← VLA Atlas

RDT2 4U zero-shot · Cloth 77% · Table Tennis 88%

Tsinghua · 7B VLM + UMI 数据 + AR + Flow Matching + 蒸馏 · 首个把跨物体/场景/指令/机器人平台 4 维 zero-shot 拿到桌面的开源工作

RDT2arXiv 2602.03310)继承 RDT-1B 的思想,但把数据从"多机型混合"换成 embodiment-agnostic UMI(Universal Manipulation Interface) —— 手持夹持器采集,动作空间和机器人本体解耦。数据量推到 10,000+ 小时,是当前最大规模开源机器人数据集之一。

训练策略是两阶段 AR + Diffusion(预训练用 AR 保护 VLM 离散知识、微调用 flow matching 学连续动作),再第三阶段蒸馏出 UltraFast 变体实时推理。项目页 rdt-robotics.github.io/rdt2

论文特别强调实验方法论:关键任务做 1,000 次 trials(Fig 4)来降 variance,其余至少 256 次 —— 这在 VLA 圈里非常少见。

"4U" Zero-shot 设定(论文核心声明)

  1. Unseen embodiment:训练只见 UMI 手持人类数据,不见任何真机臂
  2. Unseen scene:三个从未出现在训练集的实验室场景
  3. Unseen object:新买一批物体测试
  4. Unseen instruction:测试指令按训练集去重

成功率不算高(简单 open-vocabulary 拾取),但"从纯人类数据零样本跨到真机器人"是过去 VLA 从没做到的组合泛化。

Fine-tuning 对比(论文 Table 2 · 挑战性真实任务)

任务 / 指标RDT2π₀.₅π₀-FAST
Cloth Folding · Success Rate77%36%29%
  Subtask 1 · Left Sleeve97%92%80%
  Subtask 2 · Right Sleeve95%70%61%
  Subtask 3 · Final Fold81%45%38%
  Unseen Object51%15%10%
Table Bussing · Progress Score0.580.390.30
  Unseen Scene0.330.170.11
Unzipping Zipper · SR45%13%8%
Button Pressing · Δ Reaction (ms)+97+323+981
Table Tennis Hit Rate @1x88%78%N/A
Table Tennis Hit Rate @2x68%56%N/A

RDT2-UltraFast(Stage 3 蒸馏版)在按钮按压反应时间只比人类操作员慢 97ms(π₀-FAST 慢 981ms),是动态任务能落地的关键。

三阶段训练管线

  1. Stage 1 · AR pre-training:用自回归目标预训 backbone。目的是保护 discrete VLM knowledge,同时给后面 diffusion 提供好初始化。论文的 Fig 6 ablation 明确:直接从头 diffusion 训会掉最终 loss,AR pre-train + Diffusion 更快收敛也更低 loss
  2. Stage 2 · Diffusion / Flow Matching:训 action expert,学连续动作分布。产出 RDT2-FM 变体
  3. Stage 3 · One-step Distillation:把多步 diffusion 蒸馏成一步,产出 RDT2-UltraFast。图 7 明确它是所有 VLA baseline 里推理最快的,尽管参数量是 π₀.₅ 的 2 倍以上

动作离散化:RVQ vs FAST vs Uniform Binning

论文 Fig 8 对三种 action tokenizer 做了 position / rotation MSE 对比:

RVQ 是 RDT2 相比 FAST 的关键改进 —— tokens 少 → 推理快 → 更接近人类反应时间。

Scaling Law(论文 §6.2)

拟合 Hoffmann 2022 / Kaplan 2020 形式 L(N,D) = E + A/N^α + B/D^β

E   = 2.1108
A   = 4375.4     α = 0.4402   (模型规模)
B   = 179.1      β = 0.2251   (数据规模)

模型和数据同时扩展都持续降 loss,没有饱和迹象。这条 fit 也在暗示:找一种能高度可扩展采集机器人数据的方式(例如 UMI 手持)比堆参数更重要—— 因为 β < α,数据的边际收益递减稍慢。

关键工程数字

参数量7B VLM backbone
训练数据10,000+ 小时 UMI 演示
预训练 iterations 到收敛1 epoch full dataset
Pick task 统计学收敛所需 trials~1,000 次
标准实验 trials 数256 次 / 任务
发表2026-02-03

相关

Flow Matching 路线
RDT2 Stage 2 的动作头
Discrete Action Token
RDT2 的 RVQ 是这条路线的新变体
π₀.₅ / π₀-FAST(对照对手)
RDT2 在 Cloth Folding / Table Bussing / Unzipping / Table Tennis 全面胜出
DOMINO(动态操纵基准)
RDT2 的 Table Tennis 是这个方向的实证

参考链接

arXiv 2602.03310
RDT2: Scaling Limit of UMI Data · 2026-02-03
项目页 · rdt-robotics.github.io/rdt2
论文 / demo / 数据集