RDT2 4U zero-shot · Cloth 77% · Table Tennis 88%
Tsinghua · 7B VLM + UMI 数据 + AR + Flow Matching + 蒸馏 · 首个把跨物体/场景/指令/机器人平台 4 维 zero-shot 拿到桌面的开源工作
RDT2(arXiv 2602.03310)继承 RDT-1B 的思想,但把数据从"多机型混合"换成 embodiment-agnostic UMI(Universal Manipulation Interface) —— 手持夹持器采集,动作空间和机器人本体解耦。数据量推到 10,000+ 小时,是当前最大规模开源机器人数据集之一。
训练策略是两阶段 AR + Diffusion(预训练用 AR 保护 VLM 离散知识、微调用 flow matching 学连续动作),再第三阶段蒸馏出 UltraFast 变体实时推理。项目页 rdt-robotics.github.io/rdt2。
论文特别强调实验方法论:关键任务做 1,000 次 trials(Fig 4)来降 variance,其余至少 256 次 —— 这在 VLA 圈里非常少见。
"4U" Zero-shot 设定(论文核心声明)
- Unseen embodiment:训练只见 UMI 手持人类数据,不见任何真机臂
- Unseen scene:三个从未出现在训练集的实验室场景
- Unseen object:新买一批物体测试
- Unseen instruction:测试指令按训练集去重
成功率不算高(简单 open-vocabulary 拾取),但"从纯人类数据零样本跨到真机器人"是过去 VLA 从没做到的组合泛化。
Fine-tuning 对比(论文 Table 2 · 挑战性真实任务)
| 任务 / 指标 | RDT2 | π₀.₅ | π₀-FAST |
|---|---|---|---|
| Cloth Folding · Success Rate | 77% | 36% | 29% |
| Subtask 1 · Left Sleeve | 97% | 92% | 80% |
| Subtask 2 · Right Sleeve | 95% | 70% | 61% |
| Subtask 3 · Final Fold | 81% | 45% | 38% |
| Unseen Object | 51% | 15% | 10% |
| Table Bussing · Progress Score | 0.58 | 0.39 | 0.30 |
| Unseen Scene | 0.33 | 0.17 | 0.11 |
| Unzipping Zipper · SR | 45% | 13% | 8% |
| Button Pressing · Δ Reaction (ms) | +97 | +323 | +981 |
| Table Tennis Hit Rate @1x | 88% | 78% | N/A |
| Table Tennis Hit Rate @2x | 68% | 56% | N/A |
RDT2-UltraFast(Stage 3 蒸馏版)在按钮按压反应时间只比人类操作员慢 97ms(π₀-FAST 慢 981ms),是动态任务能落地的关键。
三阶段训练管线
- Stage 1 · AR pre-training:用自回归目标预训 backbone。目的是保护 discrete VLM knowledge,同时给后面 diffusion 提供好初始化。论文的 Fig 6 ablation 明确:直接从头 diffusion 训会掉最终 loss,AR pre-train + Diffusion 更快收敛也更低 loss
- Stage 2 · Diffusion / Flow Matching:训 action expert,学连续动作分布。产出 RDT2-FM 变体
- Stage 3 · One-step Distillation:把多步 diffusion 蒸馏成一步,产出 RDT2-UltraFast。图 7 明确它是所有 VLA baseline 里推理最快的,尽管参数量是 π₀.₅ 的 2 倍以上
动作离散化:RVQ vs FAST vs Uniform Binning
论文 Fig 8 对三种 action tokenizer 做了 position / rotation MSE 对比:
- Uniform binning(RT-2 / OpenVLA 用):MSE 最低,但需要 token 数最多(低效)
- FAST(π₀-FAST 用):DCT 压缩,中等
- RVQ(RDT2 提出):在相同 discretization error 下 token 数只需 FAST 的 1/3;latent space 更紧凑
RVQ 是 RDT2 相比 FAST 的关键改进 —— tokens 少 → 推理快 → 更接近人类反应时间。
Scaling Law(论文 §6.2)
拟合 Hoffmann 2022 / Kaplan 2020 形式 L(N,D) = E + A/N^α + B/D^β:
E = 2.1108 A = 4375.4 α = 0.4402 (模型规模) B = 179.1 β = 0.2251 (数据规模)
模型和数据同时扩展都持续降 loss,没有饱和迹象。这条 fit 也在暗示:找一种能高度可扩展采集机器人数据的方式(例如 UMI 手持)比堆参数更重要—— 因为 β < α,数据的边际收益递减稍慢。
关键工程数字
| 项 | 值 |
|---|---|
| 参数量 | 7B VLM backbone |
| 训练数据 | 10,000+ 小时 UMI 演示 |
| 预训练 iterations 到收敛 | 1 epoch full dataset |
| Pick task 统计学收敛所需 trials | ~1,000 次 |
| 标准实验 trials 数 | 256 次 / 任务 |
| 发表 | 2026-02-03 |