UniVLA LIBERO 95.5% · CALVIN SOTA · WidowX 69.8%
BAAI / CASIA / THU · 8.5B 纯自回归 Transformer · 视觉 / 语言 / 动作三模态离散 token 统一建模 + World Model post-training
UniVLA(arXiv 2506.19850)主张 VLA 不需要"多头拼接",而是把视觉、语言、动作全部离散化到统一 token 空间,用一个 8.5B 参数的纯自回归 Transformer(与 Emu3 同架构)建模。这条路线的关键创新是用"世界模型"作为 post-training 目标:在 622K 无动作标注的机器人视频上让模型学"给定语言+当前帧,预测下一帧",从而把因果动力学吃到 backbone 里,再迁移到 policy 微调。
Table 4 (§4.4) 的 ablation 是它最有说服力的数字:不做 post-training,LIBERO 只有 48.5%;只做 T2I post-training 到 69.8%;只做 video prediction 到 78.9%;加上"世界模型"(text + video 一起 condition)直接飙到 94.2%。这条曲线明确回答了"到底哪种 post-training 有用"。
关键数字(论文 Table 1-3 口径)
| Benchmark | UniVLA | 最强对手 | 差值 |
|---|---|---|---|
| LIBERO 平均(Spatial/Object/Goal/Long) | 95.5% | 85.5% (π₀-FAST) | +10.0 |
| LIBERO-Long(长时任务) | 94.0% | 69.0% (CoT-VLA) | +25.0 |
| LIBERO-Object | 98.8% | 96.8% (π₀-FAST) | +2.0 |
| CALVIN ABCD→D avg len | 4.63 | 4.49 (RoboVLMs) | +0.14 |
| CALVIN ABC→D avg len | 4.41 | 4.28 (Seer-Large) | +0.13 |
| SimplerEnv-WidowX overall | 69.8% | 42.7% (SpatialVLA) | +27.1 |
| NAVSIM 自动驾驶 PDMS | 81.7 | 84.0 (Transfuser+MC+LiDAR) | -2.3 |
NAVSIM 是 UniVLA 用同一个模型只加下游微调、只用前视单摄测的结果 —— 不做任何驾驶数据预训练就落到接近 BEV+LiDAR 方案的水位,说明 token 统一路线有跨域潜力。
架构与训练配方
- Backbone:Emu3 同款 8.5B 自回归 Transformer
- 视觉 tokenizer:VQ-based image encoder,spatial compression factor = 8
- 动作 tokenizer:先做 1st/99th percentile 归一化 → FAST tokenizer(vocab 1024,占用 language tokenizer 末尾 1024 位)
- Post-training:622K 机器人视频(无动作标注) · 30K steps · batch 64 · 只监督 vision tokens · 目标是 text + image → next image("世界模型" 目标)
- Fine-tuning:两帧 interleaved vision-action 序列 · action chunk size 10 · cosine LR 8e-5 · 只在 action tokens 上算 loss
- 观察空间:LIBERO/CALVIN 用第三视角 + 手腕视角双相机;SimplerEnv-Bridge 用单第三视角 256×256
关键 Ablation:World Model 是最有效的 post-training
| Post-training 策略 | LIBERO | SimplerEnv-WidowX | LIBERO-Long | CALVIN |
|---|---|---|---|---|
| 不做 post-train | 48.5 | 0.0 | 17.4 | 1.46 |
| 仅 action prediction | 43.9 (-4.6) | 0.0 | 10.6 (-6.8) | 0.52 (-0.94) |
| text-to-image | 69.8 (+21.3) | 6.3 | 55.8 | 3.79 |
| video prediction | 78.9 (+30.4) | 17.7 | 80.8 | 3.59 |
| world model(text + video) | 94.2 (+45.7) | 64.6 | 89.2 | 4.61 |
来源:论文 Table 4。有一个反直觉观察:直接在机器人视频上做 action prediction 反而降下游表现(-4.6),因为不同数据源 action space 不一致,学到的东西不 transfer。视觉预测(尤其带语言条件的 world model)比 action 预训练更有效 —— 这为"世界模型是通用 VLA post-training 手段"提供了实锤。
数据效率与训练效率
| 项 | UniVLA | RoboVLMs | GR-1 |
|---|---|---|---|
| CALVIN 10% 数据 avg len | 3.19 | 2.52 | 2.00 |
| CALVIN 收敛到 4.6+ | 2k iters | – | – |
| SimplerEnv-Bridge 到 60%+ | 12k iters, bs 128 | 50k iters, bs 128 | – |
来源:论文 Table 5。post-training 之后 fine-tuning 阶段的 sample efficiency 和 iteration efficiency 都 4-5× 提升。
History Context 的最佳窗口
- 无 history:4.26 avg len
- window 10 + 1 current + 1 history:4.61(最佳)
- window 10 + 1 current + 2 history:4.43(长过头反降)
- window 20 + 1 current + 2 history:4.47
结论:短 window + 1-2 帧历史 已经吃到大部分收益,符合 Markov 直觉。这条实证有助于工程侧压缩 context 长度、降低推理成本。
SimplerEnv-WidowX 分任务分数
| 任务 | UniVLA | SpatialVLA | RoboVLMs | OpenVLA |
|---|---|---|---|---|
| Put Spoon on Towel | 83.3 | 16.7 | 45.8 | 0.0 |
| Put Carrot on Plate | 66.7 | 25.0 | 20.8 | 0.0 |
| Stack Green on Yellow | 33.3 | 29.2 | 4.2 | 0.0 |
| Put Eggplant in Basket | 95.8 | 100 | 79.2 | 4.1 |
| Overall Success | 69.8 | 42.7 | 37.5 | 1.0 |
差异化定位
把 UniVLA 放在离散动作 token 路线的时间线里看:
- RT-2 / OpenVLA:开山工作,动作离散但视觉/语言另接 encoder,架构不统一
- π₀-FAST:仍是 VLM + 独立 action head,FAST 只是 tokenizer
- UniVLA:视觉 + 语言 + 动作 三模态全部 token 化到同一个 Transformer,从而能:(a) 完全复用 LLM 训练栈;(b) 用 world model post-training 学因果动力学;(c) 无缝迁移到 NAVSIM 这类跨域任务(driving as causal sequence prediction)
UniVLA 的另一个隐含贡献:证明"多头拼接"不是 VLA 必需品。同期的 Motus / RDT2 都在做架构统一,但 UniVLA 是最激进的 pure-AR 版本。