MolmoAct SimplerEnv 70.5 zero-shot · LIBERO 86.6 · 双臂 +22.7 vs π₀-FAST
Allen AI + UW · Action Reasoning Models (ARMs) 首创 · 三阶段结构化 pipeline · 完全开源 weights + code + dataset
MolmoAct(arXiv 2508.07917)是 Allen AI 2025-08 的重量级工作,提出 Action Reasoning Model (ARM) 这一新范式:把 VLA 从"感知直接映射到控制"改成三阶段结构化 pipeline:
- Depth-aware perception tokens:编码观察和指令
- Mid-level spatial plans:生成可编辑的 trajectory traces(可以在 UI 上直接改)
- Low-level actions:预测精确的动作
结果:MolmoAct-7B-D 用少一个量级的数据(26.3M vs π₀ 903M)就打过 π₀ / GR00T N1 等 baseline,且是唯一同时开源 weights + code + dataset + action reasoning dataset 的 SOTA VLA。项目页 allenai.org/blog/molmoact。
关键数字(论文 §5 口径)
| Benchmark | MolmoAct-7B-D | 最强对手 | 差值 |
|---|---|---|---|
| SimplerEnv Visual Matching (zero-shot) | 70.5% | Magma 68.4% | +2.1 |
| SimplerEnv Variant Aggregation (fine-tuned) | 72.1% | RT-2-X 64.3% | +7.8 |
| LIBERO 平均 | 86.6% | ThinkAct 84.4% | +2.2 |
| LIBERO-Long | 77.2% | ThinkAct 70.9% | +6.3 |
| 真机单臂 Franka(3 任务)task progression | +10% vs π₀-FAST | π₀-FAST baseline | +10.0 |
| 真机双臂 Franka(3 任务)task progression | +22.7% vs π₀-FAST | π₀-FAST baseline | +22.7 |
| OOD 泛化平均 vs π₀-FAST | +23.3% | π₀-FAST baseline | +23.3 |
| Mid-training with MolmoAct Dataset | +5.5% avg | no mid-train baseline | +5.5 |
预训练数据规模的震撼对比
MolmoAct 反常识的一点:预训练数据量比 π₀ 少一个量级,性能却更好:
| Model | Pre-training samples |
|---|---|
| π₀ | ≥ 903M |
| MolmoAct-7B-D-Pretrain | ~26.3M(1/34) |
数据组成:OXE 子集(BC-Z + BridgeData V2 + RT-1)+ 多模态 web data + 辅助机器人数据。结构化 reasoning 补偿了数据量—— 高质量深度感知 + 可编辑 spatial plans + low-level actions 三阶段监督比暴力堆数据更有效。
真机 Franka 主结果(论文 Fig 5)
每任务 50 条 tele-op 演示,25 trials 评估 task progression score:
单臂 Franka(3 任务)
put_bowl_in_sink·wipe_table·table_bussing- MolmoAct 平均相对 π₀-FAST +10%;wipe_table / table_bussing 领先最大
双臂 Franka(3 任务)
set_table·lift_tray·fold_towel- MolmoAct 平均相对 π₀-FAST +22.7% —— 双臂协调场景优势更大
OOD 泛化:真机 4 类 shift(论文 Fig 6a)
3 类物体 + 2 种颜色盘子的多任务真机,训 300+ 演示,OOD 测试 4 方面:
- Language Variation:改写指令(rephrase)
- Spatial Variation:目标物体位置变化
- Distractors:加不相关物体干扰
- Novel Objects:替换成没见过的物体
相对 π₀-FAST +23.3% 平均 task progression。MolmoAct 在 4 个 OOD axis 上都胜出。
MolmoAct Dataset(10K 条真机演示)
MolmoAct 首次开源了一个mid-training数据集:
- 10,000+ 条高质量真机演示,跨多样场景/任务
- 用它做 mid-training 相对不用 平均 +5.5%
- 即便不 mid-train,MolmoAct-Pretrain 也已经超 π₀-FAST +14.8%、超 OpenVLA +10.9%
这是社区第一次拿到专为 VLA mid-training 设计的开源数据集——之前只有各家闭源采集。
Instruction Following:Elo Arena(论文 Fig 7-8)
作者用 head-to-head arena 让人类评审在 open-ended 指令下选更好的 rollout:
1) 模拟环境执行(vs SpatialVLA / OpenVLA)
- 29 open-ended 指令 · 100 人评审 · 1500+ 投票
- MolmoAct 相对 SpatialVLA Elo +109;对 SpatialVLA 胜率 58%,对 OpenVLA 胜率 81%
2) Visual Trace 生成(vs Gemini-2.5-Flash / GPT-4o / HAMSTER)
- 87 语言 prompt · 30 张互联网图像 · 1000+ 投票
- MolmoAct Elo 显著高于 Gemini-2.5-Flash / GPT-4o / HAMSTER,95% CI 无重叠
Steerability:sketching 修改动作(论文 Fig 9)
MolmoAct 的一个杀手锏:轨迹可以用 UI 上画的 sketching 直接修改。测试 pick_up_bowl 任务:
- 初始指令模糊:"pick up (the) bowl" —— 场上有两个碗
- 用户用 visual trace 画线指导到另一个碗 → 75% 成功率
- 用 open-ended language 追加指令 → 42% 成功率(视觉 trace 比语言好 +33%)
- 相对 π₀-FAST 用语言指令 → MolmoAct +29%(指令跟随能力强)
这是"human-in-the-loop VLA"的一个漂亮 demo —— 让机器人可编辑、可解释。
模型架构与训练
- Backbone:MolmoAct-7B-D(based on Molmo 视觉基础模型)
- 三阶段 reasoning:depth-aware perception tokens → editable spatial plans (traces) → low-level actions
- Fine-tuning:LoRA · LIBERO action chunk K=8 · 每 chunk 完整执行再重规划
- 数据:26.3M pretrain samples + 10K MolmoAct Dataset mid-train + 每真机任务 50 demos post-train
差异化定位
MolmoAct 是"结构化 reasoning + 完全开源"路线的当代旗舰:
- vs ThinkAct:ThinkAct 走 RL 强化 reasoning latent;MolmoAct 走 supervised depth-aware perception + trace generation
- vs π₀ / GR00T N1:他们用 900M+ 大规模私有数据 pretrain;MolmoAct 用 26.3M 公开数据 + 结构化 reasoning,反而更好
- vs 所有其他 VLA:唯一同时开源 weights + code + 大规模 mid-training dataset + action reasoning dataset 的方案 —— 复现门槛最低
- 可编辑性:mid-level trajectory trace 可以在 UI 上直接改 —— 交互性和 debug 能力其他 VLA 都没有
MolmoAct 在 NORA-1.5 论文的 LIBERO Table 里就是核心对照 baseline(MolmoAct-7B-D 86.6%),说明它是当代 VLA 圈子里的标准参照。