MolmoAct2 LIBERO 98.1% · 13 具身推理 benchmark 打 GPT-5 · 720h 开源双臂
Allen AI 30 authors · 沿 5 轴改进 MolmoAct · MolmoER backbone + OpenFAST tokenizer + 720h Bimanual YAM + Flow expert + MolmoThink adaptive-depth
MolmoAct2(arXiv 2605.02881)是 Allen AI 2026-05 发的 MolmoAct 后继。作者写道:"This is the most extensive empirical study of any open VLA to date" —— 7 个 simulation + real-world benchmark 全线打过所有开源和闭源 baseline,包括 π₀.₅、GR00T N1.7、NORA-1.5、OpenVLA-OFT、Cosmos Policy 等。项目页 allenai.org/blog/molmoact2。
沿 五轴改进 MolmoAct:
- MolmoER:为 spatial + embodied reasoning 专门优化的 VLM backbone · 3.3M 样本 · specialize-then-rehearse 训练
- 三个新开源数据集:MolmoAct2-BimanualYAM 720 小时(目前最大开源双臂数据集)+ 质检过的 Franka DROID 子集 + SO-100/101 子集
- OpenFAST:开源 action tokenizer · 5 种机器人本体 · 百万级轨迹训
- 架构重设计:flow-matching 连续动作专家 + discrete-token VLM · per-layer KV-cache conditioning(不是 hidden state)
- MolmoThink:adaptive-depth reasoning · 只在帧间变化的场景区域重新预测 depth tokens · 大幅降推理延迟
MolmoER:13 具身推理 benchmark 打过 GPT-5 / Gemini Robotics ER-1.5
论文 §6.1:在 13 个 benchmark 上评:Point-Bench / RefSpatial / RoboSpatial-Point / Where2Place / BLINK / CV-Bench / ERQA / EmbSpatial / MindCube / SAT / OpenEQA / VSI-Bench 等。对手包括:
- Gemini 家族(Gemini-ER 1.5 Thinking 等)
- GPT-5 家族
- LLaVA-OneVision / Qwen3-VL 家族 / InternVLA
- MolmoAct2 的基座 Molmo2
MolmoER 在 9/13 benchmark 上排第一,总平均 63.8%(超 runner-up Gemini-ER 1.5 Thinking 2.5 point)。相对基座 Molmo2 提升 17% —— specialize-then-rehearse recipe 很有效。
LIBERO:97.2% (base) / 98.1% (Think)
| Model | Spatial | Object | Goal | Long | Avg |
|---|---|---|---|---|---|
| OpenVLA | 84.7 | 88.4 | 79.2 | 53.7 | 76.5 |
| MolmoAct-7B-D | 87.0 | 95.4 | 87.6 | 77.2 | 86.6 |
| ThinkAct | 88.3 | 91.4 | 87.1 | 70.9 | 84.4 |
| π₀ | 96.8 | 98.8 | 95.8 | 85.2 | 94.2 |
| NORA-1.5 | 97.3 | 96.4 | 94.5 | 89.6 | 94.5 |
| π₀.₅ | 98.8 | 98.2 | 98.0 | 92.4 | 96.9 |
| GR00T N1.7 | 97.7 | 97.5 | 98.5 | 94.4 | 97.0 |
| MolmoAct2 | 97.8 | 100.0 | 97.8 | 93.2 | 97.2 |
| MolmoAct2-Think | 98.8 | 99.8 | 98.5 | 95.4 | 98.1 |
MolmoAct2 相对 MolmoAct-7B-D 提升 +10.6(86.6 → 97.2)· 上 LIBERO-Object 100%。MolmoAct2-Think 再涨 +0.9 平均,主要收益在 LIBERO-Long(+2.2)—— adaptive-depth reasoning 在最难任务上边际最大。
MolmoBot 真机 zero-shot(论文 Table 6)
| Model | Apple on plate | Pipette in tray | Red cube in tape roll | Knife in box | Objects in bowl | Avg |
|---|---|---|---|---|---|---|
| π₀.₅-DROID | 66.7 | 33.3 | 53.3 | 26.7 | 46.2 | 45.2 |
| MolmoBot | 86.7 | 53.3 | 33.3 | 40.0 | 28.6 | 48.4 |
| MolmoAct2-DROID | 100.0 | 86.7 | 93.3 | 93.3 | 62.0 | 87.1 |
这是真机 OOD 场景(相机位置随机初始化 + 新物体 + 新环境),MolmoAct2 相对 runner-up MolmoBot +38.7 point。
SO-100/101 真机 zero-shot(论文 Table 7)
| Model | Fork on plate | Stack blocks | Tissues in basket | Pen on notebook | Block in box | Avg |
|---|---|---|---|---|---|---|
| SmolVLA | 3.3 | 5.0 | 0.0 | 3.3 | 0.0 | 2.3 |
| π₀-SO100/101 | 30.0 | 6.7 | 20.0 | 80.0 | 90.0 | 45.3 |
| MolmoAct2-SO100/101 | 70.0 | 20.0 | 73.3 | 86.7 | 33.3 | 56.7 |
在低成本 SO-100/101 消费级平台上,MolmoAct2 打过 SmolVLA + 15 point · 打过 π₀-SO100/101 + 11.4 point。SmolVLA 上分只有 2.3 是因为它没在这些 OOD 相机位设置下训 —— 但客观也说明 MolmoAct2 在这条 setup 上更 robust。
MolmoSpaces 仿真(论文 Table 4)
| Model | Pick | Pick & Place | Open | Close | Avg |
|---|---|---|---|---|---|
| StereoVLA | 7.0 | — | — | — | 7.0 |
| π₀-DROID | 16.2 | 12.5 | 11.0 | 53.1 | 23.2 |
| LAP-VLA | 24.9 | 6.6 | 11.4 | 45.9 | 22.2 |
| π₀.₅-DROID | 36.4 | 13.6 | 22.7 | 65.1 | 34.5 |
| MolmoAct2-DROID | 43.7 | 26.7 | 9.5 | 70.8 | 37.7 |
MolmoAct2 相对 π₀.₅-DROID 大幅提升 Pick +7.3 / Pick & Place +13.1(复杂多步)· Open 类关节物体交互作者承认仍需改进。
真机 Bimanual YAM:8 任务全面对比(论文 §6.3)
8 个任务覆盖实验室 / 厨房 / 书房 / pantry / 湿实验室 / mobile manipulation:
stack_cups·store_test_tubes·store_candy·hang_toolsstore_toys·shelf_cups·prepare_pipette·make_popcorn- 每任务 50 trials · 3 种 spatial 变体
对手:Cosmos Policy / X-VLA / OpenVLA-OFT / π₀.₅-DROID
MolmoAct2 在 7/8 任务上第一 · 平均 50.1% · 相对 runner-up OpenVLA-OFT +15%
OOD 鲁棒性(论文 Table 9)
| Model | Spatial | Lighting | Language | Distractor | Overall |
|---|---|---|---|---|---|
| π₀.₅ | 15.00 | 33.70 | 26.15 | 33.20 | 27.01 |
| Cosmos Policy | 8.75 | 17.50 | 5.00 | 13.75 | 11.25 |
| X-VLA | 3.75 | 8.30 | 9.95 | 3.75 | 6.44 |
| OpenVLA-OFT | 13.75 | 46.25 | 51.25 | 48.30 | 39.89 |
| MolmoAct2-Think | 26.25 | 62.05 | 60.35 | 54.10 | 50.69 |
四类扰动全面胜出,Overall +10.8 vs OpenVLA-OFT。作者也承认 Spatial 变化(26.25%)是 MolmoAct2 最弱一环,指向 spatial 泛化仍是未解问题。
关键 Ablation(论文 §6.7)
1) MolmoER backbone 单独贡献
直接用 discrete action 训 LIBERO-Long:Molmo2 → 77.6% vs MolmoER → 83.6%(+6.0)—— backbone 特化本身就带很大提升,不用连续 action expert 也能涨。
2) VLM → Action Expert 条件化方式
| Conditioning | LIBERO Avg |
|---|---|
| Hidden-state conditioning | 94.0 |
| Per-head per-layer KV | 94.8 |
| Per-layer KV conditioning(default) | 95.9 |
让 action expert 消费同一份 attention state比只看一个 residual stream 好。
3) Flow 样本数 K
K=1 (94.15) < K=2 (95.05) < K=4 (95.15) < K=8 (95.90)。Long horizon 从 K=2 起收益特别大。
4) Fine-tuning 策略
Full fine-tuning + 离散共训 = 97.20% 最高;只训 action expert 掉到 93.05%;LoRA 96.25% 在 Long 上掉 2.8。
5) MolmoAct2-Think depth 训练
关键三件事:depth-token noise (10%) + 学习 per-layer depth gate + 混合训练(有/无 depth 样本)。全启用 98.10%,全关 97.50%。
推理速度(论文 §6.8)
H100 GPU · action horizon 10 · LIBERO 测:
| Path | MolmoAct2 (Hz) | MolmoAct2-Think (Hz) |
|---|---|---|
| 原始实现 | 23.02 | 8.04 |
| + Cache optimization | 27.39 | 9.72 |
| + CUDA Graph | 55.79 | 12.71 |
| Discrete decoding path(作为对照) | 14.17 | 6.82 |
CUDA Graph 对 MolmoAct2 2.42× 加速(因为 flow matching 是 fixed-shape 计算,很适合 graph replay);MolmoAct2-Think 只有 1.58× 因为 adaptive depth 是 autoregressive 有可变长度。连续 flow path 比离散自回归快 3.94×。
轨迹质量(论文 §6.6)
不只看成功率,还看轨迹的效率、稳定性、安全性—— RoboEval 上的例子:
- Stack Two Blocks completion time:MolmoAct2 4.70s vs π₀.₅ 5.87s vs Diffusion 7.27s
- Joint path length:MolmoAct2 1.04 vs 2.16(约 2× 更短)
- Rotate Valve:MolmoAct2 8.51s vs π₀.₅ 9.69s
MolmoAct2 生成的轨迹在 Cartesian 和 joint space 都更接近最优 —— 意味着产品化部署时能耗、磨损、安全都更好。
开源清单
- MolmoER weights:spatial + embodied reasoning specialized backbone
- MolmoAct2 & MolmoAct2-Think weights:完整 checkpoint
- OpenFAST tokenizer:5 embodiments 训的开源 action tokenizer
- MolmoAct2-BimanualYAM:720 小时双臂 teleop 数据(最大开源双臂数据集)
- 质检过的 Franka DROID 子集 · SO-100/101 子集
- Training code + evaluation code + 完整训练数据
MolmoAct2 的开源完整度目前 VLA 圈子里最高—— weights 到 tokenizer 到数据到代码全给。
差异化定位
MolmoAct2 是 2026 上半年最全面的开源 VLA:
- vs π₀.₅(当代闭源 SOTA):LIBERO 相当(97.2 vs 96.9)· MolmoBot +38.7 · MolmoSpaces +3.2 · OOD 大幅胜出
- vs GR00T N1.7:LIBERO 相当(97.2 vs 97.0),完全开源 vs 闭源
- vs NORA-1.5:LIBERO +2.7 · 提供了完整数据集
- vs MolmoAct(自己的前作):LIBERO +10.6,MolmoBot 大幅提升,多加了 MolmoThink adaptive-depth 变体
- vs OpenVLA-OFT:Bimanual YAM +15 · OOD +10.8
如果你现在要复现 / 部署一个 SOTA VLA,MolmoAct2 是首选 —— 因为它公开且完整。