← VLA Atlas

MolmoAct2 LIBERO 98.1% · 13 具身推理 benchmark 打 GPT-5 · 720h 开源双臂

Allen AI 30 authors · 沿 5 轴改进 MolmoAct · MolmoER backbone + OpenFAST tokenizer + 720h Bimanual YAM + Flow expert + MolmoThink adaptive-depth

MolmoAct2arXiv 2605.02881)是 Allen AI 2026-05 发的 MolmoAct 后继。作者写道:"This is the most extensive empirical study of any open VLA to date" —— 7 个 simulation + real-world benchmark 全线打过所有开源和闭源 baseline,包括 π₀.₅、GR00T N1.7、NORA-1.5、OpenVLA-OFT、Cosmos Policy 等。项目页 allenai.org/blog/molmoact2

沿 五轴改进 MolmoAct:

  1. MolmoER:为 spatial + embodied reasoning 专门优化的 VLM backbone · 3.3M 样本 · specialize-then-rehearse 训练
  2. 三个新开源数据集:MolmoAct2-BimanualYAM 720 小时目前最大开源双臂数据集)+ 质检过的 Franka DROID 子集 + SO-100/101 子集
  3. OpenFAST:开源 action tokenizer · 5 种机器人本体 · 百万级轨迹训
  4. 架构重设计:flow-matching 连续动作专家 + discrete-token VLM · per-layer KV-cache conditioning(不是 hidden state)
  5. MolmoThink:adaptive-depth reasoning · 只在帧间变化的场景区域重新预测 depth tokens · 大幅降推理延迟

MolmoER:13 具身推理 benchmark 打过 GPT-5 / Gemini Robotics ER-1.5

论文 §6.1:在 13 个 benchmark 上评:Point-Bench / RefSpatial / RoboSpatial-Point / Where2Place / BLINK / CV-Bench / ERQA / EmbSpatial / MindCube / SAT / OpenEQA / VSI-Bench 等。对手包括:

MolmoER 在 9/13 benchmark 上排第一,总平均 63.8%(超 runner-up Gemini-ER 1.5 Thinking 2.5 point)。相对基座 Molmo2 提升 17% —— specialize-then-rehearse recipe 很有效。

LIBERO:97.2% (base) / 98.1% (Think)

ModelSpatialObjectGoalLongAvg
OpenVLA84.788.479.253.776.5
MolmoAct-7B-D87.095.487.677.286.6
ThinkAct88.391.487.170.984.4
π₀96.898.895.885.294.2
NORA-1.597.396.494.589.694.5
π₀.₅98.898.298.092.496.9
GR00T N1.797.797.598.594.497.0
MolmoAct297.8100.097.893.297.2
MolmoAct2-Think98.899.898.595.498.1

MolmoAct2 相对 MolmoAct-7B-D 提升 +10.6(86.6 → 97.2)· 上 LIBERO-Object 100%。MolmoAct2-Think 再涨 +0.9 平均,主要收益在 LIBERO-Long(+2.2)—— adaptive-depth reasoning 在最难任务上边际最大。

MolmoBot 真机 zero-shot(论文 Table 6)

ModelApple on platePipette in trayRed cube in tape rollKnife in boxObjects in bowlAvg
π₀.₅-DROID66.733.353.326.746.245.2
MolmoBot86.753.333.340.028.648.4
MolmoAct2-DROID100.086.793.393.362.087.1

这是真机 OOD 场景(相机位置随机初始化 + 新物体 + 新环境),MolmoAct2 相对 runner-up MolmoBot +38.7 point

SO-100/101 真机 zero-shot(论文 Table 7)

ModelFork on plateStack blocksTissues in basketPen on notebookBlock in boxAvg
SmolVLA3.35.00.03.30.02.3
π₀-SO100/10130.06.720.080.090.045.3
MolmoAct2-SO100/10170.020.073.386.733.356.7

低成本 SO-100/101 消费级平台上,MolmoAct2 打过 SmolVLA + 15 point · 打过 π₀-SO100/101 + 11.4 point。SmolVLA 上分只有 2.3 是因为它没在这些 OOD 相机位设置下训 —— 但客观也说明 MolmoAct2 在这条 setup 上更 robust。

MolmoSpaces 仿真(论文 Table 4)

ModelPickPick & PlaceOpenCloseAvg
StereoVLA7.07.0
π₀-DROID16.212.511.053.123.2
LAP-VLA24.96.611.445.922.2
π₀.₅-DROID36.413.622.765.134.5
MolmoAct2-DROID43.726.79.570.837.7

MolmoAct2 相对 π₀.₅-DROID 大幅提升 Pick +7.3 / Pick & Place +13.1(复杂多步)· Open 类关节物体交互作者承认仍需改进。

真机 Bimanual YAM:8 任务全面对比(论文 §6.3)

8 个任务覆盖实验室 / 厨房 / 书房 / pantry / 湿实验室 / mobile manipulation:

对手:Cosmos Policy / X-VLA / OpenVLA-OFT / π₀.₅-DROID

MolmoAct2 在 7/8 任务上第一 · 平均 50.1% · 相对 runner-up OpenVLA-OFT +15%

OOD 鲁棒性(论文 Table 9)

ModelSpatialLightingLanguageDistractorOverall
π₀.₅15.0033.7026.1533.2027.01
Cosmos Policy8.7517.505.0013.7511.25
X-VLA3.758.309.953.756.44
OpenVLA-OFT13.7546.2551.2548.3039.89
MolmoAct2-Think26.2562.0560.3554.1050.69

四类扰动全面胜出,Overall +10.8 vs OpenVLA-OFT。作者也承认 Spatial 变化(26.25%)是 MolmoAct2 最弱一环,指向 spatial 泛化仍是未解问题。

关键 Ablation(论文 §6.7)

1) MolmoER backbone 单独贡献

直接用 discrete action 训 LIBERO-Long:Molmo2 → 77.6% vs MolmoER → 83.6%(+6.0)—— backbone 特化本身就带很大提升,不用连续 action expert 也能涨。

2) VLM → Action Expert 条件化方式

ConditioningLIBERO Avg
Hidden-state conditioning94.0
Per-head per-layer KV94.8
Per-layer KV conditioning(default)95.9

让 action expert 消费同一份 attention state比只看一个 residual stream 好。

3) Flow 样本数 K

K=1 (94.15) < K=2 (95.05) < K=4 (95.15) < K=8 (95.90)。Long horizon 从 K=2 起收益特别大。

4) Fine-tuning 策略

Full fine-tuning + 离散共训 = 97.20% 最高;只训 action expert 掉到 93.05%;LoRA 96.25% 在 Long 上掉 2.8。

5) MolmoAct2-Think depth 训练

关键三件事:depth-token noise (10%) + 学习 per-layer depth gate + 混合训练(有/无 depth 样本)。全启用 98.10%,全关 97.50%。

推理速度(论文 §6.8)

H100 GPU · action horizon 10 · LIBERO 测:

PathMolmoAct2 (Hz)MolmoAct2-Think (Hz)
原始实现23.028.04
+ Cache optimization27.399.72
+ CUDA Graph55.7912.71
Discrete decoding path(作为对照)14.176.82

CUDA Graph 对 MolmoAct2 2.42× 加速(因为 flow matching 是 fixed-shape 计算,很适合 graph replay);MolmoAct2-Think 只有 1.58× 因为 adaptive depth 是 autoregressive 有可变长度。连续 flow path 比离散自回归快 3.94×

轨迹质量(论文 §6.6)

不只看成功率,还看轨迹的效率、稳定性、安全性—— RoboEval 上的例子:

MolmoAct2 生成的轨迹在 Cartesian 和 joint space 都更接近最优 —— 意味着产品化部署时能耗、磨损、安全都更好。

开源清单

MolmoAct2 的开源完整度目前 VLA 圈子里最高—— weights 到 tokenizer 到数据到代码全给。

差异化定位

MolmoAct2 是 2026 上半年最全面的开源 VLA

如果你现在要复现 / 部署一个 SOTA VLA,MolmoAct2 是首选 —— 因为它公开完整

相关

MolmoAct(前作)
Action Reasoning Model 原始提出 · LIBERO 86.6
π₀.₅(对照 · 被超越)
MolmoBot +38.7 / MolmoSpaces +3.2 / OOD +23.7
NORA-1.5
LIBERO 94.5 → MolmoAct2 97.2
SmolVLA(SO-100 对照)
MolmoAct2-SO100/101 56.7 vs SmolVLA 2.3(相机 OOD 场景)
Discrete Action Token 路线
OpenFAST 是当代最新开源 tokenizer

开源资源(完整开源)

arXiv 2605.02881
MolmoAct2: Action Reasoning Models for Real-world Deployment · 2026-05-04
GitHub · allenai/molmoact2
训练代码 + 推理脚本 + 复现指令
HF Models Collection(5 个模型)
MolmoAct2 (5B) / MolmoAct2-Think (5B) / MolmoAct2-Pretrain (5B) / Molmo2-ER (5B) / MolmoAct2-FAST-Tokenizer
HF Datasets Collection
720h BimanualYAM · SO100/101 · DROID 三个开源数据集
Allen AI Blog · MolmoAct2
官方发布 + Stanford Cong Lab CRISPR 部署案例