InternVLA-M1 SimplerEnv-Google 80.7% · LIBERO 95.9%
Shanghai AI Lab · Qwen2.5-VL-3B + DiT action head · 2.3M 空间推理预训练 · 空间 grounding 与 action 双系统 co-training
InternVLA-M1(arXiv 2510.13778)的核心命题:指令和动作之间缺一个 "where to act" 的中间量。传统 VLA 直接从 language 映到 action,遇到空间关系变了 / 物体位置换了 就崩。M1 主张先 grounding 到视觉空间位置(box / point / trace),再映到本体感知的动作。
两阶段管线:(1) 在 2.3M 空间推理数据上 pretrain 空间 grounding —— 学 "where",与本体无关;(2) 空间引导的 action post-training,通过 plug-and-play spatial prompting 学 "how"—— 本体感知。
关键数字(论文 Table 1-4 口径)
| Benchmark | InternVLA-M1 | Vanilla VLA | Δ | 第二强对手 |
|---|---|---|---|---|
| SimplerEnv Google-Robot VM | 80.7 | 66.1 | +14.6 | 75.1 (SpatialVLA) |
| SimplerEnv Google-Robot VA | 76.0 | 63.5 | +12.5 | 70.7 (SpatialVLA) |
| SimplerEnv WidowX VM | 71.7 | 54.7 | +17.0 | 61.9 (GR00T N1.5) |
| LIBERO 平均 | 95.9 | 91.6 | +4.3 | 94.3 (π₀.₅-KI) |
| LIBERO-Long | 92.6 | 88.0 | +4.6 | 90.6 (GR00T N1) |
| LIBERO-Object | 99.0 | 98.0 | +1.0 | 98.8 (π₀) |
| 200 tasks Isaac-Sim(自建) | baseline+6.2 | baseline | +6.2 | 超过 GR00T N1.5 |
| 真机 clustered pick-and-place | baseline+7.3 | baseline | +7.3 | — |
| 合成 co-training · unseen objects | baseline+20.6 | baseline | +20.6 | — |
SimplerEnv Google-Robot VM 分任务(论文 Table 1)
| 任务 | InternVLA-M1 | CogACT | π₀ | OpenVLA |
|---|---|---|---|---|
| Pick Coke Can | 95.3 | 91.3 | 72.7 | 18.0 |
| Move Near | 90.0 | 85.0 | 65.3 | 56.3 |
| Open/Close Drawer | 75.5 | 71.8 | 38.3 | 63.0 |
| Open Top Drawer & Place Apple | 62.0 | 50.9 | — | 0.0 |
| Avg (VM) | 80.7 | 74.8 | 58.8 | 34.3 |
SimplerEnv WidowX(论文 Table 2)
| 任务 | InternVLA-M1 | GR00T N1.5 | CogACT | π₀-FAST |
|---|---|---|---|---|
| Put Spoon on Towel | 87.5 | 75.3 | 71.7 | 29.1 |
| Put Carrot on Plate | 67.9 | 54.3 | 50.8 | 21.9 |
| Stack Green on Yellow Block | 31.3 | 57.0 | 15.0 | 10.8 |
| Put Eggplant in Yellow Basket | 100 | 61.3 | 67.5 | 66.6 |
| Avg | 71.7 | 61.9 | 51.3 | 48.3 |
两阶段管线
Stage 1 · Spatial Grounding Pretrain
2.3M spatial reasoning data · 训 VLM 学 box / point / trace 三种空间输出,与本体无关。
Stage 2 · Spatially-Guided Action Post-training
用 plug-and-play spatial prompting 把 grounding 结果作为条件馈给 DiT action head,产 embodiment-aware 动作。
训练:16× A100 · 50k steps (~2.5 epochs) · robot data batch 256 · multimodal data batch 64 · action chunk 16 · 观察空间 primary camera image + task instruction + spatial prompt。
为什么 co-training 有效(论文 Figure 5)
用 Projection-space Similarity (PSS)(Raghu 2017 SVD 度量)分析梯度子空间对齐:
- Vanilla co-train(简单混合 action + spatial 数据):PSS = 0.25 —— 两个 objective 的梯度方向严重不对齐
- InternVLA-M1(spatially-guided 训练):PSS = 0.42 —— 显著提升的对齐 → 更快收敛、更好操纵性能、更强空间感知
Ablation Table 3 里对比更明显:Vanilla co-train 的空间感知(RefCOCO-g box IoU)到 66.7,而 InternVLA-M1 到 71.2;同时操纵性能 Google-VM 从 70.2 提到 80.7 —— 两个能力都增强,不 tradeoff。
长时任务:System-2 planner 打过 GPT-5(论文 Table 5)
M1 的 dual-system 高层 planner 用同一个模型的 3B backbone;对照通用大模型:
| 模型 | Sort into Drawers | Make Sandwiches | Desktop Sort | Math Calc | Goods Purchase |
|---|---|---|---|---|---|
| Gemini-2.5 Pro | 57 | 62 | 83 | 53 | 61 |
| GPT-5 | 75 | 67 | 62 | 79 | 82 |
| GPT-4o | 37 | 57 | 35 | 39 | 41 |
| Qwen2.5-VL-72B | 31 | 71 | 34 | 33 | 29 |
| Ours-3B | 90 | 91 | 91 | 93 | 92 |
3B 领域微调的 planner 在具身长时任务分解上大幅超过 GPT-5 / Gemini —— 说明具身规划是"领域强调优 > 通用能力"的问题。