ThinkAct Simpler +15.5 vs DiT-Policy · LIBERO 84.4 · RoboVQA BLEU 59.8
NVIDIA + 台大 · Qwen2.5-VL 7B(高层 MLLM)+ DiT 432M(低层 policy)· GRPO 强化视觉潜规划
ThinkAct(arXiv 2507.16815)主张:end-to-end VLA 直接映射输入到动作缺少显式 reasoning 步,长时任务和复杂变化下容易崩。ThinkAct 是 dual-system —— 高层 MLLM 生成 "embodied reasoning plan",压成 visual plan latent,条件化下游 action model 执行。
关键训练技巧:Reinforced Visual Latent Planning —— 用 GRPO 加两类动作对齐视觉奖励(goal completion + trajectory consistency)强化高层的 plan 质量。结果不但操纵任务 SOTA,具身推理任务(EgoPlan-Bench2 / RoboVQA / OpenEQA)也大幅领先。
SimplerEnv 主结果(论文 Table 1)
| Split | Task | DiT-Policy | Magma | OpenVLA | CoT-VLA | ThinkAct |
|---|---|---|---|---|---|---|
| Google VM | Open/Close Drawer | 44.9 | 56.0 | 49.5 | — | 50.0 |
| Move Near | 58.9 | 65.4 | 47.1 | — | 72.4 | |
| Pick Coke Can | 64.3 | 83.7 | 15.3 | — | 92.0 | |
| Overall | 56.0 | 68.4 | 37.3 | — | 71.5 | |
| Google VA | Open/Close Drawer | 35.5 | 53.4 | 22.5 | — | 47.6 |
| Move Near | 52.8 | 65.7 | 54.0 | — | 63.8 | |
| Pick Coke Can | 56.4 | 68.8 | 52.8 | — | 84.0 | |
| Overall | 48.2 | 62.6 | 43.1 | — | 65.1 | |
| Bridge VM | Put Carrot on Plate | 29.4 | 31.0 | 4.2 | — | 37.5 |
| Put Spoon on Towel | 34.5 | 37.5 | 8.3 | — | 58.3 | |
| Put Eggplant in Basket | 65.5 | 60.5 | 45.8 | — | 70.8 | |
| Overall | 32.4 | 35.4 | 14.6 | — | 43.8 | |
| LIBERO | Spatial | 82.6 | — | 84.7 | 87.5 | 88.3 |
| Object | 84.7 | — | 88.4 | 91.6 | 91.4 | |
| Goal | 82.1 | — | 79.2 | 87.6 | 87.1 | |
| Long | 57.6 | — | 53.7 | 69.0 | 70.9 | |
| Overall | 76.8 | — | 76.5 | 83.9 | 84.4 |
ThinkAct 相对同 backbone 的 DiT-Policy(无 reasoning)在 SimplerEnv Google-VM/VA/Bridge-VM 分别提 +15.5 / +16.9 / +11.4 —— 说明 reasoning plan 的 latent 提供了关键条件信号。
具身推理主结果(论文 Table 2)
| Benchmark | 指标 | GPT-4V | Qwen2.5-VL* | Magma | ThinkAct |
|---|---|---|---|---|---|
| EgoPlan-Bench2 | Daily life | 36.7 | 47.9 | 32.1 | 50.1 |
| Work | 27.7 | 46.3 | 25.7 | 49.8 | |
| Recreation | 33.9 | 44.3 | 34.4 | 44.8 | |
| Hobbies | 32.5 | 44.2 | 29.3 | 45.2 | |
| Overall | 32.6 | 45.7 | 29.8 | 48.2 | |
| RoboVQA | BLEU-1 | 32.2 | 65.3 | 38.6 | 69.1 |
| BLEU-2 | 26.5 | 57.3 | 31.5 | 61.8 | |
| BLEU-3 | 24.7 | 52.2 | 28.1 | 56.0 | |
| BLEU-4 | 23.9 | 48.0 | 26.7 | 52.4 | |
| Overall | 26.8 | 55.7 | 31.2 | 59.8 | |
| OpenEQA | Overall | 49.6 | 52.0 | 49.1 | 56.2 |
在纯推理 benchmark 上 ThinkAct 也超所有 baseline —— 因为它在 GRPO stage 混合训练了 embodied QA 数据(EgoPlan-IT / RoboVQA / Reflect + LLaVA-Video-178K)。这说明 reasoning capability 与 action capability可以互相强化。
架构与训练
高层 F_θ(Reasoning MLLM)
- Backbone:Qwen2.5-VL 7B
- SFT cold-start:20K iters · batch 32 · lr 1e-5 · DeepSpeed ZeRO-3 · 用 OXE subset + RoboVQA + EgoPlan-IT + Video-R1-CoT
- GRPO RL:6K iters · batch 64 · lr 1e-6 · rollout size 5 · 加两类 reward
低层 π_φ(Action Model)
- Backbone:DiT-based policy 432M 参数(Chi 2023)
- State encoder:DINOv2 image + CLIP text → 1024-dim embedding
- 与高层的连接:Q-Former 用 32 queries 把 visual plan latent 转成 action condition
- Reasoning-enhanced action adaptation:100K OXE samples · 120K iters · batch 256 · lr 2e-5
- LIBERO fine-tune:75K iters · batch 128
硬件:16× NVIDIA A100 80GB · 高低层可分别推理
Reward Ablation(论文 Table 3)
| Setup | SimplerEnv | EgoPlan | RoboVQA |
|---|---|---|---|
| ThinkAct (Ours) 完整 | 60.1 | 48.2 | 59.8 |
| 去掉 r_traj | 59.2 | 47.9 | 58.5 |
| 去掉 r_goal | 59.1 | 47.6 | 58.9 |
| 都去(只留 QA reward) | 56.9 | 47.2 | 58.3 |
| SFT cold-start(无 RL) | 56.4 | 46.4 | 57.9 |
两个 reward 都必要 —— r_traj 学"结构化 plan",r_goal 学"长时目标"。全去掉性能几乎回到 SFT baseline,说明 RL 是激活 reasoning 能力的关键。
Few-Shot 适应(论文 Fig 5)
每任务只用 10 demos fine-tune LIBERO:
- LIBERO-Goal:ThinkAct 超 Magma +7.3%
- LIBERO-Spatial:ThinkAct 超 Magma +9.5%
Reasoning 提供的"subgoal 分解"让 few-shot 适应更好 —— 模型能把新任务视为已知子任务的组合。
Self-Correction 能力(论文 Fig 6)
把 MLLM 的输入从单帧 o_t 扩展到短视频 o_{t-N:t},得到时间上下文。作者演示了一个失败恢复例子:
- 任务:"把 box 放进 basket"
- gripper 中途掉了 box
- Reasoning MLLM 观察到失败 —— 生成 "Let's reconsider how to complete the task"
- 重规划 → 回到掉落位置 → 重新拾取 → 完成
这是纯 end-to-end VLA 做不到的—— 因为它们没有"意识到失败"的机制。ThinkAct 通过 reasoning MLLM 保留了这个能力。
差异化定位
ThinkAct 是dual-system reasoning + RL 组合在 VLA 里最完整的开源代表:
- vs GR00T N1:GR00T 也是 System 1/2,但走"planning + action"的纯监督路线;ThinkAct 用 GRPO RL 强化 reasoning
- vs MemER:MemER 分层但走 memory retrieval 路线;ThinkAct 走 reasoning generation 路线
- vs InternVLA-M1:M1 分层但走 spatial grounding,ThinkAct 走 abstract reasoning
- vs NORA-1.5:NORA 用 DPO 对齐 low-level policy;ThinkAct 用 GRPO 对齐 high-level reasoner
四种 dual-system 姿势各自有不同侧重,ThinkAct 是最强调 reasoning <-> action 双向学习 的一支。