← VLA Atlas

ThinkAct Simpler +15.5 vs DiT-Policy · LIBERO 84.4 · RoboVQA BLEU 59.8

NVIDIA + 台大 · Qwen2.5-VL 7B(高层 MLLM)+ DiT 432M(低层 policy)· GRPO 强化视觉潜规划

ThinkActarXiv 2507.16815)主张:end-to-end VLA 直接映射输入到动作缺少显式 reasoning 步,长时任务和复杂变化下容易崩。ThinkAct 是 dual-system —— 高层 MLLM 生成 "embodied reasoning plan",压成 visual plan latent,条件化下游 action model 执行。

关键训练技巧:Reinforced Visual Latent Planning —— 用 GRPO 加两类动作对齐视觉奖励(goal completion + trajectory consistency)强化高层的 plan 质量。结果不但操纵任务 SOTA,具身推理任务(EgoPlan-Bench2 / RoboVQA / OpenEQA)也大幅领先。

SimplerEnv 主结果(论文 Table 1)

SplitTaskDiT-PolicyMagmaOpenVLACoT-VLAThinkAct
Google VMOpen/Close Drawer44.956.049.550.0
Move Near58.965.447.172.4
Pick Coke Can64.383.715.392.0
Overall56.068.437.371.5
Google VAOpen/Close Drawer35.553.422.547.6
Move Near52.865.754.063.8
Pick Coke Can56.468.852.884.0
Overall48.262.643.165.1
Bridge VMPut Carrot on Plate29.431.04.237.5
Put Spoon on Towel34.537.58.358.3
Put Eggplant in Basket65.560.545.870.8
Overall32.435.414.643.8
LIBEROSpatial82.684.787.588.3
Object84.788.491.691.4
Goal82.179.287.687.1
Long57.653.769.070.9
Overall76.876.583.984.4

ThinkAct 相对同 backbone 的 DiT-Policy(无 reasoning)在 SimplerEnv Google-VM/VA/Bridge-VM 分别提 +15.5 / +16.9 / +11.4 —— 说明 reasoning plan 的 latent 提供了关键条件信号。

具身推理主结果(论文 Table 2)

Benchmark指标GPT-4VQwen2.5-VL*MagmaThinkAct
EgoPlan-Bench2Daily life36.747.932.150.1
Work27.746.325.749.8
Recreation33.944.334.444.8
Hobbies32.544.229.345.2
Overall32.645.729.848.2
RoboVQABLEU-132.265.338.669.1
BLEU-226.557.331.561.8
BLEU-324.752.228.156.0
BLEU-423.948.026.752.4
Overall26.855.731.259.8
OpenEQAOverall49.652.049.156.2

纯推理 benchmark 上 ThinkAct 也超所有 baseline —— 因为它在 GRPO stage 混合训练了 embodied QA 数据(EgoPlan-IT / RoboVQA / Reflect + LLaVA-Video-178K)。这说明 reasoning capability 与 action capability可以互相强化

架构与训练

高层 F_θ(Reasoning MLLM)

低层 π_φ(Action Model)

硬件:16× NVIDIA A100 80GB · 高低层可分别推理

Reward Ablation(论文 Table 3)

SetupSimplerEnvEgoPlanRoboVQA
ThinkAct (Ours) 完整60.148.259.8
去掉 r_traj59.247.958.5
去掉 r_goal59.147.658.9
都去(只留 QA reward)56.947.258.3
SFT cold-start(无 RL)56.446.457.9

两个 reward 都必要 —— r_traj 学"结构化 plan",r_goal 学"长时目标"。全去掉性能几乎回到 SFT baseline,说明 RL 是激活 reasoning 能力的关键

Few-Shot 适应(论文 Fig 5)

每任务只用 10 demos fine-tune LIBERO:

Reasoning 提供的"subgoal 分解"让 few-shot 适应更好 —— 模型能把新任务视为已知子任务的组合。

Self-Correction 能力(论文 Fig 6)

把 MLLM 的输入从单帧 o_t 扩展到短视频 o_{t-N:t},得到时间上下文。作者演示了一个失败恢复例子:

  1. 任务:"把 box 放进 basket"
  2. gripper 中途掉了 box
  3. Reasoning MLLM 观察到失败 —— 生成 "Let's reconsider how to complete the task"
  4. 重规划 → 回到掉落位置 → 重新拾取 → 完成

这是纯 end-to-end VLA 做不到的—— 因为它们没有"意识到失败"的机制。ThinkAct 通过 reasoning MLLM 保留了这个能力。

差异化定位

ThinkAct 是dual-system reasoning + RL 组合在 VLA 里最完整的开源代表:

四种 dual-system 姿势各自有不同侧重,ThinkAct 是最强调 reasoning <-> action 双向学习 的一支。

相关

GR00T N1(System 1/2)
同 dual-system 但走监督路线
MemER(分层 memory)
分层策略走 keyframe retrieval 路线
InternVLA-M1(Spatial Guided)
分层但走 spatial grounding 路线
NORA-1.5(DPO alignment)
另一条 RL for VLA 路线

参考链接

arXiv 2507.16815
ThinkAct: VLA Reasoning via Reinforced Visual Latent Planning · 2025-07-22