Ψ₀ Psi-Zero Humanoid · 比 GR00T N1.6 高 40% · 800h 人 + 30h 机器人
Unitree G1 · Qwen3-VL-2B + MM-DiT 500M action expert · 阶段解耦训练 · 数据质量 > 数据总量的实证
Ψ₀(arXiv 2603.12263)针对 humanoid 领域一个反常识发现:把人类视频和 humanoid 数据一起 co-train 效果并不好,因为人和 humanoid 的运动学差异过大。Ψ₀ 分阶段训练 —— 先在 EgoDex 大规模人视频上预训 VLM 学"视觉-动作表征",再在 Humanoid Everyday 真机数据上后训一个 MM-DiT action expert 学关节控制。
结果颠覆"数据越多越好"的直觉:只用 ~800 小时人视频 + 30 小时真机数据,就打过用了 10× 数据的基线 40% 以上(8 个真实 humanoid loco-manipulation 任务的平均成功率)。这条数据配方是全篇最有启发的贡献。
硬件与任务(论文 §IV-A1, §IV-B1)
- 本体:Unitree G1 · 29 DoF whole-body · 每只手 7-DoF Dex3-1 dexterous hand(共 43 DoF 可控)
- 视觉:默认 head-mounted Intel RealSense D435i(单目 RGB)
- 动作表示:36-DoF joint-space vector = {hand joints, arm joints, torso rpy, body height, v_x, v_y, v_yaw, p_yaw} —— 涵盖上肢操纵 + 下肢移动
- 8 个任务:涵盖 pick-and-place / pushing / wiping / turning a faucet / pulling out a chip tray 等,包含 torso rotation 和 squatting 全身动作 + locomotion + turning
- Evaluation:每个任务 10 次 rollout,只有全部子任务完成才算成功;允许 evaluator 干预继续下一个子任务,分别报子任务成功率
两阶段配方
Stage 1 · VLM 自回归预训练(EgoDex)
- Backbone:Qwen3-VL-2B-Instruct
- 数据:EgoDex ~900M 帧,含 7 spine + 2 arm + 21 hand-joint × 2 全上肢逐帧 pose
- 预处理:所有 action 变换到当前 head-camera 坐标系,帧率上采样 3×,1st/99th 归一化去 outlier
- 目标:next-action prediction(不做 chunking)
- 训练:64× A100 · 10 天 · lr 1e-4 · global batch 1024
- Tokenizer:作者用 500K EgoDex actions 重新拟合 FAST tokenizer,L1 重建损失 0.005(原始开源 FAST 0.01),每序列压成 20 tokens 加速训练
Stage 2 · Action Expert 后训练(Humanoid Everyday)
- 数据:Humanoid Everyday ~3M 帧真机 teleop
- Action Expert:500M 参数 MM-DiT(双 modulation + joint attention)
- 训练:VLM backbone 冻结,只训 action expert · 32× A100 · 30 小时 · lr 1e-4 · global batch 2048
- Chunk size:动作块长度 16,含 real-time chunking
Stage 3 · Downstream Fine-tuning
只 fine-tune action expert · 40K steps · cosine lr 1e-4 · 每个任务 80 条 teleop 演示。
核心对比:Ψ₀ 打过所有开源 humanoid baseline(论文 Fig 7)
基线全部认真复现(作者原文:"invest huge effort to reproduce the best possible results"):
- π₀.₅:作者把 action head 从 30-dim 扩到 36-dim padding,学习率从 1e-5 提到 1e-4,batch 从 32 提到 128 —— 为对齐 humanoid 设置做了大量调整
- GR00T N1.6:3B pretrained checkpoint fine-tune 20K steps,3× A100
- InternVLA-M1:从 RT-1 Bridge pretrained ckpt 起步,只训 action head 30K steps。作者观察到跨 chunk 抖动
- H-RDT:2B DiT action expert
- EgoVLA:预训 EgoDex + 其他,作者改了 action decoder 输出 joint-space
- Diffusion Policy:ResNet-18 encoder + UNet DP · 100 denoising steps · 大部分任务失败
- ACT:chunk 100 · 4 encoder / 1 decoder layer
结果:Ψ₀ 平均总成功率比第二好的 baseline GR00T N1.6 高 40% 以上(作者原话:"achieves an average overall success rate that is at least 40% higher than that of the second-best baseline, GR00T-N1.6")。这里 GR00T N1.6 是最新一代的 humanoid foundation model,Ψ₀ 用远少的数据打赢它是有力的方法论证明。
Ablation Table I(论文核心表)
单个任务:"Pick toys into a box and lift it" —— 3 步子任务(右臂 pick-place / 左臂 pick-place / 双臂 lift)。10 次 rollout 报每步成功次数:
| EgoDex Pre | HE Post | RTC | MM-DiT | Naive DiT | R-Arm | L-Arm | Dual-Arm | Overall |
|---|---|---|---|---|---|---|---|---|
| ✗ | ✗ | ✗ | ✗ | ✓ | 1/10 | 1/10 | 1/10 | 0/10 |
| ✗ | ✗ | ✗ | ✓ | ✗ | 9/10 | 2/10 | 3/10 | 2/10 |
| ✓ | ✗ | ✗ | ✓ | ✗ | 8/10 | 6/10 | 6/10 | 6/10 |
| ✓ | ✓ | ✗ | ✓ | ✗ | 8/10 | 8/10 | 9/10 | 8/10 |
| ✓ | ✓ | ✓ | ✓ | ✗ | 9/10 | 9/10 | 10/10 | 9/10 |
Ablation 亮点:Naive DiT 完全失败(0/10),MM-DiT 也只有 2/10;加 EgoDex 预训到 6/10,再加 HE 后训到 8/10,再加 real-time chunking 到 9/10。这条曲线明确说:三件事都必要,最大的单步收益是 EgoDex 预训(+4)。
三个方法论 Insight
- 分阶段避免运动学冲突:人和 humanoid 运动学差异过大,共同 loss 反而互相干扰;分阶段先学视觉表征,再学关节控制,两者互不冲突
- MM-DiT 优于 Naive DiT:文中归因为 MM-DiT 的 dual-modulation + joint attention 更适合 VL-conditioned action prediction(Naive DiT 原本是给 text-to-image 用的)
- Test-time chunking 不稳定,改用 training-time chunking:作者试了 test-time 引导(Black 2025)但不稳定;改成训练时就注入 chunking condition。RTC 减少物理碰撞并提高吞吐无性能损失
与 EgoScale 的对照(数据哲学)
Ψ₀ 和 EgoScale(2602.16710)是同一时期两条相反哲学:
- EgoScale:20,854 小时人视频 · 强调 scaling law(log-linear)· 数据越多越好
- Ψ₀:EgoDex 精挑高质量 + 高质量真机数据 · 800h + 30h 打过 10× 数据基线 40%
两者不冲突,前者可能是"高质量数据未饱和时"、后者是"noise 数据 crawl 到瓶颈时"—— 但方法论对比很值得对着看,特别是要选择数据配方的团队。