← VLA Atlas

EgoScale 20,854 h · Log-Linear Scaling Law · R² = 0.9983

从大规模 egocentric 人类视频学 dexterous 操纵先验 · 用 scaling law 让"要不要再采数据"可预测

EgoScalearXiv 2602.16710)拿 20,854 小时带动作标注的 egocentric 人类视频训 VLA,是当前公开的最大规模(比前人工作大 20×)。除了规模本身,它的方法论贡献更重要 —— 证明数据规模 vs 验证损失呈 log-linear 关系(R² = 0.9983),且这条线严格预测下游真机成功率。

换言之:"要不要再花钱采数据"这个问题第一次有了公式化答案。工程上把不确定性大幅降低。

五个 Dexterous 评估任务(论文 §3.1)

  1. Shirt Rolling:双手协作卷 T 恤 → 放入 basket(可变形物体,20 演示)
  2. Card Sorting:手指搓开一叠牌 → 按颜色插入正确 holder(精细指尖控制,100 演示)
  3. Tongs for Fruit Transfer:从工具箱抓夹子 → 夹起水果 → 放到指定位置(工具使用)
  4. Unscrewing a Bottle Cap:抓瓶盖 → 连续旋转(4 种不同大小,25 演示/瓶)
  5. Syringe Liquid Transfer:拿注射器 → 从 A 管抽液 → 注入 B 管 → 扔到垃圾桶(长时多步 + 流体控制)

Syringe 是最难的 —— 长时、多步推理、精确空间对齐、灵巧地推活塞。这五个任务代表"极限灵巧操纵"的天花板。

核心结果:人视频预训练贡献巨大(论文 Fig 4)

四个训练配方对比(average task completion + absolute success rate):

反直觉的观察:纯"噪声"的大规模人视频 pretrain(虽然不 task-aligned)比精心对齐的 mid-training-only 更强。这说明规模和多样性提供的 inductive bias 比 embodiment alignment 更重要。

Scaling Law(论文 Fig 5)

用不同数据规模(1k / 2k / 4k / 10k / 20k 小时)预训 —— 观察三件事:

  1. 下游真机 avg task completion0.30 (1k hours) → 0.71 (20k hours) · 单调上升 · 探测范围内无饱和
  2. Validation loss vs data scale:log-linear · R² = 0.9983 · 拟合式:
L = 0.024 − 0.003 · ln(D)

D = human video data (hours)
R² = 0.9983

3. 更关键:validation loss 强预测真机 success rate。换句话说,你可以用 offline 上的 val loss 预测线下要不要再采数据、能带来多大收益。这在 embodied AI 里是稀缺的量化能力。

One-Shot 适应(论文 Fig 6)

把训好的 Pretrain + Midtrain 模型放到全新任务上,只给1 条机器人演示 + 100 条对齐人演示,看能否学会:

MethodFold ShirtUnscrew Water Bottle
只 Pretrain00
只 Midtrain00
Pretrain + Midtrain0.880.55

One-shot 泛化只在两步都完成时出现 —— 大规模人视频学"广运动结构",mid-training 把结构锚定到具体机器人。缺一不可。

跨形态泛化(论文 Fig 7)

把训好的模型迁到完全不同的机器人本体 Unitree G1(更短的手臂、更小可达空间、7-DoF tri-finger 而非 22-DoF 五指手):

这证明:EgoScale 学到的是可复用的 motor prior—— hand opening / closure / coordinated finger articulation 这些原语在不同形态间可迁移。

动作表示的影响(论文 Fig 8)

三种人类手部动作表示的对比:

结论:直接在 joint space 监督是当前最稳的路子。这个 finding 对做 dexterous hand VLA 有直接指导意义。

Ψ₀ vs EgoScale:两条相反的数据哲学

EgoScale 和 Ψ₀ Psi-Zero 是同期发表的两条相反配方:

EgoScaleΨ₀
数据量20,854 小时人视频800 小时人视频 + 30 小时机器人
主张Scaling 有效,数据越多越好数据质量 > 数量
方法论Log-linear scaling law阶段解耦 · 高质量精挑
本体22-DoF Sharpa 手 → 迁 G1 tri-fingerUnitree G1 whole-body
结论强度+55% over scratch,20k hours 未饱和800h+30h 打过 10× baseline 40%

两者不冲突 —— 前者证明"高质量数据未饱和时 scaling 有效",后者证明"noisy crawl 到瓶颈时质量胜出"。适用场景不同,一起看更完整。

相关

Ψ₀ Psi-Zero(数据哲学对照)
走"质量 > 数量"路线,与 EgoScale 相反
GR00T N1
同赛道 humanoid foundation
Flow Matching
EgoScale action head 用的技术

参考链接

arXiv 2602.16710
EgoScale: Scaling Dexterous Manipulation · 2026-02-18