Kairos 3.0-4B RoboTwin 2.0 96.1% · LIBERO-Plus 90.8% · 4B 打过 28B
商汤 · 大晓机器人(ACE ROBOTICS) · Native World Model Stack for Physical AI · 4B 参数四大 benchmark 第一 · 完全开源
Kairos 3.0-4B(arXiv 2606.16533)是商汤旗下大晓机器人(ACE ROBOTICS)的原生世界模型栈。模型于 2025-12-18 首次开源(Kairos 3.0-4B 权重 + 数据集 + 技术文档),技术报告于 2026-06-15 arXiv 挂出并配套官方 press release 宣布"四大全球具身智能基准第一"。团队由王晓刚(商汤联合创始人)任董事长、陶大程(澳大利亚科学院院士)任首席科学家。主打用统一模型同时做世界理解 / 生成 / 预测,并把这一套推到 4B 参数级别 就跑赢 28B / 16B 的对手。项目页 kairos-homeworld.github.io,完全开源(权重 + 数据集 + 技术文档)。
三大设计要点:
- Native Pre-training Paradigm + Cross-Embodiment Data Curriculum:把开放世界视频、人类行为、机器人交互按 developmental curriculum 组织,逐步渐进
- Native Unified Architecture + Hybrid Linear Temporal Attention:sliding-window 抓局部动力学 + dilated sliding 抓中程依赖 + gated linear 维持全局持久记忆 —— 有 formal theoretical bounds 证明误差不会随时间累积
- Deployment-Aware System Co-Design:server 和消费级硬件都能低延迟 rollout · Kairos-4B 是首个端侧直接机器人控制的世界模型
四大 Embodied Benchmark 全线 SOTA
| Benchmark | Kairos-4B | 当代最强对手 | Δ |
|---|---|---|---|
| RoboTwin 2.0 (WAM) | 96.1 | MotuBrain 96.0 | +0.1 |
| LIBERO-Plus (7 扰动) | 89.0 | ACoT-VLA 88.0 | +1.0 |
| LIBERO-Plus (Kairos-joint 变体) | 90.8 | ACoT-VLA 88.0 | +2.8 |
| WorldModelBench Robot | 9.30 | Cosmos3-Nano 16B 9.26 | +0.04 |
| DreamGen Bench Avg Score | 0.618 | Wan2.2 14B 0.611 | +0.007 |
| VideoPhy | 45.55 | Cosmos-Predict2.5-14B 45.16 | +0.39 |
| PAI-Bench Robot Overall (small 组) | 82.57 | GigaWorld-0 2B 80.87 | +1.70 |
Kairos-4B 用少数几分之一的参数量打赢所有对手:WorldModelBench 9.30 (4B) 打 Cosmos3-Nano 9.26 (16B)、Lingbot 9.04 (28B);PAI-Bench 4B 打 Cosmos-Predict2.5-14B 79.40。
RoboTwin 2.0 全场对比(论文 Table 11)
超 50 个 bimanual 任务 · Clean + Randomized 双设定。Kairos 在 Clean 96.9 / Randomized 95.2 / Average 96.1 全领先。VLA + WAM 两类共 17 个 baseline:
| Model | 类型 | Clean | Rand. | Average |
|---|---|---|---|---|
| π₀ | VLA | 65.9 | 58.4 | 62.2 |
| X-VLA | VLA | 72.9 | 72.8 | 72.9 |
| π₀.₅ | VLA | 82.7 | 76.8 | 79.8 |
| ABot-M0 | VLA | 81.2 | 80.4 | 80.8 |
| LingBot-VLA | VLA | 86.5 | 85.3 | 85.9 |
| starVLA | VLA | 88.2 | 88.3 | 88.3 |
| G0.5 | VLA | 93.7 | 92.8 | 93.2 |
| Motus | WAM | 88.7 | 87.0 | 87.8 |
| Fast-WAM | WAM | 91.9 | 91.8 | 91.8 |
| Being-H0.7 | WAM | 90.2 | 89.6 | 89.8 |
| AIM | WAM | 94.0 | 92.1 | 93.1 |
| SANTS | WAM | 94.6 | 94.2 | 94.4 |
| MotuBrain | WAM | 95.8 | 96.1 | 96.0 |
| Kairos | WAM | 96.9 | 95.2 | 96.1 |
注意:MolmoAct2 和 GR00T N1.7 没有在 RoboTwin 2.0 上报告成绩,所以此表不含它们。
LIBERO-Plus(更难的 LIBERO 扰动版)
| Method | Camera | Robot | Language | Light | BG | Noise | Layout | Avg |
|---|---|---|---|---|---|---|---|---|
| π₀ | 61.0 | 40.8 | 63.5 | 89.3 | 84.1 | 80.1 | 76.4 | 69.4 |
| π₀.₅ | 75.8 | 79.4 | 83.3 | 95.5 | 95.0 | 89.6 | 87.0 | 85.7 |
| GR00T N1.6 | 92.6 | 33.5 | 80.1 | 93.6 | 95.4 | 93.6 | 75.0 | 79.4 |
| ACoT-VLA | 96.6 | 70.4 | 79.7 | 95.1 | 97.1 | 95.9 | 85.0 | 88.0 |
| Kairos | 95.5 | 72.6 | 86.8 | 97.7 | 95.8 | 96.8 | 81.5 | 89.0 |
| Kairos-joint | 95.9 | 74.6 | 95.3 | 97.1 | 97.1 | 95.4 | 83.8 | 90.8 |
Kairos-joint 是 inference 阶段让"未来 video tokens 和 action tokens 联合去噪"的变体 —— 让 action prediction 显式关注 video generation → 从 89.0 → 90.8 (+1.8)。
核心架构:Hybrid Linear Temporal Attention
Kairos 最有理论深度的贡献:三种 attention 并行处理不同时间尺度:
- Sliding-window attention:抓局部动力学(近期几帧)
- Dilated sliding windows:抓中程依赖(跨多帧)
- Gated linear attention:维持持久全局记忆(长视频不衰减)
论文提供 formal theoretical bounds,证明这种时间分解严格限制误差累积—— 状态传播在长时间下有数学保证。这是"世界模型"路线里少见的可证明的稳定性论述。
Kairos-4B 端侧特性
Kairos-4B 是首个能端侧直接机器人控制的世界模型:
- 4B 参数:显著小于同期 14B/16B/28B 世界模型
- Deployment-Aware Co-Design:从算子融合到 KV 管理为消费级硬件优化
- 端到端闭环:世界理解 → 状态预测 → 动作生成一次完成,不需要外部 VLA
- PAI-Bench 4B 打过 Cosmos-Predict2.5-14B(Overall 82.57 vs 79.40)
关键 Ablation(论文 Table 13-14)
1) Human-Centric 数据规模的影响(LIBERO-Plus)
| Model | Avg | Gain |
|---|---|---|
| w/o human-centric data | 83.0 | — |
| w/ human-centric data | 89.0 | +6.0 |
2) 联合 Generation + Prediction 训练
| Model | Avg | Gain |
|---|---|---|
| Action Prediction Only | 65.8 | — |
| Video Generation + Action Prediction | 89.0 | +23.2 |
只训 ActionDiT 相比联合训 video + action,性能掉 23.2—— 视频生成任务是学习 world model 的关键监督信号,不能删。
Human Evaluation(论文 Fig 19)
10 位志愿者对 5 个模型(匿名)做 head-to-head 主观评估,Kairos-4B 的胜率:
- PAI-Bench robot:赢 Wan 2.2-5B 74.1% · 赢 Cosmos-Predict2.5-14B 60.2% · 赢 Lingbot-28B 49.1%
- WorldModelBench robot:赢 Wan 2.2-5B 86.7% · 赢 Lingbot-28B 74.7% · 赢 Cosmos-Predict2.5-14B 65.0%
- DreamGen:赢 Wan 2.2-5B 88.8% · 赢 Cosmos-Predict2.5-14B 47.6%
差异化定位
Kairos 是"World Model + Action 一体化"路线当前最强开源代表:
- vs Motus / Genie Envisioner:Motus 是 MoT 五模式,GE 是四组件平台;Kairos 更强调时间尺度分解(sliding + dilated + gated linear)+ 形式化理论证明
- vs 大模型对手:Kairos-4B 打过 Cosmos3-Nano 16B / Lingbot 28B / Wan2.2 14B —— 参数效率极高
- vs 纯 VLA(π₀ / OpenVLA / GR00T):LIBERO-Plus 打过全部同期 VLA · RoboTwin 2.0 打过 π₀.₅ 16 point
- 端侧部署:Kairos-4B 是首个消费级硬件可跑的世界模型 → 有实际部署价值
如果做 world-model-based VLA,Kairos 是当代必读工作 —— 尤其它的理论保证让训练动态可预测。