GR00T N1 NVIDIA · 2025-03
开源人形机器人基础模型 · 双系统视觉-语言-动作架构
GR00T N1 是 NVIDIA 于 2025-03-27 发布的开源具身基础模型(arXiv 2503.14734),主打人形机器人的端到端多任务学习。核心创新是双系统架构:System 2(缓慢思考)由 Eagle-2 VLM 负责视觉理解与推理,System 1(快速反应)由 Diffusion Transformer 实时生成流畅的电机动作。与同类 Qwen-VLA / Wall-X 等强调操纵+导航+轨迹一体化不同,GR00T N1 专注人形本体的双足平衡与全身协调控制。
基线成绩(仿真):DexMG 9 任务 · RoboCasa 24 任务 · Digital Cousin GR-1 24 任务 · VLABench 39.7(LeRobot 视频排行榜)。真机部署于 Fourier GR-1 人形机器人,验证了双臂双足协作的数据高效学习能力。
产品线与版本
截至 2025-03-27,NVIDIA 官方发布的人形机器人 VLA 产品线:
| 版本 | 发布日期 | 参数量 | 状态 |
|---|---|---|---|
| GR00T N1 | 2025-03-27 | 2B | 开源 · 已发布 |
| GR00T N1.5 | — | — | 无确凿信息 |
| GR00T N2 | — | — | 无确凿信息 |
本页重点讲 N1。N1.5 / N2 若已发布将另开页面。
架构 · 双系统设计
论文灵感来自 Kahneman 心理学的 System 1(直觉、快速)与 System 2(理性、缓慢)模型。System 2 在每个环节思考"要做什么",System 1 在控制频率下"怎样流畅地做"。
核心模块详解
System 2: Eagle-2 Vision-Language Model
NVIDIA 自研 VLM,专门为机器人感知优化。处理 RGB 图像序列(多视角或单摄像头时序)与文本指令,输出包含视觉理解的隐状态向量。这些向量编码了"环境中有什么"、"任务是什么"的语义信息,作为 System 1 的条件信号。
System 1: Diffusion Transformer (DiT) Action Head
基于 Flow Matching 的动作去噪器,输入包含:
- Eagle-2 的 hidden states(System 2 输出)
- 本体感觉向量:关节角度、速度、力矩等当前状态
- Noisy action chunk:Flow matching 训练过程中从分布采样的噪声动作向量
输出是「未来 T 步的关节速度指令」。推理时用 Euler 积分逐步去噪,实现实时流畅的运动生成。
本体感觉编码 (Proprioception Encoder)
多层感知机 (MLP),针对不同机器人本体的不同状态维度。例如 Fourier GR-1 是人形双臂双足,状态维度远高于单臂机械臂。通过 embodiment ID 索引不同的 MLP 矩阵,在同一套权重上支持多个机器人本体。
数据混合与训练
GR00T N1 训练数据来自三个来源的混合(具体占比未在论文/模型卡披露):
| 数据源 | 特征 | 用途 |
|---|---|---|
| 真机轨迹 | 多个机器人平台(Fourier GR-1 等)· RGB + proprioception | 现实世界 grounding |
| 人类第一视角视频 | 人做演示任务的自然视频 + 语言标注 | 跨越模态差异 · 学习多样化动作 |
| 合成数据(Isaac Sim) | 仿真环境中的虚拟轨迹 · 大规模廉价生成 | 覆盖稀有场景、长尾分布 |
这个混合策略与 Qwen-VLA 相似,但 GR00T N1 特别强调了 Isaac Sim 合成数据 作为主要扩展手段,这是 NVIDIA 生态优势(官方物理仿真工具链)。
仿真基准
GR00T N1 在三个关键任务集上评测(都是仿真):
| 基准 | 任务数 | 评测体系 | 特点 |
|---|---|---|---|
| DexMG | 9 | 细致灵巧操纵 | 关节精度高 · 对手指控制敏感 |
| RoboCasa | 24 | 移动操纵 (mobile manipulation) | 导航+操纵联合 · 室内场景 |
| Digital Cousin GR-1 | 24 | 人形双臂双足 | 同架构虚拟验证 · 平衡+协调 |
真机部署与评估
机器人本体:Fourier GR-1 人形机器人
双足双臂人形机器人,154 个关节(头、躯干、双臂、双腿都有独立控制)。GR00T N1 在这个平台上完成了以下任务的真机评测:
- 杂货理货 (Grocery packing):从散乱的物品中选取、放入容器 · 需要双臂协作
- 工业多机协作与交接:与其他机器人传递物体 · 涉及精确的手爪时序
评估方法:人工观察 (human assessment) 与自动成功率检测的混合。具体数值未详细披露。
VLABench 排行榜
NVIDIA 官方维护的 VLABench 排行榜采用 LeRobot 数据集的视频预测任务评测 VLA 模型。GR00T N1 的排名成绩是 39.7(具体指标定义见排行榜页面)。
与 Qwen-VLA、π₀ 等主流基础模型在同一排行榜对标。
和其他 VLA 的对比
| 维度 | GR00T N1 | Qwen-VLA | Wall-X | π₀ |
|---|---|---|---|---|
| 参数量 | 2B | ~4B | 未披露 | ~7B |
| 主攻本体 | 人形双臂双足 | 多本体(单臂/导航/轨迹) | 双臂操纵 | 多本体 |
| VLM 主干 | Eagle-2 | Qwen3.5-4B | SigLip + LLaVA | CLIPv2 + LLaVA |
| 动作模块 | DiT (Flow Matching) | DiT (Flow Matching) | CNN 回归 + 扩散 | Flow Matching |
| 数据合成策略 | Isaac Sim 为主 | 多源混合 | 广采真机 | 多源 + domain-specific 合成 |
| 发布时间 | 2025-03-27 | 2026-05-28 | 2024-10 | 2024-10 |
核心差异点
- 双系统架构是 GR00T 独有的设计理念:显式分离"慢思考 VLM"与"快反应 DiT",物理意义上对标 Kahneman 理论。其他 VLA 多数采用串联或并联架构。
- Isaac Sim 合成数据的重度使用:与 Qwen-VLA 的混合策略相比,GR00T N1 论文更强调仿真生成能力,这是 NVIDIA 对标自家生态链的竞争优势。
- 人形机器人专项优化:Qwen-VLA 强调「一套权重跨多任务」,GR00T N1 则聚焦人形机器人的双足平衡与全身协调,任务适配度更专一。
- 参数量较轻:2B 参数量在主流 VLA 中偏小(Qwen ~4B、π₀ ~7B),推理成本更低,有利于资源受限的机器人部署。
局限与未来方向
- 动态环境表现:模型在有大量动态干扰物的环境中性能下降。论文提出的缓解方案是增加动态障碍物的训练数据。
- Sim-to-real 差距:虽然 Isaac Sim 物理模拟精度高,但仿真和真机的像素分布、接触力学等仍有缝隙。真机评估数据有限。
- 本体覆盖有限:模型在 Fourier GR-1 上验证较充分,跨机器人本体的泛化能力还需扩展测试。
- 任务复杂度:当前演示多为双臂灵巧操纵与物体交接,缺少长程序列决策(如多步规划、物理推理)的评测。
- 不建议用于关键系统:模型卡明确声明不适用于安全关键 (mission-critical) 应用,需要用户自行加入安全机制与人工监督。
获取与部署
模型权重与代码
- HuggingFace 模型卡:nvidia/GR00T-N1-2B
- 许可证:NVIDIA One-Way Noncommercial License(研究和评测可用,商业化需许可)
- 官方代码仓库:NVIDIA/Isaac-GR00T(包含推理脚本、适配器、微调工具)
- 适配器与微调模型:13 个官方适配器、5 个微调变体可在 HF 获取
训练数据
- 训练数据集:nvidia/PhysicalAI-Robotics-GR00T-X-Embodiment-Sim (HF Datasets)
- 包含真机、人类视频、合成轨迹的混合数据
硬件需求
模型支持多种 NVIDIA 加速器:Ampere (A100) / Blackwell (B100) / Hopper (H100) / Lovelace (L40) / Jetson 嵌入式 GPU。推理框架:PyTorch。
发展路线
根据官方博客与 GitHub roadmap,GR00T 系列的后续计划(截至 2025-03):
- 扩大本体支持(Boston Dynamics Atlas、Tesla Optimus 等人形平台的适配)
- 增强长程规划能力(多步任务、条件约束)
- 改进 sim-to-real 迁移(域适应、在线适应学习)
- 开源更多工具链集成(Isaac Sim → 数据生成 → 训练 → 部署的完整流水线)
N1.5 / N2 的时间表与功能细节尚未官方公布。