π₀ / π₀.₅ Physical Intelligence · PaliGemma 3B + Flow Matching
Physical Intelligence 通用机器人操纵基础模型 · 跨具身流匹配动作生成 · 开世界泛化
π₀ 和 π₀.₅ 是 Physical Intelligence(PI)团队开源的两代通用机器人操纵基础模型。PI 由来自 Stanford、Google 和工业界的研究人员组成,创始人包括 Chelsea Finn 和 Sergey Levine 等。π₀ 于 2024-10 发布(arXiv 2410.24164),π₀.₅ 于 2025-04 跟进(arXiv 2504.16054)。
两代模型的共同特点:基于预训练视觉-语言模型(VLM)PaliGemma 3B,加入 flow matching 动作专家进行连续动作生成。π₀.₅ 的核心升级是引入了开世界泛化能力——能在训练时从未见过的真实家庭环境中完成 10-15 分钟的多阶段清洁任务(如清理厨房、收拾卧室)。
两代产品线对比
| 维度 | π₀(2024-10) | π₀.₅(2025-04) |
|---|---|---|
| 核心能力 | 零样本任务跟随 + 微调为复杂长程任务 | 零样本 + 开世界泛化(全新家庭) |
| 动作表示 | 离散 token + flow matching 双混合 | 同左(预训练用离散,后训用 flow) |
| 训练数据 | PI 自采 + OXE 混合,~10K 小时 | web 数据 + PI 多具身数据 |
| 评测方式 | 16 项微调下游任务(折衣服、收拾桌子等) | 真实家庭泛化(3 厨房 + 3 卧室) |
| 参数量 | 3.3B(VLM 3B + Action Expert 0.3B) | 论文未明确披露 |
π₀ 关键成绩
包括 PI 内部采集的 dexterous manipulation 数据 + 完整 OXE 开源数据集(22 种机器人)。代表当时「业界最大规模端到端机器人学习实验」。
微调下游任务表现
π₀ 在 16 项微调任务上展示高质量执行(论文报告了定性成功案例,并未给出量化成功率表):
- 折衣(Laundry Folding)· 多阶段长程:从烘干机取衣服 → 装入篮子 → 搬到折衣台 → 逐件折叠
- 收拾桌子(Table Clearing)· 在杂乱场景中识别物品类型并分类
- 餐具清洗(Put Dishes in Microwave)
- 叠鸡蛋(Stacking Eggs into Carton)· 细粒度接触动作
- 装纸箱(Assembling Box)
- 装袋购物(Bagging Groceries)
论文强调「任务长度远超以往工作」——折衣等任务可持续数分钟至十余分钟,涉及物体变形、长期规划、细粒度控制三层耦合。
π₀.₅ 关键成绩
具体任务:「放碟子入水槽」「从抽屉取毛巾」「装衣服入篮子」等。模型零样本泛化到完全陌生的新家,涉及新物体、新背景、新布局。
评测协议(Real-Home Generalization)
π₀.₅ 的测试设置是真实用户场景的直接对标:
| 评测点 | 设置 | 指标 |
|---|---|---|
| 模拟厨房 | Lab 内 mock-up(已见过的风格) | baseline 用于消融 |
| 真实厨房(3 个) | 未见过的住宅厨房,novel objects | 语言跟随率 + 任务成功率 |
| 真实卧室(3 个) | 未见过的住宅卧室,变化的布局 | 同上 |
| 任务长度 | 10-15 分钟的多阶段清洁(e.g., 打扫整个厨房) | 完成度 %(partially successful episodes 被认可) |
注意:具体的成功率百分比在论文中是相对数值("语言跟随率 + 成功率"的对比),论文未单独报告 π₀.₅ 在这些任务上的绝对分数。
架构:PaliGemma + Flow Matching 动作专家
骨干选择:PaliGemma 3B
PaliGemma 是 Google 开源的多模态 VLM,相比通用 LLM 的优势是:
- 参数规模:3 亿参数(相对小型,便于机器人实时推理),相比 Qwen-VLA 的 4-5B 更轻)
- 视觉编码:ViT 特征提取 + 空间合并(spatial merging)
- 多模态对齐:预训练于大规模网络图像-文本对,继承了 Internet-scale 语义理解
论文说"选 PaliGemma 是为了便利性和体积平衡,但框架兼容任何 VLM"—— 这是一个可复用设计点。
Flow Matching 动作专家(核心创新)
相比传统 VLA 用离散 token 自回归生成动作,π₀ 的动作专家用 conditional flow matching 输出连续动作分布:
| 环节 | 设计 | 好处 |
|---|---|---|
| 动作块长度 | H = 50 个时步(连续) | 支持 50 Hz 控制频率,细粒度 dexterous 操纵 |
| 数学形式 | τ ∼ [0,1] flow time;loss = ||v_θ(A_τ, o) - (A - ϵ)||² | 比 diffusion 更稳定的收敛;最优传输概率路径 |
| 推理 | Euler 积分 10 步(δ=0.1)从纯噪声 → 干净动作 | 确定性、快速、无需采样 |
| 权重隔离 | Action Expert 用独立权重参数(~ 300M),VLM 冻结或微调分开 | 参数高效;可热换动作头;梯度路由灵活 |
为何选 flow matching 而非 diffusion? 论文对比指出:flow matching 用线性高斯概率路径(相比 diffusion 的 reverse 过程)在高频动作生成上收敛更快、数值更稳定;且与最优传输理论兼容。
多模态输入编码
- 视觉:2-3 个 RGB 摄像头(头部 + 腕部常见)→ ViT patch embedding
- 语言:自然语言指令 → 文本 token embedding
- 本体感受:关节角度向量(joint angles) → 线性投影
- Attention:图像/文本/本体用双向自注意;动作 token 在 flow 迭代中也用双向 attention(与其它动作 token 交互)
训练配方:Pre-training + Post-training 两阶段
π₀ 的数据源与规模
论文报告了「至知识发表时业界最大规模」的机器人预训练数据混合:
- PI 内部采集(高质量 dexterous)
- 7 种机器人配置(单臂 Franka、双臂 Aloha、移动底盘等)
- 68 项任务
- 覆盖精细操纵(folding, assembly, wiping)
- OXE 开源数据集(广覆盖)
- 22 种不同机器人平台
- 多任务覆盖(grasping, drawer opening 等)
- 语言标注:任务名 + 2 秒级子轨迹细粒度标签
总计:~10,000 小时机器人演示(π₀ 论文明确说法)· 包括多体态、多任务、多恢复策略
两阶段训练的动机
类似 LLM 的 pre-training + post-training 范式:
| 阶段 | 数据特性 | 目标 | 损失函数 |
|---|---|---|---|
| Pre-training | 低质量但多样(mix of OXE + PI diverse) | 学习广泛物理基础能力、错误恢复 | Flow matching loss(各任务混合) |
| Post-training | 高质量精心采集(single task, high-quality demos) | 精通特定下游任务、流畅执行 | 同上,但数据更纯净 |
直觉:预训练给模型「犯错时的恢复和多样化行为词汇库」,后训让它「在某一任务上表现优雅」——两者互补。
π₀.₅ 对训练的改进
π₀.₅ 采用了「离散 token 预训 + flow matching 后训」的混合方案:
- 预训阶段(α=0):把动作编码成 FAST token(离散),用普通 cross-entropy loss。优点:收敛快、内存高效、天然利用 VLM 原有的 next-token 梯度通路
- 后训阶段(α>0):加入 action expert 权重,同时监督离散 token(通过 CE)和连续 flow matching(通过向量场 loss)。α 平衡两个目标
- 推理时**:先自回归采样出高层子任务(文本),再条件化 flow matching 做 10 步去噪生成低层连续动作
这样设计让预训练稳定快速,后训既保留语言理解能力又获得细致动作生成。
π₀.₅ 的开世界泛化机制
为什么 π₀.₅ 能泛化到新家庭?
论文未明确说是某个单一技巧,而是以下因素的组合:
- Web 数据集成:训练数据中包含大量互联网图像-文本对,使得 VLM backbone 学到了世界各地厨房、卧室的视觉多样性
- 多具身交叉训练:跨 10+ 种机器人平台的轨迹混合,迫使模型学习 task-level 的语义而非 embodiment-specific 细节
- 层级推理**(π₀.₅ 新增):模型先输出高层子任务("pick up plate"),再生成低层动作。子任务是语言化的、可通用的语义
- Flow matching 的平滑性:连续动作生成相比离散 token 在分布外场景下不易"梗"
π₀.₅ 论文用的术语是"open-world generalization",特指「从未见过的房屋和物品场景」而非"无任何任务描述"——仍然给定语言指令。
和其它 VLA 的横向对比
| 模型 | Backbone | 动作头 | 参数 | 开源程度 | 主战绩 |
|---|---|---|---|---|---|
| π₀ | PaliGemma 3B | Flow matching 动作专家 | 3.3B | 代码 + 权重(HF) | 10K 小时预训 · 微调 16 项任务 · 折衣等长程 |
| π₀.₅ | PaliGemma(未公开大小) | 离散+flow 混合 · 层级推理 | 未披露 | 部分(权重 + 推理框架) | 开世界泛化 · 真实家庭 3+3 零样本 |
| Wall-X / WALL-OSS-0.5 | Qwen2.5-VL 3B | Flow + FAST 双头 · MoT 架构 | ~4B | ✅ 训练/推理全开源 | 15 真机任务 60.5%(fine-tuned)vs π₀.₅ 43.0% |
| Qwen-VLA(闭源) | Qwen3.5-4B | DiT flow matching 1.15B | ~5B | 权重 + 推理(闭源框架) | LIBERO 97.9% · ALOHA 76.9% · 多基准覆盖 |
| OpenVLA | Llama-2 7B + DINO | 离散 action token | 7B | ✅ 代码 + 权重 | 较小规模基准 |
| GR00T N1 | Eagle-2 | Diffusion Policy 双系统 | ~2B | 部分 | NVIDIA 优化、轻量级 |
π₀ vs Wall-OSS-0.5 的直接对比见 wall-x.html;π₀ vs Qwen-VLA 的对比见 qwen-vla.html。π₀.₅ 强调的是「泛化」而非「绝对分数」。
推理与部署
推理效率
| 操作 | 时间(NVIDIA RTX 4090) | 备注 |
|---|---|---|
| VLM 前缀编码(观测 + 语言) | ~50-100 ms | 可缓存 attention key/value |
| Flow matching 单个去噪步(10 步总共) | ~10 ms/step | Euler 积分,decoder-only |
| 端到端(从观测到动作) | ~150-200 ms | 适合 5-10 Hz 控制;50 Hz 需进一步优化 |
使用示例(基于开源代码)
# 加载预训练权重
from openpi import PiModel
model = PiModel.from_pretrained("physical-intelligence/pi-0")
# 准备输入:观测 + 语言指令
obs = {
"images": [img_rgb_head, img_rgb_wrist],
"proprio": joint_angles,
"language": "pick up the red block"
}
# 推理:生成 50 步动作
actions = model.predict(obs, num_integration_steps=10)
# 执行
for a in actions:
robot.send_action(a)
π₀ 代码开源于 Physical-Intelligence/openpi;模型权重托管在 Hugging Face。
局限与值得关注的点
- π₀.₅ 论文未给绝对分数:虽然论文声称"开世界泛化"和"在真实家庭成功",但具体的成功率百分比、对比 Wall-OSS-0.5 的定量差距等未详细披露。相比 Qwen-VLA 在 LIBERO/ALOHA 等标准基准上的报分,π₀.₅ 的评测方式更贴近真实但可复现性更低
- 参数量信息不完整:π₀ 明确说 3.3B,π₀.₅ 论文未公开骨干+专家总参数,只说"基于 VLM 初始化"
- 训练成本未公开:10K 小时数据在多少 GPU-hour 内训完、成本几何都没有披露
- 跨体态泛化 vs 跨场景泛化混淆**:π₀ 强调"跨 7 种机器人配置",π₀.₅ 强调"同一机器人在新家庭"——两个泛化维度不同,对比时要留意
- 真实机器人评测样本量小:π₀.₅ 在 3 厨 + 3 卧这样的小规模真实环境测试(不是大规模随机环境扫),虽更真实但推广性需斟酌
- vs Wall-OSS-0.5 的定量对比缺失:两家都声称"best-in-class",但在同一基准上的直接交叉无法从论文找到