Qwen-VLA Qwen Team · 2026-05
统一操纵、导航、轨迹预测的一体化视觉-语言-动作基础模型
Qwen-VLA 是 Qwen 团队在 2026-05-28 发布的具身基础模型(arXiv 2605.30280)。它的核心主张是:操纵、导航、轨迹预测 三大类具身决策问题不用做三个专用模型,而是可以塞进同一个 VLA 里,只需切换 embodiment prompt 就能跨机器人本体、跨环境泛化。
基线成绩:LIBERO 97.9 · Simpler-WidowX 73.7 · RoboTwin-E/H 86.1/87.2 · R2R 69.0 OSR · RxR 59.6 SR · ALOHA 真机 OOD 76.9 · DOMINO 零样本 26.6。
架构 · Architecture
分工类比生物运动控制的大脑(backbone)与小脑(action expert)。VLM 负责视觉-语言理解与推理,DiT 通过 flow matching 在动作空间做去噪,两者靠 joint self-attention 沟通。
Embodiment-aware Prompt
为了在一套权重上支持不同机器人本体,Qwen-VLA 给每条训练样本前面拼一段固定模板的机器人描述:
The robot is {robot_tag} with {single arm / dual arms}
[, waist][, and mobile base]. The control frequency is
{FPS} Hz. Please predict the next {chunk_size} control
actions to execute the following task: {ori_instruction}.
robot_tag、腰部/底盘选项、控制频率、动作分块长度都跟随各数据集的原始配置。同一个「pick up the red cup」的任务意图,会因为 embodiment prompt 不同而映射到不同关节空间的动作程序。
四阶段训练 · Staged Recipe
Text-to-Action DiT 预训练(T2A)
VLM 冻结,只训 DiT,刻意不给图像。让 decoder 从纯语言 + embodiment prompt 学一个「语言索引的动作先验」:不同措辞选择动作空间的不同区域,embodiment prompt 调制到平台特有的运动参数化。
持续预训练(CPT)
解冻两个模块,用 §3.2 的混合数据(仿真 + 真机轨迹 + 人类第一视角 + 导航 + 轨迹监督 + 视觉语言)一起训。此时 decoder 已有语言先验,多模态容量专注于把动作 grounding 到视觉观测。
监督微调(SFT) · 双分支并行
- 多任务 SFT:VQA、空间 grounding、操纵、导航联合训练,本体和任务平衡采样
- 遥操作 SFT:从 CPT checkpoint 上单独用内部遥操作数据 fine-tune,专攻真机部署
强化学习(RL) → Qwen-VLA-Instruct
从多任务 SFT 起点用稀疏二值成功奖励做 RL,只在 SimplerEnv 一个仿真环境里训。刻意窄化 RL 范围,测试单一仿真环境的成功率提升能否迁移到 OOD 场景 —— 这是最终对外报分数的模型。
全部基准分数(Qwen-VLA-Instruct)
| 数据集 | 形态 | 指标 | 分数 |
|---|---|---|---|
| LIBERO | 仿真 · Panda 单臂 | Avg Success Rate | 97.9% |
| Simpler-WidowX | 仿真 · WidowX 单臂 | Avg Success Rate | 73.7% |
| RoboTwin-Easy | 仿真 · 双臂 | Success Rate | 86.1% |
| RoboTwin-Hard | 仿真 · 双臂 | Success Rate | 87.2% |
| R2R | VLN · 室内 | Oracle Success Rate | 69.0% |
| RxR | VLN · 多语 | Success Rate | 59.6% |
| ALOHA | 真机 · ALOHA 2 双臂 | Avg OOD Success | 76.9% |
| DOMINO | 动态操纵 · 5 本体 | Zero-shot Success | 26.6% |