X-VLA Soft-Prompted Transformer · 0.9B
跨形态通用基础 VLA · 以软提示驱动具身特异性 · 仅 0.9B 参数 · WidowX 95.8% 超群
X-VLA 是清华 AIR Lab 与北大智能学院联合发布的一个轻量化 VLA 基础模型(arXiv 2510.10274,2025-10-11)。核心创新是软提示(soft prompt)机制:与其为每种机器人形态训单独的模型或用复杂路由,不如给统一的 Transformer backbone 挂上"形态特异的可学习嵌入",让同一套参数对不同机器人做自适应。结果:用 0.9B 这个轻量级体量,同时在 6 套仿真平台和 3 个真实机器人上取得 state-of-the-art 性能。
简而言之:用最少参数、最简单的 Transformer 架构、把异质数据的复杂性压进几个可学习的 prompt embedding。
核心分数
对标:Qwen-VLA 73.7% · Octo-small 真机 25.6%
软提示机制 · Soft-Prompted Transformer
核心设计思想
不同于 prefix tuning(冻结主干、学 prefix)或 LoRA(低秩分解),X-VLA 的软提示更直接:
- 每个数据源(embodiment)对应独立的可学习向量(learnable embedding) —— 这个向量充当该形态特有的"身份标签"
- 在 Transformer encoder 的前向过程中注入这个 prompt embedding —— 让模型根据输入来自哪个平台/机器人,自动调整内部表征
- 同一个 backbone 权重在推理时对所有形态共享 —— 只改变"打入"的 prompt,不改变主干参数
这种设计相比"为每个形态单独微调一份权重"或"用 MoE 路由",参数开销最小、推理最快,同时给了模型"知道自己在操纵哪个机器人"的灵活性。
与 Prefix Tuning / Prompt Tuning 的区别
- Prompt Tuning(吴恩达 / LSTM Prompt):冻结语言模型,只学一个 prompt 的 embedding 向量,应用到所有任务。适合 single-task 或小任务簇。
- Prefix Tuning:在每层 Transformer 的前面插入可学习的 prefix,梯度仍通过整个网络。参数量介于 prefix embedding 和全量 finetuning 之间。
- X-VLA Soft Prompt:为每个 embodiment / 数据源学一套独立的向量。该向量在 encoder 前端编码进去,使得同一个主干对不同形态做自适应。相比 LoRA 的秩分解,这里不再拆权重,而是以"身份前缀"的方式让主干学会形态感知。
架构:标准 Transformer 加软提示
关键参数
- 参数量:
0.9B(九亿) —— 相比 π₀.₅(约 3B)小约 3 倍;相比 OpenVLA(7B)小约 7.8 倍 - Backbone:标准 Transformer encoder · "relies exclusively on soft-prompted standard Transformer encoders"(论文原文)—— 没有 MoE、没有特殊模块,单纯的自注意力栈
- 输入层:图像 token 化(patch embedding)+ 自然语言 token 化 + 动作 embedding,然后统一过 Transformer
- 动作头:flow-matching policy —— 和 π₀ / Qwen-VLA 路线一致,用连续去噪的方式从高斯噪声生成平滑动作轨迹
- Embodiment Prompt:每个数据源的可学习向量,在 encoder 输入时拼接或融合到 token 序列里
与 Wall-X/WALL-OSS 的对比
Wall-X 用Mixture-of-Experts(MoE)把权重拆成 VL Expert 和 Action Expert,两套权重形状不同但梯度端到端穿过;X-VLA 反其道而行,干脆用单一统一 backbone,形态差异只走"提示"这一条路。
| 维度 | X-VLA | Wall-X / WALL-OSS-0.5 | Qwen-VLA | π₀.₅ |
|---|---|---|---|---|
| Backbone | 标准 Transformer 32L | Qwen2.5-VL 3B + MoT | Qwen3.5-4B | PaliGemma 3B |
| 参数 | 0.9B | ~4B | ~5B | ~3B |
| 跨形态适应 | Soft prompt | MoE 路由 | Embodiment prompt(固定) | 单一 |
| 动作生成 | Flow matching | Flow + FAST 双头 | DiT flow matching | Flow matching |
| 推理加速 | — | ✅ 自研 CUDA | — | — |
Benchmark 分数表
官方发布的微调模型成绩(arXiv 2510.10274 + GitHub README)
| 数据集 / 任务 | 机器人本体 | X-VLA 分数 | 评测指标 | 说明 |
|---|---|---|---|---|
| Simpler-WidowX | WidowX 250 | 95.8% | 成功率 | BridgeDataV2 fine-tuned · 论文重点 |
| Google Robot | Google Robot | 83.5% (VM) / 76.4% (VA) | 视觉匹配 vs 变异聚合 | Google Robot 数据集微调 |
| LIBERO | Franka | 98.1% | 成功率 | 40 任务学习基准 |
| VLABench | Franka | 51.1 | 综合得分 | 多伦多多形态基准 |
| CALVIN | Franka | 4.43 | 阶段评分 | ABC_D 子集 |
| RoboTwin 2.0 | Agilex | 70% | 成功率 | 双臂 50 demos/任务 |
| SoftFold | Agilex | 100% | 成功率 | 变形物 (布料) · 2h 内完成 |
| AgiWorld Challenge | Agibot-G1 | 🥇 Champion | 竞赛排名 | 挑战赛冠军 |
注:所有分数来源于官方 arXiv 论文或 GitHub README。X-VLA-WidowX 的 95.8% 特别突出,同类 Qwen-VLA 在同基准 73.7%(虽然 Qwen-VLA 用了 SimplerEnv 做强化学习)。
训练数据 · 跨形态异质混合
官方披露的数据源
- LIBERO:40 任务仿真基准
- CALVIN:语言指令单臂操纵
- Google Robot dataset:真机轨迹
- RoboTwin2:双臂协作数据
- Bridge Data V2:WidowX 真机数据 60k+ 轨迹
- VLABench:多形态对标数据
- Soft-Fold Dataset:变形物操纵
- AgiBot World 等:额外机器人本体数据
训练配方
这些数据混在一起,每个数据源配一个独立的 soft prompt embedding 向量。论文没有披露总数据量的具体数字,但强调了"large-scale heterogeneous robot–vision–language datasets"。训练时所有数据用同一个 backbone,通过形态特异 prompt 让模型适应不同的传感器配置、动作维度、控制频率等。
与其他 VLA 的横向对比
| 模型 | Backbone | 参数 | 动作头 | 跨形态 | WidowX 分数 |
|---|---|---|---|---|---|
| X-VLA | Soft-prompted Transformer | 0.9B | Flow matching | ✅ 单 backbone + soft prompt | 95.8% |
| Qwen-VLA | Qwen3.5-4B | ~5B | DiT flow matching | ✅ Embodiment prompt | 73.7% |
| Wall-X / WALL-OSS-0.5 | Qwen2.5-VL 3B + MoT | ~4B | Flow + FAST 双头 | ✅ MoE 路由 | — |
| π₀.₅ | PaliGemma | ~3B | Flow matching | ✅ 通用预训 | — |
| OpenVLA | Llama-2 7B + SigLIP/DINOv2 | 7B | 离散 action token | ✅ 部分 | — |
Qwen-VLA 的 WidowX 分数基于 SimplerEnv 视觉匹配模式,但包含强化学习阶段;X-VLA 是纯微调。两者口径不完全可比,但 X-VLA 在超轻量体量下的相对性能是值得关注的。
局限 / 未公开信息
- 参数细节未披露:虽然标称 0.9B,但论文没有拆解 Transformer 层数、隐藏维度、软提示向量维度等具体配置
- 训练成本未报告:跨 8+ 平台预训练需要多少 GPU-hour、用了几张卡、训多久,没有给出。相比之下 Wall-OSS 论文至少提了"单 epoch 消化 >1M 条轨迹"这样的量级信息
- 推理延迟没有公开数字:论文说"scalability and simplicity"但没给出 latency、throughput、对标 π₀ 的实际推理时间
- 软提示具体融合方式:Prompt embedding 是在输入层拼接,还是在每层中间注入,还是别的方式?论文摘要说"embody as embodiment-specific prompts"但细节没写
- 跨形态泛化的尺度:论文说"6 simulations + 3 real robots",但并没有给出"zero-shot 迁移到完全陌生的第 10 个机器人"这类极限泛化测试
- LIBERO 98.1% vs 其他文献的直接对比缺失:Octo、Diffusion Policy 等在 LIBERO-full 上的分数没有同表出现
技术亮点总结
- 参数开销最小化:用 0.9B 而不是 3-7B,同时在多个基准上竞争力强,这对部署和微调很有意义
- 软提示机制的优雅性:不需要 MoE 路由复杂度、不需要每个形态单独权重,只用可学习向量作"身份"。这个设计易于理解易于复现
- Simpler-WidowX 上的压倒性优势:95.8% vs Qwen-VLA 73.7%,虽然 Qwen-VLA 用了 RL fine-tune(口径差异),但这仍是 X-VLA 最硬的成绩
- 开源完整性高:代码、权重、多个形态的微调模型都开源了(HuggingFace 2toINF),社区可以直接用和改