← VLA Atlas

X-VLA Soft-Prompted Transformer · 0.9B

跨形态通用基础 VLA · 以软提示驱动具身特异性 · 仅 0.9B 参数 · WidowX 95.8% 超群

X-VLA 是清华 AIR Lab 与北大智能学院联合发布的一个轻量化 VLA 基础模型(arXiv 2510.10274,2025-10-11)。核心创新是软提示(soft prompt)机制:与其为每种机器人形态训单独的模型或用复杂路由,不如给统一的 Transformer backbone 挂上"形态特异的可学习嵌入",让同一套参数对不同机器人做自适应。结果:用 0.9B 这个轻量级体量,同时在 6 套仿真平台和 3 个真实机器人上取得 state-of-the-art 性能。

简而言之:用最少参数、最简单的 Transformer 架构、把异质数据的复杂性压进几个可学习的 prompt embedding

核心分数

95.8%
Simpler-WidowX · 成功率 · 在 BridgeDataV2 微调后(GitHub README
对标:Qwen-VLA 73.7% · Octo-small 真机 25.6%

软提示机制 · Soft-Prompted Transformer

核心设计思想

不同于 prefix tuning(冻结主干、学 prefix)或 LoRA(低秩分解),X-VLA 的软提示更直接:

  1. 每个数据源(embodiment)对应独立的可学习向量(learnable embedding) —— 这个向量充当该形态特有的"身份标签"
  2. 在 Transformer encoder 的前向过程中注入这个 prompt embedding —— 让模型根据输入来自哪个平台/机器人,自动调整内部表征
  3. 同一个 backbone 权重在推理时对所有形态共享 —— 只改变"打入"的 prompt,不改变主干参数

这种设计相比"为每个形态单独微调一份权重"或"用 MoE 路由",参数开销最小、推理最快,同时给了模型"知道自己在操纵哪个机器人"的灵活性。

与 Prefix Tuning / Prompt Tuning 的区别

架构:标准 Transformer 加软提示

关键参数

与 Wall-X/WALL-OSS 的对比

Wall-X 用Mixture-of-Experts(MoE)把权重拆成 VL Expert 和 Action Expert,两套权重形状不同但梯度端到端穿过;X-VLA 反其道而行,干脆用单一统一 backbone,形态差异只走"提示"这一条路。

维度X-VLAWall-X / WALL-OSS-0.5Qwen-VLAπ₀.₅
Backbone标准 Transformer 32LQwen2.5-VL 3B + MoTQwen3.5-4BPaliGemma 3B
参数0.9B~4B~5B~3B
跨形态适应Soft promptMoE 路由Embodiment prompt(固定)单一
动作生成Flow matchingFlow + FAST 双头DiT flow matchingFlow matching
推理加速✅ 自研 CUDA

Benchmark 分数表

官方发布的微调模型成绩(arXiv 2510.10274 + GitHub README)

数据集 / 任务 机器人本体 X-VLA 分数 评测指标 说明
Simpler-WidowXWidowX 25095.8%成功率BridgeDataV2 fine-tuned · 论文重点
Google RobotGoogle Robot83.5% (VM) / 76.4% (VA)视觉匹配 vs 变异聚合Google Robot 数据集微调
LIBEROFranka98.1%成功率40 任务学习基准
VLABenchFranka51.1综合得分多伦多多形态基准
CALVINFranka4.43阶段评分ABC_D 子集
RoboTwin 2.0Agilex70%成功率双臂 50 demos/任务
SoftFoldAgilex100%成功率变形物 (布料) · 2h 内完成
AgiWorld ChallengeAgibot-G1🥇 Champion竞赛排名挑战赛冠军

注:所有分数来源于官方 arXiv 论文或 GitHub README。X-VLA-WidowX 的 95.8% 特别突出,同类 Qwen-VLA 在同基准 73.7%(虽然 Qwen-VLA 用了 SimplerEnv 做强化学习)。

训练数据 · 跨形态异质混合

官方披露的数据源

训练配方

这些数据混在一起,每个数据源配一个独立的 soft prompt embedding 向量。论文没有披露总数据量的具体数字,但强调了"large-scale heterogeneous robot–vision–language datasets"。训练时所有数据用同一个 backbone,通过形态特异 prompt 让模型适应不同的传感器配置、动作维度、控制频率等。

与其他 VLA 的横向对比

模型 Backbone 参数 动作头 跨形态 WidowX 分数
X-VLA Soft-prompted Transformer 0.9B Flow matching ✅ 单 backbone + soft prompt 95.8%
Qwen-VLA Qwen3.5-4B ~5B DiT flow matching ✅ Embodiment prompt 73.7%
Wall-X / WALL-OSS-0.5 Qwen2.5-VL 3B + MoT ~4B Flow + FAST 双头 ✅ MoE 路由
π₀.₅ PaliGemma ~3B Flow matching ✅ 通用预训
OpenVLA Llama-2 7B + SigLIP/DINOv2 7B 离散 action token ✅ 部分

Qwen-VLA 的 WidowX 分数基于 SimplerEnv 视觉匹配模式,但包含强化学习阶段;X-VLA 是纯微调。两者口径不完全可比,但 X-VLA 在超轻量体量下的相对性能是值得关注的。

局限 / 未公开信息

技术亮点总结

  1. 参数开销最小化:用 0.9B 而不是 3-7B,同时在多个基准上竞争力强,这对部署和微调很有意义
  2. 软提示机制的优雅性:不需要 MoE 路由复杂度、不需要每个形态单独权重,只用可学习向量作"身份"。这个设计易于理解易于复现
  3. Simpler-WidowX 上的压倒性优势:95.8% vs Qwen-VLA 73.7%,虽然 Qwen-VLA 用了 RL fine-tune(口径差异),但这仍是 X-VLA 最硬的成绩
  4. 开源完整性高:代码、权重、多个形态的微调模型都开源了(HuggingFace 2toINF),社区可以直接用和改

论文与代码链接

arXiv 2510.10274
X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
GitHub · 2toinf/X-VLA
官方仓库 · 权重 / 训练脚本 / 8 个微调模型
Hugging Face · 2toINF
X-VLA-Pt 基座 + WidowX / LIBERO / Google Robot 等 7 个微调变体
项目主页
官方示例与快速开始
对照:Simpler-WidowX
X-VLA 最强表现的基准详解
对照:Qwen-VLA
参数量与架构对标