← darkscope.cn

VLA Atlas · 视觉-语言-动作模型图谱

Qwen-VLA 一体化具身模型 + 7 个跨形态基准的解读合集

VLA(Vision-Language-Action)是把「看」「说」「动」三种能力压进同一个大模型的思路:给它一张图 + 一句自然语言指令,它直接输出一段机器人动作序列。2026 年 5 月 Qwen Team 发布的 Qwen-VLAQwen3.5-4B 多模态主干 + 1.15B DiT flow-matching action expert,把 操纵、导航、轨迹预测 三类任务统一到同一套动作生成框架里,并在下面 8 项主流基准上给出一份跨形态、跨环境的成绩单。

本页把这份基准清单结构化:每个数据集独立子页讲清它在测什么数据长什么样Qwen-VLA 跑到了多少分,以及和 π₀ / Wall-X / OpenVLA 等同类工作的可比性。

模型 · Model

目前完整讲解的是 Qwen-VLAWall-X / WALL-OSS,其余是待补的对照参考项(先外链到官方)。

Qwen-VLA Qwen3.5 + DiT
Qwen Team · 2026-05 · 统一操纵/导航/轨迹的具身基础模型 · arxiv 2605.30280
Wall-X · WALL-OSS Qwen2.5-VL + MoE
X² Robotics · 2025-09 起开源 · 4B · Flow / FAST 双动作头 · 15 真机 60.5% (比 π₀.₅ +17.5)
π₀ / π₀.₅ PaliGemma + Flow
Physical Intelligence · 2024-10 / 2025-04 · 3.3B · 通用操纵旗舰 · 开世界泛化
OpenVLA Llama-2 7B + 离散 token
Stanford / Google / TRI / MIT · 2024-06 · OXE 970k 轨迹 · 首个大规模开源 VLA 基线
X-VLA Soft-Prompted · 0.9B
清华 AIR + 北大 · 2025-10 · 约 π₀ 的 1/3 参数 · WidowX 95.8% · 跨形态软提示
GR00T N1 Eagle-2 + DiT
NVIDIA · 2025-03 · 2B · 双系统(System 1/2)· 人形机器人 · Isaac Sim 合成数据
RT-2 / RT-2-X Google DeepMind · 2023
把 VLM 直接生成离散动作 token · VLA 范式的开山工作 · 闭源权重

模型 · 2025-2026 最新

2025 下半年到 2026 年上半年集中出的一批 VLA 新工作,覆盖 LIBERO SOTA跨形态 zero-shot世界模型 + VLA 统一人形 loco-manipulation端侧高效DPO 后训练分层 + 记忆 / 推理 等新方向。数字均以 arXiv 摘要口径为准,未披露项在子页里标注。

Kairos 3.0-4B 4 榜第一 · 4B 打过 28B
商汤 · 大晓 · 2025-12 开源 / 2026-06 论文 · Native World Model · RoboTwin 2.0 96.1% + LIBERO-Plus 90.8 + WMBench 9.30 + DreamGen 0.618
RLDX-1 Humanoid · LIBERO 97.8 · 完全开源
RLWRLD · 2026-05 · MSAT 补齐 motion + memory + physical sensing 三大盲区 · GitHub + 3 HF checkpoints · ALLEX 91.7 / GR-1 Tabletop 58.7
EvoVLA Self-Evolving · Stage Hall. -23.7pp
北大 Hao Tang 组 · 2025-11 · ECCV 2026 · SAR + POE + Long-Horizon Memory · Discoverse-L 69.2 · 首个解决 stage hallucination
MolmoAct2 LIBERO 98.1% · 打过 GPT-5
Allen AI · 2026-05 · MolmoER backbone + OpenFAST + 720h 双臂开源 + MolmoThink · 目前开源 SOTA
MolmoAct 首创 ARM · 完全开源
Allen AI · 2025-08 · Action Reasoning Model · Depth 感知 + editable trace + low-level action · LIBERO 86.6
UniVLA LIBERO 95.5%
BAAI / CASIA / THU · 2025-06 · 自回归 + world-model post-training · 打过 π₀-FAST 的 85.5%
RDT2 跨形态 · 10K 小时 UMI
Tsinghua · 2026-02 · 7B · RVQ + Flow matching + 蒸馏 · 首个 4 维 zero-shot(物体/场景/指令/平台)
Motus +45% vs π0.5
Tsinghua · 2025-12 · MoT + UniDiffuser · 一个模型同时是 WM / VLA / IDM / video-gen / joint prediction
Ψ₀ Psi-Zero 人形 loco-manip
2026-03 · 首个开源人形 loco-manipulation 基础模型 · 800h 人 + 30h 机器人打过 10× 数据基线 40%
SmolVLA 10× 更小
HuggingFace · 2025-06 · 单 GPU 训、消费级 GPU/CPU 部署 · 异步推理栈 · lerobot 官方集成
InternVLA-M1 空间引导
Shanghai AI Lab · 2025-10 · 2.3M 空间推理 pretrain · SimplerEnv +14.6% / WidowX +17% / LIBERO +4.3%
RynnVLA-001 12M ego 视频
Alibaba DAMO · 2025-09 · 两阶段视频生成式预训练 + ActionVAE 潜动作压缩
EgoScale 20,854 小时 ego
2026-02 · 目前最大规模 egocentric 视频 · log-linear scaling law · 22-DoF 灵巧手 +54%
MemER 长时记忆
Stanford Chelsea Finn · 2025-10 · Qwen2.5-VL-7B(高) + π₀.₅(低)· Keyframe 检索式记忆
Genie Envisioner World+Act+Sim 一体
AgiBot Genie Team · 2025-08 · GE-Base(video diff)+ GE-Act(flow)+ GE-Sim + EWMBench
NORA-1.5 DPO 后训练
NTU 新加坡 declare-lab · 2025-11 · Flow matching action expert + 世界模型 reward + DPO 对齐
ThinkAct Dual-System 推理
NVIDIA + 台大 · 2025-07 · Reinforced 视觉潜规划 · few-shot / long-horizon / self-correction

下面几个也在追踪,但暂不建独立页(信息量或差异化不足以支撑一页),先外链官方:

Large Video Planner arxiv 2512.15840
MIT + Berkeley · 2025-12 · 直接用大视频模型 zero-shot 出机器人 plan · 不训机器人数据
Magma arxiv 2502.13130
Microsoft · 2025-02 · SoM + ToM · 跨 UI navigation + 机器人操纵双域基础模型
LingBot-VLA arxiv 2601.18692
蚂蚁集团 · 2026-01 · 20K 小时 9 种双臂 · 训练加速 1.5–2.8× · 开源代码栈
Hy-Embodied-0.5-VLA arxiv 2606.14409
Tencent Robotics X · 2026-06 · 全栈方案 · RL post-training + FlowPRO

思路对照 · Concepts

从「怎么把动作接到 VLM 上」的角度,主流路线可以拆成 4 类,每一类各自的取舍不同。

ACT · Chunking Transformer Zhao 2023
编码-解码 Transformer + CVAE + Temporal Ensembling · 直接回归 action chunk · ALOHA 起家
Diffusion Policy Chi 2023
U-Net 或 Transformer 去噪出动作序列 · 处理多模态分布 · Receding horizon control
Flow Matching Policy Lipman 2023
回归 velocity field · Rectified Flow 少步推理 · π₀ / Qwen-VLA / Wall-OSS-Flow 选择
Discrete Action Token RT-2 / OpenVLA
动作离散化到 tokenizer 词汇表 · 自回归生成 · 完整复用 LLM 训练栈

实测 · 微调实录

不是讲论文,是真把模型跑起来的记录 —— 单卡能不能训、坑在哪、失败长什么样。

WALL-OSS 单卡 3090 微调实录 Wall-X × LIBERO
7.9GB 具身基础模型在单卡 3090 上微调 + MuJoCo 仿真闭环抓取成功 (5/50) · 排掉训推不一致 / 捷径学习失明 / 渲染错绑碰撞体 / chunk 过长 4 个独立 bug · 含 5 段 SUCCESS 视频与微调前后开环对比 · 配套 notebook 与代码走读

数据集 · 操纵

LIBERO 97.9%
仿真 · Panda 单臂 · 40 任务 / 1693 演示 · 终身学习基准
Simpler-WidowX 73.7%
仿真 · WidowX 单臂 · 基于 Bridge V2 的桥接真机→仿真评测
RoboTwin 86.1 / 87.2%
仿真 · 双臂 · 50 任务 / 10 万+ 轨迹 · Easy / Hard 两档难度
ALOHA 76.9%
真机 · ALOHA 2 双臂 · 真实世界 OOD 泛化平均成功率

数据集 · 导航

R2R 69.0% OSR
Room-to-Room · Matterport3D · 21567 条英文指令 / 7189 条轨迹
RxR 59.6% SR
Room-across-Room · 英/印地/泰卢固 · 12.6 万条长指令 + 人类跟随路径

数据集 · 动态操纵

DOMINO 26.6% zero-shot
动态物体操纵 · 35 任务 / 5 种本体 / 11.7 万轨迹 · 闭环适应

叉车挑战赛 · 相关文献

2026 树根杯·具身智能平衡重叉车挑战赛专项调研。目标:感知 → 决策 → 控制 → 作业 一体化,完成 移动 / 叉取 / 搬运 / 放置。这里汇总目前公开的叉车 / 类叉车重型机械 RL 相关论文,供比赛期间快速对标。全球公开的完整"叉车 pick-place RL 预训练权重"目前不存在,但方法层面已被 HMER 等工作揭示。

📖 完整综述 · 叉车 RL 文献深度对比 Detail Page
50 轮多角度检索 · 5 篇专项 × 4 篇类似 RL × 2 项本地资源 · 每篇 reward / observation / action space / curriculum 的可迁移点标注 · 10 条 v3.0 落地清单按 P1-P10 排序

📌 叉车专项 · Direct Forklift RL

HMER · Tianjin 94.2% · Multi-Expert
天津大学 · 2026-01 · Semantic FSM + 3 专家 (Nav 1D-CNN / Pick ResNet / Place 倒数 reward) + BC→PPO · Gazebo 32 并行 · 与我们赛题完美对标 · 未开源
Toyota Visual Forklift 60% real
Toyota 中央研究所 · 2024-12 · Isaac Sim + PPO + ResNet 视觉 + Clothoid 参考轨迹 reward · 1/14 比例真机 zero-shot sim2real · 只做"接近托盘"未做抬升 · 未开源
ADAPT · AWARD H2020 outdoor · SLAM+AI
AIT + TU Wien · 2025-03 · 户外建筑工地叉车完整流程 · 非 RL:SLAM + AI 感知 + 经典规划 · 对比 20 年经验人类操作员 · 接近人类水平
Lang2Lift · AIT VLM 语言引导
2025-08 · Florence-2 + SAM-2 + FoundationPose · 部署在 ADAPT 平台 · 自然语言指定托盘 "pick the steel beam pallet near the crane" · 0.76 mIoU · 非 RL 但完整链路
Semi-Auto Vision Forklift YOLOv8/v11
2025-11 · Optuna 优化 + Pallet hole mapping · 单相机检测 pallet + 孔位 + 插入点估计 · 纯感知 可插入我们 pipeline 前端

🌲 类似长 horizon 任务参考 · Analogous RL Tasks

Log Loading · LUT 94% full cycle
LUT Finland · 2025-10 · 林业采伐机全流程 grab→lift→transport→drop · Isaac Gym + PPO + 分阶段独立 reward + Curriculum · 与叉车 pick-place 架构最相似
Wood-Log Grasping 96% · ICRA25
TU Wien · 2025-02 · MuJoCo + 8-DOF crane + curriculum RL · 从 CAD 建模到 velocity 控制器 · MuJoCo 参考实现
Hydraulic Handler · ETH IROS 24 · 12t 真机
ETH RSL + Liebherr · 2024-10 · RL + 数据驱动油缸动力学建模 · 自由摆动末端阻尼 · 达到熟练操作员水平 · 真机验证
Forestry Crane RL · Umeå 97% · IROS 21
Umeå Univ (Andersson) · 2021 · 6-DOF 液压曲臂 + 简单 curriculum + 能量优化 reward · 开山之作,本领域后续多数工作的起点

🔧 本地资源 · Local Cloned

ROS2-Forklift-Simulation ROS2 + Gazebo
完整 Gym 环境 + DDPG / PPO / HER · 4 种 reward (L2 / Nav / Collision / Binary) · 仅训导航到托盘,不含抬升/搬运 · 无预训练权重
IsaacSim-Autonomous-Forklift NVIDIA URDF
Isaac Sim + ROS · 官方 forklift_b URDF + 高保真 mesh + warehouse 场景 + 合成数据生成 · 主算法代码未开源

社区合集 · Curated Lists

本站 18 页只覆盖了 VLA 领域一部分。想第一时间看到新论文/新开源,直接 star 下面这几个 GitHub awesome-list(多数每周有新条目)—— 我们的讲解页会有滞后。

jonyzhang2023 / awesome-embodied-vla-va-vln 全谱最全
VLA + VLN 全谱模型 / 数据集 / benchmark · 按 Manipulation / Navigation / Grounding / Generation 分类 · 社区更新最活跃
miracle-techlink / awesome-vla-2026 meta-list
「awesome-list 的 awesome-list」· 聚合了 11 个 survey + 8 个 awesome list · 15 类去重分类 · 250+ 条精选
zchoi / Awesome-Embodied-Robotics-and-Agent 端到端
具身机器人学习端到端覆盖(模型 + 数据集 + benchmark + simulator)· 含中文注解 · 国内社区资源密度高
Denghaoyuan123 / Awesome-RL-VLA RL × VLA
强化学习和 VLA 的交叉:policy learning / reward learning / exploration / sim2real · 配对 survey 论文
Psi-Robot / Awesome-VLA-Papers 按 Tokenization 分类
按 Action Tokenization 方案分类(离散 token / 连续向量 / 混合)· 和本站「思路对照」四页正好对应
YuZhaoshu / Efficient-VLAs-Survey 推理优化
高效 VLA:模型压缩 / 推理优化 / 轻量级架构 · 关注 sub-1B 参数和端侧部署路线
Tsunami-kun / awesome-humanoid-manipulation 人形专深
人形 + 灵巧手 + 双臂操纵 · 想扩展到人形方向时的入口
keon / awesome-physical-ai 工具链
Physical AI 工具链 · 世界模型 / 模拟器 / sim2real / 数据集 · 侧重 infrastructure 而不只是论文

订阅建议:GitHub Watch → Releases only,或用 RSS 订阅 commits,新条目会自动提醒。star 数和最近提交时间以 GitHub 页面为准。

参考

arXiv 2605.30280
Qwen-VLA: Unifying VLA Modeling across Tasks, Environments, and Robot Embodiments
GitHub · QwenLM/Qwen-VLA
官方仓库 · 权重 / 推理脚本 / 复现指令
Hugging Face · Robotics
全部机器人数据集索引