← VLA Atlas

DOMINO 动态操纵 · 闭环 · 零样本

首个大规模动态物体操纵基准 · 35 任务 / 5 本体 / 117K 专家轨迹

DOMINO(arXiv 2603.15620 · 华中科技大学 & 华为诺亚方舟)填补了 VLA 领域的一个显著空缺:动态物体操纵。当前所有主流基准(LIBERO / RoboTwin / Bridge / DROID)都假设物体是静止的;DOMINO 的场景里物体在移动 —— 滚动的球、掉落的杯子、传送带上滑走的目标。

关键观察(论文摘要):主流 VLA 在静态任务上 44.8% 平均 SR,一旦移到动态场景(相同物体、加了一个初速度)直接掉到 7.5%。根因是单帧感知 + 无时间预测—— 观测到目标时它已经不在那里了。这是当前 VLA 一个被系统性忽视的缺陷。

Qwen-VLA 分数

26.6%
Zero-shot Success Rate · 未在 DOMINO 上做专门微调 · arXiv 2605.30280
对比:DOMINO 论文里配套的 PUMA 方法在 DOMINO@0.1 零样本 10.86%,微调后 17.20%。Qwen-VLA 反超说明其时间建模能力更强。

动机与设计

动态操纵需要三位一体:

  1. 快速感知—— 观测到目标时它已在移动
  2. 轨迹预测—— 需要估计目标未来 T 秒的位置
  3. 闭环控制—— 边走边调整,不能像静态那样开环 replay 一条轨迹

静态数据训练的策略学不到这三者,因为标签里的目标位置和视觉观测到的目标位置总是一致的 —— 模型永远见不到「观测的时候目标 A,动作到达时目标 B」的分布偏移。

DOMINO 通过两阶段时空同步的数据生成117K 条带时间戳的多视角轨迹落到 SAPIEN 物理仿真里,让 VLA 有可能学到「过去 N 帧观测 → 未来 M 帧目标位置」的时空推理。

规模

指标
专家轨迹117,000
动态任务数35
机器人本体5(单臂 → ALOHA-AgileX 双臂)
难度分档L1 恒速 / L2 非线性 / L3 随机扰动
底层仿真SAPIEN(与 RoboTwin 同底)
数据源RoboTwin 2.0 场景(复用) + 动态化生成
论文时间2026-03-16

动态任务分类

拦截 · Interception
接住抛出物体、在传送带上抓取滚动物体 · 考察运动学预测 + 延迟补偿
追踪 · Tracking
把物体放进移动中的箱子、跟踪滑动目标 · 考察实时闭环 + 速度匹配
递送 · Delivery
向移动接收者递物 · 考察对方运动预测
回避 · Avoidance
在移动干扰物间穿行 · 考察避碰规划

三级难度

Level运动模式典型难度
L1恒速直线运动(零曲率)预测简单 · 主要考察感知延迟
L2高阶非线性轨迹(抛物线 / 摆动)需要建物理模型或强 memory
L3随机扰动 + 突发速度变化纯反应式 · 逼近真实不确定性

数据格式

关键字段与静态数据集的差异:DOMINO 里 action_t 对应的目标状态state_{t+dt} 而不是 state_t—— 因为动作到达时目标已经移动。这个细节决定了 loss 函数需要考虑时移

PUMA · 论文配套方法

DOMINO 论文同时提出 PUMA(Predictive Unified Manipulation Architecture),核心 idea:

PUMA 是当前 DOMINO 上的参考基线之一。Qwen-VLA 无需 PUMA 的显式设计就能 zero-shot 26.6%,说明其时序建模在 backbone 层面就吃到了这个能力。

主流模型分数(DOMINO@0.1 zero-shot)

模型静态 SR动态 SR说明
标准 VLA baseline44.87.5论文引用 · 静态到动态崩塌
PUMA (zero-shot)10.86DOMINO 配套方法
PUMA (fine-tuned)17.20DOMINO 训练后
Qwen-VLA-Instruct26.6零样本 · 未训 DOMINO

DOMINO 是当前 VLA 领域公开分数普遍最低的基准。26.6% 已是「不错」,但离真机可用还差很远。这是研究前沿。

和 DROID / OXE / RH20T 的区别

DROID / OXE / RH20T 都是静态多任务广谱数据集,覆盖广度不错但目标全部静止。DOMINO 是首个专门针对运动目标设计闭环评估的基准,填补 VLA 在动态场景的空白。

反证结论:动态数据训练的模型跑静态任务不退步,说明动态操纵技能包含静态操纵。这是一个可以指导训练数据配方的重要发现 —— 动态数据是严格更强的监督信号。

常见误区 / 局限

相关工作

RoboTwin(同底层仿真)
静态双臂对照基准 · SAPIEN
DROID
真机静态操纵广谱数据集
Open X-Embodiment (OXE)
跨机构静态大混合
Qwen-VLA
在 DOMINO 上零样本 26.6%

参考链接

arXiv 2603.15620
Towards Generalizable Robotic Manipulation in Dynamic Environments · 2026-03
GitHub · H-EmbodVis/DOMINO
代码 + benchmark + PUMA 参考实现
Hugging Face · hzxie/DOM
DOM 数据集(DOMINO 底层数据)