DOMINO 动态操纵 · 闭环 · 零样本
首个大规模动态物体操纵基准 · 35 任务 / 5 本体 / 117K 专家轨迹
DOMINO(arXiv 2603.15620 · 华中科技大学 & 华为诺亚方舟)填补了 VLA 领域的一个显著空缺:动态物体操纵。当前所有主流基准(LIBERO / RoboTwin / Bridge / DROID)都假设物体是静止的;DOMINO 的场景里物体在移动 —— 滚动的球、掉落的杯子、传送带上滑走的目标。
关键观察(论文摘要):主流 VLA 在静态任务上 44.8% 平均 SR,一旦移到动态场景(相同物体、加了一个初速度)直接掉到 7.5%。根因是单帧感知 + 无时间预测—— 观测到目标时它已经不在那里了。这是当前 VLA 一个被系统性忽视的缺陷。
Qwen-VLA 分数
对比:DOMINO 论文里配套的 PUMA 方法在 DOMINO@0.1 零样本
10.86%,微调后 17.20%。Qwen-VLA 反超说明其时间建模能力更强。
动机与设计
动态操纵需要三位一体:
- 快速感知—— 观测到目标时它已在移动
- 轨迹预测—— 需要估计目标未来
T秒的位置 - 闭环控制—— 边走边调整,不能像静态那样开环 replay 一条轨迹
静态数据训练的策略学不到这三者,因为标签里的目标位置和视觉观测到的目标位置总是一致的 —— 模型永远见不到「观测的时候目标 A,动作到达时目标 B」的分布偏移。
DOMINO 通过两阶段时空同步的数据生成把 117K 条带时间戳的多视角轨迹落到 SAPIEN 物理仿真里,让 VLA 有可能学到「过去 N 帧观测 → 未来 M 帧目标位置」的时空推理。
规模
| 指标 | 值 |
|---|---|
| 专家轨迹 | 117,000 |
| 动态任务数 | 35 |
| 机器人本体 | 5(单臂 → ALOHA-AgileX 双臂) |
| 难度分档 | L1 恒速 / L2 非线性 / L3 随机扰动 |
| 底层仿真 | SAPIEN(与 RoboTwin 同底) |
| 数据源 | RoboTwin 2.0 场景(复用) + 动态化生成 |
| 论文时间 | 2026-03-16 |
动态任务分类
三级难度
| Level | 运动模式 | 典型难度 |
|---|---|---|
| L1 | 恒速直线运动(零曲率) | 预测简单 · 主要考察感知延迟 |
| L2 | 高阶非线性轨迹(抛物线 / 摆动) | 需要建物理模型或强 memory |
| L3 | 随机扰动 + 突发速度变化 | 纯反应式 · 逼近真实不确定性 |
数据格式
- 多视角 RGB:
head+wrist同步采集 - 本体感受:双臂关节角度 + 末端执行器(eef)位姿
- 存储:HDF5(JPEG 编码 RGB + joint actions + eef poses + 可选深度/点云)
- 时间对齐:多视角帧间
stride = 4采样,隐式同步 - 可转换格式:ALOHA HDF5 / LeRobot v3.0
关键字段与静态数据集的差异:DOMINO 里 action_t 对应的目标状态是 state_{t+dt} 而不是 state_t—— 因为动作到达时目标已经移动。这个细节决定了 loss 函数需要考虑时移。
PUMA · 论文配套方法
DOMINO 论文同时提出 PUMA(Predictive Unified Manipulation Architecture),核心 idea:
- 融合历史光流—— 让模型看到运动方向
- 对象中心的预测查询—— 显式建模「目标
k步后在哪」 - 在 DOMINO 上相比基线提升
+6.3%SR
PUMA 是当前 DOMINO 上的参考基线之一。Qwen-VLA 无需 PUMA 的显式设计就能 zero-shot 26.6%,说明其时序建模在 backbone 层面就吃到了这个能力。
主流模型分数(DOMINO@0.1 zero-shot)
| 模型 | 静态 SR | 动态 SR | 说明 |
|---|---|---|---|
| 标准 VLA baseline | 44.8 | 7.5 | 论文引用 · 静态到动态崩塌 |
| PUMA (zero-shot) | — | 10.86 | DOMINO 配套方法 |
| PUMA (fine-tuned) | — | 17.20 | DOMINO 训练后 |
| Qwen-VLA-Instruct | — | 26.6 | 零样本 · 未训 DOMINO |
DOMINO 是当前 VLA 领域公开分数普遍最低的基准。26.6% 已是「不错」,但离真机可用还差很远。这是研究前沿。
和 DROID / OXE / RH20T 的区别
DROID / OXE / RH20T 都是静态多任务广谱数据集,覆盖广度不错但目标全部静止。DOMINO 是首个专门针对运动目标设计闭环评估的基准,填补 VLA 在动态场景的空白。
反证结论:动态数据训练的模型跑静态任务不退步,说明动态操纵技能包含静态操纵。这是一个可以指导训练数据配方的重要发现 —— 动态数据是严格更强的监督信号。
常见误区 / 局限
- DOMINO ≠ DOM:Hugging Face 上的
hzxie/DOM是 DOMINO 底层数据集,规模较小;DOMINO 是整套基准,含 benchmark 定义。 - 零样本口径 < 微调:Qwen-VLA 26.6% 是 zero-shot · 如果允许微调应能到 40%+,但论文没报
- 只有仿真:DOMINO 目前只在 SAPIEN 里 · 真机动态操纵评测尚无标准基准
- 论文数字有些歧义:2800+ 场景 / 206 物体等数字来自底层 RoboTwin 2.0,不属于 DOMINO 独有
- 发展早期:2026-03 才发布 · 社区还没有形成稳定的 leaderboard · Qwen-VLA 报告的分数目前是主要参考