NORA-1.5 LIBERO 95.0% · SimplerEnv VM 82.8% · 真机 +46 vs π₀
NTU 新加坡 declare-lab · Flow matching action expert + World-Model reward + DPO 后训练 · 首个成熟 DPO for VLA 方案
NORA-1.5(arXiv 2511.14659)从两个角度改 NORA 基座:
- 架构升级:在 NORA 自回归 backbone 后加 flow-matching action expert,单这一步就持续超各 SOTA VLA
- Reward-driven post-training:造两类 reward — (a) action-conditioned world model 判断动作是否走向目标(WM reward);(b) 相对 ground-truth 的偏差启发式(GTA reward)。用它们组 preference 数据集,跑 DPO 对齐 policy
NORA-1.5 是首个把 DPO 训练用自动 preference 落到 VLA 的开源工作 —— 从而不用人标 preference pair。
SimplerEnv Visual Matching 主结果(论文 Table 1)
| Model | Pick Coke | Move Near | Drawer | Avg |
|---|---|---|---|---|
| OpenVLA | 16.3 | 46.2 | 35.6 | 27.7 |
| π₀ (fine-tuned) | 72.7 | 65.3 | 38.3 | 58.7 |
| π₀-FAST (fine-tuned) | 75.3 | 67.5 | 42.9 | 61.9 |
| SpatialVLA (fine-tuned) | 86.0 | 77.9 | 57.4 | 73.7 |
| MolmoAct (fine-tuned) | 77.7 | 77.1 | 60.0 | 71.6 |
| NORA-1.5 (SFT) | 92.8 | 78.7 | 62.2 | 77.9 |
| NORA-1.5 (DPO) | 94.0 | 88.0 | 66.4 | 82.8 |
SimplerEnv Variant Aggregation(论文 Table 1)
| Model | Pick Coke | Move Near | Drawer | Avg |
|---|---|---|---|---|
| SpatialVLA (fine-tuned) | 88.0 | 72.7 | 41.8 | 67.5 |
| MolmoAct (fine-tuned) | 76.1 | 61.3 | 78.8 | 72.1 |
| NORA-1.5 (DPO) | 92.6 | 79.0 | 44.1 | 71.9 |
LIBERO(论文 Table 2)
| Model | Spatial | Object | Goal | Long | Avg |
|---|---|---|---|---|---|
| OpenVLA | 84.7 | 88.4 | 79.2 | 53.7 | 76.5 |
| π₀-FAST | 96.4 | 96.8 | 88.6 | 60.2 | 85.5 |
| π₀ | 96.8 | 98.8 | 95.8 | 85.2 | 94.2 |
| ThinkAct | 88.3 | 91.4 | 87.1 | 70.9 | 84.4 |
| NORA-1.5 (SFT) | 97.3 | 96.4 | 94.5 | 89.6 | 94.5 |
| NORA-1.5 (DPO) | 98.0 | 96.0 | 95.4 | 90.5 | 95.0 |
真机 Galaxea A1(论文 Table 3,9 任务)—— NORA-1.5 打过 π₀ 46 point
| Model | Part. Succ. | Distractor 抓错 ↓ | Success |
|---|---|---|---|
| π₀ (3.3B) | 44.44% | 68.33% | 25.55% |
| NORA (3B) | 73.3% | 13.3% | 58.88% |
| NORA-1.5-FAST (3.3B) | 78.88% | 15.00% | 71.11% |
Galaxea A1 是"不在预训数据集里"的机器人 —— 测的是跨机型泛化。三类任务:Put U in U(3 个)· Put U in S with distractor(3 个)· Move U to U with distractor(3 个)。NORA-1.5 相对 π₀ 提升 46 point,且 distractor 抓错率降 53 point。
DPO Reward 消融(论文 Table 4)—— WM + GTA 组合最好
| Reward Strategy | SimplerEnv VM Avg | SimplerEnv VA Avg |
|---|---|---|
| SFT baseline(无 DPO) | 77.9 | 70.7 |
| WM (endgoal) only | 76.4 | 72.5 |
| WM (subgoal) only | 78.7 | 72.2 |
| GTA only | 81.2 | 72.5 |
| WM (endgoal) + GTA | 82.8 | 71.9 |
| WM (subgoal) + GTA | 79.0 | 73.0 |
观察:(1) WM (endgoal) 单用会在 Move Near 掉性能(不理解安全约束);(2) GTA 单用好但对"pick coke can"不 fit;(3) 组合 WM + GTA 最稳定;(4) WM (subgoal) 比 WM (endgoal) 更抗视觉变化(VA 上表现更好) —— 因为 subgoal 帧更近、变化更小、信号更清晰。
DPO 让 Gripper 轨迹变漂亮
论文 Fig 3 展示:DPO 前的 gripper 有大量 fixation 和 zigzag;DPO 后 trajectory 平滑很多。数量上:
- DPO 前:平均 9.7 action chunks 到目标
- DPO 后:平均 7.0 action chunks 到目标(少 28%)
说明 DPO 不仅提高成功率,还让动作策略本身更高效。
关键工程发现
- Flow matching > FAST tokenizer(论文 Fig 2):NORA-1.5 用 flow matching 一致超 NORA-1.5-FAST。这与 π₀.₅ 论文里"flow matching 是为加速而非性能"的说法相反 —— 在 declare-lab 的实验里 flow matching 也带来性能。作者解释:flow matching expert 和 AR VLA 互相受益,前者用 VLA 的丰富表征、后者从 expert 得到梯度反馈
- 小数据 <-> flow matching:真机 Galaxea A1 只有 50K 帧数据 —— 这时 FAST autoregressive 反而更好;flow matching 需要更多数据(论文原文推测)
- DPO 主要提升点:Correct object grasping +11%,wrong distractor grasping -4%;unseen tasks +15-16% 提升最大
- WM 生成子目标 image 用于 DPO reward:这一步的视频生成质量决定 reward 质量。作者观察长期目标图(endgoal)比子目标图(subgoal)更"抖"
差异化定位
NORA-1.5 是把 alignment 引入 VLA最完整的开源代表:
- vs 纯监督 VLA(π₀ / OpenVLA / SpatialVLA):他们全是 imitation learning,没有 preference-based 微调环节
- vs GR-RL 等 RL 路线:GR-RL 走 online PPO/GRPO 路线,NORA-1.5 走 offline DPO + WM auto-reward,工程量小很多
- vs ThinkAct:ThinkAct 用 GRPO 做 reasoning 的 RL,NORA-1.5 用 DPO 做 action policy 的 alignment
DPO for VLA 这条线还很新,NORA-1.5 是第一个能 reproduce 的开源实现,值得研究。