← VLA Atlas

EvoVLA Self-Evolving · Discoverse-L 69.2 · Stage Hallucination -23.7pp

北大 Hao Tang 组 · ECCV 2026 · 首个诊断并系统化解决 VLA "stage hallucination" 的 self-evolving 框架 · 开源

EvoVLAarXiv 2511.16166, ECCV 2026)来自北大 Hao Tang 组,直击当前 VLA 长时任务的一个隐蔽缺陷:Stage Hallucination—— 模型学会利用粗粒度评估信号抄近路,报告高进度但实际上没完成多阶段任务。

EvoVLA 提出self-supervised 三件套直接对抗这个问题:

  1. Stage-Aligned Reward (SAR):用 triplet contrastive learning + Gemini 生成的 hard negatives,阻止视觉短路
  2. Pose-Based Object Exploration (POE):把好奇心 grounding 在相对 gripper-object pose上,而非 raw pixels
  3. Long-Horizon Memory:selective context retention + gated fusion,稳定长时 rollout 的内在 shaping

项目页 aigeeksgroup.github.io/EvoVLA,代码 GitHub

关键数字(论文摘要口径)

指标EvoVLAOpenVLA-OFTΔ
Discoverse-L 平均成功率69.2%59.0%+10.2 pp
Stage Hallucination(越低越好)14.8%38.5%-23.7 pp
Sample Efficiency1.5×1.0×+50%
真机 4 任务平均54.6%43.6%+11 pp

Stage Hallucination 从 38.5% → 14.8%(降到 baseline 的 38%)是最有说服力的指标 —— 这意味着 EvoVLA 学到了真的完成多阶段任务,而不是"看起来完成"。

什么是 Stage Hallucination

长时任务通常有多个 stage(比如"打开抽屉 → 拿物体 → 关抽屉")。传统 VLA 训练用粗粒度 evaluation signal(最终成功 / 失败)+ RL/BC 的 dense reward,这会诱导:

作者的观察:OpenVLA-OFT 的 stage hallucination 达 38.5%—— 相当于每 3 次 rollout 就有 1 次是"假完成"。这是长时 VLA 一个被系统性忽视的缺陷。

三个组件详解

1) Stage-Aligned Reward (SAR) —— 用 Gemini 生成 hard negatives

2) Pose-Based Object Exploration (POE) —— 好奇心接地气

3) Long-Horizon Memory —— Context Selection + Gated Fusion

差异化定位

EvoVLA 是"Self-Evolving VLA"路线在 2025-2026 最有说服力的开源代表:

Stage hallucination 是一个已经存在但没被认真讨论的问题 —— 你 fine-tune 一个 VLA 到看起来 90% 成功率,但 sim2real 到 40%,可能就是 stage hallucination 在作祟。EvoVLA 是这方面的第一个正面攻击。

Discoverse-L Benchmark(作者提出)

EvoVLA 顺带贡献了 Discoverse-L benchmark:3 个 multi-stage 长时操纵任务,专门测量 stage hallucination 率。让"看起来成功但没真做"的模型无处遁形。

这是社区目前唯一直接测量 stage hallucination 的 benchmark —— 如果做 self-evolving 或 long-horizon VLA,会经常被 cite。

Sim-to-Real 迁移

作者在真机上跑了 4 个操纵任务:

相关

MemER(Memory 路线对比)
显式 keyframe 检索 · EvoVLA 走 self-supervised gated fusion
NORA-1.5(后训练路线对比)
用 DPO + WM reward 后训练 · EvoVLA 用 SAR contrastive + POE curiosity
ThinkAct
用 GRPO RL 训 reasoning · EvoVLA 用 self-supervised 训 action
OpenVLA-OFT(被超越对象)
Discoverse-L 59.0 → EvoVLA 69.2

参考链接

arXiv 2511.16166
EvoVLA: Self-Evolving Vision-Language-Action Model · 2025-11-20 · ECCV 2026
GitHub · AIGeeksGroup/EvoVLA
代码开源
项目页 · aigeeksgroup.github.io/EvoVLA
演示 + 可视化