← VLA Atlas

R2R VLN · Matterport3D · 英语

Room-to-Room · 首个真实室内环境的视觉-语言导航基准(CVPR 2018)

R2R(Anderson et al. CVPR 2018)第一次把「跟着自然语言在真实室内建筑里走路」变成一个可评测的任务。基于 Matterport3D 90 个真实建筑扫描,把每个环境的可行 viewpoint 组织成图,智能体只能在图上走或用 stop 动作停下。

R2R 之后的 VLN 系列(Touchdown / REVERIE / RxR / VLN-CE …)都继承这套「离散图 + 全景观测 + 自然语言指令」的框架。R2R 是 VLN 领域最重要的基线,几乎所有导航 VLA 的必测项。距今已 8 年,但至今没有任何模型在 R2R Val-Unseen 上"打饱和"——即使强如 Qwen-VLA 的 69% OSR,离人类 86%+ 仍有明显差距。

Qwen-VLA 分数

69.0%
OSR(Oracle Success Rate)· Val-Unseen split
OSR 允许 agent 在轨迹上任何时刻算到达(更宽松),SR 只算最终 stop 位置。SR 通常比 OSR 低 5-15 个点。

发展史 · 从简单 VQA 到室内导航

2017 年 Peter Anderson 团队(澳国立 & Adelaide)的动机:

  1. 当时 VQA 已经卷到接近饱和(VQA v2 top 模型 > 70%),但都是"看一张图回答一句",缺动作维度
  2. 已有的导航任务(如 gym 里的 Reacher)都是低维网格世界,缺视觉复杂度
  3. Matterport3D 数据集刚发布,给了 90 栋建筑的稠密扫描 · 现成的真实室内场景

Anderson 把这三个元素拼起来 —— 让人类标注者对 Matterport3D 里的一条路径写一句自然语言指令,就得到了 R2R。这一手直接开启了 VLN(Vision-and-Language Navigation)子领域。

2020 年之后 R2R 又被 R2R-CE(continuous env、不是图)与 R2R-Habitat(用 Habitat 仿真器加速)扩展,Qwen-VLA 报告的是原始离散图版

规模

指标
导航指令总数21,567
轨迹数7,189
真实建筑环境90(Matterport3D)
全景 viewpoint10,800(RGB-D 稠密采样)
平均指令长度29 词
标注者Amazon Mechanical Turk · 3 条 / 轨迹

任务定义

智能体从起点 viewpoint 出发,按自然语言指令走到目标 viewpoint。每一步动作只能:

观测:每步给 36 × 224 × 224 RGB 全景(36 个 30° 视角切片),或者按视线方向切出 pano tile。

不允许穿墙、不允许跨图跳跃。当 stop 位置距离目标 < 3m(原版协议)判定 SR = 1。

数据切分

Train 61 环境
14025 条指令 · 已见建筑物 · 训练策略
Val-Seen 61 环境
1020 条指令 · 已见建筑物中的新轨迹 · 环境已知的难度
Val-Unseen 11 环境
2349 条指令 · 未见建筑物 · 主评测 split · 环境新颖性挑战
Test 18 环境
4173 条指令 · 未见 · 目标不公开 · EvalAI 服务器打分

评测指标

缩写全称含义范围
SRSuccess Rateagent 主动 stop 且距目标 < 3m 的比例[0,1]
OSROracle Success Rate轨迹上任一时刻曾经 < 3m 的比例(宽松版)[0,1]
SPLSuccess weighted by Path LengthSR × (最短路径 / 实际路径),兼顾效率[0,1]
nDTWnormalized Dynamic Time Warpingagent 轨迹与参考轨迹的形状相似度[0,1]
NENavigation Erroragent 停止位置到目标的欧氏距离[0m, ∞)

主流报告顺序:SR / SPL / nDTW(严格)→ OSR(宽松参考)→ NE(回归诊断)。当模型只报 OSR 不报 SR 时要注意:这可能在掩盖模型"走对了但没停下"的问题。

典型指令示例

Head upstairs and walk past the piano through an
archway directly in front. Turn right when the hallway
ends at pictures and table. Wait by the moose antlers
hanging on the wall.

意译:上楼,从正前方的拱门经过钢琴。走廊在装饰画和桌子处右转,在挂着驼鹿鹿角的墙旁停下。

Go to the living room and find the chair
that has a view of the television.

意译:前往客厅,找到能看到电视的那把椅子。

R2R 指令风格:命令式 · 平均 29 词 · 混合方向(left/right)+ 参照物(piano/moose antlers)+ 停止信号(stop / wait)。相比 RxR 的 78 词长指令,R2R 的短指令对关键词提取要求更高。

主流模型分数(Val-Unseen)

模型SROSRSPL说明
Seq2Seq(原论文 baseline)21.828.418.0CVPR 2018
PREVALENT5765532020 · 预训练 VLN backbone
HAMT65.773.261.52021 · 历史建模 transformer
DUET72.781.460.42022 · 双分支结构
Qwen-VLA-Instruct69.02026 · 通用 VLA 兼做导航
人类上限86.489.576.1原论文标注者相互评

Qwen-VLA 用 OSR 69% 打过 PREVALENT 但没到 DUET/HAMT 的水平——这是通用 VLA 兼职导航的典型表现:不专精但可控。VLN 专项模型仍有明显优势。

常见误区 / 局限

和 RxR 的关系 · 和其他 VLN 的关系

RxR 是 R2R 的多语言 & 长指令扩展:把 21K 条 29 词的英文指令扩到 126K 条 78 词的英/印地/泰卢固三语指令,并额外记录了标注者按指令实际走出的 follower path。基础任务框架和评测指标继承 R2R。

相关工作

RxR
多语言 · 长指令 · 双路径
Matterport3D
底层 90 建筑 3D 扫描
Habitat
Facebook AI · 连续动作版 R2R 的仿真基础

参考链接

项目主页
bringmeaspoon.org
arXiv 1711.07280
Vision-and-Language Navigation · Anderson et al. CVPR 2018
GitHub · Matterport3DSimulator
peteanderson80 · 官方仿真器
EvalAI 评估服务器
Test split 打分入口