LIBERO 仿真 · 单臂 · 终身学习
终身机器人学习知识迁移基准 · 130 任务四子集递进 · Panda 单臂
LIBERO(Liu et al. NeurIPS 2023 Track on Datasets and Benchmarks)由 UT Austin、卡内基梅隆、Google Research 等联合提出,全称 Lifelong Robot Learning Benchmark。它用 Franka Panda 单臂在 RoboSuite / MuJoCo 仿真里跑 130 个操纵任务,四个子集 Spatial / Object / Goal / Long 各自考察一种知识迁移能力 —— 空间推理、物体操纵、目标条件、长程复合,让研究者能隔离研究不同类型的终身学习。
它是当下 VLA 论文最常见的操纵基线之一:π₀ / OpenVLA / Octo / X-VLA / RDT / GR00T N1 等模型都例行公事要跑这张表。对 LIBERO 打不高的模型,很难说服人相信它在真机上会好。
Qwen-VLA 分数
对比参考:OpenVLA (7B, LoRA)
76.5% · Octo 75.1% · Diffusion Policy from scratch 72.4%
发展史 · 为什么会有 LIBERO
LIBERO 之前,机器人操纵仿真基准的主流是 Meta-World (2019) 和 RLBench (2020) —— 前者聚焦 meta-RL,后者聚焦多任务模仿,都不是为「终身学习」设计的。终身学习最要命的是灾难性遗忘与知识迁移:学了新任务旧任务能否记得住?旧知识能否让新任务学得快?
Liu 团队观察到,如果基准的任务之间同时改变了很多变量(物体、场景、目标全变),研究者根本没法判断到底是哪个变量导致的迁移失败。LIBERO 的核心贡献就是把变量拆开:四个子集之间只在一个维度上变化,研究者能像做消融那样精确定位问题。
这一点让 LIBERO 成为 VLA 时代的默认表 —— 一次跑完就能报告「我这个模型在 空间推理/物体识别/目标切换/长程规划 四种能力上分别表现如何」。
规模
| 指标 | 值 |
|---|---|
| 任务总数 | 130(4 子集) |
| Episode 数(LeRobot 转换版) | 1,693 |
| 帧数(LeRobot 转换版) | 273,465 |
| 控制频率 | 10 Hz |
| 图像分辨率 | 256 × 256 RGB |
| 动作维度 | 7(6 关节 + 夹爪) |
| 平均 Episode 长度 | 约 162 帧 / 16 秒 |
| 物理引擎 | MuJoCo(via RoboSuite) |
| 许可证 | MIT |
Hugging Face LeRobot 版把 130 任务聚合成 40 组以适配统一格式;原始论文 130 tasks。当你在训练里看到"40 tasks"字样,通常是指 LeRobot 版本。
机器人本体 · Franka Panda 单臂
- 本体:Franka Emika Panda · 6 关节位置控制 + 1 维平行夹爪开度 · 工作半径约 0.855 m
- 相机 A · 第三人称:工作台侧面俯视,覆盖整个操作区域
- 相机 B · 腕部:夹爪上方固定,提供抓取细节视角
- 两路输出均为
256 × 256 × 3RGB · 10 Hz 同步 - proprioception:7 维关节位置 + 夹爪开度
数据采集流程
LIBERO 的数据不是遥操作也不是纯 RL,而是专家规划 + 脚本演示:
- 对每个任务,人工编写 procedural demonstration script(用 waypoint 序列 + 抓取时机脚本)
- 在 RoboSuite / MuJoCo 里跑脚本,每个任务采集约 50 条 successful trajectories
- 轨迹经 IK 转成关节位置控制信号,记录
obs / action / reward / done
这种方式的优势是 demonstrations 高质量(100% 成功且轨迹平滑),劣势是缺少人类演示的自然噪声 —— 学到的策略在真机上可能对小扰动不鲁棒。这也是为什么 π₀ 类模型会额外做真机 fine-tune。
四子集含义
Spatial/Object/Goal 三档每档 10 任务,共 30 任务;LIBERO-10 加 10 任务。合起来基础版只有 40 任务。剩下的 90 任务是LIBERO-90(分布式多任务预训练用),不参与主评测。
典型任务示例
- put the black bowl on the plate Spatial —— 理解碗与盘子的相对位置关系并准确摆放
- put the alphabet soup in the basket Object —— 从桌上多种罐头里正确识别 alphabet soup(不是 tomato sauce)
- open the middle drawer of the cabinet Goal —— 分辨 top / middle / bottom 三个抽屉
- put both the alphabet soup and the cream cheese box in the basket LIBERO-10 —— 顺序识别两个物体 + 顺序放入,考察多步决策
官方样例图
评测指标详解
Success Rate (SR):一条 rollout 是否达成任务目标状态。目标状态由每个任务的 termination_conditions 定义,例如「碗的 z 坐标在盘子 z 坐标之上且 xy 距离 < 阈值」。
官方评测协议:每个任务跑 50 rollouts × 3 seeds,报告平均 SR ± std。总共 40 tasks × 150 rollouts = 6000 rollouts。
子集平均口径:Qwen-VLA 报告的 97.9% 是四子集分别算平均后再算大平均,即 (Spatial + Object + Goal + LIBERO-10) / 4,而不是把 6000 rollouts 拍平算。这两种口径分数会不同。
主流模型分数对照
| 模型 | Spatial | Object | Goal | Long | Avg |
|---|---|---|---|---|---|
| Diffusion Policy (scratch) | 78.3 | 92.5 | 68.3 | 50.5 | 72.4 |
| Octo (fine-tuned) | 78.9 | 85.7 | 84.6 | 51.1 | 75.1 |
| OpenVLA-7B (LoRA) | 84.7 | 88.4 | 79.2 | 53.7 | 76.5 |
| Qwen-VLA-Instruct | - | 97.9 | |||
来源:OpenVLA / Octo 论文里的官方 LIBERO 表。Qwen-VLA 论文摘要只报了 Avg 97.9%,未公开分子项分数。
常见误区 / 数据集局限
- 不测真机可迁移性:LIBERO 里的 Panda 是 MuJoCo 版,抓取动力学与真实 Panda 有差距。LIBERO 高分不代表真机好。想验真机要看 ALOHA / Bridge / DROID 系列。
- 物体种类相对有限:物体来自 RoboSuite 内置资产 + 少量 3D 扫描 · 现实中每台厨房里的物体多样性远超此。
- 脚本演示 → 分布 overfit:因为演示轨迹是脚本生成的,同一任务多条 rollout 几乎重合。模型可能过度依赖初始物体位置的固定分布。
- LIBERO-10 长任务实际长度中等:命名叫 Long,其实 3-5 个子步骤,比现实家务任务(10+ 步)短很多。
- 饱和线:当前主流 VLA 在 Spatial/Object/Goal 上已经能到 90%+,Long 仍是 50-70%。新模型如果 Long 没显著提升,就说明它没解决长程规划问题。