← VLA Atlas

SmolVLA 450M · LIBERO 87.3% · 打赢 π₀ 3.3B

HuggingFace × Sorbonne · 单 GPU 训 · 消费级 GPU/CPU 部署 · Async 推理栈 · SO-100 / SO-101 消费级机械臂

SmolVLAarXiv 2506.01844)是 HuggingFace 官方 VLA 项目组的答卷 —— 做一个能装进 lerobot、跑在消费级硬件、社区数据能训、性能还不塌的小 VLA。450M 参数量(100M action expert),单 GPU 就能训。

关键突破:不但比 π₀(3.3B)小 ,在 LIBERO 上 87.3% vs π₀ 86.0%(同为 multi-task setting);Meta-World 上 57.3% vs π₀ 47.9%;真机 SO-100 上 78.3% vs π₀ 61.7%。同时用了异步推理栈把感知/动作预测和动作执行解耦,实际部署下 30% 更快、单位时间完成更多任务。

关键数字(论文 Table 2-3 口径)

BenchmarkSmolVLA 0.45Bπ₀ 3.3Bπ₀ PaligemmaOpenVLA 7B
LIBERO-Spatial90908784.7
LIBERO-Object96866388.4
LIBERO-Goal92958979.2
LIBERO-Long71734853.7
LIBERO avg87.386.071.876.5
Meta-World avg(50 任务)57.347.950.5
Meta-World Very Hard603044
Real SO-100 Pick-Place / Stack / Sort avg78.361.7

SmolVLA 0.24B / 0.45B / 2.25B 三种变体:0.24B 就已经打过 OpenVLA 7B,0.45B 是 sweet spot,2.25B 天花板更高但从 lerobot 部署考虑 0.45B 是官方推荐。

架构与训练配方

Async 推理:30% 更快、更多完成

Sync 模式:预测完整个 chunk 再执行;执行时不 sample。
Async 模式:动作执行和下一次预测并行,结果:

指标SyncAsync
Pick-Place 平均耗时(秒)13.759.70 (-30%)
60 秒时限内 pick-place 完成数919 (2.1×)
Sorting 任务 SR(%)7050

Async 在低复杂度反应快速任务(Pick-Place)显著好,但在需要精确规划的 Sorting 反而拖累 SR —— 这是 async 的 tradeoff。作者建议按任务性质选。

Ablation 深挖(论文 §4.7)

设计选择LIBERO avg
Cross-Attention 单用79.0
Self-Attention 单用74.5
CA + SA interleaved(default)85.5
Bidirectional attention on action tokens67.5
Causal self-attention on action tokens74.5
VLM 全部 32 层80.3
只用前 16 层(default)78.5
Skip 每 2 层75.5
Flow Matching80.25
Regression(L1)75.25
Action Chunk Size 150.0
Chunk 1084.0
Chunk 50(default)80.3
Chunk 10074.5

几个反直觉发现:(1) chunk size 10-50 是 sweet spot(100 反降);(2) N < L 层比"平均 skip"或"缩小 VLM"都好;(3) Flow matching 明确胜过 L1 regression(+5 points)。

预训练与多任务对比

PolicyVLA PretrainReal SO-100 Avg
SmolVLA (single-task 训练)No40.0
SmolVLA (multi-task, no pretrain)No51.7
SmolVLA (multi-task + community pretrain)Yes78.3

在 community-collected 数据上预训 → 提升 27 point;multi-task 训练 → 再提升 12 point。lerobot 社区数据集是 SmolVLA 能落地的先决条件

硬件适配(消费级机械臂)

SmolVLA 完全部署在 lerobot 生态里 —— 未来做端侧 VLA 的团队直接 pip install lerobot 就能用。

差异化定位

SmolVLA 是端侧 VLA分类的官方标杆:

它证明了一件事:你不需要 3B+ VLA 才能刷 LIBERO SOTA;架构设计和预训练配方比堆参数更关键。

相关

ACT · Action Chunking
SmolVLA chunk size = 50 沿用 ACT 思路
Flow Matching
SmolVLA 用的 action head 目标
π₀(对照 · 被超越)
同为 flow matching,SmolVLA 用 1/7 参数超过
lerobot(部署栈)
SmolVLA 官方集成的机器人栈

参考链接

arXiv 2506.01844
SmolVLA: Affordable and Efficient Robotics · 2025-06-02
HuggingFace 博客
官方博客介绍(页面地址请核实)