← VLA Atlas

ACT · Action Chunking Transformer Encoder-Decoder · CVAE · Temporal Ensembling

一次预测多步动作 + 建模多模态分布 · VLA 时代的标准动作策略基线

ACT (Action Chunking with Transformers) 是 Zhao et al. 在 2023 年提出的动作策略方法,核心观点很简洁:与其每个时步只预测下一步,不如让 Transformer 一次预测接下来 K 步的整个动作 chunk。这样既能用 Transformer 自回归输出的强表达力建模动作序列的时序依赖,又能通过"一次决策多步"来缓解模仿学习里的累积误差问题。

ACT 于 2023 年作为 ALOHA 论文(arXiv 2304.13705)的一部分发布,并迅速成为后续 VLA 的事实标准 —— 从 π₀ 到 OpenVLA 再到 Qwen-VLA,几乎所有主流 VLA 都采纳了「action chunking」这个输出接口。它不是语言模型,也不需要外部语言知识,但在「怎样把连续动作接到 VLM 上」这个问题上定义了一条关键的技术路线。

为什么需要 Action Chunking?—— 三个问题

问题 1:模仿学习的累积误差

传统策略网络在训练时吃的都是"正确"的前置状态(人类演示的状态序列),但部署时一旦动作有偏,后续状态就偏离分布了 —— 这叫 distributional shiftcompounding error。误差随时间步 t 呈平方增长 O(T²)

一次预测 K 步而不是一步,相当于把决策间隔从 dt 拉长到 K·dt,累积误差变成 O((T/K)²) —— 即便网络不完美,整个轨迹也能撑得更久。

问题 2:机器人动作的多模态分布

同一个观测状态下,人类可以有多种「正确」的动作选择。比如拿一个物体,可以从左边拿、从右边拿,夹力可以轻可以紧 —— 都能完成任务。如果用 L2 loss 直接回归期望动作,网络会平均这些模式,输出的往往是"既不左也不右"的模糊动作,导致执行失败。

ACT 用条件 VAE (Conditional Variational Autoencoder) 来处理这个问题:encoder 把人类的完整 K 步动作 chunk 编码成一个隐向量(capture 其"风格"),decoder 在推理时可以从这个分布采样(引入随机性),从而能表达多模态的决策。

问题 3:动作序列的时序一致性

K 步动作不是独立的 K 个点,而是一条连贯的轨迹。Transformer decoder 通过自回归(每一步都能看到前面的预测结果)天然地建模这种时序依赖,输出的动作序列更平滑、更"人类"。

核心机制

1. Action Chunking:一次预测 K 步

模型的输出不是单个动作,而是一个向量序列 [a_t, a_{t+1}, ..., a_{t+K-1}]。在 ALOHA 论文的实现中,K = 100,采样频率 50 Hz,相当于预测 2 秒的动作。

推理时每一步(或每 M 步)都新生成一整个 chunk,然后融合预测(见下面的 Temporal Ensembling)。

2. Encoder-Decoder Transformer

Encoder:吃观测(图像特征 + 关节角度),输出中间表示。

Decoder:自回归式输出 K 步动作。在推理时,前几步的输出依赖 encoder 的输出和前面步骤的动作;后面的步骤逐步依赖更多的"自己预测的上文"。

3. Conditional VAE:建模多模态

训练时:

推理时:

这让模型能到数据中的多模态,也能在推理时表达多模态,而不是坍缩到平均值。

4. Temporal Ensembling:融合重叠预测

推理的典型流程:

  1. 当前帧生成 chunk [a_t, a_{t+1}, ..., a_{t+K-1}]
  2. 执行 a_t(或前几步 a_t, a_{t+1}, ...),观测结果更新
  3. 下一个时步(或下 M 步)再生成一个新的 chunk
  4. 新 chunk 和旧 chunk 在时间上有重叠 —— 用指数加权融合重叠部分

这样可以:

与其他动作策略的对比

维度 ACT (本页) Diffusion Policy Flow Matching Discrete Action Token
动作表示 连续向量 连续向量 (+ 噪声) 连续向量 (+ ODE flow) 离散 token (自回归)
多模态建模 CVAE 采样 去噪扩散固有多模态 流匹配固有多模态 多头输出或采样
网络结构 Encoder-Decoder Transformer U-Net / DiT Transformer / DiT Transformer (LLM-like)
推理成本 单次前向 (K 步) 多步去噪 (50-100 步) 多步积分 (10-30 步) 自回归生成 (K tokens)
代表工作 ALOHA / Mobile ALOHA Diffusion Policy / GR00T Qwen-VLA / π₀ RT-2 / OpenVLA

技术细节 —— ALOHA 论文里的配置

模型规格

训练配置

推理(Temporal Ensembling 细节)

局限与取舍

后续工作与影响

直接继承 ACT 的工作

启发其它 VLA 的概念

对比与未解决的问题

关键论文与开源资源

arXiv 2304.13705
Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware · 原始 ACT 论文(Zhao et al. 2023)
ALOHA 项目页
完整硬件 BOM · 训练脚本 · 演示视频
GitHub · act
原始 ACT 实现 · 基于 PyTorch · ALOHA 配置
LeRobot · Hugging Face
ACT-based 训练框架 · 多平台支持 · lerobot/aloha_* 任务数据集
对照页 · ALOHA
ALOHA 硬件平台与 ACT 的结合案例
对照页 · Qwen-VLA
现代 VLA 如何改进 action chunking 思想

为什么仍然重要?

ACT 论文发布于 2023 年 4 月,距今已有 3 年,但「action chunking」作为动作输出接口的概念仍然是标准配置。原因有几个:

即便现在的 π₀、Qwen-VLA 等选择了 flow matching 而非 CVAE,它们仍然保留了 chunk 预测(通常 K=32-64),这正是 ACT 的核心思想的延续。