← VLA Atlas

RLDX-1 LIBERO 97.8 · ALLEX Object-in-Box 91.7 · Spin Tracking 97.9

RLWRLD · Multi-Stream Action Transformer · 补齐 VLA 三大功能盲区:motion awareness / long-term memory / physical sensing · 完全开源

RLDX-1arXiv 2605.03269)是韩国团队 RLWRLD 2026-05 发布的 humanoid 灵巧操纵基础模型(68 作者)。它抓住了当前主流 VLA 的三个盲区并给出统一解决方案:

  1. Motion Awareness:对移动物体、变速目标能预测轨迹
  2. Long-Term Memory:跨时间步保留观察,做依赖历史的推理
  3. Physical Sensing:融合触觉 / 关节力矩,做接触密集操纵

架构核心是 MSAT (Multi-Stream Action Transformer) —— 异构模态各有独立 stream,通过 cross-modal joint self-attention 融合。完全开源GitHub + 3 个 HuggingFace 权重(RLDX-1-PT · MT-DROID · MT-ALLEX)。

关键数字(论文 Table 1 · 仿真)

BenchmarkRLDX-1π₀.₅GR00T N1.6π₀-FAST
LIBERO Short (S/G/O)98.698.097.493.9
LIBERO Long95.392.094.460.2
LIBERO Avg97.896.996.785.5
LIBERO-Plus (扰动)86.786.572.664.2
SIMPLER Google-VM81.572.776.161.9
SIMPLER Google-VA77.468.457.159.0
SIMPLER WidowX71.946.957.148.3
RoboCasa Kitchen70.662.166.263.6
GR-1 Tabletop humanoid58.715.447.6
RoboCasa365 Avg32.116.926.921.7

GR-1 Tabletop humanoid 是 humanoid-first 设计的杀手锏:RLDX-1 58.7 vs π₀.₅ 15.4 · π₀-FAST 完全跑不了。RoboCasa365 长时组合任务 unseen 分:RLDX-1 5.6 vs GR00T N1.6 2.6,2× 差距。

真机 ALLEX Humanoid(论文 §6.3 · 4 个功能测试)

ALLEX 是 48-DoF whole-upper-body humanoid,有高 DoF 手。4 个任务专门测 VLA 的 3 大盲区:

Task盲区RLDX-1π₀.₅GR00T N1.6
Conveyor Pick-and-Place (seen)Motion100seen 高50.0
Conveyor Pick-and-Place (unseen)Motion7529.2中间速度失败
Object-in-Box SelectionMemory91.733.329.2(等同随机)
Card Slide-and-Pick (progress)Physical Sensing97.2
Pot-to-Cup Pouring (progress)Physical Sensing70.80(都卡在倒的姿势)0

对 π₀.₅ / GR00T N1.6 而言这 4 类是结构性盲点—— 无法通过 fine-tune 补上(因为 backbone 里根本没这些模态)。RLDX-1 是架构级解决方案,MSAT 直接把 motion / memory / physics 作为独立 stream。

真机 Franka Research 3(论文 §6.4 · 6 个功能测试)

FR3 = 单臂 gripper + AnySkin 触觉,24 次 trials/task:

Task盲区RLDX-1π₀.₅GR00T N1.6
Spin TrackingMotion97.932.326.0
Pong GameMotion81.5
Cup SwappingMemory45.8< 25< 25
Shell GameMemory91.7~50~50
Plug InsertionContact Force33.320.816.7
Egg Pick-and-PlaceContact Force61.145.837.5

Spin Tracking 97.9 vs 26-32%(4× 差距)—— RLDX-1 motion 模块直接对眼前物体运动方向做端到端预测,π₀.₅/GR00T 单帧输入根本感知不到。

MSAT 架构:为什么"stream"设计有效

传统 VLA(π₀ / OpenVLA)是把所有信号 concatenate 后过 VLM—— 结果是文本视觉 dominate,触觉/关节力矩这类低带宽但关键的信号被稀释。

MSAT (Multi-Stream Action Transformer) 的做法:

这也是它能同时支持 Franka 单臂 / OpenArm 上肢 / ALLEX 全身 humanoid 三种形态的关键。

合成数据 Scaling(论文 Table 3)

Pre-training DataGR-1 Tabletop SR
只有 Real ActionNet41.0
Real + 25% Synthetic45.6
Real + 50% Synthetic46.6
Real + 100% Synthetic(Full)50.1

这是合成数据可预测提升的稀有实证 —— 每加 25% 合成,SR 增 1.5-4.5 点,且没有饱和。给数据配方策略提供 scaling law。

RL Post-training(Light Bulb Twisting · 论文 Fig 22)

拧灯泡到亮的 dexterous 任务。RECAP(作者提出的 RL 迭代)三轮训练:

推理速度(RTX 5090 · 论文 Table 4)

Inference Stackw/o physics+memoryAll-modality
PyTorch Eager67.0 ms71.2 ms
+ CUDA Graph + Torch.Compile56.9 ms (1.18×)59.6 ms (1.19×)
+ Static Graph Conversion46.2 ms (1.45×)48.9 ms (1.46×)
+ Kernel Optimization41.6 ms (1.61×)43.7 ms (1.63×)

All-modality(含 physics + memory streams)比 no-physics 只慢 2 ms —— MSAT 的 streams 是并行的。43.7 ms/step ≈ 22.9 Hz 控制频率,够 humanoid 实时。

差异化定位

RLDX-1 在几个方面独树一帜:

相关

GR00T N1 系列(被超越)
RLDX-1 GR-1 Tabletop +11.1 · ALLEX 全面超
π₀.₅(被超越)
LIBERO 96.9 vs RLDX-1 97.8;ALLEX 4 任务全负
Ψ₀ Psi-Zero
另一个 humanoid loco-manipulation 方案
DOMINO(动态操纵基准)
RLDX-1 的 Motion 模块直接针对动态场景

开源资源(完整开源)

arXiv 2605.03269
RLDX-1 Technical Report · 2026-05-05 · 68 authors
GitHub · RLWRLD/RLDX-1
代码 + 训练 pipeline
HF Collection · RLWRLD/rldx-1(11 个权重)
PT (7B) / PT-IMG (7B) / MT-DROID (8B) / MT-ALLEX (8B) + FT-ROBOCASA/SIMPLER-GOOGLE/SIMPLER-WIDOWX/RC365/LIBERO/GR1 + VLM (9B)
官方页 · rlwrld.ai
RLWRLD 官方技术博客