RLDX-1 LIBERO 97.8 · ALLEX Object-in-Box 91.7 · Spin Tracking 97.9
RLWRLD · Multi-Stream Action Transformer · 补齐 VLA 三大功能盲区:motion awareness / long-term memory / physical sensing · 完全开源
RLDX-1(arXiv 2605.03269)是韩国团队 RLWRLD 2026-05 发布的 humanoid 灵巧操纵基础模型(68 作者)。它抓住了当前主流 VLA 的三个盲区并给出统一解决方案:
- Motion Awareness:对移动物体、变速目标能预测轨迹
- Long-Term Memory:跨时间步保留观察,做依赖历史的推理
- Physical Sensing:融合触觉 / 关节力矩,做接触密集操纵
架构核心是 MSAT (Multi-Stream Action Transformer) —— 异构模态各有独立 stream,通过 cross-modal joint self-attention 融合。完全开源:GitHub + 3 个 HuggingFace 权重(RLDX-1-PT · MT-DROID · MT-ALLEX)。
关键数字(论文 Table 1 · 仿真)
| Benchmark | RLDX-1 | π₀.₅ | GR00T N1.6 | π₀-FAST |
|---|---|---|---|---|
| LIBERO Short (S/G/O) | 98.6 | 98.0 | 97.4 | 93.9 |
| LIBERO Long | 95.3 | 92.0 | 94.4 | 60.2 |
| LIBERO Avg | 97.8 | 96.9 | 96.7 | 85.5 |
| LIBERO-Plus (扰动) | 86.7 | 86.5 | 72.6 | 64.2 |
| SIMPLER Google-VM | 81.5 | 72.7 | 76.1 | 61.9 |
| SIMPLER Google-VA | 77.4 | 68.4 | 57.1 | 59.0 |
| SIMPLER WidowX | 71.9 | 46.9 | 57.1 | 48.3 |
| RoboCasa Kitchen | 70.6 | 62.1 | 66.2 | 63.6 |
| GR-1 Tabletop humanoid | 58.7 | 15.4 | 47.6 | — |
| RoboCasa365 Avg | 32.1 | 16.9 | 26.9 | 21.7 |
GR-1 Tabletop humanoid 是 humanoid-first 设计的杀手锏:RLDX-1 58.7 vs π₀.₅ 15.4 · π₀-FAST 完全跑不了。RoboCasa365 长时组合任务 unseen 分:RLDX-1 5.6 vs GR00T N1.6 2.6,2× 差距。
真机 ALLEX Humanoid(论文 §6.3 · 4 个功能测试)
ALLEX 是 48-DoF whole-upper-body humanoid,有高 DoF 手。4 个任务专门测 VLA 的 3 大盲区:
| Task | 盲区 | RLDX-1 | π₀.₅ | GR00T N1.6 |
|---|---|---|---|---|
| Conveyor Pick-and-Place (seen) | Motion | 100 | seen 高 | 50.0 |
| Conveyor Pick-and-Place (unseen) | Motion | 75 | 29.2 | 中间速度失败 |
| Object-in-Box Selection | Memory | 91.7 | 33.3 | 29.2(等同随机) |
| Card Slide-and-Pick (progress) | Physical Sensing | 97.2 | 低 | 低 |
| Pot-to-Cup Pouring (progress) | Physical Sensing | 70.8 | 0(都卡在倒的姿势) | 0 |
对 π₀.₅ / GR00T N1.6 而言这 4 类是结构性盲点—— 无法通过 fine-tune 补上(因为 backbone 里根本没这些模态)。RLDX-1 是架构级解决方案,MSAT 直接把 motion / memory / physics 作为独立 stream。
真机 Franka Research 3(论文 §6.4 · 6 个功能测试)
FR3 = 单臂 gripper + AnySkin 触觉,24 次 trials/task:
| Task | 盲区 | RLDX-1 | π₀.₅ | GR00T N1.6 |
|---|---|---|---|---|
| Spin Tracking | Motion | 97.9 | 32.3 | 26.0 |
| Pong Game | Motion | 81.5 | 低 | 低 |
| Cup Swapping | Memory | 45.8 | < 25 | < 25 |
| Shell Game | Memory | 91.7 | ~50 | ~50 |
| Plug Insertion | Contact Force | 33.3 | 20.8 | 16.7 |
| Egg Pick-and-Place | Contact Force | 61.1 | 45.8 | 37.5 |
Spin Tracking 97.9 vs 26-32%(4× 差距)—— RLDX-1 motion 模块直接对眼前物体运动方向做端到端预测,π₀.₅/GR00T 单帧输入根本感知不到。
MSAT 架构:为什么"stream"设计有效
传统 VLA(π₀ / OpenVLA)是把所有信号 concatenate 后过 VLM—— 结果是文本视觉 dominate,触觉/关节力矩这类低带宽但关键的信号被稀释。
MSAT (Multi-Stream Action Transformer) 的做法:
- 每个模态一个独立 stream,各自有 encoder 保持模态特异的表征
- Streams 通过 cross-modal joint self-attention 融合,但每个 stream 有自己的路由
- Embodiment-conditioned MSAT streams:不同机器人本体(单臂 / 双臂 / humanoid)各有自己的 encoder/decoder,共享 MSAT core
这也是它能同时支持 Franka 单臂 / OpenArm 上肢 / ALLEX 全身 humanoid 三种形态的关键。
合成数据 Scaling(论文 Table 3)
| Pre-training Data | GR-1 Tabletop SR |
|---|---|
| 只有 Real ActionNet | 41.0 |
| Real + 25% Synthetic | 45.6 |
| Real + 50% Synthetic | 46.6 |
| Real + 100% Synthetic(Full) | 50.1 |
这是合成数据可预测提升的稀有实证 —— 每加 25% 合成,SR 增 1.5-4.5 点,且没有饱和。给数据配方策略提供 scaling law。
RL Post-training(Light Bulb Twisting · 论文 Fig 22)
拧灯泡到亮的 dexterous 任务。RECAP(作者提出的 RL 迭代)三轮训练:
- BC 基线:1056 ± 326 帧 · 12.7 ± 3.0 attempts
- RECAP3:353 ± 22 帧 · 4.1 ± 0.3 attempts(3× 速度)
- 比人类 teleoperation 还快 —— RL 突破人类演示的上限
推理速度(RTX 5090 · 论文 Table 4)
| Inference Stack | w/o physics+memory | All-modality |
|---|---|---|
| PyTorch Eager | 67.0 ms | 71.2 ms |
| + CUDA Graph + Torch.Compile | 56.9 ms (1.18×) | 59.6 ms (1.19×) |
| + Static Graph Conversion | 46.2 ms (1.45×) | 48.9 ms (1.46×) |
| + Kernel Optimization | 41.6 ms (1.61×) | 43.7 ms (1.63×) |
All-modality(含 physics + memory streams)比 no-physics 只慢 2 ms —— MSAT 的 streams 是并行的。43.7 ms/step ≈ 22.9 Hz 控制频率,够 humanoid 实时。
差异化定位
RLDX-1 在几个方面独树一帜:
- Humanoid 专项:GR-1 Tabletop 58.7% 比第二名 GR00T N1.6 高 11 点 —— 这是"humanoid-first"设计的直接收益
- 三大功能盲区补齐:motion / memory / physical sensing —— 不是简单加 feature,是架构级 MSAT streams
- MSAT 跨形态:一个 core + per-embodiment encoders/decoders,支持单臂 / OpenArm / ALLEX 三种真机
- 完全开源:GitHub + 3 个 HuggingFace 权重 —— 是所有 humanoid VLA 里开源程度最高的
- vs π₀.₅ / GR00T N1.6:在他们最强的 LIBERO 上超 1 点;在他们最弱的动态/记忆/接触上超 30-70 点