TenStep

Online RL for VLA

材料 3 综述 1 更新 2026-07-06

这条主题关注 VLA 预训练之后的在线适配。核心问题不是“VLA 能不能泛化”,而是“当真实机器人需要更高精度、更高速度时,怎么以较低样本成本继续优化它”。

正文

Online RL for VLA

通才策略已经有了,接下来的问题是怎样把它快速打磨到高精度 specialist 表现。

主题概述

这条主题关注 VLA 预训练之后的在线适配。核心问题不是“VLA 能不能泛化”,而是“当真实机器人需要更高精度、更高速度时,怎么以较低样本成本继续优化它”。

当前知识库里的代表工作

当前判断

  • RLT 给出的是一条很现实的 engineering 路线:不要重训整个 VLA,只给它暴露一个适合 RL 的接口
  • STEAM 补的是数据质量与 credit assignment:真实机器人数据不是整条好/坏,而是需要逐帧识别哪些片段真正推进任务
  • π0.7 则从另一个角度说明,generalist policy 最终仍然需要 specialist-style refinement,只是 refinement 的位置和形式不同

值得后续关注的问题

  • online RL 的接口应该放在 VLA 哪一层最合适
  • 是 refinement head 更重要,还是 reward / advantage / data-quality signal 更重要
  • frame-level advantage 这类数据筛选信号,能否和 RL token 这样的轻量接口稳定结合
  • 对不同 embodiment,这类轻量接口是否还能保持稳定性

相关页面

相关材料

RL Token: Bootstrapping Online RL with Vision-Language-Action Models

这篇工作最重要的点,是给 VLA 和在线 RL 之间找到了一个足够轻量的接口。作者没有直接对整套大模型做昂贵 RL,而是让预训练 VLA 暴露一个紧凑的 `RL token`,再在这个表示上训练小型 actor-critic,从而把 VLA 的泛化能力和 real-world online RL 的样本效率拼接起来。

STEAM: Self-Supervised Temporal Ensemble Advantage Modeling for Real-World Robot Learning

STEAM 值得记住的点,是它把真实机器人数据清洗问题改写成“逐帧 advantage 建模”:不用人工奖励、不用 VLM 打分,也不假设整条轨迹好坏一致,而是从专家轨迹内部的时间顺序中学习哪些 frame pair 代表推进、停滞或倒退。它尤其适合 VLA/机器人策略在真实 rollout、人工纠正和混合质量数据上继续提升:先找出真正推进任务的局部片段,再把这些片段作为 CFGRL 的高质量训练信号。

π0.7: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities

π0.7 的关键价值不只是把模型继续做大,而是把“可控的通才机器人策略”往前推了一步。它试图解决的核心问题是:当训练数据越来越杂时,机器人基础模型怎样既能吃下示范、失败轨迹、人类视频和网页数据,又不在推理时退化成平均化、含糊的动作。作者给出的答案是把“怎么做”也写进 prompt,包括子任务语言、子目标图像、质量/速度/错误等 episode metadata,让模型学会在多模态上下文里被 steer。

相关综述

当前 VLA 路线图:基座、可控性、在线精修、记忆与人类数据

如果只看单篇论文,很容易觉得大家都在“继续做更强的 VLA”。但把 OpenVLA、π0.7、RLT、MEM、Human-to-Robot Transfer、DexImit 放在一起,会看到这条路线其实已经分化成六个相互关联的问题: 1. VLA 基座如何开放、可训、可部署 2. heterogeneous data 如何变成可控能力 3. 通才策略如何继续被打磨到 specialist 级精度 4. 分钟级任务如何通过 memory 真正支撑起来 5. 人类数据何时开始能真正被机器人利用 6. 人类视频如何被显式编译成机器人可训练数据 这说明当前 VLA 研究已经不再只是单点模型设计,而是在演化成一套完整系统栈。