Online RL for VLA
这条主题关注 VLA 预训练之后的在线适配。核心问题不是“VLA 能不能泛化”,而是“当真实机器人需要更高精度、更高速度时,怎么以较低样本成本继续优化它”。
正文
Online RL for VLA
通才策略已经有了,接下来的问题是怎样把它快速打磨到高精度 specialist 表现。
主题概述
这条主题关注 VLA 预训练之后的在线适配。核心问题不是“VLA 能不能泛化”,而是“当真实机器人需要更高精度、更高速度时,怎么以较低样本成本继续优化它”。
当前知识库里的代表工作
来源: RL Token: Bootstrapping Online RL with Vision-Language-Action Models 代表作。通过
RL token把预训练 VLA 与轻量 actor-critic 接起来,让 online RL 重点修正 critical phase。来源: STEAM: Self-Supervised Temporal Ensemble Advantage Modeling for Real-World Robot Learning 从另一个侧面补齐 online/refinement 闭环:它不设计新 VLA 接口,而是用专家轨迹的时间结构学习 frame-level advantage,从人工纠正、失败 rollout 和专家示范中筛出真正推进任务的局部片段,再接入 CFGRL。
来源: π0.7: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities 虽然主体不是 RL 论文,但它明确展示了 generalist policy 可以蒸馏和吸收 specialist 经验,也说明 online optimization 与 foundation policy 不是对立关系。
当前判断
RLT给出的是一条很现实的 engineering 路线:不要重训整个 VLA,只给它暴露一个适合 RL 的接口STEAM补的是数据质量与 credit assignment:真实机器人数据不是整条好/坏,而是需要逐帧识别哪些片段真正推进任务π0.7则从另一个角度说明,generalist policy 最终仍然需要 specialist-style refinement,只是 refinement 的位置和形式不同
值得后续关注的问题
- online RL 的接口应该放在 VLA 哪一层最合适
- 是 refinement head 更重要,还是 reward / advantage / data-quality signal 更重要
- frame-level advantage 这类数据筛选信号,能否和 RL token 这样的轻量接口稳定结合
- 对不同 embodiment,这类轻量接口是否还能保持稳定性
相关页面
相关材料
STEAM: Self-Supervised Temporal Ensemble Advantage Modeling for Real-World Robot Learning
STEAM 值得记住的点,是它把真实机器人数据清洗问题改写成“逐帧 advantage 建模”:不用人工奖励、不用 VLM 打分,也不假设整条轨迹好坏一致,而是从专家轨迹内部的时间顺序中学习哪些 frame pair 代表推进、停滞或倒退。它尤其适合 VLA/机器人策略在真实 rollout、人工纠正和混合质量数据上继续提升:先找出真正推进任务的局部片段,再把这些片段作为 CFGRL 的高质量训练信号。
相关综述
当前 VLA 路线图:基座、可控性、在线精修、记忆与人类数据
如果只看单篇论文,很容易觉得大家都在“继续做更强的 VLA”。但把 OpenVLA、π0.7、RLT、MEM、Human-to-Robot Transfer、DexImit 放在一起,会看到这条路线其实已经分化成六个相互关联的问题: 1. VLA 基座如何开放、可训、可部署 2. heterogeneous data 如何变成可控能力 3. 通才策略如何继续被打磨到 specialist 级精度 4. 分钟级任务如何通过 memory 真正支撑起来 5. 人类数据何时开始能真正被机器人利用 6. 人类视频如何被显式编译成机器人可训练数据 这说明当前 VLA 研究已经不再只是单点模型设计,而是在演化成一套完整系统栈。