Vision-Language-Action
VLA 从开放基座、多源数据、在线精修和长时程记忆,继续扩展到新感官模态的持续适配与执行期闭环。
正文
Vision-Language-Action
把视觉、语言和动作统一进同一策略建模框架,是当前具身智能主线之一。
这条主题在讲什么
VLA 的核心不是“把图像和文本都喂给机器人”,而是把机器人控制问题放进 foundation model 语境里,让预训练、多任务泛化、迁移、微调和跨 embodiment 学习都能在一套统一框架里讨论。
为什么重要
- VLA 是现在连接大模型能力与机器人执行能力的主干路线
- 它把机器人学习从 task-specific policy 推向 reusable foundation policy
- 很多后续方向,本质上都是在回答“VLA 还缺什么”
- 更强的可控性
- 更长的记忆
- 更高的精度
- 更好的跨 embodiment 迁移
- 更低成本地利用人类数据
- 新感官模态的持续适配与低延迟闭环
当前知识库里的几条子路线
开源基座化 来自 来源: OpenVLA: An Open-Source Vision-Language-Action Model OpenVLA 强调训练、微调、部署三件事一起开源,代表“VLA 作为公开基础设施”的路线。
更强 steerability 来自 来源: π0.7: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities π0.7 通过 richer prompt、subgoal image、episode metadata 把“怎么做”也编码进策略上下文。
在线 RL 精修 来自 来源: RL Token: Bootstrapping Online RL with Vision-Language-Action Models RLT 关注如何在保留 VLA 泛化先验的前提下,把精度和速度继续打磨到 specialist 水平。
长时程记忆 来自 来源: MEM: Multi-Scale Embodied Memory for Vision Language Action Models MEM 试图解决 VLA 在长达十几分钟任务中的任务进度保持和局部视觉记忆问题。
利用 human data 来自 来源: Emergence of Human to Robot Transfer in Vision-Language-Action Models 这条路线关注 VLA 何时开始能真正吃进 human video,并把它转化成机器人能力。
跨具身对齐与 OOD 规模化 来自 来源: Qwen-RobotManip Technical Report Qwen-RobotManip 把 canonical state-action slots、camera-frame delta EEF 和 episode context 组合成统一接口,重点回答异构机器人数据何时能随规模增长转化为 OOD、指令跟随和跨具身迁移能力。
灵巧手基准与失败诊断 来自 来源: DexJoCo: A Benchmark and Toolkit for Task-Oriented Dexterous Manipulation on MuJoCo DexJoCo 不提出新 VLA 模型,而是把 VLA/模仿学习策略在灵巧手、双手协作、按钮/插装/铰链交互和视觉随机化下的失败模式系统测出来。
训练目标物理化 来自 来源: AttenA+: Rectifying Action Inequality in Robotic Foundation Models AttenA+ 不改 VLA/WAM 骨干,而是把动作速度场写进 loss 权重,让模型更重视低速、精细、接触关键的动作片段。
新感官模态的持续适配 来自 来源: Multisensory Continual Learning: Adapting Pretrained Visuomotor Policies to Force MuSe 把 force-torque 接入已有 visuomotor world model,并用未来视频/F/T 联合预测、旧数据 replay 与 missing-modality mask 同时优化新任务前向迁移和旧任务后向保持。
异步快慢触觉闭环 来自 来源: T-Rex: Tactile-Reactive Dexterous Manipulation T-Rex 让低频动作专家负责视觉语言规划、高频触觉专家复用缓存并沿同一 flow 轨迹细化动作,代表“多速率专家共享动作分布”的路线。
chunk 内流式触觉反馈 来自 来源: TacForcing: Streaming Action Generation with Execution-Time Tactile Feedback TacForcing 不另设快触觉控制器,而是让同一个动作专家按块完成、执行并保留未来块中间态;每次执行后刷新触觉,EATA 只让最新触觉影响下一待执行块,把观测时刻与动作生效时刻显式对齐。
历史上下文 + 具身推理 + 动作对齐的系统化 来自 来源: DM0.5: 面向开放世界的通用具身智能基础模型 DM0.5 把长历史记忆(最长 60s)、11 种具身推理 CoT 任务、以及轨迹进展对齐三个设计做成一体,换来开放环境 Zero-Shot 泛化和真机 Table30 v2 SOTA。
隐式动作(LAM)的系统化消融 来自 来源: What Matters for Latent Actions in Robot Learning 这篇把 LAPO/LAOF/CoMo/CFD-AE 等隐式动作建模方法统一进同一自编码框架,扫描 41 个设计选择,证明原始 LAPO 最强、光流先验有害,并给出「隐式动作微调 VLM 骨干」的可复制配方(真机 +14.5pp)。
表示中心的持续预训练 来自 来源: Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models VLAct 不设计新的最终动作头,而是把 VLA continued pre-training 当作 backbone 表示学习:保护 VLM 浅层先验,以 OFT、PI、GR00T 多头联合监督减少 decoder lock-in,并只在物理可比的动作维度上做跨具身共享。
当前判断
这几篇放在一起看,VLA 主线已经很清楚:
OpenVLA解决“基座是否开放、可训、可部署”π0.7解决“多源数据如何通过 prompt 变成可控能力”RLT解决“如何把通才策略继续打磨到高精度”MEM解决“如何把策略延长到 long-horizon”Human-to-Robot Transfer解决“如何把人类数据真正吸纳进来”DexJoCo解决“如何用灵巧手任务和失败模式检验这些策略是否真的具备接触密集、双手和长时程能力”AttenA+解决“训练目标是否应该反映动作序列内部的物理关键性”MuSe解决“如何把预训练时不存在的新力觉模态接入 foundation policy,同时避免旧能力遗忘”T-Rex解决“如何让低频视觉规划与高频触觉动作细化在同一生成轨迹上协同”TacForcing解决“如何在同一个动作生成器内部交错 chunk 生成、执行与触觉更新,并限制反馈的时间作用域”DM0.5解决“如何把历史上下文、具身推理、动作监督三件事系统化地收进一个可用的通用 VLA”What Matters for Latent Actions解决“用无标注视频学隐式动作时,哪些设计真正决定下游性能、以及如何低成本评估隐式动作质量”VLAct解决“固定机器人数据预算下,如何让持续预训练得到可换动作头、可跨具身迁移的 VLA backbone”
也就是说,VLA 不再只是一个单点模型设计问题,而已经分化成一套系统问题族。
相关页面
- OpenVLA: An Open-Source Vision-Language-Action Model
- π0.7: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities
- RL Token: Bootstrapping Online RL with Vision-Language-Action Models
- MEM: Multi-Scale Embodied Memory for Vision Language Action Models
- Emergence of Human to Robot Transfer in Vision-Language-Action Models
- Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models
- DexJoCo: A Benchmark and Toolkit for Task-Oriented Dexterous Manipulation on MuJoCo
- AttenA+: Rectifying Action Inequality in Robotic Foundation Models
- 2606.30988-multisensory-continual-learning-adapting-pretrained-visuomotor-policies-to-force|Multisensory Continual Learning: Adapting Pretrained Visuomotor Policies to Force
- t-rex-tactile-reactive-dexterous-manipulation|T-Rex: Tactile-Reactive Dexterous Manipulation
- 2608.25798-tacforcing-streaming-action-generation-with-execution-time-tactile-feedback|TacForcing: Streaming Action Generation with Execution-Time Tactile Feedback
- tactile-force-into-pretrained-robot-policies|触觉与力觉如何进入预训练机器人策略:表示、持续适配与执行闭环
- DM0.5: 面向开放世界的通用具身智能基础模型
- What Matters for Latent Actions in Robot Learning
- Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models
- Online RL for VLA
- Long-Horizon Memory for Robot Policies
- Human-to-Robot Transfer
相关材料
DexJoCo: A Benchmark and Toolkit for Task-Oriented Dexterous Manipulation on MuJoCo
DexJoCo 的价值不在于提出一个新策略模型,而在于把“灵巧手到底比夹爪强在哪里、现有 VLA/模仿学习策略在哪些灵巧交互上失败”变成了可系统测量的问题。它提供 11 个功能型 MuJoCo 任务、1.1K 条人类示范、低成本手套遥操作采集系统,以及面向视觉随机化、动力学随机化、多任务训练和 action-head 适配的评测工具链。对后续灵巧手机器人学习来说,这篇更像基础设施论文:它给出了一个比 pick-and-place 更接近真实灵巧操作的压力测试场。
Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
Qwen-VLA 将操作、连续导航、轨迹预测和人类第一视角运动统一为同一 action-and-trajectory prediction 问题;它不是为每个机器人另训策略,而是用 Qwen3.5-4B 与 1.15B 参数 DiT 动作专家共享建模。其关键价值是以 embodiment-aware prompt 保留各平台原生控制语义,并用四阶段训练把语言—动作先验、视觉 grounding、任务对齐和成功率优化串起来。跨操作、导航、真实 OOD 与动态零样本基准的结果表明,这个统一接口并未以明显的 specialist 性能为代价。
Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models
Qwen-RobotManip 的核心不是“再堆更多机器人数据”,而是先把不同机器人在**表示、运动和行为**三个层面拉到同一坐标系,再讨论规模化。论文最有价值的证据是:统一动作表示后,跨具身数据在 OOD 验证误差和下游成功率上才出现清晰的规模趋势;但“只用公开数据”的说法只适用于 manipulation corpus,完整训练还混入了含 proprietary data 的 VL 数据。
Multisensory Continual Learning: Adapting Pretrained Visuomotor Policies to Force
这篇论文最值得记住的不是“给 VLA 加一条触觉输入”,而是它把新模态接入表述成 continual learning:在少量新 contact-rich 数据上学会用 force,同时尽量不破坏旧的视觉动作能力。MuSe 的价值在于,它用 multisensory future prediction 和 replay 证明,旧任务上即使没有力标注,也能把力学结构以可迁移的方式对齐进预训练策略;真正的短板则是仍依赖离线适配和专门的 compliance 控制接口,而不是端到端解决全闭环接触控制。
What Matters for Latent Actions in Robot Learning
这是第一篇对 latent action model(LAM,隐式动作模型)做系统性实证研究的论文:把 LAPO、LAOF、CoMo、CFD-AE 等代表方法统一进同一个自编码框架,系统扫描了 41 个设计选择(建模范式、学习目标/正则化、隐式动作集成方式),并检验了 4 个代理指标能否预测下游操纵性能。核心结论是**原始 LAPO 反而是最强基线**,光学流(RAFT/SEA-RAFT)这类运动先验反而有害,隐式动作在 VLM 骨干微调后能显著提升下游策略与真实机械臂性能(真机成功率 64.75% → 79.25%)。对做「用无标注视频训练机器人」方向的人,这是一份可直接照抄的配方表。
TacForcing: Streaming Action Generation with Execution-Time Tactile Feedback
TacForcing 解决的不是“VLA 能否看到触觉”,而是“动作块执行到一半时,最新触觉能否继续改写尚未执行的动作”。它把一个动作 chunk 拆成顺序完成的块,保留未来块的 flow-matching 中间态,并用执行后新采集的触觉继续细化;EATA 只让最新触觉影响下一块,避免它提前污染更远期动作。六个 UniVTAC 仿真任务平均成功率 65%,三个真机任务平均 69%,但 v1 的真机评测每任务仅 16 次,尚不足以证明跨硬件泛化或实时成本优势。
Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models
VLAct 说明 VLA 的下一条独立增长轴不只是继续堆机器人轨迹,而是改造 continued pre-training 如何塑造 backbone 表示。在固定下游微调协议下,它仅替换预训练后的 Qwen3-VL-4B backbone,就在多项仿真、真机与未见 embodiment 迁移任务上取得 7.6–21.4 个百分点增益;最值得记住的是“保护 VLM 先验、用多动作头抵抗 decoder lock-in、只在物理可比维度共享动作语义”这套配方。
相关综述
当前 VLA 路线图:基座、可控性、在线精修、记忆与人类数据
如果只看单篇论文,很容易觉得大家都在“继续做更强的 VLA”。但把 OpenVLA、π0.7、RLT、MEM、Human-to-Robot Transfer、DexImit 放在一起,会看到这条路线其实已经分化成六个相互关联的问题: 1. VLA 基座如何开放、可训、可部署 2. heterogeneous data 如何变成可控能力 3. 通才策略如何继续被打磨到 specialist 级精度 4. 分钟级任务如何通过 memory 真正支撑起来 5. 人类数据何时开始能真正被机器人利用 6. 人类视频如何被显式编译成机器人可训练数据 这说明当前 VLA 研究已经不再只是单点模型设计,而是在演化成一套完整系统栈。
触觉与力觉如何进入预训练机器人策略:表示、持续适配与执行闭环
五篇材料共同勾勒出触觉与力觉进入机器人基础策略的四层栈:传感设计、跨硬件表示、无遗忘持续适配,以及与动作生效时间对齐的执行闭环。