Long-Horizon Memory for Robot Policies
这条主题关注机器人策略如何处理分钟级任务。关键不是更多帧,而是多尺度记忆:哪些信息应该保留为短期视觉痕迹,哪些应该抽象成长期语义状态。
正文
Long-Horizon Memory for Robot Policies
长时程机器人控制不是只把上下文窗口拉长,而是要决定不同时间尺度的信息如何表示。
主题概述
这条主题关注机器人策略如何处理分钟级任务。关键不是更多帧,而是多尺度记忆:哪些信息应该保留为短期视觉痕迹,哪些应该抽象成长期语义状态。
当前知识库里的代表工作
来源: MEM: Multi-Scale Embodied Memory for Vision Language Action Models 明确把 memory 分解成视频短期记忆和语言长期记忆,是这条主题的主工作。
来源: π0.7: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities 通过 subgoal image、subtask instruction、episode metadata 给策略提供 richer context,本质上也是在补 memory 和 progress control。
来源: FM-VLA: Force-based Memory for Vision-Language-Action Models in Contact-Rich Manipulation 把整个 episode 的腕部 wrench 历史压缩成 8 个事件记忆 token,并用短时关节状态稳定接触前运动,证明视觉或语言之外的物理信号也可以成为低成本长时记忆。
当前判断
MEM是显式 memory 架构路线π0.7更偏通过 richer prompt 和 context 让模型具备更强的阶段性控制FM-VLA补出第三类路线:按事件可观测性选择记忆模态,用 wrench 记录视觉上含混的接触进度- 后续更可能出现多模态、分时间尺度的记忆:视觉/语言保存场景与计划,force/state 保存接触事件与近期运动
值得后续关注的问题
- 语言长期记忆如何更新、压缩和纠错
- 视频短期记忆如何在保证实时性的同时保留关键信息
- 如何在视觉、语言、force/tactile 与 proprioception 之间动态选择记忆内容和时间尺度
- high-level memory 与 low-level control 的接口应如何设计
相关页面
相关材料
FM-VLA: Force-based Memory for Vision-Language-Action Models in Contact-Rich Manipulation
FM-VLA 的关键不是给 VLA 再塞一种当前时刻传感器,而是把整段腕部力/力矩历史压缩成可供动作专家读取的长期事件记忆。它在找隐藏积木、精确计数按钮按压与碗内擦拭三项非马尔可夫任务上达到 83.3% 平均成功率,显著超过视觉记忆 π-MEM 的 53.7%,推理延迟仅比无记忆 π0.5 增加 3.3 ms。最值得记住的是“长时 force + 短时 state”的职责分工,但证据目前仍限于单一双臂平台和小规模任务。
相关综述
当前 VLA 路线图:基座、可控性、在线精修、记忆与人类数据
如果只看单篇论文,很容易觉得大家都在“继续做更强的 VLA”。但把 OpenVLA、π0.7、RLT、MEM、Human-to-Robot Transfer、DexImit 放在一起,会看到这条路线其实已经分化成六个相互关联的问题: 1. VLA 基座如何开放、可训、可部署 2. heterogeneous data 如何变成可控能力 3. 通才策略如何继续被打磨到 specialist 级精度 4. 分钟级任务如何通过 memory 真正支撑起来 5. 人类数据何时开始能真正被机器人利用 6. 人类视频如何被显式编译成机器人可训练数据 这说明当前 VLA 研究已经不再只是单点模型设计,而是在演化成一套完整系统栈。