TenStep

Long-Horizon Memory for Robot Policies

材料 3 综述 1 更新 2026-09-01

这条主题关注机器人策略如何处理分钟级任务。关键不是更多帧,而是多尺度记忆:哪些信息应该保留为短期视觉痕迹,哪些应该抽象成长期语义状态。

正文

Long-Horizon Memory for Robot Policies

长时程机器人控制不是只把上下文窗口拉长,而是要决定不同时间尺度的信息如何表示。

主题概述

这条主题关注机器人策略如何处理分钟级任务。关键不是更多帧,而是多尺度记忆:哪些信息应该保留为短期视觉痕迹,哪些应该抽象成长期语义状态。

当前知识库里的代表工作

当前判断

  • MEM 是显式 memory 架构路线
  • π0.7 更偏通过 richer prompt 和 context 让模型具备更强的阶段性控制
  • FM-VLA 补出第三类路线:按事件可观测性选择记忆模态,用 wrench 记录视觉上含混的接触进度
  • 后续更可能出现多模态、分时间尺度的记忆:视觉/语言保存场景与计划,force/state 保存接触事件与近期运动

值得后续关注的问题

  • 语言长期记忆如何更新、压缩和纠错
  • 视频短期记忆如何在保证实时性的同时保留关键信息
  • 如何在视觉、语言、force/tactile 与 proprioception 之间动态选择记忆内容和时间尺度
  • high-level memory 与 low-level control 的接口应如何设计

相关页面

相关材料

MEM: Multi-Scale Embodied Memory for Vision Language Action Models

这篇工作的重点,是把机器人策略里的“记忆”从单一历史帧堆叠,升级成多尺度、多模态的长期记忆结构。MEM 用视频短期记忆处理最近视觉细节,用文本长期记忆保留高层语义进度,从而把 VLA 推到更长时间跨度的任务上。

π0.7: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities

π0.7 的关键价值不只是把模型继续做大,而是把“可控的通才机器人策略”往前推了一步。它试图解决的核心问题是:当训练数据越来越杂时,机器人基础模型怎样既能吃下示范、失败轨迹、人类视频和网页数据,又不在推理时退化成平均化、含糊的动作。作者给出的答案是把“怎么做”也写进 prompt,包括子任务语言、子目标图像、质量/速度/错误等 episode metadata,让模型学会在多模态上下文里被 steer。

FM-VLA: Force-based Memory for Vision-Language-Action Models in Contact-Rich Manipulation

FM-VLA 的关键不是给 VLA 再塞一种当前时刻传感器,而是把整段腕部力/力矩历史压缩成可供动作专家读取的长期事件记忆。它在找隐藏积木、精确计数按钮按压与碗内擦拭三项非马尔可夫任务上达到 83.3% 平均成功率,显著超过视觉记忆 π-MEM 的 53.7%,推理延迟仅比无记忆 π0.5 增加 3.3 ms。最值得记住的是“长时 force + 短时 state”的职责分工,但证据目前仍限于单一双臂平台和小规模任务。

相关综述

当前 VLA 路线图:基座、可控性、在线精修、记忆与人类数据

如果只看单篇论文,很容易觉得大家都在“继续做更强的 VLA”。但把 OpenVLA、π0.7、RLT、MEM、Human-to-Robot Transfer、DexImit 放在一起,会看到这条路线其实已经分化成六个相互关联的问题: 1. VLA 基座如何开放、可训、可部署 2. heterogeneous data 如何变成可控能力 3. 通才策略如何继续被打磨到 specialist 级精度 4. 分钟级任务如何通过 memory 真正支撑起来 5. 人类数据何时开始能真正被机器人利用 6. 人类视频如何被显式编译成机器人可训练数据 这说明当前 VLA 研究已经不再只是单点模型设计,而是在演化成一套完整系统栈。