TenStep

Physical/Embodied Intelligence

研究范围

物理/具身智能总入口,覆盖感知、规划、控制、世界模型与 sim2real。

关注点

world modelsrobot manipulationsim2realplanning

范围说明

Physical/Embodied Intelligence 关注智能体如何在真实世界中感知、规划并执行动作,核心问题是把数据、模型、控制器与物理约束连接成稳定闭环。

关键问题

  • 数据、模型、控制器三者怎样形成稳定闭环?
  • sim2real 的主要瓶颈是数据覆盖还是策略表达?
  • 世界模型怎样才能真正为行动和规划服务?

综述

触觉与力觉如何进入预训练机器人策略:表示、持续适配与执行闭环

五篇材料共同勾勒出触觉与力觉进入机器人基础策略的四层栈:传感设计、跨硬件表示、无遗忘持续适配,以及与动作生效时间对齐的执行闭环。

打开综述

当前 VLA 路线图:基座、可控性、在线精修、记忆与人类数据

如果只看单篇论文,很容易觉得大家都在“继续做更强的 VLA”。但把 OpenVLA、π0.7、RLT、MEM、Human-to-Robot Transfer、DexImit 放在一起,会看到这条路线其实已经分化成六个相互关联的问题: 1. VLA 基座如何开放、可训、可部署 2. heterogeneous data 如何变成可控能力 3. 通才策略如何继续被打磨到 specialist 级精度 4. 分钟级任务如何通过 memory 真正支撑起来 5. 人类数据何时开始能真正被机器人利用 6. 人类视频如何被显式编译成机器人可训练数据 这说明当前 VLA 研究已经不再只是单点模型设计,而是在演化成一套完整系统栈。

打开综述

Long-Horizon Memory for Robot Policies

这条主题关注机器人策略如何处理分钟级任务。关键不是更多帧,而是多尺度记忆:哪些信息应该保留为短期视觉痕迹,哪些应该抽象成长期语义状态。

2026-09-01

打开主题

Contact-Rich Manipulation and Adaptive Compliance

接触密集操作中的运动—力联合学习路线:如何从示范与实时力/触觉反馈学习任务相关柔顺性和主动微位移修正,并在安全接触、轨迹精度与快速响应之间动态权衡。

2026-09-01

打开主题

Vision-Language-Action

VLA 从开放基座、多源数据、在线精修和长时程记忆,继续扩展到新感官模态的持续适配与执行期闭环。

2026-08-31

打开主题

Tactile Representation

触觉与力觉如何从传感设计、跨硬件共享表示,进入预训练策略的持续适配、快慢控制与执行期流式闭环。

2026-08-30

打开主题

Online RL for VLA

这条主题关注 VLA 预训练之后的在线适配。核心问题不是“VLA 能不能泛化”,而是“当真实机器人需要更高精度、更高速度时,怎么以较低样本成本继续优化它”。

2026-07-06

打开主题

Human-to-Robot Transfer

这条主题关注 human video、human embodiment data 与 robot policy 之间的迁移。核心问题不是“人类数据多不多”,而是“模型什么时候开始有能力利用这些数据”。

2026-06-26

打开主题

论文 2026-08-27

Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models

VLAct 说明 VLA 的下一条独立增长轴不只是继续堆机器人轨迹,而是改造 continued pre-training 如何塑造 backbone 表示。在固定下游微调协议下,它仅替换预训练后的 Qwen3-VL-4B backbone,就在多项仿真、真机与未见 embodiment 迁移任务上取得 7.6–21.4 个百分点增益;最值得记住的是“保护 VLM 先验、用多动作头抵抗 decoder lock-in、只在物理可比维度共享动作语义”这套配方。

论文 2026-08-26

TacForcing: Streaming Action Generation with Execution-Time Tactile Feedback

TacForcing 解决的不是“VLA 能否看到触觉”,而是“动作块执行到一半时,最新触觉能否继续改写尚未执行的动作”。它把一个动作 chunk 拆成顺序完成的块,保留未来块的 flow-matching 中间态,并用执行后新采集的触觉继续细化;EATA 只让最新触觉影响下一块,避免它提前污染更远期动作。六个 UniVTAC 仿真任务平均成功率 65%,三个真机任务平均 69%,但 v1 的真机评测每任务仅 16 次,尚不足以证明跨硬件泛化或实时成本优势。

论文 2026-08-20

What Matters for Latent Actions in Robot Learning

这是第一篇对 latent action model(LAM,隐式动作模型)做系统性实证研究的论文:把 LAPO、LAOF、CoMo、CFD-AE 等代表方法统一进同一个自编码框架,系统扫描了 41 个设计选择(建模范式、学习目标/正则化、隐式动作集成方式),并检验了 4 个代理指标能否预测下游操纵性能。核心结论是**原始 LAPO 反而是最强基线**,光学流(RAFT/SEA-RAFT)这类运动先验反而有害,隐式动作在 VLM 骨干微调后能显著提升下游策略与真实机械臂性能(真机成功率 64.75% → 79.25%)。对做「用无标注视频训练机器人」方向的人,这是一份可直接照抄的配方表。

网页 2026-08-10

DM0.5: 面向开放世界的通用具身智能基础模型

DM0.5 延续 VLA 架构(4B VLM 多模态主干 + 680M Action Expert),核心不是堆规模,而是四项系统增强:长历史上下文、具身推理(CoT)、动态动作对齐监督、数据质量清洗。换来的是开放环境 Zero-Shot 泛化、更长记忆、更鲁棒动作和多机型迁移,在 RoboChallenge Table30 v2 真机评测拿下 SOTA,并在 LIBERO / RoboTwin2.0 / R2R+RxR 导航基准上多项领先。

论文 2026-07-29

TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

TurboVLA 将高频控制从 LLM 居中的 V→L→A 改为轻量的直接 V+L→A,在 LIBERO 达到 97.7% 且只需 0.2B、31.2ms、0.9GB。

论文 2026-07-20

FM-VLA: Force-based Memory for Vision-Language-Action Models in Contact-Rich Manipulation

FM-VLA 的关键不是给 VLA 再塞一种当前时刻传感器,而是把整段腕部力/力矩历史压缩成可供动作专家读取的长期事件记忆。它在找隐藏积木、精确计数按钮按压与碗内擦拭三项非马尔可夫任务上达到 83.3% 平均成功率,显著超过视觉记忆 π-MEM 的 53.7%,推理延迟仅比无记忆 π0.5 增加 3.3 ms。最值得记住的是“长时 force + 短时 state”的职责分工,但证据目前仍限于单一双臂平台和小规模任务。