Contact-Rich Manipulation and Adaptive Compliance
接触密集操作中的运动—力联合学习路线:如何从示范与实时力/触觉反馈学习任务相关柔顺性和主动微位移修正,并在安全接触、轨迹精度与快速响应之间动态权衡。
正文
Contact-Rich Manipulation and Adaptive Compliance
这条路线研究机器人在持续接触中如何同时“走对轨迹”和“用对力”,并让柔顺方向与幅值随任务阶段、接触几何和扰动动态变化。
这条主题在讲什么
接触密集操作不是纯位置预测问题。刚性控制能压住轨迹误差,却可能把几毫米的视觉或标定偏差放大成巨大内力;各方向统一放软虽然降低碰撞风险,又会因摩擦和外力偏离目标。真正需要的是任务相关、方向相关、时间相关的柔顺性:接触前保证定位,接触后沿约束方向让步,在仍需追踪的方向保持足够刚度,并在几何变化或扰动出现时快速重估。
这个问题会反复出现在擦拭、翻转、插入、沿面跟随、装配、灵巧手和双臂协作中,因此它不是普通 tag,而是一条连接示教学习、力/触觉表示、动作生成和低层控制器接口的持续问题线。
为什么重要
- 真实机器人误差不可避免,纯位置策略容易把误差转成危险接触力。
- 固定均匀柔顺不能同时满足精确追踪和安全接触,柔顺性必须随方向与阶段变化。
- 学习策略通常低频运行,稳定接触还需要高频导纳、阻抗或触觉反馈回路兜底。
- 不同机器人开放的控制接口不同,动作表示是否能跨硬件执行会直接决定方法的工程价值。
当前理解
关键设计轴
- 柔顺来源:解析接触模型、重复示范统计、单示范近似标签、强化学习探索,或执行期触觉修正。
- 空间结构:统一标量刚度、逐轴对角刚度、完整六维刚度矩阵,还是由参考目标与虚拟目标隐式编码方向。
- 时间结构:接触前预调、接触后响应、动作 chunk 内反馈更新、突发扰动恢复,以及跨整个 episode 的接触事件计数与进度记忆。
- 策略—控制接口:策略直接输出力、刚度、导纳参数、虚拟目标,或只输出由独立高频控制器修正的位置动作。
- 观测硬件:腕部六轴力矩适合估计整体接触方向,指尖触觉适合局部滑移与形变;二者的可迁移性、成本和带宽不同。
- 评测目标:任务成功率之外,还应记录峰值力、工具/物体损坏、接触保持时间、轨迹误差和扰动恢复。
当前判断
ACP 给出了一个很有价值的最小接口:策略无需显式知道接触雅可比,只需从示范学习参考位姿、虚拟目标和刚度幅值,就能把方向性柔顺交给成熟低层控制器执行。它证明“柔顺性应该成为策略动作的一部分”,而不是部署时手工固定的控制器超参数。
但当前证据仍主要来自慢速、轻物体、非夹持接触和单一 UR5e 平台。后续路线需要把这一接口与高频指尖触觉、六维柔顺、跨硬件动作表示和在线恢复结合起来,才能判断它是否能从两项强演示扩展为通用接触操作方法。
FM-VLA 又补充了另一条轴:force 不仅是高频控制反馈,也可以成为低成本的 episodic memory。它在按钮计数和重复擦拭上显著胜过视觉记忆,说明接触策略需要同时设计快反馈与慢记忆;不过固定 8-token 压缩目前只在单一双臂平台、三项小规模任务上成立。
未解决问题
- 接触力不再主导、摩擦或惯性显著时,沿合力方向放软是否仍是正确近似?
- 多点夹持会违反非夹持锥假设,如何在不丢失抓持稳定性的情况下选择柔顺子空间?
- 一秒后见平滑能提前标注接触,但突发碰撞没有未来信息;训练和执行之间的差异如何补偿?
- 能否用低成本腕力估计、视觉接触估计或电机电流替代高端六轴力矩传感器?
- 面向安全的评测怎样避免“刚性基线先损坏工具、因而无法完成统计”这种不完整比较?
相关页面
- Adaptive Compliance Policy: Learning Approximate Compliance for Diffusion Guided Control
- Reactive Diffusion Policy: Slow-Fast Visual-Tactile Policy Learning for Contact-Rich Manipulation
- FM-VLA: Force-based Memory for Vision-Language-Action Models in Contact-Rich Manipulation
- T-Rex: Tactile-Reactive Dexterous Manipulation
- TacForcing: Streaming Action Generation with Execution-Time Tactile Feedback
- Tactile Representation
- Physical/Embodied Intelligence(domain)
相关材料
Reactive Diffusion Policy: Slow-Fast Visual-Tactile Policy Learning for Contact-Rich Manipulation
RDP 的关键不是“把力塞进 Diffusion Policy”,而是把力放到正确的时间尺度和网络位置:低频 latent diffusion policy 负责生成约 0.67 秒的高层动作块,快速 asymmetric tokenizer 则以 24 FPS 读取最新触觉或六维 wrench,把潜在动作解码成末端相对位姿。模型不输出目标力、阻抗或力矩,学到的是“看到这种受力与任务阶段时,位置应该再压入、退出还是沿曲面移动一点”。 这正面回应“小位移很难学、策略浮在表面”的问题。论文观察到有效修正确实只有亚毫米级:削皮器受力突增时向上卸力,接近黄瓜末端时向下压入以继续贴面,双臂夹杯接触后向外修正以免压瘪。真正决定能否学到的不是位移绝对值,而是示范中是否有稳定的“力变化—微位移—接触结果”相关性,以及训练、推理和机器人执行是否在时间上对齐。
FM-VLA: Force-based Memory for Vision-Language-Action Models in Contact-Rich Manipulation
FM-VLA 的关键不是给 VLA 再塞一种当前时刻传感器,而是把整段腕部力/力矩历史压缩成可供动作专家读取的长期事件记忆。它在找隐藏积木、精确计数按钮按压与碗内擦拭三项非马尔可夫任务上达到 83.3% 平均成功率,显著超过视觉记忆 π-MEM 的 53.7%,推理延迟仅比无记忆 π0.5 增加 3.3 ms。最值得记住的是“长时 force + 短时 state”的职责分工,但证据目前仍限于单一双臂平台和小规模任务。