Adaptive Compliance Policy: Learning Approximate Compliance for Diffusion Guided Control
Adaptive Compliance Policy: Learning Approximate Compliance for Diffusion Guided Control
Yifan Hou · Zeyi Liu · Cheng Chi · Eric Cousineau · Naveen Kuppuswamy · Siyuan Feng · Benjamin Burchfiel · Shuran Song
一句话结论
ACP 把柔顺性从低层控制器里的固定超参数提升为策略需要预测的动作变量:它从单条人体示范近似标注空间与时间变化的刚度方向和幅值,再由扩散策略结合视觉、位姿和力反馈生成。真实机器人翻转与花瓶擦拭分别达到 96% 和 93.75% 总成功率,显著超过固定柔顺和刚性位置策略。最值得记住的是它把接触约束转成可学习标签,但结论依赖慢速、轻物体、非夹持接触等明确假设。
关键词
摘要
中文摘要
柔顺性在机器人操作中至关重要,因为它需要在不确定条件下同时平衡位置与力控制。然而,当代视觉运动策略通常只关注位置控制,柔顺性往往被忽略。本文提出自适应柔顺策略 ACP:一个从人类示范学习、能够针对操作任务在空间和时间上动态调整系统柔顺性的框架,相比依赖预选柔顺参数或假设各方向恒定均匀刚度的方法更进一步。由于从人类示范完整恢复柔顺参数本身是不适定问题,作者改为估计一种近似柔顺轮廓,使其同时具备避免巨大接触力和鼓励准确轨迹跟踪两项性质。该方法使机器人能够处理复杂的接触密集操作,并相对先进视觉运动策略获得超过 50% 的性能提升。
英文摘要
Compliance plays a crucial role in manipulation, as it balances between the concurrent control of position and force under uncertainties. Yet compliance is often overlooked by today’s visuomotor policies that solely focus on position control. This paper introduces Adaptive Compliance Policy (ACP), a novel framework that learns to dynamically adjust system compliance both spatially and temporally for given manipulation tasks from human demonstrations, improving upon previous approaches that rely on pre-selected compliance parameters or assume uniform constant stiffness. However, computing full compliance parameters from human demonstrations is an ill-defined problem. Instead, we estimate an approximate compliance profile with two useful properties: avoiding large contact forces and encouraging accurate tracking. Our approach enables robots to handle complex contact-rich manipulation tasks and achieves over 50% performance improvement compared to state-of-the-art visuomotor policy methods. For result videos, see https://adaptive-compliance.github.io/.
直观理解
背景与问题
为什么做
接触密集操作同时要求位置轨迹与接触力正确。过高刚度可以精确追踪,却会把视觉或标定误差转成巨大内力,造成物体滑动、工具损坏或安全停机;各方向统一降低刚度虽然更安全,却会让摩擦把末端带离目标。更困难的是,所需柔顺性会随接触阶段、受力方向和任务而变化:翻转物体时应沿推力方向软、沿弧线切向保持硬,擦拭花瓶时双臂还要根据三维曲面和接触法向持续调整。
问题缺口
已有柔顺控制往往依赖已知接触几何、摩擦和动力学模型,或要求同一任务的多次重复轨迹来估计刚度;这些条件难以覆盖视觉场景变化和意外扰动。单条人体示范也不足以唯一恢复完整质量、阻尼与刚度,因为人的手改变了系统的有效动力学,某些时段甚至没有足够的力—运动变化。论文因此不追求还原人体真实柔顺性,而是询问:能否在温和物理假设下,从每条不同的示范构造一个足以避免约束冲突、又保留轨迹精度的近似柔顺标签,并让策略根据视觉和力反馈在线泛化?
方法
方法概述
ACP 的完整流程是“柔顺示教采集—近似刚度标注—多模态扩散策略—高频低层执行”。操作者在低刚度、低阻尼、低虚拟质量的导纳控制下直接牵引 UR5e,系统同步记录 RGB、末端位姿与六轴力矩;离线阶段从力方向构造各向异性刚度矩阵和虚拟目标位姿;训练阶段让扩散策略根据近期视觉、位姿和力历史联合预测参考位姿、虚拟目标与低刚度幅值;推理时再重建完整刚度矩阵交给高频导纳控制器。
核心机制
核心近似是沿反馈力方向使用低刚度、在所有正交方向使用高刚度。反馈力给出接触法向锥内部的一条方向;在“接触力主导、所有接触力非零、接触不形成夹持锥”的假设下,释放该方向的速度约束总能找到满足接触不穿透条件的运动,而其余方向保持高刚度有助于精确追踪。作者用以归一化力方向为第一基向量的正交基旋转对角刚度矩阵,并让低刚度随力幅值从最大值连续降到最小值;参考位姿与虚拟目标的差编码低刚度方向,低刚度标量编码幅值,从而把显式力目标转成跨机器人更容易执行的位置式表示。
方法拆解
- 示教采集:UR5e 在低刚度、低阻尼和低虚拟质量的导纳控制下接受动觉示教,GoPro、末端位姿与 ATI mini-45 六轴力矩同步记录,操作者通过直接触觉反馈自然展示不同接触阶段。
- 柔顺方向标注:对每个时刻取滤波后的反馈力方向为低刚度轴,其余正交轴设为经验高刚度;当力很小时所有方向使用高刚度,避免自由空间追踪变软。
- 柔顺幅值标注:低刚度在力幅小于阈值时保持最大值,随后随力幅线性下降,超过上阈值后固定为最小值,以缓和噪声方向估计并在强接触时增加让步。
- 动作表示:每个机械臂每步输出 19 维,包括 9 维参考位姿、9 维虚拟目标位姿和 1 个低刚度标量;两位姿之差决定推理时的柔顺方向。
- 多模态扩散策略:近期两帧 RGB 经 CLIP 预训练 ViT-B/16 编码,末端位姿取三帧历史;力矩历史用五层因果卷积或六通道频谱图加 CoordConv/ResNet-18 编码,再以 Transformer 自注意力融合视觉与力特征并条件化扩散动作头。
- 训练与执行:整段力矩先用一秒移动平均平滑,再计算刚度与虚拟目标,使标签带有即将接触的后见信息;推理时从两目标方向重建刚度矩阵,把参考位姿、虚拟目标和刚度发送给高频导纳控制器。
结果
- 翻转的五类测试覆盖训练物体、未见物体、先推后翻、不同夹具位姿和不稳定夹具;ACP 分别达到 90%、95%、95%、100% 和 100%,说明视觉与力反馈能够对几何变化和夹具扰动在线调节柔顺方向。
- 花瓶擦拭收集 200 条双臂示范,在 16 次测试中 ACP 总成功率 93.75%,无 FFT 版本 81.25%,固定柔顺策略 43.75%;刚性策略因多次折断擦拭工具而未进入量化表。
- 擦拭任务中 ACP 在小标记、接触前扰动和接触后扰动场景均为 100%,大标记为 80%;固定柔顺策略分别只有 60%、25%、100% 和 20%,主要受摩擦导致的轨迹偏离影响。
- FFT 相比因果卷积主要改善擦拭:总成功率从 81.25% 提高到 93.75%,作者观察到频谱编码与 RGB 交互后更善于选择下一次擦拭位置,但论文没有给出更细的频率消融。
洞察
- 论文没有求解完整接触几何,而是用力方向作为接触约束锥的可观测代理;这是一个典型的“只恢复决策所需结构、不恢复全部物理参数”的建模选择。
- 一秒移动平均不仅去噪,还把未来接触信息泄露进动作标签,使策略能在真正接触前开始降低刚度。它对平滑接触有利,但也意味着监督标签是离线后见构造,在线突发接触仍只能依赖反馈修正。
- 翻转中 FFT 没有优势、擦拭中明显有优势,说明力信号编码器应匹配任务的接触频谱;不是所有接触密集任务都需要高成本频域表示。
- 相对固定均匀柔顺策略,ACP 只沿当前接触力方向让步,在正交方向保持高刚度,因此同时避免过大内力和摩擦导致的轨迹漂移。
- 相对解析柔顺优化与重复示范估计,ACP 不需要测试时显式计算接触雅可比,也不要求每个场景重复同一轨迹;代价是理论保证只在简化接触假设内成立。
- 用“参考目标 + 虚拟目标”编码力或柔顺方向,是一种能复用现有位置接口和低层阻抗控制器的工程抽象。
- 对接触标签使用适度后见平滑可以提前标注接触过渡,但部署前应检查平滑窗口带来的延迟、信息泄露与意外碰撞响应边界。
风险与判断
局限
- 理论和标签构造依赖三项关键假设:接触力相对惯性、摩擦和重力占主导,所有已建立接触的法向力非零,并且接触法向锥不形成夹持;夹持、快速运动、重物或强摩擦场景可能违反这些条件。
- 实验只在 UR5e 上验证三维平移柔顺,虽然公式可扩展到六维,但转动柔顺、不同机器人控制接口和跨硬件迁移没有实证。
- 策略仍依赖昂贵的 ATI mini-45 力矩传感器和高频信号流;“无力传感器机器人可执行虚拟目标”只说明动作表示兼容,不等于该机器人能够在没有力反馈输入时运行同一策略。
- 比较只包含同数据同训练轮数的 Diffusion Policy 变体,未与基于显式接触模型、混合力位控制或强化学习得到的强柔顺控制器进行统一协议对比。
- 擦拭评测总共只有 16 次且刚性策略因损坏工具被排除出结果表,样本规模与不完整基线使 93.75% 的统计稳定性有限。
适用场景
- 适合速度较低、物体较轻、接触法向可由六轴力矩稳定反映的推、擦、沿面跟随、装配预接触和其他非夹持接触操作。
- 适合已有高频导纳或阻抗控制器、能够采集动觉示教与同步视觉—力数据,并希望让策略跨物体几何或夹具扰动调整柔顺性的研究平台。
- 不应直接用于高速冲击、重物搬运、多点夹持、强摩擦主导或缺少力反馈的安全关键部署,除非重新验证假设并加入保护控制。
最终判断
- ACP 是接触密集模仿学习中值得保留的一条关键路线:它以很小的动作表示扩展,把固定控制器参数变成随状态预测的策略变量,并在两项真实任务中给出大幅、可解释的增益。
- 其 96% 和 93.75% 结果不能简单外推为通用接触操作已解决,因为任务数、硬件、运动速度与接触类型都受限,擦拭样本尤其小。
- 后续最值得验证的是六维柔顺、跨机器人迁移、夹持与摩擦主导任务、无需高端力传感器的状态估计,以及和现代触觉 VLA 或在线强化学习结合后的恢复能力。
相关主题
Contact-Rich Manipulation and Adaptive Compliance
接触密集操作中的运动—力联合学习路线:如何从示范与实时力/触觉反馈学习任务相关柔顺性和主动微位移修正,并在安全接触、轨迹精度与快速响应之间动态权衡。
打开主题
继续阅读
上一篇
OpenVLA: An Open-Source Vision-Language-Action Model
OpenVLA 的价值不只是开源一个 VLA 模型,而是把可训练、可微调、可部署的完整开源机器人大模型工作流真正落到了实践层面。
下一篇
Reactive Diffusion Policy: Slow-Fast Visual-Tactile Policy Learning for Contact-Rich Manipulation
RDP 的关键不是“把力塞进 Diffusion Policy”,而是把力放到正确的时间尺度和网络位置:低频 latent diffusion policy 负责生成约 0.67 秒的高层动作块,快速 asymmetric tokenizer 则以 24 FPS 读取最新触觉或六维 wrench,把潜在动作解码成末端相对位姿。模型不输出目标力、阻抗或力矩,学到的是“看到这种受力与任务阶段时,位置应该再压入、退出还是沿曲面移动一点”。 这正面回应“小位移很难学、策略浮在表面”的问题。论文观察到有效修正确实只有亚毫米级:削皮器受力突增时向上卸力,接近黄瓜末端时向下压入以继续贴面,双臂夹杯接触后向外修正以免压瘪。真正决定能否学到的不是位移绝对值,而是示范中是否有稳定的“力变化—微位移—接触结果”相关性,以及训练、推理和机器人执行是否在时间上对齐。
