TenStep

材料库

Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models
论文 2026-08-27 Vision-Language-Action

Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models

Senqiao Yang · Chengyao Wang · Yuxin Chen · Zixuan Wang · Longxiang Tang · Haokun Gui · Jinhui Ye · Changsheng Lu · Xiaoyang Wu · Mingkang Zhu · Pengguang Chen · Shu Liu · Zhuotao Tian · Hengshuang Zhao · Bei Yu · Jiaya Jia

VLAct 说明 VLA 的下一条独立增长轴不只是继续堆机器人轨迹,而是改造 continued pre-training 如何塑造 backbone 表示。在固定下游微调协议下,它仅替换预训练后的 Qwen3-VL-4B backbone,就在多项仿真、真机与未见 embodiment 迁移任务上取得 7.6–21.4 个百分点增益;最值得记住的是“保护 VLM 先验、用多动作头抵抗 decoder lock-in、只在物理可比维度共享动作语义”这套配方。

TacForcing: Streaming Action Generation with Execution-Time Tactile Feedback
论文 2026-08-26 Vision-Language-ActionTactile Representation

TacForcing: Streaming Action Generation with Execution-Time Tactile Feedback

Jianbo Zhou · Boyuan Zhao · Yuzheng Zhang · Yiyang Chen · Wenxin Chen · Qiuyue Li · Xiangyang Gu · Yuhan Cao · Xiao Xia · Yanzhe Hu · Zhijie Deng

单位 School of Computer Science, SJTUSCUTECUSTECNU

TacForcing 解决的不是“VLA 能否看到触觉”,而是“动作块执行到一半时,最新触觉能否继续改写尚未执行的动作”。它把一个动作 chunk 拆成顺序完成的块,保留未来块的 flow-matching 中间态,并用执行后新采集的触觉继续细化;EATA 只让最新触觉影响下一块,避免它提前污染更远期动作。六个 UniVTAC 仿真任务平均成功率 65%,三个真机任务平均 69%,但 v1 的真机评测每任务仅 16 次,尚不足以证明跨硬件泛化或实时成本优势。

What Matters for Latent Actions in Robot Learning
论文 2026-08-20 Vision-Language-Action

What Matters for Latent Actions in Robot Learning

Xizhou Bu · Qingda Hu · Lei Zhou · Lingfeng Zhang · Yingbo Tang · Zihao Liu · Xinyi Tao · Zhiqiang Ma · Qingqiu Huang · Chufeng Tang · Hongbo Wang · Jing Zhang · Jiayi Ma · Hangjun Ye · Wei Li · Xiaoshuai Hao

这是第一篇对 latent action model(LAM,隐式动作模型)做系统性实证研究的论文:把 LAPO、LAOF、CoMo、CFD-AE 等代表方法统一进同一个自编码框架,系统扫描了 41 个设计选择(建模范式、学习目标/正则化、隐式动作集成方式),并检验了 4 个代理指标能否预测下游操纵性能。核心结论是**原始 LAPO 反而是最强基线**,光学流(RAFT/SEA-RAFT)这类运动先验反而有害,隐式动作在 VLM 骨干微调后能显著提升下游策略与真实机械臂性能(真机成功率 64.75% → 79.25%)。对做「用无标注视频训练机器人」方向的人,这是一份可直接照抄的配方表。

暂无主图
blog 2026-08-10 Vision-Language-Action

DM0.5: 面向开放世界的通用具身智能基础模型

Dexmal 原力灵机

单位 DexmalDexmal 原力灵机(北京/重庆)

DM0.5 延续 VLA 架构(4B VLM 多模态主干 + 680M Action Expert),核心不是堆规模,而是四项系统增强:长历史上下文、具身推理(CoT)、动态动作对齐监督、数据质量清洗。换来的是开放环境 Zero-Shot 泛化、更长记忆、更鲁棒动作和多机型迁移,在 RoboChallenge Table30 v2 真机评测拿下 SOTA,并在 LIBERO / RoboTwin2.0 / R2R+RxR 导航基准上多项领先。

暂无主图
论文 2026-07-29 Vision-Language-Action

TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

Hengyi Xie · Chenfei Yao · Xianjin Wu · Xuanyang Xi · Yiping Tang · Di Xu · Yingying Zhu · Dingkang Liang · Xiang Bai · Han Ding

单位 Huawei TechnologiesHuazhong University of Science and Technology

TurboVLA 将高频控制从 LLM 居中的 V→L→A 改为轻量的直接 V+L→A,在 LIBERO 达到 97.7% 且只需 0.2B、31.2ms、0.9GB。

FM-VLA: Force-based Memory for Vision-Language-Action Models in Contact-Rich Manipulation
论文 2026-07-20 Long-Horizon Memory for Robot PoliciesContact-Rich Manipulation and Adaptive Compliance

FM-VLA: Force-based Memory for Vision-Language-Action Models in Contact-Rich Manipulation

Ruicheng Li · Qixiu Li · Ruichun Ma · Yu Deng · Lin Luo · Zhiying Du · Jianfeng Xiang · Huizhi Liang · Ruicheng Wang · Jiaolong Yang · Baining Guo

单位 Microsoft ResearchTsinghua UniversityFudan UniversityUniversity of Science and Technology of China

FM-VLA 的关键不是给 VLA 再塞一种当前时刻传感器,而是把整段腕部力/力矩历史压缩成可供动作专家读取的长期事件记忆。它在找隐藏积木、精确计数按钮按压与碗内擦拭三项非马尔可夫任务上达到 83.3% 平均成功率,显著超过视觉记忆 π-MEM 的 53.7%,推理延迟仅比无记忆 π0.5 增加 3.3 ms。最值得记住的是“长时 force + 短时 state”的职责分工,但证据目前仍限于单一双臂平台和小规模任务。

Heterogeneous Tactile Transformer
论文 2026-06-29 Tactile Representation

Heterogeneous Tactile Transformer

Jianxin Bi · Qiang Wang · Jayaram Reddy · Kelvin Lin · Soibkhon Khajikhanov · Ruihan Gao · Harold Soh

单位 National University of Singapore

HTT 是面向异构触觉传感器的自监督预训练框架:四种传感器共享同一个 Transformer trunk,靠 masked reconstruction + 双向跨模态预测把光学和阵列信号对齐到同一潜空间,并在未见过的新传感器上验证可迁移。

Multisensory Continual Learning: Adapting Pretrained Visuomotor Policies to Force
论文 2026-06-29 Vision-Language-ActionTactile Representation

Multisensory Continual Learning: Adapting Pretrained Visuomotor Policies to Force

Jaden Clark · Changhao Wang · Yihuai Gao · Seongheon Hong · Hojung Choi · Mark Cutkosky · Yifan Hou · Shuran Song

单位 Stanford University

这篇论文最值得记住的不是“给 VLA 加一条触觉输入”,而是它把新模态接入表述成 continual learning:在少量新 contact-rich 数据上学会用 force,同时尽量不破坏旧的视觉动作能力。MuSe 的价值在于,它用 multisensory future prediction 和 replay 证明,旧任务上即使没有力标注,也能把力学结构以可迁移的方式对齐进预训练策略;真正的短板则是仍依赖离线适配和专门的 compliance 控制接口,而不是端到端解决全闭环接触控制。

STEAM: Self-Supervised Temporal Ensemble Advantage Modeling for Real-World Robot Learning
论文 2026-06-29 Vision-Language-ActionOnline RL for VLA

STEAM: Self-Supervised Temporal Ensemble Advantage Modeling for Real-World Robot Learning

Zhihao Liu · Qiuyi Gu · Yitao Wang · Dongming Qiao · Yixian Zhang · Shuaihang Chen · Liangzhi Shi · Tianxing Zhou · Zefang Huang · Kang Chen · Zhen Guo · Quanlu Zhang · Jincheng Yu · Xiaodan Liang · Guoliang Fan · Yu Wang · Feng Gao · Xinlei Chen · Chao Yu

单位 Striding AIInfinigence AIInstitute of Automation, Chinese Academy of SciencesTsinghua University

STEAM 值得记住的点,是它把真实机器人数据清洗问题改写成“逐帧 advantage 建模”:不用人工奖励、不用 VLM 打分,也不假设整条轨迹好坏一致,而是从专家轨迹内部的时间顺序中学习哪些 frame pair 代表推进、停滞或倒退。它尤其适合 VLA/机器人策略在真实 rollout、人工纠正和混合质量数据上继续提升:先找出真正推进任务的局部片段,再把这些片段作为 CFGRL 的高质量训练信号。

Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models
论文 2026-06-16 Vision-Language-Action

Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models

Haoqi Yuan · Zhixuan Liang · Anzhe Chen · Ye Wang · Haoyang Li · Pei Lin · Yiyang Huang · Zixing Lei · Tong Zhang · Jiazhao Zhang · Jie Zhang · Jingyang Fan · Gengze Zhou · Qihang Peng · Chenxu Lv · Xiaoyue Chen · An Yang · Fei Huang · Junyang Lin · Dayiheng Liu · Jingren Zhou · Chenfei Wu · Xiong-Hui Chen

单位 AlibabaQwen TeamQwen Team, Alibaba

Qwen-RobotManip 的核心不是“再堆更多机器人数据”,而是先把不同机器人在**表示、运动和行为**三个层面拉到同一坐标系,再讨论规模化。论文最有价值的证据是:统一动作表示后,跨具身数据在 OOD 验证误差和下游成功率上才出现清晰的规模趋势;但“只用公开数据”的说法只适用于 manipulation corpus,完整训练还混入了含 proprietary data 的 VL 数据。

T-Rex: Tactile-Reactive Dexterous Manipulation
论文 2026-06-15 Tactile RepresentationVision-Language-Action

T-Rex: Tactile-Reactive Dexterous Manipulation

Dantong Niu · Zhuoyang Liu · Zekai Wang · Boning Shao · Zhao-Heng Yin · Anirudh Pai · Yuvan Sharma · Stefano Saravalle · Ruijie Zheng · Jing Wang · Ryan Punamiya · Mengda Xu · Yuqi Xie · Yunfan Jiang · Letian Fu · Konstantinos Kallidromitis · Matteo Gioia · Junyi Zhang · Jiaxin Ge · Haiwen Feng · Fabio Galasso · Wei Zhan · David M. Chan · Yutong Bai · Roei Herzig · Jiahui Lei · Li Fei-Fei · Ken Goldberg · Jitendra Malik · Pieter Abbeel · Yuke Zhu · Danfei Xu · Linxi Fan · Trevor Darrell

单位 NVIDIAPanasonicItalAIUC Berkeley

T-Rex 的关键贡献不是把触觉当作又一种静态输入,而是让现有 VLA 的低频视觉动作规划与高频触觉修正协同工作。它用 22889 小时人类第一视角视频预训练、100 小时触觉同步机器人数据中训练和约 100 条任务示范后训练,在 12 个真实双手灵巧任务上达到 65% 平均成功率,相比最强基线 EgoScale 的 35% 高出 30 个百分点。结果很强,但目前仍是单一硬件平台上的研究级验证。

暂无主图
论文 2026-05-28 Vision-Language-Action

Qwen-VLA 将操作、连续导航、轨迹预测和人类第一视角运动统一为同一 action-and-trajectory prediction 问题;它不是为每个机器人另训策略,而是用 Qwen3.5-4B 与 1.15B 参数 DiT 动作专家共享建模。其关键价值是以 embodiment-aware prompt 保留各平台原生控制语义,并用四阶段训练把语言—动作先验、视觉 grounding、任务对齐和成功率优化串起来。跨操作、导航、真实 OOD 与动态零样本基准的结果表明,这个统一接口并未以明显的 specialist 性能为代价。

DexJoCo: A Benchmark and Toolkit for Task-Oriented Dexterous Manipulation on MuJoCo
论文 2026-05-15 Vision-Language-ActionHuman-to-Robot Transfer

DexJoCo: A Benchmark and Toolkit for Task-Oriented Dexterous Manipulation on MuJoCo

Hanwen Wang · Weizhi Zhao · Xiangyu Wang · Siyuan Huang · He Lin · Boyuan Zheng · Rongtao Xu · Gang Wang · Yao Mu · He Wang · Lue Fan · Hongsheng Li · Zhaoxiang Zhang · Tieniu Tan

单位 GalbotNLPR & MAIS, CASIAShanghai Jiao Tong UniversityMBZUAI

DexJoCo 的价值不在于提出一个新策略模型,而在于把“灵巧手到底比夹爪强在哪里、现有 VLA/模仿学习策略在哪些灵巧交互上失败”变成了可系统测量的问题。它提供 11 个功能型 MuJoCo 任务、1.1K 条人类示范、低成本手套遥操作采集系统,以及面向视觉随机化、动力学随机化、多任务训练和 action-head 适配的评测工具链。对后续灵巧手机器人学习来说,这篇更像基础设施论文:它给出了一个比 pick-and-place 更接近真实灵巧操作的压力测试场。

AttenA+: Rectifying Action Inequality in Robotic Foundation Models
论文 2026-05-13 Vision-Language-Action

AttenA+: Rectifying Action Inequality in Robotic Foundation Models

Daojie Peng · Fulong Ma · Jiahang Cao · Qiang Zhang · Xupeng Xie · Jian Guo · Ping Luo · Andrew F. Luo · Boyu Zhou · Jun Ma

单位 HKUST(GZ)HKUUSTCIDEA Research

AttenA+ 的核心价值是指出 VLA/WAM 训练里一个很朴素但长期被忽略的问题:机器人动作时间步并不等价,慢速精细动作往往比快速过渡动作更决定任务成败。它用速度场给低速关键动作更高 loss 权重,不改模型结构、不加参数,却能在 Libero、RoboTwin 2.0 和真实 Franka 任务上稳定抬高强基线的上限。值得记住的不是某个复杂网络,而是“动作序列的物理结构可以直接进入训练目标”。

RL Token: Bootstrapping Online RL with Vision-Language-Action Models
论文 2026-04-24 Vision-Language-ActionOnline RL for VLA

RL Token: Bootstrapping Online RL with Vision-Language-Action Models

Charles Xu · Jost Tobias Springenberg · Michael Equi · Ali Amin · Adnan Esmail · Sergey Levine · Liyiming Ke

单位 Physical Intelligence

这篇工作最重要的点,是给 VLA 和在线 RL 之间找到了一个足够轻量的接口。作者没有直接对整套大模型做昂贵 RL,而是让预训练 VLA 暴露一个紧凑的 `RL token`,再在这个表示上训练小型 actor-critic,从而把 VLA 的泛化能力和 real-world online RL 的样本效率拼接起来。

π0.7: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities
论文 2026-04-16 Vision-Language-ActionHuman-to-Robot Transfer

π0.7: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities

Bo Ai · Ali Amin · Raichelle Aniceto · Ashwin Balakrishna · Greg Balke · Kevin Black · George Bokinsky · Shihao Cao · Thomas Charbonnier · Vedant Choudhary · Foster Collins · Ken Conley · Grace Connors · James Darpinian · Karan Dhabalia · Maitrayee Dhaka · Jared DiCarlo · Danny Driess · Michael Equi · Adnan Esmail · Yunhao Fang · Chelsea Finn · Catherine Glossop · Thomas Godden · Ivan Goryachev · Lachlan Groom · Haroun Habeeb · Hunter Hancock · Karol Hausman · Gashon Hussein · Victor Hwang · Brian Ichter · Connor Jacobsen · Szymon Jakubczak · Rowan Jen · Tim Jones · Gregg Kammerer · Ben Katz · Liyiming Ke · Mairbek Khadikov · Chandra Kuchi · Marinda Lamb · Devin LeBlanc · Brendon LeCount · Sergey Levine · Xinyu Li · Adrian Li-Bell · Vladislav Lialin · Zhonglin Liang · Wallace Lim · Yao Lu · Enyu Luo · Vishnu Mano · Nandan Marwaha · Aikys Mongush · Liam Murphy · Suraj Nair · Tyler Patterson · Karl Pertsch · Allen Z. Ren · Gavin Schelske · Charvi Sharma · Baifeng Shi · Lucy Xiaoyang Shi · Laura Smith · Jost Tobias Springenberg · Kyle Stachowicz · Will Stoeckle · Jiaming Tang · Jimmy Tanner · Shalom Tekeste · Marcel Torne · Kyle Vedder · Quan Vuong · Anna Walling · Haohuan Wang · Jason Wang · XuDong Wang · Chris Whalen · Samuel Whitmore · Blake Williams · Charles Xu · Sukwon Yoo · Lili Yu · Wuming Zhang · Zhuoyang Zhang · Ury Zhilinsky

单位 Physical Intelligence

π0.7 的关键价值不只是把模型继续做大,而是把“可控的通才机器人策略”往前推了一步。它试图解决的核心问题是:当训练数据越来越杂时,机器人基础模型怎样既能吃下示范、失败轨迹、人类视频和网页数据,又不在推理时退化成平均化、含糊的动作。作者给出的答案是把“怎么做”也写进 prompt,包括子任务语言、子目标图像、质量/速度/错误等 episode metadata,让模型学会在多模态上下文里被 steer。

MEM: Multi-Scale Embodied Memory for Vision Language Action Models
论文 2026-03-04 Vision-Language-ActionLong-Horizon Memory for Robot Policies

MEM: Multi-Scale Embodied Memory for Vision Language Action Models

Marcel Torne · Karl Pertsch · Homer Walke · Kyle Vedder · Suraj Nair · Brian Ichter · Allen Z. Ren · Haohuan Wang · Jiaming Tang · Kyle Stachowicz · Karan Dhabalia · Michael Equi · Quan Vuong · Jost Tobias Springenberg · Sergey Levine · Chelsea Finn · Danny Driess

单位 Physical IntelligenceStanford UniversityUC BerkeleyMIT

这篇工作的重点,是把机器人策略里的“记忆”从单一历史帧堆叠,升级成多尺度、多模态的长期记忆结构。MEM 用视频短期记忆处理最近视觉细节,用文本长期记忆保留高层语义进度,从而把 VLA 推到更长时间跨度的任务上。

DexImit: Learning Bimanual Dexterous Manipulation from Monocular Human Videos
论文 2026-02-10 Human Video Robot Data GenerationHuman-to-Robot Transfer

DexImit: Learning Bimanual Dexterous Manipulation from Monocular Human Videos

Juncheng Mu · Sizhe Yang · Yiming Bao · Hojin Bae · Tianming Wei · Linning Xu · Boyi Li · Huazhe Xu · Jiangmiao Pang

单位 NVIDIAShanghai AI LaboratoryTsinghua UniversityThe Chinese University of Hong Kong

DexImit 的价值在于把大量单目人类操作视频转成可训练的双手灵巧机器人数据,而不是直接把 human embodiment 当成 policy 输入。它通过重建、调度、动作生成和增强四阶段,把 Internet 或生成模型产生的人类视频变成物理可行的机器人轨迹,并在零真实机器人数据下支持 sim-to-real 部署。

Emergence of Human to Robot Transfer in Vision-Language-Action Models
论文 2025-12-27 Vision-Language-ActionHuman-to-Robot Transfer

Emergence of Human to Robot Transfer in Vision-Language-Action Models

Simar Kareer · Karl Pertsch · James Darpinian · Judy Hoffman · Danfei Xu · Sergey Levine · Chelsea Finn · Suraj Nair

单位 Physical IntelligenceGeorgia Institute of Technology

这篇论文的关键判断是:`human-to-robot transfer` 不是简单靠对齐技巧手工做出来的,而是会随着 VLA 预训练规模和多样性增长而“涌现”。也就是说,当机器人预训练覆盖足够多任务、场景和 embodiment 后,模型开始能够真正从 human video 中学到对机器人有用的东西。

Reactive Diffusion Policy: Slow-Fast Visual-Tactile Policy Learning for Contact-Rich Manipulation
论文 2025-03-04 Contact-Rich Manipulation and Adaptive ComplianceTactile Representation

Reactive Diffusion Policy: Slow-Fast Visual-Tactile Policy Learning for Contact-Rich Manipulation

Han Xue · Jieji Ren · Wendi Chen · Gu Zhang · Yuan Fang · Guoying Gu · Huazhe Xu · Cewu Lu

单位 Shanghai Jiao Tong UniversityTsinghua University, IIISShanghai Qi Zhi InstituteShanghai AI Laboratory

RDP 的关键不是“把力塞进 Diffusion Policy”,而是把力放到正确的时间尺度和网络位置:低频 latent diffusion policy 负责生成约 0.67 秒的高层动作块,快速 asymmetric tokenizer 则以 24 FPS 读取最新触觉或六维 wrench,把潜在动作解码成末端相对位姿。模型不输出目标力、阻抗或力矩,学到的是“看到这种受力与任务阶段时,位置应该再压入、退出还是沿曲面移动一点”。 这正面回应“小位移很难学、策略浮在表面”的问题。论文观察到有效修正确实只有亚毫米级:削皮器受力突增时向上卸力,接近黄瓜末端时向下压入以继续贴面,双臂夹杯接触后向外修正以免压瘪。真正决定能否学到的不是位移绝对值,而是示范中是否有稳定的“力变化—微位移—接触结果”相关性,以及训练、推理和机器人执行是否在时间上对齐。

Adaptive Compliance Policy: Learning Approximate Compliance for Diffusion Guided Control
论文 2024-10-12 Contact-Rich Manipulation and Adaptive Compliance

Adaptive Compliance Policy: Learning Approximate Compliance for Diffusion Guided Control

Yifan Hou · Zeyi Liu · Cheng Chi · Eric Cousineau · Naveen Kuppuswamy · Siyuan Feng · Benjamin Burchfiel · Shuran Song

单位 Toyota Research InstituteStanford University

ACP 把柔顺性从低层控制器里的固定超参数提升为策略需要预测的动作变量:它从单条人体示范近似标注空间与时间变化的刚度方向和幅值,再由扩散策略结合视觉、位姿和力反馈生成。真实机器人翻转与花瓶擦拭分别达到 96% 和 93.75% 总成功率,显著超过固定柔顺和刚性位置策略。最值得记住的是它把接触约束转成可学习标签,但结论依赖慢速、轻物体、非夹持接触等明确假设。

OpenVLA: An Open-Source Vision-Language-Action Model
论文 2024-06-13 Vision-Language-Action

OpenVLA: An Open-Source Vision-Language-Action Model

Ted Xiao · Ashwin Balakrishna · Suraj Nair · Rafael Rafailov · Ethan Foster · Pannag Sanketi · Quan Vuong · Thomas Kollar · Benjamin Burchfiel · Russ Tedrake · Dorsa Sadigh · Sergey Levine · Percy Liang · Chelsea Finn

单位 Toyota Research InstituteGoogle DeepMindPhysical IntelligenceStanford University

OpenVLA 的价值不只是开源一个 VLA 模型,而是把可训练、可微调、可部署的完整开源机器人大模型工作流真正落到了实践层面。

第 1 页

最近材料

2026-08-27

VLAct 说明 VLA 的下一条独立增长轴不只是继续堆机器人轨迹,而是改造 continued pre-training 如何塑造 backbone 表示。在固定下游微调协议下,它仅替换预训练后的 Qwen3-VL-4B backbone,就在多项仿真、真机与未见 embodiment 迁移任务上取得 7.6–21.4 个百分点增益;最值得记住的是“保护 VLM 先验、用多动作头抵抗 decoder lock-in、只在物理可比维度共享动作语义”这套配方。

打开阅读