机器人如何真正理解接触?

读《Learning Physical Interaction》

从早期触觉学习到多模态融合,理解机器人如何把接触信号转化为可执行、可修正的动作。
论文阅读
具身智能
触觉感知
机器人学习
作者

neutrino

发布于

2026年8月15日

视觉可以告诉机器人物体在哪里、任务是什么,却很难完整回答接触之后发生了什么。夹爪是否已经碰到物体?接触面是否正在滑动?插入时的阻力来自摩擦,还是来自姿态偏差?这些问题不能只靠“看”,还需要机器人在动作过程中持续感受并调整。

Learning Physical Interaction: A Survey of Tactile- and Force-aware Robot Learning (Shan 等 2026年) 讨论的核心正是这条链路:触觉与力觉如何从局部、短暂的接触信号,变成能够参与表示学习、动作生成和闭环控制的物理信息。

接触不是一张静态图像

自由空间中的操作可以主要依赖视觉规划,但进入接触后,关键状态往往不可见:物体可能被手遮挡,材料会发生形变,几毫米的位置误差也可能带来完全不同的接触力。

力觉与触觉提供的是两种互补信息:腕部六维力或关节力矩描述整体负载,触觉则描述局部接触位置、压力分布、形变与滑移。前者回答“机器人整体受到了多大的力”,后者更接近“力发生在哪里、接触是否稳定”。

但触觉也有一个根本限制:一次接触只能暴露物体很小的一部分,而且读数会随着机器人的动作改变。机器人按压、滑动或重新抓取时,得到的不是同一状态的重复测量,而是一串由动作主动产生的观察。因此,触觉学习从一开始就不是单纯的分类问题,而是一个感知—动作耦合的时序问题

Early Tactile Learning:触觉学习的三条起点

论文回顾的早期触觉学习并不依赖今天的大模型,却已经建立了三个延续至今的基本思想。

从一次接触转向一段接触历史

单次触碰提供的信息局部且含糊,同样的压力分布可能来自不同物体或不同接触姿态。早期方法因此使用时序模型累积多次接触,让机器人随着新的测量逐步更新判断;持续学习方法还尝试在加入新物体类别时保留已经学到的知识。

这里真正重要的不是某一种网络结构,而是对触觉信息性质的认识:触觉证据需要在时间中积累。机器人不是“摸一下就知道”,而是在连续探索中不断缩小不确定性。

让视觉与触觉各自回答擅长的问题

视觉在接触前提供全局形状、位置和场景语义,触觉在接触后揭示局部形变、滑移和接触稳定性。早期视觉—触觉方法已经开始利用这种分工:根据两种信号预测调整抓取后的结果,选择是否重新抓取;或者通过自监督学习,把成对的视觉与触觉观察映射到可迁移的共享表示。

这种互补并不意味着把两路数据简单拼在一起。视觉适合回答“目标在哪里”,触觉适合回答“此刻接触得怎样”,二者产生信息的时机、空间尺度和可靠性都不同。

把触觉从识别输入变成控制反馈

触觉学习的第三条路线直接进入动作闭环:在底层用滑移检测调节抓取力,在运动层学习柔顺行为或沿轮廓保持接触,在技能层用触觉状态判断一个动作原语是否完成、是否应该纠正或切换到下一步。

这一步把触觉的角色从“识别物体的传感器”推进为“决定接下来怎么动的反馈”。今天的触觉策略虽然模型更大、任务更多,本质上仍在延续这三个问题:如何利用时间、如何结合其他模态,以及如何让接触真正改变动作。

TF-ART:四个 Phase 如何协作

TF-ART 的重点不是给方法贴标签,而是把“感知接触”到“稳定执行”拆成四个相互衔接的阶段。

图 1: TF-ART 将触觉、力觉、视觉、语言和机器人状态组织为一个多阶段系统:先完成多模态融合与主动作生成,再利用接触反馈修正动作,最后交给反应式控制器执行。图片来源:Learning Physical Interaction (Shan 等 2026年)
阶段 主要任务 核心问题
Phase 0:感知与融合 编码触觉、力觉、视觉、语言和本体状态 不同模态如何表示、对齐与融合
Phase 1:主动作生成 生成动作或供下游使用的中间变量 如何得到完成任务的整体动作
Phase 2:动作修正 根据接触反馈局部调整 Phase 1 的结果 如何更快、更精细地响应接触变化
Phase 3:机器人端控制 将策略输出变成稳定的硬件控制 如何保证接触过程中的柔顺与安全

Phase 0:多模态感知与融合

不同触觉传感器会输出触觉图像、taxel 矩阵、接触点、振动序列或事件流;力觉通常是腕部六维力/力矩、关节力矩或由本体状态估计出的外力。它们与图像、语言和机器人状态在维度、频率、坐标系和语义层级上都不相同。

因此,多模态系统要解决两个相互关联但并不相同的问题:先学到有用的表示,再决定这些表示如何共同影响动作。

图 2: Phase 0 的多模态融合与编码框架:上半部分列出力觉、触觉、视觉、语言、机器人状态和声音等观测,下半部分展示 MoE、FiLM、Attention、门控过滤以及输入重建。图片来源:Learning Physical Interaction (Shan 等 2026年)
  • 输入:力觉、触觉、视觉、语言、机器人状态,以及声音等其他信号。
  • 表示:通过重建、掩码自编码、向量量化或对比学习保留并对齐信息。
  • 融合:使用 FiLM、Attention、MoE 或门控机制组合不同模态。
  • 输出:融合特征送入 Phase 1,部分触觉、力觉或状态也可以直接送往 Phase 2 和 Phase 3。

表示学习:既要对齐,也要保留差异

理想的多模态表示存在一组张力:描述同一次交互的视觉、触觉和语言应该在语义上彼此接近,但触觉中的细微形变、力觉中的瞬态峰值又不能在“对齐”过程中被抹掉。论文将常见方法归纳为四类:

方法 学习目标 对触觉的意义
辅助重建 从潜在特征恢复原始输入 迫使编码器保留接触几何与形变细节
掩码自编码 根据未遮挡模态或局部信息补全缺失部分 学习模态内部结构与跨模态对应关系
向量量化 将连续触觉特征映射为离散代码 获得更紧凑、对噪声更稳健的接触表示
对比对齐 拉近同一交互的跨模态表示,推远不匹配样本 让视觉、触觉、声音或语言共享语义空间

重建强调“不要丢掉本模态的细节”,对齐强调“让不同模态能够互相理解”。一个好的物理交互表示往往需要同时满足这两个目标,而不是把触觉压缩成视觉表示的附属品。

融合机制:在正确的时刻使用正确的信号

表示形成之后,策略仍要决定每种模态以什么方式进入动作生成。综述梳理了四种主要机制:

融合机制 怎么工作 适合解决的问题
FiLM 注入 用感知特征生成缩放与偏移参数,调制动作特征 以较低开销为 Diffusion Policy 等模型加入条件
Attention Conditioning 让动作 token 查询视觉、触觉或力觉 token 建立动作步骤与具体接触证据之间的细粒度联系
Mixture-of-Experts 将不同模态或阶段的 token 路由给专门的专家 在接近、接触、调整等阶段切换处理重点
Gated Filtering 根据任务阶段动态放大或抑制某种模态 避免自由空间中的触觉噪声干扰策略,在接触后及时启用反馈

其中,门控与专家路由尤其符合物理交互的阶段性。机器人尚未接触物体时,视觉和语言更有价值;接触建立后,触觉与力觉的重要性迅速上升。真正有效的融合不是让所有模态始终拥有相同权重,而是让信息的贡献随交互状态变化。

Phase 1:生成主动作

Phase 1 是主要决策模块,负责把 Phase 0 的融合表示转成具有物理意义的动作或中间变量。

图 3: Phase 1 接收融合后的多模态特征,可使用 VLA、Diffusion/Flow Matching、ACT、RL 或回归模型生成主动作,同时输出动作块、控制刚度、参考力或其他中间变量。图片来源:Learning Physical Interaction (Shan 等 2026年)
  • 输入:Phase 0 编码并融合后的多模态特征。
  • 方法:VLA、Diffusion/Flow Matching、ACT、强化学习或回归模型。
  • 输出:动作块或参考轨迹,也可以是控制刚度、参考力和潜在表示。
  • 去向:动作可直接交给 Phase 3,也可先送入 Phase 2 做局部修正。
  • 关键作用:利用语言、视觉和全局状态确定任务的主要动作方向。

Phase 2:根据接触修正动作

Phase 2 不重新规划整个任务,而是利用接触阶段的新信息修正 Phase 1 给出的动作草案。

图 4: Phase 2 同时接收从融合层直接传来的触觉、力觉和状态,以及 Phase 1 生成的动作、参考力或潜在表示,再输出修正后的动作或控制目标。图片来源:Learning Physical Interaction (Shan 等 2026年)
  • 输入:Phase 1 的预测,以及绕过 Phase 1 直接送来的触觉、力觉和机器人状态。
  • 方法:ACT、Diffusion/Flow Matching、强化学习、回归模型或显式算法。
  • 输出:修正后的动作、参考力或其他中间控制量。
  • 修正对象:位置偏差、接触方向、施力大小、滑移和卡阻等局部问题。
  • 关键作用:用较小、较快的模块处理高频接触反馈,避免高层策略承担全部实时控制。

Phase 3:把策略输出变成稳定控制

Phase 3 位于学习策略与机器人硬件之间,目标不是继续理解任务,而是让动作在真实接触中稳定执行。

图 5: Phase 3 接收动作、参考力、控制刚度、机器人状态和实时力反馈,通过 PD、力/位混合、导纳或阻抗控制驱动机器人。图片来源:Learning Physical Interaction (Shan 等 2026年)
Shan, Shilin, Chuhao Zhou, Ruize Wang, 等. 2026年. Learning Physical Interaction: A Survey of Tactile- and Force-aware Robot Learning. https://doi.org/10.48550/arXiv.2608.07558.
  • 输入:主动作或修正动作、参考力、控制刚度、机器人状态和实时力/力矩。
  • 方法:PD/PID、力—位混合控制、导纳控制和阻抗控制。
  • 输出:机器人底层可执行的位置、速度或力矩命令。
  • 反馈:控制器持续比较目标与实际接触状态,而不是只执行一次策略预测。
  • 关键作用:在碰撞、摩擦和外力扰动下维持柔顺、稳定与安全。

四个 Phase 由此对应不同时间尺度:Phase 0 组织信息,Phase 1 决定主要动作,Phase 2 根据接触快速纠偏,Phase 3 持续稳定执行。触觉和力觉的价值不只在输入端,而在于能够沿着这条链路真正改变动作。

真正困难的是让触觉不被忽略

多模态并不天然带来更好的策略。视觉和语言信息密集、预训练充分,很容易主导梯度;触觉和力觉只在短暂的接触阶段变得关键,模型可能在训练中学会忽略它们,却仍能在简单任务上获得不错的平均损失。

这使得“平衡融合”比增加模态数量更重要。一方面,训练目标要避免视觉分支长期压制触觉分支;另一方面,策略需要知道模态何时可信。例如接触前关闭无意义的触觉输入,接触后提高触觉与力觉权重,传感器异常时又能退回视觉与本体状态。

还有一个更深的问题是跨传感器泛化。同一种接触,在不同触觉硬件上可能表现为图像、压力矩阵或稀疏接触点;更换安装位置、工具和机器人本体,也会改变力信号的分布。共享语义空间能够缩小差异,但不能替代对局部物理细节的保留。如何同时获得统一性与精细度,仍是触觉基础模型必须面对的矛盾。

从“感受到”走向“会调整”

Early Tactile Learning 留下的启发非常清楚:触觉是一种通过动作获得、需要随时间解释,并且最终应当进入反馈闭环的感知。多模态学习把这个问题扩展了——机器人不仅要理解每一种信号,还要学会在不同交互阶段协调它们。

因此,这篇综述最值得保留的并不是“给模型再加一种输入”,而是两个判断:第一,触觉必须作为时序中的主动感知来学习;第二,多模态融合必须与动作阶段和控制层级一起设计。

机器人真正理解接触的标志,不是能够描述压力图,也不是在网络输入中出现了 tactile token,而是它能根据接触历史判断当前状态,在视觉与触觉之间选择可靠证据,并在发现滑移、卡阻或过载时及时改变动作。物理智能最终体现在这种持续调整之中。

参考资料