视觉可以告诉机器人物体在哪里、任务是什么,却很难完整回答接触之后发生了什么。夹爪是否已经碰到物体?接触面是否正在滑动?插入时的阻力来自摩擦,还是来自姿态偏差?这些问题不能只靠“看”,还需要机器人在动作过程中持续感受并调整。
Learning Physical Interaction: A Survey of Tactile- and Force-aware Robot Learning (Shan 等 2026年) 讨论的核心正是这条链路:触觉与力觉如何从局部、短暂的接触信号,变成能够参与表示学习、动作生成和闭环控制的物理信息。
接触不是一张静态图像
自由空间中的操作可以主要依赖视觉规划,但进入接触后,关键状态往往不可见:物体可能被手遮挡,材料会发生形变,几毫米的位置误差也可能带来完全不同的接触力。
力觉与触觉提供的是两种互补信息:腕部六维力或关节力矩描述整体负载,触觉则描述局部接触位置、压力分布、形变与滑移。前者回答“机器人整体受到了多大的力”,后者更接近“力发生在哪里、接触是否稳定”。
但触觉也有一个根本限制:一次接触只能暴露物体很小的一部分,而且读数会随着机器人的动作改变。机器人按压、滑动或重新抓取时,得到的不是同一状态的重复测量,而是一串由动作主动产生的观察。因此,触觉学习从一开始就不是单纯的分类问题,而是一个感知—动作耦合的时序问题。
Early Tactile Learning:触觉学习的三条起点
论文回顾的早期触觉学习并不依赖今天的大模型,却已经建立了三个延续至今的基本思想。
从一次接触转向一段接触历史
单次触碰提供的信息局部且含糊,同样的压力分布可能来自不同物体或不同接触姿态。早期方法因此使用时序模型累积多次接触,让机器人随着新的测量逐步更新判断;持续学习方法还尝试在加入新物体类别时保留已经学到的知识。
这里真正重要的不是某一种网络结构,而是对触觉信息性质的认识:触觉证据需要在时间中积累。机器人不是“摸一下就知道”,而是在连续探索中不断缩小不确定性。
让视觉与触觉各自回答擅长的问题
视觉在接触前提供全局形状、位置和场景语义,触觉在接触后揭示局部形变、滑移和接触稳定性。早期视觉—触觉方法已经开始利用这种分工:根据两种信号预测调整抓取后的结果,选择是否重新抓取;或者通过自监督学习,把成对的视觉与触觉观察映射到可迁移的共享表示。
这种互补并不意味着把两路数据简单拼在一起。视觉适合回答“目标在哪里”,触觉适合回答“此刻接触得怎样”,二者产生信息的时机、空间尺度和可靠性都不同。
把触觉从识别输入变成控制反馈
触觉学习的第三条路线直接进入动作闭环:在底层用滑移检测调节抓取力,在运动层学习柔顺行为或沿轮廓保持接触,在技能层用触觉状态判断一个动作原语是否完成、是否应该纠正或切换到下一步。
这一步把触觉的角色从“识别物体的传感器”推进为“决定接下来怎么动的反馈”。今天的触觉策略虽然模型更大、任务更多,本质上仍在延续这三个问题:如何利用时间、如何结合其他模态,以及如何让接触真正改变动作。
TF-ART:四个 Phase 如何协作
TF-ART 的重点不是给方法贴标签,而是把“感知接触”到“稳定执行”拆成四个相互衔接的阶段。
| 阶段 | 主要任务 | 核心问题 |
|---|---|---|
| Phase 0:感知与融合 | 编码触觉、力觉、视觉、语言和本体状态 | 不同模态如何表示、对齐与融合 |
| Phase 1:主动作生成 | 生成动作或供下游使用的中间变量 | 如何得到完成任务的整体动作 |
| Phase 2:动作修正 | 根据接触反馈局部调整 Phase 1 的结果 | 如何更快、更精细地响应接触变化 |
| Phase 3:机器人端控制 | 将策略输出变成稳定的硬件控制 | 如何保证接触过程中的柔顺与安全 |
Phase 0:多模态感知与融合
不同触觉传感器会输出触觉图像、taxel 矩阵、接触点、振动序列或事件流;力觉通常是腕部六维力/力矩、关节力矩或由本体状态估计出的外力。它们与图像、语言和机器人状态在维度、频率、坐标系和语义层级上都不相同。
因此,多模态系统要解决两个相互关联但并不相同的问题:先学到有用的表示,再决定这些表示如何共同影响动作。
- 输入:力觉、触觉、视觉、语言、机器人状态,以及声音等其他信号。
- 表示:通过重建、掩码自编码、向量量化或对比学习保留并对齐信息。
- 融合:使用 FiLM、Attention、MoE 或门控机制组合不同模态。
- 输出:融合特征送入 Phase 1,部分触觉、力觉或状态也可以直接送往 Phase 2 和 Phase 3。
表示学习:既要对齐,也要保留差异
理想的多模态表示存在一组张力:描述同一次交互的视觉、触觉和语言应该在语义上彼此接近,但触觉中的细微形变、力觉中的瞬态峰值又不能在“对齐”过程中被抹掉。论文将常见方法归纳为四类:
| 方法 | 学习目标 | 对触觉的意义 |
|---|---|---|
| 辅助重建 | 从潜在特征恢复原始输入 | 迫使编码器保留接触几何与形变细节 |
| 掩码自编码 | 根据未遮挡模态或局部信息补全缺失部分 | 学习模态内部结构与跨模态对应关系 |
| 向量量化 | 将连续触觉特征映射为离散代码 | 获得更紧凑、对噪声更稳健的接触表示 |
| 对比对齐 | 拉近同一交互的跨模态表示,推远不匹配样本 | 让视觉、触觉、声音或语言共享语义空间 |
重建强调“不要丢掉本模态的细节”,对齐强调“让不同模态能够互相理解”。一个好的物理交互表示往往需要同时满足这两个目标,而不是把触觉压缩成视觉表示的附属品。
融合机制:在正确的时刻使用正确的信号
表示形成之后,策略仍要决定每种模态以什么方式进入动作生成。综述梳理了四种主要机制:
| 融合机制 | 怎么工作 | 适合解决的问题 |
|---|---|---|
| FiLM 注入 | 用感知特征生成缩放与偏移参数,调制动作特征 | 以较低开销为 Diffusion Policy 等模型加入条件 |
| Attention Conditioning | 让动作 token 查询视觉、触觉或力觉 token | 建立动作步骤与具体接触证据之间的细粒度联系 |
| Mixture-of-Experts | 将不同模态或阶段的 token 路由给专门的专家 | 在接近、接触、调整等阶段切换处理重点 |
| Gated Filtering | 根据任务阶段动态放大或抑制某种模态 | 避免自由空间中的触觉噪声干扰策略,在接触后及时启用反馈 |
其中,门控与专家路由尤其符合物理交互的阶段性。机器人尚未接触物体时,视觉和语言更有价值;接触建立后,触觉与力觉的重要性迅速上升。真正有效的融合不是让所有模态始终拥有相同权重,而是让信息的贡献随交互状态变化。
Phase 1:生成主动作
Phase 1 是主要决策模块,负责把 Phase 0 的融合表示转成具有物理意义的动作或中间变量。
- 输入:Phase 0 编码并融合后的多模态特征。
- 方法:VLA、Diffusion/Flow Matching、ACT、强化学习或回归模型。
- 输出:动作块或参考轨迹,也可以是控制刚度、参考力和潜在表示。
- 去向:动作可直接交给 Phase 3,也可先送入 Phase 2 做局部修正。
- 关键作用:利用语言、视觉和全局状态确定任务的主要动作方向。
Phase 2:根据接触修正动作
Phase 2 不重新规划整个任务,而是利用接触阶段的新信息修正 Phase 1 给出的动作草案。
- 输入:Phase 1 的预测,以及绕过 Phase 1 直接送来的触觉、力觉和机器人状态。
- 方法:ACT、Diffusion/Flow Matching、强化学习、回归模型或显式算法。
- 输出:修正后的动作、参考力或其他中间控制量。
- 修正对象:位置偏差、接触方向、施力大小、滑移和卡阻等局部问题。
- 关键作用:用较小、较快的模块处理高频接触反馈,避免高层策略承担全部实时控制。
Phase 3:把策略输出变成稳定控制
Phase 3 位于学习策略与机器人硬件之间,目标不是继续理解任务,而是让动作在真实接触中稳定执行。
- 输入:主动作或修正动作、参考力、控制刚度、机器人状态和实时力/力矩。
- 方法:PD/PID、力—位混合控制、导纳控制和阻抗控制。
- 输出:机器人底层可执行的位置、速度或力矩命令。
- 反馈:控制器持续比较目标与实际接触状态,而不是只执行一次策略预测。
- 关键作用:在碰撞、摩擦和外力扰动下维持柔顺、稳定与安全。
四个 Phase 由此对应不同时间尺度:Phase 0 组织信息,Phase 1 决定主要动作,Phase 2 根据接触快速纠偏,Phase 3 持续稳定执行。触觉和力觉的价值不只在输入端,而在于能够沿着这条链路真正改变动作。
真正困难的是让触觉不被忽略
多模态并不天然带来更好的策略。视觉和语言信息密集、预训练充分,很容易主导梯度;触觉和力觉只在短暂的接触阶段变得关键,模型可能在训练中学会忽略它们,却仍能在简单任务上获得不错的平均损失。
这使得“平衡融合”比增加模态数量更重要。一方面,训练目标要避免视觉分支长期压制触觉分支;另一方面,策略需要知道模态何时可信。例如接触前关闭无意义的触觉输入,接触后提高触觉与力觉权重,传感器异常时又能退回视觉与本体状态。
还有一个更深的问题是跨传感器泛化。同一种接触,在不同触觉硬件上可能表现为图像、压力矩阵或稀疏接触点;更换安装位置、工具和机器人本体,也会改变力信号的分布。共享语义空间能够缩小差异,但不能替代对局部物理细节的保留。如何同时获得统一性与精细度,仍是触觉基础模型必须面对的矛盾。
从“感受到”走向“会调整”
Early Tactile Learning 留下的启发非常清楚:触觉是一种通过动作获得、需要随时间解释,并且最终应当进入反馈闭环的感知。多模态学习把这个问题扩展了——机器人不仅要理解每一种信号,还要学会在不同交互阶段协调它们。
因此,这篇综述最值得保留的并不是“给模型再加一种输入”,而是两个判断:第一,触觉必须作为时序中的主动感知来学习;第二,多模态融合必须与动作阶段和控制层级一起设计。
机器人真正理解接触的标志,不是能够描述压力图,也不是在网络输入中出现了 tactile token,而是它能根据接触历史判断当前状态,在视觉与触觉之间选择可靠证据,并在发现滑移、卡阻或过载时及时改变动作。物理智能最终体现在这种持续调整之中。