← 返回

TouchBridge:面向跨传感器机器人操作的多桥接对齐与可逆规范触觉空间

Yongji Fu, Guanqun Cao, Yi Zhou, et al.

ICRA 2026, 已投稿, 2025

TouchBridge:面向跨传感器机器人操作的多桥接对齐与可逆规范触觉空间

摘要

光学触觉传感器在几何形态、光照和读出方式上差异很大,因此在某个传感器上学到的表示或策略往往 无法迁移到另一个传感器,导致每换一个指尖就要重新采集数据、重新训练。TouchBridge 通过一个 可逆的规范触觉空间来解决这一问题:任意传感器都可以被映射进这一共享潜空间,并且关键在于还能 从中映射回来,使触觉信号能够在异构传感器之间相互转换,而不仅仅是被嵌入其中。

对齐通过**多桥接对齐(multi-bridge alignment)**学习——不使用单一的庞大编码器,而是让每个 传感器各自通过一个可逆的桥连接到规范空间,并对这些桥进行联合训练,使规范空间保持与传感器 无关,同时又能解码回各自的原生传感器域。这样,在某一传感器上训练的操作策略或表示就能在另一个 传感器上运行,几乎不需要新的触觉数据。

我们在跨传感器操作任务上进行评估,将触觉表示与基于接触的控制在不同传感器间迁移,结果表明可逆 的规范空间既保留了下游操作所需的接触信息,又实现了传感器到传感器的转换。

研究动机

光学触觉图像不是普通照片,而是一次物理接触,经由某个具体传感器的凝胶、光照和标记点布局渲染出来 的观测。同一次按压、滑动或载荷变化,换一种传感器的光路和标定,看起来会完全不同。这个渲染差异, 正是跨传感器触觉学习不能简单靠”用一个更大的共享编码器”解决的原因——足够大的编码器很乐意先学会 认出”这是哪个传感器拍的”,再去学”发生了什么接触”,而这样学出来的表示,天然被锁死在训练它的 那个传感器上。

桥:现有工作到底把什么对齐到了一起

我们发现,用”桥”来描述现有跨传感器触觉方法很有用——桥是把异构传感器观测钉到同一次接触上的监督 锚点。文献里大致有四类桥,各有所长,也各有边界:

  • 力桥(如 UniForce)让两个传感器在匹配的准静态力平衡条件下压入,物理规律本身保证两侧观测 对应同一次接触,而不只是视觉上相似。这是很强的物理锚点,但维度低:对接触事件、物体语义几乎 没有覆盖,而且依赖压入过程保持准静态。
  • 任务标签桥(T3、UniT、Sparsh、AnyTouch/AnyTouch2)把多个传感器数据放进同一个共享编码器, 用材质、滑移、姿态或重建等任务训练。这类方法可以跨数据集规模化,但学出的表示通常是判别式、 单向的——能读出标签,却答不出”换一个传感器会看到什么”。
  • 跨模态桥(UniTouch、TVL/TLV-CoRe)把触觉与视觉、语言或音频对齐,这正是让模型把触觉和 “锤子”或”苹果”这类高层语义联系起来的关键。但语义对齐不等于传感器解耦——一个能被文字检索到的 embedding,仍然可能携带很强的传感器风格。
  • 翻译桥(Touch2Touch、GenForce)把一个传感器的外观直接映射成另一个传感器的样子,是现有 工作里最接近”可逆”的思路。但实践中往往要为每一对传感器单独训练翻译器,组合数量爆炸,翻译出的 数据通常还要重新喂给一个新的下游模型。

桥的组合,而不是押单桥

TouchBridge 的立场是:这些桥都没错,只是各自太窄——与其押一座桥,不如让力与增量力、接触几何、 离散动作、载荷序、仿真共享状态和跨传感器配对,按各自监督信号的可靠程度,共同约束同一个空间。

这个共享空间——我们称之为 TacCanon——由它排除了什么来定义,而不是它装了什么:唯一被排除的 是传感器身份。传感器之间共有的一切——力与接触动态、动作与事件、物体与材质语义、任何可跨模态对齐 的信息——都被保留下来。因为身份被单独剥离成一个可替换的分量,而不是被直接丢弃,同一次接触内容 就能被”重新渲染”成任意目标传感器本该看到的样子:跨传感器迁移由此变成经过共享空间的”翻译”,而 不是单向嵌入,也不需要为每一对传感器单独训练一座桥。

来自 Chen 等人 UniForce 论文的准静态力平衡配对装置
两个传感器在匹配的准静态力平衡条件下压入,保证两侧的帧对应同一次物理接触,而不只是视觉上相似——这正是上文提到的力桥。TouchBridge 把这类监督保留为多个信号来源之一,而不是把规范空间直接定义为纯力 latent。

结果

在 3 种光学触觉传感器(GelSight、GelSight Mini、DIGIT)与 9 个公开数据集上评测,TouchBridge 的 规范表征在材质识别基准 TAG 上达到 77.0%、在 Cloth 上达到 42.3%——均为对比方法中的最优; 滑动检测在两种评测设置下分别达到 86.798.0 F1。在真机操作任务上,基于规范表征构建的 策略取得抓取 0.80、擦拭 0.85、薯片移动 0.85 的成功率,全面优于单传感器基线与未做 跨传感器对齐的基线。

可逆性为什么重要

由于 TacCanon 在设计上与传感器无关,架在它之上的操作策略完全不需要知道输入来自哪个传感器——换 一个指尖,只需要重新拟合一个很小的身份分量,而不必重新训练整个策略。

来自 Chen 等人 UniForce 论文,力感知触觉 token 接入视觉-语言-动作模型
一个冻结的力感知触觉编码器,把异构传感器输入统一成一个 token,与图像、文本 token 一起送入视觉-语言-动作模型的动作解码器——这也是"轻轻擦掉白板上的字"这类语言指令被解析、执行的接口。TouchBridge 追求的是同一类接口:一个策略可以直接消费、不必关心来自哪个传感器的规范 token,这正是上文擦拭成功率的评测场景。