李飞飞第一篇「触觉」论文:机器人会盲摸麻将了
第二层,频率对不上。视觉模型处理一帧图像动辄几百毫秒,只能跑到5到10Hz。但触觉反应需要毫秒级,20Hz以上才能捕捉到“正在滑”和“已经滑了”的临界点。
两种信号塞进同一个低频Transformer,视觉来不及看,触觉来不及反应。

第三层,表征太浅。很多方法把触觉当成一个静态的数字——“当前压力5牛顿”。但触觉本质是时序信号:滑动、插入、按压、搓动,每种接触状态都有力随时间变化的独特模式。
好,问题在这里,先看看T-Rex团队解决的怎么样。
在12项真实世界的灵巧操作任务上,T-Rex平均成功率达到65%,比最强纯视觉基线的35%高出了30个百分点。
翻书页96%对68%,开锁70%对0%——纯视觉方案在这个任务上完全被碾压。
消融实验更直接:把T-Rex的触觉输入全部拿掉,成功率从65%掉到42%,降了23个百分点——12项任务里超过三分之一的有效操作纯靠“手感”撑着。
数据效率也很惊人:仅给10条微调演示时,经过中期训练的T-Rex能达到约40%成功率,没经过中期训练的模型直接归零。
这说明模型不是“背下了”数据,而是真正理解了“搓”“捏”“拧”这些动作的通用手感。
一句话总结:视觉数据对灵巧手来说,本质上是不够用的——触觉不是锦上添花,而是必选项。
谁先解决“触觉怎么加”的架构问题,谁就可能在灵巧手这个赛道上卡住位置。
怎么做到的?
T-Rex的核心思路并不复杂——给触觉单独开一条高速通路,而不是让它和视觉挤在同一条慢车道上。
整体架构叫Mixture-of-Transformer-Experts,三个专家分工明确。

Latent Expert处理视觉和语言,预测未来的视觉表征,相当于给模型提供一个“接下来会发生什么”的大局感。
Action Expert做低频动作规划,参数量1.41B,是三个专家里最大的那个,跑一次管一个动作块。
Tactile Expert做高频触觉精修,参数量只有0.62B,轻量到可以频繁触发。
关键机制是Cascaded Flow Matching:
扩散去噪通常需要10步才能从一团随机噪声变成一个干净的动作轨迹,而T-Rex在第4步处一切两半:
前6步由Action Expert完成,生成一个“大方向对了但缺乏手感细节”的半成品;后4步由Tactile Expert接手,注入实时触觉数据完成精修。
[加西网正招聘多名全职sales 待遇优]
无评论不新闻,发表一下您的意见吧
两种信号塞进同一个低频Transformer,视觉来不及看,触觉来不及反应。

第三层,表征太浅。很多方法把触觉当成一个静态的数字——“当前压力5牛顿”。但触觉本质是时序信号:滑动、插入、按压、搓动,每种接触状态都有力随时间变化的独特模式。
好,问题在这里,先看看T-Rex团队解决的怎么样。
在12项真实世界的灵巧操作任务上,T-Rex平均成功率达到65%,比最强纯视觉基线的35%高出了30个百分点。
翻书页96%对68%,开锁70%对0%——纯视觉方案在这个任务上完全被碾压。
消融实验更直接:把T-Rex的触觉输入全部拿掉,成功率从65%掉到42%,降了23个百分点——12项任务里超过三分之一的有效操作纯靠“手感”撑着。
数据效率也很惊人:仅给10条微调演示时,经过中期训练的T-Rex能达到约40%成功率,没经过中期训练的模型直接归零。
这说明模型不是“背下了”数据,而是真正理解了“搓”“捏”“拧”这些动作的通用手感。
一句话总结:视觉数据对灵巧手来说,本质上是不够用的——触觉不是锦上添花,而是必选项。
谁先解决“触觉怎么加”的架构问题,谁就可能在灵巧手这个赛道上卡住位置。
怎么做到的?
T-Rex的核心思路并不复杂——给触觉单独开一条高速通路,而不是让它和视觉挤在同一条慢车道上。
整体架构叫Mixture-of-Transformer-Experts,三个专家分工明确。

Latent Expert处理视觉和语言,预测未来的视觉表征,相当于给模型提供一个“接下来会发生什么”的大局感。
Action Expert做低频动作规划,参数量1.41B,是三个专家里最大的那个,跑一次管一个动作块。
Tactile Expert做高频触觉精修,参数量只有0.62B,轻量到可以频繁触发。
关键机制是Cascaded Flow Matching:
扩散去噪通常需要10步才能从一团随机噪声变成一个干净的动作轨迹,而T-Rex在第4步处一切两半:
前6步由Action Expert完成,生成一个“大方向对了但缺乏手感细节”的半成品;后4步由Tactile Expert接手,注入实时触觉数据完成精修。
[加西网正招聘多名全职sales 待遇优]
| 分享: |
| 注: | 在此页阅读全文 |
| 延伸阅读 |
推荐:
李飞飞第一篇「触觉」论文:机器人会盲摸麻将了