李飛飛第壹篇「觸覺」論文:機器人會盲摸麻將了
第贰層,頻率對不上。視覺模型處理壹幀圖像動輒幾百毫秒,只能跑到5到10Hz。但觸覺反應需要毫秒級,20Hz以上才能捕捉到“正在滑”和“已經滑了”的臨界點。
兩種信號塞進同壹個低頻Transformer,視覺來不及看,觸覺來不及反應。

第叁層,表征太淺。很多方法把觸覺當成壹個靜態的數字——“當前壓力5牛頓”。但觸覺本質是時序信號:滑動、插入、按壓、搓動,每種接觸狀態都有力隨時間變化的獨特模式。
好,問題在這裡,先看看T-Rex團隊解決的怎麼樣。
在12項真實世界的靈巧操作任務上,T-Rex平均成功率達到65%,比最強純視覺基線的35%高出了30個百分點。
翻書頁96%對68%,開鎖70%對0%——純視覺方案在這個任務上完全被碾壓。
消融實驗更直接:把T-Rex的觸覺輸入全部拿掉,成功率從65%掉到42%,降了23個百分點——12項任務裡超過叁分之壹的有效操作純靠“手感”撐著。
數據效率也很驚人:僅給10條微調演示時,經過中期訓練的T-Rex能達到約40%成功率,沒經過中期訓練的模型直接歸零。
這說明模型不是“背下了”數據,而是真正理解了“搓”“捏”“擰”這些動作的通用手感。
壹句話總結:視覺數據對靈巧手來說,本質上是不夠用的——觸覺不是錦上添花,而是必選項。
誰先解決“觸覺怎麼加”的架構問題,誰就可能在靈巧手這個賽道上卡住位置。
怎麼做到的?
T-Rex的核心思路並不復雜——給觸覺單獨開壹條高速通路,而不是讓它和視覺擠在同壹條慢車道上。
整體架構叫Mixture-of-Transformer-Experts,叁個專家分工明確。

Latent Expert處理視覺和語言,預測未來的視覺表征,相當於給模型提供壹個“接下來會發生什麼”的大局感。
Action Expert做低頻動作規劃,參數量1.41B,是叁個專家裡最大的那個,跑壹次管壹個動作塊。
Tactile Expert做高頻觸覺精修,參數量只有0.62B,輕量到可以頻繁觸發。
關鍵機制是Cascaded Flow Matching:
擴散去噪通常需要10步才能從壹團隨機噪聲變成壹個幹淨的動作軌跡,而T-Rex在第4步處壹切兩半:
前6步由Action Expert完成,生成壹個“大方向對了但缺乏手感細節”的半成品;後4步由Tactile Expert接手,注入實時觸覺數據完成精修。
[物價飛漲的時候 這樣省錢購物很爽]
這條新聞還沒有人評論喔,等著您的高見呢
兩種信號塞進同壹個低頻Transformer,視覺來不及看,觸覺來不及反應。

第叁層,表征太淺。很多方法把觸覺當成壹個靜態的數字——“當前壓力5牛頓”。但觸覺本質是時序信號:滑動、插入、按壓、搓動,每種接觸狀態都有力隨時間變化的獨特模式。
好,問題在這裡,先看看T-Rex團隊解決的怎麼樣。
在12項真實世界的靈巧操作任務上,T-Rex平均成功率達到65%,比最強純視覺基線的35%高出了30個百分點。
翻書頁96%對68%,開鎖70%對0%——純視覺方案在這個任務上完全被碾壓。
消融實驗更直接:把T-Rex的觸覺輸入全部拿掉,成功率從65%掉到42%,降了23個百分點——12項任務裡超過叁分之壹的有效操作純靠“手感”撐著。
數據效率也很驚人:僅給10條微調演示時,經過中期訓練的T-Rex能達到約40%成功率,沒經過中期訓練的模型直接歸零。
這說明模型不是“背下了”數據,而是真正理解了“搓”“捏”“擰”這些動作的通用手感。
壹句話總結:視覺數據對靈巧手來說,本質上是不夠用的——觸覺不是錦上添花,而是必選項。
誰先解決“觸覺怎麼加”的架構問題,誰就可能在靈巧手這個賽道上卡住位置。
怎麼做到的?
T-Rex的核心思路並不復雜——給觸覺單獨開壹條高速通路,而不是讓它和視覺擠在同壹條慢車道上。
整體架構叫Mixture-of-Transformer-Experts,叁個專家分工明確。

Latent Expert處理視覺和語言,預測未來的視覺表征,相當於給模型提供壹個“接下來會發生什麼”的大局感。
Action Expert做低頻動作規劃,參數量1.41B,是叁個專家裡最大的那個,跑壹次管壹個動作塊。
Tactile Expert做高頻觸覺精修,參數量只有0.62B,輕量到可以頻繁觸發。
關鍵機制是Cascaded Flow Matching:
擴散去噪通常需要10步才能從壹團隨機噪聲變成壹個幹淨的動作軌跡,而T-Rex在第4步處壹切兩半:
前6步由Action Expert完成,生成壹個“大方向對了但缺乏手感細節”的半成品;後4步由Tactile Expert接手,注入實時觸覺數據完成精修。
[物價飛漲的時候 這樣省錢購物很爽]
| 分享: |
| 注: | 在此頁閱讀全文 |
| 延伸閱讀 |
推薦:
李飛飛第壹篇「觸覺」論文:機器人會盲摸麻將了