Warning: session_start(): open(/var/www/vhosts/vandaily.com/php_session/sess_ef409d2455bc25915de3075525dbe9f7, O_RDWR) failed: No space left on device (28) in /var/www/vhosts/vandaily.com/httpdocs/includes/session_new.php on line 34
李飛飛第壹篇「觸覺」論文:機器人會盲摸麻將了 | 溫哥華教育中心
   

李飛飛第壹篇「觸覺」論文:機器人會盲摸麻將了

第贰層,頻率對不上。視覺模型處理壹幀圖像動輒幾百毫秒,只能跑到5到10Hz。但觸覺反應需要毫秒級,20Hz以上才能捕捉到“正在滑”和“已經滑了”的臨界點。


兩種信號塞進同壹個低頻Transformer,視覺來不及看,觸覺來不及反應。



第叁層,表征太淺。很多方法把觸覺當成壹個靜態的數字——“當前壓力5牛頓”。但觸覺本質是時序信號:滑動、插入、按壓、搓動,每種接觸狀態都有力隨時間變化的獨特模式。

好,問題在這裡,先看看T-Rex團隊解決的怎麼樣。

在12項真實世界的靈巧操作任務上,T-Rex平均成功率達到65%,比最強純視覺基線的35%高出了30個百分點。

翻書頁96%對68%,開鎖70%對0%——純視覺方案在這個任務上完全被碾壓。

消融實驗更直接:把T-Rex的觸覺輸入全部拿掉,成功率從65%掉到42%,降了23個百分點——12項任務裡超過叁分之壹的有效操作純靠“手感”撐著。

數據效率也很驚人:僅給10條微調演示時,經過中期訓練的T-Rex能達到約40%成功率,沒經過中期訓練的模型直接歸零。

這說明模型不是“背下了”數據,而是真正理解了“搓”“捏”“擰”這些動作的通用手感。

壹句話總結:視覺數據對靈巧手來說,本質上是不夠用的——觸覺不是錦上添花,而是必選項。

誰先解決“觸覺怎麼加”的架構問題,誰就可能在靈巧手這個賽道上卡住位置。

怎麼做到的?

T-Rex的核心思路並不復雜——給觸覺單獨開壹條高速通路,而不是讓它和視覺擠在同壹條慢車道上。

整體架構叫Mixture-of-Transformer-Experts,叁個專家分工明確。




Latent Expert處理視覺和語言,預測未來的視覺表征,相當於給模型提供壹個“接下來會發生什麼”的大局感。

Action Expert做低頻動作規劃,參數量1.41B,是叁個專家裡最大的那個,跑壹次管壹個動作塊。

Tactile Expert做高頻觸覺精修,參數量只有0.62B,輕量到可以頻繁觸發。

關鍵機制是Cascaded Flow Matching:

擴散去噪通常需要10步才能從壹團隨機噪聲變成壹個幹淨的動作軌跡,而T-Rex在第4步處壹切兩半:

前6步由Action Expert完成,生成壹個“大方向對了但缺乏手感細節”的半成品;後4步由Tactile Expert接手,注入實時觸覺數據完成精修。

[物價飛漲的時候 這樣省錢購物很爽]
這條新聞還沒有人評論喔,等著您的高見呢
注:
  • 新聞來源於其它媒體,內容不代表本站立場!
  • 在此頁閱讀全文
     延伸閱讀
    人形機器人進化:首先"卷"向壹雙手 宇樹、智元開進商場,人形機器人開始拼門店?
    "美女機器人"被引入美國學校 輔導課程掀爭議 校長發聲 給人形機器人當老師,撐起壹個百億市場
    人工智能(AI)聊天機器人可能並不客觀自由 5個月出口近200億,誰在買中國機器人?
    日本發起的機器人世界杯,70%"選手"都是中國造 馬斯克星際路線圖更新,先讓機器人上月球
    中國機器人技術熱潮下,被拋棄的藍領工人 重大突破!人形機器人首次完成膽囊切除手術 全球首次
     推薦:

    意見

    當前評論目前還沒有任何評論,歡迎您發表您的看法。
    發表評論
    您的評論 *: 
    安全校驗碼 *:  請在此處輸入圖片中的數字
    The Captcha image  (請在此處輸入圖片中的數字)



    Copyright © 溫哥華網, all rights are reserved.

    溫哥華網為北美中文網傳媒集團旗下網站