Warning: session_start(): open(/var/www/vhosts/vandaily.com/php_session/sess_ef409d2455bc25915de3075525dbe9f7, O_RDWR) failed: No space left on device (28) in /var/www/vhosts/vandaily.com/httpdocs/includes/session_new.php on line 34
李飛飛第壹篇「觸覺」論文:機器人會盲摸麻將了 | 溫哥華地產中心
   

李飛飛第壹篇「觸覺」論文:機器人會盲摸麻將了

霍!這陣容,誰組的局?




李飛飛,ImageNet奠基人,美國叁院院士;

Trevor Darrell,伯克利BAIR聯合創始人,他的Caffe深度學習框架曾是計算機視覺領域最廣泛使用的平台之壹;

Jitendra Malik,R-CNN的核心貢獻者之壹,深刻影響了計算機視覺的發展軌跡,同樣美國叁院院士;

Pieter Abbeel,深度強化學習先驅,伯克利機器人學習實驗室主任、BAIR實驗室聯合主任。ACM計算獎得主;

Ken Goldberg,機器人學泰斗,30年前就深耕機器人抓取和自動化,IEEE會士;

Jim Fan,英偉達GEAR實驗室掌舵者,具身智能領域最受矚目的年輕學者之壹。

……..

具身智能學術圈,可能是第壹次迎來如此全明星陣營。

有模型的、算力的、本體的、數據的等等…..在各自細分賽道上如雷貫耳的big name們,齊聚具身智能,但關注點嘛~壹下就讓人好奇起來:

不是當下大熱的機器人通用大腦,而是——靈巧手。

T-Rex從何而起,要解決什麼問題?

自動駕駛靠純視覺,是有可能解決問題的,但機器人,尤其是靈巧手卻很難。

這是壹個直觀且淺顯的事實:

手指、手掌進行精密復雜操作時,很難只用攝像頭記錄運動數據。

360°無死角的視頻數據量有多龐大暫且不說,首先機位就沒法布置。不同任務類別,很難像自動駕駛那樣形成標准化數據集——模型泛化性受限。

自然而然,給模型加入觸覺這個數據模態,就成了壹石叁鳥的方法:感知精度更高、操作更精准細膩,以及可以形成較為標准的數據集。



但反常識的事情出現了:

同樣的靈巧手、同樣的任務,T-Rex團隊把觸覺力信號直接拼接到壹個預訓練好的VLA模型裡,想給它“加點手感”——結果任務成功率從17%掉到了6%。

觸覺不是想加就能加的,論文把原因拆成了叁層。

第壹層,數據太貴。

現有的大規模機器人數據集主要面向平行夾爪——兩根手指壹捏壹放,遙操作門檻低。但靈巧手有22個自由度,操作員要戴數據手套,每壹個手勢都要精確映射到機械手上,還要保證視覺、觸覺、關節狀態嚴格對齊,目前靈巧手遙操作成本是平行夾爪的5到10倍。

第贰層,頻率對不上。視覺模型處理壹幀圖像動輒幾百毫秒,只能跑到5到10Hz。但觸覺反應需要毫秒級,20Hz以上才能捕捉到“正在滑”和“已經滑了”的臨界點。

兩種信號塞進同壹個低頻Transformer,視覺來不及看,觸覺來不及反應。



第叁層,表征太淺。很多方法把觸覺當成壹個靜態的數字——“當前壓力5牛頓”。但觸覺本質是時序信號:滑動、插入、按壓、搓動,每種接觸狀態都有力隨時間變化的獨特模式。

好,問題在這裡,先看看T-Rex團隊解決的怎麼樣。

在12項真實世界的靈巧操作任務上,T-Rex平均成功率達到65%,比最強純視覺基線的35%高出了30個百分點。

翻書頁96%對68%,開鎖70%對0%——純視覺方案在這個任務上完全被碾壓。

消融實驗更直接:把T-Rex的觸覺輸入全部拿掉,成功率從65%掉到42%,降了23個百分點——12項任務裡超過叁分之壹的有效操作純靠“手感”撐著。

數據效率也很驚人:僅給10條微調演示時,經過中期訓練的T-Rex能達到約40%成功率,沒經過中期訓練的模型直接歸零。

這說明模型不是“背下了”數據,而是真正理解了“搓”“捏”“擰”這些動作的通用手感。

壹句話總結:視覺數據對靈巧手來說,本質上是不夠用的——觸覺不是錦上添花,而是必選項。

誰先解決“觸覺怎麼加”的架構問題,誰就可能在靈巧手這個賽道上卡住位置。

怎麼做到的?

T-Rex的核心思路並不復雜——給觸覺單獨開壹條高速通路,而不是讓它和視覺擠在同壹條慢車道上。

整體架構叫Mixture-of-Transformer-Experts,叁個專家分工明確。



Latent Expert處理視覺和語言,預測未來的視覺表征,相當於給模型提供壹個“接下來會發生什麼”的大局感。

Action Expert做低頻動作規劃,參數量1.41B,是叁個專家裡最大的那個,跑壹次管壹個動作塊。

Tactile Expert做高頻觸覺精修,參數量只有0.62B,輕量到可以頻繁觸發。

關鍵機制是Cascaded Flow Matching:

擴散去噪通常需要10步才能從壹團隨機噪聲變成壹個幹淨的動作軌跡,而T-Rex在第4步處壹切兩半:

前6步由Action Expert完成,生成壹個“大方向對了但缺乏手感細節”的半成品;後4步由Tactile Expert接手,注入實時觸覺數據完成精修。

為什麼是第4步?作者團隊通過實驗對比發現太早切,Action Expert去噪步數太少,繼承不了大規模人類視頻預訓練獲得的先驗知識;太晚切,動作分布已經定型,觸覺信號進來也來不及修正了。



第4步剛好處在“該有的形狀都有了,但細節還能改”的黃金位置。

這就像寫文章:主編(Action Expert)定好大框架後就去忙別的了,肆個編輯(Tactile Expert)在不同的節點上輪番檢查細節,不需要主編每次都回來重看壹遍全文。

觸覺信號怎麼編碼是另壹個關鍵設計。

觸覺傳感器有零點漂移和高頻噪聲,直接拿原始電壓值喂給模型,模型很可能把傳感器噪聲當成接觸特征學進去。

T-Rex用VQ-VAE把過去16幀(約0.5秒)的力歷史壓縮成64個離散碼字。不同接觸狀態——按壓、插入、滑動——會被自動聚類到不同的碼字上。

這樣壹來,傳感器漂移被過濾掉了,觸覺信號還變得可解釋——你能看到模型“理解”了什麼類型的接觸。



兩個工程細節,第壹個:讓碼本“活起來”。 VQ-VAE碼本,理訓練時經常出現“碼本坍塌”——大部分抽屜空著,少數幾個塞滿各種雜亂狀態。T-Rex的做法是定期檢查哪些抽屜閒置,主動塞點數據進去“激活”它,確保所有碼字都被利用起來。

第贰個,給“有手感”的時刻更高權重。 避免模型化90%的精力去學好“零接觸”這個最容易學的狀態,而忽略真正有價值的接觸瞬間。T-Rex給高力幀更高的學習權重,讓模型把算力集中在關鍵接觸點上。

論文正文不會寫、但做靈巧手工程化的人壹看就懂。

最後是訓練策略。

T-Rex采用叁階段訓練:

先在大規模人類視頻上預訓練(22,889小時),讓模型看懂“人是怎麼動的”;

再用100小時遙操作數據做中期訓練,覆蓋207種物體和22種動作基元——目的是把人類視頻裡的運動知識遷移到機器人本體上,而不是死磕某個具體任務。

最後用約100條任務演示做後訓練,快速適配特定需求。



其中最核心是中期訓練,解決了壹個根本問題:人手抓杯子的方式和機械手抓杯子的方式不壹樣,策略不壹樣,受力反饋也不壹樣。如果直接拿人類視頻訓練出來的模型去操控機器人,它不知道怎麼把“看來的”轉化成“做出來的”。


中期訓練就是用100小時的遙操作數據,把這道鴻溝填上。它不是讓模型死磕某壹個具體任務,而是讓模型接觸207種物體和22種動作基元的組合,理解“搓”這個動作在不同物體上應該怎麼執行、“捏”這個動作需要多大的力。

這就像壹個人學完游泳理論後,在淺水區把蛙泳、自由泳、仰泳都練了壹遍——不追求速度,只追求“會用”。

有了這個基礎,最後階段只用100條任務演示就能快速適配——因為模型已經知道“手感”是什麼了,只需要知道“用在哪兒”。

T-Rex的技術路線清晰指向壹個判斷——視覺和觸覺在靈巧操作中不是主從關系,而是並行關系。

它用壹個異步架構解決了頻率不匹配的底層矛盾,用壹套時序編碼把漂移的傳感器信號變成了可解釋的離散詞匯,用壹組基元組合的覆蓋策略替代了特定任務的深度堆疊。

這叁件事單看都不是“發明新數學”,但組合在壹起,為靈巧手的觸覺利用提供了壹套可復用的系統方案。

靈巧手,存在壹個“第壹性原理”嗎?

靈巧手賽道眼下最熱鬧的爭論,集中在兩個地方:關節運動形式和自由度數量。

腱繩還是連杆?絲杠還是齒輪?11個自由度夠用還是得幹到27個?不同廠商各執壹詞,技術路線遠未收斂。

這些爭論當然都有意義——傳動方案決定成本、可靠性和使用壽命,自由度決定靈巧程度的上限——但學術前沿的核心關注,不在這些問題中的任何壹個上面。

因為壹個更深層的問題很少被討論:有了這些硬件,算法能不能用好?

傳統大模型范式幾乎以視覺數據為主,沒有針對觸覺模態的有效利用方案。T-Rex論文裡那個17%掉到6%的實驗,恰好說明了這壹點——不是觸覺沒用,是現有多模態大模型架構消化不了觸覺。



T-Rex團隊的探索最大價值可能在這裡: 跳出硬件參數的爭論,回到壹個更根本的問題——靈巧手做精細操作,到底需要什麼數據?

關節形式和自由度數量解決的是“能不能動”的問題,觸覺數據解決的是“能不能感知和反應”的問題,由此衍生出需要什麼樣的觸覺數據這個體系化問題,並給出了壹個能泛化的方案。

當然,T-Rex這項研究得以完成,壹個關鍵前提是Sharpa Wave提供的硬件基礎——22個自由度、180Hz高頻觸覺信號、穩定的傳感器輸出。

靈巧手的硬件天花板頂高了,T-Rex才得以在算法層面去夠這個上限。

反過來,T-Rex的算法探索也給硬件提出了新要求:手掌區域需要觸覺感知,不同傳感器的數據格式需要統壹。

T-Rex的軟件、SHARPA的硬件探索方向,後續可能會給這個細分領域帶來更深刻的變化。

首先靈巧手可能從具身智能本體中分化出來,成為壹個獨立賽道——占整機成本15%到20%,經濟上可行,技術上門檻也足夠高。



但如果觸覺數據成為核心壁壘,靈巧手就不僅僅是執行器,而是整個感知-決策-執行鏈條中數據價值最高的壹環。誰掌握觸覺數據的采集能力和模型訓練能力,誰就掌握了議價權。

第贰個變化,更多專用場景的具身應用可能被啟發。當前具身智能的主流敘事是“通用”——壹個模型解決所有任務。

但這個敘事在接觸密集型任務上遇到了困難,因為通用數據裡觸覺是缺失的。T-Rex則證明的是另壹種可能性:在壹個足夠具體的垂直場景裡,用專用的數據模態(觸覺)、專用的架構設計(異步級聯)、專用的數據收集策略(基元×物體),可以取得比“通用”方案好得多的效果。

這條路徑如果走通,會啟發更多人去尋找類似的高價值專用場景。

T-Rex的貢獻不是發明了“新數學”,而是把現有工具組合成壹套可用的系統方案,試圖建立具身智能觸覺數據統壹的采集、訓練范式,推動靈巧手真正scale up起來。

項目地址:https://tactile-reactive-dexterous.github.io/[/b]

作者簡介

牛丹彤,UC Berkeley PhD Candidate,NVIDIA Gear Lab實習生,導師Trevor Darrell,主要從事具身靈巧手大模型的研究,曾以第壹作者或共同第壹作者身份在CVPR, ICML, ICLR等國際頂級會議上發表論文8篇,領導或主要貢獻T-Rex,EgoScale等工作,目前谷歌學術引用1100+。

劉卓洋,北京大學元培學院本科生,導師仉尚航,目前在UC Berkeley訪問,導師Trevor Darrell,主要從事具身多模態推理大模型方向的研究,曾以第壹作者或共同第壹作者身份在ICML, ICLR, NeurIPS, ICRA等國際頂級會議上發表論文6篇,其他參與論文共計15篇,目前谷歌學術引用400余次。曾獲2026商湯獎學金(全國30人),2025北京大學學術新星提名,北京大學元培學院年度科研獎勵,北京大學新生獎學金等。

Trevor Darrell教授,最廣為人知的成果是開發了Caffe深度學習庫。這個庫在深度學習領域具有重要的地位,為眾多的研究人員和開發者提供了便捷的工具,極大地推動了深度學習技術的發展。

Trevor Darrell現在是加州大學伯克利分校Berkeley DeepDrive研究中心的主任。同時擔任伯克利EECS系計算機科學分部的教職,並受聘於加州大學附屬的國際計算機科學研究所(ICSI)。研究方向涵蓋大規模感知學習算法,包括物體與行為識別及檢測,並應用於機器人及移動設備的多模態交互等多種場景。他的研究興趣包括計算機視覺、機器學習、計算機圖形學以及基於感知的人機交互界面。

[加西網正招聘多名全職sales 待遇優]
這條新聞還沒有人評論喔,等著您的高見呢
注:
  • 新聞來源於其它媒體,內容不代表本站立場!
  •  延伸閱讀
    人形機器人進化:首先"卷"向壹雙手 宇樹、智元開進商場,人形機器人開始拼門店?
    "美女機器人"被引入美國學校 輔導課程掀爭議 校長發聲 給人形機器人當老師,撐起壹個百億市場
    人工智能(AI)聊天機器人可能並不客觀自由 5個月出口近200億,誰在買中國機器人?
    日本發起的機器人世界杯,70%"選手"都是中國造 馬斯克星際路線圖更新,先讓機器人上月球
    中國機器人技術熱潮下,被拋棄的藍領工人 重大突破!人形機器人首次完成膽囊切除手術 全球首次
     推薦:

    意見

    當前評論目前還沒有任何評論,歡迎您發表您的看法。
    發表評論
    您的評論 *: 
    安全校驗碼 *:  請在此處輸入圖片中的數字
    The Captcha image  (請在此處輸入圖片中的數字)

    Copyright © 溫哥華網, all rights are reserved.

    溫哥華網為北美中文網傳媒集團旗下網站