李飛飛第壹篇「觸覺」論文:機器人會盲摸麻將了
霍!這陣容,誰組的局?

李飛飛,ImageNet奠基人,美國叁院院士;
Trevor Darrell,伯克利BAIR聯合創始人,他的Caffe深度學習框架曾是計算機視覺領域最廣泛使用的平台之壹;
Jitendra Malik,R-CNN的核心貢獻者之壹,深刻影響了計算機視覺的發展軌跡,同樣美國叁院院士;
Pieter Abbeel,深度強化學習先驅,伯克利機器人學習實驗室主任、BAIR實驗室聯合主任。ACM計算獎得主;
Ken Goldberg,機器人學泰斗,30年前就深耕機器人抓取和自動化,IEEE會士;
Jim Fan,英偉達GEAR實驗室掌舵者,具身智能領域最受矚目的年輕學者之壹。
……..
具身智能學術圈,可能是第壹次迎來如此全明星陣營。
有模型的、算力的、本體的、數據的等等…..在各自細分賽道上如雷貫耳的big name們,齊聚具身智能,但關注點嘛~壹下就讓人好奇起來:
不是當下大熱的機器人通用大腦,而是——靈巧手。
T-Rex從何而起,要解決什麼問題?
自動駕駛靠純視覺,是有可能解決問題的,但機器人,尤其是靈巧手卻很難。
這是壹個直觀且淺顯的事實:
手指、手掌進行精密復雜操作時,很難只用攝像頭記錄運動數據。
360°無死角的視頻數據量有多龐大暫且不說,首先機位就沒法布置。不同任務類別,很難像自動駕駛那樣形成標准化數據集——模型泛化性受限。
自然而然,給模型加入觸覺這個數據模態,就成了壹石叁鳥的方法:感知精度更高、操作更精准細膩,以及可以形成較為標准的數據集。

但反常識的事情出現了:
同樣的靈巧手、同樣的任務,T-Rex團隊把觸覺力信號直接拼接到壹個預訓練好的VLA模型裡,想給它“加點手感”——結果任務成功率從17%掉到了6%。
觸覺不是想加就能加的,論文把原因拆成了叁層。
第壹層,數據太貴。
現有的大規模機器人數據集主要面向平行夾爪——兩根手指壹捏壹放,遙操作門檻低。但靈巧手有22個自由度,操作員要戴數據手套,每壹個手勢都要精確映射到機械手上,還要保證視覺、觸覺、關節狀態嚴格對齊,目前靈巧手遙操作成本是平行夾爪的5到10倍。
[物價飛漲的時候 這樣省錢購物很爽]
無評論不新聞,發表壹下您的意見吧

李飛飛,ImageNet奠基人,美國叁院院士;
Trevor Darrell,伯克利BAIR聯合創始人,他的Caffe深度學習框架曾是計算機視覺領域最廣泛使用的平台之壹;
Jitendra Malik,R-CNN的核心貢獻者之壹,深刻影響了計算機視覺的發展軌跡,同樣美國叁院院士;
Pieter Abbeel,深度強化學習先驅,伯克利機器人學習實驗室主任、BAIR實驗室聯合主任。ACM計算獎得主;
Ken Goldberg,機器人學泰斗,30年前就深耕機器人抓取和自動化,IEEE會士;
Jim Fan,英偉達GEAR實驗室掌舵者,具身智能領域最受矚目的年輕學者之壹。
……..
具身智能學術圈,可能是第壹次迎來如此全明星陣營。
有模型的、算力的、本體的、數據的等等…..在各自細分賽道上如雷貫耳的big name們,齊聚具身智能,但關注點嘛~壹下就讓人好奇起來:
不是當下大熱的機器人通用大腦,而是——靈巧手。
T-Rex從何而起,要解決什麼問題?
自動駕駛靠純視覺,是有可能解決問題的,但機器人,尤其是靈巧手卻很難。
這是壹個直觀且淺顯的事實:
手指、手掌進行精密復雜操作時,很難只用攝像頭記錄運動數據。
360°無死角的視頻數據量有多龐大暫且不說,首先機位就沒法布置。不同任務類別,很難像自動駕駛那樣形成標准化數據集——模型泛化性受限。
自然而然,給模型加入觸覺這個數據模態,就成了壹石叁鳥的方法:感知精度更高、操作更精准細膩,以及可以形成較為標准的數據集。

但反常識的事情出現了:
同樣的靈巧手、同樣的任務,T-Rex團隊把觸覺力信號直接拼接到壹個預訓練好的VLA模型裡,想給它“加點手感”——結果任務成功率從17%掉到了6%。
觸覺不是想加就能加的,論文把原因拆成了叁層。
第壹層,數據太貴。
現有的大規模機器人數據集主要面向平行夾爪——兩根手指壹捏壹放,遙操作門檻低。但靈巧手有22個自由度,操作員要戴數據手套,每壹個手勢都要精確映射到機械手上,還要保證視覺、觸覺、關節狀態嚴格對齊,目前靈巧手遙操作成本是平行夾爪的5到10倍。
[物價飛漲的時候 這樣省錢購物很爽]
| 分享: |
| 注: | 在此頁閱讀全文 |
| 延伸閱讀 |
推薦:



