Warning: session_start(): open(/var/www/vhosts/vandaily.com/php_session/sess_ef409d2455bc25915de3075525dbe9f7, O_RDWR) failed: No space left on device (28) in /var/www/vhosts/vandaily.com/httpdocs/includes/session_new.php on line 34
李飞飞第一篇「触觉」论文:机器人会盲摸麻将了 | 温哥华地产中心
   

李飞飞第一篇「触觉」论文:机器人会盲摸麻将了

第二层,频率对不上。视觉模型处理一帧图像动辄几百毫秒,只能跑到5到10Hz。但触觉反应需要毫秒级,20Hz以上才能捕捉到“正在滑”和“已经滑了”的临界点。


两种信号塞进同一个低频Transformer,视觉来不及看,触觉来不及反应。



第三层,表征太浅。很多方法把触觉当成一个静态的数字——“当前压力5牛顿”。但触觉本质是时序信号:滑动、插入、按压、搓动,每种接触状态都有力随时间变化的独特模式。

好,问题在这里,先看看T-Rex团队解决的怎么样。

在12项真实世界的灵巧操作任务上,T-Rex平均成功率达到65%,比最强纯视觉基线的35%高出了30个百分点。

翻书页96%对68%,开锁70%对0%——纯视觉方案在这个任务上完全被碾压。

消融实验更直接:把T-Rex的触觉输入全部拿掉,成功率从65%掉到42%,降了23个百分点——12项任务里超过三分之一的有效操作纯靠“手感”撑着。

数据效率也很惊人:仅给10条微调演示时,经过中期训练的T-Rex能达到约40%成功率,没经过中期训练的模型直接归零。

这说明模型不是“背下了”数据,而是真正理解了“搓”“捏”“拧”这些动作的通用手感。

一句话总结:视觉数据对灵巧手来说,本质上是不够用的——触觉不是锦上添花,而是必选项。

谁先解决“触觉怎么加”的架构问题,谁就可能在灵巧手这个赛道上卡住位置。

怎么做到的?

T-Rex的核心思路并不复杂——给触觉单独开一条高速通路,而不是让它和视觉挤在同一条慢车道上。

整体架构叫Mixture-of-Transformer-Experts,三个专家分工明确。




Latent Expert处理视觉和语言,预测未来的视觉表征,相当于给模型提供一个“接下来会发生什么”的大局感。

Action Expert做低频动作规划,参数量1.41B,是三个专家里最大的那个,跑一次管一个动作块。

Tactile Expert做高频触觉精修,参数量只有0.62B,轻量到可以频繁触发。

关键机制是Cascaded Flow Matching:

扩散去噪通常需要10步才能从一团随机噪声变成一个干净的动作轨迹,而T-Rex在第4步处一切两半:

前6步由Action Expert完成,生成一个“大方向对了但缺乏手感细节”的半成品;后4步由Tactile Expert接手,注入实时触觉数据完成精修。

[加西网正招聘多名全职sales 待遇优]
无评论不新闻,发表一下您的意见吧
注:
  • 新闻来源于其它媒体,内容不代表本站立场!
  • 在此页阅读全文
     延伸阅读
    人形机器人进化:首先"卷"向一双手 宇树、智元开进商场,人形机器人开始拼门店?
    "美女机器人"被引入美国学校 辅导课程掀争议 校长发声 给人形机器人当老师,撑起一个百亿市场
    人工智能(AI)聊天机器人可能并不客观自由 5个月出口近200亿,谁在买中国机器人?
    日本发起的机器人世界杯,70%"选手"都是中国造 马斯克星际路线图更新,先让机器人上月球
    中国机器人技术热潮下,被抛弃的蓝领工人 重大突破!人形机器人首次完成胆囊切除手术 全球首次
     推荐:

    意见

    当前评论目前还没有任何评论,欢迎您发表您的看法。
    发表评论
    您的评论 *: 
    安全校验码 *:  请在此处输入图片中的数字
    The Captcha image  (请在此处输入图片中的数字)

    Copyright © 温哥华网, all rights are reserved.

    温哥华网为北美中文网传媒集团旗下网站