title: T-Rex 框架來襲!研究團隊讓機器人終於「有感覺」 複雜操作成功率暴漲 30%
在機器人領域中,機器手往往如同拿著大鎚敲核桃般笨拙,如今一群研究人員帶來了一套名為 T-Rex 的框架,要為機器人補上那份長期欠缺的關鍵感知能力——觸覺反饋。這個由 UC Berkeley、NVIDIA、Stanford 等學術巨頭共同開發的專案,展示了一項令人驚嘆的成果:在複雜操作任務中,較諸僅依賴視覺的最強模型,成功率提升了 30%。這不是那種不痛不癢的改進,而是機器人與物理世界互動方式的根本性轉變。
現今大多数機器人都由視覺語言動作(VLA)模型驅動,但當它們接觸物體時,簡直就像瞎子摸象——能看到、會規劃、會行動,卻無法「感受」物體是否正在滑落或變形。T-Rex 正是針對這個痛點出擊,將高頻觸覺反饋直接整合進決策迴圈中。團隊開源的資料集涵蓋了長達 100 小時的觸覺同步操作影片,超過 7,700 條軌跡,涵蓋 200 多種不同物體——這正是該領域長期匱乏的關鍵數據。
這套系統的核心黑科技是一種創新的 Mixture-of-Transformers(MoT) 架構。這個設計巧妙地將機器人的「大脑」分拆運作:一个低頻專家負責全局視覺規劃,另一個高頻專家則處理持續輸入的觸覺數據,進行即時調整。這種設計讓機器人能夠執行諸如擰電燈泡、轉移雞蛋、或從一副撲克牌中抽出一張這類精細動作——對人類而言轻而易举,對缺乏觸覺的機器卻是夢魘般的挑戰。整個專案,包括資料集、模型和訓練代碼,將完全開源,讓全球研究者在這個全新基礎上继续發展更靈巧的機器人技術。
為何這麼重要?
多年來,機器人操作技術陷入了一個困局:表面看起來很厲害,實際上卻笨手笨腳。我們一直要求機器人戴著隔熱手套組裝 IKEA 傢具,這不是緣木求魚嗎?T-Rex 的成功證明了觸覺感測不是什麼奢侈功能,而是達成人類級別靈巧操作的必要條件。從 100 小時資料集到 MoT 架構,整個技術堆疊的開源舉措才是真正的遊戲規則改寫者。這大大降低了全球研究者的進入門檻,可能會引爆一輪機器人創新的寒武紀大爆發——終於有機器人能以應有的細緻度來處理這個物理世界了。這是邁向未來的一大步:機器人不再只能「拾取」和「放置」,而是真正能「動手」工作了。

