智元GE-Act 2.0重磅升級 看懂機器人AI的“開竅式”進化路徑

2026-09-10 19:46:44 大公網 作者:曾萍

機器人想要真正實現自主作業,核心是看懂環境、預判變化、主動行動,並具備持續進化能力。智元全新發布的GE-Act 2.0,成功驗證原生世界—動作模型的完整預訓練與規模化生長路徑,讓機器人AI告別“應試刷題”,真正擁有舉一反三的通用能力,是國內具身智能領域的重要突破。

圖中每個任務接受四檔數據量訓練(300 小時/ 1200 小時/ 5000 小時/ 30000 小時),隨着訓練數據不斷擴大,技能覆蓋範圍與任務成功率同步擴大,這驗證了原生世界-動作模型預訓練與Scaling路徑

拒絕應試假象:零樣本實測檢驗真實通用能力

當前多數機器人模型存在“刷分假象”,看似精度很高,實則依靠場景專屬微調訓練,一旦更換光照、視角、物品,性能迅速崩盤,並不具備通用能力。

為此,GE-Act 2.0採用零樣本真機測試作為唯一標準:不微調、不示範、不換模型,所有測試場景、物體、環境均從未出現在訓練集中,完全依靠模型原生認知完成操作。

研發團隊使用跨度100倍的訓練數據(300小時至3萬小時)驗證縮放規律。結果顯示,機器人能力呈現明顯“頓悟式增長”:精細操作任務數量大幅提升,毛巾摺疊、紙杯嵌套、精細插拔、插花等小動作,小數據模型完全無法理解,在3萬小時大數據加持下可穩定完成。

同時,模型整體成功率持續上漲,且5000小時至3萬小時區間仍無性能飽和跡象,成長潛力充足。最能體現通用性的是跨機型遷移效果:主力機器人貢獻超半數訓練數據,另一機型訓練佔比不足2%,依舊實現顯著能力提升,證明模型學到的是通用操作邏輯,而非設備專屬技巧,綜合性能超越多款行業主流模型。

思維範式升級:機器人從被動反應變為主動預判

傳統機器人屬於“看一步動一步”的被動執行模式,沒有未來推演能力,面對動態場景極易出錯。GE-Act 2.0原生世界—動作模型,復刻人類行為邏輯:先預判未來環境變化,再製定動作策略,實現從“被動反應”到“主動預見、驅動行動”的升級。

不同於行業拼接預訓練模型的改良思路,GE-Act 2.0從零構建具身專屬架構,通過三大核心創新解決識別慢、推理弱、規劃亂的痛點。

自研CoAE視覺編碼器,將複雜畫面壓縮為24個視覺特徵單元,算力僅為主流模型的十六分之一。通過智能篩選有效信息,在大幅降本提速的同時,指令畫面匹配準確率高達97.95%,實現輕量化與高精度兼顧。

傳統模型需要多輪反覆推演,算力高、延遲大。GE-Act 2.0支持一次性生成完整未來動作序列,並以動作誤差反向優化世界預測模型,在常規顯卡上單次連續動作生成僅需104毫秒,推理速度大幅領先同類世界動作模型。

同一任務存在多種合理操作方式,傳統模型容易因動作差異產生學習混亂。GE-Act 2.0通過KASO算法篩選最貼合真實場景的預測路徑,僅保留有效樣本參與優化,讓陌生場景目標識別率提升7.5%,抓取成功率提升10%,大幅提升泛化穩定性。

GE-Act 2.0架構

全量數據複用:徹底解決訓練數據浪費難題

傳統機器人訓練極度依賴高質量、完整標註數據,大量失敗軌跡、無標註視頻、試錯數據直接作廢,數據利用率極低。

GE-Act 2.0重構數據訓練體系,讓不同類型數據各司其職:3.9萬小時環境視頻用於學習世界變化規律,包含大量無動作標註素材;3.2萬小時機器人軌跡數據訓練動作認知,兼容失敗操作與部署回流數據;3萬小時完整配對數據,打通環境預測與實操動作的協同能力。

這套機制讓機器人可以從成功案例學方法、從失敗數據學避錯,最大化利用海量真實場景數據,大幅降低訓練成本,加速模型迭代。

行業價值:敲定通用機器人規模化生長路徑

在智元GE世界模型體系中,GE-Sim負責虛擬環境搭建與策略評測,GE-Act承擔核心落地功能,將虛擬的未來預測能力轉化為真實機器人的物理操作能力。

KASO從多個預測未來中選出與真實動作最一致的結果,再用於聯合訓練,避免未來預測與動作監督錯位

本次GE-Act 2.0的核心突破,是正式證實原生世界—動作模型具備可持續縮放能力。機器人零樣本通用能力可隨數據規模穩定提升、無明顯天花板,徹底打破定製化調參的傳統模式,為下一代通用人形機器人的規模化進化,提供了清晰、可落地的技術路徑。

隨着訓練數據規模擴大,兩種機器人本體的多數技能持續提升,數據佔比不足2%的G2-90D同樣獲得明顯增長。