原生全模態技術戰略閉環,智象(HiDream.ai)發布具身世界模型 HiDream-O1-Embodied

2026-09-08 12:47:52 大公網

智象未來(HiDream.ai)正式發布具身世界模型 HiDream-O1-Embodied。秉承原生全模態的技術理念,模型進一步強化機器人的物理感知及動態預判能力,助力具身智能實現更高階的物理互動。具身模型的發布,標誌着智象逐步打通圖像、視頻、3D、動作等模態,貫通「理解—推演—執行」全流程,構建統一世界模型基座的技術閉環。

模型發布同期,HiDream-O1-Embodied 首次參評具身智能模型評測平台 RoboColiseum,並即時在核心的 Robustness(擾動適應)子榜單中,以平均分 0.692 的成績登頂榜首。

智象未來 CTO 姚霆表示:「我們相信,圍繞真實世界的表達、理解和生成,構建同時具備全模態表達、因果推演與物理世界構建三大核心能力,才能建立完整的世界模型基座。智象的原生全模態世界模型技術理念,從設計架構之初便計劃面向包括動作等在內的統一表徵構建。HiDream-O1-Embodied 的發布,是這一技術戰略從『模擬世界』邁向『真實世界』的關鍵里程碑。」

登頂 RoboColiseum:以 0.692 分的「擾動適應」交出硬核答卷

常態化具身智能仿真評測平台 RoboColiseum 旨在構建多維度的系統評測體系,通過與真機表現高度一致的仿真評測,幫助開發者識別模型的能力優勢與短板,持續迭代提升。平台面向全球高校、科研機構、模型企業與研究者開放,實時更新評測結果,致力於構建一套結果可信、過程可復現的具身模型評測標準。

該平台基於高保真仿真環境構建,高度還原真實世界。平台圍繞四個維度推出 4 類能力子榜、78 個高保真仿真評測任務——指令跟隨、空間理解、擾動適應與通用操作。自內測上線以來,已吸引海內外數十款重量級模型參與評測。

在這四個維度中,擾動適應(Robustness)被公認為最具挑戰性的一環。它通過改變背景、光照、材質、機器人初始狀態、相機位置與圖像質量,並對指令進行多樣化改寫,檢驗模型在非理想環境中的穩定性與泛化能力。換言之,這不是在實驗室的「溫室」裡考試,而是在各種「意外」中檢驗真正實力。

HiDream-O1-Embodied 以 0.692 分的成績登頂該榜單,這得益於其原生全模態底座。原生全模態世界模型天然為跨模態理解與生成提供基礎。而在執行環節,為了確保在真實世界的各類「意外」中保持穩定,HiDream-O1-Embodied 在三項核心能力上進行突破性創新,讓理解更精準、感知更穩健、抗干擾能力更強。

語言理解——突破關鍵詞匹配的局限

傳統機械人對語言指令的理解往往停留在關鍵詞匹配層面。說「把杯子拿過來」能聽懂,換成「給我拿個杯子」或「杯子遞我一下」就可能「宕機」。HiDream-O1-Embodied 覆蓋多元動詞、句式與表達方式的等價指令空間,不受句式限制,只鎖定意圖本身。無論指令如何變換,它都能穿透字面,直達用戶的真正意圖。

視覺感知——多視角協同,避免「一處失靈、全局失效」

在物理世界中,機器人的視覺通道並非處於理想狀態。相機位置可能發生偏移,標定精度會隨時間變化,單一路畫面亦可能受到遮擋或干擾。HiDream-O1-Embodied 綜合多個視角的訊息,讓不同視覺通道相互補充,而非依賴某一固定視角。當部分視覺資訊出現偏差或暫時不可用時,模型仍能借助其他視角理解場景、判斷任務並繼續執行,讓系統由「一處失靈、全局失效」,轉變為「局部受限、整體仍可運行」。

高容錯機制——在「不完美」中學會穩定執行

大多數模型的訓練基於「完美數據」——清晰的圖像、完整的畫面、標準的視角。但真實世界從來不是這樣。光照變化、畫面污損、視野遮擋、訊號波動,都是機械人在實際運行時可能遇到的日常情況。

HiDream-O1-Embodied 在訓練階段便主動引入多種非理想條件,讓模型反覆面對不完整、不穩定的資訊,並學會從有限線索中作出可靠判斷。這樣的訓練使模型不只追求理想條件下的最佳表現,也更加重視複雜環境中的持續穩定。

這種容錯能力亦不局限於某一種視覺異常。面對光照、外觀和場景變化,模型能夠更靈活地利用已有資訊,減少環境變化對任務執行的影響。對 HiDream-O1-Embodied 而言,真正重要的不只是「看得清時做得好」,更是「條件不理想時,依然能夠穩穩完成任務」。

模型 + 數據:打造「真實基座 + 生成增強」數據生產範式

而這種「在訓練中見過足夠多不完美」的能力,並非憑空而來。它觸及一個更底層的命題:模型的認知邊界,受到其所接觸數據的影響。高質量數據,恰恰是具身訓練中最稀缺、也最具決定性的變量。智象極力打造的「模型+數據」雙驅動策略,正是問鼎具身世界模型榜單的真正護城河。

該策略的關鍵突破口,在於讓數據生產本身成為模型迭代的有機一環。為此,智象探索出「真實基座 + 生成增強」的數據生產範式。模型不再是被動接收數據,而是主動參與數據的創造。

以與諾亦騰的合作為例:其高精度真人動作捕捉數據作為真實底座,智象借助原生全模態能力完成百倍級的數據精細化擴增。基於單段真實動作樣本,模型可以生成變體視頻:在嚴格遵守物理約束不變的前提下,切換背景環境、光照條件、物體形態等變量,產出海量多元訓練樣本。

這一機制的關鍵,在於模型既做「考生」,也做「出題人」——它根據自身所需主動生成針對性訓練樣本,形成數據與模型互相驅動的增長飛輪。最終讓 HiDream-O1-Embodied 在面對現實世界的強擾動時,展現出超乎尋常的魯棒性。

原生全模態世界模型矩陣日臻完善

就在不到一個月前,智象剛剛發布了交互式世界模型 HiDream-O1-World,並在交互式視頻世界模型評測基準 WBench 的 Navi 分榜中,以平均分 80.9 登頂榜首。

交互式世界模型解決的是「理解與推演」,讓 AI 在數字世界中具備對空間、時間、運動與物體關係的完整認知。而具身世界模型解決的是「操作與執行」,讓 AI 在物理世界中完成真實任務。兩者將形成有力互補,為原生全模態世界模型的發展築牢根基。

正如智象未來創始人兼 CEO 梅濤博士此前所言,下一代大模型競爭的關鍵,不在於單一模態能力的增長,而是從單模態走向多模態,並走向原生統一的全模態。

從 HiDream-O1-Image 到 HiDream-O1-World,再到 HiDream-O1-Embodied,智象作為創新型大模型企業,正堅定地逐步形成覆蓋視覺模型、交互式世界模型及具身世界模型的模型家族矩陣。這既是原生全模態技術在多領域鋪展的能力,更體現了其強大的內生進化能力。

站在世界模型前沿技術加速發展的時代拐點,智象正加速創新向前。