商湯發布“悟能”具身智能平台,AI在物理世界中實現自我進化
隨著互聯網自然語言數據逐渐耗盡,AI想要獲得進一步的突破性成長,需要走出數字世界,迈向物理世界。
如同人類的進化轨迹——当机器能够在現實物理世界中自主探索,便能完成自我迭代與持續進化。
7月27日,由全國工商聯人工智能委員會倾力主辦,商湯科技承辦的“大爱無疆·模塑未來” WAIC 2025大模型论坛上,商湯科技正式發布「悟能」具身智能平台,從開悟世界模型到明晰智能、開悟智能,旨在為具身智能打造一個能够在現實世界中自由探索長的強大“训练場”。

基於方舟視覺感知、大裝置、日日新大模型等多種技術的長期積累,商湯「悟能」具身智能平台以商湯“開悟”世界模型為核心引擎,依托商湯大裝置提供強大的端側和雲側算力支持,能够為机器人、智能設備赋予強大的感知、視覺導航及多模態交互能力,推動智能終端向更高層次的自主化與智能化演進。
全國工商聯人工智能委員會主席團首任轮值主席、商湯科技董事長兼首席执行官徐立表示,“世界模型和具身AI的結合,將開啟AI發展的下一個阶段,完成由‘工具’向‘人’的躍遷,加速迈向AGI時代。商湯希望「悟能」具身智能平台能够幫助各類具身智能企業,幫助他們完成和現實世界交互的梦想。”
感知全能、導航精準、交互靈活,為具身智能打造“三大核心引擎”
感知、導航和交互,是具身智能的三大核心能力。
商湯科技在這三大方面均擁有深厚的技術積澱,如今這些積累轉化成了「悟能」具身智能的能力。

首先,感知是机器探索現實世界的基礎。
凭借商湯方舟在視覺AI領域十餘年的深耕積累,從机器狗到机器人,「悟能」具身智能平台能為各類終端硬件赋予對萬物的識別與理解能力,同時具有強大的場景適配性,可完全嵌入端側芯片實現端側推理,讓感知更高效、響應更敏捷。
無论是机器狗的視角(上方視頻)还是机器人的視角(下方視頻),都能對外界有整體的天然感知識別,對物體形成自然划分切割。↓↓↓
導航是机器在現實世界中行動的“骨架”。
商湯絕影在纯視覺端到端智能辅助驾驶方案上的技術積累,可泛化適配至机器人、机器狗等硬件設備,讓机器人在更多樣的環境中實現精準路徑規划與導航。
同樣,無论是在绿化小路中四足奔走的、體型較小的机器狗(上方視頻)还是行驶在城區正常車道的自動驾驶車辆(下方視頻)都在實現精準路徑規划與導航的同時,準确地進行了自動避障。↓↓↓
交互是机器與現實世界連接的桥梁。
基於“日日新”大模型的技術積累與不斷迭代,“悟能”具身智能平台可以赋能机器人具備和現實世界的交互能力,具備有温度、有深度、長記忆、超穩定等能力亮點。
以AI生成的《長安的荔枝》電影介绍PPT為例,由“悟能”具身智能平台赋能的人形机器人,能够以各種風趣幽默、嚴谨務實等各種語言風格進行生動講解。
PPT內容:


机器人講解內容:
同時,它还可以自動翻頁,實時響應用戶提問,敏锐捕捉用戶意圖,期間用戶打斷提問,它完成提問後还能回归繼續講解。
PPT內容:


机器人講解內容:
它还能結合長記忆能力進行阶段性回顧历史用戶提問,作出小結,即便遇到嘈杂環境也能輕松應對。
PPT內容:


机器人講解內容:
商湯“悟能”具身智能平台可廣泛適配包括汽車、机器人在內的各類終端,實現空間層面的現實世界互動。
構建4D真實世界,為机器進化提供高質量現實世界數據
基於強大的多模態深度理解能力,商湯“開悟”世界模型具備合理的空間一致性和時間一致性,可生成高質量數據,有效提升具身智能等終端設備的智能水平。
“開悟”世界模型能够僅凭自然語言描述,即可生成逼真的七路攝像头視角模擬數據,且不同視角下的几何位置高度對應,完全符合物理世界的規律。

“開悟”世界模型还能够編輯真實世界,可對現實世界中的車辆等場景元素進行替換、刪除、增补,創造更加多樣的現實場景。
小汽車變成小货車↓
原視頻 編輯後的視頻


“天降”公共汽車↓
原視頻 編輯後的視頻


基於強大的生成和編輯能力,“開悟”世界模型可以精準模擬方向盤、刹車和油門控制,帶來如同在真實的街道場景中玩“極品飛車”的效果,讓机器在現實世界中自由探索。
到了具身世界,發挥空間则更大。
相較於智能汽車,机器人適用和覆蓋的場景更加廣泛,能够通過主動探索生成更多高質量的現實世界數據,在具身智能數據匮乏的当前環境下,可通過構建面向人、物、場的4D真實世界,突破模型泛化能力的邊界。
具身世界模型讓用戶僅需要输入简單的提示词,就能自主進行位姿、動作骨架和指令的生成,讓机器人動作更合理。

给出“在厨房區域的架子上找東西”指令,具身世界模型可以準确生成相應的場景視頻和机器人的連續位姿,從上圖變成下面連續的動態視頻↓↓↓

再來一組,还是只给出初始視角。

给出“進入娱樂室、向右轉,然後打開通往院子的門”指令,具身世界模型不僅可以進行連續位姿生成,还支持多角度查看,并保持高度的時空一致性↓↓↓

给出“生成一段切黄瓜的机器人視頻”指令,具身世界模型可準确生成動作骨架,隨後输出具身第一視角、第三視角4D世界視角等多種視角的視頻。

给出“生成一段白天公园里机器人跳躍的視頻”指令,具身世界模型同樣可以模擬生成符合3D關係的4D世界的真實視頻。

即便是不同相機位姿視角的視頻生成,具身世界模型也能輕松拿捏,來看下具身世界模型生成的多視角視頻↓↓↓

商湯“悟能”具身智能平台正在實質性打破虚實界限,構建AI與物理世界交互的高效通路。
未來,商湯科技希望助力赋能具身智能企業實現感知、理解與生成能力的躍遷,將具身交互的不确定性挑战轉化為產業升級的确定性路徑,推動AI向下一個十年加速進化。