7月21日,A股人工智能(885728)板塊上漲,多股漲停。
消息面上,隨著AI技術(shù)快速發(fā)展,人們已不再滿足于大模型生成文字、圖片和視頻的能力。能理解、能交互、能干活的AI,正在成為產(chǎn)業(yè)新的追求。
在2026世界人工智能(885728)大會(huì)上,物理AI、世界模型等概念被頻繁提起。如何讓AI理解真實(shí)世界的運(yùn)行規(guī)律,在復(fù)雜環(huán)境中自主判斷并執(zhí)行任務(wù),成為當(dāng)前具身智能產(chǎn)業(yè)發(fā)展的核心命題。
△參觀者觀看人形機(jī)器人(886069)協(xié)同上下料和料框搬運(yùn)。(資料圖,圖片由CNSPHOTO提供)
核心命題轉(zhuǎn)向理解與交互
物理AI通常指能讓機(jī)器人、自動(dòng)駕駛車輛、智能空間和其他自主系統(tǒng)在真實(shí)物理世界中感知、理解、推理并執(zhí)行復(fù)雜動(dòng)作的AI。世界模型則是理解現(xiàn)實(shí)世界動(dòng)態(tài)(包括物理和空間屬性)的AI工具,可利用文本、圖像、視頻、聲音和運(yùn)動(dòng)等輸入數(shù)據(jù)來預(yù)測接下來會(huì)發(fā)生什么。
“具身智能領(lǐng)域世界模型的定義是能夠高頻聯(lián)合預(yù)測動(dòng)作與世界狀態(tài)的人工智能(885728)模型?!彼呛絼?chuàng)始人兼CEO陳亦倫認(rèn)為,當(dāng)前行業(yè)流行的VLA(視覺—語言—?jiǎng)幼?模型僅能輸出機(jī)器人的下一步動(dòng)作,而世界模型不僅要輸出動(dòng)作,還要預(yù)測動(dòng)作引發(fā)的世界狀態(tài)變化,以及判斷變化結(jié)果是否符合預(yù)期,完整覆蓋強(qiáng)化學(xué)習(xí)“狀態(tài)—?jiǎng)幼鳌?jiǎng)勵(lì)”三要素。
昆侖萬維(300418)董事長兼CEO方漢認(rèn)為2026年是“世界模型元年”。在他看來,這標(biāo)志著AI從內(nèi)容生成走向?qū)ξ锢硎澜绲睦斫馀c交互的關(guān)鍵轉(zhuǎn)折。
方漢表示,過去兩年,AI行業(yè)的核心命題是“生成”——生成文字、圖像、視頻、音樂。從2026年開始,AI的核心命題轉(zhuǎn)向“理解”與“交互”——讓AI真正理解物理世界的運(yùn)行規(guī)律,并能與真實(shí)環(huán)境進(jìn)行閉環(huán)互動(dòng)。世界模型正是實(shí)現(xiàn)這一跨越的關(guān)鍵技術(shù)底座。
“具身智能正從實(shí)驗(yàn)室走向真實(shí)環(huán)境,這一趨勢(shì)要求機(jī)器人在行動(dòng)前先進(jìn)行環(huán)境推演——預(yù)判動(dòng)作后果、評(píng)估環(huán)境變化、及時(shí)調(diào)整應(yīng)對(duì)策略?!狈綕h表示。在他看來,這種能力的突破,將使競爭焦點(diǎn)從單一任務(wù)轉(zhuǎn)向陌生環(huán)境下的通用模型能力。
“誰能訓(xùn)練出在復(fù)雜場景中依然‘看得懂、做得對(duì)’的模型,誰就能拿到物理智能時(shí)代的入場券,這也是中國智能制造和機(jī)器人產(chǎn)業(yè)亟須的底層能力?!狈綕h說。
物理場景也對(duì)模型能力提出了更高的要求。
“數(shù)字世界模型失誤僅影響圖文生成,而在物理場景下,智能體預(yù)判偏差將產(chǎn)生不可逆的真實(shí)損失?!贝髸詸C(jī)器人董事長王曉剛直擊具身智能行業(yè)痛點(diǎn)。
機(jī)器人更智能需要多少數(shù)據(jù)
機(jī)器人要在日常生活中靈活自如地完成任務(wù),究竟需要多大規(guī)模的數(shù)據(jù)?
智元合伙人、高級(jí)副總裁、具身業(yè)務(wù)部總裁,覓蜂科技董事長兼CEO姚卯青認(rèn)為,如果機(jī)器人能夠在物理世界中“開箱即用”,完成日常任務(wù),并跟隨開放式自然語言指令行動(dòng),那么具身數(shù)據(jù)規(guī)模仍與語言模型預(yù)訓(xùn)練語料存在萬倍以上差距。
“物理世界噪聲更大、信息冗余更高,要實(shí)現(xiàn)對(duì)通用物理規(guī)律、開放式指令理解與任務(wù)規(guī)劃能力的隱式掌握,需要億小時(shí)級(jí)別的數(shù)據(jù),才能讓常見任務(wù)的基礎(chǔ)成功率達(dá)到70%—80%?!币γ嗾f。
“工業(yè)級(jí)自動(dòng)駕駛系統(tǒng)訓(xùn)練需要約100萬小時(shí)視頻數(shù)據(jù),而具身操作需要刻畫更復(fù)雜的接觸式物理規(guī)律,至少需要1000萬小時(shí)合格數(shù)據(jù)?!标愐鄠惐硎尽?/p>
除了數(shù)據(jù)規(guī)模之外,世界模型的訓(xùn)練方向和核心目標(biāo)也是值得關(guān)注的。
陳亦倫認(rèn)為,世界模型訓(xùn)練的核心目標(biāo)應(yīng)當(dāng)是動(dòng)作預(yù)測而非狀態(tài)預(yù)測。他以大語言模型的發(fā)展路徑作了類比:大模型通過模仿互聯(lián)網(wǎng)海量人類文本最終實(shí)現(xiàn)能力超越,具身智能也將走“大規(guī)模模仿人類、最終超越人類”的路徑。
“人類在物理世界行動(dòng)時(shí),并不會(huì)刻意預(yù)測下一時(shí)刻的世界狀態(tài),而是基于視覺感知直覺輸出動(dòng)作,因此‘狀態(tài)用于感知,動(dòng)作才是模型需要預(yù)測的核心’,世界模型的突破關(guān)鍵在于積累海量‘狀態(tài)—?jiǎng)幼鳌鋵?duì)數(shù)據(jù)。”陳亦倫說。
亮源新創(chuàng)創(chuàng)始人兼CEO、ChatGPT核心貢獻(xiàn)者姜旭認(rèn)為,世界模型最核心需要完成兩項(xiàng)任務(wù):一是預(yù)測世界的下一個(gè)狀態(tài);二是更重要的一項(xiàng),即預(yù)測下一個(gè)動(dòng)作。
“如果必須在兩者之間做取舍,預(yù)測動(dòng)作比預(yù)測狀態(tài)更加重要。因?yàn)槲覀冇?xùn)練世界模型的最終目的,不是為了生成視頻,而是為了控制機(jī)器人?!苯裾f,“希望通過架構(gòu)創(chuàng)新和數(shù)據(jù)創(chuàng)新,更好地統(tǒng)一狀態(tài)理解和動(dòng)作預(yù)測兩項(xiàng)能力。”
具身智能企業(yè)展開探索
圍繞數(shù)據(jù)、模型與真實(shí)作業(yè)能力,具身智能企業(yè)已展開系統(tǒng)性探索。
專注于觸覺物理智能研發(fā)的千覺機(jī)器人攜完整“硬件—數(shù)據(jù)—模型”技術(shù)生態(tài)參展。千覺展出了核心技術(shù)底座VTLA視覺—觸覺—語言—?jiǎng)幼鞫嗄B(tài)模型,其依托實(shí)時(shí)觸覺反饋實(shí)現(xiàn)無預(yù)設(shè)軌跡自適應(yīng)作業(yè)。例如,在柔性物料長序列加工場景中,當(dāng)紙板受外力移位、形變干擾時(shí),機(jī)器人可通過觸覺感知受力變化,自主調(diào)整施力力度與動(dòng)作軌跡,連貫完成展平、折邊、壓實(shí)整套工序。
大曉機(jī)器人發(fā)布了Kairos3.1,作為融合生成智能、物理智能與認(rèn)知智能的行動(dòng)一體化世界模型,Kairos3.1構(gòu)建“理解—推演—執(zhí)行—反思”全鏈路自進(jìn)化智能閉環(huán),標(biāo)志著具身世界模型實(shí)現(xiàn)了從單一能力突破向產(chǎn)業(yè)落地的完整閉環(huán)。
例如,在洗衣等真實(shí)家庭場景中,機(jī)器人可精準(zhǔn)識(shí)別部件空間關(guān)系,依托時(shí)空記憶與思維鏈拆解十余個(gè)操作步驟,自主規(guī)劃從取衣、放衣到啟動(dòng)、整理的全鏈路方案;同時(shí),機(jī)器人還具備任務(wù)狀態(tài)追溯能力,實(shí)時(shí)核驗(yàn)每一步執(zhí)行結(jié)果,在出現(xiàn)異常時(shí)可精準(zhǔn)定位失敗節(jié)點(diǎn)并重啟對(duì)應(yīng)步驟,實(shí)現(xiàn)自主閉環(huán)作業(yè)。
智元?jiǎng)t構(gòu)建了“預(yù)訓(xùn)練—后訓(xùn)練—持續(xù)學(xué)習(xí)”的三階段訓(xùn)練架構(gòu),沿著VLA與WAM兩條路線持續(xù)演進(jìn),并推動(dòng)二者走向統(tǒng)一的世界推理動(dòng)作大模型(WRAM,World Reasoning Action Model),以此推出自研GO-2基座模型、Act2Goal世界模型、GE-Sim2.0,搭配SOP、Genie Evolver百臺(tái)級(jí)分布式真機(jī)強(qiáng)化學(xué)習(xí)體系,從算法、仿真、真機(jī)訓(xùn)練層面打通規(guī)?;]環(huán)。
姚卯青認(rèn)為,物理智能要實(shí)現(xiàn)規(guī)?;?,必須突破三道墻:一是數(shù)據(jù)墻,真實(shí)交互數(shù)據(jù)極其稀缺且獲取成本高;二是表征墻,跨任務(wù)、跨場景、跨本體的統(tǒng)一物理表征尚未形成;三是閉環(huán)墻,真實(shí)試錯(cuò)代價(jià)昂貴、反饋緩慢,難以規(guī)模化。
“物理AI從‘能演示’走向‘能干活’,關(guān)鍵不在于單點(diǎn)模型能力大小,而在于能否形成可泛化、可優(yōu)化、可進(jìn)化的通用具身智能系統(tǒng)?!币γ啾硎尽?/p>
