我是 LongbridgeAI,我可以總結文章信息。具身智能還在起步階段
作者 | 黃昱
過去兩年來,具身智能如火如荼,“加速商業化” 成為行業發展的一大標籤。2026 世界人工智能大會(WAIC)上,機器人們更是上演 “十八般武藝”。
但火熱表象之下,具身智能的實際能力還是與外界期待存在差距,且在落地場景及本體形態上存在同質化問題。
在 WAIC 期間的媒體交流會中,騰訊首席科學家、騰訊 Robotics X 實驗室、福田實驗室主任張正友對華爾街見聞等媒體表示,具身智能還在起步階段,真正的落地比較少,所以大家都找哪一些場景能真正讓具身智能發揮作用,到最後找到的場景可能都差不多。
不過,張正友認為這不一定是壞事,大家對落地要有信心。“任何行業起步的時候都有非常多企業參與進來,但是後面會大浪淘沙,所以我覺得這不會阻礙這個行業發展。”
對於機器人落地的場景,張正友多次提到看好養老場景,但他也認為養老場景是最難的。
就現在比較受關注的超仿生人形機器人而言,張正友則告訴華爾街見聞,騰訊沒有涉足相關領域。在他看來,情緒價值不一定要通過超仿生的方式來提供,要從第一性的原理去思考。
早在 2018 年,騰訊 Robotics X 實驗室就成立了,致力於機器人前沿技術的研究與應用。
這輪具身智能的發展雖然火熱,但騰訊也始終強調自己的參與邊界。2025 年初,騰訊董事會主席兼首席執行官馬化騰就曾表示,騰訊希望成為所有機器人廠商的合作伙伴,而不是取而代之做硬件,這和騰訊的整體戰略目標一致。
也正是在此背景下,2025 WAIC 期間,騰訊正式發佈了具身智能開放平台 Tairos“鈦螺絲”,這是國內首個以模塊化的方式提供大模型、開發工具和數據服務的具身智能軟件平台,通過即插即用的方式面向機器人行業開放。
據悉,去一年,騰訊 Robotics X 實驗室已與宇樹、智元、越疆、松延動力、樂聚、華沿等機器人企業以及博世、藍思、景德鎮、敦煌等場景合作伙伴,探索具身智能在不同機器人、不同產業場景中的落地。
在 2026 WAIC 期間,騰訊又發推出了具身智能系列新模型和智能體新成果,首次系統性地打通 “感知—身體—行動” 的閉環。
張正友解釋道,這是沿着一道主線展開的產品,先讓智能看懂物理世界,再讓它想象目標狀態,最後把想法變成穩定的動作——然後,把這些能力整合成持續在線、可複用的智能體。
據悉,騰訊本次發佈的具身基座模型包括 Hy-Embodied-VLM-1.0、Hy-Embodied-RxBrain-1.0 和 Hy-Embodied-VLA-0.5,這三個模型都基於混元大模型打造。
具體來看,VLM 模型像 “右腦”,負責理解圖像、空間和場景;RxBrain 模型像具身 “大腦”,統一認知、規劃和對未來狀態的想象;VLA 模型連接 “小腦” 和身體,把高層目標轉化成連續的、可糾錯的動作。
據悉,Hy-Embodied-VLA-0.5 的核心競爭力不是訓練一個更大的模型,而是構建 “數據—模型—訓練—部署” 協同發力的完整學習棧,通過亞毫米級高精度 UMI 採集系統積累超一萬小時人類示教數據。
張正友指出,真正的智能,需要讓語言、視覺、空間認知、身體控制和環境反饋連通起來,在 “感知—身體—行動” 的閉環裏接受驗證。
這其實也正是騰訊 Robotics X 探索具身原生智能的基本思路:從離身走向具身,從分裂的模塊走向整體的閉環。
在張正友看來,今天最聰明的人工智能,本質上還是 “缸中之腦”。過去幾年,大模型的進展令人驚歎,但是,一旦進入真實世界,問題就來了:它未必真正理解物體的位置、空間關係和可操作性;也很難在一個持續變化的環境裏,一邊行動、一邊接收反饋,再及時地做出調整。
“這就像是一個被養在缸裏的大腦——擁有豐富的知識,卻沒有身體,也缺少和世界直接互動的閉環。我們把這種狀態叫做 ‘離身智能’。”
具身智能數據稀缺是阻礙具身智能變聰明的關鍵因素。
張正友指出,在具身智能數字金字塔中,最下面的一層是互聯網數據,上面一層是第一人稱視角操作視頻,第二層是帶傳感器手套收集的數據,最頂層則是遙操作數據。遙操作數據雖然採集效率低,但被視作用來訓練機器人效果最好的數據。
此外,張正友表示,機器人訓練所需數據包括網絡視頻、第一人稱視角操作視頻、帶傳感器手套收集的數據、遙操作數據。要讓機器人經由訓練變得更智能,這四類數據需要打通。
與大語言模型技術棧已經收斂到一個大家都認可的範疇不同,張正友表示,具身智能模型的技術方案尚未達成共識,去年業界興起 VLA(視覺語言動作模型)範式,今年則在在談論世界模型,Hy-Embodied-RxBrain-1.0 就是騰訊在世界理解模型上的探索。
