
當下還是自動駕駛更近 機器人至少還有五年 長期確定性很強 長期看多 短期看空
終於有空回覆你,同行你好。
我認為具身智能是一場騙局,這口鍋主要該由學界來背,而不是工業界。這個概念最初就是學界炒熱的,但在工業界,“機器人” 不是什麼新詞。機器人學習本身不是騙局,但 “通用具身智能馬上到來” 這個説法幾乎一定是騙局。
我本科畢業於二本院校,現在在新疆大學讀研,導師指導也不多。復現成果時,我常常陷入很深的自我懷疑,因為很多 Oral 級別的論文,都有貢獻過窄,標題和傳播範圍過大的通病。高水平論文把很強的工程抽象做得看起來很簡潔,再通過標題,摘要和傳播,把它包裝成通用具身智能。
落到產業上就更有意思了。我接觸過的企業(以中小企業為主,大企業我也接觸不到),號稱做具身智能的機器人,本質上就是以前的 RTOS 加了個 LLM,做一些簡單的 RAG 或基於規則的自然語言指令。很多家用機器人 Demo,靠的是人在迴路的遙控操作。還記得 Figure AI 嗎?他們在工廠裏也只是用少量機器人做簡單任務。評測標準和仿真顆粒度上,當前工業界更是一團亂麻,普遍缺少足夠細粒度的物理信息,而這種精度恰恰是靈巧操作所必需的。還有馬斯克的 Optimus,2024 年發佈時,現場互動也在很大程度上依賴人工操作。
工業界在實踐上領先學界,學界在理論上領先工業界,這是一個基本規律。但現在強如工業界也沒有拿出跨時代的成果,強如學界也沒有出現真正跨時代的理論,那拿這些成果去融資,這不就是炒概念嗎?
你可能會提到 VLA,VLA 不算劃時代的。它本質上只是把 “視覺識別、語言理解、動作生成” 這幾個已有的進步,用一個端到端網絡縫合到了一起。工程整合很漂亮,但底層範式還是沒變,依然缺乏常識推理,物理直覺和可泛化的操作智能。但是這個範式不改變,很難説短期內一定會突破。
視覺識別在進步是真的,語言規劃在進步是真的,模仿學習在進步也是真的。可這些東西加在一起,充其量只是 RTOS 的 Plus 版本,連具身智能概念的邊都還沒摸到。
本文版權歸屬原作者/機構所有。
當前內容僅代表作者觀點,與本平台立場無關。內容僅供投資者參考,亦不構成任何投資建議。如對本平台提供的內容服務有任何疑問或建議,請聯絡我們。

