终于有空回复你,同行你好。
我认为具身智能是一场骗局,这口锅主要该由学界来背,而不是工业界。这个概念最初就是学界炒热的,但在工业界,“机器人” 不是什么新词。机器人学习本身不是骗局,但 “通用具身智能马上到来” 这个说法几乎一定是骗局。
我本科毕业于二本院校,现在在新疆大学读研,导师指导也不多。复现成果时,我常常陷入很深的自我怀疑,因为很多 Oral 级别的论文,都有贡献过窄,标题和传播范围过大的通病。高水平论文把很强的工程抽象做得看起来很简洁,再通过标题,摘要和传播,把它包装成通用具身智能。
落到产业上就更有意思了。我接触过的企业(以中小企业为主,大企业我也接触不到),号称做具身智能的机器人,本质上就是以前的 RTOS 加了个 LLM,做一些简单的 RAG 或基于规则的自然语言指令。很多家用机器人 Demo,靠的是人在回路的遥控操作。还记得 Figure AI 吗?他们在工厂里也只是用少量机器人做简单任务。评测标准和仿真颗粒度上,当前工业界更是一团乱麻,普遍缺少足够细粒度的物理信息,而这种精度恰恰是灵巧操作所必需的。还有马斯克的 Optimus,2024 年发布时,现场互动也在很大程度上依赖人工操作。
工业界在实践上领先学界,学界在理论上领先工业界,这是一个基本规律。但现在强如工业界也没有拿出跨时代的成果,强如学界也没有出现真正跨时代的理论,那拿这些成果去融资,这不就是炒概念吗?
你可能会提到 VLA,VLA 不算划时代的。它本质上只是把 “视觉识别、语言理解、动作生成” 这几个已有的进步,用一个端到端网络缝合到了一起。工程整合很漂亮,但底层范式还是没变,依然缺乏常识推理,物理直觉和可泛化的操作智能。但是这个范式不改变,很难说短期内一定会突破。
视觉识别在进步是真的,语言规划在进步是真的,模仿学习在进步也是真的。可这些东西加在一起,充其量只是 RTOS 的 Plus 版本,连具身智能概念的边都还没摸到。