明大教主
2024.06.03 11:12

今天与一个多年未见的海归同学吃饭,席间聊起了全球火爆的生成式 AI。

  关于 OpenAI 年内发布的 Sora ,直观来看和国内的 “文生视频”、“图生视频”、“视频生视频” 最大的区别在于,国内的 AI 视频技术生成内容长度只有几秒,而 Sora 可仅根据文本描述,就生成长达 1 分钟的视频。但同学认为,Sora 真正的优势在于生成了包含细腻复杂的场景、生动角色表情的多镜头连贯流畅视频,尤其是在人物面部刻画和场景切换上更加自然。他认为 Sora 通过去噪和梯度计算,学会复杂的图像渲染、直观的物理行为、长远规划能力以及语义层面的理解,从而模拟出真实或虚构的世界,预测事物即将发生的变化趋势,从而采取应对策略,才是 Sora 竞争力的根本。

 这让人联想到$百度(BIDU.US) “文心一言” 和月之暗面的 Kimi 两个大语言模型。Kimi 上线之初最大的特点是处理 20 万字的文本能力,这要比去年的 “文心一言” 以及其他的大语言模型处理能力都强,但这算不上技术上的超越,“道” 未变,仅 “术” 而已,与 Sora 相对于国内生成式 AI 视频的技术领先并不一样。今年百度已经快速开放了几百万字的长文本能力,可见文本字符规模并不算多么大的技术壁垒。

像本人创作时也经常使用百家号平台,在辅助创作时能够帮助过筛一些文字、标点的错误,Kimi 也没比百度更加高明。如果站在近期竞争点算力,和远期竞争点商业化模式来看,Kimi 目前怎么看也没有比 “文心一言” 断代领先的黑科技!百度商业化场景反而是更领先的一方!

本文版权归属原作者/机构所有。

当前内容仅代表作者观点,与本平台立场无关。内容仅供投资者参考,亦不构成任何投资建议。如对本平台提供的内容服务有任何疑问或建议,请联系我们。