
今天與一個多年未見的海歸同學吃飯,席間聊起了全球火爆的生成式 AI。
關於 OpenAI 年內發佈的 Sora ,直觀來看和國內的 “文生視頻”、“圖生視頻”、“視頻生視頻” 最大的區別在於,國內的 AI 視頻技術生成內容長度只有幾秒,而 Sora 可僅根據文本描述,就生成長達 1 分鐘的視頻。但同學認為,Sora 真正的優勢在於生成了包含細膩複雜的場景、生動角色表情的多鏡頭連貫流暢視頻,尤其是在人物面部刻畫和場景切換上更加自然。他認為 Sora 通過去噪和梯度計算,學會複雜的圖像渲染、直觀的物理行為、長遠規劃能力以及語義層面的理解,從而模擬出真實或虛構的世界,預測事物即將發生的變化趨勢,從而採取應對策略,才是 Sora 競爭力的根本。
這讓人聯想到$百度(BIDU.US) “文心一言” 和月之暗面的 Kimi 兩個大語言模型。Kimi 上線之初最大的特點是處理 20 萬字的文本能力,這要比去年的 “文心一言” 以及其他的大語言模型處理能力都強,但這算不上技術上的超越,“道” 未變,僅 “術” 而已,與 Sora 相對於國內生成式 AI 視頻的技術領先並不一樣。今年百度已經快速開放了幾百萬字的長文本能力,可見文本字符規模並不算多麼大的技術壁壘。
像本人創作時也經常使用百家號平台,在輔助創作時能夠幫助過篩一些文字、標點的錯誤,Kimi 也沒比百度更加高明。如果站在近期競爭點算力,和遠期競爭點商業化模式來看,Kimi 目前怎麼看也沒有比 “文心一言” 斷代領先的黑科技!百度商業化場景反而是更領先的一方!
本文版權歸屬原作者/機構所有。
當前內容僅代表作者觀點,與本平台立場無關。內容僅供投資者參考,亦不構成任何投資建議。如對本平台提供的內容服務有任何疑問或建議,請聯絡我們。


