
科大訊飛星火大模型會超預期嗎?(二)

吹泡泡邏輯 首發原文鏈接
本來科大訊飛這個發佈會該寫的都寫過了,我覺得沒啥再更新的必要了,這麼大盤子,短線沒啥看頭,週五尾盤居然都沒有進來賭超預期的(也是好事)
發佈會的內容也基本上想的到。但是發現開完確實有超預期的地方,也看到了很多轉發的券商點評,但是建議先看看我五一寫的《科大訊飛星火發佈會超預期嗎?》,再來決定要不要看我往下扯:
超預期的地方在於:
一、科大訊飛比我想象中的要高調,敢直接用中文超過 ChatGPT,英文已經接近。對內直接説大模型遙遙領先國內可測的大模型。
首先我是相信的,這裏其實不是老師們理解的那種超越。
因為 ChatGPT 英文更優秀,而科大訊飛表述的超越部分是中文,這個不矛盾。
其實我們打破國外技術壟斷的例子很多,比如科大訊飛在語音識別領域是當之無愧的 NO1,萬華化學是 MDI 領域當之無愧的 NO1,這些都是從當初的不可能變成被打破的,不然他們不會一直吃紅利吃到現在。
其次,他直接説遙遙領先國內可測的大模型,到底是情商低吹牛呢,還是真的按捺不住呢?不好説,但看了我前面關於科大訊飛的文章,我是相信的。
我發現很多人有個誤區,過分高看名義上的大模型,忽視語音識別?容易把刁鑽對話當成推理(我稱之為腦經急轉彎),甚至數據源的錯誤這麼簡單的非技術問題,也會當 bug 來看。
建議真心想測試的,找個業內的從業人員,至少是程序員幫忙測吧。舉例説明,你非要問他一個人長了五隻眼睛的問題,那麼平時訓練也得是從權威期刊的論文和臨牀病例裏面來訓練吧,你問的這麼刁鑽肯定回答不了,他也判斷不了你是來搞笑的還是真問問題的,結果當然很詭異。所以説大模型存在的意義還是幫助我們提高科研和生產生活水平的,也許未來專門會有搞笑大模型,專門來訓練這些刁鑽問題腦經急轉彎玩的,否則正常的測試,應該找個專業人士,結合最終目的來測,比如訊飛的 AI+ 醫療已經運用於救死扶傷的醫療救治了,訊飛的學習機已經幫助孩子修改作文提高作文水平了,而你還在測各種稀奇古怪的問題,有什麼實際意義呢?除了搞笑大模型,別的任何一個模型測出來估計都會有問題。
早在 2021 年,國際低資源多語種語音識別競賽 OpenASR 落下帷幕,科大訊飛 - 中科大語音及語言信息處理國家工程實驗室(USTC-NELSLIP)聯合團隊(以下簡稱聯合團隊)參加了所有15 個語種受限賽道和 7 個語種非受限賽道,並全部取得第一名的成績!(就是説國外卡脖子的技術,被科大訊飛攻克後,除了中文外,其它 14 個語種的語音識別也都是全球第一)。
這就是我説的真實邏輯,但是很多時候你要接受市場是對的,市場資金不認可,再優秀也枉然。
二、產品的細節部分讓我意外
雖然知道訊飛有這些產品,但是比如説學習機辦公本、訊飛聽見、合成虛擬人的產品細節處理上,我認為進步非常大。如果你是相關行業的人,肯定知道這種水平的應用,縱使有瑕疵,也遮掩不住其打磨產品的週期和態度。
那麼多大模型還在預訓練和訓練的階段,訊飛都已經把產品化的細節處理到了這個程度(當很多發佈會還在打字提問,訊飛已經通過語音輸入、大模型回答轉成語音播報,甚至中英文對話、轉換成虛擬人生成視頻等,都已經融合的很好了),現場隨機抽取提問,也看得出來,公司根本不在乎提問環節是不是完美,因為 ChatGPT 都有錯誤,有些錯誤反而也是訓練的一部分,重要的看是否信心十足,是不是 ppt 發佈會。
看過發佈會的肯定能理解這對辦公效率的提升程度(也意味着其它企業可以從成本角度,直接付費購買)超預期的並不是這些產品,這些產品其實一直都有,超預期的地方在於這些產品細節打磨的很好,並且已經是在大量銷售的產品。
三、大模型發佈會的下半場,就是完全的產品發佈會
當有的人還在為訊飛發佈會會不會翻車而擔心的時候,公司的重心已經放在了產品銷售上了,也就是向所有人宣佈,不是跟你們吹概念,讓你們覺得我多牛,我就是直接給你展示大模型同步支撐的產品,希望你們多多買產品,孩子家長還有學校趕快採買學習機,公司領導趕快採購訊飛辦公本、錄音筆、訊飛聽見,甚至文字工作者們趕快購買,效率提升不是一星半點。
發佈會敢一直在屏幕下面輪番彈窗帶貨,關都關不掉,足見公司的重點根本不是要大家相信訊飛大模型遙遙領先,而是希望大家多買大模型的產品化終端。
四、AI+ 醫療
訊飛這裏提到了是超過 GPT4,而前面提到的中文超過 ChatGPT(沒有提 4),我就知道,醫療這裏的細分領域,他是有自信的。因為實踐實踐做夠久,我推測在醫院的真實場景訓練時間足夠久,當然也得益於我們國家的人口基數眾多,這個是不爭的事實,非常看好訊飛在這裏的行業應用。
説了這些,我就要解釋科大訊飛有沒有吹牛了。
首先,發佈會營銷上你誇大一點,沒有問題,但是敢這麼高調,基本盤是有多紮實?
其次我要解答一下大家問題了,訊飛憑什麼?很好理解,我們都知道算力緊缺,訓練費用昂貴,現在預訓練和訓練的成本不是一般高。
但是你別忘了,科大訊飛 1999 年成立,滿打滿算 20 多年了,語音識別本質上就是大模型前身,不説訓練了 20 年,也訓練十幾年了,訊飛幾個月喂的可能遠遠不如你的,但是人家十幾年喂的你知道有多少嗎?(舉例説明,看到訊飛發佈會音頻文字自由轉換,會議紀要可以自由總結生成紀要,試想訊飛的語料護城河裏面的語音數據轉換成結構化文本,不要太容易)
你搬運石頭去山路崎嶇的山頂上蓋個鵝卵石堆砌的大房子,運輸成本足夠昂貴吧,但是十幾年來,你每天堅持背幾塊石頭上山,十幾年能背多少?這個不難理解吧?我們熟知的成語: 愚公移山,精衞填海。
可能很多人不信,我前面的文章已經提過,我和某語音識別團隊走的很近,我當然知道語音識別不就是大模型前身嘛(或者你叫小模型、中模型?),2015 年前後搞語音識別模型升級時候,連續對話流行的詞好像叫 “從語音識別到語義識別”“深度神經網絡”。
早在 2015 年前,科大訊飛就穩穩坐上了語音識別一哥的寶座,那收集的語料護城河,在語音識別,後面的語音輸入、翻譯等等領域都訓練了十多年了,你當我前面文章寫十年磨一劍是瞎説呢?公司今天宣傳口徑看樣子是二十年磨一劍。
就靠着當初的語音識別護城河,和早期的大模型不斷訓練,訊飛已經早早的實現了語音輸入、語音對話、中英文翻譯等等。
而且很多東西,真的不是新東西。我來告訴你們 2015 年訊飛可以做到什麼,一個是十幾年來不斷優化升級,一個是近年才從頭開始,這個積累,軟、硬件產品的從業者最清楚吧:
開車不方便撥打電話就可以給訊飛合作的車機(就是現在的智能座艙)打電話:
“我要撥打電話”
“請問打給誰”
“我要撥給 XXX”
“請稍後,正在為您接通”
這個場景就解決了開車翻找電話本造成的風險了,這種連續對話能力,2015 年就可以實現了。
第二個場景:
打電話給訊飛:
“請幫我訂一張明天去深圳的機票”
“請問你要頭等艙還是經濟艙”
“我要靠窗的”
“好的,已為您預定,深圳有雨,請別忘記帶雨傘”
當然,那時候的場景,後台訂票肯定是人工收到指令去出票,換成現在,肯定可以實現授權後的在線支付了。
我上面舉的例子,其實是想説從語音識別角度,2015 年就可以實現連續對話了,現在文字輸入的連續對話,無非是推理能力加強了,算力加強了,模型更大算法更優了,訓練的更多了,但不可否認,這已經又過去八年了,訊飛這麼多年靠着語音識別進入這麼多行業,推出這麼多行業和個人產品,你説他的模型不隨之不斷訓練升級嗎?哪個產品不等於在不斷往回喂語料訓練?
這也是我前面説過的,要看傳承,十幾年的積累,無論是語音識別領域,還是搜索引擎領域,都不至於現在還要從頭預訓練,都訓練十幾年了,就像一個團隊完備的中餐館改造成自助餐店,比起重新招人租房子把毛坯改造成自助餐店,哪個快?哪個費錢?不難理解吧?
説到這裏,訊飛的超預期是毋庸置疑的,前面文章也説過了,你要幾分清醒幾分醉呢?不過邏輯歸邏輯,市場歸市場,我只科普邏輯。
吹泡泡邏輯 首發原文鏈接
$科大訊飛(002230.SZ)
本文版權歸屬原作者/機構所有。
當前內容僅代表作者觀點,與本平台立場無關。內容僅供投資者參考,亦不構成任何投資建議。如對本平台提供的內容服務有任何疑問或建議,請聯絡我們。

