智譜創始人唐傑聊 Scaling Law:大模型萬億參數曾是行業走的彎路,下一步關鍵在後訓練
我是 LongbridgeAI,我可以總結文章信息。智譜創始人唐傑發文闡述 Scaling Law 新理解,指出萬億參數曾是行業彎路。他以 GLM-5.3 為例,證明在基座不變情況下,通過後訓練(長時域環境訓練與強化學習)可顯著提升模型能力,AA 評測得分從 53 分升至 60 分。該觀點強調數據、算力分配及後訓練比單純堆砌參數更重要,對 AI 行業資源分配具參考價值。
智譜人工智能創始人唐傑 19 日在 X 平台發文,系統闡述其對 Scaling Law 的最新理解,並以 GLM-5.3 作為"控制變量實驗"佐證這一判斷。這篇帖子的發佈,恰好回應了外界對智譜未訓練全新基座模型的質疑。
唐傑在文中指出,參數量從來不是評估模型能力的唯一維度,數據規模、算力分配與推理部署條件同樣不可或缺。他表示,GLM-5.3 與上一代 GLM-5.2 共用相同基座、相同架構、相同的 753B 總參數與 40B 激活參數,差異僅在於增加了一個月的長時域環境訓練與強化學習(RL)後訓練——而由此帶來的能力提升"並非微小"。在 AA 評測指數中,GLM-5.3 獲得 60 分,較 GLM-5.2 的 53 分提升 7 分。

這一實驗結論的核心在於:當基座模型參數規模已足以承載足夠的知識,額外的能力提升往往來自"撥動其他旋鈕"——尤其是後訓練階段,而非繼續堆砌參數。這一判斷對當前整個 AI 行業如何分配訓練資源,具有直接的參考價值。
萬億參數:行業曾共同走過的彎路
唐傑在文中梳理了 Scaling Law 的演變脈絡。2020 年,Kaplan 等人得出結論,認為參數規模的增長應快於數據增長,比例約為 2.7:1。這一結論推動了 GPT-3、Gopher、MT-NLG 等超大規模模型的集中湧現,萬億參數一度被視為行業進步的必經路徑。
然而,2022 年 Hoffmann 等人對 400 餘個模型重新開展實驗後發現,算力最優的分配應接近每參數 20 個 Token,且隨着算力持續擴大,參數量與數據量應以大致相同的速度共同增長,而非持續拉大差距。這即是被廣泛引用的"Chinchilla Scaling Law"。
唐傑在帖子中直言,早期擬合誤差隨着算力量級的提升被不斷放大,導致當時規模最大的一批模型恰恰是算力分配最失衡的:
"萬億參數這一輪,回頭來看,是整個領域一起走了一段彎路,然後又一起折返。"
推理成本與 MoE:最優解持續移動
Chinchilla 之後,最優解並未就此固定。唐傑指出,Chinchilla 優化的目標是"訓練一次、評測一次"的模型,而今天的主流模型每天可能被調用數十億次,推理成本在全生命週期中遠超一次性訓練成本。
將推理成本納入目標函數後,最優解將向"更小模型、訓練更久"的方向移動。他援引 Llama-2-7B 與 Gemma-2-9B 為例,兩者每參數對應 Token 數分別約為 290 和 889,均屬刻意"過訓練"的範疇。
混合專家架構(MoE)的普及進一步使問題複雜化。唐傑區分了兩個在 MoE 語境下必須分開討論的維度:總參數量決定模型能夠存儲多少知識、事實與長尾信息;激活參數與每次前向計算的有效深度,則決定模型的長程推理能力。
他援引 Roberts 等人 2025 年的研究發現,最優的每參數 Token 數因任務而異——記憶類任務傾向於更多參數,推理類任務傾向於更多數據;而在固定每參數 Token 數的條件下,繼續增加總參數會降低推理能力,激活更多專家則能穩定提升推理表現。唐傑據此指出,識別漏洞這類需要二十步因果鏈推理的任務,其核心能力並不存在於總參數量之中。
GLM-5.3:一次控制變量實驗
基於上述判斷,唐傑將 GLM-5.3 定位為一次有意為之的"控制變量實驗"。相較於 GLM-5.2,GLM-5.3 保持基座、架構、總參數與激活參數完全不變,唯一的變量是增加了一個月的長時域環境 Scaling 與強化學習後訓練。
他坦言,此次選擇後訓練這一"旋鈕",是因為它當前擁有最大的改進空間,而非其他維度已無潛力可挖——"這並不意味着其他旋鈕已經轉到頭了。"他明確表示,基座模型規模、預訓練數據以及每次前向計算的算力投入,均仍在考量之列,下一步可能還會涉及中間訓練(mid-training)與預訓練層面的調整。
這一思路與外界此前對智譜"為何不訓新基座"的質疑形成直接回應。在唐傑的框架中,各旋鈕無需同步調節,關鍵在於判斷"下一個最值得撥動的是哪一個"。目前,GLM-5.3 的 Coding 能力已被多位開發者評價為國產模型中的當前最優水平。
風險提示及免責條款
市場有風險,投資需謹慎。本文不構成個人投資建議,也未考慮到個別用户特殊的投資目標、財務狀況或需要。用户應考慮本文中的任何意見、觀點或結論是否符合其特定狀況。據此投資,責任自負。

