---
title: "智譜創始人唐傑聊 Scaling Law：大模型萬億參數曾是行業走的彎路，下一步關鍵在後訓練"
type: "News"
locale: "zh-HK"
url: "https://longbridge.com/zh-HK/news/296322809.md"
description: "智譜創始人唐傑發文闡述 Scaling Law 新理解，指出萬億參數曾是行業彎路。他以 GLM-5.3 為例，證明在基座不變情況下，通過後訓練（長時域環境訓練與強化學習）可顯著提升模型能力，AA 評測得分從 53 分升至 60 分。該觀點強調數據、算力分配及後訓練比單純堆砌參數更重要，對 AI 行業資源分配具參考價值。"
datetime: "2026-08-19T08:17:58.000Z"
locales:
  - [zh-CN](https://longbridge.com/zh-CN/news/296322809.md)
  - [en](https://longbridge.com/en/news/296322809.md)
  - [zh-HK](https://longbridge.com/zh-HK/news/296322809.md)
generator: "portal-rs"
---

# 智譜創始人唐傑聊 Scaling Law：大模型萬億參數曾是行業走的彎路，下一步關鍵在後訓練

智譜人工智能創始人唐傑 19 日在 X 平台發文，系統闡述其對 Scaling Law 的最新理解，並以 GLM-5.3 作為"控制變量實驗"佐證這一判斷。這篇帖子的發佈，恰好回應了外界對智譜未訓練全新基座模型的質疑。

唐傑在文中指出，**參數量從來不是評估模型能力的唯一維度，數據規模、算力分配與推理部署條件同樣不可或缺。**他表示，GLM-5.3 與上一代 GLM-5.2 共用相同基座、相同架構、相同的 753B 總參數與 40B 激活參數，差異僅在於增加了一個月的長時域環境訓練與強化學習（RL）後訓練——而由此帶來的能力提升"並非微小"。在 AA 評測指數中，GLM-5.3 獲得 60 分，較 GLM-5.2 的 53 分提升 7 分。

這一實驗結論的核心在於：當基座模型參數規模已足以承載足夠的知識，額外的能力提升往往來自"撥動其他旋鈕"——尤其是後訓練階段，而非繼續堆砌參數。這一判斷對當前整個 AI 行業如何分配訓練資源，具有直接的參考價值。

## 萬億參數：行業曾共同走過的彎路

唐傑在文中梳理了 Scaling Law 的演變脈絡。2020 年，Kaplan 等人得出結論，認為參數規模的增長應快於數據增長，比例約為 2.7:1。這一結論推動了 GPT-3、Gopher、MT-NLG 等超大規模模型的集中湧現，萬億參數一度被視為行業進步的必經路徑。

然而，2022 年 Hoffmann 等人對 400 餘個模型重新開展實驗後發現，算力最優的分配應接近每參數 20 個 Token，且隨着算力持續擴大，參數量與數據量應以大致相同的速度共同增長，而非持續拉大差距。這即是被廣泛引用的"Chinchilla Scaling Law"。

唐傑在帖子中直言，早期擬合誤差隨着算力量級的提升被不斷放大，導致當時規模最大的一批模型恰恰是算力分配最失衡的：

> **"萬億參數這一輪，回頭來看，是整個領域一起走了一段彎路，然後又一起折返。"**
> 
> 
## 推理成本與 MoE：最優解持續移動

Chinchilla 之後，最優解並未就此固定。唐傑指出，Chinchilla 優化的目標是"訓練一次、評測一次"的模型，而今天的主流模型每天可能被調用數十億次，推理成本在全生命週期中遠超一次性訓練成本。

將推理成本納入目標函數後，最優解將向"更小模型、訓練更久"的方向移動。他援引 Llama-2-7B 與 Gemma-2-9B 為例，兩者每參數對應 Token 數分別約為 290 和 889，均屬刻意"過訓練"的範疇。

混合專家架構（MoE）的普及進一步使問題複雜化。唐傑區分了兩個在 MoE 語境下必須分開討論的維度：**總參數量決定模型能夠存儲多少知識、事實與長尾信息；激活參數與每次前向計算的有效深度，則決定模型的長程推理能力。**

他援引 Roberts 等人 2025 年的研究發現，最優的每參數 Token 數因任務而異——記憶類任務傾向於更多參數，推理類任務傾向於更多數據；而在固定每參數 Token 數的條件下，繼續增加總參數會降低推理能力，激活更多專家則能穩定提升推理表現。唐傑據此指出，識別漏洞這類需要二十步因果鏈推理的任務，其核心能力並不存在於總參數量之中。

## GLM-5.3：一次控制變量實驗

基於上述判斷，唐傑將 GLM-5.3 定位為一次有意為之的"控制變量實驗"。**相較於 GLM-5.2，GLM-5.3 保持基座、架構、總參數與激活參數完全不變，唯一的變量是增加了一個月的長時域環境 Scaling 與強化學習後訓練。**

他坦言，此次選擇後訓練這一"旋鈕"，是因為它當前擁有最大的改進空間，而非其他維度已無潛力可挖——"這並不意味着其他旋鈕已經轉到頭了。"他明確表示，基座模型規模、預訓練數據以及每次前向計算的算力投入，均仍在考量之列，下一步可能還會涉及中間訓練（mid-training）與預訓練層面的調整。

這一思路與外界此前對智譜"為何不訓新基座"的質疑形成直接回應。在唐傑的框架中，各旋鈕無需同步調節，關鍵在於判斷"下一個最值得撥動的是哪一個"。目前，GLM-5.3 的 Coding 能力已被多位開發者評價為國產模型中的當前最優水平。

風險提示及免責條款

市場有風險，投資需謹慎。本文不構成個人投資建議，也未考慮到個別用户特殊的投資目標、財務狀況或需要。用户應考慮本文中的任何意見、觀點或結論是否符合其特定狀況。據此投資，責任自負。

### 相關股票

- [02513.HK](https://longbridge.com/zh-HK/quote/02513.HK.md)

## 相關資訊與研究

- [智譜的天貓旗艦店搜索量激增 50 倍；代幣產品交易增長超過 1.6 倍](https://longbridge.com/zh-HK/news/298010550.md)
- [智譜和 MINIMAX-W 在香港上市幾個月後是否面臨不同的財務命運？](https://longbridge.com/zh-HK/news/297919383.md)
- [OpenAI 的新模型 “Astra”：核心技術使其具備超強的推理能力](https://longbridge.com/zh-HK/news/297863964.md)
- [隨着大型語言模型市場競爭加劇，滙豐研究維持對智譜的持有評級](https://longbridge.com/zh-HK/news/298006033.md)
- [港股異動：中際旭創 H 股漲逾 9%，花旗高盛雙 “買入” 評級引爆 AI 算力熱潮](https://longbridge.com/zh-HK/news/298171736.md)

---
> **免責聲明: 本文僅供參考，不構成任何投資建議。**