---
title: "智谱创始人唐杰聊 Scaling Law：大模型万亿参数曾是行业走的弯路，下一步关键在后训练"
type: "News"
locale: "zh-CN"
url: "https://longbridge.com/zh-CN/news/296322809.md"
description: "智谱创始人唐杰发文阐述 Scaling Law 新理解，指出万亿参数曾是行业弯路。他以 GLM-5.3 为例，证明在基座不变情况下，通过后训练（长时域环境训练与强化学习）可显著提升模型能力，AA 评测得分从 53 分升至 60 分。该观点强调数据、算力分配及后训练比单纯堆砌参数更重要，对 AI 行业资源分配具参考价值。"
datetime: "2026-08-19T08:17:58.000Z"
locales:
  - [zh-CN](https://longbridge.com/zh-CN/news/296322809.md)
  - [en](https://longbridge.com/en/news/296322809.md)
  - [zh-HK](https://longbridge.com/zh-HK/news/296322809.md)
generator: "portal-rs"
---

# 智谱创始人唐杰聊 Scaling Law：大模型万亿参数曾是行业走的弯路，下一步关键在后训练

智谱人工智能创始人唐杰 19 日在 X 平台发文，系统阐述其对 Scaling Law 的最新理解，并以 GLM-5.3 作为"控制变量实验"佐证这一判断。这篇帖子的发布，恰好回应了外界对智谱未训练全新基座模型的质疑。

唐杰在文中指出，**参数量从来不是评估模型能力的唯一维度，数据规模、算力分配与推理部署条件同样不可或缺。**他表示，GLM-5.3 与上一代 GLM-5.2 共用相同基座、相同架构、相同的 753B 总参数与 40B 激活参数，差异仅在于增加了一个月的长时域环境训练与强化学习（RL）后训练——而由此带来的能力提升"并非微小"。在 AA 评测指数中，GLM-5.3 获得 60 分，较 GLM-5.2 的 53 分提升 7 分。

这一实验结论的核心在于：当基座模型参数规模已足以承载足够的知识，额外的能力提升往往来自"拨动其他旋钮"——尤其是后训练阶段，而非继续堆砌参数。这一判断对当前整个 AI 行业如何分配训练资源，具有直接的参考价值。

## 万亿参数：行业曾共同走过的弯路

唐杰在文中梳理了 Scaling Law 的演变脉络。2020 年，Kaplan 等人得出结论，认为参数规模的增长应快于数据增长，比例约为 2.7:1。这一结论推动了 GPT-3、Gopher、MT-NLG 等超大规模模型的集中涌现，万亿参数一度被视为行业进步的必经路径。

然而，2022 年 Hoffmann 等人对 400 余个模型重新开展实验后发现，算力最优的分配应接近每参数 20 个 Token，且随着算力持续扩大，参数量与数据量应以大致相同的速度共同增长，而非持续拉大差距。这即是被广泛引用的"Chinchilla Scaling Law"。

唐杰在帖子中直言，早期拟合误差随着算力量级的提升被不断放大，导致当时规模最大的一批模型恰恰是算力分配最失衡的：

> **"万亿参数这一轮，回头来看，是整个领域一起走了一段弯路，然后又一起折返。"**
> 
> 
## 推理成本与 MoE：最优解持续移动

Chinchilla 之后，最优解并未就此固定。唐杰指出，Chinchilla 优化的目标是"训练一次、评测一次"的模型，而今天的主流模型每天可能被调用数十亿次，推理成本在全生命周期中远超一次性训练成本。

将推理成本纳入目标函数后，最优解将向"更小模型、训练更久"的方向移动。他援引 Llama-2-7B 与 Gemma-2-9B 为例，两者每参数对应 Token 数分别约为 290 和 889，均属刻意"过训练"的范畴。

混合专家架构（MoE）的普及进一步使问题复杂化。唐杰区分了两个在 MoE 语境下必须分开讨论的维度：**总参数量决定模型能够存储多少知识、事实与长尾信息；激活参数与每次前向计算的有效深度，则决定模型的长程推理能力。**

他援引 Roberts 等人 2025 年的研究发现，最优的每参数 Token 数因任务而异——记忆类任务倾向于更多参数，推理类任务倾向于更多数据；而在固定每参数 Token 数的条件下，继续增加总参数会降低推理能力，激活更多专家则能稳定提升推理表现。唐杰据此指出，识别漏洞这类需要二十步因果链推理的任务，其核心能力并不存在于总参数量之中。

## GLM-5.3：一次控制变量实验

基于上述判断，唐杰将 GLM-5.3 定位为一次有意为之的"控制变量实验"。**相较于 GLM-5.2，GLM-5.3 保持基座、架构、总参数与激活参数完全不变，唯一的变量是增加了一个月的长时域环境 Scaling 与强化学习后训练。**

他坦言，此次选择后训练这一"旋钮"，是因为它当前拥有最大的改进空间，而非其他维度已无潜力可挖——"这并不意味着其他旋钮已经转到头了。"他明确表示，基座模型规模、预训练数据以及每次前向计算的算力投入，均仍在考量之列，下一步可能还会涉及中间训练（mid-training）与预训练层面的调整。

这一思路与外界此前对智谱"为何不训新基座"的质疑形成直接回应。在唐杰的框架中，各旋钮无需同步调节，关键在于判断"下一个最值得拨动的是哪一个"。目前，GLM-5.3 的 Coding 能力已被多位开发者评价为国产模型中的当前最优水平。

风险提示及免责条款

市场有风险，投资需谨慎。本文不构成个人投资建议，也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资，责任自负。

### 相关股票

- [02513.HK](https://longbridge.com/zh-CN/quote/02513.HK.md)

## 相关资讯与研究

- [智谱完成了约 50 亿美元的融资，用于开发下一代 GLM 模型](https://longbridge.com/zh-CN/news/298871677.md)
- [智谱公开了下一代 GLM 的预览：其完全自我训练的方法已经公布](https://longbridge.com/zh-CN/news/298857861.md)
- [一周回顾 | MAGS.US 本周表现，AI 变现与算力扩容成主线](https://longbridge.com/zh-CN/news/298785345.md)
- [GoMining 成为首个直接以比特币挖矿算力支付收益的平台](https://longbridge.com/zh-CN/news/298721476.md)
- [港股异动：智谱重挫 10.18%：大模型赛道拥挤遭投行看淡，空头撤退能否支撑反弹？](https://longbridge.com/zh-CN/news/298546348.md)

---
> **免责声明: 本文仅供参考，不构成任何投资建议。**