

7 小时前
以下为海豚君整理的 $智谱(02513.HK) FY26 中期的财报电话会纪要,财报解读请移步《别怀疑,2026 就是国模 “智谱年”》。
一、财报核心信息回顾
1. ARR 首次披露,并主动给出两套口径
a. 截至 2026 年 8 月末,ARR 达 16 亿美元,口径为月度年化,即 8 月单月收入乘以 12。
b. 管理层同时点明行业内另一种更激进的算法——最近一周数据乘以 52;按该口径,考虑 GLM-5.3 放量后最新 ARR 已超 20 亿美元。
2. 收入结构完成切换,量价双升
a. 总量:上半年总收入 9.57 亿元人民币,折合 1.42 亿美元,同比增长接近 400%。
b. 分部:开放平台及 API 业务收入 8.25 亿元,折合 1.23 亿美元,同比增长超过 27 倍;占总收入比重由去年同期的 15.2%、去年年末的 26.3% 提升至 86.5%。
c. 量价拆分:API 平均定价提升约 101%,同期 coding plan 调用量较年初增长超过 23 倍。管理层据此强调放量由模型能力驱动,而非价格弹性。
3. 毛利率与算力效率同步改善
a. 开放平台及 API 业务毛利率由去年同期的 -0.4% 升至 24.6%,同比抬升 25 个百分点;较去年全年的 18.9% 亦抬升约 6 个百分点。
b. 公司首次提出"算力乘数",即每投入一元算力(含训练侧与推理侧)对应的开放平台及 API 收入,该指标较去年上半年提升 14 倍。
4. 亏损收窄,管理层称毛利已开始反哺研发
a. 上半年研发支出 21.3 亿元,约合 3.17 亿美元。
b. 期内亏损 20.72 亿元,同比减少 12.5%,亏损率(期内亏损除以收入)同比收窄 4.7 倍;经调整净亏损 19.64 亿元,经调整亏损率同比收窄 3.5 倍。
c. 管理层的判断依据是:经调整净亏损 19.64 亿元已小于研发投入 21.3 亿元,说明毛利在覆盖管理与销售费用后已开始反哺研发。
二、财报电话会详细内容
2.1 高管陈述核心信息
1. 能力阶梯与商业公式
a. 管理层将大模型演进定义为只能按顺序走完的五级阶梯:Chat、Coding、Agent、Co-worker、Autonomous AI,每级之间存在技术门槛,跨不过去则上一层商业模式不成熟。
b. 报告期内公司重心处在第二级(Coding)到第四级(Co-worker)之间,已在网络安全、法律、金融、教育等方向尝试,其中网络安全进展最快,其余仍处早期、未形成规模化收入。
c. 管理层提出的公式为:AGI 商业价值 = 智能上界 × token 消耗规模。任务边界每上一级,市场空间放大一个量级。
2. GLM-5.3 与 GLM-5.3 Flash
a. GLM-5.3 与 5.2 采用相同架构、相同总参数与激活参数,唯一变量是后训练规模,端到端任务完成率提升超过 50%;训练任务已从习题式转向接近专家真实工作的完整专业任务。
b. GLM-5.3 Flash 面向高频、大规模、成本敏感场景,总参数 320B、激活参数 18B,采用线性与混合注意力,价格为 5.2 的十分之一,基准测试与实际应用均优于 5.2。
c. Flash 以匿名模型形式上线首日登上 OpenRouter 榜首并刷新当时 token 用量记录,带动平台整体调用量提升超过 20%。
3. 商业形态的三段式演进
a. 2025 年以前为本地化部署阶段,客户购买的是需要被集成、被定制、被交付到自有环境的工具,叠加数据安全合规与自主可控要求。
b. 2025 年初进入 Coding 阶段,模型从知识驱动转向任务驱动;公司战略性收缩本地化部署的软件授权业务,转向可调用、可扩展、可计量的智能服务。
c. 今年进入 Agent 与 Co-worker 并行阶段,业务由卖调用走向卖订阅与端到端任务结果。管理层的归纳是:模型每完成一次能力跃迁,客户购买的东西就离最终经济价值近一步,收入结构随之改写一次。
4. 平台用户与客户质量
a. 截至 2026 年 8 月,MaaS 平台注册用户数超过 740 万,较年初增长 144%;付费日活用户数较年初增长 603%;按收入计的前十大用户,本月日均调用量较年初增长 98 倍。
b. 仅最近两个月,凭借 GLM-5.2、5.3 与 5.3 Flash,用户数由 6 月底的 580 万增加 160 万至 740 万。
c. 按 ARR 口径,年化贡献超过 10 万、50 万、100 万、1000 万、2500 万、2.5 亿美元的用户群组分别为 115 个、25 个、37 个、8 个、2 个、2 个。
5. 安全与治理
a. 做法是开源、开放与安全能力同步增长:通过开源权重、MaaS 平台、coding plan 与全球开发者网络让模型进入尽可能多的真实环境,同时以权限控制、过程监督、风险评估、漏洞披露与外部验证建立可靠性。
b. 最敏感能力实现受控,开源前由第三方团队独立评估漏洞、经国家漏洞库完成责任披露;分工原则是基准分数由公司自报、风险判断交给外部团队,不因能力提升而改变。
2.2 Q&A 问答
Q:公司在 coding 上的领先身位后续可以维持多长时间,会面临哪些关键变量?
A:单点榜单领先都会被追平,要建立的是持续领先的能力。 管理层表示 coding benchmark 以周或月为单位更新,很快会被追平,且榜单本身存在噪声,因此半年报中对 SOTA 的表述是"领先多久"不如问"持续领先的能力有多强"。
支撑证据是过去约 11 个月内模型家族从 4.6、4.7 到 5.1、5.2、5.3 连续完成多代迭代,能力曲线持续向上,同时单位任务成本维持在相对健康水平。
管理层同时说明,公司并不把 coding 视为一条收入增长快的产品线,而是技术逻辑上必须突破的卡点——沿 coding 往下走才能演进到 Agent、长程任务与 Co-worker。
Q:这套沉淀下来的模型能力打算如何迁移到 coding 以外的场景,落地路径是什么?
A:已在网络安全验证迁移成立,CyberGym 由 77.2 升至 84.5 分。 管理层解释选择 coding 入手,是因为它提供规模化、自动化、低成本的可验证环境——代码能否运行、测试是否通过、bug 是否修好都可客观判断。这对强化学习至关重要,而多数知识工作的难点恰恰是无法判断做没做对。
另一项 benchmark 由 5.2 的 24.4 分提升 30 个百分点至 54.4 分,且越需要完整长程规划的任务,5.3 相对 5.2 的提升越明显。
真实环境中,公司与多家国内安全团队合作,在真实代码库累计发现并经专家筛选去重的漏洞达 2436 个,其中超过 1000 个为高危,覆盖 269 个项目。
场景筛选标准有三条:智力门槛是否足够高、能否被有效验证、完成后是否有足够经济价值。法律、金融、数据分析也在尝试,但可靠性门槛与验证机制不同,商业化结构随之不同。
Q:目前算力扩张的进度如何?
A:未给卡数口径,主张改用"有效算力"与"算力乘数"衡量。 管理层称算力供给是行业共性问题,公司今年沿健康节奏持续扩张,训练侧与推理侧均在加大投入。
不用卡数衡量的理由是来源与用途均已多元:来源含自有集群、租赁与服务采购,用途覆盖预训练、中训练、后训练与推理,不同代际与架构芯片效率差异极大,加总不反映真实能力。
内部关注的是多少算力已安装、能稳定调度、长期运行并最终转化为训练进度与可计费 token。管理层认为要回答的不是有多少张卡,而是这些资源能支撑多快的模型迭代与多大规模的商业化 token 供给。
Q:现有算力资源能支撑多大规模的模型训练和推理需求?
A:推理侧已达 10 万卡级国产芯片,训练侧仍是异构算力的结构性错配。 10 万卡级国产芯片集群已实现规模化低成本推理,对应单位推理成本较年初下降 80%。
GLM-5.3 Flash 匿名上线时全面使用国产集群供服务,六天约 60 万亿 token 的调用量对 OpenRouter 与 OpenCode 都是历史级。管理层认为国产卡"能不能跑"已证明,深水区是验证经济性。
为此半年前起重做推理引擎与服务栈,含量化、PD 分离、layer split、缓存与通信优化,相同国产硬件下端到端性能较基线提升 3 倍。
训练侧是结构问题而非数量问题,对同构集群的稳定性、网络与软件栈要求很高,而国内以异构算力为主。
管理层预计三到六个月内先进国产卡放量后改善;新一代基座训练已在推进,算力配置优先保证关键训练窗口,不会因推理放量就挪走全部资源。
Q:市场认为模型层最终会商品化、价值转移到 harness 或 token 分发的编排层,是否认同?
A:认同单点领先不构成定价权,靠四件事维持,未来将出现两条价格曲线。 四点是迭代速度、真实任务完成率、单位智能成本、客户工作流深度。
迭代速度上,11 个月连续六代,智能指数由 32 升至 60,旗舰单任务成本维持 0.2 美元量级,Flash 约 0.045 美元。单点分数可复制,但这条曲线更难复制。
任务完成率上,公开配置趋同会让单题能力接近,但任务越长差异越大——连续数小时的工程任务需自己读代码库、调工具、处理失败并重新规划交付。
价值密度上,同样 100 万 token 用于闲聊与修复生产漏洞,客户价值完全不同。
工作流深度上,客户围绕模型积累 prompt、权限体系、评测标准与工程集成,切换成本上升。
验证数据:API 平均售价提高约 101% 的同时调用量仍大增,前十大用户日均调用量较年初增 98 倍。
由此判断同等级智能价格将持续下降,能打开新任务边界的模型仍有溢价乃至提价空间。
Q:公司在海外的竞争与出海业务有哪些进展?
A:出海形态转向开放平台与 API,预计 1–2 个月内有 CSP 合作进展。 管理层表示公司自 2025 年起已有规模意义的出海业务,早期以本地化部署形态的主权大模型项目为主,此前披露过的马来西亚项目即属该阶段。
随着业务主体转向开放平台与 API,GLM-5.3 Flash 是新形态下的一次尝试。管理层坦承中国模型整体在前沿能力上与海外头部模型仍有一定差距。
但若综合智能与成本两个维度判断最优,GLM-5.3 作为高阶智能代表、5.3 Flash 作为普惠高性价比代表卡住了两个生态位,半年报中的双帕累托最优图对此有说明。
后续将积极推进与海外 CSP 平台的合作,未来会考虑开源模型本地托管、收入分成等方式。
Q:下一代模型最核心的提升方向是什么,参数规模、架构和训练方式会有哪些变化?
A:继续放大基座、以小激活实现深度推理、强化后训练,终点是完全自训练。 技术路线已收敛:此前投入过多模态、视频与图像生成研究,但发现对提升智能上界帮助不大,因此专注文本。
基座仍会继续 scaling,做大以存储并更好表示知识,抬高智能天花板。但激活参数不能简单做大——激活过大会拖慢推理、抬高成本,导致难以普惠,因此方向是用不大的激活配合新方法实现更深度推理。
后训练是公司自认的优势项。管理层直言中国算力短期追不上美国头部实验室,必须依靠新的技术与工程方法;公司早在 2022 年 11 月 ChatGPT 发布时即成立数百人数据标注团队,本次 5.3 的效果跃升主要来自数据环境规模扩大了几十倍。
更远期目标是 fully self training(海外称 RSI,递归自我改进),即模型从预训练、中训练到后训练完全自己训练自己。最大挑战在于模型能否自行判断何时停止、何时纠正自己。伦理与社会治理也会纳入下一代考量。
Q:部分竞品开始向更大参数推进,公司在参数上相对克制的原因是什么,后续规划如何?
A:5.3 基座 7450 亿参数、设计寿命半年以上,下一代参数不予披露。 管理层称参数选择是三者权衡:手上有多少资源、模型最终要做成什么样子、用户什么时候能用上。
数据侧,国内当前数据规模一般在 30T 到 50T 量级;在数据与算力都有限的前提下,参数做到多大才最优需要商榷。管理层同时指出公司现有资源尚未把上限打满,因此单纯堆参数不是最关键的事。
公司从年初起有清晰路线:一月份确定 5.3 基座为 7450 亿参数时,就已决定这个基座要用半年以上,并据此排定 5.1、5.2、5.3 各自要做的事,以及配套的数据环境规模与园区规划。
下一代同样是很大的基座,但具体参数不予披露,其上做什么样的中训练与后训练仍在探讨。管理层强调的原则是每个基座都要把能量放大到最大,同时每一代都要让大家用得上——当前模型推理成本已优化到企业开源装上就能真正用起来,下一代也已提前开始做推理优化。
<正文结束>
本文的风险披露与声明:海豚研究免责声明及一般披露
登录即免费解锁5,263字全文
该内容仅登录用户可见,登录长桥账户后即可阅读全文
