---
title: "AI 要砸到哪才算底，其实 token 规律给了答案"
type: "Topics"
locale: "zh-CN"
url: "https://longbridge.com/zh-CN/topics/43025853.md"
description: "为什么什么利好不管用了？这一年涨的是 AI coding 自循环，而它和所有 AI 生意一样服从同一条 token 规律。后面 AI 有没有趋势还是要从底层的 token 规律看。"
datetime: "2026-07-29T06:20:43.000Z"
locales:
  - [en](https://longbridge.com/en/topics/43025853.md)
  - [zh-CN](https://longbridge.com/zh-CN/topics/43025853.md)
  - [zh-HK](https://longbridge.com/zh-HK/topics/43025853.md)
author: "[sofa硬科技](https://longbridge.com/zh-CN/profiles/2081951097110011904.md)"
generator: "portal-rs"
---

# AI 要砸到哪才算底，其实 token 规律给了答案

什么好消息都不管用了，利好全当空头砸

**谷歌财报市场砸一波，康宁盈利符合预期市场接着砸，市场对这周各大厂财报瑟瑟发抖。**任何利好都是利空，其实去年四季度和现在的市场情绪特别像。 那时时候 OpenAI 刚完成一轮大规模融资，行业状况非常强劲，但股票就是持续横盘。市场参与者每天都在争论资本开支、ROI、估值和融资——**和现在一模一样。**

而这个季度的财报，结论仍然是压倒性积极的。谷歌云增长 82%，云计算投资的 ROI 得到验证；英特尔大幅超出预期；ASML、台积电和英特尔都提高了订单或资本开支展望。可以推测，这些公司也看到了极为强劲的下游预测——**强到让供应链里最保守的参与者，都有信心去做激进押注。**

**如果这些信息是在五月或六月公布的，半导体股票几乎肯定会大幅上涨。**

然而现在，每一次财报发布反而成了空头重新评估估值和长期投资逻辑的机会。我们可能正在看到的是，AI 市场已经不再处于五、六月的那个"AI 夏季"，**同样的积极进展，对股价的支撑变少了。**

以谷歌云 82% 的增长为例。以前市场的第一反应会是："AI 需求超出了预期——催化剂来了。"现在的第一反应却是："那又怎样？2028 年呢？OpenAI 能盈利吗？GPU 价格还能涨几年？折旧又在上升、融资成本在增加，整个资本开支论点需要重新定价。"

**本质上，市场已经从交易 AI 资本开支的增长，转向交易它的可持续性和 ROI。**

在我们看来，市场情绪已经变得极度看空。连长期多头都开始质疑 AI 半导体股票是否还能继续上涨，几乎听不到任何喊新高的声音。**而当市场从寻找进一步上涨空间，转向搜寻额外下行风险时，通常意味着悲观预期已被基本计入。**

尽管如此，我们对基本面毫无疑虑，也相信最终是事实决定股价。那么问题就变成了：**什么会让这些股票再次上涨？**

在上述框架下，**仅有额外的资本支出计划，已经不足以说服空头。需要的是对新需求曲线的验证。而最强大、最直接的催化剂，将是爆款产品的出现。**

**如果说"Coding 1.0"证明了 AI 可以提升开发者的生产力，那么"Coding 2.0"必须展示 AI 代理能真正取代软件开发过程中的一部分。** 一旦新的生产力用例得到验证，市场对 AI ROI 的担忧就可能被重新定义——**AI 基础设施支出将再次被视为"生产力投资"，而不是"成本"。**

但"爆款产品"只是答案的一半。要看清另一半，得先把这轮争论里被误读最深的那个指标校准了。

* * *

## 一、先校准那个被误读的指标

这轮"AI 是不是见顶了"的争论，很大程度上是被一张图点燃的——Silicon Data 的 **LLM Token Expenditure Index（大模型 token 支出指数）**。

市场把它当成 AI 硬件交易能不能延续的下游验证指标：如果 token 定价掉头，那么从内存交易到整个硬件和数据中心交易，这一轮可能就要结束了。担心不难理解——AI 硬件投资终究要靠下游的模型收入来支撑。

但这里有一个关键误读，它决定了后面所有推论的方向：

**这个指数不是 token 用量指数，也不是 AI 总支出指数，而是一个"用量加权的平均 token 价格指数"。**

说白了，它跟踪的不是"大家用了多少 token"，而是"大家平均愿意为每百万 token 付多少钱"。

所以指数回落，不能直接读成 AI 需求下滑或硬件需求见顶。它更准确反映的是——**市场还愿不愿意为最强的模型付溢价。** 只要 token 总量还在增长，即使平均单价周期性回落，实际的算力消耗也不必下降。

话要说全：指数回落虽然不能证明 AI 需求见顶，**但它确实影响模型层的收入结构、毛利率和资本开支回本预期**——这也正是它值得被认真对待的原因。

## 二、指数走出来的规律：一个"强模型溢价周期"

把过去几个月的轨迹拉出来，它对应的其实是一个非常规整的循环：

**2025 年末**，Gemini 3 Pro、Claude Opus 4.5、GPT-5.2 这些新一代模型刚发布，指数还在低位——大家还没用起来。

**2026 年 1 月**，企业和开发者逐步采用，用量流向更贵的闭源前沿模型，**指数快速上行**。

**2 月到 3 月初**，Kimi、DeepSeek、Qwen、GLM 一批更便宜的开源或开放权重模型密集发布，一部分常规任务迁移到低价模型，**指数回落**。

**3 月到 5 月**，GPT-5.4、GPT-5.5、Opus 4.7、Opus 4.8、Gemini 3.1、Grok 4.3 陆续推出，市场再次为更强能力付钱，**指数重新上行，突破 2.0**。

**6 月初**，再度回落。

规律因此很清楚：

> **新模型发布 → 能力天花板抬高 → 市场愿意付更高单价 → 模型被摸透、能力边界被画清 → 常规任务下沉到便宜模型 → 溢价自然消退 → 下一个更强的模型出现 → 愿付价格再次上移。**

**所以每一次回落，都不完全是开源替代造成的，更不必然意味着 AI 需求下滑。** 它是这个循环里的常规一格。六月初那次回落，最合理的解读是 GPT-5.5 / Opus 4.8 这一代被市场充分理解之后的一次**周期性溢价回吐**，把它直接读成 AI 硬件周期结束，并不准确。

## 三、但这一轮多了一样东西：ROI 纪律

如果只有上面那个循环，事情还简单。这一轮的复杂之处在于，需求侧同时发生了一个结构性变化——**token maxxing 进入了 ROI 纪律阶段。**

上半年早期的做法很直接：鼓励员工尽可能多用 AI，把 token 消耗当作 AI 渗透率和组织转型速度的信号。硅谷资深工程师每月 1–3 万美元的 token 预算相当常见；黄仁勋甚至说过，一个年薪 50 万美元的工程师如果一年没在 token 上烧掉其中一半，就该担心自己没在认真用 AI；OpenAI 的 Frontier 团队按"一个研究员 + 多个 agent 并行操作同一个代码库"组织，单团队日消耗 10 亿 token 以上；Meta 搞了一个覆盖 8.5 万员工的 "Claudeonomics" 排行榜，token 消耗排名直接进入裁员决策。

**四月之后，企业有点撑不住了。**

企业发现 token 用量涨得快、账单涨得更快，但到底转化成多少真实产出，并不好回答。**token 能反映使用强度，但不直接等于生产力**——消耗更多 token 的团队，未必交付更多代码、更少 bug、更高收入。亚马逊内部甚至出现员工制造无意义的 AI 任务来刷用量：一旦 token 被做成排行榜或 KPI，它就从"观察指标"变成了"可以被操纵的数字"。

账单压力很快把争论推上台面。五月底到六月初集中曝出一批案例：**Uber 四个月烧完了 2026 全年的 AI 编码预算**，随后对 Claude Code、Cursor 这类工具设定每人每月 1500 美元上限，超支需内部审批；**微软取消了部分内部 Claude Code 许可**，要求 Experiences + Devices 部门迁回 GitHub Copilot CLI；**Salesforce 的 Anthropic 年账单约 3 亿美元**，Benioff 开始强调用智能路由把不同任务分配给不同价位的模型；Priceline 的 Cursor 续约报价上涨 4–5 倍；还有一家没设上限的大公司，月度 Claude 账单达到 5 亿美元。

**不是 AI 支出消失，而是 AI 从无约束试用，到需要更有纪律的生产力预算管理。**

管理框架也在跟着升级：Salesforce 推出 "Agentic Work Units"，把衡量重心从"消耗了多少 token"移到"agent 完成了多少工作"；Linux 基金会下计划成立的 Tokenomics Foundation，要推进 token 计量、成本审计和跨厂商标准化。方向明确——**token 不会退出企业管理，但会从一个虚荣的使用量指标，变成可审计、可预算、可优化的成本指标。**

**这对模型层收入的含义需要说得很精确：关键变量不只是"最强的模型能不能做到"，而是"有多少任务值得用最强的模型去做"。** 高价值的工程、研究、安全、复杂投研任务愿意承受更高 token 成本；普通工作流则更多依赖便宜模型、成熟工作流或模型路由。**能力最强不等于成本效率最优。**

供给侧也承认了这一点。六月初 OpenAI 的一场企业活动上，Sam Altman 直言成本优化已经成为企业客户非常重要的诉求。**客户问的问题，从"模型行不行"变成了"这些能力能不能更便宜、更可控、更可审计地用起来"。**

## 四、Fable 5 是天花板，但是撞上了东方大国的开源模型

按前面那个循环，六月本该迎来新一轮上行。

6 月 9 日，Anthropic 发布 Claude Fable 5 和 Mythos 5，两者共享同一底层模型，参数量和训练算力都显著大于 Opus 系列旗舰，基准全面领先（SWE-Bench Pro 80.3% vs Opus 4.8 的 69.2%），**而且任务越长越复杂，相对优势越大**。

它对指数的推力有三条，都很机械：**第一，它本身就更贵**，每百万 token 输入 10 美元、输出 50 美元，约为 Opus 4.8 的两倍；**第二，它拉开差距的地方不是普通问答，而是长周期编码、复杂知识工作、全仓库迁移和多轮 agent 任务**——这类任务价值更高、消耗更多 token，且输出 token 占比更高，而输出的定价明显高于输入；**第三，6 月 22 日试用期结束后，Fable 5 退出月度套餐，改为消耗使用额度**，最强能力不再被打包进订阅池，而是以按量付费的形式直接反映进价格指数。

（中间那段监管扰动也该交代清楚：Fable 5 / Mythos 5 在 6 月 12 日因美国商务部出口管制被暂停访问，管制 6 月 30 日解除，7 月 1 日恢复。它打乱了高价模型的放量节奏，但看起来是一次性事件，不改变长期叙事。）

**问题在于，这一次抬天花板的动作，撞上了一股此前从未如此密集的反向力量。**

7 月 16 日，月之暗面发布 Kimi K3——2.8 万亿参数、每 token 从 896 个专家里激活 16 个的 MoE 模型，在独立评测上得分 57.1，**位列全球第三，仅次于 Fable 5（59.9）和 GPT-5.6 Sol（58.9）**，编码榜一度登顶，而**完整权重定于 7 月 27 日开源**。同一个周末，阿里推出 2.4 万亿参数的 Qwen3.8-Max-Preview，同样计划开放权重。再往前，DeepSeek、GLM、MiniMax 都在同一条赛道上。

**这就把原本"依次发生"的循环，压成了"同时发生"。**

过去的节奏是有先后的：新模型上市 → 溢价上行 → 被摸透 → 常规任务下沉到便宜模型 → 溢价回落 → 下一个更强模型。中间那段"溢价上行"能持续好几个月。

**现在，抬天花板和拆收费站是并行的。** Fable 5 六月抬高上限，K3 七月就把一个准前沿的替代品做成了免费文件。用一句话概括这个机制：**开源把模型从"服务"变成了"文件"——而服务有定价权，文件只有分发。** 一旦权重公开，定价权就从"模型的作者"手里，转移到了"谁能最便宜地把它跑起来"。闭源 API 那道估计 80% 以上的毛利，落到开源加托管的路径上只剩 40–45%。

**溢价的半衰期因此在急剧缩短。** 上一个开源迭代周期在三个月内追平了 13 个指数分，只剩 2.8 分的差距；有测算认为最好的开源模型距离前沿只落后约四个月。**前沿溢价过去按年折旧，现在按发布周期折旧。**

用量数据也在同向移动：OpenRouter 上单价低于 1 美元/百万 token 的调用占比五个月从 18% 涨到 41%；中国开源模型的 token 份额 18 个月从不到 2% 涨到约 61%，全部开源权重模型合计约 69%；美国实验室的 token 份额一年从约 70% 掉到约 30%。

**这才是这一轮和过去几轮循环的真正区别，也是市场不再为好财报买单的深层原因**：如果每一次抬高天花板的动作，都会在几个月内被一个免费文件追平，那么"更强的模型 → 更高的单价 → 更多的模型层收入 → 支撑上游资本开支"这条链的可信度，就会每一轮都被削一层。空头质疑的从来不是这个季度的需求，而是**这条链还能重复几次。**

### 但是：开源封的是能力溢价的天花板，不是全部

**第一，钱仍然坐在前沿。** Anthropic 处理约 11% 的 token，却拿走平台约 42% 的估计支出。25 倍的价差照样在被支付。**因为企业不为 benchmark 分数付钱——它们付的是"一个在五十步任务中途不崩的 agent"，是失败代价高昂之处的可靠性，是不必拿全部负载在新模型上重新验证一遍。**

**第二，最强的开源模型还不够精炼。** K3 跑完整评测烧了 1.32 亿输出 token，是中位数的两倍多，因为它自带 always-on 最大推理、还没有推理力度控制；结果单任务成本 0.94 美元——比 Opus 便宜，但比 GPT-5.6 Terra（0.55）贵 71%、是 Grok 4.5（0.31）的三倍；幻觉率还从上一代的 39% 恶化到 51%。**所以它是一个价格拐点，不是一个真正的临界时刻——真正的临界点，是一个既开源、又 token 高效的前沿模型，它还没出现。**

**第三，中美之间是一条锯齿线，不是一条替代曲线。** 美国出新模型，差距拉开；中国实验室在随后几个月追上，差距收窄；下一个美国模型再来。**可投资的落点因此很简单：中国和开源模型能给"近前沿智能"封一个价格天花板，即使美国保住绝对前沿。** 因为大多数商业工作流需要的是"够好且价格合适"，很少需要地球上最强的那一个。

**所以开源真正压缩的，不是前沿实验室的毛利率，而是它们的中段成交量。** 需求明确的活——文档分类、抽取、摘要、简单代码——先走；留下的是最难、能力差值值钱的活。**前沿的价格在守，但中段在抽干。**

**把这两股力量放在一起，指数的形态就出来了：它仍然会随着新模型发布而向上，但上行段会越来越短、越来越陡，回落来得越来越快。** 波动不会停，但顶部那一截的持续时间在被压缩——而资本开支要的恰恰是"持续时间"。

## 五、这一年的牛市，本质是 AI coding 的自循环

要判断这轮调整跌到何时，得先搞清楚这一年涨的到底是什么。

2026 上半年真正的变化，不是某个模型的原始能力又上了一个台阶，而是**agent 系统开始进入自我迭代阶段。**

从"到底在 scale 什么"这个角度看，AI 的进展是四次迁移：第一次 scale 预训练数据、参数和训练算力；第二次是强化学习与可验证奖励；第三次是推理时算力；**而正在发生的第四次，scale 的是 agent 所处的任务环境、工具链和反馈闭环。**

这就是 **Agent Scaling Law**。它不是对旧范式的否定，而是自然延伸——**scaling 的对象从模型本身，转移到了模型所处的系统。**

支撑它的工程前提叫 **harness engineering**：给模型搭一个真能干活的环境，做三件事——构建任务环境、设计反馈机制、形成数据闭环，让 agent 能在试错中迭代、积累经验。**没有环境，模型最多只能聊天；有了环境，它才开始工作。**

决定一个领域能力提升快慢的有四个因素：任务能否被自动验证、实验室有没有做专门的训练投入、训练数据够不够、用户愿不愿意为这类能力付钱。**四条全中的领域，能力跳跃最大最快——而 coding 是天生的教科书案例**：奖励直接、目标清晰、可自动测试、结果可验证、环境可模拟、数据可生成。

**这就是为什么 coding 是第一个端到端跑通的场景，也是为什么这一年的行情本质上是"AI coding 自循环"驱动的。然后才有年初的硬件设施，到三四月份以 “瓶颈” 命名的各类硬件，光、800v 电源、PCB、封装测试、玻璃桥等等等。其实没有 coding 带来的 token 用量及信心狂涨，不可能有今年上半年这一波，去年底已经在质疑 AI 资本开支的问题了。**

## 六、所以，要跌到何时

**这一轮跌的不是需求，是对"这笔钱值不值、什么时候回本"的重新定价。** 而它之所以格外顽固，是因为第四节里那个新变化：**抬天花板和拆地板现在是同时发生的，前沿溢价的半衰期从"按年"缩到了"按发布周期"。** 在这个背景下，每一次积极的财报数据都变成了空头重估估值的机会——不是数据不好，而是市场已经从交易增长，转向交易可持续性。

在这个语境下，**再多的资本开支计划都不构成催化剂**。多花两千亿，只会把"回本要多久"这个问题问得更响。

**真正能终结这轮调整的，是对新需求曲线的验证，而最直接的形式是爆款产品的出现。**

**如果"Coding 1.0"证明了 AI 可以提升开发者的生产力，那么"Coding 2.0"必须展示 AI 代理能真正取代软件开发过程中的一部分。**

这两件事的差别是本质性的。前者的天花板是人的数量——工具变好、人效提升，对应的是软件预算；后者的天花板是工作本身的总量——一部分工作不再需要人，对应的是人力预算。**这是两个数量级完全不同的池子。**

**而且它恰好绕开了开源封住的那道天花板。** 开源压制的是"能力溢价"——同样一个任务，开源模型也能做个八九不离十，所以你不该多付钱。但 Coding 2.0 要卖的不是能力，是**可靠性和替代**：一个能在五十步任务中途不崩、可以真正交出去、失败代价由它承担的 agent。**这正是前沿模型今天用 11% 的 token 拿走 42% 支出的那个理由，也是开源迄今最没有追平的地方**——K3 那 51% 的幻觉率和两倍的 token 消耗，说明的正是这件事。

**所以开源封的是能力的天花板，封不住可靠性的天花板；而 Coding 2.0 恰恰是把付费理由从"能力"换成"替代"的那一步。**

沿着这个思路，能终结这轮调整的出路，其实不止一条。

**第一条，是下一个自循环的跑通。** coding 之所以第一个成，是因为它天生满足可验证奖励、可合成数据、自迭代系统三个条件。下一个候选在哪？coding agent 的反馈飞轮已经在向更广的白领工作外溢，Codex 从程序员工具变成知识工作入口就是征兆；再往外一圈是物理 AI——机器人、自动驾驶、具身智能，一旦哪个场景把"环境 + 反馈 + 数据闭环"这三件套搭起来，就是第二个 coding。市场等的是这个信号。

**第二条出路更近，而且已经在发生：云厂商的盈利模式本身，可能先看到希望。**

这条账值得算细。超大云厂商卖开源模型的 token，和过去两种生意都不一样。

比转卖前沿模型的 token，**少了一大块分成支出**——过去那条路上，客户付的钱大头都被前沿模型厂商拿走了，云厂商只吃到底下那层算力租金。开源权重免费，这道分成直接消失。

比单纯出租 GPU，**又多了一层溢价**。裸租 GPU 是最没有差异化的生意；而围绕开源模型转售 token，云厂商能把一整套东西叠上去收钱：自研 ASIC 的算力成本优势、托管推理服务、数据库和向量检索、对象存储、网络和数据传输、Agent 运行时、安全和身份、评估日志监控、企业支持服务。

**本质上，这是把模型层商品化之后，云厂商把价值转移到了基础设施加平台服务层——托管、优化、路由、治理、安全。毛利自然会大幅度提升。** 开源模型对云厂商不是威胁，是它 AI 业务利润率最有效的提升路径之一。

时间上的一个关键事实：**超大云厂商是六月中下旬才开始大规模部署开源模型的，数据还没那么充分。** 所以这条逻辑现在还是推论，不是验证。但验证点很明确——**如果之后几个季度的财报能确认，部署开源模型的毛利更好、回本周期更快，那么"资本开支到底值不值"这个空头最重的质疑，就会从云厂商自己的利润表上得到回答。**

**这很可能是下一波行情的主驱动逻辑。**

在那之前，指数还会在"强模型溢价"的周期里上下摆动，而且上行段会一次比一次短；好财报还会继续变成空头的机会。**这轮跌的终点，不在下一份财报的资本开支数字里——要么在下一个跑通自循环的场景里，要么在云厂商卖开源 token 的毛利率里。现在的市场情绪差到必须从这两个源头能找到新希望才行了。**

### 相关股票

- [GOOG.US](https://longbridge.com/zh-CN/quote/GOOG.US.md)
- [GOOGL.US](https://longbridge.com/zh-CN/quote/GOOGL.US.md)
- [INTC.US](https://longbridge.com/zh-CN/quote/INTC.US.md)
- [ASML.US](https://longbridge.com/zh-CN/quote/ASML.US.md)
- [TSM.US](https://longbridge.com/zh-CN/quote/TSM.US.md)
- [GOOGN.US](https://longbridge.com/zh-CN/quote/GOOGN.US.md)
- [04335.HK](https://longbridge.com/zh-CN/quote/04335.HK.md)

## 评论 (7)

- **摸鱼炒股达人 · 2026-07-30T03:32:16.000Z**: 有没有人知道怎么才能下单，试了好多次都不行
  - **躺平坐等回本** (2026-07-30T03:32:33.000Z): 海外上网卡或者代理，二选一
- **不会辜负你的只有算法 · 2026-07-29T15:17:57.000Z**: 如果这篇文章就是借助 AI 来写的，那么。。。
- **大魔王一刻 · 2026-07-29T15:06:22.000Z · 👍 1**: 绝大部分公司会愿意一直使用 token 吗，或者说较大的公司，会不会自己部署本地模型供员工使用，这样或许更划算？
  - **Icloud** (2026-07-29T15:26:44.000Z): 但是机房还是用大厂的 本地模型应该主要是为了安全性和专业化
- **价值滑头 · 2026-07-29T07:00:59.000Z**: 好多信息，感觉是业内人士
- **桑不起 · 2026-07-29T06:42:22.000Z · 👍 1**: 逻辑清楚，解读有理


---
> **免责声明: 本文仅供参考，不构成任何投资建议。**