---
title: "Kimi K3 的两副面孔：技术研报吹上天，专业机构实测却只排第二"
type: "Topics"
locale: "zh-CN"
url: "https://longbridge.com/zh-CN/topics/42848649.md"
description: "先说个背景：Kimi 母公司月之暗面（Moonshot AI）已经向核心投资人递交了赴港上市的议案，最快半年内可能挂牌，目前正在拆除原有 VIE 架构、改为更适合港股上市的 H 股结构，这半年估值也从约 180 亿美元涨到了 300 多亿美元。放在这个背景下看，7 月 16 日发布的新模型 Kimi K3，某种程度上也是这轮 IPO 叙事的一次关键考试——模型到底行不行，直接关系到市场愿不愿意为这个估值买单..."
datetime: "2026-07-22T07:54:58.000Z"
locales:
  - [en](https://longbridge.com/en/topics/42848649.md)
  - [zh-CN](https://longbridge.com/zh-CN/topics/42848649.md)
  - [zh-HK](https://longbridge.com/zh-HK/topics/42848649.md)
author: "[William聊股](https://longbridge.com/zh-CN/profiles/2064581653212868608.md)"
---

# Kimi K3 的两副面孔：技术研报吹上天，专业机构实测却只排第二

先说个背景：Kimi 母公司月之暗面（Moonshot AI）已经向核心投资人递交了赴港上市的议案，最快半年内可能挂牌，目前正在拆除原有 VIE 架构、改为更适合港股上市的 H 股结构，这半年估值也从约 180 亿美元涨到了 300 多亿美元。放在这个背景下看，7 月 16 日发布的新模型 Kimi K3，某种程度上也是这轮 IPO 叙事的一次关键考试——模型到底行不行，直接关系到市场愿不愿意为这个估值买单。这两周陆续出了几份专业研报，一份把 K3 捧得很高，另一份却给出了更冷静的结论，两份放在一起看，比单看任何一份都更有意思。

**一、这次升级到底改了什么**

K3 的参数规模达到 2.8 万亿，是全球首个突破 3 万亿参数级别的开放模型，同时支持 100 万 Token 上下文和原生视觉理解。架构上用了三个新东西：Kimi Delta Attention（提升长序列下的注意力计算效率）、Attention Residuals（让模型在不同网络深度之间有选择性地检索历史信息，而不是简单堆叠）、以及 Stable LatentMoE（把专家数量扩展到 896 个，每次推理只激活 16 个，激活比例约 1.8%）。三者叠加，官方测算相较上一代 K2 实现了约 2.5 倍的整体缩放效率提升——通俗地说，就是同样的参数规模增长，能用更少的算力浪费换来更多的实际能力提升。

值得单独拎出来说的是一个部署细节：官方明确建议用 64 张以上加速卡组成的 “超节点” 来部署 K3。这意味着模型虽然每次只激活一小部分专家，但对卡间高速互联、显存管理和任务调度的要求反而更高了——参数规模越大、稀疏度越高，不是省了算力，而是把算力需求从 “单卡堆得多高” 转移到了 “卡与卡之间配合得多好”，这也是为什么这轮升级会让本就紧张的算力供给更加吃紧。

**二、拿了 “全球第一”，但要问清楚是哪个第一**

K3 发布后被广泛引用的一个说法是 “拿下全球第一”，但这里面其实是两件不同的事，容易被混着讲。在专门评测前端代码能力的 Frontend Code Arena 榜单上，K3 拿到 1679 分排名全球第一；而在覆盖范围更广的 Artificial Analysis 综合智能指数上，K3 的排名是全球第三，落后于 Claude Fable 5 和 GPT-5.6 Sol，但在所有开源模型里排第一。换句话说，“前端代码这个细分领域全球最强” 和 “综合智能全球最强” 是两个不同量级的说法，不宜划等号。

K3 在几项工程类基准上的具体成绩：Program Bench 得分 77.8，略高于 GPT-5.6 Sol 的 77.6；Terminal Bench 2.1 得分 88.3，接近 GPT-5.6 Sol 的 88.8；FrontierSWE 得分 81.2，比 GPT-5.6 Sol 和 Claude Opus 4.8 分别高 9.9 分和 14.5 分；SWE Marathon 得分 42.0，同样超过 GPT-5.6 Sol 和 Claude Fable 5。这些数字本身没问题，但需要提醒一句：它们大多来自 Kimi 官方发布的评测结果，属于厂商自己披露的成绩单，跟接下来要说的第三方独立评测不是一回事——两种数据都有参考价值，但不能替代彼此。

**三、一份更 “接地气” 的实测研报**

如果说榜单成绩讲的是模型在标准化测试题里的表现，某机构的一份测评报告做了一件更贴近实际工作的事：让 GPT 5.6 Sol、Kimi K3 和 GLM-5.2 三个模型分别完成估值建模、多因子回测、行业研究这三类真实投研任务，看它们能不能真正把长文本、强推理这些能力转化成一份逻辑自洽、数据可靠、经得起复核的工作成果。这类测试更难 “刷分”，也更接近普通人实际会怎么用这些模型——写报告、搭表格、做研究，而不是解一道有标准答案的编程题。

**模型**

**综合排名**

**突出优势**

**主要短板**

GPT 5.6 Sol

第一

底稿可复算、可检查性最强；回测明确区分信号日与执行日，交易时点处理最严谨；行业研究来源管理最规范

行业研究里覆盖的公司实体页相对较少

Kimi K3

第二

投资报告逻辑基本自洽；回测保留完整 Python 代码和每期选股明细；行业研究六维评分体系完整、可复算

Excel 底稿缺少有效联动、部分公式错误；回测未区分信号日与执行日；Wiki 知识库沉淀不足

GLM-5.2

第三

行业研究覆盖公司数量最多，报告展示效果较好

底稿公式异常；目标价低于当前股价却仍给 “增持” 评级，逻辑冲突；Wiki 断链

具体来看，Kimi K3 在估值任务里用 “销量×单价” 的方式预测收入，投资报告的目标价、评级和逻辑基本自洽，但 Excel 底稿缺少有效联动，部分公式错误影响了净利润、EPS、DCF 目标价等核心数据的计算，按报告的说法 “底稿未达到直接使用标准”；回测任务里，K3 保留了完整的 Python 代码、每期选股、组合收益和净值明细，可检查性不错，但没有明确区分 “信号形成日” 和 “交易执行日”，也没有处理交易成本和涨跌停、停牌这些不可交易状态，测试过程中还一度出现数据库连接中断；行业研究任务里，K3 搭建的六维评分体系比较完整、综合得分可以复算，但 Wiki 知识库只建了 2 个公司实体页和 2 个主题页，来源资料基本没有沉淀下来。三项任务综合排名，K3 排在 GPT 5.6 Sol 之后、GLM-5.2 之前，位列第二。

公允地说，这份研报也明确提到，Kimi K3 的测试是在模型发布当天进行的，属于单次测试结果，样本量和提示词设计都可能影响结论，后续还需要多轮测试验证。这一点也呼应了下一节要说的现象。

**四、一个有意思的巧合，间接印证了 “缺算力” 这件事**

由于测试恰好安排在 K3 发布当天，测试过程中 K3 出现了推理速度较慢、请求无法正常响应的情况，系统甚至提示 “和 Kimi 聊天的人太多，请等等再来”。报告方也谨慎地说明，这可能与发布首日访问量大、服务资源紧张有关，不代表模型在常态运行下的真实效率。但把这个细节和月之暗面自己发布的 “暂停 C 端新用户订阅” 公告放在一起看，两边的描述是互相印证的——不是官方在用 “算力紧张” 当托词，专业机构在做独立测试时也确确实实撞上了同样的问题。这算是这轮 “爆红缺算力” 故事里，一个比较少见的第三方交叉验证。

**五、定价也在传递一个信号**

K3 的 API 定价比上一代明显提高：缓存命中输入价格为每百万 Token 0.30 美元，未命中输入 3.00 美元，输出 15.00 美元，比 Kimi K2 系列高出不少，也高于 GLM-5.2 和 MiniMax 等大多数国产模型。

**模型**

**缓存命中输入**

**未命中输入**

**输出**

Kimi K3

$0.30/百万 Token

$3.00/百万 Token

$15.00/百万 Token

GLM-5.2

约¥0.26/百万 Token

约¥1.4/百万 Token

约¥4.4/百万 Token

GPT 5.6 Sol（1.05M 以内）

$0.5/百万 Token

$5/百万 Token

$30/百万 Token

这反映产品定位已经从 “低价获客” 转向 “长上下文、复杂推理和 Agent 任务驱动的旗舰能力定价”——通俗理解就是，当模型能干的活更复杂、更值钱，厂商就不再需要靠低价换用户量，国产模型的商业化竞争正在从单纯拼低价，转向拼模型能力、缓存效率和算力利用率的综合较量。不过这个逻辑要成立，前提是 K3 的真实能力能撑得住这个价格——这也是为什么上一节那份更保守的实测结论，值得放在一起参考。

**六、接下来看什么**

**完整模型权重：**计划 7 月 27 日前发布，届时会有更完整的架构、训练和评测技术报告，也会有更多第三方开发者和企业的真实反馈，能进一步验证这次升级的含金量。

**底稿质量能否改善：**国金证券提到的 Excel 联动、公式错误、回测信号日/执行日区分等问题，是相对具体、可验证的短板，如果后续版本或同类任务的重复测试中这些问题有改善，说明的是工程化落地能力在提升，而不只是参数规模在变大。

**算力扩容进度：**C 端新用户订阅什么时候恢复、恢复的节奏如何，会直接反映这次 “缺卡” 是短期的发布日波动，还是更持续的结构性问题。

**港股上市进展：**VIE 拆除、H 股架构调整的具体节奏，以及后续是否有新一轮融资落地，是判断这轮估值故事能不能兑现的关键窗口。

个人市场观察，基于公开信息及公开研报整理核实，不构成投资建议。月之暗面目前为非上市公司，文中港股上市进展、估值等信息均来自公开报道，可能随时变化；文中引用的两份研报数据分别来自华泰证券、国金证券公开发布内容，市场有风险，决策需独立判断。

### 相关股票

- [SOL.US](https://longbridge.com/zh-CN/quote/SOL.US.md)
- [OpenAI.NA](https://longbridge.com/zh-CN/quote/OpenAI.NA.md)