---
title: "Kimi K3 的兩副面孔：技術研報吹上天，專業機構實測卻只排第二"
type: "Topics"
locale: "zh-HK"
url: "https://longbridge.com/zh-HK/topics/42848649.md"
description: "先説個背景：Kimi 母公司月之暗面（Moonshot AI）已經向核心投資人遞交了赴港上市的議案，最快半年內可能掛牌，目前正在拆除原有 VIE 架構、改為更適合港股上市的 H 股結構，這半年估值也從約 180 億美元漲到了 300 多億美元。放在這個背景下看，7 月 16 日發佈的新模型 Kimi K3，某種程度上也是這輪 IPO 敍事的一次關鍵考試——模型到底行不行，直接關係到市場願不願意為這個估值買單..."
datetime: "2026-07-22T07:54:58.000Z"
locales:
  - [en](https://longbridge.com/en/topics/42848649.md)
  - [zh-CN](https://longbridge.com/zh-CN/topics/42848649.md)
  - [zh-HK](https://longbridge.com/zh-HK/topics/42848649.md)
author: "[William聊股](https://longbridge.com/zh-HK/profiles/2064581653212868608.md)"
---

# Kimi K3 的兩副面孔：技術研報吹上天，專業機構實測卻只排第二

先説個背景：Kimi 母公司月之暗面（Moonshot AI）已經向核心投資人遞交了赴港上市的議案，最快半年內可能掛牌，目前正在拆除原有 VIE 架構、改為更適合港股上市的 H 股結構，這半年估值也從約 180 億美元漲到了 300 多億美元。放在這個背景下看，7 月 16 日發佈的新模型 Kimi K3，某種程度上也是這輪 IPO 敍事的一次關鍵考試——模型到底行不行，直接關係到市場願不願意為這個估值買單。這兩週陸續出了幾份專業研報，一份把 K3 捧得很高，另一份卻給出了更冷靜的結論，兩份放在一起看，比單看任何一份都更有意思。

**一、這次升級到底改了什麼**

K3 的參數規模達到 2.8 萬億，是全球首個突破 3 萬億參數級別的開放模型，同時支持 100 萬 Token 上下文和原生視覺理解。架構上用了三個新東西：Kimi Delta Attention（提升長序列下的注意力計算效率）、Attention Residuals（讓模型在不同網絡深度之間有選擇性地檢索歷史信息，而不是簡單堆疊）、以及 Stable LatentMoE（把專家數量擴展到 896 個，每次推理只激活 16 個，激活比例約 1.8%）。三者疊加，官方測算相較上一代 K2 實現了約 2.5 倍的整體縮放效率提升——通俗地説，就是同樣的參數規模增長，能用更少的算力浪費換來更多的實際能力提升。

值得單獨拎出來説的是一個部署細節：官方明確建議用 64 張以上加速卡組成的 “超節點” 來部署 K3。這意味着模型雖然每次只激活一小部分專家，但對卡間高速互聯、顯存管理和任務調度的要求反而更高了——參數規模越大、稀疏度越高，不是省了算力，而是把算力需求從 “單卡堆得多高” 轉移到了 “卡與卡之間配合得多好”，這也是為什麼這輪升級會讓本就緊張的算力供給更加吃緊。

**二、拿了 “全球第一”，但要問清楚是哪個第一**

K3 發佈後被廣泛引用的一個説法是 “拿下全球第一”，但這裏面其實是兩件不同的事，容易被混着講。在專門評測前端代碼能力的 Frontend Code Arena 榜單上，K3 拿到 1679 分排名全球第一；而在覆蓋範圍更廣的 Artificial Analysis 綜合智能指數上，K3 的排名是全球第三，落後於 Claude Fable 5 和 GPT-5.6 Sol，但在所有開源模型裏排第一。換句話説，“前端代碼這個細分領域全球最強” 和 “綜合智能全球最強” 是兩個不同量級的説法，不宜劃等號。

K3 在幾項工程類基準上的具體成績：Program Bench 得分 77.8，略高於 GPT-5.6 Sol 的 77.6；Terminal Bench 2.1 得分 88.3，接近 GPT-5.6 Sol 的 88.8；FrontierSWE 得分 81.2，比 GPT-5.6 Sol 和 Claude Opus 4.8 分別高 9.9 分和 14.5 分；SWE Marathon 得分 42.0，同樣超過 GPT-5.6 Sol 和 Claude Fable 5。這些數字本身沒問題，但需要提醒一句：它們大多來自 Kimi 官方發佈的評測結果，屬於廠商自己披露的成績單，跟接下來要説的第三方獨立評測不是一回事——兩種數據都有參考價值，但不能替代彼此。

**三、一份更 “接地氣” 的實測研報**

如果説榜單成績講的是模型在標準化測試題裏的表現，某機構的一份測評報告做了一件更貼近實際工作的事：讓 GPT 5.6 Sol、Kimi K3 和 GLM-5.2 三個模型分別完成估值建模、多因子回測、行業研究這三類真實投研任務，看它們能不能真正把長文本、強推理這些能力轉化成一份邏輯自洽、數據可靠、經得起復核的工作成果。這類測試更難 “刷分”，也更接近普通人實際會怎麼用這些模型——寫報告、搭表格、做研究，而不是解一道有標準答案的編程題。

**模型**

**綜合排名**

**突出優勢**

**主要短板**

GPT 5.6 Sol

第一

底稿可復算、可檢查性最強；回測明確區分信號日與執行日，交易時點處理最嚴謹；行業研究來源管理最規範

行業研究裏覆蓋的公司實體頁相對較少

Kimi K3

第二

投資報告邏輯基本自洽；回測保留完整 Python 代碼和每期選股明細；行業研究六維評分體系完整、可復算

Excel 底稿缺少有效聯動、部分公式錯誤；回測未區分信號日與執行日；Wiki 知識庫沉澱不足

GLM-5.2

第三

行業研究覆蓋公司數量最多，報告展示效果較好

底稿公式異常；目標價低於當前股價卻仍給 “增持” 評級，邏輯衝突；Wiki 斷鏈

具體來看，Kimi K3 在估值任務裏用 “銷量×單價” 的方式預測收入，投資報告的目標價、評級和邏輯基本自洽，但 Excel 底稿缺少有效聯動，部分公式錯誤影響了淨利潤、EPS、DCF 目標價等核心數據的計算，按報告的説法 “底稿未達到直接使用標準”；回測任務裏，K3 保留了完整的 Python 代碼、每期選股、組合收益和淨值明細，可檢查性不錯，但沒有明確區分 “信號形成日” 和 “交易執行日”，也沒有處理交易成本和漲跌停、停牌這些不可交易狀態，測試過程中還一度出現數據庫連接中斷；行業研究任務裏，K3 搭建的六維評分體系比較完整、綜合得分可以復算，但 Wiki 知識庫只建了 2 個公司實體頁和 2 個主題頁，來源資料基本沒有沉澱下來。三項任務綜合排名，K3 排在 GPT 5.6 Sol 之後、GLM-5.2 之前，位列第二。

公允地説，這份研報也明確提到，Kimi K3 的測試是在模型發佈當天進行的，屬於單次測試結果，樣本量和提示詞設計都可能影響結論，後續還需要多輪測試驗證。這一點也呼應了下一節要説的現象。

**四、一個有意思的巧合，間接印證了 “缺算力” 這件事**

由於測試恰好安排在 K3 發佈當天，測試過程中 K3 出現了推理速度較慢、請求無法正常響應的情況，系統甚至提示 “和 Kimi 聊天的人太多，請等等再來”。報告方也謹慎地説明，這可能與發佈首日訪問量大、服務資源緊張有關，不代表模型在常態運行下的真實效率。但把這個細節和月之暗面自己發佈的 “暫停 C 端新用户訂閲” 公告放在一起看，兩邊的描述是互相印證的——不是官方在用 “算力緊張” 當託詞，專業機構在做獨立測試時也確確實實撞上了同樣的問題。這算是這輪 “爆紅缺算力” 故事裏，一個比較少見的第三方交叉驗證。

**五、定價也在傳遞一個信號**

K3 的 API 定價比上一代明顯提高：緩存命中輸入價格為每百萬 Token 0.30 美元，未命中輸入 3.00 美元，輸出 15.00 美元，比 Kimi K2 系列高出不少，也高於 GLM-5.2 和 MiniMax 等大多數國產模型。

**模型**

**緩存命中輸入**

**未命中輸入**

**輸出**

Kimi K3

$0.30/百萬 Token

$3.00/百萬 Token

$15.00/百萬 Token

GLM-5.2

約¥0.26/百萬 Token

約¥1.4/百萬 Token

約¥4.4/百萬 Token

GPT 5.6 Sol（1.05M 以內）

$0.5/百萬 Token

$5/百萬 Token

$30/百萬 Token

這反映產品定位已經從 “低價獲客” 轉向 “長上下文、複雜推理和 Agent 任務驅動的旗艦能力定價”——通俗理解就是，當模型能幹的活更復雜、更值錢，廠商就不再需要靠低價換用户量，國產模型的商業化競爭正在從單純拼低價，轉向拼模型能力、緩存效率和算力利用率的綜合較量。不過這個邏輯要成立，前提是 K3 的真實能力能撐得住這個價格——這也是為什麼上一節那份更保守的實測結論，值得放在一起參考。

**六、接下來看什麼**

**完整模型權重：**計劃 7 月 27 日前發佈，屆時會有更完整的架構、訓練和評測技術報告，也會有更多第三方開發者和企業的真實反饋，能進一步驗證這次升級的含金量。

**底稿質量能否改善：**國金證券提到的 Excel 聯動、公式錯誤、回測信號日/執行日區分等問題，是相對具體、可驗證的短板，如果後續版本或同類任務的重複測試中這些問題有改善，説明的是工程化落地能力在提升，而不只是參數規模在變大。

**算力擴容進度：**C 端新用户訂閲什麼時候恢復、恢復的節奏如何，會直接反映這次 “缺卡” 是短期的發佈日波動，還是更持續的結構性問題。

**港股上市進展：**VIE 拆除、H 股架構調整的具體節奏，以及後續是否有新一輪融資落地，是判斷這輪估值故事能不能兑現的關鍵窗口。

個人市場觀察，基於公開信息及公開研報整理核實，不構成投資建議。月之暗面目前為非上市公司，文中港股上市進展、估值等信息均來自公開報道，可能隨時變化；文中引用的兩份研報數據分別來自華泰證券、國金證券公開發布內容，市場有風險，決策需獨立判斷。

### 相關股票

- [SOL.US](https://longbridge.com/zh-HK/quote/SOL.US.md)
- [OpenAI.NA](https://longbridge.com/zh-HK/quote/OpenAI.NA.md)