我是 LongbridgeAI,我可以總結文章信息。8 月 13 日,阿里開源 Qwen3.8-2.4T 模型權重,這是 Qwen 系列首個開放權重的 Max 規模模型。該模型擁有 92 層、2.4 萬億參數,採用混合架構,包含 69 層線性注意力和 23 層傳統注意力,與 Kimi K3 架構趨同。此次開源僅公佈架構、後訓練及推理 Infra 信息,未提供對應 API 或應用。
Kimi K3 開源半個月後,8 月 13 日,阿里 Qwen 也正式開放了 Qwen3.8-2.4T 的模型權重。

除去是 2.4T 的大參數模型,這次開源對於阿里而言還有另外的意義。
雖然之前 Qwen 曾經多次開源旗艦模型,但 Qwen 很早就形成了兩條線。一邊是開放權重模型,一邊是更大的閉源 Max 模型。2024 年 Qwen 自己介紹第一代產品時就明確區分了 “大型開源模型 Qwen-72B” 和 “大型閉源模型”;後來 Qwen-Max-0428 也是隻通過 Qwen Chat 和 DashScope API 提供,並沒有釋放權重。Qwen2.5-Max 到 2025 年依然如此,只開放 API,而同時拿 Qwen2.5-72B 作為自己的開放權重對照。
而這,是 Qwen 第一個開放權重的 Max 規模模型。
Qwen3.8 本次的開源暫時沒有對應的模型,只有簡單的架構、後訓練、推理 Infra,以及開源規則。但從中我們已經可以獲得不少信息了。
架構
Qwen3.8 共有 92 層(K3 96 層),總參數 2.4T,每個 Token 激活 95B。它使用 512 個專家(K3 896 個),每次選擇 10 個路由專家,同時還有 1 個共享專家。相比 Kimi K3,每個專家更大,但總激活量稍小(Kimi K3 為 16 專家,103B)。

注意力機制上,Qwen3.8 繼承了 Qwen3.5 的混合架構。92 層實際上由 23 組相同結構組成,每組包含 3 層 Gated DeltaNet(門控 Delta 網絡)和 1 層 Gated Attention(門控全注意力),也就是 69 層線性注意力加 23 層傳統注意力,比例正好接近 3:1。
這和 Kimi K3 非常像。K3 的 93 層裏有 69 層 Kimi Delta Attention(KDA,Kimi Delta 注意力)和 24 層 Gated MLA(門控多頭潛在注意力),也是大約 3:1。兩者甚至屬於相近的技術譜系,KDA 可以看作對 Gated DeltaNet 遺忘機制進一步細粒度化的版本。
不過 K3 在層間信息流上還多做了一步。它引入 AttnRes(Attention Residuals,注意力殘差),允許模型重新組合多個歷史層的輸出。從 config.json 中看,Qwen3.8 沿用了 Qwen3.5 的實現。目前 Qwen 3.5 公開代碼裏仍然是比較傳統的 Pre-Norm 殘差結構,每個子層完成以後,只和進入該子層之前的 residual 直接相加。

Qwen3.8 原生上下文為 262,144 Token,並可以擴展到 1,010,000 Token,同時進行了多步 MTP(Multi-Token Prediction,多 Token 預測)訓練。
Infra
這裏首先要區分兩種 Infra。Training Infra(訓練基礎設施)回答的是 “這個模型怎麼訓出來”,例如優化器、並行訓練、通信、顯存管理、Checkpoint 和容錯。Inference Infra(推理基礎設施)回答的是 “權重已經訓完以後,怎麼把它真正部署起來,並讓每個 Token 足夠快、足夠便宜地吐出來”。
Qwen 目前並沒有像 Kimi K3 技術報告那樣系統披露訓練 Infra,因此不能從這次發佈判斷它具體如何完成 2.4T 規模的訓練。但推理側的信息相對豐富。
首先是量化。Qwen 官方提供 BF16 和 FP8 checkpoint,Inferact 進一步提供 NVFP4 和 MXFP4 量化版本。BF16/FP8 完整版本至少需要兩台 NVIDIA B300 或 AMD MI355X 節點,而 FP4 之後可以壓縮到單節點部署。
第二則是並行。Qwen3.8 在推理階段採用 TP(張量並行)、DP(數據並行)和 EP(專家並行)的組合。Attention 部分更依賴 TP,把矩陣計算拆開,MoE 部分則依靠 EP,把不同專家分佈到不同 GPU。與此同時,推理框架還需要通過融合通信、專用 MoE Kernel(算子)以及高速互聯網絡,儘量降低專家調度帶來的通信開銷。
Kimi K3 面臨的是同一個問題。在訓練 2.8T 參數、896 專家的 Stable LatentMoE 時,Moonshot 並沒有簡單擴大傳統 EP,而是提出 MoonEP,讓熱門專家根據當前負載動態複製到更多 GPU 上。
最後還有 MTP。Qwen3.8 訓練了 Multi-Token Prediction 能力,示例配置一次預測 3 個候選 Token。如果候選被主模型接受,相當於一次前向傳播推進多個 Token,從而減少自迴歸逐 Token 生成帶來的串行延遲。值得注意的是,DeepSeek V4 在技術報告中也明確用了 MTP。
後訓練
相比架構,Qwen 這次對後訓練具體技術披露得更少,因為 config 文檔裏也沒這些。
但它的後訓練目標非常清楚。
Qwen 在模型卡里直接把 Agent Execution 列為核心升級方向,強調更強的 autonomous planning(自主規劃)、對 environment feedback(環境反饋)的處理能力,以及更可靠的 end-to-end task completion(端到端任務完成)。
但基本上現在所有的後訓練都會強調這些點。
官方公佈的成績也能看到這種傾斜。在 Qwen 自己的對照中,從 Qwen3.7-Max 到 3.8-Max,Terminal Bench 2.1 從 74.5 升至 86.6,PaperBench 從 64.8 升至 93.0,JobBench 從 31.3 升至 53.4,Toolathlon Verified 從 49.7 升至 72.5。

相比之下,GPQA Diamond 只是從 92.4 變為 92.6,HLE 從 41.4 升到 43.6。至少從官方評測呈現方式看,這一代最大的增量明顯更多發生在 Coding Agent、General Agent 和專業工作,而不是傳統單輪知識與推理 Benchmark。
另外,Qwen3.8 默認開啓 preserve_thinking,把之前輪次中的推理上下文繼續保留下來。這樣 Agent 在一次工具調用之後,不必只拿着最終答案和工具結果重新開始,而可以繼續利用此前已經形成的推理狀態。
Kimi K3 也採取了幾乎相同的方向。官方明確表示其後訓練保留了推理歷史。多輪交互和工具調用時,需要把此前的 reasoning content 和 tool calls 完整送回模型。
兩家同時走到這裏,説明 “保留推理狀態” 正在從 Harness 的職責,逐漸轉入旗艦 Agent 模型本身的訓練與接口範式。
開源規則
這次開源的 Qwen3.8-2.4T-A95B 並不完全等同於雲端 Qwen3.8-Max。開放版本目前是 text-only(純文本),只能運行 thinking mode,原生上下文為 262K。而官方 Qwen3.8-Max 則建立在這一模型之上,額外提供視覺輸入、non-thinking 模式、默認 1M 上下文以及官方內置工具。

拆開增強版放雲,這已經是一個目前開源模型的常見模式了,這樣開源也可以保有部分商業能力。比如 Minimax H3 的開源,就把影響成片質量的素材理解、2K 重生成和稀疏注意力實現留在雲端。
許可證同樣發生了變化。Qwen3 時代大量模型使用 Apache 2.0,而 Qwen3.8 改成了專門的 Qwen3.8-Max License。許可證仍允許使用、複製、修改、分發、微調、部署、託管甚至出售衍生產品,但如果商業產品超過 1 億月活或月收入超過 2000 萬美元,需要在界面顯著展示模型名稱。如果企業從事 Model-as-a-Service 或 AI Work Assistant 業務,並且連續 12 個月集團收入超過 5000 萬美元,則商業使用前需要另外取得 Qwen 許可。
這和 Kimi K3 也非常類似。K3 同樣採用自己的 Kimi K3 License,而不是 Apache 2.0;同樣允許廣泛使用和修改,也設置了超大規模商業產品的署名要求以及 MaaS 業務的額外授權門檻。區別主要在具體閾值和覆蓋業務範圍。
換句話説,到了 3T 級旗艦模型,兩家公司選擇的都是 open-weight(開放權重)+ 自定義商業許可,而不是過去小模型時代更加寬鬆的 Apache 式開放。
如果把 Qwen3.8 和 Kimi K3 放在一起看,反而可以看到 2026 年旗艦模型開始出現一種相當明顯的收斂。
總參數都進入 2—3T,激活參數都控制在 100B 左右。Attention 不再全部採用傳統 Transformer,而是用大約四分之三的遞歸/線性狀態層配合四分之一的全局 Attention,上下文目標開始穩定在百萬 Token。後訓練重點轉向 Coding、Research 和長程 Agent。最終能不能部署,則越來越依賴 FP4/FP8、融合 kernel、Expert Parallelism 和機架級高速互聯。
Kimi K3 在模型架構上走得更激進一些,它同時引入 KDA、AttnRes 和 Stable LatentMoE;Qwen3.8 則更像一次把已經在 Qwen3.5 驗證過的混合注意力架構直接 Scale 到 Max 級別,並圍繞長程 Agent 和生產推理把整個生態補齊。
但無論如何,他們的架構選擇都只是小優化差異,而非大區別了。infra 方面反而可能不同更大,但各種並行之間的調劑依然是最重要的問題。
配方的底子已經開始收斂,下一個誰能打破這個底子做點新意,就更值得期待了。
風險提示及免責條款
市場有風險,投資需謹慎。本文不構成個人投資建議,也未考慮到個別用户特殊的投資目標、財務狀況或需要。用户應考慮本文中的任何意見、觀點或結論是否符合其特定狀況。據此投資,責任自負。
