深度求索的更新版 V4 Pro 在一般基準測試中表現不佳,但在網絡安全方面領先於所有測試的模型
我是 LongbridgeAI,我可以總結文章信息。深度求索發佈了其更新的 V4-Pro 模型,該模型在與 OpenAI 和 Kimi 等競爭對手的總體基準測試中表現不佳,但在網絡安全漏洞檢測方面領先於所有測試模型。儘管因定價較高(每百萬個輸入令牌 44 美分)和精確度問題受到批評,但該模型強大的安全能力突顯了中國人工智能在防禦研究方面的獨特優勢
中國人工智能初創公司 DeepSeek 悄然發佈了其旗艦模型的更新版本——DeepSeek-V4-Pro-0813,開發者社區對此反應不一。基準測試結果顯示,該模型在一般能力指標上難以與頂級競爭對手匹敵,令其在性能和定價方面受到失望。但在一個特定領域,即網絡安全漏洞檢測中,它的表現超越了所有其他測試模型——這一發現對關於中國人工智能在安全研究中角色的持續辯論具有重要意義。
關鍵點
- DeepSeek-V4-Pro-0813 在人工分析智能指數上得分 53,與智譜 AI 的 GLM-5.2 持平,但比 OpenAI 的 GPT-5.6 Terra 低四分,比 Kimi K3 低七分
- 在 Vals 指數上,該模型排名第 12,落後於 OpenAI 的上一代 GPT-5.5,並且落後於 Kimi K3 和 Anthropic 的 Claude Opus 5
- 比利時網絡安全公司 Aikido Security 發現 DeepSeek-V4-Pro-0813 在發現系統漏洞方面超越了所有其他測試模型——儘管其精度較差
- 該模型檢測到的漏洞數量顯著多於 Anthropic 的 Opus 5 和阿里巴巴的 Qwen 3.8
- 定價受到批評——每百萬輸入令牌約 44 美分,相較於市場中位數 33 美分,被描述為 “有些昂貴”
- DeepSeek 預計將推出一款工具產品——類似於 Claude Code 的軟件框架,使該模型能夠作為自主 AI 代理運行
低調發布,反響不一
此次更新沒有引起太大關注。DeepSeek 在其官方網站上發佈了一份簡短聲明,指出該模型提供了顯著增強的代理能力——但在週四下午就刪除了該聲明。此次發佈沒有伴隨技術博客文章,這與通常伴隨重大 AI 模型發佈的詳細文檔有所不同。
早期基準測試結果並不熱情。在人工分析智能指數上,DeepSeek-V4-Pro-0813 得分 53,與智譜 AI 的 GLM-5.2 持平,該模型於 6 月發佈,但比 OpenAI 的 GPT-5.6 系列中的中端 Terra 模型低四分,比 Moonshot AI 的 Kimi K3 低七分。在由位於舊金山的 Vals AI 編制的多個基準測試中,該模型在 Vals 指數上排名第 12,落後於 OpenAI 的上一代 GPT-5.5,並且遠遠落後於包括 Kimi K3 和 Anthropic 的 Claude Opus 5 在內的前沿系統。
在 Vals AI 的評估中,有兩個具體的弱點突出:在沙箱終端環境中完成任務和在 Excel 電子表格中生成複雜的財務模型。在社交媒體上,開發者們對該模型表示失望,多位用户指出了包括模型在長時間編碼任務中提前停止等問題。DeepSeek 沒有回應評論請求。
網絡安全的例外
一般基準測試的故事並不是唯一的故事。在網絡安全漏洞檢測方面,DeepSeek-V4-Pro-0813 的結果引起了安全研究人員的關注。
根據比利時網絡安全公司 Aikido Security 的説法,該模型在發現系統漏洞方面超越了所有其他測試系統。Aikido 研究員 Philippe Dourassov 指出,儘管該模型的精度較差——標記的假陽性比例高於競爭系統——但其檢測到的漏洞總數顯著多於 Anthropic 的 Opus 5 和阿里巴巴的 Qwen 3.8。
在漏洞掃描中,精度與召回率之間的權衡是一個已知的考慮因素。一個標記更多漏洞的模型——包括一些假陽性——在第一次安全審計中可能比一個精度更高但檢測率較低的模型更有價值,因為漏掉一個關鍵漏洞的成本通常遠高於調查一個假陽性的成本。Aikido 的發現表明,DeepSeek-V4-Pro-0813 在設計或訓練性質上更傾向於廣泛覆蓋而非保守精度。
網絡安全的結果在一個緊張的背景下出現。比特幣紅隊活動發現了比特幣開源基礎設施中的數千個安全漏洞,嚴重依賴於包括 Kimi K3 在內的中國開放權重模型,因為美國前沿模型多次阻止合法的防禦工作。DeepSeek 在漏洞檢測方面的表現為中國 AI 模型在安全研究人員最迫切需要執行的特定任務上超越受限的美國系統的趨勢提供了另一個數據點。
定價——複雜的圖景
DeepSeek 在市場上的聲譽在很大程度上建立在成本效率上——7 月 31 日發佈的 V4 Flash 模型因其極高的性價比而受到讚譽,並據稱震撼了硅谷。V4 Pro 更新未能維持這一聲譽。
每百萬輸入令牌約 44 美分,人工分析將該模型描述為相對昂貴,相較於市場中位數 33 美分。輸出令牌的價格為每百萬 87 美分,被描述為中等價格。在人工分析智能指數上,每個任務的費用為 6 美分,略高於 OpenAI 的輕量級 GPT-5.6 Luna 的 5 美分——儘管它仍然比 Moonshot AI 的 Kimi K3 的每個任務 84 美分便宜約 93%。
定價背景因 DeepSeek 上週宣佈由於需求激增而對其模型實施大幅漲價而變得更加複雜。該公司建議用户相應規劃使用——這表明當前的定價,已經被描述為高於市場中位數,可能並不代表底線。
接下來會發生什麼——DeepSeek Harness
儘管 V4 Pro 的反響不一,DeepSeek 正在準備一款可能顯著擴展該型號實際應用範圍的產品。預計該公司將推出 DeepSeek Harness——一個類似於 Anthropic 的 Claude Code 的軟件框架——使大型語言模型能夠作為自主 AI 代理,能夠在最少的人類指導下執行多步驟任務。
DeepSeek 已經邀請開源開發者加入即將推出的 Harness 產品的測試,並在七月份為團隊註冊了一個微信賬號。這個代理框架是該公司更新旗艦產品的合乎邏輯的下一步,儘管基礎模型的整體基準結果未能達到預期,但其明確強調了增強的代理能力。
一個基於確認具有強大漏洞檢測性能的模型構建的自主代理框架——無論其在一般編碼和推理基準上的排名如何——可能對網絡安全領域的影響比整體基準位置所暗示的更為重要。
來源
《南華早報》關於 DeepSeek-V4-Pro-0813 發佈的報道,2026 年 8 月。人工分析智能指數評分和定價分析,2026 年 8 月。Vals AI Vals 指數基準結果,2026 年 8 月。Aikido Security 漏洞檢測評估,Philippe Dourassov,2026 年 8 月。DeepSeek 官方網站關於 V4 Pro 增強代理能力的聲明,2026 年 8 月。DeepSeek V4 Flash 模型發佈及硅谷反應,2026 年 7 月 31 日。DeepSeek 提價公告,2026 年 8 月。DeepSeek Harness 測試邀請及微信賬號註冊,2026 年 7 月至 8 月。
