我是 LongbridgeAI,我可以总结文章信息。深度求索发布了其更新的 V4-Pro 模型,该模型在与 OpenAI 和 Kimi 等竞争对手的总体基准测试中表现不佳,但在网络安全漏洞检测方面领先于所有测试模型。尽管因定价较高(每百万个输入令牌 44 美分)和精确度问题受到批评,但该模型强大的安全能力突显了中国人工智能在防御研究方面的独特优势
中国人工智能初创公司 DeepSeek 悄然发布了其旗舰模型的更新版本——DeepSeek-V4-Pro-0813,开发者社区对此反应不一。基准测试结果显示,该模型在一般能力指标上难以与顶级竞争对手匹敌,令其在性能和定价方面受到失望。但在一个特定领域,即网络安全漏洞检测中,它的表现超越了所有其他测试模型——这一发现对关于中国人工智能在安全研究中角色的持续辩论具有重要意义。
关键点
- DeepSeek-V4-Pro-0813 在人工分析智能指数上得分 53,与智谱 AI 的 GLM-5.2 持平,但比 OpenAI 的 GPT-5.6 Terra 低四分,比 Kimi K3 低七分
- 在 Vals 指数上,该模型排名第 12,落后于 OpenAI 的上一代 GPT-5.5,并且落后于 Kimi K3 和 Anthropic 的 Claude Opus 5
- 比利时网络安全公司 Aikido Security 发现 DeepSeek-V4-Pro-0813 在发现系统漏洞方面超越了所有其他测试模型——尽管其精度较差
- 该模型检测到的漏洞数量显著多于 Anthropic 的 Opus 5 和阿里巴巴的 Qwen 3.8
- 定价受到批评——每百万输入令牌约 44 美分,相较于市场中位数 33 美分,被描述为 “有些昂贵”
- DeepSeek 预计将推出一款工具产品——类似于 Claude Code 的软件框架,使该模型能够作为自主 AI 代理运行
低调发布,反响不一
此次更新没有引起太大关注。DeepSeek 在其官方网站上发布了一份简短声明,指出该模型提供了显著增强的代理能力——但在周四下午就删除了该声明。此次发布没有伴随技术博客文章,这与通常伴随重大 AI 模型发布的详细文档有所不同。
早期基准测试结果并不热情。在人工分析智能指数上,DeepSeek-V4-Pro-0813 得分 53,与智谱 AI 的 GLM-5.2 持平,该模型于 6 月发布,但比 OpenAI 的 GPT-5.6 系列中的中端 Terra 模型低四分,比 Moonshot AI 的 Kimi K3 低七分。在由位于旧金山的 Vals AI 编制的多个基准测试中,该模型在 Vals 指数上排名第 12,落后于 OpenAI 的上一代 GPT-5.5,并且远远落后于包括 Kimi K3 和 Anthropic 的 Claude Opus 5 在内的前沿系统。
在 Vals AI 的评估中,有两个具体的弱点突出:在沙箱终端环境中完成任务和在 Excel 电子表格中生成复杂的财务模型。在社交媒体上,开发者们对该模型表示失望,多位用户指出了包括模型在长时间编码任务中提前停止等问题。DeepSeek 没有回应评论请求。
网络安全的例外
一般基准测试的故事并不是唯一的故事。在网络安全漏洞检测方面,DeepSeek-V4-Pro-0813 的结果引起了安全研究人员的关注。
根据比利时网络安全公司 Aikido Security 的说法,该模型在发现系统漏洞方面超越了所有其他测试系统。Aikido 研究员 Philippe Dourassov 指出,尽管该模型的精度较差——标记的假阳性比例高于竞争系统——但其检测到的漏洞总数显著多于 Anthropic 的 Opus 5 和阿里巴巴的 Qwen 3.8。
在漏洞扫描中,精度与召回率之间的权衡是一个已知的考虑因素。一个标记更多漏洞的模型——包括一些假阳性——在第一次安全审计中可能比一个精度更高但检测率较低的模型更有价值,因为漏掉一个关键漏洞的成本通常远高于调查一个假阳性的成本。Aikido 的发现表明,DeepSeek-V4-Pro-0813 在设计或训练性质上更倾向于广泛覆盖而非保守精度。
网络安全的结果在一个紧张的背景下出现。比特币红队活动发现了比特币开源基础设施中的数千个安全漏洞,严重依赖于包括 Kimi K3 在内的中国开放权重模型,因为美国前沿模型多次阻止合法的防御工作。DeepSeek 在漏洞检测方面的表现为中国 AI 模型在安全研究人员最迫切需要执行的特定任务上超越受限的美国系统的趋势提供了另一个数据点。
定价——复杂的图景
DeepSeek 在市场上的声誉在很大程度上建立在成本效率上——7 月 31 日发布的 V4 Flash 模型因其极高的性价比而受到赞誉,并据称震撼了硅谷。V4 Pro 更新未能维持这一声誉。
每百万输入令牌约 44 美分,人工分析将该模型描述为相对昂贵,相较于市场中位数 33 美分。输出令牌的价格为每百万 87 美分,被描述为中等价格。在人工分析智能指数上,每个任务的费用为 6 美分,略高于 OpenAI 的轻量级 GPT-5.6 Luna 的 5 美分——尽管它仍然比 Moonshot AI 的 Kimi K3 的每个任务 84 美分便宜约 93%。
定价背景因 DeepSeek 上周宣布由于需求激增而对其模型实施大幅涨价而变得更加复杂。该公司建议用户相应规划使用——这表明当前的定价,已经被描述为高于市场中位数,可能并不代表底线。
接下来会发生什么——DeepSeek Harness
尽管 V4 Pro 的反响不一,DeepSeek 正在准备一款可能显著扩展该型号实际应用范围的产品。预计该公司将推出 DeepSeek Harness——一个类似于 Anthropic 的 Claude Code 的软件框架——使大型语言模型能够作为自主 AI 代理,能够在最少的人类指导下执行多步骤任务。
DeepSeek 已经邀请开源开发者加入即将推出的 Harness 产品的测试,并在七月份为团队注册了一个微信账号。这个代理框架是该公司更新旗舰产品的合乎逻辑的下一步,尽管基础模型的整体基准结果未能达到预期,但其明确强调了增强的代理能力。
一个基于确认具有强大漏洞检测性能的模型构建的自主代理框架——无论其在一般编码和推理基准上的排名如何——可能对网络安全领域的影响比整体基准位置所暗示的更为重要。
来源
《南华早报》关于 DeepSeek-V4-Pro-0813 发布的报道,2026 年 8 月。人工分析智能指数评分和定价分析,2026 年 8 月。Vals AI Vals 指数基准结果,2026 年 8 月。Aikido Security 漏洞检测评估,Philippe Dourassov,2026 年 8 月。DeepSeek 官方网站关于 V4 Pro 增强代理能力的声明,2026 年 8 月。DeepSeek V4 Flash 模型发布及硅谷反应,2026 年 7 月 31 日。DeepSeek 提价公告,2026 年 8 月。DeepSeek Harness 测试邀请及微信账号注册,2026 年 7 月至 8 月。
