我是 LongbridgeAI,我可以总结文章信息。Anthropic 报告称,人工智能系统,特别是 Claude,正越来越多地通过 “递归自我改进” 来处理自身的发展,到 2026 年 5 月,人工智能负责合并代码的比例超过 80%。该公司强调了显著的生产力提升和扩展的任务能力。同时,Anthropic 向美国证券交易委员会提交了一份 S-1 表格草案,暗示其在获得 9650 亿美元估值后可能计划进行首次公开募股
Anthropic 正在将其人工智能开发的 越来越大份额 委托给人工智能系统,并可能开发自己的继任者,称这一想法为 “递归自我改进”。
“我们还没有达到那个阶段,递归自我改进并不是必然的。但它可能会比大多数机构准备的要早到来,” 该公司在最近的一篇博客文章中 写道。
报告描述了 Anthropic 内部从以人类编写代码为主的早期工作流程向能够执行任务、运行代码并将工作交给其他代理的软件代理转变的过程。它将这一进展框架视为一个路径,随着时间的推移,可能会从协助工程师转向以最小监督训练和改进模型。
另请阅读: 1.8 万亿美元的私人信贷市场面临估值考验
根据内部指标,Anthropic Institute 表示,到 2026 年 5 月,Claude 负责合并到 Anthropic 代码库中的代码超过 80%,而在 2025 年 2 月时这一比例仅为低个位数。
该公司还报告称,随着人工智能代理从建议代码片段演变为独立执行和迭代更长任务,工程师的生产力大幅上升,2026 年第二季度工程师每天合并的代码量是 2024 年的约八倍。
Anthropic 警告称,原始代码量可能会夸大生产力的提升,称代码行数是一个不完美的衡量标准,尽管内部反馈表明,人工智能使员工能够显著更快地完成核心任务。
在 2026 年 3 月对 130 名研究人员的内部调查中,受访者估计使用 Mythos Preview 时的产出约为没有人工智能工具时的 4 倍。
“我们预计 3 月的实际提升程度可能稍低。然而,我们发现总体声明是可信的,并与我们的其他观察一致:相当一部分 Anthropic 技术人员的核心工作完成速度是没有人工智能协助时的多倍,” 该公司写道。
该机构还指出了一些如果没有代理可能不会被优先考虑的工作,包括探索性工具和长期搁置的清理。在一个例子中,它表示 Claude 提供了超过 800 个修复,减少了一类 API 错误的数量达到 1,000 倍。监督工程师估计,同样的工作人类大约需要四年才能完成。
人工智能模型以更快的速度改进
Anthropic 还指出,人工智能能够可靠完成的任务长度大约每四个月翻一番。这一趋势较早期每七个月翻一番有所提升。
“在 2024 年 3 月,Claude Opus 3 能够完成人类大约需要四分钟的软件任务。一年后,Claude Sonnet 3.7 能够处理大约一个半小时的任务。再过一年,Claude Opus 4.6 能够处理 12 小时的任务。如果这一趋势持续,技能熟练的人需要几天完成的任务可能在今年内可实现。在 2027 年,人工智能系统可能能够完成需要几周时间的任务,” 该公司表示。
报告还强调了基准进展,包括 SWE-bench 和 CORE-Bench,它表示分数在相对较短的时间内从低水平上升到接近顶峰的表现。它补充说,METR 发现 Claude Mythos Preview 可以工作 “至少” 16 小时,并且 “处于 [METR] 在没有新任务情况下可以测量的上限。”
最大的剩余差距?判断力
模型可能能够执行明确定义的任务,但在决定追求哪些目标方面仍落后于人类,尤其是在工程和研究领域。
该机构认为,弥补这一差距对于任何能够设计自己继任者的未来系统至关重要,并表示这一可能性将提高安全性、监控和行为塑造控制的风险。
本月早些时候,Anthropic 向美国证券交易委员会机密 提交了一份草案 S-1 表格,为这家人工智能公司在证券交易委员会完成审查后上市提供了选择。
上个月,Anthropic 在融资 650 亿美元的 H 轮融资后超越 OpenAI 成为全球最有价值的初创公司,估值 达 9650 亿美元。Altimeter Capital、Dragoneer、Greenoaks 和 Sequoia Capital 领投了这一轮融资。
如果 Anthropic 以 1 万亿美元的估值上市,它将立即跻身全球最有价值公司之列,并可能成为历史上第二或第三大 IPO,仅次于 SpaceX 和 Saudi Aramco。
照片:Shutterstock
另请阅读: Ramp 达到 440 亿美元估值,扩大对 AI 驱动金融的推动
