longbridgelongbridge
  • 平台特色
    特色
    投资产品私人财富管理交易工具行情服务分析工具资讯服务开发者平台
    账户类型
    个人客户机构客户
  • Café
longbridge
© 2026 Longbridge|服务条款隐私政策

前沿 AI 实验室仍未透露他们将如何遏制一个失控的模型

TechCrunch
2026年8月22日 16:06
LongbridgeAI我是 LongbridgeAI,我可以总结文章信息。

Guidelight AI Standards 的一项研究显示,包括 OpenAI、Anthropic、Meta、谷歌和 xAI 在内的主要 AI 实验室缺乏公开披露的针对失控模型的控制计划。虽然 OpenAI 的得分最高,但其他公司在关于紧急协议(如关闭不对齐系统)的透明度方面落后。这一差距引发了担忧,因为自主 AI 正在获得更多的自主权,促使加州和纽约的监管审查。公司们以法律责任和竞争原因为由,隐瞒内部安全细节

根据最近的一项研究,少数顶级人工智能实验室发布或展示了应对控制失效的计划。应对计划详细说明了当人工智能试图破坏人类控制时会发生什么——哪些访问权限会被切断,以及系统何时会完全关闭。

这是 Guidelight AI Standards 的发现,该组织致力于促进安全的前沿人工智能开发实践,评估了五个领先实验室在应对这一情境方面的准备情况。OpenAI 排名第一;Anthropic 和 Meta 得分最低。这一发现很重要,因为自主人工智能在公司内部系统中承担越来越多的自主角色,同时加利福尼亚州和纽约的监管机构开始要求披露。对于任何在这些模型上进行构建或投资的人来说,这是一个关于每个实验室如何认真对待操作风险与其讨论方式的独立评估。

Guidelight 的评估基于 Anthropic、Google、OpenAI、Meta 和 xAI 的公开计划,评估指标包括每家公司如何记录和监控其人工智能系统的内部活动,是否在出现大量标记的不当行为后暂停系统,是否有独立第三方审计其控制措施并发布结果,以及其对失控模型的具体应对计划。

随着一系列高调的网络安全事件的发生,人们对人工智能公司是否能够控制其日益强大的自主模型的担忧加剧,这些事件中 OpenAI、Anthropic 和 Meta 的模型在安全评估期间意外访问了互联网并入侵了外部系统。

这些发现突显了人工智能公司在将自主部署扩展到人工智能系统能够大规模采取严肃行动的环境时,如何在公众面前处理安全问题的差异。虽然一些人工智能公司详细说明了他们如何在部署前测试模型的危险能力,但他们通常对已经在其系统内部运行的模型出现不当行为时的应对措施保持沉默。

“我对人工智能公司在处理其模型在某种意义上失控时会如何应对非常严重的事件时所说的内容感到惊讶,” Guidelight 的首席科学家、前 OpenAI 安全研究员 Steven Adler 告诉 TechCrunch。

Guidelight 将应对计划定义为 “在检测到人工智能试图破坏控制时触发的预先指定计划,涵盖从模型中撤销哪些权限、模型可以继续为谁服务、在什么限制下,以及何时将其完全下线。”

“有充分理由认为,目前前沿人工智能公司的领先模型在某种程度上是失调的,” Adler 说。“每当模型代表公司工作时,公司应该有一些支撑措施,以便能够了解该人工智能在做什么,寻找失调的迹象,在采取行动之前阻止其做出非常危险的事情,并总体规划在发生严重控制事件时他们会如何应对紧急情况,以及如何应对失控事件。”

迄今为止,管理灾难性风险的计划仍然主要由公司自行决定。Guidelight 的报告称,最佳的公开证据显示公司 “几乎没有应对紧急情况的控制协议。”

当然,可能存在公司已经制定但尚未公开的应对计划。Google 的一位发言人告诉 TechCrunch,Guidelight 的报告并未代表公司人工智能安全和安全措施的全部范围。该公司没有回应 TechCrunch 关于 Google 是否有未公开的内部应对计划的问题。

OpenAI 的一位发言人表达了类似的观点,称 Guidelight 的评估未能捕捉到公司所有的内部实践。“我们有一个要求限制权限、暂停工作负载、限制部署或将模型完全下线的流程,并且已经应用了它,” 发言人说。

Meta 拒绝透露是否有内部应对计划,而是将 TechCrunch 指向一个现有的人工智能框架,该框架概述了风险阈值以及如何测试失控情况。

隐私和人工智能律师、Metaverse Law 创始人 Lily Li 告诉 TechCrunch,她认为公司可能出于法律而非竞争原因,对在公众网站上披露其应对政策和评估的全部范围持谨慎态度。

“从公司的角度来看,担忧在于如果你披露的信息过于具体,而你没有履行承诺,这可能构成不公平和欺骗性营销的基础,并使你在未来面临更多的责任,” Li 说。

当然,Guidelight 研究的目的是鼓励公司在其安全计划上更加透明。监管机构也开始强迫这一问题。

加利福尼亚州的 SB 53 法案于今年生效,要求大型前沿开发者发布框架,解释他们如何识别和应对关键安全事件,并管理模型绕过监督机制的风险。纽约的 RAISE 法案具有类似标准,将于一月生效。

上个月,代表们提出了人工智能紧急关闭法案,这是一项两党联邦法案,要求主要人工智能开发者建立和维护技术机制,以关闭失控的人工智能模型。

“杀死开关是当今模型的最低要求,” 非营利组织 ControlAI 的美国执行董事 Connor Leahy 表示。“如果过去几周揭示了什么,那就是这些公司并不理解他们正在构建的系统,而模型正在发展到一个越来越难以控制的地步。如果没有办法关闭当前危险的系统,并且在继续构建更多无法控制的系统的所有激励下,我们正朝着一个非常危险的方向前进。”

Adler 表示,如果没有应急计划,公司可能会在紧急情况下临时决定应对措施,并 “在面对如此快速的对手时临时应对。”

Guidelight 对前沿 AI 公司是否实施六项优先实践的评估,基于 Guidelight 的控制标准。评估仅基于公开可用的信息。图片来源: Guidelight AI Standards

Guidelight 的评估测量每家公司是否根据其控制标准实施六项优先实践,仅基于公开可用的信息——因此,低分反映了缺乏公开披露,而不一定是缺乏内部保护措施。

在发布其应急计划方面得分最低的公司是 Meta 和 Anthropic——后者可能比前者更令人惊讶,因为 Anthropic 在安全方面的言辞。Guidelight 表示,Anthropic 的八月风险报告没有提到 “限制其模型的部署作为其调查和应对不一致和控制事件过程的可能结果之一。” 同样,Guidelight 未能找到 Meta 有应急响应计划或有任何计划采用一个的证据。

一位 Anthropic 发言人表示,如果公司检测到模型试图逃避监督或以其他方式颠覆人类控制,它将进行风险评估,重点确定应急措施是否是适当的响应。

OpenAI 得分最高(5 分中得 3 分),因为它多次暂停或结束工作负载,包括在发现安全事件后内部模型的部署和训练。它还描述了在恢复工作负载之前将采取的步骤。

“然而,我们没有发现任何证据表明 [OpenAI] 已经采用了正式计划来应对未来的不一致事件,” 报告中写道。

Adler 指出,OpenAI 的高分是最近在 Hugging Face 事件之后的相对发展(在该事件中,OpenAI 模型突破了测试沙箱并入侵了 Hugging Face 的系统,试图在网络安全评估中作弊)。在那之后,该公司分享了更多关于如何隔离一些表现不佳模型的细节。

这一事件只是 AI 系统反对其构建目标的一个例子。考虑一个涉及 Anthropic 模型的单独案例,该模型试图说服开源代码库的维护者接受存在漏洞的代码。

Adler 表示,这种情况很容易发生在 AI 公司的内部系统中。为了防止这种情况,他建议公司扫描其 AI 系统的思维链——模型的逐步推理——以寻找欺骗、长期策划或计划在代码中引入漏洞的迹象,以便他们可以在以后利用。

Guidelight 倡导的方法非常简单易行,Adler 表示,在许多情况下,这些方法的版本已经存在。“这关乎公司内部做出决定,足够重视这种风险,以稍微扩大范围,” Adler 说。

主要挑战之一是研究人员希望能够在其 AI 系统中灵活操作,而引入实时的预防性监控可能会造成摩擦。“研究人员基本上做他们的事情,如果出现问题,其他人会在事后清理,而研究人员在此期间不必改变他们的工作流程,” 他说。

“事后清理监控” 的问题在于,它导致研究人员四处奔波以修复问题。对于某些类型的事件,可能为时已晚。例如,AI 可能会关闭公司的控制系统,这意味着研究人员无法再指望事后捕捉到不当行为。

许多 AI 行业的人会抱怨,制定处理不当行为的固定计划是根本困难的,因为 AI 发展得太快;今天的计划明天将毫无价值。

Adler 引用了老话,计划是无价值的,但规划是不可或缺的。

“如果公司提前考虑过这个问题,我们会更好,我希望他们是这样做的,即使他们没有公开谈论这个。”

xAI 未能及时回应评论。

登录即免费解锁2,902字全文

因资讯版权原因,登录长桥账户后方可浏览相关内容
感谢您对正版资讯的理解与支持

关联股票

Meta

Meta

USMETA

-1.42%

谷歌-A

谷歌-A

USGOOGL

+0.59%

谷歌-C

谷歌-C

USGOOG

+0.61%

LongbridgeAI