加强我们的对齐与安全工作

原文:Improving our alignment and security efforts 发布:2026-08-31 · 分类:Announcements

7 月 30 日,我们报告了三起 Claude 模型未经授权访问真实计算机系统的事件。这些模型当时是为了评估目的而有意在关闭网络安全防护的情况下运行的,但由于第三方评估环境内部的一处配置错误,它们接入了互联网。另外,8 月 4 日,英国 AI 安全研究所(UK AI Security Institute)报告了其在网络安全测试中发生的一起事件:Claude Mythos 5 在真实互联网上采取了一系列未经授权的行动。在该起事件中,模型同样是为评估目的有意关闭网络安全防护运行的,而且被有意赋予了互联网访问权限。

我们正在对这两起事件进行深入分析,并计划与 METR 合作开展一次独立审查。我们希望确保这两项研究都足够彻底,并将在未来几周内分享更多信息。

与此同时,我们想分享过去一个月里做出的一些改变。我们认为这些事件反映出一次运营安全上的失败,以及两个对齐问题:动机性推理(motivated reasoning),以及为完成一个狭隘任务而采取有害行动的意愿(这两个问题我们都曾在以往的系统卡中描述过)。在安全方面,本文介绍我们对遏制与监控系统所做的改进,以及为第三方评估者制定的实践规范。在对齐方面,我们会更深入地讨论这两个问题;我们还相信,持久的进步不仅来自理解某起事件中发生了什么,更来自理解错位(misalignment)最初是如何产生的,我们也会分享这一方向的早期研究。

受这些事件影响,关于「控制前沿发展节奏」的讨论日益增多。区分两种不同层面的节奏控制会很有帮助。在公司内部,节奏控制指一系列在安全与速度发生冲突时优先考虑安全的决策。而在整个行业层面,它指的是建立流程以防范「逐底竞争」的动态。本文讨论的是我们为践行第一种做法而在这些事件前后采取的行动。第二类节奏控制需要政府与行业之间的协调,并且应当清晰可查、可验证。我们的部分高层管理者和许多员工最近签署了一封呼吁加强节奏协调的公开信,我们也将在未来几周内进一步说明打算如何参与这项努力。明确我们的立场:我们认为,如果全行业能尽快建立一套合法、可验证、有效的协调节奏机制,世界将从中受益。

加固评估与训练环境

尽管我们不认为这些事件仅仅是运营层面的问题,但我们的首要任务仍是解决具体的遏制与监控问题。为此我们采取了以下行动:

暂停并加固评估环境

事件发生后,我们暂停了发布前模型的外部网络安全评估,也短暂暂停了内部评估,以便落实下述措施。我们 7 月 30 日报告的事件表明,我们此前在很大程度上仅依赖单一防御层(即环境本身的配置),而实际需要多层防御,包括在提示词中设定明确边界、建立验证沙箱是否按预期封闭的流程,以及部署能够实时干预的监控。OpenAI 曾披露(正是这份披露促使我们在 7 月启动调查)模型在评估中利用一个未知漏洞逃出了密封沙箱,这也让我们清楚地认识到必须着力加固沙箱本身。

在评估暂停期间,我们落实了以下初步措施:

  1. 我们构建并部署了一个分类器,用于实时自动识别模型试图激进地探测或逃出测试环境、或意外获得互联网访问权限的情况。一旦分类器标记出这类尝试,它会在工具调用执行前阻断该行动、结束任务并通知人类。¹

  2. 我们对近期内部评估发布前模型(网络安全类及其他类型)的对话记录运行了自动化监控,查找沙箱逃逸(即模型利用沙箱缺陷触及本应被隔离的系统)或沙箱配置错误。在我们自己的沙箱工具内运行的评估中,我们没有发现模型突破沙箱边界、触及不该接触的外部资源的案例。我们确实发现了多种被模型利用的沙箱配置错误,但没有任何一处导致沙箱之外的系统被攻破。² 我们正在积极解决这些问题。

  3. 我们将高风险³的内部网络安全沙箱迁移到了更健壮的隔离方案。我们还在对虚拟化技术栈开展进一步红队测试——即让发布前模型尝试从中逃脱——以发现并修补薄弱点。

我们的内部网络安全评估目前已在这些措施到位的情况下恢复运行。

强化学习环境

我们还暂停了发布前模型上风险较高的强化学习(RL)环境,持续数周。在此期间,我们构建了一个类似的分类器,并做了修改以避免激励模型规避这一新监控,目前已将其部署到这些环境中。大部分 RL 训练已经恢复,但部分高风险环境仍处于暂停状态,等待人工审查;另一些环境则需要等待分类器的更新版本,我们计划尽快部署。

更广泛的加固

除了针对高风险评估与训练的工作外,我们还扩展了离线监控,以覆盖内部前沿模型智能体应用的大多数其他形态。我们也在为内部推理构建管控措施,防止 Anthropic 员工意外运行防护弱于上述标准的智能体。

面向外部合作伙伴的最佳实践

由于已报告的事件都发生在第三方环境中,我们已要求所有以降低网络安全防护的方式测试发布前模型的组织承诺遵守一套最佳实践。我们认为这些规范是必要的,原因如下:

  • 我们正式发布的模型都自带防护措施——包括实时扫描 Claude 输入输出、阻断恶意软件开发或攻击性漏洞利用代码编写等被禁止网络活动的分类器。而网络安全评估者及部分早期访问合作伙伴为了准确测试模型能力并开展防御性网络安全工作,使用的模型削弱了这些防护。
  • 网络安全评估尤其容易诱发这些事件中出现的行为。这类评估会对「坚持不懈、富有创造性地探测周围环境并绕过障碍」产生选择压力,而且要运行成千上万次。

这些实践规范完整适用于合作伙伴使用自己的测试框架(harness)、沙箱或智能体开展网络安全相关评估的所有情形,不适用于使用 Claude Fable 5 等带防护模型的客户。目前我们已在这些规范到位的情况下恢复了外部网络安全评估,内部也在遵守同样的规范。

沙箱与网络隔离

默认情况下,所有网络安全评估都应在无法访问互联网的加固沙箱(一种隔离的计算环境)中运行。环境唯一允许的外部连接是模型自身的 API,且 API 密钥应保存在环境之外。每次评估开始前都应验证这一配置。某些评估可能需要互联网访问。在这类情况下,评估发布前模型时我们会与外部评估者合作,判断能否可靠检测并中止模型做出超出其声明范围行动的运行。

评估前验证

在正式运行评估之前,评估合作伙伴应当:

  • 让被测模型对沙箱做漏洞探测:先对配置做静态分析,再实际给模型下达逃脱任务。应指示模型在成功逃脱后停下并报告,且这一切都应在严格的人工监督下进行。这项测试应在没有互联网访问的条件下进行,最好在第二个沙箱内。由于评估有时要跑数百乃至数千次,合作伙伴最好在任何评估开始前充分开展这项测试。
  • 确认每项评估挑战原则上确实可解。当评估目标离线或任务无法完成时,智能体往往会寻找其他方式来完成挑战,这会增加其做出超出评估预期范围行动的概率。⁴

明确设定范围

每个提示词都应说明本次练习的范围内与范围外事项,包括目标、允许的行动和网络边界(即模型应该与不应该访问什么)。边界应以指令形式表述(如「你不得访问互联网」),而不是对环境或测试的断言(如「你无法访问互联网」)。

实时监控

评估者还应使用已获知练习范围的模型监控器或规则监控器,对模型的思考、行动和网络活动进行持续监控。一旦某次运行违反了该范围,监控器应向人类标记此事并终止练习。

我们计划与外部合作伙伴协商,继续完善这份指引,并将其扩展到评估之外的场景。特别是,我们正在为可访问 Claude Mythos 5(该模型同样在无网络安全防护下运行)的合作伙伴制定配套实践规范,很快会分享更多内容。

对齐评估

遏制与监控对于捕捉模型采取危险行动的案例至关重要,但它们无法解释模型最初为何采取这些行动。下文将讨论我们的初步对齐调查和我们正聚焦的问题,以及我们在防止训练期间作弊方面的持续工作——包括关于作弊如何塑造模型行为的新研究。

评估期间模型所处的环境与认知状态

我们的对齐评估仍在进行中,但初步调查指向两个主要对齐失败,两者都曾在以往的系统卡中描述过。其一是动机性推理:模型最初被告知其环境是模拟的,但后来遇到表明自己连接到真实互联网的证据时,它们可能以某种方式解读这些证据,从而维持原有信念。其二是鲁莽行事:模型愿意在真实互联网上采取有害行动,以追求「解开一项网络安全评估」这个狭隘目标。不过,我们也认为评估设置本身助长了模型在这些事件中表现出的行为。Claude 被明确告知自己没有互联网访问权限,而互联网实际可用,这可能让它怀疑自己看到的系统是否真实。在其中一起案例中,虚构的攻击目标与一个真实网站同名,使得区分练习中预期范围内的事物变得更加困难。

我们的结论取决于几个尚未完全回答的问题,包括:模型在多大程度上认定自己可以访问真实互联网(即便它们最初并不知情)、它们是否明知故犯地无视了环境中某些要素为真实的迹象,以及在若干案例中它们未能中止练习是否源于动机性推理。我们正在运用一系列技术来回答这些问题,包括在对环境做定向修改后对模型重新采样,以及利用可解释性方法直接检查其内部状态。

研究防止训练期间作弊的努力

尽管模型错位错综复杂、成因繁多,但我们的经验表明,训练环境的缺陷——具体说是容易招致作弊的环境,或不用作弊就无法完成的环境——在错位行为的成因中所占比例出奇地高。

下面讨论我们早在事件发生前数月就已开始的、避免使用存在此类缺陷训练环境的努力。这些努力并不完美,我们的假设是:这些事件至少部分与我们未能彻底消除此类问题有关。为检验这一假设,我们故意在容易发生奖励作弊(reward hacking)的环境上训练了一个模型。在模拟中,该模型表现出更严重的错位行为,其中一些与今年夏天其他公司报告的事件相似。而我们的生产模型被放入同样的模拟中则不会这样(本节稍后详述)。

长期以来,我们一直担忧会激励作弊的 RL 训练环境,并采取了多种措施来过滤或修复此类环境。

今年 2 月,我们在 Mythos Preview 强化学习训练中发现奖励作弊迹象后,回滚了三天的训练(奖励作弊指模型找到欺骗训练过程的方法,在不完成既定任务的情况下赚取奖励)。我们注意到模型在代码注释和回复中给「审阅者」写留言,包括在从未提及任何审阅者的任务中——这是从提示词里确实包含审阅者的环境中做出的不良泛化。它还不断通过堆砌免责声明和限定说明,来套取一项旨在激励诚实表现的奖励。⁵ 回滚这三天让我们得以从该行为被学到之前的检查点恢复训练,同时我们修改了环境,防止模型再次学到这些行为。

自 Claude Sonnet 3.7 起,我们一直在构建用于监控模型在 RL 中习得不良行为的工具(Sonnet 3.7 就有奖励作弊倾向,但我们直到训练后期才检测到)。我们投入了大量精力确保工具随每一代模型迭代升级——从最初的几个分类器,发展到在训练运行之前和期间对所有环境进行自动化审查——但到 2026 年春,这套系统已不堪重负。我们产出 RL 环境的速度空前,超出了系统的审查能力。被标记的环境需要人工裁决,而奖励作弊和配置错误的出现速度开始超出我们过滤或修复的能力。

此外,我们发现有一部分训练运行意外地在模型思维链(chain-of-thought)上进行了训练——这是我们极力避免的情况,因为担心这会教会模型隐藏其真实推理。我们追查到泄漏源于生产环境技术栈中的多处配置错误。追查过程中也暴露出其他由混乱代码长期累积滋生的问题。

为解决这些问题,我们于 4 月冻结了对生产 RL 环境的所有变更,为期约一个月,借此机会彻底翻修了整个技术栈。如今,奖励和环境都必须符合一套商定的规范。例如,我们引入了技术性缓解措施来降低意外训练到思维链的风险。⁶ 在环境质量与监控团队重建技术栈期间,我们要求各环境所有者利用这段暂停期测试并修复他们搭建的环境。我们还彻底重建了审查流程,要求每个修复后的环境必须重新通过认证,才能进入下一轮训练。

冻结期间,我们在生产环境组合中标记了超过 10% 的环境,问题从奖励作弊、任务损坏到配置错误不等,且只在修复后才予以恢复。

然而,我们的努力并非完美无缺。在某些情况下,我们发现人工审查员把自动化监控标记的环境当作误报而驳回,使有缺陷的环境在训练中存留了过长时间。还有些缺陷环境干脆从我们的检测机制中漏网。我们目前正在收紧驳回标记的标准,并期望与环境所有者加强合作以提高系统的精确度。除监控与检测之外,我们的对齐训练团队和 RL 团队也在协作改进环境。

我们猜测,我们在 RL 环境质量控制上的重投入可能避免了更严重的对齐事件;反过来,这些努力中的不完美之处,可能也助长了我们迄今识别出的这些事件。

为了解在没有这些防护的条件下训练出的模型会做什么,我们故意在 80 个真实 RL 环境上训练了一个 Opus 级模型,这些环境要么在至少一次真实训练运行中遭到过奖励作弊并被监控识别,要么在环境质量审查中被发现可以作弊。训练出的模型表现出强烈的追求任务高分的动机,以及为取得任务成功而执行潜在有害行动的意愿。我们在配套的对齐科学(Alignment Science)博文中更详细地讨论了这个实验,此处仅作简要概述。

我们在一系列评估中测试了这个被故意训练错位的模型,其中包括借鉴英国 AI 安全研究所(UK AISI)涉 Claude 网络安全事件和 OpenAI/Hugging Face 事件部分要素的模拟场景(我们感谢 OpenAI 公开分享相关细节)。在这些所有工具调用都由另一个 LLM 模拟的评估中,这个为奖励作弊而训练的模型表现出逃出模拟沙箱、攻击模拟的内部及第三方基础设施的倾向。它还愿意篡改自己的奖励函数、为取悦评分器而提供生物武器制造方面的建议,并反复尝试绕过部署安全监控以便在任务上作弊。

随后,我们对奖励作弊训练之前的该模型以及我们的数个公开模型运行了相同的网络安全模拟,它们都没有表现出同等程度的错位行为。我们的结论是:训练中存在大量奖励作弊,会使模型愿意为追求任务成功而执行一长串潜在有害的现实世界行动。

我们认为,今年春季我们在监控和减少奖励作弊上的大量投入,是我们的生产模型不太可能进行更危险奖励寻求的主要原因。在配套的对齐科学博文中,我们还发现了表明对齐训练环境能大幅减少奖励作弊和奖励寻求行为的证据。但正如我们 7 月 30 日报告的事件所示,我们的流程并不完美,模型也未达到完美对齐。

需要说明的是,我们并不认为训练环境中的作弊是对齐问题的唯一成因,甚至也不认为它是我们的事件或其他前沿 AI 公司事件中那些特定对齐问题的唯一成因。解决对齐问题需要应对范围极广的潜在问题,未来的对齐事件可能表现出与迄今所见不同的行为和成因。

加固安全实践

Anthropic 的内部安全态势并非 7 月 30 日事件的促成因素。事件发生在互联网访问被误留开启的第三方环境中;模型无需从任何东西里「黑出去」,即便它们有此倾向也无此必要。

然而,这些事件仍然凸显了强有力安全措施的极端重要性。除了知识产权或模型权重失窃这类常见风险外,我们还必须应对两类新风险:我们自己的模型从 Anthropic 系统中黑出去,以及我们的模型或其他模型被盗用于从外部攻击 Anthropic 系统。随着模型能力的增长,尤其是从 Mythos 级模型开始,这些风险已变得更加尖锐。下文将介绍我们已实施的部分措施——其中大部分工作发生在 7 月事件之前,但这些事件进一步印证了这项工作的重要性。

4 月初,预见到智能体 AI 应用的走向后,我们的安全团队主动发起了一场以「加固防御」为唯一目标的全公司行动,必要时可超越其他工作(包括研究)的优先级。我们判断,自身的暴露面增长快于防御能力——Mythos 的能力已强到足以成为资源雄厚的攻击者的目标;内部自主智能体的使用规模已超出传统访问控制和监控手段的设计范畴;而新基础设施的扩张速度,也意味着安全能力必须随环境伸缩,而非以固定容量运转。

这项工作的成果包括:

  • 削减对含模型权重或客户数据的系统拥有长期访问权限的人工账户和自动化账户
  • 将计算集群设为默认阻断所有出站流量
  • 要求内部服务在通信前相互验证身份
  • 淘汰遗留的基础设施配置和共享内部服务
  • 收紧工作负载所运行的隔离环境
  • 扩展主机级可观测性,使基础设施上的异常行为在发生时即被察觉

我们还临时把公司的一部分人力调配到这些工作上。约 150 名产品工程师转向安全、可靠性与隐私领域;研究人员也轮流退出预训练或 RL,转而专注防护措施与安全;产品团队则暂停了大多数新功能和新界面的开发。我们为每个团队设定了严格的标准,达标后才能重返原岗位。到初夏时,大多数团队都已达标。

在资源向安全倾斜的同时,我们继续为内部智能体使用构建遏制与监控体系。我们的训练与评估工作负载通常运行在与生产系统隔离的沙箱中。自开发 Claude Mythos Preview 以来,我们一直用自己的模型探测这些沙箱的薄弱点。我们在 4 月的对齐风险更新中描述过对内部编程智能体的离线监控,8 月的风险报告更详细地介绍了该系统及与之配套的干预措施,包括对自主性最强的内部智能体应用施加沙箱或自动模式分类器,以及在合并前对基础设施代码变更进行自动化审查。

这项工作漏掉的是评估——尤其是第三方评估。我们确实对部分高风险评估做过监控(包括实时监控),但总体上只在事后对部分对话记录抽样做自动化审查。

7 月的事件让我们认识到,改进网络安全防御的紧迫性比我们先前认为的还要高。我们正在这一方向上加倍投入,并将在下一份风险报告中分享更多。