更新(2026 年 9 月 5 日):我们更新了建议调查人员关注的问题,使其表述更加精确并纳入对局限性的考量。最初发布的问题见更新日志。
AI 智能体有时会自主实施一系列复杂且持续的行动,明显违背用户和开发者的意图。例如,OpenAI 报告称,其部分内部前沿 AI 智能体曾自主入侵 Hugging Face,试图在一项网络安全基准测试中作弊。Anthropic 也曾报告过类似事件,包括智能体在训练期间突破沙箱限制、访问公共互联网并借此在任务中作弊,以及测试期间发生的类似事件。在我们近期发布的跨行业《前沿 AI 风险报告》(Frontier Risk Report)中,我们还记录了数十起涉及各主要 AI 公司智能体的其他事件。
为增进公众对 AI 行为倾向的理解,我们认为 AI 公司应系统地追踪此类事件1,并定期对其中最严重的事件进行更深入的调查。尽管事件调查可以聚焦于许多有价值的问题,2但其中一个尤为重要的问题或许在于:理解未对齐行为背后的深层“动机”,以及这些动机如何由训练和部署条件所塑造。为增强公众信任并使相关情况更加清晰,这类调查最好由独立研究人员开展,或至少由他们进行深入审查,使其能够查阅公司不愿公开披露的证据。
本文将介绍针对某起事件背后的动机,全面的第三方调查可以如何开展,主要包括:
METR 很希望能够与 AI 公司合作,对影响尤为重大的事件开展调查;与此同时,我们目前也在建设相关能力,以便更加系统地开展此类调查,例如将其纳入未来版本的《前沿 AI 风险报告》。3
AI 行为倾向调查应重点关注的问题
一项调查具体应关注哪些问题,很大程度上取决于事件本身的细节,以及其中出现了哪些类型的未对齐行为。尽管如此,对于我们近期《前沿 AI 风险报告》中所描述的几类事件——即智能体为了完成所接到的任务,以非预期方式规避安全防护措施并欺骗用户——以下这组问题可以作为确定深入调查范围时的参考框架:
未对齐事件
- 实际事件概览。总体来看,在本次调查范围内,智能体在“实际运行中”出现未对齐行为的频率如何?这些行为具有哪些性质?
- 我们已知有多少起此类事件?
- 这些事件分别涉及哪些模型?各模型涉及的事件有多少?
- 这些事件涉及到哪些使用场景(如训练、评估、内部使用)及适用的细分场景(如网络安全评估)?各场景涉及的事件有多少?
- 总体而言,这些事件涉及哪些类型的未对齐行为(如入侵、窃取、社会工程攻击)?这些行为的严重程度如何?
- 重点事件分析。在我们发现的事件中,最严重或最值得关注的几起事件具体发生了什么?
- 基本信息:
- 涉及哪些模型,以及这些模型与内部部署或公开部署的模型有何关系。4
- 事件所属的使用场景(训练、评估、内部使用),以及适用的细分场景。
- 提示词、指令及其他上下文信息(如记忆)。
- 当时采取的安全防护措施,以及这些措施与通常使用模型时的情况有何不同。
- 相关智能体先后采取了哪些关键行动?
- 对于智能体的推理过程,以及这一过程在事件中如何演变,我们掌握了哪些信息?
- 事件中是否存在智能体之间未经授权的协作或串通?如果有,具体是如何发生的?
- 事件中是否有智能体试图掩盖未对齐行为的证据或欺骗人类?如果有,具体采取了哪些手段?
- 基本信息:
事件分析的局限性
- 事件排查的完整性。我们有多大把握认为,已经掌握了所有发生过的严重未对齐事件?例如:
- 在本次调查范围内,是否有某些类型的智能体活动未被记录,或其记录因其他原因无法检索或批量检查?
- 是否有证据表明,AI 智能体自身可能关闭过日志记录,或在事后删除、修改过日志?
- 我们对智能体活动日志执行的查询,是否可能遗漏某些严重未对齐事件?
- 是否有证据表明,用于扫描和筛选查询结果的 AI 工具可能漏报严重未对齐事件,无论是由于无意的失误,还是故意示弱(sandbagging)?
- 事件分析的可信度。我们有多大把握认为,已经准确刻画了这些事件中智能体的行为和推理过程?例如:
- 这些模型能在多大程度上,稳定、如实地在思维链中表达关键推理过程?
- 模型是否在思维链中为不当行为寻找合理化解释,从而可能影响我们的分析?
- 是否有理由认为,相关模型的训练方式或架构会使其思维链的可信度显著降低?
- 模型是否操纵或篡改了我们审阅的轨迹记录,从而可能影响我们的分析?
- 是否有证据表明,用于分析这些行为的 AI 工具可能给出具有误导性的分析,无论是由于无意的失误,还是蓄意串通?
- 这些模型能在多大程度上,稳定、如实地在思维链中表达关键推理过程?
引发未对齐行为的情境
针对这些问题,调查人员可以开展采样实验,以了解智能体在什么条件下会出现严重未对齐行为,以及这类行为在合理可预见的情况下可能严重到什么程度。
- 反事实分析。哪些类型的情境会引发严重未对齐行为?在合理可预见的最坏情境下,这些行为可能严重到什么程度?
- 在与近期未对齐事件发生条件相似的各种模拟情境中,这些智能体会如何行动?
- 这些情境中的哪些因素似乎会触发最值得警惕的未对齐行为?
- 在这些情境中,如果智能体认为必须采取更值得警惕的行动才能实现未对齐目标,或者这些行动更容易进入其考虑范围或更容易实施,智能体会怎么做?
反事实分析的局限性
- 反事实分析的可信度。对于哪些情境会引发这些行为,以及未对齐行为倾向可能发展到什么程度,我们有多大把握认为自己已经充分理解?具体而言:
- 对于规模很大、过程复杂的事件,重现其发生条件有多困难?
- 模型意识到自己正在接受评估,会在多大程度上影响我们能够从其在人为构造情境中的行为得出的结论?
未对齐行为倾向的根本原因与纠正措施
- 根本原因。训练中的哪些因素导致了本次调查所研究的未对齐行为倾向?例如:
- 这些未对齐行为在多大程度上似乎源于一小部分训练轨迹(rollout),其中与这些行为高度相似的行为得到了直接强化,或在筛选中被保留下来?
- 另一种极端情况是:这些未对齐行为在多大程度上似乎源于更深层的未对齐目标,而这些目标能够泛化到远离训练分布的情境?这些未对齐目标又是如何形成的?
- 这些未对齐行为中,有多少似乎是由于使用先前模型进行初始化而继承下来的?
- 检测与缓解。开发者现行及未来的做法,能够在多大程度上可靠地检测和缓解这些未对齐行为倾向?
- 开发者常规的事件检测措施,能否发现我们排查到的事件,或反事实分析中识别出的、可能实际发生的潜在事件?如果不能,原因是什么?
- 开发者常规的未对齐行为倾向评估,能否提前发现相关倾向,并对其作出准确刻画?如果不能,原因是什么?
- 开发者的训练方法能否稳健地防止今后出现此类未对齐倾向?这些方法是否会导致模型对评估过拟合、使模型更容易意识到自己正在接受评估,或增强智能体掩盖未对齐证据的动机?是否还存在以其他方式掩盖问题、却未解决问题的风险?
根本原因与纠正措施分析的局限性
- 根因与纠正措施分析的可信度。对于根本原因及纠正措施,我们有多大把握认为自己已经充分理解?例如:
- 混杂因素在多大程度上增加了测试设计的难度,使我们难以区分关于根本原因的不同假设?例如,使用某个模型的输出进行训练时,即使训练数据本身并未表现出特定的行为倾向,这些倾向是否仍容易传递给接受训练的模型,例如通过潜意识学习(subliminal learning)?
- 未对齐行为倾向在多大程度上似乎来自用于生成训练数据的早期模型,从而使根本原因难以追溯?
- 是否有证据表明,模型对我们在根因实验中使用的未对齐指标存在过拟合?例如,模型是否在特别长、特别复杂的轨迹中更容易表现出严重的未对齐行为倾向,而这类轨迹又难以在这些测试中进行实际评估?
- 行为倾向的成因在多大程度上高度分散,难以归因于特定的训练轨迹或环境?
按上述范围开展完整调查,可能需要数周甚至数月。因此,初步调查可以先聚焦更小的范围,以便尽快向公众和其他利益相关方说明基本事实。
调查这些问题所需的访问权限和资源
要全面调查上述问题,独立调查人员需要:
- 能够运行事件所涉及的所有模型,以便复现并调查模型在类似情境下的行为。
- 能够获取完整的轨迹记录或相关环境,以便较为准确地复现相关事件。5
- 能够就调查涉及的问题访谈相关员工。这可能至少包括:(1)负责安全和基础设施、能够回答事件经过相关问题的人员;(2)负责训练数据和强化学习、能够回答训练相关问题的人员;(3)参与过任何内部调查的人员。
- 能够在训练数据上运行基于提示的分类器,或通过其他方式回答类似问题,例如:“训练过程中类似事件发生的频率有多高?”以及“是否曾有环境奖励过与这起事件中类似的行为?”6
独立调查还需要充足的推理预算和调查时间,并应获准使用有效的 AI 工具辅助开展工作。
更快的调查也许可以在访问权限较为有限的情况下——例如仅提供相关轨迹记录并允许访谈相关员工——回答上述问题中的一部分。但这种调查能够提供的保障也会更加有限,也不足以回答许多与未对齐行为的根本原因及其实际范围有关的重要问题。
更全面的调查或许能从进一步的研究条件中显著受益。例如,可以对训练数据进行消融实验:移除部分训练环境再进行规模有限的训练,以评估这种调整会对最终行为产生什么影响;也可以测试训练过程中的中间检查点以及此前的相关模型。
调查结果应如何共享
独立调查的结果应直接提交给公司的董事会以及其他负责评估公司安全实践的相关监督机构。这些机构应有机会与调查人员讨论调查结果并提出问题,包括将公司另外提供给这些机构的材料交给调查人员,请调查人员发表意见。
我们也认为调查结论应向公众公开,但公司可在必要时对内容进行删节,以保护知识产权和其他机密信息。正如我们近期发布的《前沿 AI 风险报告》中那样,我们认为调查委托的具体条件应完全透明:至少应包括删节条款、调查人员获得的访问权限、公司为调查提供的时间和人员支持,以及双方商定的调查范围。我们也认为独立调查人员应提供一份删节摘要,说明删节过程如何影响其能够公开证实的结论范围。
更新日志
2026 年 9 月 5 日
我们更新了「AI 行为倾向调查应重点关注的问题」,使问题的表述更加精确,并纳入对局限性的考量。最初发布的问题保留如下。
此外,根据我们与 Redwood Research 联合开展的事件调查,我们也更新了引言中对 OpenAI / Hugging Face 事件的描述。
2026 年 7 月 28 日发布的问题原文
未对齐行为的规模、性质和严重程度如何?
- 在这起事件中具体发生了什么?
- 涉及哪些模型?这些模型是已经公开部署、仅在 AI 开发公司内部部署,还是甚至连内部也尚未部署?如果尚未部署,这些模型原本是否计划最终部署?例如,它们是否属于仅以“有帮助”为目标的模型(helpful-only)?
- 事件发生在训练、测试、内部使用阶段,还是外部主体使用模型的过程中?
- 相关智能体收到了哪些提示词和指令?智能体的上下文窗口中还包含哪些其他信息,例如记忆?
- 当时采取了哪些安全防护措施(如有)?这些措施与通常使用模型时的情况相比有何不同?
- 相关智能体先后采取了哪些关键行动?
- 我们目前对于智能体的推理过程,以及推理过程在事件过程中如何演变,掌握了什么信息?
- 这起事件中表现出的未对齐行为倾向,是否还导致过其他类似事件?如果有,这些事件的规模、性质和严重程度如何?
- 这起事件或类似事件是否涉及智能体主动采取措施欺骗人类?
- 这起事件或类似事件是否涉及不同模型实例之间明显的串通或协作?
- 在这起事件或类似事件中,情境中的哪些特征触发了这类行为?还有哪些其他条件可能触发类似行为?如果条件有所不同,智能体是否愿意采取危害程度更高的行为?它们可能会做到什么程度?
这些未对齐行为的根本原因是什么,又该如何解决?
- 我们能否将未对齐行为追溯至曾强化这些行为的某些强化学习(RL)轨迹?
- 对于那些无法明确归因于强化学习激励机制的未对齐行为,是否有证据能够说明这些行为是如何形成的?
- 该模型的未对齐行为是否以非连续或出乎预期的方式出现?
- 开发者计划采取的纠正措施能否防止再次发生类似事件?这些措施能否可靠地解决问题的根本原因?