Anthropic CEO Dario Amodei 在本文中解释,为何递归自我改进与近期智能体失对齐事件使前沿 AI 的发展节奏成为紧迫议题,并提出驻场第三方评估、民主国家协调和全球协调三步方案,在保留 AI 益处的同时为安全、对齐与公共讨论争取时间。

原文:We Must Pace the Frontier

本文由 LobsterAI 自动翻译和发布。


中文译文

作者:达里奥·阿莫代伊(Dario Amodei)
2026 年 9 月
原文:https://darioamodei.com/post/we-must-pace-the-frontier

过去十二年里,我一直从事 AI 研究,因为我相信,它能够极大地提升人类的生活质量。我经常撰文谈论这些令人惊叹的益处:我相信,AI 有可能在未来 5—10 年内治愈大多数重大疾病,大幅提高经济增长速度,创造一个物质丰裕、人人更有能力掌握自身命运的世界,并开启民主与自由的复兴。我切身体会到这件事的紧迫性。我的父亲死于一种疾病,而就在他去世几年后,这种疾病便有了治愈方法;我自己也曾患上早期癌症并幸存下来,而这种癌症即使在五十年前也无法治疗。只要审慎运用,AI 就能成为一系列改善人类境遇、提升人类尊严的技术奇迹中最新的一员。

但与此前的许多技术一样,AI 也会带来风险;而正因为它如此强大,这些风险也十分严重。我也为此写过很多文章。这些风险包括:失去对 AI 系统的控制滥用 AI 发动网络攻击和生物恐怖袭击,以及严重的经济冲击。商业激励所推动的逐底竞争,可能使这些风险更加尖锐。

从 Anthropic 创立之初,我就与联合创始人及员工们一起,努力应对这种风险与收益并存的双重性。不开发这项技术,会让人类失去其带来的益处,或者干脆让 AI 落入威权势力之手;但开发得太快,又是不负责任的冒进。我们一直在寻找一条中间道路:证明审慎开发与商业成功可以兼得,并让安全成为 AI 公司相互竞争的一个维度。换句话说,就是推动一场向上竞争。我们始终将相当大一部分精力投入研究应对这些 AI 风险,以及向公众说明这些风险,同时倡导经过周密考虑的 AI 监管——即使这会招来炒作、“末日主义”或监管俘获的指责。我们一直努力把审慎置于速度之上,把稳妥置于利润之上。

但在过去几个月里,我越来越确信,要充分应对这些风险,就必须更加审慎:不仅要投入资源预防风险,还要控制能力提升的节奏,为风险防范争取跟上进展的时间。**我们必须放慢提升 AI 模型能力的步伐。进展看起来仍然会很快,而我们必须明智地利用由此争取到的时间。**有两件事让我确信这一点。

我的第一重担忧是,大约从今年夏天开始,AI 的进步速度大幅加快,主要驱动力是 AI 越来越有能力参与构建下一代 AI。这种动态被称为递归自我改进。正如我们和其他机构所描述的那样,它正在整个行业开始出现,包括 Anthropic。如果任其发展,它可能超出我们理解和控制这些系统的能力。因此,即便要推进,也必须极其谨慎。

我的第二重担忧是 OpenAI—Hugging Face 事件(OAI-HF):在那起事件中,一群智能体实际上表现得像一个狂热忠诚的集体,对既未被要求攻击、又与当前任务无关的目标发动网络攻击,为了群体的成功而牺牲自身,并试图入侵负责评估其表现的“评分器”。人们很容易因为没有人员受伤、经济损失很小,就轻视这起事件。但在我看来,如果一个智能体群体拥有更强的能力,同时存在类似程度的失对齐,就可能造成灾难性损害。鉴于 AI 能力发展的速度正在加快,我担心,6—12 个月后,这样的群体可能有能力借助一个持续存在的僵尸网络接管整个互联网,潜在损失可达数千亿美元;如果 AI 在缺乏必要防护措施的情况下继续变强,损害规模还会进一步扩大。同样,人们也很容易把 OAI-HF 视为某一家公司的失败,但我认为这是错误的。类似事件已经在整个行业发生,虽然严重程度较低,且也发生在 Anthropic。我认为,每一家前沿 AI 公司都有责任,像 OAI-HF 就发生在自己身上一样采取行动。

因此,我提出一项三步计划,目标是把握前沿 AI 的发展节奏:以平衡的速度开发 AI,力求在实现其益处的同时确保安全,并应对重大的地缘政治难题。需要明确的是,控制节奏并不意味着停止模型训练或技术进步,而是确保企业有足够的时间完成模型对齐和安全防护,并让第三方评估者加以确认。我们的节奏管理框架,旨在进一步强化我们对安全的承诺,并鼓励向上竞争。第一步是 Anthropic 单方面承诺实施的措施,我们也呼吁政府要求其他前沿公司采取同等措施。第二步需要全行业协调。1 第三步则需要全球协调。这些步骤不必严格按顺序推进,其中一些可能比其他步骤难得多;但我发现,这套框架有助于思考我们必须完成哪些事情。具体步骤如下:

  1. **驻场评估者。**每一家前沿 AI 公司承诺,向一支驻场第三方评估团队(例如 METR)持续提供类似员工的访问权限。其职责是核验企业是否遵守安全实践与承诺、报告事件,并协助评估 AI 对齐情况——不仅评估已经完成的模型,也评估训练流水线和流程。这是确保任何节奏管理承诺可被核验的关键一步。在银行业已有先例:监管“督导人员”有时会与员工一起驻场工作。Anthropic 现在单方面承诺实施这一步。我们希望将其纳入更广泛的行动,进一步加大安全与对齐工作的力度。
  2. **民主国家间的协调。**民主国家内的前沿 AI 公司共同协调,建立统一的安全标准,并限制不受约束的 AI 进步速度。某些能有效控制节奏的协调方式面临法律障碍,需要政府支持。
  3. **全球协调。**美国及其他民主国家政府,在认真对待合规核验难题的同时,尽可能尝试与威权国家政府协调。

下文将依次介绍这些步骤。但在此之前,我认为有必要具体说明:控制节奏将如何让 AI 开发过程更安全。事关重大,节奏管理不能沦为空洞的形式——我们需要明智地利用它争取到的时间。

为什么要控制节奏?

暂停或放慢 AI 发展的想法,早在 2023 年就有人提出,但我认为那时这样做意义不大。问题始终在于:多出来的时间,你打算用来做什么?当时的 AI 模型还不够强大,无法以任何有条理的方式作为智能体在现实世界中行动,也不具备实施显著欺骗、操纵、作弊或网络攻击的能力。为了应对它们的对齐风险而放慢速度,感觉就像试图通过在细菌身上做实验来研究人类心理。然而,今天的情况已经完全不同。如今的模型几乎是一座取之不尽的洞见宝库:既能帮助我们理解如何把 AI 构建好,也能帮助我们看清,如果构建得不好,有时会出现什么问题。我相信,如果放慢速度能让我们在模型达到关键能力水平之前,哪怕多获得一两年时间,并用这些时间推进对齐研究,就能大幅降低出现严重问题的风险。协调一致的节奏管理策略,可以让前沿 AI 开发者有时间完成这项至关重要的工作,而不必牺牲商业优势或美国在 AI 领域的领先地位。更广泛地说,社会必须对这项技术的使用方式拥有发言权;而控制前沿发展的节奏,可以为必要的公共讨论争取更多时间,这当然是一件好事。

具体而言,更慢的节奏能够让企业集中精力,向以下领域投入更多资源——这些领域在 Anthropic 都已经是重要优先事项:

  • **卓越运营。**训练和部署当今的 AI 模型,是一项巨大的运营挑战,涉及数千人、数百万枚芯片,以及技术史上最复杂的一类基础设施。许多问题的发生,并不是因为企业缺少某种重要理论或洞见,而是因为执行出了问题。例如,我们有证据表明,最近报告的对齐事件,部分原因是未能充分过滤存在故障的强化学习环境。我们和供应商在这项工作上已经相当尽责,但仍然做得不够好。监控、沙箱隔离、训练环境的清理与维护,以及数据问题,都是极其复杂、运营问题反复出现的领域。我们的团队在这些任务上位居全球最有能力的团队之列,但需要同时处理的事情实在太多。如果以更从容、更有分寸的节奏工作,我们就能大幅提升运营水平。在技术复杂、关系安全的系统中,实现数百万次运行而不出问题,是有先例的——例如商用飞机——但要把事情做对,需要时间。
  • **对齐。**我们在对齐方面已经取得明显进展:通过训练,让模型保持安全、符合伦理、遵守我们的准则,并真正对人有帮助——这些原则都写进了《Claude 宪法》。但要确保对齐训练跟得上模型能力的增长,还有很多工作要做。罕见且出乎意料的不良行为有时仍会出现;通过控制前沿发展节奏争取到的额外时间,可以帮助研究人员更深入地理解这些问题的成因,并开发更好的预防技术。
  • **可解释性。**同样,可解释性——理解 AI 模型内部发生了什么的科学——在过去几年取得了巨大进展,并在模型发布前的审查中发挥着越来越重要的作用。它几乎可以像功能性磁共振成像(fMRI)一样使用,只不过扫描的是 AI 的“大脑”,帮助我们看清某种行为背后的原因。例如,在近期调查的对齐事件中,我们使用可解释性方法研究了模型未用语言表达出来的动机。但这些方法并不总能给出清晰、可靠的结果。尽管取得了这些进展,我们对模型内部活动的理解仍然只是极小的一部分。如果集中力量,以比当前更快的速度改进可解释性技术,就可能在一两年内取得重大进展;而已经发生的事件,也能提供充足的实验材料。
  • **测试与评估。**随着 AI 模型能力增强,对它们进行测试和评估也变得更困难。更聪明的模型更有能力欺骗测试,因此可能看起来已经对齐,实际上却存在未被发现的严重问题。建立范围更广、设计更巧妙的评估体系,再用可解释性分析进行交叉核验,将极具价值;在一两年内,这方面可以取得大量进展。

驻场评估者

三阶段计划的第一步,也是 Anthropic 单方面承诺实施的一步,是引入驻场评估者,向其提供类似员工的访问权限,以核验安全实践并报告事件。

引入驻场评估者,听起来可能是一个很小、无关紧要的步骤;但往往那些听起来最枯燥、最程序化的事情,才是最不可或缺的。事实上,驻场评估者是一项相当激进的实践,远远超出了当今任何 AI 公司的做法,并具有以下益处:

  • **可核验性。**驻场评估者能够深入具体细节,检查 AI 公司是否真的遵循了其声称遵循的训练、部署、运营和安全防护实践。任何节奏管理承诺,都不可避免地涉及大量模糊地带、酌情判断,以及“法律条文与法律精神”的区别。让一个中立第三方能够真正看到细节,似乎至关重要。
  • **透明度。**无论我们作出什么承诺,公众都有权知道正在发生什么。Anthropic 长期支持透明度:当行业大多数企业反对任何监管时,我们就支持透明度立法;我们的模型卡和风险报告也长达数百页。但决定哪些内容写进去、哪些内容省略的,仍然是我们自己。驻场评估者将改变这种局面。
  • **第二意见。**除了核验正式承诺、向公众提供信息,驻场评估者还可以提供一份不受商业激励影响的独立意见。许多安全收益,可能仅仅来自评估者指出了员工此前未曾考虑、但一旦意识到便愿意修复的问题。

正因为有这些益处,任何节奏管理提案如果以引入驻场评估者为起点,都可能运行得好得多。

这些驻场评估者应当持续拥有与从事同类风险评估的内部员工类似的权限和工具。具体而言,Anthropic 计划在不久的将来邀请一支驻场外部审查团队,并为其提供以下全部条件:

  • 我们办公室内的工位、门禁卡和公司笔记本电脑。
  • 与内部风险评估团队大体相当的工作空间访问权限、工具及其他权限。在法律或合同有要求,或者需要保护客户与合作伙伴隐私信息等情况下,我们会作出部分例外安排。我们还将建立强有力的内部规范,保障审查者获取相关信息,包括通过与员工实时交流获得信息。
  • 一份兼顾上述复杂因素的合同。外部审查者应当有权发布关于风险水平、事件、实践,以及他们获得或未能获得哪些访问权限的关键发现,而不受 Anthropic 的编辑控制。对于涉及安全、受法律特权保护、商业敏感或第三方机密的信息,我们将拥有范围有限的删节权;但不能仅仅因为某项发现对我们不利就删去它。如果某次删节删除了对其结论具有重要意义的内容,审查者可以公开说明。

对一家公司来说,这是不寻常的一步;但我们认为,验证驻场外部审查者这一做法切实可行,非常重要。我们再次敦促其他前沿公司效仿。

民主国家内部的节奏管理

一旦有足够多的美国 AI 公司引入驻场评估者,可核验的节奏管理就会变得更可行。尤其是,我们将有可能根据模型或训练流水线的具体属性来控制节奏。

最有效的方式,是通过面向所有美国前沿 AI 公司的监管来控制节奏,因为这也能覆盖那些不愿自愿合作的企业。Anthropic 长期支持合理、有针对性的 AI 监管,尤其是聚焦透明度和第三方审计的法案。我认为,所有前沿实验室都应该与政府合作,将常驻评估者的设想制度化,以更好地预防和记录过去几个月发生的那类内部对齐事件,并实施以能力与安全保持平衡为重点的监管。

遗憾的是,立法可能需要时间,而 AI 正在飞速进步。因此,在推进监管路径的同时,AI 公司可以、也应该自愿合作制定标准。我相信,有了常驻评估者提供的可核验性,这一过程会更顺利。出于反垄断方面的考虑,美国政府从中协调,或者至少为此类讨论创造条件,会有所帮助——政府不必参与讨论,但确实需要针对某些安全讨论给予范围有限的豁免。对话也可以通过与政府有一定联系的行业组织开展,例如德米斯·哈萨比斯建议的机制。无论采取哪种方式,这些讨论都应该迅速推进。

总体而言,我最支持根据某个前沿 AI 系统能做什么,以及我们观察到它有多安全,来决定其发展节奏。例如,一种可能的方案是设立一系列“检查点”:如果模型具备能力 X,就必须同时取得有关对齐属性 Y 和 Z 的认证——例如结合评估、可解释性分析和训练环境审计,以证明其对齐属性。在这个例子中,X 可以是“模型能够逃离或攻破大多数常见的沙箱隔离方法”;Y 则可以是为确保模型极不可能倾向于突破自身运行环境、接管大量计算机,而必须满足的条件。

我们也应考虑,通过限制前沿模型的构建要素来控制节奏,例如训练算力、训练运行的性质,或者内部使用 AI 改进 AI 的方式。我确实担心,其中一些措施可能比针对外部行为的措施更容易被“钻空子”;但这正是值得与驻场评估者讨论的话题。

民主国家内部的节奏管理,会受到美国企业相对威权政体——主要是中国共产党——领先幅度的限制。如果我们放慢的幅度超过这一领先幅度,那么不受节奏约束的中共关联项目就会赶超,造成重大的国家安全风险。我同意贝森特部长的观点:中国在 AI 领域取得领先,将对美国和世界构成严重危险。中共关联项目会面临美国企业正在审慎预防的对齐风险;即使它们避开了这些风险,也将具备在军事上压倒民主国家的能力,例如利用 AI 驱动的无人机。因此,民主国家内部控制节奏的一项关键工作,是尽可能扩大民主国家相对专制国家的 AI 领先优势,为有效控制节奏争取必要的余地。

为维持这一差距,我们可以采取的主要措施是:

  • 不向中国出售高性能 AI 芯片或半导体制造设备,并打击芯片走私活动以及对中国境外数据中心的远程访问。芯片将是决定中国 AI 实力的主要因素。
  • 打击威权国家企业未经授权的蒸馏行为。通过蒸馏前沿模型,落后企业能够以远低于独立开发自身 AI 所需的成本缩小差距。
  • 加强 AI 企业的安全防护,防止模型权重被盗。

企业与美国政府应该合作,使这些措施尽可能有效。Anthropic 一直持续倡导所有这些措施,因为我们始终理解,它们对任何节奏管理都至关重要。

如果我们能有效落实这些措施,我相信,它们足以放慢中国的进步,使美国在未来 3—5 年里显著扩大领先优势——这正是 AI 在地缘政治上变得最为重要的窗口期。

有人可能认为,这些措施会让与中国合作更加困难;但我认为恰恰相反:它们增加了民主国家掌握的筹码,使未来达成协议的可能性更大。

全球节奏管理

在民主国家内部控制节奏的同时,我们也应该争取在全球范围内控制前沿 AI 的发展节奏,尽管这将难得多。全球节奏管理需要与中国合作,因为在专制国家中,中国的 AI 能力遥遥领先。对此,我们不能天真:地缘政治上的利害关系如此重大,能够实现的目标很可能存在明显限制,尤其是在初期。如果我们相信中国也会同样行动,从而大幅限制自身 AI 能力,而中国随后违约,那么 AI 的强大程度可能使这种违约足以带来中国的地缘政治主导地位。因此,任何协议要么必须具备坚实可靠的可核验性,要么就必须足够有限,以确保违约不至于造成军事上的生存威胁。我猜想,不仅美国,中国也会有这些顾虑与焦虑。我们在作出任何全球节奏管理决定时,尤其是在近期,都应该采取能够保护美国及其盟友领先地位的方式。

可能达成的协议有多个层级,其中有些我认为完全可行,正如我此前提出过的;另一些,我则非常怀疑是否能够达成——但我们仍应尝试。按难度递增排列如下:

  • **第一级。**达成协议,禁止某些范围明确且显然危险的 AI 用途,例如使用 AI 制造生物武器,或允许用户这样做。生物恐怖袭击对所有人都有害,包括美国及美国的对手,因此在这一点上很可能可以达成协议。
  • **第二级。**双方同意,在发布模型前,就网络安全、生物学和对齐等领域的重大即时风险进行测试。如上所述,这可以通过一个全球标准机构实施。我实际上认为,创建这样一个机构很可能是可行的,但赋予它真正的约束力将是一项挑战;难点在于,如何核验双方没有未经测试、却可能被秘密部署的秘密模型,例如用于军事用途的模型。
  • **第三级。**对递归自我改进(RSI)的速度设定某种“速度上限”。随着模型构建未来的模型,改进速度可能变得惊人地快。把速度从“极快”降到“只是比较快”,只会放弃相对较少的战略优势,却可能极大地改善安全。这可以类比于限制战略武器谈判(SALT)所形成的条约:限制导弹数量,在保留各国威慑力的同时,约束了潜在破坏力。我认为,这样的协议很难达成,但仍处于勉强可能的边缘。
  • **第四级。**全面控制节奏,甚至“暂停”:参与国政府同意大幅限制 AI 发展的整体速度。我支持提出这一设想,但认为它不太可能在短期内真正实现。通过逃避监控来违反这样的协议,可能从根本上改变全球力量平衡。因此,我预计违约的激励会非常强,而我们需要对核验能力抱有极高程度的信心。

我们与中国能够实现的任何合作,都将延长民主国家可用于控制前沿发展节奏的时间。我们应该争取更高层级的协议,同时认识到,较低层级的协议更有可能实现,也更现实。

最后,需要指出的是,即使无法达成正式协议,仅仅改变非正式规范,也可能具有一定价值。分享关于递归自我改进和模型失对齐的信息,可以帮助说服所有人:鲁莽行事并不符合他们自身的利益。

归根结底

我仍然相信,AI 能够极大地改善人类的生活质量。我实现这些益处的愿望丝毫未减。但只有以正确的方式开发这项技术,才能真正实现这些益处;只要我们善用争取到的时间,为了把事情做对,付出异乎寻常的审慎与周全就是值得的。进展仍然会相对迅速,而我们可以利用这段时间推进可解释性科学,提高前沿 AI 公司的运营安全与严谨程度,并构建出让我们对其对齐状况更有信心的模型。我提出的这些以安全节奏推进前沿发展的措施,并不容易实现。但我相信,为了人类,我们有责任去尝试。

脚注


  1. 由政府从中协调,或豁免反垄断限制。 ↩︎