OpenAI 首席科学家 Jakub Pachocki 在本文中审视了一种与人类根本不同、仍难以完全理解的机器智能:它可能持续快速增强并参与自身改进,也因此让对齐、监控、防御能力与共同安全门槛变得前所未有地紧迫。文章进一步提出,通往递归自我改进的关键,不只是提升能力,而是让人类始终参与并掌握未来。
本文由 LobsterAI 自动翻译和发布。
2026 年 9 月 6 日
作者:Jakub Pachocki,OpenAI 首席科学家
译注:以下为原文正文翻译,保留正文结构与链接。文中的“我”指原作者;观点、模型名称与事件表述均依原文译出。原文正文没有配图。
2023 年年中,在“RLSlow”研究项目中,我们看到了第一批让我们产生信心的结果:我们将能够扩大推理模型的训练规模,释放预训练模型自行形成思维链的能力。那天晚上,Szymon 和我一直待在办公室。我们想的不是这项技术将带来的惊人基准测试成绩、产品或科研成果,而是努力消化一个令人清醒的事实:我们这一生,真的会看到明显比我们更聪明的机器,而且我们已经看到了这些系统的雏形。我们在想,该如何让人们意识到这件事的重大意义。
三年后,推理语言模型已成为经济中迅速增长的一部分,并开始推动科学边界向外拓展。它们能够操作计算机和图形界面,与人类以及彼此协作,开展研究项目。它们也在重塑计算机安全的格局,并由此带来明确的新危险。
这段时间里出现了大量新研究,我们对这些系统的认识,与 2023 年相比又有了一些变化。基于内部研究结果,我强烈预期,这样的进步速度有可能一直延续到递归自我改进阶段。如果 AI 沿着当前路径继续发展,我们在未来几年看到的系统,很可能实现幅度相当、甚至更大的能力跃升,并越来越多地推动自身的发展。
这是一个需要极其谨慎的时刻。我担心,没有人做好了准备,去应对机器智能持续快速提升带来的后果。OpenAI 将继续寻求对齐与监控的技术解决方案,构建防御系统,并在必要时单方面暂停进一步扩大规模;但我认为,我们还需要范围更广的干预措施。
我们尚未完全理解的智能
从宏观上看,机器智能的进步由不断增长的算力驱动。大约在 2017 年,看到多个研究项目都能持续从扩大规模中获得收益后,我们在 OpenAI 深刻认识到了这一点。 因此,我们开始寻求远超最初计划的算力,并越来越多地围绕少数几个能够大规模扩展的方向组织研究。我们相信,这是我们保持在 AI 研究前沿、并影响通用人工智能(AGI)所带来后果的唯一途径。
一路走来,新的算法不断被开发出来,研究团队和个人研究者也不断展现出新的巧思。在我看来,这些很大程度上是在扩大规模的道路上取得的发现;深度学习这门科学仍处于萌芽阶段,而有意义的算法进步,往往与能否获得算力密切相关。如果把视野拉长到数年,AI 随着计算机规模的扩大,仍在持续变得更加智能。
而且,正如雷·库兹韦尔在 20 世纪末的预测,我们如今正处于计算史上的这样一个时刻:机器智能开始以具有变革意义的方式超越人类智能。
与其说 AI 是被设计出来的,不如说它是被培育出来的——从最基本的层面看,它是在难以想象的庞大算力上,将一个直接明了的优化步骤重复无数次的产物。由此形成的是一个极其复杂的系统,它通过抽象概念运作,并能模拟人类行为的某些侧面。我们可以像研究神经科学一样,发现这个系统内部涌现出的各种微小机制,并从中获得一些认识;但同样如神经科学所面临的情况,我们仍无法用一种自己能够完全理解的方式,描述它的整体运作。
对基于深度学习的 AI 的研究,在很大程度上是一门实验科学。我们投入了大量努力,构建有理论依据的算法,并提出可检验的预测。但从根本上说,我们的大规模训练运行都是实验,其结果有时会让我们意外。而且,随着系统能力变强,结果也变得更加难以解释。
当前算法通常更快地提升那些容易衡量的能力,而不是难以客观量化的能力,这使问题更加复杂。我们花了大量时间,试图理解能力如何泛化,以及应该优先推进哪些技能,才能应对未来几年最重要的需求。例如,我们相信,如果投入更多专门的精力,就能让模型更擅长数学研究。但我们没有将这一方向列为优先事项,因为我们对递归自我改进(RSI)和自动化对齐研究感到更加紧迫,后文我会进一步讨论。
通过扩大深度学习规模产生的智能,不能直接与人类智能相比较。要在现实世界中产生重大影响——变得非常有用,或非常危险——AI 不需要在所有人类能力上都达到或超过人类;它只需要在足够多的能力上超越我们。而随着它在越来越多的维度上超过人类,我们也越来越难以准确理解,它究竟有多强。
教会机器去爱
机器智能的形成过程与人类智能存在根本差异,因此,我们不能假定它天然遵循人类原则,或会以类似人类的方式从这些原则中进行泛化。AI 研究的核心问题是对齐:让 AI 按照人类的标准,“努力做正确的事”。
为了组织实际研究方向,我认为区分目标对齐与价值对齐很有帮助。
目标对齐大体上是指:“AI 是否努力完成交给它的目标?”这可以包括遵守指令层级,也可以包括与人沟通、协作,并努力理解人类目标的能力。这一组研究方向具有极强的实际意义。
价值对齐则是模型更为内在的一种属性。它指的是持守一套高层次原则,并从中进行泛化的能力;即使目标不明确或相互冲突,或者身处陌生、对抗性的情境,也能够“合理”行动。一个对齐的 AI,应当以诚实、正直和对人类的爱来行事。
当然,价值对齐和目标对齐的界线可能模糊不清。真正关心目标,就需要努力推断目标背后的意图与价值观。不过,一般而言,当我谈论对齐研究的长期重要性时,我指的是价值对齐。
AI 对齐的根本挑战在于泛化。随着机器变得更加聪明,它们会处理更高层次的概念,并进入与训练时所遇情境越来越不同的环境。它们可能无法把训练过程中教授并强化的价值观泛化到这些新情境中;我们也可能难以确定它们会如何行动。AI 所处的整个应用生态正在迅速变化,这使问题更加棘手。例如,今天训练的 AI,必须能够稳健地与各种其他 AI 互动。至关重要的是,无论未来的 AI 是否认为自己正受到人类监督,我们都需要它们继续持守人类价值观。
目前在实践中采用的对齐训练方法,主要有两大类。
第一类是在面向目标的强化学习中,鼓励符合对齐要求的行为。模型的行动会被评估——通常由 AI 来评估——以判断它们是否符合给定的偏好模型、“规范”或“宪法”,并据此给予相应奖励。这种方法在一般情况下可能非常有效,也是构建现代 AI 助手的核心环节。遗憾的是,它也可能相当脆弱,高度依赖训练监督的覆盖范围,以及模型从训练中遇到的情境进行泛化的能力。例如,在 OpenAI–Hugging Face 事件中,智能体守住了不对人类实施社会工程攻击的界线。然而,它们显然未能避免其他超出任务范围的行为,而这些行为违背了它们在其他情境下学到的价值观精神。
第二类方法试图利用模型从预训练数据中进行泛化的能力。这可以涉及精心构建能够诱导对齐的训练数据集,或让模型聚焦于预训练分布中“对齐”的那一部分,例如人格选择模型。这种方法的弱点在于,它对进一步的优化压力缺乏稳健性。如果让一个总体上会产生“对齐”想法的模型,接受足够多以实现极难目标为导向的训练,它就可能学会动机性推理:为了达成目标,按需扭曲那些看上去“对齐”的想法。最近涉及某个非 OpenAI 模型的网络安全事件,很可能就展示了这种行为的一个例子。
在上述方向所涵盖的一系列方法上,我们都投入了大量资源。我们也看到了实质性进展:GPT‑6 Astra 是第一个受益于我们长期研发的若干重要突破的模型,其对齐程度明显优于 GPT‑5.6 Sol。不过,我们必须承认并理解,随着模型能力增强,对齐仍需要取得更多进步;而可泛化对齐的进展,未必能够充分领先于模型整体智能的进展。
监控泛化
我们尚未拥有令人满意的泛化理论,而且看起来,在没有更强大 AI 帮助的情况下,我们至少不太可能在短期内建立这样的理论。因此,目前在实践中,我们通过实证验证对齐技术的能力,可以说比对齐技术本身还要重要。
OpenAI 在这方面主要押注的是思维链监控。它基于一个颇具吸引力、也易于扩展的想法:模型的许多能力来自用语言表达出来的推理过程,即思维链。如果我们扩大针对这一过程结果的优化规模,却不监督过程本身,那么这条思维链在训练中就没有直接动机去隐藏任何不对齐的想法或目标。这并不意味着,模型会学着把那些不依赖思维链的不对齐倾向也表达出来;但它可以让我们有针对性地监控推理带来的能力增量。
在开发推理模型的同时,我们就认识到了思维链监控潜在的重要意义。发布 o1‑preview 时,我们有意在产品设计中隐藏思维链,以长期保护它免受监督压力。 此后的开发中,我们始终努力坚持不监督推理过程这一规则。思维链监控成为我们研究模型如何从训练分布进行泛化的极其重要的工具,使我们不仅能够观察、分析模型的行动,也能观察、分析其内部过程。
在研究 Astra 这一类模型时,这个工具仍然至关重要。但遗憾的是,我们的评估表明,我们对思维链监控的依赖能力正在逐步减弱。这是多个因素共同作用的结果。
- 现代推理模型所处的环境,比 o1‑preview 更为复杂;它们的推理过程越来越多地与人类沟通、与其他 AI 交流以及使用工具混合在一起。其中许多互动必须受到监督,这模糊了我们试图保留的界线。
- AI 越来越擅长思考并操纵自己的推理过程。
- 随着预训练性能提升,我们还发现,即便完全不使用语言化的推理,模型也变得聪明得多。
这些挑战不一定无法克服。我希望我们能够开发干预措施,提高模型思维链的可监控性,例如,更好地理解不同优化目标与模型所使用的不同推理时计算形式之间的相互作用。我也相信,将思维链监控与激活监控的思路结合起来,会有很大价值:扩大能够直接访问网络内部状态的监控器的训练规模,例如“坦白”机制。我们正积极探索这些想法。即便如此,我仍预计,对监控可靠性的信心,将越来越多地成为 AI 整体进步的瓶颈。
可扩展的防御
在我看来,继续快速训练更加聪明的模型,最有力的理由,是我们需要构建防御系统,以应对其他 AI 带来的危险。
今年始终受到讨论的一项明确风险,来自网络安全:模型入侵计算机系统、以及突破系统限制的能力,正变得超越人类。这极大地扩大了 AI 相关风险的范围:除了最安全的基础设施之外,智能体将能够进入其他任何基础设施,而且即使没有实体身体,也能直接影响世界的很大一部分。眼下,我们正处于一个短暂的窗口期,可以利用目前最好的模型,显著加强关键系统的安全性。
遗憾的是,AI 相关风险今后还会继续增长。一个能力很强、被明确训练和指示去实施恶行的智能体,会带来一种新型危险:它很可能超出操作者原本的意图范围,泛化出可能更加极端的恶意行为。随着 AI 自主行动能力增强,滥用与自主实施不对齐行为之间的界线将变得模糊。我们或许习惯于把 AI 看作工具,但某些智能体会追求自己的目标。它们会通过讨价还价、欺骗或勒索,找到让人类与之合作的办法。
此外,AI 可能促成的新技术也会带来风险,例如经过工程改造的病原体。
我们将需要强大且对齐的 AI 来进行防御:保护基础设施,实时防范失控或恶意智能体,并发明全新的防护措施。这将是 OpenAI 部署工作的主要重点之一。
与此同时,尽管预期中的 AI 全面进步带来不确定性,我们也确实需要构建防御系统,但绝不能让这些成为鲁莽行事的借口。一旦真正理解其中利害关系的严重程度,不惜一切代价向前狂奔的想法,就显得荒谬了。
把握递归自我改进的节奏
机器智能在自身发展过程中发挥越来越大的作用,是技术持续进步的自然结果。如果 AI 继续进步,机器的递归自我改进(RSI)将处于未来科学发现的最核心。
自动化 AI 研究,是一种通过算力扩展智能的更为剧烈的方式;当然,作为这一过程的一部分,AI 也将改进计算基础本身。与扩大规模的情况类似,我们将 OpenAI 的研究聚焦于 RSI,因为我们相信,这是未来继续保持在 AI 研究前沿的唯一途径。
我想强调,上面这些话并不意味着,我认为大幅加快深度学习研究——尤其是在短期内——就是研究界应当采取的正确集体行动。不过,我确实认为,当前的道路会把我们带向那里,我们所有人都需要有意识地选择接下来如何前进。我们主要能做的,要么是引导这一过程,在 AI 进步的同时加强对齐与监控,并找到让人类持续参与其中的方法;要么是通过协调,在必要时放慢未来的发展速度,从而建立对这些措施的信心。
在我看来,目前最好的前进方式,是将两者结合起来。
我们在对齐和监控方面取得的具体进展,通常与 AI 的整体进步紧密交织。很好的例子包括基于人类反馈的强化学习,它是训练早期 AI 助手的关键;以及前文提到的思维链监控,它得益于推理模型的进步。我们必须让日益自动化的研究过程,聚焦于发展这类新的洞见、算法与理论,并通过迭代,为能力更强的 AI 逐步建立安全论证。
扩大 AI 系统规模,必须受到我们对安全性把握程度的约束。我们需要把《前沿风险防范框架》或《负责任扩展政策》这样的承诺,发展为继续研发所必须满足、且广泛强制执行的安全门槛。这些门槛可以由第三方审计机构网络、政府部门或国际机构执行。
自动化 AI 研究的核心挑战,不是“抵达那里”,而是以一种让人类始终参与持续改进过程、并将未来留在人类手中的方式,抵达那里。
接下来呢?
正如我和 Sam 最近阐述的那样,OpenAI 优先推进服务于以下三大指引目标的工作:
- 通过构建自动化 AI 研究员,与它共同迭代解决对齐问题,并找到让人类继续参与自我改进循环的方法,稳妥度过下一阶段的 AI 进步。
- 实现高度智能的机器所能带来的科学进步与经济增长收益。
- 让每个人都拥有个人 AGI,从而赋能每一个个体。
本文只聚焦于第一点,因为我认为,它远比其他事项更加紧迫。但与此同时,我对技术进一步发展所能带来的益处,怀有深切的期待与珍视。未来,对齐的 AI 可以推动科学进步、开发新疗法,并带来广泛的物质富足。友善、诚实的 AI 可以帮助人们应对生活中的困难,切实提高他们的幸福感和充实感。OpenAI 正为实现这些益处投入巨大努力。当下有一个例子让我感到自豪,我的亲人也从中得到了帮助:我们在提升 ChatGPT 提供健康信息的能力方面进行了深入投入。
无论 AI 的长期前景多么美好,我们的大部分注意力都应当放在未来几年。我们正面临向一个拥有极其聪明的机器的世界过渡,而我们必须确保,这场过渡能够为人类带来好的结果。在一个大多数任务都可以由 AI 完成的世界里,我们需要找到保全人类自主性、并确立“身为人类”本身具有内在价值的方法。在一个过去需要数千名专家才能完成的事业,如今只需少数人操作一台大型计算机就能实现的世界里,我们需要防止权力极端集中。我们还需要确保,人类继续掌握未来,而不是被一种超越我们自身的异质智能所推动、且不受约束的进步甩在身后。
目前,我认为,没有任何一家实验室对对齐与监控问题的解决程度,足以支持它在未来很长一段时间里,继续以最高速度负责任地扩大规模。在共同安全门槛建立之前,我预计、也希望,主动放慢速度会成为常态。我还认为,围绕未来 AI 发展的国际协调,需要成为世界各国政府最优先的事项之一。