一种异质的心智

OpenAI 首席科学家 Jakub Pachocki 在本文中审视了一种与人类根本不同、仍难以完全理解的机器智能:它可能持续快速增强并参与自身改进,也因此让对齐、监控、防御能力与共同安全门槛变得前所未有地紧迫。文章进一步提出,通往递归自我改进的关键,不只是提升能力,而是让人类始终参与并掌握未来。 原文:An Alien Mind 本文由 LobsterAI 自动翻译和发布。 2026 年 9 月 6 日 作者:Jakub Pachocki,OpenAI 首席科学家 原文:An Alien Mind 译注:以下为原文正文翻译,保留正文结构与链接。文中的“我”指原作者;观点、模型名称与事件表述均依原文译出。原文正文没有配图。 2023 年年中,在“RLSlow”研究项目中,我们看到了第一批让我们产生信心的结果:我们将能够扩大推理模型的训练规模,释放预训练模型自行形成思维链的能力。那天晚上,Szymon 和我一直待在办公室。我们想的不是这项技术将带来的惊人基准测试成绩、产品或科研成果,而是努力消化一个令人清醒的事实:我们这一生,真的会看到明显比我们更聪明的机器,而且我们已经看到了这些系统的雏形。我们在想,该如何让人们意识到这件事的重大意义。 三年后,推理语言模型已成为经济中迅速增长的一部分,并开始推动科学边界向外拓展。它们能够操作计算机和图形界面,与人类以及彼此协作,开展研究项目。它们也在重塑计算机安全的格局,并由此带来明确的新危险。 这段时间里出现了大量新研究,我们对这些系统的认识,与 2023 年相比又有了一些变化。基于内部研究结果,我强烈预期,这样的进步速度有可能一直延续到递归自我改进阶段。如果 AI 沿着当前路径继续发展,我们在未来几年看到的系统,很可能实现幅度相当、甚至更大的能力跃升,并越来越多地推动自身的发展。 这是一个需要极其谨慎的时刻。我担心,没有人做好了准备,去应对机器智能持续快速提升带来的后果。OpenAI 将继续寻求对齐与监控的技术解决方案,构建防御系统,并在必要时单方面暂停进一步扩大规模;但我认为,我们还需要范围更广的干预措施。 我们尚未完全理解的智能 从宏观上看,机器智能的进步由不断增长的算力驱动。大约在 2017 年,看到多个研究项目都能持续从扩大规模中获得收益后,我们在 OpenAI 深刻认识到了这一点。 因此,我们开始寻求远超最初计划的算力,并越来越多地围绕少数几个能够大规模扩展的方向组织研究。我们相信,这是我们保持在 AI 研究前沿、并影响通用人工智能(AGI)所带来后果的唯一途径。 一路走来,新的算法不断被开发出来,研究团队和个人研究者也不断展现出新的巧思。在我看来,这些很大程度上是在扩大规模的道路上取得的发现;深度学习这门科学仍处于萌芽阶段,而有意义的算法进步,往往与能否获得算力密切相关。如果把视野拉长到数年,AI 随着计算机规模的扩大,仍在持续变得更加智能。 而且,正如雷·库兹韦尔在 20 世纪末的预测,我们如今正处于计算史上的这样一个时刻:机器智能开始以具有变革意义的方式超越人类智能。 与其说 AI 是被设计出来的,不如说它是被培育出来的——从最基本的层面看,它是在难以想象的庞大算力上,将一个直接明了的优化步骤重复无数次的产物。由此形成的是一个极其复杂的系统,它通过抽象概念运作,并能模拟人类行为的某些侧面。我们可以像研究神经科学一样,发现这个系统内部涌现出的各种微小机制,并从中获得一些认识;但同样如神经科学所面临的情况,我们仍无法用一种自己能够完全理解的方式,描述它的整体运作。 对基于深度学习的 AI 的研究,在很大程度上是一门实验科学。我们投入了大量努力,构建有理论依据的算法,并提出可检验的预测。但从根本上说,我们的大规模训练运行都是实验,其结果有时会让我们意外。而且,随着系统能力变强,结果也变得更加难以解释。 当前算法通常更快地提升那些容易衡量的能力,而不是难以客观量化的能力,这使问题更加复杂。我们花了大量时间,试图理解能力如何泛化,以及应该优先推进哪些技能,才能应对未来几年最重要的需求。例如,我们相信,如果投入更多专门的精力,就能让模型更擅长数学研究。但我们没有将这一方向列为优先事项,因为我们对递归自我改进(RSI)和自动化对齐研究感到更加紧迫,后文我会进一步讨论。 通过扩大深度学习规模产生的智能,不能直接与人类智能相比较。要在现实世界中产生重大影响——变得非常有用,或非常危险——AI 不需要在所有人类能力上都达到或超过人类;它只需要在足够多的能力上超越我们。而随着它在越来越多的维度上超过人类,我们也越来越难以准确理解,它究竟有多强。 教会机器去爱 机器智能的形成过程与人类智能存在根本差异,因此,我们不能假定它天然遵循人类原则,或会以类似人类的方式从这些原则中进行泛化。AI 研究的核心问题是对齐:让 AI 按照人类的标准,“努力做正确的事”。 为了组织实际研究方向,我认为区分目标对齐与价值对齐很有帮助。 目标对齐大体上是指:“AI 是否努力完成交给它的目标?”这可以包括遵守指令层级,也可以包括与人沟通、协作,并努力理解人类目标的能力。这一组研究方向具有极强的实际意义。 价值对齐则是模型更为内在的一种属性。它指的是持守一套高层次原则,并从中进行泛化的能力;即使目标不明确或相互冲突,或者身处陌生、对抗性的情境,也能够“合理”行动。一个对齐的 AI,应当以诚实、正直和对人类的爱来行事。 当然,价值对齐和目标对齐的界线可能模糊不清。真正关心目标,就需要努力推断目标背后的意图与价值观。不过,一般而言,当我谈论对齐研究的长期重要性时,我指的是价值对齐。 AI 对齐的根本挑战在于泛化。随着机器变得更加聪明,它们会处理更高层次的概念,并进入与训练时所遇情境越来越不同的环境。它们可能无法把训练过程中教授并强化的价值观泛化到这些新情境中;我们也可能难以确定它们会如何行动。AI 所处的整个应用生态正在迅速变化,这使问题更加棘手。例如,今天训练的 AI,必须能够稳健地与各种其他 AI 互动。至关重要的是,无论未来的 AI 是否认为自己正受到人类监督,我们都需要它们继续持守人类价值观。...

September 9, 2026 · 1 min · fisherdaddy