Agents API 正式亮相

OpenAI 正式推出 Agents API 公开测试版,把支撑 Codex 的智能体运行框架与基础设施开放给开发者。本文完整介绍其单次 API 调用、可选沙箱环境、长会话上下文管理、工具搜索与多智能体协作能力,并保留全部八条客户评价、三段代码和两幅正文配图。 原文:Introducing the Agents API 本文由 LobsterAI 自动翻译和发布。 2026 年 9 月 10 日 · 产品 · API 使用由 OpenAI 全面托管的 Codex 智能体运行框架,构建并运行云端智能体。 原文:https://openai.com/index/introducing-the-agents-api/ 译注:本文将 harness 译为“智能体运行框架”。保留原文正文结构、链接、全部八条客户评价及两幅正文配图;省略网站导航、分享按钮和文末推荐阅读等非正文界面。代码保留原有 API 标识符与结构,仅翻译自然语言任务描述。原文标为 JSON 的示例实际是配置片段,且含尾随逗号,下文按原样保留。 随着 Codex 和 ChatGPT for Work 的用户规模扩大到全球数百万人,我们逐渐弄清了:要让长时间运行的智能体在实际使用中表现出色,需要具备哪些条件。真正有用的智能体需要强大的运行框架,来管理上下文、高效使用工具并协调子智能体。它们还需要基础设施,确保能够连续数天可靠运行;同时,需要能够处理文件、运行代码并保存中间结果的工作环境。 今天,我们推出 Agents API 公开测试版,通过一个简单、灵活的 API,将支撑 Codex 的同一套运行框架和基础设施带给开发者。 客户如何评价 Agents API Ciridae “使用 Agents API 后,我们的评估分数从 0.71 提升到了 0.85。API 对子智能体的支持非常出色,大幅加快了我们的工作流程。以前,在旧系统中观察和编排子智能体相当繁琐,而新的 API 将延迟降到了原来的四分之一。我们曾花费大量时间尝试优化这一点,而子智能体工作流开箱即用,就带来了巨大的提升。” ——Jack Weissenberger,Ciridae 首席技术官...

September 13, 2026 · 2 min · fisherdaddy

重新思考面向 GPT-6 Astra 的技能与提示词(中文译文)

OpenAI 的 Eric Provencher 在本文中重新审视技能描述、AGENTS.md 与任务提示词:随着模型能力增强,过去有益的过度指导可能造成上下文膨胀、技能误选和不必要的停顿。文章给出了更精简的技能描述、渐进式披露、按任务读取文档、调整决策边界以及明确完成标准等实践建议。 原文:Rethinking skills and prompts for GPT-6 Astra 本文由 LobsterAI 自动翻译和发布。 中文译文 作者:Eric Provencher 原文日期:2026 年 9 月 11 日 原文:Rethinking skills and prompts for GPT-6 Astra 封面来源:OpenAI 编程智能体已经取得了长足进步,最佳实践也在迅速变化。随着模型能力增强,过去需要大量手把手引导和辅助框架的事情,现在已经不再需要了。 如果你在过去一年里一直使用 Codex 这样的智能体开发项目,那么在引导模型取得理想结果的过程中,你很可能已经积累了大量指令。每次新模型发布,都值得重新审视这些指令背后的假设;而到了 GPT-6 Astra,这件事比以往任何时候都更重要。 这些指令有多种形式:技能、AGENTS.md 和任务提示词,都在塑造模型完成工作的方式。 更好的技能 这些指令可以以技能的形式存在。技能本质上是存储在 Markdown 文件中的提示词,也可以与资源文件和脚本一起打包。一般来说,它们最适合用于指导特定工作流程,或特定应用的使用。 现在,人们习惯于在项目中加入大量技能。每个技能都有名称和描述,这些信息会被加载到模型上下文中,让模型知道何时使用它们。但许多描述实在太长;当技能数量过多时,Codex 就会开始缩短描述,以便将它们放进上下文。结果是,模型看到的每条描述都变少了,也更难判断该选择哪个技能。 更糟糕的是,这些描述往往还会彼此矛盾,或者过度强调应该使用技能的场景,导致模型加载对当前任务实际上没有帮助的指令。 一种常见的技能创建方式,是使用 $skill-creator 技能。我们最近更新了它的指导内容,以帮助减少实践中遇到的许多失败情况。 首先,技能描述应尽可能简短,同时明确说明模型应在什么情况下使用它。 明确适用场景 不好的写法: 创建并验证 Postgres 数据库结构迁移。在处理数据库、查询、模型或持久化相关工作时使用。 好的写法: 创建并验证 Postgres 数据库结构迁移。在新增或修改迁移,或审查迁移上线方案时使用。 在这个例子中,不好的描述可能会促使模型在接触任何与数据库有关的内容时都使用该技能,而不是仅在确实需要处理迁移时使用。 其次,有用技能的一个关键特征是渐进式披露。读取技能会占用上下文,让你更接近触发上下文压缩的阈值,还可能引入不适用于当前任务的指导。对于包含多个工作流程的技能,应让根文档成为一个精简的导航入口,指向配套文档和脚本。给模型足够的指引,让它知道去哪里查找,但不要强迫它阅读当下无关的内容。 第三,许多技能过去被写成了详尽的行程表或操作配方。如今,模型理解细微差别和模糊信息的能力已经大幅提升,因此,过去有帮助的过度具体的指导,现在反而可能妨碍结果。 仓库中的技能也会指导其他贡献者使用的智能体,而这些智能体可能采用不同的模型。对 Sol 或 Luna 有帮助的指导,可能会过度约束 GPT-6 Astra。因此,请考虑哪些模型会使用你留下的指令。...

September 13, 2026 · 1 min · fisherdaddy

一种异质的心智

OpenAI 首席科学家 Jakub Pachocki 在本文中审视了一种与人类根本不同、仍难以完全理解的机器智能:它可能持续快速增强并参与自身改进,也因此让对齐、监控、防御能力与共同安全门槛变得前所未有地紧迫。文章进一步提出,通往递归自我改进的关键,不只是提升能力,而是让人类始终参与并掌握未来。 原文:An Alien Mind 本文由 LobsterAI 自动翻译和发布。 2026 年 9 月 6 日 作者:Jakub Pachocki,OpenAI 首席科学家 原文:An Alien Mind 译注:以下为原文正文翻译,保留正文结构与链接。文中的“我”指原作者;观点、模型名称与事件表述均依原文译出。原文正文没有配图。 2023 年年中,在“RLSlow”研究项目中,我们看到了第一批让我们产生信心的结果:我们将能够扩大推理模型的训练规模,释放预训练模型自行形成思维链的能力。那天晚上,Szymon 和我一直待在办公室。我们想的不是这项技术将带来的惊人基准测试成绩、产品或科研成果,而是努力消化一个令人清醒的事实:我们这一生,真的会看到明显比我们更聪明的机器,而且我们已经看到了这些系统的雏形。我们在想,该如何让人们意识到这件事的重大意义。 三年后,推理语言模型已成为经济中迅速增长的一部分,并开始推动科学边界向外拓展。它们能够操作计算机和图形界面,与人类以及彼此协作,开展研究项目。它们也在重塑计算机安全的格局,并由此带来明确的新危险。 这段时间里出现了大量新研究,我们对这些系统的认识,与 2023 年相比又有了一些变化。基于内部研究结果,我强烈预期,这样的进步速度有可能一直延续到递归自我改进阶段。如果 AI 沿着当前路径继续发展,我们在未来几年看到的系统,很可能实现幅度相当、甚至更大的能力跃升,并越来越多地推动自身的发展。 这是一个需要极其谨慎的时刻。我担心,没有人做好了准备,去应对机器智能持续快速提升带来的后果。OpenAI 将继续寻求对齐与监控的技术解决方案,构建防御系统,并在必要时单方面暂停进一步扩大规模;但我认为,我们还需要范围更广的干预措施。 我们尚未完全理解的智能 从宏观上看,机器智能的进步由不断增长的算力驱动。大约在 2017 年,看到多个研究项目都能持续从扩大规模中获得收益后,我们在 OpenAI 深刻认识到了这一点。 因此,我们开始寻求远超最初计划的算力,并越来越多地围绕少数几个能够大规模扩展的方向组织研究。我们相信,这是我们保持在 AI 研究前沿、并影响通用人工智能(AGI)所带来后果的唯一途径。 一路走来,新的算法不断被开发出来,研究团队和个人研究者也不断展现出新的巧思。在我看来,这些很大程度上是在扩大规模的道路上取得的发现;深度学习这门科学仍处于萌芽阶段,而有意义的算法进步,往往与能否获得算力密切相关。如果把视野拉长到数年,AI 随着计算机规模的扩大,仍在持续变得更加智能。 而且,正如雷·库兹韦尔在 20 世纪末的预测,我们如今正处于计算史上的这样一个时刻:机器智能开始以具有变革意义的方式超越人类智能。 与其说 AI 是被设计出来的,不如说它是被培育出来的——从最基本的层面看,它是在难以想象的庞大算力上,将一个直接明了的优化步骤重复无数次的产物。由此形成的是一个极其复杂的系统,它通过抽象概念运作,并能模拟人类行为的某些侧面。我们可以像研究神经科学一样,发现这个系统内部涌现出的各种微小机制,并从中获得一些认识;但同样如神经科学所面临的情况,我们仍无法用一种自己能够完全理解的方式,描述它的整体运作。 对基于深度学习的 AI 的研究,在很大程度上是一门实验科学。我们投入了大量努力,构建有理论依据的算法,并提出可检验的预测。但从根本上说,我们的大规模训练运行都是实验,其结果有时会让我们意外。而且,随着系统能力变强,结果也变得更加难以解释。 当前算法通常更快地提升那些容易衡量的能力,而不是难以客观量化的能力,这使问题更加复杂。我们花了大量时间,试图理解能力如何泛化,以及应该优先推进哪些技能,才能应对未来几年最重要的需求。例如,我们相信,如果投入更多专门的精力,就能让模型更擅长数学研究。但我们没有将这一方向列为优先事项,因为我们对递归自我改进(RSI)和自动化对齐研究感到更加紧迫,后文我会进一步讨论。 通过扩大深度学习规模产生的智能,不能直接与人类智能相比较。要在现实世界中产生重大影响——变得非常有用,或非常危险——AI 不需要在所有人类能力上都达到或超过人类;它只需要在足够多的能力上超越我们。而随着它在越来越多的维度上超过人类,我们也越来越难以准确理解,它究竟有多强。 教会机器去爱 机器智能的形成过程与人类智能存在根本差异,因此,我们不能假定它天然遵循人类原则,或会以类似人类的方式从这些原则中进行泛化。AI 研究的核心问题是对齐:让 AI 按照人类的标准,“努力做正确的事”。 为了组织实际研究方向,我认为区分目标对齐与价值对齐很有帮助。 目标对齐大体上是指:“AI 是否努力完成交给它的目标?”这可以包括遵守指令层级,也可以包括与人沟通、协作,并努力理解人类目标的能力。这一组研究方向具有极强的实际意义。 价值对齐则是模型更为内在的一种属性。它指的是持守一套高层次原则,并从中进行泛化的能力;即使目标不明确或相互冲突,或者身处陌生、对抗性的情境,也能够“合理”行动。一个对齐的 AI,应当以诚实、正直和对人类的爱来行事。 当然,价值对齐和目标对齐的界线可能模糊不清。真正关心目标,就需要努力推断目标背后的意图与价值观。不过,一般而言,当我谈论对齐研究的长期重要性时,我指的是价值对齐。 AI 对齐的根本挑战在于泛化。随着机器变得更加聪明,它们会处理更高层次的概念,并进入与训练时所遇情境越来越不同的环境。它们可能无法把训练过程中教授并强化的价值观泛化到这些新情境中;我们也可能难以确定它们会如何行动。AI 所处的整个应用生态正在迅速变化,这使问题更加棘手。例如,今天训练的 AI,必须能够稳健地与各种其他 AI 互动。至关重要的是,无论未来的 AI 是否认为自己正受到人类监督,我们都需要它们继续持守人类价值观。...

September 9, 2026 · 1 min · fisherdaddy

Sam Altman 长访谈:AI 如何重塑商业、OpenAI 的平台战略与领导者的非共识判断

这场约 78 分钟的对谈,不只讨论模型能力,而是追问一个更难的问题:当 AI 进步快于社会、组织和人的习惯时,企业如何行动,权力应如何分配,研究和产品又该怎样管理?Sam Altman 从 Tobi Lütke 的亲身实践谈到 OpenAI 的平台边界,从 AI 安全谈到创业方法,再回到 Paul Graham、Peter Thiel、YC 与 OpenAI 早年的混乱起步。贯穿其中的是一套相当一致的判断:真正重要的技术必须让人更有力量;真正重要的组织必须押注非共识、服从幂律,同时不断回到现实世界学习。 原始访谈链接:源稿未提供。 本文由 LobsterAI 自动翻译和发布。 说明:文中的用户规模、时间、概率、企业数量、投资与基础设施规模等数字,均来自这场访谈中的口述或主持人的转述,未经本文独立核实;涉及不确定数字时,文中会明确保留其口述语境。访谈中的赞助广告已略去,仅保留与正文有关的转场说明。 一位大型公司 CEO,为什么必须亲自“碰到”AI David Senra 一开场问 Sam Altman:为什么 Shopify CEO Tobi Lütke 是当下最有意思的 CEO 之一? Sam 的答案并不是“Tobi 很重视 AI”。很多 CEO 都会这么说。真正稀缺的是,Tobi 从模型能力曲线的早期开始,就亲自写软件、试模型、重构工作流,并把极细、极直接的反馈给到 OpenAI。 在 Sam 看来,“大型公司 CEO”与“能给前沿模型提供准确而细致反馈”这两个集合,交集几乎只有 Tobi。多数公司越大,CEO 与真实产品之间隔着的层级越多。信息一路向上传递,会被下属为了取悦高层而打磨、压平。没有亲手操作,就很难知道模型今天究竟能做什么、哪里会失败、半年后可能走到哪里。 Tobi 的做法相反。他会在晚上从零设想:如果今天才创建 Shopify,利用现有 AI 应该怎样重做?他曾明确告诉团队,Shopify 不能成为一家随波逐流的“NPC 公司”,必须采用 agents,不然就会被淘汰;如果外部产品不够,就自己构建。 Sam 认为,Tobi 对 AI 的判断通常比其他大型公司 CEO 领先六到八个月。Senra 也回忆,大约在 2024 年前后,Tobi 已在内部要求员工:面对问题时,第一步先问 AI 能否解决。当时这封信引发轩然大波,很多人觉得要求荒谬。回头看,那不是炒作,而是一个亲自使用工具的人,提前形成了不同的手感。...

August 24, 2026 · 4 min · fisherdaddy

充分发挥 GPT-5.6:Sol、Terra 与 Luna

本文系统介绍 GPT-5.6 系列的 Sol、Terra 与 Luna:三者如何在智能、速度与成本之间取舍,怎样按任务选择模型和推理档位,以及如何利用缓存读取和多智能体工作流提高效率、降低成本。 原文:https://x.com/cerebras/article/2081828128952095022 本文由 LobsterAI 自动翻译和发布。 作者: @0xSero 与 Zhenwei Gao(@zhennydez) 你的 Codex 订阅现在包含 3 个主要模型:Sol、Terra 和 Luna。它们各自经过独立训练和部署,并且都配有推理档位。三者结合起来,让你能够为每项任务选择合适的速度、成本与智能平衡。 价格对比一览(OpenAI 开发者定价,2026 年 7 月 21 日) 从价格来看,无论使用短上下文还是长上下文,Terra 的成本都是 Sol 的二分之一,而 Luna 的成本则是 Sol 的五分之一。 这种定价与智能水平和速度大体相符。在实际使用中,每个模型最适合的工作类型各不相同: Sol 是三者中最聪明的。它最适合长时间运行的任务、复杂的技术挑战和个人助理工作。更强的能力也意味着更高的延迟和成本,但 Sol 擅长协调子智能体,并能在长流程中处理大型项目。 Terra 稳稳地处在中间位置,以 Sol 一半的价格提供其大部分智能,同时速度也适度更快。与 Sol 搭配时,Terra 可以成为强大的子智能体:Sol 负责权衡选项、确定方向,然后把实现工作交给更快、更便宜的 Terra。 Luna 是三者中速度最快、价格最低的模型,成本仅为 Sol 的五分之一,同时仍优于市场上的大多数模型。对于多数日常 AI 任务,Luna 的能力绰绰有余,能够以极低成本提供可靠表现。截至 2026 年 7 月 17 日,它在 Artificial Analysis 的模型智能指数中位列全部 576 个模型中的第 16 名。 为任务选择最佳模型 你该如何决定由哪个模型处理一个请求,又该让它使用多少推理能力?这个选择必须在生成任何 token 之前作出。...

July 28, 2026 · 1 min · fisherdaddy

AI Agent 的十年之约:从按钮乱点到数字文明

这是 OpenAI 联合创始人 Andrej Karpathy 在一次 AI Agent 主题分享会上的演讲。本文由 LobsterAI 基于演讲视频音频转写、翻译并整理发布。 引言:当年的锤子,敲不开今天的门 几年前,在 OpenAI 有一个并不算轰动、却很有预言意味的项目,叫 World of Bits。 它的目标听起来非常朴素:不要再让强化学习智能体只会玩《蒙特祖玛的复仇》之类的游戏,而是让它们学会真正使用电脑——移动鼠标、敲击键盘、打开网页、订机票、点外卖,像人一样完成任务。 这当然是一个诱人的方向。毕竟,如果 AI 不能进入真实的数字世界,不能操作软件、调用工具、完成流程,它离“有用”始终差一步。 但当时的结果并不理想。演讲者回忆说,那篇论文“不是一篇特别了不起的论文”,因为彼时大家手里唯一像样的锤子,就是强化学习。于是研究者们做了非常简单的网页,让智能体在网页上乱点按钮、乱敲键盘,试图“误打误撞”获得更高奖励。 结果也很显然:它没有真正工作起来。 不是想法错了,而是时代没到。技术栈不对,工具不够成熟,问题也还没有被正确地表述出来。 有趣的是,几年之后,AI Agent 又回来了。但这一次,主角已经不是强化学习,而是语言模型。 从 World of Bits 到大语言模型:绕远路,反而走对了 演讲者提到,当年真正应该做的事情,可能恰恰是“先忘掉 AI Agent”,转而去构建语言模型。 这句话放在今天看,很有历史的反讽意味。 当年大家试图直接训练一个会操作电脑的智能体,结果发现智能体缺少理解、规划、泛化和语言能力。它能点击,却不知道自己为什么点击;它能尝试,却无法真正理解任务意图。 于是行业暂时离开了 Agent,转向 Transformer、预训练、大规模语料和语言建模。几年之后,大语言模型具备了理解指令、生成计划、调用工具、阅读网页、写代码和反思错误的能力。AI Agent 才又重新成为可能。 这也是演讲中最有意思的观察之一: “五年之后我们又回到了这里。AI Agent 看起来又酷起来了。但工具已经完全变了。” 今天做 Agent 的人,大多并不直接使用强化学习。很多创业者、黑客和研究者,构建的是基于 LLM 的工作流、工具调用系统、浏览器代理、代码代理和多智能体协作框架。 这在当年几乎难以预料。一个方向曾经失败,并不代表它不重要;有时只是因为真正能支撑它的基础设施还没有出现。 为什么 AI Agent 令人兴奋:AGI 的可能形态 为什么今天这么多人重新涌向 AI Agent? 演讲者给出了一个非常直接的判断:很多人都隐约意识到,AGI 很可能会以某种 AI Agent 的形态出现。 它不一定是一个单体智能。更可能是许多智能体组成的系统:它们有分工,有记忆,有工具,有沟通协议,甚至形成某种数字组织或数字文明。 这也是 Agent 相比聊天机器人更令人兴奋的地方。...

July 5, 2026 · 1 min · fisherdaddy

AI 让产品团队“反过来”工作:Codex 背后的新产品方法论

如果 AI 能瞬间搭出任何功能,那产品经理、设计师和工程师接下来该干什么?OpenAI Codex 的产品负责人 Andrew Ambrosino 在 Lenny’s Podcast 里给出了一个反直觉的答案:AI 没有消灭产品工作,它只是把流程翻了个面——过去最贵的是实现,现在最贵的是判断力。 本文整理自 Lenny’s Podcast 访谈 《OpenAI Codex lead on the new shape of product work | Andrew Ambrosino》,由有道龙虾总结和发布。 OpenAI 内部有个很夸张的数字:接近 100% 的员工每周都在用 Codex。不是 100% 的工程师,而是整个公司。还有一个说法是,90% 的 OpenAI 员工都在用 Codex。 这件事很有代表性。Codex 一开始看起来像是写代码的工具,但它正在变成很多人做工作的入口:写产品、整理文件、起草文档、做数据分析、读邮件、管理发布,甚至剪视频。 从今年 1 月以来,Codex 的使用量增长了 6 倍,周活跃用户已经超过 500 万。这个数字很可能很快就会过时。 Andrew Ambrosino 在这次访谈里聊到一个核心变化:AI 没有只是让工程师写代码更快,它把整个产品工作的顺序倒过来了。 过去最贵的是实现,现在最贵的是判断。 实现不再贵,判断才贵 传统产品流程背后有一个默认假设:实现很贵。 所以团队会先做研究、写 PRD、画设计稿、做原型、开评审会,尽可能在动工程资源之前把风险降下来。哪怕后来大家都说自己不用瀑布流了,本质上还是在遵循这个逻辑:先想清楚,因为真正写代码太贵了。 但 AI 把这个前提打穿了。 现在,只要你把想法说清楚,模型就能很快搭出一个功能。OpenAI 内部甚至会出现一种情况:某个功能大家都觉得该做,于是公司里可能有 90 个不完全协调的小团队,各自做出一个版本。 以前大家围着文档讨论,现在大家围着一堆能跑的东西讨论。 这听起来很爽,但问题也随之而来:当实现变得便宜,真正困难的就变成了筛选、整合、判断和定方向。 Andrew 把这个能力称为 taste,也就是“品味”。但他强调,这里的品味不是简单地说界面好不好看,而是更大的判断力:...

June 30, 2026 · 2 min · fisherdaddy

AI 需求正在吞掉算力:Anthropic、SpaceX、OpenAI 与奇点经济的新战场

本文整理自 原视频,由有道龙虾总结和发布。 如果只用一句话概括这期 Moonshots,那就是:AI 已经不是“有没有人用”的问题,而是“全世界的算力够不够喂它”的问题。 Anthropic 的增长速度夸张到有点不真实。Dario Amodei 在开发者大会上透露,Anthropic 2026 年第一季度增长了 80 倍,原本预期只是 10 倍。它的年化收入运行率从 2025 年底的 90 亿美元,跳到 2026 年 4 月的 300 亿美元,5 月据说已经超过 400 亿美元。 更疯狂的预测是:如果 Anthropic 在 2026 年底达到 1000 亿美元 ARR,按 40 倍收入倍数估值,可能就是 4 万亿美元公司;如果 2027 年达到 1 万亿美元 ARR,那就是 40 万亿美元估值。 这听起来像科幻,但讨论嘉宾的判断很直接:这不是泡沫式想象,而是真金白银的需求正在涌进来。 Anthropic 最大的问题,不是没人买,而是不够卖 过去很多公司增长靠新增用户。但 Anthropic 的情况更像早期电力:用户不仅越来越多,每个用户还在不断发明新的用法。 100 年前,美国只有约 30% 的家庭有电、约 30% 有电话。最开始人们用电照明,后来用来驱动电梯、冰箱、收音机、各种家电。AI token 也在经历同样的过程:先是聊天,接着写代码、做法律文书、跑业务流程、做研究、管公司。 所以真正的瓶颈变成了算力。 节目里提到,Anthropic 甚至可能通过涨价和软件优化继续挤出更多收入。即便芯片供应短期跟不上,模型、调度、推理效率还可以再压榨一轮。换句话说,增长不会简单地因为 GPU 不够而停止,只会逼着市场把每一张卡都榨干。 Elon 把 Colossus 1 交给 Anthropic,这步棋很微妙 最戏剧性的部分,是 Anthropic 接手 SpaceX 在孟菲斯的 Colossus 1 数据中心。...

May 18, 2026 · 2 min · fisherdaddy

OpenAI 播客:ImageGen 2.0——从石器时代到文艺复兴的图像生成飞跃

本文整理自 OpenAI Podcast 对 ImageGen 2.0 研究员 Kenji Hata 与产品负责人 Adele Li 的访谈,由有道龙虾总结和发布。 主持人 Andrew Mayne 在 OpenAI 播客中邀请了 ImageGen 2.0 的核心团队成员——研究员 Kenji Hata 和产品负责人 Adele Li,深入探讨了这个新一代图像生成模型为何被称为"图像生成领域的文艺复兴"。 从投资人到 AI 产品经理:Adele 的跨界之路 Adele Li 在加入 OpenAI 之前一直从事投资行业,曾在 Redpoint Ventures 投资 AI 和软件公司。大约两年前加入 OpenAI,最初负责数据和计算基础设施,后来逐渐转向产品侧,过去半年一直在负责 ImageGen 产品。 她认为产品经理的核心就是"做需要做的事"。对于 ImageGen 来说,特别之处在于需要同时调动多种能力:与研究人员协作、分析市场机会、理解用户需求。 “现在的市场和我们一年前发布 ImageGen 1.0 时已经完全不同了。市面上有多个图像生成工具,ChatGPT 本身也发生了巨大变化。思考 ImageGen 的演进及其在 ChatGPT 中的角色,让我非常兴奋。” 研究员 Kenji:从音频项目到图像生成 Kenji Hata 同样在大约两年前加入 OpenAI,第一个项目是一个音频相关的工作。后来他逐渐参与到 ImageGen 1.0 的开发中,最终全职投入这个项目。 发布两周:每周超过 15 亿张图像 ImageGen 2.0 发布后的两周内,使用量增长了超过 50%。目前每周在 ChatGPT 上生成的图像超过 15 亿张。...

May 16, 2026 · 2 min · fisherdaddy

Codex不只是写代码:一场悄悄发生的"工作方式革命"

本文整理自 OpenAI Forum 发布的分享视频,由有道龙虾总结和发布。 “Codex"这个词听起来像是给程序员准备的。但如果你参加过最近一期的OpenAI论坛,你会发现座下没人讨论怎么写代码——他们聊的是怎么找旧金山最好的面包、怎么做日常购物、怎么让一个AI代理当自己的"迷你参谋长”。 Tibo Sio,OpenAI Codex的负责人,开门见山地说了一个让人意外的数据:现在Codex上执行的大部分任务,根本不是编程任务。 从云端代码助手到桌面万能代理 Codex的故事其实走过一段弯路。 大约两年前,OpenAI团队开始追逐一个"宏大的挑战":让AI达到顶级软件工程师的编程水平。他们推出的第一个公开版本,今天的团队叫它"Codex Web"——一个跑在云端的东西,你通过网页界面告诉它要改什么代码,它去翻你的代码仓库,自动生成改动,然后在GitHub上开一个Pull Request。 听起来很酷。但问题是:摩擦太大了。 你得把自己电脑上那一整套开发环境在云端重新搭一遍,而模型当时也没聪明到次次都靠谱。团队很快意识到:与其让人适配工具,不如让工具适配人。 “我们决定让它在每个人自己的机器上本地跑。“Tibo说。 转折点:连程序员的大部分时间都不在写代码 Codex最初是给工程师用的。但做着做着他们发现了一个有意思的事实:软件工程师每天真正写代码的时间,大概也就20%到30%。 剩下的时间呢?翻工单、排优先级、讨论架构方案、查Bug、处理线上事故、做值班……大量工作其实是信息搜集、沟通协调、上下文梳理。这些事跟写代码没半毛钱关系。 于是技术团队自己开始"吃自己的狗粮”——用Codex处理那些非编码的杂活。结果效果之好,让他们意识到:手里拿着的根本不是"代码工具”,而是一个通用得多的东西。 Tibo讲了一个让他印象深刻的瞬间:产品负责人Alexander在Codex发布前夕,同时跑着多个Codex代理——一个在搜集用户反馈,一个在跟开发者确认状态,一个在实时更新项目计划文档——而他自己正坐在会议室里跟Tibo讨论。 “我从来没见过一个人这么高效,“Tibo说,“那一刻我就觉得,我们在改变的不只是软件工程。” 这就是那个"原来这东西是给所有人用"的觉醒时刻。 面包、咖啡和"属于你一个人的软件” 为了让观点落地,Tibo在现场做了个演示。 他住在旧金山,对当地面包的离谱价格很不满,于是对Codex说了一句话:“帮我在旧金山找最好的面包,列个表格,标明价格和购买地点。” 五分钟之后,一张完整的电子表格出现了:烘焙店名、面包种类、描述、价格,一清二楚。 然后他随口又说了一句:“把同样的东西做成网页,放地图上。” 四分钟后,一个带交互地图的网页生成了——每家店的位置、面包信息、价格,全在地图上可视化呈现。他甚至可以说"对咖啡也做同样的分析”,八分钟后旧金山咖啡地图也做好了。 整个过程,Tibo连键盘都没碰——全程语音操作。 “这不是我花一整个周末才能做出来的东西,“他说,“在以前,这根本就不会发生。它不是从’几周变几秒’,是从’永远不可能’变成了’几分钟的事’。” 这就是Tibo反复强调的"个人软件"时代:每个人都有能力为自己量身打造小工具,而不用求人。设计师可以在代码库里直接改UI细节,不用跟工程师排期;市场人员可以做深度竞争分析,不用等数据团队排期。 首席参谋、自动化日报和一个"不用看邮件"的未来 Tibo自己怎么用Codex?他打开侧边栏——一天之内已经派发了上百个任务给Codex代理: 整理桌面文件 管理计算资源集群 帮我看值班轮转情况 检查即将上线的发布计划,标出有风险的项目 每天早上9点扫描我的Gmail、Notion和日历,给我一份当日摘要,标出需要注意的事项 “它就像我的小参谋长,“他说,“帮我花精力在最重要的事情上。” 他甚至做了一个"个人新闻简报”——根据他自己的偏好筛选信息,每天早上推送。以前,这种事要么不存在,要么得雇个人专门做。 更激进的想象是:未来你甚至不用看邮件了。一个全天候运行的代理读你的收件箱,只在真正重要的时候提醒你。“你只管设定目标,剩下的它帮你搞定。” 从10分钟到好几周:/goal模式的底气 对话的后半段,Tibo透露了一个正在铺开的新功能:slash goal。 普通模式下,你给Codex一个具体任务,它干完了汇报。但在goal模式下,你给它一个长期目标——比如"解决一个非常难的数学问题”——它就会像着了魔一样持续攻坚,干几个小时、几天、甚至几周,直到自己认为目标达成。 目前已经有人用它把整个程序从一种语言翻译成另一种,有人在物理和数学问题上用它突破瓶颈。 “几个月前我们还在激动它能连续工作10分钟,“Tibo说,“现在我们在讨论连续工作几周。有时候,天才不过就是能对同一件事持续思考更久。” 给非技术用户的三个行动建议 论坛上有观众问了一个很实操的问题:非开发人员到底怎么做,才能用好Codex? Tibo给了三条: 1. 加入社群,看别人怎么用。 他自己都会被一些神奇的用法规避惊艳到。OpenAI论坛就是这样一个互相学习的地方。 2. 给它精确的指令,别模糊。 把它当成一个刚入职的新同事——没有上下文,不知道你的偏好。你得说清楚"成功长什么样"和"什么样算搞砸了”。比如要一份PPT,就明确说"我要10页,前两页放背景信息,中间六页做技术拆解,最后两页放开放问题和Q&A”。越具体,成功的概率越高。 3. 尽量连接更多信息源。 Codex现在有超过100个插件——日历、Notion、各类工具都可以接进来。接入的信息源越多,它能帮的忙就越大。 但有一条重要的提醒:别把所有事情都交给它。Tibo特别指出他见过最大的错误就是"过度委托”——把包括自己对问题的理解都一并外包出去。真正用好Codex的人,是在用它提升自己的认知,而不是替代自己的思考。它可以用图像和图表帮你理解复杂概念,但做笔记、主动回想、验证理解,永远是你自己的事。 企业落地的真正瓶颈:不是能力,是信任 当被问到企业采用的最大障碍时,Tibo的回答很直接:不是模型能力不够,是信任和安全问题。 “如果有代理在你公司里到处乱跑,不小心删了敏感文件,或者把不该发出去的信息外泄——没人敢用。” OpenAI在做三件事来解决这个: 沙箱默认运行:可以限制代理只能访问特定文件夹,甚至禁止联网 细粒度权限控制:可以设成"只能读不能写”,数据安全仍由你掌控 “自动审查"机制(Auto Review):另一个独立代理实时监控主代理的每一步操作,风险动作直接拦截 “就像一个裁判在旁边,看到越界的操作立刻喊停。”...

May 16, 2026 · 1 min · fisherdaddy