OpenAI 研究员谈数学与 AGI:从算不清露营账单,到奥赛金牌和研究级证明

本文整理自 YouTube 视频《How Math Unlocked AGI》,由有道龙虾总结和发布。 几年前,如果你让 ChatGPT 算一笔稍微复杂一点的露营 AA 账,或者帮三个不同时区的人找一个合适的 Zoom 会议时间,它大概率会翻车。 今天,OpenAI 的研究员已经在讨论另一个问题:模型能不能帮助 Fields Medalists 做日常研究?能不能解决 42 年没人解决的开放问题?能不能把数学家几个月甚至几年才能完成的思考,压缩成几天、几小时,甚至未来更长时间的自动研究? 在 OpenAI Podcast 里,主持人 Andrew Mayne 和两位研究员 Sebastian Bubeck、Ernest Ryu 聊了一场关于数学、科学和 AGI 的对话。Sebastian 曾在 Princeton 任教,长期研究优化和机器学习理论,后来加入 Microsoft,现在是 OpenAI 研究员。Ernest Ryu 也是应用数学家,曾在 UCLA 数学系任教授,研究优化和机器学习理论,最近加入 OpenAI。 这场对话最有意思的地方,不是简单说“AI 数学变强了”,而是把这件事放进了一个更大的框架里:数学为什么是衡量推理能力的最佳训练场?为什么模型会从几分钟推理走向几天、几周甚至几个月推理?为什么这条路和 AGI 密切相关?以及,为什么 AI 越强,越需要真正懂数学、懂科学的人类专家? 两年前还没有真正的推理模型,现在已经能帮数学家工作 Sebastian 对过去几年的变化用了一个很重的词:miraculous,近乎奇迹。 他提醒大家,两年前我们甚至还没有今天意义上的 reasoning model,更不用说证明困难数学定理。可现在,模型已经可以帮助 Fields Medalists 处理日常数学工作。 Ernest 说,这种进步连他们自己都被震到了。 一年前半,他参加过一个数学会议的 workshop。当时有一场辩论,主题是:只靠扩展 LLM,能不能帮助解决重大开放问题?现场一开始大约 80% 的数学家认为“不可能”。辩论结束后,比例变成大概 50-50,看起来已经是很大进展。 但回头看,这个争论本身都低估了速度。仅仅八个月后,模型就开始触及研究级数学。 这也是今天很多人还没完全反应过来的地方。我们对 AI 的印象更新得太慢了。很多人还记得早期 ChatGPT 算错小学题、搞错单位换算、不会安排时区会议,于是默认“语言模型不擅长数学”。但模型能力曲线并没有停在那里。...

May 5, 2026 · 3 min · fisherdaddy

Greg Brockman:AI 时代,创业公司该怎么活下来,又该怎么赢?

本文整理自 Sequoia Capital 对 OpenAI 联合创始人兼总裁 Greg Brockman 的一场访谈,原视频标题为《Greg Brockman: Inside the Race for Compute, Codex, and AGI》。以下内容由有道龙虾总结和发布。 如果你想理解 OpenAI 现在到底在押注什么,Greg Brockman 这场访谈很值得看。 他不是只讲“AI 会改变世界”这种大话,而是把 OpenAI 的生意、技术路线、组织变化、创业公司的机会和风险,都摊开讲了一遍。 最直白的一句话是: OpenAI 的业务在某种意义上很简单:买算力、租算力、建算力,然后以一定利润卖出去。 听起来像云厂商,但背后卖的不是普通计算资源,而是越来越便宜、越来越强的“智能”。 OpenAI 最缺的东西,还是算力 主持人一开场就提到 Greg 的经历:他是 Stripe 第四号员工,后来成为第一任 CTO;如今是 OpenAI 联合创始人兼总裁。Stripe 处理的支付规模据说已经达到全球 GDP 的 1.6%,而 OpenAI 的周活用户也接近甚至超过 10 亿。 但 Greg 对这些成绩的回应很克制。他更关心的是一件事:算力够不够。 答案是:不够,远远不够。 他回忆 ChatGPT 刚发布时,团队问他应该买多少算力,他的回答是“全部”。团队以为他在开玩笑,又问了一遍,他还是说:全部。 原因很简单: 无论我们用多快的速度增加算力,都追不上需求。 OpenAI 对算力的渴求,不只是为了训练更大的模型,也是为了服务海量用户和越来越复杂的智能体任务。Greg 的判断是,人类对“解决问题”的需求,对“智能”的需求,几乎是无限的。只要边际利润为正,就应该继续扩大规模。 这也是为什么他会把 OpenAI 的商业模式讲得像一门朴素生意:采购、建设、租用计算资源,再把它转化成可用的智能服务卖出去。 Scaling Laws 还没撞墙 谈到模型能力增长,Greg 用了一个很有意思的说法:Scaling Laws 是一个“深刻而美丽的谜”。...

May 4, 2026 · 2 min · fisherdaddy

那个在 OpenAI “卖铲子”的中国年轻人:从清华开源大神到 GPT 背后的核心推手

本文整理自 OpenAI Infa 核心贡献者翁家翌的专访。以下为原视频精华,本文由我和 Gemini 3 Pro 共同整理而成。 开始之前先介绍一下翁家翌,他在 2022 年加入 OpenAI,并且是 OpenAI 一系列核心模型背后的核心贡献者之一——从 GPT-3.5、GPT-4、再到 GPT-5,而他最主要的贡献,三个词:强化学习、post-training、infra。这个访谈里,涉及到翁家翌的童年经历、他在清华与 CMU 的求学与成长,以及他在 2022 年加入 OpenAI 后的亲历等等。如果你对 OpenAI 或者 OpenAI 的研究者感兴趣,这个访谈值得一看。 如果你仔细翻看 OpenAI 近年来每一篇重磅论文——从 GPT-3.5 到 GPT-4,再到最新的 GPT-4o,你会发现一个名字像那枚不可或缺的螺丝钉一样,稳定地出现在贡献者名单里:翁家翌(Jiayi Weng)。 他是 OpenAI 强化学习(RL)团队的核心成员,但他并不把自己定义为那种在大模型里“炼丹”的科学家。相反,他更愿意做一个“卖铲子”的人。在硅谷这场被誉为人类历史上最激烈的科技军备竞赛中,他亲手搭建了 OpenAI 内部最核心的 Post-training(后训练)基础设施。 这个从清华园走出的年轻人,是如何一步步走到风暴中心的?这一路并非全是光环,更有不少“误打误撞”的宿命感。 “童子功”:为了投资未来而卷 翁家翌的“开挂”人生似乎拿的是标准剧本,但内核却有点不一样。 小学一年级开始搞奥数,因为他发现自己做题不需要过脑子,那是纯粹的生理上的快感。初二自学高中数学,初三啃微积分。但他并不是因为那是“任务”,而是因为他在初中就产生了一个极其早熟的想法:学习是一种对未来的投资。 与其在简单的刷题上浪费生命,不如提前掌握工具,构建自己的知识树。 到了高中,这种“投资”转向了编程。然而,这一路并非坦途。作为福建省队的选手,他在信息学竞赛(OI)中拿了全省倒数第一(铜牌),这对他是个巨大的打击。在那个充满不确定性的高二,他面临着艰难抉择:是签一个保底的上海交大,还是赌一把清华的降分录取? 他在巨大的恐惧中咬牙选了后者。最终,他赌赢了,走进了清华计算机系。 清华岁月:打破信息差的“慈善家” 在清华,翁家翌干了两件让他在校内“封神”的事,但初衷却仅仅是——哪怕亏本,也要做点对自己和他人有意义的事。 第一件事是开源作业。 在竞争激烈的清华,信息差是巨大的壁垒。往年的试题、老师的偏好、作业的参考,这些“秘籍”往往只在小圈子流传。翁家翌看不惯,他觉得每个人都该有平等的知情权。于是,他把自己收集的所有“上古资料”和自己的作业代码全部整理开源。尽管这遭到了部分学长学姐的反对,但他坚持认为:后人不应该把时间浪费在重复造轮子上。 第二件事是天授(Tianshou)。 大四那年,因为觉得当时流行的强化学习库(如RLlib)代码在那不断“腐化”,臃肿得没法用,他干脆推倒重来。仅仅花了不到两周,他手撸了一个优雅、轻量级的强化学习框架——“天授”。没有任何功利的论文发表目的,纯粹是因为“自己用得不爽”。 哪怕后来在申请出国时遭遇疫情,他在家还要不仅面对未知的焦虑,还顺手写了一个美签预约查询系统。这个纯公益的项目最终获得了上千万的点击量,帮助了无数留学生。 对他来说,人生的游戏结算分数,不是GPA,而是死后有多少人记得你的名字。 误打误撞进OpenAI:工业界不需要“炼丹师” 2022年,从CMU硕士毕业的翁家翌面临找工作的抉择。他手里拿着Google、HFT(高频交易)公司和OpenAI的Offer。那是ChatGPT发布前夕,OpenAI还只有两三百人,远没有现在的神圣光环。 但他选择了OpenAI,原因很硬核:只有这里在正儿八经地用强化学习解决问题。 面试他的人是RLHF(基于人类反馈的强化学习)的奠基人之一John Schulman。面试题很难,但他做得太快,以至于最后John不得不让他展示怎么修Bug。 进入OpenAI后,他经历了一次认知的重塑。 在学术界,搞强化学习往往是在简单的游戏环境(如Atari)里比分数,大家都在“过拟合”环境,像炼丹一样调参。翁家翌极其讨厌这种玄学,他甚至称之为“生理性排斥”。 但在OpenAI,特别是在引入了Google来的几位大佬(Barret, Luke, Liam)后,团队的哲学变了:不要迷信天才的算法(Idea),要迷信工程的迭代速度。 如果你的基础设施(Infrastructure)足够强,能让你从一周做30次实验变成一周做300次实验,那么即便你的点子很平庸,成功的概率也会呈线性上升。 这就是翁家翌的定位——搞Infra(基建)。他为OpenAI搭建了整套后训练的强化学习框架。所有的模型,从GPT-4到GPT-4o,都要在他搭建的这条“流水线”上跑一遍。 “谁修的Bug越多,谁的模型性能就越好。” 这就是大模型背后的残酷真相。 在风暴中心:压力、宿命与迷茫 别以为在OpenAI工作就是每天和Altman谈笑风生。真实的日常是:修不完的Bug,写不完的史山代码,以及巨大的身心压力。...

February 2, 2026 · 1 min · fisherdaddy

Sam Altman 最新深度交流:软件开发的终局、GPT-6 的剧透与给开发者的建议

本文整理自 OpenAI CEO Sam Altman 今早面向开发者举办的一场交流会的在线直播。以下为本场直播的精华内容,由我和 Gemini 3 Pro 共同整理而成。 软件工程师的未来:不是消亡,而是爆发 很多人担心 AI 会让程序员失业,Sam 引用了**杰文斯悖论(Jevons paradox)**来反驳这个观点:当某种资源(这里是代码)的生产效率极速提高、成本极速降低时,需求反而会呈指数级增长。 未来的软件工程师是什么样的?Sam 认为,“写代码”本身将不再是工作的核心。未来的工程师不需要把大量时间花在敲击键盘或调试 Bug 上。 相反,工程师的定义将通过以下方式被重塑: 价值捕捉者:利用计算机完成自己想要的任务,或者通过计算机为他人创造有用的体验。 宏观调控者:你会看到更多人能独自完成以前需要整个团队才能做到的事。 Sam 预测,世界对软件的需求丝毫没有减弱。未来,我们使用的软件将不再是千人一面的通用版本,而是**“为你一人定制”**的。你会习惯于软件根据你的使用习惯不断自我微调,甚至在此时此刻为你即时生成一个小程序来解决当下的问题。这将创造出比现在大得多的 GDP 总量。 给创业者的冷水:构建变得容易,但卖出去更难了 对于开发者来说,技术门槛的降低是一把双刃剑。 Sam 分享了他以前在 Y Combinator 的观察:曾经,创始人们认为“做产品”是最难的;现在,随着 Cursor、Codex 等工具的普及,构建产品变得极其容易,真正的瓶颈变成了 GTM(Go-To-Market,推向市场)。 即使在那个“极大丰富”的 AI 未来,人类的注意力仍然是稀缺资源。 Sam 给出的建议很务实: 即便 AI 可以自动化销售和营销,你依然要面对激烈的竞争。 不要指望技术红利能自动解决获客问题,生意的本质逻辑(提供差异化价值、建立网络效应)没有变。 终极测试:问问你自己,如果 GPT-6 发布了,且性能惊人地强,你的初创公司会感到开心还是难过?你应该去做那些极度渴望模型变得更强的业务,而不是做那些“修补模型缺陷”的套壳生意,后者会极其痛苦。 关于 GPT-6 与未来的模型:我们要修好“偏科” 坦白说,Sam 承认目前的模型有点“偏科”。例如 GPT-5 在某些方面很强,但在写作风格上可能还不如以前的版本讨喜。 对于未来的模型演进(以 GPT-6 为代表的下一代),OpenAI 的目标非常明确: 全能型选手:未来的模型将在推理、编程、写作等所有维度上同时变强。智能是可互换的,一个能进行复杂科学推理的模型,理应也能写出清晰甚至有见地的文章。 速度与成本:Sam 做了一个大胆的预测——不管是到 2027 年还是更早,高端智能的成本至少会降低 100 倍。同时,OpenAI 正在努力平衡“推理深度”和“响应速度”,让复杂的输出能在 1/100 的时间内完成。 学习能力:你不必担心今天基于旧框架构建的应用会被淘汰。未来的模型将具备“看一眼就会”的能力——给它展示一个新的环境或工具,它就能像最聪明的人类一样迅速掌握并可靠地使用。 AI Agent(智能体)的形态:不仅仅是聊天 关于 Agent,至今没有一个标准答案。Sam 认为未来会有两种极端的用户画像:...

January 27, 2026 · 1 min · fisherdaddy

OpenAI 创始人 John Schulman 复盘:如果重回 2015,我们能光速造出 ChatGPT 吗?

本文整理自 Cursor CEO 对 OpenAI 联合创始人 John Schulman 的深度访谈:John Schulman on dead ends, scaling RL, and building research institutions,由我和 Gemini 3 Pro 共同整理完成。 如果给 OpenAI 的创始团队开一个“上帝视角”,让他们带着今天的知识回到 2015 年,重建 ChatGPT 需要多久? OpenAI 联合创始人 John Schulman 给出的答案可能有点反直觉:快得惊人,而且需要的算力比你想的要少得多。 这是一个关于“后见之明”、OpenAI 早期的一地鸡毛、RL(强化学习)的未来,以及他现在如何用 AI 写代码的深度思考。 带着答案考试:ChatGPT 其实可以“省钱”做 回看过去,如果我们知道确切的“配方”,其实并不需要当年那么恐怖的算力堆叠。 Schulman 提到,像 Andrej Karpathy 写的那种 NanoGPT 已经证明了,一个人、一台机器、半年时间就能跑出一个微缩版模型。如果在 2018 年或 2019 年,哪怕只有几张 GPU(当时还是 V100),只要有现在的 Post-training(后训练) 知识,几个聪明人加上高质量的微调数据,完全可以在那时就搞出 GPT-3.5 水平的对话模型。 今天的我们知道,通过巧妙的数据构建和微调,可以极大地“放大”算力的效果。也就是所谓的“小模型、大智慧”。未来甚至可能出现这种极客场景:一个文件搞定所有训练代码,一天之内跑完全流程。 早期 OpenAI:草台班子与“走错路”的探索 现在的 OpenAI 是市值巨无霸,但 Schulman 也没避讳早期的窘境。2016、2017 年那会儿,OpenAI 更像是一个稍微大点的学术实验室,甚至有点“杂牌军(ragtag)”的感觉。大家三两成群,凭兴趣做研究,写写论文。 当时有没有走弯路?当然有。...

December 18, 2025 · 1 min · fisherdaddy

OpenAI 的 2026 野心与迪士尼的豪赌:本周科技界发生了什么?

本文整理自 Youtube 知名博主 Alex Kantrowitz 每周一次的最新科技新闻讨论视频,由我和 Gemini 3 Pro 共同整理完成。 1. OpenAI 的大转向:2026 是“企业级”的一年 这就得从本周一在纽约的一场午餐会说起了。地点在中央火车站附近的 Rosemary’s 餐厅,OpenAI 的 CEO Sam Altman 和一群媒体界的大佬——包括《大西洋月刊》、《纽约客》和《纽约时报》的高管们——坐在一起。 在推杯换盏之间,Altman 抛出了一个重磅信号(Greg Brockman 随后也在推特上证实了这一点):OpenAI 接下来的重中之重,或者说 2026 年的主题,是企业级 AI(Enterprise AI)。 这听起来可能有点枯燥,但背后的逻辑非常有意思。 为什么是现在? 一直以来,OpenAI 大概是 70% 面向消费者(也就是我们要等到 2026 年第一季度才能体验到的“成人模式”聊天),30% 面向企业。但在企业服务这块,Anthropic 其实做得更好。 Altman 和他的团队意识到了两个残酷的现实: 模型正在商品化:Google 的 Gemini 现在的水平基本上已经追平了 GPT。大家手里的“大模型”底牌都差不多了。 没有直通 AGI 的捷径:单纯堆算力、堆数据带来的模型能力提升正在放缓。 所以,Sam Altman 在午餐会上直言不讳:“现在的瓶颈不是训练,而是应用。” 既然模型本身拉不开巨大差距,那就得看谁能把技术真正用在业务流程里赚钱。这也解释了为什么他们发布了 GPT-5.2(代号),这实际上是一个更擅长处理复杂工作流、待办事项和企业规划的版本。 这也带来了一个尴尬的问题: OpenAI 想做企业生意(毕竟那才是真正的大钱,预计明年这一块市场高达 375 亿美元),但它同时也得伺候好数亿的普通用户。企业用户需要严谨、准确的工具,而普通用户可能想要一个甚至会和你“调情”的 AI 伴侣。OpenAI 的高管 Fiji Simo 承认,他们想两头通吃,但这很难平衡。未来我们可能会看到两个截然不同的 ChatGPT:一个帮你做报表,一个负责陪你聊天。 2. 迪士尼入局:当米老鼠遇见 Sora 要是放在几年前,如果你跟我说迪士尼——这个对版权保护严苛到极致的公司——会主动把自家的 IP 喂给 AI,我肯定觉得你疯了。但这周,迪士尼和 OpenAI 达成了一项价值约 10 亿美元的重磅交易。...

December 18, 2025 · 1 min · fisherdaddy

介绍一下 GPT-Image 1.5

OpenAI 于 2025 年 12 月 17 日发布了全新的旗舰级图像生成模型 GPT-Image 1.5。它能进行精准编辑,同时保持细节完好,并且生成图像的速度提升高达 4 倍。同时,在 ChatGPT 中推出了全新的 Images 功能,旨在让图像生成变得令人愉悦——激发灵感并使创意探索变得轻松自如。 全新的 Images 模型即日起向所有 ChatGPT 用户推出,并在 API 中以 GPT Image 1.5 的形式提供。ChatGPT 中的全新 Images 体验也于今日向大多数用户推出,Business 和 Enterprise 用户将在稍后获得访问权限。 精准编辑,保留重要细节 现在,当你要求对上传的图像进行编辑时,模型会更可靠地遵循你的意图——甚至包括细微之处——仅根据你的要求进行更改,同时保持光线、构图和人物外貌等元素在输入、输出和后续编辑中的一致性。 这开启了符合你意图的结果——更有用的照片编辑,更逼真的服装和发型试穿/试戴,以及保留原始图像精髓的风格滤镜和概念转换。总之,这些改进意味着 ChatGPT 可以充当你口袋里的创意工作室,既能进行实用编辑,又能进行富有表现力的重构。 编辑 该模型擅长各种类型的编辑——包括添加、删减、组合、混合和变换——因此你可以在获得想要的更改的同时,不丢失图像的独特之处。 从派对到直播洛杉矶滑板 将这两名男子和狗组合成一张 2000 年代胶片相机风格的照片,表现他们在孩子们的生日派对上看起来很无聊的样子。 在背景中添加混乱的孩子们,他们在扔东西和尖叫。 将左边的男子改为手绘复古动漫风格,将狗改为毛绒玩具风格,保持右边的男子和背景景物不变。 给他们都穿上看起来像这样的 OpenAI 毛衣。 现在移除这两名男子,只保留狗,并把它们放在一个看起来像附图的 OpenAI 直播中。 创意转换 模型的创造力通过转换得以闪耀,这些转换可以更改和添加元素——例如文本和布局——使想法变为现实,同时保留重要细节。这些转换既适用于简单的概念,也适用于更复杂的概念,并且可以使用全新 ChatGPT Images 功能中的预设风格和创意轻松尝试——无需书面提示词。 电影海报 80 年代健身教练 华丽玩偶 装饰品 时尚广告 装扮角色 绘画 饮料广告 用这两名男子的图像制作一张名为“codex”的老派好莱坞黄金时代电影海报。随意更改他们的服装以符合时代背景。 将演员的名字改为 Wojciech Zaremba(左)和 Greg Brockman(右) 由 Sam Altman 执导,Fidji Simo 制作。A Feel the AGI Pictures 出品。 指令遵循 该模型比我们的初始版本更可靠地遵循指令。这实现了更精准的编辑以及更复杂的原创构图,其中元素之间的关系按预期得以保留。...

December 17, 2025 · 5 min · fisherdaddy

什么是“Vibe Engineering”?看看 OpenAI 内部是如何重新定义软件开发的

本文整理自 OpenAI Forum 发布的分享视频:Vibe Engineering with OpenAI’s Codex。 什么是“Vibe Engineering”?看看 OpenAI 内部是如何重新定义软件开发的 我们大概都经历过那种死线逼近的时刻,心里幻想着:“要是有个不知疲倦、不用睡觉的同事能帮我把这些代码写了该多好。” 在 OpenAI,Codex 就扮演着这个角色的。 最近在 OpenAI Forum 上,Global Affairs 团队的 Chris Nicholson 邀请了两位真正的“内行”——OpenAI 开发者体验负责人 Romain Huet 和技术专家 Aaron Friel,深入聊了聊一个最近很火的概念:Vibe Engineering(氛围工程)。 这不仅仅是一个流行词,它代表了软件开发的一种新范式:利用 AI 构建真正的生产级软件,同时让人类工程师对交付的每一行代码保持完全的掌控。 这不只是让 AI 吐出一堆代码然后祈祷它能跑通,而是把 AI 深度融入到设计、架构、调试甚至长周期的多步骤项目中。 今天,我们就来扒一扒 OpenAI 内部的工程师们究竟是怎么“生活”在未来的,以及作为普通开发者,我们可以怎么把这种工作流偷师过来。 从“Vibe Coding”到“Vibe Engineering” 你可能听说过“Vibe Coding”,通常指那种随意的、凭感觉的编程体验。但 Simon Willison 提出的“Vibe Engineering”是它的严肃版——它是 AI 驱动开发的进阶形态。 在这个形态下,大模型不再只是一个代码补全工具,它们变成了你的队友。 Romain Huet 分享了一个很有意思的观察:一年前,你会为了模型能写出一个贪吃蛇游戏或者 iPhone App demo 而兴奋。但现在,模型的能力已经进化到了可以处理长达数小时甚至数天的复杂任务。它们可以制定计划、做架构决策、编写测试,甚至自己检查自己的作业。 当 AI 学会了自我检查(Self-correction),它的表现就有了质的飞跃。这就是从“写代码”到“搞工程”的转变。 现场实战:把一个 Kotlin 项目重写为 Rust 光说不练假把式。Aaron Friel 在现场展示了一个非常硬核的 Demo,任务听起来就很让人头大:...

December 16, 2025 · 2 min · fisherdaddy

我们如何利用 Codex 在 28 天内构建出 Sora Android 版 • OpenAI

本文翻译 OpenAI 官方发布的文章 How we used Codex to build Sora for Android in 28 days。本文介绍了 OpenAI Sora 开发团队如何在短短 28 天内,利用 Codex CLI 成功构建并发布 Sora Android 应用程序的过程。文章中不仅展示了惊人的开发速度和质量,还深入探讨了在 AI 辅助开发时代,软件工程模式的转变以及人机协作的最佳实践。本文由我和 Gemini 3 Pro 共同完成翻译。 我们如何利用 Codex 在 28 天内构建出 Sora Android 版 作者:Patrick Hum 和 RJ Marsan,技术团队成员 11 月,我们向全球推出了 Sora Android 应用,让任何拥有 Android 设备的人都能将简短的提示词转化为生动的视频。发布当天,该应用登上了 Play 商店榜首。Android 用户在首个 24 小时内生成了超过一百万个视频。 在这次发布背后有一个故事:Sora 的 Android 生产级初始版本仅用 28 天就构建完成,这要归功于任何团队或开发者都可以使用的同一个智能体(agent):Codex。 从 2025 年 10 月 8 日到 11 月 5 日,一个精简的工程团队与 Codex 并肩工作,消耗了大约 50 亿个 token,完成了 Sora Android 版从原型到全球发布的全部过程。尽管规模庞大,该应用仍保持了 99....

December 15, 2025 · 2 min · fisherdaddy

快速了解一下 OpenAI 发布的 GPT-5.2

2025 年 12 月 12 日 OpenAI 发布了迄今为止最强大的GPT-5.2 模型,该系列专为提升专业知识型工作的效率和经济价值而设计,在制作电子表格、编写代码、设计演示文稿及处理复杂多步骤项目方面表现出显著优势。 卓越的工作效率与质量 在衡量明确知识型工作任务的 GDPval 评测中, GPT-5.2 刷新了行业水平,成为首个在相关任务上达到或超过人类专家水平的模型。 专家级表现:在涵盖 44 个职业的 GDPval 评测中, GPT-5.2 Thinking 在 70.9% 的任务中表现优于顶尖行业专家或与其持平。 极致效能:在上述任务中,模型的输出速度比专家快 11 倍以上,而成本不到专家的 1%。 办公自动化:在生成复杂的电子表格和幻灯片方面,能力较前代提升了 9.3%,格式和布局更具专业水准。 编程与工程能力的飞跃 软件工程基准:在模拟真实工业场景的 SWE-bench Pro 测试中取得了 55.6% 的新成绩;在 SWE-bench Verified 中达到了 80% 的高分。 全栈开发助手:在前端开发、复杂 UI(特别是涉及 3D 元素)以及代码调试和重构方面表现更强,减少了人工干预的需求。 可靠性、长文本与视觉能力 错误率降低:相比 GPT-5.1 Thinking,新模型的幻觉率更低,错误回答减少了 38%。 长文档处理:在长达 256k Token 的文本范围内(如 MRCRv2 评测),能保持接近 100% 的信息提取准确率,适合深度文档分析。 视觉理解:在图表推理和软件界面理解方面的错误率减半,对图像元素的空间位置有更强的感知能力。 科研推进与复杂推理 科学研究: GPT-5.2 Pro 在研究生级问答测试 GPQA Diamond 中得分 93.2%,并已在实际数学研究中协助解决了统计学习理论的开放问题。 通用推理:在 ARC-AGI-1 测试中, GPT-5....

December 12, 2025 · 3 min · fisherdaddy