本文由有道龙虾翻译并发布。

Anthropic 正式发布 Claude Opus 5:新模型在软件工程、知识工作、计算机操作和科学研究等任务上显著提升性能与成本效率,同时延续严格的对齐与安全防护。

原文:Introducing Claude Opus 5

产品|公告

2026 年 7 月 24 日

Claude Opus 5 今日正式上线。它是一款深思熟虑、积极主动的模型,智能水平接近前沿模型 Claude Fable 5,而价格只有后者的一半。

Frontier-BenchGDPval-AA 等编程与知识工作评测中,Opus 5 创下了新的业界最佳成绩,不过在网络安全任务上仍落后于 Mythos 5。

Opus 5 专为日常使用而设计:它比其他模型工作得更高效。它现在是 Claude Max 的默认模型,也是 Claude Pro 所能使用的最强模型。

性能与成本效益

Claude Opus 5 在价格与前代 Opus 4.8 相同的情况下,实现了大幅性能提升。本节图表展示了模型性能如何随“投入程度”(effort)设置变化。客户可以利用这一设置,在追求更高智能水平与节省 Token、获得更快且更便宜的结果之间进行优化。

Opus 5 在高价值的软件工程任务上表现出色。例如,在 Frontier-Bench v0.1 中,Opus 5 超越了所有其他模型;在单项任务成本更低的情况下,其表现达到 Opus 4.8 的两倍以上。在 CursorBench 3.2 中,当投入程度设为最高时,它与 Fable 5 峰值成绩的差距不到 0.5%,但单项任务成本只有后者的一半;在 high、xhigh 和 max 三档投入程度下,它还实现了同等成本下优于所有其他模型的表现。

Frontier-Bench v0.1

CursorBench

AA Coding Agent Index

在知识工作和问题解决任务上,我们也观察到了类似结果。例如:

  • ARC-AGI 3 这项要求模型解决全新问题的评测中,Opus 5 的得分是排名第二模型的三倍。
  • 在衡量模型能否从头到尾完成商业任务的 Zapier AutomationBench 中,在单项任务成本相同的情况下,Opus 5 的通过率约为排名第二模型的 1.5 倍。即使采用最低投入程度,Opus 5 通过的任务数仍超过其他所有模型。
  • 在计算机操作基准测试 OSWorld 2.0 中,无论成本处于什么水平,Opus 5 都优于其他所有模型;它仅用略高于三分之一的成本,就超过了 Fable 5 的最佳成绩。

在其他几项相关评测中,它同样是我们表现最好、成本效率最高的模型:

ARC-AGI 3

GDPval-AA v2

OSWorld 2.0

HLE

AutomationBench

DeepSearchQA

对于科学研究而言,Opus 5 相较 Opus 4.8 也实现了实质性进步。在我们所有生命科学评测中,它的表现都优于 Opus 4.8;这些评测涵盖结构生物学、有机化学和生物信息学等主题。最显著的提升出现在有机化学任务上,例如根据光谱数据推断分子结构——在我们的内部基准测试中,它比 Opus 4.8 高出 10.2 个百分点;在蛋白质相关任务上,例如预测蛋白质序列变化会如何影响其功能,它高出 7.7 个百分点。

最后,Opus 5 还能生成强大得多的视觉成果:

风洞

观看视频:Claude Opus 5 构建可运行的风洞

Opus 5 将空气流经符合和不符合空气动力学特征物体时的状态进行了可视化。

细胞模型

观看视频:Claude Opus 5 构建可交互的 3D 动物细胞

Opus 5 构建了一幅经过简化、可以交互操作的细胞示意图。

与 Claude Opus 5 协作

Claude Opus 5 在检查自身工作、认真迭代直至成功方面强大得多。在评测和抢先体验测试中,我们和用户发现了许多体现 Opus 5 主动性与严谨性的案例:

  • 在一项 Frontier-Bench 任务中,Opus 5 收到了一张机械零件图,并被要求编写代码,将它重建为 FreeCAD 3D 模型。但在这项任务中,模型被故意设置为无法直接“查看”图纸。Opus 5 随后自行编写了一套计算机视觉处理流程,从原始像素中提取几何结构,再重建出完整零件。它反复完成了这项任务;在相同设置下,没有任何竞争模型能在五次尝试后成功解决。
  • 面对某款流行开源软件包管理器中的真实 Bug,Opus 5 找出了根本原因,并修复了社区补丁遗漏的一种边界情况。另一个竞争模型只修复了表面症状,而非根本原因,之后便报告称 Bug 已解决。
  • 某交易公司的工程师在一次会话中,使用 Opus 5 为一家新交易所构建了市场数据流。此前的模型即使拿到工程师提供的详细方案,也完全无法完成这项任务。由于找不到可供验证的实时数据流,Opus 5 甚至自行构建了一套测试框架,用来检查其代码能否正确解析该交易所的数据。

以下是抢先体验客户对使用 Opus 5 的进一步反馈:

客户标志

在 FrontierCode 1.1 上,Claude Opus 5 以一半成本实现了接近 Fable 的性能。在 Devin 中,它还特别擅长高难度调试和根因分析任务。

客户标志

Claude Opus 5 以 Opus 的速度和成本,提供了接近 Fable 5 的智能水平。在 CursorBench 中,它的表现仅略低于 Fable 5,并呈现出许多相同的行为特征。我们非常期待看到开发者如何在 Cursor 中使用它。

客户标志

Claude Opus 5 登顶 Zapier 的 AutomationBench 排行榜,消耗的 Token 却没有超过此前的 Claude 模型。它接手了一份原始的客户健康状况工作簿,并端到端执行了完整的客户流失预防流程:标记高风险客户、提醒正确的负责人,并为客户留存运营团队生成摘要。此前的模型都未能通过,Opus 5 则实现了 100% 成功率。

客户标志

在我们的基因组分析工作中,Claude Opus 5 比我们使用过的任何模型都更像一位严谨的科学家。它会选择正确的统计检验来排除混杂因素,用独立方法交叉检查自己的结果,并能在漫长的多步骤分析中始终紧扣目标。

客户标志

在我们的内部评测中,Claude Opus 5 超越了同系列的所有模型。它不仅在最困难的智能体编程任务上比 Opus 4.7 提升了 22%,而且稳定性更强,每次运行之间的波动小得多。对于 Lovable 上数以百万计的创作者来说,稳定性就是胜负关键——一次又一次,可靠地完成构建。

客户标志

Claude Opus 5 是 Opus 系列自 4.5 以来最大的一次飞跃。在构建相同的全栈应用时,前端最先体现出差距:它制作出了我们在 Opus 模型中见过的最佳动画、游戏和 3D 效果。

客户标志

我们非常喜欢 Claude Opus 5。对于我们的智能体所处理的开放式分析工作,它全面优于 Opus 4.8,而且提升最大的地方恰恰是最重要的部分:难度更高、描述更模糊的任务。它的回答更清晰、更简洁,在较高投入程度下,效率也有所提升。

客户标志

对于分析师每天运行的金融研究工作流,Claude Opus 5 相比 Opus 4.8 有着惊人的提升。它在数值推理、表格处理以及要求精确性的敏锐批判性思考方面尤其突出。

客户标志

Claude Opus 5 提供了分析专业企业内容所必需的行业智能和准确性。Box 发现,Opus 5 的整体表现比 Opus 4.8 高出 8%;在科技、医疗和公共部门组织日常依赖的数据分析与尽职调查工作流中,分别实现了 11% 和 17% 的显著提升。

客户标志

Claude Opus 5 相比 Opus 4.8 是一次明显的代际跃升。一个周末里,我让它担任我的开发环境“幕僚长”:它自行构建监控工具,操控每台机器,只在需要作出判断时才让我介入。

客户标志

Claude Opus 5 对我们的 Fundamental Research Assistant 代码库进行了大规模修改,在整个智能体工作流中持续适应反馈,并且比我们使用过的任何模型都更清晰地解释其推理。它处理了那些通常需要我们拆分成许多小块才能完成的工作。

客户标志

在一些最困难的金融建模任务中,Claude Opus 5 在准确性和效率方面都明显优于 Opus 4.8。它的表现下限高出很多,尤其是在深层金融领域逻辑方面。综合各档投入程度,它的平均准确率高出 9 个百分点,同时对话轮次和工具调用减少三分之一,耗时减少 60%。

客户标志

Claude Opus 5 会像真正的前端开发者一样检查自己的工作。在我们的基准测试中,它分别以桌面端和手机端宽度在浏览器里打开自己制作的页面,发现了一个被藏在移动端首屏下方的商品和一个跑到屏幕外的结账按钮,并在交付前将两处问题全部修复。

客户标志

与此前的 Opus 模型相比,Claude Opus 5 在法律智能体工作上有着明显的性能提升,其中公司治理和仲裁等实务领域的进步最大。它在较低推理档位下仍能保持质量,这一点也给我们留下了深刻印象:与采用最高推理档位的 Opus 4.8 相比,它平均少生成 26% 的 Token,却能取得相近的表现。

客户标志

Claude Opus 5 对我们而言最大的提升体现在长周期工作上:先制作一整套演示文稿,再进行修改。最终交付物的质量决定了我们会采用哪个模型,而这是我们见过最明显的一次跃升——更出色的视觉理解、更整洁的格式、更少的幻灯片问题。

客户标志

Claude Opus 5 最突出的地方是判断力。把一个 PR 交给它时,它不会急着发布,而是先验证分支、检查模板,并思考测试会受到什么影响,从而确保交接干净利落。旧模型往往会贸然向前推进,随后卡在我们的检查环节。

客户标志

在一次重新设计架构的会话中,Claude Opus 5 对我提出的设计方案表示反对;即使我坚持己见,它也没有退让。相反,它准确说明了我的想法中哪些部分有价值,将异议收窄到一个具体的设计问题上,并提出了一套既保留优点又修复缺陷的折中方案。正是这种判断力,让我们敢在更少监督的情况下信任它。

客户标志

在首轮合同修订中,Claude Opus 5 的得分是我们测试过的所有模型里最高的,接近 Opus 4.8 的两倍。它的批注也更好:处理保密协议时,它能用更少轮次、更短时间完成修订,同时保持或提升准确性。

客户标志

Claude Opus 5 编写的差异代码干净、紧凑,没有废弃代码;对于细微且与特定代码库相关的问题,它也更善于发现潜在风险。我们正在将它用于生产工作负载。

客户标志

我们肯定会将统一智能体平台 Cosmos 中的多项使用场景迁移过去。我们期待越来越多地使用 Claude Opus 5 进行代码审查,而且可以很有把握地说:我们宁愿大家使用 Opus 5,而不是 Opus 4.8。

客户标志

Claude Opus 5 最突出的地方是判断力。它会在写下第一行代码之前进行更深入的思考,在规划阶段而不是事后发现自己的逻辑错误,并推理一个答案为什么正确,而不只是判断它能否工作。这是我们从一代 Claude 模型到下一代模型所见过最明显的问题解决能力跃升;我们期待它被 JetBrains IDE 采用。

客户标志

Claude Opus 5 是我们在交易基准测试中测过的最强 Opus 模型,而且它只使用了 Opus 4.8 大约七分之一的推理 Token,延迟不到后者的一半。只用一小部分算力,就能给出更好的答案。

对齐与安全

对齐。 在部署前测试中,我们的自动化行为审计发现,Opus 5 是迄今对齐程度最高的模型(如下图所示)。与 Opus 4.8、Sonnet 5 和 Fable 5 相比,它能更好地遵循 Claude 宪法;表现出最低比例的欺骗行为;也最不容易被诱导用于滥用。就避免采取可能造成难以逆转副作用的鲁莽行动而言,它也是我们迄今最安全的模型。

在我们的自动化行为审计中,Opus 5 的总体不对齐行为得分为 2.3,是近期模型中最低的。

安全。 Opus 5 并未推进具有风险的双重用途能力前沿。在我们与私营部门及政府合作伙伴共同开展的严格评测中,我们发现它在生物学研究和进攻性网络安全方面仍落后于 Mythos 5。有关这些评测的更多信息,请参阅我们的系统卡

与前代 Opus 4.8 一样,我们刻意避免使用网络安全任务训练 Opus 5。尽管如此,随着通用能力增强,该模型在此类任务上仍取得了显著进步;在发现网络安全漏洞方面,它已经接近 Mythos 5。但在利用这些漏洞方面,也就是将漏洞转化为实质性的网络威胁,Opus 5 仍明显落后于 Mythos 5。

Opus 5 在 OSS-Fuzz 上的表现说明了这一点。OSS-Fuzz 是我们开发的一项评测,用来衡量模型在没有大量人工指导的情况下发现并利用漏洞的能力。尽管 Mythos 5 与 Opus 5 识别漏洞的成功率相近,但 Opus 5 在漏洞利用程序开发上的得分远远落后于 Mythos 5。

在我们的网络安全评测 OSS-Fuzz 中,Opus 5 在识别软件漏洞方面接近 Mythos 5(左图),但在开发漏洞利用程序方面的成功率明显更低(右图)。

Opus 5 的安全防护措施

Claude Opus 5 的安全防护措施旨在允许用户将模型有益地用于网络安全和生物学。除了对少数网络安全任务采用更严格的防护规则外,这些措施与我们应用于 Opus 4.8 的防护措施相似。

网络安全。 Opus 5 的网络安全分类器按比例来看没有 Fable 5 那么严格。它允许 Opus 5 在源代码中寻找漏洞,但会阻止“基于二进制文件”的漏洞扫描——这种方法更可能与恶意行为者相关——以及渗透测试和漏洞利用程序生成。

根据测试结果,我们预计这些分类器的介入次数将比 Fable 5 的分类器减少约 85%。在 Claude.ai、Claude Code 和 Claude Cowork 中,任何被标记的请求默认都会回退至 Opus 4.8。用户也可以在 API 中启用回退至 Opus 4.8 的功能。

我们的网络安全验证计划(Cyber Verification Program,CVP)可支持那些原本会受到模型安全防护措施阻碍的网络安全工作。已经加入 CVP 的企业和研究人员,可以立即使用安全限制更少的 Opus 5 版本。

生物学。 由于 Opus 5 采用了一套与 Opus 4.8 相似的安全防护措施,它现在成为我们面向公众提供的科学研究能力最强的模型。尽管如此,在长期运行的自主研究任务上,该模型仍存在明显局限;而我们预计,AI 模型最重大的生物学相关风险恰恰会出现在此类任务中。(Mythos 5 仍是处理此类生物学工作的更强模型。)此次发布后,在 Fable 5 上被阻止的生物学相关请求将转交给 Opus 5,而不再转交给 Opus 4.8。

开始使用

Claude Opus 5 今日已在所有平台上线,价格为每百万输入 Token 5 美元、每百万输出 Token 25 美元,与 Opus 4.8 相同。开发者可以通过 Claude API 使用 claude-opus-5

它还提供 Fast 模式,运行速度约为默认模式的 2.5 倍。与 Opus 4.8 一样,Fast 模式可在 Claude Platform 上以 Opus 5 基础价格的两倍使用,也可以在 Claude Code 中通过使用额度调用。

在 Opus 5 上线的同时,我们还推出了两项 Beta 更新:

  • Claude Platform 上的会话中途工具变更 在一次会话中,开发者现在可以改变 Claude 能够使用的工具,而不会导致提示词缓存失效。
  • API 上的自动回退 用户现在可以选择:当 Opus 5(或 Fable 5)上的请求被安全分类器标记时,自动将其转交给另一个模型。启用自动回退后,API 请求默认会始终交给当前最佳的可用模型处理,而不是直接被阻止。

与此前的 Opus 模型一致,Opus 5 的常规访问不设数据保留要求。

如需了解如何充分发挥 Opus 5 的能力,请参阅我们的提示词指南

脚注

Frontier-Bench v0.1 投入程度图表: 这些结果来自我们在 mini-SWE-agent 框架和 GKE 后端上对 Frontier-Bench v0.1 进行的内部测试;每项任务尝试 5 次并取平均奖励。对于 Opus 5 和 Fable 5 因安全分类器而拒绝的请求,测试使用 Opus 4.8 作为回退模型。


原文:Introducing Claude Opus 5