Claude 值班:Claude Tag 如何担任 Anthropic CI/CD 故障的第一响应者

Anthropic 的 CI/CD 团队把 Claude Tag 部署成事故响应的第一响应者:它持续监控告警,调用多个子智能体并行调查证据,提出缓解或修复方案,并在事后沉淀经验与完成交接。本文完整介绍了这套值班系统的配置、检测、分诊、解决和验证流程。 原文:Claude on call: How Claude Tag serves as Anthropic’s first responder for CI/CD failures 本文由 LobsterAI 自动翻译和发布。 面向 CI/CD 的 AI 事故响应:Claude 在 Anthropic 值班 几周前,我正在值班。晚上 10 点,一位同事在 Slack 上给我发来消息:某项新服务中大约有 44 个测试没有运行。 过去,我会停下手头的事,在笔记本电脑前坐好,疲惫地叹口气,然后开始一段长达一小时的调查与修复流程。但现在,我的工作方式已经完全不同:我会把 @Claude 拉进来,问问它看到了什么。 这一次,Claude 发现:当天早上开启某个功能标志后,这些测试就消失了;同时,它还判断回滚该变更是安全的。我让同事回滚了这个标志。3 分钟后,Claude 在 Slack 上提醒我,并确认相关跳过规则确实已被移除,错误率也恢复到了基线水平。 为清晰起见,根据一次真实交流重新设计。 过去几个月里,Claude Tag 一直是 Anthropic CI/CD 故障值班体系中的第一响应者。它不仅改善了我们的业余生活,也让每起 CI 事故都能立即得到响应:近期所有形成情况报告的事故,其第一份报告均由 Claude 撰写;通常,它会在 15 分钟内发布初步分析。 本文将介绍我们构建了什么、它如何运作,以及你如何亲手搭建类似系统,从此不再害怕轮到自己值班。 我们的 Claude 值班配置 在逐一介绍事故响应流程的各个阶段之前,我先概述一下整体配置。这样,当我们继续补充细节时,你能始终把握全局。 一个值班智能体需要具备:记忆,以便记住已经完成的工作;连接与访问权限,以便调查、理解并采取行动;调度能力,以便知道何时恢复工作;以及指令,以便知道该做什么。 Claude Tag 是我们值班智能体的骨干。它会保留值班 Slack 频道中的上下文记忆,同时提供一个界面,方便我们在事故期间为每一轮交互下达指令。Claude 还会实时响应值班频道及其他频道中的事件。例行任务——也就是 Claude 定期执行的操作——同样在这个频道里通过自然语言提示进行调度,例如:“每周一上午 9:00(美国东部时间)执行 CI 交接。”...

August 29, 2026 · 2 min · fisherdaddy

Claude 文本水印的工作原理

未来的 Claude 模型将为生成文本加入一种不影响内容质量、不可被读者察觉且不携带身份信息的水印。它通过调整模型选词时的随机性,在长文本中留下只有持有密钥者才能检测的统计模式,用于判断 Claude 是否可能参与了写作。 原文:How Claude text watermarking works 本文由 LobsterAI 自动翻译和发布。 未来的 Claude 模型将生成带有水印的文本。这是一种用于判断 Claude 参与文本写作可能性的方法。为遵守《欧盟人工智能法案》(EU AI Act),Anthropic 正与其他几家主要 AI 提供商一同实施这一变更。 要点总结 水印方法不会对 Claude 输出的质量或内容产生任何实际影响。 读者无法分辨带水印与不带水印文本的差异。 文本中不会添加任何内容,也不存在隐藏字符。 水印不需要额外 token,不会增加费用。 水印不携带身份识别信息,无法追溯到特定个人、组织或对话。 水印并非 Claude 独有。自 8 月 2 日起,欧盟要求 AI 提供商标记 AI 生成内容。其他主要模型开发商也签署了同一《行为准则》,将实施各自的水印。 什么是水印? Claude 这类大语言模型每次生成一个词。每次决定下一个词时,会从候选词中依据前文选出最合理的。比如“今天天气寒冷而且……”,下一个词几乎不可能是“甜腻的”,却很可能是“阴沉的”或“灰蒙蒙的”。大多数情况下选哪个对读者并不重要,此时由随机数决定。 水印利用的正是这些无关紧要的选择——这类选择在一段文本中会出现许多次——在回答中留下模式。读者察觉不到,但持有密钥的人能够检测。使用水印时,选择仍然是随机的,只是随机性的来源发生了变化:系统使用密钥加上前几个词来决定选词。 人们可以检查词序列是否符合“使用密钥的 Claude 会做出的选择”,从而计算文本由 Claude 生成的概率。 水印如何影响输出? 水印不影响输出质量。对读者而言,带水印与不带水印的文本没有区别,这与钞票等肉眼可见的水印不同。Anthropic 的内部测试未发现水印对内容、创意或可读性产生任何影响。 在 SynthID-Text 论文中,DeepMind 对部分 Gemini 流量进行了对比,结果显示用户点赞与点踩的数据没有统计显著差异;在受控研究中,人类评分者同样没有发现质量差异。 可以用一个类比来理解:玩大富翁时不使用骰子,而是改用圆周率的小数位表,从随机位置开始依次取数作为“骰子”结果。走法依然是随机的,游戏结果没有差异;但事后如果能看到全部走法序列并知道 π,就能推断这局是否使用了 π——这局就是“带水印的”。Claude 文本水印的原理与此相同。 具体使用哪种方法? Claude 的文本水印是 DeepMind 于 2024 年发表在《自然》上的 SynthID-Text 方法的一个版本,属于可追溯至 Scott Aaronson 2022 年提案的方法家族。它们遵循同一个原则:水印只改变选词时随机性的来源。...

August 15, 2026 · 1 min · fisherdaddy
Claude Opus 5 正式发布

Claude Opus 5 正式发布

本文由有道龙虾翻译并发布。 Anthropic 正式发布 Claude Opus 5:新模型在软件工程、知识工作、计算机操作和科学研究等任务上显著提升性能与成本效率,同时延续严格的对齐与安全防护。 原文:Introducing Claude Opus 5 产品|公告 2026 年 7 月 24 日 Claude Opus 5 今日正式上线。它是一款深思熟虑、积极主动的模型,智能水平接近前沿模型 Claude Fable 5,而价格只有后者的一半。 在 Frontier-Bench 和 GDPval-AA 等编程与知识工作评测中,Opus 5 创下了新的业界最佳成绩,不过在网络安全任务上仍落后于 Mythos 5。 Opus 5 专为日常使用而设计:它比其他模型工作得更高效。它现在是 Claude Max 的默认模型,也是 Claude Pro 所能使用的最强模型。 性能与成本效益 Claude Opus 5 在价格与前代 Opus 4.8 相同的情况下,实现了大幅性能提升。本节图表展示了模型性能如何随“投入程度”(effort)设置变化。客户可以利用这一设置,在追求更高智能水平与节省 Token、获得更快且更便宜的结果之间进行优化。 Opus 5 在高价值的软件工程任务上表现出色。例如,在 Frontier-Bench v0.1 中,Opus 5 超越了所有其他模型;在单项任务成本更低的情况下,其表现达到 Opus 4.8 的两倍以上。在 CursorBench 3.2 中,当投入程度设为最高时,它与 Fable 5 峰值成绩的差距不到 0.5%,但单项任务成本只有后者的一半;在 high、xhigh 和 max 三档投入程度下,它还实现了同等成本下优于所有其他模型的表现。...

July 25, 2026 · 3 min · fisherdaddy

用 Fable 构建高性价比的智能体框架

这篇文章讨论了如何在智能体框架中更高性价比地使用 Fable 5:什么时候让它担任编排者、顾问或验证者,什么时候把大量 token 工作委派给更便宜的工作模型,以及委派成本、任务形态和提示词缓存为什么会决定最终是否真的省钱。 原文来源:https://x.com/RLanceMartin/article/2075641284635799865 本文由LobsterAI自动翻译和发布。 人们对如何高性价比地使用 Fable 5 非常感兴趣。智能体框架会越来越擅长判断:究竟应该在什么时候调用前沿智能模型。 我想分享一些自己做过的测试,以便更深入地理解应该在什么情况下、以什么方式使用 Fable 5。 任务的形态 很多任务在不同 token 阶段所需要的智能水平并不对称。智能体框架可以识别这种差异,然后决定什么时候使用 Fable 5。 目前已经出现了几种模式,未来很可能还会出现更多: 将 Fable 5 用作编排者,把任务委派给成本更低的工作模型。 将 Fable 5 用作顾问,让成本更低的执行模型在需要时向它请教。 将 Fable 5 用作验证者,检查其他模型完成的工作,例如放在 /goal 或 Outcomes 循环中。 例如,@mitchellh 提到过一种“编排者—验证者”方案: 我让 Fable xhigh 充当规划者和架构师,让 GPT 5.5 xhigh(订阅版)负责编码,然后再让 Fable xhigh 充当评审。 按照 API 定价计算,规划和评审的成本大概只有几美元,而一次典型的、完全由 Fable 完成的往返通常要花费 50 美元以上。 我也见过有人使用更笨、更便宜的编码模型,但即使开启 xhigh,GPT 5.5 与 Fable 5 相比仍然非常便宜、非常快。而且 GPT 5.5 确实……真的很强。 这种方案重新流行还不到 24 小时,所以它能否长期有效仍不确定,但到目前为止表现一直非常好。 我在 Parameter Golf 上研究了这种方案。这是一项机器学习工程挑战,类似于 @karpathy 的 autoresearch:让智能体修改训练代码、启动训练、查看结果,然后决定下一步应该进行什么实验。...

July 11, 2026 · 2 min · fisherdaddy

Claude 计算机和浏览器使用最佳实践

本文由有道龙虾翻译并发布,原文来自 Anthropic 官方博客:Best practices for computer and browser use with Claude。文章系统总结了 Claude 计算机使用和浏览器使用在截图分辨率、坐标缩放、点击准确性、思考预算、安全防护、上下文管理、批量工具、Advisor 工具和演示学习等方面的工程最佳实践。 Claude 的最新模型在计算机使用和浏览器使用能力上迈出了重要一步。凭借这些特性,LLM 现在能够驱动越来越复杂的智能体系统,用于支撑真实工作,例如构建软件应用,以及跨多个互不相同的技术自动化工作流。 在这篇博客文章中,我们分享了 Claude 计算机使用与浏览器使用的最佳实践,内容从简单的配置变更到更高级的集成模式不等。我们希望这篇文章能在你开始将 Claude 的计算机使用与浏览器使用能力集成到产品中时有所帮助。我们还发布了一个新的演示实现,其中封装了部分最佳实践,并提供了在 Claude 计算机使用能力之上进行开发时有用的附加工具。 请注意,除非另有说明,这些建议适用于 Claude 4.6 系列(Opus 4.6、Sonnet 4.6、Haiku 4.5)以及 Claude Opus 4.7。当 4.6 系列与 Opus 4.7 的指导建议存在差异时,我们会在正文中明确指出。我们的发现基于内部实验,未来可能会随着新模型和新技术的出现而更新。 入门:分辨率与缩放 点击准确性是任何计算机使用集成的基础。如果点击没有落在应有的位置,后续一切都无法正常工作:表单填不上,按钮按不下,工作流也会失败。影响最大的单项优化同时也是最简单的优化之一:在将截图发送给 API 之前,先对截图进行下采样/缩小。 确保正确缩放 当你向 Claude 的 Computer Use API 发送截图时,模型会看到它,并在你指定的 display_width_px / display_height_px 坐标空间中返回点击坐标。但这里有一个重要约束:API 对图像大小有内部处理限制。超过这些限制的图像会在模型看到之前被下采样/缩小,这意味着模型是在图像的降质版本上进行点击判断,而你的执行框架期望的坐标却与原始分辨率对齐。 对于我们的 Claude 4.6 模型系列,API 的限制如下: 最大长边:1568 像素 最大总像素数:1.15 百万像素 超过任一限制的图像都会被内部下采样/缩小 我们的 Opus 4.7 模型支持更高分辨率。限制如下:...

May 20, 2026 · 12 min · fisherdaddy

Anthropic 研究 PM 眼里的 Claude:模型、记忆、性格,以及 AI 原生产品管理

本文整理自 YouTube 视频《Alex from Anthropic on Claude, AI agents, memory and product management》,由有道龙虾总结和发布。 AI 公司到底怎么“做”一个模型? 不是简单地把更多数据扔进去,也不是只盯着榜单分数往上刷。至少在 Anthropic 内部,Claude 更像一个正在被不断打磨的产品:它有目标用户,有核心能力,有缺陷清单,有反馈渠道,也有越来越重要的“性格”。 Alex 曾是 Anthropic 的开发者关系负责人,现在是研究团队的产品经理。他在访谈里聊到一个很有意思的视角:模型本身就是产品。 这句话背后,其实藏着现在 AI 产品管理最核心的变化。 模型不是“训练完就发布”,而是从第一天就被产品化 传统产品经理做产品,大概是理解用户问题、定义解决方案、推动团队把东西做出来。 研究团队里的 PM 也差不多,只是他们面对的“产品”不是一个按钮、一套流程或者一个 App,而是模型本身。 每一代 Claude 在很早的构思阶段,就会被问几个问题: 这一代模型应该擅长什么? 它大概率会在哪些任务上变强? 上一代模型哪里表现不好,这一代要怎么修? 它会通过 API、Claude Code、Claude.ai、Co-work 等不同产品界面被怎样使用? 这和普通产品开发最大的区别在于:软件功能通常是“造出来”的,而模型更像是“长出来”的。 团队可以根据训练方式、架构选择、数据和技术路线去预测它可能擅长什么,但直到训练过程真正发生,没人能百分百知道它最后会变成什么样。 所以研究 PM 的工作,就是从模型的 ideation 阶段一路跟到训练、评测、发布,再把来自用户、内部团队、产品界面的反馈重新带回下一轮模型开发。 Claude 要变强,不只是“会写代码” 过去一两年,编码能力当然是模型竞争的核心战场。 但 Alex 提到,Claude 的能力目标远不止写代码。知识工作、表格处理、Excel、文档分析、复杂产品任务,也都变成了重要方向。 尤其是随着 Claude 被嵌入越来越多产品界面,模型能力不再是孤立存在的。 同一个模型,在 Claude.ai 里、在 Claude Code 里、在 API 里、在 Co-work 里,用户体验可能完全不同。因为每个产品界面都有自己的提示词、工具、上下文和使用场景。 这就让模型 PM 的工作变得很复杂。...

May 18, 2026 · 3 min · fisherdaddy

我逆向工程了 Claude 的记忆系统,这是我的发现!• Manthan Gupta

本文翻译自一位印度工程师在博客上发布的文章:I Reverse Engineered Claude’s Memory System, and Here’s What I Found!。作者通过逆向工程深入探究了 Claude 的记忆系统,并将其与 ChatGPT 进行了详细对比。文章揭示了两者在处理记忆和上下文时的根本性架构差异,特别是 Claude 独特的“按需检索”机制。 Claude 的提示词结构 Claude 的提示词主要由以下四个部分组成: 系统提示词(System Prompt):包含静态指令、工具定义和安全限制。 用户记忆(User Memories):类似于长期记忆。 对话历史(Conversation History):当前的对话上下文。 当前消息(Current Message):用户最新发送的内容。 用户记忆(User Memories) 内容:存储关于用户的稳定事实(如姓名、职位、偏好、技术水平等)。 格式:以 XML 格式注入提示词中。 更新机制:既包含后台的隐式更新,也支持用户通过“记住这个”或“删除这个”等指令进行的显式编辑。 对话历史的处理机制 这是 Claude 与 ChatGPT 最大的不同之处,主要由三种机制协同工作: 滚动窗口(Rolling Window):针对当前对话,保留完整的消息内容(而非摘要),直到达到 Token 限制(约 190k tokens)。 conversation_search 工具:允许 Claude 根据主题或关键词搜索过去的对话。 recent_chats 工具:允许 Claude 根据时间检索最近的对话。 总结性对比 ChatGPT:依赖预计算的摘要,每次对话都自动注入,确保了轻量级的连续性,但细节较少。 Claude:依赖 conversation_search 和 recent_chats 等工具进行按需检索。这种方式更高效(不浪费 Token 在无关历史上)且更具深度,但流程上可能不如 ChatGPT 无缝,因为其依赖于模型的检索决策。 我逆向工程了 Claude 的记忆系统,这是我的发现! 2025年12月14日 · Manthan Gupta...

December 16, 2025 · 3 min · fisherdaddy

介绍一下 Claude Opus 4.5

2025 年 11 月 25 日,Anthropic 正式发布了 Claude Opus 4.5 ,这是目前在编程、智能体(Agent)协作以及计算机操作领域最先进的模型。它在处理深度研究、幻灯片制作和电子表格等日常任务上也有显著提升,代表了 AI 系统能力的又一次飞跃。 关键细节 卓越的编程与推理能力 超越人类的测试成绩:在 Anthropic 内部用于招聘的高难度工程测试中,Claude Opus 4.5 在 2 小时的时间限制内,得分超过了以往所有的人类候选人。 基准测试提升:在 Terminal Bench 测试中,该模型比 Sonnet 4.5 提升了 15% ;在 Excel 自动化任务中,准确率提升了 20% ,效率提升了 15% 。 创造性解决问题:在 $\tau$-bench 测试中(模拟航空公司客服),模型展示了极高的灵活性,通过“先升舱再改签”的合规策略解决了看似无法处理的修改航班请求,体现了深度的推理能力。 成本效益与开发工具 定价与获取:开发者现在可以通过 API 使用 claude-opus-4-5-20251101 ,定价为每百万 token $5 / $25 ,这使得 Opus 级别的能力更加普及。 效率提升:在处理长程编程任务时,该模型可节省高达 65% 的 token 用量。工具调用错误和构建错误减少了 50% 到 75% 。 新的控制参数:API 新增了 “effort parameter” (努力程度参数),允许开发者在速度/成本与极致性能之间进行权衡。在最高设定下,其表现超出 Sonnet 4.5 4....

November 25, 2025 · 3 min · fisherdaddy

介绍一下 Anthropic 推出的 Agent Skills

Anthropic 最近虽然口碑差,但人才密度还是高,继 MCP 之后他们又新推出来 Agent Skills,这个思路非常好,既给了 Agent 确定性,也给了其几乎无限的上下文,顺便帮你省了钱。也算是和 MCP 互补,一个连接外部系统,一个连接本地脚本和文档。 Agent Skills 的核心思想也很简单,就是通过提供一个由Skill、脚本和资源组成的结构化文件夹,将领域专家的知识打包在这些文件夹中,让 Agent 能够动态加载这些“Skills”。 Skill 的构成与工作原理大概是下面这样: 一个 Agent Skill 本质上就是一个包含 SKILL.md 文件的目录,该文件有一定的规范,比如必须以包含元数据(如name和description)的 YAML 前置内容开头等等。 Agent Skills 通过分层加载信息来高效管理上下文窗口: 第一层: Agent 在启动时仅加载所有已安装 Skill 的name 和 description,以便知道何时使用某个 Skill。 第二层: 当 Agent 认为某个 Skill 与当前任务相关时,它会读取该技能的 SKILL.md 文件的完整内容。 第三层及以上: 对于更复杂的任务,技能可以包含额外的辅助文件(如 reference.md 或脚本)。Agent 只在需要时才会读取这些文件,这个意思基本就是 Skills 可以包含几乎无限的上下文信息。 Skill 中可以包含预先编写好的固定的代码(如 Python 脚本)。Agent 可以像使用工具一样执行这些代码,以处理传统代码更擅长的确定性或高效率的任务,而不需要把代码本身加载到上下文中。 这个的好处很明显,把AI 生成的质量不稳定的代码变成稳定可控的代码,既大大缩小上下文,也节省了很多成本。 这篇文章中也举了两个 Skills 的典型应用例子: 通过AI 生成的代码来对列表进行排序,远比简单地运行一个排序算法要昂贵得多。除了效率问题,许多应用还需要只有代码才能提供的确定性可靠性。 PDF Skills 包含一个预先编写的 Python 脚本,用于读取 PDF 并提取所有表单字段。Claude 可以在不将脚本或 PDF 加载到上下文的情况下运行此脚本。而且由于代码是确定性的,这个工作流程是一致且可重复的。...

October 17, 2025 · 2 min · fisherdaddy

Claude Code 深度揭秘:从“多开大法”到强大的智能体SDK,开发者是如何玩转AI的

Anthropic 的 Cat Wu (Claude Code) 和 Alex Albert (Claude Relations) 讨论了 Claude Code 团队如何对新功能进行原型设计,使用 Claude Code SDK 的最佳实践,以及在与开发人员一起构建我们的代理式编码解决方案过程中学到的其他经验。本文整理自对此讨论,带你 5 分钟了解这篇访谈的精华。 你有没有想过,当一群顶尖的AI工程师为自己打造一款编程工具时,会发生什么?答案是:迭代速度快得惊人,而且会催生出一些开发者社区独有的“黑话”,比如“Multi-Clauding”(多开Claude)。 最近,Anthropic 的 Claude Relations 负责人 Alex 和 Claude Code 产品经理 Cat 坐下来聊了聊,揭开了这款炙手可热的AI编程工具背后的故事。从团队内部的开发流程,到用户五花八门的使用姿势,再到未来人人都能构建专属智能体(Agent)的蓝图,信息量非常大。 迭代的秘诀:先让内部员工“嗨”起来 你有没有觉得,Claude Code 好像总是在更新?每次在终端里打开它,似乎都有新功能冒出来。这种“疯狂”的交付速度背后,藏着一套非常独特的开发哲学。 Cat 解释说,Claude Code 团队里全是些产品嗅觉敏锐的工程师。很多新功能的诞生,不是来自冗长的产品需求文档,而是源于一个简单的念头:“嘿,如果有个功能能帮我做……就太酷了。” 接下来会发生什么?他们不会去写文档,而是直接用 Claude Code 把这个功能的原型给做出来。 “用 Claude Code 做原型太快了,所以大部分时候,大家干脆跳过文档,直接动手。” 这个原型会立刻在公司内部发布,让所有 Anthropic 的员工(他们亲切地称自己为“Ants”)来试用。如果大家用得不亦乐乎,反馈特别积极,那它就达到了上线的标准,因为这强烈预示着外部用户也会喜欢它。 这就是他们的“吃狗粮”(Dogfooding)闭环——产品好不好,自己人先用个爽。这种方式不仅快,而且非常有效,因为开发者最懂开发者。 一种工具,N种玩法:从创业公司到世界500强 Claude Code 的一个神奇之处在于,它的上手体验极其顺滑。无论你是单打独斗的独立开发者,还是财富500强企业里的工程师,只需要一个 npm install 命令,几乎无需任何配置,它就能立刻投入工作。因为它能直接访问你本地的文件和工具,让你对它的能力范围有个非常清晰的认知。 有趣的是,不同规模的团队,渐渐玩出了完全不同的花样。 创业公司的玩法:放手去做与“Multi-Clauding” 小公司的工程师们更喜欢让 Claude “放飞自我”。他们会开启 auto-accept mode(自动接受模式),让 Claude 自主修改代码,无需每次都手动确认。...

August 22, 2025 · 1 min · fisherdaddy