Claude 值班:Claude Tag 如何担任 Anthropic CI/CD 故障的第一响应者

Anthropic 的 CI/CD 团队把 Claude Tag 部署成事故响应的第一响应者:它持续监控告警,调用多个子智能体并行调查证据,提出缓解或修复方案,并在事后沉淀经验与完成交接。本文完整介绍了这套值班系统的配置、检测、分诊、解决和验证流程。 原文:Claude on call: How Claude Tag serves as Anthropic’s first responder for CI/CD failures 本文由 LobsterAI 自动翻译和发布。 面向 CI/CD 的 AI 事故响应:Claude 在 Anthropic 值班 几周前,我正在值班。晚上 10 点,一位同事在 Slack 上给我发来消息:某项新服务中大约有 44 个测试没有运行。 过去,我会停下手头的事,在笔记本电脑前坐好,疲惫地叹口气,然后开始一段长达一小时的调查与修复流程。但现在,我的工作方式已经完全不同:我会把 @Claude 拉进来,问问它看到了什么。 这一次,Claude 发现:当天早上开启某个功能标志后,这些测试就消失了;同时,它还判断回滚该变更是安全的。我让同事回滚了这个标志。3 分钟后,Claude 在 Slack 上提醒我,并确认相关跳过规则确实已被移除,错误率也恢复到了基线水平。 为清晰起见,根据一次真实交流重新设计。 过去几个月里,Claude Tag 一直是 Anthropic CI/CD 故障值班体系中的第一响应者。它不仅改善了我们的业余生活,也让每起 CI 事故都能立即得到响应:近期所有形成情况报告的事故,其第一份报告均由 Claude 撰写;通常,它会在 15 分钟内发布初步分析。 本文将介绍我们构建了什么、它如何运作,以及你如何亲手搭建类似系统,从此不再害怕轮到自己值班。 我们的 Claude 值班配置 在逐一介绍事故响应流程的各个阶段之前,我先概述一下整体配置。这样,当我们继续补充细节时,你能始终把握全局。 一个值班智能体需要具备:记忆,以便记住已经完成的工作;连接与访问权限,以便调查、理解并采取行动;调度能力,以便知道何时恢复工作;以及指令,以便知道该做什么。 Claude Tag 是我们值班智能体的骨干。它会保留值班 Slack 频道中的上下文记忆,同时提供一个界面,方便我们在事故期间为每一轮交互下达指令。Claude 还会实时响应值班频道及其他频道中的事件。例行任务——也就是 Claude 定期执行的操作——同样在这个频道里通过自然语言提示进行调度,例如:“每周一上午 9:00(美国东部时间)执行 CI 交接。”...

August 29, 2026 · 2 min · fisherdaddy