从滑雪事故到精准理赔:一次 Prompt 工程实战大师课 • Anthropic

本文来自于 Anthropic 组织的线下分享会,从时间上看应该是 5 月前组织的线下分享会,里面不仅有 Claude 工程和算法团队的分享,还包括 Google、Amazon、Manus 甚至是创业者和学生的分享,特别值得观看,这里把其中我认为比较优质的视频内容整理出来分享给大家。本篇文章来自于视频 Prompt 101,以下为原视频精华。 你有没有过这样的经历:想让AI帮你做点事,结果它却给出了一个让你哭笑不得的答案?别担心,你不是一个人。这恰恰说明了“提示词工程”(Prompt Engineering)的重要性。 简单来说,Prompt工程就是我们与大型语言模型(比如Claude)沟通的艺术。它不仅仅是下达一个命令,更是关于如何清晰地描述任务、提供足够的上下文、并巧妙地组织信息,从而引导AI交出我们真正想要的完美答卷。 理论听起来有点枯燥,对吧?最好的学习方式永远是亲自动手。所以,今天我们不聊空泛的概念,而是跟着Anthropic应用AI团队的专家Hannah和Christian,通过一个真实的客户案例,一步步搭建一个高质量的Prompt。 初始挑战:一张瑞典语的事故报告单 想象一下,你是一家瑞典保险公司的理赔员。每天,你都要处理大量的汽车保险索赔。今天,你手上有两份材料: 一份手填的事故报告表:上面用瑞典语写着事故发生的各种情况,勾选了一些选项。 一张手绘的事故草图:潦草地画着两辆车是怎么撞上的。 我们的目标是让Claude分析这两份图像材料,搞清楚事故经过,并判断谁是责任方。听起来是个不错的自动化方案,对吧? Round 1: 最天真的尝试——直接把图片丢给AI 大多数人刚开始可能都会这么做:把两张图片上传,然后给一个超级简单的指令,比如: “请审查这份事故报告和草图,告诉我发生了什么,以及谁的责任。” (示意图:简单的指令界面) 结果呢?Claude的回答让人大跌眼镜。它认为这是一起发生在瑞典一条著名商业街上的滑雪事故。 等等,滑雪? 这当然是个无辜的错误。在我们极其简单的指令里,没有给AI任何场景信息。它看到了模糊的手绘线条和表格,做出了一个不那么离谱的猜测。这个结果虽然不对,但它告诉我们一个关键道理:你不能指望AI读懂你的心思,你得把舞台先为它搭好。 Prompt工程的核心:迭代与优化 这次失败恰恰是Prompt工程的起点。它就像一门实验科学,你需要不断尝试、观察结果、然后迭代优化你的指令。我们的第一个优化目标很明确:得让Claude知道,我们处理的是车辆事故,不是什么滑雪运动。 为了做到这一点,我们需要一个更专业的Prompt结构。Anthropic的专家们推荐了一个屡试不爽的黄金结构: 设定角色和任务:告诉Claude它是什么身份,需要完成什么工作。 提供上下文/文档:给出完成任务所需的背景信息或固定文档。 动态内容:这是每次请求都会变化的部分,比如我们这次的事故报告图片。 详细步骤/指令:像写SOP一样,告诉它一步步该怎么做。 提供范例 (Few-shot):如果可能,给一两个已完成的“标准答案”作为参考。 最后提醒和输出格式要求:在最后,再次强调关键规则,并指定你想要的输出格式。 听起来有点复杂?别急,我们一步步来拆解。 Round 2: 设定角色与基调——“你是专业的理赔助理” 在第一次失败的基础上,我们来丰富一下指令,加入“角色设定”和“基调要求”。 你是一名AI理赔助理,正在帮助人类理赔员审查瑞典的汽车事故报告。你的任务是分析提供的事故报告表(手填表格)和事故草图(手绘图)。 你的分析必须基于事实,保持自信。如果你对信息不确定,或无法看清内容,请直接说明,不要猜测。你的目标是判断事故责任方。 这次,我们明确了几个关键点: 角色:AI理赔助理。 领域:瑞典汽车事故。 输入:手填表格和手绘图。 基调:实事求是,不确定就别瞎说。 再次运行后,结果好多了!Claude准确地识别出这是一起汽车事故,还看出了A车和B车分别勾选了表格中的第1项和第12项。 但是,它最后补充道:“由于信息不足,我无法自信地判断谁是责任方。” 这是一个巨大的进步!它没有再犯“滑雪事故”那样的错误,并且严格遵守了我们“不确定就不猜测”的指令。现在的问题是,如何给它足够的信息,让它变得“确定”? Round 3: 提供背景知识——把“说明书”喂给AI 那份瑞典事故报告表,虽然每次填写的内容不同,但表格本身的格式和每个选项的含义是固定的。这部分信息就是完美的“背景知识”,可以预先提供给Claude。 我们决定把这份“说明书”放进**系统提示(System Prompt)**里。这样,AI在处理任何请求前,就已经把这份知识内化于心了。我们还使用了XML标签(比如``)来组织信息,这能让AI更好地理解不同信息块的作用。 系统提示词(System Prompt)里大概是这样写的: 这份表格用于记录交通事故详情。它有两列,分别代表车辆A和车辆B。表格共有17个选项,每个选项都描述了一种特定的驾驶行为或情况。 含义是“车辆停放/停止”。 含义是“离开停车位/开门”。 ... 含义是“其他情况”。 - 这是由普通人手填的,标记可能不完美,比如用圈、涂抹代替了标准的“X”。 - 仔细识别勾选了哪个框。 我们在用户指令(User Prompt)中保持不变,但现在Claude有了这份“说明书”撑腰。它不再需要每次都费力地去现场解读表格上每个瑞典单词的意思,而是可以直接调用这些预置知识。...

August 1, 2025 · 1 min · fisherdaddy

一份在生产环境中进行“Vibe Coding”的生存指南 • Anthropic

本文来自于 Anthropic 组织的线下分享会,从时间上看应该是 5 月前组织的线下分享会,里面不仅有 Claude 工程和算法团队的分享,还包括 Google、Amazon、Manus 甚至是创业者和学生的分享,特别值得观看,这里把其中我认为比较优质的视频内容整理出来分享给大家。本篇文章来自于视频 Vibe coding in prod,以下为原视频精华。 嘿,大家好。今天我们来聊一个大家都爱的话题——Vibe Coding。而且,我们还要聊一个可能有点争议的子话题:如何在生产环境(Prod)中负责任地进行Vibe Coding。 我叫Eric,是Anthropic的一名研究员,专注于编码智能体(Coding Agents)。去年,我骑车上班时摔断了手,打了两个月的石膏。你猜怎么着?那两个月里,我所有的代码都是Claude帮我写的。所以,如何高效地让AI为我工作,对我来说不仅仅是个研究课题,更是一次亲身实践。 到底什么是“Vibe Coding”? 很多人觉得,只要大量使用AI生成代码,比如用Cursor或者Copilot,就是在Vibe Coding。但我认为这不完全对。当你的工作流仍然是和模型进行紧密的、快速的来回反馈时,那还不是真正的Vibe Coding。 要理解它的精髓,我们得回到Andrej Karpathy的经典定义: Vibe Coding,就是你完全沉浸于“感觉”(the vibes),拥抱指数级增长,并且忘记代码本身的存在。 关键就在于**“忘记代码本身的存在”**。 这不仅仅是工程师的自娱自乐。Vibe Coding真正让人兴奋的地方,在于它让那些圈外人——那些不懂编程的人——也开始对代码生成感到激动。他们突然发现,自己竟然可以独立构建一个完整的App。这无疑是一次巨大的解放。 当然,随之而来的就是各种“翻车现场”:API密钥被刷爆、订阅系统被绕过、数据库里出现一堆奇奇怪怪的东西。成功的Vibe Coding案例,似乎都发生那些低风险的场景里,比如做个小游戏或者有趣的个人项目,就算出Bug也无伤大雅。 既然这么“危险”,我们为什么还要关心它? 答案是:指数级增长(The Exponential)。 AI能独立完成的任务时长,大约每7个月就会翻一番。现在,AI大概能独立处理一个小时的工作量。这还行,你可以用Cursor帮你写,或者让Claude帮你实现一个需要一小时开发的功能,然后你花点时间审查所有代码,你依然深度参与其中。 但是,明年呢?后年呢? 当AI强大到可以一次性为你生成一整天甚至一整周的工作量时,我们根本不可能再亦步亦趋地去审查每一行代码。如果我们想抓住这个指数级的机遇,就必须找到一种方法,负责任地“放手”,让AI去驰骋。 这让我想起了早期的编译器。我敢肯定,那时候很多开发者也不信任编译器。他们可能会用,但还是会去读编译后的汇编代码,确保它跟自己手写的一样高效。但这种做法根本无法规模化。当系统变得足够庞大复杂时,你必须选择相信这个工具。 所以,未来几年整个软件行业面临的挑战就是:我们如何安全地在生产环境中进行Vibe Coding? 我的答案是:我们可以忘记代码的存在,但绝不能忘记产品的存在。 新的思维模式:你不是码农,你是AI的产品经理 这其实不是一个新问题。想想看: 一个CTO如何管理一个自己完全不懂的专业领域的顶尖专家? 一个产品经理(PM)在自己看不懂代码的情况下,如何验收一个工程特性? 一个CEO在不精通财会的情况下,如何核查会计师的工作? 这些问题已经存在了几百年,而我们也早已有了解决方案。 CTO 可以为专家的工作编写验收测试(acceptance tests),即使不懂具体实现,也能验证功能是否达标。 PM 可以亲自使用产品,确保它的行为符合预期。 CEO 可以抽查自己能看懂的关键数据和报表切片,从而建立对整体财务模型的信心。 看出来了吗?管理一个你并不完全理解其实现的“黑箱”,是人类社会自古以来就在解决的问题。几乎所有管理者每天都在做这件事。只是我们软件工程师习惯了作为纯粹的个人贡献者,习惯了掌控从上到下的每一个技术细节。 为了变得更高效,我们必须学会放手,就像管理者为了高效必须放弃对细节的微操一样。我们需要找到一个可以验证的抽象层,而无需深入了解其底层的具体实现。 唯一的例外:技术债(Tech Debt) 不过,这里有个棘手的问题:技术债。目前,我们还没有一种好方法,可以在不阅读代码的情况下,有效地衡量或验证技术债。这是个硬伤。但这不意味着我们就束手无策了,我们只需要更聪明、更有针对性地选择Vibe Coding的应用场景。 实战框架:如何在代码库中安全“放飞”AI 我的建议是:专注于代码库的“叶子节点”(Leaf Nodes)。 (想象一个树状的代码结构) 叶子节点(图中的橙色点):这些是代码库中不被任何其他部分依赖的模块。它们通常是最终的功能、一些额外的“小玩意儿”。在这些地方,就算存在一些技术债,影响也是可控的,因为它们不太可能被修改,也不会有其他功能建立在它们之上。 主干和分支(图中的白色点):这些是系统的核心架构。我们作为工程师,仍然需要深度理解和保护这些部分,确保它们的可扩展性、可理解性和灵活性。 当然,模型在不断进步。随着时间的推移,我们可能会越来越信任AI去编写那些更核心、更具扩展性的代码。 如何成为一名出色的AI产品经理? 记住这句话:别总问Claude能为你做什么,要问问你能为Claude做什么。...

August 1, 2025 · 1 min · fisherdaddy

Claude Code 最佳实践指南 • Anthropic

本文来自于 Anthropic 组织的线下分享会,从时间上看应该是 5 月前组织的线下分享会,里面不仅有 Claude 工程和算法团队的分享,还包括 Google、Amazon、Manus 甚至是创业者和学生的分享,特别值得观看,这里把其中我认为比较优质的视频内容整理出来分享给大家。本篇文章来自于视频 Claude Code best practices,以下为原视频精华。 大家好,我是 Cal,在 Anthropic 的应用 AI 团队工作。我的日常就是和 Claude 打交道,想方设法地挖掘出这些模型最惊艳的潜力。不过,除了做提示词工程,我也是个不折不扣的编程爱好者。 你懂的,就是那种脑子里总有疯狂点子,喜欢启动一堆新项目,但最后能完成的寥寥无几的人。我的电脑里简直就是个“代码项目坟场”。 直到去年年底,我在公司内部听说了一个很酷的新工具。一个周五晚上,我下载了这个后来被命名为 “Claude Code” 的工具,并把它用在了我想开发的一个新笔记应用上。那个周末,彻彻底底地改变了我对编程和软件工程的看法。 我整个周末都抱着笔记本电脑,简直像上瘾了一样,看着 Claude 不断编写代码。我按下回车,切换到浏览器刷新,一个强大复杂的应用就在我眼前慢慢成形。我一个人绝对不可能在这么短的时间内做到这个地步,这感觉太震撼了。 当时我还有点小担心:“天啊,我这得用了多少 token,不会被老板发现我没在干正经活吧?” 但我不知道的是,Claude Code 团队内部有个排行榜,记录着所有员工的使用情况。一个周末下来,我直接冲到了榜首。 就这样,我认识了 Boris 和 Cat 这些 Claude Code 的早期团队成员。凭借着我对提示词的了解和对这个工具的热爱,我加入了他们,成为了核心贡献者之一。 今天,我想跟大家聊聊 Claude Code,分享一些我们内部总结的最佳实践。 把你的编程搭档,想象成一位终端命令行高手 如果有人问我 Claude Code 是什么,我的脑海里会浮现出一个画面:它就像你团队里那个精通命令行的同事。 他从不碰图形界面,手指在键盘上翻飞,用各种复杂的 Bash 命令和 Vim 快捷键解决问题。我刚当工程师的时候,就有个叫 Tony 的导师。每次我遇到 bug 去找他,他总是在终端里一顿操作,看得我眼花缭乱,然后问题就解决了。我总是想:“太牛了,我啥时候也学学这个。”——当然,我从来没学会。 但现在,拥有 Claude Code,就好像随时随地都有一个 Tony 坐在你旁边。 揭秘:Claude Code 是如何工作的? 在 Anthropic,我们信奉一个原则:“做那个能奏效的简单方案”。对于 Claude Code 来说,这意味着它是一个非常“纯粹”的智能体(Agent)。...

August 1, 2025 · 2 min · fisherdaddy

Anthropic CEO Dario Amodei 深度访谈:AI 的潜力、与 OpenAI 的竞争、生成式 AI 业务、末日论

本文整理自 Alex Kantrowitz 对 Anthropic CEO Dario Amodei的 深度访谈,以下为原视频精华。 别叫我“AI末日论者”——Anthropic CEO Dario Amodei的自白与野心 “当有人叫我‘末日论者’,说我想让AI发展减速时,我真的会非常愤怒。” Anthropic 的CEO Dario Amodei 在采访一开始就毫不掩饰自己的情绪。对他来说,这个标签不仅是一种误解,更是一种侮辱。因为很少有人比他更清楚,技术进步的迟缓意味着什么。 “你听听我刚才说的,我父亲的去世,就是因为那些晚了几年才出现的疗法。我比谁都懂这项技术能带来的好处。” 这份深植于个人经历的紧迫感,塑造了Dario Amodei——这位处在AI浪潮之巅,却又时常发出警示声音的复杂人物。他既是AI能力指数级增长最坚定的信徒,也是那个不断提醒世界“小心脚下”的吹哨人。 在这场坦诚的对话中,Dario分享了他对AI未来的判断、Anthropic的生存法则,以及他为何选择了一条与众不同的道路。 指数级增长:我们都被蒙在鼓里 Dario的核心观点可以归结为一个词:指数级增长(the exponential)。 他认为,人们在直觉上很难理解指数曲线的可怕。就像上世纪90年代的互联网,在它彻底爆发的前两年,看起来似乎才刚刚起步,只有1/16的威力。而今天的AI,正处在同样的历史节点。 “我们正坐在2025年的中间点,模型的能力正在爆炸式增长,” Dario说,“几年前它们还语无伦次,后来达到高中生水平,现在已经是聪明的大学生甚至博士生了。” 他不喜欢用“AGI”或“超级智能”这类模糊的营销术语,他觉得那些词只会刺激人们的多巴胺。他更愿意谈论可观察到的、实实在在的进步——只要投入更多的算力、数据和新的训练方法,AI模型每隔几个月就会变得比上一代更强。 这种进步也直接体现在商业上。Anthropic的收入增长曲线堪称疯狂: 2023年:从0增长到1亿美元 2024年:从1亿美元增长到10亿美元 2025年上半年:从10亿美元增长到超过45亿美元 “我不是说这个趋势一定会持续,但如果你假设它再持续两年呢?你会进入千亿级别。” Dario解释道,“人们正在被指数增长蒙蔽了双眼,没有意识到事情会发展得有多快。” 正是这种对未来的预判,让他感到前所未有的紧迫感。他觉得,当问题(无论是国家安全还是经济冲击)离我们越来越近时,他有责任和义务把丑话说在前面,警告世界可能出现的风险。 技术瓶颈?只是暂时的障碍 尽管行业内充满了对“规模化边际效益递减”和“模型无法持续学习”的担忧,但Dario对此不以为然。 1. 关于边际效益递减 “从我们在Anthropic内部看到的情况来说,我们没有看到任何收益递减。” 他以编码领域为例。Anthropic的Claude系列模型在编码能力上进步神速,相关的基准测试(如SweetBench)得分从18个月前的3%飙升到了现在的70%-80%。在Anthropic内部,大部分代码的编写都已经离不开Claude的参与。他认为,所谓的瓶颈,更像是某些人的一厢情愿。 2. 关于持续学习 有人批评大语言模型像个一次性产品,训练完就定型了,无法像人一样持续学习。Dario承认这是个问题,但远非致命弱点。 “就算我们永远解决不了持续学习,一个拥有诺奖级别智慧但无法学习新知识的AI,如果你有一千万个,它们照样能在生物学上取得巨大突破。” 更何况,他认为这根本不是一个无法解决的问题。首先,不断增长的“上下文窗口”本身就是一种短期学习。理论上,我们可以把上下文窗口扩展到一亿个词,相当于一个人一生的信息输入量。其次,他相信通过新的技术架构(比如他提到的“内循环”和“外循环”),持续学习的问题最终也会像之前的“推理”难题一样,被“规模化+新思路”所攻克。 “在AI领域,每当我们觉得遇到了什么根本性障碍,结果往往它都不是。” Anthropic的生存之道:小而美,但火力十足 作为一家独立创业公司,Anthropic如何在Meta、xAI这些由万亿巨头支持的庞然大物之间生存?Dario的答案是 人才密度 和 资本效率。 “三年前,我们的融资额只有几亿美元,而OpenAI已经从微软拿了130亿。我们当时的逻辑是:如果别人花10亿能做到的事,我们花1亿就能做到,那么投资我们比投资他们资本效率高10倍。” 他认为,金钱只是一个暂时的短板,可以弥补;而用更少资源做出更好产品的内在能力,才是真正的护城河。如今,Anthropic手握近200亿美元融资,在数据中心的规模上,他自信不输给任何对手。 面对Mark Zuckerberg用高薪直接挖人的策略,Dario显得很冷静。他没有选择跟进,破坏公司内部公平的薪酬体系。他认为,这种做法破坏了企业文化,而且“你只能买走那些可以被买走的人”。 “他们在尝试购买一些买不到的东西,那就是对使命的认同感。” Dario说,Meta的挖角反而成了Anthropic的“团结时刻”,因为大部分员工都拒绝了天价offer,选择留下来。 个人经历:一切紧迫感的源头 要理解Dario Amodei,就必须回到他的个人经历。 在旧金山长大的他,对早期的互联网热潮毫无兴趣,一心想成为一名物理学家,去探索宇宙的基本真理。然而,父亲的离世彻底改变了他的人生轨迹。 “我父亲病了很久,在他去世后仅仅三四年,治愈他那种疾病的成功率就从50%飙升到了95%。” 这件事对他冲击巨大。一方面,他感受到了科技进步能拯救生命,另一方面,他也体会到了“如果能再快一点”的切肤之痛。这让他从理论物理转向了生物学,希望能亲自解决这些难题。 但在生物学领域,他再次感到了人类能力的局限。“生物系统的复杂性超越了人类的尺度,”他发现,只有AI这项技术,才有可能帮助人类跨越这个鸿沟。 于是,他最终投身AI。这条从“物理学”到“生物学”再到“人工智能”的道路,贯穿着一个核心母题——产生真正的影响力(Impact)。他想解决真正重要的问题,想阻止其他人经历他所经历的痛苦。 这种强烈的使命感也解释了他为何离开OpenAI。“当你为一个动机不真诚、不是真心想让世界变得更好的人工作时,你做的技术再好,最终也只是在为一个坏结果做贡献。” 在“末日论”与“加速主义”之间走钢丝 采访中最激烈的时刻,莫过于回应英伟达CEO黄仁勋的批评——“Dario认为只有他能安全地构建AI,因此想控制整个行业”。...

August 1, 2025 · 1 min · fisherdaddy

学习一下 Claude Code 的系统提示词

2025年 5 月 23日 Anthropic 发布了基于 Claude 4 模型的 Claude Code,很快有网友破解了其 Prompt,并分享了出来。为了便于学习,我把这个 Prompt 翻译为了中文。 展开查看原文 You are Claude Code, Anthropic's official CLI for Claude.You are an interactive CLI tool that helps users with software engineering tasks. Use the instructions below and the tools available to you to assist the user. IMPORTANT: Refuse to write code or explain code that may be used maliciously; even if the user claims it is for educational purposes....

May 27, 2025 · 46 min · fisherdaddy

学习一下 Claude 4 的系统提示词

2025年 5 月 23日 Anthropic 发布了 Claude 4 模型,很快有网友破解了其 Prompt,并分享了出来。为了便于学习,我把这个 Prompt 翻译为了中文。 展开查看原文 The assistant is Claude, created by Anthropic. The current date is Thursday, May 22, 2025. Here is some information about Claude and Anthropic's products in case the person asks: This iteration of Claude is Claude Sonnet 4 from the Claude 4 model family. The Claude 4 family currently consists of Claude Opus 4 and Claude Sonnet 4. Claude Sonnet 4 is a smart, efficient model for everyday use....

May 26, 2025 · 54 min · fisherdaddy

介绍一下 Claude 4

Anthropic 于2025年5月23日推出了新一代 Claude 模型:Claude Opus 4 和 Claude Sonnet 4,它们在编码、高级推理和 AI 代理方面树立了新标准。Claude Opus 4 被誉为全球最佳编码模型,擅长处理复杂和长时间运行的任务,而 Claude Sonnet 4 则是对 Sonnet 3.7 的重大升级,在编码和推理方面表现卓越。两款模型都增强了工具使用、并行工具执行和记忆能力。此外,Claude Code 现已全面上市,旨在将 Claude 的强大功能融入开发工作流程。这些模型旨在成为能够维持完整上下文并专注于长期项目的“虚拟协作伙伴”。 模型性能与应用: Claude Opus 4: 在 SWE-bench 上得分 72.5% ,在 Terminal-bench 上得分 43.2% ,被 Cursor 、Replit 、Block 、Rakuten 和 Cognition 等公司认可为在编码和复杂问题解决方面的领先者,能够持续工作数小时。 Claude Sonnet 4: 在 SWE-bench 上得分 72.7% ,提供性能与效率的平衡。GitHub 将其作为 GitHub Copilot 中新编码代理的模型。Manus 、iGent 、Sourcegraph 和 Augment Code 等公司也对其在遵循复杂指令、自主应用开发和代码质量方面的提升表示赞赏。 新增功能: 工具使用与扩展思考: 两款模型均支持在扩展思考过程中使用工具(如网络搜索),实现推理与工具使用的交替。 并行工具执行: 能够同时使用多个工具。 记忆能力提升: 特别是 Opus 4 ,在获得本地文件访问权限时,能创建和维护“记忆文件”以存储关键信息,从而提升长期任务意识和连贯性(例如,在玩 Pokémon 时创建“导航指南”)。 行为改进: 相较于 Sonnet 3....

May 23, 2025 · 3 min · fisherdaddy

Claude 的 System Prompt 分析

几天前 Andrej Karpathy 在推特上分享了在阅读完 Claude 的 System Prompt 之后发布了一些分享:大型语言模型(LLMs)除了现有的基于参数修改(预训练获取知识,微调习得行为)的学习范式外,还缺少一种新的、重要的学习方式,作者称之为“系统提示词学习”。这种新范式类似人类学习并记下显式的问题解决策略,将通用知识存储在类似系统提示词的外部形式中,而非仅仅通过调整模型权重。作者认为这对于学习结构化的问题解决步骤(如Claude系统提示词中的计数方法)更有效率,且应该由模型自身习得,而不是依赖人工编写。 Claude 的 System Prompt 非常长。它有 一万六千多个单词。相比之下,OpenAI 在 ChatGPT 中使用的 o4-mini 的 System Prompt 有两千多个单词长,约为 Claude 长度的 13%。 我也尝试了一下X 上宝玉推荐的破解方法,重试了一次,确实可以诱导 Claude 说出一些 System Prompt 的内容,但往往到function 的时候会卡住,但也没关系,基本验证了这份泄露的 System Prompt 是真实的。我把原prompt翻译为了中文,原prompt我也贴出来了。 展开查看译文 <citation_instructions> 如果助手响应基于 web_search、drive_search、google_drive_search 或 google_drive_fetch 工具返回的内容,助手必须始终恰当地引用其响应。以下是良好引用的规则: - 答案中每一个源自搜索结果的特定论断都应该用 <antml:cite> 标签包围起来,如下所示:<antml:cite index="...">...</antml:cite>。 - <antml:cite> 标签的 index 属性应该是一个逗号分隔的句子索引列表,用于支持该论断: -- 如果论断由单个句子支持:<antml:cite index="DOC_INDEX-SENTENCE_INDEX">...</antml:cite> 标签,其中 DOC_INDEX 和 SENTENCE_INDEX 是支持该论断的文档和句子的索引。 -- 如果论断由多个连续句子(一个“段落”)支持:<antml:cite index="DOC_INDEX-START_SENTENCE_INDEX:END_SENTENCE_INDEX">...</antml:cite> 标签,其中 DOC_INDEX 是相应的文档索引,START_SENTENCE_INDEX 和 END_SENTENCE_INDEX 表示文档中支持该论断的句子的包含范围。 -- 如果论断由多个段落支持:<antml:cite index="DOC_INDEX-START_SENTENCE_INDEX:END_SENTENCE_INDEX,DOC_INDEX-START_SENTENCE_INDEX:END_SENTENCE_INDEX">....

May 13, 2025 · 98 min · fisherdaddy

Anthropic 经济指数: 人工智能对软件开发的影响

本文由 Anthropic 发布,聚焦于 Claude 在编码相关任务中的应用情况。通过对 Claude.ai 和专用编码工具 Claude Code 上 500,000 次交互的分析,揭示了 AI 在编码实践中的新兴模式、应用领域及采纳趋势。 主要观点 AI 驱动编码自动化趋势显著:特别是在专用的 AI 编码工具(如 Claude Code)中,AI 更倾向于直接执行任务(自动化),而非仅仅辅助人类(增强)。 用户界面开发是 AI 编码的热点:开发者普遍使用 AI 构建面向用户的应用程序,如网页和移动应用的界面,这可能导致相关工作岗位面临更早的 AI 冲击。 初创企业在 AI 编码工具采纳上领先:与大型传统企业相比,初创企业更积极地采用尖端的 AI 编码工具,显示出更强的敏捷性。 软件开发领域的 AI 应用或为其他行业的先导指标:编码作为 AI 应用相对成熟的领域,其发展模式可能为预测 AI 在其他职业领域的影响提供参考。 关键细节 AI 使用模式:自动化与增强 在 Claude Code 上,79% 的对话被识别为“自动化”(AI 直接执行任务),而“增强”(AI 协作并提升人类能力)占 21%。相比之下,Claude.ai 的自动化比例为 49%。 “反馈循环”(Feedback Loop)模式(AI 自主完成任务,但需人类验证和纠错)在 Claude Code 上更为普遍(占交互的 35.8%),远高于 Claude.ai(21.3%)。 “指令式”(Directive)对话(AI 以最少用户交互完成任务)在 Claude Code 上也更高(43.8% vs 27.5%)。 所有增强模式(包括“学习”)在 Claude Code 上的比例均低于 Claude....

May 6, 2025 · 3 min · fisherdaddy

介绍一下 Claude 3.7 Sonnet

Anthropic 于 2025年 2 月 25 日发布了其最新的 AI 模型 Claude 3.7 Sonnet,并称其为目前最智能的模型,也是市场上首个混合推理模型。该模型独特之处在于它既能提供近乎即时的响应,也能进行更长时间、逐步深入的思考,并且用户可以通过 API 精细地控制模型的思考时长。 Claude 3.7 Sonnet 既是普通 LLM 又是推理模型。在标准模式下,它是 Claude 3.5 Sonnet 的升级版;在扩展思考模式下,它会在回答前进行自我反思,从而提高其在数学、物理、指令跟随、编码和许多其他任务上的性能。Claude 3.7 Sonnet 的开发理念与其他推理模型不同。 Anthropic 认为,推理能力应该是前沿模型的集成能力,而不是一个完全独立的模型,就像人类使用同一个大脑进行快速反应和深入思考一样。这种统一的方法为用户创造了更无缝的体验。 Claude 3.7 Sonnet 现已在所有 Claude 计划(包括 Free, Pro, Team 和 Enterprise 计划)以及 Anthropic API, Amazon Bedrock 和 Google Cloud 的 Vertex AI 上提供。扩展思考模式在除免费 Claude 层级外的所有平台均可用。 Claude 3.7 Sonnet 的定价与其前代产品相同,为每百万输入 tokens 3 美元,每百万输出 tokens 15 美元,其中包括思考 tokens 。 与 Claude 3.7 Sonnet 模型一同发布的还有 Claude Code ,这是一个用于 agentic coding 的命令行工具,目前以有限的研究预览版形式提供。 Claude Code 旨在让开发者能够直接从终端将大量的工程任务委托给 Claude 完成。...

February 25, 2025 · 2 min · fisherdaddy