判断力

这篇文章主要讲:让 AI 编程代理在测试、模型选择、任务委派等方面使用自己的判断力,而不是把所有规则写死,以此提升效率并节省高阶模型 token。 本文由 LobsterAI 翻译、整理和发布。 原文链接:https://simonwillison.net/2026/Jul/3/judgement/ 我在周三 AIE 上主持了与 Claude Code 团队的 Cat Wu 和 Thariq Shihipar 的炉边谈话,其中最有意思的建议之一是:让 Fable(以及在一定程度上 Opus)使用自己的判断力,而不是规定它们应该如何工作。 他们给出的例子是测试。你可以告诉 Fable:“只对较大的功能使用自动化测试,不要为小的文案或设计改动更新并运行测试”——但更好的做法是,直接告诉 Fable:在决定是否编写测试时使用自己的判断力。 Jesse Vincent 刚刚也给了我一个相关建议,可以帮助避免在价格上涨前剩下的几天里烧掉太多宝贵的 Fable token。告诉 Fable:对较小的任务使用其他模型,并由它自己判断该使用哪个模型。 “我刚刚这样提示 Claude Code:” For all coding tasks use your judgement to decide an appropriate lower power model and run that in a subagent Claude 把这个记忆文件保存到了 ~/.claude/projects/name-of-project/memory/delegate-coding-to-subagents.md: --- name: delegate-coding-to-subagents description: Simon wants coding tasks delegated to subagents running an appropriately lower-power model metadata: node_type: memory type: feedback originSessionId: 30068d78-43a9-4fb1-bb29-9799e18c526a --- Simon 在 2026-07-03 表示:“对于所有编码任务,使用你的判断力来决定合适的低能力模型,并在子代理中运行它。”...

July 6, 2026 · 1 min · fisherdaddy

2024 年我们从大语言模型 (Large Language Model, LLM) 中学到的 • Simon Willison

本文是 Django 联合创始人 Simon Willison 所写,他主要回顾了2024 年,大语言模型 (LLMs) 领域经历了显著的发展和变革,以下是主要的趋势与关键事件: GPT-4 壁垒被突破:多家机构开发的模型超越了 GPT-4 的性能,并推动了更长的上下文输入和多模态能力的发展。 LLM 成本大幅下降:由于竞争加剧和效率提升,运行和训练 LLM 的成本显著降低,同时对环境的影响也得到了部分缓解。 多模态 LLM 的崛起:支持图像、音频甚至视频输入的多模态模型变得普遍,语音和实时视频交互成为现实。 生成式 AI 应用的普及:基于提示生成应用程序的能力已经成为主流,许多模型支持即时创建和使用互动工具。 “代理人”尚未实现预期:尽管“代理人”概念被频繁提及,但由于模型的可信度和工具使用能力的限制,其实际应用仍未成熟。 评估的重要性提升:开发可靠的自动化评估工具成为构建 LLM 应用的关键技能。 环境影响的两面性:虽然单次推理的能耗降低,但数据中心的扩建对环境造成了更大压力。 知识分布不均:公众对 LLM 的认知与实际技术发展之间存在巨大差距,需要更多的教育和引导。 关键细节 GPT-4 壁垒的突破 性能超越:2024 年,18 个组织的模型在 Chatbot Arena 排行榜上超越了 GPT-4(如 Google 的 Gemini 1.5 Pro 和 Anthropic 的 Claude 3.5)。 上下文长度扩展:从 2023 年的 4,096 或 8,192 个 token 提升到 2024 年的 100,000+,Google 的 Gemini 系列甚至支持 200 万个 token。 多模态能力:Gemini 1....

January 6, 2025 · 10 min · fisherdaddy