工程进阶 · 可靠 Agent 的工程模式

做最简单的、能跑的东西

Anthropic 的核心工程哲学:"Do the simplest thing that works"

本页解决的问题

先给结论

「做最简单的、能跑的东西」要解决的关键问题是什么?

Anthropic 的核心工程哲学:"Do the simplest thing that works"

判断标准

让这个结论先证明自己值得留下。 把这一页当成决策工具,而不是需要背下来的定义。把概念连到一个真实任务、一个可观察结果,以及一个能改变你判断的失败上。

下一步

写下一个问题:试完这个方法后,你能用什么证据回答它?

常见误区

结论听起来很完整,却没有检查最关键的假设。

"Do the simplest thing that works"
AI Agent 工程实践
从 Claude Code 源码中学到的三条核心教训
1
Agent 的核心是状态管理,不是智能
所有 Agent 工程化问题最终都归结为同一个问题:什么信息在什么时候、以什么形式出现在上下文窗口里。模型的智能是预训练给的,你控制不了;但上下文的构建、裁剪、排列,是工程师能决定的。
Claude Code 的大部分工程复杂度在于精心管理上下文:什么该放进去、什么该拿出来、什么时候该压缩、什么时候该重置,让模型变聪明反倒是次要的。Context Engineering 是 Agent 工程的核心能力,远不止锦上添花。
2
Harness 编码的是假设,假设会过时
你今天写的每一行脚手架代码,都隐含着对当前模型能力的假设。当模型升级时,这些假设可能全部失效。
真实案例:Claude Sonnet 4.5 存在上下文焦虑:对话变长时模型表现明显下降。团队为此加了 context reset 机制,定期压缩上下文。后来换到 Opus 4.5,焦虑现象消失了,context reset 反而成了降低效率的累赘。启示:你今天写的脚手架,明天可能就需要扔掉。
3
模型在变强,你的工程在变简单
越来越多的辅助逻辑(重试、纠错、格式化、上下文压缩)会随着模型能力的提升变得不必要。最好的工程决策是:今天不写明天可能不需要的代码
这并不意味着不需要工程化。相反,理解哪些逻辑会随模型进步而过时,哪些是真正持久的架构决策,这种判断力才是最重要的工程能力。沙箱隔离、权限分层、评测体系不会过时;但特定的 Prompt 技巧、特定模型的绕道方案,半年后可能就不需要了。
FULL JOURNEY

四个篇章的完整回顾

PART 1
理解大模型是什么
从 Transformer 的注意力机制到 Token 经济学,从训练过程到涌现能力。大模型是有明确能力边界的概率模型,远不是无所不能的黑盒。
PART 2
学会用大模型
从 Prompt Engineering 到 Few-shot Learning,从 RAG 到 Function Calling。掌握和大模型协作的方法论,让它成为你的效率倍增器。
PART 3
从 Demo 到产品
从「能跑」到「能用」的鸿沟。成本优化、延迟控制、评测体系、安全合规,把一个 AI Demo 变成可靠的生产级产品。
PART 4
从产品到设计模式
五种 Workflow + 自主 Agent、上下文工程、工具设计、长运行架构、安全容器化。基于开源工程实践,掌握 Agent 时代的核心设计模式。
这些设计模式不是终点,它们会随着下一代模型的到来而改变。
但理解它们背后的思考方式,才是真正可迁移的能力。
ACKNOWLEDGEMENT
本课程进阶篇章基于公开的 Claude Code 源码与工程博客。

「从 Claude Code 源码中学到的三条核心教训」为什么能找到相关内容

「Anthropic 的核心工程哲学:"Do the simplest thing that works"」把检索问题从“把资料存起来”推进到“怎样找到真正相关的资料”。这一步决定了 RAG、推荐和以图搜图最后交给模型的输入质量。

相似度不是答案,召回之后还要核对

在「Anthropic 的核心工程哲学:"Do the simplest thing that works"」对应的流程里,Embedding 负责把对象放到可比较的语义空间,近邻索引负责减少搜索范围,最终的回答仍然依赖召回片段是否覆盖问题、距离指标是否合适,以及内容有没有过期。

先区分找得到和找得准

把「Anthropic 的核心工程哲学:"Do the simplest thing that works"」落成一次小测试:准备几条有明确答案的查询,记录召回的相关性、遗漏和无关结果,再决定是否需要换切分方式、索引或重排。

从「从 Claude Code 源码中学到的三条核心教训」走到「四个篇章的完整回顾」

「从 Claude Code 源码中学到的三条核心教训」先把问题落在「1 Agent 的核心是状态管理,不是智能 所有 Agent 工程化问题最终都归结为同一个问题: 什么信息在什么时候、以什么形式出现在上下文窗口里 。模型的智能是预训练给的,你控制不了;但上下文的构建、裁剪、排列,是工程师能决定的。 Claude Code 的大部分工程复杂度在于精心管理上下文:什么该放进去、什么该拿出来、什么时候该压缩、什么时候该重置,让模型变聪明反倒是次要的。 Context Engineerin…」上;到了「四个篇章的完整回顾」,讨论继续推进到「PART 1 理解大模型是什么 从 Transformer 的注意力机制到 Token 经济学,从训练过程到涌现能力。大模型是有明确能力边界的概率模型,远不是无所不能的黑盒。 PART 2 学会用大模型 从 Prompt Engineering 到 Few-shot Learning,从 RAG 到 Function Calling。掌握和大模型协作的方法论,让它成为你的效率倍增器。 PART 3 从 Demo 到产…」。两段连起来,重点就不只是记住一个结论,而是看清它成立所依赖的条件。

把这条判断带到下一个场景

检索系统也可以这样看:先确定什么算相关,再观察召回是否覆盖问题,最后检查排序、切分和时效性有没有把真正有用的内容挤出去。

  • 「从 Claude Code 源码中学到的三条核心教训」:1 Agent 的核心是状态管理,不是智能 所有 Agent 工程化问题最终都归结为同一个问题: 什么信息在什么时候、以什么形式出现在上下文窗口里 。模型的智能是预训练给的,你控制不了;但上下文的构建、裁剪、排列,是工程师能决定的。 Claude Code 的大部分工程复杂度在于精心管理上下文:什么该放进去、什么该拿出来、什么时候该压缩、什么时候该重置,让模型变聪明反倒是次要的。 Context Engineerin…
  • 「四个篇章的完整回顾」:PART 1 理解大模型是什么 从 Transformer 的注意力机制到 Token 经济学,从训练过程到涌现能力。大模型是有明确能力边界的概率模型,远不是无所不能的黑盒。 PART 2 学会用大模型 从 Prompt Engineering 到 Few-shot Learning,从 RAG 到 Function Calling。掌握和大模型协作的方法论,让它成为你的效率倍增器。 PART 3 从 Demo 到产…

最后的「最后把结论落到实践」把讨论落到「Anthropic 的核心工程哲学:"Do the simplest thing that works"」。回看这条线索时,最值得保留的是:当输入、规模或风险改变,哪些判断需要重新做一遍。

标记为已学完 阅读进度会自动记录
← 上一篇下一篇 →

继续阅读

同一条线上的下一篇。

文章讨论

读到这里,留下一个判断。

把刚想明白的地方、还没想通的问题,留给下一位一起学习的人。

正在讨论 做最简单的、能跑的东西 可靠 Agent 的工程模式
3条讨论文章讨论 · 与共学社区同步
在共学社区查看
AM
Asha Morgan内容编辑
观点实践记录

我把这篇文章里的一个判断改写成了今天可以验证的小实验。比记住结论更有用的是,知道下一步要观察什么。

文章讨论7 有帮助
LH
Lin Harper独立开发者
观点观点

读完以后我先回头找它成立的条件,而不是直接把方法搬进项目。这个顺序让后面的取舍清楚很多。

文章讨论5 有帮助
KM
Kiki Moore产品运营
问题问题

如果把这个判断放到真实工作里,最先需要补的约束是什么?我想知道从阅读到第一次实践之间,哪一步最值得先做。

文章讨论4 有帮助