可靠 Agent 的工程模式

一条可以继续验证的思路

Agent 评测

这里有 3 篇文章,从一个词走向真实工作里的选择;先读懂,再决定要不要使用。

阅读线程开放
3篇札记
阅读方式先找到你卡住的地方,再顺着证据和取舍走

每篇可以独立阅读,也可以沿着这条线程继续。

可靠 Agent 的工程模式无需登录

本页解决的问题

先给结论

什么是「Agent 评测」,它会影响哪些 AI 决策?

没有评测,修一个 bug 制造三个。Anthropic 的 Eval 方法论 本页把相关概念、常见误区和实践文章放在同一条阅读线程里。

判断标准

先判断你卡在定义、选择还是验证,再从下方 3 篇文章中选择最接近的一篇。

下一步

从「为什么评测比训练更重要」开始,读完后用自己的任务复述结论。

常见误区

不要把同一主题下的所有方法当成可互换方案;输入、风险和验收标准变化时,答案也会变化。

这条问题线程

把一个词放回它真正影响的选择里。

3 篇札记
方法论

为什么评测比训练更重要

没有评测,修一个 bug 制造三个。Anthropic 的 Eval 方法论

可靠 Agent 的工程模式 3 min →
实战

三种 Grader:代码、模型、人工

静态断言 vs LLM-as-Judge vs 人工校准,每种适合什么场景

可靠 Agent 的工程模式 3 min →
案例

评测的坑:噪音、作弊与退化

基础设施噪音可造成 6pp 误差、模型会识别考试、改 Prompt 可能让 Eval 掉 3%

可靠 Agent 的工程模式 3 min →