Token 成本工程:让账算得过来

一条可以继续验证的思路

四层实战优化

这里有 4 篇文章,从一个词走向真实工作里的选择;先读懂,再决定要不要使用。

阅读线程开放
4篇札记
阅读方式先找到你卡住的地方,再顺着证据和取舍走

每篇可以独立阅读,也可以沿着这条线程继续。

Token 成本工程:让账算得过来无需登录

本页解决的问题

先给结论

什么是「四层实战优化」,它会影响哪些 AI 决策?

加粗的 ** 就吃掉 8.5% Token;复杂对象用 YAML、扁平列表用 CSV、后台输出强制 Minified JSON 本页把相关概念、常见误区和实践文章放在同一条阅读线程里。

判断标准

先判断你卡在定义、选择还是验证,再从下方 4 篇文章中选择最接近的一篇。

下一步

从「语法层:Prompt 是写给机器的」开始,读完后用自己的任务复述结论。

常见误区

不要把同一主题下的所有方法当成可互换方案;输入、风险和验收标准变化时,答案也会变化。

这条问题线程

把一个词放回它真正影响的选择里。

4 篇札记
实战

语法层:Prompt 是写给机器的

加粗的 ** 就吃掉 8.5% Token;复杂对象用 YAML、扁平列表用 CSV、后台输出强制 Minified JSON

Token 成本工程:让账算得过来 3 min →
实战

语义层:双重蒸馏

中段迷失效应:塞得越多越抓不住重点。动态 Few-Shot 从 4000 砍到 500,LLMLingua-2 压缩 5-20 倍

Token 成本工程:让账算得过来 3 min →
实战

架构层:KV Cache 的注意事项

前缀匹配最高省 90%;动态切换工具为什么把缓存全打穿,滑动窗口 vs 章节缓存

Token 成本工程:让账算得过来 3 min →
实战

输出层:管住模型的嘴

明确的负向约束砍掉 30% 废话;润色用 Diff 别重写整段;停止序列做物理截断

Token 成本工程:让账算得过来 3 min →