模型周围的 Harness

一条可以继续验证的思路

成本优化与选型

这里有 12 篇文章,从一个词走向真实工作里的选择;先读懂,再决定要不要使用。

阅读线程开放
12篇札记
阅读方式先找到你卡住的地方,再顺着证据和取舍走

每篇可以独立阅读,也可以沿着这条线程继续。

模型周围的 Harness无需登录

本页解决的问题

先给结论

什么是「成本优化与选型」,它会影响哪些 AI 决策?

Token 累积成本可视化,拖动轮次查看费用如何指数增长 本页把相关概念、常见误区和实践文章放在同一条阅读线程里。

判断标准

先判断你卡在定义、选择还是验证,再从下方 12 篇文章中选择最接近的一篇。

下一步

从「多轮对话为什么越来越贵」开始,读完后用自己的任务复述结论。

常见误区

不要把同一主题下的所有方法当成可互换方案;输入、风险和验收标准变化时,答案也会变化。

这条问题线程

把一个词放回它真正影响的选择里。

12 篇札记
交互

多轮对话为什么越来越贵

Token 累积成本可视化,拖动轮次查看费用如何指数增长

模型周围的 Harness 3 min →
交互

KV Cache:用空间换时间(和钱)

类比理解 + 节省效果计算器,拖动轮次查看节省比例

模型周围的 Harness 3 min →
交互

显式缓存:实战对比

cache_control 写法、缓存命中判断、价格折扣对比,真实省钱效果演示

模型周围的 Harness 3 min →
反例

动态时间戳:最贵的 System Prompt

错误设计 vs 正确设计,三种时间处理方案对比切换

模型周围的 Harness 3 min →
系统设计

综合成本优化:从系统角度省钱

5 层优化策略,成本构成可视化,节省 70-90% 的系统设计

模型周围的 Harness 3 min →
多模态

图片 Token:像素也在烧钱

图片计费公式、缩放机制、分辨率陷阱、按任务分级策略

模型周围的 Harness 3 min →
多模态

按任务匹配分辨率

高/中/低三档分辨率策略,不同场景的 Token 消耗对比与选型建议

模型周围的 Harness 3 min →
提示词工程

语法层优化:写给机器的提示词

YAML vs JSON、CSV vs 数组、压缩 JSON 输出,格式性 Token 省 10-30%

模型周围的 Harness 3 min →
RAG

语义层优化:不要把上下文当垃圾桶

动态 Few-Shot、LLMLingua-2 压缩、关键信息放首尾,提升信息密度

模型周围的 Harness 3 min →
架构

输出层 + KV Cache 进阶

负向约束、Diff 润色、停止序列;KV Cache 的工具陷阱与滑动窗口问题

模型周围的 Harness 3 min →
选型

模型选型:能力 vs 成本

主流模型能力/成本矩阵、选型决策树、不同场景的模型匹配策略

模型周围的 Harness 3 min →
收官

大道至简:坚守第一性原理

AI Harness 的本质 / 做 vs 不做的取舍 / 会被时代淘汰的 Harness / 终极问题

模型周围的 Harness 3 min →