模型周围的 Harness
一条可以继续验证的思路
成本优化与选型
这里有 12 篇文章,从一个词走向真实工作里的选择;先读懂,再决定要不要使用。
阅读线程开放
12篇札记
阅读方式先找到你卡住的地方,再顺着证据和取舍走
每篇可以独立阅读,也可以沿着这条线程继续。
模型周围的 Harness无需登录
本页解决的问题
先给结论什么是「成本优化与选型」,它会影响哪些 AI 决策?
Token 累积成本可视化,拖动轮次查看费用如何指数增长 本页把相关概念、常见误区和实践文章放在同一条阅读线程里。
判断标准
先判断你卡在定义、选择还是验证,再从下方 12 篇文章中选择最接近的一篇。
下一步
从「多轮对话为什么越来越贵」开始,读完后用自己的任务复述结论。
常见误区
不要把同一主题下的所有方法当成可互换方案;输入、风险和验收标准变化时,答案也会变化。
这条问题线程
把一个词放回它真正影响的选择里。
交互
多轮对话为什么越来越贵
Token 累积成本可视化,拖动轮次查看费用如何指数增长
模型周围的 Harness 3 min →
交互
KV Cache:用空间换时间(和钱)
类比理解 + 节省效果计算器,拖动轮次查看节省比例
模型周围的 Harness 3 min →
交互
显式缓存:实战对比
cache_control 写法、缓存命中判断、价格折扣对比,真实省钱效果演示
模型周围的 Harness 3 min →
反例
动态时间戳:最贵的 System Prompt
错误设计 vs 正确设计,三种时间处理方案对比切换
模型周围的 Harness 3 min →
系统设计
综合成本优化:从系统角度省钱
5 层优化策略,成本构成可视化,节省 70-90% 的系统设计
模型周围的 Harness 3 min →
多模态
图片 Token:像素也在烧钱
图片计费公式、缩放机制、分辨率陷阱、按任务分级策略
模型周围的 Harness 3 min →
多模态
按任务匹配分辨率
高/中/低三档分辨率策略,不同场景的 Token 消耗对比与选型建议
模型周围的 Harness 3 min →
提示词工程
语法层优化:写给机器的提示词
YAML vs JSON、CSV vs 数组、压缩 JSON 输出,格式性 Token 省 10-30%
模型周围的 Harness 3 min →
RAG
语义层优化:不要把上下文当垃圾桶
动态 Few-Shot、LLMLingua-2 压缩、关键信息放首尾,提升信息密度
模型周围的 Harness 3 min →
架构
输出层 + KV Cache 进阶
负向约束、Diff 润色、停止序列;KV Cache 的工具陷阱与滑动窗口问题
模型周围的 Harness 3 min →
选型
模型选型:能力 vs 成本
主流模型能力/成本矩阵、选型决策树、不同场景的模型匹配策略
模型周围的 Harness 3 min →
收官
大道至简:坚守第一性原理
AI Harness 的本质 / 做 vs 不做的取舍 / 会被时代淘汰的 Harness / 终极问题
模型周围的 Harness 3 min →