Harness 核心 · 模型周围的 Harness

综合成本优化:从系统角度省钱

5 层优化策略,成本构成可视化,节省 70-90% 的系统设计

本页解决的问题

先给结论

「综合成本优化:从系统角度省钱」要解决的关键问题是什么?

5 层优化策略,成本构成可视化,节省 70-90% 的系统设计

判断标准

让这个结论先证明自己值得留下。 把这一页当成决策工具,而不是需要背下来的定义。把概念连到一个真实任务、一个可观察结果,以及一个能改变你判断的失败上。

下一步

写下一个问题:试完这个方法后,你能用什么证据回答它?

常见误区

结论听起来很完整,却没有检查最关键的假设。

五层优化策略
依次点击,叠加效果(再次点击可取消)
成本模拟器
每天 10 万次对话 · 点击上方策略叠加优化效果
优化前
重复历史 35%
不必要RAG 25%
旗舰模型 20%
必要计算 20%
100%
当前
重复历史
不必要RAG
旗舰模型
必要 20%
已节省
100%
KV Cache −35% 模型路由 −12% RAG过滤 −18% 历史压缩 −8% 语义缓存 −7%
0%
已叠加节省
实施详情
↑ 点击上方任意策略,查看实施流程
成本优化 = 架构设计,不是事后补救。 在系统设计之初就考虑这 5 层,比上线后再优化容易 10 倍。

「五层优化策略」为什么能找到相关内容

「5 层优化策略,成本构成可视化,节省 70-90% 的系统设计」把检索问题从“把资料存起来”推进到“怎样找到真正相关的资料”。这一步决定了 RAG、推荐和以图搜图最后交给模型的输入质量。

相似度不是答案,召回之后还要核对

在「5 层优化策略,成本构成可视化,节省 70-90% 的系统设计」对应的流程里,Embedding 负责把对象放到可比较的语义空间,近邻索引负责减少搜索范围,最终的回答仍然依赖召回片段是否覆盖问题、距离指标是否合适,以及内容有没有过期。

先区分找得到和找得准

把「5 层优化策略,成本构成可视化,节省 70-90% 的系统设计」落成一次小测试:准备几条有明确答案的查询,记录召回的相关性、遗漏和无关结果,再决定是否需要换切分方式、索引或重排。

从「五层优化策略」走到「成本模拟器」

「五层优化策略」先把问题落在「依次点击,叠加效果(再次点击可取消) 优先级 1 KV Cache + 固定 System Prompt 最简单、效果最大。历史命中缓存,重算归零 节省 30–50% 优先级 2 意图识别 → 模型路由 80% 简单问题用小模型,复杂的才上旗舰 节省 40–60% 优先级 3 RAG 触发过滤 加"是否需要 RAG"判断,跳过不必要的向量检索 节省 20–40% 优先级 4 对话历史压缩(摘要策略) 超过 N 轮后…」上;到了「成本模拟器」,讨论继续推进到「每天 10 万次对话 · 点击上方策略叠加优化效果 优化前 重复历史 35% 不必要RAG 25% 旗舰模型 20% 必要计算 20% 100% 当前 重复历史 不必要RAG 旗舰模型 必要 20% 已节省 100% KV Cache −35% 模型路由 −12% RAG过滤 −18% 历史压缩 −8% 语义缓存 −7% 0% 已叠加节省」。两段连起来,重点就不只是记住一个结论,而是看清它成立所依赖的条件。

把这条判断带到下一个场景

检索系统也可以这样看:先确定什么算相关,再观察召回是否覆盖问题,最后检查排序、切分和时效性有没有把真正有用的内容挤出去。

  • 「五层优化策略」:依次点击,叠加效果(再次点击可取消) 优先级 1 KV Cache + 固定 System Prompt 最简单、效果最大。历史命中缓存,重算归零 节省 30–50% 优先级 2 意图识别 → 模型路由 80% 简单问题用小模型,复杂的才上旗舰 节省 40–60% 优先级 3 RAG 触发过滤 加"是否需要 RAG"判断,跳过不必要的向量检索 节省 20–40% 优先级 4 对话历史压缩(摘要策略) 超过 N 轮后…
  • 「成本模拟器」:每天 10 万次对话 · 点击上方策略叠加优化效果 优化前 重复历史 35% 不必要RAG 25% 旗舰模型 20% 必要计算 20% 100% 当前 重复历史 不必要RAG 旗舰模型 必要 20% 已节省 100% KV Cache −35% 模型路由 −12% RAG过滤 −18% 历史压缩 −8% 语义缓存 −7% 0% 已叠加节省
  • 「实施详情」:↑ 点击上方任意策略,查看实施流程 成本优化 = 架构设计,不是事后补救。 在系统设计之初就考虑这 5 层,比上线后再优化容易 10 倍

最后的「实施详情」把讨论落到「↑ 点击上方任意策略,查看实施流程 成本优化 = 架构设计,不是事后补救。 在系统设计之初就考虑这 5 层,比上线后再优化容易 10 倍」。回看这条线索时,最值得保留的是:当输入、规模或风险改变,哪些判断需要重新做一遍。

标记为已学完 阅读进度会自动记录
← 上一篇下一篇 →

继续阅读

同一条线上的下一篇。

文章讨论

读到这里,留下一个判断。

把刚想明白的地方、还没想通的问题,留给下一位一起学习的人。

正在讨论 综合成本优化:从系统角度省钱 模型周围的 Harness
3条讨论文章讨论 · 与共学社区同步
在共学社区查看
AM
Asha Morgan内容编辑
观点实践记录

我把这篇文章里的一个判断改写成了今天可以验证的小实验。比记住结论更有用的是,知道下一步要观察什么。

文章讨论7 有帮助
LH
Lin Harper独立开发者
观点观点

读完以后我先回头找它成立的条件,而不是直接把方法搬进项目。这个顺序让后面的取舍清楚很多。

文章讨论5 有帮助
KM
Kiki Moore产品运营
问题问题

如果把这个判断放到真实工作里,最先需要补的约束是什么?我想知道从阅读到第一次实践之间,哪一步最值得先做。

文章讨论4 有帮助