Harness 核心 · 模型周围的 Harness

汇总(下)· 成本优化 + PM 视角

五层成本体系 / KV Cache 原理 / 图片 Token / 课程完整能力清单

本页解决的问题

先给结论

「汇总(下)· 成本优化 + PM 视角」要解决的关键问题是什么?

五层成本体系 / KV Cache 原理 / 图片 Token / 课程完整能力清单

判断标准

让这个结论先证明自己值得留下。 把这一页当成决策工具,而不是需要背下来的定义。把概念连到一个真实任务、一个可观察结果,以及一个能改变你判断的失败上。

下一步

写下一个问题:试完这个方法后,你能用什么证据回答它?

常见误区

结论听起来很完整,却没有检查最关键的假设。

Part 3 · 成本优化
💰
三、成本优化五层体系
综合使用可降低 70-90% Token 成本
模型路由 简单任务用轻量模型(分类、抽取);复杂推理才用旗舰模型 省 60-80%
语法层 YAML 替代 JSON(省 15-30%),CSV 替代数组(省 40%+),删 Markdown 装饰 省 15-40%
语义层 动态 Few-Shot 向量匹配(省 87%),LLMLingua-2 压缩长文档(省 60%),关键信息放开头/结尾 省 60-87%
输出层 负向约束(精准截止废话),Diff 润色(只输出改动),Stop Sequence(及时截止) 省 20-50%
KV Cache 固定 System Prompt 前缀 → 缓存命中率高;避免动态时间戳(每次不同 = 永远 MISS) 省 30-60%
❌ 动态时间戳
每次前缀不同
System Prompt 含「现在是 {time}」,每次请求前缀变化 → KV Cache 永远 MISS
✅ 静态前缀
前缀不变,缓存稳定
时间放 user message,不放 system;System Prompt 保持固定 → 持续 HIT
Part 4 · AI PM 综合认知
🎯
四、AI PM 综合认知
从基础到工程,带走完整视角
🖼️
图片 Token 成本
分辨率 ≠ 质量。粗分类 512px 足够,OCR 用 1K-2K,高精检测才用 4K。按任务匹配可降低 60-90% 图片成本。
🛡️
Prompt 安全
4 类攻击:越权注入 / 角色逃逸 / Few-Shot 污染 / 符号注入。4 层防御:输入过滤 + 权限分层 + 输出验证 + 审计日志。
📊
多轮对话成本
每轮都把完整历史带入 → 成本指数增长。必须主动做上下文压缩,设计历史管理策略。
🔄
流式返回
Markdown 和 XML 流式友好;JSON/YAML 需等全文才能解析。格式选择影响用户体验和工程复杂度。
两篇章的终极结论
AI Harness 的本质是精心设计每一条 Message。从上下文管理到成本优化,全都是在设计那个发给模型的 Message List。
你已掌握的能力
理解 LLM 原理 识别并缓解幻觉 设计 Prompt 评估输出格式 规划 Agent 架构 系统性降低成本 防御 Prompt 攻击
Harness 核心篇完结 · 恭喜完成 AI Harness 完整学习 · 从基础认知到工程落地,你已具备 AI PM 的核心视角。

「Part 3 · 成本优化」为什么能找到相关内容

「五层成本体系 / KV Cache 原理 / 图片 Token / 课程完整能力清单」把检索问题从“把资料存起来”推进到“怎样找到真正相关的资料”。这一步决定了 RAG、推荐和以图搜图最后交给模型的输入质量。

相似度不是答案,召回之后还要核对

在「五层成本体系 / KV Cache 原理 / 图片 Token / 课程完整能力清单」对应的流程里,Embedding 负责把对象放到可比较的语义空间,近邻索引负责减少搜索范围,最终的回答仍然依赖召回片段是否覆盖问题、距离指标是否合适,以及内容有没有过期。

先区分找得到和找得准

把「五层成本体系 / KV Cache 原理 / 图片 Token / 课程完整能力清单」落成一次小测试:准备几条有明确答案的查询,记录召回的相关性、遗漏和无关结果,再决定是否需要换切分方式、索引或重排。

从「Part 3 · 成本优化」走到「Part 4 · AI PM 综合认知」

「Part 3 · 成本优化」先把问题落在「💰 三、成本优化五层体系 综合使用可降低 70-90% Token 成本 模型路由 简单任务用轻量模型(分类、抽取);复杂推理才用旗舰模型 省 60-80% 语法层 YAML 替代 JSON(省 15-30%),CSV 替代数组(省 40%+),删 Markdown 装饰 省 15-40% 语义层 动态 Few-Shot 向量匹配(省 87%),LLMLingua-2 压缩长文档(省 60%),关键信息放开头/结尾…」上;到了「Part 4 · AI PM 综合认知」,讨论继续推进到「🎯 四、AI PM 综合认知 从基础到工程,带走完整视角 🖼️ 图片 Token 成本 分辨率 ≠ 质量。粗分类 512px 足够,OCR 用 1K-2K,高精检测才用 4K。按任务匹配可降低 60-90% 图片成本。 🛡️ Prompt 安全 4 类攻击:越权注入 / 角色逃逸 / Few-Shot 污染 / 符号注入。4 层防御:输入过滤 + 权限分层 + 输出验证 + 审计日志。 📊 多轮对话成本 每轮…」。两段连起来,重点就不只是记住一个结论,而是看清它成立所依赖的条件。

把这条判断带到下一个场景

检索系统也可以这样看:先确定什么算相关,再观察召回是否覆盖问题,最后检查排序、切分和时效性有没有把真正有用的内容挤出去。

  • 「Part 3 · 成本优化」:💰 三、成本优化五层体系 综合使用可降低 70-90% Token 成本 模型路由 简单任务用轻量模型(分类、抽取);复杂推理才用旗舰模型 省 60-80% 语法层 YAML 替代 JSON(省 15-30%),CSV 替代数组(省 40%+),删 Markdown 装饰 省 15-40% 语义层 动态 Few-Shot 向量匹配(省 87%),LLMLingua-2 压缩长文档(省 60%),关键信息放开头/结尾…
  • 「Part 4 · AI PM 综合认知」:🎯 四、AI PM 综合认知 从基础到工程,带走完整视角 🖼️ 图片 Token 成本 分辨率 ≠ 质量。粗分类 512px 足够,OCR 用 1K-2K,高精检测才用 4K。按任务匹配可降低 60-90% 图片成本。 🛡️ Prompt 安全 4 类攻击:越权注入 / 角色逃逸 / Few-Shot 污染 / 符号注入。4 层防御:输入过滤 + 权限分层 + 输出验证 + 审计日志。 📊 多轮对话成本 每轮…

最后的「最后把结论落到实践」把讨论落到「五层成本体系 / KV Cache 原理 / 图片 Token / 课程完整能力清单」。回看这条线索时,最值得保留的是:当输入、规模或风险改变,哪些判断需要重新做一遍。

标记为已学完 阅读进度会自动记录
← 上一篇下一篇 →

继续阅读

同一条线上的下一篇。

文章讨论

读到这里,留下一个判断。

把刚想明白的地方、还没想通的问题,留给下一位一起学习的人。

正在讨论 汇总(下)· 成本优化 + PM 视角 模型周围的 Harness
3条讨论文章讨论 · 与共学社区同步
在共学社区查看
AM
Asha Morgan内容编辑
观点实践记录

我把这篇文章里的一个判断改写成了今天可以验证的小实验。比记住结论更有用的是,知道下一步要观察什么。

文章讨论7 有帮助
LH
Lin Harper独立开发者
观点观点

读完以后我先回头找它成立的条件,而不是直接把方法搬进项目。这个顺序让后面的取舍清楚很多。

文章讨论5 有帮助
KM
Kiki Moore产品运营
问题问题

如果把这个判断放到真实工作里,最先需要补的约束是什么?我想知道从阅读到第一次实践之间,哪一步最值得先做。

文章讨论4 有帮助