零基础入门 · 先把 AI 的雾气拨开

企业都在建的「知识库」是什么?

三步动画:文件切块入库 → 提问时检索 → 塞进上下文再回答;同一个问题有无知识库的回答对比

本页解决的问题

先给结论

企业都在建的「知识库」是什么?

三步动画:文件切块入库 → 提问时检索 → 塞进上下文再回答;同一个问题有无知识库的回答对比

判断标准

让这个结论先证明自己值得留下。 把这一页当成决策工具,而不是需要背下来的定义。把概念连到一个真实任务、一个可观察结果,以及一个能改变你判断的失败上。

下一步

写下一个问题:试完这个方法后,你能用什么证据回答它?

常见误区

结论听起来很完整,却没有检查最关键的假设。

一句话回答

把公司文件切成小块、建好索引,AI 回答前先去里面找出相关的几段,塞进对话里再作答。它拿着你的资料说话,出处也能标给你看。

看个演示 · 三步看懂知识库

整个知识库的运转就三步。点「下一步」逐步推进,每一步都用刚才那个书架的比方。

📄收集文件:制度手册、产品文档、会议纪要,都是普通的公司文件。
✂️切成小块:长文件切成一段一段的「卡片」,一块讲一件事。
🗂️放上书架并建索引:每块卡片都登记好「讲的是什么」,方便日后按意思查找。
报销制度 · 第1段报销制度 · 第2段考勤规定 · 第1段产品手册 · 第4段休假制度 · 第2段会议纪要 · 第7段
🙋有人提问:「我们的差旅报销上限是多少?」
🔍先查书架:按「意思相近」去找,命中了两张卡片(下面变绿的)。
报销制度 · 第1段报销制度 · 第2段考勤规定 · 第1段产品手册 · 第4段休假制度 · 第2段会议纪要 · 第7段
📌注意:这一步只是「翻书」,AI 还没开口
📄把找到的两段塞进对话,和问题拼在一起交给 AI。
💬AI 照着资料作答:答案来自你的文件,可以少猜、少编。
🔖顺手标出处:「来源:差旅费管理办法.pdf」,你点开原文就能核对。
同一个问题 · 有没有知识库差多少

同样问一句「我们的差旅报销上限是多少」,切换下面两个按钮,看 AI 的回答差在哪里。

为什么不直接把全部文件喂给它

有人会问:干嘛这么麻烦,把公司几百份文件一股脑发给 AI 得了。两个原因:

🪑

台面装不下

AI 一次能「看在眼里」的内容有限,像一张大小固定的工作台,几百份文件根本摊不开。这个台面叫上下文窗口,这一页讲了它为什么会「忘事」

💸

按字数收费

AI 读进去的每个字都按 Token 计费,每次提问都附上全部文件,等于每次都把整个图书馆搬一遍,钱包先受不了。Token 怎么收费看这页

所以知识库的思路很聪明:书都留在架上,每次只把最相关的几页带上考场。省钱,还装得下。

知识库的软肋

知识库让 AI 拿着资料说话,但它分辨真伪的能力有限:书架上的文件过时了,它照着旧文件答;两份文件互相矛盾,它可能各抄一半。它保证的是「有据可查」,管不了「据是否靠谱」。所以建知识库,一半功夫要花在整理文件上:删掉过时的、合并矛盾的,书架干净,答案才干净。

这一页讲的是零基础版。想看工程上怎么切块、怎么建索引、怎么提高命中率,课程正篇有深入版:用 RAG 缓解幻觉

「看个演示 · 三步看懂知识库」为什么能找到相关内容

「把公司文件 切成小块、建好索引 ,AI 回答前先去里面找出相关的几段, 塞进对话里再作答 。它拿着你的资料说话,出处也能标给你看」把检索问题从“把资料存起来”推进到“怎样找到真正相关的资料”。这一步决定了 RAG、推荐和以图搜图最后交给模型的输入质量。

相似度不是答案,召回之后还要核对

在「整个知识库的运转就三步。点「下一步」逐步推进,每一步都用刚才那个书架的比方」对应的流程里,Embedding 负责把对象放到可比较的语义空间,近邻索引负责减少搜索范围,最终的回答仍然依赖召回片段是否覆盖问题、距离指标是否合适,以及内容有没有过期。

  • 知识库 = 开卷考试的书架 :切块、建索引、考试时翻着答,就这三步
  • 能标出处 :答案来自哪份文件一目了然,点开原文就能核对
  • 文件质量决定答案质量 :书架上放了过时或矛盾的资料,AI 也照答

先区分找得到和找得准

把「知识库让 AI 拿着资料说话,但它 分辨真伪的能力有限 :书架上的文件过时了,它照着旧文件答;两份文件互相矛盾,它可能各抄一半。它保证的是「有据可查」,管不了「据是否靠谱」。所以建知识库,一半功夫要花在整理文件上:删掉过时的、合并矛盾的,书架干净,答案才干净」落成一次小测试:准备几条有明确答案的查询,记录召回的相关性、遗漏和无关结果,再决定是否需要换切分方式、索引或重排。

从「看个演示 · 三步看懂知识库」走到「同一个问题 · 有没有知识库差多少」

「看个演示 · 三步看懂知识库」先把问题落在「整个知识库的运转就三步。点「下一步」逐步推进,每一步都用刚才那个书架的比方」上;到了「同一个问题 · 有没有知识库差多少」,讨论继续推进到「同样问一句「我们的差旅报销上限是多少」,切换下面两个按钮,看 AI 的回答差在哪里」。两段连起来,重点就不只是记住一个结论,而是看清它成立所依赖的条件。

把这条判断带到下一个场景

检索系统也可以这样看:先确定什么算相关,再观察召回是否覆盖问题,最后检查排序、切分和时效性有没有把真正有用的内容挤出去。

  • 「看个演示 · 三步看懂知识库」:整个知识库的运转就三步。点「下一步」逐步推进,每一步都用刚才那个书架的比方
  • 「同一个问题 · 有没有知识库差多少」:同样问一句「我们的差旅报销上限是多少」,切换下面两个按钮,看 AI 的回答差在哪里
  • 「最后的要点」:与训练无关 :整个过程不改模型本身,换文件当天生效

最后的「最后的要点」把讨论落到「与训练无关 :整个过程不改模型本身,换文件当天生效」。回看这条线索时,最值得保留的是:当输入、规模或风险改变,哪些判断需要重新做一遍。

✅ 这一页想和你分享的

  • 知识库 = 开卷考试的书架:切块、建索引、考试时翻着答,就这三步
  • 能标出处:答案来自哪份文件一目了然,点开原文就能核对
  • 文件质量决定答案质量:书架上放了过时或矛盾的资料,AI 也照答
  • 与训练无关:整个过程不改模型本身,换文件当天生效
标记为已学完 阅读进度会自动记录
← 上一篇下一篇 →

继续阅读

同一条线上的下一篇。

文章讨论

读到这里,留下一个判断。

把刚想明白的地方、还没想通的问题,留给下一位一起学习的人。

正在讨论 企业都在建的「知识库」是什么? 先把 AI 的雾气拨开
3条讨论文章讨论 · 与共学社区同步
在共学社区查看
AM
Asha Morgan内容编辑
观点实践记录

我把这篇文章里的一个判断改写成了今天可以验证的小实验。比记住结论更有用的是,知道下一步要观察什么。

文章讨论7 有帮助
LH
Lin Harper独立开发者
观点观点

读完以后我先回头找它成立的条件,而不是直接把方法搬进项目。这个顺序让后面的取舍清楚很多。

文章讨论5 有帮助
KM
Kiki Moore产品运营
问题问题

如果把这个判断放到真实工作里,最先需要补的约束是什么?我想知道从阅读到第一次实践之间,哪一步最值得先做。

文章讨论4 有帮助