最小但有用的心智模型:下一个 Token
用句子补全实验建立一个耐用的 LLM 基础模型。它不是全部真相,却能解释上下文、措辞、概率和流畅错误为什么重要。
本页解决的问题
先给结论「最小但有用的心智模型:下一个 Token」要解决的关键问题是什么?
用句子补全实验建立一个耐用的 LLM 基础模型。它不是全部真相,却能解释上下文、措辞、概率和流畅错误为什么重要。
简单,不等于简单化。 下一个 Token 是一个实用的排查视角。答案出乎意料时,先看 Prompt 让哪种续写变得更可能,而不是默认模型已经理解了你的意图。
把一个请求改写到下一步行动不再含糊。
把流畅的续写当成模型理解目标的证据。
先别管 AI。下面三句话都没说完,点开每一句,看看你心里冒出来的下半句,和大多数人是不是一样的。
选一个开头,点「让 AI 接下去」。下面这个框,是它每往下写一步时脑子里的那道选择题——放慢了给你看。留意两件事:一是它不是一个字一个字往外蹦的,「馄饨」「五花肉」「分钟」都是一整块写出来的,这一块叫词元(token)——有的词元是一个字,有的是一个词,后面的课会讲它是怎么切出来的;二是每个候选后面那根横条的长短——横条越长,说明它越倾向于选这一块;有的一步几乎是被前文摁着写出来的,有的一步它明显在几个选项之间摇摆。同一个开头多跑几遍——在几根横条差不多长的地方,它并不总是挑最长的那根。
你可能会问:接话茬我懂了,可我和 AI 是在一问一答地聊天啊?其实,聊天只是接话茬换了个包装——
为什么它能写文章?
接话茬接得又长又顺而已。你给个开头(题目和要求),它一个词一个词往下接,接出一整篇。
为什么它会胡说八道?
它只管接得像不像,不管接得对不对。顺口的错话,比笨拙的真话更容易被它选中。这事很重要,后面单独用一课讲。
为什么同一个问题,每次答得不一样?
上面的演示里,它并不总是挑最长的那根横条——在几个候选可能性相近的地方,它按可能性大小掷一次骰子,于是走上不同的句子岔路。横条长到 99% 的地方则怎么掷都是同一个结果,所以差异只出现在它本来就摇摆的那几处。
你可能听说过「AI 连小学数学都会算错」。学完接话茬,这个谜你已经能自己解开了——它从来不是在「算」,它是在接话茬。下面两道题都发给它试试,看看它脑子里的候选有什么不同。
「第一步 · 你天生就会玩这个游戏」如何改变一次回答
「先别管 AI。下面三句话都没说完, 点开每一句 ,看看你心里冒出来的下半句,和大多数人是不是一样的」说明,模型处理的不是我们眼中的“字数”,而是一段段 Token。Token 的切分方式会影响输入长度、上下文能放下多少内容,以及一次请求要花多少计算。
长度、信息量和上下文不是一回事
当「选一个开头,点「让 AI 接下去」。下面这个框,是它 每往下写一步 时脑子里的那道选择题——放慢了给你看。留意两件事:一是它 不是一个字一个字 往外蹦的,「馄饨」「五花肉」「分钟」都是一整块写出来的,这一块叫 词元 (token)——有的词元是一个字,有的是一个词,后面的课会讲它是怎么切出来的;二是每个候选后面那根 横条 的长短——横条越长,说明它越倾向于选…」变长时,先要分清三件事:文字被切成多少 Token、哪些内容真正参与当前判断、以及旧内容是否已经超出上下文窗口。删掉重复说明通常比单纯把窗口开得更大更有效。
- AI = 超级接话机器 :它做的事就是不停地猜「下一个词是什么」
- 聊天只是接话茬的包装 :你的话是上半句,它负责接下半句
- 它没有想法 :它有的是从海量文字里统计出来的语言规律
先保留会改变判断的内容
可以用「你可能听说过「AI 连小学数学都会算错」。学完接话茬,这个谜你已经能自己解开了—— 它从来不是在「算」,它是在接话茬 。下面两道题都发给它试试,看看它脑子里的候选有什么不同」做一次对照:保留同样的问题,分别删掉重复背景、压缩格式和移除无关历史,比较答案质量、延迟与 Token 数量。
从「第一步 · 你天生就会玩这个游戏」走到「第二步 · 亲眼看 AI 接一次话」
「第一步 · 你天生就会玩这个游戏」先把问题落在「先别管 AI。下面三句话都没说完, 点开每一句 ,看看你心里冒出来的下半句,和大多数人是不是一样的」上;到了「第二步 · 亲眼看 AI 接一次话」,讨论继续推进到「选一个开头,点「让 AI 接下去」。下面这个框,是它 每往下写一步 时脑子里的那道选择题——放慢了给你看。留意两件事:一是它 不是一个字一个字 往外蹦的,「馄饨」「五花肉」「分钟」都是一整块写出来的,这一块叫 词元 (token)——有的词元是一个字,有的是一个词,后面的课会讲它是怎么切出来的;二是每个候选后面那根 横条 的长短——横条越长,说明它越倾向于选这一块;有的一步几乎是被前文摁着写出来的,有的一步它明显在几…」。两段连起来,重点就不只是记住一个结论,而是看清它成立所依赖的条件。
把这条判断带到下一个场景
处理长文本时,先保留会改变结论的内容,再决定如何压缩格式和历史;上下文更长只有在新增信息真正有用时才值得付出代价。
- 「第一步 · 你天生就会玩这个游戏」:先别管 AI。下面三句话都没说完, 点开每一句 ,看看你心里冒出来的下半句,和大多数人是不是一样的
- 「第二步 · 亲眼看 AI 接一次话」:选一个开头,点「让 AI 接下去」。下面这个框,是它 每往下写一步 时脑子里的那道选择题——放慢了给你看。留意两件事:一是它 不是一个字一个字 往外蹦的,「馄饨」「五花肉」「分钟」都是一整块写出来的,这一块叫 词元 (token)——有的词元是一个字,有的是一个词,后面的课会讲它是怎么切出来的;二是每个候选后面那根 横条 的长短——横条越长,说明它越倾向于选这一块;有的一步几乎是被前文摁着写出来的,有的一步它明显在几…
- 「最后的要点」:接得像 ≠ 接得对 :这是用好 AI 最重要的一根弦,下一课展开
最后的「最后的要点」把讨论落到「接得像 ≠ 接得对 :这是用好 AI 最重要的一根弦,下一课展开」。回看这条线索时,最值得保留的是:当输入、规模或风险改变,哪些判断需要重新做一遍。
✅ 这一课想和你分享的
- AI = 超级接话机器:它做的事就是不停地猜「下一个词是什么」
- 聊天只是接话茬的包装:你的话是上半句,它负责接下半句
- 它没有想法:它有的是从海量文字里统计出来的语言规律
- 它算数学靠「背」不靠「算」:常见的题背得滚瓜烂熟,没见过的题只能猜个像样的数
- 接得像 ≠ 接得对:这是用好 AI 最重要的一根弦,下一课展开
把模型想成在当前上下文里不断选择下一个 Token 后,很多“它为什么不知道”的问题都变成了“我有没有给它足够可用的线索”。这个转换很有帮助。
如果想让完全没接触过模型的人理解 Token,应该先用中文切词的例子,还是直接展示英文和代码的差异?不同语言的直觉好像不太一样。
希望后面能有一个同义句但 Token 数明显不同的小实验。对做 API 成本预算的人来说,这会比抽象解释更容易留下印象。
还没有这篇文章的讨论。