零基础入门 · 先把 AI 的雾气拨开

最小但有用的心智模型:下一个 Token

用句子补全实验建立一个耐用的 LLM 基础模型。它不是全部真相,却能解释上下文、措辞、概率和流畅错误为什么重要。

本页解决的问题

先给结论

「最小但有用的心智模型:下一个 Token」要解决的关键问题是什么?

用句子补全实验建立一个耐用的 LLM 基础模型。它不是全部真相,却能解释上下文、措辞、概率和流畅错误为什么重要。

判断标准

简单,不等于简单化。 下一个 Token 是一个实用的排查视角。答案出乎意料时,先看 Prompt 让哪种续写变得更可能,而不是默认模型已经理解了你的意图。

下一步

把一个请求改写到下一步行动不再含糊。

常见误区

把流畅的续写当成模型理解目标的证据。

第一步 · 你天生就会玩这个游戏

先别管 AI。下面三句话都没说完,点开每一句,看看你心里冒出来的下半句,和大多数人是不是一样的。

发现了吗?有的话茬只有一种接法(「祝你生日……」),有的话茬有好几种可能(「今天天气真……」)。你的大脑在一瞬间完成了一次「选择题」——AI 每往下写一步,做的就是这道题。区别只是:它读过的东西比你多几百万倍,所以猜得特别准。
第二步 · 亲眼看 AI 接一次话

选一个开头,点「让 AI 接下去」。下面这个框,是它每往下写一步时脑子里的那道选择题——放慢了给你看。留意两件事:一是它不是一个字一个字往外蹦的,「馄饨」「五花肉」「分钟」都是一整块写出来的,这一块叫词元(token)——有的词元是一个字,有的是一个词,后面的课会讲它是怎么切出来的;二是每个候选后面那根横条的长短——横条越长,说明它越倾向于选这一块;有的一步几乎是被前文摁着写出来的,有的一步它明显在几个选项之间摇摆。同一个开头多跑几遍——在几根横条差不多长的地方,它并不总是挑最长的那根。

选个开头:
今天加班到十点,
它正在选下一个词元(token)……
它不查资料、不联网,只凭「读过的文字」一个词元一个词元往下接
第三步 · 那「聊天」是怎么回事?

你可能会问:接话茬我懂了,可我和 AI 是在一问一答地聊天啊?其实,聊天只是接话茬换了个包装——

帮我想个周末去哪玩
↓ 在 AI 眼里,你的话是「上半句」,它负责接「下半句」 ↓
AI
可以考虑去郊区爬山,或者找个新开的展览逛逛。你更喜欢安静点的还是热闹点的?
安静点的
↓ 它把前面「所有的对话」拼成一个更长的上半句,继续接 ↓
那推荐植物园或者美术馆,人少,走累了还有地方坐……
它接得足够好、足够自然,看起来就像「懂你」。这一课最想和你分享的一句话是:它没有想法,它有的是从人类几亿本书、几十亿网页里统计出来的「什么话后面通常跟什么话」
这一个直觉,能解释后面所有事
✍️

为什么它能写文章?

接话茬接得又长又顺而已。你给个开头(题目和要求),它一个词一个词往下接,接出一整篇。

🤥

为什么它会胡说八道?

它只管接得像不像,不管接得对不对。顺口的错话,比笨拙的真话更容易被它选中。这事很重要,后面单独用一课讲

🎲

为什么同一个问题,每次答得不一样?

上面的演示里,它并不总是挑最长的那根横条——在几个候选可能性相近的地方,它按可能性大小掷一次骰子,于是走上不同的句子岔路。横条长到 99% 的地方则怎么掷都是同一个结果,所以差异只出现在它本来就摇摆的那几处。

顺便解开一个老谜团 · 它为什么算不好数学?

你可能听说过「AI 连小学数学都会算错」。学完接话茬,这个谜你已经能自己解开了——它从来不是在「算」,它是在接话茬。下面两道题都发给它试试,看看它脑子里的候选有什么不同。

看出区别了吗?「1+1=2」它在训练数据里见过几百万遍,等于背下来了;「3847×2963」这道原题它几乎没见过,只能挑一个「长得像答案」的数——位数对了、开头结尾也像样,中间的数字却是猜的。好消息是:现在很多 AI 产品遇到数学题,会让 AI 去调用真正的计算器或写代码来算,「猜」就变成了「算」——这个聪明的分工,后面的课里还会见到。

「第一步 · 你天生就会玩这个游戏」如何改变一次回答

「先别管 AI。下面三句话都没说完, 点开每一句 ,看看你心里冒出来的下半句,和大多数人是不是一样的」说明,模型处理的不是我们眼中的“字数”,而是一段段 Token。Token 的切分方式会影响输入长度、上下文能放下多少内容,以及一次请求要花多少计算。

长度、信息量和上下文不是一回事

当「选一个开头,点「让 AI 接下去」。下面这个框,是它 每往下写一步 时脑子里的那道选择题——放慢了给你看。留意两件事:一是它 不是一个字一个字 往外蹦的,「馄饨」「五花肉」「分钟」都是一整块写出来的,这一块叫 词元 (token)——有的词元是一个字,有的是一个词,后面的课会讲它是怎么切出来的;二是每个候选后面那根 横条 的长短——横条越长,说明它越倾向于选…」变长时,先要分清三件事:文字被切成多少 Token、哪些内容真正参与当前判断、以及旧内容是否已经超出上下文窗口。删掉重复说明通常比单纯把窗口开得更大更有效。

  • AI = 超级接话机器 :它做的事就是不停地猜「下一个词是什么」
  • 聊天只是接话茬的包装 :你的话是上半句,它负责接下半句
  • 它没有想法 :它有的是从海量文字里统计出来的语言规律

先保留会改变判断的内容

可以用「你可能听说过「AI 连小学数学都会算错」。学完接话茬,这个谜你已经能自己解开了—— 它从来不是在「算」,它是在接话茬 。下面两道题都发给它试试,看看它脑子里的候选有什么不同」做一次对照:保留同样的问题,分别删掉重复背景、压缩格式和移除无关历史,比较答案质量、延迟与 Token 数量。

从「第一步 · 你天生就会玩这个游戏」走到「第二步 · 亲眼看 AI 接一次话」

「第一步 · 你天生就会玩这个游戏」先把问题落在「先别管 AI。下面三句话都没说完, 点开每一句 ,看看你心里冒出来的下半句,和大多数人是不是一样的」上;到了「第二步 · 亲眼看 AI 接一次话」,讨论继续推进到「选一个开头,点「让 AI 接下去」。下面这个框,是它 每往下写一步 时脑子里的那道选择题——放慢了给你看。留意两件事:一是它 不是一个字一个字 往外蹦的,「馄饨」「五花肉」「分钟」都是一整块写出来的,这一块叫 词元 (token)——有的词元是一个字,有的是一个词,后面的课会讲它是怎么切出来的;二是每个候选后面那根 横条 的长短——横条越长,说明它越倾向于选这一块;有的一步几乎是被前文摁着写出来的,有的一步它明显在几…」。两段连起来,重点就不只是记住一个结论,而是看清它成立所依赖的条件。

把这条判断带到下一个场景

处理长文本时,先保留会改变结论的内容,再决定如何压缩格式和历史;上下文更长只有在新增信息真正有用时才值得付出代价。

  • 「第一步 · 你天生就会玩这个游戏」:先别管 AI。下面三句话都没说完, 点开每一句 ,看看你心里冒出来的下半句,和大多数人是不是一样的
  • 「第二步 · 亲眼看 AI 接一次话」:选一个开头,点「让 AI 接下去」。下面这个框,是它 每往下写一步 时脑子里的那道选择题——放慢了给你看。留意两件事:一是它 不是一个字一个字 往外蹦的,「馄饨」「五花肉」「分钟」都是一整块写出来的,这一块叫 词元 (token)——有的词元是一个字,有的是一个词,后面的课会讲它是怎么切出来的;二是每个候选后面那根 横条 的长短——横条越长,说明它越倾向于选这一块;有的一步几乎是被前文摁着写出来的,有的一步它明显在几…
  • 「最后的要点」:接得像 ≠ 接得对 :这是用好 AI 最重要的一根弦,下一课展开

最后的「最后的要点」把讨论落到「接得像 ≠ 接得对 :这是用好 AI 最重要的一根弦,下一课展开」。回看这条线索时,最值得保留的是:当输入、规模或风险改变,哪些判断需要重新做一遍。

✅ 这一课想和你分享的

  • AI = 超级接话机器:它做的事就是不停地猜「下一个词是什么」
  • 聊天只是接话茬的包装:你的话是上半句,它负责接下半句
  • 它没有想法:它有的是从海量文字里统计出来的语言规律
  • 它算数学靠「背」不靠「算」:常见的题背得滚瓜烂熟,没见过的题只能猜个像样的数
  • 接得像 ≠ 接得对:这是用好 AI 最重要的一根弦,下一课展开
标记为已学完 阅读进度会自动记录
← 上一篇下一篇 →

继续阅读

同一条线上的下一篇。

文章讨论

读到这里,留下一个判断。

把刚想明白的地方、还没想通的问题,留给下一位一起学习的人。

正在讨论 最小但有用的心智模型:下一个 Token 先把 AI 的雾气拨开
3条讨论文章讨论 · 与共学社区同步
在共学社区查看
LO
Lena Ortiz数据分析师
观点心智模型

把模型想成在当前上下文里不断选择下一个 Token 后,很多“它为什么不知道”的问题都变成了“我有没有给它足够可用的线索”。这个转换很有帮助。

文章讨论8 有帮助
FT
Felix Tan自然语言处理工程师
问题问题

如果想让完全没接触过模型的人理解 Token,应该先用中文切词的例子,还是直接展示英文和代码的差异?不同语言的直觉好像不太一样。

文章讨论6 有帮助
SM
Sofia Marin技术写作者
建议内容建议

希望后面能有一个同义句但 Token 数明显不同的小实验。对做 API 成本预算的人来说,这会比抽象解释更容易留下印象。

文章讨论3 有帮助