Token 是体验背后的计价器
用交互分词器看清文本为什么按片段计费、输入和输出为什么都算,以及语言和格式如何改变总量。Token 素养同时连接成本、上下文和延迟。
本页解决的问题
先给结论「Token 是体验背后的计价器」要解决的关键问题是什么?
用交互分词器看清文本为什么按片段计费、输入和输出为什么都算,以及语言和格式如何改变总量。Token 素养同时连接成本、上下文和延迟。
Token 既是计费单位,也是设计约束。 统计产品真正发送的 Prompt,不要只统计你眼前看到的文字。包装、重复历史和冗长输出都会在规模上叠加。
把一次真实请求拆成系统提示、历史、检索文本和输出分别测量。
只根据用户可见的那句话估算成本。
Token 是 AI 读写文字的最小单位,大约是一小块词。AI 每读一颗、每写一颗都要消耗算力,所以按颗收费,逻辑和出租车按里程计价一样:跑多远,付多少。
下面有几句现成的话,点一句试试。你会看到它被切成一颗颗彩色的小块,每一块就是一颗 Token,下方的计数器和账单会实时跟着跳。
出租车按里程计价,因为车每跑一公里都实打实地烧油。AI 同理:每读一颗、每吐一颗 Token,机房里的显卡都在做一轮运算、耗一份电。按颗数收费,是最贴近真实成本的计法。而且要注意,账单是两头一起算的:
你发给它的(输入)
你打的每一个字、贴进去的每一段资料,它都要一颗颗读进去。读,也要钱。
它回给你的(输出)
它写的每一个字也是一颗颗算出来的。写,同样要钱,而且单价通常更贵,因为「写」比「读」费劲。
用上面的分词器对比一下中文句和英文句:中文常常一到两个字就要占一颗 Token,英文一个不短的单词往往只占一颗。所以表达同样的意思,中文消耗的 Token 数常常更多。这和模型「认字」的习惯有关:它对英文见得多、切得熟,对汉字只能切得更碎。
「亲手切一句话」如何改变一次回答
「Token 是 AI 读写文字的最小单位 ,大约是一小块词。AI 每读一颗、每写一颗都要消耗算力,所以按颗收费, 逻辑和出租车按里程计价一样 :跑多远,付多少」说明,模型处理的不是我们眼中的“字数”,而是一段段 Token。Token 的切分方式会影响输入长度、上下文能放下多少内容,以及一次请求要花多少计算。
长度、信息量和上下文不是一回事
当「下面有几句现成的话,点一句试试。你会看到它被切成一颗颗彩色的小块,每一块就是一颗 Token,下方的计数器和账单会实时跟着跳」变长时,先要分清三件事:文字被切成多少 Token、哪些内容真正参与当前判断、以及旧内容是否已经超出上下文窗口。删掉重复说明通常比单纯把窗口开得更大更有效。
- Token 是计费的颗粒 :AI 读写文字的最小单位,大约一小块词
- 输入输出都算钱 :你发的要钱,它回的也要钱,后者通常更贵
- 同样的意思,中文往往更费 :汉字被切得更碎,颗数更多
先保留会改变判断的内容
可以用「用上面的分词器对比一下中文句和英文句:中文常常一到两个字就要占一颗 Token,英文一个不短的单词往往只占一颗。所以表达同样的意思, 中文消耗的 Token 数常常更多 。这和模型「认字」的习惯有关:它对英文见得多、切得熟,对汉字只能切得更碎」做一次对照:保留同样的问题,分别删掉重复背景、压缩格式和移除无关历史,比较答案质量、延迟与 Token 数量。
从「亲手切一句话」走到「为什么要按 Token 收费」
「亲手切一句话」先把问题落在「下面有几句现成的话,点一句试试。你会看到它被切成一颗颗彩色的小块,每一块就是一颗 Token,下方的计数器和账单会实时跟着跳」上;到了「为什么要按 Token 收费」,讨论继续推进到「出租车按里程计价,因为车每跑一公里都实打实地烧油。AI 同理:每读一颗、每吐一颗 Token,机房里的显卡都在做一轮运算、耗一份电。按颗数收费,是最贴近真实成本的计法。而且要注意, 账单是两头一起算的」。两段连起来,重点就不只是记住一个结论,而是看清它成立所依赖的条件。
把这条判断带到下一个场景
处理长文本时,先保留会改变结论的内容,再决定如何压缩格式和历史;上下文更长只有在新增信息真正有用时才值得付出代价。
- 「亲手切一句话」:下面有几句现成的话,点一句试试。你会看到它被切成一颗颗彩色的小块,每一块就是一颗 Token,下方的计数器和账单会实时跟着跳
- 「为什么要按 Token 收费」:出租车按里程计价,因为车每跑一公里都实打实地烧油。AI 同理:每读一颗、每吐一颗 Token,机房里的显卡都在做一轮运算、耗一份电。按颗数收费,是最贴近真实成本的计法。而且要注意, 账单是两头一起算的
- 「最后的要点」:提示词写得精炼,就是在直接省钱 :每省一颗都是真金白银
最后的「最后的要点」把讨论落到「提示词写得精炼,就是在直接省钱 :每省一颗都是真金白银」。回看这条线索时,最值得保留的是:当输入、规模或风险改变,哪些判断需要重新做一遍。
✅ 这一页想和你分享的
- Token 是计费的颗粒:AI 读写文字的最小单位,大约一小块词
- 输入输出都算钱:你发的要钱,它回的也要钱,后者通常更贵
- 同样的意思,中文往往更费:汉字被切得更碎,颗数更多
- 提示词写得精炼,就是在直接省钱:每省一颗都是真金白银
把 Token 当成体验背后的预算后,我开始同时关注上下文长度和调用次数。以前只盯单次价格,真正贵的是用户连续操作时累积出来的部分。
面向非技术同事解释 Token 时,用“字数”做近似会不会误导?我想给团队一个能做预算的直觉,但不希望他们把两个概念完全等同。
如果输入框旁边能显示一个粗略的 Token 区间,并在接近上下文上限时提醒,用户会更早意识到为什么回答开始变短或变慢。
还没有这篇文章的讨论。