贪心与采样:AI 选词时的两种性格
每步都挑最大的就是贪心解码,按概率掷骰子就是采样——Temperature 背后的算法学。亲手对比两种策略生成的句子
本页解决的问题
先给结论「贪心与采样:AI 选词时的两种性格」要解决的关键问题是什么?
每步都挑最大的就是贪心解码,按概率掷骰子就是采样——Temperature 背后的算法学。亲手对比两种策略生成的句子
让这个结论先证明自己值得留下。 把这一页当成决策工具,而不是需要背下来的定义。把概念连到一个真实任务、一个可观察结果,以及一个能改变你判断的失败上。
写下一个问题:试完这个方法后,你能用什么证据回答它?
结论听起来很完整,却没有检查最关键的假设。
开头固定是「周末的计划是」。先玩上面这台:贪心模式(temperature=0),每步永远选概率条最长的那根。连点三次「再生成」,留意下方堆叠的结果列表——有没有哪怕一个字的不同?
😤 贪心模式
temperature = 0再玩下面这台:采样模式,每步按概率加权掷骰子。先在 0.7 档连点三次,看结果是不是各不相同;再切到 1.2 档试试——留意概率条的形状变化:温度越高,条与条越接近,冷门词翻身的机会就越大。
🎲 采样模式
按概率掷骰子😤 贪心:每步拿眼前最大的
快、稳、可复现——跑一万次都是同一句话。但它有个致命盲点:每步的局部最优,加起来不一定是整体最优。第一步选了最顺口的词,可能把整句话带进死路。这个坑怎么填?下一课的 Beam Search 就是解药——先卖个关子。
🎲 采样:给随机留个口子
用确定性换多样性。按概率掷骰子,大概率的词常被选中(所以还是通顺的),小概率的词偶尔翻身(所以有惊喜)。温度就是拨给「惊喜」的额度:T 越高,概率分布被压得越平,冷门词越敢冒头。
「同一个开头 · 两种性格」里的算法代价曲线
「开头固定是「周末的计划是」。」真正训练的不是背诵步骤,而是识别重复工作:输入变大时,程序到底多做了多少次比较、移动或递归。
先找重复工作,再谈快慢
「再玩下面这台 :采样模式,每步按概率 加权掷骰子 。先在 0.7 档连点三次,看结果是不是各不相同;再切到 1.2 档试试—— 留意概率条的形状变化 :温度越高,条与条越接近,冷门词翻身的机会就越大」可以拆成输入规模、每轮做什么、以及是否能缩小下一轮范围三个问题。Big-O 是描述增长趋势的语言,不是对每台机器的精确计时;常数、内存和真实数据分布也会影响最终结果。
- 贪心 = 每步挑概率最大的 :三次生成一字不差——快、可复现,但可能错过整体更优
- 采样 = 按概率掷骰子 :三次三个样——牺牲确定性,换来多样性
- Temperature 是两者之间的旋钮 :T=0 就是贪心;T 越高分布越平、越敢选冷门词
别把理论最优当成无条件最优
面对 AI 写出的算法,先用小输入手算一遍,再用逐渐放大的数据做基准测试。这样才能把「用确定性换多样性 。按概率掷骰子,大概率的词常被选中(所以还是通顺的),小概率的词偶尔翻身(所以有惊喜)。温度就是拨给「惊喜」的额度: T 越高,概率分布被压得越平,冷门词越敢冒头」从一句结论变成可检查的性能判断。
从「同一个开头 · 两种性格」走到「概念卡 · 两种性格的账本」
「同一个开头 · 两种性格」先把问题落在「开头固定是「周末的计划是」。 先玩上面这台 :贪心模式(temperature=0),每步永远选概率条最长的那根。 连点三次「再生成」 ,留意下方堆叠的结果列表——有没有哪怕一个字的不同」上;到了「概念卡 · 两种性格的账本」,讨论继续推进到「快、稳、可复现 ——跑一万次都是同一句话。但它有个致命盲点: 每步的局部最优,加起来不一定是整体最优 。第一步选了最顺口的词,可能把整句话带进死路。这个坑怎么填? 下一课的 Beam Search 就是解药 ——先卖个关子」。两段连起来,重点就不只是记住一个结论,而是看清它成立所依赖的条件。
把这条判断带到下一个场景
算法题换成真实任务后,先找出重复工作,再问输入规模如何变化,最后用一个小基准验证理论判断。这样不会把复杂度记成脱离场景的标签。
- 「同一个开头 · 两种性格」:开头固定是「周末的计划是」。 先玩上面这台 :贪心模式(temperature=0),每步永远选概率条最长的那根。 连点三次「再生成」 ,留意下方堆叠的结果列表——有没有哪怕一个字的不同
- 「概念卡 · 两种性格的账本」:快、稳、可复现 ——跑一万次都是同一句话。但它有个致命盲点: 每步的局部最优,加起来不一定是整体最优 。第一步选了最顺口的词,可能把整句话带进死路。这个坑怎么填? 下一课的 Beam Search 就是解药 ——先卖个关子
- 「最后的要点」:贪心的坑下一课填 :Beam Search——先多看几步再选
最后的「最后的要点」把讨论落到「贪心的坑下一课填 :Beam Search——先多看几步再选」。回看这条线索时,最值得保留的是:当输入、规模或风险改变,哪些判断需要重新做一遍。
✅ 这一课想和你分享的
- 贪心 = 每步挑概率最大的:三次生成一字不差——快、可复现,但可能错过整体更优
- 采样 = 按概率掷骰子:三次三个样——牺牲确定性,换来多样性
- Temperature 是两者之间的旋钮:T=0 就是贪心;T 越高分布越平、越敢选冷门词
- 怎么选看任务:复现实验、写代码、抽取数据用 T=0;头脑风暴、写文案调高 T
- 贪心的坑下一课填:Beam Search——先多看几步再选
我把这篇文章里的一个判断改写成了今天可以验证的小实验。比记住结论更有用的是,知道下一步要观察什么。
读完以后我先回头找它成立的条件,而不是直接把方法搬进项目。这个顺序让后面的取舍清楚很多。
如果把这个判断放到真实工作里,最先需要补的约束是什么?我想知道从阅读到第一次实践之间,哪一步最值得先做。
还没有这篇文章的讨论。