Siri 和 ChatGPT 是一种东西吗?
同一句话两代助手的处理路径动画:命令匹配听不懂就道歉,生成式什么说法都接得住
本页解决的问题
先给结论Siri 和 ChatGPT 是一种东西吗?
同一句话两代助手的处理路径动画:命令匹配听不懂就道歉,生成式什么说法都接得住
让这个结论先证明自己值得留下。 把这一页当成决策工具,而不是需要背下来的定义。把概念连到一个真实任务、一个可观察结果,以及一个能改变你判断的失败上。
写下一个问题:试完这个方法后,你能用什么证据回答它?
结论听起来很完整,却没有检查最关键的假设。
老一代语音助手靠命令匹配,只听得懂预先设计好的几百种说法;ChatGPT 这类生成式 AI 什么说法都能接住。前者像电话客服的按键菜单,后者像真人接线员。
来一句稍微复杂点的指令,看看它在两种助手的脑子里分别走了一条什么路。点下面切换播放。
刚才那条老路径,问题出在第二步:去命令库里找匹配。这条技术路线有一个绕不开的天花板:人类的说法无穷无尽,命令库里的条目却是工程师一条条写进去的。「叫我起床」「设个闹钟」「明早喊我」…每一种说法都得有人预先想到、预先登记,漏了哪种,助手就听不懂哪种。
这就是为什么这些年语音助手看起来在原地踏步:工程师再加十倍,也穷举不完人类的说话方式。路线的天花板,加人是顶不破的。它和 ChatGPT 的差距是代差,就像按键电话和智能手机,给按键电话换个铃声,它还是按键电话。
按键菜单:老助手
「查话费请按 1,办业务请按 2」。选项预先定好,你只能在菜单里挑。想说点菜单外的事?它只会礼貌地重播一遍菜单。
真人接线员:生成式 AI
你怎么说都行,绕着弯说、带着条件说、说一半改主意都行。它理解你的意思,再决定怎么办。想知道它为什么能接住任何话茬,可以看这一课讲的接话原理。
好消息是,这两年各家的语音助手陆续开始「换脑子」:把老的命令匹配系统换成大模型,或者两套并用。你可能已经注意到,手机上的助手忽然能多聊几句了。这波升级还在进行中,不同设备、不同地区的进度差别很大,所以你家里可能同时住着新旧两代助手。
音箱要卖得便宜、答得飞快,跑大模型又费算力又慢半拍,所以很多音箱还留着老脑子,这和客服机器人装傻是同一本账。
「看个演示 · 同一句话的两种命运」怎样变成可执行的指令
「老一代语音助手靠 命令匹配 ,只听得懂预先设计好的几百种说法;ChatGPT 这类生成式 AI 什么说法都能接住 。前者像电话客服的按键菜单,后者像真人接线员」强调的不是某句神奇咒语,而是信息是否足够让模型判断“为谁做、要完成什么、什么结果算合格”。
背景决定方向,限制决定边界
从「来一句稍微复杂点的指令,看看它在两种助手的脑子里分别走了一条什么路。点下面切换播放」可以看出,一个有效请求至少要把任务、受众、输入材料、输出形式和限制条件分开。少了背景,模型只能猜;少了验收标准,即使文字流畅也无法判断是否完成任务。
- 代差在技术路线 :命令匹配和生成式理解是两代技术,账号升级、换个铃声都救不了
- 一个好记的比喻 :老助手是电话按键菜单,生成式 AI 是真人接线员
- 十年没进步的原因 :说法无穷、命令有限,加十倍工程师也穷举不完
继续加字不一定继续变好
把「音箱要卖得便宜、答得飞快,跑大模型又费算力又慢半拍,所以很多音箱还留着老脑子,这和 客服机器人装傻 是同一本账」变成一个小练习:只改背景、要求、限制中的一项,保留其他内容不动,观察哪一层真正改变了结果。
从「看个演示 · 同一句话的两种命运」走到「为什么语音助手十年没大进步」
「看个演示 · 同一句话的两种命运」先把问题落在「来一句稍微复杂点的指令,看看它在两种助手的脑子里分别走了一条什么路。点下面切换播放」上;到了「为什么语音助手十年没大进步」,讨论继续推进到「刚才那条老路径,问题出在第二步: 去命令库里找匹配 。这条技术路线有一个绕不开的天花板:人类的说法无穷无尽,命令库里的条目却是工程师一条条写进去的。「叫我起床」「设个闹钟」「明早喊我」…每一种说法都得有人预先想到、预先登记,漏了哪种,助手就听不懂哪种」。两段连起来,重点就不只是记住一个结论,而是看清它成立所依赖的条件。
把这条判断带到下一个场景
写请求时也应逐层补齐:先说任务和受众,再给材料和输出要求,最后加上限制与验收方式;一次只改变一层,才能知道哪项信息起了作用。
- 「看个演示 · 同一句话的两种命运」:来一句稍微复杂点的指令,看看它在两种助手的脑子里分别走了一条什么路。点下面切换播放
- 「为什么语音助手十年没大进步」:刚才那条老路径,问题出在第二步: 去命令库里找匹配 。这条技术路线有一个绕不开的天花板:人类的说法无穷无尽,命令库里的条目却是工程师一条条写进去的。「叫我起床」「设个闹钟」「明早喊我」…每一种说法都得有人预先想到、预先登记,漏了哪种,助手就听不懂哪种
- 「最后的要点」:音箱还蠢的原因 :多半是没换脑子,或者舍不得算力
最后的「最后的要点」把讨论落到「音箱还蠢的原因 :多半是没换脑子,或者舍不得算力」。回看这条线索时,最值得保留的是:当输入、规模或风险改变,哪些判断需要重新做一遍。
✅ 这一页想和你分享的
- 代差在技术路线:命令匹配和生成式理解是两代技术,账号升级、换个铃声都救不了
- 一个好记的比喻:老助手是电话按键菜单,生成式 AI 是真人接线员
- 十年没进步的原因:说法无穷、命令有限,加十倍工程师也穷举不完
- 音箱还蠢的原因:多半是没换脑子,或者舍不得算力
- 一招判断新旧:换个说法它还接得住吗
我把这篇文章里的一个判断改写成了今天可以验证的小实验。比记住结论更有用的是,知道下一步要观察什么。
读完以后我先回头找它成立的条件,而不是直接把方法搬进项目。这个顺序让后面的取舍清楚很多。
如果把这个判断放到真实工作里,最先需要补的约束是什么?我想知道从阅读到第一次实践之间,哪一步最值得先做。
还没有这篇文章的讨论。