劳动错觉:让 AI 把努力演出来
哈佛实验:展示工作过程让用户多等反而更满意。秒回 vs 过程外显的 A/B 投票实验,思考外显与检索来源的一鱼三吃,外加三条不能越过的边界
本页解决的问题
先给结论「劳动错觉:让 AI 把努力演出来」要解决的关键问题是什么?
哈佛实验:展示工作过程让用户多等反而更满意。秒回 vs 过程外显的 A/B 投票实验,思考外显与检索来源的一鱼三吃,外加三条不能越过的边界
把品味变成产品可重复的行为。 有用的结果不是一句“我觉得更好”。它应该是一条看得见的规则、一个小例子,以及判断体验何时低于标准的方法。
记录一个前后对比,让别人不用听解释也能看懂质量线。
表面更精致了,却没有减少用户的不确定感。
同一个问题同时发给两个客服机器人,答案一字不差,区别只在拿到答案的方式。A 秒回,B 花 3 秒把工作日志逐条亮出来再作答。跑完凭直觉投票。
机器人 A · 秒回
0.3 秒直接给答案
机器人 B · 展示过程
3.5 秒,工作日志逐条亮起
这个效应出自哈佛商学院 Buell 和 Norton 2011 年的实验。被试在模拟的机票搜索网站上查航班:一组秒出结果,另一组要等 30 到 60 秒,但屏幕上滚动着「正在检查 Delta 航空…正在检查 United…」。结果展示劳动的那组满意度反超,部分条件下被试宁愿选等 60 秒但看得见工作的网站。下面把实验搬给你亲手跑。
工程上你有三根现成的杠杆:推理模型的思考过程、RAG 的检索来源、Agent 的工具调用日志。它们原本是调试信息,摆上台面就成了体验资产。三个开关逐个拨开,看右边的聊天界面多出什么、体感可信度涨多少。
思考过程外显
把思维链摊开:分了几种情况、在哪换过思路,让用户看见推理的骨架。
检索来源逐条亮出
「已检索 3 个来源」加上可点开的条目,答案挂上可查验的出处。
工具调用日志
查了什么、读了什么、比对了什么,一步一行摊在屏幕上。
用户问的是试用期解除的赔偿…得分两种情况:公司拿得出「录用条件不符」的证据,和拿不出的…先查劳动合同法原文再作答,避免凭印象给数字。
过程展示有真有假。下面三个界面都在「展示努力」,逐个判断:真劳动,还是假表演?拆穿的代价,三题做完揭晓。
✓ 读取《民法典》第 587 条
✓ 比对 2 个近似判例
劳动错觉好用,但有边界。三道题,每道对应一条实践红线,做完这一课的杠杆就能放心用了。
从「先做实验 · 两个机器人,你信哪个」把感觉变成判断
「同一个问题同时发给两个客服机器人, 答案一字不差 ,区别只在拿到答案的方式。A 秒回,B 花 3 秒把工作日志逐条亮出来再作答。跑完凭直觉投票」指出,AI 降低了做出“能用”成品的门槛,读者真正需要练的是看出哪里不对,并把感觉说成可以执行的要求。
观察用户的下一步,而不是只看表面
「这个效应出自哈佛商学院 Buell 和 Norton 2011 年的实验。被试在模拟的机票搜索网站上查航班:一组秒出结果,另一组要等 30 到 60 秒,但屏幕上滚动着「正在检查 Delta 航空…正在检查 United…」。结果 展示劳动的那组满意度反超 ,部分条件下被试宁愿选等 60 秒但看得见工作的网站。下面把实验搬给你亲手跑」可以转成几个可观察的问题:用户是否知道现在发生了什么,是否知道下一步做什么,出错或空白时能否恢复,以及信息层级是否让重要内容先被看见。
- 把真实的劳动亮出来 :思考过程、检索来源、工具日志,调试信息搬上台面就是体验资产
- 用可核对的细节演 :日志条目要能和答案里的引用对上,可验证的过程越看越可信
- 展示时长锁在真实耗时之内 :呈现节奏可以放慢,超出真实劳动时长就是造假
漂亮不等于容易用
把「劳动错觉好用,但有边界。三道题,每道对应一条实践红线,做完这一课的杠杆就能放心用了」用在第二个页面或流程上,记录一个具体犹豫点和一个改动后的用户动作;能被观察到的变化,才是体验改善。
从「先做实验 · 两个机器人,你信哪个」走到「研究出处 · 让用户多等 60 秒的网站赢了」
「先做实验 · 两个机器人,你信哪个」先把问题落在「同一个问题同时发给两个客服机器人, 答案一字不差 ,区别只在拿到答案的方式。A 秒回,B 花 3 秒把工作日志逐条亮出来再作答。跑完凭直觉投票」上;到了「研究出处 · 让用户多等 60 秒的网站赢了」,讨论继续推进到「这个效应出自哈佛商学院 Buell 和 Norton 2011 年的实验。被试在模拟的机票搜索网站上查航班:一组秒出结果,另一组要等 30 到 60 秒,但屏幕上滚动着「正在检查 Delta 航空…正在检查 United…」。结果 展示劳动的那组满意度反超 ,部分条件下被试宁愿选等 60 秒但看得见工作的网站。下面把实验搬给你亲手跑」。两段连起来,重点就不只是记住一个结论,而是看清它成立所依赖的条件。
把这条判断带到下一个场景
评估体验时,把抽象的“好看”或“顺手”换成用户动作:他是否看懂状态、找到了下一步、能从错误中恢复,并且愿意继续使用。
- 「先做实验 · 两个机器人,你信哪个」:同一个问题同时发给两个客服机器人, 答案一字不差 ,区别只在拿到答案的方式。A 秒回,B 花 3 秒把工作日志逐条亮出来再作答。跑完凭直觉投票
- 「研究出处 · 让用户多等 60 秒的网站赢了」:这个效应出自哈佛商学院 Buell 和 Norton 2011 年的实验。被试在模拟的机票搜索网站上查航班:一组秒出结果,另一组要等 30 到 60 秒,但屏幕上滚动着「正在检查 Delta 航空…正在检查 United…」。结果 展示劳动的那组满意度反超 ,部分条件下被试宁愿选等 60 秒但看得见工作的网站。下面把实验搬给你亲手跑
- 「最后的要点」:高频任务收着演 :第一次展示过程建立信任,之后直奔结果,别拿用户的耐心铺排面
最后的「最后的要点」把讨论落到「高频任务收着演 :第一次展示过程建立信任,之后直奔结果,别拿用户的耐心铺排面」。回看这条线索时,最值得保留的是:当输入、规模或风险改变,哪些判断需要重新做一遍。
✅ 这一课想和你分享的
- 把真实的劳动亮出来:思考过程、检索来源、工具日志,调试信息搬上台面就是体验资产
- 用可核对的细节演:日志条目要能和答案里的引用对上,可验证的过程越看越可信
- 展示时长锁在真实耗时之内:呈现节奏可以放慢,超出真实劳动时长就是造假
- 高频任务收着演:第一次展示过程建立信任,之后直奔结果,别拿用户的耐心铺排面
我把这篇文章里的一个判断改写成了今天可以验证的小实验。比记住结论更有用的是,知道下一步要观察什么。
读完以后我先回头找它成立的条件,而不是直接把方法搬进项目。这个顺序让后面的取舍清楚很多。
如果把这个判断放到真实工作里,最先需要补的约束是什么?我想知道从阅读到第一次实践之间,哪一步最值得先做。
还没有这篇文章的讨论。