专题篇章 · AI 产品心理学:设计用户的感受

信任校准:最好的用户是半信半疑的

全信的把编造判例抄进法庭文书,不信的把 AI 变成摆设。六个场景亲手判断信任状态;可点开的引用、置信度代理信号、有条件的警告

本页解决的问题

先给结论

「信任校准:最好的用户是半信半疑的」要解决的关键问题是什么?

全信的把编造判例抄进法庭文书,不信的把 AI 变成摆设。六个场景亲手判断信任状态;可点开的引用、置信度代理信号、有条件的警告

判断标准

把品味变成产品可重复的行为。 有用的结果不是一句“我觉得更好”。它应该是一条看得见的规则、一个小例子,以及判断体验何时低于标准的方法。

下一步

记录一个前后对比,让别人不用听解释也能看懂质量线。

常见误区

表面更精致了,却没有减少用户的不确定感。

先看两种翻车姿势
全信的出事故,不信的白花钱。信任校准(Trust Calibration)的奠基综述 Lee & See(2004)把要求说得很清楚:信任要和系统的真实能力对齐。信高了叫误用(misuse),信低了叫弃用(disuse),两头各有各的账单。
⚠ 过度信任:把幻觉当真相用

2023 年纽约的 Mata v. Avianca 案:执业律师用 ChatGPT 检索判例,把 6 个查无此案的编造判例原样抄进法庭文书,法官逐个核实后律师吃了罚单、上了全球新闻。类似的事故此后接连发生:AI 的输出流畅、自信、格式规范,每一个表面特征都在诱导「它很靠谱」的判断,而这些特征和内容真伪互不相干。

⚠ 信任不足:AI 变成昂贵的摆设

另一头的翻车安静得多:企业买了 AI 工具,员工试了一次撞上错误,从此每条输出都逐句复核,复核成本超过自己写,最后干脆不用了。采购的钱照付,效率一分没涨。信任不足不上新闻,只出现在「AI 工具活跃率 8%」的内部复盘里。

系统实际的靠谱程度 → 用户以为的靠谱程度 → 过度信任区 · 误用 信任不足区 · 弃用 校准线:信任 = 真实能力
横轴是系统真的有多靠谱,纵轴是用户以为它有多靠谱。产品设计的任务:把落在两个角落里的用户,往对角线上拉。往下的三件工具,拉的都是这根线。
六个用户,逐个把脉

判断口诀先给你:盯着「风险 × 可核验性」看,别盯着「AI 强大与否」看。同样是全盘采纳,用在周报上是校准,用在法庭上是过度。六个场景,你来当校准师。

这六个用户,信任健康吗 0 / 6
三个选项:过度信任、信任不足、校准良好。先判断,再看解析。
把引用做成能点开的

第一件校准工具:来源引用,要能点开的那种。想核实的用户一键到原文,压住过度信任;懒得核实的用户看到「有出处」也建立了合理的底气,补上信任不足。一举两得的前提是引用真实可点:装饰性的假引用被戳穿一次,比没有引用糟糕十倍。下面这条 AI 回答挂了三个角标,逐个点开,和原文比对。

三条引用,揪出对不上的那条 0 / 3 已点开
点角标 [1][2][3] 展开原文卡片,比对回答里那句话和原文说的到底一致吗。
问:试用期第二个月被公司口头辞退,我能主张赔偿吗?
可以主张。用人单位在试用期解除劳动合同,应当向你说明理由[1];如果构成违法解除,赔偿金按经济补偿标准的二倍支付[2]。注意别拖:劳动仲裁的申请时效为一年,从被辞退当天起算[3]。建议先保留辞退通知、考勤和工资记录等证据。
三条引用里有一条对不上原文,是哪条?
亲手调一版置信度信号

第二件工具:置信度。第一篇章讲过,模型不知道自己不知道,让它自报把握靠不住。但产品层有诚实的代理信号:检索命中了几篇文档、相关度多高、多个来源是否一致、知识截止日期盖住问题了没有。下面是同一条用药回答,三组开关对应三个产品决策,拨一拨,看右边的回答和用户的信任校准度怎么变

置信度信号设计器 拨一拨
回答措辞
来源引用
警告条
用户信任校准度
22
布洛芬和对乙酰氨基酚,发烧能交替吃吗?
[1] 解热镇痛药临床应用指南 [2] 药典 · 非甾体抗炎药 [3] 三甲医院用药问答库
狼来了,连喊五遍试试

第三件工具管的就一件事:那行「AI 可能出错,请核实重要信息」的小字,到底有没有人在看。心理学的答案叫横幅盲视(banner blindness):Benway & Lane(1998)用眼动实验发现,恒定出现在固定位置的元素,会被大脑当成背景纹理直接滤掉。下面连点五条回答,亲眼看这行小字怎么消失。

恒定免责 vs 条件警告 第 0 / 5 条
先在「恒定免责组」点满五条,再切「条件警告组」对比。横幅的浓淡模拟的就是用户注意力的钝化。
用户对警告的注意力
100
出处与延伸:信任校准的奠基综述是 Lee & See (2004) Trust in Automation: Designing for Appropriate Reliance,误用(misuse)与弃用(disuse)的提法出自 Parasuraman & Riley (1997);律师抄幻觉判例为真实案件 Mata v. Avianca, Inc. (S.D.N.Y. 2023);横幅盲视见 Benway & Lane (1998) 的眼动研究。信任跌落之后怎么修,第 6 课讲算法厌恶(Dietvorst et al., 2015)时接着说;高危动作的人工闸门,第 7 课防御心理里有完整的设计谱系。

从「先看两种翻车姿势」把感觉变成判断

「2023 年纽约的 Mata v.」指出,AI 降低了做出“能用”成品的门槛,读者真正需要练的是看出哪里不对,并把感觉说成可以执行的要求。

观察用户的下一步,而不是只看表面

「另一头的翻车安静得多:企业买了 AI 工具,员工试了一次撞上错误,从此 每条输出都逐句复核 ,复核成本超过自己写,最后干脆不用了。采购的钱照付,效率一分没涨。信任不足不上新闻,只出现在「AI 工具活跃率 8%」的内部复盘里」可以转成几个可观察的问题:用户是否知道现在发生了什么,是否知道下一步做什么,出错或空白时能否恢复,以及信息层级是否让重要内容先被看见。

  • 把信任目标定在校准 :全信的出事故,不信的白花钱,产品要把用户往对角线上拉
  • 引用做成能点开的 :把「信我」换成「你可以验」,同时提防装饰性假引用反噬
  • 置信度用代理信号说 :检索命中数、相关度、来源一致性,比模型自报的把握诚实

漂亮不等于容易用

把「第三件工具管的就一件事:那行「AI 可能出错,请核实重要信息」的小字,到底有没有人在看。心理学的答案叫 横幅盲视(banner blindness) :Benway & Lane(1998)用眼动实验发现,恒定出现在固定位置的元素,会被大脑当成背景纹理直接滤掉。下面连点五条回答,亲眼看这行小字怎么消失」用在第二个页面或流程上,记录一个具体犹豫点和一个改动后的用户动作;能被观察到的变化,才是体验改善。

从「先看两种翻车姿势」走到「六个用户,逐个把脉」

「先看两种翻车姿势」先把问题落在「2023 年纽约的 Mata v. Avianca 案:执业律师用 ChatGPT 检索判例,把 6 个查无此案的编造判例 原样抄进法庭文书,法官逐个核实后律师吃了罚单、上了全球新闻。类似的事故此后接连发生:AI 的输出流畅、自信、格式规范, 每一个表面特征都在诱导「它很靠谱」的判断 ,而这些特征和内容真伪互不相干」上;到了「六个用户,逐个把脉」,讨论继续推进到「判断口诀先给你:盯着 「风险 × 可核验性」 看,别盯着「AI 强大与否」看。同样是全盘采纳,用在周报上是校准,用在法庭上是过度。六个场景,你来当校准师」。两段连起来,重点就不只是记住一个结论,而是看清它成立所依赖的条件。

把这条判断带到下一个场景

评估体验时,把抽象的“好看”或“顺手”换成用户动作:他是否看懂状态、找到了下一步、能从错误中恢复,并且愿意继续使用。

  • 「先看两种翻车姿势」:2023 年纽约的 Mata v. Avianca 案:执业律师用 ChatGPT 检索判例,把 6 个查无此案的编造判例 原样抄进法庭文书,法官逐个核实后律师吃了罚单、上了全球新闻。类似的事故此后接连发生:AI 的输出流畅、自信、格式规范, 每一个表面特征都在诱导「它很靠谱」的判断 ,而这些特征和内容真伪互不相干
  • 「六个用户,逐个把脉」:判断口诀先给你:盯着 「风险 × 可核验性」 看,别盯着「AI 强大与否」看。同样是全盘采纳,用在周报上是校准,用在法庭上是过度。六个场景,你来当校准师
  • 「最后的要点」:警告有条件地出现 :恒定免责三天就隐形,低置信时带原因弹出才会被读

最后的「最后的要点」把讨论落到「警告有条件地出现 :恒定免责三天就隐形,低置信时带原因弹出才会被读」。回看这条线索时,最值得保留的是:当输入、规模或风险改变,哪些判断需要重新做一遍。

✅ 这一课想和你分享的

  • 把信任目标定在校准:全信的出事故,不信的白花钱,产品要把用户往对角线上拉
  • 引用做成能点开的:把「信我」换成「你可以验」,同时提防装饰性假引用反噬
  • 置信度用代理信号说:检索命中数、相关度、来源一致性,比模型自报的把握诚实
  • 警告有条件地出现:恒定免责三天就隐形,低置信时带原因弹出才会被读
标记为已学完 阅读进度会自动记录
← 上一篇下一篇 →

继续阅读

同一条线上的下一篇。

文章讨论

读到这里,留下一个判断。

把刚想明白的地方、还没想通的问题,留给下一位一起学习的人。

正在讨论 信任校准:最好的用户是半信半疑的 AI 产品心理学:设计用户的感受
3条讨论文章讨论 · 与共学社区同步
在共学社区查看
AM
Asha Morgan内容编辑
观点实践记录

我把这篇文章里的一个判断改写成了今天可以验证的小实验。比记住结论更有用的是,知道下一步要观察什么。

文章讨论7 有帮助
LH
Lin Harper独立开发者
观点观点

读完以后我先回头找它成立的条件,而不是直接把方法搬进项目。这个顺序让后面的取舍清楚很多。

文章讨论5 有帮助
KM
Kiki Moore产品运营
问题问题

如果把这个判断放到真实工作里,最先需要补的约束是什么?我想知道从阅读到第一次实践之间,哪一步最值得先做。

文章讨论4 有帮助