为什么有的 AI 看不懂图片?
「会说话」和「会看」是两套本事。给两个模型各发一张猫图,亲眼看差别,再讲清「眼睛」的原理
本页解决的问题
先给结论为什么有的 AI 看不懂图片?
「会说话」和「会看」是两套本事。给两个模型各发一张猫图,亲眼看差别,再讲清「眼睛」的原理
让这个结论先证明自己值得留下。 把这一页当成决策工具,而不是需要背下来的定义。把概念连到一个真实任务、一个可观察结果,以及一个能改变你判断的失败上。
写下一个问题:试完这个方法后,你能用什么证据回答它?
结论听起来很完整,却没有检查最关键的假设。
因为「会说话」和「会看」是两套独立的本事。语言模型天生只认文字;想让它看图,得额外给它装一双「眼睛」——装了的叫多模态模型,没装的就只能对图片说抱歉。
「抱歉,我无法查看图片。你可以描述一下图片内容,我来帮你分析。」
「一只橘猫趴在飘窗上晒太阳,右前爪压着一个毛线球。看它的体型……这位可能需要控制一下饮食了 😄」
第一步:把图切碎
「眼睛」(视觉编码器)把图片切成许多小方块,每块转译成模型认识的「词」——一张图就变成了一段特殊的「文字」。
第二步:当话来接
转译完成后,图片对模型来说就和一段话没区别了,照常「接话茬」。所以看图能力的本质,还是那台接话机器。
为什么不都装上?
装眼睛要用海量「图 + 文」配对数据重新训练,成本高、模型更大更贵。很多场景根本用不到看图,纯文本模型反而更快更便宜。
「小实验 · 给两个模型各发一张猫的照片」的完整成本怎么算
「因为「会说话」和「会看」是 两套独立的本事 。语言模型天生只认文字;想让它看图,得额外给它装一双「眼睛」——装了的叫 多模态模型 ,没装的就只能对图片说抱歉」提醒我们,AI 成本不是单价乘一次调用这么简单。输入、输出、重试、工具调用、等待时间和人工收尾,会共同决定一次任务到底贵不贵。
先找出账单里不断重复的部分
「「眼睛」(视觉编码器)把图片切成许多小方块,每块转译成模型认识的「词」—— 一张图就变成了一段特殊的「文字」」对应的关键变量通常是上下文是否每轮重复发送、输出是否过长、失败是否触发重试,以及每次调用是否真的带来有用结果。减少无效 Token 往往同时降低费用、延迟和并发压力。
- 会说话 ≠ 会看 :看图需要额外的「眼睛」(视觉编码器)
- 眼睛的原理 :把图切碎、转译成「特殊的文字」,然后照常接话茬
- 不装眼睛不是落后 :更快更便宜,很多场景够用
便宜的单次调用可能换来更贵的全流程
以「装眼睛要用海量「图 + 文」配对数据重新训练, 成本高、模型更大更贵 。很多场景根本用不到看图,纯文本模型反而更快更便宜」为起点做一张小表:输入、输出、重试、工具和人工复核分别花了什么,再比较优化前后的质量,避免只看某一项价格。
从「小实验 · 给两个模型各发一张猫的照片」走到「原理 · 「眼睛」是怎么装上去的」
「小实验 · 给两个模型各发一张猫的照片」先把问题落在「📤 发送同一张猫咪照片给两个模型 模型 A · 纯文本模型(没装眼睛) 🖼️ 猫咪照片.jpg 「抱歉,我无法查看图片。你可以描述一下图片内容,我来帮你分析。」 模型 B · 多模态模型(装了眼睛) 🖼️ 猫咪照片.jpg 「一只橘猫趴在飘窗上晒太阳,右前爪压着一个毛线球。看它的体型…… 这位可能需要控制一下饮食了 😄」」上;到了「原理 · 「眼睛」是怎么装上去的」,讨论继续推进到「「眼睛」(视觉编码器)把图片切成许多小方块,每块转译成模型认识的「词」—— 一张图就变成了一段特殊的「文字」」。两段连起来,重点就不只是记住一个结论,而是看清它成立所依赖的条件。
把这条判断带到下一个场景
分析成本时,先画出完整交互,再找每轮重复的输入、无效输出和失败重试;单次调用便宜,并不代表整个任务便宜。
- 「小实验 · 给两个模型各发一张猫的照片」:📤 发送同一张猫咪照片给两个模型 模型 A · 纯文本模型(没装眼睛) 🖼️ 猫咪照片.jpg 「抱歉,我无法查看图片。你可以描述一下图片内容,我来帮你分析。」 模型 B · 多模态模型(装了眼睛) 🖼️ 猫咪照片.jpg 「一只橘猫趴在飘窗上晒太阳,右前爪压着一个毛线球。看它的体型…… 这位可能需要控制一下饮食了 😄」
- 「原理 · 「眼睛」是怎么装上去的」:「眼睛」(视觉编码器)把图片切成许多小方块,每块转译成模型认识的「词」—— 一张图就变成了一段特殊的「文字」
- 「最后的要点」:看图和画图是两回事 :全能应用背后是多个模型在分工
最后的「最后的要点」把讨论落到「看图和画图是两回事 :全能应用背后是多个模型在分工」。回看这条线索时,最值得保留的是:当输入、规模或风险改变,哪些判断需要重新做一遍。
✅ 这一页想和你分享的
- 会说话 ≠ 会看:看图需要额外的「眼睛」(视觉编码器)
- 眼睛的原理:把图切碎、转译成「特殊的文字」,然后照常接话茬
- 不装眼睛不是落后:更快更便宜,很多场景够用
- 看图和画图是两回事:全能应用背后是多个模型在分工
我把这篇文章里的一个判断改写成了今天可以验证的小实验。比记住结论更有用的是,知道下一步要观察什么。
读完以后我先回头找它成立的条件,而不是直接把方法搬进项目。这个顺序让后面的取舍清楚很多。
如果把这个判断放到真实工作里,最先需要补的约束是什么?我想知道从阅读到第一次实践之间,哪一步最值得先做。
还没有这篇文章的讨论。