「跑分第一」的模型,为什么用起来不行?
榜单分和真实好用度的反转演示 + 三个原因:刷榜、过拟合题库、场景不匹配;顺便说清什么榜更可信
本页解决的问题
先给结论「跑分第一」的模型,为什么用起来不行?
榜单分和真实好用度的反转演示 + 三个原因:刷榜、过拟合题库、场景不匹配;顺便说清什么榜更可信
让这个结论先证明自己值得留下。 把这一页当成决策工具,而不是需要背下来的定义。把概念连到一个真实任务、一个可观察结果,以及一个能改变你判断的失败上。
写下一个问题:试完这个方法后,你能用什么证据回答它?
结论听起来很完整,却没有检查最关键的假设。
榜单测的是考试,你要的是干活。题库会被刷、考纲未必含你的场景,跑分当参考就好。选模型最靠谱的办法是拿自己的活儿去试。
下面是两个虚构的模型:A 跑分 95,B 跑分 88,按榜单选肯定选 A。但是别急,点下面三个真实任务,看看它们各自的表现。
模型 A
95 分模型 B
88 分刷榜
榜单题库在网上流传久了,难免混进模型的训练数据。相当于考前背了答案:分数很好看,能力没那么多。这在圈内有个体面的说法,叫「数据污染」。
过拟合考试
厂商知道大家看榜,就专门朝着考点优化。就像应试教育里的做题家:卷面成绩顶尖,日常交流和动手能力反而可能被牺牲掉。
考纲不含你的场景
榜单考数学、考代码、考知识问答,但不考「懂你们行业」,也不考「安慰人」。你最在意的那门课,考纲里可能压根没有。
也有相对可信的榜:真人盲测投票类。做法是把两个模型的回答摆在一起,隐藏名字,让大量真实用户投票选哪个更好。这种榜没有固定题库可背,考官是活人,刷起来难度大得多。
但它也只是「相对」可信:投票的人未必和你干同一行,大众觉得好的回答风格,未必适合你的场景。想看国产模型在各种真实场景里的实际表现,可以移步国产模型怎么选那一页。
最靠谱的评测机构是你自己。方法很土,但极其有效:从自己的工作里攒 10 个真实问题,存成一个文档。每次想换模型,把 10 道题跑一遍,好不好用一目了然。
私人题库的攒法(示例)
- 挑最常干的活:周报、方案、邮件,选你每周都要做的 3 件
- 挑最专业的活:带上行业黑话和内部语境的问题,考它懂不懂你这行
- 挑翻过车的活:以前 AI 答砸过的问题,最能试出新模型的成色
- 留一道送分题再留一道刁钻题:送分题都答不好的直接淘汰,刁钻题用来拉开差距
- 答案好坏你说了算:你比任何榜单都清楚,什么样的输出算「能交差」
「反转演示 · 高分选手输给了谁」要放回选型约束
「榜单测的是 考试 ,你要的是 干活 。题库会被刷、考纲未必含你的场景,跑分当参考就好。选模型最靠谱的办法是 拿自己的活儿去试」说明,模型、许可证、接入方式和榜单都只是信息,不是脱离场景的答案。真正的选择取决于任务、数据边界、延迟、质量下限和运行成本。
先写淘汰条件,再看最高分
「下面是两个虚构的模型:A 跑分 95,B 跑分 88,按榜单选肯定选 A。但是别急, 点下面三个真实任务 ,看看它们各自的表现」涉及的比较,至少要使用同一组真实输入,并同时观察正确性、失败方式、响应时间和费用。一个在公开榜单上领先的模型,可能因为许可证、隐私要求或峰值延迟不适合你的任务。
- 挑最常干的活 :周报、方案、邮件,选你每周都要做的 3 件
- 挑最专业的活 :带上行业黑话和内部语境的问题,考它懂不懂你这行
- 挑翻过车的活 :以前 AI 答砸过的问题,最能试出新模型的成色
没有测试集,就没有可靠的赢家
以「最靠谱的评测机构是你自己。方法很土,但极其有效: 从自己的工作里攒 10 个真实问题 ,存成一个文档。每次想换模型,把 10 道题跑一遍,好不好用一目了然」为起点,选几条真正会影响决策的输入,写下一个会改变选择的反例;这比记住一次排名更能支持下一次判断。
从「反转演示 · 高分选手输给了谁」走到「为什么会这样 · 三个原因」
「反转演示 · 高分选手输给了谁」先把问题落在「下面是两个虚构的模型:A 跑分 95,B 跑分 88,按榜单选肯定选 A。但是别急, 点下面三个真实任务 ,看看它们各自的表现」上;到了「为什么会这样 · 三个原因」,讨论继续推进到「榜单题库在网上流传久了,难免混进模型的训练数据。 相当于考前背了答案 :分数很好看,能力没那么多。这在圈内有个体面的说法,叫「数据污染」」。两段连起来,重点就不只是记住一个结论,而是看清它成立所依赖的条件。
把这条判断带到下一个场景
做模型选择时,先用真实任务写出不能妥协的条件,再用同一组输入比较质量、失败方式、延迟、许可和成本;榜单只适合作为起点。
- 「反转演示 · 高分选手输给了谁」:下面是两个虚构的模型:A 跑分 95,B 跑分 88,按榜单选肯定选 A。但是别急, 点下面三个真实任务 ,看看它们各自的表现
- 「为什么会这样 · 三个原因」:榜单题库在网上流传久了,难免混进模型的训练数据。 相当于考前背了答案 :分数很好看,能力没那么多。这在圈内有个体面的说法,叫「数据污染」
- 「最后的要点」:答案好坏你说了算 :你比任何榜单都清楚,什么样的输出算「能交差」
最后的「最后的要点」把讨论落到「答案好坏你说了算 :你比任何榜单都清楚,什么样的输出算「能交差」」。回看这条线索时,最值得保留的是:当输入、规模或风险改变,哪些判断需要重新做一遍。
✅ 这一页想和你分享的
- 跑分是入学考试,你要的是试用期表现:两件事相关,但相关得有限
- 高分可能是背过题:题库会泄漏进训练数据,考点会被针对性优化
- 真人盲测投票的榜相对可信:没有固定题库,考官是活人
- 建一套自己的十题小考卷:换模型跑一遍,五分钟出结论,比追新闻管用
我把这篇文章里的一个判断改写成了今天可以验证的小实验。比记住结论更有用的是,知道下一步要观察什么。
读完以后我先回头找它成立的条件,而不是直接把方法搬进项目。这个顺序让后面的取舍清楚很多。
如果把这个判断放到真实工作里,最先需要补的约束是什么?我想知道从阅读到第一次实践之间,哪一步最值得先做。
还没有这篇文章的讨论。