权重是什么?一个模型的全部本事
训练几个月最后凝结成的那个文件:它长什么样、多大、为什么说拥有权重就是拥有控制权
本页解决的问题
先给结论「权重是什么?一个模型的全部本事」要解决的关键问题是什么?
训练几个月最后凝结成的那个文件:它长什么样、多大、为什么说拥有权重就是拥有控制权
让这个结论先证明自己值得留下。 把这一页当成决策工具,而不是需要背下来的定义。把概念连到一个真实任务、一个可观察结果,以及一个能改变你判断的失败上。
写下一个问题:试完这个方法后,你能用什么证据回答它?
结论听起来很完整,却没有检查最关键的假设。
这一章的例子基本都取自 Qwen,先说清楚为什么。
- 尺寸铺得最全。Ollama 官方库里 Qwen3.5 一代从 0.8B 一直排到 122B,中间有 2B、4B、9B、27B、35B。本章后面每讲到一档设备,都能对应上一个真能下载下来的文件,不用换品牌凑数。
- 别人拿它当底座。DeepSeek-R1 放出的六个蒸馏版里有四个用的是 Qwen 底座——这是第三方的选择,不是自家宣传。
- 它自己就是个反面教材。Qwen2.5 时期的 3B 和 72B 用过非标准许可证,正好拿来讲「开源」这两个字有多不可靠,这一节在第二节。
中文社区里有人管它叫「源神」,开源之神。这是网友的戏称,不是评价标准,也不代表它每一项都最强。本章拿它举例是因为素材齐、方便动手,不是因为它最好。你学完这一章要拿到的是判断标准,不是一个品牌名——同一套标准套到任何一家身上都应该照样能用。
模型内部没有规则、没有知识库、没有 if-else。有的只是一个巨大的数字表格。下面这些格子里的每个数,就是一个权重,颜色深浅表示它的绝对值大小。
上面是 36 个数。一个 Qwen3-8B 模型有 80 亿个这样的数。训练的全部意义,就是把这几十亿个数从随机值一点点调整到合适的值。调完了,参数冻结,模型就定型了。
每个权重占多少字节,取决于存储精度。模型发布时通常用 FP16,也就是每个数占 2 个字节。所以文件体积有一个很好记的估算:
80 亿参数 × 2 字节 = 160 亿字节 ≈ 16 GB
公式记住了,但它到底意味着什么,拖一下就知道了。下面这个滑块从 0.5B 拖到 2.4 万亿,你可以顺手切换存储精度,看同一个模型的文件是怎么胀大和缩小的。
下面用一组真实的模型对比一下。这里选 Qwen 系列做尺子,是因为它的尺寸谱系目前最完整,从 0.6B 一直到 2.4T 都有公开型号,同一个系列内部比较不会掺进架构差异的干扰。
存储体积和运行时占用是两码事。文件 16 GB,不代表 16 GB 显存就能跑起来。模型运行时还要额外开销一块地方存放对话的中间状态,也就是Harness 核心篇讲过的 KV Cache。算下来通常要在参数量的基础上多留三到五成。
这一章最后有一页交互工具,你可以直接选自己的显卡或者 Mac 型号,看能跑哪些模型。这里先记住结论:看文件大小估显存,会低估。
把上面的事情串起来,权重的意义就清楚了。它不只是一个文件,它是控制权。
反过来说,只提供 API 的模型,你租的是使用权。价格、可用性、什么时候下线,都由对方决定。这个区别在做技术选型时会直接变成风险,也是下一节要拆的东西:各家嘴里的「开源」,含义差得非常远。
「先说结论」要放回选型约束
「中文社区里有人管它叫 「源神」 ,开源之神。这是网友的戏称,不是评价标准,也不代表它每一项都最强。」说明,模型、许可证、接入方式和榜单都只是信息,不是脱离场景的答案。真正的选择取决于任务、数据边界、延迟、质量下限和运行成本。
先写淘汰条件,再看最高分
「模型内部没有规则、没有知识库、没有 if-else。有的只是一个巨大的数字表格。下面这些格子里的每个数,就是一个权重,颜色深浅表示它的绝对值大小」涉及的比较,至少要使用同一组真实输入,并同时观察正确性、失败方式、响应时间和费用。一个在公开榜单上领先的模型,可能因为许可证、隐私要求或峰值延迟不适合你的任务。
- 尺寸铺得最全。 Ollama 官方库里 Qwen3.5 一代从 0.8B 一直排到 122B,中间有 2B、4B、9B、27B、35B。本章后面每讲到一档设备,都能对应上一个真能下载下来的文件,不用换品牌凑数
- 别人拿它当底座。 DeepSeek-R1 放出的六个蒸馏版里有四个用的是 Qwen 底座——这是第三方的选择,不是自家宣传
- 它自己就是个反面教材。 Qwen2.5 时期的 3B 和 72B 用过非标准许可证,正好拿来讲「开源」这两个字有多不可靠,这一节在 第二节
没有测试集,就没有可靠的赢家
以「反过来说,只提供 API 的模型,你租的是使用权。价格、可用性、什么时候下线,都由对方决定。这个区别在做技术选型时会直接变成风险,也是下一节要拆的东西: 各家嘴里的「开源」,含义差得非常远」为起点,选几条真正会影响决策的输入,写下一个会改变选择的反例;这比记住一次排名更能支持下一次判断。
从「先说结论」走到「它长什么样」
「先说结论」先把问题落在「这一章的例子基本都取自 Qwen,先说清楚为什么」上;到了「它长什么样」,讨论继续推进到「模型内部没有规则、没有知识库、没有 if-else。有的只是一个巨大的数字表格。下面这些格子里的每个数,就是一个权重,颜色深浅表示它的绝对值大小」。两段连起来,重点就不只是记住一个结论,而是看清它成立所依赖的条件。
把这条判断带到下一个场景
做模型选择时,先用真实任务写出不能妥协的条件,再用同一组输入比较质量、失败方式、延迟、许可和成本;榜单只适合作为起点。
- 「先说结论」:这一章的例子基本都取自 Qwen,先说清楚为什么
- 「它长什么样」:模型内部没有规则、没有知识库、没有 if-else。有的只是一个巨大的数字表格。下面这些格子里的每个数,就是一个权重,颜色深浅表示它的绝对值大小
- 「最后的要点」:它自己就是个反面教材。 Qwen2.5 时期的 3B 和 72B 用过非标准许可证,正好拿来讲「开源」这两个字有多不可靠,这一节在 第二节
最后的「最后的要点」把讨论落到「它自己就是个反面教材。 Qwen2.5 时期的 3B 和 72B 用过非标准许可证,正好拿来讲「开源」这两个字有多不可靠,这一节在 第二节 」。回看这条线索时,最值得保留的是:当输入、规模或风险改变,哪些判断需要重新做一遍。
我把这篇文章里的一个判断改写成了今天可以验证的小实验。比记住结论更有用的是,知道下一步要观察什么。
读完以后我先回头找它成立的条件,而不是直接把方法搬进项目。这个顺序让后面的取舍清楚很多。
如果把这个判断放到真实工作里,最先需要补的约束是什么?我想知道从阅读到第一次实践之间,哪一步最值得先做。
还没有这篇文章的讨论。