专题篇章 · 开放权重、蒸馏与本地运行

权重是什么?一个模型的全部本事

训练几个月最后凝结成的那个文件:它长什么样、多大、为什么说拥有权重就是拥有控制权

本页解决的问题

先给结论

「权重是什么?一个模型的全部本事」要解决的关键问题是什么?

训练几个月最后凝结成的那个文件:它长什么样、多大、为什么说拥有权重就是拥有控制权

判断标准

让这个结论先证明自己值得留下。 把这一页当成决策工具,而不是需要背下来的定义。把概念连到一个真实任务、一个可观察结果,以及一个能改变你判断的失败上。

下一步

写下一个问题:试完这个方法后,你能用什么证据回答它?

常见误区

结论听起来很完整,却没有检查最关键的假设。

先说结论
权重就是模型训练完之后留下的一堆数字。训练花掉的几千万美元、几个月的算力,最后全部凝结成这一个文件。拿到它,你就能在自己的机器上跑出一模一样的模型,不需要联网,不需要向任何人付费。

这一章的例子基本都取自 Qwen,先说清楚为什么。

  • 尺寸铺得最全。Ollama 官方库里 Qwen3.5 一代从 0.8B 一直排到 122B,中间有 2B、4B、9B、27B、35B。本章后面每讲到一档设备,都能对应上一个真能下载下来的文件,不用换品牌凑数。
  • 别人拿它当底座。DeepSeek-R1 放出的六个蒸馏版里有四个用的是 Qwen 底座——这是第三方的选择,不是自家宣传。
  • 它自己就是个反面教材。Qwen2.5 时期的 3B 和 72B 用过非标准许可证,正好拿来讲「开源」这两个字有多不可靠,这一节在第二节

中文社区里有人管它叫「源神」,开源之神。这是网友的戏称,不是评价标准,也不代表它每一项都最强。本章拿它举例是因为素材齐、方便动手,不是因为它最好。你学完这一章要拿到的是判断标准,不是一个品牌名——同一套标准套到任何一家身上都应该照样能用。

它长什么样

模型内部没有规则、没有知识库、没有 if-else。有的只是一个巨大的数字表格。下面这些格子里的每个数,就是一个权重,颜色深浅表示它的绝对值大小。

正值 负值 颜色越深,绝对值越大

上面是 36 个数。一个 Qwen3-8B 模型有 80 亿个这样的数。训练的全部意义,就是把这几十亿个数从随机值一点点调整到合适的值。调完了,参数冻结,模型就定型了。

这也解释了大模型原理篇讲过的那件事:模型跟你聊天时并不会学到任何东西。权重是训练阶段定死的,对话阶段只读不写。你告诉它的事,它下次就忘了。
参数量决定文件体积

每个权重占多少字节,取决于存储精度。模型发布时通常用 FP16,也就是每个数占 2 个字节。所以文件体积有一个很好记的估算:

权重文件体积(GB)≈ 参数量(B)× 2
80 亿参数 × 2 字节 = 160 亿字节 ≈ 16 GB

公式记住了,但它到底意味着什么,拖一下就知道了。下面这个滑块从 0.5B 拖到 2.4 万亿,你可以顺手切换存储精度,看同一个模型的文件是怎么胀大和缩小的。

把参数量拖到 8B,然后在 FP16 和 INT4 之间来回切一次。
参数量 8 B
存储精度
16 GB

下面用一组真实的模型对比一下。这里选 Qwen 系列做尺子,是因为它的尺寸谱系目前最完整,从 0.6B 一直到 2.4T 都有公开型号,同一个系列内部比较不会掺进架构差异的干扰。

Qwen3-0.6B约 1.2 GB
Qwen3-8B约 16 GB
Qwen3-32B约 64 GB
Qwen3-235B-A22B约 470 GB
Qwen3.8-Max(2.4 万亿参数)数 TB 量级
参数规模来自各模型官方发布说明;体积为 FP16 下的理论估算值,实际文件会因分片方式与附带的配置文件略有出入。Qwen3.8-Max 总参数 2.4 万亿、激活 950 亿,发布于 2026-08-03。
一个容易混淆的地方

存储体积和运行时占用是两码事。文件 16 GB,不代表 16 GB 显存就能跑起来。模型运行时还要额外开销一块地方存放对话的中间状态,也就是Harness 核心篇讲过的 KV Cache。算下来通常要在参数量的基础上多留三到五成。

这一章最后有一页交互工具,你可以直接选自己的显卡或者 Mac 型号,看能跑哪些模型。这里先记住结论:看文件大小估显存,会低估。

为什么权重这么关键

把上面的事情串起来,权重的意义就清楚了。它不只是一个文件,它是控制权

离线
不依赖任何服务商
拔掉网线也能跑,对方涨价、限流、下架都影响不到你
可改
能在它基础上继续训练
用自己的数据微调出一个专属版本,这是调 API 做不到的
留痕
数据不出自己的机器
医疗、法务、内部代码这类不能外发的场景,只有这一条路

反过来说,只提供 API 的模型,你租的是使用权。价格、可用性、什么时候下线,都由对方决定。这个区别在做技术选型时会直接变成风险,也是下一节要拆的东西:各家嘴里的「开源」,含义差得非常远。

「先说结论」要放回选型约束

「中文社区里有人管它叫 「源神」 ,开源之神。这是网友的戏称,不是评价标准,也不代表它每一项都最强。」说明,模型、许可证、接入方式和榜单都只是信息,不是脱离场景的答案。真正的选择取决于任务、数据边界、延迟、质量下限和运行成本。

先写淘汰条件,再看最高分

「模型内部没有规则、没有知识库、没有 if-else。有的只是一个巨大的数字表格。下面这些格子里的每个数,就是一个权重,颜色深浅表示它的绝对值大小」涉及的比较,至少要使用同一组真实输入,并同时观察正确性、失败方式、响应时间和费用。一个在公开榜单上领先的模型,可能因为许可证、隐私要求或峰值延迟不适合你的任务。

  • 尺寸铺得最全。 Ollama 官方库里 Qwen3.5 一代从 0.8B 一直排到 122B,中间有 2B、4B、9B、27B、35B。本章后面每讲到一档设备,都能对应上一个真能下载下来的文件,不用换品牌凑数
  • 别人拿它当底座。 DeepSeek-R1 放出的六个蒸馏版里有四个用的是 Qwen 底座——这是第三方的选择,不是自家宣传
  • 它自己就是个反面教材。 Qwen2.5 时期的 3B 和 72B 用过非标准许可证,正好拿来讲「开源」这两个字有多不可靠,这一节在 第二节

没有测试集,就没有可靠的赢家

以「反过来说,只提供 API 的模型,你租的是使用权。价格、可用性、什么时候下线,都由对方决定。这个区别在做技术选型时会直接变成风险,也是下一节要拆的东西: 各家嘴里的「开源」,含义差得非常远」为起点,选几条真正会影响决策的输入,写下一个会改变选择的反例;这比记住一次排名更能支持下一次判断。

从「先说结论」走到「它长什么样」

「先说结论」先把问题落在「这一章的例子基本都取自 Qwen,先说清楚为什么」上;到了「它长什么样」,讨论继续推进到「模型内部没有规则、没有知识库、没有 if-else。有的只是一个巨大的数字表格。下面这些格子里的每个数,就是一个权重,颜色深浅表示它的绝对值大小」。两段连起来,重点就不只是记住一个结论,而是看清它成立所依赖的条件。

把这条判断带到下一个场景

做模型选择时,先用真实任务写出不能妥协的条件,再用同一组输入比较质量、失败方式、延迟、许可和成本;榜单只适合作为起点。

  • 「先说结论」:这一章的例子基本都取自 Qwen,先说清楚为什么
  • 「它长什么样」:模型内部没有规则、没有知识库、没有 if-else。有的只是一个巨大的数字表格。下面这些格子里的每个数,就是一个权重,颜色深浅表示它的绝对值大小
  • 「最后的要点」:它自己就是个反面教材。 Qwen2.5 时期的 3B 和 72B 用过非标准许可证,正好拿来讲「开源」这两个字有多不可靠,这一节在 第二节

最后的「最后的要点」把讨论落到「它自己就是个反面教材。 Qwen2.5 时期的 3B 和 72B 用过非标准许可证,正好拿来讲「开源」这两个字有多不可靠,这一节在 第二节 」。回看这条线索时,最值得保留的是:当输入、规模或风险改变,哪些判断需要重新做一遍。

标记为已学完 阅读进度会自动记录
← 上一篇下一篇 →

继续阅读

同一条线上的下一篇。

文章讨论

读到这里,留下一个判断。

把刚想明白的地方、还没想通的问题,留给下一位一起学习的人。

正在讨论 权重是什么?一个模型的全部本事 开放权重、蒸馏与本地运行
3条讨论文章讨论 · 与共学社区同步
在共学社区查看
AM
Asha Morgan内容编辑
观点实践记录

我把这篇文章里的一个判断改写成了今天可以验证的小实验。比记住结论更有用的是,知道下一步要观察什么。

文章讨论7 有帮助
LH
Lin Harper独立开发者
观点观点

读完以后我先回头找它成立的条件,而不是直接把方法搬进项目。这个顺序让后面的取舍清楚很多。

文章讨论5 有帮助
KM
Kiki Moore产品运营
问题问题

如果把这个判断放到真实工作里,最先需要补的约束是什么?我想知道从阅读到第一次实践之间,哪一步最值得先做。

文章讨论4 有帮助