专题篇章 · 开放权重、蒸馏与本地运行

Ollama 与 LM Studio 怎么上手

从安装到跑通的完整命令、模型标签的读法、量化档位怎么选,以及三个最常见的坑

本页解决的问题

先给结论

「Ollama 与 LM Studio 怎么上手」要解决的关键问题是什么?

从安装到跑通的完整命令、模型标签的读法、量化档位怎么选,以及三个最常见的坑

判断标准

让这个结论先证明自己值得留下。 把这一页当成决策工具,而不是需要背下来的定义。把概念连到一个真实任务、一个可观察结果,以及一个能改变你判断的失败上。

下一步

写下一个问题:试完这个方法后,你能用什么证据回答它?

常见误区

结论听起来很完整,却没有检查最关键的假设。

先选工具

Ollama

命令行
  • 一条命令下载并运行,没有多余步骤
  • 装好后自动在后台提供服务,可以直接被程序调用
  • 接口兼容 OpenAI 的格式,原来调 API 的代码改个地址就能用
  • 没有图形界面,换模型、调参数都要敲命令
适合你,如果:你要把本地模型接进自己的程序,或者习惯用终端。

LM Studio

图形界面
  • 内置模型浏览器,能看到体积和量化档位再决定下不下
  • 会提示当前机器能不能带得动,对新手很友好
  • 也能开本地服务器,同样兼容 OpenAI 格式
  • 在 Apple 芯片上支持 MLX 引擎,比通用格式更快
适合你,如果:你想先试几个模型比较一下,或者不想碰命令行。
不用纠结,两个可以都装。它们下载的模型文件互不冲突,很多人用 LM Studio 挑模型和试效果,用 Ollama 跑常驻服务。
Ollama:从零到跑通

装好 Ollama 之后,只需要一条命令。以上一节算出你能跑 8B 为例:

下载并直接开始对话
ollama run qwen3:8b

就这一句。本地没有就先下载,下完自动进入对话。想只下载不运行,把 run 换成 pull。其余常用命令:

日常管理
# 看已经下载了哪些模型,以及各占多少空间
ollama list

# 删掉不用的,本地模型很占硬盘
ollama rm qwen3:8b

# 看当前正在占用显存的模型
ollama ps

装好后 Ollama 会在本机 11434 端口提供服务,接口格式跟 OpenAI 一致。也就是说你手上现成的 OpenAI 调用代码,把 base_url 指过来就能跑,模型名填标签名即可。

用现成的 OpenAI SDK 调本地模型
from openai import OpenAI

# 本地服务不校验密钥,api_key 随便填一个非空值
client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")

resp = client.chat.completions.create(
    model="qwen3:8b",
    messages=[{"role": "user", "content": "用一句话解释什么是量化"}],
)
print(resp.choices[0].message.content)

上面那条命令里的 8b 是举例。你自己该敲哪个数字,取决于你的机器。选一下,下面直接给出你能复制走的那条。

选完直接点复制,这条命令装好 Ollama 就能用。
平台
型号
主要用途

把上面那个选择器里的机型换着点一遍,会看出一件反直觉的事:决定你能跑多大模型的不是显卡多贵,是显存多大。一张 RTX 4090 停在 30B,而一台统一内存 128 GB 的 Mac 能吃下 122B——后者的图形算力远不如前者,但模型装得进去,前者装不进去。

同样是 INT4,两台机器的上限
  • RTX 4090(24 GB 显存)→ 最大 Qwen3-30B-A3B,需 19.5 GB
  • Mac 统一内存 128 GB(约 96 GB 可用)→ 最大 Qwen3.5-122B-A10B,需 79.3 GB

这也是大内存 Mac 在本地跑模型这件事上唯一说得通的理由。它的优势不是快,是装得下:同样的钱买独显,显存到 24 GB 就到头了,而统一内存能堆到 128 GB 以上,中间这一段没有别的消费级设备能补。如果你的用途就是在本地跑大尺寸模型,内存容量比 GPU 型号重要得多。

上面的推荐只登记了 Ollama 官方库里确实存在的标签,核对日期 2026-08-07,来源 ollama.com/library。给一条拉不下来的命令比不给更糟。
标签怎么读

冒号后面那串不是随便写的,每一段都有含义。

qwen3:30b-a3b-q4_K_M
qwen3模型系列名。
30b-a3b尺寸。带 a 的是 MoE,这里表示总参数 30B、激活 3B。上一节讲过,显存要按 30B 准备。
q4_K_M量化档位。不写的话会用默认档,见下一段。
第一个坑:你跑的默认就是量化版。不写量化后缀时,Ollama 拉的通常是 Q4 档,不是原始精度。很多人拿它跟官方 API 的效果比,觉得开源模型不行,其实比的根本不是同一个东西。要对比质量,先确认两边跑的是不是同一个档位。
量化档位怎么选
Q4_K_M
默认选它。体积和质量的平衡点,绝大多数工具的默认档。日常问答、总结、改写这类任务上够用。
Q5_K_M
体积略大,质量更稳。如果你主要拿来写代码或做数学题,选这一档更保险,这两类任务对精度损失比较敏感。
Q8_0
接近原始质量,体积也接近翻倍。显存充裕又想要最好效果时用。
Q3 及以下
除非显存实在不够,否则不建议。掉分开始明显,还不如换个小一号的模型跑高一档量化。
一条实用规律:模型越大,量化越安全。32B 模型量化到 Q4 掉的那点分,往往还是比 8B 跑 Q8 强。所以显存有限时,优先保尺寸,再考虑档位。
可用标签会随版本更新,实际拉取前建议到 ollama.com/library 对应模型的 tags 页确认当前有哪些尺寸与档位。核对日期 2026-08-07。
LM Studio:点几下就行
1

在模型库里搜索

搜模型名,列表会列出各个量化版本的体积。界面会根据你的机器提示哪些带得动,这一点比命令行直观很多。

2

下载后直接聊天

加载模型时可以调上下文长度和 GPU 分配。这两个参数直接影响显存占用,先用默认值跑通再调。

3

需要给程序调用时,开本地服务器

在服务器面板里启动,同样是 OpenAI 兼容接口,用法和上面的 Ollama 例子一样,只是端口不同。

4

Mac 用户注意选 MLX 版本

如果模型有 MLX 格式,优先选它。这是针对 Apple 芯片优化的引擎,同样的模型速度会明显好于通用格式。

还有三个常见的坑
  • 上下文开太大,显存直接爆。这是最高频的问题。模型加载时显存看着够,一旦把上下文拉到几十 K,KV Cache 涨上来就崩了。现象是生成到一半卡死,或者速度突然慢到不可用。先按默认上下文跑通,需要长文再一档一档往上加。
  • 显存不够时不一定报错。有些工具会自动把装不下的部分放到内存里,靠 CPU 算。结果是能跑,但慢十倍以上。如果你发现生成速度慢得离谱,先检查是不是没完全装进显存。
  • 硬盘会被吃掉。一个 8B 的 Q4 模型三四个 GB,试几个模型就是几十个 GB。定期用 ollama list 看一眼,不用的删掉。
三条路,什么时候走哪条

到这里,你手上有三种用模型的方式了。它们不是替代关系,各有各的场合:

  • 本地跑。数据不能外发、要长期高频调用、或者想完全不受服务商影响时。代价是能力上限受硬件限制。
  • 官方 API。要最强能力、不想管运维时。按量付费,用多少算多少。
  • 中转站。便利性和风险并存,具体的取舍在《什么是 API 中转站》那一节讲过,涉及数据经手第三方的问题,选之前建议回去再看一眼。

这一章到此结束。你现在应该能自己判断一个模型的开放程度、知道小模型是怎么来的和它的代价、并且能在自己的机器上把它跑起来。

「先选工具」要放回选型约束

「装好 Ollama 之后,只需要一条命令。以上一节算出你能跑 8B 为例」说明,模型、许可证、接入方式和榜单都只是信息,不是脱离场景的答案。真正的选择取决于任务、数据边界、延迟、质量下限和运行成本。

先写淘汰条件,再看最高分

「就这一句。本地没有就先下载,下完自动进入对话。想只下载不运行,把 run 换成 pull 。其余常用命令」涉及的比较,至少要使用同一组真实输入,并同时观察正确性、失败方式、响应时间和费用。一个在公开榜单上领先的模型,可能因为许可证、隐私要求或峰值延迟不适合你的任务。

  • 装好后自动在后台提供服务,可以直接被程序调用
  • 接口兼容 OpenAI 的格式,原来调 API 的代码改个地址就能用
  • 内置模型浏览器,能看到体积和量化档位再决定下不下

没有测试集,就没有可靠的赢家

以「这一章到此结束。你现在应该能自己判断一个模型的开放程度、知道小模型是怎么来的和它的代价、并且能在自己的机器上把它跑起来」为起点,选几条真正会影响决策的输入,写下一个会改变选择的反例;这比记住一次排名更能支持下一次判断。

从「先选工具」走到「Ollama:从零到跑通」

「先选工具」先把问题落在「Ollama 命令行 一条命令下载并运行,没有多余步骤 装好后自动在后台提供服务,可以直接被程序调用 接口兼容 OpenAI 的格式,原来调 API 的代码改个地址就能用 没有图形界面,换模型、调参数都要敲命令 适合你,如果: 你要把本地模型接进自己的程序,或者习惯用终端。 LM Studio 图形界面 内置模型浏览器,能看到体积和量化档位再决定下不下 会提示当前机器能不能带得动,对新手很友好 也能开本地服务器,同样…」上;到了「Ollama:从零到跑通」,讨论继续推进到「装好 Ollama 之后,只需要一条命令。以上一节算出你能跑 8B 为例」。两段连起来,重点就不只是记住一个结论,而是看清它成立所依赖的条件。

把这条判断带到下一个场景

做模型选择时,先用真实任务写出不能妥协的条件,再用同一组输入比较质量、失败方式、延迟、许可和成本;榜单只适合作为起点。

  • 「先选工具」:Ollama 命令行 一条命令下载并运行,没有多余步骤 装好后自动在后台提供服务,可以直接被程序调用 接口兼容 OpenAI 的格式,原来调 API 的代码改个地址就能用 没有图形界面,换模型、调参数都要敲命令 适合你,如果: 你要把本地模型接进自己的程序,或者习惯用终端。 LM Studio 图形界面 内置模型浏览器,能看到体积和量化档位再决定下不下 会提示当前机器能不能带得动,对新手很友好 也能开本地服务器,同样…
  • 「Ollama:从零到跑通」:装好 Ollama 之后,只需要一条命令。以上一节算出你能跑 8B 为例
  • 「最后的要点」:在 Apple 芯片上支持 MLX 引擎,比通用格式更快

最后的「最后的要点」把讨论落到「在 Apple 芯片上支持 MLX 引擎,比通用格式更快」。回看这条线索时,最值得保留的是:当输入、规模或风险改变,哪些判断需要重新做一遍。

标记为已学完 阅读进度会自动记录
← 上一篇下一篇 →

继续阅读

同一条线上的下一篇。

文章讨论

读到这里,留下一个判断。

把刚想明白的地方、还没想通的问题,留给下一位一起学习的人。

正在讨论 Ollama 与 LM Studio 怎么上手 开放权重、蒸馏与本地运行
3条讨论文章讨论 · 与共学社区同步
在共学社区查看
AM
Asha Morgan内容编辑
观点实践记录

我把这篇文章里的一个判断改写成了今天可以验证的小实验。比记住结论更有用的是,知道下一步要观察什么。

文章讨论7 有帮助
LH
Lin Harper独立开发者
观点观点

读完以后我先回头找它成立的条件,而不是直接把方法搬进项目。这个顺序让后面的取舍清楚很多。

文章讨论5 有帮助
KM
Kiki Moore产品运营
问题问题

如果把这个判断放到真实工作里,最先需要补的约束是什么?我想知道从阅读到第一次实践之间,哪一步最值得先做。

文章讨论4 有帮助