入门 12 分钟概览

本地运行的中国 LLM:Qwen、DeepSeek、GLM、 Kimi

在 2026 年,如果您下载一个开放权重的 LLM 在自己的设备上运行,它很可能来自中国。Qwen、DeepSeek、GLM、Kimi:这些模型系列占据开放模型排行榜前列,所采用的许可证往往比西方实验室的许可证更宽松。本综述梳理了各个系列的实际表现、许可证究竟规定了什么,以及为什么在本地运行中国 LLM 就能预先解决隐私方面的疑问。

作者: Mohamed Meguedmi·更新于 2026-09-01·已在 Windows、macOS 和 Linux 上测试

#为什么中国 LLM 在开放权重领域占据主导地位

开放模型的格局已经发生转变。两年前 Meta(Llama)还处于领先地位,如今则是中国实验室发布的模型权重性能最强,发布频率也最高。阿里巴巴(Qwen)、DeepSeek、智谱 AI(GLM)和 Moonshot(Kimi)正密集推出模型,从小型 3B 模型到拥有数千亿参数的 MoE 模型。

原因既有战略层面,也有技术层面:公开模型权重能让它们提高全球知名度,吸引社区参与,并成为事实上的标准,即使面对美国的封闭模型也是如此。对您这样的本地用户而言,结果很简单:有大量免费模型可供选择,它们定期更新,而且在代码、推理和多语言能力方面,往往与云端模型不相上下。

i
开放权重 ≠ 开源
“开放权重”(open-weight)意味着模型权重可以自由下载并运行。这并不保证训练数据或完整代码已经公开。本指南中几乎所有模型都属于这种情况——您获得的是模型,而不是它的训练配方。

#本地运行解决了隐私问题

本地 AI 套件

只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。

  • 在线空间,终身可用
  • PDF + 文件
  • 终身更新

这是人们下意识会提出的质疑:“中国的 LLM,我的数据会传到中国去。”对于云端 API(chat.qwen.ai、DeepSeek 应用、智谱平台),这确实成立——您的提示词会经过受中国法律管辖的远程服务器。但本指南讨论的是本地运行,而在本地运行时,这种担忧就没有对象了。

当您用 Ollama 或 LM Studio 运行模型时,会下载一个固定的权重文件(例如 GGUF 文件),并由您的 GPU 计算回答。模型本身没有联网能力:它不是会“向开发者回传数据”的软件,而是一个庞大的数字矩阵。无论模型来自哪里,都不会有任何数据离开您的机器。

云端(API)
您的提示词会发送给模型提供商。模型的来源和所涉司法管辖区确实很重要。
本地运行
模型权重运行在您的设备上,如需可离线运行。不会有任何数据离开设备。
真正的残余风险
模型输出中存在偏见或审查(涉及某些敏感主题),并非数据泄露。这是输出质量的问题,而非隐私问题。
→
检查是否有任何数据外传
请自行验证:启动Ollama,断开Wi-Fi,与模型进行对话。所有功能均正常运行。本地大语言模型仅在初始权重下载阶段需要网络连接。

#实际许可证:Apache 2.0 和 MIT

另一个常见误解是:「中国模型的许可证不透明,或者暗藏陷阱」。2026 年的现实恰恰相反——这些许可证往往是市场上最清晰、最规范的。本概览中的大多数模型都以 Apache 2.0 或 MIT 许可证发布,这两种国际通用的宽松许可证也允许商业用途。

Qwen
大多数近期版本(如Qwen3.8-27B)采用Apache 2.0许可——允许商业使用,可自由分发。
DeepSeek
V3/V4 和 R1 版本模型采用 MIT 许可证发布,属于目前最宽松的开源许可之一。
GLM (Zhipu)
最新版本(如GLM-5.2)已采用MIT许可证。
Kimi(Moonshot)
权重开放,采用 MIT/Apache 类型的宽松许可证,具体取决于版本。
!
仍然要阅读模型卡
某些旧系列或特定变体可能包含自定义许可协议及使用条款。在进行商业部署前,务必检查您下载的特定模型在Hugging Face页面上的LICENSE文件——而不仅依赖于模型家族的声誉。

#Qwen(阿里):万能工具

Qwen 是这一生态系统中最全面、用途最广的模型系列。阿里巴巴提供各种规模的模型,从能在入门级 GPU 上运行的 3B 到大型 MoE,也涵盖各种专业方向:通用、代码(Qwen3-Coder)、视觉(Qwen3-VL),以及用于推理的“thinking”模式。

优点
多语言能力卓越(法语也相当不错),无与伦比的模型规模选择,成熟的工具生态系统,在 Ollama 上首日可用。
典型模型规模
3B/7B 用于测试,27B(Qwen3.8)是质量与显存之间的最佳平衡点,最高可到35B-A3B的MoE模型,适用于大显卡。
适用人群
如果您刚入门,希望找到一个各方面都表现不错的模型,这是默认首选。

#DeepSeek:推理领域的冠军

DeepSeek 凭借 R1 一举成名,这是一款思维链推理模型,在 2025 年初震撼了整个行业。该系列在逻辑、数学和复杂代码任务上仍是标杆。R1 的蒸馏版本(7B、14B、32B)使得这种推理能力可以在消费级硬件上实现。

优点
顶尖的推理与数学能力,MIT许可证,可在本地运行的蒸馏版本。
陷阱
旗舰模型(V3/V4,采用MoE架构,参数量为671B及以上)规模庞大,单个GPU无法承载。对于面向普通用户的本地运行,建议选择R1蒸馏模型。
适用人群
从事复杂编程、数学或逻辑推理,或希望看到模型在作答前进行思考的用户。

#GLM(智谱):全能的挑战者

由智谱 AI 开发的 GLM 是 Qwen 的有力挑战者。它的法语能力不错,代码和推理表现扎实,提供规模适中的模型(约 9B 和 32B),直接面向显存为 12–24 GB 的 GPU 所适合的模型规模,也提供 GLM-5.2(753B)这类巨型混合专家(MoE)模型,供极高配置的设备使用。

优点
9B至32B系列变体在质量与规模之间达到出色平衡,法语表现良好,最新版本采用MIT许可证。
典型模型规模
8–12 GB 显存的 GPU 适合 9B 模型,24 GB 显存适合 32B 模型。前沿 MoE 版本仍仅适用于配备大容量统一内存的 Mac。
适用人群
如果您想做比较,它是 Qwen 的可靠替代选择;如果您想在配置不高的硬件上获得良好的法语表现,它也是一个合适的模型。

#Kimi 和 MiniCPM:两个极端

这两个系列展示了该光谱的两端。Kimi (Moonshot) 瞄准超大规模:拥有 1 万亿参数及以上的 MoE 模型,以其长上下文和智能体质量著称。MiniCPM (OpenBMB / ModelBest 团队) 则相反:专注于紧凑高效的模型,旨在移动端或小型 GPU 上运行。

Kimi K2 / K3
巨型 MoE 模型(1T 至 2.8T 参数)。权重开放,但“开放”并不意味着“能在您自己的设备上运行”:这需要数十个加速器。仅适用于服务器,不适用于工作站。
MiniCPM
超紧凑模型,其中部分支持多模态,专为嵌入式设备和低配置设备设计。当每一 GB 显存都至关重要时,这是理想选择。
要点
开放权重模型覆盖各种硬件配置。不要把“模型可自由使用”与“我的机器能运行它”混为一谈。

#根据您的VRAM选择合适的模型

本地运行的真正限制因素并非模型品牌,而是您 GPU 的 VRAM。采用 Q4_K_M 量化(质量与大小之间的最佳折中)时,以下具体参考值可帮助您按硬件档次对这些模型系列进行分类。

8 GB(RTX 3060 8G,4060)
Qwen 7B、GLM 9B、DeepSeek-R1 的 7B 蒸馏模型,采用 Q4 量化(约 5 GB)。可轻松用于聊天和轻量编程。
12 GB(RTX 3060 12G,4070)
最佳平衡点。Qwen 14B、采用 Q8 量化的 GLM 9B、DeepSeek-R1 14B(约 9 GB)。还有余量支持更长的上下文。
16 GB(RTX 4080,5070 Ti)
Qwen 约 24–27B,DeepSeek-R1 32B 需采用较强的量化。这是能够认真开展推理任务的档位。
24 GB(RTX 3090/4090)
Qwen 27-32B 和 GLM 32B 可完全装入显存(约 19 GB),还有 MoE 35B-A3B。大众级本地 AI 的最佳选择。
配备统一内存的 Mac(48–128+ GB)
对于大型 MoE(GLM-5.2、DeepSeek Flash),通过卸载到统一内存来运行是唯一现实可行的选择——生成吞吐量较为有限。
i
Q4 量化下的显存占用参考
3B ≈ 2 GB · 7B ≈ 5 GB · 14B ≈ 9 GB · 32B ≈ 19 GB · 70B ≈ 40 GB。请始终额外预留 1 至 2 GB 用于上下文和系统开销。当模型超出 VRAM 时,将切换至 RAM(CPU offload),吞吐量会显著下降。

#中国模型的实际安装方法

无论模型来自哪里,典型的技术栈都相同:以 Ollama 作为推理守护进程(监听 http://localhost:11434),搭配 Open WebUI 或 LM Studio 作为界面。以下介绍如何获取各个系列的模型。

  1. 01
    安装 Ollama
    从ollama.com下载守护进程并启动。它会在11434端口暴露本地API——无需额外配置即可开始使用。
  2. 02
    根据您的 VRAM 选择模型
    重新查看上面的表格。如果拿不准,可选择 Q4_K_M 格式的 Qwen 14B 或 GLM 9B:它们能装入大多数较新 GPU 的显存,并覆盖 90% 的使用场景。
  3. 03
    下载并启动
    只需一条命令即可下载模型权重,然后打开聊天。首次启动会下载数 GB 的数据;后续启动则会瞬间完成。
  4. 04
    检查离线模式
    一旦模型权重加载到缓存中,断开网络继续对话:这证明模型本地运行率达 100%。
终端
# Qwen généraliste (Alibaba, Apache 2.0)
ollama run qwen3

# DeepSeek-R1 distillé, raisonnement (MIT)
ollama run deepseek-r1:14b

# GLM, l'alternative polyvalente (Zhipu)
ollama run glm4

# Vérifier les modèles installés et que le daemon répond
curl http://localhost:11434/api/tags
→
标签名称会有所不同
Ollama 模型库中的确切标签(qwen3、deepseek-r1:14b 等)和可用版本变化很快。下载前,请查看 ollama.com/library,确认每个变体的准确名称及以 GB 为单位的大小。

#深入了解

本概览为您提供整体图景;这些指南进一步详述了各类模型及其本地配置参数:

Qwen 的最佳平衡点
《Qwen 3.8 27B 本地运行:Ollama 安装、显存与设置》详细介绍了准确的命令、不同量化方式所需的显存,以及 thinking 模式。
DeepSeek 的推理能力
《使用 Ollama 安装 DeepSeek R1》介绍了 7B/14B/32B 蒸馏版本以及在本地运行思维链的方法。
根据您的显卡选择模型
《12 GB / 16 GB / 24 GB 显存适合运行哪些 LLM?》这些指南将上述档位转化为针对各款 GPU 的具体模型推荐。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。