本地运行的中国 LLM:Qwen、DeepSeek、GLM、 Kimi
在 2026 年,如果您下载一个开放权重的 LLM 在自己的设备上运行,它很可能来自中国。Qwen、DeepSeek、GLM、Kimi:这些模型系列占据开放模型排行榜前列,所采用的许可证往往比西方实验室的许可证更宽松。本综述梳理了各个系列的实际表现、许可证究竟规定了什么,以及为什么在本地运行中国 LLM 就能预先解决隐私方面的疑问。
#为什么中国 LLM 在开放权重领域占据主导地位
开放模型的格局已经发生转变。两年前 Meta(Llama)还处于领先地位,如今则是中国实验室发布的模型权重性能最强,发布频率也最高。阿里巴巴(Qwen)、DeepSeek、智谱 AI(GLM)和 Moonshot(Kimi)正密集推出模型,从小型 3B 模型到拥有数千亿参数的 MoE 模型。
原因既有战略层面,也有技术层面:公开模型权重能让它们提高全球知名度,吸引社区参与,并成为事实上的标准,即使面对美国的封闭模型也是如此。对您这样的本地用户而言,结果很简单:有大量免费模型可供选择,它们定期更新,而且在代码、推理和多语言能力方面,往往与云端模型不相上下。
#本地运行解决了隐私问题
只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。
- 在线空间,终身可用
- PDF + 文件
- 终身更新
这是人们下意识会提出的质疑:“中国的 LLM,我的数据会传到中国去。”对于云端 API(chat.qwen.ai、DeepSeek 应用、智谱平台),这确实成立——您的提示词会经过受中国法律管辖的远程服务器。但本指南讨论的是本地运行,而在本地运行时,这种担忧就没有对象了。
当您用 Ollama 或 LM Studio 运行模型时,会下载一个固定的权重文件(例如 GGUF 文件),并由您的 GPU 计算回答。模型本身没有联网能力:它不是会“向开发者回传数据”的软件,而是一个庞大的数字矩阵。无论模型来自哪里,都不会有任何数据离开您的机器。
- 云端(API)
- 您的提示词会发送给模型提供商。模型的来源和所涉司法管辖区确实很重要。
- 本地运行
- 模型权重运行在您的设备上,如需可离线运行。不会有任何数据离开设备。
- 真正的残余风险
- 模型输出中存在偏见或审查(涉及某些敏感主题),并非数据泄露。这是输出质量的问题,而非隐私问题。
#实际许可证:Apache 2.0 和 MIT
另一个常见误解是:「中国模型的许可证不透明,或者暗藏陷阱」。2026 年的现实恰恰相反——这些许可证往往是市场上最清晰、最规范的。本概览中的大多数模型都以 Apache 2.0 或 MIT 许可证发布,这两种国际通用的宽松许可证也允许商业用途。
- Qwen
- 大多数近期版本(如Qwen3.8-27B)采用Apache 2.0许可——允许商业使用,可自由分发。
- DeepSeek
- V3/V4 和 R1 版本模型采用 MIT 许可证发布,属于目前最宽松的开源许可之一。
- GLM (Zhipu)
- 最新版本(如GLM-5.2)已采用MIT许可证。
- Kimi(Moonshot)
- 权重开放,采用 MIT/Apache 类型的宽松许可证,具体取决于版本。
#Qwen(阿里):万能工具
Qwen 是这一生态系统中最全面、用途最广的模型系列。阿里巴巴提供各种规模的模型,从能在入门级 GPU 上运行的 3B 到大型 MoE,也涵盖各种专业方向:通用、代码(Qwen3-Coder)、视觉(Qwen3-VL),以及用于推理的“thinking”模式。
- 优点
- 多语言能力卓越(法语也相当不错),无与伦比的模型规模选择,成熟的工具生态系统,在 Ollama 上首日可用。
- 典型模型规模
- 3B/7B 用于测试,27B(Qwen3.8)是质量与显存之间的最佳平衡点,最高可到35B-A3B的MoE模型,适用于大显卡。
- 适用人群
- 如果您刚入门,希望找到一个各方面都表现不错的模型,这是默认首选。
#DeepSeek:推理领域的冠军
DeepSeek 凭借 R1 一举成名,这是一款思维链推理模型,在 2025 年初震撼了整个行业。该系列在逻辑、数学和复杂代码任务上仍是标杆。R1 的蒸馏版本(7B、14B、32B)使得这种推理能力可以在消费级硬件上实现。
- 优点
- 顶尖的推理与数学能力,MIT许可证,可在本地运行的蒸馏版本。
- 陷阱
- 旗舰模型(V3/V4,采用MoE架构,参数量为671B及以上)规模庞大,单个GPU无法承载。对于面向普通用户的本地运行,建议选择R1蒸馏模型。
- 适用人群
- 从事复杂编程、数学或逻辑推理,或希望看到模型在作答前进行思考的用户。
#GLM(智谱):全能的挑战者
由智谱 AI 开发的 GLM 是 Qwen 的有力挑战者。它的法语能力不错,代码和推理表现扎实,提供规模适中的模型(约 9B 和 32B),直接面向显存为 12–24 GB 的 GPU 所适合的模型规模,也提供 GLM-5.2(753B)这类巨型混合专家(MoE)模型,供极高配置的设备使用。
- 优点
- 9B至32B系列变体在质量与规模之间达到出色平衡,法语表现良好,最新版本采用MIT许可证。
- 典型模型规模
- 8–12 GB 显存的 GPU 适合 9B 模型,24 GB 显存适合 32B 模型。前沿 MoE 版本仍仅适用于配备大容量统一内存的 Mac。
- 适用人群
- 如果您想做比较,它是 Qwen 的可靠替代选择;如果您想在配置不高的硬件上获得良好的法语表现,它也是一个合适的模型。
#Kimi 和 MiniCPM:两个极端
这两个系列展示了该光谱的两端。Kimi (Moonshot) 瞄准超大规模:拥有 1 万亿参数及以上的 MoE 模型,以其长上下文和智能体质量著称。MiniCPM (OpenBMB / ModelBest 团队) 则相反:专注于紧凑高效的模型,旨在移动端或小型 GPU 上运行。
- Kimi K2 / K3
- 巨型 MoE 模型(1T 至 2.8T 参数)。权重开放,但“开放”并不意味着“能在您自己的设备上运行”:这需要数十个加速器。仅适用于服务器,不适用于工作站。
- MiniCPM
- 超紧凑模型,其中部分支持多模态,专为嵌入式设备和低配置设备设计。当每一 GB 显存都至关重要时,这是理想选择。
- 要点
- 开放权重模型覆盖各种硬件配置。不要把“模型可自由使用”与“我的机器能运行它”混为一谈。
#根据您的VRAM选择合适的模型
本地运行的真正限制因素并非模型品牌,而是您 GPU 的 VRAM。采用 Q4_K_M 量化(质量与大小之间的最佳折中)时,以下具体参考值可帮助您按硬件档次对这些模型系列进行分类。
- 8 GB(RTX 3060 8G,4060)
- Qwen 7B、GLM 9B、DeepSeek-R1 的 7B 蒸馏模型,采用 Q4 量化(约 5 GB)。可轻松用于聊天和轻量编程。
- 12 GB(RTX 3060 12G,4070)
- 最佳平衡点。Qwen 14B、采用 Q8 量化的 GLM 9B、DeepSeek-R1 14B(约 9 GB)。还有余量支持更长的上下文。
- 16 GB(RTX 4080,5070 Ti)
- Qwen 约 24–27B,DeepSeek-R1 32B 需采用较强的量化。这是能够认真开展推理任务的档位。
- 24 GB(RTX 3090/4090)
- Qwen 27-32B 和 GLM 32B 可完全装入显存(约 19 GB),还有 MoE 35B-A3B。大众级本地 AI 的最佳选择。
- 配备统一内存的 Mac(48–128+ GB)
- 对于大型 MoE(GLM-5.2、DeepSeek Flash),通过卸载到统一内存来运行是唯一现实可行的选择——生成吞吐量较为有限。
#中国模型的实际安装方法
无论模型来自哪里,典型的技术栈都相同:以 Ollama 作为推理守护进程(监听 http://localhost:11434),搭配 Open WebUI 或 LM Studio 作为界面。以下介绍如何获取各个系列的模型。
- 01安装 Ollama从ollama.com下载守护进程并启动。它会在11434端口暴露本地API——无需额外配置即可开始使用。
- 02根据您的 VRAM 选择模型重新查看上面的表格。如果拿不准,可选择 Q4_K_M 格式的 Qwen 14B 或 GLM 9B:它们能装入大多数较新 GPU 的显存,并覆盖 90% 的使用场景。
- 03下载并启动只需一条命令即可下载模型权重,然后打开聊天。首次启动会下载数 GB 的数据;后续启动则会瞬间完成。
- 04检查离线模式一旦模型权重加载到缓存中,断开网络继续对话:这证明模型本地运行率达 100%。
#深入了解
本概览为您提供整体图景;这些指南进一步详述了各类模型及其本地配置参数:
- Qwen 的最佳平衡点
- 《Qwen 3.8 27B 本地运行:Ollama 安装、显存与设置》详细介绍了准确的命令、不同量化方式所需的显存,以及 thinking 模式。
- DeepSeek 的推理能力
- 《使用 Ollama 安装 DeepSeek R1》介绍了 7B/14B/32B 蒸馏版本以及在本地运行思维链的方法。
- 根据您的显卡选择模型
- 《12 GB / 16 GB / 24 GB 显存适合运行哪些 LLM?》这些指南将上述档位转化为针对各款 GPU 的具体模型推荐。
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。