入门 7 分钟概念

开放权重还是开源?两者的差异 compte

“开源 LLM”这个说法经常被滥用。在几乎所有情况下,这些模型都是开放权重,而非开源:你能获取网络权重,却拿不到训练代码和数据。这一区别不只是术语严谨派之间的争论——它决定了你有权用模型做什么。本指南明确相关定义,并提供一套评估框架,帮助你在基于模型构建项目之前判断其实际开放程度。

作者: Mohamed Meguedmi·更新于 2026-08-27·已在 Windows、macOS 和 Linux 上测试

#最初的误解

通过 Ollama 下载 Llama、Mistral 或 Qwen 时,到处都能听到“开源”这个词。但这种说法几乎总是不准确的。准确的术语是“开放权重”:实验室发布的是模型权重——也就是在训练过程中学到的数十亿个数值参数。其余部分(用于训练的代码、数据语料库、确切的训练方法)大多仍不公开。

这种混淆源于一个诱人却错误的类比:人们将权重等同于模型的“源代码”。然而,权重并不是像软件源代码那样可读、可修改的代码,而是训练后得到的编译结果。获得权重,有点像获得一个功能强大、可重新配置的可执行二进制文件——而不是能从零重建它的完整流程链。

i
需要记住的句子
开放权重与开源并不是一回事。您遇到的几乎所有所谓的“开源大语言模型”,实际上都是开放权重模型。理解这一区别,才能明白您可以和不可以用模型做什么。

#权重、代码、数据:三个开放层级

本地 AI 套件

只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。

  • 在线空间,终身可用
  • PDF + 文件
  • 30 天内退款

要评估模型的开放程度,需区分三个独立的组成部分。一个模型可能开放其中一项、两项或全部三项。其实际开放程度由组合方式决定。

权重(weights)
神经网络的数值参数,以文件形式发布(通常采用 GGUF 或 safetensors 格式)。有了这些参数,您就可以运行模型、对其进行量化或微调。这是最常开放的层级。
训练代码
脚本、详细架构、超参数、预训练和对齐配方。没有它,你无法复现模型——只能直接使用。
训练数据
模型训练所使用的语料库。出于法律原因(版权)、竞争方面的考虑和实际限制(文本量达数 TB),几乎从不公开。

真正的开源软件会提供与这三项相对应的内容:您可以阅读、修改并重新编译。开放权重的 LLM 通常只开放其中第一项。这很有用,对自托管而言往往已经足够——但严格来说,这并不属于开源。

→
可复现性测试
判断的关键问题是:“仅凭已公开的资料,我能否从零开始重建模型?”如果因为缺少代码或数据而无法做到,那么它就不是开源的,无论营销宣传使用什么说法。

#开放权重究竟意味着什么,以及它能让您做什么

开放权重模型让您能够获取模型权重,通常采用允许本地使用、修改以及往往也允许商业使用的许可证。在自托管的日常实践中,这正是您需要的。

本地运行
在 Ollama、LM Studio 或 llama.cpp 中加载模型,并在您自己的设备上离线运行,不将您的数据发送到其他地方。
Quantizer
通过降低内存占用(Q4_K_M、Q5_K_M、Q8_0…)使大型模型能够运行在您的GPU上。一个14B模型在Q4量化下约需9GB显存。
Fine-tuner
使用您自己的示例对模型进行领域适配(LoRA、QLoRA)。以公开发布的权重为基础进行训练。
再分发
根据许可协议,可重新发布修改后的版本——这正是 Hugging Face 上数以千计社区变体得以存在的原因。

具体来说,当您使用 Ollama 启动模型时,使用的是开放权重。守护进程在 http://localhost:11434 上监听,并提供模型服务;您既不知道该模型的训练代码,也不知道训练数据——对于本地使用而言,这完全不重要。

终端
# Télécharger et exécuter des poids open-weights en local
ollama run qwen3.5:4b

# Inspecter la licence embarquée dans le modèle
ollama show qwen3.5:4b --license
i
在此基础上构建项目前,先检查许可证
命令 ollama show <modèle> --license 会显示随权重提供的许可证文本。养成在开展任何严肃项目之前阅读许可证的习惯:决定您实际权利的是许可证,而不是模型的“开放”名声。

#为什么 Llama 严格意义上不是开源的

Llama 来自 Meta,是所谓「开源模型」的典型代表,但实际上并非如此。Meta 在其权重发布时采用的是自家的 Llama Community License,该许可并非 Apache 2.0 或 MIT。根据传统开源定义,该许可存在两个关键缺陷使其不符合标准。

商业阈值条款
当月活跃用户数量超过一个极高的门槛时,该许可证会施加特殊条件。真正的开源许可证不会因规模或用途而歧视任何人(非歧视标准)。
使用限制
可接受使用政策禁止某些用途。传统开源不允许限制应用领域(“不得因用途而区别对待”)。
不包含代码和数据
Meta 未发布完整的训练代码和语料库,因此无法从当前分发内容中复现 Llama。

开放源代码倡议组织(Open Source Initiative)维护着开源的参考定义,并认为此类许可证不符合相关标准。因此,严格来说,Llama 是采用宽松但有限制的许可证的开放权重模型,而不是开源模型。同样的判断也适用于许多采用自行制定的“社区”许可证的模型。

!
自定义许可证的陷阱
名为“community”或“research”的许可证并不自动属于开源许可证。有些禁止商业使用,有些则禁止训练竞争模型。切勿想当然地认为自己拥有某些使用权:请阅读您所使用模型的具体许可证。

#真正开源的模型

好消息是:确实有模型配得上这一标签。按开放程度,可以区分出两类模型。

#采用 OSI 批准许可证的模型权重

许多模型以 Apache 2.0 或 MIT 许可证发布其权重——这些都是公认的开源许可证,不限制使用方式或用途。多个 Mistral 模型(如 Mistral Small 24B)、Qwen 系列(Qwen 3.5、Qwen 3.8)中采用 Apache 2.0 许可证的版本,以及 Gemma 都属于这种情况;Google 在推出 Gemma 4(2026 年 4 月)时,将 Gemma 的许可证改为 Apache 2.0。您可以将这些模型用于商业用途,自由修改和再分发。不过请注意:权重采用 Apache 许可证,并不意味着训练数据或训练代码也已公开。

#完整开放:模型权重 + 代码 + 数据

在开放程度上更进一步,有少数项目公开全部内容:模型权重、训练代码和数据。OLMo(Allen Institute for AI)和 Pythia 系列(EleutherAI)等项目明确以完全可复现为目标。只有这些项目才是完整意义上真正的开源项目——但它们很少,而且单论模型质量,并不总能达到最优秀的开放权重模型的水平。

→
开放并不等于高质量
开放程度最高的模型不一定性能最佳。最适合本地使用的模型往往是开放权重模型(许可证有限制),而非完全开源模型。请根据您的实际需求选择:性能、法律上的使用自由度或可复现性。

#评估开放程度的分析框架

面对一个新模型,请按以下顺序问自己这些问题。这些问题能帮助您从营销口号转向具体评估:您实际能用这个模型做什么。

  1. 01
    权重是公开的吗?
    无需商业协议,也无需排队,就能下载这些权重吗?如果可以,至少属于 open-weights。如果不可以(只能通过 API 访问),那么无论如何宣传,该模型都是封闭模型。
  2. 02
    采用何种许可证?
    Apache 2.0 或 MIT = 宽松许可,模型权重开源。自定的“community/research”许可 = 仔细阅读限制条款(用户数量门槛、商业用途、训练竞争模型)。
  3. 03
    商业用途是否被允许?
    如果您要开发产品,这是一个关键点。有些许可证完全禁止商业使用,另一些则在超过某个阈值后对商业使用加以限制。
  4. 04
    训练代码是否已公开?
    如果训练代码已公开,您就可以理解并复现训练方法。除以学术研究为目的的项目外,公开训练代码的情况很少见。
  5. 05
    数据是否有文档说明?
    语料库是否已公开,或至少有相关描述?这是迈向完全开源的最后一道关卡,也是最少有人跨过的一道。

前两个问题的答案均为“是”的模型,已经能满足绝大多数自托管需求。后三个问题主要对研究、审计以及最严格的合规要求有意义。

封闭
模型权重不可获取,只能通过 API 使用。典型例子:云端专有模型。
受限开放权重
权重公开,采用附有限制的自有许可证。例如:Llama 采用 Community License。
开放权重,宽松许可
公开的模型权重,采用 Apache 2.0 / MIT 许可证。示例:Mistral Small 24B、Qwen 3.5 / 3.8、Gemma 4。
完全开源
模型权重、代码和数据均已公开,且可复现。示例:OLMo、Pythia。

#这对你实际意味着什么

这种区别并不只是理论上的。根据您的具体情况,它会直接产生实际影响。

您为个人用途自行部署
这种区别对您影响不大。开放权重就已绰绰有余:您可以运行模型、进行量化,数据也留在您自己的设备上。请根据模型性能,以及模型大小是否适合您的 GPU 来选择。
您正在打造一个商业产品
许可证至关重要。请确认许可证允许商业使用,并检查是否有任何门槛会给您带来问题。优先选择 Apache 2.0 / MIT 许可证,用起来更安心。
您需要进行合规性审计或证明合规性
您需要源代码,理想情况下还需要数据。只有完全开源的模型(OLMo、Pythia)才能实现端到端的可追溯性
您希望微调并重新分发
请确认许可证允许衍生作品及其再分发。大多数宽松许可证都允许;部分自定义许可证则有所限制。
i
总结
在本地运行LLM时,开放权重几乎总是足够,而这正是您目前所使用的方案。只有当许可证或可复现性成为项目的关键制约因素时,「开源」才真正成为一个关键问题——例如商业产品、审计或研究场景。

#深入了解

厘清模型开放性的问题后,这些指南将帮助您实际开展自托管:

Ollama 是什么以及它如何工作
下载开放权重并在本地运行模型的入门指南,包含基本命令(run、pull、list)。
选择量化方案(Q4、Q5、Q8、FP16)
取得模型权重后,量化方式决定了这些权重在显卡上的显存占用。
在无 GPU(仅 CPU)的情况下本地运行 LLM
如果没有独立显卡,如何仍然在 CPU 上运行开放权重模型。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。