Hugging Face:是什么,以及如何使用 ?
Hugging Face 是几乎所有开放 AI 模型的发布平台:Qwen、Llama、Gemma、Mistral、gpt-oss、DeepSeek。它常被称为机器学习领域的 GitHub,是这些文件的来源仓库,包括 Ollama 和 LM Studio 为您下载的文件。Hub 上的公开模型数量于 2026 年 8 月 18 日突破三百万,且没有经过任何编辑筛选。
Hugging Face 是几乎所有开放 AI 模型的发布平台:Qwen、Llama、Gemma、Mistral、gpt-oss、DeepSeek。它常被称为机器学习的 GitHub。对于在自己的机器上运行 AI 的人来说,这里是所有文件的来源仓库,包括 Ollama 和 LM Studio 为您下载的那些文件。Hub 于 2026 年 8 月 18 日正式突破三百万个公开模型大关,每天新增约 2 700 至 3 000 个模型,且未经任何筛选。本页将教您如何看懂这个平台:该打开哪个仓库,为您的显卡选择哪个文件,以及在点击前需要检查什么。
#Hugging Face 是什么?
Hugging Face 是一家由三位法国企业家 Clément Delangue、Julien Chaumond 和 Thomas Wolf 于 2016 年创立的公司,在纽约和巴黎两地开展业务,注册总部仍位于美国。它最初推出了一款面向青少年的聊天机器人应用,这个项目如今已被放弃;公司的名字就取自那个面带微笑、张开双手的表情符号。随后,它转向机器学习开源工具:其 transformers 库已成为在 Python 中加载和运行语言模型的近乎标准的方式,被大多数研究实验室和业内企业采用。最后,公司构建了 Hub,这是一个基于 Git 版本控制系统的托管平台,任何人都可以免费发布模型、数据集和小型网页演示,无需事先经过编辑审核。
对于本地AI而言,Hub就像一个应用商店,但有两个不同之处:几乎一切都是免费的,且没有任何内容是为用户精选的。与传统应用商店不同,没有任何人会在发布前对模型进行测试、审核或分类:任何人都可以免费注册账户,并在几分钟内提交一个仓库,无需任何审核或质量控制。这种完全缺乏筛选机制既是Hub的优势——所有内容都会优先出现,甚至在实验室正式宣布之前就已经上线——也是新手的主要陷阱,用户可能面对数百个搜索结果,却无法判断哪个是可靠的。学会如何辨别,区分官方仓库与第三方副本、真实转换与被放弃的实验,是下载任何内容前必须掌握的技能。
#Hub 的三个分区
只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。
- 在线空间,终身可用
- PDF + 文件
- 30 天内退款
| 领域 | 内容 | 对本地 AI 的用处 |
|---|---|---|
| Models | 权重文件、配置文件、文档 | 这里存放着您将运行的文件 |
| Datasets | 训练与评估数据 | 仅在进行微调或测试时才需要 |
| Spaces | 小型网页应用,通常为演示版本 | 下载 15 GB 前,先在浏览器中试用模型 |
#阅读模型页面
每个模型都有一个形如 huggingface.co/organisation/nom-du-modele 的地址,例如 huggingface.co/Qwen/Qwen3-8B。在下载任何内容之前,该页面上有四个不同的要素值得您关注。
- 组织名称
- Qwen,google、meta-llama、mistralai、openai、deepseek-ai 是原始实验室本身,已验证。其他任何名称均指第三方:有时表现优秀,但绝非原始实验室的官方产品。
- 模型卡片(model card)
- README 文件:模型是什么,如何训练,预期用途,性能评分,提示词格式,以及限制。质量从非常完整到完全空白不等。
- 许可信息
- 在模型卡片顶部清晰显示,位于模型名称旁边。有关每种常见许可实际允许的内容,请参见下方专门章节。
- “Files and versions”选项卡
- 可下载文件的完整列表。快速浏览即可立即了解当前处于何种存储库类型。
#选择哪个仓库:原始权重还是GGUF格式
| 您在 Files 中看到的内容 | 这是什么 | 适用于哪些工具 | 8B 模型的文件大小 |
|---|---|---|---|
| model-00001-of-00004.safetensors… | 原始权重以 BF16 格式分割为多个文件 | transformers、vLLM、微调工具 | ≈ 16 GB |
| …-Q4_K_M.gguf, …-Q8_0.gguf | 量化转换版本,每个量化级别一个文件 | Ollama, LM Studio, llama.cpp, KoboldCpp, Jan | ≈ 5 GB(Q4) |
| …-AWQ、…-GPTQ、…-FP8 仓库 | 专为 GPU 服务器设计的量化 | vLLM及同类引擎 | ≈ 5至9 GB |
| …-MLX-4bit 仓库 | 适用于 Apple Silicon 的格式 | Mac 上的 MLX、LM Studio | ≈ 5 GB |
实验室主要发布第一种格式,即训练结束时得到的原始权重。桌面应用所需的 GGUF 文件则由转换者另行制作:有些实验室会直接发布自己的版本,而 bartowski、unsloth 或 ggml-org 组织等社区贡献者几乎覆盖了其余所有模型,通常在备受期待的模型发布后仅几小时就能提供转换版本。要避免盲目搜索,可以打开原始模型页面,点击页面右侧模型树中的 Quantizations 链接;也可以在 Hub 搜索栏中输入模型名称,再加上 GGUF。搜索结果通常会将下载量最高的转换版本排在前面。
#选择适合您显卡的文件
一个 GGUF 仓库通常会为同一个模型提供十来个文件,每个文件对应一种可用的量化级别,从压缩程度最高到保真度最高。文件大小大致相当于模型加载到内存后,其权重所占用的显存容量。请始终预留 1 至 3 GB 显存,用于对话上下文和系统运行余量。
| 模型 | Q4_K_M | Q5_K_M | Q8_0 | BF16 | 可轻松运行 Q4 量化模型的显卡 |
|---|---|---|---|---|---|
| Qwen 3 8B | 5 GB | 6 GB | 9 GB | 16 GB | 8 GB |
| Gemma 4 12B | 7 GB | 9 GB | 13 GB | 24 GB | 12 GB |
| Qwen 3 14B | 9 GB | 11 GB | 16 GB | 28 GB | 12 GB |
| gpt-oss 20B | 13 GB | 16 GB | 23 GB | 42 GB | 16 GB |
| Mistral Small 3.2 24B | 14 GB | 17 GB | 26 GB | 48 GB | 16 GB |
| Qwen 3.8 27B | 16 GB | 19 GB | 29 GB | 54 GB | 24 GB |
| Llama 3.3 70B | 40 GB | 48 GB | 75 GB | 140 GB | 2 × 24 GB |
#三种下载方式
最简单的方法是让您使用的工具来处理。LM Studio 的搜索功能会直接查询 Hugging Face,并指出哪些文件能在您的机器上装得下。Ollama 和 llama.cpp 都能根据 GGUF 仓库的名称拉取该仓库。
--include 过滤器很重要:没有它,您会下载仓库中的所有量化版本,总大小往往超过 100 GB。第三种方式是使用浏览器:打开「Files and versions」选项卡,点击文件旁的下载箭头。这种方式适合下载单个 GGUF 文件,但不适合下载拆分成多个文件的原始权重。
#许可:开放并不意味着无条件
| 许可证 | 目录中的示例 | 商业用途 |
|---|---|---|
| Apache 2.0 | Qwen 3 系列、Gemma 4 12B、gpt-oss、Mistral Small 3.2 | 可以,但需注明相关信息 |
| MIT | DeepSeek R1 蒸馏模型、GLM 4.7 Flash | 是 |
| Llama社区许可 | Llama 3.3 70B | 是,需满足条件:命名规则、使用政策、用户阈值 |
| 非商业用途,研究用途 | 多篇学术论文 | 否 |
有疑问时,以模型页面上标注的许可证信息为准。基于其他模型衍生、微调或融合而来的模型,通常会继承其基础模型的义务,即使衍生模型的 README 没有明确说明。对于企业部署或商业产品,花两分钟仔细阅读许可证,可以避免基于商业用途实际上受限的模型搭建整套集成。这类错误很常见,事后纠正的代价也很高。
#是否安全?
- 优先选择 .safetensors 和 .gguf
- 这些是纯数据格式。早期的 PyTorch .bin 和 .pt 文件基于 Python 的 pickle 机制,加载时可能执行代码。Hub 会对此发出警告。
- 警惕“trust remote code”
- 部分仓库,尤其是针对尚未集成到 transformers 库中的新架构的仓库,会包含自定义 Python 代码;加载器在继续之前会要求您明确授权执行这些代码。只有在您认识并信任相关组织时,才应授予此类授权:这些代码与您的 Python 程序其余部分拥有相同的运行权限,没有任何特殊限制。
- 查看谁在发布
- 累计下载次数、同一组织发布的其他仓库列表,以及实验室官网上指向该仓库的链接,都是良好的可信度信号。Hub 上和其他网站一样,也存在冒充账号:它们使用与知名组织相近的名称,只是多了一个拼写错误或下划线。通常,查看一下下载次数和账号的注册时间,就足以识别它们。
- 模型始终保留在您本地
- 下载完成后,通过 llama.cpp 或 Ollama 运行的 GGUF 模型不会再向 Hugging Face 或任何其他方发起网络请求,这与通过云端托管 API 使用模型不同。您的提示词和数据始终不会离开自己的电脑;对于选择本地 AI 而非在线服务的人来说,这是一个核心的隐私优势。
#FAQ
Hugging Face 有什么作用?+
Hugging Face是免费的吗?+
Hugging Face是一家法国公司吗?+
下载模型是否需要账号?+
Ollama 或 LM Studio 应下载哪个文件?+
是否仍需使用huggingface-cli来下载模型?+
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。