全部模型 · 100% 本地运行,100% 私密

哪款 LLM 能在
您的设备上运行?

告诉我们您的硬件配置。我们会说明哪些模型可以运行、速度如何,并用中文逐步讲解安装方法。

还没有合适的设备? 根据预算选择本地 AI 电脑 →
128 GB 迷你电脑 · NVIDIA DGX Spark · 全部 AI 硬件

~/configurateur —— ● 就绪
计算在您的浏览器内进行。网站也会进行访问统计。
免费
无需注册
提供本地语言版本
教学指南
开源
公开数据
本地计算
访问量统计
◆ QuelLLM 套件 —— 针对不同用途的参考指南 · 24 € / 套 · 49 €,所有套件终身使用 →

市场概览

查看全部动态 →
10月1日NVIDIA Kumo Tabular:更准确、更高效的表格数据预测模型9月30日据 Anthropic 红队称,GLM-5.3 在二进制漏洞利用方面突破了一个门槛9月30日Claude Sonnet 5.5:速度更快、使用成本更低,价格与 Sonnet 5 相同
目录 · 250 模型

的目录 开放权重 LLM
在本地运行。

所有相关模型,列明各量化方案所需的 VRAM、预计速度和使用场景。法国模型重点展示。

🇫🇷
注重主权

法国制造的26款模型

Mistral、Lucie(OpenLLM-France)、CroissantLLM — 基于法语语料库训练,采用宽松许可证,在正式法语表达方面表现出色。

★编辑精选推荐查看全部榜单 →
250 个模型
模型↕
Params↕
Q4 VRAM↕
上下文↕
运行平台
tok/s↕
发布日期↕
Pleias-RAG 1B★ 法语chatfr
🇫🇷 PleIAs · 专用于 RAG 的 1.2B 模型。内置引用和依据来源生成内容的功能。在 HotPotQA 上优于大多数 ≤4B 的 SLM。
1.2B
0.8 GB
2k
8121624
150
2025年4月
CroissantLLM 1.3B★ 法语chatfr
🇫🇷 CroissantLLM · 小型法英双语模型。各种设备上都能运行,甚至只用 CPU 也能运行。
1.3B
1 GB
2k
8121624
120
2024年1月
SmolLM2 1.7B Instruct★ 法语chatgeneral
🇫🇷 HuggingFace · 下载量很高的 1.7B 模型,采用 Apache 2.0 许可证。在 MMLU-Pro 上比 Qwen2.5-1.5B 高约 6 分。BFCL 函数调用得分为 27%。
1.7B
1.2 GB
8k
8121624
120
2024年11月
Helium 1 2B★ 法语chatgeneral
🇫🇷 Kyutai · 多语言基础模型,支持 24 种欧盟语言(法国 Kyutai)。由 Gemma 2 蒸馏而来 → 同样适用 Gemma 条款。
2B
1.5 GB
4k
8121624
100
2025年4月
SmolVLM2 2.2B Instruct★ 法语visionchat
🇫🇷 HuggingFace · VLM 2.2B:图像+视频+文本。视频推理需 5.2 GB VRAM。基于 SmolLM2-1.7B。
2.2B
1.6 GB
8k
8121624
90
2025年2月
Pleias 3B Preview★ 法语chatmultilingual
🇫🇷 PleIAs · 法语。100% 在 Common Corpus(开放数据)上训练。设计上符合欧盟 AI Act。
3B
2 GB
2k
8121624
70
2024年12月
SmolLM3 3B★ 法语chatgeneral
🇫🇷 HuggingFace · 30 亿参数,双模式(思考/非思考)。支持 6 种语言。MMLU 59.7,GSM8K 70.9。完全开放(数据和训练方法)。
3B
2 GB
125k
8121624
70
2025年7月
Shieldstral 3B★ 法语generalsmall
🇫🇷 Mistral AI · Mistral 3B 护栏模型(内容审核),32k 上下文,Q4 约需 1.7 GB 显存。支持自托管,Apache 2.0 许可证。
3B
1.7 GB
32k
8121624
85
—
Voxtral-4B-TTS★ 法语audiomultilingual
🇫🇷 Mistral AI · 前沿开放 TTS 模型,支持 9 种语言(含法语)。可与 ElevenLabs 媲美。⚠ 仅限非商业用途。
4B
3 GB
4k
8121624
65
2026年3月
Mistral 7B Instruct★ 法语chatgeneral
🇫🇷 Mistral AI · 法国经典之作。速度快、用途广,非常适合作为入门起点。
7B
5 GB
32k
8121624
35
2023年9月
Lucie 7B★ 法语chatfr
🇫🇷 OpenLLM-France · 主权型法语 LLM,基于法语语料库训练。
7B
5 GB
4k
8121624
35
2025年1月
Codestral Mamba 7B★ 法语代码fr
🇫🇷 Mistral AI · 用于编程的纯 Mamba SSM。线性复杂度推理,上下文 256k。不支持 Ollama(llama.cpp 仅提供部分支持)。
7B
5 GB
250k
8121624
40
2024年7月
Claire 7B 0.1★ 法语chatfr
🇫🇷 LINAGORA · 使用即兴法语对话对 Falcon-7B 进行 LoRA 微调。⚠ NC-SA 许可证。另有独立的 Apache 变体。
7B
5 GB
2k
8121624
35
2023年11月
Moshi 7B★ 法语audiofr
🇫🇷 Kyutai · 首个全双工开放语音模型。延迟约 200ms。音色:Moshiko/Moshika。Kyutai(法国实验室)。
7.6B
5 GB
4k
8121624
25
2024年9月
Mistral Nemo 12B Instruct★ 法语chatgeneral
🇫🇷 Mistral AI · 与 NVIDIA 联合开发。128k 上下文,Tekken 分词器,擅长处理多种欧洲语言。
12B
7 GB
125k
8121624
25
2024年7月
Codestral 22B v0.1★ 法语代码fr
🇫🇷 Mistral AI · Mistral 的 22B 编程模型,支持 80 多种编程语言。⚠ MNPL 非生产用途许可证——个人/研究用途。
22B
13 GB
31.25k
8121624
16
2024年5月
Mistral Small 3★ 法语chatgeneral
🇫🇷 Mistral AI · 发布时(2025 年初),模型表现与体积之间的平衡极佳。可与 70B 模型相媲美。
24B
14 GB
32k
8121624
15
2025年1月
Mistral Small 3.1 24B★ 法语chatgeneral
🇫🇷 Mistral AI · 增加了视觉能力的 Small 3。128k 上下文,Apache 2.0 许可。自 2025 年 6 月起被 Small 3.2 取代。
24B
14 GB
125k
8121624
15
2025年3月
Devstral Small 2 24B★ 法语代码fr
🇫🇷 Mistral AI · 专注编程的 24B 模型,采用 Apache 2.0 许可证。SWE-Bench 得分 72.2%。256k 上下文,来自法国实验室。
24B
14 GB
250k
8121624
15
2025年12月
Mistral Small 3.2 24B★ 法语chatgeneral
🇫🇷 Mistral AI · Small 3.1 的 2025 年 6 月更新:生成无法停止的情况减少了一半,函数调用得到改进。
24B
14 GB
125k
8121624
15
2025年6月
Magistral Small 24B★ 法语reasoningfr
🇫🇷 Mistral AI · Mistral 首个开源推理模型。AIME24 70.7%。基于 Small 3.1 并经 CoT 训练。
24B
14 GB
125k
8121624
15
2025年6月
Mixtral 8x7B★ 法语chatgeneral
🇫🇷 Mistral AI · 含 8 个专家的 MoE。质量高,但 VRAM 占用较大。
47B
26 GB
32k
8121624
12
2023年12月
Mistral Small 4★ 法语chatgeneral
🇫🇷 Mistral AI · MoE,总参数量 119B,激活参数量 6.5B,集聊天、推理、视觉和代码能力于一体。2026 年的法国旗舰模型。
119B
72 GB
250k
8121624
12
2026年3月
Mistral Medium 3.5 128B★ 法语chatgeneral
🇫🇷 Mistral AI · 128B 稠密模型,支持视觉,256k 上下文,推理功能可配置。SWE-Bench 77.6%。取代 Medium 3.1 和 Magistral。2026 年 4 月 29 日发布。
128B
74 GB
250k
8121624
4
2026年4月
Mixtral 8x22B Instruct★ 法语chatgeneral
🇫🇷 Mistral AI · MoE 模型,采用 Apache 2.0 许可证,总参数 141B,激活参数 39B。MMLU 77.8,HumanEval 45.1。Q4 量化下占用 80 GB。
141B
82 GB
62.5k
8121624
8
2024年4月
Mistral Large 3 675B★ 法语chatgeneral
🇫🇷 Mistral AI · MoE:6750 亿总参数 / 410 亿激活参数,另加 25 亿参数的视觉编码器,采用 Apache 2.0 许可证。LMArena 开源非推理模型排名第 2。在 3000 块 H200 上训练。
675B
405 GB
250k
8121624
5
2025年12月
Granite Time Series PatchTST R2generalsmall
🇺🇸 IBM · IBM 时间序列基础模型(约 385M,PatchTST),支持多变量预测,Q4 量化约需 0.2 GB VRAM。超轻量,可在 CPU 上运行。Apache 2.0 许可证。
0.4B
0.2 GB
8k
8121624
170
2026年8月
Activity Generation 0.5B (Qwen)chatgeneral
🇨🇳 mjpsm · 针对活动生成微调的 Qwen 0.5B,32k 上下文,Q4 约需 0.3 GB 显存。体积极小,也可在 CPU 上运行。Apache 2.0 许可证。
0.5B
0.3 GB
32k
8121624
170
2026年9月
S1-miniaudiosmall
🇺🇸 superwhisper · S1-mini(superwhisper):基于 Qwen3-0.6B 的 0.6B 语音识别模型,40k 上下文,Q4 量化约需 0.3 GB VRAM。超轻量本地转录。
0.6B
0.3 GB
40k
8121624
170
2026年8月
Qwen 3.5 0.8Bchatgeneral
🇨🇳 Alibaba · 0.8B 稠密模型,Apache 2.0 许可证,256k 上下文。内存占用极小,是边缘计算、移动设备和树莓派的理想选择。2026 年 4 月 13 日发布。
0.8B
0.5 GB
250k
8121624
170
2026年4月
学习中心

文档 QuelLLM.

335+ 适用于 Windows、macOS 和 Linux 的法语教程。每篇指南都会注明实际执行的测试,内容涵盖从首次安装到高级 RAG 和微调技术。

⌘ K

精选

——我们的核心指南
★ 精选
企业 · 部署

企业中的编程 AI:保护专有代码、NDA 和工业机密

为受 NDA 和工业机密保密要求约束的开发团队部署 100% 本地运行的编程 AI(Ollama + Cline + Aider + Tabby):为什么 Copilot 和 Cursor 会暴露你的专有代码,GDPR 和 AI Act 有哪些要求,工作站部署与 Tabby GPU 服务器部署的架构对比,以及验证数据不外泄的审计。

高级·16 分钟·Mohamed Meguedmi
★ 精选
入门指南 · 免费

最佳免费本地 AI:2026 年精选,没有 GPU 也能用

本地 AI:定义及 2026 年最佳免费方案,可安装在 PC 或 Mac 上,即使没有专用 GPU 也可运行。工具对比及分步指南。

入门·14 分钟·Mohamed Meguedmi
★ 精选
安装 · Ollama

在 Windows 11 上安装 Ollama:完整指南(2026)

下载适用于 Windows 11 的 Ollama,安装后启用 GPU(CUDA),并运行第一个模型:2026 年分步指南,涵盖常见错误。

入门·3 分钟·Mohamed Meguedmi
335 结果s
入门 3 分钟

在 Windows 11 上安装 Ollama:完整指南(2026)

下载适用于 Windows 11 的 Ollama,安装后启用 GPU(CUDA),并运行第一个模型:2026 年分步指南,涵盖常见错误。

Ollama阅读 →
进阶 12 分钟

RTX 4090 (24 GB) 适合运行哪个 LLM?

RTX 4090 24 GB,2026年面向大众的本地AI标杆产品。Qwen 3.8 27B,Devstral 24B,gpt-oss 20B,GLM 4.7 Flash,tokens/sec基准测试,CUDA Ada优化。

RTX 40阅读 →
进阶 11 分钟

RTX 5090 (32 GB) 适合运行哪个 LLM?

2025 年 RTX 5090:32 GB GDDR7 显存,带宽为 1792 GB/s。在本地运行 2026 年的大型 MoE 模型(Qwen 3.6 35B-A3B、Nemotron 3.5 Lightning)以及采用长上下文的 Qwen 3.8 27B,基准测试与理想配置。

RTX 50阅读 →
高级 16 分钟

本地部署 DeepSeek V4 Pro:VRAM、硬件与安装

运行 DeepSeek V4 Pro(1.6T MoE,49B 激活参数,MIT 协议)需要什么机器?所需 VRAM/RAM、本地安装、与 GPT-5 的基准测试对比及实际限制。

DeepSeek阅读 →
入门 5 分钟

LM Studio 新手入门:10 分钟完成首次本地对话

使用 LM Studio 运行您的第一个本地 LLM:在 10 分钟内完成安装、下载模型并开始对话。无需命令行操作,非常适合初学者。

LM Studio阅读 →
入门 14 分钟

RTX 3060 12 GB 上适合运行哪个 LLM?

RTX 3060 12 GB:低预算 LLM GPU 的经典之选。二手 12 GB 显卡售价 250 欧元,Gemma 4 12B、Qwen 3.5 9B、Granite 4.2 8B,详细基准测试。

RTX 30阅读 →
进阶 14 分钟

DeepSeek V4 Flash 284B:能在 Mac Studio 上运行的首个前沿模型

DeepSeek V4 Flash 284B MoE(13B 活跃参数,MIT 许可证,1M 上下文):首个可在工作站上运行的前沿模型。在 Mac Studio Ultra 上安装、基准测试,以及与 Pro 的对比。

DeepSeek阅读 →
入门 3 分钟

在 macOS(Apple Silicon)上安装 Ollama:2026 指南

充分利用 Metal 和 M1/M2/M3/M4 的统一内存

Ollama阅读 →
入门 14 分钟

Mac mini M4 / M4 Pro(16–64 GB)适合跑哪个 LLM?

Mac mini M4:2026 年本地 AI 的最佳性价比。基准测试、推荐配置、家用服务器用途。

Mac mini阅读 →
进阶 13 分钟

RTX 3090 / 3090 Ti (24 GB) 适合运行哪个 LLM?

二手 RTX 3090 和 3090 Ti 24 GB:2026 年运行 LLM 依然表现出色。Qwen 3.8 27B、Qwen3-Coder 30B、基准测试、性价比评估、散热。

RTX 30阅读 →
入门 11 分钟

12 GB 显存适合运行哪个 LLM?

12 GB VRAM(RTX 3060 12GB、4070、5070):2026 年的理想配置档位。Qwen 3.5 9B Q8 量化,Gemma 4 12B,多阶段 RAG。终极指南。

按 VRAM 分类阅读 →
进阶 14 分钟

本地部署 Qwen 3.8 27B:Ollama 安装与 VRAM 需求

本地运行 Qwen3.8-27B:准确的 Ollama 命令、各量化版本的显存需求、Mac 上的 MLX 版本、256k 上下文的陷阱、思考模式及官方基准测试。

Ollama阅读 →
入门 10 分钟

您的第一次本地对话

启动 Ollama,加载 Mistral,开始对话。第一天的教程。

Prompting阅读 →
进阶 11 分钟

RTX 5070 Ti (16 GB) 适合运行哪个 LLM?

RTX 5070 Ti 16 GB:2025 年本地 AI 性能与价格的理想平衡点。Ollama 基准测试,轻松运行 14B/24B 模型,与 4070 Ti Super 对比。

RTX 50阅读 →
进阶 11 分钟

MacBook Pro M4 Pro / Max(24–128 GB)适合跑哪个 LLM?

MacBook Pro M4 Pro / Max 2025:带宽 546 GB/s,哪些模型能真正发挥芯片的性能,实际使用有哪些限制。

MacBook Pro阅读 →
进阶 14 分钟

RTX 4070 / 4070 Super / 4070 Ti (12 GB) 适合运行哪个 LLM?

RTX 4070、4070 Super 和 4070 Ti 12 GB:LLM 对比、可轻松运行的 13B 模型、12 GB 的限制及实测基准结果。

RTX 40阅读 →
入门 11 分钟

Ollama、LM Studio、Jan 与 GPT4All 对比

汇总表,帮助您选择适合自身情况的工具。

工具阅读 →
入门 11 分钟

8 GB 显存适合运行哪个 LLM?

8 GB VRAM(RTX 3050/3060 8GB、4060、5050、5060)完整指南:Qwen 3.5 9B、Granite 4.2 8B,以及充分利用显存的技巧。

按 VRAM 分类阅读 →
高级 16 分钟

企业中的编程 AI:保护专有代码、NDA 和工业机密

为受 NDA 和工业机密保密要求约束的开发团队部署 100% 本地运行的编程 AI(Ollama + Cline + Aider + Tabby):为什么 Copilot 和 Cursor 会暴露你的专有代码,GDPR 和 AI Act 有哪些要求,工作站部署与 Tabby GPU 服务器部署的架构对比,以及验证数据不外泄的审计。

部署阅读 →
入门 11 分钟

5 分钟安装 Ollama(Windows、macOS、Linux)

如何在 Windows、macOS 和 Linux 上用 5 分钟安装 Ollama:RAM/GPU 要求、必备命令,以及安装后紧接着启动的第一个本地模型。

Ollama阅读 →
入门 11 分钟

提示词工程基础

组织好请求内容,以获得有用的回答。

Prompting阅读 →
进阶 12 分钟

MacBook Pro M3 Pro / Max(18–128 GB)适合跑哪个 LLM?

MacBook Pro M3 Pro / Max:2026 年最适合本地 AI 的笔记本电脑。Qwen 3.6 35B-A3B,128k 上下文,Flash Attention。

MacBook Pro阅读 →
进阶 11 分钟

RTX 5080 (16 GB) 适合运行哪个 LLM?

RTX 5080 Blackwell:16 GB GDDR7,带宽 960 GB/s。Qwen 3.5、Granite 4.2、Gemma 4、gpt-oss、Devstral 的 Q4 基准测试。Ollama 最佳配置。

RTX 50阅读 →
进阶 11 分钟

16 GB 显存适合运行哪个 LLM?

16 GB VRAM(RTX 4070 Ti Super、5070 Ti、5080、4060 Ti 16GB):Mistral Small 24B、Devstral 24B、gpt-oss 20B,2026 年的专业级配置档位。

按 VRAM 分类阅读 →
入门 12 分钟

本地 LLM 选什么 GPU?RTX 4070 至 5090,Mac(2026)

RTX 4070 vs 4090 vs Mac M-Max:2026年购买指南。

GPU阅读 →
入门 11 分钟

本地 RAG:简介

理解检索增强生成(RAG),以便与您的文档对话

概念阅读 →
高级 13 分钟

Mac Studio (M2 / M3 / M4 Ultra, 64–512 GB) 上选哪个 LLM?

Mac Studio Ultra:最高 512 GB 统一内存。本地运行 Llama 4 Maverick 402B、Qwen3-235B、DeepSeek 671B。高级用户指南。

Mac Studio阅读 →
进阶 11 分钟

RTX 4080 / 4080 Super(16 GB)上能运行哪个 LLM?

使用 16 GB 的 RTX 4080 和 4080 Super 运行本地 LLM:所有能装入显存的模型、基准测试、4080 与 4080 Super 对比及购买建议。

RTX 40阅读 →
进阶 11 分钟

Radeon RX 7900 XTX (24 GB) 适合哪个 LLM?

Radeon RX 7900 XTX 24 GB:运行 LLM 时可替代 RTX 4090 的 AMD 显卡。ROCm 6.x、Qwen 3.8 27B、每秒 token 数基准测试、2026 年评估结论。

Radeon RX 7000阅读 →
进阶 11 分钟

24 GB 显存该选哪个 LLM?

24 GB VRAM(RTX 3090、4090、RX 7900 XTX):Qwen 3.8 27B 完全载入显存,大型 MoE 35B-A3B,LoRA 微调。面向高要求的配置档位。

按 VRAM 分类阅读 →
…
1–30 在 335 指南
导学路线

三条路径,
根据您的身份而定。

每条学习路线都由一系列指南组成,专为特定人群设计,从首次下载一直到完成可正常使用的配置。

01
学习路径 curieux

« 我只想试试,不想折腾。 »

您听说过本地LLM,想看看在自己的设备上运行效果如何。无需代码,无需系统配置——10分钟内即可与您的第一个模型对话。

总时长
~15 分钟
先决条件
无
您最终将获得的成果
Ollama 已安装
Mistral 7B 发布
首次成功使用提示词
开启学习之旅→