首页 › 目录 › 2026 年用于 RAG 的最佳本地 LLM

2026 年用于 RAG 的最佳本地 LLM

◆ 本地RAG——用本地 AI 查询您的文档,无需云端 · 24 € · 或全部套件 49 € →

排名更新于 2026年9月22日

最适合 RAG 的 LLM 排名:长上下文窗口(≥ 32k tokens,可处理多份文档)、基于所提供来源进行综合归纳的质量,以及对干扰信息(提示词中不相关的信息)的鲁棒性。

排名

1

🇨🇳 Qwen 3.6 27B

Alibaba · 27B 参数 · Apache 2.0 · 262 144 tokens ctx

27B 稠密多模态模型,2026 年 4 月 22 日发布。262k 上下文(1M YaRN)。SWE-bench Verified 77.2%。

排名原因 262,144 个 token 的上下文——非常适合大规模语料库。27B 参数,有助于生成高质量的综合摘要。
ollama run qwen3.6:27b
Q4 VRAM
16 GB
Q8 格式下 29 GB
2

🇨🇳 Qwen 3.8 27B

Alibaba · 27B 参数 · Apache 2.0 · 262 144 tokens ctx

Qwen 3.8 27B:稠密多模态模型(文本 + 视觉),262k 上下文,Q4 约需 16 GB 显存(Ollama 权重为 18 GB)。Apache 2.0,支持智能体式编程和视觉。

排名原因 262,144 个 token 的上下文——非常适合大规模语料库。27B 参数,有助于生成高质量的综合摘要。
ollama run qwen3.8:27b
Q4 VRAM
16 GB
Q8 格式下 29 GB
3

🇺🇸 North Mini Code 1.0

Cohere · 30.5B参数 · Apache 2.0 · 488 000 tokens ctx

Cohere 的 30.5B 模型,面向智能体编程和推理。上下文 488k,Apache 2.0,Q4 量化下约需 18 GB 显存。

排名原因 488,000 token 的上下文窗口——非常适合大型语料库。305 亿参数,可实现高质量的综合总结。
ollama run north-mini-code-1.0
Q4 VRAM
18 GB
Q8 量化下为 33 GB
4

🇺🇸 Gemma 4 26B-A4B MoE

Google · 26B 参数 · Apache 2.0 · 128 000 tokens ctx

Gemma 4 的 MoE 变体。总参数量 26B,激活参数量 4B。完整多模态(文本+图像+音频)。

排名原因 128,000 个 token 的上下文——非常适合大型语料库。26B 参数,可实现高质量的归纳总结。
ollama run gemma4:26b
Q4 VRAM
16 GB
Q8 量化下 28 GB
5

🇺🇸 Gemma 4 31B

Google · 31B 参数 · Apache 2.0 · 上下文:256,000 个 token

稠密架构,31B 参数,支持多模态(文本+图像+音频)。支持 140+ 种语言,256k 上下文。Chatbot Arena 开源模型排名第 3。

排名原因 上下文长度为 256,000 token——非常适合大型语料库。31B 参数,可实现高质量的综合总结。
ollama run gemma4:31b
Q4 VRAM
18 GB
Q8 量化下为 33 GB
6

🇨🇳 GLM 4.7 Flash

Zhipu AI · 31B 参数 · MIT · 128 000 tokens ctx

GLM-4.7-Flash(MoE 31B,约 3B 激活参数):在 30B 级别中,编程能力与显存占用之比最佳。MIT 许可证,128k 上下文,在 3090/4090 上速度非常快。

排名原因 128,000 个 token 的上下文窗口——非常适合大型语料库。310 亿参数,可提供高质量的信息综合。
ollama run glm-4.7-flash
Q4 VRAM
19 GB
Q8 格式下 35 GB
7

🇨🇳 Qwen 3.6 35B-A3B

Alibaba · 35B 参数 · Apache 2.0 · 上下文长度:262 000 token

面向智能体编程的MoE模型,总参数35B,激活参数3B。SWE-Bench得分73.4%。2026年4月16日发布。

排名原因 262,000 个 token 的上下文——非常适合大型语料库。350 亿个参数,可实现高质量的信息归纳。
ollama run qwen3.6:35b-a3b
Q4 VRAM
21 GB
Q8 格式下 38 GB

对比表

名次 模型 Params Q4 VRAM 上下文 许可证
#1 Qwen 3.6 27B 27B 16 GB 262 144 Apache 2.0
#2 Qwen 3.8 27B 27B 16 GB 262 144 Apache 2.0
#3 North Mini Code 1.0 30.5B 18 GB 488 000 Apache 2.0
#4 Gemma 4 26B-A4B MoE 26B 16 GB 128 000 Apache 2.0
#5 Gemma 4 31B 31B 18 GB 256 000 Apache 2.0
#6 GLM 4.7 Flash 31B 19 GB 128 000 MIT
#7 Qwen 3.6 35B-A3B 35B 21 GB 262 000 Apache 2.0
本地 RAG 工具包

你的文档,你的 AI:基于你的 PDF、笔记和邮件的可靠本地 RAG——无需向云端发送任何内容。

  • 在线空间,终身可用
  • PDF + 文件
  • 30 天内退款

排名方法论

保留聊天/通用模型,上下文长度至少为 32k 令牌(以实现有效的分块)。评分更倾向于近期发布、窗口较大且采用宽松许可(适用于企业部署)的模型。

考虑的标准:

  • 上下文 ≥ 32k 个标记
  • 信息归纳质量
  • 抗干扰能力
  • 自由许可证

评分完全透明:请参阅 我们的方法论 ,了解 VRAM/每秒令牌数的计算详情。

常见问题

要取得良好的 RAG 效果,需要多长的上下文?

至少需要 32k tokens 以处理 5-10 个约 2k tokens 的分块加提示。理想情况为 128k tokens (Qwen 3.6 27B 支持 262144),可直接承载完整文档而无需激进的分块处理。

在配备 24 GB 显存的 RTX 4090 上做 RAG,该选哪个模型?

Mistral Small 3.1 24B 采用Q4_K_M量化,或 Qwen 2.5 32B 采用Q4量化时可在24 GB内运行。对于Llama 3.3 70B,则需要降至Q2/Q3量化,或增加第二块显卡。

哪些嵌入模型可与这些LLM搭配使用?

针对法语内容: BGE-M3, multilingual-e5-large,或 Mistral 的嵌入模型。参见 法语嵌入指南.

推荐的本地 RAG 技术栈是什么?

Ollama (LLM服务器) + ChromaDB 或 Qdrant (向量存储) + LlamaIndex 或 LangChain (编排)。详见 完整指南.

深入了解

QuelLLM 套件 按用途分类的参考指南
所有套件,终身使用 — 49 €