🇨🇳 Qwen 3.6 27B
27B 稠密多模态模型,2026 年 4 月 22 日发布。262k 上下文(1M YaRN)。SWE-bench Verified 77.2%。
ollama run qwen3.6:27b
排名更新于 2026年9月22日
最适合 RAG 的 LLM 排名:长上下文窗口(≥ 32k tokens,可处理多份文档)、基于所提供来源进行综合归纳的质量,以及对干扰信息(提示词中不相关的信息)的鲁棒性。
27B 稠密多模态模型,2026 年 4 月 22 日发布。262k 上下文(1M YaRN)。SWE-bench Verified 77.2%。
ollama run qwen3.6:27b
Qwen 3.8 27B:稠密多模态模型(文本 + 视觉),262k 上下文,Q4 约需 16 GB 显存(Ollama 权重为 18 GB)。Apache 2.0,支持智能体式编程和视觉。
ollama run qwen3.8:27b
Cohere 的 30.5B 模型,面向智能体编程和推理。上下文 488k,Apache 2.0,Q4 量化下约需 18 GB 显存。
ollama run north-mini-code-1.0
Gemma 4 的 MoE 变体。总参数量 26B,激活参数量 4B。完整多模态(文本+图像+音频)。
ollama run gemma4:26b
稠密架构,31B 参数,支持多模态(文本+图像+音频)。支持 140+ 种语言,256k 上下文。Chatbot Arena 开源模型排名第 3。
ollama run gemma4:31b
GLM-4.7-Flash(MoE 31B,约 3B 激活参数):在 30B 级别中,编程能力与显存占用之比最佳。MIT 许可证,128k 上下文,在 3090/4090 上速度非常快。
ollama run glm-4.7-flash
面向智能体编程的MoE模型,总参数35B,激活参数3B。SWE-Bench得分73.4%。2026年4月16日发布。
ollama run qwen3.6:35b-a3b
| 名次 | 模型 | Params | Q4 VRAM | 上下文 | 许可证 |
|---|---|---|---|---|---|
| #1 | Qwen 3.6 27B | 27B | 16 GB | 262 144 | Apache 2.0 |
| #2 | Qwen 3.8 27B | 27B | 16 GB | 262 144 | Apache 2.0 |
| #3 | North Mini Code 1.0 | 30.5B | 18 GB | 488 000 | Apache 2.0 |
| #4 | Gemma 4 26B-A4B MoE | 26B | 16 GB | 128 000 | Apache 2.0 |
| #5 | Gemma 4 31B | 31B | 18 GB | 256 000 | Apache 2.0 |
| #6 | GLM 4.7 Flash | 31B | 19 GB | 128 000 | MIT |
| #7 | Qwen 3.6 35B-A3B | 35B | 21 GB | 262 000 | Apache 2.0 |
你的文档,你的 AI:基于你的 PDF、笔记和邮件的可靠本地 RAG——无需向云端发送任何内容。
保留聊天/通用模型,上下文长度至少为 32k 令牌(以实现有效的分块)。评分更倾向于近期发布、窗口较大且采用宽松许可(适用于企业部署)的模型。
考虑的标准:
评分完全透明:请参阅 我们的方法论 ,了解 VRAM/每秒令牌数的计算详情。
要取得良好的 RAG 效果,需要多长的上下文?
至少需要 32k tokens 以处理 5-10 个约 2k tokens 的分块加提示。理想情况为 128k tokens (Qwen 3.6 27B 支持 262144),可直接承载完整文档而无需激进的分块处理。
在配备 24 GB 显存的 RTX 4090 上做 RAG,该选哪个模型?
Mistral Small 3.1 24B 采用Q4_K_M量化,或 Qwen 2.5 32B 采用Q4量化时可在24 GB内运行。对于Llama 3.3 70B,则需要降至Q2/Q3量化,或增加第二块显卡。
哪些嵌入模型可与这些LLM搭配使用?
针对法语内容: BGE-M3, multilingual-e5-large,或 Mistral 的嵌入模型。参见 法语嵌入指南.
推荐的本地 RAG 技术栈是什么?
Ollama (LLM服务器) + ChromaDB 或 Qdrant (向量存储) + LlamaIndex 或 LangChain (编排)。详见 完整指南.