🇺🇸 Laguna XS.2
MoE 架构,总参数 33B、激活参数 3B,采用 Apache 2.0 许可,专精智能体编程。SWE-Bench Verified 得分 68.2%,128k 上下文。可在 36 GB 内存的 Mac 上运行。发布于 2026 年 4 月 28 日。
ollama run laguna-xs.2
排名更新于 2026年9月22日
针对代码生成、重构和自动补全的专用或高性能开放权重 LLM 排名。优先选择在 HumanEval/MBPP 上经过评估、上下文长度 ≥ 32k token 以覆盖完整文件且采用宽松许可证的模型。
⚡ 切实可用的完整配置方案Cline + Aider + 已调好的 Modelfile,30 分钟即可就绪—— 本地编程助手套件 →MoE 架构,总参数 33B、激活参数 3B,采用 Apache 2.0 许可,专精智能体编程。SWE-Bench Verified 得分 68.2%,128k 上下文。可在 36 GB 内存的 Mac 上运行。发布于 2026 年 4 月 28 日。
ollama run laguna-xs.2
专注编程的 24B 模型,采用 Apache 2.0 许可证。SWE-Bench 得分 72.2%。256k 上下文,来自法国实验室。
ollama run devstral-small2:24b
MoE 33B / 3B激活(池边架构),支持多语言代理编程。上下文长度256k,采用开放许可OpenMDW。在Mac上运行需43GB显存。2026年6月发布。
ollama run laguna-xs-2.1
MoE 30B(3.3B 激活参数),专攻智能体编程。本地运行速度极快,原生 256k 上下文,是通过 Ollama 在 16–24 GB 内存下的标杆选择。
ollama run qwen3-coder:30b
2024 年末开放权重编程模型的标杆,如今已被 Qwen3-Coder / Devstral 这一代模型超越。
ollama run qwen2.5-coder:32b
Coder 14B。HumanEval 89.6,LiveCodeBench 37.1。自行部署编程模型时,显存需求处于最佳平衡点。
ollama run qwen2.5-coder:14b
27B 稠密多模态模型,2026 年 4 月 22 日发布。262k 上下文(1M YaRN)。SWE-bench Verified 77.2%。
ollama run qwen3.6:27b
| 名次 | 模型 | Params | Q4 VRAM | 上下文 | 许可证 |
|---|---|---|---|---|---|
| #1 | Laguna XS.2 | 33B | 19 GB | 131 072 | Apache 2.0 |
| #2 | Devstral Small 2 24B | 24B | 14 GB | 256 000 | Apache 2.0 |
| #3 | Laguna XS 2.1 | 33B | 19 GB | 256 000 | OpenMDW 1.1 |
| #4 | Qwen3-Coder 30B-A3B | 30B | 19 GB | 262 144 | Apache 2.0 |
| #5 | Qwen 2.5 Coder 32B | 32B | 19 GB | 131 072 | Apache 2.0 |
| #6 | Qwen 2.5 Coder 14B Instruct | 14B | 9 GB | 131 072 | Apache 2.0 |
| #7 | Qwen 3.6 27B | 27B | 16 GB | 262 144 | Apache 2.0 |
根据所需内存和您使用的软件,有两种选择: Radeon RX 9070 XT 16 GB · GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) — 比较AI硬件 →
您已经有了模型,接下来就是让它在编辑器中发挥作用:Copilote Local 套件通过 Cline 将模型接入 VS Code(第 7 章),通过 Aider 在终端中使用它(第 8 章),并在输入时提供自动补全(第 9 章)——同时为这个特定模型配置好 Modelfile(第 11 章)。
免费备忘录
接收速查表 显存 → 最佳代码模型 → Ollama 命令 (一屏即可查看,可直接复制粘贴)。再使用本地 Copilot 套件,搭建真正可用的运行环境。
本地副驾驶套件 — 可直接粘贴使用的 Ollama + Cline + Aider 配置、调校好的 Modelfiles、故障排除、可终身使用的在线空间 →无垃圾邮件。1 次点击即可退订。你的数据保留在我们这里(绝不转售)。
你的显卡 → 最适合在本地运行的编程模型,以及准确的 Ollama 命令:
| 你的 VRAM | 典型 GPU / Mac | 推荐的代码模型 | Ollama 命令 |
|---|---|---|---|
| 8 GB | RTX 4060 / 3060 · M1-M2 16 GB | Qwen 3.5 9B (Q4, 6.6 GB — 256k ctx) | ollama run qwen3.5:9b |
| 12 GB | RTX 3060 12 GB / 4070 / 5070 | Qwen 3.5 9B (Q8, 11 GB) 或 Gemma 4 12B (7.6 GB) | ollama run qwen3.5:9b-q8_0 |
| 16 GB | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 GB | Devstral 24B (Q4, 14 GB) — 专长是编程智能体任务 | ollama run devstral:24b |
| 24 GB | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 GB | Qwen 3.8 27B (Q4, 18 GB) — “接近 Copilot” | ollama run qwen3.8:27b |
| 32 GB | RTX 5090 | Qwen 3.6 35B-A3B (Q4, 23 GB) — 快速 MoE | ollama run qwen3.6:35b |
| 48 GB+ | Mac M4 Max 64 GB · M2 Ultra 128 GB | Qwen3-Coder 30B-A3B (Q8, 32 GB — 256k ctx) | ollama run qwen3-coder:30b-a3b-q8_0 |
-base : ollama run qwen2.5-coder:7b-base — 在这一特定用途上,它仍是标杆。⚠️ Qwen 3.8: 其推理强度默认设得很高,处理简单请求时会“过度思考”——请将其调低至 low (或在首次启动时关闭它)。⚠️ 许可证陷阱: Codestral 22B = Mistral Non-Production License(非生产用途许可证) → 禁止用于工作中的编程。Qwen 3.5/3.8、Gemma 4 和 Devstral 采用 Apache 2.0 许可证。💡 因内存不足而崩溃?请预留约 1.5 GB 的显存用于上下文,或将量化精度降低一档。🔌 要将其接入 VS Code: Cline (可处理多个文件的智能体), Aider (CLI) 或 Tabby/Twinny (FIM 自动补全) — 它们都连接到本地 Ollama。该套件 本地助手 — 可直接粘贴的配置 + 经过测试的设置 — 现已可用: /copilote-local.
我们筛选出标签包含“code”且参数规模不超过 100B 的模型(超过这一规模就不再算“本地”)。排名综合考虑:代码专长(名称包含“coder”、“codestral”、“devstral”、“laguna”)、长上下文、宽松的许可证,以及 7–32B 的理想参数规模。
考虑的标准:
评分完全透明:请参阅 我们的方法论 ,了解 VRAM/每秒令牌数的计算详情。
2026 年编码领域最好的开源 LLM 是什么?
我们的第一名是 Laguna XS.2 (33B, Apache 2.0)。具备高 HumanEval 精度,支持 131,072 个 token 的上下文长度,且采用宽松许可协议。
运行性能不错的代码大模型需要多少显存?
对于采用 Q4_K_M 量化的 7B Coder 模型,6–8 GB 显存就足够。对于采用 Q4 量化的 32B Coder 模型,应预留 20–24 GB 显存(RTX 4090、3090、7900 XTX)。采用 Q5 或 Q8 时,显存需求会迅速增加——请参阅 配置工具.
可以用于商业生产环境吗?
是的,如果许可证为 Apache 2.0 或 MIT。Codestral 采用 Mistral Non-Production License ——仅限个人/研究用途。Qwen 和 DeepSeek 可自由使用。
如何在VS Code中集成本地LLM?
通过扩展程序 Cline, 可连接到您的本地Ollama或LM Studio服务器。Aider支持CLI模式进行多文件重构。