🇨🇳 Qwen 3.6 27B
27B 稠密多模态模型,2026 年 4 月 22 日发布。262k 上下文(1M YaRN)。SWE-bench Verified 77.2%。
ollama run qwen3.6:27b
排名更新于 2026年9月22日
用于在本地构建自主智能体的最可靠大型语言模型排名:函数调用的准确性、多轮交互的稳健性、对 JSON 模式的理解能力,以及足以维持行动计划的上下文长度。
27B 稠密多模态模型,2026 年 4 月 22 日发布。262k 上下文(1M YaRN)。SWE-bench Verified 77.2%。
ollama run qwen3.6:27b
Qwen 3.8 27B:稠密多模态模型(文本 + 视觉),262k 上下文,Q4 约需 16 GB 显存(Ollama 权重为 18 GB)。Apache 2.0,支持智能体式编程和视觉。
ollama run qwen3.8:27b
GLM-4.7-Flash(MoE 31B,约 3B 激活参数):在 30B 级别中,编程能力与显存占用之比最佳。MIT 许可证,128k 上下文,在 3090/4090 上速度非常快。
ollama run glm-4.7-flash
MoE,总参数量 30B,激活参数量 3B:思考模式 + 指令微调。荣获 IMO 2025 和 IOI 2025 金牌。得益于 3B 激活参数,推理速度快,具备 30B 级别的推理能力。2026 年 4 月发布。
ollama run nemotron-cascade-2
Cohere 的 30.5B 模型,面向智能体编程和推理。上下文 488k,Apache 2.0,Q4 量化下约需 18 GB 显存。
ollama run north-mini-code-1.0
面向智能体编程的MoE模型,总参数35B,激活参数3B。SWE-Bench得分73.4%。2026年4月16日发布。
ollama run qwen3.6:35b-a3b
MoE,总参数量 30B,激活参数量 3B,采用混合思考模式。MMLU 81.4,AIME24 80.4。支持 100+ 种语言。
ollama run qwen3:30b-a3b
| 名次 | 模型 | Params | Q4 VRAM | 上下文 | 许可证 |
|---|---|---|---|---|---|
| #1 | Qwen 3.6 27B | 27B | 16 GB | 262 144 | Apache 2.0 |
| #2 | Qwen 3.8 27B | 27B | 16 GB | 262 144 | Apache 2.0 |
| #3 | GLM 4.7 Flash | 31B | 19 GB | 128 000 | MIT |
| #4 | Nemotron Cascade 2 30B-A3B | 30B | 17 GB | 128 000 | NVIDIA 开放模型许可证 |
| #5 | North Mini Code 1.0 | 30.5B | 18 GB | 488 000 | Apache 2.0 |
| #6 | Qwen 3.6 35B-A3B | 35B | 21 GB | 262 000 | Apache 2.0 |
| #7 | Qwen 3 30B-A3B | 30B | 19 GB | 131 072 | Apache 2.0 |
在你的机器上执行操作的智能体:具备智能体能力的 Cline、MCP、n8n + Ollama、本地自动化。
优先选择参数量 ≥ 7B 且上下文长度 ≥ 32k 的模型(以保持操作历史记录),并带有聊天或推理标签。评分更青睐近期发布的模型以及中大型规模模型(其中函数调用功能变得可靠)。
考虑的标准:
评分完全透明:请参阅 我们的方法论 ,了解 VRAM/每秒令牌数的计算详情。
本地运行的自主智能体适合使用哪个大语言模型?
Qwen 3.6 27B 我们的#1选择。Mistral Small 3.1在工具使用方面的可靠性以及低延迟方面尤为突出——这对需要每项任务执行20次以上调用的智能体至关重要。
Ollama 是否支持函数调用?
是的,自 0.3.0 版本起,可通过参数 tools。LM Studio 和 vLLM 也支持。请确保模型经过工具调用训练(较新的 Mistral、Qwen 和 Llama 模型均经过此类训练)。
构建本地 AI 智能体应使用什么框架?
LangGraph, CrewAI, AutoGen, Smolagents ——均可通过 OpenAI 兼容端点连接到本地 Ollama(http://localhost:11434/v1).
推理与智能体有何区别?
推理模型(DeepSeek R1、QwQ)会在回答前展开思维链。智能体模型(Mistral Small、Qwen)会选择并调用外部工具。两者可以结合:推理用于规划,智能体用于执行。