首页 › 目录 › 2026 年用于智能体 / 工具调用的最佳本地 LLM

2026 年用于智能体 / 工具调用的最佳本地 LLM

◆ 本地智能体 — 在您的电脑上执行操作的智能体,无需云端 · 24 € · 或全部套件 49 € →

排名更新于 2026年9月22日

用于在本地构建自主智能体的最可靠大型语言模型排名:函数调用的准确性、多轮交互的稳健性、对 JSON 模式的理解能力,以及足以维持行动计划的上下文长度。

排名

1

🇨🇳 Qwen 3.6 27B

Alibaba · 27B 参数 · Apache 2.0 · 262 144 tokens ctx

27B 稠密多模态模型,2026 年 4 月 22 日发布。262k 上下文(1M YaRN)。SWE-bench Verified 77.2%。

排名原因 可靠的函数调用,支持262,144个上下文token以保留操作历史。额外提供推理能力。
ollama run qwen3.6:27b
Q4 VRAM
16 GB
Q8 格式下 29 GB
2

🇨🇳 Qwen 3.8 27B

Alibaba · 27B 参数 · Apache 2.0 · 262 144 tokens ctx

Qwen 3.8 27B:稠密多模态模型(文本 + 视觉),262k 上下文,Q4 约需 16 GB 显存(Ollama 权重为 18 GB)。Apache 2.0,支持智能体式编程和视觉。

排名原因 可靠的函数调用,支持262,144个上下文token以保留操作历史。额外提供推理能力。
ollama run qwen3.8:27b
Q4 VRAM
16 GB
Q8 格式下 29 GB
3

🇨🇳 GLM 4.7 Flash

Zhipu AI · 31B 参数 · MIT · 128 000 tokens ctx

GLM-4.7-Flash(MoE 31B,约 3B 激活参数):在 30B 级别中,编程能力与显存占用之比最佳。MIT 许可证,128k 上下文,在 3090/4090 上速度非常快。

排名原因 可靠的函数调用,支持 128 000 个上下文 token 以保留操作历史。额外提供推理能力。
ollama run glm-4.7-flash
Q4 VRAM
19 GB
Q8 格式下 35 GB
4

🇺🇸 Nemotron Cascade 2 30B-A3B

NVIDIA · 30B 参数 · NVIDIA 开放模型许可证 · 128 000 tokens ctx

MoE,总参数量 30B,激活参数量 3B:思考模式 + 指令微调。荣获 IMO 2025 和 IOI 2025 金牌。得益于 3B 激活参数,推理速度快,具备 30B 级别的推理能力。2026 年 4 月发布。

排名原因 可靠的函数调用,支持 128 000 个上下文 token 以保留操作历史。额外提供推理能力。
ollama run nemotron-cascade-2
Q4 VRAM
17 GB
Q8 量化下为 32 GB
5

🇺🇸 North Mini Code 1.0

Cohere · 30.5B参数 · Apache 2.0 · 488 000 tokens ctx

Cohere 的 30.5B 模型,面向智能体编程和推理。上下文 488k,Apache 2.0,Q4 量化下约需 18 GB 显存。

排名原因 函数调用可靠,488,000 token 的上下文窗口可用于保留操作历史。此外还具备推理能力。
ollama run north-mini-code-1.0
Q4 VRAM
18 GB
Q8 量化下为 33 GB
6

🇨🇳 Qwen 3.6 35B-A3B

Alibaba · 35B 参数 · Apache 2.0 · 上下文长度:262 000 token

面向智能体编程的MoE模型,总参数35B,激活参数3B。SWE-Bench得分73.4%。2026年4月16日发布。

排名原因 函数调用可靠,支持262,000个上下文令牌以保留操作历史。额外提供推理能力。
ollama run qwen3.6:35b-a3b
Q4 VRAM
21 GB
Q8 格式下 38 GB
7

🇨🇳 Qwen 3 30B-A3B

Alibaba · 30B 参数 · Apache 2.0 · 131 072 tokens ctx

MoE,总参数量 30B,激活参数量 3B,采用混合思考模式。MMLU 81.4,AIME24 80.4。支持 100+ 种语言。

排名原因 可靠的函数调用功能,支持131072个上下文令牌以保留操作历史。额外提供推理能力。
ollama run qwen3:30b-a3b
Q4 VRAM
19 GB
Q8 格式下 35 GB

对比表

名次 模型 Params Q4 VRAM 上下文 许可证
#1 Qwen 3.6 27B 27B 16 GB 262 144 Apache 2.0
#2 Qwen 3.8 27B 27B 16 GB 262 144 Apache 2.0
#3 GLM 4.7 Flash 31B 19 GB 128 000 MIT
#4 Nemotron Cascade 2 30B-A3B 30B 17 GB 128 000 NVIDIA 开放模型许可证
#5 North Mini Code 1.0 30.5B 18 GB 488 000 Apache 2.0
#6 Qwen 3.6 35B-A3B 35B 21 GB 262 000 Apache 2.0
#7 Qwen 3 30B-A3B 30B 19 GB 131 072 Apache 2.0
本地智能体套件

在你的机器上执行操作的智能体:具备智能体能力的 Cline、MCP、n8n + Ollama、本地自动化。

  • 在线空间,终身可用
  • PDF + 文件
  • 30 天内退款

排名方法论

优先选择参数量 ≥ 7B 且上下文长度 ≥ 32k 的模型(以保持操作历史记录),并带有聊天或推理标签。评分更青睐近期发布的模型以及中大型规模模型(其中函数调用功能变得可靠)。

考虑的标准:

  • 精确函数调用
  • 上下文 ≥ 32k 个标记
  • 多轮交互可靠性
  • JSON格式符合要求

评分完全透明:请参阅 我们的方法论 ,了解 VRAM/每秒令牌数的计算详情。

常见问题

本地运行的自主智能体适合使用哪个大语言模型?

Qwen 3.6 27B 我们的#1选择。Mistral Small 3.1在工具使用方面的可靠性以及低延迟方面尤为突出——这对需要每项任务执行20次以上调用的智能体至关重要。

Ollama 是否支持函数调用?

是的,自 0.3.0 版本起,可通过参数 tools。LM Studio 和 vLLM 也支持。请确保模型经过工具调用训练(较新的 Mistral、Qwen 和 Llama 模型均经过此类训练)。

构建本地 AI 智能体应使用什么框架?

LangGraph, CrewAI, AutoGen, Smolagents ——均可通过 OpenAI 兼容端点连接到本地 Ollama(http://localhost:11434/v1).

推理与智能体有何区别?

推理模型(DeepSeek R1、QwQ)会在回答前展开思维链。智能体模型(Mistral Small、Qwen)会选择并调用外部工具。两者可以结合:推理用于规划,智能体用于执行。

深入了解

QuelLLM 套件 按用途分类的参考指南
所有套件,终身使用 — 49 €