首页 › 目录 › 2026 年具备视觉功能的最佳本地 LLM

2026 年具备视觉功能的最佳本地 LLM

◆ 本地 AI — 1 小时即可在你的电脑上拥有私密、免费的 ChatGPT · 24 欧元 · 或以 49 欧元购买所有套件 →

排名更新于 2026年9月22日

能够分析输入图像的开放权重 LLM 排名:OCR、图像描述、视觉问答、图表分析、从屏幕截图中提取数据。所有模型均可自行托管。

排名

1

🇨🇳 Qwen 3 VL 30B-A3B

Alibaba · 30B 参数 · Apache 2.0 · 262 144 tokens ctx

视觉 MoE,总参数量 30B,激活参数量 3B。Qwen 3 视觉模型中的最佳平衡点。256k 上下文。

排名原因 原生支持图像输入。30B参数,实现精细分析。
ollama run qwen3-vl:30b
Q4 VRAM
19 GB
Q8 格式下 35 GB
2

🇺🇸 Gemma 4 26B-A4B MoE

Google · 26B 参数 · Apache 2.0 · 128 000 tokens ctx

Gemma 4 的 MoE 变体。总参数量 26B,激活参数量 4B。完整多模态(文本+图像+音频)。

排名原因 原生支持图像输入。26B 参数可提供不错的分析效果。
ollama run gemma4:26b
Q4 VRAM
16 GB
Q8 量化下 28 GB
3

🇨🇳 LLaDA 2.0 Uni 16B

Ant Group / inclusionAI · 16B 参数 · Apache 2.0 · 8192 token 上下文

首个采用 Apache 2.0 许可证的开源 dLLM:MoE 16B/1B + 6.2B 扩散解码器。文本与视觉统一。2026 年 4 月 22 日发布。

排名原因 原生支持图像输入。160 亿参数,可提供较好的分析效果。
# HuggingFace : inclusionAI/LLaDA2.0-Uni (Flash Attn 2 + CUDA 12.4 requis)
Q4 VRAM
18 GB
30 GB,Q8 量化
4

🇨🇳 Qwen 3.6 27B

Alibaba · 27B 参数 · Apache 2.0 · 262 144 tokens ctx

27B 稠密多模态模型,2026 年 4 月 22 日发布。262k 上下文(1M YaRN)。SWE-bench Verified 77.2%。

排名原因 原生支持图像输入。270 亿参数,可提供较好的分析效果。
ollama run qwen3.6:27b
Q4 VRAM
16 GB
Q8 格式下 29 GB
5

🇨🇳 Qwen 3.8 27B

Alibaba · 27B 参数 · Apache 2.0 · 262 144 tokens ctx

Qwen 3.8 27B:稠密多模态模型(文本 + 视觉),262k 上下文,Q4 约需 16 GB 显存(Ollama 权重为 18 GB)。Apache 2.0,支持智能体式编程和视觉。

排名原因 原生支持图像输入。270 亿参数,可提供较好的分析效果。
ollama run qwen3.8:27b
Q4 VRAM
16 GB
Q8 格式下 29 GB
6

🇺🇸 Gemma 4 31B

Google · 31B 参数 · Apache 2.0 · 上下文:256,000 个 token

稠密架构,31B 参数,支持多模态(文本+图像+音频)。支持 140+ 种语言,256k 上下文。Chatbot Arena 开源模型排名第 3。

排名原因 原生支持图像输入。31B参数,实现精细分析。
ollama run gemma4:31b
Q4 VRAM
18 GB
Q8 量化下为 33 GB
7

🇨🇳 Qwen 3 VL 8B

Alibaba · 8B 参数 · Apache 2.0 · 262 144 tokens ctx

Qwen 3 的 8B 稠密视觉模型。Qwen 第三代中最佳的小型 VLM。

排名原因 原生支持图像输入。80 亿参数,分析效果不错。
ollama run qwen3-vl:8b
Q4 VRAM
6 GB
Q8 量化时为 10 GB

对比表

名次 模型 Params Q4 VRAM 上下文 许可证
#1 Qwen 3 VL 30B-A3B 30B 19 GB 262 144 Apache 2.0
#2 Gemma 4 26B-A4B MoE 26B 16 GB 128 000 Apache 2.0
#3 LLaDA 2.0 Uni 16B 16B 18 GB 8 192 Apache 2.0
#4 Qwen 3.6 27B 27B 16 GB 262 144 Apache 2.0
#5 Qwen 3.8 27B 27B 16 GB 262 144 Apache 2.0
#6 Gemma 4 31B 31B 18 GB 256 000 Apache 2.0
#7 Qwen 3 VL 8B 8B 6 GB 262 144 Apache 2.0
本地 AI 套件

您已选好视觉模型。本地 AI 套件专门用一整章介绍如何在自己的机器上妥善运行它:一步步在本地结合图像进行对话(第 7 章)。

  • 在线空间,终身可用
  • PDF + 文件
  • 30 天内退款

排名方法论

按“vision”标签筛选。评分偏向较新的模型(VLM 发展非常迅速)和规模较大的模型(能更好地呈现精细细节)。

考虑的标准:

  • 图像理解
  • OCR / 文本提取
  • VQA(图像问答)
  • Ollama / llama.cpp 兼容

评分完全透明:请参阅 我们的方法论 ,了解 VRAM/每秒令牌数的计算详情。

常见问题

哪个开源 LLM 最适合分析图像?

Qwen 3 VL 30B-A3B 是我们的 30B 参数 #1 模型。对于轻量级配置,Qwen 2.5 VL 7B 在 8-12 GB VRAM 下运行表现优异。

这些模型可以用于OCR吗?

是的——现代视觉语言模型(VLM)能够识别图像中的文本(如扫描文档、屏幕截图)。对于大规模/工业级OCR需求,DeepSeek OCR专精于此。对于手写法语文本,建议使用Qwen 2.5 VL,其对法语的处理能力较强。

是否需要 Ollama 或 llama.cpp 来支持视觉功能?

两者均支持视觉模型(Llama 3.2 Vision、LLaVA、Qwen VL)。LM Studio 也支持。使用 API 时可通过 -images 或参数 images 在 Ollama 中。

运行一个表现不错的 VLM 需要多少显存?

7B VL 模型(Qwen 2.5 VL 7B)需要 8 GB 显存,11B 模型(Llama 3.2 Vision)需要 12–16 GB,大型 72B 模型需要 40 GB 以上。除了文本模型占用的显存,视觉功能还会额外占用约 1–2 GB VRAM。

一对一比较

通过我们对入围选手的详细对决深入了解:

深入了解

QuelLLM 套件 按用途分类的参考指南
所有套件,终身使用 — 49 €