🇨🇳 Qwen 3 VL 30B-A3B
视觉 MoE,总参数量 30B,激活参数量 3B。Qwen 3 视觉模型中的最佳平衡点。256k 上下文。
ollama run qwen3-vl:30b
排名更新于 2026年9月22日
能够分析输入图像的开放权重 LLM 排名:OCR、图像描述、视觉问答、图表分析、从屏幕截图中提取数据。所有模型均可自行托管。
视觉 MoE,总参数量 30B,激活参数量 3B。Qwen 3 视觉模型中的最佳平衡点。256k 上下文。
ollama run qwen3-vl:30b
Gemma 4 的 MoE 变体。总参数量 26B,激活参数量 4B。完整多模态(文本+图像+音频)。
ollama run gemma4:26b
首个采用 Apache 2.0 许可证的开源 dLLM:MoE 16B/1B + 6.2B 扩散解码器。文本与视觉统一。2026 年 4 月 22 日发布。
# HuggingFace : inclusionAI/LLaDA2.0-Uni (Flash Attn 2 + CUDA 12.4 requis)
27B 稠密多模态模型,2026 年 4 月 22 日发布。262k 上下文(1M YaRN)。SWE-bench Verified 77.2%。
ollama run qwen3.6:27b
Qwen 3.8 27B:稠密多模态模型(文本 + 视觉),262k 上下文,Q4 约需 16 GB 显存(Ollama 权重为 18 GB)。Apache 2.0,支持智能体式编程和视觉。
ollama run qwen3.8:27b
稠密架构,31B 参数,支持多模态(文本+图像+音频)。支持 140+ 种语言,256k 上下文。Chatbot Arena 开源模型排名第 3。
ollama run gemma4:31b
Qwen 3 的 8B 稠密视觉模型。Qwen 第三代中最佳的小型 VLM。
ollama run qwen3-vl:8b
| 名次 | 模型 | Params | Q4 VRAM | 上下文 | 许可证 |
|---|---|---|---|---|---|
| #1 | Qwen 3 VL 30B-A3B | 30B | 19 GB | 262 144 | Apache 2.0 |
| #2 | Gemma 4 26B-A4B MoE | 26B | 16 GB | 128 000 | Apache 2.0 |
| #3 | LLaDA 2.0 Uni 16B | 16B | 18 GB | 8 192 | Apache 2.0 |
| #4 | Qwen 3.6 27B | 27B | 16 GB | 262 144 | Apache 2.0 |
| #5 | Qwen 3.8 27B | 27B | 16 GB | 262 144 | Apache 2.0 |
| #6 | Gemma 4 31B | 31B | 18 GB | 256 000 | Apache 2.0 |
| #7 | Qwen 3 VL 8B | 8B | 6 GB | 262 144 | Apache 2.0 |
您已选好视觉模型。本地 AI 套件专门用一整章介绍如何在自己的机器上妥善运行它:一步步在本地结合图像进行对话(第 7 章)。
按“vision”标签筛选。评分偏向较新的模型(VLM 发展非常迅速)和规模较大的模型(能更好地呈现精细细节)。
考虑的标准:
评分完全透明:请参阅 我们的方法论 ,了解 VRAM/每秒令牌数的计算详情。
哪个开源 LLM 最适合分析图像?
Qwen 3 VL 30B-A3B 是我们的 30B 参数 #1 模型。对于轻量级配置,Qwen 2.5 VL 7B 在 8-12 GB VRAM 下运行表现优异。
这些模型可以用于OCR吗?
是的——现代视觉语言模型(VLM)能够识别图像中的文本(如扫描文档、屏幕截图)。对于大规模/工业级OCR需求,DeepSeek OCR专精于此。对于手写法语文本,建议使用Qwen 2.5 VL,其对法语的处理能力较强。
是否需要 Ollama 或 llama.cpp 来支持视觉功能?
两者均支持视觉模型(Llama 3.2 Vision、LLaVA、Qwen VL)。LM Studio 也支持。使用 API 时可通过 -images 或参数 images 在 Ollama 中。
运行一个表现不错的 VLM 需要多少显存?
7B VL 模型(Qwen 2.5 VL 7B)需要 8 GB 显存,11B 模型(Llama 3.2 Vision)需要 12–16 GB,大型 72B 模型需要 40 GB 以上。除了文本模型占用的显存,视觉功能还会额外占用约 1–2 GB VRAM。
通过我们对入围选手的详细对决深入了解: