MiniCPM 本地运行(Ollama):多模态 compact
MiniCPM-V 是 OpenBMB 推出的一系列轻量级视觉-语言模型,采用 Apache 2.0 许可。在 Ollama 中,minicpm-v 仍加载版本 2.6(80亿参数,5.5GB),minicpm-v4.5 为 80亿参数、6.1GB 的版本,minicpm-v4.6 则是一个约 13亿参数、1.6GB 的模型。建议先在小型设备上运行 4.6 版本,再在您的图像上进行对比测试。
MiniCPM 是 OpenBMB 推出的轻量级模型系列,其中的视觉语言模型旨在运行于大模型无法运行的设备上。这个系列经历了很大变化:Ollama 的旧标签所加载的模型版本已不再是最新版本,如今也已有一个拥有 13 亿参数的模型。本页面介绍应安装哪个标签、如何看待公布的各项数字,以及通用模型的 OCR 能力有哪些局限。
#2026 年应安装哪个版本的 MiniCPM
MiniCPM-V 是 OpenBMB 的紧凑型视觉语言模型系列,由 THUNLP(清华大学)和 ModelBest 开发,其权重和代码以 Apache 2.0 许可证发布。在 Ollama 中,三个标签并存,容易混淆。无后缀的标签 minicpm-v 仍对应 MiniCPM-V 2.6,这是一个 80 亿参数的模型,大小为 5.5 GB,上下文长度为 32K。标签 minicpm-v4.5 加载的是较新的 80 亿参数版本(6.1 GB,上下文长度 40K)。根据项目仓库的信息,标签 minicpm-v4.6 于 2026 年 6 月 25 日进入 Ollama 官方库,大小为 1.6 GB,参数约为 13 亿。要在小型机器上体验本地视觉功能,请从 4.6 开始;保留 4.5,用于在内容密集的文档上进行比较,因为无法保证 13 亿参数的模型在读取排版紧密的文本时能与 80 亿参数的模型一样好。
| Ollama 标签 | 版本 | 参数 | 下载 | 公布的上下文长度 | 要点 |
|---|---|---|---|---|---|
| minicpm-v | MiniCPM-V 2.6 | 80亿 | 5.5 GB | 32K | 2024 年版本:支持多图和视频;不带后缀的标签加载的就是这一版本 |
| minicpm-v4.5 | MiniCPM-V 4.5 | 80亿 | 6.1 GB | 40K | 基于 Qwen3-8B 和 SigLIP2-400M 构建;高帧率视频;发布方宣称其在 OpenCompass 上得分为 77.0 |
| minicpm-v4.6 | MiniCPM-V 4.6 | 约 13 亿 | 1.6 GB | 256K | 最轻量、最新;视觉令牌压缩;提供移动端版本 |
| openbmb/minicpm-o4.5 | MiniCPM-o 4.5 | 90亿 | 6.1 GB | 40K | omni 版本(语音、实时流);Ollama 的模型介绍页仅注明支持文本和图像输入 |
#该系列带来的优势,以及需要加以权衡的地方
只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。
- 在线空间,终身可用
- PDF + 文件
- 30 天内退款
该系列追求最佳的能力与规模之比。根据 OpenBMB 的代码仓库,MiniCPM-V 4.5 在 OpenCompass 上得分为 77.0,并以 80 亿参数超越 GPT-4o-latest、Gemini 2.0 Pro 和 Qwen2.5-VL 72B。对于 4.6 版本,项目方表示,其视觉编码器的计算量降低了超过 50%,视觉 token 可选择压缩 4 倍或 16 倍,token 吞吐量约为 Qwen3.5-0.8B 的 1.5 倍。同一模型的 Ollama 页面宣称为 2.4 倍:两个数字都来自项目方,而这些页面均未详细说明测量方法。这些是项目方公布的说法,并非独立测量结果:请在自己的硬件上计时测量。
- 紧凑型多模态模型
- 支持文本、图像、同时输入多张图像,以及视频。根据代码仓库的说明,4.5 版本可将最多 6 帧视频图像压缩为共 64 个 token,从而在不增加语言模型开销的情况下读取更多图像。
- 高分辨率 OCR
- 4.5 可处理任意宽高比的图像,最多 180 万像素(例如 1344 x 1344)。开发方声称,在通用多模态模型中,它在 OCRBench 和 PDF 分析(OmniDocBench)上处于领先地位;据称,4.6 在包括 OCRBench 在内的多项基准测试中达到了 Qwen3.5 2B 的水平。
- 宽松许可证
- 代码仓库声明模型权重和代码均采用 Apache 2.0 许可证,Hugging Face 上 4.5 和 4.6 版本的模型卡也标注了同样的许可证。请核实您下载的具体版本所采用的确切许可证。
- 多种格式
- 该项目提供 GGUF、BNB、AWQ 和 GPTQ 变体,并宣布支持 SGLang、vLLM、llama.cpp 和 Ollama。
#究竟需要多少内存
| 模型与格式 | 公布的内存需求 | 来源 |
|---|---|---|
| MiniCPM-V 4.6,Transformers(GPU) | 4 GB | 仓库中的模型表格 |
| MiniCPM-V 4.6,GGUF(CPU) | 2 GB | 仓库中的模型表格 |
| MiniCPM-V 4.6,BNB,AWQ或GPTQ(GPU) | 3 GB | 仓库中的模型表格 |
| MiniCPM-o 4.5,GGUF | 10 GB | 仓库中的模型表格 |
| MiniCPM-o 4.5,GPU | 19 GB | 仓库中的模型表格 |
| Ollama 中的 minicpm-v4.6 | 下载大小1.6 GB | Ollama 介绍页面 |
| Ollama 中的 minicpm-v4.5 | 下载大小 6.1 GB | Ollama 介绍页面 |
这些数值描述的是模型权重和基本运行所需的内存:上下文和图像还需要额外的内存。图像会转换为视觉 token,占用上下文窗口。Ollama 的文档指出,显存低于 24 GiB 时,默认使用 4 000 个上下文 token;增大这一数值会增加内存需求。因此,4.6 版本标称的 256K 上下文并不会默认全部分配。最后,仓库中的表格注明 4.6 的 GGUF 版本在 CPU 上运行,但未公布速度:请先测量,再承诺实时性能。
#使用 Ollama 安装 MiniCPM-V
Ollama 负责下载、视觉投影器和 API 服务器:无需安装其他组件。请先更新 Ollama,因为 4.6 版本刚加入模型库不久。minicpm-v 标签页面此前就已注明,它要求 Ollama 0.3.10 或更高版本。
- 01下载模型ollama pull minicpm-v4.6 récupère les poids du modèle de langage et le projecteur visuel, soit environ 1,6 Go. Pour le 4.5, utilisez minicpm-v4.5 (6,1 Go).
- 02启动首次对话ollama run minicpm-v4.6 ouvre une session interactive. Posez une question texte avant de tester la vision.
- 03发送一张图片Ollama 的文档示例将文件路径放在问题之前,例如先输入 ollama run minicpm-v4.6 ./photo.jpg,再接上“描述这张图片”。
- 04接入用户界面模型下载完成后,将在 Open WebUI 或指向端口 11434 的任何客户端中出现。
#日常中的视觉识别与光学字符识别(OCR)
MiniCPM-V 擅长处理文档任务:阅读发票、转录屏幕截图、提取表格中的各行、描述照片。高分辨率图像对 OCR 非常重要,因为缩略图上无法辨认的细小文字,在完整分辨率下就能被识别和利用。请使用精确的提示词:“描述这张图片”会得到概括性的描述,而“忠实转录所有可见文字,并保留排版”则能得到规整得多的结果。提取数据时,请明确指定格式:JSON、Markdown 或表格。
正如文档所述,Ollama 的 REST API 要求在 images 字段中传入以 base64 编码的图像;SDK 还支持传入文件路径。如果使用的是 Transformers 而不是 Ollama,仓库文档介绍了一个适用于 4.6 的实用设置:downsample_mode 参数的默认值为 16x,而设为 4x 时,保留的视觉 token 数量是默认设置的四倍,能捕捉更细的细节。当字号很小的文字识别不准确时,可以尝试这个设置。
何时优先选择专用 OCR 引擎?如果您处理数千页文档且可追溯性至关重要,专用引擎会产生可见的错误,而非看似合理的数值。PaddleOCR-VL 是一个参数少于一亿的模型,据其开发者称,在 OmniDocBench v1.6 上达到 96.33% 的准确率;Tesseract 仍是处理干净文本的轻量级选择。如果您还想描述图像或回答关于图像的问题,MiniCPM-V 具有优势。
#与 Qwen3-VL 及其他紧凑模型相比
MiniCPM-V 在紧凑型视觉模型类别中的直接竞争对手是 Qwen3-VL,该模型在 Ollama 可用,提供 2、4 和 80 亿参数版本。两者覆盖相同的应用场景:图像描述、OCR、文档问答。OpenBMB 的 README 表示,MiniCPM-V 4.6 在性能上超越了更大规模的 Gemma4-E2B-it 模型,并且在效率上优于 Qwen3.5-0.8B:这些对比由发布方基于其自身评估结果发布。
| 模型 | 显示大小 | 简评 | 本站指南 |
|---|---|---|---|
| minicpm-v4.6 | 1.6 GB | 开发方称,它在包括 OCRBench 在内的多项视觉基准测试中达到了 Qwen3.5 2B 的水平 | 本页面 |
| qwen3-vl:2b | 1.9 GB | 规模级别相同,标示的上下文长度为 256K | 本地运行 Qwen3-VL |
| qwen3-vl:8b | 6.1 GB | 大小与 minicpm-v4.5 相当 | 本地运行 Qwen3-VL |
| Moondream | 查看指南 | 轻量级视觉模型,本站有专门的指南介绍 | Moondream |
如何选择,更多取决于您的图像,而不是技术规格表。这两个系列的模型都能在同一个 Ollama 中运行,并使用同一套 API:从一个系列切换到另一个,只需更改请求中的模型名称;也完全可以同时保留两者,根据任务进行路由。
#边缘设备、移动设备和服务器:项目文档中的说明
MiniCPM 是为设备量身设计的。代码仓库显示,MiniCPM-V 4.6 支持在 iOS、Android 和 HarmonyOS 上部署,提供开源适配代码,并展示了在 iPhone 17 Pro Max、Redmi K70 和 HUAWEI nova 14 上的原始屏幕录制。应用仓库提供下载及部署指南。为支持多用户使用,项目宣布支持 vLLM 和 SGLang,同时支持 llama.cpp 和 Ollama。
- 01本地文档数字化一台配备入门级 GPU 的迷你 PC 或 NAS,可以将一个文件夹中的扫描件转换为可搜索的文本,无需将敏感文档上传到云端。
- 02离线助手在 Apple Silicon 笔记本电脑或配备入门级显卡的设备上,4.6 版本可以读取屏幕内容并根据截图作答,即使没有网络连接也可以。
- 03处理流水线的预处理在进入资源需求更高的系统之前,它先做初步筛选:识别文档类型和明显字段。只有难处理的情况才会交给大型模型。
- 04批量生成替代文本为网站或媒体库批量生成图片描述;硬件成本摊销完毕后,无需按次支付调用费用。
#故障排除
- 模型忽略图像
- 请检查文件路径,并确认从 Ollama 运行的位置能够访问该文件。通过 API 调用时,图像必须以 base64 编码放入 images 字段。
- OCR 识别粗糙或结果被截断
- 图片可能压缩过度或分辨率过低。请提供清晰且更高分辨率的版本,并明确要求进行忠实转录并保留排版格式。使用 Transformers 时,尝试设置 downsample_mode 为 4x。
- 响应缓慢
- 仅使用 CPU 时,这是正常现象。使用 GPU 时,请通过 ollama ps 检查,确认模型没有因上下文过长或图像过大而被部分卸载到系统内存中。
- 输出为非结构化格式
- 为获得可靠的 JSON 输出,请在提示词中明确规定 schema;如果您的客户端支持,请使用 Ollama 的结构化格式。
- 版本与预期不符
- 未添加后缀的 minicpm-v 标签仍指向 2.6 版本。为确保可复现行为,请明确指定 minicpm-v4.6 或 minicpm-v4.5。
#深入了解
- 5 分钟安装 Ollama
- 使用Ollama在本地运行多模态视觉LLM
- 选择量化方案
- 使用 Ollama 的 Open WebUI
- 来源:OpenBMB 官方 MiniCPM-V 仓库
- 来源:Ollama 上的 minicpm-v4.6 模型页面
- 来源:Hugging Face 上的 MiniCPM-V 4.6 模型卡
- 来源:Ollama 关于视觉的文档
MiniCPM-V 应安装哪个 Ollama 标签?+
MiniCPM-V是否免费,包括商业用途?+
真正需要多少显存?+
MiniCPM-V 能够正确读取文档中的文本吗?+
可以在手机上使用吗?+
MiniCPM-o 能让您在 Ollama 中与模型进行语音对话吗?+
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。