进阶 12 分钟Edge

MiniCPM 本地运行(Ollama):多模态 compact

直接回答

MiniCPM-V 是 OpenBMB 推出的一系列轻量级视觉-语言模型,采用 Apache 2.0 许可。在 Ollama 中,minicpm-v 仍加载版本 2.6(80亿参数,5.5GB),minicpm-v4.5 为 80亿参数、6.1GB 的版本,minicpm-v4.6 则是一个约 13亿参数、1.6GB 的模型。建议先在小型设备上运行 4.6 版本,再在您的图像上进行对比测试。

MiniCPM 是 OpenBMB 推出的轻量级模型系列,其中的视觉语言模型旨在运行于大模型无法运行的设备上。这个系列经历了很大变化:Ollama 的旧标签所加载的模型版本已不再是最新版本,如今也已有一个拥有 13 亿参数的模型。本页面介绍应安装哪个标签、如何看待公布的各项数字,以及通用模型的 OCR 能力有哪些局限。

作者: Samir K.·更新于 2026-09-29·已在 Windows、macOS 和 Linux 上测试

#2026 年应安装哪个版本的 MiniCPM

MiniCPM-V 是 OpenBMB 的紧凑型视觉语言模型系列,由 THUNLP(清华大学)和 ModelBest 开发,其权重和代码以 Apache 2.0 许可证发布。在 Ollama 中,三个标签并存,容易混淆。无后缀的标签 minicpm-v 仍对应 MiniCPM-V 2.6,这是一个 80 亿参数的模型,大小为 5.5 GB,上下文长度为 32K。标签 minicpm-v4.5 加载的是较新的 80 亿参数版本(6.1 GB,上下文长度 40K)。根据项目仓库的信息,标签 minicpm-v4.6 于 2026 年 6 月 25 日进入 Ollama 官方库,大小为 1.6 GB,参数约为 13 亿。要在小型机器上体验本地视觉功能,请从 4.6 开始;保留 4.5,用于在内容密集的文档上进行比较,因为无法保证 13 亿参数的模型在读取排版紧密的文本时能与 80 亿参数的模型一样好。

MiniCPM 系列的 Ollama 标签(模型库条目,2026 年 9 月)
Ollama 标签版本参数下载公布的上下文长度要点
minicpm-vMiniCPM-V 2.680亿5.5 GB32K2024 年版本:支持多图和视频;不带后缀的标签加载的就是这一版本
minicpm-v4.5MiniCPM-V 4.580亿6.1 GB40K基于 Qwen3-8B 和 SigLIP2-400M 构建;高帧率视频;发布方宣称其在 OpenCompass 上得分为 77.0
minicpm-v4.6MiniCPM-V 4.6约 13 亿1.6 GB256K最轻量、最新;视觉令牌压缩;提供移动端版本
openbmb/minicpm-o4.5MiniCPM-o 4.590亿6.1 GB40Komni 版本(语音、实时流);Ollama 的模型介绍页仅注明支持文本和图像输入
i
三个容易混淆的名称
MiniCPM-V 指视觉模型,MiniCPM-o 指增加了语音和实时流功能的全模态模型,而 MiniCPM 5 是面向设备的新一代纯文本模型系列(MiniCPM5-1B 和 MiniCPM5-2B,后者约有 25 亿参数,均可在 Ollama 中通过 OpenBMB 获取)。如需进行图像分析和 OCR,应选择 MiniCPM-V。

#该系列带来的优势,以及需要加以权衡的地方

本地 AI 套件

只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。

  • 在线空间,终身可用
  • PDF + 文件
  • 30 天内退款

该系列追求最佳的能力与规模之比。根据 OpenBMB 的代码仓库,MiniCPM-V 4.5 在 OpenCompass 上得分为 77.0,并以 80 亿参数超越 GPT-4o-latest、Gemini 2.0 Pro 和 Qwen2.5-VL 72B。对于 4.6 版本,项目方表示,其视觉编码器的计算量降低了超过 50%,视觉 token 可选择压缩 4 倍或 16 倍,token 吞吐量约为 Qwen3.5-0.8B 的 1.5 倍。同一模型的 Ollama 页面宣称为 2.4 倍:两个数字都来自项目方,而这些页面均未详细说明测量方法。这些是项目方公布的说法,并非独立测量结果:请在自己的硬件上计时测量。

紧凑型多模态模型
支持文本、图像、同时输入多张图像,以及视频。根据代码仓库的说明,4.5 版本可将最多 6 帧视频图像压缩为共 64 个 token,从而在不增加语言模型开销的情况下读取更多图像。
高分辨率 OCR
4.5 可处理任意宽高比的图像,最多 180 万像素(例如 1344 x 1344)。开发方声称,在通用多模态模型中,它在 OCRBench 和 PDF 分析(OmniDocBench)上处于领先地位;据称,4.6 在包括 OCRBench 在内的多项基准测试中达到了 Qwen3.5 2B 的水平。
宽松许可证
代码仓库声明模型权重和代码均采用 Apache 2.0 许可证,Hugging Face 上 4.5 和 4.6 版本的模型卡也标注了同样的许可证。请核实您下载的具体版本所采用的确切许可证。
多种格式
该项目提供 GGUF、BNB、AWQ 和 GPTQ 变体,并宣布支持 SGLang、vLLM、llama.cpp 和 Ollama。

#究竟需要多少内存

OpenBMB 宣称的内存与 Ollama 显示的模型大小
模型与格式公布的内存需求来源
MiniCPM-V 4.6,Transformers(GPU)4 GB仓库中的模型表格
MiniCPM-V 4.6,GGUF(CPU)2 GB仓库中的模型表格
MiniCPM-V 4.6,BNB,AWQ或GPTQ(GPU)3 GB仓库中的模型表格
MiniCPM-o 4.5,GGUF10 GB仓库中的模型表格
MiniCPM-o 4.5,GPU19 GB仓库中的模型表格
Ollama 中的 minicpm-v4.6下载大小1.6 GBOllama 介绍页面
Ollama 中的 minicpm-v4.5下载大小 6.1 GBOllama 介绍页面

这些数值描述的是模型权重和基本运行所需的内存:上下文和图像还需要额外的内存。图像会转换为视觉 token,占用上下文窗口。Ollama 的文档指出,显存低于 24 GiB 时,默认使用 4 000 个上下文 token;增大这一数值会增加内存需求。因此,4.6 版本标称的 256K 上下文并不会默认全部分配。最后,仓库中的表格注明 4.6 的 GGUF 版本在 CPU 上运行,但未公布速度:请先测量,再承诺实时性能。

→
将部分模型卸载到 CPU
如果 Ollama 将模型分配到 GPU 和 CPU 上运行,ollama ps 命令会在 PROCESSOR 列中显示分配情况。问题往往出在图像或上下文,而不是模型权重:在考虑降低量化位数之前,先降低图像分辨率或 num_ctx 的值。

#使用 Ollama 安装 MiniCPM-V

Ollama 负责下载、视觉投影器和 API 服务器:无需安装其他组件。请先更新 Ollama,因为 4.6 版本刚加入模型库不久。minicpm-v 标签页面此前就已注明,它要求 Ollama 0.3.10 或更高版本。

  1. 01
    下载模型
    ollama pull minicpm-v4.6 récupère les poids du modèle de langage et le projecteur visuel, soit environ 1,6 Go. Pour le 4.5, utilisez minicpm-v4.5 (6,1 Go).
  2. 02
    启动首次对话
    ollama run minicpm-v4.6 ouvre une session interactive. Posez une question texte avant de tester la vision.
  3. 03
    发送一张图片
    Ollama 的文档示例将文件路径放在问题之前,例如先输入 ollama run minicpm-v4.6 ./photo.jpg,再接上“描述这张图片”。
  4. 04
    接入用户界面
    模型下载完成后,将在 Open WebUI 或指向端口 11434 的任何客户端中出现。
终端
# Le plus léger (1,6 Go)
ollama pull minicpm-v4.6

# La version 8 milliards, pour comparer
ollama pull minicpm-v4.5

# Vérifier ce qui est installé, puis discuter
ollama list
ollama run minicpm-v4.6 ./photo.jpg Décris cette image

#日常中的视觉识别与光学字符识别(OCR)

MiniCPM-V 擅长处理文档任务:阅读发票、转录屏幕截图、提取表格中的各行、描述照片。高分辨率图像对 OCR 非常重要,因为缩略图上无法辨认的细小文字,在完整分辨率下就能被识别和利用。请使用精确的提示词:“描述这张图片”会得到概括性的描述,而“忠实转录所有可见文字,并保留排版”则能得到规整得多的结果。提取数据时,请明确指定格式:JSON、Markdown 或表格。

Ollama 的 API:提取发票字段
import base64, requests

with open("facture.png", "rb") as f:
    img = base64.b64encode(f.read()).decode()

r = requests.post("http://localhost:11434/api/generate", json={
    "model": "minicpm-v4.6",
    "prompt": "Extrais le total, la date et le numéro de facture en JSON.",
    "images": [img],
    "stream": False,
})
print(r.json()["response"])

正如文档所述,Ollama 的 REST API 要求在 images 字段中传入以 base64 编码的图像;SDK 还支持传入文件路径。如果使用的是 Transformers 而不是 Ollama,仓库文档介绍了一个适用于 4.6 的实用设置:downsample_mode 参数的默认值为 16x,而设为 4x 时,保留的视觉 token 数量是默认设置的四倍,能捕捉更细的细节。当字号很小的文字识别不准确时,可以尝试这个设置。

!
请始终检查 OCR 结果
目前没有任何视觉模型在关键数据(如金额、参考编号、日期)上能实现100%的准确率:视觉模型可能生成页面中不存在的格式正确数值。在财务或法律场景中,必须保留人工复核或对敏感字段的逻辑一致性检查。

何时优先选择专用 OCR 引擎?如果您处理数千页文档且可追溯性至关重要,专用引擎会产生可见的错误,而非看似合理的数值。PaddleOCR-VL 是一个参数少于一亿的模型,据其开发者称,在 OmniDocBench v1.6 上达到 96.33% 的准确率;Tesseract 仍是处理干净文本的轻量级选择。如果您还想描述图像或回答关于图像的问题,MiniCPM-V 具有优势。

#与 Qwen3-VL 及其他紧凑模型相比

MiniCPM-V 在紧凑型视觉模型类别中的直接竞争对手是 Qwen3-VL,该模型在 Ollama 可用,提供 2、4 和 80 亿参数版本。两者覆盖相同的应用场景:图像描述、OCR、文档问答。OpenBMB 的 README 表示,MiniCPM-V 4.6 在性能上超越了更大规模的 Gemma4-E2B-it 模型,并且在效率上优于 Qwen3.5-0.8B:这些对比由发布方基于其自身评估结果发布。

在 Ollama 中可获得的紧凑型视觉模型
模型显示大小简评本站指南
minicpm-v4.61.6 GB开发方称,它在包括 OCRBench 在内的多项视觉基准测试中达到了 Qwen3.5 2B 的水平本页面
qwen3-vl:2b1.9 GB规模级别相同,标示的上下文长度为 256K本地运行 Qwen3-VL
qwen3-vl:8b6.1 GB大小与 minicpm-v4.5 相当本地运行 Qwen3-VL
Moondream查看指南轻量级视觉模型,本站有专门的指南介绍Moondream

如何选择,更多取决于您的图像,而不是技术规格表。这两个系列的模型都能在同一个 Ollama 中运行,并使用同一套 API:从一个系列切换到另一个,只需更改请求中的模型名称;也完全可以同时保留两者,根据任务进行路由。

在相同图像上对比
ollama run minicpm-v4.6 ./ticket.jpg Transcris le texte de ce ticket
ollama run qwen3-vl:2b ./ticket.jpg Transcris le texte de ce ticket

#边缘设备、移动设备和服务器:项目文档中的说明

MiniCPM 是为设备量身设计的。代码仓库显示,MiniCPM-V 4.6 支持在 iOS、Android 和 HarmonyOS 上部署,提供开源适配代码,并展示了在 iPhone 17 Pro Max、Redmi K70 和 HUAWEI nova 14 上的原始屏幕录制。应用仓库提供下载及部署指南。为支持多用户使用,项目宣布支持 vLLM 和 SGLang,同时支持 llama.cpp 和 Ollama。

  1. 01
    本地文档数字化
    一台配备入门级 GPU 的迷你 PC 或 NAS,可以将一个文件夹中的扫描件转换为可搜索的文本,无需将敏感文档上传到云端。
  2. 02
    离线助手
    在 Apple Silicon 笔记本电脑或配备入门级显卡的设备上,4.6 版本可以读取屏幕内容并根据截图作答,即使没有网络连接也可以。
  3. 03
    处理流水线的预处理
    在进入资源需求更高的系统之前,它先做初步筛选:识别文档类型和明显字段。只有难处理的情况才会交给大型模型。
  4. 04
    批量生成替代文本
    为网站或媒体库批量生成图片描述;硬件成本摊销完毕后,无需按次支付调用费用。
i
MiniCPM-o 4.5:语音功能需要另一套技术栈
MiniCPM-o 4.5 增加了语音对话和音视频流的同步处理,但 Ollama 的文档仅说明支持文本和图像输入。关于语音功能,仓库链接指向 Transformers 或 llama.cpp-omni,其文档中明确指出存在实际限制:在 omni 模式下语音有时发音不准确,回答内容有时混合使用英文和中文。

#故障排除

模型忽略图像
请检查文件路径,并确认从 Ollama 运行的位置能够访问该文件。通过 API 调用时,图像必须以 base64 编码放入 images 字段。
OCR 识别粗糙或结果被截断
图片可能压缩过度或分辨率过低。请提供清晰且更高分辨率的版本,并明确要求进行忠实转录并保留排版格式。使用 Transformers 时,尝试设置 downsample_mode 为 4x。
响应缓慢
仅使用 CPU 时,这是正常现象。使用 GPU 时,请通过 ollama ps 检查,确认模型没有因上下文过长或图像过大而被部分卸载到系统内存中。
输出为非结构化格式
为获得可靠的 JSON 输出,请在提示词中明确规定 schema;如果您的客户端支持,请使用 Ollama 的结构化格式。
版本与预期不符
未添加后缀的 minicpm-v 标签仍指向 2.6 版本。为确保可复现行为,请明确指定 minicpm-v4.6 或 minicpm-v4.5。

#深入了解

FAQ
MiniCPM-V 应安装哪个 Ollama 标签?+
对于小型设备,可选 minicpm-v4.6:大小约为 1.6 GB,参数量约为 13 亿。若想用一个 80 亿参数的模型作比较,minicpm-v4.5 的大小为 6.1 GB。注意:不带后缀的 minicpm-v 标签仍会加载 2.6 版本。请始终明确指定版本,否则你就不知道自己测试的是什么。
MiniCPM-V是否免费,包括商业用途?+
该仓库声明模型权重和代码采用 Apache 2.0 许可证,Hugging Face 页面中 4.5 和 4.6 版本也明确标注了此信息。Apache 2.0 允许商业用途。但请务必重新查阅您实际下载版本的许可证,较旧版本可能具有不同的条款。
真正需要多少显存?+
仓库中的表格标明,4.6 版本使用 Transformers 时需要 4 GB 显存,其在 CPU 上运行的 GGUF 版本需要 2 GB 内存;4.5 版本在 Ollama 中的大小为 6.1 GB。还要计入上下文和图像的开销:显存不足 24 GiB 时,Ollama 默认分配 4,000 个 token 的上下文。请使用 ollama ps 检查。
MiniCPM-V 能够正确读取文档中的文本吗?+
厂商宣称其 OCR 性能表现优异,支持高达 180 万像素的图像(版本 4.5),这是其自身测试结果。如同所有视觉模型,它可能生成页面中不存在的合理数值,请务必对关键数字进行复核,或使用专用 OCR 引擎处理大量数据。
可以在手机上使用吗?+
是的,仓库说明 MiniCPM-V 4.6 可以部署在 iOS、Android 和 HarmonyOS 上,并提供公开的适配代码和应用仓库。已发布的演示都是屏幕录制。应将其用于单次任务,而不是连续图像流,并在您的设备上测量延迟。
MiniCPM-o 能让您在 Ollama 中与模型进行语音对话吗?+
根据 Ollama 的模型页面,并不支持:该页面只列出了 minicpm-o4.5 的文本和图像输入。根据代码仓库的说明,语音对话和同时输入的音视频流需要通过 Transformers 或 llama.cpp-omni 实现。该模型所需的内存也多得多:在 GPU 上需要 19 GB,使用 GGUF 时需要 10 GB。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。