🇺🇸 Gemma 4 E4B
40 亿有效参数,多模态(文本+图像+音频)。140 种语言。适用于笔记本电脑和边缘设备。
ollama run gemma4:e4b
排名更新于 2026年9月22日
没有GPU?借助llama.cpp和Q4量化,现代1–7B规模的LLM也能在CPU上正常运行。需要8–16 GB内存,并接受5–15 token/秒的运行速度。以下是最佳选择。
40 亿有效参数,多模态(文本+图像+音频)。140 种语言。适用于笔记本电脑和边缘设备。
ollama run gemma4:e4b
30 亿参数的稠密模型,采用 Apache 2.0 许可证,支持 12 种语言(含法语),131k 上下文,GQA 40Q/8KV。支持工具调用和代码中间补全(FIM)。发布于 2026 年 4 月 29 日。
ollama run granite4.1:3b
Gemma 4 E2B:有效参数 20 亿(总参数 51 亿),Q4 约需 3 GB 显存(Ollama 权重:QAT 下为 4.3 GB,默认为 7.2 GB)。支持文本和图像多模态,128k 上下文,Apache 2.0。
ollama run gemma4:e2b
Granite 4.1(3B,Apache 2.0 许可证):IBM Granite 4.1 系列的通用 Ollama 标签,128k 上下文,支持工具调用和编程。2026 年 5 月发布。
ollama run granite4.1
OLMo 3 7B 的「thinking」SFT 微调:逐步推理,16k 上下文,Q4 约需 4.2 GB 显存。100% 开放,Apache 2.0 许可证。
# HuggingFace : zimplex/olmo3-7b-think-sft-eosfix-16k-3ep-euc
GLM 5.3(智谱):7B 稠密模型,专攻代码与推理,128k 上下文,Q4 量化约需 4.1 GB 显存。轻量级,可在配备 6–8 GB 显存的 GPU 上运行,采用 MIT 许可证。
ollama pull glm-5.3
专用于企业文档信息提取的 3B VLM。OCR、表格、表单。
# HuggingFace : ibm-granite/granite-4.0-3b-vision
| 名次 | 模型 | Params | Q4 VRAM | 上下文 | 许可证 | 使用集成显卡/无显卡 |
|---|---|---|---|---|---|---|
| #1 | Gemma 4 E4B | 4B | 10 GB | 128 000 | Apache 2.0 | ✗ |
| #2 | Granite 4.1 3B Instruct | 3B | 2 GB | 131 072 | Apache 2.0 | ✗ |
| #3 | Gemma 4 E2B | 2B | 3 GB | 128 000 | Apache 2.0 | ✗ |
| #4 | Granite 4.1 | 3B | 1.7 GB | 128 000 | Apache 2.0 | ✗ |
| #5 | OLMo 3 7B Think (SFT) | 7B | 4.2 GB | 16 000 | Apache 2.0 | ✗ |
| #6 | GLM 5.3 7B | 7B | 4.1 GB | 128 000 | MIT | ✗ |
| #7 | Granite 4.0 3B Vision | 3B | 2.2 GB | 16 384 | Apache 2.0 | ✗ |
只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。
仅限 ≤ 8B 的模型——超过这一规模,CPU 的吞吐量就会过低。≤ 3B 的模型(在现代 CPU 上运行非常快)和采用宽松许可证的模型会获得大幅加分。
考虑的标准:
评分完全透明:请参阅 我们的方法论 ,了解 VRAM/每秒令牌数的计算详情。
真的可以不使用GPU来运行LLM吗?
是的——得益于 llama.cpp + Q4_K_M 量化,7B 模型在 Ryzen 7 CPU 或 Apple M1 上可达到 5–10 tokens/秒。对于交互式使用,建议选择 1–3B 模型(30–50 tokens/秒)。
需要多少 RAM?
7B模型Q4版本:至少8 GB RAM,推荐16 GB(模型本身约5 GB,其余用于操作系统和上下文)。3B模型:6-8 GB足够。1B模型:4 GB即可。
什么样的 CPU 适合运行 LLM?
核心越多、对AVX2/AVX-512的支持越充分越好。较新的Ryzen 7/9、Intel Core i7/i9以及Apple M1/M2/M3都很出色。优先选择高速内存(DDR5 > DDR4):内存带宽往往比核心数量更容易成为性能瓶颈。
iGPU(Intel / AMD)能否提供帮助?
微小提升——iGPU 上的 Vulkan 相比仅使用 CPU 可提升 20-40%。效果不显著但值得考虑。在 Mac Apple 芯片上,集成显卡可通过 Metal 运行,且性能差异显著(即‘统一内存’模式)。