进阶 12 分钟Ollama

Llama 4 Scout 本地部署:安装与初步测试 Ollama

Llama 4 Scout 是 Meta Llama 4 系列三个模型中最小的一个。它也是唯一能在高端工作站上本地运行的模型——Maverick 和 Behemoth 仍仅限于云端或专用服务器。本指南将展示如何使用 Ollama 安装 Llama 4 Scout,实际所需的 VRAM 是多少(MoE 的承诺常被误解),以及如何利用其两大差异化优势:原生多模态能力和 10M 令牌上下文。

作者: Mohamed Meguedmi·更新于 2026-08-27·已在 Windows、macOS 和 Linux 上测试

#为什么要使用 Ollama 在本地安装 Llama 4 Scout?

Scout 是 Llama 4 系列中唯一一个设计用于单机运行的模型。Meta 将其定位为该系列的“工作站模型”:原生支持多模态(文本 + 图像),宣称上下文窗口为 1000 万 token,并采用 MoE(混合专家)架构,每处理一个 token 只激活一部分参数。

具体而言,与同等规模的密集模型相比,Scout在延迟方面表现更优(每个token激活的参数较少),上下文内存显著更大,且内置视觉能力无需额外模型。其代价是磁盘占用较大(为使路由功能正常运行,所有专家必须持续驻留在VRAM中)。

i
简说 MoE
像 Scout 这样的 MoE 模型包含 N 个“专家”(专门化的子网络)。处理每个 token 时,路由器会选择其中的 k 个(通常为 1 或 2 个)。只有这 k 个专家参与计算。结果是:推理速度相当于小模型,但输出质量趋近于大模型。全部参数仍保留在 VRAM 中——只是计算时仅用到其中一部分。

#Scout、Maverick、Behemoth:各自有什么功能

本地 AI 套件

只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。

  • 在线空间,终身可用
  • PDF + 文件
  • 30 天内退款
Scout(170 亿活跃参数)
工作站级模型。16 个专家,总参数量约 109B。支持多模态。上下文长度为 10M 个 token。目标硬件:RTX 4090、M3/M4 Max/Ultra,或显存容量至少 48 GB 的多 GPU 配置。
Maverick(17B 活跃参数)
面向服务器的模型。128 个专家,总参数约 4000 亿。激活参数数量与 Scout 相同,但编码的知识多得多。目标部署环境:配备 8 块 H100 的服务器或集群。对大多数配置而言,本地运行不现实。
Behemoth(288B 活跃参数)
前沿模型。总参数量约为 2T。没有数据中心级设施就无法在本地运行。主要用作“教师”模型,用于蒸馏另外两个模型。
→
选择哪一个?
如果您正在阅读本指南,并打算在本地安装,那么应选择 Scout。Maverick 至少需要一台高端多 GPU 服务器——到了这个配置级别,DeepSeek V4 Flash 或 Qwen3.7 Max 的指南更适合您。

#实际 VRAM:技术规格表中未提及的内容

使用 MoE 模型时,常见的错误是只根据活跃参数量来判断。“170 亿活跃参数 = Q4 量化后能装进 12 GB 内存”:这是错的。为了让路由正常工作,所有专家都必须保留在内存中。Scout 在 Q4_K_M 量化下所需的内存,远多于其 170 亿活跃参数让人以为需要的容量。

Q4_K_M (推荐)
仅模型本身约需65 GB显存,加上约4 GB用于合理上下文(32k token),总计约70 GB。
Q5_K_M
约 78 GB。相较于 Q4_K_M,大多数任务的质量提升微乎其微。
Q8_0
约 115 GB。仅供参考基准测试使用。
FP16
≈ 220GB。只能在云端或多服务器环境中运行。
!
不适合显存为 24 GB 的 GPU
如果您只有一张 RTX 4090 或 RTX 3090,Scout 无法正常运行。您可以强制将模型计算卸载到 CPU,但速度会急剧下降(< 2 tokens/sec)。对于 24 GB 显存的 GPU,建议优先考虑 Qwen3-30B-A3B 或 Mistral Small 24B。对于拥有 32 GB 显存的 RTX 5090,Qwen 3.6 35B-A3B 仍比需要卸载到 CPU 的 Scout 更合适。

可在本地顺畅运行 Scout 的配置:

Mac Studio M3 Ultra / M5 Ultra 96 GB 及以上
运行 Scout 的最佳消费级平台。采用统一内存,无需将模型卸载到系统 RAM;速度约为每秒 25–40 个 token,具体取决于量化方式。
2x RTX 4090 / 2x 5090
合计 48 GB 或 64 GB 显存,足以运行 Q4_K_M 量化版本并使用扩展上下文。使用 llama.cpp,或使用 Ollama 并设置 OLLAMA_NUM_GPU 变量。
RTX 6000 Ada(48 GB)或 A6000 工作站
可轻松容纳 Scout Q4,并为上下文留有余量。

#先决条件

Ollama 0.6 或更新版本
从 Ollama 0.6 版本开始支持 Llama 4。请使用 ollama --version 检查版本,若不匹配则需更新。
70 GB 空闲磁盘空间
Q4_K_M 标签的模型大小约为 65 GB,建议预留充足的缓存空间。
高内存带宽
在 Mac 上:目标 ≥ 400 GB/s(M3 Max 及以上)。在 PC 上:若计划使用 CPU offload,则推荐 DDR5。
稳定的网络连接
初始下载时间根据您的链接可能需要1至3小时。ollama pull supporte 若下载中断,可继续恢复。

#1. 使用 Ollama 安装 Llama 4 Scout

若 Ollama 尚未安装,请先按照适配您系统的指南操作。之后,Scout 的下载仅需一条命令。

终端 — 拉取模型
ollama pull llama4:scout

该标签默认指向Q4_K_M量化方案。若需强制使用其他量化方式,请进行如下设置:

可选变体
ollama pull llama4:scout-q5_K_M
ollama pull llama4:scout-q8_0
ollama pull llama4:scout-fp16

下载完成后,请列出模型,确认其实际大小:

验证
ollama list
i
首次加载请耐心等待
加载 65 GB 到 VRAM 需要时间:根据 SSD 不同,耗时在 30 秒到 2 分钟之间。后续加载因操作系统缓存而更快。

#2. 首次测试:文本与推理

请先启动一个交互会话以验证其正常运行,再进行其他操作。

交互式会话
ollama run llama4:scout

出现提示符 >>> 时,请用一个简单测试检查语言和推理质量:

测试提示词
>>> Explique en 4 phrases ce qu'est un modèle MoE, puis donne un avantage et un inconvénient.

[Réponse attendue : explication structurée en français, distinction entre paramètres totaux et actifs, mention de la latence comme avantage et de la VRAM comme inconvénient.]

在对话进行时,打开另一个终端来观察系统负载:

监控负载
ollama ps

SIZE 列应反映实际加载的模型大小。PROCESSOR 列理想情况下应显示 100% GPU。如果看到 CPU/GPU 混合使用,说明显存不足,Ollama 将部分模型转移到了 CPU 端运行——这会严重拖慢速度。

#3. 用法语测试视觉能力

Scout 原生支持多模态:图像和文本通过同一个主干网络处理,不同于将独立的视觉编码器附加到纯文本模型上的方法。这在融合图像与文本的各类任务(如上下文OCR、图表阅读、细粒度描述)上表现更优。

通过 Ollama 的 REST API,将图像以 base64 格式发送至 images 字段中:

Python视觉测试
import base64, requests, json

with open('facture.jpg', 'rb') as f:
    img_b64 = base64.b64encode(f.read()).decode()

response = requests.post(
    'http://localhost:11434/api/generate',
    json={
        'model': 'llama4:scout',
        'prompt': 'Décris cette image en français. Si c\'est un document, extrais les montants et la date.',
        'images': [img_b64],
        'stream': False,
    }
)
print(response.json()['response'])

在典型场景下(界面截图、白板照片、PDF扫描),Scout能生成细致的描述,并且即使图像包含英文文本,也能保持法语的连贯性,相比通用视觉小模型如Qwen 3.5 9B,在结构化细节上表现更优。

→
图像格式
JPEG 和 PNG 格式都可以使用。避免发送过大的图片(> 4 MB):Ollama 会调整图片尺寸,但这会带来较高的处理开销。发送前,请先将图片最长边缩小至不超过 1024 像素。

#4. 1000万标记上下文:承诺与现实

Meta 宣布 Scout 模型支持 1000 万 token 的上下文窗口。在本地实际使用中,会受到两个限制。

KV 缓存急剧膨胀
在 100 万 token 的上下文长度下,KV 缓存很容易在模型本身占用的显存之外,再增加 30–50 GB 的显存占用。再往上,就需要启用 KV 缓存量化(num_ctx 选项加上实验性参数),或不得不将缓存卸载到 CPU 端。
上下文长度远未达到 10M 时,质量就已开始下降
独立基准测试(RULER, NoLiMa)显示,在 256k-512k token 范围内,实用性能出现下降,尽管模型经过长上下文训练。超过该范围在技术上可行,但可靠性较低。

为实现长上下文推理而不导致系统崩溃,通过 Modelfile 配置 Ollama :

128k 上下文的 Modelfile
FROM llama4:scout

PARAMETER num_ctx 131072
PARAMETER num_predict 4096
PARAMETER temperature 0.6
变体创建
ollama create llama4-scout-128k -f Modelfile
ollama run llama4-scout-128k
!
128k已经相当多了
128k token 的上下文已相当于约 250 页文本。对于 95% 的本地使用场景(完整代码库、长 PDF 文档、工单档案),这已绰绰有余,而且比 1M 以上上下文的配置稳定得多。

#Scout 与 Qwen3-30B-A3B 的真实对比

Qwen3-30B-A3B 是 2026 年本地部署中备受讨论的另一种 MoE 模型:总参数量 30B,激活参数量 3B,原生上下文长度 256k。两者对比值得一看,因为它们在硬件需求上属于不同层级。

Q4 量化后的显存占用
Scout ≈ 65 GB。Qwen3-30B-A3B ≈ 18 GB。差异巨大,彻底改变了目标机器的配置要求。
生成速度
在同等参数下(17B 对比 3B),Qwen3-30B-A3B 的每秒令牌处理速度更快——通常在相同设备上快 2 到 3 倍,当两者同时运行时。
推理质量
在公开的 MMLU-Pro 和 GPQA 基准测试中,Scout 仍然领先于 Qwen3-30B-A3B。启用 Qwen3 的 thinking 模式后,两者的差距会大幅缩小。
多模态
Scout 是原生多模态模型。Qwen3-30B-A3B 则不是——如果您希望在同一技术栈中使用视觉能力,就需要并行运行一个独立的视觉模型,例如 Qwen 3.5 9B。
长上下文
Scout 的目标上下文长度为 10M(实际稳定可用的是 256k)。Qwen3-30B-A3B 原生支持 256k 上下文,表现更可预测,KV 缓存开销也更低。
→
实用结论
如果您拥有 Mac Studio Ultra、2x RTX 4090 或 A6000,建议选择 Scout 以获得原生视觉支持和更高质量。若仅使用单张 RTX 4090、RTX 3090 或 Mac M3 Max 36-64 GB,推荐选择 Qwen3-30B-A3B——该方案更合理且明显更快。在上述机型上将 Scout 的计算任务卸载至 CPU 是一种错误的设想。

#故障排除

"Error: model requires more system memory than is available"
您的显存与 RAM 的总容量不足。要么采用更激进的量化(已使用 Q4 时,这样的选择很少,因为压缩已经相当紧了),要么更换模型。Ollama 也没有什么神奇的解决办法。
在配备 24 GB 显存的 GPU 上,速度 < 5 tokens/sec
您当前已将部分推理计算转移到 CPU。请用 ollama ps 检查:PROCESSOR 列应显示 100% GPU。如果不是,Scout 就不适合您的机器。
截断的回复
增加 num_predict(部分配置默认为128)。在会话中通过 /set parameter num_predict 2048,或通过 Modelfile 实现。
超过 64k token 时崩溃
KV 缓存占满显存。请减小 num_ctx,或在环境变量中设置 OLLAMA_FLASH_ATTENTION=1 + OLLAMA_KV_CACHE_TYPE=q8_0,以启用 KV 缓存量化。
图像被拒绝,并提示“unsupported image format”
转换为标准JPEG或PNG格式。WebP、HEIC、AVIF并非在所有 Ollama 版本中均被支持。

#深入了解

Scout 运行起来后,有几个方向值得探索,以发挥它的独有特性。

正确选择量化方式
Q4_K_M 是 Scout 的最佳选择,但何时升级到 Q5 或 Q8 取决于具体应用场景——尤其是在多模态任务中,量化可能会比纯文本任务造成更大的性能下降。
在本地利用视觉能力
视觉专题指南介绍了在 Scout 及其多模态竞争对手(如 Qwen 3.5 9B 和 Gemma 4 12B)上真正有效的提示词模式,包括结合上下文的 OCR、结构化提取和图像比较。
通过 Modelfile 进行个性化配置
除了num_ctx之外,Modelfile还可以固定系统提示词、JSON输出格式以及适合您使用场景的温度参数——这样就不用在每次会话时重新配置。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。