Llama 4 Scout 本地部署:安装与初步测试 Ollama
Llama 4 Scout 是 Meta Llama 4 系列三个模型中最小的一个。它也是唯一能在高端工作站上本地运行的模型——Maverick 和 Behemoth 仍仅限于云端或专用服务器。本指南将展示如何使用 Ollama 安装 Llama 4 Scout,实际所需的 VRAM 是多少(MoE 的承诺常被误解),以及如何利用其两大差异化优势:原生多模态能力和 10M 令牌上下文。
#为什么要使用 Ollama 在本地安装 Llama 4 Scout?
Scout 是 Llama 4 系列中唯一一个设计用于单机运行的模型。Meta 将其定位为该系列的“工作站模型”:原生支持多模态(文本 + 图像),宣称上下文窗口为 1000 万 token,并采用 MoE(混合专家)架构,每处理一个 token 只激活一部分参数。
具体而言,与同等规模的密集模型相比,Scout在延迟方面表现更优(每个token激活的参数较少),上下文内存显著更大,且内置视觉能力无需额外模型。其代价是磁盘占用较大(为使路由功能正常运行,所有专家必须持续驻留在VRAM中)。
#Scout、Maverick、Behemoth:各自有什么功能
只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。
- 在线空间,终身可用
- PDF + 文件
- 30 天内退款
- Scout(170 亿活跃参数)
- 工作站级模型。16 个专家,总参数量约 109B。支持多模态。上下文长度为 10M 个 token。目标硬件:RTX 4090、M3/M4 Max/Ultra,或显存容量至少 48 GB 的多 GPU 配置。
- Maverick(17B 活跃参数)
- 面向服务器的模型。128 个专家,总参数约 4000 亿。激活参数数量与 Scout 相同,但编码的知识多得多。目标部署环境:配备 8 块 H100 的服务器或集群。对大多数配置而言,本地运行不现实。
- Behemoth(288B 活跃参数)
- 前沿模型。总参数量约为 2T。没有数据中心级设施就无法在本地运行。主要用作“教师”模型,用于蒸馏另外两个模型。
#实际 VRAM:技术规格表中未提及的内容
使用 MoE 模型时,常见的错误是只根据活跃参数量来判断。“170 亿活跃参数 = Q4 量化后能装进 12 GB 内存”:这是错的。为了让路由正常工作,所有专家都必须保留在内存中。Scout 在 Q4_K_M 量化下所需的内存,远多于其 170 亿活跃参数让人以为需要的容量。
- Q4_K_M (推荐)
- 仅模型本身约需65 GB显存,加上约4 GB用于合理上下文(32k token),总计约70 GB。
- Q5_K_M
- 约 78 GB。相较于 Q4_K_M,大多数任务的质量提升微乎其微。
- Q8_0
- 约 115 GB。仅供参考基准测试使用。
- FP16
- ≈ 220GB。只能在云端或多服务器环境中运行。
可在本地顺畅运行 Scout 的配置:
- Mac Studio M3 Ultra / M5 Ultra 96 GB 及以上
- 运行 Scout 的最佳消费级平台。采用统一内存,无需将模型卸载到系统 RAM;速度约为每秒 25–40 个 token,具体取决于量化方式。
- 2x RTX 4090 / 2x 5090
- 合计 48 GB 或 64 GB 显存,足以运行 Q4_K_M 量化版本并使用扩展上下文。使用 llama.cpp,或使用 Ollama 并设置 OLLAMA_NUM_GPU 变量。
- RTX 6000 Ada(48 GB)或 A6000 工作站
- 可轻松容纳 Scout Q4,并为上下文留有余量。
#先决条件
- Ollama 0.6 或更新版本
- 从 Ollama 0.6 版本开始支持 Llama 4。请使用 ollama --version 检查版本,若不匹配则需更新。
- 70 GB 空闲磁盘空间
- Q4_K_M 标签的模型大小约为 65 GB,建议预留充足的缓存空间。
- 高内存带宽
- 在 Mac 上:目标 ≥ 400 GB/s(M3 Max 及以上)。在 PC 上:若计划使用 CPU offload,则推荐 DDR5。
- 稳定的网络连接
- 初始下载时间根据您的链接可能需要1至3小时。ollama pull supporte 若下载中断,可继续恢复。
#1. 使用 Ollama 安装 Llama 4 Scout
若 Ollama 尚未安装,请先按照适配您系统的指南操作。之后,Scout 的下载仅需一条命令。
该标签默认指向Q4_K_M量化方案。若需强制使用其他量化方式,请进行如下设置:
下载完成后,请列出模型,确认其实际大小:
#2. 首次测试:文本与推理
请先启动一个交互会话以验证其正常运行,再进行其他操作。
出现提示符 >>> 时,请用一个简单测试检查语言和推理质量:
在对话进行时,打开另一个终端来观察系统负载:
SIZE 列应反映实际加载的模型大小。PROCESSOR 列理想情况下应显示 100% GPU。如果看到 CPU/GPU 混合使用,说明显存不足,Ollama 将部分模型转移到了 CPU 端运行——这会严重拖慢速度。
#3. 用法语测试视觉能力
Scout 原生支持多模态:图像和文本通过同一个主干网络处理,不同于将独立的视觉编码器附加到纯文本模型上的方法。这在融合图像与文本的各类任务(如上下文OCR、图表阅读、细粒度描述)上表现更优。
通过 Ollama 的 REST API,将图像以 base64 格式发送至 images 字段中:
在典型场景下(界面截图、白板照片、PDF扫描),Scout能生成细致的描述,并且即使图像包含英文文本,也能保持法语的连贯性,相比通用视觉小模型如Qwen 3.5 9B,在结构化细节上表现更优。
#4. 1000万标记上下文:承诺与现实
Meta 宣布 Scout 模型支持 1000 万 token 的上下文窗口。在本地实际使用中,会受到两个限制。
- KV 缓存急剧膨胀
- 在 100 万 token 的上下文长度下,KV 缓存很容易在模型本身占用的显存之外,再增加 30–50 GB 的显存占用。再往上,就需要启用 KV 缓存量化(num_ctx 选项加上实验性参数),或不得不将缓存卸载到 CPU 端。
- 上下文长度远未达到 10M 时,质量就已开始下降
- 独立基准测试(RULER, NoLiMa)显示,在 256k-512k token 范围内,实用性能出现下降,尽管模型经过长上下文训练。超过该范围在技术上可行,但可靠性较低。
为实现长上下文推理而不导致系统崩溃,通过 Modelfile 配置 Ollama :
#Scout 与 Qwen3-30B-A3B 的真实对比
Qwen3-30B-A3B 是 2026 年本地部署中备受讨论的另一种 MoE 模型:总参数量 30B,激活参数量 3B,原生上下文长度 256k。两者对比值得一看,因为它们在硬件需求上属于不同层级。
- Q4 量化后的显存占用
- Scout ≈ 65 GB。Qwen3-30B-A3B ≈ 18 GB。差异巨大,彻底改变了目标机器的配置要求。
- 生成速度
- 在同等参数下(17B 对比 3B),Qwen3-30B-A3B 的每秒令牌处理速度更快——通常在相同设备上快 2 到 3 倍,当两者同时运行时。
- 推理质量
- 在公开的 MMLU-Pro 和 GPQA 基准测试中,Scout 仍然领先于 Qwen3-30B-A3B。启用 Qwen3 的 thinking 模式后,两者的差距会大幅缩小。
- 多模态
- Scout 是原生多模态模型。Qwen3-30B-A3B 则不是——如果您希望在同一技术栈中使用视觉能力,就需要并行运行一个独立的视觉模型,例如 Qwen 3.5 9B。
- 长上下文
- Scout 的目标上下文长度为 10M(实际稳定可用的是 256k)。Qwen3-30B-A3B 原生支持 256k 上下文,表现更可预测,KV 缓存开销也更低。
#故障排除
- "Error: model requires more system memory than is available"
- 您的显存与 RAM 的总容量不足。要么采用更激进的量化(已使用 Q4 时,这样的选择很少,因为压缩已经相当紧了),要么更换模型。Ollama 也没有什么神奇的解决办法。
- 在配备 24 GB 显存的 GPU 上,速度 < 5 tokens/sec
- 您当前已将部分推理计算转移到 CPU。请用 ollama ps 检查:PROCESSOR 列应显示 100% GPU。如果不是,Scout 就不适合您的机器。
- 截断的回复
- 增加 num_predict(部分配置默认为128)。在会话中通过 /set parameter num_predict 2048,或通过 Modelfile 实现。
- 超过 64k token 时崩溃
- KV 缓存占满显存。请减小 num_ctx,或在环境变量中设置 OLLAMA_FLASH_ATTENTION=1 + OLLAMA_KV_CACHE_TYPE=q8_0,以启用 KV 缓存量化。
- 图像被拒绝,并提示“unsupported image format”
- 转换为标准JPEG或PNG格式。WebP、HEIC、AVIF并非在所有 Ollama 版本中均被支持。
#深入了解
Scout 运行起来后,有几个方向值得探索,以发挥它的独有特性。
- 正确选择量化方式
- Q4_K_M 是 Scout 的最佳选择,但何时升级到 Q5 或 Q8 取决于具体应用场景——尤其是在多模态任务中,量化可能会比纯文本任务造成更大的性能下降。
- 在本地利用视觉能力
- 视觉专题指南介绍了在 Scout 及其多模态竞争对手(如 Qwen 3.5 9B 和 Gemma 4 12B)上真正有效的提示词模式,包括结合上下文的 OCR、结构化提取和图像比较。
- 通过 Modelfile 进行个性化配置
- 除了num_ctx之外,Modelfile还可以固定系统提示词、JSON输出格式以及适合您使用场景的温度参数——这样就不用在每次会话时重新配置。
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。