进阶 14 分钟Ollama

Qwen 3.8 27B 本地运行:Ollama 安装与 VRAM

Qwen3.8-27B的模型权重于2026年8月14日在Hugging Face上发布,采用Apache 2.0许可证,Ollama官方标签也于同日推出。这是3.8代中首个真正能在您自己的设备上安装的模型:稠密架构、多模态(图像和视频),原生上下文长度为262144个token。本指南提供准确的命令、各标签实际所需的显存、默认启用的“思考”模式设置,以及两个会影响大多数首次尝试的陷阱——上下文被静默截断,以及部分模型因显存不足而转移到系统内存。

作者: Mohamed Meguedmi·更新于 2026-08-27·已在 Windows、macOS 和 Linux 上测试

#30 秒内得出结论

Qwen 3.8 27B 通过一条命令即可安装:‘ollama run qwen3.8:27b’。默认包(Q4_K_M)大小为18 GB,需要24 GB VRAM的显卡——如RTX 3090、4090、5090——或配备至少32 GB统一内存的Mac Apple Silicon,才能舒适运行。在该配置以下,模型仍可运行,但部分层会切换到CPU,吞吐量急剧下降。

这是什么
一个包含270亿参数的密集模型,原生支持视觉-语言(图像和视频),上下文长度达262,144个token,采用Apache 2.0许可——因此可商业使用且无限制条款。
实际所需的配置
Q4_K_M 版本需 24 GB 显存或 32 GB 统一内存;Q8 版本需 30 GB 文件空间和约 40 GB 显存,BF16 版本需 56 GB。
命令
ollama pull qwen3.8:27b puis ollama run qwen3.8:27b. Sur Mac, préférez le tag -mlx, optimisé Metal.
陷阱1
声明的上下文长度为 256k,但 Ollama 默认采用更小的窗口,且在未提示的情况下直接截断。需手动调整 num_ctx 参数。
陷阱2
“thinking”模式默认启用,会在回答前消耗大量 token。在本地运行时,对于简单任务,请降低 reasoning_effort 或关闭该模式。
!
性能数据来自阿里巴巴
截至本指南发布之日,尚无针对 Qwen3.8-27B 的独立基准测试得到复现。下文引用的所有分数均来自官方模型卡。这些分数与上一代模型的表现相符,但应将其视为模型发布方提供的数据。

#Qwen 3.8 27B 究竟是什么

本地 AI 套件

只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。

  • 在线空间,终身可用
  • PDF + 文件
  • 终身更新

与当下流行的混合专家(Mixture-of-Experts)模型不同,Qwen3.8-27B 是一个稠密模型:每生成一个 token,都会激活全部 270 亿参数。这使它的内存占用可预测——吞吐量不会带来意外惊喜,显存占用也不会带来意外麻烦——也解释了为什么它的本地吞吐量低于规模相近的 MoE 模型。

架构
64 层分为 16 个块,每个块的结构为「3 ×(门控 DeltaNet → FFN),然后 1 ×(门控注意力 → FFN)」。这是一种混合注意力机制:大多数层使用节省内存的线性注意力,其间穿插真正的注意力层以提高精度。
模态
原生视觉-语言能力:支持静态图像、文档、科学图表和视频。这不是一个事后叠加的适配器。
上下文
原生上下文长度为 262,144 个 token,可通过 YaRN 扩展至 1,000,000 个 token——但这种扩展仅适用于 vLLM、SGLang 或 TokenSpeed,无法通过 Ollama 实现。
许可证
Apache 2.0。允许商业使用,没有 Llama 那样的用户数量门槛,也没有 Gemma 那样的使用限制条款。
特点
模型采用多令牌预测(MTP)训练——因此带有 Ollama 「mtp」标签,可加速支持该技术的推理引擎的生成过程。
i
请勿与 Qwen 3.8-Max 混淆
Qwen 3.8-Max 于 2026 年 8 月 3 日发布,是一个约有 24000 亿参数的混合专家(MoE)模型,仅通过 API 提供:没有任何办法在您自己的设备上运行它。27B 是同一代的开放权重版本。我们的 Qwen 3.8 开放权重指南梳理了完整的时间线。

#所需硬件,按标签逐项列出

Ollama 模型库发布了十二种变体。下载文件的大小不等于所需的显存容量:还需加上随上下文长度增长的 KV 缓存,以及视觉编码器。请在文件大小的基础上预留 15% 至 25% 的额外空间。

Qwen 3.8 27B 在 Ollama 上的官方版本(2026年8月18日记录)
Tag大小内存充裕时的容量适用人群
qwen3.8:27b (Q4_K_M, 默认)18 GB24 GB默认选择:RTX 3090/4090/5090,Mac 32 GB
qwen3.8:27b-q8_030 GB40 GB 以上质量近乎最高:RTX Pro 6000,双GPU 24 GB
qwen3.8:27b-bf1656 GB80 GB参考权重,计算设备(H100、H200)
qwen3.8:27b-mlx18 GB32GB统一内存Apple Silicon:Metal构建版本,Mac上的合适默认选择
qwen3.8:27b-mxfp832 GB48 GB 统一内存Mac Studio / M4 Max 64 GB,质量更高
qwen3.8:27b-mlx-bf1656 GB96 GB统一内存Mac Studio 128 GB,无量化损失
qwen3.8:27b-mtp-q4_K_M18 GB24 GB与默认版本相同,明确采用多 token 预测
!
16 GB显存:可行,但体验不佳
在 RTX 4060 Ti 16 GB 或 5070 Ti 上,Q4_K_M 量化版本无法完全装入显存:Ollama 会将剩余部分交由 CPU 处理,生成速度往往降至每秒 5 个 token 以下。对于 16 GB 显存,选择 120 亿至 140 亿参数的模型仍能更好地利用这台机器。

在生成吞吐量方面,我们估算 Q4 量化的 27B 稠密模型在中端配置上约为 14 token/秒,在较新的高端配置上约为 22 token/秒。这些是计算得出的大致数值,而非实测结果:此外,默认启用的「thinking」模式可能使用户感受到的第一行回答出现前的等待时间翻倍。

#使用 Ollama 安装 Qwen 3.8 27B

  1. 01
    请更新 Ollama
    Qwen 3.8 的混合层和视觉解析器需要较新版本的 Ollama。早于 2026 年 8 月的版本会返回架构错误,或具有误导性的“model not found”错误。请从官方网站重新安装,或在 Linux 下重新运行安装脚本。
  2. 02
    下载模型
    需要传输18 GB的数据:请在系统盘上预留空间,Ollama会在那里存储blob文件。如果连接中断,拉取操作可以断点续传。
  3. 03
    启动首次对话
    首次响应较慢,因为需要先将模型权重加载到内存中。如果超过一分钟才开始响应,就说明部分计算已转由CPU承担。
  4. 04
    检查模型运行在何处
    ollama ps 命令显示模型在 GPU 和 CPU 之间的分配情况。只要显示的不是 100 % GPU,生成每个 token 的开销就很大——请将量化档位降低一级,或缩短上下文。
安装与首次测试
# 1. Récupérer le modèle (18 Go)
ollama pull qwen3.8:27b

# 2. Discuter avec
ollama run qwen3.8:27b

# 3. Vérifier la répartition GPU / CPU
ollama ps
i
qwen3.8 直接对应 27B 模型
标签“qwen3.8:latest”目前指向与“qwen3.8:27b”相同的 blob:这是官方模型库中唯一发布的格式。使用“ollama run qwen3.8”效果完全相同——不过,在脚本中固定模型规模,可以避免其他变体发布后出现意外情况。

#在搭载 Apple Silicon 的 Mac 上:请选择 MLX 版本

Ollama 发布了一个 MLX 构建版本,针对 Apple 的 Metal 引擎进行编译。在文件大小相同(18 GB)的情况下,它更高效地利用统一内存,并在 M3、M4 及后续芯片上显著优于通用 GGUF 模型的推理速度。

在 Apple Silicon Mac 上
# Build MLX (Metal) — recommandé sur M1/M2/M3/M4
ollama run qwen3.8:27b-mlx

# Mac 64 Go et plus : qualité supérieure
ollama run qwen3.8:27b-mxfp8
Mac 16GB
不足。macOS 只有约 70% 的统一内存可供 GPU 使用:模型会进行交换,导致不可用。
Mac 24 GB
只有在上下文较短、且未打开其他资源密集型应用时,才勉强能运行。用于测试尚可,日常使用则令人沮丧。
Mac 32 GB
真正的入门配置:内存能容纳模型,还能为 KV 缓存和系统留出余量。
Mac 64 GB 及以上
运行起来很从容,还可以升级到 mxfp8,或处理长文档。

#256k 上下文的陷阱

几乎所有首次使用的用户都会犯这个错误。模型宣称支持 262,144 个 token,但 Ollama 默认采用的上下文窗口要短得多:一旦超出这个窗口,文档开头就会直接被截断,而且没有错误提示。模型会对自己尚未完整读过的文本作出自信的回答。

设置上下文窗口
# Dans une session interactive
/set parameter num_ctx 32768

# Ou via un Modelfile réutilisable
cat > Modelfile <<'EOF'
FROM qwen3.8:27b
PARAMETER num_ctx 32768
PARAMETER temperature 1.0
PARAMETER top_p 0.95
PARAMETER top_k 20
EOF
ollama create qwen38-long -f Modelfile
!
纸面支持 256k,本地使用为 16k 至 64k
KV 缓存占用大致随上下文长度线性增长,并叠加在模型权重所占的 18 GB 之上。在显存为 24 GB 的显卡上,32,000 个 token 的上下文窗口是合理的设置;64,000 个 token 也能容纳,但运行会稍慢;262,144 个 token 则无法容纳。启用 Flash Attention 并将 KV 缓存量化为 q8_0(变量 OLLAMA_FLASH_ATTENTION 和 OLLAMA_KV_CACHE_TYPE),可释放数 GB 的显存。

至于所宣称的百万 token 上下文:它依赖于在模型配置文件中配置的 YaRN 扩展,而且只有 vLLM、SGLang 或 TokenSpeed 支持。目前还没有办法在 Ollama 中使用这一上下文长度。

#思考模式及采样参数

Qwen 3.8会先思考再回答:它先在“think”标签之间生成一段推理内容,然后给出最终答案。这一功能默认开启,也是用户感受到的大部分延迟的来源。在支持这一功能的引擎中,可以通过reasoning_effort调节推理深度——默认为xhigh,也可以降低到medium或low。

阿里巴巴推荐的采样参数
模式temperaturetop_ptop_kpresence_penalty
思考(默认)1.00.95200.0
Instruct(不启用思考)0.70.80201.5
本地短任务
将 reasoning_effort 降至 low 或 medium:对于改写或提取任务,长时间推理不会改变质量,却会让等待时间变为原来的三倍。
智能体任务
保持 xhigh 设置。阿里巴巴指出,降低推理投入会导致分析不足,进而需要重试——失败会抵消每轮节省带来的收益。
回复陷入重复循环
提升 presence_penalty(范围在0到2之间)。当超过1.5时,模型开始混合语言。
输出混入推理过程
如果您的应用显示了思考标记,说明它没有将 reasoning_content 与最终内容分开。针对这种使用场景,请关闭思考功能,而不是事后过滤文本。

#分析一张图片或一份文档

视觉原生支持:屏幕截图、表格照片、技术图纸、扫描页。通过命令行,只需在提示中提供文件路径;通过API,图像将以base64编码形式填入Ollama字段。

命令行视觉功能
ollama run qwen3.8:27b
>>> Décris ce schéma et liste les valeurs lisibles ./schema.png
!
在投入生产前,先测试视觉功能
发布后不久,多模态处理流程中的解析器就得到了一次修复。如果模型的回答忽略图像或描述了其他内容,请先更新 Ollama,再进一步排查——并在规模化投入使用前,用您自己的十来份文档进行验证。

#公布的分数有多大参考价值

据称,相较于上一代同等规模的 Qwen 3.6-27B,性能提升显著——尤其是在智能体编程和计算机操作方面。以下是阿里巴巴公布的数据,请注意,这些数据尚未经过独立复现。

Qwen3.8-27B 对比 Qwen3.6-27B —— 阿里巴巴(2026年8月)公布的成绩
测试Qwen3.8-27BQwen3.6-27B
Terminal Bench 2.1(智能体编程)73,063,4
SWE-bench Pro61,753,5
LiveCodeBench v690,383,9
IFBench(指令跟随)79,569,1
GPQA Diamond(科学领域)89,287,8
OSWorld-Verified(电脑操作)84,363,9
MathVision(视觉数学)90,085,1
OmniDocBench 1.5(文档)91,189,4

对于本地使用,可以得出的结论是:进步主要体现在耗时较长、需要使用工具的任务上——操作终端、修复代码仓库、连续完成多个步骤而不偏离目标。在简单对话或摘要任务中,与上一代模型的差距会远没有这些数字看起来那么明显。

#是否该停止使用 Qwen 3.6、Gemma 4 或 gpt-oss?

您目前使用的是 Qwen 3.6-27B
是的,值得更新:内存占用相同,仍采用相同的宽松许可证,代码和智能体能力都有明显提升。在验证您的提示词期间,请保留旧标签,因为输出风格会发生变化。
您正在使用 Gemma 4 26B
Qwen 3.8 在代码和智能体任务方面仍有优势;许可证方面,两者如今均采用 Apache 2.0,Gemma 已于 2026 年 4 月改用宽松许可证。Gemma 4(MoE 26B-A4B,多模态)在法语对话中通常仍更自然,启动也更快。
您正在使用 gpt-oss-20b
两种设计思路:gpt-oss 更轻量、速度更快;Qwen 3.8 能理解图像,支持长得多的上下文,面向长时间任务。请根据可用显存选择。
您的主要目的是编程
采用 MoE 架构、拥有 30B 参数的代码专用模型在自动补全方面仍然更快。当智能体需要读取、规划并修改多个文件时,选择 Qwen 3.8 27B 就有其理由。
您的显存少于 24 GB
不要勉强运行。一个采用 Q4 量化的 12–14B 模型,会比需要将部分计算转移到 CPU 的 27B 模型带来更好的体验。

#故障排除

执行 pull 时出现“model not found”
Ollama 版本过旧,无法识别这个仓库,或者标签拼写有误——正确写法是“qwen3.8:27b”,中间是点号,不是连字符。请更新 Ollama 后重试。
加载时出现架构错误
原因相同:只有较新版本的引擎才支持 Qwen 3.8 的混合层。
生成速度极慢(低于 5 个 token/秒)
模型超出显存。请使用 ollama ps 检查:若显存占用未达到 100%,请降低 num_ctx,关闭其他 GPU 应用,或切换到更小的模型。
忽略文档开头的回复
上下文静默截断。请将num_ctx设置为与实际输入相匹配的值,或对文档进行分段处理。
模型「思考」没有尽头
reasoning_effort 的设置对这项任务来说过高。请将其调低至 medium 或 low,或对简单任务关闭思考。
图像被忽略
Ollama 进程必须能够访问该文件路径,视觉解析器也要求使用最新版本。在认定是模型的问题之前,请先用一张简单的本地图片进行测试。
磁盘空间不足
考虑到 blob 文件和缓存,安装时请预留标示大小两倍的磁盘空间。因磁盘已满而中断的拉取会留下文件片段:先执行 ollama rm,再重新拉取。
常见问题
运行 Qwen 3.8 27B 需要多少 VRAM?+
默认版本 Q4_K_M 需要 24 GB VRAM,模型文件大小为 18 GB,再加上 KV 缓存。Q8 版本需 40 GB,BF16 版本需 56 GB。在 Mac 上,至少需要 32 GB 统一内存。
如何在本地安装 Qwen 3.8 27B?+
安装或更新 Ollama,然后运行 « ollama pull qwen3.8:27b » 和 « ollama run qwen3.8:27b »。下载大小为18 GB。在搭载 Apple 芯片的Mac上,建议使用qwen3.8:27b-mlx标签,该版本针对Metal进行了优化。
Qwen 3.8 27B 是否免费且可在企业环境中使用?+
是的。权重采用Apache 2.0许可证发布,允许商业使用、修改和分发,无用户数量限制,也无使用限制条款。这是开放模型中最为宽松的许可证之一。
Qwen 3.8 27B 与 Qwen 3.8-Max 有何区别?+
Qwen 3.8-Max 是一个约含 24,000 亿参数的专有混合专家(Mixture-of-Experts)模型,只能通过 API 访问。Qwen3.8-27B 是同一代的稠密型开放权重版本:两者中只有这个版本能在您的机器上运行。
可以在 16 GB VRAM 的情况下运行 Qwen 3.8 27B 吗?+
技术上可行,但模型的一部分会转由CPU运行,吞吐量通常会降至每秒5个token以下。在16 GB显存下,拥有120亿至140亿参数的模型能提供好得多的使用体验。
Qwen 3.8 27B 是否优于 Qwen 3.6 27B?+
根据阿里巴巴公布的数据,是的,在智能体编程(Terminal Bench 2.1 上为 73.0 对比 63.4)和计算机操作(OSWorld-Verified 上为 84.3 对比 63.9)方面明显更强。这些分数尚未得到独立复现,而在对话用途上,差距没有那么明显。
能否关闭Qwen 3.8的思考模式?+
是的。思考模式默认启用,但可以针对每次请求单独关闭,思考深度可通过 reasoning_effort 参数(xhigh、medium 或 low)调节。在直接模式下,推荐设置为 temperature 0.7 和 top_p 0.80。
本地能否支持百万 token 的上下文?+
通过 Ollama 不行。原生上下文长度为 262,144 个 token,扩展至一百万个 token 需要使用 YaRN 配置,而只有 vLLM、SGLang 和 TokenSpeed 支持该配置。实际使用时,在配备 24 GB 显存的显卡上,将上下文窗口设为 16,000 至 64,000 个 token 才是现实可行的选择。

#深入了解

本指南假设您的 Ollama 安装已能正常运行,并且您已明确选择了量化方案。以下页面可补充这一主题:

安装 Ollama
如果尚未安装运行引擎,这是在 Windows、macOS 或 Linux 上使用它的前提步骤;此外,还需要更新引擎,这对于使用 Qwen 3.8 必不可少。
选择量化方案
帮助您在充分了解的基础上权衡 Q4、Q8 和 BF16:各个精度档位需要多少内存,又能带来怎样的质量提升。
Qwen 3.8:开放权重模型的时间线
通过 API 提供的 Max 与开放权重的 27B 模型为何会被混淆,以及究竟在何时公布了哪些内容。
24 GB 显存适合哪个 LLM
如果您仍在 Qwen 3.8 27B 和更轻量的替代方案之间犹豫,可查看这份能装入 24 GB 显卡的模型对比。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。