在Intel Arc显卡(B580、A770)上本地运行LLM,使用Ollama和 IPEX-LLM
在 Intel Arc GPU 上运行本地大语言模型(LLM)并非易事:整个生态系统是围绕 CUDA 设计的。但借助 IPEX-LLM 及其 SYCL 后端,Intel Arc 与 Ollama 的组合变得切实可用,而 A770 16 GB 或 B580 12 GB 在每欧元可获得的显存容量方面很难被超越。本指南将介绍如何安装整套软件环境、实际能达到多少 tokens/sec,以及真正的局限在哪里。
您正在挑选电脑吗? 按预算推荐 →
本地 AI 的高性价比之选: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).
迷你 PC 是一台完整的机器:请检查可用内存和引擎兼容性。它不能替代 macOS/MLX 或 CUDA。
为什么选择它?我们的完整资料: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →
预算有限: RTX 5060 · 大型模型: RTX 5090 · Mac Studio.
移动场景: 本地 AI 选哪款笔记本电脑 →
联盟链接——您无需承担额外费用,但我们可能获得佣金。作为 Amazon 合作伙伴,哪个LLM会从符合条件的购买中获益。
#为何选择Intel Arc用于本地AI?
在 2026 年,决定您能运行什么模型的硬件支出项是显存。而 Intel Arc 恰恰在这方面很有竞争力:Arc A770 配备 16GB GDDR6 显存,二手市场上经常能以低于 300 欧元的价格买到;新款 Arc B580(Battlemage 架构)则提供 12GB 显存,首发价格约为 250 欧元。在这个价位,没有任何全新的 NVIDIA 显卡能提供这么多显存。
因此,意义很简单:显存决定了无需将部分计算转移到 CPU 就能加载多大的模型。配备 16 GB 显存时,Q4_K_M 量化的 Qwen 3.5 9B 或 Granite 4.2 8B 都能轻松装入显存,Q4 量化的 Gemma 4 12B 也完全可以运行。需要妥协的是软件方面:Intel 没有 CUDA,必须使用其自身的 oneAPI/SYCL 软件栈和 IPEX-LLM 库。
#B580 对比 A770:该选哪张显卡
这两张显卡的定位并不完全相同。B580 更新、能效更高,当前驱动对它的支持也更好,但显存最多只有 12 GB。A770 较旧(Alchemist,2022 年),功耗也更高,但其 16 GB 显存可以容纳更大的模型或更长的上下文。
- Arc B580 (Battlemage)
- 12 GB GDDR6,全新约 250 欧元。效率更高,驱动更成熟。如果您主要希望快速运行 7B–8B 模型,这是合适的选择。
- Arc A770 (Alchemist)
- 16 GB GDDR6,二手价格通常低于 300 欧元。更多显存可支持 14B 模型和更长的上下文,代价是更高的功耗。
- Arc A750 / B570
- 8 GB / 10 GB:勉强能运行 Q4 量化的 7B 模型来应急,但显存余量很快就会用尽。仅适合预算有限的情况。
#硬件要求和驱动程序
安装任何东西之前,请先确保基础环境配置妥当。最重要的是 Resizable BAR(ReBAR):对于 Arc GPU,这项功能是必需的。没有它,性能会大幅下降,部分加载操作也会失败。
- 01启用Resizable BAR在主板的BIOS/UEFI中,启用「Resizable BAR」(以及「Above 4G Decoding」)。这是确保Arc正常工作的必要条件。
- 02更新GPU驱动程序在 Windows 系统上,请安装最新的 Intel Arc 驱动程序(Intel Arc Control)。在 Linux 系统上,请使用较新的内核(6.2+),并搭配 i915/xe 驱动和 Intel 计算运行时(intel-opencl-icd、level-zero)。
- 03确认显卡是否被识别在Linux系统中,执行clinfo或sycl-ls命令应能将您的Arc GPU识别为Level Zero设备。这证明oneAPI层可正常看到该显卡。
#安装 IPEX-LLM 和 SYCL 后端
IPEX-LLM 是英特尔用于优化其 GPU 上 LLM 推理的库。它基于 oneAPI 和 llama.cpp 的 SYCL 后端,并提供为 Arc GPU 预编译的 Ollama 版本。应使用这个 Ollama 的“IPEX-LLM”版本,而不是标准 Ollama 二进制程序,后者仅支持 CUDA/ROCm/Metal。
最简单的方法是使用 Python 包 ipex-llm[cpp],它会安装 init-ollama 命令,用于生成链接到 Intel 后端的 Ollama 二进制文件。请创建专用环境,以免破坏现有环境。
在 Windows 上,Intel 还提供开箱即用的“Ollama 便携版”压缩包:解压后直接运行 start-ollama.bat,无需安装 Python。这是进行测试最快捷的方式。
#在 Arc 上启动 Ollama
生成二进制文件后,通常像往常一样启动 Ollama 服务——它监听在 http://localhost:11434 上——但需设置一些环境变量,指示 SYCL 使用 GPU 并将所有计算任务全部卸载到 GPU 上。
在第二个终端中下载一个模型并开始对话。先用小模型验证整个流程,再加载 12B 模型。
首次提交提示词时,编译 SYCL 内核会带来轻微延迟;借助 SYCL_CACHE_PERSISTENT,后续启动会快得多。要确认 GPU 是否正在参与计算,请使用 Intel 专用工具监控其使用率。
#在B580和A770上测得的tokens/秒
以下数字是基于常见模型在 Q4_K_M、短上下文、纯生成(不含加载时间)场景下观测到的近似值。具体数值会因驱动程序、IPEX-LLM 版本及散热方式而异,但能真实反映实际性能表现。
- Granite 4.2 3B (Q4) — B580
- ≈ 45-55 tok/s。聊天和处理快速任务时都很流畅。
- Granite 4.2 8B (Q4) — B580
- ≈ 25–32 token/秒。作为日常助手使用很顺畅。
- Qwen 3.5 9B (Q4) — A770
- 约每秒 20–28 个 token。在小模型上比 B580 慢一档,但仍然很好用,而且还支持视觉功能。
- Gemma 4 12B (Q4) — A770
- ≈ 11-16 token/秒。16 GB 显存是关键:多模态模型可以完全装入显存,无需将部分负载转移至 CPU。
- Gemma 4 12B (Q4) — B580
- ≈ 9–13 token/秒,视上下文长度而定,显存占用接近 12 GB 的上限;较长的上下文可能迫使部分模型转移到系统内存中运行,导致吞吐量骤降。
结论很明确:运行 8B–9B 模型时,这两张显卡都能提供流畅的实时体验,通常与 RTX 3060 12 GB 相当。运行 12B 模型时,A770 凭借其显存保持优势。作为参考,RTX 3060 12 GB 仍是 NVIDIA 入门级显卡的标杆——Arc 竞争的是这一档次,而不是 RTX 4080。
#与 NVIDIA 相比的局限
坦率地说,Arc 是预算有限时的明智选择,但要替代 CUDA 显卡,仍需有所取舍。以下是购买前需要了解的几点。
- 软件生态系统
- 您依赖 IPEX-LLM 和 SYCL 后端。部分近期项目(新运行时、llama.cpp 功能)相比 CUDA 延迟发布。标准版 Ollama 不足以满足需求。
- 支持的量化方式
- 支持常规 GGUF 格式(Q4_K_M、Q5_K_M、Q8_0、FP16)。不过,一些非常规或很新的量化方式可能尚未得到优化,甚至可能转而使用 CPU 计算。
- 微调与高级框架
- 可以通过 IPEX-LLM 进行训练或使用 LoRA,但相关文档和工具支持远不如 NVIDIA 完善。要认真开展微调工作,CUDA 仍是最佳途径。
- 驱动程序成熟度
- 情况正在迅速改善,但驱动程序或 IPEX-LLM 版本可能引发回归问题。请在盲目更新前锁定一个已知可用的版本。
#常见故障排除
- 模型在 CPU 上运行,而非 GPU
- 请检查ONEAPI_DEVICE_SELECTOR=level_zero:0和OLLAMA_NUM_GPU=999,并确保sycl-ls能正确列出显卡。禁用的ReBAR也可能强制切换至CPU运行。
- GPU 已在工作,但吞吐量仍极低
- 几乎总是因为 BIOS 中未启用 Resizable BAR。遇到这种情况,应首先检查这一项。
- 显存看似足够,却出现“out of memory”错误
- 上下文(num_ctx)会占用更多内存。请减小上下文窗口,或切换到更轻量的量化(例如 Q4 而非 Q5/Q8)。
- 首个提示响应极慢随后恢复正常
- 正在编译 SYCL 内核。请确保已导出 SYCL_CACHE_PERSISTENT=1,以免每次启动都再次承担这一开销。
- GPU未出现在sycl-ls中
- 计算运行时缺失:请安装intel-opencl-icd和level-zero(Linux),或重新安装Arc驱动程序(Windows)
#深入了解
Ollama 在您的 Arc 上正常运行后,后续操作就与其他机器相同了。本网站的以下指南可作为本指南的延伸:
- 选择量化方案(Q4、Q5、Q8、FP16)
- 在显存有限的 Arc 显卡上,这一点至关重要:理解质量与内存占用之间的权衡,充分利用您的 12 或 16 GB 显存。
- 为本地 AI 选择 GPU
- 将Arc与RTX和Mac进行对比,以确认这是否是符合您使用需求的合适选择。
- 安装 Ollama:Windows、macOS 和 Linux
- 介绍基础安装方法以及如何使用 11434 端口上的 API,有助于将 Open WebUI 接入由您的 Arc 显卡驱动的后端。
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。