进阶 12 分钟GPU

在Intel Arc显卡(B580、A770)上本地运行LLM,使用Ollama和 IPEX-LLM

在 Intel Arc GPU 上运行本地大语言模型(LLM)并非易事:整个生态系统是围绕 CUDA 设计的。但借助 IPEX-LLM 及其 SYCL 后端,Intel Arc 与 Ollama 的组合变得切实可用,而 A770 16 GB 或 B580 12 GB 在每欧元可获得的显存容量方面很难被超越。本指南将介绍如何安装整套软件环境、实际能达到多少 tokens/sec,以及真正的局限在哪里。

您正在挑选电脑吗? 按预算推荐 →

作者: Thomas P.·更新于 2026-08-27·已在 Windows、macOS 和 Linux 上测试
推荐硬件

本地 AI 的高性价比之选: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).

迷你 PC 是一台完整的机器:请检查可用内存和引擎兼容性。它不能替代 macOS/MLX 或 CUDA。

为什么选择它?我们的完整资料: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →

按预算比较所有选项,从 800 到 3 500 欧元 →

预算有限: RTX 5060 · 大型模型: RTX 5090 · Mac Studio.

移动场景: 本地 AI 选哪款笔记本电脑 →

联盟链接——您无需承担额外费用,但我们可能获得佣金。作为 Amazon 合作伙伴,哪个LLM会从符合条件的购买中获益。

#为何选择Intel Arc用于本地AI?

在 2026 年,决定您能运行什么模型的硬件支出项是显存。而 Intel Arc 恰恰在这方面很有竞争力:Arc A770 配备 16GB GDDR6 显存,二手市场上经常能以低于 300 欧元的价格买到;新款 Arc B580(Battlemage 架构)则提供 12GB 显存,首发价格约为 250 欧元。在这个价位,没有任何全新的 NVIDIA 显卡能提供这么多显存。

因此,意义很简单:显存决定了无需将部分计算转移到 CPU 就能加载多大的模型。配备 16 GB 显存时,Q4_K_M 量化的 Qwen 3.5 9B 或 Granite 4.2 8B 都能轻松装入显存,Q4 量化的 Gemma 4 12B 也完全可以运行。需要妥协的是软件方面:Intel 没有 CUDA,必须使用其自身的 oneAPI/SYCL 软件栈和 IPEX-LLM 库。

i
显存与模型大小
Q4_K_M 快速参考:7B 模型约占用 5 GB,14B 模型约占用 9 GB,32B 模型约占用 19 GB。A770 的 16 GB 显存可从容容纳最高 14B 的模型;B580 的 12 GB 显存容纳 7B–8B 模型很宽裕,也能容纳 14B 模型,只是空间略显紧张。

#B580 对比 A770:该选哪张显卡

这两张显卡的定位并不完全相同。B580 更新、能效更高,当前驱动对它的支持也更好,但显存最多只有 12 GB。A770 较旧(Alchemist,2022 年),功耗也更高,但其 16 GB 显存可以容纳更大的模型或更长的上下文。

Arc B580 (Battlemage)
12 GB GDDR6,全新约 250 欧元。效率更高,驱动更成熟。如果您主要希望快速运行 7B–8B 模型,这是合适的选择。
Arc A770 (Alchemist)
16 GB GDDR6,二手价格通常低于 300 欧元。更多显存可支持 14B 模型和更长的上下文,代价是更高的功耗。
Arc A750 / B570
8 GB / 10 GB:勉强能运行 Q4 量化的 7B 模型来应急,但显存余量很快就会用尽。仅适合预算有限的情况。
→
决定性标准
如果您犹豫,应优先考虑 VRAM 而非型号名称:16 GB(A770)在扩展至 14B 模型和 RAG 方面比 12 GB 的 B580 有更大余量,尽管后者硬件更现代。

#硬件要求和驱动程序

安装任何东西之前,请先确保基础环境配置妥当。最重要的是 Resizable BAR(ReBAR):对于 Arc GPU,这项功能是必需的。没有它,性能会大幅下降,部分加载操作也会失败。

  1. 01
    启用Resizable BAR
    在主板的BIOS/UEFI中,启用「Resizable BAR」(以及「Above 4G Decoding」)。这是确保Arc正常工作的必要条件。
  2. 02
    更新GPU驱动程序
    在 Windows 系统上,请安装最新的 Intel Arc 驱动程序(Intel Arc Control)。在 Linux 系统上,请使用较新的内核(6.2+),并搭配 i915/xe 驱动和 Intel 计算运行时(intel-opencl-icd、level-zero)。
  3. 03
    确认显卡是否被识别
    在Linux系统中,执行clinfo或sycl-ls命令应能将您的Arc GPU识别为Level Zero设备。这证明oneAPI层可正常看到该显卡。
终端 — 检查显卡(Linux)
# Lister les périphériques SYCL visibles par oneAPI
sycl-ls

# Sortie attendue : une ligne [level_zero:gpu] ... Intel(R) Arc(TM) ...
# Si le GPU n'apparaît pas, le compute runtime n'est pas installé.
!
必须启用 Resizable BAR
这是 Arc 上性能不佳的第一大原因。如果您的 tokens/sec 低得离谱,或者模型拒绝加载到 GPU 上,请在检查其他事项之前,先在 BIOS 中检查 ReBAR。

#安装 IPEX-LLM 和 SYCL 后端

IPEX-LLM 是英特尔用于优化其 GPU 上 LLM 推理的库。它基于 oneAPI 和 llama.cpp 的 SYCL 后端,并提供为 Arc GPU 预编译的 Ollama 版本。应使用这个 Ollama 的“IPEX-LLM”版本,而不是标准 Ollama 二进制程序,后者仅支持 CUDA/ROCm/Metal。

最简单的方法是使用 Python 包 ipex-llm[cpp],它会安装 init-ollama 命令,用于生成链接到 Intel 后端的 Ollama 二进制文件。请创建专用环境,以免破坏现有环境。

终端 — 安装 IPEX-LLM(conda/Linux)
# Environnement isolé
conda create -n ipex-llm python=3.11 -y
conda activate ipex-llm

# Installer IPEX-LLM avec le backend llama.cpp/Ollama
pip install --pre --upgrade ipex-llm[cpp]

# Générer les binaires Ollama optimisés Intel dans le dossier courant
mkdir ollama-arc && cd ollama-arc
init-ollama

在 Windows 上,Intel 还提供开箱即用的“Ollama 便携版”压缩包:解压后直接运行 start-ollama.bat,无需安装 Python。这是进行测试最快捷的方式。

i
oneAPI 已内置
近期版本的 ipex-llm[cpp] 软件包已包含所需的 oneAPI 依赖项。对于基本的 Ollama 使用,您通常不再需要单独安装 oneAPI Base Toolkit,也不再需要通过 source 加载 setvars.sh。

#在 Arc 上启动 Ollama

生成二进制文件后,通常像往常一样启动 Ollama 服务——它监听在 http://localhost:11434 上——但需设置一些环境变量,指示 SYCL 使用 GPU 并将所有计算任务全部卸载到 GPU 上。

终端 — 启动服务器
# Sélectionner le GPU Arc via Level Zero
export ONEAPI_DEVICE_SELECTOR=level_zero:0
# Cache de compilation SYCL (accélère les lancements suivants)
export SYCL_CACHE_PERSISTENT=1
# Forcer l'offload de toutes les couches sur le GPU
export OLLAMA_NUM_GPU=999

# Démarrer le daemon (depuis le dossier ollama-arc)
./ollama serve

在第二个终端中下载一个模型并开始对话。先用小模型验证整个流程,再加载 12B 模型。

终端 — 首个模型
# Télécharger et lancer un modèle 8-9B en Q4_K_M
./ollama run qwen3.5:9b

# ou un modèle plus léger pour un premier test
./ollama run granite4.2:3b

首次提交提示词时,编译 SYCL 内核会带来轻微延迟;借助 SYCL_CACHE_PERSISTENT,后续启动会快得多。要确认 GPU 是否正在参与计算,请使用 Intel 专用工具监控其使用率。

终端——监控GPU(Linux)
# Occupation et mémoire du GPU Intel en temps réel
sudo xpu-smi dump -d 0 -m 0,1,2

# Alternative légère si xpu-smi n'est pas installé
intel_gpu_top
→
接入用户界面
守护进程通过 11434 端口提供标准 Ollama API。因此,您可以像在配备 NVIDIA 显卡的机器上一样,将 Open WebUI 或 LM Studio 连接到它——客户端无需任何改动。

#在B580和A770上测得的tokens/秒

以下数字是基于常见模型在 Q4_K_M、短上下文、纯生成(不含加载时间)场景下观测到的近似值。具体数值会因驱动程序、IPEX-LLM 版本及散热方式而异,但能真实反映实际性能表现。

Granite 4.2 3B (Q4) — B580
≈ 45-55 tok/s。聊天和处理快速任务时都很流畅。
Granite 4.2 8B (Q4) — B580
≈ 25–32 token/秒。作为日常助手使用很顺畅。
Qwen 3.5 9B (Q4) — A770
约每秒 20–28 个 token。在小模型上比 B580 慢一档,但仍然很好用,而且还支持视觉功能。
Gemma 4 12B (Q4) — A770
≈ 11-16 token/秒。16 GB 显存是关键:多模态模型可以完全装入显存,无需将部分负载转移至 CPU。
Gemma 4 12B (Q4) — B580
≈ 9–13 token/秒,视上下文长度而定,显存占用接近 12 GB 的上限;较长的上下文可能迫使部分模型转移到系统内存中运行,导致吞吐量骤降。

结论很明确:运行 8B–9B 模型时,这两张显卡都能提供流畅的实时体验,通常与 RTX 3060 12 GB 相当。运行 12B 模型时,A770 凭借其显存保持优势。作为参考,RTX 3060 12 GB 仍是 NVIDIA 入门级显卡的标杆——Arc 竞争的是这一档次,而不是 RTX 4080。

i
提示词处理
在 Arc 上,薄弱环节往往是提示词处理速度(prompt eval),生成速度的问题相对较小。对于使用长上下文的 RAG,在显存容量相同的情况下,初始“思考”时间预计会比 NVIDIA 更长。

#与 NVIDIA 相比的局限

坦率地说,Arc 是预算有限时的明智选择,但要替代 CUDA 显卡,仍需有所取舍。以下是购买前需要了解的几点。

软件生态系统
您依赖 IPEX-LLM 和 SYCL 后端。部分近期项目(新运行时、llama.cpp 功能)相比 CUDA 延迟发布。标准版 Ollama 不足以满足需求。
支持的量化方式
支持常规 GGUF 格式(Q4_K_M、Q5_K_M、Q8_0、FP16)。不过,一些非常规或很新的量化方式可能尚未得到优化,甚至可能转而使用 CPU 计算。
微调与高级框架
可以通过 IPEX-LLM 进行训练或使用 LoRA,但相关文档和工具支持远不如 NVIDIA 完善。要认真开展微调工作,CUDA 仍是最佳途径。
驱动程序成熟度
情况正在迅速改善,但驱动程序或 IPEX-LLM 版本可能引发回归问题。请在盲目更新前锁定一个已知可用的版本。
!
Arc不适合哪些用户
如果您追求最高兼容性,希望“一次就能运行成功”,需要进行高强度微调,或运行最新的研究项目,请继续选择NVIDIA。如果您愿意花些工夫调试以换取价格低廉的显存,Arc会是值得的选择。

#常见故障排除

模型在 CPU 上运行,而非 GPU
请检查ONEAPI_DEVICE_SELECTOR=level_zero:0和OLLAMA_NUM_GPU=999,并确保sycl-ls能正确列出显卡。禁用的ReBAR也可能强制切换至CPU运行。
GPU 已在工作,但吞吐量仍极低
几乎总是因为 BIOS 中未启用 Resizable BAR。遇到这种情况,应首先检查这一项。
显存看似足够,却出现“out of memory”错误
上下文(num_ctx)会占用更多内存。请减小上下文窗口,或切换到更轻量的量化(例如 Q4 而非 Q5/Q8)。
首个提示响应极慢随后恢复正常
正在编译 SYCL 内核。请确保已导出 SYCL_CACHE_PERSISTENT=1,以免每次启动都再次承担这一开销。
GPU未出现在sycl-ls中
计算运行时缺失:请安装intel-opencl-icd和level-zero(Linux),或重新安装Arc驱动程序(Windows)

#深入了解

Ollama 在您的 Arc 上正常运行后,后续操作就与其他机器相同了。本网站的以下指南可作为本指南的延伸:

选择量化方案(Q4、Q5、Q8、FP16)
在显存有限的 Arc 显卡上,这一点至关重要:理解质量与内存占用之间的权衡,充分利用您的 12 或 16 GB 显存。
为本地 AI 选择 GPU
将Arc与RTX和Mac进行对比,以确认这是否是符合您使用需求的合适选择。
安装 Ollama:Windows、macOS 和 Linux
介绍基础安装方法以及如何使用 11434 端口上的 API,有助于将 Open WebUI 接入由您的 Arc 显卡驱动的后端。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。