进阶 11 分钟NPU

Snapdragon X Elite:在PC上本地运行LLM ARM

搭载 Snapdragon X Elite 的 Copilot+ 电脑让 ARM 架构重新成为 Windows 领域的焦点,并带来了颇具吸引力的 AI 卖点:集成 NPU 和数小时的续航。不过,在 Snapdragon X Elite 上本地运行 LLM,与在配备 NVIDIA GPU 的 x86 电脑上运行,体验并不相同。本指南将梳理哪些功能目前确实可用、哪些仍停留在营销承诺阶段,以及如何在这些 ARM 设备上获得可用的本地助手。

您正在挑选电脑吗? 按预算推荐 →

作者: Thomas P.·更新于 2026-08-27·已在 Windows 11 上测试
推荐硬件

本地 AI 的高性价比之选: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

迷你 PC 是一台完整的机器:请检查可用内存和引擎兼容性。它不能替代 macOS/MLX 或 CUDA。

为什么选择它?我们的完整资料: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

按预算比较所有选项,从 800 到 3 500 欧元 →

预算有限: RTX 5060 · 大型模型: RTX 5090 · Mac Studio.

移动场景: 本地 AI 选哪款笔记本电脑 →

联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。

#为什么 Snapdragon X Elite 在运行本地 LLM 方面引人关注

Snapdragon X Elite 是高通推出的一款 ARM 架构系统级芯片(SoC):最多 12 个 Oryon 核心、集成 Adreno GPU、宣称算力达 45 TOPS 的 Hexagon NPU,尤其值得关注的是 CPU、GPU 和 NPU 共享的 LPDDR5X 统一内存。这种统一内存设计与 Apple Silicon 的思路相似:加载的模型可由所有计算引擎访问,无需复制,也不会受到 8 GB 或 12 GB 独立显存的限制。

另一个优势是发热表现。这些芯片是为无风扇或近乎静音的超轻薄笔记本设计的,办公使用时的续航以数十小时计。对于在后台运行的本地大语言模型——用于邮件摘要、内容改写、小型脚本等——这提供了全新的应用空间:风扇不会突然狂转,电池也不会在二十分钟内迅速耗尽。

i
本指南的定位
在 Windows ARM 电脑上流畅使用本地对话助手(3B 至 24B 模型),并不是要替代 RTX 4090。我们希望在这一特定硬件上找到质量、速度与续航之间的最佳平衡。

#真正的挑战:ARM 平台上的 Windows

首要障碍并非算力,而是软件兼容性。在ARM架构上运行的Windows 11通过Prism层实现x86/x64应用的模拟,但该模拟会带来性能损耗,且对AI应用而言,通常会阻碍对硬件加速功能的利用。针对x86编译的、包含AVX指令的二进制文件,将无法访问Adreno GPU或Hexagon NPU。

好消息:目前主流的本地AI工具均已支持原生ARM64版本。在本指南中,这一点至关重要——一个工具“可安装”并不等于它就是“原生ARM”工具。在模拟运行时,您将损失大量硬件性能优势。

Ollama
提供原生 Windows ARM64 构建版本。在 Oryon CPU 上进行推理,默认监听地址为 http://localhost:11434,与其他平台相同。
LM Studio
为搭载 Snapdragon 的 Windows 设备提供原生 ARM64 版本,内含为 ARM 编译的 llama.cpp 运行时。
llama.cpp
可原生编译为 ARM64,并利用向量指令;它是针对这些芯片优化最充分的底层引擎。
需避免
任何通过 Prism 模拟运行的 x64 版本:能够运行,但速度较慢,且无法使用专用硬件。
!
请始终检查架构
在下载页面上,请专门查找「ARM64」或「Windows on ARM」。如果唯一的选项是「Windows x64」,应用将通过模拟运行,您也将失去这台设备的主要优势。

#Hexagon NPU:神话与现实

这是误解的核心。Copilot+营销强调NPU Hexagon的45 TOPS性能,仿佛所有本地LLM都能自动受益。实际上,在2026年,通过Ollama或LM Studio启动的几乎所有LLM均运行在CPU核心上,而非NPU。

为什么?因为要利用 NPU,模型必须专门针对高通的运行时进行转换和量化(通过 QNN——Qualcomm AI Engine Direct——以及 ONNX 格式,通常使用 ONNX Runtime 的 QNN 执行提供程序)。这些并不是 llama.cpp 使用的那类 GGUF 文件。NPU 擅长处理按固定节奏运行、可预测的负载;而受内存带宽主导的自回归文本生成,并不像人们想象的那样适合它。

哪些应用会使用 NPU
通过 Qualcomm SDK / AI Hub 打包的演示和应用,使用预先转换好的 ONNX 模型(通常是小模型,或用于视觉、音频任务的模型)。
不使用 NPU 的情况
常规使用中的 Ollama、LM Studio 和 llama.cpp:它们依赖 CPU(有时也通过实验性后端使用 Adreno GPU)。
实际性能表现
在这些设备上,决定生成速度的主要是Oryon核心和LPDDR5X内存带宽,而非NPU显示的TOPS。
→
不要为了 NPU 而选择这台设备
如果您的目标是获得一个响应快速的本地聊天机器人,就应像评估任何一款配备高速内存的优秀 ARM CPU 一样来考虑。NPU 对特定应用来说是额外的加分项,并不是您日常运行 Ollama 所依赖的计算引擎。

#前置条件和检查项

在安装任何软件之前,请确认您所使用的是一台ARM架构的设备,并查看您的RAM容量——它将决定可运行模型的大小,因为内存是统一的。

PowerShell — 检查架构和内存
# Architecture du processeur (doit renvoyer ARM64)
$env:PROCESSOR_ARCHITECTURE

# Mémoire physique totale, en Go
(Get-CimInstance Win32_ComputerSystem).TotalPhysicalMemory / 1GB
OS
Windows 11 24H2或更新版本,并安装最新更新(近期版本显著改善了Prism模拟功能和ARM支持)。
RAM
要在使用 3B–9B 模型时获得良好的体验,至少需要 16 GB 内存;若要运行 20–27B 模型并为系统保留余量,则需要 32 GB 内存。
存储
请根据下载的模型数量预留 10 至 30GB 空闲空间(一个 7B Q4_K_M 模型的大小约为 5GB)。
合理预期
使用小模型时可以期待流畅的体验,8–9B 模型的体验尚可,更大的模型则需要耐心等待。吞吐速度达不到独立 GPU 的水平。

#逐步安装本地LLM

目前最简单且最可靠的方法是使用原生ARM64架构的Ollama,可选搭配图形界面。具体步骤如下。

  1. 01
    下载 Ollama ARM64
    访问 ollama.com/download 获取 Windows 安装程序。从较新版本开始,安装程序会自动检测 ARM64 架构并安装原生二进制文件。安装后请确认服务正常运行。
  2. 02
    检查服务状态
    打开终端并运行「ollama --version」。守护进程监听在 http://localhost:11434;对该URL的请求应返回「Ollama is running」。
  3. 03
    下载第一个模型
    从小规模开始,验证完整流程后再加载更重的模型。3B 模型搭配 Q4_K_M 是测试响应性的理想选择。
  4. 04
    在命令行中聊天
    启动模型并检查生成速度。如果运行流畅,就在内存仍能满足需求的前提下逐步增大模型规模(先 7B,再 14B)。
  5. 05
    添加界面(可选)
    安装 ARM64 版本的 LM Studio,以获得完整的用户界面;如果更喜欢网页界面,也可以将 Open WebUI 连接到 Ollama 的端点。
终端 — 首个模型
# Modèle léger pour valider la chaîne
ollama pull granite4.2:3b
ollama run granite4.2:3b

# Une fois validé, monter en gamme
ollama pull qwen3.5:9b
→
实测速度
在 Ollama 中,运行命令「ollama run <模型> --verbose」可查看响应末尾的每秒 token 数,这是评估本地设备上模型性能的可靠指标,而非依赖厂商宣传数据。

#推荐模型(适用于16–32 GB RAM)

由于采用统一内存,且内存与系统共享,请不要认为全部 RAM 都可供模型使用。始终为 Windows 和您的应用程序预留 4 至 6 GB。Q4_K_M 量化下的内存占用参考值与 GPU 上相同:3B 约 2 GB,9B 约 6–7 GB,24B 约 14 GB。

16 GB 内存
舒适区:3B至9B参数模型,采用Q4_K_M量化。Granite 4.2 3B适合快速响应,Qwen 3.5 9B或Granite 4.2 8B则更注重质量。一个gpt-oss 20B(约14 GB)仍可运行,但留出的余量很小。
32 GB 内存
您可以轻松运行 20–27B 规模的模型,从 gpt-oss 20B 或 Mistral Small 24B(约 14 GB,后者尤其擅长法语),到 Qwen 3.8 27B(约 18 GB,262k 上下文),均采用 Q4_K_M 量化,同时为系统留出充足的内存。32B 及以上的稠密模型可以加载,但在这款 CPU 上运行较慢;Qwen 3.6 35B-A3B(约 23 GB,3B 活跃参数)这样的 MoE 模型则明显更快。
量化
在这里,Q4_K_M 是质量、模型大小和速度之间的最佳折中。只有在质量优先且内存足够时,才改用 Q5_K_M;避免使用 FP16,它在这类机器上会占用过多资源,没有必要。
理想应用场景
改写、摘要、翻译、轻量级代码辅助、离线问答——对于这些任务,一个性能良好的 9B 至 24B 模型就绰绰有余。
i
量化设置的正确做法
在运行速度取决于 CPU 和内存带宽的机器上,采用 Q4_K_M 量化的较小模型,往往比运行缓慢的较大模型带来更好的体验。优先考虑流畅性。

#续航与安静运行:真正的优势

这正是 Snapdragon X Elite 真正脱颖而出的地方。配备 RTX 的 x86 游戏本在 AI 负载下几分钟就会耗尽电池,风扇也会高速运转、噪声大作;相比之下,这些 ARM 机器在生成文本时仍能保持凉爽、安静,无论是否接通电源。对于移动办公——在火车、咖啡馆或会议室中工作——这是一种本质上的变化,而不仅是程度上的提升。

在原始速度上,可预期的是正常但有限的吞吐量:3B模型每秒几十个token,24B密集模型则降至每秒几个token。小模型可满足流畅对话需求,大模型长文本生成则较为吃力。得益于Oryon核心的快速响应,首token的延迟仍保持合理。

静音
生成时可以避免风扇高速运转;在低 TDP 机型上,风扇往往几乎无需启动。
电池续航
使用电池供电进行推理是可行的,而独立 GPU 几乎必须接入市电。非常适合随身使用的本地助手。
热特性
长时间运行轻量 LLM 任务时,不会出现严重降频,这与被推至性能极限的 x86 超轻薄笔记本不同。
代价
吞吐量上限远低于独立 GPU:运行大模型时,使用上的便利是以每秒生成的 token 数较少为代价的。

#相较于 x86 和独立 GPU 的局限

先把这一点说清楚,以免您失望。Snapdragon X Elite 无法与配备较新 NVIDIA 显卡的 PC 相抗衡。入门级 RTX 3060 12 GB 运行 14B 模型的速度会快得多,而 RTX 4090 24 GB 则完全属于另一个性能级别。Snapdragon 的优势不在于绝对性能,而在于性能功耗比和便携性。

生态系统尚处早期
ARM64支持正在快速推进,但相比x86仍不够成熟。部分工具、扩展或GPU后端存在滞后或处于实验阶段。
不支持消费级 GPU 加速
llama.cpp的Adreno后端仍处于早期阶段;实际推理主要依赖CPU。
NPU利用率不足
如上所述,常用的 LLM 运行时目前还无法受益于这 45 TOPS 的算力。
模型大小上限
当密集参数超过二十亿时,体验会明显下降;超大规模模型仍主要依赖专用 GPU(低激活数的 MoE 模型是少数例外,表现更佳)
!
合理设定预期
如果看重运行 3B–24B LLM 时的续航和安静表现,可以购买(或使用)Snapdragon X Elite。如果您的首要目标是快速运行大型的 32B 或 70B 稠密模型,那么您需要的是独立 GPU,而不是 ARM PC。

#深入了解

将 Snapdragon X Elite 与其他采用 NPU 的方案进行比较,并掌握本地安装的基础知识,有助于更好地理解它。以下指南可帮助您进一步了解:

Ryzen AI 9 HX:50 TOPS 的 NPU 对 LLM 真的有用吗?
这是该 NPU 讨论在 x86 平台上的对应篇,提供坦诚的测试结果,与本指南的结论相互印证。
安装 Ollama:Windows、macOS 和 Linux
用于全面掌握 Ollama 守护进程及其命令,也适用于 ARM64 构建版本。
选择量化方式(Q4、Q5、Q8)
为优化质量与速度的平衡,这对以CPU为主导的设备至关重要。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。