进阶 13 分钟NPU

Ryzen AI 9 HX:50 TOPS 的 NPU 对 LLM 真的有用吗? ?

Ryzen AI 9 HX 370 以其 XDNA 2 NPU 的 50 TOPS 算力为傲——AMD 的营销团队很喜欢拿这个数字与 Intel 和 Apple 比较。对于想在本地运行 LLM 的用户来说,真正的问题是:这个 NPU 到底有没有用,还是仍然得依靠集成的 Radeon 890M GPU?本指南将如实测试用于 LLM 的 Ryzen AI 技术栈(LM Studio Ryzen AI、Lemonade SDK),与纯 CPU 运行和 iGPU 运行进行比较,并给出结论——不加粉饰。

您正在挑选电脑吗? 按预算推荐 →

作者: Mohamed Meguedmi·更新于 2026-08-27·已在 Windows、macOS 和 Linux 上测试
推荐硬件

本地 AI 的高性价比之选: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).

迷你 PC 是一台完整的机器:请检查可用内存和引擎兼容性。它不能替代 macOS/MLX 或 CUDA。

为什么选择它?我们的完整资料: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →

按预算比较所有选项,从 800 到 3 500 欧元 →

预算有限: RTX 5060 · 大型模型: RTX 5090 · Mac Studio.

移动场景: 本地 AI 选哪款笔记本电脑 →

联盟链接 — 您无需承担额外费用,我们可能获得佣金。作为 Amazon 合作伙伴,哪个LLM 会从符合条件的购买中获利。

#为什么要用 NPU 运行本地 LLM?

NPU(神经处理单元)是一种专门加速推理中常见的 INT8 和 INT4 矩阵运算的硬件。在 Ryzen AI 9 HX 370 上,XDNA 2 模块可提供最高 50 TOPS 的 INT8 算力,功耗约为 2 W。乍看之下,这种权衡对于便携使用而言无可匹敌——LLM 可以运行,而不必启动风扇,也不会在 40 分钟内耗尽电池。

关键词Ryzen AI 9 HX LLM NPU在AMD的演示中频繁出现,但实际上软件生态仍处于早期阶段。大多数LLM框架(如llama.cpp、Ollama、vLLM)完全忽略了NPU,而是将计算全部交由CPU的AVX-512或通过Vulkan/ROCm利用集成GPU完成。要使用XDNA 2,必须依赖AMD或社区编译的专用运行时。

i
XDNA 2 实际能做什么
NPU 专为小模型在短上下文下的 INT8/INT4 推理而设计。在训练、微调或运行 32B 模型时,它不能替代 GPU。可以把它理解为“在后台回答问题的轻量级 3B–8B 助手”,而不是“AI 工作站”。

#XDNA 2 的实际表现:芯片本身能说明什么

集成在 Strix Point(Ryzen AI 300 这一代)中的 XDNA 2 架构,相比 XDNA 1 将 TOPS 翻倍(16 → 50 TOPS),并引入了对 FP8 和 FP16 块浮点格式的原生支持。这是 AMD 首款能较好运行 LLM 的 NPU,但有两项重大限制。

内存带宽
NPU 与其他组件共享系统内存(Strix Point 机型使用 LPDDR5X-7500 或 8000)。其带宽约为 120–128 GB/s,由 CPU、GPU 和操作系统共享。NPU 永远无法充分发挥其理论计算吞吐量。
必须量化
AMD 官方处理流程要求使用经过优化的 ONNX 格式,模型需量化为 INT4 或 INT8。常规 GGUF Q4_K_M 模型无法原样运行,必须先转换。
ONNX 预编译
每个模型都必须针对 XDNA 2 进行编译(子图分配给 NPU,其余部分交给 CPU)。这一步会让 95% 的用户望而却步。
不支持多用户
NPU 只能供一个进程使用。如果一个 LLM 占用了它,其他 Windows AI 功能(Studio Effects,以及您若使用的话,Recall)就无法同时使用该 NPU。

#硬件和软件先决条件

CPU
Ryzen AI 9 HX 370、HX 365 或 HX PRO 370(Strix Point,代号 Krackan);Ryzen AI 7/5 虽使用性能较低的NPU,但软件栈相同。
RAM
要使用得舒适,至少需要 32 GB LPDDR5X 内存。如果还想同时尝试在 iGPU 上运行 14B 模型,则需要 64 GB。
OS
Windows 11 24H2 或更高版本。Linux 已有 XDNA NPU 驱动程序(自内核 6.11 起已纳入上游),但用户侧工具仍严重滞后。
NPU 驱动程序
AMD Ryzen AI软件1.3或更高版本(单独从amd.com下载,不包含在Adrenalin驱动程序中)
存储
为预编译的 ONNX 模型预留约 20 GB 存储空间(其体积比对应的 GGUF 模型更大)。
!
首先检查 NPU
在设备管理器 → 神经网络处理器中,应能看到“AMD Ryzen AI NPU”,且没有黄色三角警告标志。否则,说明您使用的是通用芯片组驱动:请安装专用的 AMD Ryzen AI Software 软件包。

#1. LM Studio Ryzen AI:最简单的路径

AMD 提供了一个已针对 XDNA 2 预先配置好的 LM Studio 官方分支。对于希望不接触 Python 或 ONNX Runtime 就能进行测试的用户,这是推荐的方式。

  1. 01
    下载二进制文件
    访问 amd.com/lmstudio(官方页面「LM Studio for Ryzen AI」)。Windows 版本二进制文件由 AMD 签名。
  2. 02
    常规安装
    安装程序将 LM Studio 安装到 Program Files 并自动配置 ONNX RyzenAI Execution Provider 运行时。
  3. 03
    选择针对 NPU 优化的模型
    在 Discover 选项卡中,按“Ryzen AI”标签筛选。您会找到已针对 XDNA 2 预编译的 Qwen 3.5 9B、Granite 4.2 3B 和 Granite 4.2 8B 模型(后缀为 -hybrid)。
  4. 04
    加载并测试
    加载时,LM Studio 会显示运行时选择器:GPU、CPU 或「Ryzen AI Hybrid」(NPU + iGPU)。请选择 Hybrid,以利用 NPU。
  5. 05
    确认 NPU 正在参与运算
    打开任务管理器 → 性能选项卡 → NPU。在生成过程中,NPU 使用率应达到 60% 至 95%。若始终为 0,则运行时已降级至 CPU。
通过命令行检查 NPU
# Lister les périphériques de calcul disponibles
Get-PnpDevice -Class "ComputeAccelerator" | Format-Table FriendlyName, Status

# Doit afficher : AMD Ryzen AI NPU - OK

#2. Lemonade SDK:探索 LM Studio 之外的更多可能

Lemonade SDK 是 AMD 为开发者提供的官方工具。其主要目标有两个:(1) 将您自有的 GGUF/HF 模型编译为混合 ONNX 格式;(2) 提供兼容 OpenAI 的 API,可在 Open WebUI、Continue.dev 等平台调用。

安装Lemonade SDK
# Python 3.11 recommandé
python -m venv .venv
.\.venv\Scripts\Activate.ps1

# Installation du SDK
pip install lemonade-sdk[npu]

# Test : lister les modèles déjà disponibles
lemonade list
启动兼容OpenAI的服务器
# Charge Qwen 3.5 9B précompilé en mode hybride NPU+iGPU
lemonade serve --model qwen3.5-9b-instruct-hybrid --port 8000

# L'endpoint http://localhost:8000/v1/chat/completions est désormais utilisable
# par toute app qui parle OpenAI (Open WebUI, Continue, etc.)
→
编译自定义模型
对于您自己的模型,命令 `lemonade onnx-export --source granite-4.2-8b-instruct --target hybrid` 会生成一个预编译的 ONNX 文件夹。首次编译需耗时 15-30 分钟,且 8B 模型在 INT4 情况下约需 8-12 GB 的磁盘空间。

#3. 转向Radeon 890M:通常是最佳选择

Ryzen AI 9 HX 370 还集成了 Radeon 890M 核显(RDNA 3.5,16 个计算单元)。在标准版 LM Studio 或 Ollama 中,这款核显可通过 Vulkan 使用,单论吞吐量有时能超过 NPU。以下是使用方法。

在 Radeon 890M 上运行 Ollama(Vulkan)
# Installation Ollama Windows (build avec Vulkan)
winget install Ollama.Ollama

# Forcer le backend Vulkan
$env:OLLAMA_VULKAN = "1"

# Lancer un Qwen 3.5 9B
ollama serve
ollama run qwen3.5:9b
动态VRAM分配
Radeon 890M 共享系统内存。在 UEFI BIOS 中查找 « UMA Frame Buffer Size »,并将值设置为至少 8 GB(若可能,则设置为 16 GB),在进行任何 LLM 测试前完成此操作。
驱动程序
需使用 Adrenalin 24.10 或更高版本,以启用优化的 Vulkan 计算路径。Lenovo/Asus 的 OEM 驱动程序通常滞后两个版本。
ROCm 在 Linux 上运行
ROCm 6.3+ 自2026年4月起正式支持Strix Point。在Ubuntu 24.04上可运行,但iGPU仍受限于共享内存带宽。

#基准测试:NPU 对比 iGPU 对比 CPU

在一台华硕 Zenbook S 14(Ryzen AI 9 HX 370,32 GB LPDDR5X-7500,Windows 11 24H2,AMD Ryzen AI Software 1.3,Adrenalin 24.10.1)上测得的大致数值。使用短提示词(约 50 个 token),生成 256 个 token,温度为 0.7。取 5 次运行的平均值。

Qwen 3.5 9B — CPU AVX-512
4.1 token/s · 芯片封装功耗 28 W · 可听见风扇声
Qwen 3.5 9B — Radeon 890M (Vulkan)
9.8 tok/s · 芯片封装功耗 35 W · 风扇持续高速运转
Qwen 3.5 9B 混合运行——NPU + iGPU(LM Studio Ryzen AI)
11.2 tok/s · 芯片封装功耗 18 W · 风扇噪声较低
Granite 4.2 3B — 纯 NPU
24 tok/s · 芯片封装功耗9 W · 风扇关闭
Granite 4.2 8B — NPU + iGPU
13.5 tok/s · 芯片封装功耗 19 W · 风扇噪声较低
Gemma 4 12B — Radeon 890M (Vulkan)
4.2 tok/s · 38 W · 单独NPU无法承载
i
这些数据表明
NPU 在绝对速度上并非最快——iGPU 在 7B-8B 模型上可能与其相当。但在相同吞吐量下,NPU 的功耗低 2 倍,发热量也低 2 倍。这才是其真正价值:在电池供电下维持 3 小时的 LLM 会话而不发生热降频。

#NPU 表现出色的应用场景

随时可用的辅助聊天机器人
一台 Granite 4.2 3B 或 Qwen 3.5 4B 在 NPU 上功耗约为 5 瓦,可全天 24 小时运行,对电池影响极小。适用于生产力类应用的集成。
邮件/文档自动摘要
短时批处理任务,上下文长度为 4–8k token,模型规模为 3B–8B。非常适合 NPU:风扇关闭,在您工作时于后台静默处理。
实时语音转文本 + 摘要
Whisper(在集成显卡上)+ Granite 4.2 8B(在NPU上)串联运行——之所以可行,是因为这两个模块是相互独立的。
长时间使用飞行模式
在电池供电下,使用NPU加集成GPU可实现4至5小时的LLM活跃使用时间,而纯CPU加集成GPU的配置仅能维持1小时30分钟。
→
合理搭配使用NPU和iGPU
LM Studio Ryzen AI 的“Hybrid”模式会自动分配各层:Attention 模块放在 NPU 上(稠密 INT4),FFN 放在 iGPU 上(能更好地利用内存带宽)。性能与功耗之间的最佳平衡来自这种模式,而非单独使用 NPU。

#需了解的陷阱与限制

上下文受限
大多数预编译的 AMD 模型,其上下文长度上限为 4096 个 token。要支持 32k 或更长的上下文,您需要重新编译——而且内存消耗会大幅增加。
仅靠 NPU 无法运行超过 8B 的模型
参数规模超过 8B 时,即使采用 INT4 量化,NPU 的带宽也不足。超过 13B 时,必然由 iGPU 接手。
不可用模型
Qwen 3.5、DeepSeek、Gemma 4 并非都有官方预编译版本。如果您打算购买一套配置来运行某个特定模型,请先查看 Ryzen AI 模型库。
导致功能异常的 Windows 更新
部分 24H2 累积更新曾暂时禁用 NPU 的设备枚举。请保持 AMD Ryzen AI Software 软件包为最新版本,并在每次累积更新后检查设备管理器。
不支持微调
XDNA 2 只能进行推理。要训练模型或进行 LoRA 微调,必须使用独立 GPU。
!
NPU 无法替代专用 GPU
如果您的目标是运行 Qwen 3.6 35B、70B 模型,或进行微调,Ryzen AI 9 HX 370 并不合适。搭载 RTX 4070 / 4080 / 4090 的台式电脑仍然无可匹敌。NPU 是面向移动使用的解决方案,而非 GPU 的替代品。

#深入了解

根据您接下来的计划,可以从以下三个方向深入了解:

理解量化技术
XDNA 2 NPU 仅支持 INT4/INT8。《如何选择量化方式(Q4、Q5、Q8、FP16)》指南解释了为何 Q4_K_M 仍是 CPU/GPU 的标准,以及 INT4 在 NPU 上带来的变化。
与真实GPU配置进行对比
如果您还在考虑是否选择台式机,《如何为本地 AI 选择 GPU》指南对比了 RTX 4070、4090 和 M-Max,并根据用途给出了购买门槛。
更常规的 Ollama 配置
如果您希望在 Radeon 890M 上继续使用标准软件栈,Ollama 的 Windows 安装指南涵盖了 Vulkan 配置以及共享显存与系统内存的管理。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。