Ryzen AI 9 HX:50 TOPS 的 NPU 对 LLM 真的有用吗? ?
Ryzen AI 9 HX 370 以其 XDNA 2 NPU 的 50 TOPS 算力为傲——AMD 的营销团队很喜欢拿这个数字与 Intel 和 Apple 比较。对于想在本地运行 LLM 的用户来说,真正的问题是:这个 NPU 到底有没有用,还是仍然得依靠集成的 Radeon 890M GPU?本指南将如实测试用于 LLM 的 Ryzen AI 技术栈(LM Studio Ryzen AI、Lemonade SDK),与纯 CPU 运行和 iGPU 运行进行比较,并给出结论——不加粉饰。
您正在挑选电脑吗? 按预算推荐 →
本地 AI 的高性价比之选: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).
迷你 PC 是一台完整的机器:请检查可用内存和引擎兼容性。它不能替代 macOS/MLX 或 CUDA。
为什么选择它?我们的完整资料: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →
预算有限: RTX 5060 · 大型模型: RTX 5090 · Mac Studio.
移动场景: 本地 AI 选哪款笔记本电脑 →
联盟链接 — 您无需承担额外费用,我们可能获得佣金。作为 Amazon 合作伙伴,哪个LLM 会从符合条件的购买中获利。
#为什么要用 NPU 运行本地 LLM?
NPU(神经处理单元)是一种专门加速推理中常见的 INT8 和 INT4 矩阵运算的硬件。在 Ryzen AI 9 HX 370 上,XDNA 2 模块可提供最高 50 TOPS 的 INT8 算力,功耗约为 2 W。乍看之下,这种权衡对于便携使用而言无可匹敌——LLM 可以运行,而不必启动风扇,也不会在 40 分钟内耗尽电池。
关键词Ryzen AI 9 HX LLM NPU在AMD的演示中频繁出现,但实际上软件生态仍处于早期阶段。大多数LLM框架(如llama.cpp、Ollama、vLLM)完全忽略了NPU,而是将计算全部交由CPU的AVX-512或通过Vulkan/ROCm利用集成GPU完成。要使用XDNA 2,必须依赖AMD或社区编译的专用运行时。
#XDNA 2 的实际表现:芯片本身能说明什么
集成在 Strix Point(Ryzen AI 300 这一代)中的 XDNA 2 架构,相比 XDNA 1 将 TOPS 翻倍(16 → 50 TOPS),并引入了对 FP8 和 FP16 块浮点格式的原生支持。这是 AMD 首款能较好运行 LLM 的 NPU,但有两项重大限制。
- 内存带宽
- NPU 与其他组件共享系统内存(Strix Point 机型使用 LPDDR5X-7500 或 8000)。其带宽约为 120–128 GB/s,由 CPU、GPU 和操作系统共享。NPU 永远无法充分发挥其理论计算吞吐量。
- 必须量化
- AMD 官方处理流程要求使用经过优化的 ONNX 格式,模型需量化为 INT4 或 INT8。常规 GGUF Q4_K_M 模型无法原样运行,必须先转换。
- ONNX 预编译
- 每个模型都必须针对 XDNA 2 进行编译(子图分配给 NPU,其余部分交给 CPU)。这一步会让 95% 的用户望而却步。
- 不支持多用户
- NPU 只能供一个进程使用。如果一个 LLM 占用了它,其他 Windows AI 功能(Studio Effects,以及您若使用的话,Recall)就无法同时使用该 NPU。
#硬件和软件先决条件
- CPU
- Ryzen AI 9 HX 370、HX 365 或 HX PRO 370(Strix Point,代号 Krackan);Ryzen AI 7/5 虽使用性能较低的NPU,但软件栈相同。
- RAM
- 要使用得舒适,至少需要 32 GB LPDDR5X 内存。如果还想同时尝试在 iGPU 上运行 14B 模型,则需要 64 GB。
- OS
- Windows 11 24H2 或更高版本。Linux 已有 XDNA NPU 驱动程序(自内核 6.11 起已纳入上游),但用户侧工具仍严重滞后。
- NPU 驱动程序
- AMD Ryzen AI软件1.3或更高版本(单独从amd.com下载,不包含在Adrenalin驱动程序中)
- 存储
- 为预编译的 ONNX 模型预留约 20 GB 存储空间(其体积比对应的 GGUF 模型更大)。
#1. LM Studio Ryzen AI:最简单的路径
AMD 提供了一个已针对 XDNA 2 预先配置好的 LM Studio 官方分支。对于希望不接触 Python 或 ONNX Runtime 就能进行测试的用户,这是推荐的方式。
- 01下载二进制文件访问 amd.com/lmstudio(官方页面「LM Studio for Ryzen AI」)。Windows 版本二进制文件由 AMD 签名。
- 02常规安装安装程序将 LM Studio 安装到 Program Files 并自动配置 ONNX RyzenAI Execution Provider 运行时。
- 03选择针对 NPU 优化的模型在 Discover 选项卡中,按“Ryzen AI”标签筛选。您会找到已针对 XDNA 2 预编译的 Qwen 3.5 9B、Granite 4.2 3B 和 Granite 4.2 8B 模型(后缀为 -hybrid)。
- 04加载并测试加载时,LM Studio 会显示运行时选择器:GPU、CPU 或「Ryzen AI Hybrid」(NPU + iGPU)。请选择 Hybrid,以利用 NPU。
- 05确认 NPU 正在参与运算打开任务管理器 → 性能选项卡 → NPU。在生成过程中,NPU 使用率应达到 60% 至 95%。若始终为 0,则运行时已降级至 CPU。
#2. Lemonade SDK:探索 LM Studio 之外的更多可能
Lemonade SDK 是 AMD 为开发者提供的官方工具。其主要目标有两个:(1) 将您自有的 GGUF/HF 模型编译为混合 ONNX 格式;(2) 提供兼容 OpenAI 的 API,可在 Open WebUI、Continue.dev 等平台调用。
#3. 转向Radeon 890M:通常是最佳选择
Ryzen AI 9 HX 370 还集成了 Radeon 890M 核显(RDNA 3.5,16 个计算单元)。在标准版 LM Studio 或 Ollama 中,这款核显可通过 Vulkan 使用,单论吞吐量有时能超过 NPU。以下是使用方法。
- 动态VRAM分配
- Radeon 890M 共享系统内存。在 UEFI BIOS 中查找 « UMA Frame Buffer Size »,并将值设置为至少 8 GB(若可能,则设置为 16 GB),在进行任何 LLM 测试前完成此操作。
- 驱动程序
- 需使用 Adrenalin 24.10 或更高版本,以启用优化的 Vulkan 计算路径。Lenovo/Asus 的 OEM 驱动程序通常滞后两个版本。
- ROCm 在 Linux 上运行
- ROCm 6.3+ 自2026年4月起正式支持Strix Point。在Ubuntu 24.04上可运行,但iGPU仍受限于共享内存带宽。
#基准测试:NPU 对比 iGPU 对比 CPU
在一台华硕 Zenbook S 14(Ryzen AI 9 HX 370,32 GB LPDDR5X-7500,Windows 11 24H2,AMD Ryzen AI Software 1.3,Adrenalin 24.10.1)上测得的大致数值。使用短提示词(约 50 个 token),生成 256 个 token,温度为 0.7。取 5 次运行的平均值。
- Qwen 3.5 9B — CPU AVX-512
- 4.1 token/s · 芯片封装功耗 28 W · 可听见风扇声
- Qwen 3.5 9B — Radeon 890M (Vulkan)
- 9.8 tok/s · 芯片封装功耗 35 W · 风扇持续高速运转
- Qwen 3.5 9B 混合运行——NPU + iGPU(LM Studio Ryzen AI)
- 11.2 tok/s · 芯片封装功耗 18 W · 风扇噪声较低
- Granite 4.2 3B — 纯 NPU
- 24 tok/s · 芯片封装功耗9 W · 风扇关闭
- Granite 4.2 8B — NPU + iGPU
- 13.5 tok/s · 芯片封装功耗 19 W · 风扇噪声较低
- Gemma 4 12B — Radeon 890M (Vulkan)
- 4.2 tok/s · 38 W · 单独NPU无法承载
#NPU 表现出色的应用场景
- 随时可用的辅助聊天机器人
- 一台 Granite 4.2 3B 或 Qwen 3.5 4B 在 NPU 上功耗约为 5 瓦,可全天 24 小时运行,对电池影响极小。适用于生产力类应用的集成。
- 邮件/文档自动摘要
- 短时批处理任务,上下文长度为 4–8k token,模型规模为 3B–8B。非常适合 NPU:风扇关闭,在您工作时于后台静默处理。
- 实时语音转文本 + 摘要
- Whisper(在集成显卡上)+ Granite 4.2 8B(在NPU上)串联运行——之所以可行,是因为这两个模块是相互独立的。
- 长时间使用飞行模式
- 在电池供电下,使用NPU加集成GPU可实现4至5小时的LLM活跃使用时间,而纯CPU加集成GPU的配置仅能维持1小时30分钟。
#需了解的陷阱与限制
- 上下文受限
- 大多数预编译的 AMD 模型,其上下文长度上限为 4096 个 token。要支持 32k 或更长的上下文,您需要重新编译——而且内存消耗会大幅增加。
- 仅靠 NPU 无法运行超过 8B 的模型
- 参数规模超过 8B 时,即使采用 INT4 量化,NPU 的带宽也不足。超过 13B 时,必然由 iGPU 接手。
- 不可用模型
- Qwen 3.5、DeepSeek、Gemma 4 并非都有官方预编译版本。如果您打算购买一套配置来运行某个特定模型,请先查看 Ryzen AI 模型库。
- 导致功能异常的 Windows 更新
- 部分 24H2 累积更新曾暂时禁用 NPU 的设备枚举。请保持 AMD Ryzen AI Software 软件包为最新版本,并在每次累积更新后检查设备管理器。
- 不支持微调
- XDNA 2 只能进行推理。要训练模型或进行 LoRA 微调,必须使用独立 GPU。
#深入了解
根据您接下来的计划,可以从以下三个方向深入了解:
- 理解量化技术
- XDNA 2 NPU 仅支持 INT4/INT8。《如何选择量化方式(Q4、Q5、Q8、FP16)》指南解释了为何 Q4_K_M 仍是 CPU/GPU 的标准,以及 INT4 在 NPU 上带来的变化。
- 与真实GPU配置进行对比
- 如果您还在考虑是否选择台式机,《如何为本地 AI 选择 GPU》指南对比了 RTX 4070、4090 和 M-Max,并根据用途给出了购买门槛。
- 更常规的 Ollama 配置
- 如果您希望在 Radeon 890M 上继续使用标准软件栈,Ollama 的 Windows 安装指南涵盖了 Vulkan 配置以及共享显存与系统内存的管理。
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。