最适合Ryzen AI 9的LLM
选择 Ryzen平台最佳LLM AI 9 并非单纯依赖算力,而是取决于可用统一内存、模型架构(密集型或专家混合)以及 iGPU RDNA 和 NPU XDNA 的实际带宽。在这些平台上,参数数量较少的 MoE 模型往往优于更小的密集型模型。本文详细说明了不同量化方式下的 VRAM 规格、预期带宽、许可证要求、基准参考以及实际应用场景,以帮助您构建基于 Ryzen AI 9 的本地推理系统。
理解Ryzen AI 9的内存限制
Ryzen AI 9(HX 和 Max)APU 采用由 CPU、iGPU 和 NPU 共享的统一内存。可分配给 GPU 的内存容量直接决定您能够加载什么模型。在配备 128 GB 统一内存的 Ryzen AI Max 395 配置上,可用于推理的内存容量远高于内存限于约 32 GB 的 HX 370。
容量配置参考(仅为大致量级,需根据您的 BIOS 分配设置确认):
- Q4 :每存储十亿个参数约需 0.55 至 0.60 GB 显存
- Q5 : 相比 Q4 约增加 20 %
- Q8 : 约为Q4的两倍
- FP16 :约为 Q4 的四倍
有关NPU/iGPU完整分配方案,请参见 Ryzen AI 9 HX 使用指南 以及 Ryzen AI Max 395 指南。有关如何选择量化方案的详细说明,请参阅我们的 Q4/Q5/Q8 指导手册.
为何优先选择激活参数量较少的 MoE 模型
在内存带宽中等的集成显卡上,参数数量是性能瓶颈 actifs 按每个 token 计算,而非总量。混合专家模型在每次前向计算中只激活部分权重。
- Qwen3.8 Flash Next 125B-A6B (125B,Q4 量化约需 72 GB,上下文长度 256000):仅约 60 亿个活跃参数,因此在配备大容量统一内存的设备上,它是实现交互式生成速度的高效候选模型。参见 Qwen3.8 Flash Next规格表 以及发布方 Hugging Face 上的 Alibaba.
- Qwen 3.5 122B-A10B (122B,约73 GB Q4,上下文长度262000,Apache 2.0):约10B激活参数,质量与速度的良好平衡。详见 Qwen 3.5 122B-A10B 模型介绍.
- Mixtral 8x22B Instruct (141B,Q4 约 82 GB,上下文长度 64000,Apache 2.0):早期的 MoE 模型,来自 Hugging Face 上的 Mistral AI,是可靠的选择。参见 Mixtral 8x22B模型详情.
这三个模型仅在高统一内存配置(如Ryzen AI Max 395,128 GB)下才能以Q4格式运行。在HX 370配备32 GB内存的情况下,本地运行时需依赖极慢的磁盘卸载,否则无法运行。
紧凑型稠密模型及替代方案
如果您的工作负载需要表现更可预测的稠密模型:
- Mistral Small 4 (119B,Q4 约需 72 GB,上下文长度 256000,Apache 2.0):采用允许商业使用的宽松许可证。参见 Mistral Small 4 模型详情页.
- Nemotron 3 Super 120B (120B,Q4 下约 72 GB,上下文长度 128000,NVIDIA Open Model License):参见 Nemotron 3 Super 技术规格表 et Hugging Face 上的 NVIDIA.
- DBRX Instruct (132B,Q4 量化下约 76 GB,上下文长度 32768,Databricks Open Model License):参见 DBRX Instruct 资料页.
- dots.llm1 Instruct (142B,~85 GB Q4,上下文长度 32768,MIT):参见 dots.llm1 模型详情页.
在显存容量相同的情况下,稠密模型每生成一个 token 所需的带宽高于激活参数较少的 MoE 模型,因此在集成 GPU 上应预期吞吐量更低。Ryzen AI 上具体的 tokens/sec 数值取决于后端和内存分配,仍需在您的机器上确认。
许可证与合规性
对于专业用途,许可证与吞吐量同样重要:
- Apache 2.0 :Qwen 3.5 122B-A10B、Mixtral 8x22B、Mistral Small 4——允许广泛的商业用途。
- MIT : dots.llm1 Instruct — 非常宽松。
- NVIDIA 开放模型许可证 : Nemotron 3 Super 120B —— 请检查署名条款。
- Databricks Open Model License : DBRX Instruct — 需仔细阅读特定条件。
针对欧盟监管要求,请参考我们的 AI法案合规指南.
推荐的推理后端
所选引擎对实际吞吐量影响显著 :
- llama.cpp :通过 Vulkan/ROCm 支持 AMD 集成显卡,采用量化的 GGUF 格式,非常适合在 Ryzen AI 上自行托管。
- Ollama :便于在本地管理 GGUF 模型的封装层。
- vLLM :侧重服务器吞吐量,适合需要提供内部 API 的场景。
请始终严格采用本地推理:使用 Ryzen AI 9 电脑的目的,是让您的数据留在这台机器上。
FAQ
问:Ryzen AI 9 HX 370(32 GB 内存)能装下哪款模型?
统一内存约为 32 GB,其中一部分预留给 GPU,因此无法容纳这里列出的模型(Q4 下需要 68 GB 或更多)。HX 370 更适合本次精选之外的较轻量模型。请参阅 目录 (按 VRAM 筛选)和 配置工具 ,以根据您的实际内存容量选择合适的配置。
Q:AMD 核显该选 MoE 模型还是稠密模型?
像 Qwen3.8 Flash Next 125B-A6B(约 60 亿个活跃参数)这样活跃参数较少的 MoE 模型,每个 token 对带宽的需求低于 120B 的稠密模型。在带宽受限的 iGPU 上,MoE 通常能在质量相当的情况下提供更高的交互吞吐量,代价是更大的总内存占用。
Q:应选择何种量化方式?
Q4 能最大限度地增加可加载的参数数量,仍是常用的平衡选择。Q5 可略微提高保真度,代价是显存占用增加约 20%。Q8 的内存占用会翻倍:应留给配备 128 GB 内存的配置使用。详情参见 Q4/Q5/Q8 指导手册.
Q:NPU 是否能加速 LLM 推理?
XDNA NPU 主要面向特定工作负载,其与开源 LLM 后端的集成仍在发展。目前实际推理任务主要由 RDNA 集成 GPU 通过 Vulkan/ROCm 承担。请在以下项目中查看最新的支持情况: llama.cpp ——具体支持情况仍需根据您使用的驱动程序确认。
Q:商业用途需要什么许可证?
优先选择Apache 2.0(Qwen 3.5 122B-A10B、Mixtral 8x22B、Mistral Small 4)或MIT(dots.llm1 Instruct)许可证,以获得最大的使用自由度。NVIDIA和Databricks许可证规定了特定条件,任何部署前都应阅读这些条款。
结论
Le Ryzen平台最佳LLM AI 9 的性能主要取决于您的统一内存:在 128 GB 的典型 Ryzen AI Max 395 配置下,低激活的 MoE 模型如 Qwen 3.5 122B-A10B 或 Qwen3.8 Flash Next 125B-A6B 在 Q4 量化下提供最佳的吞吐量/质量比,而 Mistral Small 4 仍为一种允许的密集模型。在确定选择前,请务必验证实际吞吐量。请根据以下建议进行系统设计 配置工具 或浏览 目录 complet.
本地运行 LLM 所需的硬件
要在本地流畅运行这些模型,一张 RTX 5070 Ti 提供出色的性价比。比较价格:
联盟推广链接——QuelLLM 可能会从购买中获得佣金,您无需支付额外费用。作为亚马逊联盟合作伙伴,QuelLLM 会从符合条件的购买中获得收益。