Ryzen AI Max+ 395 (Strix Halo):为 LLM 提供 128 GB 内存 locaux
Ryzen AI Max+ 395(代号 Strix Halo)是 AMD 用来正面进军本地 AI 领域的 APU,此前这一领域由配备统一内存的 Mac 和拥有 24 GB 显存的 GPU 主导。它的核心优势是:CPU、GPU 和 NPU 共享高达 128 GB 的内存,其中绝大部分可分配给模型。本指南客观梳理 Ryzen AI Max+ 395 在大语言模型(LLM)方面的实际能力——哪些 70B 和 MoE 模型能够运行,运行速度如何,与独立 GPU 和 Mac 相比表现如何,以及如何在 ROCm 和 Vulkan 下进行配置。
您正在挑选电脑吗? 按预算推荐 → · 我们的页面 Ryzen AI Max 128 GB 迷你电脑 →
本指南的备选购买方案: BOSGAME M5 128GB / 2TB (Ryzen AI Max+ 395).
为什么选择它?我们的完整资料: BOSGAME M5 128GB / 2TB (Ryzen AI Max+ 395) →
移动场景: 本地 AI 选哪款笔记本电脑 →
联盟链接 — 您无需承担额外费用,我们可能获得佣金。作为 Amazon 合作伙伴,哪个LLM 会从符合条件的购买中获利。
#为什么 Ryzen AI Max+ 395 会改变本地 LLM 的格局
在本地运行大型模型几乎总会遇到同一个瓶颈:显存。RTX 4090 最大支持 24 GB,RTX 5090 为 32 GB,超过这一容量则需要堆叠多张显卡或转向 Mac Studio。Ryzen AI Max+ 395 从另一个角度突破了这一限制:它不依赖有限的专用显存,而是将一大块统一内存池共享给 CPU、集成 GPU 和 NPU。在配备 128 GB 内存的设备上,可为 GPU 分配超过 90 GB 用于推理。
具体来说,这带来了一类此前在 PC 领域不存在的设备:价格差异很大的迷你 PC 和笔记本电脑,其能否在无需独立显卡或多 GPU 配置的情况下加载 70B 模型,甚至规模大得多的混合专家模型,需要核实。这是首个在大内存本地 AI 领域能与 Mac Studio 竞争的可信 x86 方案。
#芯片详细参数
Ryzen AI Max+ 395 是一款单片式 APU,在同一块芯片上集成了三个计算引擎,全部连接到同一个内存控制器。对于 LLM,最重要的是 GPU 和内存,但这些组件共同构成了一个协调统一的整体。
- CPU — 16个Zen 5核心
- 16 个 Zen 5 核心 / 32 个线程,可用于预处理、将部分计算任务转移到 CPU,以及 GPU 推理本身之外的所有任务。
- GPU — Radeon 8060S (RDNA 3.5)
- 采用 RDNA 3.5 架构,拥有 40 个计算单元。这是 PC 市场上规模最大的集成 GPU,推理计算由它通过 ROCm 或 Vulkan 承担。
- NPU — XDNA 2,约50 TOPS
- 一种专用于 AI 的低功耗加速器。适合某些经过优化的工作负载,但目前大多数 LLM 运行时(Ollama、llama.cpp)面向的是 GPU,而非 NPU。
- 内存 — LPDDR5X 最高 128 GB
- 256位总线,LPDDR5X 8000 MT/s,共享带宽约256 GB/s。CPU、GPU和NPU之间统一共享。
#128 GB 统一内存,真正的卖点
在常规 GPU 上,VRAM 和系统 RAM 是两个独立的内存池:模型超出 VRAM 容量后,会通过 PCIe 转而使用系统 RAM,推理性能随之大幅下降。在 Ryzen AI Max+ 395 上,只有一个物理内存池。GPU 直接访问统一内存,方式与搭载 Apple Silicon 的 Mac 完全一样。无需在两个内存空间之间复制数据,也没有 PCIe 瓶颈。
模型实际可用的内存量取决于“系统”内存与“GPU”内存之间的分配。根据固件和操作系统的不同,可以为 GPU 预留一部分固定内存(BIOS 中的 UMA 参数),也可以让驱动程序动态分配其余内存(Linux 下的 GTT),或同时采用这两种方式。实际使用中,在一台配备 128 GB 内存的机器上,让 GPU 能够访问 96 GB 内存用于推理是很常见的,而且往往还能访问更多。
- 单一内存池
- 128 GB 共享内存。模型未使用的部分仍可供系统使用,反之亦然。
- GPU资源分配充足
- 根据 BIOS 和驱动配置,可为模型权重和上下文缓存分配 90 GB 或更多内存。
- 没有 PCIe 瓶颈
- 独立 GPU 在显存不足时会将部分数据转移到系统内存,而这里所有内容都能容纳在同一个高速内存空间中。
- 轻松使用长上下文
- 充足的内存余量可以支持更长的上下文窗口,而显存为24 GB的 GPU 则必须牺牲模型大小或上下文长度。
#哪些模型能运行(70B Q4、MoE)
凭借约 90 GB 的可用内存,Ryzen AI Max+ 395 相比显存为 16–24 GB 的 GPU,彻底改变了可选模型的范围。以下是具体档位,仍以 Q4 量化下常见的显存需求为参考:7B ≈ 5 GB,14B ≈ 9 GB,32B ≈ 19 GB,70B ≈ 40 GB。
- 70B 量化为 Q4_K_M(~40 GB)
- 完全放得下,还能为长上下文留出余量。这是最突出的应用场景:运行 70B 的密集模型或同等规模模型,而单张 RTX 4090 无法做到。
- 70B Q8_0(约75 GB)
- 也能装得下,几乎没有质量损失。对于消费级 GPU,不采用多 GPU 配置就无法想象能做到这一点。
- Qwen 3.6 35B-A3B 或 GLM 4.7 Flash 这类 MoE 模型
- 混合专家架构是理想选择:所有权重都加载到内存中(内存占用很大),但每个 token 只激活几十亿个参数,因此速度依然不错。
- 大规模专家混合(MoE,200B+,Q4)
- 像 Qwen3-235B-A22B 这样的模型,经过较激进的量化后,可以装入 90 GB 内存。生成吞吐量取决于活跃参数的数量,而不是总参数量。
- DeepSeek 671B 及同类模型
- 即使采用 Q4 量化,模型仍然过于庞大(仅权重就远超 100 GB)。不将部分数据卸载到磁盘,就仍然无法运行这些模型——建议选择配备超大内存的 Mac Studio 或专用的 llama.cpp 工作站。
#实际性能:带宽起决定性作用
这是在购买任何设备之前都要理解的一点。稠密模型的 token 生成受限于内存带宽,而不是原始算力。理论吞吐量上限可以粗略地用内存带宽除以模型在内存中占用的大小来计算。
Ryzen AI Max+ 395 的带宽约为 256 GB/s。因此,一个 Q4 量化的 70B 模型(约 40 GB)的理论速度上限约为 6 tokens/s,而实际观察到的生成速度通常为 4 至 5 tokens/s——可以跟得上阅读,但算不上快。相比之下,MoE 30B-A3B 模型每生成一个 token 只读取一小部分权重,速度轻松达到数十 tokens/s。提示词预处理则依靠 GPU 的 40 个计算单元,表现仍然不错。
- 70B 稠密模型,Q4 量化
- ≈ 4–5 个 token/秒的生成速度。适用于写作和分析,但对于高度互动的聊天则较慢。
- 稠密模型 32B Q4
- 明显更流畅(每生成一个 token 约读取 19 GB 数据),日常使用中质量与速度兼顾。
- MoE 30B-A3B
- 数十 tok/s 的处理速度:实际速度取决于约 3B 的激活参数,而非总 30B 参数量。
- RTX 对比
- RTX 4090(约 1000 GB/s)在纯吞吐量上远超 Strix Halo,但显存上限为 24 GB,根本无法单独加载一个 70B 模型。
#迷你PC vs 笔记本电脑 vs Mac Studio,真实对比
搭载 Ryzen AI Max+ 395 的设备有多种形态。芯片相同,选择主要取决于便携性、持续散热能力和价格。它要超越的标杆仍是 Mac Studio,以及配备大容量统一内存的 M-Max/Ultra 版本。
- 迷你PC(例如:Framework Desktop,GMKtec EVO-X2)
- 最佳性能与价格比,稳定散热,适用于长时间推理,体积紧凑、安静,适合24/7家庭服务器使用。
- 笔记本电脑(例如 HP ZBook Ultra G1a,ASUS ROG Flow Z13)
- 在移动设备上也能获得相同的内存容量,但长时间负载下会因发热而降频,推理时的续航也有限。适合随处办公,用作服务器则不太合适。
- Mac Studio(M-Max / Ultra)
- 内存带宽高得多(数百 GB/s,Ultra 芯片上最高约为 800 GB/s),MLX 生态也经过高度优化。运行稠密模型时更快,但在内存容量相同的情况下,价格明显更高。
- Mac mini M4 Pro
- 最大内存容量较小,但运行最高 32B 的模型表现出色。如果您不需要 70B 及以上的模型,可以考虑它。
总结:在高内存容量配置下,Strix Halo 在价格以及 x86/Linux 生态方面占优;Mac Studio 则在生成速度和软件成熟度方面占优。如果您想以较低成本运行 70B 模型,配备 128 GB 内存、搭载 Ryzen AI Max+ 395 的迷你 PC 是目前最合适的 x86 选项。
#在Linux下配置ROCm和Vulkan
在 Linux 下,有两种方式可以使用集成 GPU:ROCm(AMD 的计算软件栈)和 Vulkan(可跨平台使用,通常更容易在这款较新的 GPU 上运行起来)。两种方式的共同关键步骤,是让 GPU 能够访问足够的内存。
- 01在 BIOS 中设置 GPU 内存分配进入BIOS/UEFI,查找UMA Frame Buffer Size(或「Dedicated GPU Memory」)参数。为GPU预留充足显存。其余部分将由amdgpu驱动通过GTT内存动态分配。
- 02检查驱动程序识别到的 GTT 内存在 Linux 下,可动态分配给 GPU 的内存通过 amdgpu 驱动的 GTT 机制实现。使用较新的内核(6.10+)和最新的 amdgpu 固件,可最大化可用于推理的内存比例。
- 03安装针对GPU的运行栈最简单的方法是使用带有 Vulkan 后端的 Ollama 或 llama.cpp 构建版本,它能识别 Radeon 8060S,无需繁琐的 ROCm 配置。如果使用 ROCm,请安装官方软件包,并检查 GPU 是否确实出现在列表中。
- 04必要时强制指定 GPU 目标架构由于集成 GPU 并不总是在 ROCm 的官方目标列表中,有时需要通过环境变量指定 GFX 架构版本,Ollama/llama.cpp 才能接受该 GPU。
- 05启动模型并检查 GPU 卸载情况启动模型并确认其在GPU上正常运行(而非CPU)后再对性能做出任何判断。
#Windows环境配置
在 Windows 上,驱动方面的使用体验更接近“即插即用”,但内存分配仍是需要注意的关键环节。思路是一样的:先为 GPU 分配足够的内存,再使用能够利用这些内存的运行时环境。
- 01安装最新的 AMD Adrenalin 驱动程序为Ryzen AI Max+ 395使用最新驱动程序:每版更新均会提升集成GPU的LLM支持和内存分配能力。较新驱动程序会将大量统一内存暴露为VRAM。
- 02设置专用显存在 BIOS 中通过 UMA Frame Buffer Size 设置,或使用 AMD 工具,提高专用图形内存容量,为大模型留出空间。设置过低会使部分模型运算转由 CPU 承担。
- 03安装 LM Studio 或 OllamaLM Studio 会检测 AMD GPU 并提供适合的后端;这是无需使用命令行的最简单选项。Windows 版 Ollama 也能运行,其端点地址为 http://localhost:11434。
- 04加载 GGUF 并检查是否已将模型层卸载到 GPU在 LM Studio 中加载一个 Q4 量化的 70B 模型,并将 GPU offload 滑块调到最大。检查各层确实在 GPU 上运行,而不是在 CPU 上。
#故障排除与技巧
- 模型在CPU上运行,不使用GPU
- 请检查「ollama ps」/「rocm-smi」。通常GPU内存分配过小:请在BIOS中增大UMA Frame Buffer,或在Linux下检查GTT。
- ROCm无法检测Radeon 8060S
- 集成的RDNA 3.5 GPU并不总在官方列表中。请导出环境变量HSA_OVERRIDE_GFX_VERSION,或切换到Vulkan后端,后者能检测到该GPU而不产生额外开销。
- 70B 稠密模型的生成速度异常缓慢
- 这是正常现象:在 256 GB/s 的条件下,~4–5 tok/s 是现实可达到的上限。若需更高速度,请改用 MoE 模型或更小的模型——这不是 bug。
- 无法为 GPU 分配 90 GB 内存
- BIOS 固件和驱动程序/内核版本过旧会限制内存分配。请更新 BIOS,以及 Windows 上的 Adrenalin 驱动程序,或 Linux 上的内核及 amdgpu 固件。
- 长上下文导致崩溃
- 除了模型权重,KV 缓存也会占用内存。如果接近约 90 GB 的上限,请减小 num_ctx 或模型大小。
#搭载 Strix Halo 的设备(2026年8月)
芯片的成功体现在其产品目录中:已有十余款设备搭载了该芯片,从紧凑型PC到品牌工作站,从便携式游戏机到模块化机箱。以下价格为2026年8月观测到的128 GB配置价格,价格变动较快。
| 机器 | 格式 | 特点 | 参考价格 |
|---|---|---|---|
| Bosgame M5 | Mini-PC | 同档位中最便宜的选项 | ~1 700 $ |
| GMKtec EVO-X2 | Mini-PC | 4 路 8K | 价格变化很大,需核实 |
| Beelink GTR9 Pro | Mini-PC | 双 10 GbE | ~2 000 $ |
| Framework Desktop | 模块化机箱 | 可维修,开发者圈内备受推崇 | 价格变化很大,需核实 |
| Corsair AI Workstation 300 | SFF | 成熟品牌,保修有保障 | 2 000-3 400 $ |
| Minisforum MS-S1 MAX | Mini-PC | PCIe x16 插槽:唯一可扩展的类型 | ~2 500 $ |
| HP Z2 Mini G1a | 工作站 2.7 L | 经 ISV 认证,专业渠道(PRO 395) | 2 400-3 500 $ |
| Geekom A9 Mega | Mini-PC | 原厂2TB SSD | ~3 200 $ |
| Peladn YO1 | 2.4升迷你PC | 标称为「部署 70B」 | ~1 850 $ |
| Acemagic M1A Pro+ | Mini-PC | 最高支持 24 TB 存储容量 | n.c. |
| Aoostar NEX395 | Mini-PC | TDP 140 W(最强大) | 中国,欧盟市场即将推出 |
| GPD Win 5 | 掌上游戏机 | 将一个 70B 模型握在手中 | 已宣布 |
| Minix ER939-AI | Mini-PC | 双 10 GbE 版本 | n.c. |
我们的购买建议只有一句话:在配置相同的情况下(各款设备使用的芯片都相同),根据价格、保修和散热来做选择。各款设备的测试会陆续出现在我们的“评测与评论”栏目中。
#常见问题
128GB内存真的能用于LLM吗?+
在 Strix Halo 上实际可用的最大模型是什么?+
Strix Halo 能否替代 RTX 5090?+
应选择哪款 Strix Halo 机型?+
Strix Halo 上本地 AI 应该选择 Windows 还是 Linux?+
#深入了解
讨论 Ryzen AI Max+ 395,也是探讨本地 AI 硬件与模型这一更广泛议题的一部分。本网站的以下指南延伸了本指南的内容:
- 为本地 AI 选择 GPU
- 这份选购指南根据您的预算和目标模型,将 Strix Halo 与 RTX 和 Mac 进行对比,帮助您了解它的定位。
- Ollama搭配AMD GPU(ROCm)
- 详细的 ROCm 配置说明,有助于您在拿到这套平台后充分发挥 Radeon 8060S 的性能。
- 选择量化方案(Q4、Q5、Q8、FP16)
- 在内存充足时,帮助您在速度快的 Q4 和几乎无损的 Q8 之间作出选择——128 GB 的机器正是这种情况。
价格变动迅速:我们每周一和周四追踪本地 AI 显卡的最低价格,并列出每 GB VRAM 的价格。
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。