进阶 14 分钟APU

Ryzen AI Max+ 395 (Strix Halo):为 LLM 提供 128 GB 内存 locaux

Ryzen AI Max+ 395(代号 Strix Halo)是 AMD 用来正面进军本地 AI 领域的 APU,此前这一领域由配备统一内存的 Mac 和拥有 24 GB 显存的 GPU 主导。它的核心优势是:CPU、GPU 和 NPU 共享高达 128 GB 的内存,其中绝大部分可分配给模型。本指南客观梳理 Ryzen AI Max+ 395 在大语言模型(LLM)方面的实际能力——哪些 70B 和 MoE 模型能够运行,运行速度如何,与独立 GPU 和 Mac 相比表现如何,以及如何在 ROCm 和 Vulkan 下进行配置。

您正在挑选电脑吗? 按预算推荐 → · 我们的页面 Ryzen AI Max 128 GB 迷你电脑 →

作者: Samir K.·更新于 2026-08-27·已在 Windows、macOS 和 Linux 上测试
推荐硬件

本指南的备选购买方案: BOSGAME M5 128GB / 2TB (Ryzen AI Max+ 395).

为什么选择它?我们的完整资料: BOSGAME M5 128GB / 2TB (Ryzen AI Max+ 395) →

按预算比较所有选项,从 800 到 3 500 欧元 →

移动场景: 本地 AI 选哪款笔记本电脑 →

联盟链接 — 您无需承担额外费用,我们可能获得佣金。作为 Amazon 合作伙伴,哪个LLM 会从符合条件的购买中获利。

#为什么 Ryzen AI Max+ 395 会改变本地 LLM 的格局

在本地运行大型模型几乎总会遇到同一个瓶颈:显存。RTX 4090 最大支持 24 GB,RTX 5090 为 32 GB,超过这一容量则需要堆叠多张显卡或转向 Mac Studio。Ryzen AI Max+ 395 从另一个角度突破了这一限制:它不依赖有限的专用显存,而是将一大块统一内存池共享给 CPU、集成 GPU 和 NPU。在配备 128 GB 内存的设备上,可为 GPU 分配超过 90 GB 用于推理。

具体来说,这带来了一类此前在 PC 领域不存在的设备:价格差异很大的迷你 PC 和笔记本电脑,其能否在无需独立显卡或多 GPU 配置的情况下加载 70B 模型,甚至规模大得多的混合专家模型,需要核实。这是首个在大内存本地 AI 领域能与 Mac Studio 竞争的可信 x86 方案。

i
Strix Halo、Ryzen AI Max、Radeon 8060S:这些名称分别指什么?
「Strix Halo」是该代的代号。「Ryzen AI Max+ 395」是 Ryzen AI Max 系列的高端型号,其集成显卡名为 Radeon 8060S。这三个名称代表同一芯片的不同方面——您将在产品规格中看到这三个名称。

#芯片详细参数

Ryzen AI Max+ 395 是一款单片式 APU,在同一块芯片上集成了三个计算引擎,全部连接到同一个内存控制器。对于 LLM,最重要的是 GPU 和内存,但这些组件共同构成了一个协调统一的整体。

CPU — 16个Zen 5核心
16 个 Zen 5 核心 / 32 个线程,可用于预处理、将部分计算任务转移到 CPU,以及 GPU 推理本身之外的所有任务。
GPU — Radeon 8060S (RDNA 3.5)
采用 RDNA 3.5 架构,拥有 40 个计算单元。这是 PC 市场上规模最大的集成 GPU,推理计算由它通过 ROCm 或 Vulkan 承担。
NPU — XDNA 2,约50 TOPS
一种专用于 AI 的低功耗加速器。适合某些经过优化的工作负载,但目前大多数 LLM 运行时(Ollama、llama.cpp)面向的是 GPU,而非 NPU。
内存 — LPDDR5X 最高 128 GB
256位总线,LPDDR5X 8000 MT/s,共享带宽约256 GB/s。CPU、GPU和NPU之间统一共享。
!
内存为焊接式,容量需在购买时选定
Strix Halo 的 LPDDR5X 内存焊接在主板上:没有 SO-DIMM 内存条,购买后也无法扩展。如果您计划使用 70B+ 模型,请一开始就选择 128 GB 版本。32 GB 或 64 GB 版本会大幅限制该平台在运行大型 LLM 时的优势。
i
为何这款芯片具有历史意义
过去十年,在家运行大型模型意味着要堆叠价格高昂的 GPU,才能多凑出一些显存。Strix Halo 彻底改变了这一局面:AMD 将 16 个 Zen 5 核心、一款 RTX 4060–4070 级别的 GPU 和一个 50 TOPS 的 NPU 集成起来,共享一个 128 GB 的内存池——这样一来,一个 70B 量化模型就能完整装入内存,而 2026 年 9 月底售价约 5,700 欧元的 RTX 5090,显存上限却只有 32 GB。这是首款从设计之初就面向本地推理的消费级芯片,而非后来才为本地推理作适配的芯片。

#128 GB 统一内存,真正的卖点

在常规 GPU 上,VRAM 和系统 RAM 是两个独立的内存池:模型超出 VRAM 容量后,会通过 PCIe 转而使用系统 RAM,推理性能随之大幅下降。在 Ryzen AI Max+ 395 上,只有一个物理内存池。GPU 直接访问统一内存,方式与搭载 Apple Silicon 的 Mac 完全一样。无需在两个内存空间之间复制数据,也没有 PCIe 瓶颈。

模型实际可用的内存量取决于“系统”内存与“GPU”内存之间的分配。根据固件和操作系统的不同,可以为 GPU 预留一部分固定内存(BIOS 中的 UMA 参数),也可以让驱动程序动态分配其余内存(Linux 下的 GTT),或同时采用这两种方式。实际使用中,在一台配备 128 GB 内存的机器上,让 GPU 能够访问 96 GB 内存用于推理是很常见的,而且往往还能访问更多。

单一内存池
128 GB 共享内存。模型未使用的部分仍可供系统使用,反之亦然。
GPU资源分配充足
根据 BIOS 和驱动配置,可为模型权重和上下文缓存分配 90 GB 或更多内存。
没有 PCIe 瓶颈
独立 GPU 在显存不足时会将部分数据转移到系统内存,而这里所有内容都能容纳在同一个高速内存空间中。
轻松使用长上下文
充足的内存余量可以支持更长的上下文窗口,而显存为24 GB的 GPU 则必须牺牲模型大小或上下文长度。

#哪些模型能运行(70B Q4、MoE)

凭借约 90 GB 的可用内存,Ryzen AI Max+ 395 相比显存为 16–24 GB 的 GPU,彻底改变了可选模型的范围。以下是具体档位,仍以 Q4 量化下常见的显存需求为参考:7B ≈ 5 GB,14B ≈ 9 GB,32B ≈ 19 GB,70B ≈ 40 GB。

70B 量化为 Q4_K_M(~40 GB)
完全放得下,还能为长上下文留出余量。这是最突出的应用场景:运行 70B 的密集模型或同等规模模型,而单张 RTX 4090 无法做到。
70B Q8_0(约75 GB)
也能装得下,几乎没有质量损失。对于消费级 GPU,不采用多 GPU 配置就无法想象能做到这一点。
Qwen 3.6 35B-A3B 或 GLM 4.7 Flash 这类 MoE 模型
混合专家架构是理想选择:所有权重都加载到内存中(内存占用很大),但每个 token 只激活几十亿个参数,因此速度依然不错。
大规模专家混合(MoE,200B+,Q4)
像 Qwen3-235B-A22B 这样的模型,经过较激进的量化后,可以装入 90 GB 内存。生成吞吐量取决于活跃参数的数量,而不是总参数量。
DeepSeek 671B 及同类模型
即使采用 Q4 量化,模型仍然过于庞大(仅权重就远超 100 GB)。不将部分数据卸载到磁盘,就仍然无法运行这些模型——建议选择配备超大内存的 Mac Studio 或专用的 llama.cpp 工作站。
→
MoE 模型非常适合这台机器
一个 70B 稠密模型每生成一个 token 都要读取 40 GB 的权重,因此带宽成为限制因素。内存占用相同、但仅有 3B 活跃参数的 MoE 模型,每个 token 只需读取其中一小部分内存,因此运行速度快得多。在 Strix Halo 上,如果速度很重要,请优先选择 MoE 架构。

#实际性能:带宽起决定性作用

这是在购买任何设备之前都要理解的一点。稠密模型的 token 生成受限于内存带宽,而不是原始算力。理论吞吐量上限可以粗略地用内存带宽除以模型在内存中占用的大小来计算。

Ryzen AI Max+ 395 的带宽约为 256 GB/s。因此,一个 Q4 量化的 70B 模型(约 40 GB)的理论速度上限约为 6 tokens/s,而实际观察到的生成速度通常为 4 至 5 tokens/s——可以跟得上阅读,但算不上快。相比之下,MoE 30B-A3B 模型每生成一个 token 只读取一小部分权重,速度轻松达到数十 tokens/s。提示词预处理则依靠 GPU 的 40 个计算单元,表现仍然不错。

70B 稠密模型,Q4 量化
≈ 4–5 个 token/秒的生成速度。适用于写作和分析,但对于高度互动的聊天则较慢。
稠密模型 32B Q4
明显更流畅(每生成一个 token 约读取 19 GB 数据),日常使用中质量与速度兼顾。
MoE 30B-A3B
数十 tok/s 的处理速度:实际速度取决于约 3B 的激活参数,而非总 30B 参数量。
RTX 对比
RTX 4090(约 1000 GB/s)在纯吞吐量上远超 Strix Halo,但显存上限为 24 GB,根本无法单独加载一个 70B 模型。
i
容量与速度的平衡:最佳选择
Ryzen AI Max+ 395 增加的是内存容量,而非处理速度。如果您需要的是‘运行一个任何24GB显存显卡都无法加载的大型模型’,那么这款产品非常合适。如果您需要的是‘在7B到14B模型上实现最高的每秒token处理量’,专用GPU仍会更快且更经济。

#迷你PC vs 笔记本电脑 vs Mac Studio,真实对比

搭载 Ryzen AI Max+ 395 的设备有多种形态。芯片相同,选择主要取决于便携性、持续散热能力和价格。它要超越的标杆仍是 Mac Studio,以及配备大容量统一内存的 M-Max/Ultra 版本。

迷你PC(例如:Framework Desktop,GMKtec EVO-X2)
最佳性能与价格比,稳定散热,适用于长时间推理,体积紧凑、安静,适合24/7家庭服务器使用。
笔记本电脑(例如 HP ZBook Ultra G1a,ASUS ROG Flow Z13)
在移动设备上也能获得相同的内存容量,但长时间负载下会因发热而降频,推理时的续航也有限。适合随处办公,用作服务器则不太合适。
Mac Studio(M-Max / Ultra)
内存带宽高得多(数百 GB/s,Ultra 芯片上最高约为 800 GB/s),MLX 生态也经过高度优化。运行稠密模型时更快,但在内存容量相同的情况下,价格明显更高。
Mac mini M4 Pro
最大内存容量较小,但运行最高 32B 的模型表现出色。如果您不需要 70B 及以上的模型,可以考虑它。

总结:在高内存容量配置下,Strix Halo 在价格以及 x86/Linux 生态方面占优;Mac Studio 则在生成速度和软件成熟度方面占优。如果您想以较低成本运行 70B 模型,配备 128 GB 内存、搭载 Ryzen AI Max+ 395 的迷你 PC 是目前最合适的 x86 选项。

#在Linux下配置ROCm和Vulkan

在 Linux 下,有两种方式可以使用集成 GPU:ROCm(AMD 的计算软件栈)和 Vulkan(可跨平台使用,通常更容易在这款较新的 GPU 上运行起来)。两种方式的共同关键步骤,是让 GPU 能够访问足够的内存。

  1. 01
    在 BIOS 中设置 GPU 内存分配
    进入BIOS/UEFI,查找UMA Frame Buffer Size(或「Dedicated GPU Memory」)参数。为GPU预留充足显存。其余部分将由amdgpu驱动通过GTT内存动态分配。
  2. 02
    检查驱动程序识别到的 GTT 内存
    在 Linux 下,可动态分配给 GPU 的内存通过 amdgpu 驱动的 GTT 机制实现。使用较新的内核(6.10+)和最新的 amdgpu 固件,可最大化可用于推理的内存比例。
  3. 03
    安装针对GPU的运行栈
    最简单的方法是使用带有 Vulkan 后端的 Ollama 或 llama.cpp 构建版本,它能识别 Radeon 8060S,无需繁琐的 ROCm 配置。如果使用 ROCm,请安装官方软件包,并检查 GPU 是否确实出现在列表中。
  4. 04
    必要时强制指定 GPU 目标架构
    由于集成 GPU 并不总是在 ROCm 的官方目标列表中,有时需要通过环境变量指定 GFX 架构版本,Ollama/llama.cpp 才能接受该 GPU。
  5. 05
    启动模型并检查 GPU 卸载情况
    启动模型并确认其在GPU上正常运行(而非CPU)后再对性能做出任何判断。
终端 — 检查GPU并启动模型
# Vérifier que le GPU AMD est détecté par ROCm
rocminfo | grep -i "gfx"

# Voir l'occupation mémoire du GPU en temps réel
rocm-smi

# Lancer un gros MoE 2026 avec Ollama
ollama run qwen3.6:35b

# Confirmer que le modèle est sur GPU (et pas CPU)
ollama ps
终端 — 为 ROCm 强制指定 GFX 目标(若未检测到)
# Le Radeon 8060S (RDNA 3.5) n'est pas toujours reconnu par défaut.
# Indiquez la version GFX pour qu'Ollama accepte le GPU.
export HSA_OVERRIDE_GFX_VERSION=11.0.0
ollama serve
→
优先使用 Vulkan,随后是 ROCm
在这个非常新的平台上,llama.cpp/Ollama 的 Vulkan 后端通常是让 GPU 正常工作的最便捷途径:依赖更少,还能自动检测。等一切都能正常运行后,再用 ROCm 进一步优化性能。本站的 Vulkan 指南提供了详细的编译说明。

#Windows环境配置

在 Windows 上,驱动方面的使用体验更接近“即插即用”,但内存分配仍是需要注意的关键环节。思路是一样的:先为 GPU 分配足够的内存,再使用能够利用这些内存的运行时环境。

  1. 01
    安装最新的 AMD Adrenalin 驱动程序
    为Ryzen AI Max+ 395使用最新驱动程序:每版更新均会提升集成GPU的LLM支持和内存分配能力。较新驱动程序会将大量统一内存暴露为VRAM。
  2. 02
    设置专用显存
    在 BIOS 中通过 UMA Frame Buffer Size 设置,或使用 AMD 工具,提高专用图形内存容量,为大模型留出空间。设置过低会使部分模型运算转由 CPU 承担。
  3. 03
    安装 LM Studio 或 Ollama
    LM Studio 会检测 AMD GPU 并提供适合的后端;这是无需使用命令行的最简单选项。Windows 版 Ollama 也能运行,其端点地址为 http://localhost:11434。
  4. 04
    加载 GGUF 并检查是否已将模型层卸载到 GPU
    在 LM Studio 中加载一个 Q4 量化的 70B 模型,并将 GPU offload 滑块调到最大。检查各层确实在 GPU 上运行,而不是在 CPU 上。
PowerShell — Windows 上的 Ollama
# Vérifier la version d'Ollama
ollama --version

# Lancer un gros MoE 2026 ; l'endpoint local reste sur :11434
ollama run qwen3.6:35b

# Vérifier l'exécution sur GPU
ollama ps
i
推荐技术栈
最顺手的组合仍然是 Ollama(推理守护进程,在 :11434 提供兼容 OpenAI 的 API 端点)搭配 Open WebUI 或 LM Studio 这样的界面。这套组合并没有针对 Strix Halo 的特殊之处:只要用上 GPU,其余工作流程就与其他机器相同。

#故障排除与技巧

模型在CPU上运行,不使用GPU
请检查「ollama ps」/「rocm-smi」。通常GPU内存分配过小:请在BIOS中增大UMA Frame Buffer,或在Linux下检查GTT。
ROCm无法检测Radeon 8060S
集成的RDNA 3.5 GPU并不总在官方列表中。请导出环境变量HSA_OVERRIDE_GFX_VERSION,或切换到Vulkan后端,后者能检测到该GPU而不产生额外开销。
70B 稠密模型的生成速度异常缓慢
这是正常现象:在 256 GB/s 的条件下,~4–5 tok/s 是现实可达到的上限。若需更高速度,请改用 MoE 模型或更小的模型——这不是 bug。
无法为 GPU 分配 90 GB 内存
BIOS 固件和驱动程序/内核版本过旧会限制内存分配。请更新 BIOS,以及 Windows 上的 Adrenalin 驱动程序,或 Linux 上的内核及 amdgpu 固件。
长上下文导致崩溃
除了模型权重,KV 缓存也会占用内存。如果接近约 90 GB 的上限,请减小 num_ctx 或模型大小。

#搭载 Strix Halo 的设备(2026年8月)

芯片的成功体现在其产品目录中:已有十余款设备搭载了该芯片,从紧凑型PC到品牌工作站,从便携式游戏机到模块化机箱。以下价格为2026年8月观测到的128 GB配置价格,价格变动较快。

已上市或已公布的 Ryzen AI Max+ 395 机型(2026 年 8 月参考价格,128 GB 配置)
机器格式特点参考价格
Bosgame M5Mini-PC同档位中最便宜的选项~1 700 $
GMKtec EVO-X2Mini-PC4 路 8K价格变化很大,需核实
Beelink GTR9 ProMini-PC双 10 GbE~2 000 $
Framework Desktop模块化机箱可维修,开发者圈内备受推崇价格变化很大,需核实
Corsair AI Workstation 300SFF成熟品牌,保修有保障2 000-3 400 $
Minisforum MS-S1 MAXMini-PCPCIe x16 插槽:唯一可扩展的类型~2 500 $
HP Z2 Mini G1a工作站 2.7 L经 ISV 认证,专业渠道(PRO 395)2 400-3 500 $
Geekom A9 MegaMini-PC原厂2TB SSD~3 200 $
Peladn YO12.4升迷你PC标称为「部署 70B」~1 850 $
Acemagic M1A Pro+Mini-PC最高支持 24 TB 存储容量n.c.
Aoostar NEX395Mini-PCTDP 140 W(最强大)中国,欧盟市场即将推出
GPD Win 5掌上游戏机将一个 70B 模型握在手中已宣布
Minix ER939-AIMini-PC双 10 GbE 版本n.c.

我们的购买建议只有一句话:在配置相同的情况下(各款设备使用的芯片都相同),根据价格、保修和散热来做选择。各款设备的测试会陆续出现在我们的“评测与评论”栏目中。

#常见问题

128GB内存真的能用于LLM吗?+
基本上是的。内存是统一的:在Windows下GPU可分配高达96GB内存,Linux下通过正确设置可分配更多。因此,一个70B参数的Q4量化模型(约40GB)可完全加载至GPU显存中,并为上下文保留足够空间。
在 Strix Halo 上实际可用的最大模型是什么?+
量化后的 70B 模型可以轻松运行。AMD 曾通过提高内存分配,在 LM Studio 中演示运行参数量高达约 1200 亿的模型。再往上,限制因素就不再是容量,而是速度:256 GB/s 的带宽使超大型稠密模型的生成速度较慢。MoE 模型(如 GLM 或 Qwen3-30B-A3B)尤其适合这里:活跃参数较少,却能容纳大量参数。
Strix Halo 能否替代 RTX 5090?+
不能——两者的侧重点不同。对于能装入其 32 GB 显存的任务,RTX 5090 的速度要快得多。一旦模型超过这一容量限制,Strix Halo 就更有优势:它能运行 RTX 5090 根本无法加载的模型,而且整机价格低于单独一张显卡的价格。
应选择哪款 Strix Halo 机型?+
由于这些机器采用的芯片都相同,真正的选择标准是价格(Bosgame M5 的定价最具竞争力)、保修和售后服务的可靠性(Corsair、HP 和 Framework 令人放心)、可扩展性(Minisforum MS-S1 MAX 是唯一配备 PCIe x16 插槽的机型)以及散热。购买前请逐一查看我们对各款机器的评测。
Strix Halo 上本地 AI 应该选择 Windows 还是 Linux?+
两个系统都能使用。Linux 允许为 GPU 分配最多的内存,使用 llama.cpp/ROCm 时性能也最佳;Windows 配合原生支持该芯片的 LM Studio,使用起来更简单。我们的配置指南逐节介绍了这两个系统。

#深入了解

讨论 Ryzen AI Max+ 395,也是探讨本地 AI 硬件与模型这一更广泛议题的一部分。本网站的以下指南延伸了本指南的内容:

为本地 AI 选择 GPU
这份选购指南根据您的预算和目标模型,将 Strix Halo 与 RTX 和 Mac 进行对比,帮助您了解它的定位。
Ollama搭配AMD GPU(ROCm)
详细的 ROCm 配置说明,有助于您在拿到这套平台后充分发挥 Radeon 8060S 的性能。
选择量化方案(Q4、Q5、Q8、FP16)
在内存充足时,帮助您在速度快的 Q4 和几乎无损的 Q8 之间作出选择——128 GB 的机器正是这种情况。

价格变动迅速:我们每周一和周四追踪本地 AI 显卡的最低价格,并列出每 GB VRAM 的价格。

这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。