进阶 14 分钟对比

Strix Halo 对比 DGX Spark:128 核心机器的对决 GB

2026 年,两台配备 128 GB 统一内存的设备在本地大语言模型爱好者中展开竞争:AMD 的 Ryzen AI Max+ 395(代号 Strix Halo)和 NVIDIA 的 DGX Spark。理论上,内存容量相同,承诺一致——可加载 70B 模型及大型 MoE 模型,无需多 GPU。实际上,Strix Halo 与 DGX Spark 的对决更多体现在提示处理上,性能差距达到 5 倍。该对比提供了具体数据、价格信息,并根据您的实际使用情况做出判断。

您正在挑选电脑吗? 按预算推荐 → · 我们的页面 NVIDIA DGX Spark →

作者: Mohamed Meguedmi·更新于 2026-08-27·已在 Windows、macOS 和 Linux 上测试
推荐硬件

本指南的备选购买方案: BOSGAME M5 128GB / 2TB (Ryzen AI Max+ 395).

为什么选择它?我们的完整资料: BOSGAME M5 128GB / 2TB (Ryzen AI Max+ 395) →

按预算比较所有选项,从 800 到 3 500 欧元 →

移动场景: 本地 AI 选哪款笔记本电脑 →

联盟链接 — 您无需承担额外费用,我们可能获得佣金。作为 Amazon 合作伙伴,哪个LLM 会从符合条件的购买中获利。

#两台配备 128 GB 内存的机器,两种设计理念

Ryzen AI Max+ 395 是一款 x86 APU:CPU 采用 Zen 5(16 核),iGPU 为 Radeon 8060S(RDNA 3.5,40 个 CU),NPU 为 XDNA 2,全部通过 256 位总线共享高达 128 GB 的 LPDDR5X 内存。该芯片应用于部分迷你 PC(Framework Desktop、GMKtec EVO-X2、Beelink GTR9)以及少数笔记本电脑。这是一款面向大众的平台,支持 Windows 或 Linux 系统,可像普通电脑一样运行 Ollama 和 LM Studio。

DGX Spark 是一款截然不同的设备:搭载 GB10 芯片(Grace Blackwell 架构),配备 20 核 ARM CPU 和带有 Tensor Cores 的 Blackwell GPU,同样搭配 128 GB LPDDR5X 统一内存。这款设备以 NVIDIA 生态为核心,出厂预装 DGX OS(定制版 Ubuntu)及完整的 CUDA 软件栈。官方公布的价格为 4,699 美元。

i
相同内存,但目标方向相反
Strix Halo 主打价格和 x86 平台的通用性;DGX Spark 则主打计算性能和 CUDA 生态。两者都能加载相同的大型模型,但提供推理服务的速度和所需预算并不相同。

#1. 规格对比

乍看之下,最令人意外的是:内存带宽几乎相同。而决定 token 生成速度的正是内存带宽。这也解释了为什么在聊天场景中,两台设备的表现非常接近。

内存
两款设备均配备 128 GB LPDDR5X 统一内存。足以容纳一个 Q4 量化的 70B 模型(约 40 GB)及其上下文,或像 Qwen3-235B 这样采用激进量化的 MoE 模型。
带宽
Strix Halo:理论带宽约256 GB/s(256位,LPDDR5X-8000)。DGX Spark:约273 GB/s。实际生成中的差异可忽略不计。
GPU 计算
Radeon 8060S RDNA 3.5,40 个计算单元,无专用张量核心。Spark 侧:Blackwell 架构 GPU,配备张量核心及原生 FP4 支持——在原始算力上高出一个数量级。
CPU
AMD:Zen 5,16 个 x86 核心。NVIDIA:ARM Grace,20 个核心。使用大众软件时,x86 仍然更省事。
OS
Strix Halo:Windows 11 或 Linux 任选。DGX Spark:DGX OS(Ubuntu),预装驱动和 CUDA
功耗
Strix Halo:功耗预算为 55–120 W,取决于机箱。DGX Spark:负载下墙插端测得的功耗约为 240 W,配备专用电源。

#2. 每秒 token 数:势均力敌的较量

在纯生成(解码)阶段,两台设备的性能受限于内存带宽,而非计算能力。结果:数值相近,Spark 由于其略高的内存带宽以及高度优化的 CUDA 内核,表现出微弱优势。以下是社区于2026年发布的代表性数据,量化级别为Q4等效,使用短提示语。

Qwen3-30B-A3B (MoE) — Strix Halo
生成速度约为 100 token/秒。MoE 仅激活 3B 参数,因此尽管模型体量较大,速度仍然很高。
Qwen3-30B-A3B (MoE) — DGX Spark
约 100–115 tok/s。差距很小:运行这个轻量 MoE 模型时,两者都受内存瓶颈限制。
70B 稠密模型 Q4 — Strix Halo
~4-5个标记/秒。一个70B的密集模型会饱和带宽;体验仍可用但速度很慢
70B 稠密模型 Q4 — DGX Spark
~5-6 tok/s。内存受限情况下相同,差异体现在每秒token数量的分数级变化。
8B 模型 Q4 —— 两者皆可
50-70 tok/s,完全满足交互式聊天需求。
→
MoE 很适合 128 GB 内存的机器
像 Qwen3-30B-A3B 这样的混合专家模型(MoE),在处理每个 token 时只对活跃的专家进行计算。在这两台机器上,这正是最佳平衡点:内存中加载的是大模型,却能达到小模型的速度。如果您希望兼顾质量和吞吐量,请优先选择 MoE 模型。

本节的结论有些出乎直觉:如果只看聊天时每秒生成的 token 数,两台机器几乎相当,而便宜得多的 Strix Halo 似乎更胜一筹。但这个数值只反映了一半的情况。

#3. 提示词处理:真正的差异

提示处理(或prefill)阶段是模型读取并编码输入提示、生成首个token之前的阶段。与生成阶段不同,该阶段受限于计算资源,而非内存。正是在此阶段,DGX Spark的Tensor Cores发挥关键作用。

Strix Halo — prefill
~340个token/秒的提示处理速度,基于典型30B模型。iGPU RDNA 3.5没有专用矩阵单元,性能很快达到上限。
DGX Spark — prefill
得益于 Blackwell Tensor Cores 和 FP4 支持,在相同模型上的速度约为对方的 5 倍。上下文较长时,差距还可能进一步扩大。

为什么这很重要?因为只要不再局限于短对话,预填充(prefill)就会成为您感知到的响应时间的主要部分。无论是注入 8,000 个上下文 token 的 RAG 系统、每轮重新读取全部历史记录的智能体、长文档分析,还是批量处理,在这些情况下,您都得等预填充完成后才能看到任何输出。

!
短提示词基准测试的陷阱
许多测试只公布使用 20 个 token 的提示词时,每秒生成多少 token,并据此得出 Strix Halo 性能相当的结论。这在聊天场景下成立,在 RAG 或智能体场景下却不成立。如果您的使用场景会输入很长的上下文,DGX Spark 的提示词处理能力会彻底改变使用体验——购买前,请单独测量这一阶段。

举个具体例子:一个包含 4,000 个 token 的提示词。在 340 tok/s 的速度下,Strix Halo 开始回答前,仅预填充阶段就需要约 12 秒。DGX Spark 的速度约为其 5 倍,完成同一阶段只需 2–3 秒。在包含数十次请求的密集 RAG 会话中,这种差距会成为影响使用体验的主要因素。

#4. 价格与供货情况

在这个领域,Strix Halo 重新占据优势,而且优势相当明显。内存性价比是它最有力的卖点。

DGX Spark
NVIDIA 官方定价为 4,699 美元。可通过 NVIDIA 及其合作伙伴(Dell、Asus、HP、Lenovo)购买。面向专业用户和开发者。
Strix Halo — 迷你电脑
Framework Desktop、GMKtec EVO-X2、Beelink GTR9:视具体的 128 GB 配置而定,价格通常在约 1,700 至 2,500 美元/欧元之间。内存容量相同的情况下,价格约为 Spark 的一半。
Strix Halo — 笔记本
一些笔记本电脑(例如 HP ZBook Ultra、Asus ROG Flow Z13)搭载了这款 APU,为在移动场景下使用 128 GB 内存运行 LLM 提供了难得的优势。
可用性
自 2026 年中起,多家整机厂商已公开销售 Strix Halo。DGX Spark 则遵循 NVIDIA 的供货时间安排,各地区受到的限制更多。
i
真正的性价比考量
花费大约相当于一台 DGX Spark 的价格,您就可以买到一台配备 128 GB 内存的 Strix Halo 迷你 PC,外加一块配备 24 GB 显存的 RTX 4090。如果您的需求主要是聊天,以及运行能装入 24 GB 显存的模型,这种组合可能在几乎所有方面胜过 Spark——但超大模型的提示词处理除外。

#5. 软件生态

除了硬件,软件栈也对日常使用的便捷程度有很大影响——而 NVIDIA 正是在这方面发挥了 CUDA 多年来积累的领先优势。

DGX Spark — CUDA
整个 NVIDIA 生态系统都能原生运行:vLLM、TensorRT-LLM、PyTorch 和 NGC 容器。对于微调、批量推理服务或研究,这是实践经验和指导最充分的环境。
Strix Halo — ROCm / Vulkan
通过 Ollama 和 llama.cpp(Vulkan 或 ROCm 后端)进行推理效果很好。与 CUDA 相比,在 RDNA 3.5 上进行微调和使用高级框架仍需要更多手动配置和调整。
大众用户的易用性
对普通用户而言,Strix Halo 的优势在于:使用 Windows,Ollama 只需一条命令,LM Studio 通过点击操作即可。使用 Spark 则需要熟悉 Linux/Ubuntu。
多客户端服务
DGX Spark 的优势:vLLM 和 TensorRT-LLM 提供的批处理能力和聚合吞吐量都远高于对比平台,适合为团队或应用提供服务。

#6. 哪种配置适用于哪台设备

  1. 01
    您主要进行本地聊天并使用 MoE 模型
    Strix Halo。生成速度与Spark相当,价格仅为其一半,搭配Windows和Ollama,使用变得极为简单。一个约100 tokens/s的Qwen3-30B-A3B模型是出色的日常使用选择。
  2. 02
    您正在搭建 RAG 或长上下文智能体
    DGX Spark。提示词处理速度快 5 倍,当您反复输入大量上下文时,使用体验会明显改变。这正是值得支付额外费用的场景。
  3. 03
    您想进行微调或开展研究
    DGX Spark。在训练方面,CUDA 技术栈(PyTorch、TensorRT-LLM、NGC 容器)的工具支持远胜于 APU 上的 ROCm。
  4. 04
    您希望每欧元能买到尽可能多的内存
    毫不犹豫,选 Strix Halo。128 GB 统一内存(价格差异很大,需核实),通常比 Spark 更便宜,还具备真正的 x86 台式电脑的多用途优势。
  5. 05
    您希望在移动使用时也拥有 128 GB 内存
    选择配备 Strix Halo APU 的笔记本电脑——DGX Spark 是台式设备,不属于这一类别。

i
两颗芯片,一次革命
不妨退一步想想:2024 年,在家运行一个 70B 模型,还得靠爱好者用多块 GPU 自行折腾。到了 2026 年,AMD 和 NVIDIA 都在销售配备 128 GB 统一内存的芯片,能在您的书桌下安静地运行这样的模型。无论您选择哪一方,胜出的都是本地 AI。

#结论

明确的结论:平局。这场对决没有唯一的胜者,这也不是回避结论,而是测量结果所表明的事实。两款芯片均提供 128 GB 统一内存,生成速度相当;双方各赢下一半的比拼。Strix Halo 在价格与内存容量之比、多用途能力(它也是一台出色的 PC)以及交互式聊天方面胜出;GB10 则在提示词处理、微调、集群组建以及 CUDA 生态方面胜出。两种理念,两个赢家,唯一的输家是显存容量受限的传统 GPU。

具有误导性的数字
双方运行 Qwen3-30B 时的生成速度都约为 100 tok/s → 看起来打成平手,Strix Halo 在价格上占优。
决定性的数值
提示处理速度:Strix Halo 约为 340 token/s,DGX Spark 则约为其 5 倍。一旦不再局限于简短对话,提示处理速度就成为决定性因素。
简单规则
短上下文 + 资金紧张 → Strix Halo;长上下文、智能体、RAG、微调 → DGX Spark
→
请测试真实的负载,而非通用基准测试
购买前,请为您的典型提示词计时,并考虑输入长度、请求频率和目标模型大小。如果您的提示词经常超过几千个 token,Spark 的提示词处理能力就足以值回其价格。否则,Strix Halo 是理性的选择。

#常见问题

Strix Halo 或 DGX Spark:2026 年应如何选择?+
两者不分高下——选择取决于您的需求,而不是排名。短提示词、聊天、代码辅助、预算有限、需要一台多用途电脑:选择 Strix Halo。长提示词、微调、CUDA 工作流、计划搭建集群:选择 GB10/DGX Spark。在同等使用条件下,无论选择哪一台,都不会后悔没选另一台。
为何是平局而非明确胜者?+
因为两种平台共享相同的结构瓶颈——内存带宽约为256-273 GB/s,这决定了生成速度的上限——但它们在不同维度上有所侧重(价格与多功能性 vs. 计算能力与生态)。指定唯一胜者,实际上就是替用户做出了使用决策。
为什么这两台机器的文本生成速度相近?+
逐 token 生成受限于内存带宽,而非计算能力。Strix Halo 的带宽约为 256 GB/s,GB10 约为 273 GB/s,两者读取模型的速度相近,因此运行同一个量化模型时,每秒生成的 token 数也相近。相比之下,在提示词处理阶段,性能差距会大幅拉开,Blackwell GPU 占据明显优势。
实际价格差距是多少?+
在内存容量相同的情况下,价格大致相差一倍:128 GB 的 Strix Halo 机型起售价约为 1 700–2 000 美元(Bosgame、Beelink、Framework),而 GB10 系统的价格从约 2 999 美元(Asus Ascent GX10)到约 3 999 美元(DGX Spark Founders)不等。这是 Strix Halo 的核心卖点——而购买 GB10 时,您付费获得的是 CUDA 和计算能力。

#深入了解

如需深入了解这两台机器,以及这次对比涉及的硬件背景:

Ryzen AI Max+ 395 (Strix Halo)
AMD APU 专题指南:市面上可选的迷你电脑和笔记本电脑、可运行的70B及以上模型,以及相对于独立 GPU 和 Mac 的实际性能。
NVIDIA DGX Spark
128GB的AI迷你PC与传统GPU的对比:性能基准、应用场景及局限性分析。
选择量化方案(Q4、Q5、Q8、FP16)
了解为何70B模型在Q4量化下仅需40GB,以及在统一内存设备上每个量化层级对质量造成的损失。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。