Intel Crescent Island:用于推理的 160 GB 内存 LLM
Crescent Island 是英特尔于2025年10月14日宣布的一款数据中心 GPU,参考配置搭载160 GB LPDDR5X 内存(部分合作伙伴的配置最高可达480 GB),面向采用风冷的企业服务器中的推理工作负载。它既不是消费级产品,也不是可安装在个人电脑中的显卡:样品预计要到2026年下半年才会提供,目前尚未公布价格或商业发售日期。
Crescent Island 是英特尔于 2025 年末公布的数据中心推理 GPU 的代号,其主要卖点是:内存容量大,而且比竞争对手加速器使用的 HBM 内存更便宜、更省电。本文介绍英特尔已确认的内容、仍需核实的事项、这一内存方案与已上市加速器相比处于什么位置,以及为什么它不是用于个人电脑的 GPU。
您正在挑选电脑吗? 按预算推荐 →
本地 AI 的高性价比之选: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).
迷你 PC 是一台完整的机器:请检查可用内存和引擎兼容性。它不能替代 macOS/MLX 或 CUDA。
为什么选择它?我们的完整资料: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →
预算有限: RTX 5060 · 大型模型: RTX 5090 · Mac Studio.
移动场景: 本地 AI 选哪款笔记本电脑 →
联盟链接 — 您无需承担额外费用,我们可能获得佣金。作为 Amazon 合作伙伴,哪个LLM 会从符合条件的购买中获利。
#英特尔宣布了什么
英特尔于2025年10月14日在OCP全球峰会上发布了Crescent Island:一款数据中心GPU,配备160GB LPDDR5X内存,基于优化能效的Xe3P微架构。英特尔明确指出,该产品将面向‘令牌即服务’提供商及推理负载,部署于采用空气冷却而非液冷的企业服务器。
面向客户的样品预计于 2026 年下半年提供。英特尔现阶段尚未公布任何价格、面向普通消费者的商业上市日期或已确认的 OEM 合作伙伴。
#内存容量不等于吞吐量
160 GB的容量(据 Tom's Hardware 引用的部分合作伙伴信息,最高可达480 GB)可以将大型模型完整加载到 GPU 显存中,无需分拆到多张显卡上。但容量并不能说明显存带宽,而带宽才是真正限制逐 token 生成吞吐量的因素。LPDDR5X 的带宽从技术架构上就低于高端加速器使用的 HBM:Intel 有意在容量与成本和最大吞吐量之间作出了取舍。
#LPDDR5X 与当前加速器所用 HBM 的对比
英特尔没有公布 Crescent Island 的任何带宽数值,因此无法像本站其他专题那样计算理论上的 tokens/s 上限。不过,已经上市的加速器中,不同内存类型之间的带宽差距是可以测量的。这个数量级有助于理解英特尔所作的权衡,也能避免在比较未来 Crescent Island 的规格表与 H100 或 MI300X 时,误以为它们属于同一吞吐量级别。
| 加速器 | 内存 | 标称带宽 |
|---|---|---|
| NVIDIA H100 SXM | 80 GB HBM3 | 3.35 TB/s |
| AMD Instinct MI300X | 192 GB HBM3 | 5.3 TB/s |
| Intel Crescent Island(参考型号) | 160 GB LPDDR5X | 英特尔未发布 |
在没有 Crescent Island 官方数据的情况下,唯一可核实的参考来自其他已上市产品中的 LPDDR5X 实现:NVIDIA DGX Spark(128 GB LPDDR5X)公布的带宽为 273 GB/s,即约 0.27 TB/s——不足 MI300X 的十分之一。Crescent Island 这样的服务器 GPU 可能采用更宽的总线,因此带宽也可能更高;但在 Intel 公布数据之前,应假定存在这一数量级的带宽差距,而不是与 HBM 持平。这是大容量和低成本的代价:Crescent Island 面向的是完整加载大型模型比提供峰值吞吐量更重要的工作负载,而不是在所有工作负载上取代 H100 或 MI300X。
#Crescent Island:现状概览
| 要点 | 状态 | 来源 |
|---|---|---|
| 160 GB LPDDR5X,Xe3P架构 | 英特尔确认 | 英特尔新闻稿,2025年10月14日 |
| 目标用途:推理、风冷服务器、token 即服务 | 英特尔确认 | 英特尔公告 |
| 2026 年下半年向客户提供样品 | 英特尔确认 | 英特尔公告 |
| 部分合作伙伴提供最高 480 GB 的配置 | 技术媒体报道 | Tom's Hardware |
| 实际内存带宽,token/秒 | 未测量 | 首批独立基准测试 |
| 价格、销售日期、OEM供货情况 | 未知 | 需避免提前规划 |
#适合哪些人,用于哪些用途
Crescent Island 面向数据中心运营商和推理服务提供商,而非个人用户或正在搭建开发用机器的小型团队。服务器形态、以提高部署密度为目标的风冷设计,以及明确的“tokens-as-a-service”(token 即服务)定位,都表明它是一款基础设施产品:就用途而言,它更接近用于大规模 LLM 服务的硬件卡,而非工作站。
对于考虑在中期开展内部 LLM 推理的企业,其吸引力将取决于每 GB 内存和每瓦功耗的成本比是否优于目前采用 HBM 的 GPU——只有在价格和实际性能公布后,才能进行这一计算。
这一定位让人联想到多家厂商呈现出的更广泛趋势:对于加载完整模型比峰值吞吐量更重要的推理负载,提供容量充足但速度较慢的内存(LPDDR),而不是容量有限但速度极快的内存(HBM)。在采用统一内存的消费级 APU 上,例如 Ryzen AI Max+ 395(LPDDR5X,256 GB/s),也能看到同样的取舍,只是规模不同:每花一欧元能获得更多内存容量,代价是峰值吞吐量低于采用 HBM 的专用 GPU。
具体而言,同时提供多个模型服务或并行处理多个请求的服务运营方(“tokens-as-a-service”,即 token 即服务),往往更适合将负载分散到大量同时处理的请求上。在这种情况下,单个请求的延迟不如总吞吐量和每个输出 token 的服务成本重要。这正是 Crescent Island 凭借充裕的 LPDDR5X 容量所力求优化的成本效益。相反,对于要求单个请求延迟尽可能低的用途,HBM 的原始带宽仍然具有决定性作用。
#驱动和框架:仍缺少的内容
截至目前,查阅过的来源中没有任何一个确认 vLLM、SGLang 或其他主流 LLM 推理运行时已对 Crescent Island 这款芯片提供经过认证的支持。积极的一点是:vLLM 已经正式维护面向 Intel GPU 的 XPU 后端,其安装文档中列出的受支持硬件为“Intel Data Center GPU, Intel ARC GPU”。芯片样品分发后,这最有可能成为 Crescent Island 的集成路径;但在这款芯片正式上市之前,没有任何保证表明它能在上市首日就获得支持。Intel 也为其现有 GPU 维护着 llama.cpp 的 OpenVINO 后端,这进一步支持了这条连贯的软件发展路线,但并不构成对 Crescent Island 的支持保证。
#现在购买还是等待?
- 当下的企业 LLM 推理需求
- 目前可用的HBM显卡(H100、MI300X)或现有多卡解决方案仍是可衡量且可交付的唯一选择;Crescent Island目前既不可购买,也未公布价格或性能参数。
- 2027年基础设施规划项目
- 在 Crescent Island 样本发布后,跟踪首批独立基准测试,特别是实际 tokens/s 和每 GB 成本。
- 个人或小团队使用
- 这款 GPU 不适用于此使用场景:建议优先选择消费级 GPU 配置,或本站已有介绍的统一内存 APU。
- 依据公布的 480 GB 容量作出的决策
- 该数值对应于部分合作伙伴被媒体报道的最高配置,而非英特尔确认的160GB标准配置。
- 现有替代方案:使用 llama.cpp 在多个 GPU 上运行 LLM
- 选择适合本地 LLM 的 GPU
- LLM GPU 服务器的成本:需要预算的项目
- VRAM:是什么,运行 AI 需要多少
- 来源:英特尔 Crescent Island 官方公告
- 来源:Tom's Hardware 关于 Crescent Island 的报道
- 来源:vLLM 文档,Intel XPU 后端
Crescent Island是否可以购买?+
Crescent Island 能否替代消费级 GPU 用于本地 AI 处理?+
160 GB LPDDR5X 意味着模型会更快吗?+
Crescent Island 能达到 480 GB 吗?+
Crescent Island 将兼容 vLLM 或 llama.cpp 吗?+
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。