DeepSeek V4 Flash 284B:首款能跑在 Mac 上的前沿模型 Studio
DeepSeek V4 Flash 284B 于 2026 年 4 月 24 日与 V4 Pro 同步发布。这是“高效”变体:MoE 架构下总参数量 284B(每 token 激活 13B),MIT 许可证,上下文 1M tokens,与 Pro 版采用相同的 CSA+HCA 架构及相同的 3 种思考模式。最重要的是,这是首个能运行在单台工作站上的前沿级模型:Q4 量化下需 170 GB——一台配备 256 GB 内存的 Mac Studio M3 Ultra 即可满足。本指南将介绍如何安装以及其实际表现。
#DeepSeek V4 Flash 简要说明
- 发布日期
- 2026年4月24日,与V4 Pro同步发布。HuggingFace上可获取:deepseek-ai/DeepSeek-V4-Flash
- 架构
- MoE 架构,总参数量为 284B,每个 token 激活 13B 参数。每层有 128 个专家,采用 top-8 路由。提供 Base 和 Instruct 版本。
- 继承自 Pro 的创新功能
- CSA+HCA 注意力机制、mHC、Muon 优化器、FP4+FP8 混合训练。
- 上下文
- 原生支持 1,000,000 个 token(与 Pro 版本相同)
- 思考模式
- 3个级别:Non / High / Max——可通过提示词切换。
- 许可证
- MIT,与Pro版本相同。无商业或地理限制。
#1. 为什么这是一件大事
在 2026 年 4 月 24 日之前,要在本地运行前沿模型,要么需要价值 8 万欧元以上的 GPU 集群,要么就得接受 70B 模型较逊色的质量。DeepSeek V4 Flash 改变了这一局面:Q4 量化后占用 170 GB,可在价格为 4,000–8,000 欧元的二手配置上运行。
只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。
- 在线空间,终身可用
- PDF + 文件
- 终身更新
- Mac Studio M3 Ultra 256 GB
- 截至 2026 年 9 月,官方标价为 7 299 欧元;如今只能买到二手设备(Apple 已用 M5 Ultra 256 GB 取代它)。170 GB 模型 + 30 GB 上下文,内存仍绰绰有余。Q4 量化下约为 10–12 token/秒。
- 2× RTX 5090 32 GB(64 GB 显存)
- ≈ 11 400 €。不足——缺少约110 GB。可通过CPU卸载实现,但速度较慢(3-5个token/秒)。
- 4× RTX A6000 48 GB(192 GB 显存)
- 二手价格约 12,000 欧元。可轻松容纳模型,速度约为 18–25 tok/s。
- 工作站 2× Mac Studio Max 64 GB
- 单机配置不足。使用 llama.cpp RPC swarm 和 4 台 Mac Studio:可行,约 5 个 token/秒。
#2. 架构(V4高效变体)
V4 Flash 是 V4 Pro 的比例缩减版本:约减少 5.7 倍的专家数量,约减少 3.8 倍的活跃参数,但保留了相同的 CSA+HCA + Muon + FP4/FP8 架构。正是这种一致性使得 V4 Flash 能以更低的成本继承 Pro 的质量。
- 每层的专家
- 128(对比 Pro 版本的 256)。Top-8 路由策略相同。
- 当前激活参数
- 13B(Pro 为 49B)。在总参数量相同的情况下,推理速度约为对比模型的 3.8 倍。
- 层
- 61(Pro:76)。适度减少层数,以保留推理深度。
- 注意力头
- 与 Pro 相同(CSA 和 HCA 的配置完全一致)。为保持长上下文质量,没有在注意力机制上做削减。
- 预训练
- 目标是“高效推理”:18T 个 token(Pro 为 32T),训练数据配比针对数学和代码进行了优化。
#3. 量化对应的硬件要求
| Quantization | 模型显存 | + KV 32k | 推荐配置 |
|---|---|---|---|
| FP16 (基准) | 568 GB | ~620 GB | 数据中心:4× H200 141GB。本地运行不切实际。 |
| Q8_0 | 305 GB | ~340 GB | Mac Studio M3 Ultra 512 GB 或 8× RTX 4090 24GB。 |
| Q5_K_M | 205 GB | ~235 GB | 256 GB 的 Mac Studio Ultra(勉强够用),4 张 RTX A6000 48GB 则较为宽裕。 |
| Q4_K_M | 170 GB | ~200 GB | Mac Studio Ultra 256 GB,4× RTX 4090 24GB,2× RTX 6000 Ada 48GB。 |
| IQ3_M(压缩) | 130 GB | ~160 GB | Mac Studio M2 Ultra 192 GB,4× RTX 4090(少量卸载到系统内存)。 |
| IQ2_XS(极限量化) | 85 GB | ~115 GB | RTX 5090 搭配 64 GB DDR5 内存,将部分模型卸载到内存中运行;或使用 2 张 RTX 4090。 |
#4. 配置 Mac Studio Ultra 256/512 GB
#5. NVIDIA 多 GPU 配置
#选项A — vLLM 4× RTX A6000(48 GB × 4 = 192 GB)
#选项B — 使用llama.cpp进行部分卸载
#6. 基准测试及实测 tokens/sec
| Benchmark | V4 Flash | V4 Pro | Llama 4 Scout 109B | Mistral Large 2 |
|---|---|---|---|---|
| MMLU-Pro | 79.4 | 84.2 | 76.8 | 75.3 |
| GPQA Diamond | 70.1 | 78.5 | 63.2 | 59.4 |
| AIME 2025 | 76.5 | 87.0 | 61.3 | 52.1 |
| LiveCodeBench v5 | 72.6 | 79.8 | 65.4 | 61.8 |
| LongBench v2 (1M) | 68.9 | 72.6 | — | — |
| Setup | Non 模式下的 Tok/s | High 模式下的 Tok/s | Max 模式下的 token/s |
|---|---|---|---|
| Mac Studio M3 Ultra 256 GB | 10-12 | 8-10 | 5-7 |
| Mac Studio M3 Ultra 512 GB | 12-14 | 10-12 | 7-9 |
| 4× RTX A6000 48GB | 20-25 | 16-20 | 12-15 |
| 2× RTX 5090 + 64 GB 卸载至系统内存 | 3-5 | 2-4 | 1-2 |
#7. 思考模式与长上下文
V4 Flash继承了V4 Pro的三种推理模式,但质量略低,推理成本显著更低。这适用于需要推理但不占用大量基础设施的智能体。
- Non 模式
- 直接回答。延迟极低(约 1 秒即可开始流式输出)。适用于日常对话和翻译。
- High 模式
- 回答前生成 200–2000 个 token 的思维链。数学和编程任务的质量提升 25%。最终回答的第一个 token 输出前,延迟为 5–15 秒。
- Max 模式
- 最多使用 16k 个思考 token。本地运行延迟为 1–5 分钟。应留给高难度问题使用(数学证明、复杂调试)。
- 长上下文 1M
- 得益于HCA,具备与V4 Pro相同的能力——在1M上下文的Needle-in-Haystack(大海捞针)测试中约为95%(Pro为98%)。非常适合大型数据库上的RAG。
#V4 Flash 与 V4 Pro:选择其一
| 标准 | V4 Flash 284B | V4 Pro 1.6T |
|---|---|---|
| 总参数 | 284 B | 1 600 B |
| 每个 token 激活的参数 | 13 B | 49 B |
| VRAM Q4_K_M | 170 GB | 960 GB |
| 本地最低硬件要求 | Mac Studio Ultra 256 GB(二手M3 Ultra或全新M5 Ultra) | 集群约80,000欧元 |
| 本地运行的典型速度(token/秒) | 10-25 | 0,5-2 |
| MMLU-Pro 表现 | 79.4 | 84.2 |
| AIME 2025 表现 | 76.5 | 87.0 |
| 原生上下文支持 | 1 M | 1 M |
| 最高强度思考模式 | 是 | 是(质量更优) |
| 许可证 | MIT | MIT |
#2026年7月31日正式发布(版本 0731)
DeepSeek 于 2026 年 7 月底通过“0731”构建版本让 V4-Flash 结束了预览阶段:API 进入公开 beta 测试,同时 V4-Pro 的输出价格下降了 75%(每百万输出 token 0.87 美元)。Artificial Analysis 再次将 V4 系列列为“开放权重模型中的领先者之一”。模型权重方面没有变化:总参数量为 284B,激活参数量为 13B——在采用激进量化的情况下,它仍是唯一一个在高端本地配置(256 GB 内存的 Mac、Strix Halo、多 GPU)上勉强具有运行可行性的 V4 变体。
自 8 月 2 日起,LM Studio 也提供该服务:如果您的机器性能足够,可在本地运行;或通过 Bionic 应用在美国服务器上运行,默认启用“零数据保留”——这是一个需要了解的折中方案,尽管本网站的哲学仍是 100% 本地化。
#FAQ
DeepSeek V4 Flash 是否真的能在 Mac Studio M3 Ultra 256 GB 上运行?+
本地部署V4 Flash可行方案的成本是多少?+
应该选择 V4 Flash,还是等待 70B 蒸馏模型?+
V4 Flash能超越Llama 4 Maverick / Scout吗?+
Mac Studio M3 Ultra 在运行 V4 Flash 推理时的功耗是多少?+
Thinking Max 模式在 V4 Flash 上是否值得使用?+
能否在本地对 V4 Flash 进行微调?+
截至2026年4月25日,是否存在稳定的Q4量化版本?+
价格变动迅速:我们每周一和周四追踪本地 AI 显卡的最低价格,并列出每 GB VRAM 的价格。
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。