进阶 14 分钟DeepSeek

DeepSeek V4 Flash 284B:首款能跑在 Mac 上的前沿模型 Studio

DeepSeek V4 Flash 284B 于 2026 年 4 月 24 日与 V4 Pro 同步发布。这是“高效”变体:MoE 架构下总参数量 284B(每 token 激活 13B),MIT 许可证,上下文 1M tokens,与 Pro 版采用相同的 CSA+HCA 架构及相同的 3 种思考模式。最重要的是,这是首个能运行在单台工作站上的前沿级模型:Q4 量化下需 170 GB——一台配备 256 GB 内存的 Mac Studio M3 Ultra 即可满足。本指南将介绍如何安装以及其实际表现。

作者: Mohamed Meguedmi·更新于 2026-08-11·已在 Windows、macOS 和 Linux 上测试

#DeepSeek V4 Flash 简要说明

发布日期
2026年4月24日,与V4 Pro同步发布。HuggingFace上可获取:deepseek-ai/DeepSeek-V4-Flash
架构
MoE 架构,总参数量为 284B,每个 token 激活 13B 参数。每层有 128 个专家,采用 top-8 路由。提供 Base 和 Instruct 版本。
继承自 Pro 的创新功能
CSA+HCA 注意力机制、mHC、Muon 优化器、FP4+FP8 混合训练。
上下文
原生支持 1,000,000 个 token(与 Pro 版本相同)
思考模式
3个级别:Non / High / Max——可通过提示词切换。
许可证
MIT,与Pro版本相同。无商业或地理限制。

#1. 为什么这是一件大事

在 2026 年 4 月 24 日之前,要在本地运行前沿模型,要么需要价值 8 万欧元以上的 GPU 集群,要么就得接受 70B 模型较逊色的质量。DeepSeek V4 Flash 改变了这一局面:Q4 量化后占用 170 GB,可在价格为 4,000–8,000 欧元的二手配置上运行。

本地 AI 套件

只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。

  • 在线空间,终身可用
  • PDF + 文件
  • 终身更新
Mac Studio M3 Ultra 256 GB
截至 2026 年 9 月,官方标价为 7 299 欧元;如今只能买到二手设备(Apple 已用 M5 Ultra 256 GB 取代它)。170 GB 模型 + 30 GB 上下文,内存仍绰绰有余。Q4 量化下约为 10–12 token/秒。
2× RTX 5090 32 GB(64 GB 显存)
≈ 11 400 €。不足——缺少约110 GB。可通过CPU卸载实现,但速度较慢(3-5个token/秒)。
4× RTX A6000 48 GB(192 GB 显存)
二手价格约 12,000 欧元。可轻松容纳模型,速度约为 18–25 tok/s。
工作站 2× Mac Studio Max 64 GB
单机配置不足。使用 llama.cpp RPC swarm 和 4 台 Mac Studio:可行,约 5 个 token/秒。
→
真正的独特之处:Mac Studio Ultra
M3 Ultra 256 GB(截至2026年9月的官方标价为7,299欧元,如今需购买二手)在聊天模式下以约10 tok/s的速度运行DeepSeek V4 Flash Q4。在这个价位上,全球没有其他个人电脑能运行前沿模型。Apple Silicon使这一切成为可能(统一内存 + 800 GB/s带宽)。

#2. 架构(V4高效变体)

V4 Flash 是 V4 Pro 的比例缩减版本:约减少 5.7 倍的专家数量,约减少 3.8 倍的活跃参数,但保留了相同的 CSA+HCA + Muon + FP4/FP8 架构。正是这种一致性使得 V4 Flash 能以更低的成本继承 Pro 的质量。

每层的专家
128(对比 Pro 版本的 256)。Top-8 路由策略相同。
当前激活参数
13B(Pro 为 49B)。在总参数量相同的情况下,推理速度约为对比模型的 3.8 倍。
层
61(Pro:76)。适度减少层数,以保留推理深度。
注意力头
与 Pro 相同(CSA 和 HCA 的配置完全一致)。为保持长上下文质量,没有在注意力机制上做削减。
预训练
目标是“高效推理”:18T 个 token(Pro 为 32T),训练数据配比针对数学和代码进行了优化。

#3. 量化对应的硬件要求

所需总VRAM(模型 + 32k token的KV缓存)
Quantization模型显存+ KV 32k推荐配置
FP16 (基准)568 GB~620 GB数据中心:4× H200 141GB。本地运行不切实际。
Q8_0305 GB~340 GBMac Studio M3 Ultra 512 GB 或 8× RTX 4090 24GB。
Q5_K_M205 GB~235 GB256 GB 的 Mac Studio Ultra(勉强够用),4 张 RTX A6000 48GB 则较为宽裕。
Q4_K_M170 GB~200 GBMac Studio Ultra 256 GB,4× RTX 4090 24GB,2× RTX 6000 Ada 48GB。
IQ3_M(压缩)130 GB~160 GBMac Studio M2 Ultra 192 GB,4× RTX 4090(少量卸载到系统内存)。
IQ2_XS(极限量化)85 GB~115 GBRTX 5090 搭配 64 GB DDR5 内存,将部分模型卸载到内存中运行;或使用 2 张 RTX 4090。
i
2026年的最佳选择
对于认真使用的个人用户,在 Mac Studio M3 Ultra 256 GB 上以 Q4_K_M 量化运行,在价格、质量和速度之间最为划算。截至 2026 年 9 月,新机售价为 7,300 欧元(如今只能买二手,或选择全新的 M5 Ultra 256 GB),速度约为 10 token/秒,质量接近 FP16(在这一规模下,Q4 在基准测试中的损失不到 2%)。PC 端若不超过 12,000 欧元,就没有同等方案。

#4. 配置 Mac Studio Ultra 256/512 GB

Mac Studio M3 Ultra 完整安装
# 1. Relever la mémoire GPU allouable
sudo sysctl iogpu.wired_limit_mb=240640    # 256 Go : 235 Go GPU
# Ou pour Mac Studio 512 Go :
# sudo sysctl iogpu.wired_limit_mb=491520

# Persistant
echo "iogpu.wired_limit_mb=240640" | sudo tee -a /etc/sysctl.conf

# 2. llama.cpp avec Metal + Flash Attention
git clone https://github.com/ggerganov/llama.cpp && cd llama.cpp
make GGML_METAL=1 LLAMA_METAL_EMBED_LIBRARY=1

# 3. Téléchargement Q4_K_M (~170 Go split en chunks)
huggingface-cli download deepseek-ai/DeepSeek-V4-Flash-GGUF \
  --include "*Q4_K_M*.gguf" \
  --local-dir ./models

# 4. Lancement avec optimisations max
./build/bin/llama-server \
  -m ./models/DeepSeek-V4-Flash-Q4_K_M-00001-of-00004.gguf \
  -ngl 99 -fa \
  -ctk q8_0 -ctv q8_0 \
  -c 65536 \
  --host 0.0.0.0 --port 8080
→
启动后
服务器在 http://localhost:8080 提供兼容 OpenAI 的 API。将 Open WebUI、Continue.dev、Aider、Raycast AI 接入该 API——它们都能与您的本地前沿模型配合使用。

#5. NVIDIA 多 GPU 配置

#选项A — vLLM 4× RTX A6000(48 GB × 4 = 192 GB)

vLLM张量并行
pip install vllm>=0.7

vllm serve deepseek-ai/DeepSeek-V4-Flash \
  --tensor-parallel-size 4 \
  --quantization fp8 \
  --max-model-len 1000000 \
  --enable-prefix-caching \
  --port 8000

#选项B — 使用llama.cpp进行部分卸载

2× RTX 5090 + 卸载至 CPU
./build/bin/llama-server \
  -m ./models/DeepSeek-V4-Flash-Q4_K_M-00001-of-00004.gguf \
  -ngl 50 \
  --tensor-split 0.5,0.5 \
  -ctk q8_0 -ctv q8_0 \
  -c 32768
!
Offload = 慢
无法装入 VRAM 的部分将转入系统 RAM(DDR5 约 80 GB/s,对比 HBM3 的 1 TB/s)。如果 50% 卸载到系统内存,速度会降至 3-5 tok/s。对于交互式使用,请确保 100% 装入 VRAM。

#6. 基准测试及实测 tokens/sec

DeepSeek 发布的基准测试(2026 年 4 月 24 日),High 模式下的数值
BenchmarkV4 FlashV4 ProLlama 4 Scout 109BMistral Large 2
MMLU-Pro79.484.276.875.3
GPQA Diamond70.178.563.259.4
AIME 202576.587.061.352.1
LiveCodeBench v572.679.865.461.8
LongBench v2 (1M)68.972.6——
测得的 tokens/秒(聊天模式,上下文长度 4k,Q4_K_M)
SetupNon 模式下的 Tok/sHigh 模式下的 Tok/sMax 模式下的 token/s
Mac Studio M3 Ultra 256 GB10-128-105-7
Mac Studio M3 Ultra 512 GB12-1410-127-9
4× RTX A6000 48GB20-2516-2012-15
2× RTX 5090 + 64 GB 卸载至系统内存3-52-41-2

#7. 思考模式与长上下文

V4 Flash继承了V4 Pro的三种推理模式,但质量略低,推理成本显著更低。这适用于需要推理但不占用大量基础设施的智能体。

Non 模式
直接回答。延迟极低(约 1 秒即可开始流式输出)。适用于日常对话和翻译。
High 模式
回答前生成 200–2000 个 token 的思维链。数学和编程任务的质量提升 25%。最终回答的第一个 token 输出前,延迟为 5–15 秒。
Max 模式
最多使用 16k 个思考 token。本地运行延迟为 1–5 分钟。应留给高难度问题使用(数学证明、复杂调试)。
长上下文 1M
得益于HCA,具备与V4 Pro相同的能力——在1M上下文的Needle-in-Haystack(大海捞针)测试中约为95%(Pro为98%)。非常适合大型数据库上的RAG。

#V4 Flash 与 V4 Pro:选择其一

简要对比
标准V4 Flash 284BV4 Pro 1.6T
总参数284 B1 600 B
每个 token 激活的参数13 B49 B
VRAM Q4_K_M170 GB960 GB
本地最低硬件要求Mac Studio Ultra 256 GB(二手M3 Ultra或全新M5 Ultra)集群约80,000欧元
本地运行的典型速度(token/秒)10-250,5-2
MMLU-Pro 表现79.484.2
AIME 2025 表现76.587.0
原生上下文支持1 M1 M
最高强度思考模式是是(质量更优)
许可证MITMIT
→
何时选择 Flash,何时选择 Pro
V4 Flash:适用于 95% 的场景——聊天、编程、RAG、智能体、长上下文。唯一能在工作站上容纳的前沿模型。V4 Pro:纯研究(数学、证明、AIME 竞赛),以及最高质量比延迟和硬件成本更重要的工作流。

#2026年7月31日正式发布(版本 0731)

DeepSeek 于 2026 年 7 月底通过“0731”构建版本让 V4-Flash 结束了预览阶段:API 进入公开 beta 测试,同时 V4-Pro 的输出价格下降了 75%(每百万输出 token 0.87 美元)。Artificial Analysis 再次将 V4 系列列为“开放权重模型中的领先者之一”。模型权重方面没有变化:总参数量为 284B,激活参数量为 13B——在采用激进量化的情况下,它仍是唯一一个在高端本地配置(256 GB 内存的 Mac、Strix Halo、多 GPU)上勉强具有运行可行性的 V4 变体。

自 8 月 2 日起,LM Studio 也提供该服务:如果您的机器性能足够,可在本地运行;或通过 Bionic 应用在美国服务器上运行,默认启用“零数据保留”——这是一个需要了解的折中方案,尽管本网站的哲学仍是 100% 本地化。

#FAQ

DeepSeek V4 Flash 是否真的能在 Mac Studio M3 Ultra 256 GB 上运行?+
是的,在 Q4_K_M 下:170 GB 模型 + 30 GB 32k 上下文 + 8 GB 系统 = 约 210 GB,在 256 GB 范围内。实测速度:Non 模式下为 10-12 tok/s,High 模式下为 8-10 tok/s。这是 2026 年 4 月唯一能实现此配置的单机 Mac。
本地部署V4 Flash可行方案的成本是多少?+
三种预算方案:(1) Mac Studio Ultra 256 GB——二手M3 Ultra(截至2026年9月,新机售价为7,300欧元)或全新M5 Ultra。(2) 约12,000欧元——4块二手RTX A6000 48GB显卡加工作站。(3) 约11,400欧元——2块RTX 5090加64 GB DDR5内存,并将部分模型卸载到系统内存,但速度较慢(3–5个token/秒)。
应该选择 V4 Flash,还是等待 70B 蒸馏模型?+
DeepSeek 宣布将在 4 到 6 周内推出 70B 和 32B 模型的蒸馏版本。如果您没有 Mac Studio Ultra 或 GPU 集群,等待是合理的。如果您已有相关设备,V4 Flash 现在即可使用 >> 5 周内完成 70B 模型蒸馏(质量更高,上下文长度达 1M)。
V4 Flash能超越Llama 4 Maverick / Scout吗?+
根据 DeepSeek 发布的基准测试:是的,在所有测试中均如此(MMLU-Pro 79.4 对 Scout 的 76.8,GPQA 70.1 对 63.2)。独立确认预计将在 2 周内通过 Chatbot Arena 发布。V4 Flash 的明显优势:原生 1M 上下文,而 Llama 4 仍为 256k。
Mac Studio M3 Ultra 在运行 V4 Flash 推理时的功耗是多少?+
生成时功耗峰值约 150 W,加载后空闲功耗约 30 W。持续 8 小时使用约消耗 1.2 kWh,即每日约 0.30 欧元(法国 2026 年电价)。待机状态下 LED 灯泡的功耗更高。
Thinking Max 模式在 V4 Flash 上是否值得使用?+
在 Mac Studio 上:对于难题(如数学、证明、调试)确实可行,但每条回复需耗时 1-5 分钟。日常聊天场景下,High 模式已足够(8-10 tok/s,质量约等于 Mistral Large × 2)。
能否在本地对 V4 Flash 进行微调?+
LoRA / QLoRA:可以,在配备 512 GB 内存的 Mac Studio Ultra 上通过 MLX-LM(需根据安装版本确认支持情况),或在 NVIDIA 硬件上通过 unsloth(至少需要 4 张 A6000)实现。全量微调:本地不可行——云端训练成本估计为 20 万至 40 万美元。
截至2026年4月25日,是否存在稳定的Q4量化版本?+
官方 GGUF Q4_K_M 和 Q5_K_M 量化版本将于本周末(4 月 26-27 日)在 HuggingFace 发布。用于 vLLM 的 AWQ 量化版本:已可用(deepseek-ai/DeepSeek-V4-Flash-AWQ)。请在 X 上关注 @DeepSeek_AI 以获取公告。

价格变动迅速:我们每周一和周四追踪本地 AI 显卡的最低价格,并列出每 GB VRAM 的价格。

这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。