Magistral Small 24B 与 Qwen 3 32B 对比:迷你 Mistral 2026

Le Magistral Small 24B 是 Mistral AI 的紧凑推理模型,专为在单张消费级 GPU 上本地运行而设计。相比之下, Qwen 3 32B 由阿里巴巴推出,自 2025 年发布以来,已成为中等规模稠密模型中开放权重模型的标杆之一。本文详细比较这两个模型:各量化级别的显存需求、实际硬件上的推理速度、许可证、公开基准测试结果以及具体使用场景。无论您是搭建侧重推理的工作站,还是寻找用于长文本处理的通用模型,本页面都能为您提供选择所需的信息。


两个模型的介绍

Magistral Small 24B

Magistral Small 24B属于Mistral AI的Magistral系列,该系列还包括一个规模更大的版本(Magistral Medium,约1230亿参数)。其主要特点是侧重于 结构化推理 :模型在生成最终回答前,会先生成中间思维链(chain-of-thought),这使其区别于前几代 Mistral 模型。该模型拥有 240 亿参数,定位于采用 Q4 量化后可在显存为 24 GB 的 GPU 上运行的 LLM。

官方技术文档可在 HuggingFace — mistralai/Magistral-Small-2506 以及在Mistral AI 的公告.

Qwen 3 32B

Le Qwen 3 32B 是一个模型 dense (非MoE) 由阿里云研究团队研发,源自家族 Qwen 的第三代。其密集架构使其在VRAM消耗方面比同家族的MoE变体(如 Qwen 3 235B-A22B 仅在推理时激活 220 亿参数,尽管其总参数量为 2350 亿。Qwen 3 32B 覆盖范围广泛:编码、数学推理、多语言处理、长上下文支持。

官方文档见 HuggingFace — Qwen/Qwen3-32B 以及 Qwen 博客.


技术规格和显存

关于VRAM的估算,经验法则为:参数 × 0.5至0.55GB(Q4)、×1GB(Q8)、×2GB(FP16)。以下数值基于该方法及社区反馈得出——请根据您的后端环境(llama.cpp、llamafile、LM Studio)进行验证。

Magistral Small 24B

采用 Q4_K_M 量化时,模型可以轻松装入 RTX 4090(24 GB)的显存,并为短上下文的 KV 缓存留有余量。采用 Q8 量化时,显卡达到容量极限;较长的会话更适合使用 RTX 6000 Ada(48 GB)或 A5000。

Qwen 3 32B

Qwen 3 32B 采用 Q4 量化时能装入 RTX 4090 的显存,但在长上下文(64K tokens 及以上)下,KV 缓存会使总显存占用超过可用的 24 GB。若要舒适地使用长上下文,建议选择配备 48 GB 显存的显卡(RTX 6000 Ada、A40)。

如需进一步了解不同量化方案下的显存需求计算,请参见 哪个LLM 的 VRAM 使用指南.


推理速度

以下数据基于 llama.cpp 和 LM Studio 的社区反馈估算得出。具体数值会因硬件、提示词长度、后端以及实际使用的具体量化方案而异。

在 RTX 4090(24 GB,Q4_K_M)上

Magistral Small 24B - 生成 : ~25–40个token/秒(估算值,短提示)- Prefill : ~1 500–2 500 个 token/秒(估算)

Qwen 3 32B - 生成 : ~18–28 tokens/sec(估算,短提示)- Prefill : ~1 000–1 800 tokens/sec(估算)

更轻量的模型(24B)在同一 GPU 上生成速度明显更快——采用 Q4 量化时,每秒生成的 token 数约增加 30% 至 50%(估算值)。在配备 48 GB 显存的 GPU 上,或采用多请求批处理配置时,差距会缩小。

在 Apple M3 Max(128 GB 统一内存)上

配备 Apple 芯片的Mac可流畅运行两个模型,包括在64GB RAM下以Q8精度运行24B模型。


许可证

Magistral Small 24B Mistral AI 已发布其开放模型,不同版本采用 Apache 2.0 或 Modified MIT 许可证。在任何商业使用或再分发之前,必须在 HuggingFace 官方模型页面核实 Magistral Small 24B 的确切许可证。不要仅凭模型所属系列推定其许可证。

Qwen 3 32B 发布所采用的许可证为 Apache 2.0,允许商业使用、修改和再分发,无需支付许可费,但须保留法律声明。这是Qwen 3 32B相较于采用更严格社区许可证的模型的一项实际优势。

按许可证类型筛选目录中的模型,请访问 quelllm.fr/catalogue.


基准测试与性能对比

基准测试结果会因模型版本、评估框架和生成参数而异。以下数值来自公开报告或估算——请在官方排行榜上核实,例如HuggingFace开源LLM排行榜 ,然后再据此做出部署决策。

MMLU(通用知识)

Qwen 3 32B 受益于阿里巴巴海量的训练数据,其中学术和多语言内容尤其丰富,这也体现在 MMLU 表现上。

HumanEval (编程)

在标准基准测试的纯编程任务中,Qwen 3 32B 仍占优势。不过,在需要分多个步骤拆解的复杂算法问题上,Magistral Small 的推理模式可能弥补这一劣势。

AIME(数学推理)

在AIME等推理基准测试中,Magistral Small 24B 旨在脱颖而出。其链式思维(chain-of-thought)设计使其能以结构化方法而非模式匹配方式应对竞赛数学问题。精确得分仍需在公开排行榜上得到验证。

在quelllm.fr目录中的定位

以下说明这两个模型在生态系统中的位置:


具体用例

何时选择 Magistral Small 24B

何时选择Qwen 3 32B


FAQ

Q:Magistral Small 24B 是否能在RTX 4090上运行?

是的,在 Q4_K_M 情况下,需要约 13 GB VRAM —— 一块 RTX 4090(24 GB)在短上下文场景下运行时,仍有足够的内存用于 KV-cache。在 Q8 情况下,24 GB 内存会被完全使用;超长上下文(填充 32 K 个 token)可能导致内存饱和。实际上,Q5_K_M 在该显卡上提供了良好的质量与 VRAM 之间的平衡。

Q:Qwen 3 32B 的许可证是什么?

Qwen 3 32B 发布时采用的许可证是 Apache 2.0,这是一种宽松的许可证,允许商用、修改和再分发。将其集成到产品或服务中无需支付许可使用费,但须保留原有的法律声明。这是开放权重生态中最有利的许可证之一。

Q:在 RAG(检索增强生成)场景下,选择 Magistral Small 24B 还是 Qwen 3 32B?

在 RAG 场景中,Qwen 3 32B 凭借原生 128 K token 上下文窗口和出色的文档理解能力占据优势。Magistral Small 24B 则可借助推理模式,在复杂查询中生成结构更清晰、论证更充分的回答。选择主要取决于摄入文档的长度和所提问题的复杂程度。

Q:两个模型之间是否存在显著的速度差异?

是的。Magistral Small 24B 的参数量少了 80 亿,因此在同一 GPU 上的生成速度明显更快——在 RTX 4090 上运行 Q4 量化版本时,每秒生成的 token 数约高出 30% 至 50%(估算值)。在配备 80 GB 显存的 GPU 上或采用批处理部署时,这种差异会减弱,因为显存带宽不再是主要限制因素。

Q:Magistral Small 24B 是否支持'思考'模式?

是的,这是它相较于上一代 Mistral LLM 的主要特点。它会先生成中间推理过程,再给出最终回答。启用方式取决于所用的后端(llama.cpp、LM Studio 等),可以通过提示词格式或专用选项启用。具体实现细节需查阅 HuggingFace官方文档.

Q:如何将这些模型与 哪个LLM 模型目录中的其他 LLM 进行比较?

Le 哪个LLM 目录 列出 249 个模型,其显存规格、许可证和 tokens/秒指标均可筛选。要与另一款规模相近的模型直接比较, 内置对比工具 可根据您的标准(可用 VRAM、许可证、用途)并列比较不同模型。


结论

Le Magistral Small 24B 与 Qwen 3 32B 在相近的模型规模下体现了两种设计理念:前者注重结构化推理,后者则以稠密架构提供多用途能力。如果您优先考虑在 24 GB 显存的 GPU 上的推理速度和逐步推理质量,Magistral Small 24B 值得认真评估。如果您更看重编程、长上下文和明确无歧义的 Apache 2.0 许可证,Qwen 3 32B 是可靠的选择。查看按显存和许可证筛选的全部模型,请访问 quelllm.fr/catalogue,或让 配置工具 根据你的确切配置进行筛选。

文章发布及更新于 由 Mohamed Meguedmi · 数据来源: /api/models.json · 内容许可协议: CC BY 4.0.

有错误或更新需要反馈吗? 参与贡献.