首页 › 对比工具 › Mistral Small 3.1 24B 对比 Llama 3.3 70B Instruct

Mistral Small 3.1 24BvsLlama 3.3 70B Instruct

完整对比: Mistral Small 3.1 24B (24B 参数,Mistral AI)以及 Llama 3.3 70B Instruct (70B,Meta)。各量化方式所需的 VRAM、在 4 款参考 GPU 上测得的每秒 token 数、针对各使用场景的评判、许可证及安装命令。所有数值均根据模型目录数据计算得出——页面之间没有复制粘贴。

简而言之

特性 Mistral Small 3.1 24B Llama 3.3 70B Instruct
参数 24B 70B
系列 Mistral Llama
作者 Mistral AI Meta
来源国 FR US
许可证 Apache 2.0 Llama 3.3 Community
上下文 128 000 个 token 128 000 个 token
发布日期 2025年3月 2024年12月

内存占用

使用中等上下文窗口进行推理所需的大致 VRAM。获胜者(绿色)是消耗 更少 —— 小模型占优。

量化 Mistral Small 3.1 24B Llama 3.3 70B Instruct
Q4_K_M(轻量) 14 GB 40 GB
Q5_K_M(平衡) 17 GB 48 GB
Q8(近乎无损) 26 GB 75 GB
FP16(最高质量) 48 GB 140 GB
仅使用 CPU 时所需的 RAM 24 GB 64 GB

预估速度(tokens/秒)

估算基于每个 GPU 上可运行的最佳量化。实际数字取决于提示词、上下文和引擎(llama.cpp、vLLM、MLX)。 方法说明.

参考 GPU Mistral Small 3.1 24B Llama 3.3 70B Instruct
RTX 4090 (24 GB) 40 tok/s · Q5_K_M ✗ 过于庞大
RTX 4080 (16 GB) 15 tok/s · Q4_K_M ✗ 过于庞大
RTX 3060 12GB (12 GB) ✗ 过于庞大 ✗ 过于庞大
Apple M4 Pro (48 GB) (36 GB) 15 tok/s · Q8 ✗ 过于庞大

各使用场景的结论

对于每种常见用途,我们都会根据两个模型各自的标签、规模和专长,指出哪一个更适合。

通用聊天
Llama 3.3 70B Instruct 胜出。 对于此用途,模型能力与使用限制之间的最佳平衡。
正式法语
Mistral Small 3.1 24B 胜出。 使用丰富的法语语料库训练,在习语表达方面表现更佳。
推理 / 数学
Llama 3.3 70B Instruct 胜出。 显式推理模型(思维链),在数学/逻辑问题上表现更好。
视觉 / 图像
Mistral Small 3.1 24B 胜出。 原生支持图像输入。
RAG / 长文档
Llama 3.3 70B Instruct 胜出。 更大的上下文窗口(128 000 tokens),适用于长文档。
智能体与工具使用
Llama 3.3 70B Instruct 胜出。 在工具使用和遵循多步骤指令方面表现更好。
本地 AI 套件

只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。

  • 在线空间,终身可用
  • PDF + 文件
  • 终身更新

优势与劣势

Mistral AI · 24B

Mistral Small 3.1 24B

增加了视觉能力的 Small 3。128k 上下文,Apache 2.0 许可。自 2025 年 6 月起被 Small 3.2 取代。

  • 24B 模型集成视觉与文本能力
  • 128k 上下文
  • Apache 2.0
  • 推理速度约 150 tok/s
  • 要求 Ollama ≥ 0.6.5
  • Small 3.2(2025 年 6 月)在原有基础上略有改进

安装

ollama run mistral-small3.1:24b
Meta · 70B

Llama 3.3 70B Instruct

以六分之一的规模达到 Llama 3.1 405B 的质量。权重采用社区许可,HF 访问受限。

  • 质量达到 405B 至 1/6 规模
  • 128k 上下文
  • 推理和编程能力极强
  • HF 受限模型(需接受 Meta 条款)
  • 带有 >700M MAU 条款的社区许可证
  • 无视觉功能

安装

ollama run llama3.3:70b

常见问题

在 RTX 4090(24 GB)上运行效果更佳的模型是 Mistral Small 3.1 24B 还是 Llama 3.3 70B Instruct?

在 RTX 4090 上,Mistral Small 3.1 24B 运行时采用 Q5_K_M (约 40 tokens/秒),Llama 3.3 70B Instruct 同样无法装入 24 GB 显存。请参见 配置工具 以测试您的具体 GPU。

Mistral Small 3.1 24B 与 Llama 3.3 70B Instruct:哪个的法语表现更好?

对于正式法语(写作、摘要、翻译), Mistral Small 3.1 24B 占据优势——使用丰富的法语语料库训练。另一个仍可使用,但适用于要求较低的场景。

哪个模型 VRAM 占用最少?

在 Q4_K_M 量化下, Mistral Small 3.1 24B 占用 14 GB,而竞争对手需要 40 GB,相差 26 GB;若目标为 RTX 3060 或 4060 Ti 8 GB 显卡,这一差距具有显著影响。

这些模型可用于商业生产环境吗?

Mistral Small 3.1 24B 采用 Apache 2.0 许可证——可自由用于商业用途。 Llama 3.3 70B Instruct 采用 Llama 3.3 Community 许可证——也请核查其条款。对于 SaaS,优先选择 Apache 2.0 或 MIT 许可证。

2026 年选哪个?

这取决于您最主要的限制条件。 更小 / 更快 : Mistral Small 3.1 24B (24B)。 能力更强 : Llama 3.3 70B Instruct (70B)。若犹豫,可先运行 配置工具 结合您的 GPU 和使用场景——它将基于这两者做出判断。

值得考虑的替代方案

如果两者都不适合您,以下是您可以探索的相近模型。

深入了解