EuroLLM 22B vs Mistral Small 24B:欧洲主权模型
对比 EuroLLM 对比 Mistral Small,就是深入审视欧洲数字主权的两种截然不同的愿景:一个模型出自学术界与产业界联合组建的联盟,旨在覆盖欧盟的 24 种官方语言;另一个由一家巴黎初创公司开发,该公司的模型已成为全球开放权重领域的标杆。这两个模型的参数规模为 220 亿至 240 亿,面向相同的使用场景——在 PC 或小型推理服务器上本地部署——但训练重点却截然不同。本文对比它们在不同量化方式下的显存需求、公开基准测试得分、许可证及具体应用场景,帮助您做出合适的选择。
起源与愿景:两条欧洲发展路径
EuroLLM 22B 是EuroLLM项目的结果,该项目由一个联盟推动,其中Unbabel和Instituto de Telecomunicações为核心成员,并获得欧洲机构支持。该项目的明确目标已记录在 EuroLLM 联盟在 arXiv 上发表的论文 :训练能够公平处理波兰语、匈牙利语或罗马尼亚语等数据稀缺欧洲语言的多语言模型,同时不牺牲法语、德语或西班牙语的表现。22B 版本相较于初始的 17 亿和 90 亿参数版本实现了性能跃升。
Mistral Small 24B (也称为 Mistral Small 3.1)由 Mistral AI 开发,这是一家于 2023 年在巴黎成立的初创公司。其思路有所不同:通过精心优化的稠密架构、扩展的上下文窗口和通用能力,最大化每个参数的效能,而非采用面向机构的多语言定位。 Mistral AI 官方文档 确认上下文长度为 128,000 个 token,并采用完整的 Apache 2.0 许可证。
这两种发展路径在 quelllm.fr 收录的法语生态中并存,同处这一生态的还有 Mistral Large 3 675B 或 Mixtral 8x22B Instruct 用于更大规模的需求。
技术规格:显存、上下文长度和量化
硬件问题通常是首先需要解决的问题。以下是这两个模型在各个量化级别下的估算。
EuroLLM 22B — VRAM估算
- 参数 :220 亿参数(稠密架构)
- Q4_K_M :估计约 13 GB — 兼容 RTX 4080 16 GB、RX 7900 XTX
- Q5_K_M :估计约需 16 GB——推荐使用 RTX 4090
- Q8_0 : 约 23 GB(估算值)— 超出大多数消费级 GPU 的容量,需双 GPU 或服务器支持
- FP16 :约 44 GB——仅适用于服务器基础设施
- 上下文窗口 :需根据已发布的版本确认;早期版本的上下文窗口为 4,096 至 32,768 个 token
- 支持的语言 :欧盟的 24 种官方语言及英语,特别关注低资源语言
Mistral Small 24B — VRAM估算
- 参数 :240亿(稠密架构,分组查询注意力)
- Q4_K_M :估计约需 14 GB — RTX 4080 16 GB 余量充足,RTX 4080 12 GB 则处于容量极限
- Q5_K_M :估计约 17 GB — 推荐使用 RTX 4090
- Q8_0 :估计约需 25 GB — 超出单张消费级 GPU 的显存容量
- FP16 : ~48 GB — 多GPU服务器
- 上下文窗口 :128 000 tokens(已在 HuggingFace mistralai)
- Tokenizer :扩展版 SentencePiece,多语言支持良好
实际应用中,20亿参数的差异微乎其微。真实差距主要来自分词器、训练数据以及各项目的优化目标。
要了解每个量化级别对推理质量的实际影响, quelllm.fr 的量化指南 详细说明可量化的权衡。
基准测试:性能对比
现有的公开基准测试可用于部分比较。在撰写本文时,社区仍在汇总核实 EuroLLM 22B 的多项分数——下列数字是估算值,需在官方仓库中进一步确认。
MMLU(大规模多任务语言理解)
- Mistral Small 24B : ~79–82% 预估,与此前发布的Mistral 24B模型一致
- EuroLLM 22B : 待确认 — 该项目的 9B 版本在目标语言上的 MMLU 得分具有竞争力,但在英语方面仍低于纯英美中心模型
HumanEval(代码生成)
- Mistral Small 24B : ~70–74% pass@1 估算值,代码是 Mistral AI 的强项
- EuroLLM 22B :在该项目中并非优先事项;性能预计较低(约 45–55%),有待通过社区基准测试确认
多语言基准测试(EuroLLM 的结构性优势)
多语言评估最能体现 EuroLLM 22B 存在的价值。在 FLORES+(机器翻译)、MMLU 的各语言版本,或针对欧盟低资源语言(波兰语、罗马尼亚语、匈牙利语、希腊语)的专项基准上,EuroLLM 的训练目标是超越同等规模的通用模型——包括 Mistral Small 24B。
AIME 与数学推理
这两款模型都不面向高阶推理领域。在 AIME 上,未经数学专项优化的 22–24B 模型,相比一些 MoE 架构,表现仍较为有限,例如 Qwen 3 235B-A22B 从总计 235B 的参数中激活 22B 参数。
许可证:专业用途下有哪些不同
许可证往往是决定性因素,甚至需要先于性能加以考虑。
EuroLLM 22B :该项目的先前版本采用 Apache 2.0 或 CC-BY 4.0 许可证。22B 版本的许可证需在官方仓库确认。此前通常允许免版税的商业使用,但须注明出处。
Mistral Small 24B :分发所采用的许可证为 Apache 2.0, 最宽松的开源权重大模型许可。修改、再分发、商业集成:均无需限制或费用,完全允许。与 Mistral Medium 3.5 128B, 这使得企业采用决策更加简便。
对于受欧洲法律约束(如 GDPR、数据主权)的团队,两个模型均支持完全本地部署,无需将数据传输至第三方服务。
具体用例
何时选择 EuroLLM 22B?
- 机构多语言应用 :提供至少 10 种欧盟语言的客户服务、翻译官方文件、提供议会或行政助理
- 优先考虑低资源语言 : 波兰语、捷克语、罗马尼亚语、匈牙利语——EuroLLM 是针对这些语言专门训练的,而通用模型在这些语言上表现不佳
- 研究项目或欧盟资助 :与欧洲数字主权倡议保持一致,有助于在资金申请材料中论证技术选型的合理性
- 敏感数据限制 本地部署,无需依赖欧盟以外的供应商
何时选择 Mistral Small 24B?
- 通用型法语任务 : 写作、摘要、提取、分类——Mistral 在法语任务上表现优异,无需特殊配置
- 代码与技术任务 : 在HumanEval和编程任务上具有明显优势
- 长上下文,最多支持128k token :文档分析、知识库、RAG 流水线
- 单 GPU 自托管部署 :其每个参数所发挥的效能和更大的上下文窗口,使它适用于配备 RTX 4090 的本地推理服务器
- 生态系统与集成 :与 llama.cpp 的兼容性、原生函数调用和 Mistral 文档,使集成到现有流水线中更加直接
Le quelllm.fr 配置器 可让您根据 GPU 和目标语言筛选模型,从而进一步缩小选择范围。
在开放权重生态中的定位
EuroLLM 22B和Mistral Small 24B的参数量为220亿至240亿,处于一个明确的细分区间:高于能装入8 GB显存的70亿至130亿参数模型,但远低于MoE架构或需要多块高端GPU的超大型稠密模型。
如 DeepSeek、Mistral 等模型 DeepSeek R1 671B 或 Llama 4 Maverick 400B 在复杂任务上优于这两个模型,但在 Q4 量化下需要配备 200–400 GB 显存的基础设施。在配备 24 GB 显存的 RTX 4090 上,EuroLLM 22B 和 Mistral Small 24B 采用 Q4_K_M 量化时都是切实可行的选择,能够流畅推理。
对于已拥有多 GPU 基础设施并寻求更强大 Mistral 模型的团队, Mistral Small 4 (119B) 在 Q4 量化下需要 72 GB 显存,是该系列中更高一级的选择。
FAQ
Q:EuroLLM 22B在法语表现上是否优于Mistral Small 24B?
不一定。得益于其通用训练数据,Mistral Small 24B 对法语的支持非常充分。EuroLLM 22B 的附加价值主要体现在波兰语、匈牙利语、罗马尼亚语等数据覆盖较少的欧洲语言上,而非法语或西班牙语;对于后两者,Mistral 无需特别投入就已具备竞争力。
Q:运行这两个模型所需的最低VRAM是多少?
采用 Q4_K_M 量化时,EuroLLM 22B 的预计显存需求为 13–14 GB,Mistral Small 24B 为 14–15 GB。RTX 4080 16 GB 可以轻松运行两者。RTX 4090 24 GB 则能为 Q5_K_M 留出余量。显存低于 12 GB 时,可以考虑 Q3 量化,但模型质量会明显下降。
Q:EuroLLM 22B的许可是否允许商业用途?
EuroLLM 项目的早期版本采用 Apache 2.0 或 CC-BY 4.0 许可,允许商业使用。22B 版本在商业部署前,需在官方仓库中确认其许可状态。Mistral Small 24B 则明确采用 Apache 2.0 许可,无任何商业限制。
Q:Mistral Small 24B 是否支持函数调用?
是的。Mistral Small 24B (3.1) 原生支持 Mistral 格式的函数调用,官方 SDK 文档对此有详细说明。EuroLLM 22B 侧重学术多语言研究,并未将函数调用列为优先事项——22B 版本的工具使用能力仍有待确认。
Q:在哪里可以找到用于自托管的 GGUF 文件?
Mistral Small 24B 的 GGUF 文件可在 HuggingFace 通过维护良好的社区仓库获取。对于较新的 EuroLLM 22B,请查看联盟的官方仓库和社区贡献——根据可用版本,可能需要手动转换。
Q:EuroLLM 22B与Mistral Small 4相比如何?
Mistral Small 4 (119B) 属于不同级别:1190 亿参数,而对比的模型为 22–24B;Q4 量化下需要 72 GB 显存。它在几乎所有任务上都优于所比较的两个模型,但需要显著更庞大的 GPU 基础设施。EuroLLM 22B 和 Mistral Small 24B 仍是在单张消费级 GPU 上自托管的现实选择。
结论
对比 EuroLLM 对比 Mistral Small 表明这两种工具更多是互补关系,而非竞争关系:Mistral Small 24B 是在单 GPU 上自托管、处理通用任务、编程和长上下文的首选,而 EuroLLM 22B 则满足了机构在欧洲多语言覆盖方面的具体需求,尤其是针对低资源语言。选择首先取决于您的目标语言和硬件限制。请浏览收录了 249 个模型的 quelllm.fr 目录 或使用 配置工具 以找到适合您GPU和使用场景的模型。
本地运行 LLM 所需的硬件
要在本地流畅运行这些模型,一张 RTX 5070 Ti 提供出色的性价比。比较价格:
联盟推广链接——QuelLLM 可能会从购买中获得佣金,您无需支付额外费用。作为亚马逊联盟合作伙伴,QuelLLM 会从符合条件的购买中获得收益。