适用于 ESN 技术支持(IT)的最佳 LLM

部署本地 IT 支持 AI 能应对 IT 服务企业(ESN)面临的一项实际约束:工单、日志和运行手册包含受保密条款保护的客户数据。使用本地 IT 支持 AI,这些内容会保留在您掌控的机器上,每条回复也都可以关联到来源。

本页面仅涉及内部IT支持:技术工单的定级、清理日志的阅读、运行手册的检索、可追溯性及升级流程。商业运营、退款及客户服务翻译由服务指南覆盖 使用本地 LLM 提供多语言客户支持.

内容安排:选择标准、模型筛选、不同量化格式下的内存需求、吞吐量与基准测试、许可证,最后是部署流程。

ESN 的 IT 支持业务对模型的要求

内部技术支持所需的能力与通用助手不同。以下四项标准很重要:

模型精选:七个采用 Q4 量化、大小在 68 至 85 GB 之间的模型

以下模型是本页面参考目录中最轻量级的。所有模型均需配备大内存的服务器或工作站,而非技术人员的普通电脑。

两个模型受限于其 32,768 个 token 的上下文长度: dots.llm1 Instruct (142B,MIT,~85 GB) 和 DBRX Instruct (132B,Databricks Open Model License,约 76 GB)。这些模型适合工单分类,但不太适合日志分析。

对于拥有更多内存的团队, Step 3.5 Flash (196B, Apache 2.0, ~118 GB) 和 MiniMax-M2.7 (229B,Apache 2.0,约 138 GB)构成下一档选择。

不同量化方式和硬件下的内存需求

只有 Q4 的数值来自模型目录。其他量化级别的数值是按比例关系估算的大致量级,需要在各模型资料页上确认。

针对118B-128B级别模型:

对于 Mixtral 8x22B Instruct(141B):

这些数值不包含上下文开销:加载包含 100000 个 token 的日志会额外占用数 GB 缓存。请预留至少 15% 至 20% 的余量(估算值)。

在硬件方面,72 GB 的 Q4 版本能装入配备 96 GB 统一内存的机器,但余量很小;在 128 GB 的机器上则更宽裕。相关页面 Mac 96 GB et Mac 128 GB 详细说明这些配置。在 PC 上需组合多张显卡:详见指南 为本地LLM选择GPU.

吞吐量与基准测试:仍有待确认的事项

这里未公布这七个模型的任何实测吞吐量:每秒生成的token数需要在您的硬件上确认。以下是两个定性参考:

关于MMLU或HumanEval分数,请参见Open LLM Leaderboard 以及相关技术文档 目录. 这些分数需按模型逐个验证,且无法准确反映支持服务的实际能力。

内部测试集更可靠:50 个已关闭并匿名化的工单,包含类别、严重程度及真实解决情况。测量正确的分类率、运行手册中精确引用率以及误升级次数。该页面 本地基准测试 介绍了吞吐量的测量方法。

许可证:在客户处安装前需确认

使用指南 企业本地LLM及GDPR合规 针对工单中包含的个人数据,对这一点作了补充说明。

部署流程:工单、已脱敏日志、运行手册、问题升级处理

本地支持链路包含五个步骤:

  1. 确定性脱敏 : 一个脚本在将任何数据发送至模型之前,会将 IP 地址、主机名、令牌和电子邮件地址替换为中立标识符。对应映射表保留在模型之外。
  2. 在运行手册中搜索 :操作规程被切分并建立索引,然后模型仅接收相关段落及其出处。
  3. 分类 : 模型返回包含类别、严重程度、原因假设及引用来源的JSON数据。
  4. 升级规则 :任何无来源的回答、任何高严重性事件以及任何修改生产环境的操作,均须转交技术人员处理。
  5. 日志 : 每次对话都会记录模型版本、量化方式、提示词以及所使用的文本片段。

团队界面方面, Open WebUI 连接本地服务器。使用指南 在内网部署团队聊天机器人 详细介绍了安装过程,而 本地智能体架构 介绍工具调用。

FAQ

Q:这些模型能在技术人员的电脑上运行吗?

不能。所选模型中最轻量的 Laguna S 2.1,在 Q4 量化下约需 68 GB 内存,不计上下文。现实可行的方案是共享服务器或配备 96–128 GB 内存的工作站,由团队通过内部网络向其发送请求。对于配置较低的机器,本站配置器会推荐适合其可用内存的模型。

Q:是否需要在我们的工单上对模型进行微调?

不应首先考虑微调。在运维手册中检索并附上引用,就能获取 ESN 的术语和流程,无需重新训练。如果输出格式仍不稳定,或分类效果在您的测试集上遇到瓶颈,微调才有用。微调需要匿名化数据,并须核查模型许可证。

Q:模型能否自行删去日志中不应保留的内容?

不建议这样做。模型可能漏掉长文本片段中的某个 IP 地址或令牌。敏感信息的删除必须由一个确定性的、经过测试并纳入版本管理的脚本在模型处理之前完成。随后,模型使用不含敏感信息的标识符进行处理,而这些标识符与真实值之间的对应关系保留在一个独立系统中。

Q:该模型能否独立完成工单关闭?

初期最好避免这样做。模型先给出分类评估和解决思路,再由技术人员确认。经过几周的测量后,可以将某些低风险类别自动化处理,例如资料查询请求。生产环境故障和需要特权的操作仍须由人工确认。

Q:日志分析的最小上下文需求是什么?

应至少选择 64,000 tokens 的上下文窗口,Mixtral 8x22B Instruct 就能满足;如果要关联分析多个文件,最好选择 128,000 tokens 或更大。上下文窗口为 32,768 tokens 的模型会迫使你把文本片段切得很细。更大的上下文会消耗更多内存,并降低生成速度:发送日志前请先进行过滤。

Q:该推荐是否涵盖客户服务?

不是。它针对的是数字服务企业(ESN)的内部 IT 支持:故障、日志、运维手册和升级处理。商业交流、退款以及与最终客户的对话翻译涉及其他评估标准,尤其是多语言质量。这些内容已在使用本地 LLM 提供多语言客户支持的专题指南中介绍。

结论

对于 IT 服务企业(ESN)中的本地 IT 支持 AI,Mistral Small 4 和 Qwen 3.5 122B-A10B 是最稳妥的起点:采用 Apache 2.0 许可证,上下文长度约为 256,000 个 token,Q4 量化下占用 72 至 73 GB。吞吐量和评分仍需在您的硬件及您自己的工单上确认。请将您的可用内存填入 配置工具 以验证兼容性,或访问 目录 以比较许可证和VRAM需求。

本地运行 LLM 所需的硬件

要在本地流畅运行这些模型,一张 RTX 5070 Ti 提供出色的性价比。比较价格:

Amazon GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →

联盟链接 — 哪个LLM 可能从购买中获得佣金,您无需承担额外费用。作为 Amazon 合作伙伴,哪个LLM 会从符合条件的购买中获利。

文章发布及更新于 由 Mohamed Meguedmi · 数据来源: /api/models.json · 内容许可协议: CC BY 4.0.

有错误或更新需要反馈吗? 参与贡献.