为中小企业部署内部 AI 聊天机器人(0 至 50 collaborateurs)
您经营着一家员工少于 50 人的中小企业,希望为团队提供 AI 助手,同时不将他们的数据发送给 OpenAI。本指南提供一套完整且附有成本估算的技术栈,用于部署中小企业内部 AI 聊天机器人:具体硬件、开源软件、Microsoft SSO、4 周实施计划、变革管理和 ROI 计算。不讲空话,不做推销——给出的是采购清单和时间表。
#为何选择内部聊天机器人而非ChatGPT Business
ChatGPT Team 的费用为每位用户每月 25 欧元。对于 30 名员工,这意味着每年支付 9 000 欧元,而且需要持续支付。同样的预算可以购买一台能使用 4 到 5 年的工作站,并且您的对话始终不会离开办公室。这就是最关键的权衡。
但真正的问题不在于价格,而在于您的团队敢往聊天窗口里粘贴什么内容。销售人员让外部大语言模型改写的提案中,包含客户姓名或名称、金额,有时还有利润率。人力资源人员总结一次面试,就会透露一段职业经历。让 30 个人这样使用 12 个月——即使有合理使用规范,数据泄露也必然会发生。
- 隐私
- 对话内容始终留在您的局域网内。不会经由受《CLOUD Act》约束的服务传输,不会暴露给美国的分包服务商,也无需每个季度检查政策相关设置。
- 固定成本
- 硬件属于4至5年折旧的资本支出(CAPEX),而SaaS订阅属于随员工人数增加的运营支出(OPEX)
- 掌控权
- 您选择模型、调整系统提示词,并通过 RAG 接入内部文档。没有人会在您不知情的情况下更改您的工具。
- 合规性
- 相比依赖欧盟以外的供应商,采用本地部署的系统更容易证明符合《人工智能法案》和 GDPR 的要求。
#1. 硬件预算:5000至10000欧元的工作站
在工作场所部署本地 AI:GDPR、AI 法案、多用户架构、成本、供管理层参考的说明材料。
- 在线空间,终身可用
- PDF + 文件
- 终身更新
要用 Q4_K_M 量化的 20B 至 35B 模型同时为 30 至 50 名用户提供服务,无需 DGX 服务器。一台选型合适的工作站即可胜任。以下按不同使用需求提供三种配置。
#配置 A — 10 到 20 名用户(5000 欧元)
- GPU
- 1× RTX 4080 16 GB二手(价格变动)或RTX 5070 Ti 16 GB全新(约1400欧元,2026年9月底);可运行20-24B模型,量化为Q4_K_M,上下文长度16k tokens。
- CPU
- AMD Ryzen 9 7900X 或 Intel Core i7-14700K。CPU 并非关键因素,但 12 核及以上有助于准备嵌入向量。
- 系统 RAM
- 64 GB DDR5。足以满足系统、Qdrant 以及从 GPU 显存溢出到系统内存的 KV 缓存的需求。
- 存储
- 2 TB NVMe Gen4。模型 + 向量数据库 + 本地备份。
- 提供服务的模型
- Mistral 小型 24B(通用型,法语表现良好)或 gpt-oss 20B Q4_K_M(约 14 GB 显存)。延迟约 30 个 token/s。
#B 类配置 — 20 到 35 名用户(7500 欧元)
- GPU
- 1× RTX 4090 24 GB——已不再销售全新产品,需要寻找二手货源(价格不定)。这是以 Q4_K_M 量化提供 27–30B 模型服务的理想折中方案。
- CPU
- Ryzen 9 7950X 或 Threadripper 7960X。多核心有助于同时处理多个对话。
- 系统 RAM
- 若可能,建议使用 128 GB DDR5 ECC。RAG 索引增长速度很快。
- 存储
- 2 TB NVMe Gen4 + 4 TB SATA 用于归档
- 提供服务的模型
- Qwen 3.8 27B(2026 年“接近 Copilot”的模型,262k 上下文)或采用 Q4_K_M 量化的 Granite 4.2 30B(约 18 GB 显存)。延迟约 20-25 token/秒。
#C 类配置 — 35 至 50 名用户(10,000 欧元)
- NVIDIA 方案
- 2× RTX 4090 24 GB 张量并行。可运行27-35B参数的Q8全精度模型(约30-40 GB显存分配),或并行运行两个模型,且延迟可接受。
- Apple 方案
- Mac Studio M4 Max 或 Ultra,配备 64 至 128 GB 统一内存。在静音与性能之间取得了出色的平衡,非常适合开放式办公环境。
- CPU
- 采用 NVIDIA 的配置可选 Threadripper 7970X / 7980X。CPU 对处理 50 个并发 WebSocket 连接至关重要。
- 系统 RAM
- 128 至 256 GB。预留空间用于操作系统缓存、Qdrant 内存存储,以及可选的嵌入模型。
- 提供服务的模型
- Qwen 3.8 27B 采用 Q8 或 Qwen 3.6 35B-A3B(MoE 快速版本)采用 Q5_K_M。延迟约 15-20 个 token/秒。
#2. 推荐的技术栈
四个开源组件就足够了。没有软件厂商拥有监督权,无需续期任何许可证,所有组件都在工作站上通过 Docker 运行。
- Ollama
- 负责加载模型并提供模型服务的守护进程。默认监听 http://localhost:11434。自动检测 NVIDIA GPU,并管理量化。采用 MIT 许可证。
- Open WebUI
- 类似 ChatGPT 的网页界面。原生支持多用户,提供基于角色的访问控制(RBAC)、用于单点登录(SSO)的 OIDC 集成,以及每位用户各自的历史记录。采用 BSD-3 许可证。
- Qdrant
- 用于 RAG 的向量数据库。为您的内部文档(操作流程、合同模板、产品资料)建立索引。在这一数据规模下,比 pgvector 更快、更简单。采用 Apache 2 许可证。
- Traefik 或 Nginx
- 使用反向代理,凭内部证书在局域网上通过 HTTPS 提供 Open WebUI 服务,终止 TLS 连接,并将请求路由到各后端。
这个基础配置刻意保持简短。您只需在此基础上添加 Traefik 来提供 HTTPS 支持,再添加一个绑定挂载卷,用于每晚向 NAS 备份。仅此而已。
#3. 使用Microsoft Entra ID进行SSO
大多数中小企业都使用Microsoft 365。将聊天机器人认证绑定到Entra ID(原Azure AD)可消除孤儿账户,确保员工离职当天即失去访问权限。Open WebUI原生支持Microsoft的OIDC认证。
- 01创建应用注册在 Entra ID 门户中,选择 App registrations → New registration。名称:“Chatbot IA Interne”。Redirect URI:https://chatbot.votreboite.local/oauth/microsoft/callback(类型选择 Web)。
- 02获取凭证记下 Application (client) ID 和 Directory (tenant) ID。在 Certificates & secrets 中生成一个有效期为 24 个月的 Client secret,并立即记下它(之后将永远不再显示)。
- 03设置权限API permissions → Microsoft Graph → Delegated:openid、profile、email、User.Read。无需 Application permissions,因为该流程采用委托方式。
- 04限制访问Enterprise applications → 您的应用 → Properties → Assignment required = Yes。然后进入 Users and groups:添加“所有员工”组或一个试点组。如果不完成这一步,租户中的任何账户都可以登录。
- 05注入到 Open WebUI将 CLIENT_ID、CLIENT_SECRET 和 TENANT_ID 复制到 docker-compose 的 .env 文件中,然后重启。登录页面将出现“Sign in with Microsoft”按钮。
#4. 为期 4 周的部署计划
这一时间表的前提是:有一位负责企业内部项目的技术对接人(信息系统负责人、IT 经理或服务提供商),将约 50% 的工作时间投入该项目。对中小企业来说,这样的时间投入已经足够。
#第1周 — 硬件与安装
- J1-J2
- 订购硬件(工作站、1500 VA 不间断电源,以及尚未配备时所需的网管型交换机)。
- J3-J4
- 接收设备,必要时进行组装,安装 Ubuntu Server LTS 24.04、NVIDIA 驱动程序、Docker 和 NVIDIA Container Toolkit。
- J5
- 拉取 Docker 镜像,首次执行 ollama pull mistral-small,并在命令行中进行基础聊天测试。您应当看到 token 输出。
#第 2 周——技术栈与集成
- J6-J7
- docker-compose up, configuration Open WebUI (admin, paramètres généraux, branding interne).
- J8-J9
- 配置 Entra ID 单点登录(SSO),使用 3 个试点账户进行测试,并验证登录和退出登录流程。
- J10
- 使用 Traefik 作为反向代理,通过您的 PKI 配置内部证书;如果域名是公开的,也可使用 Let's Encrypt DNS-01。从局域网内的 2–3 台计算机进行测试。
#第 3 周 — RAG 与试点
- J11-J12
- 选择50至200个相关的内部文档(流程、常见问题、商业资料)。通过 Open WebUI 或 Python 脚本在 Qdrant 中进行索引。
- J13-J14
- 带有中小企业特色的系统提示词:语气、允许的主题、需拒绝的主题(敏感的人力资源问题、薪资等)。在 3 名试点人员身上进行测试。
- J15
- 向由 5–8 名有代表性的员工组成的试点小组开放(1 名销售人员、1 名人力资源人员、1 名会计人员、1 名运营人员等)。收集结构化反馈。
#第 4 周 — 培训与切换
- J16-J17
- 基于试点反馈的调整(系统提示、RAG 文档、温度参数)
- J18
- 1 小时 30 分钟的集体培训:演示、各岗位的使用场景、使用规则,以及绝不能放进聊天中的内容(健康数据、标识信息等)。
- J19
- 通过 Entra ID 组逐步向全体员工开放。发布内部公告。
- J20
- 部署监控(使用 Glances 或 Netdata 监控工作站,汇总对话日志以识别用户询问的主题)。
#5. 人员培训与变革管理
部署内部聊天机器人却不培训员工,就等于浪费了 70% 的投资。员工不知道该向它提出什么问题,会在心里将它与面向大众的 ChatGPT 比较,试用两次后便认定“效果更差”。
- 格式
- 每批 10 至 15 人,进行一次 1 小时 30 分钟的集体培训。不要花整整 1 小时讲幻灯片。安排 20 分钟演示,再用 1 小时围绕参与者的实际问题开展练习。
- 按岗位划分的应用场景
- 为每个职能(人力资源、销售、会计、运营、管理层)准备 3 个具体的提示词。大家会复制后按需调整——这正是我们希望看到的。
- 使用规则
- 请明确展示哪些内容可以粘贴(内部文本、草稿、已经公开的数据),哪些内容不得粘贴(健康信息、定罪记录、与具体个人关联的银行数据、技术标识符)。
- 负责人
- 为每个部门指定 1 名 AI 联络负责人,由其在部门内推广最佳实践,并反馈 RAG 的知识缺口。
- 第 30 天的跟进
- 衡量工具的使用情况。如果某些部门完全不使用该工具,这就是一个信号:要么他们缺少明确的使用场景,要么培训没有取得效果。
#6. GDPR 与 AI 法案合规性
系统采用本地部署会大幅简化合规工作,但并不意味着无需合规。GDPR 义务针对的是数据处理,而不是处理发生的地点。
- 数据处理活动登记册
- 为内部聊天机器人添加一条处理活动记录。目的:辅助撰写和文档检索。法律依据:雇主的合法利益。处理的数据:对话内容、SSO 标识符。
- 数据保留时长
- 明确制定策略:每个用户保留 90 天的会话历史,超时后自动清除。请将其记录在章程中。
- 告知员工
- 更新信息技术使用规范及 CSE/CSE 告知说明。明确说明对话会被存储,并且技术管理员可在发生事故时访问这些对话。
- 人工智能法案
- 内部生产力辅助聊天机器人属于“有限风险”类别(第50条)。主要义务是告知用户正在与人工智能交互——Open WebUI 界面默认就会作出这一提示。
- 技术安全性
- 对 Open WebUI 数据库进行加密备份,记录管理员访问,Entra ID 账户必须启用 MFA,每月更新 Docker 镜像。
#7. ROI:如实计算
以一家有 30 名员工的中小企业为例,采用 A 方案部署,成本为 5 000 欧元。按 3 年的时间跨度计算。
- 改用 SaaS 方案的成本
- 30 × 25 € × 12个月 × 3年 = 27,000 €(ChatGPT Team)。
- 内部成本
- 5 000 欧元的工作站 + 约 200 欧元/年的电费 + 第一年的 5 个人天安装成本(约 3 500 欧元)+ 每年 2 个人天的维护成本(约 1 400 欧元/年 × 2 年)= 3 年总计约 11 500 欧元。
- 直接净节省额
- 3 年总计约 15 500 欧元,即从第二年起每年约 5 200 欧元。
- 间接收益
- 降低数据泄露风险(可用避免一次泄露所节省的损失就足以远远覆盖项目成本来量化)、更容易满足 GDPR 要求、不受 SaaS 涨价的影响。
- 生产力提升
- 保守估算:每位用户每个工作日节省 15 分钟。按包含雇主负担的人工成本每小时 35 欧元、每年 220 个工作日计算,30 人每年可节省约 38,500 欧元。这个数字很大程度上取决于实际使用情况——编制商业论证时应谨慎。
#深入了解
本指南奠定了基础。接下来可以沿三个方向继续:为内部文档加入可靠的 RAG,让聊天机器人了解您的操作流程;加固内网上的多用户部署;并用一套整理完善的材料正式记录 GDPR 合规情况。
价格变动迅速:我们每周一和周四追踪本地 AI 显卡的最低价格,并列出每 GB VRAM 的价格。
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。