进阶 20 分钟使用场景

为中小企业部署内部 AI 聊天机器人(0 至 50 collaborateurs)

您经营着一家员工少于 50 人的中小企业,希望为团队提供 AI 助手,同时不将他们的数据发送给 OpenAI。本指南提供一套完整且附有成本估算的技术栈,用于部署中小企业内部 AI 聊天机器人:具体硬件、开源软件、Microsoft SSO、4 周实施计划、变革管理和 ROI 计算。不讲空话,不做推销——给出的是采购清单和时间表。

作者: Mohamed Meguedmi·更新于 2026-08-27·已在 Windows、macOS 和 Linux 上测试

#为何选择内部聊天机器人而非ChatGPT Business

ChatGPT Team 的费用为每位用户每月 25 欧元。对于 30 名员工,这意味着每年支付 9 000 欧元,而且需要持续支付。同样的预算可以购买一台能使用 4 到 5 年的工作站,并且您的对话始终不会离开办公室。这就是最关键的权衡。

但真正的问题不在于价格,而在于您的团队敢往聊天窗口里粘贴什么内容。销售人员让外部大语言模型改写的提案中,包含客户姓名或名称、金额,有时还有利润率。人力资源人员总结一次面试,就会透露一段职业经历。让 30 个人这样使用 12 个月——即使有合理使用规范,数据泄露也必然会发生。

隐私
对话内容始终留在您的局域网内。不会经由受《CLOUD Act》约束的服务传输,不会暴露给美国的分包服务商,也无需每个季度检查政策相关设置。
固定成本
硬件属于4至5年折旧的资本支出(CAPEX),而SaaS订阅属于随员工人数增加的运营支出(OPEX)
掌控权
您选择模型、调整系统提示词,并通过 RAG 接入内部文档。没有人会在您不知情的情况下更改您的工具。
合规性
相比依赖欧盟以外的供应商,采用本地部署的系统更容易证明符合《人工智能法案》和 GDPR 的要求。
i
本指南适用于哪些用户
拥有 5 至 50 名员工的中小企业,无论是否设有内部 IT 部门。如果企业有 200 人或更多,某些取舍就会改变(转向 vLLM、高可用性、规范化的工单管理)——本指南仍然可以作为基础。

#1. 硬件预算:5000至10000欧元的工作站

企业本地 AI 套件

在工作场所部署本地 AI:GDPR、AI 法案、多用户架构、成本、供管理层参考的说明材料。

  • 在线空间,终身可用
  • PDF + 文件
  • 终身更新

要用 Q4_K_M 量化的 20B 至 35B 模型同时为 30 至 50 名用户提供服务,无需 DGX 服务器。一台选型合适的工作站即可胜任。以下按不同使用需求提供三种配置。

#配置 A — 10 到 20 名用户(5000 欧元)

GPU
1× RTX 4080 16 GB二手(价格变动)或RTX 5070 Ti 16 GB全新(约1400欧元,2026年9月底);可运行20-24B模型,量化为Q4_K_M,上下文长度16k tokens。
CPU
AMD Ryzen 9 7900X 或 Intel Core i7-14700K。CPU 并非关键因素,但 12 核及以上有助于准备嵌入向量。
系统 RAM
64 GB DDR5。足以满足系统、Qdrant 以及从 GPU 显存溢出到系统内存的 KV 缓存的需求。
存储
2 TB NVMe Gen4。模型 + 向量数据库 + 本地备份。
提供服务的模型
Mistral 小型 24B(通用型,法语表现良好)或 gpt-oss 20B Q4_K_M(约 14 GB 显存)。延迟约 30 个 token/s。

#B 类配置 — 20 到 35 名用户(7500 欧元)

GPU
1× RTX 4090 24 GB——已不再销售全新产品,需要寻找二手货源(价格不定)。这是以 Q4_K_M 量化提供 27–30B 模型服务的理想折中方案。
CPU
Ryzen 9 7950X 或 Threadripper 7960X。多核心有助于同时处理多个对话。
系统 RAM
若可能,建议使用 128 GB DDR5 ECC。RAG 索引增长速度很快。
存储
2 TB NVMe Gen4 + 4 TB SATA 用于归档
提供服务的模型
Qwen 3.8 27B(2026 年“接近 Copilot”的模型,262k 上下文)或采用 Q4_K_M 量化的 Granite 4.2 30B(约 18 GB 显存)。延迟约 20-25 token/秒。

#C 类配置 — 35 至 50 名用户(10,000 欧元)

NVIDIA 方案
2× RTX 4090 24 GB 张量并行。可运行27-35B参数的Q8全精度模型(约30-40 GB显存分配),或并行运行两个模型,且延迟可接受。
Apple 方案
Mac Studio M4 Max 或 Ultra,配备 64 至 128 GB 统一内存。在静音与性能之间取得了出色的平衡,非常适合开放式办公环境。
CPU
采用 NVIDIA 的配置可选 Threadripper 7970X / 7980X。CPU 对处理 50 个并发 WebSocket 连接至关重要。
系统 RAM
128 至 256 GB。预留空间用于操作系统缓存、Qdrant 内存存储,以及可选的嵌入模型。
提供服务的模型
Qwen 3.8 27B 采用 Q8 或 Qwen 3.6 35B-A3B(MoE 快速版本)采用 Q5_K_M。延迟约 15-20 个 token/秒。
→
不要过度指定第1天
即使有40名用户,也先从A配置开始。大多数用户不会同时提问。3周后,您就能测量实际等待时间,并在必要时升级GPU。不过,主板和电源必须从一开始就能支持更强大的GPU。

#2. 推荐的技术栈

四个开源组件就足够了。没有软件厂商拥有监督权,无需续期任何许可证,所有组件都在工作站上通过 Docker 运行。

Ollama
负责加载模型并提供模型服务的守护进程。默认监听 http://localhost:11434。自动检测 NVIDIA GPU,并管理量化。采用 MIT 许可证。
Open WebUI
类似 ChatGPT 的网页界面。原生支持多用户,提供基于角色的访问控制(RBAC)、用于单点登录(SSO)的 OIDC 集成,以及每位用户各自的历史记录。采用 BSD-3 许可证。
Qdrant
用于 RAG 的向量数据库。为您的内部文档(操作流程、合同模板、产品资料)建立索引。在这一数据规模下,比 pgvector 更快、更简单。采用 Apache 2 许可证。
Traefik 或 Nginx
使用反向代理,凭内部证书在局域网上通过 HTTPS 提供 Open WebUI 服务,终止 TLS 连接,并将请求路由到各后端。
docker-compose.yml — 最简配置框架
services:
  ollama:
    image: ollama/ollama:latest
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: all
              capabilities: [gpu]
    volumes:
      - ollama_data:/root/.ollama
    restart: unless-stopped

  qdrant:
    image: qdrant/qdrant:latest
    volumes:
      - qdrant_data:/qdrant/storage
    restart: unless-stopped

  openwebui:
    image: ghcr.io/open-webui/open-webui:main
    environment:
      - OLLAMA_BASE_URL=http://ollama:11434
      - QDRANT_URL=http://qdrant:6333
      - ENABLE_OAUTH_SIGNUP=true
      - OAUTH_PROVIDER_NAME=Microsoft
      - MICROSOFT_CLIENT_ID=${ENTRA_CLIENT_ID}
      - MICROSOFT_CLIENT_SECRET=${ENTRA_CLIENT_SECRET}
      - MICROSOFT_CLIENT_TENANT_ID=${ENTRA_TENANT_ID}
    volumes:
      - openwebui_data:/app/backend/data
    depends_on:
      - ollama
      - qdrant
    restart: unless-stopped

volumes:
  ollama_data:
  qdrant_data:
  openwebui_data:

这个基础配置刻意保持简短。您只需在此基础上添加 Traefik 来提供 HTTPS 支持,再添加一个绑定挂载卷,用于每晚向 NAS 备份。仅此而已。

#3. 使用Microsoft Entra ID进行SSO

大多数中小企业都使用Microsoft 365。将聊天机器人认证绑定到Entra ID(原Azure AD)可消除孤儿账户,确保员工离职当天即失去访问权限。Open WebUI原生支持Microsoft的OIDC认证。

  1. 01
    创建应用注册
    在 Entra ID 门户中,选择 App registrations → New registration。名称:“Chatbot IA Interne”。Redirect URI:https://chatbot.votreboite.local/oauth/microsoft/callback(类型选择 Web)。
  2. 02
    获取凭证
    记下 Application (client) ID 和 Directory (tenant) ID。在 Certificates & secrets 中生成一个有效期为 24 个月的 Client secret,并立即记下它(之后将永远不再显示)。
  3. 03
    设置权限
    API permissions → Microsoft Graph → Delegated:openid、profile、email、User.Read。无需 Application permissions,因为该流程采用委托方式。
  4. 04
    限制访问
    Enterprise applications → 您的应用 → Properties → Assignment required = Yes。然后进入 Users and groups:添加“所有员工”组或一个试点组。如果不完成这一步,租户中的任何账户都可以登录。
  5. 05
    注入到 Open WebUI
    将 CLIENT_ID、CLIENT_SECRET 和 TENANT_ID 复制到 docker-compose 的 .env 文件中,然后重启。登录页面将出现“Sign in with Microsoft”按钮。
!
常见陷阱:Assignment required
如果您遗漏第 4 步,您的 Microsoft 租户内所有账户都可能登录——其中包括所有外部来宾账户(客户、服务提供商)。在向团队提供 URL 之前,请仔细复核这一设置。

#4. 为期 4 周的部署计划

这一时间表的前提是:有一位负责企业内部项目的技术对接人(信息系统负责人、IT 经理或服务提供商),将约 50% 的工作时间投入该项目。对中小企业来说,这样的时间投入已经足够。

#第1周 — 硬件与安装

J1-J2
订购硬件(工作站、1500 VA 不间断电源,以及尚未配备时所需的网管型交换机)。
J3-J4
接收设备,必要时进行组装,安装 Ubuntu Server LTS 24.04、NVIDIA 驱动程序、Docker 和 NVIDIA Container Toolkit。
J5
拉取 Docker 镜像,首次执行 ollama pull mistral-small,并在命令行中进行基础聊天测试。您应当看到 token 输出。

#第 2 周——技术栈与集成

J6-J7
docker-compose up, configuration Open WebUI (admin, paramètres généraux, branding interne).
J8-J9
配置 Entra ID 单点登录(SSO),使用 3 个试点账户进行测试,并验证登录和退出登录流程。
J10
使用 Traefik 作为反向代理,通过您的 PKI 配置内部证书;如果域名是公开的,也可使用 Let's Encrypt DNS-01。从局域网内的 2–3 台计算机进行测试。

#第 3 周 — RAG 与试点

J11-J12
选择50至200个相关的内部文档(流程、常见问题、商业资料)。通过 Open WebUI 或 Python 脚本在 Qdrant 中进行索引。
J13-J14
带有中小企业特色的系统提示词:语气、允许的主题、需拒绝的主题(敏感的人力资源问题、薪资等)。在 3 名试点人员身上进行测试。
J15
向由 5–8 名有代表性的员工组成的试点小组开放(1 名销售人员、1 名人力资源人员、1 名会计人员、1 名运营人员等)。收集结构化反馈。

#第 4 周 — 培训与切换

J16-J17
基于试点反馈的调整(系统提示、RAG 文档、温度参数)
J18
1 小时 30 分钟的集体培训:演示、各岗位的使用场景、使用规则,以及绝不能放进聊天中的内容(健康数据、标识信息等)。
J19
通过 Entra ID 组逐步向全体员工开放。发布内部公告。
J20
部署监控(使用 Glances 或 Netdata 监控工作站,汇总对话日志以识别用户询问的主题)。

#5. 人员培训与变革管理

部署内部聊天机器人却不培训员工,就等于浪费了 70% 的投资。员工不知道该向它提出什么问题,会在心里将它与面向大众的 ChatGPT 比较,试用两次后便认定“效果更差”。

格式
每批 10 至 15 人,进行一次 1 小时 30 分钟的集体培训。不要花整整 1 小时讲幻灯片。安排 20 分钟演示,再用 1 小时围绕参与者的实际问题开展练习。
按岗位划分的应用场景
为每个职能(人力资源、销售、会计、运营、管理层)准备 3 个具体的提示词。大家会复制后按需调整——这正是我们希望看到的。
使用规则
请明确展示哪些内容可以粘贴(内部文本、草稿、已经公开的数据),哪些内容不得粘贴(健康信息、定罪记录、与具体个人关联的银行数据、技术标识符)。
负责人
为每个部门指定 1 名 AI 联络负责人,由其在部门内推广最佳实践,并反馈 RAG 的知识缺口。
第 30 天的跟进
衡量工具的使用情况。如果某些部门完全不使用该工具,这就是一个信号:要么他们缺少明确的使用场景,要么培训没有取得效果。
→
演示中表现最佳的方案
首先展示三种场景:改写一封棘手的邮件、总结一份很长的会议纪要、翻译一份技术文档。这些用例能让人在 30 秒内直观地看到价值。

#6. GDPR 与 AI 法案合规性

系统采用本地部署会大幅简化合规工作,但并不意味着无需合规。GDPR 义务针对的是数据处理,而不是处理发生的地点。

数据处理活动登记册
为内部聊天机器人添加一条处理活动记录。目的:辅助撰写和文档检索。法律依据:雇主的合法利益。处理的数据:对话内容、SSO 标识符。
数据保留时长
明确制定策略:每个用户保留 90 天的会话历史,超时后自动清除。请将其记录在章程中。
告知员工
更新信息技术使用规范及 CSE/CSE 告知说明。明确说明对话会被存储,并且技术管理员可在发生事故时访问这些对话。
人工智能法案
内部生产力辅助聊天机器人属于“有限风险”类别(第50条)。主要义务是告知用户正在与人工智能交互——Open WebUI 界面默认就会作出这一提示。
技术安全性
对 Open WebUI 数据库进行加密备份,记录管理员访问,Entra ID 账户必须启用 MFA,每月更新 Docker 镜像。
i
是否需要进行DPIA?
对于常规的生产力用途,影响评估(DPIA)并非强制要求;但如果计划将 RAG 连接到敏感数据(人力资源档案、可识别客户身份的数据),则建议进行评估。如有疑问,由您的 DPO 作出判断。

#7. ROI:如实计算

以一家有 30 名员工的中小企业为例,采用 A 方案部署,成本为 5 000 欧元。按 3 年的时间跨度计算。

改用 SaaS 方案的成本
30 × 25 € × 12个月 × 3年 = 27,000 €(ChatGPT Team)。
内部成本
5 000 欧元的工作站 + 约 200 欧元/年的电费 + 第一年的 5 个人天安装成本(约 3 500 欧元)+ 每年 2 个人天的维护成本(约 1 400 欧元/年 × 2 年)= 3 年总计约 11 500 欧元。
直接净节省额
3 年总计约 15 500 欧元,即从第二年起每年约 5 200 欧元。
间接收益
降低数据泄露风险(可用避免一次泄露所节省的损失就足以远远覆盖项目成本来量化)、更容易满足 GDPR 要求、不受 SaaS 涨价的影响。
生产力提升
保守估算:每位用户每个工作日节省 15 分钟。按包含雇主负担的人工成本每小时 35 欧元、每年 220 个工作日计算,30 人每年可节省约 38,500 欧元。这个数字很大程度上取决于实际使用情况——编制商业论证时应谨慎。
!
生产力 ROI 计算中的典型错误
假设每天节省 1 小时并乘以用户数——这是错误的。大多数常规用户每天节省 10 到 20 分钟,且 40% 的账户在 2 个月后变得不活跃。在采用率上宽泛估计(50-60%),在每位用户的收益上保守估计(15 分钟)。投资回报率(ROI)仍然大幅为正。

#深入了解

本指南奠定了基础。接下来可以沿三个方向继续:为内部文档加入可靠的 RAG,让聊天机器人了解您的操作流程;加固内网上的多用户部署;并用一套整理完善的材料正式记录 GDPR 合规情况。

价格变动迅速:我们每周一和周四追踪本地 AI 显卡的最低价格,并列出每 GB VRAM 的价格。

这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。