面向市政部门和地方政府的本地人工智能 territoriales
市政府每天都要处理居民来信、决议草案、会议纪要和民事登记申请。这些都是个人数据,有时还涉及敏感数据,地方政府有义务予以保护。软件厂商销售的面向地方政府的 AI 产品几乎总是通过美国云服务运行,这带来了法律和政治问题。本指南介绍如何在地方政府的服务器上部署开放权重的 LLM、第一周就能开展哪些应用,以及实际成本是多少,涵盖从人口为 2000 人的市镇政府秘书处到拥有 200 名工作人员的跨市镇联合机构。
#为什么在地方行政单位部署本地AI
地方政府面临的问题不是能否使用 AI。工作人员已经在使用:个人手机上的 ChatGPT、办公套件中的 Copilot,以及消息应用中的助手。问题在于,这些使用方式缺乏规范,辖区居民的数据被复制到一些服务中,而地方政府既无法掌控这些服务的托管,也无法掌控数据的保留和再利用。数据保护官(DPO,自 2018 年起所有公共机构均须设立)对此完全不知情。
自托管的 LLM 改变了这套逻辑。模型运行在地方政府办公场所内的机器上,或运行在其惯常使用的托管服务商那里。任何文本都不会离开网络。数据控制者仍然是地方政府,无需再与额外的数据处理服务商签订合同,无需将数据传输到欧盟以外,也无需与不接受协商的巨头谈判条款。而且,成本是一次性的硬件投入,而不是按工作人员人数订阅、并随使用增加而不断上涨的费用。
这不是一个万能解决方案。拥有 80 亿至 300 亿参数的本地模型,在开放式任务上的表现不如最优秀的专有模型。但市政部门的任务很少是开放式的:改写信函、整理议决文件的结构、总结一份 40 页的报告、回答有关公墓管理规定的问题。对于这些范围明确的任务,只要有好的提示词和合适的文档,规模与 Mistral Small 或 Qwen3 14B 相当的模型就能胜任。
#适用于市政部门的应用场景
在工作场所部署本地 AI:GDPR、AI 法案、多用户架构、成本、供管理层参考的说明材料。
- 在线空间,终身可用
- PDF + 文件
- 终身更新
要让地方政府的 AI 项目失败,最有效的办法就是承诺在市政网站上提供一个无所不答的「市民助手」。要让项目成功,最有效的办法则是从内部重复性任务入手:工作人员在这些任务上耗费时间,而且错误容易发现。以下这些任务使用本地模型的效果很好。
- 致辖区居民的信函
- 回复学校入学例外申请、确认收到投诉、通知处理决定。工作人员提供事实信息并说明回复的方向,模型用行政公文的语体撰写,工作人员复核后签署。效率提升体现在重要性较低的信函上,而这类信函占大多数。
- 决议草案
- 将内部工作通知或报价单转换为结构化的议决草案(依据条款、理由条款、决定事项)。如果提供两三份现有议决作为范本,模型能很好地遵循格式。实质内容仍由总秘书处和法务人员负责。
- 报告与摘要
- 概括一份咨询机构的报告,从委员会会议纪要中提取决定,汇总一次收到 300 份意见的公众咨询。一个上下文长度为 32,000 token 的模型可以处理约一百页的文档。
- 接待与电话总机
- 帮助接待人员快速、准确地回答问题:废弃物收集站的开放时间、办理出生证明所需的材料、课前课后托管服务的收费标准。这需要借助 RAG(检索增强生成),以地方政府的官方文件为依据,而非模型自身的记忆。
- 公共采购
- 对 CCTP 进行初步复核,以发现不一致之处;重新表述分析标准;协助撰写投标分析报告。模型不做任何决策,只是加快阅读。
- 翻译与无障碍
- 为不使用法语的辖区居民翻译说明文件,用清晰易懂的语言(FALC,即易于阅读和理解)重写信件。近期模型在法语及主要欧洲语言方面表现扎实。
一开始应排除两种情况。第一种是任何针对个人的自动化决策(如发放社会援助、根据家庭系数计算收费标准):《公众与行政机关关系法典》要求告知使用者存在算法处理,并解释其规则;欧盟《人工智能法案》则将评估个人能否获得基本公共福利的系统列为高风险系统。第二种是在城市官网上向公众开放的对话智能体,这需要成熟的能力(测试、监督、应对失控行为),而很少有地方政府在开展首个项目时就具备这些能力。
#为什么美国云服务会给地方政府带来难题
这一论点不是出于意识形态,而是基于法律。根据 GDPR,地方政府属于数据控制者。当地方政府使用在线 AI 服务时,服务提供商就成为数据处理者,双方关系必须由符合第 28 条的合同加以规范,涵盖处理目的、期限、安全措施、后续数据处理者,以及合同终止时如何处置数据。对于面向大众的大型服务,这类合同是地方政府无法修改的格式合同,其条款往往允许保留对话内容,并可能根据所选服务方案,允许将这些内容用于改进服务。
- 向欧盟境外传输数据
- 在美国部署属于向第三国的数据传输。目前基于欧盟-美国数据保护框架(2023年7月适配决定),但该框架已遭欧洲法院挑战。此前的Schrems II案(2020年废除隐私盾协议)表明,这一基础可能随时失效,届时数据处理必须通过其他方式予以正当化。
- Cloud Act
- 2018年美国法律允许美国当局要求受其法律管辖的供应商提供数据,无论这些数据存储在何处。美国供应商在欧洲数据中心的部署无法规避这一要求。这正是法国国家网络安全机构(ANSSI)安全云参考框架(SecNumCloud)旨在排除的情形。
- “以云为中心”政策方针
- 法国总理于 2021 年发布、2023 年更新的通函要求中央政府行政机构将敏感数据托管在通过 SecNumCloud 认证且不受域外法律管辖的服务上。该通函不直接适用于地方自治团体,但确立了民选官员或数据保护官可参考的要求标准,各省的国家行政代表机构在与地方自治团体沟通时也会借鉴这些要求。
- 影响评估
- 地方政府在辖区范围内使用生成式 AI 处理居民数据,属于强烈建议开展数据保护影响评估的情形(《通用数据保护条例》第 35 条)。在既没有数据传输、也没有数据处理受托方的情况下,这份评估会容易撰写得多。
- 机密与敏感数据
- 社会服务(CCAS)、市政警察和户籍部门处理健康数据、违法行为及家庭状况信息。这些类别被大多数大众级AI服务的使用条款排除,向未签订合同的第三方传输此类数据构成需向法国数据保护局(CNIL)报告的数据泄露。
采用自托管时,这些问题大多会因部署方式本身而消失。不过,仍有一些切实的义务需要履行:将这一新工具纳入数据处理活动记录并及时更新,规定对话的保存期限,告知工作人员,并通过使用章程规范使用行为。但这些义务,地方政府在使用其他软件时就已经知道如何履行。
#前置条件与治理
购买硬件之前,有三项决策需要在会议上讨论决定,而不是坐在终端前决定。
- 项目由谁推动
- 由两人搭档负责:一名业务负责人(行政服务总负责人、秘书长)和一名技术对接负责人(IT 负责人、市镇的 IT 服务商,或市镇联合机构的共享服务部门)。没有业务负责人,项目就仍然只是 IT 部门的玩具。
- 服务器运行在何处
- 可以部署在地方政府内部、市镇联合体或省级行政区的数据中心,也可以交由法国托管服务商托管。这三种方案都适用于本指南。对于小市镇,市镇共同体共享的 IT 服务通常是最佳选择:一台服务器,服务十个市镇政府。
- 纳入哪些数据
- 预先确定哪些文档将用于 RAG(规章、已公开的决议、内部程序),以及哪些资料不会纳入其中(CCAS 的个人档案、市政警察的数据)。这份清单是处理活动记录中相应条目的核心内容。
- 能力
- 熟悉 Linux 和 Docker 的技术人员即可负责安装和运行维护。RAG 对工作方法的要求稍高一些(文档准备),但不需要更多代码。
- 网络
- 工作人员的电脑必须能够访问服务器(通过内部网络或 VPN),且服务器绝不能直接暴露在互联网上。如果访问范围超出局域网,至少需要配置带身份验证的反向代理。
在采购方面,不含税价格低于 40,000 欧元的设备适用无需事先公告或组织竞争的公共采购程序,本指南中的所有配置都在这一范围内。不过,仍须询取报价进行比较,并在档案中说明采购需求。此外,下文介绍的大多数配置都可以通过 UGAP 目录或地方政府惯常合作的电脑组装商购买。
#服务器配置与预算规划
决定一切的关键是您要部署并提供服务的模型大小,以及相应的可用显存(VRAM)。采用最常见的 Q4_K_M 量化方式时,70 至 80 亿参数的模型占用约 5 GB,140 亿参数的模型约 9 GB,240 至 320 亿参数的模型占用 15 至 19 GB,700 亿参数的模型约 40 GB。还需加上上下文所需的内存(当前正在读取的文档),处理长文本时,这部分内存占用会迅速增长。同时使用模型的工作人员数量没有想象中那么重要:在市政机构中,即使有十名工作人员配备了这类工具,也很少会同时发出超过两三个请求。
三个层级覆盖了几乎所有地方政府。以下价格区间仅为大致参考,需通过报价单确认:价格会因供应商、内存、存储和保修政策而异。
- 第一级:人口少于 5000 人的市镇
- 一台工作站或小型服务器,配备 12 GB 或 16 GB 显存的显卡(如 RTX 4070、RTX 4080 或同等型号)、32 GB 内存和 1 TB SSD。目标模型:Qwen3 8B 或 14B、Gemma 3 12B。硬件参考预算为 1 500 至 2 500 欧元,不含税。供五至十名工作人员使用,用于撰写、摘要,以及针对市镇规章的 RAG 检索。
- 第二级:中等城市或跨市镇合作机构
- 一台配备 24 GB 显存显卡(RTX 4090 或同等专业级显卡)、64 GB 内存和 2 TB SSD 的工作站,或一台配备 64 GB 统一内存的 Mac Studio。目标模型:Mistral Small 24B、Qwen3 32B(Q4 量化)、gpt-oss 20B。参考预算为 3,500 至 6,000 欧元(不含税)。适用于二十至五十名工作人员,涵盖本指南中的所有使用场景。
- 第三级:大型地方政府或省级共享服务
- 一台可上机架的服务器,配备一张或两张显存为 48 GB(或更大)的专业显卡和冗余电源,集成到现有服务器机房中。目标模型:Q4 量化的 70B 模型,或并行提供服务的多个专用模型。参考预算为 10,000 欧元起(不含税);包含厂商支持时,通常为 15,000 至 25,000 欧元(不含税)。面向数百名工作人员和多个成员地方政府。
除上述金额外,还需计入电费(配备消费级显卡的工作站在负载下功耗为 300 至 500 W,空闲时则很低)、技术负责人或服务商进行安装和配置所需的几天时间,尤其是工作人员的培训时间,这才是项目的真正成本。相比之下,为五十名工作人员订阅专有 AI 助手的费用,通常在第一年就超过第二档方案的价格,而且每年都要续订。
#分步部署指南
以下流程以一台运行 Linux(Ubuntu 或 Debian)的服务器为前提,该服务器配备 NVIDIA 显卡并已安装驱动程序。技术栈采用 Ollama 提供模型服务,采用 Open WebUI 提供带有用户账户、历史记录和内置 RAG 功能的界面。
- 01安装 Ollama 并使其在网络中可访问官方脚本会将 Ollama 安装为 systemd 服务。默认情况下,它仅监听本机(http://localhost:11434)。为了让部署在容器内的界面能够连接,需将其设置为监听所有网络接口,同时确保服务器防火墙阻止外部对端口 11434 的访问。
- 02下载一个或两个模型先从一个中等规模模型和一个小型快速模型开始。前者用于写作和摘要,后者用于简短任务和接待。下载量达数 GB;如果市政厅的网络带宽有限,应安排在非开放时段下载。
- 03安装 Open WebUIOpen WebUI 安装在一个 Docker 容器中,并连接到 Ollama。创建的第一个账户是管理员账户。随后关闭开放注册,手动或通过目录服务为工作人员创建账户(管理设置支持 LDAP 或 SSO)。
- 04向文档库添加资料在 Open WebUI 的工作空间中,按主题(如法规、决议、人力资源流程)创建集合,并上传 PDF 和 Word 文档。优先使用干净、最新且非图像扫描的文档。随后,将每个集合关联到一个自定义模型,并使用系统提示明确描述该模型的预期角色。
- 05按工作岗位编写系统提示词一个采用地方政府写作规范的定制“行政公文”模型,一个包含预期结构和两个示例的“决议”模型,以及一个连接到实用信息集合的“接待”模型。这些模型以开箱即用的工具形式呈现给工作人员,他们无需懂得如何编写提示词。
- 06安全与备份在 Open WebUI 前部署带 TLS 证书的反向代理,仅允许通过内部网络或 VPN 访问,每日备份 Open WebUI 的数据卷(账户、对话、文档)及配置。将该工具纳入数据处理活动记录,明确对话的保留期限,并据此配置清理机制。
为避免端口 11434 向整个网络开放,请通过防火墙(ufw 或 nftables)将访问权限限制为仅允许服务器自身和容器访问。本站关于 Ollama 服务器安全配置的指南详细介绍了这部分内容,以及反向代理的配置方法。如果地方政府已有 Proxmox 虚拟化管理平台,使用显卡直通的虚拟机是将这台服务器接入现有基础设施的好方法。
#辅助工作人员,而非取代他们
一个部门宣布引入 AI 时,工作人员的第一反应往往是担心被替代。这种担忧是合理的,用口号回应并没有用。有效的做法是准确说明工具能做什么、不能做什么,并结合工作人员的实际工作进行演示。
- 模型提出建议,工作人员作决定
- 模型生成的任何文档,未经人工复核和签字都不得发出。这条规则写入使用章程,每个定制模型也会按系统提示在回复末尾重申。这既保护地方政府机构(责任方面),也保护工作人员(其仍是文档作者)。
- 结合真实案例开展人员培训
- 每个部门安排两小时,使用本周的信函和业务材料,而不是通用示例。目标是让每位工作人员结束时都能掌握三种工具可以帮自己节省时间的情形,以及两种不应使用工具的情形。
- 解释幻觉现象
- 本地模型会以回答正确问题时同样的自信,编造法律引用、法典条文和数字。工作人员必须知道,模型给出的任何法律引用都需要在 Légifrance 上核实;对于地方政府的文档,RAG 能降低这种风险,但不能消除它。
- 使使用情况可见
- 制定一项内部约定:在工作文件中注明“由助手协助撰写,经 [agent] 复核”,但绝不在正式公文中使用这一说明。这样可以减轻对使用助手的顾虑,也便于监督。
- 让员工代表参与
- 引入 AI 工具会影响工作组织方式。在部署前向地方社会委员会(CST)通报,可以避免该委员会通过传言才得知此事,进而使项目演变为冲突。
- 衡量使用情况,不监视员工
- 关注活跃用户数量和定性反馈,而非个体生产力。聊天日志用于故障排查和合规性检查,而非员工评估,章程中必须明确这一点。
在采取了这种做法的地方政府中,工具的推广使用并不存在问题:工作人员很愿意采用能减轻信函撰写中繁琐工作的工具。需要警惕的是另一点:少数工作人员过度依赖模型,不再复核。最初几周开展交叉复核,并定期提醒大家已经发现的模型幻觉,是最好的防范措施。
#常见陷阱与故障排除
- 响应缓慢或卡顿
- 模型超出了显存容量,部分计算在 CPU 上进行。请使用 ollama ps 检查 GPU/CPU 的分配情况。请选择更小的模型、采用更激进的量化,或减小 Open WebUI 请求的上下文长度。
- RAG 答非所问
- 通常文档分割不当(如扫描的PDF、表格、复杂排版)。在上传前请将其转换为干净的文本,删除过时的法规版本,并用您已知答案的十道问题测试每一份资料集合。
- 模型不熟悉地方行政术语
- 它不知道在您的场景中CCAS、DETR或DSP是什么。请在系统提示或专门的集合中添加地方行政单位的术语表。
- 一名工作人员将一份社会援助档案粘贴到了对话中
- 这并不是数据泄露到了地方政府机构之外,但属于超出规定范围的数据处理。请删除对话,重申使用守则,并在必要时于 Open WebUI 中按用户组调整模型访问权限。
- 导致所有功能失效的更新
- 固定各项版本:Open WebUI 镜像的标签、Ollama 的版本,以及确切的模型清单。在改动工作人员使用的服务器之前,先在备用机器或虚拟机上测试更新。
- 服务器可从外部访问
- 请定期检查,确保没有端口转发或防火墙规则将 11434 端口或 Open WebUI 的端口暴露在市政府的公网地址上。互联网上一直有数千个对外开放的 Ollama 服务器被发现并记录。
#深入了解
本指南建立了基础框架和部署方案。本网站的详细指南将介绍您后续将操作的各个组件:
- 在内部网上为团队部署 AI 聊天机器人
- 面向 Open WebUI 多用户部署,详细介绍 Nginx 反向代理、身份验证、运行监控和对话备份。
- 安全配置Ollama服务器
- 检查服务器的对外暴露情况,添加身份验证和 TLS,并采用网络最佳实践。在开放本地网络以外的访问之前,请先阅读。
- 本地大语言模型与GDPR:个人数据合规性
- 完整的法律框架(GDPR、欧盟人工智能条例、CNIL 建议),用于为影响评估和登记入册提供文档依据。
- 使用 Ollama 实现本地 RAG,无需写代码
- 为了了解将文档放入集合后会发生什么,并提高接待环节的答复质量。
- 选择量化方案(Q4、Q5、Q8、FP16)
- 用于根据所购服务器的显存容量,在较大的 Q4 量化模型和较小的 Q8 量化模型之间进行权衡。
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。