参考指南 · 16章 · 包含脚本 · 永久更新

一个本地化的RAG系统
确实能稳定运行

本地 RAG 工具包 : 基于您自己的文档构建可靠 RAG 系统的权威参考指南 ——PDF、笔记、邮件、Zotero 文献库——不向云端发送任何内容。能稳定处理 300 个 PDF 的 RAG,而不是试三次才成功一次的演示。

获取套件 — 24 欧元

24 € · 一次性付款 · 包含终身更新

✓ 即时访问(在线 + PDF) ✓ Stripe 安全支付 ✓ 30 天退款保障 ✓ 持续更新版(终身更新)

查看16章 →

本地 RAG 工具包是什么?

本地 RAG 套件是一份包含 16 章(103 页)的参考指南,配有 20 个脚本和模板,并提供可终身访问的在线空间。它面向熟悉命令行的专业人士、研究人员和开发者,可在配备 8–16 GB 显存的 PC 或配备 24 GB 内存的 Mac mini M4 上使用。最终成果是一条完整的 RAG 流水线——数据摄入、分块、法语嵌入、索引、混合检索和重排序——并采用 recall@k 评估流程进行测量,而非仅用三个示例进行测试。

  • 16章(103页)及20个脚本、模板和对比文件可下载。
  • 涵盖 2 种配置:8-16 GB VRAM 的 PC,或 24 GB 的 Mac mini M4。
  • 覆盖的向量数据库:ChromaDB、Qdrant 和 LanceDB,任选其一。
  • 法语嵌入模型对比:bge-m3 和 nomic-embed-text-v2-moe。
  • 在包含 30 至 50 个问题的测试集上测量 recall@k 的流程。
  • 一次性支付 24 欧元,包含终身更新,30 天内不满意可退款。
本地 RAG 工具包封面 — 本地 RAG

✓ 适合你的情况……

你是专业人士、研究人员或开发者,熟悉命令行操作(Python 对大多数章节有帮助,但并非必需),已经在使用本地 AI(Ollama/LM Studio,也可能使用过本地 AI 套件),并希望在数十份或数百份文档——合同、Zotero 参考文献、往来通信、内部 wiki——上使用不止于一键操作的 RAG。

✗ 不适合你的情况……

你只是想偶尔就三个 PDF 提一个问题(本地 AI 套件第 8 章已涵盖);你想用文档 RAG 为编程助手提供资料(对应本地编程助手套件);或者你要在企业中为多名用户部署,并满足 GDPR 的约束(对应企业版本地 AI 套件)。

24 € 一次性付费 · 包含终身更新 30 天保障 — 不满意,只需一封邮件即可退款 网站上分散着 7 篇 RAG 指南,还需花数小时自行整合。本套件: 24 €,流程已搭建完成并经过测试。

为何你可以信赖它

本指南由以下人员撰写和维护 QuelLLM.fr 团队 — 250 个索引模型,335 个法语指南,每日更新 — 全年持续运营生产级 AI 平台 (RegulIA, IAPRO)。本指南中的每条命令、每个模型和每项许可证,都按该版发布时的官方来源进行核实(每次发布新版都会重新核实),并在我们自己使用的机器配置上验证(配备 8–16 GB 显存的 PC、24 GB 的 Mac mini M4);套装中的所有脚本均可编译通过,且都经过逐一审阅。您读到的内容经过精炼和核实,直截了当。这不是随意搜集教程后拼凑而成的合集。 QuelLLM 背后是谁 →

问题

您已经有了本地 AI 助手,或许还用上了点几下按钮就能操作的 RAG 工具(AnythingLLM、Open WebUI)。拖入一个 PDF,提出问题,它就会回答——可某一天,它开始答非所问,甚至编造出文档中根本不存在的引文。面对 300 个 PDF、整个 Zotero 文献库或多年的通信记录,简单的按钮操作就应付不了了:分块策略过于简单,没有任何可核验的引文,更重要的是 从未对任何指标进行测量 ——你只是凭三个例子就相信它,而没有依据一套测试规程。

基础信息已在网站上免费提供,分散在7篇指南中(ChromaDB、分块、BM25 混合检索、Zotero、法语嵌入、重排序、LlamaIndex)。 该套件提供了可作为基准的方法:完整流程已组装并经过测试——数据摄入、经过测量的分块处理、法语嵌入向量、能适应规模扩大的索引、混合检索、重排序,以及验证它确实有效的方法——而不是需要您自行交叉核对的一堆教程。

RAG 已搭建并完成测评 与一键式 RAG 对比,再与把所有内容直接粘贴给 LLM 的方式对比

同样的需求——查询你的文档——有三种满足方式。以下是坦诚的对比:

组装好的 RAG(本套件)一键 RAG完全贴合LLM
可支持数百个文档是有限否
始终提供可核实的引用是的,必需很少能做到可靠否
混合检索(标识符、专有名词)是(BM25 + 向量检索)否不适用
实测质量(前后 recall@k 对比)是,已提供协议否否
部署多会话支持,独立的流水线几分钟即时
隐私性(100% 本地)是是根据所使用的LLM不同
成本搭建完成后,每月 0 欧元0 欧元/月文档超过几份后,上下文成本就很高

对于偶尔处理三个文档的需求,一键操作仍是合适的选择(对应本地 AI 套件第 8 章)。当文档集合的规模、任务的重要性或所需的可靠性超出一键操作所能应对的范围时,本套件便可接手。

你将获得的内容

工具:ChromaDB、Qdrant、LanceDB、LlamaIndex、LangChain、Open WebUI Knowledge、AnythingLLM。嵌入向量:bge-m3、nomic-embed-text-v2-moe。100%本地运行,部署后每月0欧元。

这些 16章 套件

103 页,从流程基础到经过测量并提升可靠性的 RAG。各部分都应完整阅读:每一章都指向后续章节。

第 1 部分——构建可靠 RAG 的基础
  • 您现在的 RAG 在说谎(或者说,这套工具为什么存在)
  • 一个能够稳定运行的RAG管道架构解析
  • 选择技术栈:脚本、框架或高级界面
第 2 部分 — 数据导入:不止是精美的 PDF
  • OCR、清洗、去重:导入实际拥有的数据
  • Zotero:将自己的参考文献库接入真正会引用来源的 RAG 系统
  • 邮件与往来信件:常被忽略、未用于 RAG 的语料库
  • 分块:5种策略及如何评估哪种更有效
第 3 部分 — 引擎:嵌入、索引、检索
  • 适用于法语的多语言嵌入:如何选择与验证
  • 本地向量索引:ChromaDB、Qdrant、LanceDB — 2026 年应选择哪一个
  • 混合检索:当纯向量检索不足以满足需求时
  • 重排序:用于修正检索结果的交叉编码器
第4部分——编排、测量、提高可靠性
  • 本地使用 LlamaIndex 和 LangChain:构建超越手写脚本的方案
  • Open WebUI Knowledge 和 AnythingLLM 的高级用法
  • 评估自己的 RAG:问题集、引用、幻觉
  • 按设备分别说明成本、速度和故障排查
  • RAG 正在运行 — 以及后续内容

持续更新的版本:每次更新都会丰富这份目录(第 16 章设有注明日期的更新日志)——下一版本推出时,你无需再次购买。

Trois 快速见效的改进 在打开终端之前

第一章不只是介绍背景:它能让你对现有安装环境做出三项可衡量的改进,每项都可在不到 30 分钟内完成。

1 · 评估你当前的 RAG 系统

这份 10 项检查清单可在 10 分钟内找出你现有部署的最薄弱环节(或发现你尚未部署)。

2 · 通过一条命令更换嵌入器

ollama pull bge-m3,然后在 AnythingLLM 或 Open WebUI 中切换嵌入模型,并比较切换前后的效果。

3 · 要求提供可核验的引用

在已经提出的问题中加入一条严格的引用要求——然后核实引用的段落确实存在。

4 · 然后构建完整的流程

数据摄入、有测量依据的分块、法语嵌入、索引、混合检索、重排序:第 2 至第 4 部分将一步步引导您完成这些环节。

24 €
一次性付费 · 包含终身更新
站内分散着 7 篇 RAG 指南,需要花数小时搭建和测试。本套件:一次性支付 24 欧元,流程已搭建完成。
30 天内不满意可退款——一封邮件即可。
  • 终身可访问的在线空间:16 个章节,内容始终保持最新(完整目录见上方)
  • 可下载的PDF指南(103页)+ 20个文件(脚本、模板、对比资料——Zotero、分块、混合、重排序、评估等)
  • 两个基准配置(PC 8-16 GB,Mac 24 GB)以及 RAG 故障排除树
  • 终身享有所有未来版本——它们会出现在你的个人专区中
  • 支付后立即获取访问权限,访问密钥通过电子邮件发送
获取工具包 — 24 €

通过 Stripe 安全支付。自动发送 PDF 发票 · 不适用增值税,依据 CGI 第 293 B 条。

获取工具包 — 24 €

La 实话实说

搭建完成并经过测量的本地 RAG 能很好地处理您自己的文档,但并非万能方案。一份参考指南理应为您提供这样一份坦诚的说明:

该套件表现优异完全保密 · 引用可核验 · 可处理数百份文档 · 质量经过测量,而非凭空假定 · 搭建完成后每月 0 欧元
一键操作或云端方案仍有优势偶尔处理 2–3 份文档 · 无需脚本即可立即设置 · 企业多用户部署 · 多步骤智能体编排

最后,你 能做

版本 vivante ——与所有 QuelLLM 套件一样

‘终身更新’并非口号:该套件会紧跟RAG生态系统(嵌入模型、向量数据库、框架)发展,无需你额外付费。

CHANGELOG.md — 已包含在套装中

v2026.09 (当前版本)—— 套件首版:16 章、2 种参考配置(配备 8–16 GB 显存的 PC、24 GB 的 Mac mini M4)、20 个文件(脚本、模板、对比资料)。

后续版本(新的嵌入模型、向量数据库、框架)会在此处陆续添加并标注日期,也会提供到您的个人空间,无需再次付费。

常见问题

与已包含RAG章节的本地AI套件相比,有何不同?

本地 AI 套件(第 8 章)让您通过点击按钮在 AnythingLLM 或 Open WebUI 中搭建 RAG——拖入一个 PDF,再提出问题,就能满足偶尔使用的需要。本套件从那一章结束的地方继续深入:经过测量的分块处理、法语嵌入模型的比较、能应对规模扩大的向量索引、混合检索、重排序,尤其是验证您的 RAG 是否回答正确的方法——而不只是验证它是否给出了回答。这里不会重新讲解第 8 章的任何内容,只讲解高级设置,以及点击按钮式方案中缺少的组件。

与网站上 7 个免费 RAG 指南有何不同?

QuelLLM.fr 的免费指南分别介绍各个组件(单独介绍 ChromaDB、分块、BM25 混合检索、Zotero 等)。套件按顺序组装完整流程(数据导入 → 分块 → 向量嵌入 → 索引 → 混合检索 → 重排序 → 生成 → 引用 → 测量),将单篇指南未串联起来的环节连接起来,并提供 20 个经过测试的文件(脚本、模板、对比资料),这些文件是任何一篇单独的指南都没有提供的——付费购买的是流程组装和脚本,而不是基础信息。

要使用此套件,必须会Python编程吗?

Python 3.10+ 很有用,大部分章节(第 4 章至第 12 章)都会用到——脚本已经提供,需要您调整,无需从零编写。第 13 章(Open WebUI Knowledge、采用高级设置的 AnythingLLM)无需编写任何代码也能学得懂、用得上。本套件要求您能够熟练使用命令行;如果您对本地 AI 还没有基础,请先从本地 AI 套件开始。

首次获得实际结果需要多长时间?

第 1 章提供了 3 项快速见效的改进措施,每项耗时不到 30 分钟,适用于已经部署的 RAG 系统(快速审计、用一条命令更换嵌入模型、要求提供可验证的引用)——在着手搭建完整流水线之前,你就能获得可衡量的改进。基于你自己的语料库构建完整流水线(第 2 至 4 部分)需要分几次完成,而不是一小时就能完成。

在什么设备上可以运行?

以两种配置为基准,每个示例都会明确注明:一台配备 8 至 16 GB 显存的 PC(推荐的生成模型会根据显存处于该范围的下限还是上限而变化),或一台配备 24 GB 统一内存的 Apple Silicon Mac。在 RAG 中,瓶颈几乎从来不是生成,而是数据摄入(OCR、嵌入)和索引大小——这两种配置涵盖了实际专业使用和开发场景中的主要配置。

我的文档会保密吗?

这就是核心理念:整个流程(数据输入、嵌入、索引、生成)都在你的设备上运行,不会发送到第三方。第15章专门探讨了对于邮件或敏感文档集合的影响。对于企业多用户部署(符合 GDPR、AI Act、服务器架构要求),应使用企业级本地人工智能套件(quelllm.fr/kit-ia-entreprise),而非本产品。

该套件是否涵盖 AI 智能体或自动化?

第 12 章展示了一个最简智能体(一个智能体、两个工具)如何将 RAG 用作工具——内容仅足以帮助理解原理,并明确引导读者参考本地智能体套件(quelllm.fr/kit-agents-locaux),了解多步骤编排、MCP 或 n8n。这些并非本套件的主题。

如果购买后我不满意怎么办?

不满意可在 30 天内退款,只需发送一封电子邮件,无需说明理由——所有 QuelLLM 套件都享有同样的保障。

它是如何交付的,以及有效期多久?

付款后即可立即获取:可终身使用的个人在线空间(始终提供最新版本),以及可下载的 PDF 和包含 20 个文件的 ZIP 压缩包,这些下载文件永久归你所有。未来的更新(新的嵌入模型、新的向量数据库、不断演进的框架)会出现在你的在线空间中,无需再次付费。

我可以获得发票吗?

是的,会自动提供。通过 Stripe 付款后,您会立即通过电子邮件收到 Stripe 收据和以 Falcon Consulting(QuelLLM 的运营方)名义开具的 PDF 发票,发票上会填写您提供的信息——请在付款时的指定字段中填写您的公司名称或 SIREN 号。不适用增值税,依据 CGI 第 293 B 条。

套件是否仍保持更新?向量数据库和 RAG 框架更新迅速。

这就是终身更新的原则:当嵌入模型的状态发生变化、向量数据库逐渐成熟,或框架的变更破坏兼容性时,套件版本也会随之更新——其他 QuelLLM 工具包也是如此。第 16 章还说明了如何在两次版本更新之间,自行核查所引用的事实是否仍然适用。

如果我想要多个 QuelLLM 套件怎么办?

“终身全套餐”包含目前及未来所有套件,价格为 49 欧元。如果您之前以 24 欧元购买过某个套件,升级至该套餐的费用为 25 欧元,而非 49 欧元——优惠券将自动应用。

RAG到底是什么?

RAG(检索增强生成)指的是大语言模型在回答前先从你自己的文档中查找信息,而不是仅凭训练时学到的知识作答——原则上还会附上可核查的来源引用。RAG Local 工具包针对你的 PDF、参考文献或邮件,搭建这套完整流程,并对其进行测量。

如何将 Ollama 连接到 RAG?

Ollama 在 RAG 流水线中充当生成引擎,通常也用于生成嵌入向量:AnythingLLM 或 Open WebUI Knowledge 这类点击按钮即可操作的工具可以直接连接 Ollama,适合偶尔使用。对于需要在数百份文档规模下稳定运行的流水线,RAG Local 工具包展示了如何将 Ollama 连接到 ChromaDB 或 Qdrant,使用经过测试的脚本,而不只是依赖界面。

在本地部署 RAG 时应选择哪个 LLM?

模型的选择不如其前后流程重要:只要机器能够运行一个通用模型即可完成生成任务,前提是检索环节(分块、嵌入、混合检索、重排序)能提供合适的文本段落供模型阅读。RAG Local套件详细说明了这一完整流程,而不仅限于最终模型的选择。

构建一个可靠的RAG系统

这份参考指南带您从导入第一个 PDF 开始,逐步构建覆盖整个文档库、经过评测且可靠的 RAG 系统——无需将任何内容发送到云端。今天就实现,而不是等到“某一天”。

获取套件 — 24 欧元