最佳免费本地AI:2026年排名,即使没有 GPU
是的:Ollama、LM Studio、Jan和GPT4All可免费下载,且Qwen 3.5、Gemma 4、Granite 4.2或gpt-oss均采用Apache 2.0许可证发布。选择合适的模型取决于内存配置:2至4GB的文件适合8GB内存的设备,6至8GB的文件需要16GB内存,而超过14GB的文件则需至少24GB VRAM或32GB RAM。
使用免费的本地 AI,只需下载两样东西:一个软件(Ollama、LM Studio、Jan)和一个开放权重的语言模型。真正的选择标准不是模型名称,而是模型文件大小与可用内存容量的比较。本页提供 Ollama 公布的实际文件大小、无显卡电脑的运行速度计算,以及一些所谓“本地”AI 仍会将你的数据发送到其他地方的情况。
您正在挑选电脑吗? 按预算推荐 →
#根据您的设备免费开始使用
没有唯一最好的免费本地 AI:合适的选择是通过 Ollama 或 LM Studio 运行、模型文件能够装入您的内存且仍留有余量的最大模型。在没有显卡、内存为 8 GB 的机器上,目标应是 2 至 4 GB 的文件,例如 Granite 4.2 3B(2.2 GB)或 Qwen 3.5 4B(3.4 GB)。如果有 16 GB 内存,Qwen 3.5 9B(6.6 GB)、Granite 4.2 8B(5.3 GB)或 Gemma 4 12B(7.6 GB)都是合理的起点。从 24 GB 显存或 32 GB 内存起,gpt-oss 20B(14 GB)和 270 亿参数的模型(18 GB)就可以考虑了。这些大小指的是 Ollama 标示的文件大小,而不是模型名称中以十亿为单位的参数数量:需要装得下的是文件本身,再加上上下文占用和系统所需的余量。这些只是起步建议,并不保证质量或速度:请用您自己的任务测试模型。
| 机器内存 | 可尝试的模型(Ollama 标签) | 文件大小 | 公布的上下文长度 |
|---|---|---|---|
| 8 GB,无GPU | granite4.2:3b ; qwen3.5:4b | 2.2 GB;3.4 GB | 128 k;256 k tokens |
| 16 GB | granite4.2:8b ; qwen3.5:9b ; gemma4:12b | 5.3 GB;6.6 GB;7.6 GB | 128 k ; 256 k ; 256 k tokens |
| 24 GB显存或32 GB内存 | gpt-oss:20b ; qwen3.6:27b ; qwen3.8:27b ; gemma4:26b | 14 GB;18 GB;18 GB;19 GB | 128 k;256 k;256 k;256 k tokens |
| 32 GB 及以上,用于编程 | qwen3-coder:30b | 19 GB | 256 k tokens |
标称的上下文长度是上限,并非实际分配的长度。当显卡的显存少于 24 GiB 时,Ollama 默认以 4k tokens 的上下文启动,并建议网页搜索、智能体和代码任务至少使用 64,000 tokens。每次增加上下文长度,都会在模型文件占用之外额外消耗内存。
#什么是本地 AI?
你已经知道哪款免费 AI 能在自己的设备上运行。本地AI套件会带你进一步搭建一个每天都能派上用场的助手:一小时的引导式安装(第 1 章)、适合你具体机器配置的模型(第 3 章),以及没有显卡时真正可用的方案(第 12 章)。
- 在线空间,终身可用
- PDF + 文件
- 终身更新
本地 AI 是一种语言模型(LLM,如 Qwen、Gemma 或 Granite):模型文件存储在您的磁盘上,由安装在您机器上的软件运行。计算由您的处理器或显卡完成,而不是在软件厂商的服务器上进行。LM Studio 在其文档中说明:您与模型聊天时输入的内容不会离开设备。
这些模型被称为开放权重模型:其参数可以下载。这并不等同于开源,是否开源取决于许可证。Google 在介绍 Gemma 时也提醒了这一点:2026 年 4 月 2 日发布的 Gemma 4 是该系列首个采用 Apache 2.0 许可证的模型,该许可证已获 OSI 批准;此前的几代模型并未采用这一许可证。在将模型复用于产品之前,请阅读其许可证。
相反的情况是在线服务,如 ChatGPT、Gemini 或 Claude:您的消息会发送至提供商的服务器。两者之间还存在混合模式,下文将详细说明。
#为何转向本地 AI?
- 隐私
- 您的文档和提示始终保留在本地设备上,除非您启用了托管模型或网络搜索。这在敏感、法律或医疗类工作中非常有用。
- 离线
- 下载好的模型无需联网也能回答,无论是在火车上,还是在隔离网络中。
- 无消息数量限制
- 没有套餐会限制您的对话量。唯一的限制是您的硬件速度。
- 控制
- 您可以选择模型、量化方式和上下文长度,并在更好的模型发布时替换它。
这种取舍确实存在:本地模型必须能装入您的内存,因此其规模比在线服务使用的模型更小。
#本地AI免费:真的无需付费吗?
对于本文提到的软件和模型,答案是肯定的:与安装在您自己机器上的模型对话无需订阅。以下三点可避免意外:软件许可证各不相同(LM Studio 免费,但不开源),成本会转移到磁盘和硬件上,而且有些厂商还另外销售在线服务。
- 硬盘
- 在 Windows 上,安装 Ollama 至少需要 4 GB 空间,之后还需为模型预留空间;根据其文档,模型占用的空间可能达到数十至数百 GB。
- 硬件
- 在只有 8 GB 内存的机器上使用一个 14 GB 的文件并不合理:购买前先用小模型测试。
- 托管服务方案
- Ollama 的免费套餐既包含本地运行,也包含按用量提供的托管模型,此外还有更高档的付费套餐。托管模型并不属于本地 AI。
#免费工具排行榜
| 工具 | 许可证 | 界面 | 支持的系统 |
|---|---|---|---|
| Ollama | MIT | 终端、本地 API 和桌面应用程序 | Windows 10 22H2 或更新版本;macOS 14 或更新版本(Apple 芯片机型,或仅通过 CPU 运行的 Intel 机型);Linux |
| LM Studio | 专有许可,免费 | 完整的图形界面 | macOS 14+(仅限 Apple Silicon);Windows x64 和 ARM;Linux |
| Jan | Apache 2.0 | 桌面应用程序 | Windows, macOS, Linux |
| GPT4All | MIT | 桌面应用程序 | Windows、macOS 12.6+、Linux x86-64 |
- Ollama
- 开发者的首选:通过一条命令即可启动模型,提供本地API,端口为11434。
- LM Studio
- 模型目录、一键下载和对话窗口:最简单的入门方式。自2025年7月8日起,在家和工作时均可免费使用,但它仍是专有软件:其条款授予的是使用许可,并不开放源代码。
- Jan
- 从 Hugging Face 下载模型并启动本地服务器。其代码仓库说明,它也可以连接 OpenAI、Anthropic 或其他服务:是否始终在本地运行,需要您自己把握。
- GPT4All
- 其仓库宣称「无需 API 调用或 GPU」。其文档针对 30 至 130 亿参数的模型,并为 Llama 3 8B 指定 8 GB 内存。自 2025 年 2 月的 3.10.0 版本以来,未发布任何新版本:请确认其是否支持所需的模型。
#没有显卡:处理器表现如何
是的,模型可以仅依靠处理器和内存运行。Ollama 在其 FAQ 中确认了这一点:当模型完全加载到系统内存时,ollama ps 的 Processor 列会显示“100% CPU”。因此,真正的问题是速度,而非可行性。
#为什么处理器速度慢:算一算
每生成一个 token,机器都必须从内存中重新读取模型的大部分内容:速度更多地受数据访问速度限制,而不是计算能力。将内存带宽(GB/s)除以文件大小(GB),即可得到理论上限。表格以 50 GB/s 为例:这只是用于说明的计算,并非实测结果。
| 模型 | 文件大小 | 理论上限 |
|---|---|---|
| granite4.2:3b | 2.2 GB | 约每秒23个token |
| granite4.2:8b | 5.3 GB | 每秒约9个token |
| qwen3.5:9b | 6.6 GB | 每秒约8个token |
实际表现仍低于理论值。TensorFoundry 博客报告称,在带宽为 400 GB/s 的 Mac M2 Max 上,8B 模型在 4 位量化下的理论上限约为每秒 87 个 token,实测为 64.9 个,即 75%。实际后果是:在没有 GPU 的情况下,文件大小是速度的首要杠杆,因为理论上限直接取决于文件大小。混合专家模型(MoE)改变了这一局面,因为它们每个 token 只激活部分参数:Qwen3-Coder 30B-A3B 在 300 亿参数中仅激活 33 亿。如果内存足以容纳整个文件,值得尝试。
#根据您的系统
- Windows
- Ollama 要求 Windows 10 22H2 或更新版本。LM Studio 要求处理器支持 AVX2,并推荐配备 16 GB 内存和 4 GB 显存。
- 搭载 Apple Silicon 的 Mac
- CPU和GPU共享统一内存。LM Studio建议至少16 GB;在8 GB内存下,建议使用更小的模型和较小的上下文。
- Mac Intel
- LM Studio 不支持这种 Mac。Ollama 可以在 x86 上运行,但只能使用 CPU:请选用小型模型。
- Linux
- Ollama 和 LM Studio 均可用;后者以 AppImage 形式分发,需要 Ubuntu 20.04 或更新版本。
#2026 年最佳免费模型
这份精选名单依据的是 Ollama 发布的内容和开发商提供的文档,而非本站自行进行的测试。
- Qwen 3.5 (阿里)
- 这是一个多模态模型家族(文本与图像),参数规模从 8 亿到 1220 亿,上下文长度为 256 k tokens,采用 Apache 2.0 许可证。阿里巴巴宣布支持 201 种语言和方言。4B(3.4 GB)和 9B(6.6 GB)版本面向小型设备。
- Qwen 3.6和3.8(阿里)
- Qwen 3.6 提供 27B(18 GB)和 35B(23 GB)版本,Qwen 3.8 提供 27B(18 GB)版本:这两个系列都面向代码和智能体用途。Qwen3.8 的思考模式默认启用,可以针对每次请求关闭:该模式会在回答前增加 token。
- Granite 4.2 (IBM)
- 提供 3B(2.2 GB)、8B(5.3 GB)和 30B 版本,上下文长度为 128 k tokens,采用 Apache 2.0 许可证。法语是支持的十二种语言之一:这可以作为参考,但不能据此衡量质量。内置的思考模式可通过 Ollama 中的 /set nothink 命令关闭。
- Gemma 4 (Google)
- E2B、E4B、12B、26B(混合专家,38 亿活跃参数)和 31B 版本,自 2026 年 4 月起采用 Apache 2.0 许可证。“E”代表“effective”(有效):gemma4:e2b 拥有 23 亿有效参数,但包含嵌入层时为 51 亿,其在 Ollama 上的文件大小为 7.2 GB。名称中的 2B 并不保证文件较小。
- gpt-oss 20B (OpenAI)
- 这是一个采用 Apache 2.0 许可证的开放权重模型,由 OpenAI 以 MXFP4 格式量化:Ollama 表示,它可以在 16 GB 内存下运行(文件大小为 14 GB)。上下文长度为 128 k tokens。
- Qwen3-Coder 30B-A3B(阿里)
- 代码专家:总参数量 300 亿,激活参数 33 亿,上下文长度 256k tokens,文件大小 19 GB。
#正确解读基准测试
模型卡会公布分数,但这些分数来自发布方,并采用其自己的评测流程。Gemma 4 的模型卡给出的 MMLU Pro 分数,E4B 版本为 69.4%,31B 版本为 85.2%:模型规模确实有影响,但分数无法说明模型在您的任务上表现如何。另一个用词陷阱是:“免费 LLM”也可能指有配额限制的在线服务,您的数据会传给服务提供商。
#根据使用场景选择:聊天、编程、智能体
- 用法语聊天、总结和写作
- 在 16 GB 内存的机器上,可选 Granite 4.2 8B、Qwen 3.5 9B 或 Gemma 4 12B。用您自己的三篇文本比较这些模型:任何介绍资料都无法替代这项测试。
- Coder
- 阿里巴巴将 Qwen3-Coder 30B-A3B 介绍为其最侧重智能体用途的代码模型。限制在于内存:代码工具需要较长的上下文,这部分内存占用叠加在 19 GB 的模型文件之上,使 24 GB 的内存容量所剩余量很小。
- 智能体与工具
- Ollama 可以使用本地模型启动智能体,例如让 Claude Code 使用 Qwen 模型。这运行的是 Claude Code 工具,而不是 Claude 模型:实际回答的仍然是您下载的模型。
- 无限制
- 原始模型经过训练,会拒绝某些请求。社区中称为 abliterated 的变体移除了这种能力:Hugging Face 的一篇博文解释说,拒绝行为由激活中的一个特定方向承载,而这个方向可以被消除。不同变体的质量有所差异,您的使用行为仍须遵守法律。
#一步步安装免费AI
- 01检查空闲内存关闭浏览器和占用资源较多的应用程序:决定能使用哪个模型的是可用内存,而不是内存总容量。
- 02安装软件如果您能熟练使用命令,请选择 Ollama;如果您想使用图形界面,请选择 LM Studio。请选择适用于您操作系统的版本:Windows、macOS 或 Linux。
- 03下载合适大小的模型请参见第一节的表格:8 GB 内存对应 2 至 4 GB 的文件;16 GB 内存对应 5 至 8 GB 的文件。在只有 8 GB 内存的情况下,6.6 GB 的文件不会留下余量。
- 04启动,然后检查先与模型对话,然后在第二个终端中运行 ollama ps,查看模型是在 GPU、CPU 还是两者上运行。
#即便标榜“本地”,哪些内容仍可能被传出设备
“本地”描述的是模型在哪里运行,而不是软件其余部分做了什么。以下四种情况会导致数据外传或暴露。
- Ollama 的托管模型
- 该应用允许使用在 Ollama 云平台运行的模型,该平台将处理您的提示和响应;Ollama 无法看到您本地执行的内容。若要禁用此功能,请设置环境变量 OLLAMA_NO_CLOUD=1 或选择 disable_ollama_cloud 选项。
- Jan 的连接器
- Jan 可连接 OpenAI、Anthropic、Mistral 或 Groq。使用已下载的模型时,运行仍在本地进行;使用连接器时,对话会发送至所选服务提供商。
- 模型的下载
- LM Studio 会发出网络请求以搜索模型、下载并检查更新。对话、您的文档以及本地服务器将保留在设备上。
- 向网络开放访问
- Ollama 默认监听127.0.0.1:只有您的电脑可以访问。OLLAMA_HOST 变量可更改监听地址;只有在您清楚哪些人能够连接时,才开放网络访问。
入门时,哪款免费的本地 AI 最好?+
可以在没有 GPU 的情况下免费使用本地 AI 吗?+
LM Studio 和 Ollama 真的免费吗?+
我的本地 AI 会将数据上传到互联网吗?+
能否在本地运行Claude或ChatGPT?+
是否存在无限制的本地 AI?+
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。