入门 14 分钟免费

最佳免费本地AI:2026年排名,即使没有 GPU

直接回答

是的:Ollama、LM Studio、Jan和GPT4All可免费下载,且Qwen 3.5、Gemma 4、Granite 4.2或gpt-oss均采用Apache 2.0许可证发布。选择合适的模型取决于内存配置:2至4GB的文件适合8GB内存的设备,6至8GB的文件需要16GB内存,而超过14GB的文件则需至少24GB VRAM或32GB RAM。

使用免费的本地 AI,只需下载两样东西:一个软件(Ollama、LM Studio、Jan)和一个开放权重的语言模型。真正的选择标准不是模型名称,而是模型文件大小与可用内存容量的比较。本页提供 Ollama 公布的实际文件大小、无显卡电脑的运行速度计算,以及一些所谓“本地”AI 仍会将你的数据发送到其他地方的情况。

您正在挑选电脑吗? 按预算推荐 →

作者: Mohamed Meguedmi·更新于 2026-09-29·已在 Windows、macOS 和 Linux 上测试

#根据您的设备免费开始使用

没有唯一最好的免费本地 AI:合适的选择是通过 Ollama 或 LM Studio 运行、模型文件能够装入您的内存且仍留有余量的最大模型。在没有显卡、内存为 8 GB 的机器上,目标应是 2 至 4 GB 的文件,例如 Granite 4.2 3B(2.2 GB)或 Qwen 3.5 4B(3.4 GB)。如果有 16 GB 内存,Qwen 3.5 9B(6.6 GB)、Granite 4.2 8B(5.3 GB)或 Gemma 4 12B(7.6 GB)都是合理的起点。从 24 GB 显存或 32 GB 内存起,gpt-oss 20B(14 GB)和 270 亿参数的模型(18 GB)就可以考虑了。这些大小指的是 Ollama 标示的文件大小,而不是模型名称中以十亿为单位的参数数量:需要装得下的是文件本身,再加上上下文占用和系统所需的余量。这些只是起步建议,并不保证质量或速度:请用您自己的任务测试模型。

根据内存容量可尝试的模型(文件大小由 Ollama 公布,最后查阅日期为 2026 年 9 月 29 日)
机器内存可尝试的模型(Ollama 标签)文件大小公布的上下文长度
8 GB,无GPUgranite4.2:3b ; qwen3.5:4b2.2 GB;3.4 GB128 k;256 k tokens
16 GBgranite4.2:8b ; qwen3.5:9b ; gemma4:12b5.3 GB;6.6 GB;7.6 GB128 k ; 256 k ; 256 k tokens
24 GB显存或32 GB内存gpt-oss:20b ; qwen3.6:27b ; qwen3.8:27b ; gemma4:26b14 GB;18 GB;18 GB;19 GB128 k;256 k;256 k;256 k tokens
32 GB 及以上,用于编程qwen3-coder:30b19 GB256 k tokens

标称的上下文长度是上限,并非实际分配的长度。当显卡的显存少于 24 GiB 时,Ollama 默认以 4k tokens 的上下文启动,并建议网页搜索、智能体和代码任务至少使用 64,000 tokens。每次增加上下文长度,都会在模型文件占用之外额外消耗内存。

#什么是本地 AI?

本地 AI 套件

你已经知道哪款免费 AI 能在自己的设备上运行。本地AI套件会带你进一步搭建一个每天都能派上用场的助手:一小时的引导式安装(第 1 章)、适合你具体机器配置的模型(第 3 章),以及没有显卡时真正可用的方案(第 12 章)。

  • 在线空间,终身可用
  • PDF + 文件
  • 终身更新

本地 AI 是一种语言模型(LLM,如 Qwen、Gemma 或 Granite):模型文件存储在您的磁盘上,由安装在您机器上的软件运行。计算由您的处理器或显卡完成,而不是在软件厂商的服务器上进行。LM Studio 在其文档中说明:您与模型聊天时输入的内容不会离开设备。

这些模型被称为开放权重模型:其参数可以下载。这并不等同于开源,是否开源取决于许可证。Google 在介绍 Gemma 时也提醒了这一点:2026 年 4 月 2 日发布的 Gemma 4 是该系列首个采用 Apache 2.0 许可证的模型,该许可证已获 OSI 批准;此前的几代模型并未采用这一许可证。在将模型复用于产品之前,请阅读其许可证。

i
简而言之
本地 AI = 下载到您设备上的模型 + 运行该模型的软件。模型保存到磁盘后,对话就不需要联网。

相反的情况是在线服务,如 ChatGPT、Gemini 或 Claude:您的消息会发送至提供商的服务器。两者之间还存在混合模式,下文将详细说明。

#为何转向本地 AI?

隐私
您的文档和提示始终保留在本地设备上,除非您启用了托管模型或网络搜索。这在敏感、法律或医疗类工作中非常有用。
离线
下载好的模型无需联网也能回答,无论是在火车上,还是在隔离网络中。
无消息数量限制
没有套餐会限制您的对话量。唯一的限制是您的硬件速度。
控制
您可以选择模型、量化方式和上下文长度,并在更好的模型发布时替换它。

这种取舍确实存在:本地模型必须能装入您的内存,因此其规模比在线服务使用的模型更小。

#本地AI免费:真的无需付费吗?

对于本文提到的软件和模型,答案是肯定的:与安装在您自己机器上的模型对话无需订阅。以下三点可避免意外:软件许可证各不相同(LM Studio 免费,但不开源),成本会转移到磁盘和硬件上,而且有些厂商还另外销售在线服务。

硬盘
在 Windows 上,安装 Ollama 至少需要 4 GB 空间,之后还需为模型预留空间;根据其文档,模型占用的空间可能达到数十至数百 GB。
硬件
在只有 8 GB 内存的机器上使用一个 14 GB 的文件并不合理:购买前先用小模型测试。
托管服务方案
Ollama 的免费套餐既包含本地运行,也包含按用量提供的托管模型,此外还有更高档的付费套餐。托管模型并不属于本地 AI。
i
此处‘免费’的具体含义
无需订阅,模型免授权费用,无消息数量限制。存储空间、电力消耗和内存开销均由用户自行承担。

#免费工具排行榜

四个免费工具的对比(来源:官方仓库和文档)
工具许可证界面支持的系统
OllamaMIT终端、本地 API 和桌面应用程序Windows 10 22H2 或更新版本;macOS 14 或更新版本(Apple 芯片机型,或仅通过 CPU 运行的 Intel 机型);Linux
LM Studio专有许可,免费完整的图形界面macOS 14+(仅限 Apple Silicon);Windows x64 和 ARM;Linux
JanApache 2.0桌面应用程序Windows, macOS, Linux
GPT4AllMIT桌面应用程序Windows、macOS 12.6+、Linux x86-64
Ollama
开发者的首选:通过一条命令即可启动模型,提供本地API,端口为11434。
LM Studio
模型目录、一键下载和对话窗口:最简单的入门方式。自2025年7月8日起,在家和工作时均可免费使用,但它仍是专有软件:其条款授予的是使用许可,并不开放源代码。
Jan
从 Hugging Face 下载模型并启动本地服务器。其代码仓库说明,它也可以连接 OpenAI、Anthropic 或其他服务:是否始终在本地运行,需要您自己把握。
GPT4All
其仓库宣称「无需 API 调用或 GPU」。其文档针对 30 至 130 亿参数的模型,并为 Llama 3 8B 指定 8 GB 内存。自 2025 年 2 月的 3.10.0 版本以来,未发布任何新版本:请确认其是否支持所需的模型。

#没有显卡:处理器表现如何

是的,模型可以仅依靠处理器和内存运行。Ollama 在其 FAQ 中确认了这一点:当模型完全加载到系统内存时,ollama ps 的 Processor 列会显示“100% CPU”。因此,真正的问题是速度,而非可行性。

#为什么处理器速度慢:算一算

每生成一个 token,机器都必须从内存中重新读取模型的大部分内容:速度更多地受数据访问速度限制,而不是计算能力。将内存带宽(GB/s)除以文件大小(GB),即可得到理论上限。表格以 50 GB/s 为例:这只是用于说明的计算,并非实测结果。

50 GB/s 内存带宽的理论生成上限(示例计算,非实测值)
模型文件大小理论上限
granite4.2:3b2.2 GB约每秒23个token
granite4.2:8b5.3 GB每秒约9个token
qwen3.5:9b6.6 GB每秒约8个token

实际表现仍低于理论值。TensorFoundry 博客报告称,在带宽为 400 GB/s 的 Mac M2 Max 上,8B 模型在 4 位量化下的理论上限约为每秒 87 个 token,实测为 64.9 个,即 75%。实际后果是:在没有 GPU 的情况下,文件大小是速度的首要杠杆,因为理论上限直接取决于文件大小。混合专家模型(MoE)改变了这一局面,因为它们每个 token 只激活部分参数:Qwen3-Coder 30B-A3B 在 300 亿参数中仅激活 33 亿。如果内存足以容纳整个文件,值得尝试。

#根据您的系统

Windows
Ollama 要求 Windows 10 22H2 或更新版本。LM Studio 要求处理器支持 AVX2,并推荐配备 16 GB 内存和 4 GB 显存。
搭载 Apple Silicon 的 Mac
CPU和GPU共享统一内存。LM Studio建议至少16 GB;在8 GB内存下,建议使用更小的模型和较小的上下文。
Mac Intel
LM Studio 不支持这种 Mac。Ollama 可以在 x86 上运行,但只能使用 CPU:请选用小型模型。
Linux
Ollama 和 LM Studio 均可用;后者以 AppImage 形式分发,需要 Ubuntu 20.04 或更新版本。

#2026 年最佳免费模型

这份精选名单依据的是 Ollama 发布的内容和开发商提供的文档,而非本站自行进行的测试。

Qwen 3.5 (阿里)
这是一个多模态模型家族(文本与图像),参数规模从 8 亿到 1220 亿,上下文长度为 256 k tokens,采用 Apache 2.0 许可证。阿里巴巴宣布支持 201 种语言和方言。4B(3.4 GB)和 9B(6.6 GB)版本面向小型设备。
Qwen 3.6和3.8(阿里)
Qwen 3.6 提供 27B(18 GB)和 35B(23 GB)版本,Qwen 3.8 提供 27B(18 GB)版本:这两个系列都面向代码和智能体用途。Qwen3.8 的思考模式默认启用,可以针对每次请求关闭:该模式会在回答前增加 token。
Granite 4.2 (IBM)
提供 3B(2.2 GB)、8B(5.3 GB)和 30B 版本,上下文长度为 128 k tokens,采用 Apache 2.0 许可证。法语是支持的十二种语言之一:这可以作为参考,但不能据此衡量质量。内置的思考模式可通过 Ollama 中的 /set nothink 命令关闭。
Gemma 4 (Google)
E2B、E4B、12B、26B(混合专家,38 亿活跃参数)和 31B 版本,自 2026 年 4 月起采用 Apache 2.0 许可证。“E”代表“effective”(有效):gemma4:e2b 拥有 23 亿有效参数,但包含嵌入层时为 51 亿,其在 Ollama 上的文件大小为 7.2 GB。名称中的 2B 并不保证文件较小。
gpt-oss 20B (OpenAI)
这是一个采用 Apache 2.0 许可证的开放权重模型,由 OpenAI 以 MXFP4 格式量化:Ollama 表示,它可以在 16 GB 内存下运行(文件大小为 14 GB)。上下文长度为 128 k tokens。
Qwen3-Coder 30B-A3B(阿里)
代码专家:总参数量 300 亿,激活参数 33 亿,上下文长度 256k tokens,文件大小 19 GB。

#正确解读基准测试

模型卡会公布分数,但这些分数来自发布方,并采用其自己的评测流程。Gemma 4 的模型卡给出的 MMLU Pro 分数,E4B 版本为 69.4%,31B 版本为 85.2%:模型规模确实有影响,但分数无法说明模型在您的任务上表现如何。另一个用词陷阱是:“免费 LLM”也可能指有配额限制的在线服务,您的数据会传给服务提供商。

#根据使用场景选择:聊天、编程、智能体

用法语聊天、总结和写作
在 16 GB 内存的机器上,可选 Granite 4.2 8B、Qwen 3.5 9B 或 Gemma 4 12B。用您自己的三篇文本比较这些模型:任何介绍资料都无法替代这项测试。
Coder
阿里巴巴将 Qwen3-Coder 30B-A3B 介绍为其最侧重智能体用途的代码模型。限制在于内存:代码工具需要较长的上下文,这部分内存占用叠加在 19 GB 的模型文件之上,使 24 GB 的内存容量所剩余量很小。
智能体与工具
Ollama 可以使用本地模型启动智能体,例如让 Claude Code 使用 Qwen 模型。这运行的是 Claude Code 工具,而不是 Claude 模型:实际回答的仍然是您下载的模型。
无限制
原始模型经过训练,会拒绝某些请求。社区中称为 abliterated 的变体移除了这种能力:Hugging Face 的一篇博文解释说,拒绝行为由激活中的一个特定方向承载,而这个方向可以被消除。不同变体的质量有所差异,您的使用行为仍须遵守法律。

#一步步安装免费AI

  1. 01
    检查空闲内存
    关闭浏览器和占用资源较多的应用程序:决定能使用哪个模型的是可用内存,而不是内存总容量。
  2. 02
    安装软件
    如果您能熟练使用命令,请选择 Ollama;如果您想使用图形界面,请选择 LM Studio。请选择适用于您操作系统的版本:Windows、macOS 或 Linux。
  3. 03
    下载合适大小的模型
    请参见第一节的表格:8 GB 内存对应 2 至 4 GB 的文件;16 GB 内存对应 5 至 8 GB 的文件。在只有 8 GB 内存的情况下,6.6 GB 的文件不会留下余量。
  4. 04
    启动,然后检查
    先与模型对话,然后在第二个终端中运行 ollama ps,查看模型是在 GPU、CPU 还是两者上运行。
示例:一个轻量级模型,随后是 16 GB 的模型
# Machine de 8 Go
ollama run qwen3.5:4b

# Machine de 16 Go
ollama run qwen3.5:9b

# Vérifier le placement CPU ou GPU et le contexte alloué
ollama ps
智能体与代码:扩展上下文(会消耗更多内存)
OLLAMA_CONTEXT_LENGTH=64000 ollama serve

#即便标榜“本地”,哪些内容仍可能被传出设备

“本地”描述的是模型在哪里运行,而不是软件其余部分做了什么。以下四种情况会导致数据外传或暴露。

Ollama 的托管模型
该应用允许使用在 Ollama 云平台运行的模型,该平台将处理您的提示和响应;Ollama 无法看到您本地执行的内容。若要禁用此功能,请设置环境变量 OLLAMA_NO_CLOUD=1 或选择 disable_ollama_cloud 选项。
Jan 的连接器
Jan 可连接 OpenAI、Anthropic、Mistral 或 Groq。使用已下载的模型时,运行仍在本地进行;使用连接器时,对话会发送至所选服务提供商。
模型的下载
LM Studio 会发出网络请求以搜索模型、下载并检查更新。对话、您的文档以及本地服务器将保留在设备上。
向网络开放访问
Ollama 默认监听127.0.0.1:只有您的电脑可以访问。OLLAMA_HOST 变量可更改监听地址;只有在您清楚哪些人能够连接时,才开放网络访问。
!
检测托管模型
在 Ollama 中,标签以 cloud 结尾的模型(如 gemma4:31b-cloud)不会在您的设备上运行。如果您选择本地运行是为了保护隐私,请在配置中禁用这些功能。
常见问题
入门时,哪款免费的本地 AI 最好?+
使用 Ollama 或 LM Studio,搭配模型文件能轻松装入您的内存、并留有充足余量的模型:8 GB 内存可选 Qwen 3.5 4B(3.4 GB);16 GB 内存可选 Qwen 3.5 9B(6.6 GB)或 Granite 4.2 8B(5.3 GB)。用您自己的文本比较两个模型。
可以在没有 GPU 的情况下免费使用本地 AI 吗?+
可以。模型使用处理器和 RAM 运行,此时 Ollama 会显示 100 % CPU。限制在于速度,而速度取决于内存带宽除以文件大小。选择大小为 2 到 4 GB 的模型,并保持较短的上下文。
LM Studio 和 Ollama 真的免费吗?+
对于本地使用,是的。自 2025 年 7 月 8 日起,LM Studio 无论家用还是工作用途均免费,但它并非开源软件。Ollama 采用 MIT 许可证;其托管模型按使用量计费,提供付费套餐,不属于本地免费使用的范围。
我的本地 AI 会将数据上传到互联网吗?+
如果对话使用的是加载在您自己机器上的模型,就不会:LM Studio 表示,您输入的内容不会离开设备。但使用托管模型、在线连接器或 cloud 标签时,数据会发送出去。如果您希望完全在本地使用,请禁用这些选项。
能否在本地运行Claude或ChatGPT?+
Claude Code 工具可使用本地模型(例如 Qwen)通过 Ollama 启动,但实际响应的模型是您下载的模型。OpenAI 发布了 gpt-oss,采用 Apache 2.0 开源许可,权重公开:这是本地运行最接近 ChatGPT 的方式。
是否存在无限制的本地 AI?+
Hugging Face 上有一些称为 abliterated 的社区变体,它们移除了模型的拒绝能力。不同变体的质量各不相同,您如何使用它们仍须遵守法律。专题指南详细说明了它们带来的变化以及需要采取的预防措施。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。