进阶 15 分钟Edge

Raspberry Pi 5 上的 LLM:本地人工智能 嵌入式

两年前,在树莓派上运行大语言模型(LLM)听起来还像个笑话。如今,凭借 8 GB 版树莓派 5、其搭载的 BCM2712 SoC(四核 Cortex-A76,主频 2.4 GHz),以及 2026 年涌现的 2–4B 小型模型,这已成为切实可行的用途。本指南介绍如何在树莓派上安装 Ollama,测量 Qwen 3.5 2B、Granite 4.2 3B 和 Qwen 3.5 4B 每秒生成的 token 数,并展示嵌入式 LLM 在哪些场景下具有实际意义。

作者: Mohamed Meguedmi·更新于 2026-08-27·已在 Windows、macOS 和 Linux 上测试

#为何在Raspberry Pi上运行LLM?

Raspberry Pi 5 无法替代您的 RTX 4090。目标并非原始速度,而是嵌入式应用:一张售价 80 欧元、功耗 5-12 W、尺寸如信用卡大小、可 24 小时无噪音运行的卡片。对于边缘用例——本地语音助手、智能气象站、离线信息亭、移动机器人——这已经足够,且比迷你 PC 便宜得多。

另一个优势是绝对的隐私保护。任何数据都不会离开本地网络。您可以在儿童房里搭建一个家庭助手,无需云端服务、无需遥测、无需订阅。

i
简而言之
Pi 5 + Ollama + 一个 Q4 量化的 2–4B 模型 = 一个以每秒 2 至 4 个 token 的速度回复的本地助手。速度虽慢,但可独立运行、安静无声,硬件成本也很低。

#硬件要求

本地 AI 套件

只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。

  • 在线空间,终身可用
  • PDF + 文件
  • 30 天内退款
Raspberry Pi 5(需 8 GB)
4 GB 版本可以运行 Qwen 3.5 2B,但面对更大的模型就力不从心了。8 GB 版本是获得较舒适体验的最低配置。16 GB 版本(2024 年末发布)则可以运行 Qwen 3.5 4B,无需使用交换空间。
A2 级 microSD 卡或 NVMe SSD
A1 级 SD 卡会大幅拖慢模型的首次加载。理想方案是通过官方 M.2 HAT 使用 NVMe SSD——带宽超过 500 MB/s,加载 Qwen 3.5 4B 只需 4 秒,而使用 SD 卡则需 30 秒。
官方 27 W 电源适配器
Pi 5 在推理时的功耗为 9–12 W。必须使用官方 USB-C 5 V/5 A 电源,以避免降频。通用的 15 W 电源会导致主板供电电压不足。
主动散热
必不可少。当温度达到80°C时,SoC会降频。官方风扇(5欧元)或Argon ONE V3机箱即可满足需求。不配备散热器,连续2分钟推理后,吞吐量将下降30-40%。
Pi OS 64位(Bookworm)
基于 Debian 12 的 64 位 Raspberry Pi OS。Ollama 不支持 32 位。请使用 uname -m 检查 → 结果应为 aarch64。
!
无可用 GPU
Pi 5搭载的VideoCore VII没有针对LLM推理的官方支持(没有稳定的Vulkan后端,也没有成熟的机器学习驱动程序)。所有运算都在4个ARM CPU核心上运行。这是主要的限制因素。

#1. 在Pi 5上安装 Ollama

Ollama 自 2024 年起正式支持 Linux/arm64。通用安装脚本可直接在 Pi OS 上运行,无需手动编译。

安装 Ollama (1行)
curl -fsSL https://ollama.com/install.sh | sh

脚本下载 ARM64 二进制文件(约 150 MB),安装 systemd 服务,并在 11434 端口启动守护进程。预计耗时 1 到 2 分钟。

检查服务是否正常运行
systemctl status ollama
ollama --version
→
从局域网访问
默认情况下 Ollama 在 127.0.0.1:11434 上监听。若需从局域网内的其他设备(如手机、笔记本)访问,请编辑 /etc/systemd/system/ollama.service,添加 Environment="OLLAMA_HOST=0.0.0.0:11434"。然后执行 sudo systemctl daemon-reload && sudo systemctl restart ollama。

#2. 推荐用于 Raspberry Pi 的模型

在 Pi 5 8 GB 设备上,实际可用的 RAM 约为 6.5 GB(系统和缓存会占用剩余部分)。任何量化为 Q4 且超过 4-5 GB 的 LLM 均无法正常运行——它会频繁交换到 microSD 上,导致处理速度降至 0.1 tok/s。

2026年8月在 Pi 5 上表现最佳的三个模型为:

Qwen 3.5 2B(阿里巴巴,Apache 2.0)
性能与内存占用比的佼佼者。Q4_K_M 量化下大小为 1.9 GB,支持多模态,具有 256k 上下文,在短对话和法语方面表现出色。非常适合简单助手或语音指令。
Granite 4.2 3B (IBM, Apache 2.0)
非常精简且 token 效率高。Q4_K_M 格式下为 2.2 GB。推理质量提升一个档次,专为 24 小时运行而设计,不会耗尽 RAM。多语言支持稳健。
Qwen 3.5 4B (阿里巴巴,Apache 2.0)
新的“默认小模型”,也是三个模型中能力最强的。采用 Q4_K_M 量化时大小为 3.4 GB。可装入配备 8 GB 内存的 Pi 5 的 RAM 中,但剩余空间很少——不要同时运行占用资源较多的图形界面。
下载三个模型
ollama pull qwen3.5:2b
ollama pull granite4.2:3b
ollama pull qwen3.5:4b
i
为什么不选择 gpt-oss 20B 或 Mistral Small 24B?
这些模型在 Q4 量化后约为 14 GB,无法装入 8 GB 版 Pi 5 实际可用的 6.5 GB 内存。即使是 16 GB 版 Pi,也会让它们使用交换空间,速度只有 0.3–0.5 tok/s,无法使用。在 Pi 上请选择小于 4B 的模型;上述模型需要 Mac 或 GPU。

#3. 速度基准测试(token/秒,数量级参考)

在配备官方主动散热器、通过HAT M.2连接的NVMe SSD、运行Pi OS Bookworm 64位系统、Ollama最新版本、量化方式为Q4_K_M、生成提示长度为200个token的Raspberry Pi 5 8GB上的测试数据显示,性能规模大致如此。具体数值会因Ollama版本及散热条件而异——请将其视为大致规模,而非绝对值。

Qwen 3.5 2B Q4_K_M
≈ 4.4 tokens/sec 生成 · 6.6 tok/s 提示评估 · 1.9 GB 内存 · 9.6 W
Granite 4.2 3B Q4_K_M
生成 ≈ 3.4 tokens/sec · 提示词处理 5.1 tok/s · RAM 占用 2.2 GB · 功耗 10.2 W
Qwen 3.5 4B Q4_K_M
≈ 2.3 tokens/秒生成 · 3.6 tok/s 提示评估 · 3.4 GB 内存 · 11.2 W
Gemma 4 E2B(多模态参考模型)
≈ 3.9 tokens/sec · 4.3 GB RAM · 10.4 W。MoE 速度快但内存消耗较大。
Granite 4.2 3B Q3_K_S(节省资源的版本)
≈ 3.6 tokens/sec · 1.7 GB RAM · 9.9 W。这组模型中最轻量的一款,适合内存紧张的情况(4 GB 内存的 Pi)。
→
如何理解这些数字
以每秒 5 个 token 的速度,生成 80 词的回复需要 20-25 秒。虽然比云端助手慢,但对于非交互场景(如通知、批量摘要、异步语音控制)来说已足够。
在本地复现这些基准测试
ollama run qwen3.5:2b --verbose "Explique en 100 mots ce qu'est un Raspberry Pi."

--verbose 标志会在生成结束时显示:eval rate(tok/s)、prompt eval rate、total duration。这是用于比较的官方测量指标。

#4. 适用的离线使用场景

在每秒生成2到5个token的速度下,Raspberry Pi上的推理并不以实时聊天为目标。它适合延迟并不关键,或隐私和独立运行能力比速度更重要的场景。

本地语音助手
Pi 5 + USB 麦克风 + Whisper.cpp tiny + Qwen 3.5 2B + Piper TTS。问题 → 语音转文字 → 回答 → 语音合成,全程耗时 8-12 秒,无需云端服务。离线家居自动化、儿童交互终端、教育机器人。
批量生成电子邮件或新闻摘要
一个 cron 定时任务,每小时拉取 RSS 源,用 Qwen 3.5 4B 生成摘要,再发送到 Telegram/Matrix。异步运行时,推理延迟不会被察觉。
日志或工单分类
部署在网络边缘的 Raspberry Pi 在将传入日志发送至中央服务器之前,先为其添加标签(“严重错误”“垃圾信息”“正常”)。可节省 WAN 带宽。
嵌入式 / 便携式演示
客户演示、学校工作坊、会议:随身携带Pi 5,配备USB-C充电电池,实现100%自主的本地AI演示。
其他 LLM 的安全防护
一个小型本地模型,在将提示词发送给云端 LLM 之前,先对其进行过滤或改写。可用于在边缘端对敏感数据进行匿名化处理。
!
Pi 无法满足需求的场景
针对超过 50 份文档的 RAG、长篇代码生成、具有复杂工具调用的智能体、逐步推理(使用 Qwen 3.8 27B 等思维链模型)——这些场景更适合选择 Mac mini M4 或 GMKtec/Beelink 迷你 PC。它们每欧元所能提供的性能要好得多。

#5. 针对 Pi 的优化

#缩小上下文窗口

默认情况下,Ollama 使用 num_ctx=2048。在 Pi 上,这已经不少了——每个上下文 token 都会消耗 RAM,并减慢预评估速度。对于短对话助手,请将其降至 1024。

在当前会话中运行时设置
/set parameter num_ctx 1024

#限制线程数量

Ollama 默认使用所有核心。在 Pi 5(4 个核心)上,单从速度来看,这是最优选择,但会让 SoC 满负荷运行,导致 1–2 分钟后触发过热降频。长时间使用时,将核心数限制为 3 个,可以更长时间地维持稳定吞吐量。

通过env环境变量限制线程数
OLLAMA_NUM_PARALLEL=1 OLLAMA_NUM_THREAD=3 ollama serve

#优先选择NVMe而非microSD

首次从 SD 卡加载模型时,会顺序读取数 GB 的数据。使用 A1 级 SD 卡加载 Phi-3.5 Mini 需要 30–40 秒,使用 NVMe 则需要 3–5 秒。模型载入 RAM 后,推理表现相同。

#如果内存不足,降低一个级别

在启用图形界面的 8 GB 版 Pi 5 上,采用 Q4_K_M 量化的 Qwen 3.5 4B 可能开始使用交换空间。两种选择是改用更小的 Granite 4.2 3B(2.2 GB)或 Qwen 3.5 2B(1.9 GB),可释放 1 至 1.5 GB 的 RAM,同时避免模型质量大幅下降。

更轻量的模型
ollama pull granite4.2:3b
→
推荐使用无头模式
如果您将Pi配置为专用推理服务器,请禁用LXDE桌面:sudo raspi-config → Boot Options → Console。这样可以释放300–500 MB的RAM,足以让您轻松从2B模型换用4B模型。

#故障排除

安装后出现 ollama: command not found
systemd 脚本执行失败(通常是因为 Pi OS 过旧)。请检查 sudo systemctl status ollama。若出现 'exec format error' 错误,说明系统为 32 位——请重新安装 64 位的 Pi OS。
模型加载成功,但处理速度仅为 0.3 token/s
您已使用交换空间。请运行 free -h:若 'available' 列在推理过程中低于 500MB,说明模型过大。请降级至 Granite 4.2 3B 或 Qwen 3.5 2B,或切换至 Q3。
1 分钟后因过热而降频
SoC 温度超过 80 °C。推理时请检查 vcgencmd measure_temp。解决方案:使用官方风扇或 Argon ONE V3。在无主动散热情况下,Pi 5 无法持续进行推理。
生成中途内存不足
Linux的OOM killer终止了Ollama。请将num_ctx减小到1024,关闭浏览器,或切换到更小的模型。在Pi 4 GB设备上,请保持使用Qwen 3.5 2B,这是2026年目录中最轻量的模型。
Ollama 服务未随系统启动
sudo systemctl enable ollama pour activer l'autostart. Vérifiez ensuite avec systemctl is-enabled ollama.

#深入了解

Ollama 在您的 Pi 5 上运行起来后,可以沿以下三个方向继续深入探索:

理解量化技术以进一步优化
《如何选择量化方案》指南详细比较了 Q3、Q4、Q5 和 Q8。这在 Pi 上尤为关键,因为每 100 MB 内存都很重要。
集成到Python应用中
《通过 REST API 将 Ollama 集成到 Python 中》指南展示了如何通过 Flask/FastAPI 脚本控制您的 Pi 5——这是任何边缘端助手的基础。
实现离线工作流自动化
《使用 n8n 和 Ollama 实现自动化》指南可直接用于树莓派,无需修改(n8n 可在 ARM64 上原生运行)。非常适合打造自主运行的 AI 智能家居中枢。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。