Android 上的本地 LLM:PocketPal,MLC Chat (2026)
在 Android 上运行本地 LLM,意味着一个无需云端、直接在手机处理器上离线响应的助手。如今,量化后参数量在 10 亿到 40 亿之间的模型,已能装进中端智能手机的 RAM 中,并以可用的速度进行响应。本指南涵盖三种方法——使用 PocketPal 和 MLC Chat 可无需命令行即可入门,使用 Termux 运行 llama.cpp 则可深入探索——并涉及速度、发热和续航方面的实际限制。
#为何在 Android 上本地运行 LLM
在 Android 上运行本地 LLM 可满足三个具体需求:完全保护隐私(您的提示词永远不会离开设备)、离线使用(乘飞机、处于无网络覆盖区域、漫游费用高昂时),以及免费使用(无需订阅,也不按 token 收费)。需要妥协的是模型大小:手机能运行的模型比 PC 上的小得多,因此能力也更有限。但对于摘要、改写、翻译或简单对话,3B 模型就绰绰有余。
- 隐私
- 模型在手机的系统级芯片上运行,不会将任何数据发送到互联网,可通过关闭Wi-Fi和移动数据进行验证。
- 离线
- 模型下载完成后,即使开启飞行模式也能正常使用。出行或身处无网络地区时很方便。
- 免费使用
- 无需账户,没有配额限制,也不按 token 收费。唯一的代价是消耗电池电量。
- 需了解的限制
- 一款智能手机在实际应用中最多只能支持约40亿参数。对于复杂推理或编程任务,本地运行的大型语言模型(LLM)在个人电脑上仍具有明显优势。
#所需手机配置
只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。
- 在线空间,终身可用
- PDF + 文件
- 30 天内退款
决定性因素是 RAM,就像在 PC 上,VRAM 决定了模型大小的上限一样。一个 Q4 量化的 3B 模型占用约 2 GB,此外还要加上系统和应用的内存占用。实际使用时必须留有余量,因为 Android 会强制关闭内存消耗过大的应用。
- 6 GB 内存
- 最低可用配置。可运行采用 Q4 量化的 1B 至 3B 参数模型。启动推理前,请关闭其他应用程序。
- 8 GB 内存
- 运行 3B 模型较为轻松,也能运行 4B 模型。这是近期中端机型的理想配置。
- RAM 12GB及以上
- 较新的旗舰机型。可以轻松运行 4B 模型,甚至能运行经过激进量化的 7B 模型,但速度较慢。
- 存储
- 每下载一个模型,请预留 2–5 GB 的可用存储空间。GGUF 文件体积较大。
- SoC
- 骁龙 8 系列或同等的较新芯片能显著提升速度。入门级芯片也能运行,但速度仍然较慢。
#PocketPal:5 分钟内部署本地大语言模型
PocketPal AI 是最简单的入门应用。它是一个可在 Google Play 商店获取的开源项目,内置 llama.cpp,并提供可直接从 Hugging Face 下载的模型目录,无需任何命令行操作。
- 01安装应用程序在 Google Play Store 搜索「PocketPal AI」并安装。该应用免费且开源(代码可在 GitHub 上获取)
- 02打开模型目录在 Models 选项卡中浏览推荐模型列表。PocketPal 显示文件大小,并提示适合您 RAM 的模型。
- 03下载1-4B模型先选择一个小模型,例如采用 Q4 量化的 Qwen 3.5 2B(约 1.9 GB)或 Granite 4.2 3B(约 2.2 GB)。下载通过网络进行,只需一次。
- 04加载并对话点击已下载模型旁的 Load 按钮,等待模型加载至内存,然后打开聊天窗口。首次响应将在几秒预热后开始。
PocketPal 也允许您调整推理参数(温度、上下文长度、CPU 线程数),并可导入您自己的 GGUF 模型文件,以使用不在目录中的模型。对于首次在 Android 上体验本地 LLM,这是最直接的路径。
#MLC Chat 与 GPU 加速
MLC Chat 是 MLC LLM 项目的演示应用。该项目会编译模型,以便通过 Vulkan/OpenCL API 利用移动 GPU,而不是将所有计算都放在 CPU 上执行。在较新的 SoC 上,与纯 CPU 运行相比,这可能提高速度,并略微降低功耗。
- 01获取 APKMLC Chat 并非始终在 Play Store 上架。请从 MLC LLM 项目官网(llm.mlc.ai)下载官方 APK,并允许从外部来源安装。
- 02下载已编译的模型该应用提供已转换为 MLC 格式的模型(Gemma、Qwen、Granite 的小型版本)。请选择一个适合您内存容量的模型。
- 03启动聊天选择模型,等待初始化,然后开始对话。MLC在屏幕底部显示每秒token数。
#通过 Termux 使用 llama.cpp,探索更多功能
要获得完全控制——精确选择模型和量化方式,并提供本地服务器服务——进阶方案是使用 Termux。这是一款 Android 终端模拟器,无需 root 权限即可访问 Linux 环境。您可以在其中编译 llama.cpp,并像在 Linux 电脑上一样,通过命令行运行推理。
- 01安装并配置Termux从F-Droid安装Termux,打开后更新基础包。
- 02安装构建工具获取编译 llama.cpp 所需的编译器、git 和 cmake 工具
- 03编译 llama.cpp克隆官方仓库并进行编译。在移动设备上,CPU构建(ARM NEON)最为可靠。
- 04下载 GGUF 模型通过 curl 或 wget 从 Hugging Face 获取一个体积较小的 .gguf 文件(1-3B,Q4 量化)。
- 05启动推理使用 llama-cli 进行对话,或使用 llama-server 在 localhost 上提供兼容 OpenAI 的 API,可通过浏览器访问。
服务器模式很实用:它在 localhost 上提供一个兼容 OpenAI 的端点,您可以通过手机浏览器或其他应用调用它。这与 PC 上的 Ollama 服务器(默认监听 11434 端口)采用相同的方式,只是搬到了随身携带的手机上。
#哪些 1–4B 模型实际能运行
关键在于选择 10 亿至 40 亿参数的模型,并采用 Q4_K_M 量化(与在 PC 上一样,这是质量与大小之间的最佳折中)。超过 40 亿参数,手机就会运行缓慢或内存不足。以下是法语表现最好的模型系列。
- Qwen 3.5 2B
- 2026 年默认推荐的小模型(Q4 量化时约 1.9 GB)。多语言和法语表现出色,支持较长的上下文,采用 Apache 2.0 许可证。在配备 6 GB 内存的手机上追求速度时,这是最佳入门选择。
- Qwen 3.5 4B
- 质量更上一层,同时仍在移动设备可运行的范围内(Q4 下约 3.4 GB)。如果您的手机有至少 8 GB 内存,Q4 下的输出连贯,能力也不错。采用 Apache 2.0 许可证。
- Granite 4.2 3B
- IBM 的小型模型(Q4 量化下约 2.2 GB),内存占用很低,token 使用效率也很高。在 RAM 容量有限时,是一款可靠的离线通用模型。Apache 2.0。
- Gemma 4 E2B
- 谷歌的紧凑版模型(约 4.3 GB),支持多模态,自 2026 年 4 月起重新采用 Apache 2.0 许可证。只建议在内存至少为 8 GB 的手机上使用。
#速度、发热和电池:需要了解的关键点
LLM 推理会让 CPU(或 GPU)满负荷运行,这在手机上有三个很具体的后果:速度仍然有限、设备会发热,而且生成过程中电量消耗很快。这些并不妨碍使用,但需要对速度、发热和耗电的大致程度心中有数。
- 速度
- 在中高端 SoC 上,3B Q4 模型的速度大致为 5 至 15 token/秒。生成的文本可以实时阅读,但速度远不及 PC 的 GPU。1B 模型明显更快。
- 发热与降频
- 在长时间生成后,SoC 温度上升并出现降频(throttling),导致后续响应变慢。请在两次长时间请求之间留出冷却时间。
- 电池
- 持续使用可能让电量在几分钟内下降几个百分点。偶尔使用时影响不大;高强度使用时,请接上充电器。
- 上下文
- 上下文窗口越大,内存占用和处理时间就越高。在移动设备上,应保持合理的上下文长度(2k-4k tokens),以确保流畅性。
#故障排除
- 应用在加载模型时关闭
- RAM不足。请关闭其他所有应用程序,选择更小的模型(例如1B而非3B)或使用更轻量的量化方式。
- 响应非常缓慢
- 缩短上下文长度,减少生成的 token 数量,或切换到更小的模型。也请检查手机是否因过热而降频。
- Termux:编译后无法找到命令
- 构建过程静默失败。请重新编译并查看错误信息,确保已正确安装 git、cmake 和 clang。
- Termux 不再维护/软件包过时
- 您已安装 Play Store 版本。请卸载并从 F-Droid 或 GitHub 重新安装 Termux。
- 回答不一致
- 对于一个极小模型处理复杂任务而言属正常现象。请简化请求,或接受 1-3B 模型在推理能力上的局限性。
#深入了解
在移动设备上用得得心应手之后,您很可能会想在家里用一台性能更强的机器来处理繁重任务。本网站的以下指南是本指南的延伸:
- 在无 GPU(仅 CPU)的情况下本地运行 LLM
- 与移动端相同的逻辑,但适用于PC:根据RAM推荐模型,并提供纯CPU加速的技巧。
- 选择量化方案(Q4、Q5、Q8、FP16)
- 了解为什么 Q4_K_M 是推荐的折中选择,无论是在手机上还是在 PC 上。
- 安装 Ollama
- 用于在家中搭建真正的 LLM 服务器,可通过局域网从手机向其提问。
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。