入门 10 分钟移动端

Android 上的本地 LLM:PocketPal,MLC Chat (2026)

在 Android 上运行本地 LLM,意味着一个无需云端、直接在手机处理器上离线响应的助手。如今,量化后参数量在 10 亿到 40 亿之间的模型,已能装进中端智能手机的 RAM 中,并以可用的速度进行响应。本指南涵盖三种方法——使用 PocketPal 和 MLC Chat 可无需命令行即可入门,使用 Termux 运行 llama.cpp 则可深入探索——并涉及速度、发热和续航方面的实际限制。

作者: Léa B.·更新于 2026-08-27·已在 Windows、macOS 和 Linux 上测试

#为何在 Android 上本地运行 LLM

在 Android 上运行本地 LLM 可满足三个具体需求:完全保护隐私(您的提示词永远不会离开设备)、离线使用(乘飞机、处于无网络覆盖区域、漫游费用高昂时),以及免费使用(无需订阅,也不按 token 收费)。需要妥协的是模型大小:手机能运行的模型比 PC 上的小得多,因此能力也更有限。但对于摘要、改写、翻译或简单对话,3B 模型就绰绰有余。

隐私
模型在手机的系统级芯片上运行,不会将任何数据发送到互联网,可通过关闭Wi-Fi和移动数据进行验证。
离线
模型下载完成后,即使开启飞行模式也能正常使用。出行或身处无网络地区时很方便。
免费使用
无需账户,没有配额限制,也不按 token 收费。唯一的代价是消耗电池电量。
需了解的限制
一款智能手机在实际应用中最多只能支持约40亿参数。对于复杂推理或编程任务,本地运行的大型语言模型(LLM)在个人电脑上仍具有明显优势。
i
手机本地 ≠ 电脑本地
不要将手机上的 3B 模型与 GPT-4 相比。请以离线助手能完成的任务来衡量它:改写一条消息、总结粘贴的文本、回答一个常识问题。在这个范围内,它的表现令人惊叹;超出这个范围,就会很快显露出局限。

#所需手机配置

本地 AI 套件

只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。

  • 在线空间,终身可用
  • PDF + 文件
  • 30 天内退款

决定性因素是 RAM,就像在 PC 上,VRAM 决定了模型大小的上限一样。一个 Q4 量化的 3B 模型占用约 2 GB,此外还要加上系统和应用的内存占用。实际使用时必须留有余量,因为 Android 会强制关闭内存消耗过大的应用。

6 GB 内存
最低可用配置。可运行采用 Q4 量化的 1B 至 3B 参数模型。启动推理前,请关闭其他应用程序。
8 GB 内存
运行 3B 模型较为轻松,也能运行 4B 模型。这是近期中端机型的理想配置。
RAM 12GB及以上
较新的旗舰机型。可以轻松运行 4B 模型,甚至能运行经过激进量化的 7B 模型,但速度较慢。
存储
每下载一个模型,请预留 2–5 GB 的可用存储空间。GGUF 文件体积较大。
SoC
骁龙 8 系列或同等的较新芯片能显著提升速度。入门级芯片也能运行,但速度仍然较慢。
→
检查您的实际内存
标称内存并非全部可用:系统会预留一部分。对于配备 8 GB 内存的手机,实际可分配给一个应用的内存约为 5 到 6 GB。这才是可用于加载模型的内存空间。

#PocketPal:5 分钟内部署本地大语言模型

PocketPal AI 是最简单的入门应用。它是一个可在 Google Play 商店获取的开源项目,内置 llama.cpp,并提供可直接从 Hugging Face 下载的模型目录,无需任何命令行操作。

  1. 01
    安装应用程序
    在 Google Play Store 搜索「PocketPal AI」并安装。该应用免费且开源(代码可在 GitHub 上获取)
  2. 02
    打开模型目录
    在 Models 选项卡中浏览推荐模型列表。PocketPal 显示文件大小,并提示适合您 RAM 的模型。
  3. 03
    下载1-4B模型
    先选择一个小模型,例如采用 Q4 量化的 Qwen 3.5 2B(约 1.9 GB)或 Granite 4.2 3B(约 2.2 GB)。下载通过网络进行,只需一次。
  4. 04
    加载并对话
    点击已下载模型旁的 Load 按钮,等待模型加载至内存,然后打开聊天窗口。首次响应将在几秒预热后开始。

PocketPal 也允许您调整推理参数(温度、上下文长度、CPU 线程数),并可导入您自己的 GGUF 模型文件,以使用不在目录中的模型。对于首次在 Android 上体验本地 LLM,这是最直接的路径。

→
断开网络进行测试
模型加载完成后,开启飞行模式并开始对话。对话仍能正常进行:这就是推理 100% 在本地运行、没有任何网络调用的具体证明。

#MLC Chat 与 GPU 加速

MLC Chat 是 MLC LLM 项目的演示应用。该项目会编译模型,以便通过 Vulkan/OpenCL API 利用移动 GPU,而不是将所有计算都放在 CPU 上执行。在较新的 SoC 上,与纯 CPU 运行相比,这可能提高速度,并略微降低功耗。

  1. 01
    获取 APK
    MLC Chat 并非始终在 Play Store 上架。请从 MLC LLM 项目官网(llm.mlc.ai)下载官方 APK,并允许从外部来源安装。
  2. 02
    下载已编译的模型
    该应用提供已转换为 MLC 格式的模型(Gemma、Qwen、Granite 的小型版本)。请选择一个适合您内存容量的模型。
  3. 03
    启动聊天
    选择模型,等待初始化,然后开始对话。MLC在屏幕底部显示每秒token数。
i
移动GPU:性能提升无法保证
GPU 加速效果在很大程度上取决于系统级芯片(SoC)和驱动程序。在某些手机上,MLC 比使用 CPU 的 llama.cpp 更快;在其他手机上,发热和降频却会使结果反过来。请先在您的设备上测试两者,再下结论。

#通过 Termux 使用 llama.cpp,探索更多功能

要获得完全控制——精确选择模型和量化方式,并提供本地服务器服务——进阶方案是使用 Termux。这是一款 Android 终端模拟器,无需 root 权限即可访问 Linux 环境。您可以在其中编译 llama.cpp,并像在 Linux 电脑上一样,通过命令行运行推理。

!
请从 F-Droid 安装 Termux,而不是从 Play 商店安装
Play Store 的版本已过时且被弃用。请从 F-Droid 或 GitHub 安装 Termux,以获取最新包。这是初学者最常见的错误来源。
  1. 01
    安装并配置Termux
    从F-Droid安装Termux,打开后更新基础包。
  2. 02
    安装构建工具
    获取编译 llama.cpp 所需的编译器、git 和 cmake 工具
  3. 03
    编译 llama.cpp
    克隆官方仓库并进行编译。在移动设备上,CPU构建(ARM NEON)最为可靠。
  4. 04
    下载 GGUF 模型
    通过 curl 或 wget 从 Hugging Face 获取一个体积较小的 .gguf 文件(1-3B,Q4 量化)。
  5. 05
    启动推理
    使用 llama-cli 进行对话,或使用 llama-server 在 localhost 上提供兼容 OpenAI 的 API,可通过浏览器访问。
Termux — 准备工作
# Mettre à jour les paquets
pkg update && pkg upgrade -y

# Outils de compilation
pkg install -y git cmake clang wget
Termux — 编译 llama.cpp
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
cmake -B build
cmake --build build --config Release -j$(nproc)
Termux — 下载模型并进行对话
# Exemple : un petit modèle Q4 depuis Hugging Face
wget -O qwen3.5-2b-q4.gguf "<URL_DU_FICHIER_GGUF>"

# Discuter en ligne de commande
./build/bin/llama-cli -m qwen3.5-2b-q4.gguf -p "Résume ce texte : ..." -n 256
Termux — 兼容 OpenAI 的本地服务器
# Expose une API sur http://localhost:8080
./build/bin/llama-server -m qwen3.5-2b-q4.gguf --port 8080

服务器模式很实用:它在 localhost 上提供一个兼容 OpenAI 的端点,您可以通过手机浏览器或其他应用调用它。这与 PC 上的 Ollama 服务器(默认监听 11434 端口)采用相同的方式,只是搬到了随身携带的手机上。

#哪些 1–4B 模型实际能运行

关键在于选择 10 亿至 40 亿参数的模型,并采用 Q4_K_M 量化(与在 PC 上一样,这是质量与大小之间的最佳折中)。超过 40 亿参数,手机就会运行缓慢或内存不足。以下是法语表现最好的模型系列。

Qwen 3.5 2B
2026 年默认推荐的小模型(Q4 量化时约 1.9 GB)。多语言和法语表现出色,支持较长的上下文,采用 Apache 2.0 许可证。在配备 6 GB 内存的手机上追求速度时,这是最佳入门选择。
Qwen 3.5 4B
质量更上一层,同时仍在移动设备可运行的范围内(Q4 下约 3.4 GB)。如果您的手机有至少 8 GB 内存,Q4 下的输出连贯,能力也不错。采用 Apache 2.0 许可证。
Granite 4.2 3B
IBM 的小型模型(Q4 量化下约 2.2 GB),内存占用很低,token 使用效率也很高。在 RAM 容量有限时,是一款可靠的离线通用模型。Apache 2.0。
Gemma 4 E2B
谷歌的紧凑版模型(约 4.3 GB),支持多模态,自 2026 年 4 月起重新采用 Apache 2.0 许可证。只建议在内存至少为 8 GB 的手机上使用。
→
Q4 量化下的内存占用
参考:在 Q4 量化下,1B 模型约需 1 GB 内存,3B 模型约需 2 GB,4B 模型约需 3 GB。还要加上系统和应用占用的内存:因此,8 GB 内存的手机应以 3–4B 模型为目标,不宜选择更大的模型。

#速度、发热和电池:需要了解的关键点

LLM 推理会让 CPU(或 GPU)满负荷运行,这在手机上有三个很具体的后果:速度仍然有限、设备会发热,而且生成过程中电量消耗很快。这些并不妨碍使用,但需要对速度、发热和耗电的大致程度心中有数。

速度
在中高端 SoC 上,3B Q4 模型的速度大致为 5 至 15 token/秒。生成的文本可以实时阅读,但速度远不及 PC 的 GPU。1B 模型明显更快。
发热与降频
在长时间生成后,SoC 温度上升并出现降频(throttling),导致后续响应变慢。请在两次长时间请求之间留出冷却时间。
电池
持续使用可能让电量在几分钟内下降几个百分点。偶尔使用时影响不大;高强度使用时,请接上充电器。
上下文
上下文窗口越大,内存占用和处理时间就越高。在移动设备上,应保持合理的上下文长度(2k-4k tokens),以确保流畅性。
!
请勿使用快速充电
在快充的同时运行大语言模型,两种热源会同时产生热量。长期反复发热会损耗电池。高强度使用时,建议选择慢充,或适当暂停使用。

#故障排除

应用在加载模型时关闭
RAM不足。请关闭其他所有应用程序,选择更小的模型(例如1B而非3B)或使用更轻量的量化方式。
响应非常缓慢
缩短上下文长度,减少生成的 token 数量,或切换到更小的模型。也请检查手机是否因过热而降频。
Termux:编译后无法找到命令
构建过程静默失败。请重新编译并查看错误信息,确保已正确安装 git、cmake 和 clang。
Termux 不再维护/软件包过时
您已安装 Play Store 版本。请卸载并从 F-Droid 或 GitHub 重新安装 Termux。
回答不一致
对于一个极小模型处理复杂任务而言属正常现象。请简化请求,或接受 1-3B 模型在推理能力上的局限性。

#深入了解

在移动设备上用得得心应手之后,您很可能会想在家里用一台性能更强的机器来处理繁重任务。本网站的以下指南是本指南的延伸:

在无 GPU(仅 CPU)的情况下本地运行 LLM
与移动端相同的逻辑,但适用于PC:根据RAM推荐模型,并提供纯CPU加速的技巧。
选择量化方案(Q4、Q5、Q8、FP16)
了解为什么 Q4_K_M 是推荐的折中选择,无论是在手机上还是在 PC 上。
安装 Ollama
用于在家中搭建真正的 LLM 服务器,可通过局域网从手机向其提问。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。