入门 10 分钟移动端

在 iPhone 和 iPad 上本地运行 LLM:可运行的应用和模型 vraiment

在 iPhone 上运行本地 LLM 是可行的,而且确实能用:Apple Silicon 芯片(A 系列和 M 系列)与 MLX 框架支持直接在设备上离线运行参数量为 10 亿至 80 亿的模型。本指南会筛选出兑现承诺的应用,解释不同 iPhone 或 iPad 上的 RAM 容量究竟会带来什么影响,并给出真实的性能参考——不掺杂营销话术。

作者: Clara M.·更新于 2026-08-27·已在 macOS 14+ 上测试

#为何在iPhone上运行本地LLM

iOS 上的本地大语言模型会在您的设备上完成所有计算:无需服务器,无需订阅,也不会有任何数据离开手机。这与 ChatGPT 这类应用正好相反,后者会将每条消息发送到云端。选择这种方式的理由很具体:完全保护隐私(医疗笔记、草稿、代码)、在飞机上或没有网络时也能运行,以及模型下载完成后没有任何持续费用。

这种取舍确实有代价:iPhone 的内存容量和算力都无法与配备 RTX 4070 的 PC 相比。您无法在口袋里的设备上运行一个 70B 模型。不过,经过适当量化的 3B 模型,已足以胜任文本摘要、邮件改写、简单问答或翻译——这些功能都可离线使用,并且随时可以立即调用。

i
移动设备上实际可行的方案
建议选择参数量为 1B 至 8B 的 Q4 量化模型。低于 1B 时,模型质量会急剧下降;超过 8B 时,只有较新的 iPad Pro 和高端 iPhone 才能运行,而且速度仍然很慢。

#Apple Silicon、MLX 和 Neural Engine

本地 AI 套件

只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。

  • 在线空间,终身可用
  • PDF + 文件
  • 30 天内退款

现代iPhone和iPad采用与Mac相同的 Apple Silicon架构:包含系统芯片(iPhone为A系列,iPad Pro为M系列)以及关键的统一内存,该内存同时服务于CPU、GPU和神经引擎。正是这一共享的RAM池使得在移动设备上实现LLM推理成为可能——模型仅加载一次,即可被所有核心共享访问,无需复制。

MLX 是 Apple 的机器学习框架,专为这种统一内存设计。认真打造的 iOS 应用会使用它(或启用了 Metal 支持的 llama.cpp)来利用芯片的 GPU。推理计算的大部分工作就在这里完成:由通过 Metal 调用的 GPU 承担,而不是仅靠 CPU。

!
神经引擎(暂时)还做不到的事
人们常以为神经引擎(ANE)能加速 LLM。实际上,目前逐 token 生成文本主要依靠 GPU,通过 Metal 配合 MLX 或 llama.cpp 来完成。ANE 擅长处理固定计算图的模型(视觉、Face ID),但不太擅长自回归生成。不要指望它提高您的 token/s。
统一内存
CPU、GPU 和 ANE 共享同一 RAM。这是限制您可加载模型大小的第一因素。
GPU Metal
通过 MLX 或 llama.cpp 进行推理,这决定了你的每秒令牌数。
神经引擎(ANE)
性能强大但应用领域较窄。截至目前,尚未被广泛用于 LLM 文本生成。

#各设备的前提条件与 RAM 需求

在 iOS 上,RAM 容量是唯一真正重要的数值,但 Apple 并不突出强调它。然而,正是它决定了模型能否加载,还是会导致应用崩溃。以下是较新设备的参考信息。

iPhone 15 / 15 Plus
6 GB 内存。运行 Q4 量化的 1B–3B 模型比较宽裕。3B 模型可以运行,7B 模型则已接近极限,留给系统的内存余量很少。
iPhone 15 Pro / 16 / 16 Pro
8 GB。移动端的理想配置:3B 模型运行流畅,7B–8B 模型在 Q4 量化、上下文长度适中的情况下也能运行。
iPhone 17 Pro
12 GB(近期的 Pro 系列)。有充足的余量,可流畅运行 7B–8B 模型并使用更长的上下文。
iPad Pro M4
视配置而定,内存为 16 GB 或更多。是运行 iOS 本地模型的最佳设备:8B 模型运行流畅,更大的模型也可以考虑。
→
内存估算的经验法则
iOS不会让一个应用独占全部RAM。可估算第三方应用大约拥有物理内存的一半到三分之二。在8GB iPhone上,合理的模型可用内存预算约为4–5GB——即Q4压缩下的7B模型紧缩运行,或3B模型非常舒适运行。

量化为 Q4 的模型内存占用与桌面环境基本一致:3B 模型约 2 GB,7B 约 5 GB,8B 略多。此外还需考虑上下文内存(KV cache),其大小随对话长度增加而增长,因此长上下文可能导致原本能正常启动的应用崩溃。

#在 iOS 上表现稳定的 App

App Store 中有大量“AI”应用,它们其实只是云端服务的前端。要实现真正的本地运行,需要使用会将模型下载到设备上,并通过 MLX 或 llama.cpp 运行模型的应用。以下是可靠的选择。

PocketPal AI
免费且开源。从Hugging Face下载GGUF格式模型,并通过llama.cpp运行。提供简洁的聊天界面,支持上下文和温度参数设置。推荐的入门方案
LLM Farm
开源,高度可配置。支持多种格式,可精细调节推理过程。操作更偏技术性,非常适合测试不同模型。
Enclave / 基于 MLX 的应用
基于 Apple 的 MLX 框架的应用。在较新的 Apple Silicon 芯片上性能良好,通常注重隐私保护。
Private LLM
付费应用,提供经过优化的量化模型和开箱即用的体验。无需配置,一切都已打包。
i
GGUF,模型文件格式
这些应用大多加载GGUF格式文件——即llama.cpp的格式。您在下载时选择量化方式:Q4_K_M是大小与质量之间的最佳平衡,与PC端相同。在移动端请避免使用FP16,过于臃肿。

#安装并启动模型:分步指南

下面的示例使用免费的 PocketPal AI,其操作流程具有代表性。其他应用的操作逻辑也相同。

  1. 01
    安装应用
    请从 App Store 下载 PocketPal AI。无需账户,不连接任何服务器。
  2. 02
    选择一个模型
    打开内置模型库。应用提供适合移动端的模型(Qwen 3.5 2B、Granite 4.2 3B、Gemma 4 E2B、Qwen 3.5 4B)。先从小模型开始:选择 2B 或 3B 的 Q4 量化版本。
  3. 03
    下载
    开始下载(文件大小从几百 MB 到约 2 GB 不等)。请通过 Wi-Fi 下载。文件会保留在设备本地。
  4. 04
    加载模型
    选择已下载的模型以加载到内存中。如果此时应用程序关闭,说明是内存不足:请选择更小的模型或关闭其他应用程序。
  5. 05
    离线聊天
    打开聊天窗口并提出一个问题。开启飞行模式进行验证:一切仍能正常运行,这证明没有任何数据离开设备。

对于想尝试最底层方式的好奇用户,也可以自行编译 llama.cpp,但 iOS 不允许在已签名应用之外执行任意代码:实际上,对绝大多数用户而言,使用专用应用是唯一现实的途径。

#根据RAM选择合适的模型

合适的模型首先取决于您的设备。以下是从入门到进阶的实用推荐,所有模型均采用 Q4 量化。

iPhone 15 / 15 Plus(6 GB)
追求流畅性可选Qwen 3.5 2B(1.9 GB)或Granite 4.2 3B(2.2 GB);追求更高的回答质量可选Qwen 3.5 4B(3.4 GB)。请保持较短的上下文长度。
iPhone 16 / 16 Pro (8 GB)
日常流畅使用3B至4B模型。8B至9B模型(Granite 4.2 8B 占5.3 GB,Qwen 3.5 9B 占6.6 GB,256k上下文和视觉功能)在Q4量化下以中等上下文运行——速度较慢但能力明显更强。
iPhone 17 Pro (12 GB)
可轻松运行 8B–9B 模型,使用更长的上下文;还可运行 Q8 量化的 Qwen 3.5 9B(11 GB),以获得这一档位的最佳质量。
iPad Pro M4 (16 GB+)
Qwen 3.5 9B 在实际使用中运行流畅;还可以尝试运行规模最高约为 12B 的模型(Gemma 4 12B,多模态,7.6 GB),得益于 M4 GPU,运行速度仍然不错。
→
小而新的模型胜过大而旧的模型
较新的 3B 模型(Granite 4.2 3B、Qwen 3.5 2B/4B、Gemma 4 E2B)往往比更老的 7B 模型回答得更好,同时只占用一半的 RAM。在移动设备上,应优先考虑模型的代际新旧,而不是单纯的规模大小。

在处理法语时,考虑到模型规模,Gemma 4 和 Qwen 3.5 系列模型的表现不错。用于摘要、改写和简短回答时,3B 模型就足够了。如果要进行更深入的推理或处理更复杂的代码任务,移动设备的局限很快就会显现——这时就该切换到家里的电脑。

#完全保密:没有任何内容会从设备中传出

这是在移动设备上本地运行模型的最大优势。模型下载完成后,无需任何网络请求即可聊天。您的提示词、文档和草稿都留在 iPhone 上。没有对话遥测,不会用您的数据进行训练,也没有服务器端数据泄露的风险。

切换至飞行模式进行检查
最简单的测试:切断所有网络连接,确认聊天功能仍可正常运行。如果离线时能正常工作,则无数据传输。
注意混合类应用
一些所谓‘AI’应用在本地模型失败时会悄然切换至云端。建议优先选择100%本地且开源的应用以消除疑虑。
敏感数据
健康记录、受保密协议(NDA)约束的工作文档、个人信息:只有在本地处理,才能确保这些数据始终不会离开您的设备。
i
本地运行并不意味着绝对可靠
模型不会泄露您的数据,但可能会出现错误(幻觉)。对于重要决策,需保持批判性思维——隐私并不等同于可靠性。

#故障排除与技巧

应用在加载模型时崩溃
RAM 不足。请关闭其他所有应用程序,选择更小的模型(例如 3B 而非 7B),或使用更轻量的量化(例如 Q4 而非 Q5/Q8)。
响应非常缓慢
减少上下文长度和生成的token数量。同时检查温度:iPhone过热会导致降频并减慢推理速度。
iPhone 发热,电量消耗很快
推理会让 GPU 满负荷运行。长时间使用时出现这种情况是正常的。请适当暂停,避免连续生成;高强度使用时,请保持设备接通电源。
模型答非所问
很小的模型在处理复杂任务时出现这种情况是正常的。请简化请求,或者在内存允许的情况下换用大一档的模型。
下载卡住
GGUF文件体积较大。请保持连接Wi-Fi,并在下载过程中避免将应用置于后台。

#深入了解

移动设备非常适合外出时使用,也适合注重隐私的场景,但处理繁重任务时,您会希望有一台真正的电脑。本网站的以下指南进一步延伸了本篇指南的内容:

在Android上本地运行LLM
安卓端对应产品:PocketPal、MLC Chat 以及通过 Termux 使用 llama.cpp,具有相同的 RAM 限制。
在 macOS(Apple Silicon)上安装 Ollama
如果从手机转到 Mac:M1/M2/M3/M4 的统一内存能支持大得多的模型,达到 32B 甚至更大的规模。
选择量化方案(Q4、Q5、Q8、FP16)
理解为何Q4_K_M是移动端和PC端推荐的折中方案,以及在什么情况下应升级至Q5或Q8。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。