在 iPhone 和 iPad 上本地运行 LLM:可运行的应用和模型 vraiment
在 iPhone 上运行本地 LLM 是可行的,而且确实能用:Apple Silicon 芯片(A 系列和 M 系列)与 MLX 框架支持直接在设备上离线运行参数量为 10 亿至 80 亿的模型。本指南会筛选出兑现承诺的应用,解释不同 iPhone 或 iPad 上的 RAM 容量究竟会带来什么影响,并给出真实的性能参考——不掺杂营销话术。
#为何在iPhone上运行本地LLM
iOS 上的本地大语言模型会在您的设备上完成所有计算:无需服务器,无需订阅,也不会有任何数据离开手机。这与 ChatGPT 这类应用正好相反,后者会将每条消息发送到云端。选择这种方式的理由很具体:完全保护隐私(医疗笔记、草稿、代码)、在飞机上或没有网络时也能运行,以及模型下载完成后没有任何持续费用。
这种取舍确实有代价:iPhone 的内存容量和算力都无法与配备 RTX 4070 的 PC 相比。您无法在口袋里的设备上运行一个 70B 模型。不过,经过适当量化的 3B 模型,已足以胜任文本摘要、邮件改写、简单问答或翻译——这些功能都可离线使用,并且随时可以立即调用。
#Apple Silicon、MLX 和 Neural Engine
只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。
- 在线空间,终身可用
- PDF + 文件
- 30 天内退款
现代iPhone和iPad采用与Mac相同的 Apple Silicon架构:包含系统芯片(iPhone为A系列,iPad Pro为M系列)以及关键的统一内存,该内存同时服务于CPU、GPU和神经引擎。正是这一共享的RAM池使得在移动设备上实现LLM推理成为可能——模型仅加载一次,即可被所有核心共享访问,无需复制。
MLX 是 Apple 的机器学习框架,专为这种统一内存设计。认真打造的 iOS 应用会使用它(或启用了 Metal 支持的 llama.cpp)来利用芯片的 GPU。推理计算的大部分工作就在这里完成:由通过 Metal 调用的 GPU 承担,而不是仅靠 CPU。
- 统一内存
- CPU、GPU 和 ANE 共享同一 RAM。这是限制您可加载模型大小的第一因素。
- GPU Metal
- 通过 MLX 或 llama.cpp 进行推理,这决定了你的每秒令牌数。
- 神经引擎(ANE)
- 性能强大但应用领域较窄。截至目前,尚未被广泛用于 LLM 文本生成。
#各设备的前提条件与 RAM 需求
在 iOS 上,RAM 容量是唯一真正重要的数值,但 Apple 并不突出强调它。然而,正是它决定了模型能否加载,还是会导致应用崩溃。以下是较新设备的参考信息。
- iPhone 15 / 15 Plus
- 6 GB 内存。运行 Q4 量化的 1B–3B 模型比较宽裕。3B 模型可以运行,7B 模型则已接近极限,留给系统的内存余量很少。
- iPhone 15 Pro / 16 / 16 Pro
- 8 GB。移动端的理想配置:3B 模型运行流畅,7B–8B 模型在 Q4 量化、上下文长度适中的情况下也能运行。
- iPhone 17 Pro
- 12 GB(近期的 Pro 系列)。有充足的余量,可流畅运行 7B–8B 模型并使用更长的上下文。
- iPad Pro M4
- 视配置而定,内存为 16 GB 或更多。是运行 iOS 本地模型的最佳设备:8B 模型运行流畅,更大的模型也可以考虑。
量化为 Q4 的模型内存占用与桌面环境基本一致:3B 模型约 2 GB,7B 约 5 GB,8B 略多。此外还需考虑上下文内存(KV cache),其大小随对话长度增加而增长,因此长上下文可能导致原本能正常启动的应用崩溃。
#在 iOS 上表现稳定的 App
App Store 中有大量“AI”应用,它们其实只是云端服务的前端。要实现真正的本地运行,需要使用会将模型下载到设备上,并通过 MLX 或 llama.cpp 运行模型的应用。以下是可靠的选择。
- PocketPal AI
- 免费且开源。从Hugging Face下载GGUF格式模型,并通过llama.cpp运行。提供简洁的聊天界面,支持上下文和温度参数设置。推荐的入门方案
- LLM Farm
- 开源,高度可配置。支持多种格式,可精细调节推理过程。操作更偏技术性,非常适合测试不同模型。
- Enclave / 基于 MLX 的应用
- 基于 Apple 的 MLX 框架的应用。在较新的 Apple Silicon 芯片上性能良好,通常注重隐私保护。
- Private LLM
- 付费应用,提供经过优化的量化模型和开箱即用的体验。无需配置,一切都已打包。
#安装并启动模型:分步指南
下面的示例使用免费的 PocketPal AI,其操作流程具有代表性。其他应用的操作逻辑也相同。
- 01安装应用请从 App Store 下载 PocketPal AI。无需账户,不连接任何服务器。
- 02选择一个模型打开内置模型库。应用提供适合移动端的模型(Qwen 3.5 2B、Granite 4.2 3B、Gemma 4 E2B、Qwen 3.5 4B)。先从小模型开始:选择 2B 或 3B 的 Q4 量化版本。
- 03下载开始下载(文件大小从几百 MB 到约 2 GB 不等)。请通过 Wi-Fi 下载。文件会保留在设备本地。
- 04加载模型选择已下载的模型以加载到内存中。如果此时应用程序关闭,说明是内存不足:请选择更小的模型或关闭其他应用程序。
- 05离线聊天打开聊天窗口并提出一个问题。开启飞行模式进行验证:一切仍能正常运行,这证明没有任何数据离开设备。
对于想尝试最底层方式的好奇用户,也可以自行编译 llama.cpp,但 iOS 不允许在已签名应用之外执行任意代码:实际上,对绝大多数用户而言,使用专用应用是唯一现实的途径。
#根据RAM选择合适的模型
合适的模型首先取决于您的设备。以下是从入门到进阶的实用推荐,所有模型均采用 Q4 量化。
- iPhone 15 / 15 Plus(6 GB)
- 追求流畅性可选Qwen 3.5 2B(1.9 GB)或Granite 4.2 3B(2.2 GB);追求更高的回答质量可选Qwen 3.5 4B(3.4 GB)。请保持较短的上下文长度。
- iPhone 16 / 16 Pro (8 GB)
- 日常流畅使用3B至4B模型。8B至9B模型(Granite 4.2 8B 占5.3 GB,Qwen 3.5 9B 占6.6 GB,256k上下文和视觉功能)在Q4量化下以中等上下文运行——速度较慢但能力明显更强。
- iPhone 17 Pro (12 GB)
- 可轻松运行 8B–9B 模型,使用更长的上下文;还可运行 Q8 量化的 Qwen 3.5 9B(11 GB),以获得这一档位的最佳质量。
- iPad Pro M4 (16 GB+)
- Qwen 3.5 9B 在实际使用中运行流畅;还可以尝试运行规模最高约为 12B 的模型(Gemma 4 12B,多模态,7.6 GB),得益于 M4 GPU,运行速度仍然不错。
在处理法语时,考虑到模型规模,Gemma 4 和 Qwen 3.5 系列模型的表现不错。用于摘要、改写和简短回答时,3B 模型就足够了。如果要进行更深入的推理或处理更复杂的代码任务,移动设备的局限很快就会显现——这时就该切换到家里的电脑。
#完全保密:没有任何内容会从设备中传出
这是在移动设备上本地运行模型的最大优势。模型下载完成后,无需任何网络请求即可聊天。您的提示词、文档和草稿都留在 iPhone 上。没有对话遥测,不会用您的数据进行训练,也没有服务器端数据泄露的风险。
- 切换至飞行模式进行检查
- 最简单的测试:切断所有网络连接,确认聊天功能仍可正常运行。如果离线时能正常工作,则无数据传输。
- 注意混合类应用
- 一些所谓‘AI’应用在本地模型失败时会悄然切换至云端。建议优先选择100%本地且开源的应用以消除疑虑。
- 敏感数据
- 健康记录、受保密协议(NDA)约束的工作文档、个人信息:只有在本地处理,才能确保这些数据始终不会离开您的设备。
#故障排除与技巧
- 应用在加载模型时崩溃
- RAM 不足。请关闭其他所有应用程序,选择更小的模型(例如 3B 而非 7B),或使用更轻量的量化(例如 Q4 而非 Q5/Q8)。
- 响应非常缓慢
- 减少上下文长度和生成的token数量。同时检查温度:iPhone过热会导致降频并减慢推理速度。
- iPhone 发热,电量消耗很快
- 推理会让 GPU 满负荷运行。长时间使用时出现这种情况是正常的。请适当暂停,避免连续生成;高强度使用时,请保持设备接通电源。
- 模型答非所问
- 很小的模型在处理复杂任务时出现这种情况是正常的。请简化请求,或者在内存允许的情况下换用大一档的模型。
- 下载卡住
- GGUF文件体积较大。请保持连接Wi-Fi,并在下载过程中避免将应用置于后台。
#深入了解
移动设备非常适合外出时使用,也适合注重隐私的场景,但处理繁重任务时,您会希望有一台真正的电脑。本网站的以下指南进一步延伸了本篇指南的内容:
- 在Android上本地运行LLM
- 安卓端对应产品:PocketPal、MLC Chat 以及通过 Termux 使用 llama.cpp,具有相同的 RAM 限制。
- 在 macOS(Apple Silicon)上安装 Ollama
- 如果从手机转到 Mac:M1/M2/M3/M4 的统一内存能支持大得多的模型,达到 32B 甚至更大的规模。
- 选择量化方案(Q4、Q5、Q8、FP16)
- 理解为何Q4_K_M是移动端和PC端推荐的折中方案,以及在什么情况下应升级至Q5或Q8。
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。