基于NVIDIA Jetson Orin的LLM:嵌入式人工智能,其模型容量可容纳 main
NVIDIA Jetson Orin 是一款能将真正的 CUDA GPU 装进一副扑克牌大小机箱的开发板。与 Raspberry Pi 不同,Jetson Orin 能通过硬件加速运行 LLM,这为机器人、智能家居和自主传感器等嵌入式 AI 应用带来了根本性变化。本指南涵盖开发板选型(Nano 8 GB 或 AGX 64 GB)、JetPack 安装、Ollama 和 llama.cpp 部署,以及根据您的内存容量选择实际可运行的模型——全程在本地完成。
您正在挑选电脑吗? 按预算推荐 →
本地 AI 的高性价比之选: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).
迷你 PC 是一台完整的机器:请检查可用内存和引擎兼容性。它不能替代 macOS/MLX 或 CUDA。
为什么选择它?我们的完整资料: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →
预算有限: RTX 5060 · 大型模型: RTX 5090 · Mac Studio.
移动场景: 本地 AI 选哪款笔记本电脑 →
联盟链接 — 您无需承担额外费用,我们可能获得佣金。作为 Amazon 合作伙伴,哪个LLM 会从符合条件的购买中获利。
#为何为LLM选择Jetson Orin
Jetson Orin 不是微控制器,而是一个片上系统模块,集成了 ARM Cortex CPU、带有 CUDA 和 Tensor 核心的 NVIDIA GPU,以及两者共享的统一内存。具体来说,GPU 可直接访问系统 RAM,没有独立显存。因此,加载的 LLM 会占用统一内存,与搭载 Apple Silicon 的 Mac 完全一样,计算则受益于 CUDA 加速。
这正是 Jetson Orin 上运行 LLM 与 Raspberry Pi 上运行 AI 的根本区别:Pi 仅靠 CPU 计算时力不从心,而 Orin 将计算交给 GPU,在 3B 到 8B 模型上也能保持实用的吞吐量。整个系统的功耗范围为 7 到 60 瓦,可用电池供电,没有嘈杂的风扇,也不需要桌下的塔式主机。
- 不依赖网络
- 完全不依赖云端:模型在设备上运行,即使是在没有网络连接的移动机器人上或偏远场所也一样。
- 可预测延迟
- 无需经由互联网往返传输。响应仅取决于本地 GPU,这对实时控制回路很重要。
- 隐私
- 传感器、摄像头或麦克风采集的数据永远不会离开设备。在智能家居和医疗环境中尤为重要。
- CUDA 生态系统
- 软件栈与 NVIDIA 桌面 GPU 相同:Ollama、llama.cpp、PyTorch 和 TensorRT 都能运行,只是需要针对 ARM 编译。
#Jetson Orin Nano 或 AGX:如何选择开发板
Orin 系列最高与最低内存容量相差 8 倍,算力差距则更大。对于 LLM,决定性因素是统一内存:它与传统 GPU 的显存一样,限制了模型大小的上限。以下是值得关注的配置档位。
- Orin Nano 8 GB
- 入门型号(约 40 TOPS)。8 GB 统一内存与系统共享。适合运行 Q4 量化的 3B 模型;释放内存后,也可以勉强运行 7B 模型。非常适合智能传感器和嵌入式语音助手。
- Orin NX 8 / 16 GB
- 中端档位(约 70–100 TOPS)。16 GB 版本可轻松运行 Q4_K_M 量化的 7B–8B 模型。对于移动机器人而言,这是一个不错的折中选择。
- AGX Orin 32GB
- 嵌入式工作站(约 200 TOPS)。可运行采用 Q4 量化的 14B 模型,并容纳其上下文,也可并行运行多个小模型(视觉 + 语言)。
- AGX Orin 64 GB
- 高端型号(约 275 TOPS)。适合运行 Q4 量化的 32B 模型(约 19 GB),并为上下文和其他负载留出余量。它是该系列中唯一面向实际使用 32B 模型的型号。
#前置条件与 JetPack 的作用
整个 Jetson 生态系统都基于 NVIDIA 的 JetPack 软件发行版。它包含 Ubuntu(L4T,Linux for Tegra)、CUDA 驱动、cuDNN、TensorRT 和 GPU 库。如果未正确刷入 JetPack,就无法获得加速:计算将完全依赖 CPU,这块开发板也就失去了全部价值。
- 一块 Jetson Orin 开发板
- Nano、NX或AGX系列,搭配相应电源(Nano最大功耗达15W,AGX最大功耗达60W)
- 快速存储
- 测试 Nano 时可使用 microSD(UHS-I)卡,但强烈建议使用 NVMe SSD:模型文件大小有数 GB,使用 SD 卡会拖慢加载速度。
- 一台运行 Linux(Ubuntu)的主机电脑
- 在 AGX/NX 设备上通过 SDK Manager 刷写时必不可少。Nano Developer Kit 可直接从 SD 卡镜像安装。
- JetPack 6.x
- 基于 Ubuntu 22.04、配备 CUDA 12 的较新分支。这是现代 LLM 技术栈的目标平台(针对 ARM SBSA 架构编译的 Ollama 和 llama.cpp)。
#1. 刷入 JetPack 并验证 CUDA
- 01刷写镜像对于 Orin Nano 开发者套件,使用 Balena Etcher 将官方 SD 镜像写入 SD 卡,插入卡后接通电源,并按照 Ubuntu 向导操作。对于 AGX/NX,在主机 PC 上使用 NVIDIA SDK Manager,通过 USB-C 线缆连接,并将开发板置于恢复模式。
- 02更新系统首次启动时,请更新软件包。如果您是从SD镜像安装的,此时也请安装缺失的JetPack组件。
- 03检查 GPU 和 CUDA检查CUDA是否已安装,以及模组是否已被识别。jtop(通过jetson-stats软件包安装)可实时显示GPU、RAM和功耗情况,相当于Jetson平台上的nvidia-smi。
#2. 在JetPack中安装Ollama
Ollama是开始运行第一个模型的最快途径。官方安装脚本会检测ARM64架构和Jetson GPU,并配置systemd服务。启动后,守护进程默认监听http://localhost:11434,与桌面PC上的行为完全一致。
要获得类似 ChatGPT 的界面,请添加一个运行 Open WebUI 的容器,并让它连接同一个端点。在 8 GB 的 Nano 上,要控制服务数量:每个服务都会占用原本已计入模型内存预算的统一内存。
#3. 使用CUDA编译llama.cpp
Ollama 足以满足大多数使用需求,但手动编译 llama.cpp 可以提供精细控制:选择具体的 GGUF 量化方案、调整转移到 GPU 上的模型层数,而且通常每秒还能多生成几个 token。如果您想将引擎集成到自己的嵌入式二进制程序中,这也是一种途径。
#不同内存容量能运行哪些模型
规则与桌面 GPU 相同:采用 Q4_K_M 量化(质量与内存占用之间的最佳折中)时,3B 模型约需 2 GB,7B 模型约需 5 GB,14B 模型约需 9 GB,32B 模型约需 19 GB。在 Jetson 上,需从 RAM 总容量中扣除系统占用的内存,才能得到实际可用的内存预算。
- Orin Nano 8 GB
- 采用 Q4 量化的 Granite 4.2 3B(约 2.2 GB)、Qwen 3.5 4B(约 3.4 GB)或 Gemma 4 E2B(约 4.3 GB)。关闭其他所有程序后,也能运行一个 8B 模型(Granite 4.2 8B,约 5.3 GB),但留给上下文的空间仍然很有限。
- Orin NX 16 GB
- 在8B-9B(Granite 4.2 8B、Qwen 3.5 9B)模型上,使用Q4_K_M量化配合上下文可获得良好体验。24B(Mistral Small 24B,约14 GB)模型在Q4量化下可运行,但留有极小余量。
- AGX Orin 32GB
- 可轻松运行一个 24B 模型(Mistral Small、gpt-oss 20B),或一个 30–35B 的 MoE 模型(Qwen 3.6 35B-A3B,约 23 GB)。还有足够的内存空间来同时运行语言模型和视觉软件栈。
- AGX Orin 64 GB
- 可运行保持完整质量的 30–35B MoE 模型、采用 Q8 量化的 24B 模型,或同时加载多个模型。这是唯一真正面向大模型且留有余量的配置档位。
#功耗与电源模式
Jetson 的最大优势在于每瓦性能。每块板卡都提供多种功耗模式(power modes),通过启用不同数量的 CPU 核心并限制 GPU 频率来限定功耗上限。可以用 nvpmodel 控制这些模式,而 jetson_clocks 会强制将频率设为当前模式允许的最大值。
- 低功耗模式
- 在 Orin Nano 上,7 W 模式会显著限制吞吐量,但允许使用电池或功率不高的 USB-C 电源供电。适合间歇性调用模型的传感器。
- 全功率模式
- MAXN 模式可释放 GPU 的全部性能。在 AGX Orin 上,功耗可能达到 60 W:请做好散热准备(使用主动散热器),并配备功率足够的电源。
- 嵌入式部署的权衡
- 许多项目在15-25W功耗下运行良好:3B-7B模型具备良好吞吐量,散热可控,电池续航合理。
#应用场景:机器人与智能家居
Jetson 在需要大模型贴近物理世界运行、无云端延迟且数据不外泄的场景中表现突出。两大应用场景主导了嵌入式领域。
- 机器人技术(ROS 2)
- 大语言模型(LLM)作为自然语言接口:将口头指令转换为动作序列,描述摄像头感知到的场景,对任务进行推理。Jetson 同时承载视觉感知和语言处理,均运行在同一个 GPU 上。
- 本地智能家居
- 家中的语音助手可以控制 Home Assistant,全程无需经过云端。模型理解自然语言请求并触发自动化操作——麦克风和数据都留在家中。
- 自主智能传感器
- 在偏远场地(农业或工业场地),Orin 在本地分析数据并生成自然语言摘要,仅在有网络连接时才传输这些摘要。
- 离线现场助手
- 部署在车辆或设备中的技术文档,可通过 RAG 查询,无需网络即可使用。
#与Raspberry Pi相比的真实差距
这个问题总会出现:既然 Raspberry Pi 5 也能运行 Ollama,为什么还要花钱买 Jetson?答案只有一个词:GPU。Pi 没有可用于 LLM 推理的加速器,所有计算都由 ARM CPU 完成。而 Jetson 则将计算交给 CUDA 核心。
- 加速
- Pi 5:仅使用CPU,运行3B模型时也只能勉强达到每秒几个token。Jetson Orin:使用支持CUDA的GPU,同一模型的吞吐量高出数倍,7B至14B模型也真正具备实用性。
- 内存
- Pi 5 的 CPU 内存上限为 8/16 GB。Jetson 的统一内存最高可达 64 GB,且可供 GPU 使用,因此能运行 Pi 无法运行的模型。
- 价格
- Pi 的价格只是 Jetson 的一小部分。价格差距确实存在:只有在您需要更高的吞吐量或运行大型模型时,选择 Jetson 才有理由;仅运行一个简单的 1B 机器人则没有必要。
- 生态系统
- Pi 是社区驱动的通用平台;Jetson 则面向嵌入式 AI,配有 CUDA、TensorRT 和 NVIDIA 的机器人技术支持(Isaac)。
#故障排除
- Ollama 仍在 CPU 上运行
- 如果 JetPack/CUDA 未正确安装,或您刷入了不支持 Tegra 的通用 ARM 镜像,GPU 就不会被使用。请检查 nvcc --version 的输出以及 jtop 中的 GPU 活动情况。
- 加载时内存不足
- 扣除系统占用后,模型所需的内存超过了可用的统一内存。请换用小一档的模型(7B → 3B),采用压缩程度更高的 Q4 量化,或关闭其他服务。
- 生成吞吐量骤降
- 过热降频。在 jtop 中检查温度,改善散热,或切换到功耗更低但运行稳定的 nvpmodel 模式。
- 模型加载极慢
- 模型存储在microSD上。将 ~/.ollama(或您的GGUF文件)迁移到NVMe SSD上,可实现秒级加载而非分钟级加载。
- llama.cpp 忽略 GPU
- 缺少 -ngl 选项或未启用CUDA构建。请重新编译并设置 -DGGML_CUDA=ON,然后使用 -ngl 99 启动。
#深入了解
Jetson 与配备 NVIDIA 显卡的 PC 使用相同的软件栈。以下指南可帮助您进一步完善嵌入式配置:
- 在 Raspberry Pi 5 上运行 LLM:嵌入式本地 AI
- 从纯 CPU 运行角度进行的直接比较,有助于根据您的项目和预算在 Pi 与 Jetson 之间做出选择。
- 使用 CUDA 编译 llama.cpp
- 深入了解从源码编译及 GPU 配置,这些设置可移植至 Jetson 的 ARM 架构。
- 选择量化方案(Q4、Q5、Q8、FP16)
- 让内存占用与您的 Orin 板卡的统一内存容量相匹配。
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。