高级 13 分钟Edge

基于NVIDIA Jetson Orin的LLM:嵌入式人工智能,其模型容量可容纳 main

NVIDIA Jetson Orin 是一款能将真正的 CUDA GPU 装进一副扑克牌大小机箱的开发板。与 Raspberry Pi 不同,Jetson Orin 能通过硬件加速运行 LLM,这为机器人、智能家居和自主传感器等嵌入式 AI 应用带来了根本性变化。本指南涵盖开发板选型(Nano 8 GB 或 AGX 64 GB)、JetPack 安装、Ollama 和 llama.cpp 部署,以及根据您的内存容量选择实际可运行的模型——全程在本地完成。

您正在挑选电脑吗? 按预算推荐 →

作者: Samir K.·更新于 2026-08-27·已在 Windows、macOS 和 Linux 上测试
推荐硬件

本地 AI 的高性价比之选: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).

迷你 PC 是一台完整的机器:请检查可用内存和引擎兼容性。它不能替代 macOS/MLX 或 CUDA。

为什么选择它?我们的完整资料: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →

按预算比较所有选项,从 800 到 3 500 欧元 →

预算有限: RTX 5060 · 大型模型: RTX 5090 · Mac Studio.

移动场景: 本地 AI 选哪款笔记本电脑 →

联盟链接 — 您无需承担额外费用,我们可能获得佣金。作为 Amazon 合作伙伴,哪个LLM 会从符合条件的购买中获利。

#为何为LLM选择Jetson Orin

Jetson Orin 不是微控制器,而是一个片上系统模块,集成了 ARM Cortex CPU、带有 CUDA 和 Tensor 核心的 NVIDIA GPU,以及两者共享的统一内存。具体来说,GPU 可直接访问系统 RAM,没有独立显存。因此,加载的 LLM 会占用统一内存,与搭载 Apple Silicon 的 Mac 完全一样,计算则受益于 CUDA 加速。

这正是 Jetson Orin 上运行 LLM 与 Raspberry Pi 上运行 AI 的根本区别:Pi 仅靠 CPU 计算时力不从心,而 Orin 将计算交给 GPU,在 3B 到 8B 模型上也能保持实用的吞吐量。整个系统的功耗范围为 7 到 60 瓦,可用电池供电,没有嘈杂的风扇,也不需要桌下的塔式主机。

不依赖网络
完全不依赖云端:模型在设备上运行,即使是在没有网络连接的移动机器人上或偏远场所也一样。
可预测延迟
无需经由互联网往返传输。响应仅取决于本地 GPU,这对实时控制回路很重要。
隐私
传感器、摄像头或麦克风采集的数据永远不会离开设备。在智能家居和医疗环境中尤为重要。
CUDA 生态系统
软件栈与 NVIDIA 桌面 GPU 相同:Ollama、llama.cpp、PyTorch 和 TensorRT 都能运行,只是需要针对 ARM 编译。

#Jetson Orin Nano 或 AGX:如何选择开发板

Orin 系列最高与最低内存容量相差 8 倍,算力差距则更大。对于 LLM,决定性因素是统一内存:它与传统 GPU 的显存一样,限制了模型大小的上限。以下是值得关注的配置档位。

Orin Nano 8 GB
入门型号(约 40 TOPS)。8 GB 统一内存与系统共享。适合运行 Q4 量化的 3B 模型;释放内存后,也可以勉强运行 7B 模型。非常适合智能传感器和嵌入式语音助手。
Orin NX 8 / 16 GB
中端档位(约 70–100 TOPS)。16 GB 版本可轻松运行 Q4_K_M 量化的 7B–8B 模型。对于移动机器人而言,这是一个不错的折中选择。
AGX Orin 32GB
嵌入式工作站(约 200 TOPS)。可运行采用 Q4 量化的 14B 模型,并容纳其上下文,也可并行运行多个小模型(视觉 + 语言)。
AGX Orin 64 GB
高端型号(约 275 TOPS)。适合运行 Q4 量化的 32B 模型(约 19 GB),并为上下文和其他负载留出余量。它是该系列中唯一面向实际使用 32B 模型的型号。
i
统一内存容量决定您的容量上限
在 Jetson 上,GPU 和 CPU 共享同一块 RAM。大小为 5 GB 的模型会占用相应内存,使留给系统、视觉软件栈或 ROS 的内存更少。始终为系统预留 1.5 至 2 GB:在 8 GB 的 Nano 上,实际可供模型使用的内存约为 6 GB。
→
什么项目该选哪款开发板
家庭自动化原型或语音助手 → Orin Nano 8 GB。具备感知能力的移动机器人 → NX 16 GB。多模型嵌入式计算设备或 32B 模型 → AGX Orin 64 GB。无需过度配置:一个调优良好的 7B 模型即可覆盖绝大多数嵌入式应用场景。

#前置条件与 JetPack 的作用

整个 Jetson 生态系统都基于 NVIDIA 的 JetPack 软件发行版。它包含 Ubuntu(L4T,Linux for Tegra)、CUDA 驱动、cuDNN、TensorRT 和 GPU 库。如果未正确刷入 JetPack,就无法获得加速:计算将完全依赖 CPU,这块开发板也就失去了全部价值。

一块 Jetson Orin 开发板
Nano、NX或AGX系列,搭配相应电源(Nano最大功耗达15W,AGX最大功耗达60W)
快速存储
测试 Nano 时可使用 microSD(UHS-I)卡,但强烈建议使用 NVMe SSD:模型文件大小有数 GB,使用 SD 卡会拖慢加载速度。
一台运行 Linux(Ubuntu)的主机电脑
在 AGX/NX 设备上通过 SDK Manager 刷写时必不可少。Nano Developer Kit 可直接从 SD 卡镜像安装。
JetPack 6.x
基于 Ubuntu 22.04、配备 CUDA 12 的较新分支。这是现代 LLM 技术栈的目标平台(针对 ARM SBSA 架构编译的 Ollama 和 llama.cpp)。
!
请检查 JetPack 兼容性
并非所有开发板都支持相同的 JetPack 版本。旧款 Nano(上一代)只能使用较旧的版本分支。开始之前,请在 NVIDIA Jetson 官方页面上确认您的模块确实支持 JetPack 6——刷写出错会导致设备无法启动。

#1. 刷入 JetPack 并验证 CUDA

  1. 01
    刷写镜像
    对于 Orin Nano 开发者套件,使用 Balena Etcher 将官方 SD 镜像写入 SD 卡,插入卡后接通电源,并按照 Ubuntu 向导操作。对于 AGX/NX,在主机 PC 上使用 NVIDIA SDK Manager,通过 USB-C 线缆连接,并将开发板置于恢复模式。
  2. 02
    更新系统
    首次启动时,请更新软件包。如果您是从SD镜像安装的,此时也请安装缺失的JetPack组件。
  3. 03
    检查 GPU 和 CUDA
    检查CUDA是否已安装,以及模组是否已被识别。jtop(通过jetson-stats软件包安装)可实时显示GPU、RAM和功耗情况,相当于Jetson平台上的nvidia-smi。
检查 CUDA 及 Jetson 状态
# Mettre à jour le système
sudo apt update && sudo apt upgrade -y

# Vérifier la version de CUDA fournie par JetPack
nvcc --version

# Installer jtop (moniteur GPU/RAM/conso pour Jetson)
sudo pip3 install -U jetson-stats
sudo systemctl restart jtop.service

# Lancer le moniteur temps réel
jtop
i
切换到 NVMe SSD
如果您有 NVMe SSD,请将系统迁移到该 SSD(或至少将模型目录 ~/.ollama 迁移过去)。从 microSD 加载一个 7B 模型可能需要一分钟;从 NVMe 加载则只需几秒钟。在机器人上,这会改变开机时的体验。

#2. 在JetPack中安装Ollama

Ollama是开始运行第一个模型的最快途径。官方安装脚本会检测ARM64架构和Jetson GPU,并配置systemd服务。启动后,守护进程默认监听http://localhost:11434,与桌面PC上的行为完全一致。

在Jetson上安装并启动 Ollama
# Script d'installation officiel (détecte ARM64 + GPU Jetson)
curl -fsSL https://ollama.com/install.sh | sh

# Le service démarre automatiquement (systemd)
systemctl status ollama

# Tirer et lancer un modèle 3B adapté au Nano
ollama run granite4.2:3b

# Vérifier que le GPU est bien utilisé (pas CPU)
ollama ps
→
确认GPU加速
运行 ollama run 后,在另一个终端中打开 jtop:生成过程中,GPU 使用率条应上升。如果 GPU 使用率始终为 0%,而 CPU 使用率飙升,说明 GPU 加速未启用。请确认 JetPack 和 CUDA 已正确安装,并确认您没有使用缺少 Tegra 支持的通用 ARM 镜像。

要获得类似 ChatGPT 的界面,请添加一个运行 Open WebUI 的容器,并让它连接同一个端点。在 8 GB 的 Nano 上,要控制服务数量:每个服务都会占用原本已计入模型内存预算的统一内存。

#3. 使用CUDA编译llama.cpp

Ollama 足以满足大多数使用需求,但手动编译 llama.cpp 可以提供精细控制:选择具体的 GGUF 量化方案、调整转移到 GPU 上的模型层数,而且通常每秒还能多生成几个 token。如果您想将引擎集成到自己的嵌入式二进制程序中,这也是一种途径。

在 Jetson 上编译支持 CUDA 的 llama.cpp
# Dépendances de build
sudo apt install -y build-essential cmake git libcurl4-openssl-dev

# Récupérer les sources
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp

# Compiler avec CUDA activé (GGML_CUDA=ON)
cmake -B build -DGGML_CUDA=ON
cmake --build build --config Release -j$(nproc)

# Lancer l'inférence en déchargeant les couches sur le GPU (-ngl 99)
./build/bin/llama-cli -m modele-q4_k_m.gguf -ngl 99 -p "Bonjour"
!
选项 -ngl 非常关键
不使用 -ngl(GPU上的层数),llama.cpp 将运行在CPU上,无法发挥Jetson的优势。若模型能装入统一内存,设置 -ngl 99 可将整个模型加载到GPU上。若模型过大,需降低该数值以启用CPU/GPU混合模式。

#不同内存容量能运行哪些模型

规则与桌面 GPU 相同:采用 Q4_K_M 量化(质量与内存占用之间的最佳折中)时,3B 模型约需 2 GB,7B 模型约需 5 GB,14B 模型约需 9 GB,32B 模型约需 19 GB。在 Jetson 上,需从 RAM 总容量中扣除系统占用的内存,才能得到实际可用的内存预算。

Orin Nano 8 GB
采用 Q4 量化的 Granite 4.2 3B(约 2.2 GB)、Qwen 3.5 4B(约 3.4 GB)或 Gemma 4 E2B(约 4.3 GB)。关闭其他所有程序后,也能运行一个 8B 模型(Granite 4.2 8B,约 5.3 GB),但留给上下文的空间仍然很有限。
Orin NX 16 GB
在8B-9B(Granite 4.2 8B、Qwen 3.5 9B)模型上,使用Q4_K_M量化配合上下文可获得良好体验。24B(Mistral Small 24B,约14 GB)模型在Q4量化下可运行,但留有极小余量。
AGX Orin 32GB
可轻松运行一个 24B 模型(Mistral Small、gpt-oss 20B),或一个 30–35B 的 MoE 模型(Qwen 3.6 35B-A3B,约 23 GB)。还有足够的内存空间来同时运行语言模型和视觉软件栈。
AGX Orin 64 GB
可运行保持完整质量的 30–35B MoE 模型、采用 Q8 量化的 24B 模型,或同时加载多个模型。这是唯一真正面向大模型且留有余量的配置档位。
→
优先选择近期发布的轻量级模型
在嵌入式设备上,较新的 3B–4B 模型(Granite 4.2 3B、Qwen 3.5 4B、Gemma 4 E2B)往往胜过上一代的 7B 模型,而内存占用和功耗仅为其一半。对于特定的机器人或智能家居用途,只要提示词设计得当,小模型就完全够用——无需追求会耗尽您散热余量的大模型。

#功耗与电源模式

Jetson 的最大优势在于每瓦性能。每块板卡都提供多种功耗模式(power modes),通过启用不同数量的 CPU 核心并限制 GPU 频率来限定功耗上限。可以用 nvpmodel 控制这些模式,而 jetson_clocks 会强制将频率设为当前模式允许的最大值。

管理能耗模式
# Lister les modes d'alimentation disponibles
sudo nvpmodel -q

# Basculer sur le mode le plus performant (index variable selon la carte)
sudo nvpmodel -m 0

# Verrouiller les fréquences au max du mode courant
sudo jetson_clocks

# Suivre conso, GPU et température en direct
jtop
低功耗模式
在 Orin Nano 上,7 W 模式会显著限制吞吐量,但允许使用电池或功率不高的 USB-C 电源供电。适合间歇性调用模型的传感器。
全功率模式
MAXN 模式可释放 GPU 的全部性能。在 AGX Orin 上,功耗可能达到 60 W:请做好散热准备(使用主动散热器),并配备功率足够的电源。
嵌入式部署的权衡
许多项目在15-25W功耗下运行良好:3B-7B模型具备良好吞吐量,散热可控,电池续航合理。
!
散热 = 实际吞吐量
Jetson 过热时会降频:每秒生成的 token 数会悄然下降。在机器人的封闭机箱中,MAXN 模式下仅靠被动散热是不够的。请在 jtop 中监控温度;如果要让这块板卡高负载运行,请准备风扇或尺寸充足的散热器。

#应用场景:机器人与智能家居

Jetson 在需要大模型贴近物理世界运行、无云端延迟且数据不外泄的场景中表现突出。两大应用场景主导了嵌入式领域。

机器人技术(ROS 2)
大语言模型(LLM)作为自然语言接口:将口头指令转换为动作序列,描述摄像头感知到的场景,对任务进行推理。Jetson 同时承载视觉感知和语言处理,均运行在同一个 GPU 上。
本地智能家居
家中的语音助手可以控制 Home Assistant,全程无需经过云端。模型理解自然语言请求并触发自动化操作——麦克风和数据都留在家中。
自主智能传感器
在偏远场地(农业或工业场地),Orin 在本地分析数据并生成自然语言摘要,仅在有网络连接时才传输这些摘要。
离线现场助手
部署在车辆或设备中的技术文档,可通过 RAG 查询,无需网络即可使用。
i
感知与语言的组合
Jetson 在机器人领域的真正价值在于,能够在同一块 GPU 上同时运行视觉模型(通过 TensorRT 进行检测、分割)和一个大语言模型(LLM)。务必谨慎规划内存预算:在 16 GB 的 NX 上,一个 Q4 量化的 8B 模型(约 5.3 GB)仍能留出加载视觉处理软件栈的空间,但容不下第二个大型模型。

#与Raspberry Pi相比的真实差距

这个问题总会出现:既然 Raspberry Pi 5 也能运行 Ollama,为什么还要花钱买 Jetson?答案只有一个词:GPU。Pi 没有可用于 LLM 推理的加速器,所有计算都由 ARM CPU 完成。而 Jetson 则将计算交给 CUDA 核心。

加速
Pi 5:仅使用CPU,运行3B模型时也只能勉强达到每秒几个token。Jetson Orin:使用支持CUDA的GPU,同一模型的吞吐量高出数倍,7B至14B模型也真正具备实用性。
内存
Pi 5 的 CPU 内存上限为 8/16 GB。Jetson 的统一内存最高可达 64 GB,且可供 GPU 使用,因此能运行 Pi 无法运行的模型。
价格
Pi 的价格只是 Jetson 的一小部分。价格差距确实存在:只有在您需要更高的吞吐量或运行大型模型时,选择 Jetson 才有理由;仅运行一个简单的 1B 机器人则没有必要。
生态系统
Pi 是社区驱动的通用平台;Jetson 则面向嵌入式 AI,配有 CUDA、TensorRT 和 NVIDIA 的机器人技术支持(Isaac)。
→
选择哪一个
偶尔使用的文本机器人、预算紧张、1B–3B 模型已足够 → Raspberry Pi 5。持续吞吐、视觉 + 语言、7B 及以上模型、实时循环 → Jetson Orin。只有真正利用 Jetson 的 GPU,其额外成本才有意义。

#故障排除

Ollama 仍在 CPU 上运行
如果 JetPack/CUDA 未正确安装,或您刷入了不支持 Tegra 的通用 ARM 镜像,GPU 就不会被使用。请检查 nvcc --version 的输出以及 jtop 中的 GPU 活动情况。
加载时内存不足
扣除系统占用后,模型所需的内存超过了可用的统一内存。请换用小一档的模型(7B → 3B),采用压缩程度更高的 Q4 量化,或关闭其他服务。
生成吞吐量骤降
过热降频。在 jtop 中检查温度,改善散热,或切换到功耗更低但运行稳定的 nvpmodel 模式。
模型加载极慢
模型存储在microSD上。将 ~/.ollama(或您的GGUF文件)迁移到NVMe SSD上,可实现秒级加载而非分钟级加载。
llama.cpp 忽略 GPU
缺少 -ngl 选项或未启用CUDA构建。请重新编译并设置 -DGGML_CUDA=ON,然后使用 -ngl 99 启动。
Jetson快速诊断
# Le GPU est-il vu et actif ?
jtop

# CUDA est-il bien présent ?
nvcc --version

# Ollama utilise-t-il le GPU pour le modèle chargé ?
ollama ps

# Mode d'alimentation courant
sudo nvpmodel -q

#深入了解

Jetson 与配备 NVIDIA 显卡的 PC 使用相同的软件栈。以下指南可帮助您进一步完善嵌入式配置:

在 Raspberry Pi 5 上运行 LLM:嵌入式本地 AI
从纯 CPU 运行角度进行的直接比较,有助于根据您的项目和预算在 Pi 与 Jetson 之间做出选择。
使用 CUDA 编译 llama.cpp
深入了解从源码编译及 GPU 配置,这些设置可移植至 Jetson 的 ARM 架构。
选择量化方案(Q4、Q5、Q8、FP16)
让内存占用与您的 Orin 板卡的统一内存容量相匹配。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。