进阶 10 分钟NVIDIA

本地运行 Nemotron 3:NVIDIA 模型搭配 Ollama

NVIDIA 不仅制造 GPU,也对自己的 LLM——Nemotron 系列——进行后训练。本指南介绍如何使用 Ollama 在本地安装 Nemotron 3,如何根据您的显存选择变体(Nano、Super),NVIDIA 在哪些方面采用了不同于其他厂商的优化方式——可控推理和智能体应用——以及与同等级的 Qwen3 模型相比,这些模型在什么情况下值得使用。

作者: Clara M.·更新于 2026-07-28·已在 Windows、macOS 和 Linux 上测试

#为何选择 Nemotron 而非其他模型

Nemotron 并不是从零开始训练的模型。NVIDIA 以成熟的开放权重模型为基础(具体版本采用 Llama 或 Qwen),再应用自己的后训练方案:通过剪枝(pruning)缩小模型规模,通过蒸馏恢复损失的质量,并针对推理、数学、代码和工具调用进行大规模微调。最终目标很明确:为智能体任务实现最佳的质量与计算成本之比,而非面向通用对话。

另一个特点是,NVIDIA 针对自己的硬件和推理流程优化这些模型。实际效果是,它们在 NVIDIA GPU 上具有出色的吞吐量,而且整个模型系列被设计为一套协调的产品线:面向消费级显卡的小型版本、面向工作站的中型版本,以及面向服务器的超大型版本。您可以根据可用显存选择,无需改变提示词的设计逻辑。

i
Nemotron 是 Llama/Qwen 的改进版
如果您已经熟悉在本地使用 Llama 或 Qwen,Nemotron 的使用方式也会让您感到熟悉:相同的聊天格式,相同的 GGUF 量化版本。区别在于 NVIDIA 的后训练,而非某种特殊的架构。

#Nano、Super 和 Ultra:该选哪个版本

本地 AI 套件

只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。

  • 在线空间,终身可用
  • PDF + 文件
  • 终身更新

Nemotron 3 系列有三种规模,每种面向一类机器。名称更多体现的是目标设备,而不是确切的参数数量。

Nano(约80–90亿参数)
面向消费级显卡的版本。采用 Q4 量化时,可轻松装入 RTX 3060 12 GB 或任何显存至少为 8 GB 的 GPU。它是试用 Nemotron 和运行轻量级智能体的理想入门选择。
Super(约 49B)
面向工作站和高性能 GPU 的版本。借助 NVIDIA 的剪枝技术,目标是以更低的计算成本达到 70B 模型的质量。需要一张 RTX 4090 24 GB 显卡(采用 Q4 量化时空间较紧),更理想的是显存为 32–48 GB 的显卡。
Ultra (~253B)
服务器版本超出普通个人电脑的配置范围。适用于多GPU工作站或数据中心。此处提及仅为说明产品线范围,不适用于本地日常使用。

对于本地部署,实际选择在于Nano和Super之间。若您拥有8-16GB显存或更看重运行速度,选择Nano;若您拥有24GB及以上显存,并且追求复杂推理或代码任务的最高质量,则选择Super。

#各变体的前置条件及VRAM需求

与所有本地运行的模型一样,显存是限制因素。以下给出采用 Q4_K_M 量化时的参考值;这是默认推荐的量化方式,因为它在质量与内存占用之间提供了最佳折中。始终要为上下文窗口预留余量,因为除了模型权重之外,它也会占用内存。

Nemotron Nano(约 9B)— Q4
约需 6-7 GB 显存。在 RTX 3060 12 GB、RTX 4070 12 GB,或配备至少 16 GB 统一内存的 Apple Silicon Mac 上,都能从容运行。
Nemotron Super(~49B)— Q4
约 28–30 GB。不将部分模型卸载到系统内存,就无法装入单张 24 GB 显存的 RTX 4090:请准备一张显存至少为 32 GB 的显卡、两张 GPU,或一台配备 48 GB 统一内存的 Mac M4 Pro/Max。
Nemotron Super — Q5/Q8
Q5_K_M 的占用升至约 35 GB,Q8_0 则超过 50 GB。仅适用于大显存或多 GPU 配置。
为上下文预留的内存
根据目标上下文长度,增加 1 到 4 GB。长上下文推理会产生大量中间 token,从而显著增加内存占用。
→
检查哪些模型确实装得下
执行「ollama run」后,在另一个终端运行「ollama ps」。如果模型全部加载在显存中,PROCESSOR 列会显示「100% GPU」;如果 Ollama 因显存不足而将部分模型加载到系统内存,则会显示「GPU/CPU」分担运行,此时速度会大幅下降。这表明您需要选择小一档的模型,或降低一档量化精度。

软件方面,前提条件很简单:安装 Ollama 守护进程,它默认监听 http://localhost:11434。如果使用 NVIDIA GPU,请确保 CUDA 驱动程序已更新;Ollama 会自动检测 GPU。在此基础上使用 Open WebUI 或 LM Studio 等界面会更方便,但并非必需。

#通过 Ollama 安装 Nemotron

安装流程完全遵循 Ollama 的标准流程。若服务进程已运行,仅需一条命令即可下载并启动模型。

  1. 01
    检查 Ollama 是否正在运行
    打开终端并运行「ollama --version」。如果命令有响应,说明守护进程已准备就绪。否则,请先安装Ollama(详见文章末尾的安装指南)
  2. 02
    下载Nano版本
    为避免测试时出现显存方面的问题,请从Nano开始。该命令会先下载模型权重,然后直接在终端中开启聊天会话。
  3. 03
    GPU 能胜任时,切换到 Super
    熟悉操作后,如果您有足够的显存,就下载 Super 版本,以提高推理和代码质量。
  4. 04
    列出和管理模型
    “ollama list”显示已安装的模型及其磁盘大小。“ollama rm <模型名>”可释放不再使用的模型变体所占用的空间。
终端 — 安装 Nemotron
# Vérifier qu'Ollama répond
ollama --version

# Variante Nano (~9B) — cartes grand public
ollama run nemotron-nano

# Variante Super (~49B) — grosse VRAM / multi-GPU
ollama run nemotron-super

# Voir ce qui est installé et vérifier le placement GPU
ollama list
ollama ps
!
标签会更新
Ollama 模型库会定期更新 Nemotron 模型的名称和版本。执行命令前,请在 ollama.com/library 上核对准确的标签——根据已发布的模型代际,模型名称及版本号可能与上述示例不同。

要从您自己的脚本调用 Nemotron,可使用同一端口上的 Ollama REST API。“model”字段应填写您下载模型时使用的确切标签。

终端 — 调用 API
curl http://localhost:11434/api/generate -d '{
  "model": "nemotron-nano",
  "prompt": "Explique la différence entre RAG et fine-tuning en trois phrases.",
  "stream": false
}'

#可控推理模式

Nemotron 模型的标志性特点是可以按需开启或关闭推理。NVIDIA 训练了这些模型,使其在系统提示词提出要求时生成详细的思维链,否则直接回答。具体而言,只需一条系统指令即可在两种模式之间切换:“detailed thinking on” 强制逐步推理,“detailed thinking off” 则让模型给出简洁快速的回答。

这个开关很有用,因为推理有成本。思维链会生成大量中间 token:对于数学问题、逻辑问题或棘手的调试工作,这很有价值;但如果只是改写一封邮件,就是浪费。使用 Nemotron,您可以针对每条提示词决定是否承担这笔额外成本。

终端 — 启用推理
# Dans une session ollama run, définir le system prompt :
/set system detailed thinking on

# Puis poser une question de raisonnement
Un train part de A à 60 km/h, un autre de B à 90 km/h... résous étape par étape.
→
关闭推理以加快速度
对于简单文本、改写或分类任务,请设置「detailed thinking off」。这些任务不需要输出思考过程,因此可以降低延迟、减少 token 消耗,同时不损失质量。

这种运行方式使 Nemotron 类似于处于“thinking”模式的 DeepSeek R1 或 Qwen3 等模型,但控制方式更明确:推理不是模型的全局模式,而是您可以在对话过程中控制的一项设置。

#代码、智能体和工具调用

NVIDIA 主要针对推理和智能体任务这两种用途优化 Nemotron。在代码生成、解释和纠错方面,Super 系列变体可与优秀的 32–70B 模型相抗衡。Nano 用于偶尔的辅助仍有不错的表现,但在较长的任务或大规模重构中会显现出局限——对于这种规模的模型,这是可以预料的。

真正的区别在于函数调用。Nemotron 经过训练,能够生成可靠且格式正确的工具调用,因此是构建本地智能体的不错选择:模型决定调用某个函数,读取结果,再继续执行。结合推理模式,这样的智能体能够先规划再行动,而不是贸然执行。

推理 / 数学
这是一个明显的优势,尤其是 Super 开启“detailed thinking on”时。思维链能减少计算和逻辑错误。
代码
Super 在代码生成和调试方面可与 70B 模型媲美;Nano 适合轻量辅助和自动补全。
智能体与工具
工具调用可靠,严格遵循 JSON 格式——用于本地自动化是该系列最擅长的用途之一。
法语 / 通用对话
表现尚可,但并非同类最佳。Nemotron 擅长推理和执行操作,对多语言闲聊则没那么擅长。

#与Qwen3对比:在何种情况下应选择Nemotron?

Qwen3是值得拿来比较的开放权重标杆,因为这两个模型家族面向相同领域:推理、编程、多种规模和思考模式。在许多通用任务和法语表现方面,Qwen3在同等规模下仍然领先——它用途更广,多语言训练也更充分。

当您的用途更偏向智能体应用和 NVIDIA 生态系统集成时,Nemotron 重新占据优势。如果您正在构建需要大量工具调用的智能体,希望针对每条提示词明确控制推理,或运营一批 NVIDIA GPU,且重视推理吞吐量,那么 Nemotron 值得测试。相反,对于通用的法语对话助手,Qwen3 是更稳妥的默认选择。

适合选择 Nemotron 的情况
需要高强度工具调用的代理、需要精细切换推理开/关的场景、100% 使用 NVIDIA 基础设施,或在纯推理任务中寻求最佳质量/计算比的用户。
适合选择 Qwen3 的情况
需要通用助手,优先考虑法语和多语言能力、对话用途的多样性,或者只是想选择最经过实践检验、适合广泛用途的模型。
实用结论
使用您自己的实际提示词,在规模相近的情况下测试两者(Nano 对比 Qwen3-8B,Super 对比 Qwen3-32B)。性能差异在很大程度上取决于具体任务,而非抽象的排名。

#故障排除

执行 pull 时出现“model not found”
不存在这个名称的标签。请在 ollama.com/library 上核对准确拼写——Nemotron 的名称会随代际更替而变化。
Super 模型速度骤降
由于显存不足,模型的一部分被放入系统内存。命令「ollama ps」会显示模型在 GPU 和 CPU 之间的分配情况。请改用 Nano、采用更低精度的量化(Q4),或增加 GPU 资源。
推理功能未启用
系统提示未被采用。在交互会话中,请使用「/set system detailed thinking on」;在API中,请将指令放入system字段,而非用户提示字段。
回答过于冗长
推理模式默认开启,或沿用了已有设置。处理简单任务时,请切换至“detailed thinking off”。
« Connection refused »
Ollama 守护进程尚未启动。请使用「ollama ps」检查,并确认服务确实在 http://localhost:11434 上监听。

#深入了解

Nemotron 依托的基础组件,本站已有介绍。以下指南是本指南的延伸:

本地运行 Qwen 3:完整测试与实测基准测试
这份必读对比有助于了解 Nemotron 与其主要开放权重替代方案相比的表现,并提供每秒 token 数的数据。
选择量化方案(Q4、Q5、Q8、FP16)
帮助您在使用 Nemotron Super 时权衡质量与显存需求,因为每调整一级量化,显卡能够容纳的模型就会不同。
在 Linux 上安装 Ollama
如果守护进程尚未配置好,这是需要先完成的步骤:安装脚本、systemd 服务以及 NVIDIA GPU 配置。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。