本地运行 Nemotron 3:NVIDIA 模型搭配 Ollama
NVIDIA 不仅制造 GPU,也对自己的 LLM——Nemotron 系列——进行后训练。本指南介绍如何使用 Ollama 在本地安装 Nemotron 3,如何根据您的显存选择变体(Nano、Super),NVIDIA 在哪些方面采用了不同于其他厂商的优化方式——可控推理和智能体应用——以及与同等级的 Qwen3 模型相比,这些模型在什么情况下值得使用。
#为何选择 Nemotron 而非其他模型
Nemotron 并不是从零开始训练的模型。NVIDIA 以成熟的开放权重模型为基础(具体版本采用 Llama 或 Qwen),再应用自己的后训练方案:通过剪枝(pruning)缩小模型规模,通过蒸馏恢复损失的质量,并针对推理、数学、代码和工具调用进行大规模微调。最终目标很明确:为智能体任务实现最佳的质量与计算成本之比,而非面向通用对话。
另一个特点是,NVIDIA 针对自己的硬件和推理流程优化这些模型。实际效果是,它们在 NVIDIA GPU 上具有出色的吞吐量,而且整个模型系列被设计为一套协调的产品线:面向消费级显卡的小型版本、面向工作站的中型版本,以及面向服务器的超大型版本。您可以根据可用显存选择,无需改变提示词的设计逻辑。
#Nano、Super 和 Ultra:该选哪个版本
只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。
- 在线空间,终身可用
- PDF + 文件
- 终身更新
Nemotron 3 系列有三种规模,每种面向一类机器。名称更多体现的是目标设备,而不是确切的参数数量。
- Nano(约80–90亿参数)
- 面向消费级显卡的版本。采用 Q4 量化时,可轻松装入 RTX 3060 12 GB 或任何显存至少为 8 GB 的 GPU。它是试用 Nemotron 和运行轻量级智能体的理想入门选择。
- Super(约 49B)
- 面向工作站和高性能 GPU 的版本。借助 NVIDIA 的剪枝技术,目标是以更低的计算成本达到 70B 模型的质量。需要一张 RTX 4090 24 GB 显卡(采用 Q4 量化时空间较紧),更理想的是显存为 32–48 GB 的显卡。
- Ultra (~253B)
- 服务器版本超出普通个人电脑的配置范围。适用于多GPU工作站或数据中心。此处提及仅为说明产品线范围,不适用于本地日常使用。
对于本地部署,实际选择在于Nano和Super之间。若您拥有8-16GB显存或更看重运行速度,选择Nano;若您拥有24GB及以上显存,并且追求复杂推理或代码任务的最高质量,则选择Super。
#各变体的前置条件及VRAM需求
与所有本地运行的模型一样,显存是限制因素。以下给出采用 Q4_K_M 量化时的参考值;这是默认推荐的量化方式,因为它在质量与内存占用之间提供了最佳折中。始终要为上下文窗口预留余量,因为除了模型权重之外,它也会占用内存。
- Nemotron Nano(约 9B)— Q4
- 约需 6-7 GB 显存。在 RTX 3060 12 GB、RTX 4070 12 GB,或配备至少 16 GB 统一内存的 Apple Silicon Mac 上,都能从容运行。
- Nemotron Super(~49B)— Q4
- 约 28–30 GB。不将部分模型卸载到系统内存,就无法装入单张 24 GB 显存的 RTX 4090:请准备一张显存至少为 32 GB 的显卡、两张 GPU,或一台配备 48 GB 统一内存的 Mac M4 Pro/Max。
- Nemotron Super — Q5/Q8
- Q5_K_M 的占用升至约 35 GB,Q8_0 则超过 50 GB。仅适用于大显存或多 GPU 配置。
- 为上下文预留的内存
- 根据目标上下文长度,增加 1 到 4 GB。长上下文推理会产生大量中间 token,从而显著增加内存占用。
软件方面,前提条件很简单:安装 Ollama 守护进程,它默认监听 http://localhost:11434。如果使用 NVIDIA GPU,请确保 CUDA 驱动程序已更新;Ollama 会自动检测 GPU。在此基础上使用 Open WebUI 或 LM Studio 等界面会更方便,但并非必需。
#通过 Ollama 安装 Nemotron
安装流程完全遵循 Ollama 的标准流程。若服务进程已运行,仅需一条命令即可下载并启动模型。
- 01检查 Ollama 是否正在运行打开终端并运行「ollama --version」。如果命令有响应,说明守护进程已准备就绪。否则,请先安装Ollama(详见文章末尾的安装指南)
- 02下载Nano版本为避免测试时出现显存方面的问题,请从Nano开始。该命令会先下载模型权重,然后直接在终端中开启聊天会话。
- 03GPU 能胜任时,切换到 Super熟悉操作后,如果您有足够的显存,就下载 Super 版本,以提高推理和代码质量。
- 04列出和管理模型“ollama list”显示已安装的模型及其磁盘大小。“ollama rm <模型名>”可释放不再使用的模型变体所占用的空间。
要从您自己的脚本调用 Nemotron,可使用同一端口上的 Ollama REST API。“model”字段应填写您下载模型时使用的确切标签。
#可控推理模式
Nemotron 模型的标志性特点是可以按需开启或关闭推理。NVIDIA 训练了这些模型,使其在系统提示词提出要求时生成详细的思维链,否则直接回答。具体而言,只需一条系统指令即可在两种模式之间切换:“detailed thinking on” 强制逐步推理,“detailed thinking off” 则让模型给出简洁快速的回答。
这个开关很有用,因为推理有成本。思维链会生成大量中间 token:对于数学问题、逻辑问题或棘手的调试工作,这很有价值;但如果只是改写一封邮件,就是浪费。使用 Nemotron,您可以针对每条提示词决定是否承担这笔额外成本。
这种运行方式使 Nemotron 类似于处于“thinking”模式的 DeepSeek R1 或 Qwen3 等模型,但控制方式更明确:推理不是模型的全局模式,而是您可以在对话过程中控制的一项设置。
#代码、智能体和工具调用
NVIDIA 主要针对推理和智能体任务这两种用途优化 Nemotron。在代码生成、解释和纠错方面,Super 系列变体可与优秀的 32–70B 模型相抗衡。Nano 用于偶尔的辅助仍有不错的表现,但在较长的任务或大规模重构中会显现出局限——对于这种规模的模型,这是可以预料的。
真正的区别在于函数调用。Nemotron 经过训练,能够生成可靠且格式正确的工具调用,因此是构建本地智能体的不错选择:模型决定调用某个函数,读取结果,再继续执行。结合推理模式,这样的智能体能够先规划再行动,而不是贸然执行。
- 推理 / 数学
- 这是一个明显的优势,尤其是 Super 开启“detailed thinking on”时。思维链能减少计算和逻辑错误。
- 代码
- Super 在代码生成和调试方面可与 70B 模型媲美;Nano 适合轻量辅助和自动补全。
- 智能体与工具
- 工具调用可靠,严格遵循 JSON 格式——用于本地自动化是该系列最擅长的用途之一。
- 法语 / 通用对话
- 表现尚可,但并非同类最佳。Nemotron 擅长推理和执行操作,对多语言闲聊则没那么擅长。
#与Qwen3对比:在何种情况下应选择Nemotron?
Qwen3是值得拿来比较的开放权重标杆,因为这两个模型家族面向相同领域:推理、编程、多种规模和思考模式。在许多通用任务和法语表现方面,Qwen3在同等规模下仍然领先——它用途更广,多语言训练也更充分。
当您的用途更偏向智能体应用和 NVIDIA 生态系统集成时,Nemotron 重新占据优势。如果您正在构建需要大量工具调用的智能体,希望针对每条提示词明确控制推理,或运营一批 NVIDIA GPU,且重视推理吞吐量,那么 Nemotron 值得测试。相反,对于通用的法语对话助手,Qwen3 是更稳妥的默认选择。
- 适合选择 Nemotron 的情况
- 需要高强度工具调用的代理、需要精细切换推理开/关的场景、100% 使用 NVIDIA 基础设施,或在纯推理任务中寻求最佳质量/计算比的用户。
- 适合选择 Qwen3 的情况
- 需要通用助手,优先考虑法语和多语言能力、对话用途的多样性,或者只是想选择最经过实践检验、适合广泛用途的模型。
- 实用结论
- 使用您自己的实际提示词,在规模相近的情况下测试两者(Nano 对比 Qwen3-8B,Super 对比 Qwen3-32B)。性能差异在很大程度上取决于具体任务,而非抽象的排名。
#故障排除
- 执行 pull 时出现“model not found”
- 不存在这个名称的标签。请在 ollama.com/library 上核对准确拼写——Nemotron 的名称会随代际更替而变化。
- Super 模型速度骤降
- 由于显存不足,模型的一部分被放入系统内存。命令「ollama ps」会显示模型在 GPU 和 CPU 之间的分配情况。请改用 Nano、采用更低精度的量化(Q4),或增加 GPU 资源。
- 推理功能未启用
- 系统提示未被采用。在交互会话中,请使用「/set system detailed thinking on」;在API中,请将指令放入system字段,而非用户提示字段。
- 回答过于冗长
- 推理模式默认开启,或沿用了已有设置。处理简单任务时,请切换至“detailed thinking off”。
- « Connection refused »
- Ollama 守护进程尚未启动。请使用「ollama ps」检查,并确认服务确实在 http://localhost:11434 上监听。
#深入了解
Nemotron 依托的基础组件,本站已有介绍。以下指南是本指南的延伸:
- 本地运行 Qwen 3:完整测试与实测基准测试
- 这份必读对比有助于了解 Nemotron 与其主要开放权重替代方案相比的表现,并提供每秒 token 数的数据。
- 选择量化方案(Q4、Q5、Q8、FP16)
- 帮助您在使用 Nemotron Super 时权衡质量与显存需求,因为每调整一级量化,显卡能够容纳的模型就会不同。
- 在 Linux 上安装 Ollama
- 如果守护进程尚未配置好,这是需要先完成的步骤:安装脚本、systemd 服务以及 NVIDIA GPU 配置。
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。