进阶 11 分钟性能

优化散热性能在 推理

直接回答

对于持续推理,最经济的散热方案是限制GPU的功耗:根据在RTX 3090上发布的测试数据,将功耗从350瓦降至250瓦,生成速度仅下降不足3%,而低于该阈值后速度会急剧下降。请先使用nvidia-smi确认实际限制因素是温度还是功耗,再考虑调整风扇、电压或导热膏。

一台整天响应请求的机器,其发热情况与运行电子游戏时不同:负载持续不变,内存承受高强度访问,机箱封闭。本页面介绍如何判断您的显卡是否变慢、应首先尝试哪项设置、限制功率实际会损失多少每秒生成的 token,以及何时维护(清理灰尘、更换导热膏、处理机箱问题)才是真正的解决办法。

您正在挑选电脑吗? 按预算推荐 →

作者: Mohamed Meguedmi·更新于 2026-09-30·已在 Windows、macOS 和 Linux 上测试
推荐硬件

本地 AI 的高性价比之选: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).

迷你 PC 是一台完整的机器:请检查可用内存和引擎兼容性。它不能替代 macOS/MLX 或 CUDA。

为什么选择它?我们的完整资料: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →

按预算比较所有选项,从 800 到 3 500 欧元 →

预算有限: RTX 5060 · 大型模型: RTX 5090 · Mac Studio.

移动场景: 本地 AI 选哪款笔记本电脑 →

联盟链接——您无需承担额外费用,但我们可能获得佣金。作为 Amazon 合作伙伴,哪个LLM会从符合条件的购买中获益。

#为什么散热对推理服务器至关重要

GPU 会保护其芯片:当温度或功耗超过固件允许的范围时,它会降低频率。这种机制称为降频(throttling)。nvidia-smi 的文档区分了其成因:与温度相关的软件降频(“sw thermal slowdown”)、更剧烈的硬件降频(将频率降低 2 倍或更多,“hw thermal slowdown”),以及功耗上限(“sw power cap”)。如果所有这些原因均显示为未激活,则频率将运行在尽可能高的水平。

不同显卡的阈值并不相同。NVIDIA 将其称为「GPU Slowdown Temp」,即硬件开始调整频率以降温的温度,并在 nvidia-smi 中显示。因此,不要依赖「83 °C」这样的通用数值:请查看您显卡对应的数值。温度限制导致的降频会使速度下降;如果风扇加速以补偿,也会产生噪音。从长期来看,始终在高温下运行的显卡会更快老化,但我们没有可靠的数值可以引用来说明这一点。

i
解码与提示词处理:敏感程度不同
文本生成受内存带宽限制,因此对核心频率不太敏感。提示词处理受计算能力限制,因此对任何频率下降都更敏感。处理长文档或智能体循环的服务器,比交互式聊天更容易受到功率上限的影响。

#先测量,再调整:显卡的实际表现

首先要判断显卡是否降频,以及降频的原因。对于 NVIDIA 显卡,两条命令就够了。第一条持续显示温度、功耗、核心频率和利用率;第二条详细列出降频原因以及您所用显卡型号的温度阈值。

在负载下监控(每秒一行)
nvidia-smi --query-gpu=timestamp,temperature.gpu,power.draw,clocks.current.graphics,clocks.current.memory,utilization.gpu --format=csv -l 1
性能下降原因及温度阈值
nvidia-smi -q -d PERFORMANCE
nvidia-smi -q -d TEMPERATURE
AMD 显卡
rocm-smi --showtemp --showpower --showuse

在生成持续几分钟的过程中执行这些命令,而非在空闲状态下。两次读取均计入。若核心频率下降而温度上升,且存在热限制,则存在散热问题。若核心频率保持高位但存在功耗上限,则显卡因功耗受限:进一步降低功耗限制对生成速度无明显影响,但可减少发热量。

查看哪些指标,得出哪些结论
长时间生成过程中的观察解读首先采取的措施
温度稳定在热降频阈值以下,频率稳定没有散热问题无需更改;可酌情设置功率上限以降低噪音
温度达到阈值,频率下降,热限制原因标记处于激活状态散热不足机箱气流、灰尘、风扇转速曲线
频率较低,限频原因显示为“power cap”,温度正常已达到功率上限正常;仅在吞吐量不足时提高上限
首次与第十次交互之间的速度差异逐步升温在长时间负载下测量,而非启动时

#功率上限:收益最大的设置

限制显卡功耗比调整电压曲线更简单,而且可以恢复原设置。对于受内存性能限制的推理,在达到某个阈值之前,速度损失很小,超过后则会骤降。runaihome 博客使用一个具有 270 亿参数的稠密模型测试了 RTX 3090,并指出:功耗从 350 W 降至 250 W 时,减少了 100 W,而显卡速度损失不到 3%;降至 200 W 时,核心频率骤降,速度下降 35%。

RTX 3090 的功率限制与生成速度(runaihome 发布的测量结果)
限制对生成速度的实测影响
350 W(默认值)参考
300 W与参考值相差不到3%
250 W31.7 t/s,比参考值低不到 3%
200 W20.6 tokens/s,即降低 35%:不应越过的阈值

对于 RTX 4090,同一篇博客引用了 Tom's Hardware 的说法:将功率上限设为 70%(约 315 W),可保留约 94% 的性能。这些数字来自二手来源,并针对某一张显卡:不要原样套用到您的显卡上。可靠的方法是在长时间生成过程中测量吞吐量,以每次 25 至 50 W 的幅度逐步降低功率上限,并在性能骤降之前停止下调。

设置功率上限(Linux,需根据您的显卡调整)
# Lire la limite par défaut, minimale et maximale
nvidia-smi -q -d POWER

# Appliquer 250 W sur la carte 0 (nécessite les droits root)
sudo nvidia-smi -i 0 -pl 250

nvidia-smi 的文档明确指出,该值必须在显卡报告的最小值和最大值之间,并且该命令需要 root 权限。重启后请确认限制是否仍被应用:如果已恢复为默认值,请创建一个 systemd 单元在启动时重新应用该限制。

/etc/systemd/system/nvidia-power-limit.service
[Unit]
Description=Limite de puissance GPU
After=multi-user.target

[Service]
Type=oneshot
ExecStart=/usr/bin/nvidia-smi -i 0 -pl 250
RemainAfterExit=yes

[Install]
WantedBy=multi-user.target

通过运行 sudo systemctl enable --now nvidia-power-limit.service 启用该功能。

#风扇转速曲线:尽早提高转速,而不是等到后期才骤然拉高

出厂风扇曲线优先考虑静音:风扇在温度较高之前保持低速,之后才逐渐加速。对于持续负载,让风扇更早开始提速的曲线能在噪声相近的情况下使显卡保持更低的温度,因为这样可以避免转速峰值。在 Windows 下,可使用 MSI Afterburner 调整风扇曲线;在 Linux 下,LACT 是一款用于控制 AMD、NVIDIA 和 Intel GPU 的图形界面应用,也支持风扇控制。

适用于持续负载的示例曲线(需在您的显卡上验证)
温度风扇转速
50 °C40 %
60 °C55 %
70 °C75 %
78 °C90 %
降频温度阈值减去 5 °C100 %

这些数值只是起点,并非制造商的推荐值。请根据您显卡的“GPU Slowdown Temp”值调整风扇曲线的最后一档,并根据房间内可接受的噪声水平判断效果。在 macOS 上,Apple 管理风扇,没有风扇曲线调节选项。

#降压(Undervolting):更精细,验证时间更长

降压是指在更低的电压下达到相同的频率,从而减少发热。在 Windows 下,可通过 MSI Afterburner 的频率—电压曲线进行调整;在 Linux 下,常见做法是使用 nvidia-smi 中用于设置核心频率范围的选项来锁定频率。收益因显卡而异:每颗芯片的可调整余量都不同,过于激进的设置会导致错误或崩溃,但这些问题往往要过一段时间才会出现,而不是立即发生。

  1. 01
    从一个可稳定运行的功耗限制出发
    先从限制功耗入手:这是最稳妥的改善方式。只有显卡仍然过热或噪音过大时,才进一步降低电压。
  2. 02
    设置最大频率
    将核心频率锁定在低于最高加速频率的某个值,例如使用 nvidia-smi -lgc,后面加上以 MHz 为单位的频率范围。
  3. 03
    长时间测试
    启动生成任务,让其连续运行至少 30 分钟。不稳定会表现为 CUDA 错误、驱动程序崩溃或输出内容混乱。
  4. 04
    对比
    使用相同的模型和提示词,测量调整设置前后的速度与温度,然后仅在速度损失可以忽略时保留该设置。
  5. 05
    必要时撤销更改
    重置频率(nvidia-smi -rgc)或重启,以恢复出厂设置。
!
降压并非万无一失
与限制功耗不同,过度降低电压可能导致系统出现间歇性不稳定。对于无人值守运行的服务器,如果尚未进行数小时的测试,就只采用功耗限制。

#机箱与气流:改善效果以温度降幅衡量

风道
保持从前向后畅通的气流,并将凉爽空气引向显卡风扇。布线如果阻碍气流,就会让温度升高。
滤网与灰尘
滤网积尘会降低空气流量:请定期清洁滤网,并用压缩空气清除显卡散热器上的灰尘;清理时应固定风扇,防止气流带动其超速旋转。
显卡周围的空间
在多 GPU 配置中,两张显卡紧挨着安装会让第一张显卡升温;请拉开它们之间的距离,或加装一个侧面风扇。
环境
与 20 °C 的房间相比,30 °C 的房间会让显卡温度增加 10 °C:放在封闭柜子里的服务器,首先面临的是散热问题,其次才是显卡本身的问题。

为准确判断某项设置的效果,请保持测试方法一致:使用相同的模型、相同的长提示词和相同的生成时长,每次只改变一个参数。在生成结束时记录最高温度、核心频率和平均吞吐量,而不是在开始时记录,因为尚未升温的显卡测出的数值总比同一张显卡运行二十分钟后更好。请在相同的室温下重新测量,否则导致比较失真的将是室温,而不是设置本身。

#重新涂抹导热膏:有风险的最后手段

使用数年后,二手显卡的导热硅脂和导热垫可能已经干燥老化。症状是,即使机箱干净,在相同负载下的温度仍高于购买时。拆解显卡会失去保修,可能损坏导热垫和芯片,而且需要按正确的方法操作。只有排除更简单的原因后,才应考虑拆解:灰尘、气流、功率限制和环境温度。如果您没有把握,请交给专业服务商处理,并将费用与更换显卡的成本进行比较。

#笔记本电脑和 Mac:优化手段有所不同

在笔记本电脑上,您既不调节电压,也不调整导热硅脂。有效的调节手段是电源模式。Apple 介绍了两种模式:低电量模式,在 macOS Sequoia 15.1 及更新版本上,也会降低采用主动散热的机型的风扇噪音;高能耗模式则允许风扇以更高转速运行,以在非常繁重的负载下维持性能,同时带来更多噪音。对于没有风扇的 MacBook Air,能采取的措施只有使用有助于散热的支架、接通市电,以及选用更小的模型。

#常见问题

FAQ
显卡在什么温度下开始变慢?+
这取决于显卡型号。NVIDIA 在 nvidia-smi 中定义了一个名为“GPU Slowdown Temp”的温度阈值,达到该温度后,硬件会调整频率以降温。命令 nvidia-smi -q -d TEMPERATURE 可显示您显卡的这一阈值。未经核实,不要依赖 83 °C 这样的通用阈值。
设置功率上限会显著降低推理速度吗?+
在达到某个阈值之前,减速幅度很小。一项已公布的 RTX 3090 测量结果显示,将功率从 350 W 降至 250 W 时,生成速度损失不到 3%;降至 200 W 时,生成速度则下降 35%。受计算能力限制的提示词处理对功率变化更敏感。请在自己的显卡上使用自己的负载进行测量。
如何判断我的GPU是否处于降频状态?+
启动一次长时间的生成任务,并用 nvidia-smi 观察 GPU 核心频率。如果温度升高时频率下降,请查看 nvidia-smi -q -d PERFORMANCE 的输出:它会显示是否有温度或功耗方面的限制原因处于生效状态。如果所有原因都未生效,说明当前频率已经尽可能高。
是否需要更换显卡的导热膏?+
很少需要。请先排查灰尘、机箱气流、环境温度和功耗限制是否是原因。拆卸会导致保修失效,也可能损坏导热垫和芯片。只有在检查了其他所有因素后,发现干净的显卡温度仍明显升高,拆卸才有理由。
降压或功耗限制:该选择哪个?+
先设置功率上限:操作简单、可撤销,而且不会带来不稳定的风险。降压需要长时间测试,并可能导致间歇性崩溃,尤其是在无人值守的服务器上。只有在仅设置功率上限后,显卡仍然过热或噪声过大时,才进一步采用降压。
MacBook 有针对本地 AI 的散热设置吗?+
可调整的设置不多。Apple 提供电源模式:低电量模式,以及部分机型上的高功率模式;后者会提高风扇转速,但噪音也更大。对于没有风扇的 MacBook Air,请将电脑放在有助于散热的支架上,接通电源,并在长时间生成时选择较小的模型。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。