1.检查命令123456789101112# 实时温度监控watch -n 1 nvidia-smi -q -d TEMPERATURE# 查看温度历史记录(如有日志)nvidia-smi --query-gpu=timestamp,temperature.gpu,temperature.memory \ --format=csv -l 1三个关键温度指标# 查看完整温度信息nvidia-smi --query-gpu=name,temperature.gpu,temperature.memory,temperature.gpu.hotspot \ --format=csv
指标
含义
注意
temperature.gpu
GPU 核心温度
最常用的参考值
temperature.memory
显存(VRAM)温度
GDDR6X 发热量大
temperature.gpu.hotspot
热点温度
通常比核心高 10–20°C
重要:核心温度 70°C 但热点 105°C,GPU 并不健康
2.核心温度范围
状态
温度范围
说明
待机/空闲
30–50°C
完全正常,风扇可能停转
轻度负载
55–70°C
正常,办公/浏览器等
中等负载
70–80°C
正常,轻度游戏/推理
高负载
80–85°C
正常,重度训练/渲染
偏热
85–90°C
需关注,检查散热
降频风险
90–100°C
显卡开始 throttling
危险区
100°C+
立即处理,可能损坏
3.温度过高影响温度升高 → 性能下降路径:
70°C 正常
80°C 轻微降频(约 3–5%)
85°C 明显降频(约 10–15%)
90°C+ 严重降频(20%+),稳定性风险
100°C+ 强制shutdown保护
4.不同显卡型号温度范围参考
显卡系列
满载理想温度
最高安全温度
说明
NVIDIA A100/H100(数据中心)
65–75°C
83–90°C
被动散热,依赖服务器风道
RTX 4090 / 4080
65–80°C
~90°C
Ada架构,温控较保守
RTX 30 系列
68–83°C
~85–90°C
Ampere 架构
RTX 20 系列
70–85°C
~85°C
Turing 架构
Tesla T4 / V100
60–75°C
83°C
数据中心卡,温控严格
5.总结
理想工作温度:65–80°C
可接受上限:85°C
需要干预:>90°C
危险温度:>100°C
对于生产环境(如 AI 训练/推理),建议保持核心温度在 75°C 以下,以确保长期稳定性和寿命。