GPU温度正常范围参考

GPU温度正常范围参考

1.检查命令123456789101112# 实时温度监控watch -n 1 nvidia-smi -q -d TEMPERATURE# 查看温度历史记录(如有日志)nvidia-smi --query-gpu=timestamp,temperature.gpu,temperature.memory \ --format=csv -l 1三个关键温度指标# 查看完整温度信息nvidia-smi --query-gpu=name,temperature.gpu,temperature.memory,temperature.gpu.hotspot \ --format=csv

指标

含义

注意

temperature.gpu

GPU 核心温度

最常用的参考值

temperature.memory

显存(VRAM)温度

GDDR6X 发热量大

temperature.gpu.hotspot

热点温度

通常比核心高 10–20°C

重要:核心温度 70°C 但热点 105°C,GPU 并不健康

2.核心温度范围

状态

温度范围

说明

待机/空闲

30–50°C

完全正常,风扇可能停转

轻度负载

55–70°C

正常,办公/浏览器等

中等负载

70–80°C

正常,轻度游戏/推理

高负载

80–85°C

正常,重度训练/渲染

偏热

85–90°C

需关注,检查散热

降频风险

90–100°C

显卡开始 throttling

危险区

100°C+

立即处理,可能损坏

3.温度过高影响温度升高 → 性能下降路径:

70°C 正常

80°C 轻微降频(约 3–5%)

85°C 明显降频(约 10–15%)

90°C+ 严重降频(20%+),稳定性风险

100°C+ 强制shutdown保护

4.不同显卡型号温度范围参考

显卡系列

满载理想温度

最高安全温度

说明

NVIDIA A100/H100(数据中心)

65–75°C

83–90°C

被动散热,依赖服务器风道

RTX 4090 / 4080

65–80°C

~90°C

Ada架构,温控较保守

RTX 30 系列

68–83°C

~85–90°C

Ampere 架构

RTX 20 系列

70–85°C

~85°C

Turing 架构

Tesla T4 / V100

60–75°C

83°C

数据中心卡,温控严格

5.总结

理想工作温度:65–80°C

可接受上限:85°C

需要干预:>90°C

危险温度:>100°C

对于生产环境(如 AI 训练/推理),建议保持核心温度在 75°C 以下,以确保长期稳定性和寿命。

相关推荐