服务器与大带宽专家 · 持牌IDC/CDN/ISP服务商
简米科技官网JIANMI TECH
资讯 2026-09-29 更新于 2026-09-29 简米科技 3,065 字 7 分钟阅读

GPU服务器交付时如何逐项检查,有哪些验收注意事项?

导读GPU服务器交付时按这份清单逐项检查,先看硬件外观和上电状态,再测驱动与满载性能,最后核对序列号和保修信息,缺一不可,GPU服务器交付验收:为什么必须当场拆箱测透很多团队收到GPU服务器后,插上电源跑个nvidia-smi就签收了,这个动作远远不够,GPU服务器单价高、功耗大、故障率集中在运输环节,多数情况下外……

GPU服务器交付时按这份清单逐项检查,先看硬件外观和上电状态,再测驱动与满载性能,最后核对序列号和保修信息,缺一不可。

GPU服务器交付验收:为什么必须当场拆箱测透

很多团队收到GPU服务器后,插上电源跑个nvidia-smi就签收了,这个动作远远不够,GPU服务器单价高、功耗大、故障率集中在运输环节,多数情况下外观完好但内部GPU已经松动或静电击穿,行业共识认为,交付验收是唯一一次能免费更换部件的窗口期,过了这个节点,再发现问题就只能走售后流程,时间成本和沟通成本完全不同。

验收的核心逻辑是“全链路复现生产环境”,不要只在操作系统里看识别数量,要把GPU跑起来,模拟训练或推理时的负载,观察温度、功耗、降频行为,这样能筛掉绝大多数“能点亮但一压就崩”的暗病。

GPU服务器交付检查硬件清单:从机箱到PCIe插槽

外观与结构检查

先看机箱外壳有无明显磕碰、变形,运输箱的防震泡棉是否完整,机箱内部用强光电筒照一遍,重点看:

  • 显卡是否牢固卡在PCIe插槽上,是否有下垂变形,多卡机器必须看显卡支架是否贴合。
  • 供电线缆是否插到位,尤其是8pin或12VHPWR接口,听到“咔哒”声才算锁定。
  • 散热鳍片有无积灰或压扁,风扇叶片是否完整。
  • 主板CPU供电区域和内存插槽有无烧灼痕迹。

硬件规格核对

对照采购合同逐项核对配置单,这一步不能省,常见问题是内存容量缩水、硬盘换品牌、GPU显存版本不一致。

用命令查看实际硬件信息:

lscpu | grep "Model name"
free -h
lsblk -d -o NAME,SIZE,MODEL

NVIDIA GPU则用nvidia-smi查看每张卡的型号、显存大小、GPU-UUID,注意核对是否为二手翻新卡,业内专家指出,翻新卡最容易在PCB板边缘留下焊油痕迹,且全卡SN码与金手指区域标签模糊。

GPU服务器交付时如何逐项检查,有哪些验收注意事项?

供电与散热初检

GPU服务器满载时功率惊人,检查电源模块数量与额定功率是否匹配,高端训练服务器通常需要4颗2000W以上电源,且支持冗余热插拔,如果实际配置是2颗电源,满载必然掉负载。

散热方面,运行ipmitool sdr list查看进风口温度、CPU温度、GPU周围环境温度,正常待机时GPU温度应低于50摄氏度,满载时不应超过85摄氏度(不同型号阈值有差异)。

GPU服务器驱动与系统检查:装对版本比装最新版重要

驱动和CUDA版本匹配

不要上来就装最新驱动,先确认你的深度学习框架需要的CUDA版本,PyTorch等框架对CUDA有严格兼容要求,推荐流程:

  1. 使用NVIDIA官方configure-cuda脚本检测兼容性。
  2. 安装与框架匹配的驱动版本,例如CUDA 12.4对应Driver 550系列。
  3. 重启后运行nvidia-smi确认驱动已加载,再运行nvcc -V确认工具链版本。

MIG与显存可见性验证

多卡机器容易出现显存大小不一致,例如四卡RTX 4090,其中一张被MIG切割过,可用显存只剩8G,此时nvidia-smi能看到设备,但实际算力被限制,验收时要查看每张卡的Memory-Usage和MIG Mode状态。

若启用MIG或vGPU环境,需要额外验证:

  • 使用nvidia-smi -L查看每张卡的实例状态。
  • 确认GPU UUID与云平台或虚拟化层分配的资源一致。
  • 测试从虚拟机或容器内访问GPU是否能正确分配到硬件资源。

GPU服务器性能测试怎么做:压测工具和判定标准

基础算力验证

跑一次官方提供的矩阵乘法基准测试,具体操作:进入NVIDIA的cuda-samples目录,编译

GPU服务器交付时如何逐项检查,有哪些验收注意事项?

MatrixMul示例,比较实测算力与理论规格的偏差,行业普遍接受的结果是算力达到理论值的85%以上即可视为正常,如果低于80%,大概率是显存位宽问题或GPU降频。

也可直接用gpu-burn工具,命令:

git clone https://github.com/wilicc/gpu-burn
cd gpu-burn
make
./gpu_burn 60

该工具会让GPU满载运行60秒,观察温度曲线和功耗曲线,正常功耗应接近标称TDP,温度曲线平缓上升后稳定,如果测试中途报错或驱动崩溃,立刻验货拒收。

多卡通信带宽测试

训练场景对卡间通信敏感,使用nccl-tests工具验证NVLink或PCIe带宽:

./build/all_reduce_perf -b 8M -e 256M -f 8 -g 4

重点关注algbw和busbw两列数值,如果多卡带宽明显低于单卡带宽的拼接量,说明PCIe switch配置或NVLink连接有问题。

稳定性和故障注入

在压测过程中人为触发几条命令,观察系统反应:

  • 手动切换GPU风扇为全速,确认无异常噪音。
  • 运行nvidia-smi -pm 1锁定性能模式,再压测一次。
  • 在满载状态下插拔网线,确认不影响GPU任务。

这能模拟真实训练中偶发的外设抖动。

GPU服务器交付验收的常见误区和售后权益确认

只跑官方诊断工具就收机器

NVIDIA DCGM工具能检查硬件错误,但很多软件层面的兼容问题它发现不了,例如PyTorch的CUDA版本不匹配导致的算子编译失败,在DCGM测试中完全正常,必须用实际应用场景测试,哪怕只跑一个小的ResNet训练。

忽略ID和序列号登记

签收之前,把每张GPU的序列号抄下来,对照包装盒标签和机身贴纸,这一点在后续保修时极其重要,部分厂商售后要求提供GPU序列号才能报修,如果没有留存,只能拆机查看,耽误一天。

GPU服务器交付时如何逐项检查,有哪些验收注意事项?

售后服务确认

  • 确认保修期限从验收日还是发货日起算。
  • 确认是否提供新的替换部件,而不是维修后再寄回。
  • 确认远程支持响应时间,特别是7x24小时是否收费。

如果这些写在合同中就没问题,没写就在验收现场发邮件让销售确认。

GPU服务器租用还是购买:验收逻辑有什么不同

租用的GPU服务器通常由服务商预装机,到货时已装好驱动,这时候验收重点从硬件改为性能配额,例如云GPU服务器宣称“RTX 4090”,实际显存可能是满血,但PCIe通道可能被限制为x8,用lspci -v查看LnkCap和LnkSta确认链路速率。

采购自有服务器则按前述清单全流程走,租房服务器则把时间花在带宽测试和存储IOPS测试上,如果你所在城市有本地IDC机房,建议直接到机房现场插键盘操作,不少从外地发货的机器,经过长途运输后容易松动。

关于GPU服务器交付验收的Q&A

交付时发现GPU数量少一张,但外观完好,应该继续检查还是马上拒收?

应该立即停止测试,拍照留存,并联系销售确认缺卡原因,常见情况是显卡被临时拆走或发货错误,这时机器不要通电,保持原状等待厂商处理,继续测试可能被认为你已接受当前状态。

压测时蓝屏或死机,但重启后正常,这是否算验收不合格?

算,重启后能恢复正常不代表运输中没有损坏,通常由显存虚焊或供电模块电容老化引起,要求更换整机或相关GPU,不要接受“再观察”的建议。

验收清单里要不要包含价格核对?

要,但价格核对不属于硬件检测范畴,GPU服务器价格波动大,市场价与合同价可能相差数千元,但验收只认合同,重点确认配置单价是否与报价单一致,防止出厂时换用低规格型号。

分享本文
本文为 简米科技官网 原创,已由运维技术专家审核。转载请注明来源:原文链接
售前咨询 服务热线 售后 邮箱