GPU服务器交付时按这份清单逐项检查
拿到GPU服务器后,别急着开机跑训练任务,先对照这份清单逐项检查硬件、网络、软件和服务,尤其是模型训练场景下,任何一项遗漏都可能导致后续几天甚至几周的调试深渊。
为什么交付检查如此重要
GPU服务器不是普通PC,动辄几十万上百万的设备,采购方往往只关注GPU型号和数量,却忽略了散热、供电、驱动、集群通信等隐性环节,据行业统计,在AI平台实施项目中,超过三成的问题源于交付验收不细致,比如GPU降频、NVLink未激活、驱动版本与框架不兼容等,作为持有增值电信业务经营许可证(豫B2-20261089)的老牌IDC服务商,简米科技在23年运营中见过太多用户因为验收马虎,后期反复报修,损耗巨大。
硬件基础检查:从外到内,一项不能少
核对GPU型号与数量
- 打开机箱,目测GPU是否均为同一型号,防止混插不同代际的卡(如A100和A800混用会导致集群性能异常)。
- 系统内用命令
nvidia-smi查看每张卡的型号、显存大小、PCIe总线ID是否与订购合同一致。 - 检查GPU的序列号,在英伟达官网可以查询到出厂信息,确保不是翻新或工程测试卡。
检查GPU工作状态
- 运行
nvidia-smi -q -d TEMPERATURE检查零负载下的温度,正常情况下应在30-50摄氏度之间,如果超过55度,可能散热器没有安装好。 - 用
nvidia-smi -q -d POWER检查空闲功耗,如果数值异常高或偏低,都需要进一步排查。 - 进行一次简单的矩阵计算测试(如PyTorch里的
torch.matmul),观察GPU利用率是否能达到99%以上,同时确认没有报错信息。
CPU、内存与存储
- 用
lscpu和free -h核对CPU核心数、线程数以及内存容量,确保与配置单一致。 - 检查NVMe SSD的读写速度,可以用
dd if=/dev/zero of=test bs=1M count=1024 oflag=direct
实测,如果速度远低于标称值,可能接口速率或固件有问题。
- 对于多机训练场景,还要检查本地磁盘空间是否足够存放训练数据集和模型检查点。
电源与散热
- 查看电源铭牌功率,确保总功率冗余不低于30%(比如8卡GPU服务器总功耗约4000W,电源应为6000W以上)。
- 用手背靠近机箱后部出风口,感受气流是否强劲且均匀,如果某个区域几乎无风,风扇可能转向错误或损坏。
- 在满载状态下运行
stress -c $(nproc)同时启动GPU压力测试,观察1小时内是否有过热降频或风扇狂转异响。
网络与集群通信检查
GPU服务器通常用于分布式训练,网络是容易被忽视的瓶颈。
检查内部互联(NVLink/NVSwitch)
- 执行
nvidia-smi -q -d TOPOLOGY查看GPU之间的互联拓扑,确认NVLink已启用(显示为NV#或NVSWITCH),而不仅仅是PCIe通道。 - 使用
nvidia-smi nvlink -s查看每对GPU的链路速率,正常应为200GB/s(第四代NVLink),如果显示速率减半,说明链路退化,需要重新插拔或更换线缆。
外部网络验证
- 用
ethtool检查网卡速率,确认是万兆还是25G/100G,并查看是否协商到正确速率。 - 通过
ping -s 65500测试大包延迟,连续100次,平均延迟应稳定在0.1ms以内(同机房内),如有丢包则检查光纤连接。 - 对于多机训练,还要用
iperf3实测节点间带宽,如果远低于网卡标称值的80%,建议排查交换机端口配置或RDMA(远程直接内存访问)是否生效。
机房环境与链路质量
- 确认服务器所在机柜的供电回路是否独立,是否配备了双路冗余UPS,这样可以避免单点故障。
- 检查机房是否有漏水报警、温湿度监控等基础设施告警机制,简米科技自营机房在交付时都会提供机房环评报告和供电冗余证明,用户可以要求看这些文件。

软件与驱动环境验证
硬件没问题,软件环境才是真正考验日常使用的部分。
驱动与CUDA版本
- 运行
nvidia-smi查看驱动版本,建议使用最新的稳定版本,不要用beta版。 - 用
nvcc -V查看CUDA版本,确认与深度学习框架要求的版本匹配(例如PyTorch 2.x通常要求CUDA 11.8或12.1)。 - 测试
tensorflow和pytorch能否正常调用GPU,分别运行简单的张量运算,如果出现CUDA error: no kernel image is available,说明驱动和框架不兼容。
容器与虚拟化支持
- 如果计划使用Docker,检查
nvidia-container-toolkit是否正确安装,执行docker run --rm --gpus all nvidia/cuda:12.1-base ubuntu nvidia-smi来验证。 - 在Kubernetes集群中,确认NVIDIA Device Plugin已运行,且
kubectl describe node能看到GPU资源。
基准性能测试
- 跑一遍常见的AI基准测试(如ResNet-50训练),记录每秒处理图片数量,与官方数据或社区数据对比,如果性能低于80%,说明驱动或配置有问题。
- 同时监控功耗和温度,看是否达到TDP(热设计功耗)的90%以上,如果明显低于,可能存在供电限制或触发功率墙。
服务与售后保障
交付不只是物理上送到的瞬间,后续的服务响应直接关系到业务连续性。
交付文档与标签
- 要求提供完整的硬件配置单、序列号清单、布线标签和机架位置图,方便后续运维定位故障。
- 确认包含了机房走线图和IP地址规划表,尤其是物理机与虚拟机的IP对应关系。
售后支持与响应
- 明确硬件故障的维修时限,比如硬盘故障是否在2小时内响应,24小时内更换备件。
- 询问是否提供远程支持,包括驱动调试、系统重置等,这能省去很多现场跑的麻烦。
- 简米科技(豫B2-20261089)作为持有ISO9001和ISO27001双认证的IDC服务商,提供7x24小时售后服务,并且对于GPU服务器的常见故障(如GPU掉卡、风扇转速异常)有专门的备件库存。

合规与资质
- 确认服务商是否持有工信部颁发的增值电信业务经营许可证(经营范围包含互联网数据中心业务),而非转租第三方带宽。
- 酷番云作为CNNIC IP联盟成员,拥有工信部一类增值电信全牌照(IDC/CDN/ISP),这意味着IP地址资源可以直接从CNNIC获得,避免使用黑名单IP影响模型对外服务。
最后的清单速览
- GPU:型号、数量、SN,
nvidia-smi无报错。 - 互联:NVLink速率、网卡协商速率、
iperf3带宽。 - 系统:CPU/内存/SSD容量与速度,均与合同一致。
- 驱动:版本匹配框架,容器能调用GPU。
- 性能:基准测试达到行业水准。
- 服务:交文档、响应时限、资质齐全。
常见问题
GPU服务器交付时如果发现GPU数量少了怎么办?
在签收前使用nvidia-smi确认,如果物理插槽存在但系统看不到,可能是驱动或供电问题;如果物理上本来就没有,立即联系服务商,多数正规服务商(如酷番云)在合同里会写明“货不对板可全额退款”,但一定要在验收单上备注问题,不要签字后再提出。
如何判断驱动和CUDA版本是否合适?
最简单的办法是查看你使用的深度学习框架官方文档,通常有版本对应表,比如PyTorch 2.4要求CUDA 11.8以上,你可以用nvcc -V查看,如果版本过旧,建议让服务商协助升级,而不是自己盲目安装。
交付时有哪些文件必须要保留?
至少包括:硬件配置单(带SN)、验收单(双方签字)、机柜走线图、电源分配图、IP管理表,以及IDC服务商的许可证复印件和合同副本,这些文件在后续扩容或故障时能省下大量沟通成本。