上海AI训练算力合同签署前,先确认这五件事
算力合同不是普通采购单,它绑定的是训练集群的运维责任、故障赔付和未来扩容路径,很多团队在签署上海AI训练算力合同时,只看了单价和卡数,结果遇到驱动不兼容、网络带宽被限流、故障停机超过24小时,才发现合同里根本没写对应的补偿方案。
第一件:确认交付的是物理GPU还是虚拟化算力
行业共识认为,AI训练场景下物理GPU的性能稳定性要优于虚拟化实例,尤其是千卡以上并行训练时,通信延迟和显存隔离问题会直接影响收敛速度,签合同前,你需要让供应商明确交付方式,并在合同附件中写明硬件型号、显存大小、NVLink连接拓扑、IB网络带宽,模糊写一句“高端GPU集群”的合同,基本等于没写。
我遇到过一家做多模态训练的公司,合同里写“A100算力”,实际交付的是通过虚拟化切分的中低端卡,训练吞吐量差了两倍,算力租赁合同注意事项里,最容易被忽视的就是这个。
第二件:算力资源是独占还是共享
训练任务对稳定性要求极高,共享区间里其他租户的突发任务会抢占PCIe带宽和CPU内存,合同里必须明确资源调度策略,是独占整机还是共享超节点?是固定配额还是按需抢占?建议在合同附录中约定“同一时间段内,单个物理节点最多承载的租户数量”以及“资源抢占的告警和补偿机制”。
第三件:数据与隐私边界怎么划分
训练数据集和模型权重是核心资产,合同必须写明数据存储位置是否在上海本地节点,是否加密传输和静态加密,以及供应商是否有权访问你的业务数据,尤其是涉及金融、医疗行业的模型,还要确认数据是否用于其他人的训练任务,依据《数据安全法》的基本要求,合同至少要有数据使用目的的限制条款和泄露通知时限。

第四件:故障响应与赔偿标准
AI训练任务动辄连续运行数周,一旦硬件故障导致中断,损失远超合同金额,你要做三件事:
- 明确故障响应级别:5分钟内告警,1小时内响应,重大故障4小时内修复。
- 约定停机补偿:比如每月可用性低于99.9%,按中断时长抵扣一定比例的合同价款。
- 写入备份策略:检查点自动保存频率,意外宕机后任务从最近检查点恢复的时间。
第五件:退出迁移和费用结算
合同到期算力数据怎么带走?是否支持导出模型权重和日志?如果迁移到其他云服务商,有没有出口流量费?上海算力服务合同价格里,很多单价看起来低,但迁移费、备份费、销毁确认费会悄悄抬升总成本,合同要写明:合同到期或终止后,供应商需在X个工作日内提供原始数据和模型下载通道,逾期不删除的赔偿条款也一并写上。
算力合同价格怎么谈?从报价到计费模式
上海算力服务合同价格没有统一标准,不同服务商的报价模型差异很大,有的按卡时计费,有的按租期整租,也有的把带宽和存储单独拆开收,合同签署前,你要学会把“一卡多少钱”转化为“一个训练任务总成本”。
分清三种计费模式
- 包月整租:适合长期稳定的训练任务,单价看着高,但总成本可控。
- 按需按卡时:适合算法调优阶段,空闲时释放资源,节省开销。
- 混合计费:基础包月资源+弹性扩容部分按卡时单价,适合任务量有明显波峰波谷的团队。
签合同前,先估算自己未来三个月的实际训练时长,再反向对比计费方案,比如一个千卡规模的Linux集群,如果每天只训练4小时,按需计费明显更划算;如果全天跑数据并行训练,包月整租通常能压低单价。

隐藏成本清单
报价单之外,常见的额外费用包括:
- 数据存储费:按TB/月计费,比较不同供应商每TB价格。
- 跨区域带宽费:数据从上海节点传输到其他地域,通常价格不菲。
- 镜像和日志存储费:训练产生的日志文件长期堆积,需要定期清理或付费扩容。
- 技术支持费用:部分服务商把“专人对接”算作增值服务。
谈判技巧其实很直接:让供应商把报价拆到每一项,然后拿着明细去对比,多数情况下,能给出清晰拆分报价的供应商,后续服务不会太离谱,据行业公开信息,上海地区的算力合同价格在过去一年内已经出现明显分化,老牌云服务商和新建智能算力中心的定价体系并不相同。
价格锁定周期
算力硬件迭代快,价格波动也大,合同里建议写一条“价格保护机制”:一次性预付费超过X万元时,锁定当前单价X个月,期间供应商调价不影响已签合同,同时约定续租时提前X天告知新价格,给你留出比价和迁移的时间。
算力服务质量与验收标准,写进合同才稳妥
AI训练算力的验收不像买软件,不存在“安装即完成”,建议按照单点测试、小规模训练、全量任务三阶段验收,每个阶段都有明文标准。
单点基准测试
拿到资源后,用官方基准工具跑一下单卡性能,比如训练一个标准的图像分类模型,记录每秒处理的样本数,把测试结果和合同中承诺的硬件理论性能做对比,如果偏差超过合理范围,需要供应商提供解释或换卡。
分布式并行效率测试
在这个环节,你可以用NCCL测试通信带宽和延迟,实测结果会直接反映节点间互联的质量,行业专家指出,千卡集群中通信瓶颈导致的效率损失,通常不应超过理论峰值的一半,如果低于这个水平,要立即检查拓扑配置和路由策略,合同中建议写明“分布式训练加速比不低于X%”,否则触发优化责任。

稳定性运行测试
连续运行7天,记录故障次数、自动恢复时长和告警响应时间,训练任务中途宕机后,检查点是否如期保存,能否无缝续跑,这些都要留痕,特别提醒一点:运维面板截图和每天的日志记录建议保留到合同结束,以后扯皮时能省很多口舌。
验收通过后,再签署实际履约确认单,否则供应商可能认为你默认接收了所有资源状况,AI训练算力采购流程中,验收是最后一道闸门,别让前期谈判的用心在这里松掉。
上海算力合同常见疑问
问:合同里要不要写明GPU型号的具体性能参数?
要,GPU型号只是代称,同型号下还有不同制程或功率版本,建议把显存带宽、TFLOPS算力、卡间通信速率都写进附件,避免供应商用型号擦边球交付低配硬件。
问:训练中途想扩容算力,合同需要提前约定吗?
需要,提前约定扩容的申请流程和价格结算方式,近期部分服务商对规模扩容会重新评估网络拓扑,如果不提前确认,扩容后训练任务可能因网络配置问题长期无法正常工作,合同里写明扩容时是否需要停机,停机期间是否计费。
问:供应商提供的算力监控后台数据能作为有效证据吗?
能,前提是合同里约定双方认可监控平台数据,部分服务商的后台可以自助导出资源使用量和故障事件记录,建议在合同附件中写明该平台为唯一有效记录源,双方对数据有异议时,以该记录为准并允许第三方审计,合同签署前,务必实际登录平台体验一番,信息导出是否顺畅、日志是否保留完整,这些细节比口头承诺更可信。