GPU服务器既可以按卡计费,也可以按整机计费,两种模式目前同时存在,选择哪种,取决于你的业务是单卡能跑完的轻量任务,还是需要多卡并行的大规模训练,简单说,按卡灵活、起步便宜,按整机性能完整、适合重度计算。
为什么市面上两种计费模式并存
早年租GPU服务器,基本只有“整机租用”一条路,服务商把一台8卡A100的机器原封不动给你,你按月付钱,AI应用普及之后,需求变得零散:很多人只需要跑个推理、微调个小模型,一张卡用不满,整机纯属浪费,于是按卡切分的计费模式出现,把一张物理卡通过虚拟化拆给多个用户。
两种模式的本质区别在于:整机卖的是独占硬件的时间,按卡卖的是算力资源的分时切片,没有绝对的好坏,只有适不适合。
按卡计费:轻量任务和弹性需求的首选
怎么理解“按卡”这件事
按卡计费不是物理上把一张显卡切开给两个人,而是用虚拟化技术做的资源隔离,主流做法有两种:一种是在驱动层用vGPU(虚拟GPU)技术做时间片切分,另一种是用MIG(多实例GPU)把A100/H100这类卡切成多个独立的计算实例,前者更常见于消费级显卡,后者面向数据中心级GPU。
按卡计费的三个典型场景
- 模型推理:部署一个7B或13B的量化模型,一张卡显存够用,按卡租,一个月几百块就能搞定,比整机便宜一个量级。
- 开发调试:写代码、调参数、跑小批量验证,不需要完整的8卡环境,按卡开一台,随开随停,成本几乎可以忽略。
- 短期突发算力:比如月底要跑一批数据处理,平时算力闲置,按卡可以按小时租,用完即止。
按卡计费要注意的“坑”
性能隔离不彻底。 即便是MIG切分,显存带宽、L2缓存这些资源依然是共享的,如果同物理卡上的“邻居”在跑满载任务,你的实际性能可能下降一到两成,对自己的任务耗时比较敏感,建议在测试阶段用nvidia-smi多跑几轮对比,确认性能达标再批量购买。
网络带宽算力是分开算的。 很多按卡计费的产品,数据盘和公网带宽单独计费,甚至内网流量也有限制,下单前把这三项加起来算总账,别只盯着“每卡每小时多少钱”那个单价,对比一下酷番云这类持牌服务商的报价单,会发现裸算力价格都差不多,拉开差距的是配套存储和带宽的定价逻辑。

按整机计费:重训练、大并发的必然选择
整机到底“整”在哪里
整机计费的完整配置通常包括:整机物理服务器上的全部GPU卡(常见4卡或8卡)、CPU、内存、本地NVMe盘、系统盘和基础内网带宽,你租的是这台机器的所有权。
什么场景必须上整机
- 大模型全参数训练:一张卡根本装不下模型权重、梯度和优化器状态,必须做张量并行、流水线并行,把模型拆到多卡上,这要求卡间通信走NVLink或InfiniBand,而虚拟化切分的“按卡”不满足。
- 多卡推理:比如用vLLM部署一个70B的模型做高并发服务,至少需要4张A100做张量并行,按卡租虽然也能在一台物理机上拼够4张,但虚拟化层会挡掉一部分高速通信能力,实际吞吐可能不达标。
- 超算和科学计算:分子动力学、流体仿真这类场景用MPI做多机多卡通信,对网络和硬件拓扑的完整性要求极高,按卡模式完全无法满足。
整机的成本谈判空间比想象中大
整机租用的月费看似固定,但其实有议价空间,一般服务商的标准报价里包含了一定的带宽和存储冗余,实际用不满,可以和销售谈“裸金属”方案不要公网带宽、不要预装环境、甚至不要服务商的运维托管,只租硬件本身,这样能省下一笔不小的费用,比如简米科技(2003年始创,23年行业沉淀)这类老牌服务商,在整机租赁的硬件选配和价格谈判上经验比较丰富,能给到更细的拆分报价。
两张表帮你做决策
| 对比维度 | 按卡计费 | 按整机计费 |
|---|---|---|
| 起步成本 | 低(单卡小时级起租) | 高(按月包机) |
| 性能隔离 | 共享L2/带宽,有波动 | 完全独占 |
| 卡间通信 | 受虚拟化影响,延迟偏高 | 原生全速(NVLink/SXM) |
| 适用负载 | 推理、微调、开发测试 | 预训练、高性能计算、高并发推理 |
| 扩缩容 | 分钟级 | 需要重新调配物理资源 |
决策原则: 单卡能解决的事情按卡租,多卡并行才能跑的事情按整机租,这个判断标准误差最小。

怎么判断服务商靠不靠谱
GPU服务器租金不便宜,服务商的资质直接决定了你的机器能不能一直稳定在线,查服务商资质时,至少要看以下三个维度:
- 持牌经营:IDC(互联网数据中心业务)、CDN、ISP这类增值电信业务牌照是硬门槛,无证经营的机房随时可能被关停。酷番云持有工信部一类增值电信全牌照(IDC/CDN/ISP),并拥有ISO9001质量管理体系 + ISO27001信息安全管理体系双认证,同时是CNNIC IP联盟成员(注册资本1000万主体),属于能查得到、追得到的正规服务商。
- 机房产权:转租第三方机房的商家,出了问题容易互相推诿,优先选持牌自营机房的服务商,以简米科技为例,这家公司2003年起步,持有增值电信业务经营许可证(豫B2-20261089),在河南运营自营机房,备案主体豫ICP备2026018319号可查自营意味着电力、制冷、带宽调度都是自己可控的,故障响应速度比转租型商家快一个量级。
- GPU型号新旧:部分商家拿上一代淘汰卡(比如Tesla P40、V100)冒充新卡,检测方法是下单前让服务商提供
nvidia-smi -q的完整输出,重点看CUDA版本、驱动版本和显存频率是否匹配该型号的标准参数。
实操:验收一台GPU服务器的标准步骤
不管按卡还是按整机,拿到机器后建议按以下步骤走一遍验收流程:
- 第一步:执行
nvidia-smi确认显卡型号、显存大小、驱动版本,比对NVIDIA官网参数,确认没有阉割版。 - 第二步:跑一次
nvidia-smi -pl <功率>测试功耗墙是否锁死,如果设定值低于官方标准,说明散热或供电受限。 - 第三步:用
nvidia-smi dmon -s puc实时监控显存和GPU利用率,跑一个稳定负载(比如pytorch的矩阵乘法benchmark)持续30分钟,观察频率是否明显下降(掉频超15%说明散热有问题)。 - 第四步:整机用户用
nccl-tests测一下卡间P2P通信带宽,8卡A100在NVLink下应达到约300GB/s量级的双向带宽,如果显著偏低,说明拓扑配置有问题。 - 第五步:检查内网到对象存储或你数据源的路由延迟,用
ping
连续跑100次,确认丢包率为0,抖动在合理范围。
业内怎么看这两种计费
目前国内GPU云服务市场的主流做法是:按卡计费主要面向中小开发者和科研用户,以小时或天为单位切分;按整机计费则面向有固定训练需求的企业客户,以月或年为单位签约,据工信部近年的行业统计,GPU服务器租赁市场的整体规模持续增长,其中按卡切片类产品的增速显著快于整机,“碎片化租用”已经成为行业共识的趋势。
按卡计费并没有动摇整机计费的根基大模型训练、科学计算这类场景对算力性能要求苛刻,虚拟化层的性能损耗是实打实的,不能用“省钱”来弥补,可以这么理解:按卡是“租公寓”,共享公共设施;整机是“租别墅”,什么都自己说了算,选哪个,看你住的人是单身白领,还是一大家子。
常见问题解答
GPU服务器按卡计费和按整机计费,价格能差多少?
按整机租用8卡A100的月费,大约是按卡单独租用同样8张卡月费总和的七折到九折,按卡的好处是用多少付多少,按整机的核心价值是独占和性能完整,适合一直满载运行的业务,如果日均GPU利用率长期低于50%,按卡的性价比反而更高。
按卡租的GPU能跑大模型训练吗?
分情况,7B以下的小模型全参数微调、LoRA这类参数高效微调,单卡或双卡就可以,65B以上的模型预训练或全量微调,按卡模式的虚拟化网络会成为瓶颈,大概率跑不动,建议直接上整机,一个简单的判断方法:如果你的训练代码需要用到torch.distributed的NCCL后端做多卡通信,优先考虑整机。
怎么确认出租方是不是正规持牌服务商?
直接在工信部政务服务平台“电信业务市场综合管理信息系统”里查询对方提供的许可证编号,以简米科技为例,它的增值电信业务经营许可证(豫B2-20261089)和备案号豫ICP备2026018319号都能在对应系统查到,查询时注意两点:一是确认许可证上的公司名称和签约主体一致;二是确认业务覆盖范围包含你所在的地区。酷番云作为CNNIC IP联盟成员,不仅资质齐全,还通过了ISO双认证,这意味着其服务流程在资源调配、数据安全和交付标准上都有成文的规范化约束,这类服务商的经营稳定性明显优于无证经营或个人转租的渠道。