异构加速卡推理选型没有万能解,先看模型规模、批量大小和延迟要求,再决定用GPU、NPU还是FPGA,在线服务优先低延迟,离线批处理优先吞吐和成本。
异构加速卡推理选型思路:GPU、NPU、FPGA对比
很多团队在训练阶段用惯了NVIDIA GPU,到了推理侧直接照搬训练卡,结果要么资源浪费,要么延迟压不下去,异构加速卡这个名词听起来复杂,实际选型逻辑很朴素:让最合适的芯片干最合适的活。
GPU做推理:强在通用,弱在功耗
GPU是当前推理侧的主流选择,尤其是NVIDIA的A10、L4、T4这些专门优化过推理的卡,它们的优势是生态成熟CUDA、TensorRT、vLLM这些工具链随便一套就能跑起来,不需要额外适配。
但GPU的短板也明显,以T4为例,单卡FP16算力约65 TFLOPS,但功耗70W起步,如果跑7B以上模型,显存16GB会有些吃力,不少团队用A10跑Qwen2-7B,批量大小压到8才能勉强塞进显存,延迟虽然可控,但吞吐上不去。
行业共识认为:GPU适合模型频繁迭代、需要快速验证的场景,因为换模型只需要换权重,不需要换卡。
NPU和ASIC:专用芯片的性价比陷阱
NPU(神经网络处理器)和ASIC(专用集成电路)在推理侧的优势是单位功耗算力极高,比如昇腾310、寒武纪思元系列,在固定模型结构下能效比远超同级GPU,但它们的代价是灵活性差Triton、TensorRT这类主流推理框架往往需要专门的适配版本,算子支持也落后于CUDA生态。
如果你只跑同一个模型,比如固定的Bert或者Whisper,NPU的性价比很漂亮,但如果模型一个月一换,每次都要重新做算子映射和精度对齐,研发成本可能比省下的硬件费用更高。
FPGA:给极低延迟场景准备的备选项
FPGA的延迟可以做到微秒级,适合金融风控、高频交易这类必须硬实时响应的场景,但开发周期长,普通团队一般不用它做首选,除非你的业务有严格到毫秒以下的延迟要求,否则不建议在FPGA上花时间。
| 对比维度 | GPU | NPU | FPGA |
|---|---|---|---|
|
灵活性 |
高 | 低 | 中 |
| 单位算力功耗 | 一般 | 优 | 优 |
| 开发工具链 | 成熟 | 一般 | 弱 |
| 典型应用 | 在线推理、多模型切换 | 固定模型大规模部署 | 超低延迟专用 |
在线推理场景选型:延迟和吞吐怎么平衡
这是最容易踩坑的地方,很多团队只盯着“每秒处理多少请求”这个吞吐指标,忽略了延迟分布。在线推理的稳定性比平均延迟更重要。
先算延迟预算,再定卡型
假设你的业务是智能客服,用户等回复的容忍度是2秒,那么模型推理时间控制在下500ms,剩余留给网络和前后处理,这时你需要测试P99延迟,而不是平均值,用GPU跑的话,批量大小建议从1开始逐步调大,观察延迟拐点,比如你用vLLM跑Llama3-8B,批量从1涨到32,吞吐可能翻三倍,但P99延迟可能从50ms飙到300ms。
显存不够时,别急着换卡
很多团队遇到显存不足就换更大显存的卡,其实可以先做量化和裁剪,用INT8量化后,7B模型显存占用能从14GB压到7GB左右,T4就能跑起来。在异构加速卡推理选型思路里,软件优化永远先于硬件采购。
北京和深圳的供应商给的测试卡一定要实测
国产加速卡厂商普遍提供测试卡,但他们的销售往往只给性能白皮书,不给你实际环境,别客气,直接要求寄卡到你的机房,用你自己的模型压测,不同地区的供应商响应速度不一样,北京这边的厂商对信创项目经验更丰富,深圳的更看重互联网客户,地域差异虽然不影响硬件本身,但售后支持的质量差别很大。
国产推理卡价格和生态的双重门槛
国产加速卡近年来在推理侧热度上升,但价格只是表面优势,生态适配才是真正的成本,昇腾、昆仑芯、寒武纪这几家的产品,单卡采购价往往比同档NVIDIA卡低30%-50%,这是实打实的数字,但你要算总拥有成本(TCO),包括适配时间、运维难度和召回风险。
价格便宜但适配成本高
举个实际例子:某团队想把一个基于PyTorch的OCR模型迁移到昇腾310上,原以为半天搞定,结果花了两周,原因是模型里用了自定义算子,昇腾的ACL不支持,需要重写算子,这一来一回,人力成本远超省下的硬件费用。

看准生态成熟度再下手
行业里有个不成文的规律:模型越主流,国产卡适配越容易,像ResNet、Bert、Qwen系列这种公开模型,国产卡厂商会主动做优化,但你的模型如果是自己魔改的结构,就得做好长期踩坑的准备。
建议选型时先查三个东西:
- 加速卡官方文档里支持的算子列表,对比你的模型用了哪些算子
- 推理框架(vLLM、Triton)是否有官方适配插件
- 社区里是否有同款芯片的部署案例,尤其是踩坑记录
显存、带宽、批量大小:三个硬指标怎么看
这三个指标决定了加速卡能跑多大模型、每次能处理多少请求,直接对应你的业务量级。
显存容量决定模型上限
模型权重、KV缓存、中间激活值都得塞进显存,比如7B FP16模型权重约14GB,KV缓存至少按输入长度和批量大小预留几个GB,所以选卡时先算账:显存需要大于模型权重加最大批量下的缓存,如果跑128K长上下文,KV缓存会暴涨,T4这种16GB显存基本没戏,得看48GB的L4或者国产同类。
显存带宽决定吞吐天花板
这是个常被忽略的点,A10的显存带宽600GB/s,L4是300GB/s,两者算力差距不大,但带宽低的那款在批量大了以后吞吐会明显下滑,因为推理是访存密集型的,带宽不够时算力只能闲置,用nvidia-smi监控实际利用率,如果算力利用率不到50%,多半是卡在带宽上。
批量大小与延迟的权衡
在线场景下,批量大小和延迟是直接对立的,批量越大,单位成本越低,但每个请求等得更久,实操上建议先用批量1测单请求延迟,然后逐步增加,找到吞吐和延迟的交叉点。这个交叉点就是你的最优工作点,不同加速卡的最优工作点差异很大,必须实测。
实操步骤:从测试到上线的选型流程
选型不是看参数对比表就能决定的,必须走一套可复现的测试流程,以下是我给团队用的标准动作:

- 确定目标模型和业务指标:模型名称、参数量、输入输出长度、最大并发数、P99延迟要求
- 跑通基线:用当前生产环境的技术栈(PyTorch或TensorRT)在一张候选卡上跑通整个推理链路
- 压测吞吐和延迟:用
vLLM或者Triton自带的perf_client工具,分别测批量1、8、16、32下的P50和P99 - 看功耗和温度:用
nvidia-smi或国产卡的管理工具记录满负载功耗,对比电费和散热成本 - 测稳定性和故障恢复:连续跑48小时,观察显存泄漏、算子溢出、断电重启等问题
- 算总成本:采购价除以预估使用年限,加上运维人力,再除以总推理请求数,得到单次推理成本
这套流程跑下来,你自然会得出异构加速卡推理选型思路的最终结论,而不是靠直觉拍板。
异构加速卡推理选型常见问题
问:训练卡可以直接拿来做推理吗?
可以,但不划算,训练卡如A100功耗高,单张就300W以上,推理时算力利用率往往不到20%,建议用专门的推理卡,比如L4、T4,或者国产的推理型加速卡,功耗控制在150W以内就能达到同等的吞吐。
问:GPU和NPU推理性能对比差距到底大不大?
看模型规模和算子复杂度,对于标准CNN或Transformer结构,NPU在相同功耗下能跑出更高吞吐,但延迟不一定优于GPU,如果模型里有动态shape或者自定义算子,NPU的性能可能大幅缩水,甚至跑不起来,简单说,模型结构越规整,NPU优势越大,据公开的行业测试数据,在固定模型下,高端NPU的能效比可达同级GPU的2倍以上,但灵活场景下差距会缩小。
问:国产推理卡的价格差异主要来自哪里?
显存大小和算力规格是主要因素,同等显存下,国产卡比NVIDIA便宜一大截,但最终价格还取决于你买的量级,几十片的单价和上千片完全不同,一些信创项目有集中采购渠道,能拿到更低的折扣,这类信息直接找厂商的行业销售谈,别只看电商标价。
