私有化部署想实现数据不出内网,算力配置的核心思路是“按模型规模算显存、按并发量算吞吐、按业务场景定推理卡”,绝不能一上来就堆GPU,而是先算清楚模型参数量、量化精度、单卡显存和并发请求数,再决定用几块显卡、什么型号的服务器,最后用本地推理框架把模型灌进去验证。
私有化部署怎么配算力才不浪费钱
很多客户第一次咨询“数据不出内网怎么配算力”时,第一句话往往是“我要上大模型,给我配个8卡A100”,这种思路在私有化部署场景里大概率会翻车,内网部署的核心约束是数据链路不出机房,这意味着你不需要考虑公网带宽、云厂商API限流,但必须自己兜底算力集群的稳定性、可用性和扩展性。
先算显存,再选显卡
显存是私有化部署算力配置的第一道门槛,以目前主流的开源大模型为例,7B参数模型用FP16精度加载,权重占显存约14GB,加上KV Cache和中间激活值,单卡推理至少需要24GB显存;13B模型需要40GB以上;70B模型则要140GB以上,多卡并行跑基本是必然。
选显卡时不要只看显存容量,显存带宽和算力利用率同样关键,同样40GB显存,A100和L40S的推理吞吐差距可能达到30%-50%,行业共识认为,内网部署场景下,性价比最高的卡型集中在48GB显存档位,既能覆盖14B模型单卡推理,又能通过张量并行跑70B模型。
按并发量决定卡数
算力配置不是算一次跑多少个Token,而是算每秒能扛多少并发请求,一个实用公式是:
所需显存总量 = 模型权重显存 + 并发请求数 × 单请求KV Cache显存
举例说明:14B模型用FP16精度,单卡推理占用约30GB显存(含KV Cache),如果业务要求50路并发,单请求KV Cache占用约1.2GB,那么总显存需求就是 30 + 50 × 1.2 = 90GB。三张48GB显卡或两张80GB显卡都能满足需求,但前者在推理引擎调度上更灵活。
内网私有化部署和公网云服务的最大区别在于访问模式更可控,企业内部系统的峰值往往集中在工作日的9:00-11:00和14:00-16:00,平均负载通常只有峰值的20%-30%,这意味着算力配置可以按峰值需求上浮30%,不必预留过多空闲资源,不过如果老板明确要求“双十一大促必须扛住”,那就另当别论了。
内网部署大模型需要什么显卡配置
很多人把“显卡配置”等同于“显卡型号”,其实从部署角度,需要关注三个维度:单卡显存、卡间互联、散热功耗,这三个维度直接决定了你能跑多大的模型,以及跑起来是否稳定。
单卡显存与模型规模的对应关系

- 7B-14B模型:单张24GB显卡(如RTX 4090、L4)即可跑量化版本,FP16精度则建议上48GB卡
- 32B-70B模型:需要2-4张80GB显卡做张量并行,或者用8张48GB卡做流水线并行
- 百亿参数以上模型:建议直接上8卡A100/H800整机,否则通信开销会吃掉大部分性能
GPU服务器怎么选,本质上是一个卡间互联带宽的问题,8卡A100整机的NVLink带宽高达600GB/s,而两张PCIe 4090之间的通信带宽只有约64GB/s,一旦模型需要跨卡并行,PCIe互联的性能瓶颈会非常明显,如果你的模型参数超过单卡显存的一半,就别用普通PCIE拓扑的机器硬撑。
显存带宽与推理速度的关系
同样的模型,为什么内网部署时延迟忽高忽低?八成出在显存带宽上,推理过程中,模型权重需要反复从显存读取,显存带宽直接决定了每秒钟能处理多少Token,以FP16精度跑70B模型为例,理论计算量约为140GFLOPs,需要的显存带宽大约在2TB/s以上,A100 80GB的显存带宽是2TB/s,刚好能喂饱算力,如果换成带宽只有1TB/s的卡,生成速度会打对折,用户体验直接从“流畅”变“卡顿”。
内网私有化部署选择显卡时,算力与带宽的匹配度比峰值算力更重要,一位做制造业知识库的客户,用两张RTX 4090替换了原来的4张A10,生成速度反而提升了40%,就是因为4090的显存带宽是A10的2.3倍。
推理场景与训练场景的分层配置
大多数私有化部署场景其实是推理,而不是训练,如果只做推理,没必要上A100/H100这类训练卡L20、L40S、A40这类推理卡的性价比更高,具体区别如下:
| 卡型 | 单卡显存 | 适合场景 | 说明 |
|---|---|---|---|
| L4 | 24GB | 轻量推理 | 适合14B以下模型的低并发场景 |
| L20 | 48GB | 中型推理 | 支持主流开源模型的量化推理 |
| L40S | 48GB | 高并发推理 | RTX 4090同款核心,功耗更低 |
| A100/H800 | 80GB | 训练+大模型推理 | 适合70B以上模型或微调场景 |
| 国产卡(如华为昇腾910B) | 64GB | 信创合规 | 满足国产化替代要求 |
数据不出内网的算力部署实操步骤
数据不出内网不是一句口号,它要求计算、存储、网络都在内网闭环,下面是一套经过多个项目验证的实操路径。
第一步:明确量化精度
先问自己一个问题:业务能容忍多大的精度损失?如果只是做文本分类、信息抽取,4-bit量化完全够用,显存占用直降

75%,如果做数学推理、代码生成,建议保留FP16或BF16精度,量化不仅改变显存占用,还会影响生成质量和速度,这一步决定了后面所有硬件选型。
第二步:搭好推理框架
内网部署推荐使用vLLM或TensorRT-LLM作为推理引擎,二者都能充分发挥多卡并行能力,具体操作路径:
- 准备一台GPU服务器,安装Ubuntu 22.04或国产化操作系统
- 安装NVIDIA驱动和CUDA 12.x(如果使用国产卡则安装对应CANN环境)
- 通过Docker拉取vLLM镜像,或使用
pip install vllm直接安装 - 将模型文件下载到内网存储,修改启动脚本中的模型路径
- 用
python -m vllm.entrypoints.openai.api_server启动服务,绑定内网IP
第三步:分场景验证算力
内网环境的网络拓扑和公网差异很大,需要在真实内网环境中压测,而不是只看显卡参数,压测工具建议用Locust(开源的负载测试工具),写作一个简单的压测脚本向本地API接口发送并发请求,观察每秒查询率、延迟和显存占用,实操中常见的结果是:14B模型+单张48GB卡,在32路并发下每秒查询率约为15-25,延迟约200-400毫秒,如果达不到这个基线水平,优先检查FP16是否被自动切换成FP32,或者KV Cache是否被默认调低。
私有化大模型算力成本控制
成本是私有化部署绕不开的话题,数据不出内网虽然省掉了API调用费,但硬件采购、机房电费、运维人力都是真金白银。算力成本的真正天花板不在购买环节,而在使用环节。
买卡贵,闲置更贵
一张48GB的推理卡,空载功耗仍有80-120瓦,一年电费约700-1000元,十张卡就是一年上万的电费,如果利用率长期低于30%,相当于每天都在烧钱,因此内网部署必须建立算力资源监控机制,实时追踪GPU利用率和显存占用,推荐使用Prometheus+Grafana搭建监控面板,或者直接用nvidia-smi dmon命令定时采集数据。
用弹性调度替代盲目扩容
很多业务场景的算力需求是波动的,比如行政部门的AI问答系统,白天并发高,晚上几乎没人用;财务部门的月结报表生成,只在月底产生算力峰值。合理的做法是使用Kubernetes+KubeFlow搭建算力调度平台,让不同部门共享同一批GPU,按优先级动态分配资源,这样做的效果是:同样10张卡,利用率能从30%提升到70%以上,部分国产GPU服务器也自带虚拟化调度方案,如昇腾的MindX,配置起来更省事。
模型蒸馏是终极省卡方案

近年来,不少企业发现一个省钱路径:用大模型蒸馏小模型,用70B大模型生成领域数据,微调一个14B的小模型,在垂直场景下的效果几乎无损,但显存需求直降80%,这种做法特别适合数据不出内网的客户大模型在内网生成样本,小模型在内网学习,整个过程完全不依赖外部算力。
未来场景的算力演进
私有化部署的算力规划不能只看今天的需求,还要给未来留出余地,一个常见误区是:配了一台8卡GPU服务器,觉得“一步到位了”,结果半年后业务量翻倍,整机扩展不上去了。
扩展策略一:算力池化,通过vGPU或MIG技术把物理GPU切成多份,按需分配,A100支持最多7个MIG实例,可以将不同业务隔离在同一物理卡上,既能提高利用率,又能避免业务之间互相抢占资源。
扩展策略二:异构统筹,传统架构是每台服务器跑自己的模型,无法共享算力,如果业务复杂,建议搭建算力中台,统一管理不同型号的GPU,向外提供标准推理接口,这样新业务接入时不需要关心底层卡型差异,直接调用算力中台的API即可。
扩展策略三:国产化适配,很多数据不出内网的企业同时面临信创合规要求,目前华为昇腾、寒武纪、海光等国产卡已经能兼容主流开源模型,但推理引擎的适配程度存在差异,选购时优先看目标模型是否已有适配案例,并在下单前申请测试机完成验证。
常见问题
内网部署大模型最省钱的方案是什么?
如果模型在14B以下且并发量较小,一张二手或渠道价的RTX 4090 24GB即可胜任,配合4-bit量化和vLLM推理引擎,总硬件投入控制在2万元以内,如果预算允许,加点钱上48GB的L20或国产昇腾910B,能覆盖未来18个月的模型升级需求。
数据不出内网对算力配置有什么特殊要求?
核心要求是所有计算过程必须在内网完成,这意味着模型权重、推理服务、向量数据库、对象存储都必须部署在同一个内网环境中,如果模型权重存储在公有云,即使推理在内网,数据链路已存在出网行为,就不满足合规要求,企业应使用内网对象存储(如MinIO)存放模型文件,以保障模型文件全生命周期不出网。
内网GPU服务器需要多大带宽?
数据不出内网的场景全部走内网传输,带宽需求取决于并发请求量和模型平均Token输出长度,大多数企业内部AI应用以文本交互为主,万兆内网(10GbE)已能支撑上百路并发,如果涉及多卡并行推理,建议直接用NVLink互联的整机,避免用RoCE网络做张量并行,否则网络会成为瓶颈。