模型显存需求没有固定值,核心公式是“参数量 × 精度字节数”,推理和微调再乘上不同系数,本文直接用7B/13B/72B三个档位给出具体配置答案。
参数量如何决定显存底数
大模型的“体重”用参数量衡量,单位是B(Billion,十亿),7B代表70亿参数,130亿参数的模型就叫13B,参数量是显存的第一位变量,模型文件装进显存,每1B参数至少要占一个“容器”,容器大小由精度格式决定。
| 精度格式 | 每个参数占字节数 | 7B模型基础显存 | 13B基础显存 | 72B基础显存 |
|---|---|---|---|---|
| FP32(单精度) | 4字节 | 28GB | 52GB | 288GB |
| FP16/BF16(半精度) | 2字节 | 14GB | 26GB | 144GB |
| INT8(8位量化) | 1字节 | 7GB | 13GB | 72GB |
| INT4(4位量化) | 5字节 | 5GB | 5GB | 36GB |
这组数据等价于你拿模型文件右键看属性,文件多大,显存底数就多大,装进去不等于能跑,推理时还有额外开销,训练时开销呈倍数膨胀。
推理场景:显存配置计算器
推理是模型“回答问题”的过程,显存需求相对温和,多数情况下的配置公式:
推理显存 = 模型权重 + KV Cache + 计算缓冲
KV Cache是隐藏的大头
模型处理长文本时,每生成一个token都要重新计算之前所有token的注意力值,KV Cache是把中间结果存下来避免重复计算,上下文越长,KV Cache越大,以7B模型为例,FP16权重占14GB,处理4096长度上下文时KV Cache大约多占8GB,总显存直奔22GB。
更直观的算法:推理显存通常是模型权重的1.2到1.4倍,7B模型FP16推理,乘以1.4得到19.6GB,单张24GB的RTX 4090够用,13B模型FP16权重26GB,乘以1.4得到36.4GB,单卡必须上48GB的A6000或A800,72B模型用FP16想本地部署,基础就要144GB,单卡方案基本不现实,需要多卡并行或强量化。
7B模型需要多少显存:按用途给答案
纯聊天场景,7B模型INT4量化后权重仅3.5GB,加上KV Cache和缓冲,8GB显存就是及格线,16GB的笔记本显卡跑起来比较舒适,如果想在本地跑72B模型,INT4量化后权重36GB,两张4090拼接或一张A100 80G勉强能推,但速度容易让人着急。

行业共识对推理场景的硬件盘点是:模型推理不吃算力上限,吃显存容量,批量跑或并发高才需要更好的卡,个人玩家用16GB以上显卡基本覆盖所有可下载模型的推理需求。
训练与微调:显存需求翻倍的真实原因
训练比推理“重”得多,同样是7B模型,推理15GB就能运行,全参数微调至少要60GB,差距来自四份“作业”同时驻留显存。
四件套:参数、梯度、优化器、激活值
- 参数(权重)本身:FP16下7B模型占14GB
- 梯度:和参数同尺寸,再占14GB
- 优化器状态:AdamW优化器每个参数保存动量变量和方差变量,FP32格式下是原来的8倍,即14GB × 4 = 56GB?这里换算法:7B参数FP32单精度的量是28GB,AdamW保存两份,共56GB
- 激活值动态增长:训练时每层的中间结果都要留到反向传播使用,batch size越大,激活值越大
粗算下来,全参数训练显存大约是参数量的16到20倍,7B模型想全参训练,至少准备120GB显存,单卡方案只有H100 80G或A100 80G拼多卡,这就是为什么大模型训练几乎只能在云上跑,消费级显卡的24GB完全是杯水车薪。
大模型微调显存不够怎么办:LoRA是性价比答案
全参训练没戏,退一步用参数高效微调,LoRA冻结原模型权重,只训练额外插入的小矩阵,同样7B模型,LoRA只需额外训练0.1%到1%的参数,显存大头从激活值变为模型权重和梯度。
实操来看,7B模型用LoRA做单卡微调,24GB显卡刚好够用,12GB显存需要配合梯度累积和混合精度才能跑,LoRA的参数要是低于0.5%,显存压力能降到原来的四分之一,想让消费级显卡顺畅微调,还有几个实操选项:
- 开启梯度检查点,牺牲重算时间换取少存约一半激活值
- 限制序列长度到1024或2048,显著压缩激活值开销
- 使用8位AdamW优化器,优化器状态直接减半
- batch size降到1,用梯度累积补偿,显存压力再降一档
实操步骤:算出你的显存配置
不借助跑代码,五分钟手算出该买多大显存。
第一步:确定模型加载方式
你要用原版精度跑,还是量化后跑,家用的RTX 3060 12GB,跑原版7B很悬,量化到INT4反而有富余,商用环境需要高精度输出,尽量不上量化,显存就按FP16算。
第二步:代入场景系数

- 单轮短对话:系数1.2,7B约17GB,选24GB卡
- 长文本对话(超过8K上下文):系数1.6,7B约22GB,选24GB卡保险
- 长文本高频并发:系数2.0起步,7B约28GB,必须上40GB以上卡
- 微调(LoRA):系数4到6,7B控在60GB以内,单张A6000或两张4090比较稳
- 微调(全参数):系数16到20,7B至少120GB,计划多卡或直接租云服务
第三步:在PyTorch中快速验证
通过一行代码可以拿到模型的精确参数占用,环境里有PyTorch时,加载模型后执行:
from transformers import AutoModelForCausalLM
model = AutoModelForCausalLM.from_pretrained("meta-llama/Llama-3.2-7B")
print(model.get_memory_footprint())
这会打印出模型权重Footprint,单位为字节,除以1024的三次方换算成GB,然后用nvidia-smi观察实际运行显存,把推理时的-KV Cache开销和训练时的梯度开销一并加到你的估算里。
按预算和任务选择显存规格
推理为主的显存配置表
| 模型档位 | 最低建议显存 | 推荐显卡 | 适用场景 |
|---|---|---|---|
| 5B-4B量化 | 6-8GB | RTX 3060 8G / 4060 | 轻度对话,代码补全 |
| 7B-9B原版 | 16-24GB | RTX 4090 / 3090 24G | 通用助手,长文本摘要 |
| 13B-14B量化或原版 | 16-24GB | RTX 4090 / 双卡3090 | 更高推理质量,少批量推理 |
| 13B-14B原版 | 40-48GB | A6000 / A40 | 大批量推理,商用部署 |
| 72B量化 | 40-80GB | A100 80G / 双4090拼接 | 接近闭源模型效果的自部署 |
本地部署大模型显卡推荐这个需求在各大硬件社区非常活跃,近两年的热门方案里,24GB的二手3090是高性价比之选,能覆盖多数用户对7B到13B模型的推理预期。
微调和训练为主的显存配置表
微调是比推理高一维度的需求,做LoRA微调和全量微调完全是两套预算,显存的配置逻辑从“能跑起来”变为“能跑得稳”。
| 任务类型 | 模型档位 | 建议显存 | 配置方式 |
|---|---|---|---|
| LoRA微调 | 7B | 24-48GB | 一张4090较紧张,A6000舒适 |
| LoRA微调 | 13B | 48-80GB | 双卡4090或A800/A100 |
| LoRA微调 | 72B | 160GB以上 | 多节点多卡协同 |
| 全参微调 | 7B | 120GB以上 | 2张A100或4张4090 |
| 全参微调 | 13B | 240GB以上 | 4张A100或云租用 |
在显存规划这件事上,“小马拉大车”的失误很常见,一位技术社区博主分享过,用单张3090硬跑13B模型的LoRA微调,结果OOM报错后反复调参两天,最后切到7B模型跑通,才知道选型第一,参数第二。
显存规划的时间窗口
单卡跑大模型会越来越吃力,但显存本身的成本在快速下滑,2024年上半年24GB显卡还在万元档,到2026年二手市场明显回落,显存的配置要留出30%冗余空间,用于模型升级、上下文长度变化和量化到更高精度的回退空间。
租用云GPU是按小时计费的弹性选择,需要高配置训练时,按月租A100 80G或H100是行业共识的省心模式,成本通常比自购设备低,尤其在北上广深机房托管价格明显高于自建服务器时,云租赁方案在总拥有成本上更优,短期跑通验证选按量付费,长期稳定训练选包月或包年。
常见问答
7B模型需要多少显存才能真正流畅运行不卡顿?
生成单个token时远小于满负荷,卡顿主要来自上下文变长和batch size变大,本地单机对话场景,7B模型原版FP16配合24GB显存能流畅处理8K以内的上下文;16GB显存建议用INT4量化,量化让位精度,换取速度优势,这是所有本地部署方案的共同取舍。
模型参数量和显存的换算公式还有哪些实际修正项?
公式之外的变量主要是注意力机制的序列长度和吞吐量要求,同等参数量下,支持128K上下文的模型比4K版本的KV Cache高出约30倍,批处理场景下,batch size每加一,显存近似增加一个单序列推理的全部需求,量化的修正项最直接:从FP16降到INT4,权重显存减75%,KV Cache不改的情况下,整体占用减半以上。
单张A100 80G能跑多少参数模型?
A100 80G的显存天花板,能跑FP16的13B-14B模型做推理和LoRA微调,能跑INT4量化的72B模型推理,全参数微调7B模型要额外叠加梯度占用的优化器开销,80G是及格线但接近上限,用LoRA做7B全参模型微调,A100 80G的体验最为安全,显存占用约在50GB到62GB之间波动。
