栏目一 · 模型大小

模型“大小”到底指什么?

常说的 7B、13B、70B 指的是参数量(B = 十亿)。 但参数不等于显存——精度、优化器状态、激活值都会吃内存。本节帮你把这几个量算清楚。

核心概念:参数量、精度、显存

一个模型由大量“参数(权重 + 偏置)”组成。参数越多,理论上能记住/拟合的模式越复杂, 但训练和推理需要的资源也越多。存储这些参数时,每个参数用什么数值精度直接决定占多少空间:

精度每参数占用说明
FP32(单精度)4 字节训练常用,精度高、最占空间
FP16 / BF16(半精度)2 字节推理与混合精度训练常用
INT8(8 位整型)1 字节量化后推理,省空间但略有精度损失
INT4(4 位整型)0.5 字节极致压缩,常用于本地跑大模型
记忆口诀:显存(字节) ≈ 参数量 × 每参数字节数。 例如 7B 模型用 FP16 存权重:7×10⁹ × 2 ≈ 14 GB;用 INT4 量化只剩约 3.5 GB。

参数 → 显存 计算器

输入参数量与精度,实时估算仅权重的显存占用(不含优化器状态与激活)。

🔢 计算器

参数量
—
权重显存
—
约等常见卡
—
提示:实际训练时优化器(如 Adam)约额外占用 12 字节/参数(FP32 权重副本 + 一阶/二阶动量), 显存需求通常是“权重显存 × 多倍”。本计算器只算权重,便于快速对比。

主流模型规模对照(示意)

下列为教学示意值,帮助建立“量级感”,不代表某一版本精确数字。

模型(类别)参数量FP16 权重显存典型用途
ResNet-50(图像)25 M~50 MB图像分类
BERT-Base(NLP)110 M~220 MB文本理解
GPT-2(NLP)1.5 B~3 GB文本生成
LLaMA-2 7B(大模型)7 B~14 GB对话/通用
LLaMA-2 13B13 B~26 GB更强生成
GPT-3(超大模型)175 B~350 GB少样本学习

算力视角:FLOPs 与推理成本

模型大小还决定“算一次”要多少浮点运算。粗略估算:前向一次约 2×参数量 次浮点运算, 训练一个 step(前向+反向)约 6×参数量 次。所以:

训练一个 step 的算力(粗略) FLOPs ≈ 6 × N (N = 参数量)
大模型“贵”的本质:参数量涨 10 倍,算力与显存都要几倍到十几倍增长, 所以工程上才需要量化、蒸馏、分布式训练等手段来“缩小”或“分摊”它。