核心概念:参数量、精度、显存
一个模型由大量“参数(权重 + 偏置)”组成。参数越多,理论上能记住/拟合的模式越复杂, 但训练和推理需要的资源也越多。存储这些参数时,每个参数用什么数值精度直接决定占多少空间:
| 精度 | 每参数占用 | 说明 |
|---|---|---|
| FP32(单精度) | 4 字节 | 训练常用,精度高、最占空间 |
| FP16 / BF16(半精度) | 2 字节 | 推理与混合精度训练常用 |
| INT8(8 位整型) | 1 字节 | 量化后推理,省空间但略有精度损失 |
| INT4(4 位整型) | 0.5 字节 | 极致压缩,常用于本地跑大模型 |
记忆口诀:显存(字节) ≈ 参数量 × 每参数字节数。
例如 7B 模型用 FP16 存权重:7×10⁹ × 2 ≈ 14 GB;用 INT4 量化只剩约 3.5 GB。
参数 → 显存 计算器
输入参数量与精度,实时估算仅权重的显存占用(不含优化器状态与激活)。
🔢 计算器
参数量
—
权重显存
—
约等常见卡
—
提示:实际训练时优化器(如 Adam)约额外占用 12 字节/参数(FP32 权重副本 + 一阶/二阶动量),
显存需求通常是“权重显存 × 多倍”。本计算器只算权重,便于快速对比。
主流模型规模对照(示意)
下列为教学示意值,帮助建立“量级感”,不代表某一版本精确数字。
| 模型(类别) | 参数量 | FP16 权重显存 | 典型用途 |
|---|---|---|---|
| ResNet-50(图像) | 25 M | ~50 MB | 图像分类 |
| BERT-Base(NLP) | 110 M | ~220 MB | 文本理解 |
| GPT-2(NLP) | 1.5 B | ~3 GB | 文本生成 |
| LLaMA-2 7B(大模型) | 7 B | ~14 GB | 对话/通用 |
| LLaMA-2 13B | 13 B | ~26 GB | 更强生成 |
| GPT-3(超大模型) | 175 B | ~350 GB | 少样本学习 |
算力视角:FLOPs 与推理成本
模型大小还决定“算一次”要多少浮点运算。粗略估算:前向一次约 2×参数量 次浮点运算, 训练一个 step(前向+反向)约 6×参数量 次。所以:
训练一个 step 的算力(粗略)
FLOPs ≈ 6 × N (N = 参数量)
大模型“贵”的本质:参数量涨 10 倍,算力与显存都要几倍到十几倍增长,
所以工程上才需要量化、蒸馏、分布式训练等手段来“缩小”或“分摊”它。