模型参数规模(7B 里的 7B 是什么)
一句话定义:LLM 的"参数量"指网络中可学习权重(数字)的总数,"7B"即约 70 亿个;它衡量模型规模与容量,但相同参数量的不同模型能力可差很多。
0. 先回答最直接的问题
- B = Billion = 10 亿。7B = 约 70 亿,70B = 约 700 亿,405B = 约 4050 亿。
- 参数(parameter) = 神经网络里那些可学习的数字(权重 weight 和偏置 bias)。模型推理时,就是把输入和这些数字做大量矩阵乘加,得到输出。
- 7B 不是精确的 7,000,000,000,而是"约 70 亿量级"的简称。LLaMA-7B 实际约 66 亿,Qwen-7B 约 77 亿,都叫"7B"。
下面分两个视角讲透。
视角一:数学与数据设计(技术视角)
1.1 参数在数学上是什么
一个 Transformer 语言模型本质是一堆矩阵运算。参数就是这些矩阵里的元素:
- 权重矩阵 $W$:线性变换 $y = Wx + b$ 里的 $W$。
- 偏置 $b$:加在每个输出上的常数(很多现代 LLM 去掉了偏置,只留权重)。
- 归一化参数:如 RMSNorm 里的缩放因子 $g$(每层一两个,量很小)。
参数量 = 所有这些矩阵元素个数之和。
1.2 参数从哪几个部分来(Transformer 结构拆解)
一个 Decoder-only LLM 的参数主要由四块构成:
| 组成 | 参数量(近似) | 说明 |
|---|---|---|
| 词嵌入 Embedding | $V \times d$ | $V$=词表大小,$d$=隐藏维度;每个 token 一个 $d$ 维向量 |
| 每层注意力 Attention | $4 d^2$ | Q/K/V/O 四个投影矩阵,各 $d \times d$ |
| 每层前馈网络 FFN | $\approx 8 d^2$ | 标准 FFN 两层 $d \to 4d \to d$;SwiGLU 三矩阵约等价 |
| 输出头 LM Head | $V \times d$ | 映射回词表概率;常与 Embedding 共享权重(tied) |
其中 $L$ = 层数,$d$ = 隐藏维度,$V$ = 词表大小。
总参数量近似公式(稠密模型,权重共享):
$$N \approx \underbrace{L \cdot 12 d^2}{\text{每层 Attention+FFN}} + \underbrace{V \cdot d}{\text{Embedding/LM Head}}$$
经验法则:参数量主要由 $L \cdot d^2$ 决定,词表嵌入在千亿以下占比不大。
1.3 实例拆解:7B 到底怎么算出来的(以 LLaMA-7B 为例)
LLaMA-7B 配置:$d=4096$,$L=32$,词表 $V=32000$,FFN 中间层 $d_{ff}=11008$(SwiGLU 三矩阵)。
逐层算:
- 注意力:$4 \times 4096^2 \approx 67.1\text{M}$
- FFN(SwiGLU):$3 \times (4096 \times 11008) \approx 135.3\text{M}$
- 每层合计:$\approx 202.4\text{M}$
- 32 层:$32 \times 202.4\text{M} \approx 6.48\text{B}$
- 词嵌入(与输出头共享):$32000 \times 4096 \approx 0.13\text{B}$
- 总计:$\approx 6.6\text{B}$ → 约 7B
这就是"7B"的来历:层数 × 每层参数 + 嵌入,四舍五入到 7B 量级。
换个配置(更大词表、更大 FFN)同样是"7B 级",但具体数字略有出入——这就是不同家"7B"参数不完全相同的原因之一。
1.4 稠密 vs MoE:总参数 ≠ 激活参数
稠密模型(Dense):每个 token 过所有参数。7B 就是 7B。
混合专家模型(MoE, Mixture of Experts):FFN 换成多个"专家",每个 token 只激活其中 top-k 个。于是出现两个数:
| 概念 | 含义 | 例子 |
|---|---|---|
| 总参数(Total) | 所有专家参数之和 | DeepSeek-V3 ≈ 671B |
| 激活参数(Active) | 单个 token 实际用到的 | DeepSeek-V3 ≈ 37B |
其他 MoE 例子:Mixtral 8×7B(总 ≈ 47B,激活 ≈ 13B)、Qwen3 系列也有 MoE 版本。
关键:MoE 模型看"参数规模"必须区分总量与激活量。算力/速度看激活参数,知识容量看总参数。
1.5 这些参数"是怎么出来的"——两步
第一步:设计(人决定的) 工程师根据算力预算 + Scaling Laws,先定架构($L, d, V$ 等),这一步就决定了参数量。算力越多,越敢往大里定。
第二步:训练(机器学出来的)
- 参数初始值随机生成(通常是小高斯噪声),此刻模型什么都不懂。
- 用梯度下降在海量文本上做"预测下一个 token"任务,反复调整这几十亿个数字。
- 训练结束,参数里就"编码"了语言的语法、语义和世界知识。
所以参数值不是人手写的,而是从数据中学出来的;参数量则是人提前定好的"容器大小"。
1.6 为什么参数越来越多
| 原因 | 说明 |
|---|---|
| Scaling Laws | 参数越多,损失越低、能力越强(幂律) |
| 知识容量 | 更多参数能存更多世界知识与模式 |
| 涌现能力 | 某些能力(推理、少样本学习)在大模型才出现 |
| 算力增长 | GPU 显存/算力提升,能训更大模型 |
| MoE 杠杆 | 总参数做大、激活参数做小,用更少算力换更大容量 |
但 Chinchilla 指出:参数和数据要平衡增长,光堆参数而数据不够是"训练不足",性价比低。这也是 Llama 走"中等模型 + 超量数据"高效路线的原因。
视角二:白话讲给普通人
2.1 参数是什么?——"几十亿个小旋钮"
把大模型想象成一台有几十亿个小旋钮的机器。你输入一句话,机器转一转这些旋钮,吐出一个回答。
- 每个"旋钮"就是一个参数,本质就是一个数字(比如 0.37、-1.2)。
- "7B"就是说这台机器有 70 亿个这样的旋钮。
- 训练,就是反复拧这 70 亿个旋钮,让机器在看到大量文章后,能学着"接话"。
2.2 类比:大脑、图书馆、音箱
| 类比 | 对应 |
|---|---|
| 旋钮越多,能调出的"音色"越丰富 | 参数越多,能表达的模式越复杂 |
| 大脑神经元/突触多,能记的、能想的越多 | 参数多 ≈ 容量大(注意:人脑约 860 亿神经元、百万亿突触,远超现 LLM,类比不精确但好理解) |
| 图书馆书架多,能放的书多 | 参数多 ≈ 能装的知识多 |
要点:参数是"容量",不是"智商本身"。书架大不代表书都读过了——还得看训练数据(书)够不够、好不好。
2.3 为什么越来越大?
因为大一点的模型,通常更聪明一点:能记更多知识、推理更稳、理解更细。这有科学规律支撑(Scaling Laws),不是玄学。
但变大要付代价:
- 更贵:训练一次大模型动辄千万到上亿元电费和算力。
- 更慢:用起来推理延迟更高。
- 更耗显存:要更多/更大的显卡才跑得动。
所以不是无脑往大做,而是在够用、能负担、有效益之间找平衡。
2.4 为什么常是 7B / 13B / 70B 这些数?
- 大致按 2 倍往上翻:7B → 13B → 30B → 70B → 405B。
- 这些数贴近显卡显存的整数倍(如一张 80G 卡能装下 7B 的半精度权重),方便部署。
- "7B" 是消费级显卡(单张 24G/48G)能跑起来的"甜点"大小,所以开源社区最热闹。
2.5 不同家的"7B"有啥区别?
同样叫 7B,能力可能差一截。 因为参数量只是"容器大小",真正决定强弱的是往里装了什么:
| 差异点 | 影响 |
|---|---|
| 架构 | 稠密 vs MoE;注意力用 GQA/MQA;FFN 大小不同 |
| 词表大小 | Qwen 约 15 万 vs LLaMA 约 3.2 万,影响多语言/中文表现 |
| 训练数据 | 量、质、语言配比、是否含代码/数学 |
| 训练配方 | 预训练后 SFT/RLHF 的数据与对齐方式 |
| 训练充分度 | 同参数下数据越多越"训透",越强(Chinchilla) |
所以:
- Qwen-7B、LLaMA-7B、GLM-7B、DeepSeek-7B 参数量相近,但中文、代码、推理各有强弱。
- 参数多 ≠ 一定强:一个训透的 7B 可能吊打一个没训够的 30B。
- 闭源模型(GPT-4/5、Claude、Gemini)参数量大多不公开,且常用 MoE,比的不只是"数字大小"。
2.6 一句话总结(白话版)
7B 就是"这台模型有 70 亿个可调的小数字"。数字越多,模型容量越大、可能越聪明,但也更贵更慢;同样 7B 的不同模型,因为训练数据和设计不同,聪明程度不一样——参数量是"排量",训练质量是"调校"。
3. 主流模型参数量速查(2026 视角)
| 模型 | 参数量 | 类型 |
|---|---|---|
| LLaMA-3 8B / 70B / 405B | 8B / 70B / 405B | 稠密 |
| Qwen3 系列 | 0.6B ~ 235B(含 MoE:总 235B / 激活 22B) | 稠密 + MoE |
| DeepSeek-V3 | 总 671B / 激活 37B | MoE |
| GLM-4 / GLM-4.5 | 9B ~ 355B(含 MoE 版) | 稠密 + MoE |
| Mixtral 8×7B | 总 47B / 激活 13B | MoE |
| GPT-4 / Claude / Gemini | 未公开(推测为超大规模 MoE) | MoE |
4. 常见误区
- "参数 = 神经元":错。参数是权重/连接,不是神经元数;一个神经元带多个权重。
- "参数越多一定越好":错。要配足够数据与算力,否则"大而欠训"。
- "MoE 的 8×7B = 56B":错。专家结构共享,总量约 47B,激活约 13B。
- "7B 就是恰好 70 亿":错。是约数,各家 7B 实际从 66 亿到 77 亿不等。
- "参数量大的模型一定更强":错。训练质量、数据、对齐都很关键,小而精可胜大而糙。
5. 学习要点
- 参数 = 网络里可学习的权重数字;7B ≈ 70 亿个,是"容器大小"非"智商本身"。
- 技术上:参数量 $\approx L \cdot 12d^2 + Vd$,由层数、隐藏维度、词表决定;7B 是这么算出来的。
- MoE 必须区分总参数与激活参数:算力看激活,容量看总量。
- 参数值随机初始化后由训练学出来,参数量则是人提前设计。
- 参数增长因 Scaling Laws + 容量需求,但 Chinchilla 要求与数据平衡。
- 同参数量不同模型能力可差很多——排量看参数,调校看训练。
6. 参考资料
- Kaplan et al., "Scaling Laws for Neural Language Models"(2020)
- Hoffmann et al., "Training Compute-Optimal Large Language Models"(Chinchilla, 2022)
- Touvron et al., "LLaMA: Open and Efficient Foundation Language Models"(7B 架构实例)
- Shazeer et al., "Outrageously Large Neural Networks: The Sparsely-Gated MoE Layer"
- Fedus et al., "Switch Transformers"(MoE 参数与激活)
- 本知识库 05-Scaling-Laws.md(参数量与损失的关系)
评论
评论加载中…