模型参数规模(7B 里的 7B 是什么)

一句话定义:LLM 的"参数量"指网络中可学习权重(数字)的总数,"7B"即约 70 亿个;它衡量模型规模与容量,但相同参数量的不同模型能力可差很多。

0. 先回答最直接的问题

  • B = Billion = 10 亿。7B = 约 70 亿,70B = 约 700 亿,405B = 约 4050 亿。
  • 参数(parameter) = 神经网络里那些可学习的数字(权重 weight 和偏置 bias)。模型推理时,就是把输入和这些数字做大量矩阵乘加,得到输出。
  • 7B 不是精确的 7,000,000,000,而是"约 70 亿量级"的简称。LLaMA-7B 实际约 66 亿,Qwen-7B 约 77 亿,都叫"7B"。

下面分两个视角讲透。


视角一:数学与数据设计(技术视角)

1.1 参数在数学上是什么

一个 Transformer 语言模型本质是一堆矩阵运算。参数就是这些矩阵里的元素:

  • 权重矩阵 $W$:线性变换 $y = Wx + b$ 里的 $W$。
  • 偏置 $b$:加在每个输出上的常数(很多现代 LLM 去掉了偏置,只留权重)。
  • 归一化参数:如 RMSNorm 里的缩放因子 $g$(每层一两个,量很小)。

参数量 = 所有这些矩阵元素个数之和。

1.2 参数从哪几个部分来(Transformer 结构拆解)

一个 Decoder-only LLM 的参数主要由四块构成:

组成 参数量(近似) 说明
词嵌入 Embedding $V \times d$ $V$=词表大小,$d$=隐藏维度;每个 token 一个 $d$ 维向量
每层注意力 Attention $4 d^2$ Q/K/V/O 四个投影矩阵,各 $d \times d$
每层前馈网络 FFN $\approx 8 d^2$ 标准 FFN 两层 $d \to 4d \to d$;SwiGLU 三矩阵约等价
输出头 LM Head $V \times d$ 映射回词表概率;常与 Embedding 共享权重(tied)

其中 $L$ = 层数,$d$ = 隐藏维度,$V$ = 词表大小。

总参数量近似公式(稠密模型,权重共享):

$$N \approx \underbrace{L \cdot 12 d^2}{\text{每层 Attention+FFN}} + \underbrace{V \cdot d}{\text{Embedding/LM Head}}$$

经验法则:参数量主要由 $L \cdot d^2$ 决定,词表嵌入在千亿以下占比不大。

1.3 实例拆解:7B 到底怎么算出来的(以 LLaMA-7B 为例)

LLaMA-7B 配置:$d=4096$,$L=32$,词表 $V=32000$,FFN 中间层 $d_{ff}=11008$(SwiGLU 三矩阵)。

逐层算:

  • 注意力:$4 \times 4096^2 \approx 67.1\text{M}$
  • FFN(SwiGLU):$3 \times (4096 \times 11008) \approx 135.3\text{M}$
  • 每层合计:$\approx 202.4\text{M}$
  • 32 层:$32 \times 202.4\text{M} \approx 6.48\text{B}$
  • 词嵌入(与输出头共享):$32000 \times 4096 \approx 0.13\text{B}$
  • 总计:$\approx 6.6\text{B}$ → 约 7B

这就是"7B"的来历:层数 × 每层参数 + 嵌入,四舍五入到 7B 量级。

换个配置(更大词表、更大 FFN)同样是"7B 级",但具体数字略有出入——这就是不同家"7B"参数不完全相同的原因之一。

1.4 稠密 vs MoE:总参数 ≠ 激活参数

稠密模型(Dense):每个 token 过所有参数。7B 就是 7B。

混合专家模型(MoE, Mixture of Experts):FFN 换成多个"专家",每个 token 只激活其中 top-k 个。于是出现两个数:

概念 含义 例子
总参数(Total) 所有专家参数之和 DeepSeek-V3 ≈ 671B
激活参数(Active) 单个 token 实际用到的 DeepSeek-V3 ≈ 37B

其他 MoE 例子:Mixtral 8×7B(总 ≈ 47B,激活 ≈ 13B)、Qwen3 系列也有 MoE 版本。

关键:MoE 模型看"参数规模"必须区分总量与激活量。算力/速度看激活参数,知识容量看总参数

1.5 这些参数"是怎么出来的"——两步

第一步:设计(人决定的) 工程师根据算力预算 + Scaling Laws,先定架构($L, d, V$ 等),这一步就决定了参数量。算力越多,越敢往大里定。

第二步:训练(机器学出来的)

  • 参数初始值随机生成(通常是小高斯噪声),此刻模型什么都不懂。
  • 梯度下降在海量文本上做"预测下一个 token"任务,反复调整这几十亿个数字。
  • 训练结束,参数里就"编码"了语言的语法、语义和世界知识。

所以参数值不是人手写的,而是从数据中学出来的;参数量则是人提前定好的"容器大小"

1.6 为什么参数越来越多

原因 说明
Scaling Laws 参数越多,损失越低、能力越强(幂律)
知识容量 更多参数能存更多世界知识与模式
涌现能力 某些能力(推理、少样本学习)在大模型才出现
算力增长 GPU 显存/算力提升,能训更大模型
MoE 杠杆 总参数做大、激活参数做小,用更少算力换更大容量

但 Chinchilla 指出:参数和数据要平衡增长,光堆参数而数据不够是"训练不足",性价比低。这也是 Llama 走"中等模型 + 超量数据"高效路线的原因。


视角二:白话讲给普通人

2.1 参数是什么?——"几十亿个小旋钮"

把大模型想象成一台有几十亿个小旋钮的机器。你输入一句话,机器转一转这些旋钮,吐出一个回答。

  • 每个"旋钮"就是一个参数,本质就是一个数字(比如 0.37、-1.2)。
  • "7B"就是说这台机器有 70 亿个这样的旋钮。
  • 训练,就是反复拧这 70 亿个旋钮,让机器在看到大量文章后,能学着"接话"。

2.2 类比:大脑、图书馆、音箱

类比 对应
旋钮越多,能调出的"音色"越丰富 参数越多,能表达的模式越复杂
大脑神经元/突触多,能记的、能想的越多 参数多 ≈ 容量大(注意:人脑约 860 亿神经元、百万亿突触,远超现 LLM,类比不精确但好理解)
图书馆书架多,能放的书多 参数多 ≈ 能装的知识多

要点:参数是"容量",不是"智商本身"。书架大不代表书都读过了——还得看训练数据(书)够不够、好不好。

2.3 为什么越来越大?

因为大一点的模型,通常更聪明一点:能记更多知识、推理更稳、理解更细。这有科学规律支撑(Scaling Laws),不是玄学。

但变大要付代价:

  • 更贵:训练一次大模型动辄千万到上亿元电费和算力。
  • 更慢:用起来推理延迟更高。
  • 更耗显存:要更多/更大的显卡才跑得动。

所以不是无脑往大做,而是在够用、能负担、有效益之间找平衡。

2.4 为什么常是 7B / 13B / 70B 这些数?

  • 大致按 2 倍往上翻:7B → 13B → 30B → 70B → 405B。
  • 这些数贴近显卡显存的整数倍(如一张 80G 卡能装下 7B 的半精度权重),方便部署。
  • "7B" 是消费级显卡(单张 24G/48G)能跑起来的"甜点"大小,所以开源社区最热闹。

2.5 不同家的"7B"有啥区别?

同样叫 7B,能力可能差一截。 因为参数量只是"容器大小",真正决定强弱的是往里装了什么:

差异点 影响
架构 稠密 vs MoE;注意力用 GQA/MQA;FFN 大小不同
词表大小 Qwen 约 15 万 vs LLaMA 约 3.2 万,影响多语言/中文表现
训练数据 量、质、语言配比、是否含代码/数学
训练配方 预训练后 SFT/RLHF 的数据与对齐方式
训练充分度 同参数下数据越多越"训透",越强(Chinchilla)

所以:

  • Qwen-7B、LLaMA-7B、GLM-7B、DeepSeek-7B 参数量相近,但中文、代码、推理各有强弱。
  • 参数多 ≠ 一定强:一个训透的 7B 可能吊打一个没训够的 30B。
  • 闭源模型(GPT-4/5、Claude、Gemini)参数量大多不公开,且常用 MoE,比的不只是"数字大小"。

2.6 一句话总结(白话版)

7B 就是"这台模型有 70 亿个可调的小数字"。数字越多,模型容量越大、可能越聪明,但也更贵更慢;同样 7B 的不同模型,因为训练数据和设计不同,聪明程度不一样——参数量是"排量",训练质量是"调校"


3. 主流模型参数量速查(2026 视角)

模型 参数量 类型
LLaMA-3 8B / 70B / 405B 8B / 70B / 405B 稠密
Qwen3 系列 0.6B ~ 235B(含 MoE:总 235B / 激活 22B) 稠密 + MoE
DeepSeek-V3 总 671B / 激活 37B MoE
GLM-4 / GLM-4.5 9B ~ 355B(含 MoE 版) 稠密 + MoE
Mixtral 8×7B 总 47B / 激活 13B MoE
GPT-4 / Claude / Gemini 未公开(推测为超大规模 MoE) MoE

4. 常见误区

  • "参数 = 神经元":错。参数是权重/连接,不是神经元数;一个神经元带多个权重。
  • "参数越多一定越好":错。要配足够数据与算力,否则"大而欠训"。
  • "MoE 的 8×7B = 56B":错。专家结构共享,总量约 47B,激活约 13B。
  • "7B 就是恰好 70 亿":错。是约数,各家 7B 实际从 66 亿到 77 亿不等。
  • "参数量大的模型一定更强":错。训练质量、数据、对齐都很关键,小而精可胜大而糙。

5. 学习要点

  • 参数 = 网络里可学习的权重数字;7B ≈ 70 亿个,是"容器大小"非"智商本身"。
  • 技术上:参数量 $\approx L \cdot 12d^2 + Vd$,由层数、隐藏维度、词表决定;7B 是这么算出来的。
  • MoE 必须区分总参数激活参数:算力看激活,容量看总量。
  • 参数值随机初始化后由训练学出来,参数量则是人提前设计。
  • 参数增长因 Scaling Laws + 容量需求,但 Chinchilla 要求与数据平衡。
  • 同参数量不同模型能力可差很多——排量看参数,调校看训练

6. 参考资料

  • Kaplan et al., "Scaling Laws for Neural Language Models"(2020)
  • Hoffmann et al., "Training Compute-Optimal Large Language Models"(Chinchilla, 2022)
  • Touvron et al., "LLaMA: Open and Efficient Foundation Language Models"(7B 架构实例)
  • Shazeer et al., "Outrageously Large Neural Networks: The Sparsely-Gated MoE Layer"
  • Fedus et al., "Switch Transformers"(MoE 参数与激活)
  • 本知识库 05-Scaling-Laws.md(参数量与损失的关系)