Transformer 解剖:从 Attention 到推理系统

第 11 章 Scaling Laws:Chinchilla 法则与算力配比

作者 杨艺韬 · 5,878 字 · 发布于 · 更新于

第二部分到第四部分我们把 Transformer 的「单台机器版」彻底拆开了。这一章升级视角——怎么把它训到 100B、1T 参数?

「大」不是简单放大。把 7B 模型的代码和配置直接乘 100 倍训成 700B,结果很可能是:训不动(loss 不降)、训不收敛(spike 频发),或者算力花出去了却远没换来应有的提升。从 7B 到 700B 之间隔着的不是工程量,而是对「N、D、C 三者怎么配比」的科学理解。

这门科学叫 Scaling Laws——研究模型规模 N、训练数据量 D、训练算力 C 与模型 loss 之间的定量关系。它从 2020 年 Kaplan 等人提出,到 2022 年 DeepMind 的 Chinchilla 反转,再到今天 Llama 时代的 over-training 取舍,是近几年影响最深的工业知识之一。

读完这章你能:

  • 写出 loss 与 N、D、C 的幂律关系,并解释每个参数的含义;
  • 给定算力预算 CC,算出 Chinchilla-optimal 的 N 和 D;
  • 理解为什么 GPT-3 是「数据不足」、Llama 是「数据过量」;
  • 估算一个新模型训练所需的 GPU 小时与成本;
  • 理解 emergent abilities(涌现能力)背后的工程本质。

11.1 三个变量:N、D、C

先把核心变量定下来,本章会反复用到:

  • N:模型参数量(Number of parameters)
    • Kaplan 论文用的是不计 embedding 的「主体参数」;Chinchilla 论文及下文各模型的规模按总参数计。单位通常是 B(10^9)
    • GPT-3 是 175B,Llama-3 70B 是 70B,DeepSeek-V3 是 671B
  • D:训练 token 数(Dataset size)
    • 单位通常是 T(10^12)
    • GPT-3 用了 0.3T token,Chinchilla 70B 用了 1.4T,Llama-3 用了 15T
  • C:训练算力(Compute)
    • 单位是 FLOPs(浮点运算次数),常用 PF-days 或 EF-days(exa-FLOPs-days)
    • 一个粗略关系:C≈6⋅N⋅DC \approx 6 \cdot N \cdot D(每个参数每 token 训练一次约 6 FLOPs,含前向 2 FLOPs + 反向 4 FLOPs)

这个 C≈6NDC \approx 6ND 是后面所有推导的基础。它来自简单的 FLOP 计数:每个 token 经过模型时大约要做 2N2N 次 FLOPs(前向);反向传播大约是前向的 2 倍(计算梯度),所以 4N4N FLOPs;合起来 6N6N FLOPs/token。所有 D 个 token 都要扫一遍,总算力 ≈6ND\approx 6ND。

flowchart LR
  N[模型参数 N] --> C
  D[训练数据 D] --> C
  C[算力 C ≈ 6ND]
  C --> LOSS[最终 loss L]
  N --> LOSS
  D --> LOSS

研究 Scaling Laws 的核心问题就是:给定预算(任意两个变量固定),第三个变量该怎么选才能让 loss L 最小?

11.2 第一版:Kaplan 2020 的原始 Scaling Law

2020 年 1 月,OpenAI 的 Kaplan、McCandlish 等人在 Scaling Laws for Neural Language Models 论文里给出了第一组系统的实验结果:在 768 个到 1.5B 个非嵌入参数、22M 到 23B token 的范围内,模型 loss 与 N、D、C 之间存在幂律关系:

L(N)=(NcN)αN,L(D)=(DcD)αDL(N) = \left(\frac{N_c}{N}\right)^{\alpha_N}, \quad L(D) = \left(\frac{D_c}{D}\right)^{\alpha_D}

其中 αN≈0.076\alpha_N \approx 0.076、αD≈0.095\alpha_D \approx 0.095、NcN_c 和 DcD_c 是常数(Kaplan 论文式 1.1 / 1.2)。

直观意思:loss 随 N 或 D 增大按幂律下降。把一个变量翻 10 倍,loss 下降一个固定的因子;再翻 10 倍(累计 100 倍),再下降同样的因子。这个性质在 log-log 图上是一条直线。

log(L)
  ^
  |  *
  |   *
  |    *
  |     *      斜率 ≈ -α
  |      *
  |       *
  +-------------> log(N)

更进一步,给定算力 CC,loss 的下界也是幂律:

L(Cmin⁡)≈(CcCmin⁡)αC,αC≈0.050L(C_{\min}) \approx \left(\frac{C_c}{C_{\min}}\right)^{\alpha_C}, \quad \alpha_C \approx 0.050

这套结果意味着两件事:

1. Loss 还有很多「下降空间」。当时 GPT-3 还没出(GPT-2 是 1.5B),按幂律外推,把规模再放大 10 倍 / 100 倍仍然能持续降 loss——这给后续 GPT-3、GPT-4 的研发提供了直接信仰支撑。

2. 给定算力 C,最优如何分配 N 和 D? Kaplan 的实验结论:模型规模 N 比数据 D 重要得多。具体地,他们建议算力翻倍时 N 应该多增加(占大头),D 增加少一些。

这条「N 重于 D」的结论催生了 GPT-3:用 175B 参数 + 0.3T token 训练。从 Kaplan Scaling Law 角度看,这是「算力最优」的配置——175B 参数已经接近当时的训练算力上限,再多 token 不如再大模型。

但这个结论是错的——只是 2 年后才被发现。

11.3 反转:Chinchilla 2022

2022 年 3 月,DeepMind 发布了 Training Compute-Optimal Large Language Models,提出了著名的 Chinchilla 法则。

DeepMind 的实验范围更宽——他们训了 400 多个不同 N、D 组合的模型,从 70M 到 16B 参数、5B 到 500B token(论文摘要的原话是 "70 million to over 16 billion parameters on 5 to 500 billion tokens")。结果颠覆了 Kaplan 的结论:

结论:在固定算力 C 下,最优的 N 和 D 应该大致同步增加——具体地,

Nopt(C)∝C0.5,Dopt(C)∝C0.5N_{\text{opt}}(C) \propto C^{0.5}, \quad D_{\text{opt}}(C) \propto C^{0.5}

下面这张图左边是 Kaplan 论文的 L(N)L(N) 公式(常数 Nc≈8.8×1013N_c \approx 8.8\times10^{13},实线为论文拟合区间,虚线为外推),右边是 Chinchilla 1:20 线和主流模型在 (N, D) 平面上的位置:

Scaling Laws:幂律 + 主流模型在 (N, D) 平面

右图特别值得停下来看——GPT-3 175B 远低于 Chinchilla 对角线(D/N=1.7,理论应该 D/N=20,欠训 12 倍);Llama-2 7B 和 Llama-3 系列远高于对角线(Llama-3 8B 的 D/N=1875,over-train 94 倍)。DeepSeek-V3 是 MoE,按总参数和按激活参数各标了一个点,落点差了一个数量级。这两端的偏离来源不同:GPT-3 的欠训沿用了当时 Kaplan「N 重于 D」的结论(见 11.4 节),Llama 的过训则是有意拿训练算力换推理成本(见 11.5 节)。

而 Kaplan 的结论是 N∝C0.73,D∝C0.27N \propto C^{0.73}, D \propto C^{0.27}——N 增长率远高于 D。

Chinchilla 给出的具体配比:算力最优时 N : D ≈ 1 : 20,即每参数对应大约 20 token 训练数据。

N(参数量) Chinchilla-optimal D(按 20 token/参数) 备注
1B 20B token
7B 140B token
13B 260B token
70B 1.4T token DeepMind 实测
175B 3.5T token GPT-3 实际只训 0.3T,严重欠训
500B 10T token
1T 20T token

按这个公式,GPT-3 是严重欠训的——175B 参数对应 0.3T token 训练,只有 Chinchilla-optimal 的 1/12。这意味着 GPT-3 的算力没有被充分用来「挖掘」175B 参数的潜力——按 C≈6NDC \approx 6ND,GPT-3 约 3.2×10233.2\times10^{23} FLOPs,同样的算力按 1:20 分配约是 50B + 1T。

Chinchilla 70B 在论文里的实验证实:与 Gopher 280B 相同算力下的 Chinchilla 配置(70B + 1.4T,数据是 Gopher 的 4 倍)训出来的模型,在大范围下游任务上击败 Gopher 280B、GPT-3 175B、Jurassic-1 178B 和 MT-NLG 530B——参数量只有 GPT-3 的 40%,但更优的训练分配让它强得多。

flowchart TB
  subgraph "Kaplan 2020 (错误)"
    K1["N >> D"]
    K2["GPT-3: 175B + 0.3T"]
    K1 --> K2
  end
  subgraph "Chinchilla 2022 (正确)"
    C1["N ~ D"]
    C2["最优比例 N:D = 1:20"]
    C1 --> C2
    C2 --> C3["Chinchilla 70B + 1.4T<br/>击败 GPT-3 175B"]
  end
  K2 -.推翻.-> C1

11.4 为什么 Kaplan 错了

回头看 Kaplan 的实验,Chinchilla 论文指出的首要原因是一个工程细节:学习率 schedule 的长度没有跟着训练 token 数调整。

Kaplan 对所有模型用了同一个训练 token 数和同一条 cosine schedule,「数据量较少」的点取的是训练中途的 loss。Chinchilla 论文的说法是:cosine schedule 设到 130B token 时,中途(D′≪D' \ll 130B)的 loss 会高估一个按 D′D' 设 schedule 长度的模型的 loss——那时 lr 还没降下来。用这些中途 loss 去拟合,会低估训练 token 少于 130B 时模型的实际效果,论文认为这是 Kaplan 得出「算力增加时模型应比数据长得快」的原因之一。

Chinchilla 的实验修正了这点:每个实验配置都用专属的 schedule——cosine 周期长度匹配该实验的 token 总数,让 lr 在最后才降到底。论文还指出第二个差异:Kaplan 的多数实验模型很小(不少不到 100M 参数),而 Chinchilla 的实验模型多数超过 500M、最大超过 16B,能看到 FLOP–loss 前沿在大规模处的弯曲。修正后的结论是 N 和 D 应以大致相同的速度增长。

这个修正听起来很小,但它重新定义了大模型工业的训练取向——2022 年之后的大模型普遍以 Chinchilla 配比为下限来配置 N 和 D(至少不再欠训),Kaplan 的「N 重于 D」原则被放弃。

11.5 第三版:Llama 的 over-training

如果 Chinchilla 法则就是终点,那 Llama 不应该出现——Llama-2 7B 用 2T token 训练,严重超过 Chinchilla-optimal 的 140B;Llama-3 8B 用 15T token,约为 Chinchilla-optimal(160B)的 94 倍。

为什么?因为 Chinchilla 法则只优化「训练算力」,没有考虑「推理成本」。

flowchart LR
  TC[训练算力] --> CHIN[Chinchilla optimal]
  IC[推理成本] --> LLAMA[Llama over-training]
  CHIN -.训练优化.-> M1["70B + 1.4T (例)<br/>训练效率最高<br/>但部署贵"]
  LLAMA -.部署优化.-> M2["7B + 15T (例)<br/>训练投入更多<br/>但模型小,部署便宜"]

Meta 的理由是:模型一旦训完,要部署给亿级用户用很多年。训练算力是一次性投入,推理算力是持续投入。

举个数字:

  • 用 Chinchilla 配置训 70B + 1.4T,训练成本 X,部署时每个用户 query 调用 70B 模型
  • 用 over-training 训 7B + 15T,训练成本几乎持平(6×7×109×15×1012=6.3×10236\times7\times10^9\times15\times10^{12}=6.3\times10^{23},对比前者的 5.9×10235.9\times10^{23},只多 7%),但部署时每个 query 用 7B 模型——推理成本只有前者的 1/10

如果模型要给上亿用户用一年(假设 101110^{11} 量级的调用),推理成本主导一切——前者多出来的推理开支远超后者多花的那 7% 训练成本。

更关键的是:继续 over-train 的边际收益虽然递减,但不为零。Meta 在 Llama 3 发布博客里写道:8B 模型的 Chinchilla-optimal 数据量约 200B token,但训到两个数量级以上的数据后性能仍在提升,8B 和 70B 一直训到 15T token 都还在按对数线性改善。这和 Chinchilla 并不矛盾——Chinchilla 回答的是「给定算力怎么分配最划算」,并没有说固定 N 之后多喂数据就没用;只是这时每单位算力换来的 loss 下降比同时放大 N 更少。

主流模型的 N : D 比例:

模型 N D D/N 比 备注
GPT-3 175B 0.3T 1.7 严重欠训(Kaplan 时代)
Chinchilla 70B 1.4T 20 Compute-optimal
Llama-2 7B 7B 2T 286 over-train 14×
Llama-2 70B 70B 2T 29 接近 Chinchilla
Llama-3 8B 8B 15T 1875 over-train 94×
Llama-3 70B 70B 15T 214 over-train 11×
Llama-3 405B 405B 15.6T 39 约 2×;Meta 按自家 scaling law 称其对 3.8×10253.8\times10^{25} FLOPs 预算近似算力最优
DeepSeek-V3 671B(37B activated) 14.8T 22 按总参数算 D/N≈22,接近 Chinchilla;按激活参数算 D/N≈400,属重度 over-train

可以看到 2024 之后的趋势是:普通规模模型(7B、70B 这一档)严重 over-train,因为它们要承担推理负担;数百 B 的旗舰模型(按总参数计)更接近 Chinchilla 配比,因为此时训练算力本身已经是硬约束。Llama 3 论文说得很直白:旗舰 405B 的规模对其训练预算近似算力最优,而较小的模型则有意训得远超算力最优。

11.6 估算训练成本

有了 C≈6NDC \approx 6ND 这个公式,我们可以估算实际训练所需的算力。

例 1:Llama-3 70B

C≈6×70×109×15×1012=6.3×1024 FLOPsC \approx 6 \times 70 \times 10^9 \times 15 \times 10^{12} = 6.3 \times 10^{24} \text{ FLOPs}

H100 GPU 的 BF16 算力是 989 TFLOPs/s(理论峰值),但大规模稠密模型预训练场景下的实际利用率(MFU, Model FLOPs Utilization)只有 30-50%(Llama 3 论文报告 405B 预训练的 BF16 MFU 为 38-43%)。取 40% 利用率:

MFU 这个数脱离场景没有意义,报的时候必须带上场景和模型规模:本节 30-50% 说的是稠密模型训练;推理侧 prefill 属计算密集、MFU 可以较高,decode 在小 batch 下受显存带宽限制、MFU 可低到 1% 以下(第 14 章按 roofline 推导);MoE 大模型训练又是另一档。看到一个孤零零的 MFU 数字,先问它是哪一段。

有效算力=989×1012×0.4=3.96×1014 FLOPs/s\text{有效算力} = 989 \times 10^{12} \times 0.4 = 3.96 \times 10^{14} \text{ FLOPs/s}

总 GPU·秒:

6.3×10243.96×1014≈1.59×1010 GPU⋅s≈4.4×106 GPU⋅hours\frac{6.3 \times 10^{24}}{3.96 \times 10^{14}} \approx 1.59 \times 10^{10} \text{ GPU·s} \approx 4.4 \times 10^6 \text{ GPU·hours}

假设 H100 租价 $2.5/GPU·小时(本章后面的估算都沿用这个假设价),训练成本约 $11M(千万美元量级)。Meta 在 Llama 3 模型卡里报告 70B 预训练用了 6.4M GPU·hours(H100-80GB)——和我们估算的同一量级。

例 2:你的小公司想训一个 7B 模型

按 Chinchilla 法则,7B 对应 140B token:

C≈6×7×109×140×109=5.88×1021C \approx 6 \times 7 \times 10^9 \times 140 \times 10^9 = 5.88 \times 10^{21}

40% MFU 下需要 H100 GPU·hours:

5.88×10213.96×1014×3600≈4100 GPU⋅hours\frac{5.88 \times 10^{21}}{3.96 \times 10^{14} \times 3600} \approx 4100 \text{ GPU·hours}

也就是 8 张 H100 跑 21 天,或 64 张 H100 跑 2.7 天。按上面的假设价约 $10K,租价浮动时大致在 $10K~$15K——这是 Chinchilla-optimal 的最低门槛。

如果你想 over-train(比如 Llama 风格 7B + 2T token),算力翻 14 倍,约 $150K——已经能让一个百万美元的实验室出一个相当不错的中等模型。

估算的实际意义

这套估算让你看到:

  • 训练 100B 稠密模型:按同样的假设(40% MFU、$2.5/GPU·小时),Chinchilla 配比(2T token)约 1.2×10241.2\times10^{24} FLOPs、84 万 GPU·小时、两百万美元出头;像 Llama-3 那样喂 15T token,则约 9×10249\times10^{24} FLOPs、630 万 GPU·小时、一千六百万美元左右。这还只是一次成功训练的算力账,不含前期实验、失败重跑、数据和人力。作为对照,DeepSeek-V3 报告的正式训练共 278.8 万 H800 GPU·小时,按 $2/GPU·小时折合 557.6 万美元,报告也明确说明不含此前的研究与消融实验成本。
  • 训练 7B 模型:一万到十几万美元(取决于喂 140B 还是 2T token)——一个研究小组的预算。
  • 训练 100M 模型:按 Chinchilla 配比(2B token)不到 1 个 GPU·小时,就算多喂几十倍数据也花不了多少钱——任何爱好者都能复刻 mini-GPT 实验。

这就是为什么开源大模型生态在 7B-70B 这一档百花齐放,而数百 B 乃至更大的旗舰模型只有少数资金雄厚的机构能训——成本曲线决定了谁能玩。

11.7 涌现能力:Scaling 的「幻觉」与「真实」

Scaling Laws 告诉我们 loss 会随 N、D 平滑下降。但有些具体能力——in-context learning、reasoning、tool use、复杂指令理解——并不平滑出现,而是在某个规模阈值之后突然涌现。

Wei et al.(Google,2022)的论文 Emergent Abilities of Large Language Models 系统刻画了这一现象。比如:

  • 多位数算术:小模型上正确率接近零,规模跨过某个阈值后才跳起来。
  • 多步推理:CoT(Chain-of-Thought)prompt 在小模型上几乎不起作用,要到百亿-千亿参数量级才明显有效。
  • 上下文学习(few-shot):小模型上效果很弱,GPT-3 这一档才大规模涌现。

(这几条的具体阈值随模型族、训练数据、评测指标而变,论文里给的是曲线而不是一个通用的临界参数量——不要把某个具体数字当成硬门槛。)

flowchart LR
  X[模型规模] --> Y[能力]
  Y -.平滑.-> S1["loss / 标准 benchmark<br/>渐进改善"]
  Y -.阈值跳变.-> S2["三位数加法<br/>多步推理<br/>ICL<br/>tool use"]

这给「Scaling 信仰」加了一条:不只 loss 会降,还会涌现新能力——这也是业界持续投入巨资放大模型的重要论据之一。

但这件事也有争议。Schaeffer et al.(Stanford,2023)在论文 Are Emergent Abilities of Large Language Models a Mirage? 提出反驳:所谓「涌现」很大程度上是评测指标的不连续性导致的视觉错觉。比如算术题用「答案是否完全正确」(exact match)这种非线性指标会突然跳变,但换成「token 编辑距离」这类连续指标,同一批模型的曲线其实是平滑的。

两种观点并存。我个人倾向认为:有些能力是真的涌现,有些是评测错觉,但模型规模带来的能力提升是真实的——这一点工业界的产品化数据支撑得比较充分(新一代 frontier 模型在多数任务维度上都明显强于前一代)。

11.8 Scaling 的瓶颈

到了 2024-2025,Scaling 曲线开始遇到几堵墙。

墙一:高质量数据耗尽

Llama-3 用 15T token,DeepSeek-V3 用 14.8T——训练数据的规模正在逼近互联网公开高质量文本的存量。Common Crawl 等大数据集去重、去噪、过滤后,剩下的高质量内容是有限的,而训练数据量仍在逐代增长,多种估计都认为几年内就会触及这个上限(这是预测,具体年份各家估计不一)。

继续扩 10 倍数据到 100T+?除非:

  • 加入大量代码(公开代码语料库的可用规模在千亿到万亿 token 量级)
  • 加入科学论文(arXiv、PubMed Central 等,规模比代码更小)
  • 加入合成数据(synthetic data,用大模型生成)—— Llama-3 / DeepSeek 都开始用这条路

合成数据是当前最热的方向但也最有争议——用 AI 生成的内容训 AI,可能引入 model collapse(Shumailov et al., 2023):模型逐渐学到自己的偏见,分布越来越窄。这个问题至今没完全解决。

墙二:算力 / 资金

GPT-4 的训练成本、参数量和训练 token 数都从未公开,外界普遍估计训练成本在上亿美元量级(传闻数字不要当真);此后各家旗舰模型的训练投入普遍被认为还在上升,同样没有公开数字。这个成本曲线让玩家越来越少——只有顶级头部能继续玩。

而且即使有钱,单机房供电也有上限——GW 量级的数据中心需要专门规划电力接入,已经不是找个机房就能解决的事。头部厂商已经开始直接和核电站签长期供电协议,门槛正在逼近「国家工程」级别。

墙三:训练稳定性

模型越大越不稳定。loss spike(突然上升不降)、gradient explosion(梯度爆炸)、attention collapse(attention 退化为单峰)等问题在 100B+ 规模上频发。解决这些问题需要:

  • 更精细的初始化与超参迁移(如 µP)
  • 更稳定的归一化与数值约束(pre-LN + RMSNorm,再加上 PaLM 用过的输出 logits z-loss 等)
  • 更细致的优化器调参(AdamW + 量身定做的 lr schedule + 梯度裁剪)
  • 频繁的 checkpoint + rollback(loss spike 时回滚到上一个稳定点)

这些工程经验大厂内部积累深厚,是开源模型很难快速追赶的「软实力」。

墙四:边际收益递减

幂律的本质就是「边际递减」——每翻一倍 N 或 D,loss 只下降固定百分比,能力提升越来越微弱。从 GPT-3.5 到 GPT-4 的能力提升非常明显,而此后单靠放大预训练规模换来的提升,普遍被认为在收窄——这是业界的判断而非定论。(GPT-4 及之后各代的参数量与数据量都未公开,下图里不标这些数字。)

flowchart LR
  G2["GPT-2 (2019)<br/>1.5B / WebText 40GB"] --> G3["GPT-3 (2020)<br/>175B / 0.3T<br/>能力跳变"]
  G3 --> G4["GPT-4 (2023)<br/>参数/数据未公开<br/>能力提升明显"]
  G4 --> G5["下一代 (外界估计)<br/>边际递减<br/>成本爆炸"]

11.9 新方向:Test-Time Compute Scaling

到了 2024 下半年,Scaling 的方向开始变化。OpenAI 的 o1(2024-09)、DeepSeek 的 R1(2025-01)提出了新的思路:不再无限放大模型,而是让模型在推理时『多花时间思考』来提升能力。

这叫 test-time compute scaling(推理时算力 scaling):

  • 训练时:模型规模不再追求无限放大(这条路线在中等规模模型上就能看到收益,R1 本身仍是 671B MoE)
  • 推理时:让模型生成超长的「思考链」(CoT),中间生成几千、几万 token 的 reasoning trace,最终给出更可靠的答案
flowchart LR
  Q[复杂问题] --> M[中等大小模型]
  M --> THINK[生成 长 reasoning trace<br/>5000+ tokens]
  THINK --> ANS[最终答案]
  CMP1[传统模型<br/>直接答<br/>100 token<br/>容易错] -.对比.-> CMP2[o1 / R1 风格<br/>先思考<br/>多次自检<br/>5000 token<br/>更准]

这里的 trade-off 变了:训练成本不再是唯一的杠杆,但推理成本上升——同一个 query 要生成的 token 可能多出一两个数量级(上图示意的 100 对 5000 token 就是 50 倍)。对准确率要求高的场景往往愿意为此付费——只要多花的 token 换来足够明显的准确率提升,这笔账就划算。

这条路把 Scaling 的视角从「训练时算力」推到了「推理时算力」——一个全新的维度,还有大量空间可以挖。

11.10 这一章的实战意义

理论讲到这里,转一些工程视角的 takeaway:

1. 给一个新模型时,先估算 Chinchilla-optimal。这是「最低限度训练量」——少于这个就是欠训,浪费参数。

2. 如果模型要部署给大量用户,over-train 是合理的。Llama 路线(7B + 15T)在「推理成本主导」时显著优于 Chinchilla 配置。

3. 不要试图自己训 100B+ 模型——除非你有充足的算力预算(按 11.6 节的估算,单次训练就在数百万到千万美元量级,还不算实验和失败重跑)和成熟的工程团队。开源 Llama / Qwen / DeepSeek 是更便宜的起点。

4. 关注 emergent abilities 阈值。需要多步 reasoning 的应用,小模型往往怎么调 prompt 都过不了关,得往上换一档;只需要分类、简单问答的话 7B 量级够用。具体阈值在你自己的评测集上测,别照搬论文里的数字。

5. 推理时 scaling 是新机会。在中等规模模型上做 RL / 思维链训练,能在不放大参数的情况下显著提升能力。这是 2025-2026 的工业热点。

本章小结

  1. 三个变量 N、D、C:参数量、数据量、算力。简单关系 C≈6NDC \approx 6ND。
  2. Kaplan 2020 原始 Scaling Law:loss 随 N、D 幂律下降,但「N 重于 D」结论是错的(来自实验设计的瑕疵)。
  3. Chinchilla 2022 反转:N : D ≈ 1 : 20(每参数对应 20 token 训练数据)才是 compute-optimal。Chinchilla 70B 击败 GPT-3 175B 证明了这点。
  4. Llama 时代的 over-training:Chinchilla 优化的是训练成本,但忽略了推理成本。Llama 把 D / N 推到两三百乃至上千(Llama-3 8B 是 1875),用更多训练投入换更小推理成本。
  5. 训练成本估算:用 C≈6NDC \approx 6ND + GPU FLOPs + MFU,可以从 N、D 估出钱和时间。
  6. Emergent abilities 让 Scaling 信仰多了一层——某些能力在阈值后突然出现(in-context learning、reasoning、tool use)。
  7. Scaling 遇到四堵墙:高质量数据耗尽、算力 / 资金、训练稳定性、边际收益递减。
  8. 新方向:Test-time compute scaling——o1 / R1 路线把算力从训练时挪到推理时,让中等模型靠「多想」打出新能力。

下一章我们具体看一种突破规模化天花板的关键技术——Mixture of Experts (MoE)。MoE 让你能训 671B 总参数但每次只激活 37B 的模型(DeepSeek-V3),用「激活参数 ≠ 总参数」绕开了密集模型的算力瓶颈。

延伸阅读

  • Kaplan et al., Scaling Laws for Neural Language Models, 2020. arXiv:2001.08361——原始 Scaling Law 论文。
  • Hoffmann et al., Training Compute-Optimal Large Language Models, NeurIPS 2022. arXiv:2203.15556——Chinchilla 论文。
  • Touvron et al., LLaMA: Open and Efficient Foundation Language Models, 2023. arXiv:2302.13971——Llama 1 论文,over-training 路线的代表。
  • Wei et al., Emergent Abilities of Large Language Models, TMLR 2022. arXiv:2206.07682
  • Schaeffer et al., Are Emergent Abilities of Large Language Models a Mirage?, NeurIPS 2023. arXiv:2304.15004——涌现能力的反驳视角。
  • Snell et al., Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters, 2024. arXiv:2408.03314——test-time scaling 的代表作。
  • DeepSeek-V3 Technical Report, 2024. arXiv:2412.19437——over-training + MoE + MLA 的工业代表。
  • Shumailov et al., The Curse of Recursion: Training on Generated Data Makes Models Forget, 2023. arXiv:2305.17493——synthetic data 的风险。