Transformer 解剖:从 Attention 到推理系统

第 19 章 Transformer 之后:Mamba、Hybrid 与你接下来该读哪个专栏

作者 杨艺韬 · 6,851 字 · 发布于 · 更新于

到这里,这个专栏的主要内容已经讲完了。我们从 2017 年那篇 Attention Is All You Need 出发,一路走过 Self-Attention 的数学、Multi-Head 的几何、位置编码的演化、Block 的组装、三种架构的取舍、预训练范式之战、动手实现 mini-GPT、Tokenizer 工程、Scaling Laws、MoE、长上下文、推理两阶段、KV Cache、量化、投机解码、Flash Attention、分布式部署——18 章构成了 Transformer 这台机器从设计到生产的完整解剖。

这最后一章不再讲 Transformer 内部。它要做两件事:

第一,往前看——Transformer 之后。九年没变过骨架的 Transformer 是终点吗?研究界正在探索的 Mamba、RetNet、Hybrid 这些路线,会不会替代 Transformer?哪些已经在生产中被验证、哪些仍是实验性的?

第二,往整体上回望——把整个专栏的心智模型重新串一遍,以及读完这个专栏后你应该读什么、做什么、看什么——把这个专栏放进你的整个学习路径里。

19.1 Transformer 真的是终点吗

骨架九年没变——这是一个工业界长期稳定的架构。但研究界一直没停止过对 Transformer 的挑战。挑战的动力其实可以归结到一句话:Transformer 的 O(N²) 是结构上绕不开的伤口。

我们整个专栏反复绕开这个伤口:

  • 第 13 章用 Flash Attention 在内存层级上压它(不改算法),又用 Sliding Window / Sparse 在算法上局部化它(损失质量)
  • 第 15 章用 KV Cache 量化把它的内存代价压下来
  • 第 16 章用低位量化让权重读取更快
  • 第 18 章用 Flash Attention 3 把单卡 attention 推到 75% MFU

但只要 attention 还是「每个 token 看其他所有 token」,复杂度就是 O(N²)——所有这些优化都是在围绕这个事实做工程。如果有一天我们能换一种「每个 token 看 O(1) 信息」的架构,又能保持 attention 的能力,整个推理工程会轻松得多。

这就是「Transformer 之后」的所有努力的共同动机。下面看几条主要路线。

19.2 路线一:State Space Models(Mamba)

最受关注的替代路线是基于状态空间模型(State Space Models, SSM)。这个概念来自经典控制理论——一个动态系统的状态随时间演化,由一组微分方程描述:

h′(t)=Ah(t)+Bx(t)h'(t) = A h(t) + B x(t) y(t)=Ch(t)y(t) = C h(t)

其中 h(t)h(t) 是状态、x(t)x(t) 是输入、y(t)y(t) 是输出,A,B,CA, B, C 是矩阵。这个公式描述了「状态如何随输入演化、状态如何映射到输出」。

把它离散化(针对序列建模),就得到一个递归式:

ht=Aˉht−1+Bˉxth_t = \bar{A} h_{t-1} + \bar{B} x_t yt=Chty_t = C h_t

——形式上像极了 RNN。但和 RNN 不同,SSM 的 A,B,CA, B, C 矩阵有特殊结构(来自连续时间动力学的离散化),让它具备一些 RNN 没有的性质。

S4:第一次能跟 Transformer 较量的 SSM

S4(Structured State Space, Gu et al., 2021)是第一个让 SSM 在长序列任务上能和 Transformer 较量的工作。它有两个关键创新:

  1. HiPPO 矩阵作为 AA:HiPPO(High-order Polynomial Projection Operator)是一族数学上「最优记忆」的矩阵——它让状态 hth_t 在任何时刻都「最优地总结」过去的输入。

  2. 卷积形式的并行计算:递归式 ht=Aht−1+Bxth_t = A h_{t-1} + B x_t 在 A,BA, B 是常数时可以展开成卷积:y=K∗xy = K * x,其中 KK 是一个固定的「卷积核」;S4 的贡献之一是给出了高效算出这个卷积核的方法。卷积可以用 FFT 在 O(N log N) 时间内并行算——这让 SSM 训练时和 Transformer 一样支持并行。

S4 在 Long Range Arena(一个长序列基准)上首次大幅超过 Transformer 这类基线。但它在语言建模任务上不如 Transformer——因为 A,B,CA, B, C 是固定参数、不依赖输入,没有 attention 那种「内容寻址」的能力。

Mamba:选择性状态空间

Mamba(Gu & Dao, 2023)解决了 S4 的核心限制:让 SSM 的参数依赖输入——也就是「选择性 SSM」(Selective SSM)。

具体地,Mamba 让 Bt,CtB_t, C_t 是输入 xtx_t 的函数:

Bt=LinearB(xt),Ct=LinearC(xt)B_t = \text{Linear}_B(x_t), \quad C_t = \text{Linear}_C(x_t)

Δt\Delta_t(离散化步长)也是输入相关的。AA 本身仍是与输入无关的参数,但离散化后的 Aˉ=exp⁡(ΔtA)\bar{A} = \exp(\Delta_t A) 经 Δt\Delta_t 间接随输入变化——论文认为 Δ\Delta 的选择性就足以让 (Aˉ,Bˉ)(\bar{A}, \bar{B}) 都具备选择性。这意味着模型可以根据当前 token 决定「记住什么、忘什么、提取什么」——这是 attention 的核心能力,但是用 SSM 的形式表达。

代价:B,CB, C 不再是常数,S4 的卷积加速失效——Mamba 的训练并行依赖一种叫 parallel scan(关联扫描)的算法。Mamba 的官方实现(state-spaces/mamba)把离散化和扫描融合进一个 CUDA kernel、在 SRAM 里完成,论文报告这个 scan 在序列长度超过 2K 后比 FlashAttention-2 还快。

flowchart LR
  X[x_1, x_2, ..., x_T] --> SSM["Selective SSM 块"]
  SSM --> H["状态 h_t<br/>每通道 d_state 维<br/>大小与序列长度无关"]
  H --> Y[y_t]
  COMPLEXITY["训练 O(N) 推理 O(N) 状态固定 O(1)"]

Mamba 的优势

  1. 训练复杂度 O(N)——比 Transformer 的 O(N²) 少 N 倍
  2. 推理时是 RNN 风格——只维护一个固定大小的状态向量,不需要 KV Cache
  3. 长上下文友好——理论上可以处理无限长序列,状态压缩信息

Mamba 的劣势

但 Mamba 有几个根本限制:

  1. 精确召回弱——Transformer 能精确记住上下文中任意位置的内容(attention 是全连接的);Mamba 的状态是定长压缩,远位置信息会被新内容覆盖。
  2. In-Context Learning 不如 Transformer——NVIDIA 在同数据、同 8B 规模下的对照实验(Waleffe et al., 2024)里,纯 Mamba / Mamba-2 在需要强复制或上下文学习能力的任务(如 5-shot MMLU、Phonebook 查找)上落后于 Transformer。
  3. 训练规模化未充分验证——公开的纯 SSM 语言模型多在 7B 量级(Falcon-Mamba、Codestral Mamba 等),就作者所知,还没有公开的 70B 以上、能与同代一线 Transformer 比肩的纯 SSM 模型。

这些劣势不是「Mamba 永远不行」的证据,但就目前而言,它们让纯 Mamba 还不足以替代 Transformer。

Mamba-2:理论统一

Mamba-2(Dao & Gu, 2024)做了一个理论统一:它证明一类结构化 SSM(AA 为标量乘单位阵)和一类带掩码的线性 attention 是同一个东西的两种写法——两者由「state-space duality」(SSD)连接。注意这里连接的是线性 attention,不是带 softmax 的标准 attention;softmax 那一层非线性正是标准 attention 无法被写成定长状态递归的原因。

这个洞察让 Mamba-2 既保留 SSM 的线性复杂度,又能把计算改写成分块的矩阵乘、用上 GPU 的 Tensor Core——论文报告 SSD 层比 Mamba 的 selective scan 快 2–8 倍。语言建模质量上,论文在 125M–1.3B 的 scaling 实验里 Mamba-2 与强 Transformer 基线(Transformer++)持平或略优;2.7B、300B token 的 Mamba-2 在零样本评测上超过同数据训练的 Pythia-2.8B 乃至 Pythia-6.9B。

但这些都是数十亿参数以内的实验——Mamba-2 仍然没在主流大模型场景下展示出对 Transformer 的明确优势。

19.3 路线二:Linear Attention(RetNet、RWKV)

另一条路线想从 attention 本身下手——让 attention 变成线性复杂度。

回忆 attention 的公式:

Attention(Q,K,V)=softmax(QKT/d)V\text{Attention}(Q, K, V) = \text{softmax}(QK^T / \sqrt{d}) V

softmax 是关键——它让 attention 矩阵 N×N 必须显式计算。如果能去掉 softmax,把 ϕ(Q)ϕ(K)TV\phi(Q) \phi(K)^T V 这种形式重排成 ϕ(Q)(ϕ(K)TV)\phi(Q) (\phi(K)^T V),就能把 N×N 的中间矩阵换成 d×d——复杂度从 O(N²·d) 降到 O(N·d²)。当 N >> d 时这就是线性复杂度。

这就是 Linear Attention(Katharopoulos et al., 2020)的基本想法:用一个核函数 ϕ\phi 替代 softmax。

RWKV

RWKV(Bo Peng et al., 2023)走得更远——它把 Linear Attention 重新表达成一种「RNN 友好的形式」:

wkvt=∑i≤te−(t−i)w⋅eki⋅vi∑i≤te−(t−i)w⋅eki\text{wkv}_t = \frac{\sum_{i \le t} e^{-(t-i) w} \cdot e^{k_i} \cdot v_i}{\sum_{i \le t} e^{-(t-i) w} \cdot e^{k_i}}

这是一个类似 attention 的加权求和,但权重是「指数衰减 + 内容相关」的形式(这里写的是简化版,略去了给当前 token 单独加的 bonus 项)。它有两个等价的计算形式:

  1. 训练时:用自定义 CUDA kernel 在时间维上做线性扫描,复杂度 O(N)O(N),不需要物化 N×N 矩阵
  2. 推理时:可以重写成 RNN 风格(每步 O(1)O(1) 状态更新,不需要 KV Cache)

RWKV 已迭代到 RWKV-7(Peng et al., 2025,arXiv:2503.14456),论文报告其 2.9B 模型在 3B 量级的英文下游任务上追平当时的最好水平;推理时只维护固定大小的状态、不需要 KV Cache——是开源社区里 SSM 之外另一条值得跟踪的路线。

RetNet

RetNet(Sun et al., 2023)由微软研究院与清华大学提出,核心是一种叫 Retention 的机制——和 RWKV 思路类似,但数学形式不同。RetNet 给出三种数学等价的表示:parallel(训练用,O(N2)O(N^2) 但可以吃满 Tensor Core)、recurrent(推理用,每步 O(1)O(1))、chunkwise(长序列训练用,块内并行、块间递归)。

RetNet 论文把模型做到 6.7B,报告 2B 以上困惑度优于同规模 Transformer,训练吞吐与 FlashAttention 版 Transformer 相当或略高,7B、8K 长度下解码比带 KV Cache 的 Transformer 快 8.4 倍。但此后公开的大规模 RetNet 模型很少,工业界落地不多。

flowchart LR
  TR["Transformer<br/>O(N²) attention<br/>需要 KV Cache"] --> ALT[替代方案]
  ALT --> SSM["SSM (Mamba)<br/>O(N), 状态固定"]
  ALT --> LIN["Linear Attention<br/>(RWKV / RetNet)<br/>训练可并行 / 推理 O(1) 状态"]

19.4 路线三:Hybrid Architecture

Mamba、RWKV、RetNet 各有优势但也各有局限。一种更务实的路线是 Hybrid——Transformer Block + Mamba Block 交替堆叠,取两者之长。

Hybrid 架构的核心 insight:

  • Transformer Block 提供精确召回和强 ICL 能力
  • Mamba Block 提供线性复杂度和长上下文友好性
  • 少数几层 Transformer + 大量 Mamba:在 Jamba 论文 1.3B 规模的消融、Mamba-2 论文 350M 规模的消融(约 10% 的层用 attention 最好)、以及 NVIDIA 8B 规模的对照实验(Waleffe et al., 2024:8B Mamba-2-Hybrid 在 12 项标准任务上全部超过同数据的 8B Transformer)里,混合体都优于同规模的纯 Transformer 和纯 SSM

代表工作:

Jamba(AI21 Labs, 2024)

Jamba 是最早达到生产规模的 Hybrid 模型之一(52B 总参数,12B 激活):每 8 层里只有 1 层是 attention、其余 7 层是 Mamba,并且隔层插入 MoE。

测试结果:

  • 官方报告长上下文下的吞吐约为同档 Transformer MoE 的 3 倍
  • 在主流基准上与参数量相近的 Mixtral 8x7B、以及更大的 Llama-2 70B 大体相当
  • 支持 256K 上下文,8 bit 权重下单张 80GB GPU 能放下 128K 以上的上下文

Zamba(Zyphra, 2024)

Zamba 走的是另一条混合策略:用一个「共享 attention block」——以 Mamba block 为主干,每 6 个 Mamba block 插入一次同一个 attention + MLP block(参数共享,不是每次都用新的)。这进一步压缩参数量。

Zamba-7B(1T token 训练)在技术报告里与同尺寸的主流开源权重模型有竞争力,而推理时因为只有 attention 那几次调用需要存 KV,长序列生成的显存和速度都更友好。

Hymba(NVIDIA, 2024)

更精细的方案:SSM(Mamba)头和 attention 头并行存在——在同一层里,同一份输入同时送进 attention 头和 SSM 头,两路输出再合并。这种「层内 Hybrid」让两种机制能在每层都协作。

Hybrid 路线的现实

作者的判断是,Hybrid 是 SSM/Linear Attention 路线里最有商业潜力的方向——它不需要替代 Transformer,只需要与 Transformer 协作。公开权重里已经有数百亿激活参数级别的例子,如 MiniMax-01(456B 总参数、45.9B 激活,每 7 层线性注意力(lightning attention)后接 1 层 softmax attention,arXiv:2501.08313)。

闭源 frontier 模型(GPT / Claude / Gemini)不公开架构,外界无从确认它们是否用了 Hybrid。如果确实没用,可能的原因是(推测):

  • frontier 模型已经投入巨大,重构架构成本高
  • Hybrid 的优势主要在长上下文 / 推理效率,frontier 模型已经用其他工程手段(PD 分离、KV Cache 优化)解决得很好
  • 评测/对齐 pipeline 都是为 Transformer 调过的,换架构需要重新调

19.5 路线四:Diffusion-based Language Models

还有一条非主流但有潜力的路线:用 Diffusion 模型生成文本。

Diffusion 模型在图像生成(Stable Diffusion、DALL-E 2 等)上大获成功——它们的核心想法是「先把数据加噪声变成随机分布、再训一个网络逐步去噪还原」。这种「双向、迭代、并行」的生成方式和自回归模型的「单向、逐 token、串行」完全不同(注意 LLaDA 这类扩散语言模型的去噪网络本身仍是 Transformer,变的是生成方式而不是骨架)。

把 Diffusion 用到文本生成的代表作:Diffusion-LM(Stanford, 2022)、SUNDAE(DeepMind, 2022)、LLaDA(蚂蚁/人大, 2025)、Mercury(Inception Labs, 2025)。

Diffusion-based LM 的潜在优势:

  1. 生成可以全局并行——不像自回归一个一个 token 等
  2. 可控性更强——可以指定中间 token、模型迭代填充周围
  3. 理论上更好的长程一致性——双向迭代避免逐 token 累积错误

但 Diffusion-LM 在 2025 年仍是研究阶段,主要挑战:

  • 质量仍待大规模验证——LLaDA 报告其 8B 模型与自建的自回归基线相当、在上下文学习上可与 LLaMA3 8B 竞争,但更大规模、更广任务上的对比还很少
  • 推理成本不一定更低——虽然生成可以并行,但要做 N 步去噪迭代,总算力仍可能高
  • 生态不成熟——没有像自回归模型那样成熟的推理工具链(KV Cache、投机解码这些优化都假设逐 token 自回归生成)

作者的判断是,未来几年 Diffusion-LM 是一个不能忽视的方向——特别是对需要并行生成、中间填充(infilling)的场景。

19.6 当前的趋势:Frontier 在做什么

2024-2025 年,frontier 模型(GPT-4o / Claude 3.7 / Gemini 2 / DeepSeek-V3 / o1 / R1)的演化方向不再是「再放大 10 倍」,而是几条新的主线:

主线 1:Test-time Compute Scaling

让模型在推理时多算、不只在训练时多算。

代表:OpenAI o1、DeepSeek-R1。这类模型在预训练之后做大规模 RL 训练,让模型学会先生成很长的 reasoning trace、「思考」之后再回答(o1 的训练细节未公开,DeepSeek-R1 的技术报告公开了这条做法)。

第 11 章我们已经讲过这条路线。它的工程含义:

  • 训练算力:在预训练之上再加一段 RL 训练
  • 推理算力:每个 query 要生成长得多的 trace,推理成本成倍上升
  • 能力提升:在数学、代码、复杂 reasoning 上质变——以 AIME 2024 为例,DeepSeek-R1 报告里 GPT-4o 的 pass@1 是 9.3%、Claude-3.5-Sonnet 是 16.0%、DeepSeek-V3 是 39.2%,而 o1-1217 是 79.2%、R1 是 79.8%

这种「用推理算力换能力」的范式,让模型规模不再是提升能力的唯一杠杆。

主线 2:Multimodal Native

GPT-4o、Gemini 等已经从「文本模型 + 视觉模块」走向「原生多模态」——OpenAI 称 GPT-4o 是跨文本、视觉、音频端到端训练的单一模型,Gemini 技术报告也称其从一开始就是多模态训练。

闭源模型的具体实现并未公开,公开文献里这条路线的常见做法是:

  • 统一 tokenization:图像 → patch tokens、音频 → audio tokens、视频 → spatiotemporal tokens——所有模态都被映射到同一个 token 空间
  • 跨模态 attention:不同模态 token 在同一个 attention 矩阵里互相 attend
  • 多模态预训练:一开始就用混合数据训练,而不是事后接

这条路线让模型能处理「看图说话 + 听音生成 + 视频理解」等任务在同一个模型里。Gemini 2 / GPT-4o 是这条路线的代表。

主线 3:Agentic / Tool-Native Models

模型不再被动回答问题,而是主动调用工具、规划多步执行。代表:Claude 3.5 Sonnet(Computer Use)、GPT-4 系列(Tool Use)、各种 Agent 平台。

技术含义:

  • 训练数据加入「工具调用」轨迹——SFT 教会模型使用工具
  • RL 优化「完成任务的能力」而不是只优化「回答正确的能力」
  • 长上下文极重要——Agent 多轮交互会累积大量上下文

这条路线实际上推着 Transformer 工程的所有维度同步发展:长上下文(容纳 trace)、推理优化(多步推理需要快)、对齐(避免工具滥用)。

主线 4:Specialized vs General

到 2025 年,「通用大模型 vs 专用小模型」的取舍开始浮现:

  • 通用模型(GPT-5、Claude 4、Gemini 3):什么都能做,但贵
  • 专用模型(代码专用、数学专用、翻译专用的中小模型):单点更强、便宜

作者的预测是,未来可能形成「通用大模型 + 众多专用小模型」的混合生态——routing 把不同 query 送到不同模型。

flowchart TB
  TODAY[2025 现状]
  TODAY --> T1[Transformer 仍主导]
  TODAY --> T2[Test-time scaling 兴起]
  TODAY --> T3[Multimodal native]
  TODAY --> T4[Agentic models]
  TODAY --> T5[Hybrid 探索中]
  T1 --> FUTURE[未来(预测)]
  T2 --> FUTURE
  T3 --> FUTURE
  T4 --> FUTURE
  T5 --> FUTURE
  FUTURE --> F1[Hybrid 在某些场景胜出]
  FUTURE --> F2[Diffusion-LM 在长生成站稳]
  FUTURE --> F3[Specialized + Generalist 共存]
  FUTURE --> F4[新硬件带来新瓶颈]

19.7 把整个专栏的心智模型再串一遍

这个专栏的 19 章分成六个部分加一个终章。让我们用一段话把每个部分浓缩一遍:

第一部分(第 1 章)—— 为什么是 Transformer:RNN 撞在两道墙上——长距离依赖衰减带来的信息瓶颈、递归结构导致的训练无法并行。Transformer 用「一次架构换型」同时拆掉这两道墙,代价是 O(N²) 复杂度。

第二部分(第 2-5 章)—— 注意力机制:Self-Attention 是 Q/K/V 三元组下的软查询(公式 softmax(QKT/dk)V\text{softmax}(QK^T/\sqrt{d_k})V);Multi-Head 把空间切成 h 个子空间让模型多视角看同一段文本;位置编码从 sinusoidal 一路演化到 RoPE 解决了「Attention 不感知位置」的根本问题;Block 把 Attention + FFN + RMSNorm + Residual 装在一起,可以堆叠 80 层。

第三部分(第 6-7 章)—— 架构家族:Encoder(双向)擅长理解、Decoder(因果)擅长生成、Encoder-Decoder(合体)擅长 seq2seq。BERT 输给 GPT 的本质不是性能、而是「语言是填空 vs 续写」的世界观差异——续写视角和 AI 实际应用的需求对齐。

第四部分(第 8-10 章)—— 从零实现:50 行 PyTorch 实现 Self-Attention(含 RoPE、causal mask);用第 5 章 Block + 第 8 章 Attention 搭一个 mini-GPT,在《全唐诗》上训出能写诗的小模型;Tokenizer 是连接「文本」和「token id」的桥梁——子词级 BPE(SentencePiece BPE 或字节级 BPE)是今天主流大模型的工业标配。

第五部分(第 11-13 章)—— 规模化:Scaling Laws 告诉我们 N、D、C 的最优配比(Chinchilla 1:20);MoE 用稀疏激活让 671B 总参数只激活 37B(DeepSeek-V3);长上下文之战推动了三道墙的协同优化(Flash Attention + GQA/MLA + RoPE 外推)。

第六部分(第 14-18 章)—— 推理系统:Prefill(compute-bound)和 Decode(memory-bound)是两个性格截然不同的阶段;KV Cache 是显存杀手——PagedAttention + Prefix Caching + GQA/MLA 是工程的三件套;量化把 HBM 读取压 4 倍(INT4 + AWQ);投机解码用小模型「赌」出多 token 一次;Flash Attention 在 SMEM 里完成 attention 计算,TP/PP/EP 把超大模型切到几百张 GPU。

终章(第 19 章)—— Transformer 之后:Mamba、RWKV、Hybrid、Diffusion-LM 都是探索性方向;frontier 模型在 test-time scaling、multimodal、agentic 三条主线上同步推进。

这套心智模型的关键不是记住每一个具体技术,而是把每个技术对应到一个具体的工程问题:

  • 每次看到一个新论文,问:它解决的是哪一墙?是 attention 计算、KV Cache 显存、训练并行、推理延迟,还是其他?
  • 每次设计一个新系统,问:在我的场景下哪一墙是瓶颈?应该用哪些技术组合压它?
  • 每次部署一个模型,问:硬件、上下文、吞吐、延迟之间怎么权衡?

这种「从工程问题反推技术选择」的能力,是这个专栏希望留给你的。

19.8 接下来读哪个专栏

读完这个专栏你已经掌握了 Transformer 这台机器从设计到生产的完整心智模型。下一步沿着哪条路深入,取决于你的兴趣:

flowchart TB
  HERE[Transformer 解剖]
  HERE --> APP[偏应用]
  HERE --> SYS[偏推理系统]
  HERE --> ARCH[偏架构 / 模型]
  HERE --> EVAL[偏评测 / 对齐]
  APP --> RAG[RAG 工程与检索系统设计]
  APP --> LANG[LangGraph 设计与实现]
  APP --> MCP[MCP 协议设计与实现]
  SYS --> VLLM[vLLM 推理内核深度解析]
  SYS --> PT[PyTorch 训练框架内核深度解析]
  ARCH --> DS[DeepSeek V4 源码剖析]
  ARCH --> RC[Rust 编译器与运行时揭秘]
  EVAL --> EV[LLM 评测体系]
  EVAL --> CC[Claude Code 源码深度解析]

具体推荐:

如果你做 LLM 应用开发

继续读:

  1. 《RAG 工程与检索系统设计》——长文档场景下,按输入 token 数粗算,RAG 比长 context 便宜几十到上百倍(第 13.12 节)。这个专栏教你怎么把 embedding 模型、向量数据库、reranker、生成模型组装成生产级的 RAG 系统。
  2. 《LangGraph 设计与实现》——LangGraph 是目前使用较广的 Agent 编排框架之一。这个专栏从源码深入剖析它的状态管理、工具编排、checkpoint 机制。
  3. 《MCP 协议设计与实现》——Anthropic 的 MCP(Model Context Protocol)是 Agent 工具调用的开放标准。这个专栏讲它的设计哲学、实现细节、生态。

如果你做推理工程

继续读:

  1. 《vLLM 推理内核深度解析》——把第六部分讲到的核心概念(PagedAttention、Continuous Batching、量化、投机解码)落到 vLLM 源码上。是「从理论到生产」的桥梁。
  2. 《PyTorch 训练框架内核深度解析》——理解 nn.Module、autograd、CUDA kernel 派发。让你能从「这一行 PyTorch 代码到底跑了什么」彻底打开。

如果你研究模型架构

继续读:

  1. 《DeepSeek V4 源码剖析》——从 V3 的 MoE + MLA + FP8,到 V4-Pro 的 1.6T 总参 / 49B 激活、384 专家、稀疏注意力与 FP4/FP8 混合精度。这个专栏逐行读官方源码,是 frontier 模型的完整案例。
  2. 《Rust 编译器与运行时揭秘》——读模型代码总要读底层;如果你的工作涉及 Rust(tiktoken、HuggingFace tokenizers 等),这个专栏让你看懂 Rust 后端的每一层。

如果你做评测和对齐

继续读:

  1. 《LLM 评测体系》——换模型、改 prompt、换量化方案,都可能让效果悄悄漂移;这个专栏讲怎么把这些变化测出来,从数据集、判分器到 CI 质量门禁,搭一个能信赖的评测 pipeline。
  2. 《Claude Code 源码深度解析》——一个最复杂的 Agent 场景:让 AI 自主写代码、执行命令、修复 bug。这个专栏拆解 Claude Code 的内部机制,是研究「生产级 Agent」的一个完整样本。

19.9 一些超出本专栏但值得深入的方向

在 19 个章节范围之外,还有几条与 Transformer 紧密相关、但本专栏没展开的方向,列出来作为「下一步阅读」的提示:

强化学习与 RLHF:这个专栏第 7 章简要提及了 RLHF / DPO / Constitutional AI。完整的 RL 训练 pipeline、PPO 算法细节、reward model 训练、AI 红队、对齐评估——这些是另一个专栏的体量。推荐:

  • Training Language Models to Follow Instructions with Human Feedback (Ouyang et al., 即 InstructGPT 论文)
  • Constitutional AI: Harmlessness from AI Feedback (Anthropic)
  • HuggingFace 的 TRL 库文档

多模态 Transformer:CLIP、ViT、LLaVA、Flamingo 这一脉络。让 Transformer 处理图像、音频、视频。和文本 Transformer 的核心结构一致,但 tokenization 和 attention 模式有特殊性。推荐:

  • An Image is Worth 16x16 Words (ViT)
  • Visual Instruction Tuning (LLaVA)
  • Flamingo: a Visual Language Model for Few-Shot Learning

Agentic Reasoning:o1 / R1 / Claude 思考链这条路线。涉及 process supervision、reward model design、test-time search 等独特技术。推荐:

  • Let's Verify Step by Step (OpenAI,过程监督 / PRM)
  • DeepSeek-R1 Technical Report
  • Tree of Thoughts (Yao et al.)

模型解释性 (Interpretability):Anthropic 在 mechanistic interpretability 上的工作——理解大模型内部的「电路」。让模型不只是个黑盒。推荐:

  • Toy Models of Superposition (Anthropic)
  • Transformer Circuits 系列文章
  • Neel Nanda 的博客和教程

安全和对齐:超出本专栏,但极重要。Prompt Injection、Jailbreak、Constitutional AI、Red-teaming 等。在 AI 走向更通用的路上,安全是绕不开的话题。

19.10 写在最后

这个专栏最初的目标,是把 Transformer 这台骨架九年没变过的机器拆开给读者看——既讲它的数学,也讲它在 GPU 上每一秒钟在做什么。从 RNN 时代的瓶颈讲起,到今天万亿参数模型、1M 上下文的工程极限。

如果读完这个专栏你在面对 Transformer 时不再有「黑盒」感——能看到一段大模型代码就指出每一个组件、能看到一份 GPU 监控就解释每一个利用率峰谷、能看到一个新论文就立刻判断它属于哪一支血脉、解决的是哪一墙——那就达到了这个专栏想做的事。

Transformer 不会是终点。Mamba、Hybrid、Diffusion-LM、新硬件、新范式——每一条路都在开。但作为今天工业的基础,理解它本身就是一份长期资产——理解了它,下一代架构出来时你能立刻把它「翻译」回 Transformer 的语言、理解它的取舍。


全专栏最终回顾:Transformer 解剖路径图

flowchart TB
  START["第 1 章<br/>为什么是 Transformer<br/>RNN 的两道墙"]
  START --> P2[第二部分 注意力机制]
  P2 --> CH2[第 2 章 Self-Attention]
  P2 --> CH3[第 3 章 Multi-Head]
  P2 --> CH4[第 4 章 位置编码]
  P2 --> CH5[第 5 章 Transformer Block]
  CH5 --> P3[第三部分 架构家族]
  P3 --> CH6[第 6 章 三种架构]
  P3 --> CH7[第 7 章 预训练范式]
  CH7 --> P4[第四部分 从零实现]
  P4 --> CH8[第 8 章 Attention 50 行]
  P4 --> CH9[第 9 章 mini-GPT]
  P4 --> CH10[第 10 章 Tokenizer]
  CH10 --> P5[第五部分 规模化]
  P5 --> CH11[第 11 章 Scaling Laws]
  P5 --> CH12[第 12 章 MoE]
  P5 --> CH13[第 13 章 长上下文]
  CH13 --> P6[第六部分 推理系统]
  P6 --> CH14[第 14 章 两阶段]
  P6 --> CH15[第 15 章 KV Cache]
  P6 --> CH16[第 16 章 量化]
  P6 --> CH17[第 17 章 投机解码]
  P6 --> CH18[第 18 章 Flash Attention 与并行]
  CH18 --> END[第 19 章 Transformer 之后]
  END --> NEXT["接下来读哪个专栏"]

延伸阅读

  • Gu et al., Efficiently Modeling Long Sequences with Structured State Spaces, ICLR 2022(预印本 2021)——S4 论文。
  • Gu & Dao, Mamba: Linear-Time Sequence Modeling with Selective State Spaces, COLM 2024(预印本 2023,arXiv:2312.00752)。
  • Dao & Gu, Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality, ICML 2024(arXiv:2405.21060)——Mamba-2 / 理论统一。
  • Peng et al., RWKV: Reinventing RNNs for the Transformer Era, Findings of EMNLP 2023(arXiv:2305.13048)。
  • Sun et al., Retentive Network: A Successor to Transformer for Large Language Models, 2023(arXiv:2307.08621)——RetNet。
  • Lieber et al., Jamba: A Hybrid Transformer-Mamba Language Model, 2024(arXiv:2403.19887)。
  • Waleffe et al., An Empirical Study of Mamba-based Language Models, 2024(arXiv:2406.07887)——NVIDIA 8B 规模的 Mamba / Mamba-2 / Hybrid / Transformer 对照实验。
  • Glorioso et al., Zamba: A Compact 7B SSM Hybrid Model, 2024(arXiv:2405.16712)。
  • Nie et al., Large Language Diffusion Models (LLaDA), 2025. arXiv:2502.09992——Diffusion-LM 代表作之一。
  • DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning, 2025(arXiv:2501.12948)——test-time compute scaling 开源代表作。
  • Nanda 的 ML 学习路径博客 https://www.neelnanda.io/mechanistic-interpretability/getting-started。