为什么写这本书

2023 年底,我在 Bilibili 上发布了一系列讲解 Transformer 的视频。最初只是想把自己学习的过程记录下来,没想到收到了很多观众的反馈:"张老师,能不能出个文字版?视频看完就忘了,想要能反复查阅的资料。"

这本书就是那个"文字版"。

但它不是视频的简单转录。在整理的过程中,我重新思考了概念的讲解顺序,补充了视频中一笔带过的细节,并逐步加入推理模型、偏好学习、Mixture of Experts 和 Mamba 等主题。本书按原理组织,不把某个月的模型榜单当作长期有效的学习顺序。

这些内容在我录制视频时还不存在。AI 领域的发展速度,确实超出了所有人的预期。


这本书的写作理念

直觉优先,公式其次。

我见过太多技术书籍,上来就是一堆公式,读者还没建立起任何直觉,就被符号淹没了。这本书的每一章都遵循同样的结构:

  1. 先讲"为什么" —— 这个东西要解决什么问题?
  2. 再建立直觉 —— 用类比、图示、几何解释让你"感受"到它
  3. 然后看公式 —— 有了直觉之后,公式只是精确的描述
  4. 最后写代码 —— 能跑起来的代码,才是真正的理解

如果你读完一章,能用自己的话向别人解释清楚,而不是只会背公式——那这一章就成功了。


谁适合读这本书

这本书适合你,如果:

  • 你用过 ChatGPT,想知道它背后是怎么工作的
  • 你看过一些 Transformer 的介绍,但总觉得似懂非懂
  • 你想从零实现一个 GPT,而不是只会调 API
  • 你是算法工程师,需要一本能快速查阅的中文参考书
  • 你想把新的模型架构放回一张稳定的知识地图中理解

这本书可能不适合你,如果:

  • 你是深度学习的完全新手(建议先学习基础的神经网络知识)
  • 你需要严格的数学证明(这不是一本学术专著)
  • 你只想快速调用现成的模型(直接用 Hugging Face 就好)

如何阅读这本书

快速入门(1-2 天): Part 1 全部 → 第 10 章(QKV)→ 第 15 章(完整前向传播)

系统学习(1-2 周): Part 1-5 顺序阅读,跟着敲代码

生产部署(按需): Part 6-8,重点关注 Flash Attention、KV Cache、量化

架构进阶(按主题): Part 9,了解 RLHF、MoE、推理模型、后 Transformer 架构

每章结尾都有"本章交付物"清单,你可以用它检验自己是否真正理解了。


2026 年如何用这本书解决具体问题

不必因为模型名字更新,就重新从第一章读起。先确定自己缺少的是原理、实现还是工程知识,再进入对应章节:

你的问题阅读入口学完应能检验什么
Attention 的 Q、K、V 到底在做什么?第 10 章:QKV第 15 章:前向传播写出各张量形状,解释因果掩码的位置
怎样从零实现一个小模型?第 18 章:Model.py → 第 19、20 章区分训练损失下降、生成行为和模型能力评估
为什么长上下文更占显存、推理更慢?第 21 章:Flash Attention第 22 章:KV Cache区分注意力计算、缓存存储和生成阶段的瓶颈
显存有限,应该微调还是量化?第 26 章:LoRA第 27 章:量化区分可训练参数减少、权重精度降低与质量评估
学会 Transformer 后,怎样理解 Agent?Agent 书前言区分模型内部计算与外部工具、状态、验证流程

建议把三个原始材料放在手边:Attention Is All You Need 对照架构,FlashAttention 对照 IO 优化,LoRA 对照低秩适配。先读相关章节,再回论文核对假设和实验条件,不必一开始就啃完全文。

原视频的 2023–2024 年份是出版历史;章节的明确更新日期记录内容变化。二者不同,也不表示所有代码都已在最新依赖版本上重新测试。

关于代码

本书的代码都可以实际运行。我选择从零手写而不是调用框架,是因为:

# 这行代码:
output = nn.MultiheadAttention(embed_dim, num_heads)(query, key, value)

# 不如这样写更能帮助理解:
scores = torch.matmul(Q, K.transpose(-2, -1)) / math.sqrt(d_k)
scores = scores.masked_fill(mask == 0, -1e9)
attention_weights = F.softmax(scores, dim=-1)
output = torch.matmul(attention_weights, V)

当你能写出第二种代码时,你才真正理解了 Attention。


致谢

感谢所有在 Bilibili 上留言、提问、纠错的观众。你们的反馈让我意识到哪些地方讲得不够清楚,哪些地方需要补充。这本书的很多改进,都来自于你们的问题。

感谢 Geoffrey Hinton、Ilya Sutskever、Andrej Karpathy 等前辈的公开课程和分享。站在巨人的肩膀上,我们才能看得更远。

感谢我的家人,容忍我在深夜和周末对着电脑自言自语地录视频、写文档。

最后,感谢你选择阅读这本书。希望它能帮助你真正理解 Transformer,而不只是"知道"它。


Wayland Zhang(张老师)

时间线: 原视频录制 2023年12月 - 2024年3月,文字整理 2026年1月

"The best way to learn is to teach."


勘误与反馈

如果你发现书中的错误,或有任何建议,欢迎通过以下方式联系我:

  • Bilibili: @LLM张老师
  • GitHub: github.com/WaylandZhang

我会持续更新和修正内容。技术书籍难免有疏漏,感谢你的理解和帮助。

引用本文 / Cite
Zhang, Wayland (2026). 前言. In Transformer 架构:从直觉到实现. https://waylandz.com/llm-transformer-book/%E5%89%8D%E8%A8%80/
@incollection{zhang2026transformer_chapter_yyvwlk,
  author = {Zhang, Wayland},
  title = {前言},
  booktitle = {Transformer 架构:从直觉到实现},
  year = {2026},
  url = {https://waylandz.com/llm-transformer-book/%E5%89%8D%E8%A8%80/}
}