Transformer 实现机制:从下一词预测到手写完整模型
主干教材:Vizuara《The Transformers》(1.1–1.24)。目标:深刻理解 Transformer 每个模块的存在理由与数学运作,通俗类比 + 手算数值 + 代码/图形演示,最后亲手拼出一个完整模型。
学习地图
十五课分三段走:先把文字变成向量(输入段),再造出理解上下文的处理器(注意力与完整 block),最后拼成完整模型、真训练一次。每一课都从一个问题出发——看下面每张卡片的第二行。
第一阶段 · 输入段 把文字变成向量:分词、嵌入、位置(第 1–6 课)
- 第 1 课LLM 全景 —— 下一词预测、缩放定律与三段架构只是猜下一个词而已,凭什么智能?
- 第 2 课分词与 BPE —— 词表是怎么从语料里长出来的模型眼里的"词",到底从哪来?
- 第 3 课 · 补充课中文怎么办 —— 没有空格的语言怎么过 tokenizer 这一关没有空格的中文,模型怎么下刀切?
- 第 4 课词嵌入 —— 意思如何变成几何"意思"怎么变成可以计算的向量?
- 第 5 课 · 补充课余弦相似度 —— 把"像不像"变成一个数两个向量"像不像",怎么量成一个数?
- 第 6 课位置编码 —— 整数、二进制与正弦波注意力天生不认顺序,词袋怎么破?
第二阶段 · 处理器 从注意力诞生到完整 block(第 7–12 课)
- 第 7 课自注意力 I —— 注意力的诞生与 Q/K/V 投影RNN 有瓶颈、LSTM 有死穴,然后呢?
- 第 8 课自注意力 II —— 打分、缩放与 softmax一句话之内,谁该看谁、看多少?
- 第 9 课因果注意力 —— 掩码、数据泄漏与 dropout训练时偷看未来,会出什么事?
- 第 10 课多头注意力 —— 一个头一种眼光一套 Q/K/V 打出的一种分数,照顾得过来吗?
- 第 11 课LayerNorm 与残差 —— 深网络的稳定器网络越深越不稳,谁来做稳定器?
- 第 12 课前馈网络 —— 每个 token 的私人 MLP 与 GELU注意力都干了,FFN 还要干嘛?
第三阶段 · 整合与实战 全景、手拼、真训练(第 13–15 课)
- 第 13 课全景与权衡 —— 为什么赢了 RNN/CNN、预训练与局限注意力全赢了,还有输给 RNN 的地方吗?
- 第 14 课实战 —— numpy 手拼迷你 Transformer 前向零件全齐了,能拼成一台发动机吗?
- 第 15 课T4 实战 —— PyTorch 迷你序列分类器纸上谈完,真刀真枪训练一次呢?
附录 随时可看;课程完结后作为总复习站
- 附录Transformer 全景图 —— 跟着一句话走完一趟前向零件各自都见过了,整台机器到底怎么转?
参考
术语表与速查卡将随课程发布