MOC Transformer
Transformer
条目状态与系统位置
本图的链接均指向已有文章;没有独立链接的实现名词只表示“代码来源/横向概念”,不代表缺页。Transformer 主体位于 Model Layer;从 KV Cache、Prefill、Decode 开始进入 Inference computation / request memory。
学习顺序与因果链
1 | tokenizer / ids / shape |
先用 shape ledger 验证每个 axis,再讨论优化;任何“更快”都要说明是 FLOPs、显存读写、KV 还是调度收益。MHA→GQA→MQA 是同一注意力结构的存储/带宽取舍,不是三个互不相干的算法。
数学与张量基础
核心结构
- Multi-Head Attention
- Multi-Query Attention
- Grouped-Query Attention
- Causal Mask
- Transformer Block
- Autoregressive Generation
推理延伸
代码来源
- 源仓库中的手写 attention 代码用于 shape 和机制讲解;mask、device、连续性和模型结构问题见 FAQ Repository Migration Index。
每个阶段要留下什么证据
读完 tokenizer 到 block,不要只记公式。对一个短序列保留 token ids、每层 Q/K/V shape、causal mask、RoPE 后的值范围和 logits;对增量 decode 再比较 full forward 与 KV cache 的输出是否一致。shape ledger 能发现 head 数、position offset 和 batch 维度错误,logit 对齐能发现 cache 或 mask 错误。
MHA/MQA/GQA 的横向比较也要落到同一份账本:query heads 是否保持不变、KV heads 如何映射、cache 字节数如何变化、质量回归在哪个 benchmark 暴露。由此才能把“架构变化”连接到 Decode 的带宽和 KV Cache 的容量,而不是把它们当成孤立术语。
本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来源 Lux's Blog!