AI Knowledge Base

用主题地图管理学习路径,用内部链接沉淀概念之间的关系。

先读这套导航协议

地图里的条目不再默认意味着“这里有一篇同名文章”:

  • 可点击链接:已有独立文章,点击即可阅读。
  • 未单列:概念存在,但当前由上位文章覆盖;条目旁应给出承载它的文章。
  • 待建:目前只有地图占位,没有独立文章;不要把它误认为断链。
  • 问题笔记:实现或事实仍需实验/版本核验,结论不应当当作稳定原理。

文章开头的“系统定位”说明它位于模型、训练、推理、Serving/API、Agent Runtime 或 Infra 哪一层;跨层文章会明确写出上下游,而不是靠读者猜。

快速入口

1. 模型生命周期

2. 按系统层寻找

你要找的东西 首选入口 典型核心节点
模型内部如何计算 MOC - Transformer Attention、RoPE、Transformer Block
模型如何被训练/改变 MOC - Training SFT、LoRA、DPO、ZeRO
一次请求如何生成 token MOC - Inference KV Cache、Prefill、Decode
如何把引擎变成服务 MOC - Serving and LLMOps routing、SLO、灰度、回滚
模型如何执行外部任务 MOC - Agents Agent Loop、State、Tool Calling
资源、通信与故障在哪里 MOC - AI Infra GPU、kernel、Ray、Kubernetes

KV Cache 的最短路径

如果只想理解 KV Cache,不要从全库搜索:

1
2
3
4
5
6
[KV Cache](/2026/07/13/llm-note-kv-cache-28707f541b/)
→ [Prefill](/2026/07/13/llm-note-prefill-3732a1d659/)
→ [Decode](/2026/07/13/llm-note-decode-069b2b506a/)
→ [PagedAttention](/2026/07/13/llm-note-pagedattention-12580957bc/)
→ [Continuous Batching](/2026/07/13/llm-note-continuous-batching-ac3f68032b/)
→ [PD Disaggregation](/2026/07/13/llm-note-prefill-decode-disaggregation-0e28910a5c/)

这条路径依次回答:缓存是什么、在哪生成、如何被读取、如何分配、如何服务多请求、如何跨节点移动。

知识库架构约束

这套库把“概念身份”和“文章身份”分开处理:一个概念可以暂时没有独立文章,也可以被上位文章覆盖;只有确定需要独立因果链、实验或实现边界时,才新建 note。这样 MOC 是地图,不会变成大量只有标题的伪文章。

  • 每篇文章设一个主系统层,跨层影响写在正文和链接里;KV Cache 的主层是 Inference Computation,但它同时受 Model 的 GQA、Serving 的 admission 和 Infra 的 HBM 约束。
  • MOC 只负责入口、状态和阅读顺序;机制、公式、失败模式放在独立文章中,避免同一概念在多个地图里漂移。
  • 每个未链接条目必须落入“未单列”或“待建”之一;如果两者都没有,就视为导航缺陷,而不是让读者猜。
  • 高频节点要有稳定的多入口:KV Cache 既从 Inference、Transformer 进入,也从 Serving、AI Knowledge Base 和面试索引进入。

3. 系统技术栈

4. 当前学习主线

  • Transformer From Scratch
  • LLM Inference System
  • Distributed LLM Inference
  • Agentic RL System

5. 当前项目

6. 维护原则

  1. 一篇文章解决一个相对独立的问题。
  2. 新写之前先搜索现有文章,能补旧文就不重复建文。
  3. 用标准 Markdown 链接补充上游、下游和易混淆概念。
  4. 不确定的结论保留验证边界,不把版本能力写成永久事实。
  5. 直接维护 source/_posts/,构建只负责渲染,不再同步第二份内容源。