AI Overview

这张总图的边界

这里的七个入口是系统层,不是七篇必然存在的文章。可点击的是已有 MOC;未链接层级由下方 MOC 覆盖,尚未建立独立地图的地方标为“待建”,避免把层级名称误读成断链。

一张地图怎么使用

从问题出发而不是从工具名出发:

1
2
3
4
5
6
要学会模型机制 → Transformer
要改变模型行为 → Training
要降低生成成本 → Inference
要把模型稳定上线 → Serving/LLMOps
要让模型执行任务 → Agents/RAG
要支撑规模与可靠性 → AI Infra

跨主题阅读时保留“问题—机制—代价—验收”四个问句,避免把同一个概念在训练、推理和平台层重复定义。

按模型生命周期

  1. Data Processing(待建:目前没有独立 MOC)
  2. Pre-training(未单列:见 MOC - Training
  3. Post-training(未单列:见 MOC - Training
  4. Inference
  5. Serving & LLMOps
  6. LLM Apps & Agents

按系统技术栈

  1. Application / Agent(见 MOC - Agents
  2. Serving / LLMOps(见 MOC - Serving and LLMOps
  3. Training & Inference Engine(分别见 MOC - TrainingMOC - Inference
  4. Distributed Runtime(未单列:见 MOC - AI Infra
  5. Framework(未单列:见 AI Infra MOC)
  6. Kernel / Compiler(未单列:见 AI Infra MOC)
  7. Hardware / Cluster(未单列:见 AI Infra MOC)

主题地图

用一个请求穿过整张地图

不要把生命周期和技术栈当成两张互不相干的目录。一个“长文档问答并调用工具”的请求会依次触碰:tokenizer/Transformer 产生 token 概率,prefill/decode 与 KV 决定延迟,RAG 提供外部证据,Agent Loop 决定下一动作,serving 负责 admission/trace,AI Infra 决定 GPU、网络和恢复。任何一层的优化都可能改变另一层的预算:增大 context 提高证据覆盖,却增加 prefill 和 KV;增加 agent 步数提高完成率,却增加工具费用和 p99。

选阅读入口

从“要解释什么”选模型与 Transformer;从“要改变什么行为”进入 Training;从“用户等多久/成本多少”进入 Inference;从“能否稳定恢复和回滚”进入 Serving/Infra;从“如何完成外部任务”进入 Agents/RAG。读完入口后必须返回一个下游验收指标,否则只是术语浏览:模型笔记回到 shape/loss,推理回到 TTFT/TPOT,Agent 回到环境成功谓词,平台回到 SLO 与故障恢复。