MOC Training
Training条目状态与系统位置本图位于 Training Layer,覆盖数据/目标、优化、显存、并行与能力回归;它向下依赖 Model/Infra,向上影响 Inference 与 Agentic RL。已有独立文章和地图概念分开:有链接即可直接阅读;“未单列”表示由指定文章承载;“待建”表示现在没有独立正文。 学习顺序与决策...
MOC Transformer
Transformer条目状态与系统位置本图的链接均指向已有文章;没有独立链接的实现名词只表示“代码来源/横向概念”,不代表缺页。Transformer 主体位于 Model Layer;从 KV Cache、Prefill、Decode 开始进入 Inference computation / request memory。 学习...
Multi GPU and Multi Node LLM Inference
Multi-GPU and Multi-Node LLM Inference并行维度 Tensor Parallelism:切分层内张量和 GEMM,通信频繁。 Pipeline Parallelism:切分层,存在 stage 与 micro-batch 调度。 Data Parallelism:复制模型,扩展独立请求吞吐。 Expert Paral...
Multi Head Attention
Multi-Head AttentionMHA 把一个 hidden vector 投影成多组 Q/K/V,让每个 head 在不同参数子空间里学习 token 关系,再把结果拼回原维度。它的价值不是“多算几遍同一个 attention”,而是把容量分配给多个可能互补的关系模式:局部搭配、长距离指代、句法结构或位置模式可以共存。 数...
Open Questions
Open Questions 问题解决后,将问题笔记的 status 改为 solved,并补充结论及来源。 当前问题 vLLM 和 SGLang 的调度器区别是什么 How PD Disaggregation Transfers KV Why Decode Is Memory Bound Ray 与 Kubernetes 的调度边界是什么 记录规...
PagedAttention
PagedAttention一句话解释PagedAttention 将请求的 KV Cache 组织为可映射的固定大小块,以减少连续分配带来的碎片与容量浪费。 问题从哪里来每个请求的 KV Cache 随 token 逐步增长,而最终输出长度事先未知。如果系统先为最大长度预留连续显存,会产生大量未使用空间;如果要求增长时仍保持连续,又容易遇到外部碎片和...
PEFT
PEFTPEFT 是 Parameter-Efficient Fine-Tuning,即只训练较少参数的微调方法族,而不是“性能估计和建模”。 方法族 低秩更新:LoRA、QLoRA Adapter:在网络中加入小型可训练模块 Soft prompt:Prompt Tuning、Prefix Tuning、P-Tuning 边界LoRA 不是 pro...
Positional Encoding and RoPE
Positional Encoding and RoPE自注意力对输入 token 做集合式的加权交互;如果不注入位置,A B 与 B A 可能得到同一组交互模式。位置编码的任务不是告诉模型“第几个 token”这么简单,而是让 attention 的相似度随相对距离和方向变化。 几类位置机制 机制 注入位置 主要性质 典型边界 learne...
Prefill
Prefill一句话解释Prefill 一次处理输入提示词,计算首个输出 token 所需状态并填充 KV Cache。 对比 相比 Decode,Prefill 通常具有更高的并行度。 与 Decode 的资源特征不同,因此出现 Prefill-Decode Disaggregation。 一次 prefill 的数据流123456prompt [...
PPO
PPOPPO 是 on-policy policy-gradient 方法,通过限制新旧策略的更新幅度来提升训练稳定性。 在 LLM 后训练中,典型流程是 rollout → reward → advantage → clipped policy update,并常加入 reference model 的 KL 约束。 PPO 不“必须”使用独立训练的...