AI Knowledge Base
AI Knowledge Base 用主题地图管理学习路径,用内部链接沉淀概念之间的关系。 先读这套导航协议地图里的条目不再默认意味着“这里有一篇同名文章”: 可点击链接:已有独立文章,点击即可阅读。 未单列:概念存在,但当前由上位文章覆盖;条目旁应给出承载它的文章。 待建:目前只有地图占位,没有独立文章;不要把它误认为断链。 问题笔记:实现或事实...
Autoregressive Generation
Autoregressive Generation一句话解释自回归生成把联合分布拆成按位置的条件概率:P(x1...xT)=∏t P(xt | x<t)。模型每一步只决定下一个 token,再把它放回上下文;这让训练可以并行,却使在线生成天然带有串行依赖。 执行阶段 Prefill:一次处理已有提示词。 Decode:循环生成后续 token。 ...
AI System Performance Bottlenecks
AI System Performance Bottlenecks看到一项新技术时,问两个问题:它在第几层?它主要解决哪类瓶颈? 六类瓶颈 Compute:FLOPs、Tensor Core、GEMM、kernel fusion。 VRAM:参数、梯度、optimizer state、activation、KV Cache。 Memory bandwi...
Catastrophic Forgetting
Catastrophic Forgetting模型在新数据或新目标上继续训练时,可能损害原有任务和通用能力,这称为灾难性遗忘。 常见原因 新数据分布过窄或与原能力冲突。 学习率过大、训练时间过长。 缺少旧任务 replay 或通用能力约束。 评测只看新任务,未建立回归集。 缓解方向 混合 replay 数据与代表性旧任务。 更小学习率、合理 warm...
Causal Mask
Causal Mask因果掩码把“当前位置不能偷看未来”写成 attention 的可见性约束。它不是一种正则化,也不是为了让模型更懂时间;它保证训练时的条件分布与生成时逐 token 展开的问题定义一致。 从目标函数到矩阵自回归目标是: 1P(x1...xT) = ∏t P(xt | x<t) 训练可以并行计算所有位置,但第 t 行的 att...
Data Parallelism
Data Parallelism数据并行在多个 worker 上复制模型,把不同 mini-batch 分片交给各 worker 计算,再同步梯度以保持参数一致。 DDP 流程 每个进程持有一份模型副本。 DistributedSampler 切分数据。 每个进程独立 forward/backward。 梯度通过 collective com...
Continuous Batching
Continuous Batching一句话解释连续批处理在迭代边界动态加入新请求并移除已完成请求,提高推理设备利用率。 它解决什么问题自回归请求需要的 decode 步数不同。静态批处理若把一组请求绑定到全部完成,短请求结束后留下空槽,新请求仍要等待最长请求退出;若为了低延迟减小 batch,又浪费设备并行能力。 连续批处理把调度单位从“整个请求”下...
DeepSpeed
DeepSpeed一句话定位DeepSpeed 是围绕大模型训练的执行与内存优化引擎,重点包括训练状态切分、并行和大规模训练效率。 它负责 ZeRO 等参数、梯度和优化器状态切分 与 PyTorch 模型和 optimizer 集成 混合精度、offload、pipeline 等训练能力 它不负责 不定义 Transformer 数学结构 不替代 P...
Decode
DecodeDecode 是自回归生成中真正“逐 token”的阶段:prefill 一次性消化提示词之后,decode 进入循环——读取历史状态、执行一次模型 forward、采样出下一个 token,再把 token 追加进上下文重复此过程,直至 EOS 或长度上限。每生成一个 token 就是一次完整的模型调用,这个结构性事实决定了它的一切性能特...
DPO
DPODPO 直接用 (prompt, chosen, rejected) 偏好对优化策略相对参考模型的偏好,不需要显式训练 reward model 再执行在线 rollout。 适合回答的比较 相比 PPO:流程更简单、离线,但不执行同样的在线策略探索。 相比 SFT:使用成对偏好信号,而非只最大化一个目标回答的似然。 beta 控制偏好优化与参考...