MOC Training
Training
条目状态与系统位置
本图位于 Training Layer,覆盖数据/目标、优化、显存、并行与能力回归;它向下依赖 Model/Infra,向上影响 Inference 与 Agentic RL。已有独立文章和地图概念分开:有链接即可直接阅读;“未单列”表示由指定文章承载;“待建”表示现在没有独立正文。
学习顺序与决策边界
1 | 数据/目标 |
每一层都依赖上一层的验收:没有可靠数据和 loss mask,换 LoRA 没意义;没有显存/通信测量,换 ZeRO 只是配置赌博;没有旧能力回归,训练 loss 下降不能算成功。
1. 全生命周期
- LLM Training Lifecycle
- Base Pre-training(待建:生命周期文章只有阶段总览)
- Mid-training / Annealing(待建:生命周期文章只有阶段总览)
- Supervised Fine-Tuning
- Reasoning RL
- Agentic RL
2. 数据与目标
- Tokenization and BPE
- Next Token Prediction / Cross Entropy(未单列:见 Autoregressive Generation)
- Training Data Mixture(待建)
- Instruction / Preference / Verifiable Reward Data(分散在 SFT、DPO 和 Reward Model)
- Agentic Training Data(未单列:见 Agentic RL)
3. 参数高效微调
- PEFT
- LoRA
- QLoRA
- Prompt / Prefix / P-Tuning(待建:PEFT 文章只做方法族定位)
- Hugging Face PEFT
4. 显存与数值
- Training Memory Accounting
- Mixed Precision(未单列:见 Training Memory Accounting)
- Gradient Accumulation / Checkpointing(未单列:见 Training Memory Accounting)
- Optimizer State(未单列:见 Training Memory Accounting)
5. 并行与切分
- Data Parallelism
- Tensor / Pipeline / Expert Parallelism(待建;训练并行与推理并行不要混读)
- ZeRO / FSDP
- NCCL 与通信(待建:目前只在 DP/ZeRO/Infra 文章中作为机制出现)
6. 框架和运行时
7. 能力保持与评测
- Catastrophic Forgetting
- Replay、正则、蒸馏与模型合并(未单列:先读 Catastrophic Forgetting)
- 通用、领域、推理、工具和安全回归集
来源提醒
源仓库有多个空占位文件,且 LoRA/PEFT/NF4 与分布式边界存在概念错误。迁移记录见 FAQ Repository Migration Index。
从 loss 到可用模型的验收链
训练配置的正确顺序不是先挑算法名,而是先证明数据和目标:样本能否被 tokenizer 正确表示,response-only mask 是否屏蔽了不应学习的 prompt,训练 loss 是否与独立验证集一致。接着才判断全参、LoRA 或 QLoRA 是否能在显存预算内更新所需模块;再根据显存账本选择梯度累积、checkpoint、DP/ZeRO 或更复杂的切分。最后必须跑旧能力、目标能力、长上下文和安全回归,并把 checkpoint 加载到推理链验证。
例如 loss 下降但工具调用格式变坏,问题可能是数据模板或 label mask,不是 LoRA rank;显存溢出也可能来自 activation 和 sequence length,而不是参数副本。每个阶段都应保存可复现配置、有效 token 数、梯度/optimizer 状态和失败样例,才能把“训练成功”与“指标下降”区分开。
本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来源 Lux's Blog!