Training

条目状态与系统位置

本图位于 Training Layer,覆盖数据/目标、优化、显存、并行与能力回归;它向下依赖 Model/Infra,向上影响 Inference 与 Agentic RL。已有独立文章和地图概念分开:有链接即可直接阅读;“未单列”表示由指定文章承载;“待建”表示现在没有独立正文。

学习顺序与决策边界

1
2
3
4
5
6
7
数据/目标
→ 生命周期阶段
→ 全参或 PEFT
→ 显存账本
→ DP/ZeRO/并行切分
→ 评测与回归
→ 进入推理/Agent 闭环

每一层都依赖上一层的验收:没有可靠数据和 loss mask,换 LoRA 没意义;没有显存/通信测量,换 ZeRO 只是配置赌博;没有旧能力回归,训练 loss 下降不能算成功。

1. 全生命周期

2. 数据与目标

3. 参数高效微调

4. 显存与数值

5. 并行与切分

  • Data Parallelism
  • Tensor / Pipeline / Expert Parallelism(待建;训练并行与推理并行不要混读)
  • ZeRO / FSDP
  • NCCL 与通信(待建:目前只在 DP/ZeRO/Infra 文章中作为机制出现)

6. 框架和运行时

  • PyTorch
  • DeepSpeed
  • Hugging Face Accelerate / TRL(待建)
  • Ray Train / verl(待建:Ray 文章只覆盖运行时编排)

7. 能力保持与评测

来源提醒

源仓库有多个空占位文件,且 LoRA/PEFT/NF4 与分布式边界存在概念错误。迁移记录见 FAQ Repository Migration Index

从 loss 到可用模型的验收链

训练配置的正确顺序不是先挑算法名,而是先证明数据和目标:样本能否被 tokenizer 正确表示,response-only mask 是否屏蔽了不应学习的 prompt,训练 loss 是否与独立验证集一致。接着才判断全参、LoRA 或 QLoRA 是否能在显存预算内更新所需模块;再根据显存账本选择梯度累积、checkpoint、DP/ZeRO 或更复杂的切分。最后必须跑旧能力、目标能力、长上下文和安全回归,并把 checkpoint 加载到推理链验证。

例如 loss 下降但工具调用格式变坏,问题可能是数据模板或 label mask,不是 LoRA rank;显存溢出也可能来自 activation 和 sequence length,而不是参数副本。每个阶段都应保存可复现配置、有效 token 数、梯度/optimizer 状态和失败样例,才能把“训练成功”与“指标下降”区分开。