FAQ Repository Migration Index
FAQ Repository Migration Index迁移原则本轮逐文件审阅源仓库中的 Markdown、Python 和 Notebook,并按以下规则处理: 稳定知识拆成 concept 或 tool,不沿用源仓库的技术目录层级。 长篇问答按主题合并,避免同一 LoRA、RAG 或分布式问题产生多份正文。 可运行价值较高的实现进入 50_C...
How PD Disaggregation Transfers KV
How PD Disaggregation Transfers KV为什么值得回答KV Cache 的跨节点传输路径会直接影响 PD 分离的首 token 延迟、吞吐与部署拓扑。 验证路径 明确 KV Cache 的字节规模 比较 GPU Direct、RDMA、主机中转等传输路径 调研具体推理系统的传输与路由实现 测量计算与传输能否重叠 机...
Current Learning
Current Learning本周主线 用同一模型和负载跑通“prefill/decode → KV → batching → engine”因果链,并产出一张可复现性能表。 正在生长的笔记 Multi-Head Attention KV Cache vLLM 本周输出 完成一篇能够独立解释的 evergreen 笔记 写一个最小...
Inference Engine Selection
Inference Engine Selection推理引擎选型不是给工具排总榜,而是把一类工作负载映射到可验证的执行系统。不存在脱离场景的“最好引擎”:同一个引擎可以在离线吞吐测试里占优,却因为 P99、模型格式、硬件拓扑或运维边界而不适合线上服务。 先划清系统边界选型对象必须处在同一层,否则比较表看起来完整,结论却没有意义。 对象 主要回答 ...
Kubernetes
Kubernetes一句话定位Kubernetes 是容器与集群编排平台,负责 Pod 在节点上的落点、资源申请、重启、网络、服务发现、扩缩容和隔离。 它负责 CPU/GPU/内存等粗粒度资源分配 container lifecycle 与健康检查 service discovery、网络和存储挂载 deployment、autos...
Hugging Face PEFT
Hugging Face PEFTHugging Face PEFT 是实现和管理 LoRA、Prefix/Prompt Tuning 等参数高效微调方法的工具库。 典型职责 为基础模型注入 adapter 选择 target modules 与配置 rank/scaling 保存、加载和切换 adapter 将 adapter 合...
KV Cache
KV Cache自回归生成有一个看似昂贵的性质:每生成一个 token,都要对全部历史 token 重算注意力。幸运的是,历史 token 的 Key 和 Value 投影不会因为尾部新增 token 而改变——KV Cache 正是利用这一点,把每一层注意力的 K/V 保存下来,让 decode 时只需计算新 token 的投影并与缓存交互...
LLM Inference Optimization Map
LLM Inference Optimization Map指标 TTFT:首 token 延迟,常受排队与 prefill 影响。 TPOT:后续每 token 延迟,常受 decode 与 batch 状态影响。 Throughput:单位时间完成的 tokens 或 requests。 P95/P99:尾延迟。 GPU 利用率、KV c...
LLM Quantization Deployment
LLM Quantization Deployment一句话解释量化通过降低权重(或激活/KV)的数值表示精度来换取显存和带宽,但”几 bit”只是入口——真正决定质量的是编码 recipe、bit 分配策略和硬件 kernel 支持的合力。 四层分类框架 层次 回答的问题 代表 数值格式 一个数怎么表示 BF16、FP8、NVFP...
LLM Training Lifecycle
LLM Training Lifecycle主线123456Base Pre-training→ Mid-training / Annealing→ Supervised Fine-Tuning→ Preference Alignment / Reasoning RL→ Agentic RL→ Evaluation, deployment and da...