Lux's Blog

Lux's Blog

MOC Training
发表于2026-07-13|LLM Notes主题地图
Training条目状态与系统位置本图位于 Training Layer,覆盖数据/目标、优化、显存、并行与能力回归;它向下依赖 Model/Infra,向上影响 Inference 与 Agentic RL。已有独立文章和地图概念分开:有链接即可直接阅读;“未单列”表示由指定文章承载;“待建”表示现在没有独立正文。 学习顺序与决策...
MOC Transformer
发表于2026-07-13|LLM Notes主题地图
Transformer条目状态与系统位置本图的链接均指向已有文章;没有独立链接的实现名词只表示“代码来源/横向概念”,不代表缺页。Transformer 主体位于 Model Layer;从 KV Cache、Prefill、Decode 开始进入 Inference computation / request memory。 学习...
Multi GPU and Multi Node LLM Inference
发表于2026-07-13|LLM Notes概念笔记
Multi-GPU and Multi-Node LLM Inference并行维度 Tensor Parallelism:切分层内张量和 GEMM,通信频繁。 Pipeline Parallelism:切分层,存在 stage 与 micro-batch 调度。 Data Parallelism:复制模型,扩展独立请求吞吐。 Expert Paral...
Multi Head Attention
发表于2026-07-13|LLM Notes概念笔记
Multi-Head AttentionMHA 把一个 hidden vector 投影成多组 Q/K/V,让每个 head 在不同参数子空间里学习 token 关系,再把结果拼回原维度。它的价值不是“多算几遍同一个 attention”,而是把容量分配给多个可能互补的关系模式:局部搭配、长距离指代、句法结构或位置模式可以共存。 数...
Open Questions
发表于2026-07-13|LLM Notes知识库总览
Open Questions 问题解决后,将问题笔记的 status 改为 solved,并补充结论及来源。 当前问题 vLLM 和 SGLang 的调度器区别是什么 How PD Disaggregation Transfers KV Why Decode Is Memory Bound Ray 与 Kubernetes 的调度边界是什么 记录规...
PagedAttention
发表于2026-07-13|LLM Notes概念笔记
PagedAttention一句话解释PagedAttention 将请求的 KV Cache 组织为可映射的固定大小块,以减少连续分配带来的碎片与容量浪费。 问题从哪里来每个请求的 KV Cache 随 token 逐步增长,而最终输出长度事先未知。如果系统先为最大长度预留连续显存,会产生大量未使用空间;如果要求增长时仍保持连续,又容易遇到外部碎片和...
PEFT
发表于2026-07-13|LLM Notes概念笔记
PEFTPEFT 是 Parameter-Efficient Fine-Tuning,即只训练较少参数的微调方法族,而不是“性能估计和建模”。 方法族 低秩更新:LoRA、QLoRA Adapter:在网络中加入小型可训练模块 Soft prompt:Prompt Tuning、Prefix Tuning、P-Tuning 边界LoRA 不是 pro...
Positional Encoding and RoPE
发表于2026-07-13|LLM Notes概念笔记
Positional Encoding and RoPE自注意力对输入 token 做集合式的加权交互;如果不注入位置,A B 与 B A 可能得到同一组交互模式。位置编码的任务不是告诉模型“第几个 token”这么简单,而是让 attention 的相似度随相对距离和方向变化。 几类位置机制 机制 注入位置 主要性质 典型边界 learne...
Prefill
发表于2026-07-13|LLM Notes概念笔记
Prefill一句话解释Prefill 一次处理输入提示词,计算首个输出 token 所需状态并填充 KV Cache。 对比 相比 Decode,Prefill 通常具有更高的并行度。 与 Decode 的资源特征不同,因此出现 Prefill-Decode Disaggregation。 一次 prefill 的数据流123456prompt [...
PPO
发表于2026-07-13|LLM Notes概念笔记
PPOPPO 是 on-policy policy-gradient 方法,通过限制新旧策略的更新幅度来提升训练稳定性。 在 LLM 后训练中,典型流程是 rollout → reward → advantage → clipped policy update,并常加入 reference model 的 KL 约束。 PPO 不“必须”使用独立训练的...
1…456…8
avatar
Lux
笔记
文章
75
标签
103
分类
9
GitHub
分类
  • LLM Notes72
    • 主题地图10
    • 工具笔记10
    • 概念笔记43
    • 知识库总览4
    • 问题笔记4
    • 项目笔记1
  • 产品文档2
  • 技术笔记1
标签
MQA Low-Rank Adaptation Iteration-level Scheduling hx_llm infra, inference, training, serving PD 分离之后 KV Cache 怎么传输 AI Infrastructure rag, agent, application AI办公 vLLM 推理引擎 奖励模型 Proximal Policy Optimization PD Disaggregation LLM 面试准备 Training Parameter-Efficient Fine-Tuning, 参数高效微调 inference, serving, infra 商业分析 推测解码 推理引擎选型, vLLM SGLang TensorRT-LLM LMDeploy 选型 agent, training 键值缓存 解码阶段 training, transformer training 连续批处理 AI Infra 七层技术栈 分页注意力 RAG 端到端优化地图 推理强化学习, Reasoning Reinforcement Learning inference 未解决问题 大模型训练生命周期 多头注意力 AI 系统性能瓶颈 training, agent Agents infra, inference, training Quantized LoRA 飞书
© 2025 - 2026 By Lux框架 Hexo 8.1.2|主题 Butterfly 5.6.1