Lux's Blog

Lux's Blog

FAQ Repository Migration Index
发表于2026-07-13|LLM Notes知识库总览
FAQ Repository Migration Index迁移原则本轮逐文件审阅源仓库中的 Markdown、Python 和 Notebook,并按以下规则处理: 稳定知识拆成 concept 或 tool,不沿用源仓库的技术目录层级。 长篇问答按主题合并,避免同一 LoRA、RAG 或分布式问题产生多份正文。 可运行价值较高的实现进入 50_C...
How PD Disaggregation Transfers KV
发表于2026-07-13|LLM Notes问题笔记
How PD Disaggregation Transfers KV为什么值得回答KV Cache 的跨节点传输路径会直接影响 PD 分离的首 token 延迟、吞吐与部署拓扑。 验证路径 明确 KV Cache 的字节规模 比较 GPU Direct、RDMA、主机中转等传输路径 调研具体推理系统的传输与路由实现 测量计算与传输能否重叠 机...
Current Learning
发表于2026-07-13|LLM Notes知识库总览
Current Learning本周主线 用同一模型和负载跑通“prefill/decode → KV → batching → engine”因果链,并产出一张可复现性能表。 正在生长的笔记 Multi-Head Attention KV Cache vLLM 本周输出 完成一篇能够独立解释的 evergreen 笔记 写一个最小...
Inference Engine Selection
发表于2026-07-13|LLM Notes概念笔记
Inference Engine Selection推理引擎选型不是给工具排总榜,而是把一类工作负载映射到可验证的执行系统。不存在脱离场景的“最好引擎”:同一个引擎可以在离线吞吐测试里占优,却因为 P99、模型格式、硬件拓扑或运维边界而不适合线上服务。 先划清系统边界选型对象必须处在同一层,否则比较表看起来完整,结论却没有意义。 对象 主要回答 ...
Kubernetes
发表于2026-07-13|LLM Notes工具笔记
Kubernetes一句话定位Kubernetes 是容器与集群编排平台,负责 Pod 在节点上的落点、资源申请、重启、网络、服务发现、扩缩容和隔离。 它负责 CPU/GPU/内存等粗粒度资源分配 container lifecycle 与健康检查 service discovery、网络和存储挂载 deployment、autos...
Hugging Face PEFT
发表于2026-07-13|LLM Notes工具笔记
Hugging Face PEFTHugging Face PEFT 是实现和管理 LoRA、Prefix/Prompt Tuning 等参数高效微调方法的工具库。 典型职责 为基础模型注入 adapter 选择 target modules 与配置 rank/scaling 保存、加载和切换 adapter 将 adapter 合...
KV Cache
发表于2026-07-13|LLM Notes概念笔记
KV Cache自回归生成有一个看似昂贵的性质:每生成一个 token,都要对全部历史 token 重算注意力。幸运的是,历史 token 的 Key 和 Value 投影不会因为尾部新增 token 而改变——KV Cache 正是利用这一点,把每一层注意力的 K/V 保存下来,让 decode 时只需计算新 token 的投影并与缓存交互...
LLM Inference Optimization Map
发表于2026-07-13|LLM Notes概念笔记
LLM Inference Optimization Map指标 TTFT:首 token 延迟,常受排队与 prefill 影响。 TPOT:后续每 token 延迟,常受 decode 与 batch 状态影响。 Throughput:单位时间完成的 tokens 或 requests。 P95/P99:尾延迟。 GPU 利用率、KV c...
LLM Quantization Deployment
发表于2026-07-13|LLM Notes概念笔记
LLM Quantization Deployment一句话解释量化通过降低权重(或激活/KV)的数值表示精度来换取显存和带宽,但”几 bit”只是入口——真正决定质量的是编码 recipe、bit 分配策略和硬件 kernel 支持的合力。 四层分类框架 层次 回答的问题 代表 数值格式 一个数怎么表示 BF16、FP8、NVFP...
LLM Training Lifecycle
发表于2026-07-13|LLM Notes概念笔记
LLM Training Lifecycle主线123456Base Pre-training→ Mid-training / Annealing→ Supervised Fine-Tuning→ Preference Alignment / Reasoning RL→ Agentic RL→ Evaluation, deployment and da...
1234…8
avatar
Lux
笔记
文章
75
标签
103
分类
9
GitHub
分类
  • LLM Notes72
    • 主题地图10
    • 工具笔记10
    • 概念笔记43
    • 知识库总览4
    • 问题笔记4
    • 项目笔记1
  • 产品文档2
  • 技术笔记1
标签
MQA Low-Rank Adaptation Iteration-level Scheduling hx_llm infra, inference, training, serving PD 分离之后 KV Cache 怎么传输 AI Infrastructure rag, agent, application AI办公 vLLM 推理引擎 奖励模型 Proximal Policy Optimization PD Disaggregation LLM 面试准备 Training Parameter-Efficient Fine-Tuning, 参数高效微调 inference, serving, infra 商业分析 推测解码 推理引擎选型, vLLM SGLang TensorRT-LLM LMDeploy 选型 agent, training 键值缓存 解码阶段 training, transformer training 连续批处理 AI Infra 七层技术栈 分页注意力 RAG 端到端优化地图 推理强化学习, Reasoning Reinforcement Learning inference 未解决问题 大模型训练生命周期 多头注意力 AI 系统性能瓶颈 training, agent Agents infra, inference, training Quantized LoRA 飞书
© 2025 - 2026 By Lux框架 Hexo 8.1.2|主题 Butterfly 5.6.1