Lux's Blog

Lux's Blog

Scaled Dot Product Attention
发表于2026-07-13|LLM Notes概念笔记
Scaled Dot-Product AttentionAttention 把“当前 query 应该从哪些 key 读取信息”变成一个可微分的加权聚合: $$\operatorname{Attention}(Q,K,V)=\operatorname{softmax}\left(\frac{QK^\top}{\sqrt{d_k}}+M\rig...
Supervised Fine Tuning
发表于2026-07-13|LLM Notes概念笔记
Supervised Fine-Tuning一句话解释SFT 用高质量输入—目标示范继续优化语言模型,使其学会指令遵循、回答格式、领域任务或工具行为。 典型数据 单轮:prompt / response 多轮:messages=[system,user,assistant,...] Tool use:tool schema、assistant...
SGLang
发表于2026-07-13|LLM Notes工具笔记
SGLang一句话定位SGLang 是面向大语言模型及多模态模型的推理与服务系统。 运行时因果链12345结构化 prompt / 多轮程序→ 前端编排与状态复用→ runtime 调度 token、KV 与批次→ GPU kernel 执行→ streaming response / tool result 它的价值不只是“另一个 HTTP ser...
Speculative Decoding
发表于2026-07-13|LLM Notes概念笔记
Speculative Decoding一句话解释推测解码先用较便宜的方法提出多个候选 token,再由目标模型并行验证,以减少目标模型串行 decode 的步数。 仍需实测的变量 解释接受与拒绝过程 区分吞吐提升与单请求延迟提升 对比 Draft Model、Medusa、EAGLE 与 MTP 接受/拒绝的最小流程123456已有...
Tokenization and BPE
发表于2026-07-13|LLM Notes概念笔记
Tokenization and BPETokenizer 是模型看到世界的第一层接口:它把字节或文本映射成整数 token IDs,再由 embedding 映射到向量。切分方式同时决定序列长度、训练 FLOPs、KV Cache 占用、跨语言公平性和生成时的边界,因此“词表只是预处理”是错误的低估。 一次编码经过什么1234567原始文本→ nor...
Training Memory Accounting
发表于2026-07-13|LLM Notes概念笔记
Training Memory Accounting组成1234567model parameters+ gradients+ optimizer states+ master weights / mixed-precision copies+ activations+ temporary buffers and communication works...
Triton Language
发表于2026-07-13|LLM Notes工具笔记
Triton Language一句话定位Triton 是编写高性能 GPU kernel 的语言和编译器,使开发者能以高层次方式表达 block/tile 计算,再生成 GPU 代码。 系统位置1234attention / GEMM algorithm→ PyTorch operator or custom op→ Triton / CUD...
Transformer Block
发表于2026-07-13|LLM Notes概念笔记
Transformer BlockTransformer block 的核心分工是“跨位置通信 + 逐位置变换”。Attention 让一个 token 读取其他可见 token,FFN/MoE 在每个位置独立改变表示;残差把新信息加回旧流,归一化控制数值尺度。把这几件事混成“一个大网络层”,就解释不了缓存、并行和故障定位。 12345tok...
vLLM
发表于2026-07-13|LLM Notes工具笔记
vLLM一句话定位vLLM 是面向大语言模型推理与服务的引擎,重点处理请求调度、模型执行和 KV Cache 管理。 它解决的核心矛盾不是“怎样算出下一个 token”——模型本身已经定义了计算——而是多个长度不同、到达时间不同的请求如何共享有限 GPU 计算与 KV Cache,又不让空闲槽位和内存碎片吞掉吞吐。 在系统中的位置12345应用 / S...
Tensor Shape
发表于2026-07-13|LLM Notes概念笔记
Tensor Shape张量 shape 不是排版信息,而是模型中“谁和谁相乘、沿哪个轴归约、结果回到哪里”的接口契约。看不懂 shape,就无法判断一个 attention 实现到底是在 batch、head 还是 sequence 维度上做了错误广播。 统一符号与数据流 B:并行请求或样本数;T:序列长度;D:hidden size。 Hq &#x...
1…678
avatar
Lux
笔记
文章
75
标签
103
分类
9
GitHub
分类
  • LLM Notes72
    • 主题地图10
    • 工具笔记10
    • 概念笔记43
    • 知识库总览4
    • 问题笔记4
    • 项目笔记1
  • 产品文档2
  • 技术笔记1
标签
MQA Low-Rank Adaptation Iteration-level Scheduling hx_llm infra, inference, training, serving PD 分离之后 KV Cache 怎么传输 AI Infrastructure rag, agent, application AI办公 vLLM 推理引擎 奖励模型 Proximal Policy Optimization PD Disaggregation LLM 面试准备 Training Parameter-Efficient Fine-Tuning, 参数高效微调 inference, serving, infra 商业分析 推测解码 推理引擎选型, vLLM SGLang TensorRT-LLM LMDeploy 选型 agent, training 键值缓存 解码阶段 training, transformer training 连续批处理 AI Infra 七层技术栈 分页注意力 RAG 端到端优化地图 推理强化学习, Reasoning Reinforcement Learning inference 未解决问题 大模型训练生命周期 多头注意力 AI 系统性能瓶颈 training, agent Agents infra, inference, training Quantized LoRA 飞书
© 2025 - 2026 By Lux框架 Hexo 8.1.2|主题 Butterfly 5.6.1