Scaled Dot Product Attention
Scaled Dot-Product AttentionAttention 把“当前 query 应该从哪些 key 读取信息”变成一个可微分的加权聚合: $$\operatorname{Attention}(Q,K,V)=\operatorname{softmax}\left(\frac{QK^\top}{\sqrt{d_k}}+M\rig...
Supervised Fine Tuning
Supervised Fine-Tuning一句话解释SFT 用高质量输入—目标示范继续优化语言模型,使其学会指令遵循、回答格式、领域任务或工具行为。 典型数据 单轮:prompt / response 多轮:messages=[system,user,assistant,...] Tool use:tool schema、assistant...
SGLang
SGLang一句话定位SGLang 是面向大语言模型及多模态模型的推理与服务系统。 运行时因果链12345结构化 prompt / 多轮程序→ 前端编排与状态复用→ runtime 调度 token、KV 与批次→ GPU kernel 执行→ streaming response / tool result 它的价值不只是“另一个 HTTP ser...
Speculative Decoding
Speculative Decoding一句话解释推测解码先用较便宜的方法提出多个候选 token,再由目标模型并行验证,以减少目标模型串行 decode 的步数。 仍需实测的变量 解释接受与拒绝过程 区分吞吐提升与单请求延迟提升 对比 Draft Model、Medusa、EAGLE 与 MTP 接受/拒绝的最小流程123456已有...
Tokenization and BPE
Tokenization and BPETokenizer 是模型看到世界的第一层接口:它把字节或文本映射成整数 token IDs,再由 embedding 映射到向量。切分方式同时决定序列长度、训练 FLOPs、KV Cache 占用、跨语言公平性和生成时的边界,因此“词表只是预处理”是错误的低估。 一次编码经过什么1234567原始文本→ nor...
Training Memory Accounting
Training Memory Accounting组成1234567model parameters+ gradients+ optimizer states+ master weights / mixed-precision copies+ activations+ temporary buffers and communication works...
Triton Language
Triton Language一句话定位Triton 是编写高性能 GPU kernel 的语言和编译器,使开发者能以高层次方式表达 block/tile 计算,再生成 GPU 代码。 系统位置1234attention / GEMM algorithm→ PyTorch operator or custom op→ Triton / CUD...
Transformer Block
Transformer BlockTransformer block 的核心分工是“跨位置通信 + 逐位置变换”。Attention 让一个 token 读取其他可见 token,FFN/MoE 在每个位置独立改变表示;残差把新信息加回旧流,归一化控制数值尺度。把这几件事混成“一个大网络层”,就解释不了缓存、并行和故障定位。 12345tok...
vLLM
vLLM一句话定位vLLM 是面向大语言模型推理与服务的引擎,重点处理请求调度、模型执行和 KV Cache 管理。 它解决的核心矛盾不是“怎样算出下一个 token”——模型本身已经定义了计算——而是多个长度不同、到达时间不同的请求如何共享有限 GPU 计算与 KV Cache,又不让空闲槽位和内存碎片吞掉吞吐。 在系统中的位置12345应用 / S...
Tensor Shape
Tensor Shape张量 shape 不是排版信息,而是模型中“谁和谁相乘、沿哪个轴归约、结果回到哪里”的接口契约。看不懂 shape,就无法判断一个 attention 实现到底是在 batch、head 还是 sequence 维度上做了错误广播。 统一符号与数据流 B:并行请求或样本数;T:序列长度;D:hidden size。 Hq ...