Lux's Blog

Lux's Blog

Prefill Decode Disaggregation
发表于2026-07-13|LLM Notes概念笔记
Prefill-Decode Disaggregation一句话解释PD 分离将 Prefill 与 Decode 放到不同资源池,使两种不同的负载特征可以分别调度和扩缩容。 关键挑战 How PD Disaggregation Transfers KV 请求路由与负载均衡 跨节点传输带来的延迟和带宽成本 请求路径与适用边界123client → r...
Project hx_llm
发表于2026-07-13|LLM Notes项目笔记
Project - hx_llm目标 用固定模型、硬件和请求分布,比较不同推理路线在质量不回退前提下的 TTFT、TPOT、吞吐、峰值显存和 p99;所有结论必须能由脚本和配置复现。 本项目采用的推理路线 推理引擎:vLLM 调度机制:Continuous Batching KV 管理:PagedAttention 后续研究:Prefill-Deco...
PyTorch
发表于2026-07-13|LLM Notes工具笔记
PyTorch一句话定位PyTorch 是提供张量计算、自动求导、神经网络组件及设备执行能力的机器学习框架。 它不负责什么 不直接替代集群编排系统。 不等同于面向在线请求的 LLM 推理调度器。 不自动决定具体项目的分布式与服务架构。 在 LLM 系统中的因果位置12345Python model code→ Tensor / autograd gr...
RAG Optimization Map
发表于2026-07-13|LLM Notes概念笔记
RAG Optimization MapPipeline123456789source parsing→ chunking and metadata→ embedding / sparse index→ query transformation→ retrieval→ fusion and reranking→ context construction...
Ray
发表于2026-07-13|LLM Notes工具笔记
Ray一句话定位Ray 是面向 Python/AI 工作负载的分布式运行时,用 task、actor、object store 和资源调度组织跨进程、跨节点工作。 它负责 启动和管理 task、actor 与 GPU workers placement group、资源调度和故障恢复 组织 learner、rollout、reward 与 e...
Grouped Query Attention
发表于2026-07-13|LLM Notes概念笔记
Grouped-Query AttentionGQA 把 Hq 个 Query heads 分成若干组,每组共享一个 K/V head。它保留多种 query 子空间,却只维护中间数量的历史 KV,是 Multi-Head Attention 与 Multi-Query Attention 之间的结构旋钮。 形状和映射 Query heads...
QLoRA
发表于2026-07-13|LLM Notes概念笔记
QLoRAQLoRA 用低比特形式加载冻结的基础模型权重,同时在高精度计算路径上训练 LoRA adapter,以降低微调显存。 核心组成 量化的 frozen base weights LoRA trainable adapters 适合量化权重分布的 4-bit 数据格式,例如 NF4 可能结合 double quantization 与 page...
Ray 与 Kubernetes 的调度边界是什么
发表于2026-07-13|LLM Notes问题笔记
Ray 与 Kubernetes 的调度边界是什么当前假设Kubernetes 主要管理集群级容器与服务生命周期,Ray 主要管理应用级任务、Actor 与资源调度;两者可以分层协作。 验证路径 分别列出调度对象、时间尺度和故障恢复边界 用一个 Ray on Kubernetes 部署追踪两层控制流 可证伪的边界若 Pod 被驱逐或节点故障,Ku...
Reasoning RL
发表于2026-07-13|LLM Notes概念笔记
Reasoning RLReasoning RL 用奖励、偏好或 verifier 优化模型在数学、代码等任务中的生成策略,尤其适合结果可以自动验证的场景。 与 SFT 的差别 Supervised Fine-Tuning 模仿给定目标序列。 RL 优化期望奖励,模型可以探索不同生成轨迹。 常见对象 policy / reference m...
Reward Model
发表于2026-07-13|LLM Notes概念笔记
Reward ModelReward model 把 prompt-response 或完整轨迹映射为质量信号,用于排序、筛选或策略优化。 数据常见数据不是简单的 Input,Reward CSV,而是: (prompt, chosen, rejected) 偏好对 多候选排序 带过程步骤的标注 可验证结果和规则奖励 类型 Outcome rewa...
1…5678
avatar
Lux
笔记
文章
75
标签
103
分类
9
GitHub
分类
  • LLM Notes72
    • 主题地图10
    • 工具笔记10
    • 概念笔记43
    • 知识库总览4
    • 问题笔记4
    • 项目笔记1
  • 产品文档2
  • 技术笔记1
标签
MQA Low-Rank Adaptation Iteration-level Scheduling hx_llm infra, inference, training, serving PD 分离之后 KV Cache 怎么传输 AI Infrastructure rag, agent, application AI办公 vLLM 推理引擎 奖励模型 Proximal Policy Optimization PD Disaggregation LLM 面试准备 Training Parameter-Efficient Fine-Tuning, 参数高效微调 inference, serving, infra 商业分析 推测解码 推理引擎选型, vLLM SGLang TensorRT-LLM LMDeploy 选型 agent, training 键值缓存 解码阶段 training, transformer training 连续批处理 AI Infra 七层技术栈 分页注意力 RAG 端到端优化地图 推理强化学习, Reasoning Reinforcement Learning inference 未解决问题 大模型训练生命周期 多头注意力 AI 系统性能瓶颈 training, agent Agents infra, inference, training Quantized LoRA 飞书
© 2025 - 2026 By Lux框架 Hexo 8.1.2|主题 Butterfly 5.6.1