Prefill Decode Disaggregation
Prefill-Decode Disaggregation一句话解释PD 分离将 Prefill 与 Decode 放到不同资源池,使两种不同的负载特征可以分别调度和扩缩容。 关键挑战 How PD Disaggregation Transfers KV 请求路由与负载均衡 跨节点传输带来的延迟和带宽成本 请求路径与适用边界123client → r...
Project hx_llm
Project - hx_llm目标 用固定模型、硬件和请求分布,比较不同推理路线在质量不回退前提下的 TTFT、TPOT、吞吐、峰值显存和 p99;所有结论必须能由脚本和配置复现。 本项目采用的推理路线 推理引擎:vLLM 调度机制:Continuous Batching KV 管理:PagedAttention 后续研究:Prefill-Deco...
PyTorch
PyTorch一句话定位PyTorch 是提供张量计算、自动求导、神经网络组件及设备执行能力的机器学习框架。 它不负责什么 不直接替代集群编排系统。 不等同于面向在线请求的 LLM 推理调度器。 不自动决定具体项目的分布式与服务架构。 在 LLM 系统中的因果位置12345Python model code→ Tensor / autograd gr...
RAG Optimization Map
RAG Optimization MapPipeline123456789source parsing→ chunking and metadata→ embedding / sparse index→ query transformation→ retrieval→ fusion and reranking→ context construction...
Ray
Ray一句话定位Ray 是面向 Python/AI 工作负载的分布式运行时,用 task、actor、object store 和资源调度组织跨进程、跨节点工作。 它负责 启动和管理 task、actor 与 GPU workers placement group、资源调度和故障恢复 组织 learner、rollout、reward 与 e...
Grouped Query Attention
Grouped-Query AttentionGQA 把 Hq 个 Query heads 分成若干组,每组共享一个 K/V head。它保留多种 query 子空间,却只维护中间数量的历史 KV,是 Multi-Head Attention 与 Multi-Query Attention 之间的结构旋钮。 形状和映射 Query heads...
QLoRA
QLoRAQLoRA 用低比特形式加载冻结的基础模型权重,同时在高精度计算路径上训练 LoRA adapter,以降低微调显存。 核心组成 量化的 frozen base weights LoRA trainable adapters 适合量化权重分布的 4-bit 数据格式,例如 NF4 可能结合 double quantization 与 page...
Ray 与 Kubernetes 的调度边界是什么
Ray 与 Kubernetes 的调度边界是什么当前假设Kubernetes 主要管理集群级容器与服务生命周期,Ray 主要管理应用级任务、Actor 与资源调度;两者可以分层协作。 验证路径 分别列出调度对象、时间尺度和故障恢复边界 用一个 Ray on Kubernetes 部署追踪两层控制流 可证伪的边界若 Pod 被驱逐或节点故障,Ku...
Reasoning RL
Reasoning RLReasoning RL 用奖励、偏好或 verifier 优化模型在数学、代码等任务中的生成策略,尤其适合结果可以自动验证的场景。 与 SFT 的差别 Supervised Fine-Tuning 模仿给定目标序列。 RL 优化期望奖励,模型可以探索不同生成轨迹。 常见对象 policy / reference m...
Reward Model
Reward ModelReward model 把 prompt-response 或完整轨迹映射为质量信号,用于排序、筛选或策略优化。 数据常见数据不是简单的 Input,Reward CSV,而是: (prompt, chosen, rejected) 偏好对 多候选排序 带过程步骤的标注 可验证结果和规则奖励 类型 Outcome rewa...