LoRA
LoRALoRA 冻结原权重 W,学习低秩更新: $$W’ = W + \Delta W,\qquad \Delta W = sBA$$ 其中 rank r 远小于输入、输出维度,s 常与 alpha/r 等 scaling 约定有关。 关键决策 target modules:应从实际模型的 named_modules() 确认,不...
MOC Agentic RL
Agentic RL条目状态与系统位置本图位于 Training / Agent Runtime 的交界:运行时负责环境、工具和轨迹,训练侧负责 reward、advantage 和 policy update。链接是独立文章;未链接的术语表示当前只在闭环中解释,尚无独立正文。 学习主线Agentic RL 位于“运行时 Agent 工程”和...
MOC Agents
Agents条目状态与系统位置本图主要位于 Agent Runtime,并向上连接 Serving/API、向下连接 Model/Inference。可点击条目是独立文章;“未单列”表示由现有 Agent Loop、State 或 RAG 文章覆盖;“待建”才表示真正缺少正文。 学习主线先掌握 Agent Loop 的 state→...
MOC AI Infra
AI Infra条目状态与系统位置本图覆盖 Infra / control plane / data plane,不是一个单一技术层。可点击条目是独立文章;“未单列”表示由工具或性能文章承载;“待建”表示当前没有独立实现笔记。 两条互相约束的因果链12345硬件/网络/存储→ kernel 与框架→ 并行执行/通信→ 训练或推理 e...
MOC AI Overview
AI Overview这张总图的边界这里的七个入口是系统层,不是七篇必然存在的文章。可点击的是已有 MOC;未链接层级由下方 MOC 覆盖,尚未建立独立地图的地方标为“待建”,避免把层级名称误读成断链。 一张地图怎么使用从问题出发而不是从工具名出发: 123456要学会模型机制 → Transformer要改变模型行为 → Training要降低生成成...
MOC Inference
LLM Inference条目状态与系统位置本图位于 Inference Layer,核心是 request computation、KV memory、scheduling 和 engine;它向上连接 Serving,向下依赖 Transformer 与 AI Infra。链接是独立文章;标注“未单列”表示该概念由相邻文章覆盖;标注“待建”表示目前...
Long Context Training
Long Context Training核心问题模型是真能使用远距离信息,还是只把配置窗口变长? 组成 RoPE scaling / position extrapolation 长文档与跨段依赖训练数据 repo-level code 和多文档任务 context length curriculum 与数据配比 推理侧 KV Cache ...
MOC Interview Preparation
LLM Interview Preparation条目状态与系统位置这是面试索引,不是完整文章目录。已有答案会链接到正文;没有链接的问题只是频率记录或待建主题,正式回答应先回到对应 MOC 的系统层。 用因果链组织回答每个问题都按“定义/边界 → 解决的瓶颈 → 机制数据流 → 代价与失败 → 指标/实验”展开;例如问 KV Cac...
MOC Serving and LLMOps
Serving and LLMOps条目状态与系统位置本图位于 Serving / API / LLMOps,承接推理引擎,向上服务应用和 Agent,向下依赖 GPU、KV 和调度。可点击条目是独立文章;其余是平台能力清单,未单列不等于断链。 从请求到 SLO 的闭环1234567流量/租户→ gateway 与 admissio...
MOC RAG and Retrieval
RAG and Retrieval条目状态与系统位置本图位于 Application / Retrieval / Agent Runtime:索引和召回是数据与检索层,引用生成接到模型层,多跳检索再接到 Agent Loop。只有 RAG Optimization Map 是独立总览,其余条目默认是该总览中的子机制,不代表每个都有单...