MOC Interview Preparation
LLM Interview Preparation
条目状态与系统位置
这是面试索引,不是完整文章目录。已有答案会链接到正文;没有链接的问题只是频率记录或待建主题,正式回答应先回到对应 MOC 的系统层。
用因果链组织回答
每个问题都按“定义/边界 → 解决的瓶颈 → 机制数据流 → 代价与失败 → 指标/实验”展开;例如问 KV Cache,不止说“缓存 K/V”,还要说明它如何把 decode 从重复计算变成读写压力,以及并发下为什么需要分页和调度。
面试记录用于统计问题频率;正式回答应链接到经过整理和验证的知识笔记。
第一梯队:几乎必问
- 项目背景、个人职责、技术难点、指标和上线维护。
- RAG 与微调如何选,数据怎样构建和验收。
- RAG 的解析、分块、检索、重排和评测。
- Transformer、MHA/MQA/GQA、RoPE、KV Cache、MoE。
第二梯队:高级算法与 Infra
- 推理:KV Cache、PagedAttention、Continuous Batching、LLM Quantization Deployment。
- 引擎:Inference Engine Selection、vLLM、SGLang。
- 分布式:Data Parallelism、ZeRO、Multi-GPU and Multi-Node LLM Inference。
- 后训练:Supervised Fine-Tuning、LoRA、PPO、DPO、GRPO。
- Agent:Agent Loop、Agent Evaluation、MOC - Agentic RL。
- 多模态:VLM 架构、数据、微调和边缘部署(待建)
回答模板
- 先给一句话定义和边界。
- 说明它解决的问题与所在层。
- 给出核心机制或数据流。
- 讨论代价、失败模式与对比方案。
- 用真实项目、指标或最小实验收尾。
来源分布
- 2024:多卡、LoRA、DeepSpeed、DDP、RLHF 开始高频出现。
- 2025:RAG/微调选型、Agent、推理部署和项目深挖显著增加。
- 2026:企业 Agent 平台、结构化输出、SLO、VLM、推理引擎和行业落地更集中。
风险
- 不保留公司评价、情绪化文字、薪资与个人隐私。
- 行为/法律问题与技术知识分开;劳动法律话术必须另行专业核验。
- 任何“某框架最好”“某参数固定最优”的回答均需要场景和版本限定。
练习应从现象反推机制
面试题不应只背定义。给自己一个观测现象,再沿因果链解释:
| 现象 | 必须追问到的层次 |
|---|---|
| 首 token 很慢、后续正常 | prompt 长度、prefill、队列和 TTFT,而不是笼统说 GPU 慢 |
| 并发增加后吞吐升高但 P99 爆炸 | continuous batching、KV 预算、admission 和请求混部 |
| RAG 答案流畅但引用错误 | gold evidence、权限/版本、rerank、context binding |
| Agent 重试后产生重复写入 | action 幂等、receipt、checkpoint 和恢复路径 |
| 训练 loss 下降但旧能力掉 | 数据混合、mask、能力回归与 catastrophic forgetting |
每次回答最后给一个能证伪自己的实验:固定模型和负载跑 TTFT/TPOT,保存检索候选和引用,注入工具超时,或比较旧能力回归集。这样回答不会变成“某框架最好”的口号,而能说明边界、代价和证据等级。
本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来源 Lux's Blog!