LLM Interview Preparation

条目状态与系统位置

这是面试索引,不是完整文章目录。已有答案会链接到正文;没有链接的问题只是频率记录或待建主题,正式回答应先回到对应 MOC 的系统层。

用因果链组织回答

每个问题都按“定义/边界 → 解决的瓶颈 → 机制数据流 → 代价与失败 → 指标/实验”展开;例如问 KV Cache,不止说“缓存 K/V”,还要说明它如何把 decode 从重复计算变成读写压力,以及并发下为什么需要分页和调度。

面试记录用于统计问题频率;正式回答应链接到经过整理和验证的知识笔记。

第一梯队:几乎必问

  1. 项目背景、个人职责、技术难点、指标和上线维护。
  2. RAG 与微调如何选,数据怎样构建和验收。
  3. RAG 的解析、分块、检索、重排和评测。
  4. Transformer、MHA/MQA/GQA、RoPE、KV Cache、MoE。

第二梯队:高级算法与 Infra

回答模板

  1. 先给一句话定义和边界。
  2. 说明它解决的问题与所在层。
  3. 给出核心机制或数据流。
  4. 讨论代价、失败模式与对比方案。
  5. 用真实项目、指标或最小实验收尾。

来源分布

  • 2024:多卡、LoRA、DeepSpeed、DDP、RLHF 开始高频出现。
  • 2025:RAG/微调选型、Agent、推理部署和项目深挖显著增加。
  • 2026:企业 Agent 平台、结构化输出、SLO、VLM、推理引擎和行业落地更集中。

风险

  • 不保留公司评价、情绪化文字、薪资与个人隐私。
  • 行为/法律问题与技术知识分开;劳动法律话术必须另行专业核验。
  • 任何“某框架最好”“某参数固定最优”的回答均需要场景和版本限定。

练习应从现象反推机制

面试题不应只背定义。给自己一个观测现象,再沿因果链解释:

现象 必须追问到的层次
首 token 很慢、后续正常 prompt 长度、prefill、队列和 TTFT,而不是笼统说 GPU 慢
并发增加后吞吐升高但 P99 爆炸 continuous batching、KV 预算、admission 和请求混部
RAG 答案流畅但引用错误 gold evidence、权限/版本、rerank、context binding
Agent 重试后产生重复写入 action 幂等、receipt、checkpoint 和恢复路径
训练 loss 下降但旧能力掉 数据混合、mask、能力回归与 catastrophic forgetting

每次回答最后给一个能证伪自己的实验:固定模型和负载跑 TTFT/TPOT,保存检索候选和引用,注入工具超时,或比较旧能力回归集。这样回答不会变成“某框架最好”的口号,而能说明边界、代价和证据等级。