Current Learning

本周主线

  • 用同一模型和负载跑通“prefill/decode → KV → batching → engine”因果链,并产出一张可复现性能表。

正在生长的笔记

本周输出

  • 完成一篇能够独立解释的 evergreen 笔记
  • 写一个最小代码验证
  • 关闭一个 开放问题

回顾

  • 学到了什么:
  • 哪个假设被推翻:
  • 下一步是什么:

本周实验卡片

每周主线不是把链接读完,而是完成一条能被复跑的因果链。实验卡片至少写清:

1
2
3
4
假设:在固定模型和硬件下,KV budget / batch 改变会影响 TPOT 与 P99
输入:请求长度分布、并发、采样、版本 hash
观察:TTFT、TPOT、KV 使用率、排队、OOM、质量样例
结论:在哪个区间成立,在哪个区间失效

如果结果和预期不符,先记录被推翻的部分,不要把参数继续调到“看起来合理”。例如 batch 增大可能提高吞吐却让短请求 P99 变差;这不是实验失败,而是说明服务目标需要拆成不同请求类别。

交付标准

一篇本周输出只有在读者能复现并回答“瓶颈在哪里、为什么、何时不成立”时才算完成。最小交付包括配置、运行命令、原始指标位置、一个失败样例和一个链接回概念笔记的解释。没有硬件或数据条件时,把它登记为 Open Questions,而不是用未经验证的结论填空。

学习顺序

先读 MOC - Inference 的先修链,再用 AI System Performance Bottlenecks 做症状定位,最后把实验结果回填 Project - hx_llm。每周只保留一个主假设、一个最小实验和一个可交付结论;其他想法进入 Open Questions