Current Learning
Current Learning
本周主线
- 用同一模型和负载跑通“prefill/decode → KV → batching → engine”因果链,并产出一张可复现性能表。
正在生长的笔记
本周输出
- 完成一篇能够独立解释的 evergreen 笔记
- 写一个最小代码验证
- 关闭一个 开放问题
回顾
- 学到了什么:
- 哪个假设被推翻:
- 下一步是什么:
本周实验卡片
每周主线不是把链接读完,而是完成一条能被复跑的因果链。实验卡片至少写清:
1 | 假设:在固定模型和硬件下,KV budget / batch 改变会影响 TPOT 与 P99 |
如果结果和预期不符,先记录被推翻的部分,不要把参数继续调到“看起来合理”。例如 batch 增大可能提高吞吐却让短请求 P99 变差;这不是实验失败,而是说明服务目标需要拆成不同请求类别。
交付标准
一篇本周输出只有在读者能复现并回答“瓶颈在哪里、为什么、何时不成立”时才算完成。最小交付包括配置、运行命令、原始指标位置、一个失败样例和一个链接回概念笔记的解释。没有硬件或数据条件时,把它登记为 Open Questions,而不是用未经验证的结论填空。
学习顺序
先读 MOC - Inference 的先修链,再用 AI System Performance Bottlenecks 做症状定位,最后把实验结果回填 Project - hx_llm。每周只保留一个主假设、一个最小实验和一个可交付结论;其他想法进入 Open Questions。
本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来源 Lux's Blog!