Prefill vs Decode: LLM Inference 的两个阶段
理解 LLM 推理中 prefill 和 decode 的区别,以及为什么 prefill 更适合 batching。
按关键词浏览笔记与项目。
理解 LLM 推理中 prefill 和 decode 的区别,以及为什么 prefill 更适合 batching。
梳理 KV Cache 的数据结构、显存估算方式,以及长上下文为什么会放大问题。
分析 Prefix Cache 命中与未命中对首 token 延迟的影响,并记录后续 benchmark 计划。
围绕 LLM 推理、KV Cache 与评估方法建立可追溯的学习记录。
梳理学习问题、理解推理机制,并规划可复现实验。