LLM Inference Lab
围绕 LLM 推理、KV Cache 与评估方法建立可追溯的学习记录。
我的工作: 梳理学习问题、理解推理机制,并规划可复现实验。
问题与目标
理解推理系统不能停留在 API 调用。缓存的容量、复用、请求调度和内存传输会影响延迟与吞吐,实验条件也决定结论是否可比较。
这个项目以学习记录为主,建立从概念、方法到实验的路径。它不是已经完成的推理服务优化案例。
我的工作
整理学习问题,阅读和理解推理阶段、缓存机制与测量指标,在 AI 协助下补充背景知识与笔记。学习记录需要能回到原问题,也要记录尚未解决的疑问。
已有材料
站内已有 Prefill/Decode、KV Cache 显存和 Prefix Cache/TTFT 三篇基础笔记。它们包含机制解释和后续实验计划,不包含已经测得的性能提升数字。
实验计划
| 实验方向 | 主要指标 | 状态 |
|---|---|---|
| Prefill 与 Decode 延迟 | TTFT / TPOT | 计划中 |
| KV Cache 显存估算 | GPU memory | 计划中 |
| Prefix Cache 复用 | TTFT / 命中比例 | 计划中 |
方法与边界
未来实验需同时记录模型、硬件、软件版本、并发、输入长度和前缀分布。先建立可重复的基线,再讨论缓存策略是否带来收益。计划学习的工具不等于已验证的工程能力。