ELL3N HSU
← 项目

LLM Inference Lab

围绕 LLM 推理、KV Cache 与评估方法建立可追溯的学习记录。

我的工作: 梳理学习问题、理解推理机制,并规划可复现实验。

Markdown

计划探索:Python / PyTorch / vLLM / SGLang / LMCache

问题与目标

理解推理系统不能停留在 API 调用。缓存的容量、复用、请求调度和内存传输会影响延迟与吞吐,实验条件也决定结论是否可比较。

这个项目以学习记录为主,建立从概念、方法到实验的路径。它不是已经完成的推理服务优化案例。

我的工作

整理学习问题,阅读和理解推理阶段、缓存机制与测量指标,在 AI 协助下补充背景知识与笔记。学习记录需要能回到原问题,也要记录尚未解决的疑问。

已有材料

站内已有 Prefill/Decode、KV Cache 显存和 Prefix Cache/TTFT 三篇基础笔记。它们包含机制解释和后续实验计划,不包含已经测得的性能提升数字。

实验计划

实验方向主要指标状态
Prefill 与 Decode 延迟TTFT / TPOT计划中
KV Cache 显存估算GPU memory计划中
Prefix Cache 复用TTFT / 命中比例计划中

方法与边界

未来实验需同时记录模型、硬件、软件版本、并发、输入长度和前缀分布。先建立可重复的基线,再讨论缓存策略是否带来收益。计划学习的工具不等于已验证的工程能力。

相关材料