Skip to main content

00 - 专题索引

转载说明

本专题全文转载自开源文档站 AI Infra 学习笔记,作者 程治玮(Se7en / cr7258),仅作个人学习存档,正文与配图保持原样。

这个专题讲什么

七期在线分享,沿着**「跑起来 → 看懂内存 → 看懂缓存 → 看懂解码 → 看懂调度 → 看懂架构 → 看懂平台」**的顺序,把 LLM 推理系统从单机部署一路拆到生产级推理平台。

期次主题解决的核心问题关键概念
01vLLM 快速入门怎么把 vLLM 跑起来离线推理 vs 在线推理、GPU/CPU 后端
02PagedAttentionKV Cache 内存碎片分页、Block Table、Copy-on-Write
03Prefix Caching重复前缀的重复计算RadixAttention、Hash 复用、缓存感知路由
04Speculative Decoding自回归解码的串行瓶颈草稿模型、Medusa、EAGLE、Lookahead
05Chunked PrefillPrefill 抢占 Decode分块预填充、Batching 演进
06PD 分离两阶段互相干扰Goodput、KV Cache 传输、DistServe/Mooncake
07开源推理平台全景集群级编排与调度Dynamo、llm-d、Kthena、OME、AiBrix、KServe

推荐阅读顺序

  • 只想部署模型:读 01,再按需查 07 里的平台选型。
  • 准备 AI Infra 面试:02 / 03 / 05 / 06 是高频考点,建议配合核心论文清单一起看。
  • 要做推理优化:02 → 05 → 06 是一条完整的「显存 → 调度 → 架构」主线。

与本站其他内容的关系