03 - 硬核开源项目图谱
说明
本页是在 AI Infra 学习笔记 资源合集基础上扩充整理的开源项目清单。
- Star 数为 2026-08-12 通过 GitHub API 抓取的快照,仅用于判断项目热度量级,会随时间变化。
- 分类依据是「读这个仓库能学到什么」,而不是功能完整度。
怎么用这张图谱
读源码最容易犯的错是一上来就啃 vLLM 主干。更有效的顺序是:先读教学型精简实现建立骨架认知,再回到生产级仓库看它为了正确性和性能付出了什么代价。
一、推理引擎与 Serving
推理是 AI Infra 目前投入最集中的方向,也是最适合作为入口的方向:反馈快、能本地跑、面试高频。
| 项目 | Star | 一句话 | 读它能学到 |
|---|---|---|---|
| vllm-project/vllm | 88.8k | 高吞吐、显存高效的 LLM 推理与服务引擎 | PagedAttention、连续批处理、调度器主循环 |
| ggml-org/llama.cpp | 123.5k | 纯 C/C++ 的 LLM 推理 | 量化格式、CPU/端侧推理、无依赖工程实践 |
| sgl-project/sglang | 31.7k | 高性能大模型与多模态服务框架 | RadixAttention、结构化输出、约束解码 |
| mlc-ai/mlc-llm | 23.1k | 基于编译的通用 LLM 部署引擎 | 机器学习编译(TVM)路线的部署思路 |
| NVIDIA/TensorRT-LLM | 14.4k | NVIDIA 官方推理优化库 | 算子融合、Plugin、In-flight Batching |
| huggingface/text-generation-inference | 10.9k | HuggingFace 的生成推理服务 | Rust 服务层 + Python 模型层的分工 |
| InternLM/lmdeploy | 8.0k | 压缩、部署、服务一体工具箱 | TurboMind 引擎、W4A16 量化落地 |
| ModelTC/LightLLM | 4.2k | 轻量 Python 推理框架 | 代码量小,适合通读整条推理链路 |
配套精读:vLLM 推理专题(七期,含 PagedAttention / Prefix Caching / 推测解码 / PD 分离全图解)。
二、KV Cache 与 PD 分离
PD 分离把「KV Cache 怎么跨节点搬」变成了独立的基础设施问题,也因此长出了这一层项目。

| 项目 | Star | 一句话 | 读它能学到 |
|---|---|---|---|
| LMCache/LMCache | 11.1k | LLM 的 KV Cache 缓存层 | 跨请求缓存复用、CacheGen/CacheBlend 落地 |
| kvcache-ai/Mooncake | 6.2k | Kimi 的服务平台,KV Cache 中心化架构 | 用 DRAM/SSD 组池化 KV Cache 的工程细节 |
| deepseek-ai/3FS | 10.1k | 面向训练与推理的高性能分布式文件系统 | 存储侧如何配合 AI 负载 |
论文对照:学习资源大全 · 核心论文清单 的 PD 分离一节(DistServe、Splitwise、Mooncake)。
三、训练框架与 RL
| 项目 | Star | 一句话 | 读它能学到 |
|---|---|---|---|
| deepspeedai/DeepSpeed | 42.9k | 分布式训练与推理优化库 | ZeRO 三阶段、Offload、混合精度 |
| ray-project/ray | 43.5k | 通用分布式计算引擎 | Task/Actor 模型、对象存储、调度器 |
| hpcaitech/ColossalAI | 41.4k | 大模型训练系统 | 多维并行策略的组合方式 |
| volcengine/verl | 22.9k | HybridFlow:灵活高效的 RL 后训练框架 | RLHF/PPO 的分布式编排 |
| NVIDIA/Megatron-LM | 17.4k | 大规模 Transformer 训练 | TP/PP/SP 的经典实现,几乎是并行策略的教科书 |
| OpenRLHF/OpenRLHF | 9.9k | 基于 Ray 的 Agentic RL 框架 | 用 Ray 编排 RL 训练的工程范式 |
| pytorch/torchtitan | 5.6k | PyTorch 原生的生成式模型训练平台 | FSDP2 / DTensor 等新一代原生并行 API |

四、GPU Kernel 与编译器
| 项目 | Star | 一句话 | 读它能学到 |
|---|---|---|---|
| Dao-AILab/flash-attention | 24.7k | 快速且省显存的精确 Attention | IO-aware 算法设计的标杆实现 |
| triton-lang/triton | 19.9k | Triton 语言与编译器 | Python DSL → PTX 的完整编译链路 |
| deepseek-ai/FlashMLA | 12.8k | 高效 MLA 解码 Kernel | Hopper 架构上的 Kernel 优化实战 |
| xlite-dev/LeetCUDA | 11.7k | 200+ CUDA Kernel 学习笔记 | 刷题式建立 Kernel 手感 |
| NVIDIA/cutlass | 10.2k | 高性能线性代数模板库 | Tensor Core、分块与流水线的抽象方式 |
| deepseek-ai/DeepEP | 10.0k | 专家并行通信库 | MoE 的 dispatch/combine 通信优化 |
| tile-ai/tilelang | 7.2k | 面向 GPU/加速器的 Kernel DSL | 比 Triton 更贴近 Tile 抽象的写法 |
| gpu-mode/lectures | 6.4k | GPU MODE 系列讲座材料 | 社区最系统的 GPU 编程公开课 |
| NVIDIA/nccl | 5.0k | 多 GPU 集合通信原语 | Ring/Tree 算法与拓扑感知通信 |

五、集群编排与调度
单机优化到头之后,剩下的收益全在集群利用率上。

| 项目 | Star | 一句话 | 读它能学到 |
|---|---|---|---|
| volcano-sh/volcano | 5.8k | 云原生批处理系统(CNCF 项目) | Gang Scheduling、队列与公平调度 |
| vllm-project/aibrix | 5.0k | 面向 GenAI 推理的可插拔基础设施 | LoRA 管理、自动扩缩、路由策略 |
| kubernetes-sigs/kueue | 2.8k | Kubernetes 原生作业队列 | 配额、抢占与准入控制 |
深入阅读:vLLM 推理专题 07 - 开源推理平台全景,逐个拆解了 NVIDIA Dynamo、llm-d、Kthena、RoleBasedGroup、OME、AiBrix、KServe。
六、学习型项目(强烈建议动手)
这一类不追求性能,追求「看得懂、改得动」。投入产出比最高。
| 项目 | Star | 一句话 |
|---|---|---|
| rasbt/LLMs-from-scratch | 102.4k | 从零一步步用 PyTorch 实现类 ChatGPT 模型 |
| karpathy/nanoGPT | 62.0k | 最精简的 GPT 训练/微调实现 |
| karpathy/nanochat | 57.1k | nanoGPT 的后继,端到端可对话的训练流程 |
| karpathy/llm.c | 30.8k | 纯 C/CUDA 的 LLM 训练 |
| stanford-cs336/assignment2-systems | 296 | CS336 系统作业:基准测试、分析、分布式训练 |
同类的自研实践可以看本站 项目沉淀 - mini-ray:用 C++ 写调度器和共享内存对象存储,Python 侧提供 @remote / get API。
七、中文体系化资料
| 项目 | Star | 一句话 |
|---|---|---|
| liguodongiot/llm-action | 24.9k | 大模型工程化与应用落地的技术原理与实战经验 |
| stas00/ml-engineering | 18.6k | 机器学习工程开放书(英文,但是最实用的踩坑合集) |
| Infrasys-AI/AISystem | 17.6k | AI 系统全栈:AI 芯片、编译器、推理与训练框架 |
| jax-ml/scaling-book | 1.3k | 《How to Scale Your Model》的源仓库 |
面试视角的取舍
如果时间有限、目标是 AI Infra 岗位面试,按这个顺序投入:
- vLLM(必读)—— PagedAttention、连续批处理、调度器,几乎必问。
- Megatron-LM(读并行策略部分)—— TP/PP/SP 的区别与通信量分析是高频题。
- flash-attention(读思想,不必读全部 CUDA)—— IO-aware 是回答"如何优化 Attention"的标准答案。
- LMCache / Mooncake(读架构文档)—— PD 分离与 KV Cache 池化是近两年的新增考点。
配套的题目整理见 Agent 面试题汇总 与 RAG 面试题汇总。