Skip to main content

03 - 硬核开源项目图谱

说明

本页是在 AI Infra 学习笔记 资源合集基础上扩充整理的开源项目清单。

  • Star 数为 2026-08-12 通过 GitHub API 抓取的快照,仅用于判断项目热度量级,会随时间变化。
  • 分类依据是「读这个仓库能学到什么」,而不是功能完整度。

怎么用这张图谱

读源码最容易犯的错是一上来就啃 vLLM 主干。更有效的顺序是:先读教学型精简实现建立骨架认知,再回到生产级仓库看它为了正确性和性能付出了什么代价。


一、推理引擎与 Serving

推理是 AI Infra 目前投入最集中的方向,也是最适合作为入口的方向:反馈快、能本地跑、面试高频。

项目Star一句话读它能学到
vllm-project/vllm88.8k高吞吐、显存高效的 LLM 推理与服务引擎PagedAttention、连续批处理、调度器主循环
ggml-org/llama.cpp123.5k纯 C/C++ 的 LLM 推理量化格式、CPU/端侧推理、无依赖工程实践
sgl-project/sglang31.7k高性能大模型与多模态服务框架RadixAttention、结构化输出、约束解码
mlc-ai/mlc-llm23.1k基于编译的通用 LLM 部署引擎机器学习编译(TVM)路线的部署思路
NVIDIA/TensorRT-LLM14.4kNVIDIA 官方推理优化库算子融合、Plugin、In-flight Batching
huggingface/text-generation-inference10.9kHuggingFace 的生成推理服务Rust 服务层 + Python 模型层的分工
InternLM/lmdeploy8.0k压缩、部署、服务一体工具箱TurboMind 引擎、W4A16 量化落地
ModelTC/LightLLM4.2k轻量 Python 推理框架代码量小,适合通读整条推理链路

配套精读:vLLM 推理专题(七期,含 PagedAttention / Prefix Caching / 推测解码 / PD 分离全图解)。


二、KV Cache 与 PD 分离

PD 分离把「KV Cache 怎么跨节点搬」变成了独立的基础设施问题,也因此长出了这一层项目。

PD 分离下的 KV Cache 传输路径

项目Star一句话读它能学到
LMCache/LMCache11.1kLLM 的 KV Cache 缓存层跨请求缓存复用、CacheGen/CacheBlend 落地
kvcache-ai/Mooncake6.2kKimi 的服务平台,KV Cache 中心化架构用 DRAM/SSD 组池化 KV Cache 的工程细节
deepseek-ai/3FS10.1k面向训练与推理的高性能分布式文件系统存储侧如何配合 AI 负载

论文对照:学习资源大全 · 核心论文清单 的 PD 分离一节(DistServe、Splitwise、Mooncake)。


三、训练框架与 RL

项目Star一句话读它能学到
deepspeedai/DeepSpeed42.9k分布式训练与推理优化库ZeRO 三阶段、Offload、混合精度
ray-project/ray43.5k通用分布式计算引擎Task/Actor 模型、对象存储、调度器
hpcaitech/ColossalAI41.4k大模型训练系统多维并行策略的组合方式
volcengine/verl22.9kHybridFlow:灵活高效的 RL 后训练框架RLHF/PPO 的分布式编排
NVIDIA/Megatron-LM17.4k大规模 Transformer 训练TP/PP/SP 的经典实现,几乎是并行策略的教科书
OpenRLHF/OpenRLHF9.9k基于 Ray 的 Agentic RL 框架用 Ray 编排 RL 训练的工程范式
pytorch/torchtitan5.6kPyTorch 原生的生成式模型训练平台FSDP2 / DTensor 等新一代原生并行 API

DDP 的梯度分桶与 AllReduce


四、GPU Kernel 与编译器

项目Star一句话读它能学到
Dao-AILab/flash-attention24.7k快速且省显存的精确 AttentionIO-aware 算法设计的标杆实现
triton-lang/triton19.9kTriton 语言与编译器Python DSL → PTX 的完整编译链路
deepseek-ai/FlashMLA12.8k高效 MLA 解码 KernelHopper 架构上的 Kernel 优化实战
xlite-dev/LeetCUDA11.7k200+ CUDA Kernel 学习笔记刷题式建立 Kernel 手感
NVIDIA/cutlass10.2k高性能线性代数模板库Tensor Core、分块与流水线的抽象方式
deepseek-ai/DeepEP10.0k专家并行通信库MoE 的 dispatch/combine 通信优化
tile-ai/tilelang7.2k面向 GPU/加速器的 Kernel DSL比 Triton 更贴近 Tile 抽象的写法
gpu-mode/lectures6.4kGPU MODE 系列讲座材料社区最系统的 GPU 编程公开课
NVIDIA/nccl5.0k多 GPU 集合通信原语Ring/Tree 算法与拓扑感知通信

CUDA 组件栈


五、集群编排与调度

单机优化到头之后,剩下的收益全在集群利用率上。

Kubernetes 设备插件工作流

项目Star一句话读它能学到
volcano-sh/volcano5.8k云原生批处理系统(CNCF 项目)Gang Scheduling、队列与公平调度
vllm-project/aibrix5.0k面向 GenAI 推理的可插拔基础设施LoRA 管理、自动扩缩、路由策略
kubernetes-sigs/kueue2.8kKubernetes 原生作业队列配额、抢占与准入控制

深入阅读:vLLM 推理专题 07 - 开源推理平台全景,逐个拆解了 NVIDIA Dynamo、llm-d、Kthena、RoleBasedGroup、OME、AiBrix、KServe。


六、学习型项目(强烈建议动手)

这一类不追求性能,追求「看得懂、改得动」。投入产出比最高。

项目Star一句话
rasbt/LLMs-from-scratch102.4k从零一步步用 PyTorch 实现类 ChatGPT 模型
karpathy/nanoGPT62.0k最精简的 GPT 训练/微调实现
karpathy/nanochat57.1knanoGPT 的后继,端到端可对话的训练流程
karpathy/llm.c30.8k纯 C/CUDA 的 LLM 训练
stanford-cs336/assignment2-systems296CS336 系统作业:基准测试、分析、分布式训练

同类的自研实践可以看本站 项目沉淀 - mini-ray:用 C++ 写调度器和共享内存对象存储,Python 侧提供 @remote / get API。


七、中文体系化资料

项目Star一句话
liguodongiot/llm-action24.9k大模型工程化与应用落地的技术原理与实战经验
stas00/ml-engineering18.6k机器学习工程开放书(英文,但是最实用的踩坑合集)
Infrasys-AI/AISystem17.6kAI 系统全栈:AI 芯片、编译器、推理与训练框架
jax-ml/scaling-book1.3k《How to Scale Your Model》的源仓库

面试视角的取舍

如果时间有限、目标是 AI Infra 岗位面试,按这个顺序投入:

  1. vLLM(必读)—— PagedAttention、连续批处理、调度器,几乎必问。
  2. Megatron-LM(读并行策略部分)—— TP/PP/SP 的区别与通信量分析是高频题。
  3. flash-attention(读思想,不必读全部 CUDA)—— IO-aware 是回答"如何优化 Attention"的标准答案。
  4. LMCache / Mooncake(读架构文档)—— PD 分离与 KV Cache 池化是近两年的新增考点。

配套的题目整理见 Agent 面试题汇总RAG 面试题汇总