Skip to content

精选资源清单

本页速览 从 vLLM 到 TensorRT-LLM、从 FlashAttention 到 PagedAttention、从 CUDA Mode 到 CMU 15-819:一份按主题组织、官方链接逐一核验的大模型推理加速与部署学习资源地图。

精选资源清单

推理加速是个"硬骨头"学科——它一头挂着 PyTorch/CUDA 的工程实践、一头挂着 vLLM/PagedAttention 的系统论文,还涉及硬件体系结构。过去三年(2022–2026),这个领域沉淀出一批质量极高、且大多免费的官方资源:vLLM 的源码与 blog、FlashAttention 系列论文、CMU 15-819 ASPIRE 课程、CUDA Mode 播客。它们彼此之间有明确的能力递进与风格分工。本页按主题把它们整理成七类,每条给出一句话定位适合谁官方入口,链接均已逐一核验。

使用建议

这份清单不是"收藏夹",而是和本站 学习路径 配套的"外挂资源层"。建议做法是:先在本站建立概念骨架(从什么是推理加速术语表开始),然后按本页的节奏挑一两条主线吃透——贪多嚼不烂,选一条主线走完胜过十条各学了前三章

一、官方文档

推理引擎与底层库的官方文档是"随用随查"的权威来源,比任何二手教程都准。本节只保留学推理必碰的核心入口。

vLLM 文档

一句话定位:开源 LLM 推理引擎的"事实标准",文档含 PagedAttention、continuous batching、prefix caching 全部原理与 API。

vLLM 文档分三块:Getting Started(一行 pip install vllm 跑起来)、Design(PagedAttention 论文 + 架构图,新手必读)、API ReferenceLLM 离线类与 AsyncLLMEngine 在线类的全部参数)。它的源码本身也是教材,vllm/core/scheduler.pyvllm/core/block_manager.py 是理解 continuous batching 的最佳现场。详见vLLM 与 PagedAttention

  • 适合谁:要部署/调优 LLM 推理服务的工程师;想读懂 PagedAttention 实现的研究者。
  • 官方入口docs.vllm.ai

TensorRT-LLM 文档

一句话定位:NVIDIA 官方 LLM 推理引擎,把 FP8、in-flight batching、speculative decoding 与 Hopper/Blackwell 硬件深度结合。

TensorRT-LLM 文档含 Builder/Engine/Runtime 三段式流水线说明、精度与量化(FP8、INT4 AWQ、SmoothQuant)、in-flight batchingspeculative decoding(Medusa/EAGLE)以及 Multi-Device(TP/PP)配置。配套的 TensorRT-LLM benchmark 仓库是性能调优的第一手参考。详见TensorRT-LLMTensorRT 与 GPU 推理

NVIDIA Triton Inference Server 文档

一句话定位:NVIDIA 的多后端推理服务框架,统一管理 TensorRT/PyTorch/ONNX/TF 模型,提供 HTTP/gRPC 与动态 batching。

Triton 文档含 模型仓库管理(model repository layout)、后端(TensorRT、PyTorch、ONNX Runtime、Python backend)、动态 batching 策略模型分析器(Model Analyzer)。它是把多个引擎"封装成统一服务"的事实方案。详见Triton 推理服务

两个 Triton

官方文档 triton-inference-server 是推理服务框架;triton-lang 是 OpenAI 的 GPU kernel DSL。两者同名不同物,本节指前者,后者见算子融合相关章节。

ONNX Runtime 文档

一句话定位:微软的跨平台推理引擎,覆盖 CPU/GPU/NPU/移动端,是"一份模型到处跑"的工程底座。

ONNX Runtime 文档分 Execution Providers(CUDA、TensorRT、OpenVINO、CoreML、DirectML 等后端)、Graph Optimizer(图优化规则)、Performance Tuning(per-thread affinity、memory pattern)。它的跨平台特性是端侧与混合部署的关键。详见ONNX Runtime 跨平台

  • 适合谁:要跨硬件部署同一份模型的人;CPU/移动端推理工程师。
  • 官方入口onnxruntime.ai

OpenVINO 文档

一句话定位:Intel 的 CPU/iGPU/VPU 推理优化工具链,把 Intel 硬件上的矩阵乘榨到极致(含 AMX)。

OpenVINO 文档含 Model Optimizer(把 PyTorch/TF 模型转 IR)、NNCF(神经网络压缩框架,量化/剪枝/蒸馏)、Inference Engine(运行时)。它是 Intel CPU 推理的第一选择。详见OpenVINO 与 CPU 推理

  • 适合谁:在 Intel CPU/iGPU 上部署推理的人;用 AMX 榨 CPU 矩阵乘性能的人。
  • 官方入口docs.openvino.ai

CUDA Toolkit / cuDNN / cuBLAS 文档

一句话定位:NVIDIA GPU 编程与算子库的官方文档,理解 GPU 微架构与算子优化的根基。

CUDA Toolkit 含 CUDA C++ Programming Guide(SIMT、warp、shared memory、stream)、CUDA C++ Best Practices Guide(优化技巧)、Nsight 文档。cuDNN/cuBLAS 是 GEMM/卷积/归一化的底层库文档。详见GPU 体系结构与优化硬件基础速查

  • 适合谁:要写自定义 CUDA kernel 的人;做算子级性能调优的人。
  • 官方入口docs.nvidia.com/cuda

PyTorch 文档

一句话定位:训练与推理的主流框架,2.x 起的 torch.compile 是入门图编译的入口。

PyTorch 文档的 Tutorials 含"从 eager 到 torch.compile"与"Transformer from scratch"等必读;torch.compile 文档是理解 JIT 编译、kernel fusion 的实操入口;Distributed 文档(DDP、FSDP、TP)是大模型推理分布式的基础。详见推理 vs 训练 vs 微调分布式推理

  • 适合谁:把 PyTorch 模型从训练搬到推理的人;想懂 torch.compile 背后图编译的人。
  • 官方入口pytorch.org/docs/stable

官方文档怎么读

框架文档不是教材,别从头通读。正确做法:先 30 分钟读 Getting Started 建立心智模型,带着具体问题进 API 页("这个参数什么意思"),最后用示例页做模板改自己的代码。引擎之间的取舍见推理引擎选型对比

二、论文 arxiv

推理加速领域几乎每一项关键技术都对应一篇里程碑论文。这里按主题精选必读论文,每条附一句话定位,完整精读见经典论文精读论文地图

Attention 加速

量化

投机解码与并行

引擎与系统

  • vLLMarxiv 2309.06180):PagedAttention + continuous batching 的原始论文。
  • SGLangarxiv 2312.07104):RadixAttention 前缀缓存与结构化生成编程模型。
  • DeepSpeed-FastGenarxiv 2401.08671):Microsoft 的 LLM 推理系统,Dynamic Splitfuse 思想。

更多论文按阅读路径组织见阅读路径论文地图,前沿进展见前沿进展

三、开源代码仓库

读源码是理解推理引擎内部机制的最快路径。本节按"从主流到配套"组织。

主流 LLM 推理引擎

经典推理引擎与编译器

算子与底层

量化与压缩

四、博客教程

跟上推理加速领域节奏,博客比论文更及时,比官方文档更易懂。本节保留质量最高的一批。

引擎官方 blog

  • vLLM blog:PagedAttention、continuous batching、prefix caching、SGLang 对比的官方发布地,每篇都配实测数据。
  • SGLang blog:RadixAttention、结构化生成、多轮对话优化的官方解读。
  • NVIDIA Developer Blog:TensorRT-LLM、FP8、Hopper Transformer Engine 的深度技术解读。

个人深度博客

播客与视频

  • GPU Mode Discord:GPU 编程与推理优化社区,每周都有 talk,技术含量极高。
  • CUDA Mode YouTube:GPU Mode 的视频频道,FlashAttention、Triton、Nsight 实操讲解。
  • Karpathy YouTube:虽然主打训练,但"Let's build GPT"与"intro to LLMs"对理解推理机制极有帮助。

五、课程

学术课程是系统建立"推理优化心智模型"的最佳路径,以下是公认顶级且全部免费的课程。

CMU 15-819 ASPIRE(Hazy Research)

一句话定位:Stanford Hazy Research 的 Tri Dao 在 CMU 开的"高效深度学习"课程,FlashAttention 与系统优化的第一手讲解。

覆盖 attention 优化、kernel fusion、长上下文、稀疏注意力、采样加速。Tri Dao 是 FlashAttention 一作,他的课是这门领域"作者本人讲自己工作"的稀缺资源。配套的 Notes 与 Hazy Research 的 blog 互为补充。

  • 适合谁:想深入 FlashAttention 与长上下文优化的人;推理引擎开发者。
  • 官方入口cs.cmu.edu/~15319

MIT 6.5940(Song Han 团队)

一句话定位:Han Lab 的"TinyML 与 Efficient Deep Learning"课程,量化、剪枝、蒸馏的体系化讲解。

Song Han 是深度学习压缩领域的奠基人之一(Deep Compression),这门课从算法到硬件全覆盖,含 INT4/INT8 量化、结构化剪枝、知识蒸馏的完整链条,配 Lab 作业。详见模型量化基础剪枝与稀疏化知识蒸馏

Stanford CS336

一句话定位:斯坦福"从零实现大语言模型"课,覆盖训练 + 推理 + 系统。

CS336 不止讲怎么训 LLM,还讲怎么高效推理——含 KV cache、attention 优化、量化的实操。作业要求从零写 attention kernel、实现 KV cache。它是理解"训练到推理全链路"的最佳单门课。

Sasha Rush 的 Tensor 园

一句话定位:Cornell 教授 Sasha Rush 的"annotated tensor"系列,用 Jupyter 把 attention、RoPE、量化逐行讲透。

Sasha Rush(PyTorch TorchDynamo 作者之一)用 annotated Python notebook 把抽象概念变成可运行代码——从 attention 的矩阵乘到 FlashAttention 的 tiling,再到 INT4 量化的反量化 GEMM,每一步都配代码与图。是"动手学"的最佳资源。

课程搭配建议

先 CS336建立 LLM 系统全局观(含推理);深入量化/剪枝上 MIT 6.5940深入 attention 优化与长上下文上 CMU 15-819配合 Sasha Rush 的 notebook 边读边动手。配合本站学习路径按需穿插。

六、基准与工具

基准榜单

评测工具

性能剖析工具

七、社区

跟上领域节奏靠固定的信息入口。以下社区覆盖"讨论、答疑、新动态"三个层次。

Discord / Slack

中文社区

  • 机器之心:偏学术与产业深度,论文解读质量高。
  • 量子位:偏产业动态与产品化新闻,速度快。
  • 知乎"大模型推理"话题:中文世界质量最高的 LLM 推理讨论区,从业者长文沉淀多。注意甄别时效性。

信息摄入的黄金比例

每天扫 arXiv cs.LG/cs.DC 标题(15 分钟);每周读 GPU Mode Discord 的精选 talk + 一份 newsletter;每月精读一篇本页列出的关键论文。资讯类公众号只做辅助,不做主源——能力来自论文与代码,不来自资讯。

怎么把它们串起来

最后给一张"阶段 → 主线资源 → 本站配套页"的对照表,按需取用:

你的阶段主线资源(本页)本站配套
刚接触推理优化,不知道是什么vLLM 文档 Getting Started + 什么是推理加速术语表
会跑 vLLM,想懂原理vLLM blog + PagedAttention 论文 + Jay Shah blogvLLM 与 PagedAttention
要在 H100 上榨干性能TensorRT-LLM 文档 + NVIDIA blog + Nsight 工具TensorRT-LLM + 调参与性能调优
想懂量化MIT 6.5940 + AWQ/GPTQ 论文 + Sasha Rush notebook模型量化基础 + 权重量化与混合精度
想懂 attention 优化CMU 15-819 + FlashAttention v1/v2/v3 + FlashInfer算子融合与自定义核
要做端侧部署llama.cpp + ONNX Runtime Mobile + MIT 6.5940llama.cpp 与 GGUF + 移动端部署
想做分布式推理NCCL 文档 + DeepSpeed-FastGen + DistServe 论文分布式推理(TP/PP)
想自己测基准MLPerf + vLLM benchmark suite + Nsight Systems基准数据与工具档案 + 推理基准测试实践

记住三条铁律:主线只挑一条;动手优先于收藏;官方文档与论文优先于二手教程。收藏 100 个链接不如跑通 1 个项目——现在,关掉这个页面,去学习路径挑一条线开始吧。