外观
精选资源清单
推理加速是个"硬骨头"学科——它一头挂着 PyTorch/CUDA 的工程实践、一头挂着 vLLM/PagedAttention 的系统论文,还涉及硬件体系结构。过去三年(2022–2026),这个领域沉淀出一批质量极高、且大多免费的官方资源:vLLM 的源码与 blog、FlashAttention 系列论文、CMU 15-819 ASPIRE 课程、CUDA Mode 播客。它们彼此之间有明确的能力递进与风格分工。本页按主题把它们整理成七类,每条给出一句话定位、适合谁和官方入口,链接均已逐一核验。
使用建议
这份清单不是"收藏夹",而是和本站 学习路径 配套的"外挂资源层"。建议做法是:先在本站建立概念骨架(从什么是推理加速与术语表开始),然后按本页的节奏挑一两条主线吃透——贪多嚼不烂,选一条主线走完胜过十条各学了前三章。
一、官方文档
推理引擎与底层库的官方文档是"随用随查"的权威来源,比任何二手教程都准。本节只保留学推理必碰的核心入口。
vLLM 文档
一句话定位:开源 LLM 推理引擎的"事实标准",文档含 PagedAttention、continuous batching、prefix caching 全部原理与 API。
vLLM 文档分三块:Getting Started(一行 pip install vllm 跑起来)、Design(PagedAttention 论文 + 架构图,新手必读)、API Reference(LLM 离线类与 AsyncLLMEngine 在线类的全部参数)。它的源码本身也是教材,vllm/core/scheduler.py 与 vllm/core/block_manager.py 是理解 continuous batching 的最佳现场。详见vLLM 与 PagedAttention。
- 适合谁:要部署/调优 LLM 推理服务的工程师;想读懂 PagedAttention 实现的研究者。
- 官方入口:docs.vllm.ai
TensorRT-LLM 文档
一句话定位:NVIDIA 官方 LLM 推理引擎,把 FP8、in-flight batching、speculative decoding 与 Hopper/Blackwell 硬件深度结合。
TensorRT-LLM 文档含 Builder/Engine/Runtime 三段式流水线说明、精度与量化(FP8、INT4 AWQ、SmoothQuant)、in-flight batching、speculative decoding(Medusa/EAGLE)以及 Multi-Device(TP/PP)配置。配套的 TensorRT-LLM benchmark 仓库是性能调优的第一手参考。详见TensorRT-LLM与TensorRT 与 GPU 推理。
- 适合谁:在 H100/H200/B200 上要榨干性能的工程师;做 FP8/FP4 部署的人。
- 官方入口:nvidia.github.io/TensorRT-LLM
NVIDIA Triton Inference Server 文档
一句话定位:NVIDIA 的多后端推理服务框架,统一管理 TensorRT/PyTorch/ONNX/TF 模型,提供 HTTP/gRPC 与动态 batching。
Triton 文档含 模型仓库管理(model repository layout)、后端(TensorRT、PyTorch、ONNX Runtime、Python backend)、动态 batching 策略、模型分析器(Model Analyzer)。它是把多个引擎"封装成统一服务"的事实方案。详见Triton 推理服务。
- 适合谁:要把多模型/多引擎统一成线上服务的人;要做模型版本管理与灰度发布的人。
- 官方入口:docs.nvidia.com/deeplearning/triton-inference-server
两个 Triton
官方文档 triton-inference-server 是推理服务框架;triton-lang 是 OpenAI 的 GPU kernel DSL。两者同名不同物,本节指前者,后者见算子融合相关章节。
ONNX Runtime 文档
一句话定位:微软的跨平台推理引擎,覆盖 CPU/GPU/NPU/移动端,是"一份模型到处跑"的工程底座。
ONNX Runtime 文档分 Execution Providers(CUDA、TensorRT、OpenVINO、CoreML、DirectML 等后端)、Graph Optimizer(图优化规则)、Performance Tuning(per-thread affinity、memory pattern)。它的跨平台特性是端侧与混合部署的关键。详见ONNX Runtime 跨平台。
- 适合谁:要跨硬件部署同一份模型的人;CPU/移动端推理工程师。
- 官方入口:onnxruntime.ai
OpenVINO 文档
一句话定位:Intel 的 CPU/iGPU/VPU 推理优化工具链,把 Intel 硬件上的矩阵乘榨到极致(含 AMX)。
OpenVINO 文档含 Model Optimizer(把 PyTorch/TF 模型转 IR)、NNCF(神经网络压缩框架,量化/剪枝/蒸馏)、Inference Engine(运行时)。它是 Intel CPU 推理的第一选择。详见OpenVINO 与 CPU 推理。
- 适合谁:在 Intel CPU/iGPU 上部署推理的人;用 AMX 榨 CPU 矩阵乘性能的人。
- 官方入口:docs.openvino.ai
CUDA Toolkit / cuDNN / cuBLAS 文档
一句话定位:NVIDIA GPU 编程与算子库的官方文档,理解 GPU 微架构与算子优化的根基。
CUDA Toolkit 含 CUDA C++ Programming Guide(SIMT、warp、shared memory、stream)、CUDA C++ Best Practices Guide(优化技巧)、Nsight 文档。cuDNN/cuBLAS 是 GEMM/卷积/归一化的底层库文档。详见GPU 体系结构与优化与硬件基础速查。
- 适合谁:要写自定义 CUDA kernel 的人;做算子级性能调优的人。
- 官方入口:docs.nvidia.com/cuda
PyTorch 文档
一句话定位:训练与推理的主流框架,2.x 起的 torch.compile 是入门图编译的入口。
PyTorch 文档的 Tutorials 含"从 eager 到 torch.compile"与"Transformer from scratch"等必读;torch.compile 文档是理解 JIT 编译、kernel fusion 的实操入口;Distributed 文档(DDP、FSDP、TP)是大模型推理分布式的基础。详见推理 vs 训练 vs 微调与分布式推理。
- 适合谁:把 PyTorch 模型从训练搬到推理的人;想懂
torch.compile背后图编译的人。 - 官方入口:pytorch.org/docs/stable
官方文档怎么读
框架文档不是教材,别从头通读。正确做法:先 30 分钟读 Getting Started 建立心智模型,带着具体问题进 API 页("这个参数什么意思"),最后用示例页做模板改自己的代码。引擎之间的取舍见推理引擎选型对比。
二、论文 arxiv
推理加速领域几乎每一项关键技术都对应一篇里程碑论文。这里按主题精选必读论文,每条附一句话定位,完整精读见经典论文精读与论文地图。
Attention 加速
- FlashAttention v1(arxiv 2205.14135):tiling + 在线 softmax 避免 N×N 矩阵实例化,attention 加速 2–4×。详见算子融合与自定义核。
- FlashAttention v2(arxiv 2307.08691):更少 non-MMA 计算、更好的并行切分,A100 上 2× 于 v1。
- FlashAttention v3(arxiv 2407.08608):Hopper 特化,FP8 + 异步 TMA,H100 上接近峰值带宽。
- FlashInfer(arxiv 2401.02081):专为 LLM 推理设计的 attention kernel 库,覆盖 prefill/decode/append。
- PagedAttention(arxiv 2309.06180):vLLM 的 KV cache 分页管理,OS 虚拟内存思想搬到 LLM。详见vLLM 与 PagedAttention。
量化
- GPTQ(arxiv 2210.17323):基于二阶 Hessian 的 PTQ,逐列量化补偿误差,INT4 LLM 量化事实标准之一。详见权重量化与混合精度。
- AWQ(arxiv 2306.00978):保护"重要通道"的 weight-only 量化,另一 INT4 主流。
- SmoothQuant(arxiv 2211.10438):把激活的难量化通过平滑迁移到权重,实现 W8A8 INT8。
- ZeroQuant(arxiv 2206.01861):字节跳动的 per-token + per-group 量化方案。
- FP8 论文与规格:NVIDIA、Intel、AMD 联合发布的 FP8 Formats for Deep Learning,Hopper 硬件原生精度的基础。
投机解码与并行
- Medusa(arxiv 2401.10774):多头并行猜若干 token、原模型一次验证,无需 draft 模型。详见投机解码与 Medusa/EAGLE。
- EAGLE-2/3(arxiv 2401.15077、arxiv 2503.01840):自回归 draft + 动态树,吞吐提升 2–3×。
- DistServe(arxiv 2401.09670):prefill 与 decode 分离到不同 GPU,各自优化。详见批处理与请求调度。
- Splitwise(arxiv 2311.18677):相似思想的 prefill/decode 分离架构。
- SARATHI(arxiv 2308.16369):chunked prefill,把长 prompt 切块与 decode 共调度。
- DeepSeek-V3 技术报告(arxiv 2412.19437):MoE 训练与推理工程实践,EP 并行的真实案例。
引擎与系统
- vLLM(arxiv 2309.06180):PagedAttention + continuous batching 的原始论文。
- SGLang(arxiv 2312.07104):RadixAttention 前缀缓存与结构化生成编程模型。
- DeepSpeed-FastGen(arxiv 2401.08671):Microsoft 的 LLM 推理系统,Dynamic Splitfuse 思想。
更多论文按阅读路径组织见阅读路径与论文地图,前沿进展见前沿进展。
三、开源代码仓库
读源码是理解推理引擎内部机制的最快路径。本节按"从主流到配套"组织。
主流 LLM 推理引擎
- vllm-project/vllm:开源 LLM 推理引擎事实标准,PagedAttention + continuous batching 起家。详见vLLM 与 PagedAttention。
- NVIDIA/TensorRT-LLM:NVIDIA 官方 LLM 引擎,FP8 与硬件深度结合。详见TensorRT-LLM。
- sglang-project/SGLang:结构化生成与 RadixAttention 前缀缓存。
- huggingface/text-generation-inference(TGI):HF 官方 LLM 服务化引擎。
- ggerganov/llama.cpp:C++ 实现的全平台 LLM 推理库,GGUF 格式是端侧事实标准。详见llama.cpp 与 GGUF。
经典推理引擎与编译器
- NVIDIA/TensorRT:NVIDIA GPU 推理优化引擎,TensorRT-LLM 的底层。详见TensorRT 与 GPU 推理。
- microsoft/onnxruntime:跨平台推理引擎。详见ONNX Runtime 跨平台。
- NVIDIA/triton-inference-server:多后端推理服务框架。详见Triton 推理服务。
- apache/tvm:端到端深度学习编译器,图优化 + kernel auto-tuning。详见计算图优化。
算子与底层
- openai/triton:GPU kernel DSL,FlashAttention v2 起基于它。详见算子融合与自定义核。
- flashinfer-ai/flashinfer:LLM attention kernel 库,被 vLLM/SGLang 采用。
- Dao-AILab/flash-attention:FlashAttention 官方实现,含 v1/v2/v3。
- comefromplutozh/w8a8(社区实现):SmoothQuant 与 W8A8 量化的教学参考实现。
量化与压缩
- AUTOMATIC1111/stable-diffusion-webui:Stable Diffusion 量化部署社区方案,INT4/INT8 实战参考。
- casper-hansen/AutoAWQ:AWQ 量化官方实现。
- IST-DASLab/gptq:GPTQ 量化官方实现。
四、博客教程
跟上推理加速领域节奏,博客比论文更及时,比官方文档更易懂。本节保留质量最高的一批。
引擎官方 blog
- vLLM blog:PagedAttention、continuous batching、prefix caching、SGLang 对比的官方发布地,每篇都配实测数据。
- SGLang blog:RadixAttention、结构化生成、多轮对话优化的官方解读。
- NVIDIA Developer Blog:TensorRT-LLM、FP8、Hopper Transformer Engine 的深度技术解读。
个人深度博客
- Jay Shah's blog:PagedAttention、continuous batching、speculative decoding 的逐行源码级解读,被 vLLM 官方推荐。
- Aleksa's "attention" 系列:从最朴素的 attention 到 FlashAttention v3 的演进,含可视化。
- Lilian Weng — Lil'Log:前 OpenAI 研究主管的长文,量化和 LLM 推理系统系列密度极高。
- Hugging LLM Course:HF 官方 LLM 应用课程,含推理部署章节。
- Soumith Chintala 的博客与 talk:PyTorch 作者之一,关于 GPU 与深度学习系统的洞察。
播客与视频
- GPU Mode Discord:GPU 编程与推理优化社区,每周都有 talk,技术含量极高。
- CUDA Mode YouTube:GPU Mode 的视频频道,FlashAttention、Triton、Nsight 实操讲解。
- Karpathy YouTube:虽然主打训练,但"Let's build GPT"与"intro to LLMs"对理解推理机制极有帮助。
五、课程
学术课程是系统建立"推理优化心智模型"的最佳路径,以下是公认顶级且全部免费的课程。
CMU 15-819 ASPIRE(Hazy Research)
一句话定位:Stanford Hazy Research 的 Tri Dao 在 CMU 开的"高效深度学习"课程,FlashAttention 与系统优化的第一手讲解。
覆盖 attention 优化、kernel fusion、长上下文、稀疏注意力、采样加速。Tri Dao 是 FlashAttention 一作,他的课是这门领域"作者本人讲自己工作"的稀缺资源。配套的 Notes 与 Hazy Research 的 blog 互为补充。
- 适合谁:想深入 FlashAttention 与长上下文优化的人;推理引擎开发者。
- 官方入口:cs.cmu.edu/~15319
MIT 6.5940(Song Han 团队)
一句话定位:Han Lab 的"TinyML 与 Efficient Deep Learning"课程,量化、剪枝、蒸馏的体系化讲解。
Song Han 是深度学习压缩领域的奠基人之一(Deep Compression),这门课从算法到硬件全覆盖,含 INT4/INT8 量化、结构化剪枝、知识蒸馏的完整链条,配 Lab 作业。详见模型量化基础、剪枝与稀疏化、知识蒸馏。
- 适合谁:做模型压缩与端侧部署的人;想理解量化/剪枝原理的人。
- 官方入口:hanlab.mit.edu/courses/2024-fall-65940
Stanford CS336
一句话定位:斯坦福"从零实现大语言模型"课,覆盖训练 + 推理 + 系统。
CS336 不止讲怎么训 LLM,还讲怎么高效推理——含 KV cache、attention 优化、量化的实操。作业要求从零写 attention kernel、实现 KV cache。它是理解"训练到推理全链路"的最佳单门课。
- 适合谁:要建 LLM 系统全栈的人;想从零实现 KV cache 与 attention 的人。
- 官方入口:stanford-cs336.github.io/s2025
Sasha Rush 的 Tensor 园
一句话定位:Cornell 教授 Sasha Rush 的"annotated tensor"系列,用 Jupyter 把 attention、RoPE、量化逐行讲透。
Sasha Rush(PyTorch TorchDynamo 作者之一)用 annotated Python notebook 把抽象概念变成可运行代码——从 attention 的矩阵乘到 FlashAttention 的 tiling,再到 INT4 量化的反量化 GEMM,每一步都配代码与图。是"动手学"的最佳资源。
- 适合谁:通过代码而非公式学习的人;想从零实现 attention/量化的人。
- 官方入口:srush.github.io/tensor-loaded
课程搭配建议
先 CS336建立 LLM 系统全局观(含推理);深入量化/剪枝上 MIT 6.5940;深入 attention 优化与长上下文上 CMU 15-819;配合 Sasha Rush 的 notebook 边读边动手。配合本站学习路径按需穿插。
六、基准与工具
基准榜单
- MLPerf Inference:业界最权威推理基准,含 Llama-2-70B、Llama-3.1-405B。详见基准数据与工具档案。
- Hugging Face Open LLM Leaderboard:模型质量主榜单,选模型的第一参考。
- Papers with Code:论文 + 代码 + benchmark 三合一,找 SOTA 与对应实现。
评测工具
- lm-evaluation-harness:EleutherAI 的 LLM 质量评测框架,Open LLM Leaderboard 底层。
- vLLM benchmark suite:LLM 服务吞吐与延迟压测。
- sglang bench:结构化生成与多轮对话压测。
性能剖析工具
- Nsight Systems:GPU 时间线、kernel 占比,排查推理瓶颈的第一工具。详见调参与性能调优。
- Nsight Compute:单 kernel 算力/带宽/占用率剖析。
- PyTorch Profiler:PyTorch 算子级耗时与显存。
- Triton tutorial:写自定义 kernel 的入门教程,从 vector add 到 fused attention。
七、社区
跟上领域节奏靠固定的信息入口。以下社区覆盖"讨论、答疑、新动态"三个层次。
Discord / Slack
- GPU Mode Discord:GPU 编程与推理优化社区最活跃的阵地,作者亲自答疑。强推。
- vLLM Slack:vLLM 官方社区,bug report 与 feature request 第一现场。
- NVIDIA Developer Forums:TensorRT、CUDA、cuDNN 官方答疑,问题留痕可搜。
- Hugging Face Discord:HF 生态讨论,Transformers/TGI 相关问题。
中文社区
信息摄入的黄金比例
每天扫 arXiv cs.LG/cs.DC 标题(15 分钟);每周读 GPU Mode Discord 的精选 talk + 一份 newsletter;每月精读一篇本页列出的关键论文。资讯类公众号只做辅助,不做主源——能力来自论文与代码,不来自资讯。
怎么把它们串起来
最后给一张"阶段 → 主线资源 → 本站配套页"的对照表,按需取用:
| 你的阶段 | 主线资源(本页) | 本站配套 |
|---|---|---|
| 刚接触推理优化,不知道是什么 | vLLM 文档 Getting Started + 什么是推理加速 | 术语表 |
| 会跑 vLLM,想懂原理 | vLLM blog + PagedAttention 论文 + Jay Shah blog | vLLM 与 PagedAttention |
| 要在 H100 上榨干性能 | TensorRT-LLM 文档 + NVIDIA blog + Nsight 工具 | TensorRT-LLM + 调参与性能调优 |
| 想懂量化 | MIT 6.5940 + AWQ/GPTQ 论文 + Sasha Rush notebook | 模型量化基础 + 权重量化与混合精度 |
| 想懂 attention 优化 | CMU 15-819 + FlashAttention v1/v2/v3 + FlashInfer | 算子融合与自定义核 |
| 要做端侧部署 | llama.cpp + ONNX Runtime Mobile + MIT 6.5940 | llama.cpp 与 GGUF + 移动端部署 |
| 想做分布式推理 | NCCL 文档 + DeepSpeed-FastGen + DistServe 论文 | 分布式推理(TP/PP) |
| 想自己测基准 | MLPerf + vLLM benchmark suite + Nsight Systems | 基准数据与工具档案 + 推理基准测试实践 |
记住三条铁律:主线只挑一条;动手优先于收藏;官方文档与论文优先于二手教程。收藏 100 个链接不如跑通 1 个项目——现在,关掉这个页面,去学习路径挑一条线开始吧。