Skip to content

从这里开始

本页速览 为什么做推理加速与部署也要读论文?本文说清三类论文的不同价值,按目标给出三条入门路线,介绍本站论文栏目五部分导航,并附一条读论文最重要的一条建议。

从这里开始

一句话定位:这个栏目带你读懂推理加速与部署领域的论文——从"看得懂 SOSP/MLSys/arXiv 摘要"到"追得上 H100/B200 时代的系统节奏"。它不要求你一次啃完整个 FlashAttention 推导,而是先解决"读什么、怎么读、读到什么程度"三个问题。

一、栏目定位:为什么推理加速也要读论文

读论文不是研究者的专利,也不是面试时背的"加分表演"。对任何认真做推理部署的人来说,它有三个无法替代的价值:

1. 读懂原理,而不是背配置

你会在框架文档里学会 engine.generate(...),但只有论文能告诉你这行代码背后的设计为什么存在。PagedAttention 为什么要用块表(block table)管理 KV cache?FlashAttention 为什么宁可多算也要少读写 HBM?GPTQ 为什么在 Hessian 上做列缩并而不是逐层clip?

这些都不是拍脑袋想出来的。每个设计都对应原论文里的一次失败、一次 profile、一次消融。从论文中获得的不是"怎么调参",而是"为什么这么设计"——后者才是从"会用框架的人"升级为"能写引擎的人"的分水岭。本站核心知识(如什么是推理)讲的是概念地图,论文栏目补的是地图上的每一个地名为什么叫这个名字。

2. 跟上前沿,而不是追热点

推理系统的迭代速度以"季度"为单位:你一年前学的"最新技术",今天可能已经进了二线引擎的 changelog。而论文是前沿信息的第一手来源——新算子、新调度、新量化格式总是先以论文形式出现,半年后才进入 vLLM、TensorRT-LLM、SGLang 的 main 分支。

不读论文的人,只能从 Release Note 里获得被过滤、被简化、甚至被错过的信息;读论文的人,能直接判断"这个 3x 加速是在什么模型、什么 batch、什么硬件上、什么指标下取得的"。前者追 changelog,后者看趋势线。

3. 工程硬加分,而且是不可替代的硬加分

推理部署岗面试中,"聊透一篇系统论文"几乎必然出现。面试官问的往往不是摘要,而是:

  • 这篇论文要解决什么瓶颈?为什么是瓶颈?
  • 它的核心贡献是什么?以前的方法为什么不奏效?
  • 消融实验证明了什么?哪些是真正的算法创新,哪些只是 kernel 调参?
  • 换成我的硬件(A100 而不是 H100)、我的模型(13B 而不是 70B),这篇论文的方法会失效在哪里?

这些问题只有精读过原文才答得出来。面试官要的不是"你背过 PagedAttention",而是"你具备读系统论文的能力"——因为这正是日常部署优化的核心技能。

二、你该从哪开始:三条路线

读论文的深度没有统一标准,按你的目标选路线。三条路线都在阅读路径中展开,这里先给一张速览:

目标:两小时入门
├─ 只读 FlashAttention v1(摘要 + 第 3 节算法 + 图 1)
├─ 补一篇中文图解或笔记
└─ 产出:能说清"为什么 IO 感知让 attention 快 2-4 倍"

目标:工程落地
├─ 精读 vLLM / FlashAttention / GPTQ / AWQ / EAGLE-2 全文
├─ 重点看 profile、消融、工程局限(Discussion)
└─ 产出:能判断"这个方法能不能搬到我的业务模型和 batch size 上"

目标:做研究
├─ 精读全部 + 数学推导 + 自行复现 kernel
├─ 反向阅读参考文献、对比后续工作(FA1→FA2→FA3)
└─ 产出:能提出自己的算子/调度改进并 benchmark
路线适合人群阅读深度应读文章
两小时入门刚学完推理基础的学习者摘要 + 引言 + 算法图 + 结论经典论文精读 的 FlashAttention 篇开始
工程落地工程师、想用论文方法解决实际部署问题全文 + 消融 + 局限分析结合经典论文精读前沿进展
做研究系统方向研究生、计划发 MLSys/SOSP 的人全文 + 推导 + kernel 复现论文地图建立全局坐标系后深入

给新手的一句话

第一篇论文永远选"里程碑且好读"的,而不是"最新最热"的。 FlashAttention v1(NeurIPS 2022)经过时间检验、被无数后续工作引用、且写作清晰。先建立"能读懂一篇系统论文"的信心,再谈数量。

三、这个栏目里有什么

本站论文栏目共五个部分,建议按下面顺序逛:

页面一句话介绍你会得到什么
阅读路径栏目总入口:三条路线的具体文章清单与阅读顺序一份按目标编排的读论文路线图
论文地图把 2014–2025 推理加速关键论文按主题和时间轴排成地图宏观坐标系:知道哪篇是源头、哪篇是里程碑、哪篇是综述
经典论文精读逐篇精读改变领域的十篇经典论文:背景、机制、实验、局限吃透原理的能力,附送面试谈资
前沿进展追踪近年重要突破与趋势:FP8/FP4、Prefill/Decode 分离、投机解码、新硬件跟上 2024–2026 年的前沿节奏
阅读纪律与 FAQ读论文的方法论:怎么记笔记、读不懂怎么办、如何判断一篇论文好坏可持续阅读的习惯,而不是一次性冲动

栏目之间的逻辑是先地图、再精读、后前沿:地图解决"读什么",精读解决"读多透",前沿解决"往哪走"。术语不熟悉时随时查阅术语表

四、一条最重要的建议

最重要的建议:带走机制,别带走数字

论文里最容易被记住的往往是那个 speedup 数字:"比 PyTorch 快 2-4 倍""比 vLLM 吞吐高 2-3 倍""EAGLE-3 在 MT-Bench 上 6.5× 加速"。但请记住:

一切 speedup 都是"模型 + batch + 硬件 + 评测协议"四者的合谋。 换了模型(13B 而不是 70B)、换了硬件(A100 而不是 H100)、换了 batch size(1 而不是 256)、换了评测脚本(vLLM 0.6 而不是 0.4),数字就可能完全失效。用 2024 年的 H100 复现 2022 年的 FlashAttention v1 实验,结论可能完全反着写。

真正值得带走的是三样东西:

  1. 机制——这个方法为什么有效?它解决了什么结构性瓶颈?(如:FlashAttention 把 softmax 中间态从 HBM 搬到 SRAM,解决了 HBM 带宽墙)
  2. 失败分析——作者哪些实验没做、哪些硬件上不适用、作者自述的局限是什么?失败往往比成功更值钱。
  3. 适用边界——这个方法在什么 batch、什么序列长度、什么硬件代际下成立?(如:PagedAttention 在长序列 + 大 batch 下收益最大,单用户短序列下收益微乎其微)

Benchmark 数字会过时,机制与边界不会。

延伸阅读

  • 什么是推理 —— 概念与范式的地基,读论文前建议先有这份全局图
  • 阅读路径 —— 从本文出发的下一步:选定你的第一条路线
  • 论文地图 —— 把推理加速十年的关键论文排成时间轴
  • 经典论文精读 —— 最重要的十篇论文的逐段拆解
  • 术语表 —— 读论文时随时查阅的术语速查

参考资料

以下资料均为真实公开资源,供深入自学:

  • arXiv 预印本库 —— 绝大多数推理系统论文的预印本发布地,重点分区 cs.LGcs.DCcs.OS
  • Papers with Code —— 论文 + 代码 + 推理 benchmark 聚合,方便核对 SOTA 与复现
  • FlashAttention 官方仓库 —— 论文配套代码,是读 FlashAttention 系列的最佳拐杖
  • vLLM 官方仓库 —— PagedAttention 的工业级实现,issue 与 PR 里藏着大量工程细节
  • SOSP 2023 论文集 —— vLLM 论文发表会议,可顺带阅读同年的 DistServe 等系统论文
  • CUDA Programming Guide —— 读算子论文(FlashAttention、FlashInfer)必备的硬件背景
  • Tri Dao 博客 —— FlashAttention 作者博客,常发后续工作的"作者视角"解读