外观
从这里开始
一句话定位:这个栏目带你读懂推理加速与部署领域的论文——从"看得懂 SOSP/MLSys/arXiv 摘要"到"追得上 H100/B200 时代的系统节奏"。它不要求你一次啃完整个 FlashAttention 推导,而是先解决"读什么、怎么读、读到什么程度"三个问题。
一、栏目定位:为什么推理加速也要读论文
读论文不是研究者的专利,也不是面试时背的"加分表演"。对任何认真做推理部署的人来说,它有三个无法替代的价值:
1. 读懂原理,而不是背配置
你会在框架文档里学会 engine.generate(...),但只有论文能告诉你这行代码背后的设计为什么存在。PagedAttention 为什么要用块表(block table)管理 KV cache?FlashAttention 为什么宁可多算也要少读写 HBM?GPTQ 为什么在 Hessian 上做列缩并而不是逐层clip?
这些都不是拍脑袋想出来的。每个设计都对应原论文里的一次失败、一次 profile、一次消融。从论文中获得的不是"怎么调参",而是"为什么这么设计"——后者才是从"会用框架的人"升级为"能写引擎的人"的分水岭。本站核心知识(如什么是推理)讲的是概念地图,论文栏目补的是地图上的每一个地名为什么叫这个名字。
2. 跟上前沿,而不是追热点
推理系统的迭代速度以"季度"为单位:你一年前学的"最新技术",今天可能已经进了二线引擎的 changelog。而论文是前沿信息的第一手来源——新算子、新调度、新量化格式总是先以论文形式出现,半年后才进入 vLLM、TensorRT-LLM、SGLang 的 main 分支。
不读论文的人,只能从 Release Note 里获得被过滤、被简化、甚至被错过的信息;读论文的人,能直接判断"这个 3x 加速是在什么模型、什么 batch、什么硬件上、什么指标下取得的"。前者追 changelog,后者看趋势线。
3. 工程硬加分,而且是不可替代的硬加分
推理部署岗面试中,"聊透一篇系统论文"几乎必然出现。面试官问的往往不是摘要,而是:
- 这篇论文要解决什么瓶颈?为什么是瓶颈?
- 它的核心贡献是什么?以前的方法为什么不奏效?
- 消融实验证明了什么?哪些是真正的算法创新,哪些只是 kernel 调参?
- 换成我的硬件(A100 而不是 H100)、我的模型(13B 而不是 70B),这篇论文的方法会失效在哪里?
这些问题只有精读过原文才答得出来。面试官要的不是"你背过 PagedAttention",而是"你具备读系统论文的能力"——因为这正是日常部署优化的核心技能。
二、你该从哪开始:三条路线
读论文的深度没有统一标准,按你的目标选路线。三条路线都在阅读路径中展开,这里先给一张速览:
目标:两小时入门
├─ 只读 FlashAttention v1(摘要 + 第 3 节算法 + 图 1)
├─ 补一篇中文图解或笔记
└─ 产出:能说清"为什么 IO 感知让 attention 快 2-4 倍"
目标:工程落地
├─ 精读 vLLM / FlashAttention / GPTQ / AWQ / EAGLE-2 全文
├─ 重点看 profile、消融、工程局限(Discussion)
└─ 产出:能判断"这个方法能不能搬到我的业务模型和 batch size 上"
目标:做研究
├─ 精读全部 + 数学推导 + 自行复现 kernel
├─ 反向阅读参考文献、对比后续工作(FA1→FA2→FA3)
└─ 产出:能提出自己的算子/调度改进并 benchmark| 路线 | 适合人群 | 阅读深度 | 应读文章 |
|---|---|---|---|
| 两小时入门 | 刚学完推理基础的学习者 | 摘要 + 引言 + 算法图 + 结论 | 从 经典论文精读 的 FlashAttention 篇开始 |
| 工程落地 | 工程师、想用论文方法解决实际部署问题 | 全文 + 消融 + 局限分析 | 结合经典论文精读与前沿进展 |
| 做研究 | 系统方向研究生、计划发 MLSys/SOSP 的人 | 全文 + 推导 + kernel 复现 | 从论文地图建立全局坐标系后深入 |
给新手的一句话
第一篇论文永远选"里程碑且好读"的,而不是"最新最热"的。 FlashAttention v1(NeurIPS 2022)经过时间检验、被无数后续工作引用、且写作清晰。先建立"能读懂一篇系统论文"的信心,再谈数量。
三、这个栏目里有什么
本站论文栏目共五个部分,建议按下面顺序逛:
| 页面 | 一句话介绍 | 你会得到什么 |
|---|---|---|
| 阅读路径 | 栏目总入口:三条路线的具体文章清单与阅读顺序 | 一份按目标编排的读论文路线图 |
| 论文地图 | 把 2014–2025 推理加速关键论文按主题和时间轴排成地图 | 宏观坐标系:知道哪篇是源头、哪篇是里程碑、哪篇是综述 |
| 经典论文精读 | 逐篇精读改变领域的十篇经典论文:背景、机制、实验、局限 | 吃透原理的能力,附送面试谈资 |
| 前沿进展 | 追踪近年重要突破与趋势:FP8/FP4、Prefill/Decode 分离、投机解码、新硬件 | 跟上 2024–2026 年的前沿节奏 |
| 阅读纪律与 FAQ | 读论文的方法论:怎么记笔记、读不懂怎么办、如何判断一篇论文好坏 | 可持续阅读的习惯,而不是一次性冲动 |
栏目之间的逻辑是先地图、再精读、后前沿:地图解决"读什么",精读解决"读多透",前沿解决"往哪走"。术语不熟悉时随时查阅术语表。
四、一条最重要的建议
最重要的建议:带走机制,别带走数字
论文里最容易被记住的往往是那个 speedup 数字:"比 PyTorch 快 2-4 倍""比 vLLM 吞吐高 2-3 倍""EAGLE-3 在 MT-Bench 上 6.5× 加速"。但请记住:
一切 speedup 都是"模型 + batch + 硬件 + 评测协议"四者的合谋。 换了模型(13B 而不是 70B)、换了硬件(A100 而不是 H100)、换了 batch size(1 而不是 256)、换了评测脚本(vLLM 0.6 而不是 0.4),数字就可能完全失效。用 2024 年的 H100 复现 2022 年的 FlashAttention v1 实验,结论可能完全反着写。
真正值得带走的是三样东西:
- 机制——这个方法为什么有效?它解决了什么结构性瓶颈?(如:FlashAttention 把 softmax 中间态从 HBM 搬到 SRAM,解决了 HBM 带宽墙)
- 失败分析——作者哪些实验没做、哪些硬件上不适用、作者自述的局限是什么?失败往往比成功更值钱。
- 适用边界——这个方法在什么 batch、什么序列长度、什么硬件代际下成立?(如:PagedAttention 在长序列 + 大 batch 下收益最大,单用户短序列下收益微乎其微)
Benchmark 数字会过时,机制与边界不会。
延伸阅读
- 什么是推理 —— 概念与范式的地基,读论文前建议先有这份全局图
- 阅读路径 —— 从本文出发的下一步:选定你的第一条路线
- 论文地图 —— 把推理加速十年的关键论文排成时间轴
- 经典论文精读 —— 最重要的十篇论文的逐段拆解
- 术语表 —— 读论文时随时查阅的术语速查
参考资料
以下资料均为真实公开资源,供深入自学:
- arXiv 预印本库 —— 绝大多数推理系统论文的预印本发布地,重点分区
cs.LG、cs.DC、cs.OS - Papers with Code —— 论文 + 代码 + 推理 benchmark 聚合,方便核对 SOTA 与复现
- FlashAttention 官方仓库 —— 论文配套代码,是读 FlashAttention 系列的最佳拐杖
- vLLM 官方仓库 —— PagedAttention 的工业级实现,issue 与 PR 里藏着大量工程细节
- SOSP 2023 论文集 —— vLLM 论文发表会议,可顺带阅读同年的 DistServe 等系统论文
- CUDA Programming Guide —— 读算子论文(FlashAttention、FlashInfer)必备的硬件背景
- Tri Dao 博客 —— FlashAttention 作者博客,常发后续工作的"作者视角"解读