Skip to content

论文地图

本页速览 把推理加速与部署领域 2014–2025 关键论文按主题分组排成一张可检索的地图,覆盖算子优化、量化、服务系统、投机解码、分布式训练推理、端侧部署六大主题,附范式迁移时间轴与按任务查论文索引。

论文地图

一句话定位:这张地图把推理加速与部署领域 2014–2025 的关键论文按主题与年代排成一张可随时检索的坐标系——从 2014 年 PipeDream 的流水并行,到 2025 年 EAGLE-3 的 6.5× 加速,读完这张地图,你能说出"每一篇关键论文解决了什么瓶颈、与前后哪些工作相连、值得精读还是泛读"。

论文阅读最大的障碍不是"读不懂一篇",而是"不知道下一篇该读哪篇"。教程会按顺序教,但论文世界是按问题组织的:同一个问题(比如"怎么让 attention 不被 HBM 卡住")在 2022 年的答案是 FlashAttention v1,在 2023 年是 FlashAttention-2,在 2024 年是 FlashAttention-3(H100 FP8),在 2024 年还有 vAttention(用软件 PagedAttention 逼近硬件原生稀疏 attention)。如果你只顺着时间线读,你会迷失在"谁优化了谁"的细节里;如果你只按主题读,你会错过"为什么硬件代际迁移会重塑算法路线"的宏观叙事。这张地图的目的,就是把主题时间两个维度叠在一起,让你在任何一篇论文面前都能回答三个问题:它属于哪条技术线?它处在范式演进的哪个阶段?它和哪几篇论文构成"必读链"?

地图与其他页面的分工

本站论文栏目共五页,分工不同:从这里开始 讲"为什么要读推理论文",阅读路径 讲"按目标怎么读",本文(论文地图) 讲"整个领域有哪些值得读的论文、它们之间什么关系",经典论文精读 逐篇深挖,前沿进展 追踪 2024–2026 年的新趋势。一句话:地图定坐标,精读给深度,前沿指方向。

一、这张地图怎么读

在展开地图之前,先说清三条阅读约定:

  1. 编号约定:所有论文都给 arXiv 编号(或会议/期刊正式出处),可在 https://arxiv.org/abs/编号 免费取全文;老论文无 arXiv 的标注"—",出处写会议/期刊,可在参考资料中找到原文链接。
  2. 年份约定:论文年份一律指首次公开发表(会议/期刊正式发表,或 arXiv 预印本提交)的年份。例如 FlashAttention v1 的 arXiv 预印本 2022 年 6 月提交、NeurIPS 2022 发表,表格记为 2022。
  3. 深读约定:地图只给"一句话贡献",回答"这篇为什么值得记"。想读透一篇时,跳到经典论文精读;想追它之后的发展,用前沿进展FAQ 中的检索法

三大坐标一起使用:主题决定它归哪条线,年份决定它在范式演进中的位置,重要度决定你投入多少时间。下图是这张地图的总览:

                      主题维度(六大技术线)
                    ┌──────────────────────────────┐
  时间维度 ↓        │  ① 算子优化                   │
                    │  ② 量化与压缩                 │
                    │  ③ 服务系统与调度             │
                    │  ④ 投机解码与并行解码         │
                    │  ⑤ 分布式训练/推理            │
                    │  ⑥ 端侧与边缘部署             │
                    └──────────────────────────────┘

二、按主题分组的学术地图

1. 算子优化:从朴素 attention 到 IO 感知与硬件协同(2017–2025)

这一组的核心问题始终是:attention 的 O(n²) 复杂度为什么是瓶颈?是 FLOPs 瓶颈还是 IO 瓶颈? 2017 年 Transformer 之后,社区先在 FLOPs 上做文章(稀疏注意力、Longformer、Big Bird),直到 2022 年 FlashAttention 指出瓶颈在 HBM 带宽,路线才被纠回到"IO 感知 + 算子融合"。

论文作者/机构年份出处/arXiv一句话贡献
Attention Is All You NeedVaswani 等(Google Brain)2017arXiv:1706.03762提出 Transformer 与纯 attention 架构,O(n²) 复杂度的源头
Longformer / Big BirdBeltagy 等 / Zaheer 等2020arXiv:2004.05150 / arXiv:2007.14062稀疏注意力,把全局 attention 替换为"局部窗口 + 少量全局",长文本上算力 O(n)
FlashAttention v1Dao 等(Stanford)2022arXiv:2205.14135IO 感知的 attention 算子,分块 + online softmax + 中间态不写回 HBM,A100 上快 2-4 倍
FlashAttention-2Dao(Stanford)2023arXiv:2307.08691重做并行与工作划分,长序列下 GPU 利用率从 35% 提到 50-73%
FlashAttention-3Shah 等(Princeton)2024arXiv:2407.08608H100 上的 FP8 + 异步(warp-specialized),峰值 1.2 PFLOPs,比 FA2 快 1.5-2×
FlashInferYe 等(Princeton/DeepSeek)2024arXiv:2401.12448块稀疏 + 可组合 KV 格式,把 paged KV 与变长 attention 统一在一个 kernel
vAttentionPrabhu 等(Georgia Tech)2024arXiv:2405.04447用硬件原生 sparse attention 实现软件 PagedAttention 的功能,避免 SM 阻塞

为什么先读 FlashAttention 系列再读 vAttention

FlashAttention 三代(v1→v2→v3)展示了"同一个数学公式,三代工程实现"的演进范式:v1 找到瓶颈(IO),v2 优化并行,v3 协同硬件(H100 FP8)。vAttention 则提出"能不能用硬件稀疏 attention 替代软件 PagedAttention",是 2024 年的新范式争论。读懂这条线,就抓住了"算子优化如何跟随硬件代际演进"的核心规律。 算子机制详解见算子融合

2. 量化与压缩:从均匀量化到二阶信息与旋转量化(2020–2025)

量化的核心问题是:能不能用更少的 bit 表示权重与激活,且精度损失可接受? 这条线在 2020 年代经历过三次范式迁移:从朴素 round-to-nearest → LLM.int8() 发现离群值 → GPTQ/AWQ/SmoothQuant 用更聪明的方法保护重要参数 → 2024 年的旋转量化(QuaRot/SpinQuant)与 FP8/FP4 硬件量化。

论文作者/机构年份出处/arXiv一句话贡献
LLM.int8()Dettmers 等(Washington)2022arXiv:2208.07339发现 >6.7B 模型有"离群值特征",提出混合精度(离群值列用 FP16、其他 INT8),LLM 量化研究的起点
GPTQFrantar 等(IST Austria)2022arXiv:2210.17323用 Hessian 信息做后训练 4-bit 权重量化,175B 模型上精度损失 < 1%,二阶量化范式
SmoothQuantXiao 等(MIT/字节)2022arXiv:2211.10438把激活的离群值平滑到权重,让 W8A8 量化成为可能,激活量化的破局者
AWQLin 等(MIT/Hugging Face)2023arXiv:2306.00978激活感知的显著权重保护,比 GPTQ 快 3 倍且精度相当,工程落地常用
ZeroQuantYao 等(Microsoft)2022arXiv:2206.01861权重与激活联合量化 + 逐块校准,训练后量化的早期工业方案
FP8 LLM 推理(NVIDIA)NVIDIA2023NVIDIA FP8 白皮书H100 引入 FP8 Tensor Core,硬件级量化甜点格式
QuaRotAshkboos 等(ETH)2024arXiv:2404.00456旋转量化:用随机正交变换把离群值"抹平",让 W4A4 量化精度大增
SpinQuantLiu 等(Meta)2024arXiv:2405.16406学习型旋转矩阵,比 QuaRot 的随机旋转更优,W4A4 量化接近 W4A16

量化的两条主线

权重侧:GPTQ 与 AWQ 用二阶/激活信息定位"显著权重",是"差异化保护"。激活侧:SmoothQuant 把难度从激活迁到权重,QuaRot/SpinQuant 用旋转把分布"抹平"。两条线最终汇合于 2024 年的 W4A4 + 旋转,让 4-bit 推理逼近 16-bit 精度。量化机制详见量化权重混合精度

3. 服务系统与调度:从朴素 batching 到 Prefill/Decode 分离(2022–2025)

服务系统的核心问题是:多用户、变长请求下,怎么让 GPU 不空转、显存不碎片、长尾延迟可控? 2022 年 Orca 提出 iteration-level scheduling,2023 年 vLLM 用 PagedAttention 把 KV cache 当虚拟内存管,2024 年 DistServe/Splitwise 把 prefill 与 decode 物理分离,2024 年 SARATHI 用 chunked prefill 平衡算力。

论文作者/机构年份出处/arXiv一句话贡献
OrcaYu 等(微软)2022OSDI 2022iteration-level scheduling,让不同长度请求在同 batch 推进,continuous batching 前身
vLLM / PagedAttentionKwon 等(Berkeley)2023SOSP 2023KV cache 当虚拟内存管,block table + 块级分配,吞吐 2-4×
AlpaServeLi 等(Berkeley)2023OSDI 2023模型并行 + 时分复用,用统计复用率指导多模型部署,多模型服务优化
SARATHIAgarwal 等(微软)2023arXiv:2308.16369chunked prefill,把长 prefill 拆 chunk 与 decode 同 batch,平衡算力与显存
DistServeZhong 等(北大/清华)2024arXiv:2401.09670prefill 与 decode 物理分离到不同 GPU,各自独立 scaling
SplitwisePatel 等(微软/印度理工)2024HPCA 2024与 DistServe 思路相似,但聚焦"分阶段机器"的集群级方案
SGLangZheng 等(Berkeley/DeepSeek)2024arXiv:2312.07104RadixAttention:前缀树复用 KV cache,多轮对话与 few-shot 场景的吞吐利器
Mooncake月之暗面2024arXiv:2407.00079KV cache 分离的全球级服务架构,KV cache 当作一等公民存储

服务系统演进的三个阶段

阶段一(2022 Orca):把"按请求 batching"换成"按 iteration batching",吞吐飞跃。阶段二(2023 vLLM):把"显存预分配"换成"按需块级分配",KV 碎片消除。阶段三(2024 DistServe/SARATHI):把"prefill + decode 同 GPU 同 batch"拆开,因为两者算力/显存比完全相反。读懂这三个阶段,就理解了 LLM 服务演进史。服务机制详见批处理与调度模型服务

4. 投机解码与并行解码:从单步到多 token 预测(2022–2025)

解码层的核心瓶颈是:自回归生成每步只产 1 token,KV cache 重算 1000+ 次只为生成 1000 个 token。投机解码的思路是"用小成本猜 k 个 token,再用大模型一次性验证",2023 年 Leviathan 把它正式化,2024 年 Medusa/EAGLE-1/2 各自升级 drafting,2025 年 EAGLE-3 把加速比推到 6.5×。

论文作者/机构年份出处/arXiv一句话贡献
Speculative DecodingLeviathan 等(Google/Technion)2023arXiv:2211.17192用小模型猜 + 大模型并行验证,无损加速,spec decoding 的正式化
SpecInferMiao 等(CMU/SCU)2023arXiv:2302.02018token 树并行验证 +狮心 SSG,把 spec decoding 与多 draft 升级
MedusaCai 等(Princeton/DeepSeek)2024arXiv:2401.10774主模型多头并行预测,不再需要独立小模型,简化 spec decoding
EAGLE-1Li 等(北大/腾讯)2024arXiv:2401.15077用主模型 hidden state 做 draft,draft 与 verify 特征对齐,接受率 50%+
EAGLE-2Li 等(北大/腾讯)2024arXiv:2406.16858动态 draft tree,根据上下文概率裁剪树形,接受率推到 70%+
EAGLE-3Li 等(北大/腾讯)2025arXiv:2503.01840用隐藏层深层特征 + 训练目标改进,加速比 3-6.5×
SpecForgeSGLang 组2025SGLang 博客多 draft 模型训练管线,把 spec decoding 当成"工程产物"而非"模型产物"
DeepSeek-V3 MTPDeepSeek-AI2024arXiv:2412.19437主模型原生支持 multi-token prediction,训练时学 spec decoding 能力

投机解码的"成本账"

spec decoding 的核心权衡是:draft 多花的算力 vs verify 节省的步数。draft 越准、接受率越高,节省越多;draft 越大,开销越大。EAGLE 系列的演进逻辑是"用主模型 hidden state 让 draft 既准又小",DeepSeek-V3 的 MTP 是另一条路——让主模型在训练时就学会一次吐多个 token,把 spec decoding 内化为训练目标。两者哪个能成为主流,是 2025–2026 的开放问题。案例详见投机解码案例

5. 分布式训练/推理:从数据并行到专家并行与流水并行(2019–2025)

分布式不再是"训练时的事"——MoE 推理让专家并行成为推理部署的刚需,DeepSeek-V3 的 671B 总参数 + 37B 激活让推理侧的分布式调度与训练侧同样复杂。

论文作者/机构年份出处/arXiv一句话贡献
Megatron-LMShoeybi 等(NVIDIA)2019arXiv:1904.10509张量并行:把每层的矩阵乘法按列/行切到多 GPU,大模型训练的基础设施
PipeDreamNarayanan 等(Stanford/Google)2019arXiv:1806.03312流水并行 + micro-batching + 1F1B 调度,让"层切到不同 GPU"成为可行
MegaScaleJiang 等(字节跳动)2024NSDI 2024万亿参数 MoE 训练的工业级系统,通信/计算 overlap 与故障恢复
Mixtral of ExpertsMistral AI2024arXiv:2401.040888 专家 MoE 开源权重,把 MoE 从闭源带入开源,推理侧专家并行成为标配
DeepSeek-V3DeepSeek-AI2024arXiv:2412.19437256 专家 + 8 激活 MoE + MTP,把 MoE 推理服务推到千亿级开源标杆

训练与推理的分布式边界在模糊

Megatron 与 PipeDream 是训练侧的论文,但它们的并行方案(TP/PP/SP)被推理侧直接继承——TensorRT-LLM 与 vLLM 的多 GPU 推理用的就是同一套切分。MoE 推理(Mixtral、DeepSeek-V3)则把"专家并行"从训练侧带进了推理侧,让推理引擎不得不引入新的调度。今天做推理部署的人,不能不懂训练侧的并行方案。 详见分布式推理

6. 端侧与边缘部署:把 LLM 塞进手机与笔记本(2020–2025)

当 LLM 走向手机与笔记本时,问题从"怎么更快"变成"怎么在 4-8GB 显存里跑得动"。这条线包括端侧专用架构(MobileBERT)、端侧推理引擎(MLC-LLM、llama.cpp)、端侧量化方案(MCT-LLM)。

论文作者/机构年份出处/arXiv一句话贡献
MobileBERTSun 等(华中科大/Google)2020arXiv:2004.02584蒸馏 + 逐层瓶颈结构,把 BERT 压到手机可跑,端侧 Transformer 起点
MCT-LLMLinux Foundation / ONNX Format2023Microsoft Build 2023Microsoft 的端侧 INT4 量化方案,让 Llama-7B 跑在 Surface Laptop
MLC-LLMTVM 团队(OctoML/Apache)2023mlc.ai用 TVM 编译 LLM 到 GPU/NPU/CPU,端侧 LLM 的编译器方案
llama.cppGerganov 等2023github.com/ggerganov/llama.cpp纯 C++ + GGUF 量化格式,让 Llama 在 CPU 与低端 GPU 上跑,端侧事实标准

端侧推理的两条路

编译器路(MLC-LLM):把 LLM 当作计算图,用 TVM 编译到不同硬件后端,工程优雅但适配慢。直接实现路(llama.cpp):用纯 C++ + SIMD 重写整个推理路径,灵活但适配靠手。今天 llama.cpp 因其简单与活跃社区成为端侧事实标准,但 NPU 时代编译器路是否反超,仍未定。详见端侧部署llama.cpp 案例

三、范式迁移时间轴:一张图看懂十年演进

把上面六个主题的关键论文按时间排成一张图,你能看到推理加速领域的范式迁移节奏

2017  Transformer          ── O(n²) 复杂度的源头

2019  Megatron-LM/PipeDream ── 大模型训练的并行基础设施

2020  Longformer/BigBird    ── 朴素稀疏注意力(绕开 O(n²))

2022  LLM.int8()           ── 发现离群值,量化研究破局
      │  GPTQ              ── 二阶信息量化
      │  SmoothQuant       ── 激活平滑
      │  Orca              ── iteration-level scheduling
      │  FlashAttention v1 ── IO 感知算子(范式转折点)

2023  vLLM/PagedAttention  ── KV cache 当虚拟内存管(范式转折点)
      │  AWQ               ── 激活感知量化
      │  FlashAttention-2 ── 并行与工作划分优化
      │  Speculative Decoding ── 投机解码正式化
      │  llama.cpp/MLC-LLM  ── 端侧 LLM 落地
      │  SARATHI            ── chunked prefill

2024  FlashAttention-3     ── H100 FP8 协同
      │  vAttention        ── 硬件原生稀疏替代软件 paged
      │  DistServe/Splitwise ── Prefill/Decode 物理分离
      │  SGLang             ── RadixAttention 前缀树复用
      │  Medusa/EAGLE-1/2    ── 投机解码升级
      │  QuaRot/SpinQuant   ── 旋转量化
      │  Mixtral/DeepSeek-V3 ── MoE 推理服务规模化
      │  Mooncake           ── KV cache 分离架构

2025  EAGLE-3              ── 投机解码 6.5× 加速
      │  FP4/NVFP4          ── Blackwell B200 时代
      │  P-EAGLE/SpecForge  ── 投机解码工程化
      │  ...

两个范式转折点最值得记住:2022 年 FlashAttention v1 把瓶颈从 FLOPs 纠回到 IO;2023 年 vLLM 把 LLM 服务从"模型加载"重定义为"显存管理"。读论文时优先精读这两年的论文,因为它们定义了今天的工程坐标系。

四、按任务查论文索引

不同角色、不同场景关心的论文不同。下表帮你按"任务"反查论文:

你在做的事必读论文进阶论文
写一个 attention kernelFlashAttention v1/v2FlashAttention-3、FlashInfer、vAttention
优化 LLM 服务吞吐vLLM、OrcaSARATHI、DistServe、Splitwise、SGLang、Mooncake
量化一个 70B 模型上线GPTQ、AWQSmoothQuant、LLM.int8()、QuaRot、SpinQuant
加速 decode 阶段Speculative Decoding、EAGLE-2Medusa、EAGLE-1/3、SpecInfer
部署 MoE 模型Mixtral、DeepSeek-V3MegaScale、Megatron-LM
跑端侧 LLMllama.cpp、MLC-LLMMobileBERT、MCT-LLM
在 H100/B200 上榨性能FlashAttention-3、FP8 推理NVFP4、QuaRot、vAttention
面试前恶补经典论文精读 全部配合前沿进展

五、按重要度分级阅读

如果时间不够,按下面的分级选论文:

三级阅读清单

必读 5 篇(任何做推理部署的人都该读)

  • FlashAttention v1(2022)
  • vLLM / PagedAttention(2023)
  • GPTQ 或 AWQ(任选一篇)
  • EAGLE-2(2024)
  • Orca 或 SARATHI(任选一篇)

强烈推荐 5 篇(系统精进或求职者)

  • FlashAttention-2(2023)
  • SmoothQuant(2022)
  • Medusa(2024)
  • DistServe(2024)
  • FlashAttention-3(2024)

研究者必读 5 篇(追前沿/写论文)

  • vAttention(2024)
  • SGLang(2024)
  • QuaRot 或 SpinQuant(2024)
  • DeepSeek-V3 Technical Report(2024)
  • EAGLE-3(2025)

六、延伸阅读

参考资料

以下均为真实公开资源,可直接访问原文: