外观
阅读路径
一句话定位:论文阅读不是"读得多",而是"路径对"——先选定你的目标,再决定读哪几篇、读到多深。本文给你三张经过编排的路线图,并附上读透任何一篇系统论文的通用方法。
一、为什么要按路径读:论文学海的导航
先看一组数字:仅 cs.LG(机器学习)+ cs.DC(分布式计算)+ cs.OS(操作系统)三个分区,2024 年 arXiv 上与 LLM 推理相关的论文每周新增约 30-50 篇——FlashAttention 变体、投机解码改进、新量化格式、新调度策略、新硬件适配。算上历史积累,2017 年(Transformer 出生)以来推理加速领域的论文早已超过一万篇。
在这个规模面前,有两个残酷的事实:
- 没有人读得完。 即便是一线引擎开发者,每周也最多精读两三篇、泛读十几篇,其余全靠标题、作者与二次筛选。
- 不筛选就是灾难。 论文质量分布极不均匀:有改变整个引擎设计的奠基之作(FlashAttention、PagedAttention),有工程调参报告("我们用 FA2 + AWQ 在 Llama-3 上跑出 X 吞吐"),也有为了发而发的注水工作。不加选择地读,三个月后你会得到一堆 kernel 技巧碎片,却说不清这个领域的骨架。
这就是"路径"存在的意义。路径 = 目标 + 顺序 + 深度标准:
没有路径: 每周刷 arXiv → 今天读个新量化 → 明天读个新调度
→ 三个月后: 什么都见过,什么都说不出所以然
有路径: 先定目标(工程落地/系统精进/科研)
→ 选定路线(入门/精进/研究)
→ 按编排好的顺序读(每篇都承接上一篇)
→ 三个月后: 形成一张有结构的地图顺着路径走,你读的每一篇论文都不是孤立文件,而是地图上的一个节点——上一篇提出的瓶颈,正好由下一篇回答。这种"知识节点互相咬合"的效应,会让你的理解产生复利。
路径与地图、精读、前沿的关系
本站论文栏目是配套的:论文地图 回答"这十年有哪些关键论文、谁先谁后"(宏观坐标系);经典论文精读 回答"一篇论文如何吃透"(微观显微镜);前沿进展 回答"近年在往哪走"(动态雷达)。本文的阅读路径是把这三者串成行动方案:按顺序读、按目标取舍、按节奏坚持。
二、三条路径总览
按学习者的核心目标,本站把读论文分三条路径。它们不是"等级",而是"方向":
| 路径 | 核心目标 | 时间预算 | 适合人群 | 终点产出 |
|---|---|---|---|---|
| ① 工程师入门线 | 建立"我能读懂一篇系统论文"的信心与全局感 | 约 6 小时 | 刚学完推理基础、想第一次碰推理论文的学习者 | 读透 6 篇,能讲清"为什么 HBM 是推理瓶颈、为什么 PagedAttention 革命" |
| ② 系统精进线 | 把推理加速的骨架完整吃透 | 约 3 周(每周 1 组) | 求职者、引擎工程师、计划深入系统的硕士/博士 | 四组主题的机制 + 消融逻辑 + 面试谈资 |
| ③ 研究者线 | 跟上 2024–2026 年的最新趋势并产出 | 持续(每周 4–6 小时) | 已在业界/学界的进阶者 | 稳定的信息管道:会找、会筛、会判断、能复现 |
工程师入门线 ── 6 小时 ──► 会读:建立信心与全局感(适合首次接触推理论文)
系统精进线 ── 3 周 ──► 吃透:完整骨架 + 机制 + 谈资(适合求职/精进)
研究者线 ── 持续 ──► 跟跑:会找、会筛、会复现、能产出(适合研究/做系统)三条路径不是三选一,而是三个阶段
工程师入门线是所有人的起点——包括日后要走向研究的人。先花 6 小时建立"读得懂"的信心,再决定要不要用 3 周系统精进,最后把研究者线变成日常习惯。跳过第一阶段直接啃最新 arXiv 论文,是绝大多数人"读推理论文劝退"的原因——FlashAttention 的 IO 复杂度推导会让没读过 FA1 的人瞬间放弃。
三、路径一:工程师入门(约 6 小时)
1. 路线设计:为什么是这六篇
入门线只有 6 篇,顺序刻意不按时间排,而是按"认知依赖"排:先用 FlashAttention 建立"算子为什么是瓶颈"的直觉,再补系统视角(PagedAttention)与压缩视角(GPTQ/AWQ/EAGLE)。
FlashAttention v1(2022)── 算子瓶颈:HBM 带宽墙 + 算子融合
│
FlashAttention v2(2023)── 算子进化:并行度与工作划分
│
PagedAttention / vLLM(2023)── 系统瓶颈:KV cache 碎片 + 吞吐
│
GPTQ(2022)── 量化:用 Hessian 信息保护重要权重
│
AWQ(2023)── 量化:显著权重 + 激活感知
│
EAGLE-2(2024)── 投机解码:动态 draft tree 让小模型猜下一步2. 每篇一句话
| 顺序 | 论文 | 一句话为什么读它 |
|---|---|---|
| 1 | FlashAttention v1(Dao et al., NeurIPS 2022) | 它展示了"算子 IO 感知"如何在不改变数学的前提下让 attention 快 2-4 倍,建立"推理瓶颈在 IO 不在 FLOPs"的核心直觉 |
| 2 | FlashAttention-2(Dao, 2023) | 它在 v1 基础上重做并行与工作划分,让 attention 在 A100 上达到 50-73% 理论峰值,是承接 v1 的最佳续篇 |
| 3 | PagedAttention / vLLM(Kwon et al., SOSP 2023) | 它把 KV cache 当虚拟内存管,把 LLM 服务吞吐提升 2-4 倍,是 LLM 推理服务的革命性起点 |
| 4 | GPTQ(Frantar et al., ICLR 2023) | 它用 Hessian 信息做后训练 4-bit 量化,展示"保护重要权重"的量化范式如何在 175B 模型上保持精度 |
| 5 | AWQ(Lin et al., MLSys 2024) | 它发现"显著权重"的稀疏性可以靠激活感知定位,量化比 GPTQ 更快且精度相当,是工程落地的常用方案 |
| 6 | EAGLE-2(Li et al., EMNLP 2024) | 它用动态 draft tree 把投机解码的接受率从 50% 推到 70%+,是承接 Medusa/EAGLE-1 的最佳续篇 |
3. 执行节奏
- 第 1 小时:读 FlashAttention v1。重点看摘要、第 3 节算法(图 1 的循环展开)、第 5 节实验。配合 Tri Dao 的博客 或中文图解建立"IO 感知"直觉。
- 第 2 小时:读 FlashAttention-2。重点看第 3 节"工作划分"——为什么 v1 在长序列上算不动?v2 怎么拆?配合 FlashInfer 的博客 对照。
- 第 3 小时:读 vLLM 论文。重点看第 3 节"PagedAttention"(图 3 的 block table)与第 4 节"continuous batching"。直觉要点:KV cache 是 LLM 服务的"虚拟内存",碎片化是吞吐杀手。
- 第 4 小时:读 GPTQ 论文。重点看第 2 节"OBQ 与量化顺序"与第 4 节实验。直觉要点:量化不是均匀压缩,而是按重要性差异化保护。
- 第 5 小时:读 AWQ 论文。重点看第 3 节"显著权重"与第 4 节"激活感知"。直觉要点:用激活的统计量定位重要权重列,比用 Hessian 更快。
- 第 6 小时:读 EAGLE-2 论文。重点看第 3 节"动态 draft tree"与第 4 节实验。直觉要点:投机解码的本质是用小模型换大模型的算力,draft tree 的形状决定接受率。
工程师入门线的验收标准
读完 6 篇后,你应该能不看笔记对另一个人讲清楚三件事:①推理瓶颈在 IO 不在 FLOPs(FA);②LLM 服务的吞吐取决于 KV cache 管理而不是模型大小(vLLM);③量化与投机解码是两条"压缩成本"的路线,前者压缩权重大小、后者压缩解码步数。能讲清这三句,第一次读推理论文就成功了。
这六篇的更深入版本
入门线是"尝味"——每篇只读摘要、引言、关键图、结论,全程约 6 小时。当你决定把它们列入系统精进线时,再按第六节的三遍法逐篇吃透;经典论文精读 里已有 FlashAttention v1/v2、vLLM、GPTQ、AWQ、EAGLE-2 的逐段拆解,可直接对照。
四、路径二:系统精进(约 3 周)
1. 路线设计:四个主题组
系统精进线把推理加速分为四组主题,每周一组、每组 2–3 篇,共约 3 周。分组的逻辑遵循领域演进的自然顺序:先有算子(FA),再有系统(vLLM),然后是压缩(量化/投机),最后是新范式(Prefill/Decode 分离 + 新算子格式)。
第 1 周 算子层 FA v1 → FA v2 → FlashInfer "算子融合与 IO 感知"
第 2 周 系统层 vLLM → Orca → SARATHI "批处理与调度"
第 3 周 压缩层 GPTQ → AWQ → SmoothQuant "量化与权重保护"
第 4 周 解码层与分离 Medusa → EAGLE-2 → DistServe "投机解码与流水线分离"2. 各组安排与检验标准
第 1 周:算子层(FA v1 → FA v2 → FlashInfer)
| 论文 | 年份 | 核心贡献 |
|---|---|---|
| FlashAttention v1 | 2022 | IO 感知的 attention 算子,把中间 softmax 态从 HBM 搬到 SRAM,A100 上快 2-4 倍 |
| FlashAttention v2 | 2023 | 重做并行与工作划分,长序列下 GPU 利用率从 35% 提到 50-73% |
| FlashInfer | 2024 | 块稀疏 + 可组合 KV 格式,把 paged KV 与变长 attention 统一在一个 kernel |
- 本周要抓住:HBM 与 SRAM 的带宽差(约 30 倍);softmax 必须分块计算的原因;recomputation 为什么比存中间态更省时间。
- 检验标准:能徒手画出 FlashAttention 的"外层循环 over K/V 块、内层循环 over Q 块"的双层结构,并解释为什么不能反过来。
- 算子机制详见算子融合与GPU 优化。
第 2 周:系统层(vLLM → Orca → SARATHI)
| 论文 | 年份 | 核心贡献 |
|---|---|---|
| Orca | 2022 | iteration-level scheduling,让不同长度请求在同一 batch 里推进,continuous batching 的前身 |
| vLLM / PagedAttention | 2023 | 把 KV cache 当虚拟内存管,block table + 块级分配,把 LLM 服务吞吐提升 2-4 倍 |
| SARATHI | 2023 | chunked prefill,把长 prefill 拆成 chunk 与 decode 同 batch,平衡算力与显存 |
- 本周要抓住:KV cache 的物理布局如何决定吞吐;为什么 request-level batching 在 LLM 上低效;prefill 与 decode 的算力/显存特征完全相反。
- 检验标准:能画 vLLM 的 block table 与 PagedAttention 的逻辑视图,并解释 SARATHI 解决了 vLLM 的什么遗留问题。
- 服务机制详见批处理与调度与模型服务。
第 3 周:压缩层(GPTQ → AWQ → SmoothQuant)
| 论文 | 年份 | 核心贡献 |
|---|---|---|
| GPTQ | 2022 | 二阶信息(Hessian)做后训练量化,4-bit 下 175B 模型精度损失 < 1% |
| AWQ | 2023 | 激活感知的显著权重保护,比 GPTQ 快 3 倍且精度相当,工程落地常用 |
| SmoothQuant | 2022 | 激活的离群值平滑到权重,让权重与激活都做 W8A8 量化成为可能 |
- 本周要抓住:为什么权重 4-bit 是甜点;为什么激活量化比权重难(离群值);smooth 的本质是"难度迁移"。
- 检验标准:能说清 GPTQ 与 AWQ 的核心差异("用 Hessian 信息"vs"用激活统计"),并指出 SmoothQuant 解决的是"权重还是激活"侧的瓶颈。
- 量化机制详见量化与权重混合精度。
第 4 周:解码层与流水线分离(Medusa → EAGLE-2 → DistServe)
| 论文 | 年份 | 核心贡献 |
|---|---|---|
| Medusa | 2024 | 多头并行预测未来 k 个 token,把投机解码从"小模型猜"升级为"主模型多 head 猜" |
| EAGLE-2 | 2024 | 动态 draft tree,接受率从 EAGLE-1 的 50% 推到 70%+ |
| DistServe | 2024 | prefill 与 decode 物理分离到不同 GPU,各自独立 scaling,避免互相干扰 |
- 本周要抓住:投机解码的本质是"小成本换大步数";draft tree 形状决定接受率;prefill 与 decode 的算力/显存比差异为何让分离有益。
- 检验标准:能画 Medusa 与 EAGLE-2 的 draft 结构差异,能解释 DistServe 为什么在长尾延迟上比 vLLM 更稳。
- 投机解码案例详见投机解码案例与分布式推理。
3. 系统精进线的执行纪律
- 每天固定 1–2 小时,不要突击;每组论文之间留一天"合上笔记本复述"。
- 每篇必须产出笔记:三句话摘要 + 一张机制图 + 一个"如果去掉这个设计会怎样"的反问。笔记法详见阅读纪律与 FAQ。
- 读完一组做一次复盘:这组主题的内部演进逻辑是什么?下一篇论文解决了上一篇的什么遗留问题?
系统精进线可能遇到的两个坎
第一,CUDA 复杂度劝退——读到 FlashAttention 的"online softmax + 分块循环"时容易卡住。对策:先要直觉(这篇论文在干什么),再要伪码(算法 1 的循环顺序),最后才抠 GPU 线程映射;多数读论文者停留在第二层就足够了。第二,复现诱惑——想立刻把 vLLM 跑起来对比 baseline。对策:系统精进阶段以理解为主,动手复现留到读完之后;引擎对比的路径参考引擎对比与benchmarking。
五、路径三:研究者线(持续)
系统精进线给你"存量"的骨架,研究者线负责"增量"——持续地把新论文接入你的知识地图,并产出自己的工作。研究者线不是"每天刷屏"(那只会制造焦虑),而是一套管道 + 复现 + 输出的循环:
信息源(arXiv / 顶会 / 工程博客 / 仓库 PR)
↓ 过滤
候选清单(每周 10–20 篇)
↓ 排序
值得读(每周 3–5 篇)→ 泛读 2 篇 / 精读 1 篇
↓ 复现
选 1 篇做 mini 复现(kernel 或调度片段)
↓ 输出
一句话卡片入库 + 周度笔记 + 月度复盘1. 主信息源:arXiv 与系统会议
arXiv 是所有推理论文的第一发布地。用法:
- 按分区订阅:
cs.LG(机器学习)、cs.DC(分布式)、cs.OS(操作系统)、cs.PF(性能评测)。每天上新后,先只看标题,标题让你"觉得该看一眼"的才点开摘要。 - 关注具体作者与实验室:Tri Dao(Princeton/Together)、Lianmin Zheng(Berkeley/DeepSeek)、Ying Sheng(MIT/Together)、Zhuoming Chen(Princeton)、DeepSeek AI 的系统组、NVIDIA 的 TensorRT-LLM 组、vLLM 项目组。把他们的页面加书签、定期扫一眼最新挂出的论文,比每天刷整个分区高效得多。
- 善用引用追踪:读到一篇好论文,看它的"引用它的后续工作"(Google Scholar 的 Cited by),等于自动顺着时间线往前走。
2. 仓库与 PR:工程信号的第二管道
推理部署领域有个独特现象:很多重要工作先出现在 GitHub PR 里,再写论文。值得长期盯的仓库:
| 仓库 | 价值 |
|---|---|
| vllm-project/vllm | 主线 PR 里藏着 PagedAttention 的演进、Chunked prefill 的落地、各类 spec decoding 集成 |
| NVIDIA/TensorRT-LLM | 工程与硬件协同的一线信号,FP8/FP4 kernel 通常先在这里落地 |
| flash-attention | FA 系列与相关算子的官方实现,issue 里有大量边界 case |
| flashinfer-ai/flashinfer | 可组合 KV 格式、块稀疏 attention 的官方实现 |
| sgl-project/sglang | RadixAttention 与 spec decoding 的工程前沿 |
3. 顶会清单:系统四大件怎么分工
| 会议 | 全称 | 侧重 | 举办规律 | 官网 |
|---|---|---|---|---|
| SOSP/OSDI | Symposium on Operating Systems / Operating Systems Design and Implementation | 顶级系统会议,vLLM、Orca、AlpaServe 等服务系统论文多发于此 | 每年 10–11 月交替 | sigops.org |
| MLSys | Conference on Machine Learning and Systems | 机器学习系统专门会议,FA、AWQ、SARATHI 多发于此 | 每年 3 月 | mlsys.org |
| ASPLOS | Architectural Support for Programming Languages and Operating Systems | 软硬件接口,Splitwise、vAttention 类工作 | 每年 3–4 月 | asplos-conference.org |
| ISCA/HPCA | International Symposium on Computer Architecture / High-Performance Computer Architecture | 硬件向,Splitwise、Mooncake 多发 HPCA | 每年 6 月 / 4 月 | iscaconf.org / hpca-conf.org |
实用建议:与其天天刷 arXiv 碰运气,不如每年盯三件事——SOSP/OSDI 的 accepted papers 列表(找服务系统趋势)、MLSys 的 best paper(找算子与系统热点)、ASPLOS 的 GPU 相关论文(找硬件协同),每次用 2 小时泛读一遍标题与摘要即可。
4. 研究者线的节奏
- 每周 4–6 小时:扫 arXiv + 仓库 PR → 挑 10 篇看摘要 → 挑 2–3 篇泛读 → 挑 1 篇按三遍法精读 + mini 复现。
- 每月一次复盘:本月看到的主线趋势是什么?哪些是工程优化、哪些是真算法创新?哪些会进主流引擎、哪些会消失?
- 研究者线的注意事项与 FAQ 见阅读纪律与 FAQ;本站前沿进展已帮你把 2024–2026 年的重要突破(FP8/FP4、Prefill/Decode 分离、EAGLE-3、新硬件)做了系统梳理,可作为追踪的起始点。
追踪前沿的正确心态
研究者线的价值不是"第一时间知道",而是"知道得比其他人更准确"。晚两周读到一篇论文完全没关系,判断得比转述者更靠谱(这个 speedup 怎么来的、代价是什么、局限在哪)才是进阶者的能力。慢而准,胜过快而慌。
六、读一篇论文的方法:三遍法
无论走哪条路径,落到"读一篇"时都推荐计算机科学家 S. Keshav 提出的三遍法(Three-Pass Method)——三遍的深度逐级加深,每一遍都允许"提前终止":
| 遍数 | 时间 | 读什么 | 产出 | 何时可以停在这一遍 |
|---|---|---|---|---|
| 第一遍:鸟瞰 | 5–10 分钟 | 标题、摘要、引言、各节标题、所有图表、结论 | 能回答"这篇论文做什么、贡献是什么" | 它不在你的兴趣/方向上,可以扔掉 |
| 第二遍:细读 | 约 1–2 小时 | 方法、实验、图表的每一处细节,勾画关键定义与伪码 | 能向别人复述论文的完整论证 | 你只需要"用"它,不需要"改"它 |
| 第三遍:重建 | 数小时–数天 | 逐行读、重现推导、复现 kernel、质疑每个假设 | 能指出论文的漏洞与改进空间 | 你要做研究、复现或写综述时 |
第一遍 5–10 分钟 → 读摘要+引言+图表+结论 → 决定: 读不读
第二遍 1–2 小时 → 读方法+实验,勾画伪码 → 决定: 用到多深
第三遍 数小时+ → 复现 kernel,质疑假设 → 决定: 要不要跟进针对推理系统论文,三遍法有三个额外要点:
- 永远先读 abstract → profile 图 → 结论。系统论文的"profile 图"信息密度极高:一张 roofline 图顶三段文字,一张 batch 吞吐曲线直接暴露方法的真实水平。先看图,再带着问题读文字。
- 第二遍必做"消融追踪"。凡是论文里出现"Table X: Ablation"的地方,都停一停,问:作者通过删除某个组件证明了什么?这是辨别"真创新"与"工程叠加"的核心方法。FlashAttention 没有消融 IO 感知就让数字翻倍,可信度就远低于"我们去掉 IO 感知后速度降到 1.1×"。
- 第三遍把"speedup"翻译成"边界"。把每个 2×、3× 都加一个限定条件:在什么模型、什么 batch、什么序列长度、什么硬件下成立?翻译完,你就真正读懂了这篇论文(更多方法论见阅读纪律与 FAQ)。
七、权衡与取舍:精读 vs 泛读
读论文最大的资源约束是时间,于是所有策略都围绕一个权衡:有限的精力如何在"精读"与"泛读"之间分配。
| 维度 | 泛读(Skim) | 精读(Deep Read) |
|---|---|---|
| 单位成本 | 10–30 分钟/篇 | 4–10 小时/篇 |
| 收获 | 广度:知道"有什么、趋势在哪" | 深度:知道"为什么、边界在哪" |
| 适用 | 追踪前沿、筛候选、建立全局感 | 与你工作/研究强相关、经典奠基、要复现的论文 |
| 风险 | 只见森林不见树,人云亦云 | 只见树不见森林,视野变窄 |
实践中建议 80/20 法则:80% 的论文用第一遍(鸟瞰)处理掉,15% 用第二遍(细读),只有 5% 值得第三遍(重建)。真正值得精读的论文只有三类:
- 范式级经典:改变了整个领域的思路(如 FlashAttention、vLLM)——精读,因为它是你后续理解的基石。
- 与你工作/研究强相关:直接对接你当前部署场景的论文——精读,读它的消融与局限,判断能否搬到自己场景。
- 被反复引用、但众说纷纭的论文:既然绕不开、又存在争议——精读,用自己的判断定夺。
其余(热点新闻、边角改进、纯工程报告)一律泛读。精读是投资,泛读是开销——用开销维持广度,用投资换取深度,是这个领域最可持续的阅读策略。
与本站其他栏目如何搭配
读路径时,把本站四篇配套文章当作"加速器":论文地图 帮你判断一篇论文在地图上的位置(源头/里程碑/综述),决定该泛读还是精读;经典论文精读 替你把最重要的几篇做了第三遍级的拆解;前沿进展 帮你把最新论文归位到趋势线上;阅读纪律与 FAQ 负责处理"读不懂、记不住、坚持不下去"。
八、一句话总结:路线怎么选
- 刚接触推理部署、想第一次读论文 → 走工程师入门线,6 小时读完 6 篇建立信心。
- 要面试/要落地/要做引擎 → 走系统精进线,3 周读完 12 篇建立骨架。
- 要做研究/要写论文/要做开源 → 在系统精进线基础上转研究者线,把信息管道 + mini 复现变成日常。
- 不确定走哪条 → 先走工程师入门线,6 小时后你就知道自己该往哪走。
九、延伸阅读
到这里,你已经有了三条路径和三遍法。接下来按你的目标选下一站:
- 从这里开始 —— 论文栏目总入口,读论文的三个价值与一条最重要的建议
- 论文地图 —— 系统精进线的宏观坐标系:2014–2025 关键论文按主题与时间轴排布
- 经典论文精读 —— 工程师入门线与系统精进线涉及的经典论文的逐段拆解
- 前沿进展 —— 研究者线的起始点:2024–2026 重要突破的系统梳理
- 阅读纪律与 FAQ —— 三遍法的补充:笔记法、读不懂怎么办、如何判断论文好坏
- 什么是推理 —— 从论文回到体系:推理部署的基础概念
- 学习路径 —— 全站知识学习路线
- 资源清单 —— 论文代码复现、benchmark 与工具的真实资源集合
参考资料
以下资料均为真实公开资源,供深入自学:
- arXiv 预印本库 —— 推理系统论文的第一发布地,重点
cs.LG/cs.DC/cs.OS - Papers with Code —— 论文 + 代码 + 推理 benchmark 聚合,复现与对比的主战场
- Google Scholar —— 论文引用追踪(Cited by),顺着时间线找后续工作
- SOSP 官网 —— 顶级系统会议,vLLM、Orca 等服务论文的发表地
- MLSys 官网 —— 机器学习系统专门会议,FA、AWQ、SARATHI 多发于此
- ASPLOS 官网 —— 软硬件接口会议,Splitwise、vAttention 类工作
- HPCA 官网 —— 高性能计算机体系结构会议,Mooncake、Splitwise 发表地
- Keshav. How to Read a Paper(2007) —— "三遍法"的原始论文,阅读方法论必读
- Dao et al. FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness(NeurIPS 2022)
- Dao. FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning(2023)
- Kwon et al. Efficient Memory Management for LLMs Serving with PagedAttention(SOSP 2023)
- Frantar et al. GPTQ: Accurate Post-Training Quantization for GPT(ICLR 2023)
- Lin et al. AWQ: Activation-aware Weight Quantization(MLSys 2024)
- Cai et al. Medusa: Simple Framework for Accelerating LLM Generation with Multiple Decoding Heads(ICML 2024)
- Li et al. EAGLE-2: Faster Speculative Decoding with Dynamic Draft Trees(EMNLP 2024)