外观
前沿进展
"前沿"是个陷阱词。它既意味着机会,也意味着最密集的信息噪声——每周 arXiv 上涌现数十篇推理论文、每月有新引擎发布、每条研究主线都有人在宣告"3× 加速"。如果不加方法地追,你会疲于奔命;但如果完全无视,你会错过这个领域十年一遇的结构性变化(如 H100 时代的 FP8、B200 时代的 FP4、Prefill/Decode 分离范式、spec decoding 的训练时内化)。
本文的目标是给出一张有方法的地图:先讲清楚如何低成本、低噪声地追踪前沿(渠道与优先级),再拆解当下最值得关注的六条研究主线(现状、代表工作、关键问题),然后诚实回答"哪些问题还没解决",最后给出选择深耕方向的具体建议。它既是前沿导航的展开,也与核心论文精读、常见问题互为补充。
一、如何追踪前沿
前沿信息不是太少,而是太多。有效的追踪者做的不是"全部读完",而是建立一条有优先级的信号管道。
1. arXiv:一手战场
几乎所有重要工作都以预印本形式先发在 arXiv 上,随后才被会议接收。对推理加速研究者来说,几个子分类是主战场:
| 分类 | 主题 | 说明 |
|---|---|---|
| cs.LG | 机器学习 | 算子、量化、spec decoding 论文多发于此 |
| cs.DC | 分布计算 | 服务系统、并行、集群调度论文多发于此 |
| cs.OS | 操作系统 | SOSP/OSDI 投稿常先在此 |
| cs.PF | 性能评测 | benchmark、roofline、profile 工作 |
| cs.AR | 计算机体系结构 | 硬件协同、ISA 论文 |
每日更新量在数十篇量级,直接刷列表效率极低。实用的做法有三种:
- 跟作者与机构:在 arXiv 订阅你关注的学者(比如你精读过的论文的作者)的新提交,而不是刷全量列表。一个小组持续产出,通常比随机看一百篇有价值得多。重点作者:Tri Dao(Princeton/Together)、Lianmin Zheng(Berkeley/DeepSeek)、Ying Sheng(MIT/Together)、Zhuoming Chen(Princeton)、DeepSeek-AI 的系统组、NVIDIA TensorRT-LLM 组、vLLM 项目核心团队。
- 用工具做筛选:Hugging Face Papers 每天按热度整理论文并附带代码、讨论;Papers with Code 按任务查 SOTA;AlphaXiv 等工具可以直接在论文页面上提问。
- 只精读高信号论文:一篇论文值不值得精读,先看三点——题目是否回应你正在解决的部署问题、作者/机构是否有延续性、是否同时发布了代码与权重。
时间线经验
预印本永远快于会议:从投稿到发表往往隔 6–10 个月。2023 年 6 月挂出的 vLLM 论文,2023 年 10 月才在 SOSP 出现,但它的影响力从预印本发布那天就开始了。读预印本、按会议查证版本,是研究者的标准节奏。
2. 评测与榜单:把"感觉"换成"数字"
单纯追论文会被叙事带偏——宣传稿总是报喜。对抗噪声的第二条管道是评测聚合站:
| 渠道 | 用途 | 特点 |
|---|---|---|
| Papers with Code | 按任务查 SOTA 榜单 | 每个基准的最高分、代码、论文一一对应 |
| Artificial Analysis | 推理成本 / 速度 / 质量对照 | 把"强不强"与"贵不贵"放在一起看,贴近工程决策 |
| vLLM benchmarks | 引擎级吞吐 / 延迟基准 | 跟 vLLM main 同步演进,最贴近工业部署 |
| SGLang benchmarks | 引擎对比 + spec decoding 基准 | spec decoding 与 RadixAttention 的对比数据 |
评测站的局限也要知道:榜单总是滞后于发布、且容易被刷分污染。它的正确用法不是"谁第一就信谁",而是给你一个横向坐标,帮助判断一篇论文声称的提升是真实还是噪声——这部分方法与坑见前沿导航中的阅读方法,以及评测资源档案。
3. 开源仓库与 PR:工程信号的第二管道
推理部署领域有个独特现象:很多重要工作先出现在 GitHub PR 里,再写论文。值得长期盯的仓库:
| 仓库 | 价值 |
|---|---|
| vllm-project/vllm | 主线 PR 里藏着 PagedAttention 演进、Chunked prefill、各类 spec decoding 集成 |
| NVIDIA/TensorRT-LLM | 工程与硬件协同的一线信号,FP8/FP4 kernel 通常先在这里落地 |
| flash-attention | FA 系列与相关算子的官方实现,issue 里有大量边界 case |
| flashinfer-ai/flashinfer | 可组合 KV 格式、块稀疏 attention 的官方实现 |
| sgl-project/sglang | RadixAttention 与 spec decoding 的工程前沿 |
| llama.cpp | 端侧推理事实标准,GGUF 量化格式的演进 |
4. 顶会:沉淀后的系统知识
顶会论文比预印本晚,但经过了同行评审,且会议有组织性的教程(Tutorial)与综述(Survey),是补系统知识的最佳入口:
| 会议 | 领域 | 每年大致时间 |
|---|---|---|
| SOSP / OSDI | 操作系统与系统 | 10–11 月交替 |
| MLSys | 机器学习系统 | 3 月 |
| ASPLOS | 软硬件接口 | 3–4 月 |
| ISCA / HPCA | 体系结构 | 6 月 / 4 月 |
| NeurIPS / ICML / ICLR | 机器学习综合 | 12 月 / 7 月 / 4–5 月 |
追踪顶会不必参会:录用列表公布时扫一遍标题,会议结束后看 tutorial 材料即可。对于一个新人,一两个高质量 Tutorial 比五十篇论文管用,因为它们把该领域的坐标系讲清楚了。
把四条管道按"速度 × 深度"排列:
速度高 ┌────────────────────────────────────┐
│ GitHub PR、X/博客、实验室动态 ── 信号,噪声最多 │
│ arXiv 每日更新 ── 一手论文 │
│ 评测榜 / HF 论文日报 ── 聚合 + 数字 │
│ 顶会论文与教程 ── 沉淀后知识 │
深度高 └────────────────────────────────────┘
读得越深,判断越稳;追得越急,越容易被带偏。二、六条研究主线
下面六条主线是当下最活跃、也最影响产业走势的方向。每条都给出现状、代表工作、关键问题,并按"论文名称(arXiv 号)→ 一句话要点"的方式引用,方便你在核心论文精读中对照精读。
主线一:算子层前沿——从 IO 感知到硬件协同
现状。 FlashAttention v1/v2 把 attention 瓶颈从 FLOPs 纠回到 IO,2024 年起算子前沿进入第三代:与硬件代际深度协同。FlashAttention-3 用 H100 的 FP8 + 异步(warp-specialized),把峰值推到 1.2 PFLOPs;FlashInfer 用块稀疏 + 可组合 KV 格式,把 paged KV 与变长 attention 统一在一个 kernel;vAttention 反过来问:能不能用硬件原生 sparse attention 替代软件 PagedAttention,避免 SM 阻塞?
代表工作。
| 工作 | 要点 |
|---|---|
| FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision(arXiv:2407.08608) | H100 上 FP8 + 异步(warp-specialized),峰值 1.2 PFLOPs,比 FA2 快 1.5-2×;展示了"算子协同硬件代际"的范式 |
| FlashInfer: An Efficient and Customizable Attention Engine for LLMs(arXiv:2401.12448) | 块稀疏 + 可组合 KV 格式(PagedKV、RaggedKV、BlockSparse),统一 attention 接口;2025 MLSys 论文 |
| vAttention: Efficient Attention with Suffix Parallelism(arXiv:2405.04447) | 用硬件原生 sparse attention 替代软件 PagedAttention,避免 SM 阻塞;提出"软件 paged 是临时方案,硬件稀疏才是终局"的争论 |
| Flash-Decoding(Dao 等,2023 博客) | 长序列、batch=1 解码场景下,FA 的并行度改进,把 KV 切块并行 |
| Lightning Attention-2(Qwen 团队,2024) | 线性 attention 的工程实现,在长上下文下推理成本接近线性 |
关键问题。
- 硬件代际决定算法选择:FA2 在 A100 上最优,FA3 在 H100 上最优,FP8/FP4 kernel 在 Blackwell 上才甜。硬件换一代,算子要重写一次,这是算子层的核心痛点。
- 软件 vs 硬件稀疏:vAttention 提出的"用硬件稀疏替代软件 paged"是 2024 年最有趣的争论。短期内软件方案仍主流,但硬件稀疏是否会终结 PagedAttention,是值得追的开放问题。
- 统一接口缺失:FlashInfer 的尝试说明,目前 attention 算子接口太多(PagedKV、RaggedKV、BlockSparse、FA),缺少统一抽象。这是引擎开发者的日常痛点。算子机制详见算子融合与GPU 优化。
与你的关系
如果你做算子:算子层是"必须持续跟进"的主线,硬件代际迁移即算法重写。如果你做引擎:算子层只看接口与 benchmark,不需要追每篇论文。如果你做研究:算子层是最难做但影响最大的方向——能写出 FA4 级别的工作就是 NeurIPS/MLSys 的最佳论文候选。
主线二:服务系统前沿——从单引擎到 Prefill/Decode 分离
现状。 vLLM 的 PagedAttention 解决了 KV cache 碎片化,但 LLM 服务还有两个遗留问题:① prefill 与 decode 的算力/显存比完全相反,同 GPU 同 batch 时互相干扰;② 多轮对话与 few-shot 场景下,KV cache 的前缀重复计算浪费。2024 年的两条主线——Prefill/Decode 物理分离与前缀树复用——分别解决这两个问题。
代表工作。
| 工作 | 要点 |
|---|---|
| DistServe: Disaggregating Prefill and Decoding for Goodput-optimized LLM Serving(arXiv:2401.09670) | prefill 与 decode 物理分离到不同 GPU,各自独立 scaling,避免互相干扰;P99 延迟减半 |
| Splitwise: Efficient generative LLM inference using phase splitting(HPCA 2024) | 与 DistServe 思路相似,但聚焦集群级方案,做分阶段机器调度 |
| SARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills(arXiv:2308.16369) | chunked prefill:把长 prefill 拆 chunk 与 decode 同 batch,平衡算力与显存;vLLM 0.5+ 已集成 |
| SGLang: Efficient Execution of Structured Language Model Programs(arXiv:2312.07104) | RadixAttention:前缀树复用 KV cache,多轮对话与 few-shot 场景的吞吐利器 |
| Mooncake: A KV-Centric Decoupled Architecture for LLM Serving(arXiv:2407.00079) | 月之暗面的全球级架构:把 KV cache 当一等公民存储与传输,KV cache 分离 |
| AlpaServe: Scaling for Large-Scale Deep Learning Serving(OSDI 2023) | 多模型部署的统计复用率分析,指导多模型时分复用 |
关键问题。
- 分离 vs 混合的权衡:DistServe 的物理分离代价是机器利用率不均(prefill 机器忙、decode 机器闲);SARATHI 的混合方案代价是 prefill 与 decode 互相干扰。短期看混合(SARATHI)落地更多,长期看分离(DistServe)更可能成为大规模服务的范式。
- KV cache 的存储与传输:Mooncake 把 KV cache 当一等公民,但跨节点传输 KV cache 的带宽成本与延迟开销仍是开放问题。KV cache 的"分布式存储"会不会成为下一个 vLLM 级的范式? 值得持续关注。
- 前缀复用 vs chunked prefill 的协同:SGLang 的 RadixAttention 与 SARATHI 的 chunked prefill 在多轮对话场景下有协同,也有冲突。主流引擎正在融合两者,但最佳实践仍在演化。服务机制详见批处理与调度与模型服务。
主线三:投机解码前沿——从接受率 50% 到 6.5× 加速
现状。 2023 年 Leviathan 把 spec decoding 正式化时,接受率约 50%,加速 2-3×。2024 年 Medusa/EAGLE-1/2 把接受率推到 70%+,加速 3-5×。2025 年 EAGLE-3 把加速比推到 6.5×。同时,DeepSeek-V3 把 spec decoding 内化为训练目标(MTP),开启了"训练时学会 draft"的新范式。spec decoding 是 2024–2026 年 LLM 推理最活跃的研究方向之一。
代表工作。
| 工作 | 要点 |
|---|---|
| EAGLE-3: Scaling up Inference Speed(arXiv:2503.01840) | NeurIPS 2025,用深层特征 + 训练目标改进,加速比 3-6.5×;EAGLE 系列的最新标杆 |
| P-EAGLE(AWS, 2025) | 解耦 drafting:draft 模型可以独立部署,不与主模型耦合,简化多模型集成 |
| SpecForge(SGLang 组, 2025 博客) | 多 draft 模型训练管线:把 spec decoding 当作"工程产物"训练,可批量产出 draft 模型 |
| DeepSeek-V3 MTP(arXiv:2412.19437) | 主模型原生支持 multi-token prediction,训练时学 spec decoding 能力;spec decoding 的训练时内化 |
| Medusa(arXiv:2401.10774) | 主模型多头并行预测,简化 spec decoding;EAGLE 的前奏 |
| EAGLE-2(arXiv:2406.16858) | 动态 draft tree,接受率 70%+ |
| SpecBench(SGLang, 2024) | spec decoding 的统一评测基准,对比 EAGLE/Medusa/SpecInfer 等方案 |
关键问题。
- 训练时 vs 推理时 draft:DeepSeek-V3 MTP 的"训练时学会 draft" vs EAGLE 系列的"推理时附加 draft",哪个能成为主流?短期看 EAGLE 工程化更成熟,长期看 MTP 与模型架构深度耦合可能胜出。2025–2026 年的关键开放问题。
- draft 模型的解耦与可移植性:P-EAGLE 与 SpecForge 把 draft 模型做成"独立训练产物",意味着未来可能有"draft 模型即服务"——新模型发布时配套发布 draft 模型,可能成为标配。
- 接受率的上限:EAGLE-3 接受率 80%+,加速 6.5×。接受率能到 100% 吗? 显然不能,但上限在哪、能否做自适应 budget(易猜的 token 多猜、难猜的少猜),是活跃研究方向。案例详见投机解码案例。
主线四:量化前沿——从 4-bit 到 FP4 与旋转量化
现状。 量化的甜点从 INT4(GPTQ、AWQ)→ INT8 激活(SmoothQuant)→ 2024 年的 FP8(H100)→ 2025 年的 FP4(Blackwell B200)。同时,旋转量化(QuaRot、SpinQuant)用等价变换"抹平"分布,让 W4A4 量化精度大增。量化的两条主线——硬件格式与等价变换——正在汇合。
代表工作。
| 工作 | 要点 |
|---|---|
| FP8 Formats for Deep Learning(NVIDIA, 白皮书) | H100 引入 FP8 Tensor Core,硬件级量化甜点格式;E4M3 与 E5M2 两种格式 |
| FP4 Inference on Blackwell(NVIDIA, 2024) | B200 引入 FP4 Tensor Core + NVFP4 量化格式,权重量化甜点 |
| QuaRot: Outlier-free 4-bit Inference for Rotated LLMs(arXiv:2404.00456) | 随机正交变换把离群值"抹平",让 W4A4 量化精度大增 |
| SpinQuant: LLM Quantization with Learned Rotations(arXiv:2405.16406) | 学习型旋转矩阵,比 QuaRot 的随机旋转更优,W4A4 接近 W4A16 |
| BigVGQ: Bit-Grouped Quantization(2024) | 把权重按子组量化,进一步降低量化误差 |
| GPTQ/AWQ/SmoothQuant(精读见此) | 二阶/激活/平滑的经典 4-bit 与 8-bit 量化方案 |
关键问题。
- 硬件格式 vs 算法量化的赛跑:FP8 让硬件原生支持 8-bit 浮点,但算法量化(GPTQ/AWQ)能到 4-bit。当硬件原生支持 FP4/NVFP4(B200)后,算法量化是否还有优势? 短期看 GPTQ/AWQ 在 A100/H100 仍主流,长期看 NVFP4 可能终结权重量化的算法研究。
- W4A4 vs W4A16 的精度差:W4A16(权重 4-bit、激活 16-bit)已经接近无损,但 W4A4(全 4-bit)仍损失明显。旋转量化(QuaRot、SpinQuant)让 W4A4 接近 W4A16,但还不够。W4A4 何时成为默认? 取决于硬件与算法的双重突破。
- 旋转量化的理论极限:QuaRot 用随机旋转,SpinQuant 用学习旋转,最优旋转是什么? 仍是开放问题。理论上"Hadamard 变换"可能更优,工程上还在验证。量化机制详见量化与权重混合精度。
主线五:架构创新——SSM、MoE 与线性 attention
现状。 Transformer 不是唯一选择。Mamba/SSM 在长序列上推理成本接近线性;MoE(DeepSeek-V3、Mixtral)让开源模型推到千亿级;Linear Attention(Lightning Asst、GLA)试图打破 O(n²) 复杂度。架构层的创新正在重塑推理引擎的设计——MoE 要支持专家并行与路由,Mamba 要支持状态推理,Linear Attention 要支持 chunk-wise 计算。
代表工作。
| 工作 | 要点 |
|---|---|
| Mamba: Linear-Time Sequence Modeling with Selective State Spaces(arXiv:2312.00752) | 选择性状态空间模型,长序列推理成本接近线性,挑战 Transformer 的 O(n²) |
| Mixtral of Experts(arXiv:2401.04088) | 8 专家 MoE 开源权重,把 MoE 从闭源带入开源;推理侧专家并行成为标配 |
| DeepSeek-V3 Technical Report(arXiv:2412.19437) | 256 专家 + 8 激活 MoE + MTP,开源 MoE 推理服务标杆 |
| Lightning Attention-2(Qwen 团队,arXiv:2401.11461) | 线性 attention 的工程实现,长上下文下推理成本接近线性 |
| Gated Linear Attention(GLA, Yang 等, 2024) | 带 gating 的线性 attention,比 Mamba 更易并行训练 |
| Jamba(AI21 Labs, 2024) | Mamba + Transformer 混合架构,工业上首次把 SSM 用在大规模 LLM |
关键问题。
- MoE 推理的工程化挑战:256 专家的显存驻留、专家路由负载均衡、跨节点通信,比 Llama-3-70B 复杂得多。新模型架构 vs 推理引擎能力,总是你追我赶——SGLang、vLLM 花了半年才把 DeepSeek-V3 高效推理跑通。
- SSM/Mamba 的推理特性:Mamba 的"状态推理"与传统 attention 的 KV cache 完全不同,引擎要重写。SSM 推理的 PagedAttention 等价物还没出现,是开放机会。
- 混合架构的复杂性:Jamba 这样的 Mamba+Transformer 混合,让引擎要同时支持两种推理范式,工程成本高。短期内 MoE 仍是主流,Mamba 与 Linear Attention 是补充而非替代。架构机制详见GPU 优化与分布式推理。
主线六:硬件代际——B200、MI300X、昇腾、Groq、Cerebras
现状。 硬件代际迁移即算法重写。H100 引入 FP8,B200 引入 FP4 与 NVLink 5.0;AMD MI300X 用 HBM3+ 大显存挑战 NVIDIA;华为昇腾 910B 在国内承担大量推理负载;Groq LPU 用确定性架构追求极致 throughput;Cerebras WSE 用整片晶圆做计算。
代表工作 / 硬件发布。
| 硬件 | 关键特性 | 对推理的影响 |
|---|---|---|
| NVIDIA B200 / GB200 NVL72(Blackwell, 2024) | FP4 Tensor Core + NVFP4 量化格式 + 72 GPU NVLink 集群 | FP4 量化甜点;大模型可单集群推理 |
| NVIDIA H100 / H200(Hopper, 2022-2024) | FP8 Tensor Core + Transformer Engine + 第四代 NVLink | FP8 推理甜点;FA3 的硬件基础 |
| AMD MI300X(2023) | 192GB HBM3 + 5.3TB/s 带宽 | 大显存 + 高带宽,挑战 NVIDIA;vLLM/SGLang 已支持 |
| 华为昇腾 910B(2023) | 国产 7nm + 达芬奇架构 + 64GB HBM | 国内大模型推理主力硬件之一 |
| Groq LPU(2024 商用) | 确定性架构 + SRAM 主导 + 极高 throughput | 单 token 延迟极低,但显存小、不适合大模型 KV cache |
| Cerebras WSE-3(2024) | 整片晶圆 + 4 trillion 晶体管 | 极致稀疏算力,但生态弱、部署复杂 |
| Intel Gaudi 2/3(2023-2024) | 96GB HBM2 + 24GB HBM3 | 性价比路线,部分企业部署 |
关键问题。
- 硬件代际即算法重写:FA1 在 A100 上最优,FA3 在 H100 上最优,FP4 kernel 在 B200 上才甜。硬件换一代,算子要重写一次,这是算子层的核心痛点,也是这个领域持续的机会。
- 国产硬件的生态追赶:昇腾 910B 在硬件性能上接近 A100,但软件生态(PyTorch 集成、vLLM 移植、算子库)落后 2-3 年。国产推理引擎与算子是未来 3-5 年的关键机会。
- 极端架构的命运:Groq LPU 的"确定性 + 高 throughput"在特定场景惊艳,但显存小限制了通用 LLM 推理;Cerebras WSE 算力惊人但部署门槛高。极端架构要么找到 niche 市场活下去,要么被主流 GPU 生态吞掉。硬件背景详见硬件入门。
三、哪些问题还没解决
上面每条主线都有"关键问题",但有几个问题是跨主线的、被反复提到却远未解决的。诚实面对它们,比追逐热点更重要。
1. 长尾延迟与公平性的矛盾
LLM 服务的吞吐与延迟容易测,但 P99/P999 长尾延迟极难控——它取决于负载分布、调度策略、KV cache 命中率、硬件抖动。业界没有"长尾延迟的 SOTA",只有"在 X 负载下用 Y 引擎达到 Z 长尾"的案例。DistServe/SARATHI 都在打这个,但没有一个是"通用解"。
2. 多模型部署的"复用率"理论
AlpaServe 给出了"多模型时分复用"的统计框架,但多模型部署的最佳实践仍未形成共识——每个团队都在自己摸索"几个模型用几张卡、用什么样的 batching 策略"。这是开放机会,也是工业界的日常痛点。
3. spec decoding 的训练时内化
DeepSeek-V3 MTP 开启了"训练时学会 draft"的新范式,但MTP 的训练成本、对主模型精度的影响、draft 能力的可移植性都没有定论。2025–2026 年的关键开放问题。
4. 量化与稀疏的统一
量化(让权重更小)与稀疏(让计算更少)是两条独立的优化路线,但它们能否协同?比如稀疏 attention 的稀疏模式能否与权重量化协同?目前几乎没人研究这个交叉,是开放机会。
5. 国产硬件的算子生态
昇腾 910B 等国产硬件在算力上不弱,但算子生态是"空地"。FA3、PagedAttention、spec decoding 这些主流工作的国产硬件实现,是未来 3-5 年的刚需机会。
如何与"未解决"相处
不要把"还没解决"等同于"没有机会"。恰恰相反:真正高价值的产出通常出现在公认难题的边角。长尾延迟催生了 DistServe/SARATHI 的繁荣,多模型复用率催生了 AlpaServe,spec decoding 的训练时内化催生了 DeepSeek-V3 MTP。理解了问题清单,你就理解了机会清单。
四、给读者的建议:如何选择深耕方向
面对六条主线,最常见的困惑是"该选哪个"。给三条原则:
原则一:按"你的不可替代性"选,不按"热度"选。 六条主线都很热,但你的背景决定了哪条路的上手成本最低、护城河最深:
| 你的背景 | 切入方向 | 理由 |
|---|---|---|
| 算法/CUDA 基础好 | 主线一(算子层)或主线四(量化) | 算子层与量化都是算子密集区,CUDA 能力即优势 |
| 系统/分布式基础好 | 主线二(服务系统)或主线五(架构创新) | 服务系统与 MoE 推理都是系统密集区 |
| 工程/产品基础好 | 主线三(spec decoding)或主线六(硬件) | spec decoding 工程化最热,硬件适配国产空白多 |
| 算法/建模基础好 | 主线五(架构创新) | Mamba/MoE 的设计空间大,靠理解力而非算力取胜 |
| 国产硬件背景 | 主线六(硬件)的国产部分 | 国产算子生态是未来 3-5 年的关键机会 |
| 尚不确定 | 先读前沿地图与核心论文精读 | 用一两个月建立全貌再决定,别急着押注 |
原则二:深耕一个方向"到能独立做项目",再横向扩展。 前沿最大的陷阱是"每篇论文都读一遍、哪个方向都浅尝"。更有效的模式是:
- 选一个方向,把它的经典论文(见核心论文精读)按时间顺序精读十到二十篇,画出一张技术演进图;
- 用开源权重与引擎复现至少一个代表工作(哪怕是缩小版),把论文里的"做法"变成你手上的"能力";
- 在 vLLM、SGLang、TensorRT-LLM 上参与一个活跃 PR(提 issue、修 bug、复现实验),让真实反馈校准你的理解;
- 用资源档案里的工具与榜单持续跟踪这个方向的进展,写周期性的个人综述。
原则三:警惕叙事,拥抱数字。 前沿写作充满了"3× 加速""无损""革命性"的叙事,但它们很少经得起下个月的检验。你的防御武器是评测与复现:任何"大突破",都先在评测站找数据,再跑一个小实验验证。判断"什么会留下、什么会退潮",比预测"下一个热点"更可靠。
一年的深耕时间线(参考)
如果决定深耕一个方向,一个可执行的一年框架是:第 1–3 个月把该方向经典论文精读一遍并复现至少一个缩小版实验,建立自己的代码基座;第 4–6 个月独立完成一个小项目(复现 + 一项自己的改进),并写成一份技术报告;第 7–9 个月参与一个开源引擎或公开评测,让社区反馈校准你的判断;第 10–12 个月把成果整理成可展示的形式(博客、报告、参赛成绩)。一年后你收获的不是"读过很多论文",而是一条能独立走通"读论文—做实验—形成判断"的回路——这比任何知识量都值钱。
给新人的时间预算
如果每周能投入 10 小时:5 小时精读与复现、3 小时跟踪(arXiv + 评测榜 + 仓库 PR)、2 小时写笔记与总结。三个月后你会明显感觉到:判断力比记忆量大得多。完整的学习路径规划见学习路径与前沿导航。
五、延伸阅读
- 前沿导航 —— 本站论文板块入口,含检索与阅读方法
- 论文地图 —— 用一张图把握六大主线的位置关系
- 核心论文精读 —— 本文引用的关键论文的精读版本
- 常见问题 —— 关于论文阅读与研究方向的高频问答
- 什么是推理 —— 推理部署的概念地基
- 案例拆解:vLLM 案例、TensorRT-LLM 案例、投机解码案例、分布式推理、端侧部署
- 概念页:算子融合、GPU 优化、量化、模型服务
- 资源与工具档案 —— 追踪前沿所需的全部工具清单
- 硬件入门 —— GPU/MLPU/国产硬件的背景
参考资料
- FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision(arXiv:2407.08608)
- FlashInfer: An Efficient and Customizable Attention Engine for LLMs(arXiv:2401.12448)
- vAttention: Efficient Attention with Suffix Parallelism(arXiv:2405.04447)
- DistServe: Disaggregating Prefill and Decoding for Goodput-optimized LLM Serving(arXiv:2401.09670)
- Splitwise: Efficient generative LLM inference using phase splitting(HPCA 2024)
- SARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills(arXiv:2308.16369)
- SGLang: Efficient Execution of Structured Language Model Programs(arXiv:2312.07104)
- Mooncake: A KV-Centric Decoupled Architecture for LLM Serving(arXiv:2407.00079)
- AlpaServe: Scaling for Large-Scale Deep Learning Serving(OSDI 2023)
- EAGLE-3: Scaling up Inference Speed(arXiv:2503.01840)
- Medusa: Simple Framework for Accelerating LLM Generation with Multiple Decoding Heads(arXiv:2401.10774)
- EAGLE-2: Faster Speculative Decoding with Dynamic Draft Trees(arXiv:2406.16858)
- DeepSeek-V3 Technical Report(arXiv:2412.19437)
- QuaRot: Outlier-free 4-bit Inference for Rotated LLMs(arXiv:2404.00456)
- SpinQuant: LLM Quantization with Learned Rotations(arXiv:2405.16406)
- Mamba: Linear-Time Sequence Modeling with Selective State Spaces(arXiv:2312.00752)
- Mixtral of Experts(arXiv:2401.04088)
- Lightning Attention-2(arXiv:2401.11461)
- NVIDIA H100 / H200 数据中心 GPU
- NVIDIA Blackwell B200 / GB200 NVL72
- AMD Instinct MI300X
- Groq LPU
- Cerebras WSE-3
- arXiv(cs.LG / cs.DC 最新提交)
- Hugging Face Papers
- Papers with Code
- Artificial Analysis
- vLLM benchmarks
- SGLang 项目
- FlashAttention 官方仓库
- FlashInfer 项目
- TensorRT-LLM 项目