Skip to content

前沿进展

本页速览 推理加速前沿每周都在变化:本文给出用 arXiv、系统顶会与开源仓库追踪研究的方法,拆算子层、服务系统、投机解码、量化、架构创新与硬件代际六条主线,并诚实评估未解难题,助你选择深耕方向。

前沿进展

"前沿"是个陷阱词。它既意味着机会,也意味着最密集的信息噪声——每周 arXiv 上涌现数十篇推理论文、每月有新引擎发布、每条研究主线都有人在宣告"3× 加速"。如果不加方法地追,你会疲于奔命;但如果完全无视,你会错过这个领域十年一遇的结构性变化(如 H100 时代的 FP8、B200 时代的 FP4、Prefill/Decode 分离范式、spec decoding 的训练时内化)。

本文的目标是给出一张有方法的地图:先讲清楚如何低成本、低噪声地追踪前沿(渠道与优先级),再拆解当下最值得关注的六条研究主线(现状、代表工作、关键问题),然后诚实回答"哪些问题还没解决",最后给出选择深耕方向的具体建议。它既是前沿导航的展开,也与核心论文精读常见问题互为补充。

一、如何追踪前沿

前沿信息不是太少,而是太多。有效的追踪者做的不是"全部读完",而是建立一条有优先级的信号管道

1. arXiv:一手战场

几乎所有重要工作都以预印本形式先发在 arXiv 上,随后才被会议接收。对推理加速研究者来说,几个子分类是主战场:

分类主题说明
cs.LG机器学习算子、量化、spec decoding 论文多发于此
cs.DC分布计算服务系统、并行、集群调度论文多发于此
cs.OS操作系统SOSP/OSDI 投稿常先在此
cs.PF性能评测benchmark、roofline、profile 工作
cs.AR计算机体系结构硬件协同、ISA 论文

每日更新量在数十篇量级,直接刷列表效率极低。实用的做法有三种:

  • 跟作者与机构:在 arXiv 订阅你关注的学者(比如你精读过的论文的作者)的新提交,而不是刷全量列表。一个小组持续产出,通常比随机看一百篇有价值得多。重点作者:Tri Dao(Princeton/Together)、Lianmin Zheng(Berkeley/DeepSeek)、Ying Sheng(MIT/Together)、Zhuoming Chen(Princeton)、DeepSeek-AI 的系统组、NVIDIA TensorRT-LLM 组、vLLM 项目核心团队。
  • 用工具做筛选Hugging Face Papers 每天按热度整理论文并附带代码、讨论;Papers with Code 按任务查 SOTA;AlphaXiv 等工具可以直接在论文页面上提问。
  • 只精读高信号论文:一篇论文值不值得精读,先看三点——题目是否回应你正在解决的部署问题、作者/机构是否有延续性、是否同时发布了代码与权重。

时间线经验

预印本永远快于会议:从投稿到发表往往隔 6–10 个月。2023 年 6 月挂出的 vLLM 论文,2023 年 10 月才在 SOSP 出现,但它的影响力从预印本发布那天就开始了。读预印本、按会议查证版本,是研究者的标准节奏。

2. 评测与榜单:把"感觉"换成"数字"

单纯追论文会被叙事带偏——宣传稿总是报喜。对抗噪声的第二条管道是评测聚合站

渠道用途特点
Papers with Code按任务查 SOTA 榜单每个基准的最高分、代码、论文一一对应
Artificial Analysis推理成本 / 速度 / 质量对照把"强不强"与"贵不贵"放在一起看,贴近工程决策
vLLM benchmarks引擎级吞吐 / 延迟基准跟 vLLM main 同步演进,最贴近工业部署
SGLang benchmarks引擎对比 + spec decoding 基准spec decoding 与 RadixAttention 的对比数据

评测站的局限也要知道:榜单总是滞后于发布、且容易被刷分污染。它的正确用法不是"谁第一就信谁",而是给你一个横向坐标,帮助判断一篇论文声称的提升是真实还是噪声——这部分方法与坑见前沿导航中的阅读方法,以及评测资源档案

3. 开源仓库与 PR:工程信号的第二管道

推理部署领域有个独特现象:很多重要工作先出现在 GitHub PR 里,再写论文。值得长期盯的仓库:

仓库价值
vllm-project/vllm主线 PR 里藏着 PagedAttention 演进、Chunked prefill、各类 spec decoding 集成
NVIDIA/TensorRT-LLM工程与硬件协同的一线信号,FP8/FP4 kernel 通常先在这里落地
flash-attentionFA 系列与相关算子的官方实现,issue 里有大量边界 case
flashinfer-ai/flashinfer可组合 KV 格式、块稀疏 attention 的官方实现
sgl-project/sglangRadixAttention 与 spec decoding 的工程前沿
llama.cpp端侧推理事实标准,GGUF 量化格式的演进

4. 顶会:沉淀后的系统知识

顶会论文比预印本晚,但经过了同行评审,且会议有组织性的教程(Tutorial)与综述(Survey),是补系统知识的最佳入口:

会议领域每年大致时间
SOSP / OSDI操作系统与系统10–11 月交替
MLSys机器学习系统3 月
ASPLOS软硬件接口3–4 月
ISCA / HPCA体系结构6 月 / 4 月
NeurIPS / ICML / ICLR机器学习综合12 月 / 7 月 / 4–5 月

追踪顶会不必参会:录用列表公布时扫一遍标题,会议结束后看 tutorial 材料即可。对于一个新人,一两个高质量 Tutorial 比五十篇论文管用,因为它们把该领域的坐标系讲清楚了。

把四条管道按"速度 × 深度"排列:

  速度高 ┌────────────────────────────────────┐
         │  GitHub PR、X/博客、实验室动态   ── 信号,噪声最多 │
         │  arXiv 每日更新                  ── 一手论文      │
         │  评测榜 / HF 论文日报            ── 聚合 + 数字   │
         │  顶会论文与教程                  ── 沉淀后知识    │
  深度高 └────────────────────────────────────┘
         读得越深,判断越稳;追得越急,越容易被带偏。

二、六条研究主线

下面六条主线是当下最活跃、也最影响产业走势的方向。每条都给出现状、代表工作、关键问题,并按"论文名称(arXiv 号)→ 一句话要点"的方式引用,方便你在核心论文精读中对照精读。

主线一:算子层前沿——从 IO 感知到硬件协同

现状。 FlashAttention v1/v2 把 attention 瓶颈从 FLOPs 纠回到 IO,2024 年起算子前沿进入第三代:与硬件代际深度协同。FlashAttention-3 用 H100 的 FP8 + 异步(warp-specialized),把峰值推到 1.2 PFLOPs;FlashInfer 用块稀疏 + 可组合 KV 格式,把 paged KV 与变长 attention 统一在一个 kernel;vAttention 反过来问:能不能用硬件原生 sparse attention 替代软件 PagedAttention,避免 SM 阻塞?

代表工作。

工作要点
FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precisionarXiv:2407.08608H100 上 FP8 + 异步(warp-specialized),峰值 1.2 PFLOPs,比 FA2 快 1.5-2×;展示了"算子协同硬件代际"的范式
FlashInfer: An Efficient and Customizable Attention Engine for LLMsarXiv:2401.12448块稀疏 + 可组合 KV 格式(PagedKV、RaggedKV、BlockSparse),统一 attention 接口;2025 MLSys 论文
vAttention: Efficient Attention with Suffix ParallelismarXiv:2405.04447用硬件原生 sparse attention 替代软件 PagedAttention,避免 SM 阻塞;提出"软件 paged 是临时方案,硬件稀疏才是终局"的争论
Flash-Decoding(Dao 等,2023 博客)长序列、batch=1 解码场景下,FA 的并行度改进,把 KV 切块并行
Lightning Attention-2Qwen 团队,2024线性 attention 的工程实现,在长上下文下推理成本接近线性

关键问题。

  • 硬件代际决定算法选择:FA2 在 A100 上最优,FA3 在 H100 上最优,FP8/FP4 kernel 在 Blackwell 上才甜。硬件换一代,算子要重写一次,这是算子层的核心痛点。
  • 软件 vs 硬件稀疏:vAttention 提出的"用硬件稀疏替代软件 paged"是 2024 年最有趣的争论。短期内软件方案仍主流,但硬件稀疏是否会终结 PagedAttention,是值得追的开放问题。
  • 统一接口缺失:FlashInfer 的尝试说明,目前 attention 算子接口太多(PagedKV、RaggedKV、BlockSparse、FA),缺少统一抽象。这是引擎开发者的日常痛点。算子机制详见算子融合GPU 优化

与你的关系

如果你做算子:算子层是"必须持续跟进"的主线,硬件代际迁移即算法重写。如果你做引擎:算子层只看接口与 benchmark,不需要追每篇论文。如果你做研究:算子层是最难做但影响最大的方向——能写出 FA4 级别的工作就是 NeurIPS/MLSys 的最佳论文候选。

主线二:服务系统前沿——从单引擎到 Prefill/Decode 分离

现状。 vLLM 的 PagedAttention 解决了 KV cache 碎片化,但 LLM 服务还有两个遗留问题:① prefill 与 decode 的算力/显存比完全相反,同 GPU 同 batch 时互相干扰;② 多轮对话与 few-shot 场景下,KV cache 的前缀重复计算浪费。2024 年的两条主线——Prefill/Decode 物理分离前缀树复用——分别解决这两个问题。

代表工作。

工作要点
DistServe: Disaggregating Prefill and Decoding for Goodput-optimized LLM ServingarXiv:2401.09670prefill 与 decode 物理分离到不同 GPU,各自独立 scaling,避免互相干扰;P99 延迟减半
Splitwise: Efficient generative LLM inference using phase splittingHPCA 2024与 DistServe 思路相似,但聚焦集群级方案,做分阶段机器调度
SARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked PrefillsarXiv:2308.16369chunked prefill:把长 prefill 拆 chunk 与 decode 同 batch,平衡算力与显存;vLLM 0.5+ 已集成
SGLang: Efficient Execution of Structured Language Model ProgramsarXiv:2312.07104RadixAttention:前缀树复用 KV cache,多轮对话与 few-shot 场景的吞吐利器
Mooncake: A KV-Centric Decoupled Architecture for LLM ServingarXiv:2407.00079月之暗面的全球级架构:把 KV cache 当一等公民存储与传输,KV cache 分离
AlpaServe: Scaling for Large-Scale Deep Learning ServingOSDI 2023多模型部署的统计复用率分析,指导多模型时分复用

关键问题。

  • 分离 vs 混合的权衡:DistServe 的物理分离代价是机器利用率不均(prefill 机器忙、decode 机器闲);SARATHI 的混合方案代价是 prefill 与 decode 互相干扰。短期看混合(SARATHI)落地更多,长期看分离(DistServe)更可能成为大规模服务的范式
  • KV cache 的存储与传输:Mooncake 把 KV cache 当一等公民,但跨节点传输 KV cache 的带宽成本与延迟开销仍是开放问题。KV cache 的"分布式存储"会不会成为下一个 vLLM 级的范式? 值得持续关注。
  • 前缀复用 vs chunked prefill 的协同:SGLang 的 RadixAttention 与 SARATHI 的 chunked prefill 在多轮对话场景下有协同,也有冲突。主流引擎正在融合两者,但最佳实践仍在演化。服务机制详见批处理与调度模型服务

主线三:投机解码前沿——从接受率 50% 到 6.5× 加速

现状。 2023 年 Leviathan 把 spec decoding 正式化时,接受率约 50%,加速 2-3×。2024 年 Medusa/EAGLE-1/2 把接受率推到 70%+,加速 3-5×。2025 年 EAGLE-3 把加速比推到 6.5×。同时,DeepSeek-V3 把 spec decoding 内化为训练目标(MTP),开启了"训练时学会 draft"的新范式。spec decoding 是 2024–2026 年 LLM 推理最活跃的研究方向之一

代表工作。

工作要点
EAGLE-3: Scaling up Inference SpeedarXiv:2503.01840NeurIPS 2025,用深层特征 + 训练目标改进,加速比 3-6.5×;EAGLE 系列的最新标杆
P-EAGLE(AWS, 2025)解耦 drafting:draft 模型可以独立部署,不与主模型耦合,简化多模型集成
SpecForge(SGLang 组, 2025 博客)多 draft 模型训练管线:把 spec decoding 当作"工程产物"训练,可批量产出 draft 模型
DeepSeek-V3 MTParXiv:2412.19437主模型原生支持 multi-token prediction,训练时学 spec decoding 能力;spec decoding 的训练时内化
MedusaarXiv:2401.10774主模型多头并行预测,简化 spec decoding;EAGLE 的前奏
EAGLE-2arXiv:2406.16858动态 draft tree,接受率 70%+
SpecBench(SGLang, 2024)spec decoding 的统一评测基准,对比 EAGLE/Medusa/SpecInfer 等方案

关键问题。

  • 训练时 vs 推理时 draft:DeepSeek-V3 MTP 的"训练时学会 draft" vs EAGLE 系列的"推理时附加 draft",哪个能成为主流?短期看 EAGLE 工程化更成熟,长期看 MTP 与模型架构深度耦合可能胜出。2025–2026 年的关键开放问题
  • draft 模型的解耦与可移植性:P-EAGLE 与 SpecForge 把 draft 模型做成"独立训练产物",意味着未来可能有"draft 模型即服务"——新模型发布时配套发布 draft 模型,可能成为标配
  • 接受率的上限:EAGLE-3 接受率 80%+,加速 6.5×。接受率能到 100% 吗? 显然不能,但上限在哪、能否做自适应 budget(易猜的 token 多猜、难猜的少猜),是活跃研究方向。案例详见投机解码案例

主线四:量化前沿——从 4-bit 到 FP4 与旋转量化

现状。 量化的甜点从 INT4(GPTQ、AWQ)→ INT8 激活(SmoothQuant)→ 2024 年的 FP8(H100)→ 2025 年的 FP4(Blackwell B200)。同时,旋转量化(QuaRot、SpinQuant)用等价变换"抹平"分布,让 W4A4 量化精度大增。量化的两条主线——硬件格式与等价变换——正在汇合

代表工作。

工作要点
FP8 Formats for Deep Learning(NVIDIA, 白皮书H100 引入 FP8 Tensor Core,硬件级量化甜点格式;E4M3 与 E5M2 两种格式
FP4 Inference on Blackwell(NVIDIA, 2024)B200 引入 FP4 Tensor Core + NVFP4 量化格式,权重量化甜点
QuaRot: Outlier-free 4-bit Inference for Rotated LLMsarXiv:2404.00456随机正交变换把离群值"抹平",让 W4A4 量化精度大增
SpinQuant: LLM Quantization with Learned RotationsarXiv:2405.16406学习型旋转矩阵,比 QuaRot 的随机旋转更优,W4A4 接近 W4A16
BigVGQ: Bit-Grouped Quantization(2024)把权重按子组量化,进一步降低量化误差
GPTQ/AWQ/SmoothQuant精读见此二阶/激活/平滑的经典 4-bit 与 8-bit 量化方案

关键问题。

  • 硬件格式 vs 算法量化的赛跑:FP8 让硬件原生支持 8-bit 浮点,但算法量化(GPTQ/AWQ)能到 4-bit。当硬件原生支持 FP4/NVFP4(B200)后,算法量化是否还有优势? 短期看 GPTQ/AWQ 在 A100/H100 仍主流,长期看 NVFP4 可能终结权重量化的算法研究。
  • W4A4 vs W4A16 的精度差:W4A16(权重 4-bit、激活 16-bit)已经接近无损,但 W4A4(全 4-bit)仍损失明显。旋转量化(QuaRot、SpinQuant)让 W4A4 接近 W4A16,但还不够。W4A4 何时成为默认? 取决于硬件与算法的双重突破。
  • 旋转量化的理论极限:QuaRot 用随机旋转,SpinQuant 用学习旋转,最优旋转是什么? 仍是开放问题。理论上"Hadamard 变换"可能更优,工程上还在验证。量化机制详见量化权重混合精度

主线五:架构创新——SSM、MoE 与线性 attention

现状。 Transformer 不是唯一选择。Mamba/SSM 在长序列上推理成本接近线性;MoE(DeepSeek-V3、Mixtral)让开源模型推到千亿级;Linear Attention(Lightning Asst、GLA)试图打破 O(n²) 复杂度。架构层的创新正在重塑推理引擎的设计——MoE 要支持专家并行与路由,Mamba 要支持状态推理,Linear Attention 要支持 chunk-wise 计算。

代表工作。

工作要点
Mamba: Linear-Time Sequence Modeling with Selective State SpacesarXiv:2312.00752选择性状态空间模型,长序列推理成本接近线性,挑战 Transformer 的 O(n²)
Mixtral of ExpertsarXiv:2401.040888 专家 MoE 开源权重,把 MoE 从闭源带入开源;推理侧专家并行成为标配
DeepSeek-V3 Technical ReportarXiv:2412.19437256 专家 + 8 激活 MoE + MTP,开源 MoE 推理服务标杆
Lightning Attention-2Qwen 团队,arXiv:2401.11461线性 attention 的工程实现,长上下文下推理成本接近线性
Gated Linear Attention(GLA, Yang 等, 2024)带 gating 的线性 attention,比 Mamba 更易并行训练
Jamba(AI21 Labs, 2024)Mamba + Transformer 混合架构,工业上首次把 SSM 用在大规模 LLM

关键问题。

  • MoE 推理的工程化挑战:256 专家的显存驻留、专家路由负载均衡、跨节点通信,比 Llama-3-70B 复杂得多。新模型架构 vs 推理引擎能力,总是你追我赶——SGLang、vLLM 花了半年才把 DeepSeek-V3 高效推理跑通。
  • SSM/Mamba 的推理特性:Mamba 的"状态推理"与传统 attention 的 KV cache 完全不同,引擎要重写。SSM 推理的 PagedAttention 等价物还没出现,是开放机会。
  • 混合架构的复杂性:Jamba 这样的 Mamba+Transformer 混合,让引擎要同时支持两种推理范式,工程成本高。短期内 MoE 仍是主流,Mamba 与 Linear Attention 是补充而非替代。架构机制详见GPU 优化分布式推理

主线六:硬件代际——B200、MI300X、昇腾、Groq、Cerebras

现状。 硬件代际迁移即算法重写。H100 引入 FP8,B200 引入 FP4 与 NVLink 5.0;AMD MI300X 用 HBM3+ 大显存挑战 NVIDIA;华为昇腾 910B 在国内承担大量推理负载;Groq LPU 用确定性架构追求极致 throughput;Cerebras WSE 用整片晶圆做计算。

代表工作 / 硬件发布。

硬件关键特性对推理的影响
NVIDIA B200 / GB200 NVL72(Blackwell, 2024)FP4 Tensor Core + NVFP4 量化格式 + 72 GPU NVLink 集群FP4 量化甜点;大模型可单集群推理
NVIDIA H100 / H200(Hopper, 2022-2024)FP8 Tensor Core + Transformer Engine + 第四代 NVLinkFP8 推理甜点;FA3 的硬件基础
AMD MI300X(2023)192GB HBM3 + 5.3TB/s 带宽大显存 + 高带宽,挑战 NVIDIA;vLLM/SGLang 已支持
华为昇腾 910B(2023)国产 7nm + 达芬奇架构 + 64GB HBM国内大模型推理主力硬件之一
Groq LPU(2024 商用)确定性架构 + SRAM 主导 + 极高 throughput单 token 延迟极低,但显存小、不适合大模型 KV cache
Cerebras WSE-3(2024)整片晶圆 + 4 trillion 晶体管极致稀疏算力,但生态弱、部署复杂
Intel Gaudi 2/3(2023-2024)96GB HBM2 + 24GB HBM3性价比路线,部分企业部署

关键问题。

  • 硬件代际即算法重写:FA1 在 A100 上最优,FA3 在 H100 上最优,FP4 kernel 在 B200 上才甜。硬件换一代,算子要重写一次,这是算子层的核心痛点,也是这个领域持续的机会。
  • 国产硬件的生态追赶:昇腾 910B 在硬件性能上接近 A100,但软件生态(PyTorch 集成、vLLM 移植、算子库)落后 2-3 年。国产推理引擎与算子是未来 3-5 年的关键机会
  • 极端架构的命运:Groq LPU 的"确定性 + 高 throughput"在特定场景惊艳,但显存小限制了通用 LLM 推理;Cerebras WSE 算力惊人但部署门槛高。极端架构要么找到 niche 市场活下去,要么被主流 GPU 生态吞掉。硬件背景详见硬件入门

三、哪些问题还没解决

上面每条主线都有"关键问题",但有几个问题是跨主线的、被反复提到却远未解决的。诚实面对它们,比追逐热点更重要。

1. 长尾延迟与公平性的矛盾

LLM 服务的吞吐与延迟容易测,但 P99/P999 长尾延迟极难控——它取决于负载分布、调度策略、KV cache 命中率、硬件抖动。业界没有"长尾延迟的 SOTA",只有"在 X 负载下用 Y 引擎达到 Z 长尾"的案例。DistServe/SARATHI 都在打这个,但没有一个是"通用解"。

2. 多模型部署的"复用率"理论

AlpaServe 给出了"多模型时分复用"的统计框架,但多模型部署的最佳实践仍未形成共识——每个团队都在自己摸索"几个模型用几张卡、用什么样的 batching 策略"。这是开放机会,也是工业界的日常痛点。

3. spec decoding 的训练时内化

DeepSeek-V3 MTP 开启了"训练时学会 draft"的新范式,但MTP 的训练成本、对主模型精度的影响、draft 能力的可移植性都没有定论。2025–2026 年的关键开放问题。

4. 量化与稀疏的统一

量化(让权重更小)与稀疏(让计算更少)是两条独立的优化路线,但它们能否协同?比如稀疏 attention 的稀疏模式能否与权重量化协同?目前几乎没人研究这个交叉,是开放机会。

5. 国产硬件的算子生态

昇腾 910B 等国产硬件在算力上不弱,但算子生态是"空地"。FA3、PagedAttention、spec decoding 这些主流工作的国产硬件实现,是未来 3-5 年的刚需机会

如何与"未解决"相处

不要把"还没解决"等同于"没有机会"。恰恰相反:真正高价值的产出通常出现在公认难题的边角。长尾延迟催生了 DistServe/SARATHI 的繁荣,多模型复用率催生了 AlpaServe,spec decoding 的训练时内化催生了 DeepSeek-V3 MTP。理解了问题清单,你就理解了机会清单。

四、给读者的建议:如何选择深耕方向

面对六条主线,最常见的困惑是"该选哪个"。给三条原则:

原则一:按"你的不可替代性"选,不按"热度"选。 六条主线都很热,但你的背景决定了哪条路的上手成本最低、护城河最深:

你的背景切入方向理由
算法/CUDA 基础好主线一(算子层)或主线四(量化)算子层与量化都是算子密集区,CUDA 能力即优势
系统/分布式基础好主线二(服务系统)或主线五(架构创新)服务系统与 MoE 推理都是系统密集区
工程/产品基础好主线三(spec decoding)或主线六(硬件)spec decoding 工程化最热,硬件适配国产空白多
算法/建模基础好主线五(架构创新)Mamba/MoE 的设计空间大,靠理解力而非算力取胜
国产硬件背景主线六(硬件)的国产部分国产算子生态是未来 3-5 年的关键机会
尚不确定先读前沿地图核心论文精读用一两个月建立全貌再决定,别急着押注

原则二:深耕一个方向"到能独立做项目",再横向扩展。 前沿最大的陷阱是"每篇论文都读一遍、哪个方向都浅尝"。更有效的模式是:

  1. 选一个方向,把它的经典论文(见核心论文精读)按时间顺序精读十到二十篇,画出一张技术演进图;
  2. 用开源权重与引擎复现至少一个代表工作(哪怕是缩小版),把论文里的"做法"变成你手上的"能力";
  3. 在 vLLM、SGLang、TensorRT-LLM 上参与一个活跃 PR(提 issue、修 bug、复现实验),让真实反馈校准你的理解;
  4. 资源档案里的工具与榜单持续跟踪这个方向的进展,写周期性的个人综述。

原则三:警惕叙事,拥抱数字。 前沿写作充满了"3× 加速""无损""革命性"的叙事,但它们很少经得起下个月的检验。你的防御武器是评测与复现:任何"大突破",都先在评测站找数据,再跑一个小实验验证。判断"什么会留下、什么会退潮",比预测"下一个热点"更可靠。

一年的深耕时间线(参考)

如果决定深耕一个方向,一个可执行的一年框架是:第 1–3 个月把该方向经典论文精读一遍并复现至少一个缩小版实验,建立自己的代码基座;第 4–6 个月独立完成一个小项目(复现 + 一项自己的改进),并写成一份技术报告;第 7–9 个月参与一个开源引擎或公开评测,让社区反馈校准你的判断;第 10–12 个月把成果整理成可展示的形式(博客、报告、参赛成绩)。一年后你收获的不是"读过很多论文",而是一条能独立走通"读论文—做实验—形成判断"的回路——这比任何知识量都值钱。

给新人的时间预算

如果每周能投入 10 小时:5 小时精读与复现、3 小时跟踪(arXiv + 评测榜 + 仓库 PR)、2 小时写笔记与总结。三个月后你会明显感觉到:判断力比记忆量大得多。完整的学习路径规划见学习路径前沿导航

五、延伸阅读

参考资料