Skip to content

学习路径:三条路线

本页速览 本站 50 余页内容不是要你通读的图书馆,而是可以按需组合的路线图:为三个月内要面试推理/部署岗的人准备求职冲刺线,为想打牢底子的人准备八周系统精进线,为在职部署工程师准备「问题 → 页面」的案头速查索引。

学习路径:三条路线

这个站点有 50 多页内容。如果你从第一页顺着读下去,大概率会在性能瓶颈那篇的第三小节开始走神——不是内容不好,而是通读不是学习推理加速这门学科的正确姿势。你需要的不是图书馆,是路线图。

本站内容其实只有四种性质:建立概念的(导读)、解释机制的(核心知识)、提供证据的(案例与论文)、改变你行为的(实践与求职)。不同处境的人,应该以完全不同的顺序和深度消费它们。这一页给出三条已经排好的路线,你对号入座即可。

text
                    你的处境是什么?

          ┌───────────────┼───────────────────┐
          ▼               ▼                   ▼
   1-3 个月内面试    时间充裕,想转岗      已经在做部署
          │               │                   │
   ┌────────────┐  ┌───────────────┐   ┌─────────────┐
   │ ① 求职冲刺线 │  │ ② 系统精进线   │   │ ③ 案头速查线  │
   │   约 2 周   │  │   约 8 周     │   │  不通读,随用  │
   ├────────────┤  ├───────────────┤   ├─────────────┤
   │ career 主线 │  │ 导读→知识→案例 │   │ 遇到问题      │
   │ +高频概念   │  │ →实践→论文     │   │ →查索引表     │
   │ +动手 demo  │  │ 每周有检验标准 │   │ →回到工作     │
   ├────────────┤  ├───────────────┤   ├─────────────┤
   │产出:改好的  │  │产出:能讲清    │   │产出:当下的   │
   │简历+10 道题 │  │整套体系+作品集 │   │问题被解决     │
   └────────────┘  └───────────────┘   └─────────────┘

三条路线不是互斥的

很多在职部署工程师的真实轨迹是:先按速查线用了本站几个月,决定系统补齐底子后走一遍八周线,临面试前再跑一遍冲刺线的后半段。路线是导航,不是铁轨。

路线一:求职冲刺线(约 2 周)

适用人群:1–3 个月内有推理加速/模型部署/LLM 服务岗面试,已具备 Python 与基础 ML 知识(能跑通 transformers),没有整块时间,只有晚上和周末。

核心思路:推理/部署岗面试考察的本质是两件事——你能否把"模型权重到生产服务"的工程体系讲清楚(从量化到 batching 到 KV cache),以及你的简历和表达能否通过筛选。所以这条线以终为始,从 JD 和面试题倒推学习内容,不求全面,只求高频考点全部覆盖、每个考点都能说出"为什么"和"代价"。

主线:career 模块四篇

顺序页面你要拿走的东西
1JD 清单:推理/部署岗在招什么目标岗位到底要求什么,把其中反复出现的技能词抄下来(vLLM/TensorRT/量化/KV cache 几乎必现)
2能力地图把 JD 里的技能词映射到本站页面,生成你个人的补课清单
3简历分析按里面的标准重写你的项目经历,突出延迟/吞吐/成本的具体数字
4面试题解析最后用它自测,而非第一天就看

配菜:最高频被考的概念 + 一个动手 demo

从国内外大厂推理/部署岗 JD 与面经的分布看,以下四篇覆盖了绝大多数"工程侧"考点,按这个顺序读:

  1. 延迟与吞吐——几乎每场部署面试必考,TTFT/TPOT/E2E latency、tokens/s、QPS 要能脱口而出,且能解释为什么 prefill 和 decode 的算术强度差 100 倍;
  2. 模型量化基础——PTQ/QAT、对称/非对称、per-channel/per-tensor、INT8/INT4/FP8 的取舍;
  3. 模型服务——在线/批处理/流式三种部署形态、副本策略、灰度发布、SLO 设计;
  4. GPU 优化基础——SM/warp/HBM/SRAM、kernel launch、roofline 模型,至少能讲清"为什么 LLM decode 是访存瓶颈"。

如果只能再加一篇,加批处理与调度——continuous batching 是 vLLM/TGI/SGLang 的核心机制,面试几乎必问。

光看不练的简历没有说服力。用周末跑通从零构建推理服务:仓库里的 v1 最小 forward 只有几十行,v2 加 KV cache + batching、v3 接 vLLM/TensorRT-LLM,逐层跑一遍、改一改,你就拥有了一个可以在面试时讲五分钟不带停的亲手项目——而且这个项目恰好覆盖了面试官最爱的"你亲手调过什么、踩过什么坑"。

两周节奏

第一周(理解 + 简历):

  • 周一到周三:JD 清单 → 能力地图,产出你的补课清单;
  • 周四到周五:按上面顺序读四篇概念文,每篇读完合上书,用手机录音给自己讲一遍核心机制("为什么 continuous batching 比 static batching 快"、"为什么 INT4 量化要感知激活异常值"),讲不顺的地方回读;
  • 周末:跑通 build-your-own 的 v1→v3;按简历分析页的标准改完简历初稿。

第二周(表达 + 自测):

  • 周一到周三:面试题解析,每道题先自己答再对照,把答不上来的标红回炉对应概念页;
  • 周四到周五:找朋友或用语音自问自答做模拟,重点练"为什么"类问题(为什么 KV cache 要分页?为什么投机解码不改变输出分布?为什么 FP8 在 H100 上比 INT8 更受欢迎?);
  • 周末:定稿简历,把 demo 项目整理成能展示的仓库,附上 benchmark 数字。

两周后的验收标准

你手里应该有三样东西:一份按部署岗标准重写过的简历(每个项目都有 latency/throughput/成本数字)、一个跑得通讲得清的推理服务仓库(含 KV cache + batching + 至少一种量化)、10 道能讲出取舍和代价的面试题答案。少一样,说明对应环节偷工了。

路线二:系统精进线(约 8 周)

适用人群:时间相对充裕(每周能投入 8–10 小时),想在 1–2 个季度内完成转型或打牢底子,看重体系而不是速成。

核心思路:推理加速知识是有依赖图的——不理解访存就看不懂为什么量化有效,不理解 batching 就看不懂 vLLM 的精髓,没拆过 vLLM 就写不出自己的调度策略。这条线按依赖顺序排布,每周附检验标准,达不到就不要进下一周

内容检验标准
第 1 周导读五篇:什么是推理加速推理 vs 训练演进简史架构解剖学习路径能向一个没学过的人讲清"为什么同一个模型在 transformers 和 vLLM 上差 100 倍吞吐",并画出推理系统的五层架构
第 2 周性能瓶颈三篇:延迟与吞吐访存与带宽Roofline 模型能徒手算出 Llama-70B FP16 在 A100 上单请求 decode 的 token/s 上限(≈ 带宽/模型大小 ≈ 28 tokens/s),并说清 prefill 与 decode 的算术强度差
第 3 周量化压缩四篇:模型量化基础权重 only 与混合精度剪枝知识蒸馏能说清 GPTQ 与 AWQ 的差异、为什么 INT4 权重量化在 LLM 上常掉点、什么时候选蒸馏而非量化
第 4 周算子图两篇:算子融合图优化;案例选读 TensorRTONNX Runtime能徒手画出 FlashAttention 的分块示意,讲清它为什么省访存;能列出至少 5 种图级融合模式
第 5 周系统硬件三篇:GPU 优化批处理与调度模型服务;动手:从零构建推理服务 的 v1→v3能讲清 continuous batching 的请求加入/退出机制、PagedAttention 的分页思想;demo 跑通并能解释每步在做什么
第 6 周引擎案例选读:vLLM + TensorRT-LLM 必读,SGLang/TGI/llama.cpp/Triton Server 选读能对比至少 3 个引擎在"延迟/吞吐/易用性/硬件支持"四维上的差异,并说出"什么 workload 该选哪个"
第 7 周实践收尾:基准测试调优实战设计原则常见陷阱;选读 投机解码分布式推理移动端部署你的项目能在别人的机器上跑起来,并且你能说出它在什么 batch/seq_len 下会失败、为什么
第 8 周论文 + 求职材料收尾:经典论文精读 至少精读 3 篇(PagedAttention、FlashAttention、GPTQ/AWQ 二选一),前沿进展 选读;然后走 career 模块能讲清至少两篇经典论文的动机与贡献;简历和 10 道题答案达到路线一的验收标准

关于第 5 周的硬性要求

八周里唯一不可压缩的是动手周。读完概念文时你会产生一种"我已经懂了"的错觉——这种错觉会在你第一次面对真实 OOM、KV cache 碎片、batching 抖动时碎掉。没有亲手被 CUDA OOM、被 padding 浪费、被量化掉点教育过,转型是不算完成的。

时间实在紧张的话,第 6 周的引擎选读和第 8 周的论文可以各砍一半,但导读、性能瓶颈、量化、动手这四段不要砍——它们是这条线的承重墙。

路线三:案头速查线(在职部署工程师)

适用人群:已经在做推理/部署相关开发,问题是以"今天卡住了"为单位出现的,没有通读的需求和耐心。

这条线的用法是:遇到问题时从下表查入口页,读完解决问题就走,不要顺藤摸瓜。 摸瓜留给周末。

你遇到的问题去看
线上延迟突增、TPOT 变高延迟与吞吐批处理与调度
GPU 利用率上不去(<30%)Roofline 模型GPU 优化批处理与调度
显存 OOM、KV cache 不够访存与带宽vLLM 与 PagedAttention
想量化但不知道选 INT8 还是 INT4模型量化基础权重 only 与混合精度
量化后掉点严重权重 only 与混合精度(AWQ/SmoothQuant 部分)、常见陷阱
想从 transformers 迁到 vLLMvLLM 与 PagedAttention从零构建推理服务
想从 vLLM 迁到 TensorRT-LLMTensorRT-LLM引擎对比
需要在 CPU/边缘部署OpenVINOllama.cpp移动端部署
想做多模型路由、A/B 测试模型服务Triton Server
单卡装不下 70B,要切 TP/PP分布式推理
想加投机解码提速投机解码案例
attention 占用大头、想优化算子融合(FlashAttention 部分)
图优化没生效、TensorRT 报错图优化常见陷阱
流式输出体验差、首 token 慢延迟与吞吐(TTFT 部分)、批处理与调度
想压测、想出 benchmark 报告基准测试基准数据
老板/客户问"为什么不用更新的模型"设计原则引擎对比
面试或被面试,需要考察引擎面试题解析
术语卡壳(KV cache、continuous batching、speculative decoding)术语表
想知道某卡算力/带宽/显存硬件入门
找开源引擎、找数据集精选资源

把这一页加书签

速查线的价值在于复用率。建议把本页(而不是任何一篇概念文)设为书签——它是全站的交换机。

两点说明

路径不是死规定。 三条线的周数和顺序都是按典型背景估的:算法背景强的可以快进量化压缩,工程背景强的可以快进模型服务,硬件背景强的可以快进 GPU 优化。判断标准永远是你能否通过每周的检验,而不是日历翻到了第几页。

注意内容的时效。 推理加速是半衰期极短的领域——引擎版本、benchmark 分数、硬件代际都会过期。career 模块和案例章的部分页面在 frontmatter 里标注了 dataAsOf(数据截止月份),页面顶部也会显示;引用其中的具体加速倍数、显存数字、引擎版本之前,先看一眼那个日期,超过一个季度的数据请当作"趋势参考"而非"当前事实",并以官方 benchmark 复核。概念性的内容(什么是 KV cache、为什么 decode 访存瓶颈)衰减慢得多,可以放心长期依赖。

延伸阅读