外观
学习路径:三条路线
这个站点有 50 多页内容。如果你从第一页顺着读下去,大概率会在性能瓶颈那篇的第三小节开始走神——不是内容不好,而是通读不是学习推理加速这门学科的正确姿势。你需要的不是图书馆,是路线图。
本站内容其实只有四种性质:建立概念的(导读)、解释机制的(核心知识)、提供证据的(案例与论文)、改变你行为的(实践与求职)。不同处境的人,应该以完全不同的顺序和深度消费它们。这一页给出三条已经排好的路线,你对号入座即可。
text
你的处境是什么?
│
┌───────────────┼───────────────────┐
▼ ▼ ▼
1-3 个月内面试 时间充裕,想转岗 已经在做部署
│ │ │
┌────────────┐ ┌───────────────┐ ┌─────────────┐
│ ① 求职冲刺线 │ │ ② 系统精进线 │ │ ③ 案头速查线 │
│ 约 2 周 │ │ 约 8 周 │ │ 不通读,随用 │
├────────────┤ ├───────────────┤ ├─────────────┤
│ career 主线 │ │ 导读→知识→案例 │ │ 遇到问题 │
│ +高频概念 │ │ →实践→论文 │ │ →查索引表 │
│ +动手 demo │ │ 每周有检验标准 │ │ →回到工作 │
├────────────┤ ├───────────────┤ ├─────────────┤
│产出:改好的 │ │产出:能讲清 │ │产出:当下的 │
│简历+10 道题 │ │整套体系+作品集 │ │问题被解决 │
└────────────┘ └───────────────┘ └─────────────┘三条路线不是互斥的
很多在职部署工程师的真实轨迹是:先按速查线用了本站几个月,决定系统补齐底子后走一遍八周线,临面试前再跑一遍冲刺线的后半段。路线是导航,不是铁轨。
路线一:求职冲刺线(约 2 周)
适用人群:1–3 个月内有推理加速/模型部署/LLM 服务岗面试,已具备 Python 与基础 ML 知识(能跑通 transformers),没有整块时间,只有晚上和周末。
核心思路:推理/部署岗面试考察的本质是两件事——你能否把"模型权重到生产服务"的工程体系讲清楚(从量化到 batching 到 KV cache),以及你的简历和表达能否通过筛选。所以这条线以终为始,从 JD 和面试题倒推学习内容,不求全面,只求高频考点全部覆盖、每个考点都能说出"为什么"和"代价"。
主线:career 模块四篇
| 顺序 | 页面 | 你要拿走的东西 |
|---|---|---|
| 1 | JD 清单:推理/部署岗在招什么 | 目标岗位到底要求什么,把其中反复出现的技能词抄下来(vLLM/TensorRT/量化/KV cache 几乎必现) |
| 2 | 能力地图 | 把 JD 里的技能词映射到本站页面,生成你个人的补课清单 |
| 3 | 简历分析 | 按里面的标准重写你的项目经历,突出延迟/吞吐/成本的具体数字 |
| 4 | 面试题解析 | 最后用它自测,而非第一天就看 |
配菜:最高频被考的概念 + 一个动手 demo
从国内外大厂推理/部署岗 JD 与面经的分布看,以下四篇覆盖了绝大多数"工程侧"考点,按这个顺序读:
- 延迟与吞吐——几乎每场部署面试必考,TTFT/TPOT/E2E latency、tokens/s、QPS 要能脱口而出,且能解释为什么 prefill 和 decode 的算术强度差 100 倍;
- 模型量化基础——PTQ/QAT、对称/非对称、per-channel/per-tensor、INT8/INT4/FP8 的取舍;
- 模型服务——在线/批处理/流式三种部署形态、副本策略、灰度发布、SLO 设计;
- GPU 优化基础——SM/warp/HBM/SRAM、kernel launch、roofline 模型,至少能讲清"为什么 LLM decode 是访存瓶颈"。
如果只能再加一篇,加批处理与调度——continuous batching 是 vLLM/TGI/SGLang 的核心机制,面试几乎必问。
光看不练的简历没有说服力。用周末跑通从零构建推理服务:仓库里的 v1 最小 forward 只有几十行,v2 加 KV cache + batching、v3 接 vLLM/TensorRT-LLM,逐层跑一遍、改一改,你就拥有了一个可以在面试时讲五分钟不带停的亲手项目——而且这个项目恰好覆盖了面试官最爱的"你亲手调过什么、踩过什么坑"。
两周节奏
第一周(理解 + 简历):
- 周一到周三:JD 清单 → 能力地图,产出你的补课清单;
- 周四到周五:按上面顺序读四篇概念文,每篇读完合上书,用手机录音给自己讲一遍核心机制("为什么 continuous batching 比 static batching 快"、"为什么 INT4 量化要感知激活异常值"),讲不顺的地方回读;
- 周末:跑通 build-your-own 的 v1→v3;按简历分析页的标准改完简历初稿。
第二周(表达 + 自测):
- 周一到周三:面试题解析,每道题先自己答再对照,把答不上来的标红回炉对应概念页;
- 周四到周五:找朋友或用语音自问自答做模拟,重点练"为什么"类问题(为什么 KV cache 要分页?为什么投机解码不改变输出分布?为什么 FP8 在 H100 上比 INT8 更受欢迎?);
- 周末:定稿简历,把 demo 项目整理成能展示的仓库,附上 benchmark 数字。
两周后的验收标准
你手里应该有三样东西:一份按部署岗标准重写过的简历(每个项目都有 latency/throughput/成本数字)、一个跑得通讲得清的推理服务仓库(含 KV cache + batching + 至少一种量化)、10 道能讲出取舍和代价的面试题答案。少一样,说明对应环节偷工了。
路线二:系统精进线(约 8 周)
适用人群:时间相对充裕(每周能投入 8–10 小时),想在 1–2 个季度内完成转型或打牢底子,看重体系而不是速成。
核心思路:推理加速知识是有依赖图的——不理解访存就看不懂为什么量化有效,不理解 batching 就看不懂 vLLM 的精髓,没拆过 vLLM 就写不出自己的调度策略。这条线按依赖顺序排布,每周附检验标准,达不到就不要进下一周。
| 周 | 内容 | 检验标准 |
|---|---|---|
| 第 1 周 | 导读五篇:什么是推理加速 → 推理 vs 训练 → 演进简史 → 架构解剖 → 学习路径 | 能向一个没学过的人讲清"为什么同一个模型在 transformers 和 vLLM 上差 100 倍吞吐",并画出推理系统的五层架构 |
| 第 2 周 | 性能瓶颈三篇:延迟与吞吐 → 访存与带宽 → Roofline 模型 | 能徒手算出 Llama-70B FP16 在 A100 上单请求 decode 的 token/s 上限(≈ 带宽/模型大小 ≈ 28 tokens/s),并说清 prefill 与 decode 的算术强度差 |
| 第 3 周 | 量化压缩四篇:模型量化基础 → 权重 only 与混合精度 → 剪枝 → 知识蒸馏 | 能说清 GPTQ 与 AWQ 的差异、为什么 INT4 权重量化在 LLM 上常掉点、什么时候选蒸馏而非量化 |
| 第 4 周 | 算子图两篇:算子融合 → 图优化;案例选读 TensorRT、ONNX Runtime | 能徒手画出 FlashAttention 的分块示意,讲清它为什么省访存;能列出至少 5 种图级融合模式 |
| 第 5 周 | 系统硬件三篇:GPU 优化 → 批处理与调度 → 模型服务;动手:从零构建推理服务 的 v1→v3 | 能讲清 continuous batching 的请求加入/退出机制、PagedAttention 的分页思想;demo 跑通并能解释每步在做什么 |
| 第 6 周 | 引擎案例选读:vLLM + TensorRT-LLM 必读,SGLang/TGI/llama.cpp/Triton Server 选读 | 能对比至少 3 个引擎在"延迟/吞吐/易用性/硬件支持"四维上的差异,并说出"什么 workload 该选哪个" |
| 第 7 周 | 实践收尾:基准测试 → 调优实战 → 设计原则 → 常见陷阱;选读 投机解码、分布式推理、移动端部署 | 你的项目能在别人的机器上跑起来,并且你能说出它在什么 batch/seq_len 下会失败、为什么 |
| 第 8 周 | 论文 + 求职材料收尾:经典论文精读 至少精读 3 篇(PagedAttention、FlashAttention、GPTQ/AWQ 二选一),前沿进展 选读;然后走 career 模块 | 能讲清至少两篇经典论文的动机与贡献;简历和 10 道题答案达到路线一的验收标准 |
关于第 5 周的硬性要求
八周里唯一不可压缩的是动手周。读完概念文时你会产生一种"我已经懂了"的错觉——这种错觉会在你第一次面对真实 OOM、KV cache 碎片、batching 抖动时碎掉。没有亲手被 CUDA OOM、被 padding 浪费、被量化掉点教育过,转型是不算完成的。
时间实在紧张的话,第 6 周的引擎选读和第 8 周的论文可以各砍一半,但导读、性能瓶颈、量化、动手这四段不要砍——它们是这条线的承重墙。
路线三:案头速查线(在职部署工程师)
适用人群:已经在做推理/部署相关开发,问题是以"今天卡住了"为单位出现的,没有通读的需求和耐心。
这条线的用法是:遇到问题时从下表查入口页,读完解决问题就走,不要顺藤摸瓜。 摸瓜留给周末。
| 你遇到的问题 | 去看 |
|---|---|
| 线上延迟突增、TPOT 变高 | 延迟与吞吐、批处理与调度 |
| GPU 利用率上不去(<30%) | Roofline 模型、GPU 优化、批处理与调度 |
| 显存 OOM、KV cache 不够 | 访存与带宽、vLLM 与 PagedAttention |
| 想量化但不知道选 INT8 还是 INT4 | 模型量化基础、权重 only 与混合精度 |
| 量化后掉点严重 | 权重 only 与混合精度(AWQ/SmoothQuant 部分)、常见陷阱 |
| 想从 transformers 迁到 vLLM | vLLM 与 PagedAttention、从零构建推理服务 |
| 想从 vLLM 迁到 TensorRT-LLM | TensorRT-LLM、引擎对比 |
| 需要在 CPU/边缘部署 | OpenVINO、llama.cpp、移动端部署 |
| 想做多模型路由、A/B 测试 | 模型服务、Triton Server |
| 单卡装不下 70B,要切 TP/PP | 分布式推理 |
| 想加投机解码提速 | 投机解码案例 |
| attention 占用大头、想优化 | 算子融合(FlashAttention 部分) |
| 图优化没生效、TensorRT 报错 | 图优化、常见陷阱 |
| 流式输出体验差、首 token 慢 | 延迟与吞吐(TTFT 部分)、批处理与调度 |
| 想压测、想出 benchmark 报告 | 基准测试、基准数据 |
| 老板/客户问"为什么不用更新的模型" | 设计原则、引擎对比 |
| 面试或被面试,需要考察引擎 | 面试题解析 |
| 术语卡壳(KV cache、continuous batching、speculative decoding) | 术语表 |
| 想知道某卡算力/带宽/显存 | 硬件入门 |
| 找开源引擎、找数据集 | 精选资源 |
把这一页加书签
速查线的价值在于复用率。建议把本页(而不是任何一篇概念文)设为书签——它是全站的交换机。
两点说明
路径不是死规定。 三条线的周数和顺序都是按典型背景估的:算法背景强的可以快进量化压缩,工程背景强的可以快进模型服务,硬件背景强的可以快进 GPU 优化。判断标准永远是你能否通过每周的检验,而不是日历翻到了第几页。
注意内容的时效。 推理加速是半衰期极短的领域——引擎版本、benchmark 分数、硬件代际都会过期。career 模块和案例章的部分页面在 frontmatter 里标注了 dataAsOf(数据截止月份),页面顶部也会显示;引用其中的具体加速倍数、显存数字、引擎版本之前,先看一眼那个日期,超过一个季度的数据请当作"趋势参考"而非"当前事实",并以官方 benchmark 复核。概念性的内容(什么是 KV cache、为什么 decode 访存瓶颈)衰减慢得多,可以放心长期依赖。