什么是推理加速
推理是把训练好的模型权重变成生产可服务系统的全部工程。本文给出三层定义、与训练的根本差异、四大优化层次、手写最小推理系统(含 KV cache),以及三个实证加速刻度。
INFERENCE ACCELERATION HANDBOOK
从权重到服务的系统化知识 —— 性能与瓶颈 · 量化与压缩 · 算子与图优化 · 服务与编排 · 引擎案例 · 论文与职业路径
50+ 篇内容不是要你通读的图书馆,而是可以按需组合的路线图
只读十篇的话,读这些
推理是把训练好的模型权重变成生产可服务系统的全部工程。本文给出三层定义、与训练的根本差异、四大优化层次、手写最小推理系统(含 KV cache),以及三个实证加速刻度。
导读量化是把 FP16/BF16 权重和激活压到 INT8/INT4/FP8/FP4 的核心技术——以少量精度损失换 2-8 倍推理速度与显存压缩。本文讲透线性量化公式、量化粒度、PTQ vs QAT、校准方法、GPTQ/AWQ/SmoothQuant/FP8/FP4 主流算法族。
核心知识算子融合把多个 elementwise/reduction 算子合成一个 kernel,避免中间张量在 HBM 往返——LLM 推理优化的核心手段。本文讲透经典融合、FlashAttention v1/v2/v3 的 SRAM tiling、FlashInfer 块稀疏、Triton/CUDA 编程模型、融合边界判定。
核心知识推理系统的三个核心指标——延迟(TTFT/TPOT/E2E)、吞吐(tokens/s、QPS)、并发数,以及它们之间此消彼长的关系。本文给出 Little's Law、prefill/decode 两阶段延迟特性差异、延迟-吞吐曲线,以及测量方法。
核心知识GPU 是 LLM 推理的主力硬件——SM、warp、Tensor Core、HBM、L2 cache 的体系结构决定了一切优化方向。本文讲透 GPU 编程模型、各代 GPU 算力与带宽参数、性能调优 checklist(occupancy、coalesced access、bank conflict、async memcpy、pipelining)、cudnn/cublas/cutlass 库。
核心知识用一个小的 draft model 预测 k 个 token,大模型一次 forward 验证,正确就接受全部——这是 LLM decode 阶段最优雅的"无损 2-6× 加速"。本文拆解三代投机解码方法、数学无损保证与边界条件。
经典案例ONNX Runtime 把"模型即文件"做到了极致——一个 .onnx 文件在 CPU、CUDA、DirectML、CoreML、QNN 上跑得起来,靠的是 Execution Provider 机制与一套严格的图优化管线。本文拆解 ONNX IR、EP 机制、GRPO 优化器与跨框架工具链。
经典案例NVIDIA 自家的 GPU 推理优化引擎,通过图融合、kernel auto-tuning 与 INT8/FP8 量化,把训练框架的"通用计算"打磨成"GPU 上的极致吞吐"。本文拆解 Builder/Engine/Runtime 三段式流水线、INT8 calibration、Plugin 接口与 torch_tensorrt 集成。
经典案例NVIDIA 在 TensorRT 之上为 LLM 推理专门打造的扩展,集成 In-Flight Batching、Paged KV Cache、FlashAttention、FP8 等优化,是 H100 上 LLM 推理的旗舰栈。本文拆解 build 流程、调优开关、与 vLLM 的对比与 Triton 部署。
经典案例UC Berkeley 2023 年开源的 LLM 推理引擎,用 PagedAttention 把 KV Cache 像虚拟内存一样分页管理,配合 continuous batching 让 Llama-65B 的吞吐直接涨一个量级。本文拆解 PagedAttention、prefix caching、量化支持、与 SGLang/TGI 的对比。
经典案例为什么做推理加速与部署也要读论文?本文说清三类论文的不同价值,按目标给出三条入门路线,介绍本站论文栏目五部分导航,并附一条读论文最重要的一条建议。
论文精读从 FlashAttention 到 DeepSeek-V3,逐篇精读改变推理加速与部署领域的十篇经典论文:背景、机制、实验、启示,并附三遍读论文法与十篇论文背后的共同规律,助你建立推理论文阅读坐标系。
论文精读推理加速前沿每周都在变化:本文给出用 arXiv、系统顶会与开源仓库追踪研究的方法,拆算子层、服务系统、投机解码、量化、架构创新与硬件代际六条主线,并诚实评估未解难题,助你选择深耕方向。
论文精读量化前后精度没对齐、预处理与训练不一致、单 batch 测延迟当生产、KV cache 估算错、GPU 利用率当唯一指标、投机解码在大 batch 用……本清单覆盖推理部署 15 个高频陷阱,每个给出症状、根因、修复与相关页链接,附一张可勾选自检清单。
实践指南用 Llama-2-7B 走通从 PyTorch 直接推理、vLLM 替换到 AWQ 量化 + EAGLE 投机解码 + Triton 部署的三版渐进路线,每版给出可执行命令、观测指标、目录结构与性能对比,是推理部署方向最浓缩的端到端动手项目。
实践指南推理优化的数字怎么测、怎么报、怎么防作弊?本文给出 LLM 推理基准测试方法论:测什么(吞吐/TTFT/TPOT/p99/显存)、用什么测(vLLM offline / mlperf-llm / sglang bench / lm-eval-harness)、怎么控制变量、怎么写报告,附防作弊清单与报告模板。
实践指南vLLM、SGLang、TensorRT-LLM、TGI、Triton、ONNX Runtime、OpenVINO、llama.cpp、TFLite 怎么选?本文从模型类型、硬件、部署形态、性能目标、团队能力五个维度出发,给出九大引擎横向对比表与 LLM 在线、经典模型服务、端侧三大场景的选型决策。
实践指南推理加速岗面试全景与高频真题解析:十类轮次、28 道题覆盖性能指标、量化、KV cache、批处理、算子、服务编排、投机解码、分布式、硬件与系统设计,附手撕 KV cache 草稿与「不知道」话术和 1 周/1 个月冲刺清单。
求职与JD推理加速岗位的全景图:从硅谷到国内,引擎工程师、系统工程师、Infra 工程师、算子工程师、端侧工程师等七类岗位的职责、能力模型与薪资水位,配三角色画像与 career 模块四页使用地图。
求职与JD推理加速领域的核心术语表:基础概念、性能与指标、显存与算力、量化与压缩、算子与图、系统与服务、硬件七组共 70+ 术语的准确定义与辨析。
资源推理加速硬件体系结构:GPU/SM/Tensor Core、NVIDIA 三代数据中心卡 A100/H100/H200/B200 显存带宽算力功耗对比、消费卡对比、AMD MI300X、Apple Silicon、昇腾 910B、Intel AMX、NPU,及训练/推理选型逻辑。
资源按模块浏览,或直接搜索
推理是把训练好的模型权重变成生产可服务系统的全部工程。本文给出三层定义、与训练的根本差异、四大优化层次、手写最小推理系统(含 KV cache),以及三个实证加速刻度。
训练算 FLOPs 多、激活多;推理访存重、batching 紧、KV cache 必须。微调是训练的轻量化尾声。本文从算力、访存、批处理、KV cache、精度、硬件、微调位置七个维度把三者切清楚。
本站 50 余页内容不是要你通读的图书馆,而是可以按需组合的路线图:为三个月内要面试推理/部署岗的人准备求职冲刺线,为想打牢底子的人准备八周系统精进线,为在职部署工程师准备「问题 → 页面」的案头速查索引。
从 2010 年代 CPU 推理与 OpenVINO,到 GPU/cuDNN 兴起,到 Transformer 与 LLM 推理革命,再到 vLLM/PagedAttention、FP8、投机解码。本文用一条时间线讲清推理加速十五年的起落逻辑与每次跃迁背后的技术原因。
一个生产级 LLM 推理系统的完整骨架:应用、编排、引擎、算子、模型、硬件六层。本文是本站的内容地图,每一层指向对应的深入文章,读完它你就拥有推理工程的全局视角。
计算图(IR)是推理引擎的中枢——常量折叠、死代码消除、算子融合、布局传播、CUDA graph capture、prefix caching 都是图层面优化。本文讲透 ONNX/MLIR/XLA HLO IR、静态 vs 动态 shape、TVM Relax/Inductor/XLA/Triton 编译器栈。
剪枝是把不重要的权重或结构去掉——让模型变小变快。本文讲透非结构化 vs 结构化剪枝、Lottery Ticket 假说、幅值/迭代/Taylor/Movement 剪枝算法、NVIDIA 2:4 结构化稀疏,以及 LLM 时代的 Wanda/LLM-Pruner。
把模型从 notebook 变成稳定线上服务:推理服务架构分层(API gateway / 推理引擎 / 模型仓库 / 负载均衡 / 健康检查)、部署形态、主流框架(Triton / vLLM / TGI / SGLang / Ray Serve)、多模型路由、弹性伸缩、监控指标与 MLOps 闭环。
量化是把 FP16/BF16 权重和激活压到 INT8/INT4/FP8/FP4 的核心技术——以少量精度损失换 2-8 倍推理速度与显存压缩。本文讲透线性量化公式、量化粒度、PTQ vs QAT、校准方法、GPTQ/AWQ/SmoothQuant/FP8/FP4 主流算法族。
batching 是 GPU 推理性能的核心旋钮——静态 batching 凑齐才跑(延迟高)、动态 batching 折中、continuous batching 每 step 都可换请求(vLLM/SGLang 的革新)。本文讲透调度策略、prefill/decode 分离调度、vLLM 调度器机制。
权重量化(weight-only)把 LLM 权重压到 INT4/INT8 同时激活保持 FP16/BF16——专门为 decode 阶段带宽墙设计。本文讲透 GPTQ 的 Hessian 二阶补偿、AWQ 的显著权重保护、Marlin kernel 的极致融合、以及 W8A16/W4A16/W4A8 等组合的选型。
算子融合把多个 elementwise/reduction 算子合成一个 kernel,避免中间张量在 HBM 往返——LLM 推理优化的核心手段。本文讲透经典融合、FlashAttention v1/v2/v3 的 SRAM tiling、FlashInfer 块稀疏、Triton/CUDA 编程模型、融合边界判定。
LLM 推理在 decode 阶段几乎被显存带宽卡死——每生成一个 token 都要把整个模型权重从 HBM 读一遍。本文讲清显存层次结构(HBM/L2/SRAM)、各代 GPU 的带宽参数、KV cache 显存公式、memory-bound 的判定与对策。
推理系统的三个核心指标——延迟(TTFT/TPOT/E2E)、吞吐(tokens/s、QPS)、并发数,以及它们之间此消彼长的关系。本文给出 Little's Law、prefill/decode 两阶段延迟特性差异、延迟-吞吐曲线,以及测量方法。
知识蒸馏(Hinton 2015)让大模型(teacher)教小模型(student),把"暗知识"通过 soft label 传下来。本文讲透三类监督(soft/hard/feature)、温度 T 的作用、LLM 蒸馏(GPT-4 蒸馏小模型、MiniLLM 白盒蒸馏)、以及"压缩三件套"中蒸馏的角色。
GPU 是 LLM 推理的主力硬件——SM、warp、Tensor Core、HBM、L2 cache 的体系结构决定了一切优化方向。本文讲透 GPU 编程模型、各代 GPU 算力与带宽参数、性能调优 checklist(occupancy、coalesced access、bank conflict、async memcpy、pipelining)、cudnn/cublas/cutlass 库。
Roofline 是分析 GPU 算子性能的统一框架—— attainable FLOPS = min(peak FLOPS, bandwidth × arithmetic_intensity)。本文画一张 Roofline 图,讲清算术强度、拐点、memory-bound vs compute-bound 的判定,并用它诊断 LLM 推理的瓶颈。
当 LLM 跑不进单卡显存,需要把模型切分到多卡——张量并行按 head 切、流水线并行按层切、专家并行按 MoE 路由切。本文拆解三大切分策略、通信代价、主流实现与跨节点部署。
用一个小的 draft model 预测 k 个 token,大模型一次 forward 验证,正确就接受全部——这是 LLM decode 阶段最优雅的"无损 2-6× 加速"。本文拆解三代投机解码方法、数学无损保证与边界条件。
iOS CoreML/Metal、Android NNAPI/Hexagon、跨平台 PyTorch Mobile/TFLite——把模型塞进 iPhone 与 Android 的内存、功耗、散热三重约束里。本文拆解模型转换、量化、NPU 加速与移动端 LLM 现状。
纯 C++ 实现的 LLM 推理框架,靠 GGUF 文件格式与 k-quants 块量化,把 Llama-70B 塞进 MacBook Pro 跑出 10 tokens/s,是端侧 LLM 与"消费级硬件玩大模型"的事实首选。
ONNX Runtime 把"模型即文件"做到了极致——一个 .onnx 文件在 CPU、CUDA、DirectML、CoreML、QNN 上跑得起来,靠的是 Execution Provider 机制与一套严格的图优化管线。本文拆解 ONNX IR、EP 机制、GRPO 优化器与跨框架工具链。
Intel 自家 CPU/iGPU 推理优化引擎,用 Model Optimizer 转 IR、AVX512/AMX 指令深度调优,NNCF 一站式 INT8 量化,是 Intel 服务器上"零成本即可上手"的推理首选。
NVIDIA 自家的 GPU 推理优化引擎,通过图融合、kernel auto-tuning 与 INT8/FP8 量化,把训练框架的"通用计算"打磨成"GPU 上的极致吞吐"。本文拆解 Builder/Engine/Runtime 三段式流水线、INT8 calibration、Plugin 接口与 torch_tensorrt 集成。
NVIDIA 在 TensorRT 之上为 LLM 推理专门打造的扩展,集成 In-Flight Batching、Paged KV Cache、FlashAttention、FP8 等优化,是 H100 上 LLM 推理的旗舰栈。本文拆解 build 流程、调优开关、与 vLLM 的对比与 Triton 部署。
NVIDIA 开源的多框架、多模型、多后端推理服务器,是 LLM 与传统模型上线到生产的事实标准。本文拆解 Backend 概念、config.pbtxt、并发执行、动态批处理、模型仓库、Prometheus 指标与 KServe 集成。
UC Berkeley 2023 年开源的 LLM 推理引擎,用 PagedAttention 把 KV Cache 像虚拟内存一样分页管理,配合 continuous batching 让 Llama-65B 的吞吐直接涨一个量级。本文拆解 PagedAttention、prefix caching、量化支持、与 SGLang/TGI 的对比。
为什么做推理加速与部署也要读论文?本文说清三类论文的不同价值,按目标给出三条入门路线,介绍本站论文栏目五部分导航,并附一条读论文最重要的一条建议。
从 FlashAttention 到 DeepSeek-V3,逐篇精读改变推理加速与部署领域的十篇经典论文:背景、机制、实验、启示,并附三遍读论文法与十篇论文背后的共同规律,助你建立推理论文阅读坐标系。
把推理加速与部署领域 2014–2025 关键论文按主题分组排成一张可检索的地图,覆盖算子优化、量化、服务系统、投机解码、分布式训练推理、端侧部署六大主题,附范式迁移时间轴与按任务查论文索引。
推理加速前沿每周都在变化:本文给出用 arXiv、系统顶会与开源仓库追踪研究的方法,拆算子层、服务系统、投机解码、量化、架构创新与硬件代际六条主线,并诚实评估未解难题,助你选择深耕方向。
读推理论文的方法论手册:怎么读论文里的 speedup 与 profile 图、怎么用红旗信号判断论文好坏,以及 12 个高频问题的逐条解答——读不懂、记不住、找不到相关论文、读不完,都有具体对策。
推理论文海量且艰深,盲目开卷只会劝退。本文给出三条路径——工程师入门线、系统精进线、研究者线,并附三遍阅读法,帮你按目标选路线、按节奏读论文。
推理部署项目失败很少因为引擎不够先进,更多死于设计错误。本文提炼十二条推理部署设计原则:延迟优先 vs 吞吐优先、显存预算、流式优于等结果、三层查瓶颈、量化看激活异常值、投机解码看 batch、灰度先 5%、监控 KV 命中率、故障演练、端到端基准等。
量化前后精度没对齐、预处理与训练不一致、单 batch 测延迟当生产、KV cache 估算错、GPU 利用率当唯一指标、投机解码在大 batch 用……本清单覆盖推理部署 15 个高频陷阱,每个给出症状、根因、修复与相关页链接,附一张可勾选自检清单。
用 Llama-2-7B 走通从 PyTorch 直接推理、vLLM 替换到 AWQ 量化 + EAGLE 投机解码 + Triton 部署的三版渐进路线,每版给出可执行命令、观测指标、目录结构与性能对比,是推理部署方向最浓缩的端到端动手项目。
LLM 推理调参清单与性能调优实战:max_num_seqs、max_model_len、gpu_memory_utilization、block_size、swap_space、prefix_caching、chunked_prefill、tensor_parallel_size 八大参数详解,配 nvidia-smi、Nsight Systems、PyTorch Profiler 的瓶颈诊断方法与 compute-bound vs memory-bound 的应对策略。
把 v1→v2→v3 的部署优化拆成六版(v0 baseline → v1 KV cache → v2 continuous batching → v3 INT4 → v4 speculative decoding → v5 Triton + autoscale),每一版只加一项优化,给出 diff-style 代码与对应基准数据,便于逐项学习。
推理优化的数字怎么测、怎么报、怎么防作弊?本文给出 LLM 推理基准测试方法论:测什么(吞吐/TTFT/TPOT/p99/显存)、用什么测(vLLM offline / mlperf-llm / sglang bench / lm-eval-harness)、怎么控制变量、怎么写报告,附防作弊清单与报告模板。
vLLM、SGLang、TensorRT-LLM、TGI、Triton、ONNX Runtime、OpenVINO、llama.cpp、TFLite 怎么选?本文从模型类型、硬件、部署形态、性能目标、团队能力五个维度出发,给出九大引擎横向对比表与 LLM 在线、经典模型服务、端侧三大场景的选型决策。
推理部署方向五个拿得出手的作品集项目:RAG 推理服务、多模型路由、流式对话 API、量化模型对比 benchmark 平台、端侧 LLM App。每个项目给出动机、技术栈、产出物与可拿出来说的卖点。
推理加速岗面试全景与高频真题解析:十类轮次、28 道题覆盖性能指标、量化、KV cache、批处理、算子、服务编排、投机解码、分布式、硬件与系统设计,附手撕 KV cache 草稿与「不知道」话术和 1 周/1 个月冲刺清单。
推理加速岗位的全景图:从硅谷到国内,引擎工程师、系统工程师、Infra 工程师、算子工程师、端侧工程师等七类岗位的职责、能力模型与薪资水位,配三角色画像与 career 模块四页使用地图。
推理部署岗简历不是经历流水账,而是"性能数据 + 系统理解 + 工程能力"三要素的证据链。本文给 JD 能力对标法、STAR 法部署版项目写法、6 个项目重写范例、技术栈分层策略与十大致命反例,并附可直接套用的简历模板骨架。
精选国内外大厂在招推理加速岗位的真实 JD 拆解,覆盖字节豆包、阿里 PAI、华为昇腾、OpenAI、Anthropic、Meta、NVIDIA、Groq 等 14 条岗位,提炼高频技能词频表并映射到本站学习页面,帮助你从 JD 反推学习计划。
把推理部署 JD 里"熟悉 vLLM""了解 CUDA""有量化经验"翻译成可逐项复习的知识点清单。三层能力结构 L1 基础 / L2 主题 / L3 高阶 + 五档自评表,从"没听过"到"能讲透"逐项打分,自动生成属于你自己的补课路线图。
推理加速的基准数据与工具档案:MLPerf Inference 4.1/5.0、vLLM/SGLang/TensorRT-LLM 公开 benchmark、各 GPU 上 LLM 吞吐延迟数据、INT8/INT4/FP8 对比、引擎对比、benchmark 工具速查。
从 vLLM 到 TensorRT-LLM、从 FlashAttention 到 PagedAttention、从 CUDA Mode 到 CMU 15-819:一份按主题组织、官方链接逐一核验的大模型推理加速与部署学习资源地图。
推理加速领域的核心术语表:基础概念、性能与指标、显存与算力、量化与压缩、算子与图、系统与服务、硬件七组共 70+ 术语的准确定义与辨析。
推理加速硬件体系结构:GPU/SM/Tensor Core、NVIDIA 三代数据中心卡 A100/H100/H200/B200 显存带宽算力功耗对比、消费卡对比、AMD MI300X、Apple Silicon、昇腾 910B、Intel AMX、NPU,及训练/推理选型逻辑。