外观
模块导读与岗位版图
先记住这一页的一句话:career 模块解决两件事——先看清推理部署市场上有多少岗位、各要什么,再照着差距准备自己。 本文是这两件事的导航图:岗位版图给你市场信息,三角色画像帮你定位,内容地图告诉你去哪四页深挖。
求职最怕的顺序错误是"先努力、再定位":闷头刷了三个月 CUDA 编程,回头发现目标岗位其实在招 vLLM 二次开发。career 模块把你拉回正轨——先做信息工作,再做学习工作。推理部署岗位的技能半径比传统 ML 更宽(横跨系统、算子、服务、硬件),更不允许"先学再定位"。
一、模块定位:看清市场,然后准备自己
整个模块的四篇正文串成一条求职流水线,每一站的产出是下一站的输入:
你的处境:想在推理加速 / 模型部署方向求职 / 转岗 / 跳槽
│
▼
┌─────────────────────────────────────────────────┐
│ ① 看清市场 ── JD 清单 │
│ 市场上在招什么岗?字节、阿里、OpenAI、Groq…… │
│ JD 里反复出现的 vLLM / TensorRT / CUDA 是什么 │
│ 薪资区间、级别门槛、加分项权重 │
└─────────────────────────────────────────────────┘
│
▼
┌─────────────────────────────────────────────────┐
│ ② 看清自己 ── 能力地图 │
│ 把 JD 技能词映射成「会 / 不会 / 半会不会」, │
│ 生成 L1→L2→L3 的补课路线,而不是从头通读 │
└─────────────────────────────────────────────────┘
│
▼
┌─────────────────────────────────────────────────┐
│ ③ 包装自己 ── 简历分析 │
│ 按面试官视角重写项目经历:突出延迟、吞吐、 │
│ batch 规模、加速比、踩过的坑 │
└─────────────────────────────────────────────────┘
│
▼
┌─────────────────────────────────────────────────┐
│ ④ 证明自己 ── 面试题库 │
│ 性能指标 / 量化 / KV cache / 投机解码 / │
│ 系统设计 / 手撕 KV cache 草稿,自测用 │
└─────────────────────────────────────────────────┘这套顺序不是本站发明的,而是求职冲刺线的主线设计:以终为始,从 JD 和面试题倒推学习内容,不求全面,只求高频考点全部覆盖。时间只有两三周就跟着这条主线走;时间充裕,就把主线与本站「导读 → 核心知识 → 案例 → 实践」的常规路径交叉推进。
与其它模块的关系
career 模块不重复讲知识,它只做两件事:市场信息 + 求职方法。概念性的东西去什么是推理理清边界,去术语表查定义。求职阶段最容易犯的错是把时间花在"再学一章 CUDA"而不是"整理已会的 PagedAttention"——career 模块正是为后者设计的。
二、岗位版图:七类推理部署岗全景
先看总表,再逐个拆。请注意:本节岗位分类是按"职责性格"而非"招聘标题"——同一类岗位在不同公司可能挂着完全不同的名字。
| 岗位 | 英文常用名 | 一句话定位 | 主要产出 |
|---|---|---|---|
| 推理引擎工程师 | Inference Engine Engineer | 在 vLLM / TensorRT-LLM / SGLang 上做二次开发 | 引擎 patch、自定义算子、调度策略 |
| LLM 系统工程师 | LLM Systems Engineer | 把开源 LLM 部署成稳定服务 | 上线模型、扩缩容、监控告警 |
| 推理优化工程师 | Inference Optimization Engineer | 性能调优、量化、算子选型 | 延迟降一半、吞吐翻倍的 case |
| ML Infra / MLOps 工程师 | ML Infra / MLOps Engineer | 模型服务化、CI/CD、平台化 | 模型平台、推理网关、灰度系统 |
| 算子工程师 | Kernel Engineer | CUDA / Triton 手写核 | 自定义 attention / quantization kernel |
| 端侧推理工程师 | Edge Inference Engineer | 移动 / 嵌入式 / 浏览器推理 | llama.cpp / MLC / WebGPU 部署 |
| 推理框架研发 | Inference Framework R&D | 引擎本身的架构与演进 | 新调度算法、新内存管理、新执行模式 |
薪资数字怎么读(请务必先看这一条)
本节薪资为撰写时(dataAsOf: 2026-08)基于招聘平台公开信息、levels.fyi 等第三方统计的粗粒度综合区间,只做选方向时的量级参考,不构成精确报价。「国内一线城市」指北京、上海、深圳、杭州等地的全职年薪(人民币,覆盖常见水平);「海外」以美国科技公司为主(美元)。推理部署岗薪资的两极分化比传统 ML 更显著:能改 vLLM 源码的引擎工程师稀缺度极高,单纯会部署调用的工程师则面临薪资天花板。同岗位薪资因学历、经验、公司、面试表现可相差 2–3 倍;超过一个季度请当趋势参考,精确数字以实际 offer 和最新统计为准。
1. 推理引擎工程师 —— 引擎的"二次开发者"
国内大厂与前沿实验室最稀缺的岗位之一。职责是在开源推理引擎(vLLM / TensorRT-LLM / SGLang / LMDeploy)的源码层做改造:打 patch 加自定义 attention 变体、扩展调度策略、对接新模型结构、修复特定 shape 下的性能崩坏。它要求你真的读过 vLLM 的 scheduler 源码、知道 PagedAttention 的 block table 是怎么维护的,而不是只会 python -m vllm.entrypoints.api_server。
- 核心技能:Python 工程级 + C++ 系统级、PyTorch 内部机制(autograd / dispatch)、至少一个推理引擎的源码阅读经验、CUDA 基础、Linux 性能分析(perf / nsys / Nsight Compute)。
- 典型薪资:国内一线城市约 50–120 万/年(大模型创业公司核心部门溢价明显);海外约 20–40 万美元/年(OpenAI / Anthropic / Meta Infra 这类团队的 L5+)。
- 与本站对应:源码级理解见vLLM、TensorRT-LLM、投机解码;调度与 batching 见批处理与调度。
2. LLM 系统工程师 —— 把模型变成服务
与引擎工程师常被混淆,但分工不同:引擎工程师改源码,系统工程师用现成引擎把模型部署成稳定服务。职责包括模型加载与权重管理、推理服务封装(FastAPI / Triton)、扩缩容与流量调度、监控告警(TTFT / TPOT / queue length)、版本发布与灰度、成本核算与 GPU 利用率优化。它是 SRE 与 ML 工程师的交叉岗。
- 核心技能:Python + Go(部分团队)、Kubernetes 与容器编排、Triton / vLLM / TGI 服务化、Linux + 网络、可观测性(Prometheus / Grafana / OpenTelemetry)、GPU 资源管理。
- 典型薪资:国内一线城市约 40–80 万/年;海外约 15–28 万美元/年。
- 与本站对应:服务化与编排见模型服务、Triton 推理服务;分布式推理见分布式推理。
3. 推理优化工程师 —— 找瓶颈、改算子、写量化
聚焦"性能"二字的岗位。职责是定位推理瓶颈、选择并实施优化手段:算子融合、KV cache 优化、量化(INT8 / FP8 / INT4 weight-only)、speculative decoding、CUDA Graph 捕获、 batching 策略调优。它要求既能用 Nsight 找瓶颈、又能下到 CUDA 层写或改 kernel,是"系统工程 + 算子能力"的复合岗。
- 核心技能:性能分析工具链(Nsight Systems / Compute / PyTorch Profiler)、量化方法(GPTQ / AWQ / SmoothQuant)、CUDA / Triton 算子开发、batching 策略(continuous / in-flight batching)、加速比测量与归因。
- 典型薪资:国内一线城市约 50–100 万/年;海外约 18–32 万美元/年。
- 与本站对应:性能分析见延迟与吞吐、内存与带宽、Roofline 模型;优化手段见量化、权重-激活混合精度、算子融合、图优化。
4. ML Infra / MLOps 工程师 —— 平台与流水线
为算法团队提供"模型到生产"的基建。职责是模型仓库、训练 / 推理 pipeline、特征平台、实验管理、灰度与回滚、成本与配额管理。这个岗位的推理部署部分主要负责多模型调度、模型版本管理、推理网关,而非单模型极致优化——后者交给推理优化工程师。
- 核心技能:Python + Go、Kubernetes、Kubeflow / MLflow / Weights & Biases、Triton / vLLM 服务层、CI/CD(GitLab CI / Argo Workflows)、IaC(Terraform)、GPU 调度(Volcano / Run:AI)。
- 典型薪资:国内一线城市约 40–80 万/年;海外约 15–28 万美元/年。
- 与本站对应:见模型服务、批处理与调度、GPU 优化原理。
5. 算子工程师 —— 在 CUDA 层抠纳秒
专门写 CUDA / Triton / CUTLASS 核的岗位,多见于大模型团队的基础设施组、芯片公司的 SDK 团队、自动驾驶 / 多模态团队的推理组。职责是手写或优化 FlashAttention 变体、量化 kernel、GEMM、reduction、scan 等;要求能读 Nsight Compute 报告、懂 Tensor Core / WGMMA / TMA 指令、能对着 PTX 汇编反推瓶颈。
- 核心技能:CUDA / C++ / CUTLASS、Triton(OpenAI / Triton-Lang)、PTX / SASS 阅读能力、Tensor Core 编程(mma / wgmma)、TMA(Hopper+)、算子融合策略、内存对齐与 bank conflict。
- 典型薪资:国内一线城市约 60–150 万/年(H100 级算子工程师在头部公司薪资极溢价);海外约 22–45 万美元/年(NVIDIA CUDA 团队、Groq、硬件创业公司)。
- 与本站对应:见GPU 优化原理、算子融合、图优化、硬件入门。
6. 端侧推理工程师 —— 把 LLM 装进手机
2024 年后随开源小模型(Phi-3、Qwen2.5-0.5B/1.5B、Llama-3.2-1B/3B)成熟而新增的岗位。职责是在手机 / 嵌入式 / 浏览器跑 LLM:llama.cpp 移植、MLC-LLM 编译、WebGPU / Vulkan 后端、Apple Silicon 的 Metal、ARM CPU 的 NEON 优化。要求"算子级理解 + 端侧工程"双能力。
- 核心技能:C / C++(嵌入式级)、llama.cpp / ggml 源码、MLC / Apache TVM、Metal / Vulkan / OpenCL / WebGPU、ARM NEON / SVE、模型量化(INT4 / INT8 / INT4 group-wise)。
- 典型薪资:国内一线城市约 35–70 万/年(手机厂商 / 算法创业公司);海外约 14–25 万美元/年(Apple ANE 团队、Google Pixel、Meta Llama On-Device)。
- 与本站对应:见llama.cpp、移动端部署、量化。
7. 推理框架研发 —— 写下一个 vLLM
少见但顶级岗位:负责推理框架本身的架构与演进,多见于 vLLM / SGLang / LMDeploy / TensorRT-LLM 的核心团队、OpenAI Triton Inference 团队、Anyscale / Modal / Together AI 的平台团队。职责包括设计新调度算法、新内存管理、新执行模式(如 Chunked Prefill、Disaggregated Prefill / Decode)、跨硬件抽象层。这是"研究 + 工程 + 系统"三位一体岗。
- 核心技能:分布式系统原理、C++ / Rust / Python 全栈、CUDA / ROCm / TPU 抽象层、注意力机制前沿(FlashAttention-3、Mamba、Hybrid)、调度算法、论文阅读与复现。
- 典型薪资:国内一线城市约 80–200 万/年(创业公司核心 + 期权);海外约 30–60 万美元/年 + 期权(OpenAI / Anthropic / Anyscale 等)。
- 与本站对应:见分布式推理、批处理与调度、核心论文、前沿论文。
三、岗位技能雷达图:系统 · 算子 · 硬件 · 工程
把七类岗位放进四个维度的坐标系,差异更直观。四个维度定义:
系统(调度 / 内存 / 服务 / 分布式)
▲
/|\
│
算子 ──────────┼────────── 硬件
(CUDA / Triton / │ (GPU 架构 / Tensor Core /
FlashAttention / │ TPU / HBM / NVLink)
量化 kernel) │
│
\|/
工程(CI/CD / K8s / 监控 / 协作)各维权重 1–5 表示(1 = 基本不需要,5 = 岗位核心能力):
| 岗位 | 系统 | 算子 | 硬件 | 工程 | 岗位性格 |
|---|---|---|---|---|---|
| 推理引擎工程师 | 5 | 4 | 3 | 3 | 引擎内核型 |
| LLM 系统工程师 | 4 | 2 | 2 | 5 | 部署运维型 |
| 推理优化工程师 | 4 | 4 | 4 | 3 | 性能调优型 |
| ML Infra / MLOps | 3 | 2 | 2 | 5 | 平台基建型 |
| 算子工程师 | 3 | 5 | 5 | 2 | 内核深挖型 |
| 端侧推理工程师 | 3 | 4 | 4 | 3 | 端侧综合型 |
| 推理框架研发 | 5 | 4 | 4 | 3 | 框架架构型 |
用这张表怎么选
不要只盯"哪行数字最大",要看哪一列你能接受长期深耕:系统强的人耐得住调度算法的细节、算子强的人享受对着 PTX 推纳秒、工程强的人需要看到服务稳定跑起来的踏实、硬件强的人享受对着架构图推算带宽。把"我更愿意长期做哪类工作"排在"哪个岗位更热门"前面。算子工程师薪资高但路径窄,MLOps 岗位多但天花板低——这条权衡要诚实面对。
四、三种典型角色画像
读 JD 容易,但"做完这份工作到底是什么体验"难想象。下面给三个典型画像,把岗位的差异具象到日常。
画像 A:引擎工程师 · Lin
Lin 在某大模型创业公司做推理引擎工程师,3 年经验,从 PyTorch 后端转来。早上 10 点到公司,先看昨夜的 vLLM 性能 benchmark 报告:Qwen2.5-72B 在 4×H100 上的 TTFT 比上周慢了 8%。她打开 Nsight Systems trace,发现是新加的一个 attention 路径没走 FlashAttention-3,下午就给 vLLM 提了一个 PR,把 flash_attn_varlen_func 换成了 flash_attn_3_varlen_func,附带一组对比 benchmark。晚上 9 点,CI 跑完,合并到内部 fork。她的周报里永远有"延迟从 X 降到 Y"这种数字。
她读过的代码量比写过的多得多——vLLM 的 scheduler、block manager、model runner 加起来上万行,她能讲清楚"一次 forward 里 GPU 上发生了什么",从 H2D 拷贝到 kernel launch 到 attention 到 all-reduce。她的简历亮点是:"为 vLLM 贡献过 6 个 PR,其中 PagedAttention 的 block_table 索引优化将 72B 模型 TTFT 降低 18%"。
画像 B:系统工程师 · Wei
Wei 在某互联网大厂的 LLM 平台组做系统工程师,5 年经验,从传统 Web 后端转来。他不改 vLLM 源码,但负责把 40+ 个开源 / 自研模型部署成可调用服务。他的日常是看 Grafana 看板:每个模型的 QPS、P99 延迟、GPU 利用率、queue 积压。某天 Llama-3.1-70B 服务的 P99 突然飙到 8 秒,他半小时内定位是某条 prompt 长度 28k 触发了 prefill 阶段的显存抖动,扩了两个副本并加了 max_num_batched_tokens 限制,恢复到 1.2 秒。
他最熟练的工具是 Helm、ArgoCD、Triton Server 的 model repository 配置、vLLM 的 --gpu-memory-utilization 调参。他的简历亮点是:"搭建支持 1000+ QPS 的多模型推理平台,灰度发布机制支持 5% 流量灰度 30 分钟无回归即全量;GPU 利用率从 38% 提升到 71%"。
画像 C:Infra 工程师 · Sam
Sam 在某硅谷大厂做 ML Infra,6 年经验,从 SRE 转 MLOps。他不直接管模型,管的是"算法工程师能不能把模型推到生产"。日常是写 Argo Workflows 模板、维护模型仓库 API、跟算法团队对接新模型上线的需求、跑成本核算月会向老板汇报"这个月 GPT-4o 调用花了 80 万美元,我们用 Qwen2.5-72B 替换了其中 30% 流量,省了 24 万"。他的代码大部分是 Go,少部分是 Python glue code。
他熟的不是 vLLM 源码,而是 Triton Inference Server 的 model.json、KServe 的 InferenceService CRD、Kubeflow 的 pipeline DSL。他的简历亮点是:"设计并落地多模型推理网关,支持 200+ 模型版本灰度;构建 GPU 配额与计费系统,覆盖 4 个业务线、月度 GPU 成本下降 22%"。
三个画像的共通点
三个人简历里的共同关键词都是数字:延迟降低 X、吞吐提升 Y、成本节省 Z、GPU 利用率从 A 到 B。推理部署岗的简历不带数字等于没写——这是它与算法岗最大的区别。算法岗还能讲"AUC 提升 3 个点",部署岗不讲数字就只剩"用过 vLLM",这在面试官眼里约等于没经验。具体方法见简历分析。
五、你该选哪个方向:决策清单
按下面三组清单逐项自问,勾出的答案会收敛到一两个岗位。
1. 按背景:你现在站在哪?
- [ ] Python / PyTorch 工程背景,写过训练 pipeline → 优先 推理引擎工程师 / 推理优化工程师
- [ ] C / C++ / 系统编程背景,写过网络或存储服务 → 优先 LLM 系统工程师 / 算子工程师
- [ ] SRE / DevOps 背景,熟 Kubernetes → 优先 ML Infra / MLOps 工程师
- [ ] 嵌入式 / 移动开发背景,写过 ARM NEON → 优先 端侧推理工程师
- [ ] CUDA / 高性能计算背景,写过 GEMM 或 reduction → 优先 算子工程师 / 推理框架研发
- [ ] 算法工程师背景,想转工程方向 → 推理优化工程师是过渡最自然的岗位
2. 按兴趣:你享受哪种"完成感"?
- [ ] "我把 vLLM 的某个 bottleneck 改成了 X 倍速" → 引擎 / 优化方向
- [ ] "我们的服务 99.99% 可用,全年没出过 P0" → 系统工程师 / MLOps
- [ ] "我对着 SASS 反汇编看到一个 bank conflict,改成 coalesced 后快了 20%" → 算子工程师
- [ ] "我把 1.5B 模型塞进手机,离线能跑 15 token/s" → 端侧推理
- [ ] "我设计的调度算法让集群吞吐提升 40%" → 推理框架研发
3. 按趋势:你愿意为确定性付出多少?
推理部署岗的市场结构正在快速变化,几个值得纳入决策的事实(截至 dataAsOf: 2026-08):
- 大模型推理优化岗位需求井喷:2023 年 vLLM / TensorRT-LLM 成熟后,所有大模型团队都需要至少一名会改引擎的工程师,全国年新增岗位估算在数千量级;
- 算子工程师薪资涨幅领先:随 H100 / H200 / B200 部署规模扩大,懂 Tensor Core / TMA / FP8 的算子工程师薪资年涨幅 15–25%;
- MLOps 岗位标准化、薪资趋稳:MLOps 工程师需求大但门槛相对低,薪资天花板逐渐清晰;
- 端侧推理岗尚未规模化:手机端 LLM 仍在早期,岗位数量小于服务端;
- 国产芯片推理岗崛起:华为昇腾、摩尔线程、壁仞、海光等厂商在 2025 年后开始规模招推理部署工程师,岗位增长快但生态不如 NVIDIA 成熟。
把三组结果合起来看:三个指向同一个方向就果断选它;方向打架时,用「背景兜底、兴趣定远、趋势加权」排优先级——背景决定你能不能进门,兴趣决定你能走多远,趋势只决定门口挤不挤。
别把"岗位名"当身份
同一个名字在不同公司做的事可能完全不同:A 厂的"推理优化工程师"可能天天改 CUDA kernel,B 厂的同名岗位可能天天调 vLLM 参数。读 JD 永远比读岗位名重要——这就是为什么本模块的第一页是JD 清单,而不是"岗位百科"。
六、本模块内容地图:四页各干什么
career 模块共四篇正文,对应求职流程的四个动作:
| 页面 | 一句话定位 | 什么时候用 |
|---|---|---|
| JD 清单 | 汇总国内外大厂在招推理部署岗位的真实 JD,拆解高频要求与门槛 | 求职第一天:先知道市场要什么 |
| 能力地图 | 把 JD 技能词映射到本站页面,生成 L1→L3 个人补课清单 | 摸清市场后:定位自己的差距 |
| 简历分析 | 面试官视角的简历审查标准,含 5–8 个项目经历改写示例 | 准备投递时:把经历变成证据 |
| 面试题库 | 高频考点问答 + 答题框架,配合自测 | 面试前一周:最后自测 |
使用顺序是主线,不是选项
求职冲刺线已经把四页排成了两周主线:JD 清单 → 能力地图 → 简历分析 → 面试题库,上一页的产出是下一页的输入。跳着读会损失大半价值。
七、两点提醒
1. 先看 dataAsOf,再信数字
本模块涉及的岗位、薪资、JD 要求、技术关键词都有时效:推理部署领域半衰期很短,一个岗位的 JD 一年内可能重写两遍,Tensor Core 编程模型每代 GPU 都变。因此本模块所有含时效的页面都在 frontmatter 标注了 dataAsOf(数据截止月份),页面顶部也会显示。引用其中的具体数字之前,先看一眼那个日期:
- 距今一个季度内 → 可以当作当前参考;
- 超过一个季度 → 当作"趋势参考",并以官方来源复核;
- 概念性内容(KV cache 计算、Roofline 模型)衰减很慢,不受此约束。
2. 岗位描述 vs 实际工作:两个版本的世界
JD 是"希望你是的样子",日常工作则是"实际需要你的样子",两者存在系统性落差:
- JD 写"精通 vLLM 源码",实际可能是大量运维与故障排查——读源码只占工作的一小部分;
- JD 写"优化延迟",实际考核的是成本与可用性——降 30% 延迟但成本翻倍,业务侧不一定会满意;
- JD 写"独立负责",实际是庞大推理平台里的一环——面试时把"我负责的部分"讲清楚,远比吹"我负责整个系统"可信;
- JD 写"H100 集群经验优先",实际团队自己也才用上 3 个月——诚实讨论你对这种不确定性的理解,本身是加分项。
应对方法只有一个:面试前对目标团队做信息侦查(面经、在职者访谈、技术博客),把 JD 当作假设、用调研去验证。面试题库里有一类"反问面试官"的问题清单,正是干这个用的。
八、延伸阅读
站内继续读
- 求职冲刺线 —— career 模块所在的完整两周备战主线
- 什么是推理 —— 把"推理部署"这个概念边界切清楚
- 推理与训练的差异 —— 理解岗位独特性的关键
- 术语表 —— 读 JD 和面试题时随时回来查口径
- 硬件入门 —— 理解岗位背后的硬件约束
参考资料(真实来源,供复核薪资与趋势)
- levels.fyi —— 美国科技公司薪酬数据库,按公司/级别/城市查询,海外薪资的可靠来源
- NVIDIA Careers —— NVIDIA 招聘官网,TensorRT / CUDA 团队的岗位来源
- OpenAI Careers —— Triton Inference 等推理岗位的官方来源
- vLLM Project Contributors —— 引擎工程师招聘的"开源简历"通道
- [PaperMC / Moonshot / Zhipu Careers] —— 国内大模型创业公司的招聘页,岗位需求与薪资区间参考