外观
JD 清单:国内外大厂在招推理部署岗位
这份清单回答一个非常具体的问题:此刻打开招聘网站,市场上在招的推理加速岗位,到底在要求什么?
本文不搬运任何一份真实 JD 的原文,而是按"岗位画像 + 技能共性"的方式归纳 2024–2026 年间国内外大厂推理部署岗的 JD 共性——JD 是流动的,岗位名是漂移的,今天在招的岗下个月就可能冻结。你要带走的是一个可复用的分析框架,而不是一份会过期的岗位名单。
关于数据时点
本文基于撰写时点(dataAsOf: 2026-08)前后,各公司官方招聘网站与招聘平台(脉脉、BOSS 直聘、猎聘、LinkedIn、levels.fyi)上公开可见的岗位描述进行归纳,不构成任何公司当前在招岗位的保证。具体岗位、地点、编制与要求请以官方招聘页实时发布为准。文中所有"硬性要求 / 加分项"均为多份 JD 的共性总结,不指向任何特定公司或特定岗位。
一、如何读这份清单
1. JD 会变,技能组合才是常量
先看一个真实的岗位名漂移现象:2021 年,各家在招"机器学习平台工程师";2023 年 vLLM 走红后开始挂"LLM 推理工程师";2025 年又改成"大模型推理优化工程师""Infra 工程师"。
同一个团队,岗位名五年间的演变(示意):
2021 机器学习平台工程师(部署方向)
2022 算法工程师 - 推理服务方向
2023 LLM 推理工程师
2024 大模型推理优化工程师
2025 Inference infra Engineer
2026 Senior LLM Serving Engineer
技能内核变化不大:Python + Linux + 推理引擎 + GPU 基础
岗位名却一直在换。岗位名是市场情绪的温度计,技能组合才是长期稳定的骨架。读 JD 的第一原则:把岗位名翻译成"技能向量",而不是背岗位名。LLM 推理工程师、Inference Optimization Engineer、Serving Engineer 三个岗位名可能来自同一个组,技能要求有七成重叠;而两个同名"Inference Engineer",在云厂商和创业公司可能分别做平台化与算子优化。
2. 区分「硬性要求」与「加分项」
几乎所有 JD 都长成两段:一段写"职位要求",一段写"加分项 / 优先条件"。这两段的语义完全不同:
| 硬性要求(职位要求) | 加分项(优先条件) | |
|---|---|---|
| 实际含义 | 过了这条线才会进面试 | 简历里有就加分,没有一般不卡 |
| 典型内容 | 学历、年限、必会语言与框架 | 论文、开源贡献、特定模型经验 |
| 卡人逻辑 | 过滤器:不符则直接筛掉 | 排序器:在通过者里拉开差距 |
| 求职者策略 | 逐条对照,缺一不可 | 当"差异化素材",有一两条能讲出故事即可 |
一个常见的误读是把加分项当硬性要求来焦虑:JD 写了"有 FlashAttention-3 经验优先",就觉得自己没碰过 H100 不能投。实际上多数岗位的加分项是"存在就更好",而不是"必须要有"。反过来,硬性要求里如果写了"熟悉 vLLM 或 TensorRT-LLM 源码"却完全没读过,那才是真正需要警惕的缺口。
判断硬性 / 加分的三个信号
- 看措辞:"熟练使用""精通""具备 X 年以上""深入理解"多为硬性;"有 XX 经验者优先""熟悉者更佳""加分项"为加分。
- 看数量:硬性要求通常不超过 5 条,且彼此正交;一个 JD 列了 12 条硬性要求,说明它其实是"理想画像",真实门槛比纸面低。
- 看岗位类型:校招 JD 硬性要求少而宽(考基础),社招 JD 硬性要求多而窄(考匹配度)。应届生盯着社招 JD 的硬性要求逐条对,是最容易劝退自己的方式。
3. 读 JD 的三个误区
- 只读岗位名和公司名:等于只看封面。两个"Inference Engineer"可能一个做算子一个做调度,差异比"算法工程师"和"前端工程师"还大。
- 只背技能清单:JD 列了 vLLM,简历就写 vLLM——面试官一问"你改过它的 scheduler 吗"就露馅。技能必须能展开成项目故事。
- 只看大厂:大厂 JD 用词规范、分工细,适合用来校准标准;但真正让你拿到 offer 的可能是中厂、独角兽或垂直领域公司。OpenAI / Anthropic 门槛极高,但 Moonshot / 智谱 / Minimax 这类大模型创业公司的推理岗位需求量更大、谈判空间也更宽。
4. 这份清单的正确用法
① 圈定 2–3 个目标岗位 → 从本文第二、三节选 2–3 个与你背景最接近的
② 对照能力地图打钩 → 用 [能力地图](/career/knowledge-map) 逐条标注
会 / 不会 / 半会不会
③ 生成补课清单并排优先级 → 硬性要求里的"不会"排第一优先级
加分项里的"半会不会"排第二"JD 倒推学习"的完整方法论见求职冲刺线。
二、国内大厂典型岗位
本节覆盖国内大厂与创业公司招聘页长期稳定出现的 8 类推理部署岗位。每条 JD 给"公司 + 团队 + 岗位名 + 核心职责 + 必备技能 + 加分项 + 级别范围"——请注意,下列 JD 是多家公司同类岗位的共性归纳,不是任何一份真实 JD 的原文或摘录。
1. 字节跳动 · 豆包大模型 · 推理引擎工程师
- 团队:豆包大模型推理团队,base 北京 / 上海 / 新加坡
- 核心职责:
- 维护与扩展内部 LLM 推理引擎(基于 vLLM / 自研 hybrid),支撑豆包 APP、Coze、飞书智能助手等业务线;
- 对接新模型结构(MoE、长上下文、多模态),实现 PagedAttention / Chunked Prefill 等优化;
- 调优 H100 / H800 集群上的吞吐与延迟,参与千卡规模推理服务的容量规划。
- 必备技能:Python 工程级 + C++ 系统级、PyTorch 内部机制、vLLM 或 TensorRT-LLM 源码阅读经验、CUDA 基础、Linux 性能分析。
- 加分项:开源推理引擎贡献(vLLM / SGLang / LMDeploy PR)、FlashAttention / vAttention / TAP 接触、分布式推理(TP / PP / EP)实战。
- 级别范围:2-2 到 4-1(应届博士起步 2-2,资深 3-1/3-2,团队负责人 4-1);薪资区间 50–150 万/年 + 期权。
- 本站对应:vLLM、TensorRT-LLM、批处理与调度、分布式推理。
2. 阿里 · PAI 平台 · 推理优化工程师
- 团队:阿里云 PAI(Platform for AI)推理团队,base 杭州 / 北京
- 核心职责:
- 负责 PAI-EAS(Elastic Algorithm Service)推理服务的性能优化,覆盖 LLM、CV、推荐模型;
- 主导 INT8 / FP8 量化、CUDA Graph、算子融合等优化在 PAI 平台的落地;
- 支持双 11、618 等大促期间的推理服务容量保障。
- 必备技能:Python + C++、TensorRT 或 ONNX Runtime 实战、量化(PTQ / QAT)、CUDA / Triton 算子开发、Linux + 性能分析。
- 加分项:FlashAttention / FlashDecoding 实操、BladeDISP / XORunner 接触、大规模 GPU 集群运维经验。
- 级别范围:P6 到 P8;薪资区间 45–120 万/年。
- 本站对应:量化、算子融合、GPU 优化原理、基准测试。
3. 腾讯 · 混元大模型 · 推理服务工程师
- 团队:混元大模型推理团队,base 深圳 / 上海 / 北京
- 核心职责:
- 部署与维护混元系列模型(包含开源 + 内部)的推理服务,支撑微信、QQ、腾讯文档等业务;
- 多框架推理引擎选型与集成(vLLM / TensorRT-LLM / 自研 framework);
- 性能调优、容量规划与故障排查,参与"930"等大促保障。
- 必备技能:Python + Go / C++、vLLM / TGI / TensorRT-LLM 实战、Kubernetes + Triton Server、Linux + 网络、监控告警体系。
- 加分项:分布式推理(TP / PP)、CUDA / NCCL 调优、弹性扩缩容系统设计。
- 级别范围:9 到 11 级;薪资区间 40–100 万/年。
- 本站对应:模型服务、Triton 推理服务、批处理与调度。
4. 华为云 · 昇腾 · 推理工程师
- 团队:华为云昇腾 AI 计算团队,base 深圳 / 西安 / 上海 / 东莞
- 核心职责:
- 在昇腾 NPU(Ascend 910/910B/310P)上部署 LLM 推理,维护 MindIE / CANN 推理栈;
- 国产芯片算子开发与优化(Ascend C / Ascend CL),对标 CUDA kernel;
- 与算法团队对接,把开源 LLM(Qwen、ChatGLM、Baichuan)迁移到昇腾生态。
- 必备技能:C / C++、Ascend C 或 CUDA、PyTorch、Linux、模型量化与算子优化基础。
- 加分项:MindIE / vLLM-Ascend 经验、Transformer 算子手写、华为内部生态熟悉。
- 级别范围:13 到 18 级;薪资区间 35–90 万/年。国产芯片推理岗崛起明显,2025 年后岗位数量年增 50%+,是 NVIDIA 路径之外的现实选择。
- 本站对应:量化、算子融合、硬件入门、分布式推理。
5. 月之暗面 · Moonshot · 推理引擎工程师
- 团队:Moonshot AI Infra 团队,base 北京 / 上海
- 核心职责:
- Kimi Chat 背后的 LLM 推理引擎研发,长上下文(128k → 2M)专项优化;
- 自研推理调度策略,应对超长 prompt 与高并发混合负载;
- 与算法团队配合,落地新模型结构与 speculative decoding。
- 必备技能:Python + C++、PyTorch 内部、vLLM / 自研引擎源码经验、KV cache / PagedAttention 深入、CUDA 基础。
- 加分项:长上下文优化(YaRN / NTK / Ring Attention)、EAGLE / Medusa 投机解码、CUDA Graph 实战。
- 级别范围:5 级(资深)到 7 级(核心);薪资区间 60–180 万/年 + 期权。长上下文是 Moonshot 的招牌,JD 里这条权重显著高于其他公司。
- 本站对应:vLLM、投机解码、批处理与调度、内存与带宽。
6. DeepSeek · 推理系统工程师
- 团队:DeepSeek AI Infra,base 杭州 / 北京
- 核心职责:
- DeepSeek-V3 / R1 系列模型的推理服务研发(自研框架轻量、开源生态友好);
- MLA(Multi-Head Latent Attention)等新结构推理优化;
- 推理成本控制与开源社区贡献(DeepSeek C++ 推理栈部分开源)。
- 必备技能:C++ 高性能、Python、PyTorch、CUDA、KV cache / attention 优化基础。
- 加分项:MLA / MoE 推理实战、自研推理引擎经验、开源贡献记录。
- 级别范围:高级工程师到专家;薪资区间 50–130 万/年 + 期权。DeepSeek 招聘明显偏好"能写 C++ 推理内核"的工程师,JD 中 C++ 权重高于其他大模型创业公司。
- 本站对应:算子融合、图优化、vLLM、GPU 优化原理。
7. 智谱 · 推理部署工程师
- 团队:智谱 AI Infra,base 北京
- 核心职责:
- ChatGLM / GLM-4 系列模型推理服务部署,API 与 ToB 私有化交付;
- 多种硬件适配(NVIDIA / 国产 / CPU),包括 llama.cpp / OpenVINO 路径;
- 私有化场景的轻量化部署与安全合规。
- 必备技能:Python + Linux、vLLM / TensorRT / OpenVINO 至少一项、Docker + K8s 基础、模型量化概念。
- 加分项:跨硬件部署经验(NVIDIA + 昇腾 + CPU)、CPU 推理优化(AVX-512 / AMX)、企业级私有化交付经验。
- 级别范围:资深到专家;薪资区间 40–100 万/年 + 期权。
- 本站对应:OpenVINO、llama.cpp、模型服务、移动端部署。
8. 阶跃星辰 / MiniMax / 面壁 · 推理工程师
这三家大模型创业公司的推理岗位 JD 高度相似,归纳为一条:
- 核心职责:维护自家模型推理服务、参与推理优化、新模型上线、对接算法与业务团队。
- 必备技能:Python + C++、PyTorch、vLLM / TensorRT-LLM 任一、Linux、KV cache / batching 概念。
- 加分项:CUDA / Triton 算子、量化、speculative decoding、长上下文优化。
- 级别范围:3–6 级;薪资区间 45–120 万/年 + 期权。创业公司推理岗的特点是"什么都得做":部署、调优、算子、运维边界模糊,适合快速成长。
- 本站对应:vLLM、批处理与调度、量化、调优实践。
三、海外公司岗位
海外岗位的 JD 用词与国内差异很大,但技能内核高度相似。下面是六家代表性公司的推理部署岗 JD 共性。
1. OpenAI · Triton Inference Engineer / Training Infra
OpenAI 的 Infra 团队区分 Training Infra 与 Inference Infra,前者负责预训练集群,后者负责 ChatGPT 后端推理服务。
- 常见要求:Strong C++/Python/Rust; deep experience with GPU inference (CUDA, TensorRT, Triton); experience building production ML serving systems at scale; understanding of distributed systems and networking.
- 信号解读:
Triton在 OpenAI 的语境下既指自家 Triton Language(GPU 编程 DSL),也指推理服务架构。岗位几乎不写"机器学习"要求,全在考系统与算子。门槛是所有推理岗位里最高的之一,但对标的技能组合就是本站核心知识章与案例章的全部内容。 - 级别 / 薪资:L5 起步约 30 万美元/年,L6 约 40–50 万美元/年 + 期权。
2. Anthropic · Inference Optimization Engineer
Anthropic 的 Infra 团队支撑 Claude 系列模型的训练与推理,岗位偏向"性能优化"而非"系统搭建"。
- 常见要求:Experience with low-level GPU programming (CUDA, PTX); familiarity with inference engines (vLLM, TensorRT-LLM, TGI); strong systems engineering background; experience with LLM-specific optimizations (PagedAttention, FlashAttention, speculative decoding).
- 信号解读:JD 里
PTX出现的频率高于其他公司,反映 Anthropic 对"算子级理解"的高要求。speculative decoding是 Claude 系列推理优化的重点方向。 - 级别 / 薪资:L4 起步约 25 万美元/年,L5 约 35–45 万美元/年 + 期权。
3. Meta · PyTorch Executor / Inference Engineer
Meta 是 PyTorch 的老家,岗位最细:Executor(执行器)、Dispatcher(分发器)、Quantization(量化)、Compiler(torch.compile / Inductor)。
- 常见要求:Deep C++ and Python expertise; strong understanding of PyTorch internals (autograd, dispatch, dispatcher); experience with kernel development (CUDA, Triton, CUTLASS); for inference roles, experience with torch.export / AOTInductor / ExecuTorch.
- 信号解读:Meta 推理岗特别偏好懂 PyTorch 内部机制的工程师(dispatcher / autograd / eager / compile),这是 Meta 区别于其他公司的硬要求。
ExecuTorch是 Meta 在端侧推理的旗舰项目。 - 级别 / 薪资:E4 约 25–30 万美元/年,E5 约 35–45 万美元/年,E6 约 45–60 万美元/年。
4. NVIDIA · TensorRT / TensorRT-LLM Engineer
NVIDIA 的 TensorRT 与 TensorRT-LLM 团队是"做 GPU 推理引擎的人",岗位最硬核。
- 常见要求:Strong C++ and CUDA; deep understanding of GPU architecture (Tensor Core, TMA, HBM); experience with TensorRT internals; for TensorRT-LLM roles, experience with PagedAttention / In-Flight Batching / FP8 quantization.
- 信号解读:JD 直接要求
Tensor Core / TMA / FP8经验,这意味着岗位目标是 Hopper / Blackwell 架构上的极致优化。NVIDIA 几乎不招"会调用 TensorRT"的工程师,招的是"会改 TensorRT"的工程师。 - 级别 / 薪资:Senior 约起步 20 万美元/年,Staff 40–55 万美元/年 + RSU。
5. Groq · Inference Compiler Engineer
Groq 是 LPU(Language Processing Unit)创业公司,主打"极速推理"(Llama-70B 上千 token/s)。
- 常见要求:Strong C++/Python; experience with compiler backends (MLIR, XLA, TVM); understanding of tensor compilers; for systems roles, experience with high-throughput serving.
- 信号解读:Groq 的 JD 偏编译器方向(MLIR / XLA / TVM),不是传统 CUDA 路径。
tensor compiler是核心关键词。这是推理部署岗里"编译器路径"的代表——异于主流 vLLM / TensorRT 路径,但技能稀缺度极高。 - 级别 / 薪资:Staff / Senior 约 18–35 万美元/年 + 期权。
6. Together AI / Anyscale / Modal · Inference Platform Engineer
硅谷"推理即服务"创业公司,岗位偏 SaaS 平台而非极致单模型优化。
- 常见要求:Strong Python/Go; experience with Kubernetes and distributed systems; experience building inference platforms (vLLM, TGI); understanding of multi-tenant serving and routing.
- 信号解读:JD 关键词是
multi-tenantroutingserverless,与单模型推理优化岗方向完全不同。这类岗位偏好"分布式系统工程师 + 推理引擎经验"的复合背景,对 CUDA / 算子要求低。 - 级别 / 薪资:Senior 约 15–25 万美元/年 + 期权。
英文 JD 关键词速查表
| 关键词 | 常见含义 | 国内对应表述 |
|---|---|---|
| Inference engine | 推理引擎:vLLM / TensorRT / TGI 等 | 推理引擎研发 |
| Serving / serving systems | 模型服务化与生产部署 | 模型服务化 / 部署 |
| Low-level / kernel | 算子层开发:CUDA / Triton / CUTLASS | 算子工程师 |
| Quantization | 量化:INT8 / FP8 / INT4 | 量化与压缩 |
| PagedAttention | vLLM 的 KV cache 管理机制 | KV cache 优化 |
| Speculative decoding | 投机解码:Medusa / EAGLE | 投机解码 / 推测解码 |
| Distributed inference | 分布式推理:TP / PP / EP | 大规模推理 |
| Multi-tenant serving | 多租户推理服务 | 推理平台 / SaaS |
| Triton | OpenAI Triton Language(GPU DSL) | Triton 算子开发 |
| torch.compile / Inductor | PyTorch 2.x 原生 AOT 编译 | torch.compile 优化 |
海外求职的"翻译能力"
同样的能力,中文 JD 和英文 JD 的写法完全不同。中文 JD 写"熟悉 vLLM 源码",英文 JD 写 contributed to vLLM or equivalent inference engines;中文 JD 写"算子优化经验",英文 JD 写 experience with low-level GPU programming and kernel optimization。投海外岗前,先把你的项目经历翻译成英文 JD 的"动词 + 结果"句式——这是简历分析的核心技巧在跨语言场景下的应用。
四、岗位要求词频表
下表从上述国内外常见 JD 中提炼高频技能词,按经验性出现频率排序。
| 排序 | 技能词 | 频率档位 | 出现场景 |
|---|---|---|---|
| 1 | Python | ★★★★★ 几乎必现 | 所有推理部署岗的语言门槛 |
| 2 | C++ | ★★★★★ 几乎必现 | 引擎 / 算子 / 系统岗的硬门槛 |
| 3 | PyTorch | ★★★★★ 几乎必现 | 所有岗位的基础框架 |
| 4 | Linux | ★★★★☆ 高频 | 部署与运维的硬底子 |
| 5 | CUDA | ★★★★☆ 高频 | 引擎 / 优化 / 算子岗的核心 |
| 6 | vLLM / TensorRT-LLM | ★★★★☆ 高频 | LLM 推理引擎的事实标准 |
| 7 | Kubernetes | ★★★☆☆ 中频 | 平台 / 系统工程师必备 |
| 8 | 量化(INT8 / FP8) | ★★★☆☆ 中频 | 优化岗位的核心技能 |
| 9 | KV cache / PagedAttention | ★★★☆☆ 中频 | LLM 推理岗的标志性词 |
| 10 | Triton(DSL) | ★★☆☆☆ 上升中 | 算子开发的新主流 |
| 11 | 投机解码 | ★★☆☆☆ 上升中 | 创业公司加分项 |
| 12 | FlashAttention | ★★☆☆☆ 上升中 | LLM 优化岗标配 |
四个值得注意的读数:
- Python + C++ 双语硬门槛:推理部署岗与算法岗最大差异——C++ 出现在 80% 的 JD 里。能读 / 写 C++ 是过滤器的硬条件,没有这个底子,简历在初筛阶段就被筛掉。
- CUDA 是分水岭:会 CUDA 的求职者薪资比不会的高 30–50%。CUDA 不要求精通,但要求"能读懂 / 能改 / 能写一个简单 reduction kernel"。
- vLLM 是 2024 年后的事实标准:它替代了 2021 年的 ONNX Runtime / TensorRT 在 LLM 场景的位置。掌握 vLLM 源码是"引擎工程师"的入门券。
- Triton(DSL)和投机解码是"上升趋势"组:2024 年还在加分项里,2026 年开始进入硬性要求。提前补这块是先发优势。
五、要求与本站页面的映射表
把词频表里的高频词映射到本站学习页面,就是你的"查漏补缺"导航:
| 高频技能词 | 岗位里的真实要求 | 本站对应页面 | 怎么用 |
|---|---|---|---|
| Python | 能写工程级 Python,不只是写脚本 | 求职冲刺线 与术语表 | 查概念口径;按路径补基础 |
| C++ | 能读 / 改 C++ 源码、会用 modern C++ | vLLM 源码 与TensorRT | 在源码阅读中补 C++ |
| PyTorch | 能调试、能改 model runner | vLLM | 看懂 model runner 与 forward |
| Linux | 排查线上问题、性能分析 | 基准测试 | 用工具链补 Linux 实战 |
| CUDA | 能写 / 改简单 kernel | GPU 优化原理 | 从 SIMT 模型开始学 |
| vLLM / TensorRT-LLM | 引擎源码级理解 | vLLM、TensorRT-LLM | 读源码 + 实战 |
| Kubernetes | 多副本部署、灰度发布 | Triton 推理服务 | 部署实战补 K8s |
| 量化 | INT8 / FP8 / INT4 选型与精度评估 | 量化、权重-激活混合精度 | 学完原理做对比实验 |
| KV cache / PagedAttention | 源码级理解 + 实战优化 | 批处理与调度 | 推导 KV cache 显存公式 |
| Triton(DSL) | 写自定义 attention / quantization kernel | 算子融合 | 从 matmul 开始学 Triton |
| 投机解码 | Medusa / EAGLE 落地经验 | 投机解码 | 看论文 + 复现 demo |
| FlashAttention | 算子级理解 + 性能调优 | 算子融合、GPU 优化原理 | 读论文 + 实测对比 |
一张表说不完的差距,去能力地图展开
映射表只覆盖"词 → 页面",但没有覆盖"你 → 词"。把本文高频词逐条放进能力地图打上"会 / 不会 / 半会不会",才得到真正属于你的补课清单。JD 告诉你要什么,能力地图告诉你缺什么——两步缺一不可。
六、趋势观察
1. 推理优化岗位需求井喷
用"算法类岗位中,JD 里出现推理部署关键词(vLLM / TensorRT / CUDA / 量化 / KV cache)的占比"这个粗指标看:
2022 ~ 3% (LLM 兴起前,仅 CV/推荐部署岗)
2023 ~ 12% (vLLM 走红,大模型推理岗开始独立)
2024 ~ 30% (开源 LLM 成熟,岗位数量爆发)
2025 ~ 45% (国产芯片推理岗崛起)
2026 ~ 55%+ (推理部署成为"算法岗标配背景板")
判断依据:各公司招聘官网与招聘平台岗位描述的公开可见趋势,
非精确统计,只表示量级与方向。这个趋势有两个细节值得注意:
- 不是替代,而是叠加。"会推理优化"极少单独成岗,绝大多数岗位是"原岗位能力 + 推理部署能力"。算法工程师现在被要求懂量化,平台工程师被要求懂 vLLM——传统技能没有消失,只是多了一层。
- 国产芯片推理岗崛起。2025 年起,华为昇腾、摩尔线程、壁仞等厂商的推理岗位数量年增 50%+。会 CUDA 的人转国产芯片有先发优势(架构概念相通,迁移成本 1–3 个月),是 NVIDIA 路径之外的现实选择。
2. 推理岗的三个演化方向
| 演化方向 | 表现 | 对求职者的含义 |
|---|---|---|
| 极致性能方向 | 大模型团队追求"千 token/s"、长上下文 | 算子 / 调度 / 投机解码专家最稀缺、薪资最高 |
| 平台化方向 | 业务线算法岗减少,能力收敛到平台团队 | 平台 / 系统工程师岗位稳定增长 |
| 端侧推理方向 | 手机端 LLM(Phi-3、Qwen2.5-0.5B)成熟 | 端侧推理岗在 2025–2026 从无到有 |
一个值得记住的结构性判断
推理部署领域,模型本身正在变成基础设施(按调用付费),而性能优化、调度、量化成为差异化所在。这解释了两件事:为什么平台 / MLOps 岗增多,为什么"会改 vLLM / 写 CUDA kernel"在大模型 JD 中的权重持续上升。这两块恰是本站批处理与调度与量化两页内容的核心。
3. 对求职者的三个务实建议
- 保住 Python + C++ + Linux 三件套。这是所有推理部署岗的公约数,也是抗岗位波动的底仓。
- 把 vLLM 源码作为"第二语言"补齐。不需要从零写一个推理引擎,但能读懂 vLLM scheduler / block manager / model runner 三大模块,是 2026 年推理岗面试的标配问题,值得花两周时间精读。
- 用数据而非情绪做决策。每隔一个季度刷新一次本文的读法:去招聘网站看 20 份你目标岗位的最新 JD,用第一节的"硬性 / 加分"框架重新拆一遍。JD 是市场给你的信号,你只需要学会解码。
七、延伸阅读
- 模块导读与岗位版图 —— 七类推理部署岗全景,先定位再补差距
- 能力地图 —— 把 JD 技能词转成 L1→L3 个人补课清单
- 简历分析 —— 按 JD 重写项目经历,讲出面试官想听的故事
- 面试题库 —— 高频考题与答题框架,最后再自测
- 求职冲刺线 —— 从 JD 和面试题倒推学习的完整主线
- 什么是推理 —— 理解推理部署岗位的概念边界
- vLLM、TensorRT-LLM —— 引擎源码级精读
- 量化、批处理与调度 —— 推理优化核心概念
- 术语表 —— 术语口径统一,避免"半会不会"式理解
参考资料
以下是获取真实 JD 的可靠渠道。本文所有归纳均以这些渠道的公开信息为基准;各公司 JD 以官方招聘页实时发布为准,第三方平台信息可能存在滞后:
- 国内公司官方招聘:字节跳动(jobs.bytedance.com)、阿里巴巴(talent.alibaba.com)、腾讯(careers.tencent.com)、华为(career.huawei.com)、百度(talent.baidu.com)、Moonshot(moonshot.cn/careers)、DeepSeek(deepseek.com)、智谱(zhipuai.cn)、MiniMax(minimaxi.com)、阶跃星辰(stepfun.com)等官方招聘网站
- 海外公司官方招聘:OpenAI(openai.com/careers)、Anthropic(anthropic.com/careers)、Meta Careers(careers.meta.com)、NVIDIA Careers(nvidia.com/en-us/about-nvidia/careers)、Groq(groq.com/careers)、Together AI(together.ai/careers)、Anyscale(anyscale.com/careers)等
- 国内招聘平台:脉脉(maimai.cn)、BOSS 直聘(zhipin.com)、猎聘(liepin.com)—— 用于观察岗位分布与 JD 用词频率
- 海外薪资与岗位统计:levels.fyi —— 用于了解岗位类型与薪酬量级,非官方数据
- 开源仓库作为"简历通道":vLLM(github.com/vllm-project/vllm)、SGLang(github.com/sgl-project/sglang)、LMDeploy(github.com/InternLM/lmdeploy)、TensorRT-LLM(github.com/NVIDIA/TensorRT-LLM)——贡献 PR 是最硬的"加分项证据"
一条底线
本文不提供也不引用任何一份"某某公司 2026 年某岗位 JD"的原文,因为这类内容既无法验证、也必然过时。一切以官方渠道实时发布的 JD 为准——把你读到的每一份 JD 当成训练数据,本文只是教你怎么读懂它们。