Skip to content

JD 清单:国内外大厂在招推理部署岗位

本页速览 精选国内外大厂在招推理加速岗位的真实 JD 拆解,覆盖字节豆包、阿里 PAI、华为昇腾、OpenAI、Anthropic、Meta、NVIDIA、Groq 等 14 条岗位,提炼高频技能词频表并映射到本站学习页面,帮助你从 JD 反推学习计划。

本页含时效性内容,数据截止于 2026-08;引擎版本、性能榜单、产品功能等信息可能已变化,引用前请核对原始出处。

JD 清单:国内外大厂在招推理部署岗位

这份清单回答一个非常具体的问题:此刻打开招聘网站,市场上在招的推理加速岗位,到底在要求什么?

本文不搬运任何一份真实 JD 的原文,而是按"岗位画像 + 技能共性"的方式归纳 2024–2026 年间国内外大厂推理部署岗的 JD 共性——JD 是流动的,岗位名是漂移的,今天在招的岗下个月就可能冻结。你要带走的是一个可复用的分析框架,而不是一份会过期的岗位名单。

关于数据时点

本文基于撰写时点(dataAsOf: 2026-08)前后,各公司官方招聘网站与招聘平台(脉脉、BOSS 直聘、猎聘、LinkedIn、levels.fyi)上公开可见的岗位描述进行归纳,不构成任何公司当前在招岗位的保证。具体岗位、地点、编制与要求请以官方招聘页实时发布为准。文中所有"硬性要求 / 加分项"均为多份 JD 的共性总结,不指向任何特定公司或特定岗位。

一、如何读这份清单

1. JD 会变,技能组合才是常量

先看一个真实的岗位名漂移现象:2021 年,各家在招"机器学习平台工程师";2023 年 vLLM 走红后开始挂"LLM 推理工程师";2025 年又改成"大模型推理优化工程师""Infra 工程师"。

同一个团队,岗位名五年间的演变(示意):

2021  机器学习平台工程师(部署方向)
2022  算法工程师 - 推理服务方向
2023  LLM 推理工程师
2024  大模型推理优化工程师
2025  Inference infra Engineer
2026  Senior LLM Serving Engineer

技能内核变化不大:Python + Linux + 推理引擎 + GPU 基础
岗位名却一直在换。

岗位名是市场情绪的温度计,技能组合才是长期稳定的骨架。读 JD 的第一原则:把岗位名翻译成"技能向量",而不是背岗位名LLM 推理工程师Inference Optimization EngineerServing Engineer 三个岗位名可能来自同一个组,技能要求有七成重叠;而两个同名"Inference Engineer",在云厂商和创业公司可能分别做平台化与算子优化。

2. 区分「硬性要求」与「加分项」

几乎所有 JD 都长成两段:一段写"职位要求",一段写"加分项 / 优先条件"。这两段的语义完全不同:

硬性要求(职位要求)加分项(优先条件)
实际含义过了这条线才会进面试简历里有就加分,没有一般不卡
典型内容学历、年限、必会语言与框架论文、开源贡献、特定模型经验
卡人逻辑过滤器:不符则直接筛掉排序器:在通过者里拉开差距
求职者策略逐条对照,缺一不可当"差异化素材",有一两条能讲出故事即可

一个常见的误读是把加分项当硬性要求来焦虑:JD 写了"有 FlashAttention-3 经验优先",就觉得自己没碰过 H100 不能投。实际上多数岗位的加分项是"存在就更好",而不是"必须要有"。反过来,硬性要求里如果写了"熟悉 vLLM 或 TensorRT-LLM 源码"却完全没读过,那才是真正需要警惕的缺口。

判断硬性 / 加分的三个信号

  1. 看措辞:"熟练使用""精通""具备 X 年以上""深入理解"多为硬性;"有 XX 经验者优先""熟悉者更佳""加分项"为加分。
  2. 看数量:硬性要求通常不超过 5 条,且彼此正交;一个 JD 列了 12 条硬性要求,说明它其实是"理想画像",真实门槛比纸面低。
  3. 看岗位类型:校招 JD 硬性要求少而宽(考基础),社招 JD 硬性要求多而窄(考匹配度)。应届生盯着社招 JD 的硬性要求逐条对,是最容易劝退自己的方式。

3. 读 JD 的三个误区

  • 只读岗位名和公司名:等于只看封面。两个"Inference Engineer"可能一个做算子一个做调度,差异比"算法工程师"和"前端工程师"还大。
  • 只背技能清单:JD 列了 vLLM,简历就写 vLLM——面试官一问"你改过它的 scheduler 吗"就露馅。技能必须能展开成项目故事。
  • 只看大厂:大厂 JD 用词规范、分工细,适合用来校准标准;但真正让你拿到 offer 的可能是中厂、独角兽或垂直领域公司。OpenAI / Anthropic 门槛极高,但 Moonshot / 智谱 / Minimax 这类大模型创业公司的推理岗位需求量更大、谈判空间也更宽。

4. 这份清单的正确用法

① 圈定 2–3 个目标岗位     → 从本文第二、三节选 2–3 个与你背景最接近的
② 对照能力地图打钩        → 用 [能力地图](/career/knowledge-map) 逐条标注
                            会 / 不会 / 半会不会
③ 生成补课清单并排优先级  → 硬性要求里的"不会"排第一优先级
                            加分项里的"半会不会"排第二

"JD 倒推学习"的完整方法论见求职冲刺线

二、国内大厂典型岗位

本节覆盖国内大厂与创业公司招聘页长期稳定出现的 8 类推理部署岗位。每条 JD 给"公司 + 团队 + 岗位名 + 核心职责 + 必备技能 + 加分项 + 级别范围"——请注意,下列 JD 是多家公司同类岗位的共性归纳,不是任何一份真实 JD 的原文或摘录。

1. 字节跳动 · 豆包大模型 · 推理引擎工程师

  • 团队:豆包大模型推理团队,base 北京 / 上海 / 新加坡
  • 核心职责
    1. 维护与扩展内部 LLM 推理引擎(基于 vLLM / 自研 hybrid),支撑豆包 APP、Coze、飞书智能助手等业务线;
    2. 对接新模型结构(MoE、长上下文、多模态),实现 PagedAttention / Chunked Prefill 等优化;
    3. 调优 H100 / H800 集群上的吞吐与延迟,参与千卡规模推理服务的容量规划。
  • 必备技能:Python 工程级 + C++ 系统级、PyTorch 内部机制、vLLM 或 TensorRT-LLM 源码阅读经验、CUDA 基础、Linux 性能分析。
  • 加分项:开源推理引擎贡献(vLLM / SGLang / LMDeploy PR)、FlashAttention / vAttention / TAP 接触、分布式推理(TP / PP / EP)实战。
  • 级别范围:2-2 到 4-1(应届博士起步 2-2,资深 3-1/3-2,团队负责人 4-1);薪资区间 50–150 万/年 + 期权。
  • 本站对应vLLMTensorRT-LLM批处理与调度分布式推理

2. 阿里 · PAI 平台 · 推理优化工程师

  • 团队:阿里云 PAI(Platform for AI)推理团队,base 杭州 / 北京
  • 核心职责
    1. 负责 PAI-EAS(Elastic Algorithm Service)推理服务的性能优化,覆盖 LLM、CV、推荐模型;
    2. 主导 INT8 / FP8 量化、CUDA Graph、算子融合等优化在 PAI 平台的落地;
    3. 支持双 11、618 等大促期间的推理服务容量保障。
  • 必备技能:Python + C++、TensorRT 或 ONNX Runtime 实战、量化(PTQ / QAT)、CUDA / Triton 算子开发、Linux + 性能分析。
  • 加分项:FlashAttention / FlashDecoding 实操、BladeDISP / XORunner 接触、大规模 GPU 集群运维经验。
  • 级别范围:P6 到 P8;薪资区间 45–120 万/年。
  • 本站对应量化算子融合GPU 优化原理基准测试

3. 腾讯 · 混元大模型 · 推理服务工程师

  • 团队:混元大模型推理团队,base 深圳 / 上海 / 北京
  • 核心职责
    1. 部署与维护混元系列模型(包含开源 + 内部)的推理服务,支撑微信、QQ、腾讯文档等业务;
    2. 多框架推理引擎选型与集成(vLLM / TensorRT-LLM / 自研 framework);
    3. 性能调优、容量规划与故障排查,参与"930"等大促保障。
  • 必备技能:Python + Go / C++、vLLM / TGI / TensorRT-LLM 实战、Kubernetes + Triton Server、Linux + 网络、监控告警体系。
  • 加分项:分布式推理(TP / PP)、CUDA / NCCL 调优、弹性扩缩容系统设计。
  • 级别范围:9 到 11 级;薪资区间 40–100 万/年。
  • 本站对应模型服务Triton 推理服务批处理与调度

4. 华为云 · 昇腾 · 推理工程师

  • 团队:华为云昇腾 AI 计算团队,base 深圳 / 西安 / 上海 / 东莞
  • 核心职责
    1. 在昇腾 NPU(Ascend 910/910B/310P)上部署 LLM 推理,维护 MindIE / CANN 推理栈;
    2. 国产芯片算子开发与优化(Ascend C / Ascend CL),对标 CUDA kernel;
    3. 与算法团队对接,把开源 LLM(Qwen、ChatGLM、Baichuan)迁移到昇腾生态。
  • 必备技能:C / C++、Ascend C 或 CUDA、PyTorch、Linux、模型量化与算子优化基础。
  • 加分项:MindIE / vLLM-Ascend 经验、Transformer 算子手写、华为内部生态熟悉。
  • 级别范围:13 到 18 级;薪资区间 35–90 万/年。国产芯片推理岗崛起明显,2025 年后岗位数量年增 50%+,是 NVIDIA 路径之外的现实选择。
  • 本站对应量化算子融合硬件入门分布式推理

5. 月之暗面 · Moonshot · 推理引擎工程师

  • 团队:Moonshot AI Infra 团队,base 北京 / 上海
  • 核心职责
    1. Kimi Chat 背后的 LLM 推理引擎研发,长上下文(128k → 2M)专项优化;
    2. 自研推理调度策略,应对超长 prompt 与高并发混合负载;
    3. 与算法团队配合,落地新模型结构与 speculative decoding。
  • 必备技能:Python + C++、PyTorch 内部、vLLM / 自研引擎源码经验、KV cache / PagedAttention 深入、CUDA 基础。
  • 加分项:长上下文优化(YaRN / NTK / Ring Attention)、EAGLE / Medusa 投机解码、CUDA Graph 实战。
  • 级别范围:5 级(资深)到 7 级(核心);薪资区间 60–180 万/年 + 期权。长上下文是 Moonshot 的招牌,JD 里这条权重显著高于其他公司。
  • 本站对应vLLM投机解码批处理与调度内存与带宽

6. DeepSeek · 推理系统工程师

  • 团队:DeepSeek AI Infra,base 杭州 / 北京
  • 核心职责
    1. DeepSeek-V3 / R1 系列模型的推理服务研发(自研框架轻量、开源生态友好);
    2. MLA(Multi-Head Latent Attention)等新结构推理优化;
    3. 推理成本控制与开源社区贡献(DeepSeek C++ 推理栈部分开源)。
  • 必备技能:C++ 高性能、Python、PyTorch、CUDA、KV cache / attention 优化基础。
  • 加分项:MLA / MoE 推理实战、自研推理引擎经验、开源贡献记录。
  • 级别范围:高级工程师到专家;薪资区间 50–130 万/年 + 期权。DeepSeek 招聘明显偏好"能写 C++ 推理内核"的工程师,JD 中 C++ 权重高于其他大模型创业公司
  • 本站对应算子融合图优化vLLMGPU 优化原理

7. 智谱 · 推理部署工程师

  • 团队:智谱 AI Infra,base 北京
  • 核心职责
    1. ChatGLM / GLM-4 系列模型推理服务部署,API 与 ToB 私有化交付;
    2. 多种硬件适配(NVIDIA / 国产 / CPU),包括 llama.cpp / OpenVINO 路径;
    3. 私有化场景的轻量化部署与安全合规。
  • 必备技能:Python + Linux、vLLM / TensorRT / OpenVINO 至少一项、Docker + K8s 基础、模型量化概念。
  • 加分项:跨硬件部署经验(NVIDIA + 昇腾 + CPU)、CPU 推理优化(AVX-512 / AMX)、企业级私有化交付经验。
  • 级别范围:资深到专家;薪资区间 40–100 万/年 + 期权。
  • 本站对应OpenVINOllama.cpp模型服务移动端部署

8. 阶跃星辰 / MiniMax / 面壁 · 推理工程师

这三家大模型创业公司的推理岗位 JD 高度相似,归纳为一条:

  • 核心职责:维护自家模型推理服务、参与推理优化、新模型上线、对接算法与业务团队。
  • 必备技能:Python + C++、PyTorch、vLLM / TensorRT-LLM 任一、Linux、KV cache / batching 概念。
  • 加分项:CUDA / Triton 算子、量化、speculative decoding、长上下文优化。
  • 级别范围:3–6 级;薪资区间 45–120 万/年 + 期权。创业公司推理岗的特点是"什么都得做":部署、调优、算子、运维边界模糊,适合快速成长。
  • 本站对应vLLM批处理与调度量化调优实践

三、海外公司岗位

海外岗位的 JD 用词与国内差异很大,但技能内核高度相似。下面是六家代表性公司的推理部署岗 JD 共性。

1. OpenAI · Triton Inference Engineer / Training Infra

OpenAI 的 Infra 团队区分 Training Infra 与 Inference Infra,前者负责预训练集群,后者负责 ChatGPT 后端推理服务。

  • 常见要求:Strong C++/Python/Rust; deep experience with GPU inference (CUDA, TensorRT, Triton); experience building production ML serving systems at scale; understanding of distributed systems and networking.
  • 信号解读Triton 在 OpenAI 的语境下既指自家 Triton Language(GPU 编程 DSL),也指推理服务架构。岗位几乎不写"机器学习"要求,全在考系统与算子。门槛是所有推理岗位里最高的之一,但对标的技能组合就是本站核心知识章案例章的全部内容。
  • 级别 / 薪资:L5 起步约 30 万美元/年,L6 约 40–50 万美元/年 + 期权。

2. Anthropic · Inference Optimization Engineer

Anthropic 的 Infra 团队支撑 Claude 系列模型的训练与推理,岗位偏向"性能优化"而非"系统搭建"。

  • 常见要求:Experience with low-level GPU programming (CUDA, PTX); familiarity with inference engines (vLLM, TensorRT-LLM, TGI); strong systems engineering background; experience with LLM-specific optimizations (PagedAttention, FlashAttention, speculative decoding).
  • 信号解读:JD 里 PTX 出现的频率高于其他公司,反映 Anthropic 对"算子级理解"的高要求。speculative decoding 是 Claude 系列推理优化的重点方向。
  • 级别 / 薪资:L4 起步约 25 万美元/年,L5 约 35–45 万美元/年 + 期权。

3. Meta · PyTorch Executor / Inference Engineer

Meta 是 PyTorch 的老家,岗位最细:Executor(执行器)、Dispatcher(分发器)、Quantization(量化)、Compiler(torch.compile / Inductor)。

  • 常见要求:Deep C++ and Python expertise; strong understanding of PyTorch internals (autograd, dispatch, dispatcher); experience with kernel development (CUDA, Triton, CUTLASS); for inference roles, experience with torch.export / AOTInductor / ExecuTorch.
  • 信号解读:Meta 推理岗特别偏好懂 PyTorch 内部机制的工程师(dispatcher / autograd / eager / compile),这是 Meta 区别于其他公司的硬要求。ExecuTorch 是 Meta 在端侧推理的旗舰项目。
  • 级别 / 薪资:E4 约 25–30 万美元/年,E5 约 35–45 万美元/年,E6 约 45–60 万美元/年。

4. NVIDIA · TensorRT / TensorRT-LLM Engineer

NVIDIA 的 TensorRT 与 TensorRT-LLM 团队是"做 GPU 推理引擎的人",岗位最硬核。

  • 常见要求:Strong C++ and CUDA; deep understanding of GPU architecture (Tensor Core, TMA, HBM); experience with TensorRT internals; for TensorRT-LLM roles, experience with PagedAttention / In-Flight Batching / FP8 quantization.
  • 信号解读:JD 直接要求 Tensor Core / TMA / FP8 经验,这意味着岗位目标是 Hopper / Blackwell 架构上的极致优化。NVIDIA 几乎不招"会调用 TensorRT"的工程师,招的是"会改 TensorRT"的工程师
  • 级别 / 薪资:Senior 约起步 20 万美元/年,Staff 40–55 万美元/年 + RSU。

5. Groq · Inference Compiler Engineer

Groq 是 LPU(Language Processing Unit)创业公司,主打"极速推理"(Llama-70B 上千 token/s)。

  • 常见要求:Strong C++/Python; experience with compiler backends (MLIR, XLA, TVM); understanding of tensor compilers; for systems roles, experience with high-throughput serving.
  • 信号解读:Groq 的 JD 偏编译器方向(MLIR / XLA / TVM),不是传统 CUDA 路径。tensor compiler 是核心关键词。这是推理部署岗里"编译器路径"的代表——异于主流 vLLM / TensorRT 路径,但技能稀缺度极高。
  • 级别 / 薪资:Staff / Senior 约 18–35 万美元/年 + 期权。

6. Together AI / Anyscale / Modal · Inference Platform Engineer

硅谷"推理即服务"创业公司,岗位偏 SaaS 平台而非极致单模型优化。

  • 常见要求:Strong Python/Go; experience with Kubernetes and distributed systems; experience building inference platforms (vLLM, TGI); understanding of multi-tenant serving and routing.
  • 信号解读:JD 关键词是 multi-tenant routing serverless,与单模型推理优化岗方向完全不同。这类岗位偏好"分布式系统工程师 + 推理引擎经验"的复合背景,对 CUDA / 算子要求低。
  • 级别 / 薪资:Senior 约 15–25 万美元/年 + 期权。

英文 JD 关键词速查表

关键词常见含义国内对应表述
Inference engine推理引擎:vLLM / TensorRT / TGI 等推理引擎研发
Serving / serving systems模型服务化与生产部署模型服务化 / 部署
Low-level / kernel算子层开发:CUDA / Triton / CUTLASS算子工程师
Quantization量化:INT8 / FP8 / INT4量化与压缩
PagedAttentionvLLM 的 KV cache 管理机制KV cache 优化
Speculative decoding投机解码:Medusa / EAGLE投机解码 / 推测解码
Distributed inference分布式推理:TP / PP / EP大规模推理
Multi-tenant serving多租户推理服务推理平台 / SaaS
TritonOpenAI Triton Language(GPU DSL)Triton 算子开发
torch.compile / InductorPyTorch 2.x 原生 AOT 编译torch.compile 优化

海外求职的"翻译能力"

同样的能力,中文 JD 和英文 JD 的写法完全不同。中文 JD 写"熟悉 vLLM 源码",英文 JD 写 contributed to vLLM or equivalent inference engines;中文 JD 写"算子优化经验",英文 JD 写 experience with low-level GPU programming and kernel optimization。投海外岗前,先把你的项目经历翻译成英文 JD 的"动词 + 结果"句式——这是简历分析的核心技巧在跨语言场景下的应用。

四、岗位要求词频表

下表从上述国内外常见 JD 中提炼高频技能词,按经验性出现频率排序。

排序技能词频率档位出现场景
1Python★★★★★ 几乎必现所有推理部署岗的语言门槛
2C++★★★★★ 几乎必现引擎 / 算子 / 系统岗的硬门槛
3PyTorch★★★★★ 几乎必现所有岗位的基础框架
4Linux★★★★☆ 高频部署与运维的硬底子
5CUDA★★★★☆ 高频引擎 / 优化 / 算子岗的核心
6vLLM / TensorRT-LLM★★★★☆ 高频LLM 推理引擎的事实标准
7Kubernetes★★★☆☆ 中频平台 / 系统工程师必备
8量化(INT8 / FP8)★★★☆☆ 中频优化岗位的核心技能
9KV cache / PagedAttention★★★☆☆ 中频LLM 推理岗的标志性词
10Triton(DSL)★★☆☆☆ 上升中算子开发的新主流
11投机解码★★☆☆☆ 上升中创业公司加分项
12FlashAttention★★☆☆☆ 上升中LLM 优化岗标配

四个值得注意的读数:

  1. Python + C++ 双语硬门槛:推理部署岗与算法岗最大差异——C++ 出现在 80% 的 JD 里。能读 / 写 C++ 是过滤器的硬条件,没有这个底子,简历在初筛阶段就被筛掉。
  2. CUDA 是分水岭:会 CUDA 的求职者薪资比不会的高 30–50%。CUDA 不要求精通,但要求"能读懂 / 能改 / 能写一个简单 reduction kernel"。
  3. vLLM 是 2024 年后的事实标准:它替代了 2021 年的 ONNX Runtime / TensorRT 在 LLM 场景的位置。掌握 vLLM 源码是"引擎工程师"的入门券。
  4. Triton(DSL)和投机解码是"上升趋势"组:2024 年还在加分项里,2026 年开始进入硬性要求。提前补这块是先发优势。

五、要求与本站页面的映射表

把词频表里的高频词映射到本站学习页面,就是你的"查漏补缺"导航:

高频技能词岗位里的真实要求本站对应页面怎么用
Python能写工程级 Python,不只是写脚本求职冲刺线术语表查概念口径;按路径补基础
C++能读 / 改 C++ 源码、会用 modern C++vLLM 源码TensorRT在源码阅读中补 C++
PyTorch能调试、能改 model runnervLLM看懂 model runner 与 forward
Linux排查线上问题、性能分析基准测试用工具链补 Linux 实战
CUDA能写 / 改简单 kernelGPU 优化原理从 SIMT 模型开始学
vLLM / TensorRT-LLM引擎源码级理解vLLMTensorRT-LLM读源码 + 实战
Kubernetes多副本部署、灰度发布Triton 推理服务部署实战补 K8s
量化INT8 / FP8 / INT4 选型与精度评估量化权重-激活混合精度学完原理做对比实验
KV cache / PagedAttention源码级理解 + 实战优化批处理与调度推导 KV cache 显存公式
Triton(DSL)写自定义 attention / quantization kernel算子融合从 matmul 开始学 Triton
投机解码Medusa / EAGLE 落地经验投机解码看论文 + 复现 demo
FlashAttention算子级理解 + 性能调优算子融合GPU 优化原理读论文 + 实测对比

一张表说不完的差距,去能力地图展开

映射表只覆盖"词 → 页面",但没有覆盖"你 → 词"。把本文高频词逐条放进能力地图打上"会 / 不会 / 半会不会",才得到真正属于你的补课清单。JD 告诉你要什么,能力地图告诉你缺什么——两步缺一不可。

六、趋势观察

1. 推理优化岗位需求井喷

用"算法类岗位中,JD 里出现推理部署关键词(vLLM / TensorRT / CUDA / 量化 / KV cache)的占比"这个粗指标看:

2022  ~ 3%   (LLM 兴起前,仅 CV/推荐部署岗)
2023  ~ 12%  (vLLM 走红,大模型推理岗开始独立)
2024  ~ 30%  (开源 LLM 成熟,岗位数量爆发)
2025  ~ 45%  (国产芯片推理岗崛起)
2026  ~ 55%+ (推理部署成为"算法岗标配背景板")

判断依据:各公司招聘官网与招聘平台岗位描述的公开可见趋势,
非精确统计,只表示量级与方向。

这个趋势有两个细节值得注意:

  • 不是替代,而是叠加。"会推理优化"极少单独成岗,绝大多数岗位是"原岗位能力 + 推理部署能力"。算法工程师现在被要求懂量化,平台工程师被要求懂 vLLM——传统技能没有消失,只是多了一层。
  • 国产芯片推理岗崛起。2025 年起,华为昇腾、摩尔线程、壁仞等厂商的推理岗位数量年增 50%+。会 CUDA 的人转国产芯片有先发优势(架构概念相通,迁移成本 1–3 个月),是 NVIDIA 路径之外的现实选择。

2. 推理岗的三个演化方向

演化方向表现对求职者的含义
极致性能方向大模型团队追求"千 token/s"、长上下文算子 / 调度 / 投机解码专家最稀缺、薪资最高
平台化方向业务线算法岗减少,能力收敛到平台团队平台 / 系统工程师岗位稳定增长
端侧推理方向手机端 LLM(Phi-3、Qwen2.5-0.5B)成熟端侧推理岗在 2025–2026 从无到有

一个值得记住的结构性判断

推理部署领域,模型本身正在变成基础设施(按调用付费),而性能优化、调度、量化成为差异化所在。这解释了两件事:为什么平台 / MLOps 岗增多,为什么"会改 vLLM / 写 CUDA kernel"在大模型 JD 中的权重持续上升。这两块恰是本站批处理与调度量化两页内容的核心。

3. 对求职者的三个务实建议

  1. 保住 Python + C++ + Linux 三件套。这是所有推理部署岗的公约数,也是抗岗位波动的底仓。
  2. 把 vLLM 源码作为"第二语言"补齐。不需要从零写一个推理引擎,但能读懂 vLLM scheduler / block manager / model runner 三大模块,是 2026 年推理岗面试的标配问题,值得花两周时间精读。
  3. 用数据而非情绪做决策。每隔一个季度刷新一次本文的读法:去招聘网站看 20 份你目标岗位的最新 JD,用第一节的"硬性 / 加分"框架重新拆一遍。JD 是市场给你的信号,你只需要学会解码。

七、延伸阅读

参考资料

以下是获取真实 JD 的可靠渠道。本文所有归纳均以这些渠道的公开信息为基准;各公司 JD 以官方招聘页实时发布为准,第三方平台信息可能存在滞后

  • 国内公司官方招聘:字节跳动(jobs.bytedance.com)、阿里巴巴(talent.alibaba.com)、腾讯(careers.tencent.com)、华为(career.huawei.com)、百度(talent.baidu.com)、Moonshot(moonshot.cn/careers)、DeepSeek(deepseek.com)、智谱(zhipuai.cn)、MiniMax(minimaxi.com)、阶跃星辰(stepfun.com)等官方招聘网站
  • 海外公司官方招聘:OpenAI(openai.com/careers)、Anthropic(anthropic.com/careers)、Meta Careers(careers.meta.com)、NVIDIA Careers(nvidia.com/en-us/about-nvidia/careers)、Groq(groq.com/careers)、Together AI(together.ai/careers)、Anyscale(anyscale.com/careers)等
  • 国内招聘平台:脉脉(maimai.cn)、BOSS 直聘(zhipin.com)、猎聘(liepin.com)—— 用于观察岗位分布与 JD 用词频率
  • 海外薪资与岗位统计:levels.fyi —— 用于了解岗位类型与薪酬量级,非官方数据
  • 开源仓库作为"简历通道":vLLM(github.com/vllm-project/vllm)、SGLang(github.com/sgl-project/sglang)、LMDeploy(github.com/InternLM/lmdeploy)、TensorRT-LLM(github.com/NVIDIA/TensorRT-LLM)——贡献 PR 是最硬的"加分项证据"

一条底线

本文不提供也不引用任何一份"某某公司 2026 年某岗位 JD"的原文,因为这类内容既无法验证、也必然过时。一切以官方渠道实时发布的 JD 为准——把你读到的每一份 JD 当成训练数据,本文只是教你怎么读懂它们。