外观
论文地图
一句话定位:这张地图把推理加速与部署领域 2014–2025 的关键论文按主题与年代排成一张可随时检索的坐标系——从 2014 年 PipeDream 的流水并行,到 2025 年 EAGLE-3 的 6.5× 加速,读完这张地图,你能说出"每一篇关键论文解决了什么瓶颈、与前后哪些工作相连、值得精读还是泛读"。
论文阅读最大的障碍不是"读不懂一篇",而是"不知道下一篇该读哪篇"。教程会按顺序教,但论文世界是按问题组织的:同一个问题(比如"怎么让 attention 不被 HBM 卡住")在 2022 年的答案是 FlashAttention v1,在 2023 年是 FlashAttention-2,在 2024 年是 FlashAttention-3(H100 FP8),在 2024 年还有 vAttention(用软件 PagedAttention 逼近硬件原生稀疏 attention)。如果你只顺着时间线读,你会迷失在"谁优化了谁"的细节里;如果你只按主题读,你会错过"为什么硬件代际迁移会重塑算法路线"的宏观叙事。这张地图的目的,就是把主题和时间两个维度叠在一起,让你在任何一篇论文面前都能回答三个问题:它属于哪条技术线?它处在范式演进的哪个阶段?它和哪几篇论文构成"必读链"?
地图与其他页面的分工
本站论文栏目共五页,分工不同:从这里开始 讲"为什么要读推理论文",阅读路径 讲"按目标怎么读",本文(论文地图) 讲"整个领域有哪些值得读的论文、它们之间什么关系",经典论文精读 逐篇深挖,前沿进展 追踪 2024–2026 年的新趋势。一句话:地图定坐标,精读给深度,前沿指方向。
一、这张地图怎么读
在展开地图之前,先说清三条阅读约定:
- 编号约定:所有论文都给 arXiv 编号(或会议/期刊正式出处),可在 https://arxiv.org/abs/编号 免费取全文;老论文无 arXiv 的标注"—",出处写会议/期刊,可在参考资料中找到原文链接。
- 年份约定:论文年份一律指首次公开发表(会议/期刊正式发表,或 arXiv 预印本提交)的年份。例如 FlashAttention v1 的 arXiv 预印本 2022 年 6 月提交、NeurIPS 2022 发表,表格记为 2022。
- 深读约定:地图只给"一句话贡献",回答"这篇为什么值得记"。想读透一篇时,跳到经典论文精读;想追它之后的发展,用前沿进展与 FAQ 中的检索法。
三大坐标一起使用:主题决定它归哪条线,年份决定它在范式演进中的位置,重要度决定你投入多少时间。下图是这张地图的总览:
主题维度(六大技术线)
┌──────────────────────────────┐
时间维度 ↓ │ ① 算子优化 │
│ ② 量化与压缩 │
│ ③ 服务系统与调度 │
│ ④ 投机解码与并行解码 │
│ ⑤ 分布式训练/推理 │
│ ⑥ 端侧与边缘部署 │
└──────────────────────────────┘二、按主题分组的学术地图
1. 算子优化:从朴素 attention 到 IO 感知与硬件协同(2017–2025)
这一组的核心问题始终是:attention 的 O(n²) 复杂度为什么是瓶颈?是 FLOPs 瓶颈还是 IO 瓶颈? 2017 年 Transformer 之后,社区先在 FLOPs 上做文章(稀疏注意力、Longformer、Big Bird),直到 2022 年 FlashAttention 指出瓶颈在 HBM 带宽,路线才被纠回到"IO 感知 + 算子融合"。
| 论文 | 作者/机构 | 年份 | 出处/arXiv | 一句话贡献 |
|---|---|---|---|---|
| Attention Is All You Need | Vaswani 等(Google Brain) | 2017 | arXiv:1706.03762 | 提出 Transformer 与纯 attention 架构,O(n²) 复杂度的源头 |
| Longformer / Big Bird | Beltagy 等 / Zaheer 等 | 2020 | arXiv:2004.05150 / arXiv:2007.14062 | 稀疏注意力,把全局 attention 替换为"局部窗口 + 少量全局",长文本上算力 O(n) |
| FlashAttention v1 | Dao 等(Stanford) | 2022 | arXiv:2205.14135 | IO 感知的 attention 算子,分块 + online softmax + 中间态不写回 HBM,A100 上快 2-4 倍 |
| FlashAttention-2 | Dao(Stanford) | 2023 | arXiv:2307.08691 | 重做并行与工作划分,长序列下 GPU 利用率从 35% 提到 50-73% |
| FlashAttention-3 | Shah 等(Princeton) | 2024 | arXiv:2407.08608 | H100 上的 FP8 + 异步(warp-specialized),峰值 1.2 PFLOPs,比 FA2 快 1.5-2× |
| FlashInfer | Ye 等(Princeton/DeepSeek) | 2024 | arXiv:2401.12448 | 块稀疏 + 可组合 KV 格式,把 paged KV 与变长 attention 统一在一个 kernel |
| vAttention | Prabhu 等(Georgia Tech) | 2024 | arXiv:2405.04447 | 用硬件原生 sparse attention 实现软件 PagedAttention 的功能,避免 SM 阻塞 |
为什么先读 FlashAttention 系列再读 vAttention
FlashAttention 三代(v1→v2→v3)展示了"同一个数学公式,三代工程实现"的演进范式:v1 找到瓶颈(IO),v2 优化并行,v3 协同硬件(H100 FP8)。vAttention 则提出"能不能用硬件稀疏 attention 替代软件 PagedAttention",是 2024 年的新范式争论。读懂这条线,就抓住了"算子优化如何跟随硬件代际演进"的核心规律。 算子机制详解见算子融合。
2. 量化与压缩:从均匀量化到二阶信息与旋转量化(2020–2025)
量化的核心问题是:能不能用更少的 bit 表示权重与激活,且精度损失可接受? 这条线在 2020 年代经历过三次范式迁移:从朴素 round-to-nearest → LLM.int8() 发现离群值 → GPTQ/AWQ/SmoothQuant 用更聪明的方法保护重要参数 → 2024 年的旋转量化(QuaRot/SpinQuant)与 FP8/FP4 硬件量化。
| 论文 | 作者/机构 | 年份 | 出处/arXiv | 一句话贡献 |
|---|---|---|---|---|
| LLM.int8() | Dettmers 等(Washington) | 2022 | arXiv:2208.07339 | 发现 >6.7B 模型有"离群值特征",提出混合精度(离群值列用 FP16、其他 INT8),LLM 量化研究的起点 |
| GPTQ | Frantar 等(IST Austria) | 2022 | arXiv:2210.17323 | 用 Hessian 信息做后训练 4-bit 权重量化,175B 模型上精度损失 < 1%,二阶量化范式 |
| SmoothQuant | Xiao 等(MIT/字节) | 2022 | arXiv:2211.10438 | 把激活的离群值平滑到权重,让 W8A8 量化成为可能,激活量化的破局者 |
| AWQ | Lin 等(MIT/Hugging Face) | 2023 | arXiv:2306.00978 | 激活感知的显著权重保护,比 GPTQ 快 3 倍且精度相当,工程落地常用 |
| ZeroQuant | Yao 等(Microsoft) | 2022 | arXiv:2206.01861 | 权重与激活联合量化 + 逐块校准,训练后量化的早期工业方案 |
| FP8 LLM 推理(NVIDIA) | NVIDIA | 2023 | NVIDIA FP8 白皮书 | H100 引入 FP8 Tensor Core,硬件级量化甜点格式 |
| QuaRot | Ashkboos 等(ETH) | 2024 | arXiv:2404.00456 | 旋转量化:用随机正交变换把离群值"抹平",让 W4A4 量化精度大增 |
| SpinQuant | Liu 等(Meta) | 2024 | arXiv:2405.16406 | 学习型旋转矩阵,比 QuaRot 的随机旋转更优,W4A4 量化接近 W4A16 |
量化的两条主线
权重侧:GPTQ 与 AWQ 用二阶/激活信息定位"显著权重",是"差异化保护"。激活侧:SmoothQuant 把难度从激活迁到权重,QuaRot/SpinQuant 用旋转把分布"抹平"。两条线最终汇合于 2024 年的 W4A4 + 旋转,让 4-bit 推理逼近 16-bit 精度。量化机制详见量化与权重混合精度。
3. 服务系统与调度:从朴素 batching 到 Prefill/Decode 分离(2022–2025)
服务系统的核心问题是:多用户、变长请求下,怎么让 GPU 不空转、显存不碎片、长尾延迟可控? 2022 年 Orca 提出 iteration-level scheduling,2023 年 vLLM 用 PagedAttention 把 KV cache 当虚拟内存管,2024 年 DistServe/Splitwise 把 prefill 与 decode 物理分离,2024 年 SARATHI 用 chunked prefill 平衡算力。
| 论文 | 作者/机构 | 年份 | 出处/arXiv | 一句话贡献 |
|---|---|---|---|---|
| Orca | Yu 等(微软) | 2022 | OSDI 2022 | iteration-level scheduling,让不同长度请求在同 batch 推进,continuous batching 前身 |
| vLLM / PagedAttention | Kwon 等(Berkeley) | 2023 | SOSP 2023 | KV cache 当虚拟内存管,block table + 块级分配,吞吐 2-4× |
| AlpaServe | Li 等(Berkeley) | 2023 | OSDI 2023 | 模型并行 + 时分复用,用统计复用率指导多模型部署,多模型服务优化 |
| SARATHI | Agarwal 等(微软) | 2023 | arXiv:2308.16369 | chunked prefill,把长 prefill 拆 chunk 与 decode 同 batch,平衡算力与显存 |
| DistServe | Zhong 等(北大/清华) | 2024 | arXiv:2401.09670 | prefill 与 decode 物理分离到不同 GPU,各自独立 scaling |
| Splitwise | Patel 等(微软/印度理工) | 2024 | HPCA 2024 | 与 DistServe 思路相似,但聚焦"分阶段机器"的集群级方案 |
| SGLang | Zheng 等(Berkeley/DeepSeek) | 2024 | arXiv:2312.07104 | RadixAttention:前缀树复用 KV cache,多轮对话与 few-shot 场景的吞吐利器 |
| Mooncake | 月之暗面 | 2024 | arXiv:2407.00079 | KV cache 分离的全球级服务架构,KV cache 当作一等公民存储 |
服务系统演进的三个阶段
阶段一(2022 Orca):把"按请求 batching"换成"按 iteration batching",吞吐飞跃。阶段二(2023 vLLM):把"显存预分配"换成"按需块级分配",KV 碎片消除。阶段三(2024 DistServe/SARATHI):把"prefill + decode 同 GPU 同 batch"拆开,因为两者算力/显存比完全相反。读懂这三个阶段,就理解了 LLM 服务演进史。服务机制详见批处理与调度与模型服务。
4. 投机解码与并行解码:从单步到多 token 预测(2022–2025)
解码层的核心瓶颈是:自回归生成每步只产 1 token,KV cache 重算 1000+ 次只为生成 1000 个 token。投机解码的思路是"用小成本猜 k 个 token,再用大模型一次性验证",2023 年 Leviathan 把它正式化,2024 年 Medusa/EAGLE-1/2 各自升级 drafting,2025 年 EAGLE-3 把加速比推到 6.5×。
| 论文 | 作者/机构 | 年份 | 出处/arXiv | 一句话贡献 |
|---|---|---|---|---|
| Speculative Decoding | Leviathan 等(Google/Technion) | 2023 | arXiv:2211.17192 | 用小模型猜 + 大模型并行验证,无损加速,spec decoding 的正式化 |
| SpecInfer | Miao 等(CMU/SCU) | 2023 | arXiv:2302.02018 | token 树并行验证 +狮心 SSG,把 spec decoding 与多 draft 升级 |
| Medusa | Cai 等(Princeton/DeepSeek) | 2024 | arXiv:2401.10774 | 主模型多头并行预测,不再需要独立小模型,简化 spec decoding |
| EAGLE-1 | Li 等(北大/腾讯) | 2024 | arXiv:2401.15077 | 用主模型 hidden state 做 draft,draft 与 verify 特征对齐,接受率 50%+ |
| EAGLE-2 | Li 等(北大/腾讯) | 2024 | arXiv:2406.16858 | 动态 draft tree,根据上下文概率裁剪树形,接受率推到 70%+ |
| EAGLE-3 | Li 等(北大/腾讯) | 2025 | arXiv:2503.01840 | 用隐藏层深层特征 + 训练目标改进,加速比 3-6.5× |
| SpecForge | SGLang 组 | 2025 | SGLang 博客 | 多 draft 模型训练管线,把 spec decoding 当成"工程产物"而非"模型产物" |
| DeepSeek-V3 MTP | DeepSeek-AI | 2024 | arXiv:2412.19437 | 主模型原生支持 multi-token prediction,训练时学 spec decoding 能力 |
投机解码的"成本账"
spec decoding 的核心权衡是:draft 多花的算力 vs verify 节省的步数。draft 越准、接受率越高,节省越多;draft 越大,开销越大。EAGLE 系列的演进逻辑是"用主模型 hidden state 让 draft 既准又小",DeepSeek-V3 的 MTP 是另一条路——让主模型在训练时就学会一次吐多个 token,把 spec decoding 内化为训练目标。两者哪个能成为主流,是 2025–2026 的开放问题。案例详见投机解码案例。
5. 分布式训练/推理:从数据并行到专家并行与流水并行(2019–2025)
分布式不再是"训练时的事"——MoE 推理让专家并行成为推理部署的刚需,DeepSeek-V3 的 671B 总参数 + 37B 激活让推理侧的分布式调度与训练侧同样复杂。
| 论文 | 作者/机构 | 年份 | 出处/arXiv | 一句话贡献 |
|---|---|---|---|---|
| Megatron-LM | Shoeybi 等(NVIDIA) | 2019 | arXiv:1904.10509 | 张量并行:把每层的矩阵乘法按列/行切到多 GPU,大模型训练的基础设施 |
| PipeDream | Narayanan 等(Stanford/Google) | 2019 | arXiv:1806.03312 | 流水并行 + micro-batching + 1F1B 调度,让"层切到不同 GPU"成为可行 |
| MegaScale | Jiang 等(字节跳动) | 2024 | NSDI 2024 | 万亿参数 MoE 训练的工业级系统,通信/计算 overlap 与故障恢复 |
| Mixtral of Experts | Mistral AI | 2024 | arXiv:2401.04088 | 8 专家 MoE 开源权重,把 MoE 从闭源带入开源,推理侧专家并行成为标配 |
| DeepSeek-V3 | DeepSeek-AI | 2024 | arXiv:2412.19437 | 256 专家 + 8 激活 MoE + MTP,把 MoE 推理服务推到千亿级开源标杆 |
训练与推理的分布式边界在模糊
Megatron 与 PipeDream 是训练侧的论文,但它们的并行方案(TP/PP/SP)被推理侧直接继承——TensorRT-LLM 与 vLLM 的多 GPU 推理用的就是同一套切分。MoE 推理(Mixtral、DeepSeek-V3)则把"专家并行"从训练侧带进了推理侧,让推理引擎不得不引入新的调度。今天做推理部署的人,不能不懂训练侧的并行方案。 详见分布式推理。
6. 端侧与边缘部署:把 LLM 塞进手机与笔记本(2020–2025)
当 LLM 走向手机与笔记本时,问题从"怎么更快"变成"怎么在 4-8GB 显存里跑得动"。这条线包括端侧专用架构(MobileBERT)、端侧推理引擎(MLC-LLM、llama.cpp)、端侧量化方案(MCT-LLM)。
| 论文 | 作者/机构 | 年份 | 出处/arXiv | 一句话贡献 |
|---|---|---|---|---|
| MobileBERT | Sun 等(华中科大/Google) | 2020 | arXiv:2004.02584 | 蒸馏 + 逐层瓶颈结构,把 BERT 压到手机可跑,端侧 Transformer 起点 |
| MCT-LLM | Linux Foundation / ONNX Format | 2023 | Microsoft Build 2023 | Microsoft 的端侧 INT4 量化方案,让 Llama-7B 跑在 Surface Laptop |
| MLC-LLM | TVM 团队(OctoML/Apache) | 2023 | mlc.ai | 用 TVM 编译 LLM 到 GPU/NPU/CPU,端侧 LLM 的编译器方案 |
| llama.cpp | Gerganov 等 | 2023 | github.com/ggerganov/llama.cpp | 纯 C++ + GGUF 量化格式,让 Llama 在 CPU 与低端 GPU 上跑,端侧事实标准 |
端侧推理的两条路
编译器路(MLC-LLM):把 LLM 当作计算图,用 TVM 编译到不同硬件后端,工程优雅但适配慢。直接实现路(llama.cpp):用纯 C++ + SIMD 重写整个推理路径,灵活但适配靠手。今天 llama.cpp 因其简单与活跃社区成为端侧事实标准,但 NPU 时代编译器路是否反超,仍未定。详见端侧部署与llama.cpp 案例。
三、范式迁移时间轴:一张图看懂十年演进
把上面六个主题的关键论文按时间排成一张图,你能看到推理加速领域的范式迁移节奏:
2017 Transformer ── O(n²) 复杂度的源头
│
2019 Megatron-LM/PipeDream ── 大模型训练的并行基础设施
│
2020 Longformer/BigBird ── 朴素稀疏注意力(绕开 O(n²))
│
2022 LLM.int8() ── 发现离群值,量化研究破局
│ GPTQ ── 二阶信息量化
│ SmoothQuant ── 激活平滑
│ Orca ── iteration-level scheduling
│ FlashAttention v1 ── IO 感知算子(范式转折点)
│
2023 vLLM/PagedAttention ── KV cache 当虚拟内存管(范式转折点)
│ AWQ ── 激活感知量化
│ FlashAttention-2 ── 并行与工作划分优化
│ Speculative Decoding ── 投机解码正式化
│ llama.cpp/MLC-LLM ── 端侧 LLM 落地
│ SARATHI ── chunked prefill
│
2024 FlashAttention-3 ── H100 FP8 协同
│ vAttention ── 硬件原生稀疏替代软件 paged
│ DistServe/Splitwise ── Prefill/Decode 物理分离
│ SGLang ── RadixAttention 前缀树复用
│ Medusa/EAGLE-1/2 ── 投机解码升级
│ QuaRot/SpinQuant ── 旋转量化
│ Mixtral/DeepSeek-V3 ── MoE 推理服务规模化
│ Mooncake ── KV cache 分离架构
│
2025 EAGLE-3 ── 投机解码 6.5× 加速
│ FP4/NVFP4 ── Blackwell B200 时代
│ P-EAGLE/SpecForge ── 投机解码工程化
│ ...两个范式转折点最值得记住:2022 年 FlashAttention v1 把瓶颈从 FLOPs 纠回到 IO;2023 年 vLLM 把 LLM 服务从"模型加载"重定义为"显存管理"。读论文时优先精读这两年的论文,因为它们定义了今天的工程坐标系。
四、按任务查论文索引
不同角色、不同场景关心的论文不同。下表帮你按"任务"反查论文:
| 你在做的事 | 必读论文 | 进阶论文 |
|---|---|---|
| 写一个 attention kernel | FlashAttention v1/v2 | FlashAttention-3、FlashInfer、vAttention |
| 优化 LLM 服务吞吐 | vLLM、Orca | SARATHI、DistServe、Splitwise、SGLang、Mooncake |
| 量化一个 70B 模型上线 | GPTQ、AWQ | SmoothQuant、LLM.int8()、QuaRot、SpinQuant |
| 加速 decode 阶段 | Speculative Decoding、EAGLE-2 | Medusa、EAGLE-1/3、SpecInfer |
| 部署 MoE 模型 | Mixtral、DeepSeek-V3 | MegaScale、Megatron-LM |
| 跑端侧 LLM | llama.cpp、MLC-LLM | MobileBERT、MCT-LLM |
| 在 H100/B200 上榨性能 | FlashAttention-3、FP8 推理 | NVFP4、QuaRot、vAttention |
| 面试前恶补 | 经典论文精读 全部 | 配合前沿进展 |
五、按重要度分级阅读
如果时间不够,按下面的分级选论文:
三级阅读清单
必读 5 篇(任何做推理部署的人都该读)
- FlashAttention v1(2022)
- vLLM / PagedAttention(2023)
- GPTQ 或 AWQ(任选一篇)
- EAGLE-2(2024)
- Orca 或 SARATHI(任选一篇)
强烈推荐 5 篇(系统精进或求职者)
- FlashAttention-2(2023)
- SmoothQuant(2022)
- Medusa(2024)
- DistServe(2024)
- FlashAttention-3(2024)
研究者必读 5 篇(追前沿/写论文)
- vAttention(2024)
- SGLang(2024)
- QuaRot 或 SpinQuant(2024)
- DeepSeek-V3 Technical Report(2024)
- EAGLE-3(2025)
六、延伸阅读
- 从这里开始 —— 论文栏目总入口,读论文的三个价值
- 阅读路径 —— 把这张地图里的论文编排成三条可执行的路线
- 经典论文精读 —— 必读 5 篇 + 部分强推篇的逐段拆解
- 前沿进展 —— 2024–2026 重要突破的系统梳理
- 阅读纪律与 FAQ —— 读论文的方法论
- 什么是推理 —— 概念地基
- 演进简史 —— 把论文放进更大的时间线
- 术语表 —— 读论文时随时查阅
- 案例拆解:vLLM 案例、TensorRT-LLM 案例、投机解码案例、分布式推理、端侧部署
参考资料
以下均为真实公开资源,可直接访问原文:
- Vaswani et al. Attention Is All You Need (NeurIPS 2017)
- Beltagy et al. Longformer: The Long-Document Transformer (2020)
- Zaheer et al. Big Bird: Transformers for Longer Sequences (NeurIPS 2020)
- Dao et al. FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness (NeurIPS 2022)
- Dao. FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning (2023)
- Shah et al. FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision (2024)
- Ye et al. FlashInfer: Efficient and Customizable Attention Engine for LLMs (2024)
- Prabhu et al. vAttention: Efficient Attention with Suffix Parallelism (2024)
- Dettmers et al. LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale (NeurIPS 2022)
- Frantar et al. GPTQ: Accurate Post-Training Quantization for GPT (ICLR 2023)
- Xiao et al. SmoothQuant: Accurate and Efficient Post-Training Quantization for LLMs (ICML 2023)
- Lin et al. AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration (MLSys 2024)
- Ashkboos et al. QuaRot: Outlier-free 4-bit Inference for Rotated LLMs (2024)
- Liu et al. SpinQuant: LLM Quantization with Learned Rotations (2024)
- Yu et al. Orca: A Distributed Serving System for Transformer-Based LLMs (OSDI 2022)
- Kwon et al. Efficient Memory Management for LLMs Serving with PagedAttention (SOSP 2023)
- Li et al. AlpaServe: Scaling for Large-Scale Deep Learning Serving (OSDI 2023)
- Agarwal et al. SARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills (2023)
- Zhong et al. DistServe: Disaggregating Prefill and Decoding for Goodput-optimized LLM Serving (2024)
- Patel et al. Splitwise: Efficient generative LLM inference using phase splitting (HPCA 2024)
- Zheng et al. SGLang: Efficient Execution of Structured Language Model Programs (2024)
- Mooncake. Mooncake: A KV-Centric Decoupled Architecture for LLM Serving (2024)
- Leviathan et al. Fast Inference from Transformers via Speculative Decoding (2023)
- Miao et al. SpecInfer: Accelerating Generative Large Language Model Serving with Tree-based Speculative Inference (SOSP 2023)
- Cai et al. Medusa: Simple Framework for Accelerating LLM Generation with Multiple Decoding Heads (ICML 2024)
- Li et al. EAGLE: Speculative Sampling Requires Rethinking Feature Uncertainty (2024)
- Li et al. EAGLE-2: Faster Speculative Decoding with Dynamic Draft Trees (EMNLP 2024)
- Li et al. EAGLE-3: Scaling up Inference Speed (2025)
- DeepSeek-AI. DeepSeek-V3 Technical Report (2024)
- Shoeybi et al. Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism (2019)
- Narayanan et al. PipeDream: Generalized Pipeline Parallelism for DNN Training (SOSP 2019)
- Jiang et al. MegaScale: Scaling Large Language Model Training to More Than 10,000 GPUs (NSDI 2024)
- Jiang et al. Mixtral of Experts (2024)
- Sun et al. MobileBERT: a Compact Task-Agnostic BERT for Resource-Limited Devices (2020)
- MLC-LLM 项目
- llama.cpp 项目