学习路径
按阶段推进;最小可用路径是覆盖“部署-调优-排错”闭环的最短序列,学完即可独立完成一次生产级部署。
最小可用路径
- 1推理优化全景与发展脉络
模型部署与推理优化是把训练好的模型高效、稳定、低成本地跑起来并对外服务的一门工程学科,核心是在延迟、吞吐、显存、成本四个目标与精度约束之间做系统性的交换。
- 2性能度量:TTFT、TPOT、吞吐与延迟分位数
推理性能度量用 TTFT(首 token 时间)、TPOT(每 token 时间)、吞吐(tokens/s)与延迟分位数(P50/P99)四组指标,把"快"拆成可优化、可验收的数字。
- 3Prefill 与 Decode:Transformer 推理的两阶段
一次 LLM 推理由 Prefill(并行处理全部输入 token)与 Decode(逐 token 自回归生成)两个阶段组成,前者计算密集、后者访存密集,几乎所有推理优化都源于对这个不对称的正确处理。
- 4显存账本与容量估算
显存账本把"能不能部署"拆成一个可加总公式:权重 + KV Cache 上限 + 激活与框架开销,其中每一项都能从模型参数与精度直接推出来。
- 5KV Cache:原理与显存占比
KV Cache 把每层已算出的 Key/Value 向量存下来供后续 decode 步复用,用显存换掉每步对全序列的重复计算,是自回归推理"能跑"的前提,也是并发显存的最大可变项。
- 6连续批处理(Continuous Batching)
连续批处理把调度粒度从"一个请求"细化到"一次前向迭代":每生成一步都允许新请求加入、已完成请求退出,从而让 GPU 永远跑在"当前能装下的最大有效 batch"上,是服务端吞吐的第一支柱。
- 7vLLM 参数级配置与调优
vLLM 的部署质量由十余个参数共同决定,核心是三件事:把显存账(gpu-memory-utilization × 卡容量 = 权重 + KV 池)算对、把并发上限(max-num-seqs)与 TPOT SLO 对齐、把前缀缓存与量化等开关按负载画像打开。
- 8排错清单:OOM、长尾延迟与吞吐瓶颈的定位方法
推理排错的方法论是"分层定位 + 单变量修改":先按 负载 → 调度/容量 → 算子/硬件 → 数值/参数 四层把症状归类,再用对照实验逐项排除,本页给出高频症状的现成对照表。
入门阶段(4 个知识点)
核心阶段(14 个知识点)
- kp-003Prefill 与 Decode:Transformer 推理的两阶段
- kp-004显存账本与容量估算
- kp-006权重量化方法:scale、零点与分组粒度
- kp-007GPTQ:基于 Hessian 的逐层误差补偿
- kp-008AWQ:激活感知的权重量化
- kp-010剪枝:非结构化与结构化
- kp-011知识蒸馏:从 logits 到 on-policy
- kp-013KV Cache:原理与显存占比
- kp-014PagedAttention 与 KV 显存分页管理
- kp-015FlashAttention:IO 感知的精确注意力
- kp-020推理引擎格局:vLLM、SGLang、TensorRT-LLM 与 llama.cpp
- kp-021连续批处理(Continuous Batching)
- kp-022vLLM 参数级配置与调优
- kp-025端侧部署:ONNX Runtime 与 llama.cpp 两条路径