模型部署与推理优化

学习路径

按阶段推进;最小可用路径是覆盖“部署-调优-排错”闭环的最短序列,学完即可独立完成一次生产级部署。

路径完成进度0%

最小可用路径

  1. 1
    推理优化全景与发展脉络

    模型部署与推理优化是把训练好的模型高效、稳定、低成本地跑起来并对外服务的一门工程学科,核心是在延迟、吞吐、显存、成本四个目标与精度约束之间做系统性的交换。

    入门15 分钟
  2. 2
    性能度量:TTFT、TPOT、吞吐与延迟分位数

    推理性能度量用 TTFT(首 token 时间)、TPOT(每 token 时间)、吞吐(tokens/s)与延迟分位数(P50/P99)四组指标,把"快"拆成可优化、可验收的数字。

    入门20 分钟
  3. 3
    Prefill 与 Decode:Transformer 推理的两阶段

    一次 LLM 推理由 Prefill(并行处理全部输入 token)与 Decode(逐 token 自回归生成)两个阶段组成,前者计算密集、后者访存密集,几乎所有推理优化都源于对这个不对称的正确处理。

    核心20 分钟
  4. 4
    显存账本与容量估算

    显存账本把"能不能部署"拆成一个可加总公式:权重 + KV Cache 上限 + 激活与框架开销,其中每一项都能从模型参数与精度直接推出来。

    核心25 分钟
  5. 5
    KV Cache:原理与显存占比

    KV Cache 把每层已算出的 Key/Value 向量存下来供后续 decode 步复用,用显存换掉每步对全序列的重复计算,是自回归推理"能跑"的前提,也是并发显存的最大可变项。

    核心20 分钟
  6. 6
    连续批处理(Continuous Batching)

    连续批处理把调度粒度从"一个请求"细化到"一次前向迭代":每生成一步都允许新请求加入、已完成请求退出,从而让 GPU 永远跑在"当前能装下的最大有效 batch"上,是服务端吞吐的第一支柱。

    核心20 分钟
  7. 7
    vLLM 参数级配置与调优

    vLLM 的部署质量由十余个参数共同决定,核心是三件事:把显存账(gpu-memory-utilization × 卡容量 = 权重 + KV 池)算对、把并发上限(max-num-seqs)与 TPOT SLO 对齐、把前缀缓存与量化等开关按负载画像打开。

    核心30 分钟
  8. 8
    排错清单:OOM、长尾延迟与吞吐瓶颈的定位方法

    推理排错的方法论是"分层定位 + 单变量修改":先按 负载 → 调度/容量 → 算子/硬件 → 数值/参数 四层把症状归类,再用对照实验逐项排除,本页给出高频症状的现成对照表。

    进阶30 分钟

入门阶段(4 个知识点)

核心阶段(14 个知识点)

进阶阶段(9 个知识点)

前沿阶段(2 个知识点)