模型部署与推理优化

学习站 · inference.xph.ink

模型部署与推理优化

模型部署与推理优化(Model Deployment & Inference Optimization)研究的是训练完成后那段路:如何让大语言模型以可接受的延迟、吞吐、显存占用与成本,稳定地跑在云端 GPU 集群、公司内网服务器或用户的手机与笔记本上。它不是训练技术的延伸课,而是一门独立学科——训练追求的是 loss,部署追求的是「每瓦特、每美元、每毫秒」下的 token 产出。

7模块
29知识点
665分钟总时长
4入门 / 14核心 / 9进阶 / 2前沿难度分布
总体学习进度0%

最小可用路径(约 180 分钟)

从零把一个 7B 模型部署进生产并会排查故障的最短闭环。

  1. kp-001 · 推理优化全景与发展脉络15 分钟
  2. kp-002 · 性能度量:TTFT、TPOT、吞吐与延迟分位数20 分钟
  3. kp-003 · Prefill 与 Decode:Transformer 推理的两阶段20 分钟
  4. kp-004 · 显存账本与容量估算25 分钟
  5. kp-013 · KV Cache:原理与显存占比20 分钟
  6. kp-021 · 连续批处理(Continuous Batching)20 分钟
  7. kp-022 · vLLM 参数级配置与调优30 分钟
  8. kp-027 · 排错清单:OOM、长尾延迟与吞吐瓶颈的定位方法30 分钟

全部模块

01-全景与度量 · 全景与性能度量

02-量化压缩 · 模型量化

03-剪枝与蒸馏 · 剪枝与蒸馏

04-KV与注意力 · KV Cache 与注意力优化

05-解码与投机 · 解码策略与投机解码

06-推理服务 · 推理服务架构

07-端侧与实践 · 端侧部署与工程实践