模型部署与推理优化

术语表

共 53 条术语;输入关键词即时过滤。

术语英文释义
推理Inference用训练好的模型对输入做前向计算并生成输出的过程
PrefillPrefill推理第一阶段:并行处理全部输入 token,产出首 token 并生成 KV Cache
DecodeDecode推理第二阶段:逐 token 自回归生成,访存密集
TTFTTime To First Token请求发出到第一个 token 返回的时间,含排队与 prefill
TPOTTime Per Output Token首 token 之后平均每 token 的生成间隔,其倒数为单流速度
吞吐Throughput系统单位时间产出的 token 总数,汇报须注明并发数
好吞吐Goodput同时满足全部 SLO 的请求所计的有效吞吐
P9999th Percentile把样本排序后 99% 位置的分位数,SLO 的标准口径
算术强度Arithmetic IntensityFLOPs ÷ 读取字节数,判断计算/访存瓶颈的量尺
RooflineRoofline Model用 max(计算时间, 访存时间) 判定瓶颈的性能模型
KV CacheKV Cache缓存的历史 token 的 Key/Value 张量,随序列与并发线性增长
PagedAttentionPagedAttention把 KV 按固定 block 分页管理的技术,消灭按最大长度预留的浪费(vLLM)
连续批处理Continuous Batching以一次前向迭代为调度粒度,请求随时进出批队列(in-flight batching)
量化Quantization把数值映射到低位宽格式(INT8/INT4/FP8)以省显存与带宽
PTQPost-Training Quantization训练后量化,不重训练模型
QATQuantization-Aware Training量化感知训练,训练中模拟量化误差
权重量化Weight-only Quantization仅量化权重、激活保持高精度的方案(W4A16 等)
Scale / 零点Scale / Zero-point量化还原所需的步长与偏移,按组存储
分组量化Group-wise Quantization每 32/64/128 个权重共用一组 scale,4-bit 主流形态
GPTQGPTQ基于 Hessian 的逐层误差补偿式 PTQ 算法
AWQActivation-aware Weight Quantization用每通道缩放保护显著权重的 PTQ 算法
离群值Outlier激活中幅度异常大的通道,是 LLM 量化难度的来源
FP8FP88-bit 浮点格式,E4M3 与 E5M2 两种变体
BF16BFloat16与 FP32 同指数位的 16-bit 浮点,动态范围大
剪枝Pruning删除不重要的权重/通道/层,分非结构化与结构化
2:4 稀疏2:4 Sparsity每 4 个连续权重保留 2 个的半结构化稀疏,需 Ampere+ 硬件支持
知识蒸馏Knowledge Distillation学生模型模仿教师软分布的学习方式
温度Temperaturesoftmax 前对 logits 缩放的参数,控制输出随机性
Top-p / Top-kNucleus / Top-k Sampling按累计概率或个数截断候选集的采样策略
投机解码Speculative Decoding小模型草拟、大模型并行验证的加速法,输出分布无损
接受率Acceptance Rate (α)投机解码中 draft 被目标模型接受的比例,决定收益上界
MedusaMedusa目标模型附加多头预测的自投机方案
EAGLEEAGLE在特征层训练轻量 draft 头的高接受率投机方案
FlashAttentionFlashAttention分块 + online softmax 的 IO 感知精确注意力实现
Online SoftmaxOnline Softmax分块计算 softmax 时维护运行最大值/和的技巧
GQA / MQAGrouped / Multi-Query Attention多个 query 头共享一组或多组 KV 头,压缩 KV 体积
滑动窗口Sliding Window Attention只保留最近 W 个 token 注意力视野的机制
token 淘汰Token Eviction按重要性淘汰 KV 中低价值 token 的压缩思路
张量并行Tensor Parallelism把权重矩阵切到多卡并行计算的部署方式
GPU 利用率GPU UtilizationSM 被占用的时间比例,decode 场景虚高、不可当容量指标
抢占Preemption显存不足时引擎换出/重算部分请求 KV 的调度行为
前缀缓存Prefix Caching复用相同前缀的 KV 块以省 prefill 的工作
会话亲和Session Affinity把同一会话固定路由到同一副本以保留 KV 缓存
PD 分离Prefill/Decode Disaggregation把 prefill 与 decode 拆到不同实例、实例间迁移 KV 的架构
Chunked PrefillChunked Prefill把长 prefill 切块与 decode 交错调度以降 TTFT 长尾
GGUFGGUFllama.cpp 的单文件模型容器格式(权重+分词器+元数据)
Q4_K_MQ4_K_MGGUF K-quant 家族的 4-bit 甜点档位(混精度配比)
mmapMemory-mapped File按需映射权重文件的内存管理方式,冷启动快
ONNXOpen Neural Network Exchange跨框架模型交换格式,配合 ONNX Runtime 多后端执行
OOMOut Of Memory显存/内存不足错误,排错第一优先项
Little's LawLittle's LawL = λ×W,用到达率与停留时间换算系统并发量的定律
困惑度Perplexity (PPL)语言模型对文本的预测困惑度,量化验收的常用代理指标
热节流Thermal Throttling设备过热降频导致推理速度下降的现象