术语表
共 53 条术语;输入关键词即时过滤。
| 术语 | 英文 | 释义 |
|---|---|---|
| 推理 | Inference | 用训练好的模型对输入做前向计算并生成输出的过程 |
| Prefill | Prefill | 推理第一阶段:并行处理全部输入 token,产出首 token 并生成 KV Cache |
| Decode | Decode | 推理第二阶段:逐 token 自回归生成,访存密集 |
| TTFT | Time To First Token | 请求发出到第一个 token 返回的时间,含排队与 prefill |
| TPOT | Time Per Output Token | 首 token 之后平均每 token 的生成间隔,其倒数为单流速度 |
| 吞吐 | Throughput | 系统单位时间产出的 token 总数,汇报须注明并发数 |
| 好吞吐 | Goodput | 同时满足全部 SLO 的请求所计的有效吞吐 |
| P99 | 99th Percentile | 把样本排序后 99% 位置的分位数,SLO 的标准口径 |
| 算术强度 | Arithmetic Intensity | FLOPs ÷ 读取字节数,判断计算/访存瓶颈的量尺 |
| Roofline | Roofline Model | 用 max(计算时间, 访存时间) 判定瓶颈的性能模型 |
| KV Cache | KV Cache | 缓存的历史 token 的 Key/Value 张量,随序列与并发线性增长 |
| PagedAttention | PagedAttention | 把 KV 按固定 block 分页管理的技术,消灭按最大长度预留的浪费(vLLM) |
| 连续批处理 | Continuous Batching | 以一次前向迭代为调度粒度,请求随时进出批队列(in-flight batching) |
| 量化 | Quantization | 把数值映射到低位宽格式(INT8/INT4/FP8)以省显存与带宽 |
| PTQ | Post-Training Quantization | 训练后量化,不重训练模型 |
| QAT | Quantization-Aware Training | 量化感知训练,训练中模拟量化误差 |
| 权重量化 | Weight-only Quantization | 仅量化权重、激活保持高精度的方案(W4A16 等) |
| Scale / 零点 | Scale / Zero-point | 量化还原所需的步长与偏移,按组存储 |
| 分组量化 | Group-wise Quantization | 每 32/64/128 个权重共用一组 scale,4-bit 主流形态 |
| GPTQ | GPTQ | 基于 Hessian 的逐层误差补偿式 PTQ 算法 |
| AWQ | Activation-aware Weight Quantization | 用每通道缩放保护显著权重的 PTQ 算法 |
| 离群值 | Outlier | 激活中幅度异常大的通道,是 LLM 量化难度的来源 |
| FP8 | FP8 | 8-bit 浮点格式,E4M3 与 E5M2 两种变体 |
| BF16 | BFloat16 | 与 FP32 同指数位的 16-bit 浮点,动态范围大 |
| 剪枝 | Pruning | 删除不重要的权重/通道/层,分非结构化与结构化 |
| 2:4 稀疏 | 2:4 Sparsity | 每 4 个连续权重保留 2 个的半结构化稀疏,需 Ampere+ 硬件支持 |
| 知识蒸馏 | Knowledge Distillation | 学生模型模仿教师软分布的学习方式 |
| 温度 | Temperature | softmax 前对 logits 缩放的参数,控制输出随机性 |
| Top-p / Top-k | Nucleus / Top-k Sampling | 按累计概率或个数截断候选集的采样策略 |
| 投机解码 | Speculative Decoding | 小模型草拟、大模型并行验证的加速法,输出分布无损 |
| 接受率 | Acceptance Rate (α) | 投机解码中 draft 被目标模型接受的比例,决定收益上界 |
| Medusa | Medusa | 目标模型附加多头预测的自投机方案 |
| EAGLE | EAGLE | 在特征层训练轻量 draft 头的高接受率投机方案 |
| FlashAttention | FlashAttention | 分块 + online softmax 的 IO 感知精确注意力实现 |
| Online Softmax | Online Softmax | 分块计算 softmax 时维护运行最大值/和的技巧 |
| GQA / MQA | Grouped / Multi-Query Attention | 多个 query 头共享一组或多组 KV 头,压缩 KV 体积 |
| 滑动窗口 | Sliding Window Attention | 只保留最近 W 个 token 注意力视野的机制 |
| token 淘汰 | Token Eviction | 按重要性淘汰 KV 中低价值 token 的压缩思路 |
| 张量并行 | Tensor Parallelism | 把权重矩阵切到多卡并行计算的部署方式 |
| GPU 利用率 | GPU Utilization | SM 被占用的时间比例,decode 场景虚高、不可当容量指标 |
| 抢占 | Preemption | 显存不足时引擎换出/重算部分请求 KV 的调度行为 |
| 前缀缓存 | Prefix Caching | 复用相同前缀的 KV 块以省 prefill 的工作 |
| 会话亲和 | Session Affinity | 把同一会话固定路由到同一副本以保留 KV 缓存 |
| PD 分离 | Prefill/Decode Disaggregation | 把 prefill 与 decode 拆到不同实例、实例间迁移 KV 的架构 |
| Chunked Prefill | Chunked Prefill | 把长 prefill 切块与 decode 交错调度以降 TTFT 长尾 |
| GGUF | GGUF | llama.cpp 的单文件模型容器格式(权重+分词器+元数据) |
| Q4_K_M | Q4_K_M | GGUF K-quant 家族的 4-bit 甜点档位(混精度配比) |
| mmap | Memory-mapped File | 按需映射权重文件的内存管理方式,冷启动快 |
| ONNX | Open Neural Network Exchange | 跨框架模型交换格式,配合 ONNX Runtime 多后端执行 |
| OOM | Out Of Memory | 显存/内存不足错误,排错第一优先项 |
| Little's Law | Little's Law | L = λ×W,用到达率与停留时间换算系统并发量的定律 |
| 困惑度 | Perplexity (PPL) | 语言模型对文本的预测困惑度,量化验收的常用代理指标 |
| 热节流 | Thermal Throttling | 设备过热降频导致推理速度下降的现象 |