常见误区总表与选型决策树
一句话定义
本页把全库散落的误区收拢成一张速查总表,并给出"端侧 or 云端、量化几比特、开不开投机、拆不拆 PD"的四问决策树,作为结业时的选型终检。
为什么重要
推理优化的错误大多不是"不懂技术",而是"机制懂了但直觉错了"——把吞吐当延迟、把稀疏度当加速比、把 GPU 利用率当饱和度。决策树的价值在于把 29 个知识点的判断力压缩成 5 分钟能走完的检查流程。
前置知识
核心概念:十大误区速查
| # | 误区 | 事实(对应知识点) |
|---|---|---|
| 1 | 吞吐高=延迟低 | 两者互相拉扯,SLO 先行(kp-002) |
| 2 | 显存只算权重 | KV+激活+开销占大头(kp-004/kp-013) |
| 3 | 量化必然大掉点 | 分组 W4 常在个位数百分比内(kp-006/009) |
| 4 | 位宽÷4=速度×4 | 收益 1.5–2.5×,受 kernel 限制(kp-009) |
| 5 | 稀疏 50%=快 2 倍 | 通用 GPU 无收益,需 2:4 硬件(kp-010) |
| 6 | batch 无限大最好 | SLO 约束下取 goodput 最大点(kp-021) |
| 7 | 投机解码全场景加速 | 仅 decode-bound 小并发(kp-018) |
| 8 | GPU 利用率=饱和度 | decode 时虚高,用队列/TPOT(kp-003/023) |
| 9 | 公开跑分可直接搬 | 版本/配置/负载敏感,自测为准(kp-020) |
| 10 | 优化没有代价 | 精度风险+复杂度+人力都是成本(kp-012/028) |
原理与机制
决策树的每个分支都由一条已经证明过的机制裁定:端侧分支由内存账本裁定,量化分支由带宽瓶颈裁定,投机分支由 decode-bound 判据裁定,PD 分支由两阶段干扰裁定。树只是把这些判据按"验证成本从低到高"排序——先用零成本判据排除选项,再进入需要压测的判据,这正是它比"凭经验拍板"可靠的原因。
选型决策树
Q1 模型跑在哪?
├─ 端侧/内网无GPU → llama.cpp + GGUF Q4_K_M(kp-025/026)
└─ 云端GPU →
Q2 显存账本(权重+KV+开销)是否宽松? (kp-004)
├─ 紧 → W4A16 量化(kp-009); 仍紧 → 缩上下文/加TP
└─ 宽 → FP16 或 W8, 精度优先
Q3 是否有高并发吞吐诉求?
├─ 是 → 连续批处理+SLO压测定并发(kp-021/022)+前缀感知路由(kp-023)
└─ 低并发延迟敏感 → 评估投机解码(kp-018, 看α)
Q4 长输入+双SLO严格+规模大?
├─ 是 → 评估 PD 分离(kp-024)
└─ 否 → chunked prefill 混部即可
实例或案例
演练一次完整走树——“代码补全 SaaS、单卡 A100、7B 模型”:显存账本显示 FP16 可容(走云端分支且不强制量化,但为并发余量选 W8);高并发吞吐诉求 → 连续批处理 + SLO 压测定并发;同时延迟敏感 → 单流场景评估投机解码,代码任务 α 高、采纳;输入短 → 不做 PD 分离。最终配置 = W8 量化 + 连续批处理 + 投机解码,每一个决策都能指回对应知识点。
常见误区(本页元层面的)
- "把决策树当算法执行":它是初检流程,分支处的每个量化/容量数字仍要按各自知识点实测。
- "误区背下来就不会犯":误区会随工具演化变形(如新引擎默认值变化),重要的是背后的机制而非条目。
- "别人家的配置直接抄":负载画像不同,一切数字以自测为准(kp-002 方法论)。
争议与伦理速览
- 开源量化用于生产的边界:通用任务 W4 已被广泛接受;金融/医疗等高风险域必须在真实分布上做任务级验收并留审计记录(kp-009 的留痕纪律)。
- benchmark 文化的陷阱:为跑分调优与为业务调优目标函数不同;采购决策应要求供应商提供与你负载同分布的复测。
- 成本与公平:推理成本决定"谁用得起大模型"——量化/批处理这类把成本降一个量级的技术,兼具工程与公共价值(kp-028 能耗一节)。
自测题
- 走一遍决策树:内网无 GPU 的 3B 需求,落点是什么?
要点:llama.cpp + GGUF Q4_K_M(约 1.8GB),上下文按内存余量设。
- 误区 7 的判据是什么?
要点:decode-bound 且并发小、draft 接受率 α 高;高并发 compute-bound 时不收益。
- 为什么"自建 vs API"不能只比较单价?
要点:要计入利用率折扣、峰值冗余、运维隐性成本(kp-028),量级相当时自建不省。
与其他知识点的关系
本页是 kp-001 全景图的收口与 kp-012/kp-025/kp-028 的决策化重述;排错侧的姊妹篇是 kp-027。
延伸阅读
本节不适用——本页为全库综合,延伸阅读即各对应知识点的延伸条目。