模型部署与推理优化

PD 分离架构:Prefill 与 Decode 的解耦部署

kp-024前沿20 分钟06-推理服务

一句话定义

PD 分离(Prefill/Decode disaggregation)把计算密集的 prefill 与访存密集的 decode 拆到不同实例,各自按自身瓶颈配置硬件与调度,实例间传输 KV Cache,从而让两类 SLO 同时达成——是当前大规模服务的前沿架构方向。

为什么重要

混部时两阶段互相伤害:一个 8k 长输入的 prefill 会阻塞同卡上所有 decode,把别人的 TPOT 打成尖刺;而为了 decode 稳定性压小 batch 又浪费 prefill 算力。PD 分离是 DistServe(2024)与 Mooncake(Kimi 生产系统)验证过的解法,代表"推理基础设施化"的方向,也决定了你是否看得懂新一代引擎的架构图。

前置知识

  • kp-003(两阶段的瓶颈不对称——本页全部动机的来源)。
  • kp-021(混部调度的现状)、kp-023(路由层)。

核心概念

  • 混部冲突:prefill 挤占算力 → decode 停摆(TPOT 尖刺);decode 长尾占用 → prefill 排队(TTFT 尖刺)。同一批资源无法同时优化两个 SLO。
  • 分离部署:P 实例按算力配(prefill 计算密集),D 实例按带宽配、追求 batch 大而稳;请求先在 P 实例算完 prefill,KV 迁移到 D 实例继续 decode。
  • KV 传输:迁移是分离架构的核心开销,走 RDMA/高速互联,现代实现(如 Mooncake 的 KVCache-centric 设计)把 KV 存储做成全局缓存层——前缀在集群级复用。
  • 轻量替代:chunked prefill:不拆机器,把长 prefill 切成小块与 decode 交错调度,缓解(而非消除)干扰;中小规模的首选。
  • goodput 目标:以"同时满足 TTFT 与 TPOT SLO 的有效吞吐"为优化对象,而非裸吞吐(kp-002 概念的架构级应用)。

原理与机制

PD 分离把两阶段的不对称推到物理边界:prefill 实例按算力配比、decode 实例按带宽配比,各自运行在自己的甜点区,代价是 KV 要跨实例迁移一次。迁移成本与上下文长度成正比,所以分离只在"长输入、高并发、双 SLO 严格"的场景净收益为正;中小规模用 chunked prefill 在混部内部缓解即可,不必为架构付税。

公式与模型

分离 vs 混部的容量直觉:混部下 decode 实例被 prefill 任务打断的频率随 prefill 占比上升,TPOT P99 ≈ 稳态 TPOT + 每步被插队的 prefill 片段时间;分离后 D 实例 TPOT 方差仅剩自身 batch 波动。DistServe 给出的结论形态:相同 SLO 下分离架构的可承载 QPS 可达混部的数倍(长输入、高并发场景差距最大;短输入小流量则分离不划算——KV 迁移开销吃掉收益)。

图示

混部:   [P+D 同卡]  prefill 尖刺 → decode 停顿 → TPOT 抖动
分离:   客户端 → Router → P实例×N(算力型) ──KV迁移──► D实例×M(带宽型) ──► 客户端
                          (TTFT 由P负责)         (TPOT 由D负责)

实例或案例

长文档问答平台:输入均值 6k token。混部时 decode 副本被 prefill 打断,TPOT P99 超 200ms 不达标;拆分后 P 实例 4 卡专做 prefill(TTFT P99 800ms),D 实例 8 卡大 batch decode(TPOT P99 30ms),KV 走 RDMA 迁移,单机集群 goodput 提升约 2–3 倍。而输入仅 200 token 的客服机器人则留在 chunked prefill 混部——分离反而更贵。

常见误区

  • "PD 分离是万能升级":小流量、短输入场景 KV 迁移开销与管理复杂度为负收益;它的适用域是长输入、高并发、SLO 严格。
  • "分离就是多买机器":核心是调度与 KV 传输系统(何时迁、迁到哪、缓存级复用),机器只是载体。
  • "chunked prefill 与 PD 分离二选一":chunked prefill 是混部内的缓解手段,也是通往分离的中间站;两者按规模演进。

自测题

  1. 混部下两阶段互相伤害的机制是什么?

要点:prefill 挤占算力使 decode 停摆、decode 长尾占用使 prefill 排队,两类 SLO 无法同时满足。

  1. PD 分离新增的核心开销是什么?

要点:实例间 KV Cache 迁移(网络传输与存储管理)。

  1. 什么负载特征适合 PD 分离?

要点:输入长、并发高、TTFT/TPOT 双 SLO 严格;短输入小流量不划算。

与其他知识点的关系

动机来自 kp-003,SLO 概念来自 kp-002,路由由 kp-023 扩展为"按阶段路由";kp-015 决定 P 实例效率。本页与 kp-019 同为本库前沿档。

延伸阅读

《DistServe》(Zhong 等,2024)与《Mooncake》(Qin 等,2024)——前者给分离的量化论证,后者给生产级 KV 中心架构,合读覆盖该方向全貌。

#PD 分离#chunked prefill#DistServe#Mooncake#前沿架构