PD 分离架构:Prefill 与 Decode 的解耦部署
一句话定义
PD 分离(Prefill/Decode disaggregation)把计算密集的 prefill 与访存密集的 decode 拆到不同实例,各自按自身瓶颈配置硬件与调度,实例间传输 KV Cache,从而让两类 SLO 同时达成——是当前大规模服务的前沿架构方向。
为什么重要
混部时两阶段互相伤害:一个 8k 长输入的 prefill 会阻塞同卡上所有 decode,把别人的 TPOT 打成尖刺;而为了 decode 稳定性压小 batch 又浪费 prefill 算力。PD 分离是 DistServe(2024)与 Mooncake(Kimi 生产系统)验证过的解法,代表"推理基础设施化"的方向,也决定了你是否看得懂新一代引擎的架构图。
前置知识
- kp-003(两阶段的瓶颈不对称——本页全部动机的来源)。
核心概念
- 混部冲突:prefill 挤占算力 → decode 停摆(TPOT 尖刺);decode 长尾占用 → prefill 排队(TTFT 尖刺)。同一批资源无法同时优化两个 SLO。
- 分离部署:P 实例按算力配(prefill 计算密集),D 实例按带宽配、追求 batch 大而稳;请求先在 P 实例算完 prefill,KV 迁移到 D 实例继续 decode。
- KV 传输:迁移是分离架构的核心开销,走 RDMA/高速互联,现代实现(如 Mooncake 的 KVCache-centric 设计)把 KV 存储做成全局缓存层——前缀在集群级复用。
- 轻量替代:chunked prefill:不拆机器,把长 prefill 切成小块与 decode 交错调度,缓解(而非消除)干扰;中小规模的首选。
- goodput 目标:以"同时满足 TTFT 与 TPOT SLO 的有效吞吐"为优化对象,而非裸吞吐(kp-002 概念的架构级应用)。
原理与机制
PD 分离把两阶段的不对称推到物理边界:prefill 实例按算力配比、decode 实例按带宽配比,各自运行在自己的甜点区,代价是 KV 要跨实例迁移一次。迁移成本与上下文长度成正比,所以分离只在"长输入、高并发、双 SLO 严格"的场景净收益为正;中小规模用 chunked prefill 在混部内部缓解即可,不必为架构付税。
公式与模型
分离 vs 混部的容量直觉:混部下 decode 实例被 prefill 任务打断的频率随 prefill 占比上升,TPOT P99 ≈ 稳态 TPOT + 每步被插队的 prefill 片段时间;分离后 D 实例 TPOT 方差仅剩自身 batch 波动。DistServe 给出的结论形态:相同 SLO 下分离架构的可承载 QPS 可达混部的数倍(长输入、高并发场景差距最大;短输入小流量则分离不划算——KV 迁移开销吃掉收益)。
图示
混部: [P+D 同卡] prefill 尖刺 → decode 停顿 → TPOT 抖动
分离: 客户端 → Router → P实例×N(算力型) ──KV迁移──► D实例×M(带宽型) ──► 客户端
(TTFT 由P负责) (TPOT 由D负责)
实例或案例
长文档问答平台:输入均值 6k token。混部时 decode 副本被 prefill 打断,TPOT P99 超 200ms 不达标;拆分后 P 实例 4 卡专做 prefill(TTFT P99 800ms),D 实例 8 卡大 batch decode(TPOT P99 30ms),KV 走 RDMA 迁移,单机集群 goodput 提升约 2–3 倍。而输入仅 200 token 的客服机器人则留在 chunked prefill 混部——分离反而更贵。
常见误区
- "PD 分离是万能升级":小流量、短输入场景 KV 迁移开销与管理复杂度为负收益;它的适用域是长输入、高并发、SLO 严格。
- "分离就是多买机器":核心是调度与 KV 传输系统(何时迁、迁到哪、缓存级复用),机器只是载体。
- "chunked prefill 与 PD 分离二选一":chunked prefill 是混部内的缓解手段,也是通往分离的中间站;两者按规模演进。
自测题
- 混部下两阶段互相伤害的机制是什么?
要点:prefill 挤占算力使 decode 停摆、decode 长尾占用使 prefill 排队,两类 SLO 无法同时满足。
- PD 分离新增的核心开销是什么?
要点:实例间 KV Cache 迁移(网络传输与存储管理)。
- 什么负载特征适合 PD 分离?
要点:输入长、并发高、TTFT/TPOT 双 SLO 严格;短输入小流量不划算。
与其他知识点的关系
动机来自 kp-003,SLO 概念来自 kp-002,路由由 kp-023 扩展为"按阶段路由";kp-015 决定 P 实例效率。本页与 kp-019 同为本库前沿档。
延伸阅读
《DistServe》(Zhong 等,2024)与《Mooncake》(Qin 等,2024)——前者给分离的量化论证,后者给生产级 KV 中心架构,合读覆盖该方向全貌。