Prefill-as-a-Service: KV Cache of Next-Generation Models Could Go Cross-Datacenter

Authors: Ruoyu Qin, Weiran He, Yaoyu Wang, Zheming Li, Xinran Xu, Yongwei Wu, Weimin Zheng, Mingxing Zhang

Affiliations: Moonshot AI, Tsinghua University

Venue: arXiv (arXiv:2506.10934)

Year: 2026

Pages: 16


1. 研究摘要 (Research Summary)

大语言模型(LLM)推理服务的规模化和效率优化,已经成为人工智能基础设施领域的核心挑战之一。在这一背景下,Prefill-Decode(PD)分离架构(disaggregation)应运而生,并迅速成为大规模LLM部署的标准范式。PD分离的核心洞见在于:推理过程中的两个计算阶段——Prefill(预填充,主要受限于计算吞吐量)和Decode(解码生成,主要受限于内存带宽)——具有截然不同的资源需求特征。将它们部署在独立的计算节点上,可以分别针对各自瓶颈进行优化,从而提升整体资源利用率。Moonshot AI推出的Mooncake系统率先将KV Cache(键值缓存)视为系统中的一等公民,通过高效的跨节点KV Cache传输机制,推动了PD分离从理论走向实践。这一方向随后被vLLM、SGLang、Dynamo等开源框架广泛采纳,成为业界共识。

然而,PD分离在实践中的部署边界至今仍被一个核心瓶颈所束缚:KV Cache传输。在传统密集注意力(dense-attention)模型中,Prefill阶段生成的KV Cache数据量极为庞大——对于长上下文请求,单个模型实例可以产生数十Gbps的KV Cache流量。这种巨大的传输需求迫使Prefill和Decode节点必须部署在同一个高带宽、低延迟的网络域内(通常是基于RDMA的单一数据中心内部网络),两者被紧密耦合在一起。这种耦合带来了深层的系统性限制:首先,它阻碍了异构部署(heterogeneous deployment)——即让计算密集型的Prefill运行在专门的计算加速器上,而内存带宽密集型的Decode运行在带宽优化的加速器上。尽管硬件路线图已经明确朝着这个方向演进(NVIDIA的Rubin CPX专门针对高吞吐量长上下文Prefill,而Groq的LPU等架构则强调Decode所需的极端内存带宽),但在现实中,不同类型的加速器往往无法共享同一个RDMA网络域。其次,即使在单一数据中心内部强制部署异构硬件,Prefill与Decode的硬件配比也会随着流量模式的演化而迅速失衡,导致严重的资源搁浅(stranded capacity)和负载不均衡。因此,PD分离所承诺的灵活性和弹性,在跨数据中心尺度上始终难以兑现。

这篇论文的出发点和核心贡献,正是在于系统地打破这一瓶颈。作者们观察到,近期的混合注意力架构(hybrid-attention architectures)——通过在模型中交替使用少量全注意力层和大量线性复杂度或有限状态层——从根本上改变了KV Cache的增长特性,使其相对传统密集注意力模型降低了一个数量级。这意味着,跨数据中心的KV Cache传输在理论上变得可行。但作者们进一步指出,仅凭模型侧的KV Cache压缩并不足以让跨数据中心异构服务真正落地。现实中的工作负载具有显著的突发性(bursty)、请求长度高度偏斜(highly skewed)、前缀缓存(prefix cache)分布不均匀,且跨集群带宽存在波动。一个简单地将所有Prefill外部化到远程集群的朴素设计,仍然会因为上述系统性挑战而陷入拥塞、队列不稳定和资源利用率低下的困境。

基于这一深刻洞察,论文提出了Prefill-as-a-Service(PrfaaS)架构——一种跨数据中心的服务架构,通过选择性卸载(selective offloading)、带宽感知调度(bandwidth-aware scheduling)和缓存感知请求放置(cache-aware request placement)三者协同,将长上下文Prefill任务卸载到独立的、计算密集的Prefill集群,然后通过标准以太网将生成的KV Cache传输到本地的PD集群进行Decode。这一设计的关键在于,它并不要求异构加速器共享同一个低延迟RDMA网络,从而使Prefill和Decode容量能够在松耦合的集群之间独立扩展。论文通过一个内部1T参数的混合架构模型的案例研究证明,PrfaaS增强的异构部署相比同构PD基线实现了54%更高的服务吞吐量64%更低的P90 TTFT(Time To First Token),在同等成本下吞吐量提升约15%,而消耗的跨数据中心带宽仅为100Gbps以太网链路的13%。

从更宏观的视角来看,这项工作重新界定了PD分离的部署边界:从"单数据中心RDMA孤岛"扩展到"跨数据中心商品以太网互联"。它揭示了一个重要的系统级真理——模型架构创新与系统设计必须协同演进:混合注意力模型提供了必要的KV Cache效率,但只有通过系统级的选择性卸载和智能调度,这种效率才能转化为实际的部署收益。这一洞见对于下一代LLM服务系统的构建具有深远的指导意义。

2. 理论框架 (Theoretical Framework)

2.1 带宽墙:传统PD分离的结构性瓶颈

要理解PrfaaS的理论基础,必须首先回到传统PD分离架构中的"带宽墙"(Bandwidth Wall)问题。在标准Transformer注意力机制中,KV Cache的存储量与序列长度呈线性增长关系。当一个长上下文请求(例如32K tokens)经过Prefill阶段时,模型需要为每一层、每一个注意力头存储Key和Value向量。对于密集注意力模型,这些向量累积起来可以达到数十GB的规模。当Prefill和Decode位于不同节点时,这些数据必须通过网络从Prefill节点传输到Decode节点。这一传输需求构成了PD分离架构的核心约束。

论文用KV吞吐量(KV throughput)这一精炼的指标来量化这一瓶颈。KV吞吐量定义为单个模型实例在Prefill过程中产生KV Cache的速率:

Φkv(l)=Skv(l)Tprefill(l)

其中,Skv(l) 表示长度为 l 的请求所产生的KV Cache大小,Tprefill(l) 是对应的Prefill延迟。这个公式将模型架构特性与系统传输需求直接联系起来:分子反映"产生了多少数据",分母反映"以多快的速度产生",它们的比值决定了Prefill集群的出站带宽需求。对于传统密集注意力模型(如MiniMax-M2.5),在32K token输入下,单个实例的KV吞吐量高达约60 Gbps。这意味着一个多实例的Prefill集群需要Tbps级别的出站带宽才能避免GPU空闲等待。这种级别的带宽需求完全超出了跨数据中心商品以太网的能力范围,因此传统PD部署被牢牢锁定在单数据中心的RDMA网络域内。

2.2 混合注意力架构:重新定义部署边界

混合注意力架构的兴起从根本上改变了上述方程。通过在模型中交替配置不同类型的注意力层,混合模型实现了KV Cache的显著压缩。论文在表2中对主流注意力改进进行了系统的分类,从两个维度——Prefill延迟 Tprefill 和KV吞吐量 Φkv ——来刻画它们的特性。全注意力机制(如GQA、MLA)保持二次复杂度,Prefill成本高且KV吞吐量大;稀疏注意力可以降低计算量,但KV Cache仍依赖序列长度;而线性注意力(Linear Attention)和滑动窗口注意力(SWA)不仅保持线性计算复杂度,其有限状态尺寸(bounded state size)更是大幅压缩了KV吞吐量。

论文表3中的基准测试结果清晰地展示了这一转变的量化效应。在32K token输入下,采用混合架构的MiMo-V2-Flash的KV吞吐量为4.66 Gbps,而密集架构的MiniMax-M2.5则高达59.93 Gbps——两者相差13倍。Qwen3.5-397B(8.25 Gbps)与Qwen3-235B(33.35 Gbps)相比也有4倍的缩减。对于文中重点分析的Ring-2.5-1T模型,MLA机制本身带来约4.5×的KV压缩,而7:1的混合比例进一步带来约8×的缩减,总体KV内存节省约36倍。

这一架构演进所带来的系统级含义是深远的。它并非简单地"降低了成本",而是将PD分离的可部署网络边界从RDMA级网络推向了商品以太网。在密集模型中,Prefill产生数据的速度超过了网络传输能力,网络成为两阶段之间的硬性耦合点;而在混合模型中,Prefill仍然执行大量计算,但产生的KV Cache数据量急剧减少,从而进入了一个"网络不再必然是瓶颈"的定性不同的运行区间。这为跨数据中心PD分离创造了先决条件,但正如作者反复强调的,这一条件只是"可行"而非"免费"——系统设计的挑战才刚刚开始。

2.3 从集群级到系统级的带宽建模

将KV吞吐量的分析从单实例扩展到集群级别,论文推导出了Prefill集群的最小出站带宽需求:

Bout=NPE[Skv]E[Tprefill]NPΦkv(Lavg)

其中 N 是GPU总数,P 是并行度(每实例GPU数),Lavg 是实际卸载到PrfaaS集群的请求的平均未缓存输入长度。这个公式揭示了一个关键洞见:Bout 不仅取决于由模型架构和硬件决定的 Φkv,还取决于由请求长度分布、前缀缓存命中率和路由策略共同塑造的 Lavg这恰恰说明了为什么混合模型本身并不足够——系统侧的选择性卸载和带宽感知调度决定了哪些请求消耗跨数据中心带宽,从而直接影响带宽需求的最终数值

论文通过具体数值验证了这一论点。对于一个512 H200 GPU的Prefill集群,在 Lavg=32K 的配置下,密集模型MiniMax-M2.5和Qwen3分别需要3.8 Tbps和2.1 Tbps的出站带宽,这完全锁定了单集群部署。而混合架构模型(如Ring-2.5-1T)的带宽需求降至约170 Gbps,当通过路由策略将更长请求(128K tokens)定向到PrfaaS集群时,带宽需求进一步降至100 Gbps以下。即使在万卡数据中心规模,总出站带宽需求也仅约1.8 Tbps,完全在现代数据中心互联的能力范围内。

2.4 吞吐量模型的理论构建

为了指导系统设计和参数优化,论文构建了一个简洁而有效的分析吞吐量模型。模型将系统划分为三个角色:PrfaaS Prefill(远程预填充)、PD-P(本地PD集群内的预填充节点)和PD-D(本地PD集群内的解码节点)。系统的端到端吞吐量由最慢的瓶颈阶段决定:

Λmax=min(Θprfaasp,Θpdp1p,Θpdd)

其中 p 是被路由到PrfaaS的请求比例,ΘprfaasΘpdpΘpdd 分别是三个角色的吞吐量。PrfaaS的吞吐量由Prefill计算和KV Cache传输的较慢者决定:

Θprfaas=min(NprfaasTprefill(llong),BoutSkv(llong))

这个min结构精确捕捉了PrfaaS集群的双重约束:如果计算速度是瓶颈,增加GPU可以提升吞吐;如果网络带宽是瓶颈,单纯增加GPU则无济于事。PD-P的吞吐量仅由计算容量决定,而PD-D的吞吐量则由解码批大小和输出长度约束。

基于这一模型,论文推导了两个关键的优化条件:

条件一(路由阈值优化):最优路由阈值 t 应使PrfaaS和PD-P的归一化吞吐量相等:

Θprfaasp=Θpdp1p

直观上,这要求两个上游生产者的"单位负载产能"平衡。如果阈值过低,过多短请求涌入PrfaaS,每个请求的KV Cache传输开销相对其计算收益不成比例,PrfaaS侧的网络瓶颈将限制系统吞吐;如果阈值过高,PrfaaS集群资源闲置,PD-P侧过载。最优阈值恰好位于两者的交汇点。

条件二(预填充/解码配比优化):在PD集群内部,预填充与解码实例的配比应满足:

Θprfaas+Θpdp=Θpdd

这保证了上游生产者的总输出恰好匹配下游消费者的处理能力。过少预填充节点会"饿死"Decode阶段;过多预填充节点则导致Prefill计算资源闲置。论文通过二维网格搜索(grid search)高效求解这两个耦合变量,展示了理论模型如何直接转化为系统配置参数。

3. 技术架构 (Technical Architecture)

3.1 系统全景:三层子系统的协同设计

PrfaaS-PD架构的精髓在于将跨数据中心异构推理服务分解为三个相互协作的子系统:计算子系统、网络子系统和存储子系统。这种分层设计不仅清晰划分了功能边界,更重要的是反映了真实部署环境中的物理约束和机会。

计算子系统由多个独立的集群组成,每个集群仅包含同构硬件——这是因为不同类型的加速器在物理形态、散热需求和部署环境上往往难以共置。集群分为两类:本地PD集群(Local PD Cluster)负责PD分离服务,能够独立完成请求的全流程推理;PrfaaS集群则专门提供远程长上下文Prefill能力,仅处理增量未缓存长度超过路由阈值 t 的请求。这种"计算特化"的设计思路——让PrfaaS集群使用高吞吐量、成本效益更优的计算加速器——是系统效率的核心来源之一。

网络子系统跨越两个层级:集群内部网络使用RDMA进行延迟敏感的集合通信和PD KV Cache传输,而集群之间的链路则依赖VPC对等互联或专线,通过标准以太网传输跨数据中心KV Cache。这种"双轨网络"设计是对现实约束的务实回应:RDMA在高性能计算集群内部成熟可靠,但跨数据中心部署RDMA在工程上复杂且成本高昂;而商品以太网虽然延迟较高,但带宽能力足以承载混合模型压缩后的KV Cache传输。

存储子系统在每个集群内部构建分布式混合前缀缓存池(Hybrid Prefix Cache Pool),由全局KV Cache管理器维护跨所有集群的元数据。全局调度器位于这些基础设施组件之上,基于请求特征、网络条件和缓存分布进行智能路由,最大化跨集群带宽约束下的端到端吞吐量。

3.2 混合前缀缓存池:适配混合模型的存储创新

传统前缀缓存池(Prefix Cache Pool)假设KV Cache是统一类型的,可以在token或block级别进行匹配和逐出。然而,混合模型引入了一个根本性的异构性:线性注意力层(如KDA、SWA)的循环状态是请求级别的——其大小与输入长度无关,且只能在缓存长度完全匹配时复用;而全注意力层的KV Cache是块级别的——随输入长度线性增长,并支持部分前缀匹配。这种异构性挑战了传统"全层统一"的KV Cache存储范式。

PrfaaS的解决方案是在vLLM混合KV Cache管理器的基础上,构建了一个针对跨集群传输优化的混合前缀缓存系统。如图4所示,线性状态和全注意力KV Cache由独立的KV Cache组管理,但使用对齐的块大小从共享的KV Cache池中分配和释放。在此之上,缓存块被进一步划分为两个类别:

当一个新请求到达时,全局KV Cache管理器计算每个集群的前缀匹配信息,请求路由器利用这些信息选择Prefill集群和集群内具有缓存亲和性(cache-affinitive)的节点。此外,管理器还执行缓存再平衡(cache rebalancing)以缓解热点问题——在跨集群带宽充足时,甚至可以跨集群传输缓存块,进一步提升缓存命中率和减少冗余计算。

3.3 跨集群KV Cache传输的工程实现

即使混合模型大幅降低了KV Cache的标称带宽需求,突发性流量和不均衡的链路利用率仍可能导致拥塞,增加队列延迟并降低KV Cache交付效率。为此,PrfaaS在传输层采用了三项互补的技术措施来平滑流量并维持高链路利用率。

首先是层间Prefill流水线(Layer-wise Prefill Pipelining),将KV Cache的生成与传输重叠。在逐层计算的过程中,已完成的层所产生的KV Cache可以立即开始传输,而不必等到整个Prefill阶段结束。这种流水线机制有效隐藏了网络延迟,使传输与计算并行进行。其次是多连接TCP传输,通过建立多个并发连接来充分利用可用带宽,避免单条TCP连接因拥塞控制或协议开销而无法饱和物理链路。第三是拥塞监测与调度器联动,系统持续监测跨集群链路的丢包和重传信号,在拥塞积累的早期阶段就触发调度策略调整,将请求路由回本地PD路径,避免PrfaaS集群的出站链路成为持久瓶颈。

这三项技术的组合体现了论文的核心设计哲学:在模型创新降低了"标称带宽需求"的基础上,系统工程通过流水线、并行传输和拥塞感知来确保"实际带宽利用"的稳定高效。

3.4 双时间尺度调度:从理论到实践的桥梁

如果说§3.4.1和§3.4.2的吞吐量模型为稳态优化提供了理论指导,那么§3.4.3的双时间尺度调度算法则是应对真实世界动态性的工程解决方案。理论分析假设了稳态流量和恒定链路条件,但生产环境中流量突发、链路抖动和缓存热点持续存在。调度器必须同时应对两个时间尺度的变化:秒级的带宽波动和分钟级的流量趋势变化。

短期调度:带宽与缓存感知的路由。PrfaaS集群有一个由带宽强加的吞吐量上限 Bout/Skv(llong)。当集群接近这个上限时,出站链路处会发生拥塞。调度器持续监测PrfaaS的出站利用率和请求队列深度,当利用率接近阈值或队列激增时,触发短期路由调整。在初始化或策略更新时,调度器首先对应当的计算容量和出站带宽进行画像分析,然后基于前缀匹配后的增量Prefill长度分布搜索最优阈值 t。通过仅将足够长的请求路由到PrfaaS,调度器降低了每个请求的带宽需求,避免了在带宽上限附近的拥塞。

对于具有前缀缓存命中的请求,调度器必须联合考虑缓存亲和性和带宽可用性。设 ltotal 为请求的总输入长度,lprfaaslpd 分别为在PrfaaS和PD集群中的缓存前缀长度。当带宽稀缺时,各集群的前缀缓存被独立评估:如果 ltotallpdt,请求在本地PD-P预填充;否则卸载到PrfaaS。当带宽充裕时,计算成为更稀缺的资源,调度器考虑所有集群中的最佳缓存:令 lprefix=max(lprfaas,lpd),如果 ltotallprefixt,请求在PD-P处理;否则前往PrfaaS。如果最优缓存所在的集群与计算集群不同,则触发跨集群缓存传输。

长期调度:流量驱动的资源再优化。在更长的时间尺度上,流量量的变化会造成流水线各阶段的持久性失衡。当上游总吞吐量(Θprfaas+Θpdp)远小于下游Decode吞吐量(Θpdd)时,Prefill成为系统瓶颈;反之则Decode成为瓶颈。调度器通过监测各阶段的队列深度和利用率来识别瓶颈所在。由于这一时间尺度上的流量变化通常是缓慢且周期性的,调度器定期重新评估负载平衡,并在PD集群内部将节点在Prefill和Decode角色之间转换,调整 NpNd 以恢复最优性条件。随着实例数量的变化,路由阈值 t 也被相应重新优化。这种"粗粒度资源重组 + 细粒度路由调整"的双时间尺度策略,使系统能够在保持稳态效率的同时,适应动态变化的生产环境。

4. 实验评估 (Experimental Evaluation)

4.1 实验设计与硬件配置

论文通过一个内部1T参数混合架构模型的案例研究,系统评估了PrfaaS-PD架构在真实硬件和部署设置下的可行性、带宽占用和性能收益。实验部署包含两个通过VPC网络互联的集群,提供约100Gbps的聚合跨集群带宽。PrfaaS集群由32个H200 GPU组成,专门用于长上下文Prefill;本地PD集群由64个H20 GPU组成,运行传统PD分离模式,内部使用800Gbps RDMA互联,其Prefill/Decode比例可根据流量调整。作为基线对比,实验还构建了一个96 H20 GPU的同构PD集群。

被测模型是一个1T参数的内部混合模型,采用Kimi Linear架构的3:1 KDA:MLA层交错结构。模型以8 GPU每实例部署,并使用内部优化的vLLM进行Prefill和Decode性能画像。工作负载的输入长度服从截断对数正态分布(μ=9.90,σ=1.00,截断至[128,128K]),均值约27K tokens,反映了真实世界长上下文工作负载的分布特征。输出长度固定为1024 tokens,SLO目标为40 tokens/s(不含推测解码)。所有吞吐量和带宽结果均通过将实测画像数据代入§3.4的吞吐量模型计算得出。

4.2 模型画像与参数优化

论文首先对内部1T模型进行了详细的画像分析,结果如表5所示。随着输入长度从1K增加到128K,KV Cache大小从190.8 MiB增长到2316.3 MiB,Prefill延迟从0.44秒增长到7.40秒,而KV吞吐量则从3.61 Gbps缓慢下降至2.62 Gbps。值得注意的是,混合架构的KV吞吐量在长上下文下保持相对稳定,这与其他模型(如表3所示的密集模型在长序列下KV吞吐量急剧攀升)形成鲜明对比。这种稳定性对于跨数据中心传输的带宽规划至关重要——它意味着系统可以基于一个相对恒定的带宽需求来配置资源,而不必为极端长度的请求预留过量的带宽余量。

基于画像数据,论文应用PrfaaS-PD吞吐量模型进行二维网格搜索,优化路由阈值 t 和PD集群内Prefill/Decode分配。图5展示了搜索过程:固定一个变量后,在另一个变量上寻找最优值。图5a显示,在固定阈值 t 的情况下,系统吞吐量在Prefill和Decode能力大致平衡时达到峰值,最优配置为 Np=3Nd=5。图5b固定 Np=3Nd=5,此时 Λmaxmin(Θprfaas/p,Θpdp/(1p)) 决定。两条曲线在最优阈值处相交,得到 t=19.4K 的最优解。在这个操作点,约50%的请求(较长的那些)被卸载到PrfaaS集群,充分利用了高计算吞吐量加速器的优势。

4.3 核心结果分析

表6系统对比了三种部署配置的最优性能指标:

Metric PrfaaS-PD Homogeneous PD Naive Heterogeneous PD
Threshold t 19.4K
Nprfaas / Np / Nd 4 / 3 / 5 — / 9 / 3 4 / — / 8
Mean / P90 TTFT (s) 2.22 / 3.51 4.44 / 9.73 1.74 / 3.51
Θprfaas / Θpdp / Θpdd (req/s) 1.61 / 1.64 / 3.91 — / 2.11 / 2.35 2.45 / — / 6.25
Λmax (req/s) 3.24 2.11 2.45
Ratio 1.54× 1.00× 1.16×

跨数据中心带宽占用是验证架构可行性的首要前提。在最优配置 t=19.4K 下,49.6%的请求被路由到PrfaaS,卸载子集的平均长度约为44K tokens。由此计算,PrfaaS集群的聚合出站负载仅约13 Gbps,仅消耗了100Gbps以太网链路的13%。这证明了在适当调度下,混合架构模型的KV Cache完全可以通过商品以太网传输,且留有充足余量。相比之下,传统Transformer模型的全KV头将产生显著更大的传输量,很可能需要RDMA级互联才能支撑。

与同构PD基线的对比凸显了异构部署的根本性优势。在同构配置(96 H20 GPU)中,系统吞吐量在9个Prefill实例和3个Decode实例平衡时达到最大,为2.11 req/s。PrfaaS-PD配置(32 H200 + 64 H20)由于PrfaaS集群的卓越计算吞吐量,在本地PD集群中仅需2个Prefill实例(相比同构的9个),从而释放了更多GPU用于Decode,整体吞吐量提升至3.24 req/s,提升幅度达54%。在TTFT方面,同构基线中长请求与短请求争夺Prefill容量,导致队列延迟膨胀。PrfaaS-PD将长请求卸载到专用高吞吐量集群,Prefill完成速度显著快于PD集群,即使计入跨集群传输延迟,端到端TTFT仍有显著改善。平均TTFT降低50%(4.44s → 2.22s),P90 TTFT降低64%(9.73s → 3.51s),这对于用户体验而言是质的飞跃。

与朴素异构PD的对比则凸显了调度策略在异构系统中的决定性作用。朴素异构配置将所有Prefill分配给H200 GPU,所有Decode分配给H20 GPU,但没有基于长度的选择性路由或负载均衡。如表6所示,这种配置仅实现1.16×的吞吐量提升,比PrfaaS-PD低25%。性能损失的根本原因在于Prefill和Decode吞吐量之间的严重失衡——所有请求都走H200 Prefill路径,导致Prefill侧的计算资源无法充分匹配Decode侧的消耗能力,系统瓶颈在Decode阶段暴露无遗。这一对比有力地证明了,将异构Prefill视为通用路径(即不加选择地外部化所有请求)是不充分的——只有选择性卸载那些最能从PrfaaS中受益的长请求,同时保持短请求在本地PD路径上高效处理,才能实现异构部署的全部潜力。

4.4 规模扩展性分析

论文进一步指出,当前的PrfaaS集群在实验配置下是计算受限的,带宽余量充足。这意味着在更大规模部署或更高带宽专线条件下,PrfaaS集群可以进一步扩展以获取额外的吞吐量收益。例如,在IDC级部署(数千PrfaaS GPU)中,KV Cache传输的聚合出站带宽需求仅约1Tbps,完全在现代数据中心互联的能力范围内。这种良好的规模扩展性表明,PrfaaS-PD架构不仅在实验规模下有效,而且具备支撑未来超大规模服务部署的潜力。

5. 案例研究 (Case Studies)

论文的核心案例研究围绕内部1T参数混合模型展开,这一案例本身就包含了多个值得深入剖析的层面。让我们通过两个关键视角来审视这一案例:一是从"配置优化空间"的角度理解系统设计决策,二是从"带宽-计算权衡"的角度理解选择性卸载的精妙之处。

5.1 配置优化空间:网格搜索的洞察

在图5中,论文展示了二维网格搜索的过程,这实际上是系统设计者面对的真实决策空间。图5a描绘了固定路由阈值后,在PD集群内调整Prefill/Decode比例的效果。随着Prefill实例数 Np 从1增加到6,系统吞吐量呈现先上升后下降的趋势。在左侧(Np 较小),系统受限于Prefill产能不足——Decode节点有闲置能力,但上游KV Cache供应跟不上;在右侧(Np 较大),系统受限于Decode产能不足——过多的Prefill计算能力被浪费,因为Decode阶段无法及时处理生成的KV Cache。峰值出现在 Np=3Nd=5 处,这验证了理论模型中"上游生产总产能应匹配下游消费产能"的直觉。

图5b则展示了固定PD集群配比后,调整路由阈值 t 的效果。t 从0K增加到60K的过程中,两条曲线——PrfaaS归一化吞吐量(Θprfaas/p)和PD-P归一化吞吐量(Θpdp/(1p))——呈现反向运动。当 t 很小时,几乎所有请求都进入PrfaaS,p 接近1,PrfaaS侧因带宽瓶颈而吞吐量骤降,而PD-P因负载过轻而效率低下。当 t 很大时,几乎没有请求进入PrfaaS,PrfaaS资源闲置,PD-P过载。两条曲线的交点 t=19.4K 恰好平衡了两个上游生产者,使得系统整体吞吐量达到最大值3.24 req/s。这一交点的物理意义是:两个上游阶段的"单位请求产能"相等,没有任何一个阶段成为系统瓶颈的明显短板。

这个案例生动地说明了理论模型如何转化为可操作的工程决策。通过画像数据、分析公式和网格搜索,系统设计者可以从茫茫的参数空间中找到接近最优的配置,而无需依赖耗时的在线实验或复杂的强化学习。

5.2 带宽-计算权衡:为什么"选择性"至关重要

另一个深刻的案例洞察来自对三种部署模式的对比,特别是朴素异构PD为何大幅落后于PrfaaS-PD。在朴素异构配置中,所有Prefill都路由到H200集群,所有Decode到H20集群,但缺乏长度感知的路由。结果是:H200集群的Prefill计算能力(Θprfaas=2.45 req/s)与H20集群的Decode能力(Θpdd=6.25 req/s)严重失衡。Decode阶段可以处理6.25 req/s,但Prefill阶段只能供应2.45 req/s,Decode侧大量资源被闲置,系统整体吞吐量被Prefill侧拖累至2.45 req/s(实际上由于配比问题进一步下降到2.11的等价水平)。

PrfaaS-PD通过选择性路由巧妙地解决了这一失衡。将阈值设为19.4K后,只有约50%的最长请求进入PrfaaS。这些长请求有两个特征:一是它们的Prefill计算量很大,需要H200的高计算吞吐量来加速;二是它们虽然KV Cache绝对量不小,但相对于其计算量来说,KV吞吐量(Φkv)反而较低——因为Prefill延迟 Tprefill 随长度近似二次增长,而KV Cache大小 Skv 仅线性增长。这意味着长请求"单位KV Cache的计算密度"更高,更适合跨集群传输。短请求则留在本地PD-P处理,避免了为少量KV Cache支付跨集群传输的固定开销。这种"计算密集型长请求去PrfaaS,轻量短请求留本地"的分离策略,恰好实现了两个上游阶段的产能平衡:PrfaaS以1.61 req/s处理其50%的负载,PD-P以1.64 req/s处理另外50%,两者几乎完美匹配,而下游Decode的3.91 req/s又足以消费两者之和。系统整体吞吐量因此跃升至3.24 req/s,远超朴素异构的2.45 req/s。

这一案例深刻揭示了一个容易被忽视的设计原则:在资源受限系统中,"做什么"与"不做什么"同等重要。PrfaaS-PD的价值不仅在于它选择将某些请求卸载到远程集群,更在于它明智地选择不将另一些请求发送出去。这种选择性是基于对请求特征、计算成本和传输成本的精确权衡,而非简单的"外部化所有Prefill"的直觉。

6. 综合价值与局限 (Synthesis — Value and Limitations)

6.1 理论 significance:重新界定PD分离的部署边界

从理论层面看,这篇论文最重要的贡献在于系统性地证明了跨数据中心PD分离的现实可行性条件。在PD分离提出之初,其愿景是分离计算阶段以实现各自优化,但KV Cache传输一直是一个"知其不可而为之"的瓶颈。本论文通过"模型架构演进(KV Cache压缩)+ 系统级优化(选择性卸载+智能调度)"的协同框架,将这一愿景从理论可能性转化为工程实践。它不仅回答了"能否跨数据中心"的问题,更重要的是给出了"在什么条件下可以"以及"如何做到"的完整答案。这一定量化的可行性分析(基于KV吞吐量、带宽模型和调度算法)为后续的研究者和工程师提供了一个坚实的起点。

此外,论文提出的分析吞吐量模型(§3.4)本身就是一个有价值的理论工具。它将复杂的异构推理系统抽象为可解析的流水线模型,通过两个简洁的优化条件(公式7和公式8)指导了系统配置。虽然模型做了稳态和均值近似等简化,但它捕捉了系统的核心权衡关系,并能在实践中通过画像数据进行校准,展现出良好的预测和指导能力。

6.2 实际 impact:面向下一代服务基础设施

在实践层面,PrfaaS-PD的潜在影响是深远的。首先,它为硬件专业化趋势提供了系统支撑。随着NVIDIA Rubin CPX(Prefill专用)和LPU/Taalas HC1(Decode专用)等相位专用芯片的出现,PrfaaS-PD消除了"这些芯片必须共处同一RDMA网络"的强制约束,使运营商可以根据需要在不同数据中心或区域独立扩展Prefill和Decode容量。其次,它使"远程计算资源利用"成为可能——当某个数据中心拥有过剩的计算能力但不足的带宽资源时,PrfaaS架构可以将其计算能力转化为Prefill服务,通过标准以太网连接消费者集群。第三,对于长上下文服务(128K甚至1M tokens),PrfaaS提供的TTFT改善(本案例中P90降低64%)直接转化为用户体验的提升,这在对话式AI、代码生成和文档分析等场景中具有显著的商业价值。

6.3 优势:模型-系统协同设计的典范

论文最出色的方面在于其对模型-系统协同演进关系的深刻理解和清晰阐述。作者没有孤立地看待模型架构创新(混合注意力)或系统优化(调度算法),而是展示了两者如何在一个统一的框架中相互依赖、相互增强。混合注意力模型提供了必要条件,但系统调度是将必要条件转化为充分条件的催化剂。这种全局视角避免了两个常见的陷阱:一是模型研究者认为"只要KV Cache足够小,问题就解决了"而忽视系统复杂性;二是系统研究者假设"通用调度可以适应任何模型"而忽视架构特性。论文的案例研究表明,54%的吞吐量提升中,混合架构贡献了基础条件,但选择性路由和负载平衡贡献了关键的增量价值——朴素异构配置仅能获得16%的提升,而优化后的PrfaaS-PD获得了54%。这一差距量化了系统设计的价值。

此外,论文的实验设计务实且全面。不仅展示了与强基线(同构PD)的对比,还引入了"朴素异构"这一中间基线来隔离"异构本身"和"异构+调度优化"各自的贡献。这种分层对比使读者能够清晰地理解每个设计决策的边际价值。

6.4 局限:值得诚实的审视

尽管论文论证有力,但仍存在一些值得关注的局限。首先,实验基于一个内部1T参数模型和特定的硬件组合(H200+H20),结果的普适性需要更多验证。不同混合比例、不同模型规模、甚至不同KV压缩机制(如量化、剪枝)的模型,其KV吞吐量特性和最优配置可能有所不同。论文在表3中展示了多种开源模型的基准数据,但并未对所有模型进行完整的端到端系统评估。

其次,工作负载模型虽然基于真实分布(截断对数正态),但仍是一个静态分布。真实生产环境中的流量具有强烈的突发性和时间相关性(例如日间高峰、事件驱动的峰值),论文中的双时间尺度调度虽然考虑了动态因素,但主要评估仍基于稳态吞吐量模型。在极端突发场景下,PrfaaS集群的出站链路可能短时间内超过其带宽上限,此时系统的降级行为(graceful degradation)和恢复机制需要进一步验证。

第三,跨集群缓存传输虽然被提及为可能的优化手段,但在案例研究中并未作为主要组成部分进行量化评估。当跨集群带宽充裕时,将前缀缓存从命中集群传输到计算集群可以进一步减少冗余计算,但这也引入了缓存一致性和传输调度的新复杂性。这部分机制的实验验证和开销分析在论文中着墨较少。

第四,论文未深入讨论故障恢复和容错机制。在跨数据中心部署中,网络分区、集群故障或延迟 spike 是现实威胁。PrfaaS集群如果发生故障,正在处理的请求和已生成的KV Cache如何恢复?系统是否支持请求回退到本地PD路径?这些生产级部署必须考虑的问题在论文中未被充分覆盖。

6.5 更广泛的含义:LLM服务架构的范式转变

从更宏观的视角来看,这项工作标志着LLM服务架构从"单数据中心统一集群"向"多数据中心异构联邦"的范式转变。它表明,随着模型架构不断演进、硬件专业化不断加深,以及网络基础设施持续升级,推理服务的部署模式将不再受限于单一物理位置。这种趋势与云计算从"集中式"走向"边缘-中心分布式"的演进逻辑一致。PrfaaS-PD为LLM推理服务提供了一种类似于"边缘计算"但面向特定计算阶段(Prefill)的分布式架构思路,这可能是未来超大规模AI基础设施的重要参考范式。

7. 延伸阅读与思考 (Further Reading and Reflection)

7.1 奠基性工作:PD分离与KV Cache中心架构

PrfaaS-PD建立在一系列重要的前期工作之上。最核心的先驱是Mooncake(Qin et al., 2024)——来自同一研究团队的前作,首次将KV Cache提升为LLM服务系统中的一等公民,构建了全局KV Cache池以支持跨节点和跨请求复用。Mooncake为PD分离奠定了系统基础,而本论文则将这一架构从单数据中心扩展到了跨数据中心尺度。Splitwise(Patel et al., 2024)从成本/功耗角度对PD分离进行了深入的优化分析,DistServe(Zhong et al., 2024)则从goodput(满足SLO的请求比例)视角提出了PD分离的调度策略。这两篇工作与PrfaaS-PD形成了互补:它们关注单数据中心内的PD优化,而本论文关注跨数据中心的扩展。Helix(Mei et al., 2025)、Hetis(Mo et al., 2025)和LLM-PQ(Zhao et al., 2024)则代表了异构GPU集群中LLM服务优化的另一条研究线,它们处理的是硬件异构性但通常假设集群内高速互联,PrfaaS-PD则放宽了这一假设。

7.2 相关技术方向:压缩、复用与硬件协同

在KV Cache压缩和复用领域,存在丰富的相关工作。KIVI(Liu et al., 2024)提出了无需微调的非对称2-bit KV Cache量化,KVQuant(Hooper et al., 2024)将上下文长度推至千万级别,H2O(Zhang et al., 2023)通过重要性评估选择性驱逐KV Cache条目。在传输压缩方面,CacheGen(Liu et al., 2024)应用传统压缩技术减少KV Cache传输量,而CacheBlend(Yao et al., 2025)和FusionRAG(Wang et al., 2026)则通过近似匹配的KV Cache融合复用,显著降低RAG场景中的TTFT。这些技术路线与PrfaaS-PD是高度互补的:PrfaaS-PD通过架构设计和系统调度减少KV Cache传输的"需求侧",而这些压缩技术则从"供给侧"进一步减少每个请求的传输量。两者的结合可能将跨数据中心KV Cache的带宽需求推向更低水平,使更宽松的互联条件(如更低带宽的广域网)也能支撑异构推理。

在硬件协同方面,NVIDIA Rubin CPX(2025)专门针对1M+ token长上下文Prefill优化,而LPU(Groq, 2025)和Taalas HC1(2025)则聚焦于Decode所需的极端内存带宽。PrfaaS-PD为这些专用芯片的独立部署和协同工作提供了系统级蓝图。Dynamo LLM(Stojkovic et al., 2025)和FREESH(He et al., 2025)从能耗、成本和碳效率角度重新思考LLM推理集群设计,这与PrfaaS-PD的"低成本异构部署"目标不谋而合,未来可能在联合优化框架下产生交叉研究。

7.3 未来方向:从可行到最优的演进路径

PrfaaS-PD开启的研究方向具有多个值得探索的延伸。第一,自适应在线学习可以取代当前的静态画像+网格搜索配置方法。通过在线监测请求分布、缓存命中率和链路状况,系统可以实时调整路由阈值和集群配比,而非依赖周期性重优化。这将使系统对流量漂移和突发事件具有更强的鲁棒性。第二,多PrfaaS集群的协同调度——当存在多个地理分布的PrfaaS集群时,如何根据请求来源、集群负载和网络拓扑选择最优的Prefill位置,成为一个更复杂的组合优化问题。第三,KV Cache压缩与PrfaaS的联合优化——将传输压缩(如CacheGen)直接集成到PrfaaS的传输层,可能进一步降低带宽需求,或者允许在同等带宽下支持更大规模的模型或更长的上下文。第四,与推测解码(speculative decoding)和提示缓存(prompt caching)的集成——这些已经在生产中广泛部署的优化技术与PrfaaS-PD的交互效应需要进一步研究,例如推测解码对KV Cache传输时机和模式的影响。

7.4 开放问题:最深层的挑战

这一领域最根本的未解挑战或许在于模型架构与系统设计的 co-design(协同设计)。PrfaaS-PD展示了模型侧(混合注意力)和系统侧(选择性卸载)的良性协同,但未来的 co-design 可以走得更远。例如,模型架构是否可以有意识地优化以最大化KV吞吐量(即最小化Φkv),而非仅仅最小化KV Cache大小?是否可以设计"传输感知"的注意力层,在保持模型能力的同时,使KV Cache的生成模式更友好于流水线传输?更进一步,是否存在一种理论框架,能够同时优化模型参数(影响SkvTprefill)和系统参数(影响tNp/Nd),实现端到端的全局最优?

另一个深层问题是跨数据中心推理的可靠性和安全性。当KV Cache跨越数据中心边界时,数据传输的加密、完整性校验、访问控制和合规性(如GDPR的数据驻留要求)都成为必须正视的工程问题。PrfaaS-PD论文主要聚焦于性能和带宽分析,但这些"非功能性需求"在实际部署中往往与功能性需求同等重要。

7.5 个人反思:最引人深思的洞见

反复阅读这篇论文后,最令我深思的洞见是:技术进步往往不是由单一领域的突破推动的,而是多个领域进展的"交汇点"创造的。在PrfaaS-PD这个例子中,混合注意力模型(MLA、KDA、SWA等)的进展本身并没有"解决"跨数据中心推理问题——它只是将KV吞吐量降低到了一个新的数量级。与此同时,数据中心互联带宽的持续增长(100Gbps、400Gbps以太网)、云计算VPC网络的成熟、以及PD分离架构在生产中的广泛验证,各自都是独立的进展。PrfaaS-PD的洞察在于认识到这些独立进展的交汇创造了新的可能性空间,并通过精巧的系统设计(选择性卸载+带宽感知调度)将这些可能性转化为现实。这提醒我们,在评估技术趋势时,不仅要看单一指标的进步(如KV Cache压缩率),更要观察多个指标和能力的"交集区域"——真正的突破性机会往往出现在那里。

如果让我选择一个最想深入探索的方向,那可能是基于强化学习的在线调度策略。当前论文中的调度器基于分析模型和规则式阈值调整,虽然有效但在高度动态和不确定的环境中可能不是最优。一个能够同时学习请求分布、预测链路状况并优化长期吞吐量/延迟目标的在线策略,或许能够在复杂生产环境中榨取额外的效率。当然,这需要仔细设计状态空间、动作空间和奖励函数,以确保学习的稳定性和可解释性——但这正是模型-系统协同优化最激动人心的前沿之一。


本分析基于论文"Prefill-as-a-Service: KV Cache of Next-Generation Models Could Go Cross-Datacenter"(Ruoyu Qin et al., 2026)的完整文本,结合其理论框架、技术架构和实验结果进行全面解读。

Topics:

Powered by Forestry.md