智客 ZICQ
EN 登录 / 注册
智客前沿 大模型 #FluidPD #LLM #SLO感知 #弹性扩展 #AI服务

FluidPD发布:革新LLM服务架构,实现SLO感知的高效弹性扩展

Mr.Xu 的头像

文 / Mr.Xu

发布时间:

中文阅读 (Chinese) English Version

摘要:FluidPD是一种新型的P/D(预填充/解码)分离架构的LLM服务系统,旨在解决现有系统因负载波动导致的延迟问题。该系统引入了两种互补机制:FluidToken用于处理瞬时不平衡,通过在解码端空闲时将部分预填充计算任务转移至解码端;FluidRole则通过在预填充和解码角色之间动态重新分配运行中的工作节点来应对持续不平衡,避免了模型重载和引擎重启。实验表明,FluidPD在Azure生产级工作负载上相比静态SGLang系统,SLO达标率提升了高达94.6个百分点,展示了其在不增加额外资源的情况下提升服务质量的潜力。


背景与挑战

在大型语言模型(LLM)的服务架构中,预填充(Prefill)和解码(Decode)阶段由于执行模式和SLO(服务级别目标)目标的不同,通常被分离处理。现有的系统通常采用固定的预填充/解码工作节点比例,并通过请求路由来分配任务。然而,实际工作负载中,预填充与解码的需求比例会经历短时突发和持续变化,导致配置失衡,进而引发延迟SLO违规问题。尽管现有的自动扩展机制可以增加容量,但它们反应速度慢、需要备用GPU,并且无法直接解决短时间尺度上的阶段不平衡问题。

FluidPD的创新解决方案

FluidPD提出了一种SLO感知的高效弹性扩展方案,通过以下两种机制实现:

  1. FluidToken:在解码端有空闲资源时,将部分预填充计算任务动态转移至解码端,以处理瞬时不平衡问题。
  2. FluidRole:通过在预填充和解码角色之间动态重新分配运行中的工作节点,避免模型重载和引擎重启,以应对持续不平衡。

这两种机制由轻量级的压力指标引导,这些指标能够在SLO违规出现之前暴露预填充和解码端的资源压力。

实验与成果

在Azure生产级工作负载上的实验表明,FluidPD相比静态SGLang系统,SLO达标率提升了高达94.6个百分点。这表明,SLO感知的高效弹性扩展不仅能够提升服务质量,还能避免额外的资源开销。

行业影响与开发者建议

  • 行业影响:FluidPD为LLM服务架构的优化提供了新的思路,尤其在处理动态负载变化方面展示了显著优势。其高效的资源利用和SLO感知机制,使其成为高负载、高要求场景下的理想选择。
  • 开发者建议:对于正在构建或优化LLM服务的开发者,FluidPD提供了一种可行的解决方案。建议开发者关注其机制设计,并考虑在现有系统中引入类似的弹性扩展策略,以提升服务质量和资源利用率。

未来展望

FluidPD的发布标志着LLM服务架构的一个重要进展。未来,随着AI技术的不断发展,类似的弹性扩展机制有望在更多领域得到应用,进一步推动AI服务的普及和优化。


消息来源:ArXiv AI (cs.AI) (2026-10-07)

—— 完 ——

主题标签: #FluidPD #LLM #SLO感知 #弹性扩展 #AI服务

社区整体评论区

正在加载实时智能评论与划词标注…