AWS发布基于Curvine的分布式KV缓存架构:提升大语言模型推理效率
文 / Mr.Xu
发布时间: · 4 次阅读
摘要:AWS推出了一种基于Curvine的分布式KV缓存架构,用于Amazon SageMaker HyperPod上的大语言模型(LLM)推理。该架构通过扩展缓存层级,将GPU内存、CPU内存与共享NVMe存储池结合,实现了跨副本缓存重用,显著提升了缓存命中率并降低了首次令牌生成时间(TTFT)。测试显示,该方案在跨节点缓存读取延迟约56毫秒的情况下,实现了最高2.7倍的TTFT提升,并支持在成本更低的实例上运行复杂工作负载。
AWS发布基于Curvine的分布式KV缓存架构:提升大语言模型推理效率
近日,AWS宣布推出一种创新的分布式KV缓存架构,用于在Amazon SageMaker HyperPod上运行的大语言模型(LLM)推理。该架构通过结合GPU内存、CPU内存和共享NVMe存储池,显著提升了缓存命中率和推理效率。以下是主要技术亮点:
核心架构与技术创新
-
三级缓存层级:
- L0(GPU HBM):用于存储最热的KV块,具有最低的访问延迟。
- L1(CPU内存):作为GPU缓存的溢出层,通过LMCache将数据暂存于主机DRAM中。
- L2(Curvine分布式缓存):通过Curvine将节点本地的NVMe存储池化,实现跨副本的缓存共享。
-
Curvine分布式缓存文件系统:
- Curvine将节点本地的NVMe存储池化,并通过FUSE客户端将其挂载为共享的L2缓存。
- 该方案支持跨节点的高速缓存读取,延迟仅约56毫秒。
-
智能路由机制:
- HyperPod推理操作符集成了智能路由功能,支持前缀感知路由和KV感知路由策略。
- 该机制确保请求被路由到最有可能命中缓存的副本,从而减少跨节点L2读取的频率。
性能与成本优势
- 性能提升:在测试中,该架构实现了最高2.7倍的TTFT提升,尤其适用于长提示词(超过1000个token)的场景。
- 成本优化:通过在成本更低的实例(如ml.g6e.4xlarge)上运行复杂工作负载,降低了每端点的成本。
- 跨节点缓存共享:Curvine的共享L2缓存使得不同副本之间可以重用缓存数据,进一步提升了整体缓存命中率。
适用场景
该方案特别适用于以下场景:
- 高提示词重叠度的应用:如检索增强生成(RAG)管道和基于会话的对话系统。
- 多租户部署:多个用户共享系统提示模板时,缓存共享可以显著提升效率。
实施步骤
- 启用HyperPod分层存储:通过AWS CLI或控制台配置节点本地的缓存层级。
- 安装推理操作符和依赖项:包括S3 CSI、FSx CSI、Metrics Server和Cert Manager。
- 部署Curvine分布式缓存:使用Helm图表安装Curvine CSI和服务器组件。
- 配置vLLM端点:通过InferenceEndpointConfig CRD声明缓存拓扑,并应用补丁以将L2缓存指向Curvine。
- 验证缓存效果:通过日志和基准测试确认缓存命中率和TTFT提升。
结论
AWS通过结合vLLM、LMCache和Curvine,构建了一个高效、可扩展的分布式KV缓存架构。该方案不仅提升了LLM推理的性能和效率,还为在成本更低的实例上运行复杂工作负载提供了可能。对于需要高缓存命中率和低TTFT的应用场景,该架构是一个值得考虑的选择。
资源链接
—— 完 ——消息来源:AWS Machine Learning Blog (2026-08-12)
主题标签: #AWS #大语言模型 #分布式缓存 #Curvine #SageMaker
社区整体评论区