智客 ZICQ
EN 登录 / 注册
智客前沿 大模型 #KV缓存 #LLM推理 #压缩技术

arXiv发布KVFetch框架:解决KV缓存压缩中的顺序遗忘问题

Mr.Xu 的头像

文 / Mr.Xu

发布时间:

中文阅读 (Chinese) English Version

摘要:arXiv近日发布了一种名为KVFetch的新框架,旨在解决大语言模型(LLM)推理中KV缓存压缩的顺序遗忘问题。KVFetch通过引入时间召回通道,弥补了现有基于内容压缩方法的不足,避免了模型在需要逐位置访问上下文时出现的信息丢失现象。该框架无需额外训练即可集成到现有压缩器中,并在多个基准测试中表现出色,尤其在需要顺序访问的任务中显著提升了模型性能。


背景与挑战

随着大语言模型(LLM)的上下文窗口扩展到数万甚至数十万个token,KV缓存压缩已成为高效推理的关键。然而,现有方法主要基于内容相关性进行压缩,无法有效处理模型对上下文进行逐位置访问的需求。这种设计上的不足导致了“顺序遗忘”问题,即模型在需要逐字复制标识符、字段值或代码token时,会因压缩而丢失后续内容,导致复制失败。

KVFetch框架

KVFetch是一种无需训练的即插即用框架,旨在为任何基于评分的压缩器引入时间召回通道。其核心机制包括:

  • 冷区降级:将驱逐的候选对象降级到量化的冷区。
  • 单调读取指针:通过单调读取指针检测活跃的复制行为。
  • 预取机制:将位置后继对象预取到固定大小的热区插槽中,而不会增加注意力成本。

实验结果

在RULER-16K基准测试中,KVFetch在等预算控制下,将逐字复制恢复率从0.8%提高到78.4%,并将13项任务的平均得分提高了+8.4%,尤其在需要顺序访问的任务中表现突出。而在LongBench基准测试中,由于没有任务需要顺序访问,KVFetch的时间召回通道保持休眠状态,未产生额外成本。

行业影响与开发者建议

KVFetch的发布为LLM推理中的KV缓存压缩提供了新的解决方案,尤其适用于需要高保真度文本生成和代码补全的应用场景。开发者可以将其集成到现有系统中,以提升模型在复杂任务中的表现。此外,KVFetch的无需训练特性使其易于部署和扩展。

技术亮点

  • 无需训练:无需额外训练即可集成到现有压缩器中。
  • 时间召回通道:弥补了基于内容压缩的不足。
  • 性能提升显著:在多个基准测试中表现出色,尤其在需要顺序访问的任务中。

未来展望

KVFetch的发布为AI领域提供了新的研究方向,未来可以进一步优化其性能,并探索其在多模态模型中的应用潜力。


消息来源:ArXiv Machine Learning (cs.LG) (2026-10-08)

—— 完 ——

主题标签: #KV缓存 #LLM推理 #压缩技术

社区整体评论区

正在加载实时智能评论与划词标注…