智客 ZICQ
EN 登录 / 注册
智客前沿 大模型 #RAG #查询重写 #LLM #arXiv #检索增强生成

arXiv研究揭示:互补查询重写在强RAG基线下的性能提升

Mr.Xu 的头像

文 / Mr.Xu

发布时间: · 6 次阅读

中文阅读 (Chinese) English Version

摘要:一项由arXiv发布的研究探讨了在强大的检索增强生成(RAG)基线下,查询重写策略对性能的影响。研究表明,尽管单独使用查询重写策略仅能与强基线竞争,但多种策略的组合能够带来显著的性能提升,尤其是在企业数据集上,组合策略的HIT@10指标提升了12.5个百分点。研究还提出了一种基于置信度的路由机制,通过动态选择是否进行查询重写,在保持性能提升的同时有效控制了计算成本。


研究背景与动机

在检索增强生成(RAG)系统中,查询重写是一种常见的方法,通过将用户问题改写为多个变体并搜索所有变体来提升性能。然而,当底层检索系统已经足够强大时,查询重写是否仍然有效是一个值得探讨的问题。

研究方法与实验

研究团队在固定的强基线管道(BGE密集检索、交叉编码器重排序和MMR多样化)下,对四种查询重写策略(S1-S4)和两种强大的LLM基线(HyDE和Query2Doc)进行了比较。实验在三个数据集(HotpotQA、AmbigNQ和512K条目的EnterpriseRAG-Bench)上进行了三次种子实验,并使用配对自举显著性测试进行评估。

主要发现

  1. 单独重写策略的局限性:单独使用查询重写策略仅能与强基线竞争,无法显著超越。
  2. 组合策略的优势:多种策略的组合能够带来显著的性能提升。例如,四种方法的组合在企业数据集上的HIT@10指标提升了12.5个百分点,五种方法的组合则达到了52.98(+13.8)。
  3. 互补性而非预算驱动:预算匹配的控制实验表明,组合策略的优势主要来自于不同策略的互补性,而非检索预算的增加。
  4. 成本感知路由机制:研究提出了一种基于置信度的路由机制,仅在基线自身得分较低时进行查询重写。该机制在企业数据集上捕获了约一半的组合增益,同时将重写成本降低到40%以下。

行业影响与建议

  1. 优化RAG系统:开发者应将查询重写视为一种补充手段,而非替代强基线的方法。
  2. 动态选择策略:通过成本感知路由机制,开发者可以在提升性能的同时有效控制计算成本。
  3. 关注数据集特性:不同数据集对查询重写策略的响应不同,开发者应根据具体应用场景选择合适的策略组合。

技术亮点

  • 多策略组合:通过多种查询重写策略的组合,显著提升了RAG系统的性能。
  • 置信度路由:引入基于置信度的路由机制,实现了性能与成本的平衡。
  • 实验验证:在多个数据集和基线上的实验验证了研究结果的可靠性和普适性。

消息来源:ArXiv NLP/LLM (cs.CL) (2026-09-09)

—— 完 ——

主题标签: #RAG #查询重写 #LLM #arXiv #检索增强生成

社区整体评论区

正在加载实时智能评论与划词标注…