智客 ZICQ
EN 登录 / 注册
智客前沿 大模型 #NavTree #长文档问答 #层级检索 #arXiv #检索增强生成

NavTree:基于层级导航的长文档问答新方法,性能超越传统检索器

Mr.Xu 的头像

文 / Mr.Xu

发布时间:

中文阅读 (Chinese) English Version

摘要:arXiv发布了一项关于长文档问答(QA)的新研究,提出了一种名为NavTree的创新方法。NavTree通过构建平衡段树并利用混合词法-密集前沿遍历技术,实现了高效的长文档导航。与传统扁平检索器和RAPTOR的提取实现相比,NavTree在匹配成本评估中表现最佳,并在长文档多跳问答任务中显著超越BM25基准。实验结果表明,NavTree通过仅输出叶节点数据,显著提升了检索效率和问答准确性,为长文档处理提供了新的技术路径。


研究背景与动机

在长文档问答(QA)任务中,传统的扁平检索方法(如BM25或top-$k$检索)常常因无法有效捕捉文档中的互补证据而表现不佳。RAPTOR等方法通过构建摘要树来缓解这一问题,但生成摘要内容的过程复杂且计算成本高。

NavTree方法概述

NavTree提出了一种无需语言模型生成摘要的层级导航方法。其核心思想是构建一个平衡的段树,并利用混合词法-密集前沿遍历技术进行导航。具体步骤如下:

  1. 构建平衡段树:NavTree在索引阶段对文档进行分块,并构建一个确定性的平衡段树,不依赖语言模型进行摘要生成。
  2. 混合前沿遍历:在查询阶段,NavTree采用混合词法-密集前沿遍历技术,从根节点开始遍历树结构,仅输出叶节点数据供阅读器使用。
  3. 导航而非生成:NavTree强调导航而非生成摘要内容,通过高效的结构化检索提升问答性能。

实验结果与性能

在匹配成本评估中,NavTree在长文档多跳问答任务中表现优异:

  • 超越BM25:NavTree是唯一一种在类间比较中显著超越BM25的层级检索方法。
  • 匹配成本优势:NavTree在匹配成本评估中表现最佳,与最强的扁平检索器基线持平。
  • 零索引成本:即使在零索引成本条件下,NavTree也优于RAPTOR的提取实现版本。

此外,NavTree在更强的阅读器和开放权重阅读器上表现一致,并成功隔离了仅叶节点输出的结构优势。

技术亮点

  • 无需语言模型生成摘要:NavTree通过结构化导航而非生成摘要内容,显著降低了计算成本。
  • 混合词法-密集前沿遍历:结合词法匹配和密集向量匹配的优势,提升检索效率。
  • 平衡段树结构:构建确定性的平衡段树,确保检索过程的稳定性和高效性。

行业影响与开发者建议

NavTree为长文档处理领域提供了新的思路,尤其适用于需要高效检索和问答的场景,如法律文档分析、医疗文献检索等。开发者可以借鉴NavTree的层级导航思想,优化现有检索系统,提升长文档处理能力。此外,NavTree的零索引成本特性使其在资源受限的环境中具有广泛的应用潜力。


消息来源:ArXiv NLP/LLM (cs.CL) (2026-10-07)

—— 完 ——

主题标签: #NavTree #长文档问答 #层级检索 #arXiv #检索增强生成

社区整体评论区

正在加载实时智能评论与划词标注…