ArXiv提出AWM框架:提升长文档视觉问答的记忆质量与推理准确性
文 / Mr.Xu
发布时间:
摘要:ArXiv团队提出了一种名为Answerable Working Memory (AWM)的新框架,用于提升长文档视觉问答(VQA)任务中的记忆质量与推理准确性。AWM通过引入“仅记忆可回答性”诊断,将终端工作记忆视为可回答的证据,并结合GRPO奖励机制优化模型表现。实验结果表明,AWM-GRPO在MMLongBench-Doc和LongDocURL数据集上显著提升了最终答案的准确性,并减少了记忆缺失导致的错误率。该研究为长文档问答中的记忆建模提供了新的技术路径。
核心突破
ArXiv团队提出了一种名为Answerable Working Memory (AWM)的新框架,旨在解决长文档视觉问答(VQA)任务中记忆质量不足的问题。该框架的核心创新点包括:
- 仅记忆可回答性诊断:通过评估终端工作记忆是否能够独立支持问题回答,识别记忆中的不足。
- AWM-GRPO机制:将“仅记忆可回答性”信号整合到GRPO奖励机制中,在保证最终答案优先性的同时,赋予记忆质量更高的权重。
技术亮点
- 长文档VQA中的记忆建模挑战:现有方法主要关注最终答案的正确性和证据页面的访问,但忽略了工作记忆的质量。AWM通过引入新的诊断方法,填补了这一空白。
- GRPO奖励机制的改进:AWM-GRPO在GRPO的基础上,增加了对记忆质量的奖励,使得模型在生成答案时能够更好地利用工作记忆中的信息。
- 实验结果显著提升:在MMLongBench-Doc和LongDocURL数据集上的实验表明,AWM-GRPO在最终答案准确性和记忆质量方面均优于现有方法。例如,在MMLongBench-Doc上,最终答案准确性提升了8.1个百分点。
行业影响
AWM框架的提出,为长文档问答系统中的记忆建模提供了新的思路,特别是在处理复杂文档和多步推理任务时,能够显著提升模型的推理能力和答案质量。这对于需要处理长文档的AI应用,如法律文档分析、医疗记录处理和学术文献综述等,具有重要意义。
开发者建议
- 应用场景拓展:开发者可以将AWM框架应用于需要处理长文档和多步推理的AI应用中,如法律咨询系统、医疗诊断助手等。
- 模型优化:结合AWM框架,开发者可以进一步优化现有模型的记忆建模机制,提升其在复杂任务中的表现。
- 跨领域应用:AWM框架不仅限于视觉问答任务,还可以扩展到其他需要高质量记忆建模的领域,如自然语言推理和对话系统。
—— 完 ——消息来源:ArXiv cs.CL (2026-08-26)
社区整体评论区
正在加载实时智能评论与划词标注…