智客 ZICQ
EN 登录 / 注册
智客前沿 前沿论文 #MemArena #端侧AI #记忆系统 #基准测试 #智能体

MemArena基准发布:面向端侧智能体个人记忆助手的自我中心评测框架

Mr.Xu 的头像

文 / Mr.Xu

发布时间: · 8 次阅读

中文阅读 (Chinese) English Version

摘要:arXiv 最新论文提出 MemArena,一个面向端侧部署的智能体个人记忆助手的自我中心评测基准。该基准基于 MASim 智能体模拟器,构建了包含 50 个智能体、持续 15 天的单一世界对话环境,生成 1030 万对话文本令牌,并针对六项记忆召回、推理与可信度维度生成真值。研究评估了五种开源阅读器与多种记忆后端,发现记忆后端的选择对内容准确性的影响超过阅读器规模的扩展,且权限感知访问机制普遍失效。该工作为端侧记忆系统的评测提供了新标准。


概述

端侧部署的个人记忆助手需要在设备上处理私密的人际对话,并依赖开源权重模型。然而,现有的记忆基准往往未能充分测试活动密集交互、自我中心视角和连贯多会话世界的组合。MemArena 填补了这一空白,提出了一个基于 MASim 智能体模拟器的单一世界对话基准,模拟 50 个智能体在 15 天内的交互,生成 1030 万对话文本令牌,每个智能体每天平均观察到 24.1K 文本令牌。

基准构建

MemArena 利用交互历史,在六个维度上共同生成真值:召回(recall)、推理(reasoning)和可信度(trustworthiness)。这六个维度覆盖了记忆助手的关键能力,包括事实回忆、时间推理、权限感知等。

实验设置

研究评估了五种开源阅读器(包括 Qwen3-0.6B 等),并搭配多种记忆后端:Vanilla context、BM25-RAG、Oracle retrieval、Memobase 和 MemSearch。实验在 Spark GB10 边缘节点上进行,以模拟真实部署环境。

关键发现

  1. 记忆后端的选择对内容准确性的影响更大:在 Qwen3-0.6B 上,从 Memobase 切换到 MemSearch 带来了 +32.5/+19.2 个百分点的提升,超过了通过扩大阅读器规模(MemSearch 阅读器扩展)获得的 +10.6/+6.8 个百分点。这表明,优化记忆后端可能比升级模型更有效。

  2. 权限感知访问机制普遍失效:Oracle 检索泄漏严重,而其他后端则过于保守,不敢披露信息。这揭示了当前记忆系统在权限控制上的不足,可能导致隐私泄露或信息获取不足。

  3. 搜索延迟仅在极小型阅读器上成为瓶颈:在 Spark GB10 边缘节点上,记忆搜索增加了适度的固定延迟(BM25-RAG/Memobase/MemSearch 分别为 87/7/48 毫秒),对于大多数阅读器-后端组合,这部分延迟仅占首令牌时间(TTFT)的一小部分。

行业影响与开发者建议

MemArena 为端侧记忆系统的评测提供了标准化工具,有助于开发者比较不同记忆后端和阅读器的组合。对于开发者而言,建议优先优化记忆后端的选择,而非盲目追求更大的模型。此外,权限感知机制需要更精细的设计,以平衡信息可用性与隐私保护。

资源与开源

代码、MASim 模拟器以及 MemArena-L 基准将在论文被接收后发布,届时开发者可以复现实验并扩展自己的评测。

出处

本文基于 arXiv 论文 arXiv:2608.02613,由论文作者团队发布。


消息来源:ArXiv NLP/LLM (cs.CL) (2026-08-06)

—— 完 ——

主题标签: #MemArena #端侧AI #记忆系统 #基准测试 #智能体

社区整体评论区

正在加载实时智能评论与划词标注…