智客 ZICQ
EN 登录 / 注册
智客前沿 大模型 #LLM #AI审计 #智能体 #Proxy Confidence #ArXiv

ArXiv提出Proxy Confidence:黑盒LLM智能体的审计新方法

Mr.Xu 的头像

文 / Mr.Xu

发布时间:

中文阅读 (Chinese) English Version

摘要:ArXiv发布了一项关于黑盒大语言模型(LLM)智能体审计的新研究,提出了名为Proxy Confidence的方法。该方法通过并行运行低成本开放权重代理,读取与目标智能体相同的上下文、模式和拟议操作,并利用多种互补的评分机制(如教师强制、请求PMI判别判决和工具选择竞争)来评估智能体的输出。这种方法无需访问智能体的内部信息,能够有效识别错误并提供实时反馈或决策升级机制,从而提升智能体在复杂任务中的准确性和可靠性。


研究背景与动机

在部署大语言模型(LLM)智能体时,智能体可能会发出错误的工具调用、查询或代码,而这些问题往往在执行后才被发现。现有的前沿聊天API隐藏了模型的token概率,智能体声明的置信度在关键错误上几乎与随机猜测无异。此外,智能体重采样也无法解决问题,因为前沿模型具有高度重复性,会在样本中重复相同的调用。

方法与创新

Proxy Confidence通过并行运行一个低成本开放权重的代理来解决上述问题。该代理读取与目标智能体相同的上下文、模式和拟议操作,并通过以下几种互补的评分机制来评估智能体的输出:

  • 教师强制(Teacher Forcing):评估每个参数值的可能性。
  • 请求PMI(Request-PMI):衡量请求与参数值之间的关联性。
  • 判别判决(Discriminative Verdict):对调用进行整体判断。
  • 工具选择竞争(Tool-Choice Competition):将函数与其同类函数进行比较。

这些评分机制能够有效识别错误参数值和整体错误的调用。当错误类型未知时,集成方法成为低遗憾的默认选择。

实验结果

在困难的编程任务中,Proxy Confidence的AUROC达到0.825,而智能体声明的置信度接近随机水平(0.598)。在三个不同的智能体中,生成式评分机制的表现比智能体自身置信度高出+0.07到+0.28。在近乎确定性的智能体上,Proxy Confidence在自洽性测试中提升了+0.14到+0.19,同时成本仅为1/K。

部署模式

Proxy Confidence支持两种部署模式:

  1. 实时门控(Real-time Gate):将最不可信的调用升级以供审查,在50%的覆盖率下,接受的操作准确性提高了+0.05到+0.30。
  2. 置信度反馈(Confidence Feedback):将工具结果与评分一起返回,使智能体能够调整其下一步操作,从而在实时执行基准测试中提升任务成功率(+0.119和+0.137,p <= 1e-4),并击败了步骤错误为静默的随机值控制(+0.078,p = 0.003)。

行业影响与未来展望

Proxy Confidence为LLM智能体的审计和错误检测提供了一种高效且实用的解决方案。其无需访问智能体内部信息的特性使其易于集成到现有的AI系统中。该方法不仅提升了智能体的可靠性和安全性,还为AI在复杂任务中的应用开辟了新的可能性。


消息来源:ArXiv AI (cs.AI) (2026-10-06)

—— 完 ——

主题标签: #LLM #AI审计 #智能体 #Proxy Confidence #ArXiv

社区整体评论区

正在加载实时智能评论与划词标注…