智客 ZICQ
EN 登录 / 注册
智客前沿 大模型 #Hugging Face #LLM #智能体审计 #ProxyConfidence

Hugging Face发布ProxyConfidence:提升黑盒LLM智能体审计能力

Mr.Xu 的头像

文 / Mr.Xu

发布时间:

中文阅读 (Chinese) English Version

摘要:Hugging Face推出了一种名为ProxyConfidence的新方法,用于审计黑盒大语言模型(LLM)智能体的行为。该方法通过并行运行一个低成本的开放权重代理模型,捕捉智能体决策中的缺失信号,并利用多种互补的评估技术(如教师强制、请求PMI判别和工具选择竞争)来检测智能体调用中的错误。ProxyConfidence无需访问智能体的内部结构,且在复杂编码任务中显著提升了检测准确率(AUROC达0.825),为实时审查和智能体自适应提供了新的技术路径。


技术背景与挑战

在部署大语言模型(LLM)智能体时,智能体可能会发出错误的工具调用、查询或代码,而这些问题往往在执行后才被发现。现有的前沿聊天API隐藏了模型的token概率,智能体声称的置信度在关键错误上仅略高于随机猜测。此外,由于前沿模型的高度重复性,重新采样也无法有效解决问题。

ProxyConfidence的核心方法

Hugging Face提出的ProxyConfidence通过以下方式解决了上述问题:

  • 并行开放权重代理模型:ProxyConfidence并行运行一个低成本的开放权重代理模型,该模型读取与智能体相同的上下文、模式和拟议操作。
  • 互补评估技术:
    • 教师强制和请求PMI:评估每个参数值的可能性。
    • 判别性裁决:整体判断调用是否正确。
    • 工具选择竞争:将函数与其同类进行比较。
  • 信任原则:生成式可能性用于定位错误的参数值,而裁决则用于捕捉整体错误的调用。当错误类型未知时,使用集成方法作为低遗憾的默认选择。

技术亮点

  • 无训练需求:ProxyConfidence无需训练即可运行。
  • 无需访问智能体内部:该方法仅需智能体的输出和上下文信息。
  • 高效性:ProxyConfidence的成本仅为智能体调用的一次预填充过程。

实验结果

在困难编码任务中,ProxyConfidence的AUROC达到0.825,而智能体声称的置信度仅为0.598。在三个不同的智能体上,生成式读数的表现比智能体置信度高出+0.07到+0.28。在近乎确定性的智能体上,ProxyConfidence在自一致性测试中提升了+0.14到+0.19,同时成本仅为1/K。

部署模式

  • 实时审查门控:将最不可信的调用升级以供审查,在50%的覆盖率下,接受动作的准确率提高了+0.05到+0.30。
  • 置信度反馈:将工具结果与评分一起返回,以便智能体调整下一步操作,从而在实时执行基准测试中提高了任务成功率(+0.119和+0.137,p <= 1e-4),并击败了随机值控制(+0.078,p = 0.003)。

行业影响与开发者建议

ProxyConfidence为LLM智能体的审计和错误检测提供了一种高效且实用的解决方案,尤其适用于对可靠性要求较高的应用场景,如金融、医疗和关键基础设施。开发者可以利用该方法提升智能体的透明度和可靠性,同时减少错误带来的风险。建议开发者关注该技术的进一步发展和应用案例,以更好地集成到现有的智能体工作流中。


消息来源:ArXiv AI (cs.AI) (2026-10-07)

—— 完 ——

主题标签: #Hugging Face #LLM #智能体审计 #ProxyConfidence

社区整体评论区

正在加载实时智能评论与划词标注…