Hugging Face发布ProxyConfidence:提升黑盒LLM智能体审计能力
文 / Mr.Xu
发布时间:
摘要:Hugging Face推出了一种名为ProxyConfidence的新方法,用于审计黑盒大语言模型(LLM)智能体的行为。该方法通过并行运行一个低成本的开放权重代理模型,捕捉智能体决策中的缺失信号,并利用多种互补的评估技术(如教师强制、请求PMI判别和工具选择竞争)来检测智能体调用中的错误。ProxyConfidence无需访问智能体的内部结构,且在复杂编码任务中显著提升了检测准确率(AUROC达0.825),为实时审查和智能体自适应提供了新的技术路径。
技术背景与挑战
在部署大语言模型(LLM)智能体时,智能体可能会发出错误的工具调用、查询或代码,而这些问题往往在执行后才被发现。现有的前沿聊天API隐藏了模型的token概率,智能体声称的置信度在关键错误上仅略高于随机猜测。此外,由于前沿模型的高度重复性,重新采样也无法有效解决问题。
ProxyConfidence的核心方法
Hugging Face提出的ProxyConfidence通过以下方式解决了上述问题:
- 并行开放权重代理模型:ProxyConfidence并行运行一个低成本的开放权重代理模型,该模型读取与智能体相同的上下文、模式和拟议操作。
- 互补评估技术:
- 教师强制和请求PMI:评估每个参数值的可能性。
- 判别性裁决:整体判断调用是否正确。
- 工具选择竞争:将函数与其同类进行比较。
- 信任原则:生成式可能性用于定位错误的参数值,而裁决则用于捕捉整体错误的调用。当错误类型未知时,使用集成方法作为低遗憾的默认选择。
技术亮点
- 无训练需求:ProxyConfidence无需训练即可运行。
- 无需访问智能体内部:该方法仅需智能体的输出和上下文信息。
- 高效性:ProxyConfidence的成本仅为智能体调用的一次预填充过程。
实验结果
在困难编码任务中,ProxyConfidence的AUROC达到0.825,而智能体声称的置信度仅为0.598。在三个不同的智能体上,生成式读数的表现比智能体置信度高出+0.07到+0.28。在近乎确定性的智能体上,ProxyConfidence在自一致性测试中提升了+0.14到+0.19,同时成本仅为1/K。
部署模式
- 实时审查门控:将最不可信的调用升级以供审查,在50%的覆盖率下,接受动作的准确率提高了+0.05到+0.30。
- 置信度反馈:将工具结果与评分一起返回,以便智能体调整下一步操作,从而在实时执行基准测试中提高了任务成功率(+0.119和+0.137,p <= 1e-4),并击败了随机值控制(+0.078,p = 0.003)。
行业影响与开发者建议
ProxyConfidence为LLM智能体的审计和错误检测提供了一种高效且实用的解决方案,尤其适用于对可靠性要求较高的应用场景,如金融、医疗和关键基础设施。开发者可以利用该方法提升智能体的透明度和可靠性,同时减少错误带来的风险。建议开发者关注该技术的进一步发展和应用案例,以更好地集成到现有的智能体工作流中。
—— 完 ——消息来源:ArXiv AI (cs.AI) (2026-10-07)
社区整体评论区