智客 ZICQ
EN 登录 / 注册
智客前沿 大模型 #医学AI #大语言模型 #推理审计 #链式推理 #扰动分析

ArXiv提出医学链式推理扰动审计框架,揭示医疗大语言模型推理缺陷

Mr.Xu 的头像

文 / Mr.Xu

发布时间:

中文阅读 (Chinese) English Version

摘要:ArXiv团队提出了一种名为医学链式推理扰动审计(Medical Chain-of-Thought Perturbation Audit)的新方法,用于评估医疗大语言模型(LLMs)在处理医学推理任务时的可靠性。该方法通过30种临床相关的扰动操作对问题和推理链进行修改,并结合链更新与答案翻转的联合分析,揭示了模型在面对破坏性编辑时的表现。实验结果表明,链解耦率(CDR)高达72.9%,即大多数情况下链的变化未影响模型输出,且移除CoT提示对模型准确率无显著影响。这表明现有医疗LLMs的链式推理可能更多是装饰性而非功能性。


研究背景与动机

在医疗领域,链式推理(Chain-of-Thought, CoT)被广泛用于展示模型的推理过程。然而,现有评估方法通常将链式推理视为黑盒,忽略了其实际作用。ArXiv团队提出了一种新的审计框架,旨在通过系统化的扰动操作,评估医疗LLMs在面对临床相关修改时的表现。

方法与实验

该研究设计了一个包含30种临床相关扰动操作的工具包,例如严重性反转、否定翻转、人口统计交换和证据删除等。这些操作被应用于问题和推理链,并通过链更新与答案翻转的联合分析对模型进行分类。实验在14个LLMs和四个医学问答基准测试上展开,结果显示:

  • 链解耦率(CDR)高达72.9%:在临床相关的破坏性编辑中,大多数情况下链的变化未影响模型输出。
  • 链损坏对准确率无影响:即使链被破坏,模型的准确率也未显著下降。
  • 移除CoT提示不影响准确率:去除链式推理提示后,模型的准确率没有显著变化。

此外,两名认证的临床医生对197个扰动问题进行了重新注释,98.5%的案例中,原始答案仍然成立。

结论与影响

研究表明,现有医疗LLMs的链式推理可能更多是装饰性的,而非真正用于支持推理过程。这一发现对医疗AI的应用具有重要意义,提示开发者应更加关注模型的实际推理能力,而非仅依赖链式推理作为可信度的象征。

开发者建议

  • 重视模型的实际推理能力:不要仅依赖链式推理作为模型可靠性的唯一指标。
  • 引入更严格的评估标准:在医疗AI应用中,应采用更严格的评估方法,确保模型在面对扰动时的鲁棒性。
  • 探索新的推理机制:考虑开发新的推理机制,以更好地支持医疗决策过程。

消息来源:ArXiv cs.AI (2026-08-25)

—— 完 ——

主题标签: #医学AI #大语言模型 #推理审计 #链式推理 #扰动分析

社区整体评论区

正在加载实时智能评论与划词标注…