Hugging Face提出新方法:通过噪声轨迹注入定向偏差,揭示扩散语言模型安全漏洞
文 / Mr.Xu
发布时间:
摘要:Hugging Face的研究团队提出了一种针对扩散语言模型的新型攻击方法,通过噪声轨迹注入定向偏差,揭示了模型在去噪过程中暴露的潜在安全漏洞。该方法利用比例-积分控制器实时调整干预强度,在多个基准测试中显著提升了模型对特定目标答案的偏好。例如,在LLaDA-8B-Instruct模型中,对目标群体的偏好从1.8%提升至16.7%,而在SocialStigmaQA数据集上,污名化答案的选择率从17.6%增至58.1%。研究强调了在去噪轨迹中控制模型输出的可能性,并呼吁对扩散语言模型进行更全面的偏差审计。
研究背景与动机
扩散语言模型(dLLMs)通过迭代去噪生成文本,在每个去噪步骤中重新预测被掩盖的位置。与自回归解码器不同,dLLMs在最终提交答案之前会多次暴露答案的分布,这为潜在的攻击者提供了操控模型输出的机会。
方法与创新
研究提出了一种通过噪声轨迹注入定向偏差的方法,具体步骤如下:
- 攻击机制:利用比例-积分(PI)控制器实时跟踪目标答案的概率,并动态调整干预强度。
- 实验验证:在LLaDA-8B-Instruct模型上,针对模糊的BBQ问题(正确答案应为弃权),攻击将目标群体的偏好从1.8%提升至16.7%,是现有最强固定强度干预方法的3倍多。在SocialStigmaQA数据集上,污名化答案的选择率从17.6%增至58.1%。
- 扩展应用:针对其他人口统计目标,攻击可使答案偏好变化高达37个百分点,每次攻击在单个GPU上耗时约40分钟。
技术亮点
- 新颖的攻击路径:首次揭示了dLLMs在去噪轨迹中的控制通道,为模型安全研究提供了新的视角。
- 高效的干预策略:PI控制器能够根据目标答案的概率动态调整干预强度,显著提升了攻击效果。
- 广泛的适用性:该方法可针对不同的人口统计目标进行定制化攻击,展示了其强大的泛化能力。
行业影响与建议
- 安全审计的重要性:研究强调了对dLLMs进行更全面的偏差审计的必要性,不仅要关注静态模型,还要考虑服务栈中的动态行为。
- 开发者建议:在部署dLLMs时,应考虑引入额外的安全机制,如实时监控和干预,以防止潜在的偏差注入攻击。
- 未来研究方向:进一步探索更复杂的攻击路径和防御策略,以提升dLLMs的鲁棒性和安全性。
结论
这项研究揭示了dLLMs在去噪过程中暴露的潜在安全漏洞,并提出了通过噪声轨迹注入定向偏差的有效方法。研究结果对AI模型的安全性和可靠性具有重要意义,呼吁AI社区加强对dLLMs的偏差审计和安全防护。
—— 完 ——消息来源:Hugging Face Daily Papers (2026-10-05)
主题标签: #Hugging Face #扩散模型 #模型安全 #偏差注入 #AI安全
社区整体评论区