智客 ZICQ
EN 登录 / 注册
智客前沿 前沿论文 #大语言模型 #系统提示 #安全机制 #CKA #指令微调

研究揭示:系统提示对大语言模型内部计算的影响机制

Mr.Xu 的头像

文 / Mr.Xu

发布时间:

中文阅读 (Chinese) English Version

摘要:一项由ArXiv发布的研究深入探讨了系统提示对大语言模型内部计算的影响。研究发现,不同类型的系统提示对模型内部表示的影响具有显著差异:个性化和格式化提示会深度重构中间层表示,而安全提示几乎不改变表示,其变化与最小基线无显著差异。研究还指出,限制性安全提示和完全开放的安全提示会激活几乎相同的计算路径,这表明当前基于系统提示的安全机制存在固有的脆弱性。研究通过线性探测和因果激活归因等方法揭示了模型对提示的编码机制,并提出了改进系统提示安全性的潜在方向。


研究背景与动机

系统提示是当前大语言模型(LLM)开发者控制模型行为的主要手段,但其对模型内部计算的影响机制尚不明确。本研究旨在通过系统化的实验和分析,揭示不同类型的系统提示如何影响模型的内部表示和计算路径。

主要发现

  1. 提示类型对表示的影响:

    • 个性化和格式化提示:深度重构模型的中间层表示。
    • 安全提示:对表示的影响微乎其微,其变化与最小基线无显著差异。
  2. 计算路径的相似性:

    • 限制性安全提示和完全开放的安全提示(例如“没有任何限制”)会激活几乎相同的计算路径,平均CKA相关性高达0.997。
  3. 安全提示的脆弱性:

    • 即使在70B-72B参数规模的模型中,安全提示的“渗透率”仍然低于10%,这表明当前基于系统提示的安全机制存在固有的脆弱性。
  4. 机制解释:

    • 模型在每一层都编码了提示的类别,但仅在少数层重构其计算路径。这意味着提示被可靠地“看到”,但对于安全提示,并未深度“执行”。

方法与实验

研究使用了Centered Kernel Alignment (CKA)方法,对17个指令微调模型(涵盖8个架构家族,参数范围从1.5B到72B)进行了层间表示比较。实验结果表明,提示对模型的影响是层选择性的,并且依赖于指令类型。

结论与建议

研究为系统提示对模型内部计算的影响提供了机制性解释,并揭示了基于系统提示的安全机制存在的脆弱性。未来的研究可以进一步探索如何增强系统提示的安全性,例如通过更精细的提示工程或引入额外的安全机制。

开发者建议

  • 提示工程的重要性:开发者应意识到不同类型的系统提示对模型行为的影响,并谨慎设计提示以实现预期的控制效果。
  • 安全机制的多样性:仅依赖系统提示进行安全控制可能不够,建议结合其他安全机制(如微调、规则引擎等)以提高模型的安全性。
  • 模型监控与评估:定期监控模型的行为,并使用多种评估方法(如对抗性测试、行为分析等)以确保模型的安全性和可靠性。

消息来源:ArXiv NLP/LLM (cs.CL) (2026-10-01)

—— 完 ——

主题标签: #大语言模型 #系统提示 #安全机制 #CKA #指令微调

社区整体评论区

正在加载实时智能评论与划词标注…