跳转至

RefusalGuard:大语言模型中保持几何结构的安全性微调方法

文章背景与核心概要

微调经过安全性对齐的大语言模型(LLM)往往会削弱其拒绝有害请求的行为(即拒识行为),从而使模型容易受到对抗性攻击。本文深入探讨了这一对齐退化现象背后的表征级机制,揭示了标准微调会导致安全性表征发生系统性漂移和几何畸变,同时干扰任务优化。

为了解决这一问题,作者推出了 REFUSALGUARD,这是一个通过约束隐藏表征更新来保留安全性相关结构的表征级微调框架。该方法在 LLaMA、Gemma 和 Qwen 等主流模型系列上进行了评估,在对抗性基准测试和下游任务中,REFUSALGUARD 成功匹配了基础安全性对齐模型的攻击成功率,同时保持了具有竞争力的任务性能。


元数据与出版详情

  • 作者: Sadia Asif, Mohammad Mohammadi Amiri
  • 主要学科: 机器学习 (cs.LG)
  • 其他学科: 人工智能 (cs.AI)、计算工程、金融与科学 (cs.CE)、计算与语言 (cs.CL)、密码学与安全 (cs.CR)
  • 标识符:
  • arXiv: 2605.01913 (v2)
  • DOI: 10.48550/arXiv.2605.01913
  • 会议参考: 语言建模会议,COLM 2026
  • 许可证: 知识共享署名 4.0 国际许可协议 license icon

摘要

为下游任务微调经过安全性对齐的语言模型往往会导致拒识行为的大幅退化,使模型容易受到对抗性滥用。虽然先前的研究表明,安全性相关特征编码在模型激活空间的结构化表征中,但这些表征在微调过程中如何变化以及对齐为何会退化,目前人们的理解仍然有限。

在这项工作中,我们研究了对齐退化背后的表征级机制。我们的分析表明,标准微调会引起安全性相关表征的系统性漂移,扭曲其几何结构,并在任务优化与安全特征之间引入干扰。这些影响共同导致了有害合规性的增加。

受这些发现的启发,我们引入了 REFUSALGUARD,这是一个在模型适应过程中保留安全性相关结构的表征级微调框架。我们的方法约束了隐藏表征空间中的更新,确保调节安全的组件保持稳定,同时允许在互补方向上进行特定任务的学习。我们在 LLaMA、Gemma 和 Qwen 等多个模型系列上评估了 REFUSALGUARD,测试对象包括 AdvBench、DirectHarm4 和 JailbreakBench 等对抗性安全基准,以及下游实用任务。我们的方法实现了与基础安全性对齐模型相当的攻击成功率,同时保持了具有竞争力的任务性能,显著优于基准方法。


核心特性与评估

  • 识别出的失效模式: 标准微调过程中的系统性漂移、安全性表征的几何畸变以及优化与安全的干扰。
  • 核心解决方案: REFUSALGUARD——通过约束隐藏表征的更新来稳定调节安全的结构,同时促进并行任务学习。
  • 测试模型系列: LLaMA、Gemma 和 Qwen。
  • 评估基准:
  • 对抗性安全: AdvBench、DirectHarm4、JailbreakBench。
  • 下游效用: 标准特定领域 NLP 任务。