跳转至

无需拒绝的拒绝:安全微调响应的结构化分析与大语言模型误拒率的降低

文章背景与核心概要

在大语言模型(LLM)的对齐研究中,平衡模型的“有用性(Helpfulness)”与“安全性(Safety)”始终是一个核心挑战。当良性查询包含表面上具有风险的词汇时(例如将“如何拍一张好照片?”与有害的暴力查询混淆),模型往往会产生误拒绝(False Refusals)。这不仅损害了用户体验,也暴露出当前安全机制在语义理解上的局限性。

本文已被 EMNLP 2026 接收,作者深入剖析了安全微调响应的内部结构,将其拆解为两个关键部分:(i) 套话式的拒绝声明(ii) 解释性理由(Rationale)。研究发现,拒绝声明实际上会诱导模型过度依赖表面关键词,从而阻碍其准确区分安全与有害输入的能力。相反,仅使用解释性理由对模型进行训练,能够在保持高标准安全性的同时,成功降低误拒绝率。该研究为构建兼顾有用性与安全性的AI智能体开辟了新的有效途径。


📋 摘要

大型语言模型在平衡有用性和安全性方面仍然面临基础性挑战。为了实现这种平衡,模型应当拒绝有害查询(例如,“如何射杀某人?”),同时对良性输入保持响应,即使这些输入表面上类似于有害查询(例如,“在哪里可以拍一张好照片?”)。然而,模型往往难以区分真正的有害查询和包含表面风险语言的良性查询,从而导致错误拒绝。在本文中,我们通过将安全微调数据集中的响应分解为两个不同部分来解决这个问题:(i) 套话式的拒绝声明,以及 (ii) 解释拒绝原因的理由。我们的实验和分析表明,拒绝声明通过诱导模型对表面线索的依赖,阻碍了对有害查询和良性查询的准确区分。相比之下,仅使用理由进行训练可以减少错误拒绝,同时维持可比的安全性能水平。仅凭理由(Rationale-Only)带来的益处同样体现在我们的上下文学习(ICL)配置中,并且与所评估的推理阶段缓解方法保持兼容。这些结果强调了精确精选、细粒度安全监督数据集的必要性,并指明了构建更好地协调有用性与安全性的对齐智能体的发展方向。

Large language models often struggle to balance helpfulness and safety, frequently issuing false refusals when benign queries contain superficially risky language (e.g., confusing "How do I shoot someone?" with "Where can I shoot a good photo?").

This paper—accepted at EMNLP 2026—analyzes safety-tuning responses by breaking them down into two components: (i) boilerplate refusal statements and (ii) explanatory rationales. The authors discover that refusal statements actually hinder a model's ability to accurately distinguish between safe and harmful inputs by triggering reliance on superficial keywords. Conversely, training models solely on rationales successfully reduces false refusals while preserving high safety standards, offering a promising new path for aligning helpful and safe AI agents.


📑 论文详情


🔍 摘要

在对齐大型语言模型时,在有用性和安全性之间取得平衡仍然是一项根本性的挑战。为了实现这种平衡,模型应该拒绝有害查询(例如,“如何射杀某人?”),同时对良性输入保持响应,甚至是那些表面上类似于有害查询的良性输入(例如,“在哪里可以拍一张好照片?”)。然而,模型往往难以区分真正有害的查询和包含表面风险语言的良性查询,从而导致误拒绝。在本文中,我们通过将安全微调数据集中的响应分解为两个不同的组成部分来解决这个问题:(i) 套话式的拒绝声明,以及 (ii) 解释拒绝原因的理由。我们的实验和分析表明,拒绝声明通过诱导模型依赖表面线索,阻碍了对有害查询和良性查询的准确辨别。相比之下,仅根据理由进行训练可以减少误拒绝,同时保持相当的安全性能水平。“仅限理由”带来的优势同样出现在我们的 ICL 配置中,并且与评估的推理时缓解方法保持兼容。这些结果强调了精确策划、细粒度安全监督数据集的必要性,并勾勒出了构建更好地协调有用性与安全性的对齐智能体的发展方向。

Striking a balance between helpfulness and safety remains a fundamental challenge in aligning large language models. To achieve this balance, models should refuse harmful queries (e.g., "How do I shoot someone?") while remaining responsive to benign inputs, even those superficially resembling harmful queries (e.g., "Where can I shoot a good photo?"). However, models often struggle to distinguish genuinely harmful queries from benign queries that contain superficially risky language, resulting in false refusals. In this paper, we address the issue by decomposing a response in the safety-tuning dataset into two distinct components: (i) a boilerplate refusal statement and (ii) a rationale explaining the refusal. Our experiments and analyses show that refusal statements impede accurate discrimination between harmful and benign queries by inducing reliance on superficial cues. In contrast, training solely on rationales reduces false refusals while maintaining a comparable level of safety performance. Rationale-Only benefits also appear in our ICL configuration and remain compatible with the evaluated inference-time mitigation methods. The results emphasize the necessity of precisely curated, fine-grained safety supervision datasets and outline directions for constructing aligned agents that better reconcile helpfulness with safety.


🔗 外部参考与引用