当安全路由失效:解析良性微调下的对齐脆弱性
文章背景与核心概要
大语言模型(LLMs)的安全对齐机制在面对良性微调(benign fine-tuning)时表现出极大的脆弱性,本篇论文深入探讨了背后的成因。传统观点通常将安全性能的退化简单归咎于梯度冲突,而本文的作者则创新性地提出了一种费雪几何学解释(Fisher-geometric explanation):研究发现,安全费雪信息矩阵呈低秩特性,这意味着对齐操作在压平安全几何结构的同时,保留了一条独特的输出路由路径。
当模型经历良性微调(甚至仅使用100个样本)时,这条特定的路径会在输出侧的 MLP 模块中被选择性地重新锐化。这解释了为何会出现非对称的脆弱性——即安全机制崩溃并导致高攻击成功率,而通用效用却基本保持不变。这种路由视角同时也解释了极少量的安全样本为何能够有效恢复拒绝响应行为(因为内部的安全表征得到了保留),并指出了 LoRA 和 ASAM 等缓解技术在更大微调规模下失效的局限性。
论文元数据 (Paper Metadata)
| 字段 | 详情 |
|---|---|
| arXiv ID | arXiv:2609.01455 |
| 主要学科 | 密码学与安全 (cs.CR) |
| 次要学科 | 人工智能 (cs.AI) |
| 作者 | Yitong Guo, Xiaoyi Chen, Siyuan Zhang, Xiaofeng Wang, Haixu Tang |
| 提交日期 | 2026年9月1日 |
| 状态 | 已被 Findings of EMNLP 2026 接收 |
Paper Metadata
Field Details arXiv ID arXiv:2609.01455 Primary Subject Cryptography and Security ( cs.CR)Secondary Subjects Artificial Intelligence ( cs.AI)Authors Yitong Guo, Xiaoyi Chen, Siyuan Zhang, Xiaofeng Wang, Haixu Tang Submission Date September 1, 2026 Status Accepted to the Findings of EMNLP 2026
访问与资源 (Access & Resources)
- 全文链接: 查看 PDF | HTML(实验性) | TeX 源码
- 数字对象唯一标识符 (DOI): 10.48550/arXiv.2609.01455
Access & Resources
- Full-Text Links: View PDF | HTML (Experimental) | TeX Source
- Digital Object Identifier (DOI): 10.48550/arXiv.2609.01455