文章背景与核心概要
随着扩散大语言模型(DLLMs)的兴起,传统的自回归逐Token预测范式正逐渐被迭代式的并行去噪所替代。然而,学术界对这类新型模型内部的安全对齐与防御机制仍缺乏足够的理解。本文首次深入探讨了DLLMs在安全博弈中既作为攻击目标(Targets)又作为对抗者(Adversaries)的双重角色,并揭示了基于扩散机制的对齐方法中存在的深层机理性漏洞。
研究表明,DLLMs的安全对齐特性呈现出高度的稀疏性并具备跨架构的可迁移性。由自回归模型初始化而来的DLLMs会直接继承其源模型的安全神经元足迹,这使得攻击者能够通过直接映射和剪枝安全神经元来实施攻击。实验发现,自剪枝会使攻击成功率(ASR)在 LLaDA 上从 2.6% 飙升至 73.8%,在 Dream 上从 1.9% 飙升至 86.6%。此外,作者还提出了一种名为“SN-Guided Diffusion”的离线黑盒越狱框架,它利用加权安全神经元损失来引导扩散过程远离安全触发区,在保持极低生成开销的同时,实现了极高的提示词可分离性(\(\text{AUROC} = 1.0\))以及对各大主流开源和闭源模型的高效攻击迁移能力。
扩散大语言模型作为攻击目标与对抗者:机理性安全漏洞 (Diffusion LLMs as Targets and Adversaries: Mechanistic Safety Exploits)
arXiv ID: 2608.07430
学科领域: 机器学习 (cs.LG);人工智能 (cs.AI)
提交时间: 2026年8月7日
作者: Elena Dumitrescu, Gert Lek, Lydia Y. Chen, Jérémie Decouchant
📌 执行摘要 (Executive Summary)
扩散大语言模型(DLLMs)通过迭代式并行去噪取代了标准的自回归下一个Token预测,实现了范式转变。然而,其内部的安全机制在很大程度上仍未得到充分研究。
本文深入研究了DLLMs作为目标(Targets)和对抗者(Adversaries)的双重角色,揭示了基于扩散的安全对齐中的深层机理性漏洞: * 稀疏且可迁移的对齐: 从自回归模型初始化的DLLMs继承了与源模型完全相同的机理性安全足迹,这使得它们容易受到直接安全神经元映射和剪枝的影响。 * 剪枝导致的ASR(攻击成功率)大规模飙升: 自剪枝显著提高了攻击成功率,在 LLaDA 上从 2.6% 飙升至 73.8%,在 Dream 上从 1.9% 飙升至 86.6%。来自 Qwen2.5 的迁移剪枝同样将 Dream 的ASR提升至 73.2%,将 Fast-dLLM 的ASR提升至 86.3%。 * SN引导扩散(SN-Guided Diffusion): 作者引入了一个完全离线的黑盒越狱框架,利用加权安全神经元损失来引导扩散过程远离安全触发区。该方法实现了近乎完美的提示词可分离性(\(\text{AUROC} = 1.0\)),并在闭源和开源模型上实现了高迁移ASR(例如,在 Llama-3-8B-Instruct 上为 77.1%,在 Qwen2.5-7B-Instruct 上为 86.9%,在 Gemini-2.5-Flash-Lite 上为 74.3%),且生成开销极低。
Diffusion Large Language Models (DLLMs) represent a paradigm shift by replacing standard autoregressive next-token prediction with iterative parallel denoising. However, their internal safety mechanisms remain largely unstudied.
This paper investigates DLLMs as both targets and adversaries, uncovering deep mechanistic vulnerabilities in diffusion-based safety alignment: * Sparse & Transferable Alignment: DLLMs initialized from autoregressive models inherit the exact same mechanistic safety footprints, making them susceptible to direct safety neuron mapping and pruning. * Massive ASR Spikes via Pruning: Self-pruning dramatically increases Attack Success Rates (ASR) from 2.6% to 73.8% on LLaDA and from 1.9% to 86.6% on Dream. Transfer pruning from Qwen2.5 similarly boosts ASR to 73.2% (Dream) and 86.3% (Fast-dLLM). * SN-Guided Diffusion: The authors introduce a fully offline black-box jailbreak framework utilizing weighted safety neuron loss to steer diffusion away from safety triggers. This achieves near-perfect prompt separability (\(\text{AUROC} = 1.0\)) and high transfer ASRs across proprietary and open models (e.g., 77.1% on Llama-3-8B-Instruct, 86.9% on Qwen2.5-7B-Instruct, and 74.3% on Gemini-2.5-Flash-Lite) with minimal generation overhead.
📄 摘要 (Abstract)
扩散大语言模型(DLLMs)用迭代式的并行去噪代替了自回归的下一个Token预测,然而人们对它们内部的安全机制仍然知之甚少。在这项工作中,我们研究了DLLMs作为目标和对抗者的双重角色,暴露了基于扩散的安全对齐中的机理性漏洞。
我们首先表明,DLLMs中的安全对齐仍然是稀疏的,并且在不同架构之间是可迁移的。从自回归前身初始化的DLLMs继承了与其源模型相同的机理性安全足迹,从而能够通过直接的安全神经元映射和剪枝来实施迁移攻击。自剪枝将 LLaDA 上的攻击成功率(ASR)从 2.6% 提高到 73.8%,将 Dream 上的 ASR 从 1.9% 提高到 86.6%;而从 Qwen2.5 进行迁移剪枝则将 Dream 上的 ASR 从 1.9% 提高到 73.2%,将 Fast-dLLM 上的 ASR 从 7.0% 提高到 86.3%。
在这些发现的基础上,我们引入了 SN引导扩散(SN-Guided Diffusion),这是一个完全离线的黑盒越狱框架,它利用加权安全神经元损失引导扩散过程远离安全触发区域,实现了近乎完美的提示词可分离性(良性与越狱辨别的 AUROC = 1.0)。在多个开放和专有目标模型中,我们的方法在 Llama-3-8B-Instruct 上实现了高达 77.1% 的迁移 ASR,在 Qwen2.5-7B-Instruct 上实现了 86.9% 的迁移 ASR,针对 Gemini-2.5-Flash-Lite 实现了 74.3% 的迁移 ASR,同时每个提示词仅需要 20 次生成迭代。与先前的越狱框架相比,我们的方法以低几个数量级的生成成本实现了极具竞争力的可迁移性。
Diffusion Large Language Models (DLLMs) replace autoregressive next-token prediction with iterative parallel denoising, yet their internal safety mechanisms remain poorly understood. In this work, we investigate DLLMs both as targets and as adversaries, exposing mechanistic vulnerabilities in diffusion-based alignment.
We first show that safety alignment in DLLMs remains sparse and transferable across architectures. DLLMs initialized from autoregressive predecessors inherit the same mechanistic safety footprint as their source models, enabling transfer attacks via direct safety neuron mapping and pruning. Self-pruning increases attack success rates (ASR) from 2.6% to 73.8% on LLaDA and from 1.9% to 86.6% on Dream, while transfer pruning from Qwen2.5 increases ASR from 1.9% to 73.2% on Dream and from 7.0% to 86.3% on Fast-dLLM.
Building on these findings, we introduce SN-Guided Diffusion, a fully offline black-box jailbreak framework that steers the diffusion process away from safety-triggering regions using a weighted safety neuron loss, which achieves near-perfect prompt separability (AUROC = 1.0 for benign-vs-jailbreak discrimination). Across multiple open and proprietary targets, our method achieves a transfer ASR of up to 77.1% on Llama-3-8B-Instruct, 86.9% on Qwen2.5-7B-Instruct, and 74.3% against Gemini-2.5-Flash-Lite, while requiring only 20 generation episodes per prompt. Compared to prior jailbreaking frameworks, our method achieves competitive transferability with orders-of-magnitude lower generation cost.
🔗 资源与全文链接 (Resources & Full-Text Links)
- arXiv 摘要: https://arxiv.org/abs/2608.07430
- PDF 直链: 查看 PDF
- HTML 版本: arXiv HTML (实验性)
- 代码库: GitHub 仓库 - SN-Guided Diffusion
- 许可证: 知识共享署名 4.0 (根据说明保留下方许可证图标)
