跳转至

GRM:通过梯度比率掩码对音频大模型实施兼顾效用的越狱攻击

文章背景与核心概要

音频大模型(ALLMs)虽然支持无缝的语音交互,但也引入了新的安全漏洞,例如越狱攻击。传统的基于扰动的方法通常在所有频段上应用通用扰动,缺乏选择性控制。这种全频段方法会产生明显的行为痕迹,并降低系统在正常良性任务上的实用性,从而使攻击极易被检测到。

为了解决这一问题,本文作者深入研究了部分频段与全频段扰动的差异,发现越狱成功率(JSR)呈非单调变化,而效用损失则随着频率覆盖范围的扩大而线性增加。基于这一洞察,他们提出了 GRM(Gradient-Ratio Masking,梯度比率掩码)——一个兼顾效用的频率选择性越狱框架。该框架能够:1. 根据越狱贡献与转录敏感度的比率对梅尔频段(Mel bands)进行排序;2. 将通用扰动严格限制在最优频段内;3. 对偏离用户请求预期语义的行为进行正则化。

对四个音频大模型的实验评估表明,GRM 平均实现了高达 88.46% 的越狱成功率(JSR),同时显著降低了其在良性转录和响应任务中的效用损失。


论文元数据

  • arXiv ID: arXiv:2604.09222 [cs.SD]
  • 学科分类: 声音 (cs.SD); 人工智能 (cs.AI)
  • 会议/录用: 已被 MM 2026 录用
  • 作者:
  • Yunqiang Wang
  • Hengyuan Na
  • Di Wu
  • Miao Hu
  • Guocong Quan
  • 提交日期: 2026年4月10日提交;2026年8月7日最后修订(v2版本)
  • 代码仓库: GitHub - 159753Fetter/GRM

⚠️ 警告: 本文包含与人工智能安全和越狱方法论相关的潜在敏感内容。


摘要

音频大模型(ALLMs)实现了语音交互,但也带来了新的越狱漏洞。现有的基于扰动的越狱方法并未显式控制哪些频段承载扰动。尽管此类扰动可以引发不安全的回应,但在多样化的输入上重复应用通用扰动也可能降低正常任务的效用,从而留下明显的行为痕迹,使攻击暴露给用户或自动化监控系统,进而损害其隐蔽性。

为了确定全频段扰动是否必要,我们将覆盖范围从部分频段调整到全频段。研究发现,越狱成功率(JSR)呈非单调变化,而效用降级则随着覆盖范围的扩大而增长。这种不匹配表明,相比于全频段扰动,精选的频段可以在带来更少效用损失的同时产生更强的攻击效果。

基于这一观察,我们提出了 GRM(梯度比率掩码),这是一个兼顾效用、具备频率选择性的越狱框架。它通过计算越狱贡献与转录敏感度之间的比率来对梅尔频段进行排序,将通用扰动限制在选定的频段内,并正则化对预期请求语义的偏离。在四个音频大模型上的实验表明,GRM 平均实现了 88.46% 的 JSR,同时在良性转录和响应任务中大幅减少了相对于基线方法的效用损失。

Audio Large Language Models (ALLMs) enable spoken interaction but introduce new jailbreak vulnerabilities. Existing perturbation-based jailbreaks do not explicitly control which frequency bands carry the perturbation. Although such perturbations can elicit unsafe responses, repeatedly applying a universal perturbation across diverse inputs may also degrade utility on normal tasks, leaving a conspicuous behavioral footprint that may expose the attack to users or automated monitoring systems and thereby compromise its stealthiness.

To determine whether full-band perturbation is necessary, we vary coverage from partial-band to full-band. Jailbreak Success Rate (JSR) varies non-monotonically, while utility degradation grows with coverage. This mismatch shows that selected bands can yield stronger attacks with less utility degradation than full-band perturbations.

Based on this observation, we propose GRM, a utility-aware, frequency-selective jailbreak framework that ranks Mel bands by the ratio between jailbreak contribution and transcript sensitivity, confines a universal perturbation to selected bands, and regularizes deviations from the intended request semantics. Experiments on four ALLMs show that GRM achieves an average JSR of 88.46% while substantially reducing utility degradation across benign transcription and response tasks relative to baselines.


全文及访问链接