文章背景与核心概要
传统的语言模型安全防护机制(如安全微调、过滤和遗忘技术)通常在模型权重之外运行,通过重新配置过滤器或发布独立的组件来实现。相比之下,“能力门控部署”(capability-gated deployment)直接在单一的模型权重内部引入了针对不同主体(principal)的访问控制。
在该框架中,模型配置构成了一个数学上的格(lattice):交运算(Meets,\(\sqcap\))用于累加主体的限制条件,并运算(Joins,\(\sqcup\))用于汇聚多个主体的访问范围。作者通过现有的嵌套分解机制采用稀疏秩门控来实现这一方法,并通过单遍归因(one-pass attribution)引导配置文件搜索,同时在预注册的留存数据集上评估结果。研究发现:其一,在单调诱导假设下,安全性在交运算下具有可证明的组合性;其二,效用并不具备组合性,单独无害的配置文件组合起来可能会导致显著的信息保留和流畅度受损,且不存在组合性边界。
Capability-Gated Language Models: Security Composes, Utility Does Not
arXiv: 2609.00445 [cs.CR]
Submitted: 31 August 2026
Authors: Patrikas Vanagas, Augustas Mačijauskas, Laurynas Lopata
Primary Subject: Cryptography and Security (cs.CR)
Additional Subjects: Artificial Intelligence (cs.AI), Machine Learning (cs.LG)
arXiv: 2609.00445 [cs.CR]
Submitted: 31 August 2026
Authors: Patrikas Vanagas, Augustas Mačijauskas, Laurynas Lopata
Primary Subject: Cryptography and Security (cs.CR)
Additional Subjects: Artificial Intelligence (cs.AI), Machine Learning (cs.LG)
Summary
Summary
Traditional language model safeguards (such as safety fine-tuning, filtering, and unlearning) typically operate outside the model weights by reconfiguring filters or issuing separate artefacts. In contrast, capability-gated deployment introduces per-principal access control directly inside a single set of model weights.
传统的语言模型安全防护机制(如安全微调、过滤和遗忘技术)通常在模型权重之外运行,通过重新配置过滤器或发布独立的组件来实现。相比之下,“能力门控部署”(capability-gated deployment)直接在单一的模型权重内部引入了针对不同主体(principal)的访问控制。
In this framework, model configurations form a mathematical lattice: * Meets (\(\sqcap\)) accumulate a principal's restrictions. * Joins (\(\sqcup\)) pool a coalition's reach.
在该框架中,模型配置构成了一个数学上的格(lattice): * 交运算 (\(\sqcap\)) 用于累加主体的限制条件。 * 并运算 (\(\sqcup\)) 用于汇聚多个主体的访问范围。
The authors instantiate this approach using sparse rank gating over an existing nested-factorisation mechanism, guiding profile search via one-pass attribution and evaluating results against a pre-registered held-out split.
作者通过现有的嵌套分解机制采用稀疏秩门控来实现这一方法,并通过单遍归因(one-pass attribution)引导配置文件搜索,同时在预注册的留存数据集上评估结果。
Key Findings
- Security Composes: Provably at meets under a monotone-elicitation assumption (which the authors falsify pointwise). Across two lineages, the median held-out meet deepens suppression, with the surviving effect strengthening it.
- Utility Does Not: Individually harmless profiles can compose to cause significant retention and fluency damage, and no compositional bound exists.
核心发现
- 安全性具备组合性: 在单调诱导假设下(作者在逐点上对其进行了证伪),安全性在交运算下具有可证明的组合性。在两个谱系中,中位数留存交运算加深了抑制效果,且残留的影响进一步增强了这种抑制。
- 效用并不具备组合性: 单独无害的配置文件组合起来可能会导致显著的信息保留和流畅度受损,且不存在任何组合性边界。
Metadata & Links
Metadata & Links
- DOI: 10.48550/arXiv.2609.00445
- Full-Text Access:
- View PDF
- HTML (Experimental)
- TeX Source
- License: Creative Commons Attribution 4.0 (License icon preserved below)

- DOI: 10.48550/arXiv.2609.00445
- Full-Text Access:
- View PDF
- HTML (Experimental)
- TeX Source
- License: Creative Commons Attribution 4.0 (License icon preserved below)