跳转至

文章背景与核心概要

在大语言模型(LLM)的可解释性研究中,激活引导(Activation steering)是一种将局部的神经表征转化为控制方向的常用技术。然而,单纯的定位并不能保证所选方向具备“选择性操作区间”(即在成功改变目标行为的同时,不会引发能力或语义上的损害)。为了解决这一痛点,本文引入了预测性记忆定位(Predictive Memory Localization, PML)框架,该框架将测量网格干预路径作为主要的预测对象。

通过将随机校准的目标移动与语义邻近域及能力退化进行隔离,PML 为边际级别的选择性结果建立了可证伪的预测,从而实现了更安全、具备风险感知能力模型干预。研究通过跨 9 个数据集和 14 个领域的 3,000 条记录进行了广泛评估,证明了低剂量因果响应能够作为强有力的预测信号,显著提升大模型干预的精确度与安全性,并有效规避了密集的评估扫描。


Predictive Memory Localization: Forecasting Selective Intervention Paths from Internal Signals

预测性记忆定位:从内部信号预测选择性干预路径

arXiv: 2608.12892 [cs.AI]
DOI: 10.48550/arXiv.2608.12892
Submitted: August 13, 2026
Authors: Jinhao Jing, Tian Zeyu, Lucas Qingyang Fang, Zhisheng Chen, Shuang Chen, Yuhao Luo, Qiannian Zhao


📌 Summary

📌 摘要

Activation steering is a popular technique for transforming localized neural representations into control directions; however, mere localization fails to guarantee whether a chosen direction possesses a selective operating regime (i.e., successfully altering target behaviors without inducing capability or semantic damage).

激活引导是将局部的神经表征转化为控制方向的常用技术;然而,单纯的定位并不能保证所选方向具备选择性操作区间(即在成功改变目标行为的同时,不会引发能力或语义上的损害)。

This paper introduces Predictive Memory Localization (PML), a framework that treats measured-grid intervention paths as primary predictive objects. By isolating random-calibrated target movements from semantic-neighbor and capability degradation, PML establishes a falsifiable forecast for margin-level selective outcomes, enabling safer, risk-aware model interventions.

本文引入了预测性记忆定位(Predictive Memory Localization, PML)框架,该框架将测量网格干预路径作为主要的预测对象。通过将随机校准的目标移动与语义邻近域和能力退化分离开来,PML 为边际级别的选择性结果建立了一个可证伪的预测,从而实现了更安全、具备风险意识的模型干预。


🔍 Key Highlights & Methodology

🔍 核心亮点与方法论

  • Comprehensive Evaluation: The study evaluates frozen models across 3,000 records spanning 9 datasets and 14 domains, producing 30,000 distinct record-direction-layer paths and 210,000 unique path-strength evaluations.
  • 全面评估: 本研究对冻结模型进行了评估,涵盖跨越 9 个数据集和 14 个领域的 3,000 条记录,产生了 30,000 条不同的“记录-方向-层”路径以及 210,000 次独特的路径强度评估。
  • Geometric Superiority: At layer 7, geometry-derived RFM/AGOP directions achieve 13.1% target-any and 12.3% clean-any success rates, outperforming random baselines by 3.6 and 3.4 percentage points respectively (under record-paired bootstrapping).
  • 几何优势: 在第 7 层,基于几何推导的 RFM/AGOP 方向实现了 13.1% 的目标任意成功率和 12.3% 的纯净任意成功率,在记录配对自助法(bootstrap)下,分别比随机基线高出 3.6 和 3.4 个百分点。
  • Low-Dose Causality: Across record-, dataset-, and domain-grouped splits, causal responses measured at a weak intervention strength (\(|\alpha|=0.1\)) serve as the most powerful predictive signals for outcomes at disjoint, stronger intensities (\(|\alpha| \in \{0.25, 0.5\}\)).
  • 低剂量因果关系: 在记录、数据集和域分组切分中,在较弱干预强度(\(|\alpha|=0.1\))下测量的因果响应,成为了预测不相交且更强强度(\(|\alpha| \in \{0.25, 0.5\}\))下结果的最强大预测信号。
  • Risk-Aware Selectors: On held-out records, a predictor-driven selector can choose an optimal coefficient or abstain entirely. This approach improves overall utility, reduces semantic-neighbor damage compared to fixed-strength policies, and circumvents the need for dense evaluation scans.
  • 风险感知选择器: 在保留记录(held-out records)上,预测器驱动的选择器可以选择最佳系数或完全弃权。与固定强度策略相比,这种方法提高了整体效用,减少了语义邻近域的损害,并避免了对密集评估扫描的需求。
  • Robust Across Base Models: Across three residual-norm-matched base models, learned directions reliably preserve selective-path gains, with low-dose responses achieving high macro-AUROC scores (\(0.801\) to \(0.828\)) on held-out records.
  • 跨基础模型的鲁棒性: 在三个残差范数匹配的基础模型中,学习到的方向可靠地保持了选择性路径的增益,低剂量响应在保留记录上获得了很高的宏观 AUROC 得分(\(0.801\)\(0.828\))。

📄 Access Full-Text

📄 访问全文


🔗 相关链接与工具