跳转至

语言模型智能体能成为机械可解释性中得力的电路解释器吗?

文章背景与核心概要

在机械可解释性领域,自动定位神经网络电路的技术近年来取得了显着进展,但解释这些组件的具体功能依然是一项劳动密集型且难以标准化的任务。本文探讨了语言模型(LM)智能体是否能够实现这一解释过程的自动化,并推出了 AgenticInterpBench——一个包含 84 个半合成 Transformer 电路和 163 个组件级标注的全新基准测试。

作者提出了 HyVE(假设、验证、解释)这一智能体解释器框架,它通过观察、假设生成和因果验证的迭代循环来分析每个网络组件,最终得出组件级和任务级的功能描述。研究表明,虽然强大的底层模型能够有效地生成基于观察的假设,但由于计划不完整、执行错误或未解决的假设,性能瓶颈通常出现在验证阶段。针对 Llama-3-8B 中算术电路的案例研究证明,该框架成功地将应用范围从基准测试扩展到了自然训练的模型中。


论文元数据 (Paper Metadata)

  • arXiv ID: arXiv:2606.24026 [cs.AI]
  • 学科分类: 人工智能 (cs.AI)
  • 提交历史:
  • [v1] 2026年6月23日(星期二)
  • [v2] 2026年9月2日(星期三)(已被 EMNLP 2026 Findings 录用)
  • 作者: Ayan Antik Khan, Harsh Kohli, Yuekun Yao, Huan Sun, Ziyu Yao

Paper Metadata

  • arXiv ID: arXiv:2606.24026 [cs.AI]
  • Subjects: Artificial Intelligence (cs.AI)
  • Submission History:
  • [v1] Tue, 23 Jun 2026
  • [v2] Wed, 2 Sep 2026 (Accepted to Findings of EMNLP 2026)
  • Authors: Ayan Antik Khan, Harsh Kohli, Yuekun Yao, Huan Sun, Ziyu Yao

核心贡献与框架 (Key Contributions & Framework)

  • AgenticInterpBench: 一个专为评估电路解释而设计的新基准,包含 84 个半合成 Transformer 电路和 163 个组件级标注。
  • HyVE(假设、验证、解释): 一个迭代式智能体框架,通过以下步骤系统性地评估网络组件:
  • 观察 组件行为。
  • 生成假设 基于实证证据。
  • 因果验证 通过编程测试。
  • 研究发现: 语言模型智能体作为自动化电路解释器展现出了巨大的潜力,但稳健的因果验证仍然是实现可靠性能的主要障碍。

Key Contributions & Framework

  • AgenticInterpBench: A new benchmark designed for evaluating circuit explanations, featuring 84 semi-synthetic transformer circuits and 163 component-level annotations.
  • HyVE (Hypothesize, Validate, Explain): An iterative agent framework that systematically assesses network components via:
  • Observation of component behavior.
  • Hypothesis Generation based on empirical evidence.
  • Causal Validation via programmatic testing.
  • Findings: LM agents show strong promise as automated circuit explainers, though robust causal validation remains the primary hurdle for reliable performance.

全文与资源 (Full-Text & Resources)

Full-Text & Resources