语言模型中的信念与行为
文章背景与核心概要
本文探讨了“信念”或“欲望”等认知抽象概念是否能够有意义地描述和预测大语言模型(LLM)的行为。尽管这些潜在概念经常被用来解释模型输出或评估依赖意图的有害行为,但此前一直缺乏系统的方法来检验其有效性。为此,作者提出了一个实证框架,以检验单个潜变量(被解释为信念度)是否能准确预测LLM对新提示词的响应方式。
研究结果表明,能力极强的模型可以被有效地描述为持有信念,且预测能力随模型整体能力的提升而提升。此外,该研究还概述了用于测量信念、评估对决策规则的遵从度,以及追踪单个模型实例在推理过程中信念演变过程的实证策略。
Metadata
- arXiv ID: arXiv:2609.07943
- Primary Subject: Computer Science > Artificial Intelligence (
cs.AI) - Secondary Subjects: Machine Learning (
cs.LG) - Submitted on: September 7, 2026
- Authors: Alex Smolin, Bryan Wilder
- Comments: 33 pages, 10 figures
Metadata
- arXiv ID: arXiv:2609.07943
- Primary Subject: Computer Science > Artificial Intelligence (
cs.AI)- Secondary Subjects: Machine Learning (
cs.LG)- Submitted on: September 7, 2026
- Authors: Alex Smolin, Bryan Wilder
- Comments: 33 pages, 10 figures
Access & Resources
- Full-Text Links: View PDF | TeX Source
- External References: Google Scholar | Semantic Scholar | NASA ADS
Access & Resources
- Full-Text Links: View PDF | TeX Source
- External References: Google Scholar | Semantic Scholar | NASA ADS