跳转至

短上下文语言建模中的逐层位置偏差

文章背景与核心概要

Transformer 语言模型在处理输入时,往往表现出一种“位置偏差”,即无论语义重要性如何,模型都会系统性地偏向特定的输入位置。以往的研究大多通过长上下文性能下降或注意力模式来观察这种现象,但输入位置如何逐层直接驱动预测结果,此前尚未得到量化测量。

为了解决这一问题,研究人员引入了一种“层电导(layer conductance)”框架,并结合滑动窗口设计,将其应用于短上下文的下一个词预测任务中。该方法成功将模型内部行为与外部任务或上下文窗口的限制隔离开来。核心发现包括:逐层位置重要性分布在不同文本和词序打乱下保持高度一致,证实了其代表真实的模型内部结构;随着网络深度的加深,近因偏差(recency bias)单调递增,而首因偏差(primacy bias)则较为微妙且呈减弱趋势;此外,位置偏差因词性而异——虚词表现出更强的近因偏差,而实词则倾向于更高的首因偏差。


文章详情 (Article Details)

  • arXiv ID: arXiv:2601.04098 [cs.CL]

  • DOI: 10.48550/arXiv.2601.04098

  • Primary Subject: 计算与语言 (cs.CL)

    • Primary Subject: Computation and Language (cs.CL)
  • Secondary Subjects: 人工智能 (cs.AI)

    • Secondary Subjects: Artificial Intelligence (cs.AI)
  • Authors: Maryam Rahimi, Mahdi Nouri, Yadollah Yaghoobzadeh

    • Authors: Maryam Rahimi, Mahdi Nouri, Yadollah Yaghoobzadeh
  • Submission Timeline:

  • 提交于 2026年1月7日 (v1)
  • 最后修订于 2026年8月6日 (v2)
    • Submission Timeline:
    • Submitted on January 7, 2026 (v1)
    • Last revised on August 6, 2026 (v2)

许可与资源 (License & Resources)