跳转至

高效注意力机制的线性代数基础:SVD压缩下秩坍缩的相位反转

文章背景与核心概要

现代基于Transformer的基础网络广泛利用自注意力机制进行信息的编码、压缩和传递。本文深入探讨了支撑这一过程的矩阵秩、奇异值分解(SVD)以及特征值分解等基础线性代数概念,通过统一14篇同行评议的研究成果,聚焦于自注意力矩阵的输出秩推导、利用秩行为的压缩方法,以及低秩键值(KV)缓存投影与线性注意力、状态空间模型之间的数学对偶性。

该研究的一大核心发现是关于SVD压缩与网络自然秩坍缩之间相互作用的突破性进展。作者发现,对注意力投影进行SVD压缩会导致网络秩坍缩出现“相位反转”现象:在网络初始化时,SVD会强烈抑制秩坍缩;而在预训练模型上,SVD则会加速秩坍缩。因果分解进一步揭示,压缩过程中SVD所选择的特定子空间起到了决定性作用(在初始化时占约76%的效果,在预训练权重上占83%),其重要性远超算子范数的单纯降低。这一发现为校准感知压缩范式提供了关键改进,并解释了为什么SVD的性能表现优于朴素截断。