优化中的渗透动力学:方差级联与离散尺度不变性
文章背景与核心概要
本文深入研究了深度神经网络中随机梯度下降(SGD)的底层动力学机制。尽管众所周知 SGD 会引导网络走向代表较简小子网络的泛化不变集,但这一过程的时间演化规律此前尚不明确。作者将随机梯度流(SGF)建模为一个渗透(percolation)过程,其中架构对称性导致各个子网络以离散的同步块形式合并,而非按顺序逐一合并。
这些结构转变在宏观序参量中表现为方差尖峰,这与物理学中的相变现象高度相似。此外,该研究证明了这种捕获机制及其相应的缩放级联,在显式重尾噪声框架下同样适用于 Adam 和 AdamW 等现代优化器。这项工作为理解深度学习中的优化过程架起了通往统计力学的重要桥梁。
论文元数据 (Paper Metadata)
- arXiv ID:
arXiv:2609.02373[cs.LG] - 主要学科: 机器学习 (
cs.LG) - 次要学科: 无序系统与神经网络 (
cond-mat.dis-nn)、统计力学 (cond-mat.stat-mech)、人工智能 (cs.AI) - 作者: Sai Niranjan Ramachandran, Suvrit Sra
- 提交日期: 2026年9月2日
- 许可协议: 知识共享署名 4.0

- arXiv ID:
arXiv:2609.02373[cs.LG]- Primary Subject: Machine Learning (
cs.LG)- Secondary Subjects: Disordered Systems and Neural Networks (
cond-mat.dis-nn), Statistical Mechanics (cond-mat.stat-mech), Artificial Intelligence (cs.AI)- Authors: Sai Niranjan Ramachandran, Suvrit Sra
- Submission Date: September 2, 2026
- License: Creative Commons Attribution 4.0