跳转至

更大的文本编码器可能会损害 CLIP 的零样本性能

文章背景与核心概要

对比语言-图像预训练(CLIP)模型是现代多模态机器学习的基石。在以往的大规模训练中,标度律(Scaling Laws)通常指导着计算资源的分配,人们往往假设盲目增大模型尺寸能带来性能的全面提升。然而,本文研究揭示了一个反直觉的现象:对于大多数视觉编码器而言,文本编码器存在一个最佳尺寸,一旦超过这个大小,零样本(Zero-shot)性能反而会下降——尽管模型的总参数量仍在增加。

作者证明,这种性能下降是由过大的文本编码器引起的过拟合所导致的,并且可以通过使用模态特定的权重衰减(weight decay)来缓解。通过几何分析,他们进一步表明,盲目扩展文本编码器虽然能提高嵌入空间的均匀性(uniformity),但会以牺牲跨模态对齐(cross-modal alignment)为代价。该研究不仅为零样本性能提供了预测性指标,也为设计更高效、更可靠的 CLIP 扩展路径开辟了新方向。


论文元数据

  • arXiv ID: arXiv:2609.05730 [cs.CV]
  • DOI: 10.48550/arXiv.2609.05730
  • 主要学科: 计算机视觉与模式识别 (cs.CV), 人工智能 (cs.AI)
  • 提交日期: 2026年9月4日
  • 作者: Samir Char, Carles Domingo-Enrich, Randall Balestriero

摘要

对比语言-图像预训练(CLIP)是许多机器学习应用的核心构建模块。虽然标度律一直指导着大规模训练的资源分配,但以往的工作通常将 CLIP 的整体模型大小视为单一变量,而没有探讨视觉与文本编码器之间的容量分配如何影响下游性能。

在本文中,我们训练了多个具有不同视觉和文本编码器尺寸的 CLIP 模型。结果表明,对于大多数视觉编码器,文本编码器存在一个最佳尺寸,一旦超过该尺寸,零样本性能就会下降——即使总参数量仍在增加。利用这一特性,我们可以构建出高效的配置:在参数量减少高达 55% 的情况下,依然能够匹配标准 ViT-B/16 架构的零样本性能。

我们进一步证明,这种性能下降源于过大文本编码器所导致的过拟合,而采用模态特定的权重衰减系数不仅可以恢复性能,还能在所有受损的配置中进一步提升性能。几何分析表明,扩展文本编码器会带来一种权衡:它提升了嵌入的均匀性,但恶化了跨模态对齐;我们进一步证明,这些指标能够有效预测零样本性能。我们希望这些发现能推动 CLIP 架构和训练方法的发展,以克服这种性能下降问题,这是实现 CLIP 可靠且高效扩展的先决条件。


访问链接与资源