跳转至

频率至关重要:用于剪枝与量化的快速模型无关数据筛选

文章背景与核心概要

在保持大语言模型(LLM)性能的同时提升其部署便携性,训练后模型压缩技术至关重要。然而,选择用于寻找压缩模型配置的最佳校准数据,是一个关键但经常被忽视的环节。

本文推出了 ZipCal,这是一种创新的模型无关数据筛选策略,旨在基于齐普夫幂律(Zipfian power laws)最大化词汇多样性。ZipCal 不依赖于模型特定的信号(例如在规模扩大时成本极其高昂的困惑度),而是通过分析数据的内在属性来实现高效筛选。

该方法的主要发现与特性包括: * 卓越性能: 在各项剪枝基准测试中均优于标准的均匀随机采样。 * 效果匹敌: 实现了与依赖模型困惑度的最先进方法相媲美的下游性能。 * 极高效率: 凭借其易处理的线性复杂度,平均比基于困惑度的文方法快约 240 倍


论文元数据

Paper Metadata

  • arXiv ID: arXiv:2603.16105 [cs.CL]

  • 主要学科: 计算与语言 (cs.CL)

    • Primary Subject: Computation and Language (cs.CL)
  • 次要学科: 人工智能 (cs.AI)

    • Secondary Subjects: Artificial Intelligence (cs.AI)
  • ACM 分类: I.2.7

    • ACM Classification: I.2.7
  • 发表状态: 已被 EMNLP 2026 接受为主会论文

    • Publication Status: Accepted as a Main Conference Paper at EMNLP 2026
  • 作者:

  • Francesco Pio Monaco
  • Elia Cunegatti
  • Flavio Vella
  • Giovanni Iacca

    • Authors:
    • Francesco Pio Monaco
    • Elia Cunegatti
    • Flavio Vella
    • Giovanni Iacca
  • 提交时间: 2026年3月17日(v1);最后修订:2026年8月27日(v4)

    • Submitted: March 17, 2026 (v1); Last revised: August 27, 2026 (v4)
  • 相关资源: GitHub 仓库 | 查看 PDF