频率至关重要:用于剪枝与量化的快速模型无关数据筛选
文章背景与核心概要
在保持大语言模型(LLM)性能的同时提升其部署便携性,训练后模型压缩技术至关重要。然而,选择用于寻找压缩模型配置的最佳校准数据,是一个关键但经常被忽视的环节。
本文推出了 ZipCal,这是一种创新的模型无关数据筛选策略,旨在基于齐普夫幂律(Zipfian power laws)最大化词汇多样性。ZipCal 不依赖于模型特定的信号(例如在规模扩大时成本极其高昂的困惑度),而是通过分析数据的内在属性来实现高效筛选。
该方法的主要发现与特性包括: * 卓越性能: 在各项剪枝基准测试中均优于标准的均匀随机采样。 * 效果匹敌: 实现了与依赖模型困惑度的最先进方法相媲美的下游性能。 * 极高效率: 凭借其易处理的线性复杂度,平均比基于困惑度的文方法快约 240 倍。
论文元数据
Paper Metadata
-
arXiv ID: arXiv:2603.16105 [cs.CL]
- arXiv ID: arXiv:2603.16105 [cs.CL]
-
主要学科: 计算与语言 (
cs.CL)- Primary Subject: Computation and Language (
cs.CL)
- Primary Subject: Computation and Language (
-
次要学科: 人工智能 (
cs.AI)- Secondary Subjects: Artificial Intelligence (
cs.AI)
- Secondary Subjects: Artificial Intelligence (
-
ACM 分类: I.2.7
- ACM Classification: I.2.7
-
发表状态: 已被 EMNLP 2026 接受为主会论文
- Publication Status: Accepted as a Main Conference Paper at EMNLP 2026
-
作者:
- Francesco Pio Monaco
- Elia Cunegatti
- Flavio Vella
-
Giovanni Iacca
- Authors:
- Francesco Pio Monaco
- Elia Cunegatti
- Flavio Vella
- Giovanni Iacca
-
提交时间: 2026年3月17日(v1);最后修订:2026年8月27日(v4)
- Submitted: March 17, 2026 (v1); Last revised: August 27, 2026 (v4)
-
- Resources: GitHub Repository | View PDF