GAMMA:任意预算下混合精度模型的全局比特分配
文章背景与核心概要
大语言模型的混合精度量化是一种平衡计算预算与模型精度的有效方法,其核心思想是为敏感的模块分配更高的比特宽度。然而,现有技术面临着明显的瓶颈:基于学习的方法需要进行昂贵的量化感知训练(QAT);无需训练的替代方案依赖于静态代理指标,无法捕捉模块间的交互作用,且必须针对每个目标预算重新计算;而基于搜索的方法则无法保证严格满足预算约束。
为了克服这些挑战,本文作者提出了 GAMMA(Global Bit Allocation,全局比特分配)框架。这是一个与量化器无关的框架,完全在训练后(post-training)流程中运行。GAMMA 通过在增强拉格朗日约束下优化教师强制的隐藏状态重构目标来学习模块级的精度偏好,并利用整数规划将这些偏好转化为精确满足预算的可行离散分配方案。由于学习到的偏好编码了稳定的敏感度排序,而不是僵化的预算权重,因此单次训练即可通过重新求解整数规划来适应任意部署目标,从而将每个预算的适配时间从数小时缩短至数分钟。在 Llama 和 Qwen 模型(8B 至 32B)上的评估表明,GAMMA 显著优于固定精度基线(平均提升高达 +12.99)以及基于搜索的混合精度方法(平均提升高达 +7.00),在平均仅 2.5 比特的精度下成功匹配了固定 3 比特的性能。
论文元数据
| 字段 | 详情 |
|---|---|
| arXiv ID | arXiv:2605.18475 [cs.LG] |
| 主要学科 | 机器学习 (cs.LG),交叉收录于人工智能 (cs.AI) |
| 作者 | Zhangyang Yao, Haiyan Zhao, Haoyu Wang, Xu Han |
| 提交历史 | 2026年5月18日提交;2026年8月27日修订 |
| 全文链接 | 查看 PDF | HTML 版本 | TeX 源码 |
核心亮点
- 与量化器无关的训练后方法: 无需对数十亿参数的模型进行开销高昂的量化感知训练,即可学习模块级的精度偏好。
- 分数复用以适应任意预算: 编码稳定的敏感度排序而非特定预算的权重,使单次训练即可通过整数规划在数分钟内动态适应任何部署目标。
- SOTA 性能表现: 在 Llama 和 Qwen 模型(8B–32B)上,相比固定精度基线平均提升高达 +12.99,相比基于搜索的方法平均提升高达 +7.00。
- 极高的内存效率: 在平均 2.5 比特 的精度下成功匹配了固定 3 比特模型的质量,大幅减少了内存占用。