跳转至

GAMMA:面向任意预算的混合精度模型全局位分配框架

文章背景与核心概要

通过混合精度量化优化大语言模型(LLM)是平衡计算预算与模型精度的有效手段,其核心在于为敏感模块分配更高的位宽。然而,现有的技术方案存在明显瓶颈:基于学习的方法需要昂贵的量化感知训练(QAT);无需训练的替代方案依赖于静态代理指标,难以捕捉模块间的交互,且每当目标预算改变时都必须重新计算;而基于搜索的方法则往往难以保证对预算约束的严格遵守。

为了克服这些挑战,作者提出了 GAMMA,这是一个与量化器无关(quantizer-agnostic)的训练后量化框架。GAMMA 通过在增强拉格朗日约束下优化教师强制的隐藏状态重构目标,学习各模块的精度偏好,并利用整数规划将这些偏好转化为精确符合预算的离散分配方案。由于所学习的偏好编码了稳定的敏感度排序而非僵化的预算权重,单次训练即可通过重新求解整数规划来支持任意部署目标,将单次预算适配时间从数小时缩短至数分钟。在 Llama 和 Qwen 模型(8B 至 32B)上的评估显示,GAMMA 显著优于固定精度基线(平均提升高达 +12.99)和基于搜索的混合精度方法(平均提升高达 +7.00),在仅 2.5 位平均精度下成功匹配了固定 3 位模型的性能。


论文元数据

字段 详情
arXiv ID arXiv:2605.18475 [cs.LG]
主要学科 机器学习 (cs.LG),交叉学科:人工智能 (cs.AI)
作者 Zhangyang Yao, Haiyan Zhao, Haoyu Wang, Xu Han
提交历史 2026年5月18日提交;2026年8月27日修订
全文链接 查看 PDF | HTML 版本 | TeX 源码

核心亮点

  • 与量化器无关的训练后处理: 无需对数十亿参数模型进行昂贵的量化感知训练,即可学习模块级的精度偏好。

    Quantizer-Agnostic Post-Training: Learns module-wise precision preferences without the prohibitive costs of quantization-aware training on billion-parameter models.

  • 面向任意预算的评分复用: 编码了稳定的敏感度排序而非特定于预算的权重,使得单次训练运行即可通过整数规划在几分钟内动态适配任何部署目标。

    Score Reuse for Arbitrary Budgets: Encodes stable sensitivity rankings instead of budget-specific weights, allowing a single training run to dynamically adapt to any deployment target in minutes via integer programming.

  • 最先进的性能表现: 在 Llama 和 Qwen 模型(8B–32B)上,较固定精度基线平均提升高达 +12.99,较基于搜索的方法平均提升高达 +7.00

    State-of-the-Art Performance: Outperforms fixed-precision baselines by up to +12.99 Avg. and search-based methods by up to +7.00 Avg. on Llama and Qwen models (8B–32B).

  • 高内存效率: 在平均仅 2.5 位 的精度下成功匹配了固定 3 位模型的质量,大幅降低了内存占用。

    High Memory Efficiency: Successfully matches fixed 3-bit model quality at an average precision of 2.5 bits, drastically minimizing memory footprints.