研究将LLM块剪枝重构为伊辛优化问题
Hugging Face博客介绍一项研究,把大语言模型的整块删除(深度剪枝)重构为受约束二元优化问题,对应伊辛玻璃模型,并称在深度压缩场景下优于现有块删除基线。
核心事实
Hugging Face博客发布的一篇文章介绍了一项研究,将大语言模型的整块删除(block removal,也称深度剪枝)重新表述为受约束二元优化(CBO)问题。据该文描述,每个transformer块对应一个二元变量,0表示保留、1表示删除,通过对模型损失做二阶泰勒展开得到近似Hessian矩阵,其对角线表示单块重要性,非对角项表示块与块之间的耦合。该问题在物理上对应一种全连接的伊辛玻璃模型,即在固定删除块数的约束下寻找低能态。
背景与影响
文章指出,现有块删除方法多对每个块单独打分,或只允许删除一段连续块,忽略了块之间的相互作用,在压缩比例较高时容易损失模型质量。该研究称,Hessian只需在小规模校准数据集上通过前向与反向传播计算一次,之后评估任意候选配置只需一次能量计算,且同一Hessian可复用于不同压缩目标。文章称,在Llama-3.3-70B-Instruct上以50%深度压缩且不重训练时,该方法在MMLU上比最强基线高出近23个百分点;并称该方法可直接迁移到Mamba2、注意力与MoE层交错的混合架构。上述数据均来自该文自述,尚未获官方独立确认。
限制与来源
该文同时说明,能量只是下游质量的近似代理,最低能态未必是最佳模型,因此需要考察低能谱中的多个候选。文章提到,精确枚举在配置空间过大时会失效,此时需借助禁忌搜索、量子退火、QAOA等求解器,其中开源禁忌求解器可在数秒内达到可验证的最低能态。相关结论、基准与适用性均以论文原文及官方后续信息为准。来源:Hugging Face博客文章《Pruning LLMs Like a Physicist: Block Removal as an Ising Optimization Problem》。