加速大型语言模型(LLM)最高效且低成本的路径之一,往往最为直接:直接删除整个 Transformer 模块。这种被称为模块移除(或深度剪枝)的技术,通过缩短模型结构,不仅能节省内存,还能带来可预测的推理速度提升,并可无缝叠加量化、低秩压缩等技术。

难点在于精准决策哪些模块应当被切除。误删会导致模型性能崩溃,且模块间的移除存在复杂的相互作用,这使得该问题成为一个组合优化难题,而非简单的排序问题。针对这一挑战,最新论文《通过受限二进制优化进行 LLM 模块移除压缩》提出将模块选择重构为受限二进制优化(CBO)问题,并直接映射到物理学中的伊辛玻璃(Ising glass)模型。

从平均场到多体耦合:为何模块选择是组合难题

传统模块移除方法多采用“平均场”思路,即单独评估每个模块的重要性(如基于幅度、敏感度或模块影响力),假设各模块贡献相互独立。然而,真实模型中的模块如同磁铁中的自旋,存在显著的耦合效应。移除第 20 个模块的影响,取决于第 19 或 24 个模块是否也被移除。忽略这种耦合,尤其在深度压缩场景下,将导致严重的性能损失。

研究团队为每个 Transformer 模块关联一个二元变量(0 保留,1 移除),并通过模型损失的二阶泰勒展开构建海森矩阵。矩阵的非对角线元素精确描述了模块间的成对耦合。由此,模块选择被转化为寻找伊辛玻璃低能态的能量最小化问题:自旋系统的低能态直接对应高性能的剪枝模型。

求解策略:能量作为质量的廉价代理

该方法的核心优势在于效率。海森矩阵只需基于少量校准数据计算一次,此后评估任何候选配置仅需廉价的能量计算,无需实际运行模型或进行基准测试。对于配置空间可控的情况,可在单 GPU 上进行暴力搜索;对于更复杂的实例,则利用量子及类量子求解器(如量子退火、禁忌搜索)处理。

值得注意的是,研究并不强求找到绝对基态(ground state)。由于能量是质量的强代理但非完美代理,探索低激发态往往能发现更优解。例如在 Llama-3.1-8B 实验中,第 17 个激发态因移除了模型开头附近的模块,经轻微重训练后在多个基准测试中超越了基态,打破了“最佳剪枝应集中在中后部”的传统认知。

实验结果:深度压缩下显著领先

在 Llama-3.1-8B、Qwen3-14B 和 Llama-3.3-70B 上的测试显示,该方法(CBO)在轻度压缩下与最先进基线持平,但在深度压缩下优势巨大:

  • Llama-3.3-70B-Instruct:在移除 40/80(50%)模块且未经重训练的情况下,CBO 在 MMLU 基准上得分 76.9,而最强竞争性基线仅为 54.0,差距接近 23 个百分点
  • Qwen3-14B:在移除 12/40 模块时,CBO 在 MMLU 上领先约 10 分。

此外,该方法具备广泛的通用性。在 NVIDIA-Nemotron-3-Nano-30B 这类包含 Mamba2、注意力和 MoE 层的异构混合模型中,CBO 无需重训练即可找到优于基线的配置,证实了其在复杂架构中定位冗余模块的能力。

目前,相关代码已在 GitHub 开源,完整技术细节及消融实验可查阅 Hugging Face 上的论文。