现有的两阶段量化剪枝方法,如先剪枝后量化或先量化后剪枝往往会低比特校准流形与剪枝执行形式之间引入不匹配,具体到实验中就是这种方法的效果不佳。
一种可能的解释是量化的噪声会干扰Token重要性信号的估计,而剪枝则会改变激活的统计特性,可能使低比特算子依赖的校准假设失效。且目前的剪枝方法没有充分考虑量化对重要性信号评估的可靠性的影响
对应上述问题,论文提出了一个协作式量化与剪枝框架,通过QUOTA机制将低比特校准敏感度转换为层级的Token分配计划,并在统一的低比特推理流程(包括量化KV缓存)中执行确定性剪枝,从而确保剪枝决策与部署时的量化操作制度保持一致。
首先需要解决的是剪枝候选层$L_c$的确定问题。论文中选择在校准集上对逐层注意力集中度和视觉Token冗余度进行分析。其中逐层注意力集中度从多模态注意力图中模态间注意力块测得,具体使用从文本query到视觉token的top-10注意力分数的中位数,并结合样本间的四分位距进行衡量。结果表明前两层的集中度较低,随后急剧上升,这表明从该深度开始,基于注意力的重要性排序变得更加可靠。与此同时,基于视觉 token 两两余弦相似度中位数的冗余度代理指标在早期模块中仍然较低,并且显著低于最后几个模块,这说明视觉 token 在该阶段仍具有较高多样性。基于这些趋势,我们排除前两层,选择一个连续的早期层范围作为 LcLc,并避免在最后几个模块中进行剪枝,因为此时累积节省较小,且 token 移除更加脆弱。所得 $L_c$ 将用于后续的预算分配和 token 选择步骤。
给定$L_c$后,QUOTA在低比特校准过程中通过分析校准集上的量化敏感度来推导逐层token预算。对于每个$l\in L_c$,我们将敏感度定义为全精度激活$x_l$与在部署的低比特算子下计算得到的低比特激活值$x_l^q$之间的相对偏差
$$ S_l = \text{median}_{x\sim D_{cal}}\frac{||x_l^q-x_l||^2}{||x_l||^2+\epsilon} $$较大的$S_l$说明在低比特下该层更加敏感,因此会分配更大的token预算。
原始的敏感度在不同层之间可能呈现出重尾分布,因此采用基于百分位数的裁剪和归一化。
$$ \hat{S_l} =\text{clip}(\frac{S_l-P_{10}}{P_{90}-P_{10}},0.1,0.9) $$接下来我们将$\hat S_{l}$映射为逐层保留比例调度。通过一个温度控制的softmax实现:
$$ \pi_i = \frac{\exp(\frac{1-\hat S_{l_i}}{\tau})}{\sum_{j=1}^m \exp(\frac{1-\hat S_{l_j}}{\tau})} $$为了确保鲁棒性和单调调度,我们设置保留比例下限 $p_{\min}$,并令总丢弃预算 $B = 1-p_{\min}$。我们分配 $d_i=Bπ_i$,并形成一个非递增的保留比例表:
$$ r_{l_i} = \max(p_{\min},1-\sum_{j=1}^{i} d_j) $$接下来问题就转变为了给定逐层保留比例$\{r_l\}_{l\in L_c}$,我们在每个候选层执行带预算约束的token选择。我们遵循量化的一致性原则:
所有重要性信号都在实际部署的低比特算子下计算。随后,我们可以得到一个确定性的综合评分,并应用$Top-K_l$选择:
在候选层$l\in L_c$处,令:
$$ V_l = \{v_i^l\}_{i=1}^{N_l} $$和$T_l$分别表示视觉Token表征和文本Token表征。令$V_0$表示经过projector后的参考视觉Token长度,该长度在校准阶段测量,并存储在剪枝策略中。逐层预算定义为:
$$ K_l = [r_lV_0] $$我们保留按照下述评分排序后排名前 $K_l$的视觉 token。对于每个视觉 token $V_{l_i}$,我们从实际部署的量化前向传播中计算四种重要性指标。我们约定注意力权重 $A_{qk}$按查询 token q 和键 token k索引。具体而言,
$$ m_{i,l}^{\text{mag}}=||v_i^l||_2,\quad m_{i,l}^{\text{inter}}=\frac{1}{H}\sum_{h=1}^H\sum_{j\in T}A_{ji}^{\text{inter},h}(l),\\ m_{i,l}^{res}=||Q(v_i^l)-v_i^l||_2,\quad m_{i,l}^{\text{intra}}=\frac{1}{H}\sum_{h=1}^H\sum_{k\in V}A_{ki}^{\text{intra},h}(l) $$由于这些指标具有不同尺度,并且可能受到离群值影响,我们采用基于百分位裁剪与重缩放的逐层鲁棒归一化算子 GG。对于每一种指标类型:
$$ m \in \{\text{mag,inter,res,intra}\}\\ \hat{m_{i,l}}^{(m)}=G(m_{i,l}^{(m)}) $$其中,GG 在每一层 ℓℓ 上独立应用,将数值映射到可比较的范围,同时降低极端 token 的影响。随后,我们使用层间共享的加权和来构造综合重要性评分:
$$ \text{score}_{i,l} = \sum_{m\in \{\text{mag,inter,res,intra}\}}w_m \hat m_{i,l}^{(m)} $$然后选出Top—K。