<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>VLM on Lorn</title><link>https://july-h5kf3.github.io/categories/vlm/</link><description>Recent content in VLM on Lorn</description><generator>Hugo -- gohugo.io</generator><language>zh-cn</language><lastBuildDate>Wed, 26 Aug 2026 08:54:00 +0800</lastBuildDate><atom:link href="https://july-h5kf3.github.io/categories/vlm/index.xml" rel="self" type="application/rss+xml"/><item><title>[2026 ICML] VEQ: Modality-Adaptive Quantization for MoE Vision-Language Models</title><link>https://july-h5kf3.github.io/p/veq/</link><pubDate>Wed, 26 Aug 2026 08:54:00 +0800</pubDate><guid>https://july-h5kf3.github.io/p/veq/</guid><description>&lt;p&gt;本篇文章主要针对MoE架构的VLMs的PTQ。&lt;/p&gt;&#10;&lt;p&gt;目前主流的MoE VLMs PTQ方法往往忽略了两种异质性：&lt;/p&gt;&#10;&lt;ol&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;跨模态异质性:视觉token和语言token在统计分布，敏感度和对模型输出的影响上存在显著差异:&lt;/p&gt;&#10;&lt;p&gt;a. 敏感度差异，文本token的梯度范数平均是视觉token的22.4倍，表明文本token包含更密集的信息，对量化误差更加敏感。&lt;/p&gt;&#10;&lt;p&gt;b. 数量不平衡，视觉Token远多于文本Token，但文本token在推理中起主导作用&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;专家间异质性:MoE架构中不同专家的重要性呈现高度不均匀分布：&lt;/p&gt;&#10;&lt;p&gt;a. 激活稀疏性，少数热专家被频繁激活，而大部分专家很少被使用&lt;/p&gt;&#10;&lt;p&gt;b. 功能分化，部分专家专门处理视觉特征，部分专门处理文本语义，还有部分作为跨模态通用处理器。&lt;/p&gt;&#10;&lt;p&gt;c. 路由偏差，路由器对少数专家赋予极高置信度，这些专家对最终输出起决定性作用。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;/ol&gt;&#10;&lt;p&gt;基于此论文提出了VEQ-ME,VEQ-MA.&lt;/p&gt;&#10;&lt;p&gt;首先介绍VEQ-ME，即模态-专家感知量化。其核心在于将专家重要性引入误差最小化目标中。&lt;/p&gt;&#10;&lt;p&gt;我们定义第i个专家的重要性分数为$S_i$,用于平衡衡量该专家在不同模态下的贡献。由于视觉token天然比文本token数量多，因此单纯用原始频次统计会使结果过度偏向视觉主导型专家，因此重要性分数采取加权求和的方式:&#10;&lt;/p&gt;&#10;$$&#10;S_i = \gamma N_i^{\text{text}} + \beta N_i^{\text{vis}}&#10;$$&lt;p&gt;&#10;其中$N_i^{\text{text}},N_i^{\text{vis}}$表示被路由到第i个专家的某种模态token数目。令$T_{text},T_{vis}$分别表示校准集中所有文本 token 和视觉 token 的总数。系数:&#10;&lt;/p&gt;&#10;$$&#10;\beta = \frac{T_{text}}{T_{vis}}&#10;$$&lt;p&gt;&#10;作为数量归一化因子，用于缩小高频视觉激活的影响，使其能够与文本 token 的计数处于可比较的尺度。系数&#10;&lt;/p&gt;&#10;$$&#10;\gamma = \frac{||\nabla_{text}||}{||\nabla_{vis}||}&#10;$$&lt;p&gt;&#10;作为质量敏感性因子，用于反映文本 token 具有更高梯度影响这一事实。&lt;/p&gt;&#10;&lt;p&gt;得到每个专家的重要性分数后，后续在计算量化误差时，采用加权形式:&#10;&lt;/p&gt;&#10;$$&#10;\mathcal{L}_{\text{weighted}} = \sum_{i=1}^M S_i \cdot ||W_iX_i-\hat W_i X_i||_2^2&#10;$$&lt;p&gt;&#10;接下来介绍VEQ-MA，即模态-亲和性感知量化。其核心在于构建增强的Hessian矩阵$\hat H = XCX^\top$&lt;/p&gt;&#10;&lt;p&gt;目前具有代表性的PTQ框架通常使用二阶信息(Hessian矩阵)来确定最优量化参数，而出于计算效率的考虑，往往采用如下近似:&#10;&lt;/p&gt;&#10;$$&#10;H = 2X^\top X&#10;$$&lt;p&gt;&#10;这种形式隐含地假设所有输入 token 对重构误差的贡献是相同的，也就是说，它将序列维度上的优化地形视为均匀的。&lt;/p&gt;&#10;&lt;p&gt;然而在MoE-VLM中，存在如下问题:&lt;/p&gt;&#10;&lt;ol&gt;&#10;&lt;li&gt;路由多样性，不同token与特定专家之间具有不同程度的亲和性，这由路由器输出的概率决定；&lt;/li&gt;&#10;&lt;li&gt;模态敏感性,尽管文本 token 的数量更少，但相比空间冗余较高的视觉 token，它们通常具有更高的梯度密度和信息价值。&lt;/li&gt;&#10;&lt;/ol&gt;&#10;&lt;p&gt;如果直接将统一的 Hessian 计算方式应用于 MoE 层，就无法刻画这些细粒度差异，进而可能导致关键语义信息被忽视。&lt;/p&gt;&#10;&lt;p&gt;因此VEQ-MA采用了增强的Hessian矩阵:&lt;/p&gt;&#10;&lt;p&gt;设$X \in \mathbb{R}^{d\times N}$表示被路由到当前专家的输入 token，其中 N 是这些 token 的数量。我们根据每个 token 的模态相关亲和性，对其贡献进行缩放，从而重构 Hessian 矩阵 $\hat H$：&#10;&lt;/p&gt;&#10;$$&#10;\hat H = (X\cdot \sqrt{C})(X\cdot \sqrt{C})^\top = XCX^\top&#10;$$&lt;p&gt;&#10;其中$C\in \mathbb{R}^{N\times N}$是一个对角矩阵，表示每个 token 的重要性权重。对于第 j 个 token $x_j$，其对应的对角元素 $c_j$ 定义为：&#10;&lt;/p&gt;&#10;$$&#10;c_j = p_j \cdot \alpha_j&#10;$$&lt;p&gt;&#10;其中:&#10;&lt;/p&gt;&#10;$$&#10;\alpha_j =&#10;\begin{cases}&#10;\gamma, &amp; x_j \text{ 是文本 token}, \\&#10;1, &amp; x_j \text{ 是视觉 token}.&#10;\end{cases}&#10;$$&lt;p&gt;&#10;$p_j$表示$x_j$与专家的亲和性。项$\gamma$表示梯度缩放因子。&lt;/p&gt;&#10;&lt;p&gt;整体架构图如下:&lt;/p&gt;&#10;&lt;p&gt;&lt;img class="gallery-image" data-flex-basis="373px" data-flex-grow="155" height="814" loading="lazy" sizes="(max-width: 767px) calc(100vw - 30px), (max-width: 1023px) 700px, (max-width: 1279px) 950px, 1232px" src="https://july-h5kf3.github.io/p/veq/VEQ_fig1.png" srcset="https://july-h5kf3.github.io/p/veq/VEQ_fig1_hu_2fde5866ac83ea93.png 800w, https://july-h5kf3.github.io/p/veq/VEQ_fig1.png 1268w" width="1268"&gt;&lt;/p&gt;&#10;</description></item><item><title>[2026 NeurIPS] Breaking Modality Heterogeneity in Low-Bit Quantization for Large Vision-Language Models</title><link>https://july-h5kf3.github.io/p/breaking-modality-heterogeneity/</link><pubDate>Wed, 26 Aug 2026 08:51:00 +0800</pubDate><guid>https://july-h5kf3.github.io/p/breaking-modality-heterogeneity/</guid><description>&lt;p&gt;作者团队通过可视化文本和视觉Token在不同通道分布上的分布，观察到以下现象:&lt;/p&gt;&#10;&lt;ol&gt;&#10;&lt;li&gt;不同模态的激活分布存在本质差异:视觉激活通常呈现长尾分布，即只有少数通道包含幅值极大的激活，也就是需要谨慎处理的离群值。相比之下，文本激活中的离群值在通道之间分布得更加均匀。&lt;/li&gt;&#10;&lt;li&gt;对于两种模态而言，离群通道都只占全部通道的一小部分&lt;/li&gt;&#10;&lt;li&gt;更重要的是，文本模态和视觉模态的激活离群值位于不同的通道中。&lt;/li&gt;&#10;&lt;/ol&gt;&#10;&lt;p&gt;由观察1，可以指导VLM量化的一个困难在于目前所有通道的激活都通过一个共享的变换矩阵P进行优化。然而，Modality-specific的离群通道会彼此显著干扰，导致该共享的变换矩阵不是最优的。&lt;/p&gt;&#10;&lt;p&gt;这里可以简单解释一下，目前基于变换矩阵的PTQ方法普遍通过最小化如下损失获取:&#10;&lt;/p&gt;&#10;$$&#10;P = \arg \min ||Q(XP)Q(P^{-1}W) - XW||_2^2&#10;$$&lt;p&gt;&#10;而这种方式获取的P，往往会忽视不同模态Token之间的差异，以及不同通道之间的差异，因此论文提到这个共享的变换矩阵不是最优的。&lt;/p&gt;&#10;&lt;p&gt;而受第2，3点的启发，文章提出了一种Modality-specific 的离群通道解耦技术（MOCD）。该方法通过从所有通道分离出文本特定和视觉特定的离群通道，来解耦模态特定离群值之间的干扰。这样，通道被划分为了三组: 视觉特定通道，文本特定通道和模态兼容通道&lt;/p&gt;&#10;&lt;p&gt;形式化而言:&lt;/p&gt;&#10;&lt;p&gt;我们令:$C = \{0,1,\dots,D_{in}\}$,表示所有通道索引。MOCD将输入通道划分为三个互不相交的集合:&#10;&lt;/p&gt;&#10;$$&#10;C = C_m \cup C_t \cup C_v,\quad C_t\cap C_m = \emptyset,\quad C_v\cap C_m = \emptyset&#10;$$&lt;p&gt;&#10;其中，$C_m,C_t,C_v$分别表示模态兼容通道，文本通道和视觉通道。由于离群通道数目远远小于$D_{in}$,他们还满足如下条件:&#10;&lt;/p&gt;&#10;$$&#10;\abs{C_m}\gg \abs{C_v},\quad \abs{C_m}\gg \abs{C_t}&#10;$$&lt;p&gt;&#10;相应地，激活矩阵和权重矩阵被拆分为:&#10;&lt;/p&gt;&#10;$$&#10;X \to \{X_m,X_t,X_v\},\quad W\to \{W_m,W_t,W_v\}&#10;$$&lt;p&gt;&#10;这三组矩阵对:&#10;&lt;/p&gt;&#10;$$&#10;\{X_m,W_m\},\quad \{X_v,W_v\},\quad \{X_t,W_t\}&#10;$$&lt;p&gt;&#10;会通过学习不同的变换进行不同方式的处理。&lt;/p&gt;&#10;&lt;p&gt;模态特定通道的选取方式如下:&lt;/p&gt;&#10;&lt;p&gt;首先根据幅度值选择视觉特定的离群通道，然后通过一种基于一致性的校准代理指标来识别文本特定的离群通道。令$T_v$和$T_t$分别代表采样得到的视觉Token和文本Token，C代表完整的通道集合。&lt;/p&gt;&#10;&lt;p&gt;对于视觉token，我们使用每个通道上的最大绝对激活值作为该通道的分数:&#10;&lt;/p&gt;&#10;$$&#10;s_v(c) = \max_{i \in T_v}\abs{X_{i,c}}&#10;$$&lt;p&gt;&#10;视觉特定的离群通道集合通过选择分数最高的$K_v$个通道得到:&#10;&lt;/p&gt;&#10;$$&#10;C_v = \text{TopK}_{c\in C}(s_v(c),K_v)&#10;$$&lt;p&gt;&#10;记剩下的通道为:$C' = C - C_v$&lt;/p&gt;&#10;&lt;p&gt;对于文本Token而言，使用每个通道上的最大激活值作为通道分数并不合理，因为文本Token的离群通道更多与不同 token 之间不稳定的相对响应有关。因此，我们使用每个 token 内部的百分位排名作为一种对尺度不敏感的通道重要性度量：&#10;&lt;/p&gt;&#10;$$&#10;r_{i,c} = \frac{1}{\abs{C'}}\sum_{j\in C'}\mathbb{I}(\abs{X_{i,j}}\leq \abs{X_{i,c}}),\quad i\in T_t,c\in C'&#10;$$&lt;p&gt;&#10;这种基于排名的度量可以抑制 token 之间的尺度变化，使得不同文本 token 之间的通道响应具有可比性。&lt;/p&gt;&#10;&lt;p&gt;对于每个通道，我们将其在所有文本 token 上的排名序列聚类为 K 组，并使用簇内方差作为响应不稳定性的度量。令$z_{i,c}$表示$r_{i,c}$的聚类分配，$\mu_{c,z_{i,c}}$表示对应的聚类中心，则:&#10;&lt;/p&gt;&#10;$$&#10;s_t(c) = \frac{1}{\abs{T_t}}\sum_{i\in T_t}(r_{i,c} - \mu_{c,z_{i,c}})^2&#10;$$&lt;p&gt;&#10;更大的$s_t(c)$表明在该通道上，不同文本 token 之间的相对响应更加不稳定。我们选择$s_t(c)$最高的$K_t$个通道作为文本特定通道:&#10;&lt;/p&gt;&#10;$$&#10;C_t = \text{TopK}_{c\in C'}(s_t(c),K_t)&#10;$$&lt;p&gt;&#10;剩余的通道构成模态兼容的通道:&#10;&lt;/p&gt;&#10;$$&#10;C_m = C - C_t - C_v&#10;$$&lt;p&gt;&#10;接下来视觉和文本特定通道对应的矩阵对$\{W_v,X_v\},\quad \{W_t,X_t\}$会走各自的独立量化路径，而主通道路径则会走自适应跨模态校准(ACC)&lt;/p&gt;&#10;&lt;p&gt;我们令$\Delta M= M - Q(M)$,其中M为权重矩阵或激活值矩阵。&lt;/p&gt;&#10;&lt;p&gt;对于权重侧的量化误差，采用CWS,通过低秩分解吸收由跨模态偏移触发的权重变化:&#10;&lt;/p&gt;&#10;$$&#10;P_m^{-1}W_m = \underbrace{(P_m^{-1}W_m)-U_sV_s}_{\text{平滑后主权重}}+\underbrace{U_sV_s}_{\text{低秩自适应分量}}&#10;$$&lt;p&gt;&#10;量化形式为:&#10;&lt;/p&gt;&#10;$$&#10;Y_m = \hat{X}_mQ(P_m^{-1}W_m-U_sV_s)+\hat{X}Q(U_s)Q(V_s)&#10;$$&lt;p&gt;&#10;其中$U_s\in\mathbb{R}^{D_m\times r},\quad V_s\in\mathbb{R}^{r\times D_{out}}$为可学习低秩矩阵，用于隔离敏感跨模态成分，使主权重分布更加平滑。&lt;/p&gt;&#10;&lt;p&gt;而对于激活侧的激活残差，与静态权重不同，激活是输入相关的，并且会随模态动态变化。因此，很难通过结构分解来重新表示其量化敏感分量。&lt;/p&gt;&#10;&lt;p&gt;因此我们引入一个直接补偿分支，用于恢复由激活量化带来的输出偏差:&#10;&lt;/p&gt;&#10;$$&#10;\Delta Y_{m}^{\text{act}} = \Delta(X_mP_m)P_{m}^{-1}W_m&#10;$$&lt;p&gt;&#10;而有研究表明:由于文本激活具有稠密语义特性，因此它们对量化噪声更加敏感；相比之下，视觉激活通常具有较强冗余性。因此，文本补偿通常能够捕获更关键的激活侧误差。&lt;/p&gt;&#10;&lt;p&gt;因此引入补偿分支恢复文本token的输出偏差,同时为了高效计算，我们用可学习的低秩矩阵$U_c,V_c$来近似权重映射。&#10;&lt;/p&gt;&#10;$$&#10;Y_{m}^{\text{text}}\leftarrow Y_{m}^{\text{text}}+Q(\Delta(X_mP_m)^{\text{text}})Q(U_c)Q(V_c)&#10;$$&lt;p&gt;&#10;整体的框架如图所示:&lt;/p&gt;&#10;&lt;p&gt;&lt;img class="gallery-image" data-flex-basis="469px" data-flex-grow="195" height="544" loading="lazy" sizes="(max-width: 767px) calc(100vw - 30px), (max-width: 1023px) 700px, (max-width: 1279px) 950px, 1232px" src="https://july-h5kf3.github.io/p/breaking-modality-heterogeneity/SplitQ_fig1.png" srcset="https://july-h5kf3.github.io/p/breaking-modality-heterogeneity/SplitQ_fig1_hu_34aa8b07b50941a4.png 800w, https://july-h5kf3.github.io/p/breaking-modality-heterogeneity/SplitQ_fig1.png 1064w" width="1064"&gt;&lt;/p&gt;&#10;&lt;p&gt;激活侧和权重侧的补偿都依赖于低秩分支。然而，像 LoRA 或 QLoRA这样自由学习的参数很容易在小规模校准集上过拟合；而固定的基于 SVD 的分量又缺乏足够的灵活性，难以吸收由模态异构性导致的量化误差。&lt;/p&gt;&#10;&lt;p&gt;为了在两种选择之间平衡，避免自由参数过拟合，同时保持对跨模态异质性的适应能力，低秩矩阵采用锚定SVD结构：&#10;&lt;/p&gt;&#10;$$&#10;W_m \approx U_r\Sigma_r V_r^\top\\&#10;U^* = P_m^{-1}W_m,V^*=\Sigma_rG_*V_r^\top,*\in \{s,c\}&#10;$$&lt;p&gt;&#10;其中$G_* \in \mathbb{R}^{r\times r}$为可学习的对角门控矩阵，在保留SVD结构先验的同时实现奇异方向自适应重加权。&lt;/p&gt;&#10;&lt;p&gt;可以参考下图:&lt;/p&gt;&#10;&lt;p&gt;&lt;img class="gallery-image" data-flex-basis="292px" data-flex-grow="121" height="328" loading="lazy" sizes="(max-width: 767px) calc(100vw - 30px), (max-width: 1023px) 700px, (max-width: 1279px) 950px, 1232px" src="https://july-h5kf3.github.io/p/breaking-modality-heterogeneity/SplitQ_fig2.png" width="400"&gt;&lt;/p&gt;&#10;</description></item><item><title>[2026 ICLR] Task-related Token Compression in Multi-modal Large Language Models from an Explainability Perspective</title><link>https://july-h5kf3.github.io/p/task-related-token-compression/</link><pubDate>Wed, 26 Aug 2026 08:36:00 +0800</pubDate><guid>https://july-h5kf3.github.io/p/task-related-token-compression/</guid><description>&lt;div style="background-color:#f9f9f9; padding:8px; border-radius:6px;"&gt;&#10; &lt;b&gt;个人评价&lt;/b&gt;:很有意思的一篇文章，出发点是发现了一种较好的可解释性的剪枝方法，但是剪枝决策需要在推理完成后得到，因此通过加入可学习模块的方式进行改良。&#10;&lt;/div&gt;&#10;&lt;p&gt;现有的MLLMs通常将视觉token和文本token一起输入到LLM中进行跨模态对齐和整合。然而，这种方法由于视觉token数量庞大（尤其是处理高分辨率图像或高帧率视频时），导致了巨大的内存和计算开销。因此，迫切需要有效的token压缩技术来提高模型的效率。&lt;/p&gt;&#10;&lt;p&gt;基于此，论文作者提出了一种可解释性Token剪枝方法:&lt;/p&gt;&#10;&lt;p&gt;我们假设MLLMs一共有L层，并将生成的文本token序列记为:&#10;&lt;/p&gt;&#10;$$&#10;Y=\{y_0,y_1,\dots,y_{T-1}\}&#10;$$&lt;p&gt;&#10;具体而言，我们从最终生成的token来回溯原始视觉输入的贡献。对于第t个生成步骤中的每个$y_t$，首先将相关性图$R_t$初始化为单位矩阵，然后在各层之间迭代更新。&lt;/p&gt;&#10;&lt;p&gt;记$A_t^l,\nabla A_t^l$分别为第l层中的Multi-Head Attention Map以及对应的梯度，它们分别在前向反向传播中获取。那么$R_t$的迭代方式如下:&#10;&lt;/p&gt;&#10;$$&#10;R_t = R_t + E_h((A_t^l\odot \nabla A_t^l)^+)\cdot R_t \tag{1}&#10;$$&lt;p&gt;&#10;其中，$\odot$ 表示Hadamard积，$E_h$表示沿注意力头维度取平均。该更新从第0层一直进行到最后一层。&lt;/p&gt;&#10;&lt;p&gt;最终，可以通过索引$R_t$最后一行中相应位置来提取$y_t$与视觉信号之间的相关性，即:&#10;&lt;/p&gt;&#10;$$&#10;R_t[-1,N_s:N_s+N_v]&#10;$$&lt;p&gt;&#10;最后，我们对所有时间步 t的视觉相关性取平均，从而得到相对于当前响应的整体视觉相关性分数：&#10;&lt;/p&gt;&#10;$$&#10;R_v\in \mathbb{R}^{1\times N_v}&#10;$$&lt;p&gt;&#10;接下来可以根据&lt;/p&gt;&#10;&lt;p&gt;下面对式(1)进行简单的理论解释:&lt;/p&gt;&#10;&lt;p&gt;该式来源于&lt;strong&gt;Generic Attention Explainability, GAE&lt;/strong&gt; 框架。这是一个用于解释Transformer架构预测结果的强大方法。&lt;/p&gt;&#10;&lt;p&gt;GAE之所以选择将Attention Map和其梯度的Hadamard积是因为:&lt;/p&gt;&#10;&lt;ol&gt;&#10;&lt;li&gt;Attention Map可以反映每个token从其他token接受了多少注意力&lt;/li&gt;&#10;&lt;li&gt;梯度可以反映哪些 token 需要获得更多注意力，才能有效影响当前输出&lt;/li&gt;&#10;&lt;/ol&gt;&#10;&lt;p&gt;从数学上我们有:&lt;/p&gt;&#10;&lt;p&gt;对某一层、第 h 个注意力头来说，注意力矩阵可以写成：&#10;&lt;/p&gt;&#10;$$&#10;A_h^l \in \mathbb{R}^{N\times N}&#10;$$&lt;p&gt;我们把输出分数$s_t$看作是注意力矩阵的函数:&#10;&lt;/p&gt;&#10;$$&#10;s_t = f(A_h^l)&#10;$$&lt;p&gt;&#10;假设我们对某个注意力权重$A_{h,ij}^l$做一个小扰动，根据一阶泰勒展开我们有:&#10;&lt;/p&gt;&#10;$$&#10;\Delta s_t \approx \frac{\partial s_t}{\partial A_{h,ij}^l}\Delta A_{h,ij}^l&#10;$$&lt;p&gt;&#10;而在剪枝场景中，扰动量就是其本身，那么我们就可以把贡献写作:&#10;&lt;/p&gt;&#10;$$&#10;A_{h,ij}^l\odot \nabla A_{h,ij}^l&#10;$$&lt;p&gt;&#10;这就是式子(1)中采用Hadamard积的原因。&lt;/p&gt;&#10;&lt;p&gt;实验表明，使用这种方法作为剪枝依据，可以在仅保留50%视觉Token的情况下，保留99%的性能&lt;/p&gt;&#10;&lt;p&gt;然而在实际应用中却存在一个局限，$R_v$是输出已经生成后得到的，这与我们进行剪枝的初衷相违背。为了解决这一限制，作者提出了一个独立于MLLM训练的单独模块来近似$R_v$。&lt;/p&gt;&#10;&lt;p&gt;整体而言，模型架构如下：&lt;/p&gt;&#10;&lt;p&gt;在式子(1)中，我们的相关性图是通过聚合Attention Map得到的，这表明从Attention Map到相关性图的映射是有前景的。&lt;/p&gt;&#10;&lt;p&gt;作者通过实验发现仅对第一层注意力应用一个简单的卷积网络就足够了。形式上，令$A^0$表示第一层Attention Map，因为我们是对视觉Token进行剪枝，我们更加关心文本token对于视觉Token的注意力，因此，我们取其子图:$A_{u\to v}^0\in \mathbb{R}^{N_{u}\times N_v}$&lt;/p&gt;&#10;&lt;p&gt;随后，我们对每个视觉token的$N_v$个分数取平均，得到一个紧凑表示$A_v^0 \in \mathbb{R}^{1\times N_v}$&lt;/p&gt;&#10;&lt;p&gt;该平均注意力向量$A_v^0$随后被输入到一个一维卷积模型$f_{\theta}$中，用于预测视觉相关性:&#10;&lt;/p&gt;&#10;$$&#10;\hat R_{v} = f_{\theta}(A_v^0)&#10;$$&lt;p&gt;&#10;训练时，我们将真实计算出来的$R_v$处理成为$R_v^*$来作为GT：首先按照上面介绍的方法，屏蔽掉最低的50%的数值，然后将剩余部分归一化为概率分布。作者为了避免原始分数接近，softmax 产生近似均匀的数值，而采用将每个分数除以总和来进行归一化。&lt;/p&gt;&#10;&lt;p&gt;最后给定$R_v^*,\hat R_v$，通过KL散度来计算Loss。&lt;/p&gt;&#10;</description></item><item><title>Towards Joint Quantization and Token Pruning of Vision-Language Models</title><link>https://july-h5kf3.github.io/p/joint-quant-token-pruning/</link><pubDate>Wed, 26 Aug 2026 08:33:00 +0800</pubDate><guid>https://july-h5kf3.github.io/p/joint-quant-token-pruning/</guid><description>&lt;div style="background-color:#f9f9f9; padding:8px; border-radius:6px;"&gt;&#10; &lt;b&gt;个人评价&lt;/b&gt;:其实和QAPruner大同小异，就多了一个层预算分配的问题，以及打分的依据不同&#10;&lt;/div&gt;&#10;&lt;p&gt;现有的两阶段量化剪枝方法，如先剪枝后量化或先量化后剪枝往往会低比特校准流形与剪枝执行形式之间引入不匹配，具体到实验中就是这种方法的效果不佳。&lt;/p&gt;&#10;&lt;p&gt;一种可能的解释是量化的噪声会干扰Token重要性信号的估计，而剪枝则会改变激活的统计特性，可能使低比特算子依赖的校准假设失效。且目前的剪枝方法没有充分考虑量化对重要性信号评估的可靠性的影响&lt;/p&gt;&#10;&lt;p&gt;对应上述问题，论文提出了一个协作式量化与剪枝框架，通过QUOTA机制将低比特校准敏感度转换为层级的Token分配计划，并在统一的低比特推理流程（包括量化KV缓存）中执行确定性剪枝，从而确保剪枝决策与部署时的量化操作制度保持一致。&lt;/p&gt;&#10;&lt;p&gt;首先需要解决的是剪枝候选层$L_c$的确定问题。论文中选择在校准集上对逐层注意力集中度和视觉Token冗余度进行分析。其中逐层注意力集中度从多模态注意力图中模态间注意力块测得，具体使用从文本query到视觉token的top-10注意力分数的中位数，并结合样本间的四分位距进行衡量。结果表明前两层的集中度较低，随后急剧上升，这表明从该深度开始，基于注意力的重要性排序变得更加可靠。与此同时，基于视觉 token 两两余弦相似度中位数的冗余度代理指标在早期模块中仍然较低，并且显著低于最后几个模块，这说明视觉 token 在该阶段仍具有较高多样性。基于这些趋势，我们排除前两层，选择一个连续的早期层范围作为 LcLc，并避免在最后几个模块中进行剪枝，因为此时累积节省较小，且 token 移除更加脆弱。所得 $L_c$ 将用于后续的预算分配和 token 选择步骤。&lt;/p&gt;&#10;&lt;p&gt;给定$L_c$后，QUOTA在低比特校准过程中通过分析校准集上的量化敏感度来推导逐层token预算。对于每个$l\in L_c$，我们将敏感度定义为全精度激活$x_l$与在部署的低比特算子下计算得到的低比特激活值$x_l^q$之间的相对偏差&#10;&lt;/p&gt;&#10;$$&#10;S_l = \text{median}_{x\sim D_{cal}}\frac{||x_l^q-x_l||^2}{||x_l||^2+\epsilon}&#10;$$&lt;p&gt;&#10;较大的$S_l$说明在低比特下该层更加敏感，因此会分配更大的token预算。&lt;/p&gt;&#10;&lt;p&gt;原始的敏感度在不同层之间可能呈现出重尾分布，因此采用基于百分位数的裁剪和归一化。&#10;&lt;/p&gt;&#10;$$&#10;\hat{S_l} =\text{clip}(\frac{S_l-P_{10}}{P_{90}-P_{10}},0.1,0.9)&#10;$$&lt;p&gt;&#10;接下来我们将$\hat S_{l}$映射为逐层保留比例调度。通过一个温度控制的softmax实现:&#10;&lt;/p&gt;&#10;$$&#10;\pi_i = \frac{\exp(\frac{1-\hat S_{l_i}}{\tau})}{\sum_{j=1}^m \exp(\frac{1-\hat S_{l_j}}{\tau})}&#10;$$&lt;p&gt;&#10;为了确保鲁棒性和单调调度，我们设置保留比例下限 $p_{\min}$，并令总丢弃预算 $B = 1-p_{\min}$。我们分配 $d_i=Bπ_i$，并形成一个非递增的保留比例表：&#10;&lt;/p&gt;&#10;$$&#10;r_{l_i} = \max(p_{\min},1-\sum_{j=1}^{i} d_j)&#10;$$&lt;p&gt;&#10;接下来问题就转变为了给定逐层保留比例$\{r_l\}_{l\in L_c}$,我们在每个候选层执行带预算约束的token选择。我们遵循量化的一致性原则:&lt;/p&gt;&#10;&lt;p&gt;所有重要性信号都在实际部署的低比特算子下计算。随后，我们可以得到一个确定性的综合评分，并应用$Top-K_l$选择：&lt;/p&gt;&#10;&lt;p&gt;在候选层$l\in L_c$处，令:&#10;&lt;/p&gt;&#10;$$&#10;V_l = \{v_i^l\}_{i=1}^{N_l}&#10;$$&lt;p&gt;&#10;和$T_l$分别表示视觉Token表征和文本Token表征。令$V_0$表示经过projector后的参考视觉Token长度，该长度在校准阶段测量，并存储在剪枝策略中。逐层预算定义为:&#10;&lt;/p&gt;&#10;$$&#10;K_l = [r_lV_0]&#10;$$&lt;p&gt;&#10;我们保留按照下述评分排序后排名前 $K_l$的视觉 token。对于每个视觉 token $V_{l_i}$，我们从实际部署的量化前向传播中计算四种重要性指标。我们约定注意力权重 $A_{qk}$按查询 token q 和键 token k索引。具体而言，&#10;&lt;/p&gt;&#10;$$&#10;m_{i,l}^{\text{mag}}=||v_i^l||_2,\quad m_{i,l}^{\text{inter}}=\frac{1}{H}\sum_{h=1}^H\sum_{j\in T}A_{ji}^{\text{inter},h}(l),\\&#10;m_{i,l}^{res}=||Q(v_i^l)-v_i^l||_2,\quad m_{i,l}^{\text{intra}}=\frac{1}{H}\sum_{h=1}^H\sum_{k\in V}A_{ki}^{\text{intra},h}(l)&#10;$$&lt;p&gt;&#10;由于这些指标具有不同尺度，并且可能受到离群值影响，我们采用基于百分位裁剪与重缩放的逐层鲁棒归一化算子 GG。对于每一种指标类型：&#10;&lt;/p&gt;&#10;$$&#10;m \in \{\text{mag,inter,res,intra}\}\\&#10;\hat{m_{i,l}}^{(m)}=G(m_{i,l}^{(m)})&#10;$$&lt;p&gt;&#10;其中，GG 在每一层 ℓℓ 上独立应用，将数值映射到可比较的范围，同时降低极端 token 的影响。随后，我们使用层间共享的加权和来构造综合重要性评分：&#10;&lt;/p&gt;&#10;$$&#10;\text{score}_{i,l} = \sum_{m\in \{\text{mag,inter,res,intra}\}}w_m \hat m_{i,l}^{(m)}&#10;$$&lt;p&gt;&#10;然后选出Top—K。&lt;/p&gt;&#10;</description></item><item><title>QAPruner: Quantization-Aware Vision Token Pruning for Multimodal Large Language Models</title><link>https://july-h5kf3.github.io/p/qapruner/</link><pubDate>Wed, 26 Aug 2026 08:30:00 +0800</pubDate><guid>https://july-h5kf3.github.io/p/qapruner/</guid><description>&lt;div style="background-color:#f9f9f9; padding:8px; border-radius:6px;"&gt;&#10; &lt;b&gt;个人评价&lt;/b&gt;:方法特别简单，就是在剪枝的时候考虑量化的影响&#10;&lt;/div&gt;&#10;&lt;p&gt;当我们简单地将基于语义的token剪枝应用于经PTQ优化的模型时，会丢弃对数值稳定性至关重要的激活异常值，从而在低比特位制度（如W4A4）下显著加剧量化误差。&lt;/p&gt;&#10;&lt;p&gt;论文提出的解决思路是提出一种量化感知的视觉Token剪枝方法QAPruner，具体而言，方法如下：&lt;/p&gt;&#10;&lt;p&gt;我们考虑构建一个联合考虑语义相关性和量化鲁棒性的Token选择机制。&lt;/p&gt;&#10;&lt;p&gt;对于每个视觉token，$v_i \in \mathbb{R}^{D}$，我们通过融合两个互相正交的指标来计算其敏感度:分组量化模拟和全局异常值强度。&lt;/p&gt;&#10;&lt;p&gt;在目前主流的PTQ量化方法中，通常会将激活值重新分组为若干个更小的组，以便计算局部缩放因子，从而减轻通道异常值的影响。为了模拟这个过程，我们将token特征重排为$M = D / G$个组，其中第i个token的第m组记为$v_{i,m}\in\mathbb{R}^{G}$。假设采用INT4量化，则局部缩放因子$s_{i,m}$及其量化后的表示$\hat{v_{i,m}}$可以写作：&#10;&lt;/p&gt;&#10;$$&#10;s_{i,m} = \frac{\max(|v_{i,m}|)}{7}\\&#10;\hat{v_{i,m}} = \text{Round}(\frac{v_{i,m}}{s_{i,m}+\epsilon})\cdot s_{i,m}&#10;$$&lt;p&gt;&#10;随后将所有的$v_{i,m}$进行拼接得到$\hat{v_i}\in \mathbb{R}^{D}$。那么第i个Token的分组量化误差记为:$E_i$:&#10;&lt;/p&gt;&#10;$$&#10;E_i = ||v_i - \hat{v_i}||_2^2&#10;$$&lt;p&gt;&#10;具有较高$E_i $的 token 在局部层面上本质上更难量化，并会遭受显著的信息损失，因此是应当优先保留的关键候选。&lt;/p&gt;&#10;&lt;p&gt;尽管上述指标$E_i$可以捕获局部量化困难，但是它可能无法显式惩罚那些包含极端全局异常值的token被移除的情况。这类携带异常值的token决定了整个张量的最大激活范围，对于保持大语言模型的涌现特性至关重要。&lt;/p&gt;&#10;&lt;p&gt;为了显式保护这些结构性异常值，我们将第 i 个 token 的&lt;strong&gt;全局异常值强度&lt;/strong&gt; $R_i$定义为其在全部 D 个通道上的激活值跨度：&#10;&lt;/p&gt;&#10;$$&#10;R_i = \max_{j\in\{1,\dots,D\}}(v_{i,j})-\min_{j\in\{1,\dots,D\}}(v_{i,j})&#10;$$&lt;p&gt;&#10;较大的 $R_i$ 表明该 token 中存在严重的激活异常值，因此一旦被丢弃，就会对量化后的数值分布造成更大的扰动。&lt;/p&gt;&#10;&lt;p&gt;为了构建一个能够兼顾局部细节保留和全局异常值保护的综合度量，我们首先在一个 batch 内，对 N个视觉 token 的这两个指标分别独立归一化到 [0,1] 区间。最终的量化敏感度分数 $S_i^Q$定义为两项归一化指标的等权和：&#10;&lt;/p&gt;&#10;$$&#10;S_i^Q = \frac{1}{2}\cdot \frac{E_i - \min(E)}{\max(E)-\min(E)} + \frac{1}{2}\cdot \frac{R_i -\min(R)}{\max(R)-\min(R)}&#10;$$&lt;p&gt;&#10;最后，我们将这一量化敏感度与传统的视觉token剪枝方法得到的分数$S_i^P$结合起来，共同指导token的选择过程。为此，我们引入了超参数$\alpha \in [0,1]$,用于控制语义对齐和数值稳定性之间的权衡：&#10;&lt;/p&gt;&#10;$$&#10;S_i^{Final} = \alpha S_i^P + (1-\alpha)S_i^Q&#10;$$&lt;p&gt;&#10;通过这种方法重新校准了 token 选择准则，使得剪枝后的视觉序列不仅在语义上对查询保持足够的信息性，同时也能更好地抵抗低比特 PTQ 所带来的性能退化。&lt;/p&gt;&#10;</description></item><item><title>VLMQ: Efficient Post-Training Quantization for Large Vision-Language Models via Hessian Augmentation</title><link>https://july-h5kf3.github.io/p/vlmq/</link><pubDate>Wed, 26 Aug 2026 08:27:00 +0800</pubDate><guid>https://july-h5kf3.github.io/p/vlmq/</guid><description>&lt;div style="background-color:#f9f9f9; padding:8px; border-radius:6px;"&gt;&#10; &lt;b&gt;个人评价&lt;/b&gt;:文章引出给不同token分配重要性的方式特别好，值得学习！后面的方法就和MBQ，QIG大同小异了&#10;&lt;/div&gt;&#10;&lt;p&gt;文章提出在VLM中，视觉被过度表征是一个被广泛接受的观点，然而目前基于Hessian的PTQ方法没有利用这种冗余性，而我们知道在GPTQ中近似Hessian是通过激活值的内积近似得到的，这就会导致GPTQ等基于Hessian的量化方法直接应用于VLM上时，构建的Hessian矩阵大部分贡献来自于视觉冗余Token，从而表现不佳。因此，给各个Token分配不同的重要性是至关重要的。&lt;/p&gt;&#10;&lt;p&gt;那么视觉token是如何影响Hessian的估计和模型精度的呢？&lt;/p&gt;&#10;&lt;p&gt;论文作者发现：&lt;/p&gt;&#10;&lt;ol&gt;&#10;&lt;li&gt;在对VLM进行量化时，视觉Token的纳入是必要的&lt;/li&gt;&#10;&lt;li&gt;过量的视觉Token可能会导致量化性能下降，为冗余token赋予较低的重要性，可以缓解由此带来的性能衰退&lt;/li&gt;&#10;&lt;/ol&gt;&#10;&lt;p&gt;作者对这两个发现给出了一定的解释：&lt;/p&gt;&#10;&lt;p&gt;性能的波动实际上可以归因于Hessian的特征偏移，如下图所示&lt;/p&gt;&#10;&lt;p&gt;&lt;img class="gallery-image" data-flex-basis="784px" data-flex-grow="326" height="408" loading="lazy" sizes="(max-width: 767px) calc(100vw - 30px), (max-width: 1023px) 700px, (max-width: 1279px) 950px, 1232px" src="https://july-h5kf3.github.io/p/vlmq/VLMQ_fig1.png" srcset="https://july-h5kf3.github.io/p/vlmq/VLMQ_fig1_hu_8e8273033c57a67c.png 800w, https://july-h5kf3.github.io/p/vlmq/VLMQ_fig1.png 1334w" width="1334"&gt;可以看到，当仅有文本输入时，Hessian矩阵的主成分空间中的分布较为紧凑，而加入了视觉Token后，校准分布变得更加多样化，这有助于缓解量化与推理之间的差距。然而，由于视觉过度表征问题，过量引入视觉 token 会带来 Hessian 向冗余视觉特征偏置的风险（即周围稀疏的点)。&lt;/p&gt;&#10;&lt;p&gt;为了解决这个问题，作者提出了一种面向VLM的精确PTQ方法，该方法主要由两方面组成:&lt;/p&gt;&#10;&lt;ol&gt;&#10;&lt;li&gt;重要性感知的量化目标&lt;/li&gt;&#10;&lt;li&gt;建立了分块损失扰动与逐层输出误差之间的理论联系，从而能够仅通过一次分块反向传播，高效计算由梯度驱动的重要性分数。&lt;/li&gt;&#10;&lt;/ol&gt;&#10;&lt;p&gt;重要性感知的量化目标实际上就是我们先前阅读过的MBQ，QIG等方法使用的量化目标，即Token-Wise的加权。VLMQ的Token重要性通过矩阵形式给出:&lt;/p&gt;&#10;&lt;p&gt;令$G\in \mathbb{R}^{N\times N}$,其中G为对角矩阵，第i个对角元素表示分配给输出token$Z_{:,i}$的重要性。&lt;/p&gt;&#10;&lt;p&gt;将其纳入目标函数后，我们得到了如下改进形式的目标函数：&#10;&lt;/p&gt;&#10;$$&#10;\arg \min_{\hat w} ||(\Delta w X-r)\sqrt{G}||_2^2 \quad s.t. \Delta w e_q^\top +w_q - \hat w_q = 0&#10;$$&lt;p&gt;&#10;利用拉格朗日算子法，我们有：&#10;&lt;/p&gt;&#10;$$&#10;L = ||(\Delta w X -r)\sqrt{G}||_2^2 +\lambda(\Delta w e_q^\top + w_q - \hat w_q)&#10;$$&lt;p&gt;&#10;解得:&#10;&lt;/p&gt;&#10;$$&#10;\Delta w = \frac{\hat w_q - w_q}{\hat H_{qq}^{-1}}\cdot \hat H_{q,:}^{-1} + \hat r \hat X^\top \hat H_{-q,:}^{-1}&#10;$$&lt;p&gt;&#10;其中$\hat H = XGX^\top ,\quad \hat r = r\sqrt{G} ,\quad \hat X = X\sqrt{G}$&lt;/p&gt;&#10;&lt;p&gt;该形式与原始的GPTAQ方式对齐，因此可以复用其中的效率技巧如Cholesky等。&lt;/p&gt;&#10;&lt;p&gt;那么重要性是如何得到的呢？&lt;/p&gt;&#10;&lt;p&gt;参见MBQ中的推导，可以得知，最终使用的是:&#10;&lt;/p&gt;&#10;$$&#10;G = \text{diag}([\overline{|P|}_0,\overline{|P|}_1,\dots,\overline{|P|}_{N-1}])&#10;$$&lt;p&gt;&#10;其中第 n个 token 的重要性定义为梯度中第 n 列的 ℓ1 范数&#10;&lt;/p&gt;&#10;$$&#10;|P|_n = \sum_{i=0}^{C_0 - 1}|P|_{i,n}&#10;$$</description></item><item><title>[2026 CVPR] Fine-Grained Post-Training Quantization for Large Vision Language Models with Quantization-Aware Integrated Gradients</title><link>https://july-h5kf3.github.io/p/fine-grained-vlm-ptq/</link><pubDate>Wed, 26 Aug 2026 08:24:00 +0800</pubDate><guid>https://july-h5kf3.github.io/p/fine-grained-vlm-ptq/</guid><description>&lt;div style="background-color:#f9f9f9; padding:8px; border-radius:6px;"&gt;&#10; &lt;b&gt;个人评价&lt;/b&gt;:比较有意思的研究思路，从MBQ的Modality-Specific出发，通过实验发现，相较于Modality-Specific，更加细粒度的Token-Wise进行区分效果会更好。基于此研究了多种Token敏感度估计方法，最终采用基于公理化归因的积分梯度方法进行规约，取得不错的效果。但是问题在于文章对理论的分析严重不足！&#10;&lt;/div&gt;&#10;&lt;p&gt;假设你阅读过MBQ，它是按照模态去对优化目标进行加权的，那么我们可以仔细想想，不同模态最终都会以Token的形式输入模型，既然不同模态之间存在对量化噪声敏感性差异，那么我们其实可以说本质上是Token内部就存在差异，这个差异不仅仅存在于不同模态之间，还可能存在同一个模态之中。那么也就是说，我们完全可以仿照MBQ的思路去做更加细粒度的加权。&lt;/p&gt;&#10;&lt;p&gt;一般而言，衡量这种Token之间的差异，可以通过敏感性估计进行。作者在文章中尝试了三种敏感性估计方式:&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;基于梯度:和MBQ一致，依据Token关于量化损失的梯度&lt;/li&gt;&#10;&lt;li&gt;基于注意力:用Attention Score&lt;/li&gt;&#10;&lt;li&gt;基于扰动:人为扰动token，然后观察block输出变化有多大。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;注:实验方法大概是像MBQ一样对不同的Token对量化损失进行加权，然后在VizWiz数据集上进行测试。&lt;/p&gt;&#10;&lt;p&gt;最后结果表明，Token-Level的扰动法的效果在不同敏感度估计下表现最优(0.36%的微弱优势)&lt;/p&gt;&#10;&lt;p&gt;基于上述分析，我们知道，按Token的细粒度量化方法可能会有更好的效果。因此作者声称基于公理化归因的启发。下面简单介绍一下公理化归因，这个方法来源于可解释AI。&lt;/p&gt;&#10;&lt;p&gt;我们从经典的积分梯度（IG）出发。IG用来衡量从参考输入x&amp;rsquo;到真实输入x的真实路径上，每个Token的累积贡献，其中$f(\cdot,\cdot)$表示该Block的输出：&#10;&lt;/p&gt;&#10;$$&#10;\text{IG}(x) = (x - x')\int_{0}^{1}\frac{\partial f(x^\alpha ,w)}{\partial x^{\alpha}}d\alpha \tag{QIG 1}&#10;$$&lt;p&gt;&#10;其中$x^\alpha = \alpha(x-x')$,而$f(\cdot,w)$表示全精度模型。&lt;/p&gt;&#10;&lt;p&gt;我简单介绍一下这个是怎么来的吧，本质上我们是想知道某个输入的Token发生变化后会对模型的输出产生怎样的变化。由导数的定义我们知道:&#10;&lt;/p&gt;&#10;$$&#10;f(x)-f(x') = \int_{x'}^x\frac{\partial f(t)}{\partial t}dt&#10;$$&lt;p&gt;&#10;在一维的情况下，因为只有一个变量，因此我们上式就是该Token的归约。当我们将输入扩展到多维，我们自然想知道每个维度对变化的贡献。&lt;/p&gt;&#10;&lt;p&gt;IG的做法是，我们从参考输入x‘出发，沿一条直线走到真实输入x，可以将这条路径写作:&#10;&lt;/p&gt;&#10;$$&#10;x^\alpha = x' + \alpha(x - x'),\quad \alpha \in [0,1]&#10;$$&lt;p&gt;&#10;那么此时，我们可以把函数写作按照路径变化的形式:&#10;&lt;/p&gt;&#10;$$&#10;F(\alpha) = f(x^\alpha)&#10;$$&lt;p&gt;&#10;这是一个一维函数，自变量只有$\alpha$，于是输入变化带来的变化可以写作:&#10;&lt;/p&gt;&#10;$$&#10;f(x)-f(x') = F(1)-F(0)&#10;$$&lt;p&gt;&#10;写作积分形式:&#10;&lt;/p&gt;&#10;$$&#10;F(1)-F(0) = \int_0^1 \frac{dF(\alpha)}{d\alpha}d\alpha = \int_{0}^1 \frac{\partial f(x^\alpha)}{\partial x^\alpha}\cdot \frac{\partial x^\alpha}{\partial \alpha}&#10;$$&lt;p&gt;&#10;而:&#10;&lt;/p&gt;&#10;$$&#10;x_i^\alpha = x_i' + \alpha(x_i-x_i')&#10;$$&lt;p&gt;&#10;故:&#10;&lt;/p&gt;&#10;$$&#10;\frac{\partial x_i^\alpha}{\partial \alpha} = x_i-x_i'&#10;$$&lt;p&gt;&#10;代入有：&#10;&lt;/p&gt;&#10;$$&#10;\frac{dF(\alpha)}{d\alpha} = \sum_{i=1}^n \frac{\partial f(x^\alpha)}{\partial x^\alpha}(x_i-x_i')&#10;$$&lt;p&gt;&#10;因此:&#10;&lt;/p&gt;&#10;$$&#10;f(x)-f(x') = \int_{0}^1 \sum_{i=1}^n\frac{\partial f(x^\alpha)}{\partial x^\alpha}(x_i-x_i') d\alpha = \sum_{i=1}^n (x_i-x_i')\int_{0}^1 \frac{\partial f(x^\alpha)}{\partial x^\alpha}d\alpha&#10;$$&lt;p&gt;&#10;那么IG就定义第i维的规约为:&#10;&lt;/p&gt;&#10;$$&#10;\text{IG}_i(x) = (x_i-x_i')\int_{0}^1 \frac{\partial f(x^\alpha)}{\partial x^\alpha}d\alpha&#10;$$&lt;p&gt;&#10;写作向量形式就是式子QIG(1)中的形式。&lt;/p&gt;&#10;&lt;p&gt;对应到量化场景，我们取原始输入$x'$为量化后的输入$x'=x^q$,那么可以写出量化感知积分梯度:&#10;&lt;/p&gt;&#10;$$&#10;\text{QIG} = (x-x_q)\int_{0}^1 \frac{\partial f(x^\alpha)}{\partial x^\alpha}d\alpha&#10;$$&lt;p&gt;&#10;不过我们不能直接将QIG作为优化的权，因为它呈现了重尾分布，这会导致极少部分token主导优化过程。为了抑制这种现象，作者选择按照四分位距(IQR)进行裁剪，从而得到裁剪后的分数:&#10;&lt;/p&gt;&#10;$$&#10;C(QIG_i) = clip(QIG_i,Q_1-1.5\cdot IQR,Q_3+1.5\cdot IQR)&#10;$$&lt;p&gt;&#10;其中$Q_1,Q_3$分别表示第一和第三四分位数，且$IQR=Q_3-Q_1$.随后对这些分数进行归一化，得到最终的token重要系数:&#10;&lt;/p&gt;&#10;$$&#10;\lambda_i = \frac{C(QIG_i)}{\sum C(QIG_i)}&#10;$$&lt;p&gt;&#10;之后按照类似于MBQ的思路，将这个加权融入量化优化的目标函数即可。&lt;/p&gt;&#10;</description></item><item><title>[2025 CVPR] MBQ: Modality-Balanced Quantization for Large Vision-Language Models</title><link>https://july-h5kf3.github.io/p/mbq/</link><pubDate>Wed, 26 Aug 2026 08:21:00 +0800</pubDate><guid>https://july-h5kf3.github.io/p/mbq/</guid><description>&lt;div style="background-color:#f9f9f9; padding:8px; border-radius:6px;"&gt;&#10; &lt;b&gt;个人评价&lt;/b&gt;:文章的Insight很不错，不同模态Token的影响差异确实很显著，Method is Simple but benefit a lot&#10;&lt;/div&gt;&#10;&lt;p&gt;当我们直接使用大语言模型的量化的方法对多模态大模型进行量化时(如AWQ，GPTQ等)，往往会忽略不同模态激活值带来的差异，在论文中这种差异被描述为模态之间敏感度的差异。MBQ的思路是在量化过程中平衡这些差异，从而提高VLMs的准确性。&lt;/p&gt;&#10;&lt;p&gt;MBQ首先通过实验发现将\，作者认为这源于对不同模态一视同仁的处理方式。原因主要有两点:&lt;/p&gt;&#10;&lt;ol&gt;&#10;&lt;li&gt;从数据角度来看，视觉数据具有较高的冗余性，因此对小扰动具有强抗干扰性。&lt;/li&gt;&#10;&lt;li&gt;从模型角度来看，目前VLM生成的内容主要受预训练LLM的影响，而非输入的图像本身。&lt;/li&gt;&#10;&lt;/ol&gt;&#10;&lt;p&gt;作者做了一个小实验来验证上述猜想，他们将图像-文本对作为VLM的输入，并计算并计算监督微调损失函数相对于语言token和视觉token的梯度。这些梯度反映了当对语言（文本）或视觉（图像）token特征施加微小扰动时，对输出语言token（caption）的影响。&lt;/p&gt;&#10;&lt;p&gt;如下图所示，可以发现,语言Token的平均绝对值比视觉的大了一个数量级。这也就意味着，在相同的扰动下，视觉token对SFT损失的影响仅为语言token的0.1倍，因此我们不能发把语言Token和视觉Token同等对待&lt;/p&gt;&#10;&lt;p&gt;&lt;img class="gallery-image" data-flex-basis="312px" data-flex-grow="130" height="494" loading="lazy" sizes="(max-width: 767px) calc(100vw - 30px), (max-width: 1023px) 700px, (max-width: 1279px) 950px, 1232px" src="https://july-h5kf3.github.io/p/mbq/MBQ_fig1.png" width="644"&gt;&lt;/p&gt;&#10;&lt;p&gt;为了展示在校准过程考虑模态差异的重要性，作者进行了一个简单的小实验:在CWE校准中，对视觉Token的重建损失施加一个0.1的模态平衡因子。此时优化目标可以写作:&#10;&lt;/p&gt;&#10;$$&#10;E^* = \arg \min_{E}[||Q(W\cdot E)(E^{-1}X_l)-W\cdot X_l||^2 + 0.1 *||Q(W\cdot E)Q(E^{-1}X_v)-W\cdot x_v||^2]&#10;$$&lt;p&gt;&#10;实验结果表明:&#9;即使仅使用一个启发式选择的模态平衡因子，balanced CWE 也能够显著超过原始 CWE 的性能。&lt;/p&gt;&#10;&lt;p&gt;为了进一步探索这个最优的平滑因子，论文提出了MBQ方法。&lt;/p&gt;&#10;&lt;p&gt;具体而言，该方法通过最小化SFT损失函数的变化，为每一层分配最优的模态平衡因子。具体而言，我们用下式描述每个线性层的输出激活Y收到一个小扰动$\Delta $时，SFT损失L的变化:&#10;&lt;/p&gt;&#10;$$&#10;\mathcal{L}(Y+\Delta W) \simeq \mathcal{L} + g^\top \cdot \Delta&#10;$$&lt;p&gt;&#10;其中$g^\top$表示输出激活Y的梯度。那么由量化引起的SFT损失可以表示为：&#10;&lt;/p&gt;&#10;$$&#10;\begin{align}&#10;||\mathcal{L}(\hat Y)-\mathcal{L}(Y)||\simeq ||g^\top \cdot \Delta||\\&#10;=||g_v^\top \cdot \Delta_v + g_l^\top \cdot \Delta_l||\\&#10;\leq ||g_v^\top \cdot \Delta_v|| + ||g_l^\top \cdot \Delta_l||\\&#10;\leq |g_v^\top|\cdot |\Delta_v| + |g_l^\top|\cdot |\Delta_l|\\&#10;=\overline{|g_v|}\cdot ||\hat Y_v - Y_v|| + \overline{|g_l|} \cdot ||\hat Y_l - Y_l||&#10;\end{align}&#10;$$&lt;p&gt;&#10;在一般的大语言模型的量化中，通常会分为两个阶段采用不同粒度的量化:&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;Prefill阶段：这个阶段主要是将整个Prompt并行地计算每一层的hidden state（即计算KV，并得到KV-Cache），这个阶段整个Prompt一次性并行计算，矩阵乘法很大，算力利用率很高。这时候如果把 权重和激活都量化，就能直接减少 GEMM 的计算/带宽开销，所以 W8A8 / FP8 W8A8 往往比较合适。&lt;/li&gt;&#10;&lt;li&gt;Decode阶段：decode阶段是逐token生成，其瓶颈不在于计算，而是权重的访存，因此通常只会对权重进行量化&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;在MBQ中遵循了同样的方式，在Prefill阶段进行权重-激活值的量化，在Decode阶段进行权重的量化。二者的优化目标均为:&#10;&lt;/p&gt;&#10;$$&#10;\min_E{\mathbb{E}}[\overline{|g_v|}\cdot ||WX_v-Q(W\cdot E)Q(E^{-1}\cdot X_v)|| + \overline{|g_l|}\cdot ||WX_l-Q(W\cdot E)Q(E^{-1}X_l)||]&#10;$$&lt;p&gt;&#10;需要注意的是，这里的重建损失函数是基于MAE而非MSE的。&lt;/p&gt;&#10;</description></item><item><title>[2026 CVPR] MASQuant: Modality-Aware Smoothing Quantization for Multimodal Large Language Models</title><link>https://july-h5kf3.github.io/p/masquant/</link><pubDate>Wed, 26 Aug 2026 08:18:00 +0800</pubDate><guid>https://july-h5kf3.github.io/p/masquant/</guid><description>&lt;div style="background-color:#f9f9f9; padding:8px; border-radius:6px;"&gt;&#10; &lt;b&gt;个人评价&lt;/b&gt;:很有价值的工作，从High-Level的角度来看，不同模态激活值的分布不同带来的量化挑战可以看作LLM Quant中激活值Outlier带来的挑战，因此从这个角度出发可以很好的理解文章的出发点。&#10;&lt;/div&gt;&#10;&lt;p&gt;总结：本文旨在解决基于通道级平滑的PTQ方法应用于多模态大模型时面临的一个核心挑战：Smoothing Misalignment。论文通过MAS为每个模态确定一个平滑因子来解决这个问题，并通过CMC方法来解决与之伴随而来的Cross-Modal Computation Invariance问题。&lt;/p&gt;&#10;&lt;p&gt;当将基于通道级（Per-channel）平滑的PTQ应用于多模态大模型（MLLMs）时会面临两个核心挑战：&lt;/p&gt;&#10;&lt;ol&gt;&#10;&lt;li&gt;Smoothing Misalignment（平滑错位）：不同模态的激活值幅度存在数量级的差异，例如视觉Token的激活范围通常比文本和音频大10-100倍。传统的Per-channel量化为每个通道计算单一的缩放因子，导致主导模态的较大激活决定平滑因子，而使非主导模态的激活被过度平滑，信号被严重压制，最终导致量化后的模型性能不佳。&lt;/li&gt;&#10;&lt;li&gt;Cross-Modal Computational Invariance（跨模态计算不变性）：直接为不同模态计算独立的平滑因子会破坏计算不变性（坐标系不同）。若严格保持模态特定的平滑，推理时需要为不同模态存储不同的量化权重矩阵，这违背了量化技术通过单一低精度权重表示来减少内存占用的根本目标。&lt;/li&gt;&#10;&lt;/ol&gt;&#10;&lt;p&gt;论文提出了MASQuant框架来解决上述两个问题，该框架包含两个核心组件：MAS（Modality-Aware Smoothing）以及CMC（Cross-Modal Compensation ）&lt;/p&gt;&#10;&lt;p&gt;对于Smoothing Misalignment的问题，其核心还是在于不同模态的激活值幅度存在数量级的差异，因此MASQuant通过为每种模态维护模态特定的平滑因子来解决这个问题，从而从根本上解决了某一模态的主导效应。&lt;/p&gt;&#10;&lt;p&gt;(n这里有一点与SmoothQuant不同，MAS的平滑因子是通过学习得到的：&lt;/p&gt;&#10;&lt;p&gt;首先获得模态感知的平滑因子初始值如下&#10;&lt;/p&gt;&#10;$$&#10;S_m= \text{diag}(s_m),\quad s_{m,i} = \frac{\max_t |x_{t,i}^m|}{\max_j |w_{j,i}|},\quad m\in M&#10;$$&lt;p&gt;&#10;随后，我们在模态特定的数据上最小化MAE损失来优化$S_m$。我们记$\{S_m\}_{m\in M}$为$\{S_m\}$,我们有:&#10;&lt;/p&gt;&#10;$$&#10;\{S_m^*\} = \arg \min_{\{S_m\}_{m\in M}}(\lambda_m \cdot \mathcal{L}_{\text{MAE}}(S_m,X_m,W))&#10;$$&lt;p&gt;&#10;其中$\lambda_m$表示模态m的损失权重，对于模态m，量化重建的MAE损失为:&#10;&lt;/p&gt;&#10;$$&#10;\mathcal{L}_{\text{MAE}}=||Q(X_m S_m^{-1})Q(S_mW)-X_mW||&#10;$$&lt;p&gt;&#10;这保证了$S_m^*$能捕获模态特定的统计特性，同时避免跨模态干扰。&lt;/p&gt;&#10;&lt;p&gt;此外，论文中还给出了通过信噪比量化的收益，可以证明相较于之前的统一平滑(Unified Smoothing)，MAS使用的最优平滑(Optimal Smoothing)二者差值：&#10;&lt;/p&gt;&#10;$$&#10;\Delta =10\log_{10}(\frac{\sum_{i=1}^d \frac{1}{\alpha_i^2}}{d\cdot (\max_i \frac{1}{\alpha})^2})\leq 0&#10;$$&lt;p&gt;&#10;这说明，在任何情况下MAS的Optimal Smoothing都不会比Unified Smoothing更差（虽然这是显而易见的）&lt;/p&gt;&#10;&lt;p&gt;在MAS中，我们为每个模态都存储了一个$S_m$，那么这意味着我们模型中每一层的权重W，对于每一个模态都要维护一个量化矩阵$S_mW$，这显然是我们无法接受的。MAS为了保证在PTQ过程中所有的模态之间共享一个量化权重，采用了如下方法（CMC）：&lt;/p&gt;&#10;&lt;p&gt;首先，我们仅存储一个量化权重$Q(S_tW)$,以文本模态为参考，并通过lora矫正来补偿其他模块。以视觉输入为例：理想情况下，我们计算：&#10;&lt;/p&gt;&#10;$$&#10;X_vS_v^{-1}\cdot(S_vW)&#10;$$&lt;p&gt;&#10;但使用共享权重则会产生残差：&#10;&lt;/p&gt;&#10;$$&#10;\Delta Y = X_vS_v^{-1}\cdot(\underbrace{S_vW-Q(S_tW)}_{\Delta W})&#10;$$&lt;p&gt;那么我们可以对于每个非文本模态，我们都去存储这个残差，然后为了避免大矩阵的存储开销，我们可以使用低秩近似。&lt;/p&gt;&#10;&lt;p&gt;然而，我们不能直接对$\Delta W$使用SVD进行近似，因为事实上，我们需要近似的是残差$\Delta Y$,而非$\Delta W$（可以理解为$\Delta Y$是带权重的$\Delta W$）,且$\Delta W$不一定具有低秩结构（即前若干个大的奇异值不能解释大部分的能量）&lt;/p&gt;&#10;&lt;p&gt;我们现在来看我们的优化目标：&#10;&lt;/p&gt;&#10;$$&#10;\arg \min_{L} ||X_vS_v^{-1}(L-\Delta W)||^2_F&#10;$$&lt;p&gt;&#10;为了符号简便起见，我们令$A = X_vS_v^{-1}$,那么我们可以把最小化目标拆开写作:&#10;&lt;/p&gt;&#10;$$&#10;\arg \min_L \text{tr}((\Delta W - L)^\top A^\top A (\Delta W - L))&#10;$$&lt;p&gt;&#10;那么一个自然的想法就是考虑能否通过某种线性变换消去这个权重的影响。在线性代数中我们知道，可以通过对一个矩阵进行白化（可将数据的协方差变为单位矩阵I）来达成我们的目的。&lt;/p&gt;&#10;&lt;p&gt;我们通过如下方式计算白化变换：&#10;&lt;/p&gt;&#10;$$&#10;\text{SVD}(A^\top A) = P\Lambda P^\top,T = (P\Lambda^{\frac{1}{2}})^\top&#10;$$&lt;p&gt;&#10;那么此时$AT^{-1}$是正交的。我们近似的目标可以描述为:&#10;&lt;/p&gt;&#10;$$&#10;\arg \min_L ||AT^{-1}T(\Delta W -L)||_F^2 = \arg \min_L ||T(\Delta W-L)||_F^2&#10;$$&lt;p&gt;&#10;所以我们现在相当于在用一个rank为r的矩阵$TL$对矩阵$T\Delta W$进行逼近（经过实验验证，它具有低秩结构），因此我们可以对$T\Delta W$进行SVD截断:&#10;&lt;/p&gt;&#10;$$&#10;SVD(T(\Delta W)) = U\Sigma V^\top \approx U_r \Sigma_r V^\top_r&#10;$$&lt;p&gt;那么我们对白化进行逆变换后就可以得到低秩修正项：&#10;&lt;/p&gt;&#10;$$&#10;\Delta W = L_1L_2 \quad L_1 = T^{-1}U_r \quad L_2 = \Sigma_r V_r^\top&#10;$$&lt;p&gt;&#10;可以证明上述近似在秩r补偿近似下最优：&lt;/p&gt;&#10;&lt;p&gt;假设秩为r的矩阵$L = L_1L_2$,其中$L_1,L_2$由上式中定义的秩 r 截断 SVD 给出，它能够最小化重构损失。用形式化语言描述：&#10;&lt;/p&gt;&#10;$$&#10;\mathcal{L}=\sum_v ||X_vS_v^{-1}(\Delta W-L)||_F^2 \quad L^* = \arg \min_{\text{rank}(L)\leq r}\sum_v ||X_vS_v^{-1}(\Delta W-L)||_F^2&#10;$$&lt;p&gt;&#10;证明如下：&lt;/p&gt;&#10;&lt;p&gt;只考虑两个模态，并且仅对权重进行量化，那么根据定义我们有：&#10;&lt;/p&gt;&#10;$$&#10;L^*=T^{-1}(\text{Trunc}_r(T\Delta W))&#10;$$&lt;p&gt;&#10;由&#10;&lt;/p&gt;&#10;$$&#10;(X_vS^{-1}_v)^\top (X_vS_v^{-1}) = P\Lambda P^{\top}&#10;$$&lt;p&gt;&#10;可以推出：&#10;&lt;/p&gt;&#10;$$&#10;X_vS_v^{-1}=U\Lambda^{\frac{1}{2}}P^{\top}=UT&#10;$$&lt;p&gt;&#10;那么有&#10;&lt;/p&gt;&#10;$$&#10;\begin{align}&#10;\mathcal{L}(L^*)&#10;&amp;= \left\| X_v S_v^{-1}(\Delta W - L^*) \right\|_F^2 \\&#10;&amp;= \left\| U T (\Delta W - L^*) \right\|_F^2 \\&#10;&amp;= \left\| U T \left(\Delta W - T^{-1}\operatorname{Trunc}_r(T\Delta W)\right) \right\|_F^2 \\&#10;&amp;= \left\| T\Delta W - \operatorname{Trunc}_r(T\Delta W) \right\|_F^2 \\&#10;&amp;= \sum_{i&gt;r} \sigma_i(T\Delta W)^2 \\&#10;&amp;= \sum_{i&gt;r} \sigma_i\!\left(U^{-1}X_vS_v^{-1}\Delta W\right)^2 \\&#10;&amp;= \sum_{i&gt;r} \sigma_i\!\left(X_vS_v^{-1}\Delta W\right)^2 \\&#10;&amp;= L_{\min}^2.&#10;\end{align}&#10;$$&lt;p&gt;那么至此我们可以写出最终推理阶段将基础量化输出与模态特定修正结合起来：&#10;&lt;/p&gt;&#10;$$&#10;Y =\left&#10;\{&#10;\begin{aligned}&#10;Q(X_mS_m^{-1})Q(S_tW), \quad m=\text{text}\\&#10;Q(x_mS_m^{-1})Q(S_tW) + X_mS_m^{-1}\cdot L_1^mL_2^m,\quad m\neq \text{text}&#10;\end{aligned}&#10;\right.&#10;$$&lt;p&gt;&#10;MAS完整的流程如下图&lt;/p&gt;&#10;&lt;p&gt;&lt;img class="gallery-image" data-flex-basis="284px" data-flex-grow="118" height="402" loading="lazy" sizes="(max-width: 767px) calc(100vw - 30px), (max-width: 1023px) 700px, (max-width: 1279px) 950px, 1232px" src="https://july-h5kf3.github.io/p/masquant/MASQuant.png" width="477"&gt;&lt;/p&gt;&#10;</description></item></channel></rss>