<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>MASQuant on Lorn</title><link>https://july-h5kf3.github.io/tags/masquant/</link><description>Recent content in MASQuant on Lorn</description><generator>Hugo -- gohugo.io</generator><language>zh-cn</language><lastBuildDate>Wed, 26 Aug 2026 08:18:00 +0800</lastBuildDate><atom:link href="https://july-h5kf3.github.io/tags/masquant/index.xml" rel="self" type="application/rss+xml"/><item><title>[2026 CVPR] MASQuant: Modality-Aware Smoothing Quantization for Multimodal Large Language Models</title><link>https://july-h5kf3.github.io/p/masquant/</link><pubDate>Wed, 26 Aug 2026 08:18:00 +0800</pubDate><guid>https://july-h5kf3.github.io/p/masquant/</guid><description>&lt;div style="background-color:#f9f9f9; padding:8px; border-radius:6px;"&gt;&#10; &lt;b&gt;个人评价&lt;/b&gt;:很有价值的工作，从High-Level的角度来看，不同模态激活值的分布不同带来的量化挑战可以看作LLM Quant中激活值Outlier带来的挑战，因此从这个角度出发可以很好的理解文章的出发点。&#10;&lt;/div&gt;&#10;&lt;p&gt;总结：本文旨在解决基于通道级平滑的PTQ方法应用于多模态大模型时面临的一个核心挑战：Smoothing Misalignment。论文通过MAS为每个模态确定一个平滑因子来解决这个问题，并通过CMC方法来解决与之伴随而来的Cross-Modal Computation Invariance问题。&lt;/p&gt;&#10;&lt;p&gt;当将基于通道级（Per-channel）平滑的PTQ应用于多模态大模型（MLLMs）时会面临两个核心挑战：&lt;/p&gt;&#10;&lt;ol&gt;&#10;&lt;li&gt;Smoothing Misalignment（平滑错位）：不同模态的激活值幅度存在数量级的差异，例如视觉Token的激活范围通常比文本和音频大10-100倍。传统的Per-channel量化为每个通道计算单一的缩放因子，导致主导模态的较大激活决定平滑因子，而使非主导模态的激活被过度平滑，信号被严重压制，最终导致量化后的模型性能不佳。&lt;/li&gt;&#10;&lt;li&gt;Cross-Modal Computational Invariance（跨模态计算不变性）：直接为不同模态计算独立的平滑因子会破坏计算不变性（坐标系不同）。若严格保持模态特定的平滑，推理时需要为不同模态存储不同的量化权重矩阵，这违背了量化技术通过单一低精度权重表示来减少内存占用的根本目标。&lt;/li&gt;&#10;&lt;/ol&gt;&#10;&lt;p&gt;论文提出了MASQuant框架来解决上述两个问题，该框架包含两个核心组件：MAS（Modality-Aware Smoothing）以及CMC（Cross-Modal Compensation ）&lt;/p&gt;&#10;&lt;p&gt;对于Smoothing Misalignment的问题，其核心还是在于不同模态的激活值幅度存在数量级的差异，因此MASQuant通过为每种模态维护模态特定的平滑因子来解决这个问题，从而从根本上解决了某一模态的主导效应。&lt;/p&gt;&#10;&lt;p&gt;(n这里有一点与SmoothQuant不同，MAS的平滑因子是通过学习得到的：&lt;/p&gt;&#10;&lt;p&gt;首先获得模态感知的平滑因子初始值如下&#10;&lt;/p&gt;&#10;$$&#10;S_m= \text{diag}(s_m),\quad s_{m,i} = \frac{\max_t |x_{t,i}^m|}{\max_j |w_{j,i}|},\quad m\in M&#10;$$&lt;p&gt;&#10;随后，我们在模态特定的数据上最小化MAE损失来优化$S_m$。我们记$\{S_m\}_{m\in M}$为$\{S_m\}$,我们有:&#10;&lt;/p&gt;&#10;$$&#10;\{S_m^*\} = \arg \min_{\{S_m\}_{m\in M}}(\lambda_m \cdot \mathcal{L}_{\text{MAE}}(S_m,X_m,W))&#10;$$&lt;p&gt;&#10;其中$\lambda_m$表示模态m的损失权重，对于模态m，量化重建的MAE损失为:&#10;&lt;/p&gt;&#10;$$&#10;\mathcal{L}_{\text{MAE}}=||Q(X_m S_m^{-1})Q(S_mW)-X_mW||&#10;$$&lt;p&gt;&#10;这保证了$S_m^*$能捕获模态特定的统计特性，同时避免跨模态干扰。&lt;/p&gt;&#10;&lt;p&gt;此外，论文中还给出了通过信噪比量化的收益，可以证明相较于之前的统一平滑(Unified Smoothing)，MAS使用的最优平滑(Optimal Smoothing)二者差值：&#10;&lt;/p&gt;&#10;$$&#10;\Delta =10\log_{10}(\frac{\sum_{i=1}^d \frac{1}{\alpha_i^2}}{d\cdot (\max_i \frac{1}{\alpha})^2})\leq 0&#10;$$&lt;p&gt;&#10;这说明，在任何情况下MAS的Optimal Smoothing都不会比Unified Smoothing更差（虽然这是显而易见的）&lt;/p&gt;&#10;&lt;p&gt;在MAS中，我们为每个模态都存储了一个$S_m$，那么这意味着我们模型中每一层的权重W，对于每一个模态都要维护一个量化矩阵$S_mW$，这显然是我们无法接受的。MAS为了保证在PTQ过程中所有的模态之间共享一个量化权重，采用了如下方法（CMC）：&lt;/p&gt;&#10;&lt;p&gt;首先，我们仅存储一个量化权重$Q(S_tW)$,以文本模态为参考，并通过lora矫正来补偿其他模块。以视觉输入为例：理想情况下，我们计算：&#10;&lt;/p&gt;&#10;$$&#10;X_vS_v^{-1}\cdot(S_vW)&#10;$$&lt;p&gt;&#10;但使用共享权重则会产生残差：&#10;&lt;/p&gt;&#10;$$&#10;\Delta Y = X_vS_v^{-1}\cdot(\underbrace{S_vW-Q(S_tW)}_{\Delta W})&#10;$$&lt;p&gt;那么我们可以对于每个非文本模态，我们都去存储这个残差，然后为了避免大矩阵的存储开销，我们可以使用低秩近似。&lt;/p&gt;&#10;&lt;p&gt;然而，我们不能直接对$\Delta W$使用SVD进行近似，因为事实上，我们需要近似的是残差$\Delta Y$,而非$\Delta W$（可以理解为$\Delta Y$是带权重的$\Delta W$）,且$\Delta W$不一定具有低秩结构（即前若干个大的奇异值不能解释大部分的能量）&lt;/p&gt;&#10;&lt;p&gt;我们现在来看我们的优化目标：&#10;&lt;/p&gt;&#10;$$&#10;\arg \min_{L} ||X_vS_v^{-1}(L-\Delta W)||^2_F&#10;$$&lt;p&gt;&#10;为了符号简便起见，我们令$A = X_vS_v^{-1}$,那么我们可以把最小化目标拆开写作:&#10;&lt;/p&gt;&#10;$$&#10;\arg \min_L \text{tr}((\Delta W - L)^\top A^\top A (\Delta W - L))&#10;$$&lt;p&gt;&#10;那么一个自然的想法就是考虑能否通过某种线性变换消去这个权重的影响。在线性代数中我们知道，可以通过对一个矩阵进行白化（可将数据的协方差变为单位矩阵I）来达成我们的目的。&lt;/p&gt;&#10;&lt;p&gt;我们通过如下方式计算白化变换：&#10;&lt;/p&gt;&#10;$$&#10;\text{SVD}(A^\top A) = P\Lambda P^\top,T = (P\Lambda^{\frac{1}{2}})^\top&#10;$$&lt;p&gt;&#10;那么此时$AT^{-1}$是正交的。我们近似的目标可以描述为:&#10;&lt;/p&gt;&#10;$$&#10;\arg \min_L ||AT^{-1}T(\Delta W -L)||_F^2 = \arg \min_L ||T(\Delta W-L)||_F^2&#10;$$&lt;p&gt;&#10;所以我们现在相当于在用一个rank为r的矩阵$TL$对矩阵$T\Delta W$进行逼近（经过实验验证，它具有低秩结构），因此我们可以对$T\Delta W$进行SVD截断:&#10;&lt;/p&gt;&#10;$$&#10;SVD(T(\Delta W)) = U\Sigma V^\top \approx U_r \Sigma_r V^\top_r&#10;$$&lt;p&gt;那么我们对白化进行逆变换后就可以得到低秩修正项：&#10;&lt;/p&gt;&#10;$$&#10;\Delta W = L_1L_2 \quad L_1 = T^{-1}U_r \quad L_2 = \Sigma_r V_r^\top&#10;$$&lt;p&gt;&#10;可以证明上述近似在秩r补偿近似下最优：&lt;/p&gt;&#10;&lt;p&gt;假设秩为r的矩阵$L = L_1L_2$,其中$L_1,L_2$由上式中定义的秩 r 截断 SVD 给出，它能够最小化重构损失。用形式化语言描述：&#10;&lt;/p&gt;&#10;$$&#10;\mathcal{L}=\sum_v ||X_vS_v^{-1}(\Delta W-L)||_F^2 \quad L^* = \arg \min_{\text{rank}(L)\leq r}\sum_v ||X_vS_v^{-1}(\Delta W-L)||_F^2&#10;$$&lt;p&gt;&#10;证明如下：&lt;/p&gt;&#10;&lt;p&gt;只考虑两个模态，并且仅对权重进行量化，那么根据定义我们有：&#10;&lt;/p&gt;&#10;$$&#10;L^*=T^{-1}(\text{Trunc}_r(T\Delta W))&#10;$$&lt;p&gt;&#10;由&#10;&lt;/p&gt;&#10;$$&#10;(X_vS^{-1}_v)^\top (X_vS_v^{-1}) = P\Lambda P^{\top}&#10;$$&lt;p&gt;&#10;可以推出：&#10;&lt;/p&gt;&#10;$$&#10;X_vS_v^{-1}=U\Lambda^{\frac{1}{2}}P^{\top}=UT&#10;$$&lt;p&gt;&#10;那么有&#10;&lt;/p&gt;&#10;$$&#10;\begin{align}&#10;\mathcal{L}(L^*)&#10;&amp;= \left\| X_v S_v^{-1}(\Delta W - L^*) \right\|_F^2 \\&#10;&amp;= \left\| U T (\Delta W - L^*) \right\|_F^2 \\&#10;&amp;= \left\| U T \left(\Delta W - T^{-1}\operatorname{Trunc}_r(T\Delta W)\right) \right\|_F^2 \\&#10;&amp;= \left\| T\Delta W - \operatorname{Trunc}_r(T\Delta W) \right\|_F^2 \\&#10;&amp;= \sum_{i&gt;r} \sigma_i(T\Delta W)^2 \\&#10;&amp;= \sum_{i&gt;r} \sigma_i\!\left(U^{-1}X_vS_v^{-1}\Delta W\right)^2 \\&#10;&amp;= \sum_{i&gt;r} \sigma_i\!\left(X_vS_v^{-1}\Delta W\right)^2 \\&#10;&amp;= L_{\min}^2.&#10;\end{align}&#10;$$&lt;p&gt;那么至此我们可以写出最终推理阶段将基础量化输出与模态特定修正结合起来：&#10;&lt;/p&gt;&#10;$$&#10;Y =\left&#10;\{&#10;\begin{aligned}&#10;Q(X_mS_m^{-1})Q(S_tW), \quad m=\text{text}\\&#10;Q(x_mS_m^{-1})Q(S_tW) + X_mS_m^{-1}\cdot L_1^mL_2^m,\quad m\neq \text{text}&#10;\end{aligned}&#10;\right.&#10;$$&lt;p&gt;&#10;MAS完整的流程如下图&lt;/p&gt;&#10;&lt;p&gt;&lt;img class="gallery-image" data-flex-basis="284px" data-flex-grow="118" height="402" loading="lazy" sizes="(max-width: 767px) calc(100vw - 30px), (max-width: 1023px) 700px, (max-width: 1279px) 950px, 1232px" src="https://july-h5kf3.github.io/p/masquant/MASQuant.png" width="477"&gt;&lt;/p&gt;&#10;</description></item></channel></rss>