<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>低比特 on Lorn</title><link>https://july-h5kf3.github.io/tags/%E4%BD%8E%E6%AF%94%E7%89%B9/</link><description>Recent content in 低比特 on Lorn</description><generator>Hugo -- gohugo.io</generator><language>zh-cn</language><lastBuildDate>Wed, 26 Aug 2026 08:51:00 +0800</lastBuildDate><atom:link href="https://july-h5kf3.github.io/tags/%E4%BD%8E%E6%AF%94%E7%89%B9/index.xml" rel="self" type="application/rss+xml"/><item><title>[2026 NeurIPS] Breaking Modality Heterogeneity in Low-Bit Quantization for Large Vision-Language Models</title><link>https://july-h5kf3.github.io/p/breaking-modality-heterogeneity/</link><pubDate>Wed, 26 Aug 2026 08:51:00 +0800</pubDate><guid>https://july-h5kf3.github.io/p/breaking-modality-heterogeneity/</guid><description>&lt;p&gt;作者团队通过可视化文本和视觉Token在不同通道分布上的分布，观察到以下现象:&lt;/p&gt;&#10;&lt;ol&gt;&#10;&lt;li&gt;不同模态的激活分布存在本质差异:视觉激活通常呈现长尾分布，即只有少数通道包含幅值极大的激活，也就是需要谨慎处理的离群值。相比之下，文本激活中的离群值在通道之间分布得更加均匀。&lt;/li&gt;&#10;&lt;li&gt;对于两种模态而言，离群通道都只占全部通道的一小部分&lt;/li&gt;&#10;&lt;li&gt;更重要的是，文本模态和视觉模态的激活离群值位于不同的通道中。&lt;/li&gt;&#10;&lt;/ol&gt;&#10;&lt;p&gt;由观察1，可以指导VLM量化的一个困难在于目前所有通道的激活都通过一个共享的变换矩阵P进行优化。然而，Modality-specific的离群通道会彼此显著干扰，导致该共享的变换矩阵不是最优的。&lt;/p&gt;&#10;&lt;p&gt;这里可以简单解释一下，目前基于变换矩阵的PTQ方法普遍通过最小化如下损失获取:&#10;&lt;/p&gt;&#10;$$&#10;P = \arg \min ||Q(XP)Q(P^{-1}W) - XW||_2^2&#10;$$&lt;p&gt;&#10;而这种方式获取的P，往往会忽视不同模态Token之间的差异，以及不同通道之间的差异，因此论文提到这个共享的变换矩阵不是最优的。&lt;/p&gt;&#10;&lt;p&gt;而受第2，3点的启发，文章提出了一种Modality-specific 的离群通道解耦技术（MOCD）。该方法通过从所有通道分离出文本特定和视觉特定的离群通道，来解耦模态特定离群值之间的干扰。这样，通道被划分为了三组: 视觉特定通道，文本特定通道和模态兼容通道&lt;/p&gt;&#10;&lt;p&gt;形式化而言:&lt;/p&gt;&#10;&lt;p&gt;我们令:$C = \{0,1,\dots,D_{in}\}$,表示所有通道索引。MOCD将输入通道划分为三个互不相交的集合:&#10;&lt;/p&gt;&#10;$$&#10;C = C_m \cup C_t \cup C_v,\quad C_t\cap C_m = \emptyset,\quad C_v\cap C_m = \emptyset&#10;$$&lt;p&gt;&#10;其中，$C_m,C_t,C_v$分别表示模态兼容通道，文本通道和视觉通道。由于离群通道数目远远小于$D_{in}$,他们还满足如下条件:&#10;&lt;/p&gt;&#10;$$&#10;\abs{C_m}\gg \abs{C_v},\quad \abs{C_m}\gg \abs{C_t}&#10;$$&lt;p&gt;&#10;相应地，激活矩阵和权重矩阵被拆分为:&#10;&lt;/p&gt;&#10;$$&#10;X \to \{X_m,X_t,X_v\},\quad W\to \{W_m,W_t,W_v\}&#10;$$&lt;p&gt;&#10;这三组矩阵对:&#10;&lt;/p&gt;&#10;$$&#10;\{X_m,W_m\},\quad \{X_v,W_v\},\quad \{X_t,W_t\}&#10;$$&lt;p&gt;&#10;会通过学习不同的变换进行不同方式的处理。&lt;/p&gt;&#10;&lt;p&gt;模态特定通道的选取方式如下:&lt;/p&gt;&#10;&lt;p&gt;首先根据幅度值选择视觉特定的离群通道，然后通过一种基于一致性的校准代理指标来识别文本特定的离群通道。令$T_v$和$T_t$分别代表采样得到的视觉Token和文本Token，C代表完整的通道集合。&lt;/p&gt;&#10;&lt;p&gt;对于视觉token，我们使用每个通道上的最大绝对激活值作为该通道的分数:&#10;&lt;/p&gt;&#10;$$&#10;s_v(c) = \max_{i \in T_v}\abs{X_{i,c}}&#10;$$&lt;p&gt;&#10;视觉特定的离群通道集合通过选择分数最高的$K_v$个通道得到:&#10;&lt;/p&gt;&#10;$$&#10;C_v = \text{TopK}_{c\in C}(s_v(c),K_v)&#10;$$&lt;p&gt;&#10;记剩下的通道为:$C' = C - C_v$&lt;/p&gt;&#10;&lt;p&gt;对于文本Token而言，使用每个通道上的最大激活值作为通道分数并不合理，因为文本Token的离群通道更多与不同 token 之间不稳定的相对响应有关。因此，我们使用每个 token 内部的百分位排名作为一种对尺度不敏感的通道重要性度量：&#10;&lt;/p&gt;&#10;$$&#10;r_{i,c} = \frac{1}{\abs{C'}}\sum_{j\in C'}\mathbb{I}(\abs{X_{i,j}}\leq \abs{X_{i,c}}),\quad i\in T_t,c\in C'&#10;$$&lt;p&gt;&#10;这种基于排名的度量可以抑制 token 之间的尺度变化，使得不同文本 token 之间的通道响应具有可比性。&lt;/p&gt;&#10;&lt;p&gt;对于每个通道，我们将其在所有文本 token 上的排名序列聚类为 K 组，并使用簇内方差作为响应不稳定性的度量。令$z_{i,c}$表示$r_{i,c}$的聚类分配，$\mu_{c,z_{i,c}}$表示对应的聚类中心，则:&#10;&lt;/p&gt;&#10;$$&#10;s_t(c) = \frac{1}{\abs{T_t}}\sum_{i\in T_t}(r_{i,c} - \mu_{c,z_{i,c}})^2&#10;$$&lt;p&gt;&#10;更大的$s_t(c)$表明在该通道上，不同文本 token 之间的相对响应更加不稳定。我们选择$s_t(c)$最高的$K_t$个通道作为文本特定通道:&#10;&lt;/p&gt;&#10;$$&#10;C_t = \text{TopK}_{c\in C'}(s_t(c),K_t)&#10;$$&lt;p&gt;&#10;剩余的通道构成模态兼容的通道:&#10;&lt;/p&gt;&#10;$$&#10;C_m = C - C_t - C_v&#10;$$&lt;p&gt;&#10;接下来视觉和文本特定通道对应的矩阵对$\{W_v,X_v\},\quad \{W_t,X_t\}$会走各自的独立量化路径，而主通道路径则会走自适应跨模态校准(ACC)&lt;/p&gt;&#10;&lt;p&gt;我们令$\Delta M= M - Q(M)$,其中M为权重矩阵或激活值矩阵。&lt;/p&gt;&#10;&lt;p&gt;对于权重侧的量化误差，采用CWS,通过低秩分解吸收由跨模态偏移触发的权重变化:&#10;&lt;/p&gt;&#10;$$&#10;P_m^{-1}W_m = \underbrace{(P_m^{-1}W_m)-U_sV_s}_{\text{平滑后主权重}}+\underbrace{U_sV_s}_{\text{低秩自适应分量}}&#10;$$&lt;p&gt;&#10;量化形式为:&#10;&lt;/p&gt;&#10;$$&#10;Y_m = \hat{X}_mQ(P_m^{-1}W_m-U_sV_s)+\hat{X}Q(U_s)Q(V_s)&#10;$$&lt;p&gt;&#10;其中$U_s\in\mathbb{R}^{D_m\times r},\quad V_s\in\mathbb{R}^{r\times D_{out}}$为可学习低秩矩阵，用于隔离敏感跨模态成分，使主权重分布更加平滑。&lt;/p&gt;&#10;&lt;p&gt;而对于激活侧的激活残差，与静态权重不同，激活是输入相关的，并且会随模态动态变化。因此，很难通过结构分解来重新表示其量化敏感分量。&lt;/p&gt;&#10;&lt;p&gt;因此我们引入一个直接补偿分支，用于恢复由激活量化带来的输出偏差:&#10;&lt;/p&gt;&#10;$$&#10;\Delta Y_{m}^{\text{act}} = \Delta(X_mP_m)P_{m}^{-1}W_m&#10;$$&lt;p&gt;&#10;而有研究表明:由于文本激活具有稠密语义特性，因此它们对量化噪声更加敏感；相比之下，视觉激活通常具有较强冗余性。因此，文本补偿通常能够捕获更关键的激活侧误差。&lt;/p&gt;&#10;&lt;p&gt;因此引入补偿分支恢复文本token的输出偏差,同时为了高效计算，我们用可学习的低秩矩阵$U_c,V_c$来近似权重映射。&#10;&lt;/p&gt;&#10;$$&#10;Y_{m}^{\text{text}}\leftarrow Y_{m}^{\text{text}}+Q(\Delta(X_mP_m)^{\text{text}})Q(U_c)Q(V_c)&#10;$$&lt;p&gt;&#10;整体的框架如图所示:&lt;/p&gt;&#10;&lt;p&gt;&lt;img class="gallery-image" data-flex-basis="469px" data-flex-grow="195" height="544" loading="lazy" sizes="(max-width: 767px) calc(100vw - 30px), (max-width: 1023px) 700px, (max-width: 1279px) 950px, 1232px" src="https://july-h5kf3.github.io/p/breaking-modality-heterogeneity/SplitQ_fig1.png" srcset="https://july-h5kf3.github.io/p/breaking-modality-heterogeneity/SplitQ_fig1_hu_34aa8b07b50941a4.png 800w, https://july-h5kf3.github.io/p/breaking-modality-heterogeneity/SplitQ_fig1.png 1064w" width="1064"&gt;&lt;/p&gt;&#10;&lt;p&gt;激活侧和权重侧的补偿都依赖于低秩分支。然而，像 LoRA 或 QLoRA这样自由学习的参数很容易在小规模校准集上过拟合；而固定的基于 SVD 的分量又缺乏足够的灵活性，难以吸收由模态异构性导致的量化误差。&lt;/p&gt;&#10;&lt;p&gt;为了在两种选择之间平衡，避免自由参数过拟合，同时保持对跨模态异质性的适应能力，低秩矩阵采用锚定SVD结构：&#10;&lt;/p&gt;&#10;$$&#10;W_m \approx U_r\Sigma_r V_r^\top\\&#10;U^* = P_m^{-1}W_m,V^*=\Sigma_rG_*V_r^\top,*\in \{s,c\}&#10;$$&lt;p&gt;&#10;其中$G_* \in \mathbb{R}^{r\times r}$为可学习的对角门控矩阵，在保留SVD结构先验的同时实现奇异方向自适应重加权。&lt;/p&gt;&#10;&lt;p&gt;可以参考下图:&lt;/p&gt;&#10;&lt;p&gt;&lt;img class="gallery-image" data-flex-basis="292px" data-flex-grow="121" height="328" loading="lazy" sizes="(max-width: 767px) calc(100vw - 30px), (max-width: 1023px) 700px, (max-width: 1279px) 950px, 1232px" src="https://july-h5kf3.github.io/p/breaking-modality-heterogeneity/SplitQ_fig2.png" width="400"&gt;&lt;/p&gt;&#10;</description></item><item><title>[2026 ICML] OSAQ: Outlier Self-Absorption for Accurate Low-bit LLM Quantization</title><link>https://july-h5kf3.github.io/p/osaq/</link><pubDate>Wed, 26 Aug 2026 08:42:00 +0800</pubDate><guid>https://july-h5kf3.github.io/p/osaq/</guid><description>&lt;p&gt;目前针对大语言模型中存在的系统性异常值问题，现有方法主要依赖层内乘法变换来抑制异常值，包括:&lt;/p&gt;&#10;&lt;ol&gt;&#10;&lt;li&gt;缩放:如AWQ，SmoothQuant等方法通过激活分布特征对权重进行缩放&lt;/li&gt;&#10;&lt;li&gt;旋转:如QuIP等方法通过正交矩阵旋转权重矩阵&lt;/li&gt;&#10;&lt;/ol&gt;&#10;&lt;p&gt;然而这些方法在极低比特量化时，性能仍远未达到理想水平，表明单一乘法策略在根本上不足以充分处理异常值问题。&lt;/p&gt;&#10;&lt;p&gt;本方法基于如下发现:&lt;/p&gt;&#10;&lt;p&gt;&lt;img class="gallery-image" data-flex-basis="749px" data-flex-grow="312" height="412" loading="lazy" sizes="(max-width: 767px) calc(100vw - 30px), (max-width: 1023px) 700px, (max-width: 1279px) 950px, 1232px" src="https://july-h5kf3.github.io/p/osaq/OSAQ_fig1.png" srcset="https://july-h5kf3.github.io/p/osaq/OSAQ_fig1_hu_fb257bb2ca2760d2.png 800w, https://july-h5kf3.github.io/p/osaq/OSAQ_fig1.png 1286w" width="1286"&gt;&lt;/p&gt;&#10;&lt;p&gt;即任务损失关于权重的Hessian矩阵具有低秩一致性，即&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;特征值沿特定方向趋于0零&lt;/li&gt;&#10;&lt;li&gt;对应的特征向量构成稳定的零空间&lt;/li&gt;&#10;&lt;li&gt;该零空间在不同输入样本间保持高度一致&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;而我们知道，通过泰勒展开，我们可以知道权重收到扰动时，任务损失L关于权重的二阶泰勒展开可以写作:&#10;&lt;/p&gt;&#10;$$&#10;\mathbb{E}[L(w+\Delta w)-L(w)]\approx\frac{1}{2}\Delta w^\top H_w \Delta w&#10;$$&lt;p&gt;&#10;而我们又发现$H_w$具有低秩一致性，因此根据零空间的定义，用$H_w$乘以零空间中的任意向量都会得到零。因此，通过对这些零空间向量进行加权组合，我们可以构造出$\Delta w$。这使得一种加性变换成为可能，并且保证损失保持不变:&#10;&lt;/p&gt;&#10;$$&#10;W' = W +\Delta W\quad s.t. \quad \Delta w^\top H_w \Delta w = 0&#10;$$&lt;p&gt;&#10;基于这个发现，我们旨在构建一个由低秩结构引导的$\Delta w$，对权重执行加性变换，从而实现异常值的子吸收，同时保持模型的性能。&lt;/p&gt;&#10;&lt;p&gt;给定一个权重矩阵$W\in \mathbb{R}^{M\times N}$,其中M表示输出通道维度，N表示输入通道维度，$\Delta W$的构造过程如下所述:&lt;/p&gt;&#10;&lt;ol&gt;&#10;&lt;li&gt;零空间提取: 首先我们对Hessian矩阵$H_w$进行特征分解，并按照特征值幅度的非递减顺序进行排序，如下所示:&lt;/li&gt;&#10;&lt;/ol&gt;&#10;$$&#10;H_w = V \text{diag}(\lambda_1,\dots,\lambda_N)V^\top,\quad 0\leq \abs{\lambda_1}\leq \abs{\lambda_2}\leq \dots \leq \abs{\lambda_N}&#10;$$&lt;p&gt;其中$V\in \mathbb{R}^{N\times N}$是特征矩阵,$\lambda_1 ,\dots,\lambda_N$是矩阵的特征值。我们采取尾部能量累积的策略，从最小的特征值开始累加，得到前缀能量，并将零空间维度确定为满足累积尾部能量达到预设阈值时的最小K:&#10;&lt;/p&gt;&#10;$$&#10;\mathcal{N}=V^\top_{[:,0:K-1]},\text{where}\quad K=\min_k \{\sum_{i=1}^k \abs{\lambda_i} \geq \gamma \sum_{i=1}^N\}&#10;$$&lt;p&gt;&#10;其中$\gamma \in (0,1)$是尾部能量阈值，$\mathcal{N}\in \mathbb{R}^{N\times K}$表示矩阵$H_w$的零空间，其中每一行对应一个特征方向，在该方向上$H_w$表现出近似消失的曲率。&lt;/p&gt;&#10;&lt;ol start="2"&gt;&#10;&lt;li&gt;$\text{softmax}-\infty$目标近似：在获取了Hessian矩阵的零空间后，我们引入了一个权重系数矩阵$\beta \in \mathbb{R}^{N\times K}$,用于为每个零空间中的每个向量分配权重，从而构造$\Delta w$：&lt;/li&gt;&#10;&lt;/ol&gt;&#10;$$&#10;\Delta W = \beta \mathcal{N}&#10;$$&lt;p&gt;​&#9;我们希望构造出来的$\Delta W$能够最小化施加加性扰动后权重的数值范围，我们可以通过最小化下式达到目标:&#10;&lt;/p&gt;&#10;$$&#10;\min_{\beta}||W+\Delta W||_{\infty} = \min_{\beta}||W+\beta \mathcal{N}||_{\infty}&#10;$$&lt;p&gt;&#10;其中$x=[x_1,\dots,x_n]^\top,\quad ||x||_{\infty} = \max_{1\leq i \leq n}\abs{x_i}$.显然无穷范数不可微，为了解决这个问题，我们采用$\text{softmax}-\infty$近似:&lt;/p&gt;&#10;&lt;p&gt;我们沿着输出通道维度应用softmax操作:&#10;&lt;/p&gt;&#10;$$&#10;s_{ij} = \frac{\exp{(\abs{W_{ij}}/\tau)}}{\sum_{t=1}^N \exp(\abs{W_{it}}/\tau)}&#10;$$&lt;p&gt;&#10;其中,$i=1,\dots,M,\quad \tau &gt; 0$是温度系数。当它较大时，它能够捕捉所有分量的平均行为；而当$\tau \to 0^+$时，它会越来越强调极端峰值。&lt;/p&gt;&#10;&lt;p&gt;在这种情况下，对这些被“峰值强调”的参数施加$\mathcal{l}_2$范数，便可以作为$l_{\infty}$的一种近似，从而有效地识别并抑制异常值。&lt;/p&gt;&#10;&lt;ol start="3"&gt;&#10;&lt;li&gt;$\beta$的显式解: 接下来我们来显式解决上述优化问题。经过$\text{softmax}-\infty$近似后我们可以把优化目标写作如下形式，特别地，由于量化的scale和zero-point都是沿着输出通道维度计算的，因此我们给出每个输出通道对应的$\mathcal{l}_2$范数优化目标:&lt;/li&gt;&#10;&lt;/ol&gt;&#10;$$&#10;\min_{b_i}\frac{1}{2}\sum_{j=1}^{N}s_{ij}(W_{ij}+b_i^\top \mathcal{n}_j)^2 + \frac{\mu_1}{2}||b_i||_2 + \frac{\mu_2}{2}(b_i^\top v)^2&#10;$$&lt;p&gt;​&#9;其中:&#10;&lt;/p&gt;&#10;$$&#10;b_i = \beta[i,:] \in \mathbb{R}^{K},\\&#10;n_j = \mathcal{N}[:,j] \in \mathbb{R}^{K},\\&#10;v = \mathcal{N}1_{N} \in \mathbb{R}^{K}&#10;$$&lt;p&gt;&#10;上式中第一项是主要的优化目标，作用是最小化施加加性扰动后权重的数值范围；第二项是关于$b_i$的正则化项，防止过大的修正；第三项施加了一个反平移约束，用于惩罚整个通道沿同一方向发生一致平移。&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;Remark&lt;/strong&gt;：这个第三项约束是为了避免第 i 个输出通道的整行权重整体发生同方向平移。它希望$\sum_{j=1}^N \Delta w_{ij} \approx 0$&lt;/p&gt;&#10;&lt;p&gt;求解上述最优化方程（对$b_i$求导，并令一阶最优性条件为零），可以得到:&#10;&lt;/p&gt;&#10;$$&#10;A_ib_i = -\rho_i&#10;$$&lt;p&gt;&#10;其中&#10;&lt;/p&gt;&#10;$$&#10;A_i^* = \sum_{j=1}^N s_{ij}n_j n_j^\top + \mu_1 I_K +\mu_2 v v^\top,\quad \rho_i = \sum_{j=1}^N s_{ij}W_{ij}n_j&#10;$$&lt;p&gt;&#10;因此，我们可以得到最优的系数矩阵$\beta$：&#10;&lt;/p&gt;&#10;$$&#10;\beta^* = [b_1^*,\dots,b_M^*]^\top,\quad b_i = -A_i^{-1}\rho_i,i = 1,\dots,M&#10;$$</description></item></channel></rss>