<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>ARCQuant on Lorn</title><link>https://july-h5kf3.github.io/tags/arcquant/</link><description>Recent content in ARCQuant on Lorn</description><generator>Hugo -- gohugo.io</generator><language>zh-cn</language><lastBuildDate>Wed, 26 Aug 2026 08:57:00 +0800</lastBuildDate><atom:link href="https://july-h5kf3.github.io/tags/arcquant/index.xml" rel="self" type="application/rss+xml"/><item><title>[2026 ACL] ARCQuant: Boosting NVFP4 Quantization with Augmented Residual Channels for LLMs</title><link>https://july-h5kf3.github.io/p/arcquant/</link><pubDate>Wed, 26 Aug 2026 08:57:00 +0800</pubDate><guid>https://july-h5kf3.github.io/p/arcquant/</guid><description>&lt;p&gt;目前把使用NVFP4对大语言模型进行PTQ有一下难点:&lt;/p&gt;&#10;&lt;ol&gt;&#10;&lt;li&gt;NVFP4格式与现有的权重-激活值PTQ方法不兼容:&#10;&lt;ol&gt;&#10;&lt;li&gt;旋转类方法，如QuaRot等会把异常值能量扩散到所有块，破坏NVFP4本身块隔离优势，反而放大局部动态范围&lt;/li&gt;&#10;&lt;li&gt;平滑类方法，如Smoothquant等在低比特下几乎失效&lt;/li&gt;&#10;&lt;/ol&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;混合精度方案硬件不兼容，Tensor Core要求数据格式统一，采用混合精度必然导致模型吞吐量下降&lt;/li&gt;&#10;&lt;/ol&gt;&#10;&lt;p&gt;&lt;img class="gallery-image" data-flex-basis="560px" data-flex-grow="233" height="694" loading="lazy" sizes="(max-width: 767px) calc(100vw - 30px), (max-width: 1023px) 700px, (max-width: 1279px) 950px, 1232px" src="https://july-h5kf3.github.io/p/arcquant/ARCQuant_fig1.png" srcset="https://july-h5kf3.github.io/p/arcquant/ARCQuant_fig1_hu_12eee242b1ba6472.png 800w, https://july-h5kf3.github.io/p/arcquant/ARCQuant_fig1_hu_e473259efb48afdc.png 1600w, https://july-h5kf3.github.io/p/arcquant/ARCQuant_fig1.png 1620w" width="1620"&gt;&lt;/p&gt;&#10;&lt;p&gt;如图所示，虽然基于旋转矩阵的方法可以降低全局峰值，但是会显著增加原本低幅值 block 的局部动态范围。这个影响抵消了细粒度 scaling 原本带来的离群值隔离优势。导致在NVFP4上效果不佳。&lt;/p&gt;&#10;&lt;p&gt;为了解决上述问题，ARCQuant提出了一个“不改动数值格式，不混合精度，不旋转矩阵”的NVFP4量化框架。&lt;/p&gt;&#10;&lt;p&gt;具体实现如下:&lt;/p&gt;&#10;&lt;ol&gt;&#10;&lt;li&gt;离线选出&amp;quot;必须补偿&amp;quot;的异常通道:用校准集统计每层激活的通道最大值，按绝对值降序重排；以FP8（E5M2）动态范围作为参考，设阈值$\tau = 2^{-3}M$，只取超过该阈值的前S条通道作为&amp;quot;残差通道&amp;quot;。&lt;/li&gt;&#10;&lt;li&gt;对输入X先重拍然后进行量化得到$Q_x$,然后对选出来的残差通道计算残差:$R_o = X_o - s_{X_o}\cdot Q(X_o)$,再把$R_o$用同一NVFP4格式量化为$Q_{R_o}$.最后把$Q_x$和$Q_{R_o}$在通道维度拼接，得到增广激活矩阵:$Q_{Xaug}=[Q_x|Q_{R_o}]\in \mathbb{R}^{N\times (K+S)}$.之后权重侧离线做对称处理:把对应 S 条权重复制一份，拼接成 $Q_{Waug}=[Q_W∣Q_{Wo}]$。&lt;/li&gt;&#10;&lt;li&gt;最后矩阵乘法格式与NVFP4 Tensor Core所需格式完全相同:$Y = s_{Xaug} \cdot Q_{Xaug}\cdot(s_{Waug}\cdot Q_{Waug})^\top$。全程保持数据格式一致，可直接调用 CUTLASS/cuBLAS，无需改内核循环。&lt;/li&gt;&#10;&lt;/ol&gt;&#10;&lt;p&gt;&lt;img class="gallery-image" data-flex-basis="784px" data-flex-grow="326" height="486" loading="lazy" sizes="(max-width: 767px) calc(100vw - 30px), (max-width: 1023px) 700px, (max-width: 1279px) 950px, 1232px" src="https://july-h5kf3.github.io/p/arcquant/ARCQuant_fig2.png" srcset="https://july-h5kf3.github.io/p/arcquant/ARCQuant_fig2_hu_1aa65e2f8423e208.png 800w, https://july-h5kf3.github.io/p/arcquant/ARCQuant_fig2.png 1588w" width="1588"&gt;&lt;/p&gt;&#10;</description></item></channel></rss>