校准数据为何决定量化成败?

量化失败,往往不是因为位宽选错,而是校准数据没有真实反映模型上线后的输入。后训练量化需要借助一批样本观察激活值的分布,再把原本的浮点表示映射为更短的整数表示。这个映射若建立在失真的样本上,模型即使参数没有明显问题,推理时也可能因数值范围不匹配而出现精度下降。

校准数据的关键不在“有没有”,而在“像不像”。随手抽取的少量样本,若只覆盖了单一场景、单一输入特征,得到的激活范围就可能过窄或过宽。范围过窄,真实输入中的较大值容易被截断;范围过宽,有限的整数表示会被分散使用,细微差异难以保留。两种情况都会放大量化误差。

校准集应服务于部署场景

用于边缘摄像头的模型,校准样本应尽量覆盖实际设备会遇到的画面变化;用于语音识别的模型,则应覆盖目标使用中的典型声音条件。这里追求的不是训练集的规模,而是输入分布的代表性:常见情况不能缺席,容易导致异常响应的边界情况也不应完全遗漏。

校准还应与量化策略联动。按通道量化通常比按层量化更稳,尤其面对卷积层时,不同通道的数值分布未必一致;若校准样本不足,这种差异就更难被正确捕捉。先以较高精度或混合精度观察影响,再逐步压缩,通常比直接把模型降到较低位宽更容易定位问题。

最终判断不能只看转换是否成功,而要在目标设备上验证准确率、延迟、内存与功耗表现。校准数据不是量化流程里的附属材料,而是决定“压缩后模型仍然像原模型一样工作”的基础。

参与讨论

0 条评论

延伸阅读