什么是模型蒸馏中的软标签?

模型蒸馏中的软标签,是教师模型对一个样本输出的完整概率分布,而不是仅保留“正确类别”这一结果。比如,教师模型判断某张图片属于猫、狗、兔子的概率分别为 0.7、0.25 和 0.05,这组概率就是软标签;若只记录“猫”,则属于硬标签。

软标签的价值在于,它不仅表达答案,还保留了类别之间的相似性与不确定性。猫的概率明显高于狗,狗又明显高于兔子,说明教师模型认为前两者可能共享某些视觉特征。学生模型拟合这种分布时,学习到的不只是“该选哪一类”,还包括“其他类别为什么不太可能”的结构信息。相比单一的硬标签,这类信息通常更适合传递教师模型的判断倾向。

温度如何改变软标签

蒸馏训练中常用温度参数调整输出分布的平滑程度。温度升高后,原本集中的概率会变得更平滑,次优类别的差异更容易显现;学生模型因此能够观察到更丰富的类别关系。温度过低,分布可能接近硬标签,软信息不足;温度过高,则可能削弱教师模型的区分能力,因此不能简单理解为越高越好。

实际训练时,软标签通常与真实标签共同参与损失计算。软标签负责传递教师模型的“相对判断”,真实标签则提供明确的任务目标。两者的损失权重需要结合学生模型容量、数据情况和目标任务调节。若学生模型过小,即使软标签信息充分,也可能因表达能力不足而难以复现教师模型的决策边界。

判断软标签是否真正有效

评估蒸馏效果不能只看总体准确率。还应观察学生模型在错误样本上的表现、置信度是否合理,以及部署环境中的延迟和内存占用。一个学生模型即使准确率接近教师模型,也可能在困难样本上过度自信。更稳妥的做法是先以合适容量的学生模型建立基线,再逐步调整温度、软硬标签损失权重,并用验证集比较不同组合。

因此,软标签并不是教师模型简单输出的“答案备份”,而是对其预测结构的压缩表达。模型蒸馏的关键,也不在于盲目缩小模型,而在于让学生模型以有限容量尽可能保留教师模型的判断信息。

参与讨论

0 条评论

延伸阅读