QUESTION

模型蒸馏中的教师模型、学生模型和软标签是什么?

A

学生模型同时学习真实标签和教师模型的概率分布,以较小体积保留更多类别关系信息。

DETAILED ANSWER

直接结论

模型蒸馏是一种模型压缩方法:让体积较小的学生模型,不仅学习数据集提供的真实标签,还学习大型教师模型输出的概率分布。训练完成后通常只部署学生模型。

教师模型和学生模型

  • Teacher:效果较好但参数量和推理成本较高的教师模型。
  • Student:参数更少、速度更快、准备实际部署的学生模型。

学生通常同时学习两种监督信号:

真实标签损失
+
教师输出的蒸馏损失
=
学生模型总损失

硬标签和软标签

假设真实类别是“猫”。硬标签只告诉模型唯一答案:

猫:1
狗:0
老虎:0

教师模型可能输出:

猫:0.80
狗:0.05
老虎:0.15

这组软标签除了说明“猫”最可能,还表达“猫和老虎比猫和狗更相似”这样的类别关系。

温度参数有什么作用

温度T用于调节教师输出分布的平滑程度。适当提高温度,可以让非最高类别的概率关系更加明显,使学生获得比硬标签更丰富的信息。

蒸馏不保证学生一定达到教师效果,它是在模型体积、推理速度和性能之间做权衡。

面试口述

模型蒸馏是让小型学生模型学习大型教师模型知识的一种压缩方法。学生不仅学习真实标签,还学习教师模型经过温度调节后的软标签,从而获得类别之间的关系信息。训练完成后通常只部署学生模型,在尽量保留性能的同时降低参数量和推理成本。