新闻
通过交互解释大型语言模型知识蒸馏的统一方法
1 分钟阅读
来源:arXiv ML
arXiv:2607.08776v1 公告类型:新 摘要:尽管知识蒸馏(KD)在大型语言模型(LLM)中取得了成功,但其功效背后的潜在机制仍不清楚。在本文中,我们提出了一种统一的方法来探索使用交互的各种 KD 方法的共同机制。具体来说,我们将法学硕士的输出分数分解为众多交互的总和。每个交互都代表涉及一组输入变量(例如单词)的非线性关系。基于分解的交互,我们发现各种 KD 方法背后的共同机制是交互的稀疏化,即学生模型保留较少的交互