AMAZINGINDEX.COM 日报快照
50.8
VOL. 2026.08
2026.08.05
← 返回 2026.08.05 日报
日报快照 · Daily Snapshot
NO. 023

蒸馏时教师偷看答案,学生考试翻车

#HF_PAPERS HuggingFace Papers 2026.08.05
推荐指数 80.0 NO. 023 · 2026.08.05
upvotes54comments2

DAPD 提出双锚定策略蒸馏框架,解决 on-policy 蒸馏中教师利用特权信息导致学生推理时产生"特权幻觉"的问题。对做模型后训练的团队有直接价值,能避免蒸馏出来的模型在部署时性能断崖下跌。

蒸馏时教师偷看答案,学生考试翻车

这个"特权幻觉"问题在工业界其实很常见但很少被系统性地讨论——比如教师模型在 RLHF 阶段能看到完整的 reward model 信号或额外的推理链标注,学生模型蒸馏后却只能在裸文本上推理,行为模式对不齐。DAPD 的双路径锚定本质上是用自条件桥接强制对齐训练和推理时的信息边界,这和之前 Stanford 的 Speculative Decoding 那类"教师加速"思路不同,这里聚焦的是行为一致性而非速度。

实验部分如果能在公开的 instruct 模型上复现,价值会更高。目前论文只给了理论框架和初步验证,建议关注作者是否会在 TRL 或 transformers 里放出实现,做 SFT/RL 管线优化的团队可以直接集成到现有的 distillation 流程中。

查看原文 →