解决蒸馏中的特权幻觉问题
推荐指数 67.0 NO. 020 · 2026.07.02
upvotes75comments1
为什么值得看
DOPD 提出动态路由机制,根据优势差距和概率在教师与学生策略间分配 token 级监督信号,避免特权信息导致的蒸馏失效。该方案直接提升大模型和视觉语言模型的能力迁移效率,对正在做模型蒸馏压缩的团队有参考价值。
媒体预览
编辑判断
特权幻觉这个命名很准——之前给教师或学生塞额外信息做蒸馏的团队,大概率踩过这个坑但没意识到是系统性问题。DOPD 的动态路由本质上是用优势估计做信用分配,这跟 PPO 里的 advantage baseline 思路同源,但首次用到了蒸馏场景。
论文没放开源链接,复现成本取决于策略模型的规模。如果你在用 GRPO 或 PPO 做 post-training 蒸馏,建议等代码 release 后对比下静态监督基线,token 级路由的 overhead 在工程上是否划算需要实测。