[LG]《Reference-Based Distillation Detection in LLMs》R Rawat, S Chen, A Anand, M Duan… [UC Berkeley] (2026)
在模型审计领域,检测一个大语言模型是否通过「知识蒸馏」(即在更强模型的输出上训练)获取能力是一个悬而未决的难题。过去的方法受困于对候选模型行为的孤立判断,本质原因是现代模型谱系高度交织且蒸馏过程(如提示词、过滤机制)极度不透明,导致传统的成员推理指标在大规模模型面前几乎失效。
本文的核心洞见是:把蒸馏检测重新看作一种基于「参考点」的相对偏移测量。由此,引入一个同系列早期版本的参考模型,通过对比目标学生模型与参考模型在解释候选老师输出时的「似然度增益」这一关键操作,成功抵消了提示词和数据分布的干扰,甚至能通过非 ASCII 字符的编码特征识别出 o1 系列模型的独特印记。
这项工作真正留下的遗产是证明了即使在黑盒准入和复杂蒸馏流程下,模型行为审计依然具有高度的可行性。它为后来者打开的新门是建立了一套量化模型知识溯源的统计框架,并初步揭示了 QwQ、DeepSeek-R1 等前沿模型间的潜在演化关系,但尚未跨过的门槛是多老师混合蒸馏以及经过深度重写后的复杂蒸馏场景下的精准归因。
arxiv.org/abs/2607.09692 机器学习 人工智能 论文 AI创造营








