结论

普渡大学团队于上海时间 2026 年 9 月 1 日 00:22(UTC 8 月 31 日 16:22)以预印本首次公开研究《Does On-Policy Distillation Really Distill?》,系统揭示在位蒸馏(OPD)中教师监督高度噪声且规模越大噪声越高,并提出无监督的在位自适应方法 OPSA,仅对低 logp 的 20% token 施加熵自适应负优势,即可在 Qwen3-1.7B 上将 AIME24 Avg@32 提升 35.41 分、相对增幅 263% 并超过标准 OPD 16.77 分。该成果为预印本,未经同行评审,评估限于特定模型与数学推理任务。

方法与评估条件

研究将 OPD 形式化为在学生采样前缀上优化学生与教师的反向 KL,以 token 级优势 Ai=log πt/πs 训练。为量化噪声,作者将噪声定义为 boxed 最终答案上优势符号与验证奖励不一致(正确给负或错误给正),在 DAPO-17k 中对每题各采样一正一错的 Qwen3-1.7B 响应(共 500 题)进行测量,教师分别采用 Qwen3-4B/30B-A3B/235B-A22B-Instruct。对照实验比较全量 OPD、仅含噪轨迹与仅无噪轨迹,并进一步限制训练至低 logp token 与固定优势(-0.5 与 +0.2)以分离 token 与信号的作用,随后提出熵自适应负优势(δ 控制熵与优势幅度的正负相关)并构建 OPSA,训练目标仅更新 S_lowest20 集合内的 token,优势按 -1/2 - (Hi-Hmin)/2(Hmax-Hmin) 赋值,无需教师前向。

数据范围与主要结果

噪声分析显示显著且随规模递增的噪声:4B 教师噪声 30.6%,30B-A3B 34.7%,235B-A22B 约 50.6% 且对答案几乎全量赋负(正确 97.8%、错误 96.6%),反映学生轨迹对教师高度 off-policy。过滤实验显示三者性能相当,提示提升并非来自拟合教师。Token 分布分析发现 29.2% token 优势为零、51.7% 幅值低于 1e-4,且近零优势集中于学生高 logp token,仅训高 logp token 无论用真实或随机优势均无提升;在低 logp 20% 上以固定负优势训练即可达到与全量 OPD 相当的性能。OPSA 在 Qwen3-1.7B 上实现 AIME24 Avg@32 263%–307% 的相对提升、Pass@32 翻倍,熵正相关(δ=1)达 50.0% 显著超过 OPD 的 35.13% 与负相关变体;扩展到多模型家族与三基准均保持稳定优势,且因省去教师前向而降低训练时间与推理开销。

局限与不确定性

作者在附录明确局限:研究为 20 页预印本,未经同行评审或独立验证;噪声度量仅基于最终答案,无法评估中间步骤监督质量;OPSA 的低 logp 20%、熵归一区间与固定幅度在不同温度、长上下文与非数学任务中的鲁棒性尚未充分检验;报告的推理长度与梯度稳定性基于特定训练配置(thinking 模式关闭等),外推至更大模型、代码与开放域智能体任务需谨慎。相关性、局部基准提升与预印本结果不应视为普遍、因果或已获学界认可的事实。

是否同行评审与潜在意义

该工作当前状态为预印本(arXiv:2608.31046v1),尚未发表于期刊或会议,引用需标注为未同行评审。其意义在于质疑在位蒸馏对教师监督的依赖,提出无需外部监督、仅利用学生熵与低概率 token 的自改进路径,为强化学习可验证奖励稀疏、组内优势归零等不稳定问题提供轻量替代;普渡团队通过消融揭示尾部抑制与头部重分配可保持探索多样性,为长程推理中反思行为的涌现提供可操作解释。潜在应用包括低成本推理后训练与长程智能体探索优化,但在大规模部署前仍需同行评审、独立复现与安全性评估。