结论先行

清华大学、中国科学院大学、东北大学、伊利诺伊大学厄巴纳-香槟分校与约翰斯·霍普金斯大学团队于 9 月 4 日(Asia/Shanghai,对应 arXiv 记录 2026-09-03 17:54:38 UTC)公开预印本《Rethinking On-Policy Distillation of Large Language Models II: One Training Example》,系统检验单条查询在在策略蒸馏(OPD)中的作用。核心发现是单查询即可在数学推理、代码生成、指令跟随与智能体工具调用四域恢复全量训练约 87% 的增益,原因在于状态覆盖已达 71.5%,而 16 条语义多样查询达 98.9% 并完全匹配全量表现;同时吸收率随训练持续下降且与数据量无关,因此 OPD 属于“数据过量、算法挨饿”。该结论为作者实验条件下的相关性发现,属预印本未同行评审,需独立复现方可推广。

研究对象与方法

研究聚焦 OPD 中训练数据的作用,以“单查询极端”解耦数据供给与算法吸收。学生-教师对包括 DeepSeek-R1-Distill-Qwen-1.5B/JustRL-1.5B、Llama-3.2-3B/GT-Llama-3B-Math、OLMo-3-7B 等三家族;在 DAPO-Math-17K、Open-R1 Codeforces、UltraData-SFT-2605、xLAM-function-calling-60K 上以 veRL 实现 OPD,数学域采用 top-k(k=16)优势、其余域采用采样优势,batch 64、AdamW 学习率 1e-6、温度 1.0。提出状态覆盖度量:以教师最后层隐向量经 PCA 后 K=200 聚类,统计某查询集 rollouts 覆盖全量运行状态簇的比例;并定义距离 dt 与吸收率 vt 跟踪师生分歧的缩小速度,在多教师蒸馏(MOPD)与内容轻量/跨域查询上做对照。

数据范围与评估条件

数学推理在 MATH-500、AMC 2023、AIME 2025 上以 avg@16 评估,代码生成在 LiveCodeBench v6 以 avg@3 与执行评测,指令跟随在 Multi-IF 三轮对话,工具调用在 BFCL v3。单查询在数学域选取易/中/难三条(学生 8 次采样通过率 8/8、4/8、0/8),其余域随机采样;对比组包括 1、4、16 与全量 17K 查询及固定 64 轨迹的离策略对照,评估预算为 300–1000 步,覆盖与准确率在同预算下比较。开源代码已发布于 Thinking-Space/One-Shot-OPD 仓库。

主要结果

  • 单查询数学平均 68.5 分 vs 全量 69.8 分,恢复 87% 全量增益、69% 师生差距,1000 步仍维持 62%–89% 区间;在易/中/难查询、不同长度与温度下稳健,跨三家族分别从 77.1/28.2/70.8 提升至 85.5/40.2/82.4;代码、指令、工具域分别恢复 73%、66%、64% 师生差距。
  • 状态覆盖:单查询 300 步达 71.5%(100 步已达 65.9%),16 语义多样查询达 98.9% 并匹配全量;离策略轨迹数与语义多样性单独提升覆盖与准确率,固定查询集的顺序不影响;MOPD 中每域 16 条多样查询恢复全量的 101%(数学 93%、代码 136%、指令 109%)。
  • 算法吸收:四种数据量下的吸收率均对数式下降,300 步内消除 78%–84% 的 step-30 剩余距离;固定状态集的离策略单查询仍需约 200 步才停止增益;内容轻量模板与 WildChat 跨域查询仍接近真实查询基线,任务内容与状态覆盖可分离;与单查询 RLVR 对比,OPD 的 token 级稠密信号在查询解出后仍持续,1000 步增益超 RLVR 两倍。

局限与不确定性

作者在第 9 节明确局限:仅检验有限模型规模与四域受控基准,未覆盖更大模型、真实用户分布或长程交互;度量依赖特定表示与聚类实现,结论对度量选择敏感;空模板与跨域有效性仅在所用模板与 WildChat 子集上验证;同行评审缺失,成果为基准内相关性与模拟环境提升,不应解读为普遍因果、生产级收益或已获学界共识。后续需在更广模型、更多领域与真实任务上独立验证吸收率与覆盖度量的稳健性。

同行评审状态与潜在意义

截至 9 月 4 日该文为 arXiv 预印本 v1,未经期刊或会议同行评审,亦无独立第三方复现报告。若被验证,其意义在于重定向数据策展从“收集更多题目”转向“诱发更多有效状态”,并推动改进 OPD 的步效与采样策略;对中国开发者而言,少量多样查询即可接近全量的发现可降低后训练数据成本,但需在自有数据与模型上复测覆盖度量与吸收效率,不宜直接外推至所有任务或规模。