结论

Amazon Web Services 与伊利诺伊大学香槟分校团队于上海时间 9 月 3 日 01:03(对应 arXiv 显示的 2 Sep 2026 17:03 UTC)公开预印本 Cliff,提出仅以首次错误为界的极简过程奖励:不再逐 Token 精细打分,而是用教师模型判定每条轨迹首次出错位置,将轨迹分为正确前缀与错误后缀并据此重分配 Token 级优势。在数学与编程 12 个场景的对比中,该方法较同门槛的 On-Policy Distillation 平均提升约 15%、较标准 GRPO 提升约 7%。论文为预印本,尚未同行评审,结论限于作者受控实验条件。

方法与评估条件

Cliff 基于 GRPO 扩展。训练时对每组查询采样 N 条轨迹,先让教师独立生成参考解并经自动可验证器检验,仅保留教师自解正确的组;再让教师逐条判断学生轨迹是否正确,若错误则标出首次错误的句子索引 Pitfall Step p(a)。随后将二值结果奖励转化为 Token 级优势:正确轨迹为 Acor,错误轨迹中 p(a) 之前的 Token 获 λ·Acor,p(a) 及之后获 Ainc,再减去组内零均值偏移 b。作者在验证中固定 λ=0,超长截断轨迹设 p=0。教师包括 SOTA 前沿模型、Qwen3-32B 与 Gemma3-27B;学生为经 OpenThoughts 监督微调后的 Qwen3-4B-Base 及 Phi-4-mini-Instruct。

数据范围与实验设计

训练与评估覆盖两域:数学使用 DAPO-math-17k 处理版,编程使用 Deepcoder,评测涵盖 GSM8K、MATH-500、DAPO、AIME、CodeContests、LiveCodeBench 等 12 个基准。对照基线包括 vanilla GRPO、GRPO with Teacher(仅用教师判断整条轨迹正误)、Supervised Distillation 与跨分词器的 On-Policy Distillation。教师判断质量另以 DAPO-Math 上 100 条(50 正 50 误)人工标注的 Pitfall Step 为尺子,衡量参考解准确率、与自动验证器一致性及与人类的 p-dis 句距。

主要结果

在全部 12 场景与全部三类教师下,Cliff 均取得最好结果。以 Qwen3-4B 为例,SOTA 教师下 Cliff 在数学平均与编程平均上分别达到 65.66 与 25.96,显著高于同教师的 GRPO(62.37/24.83)与 OPD(58.17/20.38);Qwen 与 Gemma 教师下优势方向一致。GRPO with Teacher 仅较 vanilla GRPO 微幅提升,说明增益主要来自首次错误分段而非单纯引入教师。教师判断本身:SOTA 教师参考解准确率最高且 p-dis 最小;Qwen3-32B、Gemma3-27B 求解准确率较低但判断仍可靠,有验证参考时判断准确率超 90%、平均 p-dis 约 3 句,且假阳性极低、假阴性约 10% 含部分验证器误判。去掉真值过滤后,强教师性能基本不变,弱教师约下降 2% 仍常优于 vanilla GRPO。

局限与待验证点

作者明确该结果为预印本单次轨迹、固定超参与 3 种子抽样的描述性对比,非跨种子统计显著性检验。范围上仅验证两类小规模学生与两域可验证任务,未覆盖对话、工具使用、长上下文或非二值奖励场景;二值奖励对代码需全部测试通过才计 1,可能掩盖部分正确。策略上依赖教师参考解质量与筛选阈值,弱教师在无筛选时引入噪声;λ 取值与超长截断规则对长度与稳定性敏感,λ=0.5 可持平而 λ=1.0 引发长度攻击与回退。基准中 OPD 对同分词器与相似推理模式更友好,跨分词器 OPD 已处劣势,比较基线选择影响相对提升幅度。

研究状态与潜在意义

该工作以预印本形式于 2026 年 9 月 3 日上海时间首次公开,标注 Preprint, under review,尚未经同行评审与独立复现。其意义在于为 RLVR 提供了无需训练专用过程奖励模型的极简替代:只要教师能可靠定位首次错误,即可将稀疏结果奖励转化为稳健的 Token 级监督,且对教师能力要求相对宽松。若在更广模型规模、奖励形态与真实无真值场景中复现,将有助于提升长链推理训练的样本效率与信用分配稳定性,但不宜直接解读为已确立通用的因果或普适最优解。