核心结论

浙江大学团队以预印本 Reconciling Process Supervision with Outcome-Based Credit in Agentic Policy Optimization(arXiv:2608.31077v1,首次公告归属 2026-09-01 上海日历日,对应 31 Aug 2026 16:51 UTC)在三项长程智能体任务中证明:将训练时特权信息(PI)对齐至目标轨迹的执行前历史,并在可执行动作级聚合其似然偏移以重分配验证结果的 GRPO 优势,可稳定提升长程信用分配的准确性与效率。核心结果为较匹配的 GRPO 平均提升 10.6%,在 ALFWorld 上对三款骨干平均提升 16.9% 且泛化至未见任务。该结论为作者受控实验报告,尚未经同行评审与独立验证。

方法与评估条件

方法 TASPO 分两步。第一步构造轨迹对齐的 PI:从同任务同组中验证成功的兄弟轨迹中抽取条件化指导项(任务要求、顺序约束、有效替代及其源证据),仅当目标轨迹的已记录动作-观测历史满足条件时保留,否则弃用并回退至原始 GRPO。第二步计算动作级相对支持:以冻结的 rollout 策略对同一采样响应分别在有无 PI 条件下打分,计算 token 级对数似然差 Δ,经幅度阈值 κ 过滤后在可执行动作的 token 跨度上均值聚合得到动作分 d,经轨迹内均值中心化得到相对分,再按优势符号经 tanh 温度缩放与均值保持转换为权重 w∈[1-εw,1+εw],使 tilde A= A·w 保持符号与轨迹均值不变。优化仍使用 GRPO token 损失,仅将轨迹级优势替换为 turn 级优势,无需额外环境交互。

数据范围与主要结果

评估覆盖三类域:ALFWorld 六家族(Pick、Look、Clean、Heat、Cool、Pick2,140 见/134 未见)、WebShop 128 固定任务(报告归一化分与成功率)与 Search-QA 七数据集(NQ、TriviaQA、PopQA、HotpotQA、2WikiMultiHopQA、MuSiQue、Bamboogle,在 NQ 与 HotpotQA 上训练、七集上测 EM)。骨干为 Qwen2.5-3B/7B-Instruct 与 Qwen3-1.7B-Instruct,主配置为每任务 8 轨迹、批量 16(Search-QA 128)、最大交互 50/15/4 步、学习率 1e-6、三种子平均,分析器默认 DeepSeek-V4-Pro。主要结果为一致提升与更快收敛;PI 构造消融与粒度消融分别验证对齐与动作级聚合的必要性;与 OPSD、外部教师 OPD(Qwen2.5-7B 与 Qwen3-32B 教师)及 GRPO+OPSD 直接组合的对比表明,以 PI 仅重分配 outcome 信用比引入独立蒸馏目标更稳定有效。

局限与不确定性

作者与正文明确以下边界:预印本工作仍在进行中,未发表于期刊或会议;基准与骨干规模有限,交互预算与评估划分为受控设置;PI 覆盖率受同组成功率限制,阈值与有界重分配超参未在更广温度与长上下文中充分检验;成功轨迹平均步数与奖励平滑性为受控域内指标;OPI 教师相关对比显示不同 PI 源与粒度会显著改变结果,局部提升与模拟节省不应外推为普遍、因果或已获学界认可的事实。

同行评审状态与潜在意义

该工作当前为预印本,未经同行评审,引用与应用应标注为未同行评审并等待独立复现。其意义在于为长程智能体强化学习提供一种不以特权监督替代验证结果、而以其精细化信用再分配的路径,在不增加环境交互与外部教师的前提下提升样本效率与稳定性,为后续设计可验证、可对齐的密集监督与更可靠的长程信用分配提供了可复现基线,但在规模化部署前仍需同行评审、独立验证与安全性评估。