结论:斯坦福大学团队于上海时间2026年8月31日通过arXiv首次公开预印本Learning to Use Tools,核心结论是:在Countdown数学推理任务上,计算器工具集成与在线强化学习互补,Tool-DAPO在作者构造的1,024题held-out基准上将pass@1从Tool-SFT的35.8%提升至66.0%,匹配预算下工具集成较无工具RLOO带来约10个百分点的pass@1增益,且强化学习进一步鼓励有效工具调用。该结论来自作者在受控的Countdown流水线与固定SFT起点下的报告,尚未经同行评审或独立验证,不应视为普遍生产表现或已获学界共识。

研究对象与方法

研究针对大模型在多步数学推理中易出现算术错误与验证不足的问题,聚焦Countdown任务:给定3或4个数经算术运算得到目标值,答案需以<answer>表达式</answer>形式使用全部给定数且精确等于目标,终答可自动验证。方法上,作者将模型生成扩展为工具集成格式,允许以<tool>表达式</tool>发起计算器调用,环境返回<obs>=结果</obs>后再继续推理,训练时仅对模型可控部分计算策略损失;先以错误检测与SFT参考模型续写构造Tool-SFT数据,对含错误算术步的轨迹注入校正前缀并用最短正确延续补全,对已正确轨迹追加确认性调用,再在该策略上分别应用RLOO、RLOO++(全局优势归一化)、GRPO与DAPO(动态过滤零方差组、组内归一化与非对称裁剪)进行在线强化学习,仅以终答是否正确为奖励。

评估条件与数据范围

评估数据为作者新构造的1,024题fresh held-out Countdown基准,基于(target, sorted numbers)与训练集严格无重叠,以降低原50题公开集的高方差噪声,所有pass@k均以k次采样计算并报告95% bootstrap置信区间。比较基线包括无工具SFT、Tool-SFT、无工具RLOO及四种工具RL,共享相同RL超参、批量与组大小、采样温度、熵系数1e-3与KL系数,采样由vLLM完成、策略更新基于HuggingFace可训练策略;Tool观测作为环境输出不计入策略损失。硬件与时间为单H100,RLOO无工具100步约5.73小时、Tool-RLOO 100步约9.21小时、200步共16.15小时、Tool-DAPO 100步6.29小时,Tool-GRPO因偏离仅取30步。

主要发现(作者报告,未独立验证)

以下均为作者在设定条件下的报告结果,属相关性与局部基准发现,未经独立复现,不应写作普遍因果或行业通用水平。

  • SFT失败以算术与规划错误互补:计算错误在3数与4数题中均频繁,4数题中目标/规划错误显著增多,提示需同时提升精确计算与目标感知规划。 工具集成一致增益:匹配预算下Tool-RLOO较无工具RLOO在1,024题上pass@1 50.6%→56.6%、pass@16 66.6%→74.0%,扩展至200步达60.7%/76.5%,相对无工具提升约10个百分点;作者指出50题集区间重叠大、结论以1,024题为准。 RL方法分化:Tool-DAPO达66.0% pass@1,较Tool-SFT 35.8%提升30.2个百分点、较Tool-RLOO高约9.3个百分点,pass@16亦提升;其动态采样过滤60.7%全对或全错组使有效批次密度提升,100步即超越200步Tool-RLOO。Tool-RLOO++未稳定提升高k,Tool-GRPO仅在30步内有效,随后因保留零梯度组并除以不稳定组内标准差导致策略偏离、工具使用与奖励崩塌。 RL鼓励工具使用:Tool-RLOO训练中可执行工具调用均值从不足1次升至约1次/轨迹,准确率同步提升,正确轨迹在全正确组质量化分布中增多,而零正确组仍难改善,提示RL更多是提升已有正确轨迹采样概率。
作者强调:工具集成通过将算术验证外置减少计算与核对错误,而强化学习在仅有终答奖励时仍能增加有效工具调用与正确轨迹概率,但难以为始终零正确的困难提示创造新解。

局限与同行评审状态

该工作为arXiv:2608.28447v1预印本,于Fri 28 Aug 2026 15:35 UTC提交,按arXiv 14:00 UTC截点于Mon 31 Aug 2026 00:00 UTC(上海08:00)公告并归入cs.AI当日列表,视为上海当日首次公开,尚未经期刊或会议同行评审。关键限制见limitations,局部基准与模拟结果不得写作普遍因果或已获同行认可的事实。

  • 仅Countdown单一任务与特定验证奖励,数据与评测未覆盖其他领域与真实分布,代理held-out不能代表全部数学推理。 仅在作者固定SFT起点、超参与单H100设置下比较四种RL,换基座模型、温度、批量或工具格式时增益可能变化。 工具仅为计算器单一类型,未评估检索、代码执行等多工具协同与更复杂环境。 零方差组过滤与组内归一化引入重采样开销,零正确组仍缺乏有效信号,需结合更强规划或搜索。

潜在意义与适用边界

若后续获同行评审与多模型、多任务独立复现支持,该流水线为“工具+可验证奖励RL”提供了可复用的互补范式:以工具减少算术与验证类错误、以RL提升有效工具调用与正确轨迹采样效率,尤其Tool-DAPO的动态过滤对稀疏奖励下提升批次信息密度具参考价值。适用时需注意其严格依赖可自动验证的终答与受控Countdown设置,落地前应在更广数学与代码基准、不同基座与工具栈、以及规划与搜索增强的组合中进一步校验。