结论:加拿大皇家银行团队(含Borealis AI)在上海时间2026年8月31日公开的预印本Thinking Costs Tokens,通过14档预算、1,000题、28,000单元的对照实验发现,额外推理结构是否值得取决于token预算是否跨过约1,500输出等价token的阈值。预算为1,000时单次调用以18%领先而验证搜索近乎失效;预算1,500起验证搜索以24%超越单次调用20.6%并在后续所有档位保持3–5个百分点优势,双端p≤0.001。该结论仅来自作者在FinQA/TAT-QA与GPT-5.4 mini上的受控实验,尚未经同行评审与独立验证,不能外推为所有模型或领域的普遍阈值。
研究对象与方法
研究针对测试时增加规划、检索、验证与修复等结构是否总能提升大模型推理效果的问题,提出条件性假设:单次调用在低预算下以单一检索与回答更省开销,而多步验证搜索需先后完成规划、检索、候选生成与无标签校验,预算不足时会挤占回答空间,仅在预算足以容纳完整流水线时才能将额外开销转化为收益。方法对比两套共享相同模型、指令、证据序列化与确定性检索器的系统:单次调用与增加规划、标签盲校验与修复能力的验证搜索,以预算档位为唯一操纵变量,采用交并检验对低端小于0且高端大于0的交叉假设进行确证。
数据范围与评估条件
数据集为FinQA与TAT-QA的本地快照,各取500题共1,000题平衡集,要求每题至少两步推导、每文档至多一题,公开部分仅含问题、证据与元数据,隐藏标签含可执行推导与证据ID。模型统一为GPT-5.4 mini(输入$0.75/百万、输出$4.50/百万折算为输入token按0.17计入输出等价预算),预算分14档从250至42,000输出等价token,每单元记录调用、候选、校验与修复轨迹,严格按网关报告的提示与补全token总和执行硬预算,温度1.0单采样,无效输出与预算耗尽可能均记为错误,评分采用小数与单位尺度归一化后的精确数值匹配。
主要结果(作者报告,未独立验证)
250与500档两者均为0%,验证存在真实资源地板。1,000档单次调用180/1,000正确而验证搜索仅1/1,000正确;1,500档验证搜索首次超越并保持至最高档。验证搜索的提升与机制激活严格对应:1,000档平均1.01次调用、0.01候选;1,500档达2.0次调用、1.0候选;8,000档以上达2.6次调用、1.4候选且12–19%触发修复。单次调用在阈值上亦随预算从18%持续升至约40%,但验证搜索以约44%保持领先,表明阈值上额外结构能持续将更广检索、多候选与校验转化为准确率。双端McNemar检验均p≤0.001,满足交叉的确证标准。
局限与同行评审状态
该工作为arXiv:2608.27506v1预印本,提交于2026年8月27日05:24 UTC,按arXiv截点于8月31日00:00 UTC(上海8时)公告并归入当日cs.AI新列表,尚未经期刊或会议同行评审。关键限制包括:仅单一模型与默认采样、固定提示词与手工预算-动作映射、单一BM25检索器与特定校验规则;仅金融领域与精确匹配计分,无人专家基线与难度分层;共享模型导致误差相关,分数外推至其他架构、规模、语言或真实部署需谨慎。局部基准、模拟结果与相关性不得写成普遍因果或已获同行认可的事实。
潜在意义
若在多模型、多领域与独立复现中得到支持,该阈值框架为架构选型提供了可操作的预算条件判断:预算受限至约1,500输出等价token以下时,单次调用是更经济的执行路径;预算可达1,500及以上时,规划与验证的增量开销可被系统性转化为正确率。工程落地仍需结合自适应分配、检索质量、人评与成本时延的综合评估。