结论
北京时间2026年8月7日,CalibForge预印本首次公开。该研究将终端任务的“可学习难度”定义为相对于指定求解器的性质:任务既要能被验证为可解,又不应在给定求解器配置下被一致轻易解决。作者发布了5,431个据此校准的任务,并在固定训练、评测条件下报告,由这些任务蒸馏出的训练数据可提升两种Qwen骨干在终端代理和软件工程基准上的成绩。
arXiv API记录该论文v1发表于2026年8月6日17:53:18 UTC,即北京时间2026年8月7日01:53:18,符合本地当日窗口。研究状态为预印本,未获同行评审;文中性能数字均是作者报告。
方法与范围
CalibForge从工程线索生成候选任务,并对任务指令、Docker环境和验证测试进行结构验证与自求解。之后系统让求解器执行任务:多求解器校准要求至少一个求解器通过、至少一个失败;强弱对比校准要求指定强求解器通过而弱求解器失败。若不满足目标关系,作者代理会利用已验证的成败结果和轨迹反馈修订任务后重新测试。
论文使用DeepSeek-V4-Pro作为任务作者和轨迹蒸馏教师;多求解器校准使用DeepSeek-V4-Flash、GLM-5和Kimi K2.5,强弱对比使用DeepSeek-V4-Pro与DeepSeek-V4-Flash。最终任务集含1,263个多求解器校准任务与4,168个强弱对比校准任务。作者以相同的蒸馏和微调流程训练两种Qwen骨干,并在Terminal-Bench 2.0、SWE-bench Pro和Doc2Repo上评估。
作者报告的结果
在Terminal-Bench 2.0上,CalibForge-30B-A3B为32.58%(标准误1.12),CalibForge-35B-A3B为47.57%(标准误0.99);作者将其与相同骨干、相同训练协议下的对比任务数据比较,分别报告高出最强对比项6.36和6.75个百分点。对30B骨干,作者还报告其在SWE-bench Pro与Doc2Repo分别由基础模型的3.26%和5.94%升至30.94%和35.98%。这些数字描述的是论文设置内的相对结果。
限制与潜在意义
结果尚不足以证明该方法对所有编码代理或真实生产任务都有效。实验只覆盖两种Qwen骨干和指定的任务作者、求解器与训练预算;Terminal-Bench 2.0和Doc2Repo各运行三次,SWE-bench Pro只运行一次。受控终端基准与开放网页、长期工具调用或复杂生产状态也存在差异。
若后续复现成立,这项工作的实际价值在于把“任务可解”之外的难度校准纳入训练数据构造:可用经验证的强弱求解器差异来筛选并修订任务。不过,是否能稳定迁移到不同模型、不同成本预算和实际软件开发流程,仍需独立评测。