结论先行

中山大学、华为云与浙江大学团队于2026年9月2日(上海日历日,对应1 Sep 2026 17:59:46 UTC)首次公开的预印本 Efficient SWE Agent Benchmarking via Trajectory-Aware Evaluation 提出PTA-IRT:用历史执行轨迹中的过程证据扩展以往仅依赖“通过/失败”结果的IRT高效评估。在四项SWE基准与多类IRT/AutoJudger基线对比中,PTA-IRT在低校准预算下对全量分数与排名的恢复最优,10%预算平均MAE约0.041、Kendall τ约0.888、Spearman ρ约0.973,且5%预算已达实用排名一致性。该结论来自作者实验的预印本报告,未同行评审、未经独立验证,属局部基准结果,不应夸大为普遍或因果保证。

方法与评估条件

方法上,PTA-IRT分三阶段:1) 将异构长轨迹解析为四字段结构化过程摘要(任务目标、已探上下文、已执行编辑、路径概览),以参考补丁对齐相关文件与作用域但不作为标签;2) 以轨迹感知的4PL IRT拟合项目参数(区分度a、难度b、猜测下界c与可行性上界d),对摘要注入Δa、Δb残差,并以Fisher信息加权log(1+ESS)作难度分层抽样选取校准子集;3) 以同一骨干做师-生LUPI训练,教师用轨迹调整参数、学生仅用全局参数,测试时冻结权重在校准子集上以L-BFGS拟合新智能体的标量能力θ*并外推全量。

评估条件为:四项SWE-bench版本(Lite、Verified、Full、Pro),前两者智能体与轨迹更密集、后两者任务更多但智能体更稀疏;采用四折交叉验证(75%模型训练、25%测试),对比MLE、MCMC、VI、VIBO、Deep-IRT、PSN-IRT、AutoJudger;度量为MAE、Kendall τ与Spearman ρ;过程摘要以DeepSeek-V4-Flash生成、all-MiniLM-L6-v2嵌入。

主要结果

  • 10%校准预算下在四基准全部指标最优:平均MAE约0.041±0.015、τ约0.888、ρ约0.973;在Lite/Verified密集池与Full/Pro稀疏大任务池两类 regime 均保持最好 预算敏感性:Lite上5%预算τ约0.768已达文献实用区间(0.7–0.8),20%时τ约0.886且MAE趋降,5%–25%全区间领先基线 消融:移除轨迹感知打分器或移除LUPI均使恢复变差;仅用结果标签或腐化摘要显著削弱;结构化摘要的增量超出问题文本与补丁本身 选择策略对比:分层信息抽样优于全局Top-K与按通过率聚类,避免过难同质选择,兼顾代表性与信息量 代码与数据已公开于 https://github.com/DeepSoftwareAnalytics/PTA-IRT

局限、是否同行评审与潜在意义

局限在文中明确讨论:预印本未同行评审、结论依赖特定摘要生成与嵌入实现、权重与有效样本量设计、以及四基准与历史轨迹分布;对不完整、格式异常轨迹的降权可能引入偏差;新智能体仅在小子集上估计,跨任务、跨语言与更长程企业场景的泛化未验证;文中以分数与排名恢复度量效率,未直接量化实际推理成本与时间节省。

作者原话:Under low calibration budgets, PTA-IRT consistently outperforms prior IRT baselines on score and ranking recovery across four SWE benchmarks. 该判断为作者基于受控实验的描述性结论,未独立验证。

是否同行评审:arXiv:2609.01603v1标注Comments为Under review,提交历史Tue, 1 Sep 2026 17:59:46 UTC(对应上海9月2日01:59),无期刊或会议接收信息,属预印本。潜在意义在于为关注软件工程智能体评测成本的研究与工程团队提供可复现的“小子集估计全量”路径:在保留通过率分层覆盖的前提下引入过程级特权信息,可在有限预算内更稳地恢复全量表现与排名;但现阶段应视为受控条件下的方法验证,局部MAE与τ/ρ提升不得外推为所有基准与智能体的普遍效率保证。