结论

清华大学与腾讯混元团队公开的预印本提出 TrajDebug,用于在长链大语言模型代理的失败轨迹中找出最早、且与最终失败相关的关键错误步骤。研究同时发布 TrajErrBench。论文为预印本:文中的性能比较和应用增益均属于作者实验结果,尚未获得同行评审或独立验证。

研究对象与方法

研究关注的不是“哪一步看起来有错”,而是区分后来被修复、没有造成后果的局部错误,与真正导致任务失败的错误。TrajDebug把诊断分为三个阶段:先用多粒度历史压缩保留局部证据并识别与指令、历史或环境反馈冲突的错误触发;再按被违反的对象聚合触发点,判断错误是否已解决、是否留下终局影响;最后只在终局相关候选中进行归因,选择关键错误步骤。

数据与评测范围

TrajErrBench包含486条人工标注的失败轨迹:400条来自 τ²-Bench 的工具使用和交互场景,86条来自 SWE-Bench Pro 的长程编码场景。论文称每条轨迹由三名标注者判断,以多数同意作为标签;两类数据的关键错误标注一致性分别为 Fleiss’ κ=0.91 和 κ=0.67。该范围说明它主要评估受控基准中的失败诊断,而非生产环境的通用可靠性。

作者报告的结果

作者称,TrajDebug在所比较的高级提示基线和既有诊断系统中取得总体最佳表现,并在较长轨迹上更稳健。两项推理时应用研究中,先诊断失败轨迹、再生成定向指导后重跑同一任务,平均成功率提升10.8%;将少量历史失败诊断汇总为可复用记忆并迁移到留出任务,平均提升5.7%。这些数值应理解为该论文实验设置内的作者报告,而不是独立复现结论。

限制与潜在意义

该工作尚不能证明在不同模型、代理框架、工具权限或真实业务流程中同样有效;基准来源也限于两套现有任务。若后续代码、数据和跨框架复现可用,这类把错误证据、修复状态和终局影响分开的诊断流程,可能帮助开发者更有针对性地分析长任务代理为何失败,而不是只依据最终得分或最后一步现象修补。