结论
作者在一项标注为 arXiv 预印本的研究中报告:当用户在编码代理执行任务期间修改共享代码,且编辑与任务完成相冲突时,9 个模型在 SWE-bench Verified 上的平均解决率较自主条件下降 7.7 个百分点。这是受控基准结果,不是对所有代理或真实生产协作的普遍结论。
方法
SWE-Touch 先从多条修复轨迹中找出任务关键代码区域,再用独立的 User Patch Generator 生成小范围、语法有效且经验证的 Counter-Edit:用户编辑单独不能解决任务,参考修复可以解决,二者合并后仍不能通过验证。评测在代理触达相关代码时注入编辑及上下文用户消息,要求代理继续在变化后的工作区中修复。
评估范围
主实验使用 SWE-bench Verified 中按设定随机抽取的 200 个任务,代理通过 Mini-SWE-Agent shell 接口操作,设置 100 步预算,每种条件独立运行 3 次,完整验证器通过才计为解决。作者另在 SWE-Bench Pro 和 DeepSWE 上各评估 25 个更长时程任务,使用 500 步预算和不同的编辑调度。
结果
在主实验中,9 个模型的 Counter-Edit 平均解决率下降 7.7 个百分点,单模型下降 1.3 至 16.5 个百分点;论文还报告模型排序出现明显变化。长时程基准上退化仍存在,但受影响的模型不同。轨迹审计显示,在自主条件下已解决、冲突编辑条件下未解决的运行中,63.3% 最终仍保留冲突行为,另有错误替换、不完整协调等失效类型。
状态与限制
论文页状态为 Preprint,当前版本为 arXiv v1,尚未确认同行评审。本次核验未发现当日独立复现或第三方结果,因此上述数字应归于作者实验。研究使用区域触发的模拟冲突编辑,不能覆盖真实协作中的全部用户行为;任务筛选、不同基准的样本量和注入规则也限制了外推。编辑解读是:共享工作区中的状态感知、冲突协调和受影响行为复验,可能需要作为独立评测维度,但这不是因果或生产效果结论。