核心结论

AMAP-ML 团队 8月31日首次公开的预印本 LoopArena 显示,目前最强的循环控制器在完整长程编程任务上的严格成功率仅 24.69%,长程循环控制仍存明显短板。该结果来自当日公告的预印本及配套基准,尚未经同行评审。

研究对象与方法

研究聚焦 Loop Engineering 场景:开发者不再逐条手写提示,而是设计循环来监控进度、分配工作、执行检查并决定智能体的下一步。LoopArena 将评价对象限定为控制器(Controller),与执行实际代码修改的固定工作器(Worker)分离。控制器每轮仅接收结构化的运行摘要证据包,输出下一条工作器指令、验证请求或停止决策,自身不直接改代码。

基准设置三档互补评估:Type I 为基于执行验证的下一步 Loop Contract 四选一选择题,无需运行工作器;Type II 在完整任务的选定切片上进行闭环控制;Type III 从原始任务状态执行完整任务。Type II 与 Type III 一一配对,便于在低成本切片与完整任务之间对比结论。

评估范围与主要结果

作者在配对的切片与完整任务上对比多款控制器,固定工作器与执行环境保持一致以衡量控制器本身的决策能力。核心发现为:完整任务(Type III)最优严格成功率 24.69%(Hugging Face 摘要披露为最优观察值),显著低于切片场景且整体偏低,表明长程控制仍有较大改进空间;切片任务平均减少约 64.4% 的估算推理成本,同时与完整任务的核心排序高度一致(Spearman ρ=0.9747),可作为低成本近似。作者未提供更大任务集或更多工作器配置下的普适性证据。

限制与同行评审状态

研究状态为预印本,尚未经同行评审。结果受限于特定配对任务集合、单一固定工作器(Qwen3.7-Plus)及特定预算与工具链,无法直接推广到所有编程语言、仓库规模或真实开发环境。64.4% 的成本降低为估算值,实际成本取决于模型计费与执行路径。作者结论应理解为在 LoopArena 协议与当前任务集下的局部基准表现,而非对代码智能整体能力的普遍判断。

潜在意义

LoopArena 提供了可复用的评估协议与基准数据,将循环控制能力与编码执行能力解耦,有助于对比不同模型在长程规划、进度监控与验证决策上的差异。中国用户关注代码智能体在长任务中的可靠性时,可参考该基准的严格成功率与成本-一致性权衡,但应等待后续同行评审、更多工作器与任务集的补充验证后再作选型或投入决策。