核心结论
上海人工智能实验室团队于Asia/Shanghai 9月2日公开的预印本Harness-of-Harness提出一种可在现有编程智能体harness之上持续改进的多日自主软件开发框架。作者在三项受控基准与三组harness-模型配置下的实验显示,经三轮规划—编码—测试循环后平均相对增益52.25%、最高82.86%,并在一项超过70轮的多日部署中从零自主生成一款可游玩的第一人称射击游戏。该结论来自作者实验,仍为预印本且限于所述基准与配置,未获独立验证。
方法与评估条件
HoH不重写底层harness,而是将其组织为迭代式循环:规划器综合高层需求与历史证据制定兼顾问题修复与新能力的小增量计划;开发者在实现阶段嵌入聚焦测试获得即时反馈;测试员以白盒与黑盒等多视角独立评估是否满足整体需求与当轮计划,并返回结构化报告供下一轮使用。框架通过限定可验证交付物而非固定工作流、渐进式披露产物与证据、按角色组织工具与Markdown技能、鼓励复用而非重造、以及维护迭代级与角色级版本历史来维持长程连贯性。
评估分两类。受控基准评估在不启用额外工具、技能与版本控制的条件下进行,覆盖GameCraft-Bench(游戏开发)、FrontierSWE(仓库级工程)与ProgramBench(程序重建),对比三组固定配置:Codex配合GPT-5.5(high)、OpenCode配合DeepSeek-V4-Pro、Pi配合MiniMax-M3。开放式评估为多日自主游戏开发,仅给定高层产品需求,启用角色专用工具、资产获取与生成、测试及状态管理,并在每阶段提交后将代码与产物提交至公开仓库以保证轨迹可追溯。
主要结果与数据范围
- 三轮后绝对增益:GameCraft-Bench 16.62–22.08分,FrontierSWE 19–29分,ProgramBench 6.09–16.85分;三组配置均超越对应独立harness。 平均相对增益52.25%,最高82.86%(均指三轮后相对于独立harness)。 FrontierSWE上Codex+GPT-5.5(high)从22%经十轮持续提升至72.67%。 开放式FPS游戏在70余轮内实现连贯剧情、战斗与武器及敌方交互、引导、HUD与菜单、过场动画与视听打磨,产物、轨迹与游玩视频已随论文公开。
作者指出,增益在不同基准与配置间稳定出现,但数值仅在所述基准与模型组合下测得,不应直接外推为所有软件开发任务的普遍提升。多日游戏案例展示了框架处理长程依赖与持续集成的能力,但为单一样本案例研究,未设置与独立harness或人工团队的定量对照。
限制与不确定性
- 预印本状态:未同行评审,论文标注为初步版本,细节与更多结果待补充。 范围限制:仅三基准与三配置,未测试其他主流模型、更大规模或不同编程范式的软件项目。 单样本开放任务:FPS游戏未进行对照与外部盲评,成功度依赖作者定义的完成度与主观可玩性判断。 环境与工具依赖:结果在特定计算环境与Godot 4.7等引擎下取得,且依赖手工技能与工具编排,迁移成本未量化。 配置差异:受控基准与开放任务的HoH配置不一致,两类结果不可直接比较或叠加解读。
研究状态与潜在意义
该工作为9月2日首次公开的预印本(arXiv:2609.01481,提交时间1 Sep 2026 16:17 UTC,对应Asia/Shanghai 9月2日00:17),尚未经同行评审。其披露的迭代式增量与独立验证机制为当前编程智能体易陷入局部修复、遗忘历史证据与重复验证的问题提供了可复用的工程范式。若在更多模型、任务与团队对照中获独立验证,将有助于将智能体从人机协同的辅助角色推向更长时间跨度的自主项目级开发,但现阶段仍应视为受控条件下的方法验证,而非已具备普适自主交付能力的证明。