结论:斯里西瓦苏布拉马尼亚纳达工程学院研究人员于上海时间2026年8月31日通过 arXiv 首次公开预印本 COVER,核心结论是:在声明有限联盟族、固定信息边界与下游协议栈 G 的前提下,联盟路由的有限基准遗憾度可被精确识别,且冻结策略两两对比的最小无假设支撑恰为路由并集。在受控的 MuSiQue-12 与 HotpotQA-4 干预表及五族 ToolSandbox 自然验证中,该契约既能检出公共接口的显著遗憾改善,也能揭示 0.768 的声明族天花板尚未转化为可部署的达标路由性能。该结论来自作者在受控与半自然环境中的完整覆盖测量,尚未经同行评审或独立验证,不应解读为已获学界共识或跨栈通用的优越性证明。
研究对象与方法
研究针对多智能体系统更换团队后消息与终答同步变化,导致端到端准确率差无法单独识别路由效应的混淆问题。方法上,作者提出 COVER 五要素契约:预先声明合法团队全集、路由器仅见任务文本与公共卡片、固定工人、顺序、通信、效用与终结器为同一 G、按需执行完整族或路由并集、任务层重采样推断。形式化定义有限基准价值与遗憾(式1),证明完整覆盖下遗憾等于观测最大值与路由值之差,否则识别集为 [m^G−y, 1−y](定理3),并给出定理1:对任意有限冻结策略集,其路由并集是所有两两对比点识别的唯一最小无假设设计。验证策略作为仪器而非新架构:Unified-COVER 为置换不变直接评分器,Partition-COVER 为基于局部兼容性与平衡划分完成质量的三元组排序器,区分特权正对照与公共回溯对照。
评估条件与数据范围
评估分三段。两受控表为多跳问答:MuSiQue-12 每池12张置换卡片、220 合法三元组,HotpotQA-4 为4选3,源ID在训练/开发/ held-out 上不相交,held-out 上每任务恰一正团队且为二值覆盖值,经流式审计确认 MuSiQue 500/500 与 HotpotQA 300/300 有效,效用为构造要求的证据存在性,终结器固定为符号验证器。固定栈真执行为 300 任务 Llama 托管工人,同 G 下执行路由并集,比较已验证证据完成度与原始精确答案。自然验证为五族 ToolSandbox,声明族为5单例+10对+1全团队共16联盟/任务,开发矩阵 34×16=544 行,held-out 为 14 个同族变体共 14×16=224 行,执行器为固定 Qwen2.5-14B-AWQ,价值为官方安全工具状态里程碑完成比例,协议哈希与任务哈希冻结。
主要发现(作者报告,未独立验证)
- MuSiQue-12:回溯性公共接口 0.554→0.424(无隐蔽标签),预设特权正对照 0.532→0.402(依赖训练期隐蔽标签,仅作仪器灵敏度阳性对照,非部署证据); HotpotQA-4:公共直接法 leave-one-out 0.313 对 Unified-COVER 0.110,配对增益 0.203,95% CI 0.153至0.257,符号翻转 p=0.00001(69胜223平8负),MLP 基线 0.350 更弱; Llama 同栈执行:已验证证据遗憾改善 0.190(CI 0.140至0.240,Holm p=0.00003),原始答案对比仅 0.010(CI -0.0067至0.0267)跨零,说明优路由可被弱终结器掩蔽; ToolSandbox 自然验证:声明族 oracle 0.768,前景冻结能力路由 0.637(遗憾0.131,未达预设阈值0.10),全工人 0.655,开发最优后验对比 0.655 亦未达标但将平均队规模从5.00降至4.57; 方法学定性:完整表查询本身非理论贡献,实质为识别层次与最小支撑定理,2×2 交叉终结器诊断未检出路由-终结器交互,但绝对值依赖 G。
作者强调:COVER 是可审计的度量方法学,不是对栈不变或通用智能体路由优越性的主张;报告 oracle 而不报告可实现性能会制造虚假路由增益,仅报告可实现性能则会掩盖环境中可利用的异质性,两者需同时报告。
局限与同行评审状态
- 该工作为 arXiv 预印本,于2026-08-28 16:01 UTC提交,按 arXiv 14:00 UTC截点与周末不公告规则于2026-08-31 00:00 UTC(上海08:00)公告并归入 cs.AI 当日列表视为首次公开,尚未经期刊或会议同行评审。 受控结果为构造证据覆盖,终结器与效用为作者定义的符号验证,非自然任务成功或总体效用;单次 provider 调用非总体期望,多配置面板仍不完整。 特权 MuSiQue 对照不可外部署,公共回溯对照属回溯性,不能替代前景冻结验证;ToolSandbox 仅14变体且为同族内位移,非跨族复现,后验套件在查看 held-out 摘要后设定,不得晋升为前景结果。 统计限任务层自举与符号翻转, Holm 校正在原确认族内完成;附录与增量台账保留更多对照与零结果,主文叙事有意线性化,解读需结合附录。
潜在意义与适用边界
若后续获同行评审与更广栈、更大池及独立复现支持,COVER 为在可承担穷举成本的小而有意义团队族上评估路由提供了契约与报告规范:区分有限受控表选择、固定生成下的证据传输与随机执行下的终答成功三种不同量,避免将移动管线对比误读为选择对比,或将天花板 oracle 误读为可部署性能。适用时需预先声明族与 G、完整执行并冻结路由后再比较 held-out;大空间应声明采样设计并报告采样遗憾及其覆盖,必要时在小重叠队列上对照全枚举校验。落地前仍需评估真实工具成功、长期稳定性与跨提供方可复现性。