结论先行

Inria团队(Damien Sileo,Univ. Lille / Inria / CNRS / Centrale Lille – CRIStAL)于2026年9月2日(上海日历日,对应1 Sep 2026 17:59:13 UTC)首次公开的预印本CordisBench提出:当语言模型通过动态Agent编排在运行时增删插件并触发依赖清理时,模型需自行预判一次生命周期变更的连锁影响。作者以1,200题受控基准系统评测发现,模型在小规模下通常可正确识别影响范围,但随需要同时追踪的交互数从2增至32,预测终态与跨调度条件推理的可靠性显著下降;增加推理开销可部分恢复,但该类后果在受控实例中本身可由有限语义精确计算,提示编排系统应优先由运行时直接计算或验证。该结论来自作者受控实验的预印本报告,未同行评审、未获独立验证,属局部基准结果。

方法与评估条件

方法上,CordisBench基于Cordis运行时(4.0.0-rc.7)的依赖与生命周期模型构造评估。每个实例指定组件、依赖、初始应用状态与清理效应(启动时记录所见状态、停止时恢复该值),并设定一次生命周期变更。形式化设置以模运算向量与算术效应程序表达,穷举合法生命周期延续以得到精确参考答案;Cordis原生设置将同类干扰编译为真实Cordis插件并实际执行,对比参考语义与运行时结果。

评估条件为:由240个独立生成系统衍生1,200题,其中1,056题为五个主任务、144题为结果计数诊断;两设置各在交互数2、4、8、16、24、32六档下保持题型与评分不变,仅增加需同时处理的效应组或依赖数。主任务含定位(受影响组件/槽位识别,Jaccard评分)、调度预测(给定拆卸顺序后的终态,逐观测准确率)、全体条件与存在条件判定(跨调度全称/存在推理,Jaccard)及重配置(输出最小预拆除集合并实际执行验证执行成功率)。参测模型为Gemini 3.7 Flash、GPT-5.6 Luna与DeepSeek V4 Flash,温度0、低推理开销、8,192 token输出上限,单次完成无工具或执行反馈,按系统做聚类自助采样报告不确定性。

主要结果

  • 定位随规模下降较缓,终态预测与跨调度条件推理下降更明显:例如GPT-5.6 Luna形式化可达条件Jaccard 91.7%→14.1%、Cordis原生重配置执行成功62.5%→25.0%;DeepSeek V4 Flash形式化预测准确率81.2%→57.7%;Gemini 3.7 Flash多数Cordis原生任务保持高位 增加推理可显著恢复:16交互平衡子集中,GPT-5.6 Luna中等推理下Cordis原生预测31.2%→85.4%、重配置0%→50%,平均每题约2,967个推理token;Gemini在32交互全体条件等题上受限于8,192 token截断,调大至32,768后全体条件Jaccard由20.2%回升至71.2%等,说明部分下降由输出上限贡献 有限参考语义与Cordis执行在全部528个可执行问题上观测与动作结果完全一致,证实受控实例后果可确定计算;快捷方式对照显示仅依任务标识等浅层线索的最好对照仅获7.3%全答精确匹配,排除部分简单捷径 执行验证区分失败类型:Gemini 92/96成功;GPT-5.6 Luna 67/96达到目标但11题冗余,实际最小成功56题;DeepSeek 33/96达到目标但32题冗余,仅1题最小成功;固定两调度对照中GPT-5.6 Luna全体与存在条件仍显著下降,证实规模趋势非仅由调度数量增加驱动

局限、是否同行评审与潜在意义

局限在论文第7章与附录明确列出:基准隔离特定恢复清理干扰,未覆盖失败、不可逆外部操作、热模块替换等真实要素;最大规模实例为压力测试,绝对分数不等同于典型部署规模的日常表现;三款高效模型与低推理配置限制泛化,完整编排中可借助工具计算、验证与重试,单题隔离难度与端到端表现不完全等同;输出长度与返回全标签等策略性回答会掩盖真实推理曲线。

作者原话:The systems implication is therefore not simply to spend more inference on lifecycle management. When dependencies and cleanup effects can be represented explicitly, harnesses should compute or verify their mechanical consequences directly。 该判断为作者基于受控结果的解释性结论,未独立验证。

是否同行评审:arXiv:2609.01600v1为预印本,标注提交历史Tue, 1 Sep 2026 17:59:13 UTC(对应上海9月2日),未标注期刊或会议接收,尚未同行评审,需等待后续审议与独立复现。潜在意义在于为关注Agent编排与工具调度的研究与工程团队提供可复现的压力基准与参考语义:在依赖与清理可显式建模时,优先由运行时直接计算或验证机械后果,可减少模型在生命周期管理上的推理负担与不可靠性;但该路径现阶段仅验证受控干扰模式,扩展至更广生产场景仍需系统验证与安全评估,局部Jaccard与执行成功率下降不得夸大为普遍因果能力缺陷。