结论先行
中山大学与清华大学深圳国际研究生院团队于2026年9月2日(上海日历日,对应1 Sep 2026 16:55:56 UTC)首次公开预印本 EvoSCM: Scientific Belief Revision Through Causal Model Evolution and Experimentation,提出以可演化的结构因果模型群体作为科学智能体的显式认知状态。在交互式基准DiscoverPhysics上,EvoSCM在GPT-5.5与GPT-5.4两基座上较基线全面提升解释准确率并将预测误差降低一个至两个数量级,同时减少约24%–30%的实验回合;演化的SCM可零样本移植至完全无法通过的Qwen3.6-35B-A3B并使其pass@5达63.64%。该结论来自作者受控实验的预印本报告,未同行评审、未经独立验证,属局部基准结果。
方法与评估条件
方法上,EvoSCM将科学发现建模为通过do干预顺序恢复未知SCM。每个假设包含可观测变量、潜变量、DAG图结构、结构方程与参数,以群体形式维持多候选解释。每轮执行闭环:1)因果实验设计——对每个假设溯因推断潜状态,选择使群体预测最分歧的干预并提交可证伪预测,经真实环境观测获不符;2)SCM假设修订——将不符归纳蒸馏为自然语言修正规则,触发四类最小修订(增删边、增删潜变量、更新机制、更新参数),再经证据验证(对累积观测的预测一致性)与一致性检查(DAG有效性与机制兼容)筛选进入下轮。推理时以演化群体对未见干预做因果预测并聚合。
评估在DiscoverPhysics上进行,该基准要求智能体通过主动实验揭示非正则物理环境的隐藏动力学,隔离对预训练经典物理记忆的依赖,度量机制解释分、归一化MSE、pass@k与实验效率。对比基线为常规提示基线,骨干为GPT-5.4、GPT-5.5与用于移植检验的Qwen3.6-35B-A3B;结果以直接对比与跨模型移植两部分报告。
主要结果
- GPT-5.5上EvoSCM解释分0.516→0.751、归一化MSE 2.83e-2→2.77e-4、pass@1 7.25%→53.04%、pass@2 13.59%→59.95%、pass@5 27.27%→63.64%,回合2206→1685 GPT-5.4上解释分0.398→0.653、MSE 5.249e-1→2.339e-3、pass@1 1.86%→38.08%、pass@5 9.09%→54.55%,回合1045→736;两基座在解释、预测、成功率与效率上均超越基线 跨模型移植:Qwen3.6基线解释0.307、MSE 0.190、pass@k全0%;注入Qwen自演化SCM后解释0.489、pass@5 36.36%,注入GPT-5.4/5.5 SCM后分别至0.576/0.625与27.27%/45.45%,注入GPT-5.6-Sol SCM后达解释0.740、MSE近0、pass@1 39.85%、pass@5 63.64%,与前沿模型零样本能力相当 作者图示显示EvoSCM以更少实验回合实现更快收敛与更低误差,且演化SCM可直接在不同基座间复用,证实显式因果表征的可移植性优于绑定于单一智能体的过程改进
局限、是否同行评审与潜在意义
局限在论文中已部分说明:预印本标注为初步版本,结果仅在DiscoverPhysics的特定非正则物理任务分布与有限基座上测得,随轮次增加的修正规则质量、图结构搜索深度与潜变量规模对长程稳定性的影响未量化;真实科学发现中的噪声观测、仪器偏差、领域约束与开放文献知识未纳入;对早期证据的保持与新证据的权衡、失败预测的归因粒度及计算开销的系统分析待补充;局部MSE与pass@k提升不得夸大为所有科学领域的普遍或因果发现能力保证。
作者强调:EvoSCM turns free-form scientific reasoning into a structured, falsifiable, and cumulatively revisable process. 该判断为作者基于受控实验的解释性结论,未独立验证。
是否同行评审:arXiv:2609.01526v1提交历史为Tue, 1 Sep 2026 16:55:56 UTC(对应上海9月2日00:55),无期刊或会议接收信息,属预印本。潜在意义在于为关注科学智能、因果发现与主动实验的团队提供可复现的显式认知状态路径:在依赖可干预模拟环境时,以SCM群体演化替代自由文本假设,可减少难以归因与难以修正的问题,并实现知识在不同基座间的零样本迁移;但现阶段应视为模拟基准上的方法验证,扩展至真实物理、化学或生物发现仍需独立验证与安全评估。