核心结论
加州大学圣迭戈分校牵头团队以预印本 Can LLMs Discover Scientific Laws in Real and Parallel Worlds?(arXiv:2609.01552v1,首次公告归属 2026-09-02 上海日历日,对应 1 Sep 2026 17:17:59 UTC)发布 SciLaws-Bench,系统检验大模型是否能从真实观测中发现科学定律。基准由118个问题、381篇论文、291个候选定律与约800万真实数据点构成,跨6个学科并首次纳入多组迁移设定。核心发现为: held-out 预测拟合与文献落地的科学有效性分歧显著(一致率仅54.9%)、记忆主要帮助复现已发表形式而非发现新增结构、以及模型生成候选优于自选能力存在明显瓶颈。该结论为作者受控实验报告,当前仍为预印本未获同行评审与独立验证。
方法与评估条件
方法上,团队以严格三标准筛选问题:论文提出可执行的闭式定律且具足够有效性约束、数据集公开且量足、可与朴素基线拉开差距且不泄露目标;将单组设定为单一全局定律与参数集,多组设定为共享函数形式但部分参数按组可变。SciLaws-Real 要求模型在给定训练切分上提出定律,按任务特定 held-out 切分(插值、外推、时间迁移或跨组留组)计算相对最强已发表基线的拟合分 SN(基线0.5、完美1.0,按 rmse/smape/log_mae 或 r2 归一化)与基于冻结文献条目的有效性分 SV=at·Mt/Nt(含全局防作弊门控)。SciLaws-Parallel 为同一问题构建残差校准的平行世界:对已发表基线合成结构变体并经执行与科学性筛选,以真实数据拟合系数、去偏残差的 k-NN bootstrap 重采样与尺度因子 α 校准噪声,生成仿真器 y=f(X)+α·resample(X);模型从零观测起在固定查询预算与可接受输入范围内主动选择测量点并推断隐藏定律,按5级结构分 SS(0/0.25/0.5/0.75/1.0)度量恢复程度。评估均在统一 ReAct 智能体框架下进行,暴露 Python 沙盒、提交与主动实验三类动作,最多30轮交互。
数据范围与主要结果
数据范围为118问题(66单组、52多组)、291定律、约800万点,覆盖物理、材料、生命等6学科。评测9个前沿模型:GPT-5.5、GPT-5.4-mini、GPT-5-mini、GPT-4o-mini、Claude Opus 4.8、Gemini 3.5 Flash、DeepSeek-V4 Pro、Qwen3.7-Max、GLM-5.2。聚合结果显示 GPT-5.5 在拟合、有效性与结构恢复三指标领先,但领域分化明显:GPT-5.5 在6域中5域拟合第一,却在生物学中位列第7(41.0% vs Gemini 3.5 Flash 46.9%)。关键量化结果包括:3616对同任务比较中拟合与有效性一致率54.9%,ΔSN≥0.4时才至69.5%;冷回忆审计仅11.9%问题被9模型全回忆、47.5%全无回忆,Real中不可回忆区间超越基线率显著更高(GPT-5.5 21%→54%),Parallel中回忆将基形式恢复从0.59提至0.85但完整新结构恢复扁平约0.08(GPT-4o-mini 0%至 GPT-5.5 21%);候选自选实验中 N=5→20 的 oracle 增益分别为4.5与5.3分,自选仅 <2分,60%自选胜者被同组兄弟 Pareto 支配,自选联合均衡0.61远低于 oracle 0.93。
局限与不确定性
作者与正文明示以下边界:工作为预印本,未经期刊或会议同行评审,依赖自动判官(有效性与结构恢复由 gpt-5.4-mini、回忆由 gpt-4.1 判定,虽与5名专家 κ 0.77-0.84 但仍可误判);任务抽样与有效性条目受来源文献与实现影响;模型与 harness、轮数与预算固定,合成隐藏定律与残差校准虽保留真实噪声形态但仍非自然定律;多组任务的留组与标定切分及指标平均、拟合-有效性权衡未完全消除;局部基准与仿真节省不应外推为普适或因果结论。
同行评审状态与潜在意义
当前状态为预印本,未同行评审,引用与应用应标注为未验证并等待独立复现与期刊审议。其意义在于为 AI for Science 提供了首个基于真实文献与可执行检验的定律发现基准,明确区分“拟合好”与“科学对”的鸿沟,揭示记忆与选择器是当前瓶颈而非仅生成能力,为后续改进自选策略、记忆感知训练与更严格的科学有效性约束提供了可复现起点,但在规模化应用前仍需同行评审、独立验证与安全性评估。