核心结论
在共享推理服务端点上,将黑盒大模型作为评审仪器使用时,“相同请求发送给同一模型名应在次日得到相同读数”的稳定性假设未通过预注册检验。谢菲尔德大学等团队的两轮预注册实验共审计 52,988 次请求,同窗口重复排名一致性中位数为 0.400(门限 0.90),字节完全一致的次日重放全排名一致率为 0.78(门限 0.99),均显著失效,而工程执行记录(投递、模式校验、请求体哈希、提供方元数据)均处于上限,表明“工程完美不等于测量可靠”。
研究主体与状态
论文题为《Clean Engineering, Unstable Measurement: A Preregistered Reliability Failure of Black-Box LLM Observers on Shared Endpoints》,作者来自谢菲尔德大学电子电气工程学院、Ranplan Wireless 与 Cambridge AI+,通讯作者为 Haoyuan Zhu。论文于 2026 年 9 月 4 日(Asia/Shanghai)以预印本形式在 arXiv 发布(arXiv:2609.04198,提交历史显示 Thu, 3 Sep 2026 17:59:43 UTC,对应上海 4 Sep 01:59),尚未经过同行评审,属于可核验预印本研究进展。
方法与数据范围
研究采用两代仪器与两类预注册门限:I-3S 检验同窗口重复排名稳定性(要求 Spearman 中位数 ≥0.90,重复 10% 子集),I-5R 检验间隔 ≥24 小时的 100 个冻结请求字节一致重放(要求全排名一致率 ≥0.99)。配置冻结于执行前,审计链以 SHA-256 固定的追加式 JSONL 记录每次请求体与响应的哈希、时间戳与提供方元数据。主实验覆盖 80 任务×4 候选、31 个有效任务组与 100 个重放对;补充实验 A-S1/A-S2/A-S3 分别进行同日/跨日方差分解、四服务商平台类比与 340 次调用的已知误差构造电池,全部预注册且独立归档。
主要结果
主门限均未通过:I-3S 在标量重复度中位数 |Δ| 为 0.0067(优于 0.03 阈值)的同时排名仍失效;I-5R 在 100 次重放中 22 次出现漂移且分布于 16 个任务。机制上,M1 为标签语义映射偏差(中位数 0.3125 logits),M2 为近简并可测量子(最小差距中位数 3.04×10^-10,远低于噪声底),M3 为字节一致输入的漂移。等待未改善(0.805 vs 0.800,跨 5 个额外工作日复现),四家服务商共享同一量级底噪(0.74–0.88),自托管批量不变内核仅在安静时达 0.9872,并发下回落至 0.8925。
限制与边界
作者明确限定:所有结果仅为共享服务基础设施上的外部测量,不推断模型内部机理,不作服务质量评价;M1/M2 来自单一观察者与单一合成任务族,需试点后再外推;预印本未经同行评审,近简并性由任务设计制造(84% 任务无可排差异),门限与全排序读出的组合放大了噪声,连续读出配合等价带与按可分辨对过滤分母的规则是后续设计要点。
是否同行评审与潜在意义
该研究当前为预印本,未经过同行评审。其价值在于以完整的预注册与审计链条证实:在共享端点上,模型名不是冻结仪器,任何冻结的评估门限在冻结前必须先试点测量噪声底与差距分布并模拟工作特性(pilot–simulate–freeze),否则门限可能不可达。论文提出 L0–L2 快照身份阶梯、八条设计规则与报告清单,提示预注册评估应先测量仪器再冻结门限,对依赖 LLM 评审的数据筛选、排行榜与训练门控具有直接的工程与报告启示。