结论:谢菲尔德大学等团队于 9 月 4 日(Asia/Shanghai 01:59,对应 arXiv 2026-09-03 17:59 UTC)公开预印本 Clean Engineering, Unstable Measurement,以两项预注册仪器审计揭示黑箱 LLM 观测器在共享端点上不是稳定测量仪器。核心发现是工程层完美不蕴含测量层可靠:52,988 次审计中同窗重复排序 Spearman 仅 0.40(门槛 0.90)、次日字节完全一致重放仅 0.78(门槛 0.99),三类机制(标签映射偏差、近零间隔与共享端点非确定性)经排列读出被放大。研究为预印本,尚未同行评审,结论限共享推理基础设施与特定排序读出。

研究主体与状态

论文题为 Clean Engineering, Unstable Measurement: A Preregistered Reliability Failure of Black-Box LLM Observers on Shared Endpoints,作者 Haoyuan Zhu(谢菲尔德大学电子电气工程学院)与 Jie Zhang(Ranplan Wireless Network Design Ltd. 与 Cambridge AI+ Ltd.),通讯作者为后者。研究状态为预印本,公开于 arXiv:2609.04198,提交历史 Thu, 3 Sep 2026 17:59:43 UTC,对应 Asia/Shanghai 2026-09-04 01:59:43,落在当日 00:00—23:59 窗口内。背景是 LLM 作为裁判(judge)广泛用于训练数据筛选、生成评分与排行榜,其隐含假设是同一请求发给同一模型名次日读数一致;本工作将该假设作为预注册仪器门槛进行审计。

方法与数据范围

方法上,研究测量一个双模型流水线:生成器对确定性算术任务产生 4 个候选解答(4–8 步可见推理,终答为唯一有理数),外部观测器在不同可见前缀进度(25%、50%、75%、100%)下以温度 0.0、单 token 精确标签读出(top_logprobs 5)给出正确概率或全排序,冻结配置下 80 任务×4 候选共 3,312 次调用(硬上限 3,632)。审计采用预注册门槛:I-3S 要求同窗重复排序中位数 ≥0.90,I-5R 要求 24 小时后 100 次字节一致重放完全一致率 ≥0.99,辅以覆盖率、标签质量与标量稳定性等子准则,并以仅追加 JSONL 事件日志与 SHA-256 封存保证字节级可审计。数据范围为 52,988 次审计请求尝试(分析基于 31 个有效任务组、100 对重放、10 窗口补充臂与 3,060 个构造错误判断),以及 74.8 万次调用的模拟设计网格;补充实验覆盖同日/跨日方差分解、4 家跨 3 法域提供商、自托管批不变量内核与已知差距构造错误电池。

主要结果

结果呈现执行与测量分离:I0-S 与 F2 窗口交付、模式校验、请求体哈希一致性与记录元数据(模型字符串、system_fingerprint 等)均达天花板,但两项门槛均远未通过。机制分解显示:M1 标签语义映射偏差中位数 0.25–0.31 logits,95 百分位约 1.3 logits,且在正误候选上符号相反,翻转映射可使排序相关降至 0.21 甚至 -0.63;M2 近退化测度中 4 候选分数极差中位数仅 0.0114,最小相邻间隔中位数 3.04×10^-10,四分位仍仅 0.0005,远低于重复噪声四分位 0.001–0.018 与 90/95 分位 0.052/0.080,标量重复误差中位数 0.0067 却导致排序坍塌;M3 字节一致重放 22/100 漂移分散于 16/25 任务,Kendall 距离谱 78 次完全一致、11 次距离 1,其余分散。自然修复路径均封闭:度量替换下 Top-1 一致率 0.95 与成对一致率 0.986 仍不触及全排列门槛,模拟中 500 次运行 0 次通过;补充实验显示同日 0.805 对跨日 0.800(差 0.005 在等价带内,5 额外日重复)、4 家提供商中位数 0.74–0.88 且无元数据可预测、并发负载使自托管分歧扩大 8.4 倍至共享端点量级、构造错误上区分错误类型而非大小。作者据此提出 L0–L2 快照身份阶梯、8 条设计规则与报告清单,指出约 2% 试点调用即可提前暴露两项不可达门槛。

局限与待验证事项

局限包括:预印本性质,未经同行评审,数值与结论需独立复现;结论仅适用于共享端点上外部测量行为,不涉及模型内部或语义动力学,也不评价提供商服务质量;任务设计人为制造近退化(准确率 0.781、仅 16.25% 任务混合正误),导致排序信息集中于中段前缀,外部有效性有限;分析限于精确排列读出,连续读出配合等价带或聚合可能表现不同,作者已建议改用后者;范围限于所测配置、提供商与窗口,第二活动冻结点晚于两次开发结果并非完全预冻结;自托管仅验证批不变量内核与特定并发模型,其他服务栈与负载形态需另测。作者未声称发现新偏置或新机制,而是将已知的裁判不一致、批依赖非确定性与可复现性清单组合为仪器优先的审计与设计纪律。

潜在意义

潜在意义在于为以 LLM 为裁判的评测提供仪器优先的工程纪律:在共享端点上模型名不是冻结仪器,预注册评测应在冻结门槛前实测仪器噪声底与差距分布、校准操作特性,并在报告中将执行层与测量层分离、披露快照身份等级与元数据语义。对中国用户与实践者,启示是复用黑箱裁判作数据门控或榜单裁决时,应先以千次级试点测量重复稳定性与跨日漂移,并优先采用连续分数加等价带而非精确排列门槛,或在静默自托管环境下固定快照;否则“全绿测试与哈希一致”仍可能掩盖测量层不可用。