结论
北京大学多媒体信息处理国家重点实验室、计算机学院与 YiXin-AILab、北京智源人工智能研究院团队于上海时间 2026 年 9 月 1 日 00:43(对应 UTC 8 月 31 日 16:43)以预印本 arXiv:2608.31068v1 首次公开研究《Wrong Prediction, Right Answer》。核心发现是:大模型在多类推理任务上的错误预测常非能力缺失,而是后期输出层评分坍缩所致——隐藏状态探针仍可近 97% 解码正确答案,而原始序列评分坍缩至约 33% 随机水平;作者以仅两参数的无标签先验偏移校正,可在 25 例样本下回收 9–34 个百分点准确率并通过严格对照验证。该成果当前为预印本,未经同行评审,评估限于受控逻辑等强迫选择任务。
方法与评估条件
研究构建三阶段诊断链:以冻结隐藏状态的多项逻辑回归探针检验答案是否已编码;以同位置标签 logits 与完整候选答案串的教师强制对数概率和对比,定位词汇投影与序列聚合两处信息丢失;进而引入先验条件加性偏移,仅设两自由度(固定一类偏移为零),在无标签域内评分集合上以网格搜索拟合,使预测分布贴合已知均衡先验,偏移全局生效且不改变同标签内排序,故无法教授新推理。评估按可控递进设计:受控合成逻辑(ID 与词法外分布各 1,000 例)、ProofWriter(1,000 拟合/1,000 测试)、ANLI(R1 拟合/R2 测试)与 FOLIO(203 验证拟合/1,001 训练测试),主扫为协议对齐的 Qwen3.5-2B/4B/9B 训后模型,跨家族在 ProofWriter 上追加 OLMo-2-1B、Llama-3.1-8B 与 Pythia 对照,所有拟合集与测试集严格不相交。
数据范围与主要结果
读出差距显著且一致:Qwen3.5-2B 答案槽探针 ID 91.8%、词法外 66.1% 对序列评分 33.3%;9B 探针达 97.2%/83.0% 仍对 33.3%;Base 版亦现同分歧,9B-Base 同位置 logits 62.7%/60.7% 但全串评分回落至 37.4%/36.1%,证实瓶颈在序列聚合。校正后恢复明确:1,000 例拟合下合成词法外分布上 4B/9B 分别达 57.0%/60.2%,ProofWriter 65.3%/67.8%,ANLI-4B 47.8%→57.1%,均为 p≤0.035。样本效率上,25 例拟合在全部坍缩行均为正增益,ProofWriter 25 例即 +21.6/+27.7 点,30 次确定性子采样全部正向,且 25 与 1,000 例差异≤2.2 点。对照上,TF-IDF 难例切片仍达 62.2%/64.3%,超计数保持置换基线 28.7/30.5 点;跨 20 种提示/表述变体坍缩在 87%–96% 配置中持续,3 套独立生成器种子下 9B 最小 Δ仍 +23.0 点,排除表面捷径与直方图匹配解释。跨任务融合中,校正后的目标准确率与源任务集成互补,在 ProofWriter 难例与深层证明上进一步提升。
局限与不确定性
作者在正文局限章节明确边界:校正依赖已知均衡先验,未解决非平衡或先验未知部署下的同时估计问题;诊断为观测性三角定位,未作因果电路剥离,探针与偏移成功不等于人类式语义处理证明;主链以 Qwen3.5 定制协议为核心,跨家族仅在 ProofWriter 上验证,Pythia 无可靠恢复,现象非普适;拟合仅移除共享标签级偏移 βy,无法修复每例表面形式竞争等细粒度失真,故校正后仍与探针存在残余差距(词法外 57%–60% 对探针 77%–83%);局部基准与单配置显著性不应外推为普遍因果或已获学界共识的事实。
是否同行评审与潜在意义
该工作当前状态为预印本,未发表于期刊或会议,需标注为未同行评审,引用与应用应审慎。其意义在于为零样本推理失败提供可操作的轻量诊断:当预测直方图坍缩至单一标签时,以 25 例无标签数据拟合两参数偏移即可检验能力是缺失还是被输出层掩盖,有助于更审慎解读榜单排名;同时为链式思考将单步分类分散至多步 hidden state 的作用提供机制性解释。潜在应用包括评测校准与阈值诊断,但在大规模部署前仍需同行评审、独立复现与先验自适应方法突破。