结论:清华大学、腾讯优图实验室与华威大学团队于上海时间2026年8月31日通过arXiv首次公开预印本ElephantBench,核心结论是:即使面对已验证的长尾分歧事实,最强闭源与开源大模型也只能在约半数问题上完整召回全部验证答案(Kimi-K3完整召回52.38%,Gemini-3.1-Pro与GPT-5.5约50%),近半数回答为仅召回一方的“认知近视”,扩大参数与增加推理可提升可达性但未消除不完整性。该结论来自作者对1,094题、22领域、32模型配置的受控闭本书测量,尚未经同行评审或独立验证,不应视为普遍生产表现或已获学界共识。

研究对象与方法

研究针对传统事实问答以单一标准答案衡量、无法检验模型对长尾分歧知识完整记忆的问题。方法上,作者将已过滤的低曝光网页语料D_low建模为文档图:先以SuperGPQA知识标签与T-NER实体进行候选检索,再以LLM分类器诱导支持与冲突边,冲突边经支持邻居扩展为局部子图后,由GPT-5.6-Sol合成命名实体与线索两种提问形式,每题答案集须在子图原文中显式支持,并经独立网页检索与人工复核双重外部验证,源文档在评估时完全对模型隐藏。

评估条件与数据范围

评估数据为1,094题经去重保留的问答对,覆盖新闻、人物组织事件等22领域,最大领域新闻与公共信息占39.4%。评估覆盖26个开放权重与6个闭源共32个配置,默认启用推理、温度0,采用闭本书提示仅发送系统指令与问题,不提供源文档或工具;评判由GPT-5.6-Sol按C(完整召回)、P(部分召回)、F(失败召回)与条件完整性K=C/(C+P)四指标判定。曝光分析以D_low中主导与少数答案的支持文档数N_maj、N_min为观测代理,补充跨领域、跨模型或acles与PPL代理等分析。

主要发现(作者报告,未独立验证)

以下均为作者在设定条件下的报告结果,属相关性与局部基准发现,未经独立复现,不应写作普遍因果或行业通用水平。

  • 闭本书可达性高而完整性低:三强模型失败仅2.19%–2.65%,但完整召回52.38%/50.37%/50.18%,部分召回45.25%–47.44%,表明模型几乎总能想起至少一方,却常遗漏另一验证方。 规模效应:<10B平均完整5.48%,>1T达52.38%;Qwen3.5族内2B→397B完整1.65%→32.27%、失败81.35%→8.50%,但部分17.00%→59.23%,可达性提升多转化为不完整。 推理增益分化:GPT-5.6-Sol与GPT-OSS-120B开启推理分别+13.99/+12.89个百分点,Qwen3.5在9B–397B上+0.73至+4.39个百分点,而2B/4B下降0.64/0.37个百分点,附录案例显示推理可能将一分歧视为共识而丢弃另一方。 曝光不对称:N_maj−N_min越大越偏向部分召回,N_min越大越利于完整;标准化回归显示主导侧曝光+1σ部分升14.18个百分点、失败降10.17个百分点,少数侧+1σ完整升15.13个百分点、部分降15.41个百分点。 互补与盲点:32配置贪心或acles完整从52.4%升至81.2%且失败归零,但仍有206题(18.8%)对所有配置均为部分召回,显示共享盲点;问题表述差异(命名实体vs线索)均值仅0.65个百分点且不显著,条件PPL与生成评判高度一致可作低成本代理。
作者强调:暴露不平衡有利于主导记忆,而少数侧曝光更关联完整记忆;该关联基于代理语料观测,非对各模型训练数据的直接测量。

局限与同行评审状态

该工作为arXiv:2608.28478v1预印本,于Fri 28 Aug 2026 16:06 UTC提交,按arXiv周五截点与周末不公告规则于Mon 31 Aug 2026 00:00 UTC(上海08:00)公告并进入cs.CL当日列表,视为上海当日首次公开,尚未经期刊或会议同行评审,标注under review。关键限制见limitations,局部基准与模拟关联不得写作普遍事实或已获同行认可。

  • 代理语料与真实预训练混合差异未知,曝光结论为关联而非因果;22领域与1,094题无法代表全部长尾与分歧类型。 仅32模型与特定推理档位,LLM评判体系与人工一致性有限,跨模型与跨时间泛化需后续验证。 闭本书设置与实验室提示、温度等条件绑定,真实检索增强或工具使用场景下的表现未评估。 数据集虽经三重校验,仍可能含源错误或信息时效漂移,人审已移除敏感与有害内容但不保证零遗漏。

潜在意义与适用边界

若后续获同行评审与多源复现支持,ElephantBench为诊断大模型参数化记忆的“完整性”提供了可复用的探针与构库流水线:区分“能否想起事实”与“能否想起全部验证分歧”,并提示数据策展中应关注少数侧曝光而非仅增加总体频次。适用时需注意其闭本书、无工具的严格设定与代理语料局限,落地前应在检索增强、不同评判体系与更广模型覆盖中进一步校验。