核心结论

耶路撒冷希伯来大学与IBM研究院等团队在9月3日(按Asia/Shanghai计,arXiv显示为2 Sep 2026 17:42 UTC,对应上海3 Sep 01:42)发布预印本指出:自然出现的用户反馈是可显著提升大语言模型修订质量的独特信号,但在现有LLM-as-a-Judge评估范式下该价值被系统性低估。研究为预印本,未经同行评审,结论限于受控的合成与英语真实对话场景,推广性与训练阶段效应仍需验证。

方法与数据范围

团队构建两类数据以隔离反馈效用:合成数据基于Arena-Hard-v2.0的500个hard prompt真实查询,取o3模型的正确回答并用Gemini-3-Flash按四类可控破坏(因果倒置、关键遗漏、实体/主体替换、逻辑算符反转)生成缺陷回答与三档反馈(告知如何修复、仅指出问题、仅称有问题);自然数据来自ShareLM的真实人机对话,用Qwen3-30B抽取反馈并以Gemini-3-Flash过滤出对未来用户也适用的反馈。改进器对比“有反馈”与“无反馈”两版修订,分别以Gemini-3-Flash-preview与Qwen3-8B验证,并用Gemini-3.1-Pro作问题解决与成对偏好裁判,部分以自判对照。

主要结果

  • 合成2000例:大模型有反馈解决率95.6% vs 无反馈86.3%,小模型77.9% vs 42.7%,相对提升约9–35个百分点;自然1000例:大模型89% vs 70%,小模型53% vs 26%,提升约16–27个百分点,小模型获益更大。 仅有反馈才修复的子集上,裁判正确偏好率合成大模型54.6%、小模型80.9%,自然大模型34%、小模型54%,多数情况下错误偏好无反馈版本或平局。 以小模型的有反馈正确样本为基准,大模型裁判在自身可自修复组准确率87.7%,在仅依赖反馈组降至72.2%,自判时小模型从80.8%降至67.6%,显示生成与评估能力的相关失效。 内容分析显示有反馈修订更多触及事实性、完整性与逻辑,无反馈修订多为语气与格式等风格编辑,裁判偏好风格导致偏差。

局限与待验证事项

作者自陈局限包括:合成结论主要基于数学与代码类hard prompt,创意写作破坏与修复有效性较低;自然数据为英语且经模型过滤,覆盖面有限;成对评估未系统人工复核,问题解决评估也仅小样本人工校验;实验为推理时修订,未涉及训练;模型组合有限,弱反馈效应已显示但增益随信号减弱而下降。相关性与模拟结果未被写作普遍或因果事实。

是否同行评审与潜在意义

该工作为arXiv预印本(arXiv:2609.02859v1),截至上海时间9月3日检索未见期刊或会议正式接收信息。作者认为发现提示:LLM裁判无法识别自身无法独立完成的修复,过度依赖LLM裁判会人为抑制基于开放用户反馈的对齐与自进化路径,社区需构建更稳健的评估框架、专用奖励模型或交互式评估;开放反馈或许提供了模型权重中未编码的独特信号,需以隔离于语言可读性的系统层保障配合评估。