结论先行
MIT CSAIL团队于2026年9月2日(上海日历日,对应arXiv公告Wed, 2 Sep 2026与提交历史Tue, 1 Sep 2026 17:19:57 UTC)在arXiv首次公开的预印本《Retrieved but not ranked: surface-form bias in structural retrieval, from mathematics to agent trajectories》表明:当结构与表述被刻意分离时,嵌入检索会锚定表层词形而非结构。数学最难伪装下两款生产嵌入器严格命中率为0.0%且正确答案几乎总在前10,智能体轨迹在严格跨物与跨容器定义下三款嵌入器均低于机遇;同一词形重排对照在数学域损害、在轨迹域帮助,LLM重排虽在两域均闭合部分可恢复缺口但仅方向可复现、幅度与最优裁判均随域而变。研究为预印本、未同行评审、限受控基准,需审慎解读。
方法与评估条件
方法采用跨域共享协议以隔离基准构造影响。数学域使用MathNet-Retrieve的500查询对117,088项全库做全量余弦排序,查询为竞赛题在two-tier伪装下的等价改写语料库在层级间保持字节一致、仅金标变化并植入词形相似但结构不同的近miss;智能体域使用ALFWorld的336轨迹语料与118查询(官方40题加公开valid_unseen增补78题),以六类任务类型定义结构相关并设置“不同目标物”与“不同目标物+不同容器”两级严格定义,相关判定经规则与分层人工抽审验证。嵌入检索固定为查询单次嵌入对全库余弦排名,数学用gemini-embedding-001与Qwen3-Embedding-8B(DeepInfra与实验室双部署对照),轨迹增加MiniLM-L6-v2;重排均在同一Top10上进行,词形对照为三信号平均的朴素词形分,LLM裁判为Gemini 3.1 Flash-Lite、GLM-5.2与Claude Haiku 4.5在terse与链式思考提示下的单选重排,指标为严格Hit@k与可恢复缺口占比并报告bootstrap 95%区间与配对差异检验。
评估条件与数据范围明确受限:数学域严格金标为源题、宽松计入近miss以度量可恢复缺口;轨迹域以任务类型为金标并报告超几何机遇精确基线;两域均先以已发表数值为验证门(数学easy层Hit@1/5/10在1点内复现、轨迹mAP在0.007内复现)后再进入新测量;下游效用以DeepSeek-v4-flash在32,768 token预算下对210数学题的三种条件(无上下文、对抗性坏检索、金标+解答)配对对比,双裁判在96—99%上一致并记录完成原因以分离截断影响。
主要结果
- 数学基线:hard层严格Hit@1为0.0%[0.0,0.0]两者,严格Hit@10与宽松Hit@10差距即为可恢复缺口;84—98%未命中为植入近miss且95.2—99.8%胜出者更词形相似,个例显示单字符不等式翻转即可超越重命名变量的真等价 轨迹基线:严格Hit@1在定义i下与机遇持平或略低(Qwen 17.8%[11.0,25.4]/Gemini 15.3%[9.3,22.0]/MiniLM 9.3%[4.2,14.4]对机遇15.3%),在定义ii下三者均低于机遇,方向性表明非中立而是被词形主动拉偏 词形对照符号翻转:同一朴素重排在数学easy层损失可恢复缺口9.1%与4.8%(hard持平),在轨迹严格定义下闭合25.9%[11.3,41.2]、36.4%[23.4,50.0]、32.1%[18.5,47.1]且全部排除零;动词与名词消融显示轨迹增益主要来自动词与容器词重叠,作者据此提出以符号作为基准表层变化类型的廉价诊断 LLM重排:数学terse下12个单元全为正但幅度分离显著(Haiku在easy达58.1%/63.3%而hard仅5.4%/6.7%,Gemini链式思考在easy翻倍而hard减半),轨迹terse下闭合43—76%且裁判排序反转(GLM领先1.3—1.7倍、与数学域相反);21个裁判×配置单元方向全正但幅度、层级分布与离群裁判均随域变化,配对差异在所有配置上排除零,且在同一域内查询风格切换即可使Gemini增益下滑超三分之一 下游效用:oracle与对抗检索在准确率上无差异(13对10翻转p=0.678,11对8 p=0.648),在64个零样本失败子集上金标仅挽回10题却破坏13题已解题净-3;仅看127个三条件均完成的作答时准确率为97.6—100%,双裁判零到两对分歧,表明69.5%零样本标题准确率主要为截断代理而非求解能力,检索几乎无操作空间
局限、是否同行评审与潜在意义
局限在论文第9—10章与全文中明确披露:结论仅在两域、有限查询与嵌入器集合、固定Top10与特定裁判提示下成立;LLM裁判存在记忆偏置(数学增益在一组中集中于IMO/USAMO/APMO等知名竞赛)与风格敏感性;私有lab-hosted嵌入与GLM端点结果外部不可独立复现;下游实验仅单求解器单预算且截断率约31%虽跨条件均匀但仍为显著警告;八起评估完整性事件(含静默截断解析为有效输出)虽被审计捕获,但提示评测链路对截断与链路配置敏感。局部基准与模拟条件下的相关性不得写成普遍因果或行业共识。
作者强调:direction replicates across judges but effect sizes, tier profiles, and even which judge is outlier change with domain; part of the recovery is memorization, and the solver's 69.5% zero-shot accuracy is largely a truncation proxy leaving near-zero headroom for retrieval. 该判断为作者在受控评估内的解释,需独立验证。
是否同行评审:arXiv:2609.01556v1标注为预印本,提交历史为Tue, 1 Sep 2026 17:19:57 UTC,对应上海公告日Wed, 2 Sep 2026,尚未同行评审,需等待后续审议与独立复现。潜在意义在于为中国关注检索增强生成、嵌入选型与评测设计的团队提供可操作的审慎参考:在结构与表述分离的任务上,嵌入检索的Top1失败可能并非未召回而是未排序,简单的词形对照可先用于判断基准是“对抗性改写”还是“偶发性变体”,而LLM重排的收益方向可复现但数值与最优裁判不可移植;同时,下游是否能从更优检索中获益取决于求解器在完成作答上的真实余量,单点准确率需与完成率联合解读。
本文证据来自2026年9月2日上海当日首次公告的预印本及同日公告列表,已对关键数值、置信区间与适用条件做区分表述,未将相关性、模拟结果或预印本结论外推为普遍事实。