9月2日,AllenAI 在 Hugging Face 官方博客发布 BenchMIRT,提出以多维项目反应理论审计 LLM 基准的题目级方法。官方称该方法可在不预设基准归属下,分离基准分数背后的能力维度,并在更少题目上保持评估区分度。发布页显示发布时间为 2026-09-01T21:39:07Z,对应上海时间 9月2日 05:39,落于当日 00:00–23:59 窗口内。
核心方法与发现
据官方博客,BenchMIRT 将每道题视为独立测量单元,估计题目难度、区分度及模型在不同能力维度上的强度。研究基于 100 个开源 LLM 在 16 项基准、超 3.4 万题上的结果训练,其中 6 项为 MMLU-Pro、GPQA、MATH 等通用推理基准,10 项来自 Olmo 3 安全套件如 HarmBench、WildJailbreak 等。结果显示模型表现可被安全与通用推理两大维度稳定解释,重复实验亦复现该结构。官方指出,BBQ、WMDP 等常被归为安全的基准实则更关联推理能力,HarmBench 中版权类题目亦偏向推理,单一总分易掩盖内部异质性。
效率与预测能力
官方报告称,按区分度筛选题目后,仅保留 10% 题目即可在安全与推理维度上接近全量基准对模型强弱的排序,保留 50% 更接近全量;利用已学到的模型与题目参数,BenchMIRT 对未观测题目作答正确性的预测准确率达 79%,高于按基准平均表现预测的 70%。这意味着可在大幅减少评测成本的同时保持对核心能力的度量。
边界与下一步
官方同时说明局限:训练与评估模型均截至 2025年3月前发布,未覆盖更新一代模型;发现的维度受所选 16 项基准集合影响,更换基准组合可能呈现不同结构;按题目精简虽提升效率,但也可能被用于构造更易通过的弱化评测,需谨慎使用。相关论文、技术报告、数据与代码已在 AllenAI 与 Hugging Face 开放,后续适用性以官方更新为准。本文基于当日官方博客整理,关键结论为官方自述,尚未经独立第三方同条件复核。
评测分数并非单一能力,题目级审计有助于区分安全与推理信号,并在更少题目上实现更聚焦的基准设计与解读。