结论:Epiq AI Labs与康奈尔大学团队于上海时间2026年8月28日(27 Aug 17:23 UTC)在arXiv公开CorporateBench会议论文(Accepted to EMNLP Findings),提出基于时序知识库合成企业通信网络的规模化问答基准。在作者覆盖4家企业、总计263,466份文档与5个轻量模型的受控评估中,随企业规模增至超23万文档,关系与时序抽取及问答表现持续下降,且基于文档检索的RAG始终弱于直接查询知识库,差距随规模扩大;但该结论仅来自作者合成环境与有限模型,未经独立验证,不能视为企业真实场景下的普遍结论。
研究对象与方法
研究针对现有企业级评测因保密限制依赖简化合成数据、无法在百万文档规模下保证逻辑一致性的不足,提出CorporateBench构建管线:先以Turtle本体定义公司、部门、团队、员工、项目、任务、会议及MemberOf、ReportsTo等7类关系,再按员工规模对数缩放生成层级结构并在90天季度内模拟任务分配(人均1–3个任务)、六类会议与10%增员扩编,最后以Claude Haiku 4.5为实体与文档生成器,基于3,217条证据字符串与3,000+3,000业务/非业务话题及16种人格与正式/随意的文风指令生成邮件,并在N-Quads图中以OWL校验保证一致性。
数据范围与评估条件
基准包含4家合成公司:Zenith Labs(科技,12人,353文档)、Streamvibe(媒体,122人,3,925文档)、Biocure(制药,1,110人,26,492文档)、Pound(金融,10,210人,232,692文档),合计263,466文档,评估语料超23万。任务分两类五项:抽取类为知识库三元组抽取与主题分类(Biocure 31类、Pound 17类,1,000题测试集),问答类为KB问答、主题问答与整合问答(每公司每类250题,共3,000核心题,含字符串、日期、整数、布尔与字符串集合五种答案类型)。对比设置分为RAG(pgvector+text-embedding-3-small,k=10,最多5次调用)与KB直接SQL查询两种。评测模型为Claude Haiku 4.5、Claude Sonnet 4.5、GPT-5 Nano、GPT-5.1、Gemini 2.5 Flash Lite五款轻量模型,人类验证环节对100封邮件的平衡正负样本进行1,000次二分类判断。
主要发现(作者报告,未独立验证)
作者报告:抽取任务中实体识别相对稳健(F1 0.715–0.824),而关系抽取随规模显著退化(S企业0.419–0.845至XL企业0.205–0.494),时序关系最难(S企业0.142–0.470至XL企业0.062–0.173),错误主要源于实体错误级联与跨文档矛盾描述累积。主题分类在Biocure上LLMs零样本即达0.872–0.950,50样本后0.877–0.982接近TF-IDF+LR用10K样本的0.993;而在Pound上零样本仅0.357–0.531,50样本后0.598–0.751仍显著低于基线0.983,显示层次化合并导致语义重叠。问答任务上所有模型均呈现规模越大越差的趋势,且KB直接查询最优分始终高于RAG最优分,差值由S企业的0.24扩大至XL企业的0.37;作者强调高文档/问题比(87.6,对比最接近基准EKRAG仅1.5)要求模型在数百文档间整合证据,凸显长上下文理解与真实企业推理的差距。
局限与同行评审状态
该工作在arXiv页标注Accepted to EMNLP Findings,本次为2026年8月28日(上海)首次公开的arXiv:2608.27391v1版本,完整会议论文集尚未出版,尚未获独立复现,不应视为已确立的同行评审事实。关键限制包括:合成通信网络仅覆盖邮件等单一文档类型与90天模拟,未验证跨真实企业、跨语言与跨年度的适用性;文档与实体均由单一LLM生成,人类验证正确率76.2%说明部分证据表述不够显式,存在幻觉与偏置风险;评估仅限5个轻量模型与固定检索参数,未覆盖更大上下文窗口、更强检索或人工协作流程;问答模板虽经SPARQL校验,但仍为模板实例化而非真实企业提问,答题上限受text-to-SQL本身难度限制。
潜在意义
若后续获同行评审与外部复现支持,该基准为LLM在企业级规模下的检索、抽取与推理提供了可复现、确定性答案的评估抓手,提示在接近真实企业规模(数十万文档)时,仅扩展上下文窗口不足以保证长上下文理解,检索与知识库构建的鲁棒性更为关键;对面向企业知识工作的模型选型与检索增强设计具参考价值,但在部署前仍需在真实企业数据、多模态文档与更强基线下的前瞻验证。