核心结论

西北大学与南京大学团队于Asia/Shanghai 9月3日首次公告的预印本提出AICOME(AI COntextual MEasurement)框架,核心结论是:当拥有丰富的个体与岗位特征时,基于大模型的个体层面AI测度可以分解为职业均值与个体偏差,从而在情境模型中同时恢复群间与群内效应,而传统的职业层级AI分数只能估计群间差异。该结论来自作者在CFPS 2022中的对比验证,属预印本作者结论,尚未经同行评审与独立复现。

方法与数据范围

框架将个体AI测度Z_i记为潜在概念水平与个体特征、提示协议的函数,通过Z_i = 职业均值 + 个体偏差的分解,分别进入原始情境参数化与偏差情境参数化模型,以区分个体与群体关联。研究使用2022年中国家庭追踪调查(CFPS)职业作为分组单位,样本含丰富的人口、教育、户籍、收入、健康及岗位信息;验证选用计算机使用、外语使用、周工时、管理职责四项CFPS已有调查变量作为可观测基准,对比调查测度W与两种AI测度:富信息提示与调查提示衍生的个体分数及其职业均值。

评估条件与主要结果

验证分四层,均在作者受控环境中进行,未引入外部独立数据集。

  • 1)响应层与模型层:比较AI测度与调查测度的相关性、增量解释力与系数方向,富信息条件下两者可共享较多概念相关信号; 2)情境验证:检验AI测度是否复现调查测度得到的群间与群内结论,处理论意义; 3)四项单维度情境验证中,周工时提供最清晰案例:两种AI提示策略均复现了CFPS中周工时与工作满意度的大幅度负向群间与群内关联,而职业层级测度机械缺失个体偏差;计算机、外语与管理职责的恢复程度次于周工时; 4)边界验证:当特征仅限职业与基础人口信息时各类验证指标显著下滑;当多个相关概念同时视为缺失时,联合情境推断的一致性与解释力进一步减弱。

限制与不确定性

上述结果均为局部基准下的作者实验发现,不能直接推广为普遍或因果事实。除预印本未同行评审外,实验限于CFPS职业分组、中文问卷与特定满意度结果变量,未覆盖潜在维度或跨群体结构;AI测度与调查测度均被视为潜在概念的不完美指标,相关性与拟合相似性不等同于真实性。作者亦强调,AICOME不创造原始数据中不存在的信息,仅在拥有丰富存量特征且待恢复概念较少时最为可信,不应用于替代直接调查或一次性恢复大量缺失题组。

同行评审状态与潜在意义

该工作为9月3日首次公告的预印本(arXiv:2609.02821,提交时间2 Sep 2026 17:09:30 UTC,对应Asia/Shanghai 3 Sep 01:09;当日公告批次标题为Thu, 3 Sep 2026,属当日首次公开),尚未经期刊或会议同行评审。其意义在于将AI测量从单纯的回答预测转向情境推断的恢复,为缺乏直接调查但拥有丰富背景特征的研究提供一种可验证的补充路径,但实际应用仍需在目标群体与概念上进行独立的响应层与情境层验证。