结论先行

这篇8月10日上线的同行评审论文表明,在一个规模较小、单医疗系统的重度抑郁障碍临床笔记测试集中,GPT-4o可在零样本提示下较高程度复现精神科医生基于同一文本给出的CGI-S严重度评分。这里衡量的是文本评分一致性,不是诊断准确率,也没有证明模型能够替代医生或直接改善患者结局。

研究对象与方法

作者使用约翰斯·霍普金斯情绪障碍登记库中的回顾性电子健康记录。研究先从499份笔记中抽取70份,供三名精神科医生校准抑郁症CGI评分规则;另取77份互不重叠的笔记作为主要测试集。测试集覆盖住院和门诊等场景,全部在进入人工评分和模型评估前去标识。

三名精神科医生分别按1至7分的CGI-S规则独立评分。模型侧比较GPT-4o(gpt-4o-2024-11-20)的零样本与少样本提示,以及Llama 4 Maverick的零样本提示;没有微调。主要指标是加权Cohen κ,并以5000次笔记级自助法估计置信区间。作者还按年龄、性别、种族、就诊场景、笔记长度和复制沿用文本比例做探索性分层。

主要结果

三名医生两两评分的一致性为κ=0.77–0.78。GPT-4o零样本与三人平均评分的一致性最高,为κ=0.85(95% CI 0.78–0.90);少样本为0.84(0.77–0.89),没有显示额外示例带来改善。Llama 4 Maverick零样本为0.70(0.55–0.80)。这些数值是作者在特定模型版本、提示和单一数据集上的结果,并非跨场景性能保证。

GPT-4o零样本在31份笔记上的评分与人工平均值不一致:22份偏高、9份偏低;差异大多不超过1个CGI分值,仅1份出现至少2分的高估。探索性分析还发现,短于中位数1007词的笔记一致性较低(κ=0.72),较长笔记为0.92(P=.003)。其他已分析分层没有显著差异,但样本量不足以排除真实差异。

限制与研究状态

论文由《JMIR Formative Research》以Original Paper发表;出版社XML列出了收稿、修回、接受记录以及编辑和审稿人,因此可归为同行评审论文。最重要的限制是:评分者基于同一文本给分,不等于医生直接评估患者;研究未检验模型评分与同期CGI-S、PHQ-9或MADRS的关系。样本来自单一医疗系统,人工评分者均为作者且未对研究目标设盲,最佳模型又是可能发生版本变化的闭源服务。

潜在意义

若后续在更多机构、疾病和临床人员中完成外部与前瞻性验证,这类方法或可把非结构化精神科笔记转为研究用的标准化结局指标。不过,短笔记性能下降、评分高估倾向和并发效度缺失意味着当前更适合作为待验证的研究工具,而不是自动诊疗或独立临床决策系统。