两阶段自动筛选流程验证:三独立评审者分层一致性研究

人工智能 2026-10-12 11 阅读

medRxiv · 2026-10-07 · 预印本

  • 一句话结论:在医学系统综述的题录-摘要筛选中,两阶段自动流程(规则脚本+大模型裁定)与三名独立人工评审者的分层一致性总体提示较高,但该结论仅针对第一阶段自动排除决策,且不同评审者间差异明显,尚不足以外推为通用验证结论。
  • 研究设计与做法:设计为分层一致性研究(预印本,证据档位C)。从904条已筛记录(第一阶段131纳入、670排除、94不确定;第二阶段经API大模型、温度=0:11纳入、83排除)中,按第一阶段各层50条加第二阶段35条,抽取185条分层样本(随机种子=42),由三名医师在盲法下独立判定。随访时长材料未报告。
  • 主要结果:主要目标为第一阶段排除决策:与E.P.一致时PABAK=AC1=1.000(48/48),与D.C.为1.000(50/50),与Berti为PABAK=0.940、AC1=0.959(48/50排除,2条不确定);该层占670/904(74.1%)。两名外部评审者间一致性最高(PABAK=0.854,AC1=0.881),涉及E.P.时较低(0.703/0.774与0.621/0.702)。AI与各人工评审者一致性仍较差(PABAK 0.225/0.205/0.222)。
  • 机制或解释:作者解释为:既往验证研究多报告敏感度、特异度或Cohen's kappa,在低且不平衡的患病率下不稳定,故采用对患病率稳健的PABAK与Gwet's AC1,并针对不确定类单独抽样、分层抽样与三名独立评审者,以更稳健地评估自动排除决策的一致性。
  • 局限与边界:局限与边界:为预印本、证据档位C;样本来自单一医学主题(高治疗中血小板反应性、阿司匹林抵抗与颈动脉斑块);其中一名评审者E.P.为流程设计者,可能引入偏倚;随访时长、单中心与否、利益冲突均材料未报告;多数标签仅作补充面板,不替代成对表格作为敏感度主要参照。
  • 可否落地:可否落地:对临床与科研而言,该流程在减少人工阅读量方面提示有潜在价值(第一阶段排除层占74.1%),但AI与人工评审者一致性仍差,且评审者间一致性亦不理想,故目前证据档位为C,仅提示需在更多主题与独立评审者中进一步验证,尚不足以下结论支持常规替代人工筛选。

🔗 打开原文

Pirani E, Costazza D, Berti PP.


本文摘自《每日前沿研究简报 · 2026-10-12》「AI 科研智能体」。本内容仅用于研究信息整理与科普交流,不构成医疗建议。

评论 共 0 条

暂无评论

微信小程序

微信扫一扫体验

立即
投稿

微信公众账号

微信扫一扫加关注

发表
评论
返回
顶部