多中心评估大语言模型与肝病医师预测药物性肝损伤预后

人工智能 2026-10-01 9 阅读

Liver international : official journal of the International Association for the Study of the Liver · 2026-10-01 · 期刊论文

  • 一句话结论:在药物性肝损伤(DILI)预后预测中,大语言模型(Gemini-2.5 Pro、GPT-5.1)的AUROC接近高年资肝病医师,但准确度与特异度均低于医师,提示其或可作为临床医师监督下的辅助工具,尚不足以独立替代医师判断。
  • 研究设计与做法:多中心队列研究,纳入3个中心共943例DILI患者,分内部与外部队列,随访12个月;结局分为恢复、6/12个月慢性化与死亡;由大语言模型、初/中/高年资肝病医师及Hy's Law、nHy's Law、MELD评分分别估计结局概率,并采用VOTE、OR、AND等LLM-Rules整合。
  • 主要结果:6个月慢性化方面,高年资医师AUROC最高(0.61),准确度70%;Gemini-2.5 Pro与GPT-5.1的AUROC分别为0.60与0.59,优于初、中年资医师;Gemini-2.5 Pro与高年资医师一致性最强(κ=0.43)。总体死亡方面,高年资医师AUROC最高(0.87),准确度83%;Gemini-2.5 Pro与GPT-5.1均为0.86,优于初年资医师、Hy's Law与nHy's Law;GPT-5.1与高年资医师一致性最强(κ=0.25)。12个月慢性化结果类似。
  • 机制或解释:作者未在摘要中阐述模型预测差异的生物学或算法机制,仅提出LLM-Rules(VOTE、OR、AND)可提升稳定性,其中OR规则提高敏感度、AND规则提高特异度;机制层面材料未报告。
  • 局限与边界:研究为三中心设计,外部验证队列规模与人群构成材料未报告;随访为12个月,长期结局未知;各模型版本与提示策略可能影响结果;利益冲突与资金来源材料未报告。
  • 可否落地:对临床而言,提示大语言模型可作为医师监督下的补充预测工具,但准确度与特异度有限,不宜单独用于DILI预后决策;对科研而言,支持多模型整合规则以平衡敏感度与特异度。证据档位为B,属证据支持其辅助价值、但不足以下结论可替代医师。

🔗 打开原文

Fu H, Du Y, Zhao G 等


本文摘自《每日前沿研究简报 · 2026-10-01》「AI 科研智能体」。本内容仅用于研究信息整理与科普交流,不构成医疗建议。

评论 共 0 条

暂无评论

微信小程序

微信扫一扫体验

立即
投稿

微信公众账号

微信扫一扫加关注

发表
评论
返回
顶部