风湿病指南驱动大语言模型聊天机器人全国多中心评估

人工智能 2026-10-07 25 阅读

Journal of Medical Systems · 2026-10-05 · 期刊论文

  • 一句话结论:在真实使用场景中,基于德国风湿病指南开发的大语言模型聊天机器人获得以正面为主的用户反馈,提示其在患者自我管理与教育中可能具有辅助价值;但指南依从性评估结果与医师判断一致性较弱,尚不足以下结论认为其可替代专业指导。
  • 研究设计与做法:研究为开发与全国多中心评估,共开发10个疾病特异性聊天机器人,通过13个风湿病中心和6个患者组织部署。用户对回答评分并填写问卷,采用类别编码与六维LLM-as-a-judge评估,并在随机子集中将LLM评分与风湿科医师评分比较。随访时长为2025年9月至2026年1月。
  • 主要结果:共记录6291个问题,最常见类别为疾病特异性问题(50.2%)、药物与监测(37.3%)、诊断(28.2%)。263次交互(4.2%)无法回答。2671条被用户评分的回答中2481条(92.9%)获正面评价;负面评价最常见原因为细节不足(125/190,65.8%)。602名问卷受访者中,84.6%认为易用,84.1%认为答案易懂,80.2%认为是有用补充。LLM评估中95.3%回答被评为完全安全,79.1%完全正确;指南依从性单独评估为45.0%完全依从,与医师评估一致性弱。
  • 机制或解释:作者解释为:基于指南的聊天机器人可在真实世界使用中提供以正面为主的用户体验,LLM评估提示多数回答安全且正确;用户问题与反馈可帮助迭代改进源内容和患者教育材料。未讨论具体作用机制。
  • 局限与边界:局限包括:研究为真实世界评估,未设对照,无法判断教育效果;指南依从性仅45.0%完全依从且与医师评估一致性弱;LLM-as-a-judge评估可能无法独立验证回答质量与临床安全性;材料未报告随访时长对临床结局的影响、单中心偏倚、利益冲突等信息。
  • 可否落地:对临床实践:该聊天机器人可作为患者教育的辅助工具,证据档位为「提示」其可能有用,但不应替代医师判断。对科研:需进一步开展对照研究评估教育效果,并独立验证回答质量与临床安全性;当前证据「不足以下结论」支持其常规临床推广。

🔗 打开原文

Tim Wilhelmi, Vanessa Bartsch, Marius Platt 等


本文摘自《每日前沿研究简报 · 2026-10-07》「AI 科研智能体 / AI 科学家」。本内容仅用于研究信息整理与科普交流,不构成医疗建议。

评论 共 0 条

暂无评论

微信小程序

微信扫一扫体验

立即
投稿

微信公众账号

微信扫一扫加关注

发表
评论
返回
顶部