Auditing the Auditor:无标签、可校准地测量 LLM 诊断中的"无依据断言"
arXiv:2606.29193 · AAAI Fall Symposium (ATRACC 2026) · 2026-09-09 · 预印本 提出 Telemetry Claim Adjudicator(TCA) :一种"机制式、无需结果
arXiv:2606.29193 · AAAI Fall Symposium (ATRACC 2026) · 2026-09-09 · 预印本 提出 Telemetry Claim Adjudicator(TCA) :一种"机制式、无需结果
三种当代大语言模型在苯妥英与地高辛治疗药物监测解读上表现存在领域差异。 向Claude Sonnet 4.6、ChatGPT 5.5与Gemini 3.1 Pro提交30个结构化临床情景,由两名评分者盲法独立评分。
该综述考察机器学习算法预测心血管疾病风险的输出,是否针对Framingham风险评分的已知不足并改善风险估计。 检索Medline、Embase与IEEE自建库至2025年1月1日,纳入将机器学习心血管风险评估输出与FRS直接比较的研究,排除评论、信件及未发表文献。
针对肝胆胰肿瘤多学科决策场景,评估当代大语言模型治疗建议的稳定性及其与团队决策的一致性。 回顾性比较可行性研究,对相同肝胆胰肿瘤病例重复查询大语言模型,考察同一输入下输出是否一致,并与多学科团队决策比对。
研究提出并评估“检索后验证”方法,用于衡量大语言模型生成医学信息的证据支持度与幻觉。 针对AI生成医学信息缺乏源文档明确支持的问题,开展实证研究以直接评估其是否基于底层证据。
演进脉络:从 DENDRAL 专家系统、计算机辅助药物设计(CADD)、QSAR 建模,到 AlphaFold 3 生物分子复合物预测、计算机辅助合成规划(CASP)、天然产物生物勘探与自主多智能体系统。 重点进展:抗菌筛选、精准肿瘤学、植物化学表征,以及临床阶段的 AI 生成分
综述认为,AI与机器学习正成为加速自旋电子材料发现与磁性能预测的有力工具。 文章为综述,围绕自旋电子技术对高自旋极化、大磁矩、可调交换作用与热稳定性的需求展开梳理。
场景:微服务事故诊断。核心工具 TCA(Telemetry Claim Adjudicator) 是一个不依赖结果标签的机械裁决器,逐条裁定 LLM 智能体在诊断中引用的遥测断言是否有依据。 配套制品:6 种架构臂 × 2 个基准的诊断 harness;以 SHA-256 请求号
结论:医护人员对大语言模型在医疗中的使用持有多元看法,其采纳与监管偏好可通过调查加以刻画。 设计:通过某医疗新闻平台邮件列表在线发放横断面问卷,共335名医护人员作答,含主治医师等。
arXiv:2609.02749 · 2026-09-02 · 预印本 DisCo 智能体把开源生态的领域"操作知识"蒸馏为紧凑、可复用的验证技能,产出 AREX-Skill Library(5000+ 技能)。 看点 :这与本站"技能库"