TruthInsightBench:用"盲任务"测科研智能体是否真的会"发现"
arXiv:2609.05079 · 2026-09-04 · 预印本 40 个来自同行评审研究的盲任务(跨 10 个学科),只给目标与冻结数据、隐藏结论与路径;LLM 评委按 6 维证据成熟度打分。结果:4 个主流编码智能体挤在 58–6
arXiv:2609.05079 · 2026-09-04 · 预印本 40 个来自同行评审研究的盲任务(跨 10 个学科),只给目标与冻结数据、隐藏结论与路径;LLM 评委按 6 维证据成熟度打分。结果:4 个主流编码智能体挤在 58–6
Brazilian Journal of Health Aromatherapy and Essential Oil · 2026-09-08 · 综述 综述药物研发管线中计算技术的演进:从早期专家系统(DENDRAL)、计算机辅助药物设计
综述主张人工智能交互不等同于社会交互,需重新审视幼儿期人工智能介导的数字暴露。 该文为综述,因摘要缺失,具体检索策略、纳入文献与分析框架无法从现有信息获知。
arXiv:2606.29193 · AAAI Fall Symposium (ATRACC 2026) · 2026-09-09 · 预印本 提出 Telemetry Claim Adjudicator(TCA) :一种"机制式、无需结果
三种当代大语言模型在苯妥英与地高辛治疗药物监测解读上表现存在领域差异。 向Claude Sonnet 4.6、ChatGPT 5.5与Gemini 3.1 Pro提交30个结构化临床情景,由两名评分者盲法独立评分。
该综述考察机器学习算法预测心血管疾病风险的输出,是否针对Framingham风险评分的已知不足并改善风险估计。 检索Medline、Embase与IEEE自建库至2025年1月1日,纳入将机器学习心血管风险评估输出与FRS直接比较的研究,排除评论、信件及未发表文献。
针对肝胆胰肿瘤多学科决策场景,评估当代大语言模型治疗建议的稳定性及其与团队决策的一致性。 回顾性比较可行性研究,对相同肝胆胰肿瘤病例重复查询大语言模型,考察同一输入下输出是否一致,并与多学科团队决策比对。
研究提出并评估“检索后验证”方法,用于衡量大语言模型生成医学信息的证据支持度与幻觉。 针对AI生成医学信息缺乏源文档明确支持的问题,开展实证研究以直接评估其是否基于底层证据。
演进脉络:从 DENDRAL 专家系统、计算机辅助药物设计(CADD)、QSAR 建模,到 AlphaFold 3 生物分子复合物预测、计算机辅助合成规划(CASP)、天然产物生物勘探与自主多智能体系统。 重点进展:抗菌筛选、精准肿瘤学、植物化学表征,以及临床阶段的 AI 生成分
综述认为,AI与机器学习正成为加速自旋电子材料发现与磁性能预测的有力工具。 文章为综述,围绕自旋电子技术对高自旋极化、大磁矩、可调交换作用与热稳定性的需求展开梳理。