TruthInsightBench:用"盲任务"测科研智能体是否真的会"发现"
arXiv:2609.05079 · 2026-09-04 · 预印本 40 个来自同行评审研究的盲任务(跨 10 个学科),只给目标与冻结数据、隐藏结论与路径;LLM 评委按 6 维证据成熟度打分。结果:4 个主流编码智能体挤在 58–6
arXiv:2609.05079 · 2026-09-04 · 预印本 40 个来自同行评审研究的盲任务(跨 10 个学科),只给目标与冻结数据、隐藏结论与路径;LLM 评委按 6 维证据成熟度打分。结果:4 个主流编码智能体挤在 58–6
Brazilian Journal of Health Aromatherapy and Essential Oil · 2026-09-08 · 综述 综述药物研发管线中计算技术的演进:从早期专家系统(DENDRAL)、计算机辅助药物设计
综述主张人工智能交互不等同于社会交互,需重新审视幼儿期人工智能介导的数字暴露。 该文为综述,因摘要缺失,具体检索策略、纳入文献与分析框架无法从现有信息获知。
arXiv:2606.29193 · AAAI Fall Symposium (ATRACC 2026) · 2026-09-09 · 预印本 提出 Telemetry Claim Adjudicator(TCA) :一种"机制式、无需结果
三种当代大语言模型在苯妥英与地高辛治疗药物监测解读上表现存在领域差异。 向Claude Sonnet 4.6、ChatGPT 5.5与Gemini 3.1 Pro提交30个结构化临床情景,由两名评分者盲法独立评分。
该综述考察机器学习算法预测心血管疾病风险的输出,是否针对Framingham风险评分的已知不足并改善风险估计。 检索Medline、Embase与IEEE自建库至2025年1月1日,纳入将机器学习心血管风险评估输出与FRS直接比较的研究,排除评论、信件及未发表文献。
针对肝胆胰肿瘤多学科决策场景,评估当代大语言模型治疗建议的稳定性及其与团队决策的一致性。 回顾性比较可行性研究,对相同肝胆胰肿瘤病例重复查询大语言模型,考察同一输入下输出是否一致,并与多学科团队决策比对。
由 Google Brain 团队发起的端到端开源机器学习平台,提供工具、库与社区资源,供研究者开展机器学习与神经网络研究并部署应用。
针对CI/CD下代码变更使既有测试用例失效的问题,提出基于变异的多智能体测试用例更新方法。 指出近期基于大语言模型的测试更新方法依赖执行反馈与精确匹配上下文检索,优先保证可执行性与行覆盖率。
背景:功效分析(power analysis)对定量研究的严谨性至关重要,但因专用软件门槛高而使用不足;LLM 正被快速整合进研究实践,其在统计任务上的可靠性却缺乏系统评估 —— 存在"未经检验或过于乐观地使用"的风险。 设计:评估四种广泛使用的 LLM —— ChatGPT(G