TruthInsightBench:用"盲任务"测科研智能体是否真的会"发现"
arXiv:2609.05079 · 2026-09-04 · 预印本 40 个来自同行评审研究的盲任务(跨 10 个学科),只给目标与冻结数据、隐藏结论与路径;LLM 评委按 6 维证据成熟度打分。结果:4 个主流编码智能体挤在 58–6
arXiv:2609.05079 · 2026-09-04 · 预印本 40 个来自同行评审研究的盲任务(跨 10 个学科),只给目标与冻结数据、隐藏结论与路径;LLM 评委按 6 维证据成熟度打分。结果:4 个主流编码智能体挤在 58–6
Human Factors · 2026-09-08 · 期刊论文 比较人–人团队与人–AI 团队在协作决策中的表现,考察信息询问(information inquiry)与团队表现预期如何影响团队过程与结果。 看点 :AI 科研不只发生在
Brazilian Journal of Health Aromatherapy and Essential Oil · 2026-09-08 · 综述 综述药物研发管线中计算技术的演进:从早期专家系统(DENDRAL)、计算机辅助药物设计
Nature Communications · 2026-09-08 · 期刊论文(Karl Friston 等) 论文处理的是"采样哪些结果能最大程度揭示世界模型结构"这一问题,为 结构学习(尤其是规则发现) 提供了原则性方法:在主动推断
arXiv:2606.29193 · AAAI Fall Symposium (ATRACC 2026) · 2026-09-09 · 预印本 提出 Telemetry Claim Adjudicator(TCA) :一种"机制式、无需结果