TruthInsightBench:用"盲任务"测科研智能体是否真的会"发现"
arXiv:2609.05079 · 2026-09-04 · 预印本 40 个来自同行评审研究的盲任务(跨 10 个学科),只给目标与冻结数据、隐藏结论与路径;LLM 评委按 6 维证据成熟度打分。结果:4 个主流编码智能体挤在 58–6
arXiv:2609.05079 · 2026-09-04 · 预印本 40 个来自同行评审研究的盲任务(跨 10 个学科),只给目标与冻结数据、隐藏结论与路径;LLM 评委按 6 维证据成熟度打分。结果:4 个主流编码智能体挤在 58–6
Dr. Claw (arXiv:2609.00365,2026-08-31):以人机协同 + 持久状态 + 技能库把规划-执行-写作变成一条可恢复、可审计的闭环,比裸 CLI 智能体完整度更高。 BloClaw (AI4S 工作站,2026
arXiv:2609.02749 · 2026-09-02 · 预印本 DisCo 智能体把开源生态的领域"操作知识"蒸馏为紧凑、可复用的验证技能,产出 AREX-Skill Library(5000+ 技能)。 看点 :这与本站"技能库"
演进脉络:从 DENDRAL 专家系统、计算机辅助药物设计(CADD)、QSAR 建模,到 AlphaFold 3 生物分子复合物预测、计算机辅助合成规划(CASP)、天然产物生物勘探与自主多智能体系统。 重点进展:抗菌筛选、精准肿瘤学、植物化学表征,以及临床阶段的 AI 生成分
场景:微服务事故诊断。核心工具 TCA(Telemetry Claim Adjudicator) 是一个不依赖结果标签的机械裁决器,逐条裁定 LLM 智能体在诊断中引用的遥测断言是否有依据。 配套制品:6 种架构臂 × 2 个基准的诊断 harness;以 SHA-256 请求号
综述认为,AI与机器学习正成为加速自旋电子材料发现与磁性能预测的有力工具。 文章为综述,围绕自旋电子技术对高自旋极化、大磁矩、可调交换作用与热稳定性的需求展开梳理。
核心问题:如何采样最能揭示世界模型结构的结果——即在若干生成模型/假设之间做最优实验设计(rule discovery)。 数学工具:主动推断中,策略(动作组合)按期望自由能选择 = 期望信息增益 + 价值;信息增益即"含与不含行动后果"两种预测后验之间的 KL 散度。 计算效率
从社会语言学视角提出机器“身份”概念框架,探讨大语言模型是否具有可测量的人格及其推理风格受语料语言属性影响。 属概念性视角论文,不提供原始实验数据,也非有既定检索策略与纳入标准的系统综述,而是整合已发表发现。
该综述考察机器学习算法预测心血管疾病风险的输出,是否针对Framingham风险评分的已知不足并改善风险估计。 检索Medline、Embase与IEEE自建库至2025年1月1日,纳入将机器学习心血管风险评估输出与FRS直接比较的研究,排除评论、信件及未发表文献。
背景:传统人–AI 决策研究把过程当作"AI 给建议、人做决定"的线性分段流程;但 LLM 让交互更接近人–人团队的协作——成员必须共享并整合各自独有的信息才能做出好决策。 采用团队研究经典范式 隐藏剖面任务(hidden profile);操纵团队类型(人–AI 98 组 vs