Auditing the Auditor:无标签、可校准地测量 LLM 诊断中的"无依据断言"
arXiv:2606.29193 · AAAI Fall Symposium (ATRACC 2026) · 2026-09-09 · 预印本 提出 Telemetry Claim Adjudicator(TCA) :一种"机制式、无需结果
arXiv:2606.29193 · AAAI Fall Symposium (ATRACC 2026) · 2026-09-09 · 预印本 提出 Telemetry Claim Adjudicator(TCA) :一种"机制式、无需结果
Nature Communications · 2026-09-08 · 期刊论文(Karl Friston 等) 论文处理的是"采样哪些结果能最大程度揭示世界模型结构"这一问题,为 结构学习(尤其是规则发现) 提供了原则性方法:在主动推断
Brazilian Journal of Health Aromatherapy and Essential Oil · 2026-09-08 · 综述 综述药物研发管线中计算技术的演进:从早期专家系统(DENDRAL)、计算机辅助药物设计
Human Factors · 2026-09-08 · 期刊论文 比较人–人团队与人–AI 团队在协作决策中的表现,考察信息询问(information inquiry)与团队表现预期如何影响团队过程与结果。 看点 :AI 科研不只发生在
arXiv:2609.05079 · 2026-09-04 · 预印本 40 个来自同行评审研究的盲任务(跨 10 个学科),只给目标与冻结数据、隐藏结论与路径;LLM 评委按 6 维证据成熟度打分。结果:4 个主流编码智能体挤在 58–6
arXiv:2609.02749 · 2026-09-02 · 预印本 DisCo 智能体把开源生态的领域"操作知识"蒸馏为紧凑、可复用的验证技能,产出 AREX-Skill Library(5000+ 技能)。 看点 :这与本站"技能库"
Dr. Claw (arXiv:2609.00365,2026-08-31):以人机协同 + 持久状态 + 技能库把规划-执行-写作变成一条可恢复、可审计的闭环,比裸 CLI 智能体完整度更高。 BloClaw (AI4S 工作站,2026
场景:微服务事故诊断。核心工具 TCA(Telemetry Claim Adjudicator) 是一个不依赖结果标签的机械裁决器,逐条裁定 LLM 智能体在诊断中引用的遥测断言是否有依据。 配套制品:6 种架构臂 × 2 个基准的诊断 harness;以 SHA-256 请求号
核心问题:如何采样最能揭示世界模型结构的结果——即在若干生成模型/假设之间做最优实验设计(rule discovery)。 数学工具:主动推断中,策略(动作组合)按期望自由能选择 = 期望信息增益 + 价值;信息增益即"含与不含行动后果"两种预测后验之间的 KL 散度。 计算效率
演进脉络:从 DENDRAL 专家系统、计算机辅助药物设计(CADD)、QSAR 建模,到 AlphaFold 3 生物分子复合物预测、计算机辅助合成规划(CASP)、天然产物生物勘探与自主多智能体系统。 重点进展:抗菌筛选、精准肿瘤学、植物化学表征,以及临床阶段的 AI 生成分
背景:传统人–AI 决策研究把过程当作"AI 给建议、人做决定"的线性分段流程;但 LLM 让交互更接近人–人团队的协作——成员必须共享并整合各自独有的信息才能做出好决策。 采用团队研究经典范式 隐藏剖面任务(hidden profile);操纵团队类型(人–AI 98 组 vs