审计"审计者":无标签、可校准地测量 LLM 诊断中的无依据断言(ATRACC 2026)
场景:微服务事故诊断。核心工具 TCA(Telemetry Claim Adjudicator) 是一个不依赖结果标签的机械裁决器,逐条裁定 LLM 智能体在诊断中引用的遥测断言是否有依据。 配套制品:6 种架构臂 × 2 个基准的诊断 harness;以 SHA-256 请求号
场景:微服务事故诊断。核心工具 TCA(Telemetry Claim Adjudicator) 是一个不依赖结果标签的机械裁决器,逐条裁定 LLM 智能体在诊断中引用的遥测断言是否有依据。 配套制品:6 种架构臂 × 2 个基准的诊断 harness;以 SHA-256 请求号
演进脉络:从 DENDRAL 专家系统、计算机辅助药物设计(CADD)、QSAR 建模,到 AlphaFold 3 生物分子复合物预测、计算机辅助合成规划(CASP)、天然产物生物勘探与自主多智能体系统。 重点进展:抗菌筛选、精准肿瘤学、植物化学表征,以及临床阶段的 AI 生成分
arXiv:2609.02749 · 2026-09-02 · 预印本 DisCo 智能体把开源生态的领域"操作知识"蒸馏为紧凑、可复用的验证技能,产出 AREX-Skill Library(5000+ 技能)。 看点 :这与本站"技能库"
Dr. Claw (arXiv:2609.00365,2026-08-31):以人机协同 + 持久状态 + 技能库把规划-执行-写作变成一条可恢复、可审计的闭环,比裸 CLI 智能体完整度更高。 BloClaw (AI4S 工作站,2026
arXiv:2609.05079 · 2026-09-04 · 预印本 40 个来自同行评审研究的盲任务(跨 10 个学科),只给目标与冻结数据、隐藏结论与路径;LLM 评委按 6 维证据成熟度打分。结果:4 个主流编码智能体挤在 58–6