审计"审计者":无标签、可校准地测量 LLM 诊断中的无依据断言(ATRACC 2026)

人工智能 2026-09-11 9 阅读

arXiv 预印本 · 2026-09-09 · 预印本 · Yash Rajeshbhai Parikh

  • 场景:微服务事故诊断。核心工具 TCA(Telemetry Claim Adjudicator) 是一个不依赖结果标签的机械裁决器,逐条裁定 LLM 智能体在诊断中引用的遥测断言是否有依据
  • 配套制品:6 种架构臂 × 2 个基准的诊断 harness;以 SHA-256 请求号索引的推理台账——论文中每个数字都能回溯到原始请求–响应对;4 轮盲审人评(352 条断言,附带评分者看过的材料、被隐藏的判定键、逐条判定与理由,以及读第一条前就固定的评分量表)。
  • 可复现性:./reproduce.sh check 秒级运行、无需数据与凭据,用两条独立路径重算论文所有量,并校验手稿格式、引文(Crossref/arXiv)与 README 自身数字;CLAIMS.md 把每条论断映射到生成命令,并声明哪些不可复现MANIFEST.sha256 固定每个文件内容。
  • 数据合规:RCA100 与 AIOps2025 数据集仅限非商业使用、答案键明确禁止再分发 → 脚本改为从原始来源下载,无任何结果依赖私有数据
  • 看点:这是"AI 科研可信度"的方法论样板:可追溯台账 + 预先固定的量表 + 无标签裁决 + 明确的"不可复现清单"。做自己的 LLM 评测时可直接抄这套结构。
  • 🔗 打开原文

本文摘自《每日前沿研究简报 · 2026-09-11》「七、AI 科研智能体 / AI 科学家:可核查性、主动推断与团队协作」。本内容仅用于研究信息整理与科普交流,不构成医疗建议

评论 共 0 条

暂无评论

微信小程序

微信扫一扫体验

立即
投稿

微信公众账号

微信扫一扫加关注

发表
评论
返回
顶部