ChemRxiv · 2026-09-09 · 预印本 · Voinea A 等
- 问题:化学文献中大量物理数据分散在非结构化文本与复杂表格里;将其转为机器可读格式是训练数据驱动化学模型的前提。但计算抽取的数据集普遍缺乏不确定性量化,导致人工抽取与整理仍不可省。
- 方案:一个完全自动化、带不确定性量化的抽取流水线 —— 用 LLM 直接从科学 PDF 中抽取复杂表格与文本化学数据,并系统评估多种现代 LLM 与"文档转文本"框架。
- 验证方式:把计算抽取的数据库与大型人工整理溶解度数据库对比,以基准化抽取不确定性。
- 结果:流水线捕获了文献所含数据的 93%–79%;对结构匹配行中位对数偏差接近于零,残余高量级偏差集中于难例。
- 看点:关键创新是"不确定性量化" —— 大多数 LLM 抽取工作只报告"抽对了几成",而这篇把偏差分布当作一等公民,这正是让数据库能被下游模型信任的前提。⚠️ 预印本,未经同行评审。
- 🔗 打开原文
本文摘自《每日前沿研究简报 · 2026-09-12》「七、AI 科研智能体 / AI 科学家:小模型智能体与能力边界」。本内容仅用于研究信息整理与科普交流,不构成医疗建议。

发表评论 取消回复