Journal of Behavioral Data Science · 2026-09-09 · 期刊论文 · Kim H 等
- 背景:功效分析(power analysis)对定量研究的严谨性至关重要,但因专用软件门槛高而使用不足;LLM 正被快速整合进研究实践,其在统计任务上的可靠性却缺乏系统评估 —— 存在"未经检验或过于乐观地使用"的风险。
- 设计:评估四种广泛使用的 LLM —— ChatGPT(GPT-3.5、GPT-4、GPT-4o)与 Llama 3.2,共两个实验。
- 实验 1:检验 LLM 能否为常见统计检验(两样本 t 检验、单因素 ANOVA、χ² 拟合优度检验)计算所需样本量,并对比不同提示策略(直接计算 vs 生成 R/Python 代码)。
- 实验 2:评估模型识别功效分析所需缺失输入参数的能力 —— 这是需要方法学理解的任务。
- 结果:GPT-4 与 GPT-4o 在生成 R 代码做样本量估计时表现良好,但直接在数值计算上表现吃力;模型能检测到缺失信息,但可靠性随统计情境变化。
- 结论:LLM 可在结构化与启动功效分析时提供支持,但不能替代专家判断;负责任地整合 LLM 需要批判性监督、交叉验证与方法学评估。
- 看点:一个非常实用的边界结论 —— "会写代码" ≠ "会算对"。在自己的科研工作流里用 LLM 时,把"生成代码"与"给出数值结论"分开要求,前者可靠得多。
- 🔗 打开原文
本文摘自《每日前沿研究简报 · 2026-09-12》「七、AI 科研智能体 / AI 科学家:小模型智能体与能力边界」。本内容仅用于研究信息整理与科普交流,不构成医疗建议。

发表评论 取消回复