AI能查论文错,但不能独判
AI代理正以规模化方式发现数据库和论文错误,但所引研究从较高精度到极低召回率都有,所有结论仍需人工复核。
60 秒版本
AI代理可以规模化查找科研错误并重跑主张,但当前结果从较高精度到极低召回率和不稳定基准表现都有。
要点
- 化学数据库异常只有在回查原始文献后才成为确认错误。
- 一份预印本中,专家确认316个候选客观错误中的263个,报告精度83.2%。
- SPOT的83篇论文和91个已知严重错误中,所有模型召回率不超过21.1%,精度不超过6.1%。
- 复现失败本身不能证明作者有错,创新性与重要性也仍需人工判断。
结论. AI已能成为科研审计助手,但可信使用必须保留可重复轨迹、专家裁决,并严格区分提示与确认错误。
AI工具能以人工难以达到的规模扫描数据库和论文,也确实找到了一些真实错误。相同证据同时显示低召回、误报和多次运行不稳定。当前合理角色是机器辅助筛查后由人核验,而不是自动判定论文对错。
有效模式AI发现异常,人来确认事实
化学家Sebastian Pios发现AI预测沸点与一个使用75年的参考数据库冲突。他最初怀疑模型,回查原始文献后却发现参考链中有错误,包括论文笔误和源自百年前测量的错误数值。决定事实的是源记录,不是模型自信度。
客观核查一套检查器报告了较高精度
基于GPT五的论文正确性检查器聚焦公式、推导、计算、图表中的可核验问题。专家复核316个候选错误,确认263个,所复核集合中的报告精度为83.2%。预印本刻意不判断创新性、重要性和写作质量。
结果值得关注,但依赖样本、错误定义和AI辅助流程,不能说明所有AI论文都有相同错误数,也不能把论文质量压缩成一个计数。
困难基准已知严重错误仍大量漏检
SPOT基准收集83篇已发表论文及91个曾触发勘误或撤稿的严重错误。所有受测模型的召回率都不超过21.1%,精度不超过6.1%;八次运行中也很少重复找到同一错误,直接暴露漏检、误报和不稳定。
| 异常检测 | 发现模型或计算与参考值冲突,最终应由源记录判断。 |
|---|---|
| 客观查错 | 检验可建立真值的公式、计算、图或表。 |
| 复现实验 | 在可用环境中重跑主张,失败后必须先诊断原因。 |
| 同行判断 | 评价创新性、重要性、解释和伦理,不能缩减为自动检查。 |
可复现性重跑失败是问题,不是定罪
一家企业用代理分析168篇ICML 2026口头报告论文。92篇至少有五项可评估主张,其中34篇被复现至少五分之二,8篇超过80%。这些数字描述代理能重跑多少,不代表多少论文造假或结论错误。
AI可以让科研核查更快,但科学程序仍需要证据轨迹、领域专家和回应机会。
实践负责任审查需要什么
- 记录模型、提示词、工具、代码、数据、环境和被核查的准确主张。
- 每个疑似错误都附可重复计算或执行轨迹。
- 由领域专家裁决,并让作者补充缺失背景或更正。
- 重复核查或使用独立系统测量稳定性。
- 区分疑似问题、确认错误、正式更正和撤稿。
结论扩大审查,不取消责任
研究者和编辑可以用代理检查参考一致性、计算、代码执行和初筛。正确性与重要性的决定需要可审阅证据和承担责任的人。真正目标不是给每篇论文打AI分,而是建立从怀疑到确认或排除的更快、可审计路径。