AI能查论文错,但不能独判

AI代理正以规模化方式发现数据库和论文错误,但所引研究从较高精度到极低召回率都有,所有结论仍需人工复核。

✓ 已核实 来源 Nature news analysis; claims checked against the three cited arXiv preprints and Crossref ⚑ 科研诚信

60 秒版本

AI代理可以规模化查找科研错误并重跑主张,但当前结果从较高精度到极低召回率和不稳定基准表现都有。

要点

  • 化学数据库异常只有在回查原始文献后才成为确认错误。
  • 一份预印本中,专家确认316个候选客观错误中的263个,报告精度83.2%。
  • SPOT的83篇论文和91个已知严重错误中,所有模型召回率不超过21.1%,精度不超过6.1%。
  • 复现失败本身不能证明作者有错,创新性与重要性也仍需人工判断。

结论. AI已能成为科研审计助手,但可信使用必须保留可重复轨迹、专家裁决,并严格区分提示与确认错误。

AI工具能以人工难以达到的规模扫描数据库和论文,也确实找到了一些真实错误。相同证据同时显示低召回、误报和多次运行不稳定。当前合理角色是机器辅助筛查后由人核验,而不是自动判定论文对错。

有效模式AI发现异常,人来确认事实

化学家Sebastian Pios发现AI预测沸点与一个使用75年的参考数据库冲突。他最初怀疑模型,回查原始文献后却发现参考链中有错误,包括论文笔误和源自百年前测量的错误数值。决定事实的是源记录,不是模型自信度。

客观核查一套检查器报告了较高精度

基于GPT五的论文正确性检查器聚焦公式、推导、计算、图表中的可核验问题。专家复核316个候选错误,确认263个,所复核集合中的报告精度为83.2%。预印本刻意不判断创新性、重要性和写作质量。

263/316经人工确认的候选错误
83.2%所复核集合中的报告精度
55.3%抽样NeurIPS论文报告错误数从3.8升至5.9的增幅

结果值得关注,但依赖样本、错误定义和AI辅助流程,不能说明所有AI论文都有相同错误数,也不能把论文质量压缩成一个计数。

困难基准已知严重错误仍大量漏检

SPOT基准收集83篇已发表论文及91个曾触发勘误或撤稿的严重错误。所有受测模型的召回率都不超过21.1%,精度不超过6.1%;八次运行中也很少重复找到同一错误,直接暴露漏检、误报和不稳定。

异常检测发现模型或计算与参考值冲突,最终应由源记录判断。
客观查错检验可建立真值的公式、计算、图或表。
复现实验在可用环境中重跑主张,失败后必须先诊断原因。
同行判断评价创新性、重要性、解释和伦理,不能缩减为自动检查。

可复现性重跑失败是问题,不是定罪

一家企业用代理分析168篇ICML 2026口头报告论文。92篇至少有五项可评估主张,其中34篇被复现至少五分之二,8篇超过80%。这些数字描述代理能重跑多少,不代表多少论文造假或结论错误。

AI可以让科研核查更快,但科学程序仍需要证据轨迹、领域专家和回应机会。

实践负责任审查需要什么

  • 记录模型、提示词、工具、代码、数据、环境和被核查的准确主张。
  • 每个疑似错误都附可重复计算或执行轨迹。
  • 由领域专家裁决,并让作者补充缺失背景或更正。
  • 重复核查或使用独立系统测量稳定性。
  • 区分疑似问题、确认错误、正式更正和撤稿。

结论扩大审查,不取消责任

研究者和编辑可以用代理检查参考一致性、计算、代码执行和初筛。正确性与重要性的决定需要可审阅证据和承担责任的人。真正目标不是给每篇论文打AI分,而是建立从怀疑到确认或排除的更快、可审计路径。