AI論文監査、単独判定はまだ無理
AIエージェントはデータベースや論文の誤りを大規模に見つけ始めましたが、引用研究の性能は高精度から極低再現率まで幅があり、人の検証が不可欠です。
60秒でわかる
AIは科学的誤りの検出と主張の再実行を大規模化できますが、高い適合率から低い再現率と不安定性まで結果は大きく異なります。
要点
- 化学データの異常は原著確認後に初めてデータベース誤りと確定しました。
- 一つのプレプリントでは候補316件中263件を専門家が確認し、83.2%の適合率を報告しました。
- SPOTの83論文と既知の重大誤り91件では、全モデルの再現率は21.1%以下、適合率は6.1%以下でした。
- 再現失敗だけでは著者の誤りを証明できず、新規性と重要性は人の判断が必要です。
結論. AIは科学監査の補助として既に有用ですが、再現可能な履歴、専門家の裁定、指摘と確認済み誤りの区別が不可欠です。
AIは人手では難しい規模でデータベースや論文を走査し、実際の誤りも見つけています。同じ証拠は低い再現率、誤検出、実行間の不安定性も示します。現在の妥当な役割は機械による選別と人の検証であり、自動判定ではありません。
有効な形AIが異常を示し、人が事実を確定する
化学者Sebastian PiosはAI予測の沸点が75年使われたデータベースと違うことに気付きました。モデルを疑った後、原著を確認し、論文の誤植と百年前の測定に由来する誤値を発見しました。事実を決めたのはモデルの確信度ではなく一次資料です。
客観的検査一つの検査器は高い適合率を報告
GPT五ベースの検査器は数式、導出、計算、図表の検証可能な問題に集中しました。専門家は316件の候補から263件を確認し、対象集合の報告適合率は83.2%でした。新規性、重要性、文章品質は判定対象外です。
有望な結果ですが、論文標本、誤りの定義、AI支援パイプラインに依存し、すべてのAI論文の誤り数や品質を一つの数で示すものではありません。
困難な基準既知の重大誤りを多く見逃した
SPOTは、訂正や撤回につながった重大誤り91件と発表済み論文83報を組み合わせました。どのモデルも再現率21.1%、適合率6.1%を超えず、八回の実行で同じ誤りを再発見することもまれでした。
| 異常検出 | 予測・計算と参照値の衝突を示し、一次資料で決着します。 |
|---|---|
| 客観的誤り検査 | 真値を確立できる数式、計算、図表を検証します。 |
| 再現 | 利用可能な環境で主張を再実行し、失敗理由を診断します。 |
| 査読判断 | 新規性、重要性、解釈、倫理を評価し、自動検査へ還元できません。 |
再現性再実行失敗は疑問であり有罪判定ではない
企業分析はICML 2026口頭発表168報を調べました。五項目以上を評価できる92報のうち、五分の二以上を再現できたのは34報、80%超は8報でした。エージェントが再実行できた量であり、不正や誤りの論文数ではありません。
AIは科学監査を速くできるが、科学的手続きには証拠の履歴、専門家、回答機会が必要である。
実務責任ある監査に必要なもの
- モデル、プロンプト、道具、コード、データ、環境、対象主張を記録する。
- 各疑義に再現可能な計算または実行履歴を付ける。
- 分野の専門家が裁定し、著者が背景や訂正を提示できるようにする。
- 反復または独立システムで安定性を測る。
- 疑い、確認済み誤り、正式訂正、撤回を区別する。
結論監査を広げても責任は消さない
参照整合性、計算、コード実行、初期選別にはAIを使えます。正しさと重要性の判断には検証可能な証拠と責任ある人が必要です。目標は全論文へのAI採点ではなく、疑いから確認または棄却までの速く監査可能な経路です。