LLMの疎な報酬座標という仮説

プローブと活性介入で、答えの価値と段階的報酬誤差を追う少数の隠れ状態座標が報告されたが、神経科学用語は比喩で、査読前である。

未検証 出典 Unreviewed arXiv preprint; existence and metadata verified against arXiv and OpenAlex, findings not independently replicated ⚑ AI解釈可能性

60秒でわかる

査読前プレプリントは、訓練プローブ下で価値と報酬予測誤差を追う疎で介入感受性の高いLLM座標を報告した。

要点

  • 一部剪定試験で1%未満の座標がプローブ性能を保った。
  • 標的介入で一QwenモデルのMATH500精度が大幅に低下した。
  • 信頼度予測と誘導探索は選定条件で小幅改善した。
  • 座標集合はプローブ、層、課題、報酬定義に依存する。
  • 神経科学語は比喩で、ドーパミンや意識の証拠ではない。

結論. 有望な機械的解釈可能性仮説だが、査読済み・独立再現済みの報酬系発見ではない。

方法隠れ状態をプローブで探索

Transformer隠れ状態に小型プローブを訓練した。一つは未完成解答の最終正解確率、もう一つは推論段階間の時間差分誤差を推定する。

価値座標終端正解性や期待価値の予測に使われるため選択された。
TD誤差座標段階間の推定成功率変化を追うため選択された。
疎性試験低重み入力を除き、予測に必要な最小次元を調べた。
介入特定層の選択活性をゼロにして精度を再測定した。

結果1%未満で信号を保つ場合

著者報告の複数モデル・ベンチマークで、大幅な剪定後も少数座標が近いプローブ性能を維持した。数学、コード、指示追従を含むが、全試験が全モデルを網羅したわけではない。

1%未満一部剪定試験の座標
75.2%一介入前のMATH500精度
20.3%標的介入後の層平均
77.8%一誘導探索の精度

解釈復号可能性は生物学ではない

Transformer座標は計算上の数値である。ニューロンは略称にすぎず、ドーパミンニューロンは報酬予測誤差との数学的類似を表すだけである。

報告されたのは疎な報酬関連表現であり、モデル内の脳ではない。

限界一般機構は未証明

  • プレプリント:査読や独立再現は確認できない。
  • プローブ依存:座標はプローブと剪定規則で変わる。
  • 特徴の絡み合い:介入は同座標の別機能も壊し得る。
  • 応用が限定的:プロセス報酬探索は狭い設定での実演である。
  • 心的状態ではない:意識、喜び、動機を検証していない。

次の検証独自性と転移を再現する

非線形・因果基準を追加し、座標を選び直さず無関係な構造で試し、同じ疎集合がベンチマーク外の失敗を予測できるか検証すべきである。現状は検証可能な解釈可能性提案だ。