GPT-2からKimi K3へ

Kimi K3の総パラメータ数はGPT-2の22,580倍だが、本質的な進歩は記憶を圧縮・更新・選択検索する仕組みにある。

✓ 検証済み 出典 ali (@waterloo_intern) architecture worklog, cross-checked against Moonshot AI's public Kimi K3 materials ⚑ アーキテクチャ

60秒でわかる

Kimi K3はGPT-2の22,580倍の総パラメータを持つが、本当の飛躍は圧縮再帰記憶、完全注意、疎な専門家、深さ検索の役割分担にある。

要点

  • GPT-2型Softmax注意のKVキャッシュは文脈とともに増える。
  • 線形注意は履歴を固定行列へ圧縮し、干渉と引き換えにメモリを一定にする。
  • DeltaNetは古い関連を修正してから書き、ゲートが学習可能な忘却を加える。
  • KDAは減衰を細粒度化し、周期的MLAが直接トークン検索を残す。
  • MoEとAttnResは専門家方向と深さ方向に選択的な容量を加える。

結論. 22,580倍は規模の比較であり知能スコアではない。K3の核心は、各層で何を記憶し、消し、取り戻すかを選ぶことにある。

結論から22580倍大きくても22580倍賢いわけではない

Kimi K3の総パラメータ2.8兆をGPT-2の約1.24億で割ると、確かに約22,580になります。ただしこれは能力倍率ではありません。K3は各トークンで疎な専門家の一部だけを有効化し、7年間で記憶、ルーティング、学習方式そのものが変わりました。

124MGPT-2の基準パラメータ
2.8TKimi K3の総パラメータ
22,580×パラメータ数の比
104BK3のトークン当たり有効パラメータ、ベンダー仕様

第一段階Softmax注意は各トークンを保持する

GPT-2型デコーダーはトークンをQuery、Key、Valueへ変換します。生成時にはKVキャッシュが過去のKeyとValueを保存し、接頭辞全体の再計算を避けます。代償は、文脈とともにキャッシュが増え、読み出しがメモリ帯域の制約になることです。

Softmax注意トークン単位のKey/Valueを保持。検索は強力だがKVキャッシュが文脈とともに増える。
線形注意履歴を固定サイズの行列状態に折り畳む。メモリは一定だが関連が干渉する。
Delta則現在の関連を読み、置換に必要な差分だけを書き込む。
ゲート古い状態をいつ、どれだけ減衰させるかを学習する。

第二段階線形注意は書庫を固定ホワイトボードに替える

線形注意は積の順序を変え、増え続ける履歴を固定行列へ要約します。トークンごとに引き出しが増える書庫を、寸法が変わらないホワイトボードへ置き換えるイメージです。持ち運びは軽くなりますが、新しい情報が古い情報を曖昧にします。

効率化と記憶の弱点は同じ操作から生まれる。多数のトークン関連を、一つの固定状態へ圧縮することだ。

第三段階DeltaNetは消してから書く

DeltaNetは状態を高速重みとして扱います。書き込む前に、そのKeyが現在何を読み出すかを確認し、目標との差分だけを戻します。Gated DeltaNetは学習可能な減衰を加え、特定関連の置換と広い忘却を組み合わせます。

難所は再帰を効率よく学習することです。チャンク方式では小さなブロック内で通常の注意に近い行列演算を行い、ブロック間では圧縮状態だけを渡します。FLOPsが少ない構成が、GPU上で必ず最速とは限りません。

第四段階Kimiは圧縮記憶と精密検索を混ぜる

Kimi Delta Attentionは減衰をチャネルごとに細かく制御します。Kimi K3の四層マクロサイクルは三層のKDAと一層のGated MLAで構成されます。KDAは固定サイズの再帰記憶を運び、周期的なMLAは圧縮で失われる詳細をトークン文脈から直接取り出します。

KDA細粒度の減衰を持つ固定状態の再帰記憶。
周期的MLA選ばれた層でSoftmax型の直接検索を残す。
潜在MoEトークンを少数の専門家へ送り、2.8兆全体を有効化せずに容量を増やす。
AttnRes後段が過去の深さ表現を選択検索できるようにする。

結論この系譜は記憶方針の進化である

重要なのはTransformerが単に巨大化したことではありません。各段階は、何をトークン単位で残すか、何を圧縮するか、何を上書きするか、いつ高価な精密検索を使うかを決めています。K3は22,580個のGPT-2の山ではなく、疎な計算を備えた混合記憶システムです。