# 从GPT-2到Kimi K3

> Kimi K3 的参数量相当于 22,580 个 GPT-2，但真正的跃迁，是模型学会了压缩、更新并选择性检索记忆。

_Source: ali (@waterloo_intern) architecture worklog, cross-checked against Moonshot AI's public Kimi K3 materials · 2026-07-29 · 9 min read · Verified against primary sources_

Canonical: https://iyu.app/zh/e/gpt2-to-kimi-k3-architecture

## 60 秒版本

Kimi K3 的参数量是 GPT-2 的 22,580 倍，但真正的架构跃迁，是在压缩递归记忆、完整注意力、稀疏专家和深度检索之间重新分工。

**要点**

- GPT-2 式 Softmax 注意力使用随上下文增长的 KV Cache。
- 线性注意力把历史压进固定矩阵，以关联干扰换取内存有界。
- DeltaNet 写入前先修正旧关联，门控再加入可学习遗忘。
- KDA 细化衰减，周期性 MLA 保留直接 token 检索。
- MoE 与 AttnRes 分别在专家和网络深度上增加选择性容量。

**结论.** 22,580 倍只是规模比较，不是智力分数。K3 的关键进步，是分层决定什么该记、该忘、该精确找回。

## 全文

> **i** 本文提炼 ali 的架构长文，并用月之暗面公开的 Kimi K3 资料交叉核对模型结构。谱系解释属于原作者分析；K3 性能数字仍是厂商自测，独立复现前不作定论。


### 先说结论 — 大22580倍不等于聪明22580倍

Kimi K3 的总参数量为 2.8 万亿，除以 GPT-2 的约 1.24 亿，确实约等于 **22,580**。但这只是参数量比值，不是能力倍数：K3 每个 token 只激活部分稀疏专家，七年间变化更大的，是记忆、路由和训练方式。

- **1.24亿** — GPT-2 基线参数
- **2.8万亿** — Kimi K3 总参数
- **22,580×** — 参数量比值
- **1040亿** — K3 每 token 激活参数，厂商规格


### 第一步 — Softmax注意力记住每个token

GPT-2 式解码器把 token 变成 Query、Key、Value。生成时，KV Cache 保存此前的 Key 和 Value，避免每一步重算完整前缀。代价也很直接：缓存随上下文增长，读取它会逐渐变成显存带宽瓶颈。

- **Softmax 注意力:** 保留 token 级 Key/Value；检索能力强，但 KV Cache 随上下文增长。
- **线性注意力:** 把历史压进固定大小的矩阵状态；内存有界，但关联会互相干扰。
- **Delta 规则:** 先读出旧关联，再只写入替换它所需的修正量。
- **门控:** 学习旧状态何时、以多大强度衰减，避免记忆无限累积。


### 第二步 — 线性注意力把档案柜换成白板

线性注意力改变乘法顺序：先分别变换 Query 与 Key，再把不断增长的历史折叠进固定矩阵。它像是把“每个 token 增加一个抽屉”的档案柜，换成尺寸固定的白板。白板更省空间，但新笔记最终会覆盖或模糊旧笔记。

> 效率来源与记忆缺陷其实是同一件事：大量 token 级关联，被压缩进一个固定大小的状态。


### 第三步 — DeltaNet先擦再写

DeltaNet 把状态当作快速权重。每次写入前，先看当前 Key 能从记忆中读出什么；再用目标值减去旧值，只把差额写回。Gated DeltaNet 额外加入可学习衰减，把定点替换和整体遗忘结合起来。

真正困难的是高效训练这类递归。分块算法让小块内部继续做类似普通注意力的矩阵运算，块与块之间只传递紧凑状态。块越小 FLOPs 越低，但 GPU 往往更擅长较大的矩阵乘法，所以算得少不一定跑得快。


### 第四步 — Kimi把压缩记忆与精确检索混合

Kimi Delta Attention 把单一衰减门细化为逐通道控制。Kimi K3 的每个四层宏循环由三层 KDA 和一层 Gated MLA 组成：KDA 维持固定大小的递归记忆，周期性 MLA 则在压缩可能丢细节时，重新直接检索 token 上下文。

- **KDA:** 带细粒度衰减的固定状态递归记忆。
- **周期性 MLA:** 在部分层保留 Softmax 式完整检索，找回 token 级细节。
- **潜空间 MoE:** 每个 token 只路由到少量专家，不必激活整个 2.8 万亿参数模型。
- **AttnRes:** 让后续块选择性读取更早的深度表示，而非只接收不断累加的残差。

> **⚑ Caveat:** 月之暗面公布了 Kimi Linear 最高 6 倍解码吞吐等优势，并发布了 K3 的架构与跑分。这些都是第一方测量；硬件、内核、序列长度和对比设置都会影响实际结果。


### 结论 — 这条谱系本质是记忆策略演进

重点不是 Transformer 只会越堆越大，而是每一步都在回答记忆问题：哪些信息必须按 token 精确寻址，哪些可以压缩，哪些应该覆盖，何时值得支付精确检索的成本。K3 更像“稀疏计算的混合记忆系统”，而不是把 22,580 个 GPT-2 叠在一起。


## Primary sources

- [ali (@waterloo_intern) — 22580: From GPT2 to Kimi3, Explained](https://x.com/waterloo_intern/status/2081762065392541951)
- [Moonshot AI — Kimi K3 official repository](https://github.com/MoonshotAI/Kimi-K3)
- [Moonshot AI — Kimi K3 model card](https://huggingface.co/moonshotai/Kimi-K3)

---
_Published by iyu (https://iyu.app) — the day's AI news, checked against primary sources and rewritten in plain language. Free to quote with attribution and a link to the canonical URL._
