从GPT-2到Kimi K3
Kimi K3 的参数量相当于 22,580 个 GPT-2,但真正的跃迁,是模型学会了压缩、更新并选择性检索记忆。
60 秒版本
Kimi K3 的参数量是 GPT-2 的 22,580 倍,但真正的架构跃迁,是在压缩递归记忆、完整注意力、稀疏专家和深度检索之间重新分工。
要点
- GPT-2 式 Softmax 注意力使用随上下文增长的 KV Cache。
- 线性注意力把历史压进固定矩阵,以关联干扰换取内存有界。
- DeltaNet 写入前先修正旧关联,门控再加入可学习遗忘。
- KDA 细化衰减,周期性 MLA 保留直接 token 检索。
- MoE 与 AttnRes 分别在专家和网络深度上增加选择性容量。
结论. 22,580 倍只是规模比较,不是智力分数。K3 的关键进步,是分层决定什么该记、该忘、该精确找回。
先说结论大22580倍不等于聪明22580倍
Kimi K3 的总参数量为 2.8 万亿,除以 GPT-2 的约 1.24 亿,确实约等于 22,580。但这只是参数量比值,不是能力倍数:K3 每个 token 只激活部分稀疏专家,七年间变化更大的,是记忆、路由和训练方式。
第一步Softmax注意力记住每个token
GPT-2 式解码器把 token 变成 Query、Key、Value。生成时,KV Cache 保存此前的 Key 和 Value,避免每一步重算完整前缀。代价也很直接:缓存随上下文增长,读取它会逐渐变成显存带宽瓶颈。
| Softmax 注意力 | 保留 token 级 Key/Value;检索能力强,但 KV Cache 随上下文增长。 |
|---|---|
| 线性注意力 | 把历史压进固定大小的矩阵状态;内存有界,但关联会互相干扰。 |
| Delta 规则 | 先读出旧关联,再只写入替换它所需的修正量。 |
| 门控 | 学习旧状态何时、以多大强度衰减,避免记忆无限累积。 |
第二步线性注意力把档案柜换成白板
线性注意力改变乘法顺序:先分别变换 Query 与 Key,再把不断增长的历史折叠进固定矩阵。它像是把“每个 token 增加一个抽屉”的档案柜,换成尺寸固定的白板。白板更省空间,但新笔记最终会覆盖或模糊旧笔记。
效率来源与记忆缺陷其实是同一件事:大量 token 级关联,被压缩进一个固定大小的状态。
第三步DeltaNet先擦再写
DeltaNet 把状态当作快速权重。每次写入前,先看当前 Key 能从记忆中读出什么;再用目标值减去旧值,只把差额写回。Gated DeltaNet 额外加入可学习衰减,把定点替换和整体遗忘结合起来。
真正困难的是高效训练这类递归。分块算法让小块内部继续做类似普通注意力的矩阵运算,块与块之间只传递紧凑状态。块越小 FLOPs 越低,但 GPU 往往更擅长较大的矩阵乘法,所以算得少不一定跑得快。
第四步Kimi把压缩记忆与精确检索混合
Kimi Delta Attention 把单一衰减门细化为逐通道控制。Kimi K3 的每个四层宏循环由三层 KDA 和一层 Gated MLA 组成:KDA 维持固定大小的递归记忆,周期性 MLA 则在压缩可能丢细节时,重新直接检索 token 上下文。
| KDA | 带细粒度衰减的固定状态递归记忆。 |
|---|---|
| 周期性 MLA | 在部分层保留 Softmax 式完整检索,找回 token 级细节。 |
| 潜空间 MoE | 每个 token 只路由到少量专家,不必激活整个 2.8 万亿参数模型。 |
| AttnRes | 让后续块选择性读取更早的深度表示,而非只接收不断累加的残差。 |
结论这条谱系本质是记忆策略演进
重点不是 Transformer 只会越堆越大,而是每一步都在回答记忆问题:哪些信息必须按 token 精确寻址,哪些可以压缩,哪些应该覆盖,何时值得支付精确检索的成本。K3 更像“稀疏计算的混合记忆系统”,而不是把 22,580 个 GPT-2 叠在一起。