从GPT-2到Kimi K3

Kimi K3 的参数量相当于 22,580 个 GPT-2,但真正的跃迁,是模型学会了压缩、更新并选择性检索记忆。

✓ 已核实 来源 ali (@waterloo_intern) architecture worklog, cross-checked against Moonshot AI's public Kimi K3 materials ⚑ 架构

60 秒版本

Kimi K3 的参数量是 GPT-2 的 22,580 倍,但真正的架构跃迁,是在压缩递归记忆、完整注意力、稀疏专家和深度检索之间重新分工。

要点

  • GPT-2 式 Softmax 注意力使用随上下文增长的 KV Cache。
  • 线性注意力把历史压进固定矩阵,以关联干扰换取内存有界。
  • DeltaNet 写入前先修正旧关联,门控再加入可学习遗忘。
  • KDA 细化衰减,周期性 MLA 保留直接 token 检索。
  • MoE 与 AttnRes 分别在专家和网络深度上增加选择性容量。

结论. 22,580 倍只是规模比较,不是智力分数。K3 的关键进步,是分层决定什么该记、该忘、该精确找回。

先说结论大22580倍不等于聪明22580倍

Kimi K3 的总参数量为 2.8 万亿,除以 GPT-2 的约 1.24 亿,确实约等于 22,580。但这只是参数量比值,不是能力倍数:K3 每个 token 只激活部分稀疏专家,七年间变化更大的,是记忆、路由和训练方式。

1.24亿GPT-2 基线参数
2.8万亿Kimi K3 总参数
22,580×参数量比值
1040亿K3 每 token 激活参数,厂商规格

第一步Softmax注意力记住每个token

GPT-2 式解码器把 token 变成 Query、Key、Value。生成时,KV Cache 保存此前的 Key 和 Value,避免每一步重算完整前缀。代价也很直接:缓存随上下文增长,读取它会逐渐变成显存带宽瓶颈。

Softmax 注意力保留 token 级 Key/Value;检索能力强,但 KV Cache 随上下文增长。
线性注意力把历史压进固定大小的矩阵状态;内存有界,但关联会互相干扰。
Delta 规则先读出旧关联,再只写入替换它所需的修正量。
门控学习旧状态何时、以多大强度衰减,避免记忆无限累积。

第二步线性注意力把档案柜换成白板

线性注意力改变乘法顺序:先分别变换 Query 与 Key,再把不断增长的历史折叠进固定矩阵。它像是把“每个 token 增加一个抽屉”的档案柜,换成尺寸固定的白板。白板更省空间,但新笔记最终会覆盖或模糊旧笔记。

效率来源与记忆缺陷其实是同一件事:大量 token 级关联,被压缩进一个固定大小的状态。

第三步DeltaNet先擦再写

DeltaNet 把状态当作快速权重。每次写入前,先看当前 Key 能从记忆中读出什么;再用目标值减去旧值,只把差额写回。Gated DeltaNet 额外加入可学习衰减,把定点替换和整体遗忘结合起来。

真正困难的是高效训练这类递归。分块算法让小块内部继续做类似普通注意力的矩阵运算,块与块之间只传递紧凑状态。块越小 FLOPs 越低,但 GPU 往往更擅长较大的矩阵乘法,所以算得少不一定跑得快。

第四步Kimi把压缩记忆与精确检索混合

Kimi Delta Attention 把单一衰减门细化为逐通道控制。Kimi K3 的每个四层宏循环由三层 KDA 和一层 Gated MLA 组成:KDA 维持固定大小的递归记忆,周期性 MLA 则在压缩可能丢细节时,重新直接检索 token 上下文。

KDA带细粒度衰减的固定状态递归记忆。
周期性 MLA在部分层保留 Softmax 式完整检索,找回 token 级细节。
潜空间 MoE每个 token 只路由到少量专家,不必激活整个 2.8 万亿参数模型。
AttnRes让后续块选择性读取更早的深度表示,而非只接收不断累加的残差。

结论这条谱系本质是记忆策略演进

重点不是 Transformer 只会越堆越大,而是每一步都在回答记忆问题:哪些信息必须按 token 精确寻址,哪些可以压缩,哪些应该覆盖,何时值得支付精确检索的成本。K3 更像“稀疏计算的混合记忆系统”,而不是把 22,580 个 GPT-2 叠在一起。