打开 2017 年的 Transformer 论文架构图,映入眼帘的是左右对称的「编码器(Encoder)」和「解码器(Decoder)」。但到了今天,从 GPT-4、Claude 到 DeepSeek、Kimi K3,几乎所有大语言模型全把左半边的编码器扔了,只留下了纯解码器(Decoder-only)。这是怎么发生的?因果掩码在其中扮演了什么魔法?
架构分叉与掩码机制,本质是「做题姿势」的切换:
| 你已经会的 | AI 世界里对应的东西 |
|---|---|
| 阅读理解试卷:可以来回反复看全篇材料(双向可见) | 编码器(Encoder / BERT):无掩码,所有 token 可以双向自由交互 |
| 闭卷默写作文:写到当前字,不能偷看后面的字 | 因果掩码解码器(Decoder / GPT):单向因果,只能看上文 |
数学里的负无穷大:e^(-∞) = 0 | Masking 矩阵实现:把非法连接的分数设为 -∞,Softmax 后概率严格为 0 |
| 边听发言边写纪要:落笔时可以随时回看速记稿 | 交叉注意力(Cross-Attention):Decoder 逐 token 生成时,回头查询 Encoder 整理好的输入表示 |
| 一体机设计:把两台机器(翻译机+打字机)合二为一 | Decoder-only 架构:统一用「单向接龙」包揽理解与生成所有任务 |
2017 年的这篇论文全名叫《Attention Is All You Need》,但它当初要解决的具体靶子其实是机器翻译(英译德、英译法)。
在矩阵并行计算中,计算机怎么做到「让前面的 token 看不到后面的 token」?秘密就在一个极其精妙的数学技巧:加上一个上三角全是 -∞ 的掩码矩阵。
e^(-∞) = 0,右上角代表未来的连接在 Softmax 后权重绝对为 0,彻底切断了向未来的信息流动。Transformer 提出后的前三年(2018–2020),AI 工业界经历了激烈的架构派系争夺:
2020 年后,随着 GPT-3、LLaMA、Kimi K3 的相继问世,行业达成终极共识:Decoder-only 赢麻了。原因不是运气,而是底层工程与算法的双重降维打击:
逐词翻译:「我们修改了解码器堆栈中的自注意力子层,以防止当前位置关注到后续位置。这种掩码配合输出向右偏移一个位置的设计,确保对位置 i 的预测只能依赖于小于 i 的已知输出。」
e^0 = 1 的非零概率;只有设为 -∞,经过 Softmax 才会精准变成 e^(-∞) = 0。