在 30 天主线课程里,我们看清了大模型近十年的工程进化;而在这个特别番外篇中,我们将脱去枯燥的代码与死板的文字,用纯粹的几何变换、连续流形、复数旋转与动态引力场,亲眼见证支撑 2.8 万亿参数巨兽运转的数学底层奇迹。
为什么给 Query 旋转 mθ,给 Key 旋转 nθ,两者相乘就会奇迹般地只留下相对距离 m−n?拖动下方的位置滑块,观察向量旋转与投影内积的动态几何守恒。
⟨R_m·q, R_n·k⟩ = Re[(q·e^(imθ))* · (k·e^(inθ))] = Re[q*·k · e^(i(n−m)θ)]
当你同时将 m 和 n 增加相同步数时(比如句子整体后移 10 个 token),两根指针在表盘上同步飞转,但它们之间的相对夹角 (m−n)θ 绝对静止不变,点积能量严格守恒!
MLA 为什么能将 KV 显存压缩 90% 以上(DeepSeek-V2 论文口径)?秘密在于矩阵乘法的结合律——解压矩阵在几何上被如同折纸般“折叠吸附”进了 Query 侧。
传统线性注意力的状态矩阵为什么会“饱和爆仓”?KDA 的 Delta 规则是如何像激光雕刻一样只更新误差残差的?点击下方播放按钮观察状态热力网格演进。
S_t = S_(t−1) + k_t·v_tᵀ 像一个只写不擦的黑板,高维矩阵很快被大数值填满失去区分度(左侧热力图死白);
S_t = α_t·S_(t−1) + β_t·(v_t − S_(t−1)·k_t)·k_tᵀ:先用旧记忆预测当前值,只将未能预测的残差差值(Δ)投射到正交流形上,并配合通道衰减门 α_t 淡出过期信息(右侧热力图秩序井然)。
传统 AdamW 逐参数缩放会导致权重矩阵被拉扯成极度扁平的尖锐椭圆(条件数恶化);而 Muon 利用 5 步牛顿-舒尔茨多项式,将矩阵平滑弹回为完美的谱正交圆!
成千上万个 Token 粒子涌入,Router 怎么避免局部明星专家被活活挤爆?观察 QB 分位数算法如何像动态水位控制器一样,自发抚平波峰填补波谷。