从 Attention 到 K3 3B1B SPECIAL
✦ 3Blue1Brown 风格沉浸式几何漫游 ✦

大模型底层几何与数学之美

在 30 天主线课程里,我们看清了大模型近十年的工程进化;而在这个特别番外篇中,我们将脱去枯燥的代码与死板的文字,用纯粹的几何变换、连续流形、复数旋转与动态引力场,亲眼见证支撑 2.8 万亿参数巨兽运转的数学底层奇迹。

Episode 01

RoPE 的复平面旋转几何:相对距离的不变性

为什么给 Query 旋转 mθ,给 Key 旋转 nθ,两者相乘就会奇迹般地只留下相对距离 m−n?拖动下方的位置滑块,观察向量旋转与投影内积的动态几何守恒。

⚡ 2D 复平面正交旋转模拟器
Query 位置 m (蓝色): m = 18
Key 位置 n (珊瑚红): n = 8
3B1B 几何顿悟时刻
在复平面上,内积等于一个向量在另一个向量上的投影长度乘以模长。 ⟨R_m·q, R_n·k⟩ = Re[(q·e^(imθ))* · (k·e^(inθ))] = Re[q*·k · e^(i(n−m)θ)] 当你同时将 m 和 n 增加相同步数时(比如句子整体后移 10 个 token),两根指针在表盘上同步飞转,但它们之间的相对夹角 (m−n)θ 绝对静止不变,点积能量严格守恒!
Episode 02

MLA 矩阵折纸:低秩流形与 Query 吸收结合律

MLA 为什么能将 KV 显存压缩 90% 以上(DeepSeek-V2 论文口径)?秘密在于矩阵乘法的结合律——解压矩阵在几何上被如同折纸般“折叠吸附”进了 Query 侧。

⚡ 矩阵结合律与低秩折叠动画
传统多头: Score = (Q) · (K)^T = (x W_Q) · (x W_K)^T [需显存展开 32 个巨大 K 矩阵] MLA 结合律: Score = (Q W^{UK}) · (c^{KV})^T = (Q · (W^{UK} (W^{DK})^T)) · (c^{KV})^T ↑ 预先将解压矩阵吸附在 Query 侧,显存全程只存极细的潜在向量 c^{KV}!
Episode 03

KDA 记忆流形:Delta 规则的“定向黑板擦”

传统线性注意力的状态矩阵为什么会“饱和爆仓”?KDA 的 Delta 规则是如何像激光雕刻一样只更新误差残差的?点击下方播放按钮观察状态热力网格演进。

⚡ 状态空间演进:朴素累加 vs Delta 规则擦除
3B1B 几何顿悟时刻
朴素线性注意力 S_t = S_(t−1) + k_t·v_tᵀ 像一个只写不擦的黑板,高维矩阵很快被大数值填满失去区分度(左侧热力图死白);
KDA 的 Delta 规则 S_t = α_t·S_(t−1) + β_t·(v_t − S_(t−1)·k_t)·k_tᵀ:先用旧记忆预测当前值,只将未能预测的残差差值(Δ)投射到正交流形上,并配合通道衰减门 α_t 淡出过期信息(右侧热力图秩序井然)。
Episode 04

Muon 优化器:矩阵流形上的牛顿-舒尔茨谱正交化

传统 AdamW 逐参数缩放会导致权重矩阵被拉扯成极度扁平的尖锐椭圆(条件数恶化);而 Muon 利用 5 步牛顿-舒尔茨多项式,将矩阵平滑弹回为完美的谱正交圆!

⚡ Newton-Schulz 谱正交投影收敛模拟器
当前状态:第 0 步初始变形矩阵(奇异值高度失衡 σ_max / σ_min = 6.8)
Episode 05

896 专家的引力场:QB 分位数直方图平衡

成千上万个 Token 粒子涌入,Router 怎么避免局部明星专家被活活挤爆?观察 QB 分位数算法如何像动态水位控制器一样,自发抚平波峰填补波谷。

⚡ 896 专家粒子引力场与动态水位线
3B1B 几何顿悟时刻
QB 算法在不干扰反向传播梯度(Auxiliary-loss-free)的前提下,统计每个专家的分位数分布,动态给过载专家施加向下的引力势能惩罚(Bias Penalty),给冷门专家施加向上浮力,实现全局完美的流体力学式均匀分流。
《从 Attention 到 K3》3Blue1Brown 沉浸式几何特别篇 · 返回 30 天课程导航主页