早期的大模型看图片,是外挂一个视觉模型(以往多用 SigLIP 这类对比预训练模型来初始化)硬生生粘在语言模型上面;而到了 2026 年的 Kimi K3,视觉不再是二等公民,而是与文本在同一个主干网络中、同一个 Next-Token 预测目标下交错共生的原生多模态(Native Multimodal)!今天拆解图片是怎么变成 token 并融入通用大模型的。
视觉与语言的融合,本质是「统一数据媒介」:
| 你已经会的 | AI 世界里对应的东西 |
|---|---|
| 连环画与图文书:插图和配文穿插排版,一页一页往下读 | 交错图文序列(Interleaved Tokens):视觉 token 与文本 token 混排自回归 |
| 拼图切块:把一张大风景照剪成一个个小方块 | Patch 切片:将连续像素网格离散化为一个个视觉特征块 |
| 双脑外挂翻译:眼睛看到后翻译成英文单词,嘴巴再复述出来 | 此前的外挂做法:以 SigLIP 等对比预训练模型初始化视觉编码器,再嫁接到语言模型上(§2.4) |
| 天生眼明心亮:视神经信号直接接入统一的大脑皮层联合处理 | 原生多模态(K3):MoonViT-V2 从零开始与语言主干在同一个预测目标下共同训练 |
| 印照片先看小样:把大图缩到四分之一再处理,省纸又省时 | 2×2 pixel-shuffle 下采样:投影前把视觉 token 数量压缩为四分之一(§2.4) |
在 Transformer 看来,世界上根本没有「图片」和「文字」的区别,所有输入最终都是一串向量序列(Token Embeddings)。
在《Kimi K3 技术报告》§2.4 中,K3 搭载了全新自研的 MoonViT-V2 原生视觉编码器:
逐词翻译: