Attention→K3 三十天课 · Day 25 / 30 课程首页 面试视角 自测题
Day 25 · 原生多模态

原生多模态:文本与视觉的统一自回归接龙

早期的大模型看图片,是外挂一个视觉模型(以往多用 SigLIP 这类对比预训练模型来初始化)硬生生粘在语言模型上面;而到了 2026 年的 Kimi K3,视觉不再是二等公民,而是与文本在同一个主干网络中、同一个 Next-Token 预测目标下交错共生的原生多模态(Native Multimodal)!今天拆解图片是怎么变成 token 并融入通用大模型的。

学完你能回答
外挂拼接 vs 原生多模态有什么本质区别?
学完你能回答
图片是怎么被切片(Patch)变成视觉 token 的?
学完你能回答
K3 的 MoonViT-V2 视觉编码器是如何工作的?

1起点:这些你早就会了

视觉与语言的融合,本质是「统一数据媒介」:

你已经会的AI 世界里对应的东西
连环画与图文书:插图和配文穿插排版,一页一页往下读交错图文序列(Interleaved Tokens):视觉 token 与文本 token 混排自回归
拼图切块:把一张大风景照剪成一个个小方块Patch 切片:将连续像素网格离散化为一个个视觉特征块
双脑外挂翻译:眼睛看到后翻译成英文单词,嘴巴再复述出来此前的外挂做法:以 SigLIP 等对比预训练模型初始化视觉编码器,再嫁接到语言模型上(§2.4)
天生眼明心亮:视神经信号直接接入统一的大脑皮层联合处理原生多模态(K3):MoonViT-V2 从零开始与语言主干在同一个预测目标下共同训练
印照片先看小样:把大图缩到四分之一再处理,省纸又省时2×2 pixel-shuffle 下采样:投影前把视觉 token 数量压缩为四分之一(§2.4)

2万物皆可 Token:图片是怎么变成数字的?

在 Transformer 看来,世界上根本没有「图片」和「文字」的区别,所有输入最终都是一串向量序列(Token Embeddings)。

视觉 Token 化与图文交错自回归流水线 输入图片切分成 Patch 经过 MoonViT-V2 产生视觉 Token,与文本 Token 一起交错进入主干模型 原生多模态视觉 Token 化与交错预测流程(K3 §2.4) 输入图片 图像与视频输入 最高 3584×3584 像素 MoonViT-V2 原生视觉编码器 产生 2D 特征向量 统一交错 Token 序列进入 2.8T 主干 [IMG_1] [IMG_2] ... 详细描述图中细节 在单一 Next-Token 目标下自回归统一学习
图 25.1:原生多模态的统一流向。图片与文字在同一个 Transformer 骨架中享受同等的自注意力交互。

3K3 的 MoonViT-V2 视觉引擎

在《Kimi K3 技术报告》§2.4 中,K3 搭载了全新自研的 MoonViT-V2 原生视觉编码器:

核心类比 · 母语 vs 二外
外挂方案像「成年后学的二外」:视觉那套本领是别人(SigLIP 这类对比预训练模型)先学好的,再靠一层翻译接到语言大脑上——想说点什么,总得先在脑子里转一道手,细节难免在翻译中丢掉。原生多模态则像「母语环境里长大的双语儿」:MoonViT-V2 从训练第一天起,就和语言主干在同一个「预测下一个 token」的目标下一起学,视觉和语言长在同一片大脑皮层里,根本不需要翻译。
严格来说(类比的边界):「双语儿」并不全科碾压——报告只说从零训练的 MoonViT-V2 在各项视觉评测中与 SigLIP 初始化的基线相当;K3 放弃 SigLIP 初始化的主要理由是训练稳定性(SigLIP 初始化时梯度范数持续偏高、尖峰频繁),而不是效果更好(§2.4)。
小结:MoonViT-V2 是一个 27 层、约 0.4B 参数的视觉 Transformer,图像与视频用完全共享的参数处理;视觉特征先经它编码,再过一个轻量级 MLP 投影器映射进主干。投影之前,一次 2×2 pixel-shuffle 下采样把视觉 token 数量压缩为四分之一,让最高 3584×3584 像素的输入在 100 万 token 上下文里也负担得起(§2.4)。

4面试视角

面试视角 · 高频考点
面试官可能会问:「原生多模态(Native Multimodal)与传统的 Adapter/Cross-Attention 视觉外挂方案有什么区别?为什么原生多模态逐渐成为主流?」
八股答「外挂方案是先用 SigLIP 这类对比预训练模型提取图片特征再通过投影层映射给 LLM,两个模型是分开训的;原生多模态是将视觉和文本 token 在同一个主干网络里从头联合预训练,泛化能力更强、图文融合更深。」——答得很好,若能点出细粒度视觉理解与长上下文支持则更具说服力。
本课答「核心在于表征空间的统一与梯度联合流动:① 外挂方案(如 LLaVA / Flamingo)的局限:依赖预冻结的静态视觉编码器(以 SigLIP 等对比预训练模型初始化),其表征受限于图文对比学习的粗粒度语义,难以胜任细粒度几何推理、OCR 文字定位与长视频分析;同时两阶段拼接导致模态适配层成为信息瓶颈;② 原生多模态(Native Multimodal)的破局:将图像通过 Patch 切分(如 MoonViT-V2)转化为视觉 token 序列,与文本 token 一道直接进入统一的 Decoder-only 主干网络。在单一的自回归 Next-Token 预测目标下,视觉特征与语言知识在数十层 Transformer 深度中进行无缝的多头自注意力融合,极大提升了跨模态深度推理与长上下文视觉理解上限。」

5映射到原文:K3 报告 §2.4 与 §3.3

K3 原文(§3.3 训练配方 · 原生多模态训练策略)
「Kimi K3 采用原生多模态训练策略:语言与视觉从训练伊始便联合优化,而不是先训练语言模型、再事后通过对齐阶段嫁接视觉编码器。在这一范式下,视觉与文本 token 在单一的下一 token 预测目标中交错出现,使共享主干从一开始就能学习统一的多模态表示。」

逐词翻译:

  • 「从训练伊始便联合优化」:视觉编码器 MoonViT-V2 不是先单独练好再接进来,而是从零开始跟语言主干一起训练。§2.4 还交代了为什么:此前用 SigLIP 初始化时梯度范数持续偏高、尖峰频繁,从零训练反而全程稳定。
  • 「事后通过对齐阶段嫁接视觉编码器」:说的就是外挂路线——先训好语言模型,再补一个对齐阶段把视觉「粘」上去。K3 明确不走这条路。
  • 「单一的下一 token 预测目标」:图片 token 和文字 token 排进同一条序列,模型用同一个接龙目标学习——第 2 节那张图里的「交错序列」画的就是这句话。
27 层
MoonViT-V2 视觉
Transformer 层数(§2.4)
0.4B
MoonViT-V2
参数量(§2.4)
1/4
2×2 pixel-shuffle 后的
视觉 token 数(§2.4)
3584×3584
最高输入像素,装进
100 万 token 上下文(§2.4)

6自测题(先自己答,再点开看解析)

Q1 图像在进入 Transformer 之前,第一步必须做什么操作?
解析:必须进行 Patch 切分,将二维连续像素网格切成一个个小方块(patch),展平并线性投影为一维的视觉 Token 向量序列——K3 中这一步由 MoonViT-V2 视觉编码器完成。
Q2 为什么外挂 SigLIP 初始化编码器的方案在复杂图表和细小文字识别上效果较差?
解析:因为 SigLIP 这类对比预训练模型是基于整图-整句对比学习训练的,偏向全局粗粒度概念匹配——报告 §2.4 的原话是「偏重全局语义、牺牲细粒度文本与结构线索」,缺少密集像素级空间位置定位与细粒度字符几何解析能力。
Q3 什么是「交错图文自回归(Interleaved Auto-regression)」?
解析:指文本 token 和视觉 token 可以自由混排在同一个序列中,模型根据前面的图文前缀连续自回归预测下一个 token。注意这是输入侧的统一 token 化:视觉内容以 token 形式进入序列、参与预测,报告并未说 K3 用自回归方式生成图像。
Q4 一张高分辨率大图会产生海量视觉 token,K3 怎么让它装进 100 万 token 的上下文?
解析:MoonViT-V2 编码之后、进入投影器之前,做一次 2×2 pixel-shuffle 下采样,把视觉 token 数量压缩为四分之一(§2.4)。这样最高 3584×3584 像素的输入,在 100 万 token 上下文里也负担得起。
Q5 原生多模态大模型在设计存活表上属于什么形态?
解析:属于 Decoder-only 原生多模态统一骨架(K3 终极架构选择)。
《从 Attention 到 K3 · 大模型近十年设计演进》30 天课 · Day 25 / 30 · 返回课程首页