💡 核心观点

用一个 Transformer + 一个自回归语言建模目标,预训练出强大的 MLLM 视觉编码器——无需对比损失、无需双塔结构、无需额外文本解码器。仅用 8B 样本,性能超越用 40B 样本训练的 SigLIP2,Doc/OCR 任务优势最显著。


🌍 研究背景

<aside>

MLLM 的三要素架构

主流 MLLM 由三部分构成:视觉编码器(感知基础)→ 连接器(模态桥梁)→ 大语言模型(推理引擎)。视觉编码器质量直接决定 MLLM 的视觉理解上限。

image.png

现有两条路线的问题

对比式预训练(CLIP / SigLIP)

生成式预训练(CapPa / AIMv2 / OpenVision2)

本文动机:去除冗余模块,让视觉编码器直接被优化。

</aside>


🛠️ 方法:GenLIP 框架

<aside>

核心思路:让 ViT 直接"开口说话"——直接预测描述视觉内容的语言 token,无需任何额外文本模块。

image.png

用于极简生成式视觉-语言预训练的 GenLIP 框架概述。 (a) GenLIP 模型架构:一种处理拼接视觉前缀序列的单一 Transformer 架构。 下一个 Token 的预测仅通过语言建模头在文本 Token 上执行。 (b) 门控注意力层:我们 GenLIP 的基本层单元,图中红线为门控信号的前向路径,该信号随后与注意力输出进行逐元素相乘,以控制信息流。 (c) 前缀语言模型(Prefix-LM)注意力机制:允许对图像 Token 进行双向注意力计算,并对文本 Token 进行因果注意力计算。 多模态旋转位置编码(MRoPE)将位置信息注入查询(Q)和键(K)向量中。

</aside>

数据格式

<aside>

图像切分为 patch 序列,文本用 Qwen3 tokenizer 分词,拼接为统一序列: S = [v₀, …, $v_M$, t₀, …, $t_L$]

</aside>

三个关键架构设计

<aside>

训练目标

<aside>

单一标准自回归语言建模损失,直接驱动 ViT 对齐 LLM 的 NTP 本质: $L_{LM} = − Σₖ log P(tₖ | {vⱼ}, {t₀…t{ₖ₋₁}} ; θ)$

</aside>

门控注意力:解决 Attention Sink

<aside>

问题:混合模态序列中,模型倾向于将视觉信息压缩进少数"汇聚 token",导致视觉空间多样性丧失、训练 loss 突刺、扩展不稳定。

解法:对每个 token 学习输入依赖的 sigmoid 门控,与注意力输出逐元素相乘: $G = σ(X·Wg + bg),Ã = G ⊙ A$

效果:缓解 loss 突刺 · 加速收敛 · 稳定扩展行为

</aside>

部署为视觉编码器

<aside>

推理时丢弃 tokenizer 和 LM head,保留 Transformer + LayerNorm 提取视觉特征,经 2 层 MLP 投影对齐 LLM 输入空间。

</aside>

两阶段预训练

<aside>

image.png

第一阶段训练参数如表所示; 第二阶段与第一阶段相比有三个主要区别: (i) 全局批大小从 32K 或 48K 减少到 3.6K,因为平均样本长度从 270 个 Token 增加到约 1200 个 Token; (ii) 峰值学习率降低至1e−4;以及 (iii) 图像按其原始纵横比进行处理。 此外,其他训练设置与第一阶段保持一致。

阶段 数据集 分辨率 样本量 目标
Stage 1 Recap-DataComp-1B 固定 224×224 8B 基础视觉-语言表征
Stage 2 Infinity-MM + BLIP3o-Long-Cap 原生比例(16~1024 token) 37M 多分辨率适配,增强 OCR

模型规格

模型 参数量 层数 隐层维度
GenLIP-L/16 0.3B 24 1024
GenLIP-So/16 0.4B 27 1152
GenLIP-g/16 1.1B 40 1536
</aside>