用一个 Transformer + 一个自回归语言建模目标,预训练出强大的 MLLM 视觉编码器——无需对比损失、无需双塔结构、无需额外文本解码器。仅用 8B 样本,性能超越用 40B 样本训练的 SigLIP2,Doc/OCR 任务优势最显著。
<aside>
主流 MLLM 由三部分构成:视觉编码器(感知基础)→ 连接器(模态桥梁)→ 大语言模型(推理引擎)。视觉编码器质量直接决定 MLLM 的视觉理解上限。

对比式预训练(CLIP / SigLIP)
生成式预训练(CapPa / AIMv2 / OpenVision2)
本文动机:去除冗余模块,让视觉编码器直接被优化。
</aside>
<aside>
核心思路:让 ViT 直接"开口说话"——直接预测描述视觉内容的语言 token,无需任何额外文本模块。

用于极简生成式视觉-语言预训练的 GenLIP 框架概述。 (a) GenLIP 模型架构:一种处理拼接视觉前缀序列的单一 Transformer 架构。 下一个 Token 的预测仅通过语言建模头在文本 Token 上执行。 (b) 门控注意力层:我们 GenLIP 的基本层单元,图中红线为门控信号的前向路径,该信号随后与注意力输出进行逐元素相乘,以控制信息流。 (c) 前缀语言模型(Prefix-LM)注意力机制:允许对图像 Token 进行双向注意力计算,并对文本 Token 进行因果注意力计算。 多模态旋转位置编码(MRoPE)将位置信息注入查询(Q)和键(K)向量中。
</aside>
<aside>
图像切分为 patch 序列,文本用 Qwen3 tokenizer 分词,拼接为统一序列: S = [v₀, …, $v_M$, t₀, …, $t_L$]
</aside>
<aside>
<aside>
单一标准自回归语言建模损失,直接驱动 ViT 对齐 LLM 的 NTP 本质: $L_{LM} = − Σₖ log P(tₖ | {vⱼ}, {t₀…t{ₖ₋₁}} ; θ)$
</aside>
<aside>
问题:混合模态序列中,模型倾向于将视觉信息压缩进少数"汇聚 token",导致视觉空间多样性丧失、训练 loss 突刺、扩展不稳定。
解法:对每个 token 学习输入依赖的 sigmoid 门控,与注意力输出逐元素相乘: $G = σ(X·Wg + bg),Ã = G ⊙ A$
效果:缓解 loss 突刺 · 加速收敛 · 稳定扩展行为
</aside>
<aside>
推理时丢弃 tokenizer 和 LM head,保留 Transformer + LayerNorm 提取视觉特征,经 2 层 MLP 投影对齐 LLM 输入空间。
</aside>
<aside>

第一阶段训练参数如表所示; 第二阶段与第一阶段相比有三个主要区别: (i) 全局批大小从 32K 或 48K 减少到 3.6K,因为平均样本长度从 270 个 Token 增加到约 1200 个 Token; (ii) 峰值学习率降低至1e−4;以及 (iii) 图像按其原始纵横比进行处理。 此外,其他训练设置与第一阶段保持一致。
| 阶段 | 数据集 | 分辨率 | 样本量 | 目标 |
|---|---|---|---|---|
| Stage 1 | Recap-DataComp-1B | 固定 224×224 | 8B | 基础视觉-语言表征 |
| Stage 2 | Infinity-MM + BLIP3o-Long-Cap | 原生比例(16~1024 token) | 37M | 多分辨率适配,增强 OCR |
| 模型 | 参数量 | 层数 | 隐层维度 |
|---|---|---|---|
| GenLIP-L/16 | 0.3B | 24 | 1024 |
| GenLIP-So/16 | 0.4B | 27 | 1152 |
| GenLIP-g/16 | 1.1B | 40 | 1536 |
| </aside> |