<aside>

🧠 一句话总结

论文研究:视觉特征是如何被线性适配器映射到冻结的大语言模型语言特征空间中的,并发现这种对齐主要发生在 LLM 的中后层(约第18层),而早期层存在明显错位。

</aside>

1. 研究背景与核心问题

研究问题

<aside>

多模态大语言模型(VLM)中:

但 视觉表征是如何变成语言表征的?

这个跨模态对齐过程仍然不清楚。

</aside>


核心思想

<aside>

作者构造一个可解释性友好的极简VLM结构:

这样:

adapter 被迫将视觉特征直接映射到已有语言特征空间

</aside>


2. 方法概览

模型结构

<aside>

Image → CLIP ViT-L/14 → Linear Adapter → Gemma-2-2B-it (Frozen)

关键点:

视觉 token 数量:


使用 SAE 做可解释性分析

使用 GemmaScope 提供的预训练 SAE

作用:

把 LLM 隐藏状态分解为:

hidden state → sparse interpretable features

用于分析:

  1. 重构误差
  2. 稀疏性