<aside>
论文研究:视觉特征是如何被线性适配器映射到冻结的大语言模型语言特征空间中的,并发现这种对齐主要发生在 LLM 的中后层(约第18层),而早期层存在明显错位。
</aside>
<aside>
多模态大语言模型(VLM)中:
但 视觉表征是如何变成语言表征的?
这个跨模态对齐过程仍然不清楚。
</aside>
<aside>
作者构造一个可解释性友好的极简VLM结构:
这样:
adapter 被迫将视觉特征直接映射到已有语言特征空间
</aside>
<aside>
Image → CLIP ViT-L/14 → Linear Adapter → Gemma-2-2B-it (Frozen)
关键点:
视觉 token 数量:
使用 GemmaScope 提供的预训练 SAE
作用:
把 LLM 隐藏状态分解为:
hidden state → sparse interpretable features
用于分析: