1. TL;DR

这篇文章发现:多图输入时,LVLM 虽然用 delimiter token 标记每张图的边界,但这些 token 并不能有效阻止不同图片之间的信息泄漏。

作者提出一个非常简单的 inference-time 方法:把图像 delimiter token 的 hidden states 放大,让它们在 attention 中更像“每张图的强边界 / 图像标签”。这样可以增强图内 token 的一致性,同时减少不必要的跨图交互。方法不需要训练,论文声称也不会带来额外推理成本。(arXiv)

一句话概括:

不是新增 token,也不是重新训练模型,而是在推理时放大已有图像分隔符 token,让模型更清楚“哪些 token 属于同一张图”。


2. 论文想解决的问题

背景

现在很多 LVLM 在单图理解上表现不错,但输入多张图后容易出现性能下降。核心原因之一是 cross-image information leakage:模型无法稳定区分不同图片中的信息,导致把 A 图的信息错误地用到 B 图上。(arXiv)

现有做法的问题

很多 LVLM 已经会在图像 token 前后加入 delimiter token,例如:

<image_start> image tokens <image_end>
<image_start> image tokens <image_end>

但作者的分析认为,这些 delimiter token 只是形式上存在,并没有足够强地阻断跨图 attention 或建立清晰的 image-wise boundary


3. 核心观察

作者认为 delimiter token 不是完全没用,而是“强度不够”。

论文分析了 delimiter token 的两个关键性质:

Property 1:Localized Strong Attention

第 i 张图的 delimiter token 主要会被第 i 张图内部的 token 关注,因此它天然有一定的 image-wise anchor 作用

Property 2:Intra-image Interaction Reinforcement