这篇文章发现:多图输入时,LVLM 虽然用 delimiter token 标记每张图的边界,但这些 token 并不能有效阻止不同图片之间的信息泄漏。
作者提出一个非常简单的 inference-time 方法:把图像 delimiter token 的 hidden states 放大,让它们在 attention 中更像“每张图的强边界 / 图像标签”。这样可以增强图内 token 的一致性,同时减少不必要的跨图交互。方法不需要训练,论文声称也不会带来额外推理成本。(arXiv)
一句话概括:
不是新增 token,也不是重新训练模型,而是在推理时放大已有图像分隔符 token,让模型更清楚“哪些 token 属于同一张图”。
现在很多 LVLM 在单图理解上表现不错,但输入多张图后容易出现性能下降。核心原因之一是 cross-image information leakage:模型无法稳定区分不同图片中的信息,导致把 A 图的信息错误地用到 B 图上。(arXiv)
很多 LVLM 已经会在图像 token 前后加入 delimiter token,例如:
<image_start> image tokens <image_end>
<image_start> image tokens <image_end>
但作者的分析认为,这些 delimiter token 只是形式上存在,并没有足够强地阻断跨图 attention 或建立清晰的 image-wise boundary
作者认为 delimiter token 不是完全没用,而是“强度不够”。
论文分析了 delimiter token 的两个关键性质:
第 i 张图的 delimiter token 主要会被第 i 张图内部的 token 关注,因此它天然有一定的 image-wise anchor 作用