审计“Thinking with Images / Visual Tool-Use”到底是真的在利用视觉工具,还是只是看起来像在利用。

论文研究的是这类流程:

原图 + 问题
   ↓
MLLM reasoning
   ↓
调用 crop / zoom
   ↓
看到局部高清图
   ↓
继续 reasoning
   ↓
最终回答

作者发现,很多模型虽然会主动 crop-and-zoom,甚至 benchmark 上有一点提升,但这个 crop 回来的视觉信息,很多时候并没有真正因果地影响最终答案

它最大的贡献:做“因果干预”

传统评测只看:

不开 tool:accuracy = A

开 tool:accuracy = B

B > A
→ 认为 tool 有用

作者认为这个结论太粗。

因为模型调用 tool 以后,实际上存在两条路径:

               tool action T
                 /       \
                /         \
               ▼           ▼
      visual observation O   textual/action shortcut
               │           │
               ▼           ▼
             answer Y     answer Y

真正希望的是:

T → O → Y

也就是:

crop 出来的视觉内容真的改变了答案。

但可能实际发生:

T → Y

也就是模型光是“决定我要 zoom 这个区域”,这个动作/文本轨迹本身就改变了后续答案,哪怕返回给它的是错误 crop,它可能还是给出一样的答案


他们设计了三个层级的干预

1. Policy level