审计“Thinking with Images / Visual Tool-Use”到底是真的在利用视觉工具,还是只是看起来像在利用。
论文研究的是这类流程:
原图 + 问题
↓
MLLM reasoning
↓
调用 crop / zoom
↓
看到局部高清图
↓
继续 reasoning
↓
最终回答
作者发现,很多模型虽然会主动 crop-and-zoom,甚至 benchmark 上有一点提升,但这个 crop 回来的视觉信息,很多时候并没有真正因果地影响最终答案
传统评测只看:
不开 tool:accuracy = A
开 tool:accuracy = B
B > A
→ 认为 tool 有用
作者认为这个结论太粗。
因为模型调用 tool 以后,实际上存在两条路径:
tool action T
/ \
/ \
▼ ▼
visual observation O textual/action shortcut
│ │
▼ ▼
answer Y answer Y
真正希望的是:
T → O → Y
也就是:
crop 出来的视觉内容真的改变了答案。
但可能实际发生:
T → Y
也就是模型光是“决定我要 zoom 这个区域”,这个动作/文本轨迹本身就改变了后续答案,哪怕返回给它的是错误 crop,它可能还是给出一样的答案