Mechanistic Interpretability Meets Vision Language Models: Insights and Limitations

How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding

How Visual Representations Map to Language Feature Space in Multimodal LLMs

Towards Interpreting Visual Information Processing in Vision-Language Models

Hidden in plain sight: VLMs overlook their visual representations