1. 核心目标

将传统的 Image Aesthetic Assessment(IAA) 从:

输入图片 → 输出一个分数

升级为:

输入图片 → 细粒度审美分析 + 整体审美评分

核心是让 MLLM 同时具备 Expert-level Understanding + Quantitative Scoring。


2. 数据:ArtiMuse-10K

构建约 10K 张专家标注图片,提供:

用于训练 MLLM 学习:

“为什么这张图好/不好” + “到底有多好”


3. 模型

基于 InternVL-3-8B 进行训练。

整体:

Image + Instruction
        ↓
   InternVL-3-8B
        ↓
Fine-grained Analysis
        +
Overall Score

没有设计新的视觉 Backbone,主要创新在于: