Évaluation de la cohérence des modèles vision-langage pour la tâche de question-réponse visuelle
Khanh-An C. Quan, Camille Guinaudeau, Shin'ichi Satoh
Résumé : La tâche de question-réponse visuelle constitue un défi nécessitant une compréhension approfondie de l'image et de la question associée. Bien que les modèles vision-language récents obtiennent des performances élevées, ils révèlent des comportements incohérents lorsque des modifications mineures sont appliquées à la question. Dans cet article, nous proposons deux protocoles d'évaluation centrés sur la compréhension des questions : la permutation des choix et la reformulation des questions. Ces approches permettent de tester la robustesse et la cohérence des modèles au-delà de la seule mesure d'exactitude. Nos résultats expérimentaux montrent que LLaVA et MM-CoT produisent fréquemment des réponses incohérentes malgré une haute exactitude. Cette étude met en évidence les limites des métriques traditionnelles et propose un cadre pour évaluer de manière plus fine la compréhension des questions par les modèles multimodaux.
Mots clés : Métrique d'évaluation, LLMs multimodaux, cohérence