@inproceedings{C.-Quan-Guinaudeau-Satoh:CORIA-TALN-2026:2026,
    author = "C. Quan, Khanh-An and Guinaudeau, Camille and Satoh, Shin'ichi",
    title = "\'Evaluation de la coh\'erence des mod\`eles vision-langage pour la t\^ache de question-r\'eponse visuelle",
    booktitle = "Actes de CORIA-TALN 2026. Actes de l'atelier sur l'\'evaluation des mod\`eles g\'en\'eratifs (LLM) et challenges (EvalLLM 2026)",
    month = "6",
    year = "2026",
    address = "Nantes, France",
    publisher = "Association pour le Traitement Automatique des Langues",
    pages = "64-74",
    note = "",
    abstract = "La t\^ache de question-r\'eponse visuelle constitue un d\'efi n\'ecessitant une compr\'ehension approfondie de l'image et de la question associ\'ee. Bien que les mod\`eles vision-language r\'ecents obtiennent des performances \'elev\'ees, ils r\'ev\`elent des comportements incoh\'erents lorsque des modifications mineures sont appliqu\'ees \`a la question. Dans cet article, nous proposons deux protocoles d'\'evaluation centr\'es sur la compr\'ehension des questions : la permutation des choix et la reformulation des questions. Ces approches permettent de tester la robustesse et la coh\'erence des mod\`eles au-del\`a de la seule mesure d'exactitude. Nos r\'esultats exp\'erimentaux montrent que LLaVA et MM-CoT produisent fr\'equemment des r\'eponses incoh\'erentes malgr\'e une haute exactitude. Cette \'etude met en \'evidence les limites des m\'etriques traditionnelles et propose un cadre pour \'evaluer de mani\`ere plus fine la compr\'ehension des questions par les mod\`eles multimodaux.",
    keywords = "M\'etrique d'\'evaluation, LLMs multimodaux, coh\'erence",
    url = "730094.pdf"
}
