@inproceedings{Baneras-Roux-Shashi-Khalil-Burdisso-Motlicek-Liu-Rouvier-Wottawa-Dufour:CORIA-TALN-2026:2026,
    author = "Ba\\textasciitilde neras-Roux, Thibault and Shashi, Kumar and Khalil, Driss and Burdisso, Sergio and Motlicek, Petr and Liu, Shiran and Rouvier, Mickael and Wottawa, Jane and Dufour, Richard",
    title = "\'Evaluation de la reconnaissance automatique de la parole par les grands mod\`eles de langage g\'en\'eratifs",
    booktitle = "Actes de CORIA-TALN 2026. Actes de l'atelier sur l'\'evaluation des mod\`eles g\'en\'eratifs (LLM) et challenges (EvalLLM 2026)",
    month = "6",
    year = "2026",
    address = "Nantes, France",
    publisher = "Association pour le Traitement Automatique des Langues",
    pages = "75-86",
    note = "",
    abstract = "La reconnaissance automatique de la parole (RAP) est traditionnellement \'evalu\'ee par le taux d'erreur mot (WER), une m\'etrique insensible au sens. Les m\'etriques s\'emantiques bas\'ees sur les plongements sont mieux corr\'el\'ees \`a la perception humaine, mais les grands mod\`eles de langage (LLM) d\'ecodeurs restent peu explor\'es pour cette t\^ache. Cet article \'evalue leur pertinence selon trois approches : (1) s\'election de la meilleure hypoth\`ese parmi deux candidats, (2) calcul de distance s\'emantique via embeddings g\'en\'eratifs, et (3) classification qualitative des erreurs. Sur le jeu de donn\'ees HATS, les meilleurs LLM atteignent 92{\textendash}94 \\% d'accord avec les annotateurs humains pour la s\'election d'hypoth\`eses, contre 63 \\% pour le WER, surpassant aussi les m\'etriques s\'emantiques. Les embeddings issus de LLM d\'ecodeurs montrent des performances comparables aux mod\`eles encodeurs. Enfin, les LLM offrent une perspective prometteuse pour une \'evaluation interpr\'etable et s\'emantique de la RAP",
    keywords = "Reconnaissance automatique de la parole, grands mod\`eles de langage, similarit\'e s\'emantique, mod\`eles g\'en\'eratifs, perception humaine",
    url = "735195.pdf"
}
