talnarchives

Une archive numérique francophone des articles de recherche en Traitement Automatique de la Langue.

Évaluation de la reconnaissance automatique de la parole par les grands modèles de langage génératifs

Thibault Bañeras-Roux, Kumar Shashi, Driss Khalil, Sergio Burdisso, Petr Motlicek, Shiran Liu, Mickael Rouvier, Jane Wottawa, Richard Dufour

Résumé : La reconnaissance automatique de la parole (RAP) est traditionnellement évaluée par le taux d'erreur mot (WER), une métrique insensible au sens. Les métriques sémantiques basées sur les plongements sont mieux corrélées à la perception humaine, mais les grands modèles de langage (LLM) décodeurs restent peu explorés pour cette tâche. Cet article évalue leur pertinence selon trois approches : (1) sélection de la meilleure hypothèse parmi deux candidats, (2) calcul de distance sémantique via embeddings génératifs, et (3) classification qualitative des erreurs. Sur le jeu de données HATS, les meilleurs LLM atteignent 92–94 % d'accord avec les annotateurs humains pour la sélection d'hypothèses, contre 63 % pour le WER, surpassant aussi les métriques sémantiques. Les embeddings issus de LLM décodeurs montrent des performances comparables aux modèles encodeurs. Enfin, les LLM offrent une perspective prometteuse pour une évaluation interprétable et sémantique de la RAP

Mots clés : Reconnaissance automatique de la parole, grands modèles de langage, similarité sémantique, modèles génératifs, perception humaine