@inproceedings{Baneras-Roux-Wottawa-Rouvier-Merlin-Dufour:CORIA-TALN:2023,
    author = "Ba\\textasciitilde neras-Roux, Thibault and Wottawa, Jane and Rouvier, Mickael and Merlin, Teva and Dufour, Richard",
    title = "HATS : Un jeu de donn\'ees int\'egrant la perception humaine appliqu\'ee \`a l'\'evaluation des m\'etriques de transcription de la parole",
    booktitle = "Actes de CORIA-TALN 2023. Actes de la 30e Conf\'erence sur le Traitement Automatique des Langues Naturelles (TALN),  volume 4 : articles d\'ej\`a soumis ou accept\'es en conf\'erence internationale",
    month = "6",
    year = "2023",
    address = "Paris, France",
    publisher = "Association pour le Traitement Automatique des Langues",
    pages = "10-18",
    note = "",
    abstract = "Traditionnellement, les syst\`emes de reconnaissance automatique de la parole (RAP) sont \'evalu\'es sur leur capacit\'e \`a reconna{\^\i}tre correctement chaque mot contenu dans un signal vocal. Dans ce contexte, la mesure du taux d'erreur-mot est la r\'ef\'erence pour \'evaluer les transcriptions vocales. Plusieurs \'etudes ont montr\'e que cette mesure est trop limit\'ee pour \'evaluer correctement un syst\`eme de RAP, ce qui a conduit \`a la proposition d'autres variantes et d'autres m\'etriques. Cependant, toutes ces m\'etriques restent orient\'ees ``syst\`eme'' alors m\^eme que les transcriptions sont destin\'ees \`a des humains. Dans cet article, nous proposons un jeu de donn\'ees original annot\'e manuellement en termes de perception humaine des erreurs de transcription produites par divers syst\`emes de RAP. Plus de 120 humains ont \'et\'e invit\'es \`a choisir la meilleure transcription automatique entre deux hypoth\`eses. Nous \'etudions la relation entre les pr\'ef\'erences humaines et diverses mesures d'\'evaluation pour les syst\`emes de RAP, y compris les mesures lexicales et celles fond\'ees sur les plongements de mots.",
    keywords = "reconnaissance de la parole, jeu de donn\'ees, perception, m\'etrique, corpus",
    url = "459085.pdf"
}
