@inproceedings{Wang-Liu-Yue:DEFT:2021,
    author = "Wang, Xiaoou and Liu, Xingyu and Yue, Yimei",
    title = "Mesure de similarit\'e textuelle pour l'\'evaluation automatique de copies d'\'etudiants",
    booktitle = "Actes de l'atelier D\'efi Fouille de Textes@TALN 2020  Classification de cas cliniques et correction automatique de copies d'\'etudiants. Atelier D\'Efi Fouille de Textes",
    month = "6",
    year = "2021",
    address = "Lille, France",
    publisher = "Association pour le Traitement Automatique des Langues",
    pages = "63-71",
    note = "Textual similarity measurement for automatic evaluation of students' answers",
    abstract = "Cet article d\'ecrit la participation de l'\'equipe Nantalco \`a la t\^ache 2 du D\'efi Fouille de Textes 2021 (DEFT) : \'evaluation automatique de copies d'apr\`es une r\'ef\'erence existante. Nous avons utilis\'e principalement des traits bas\'es sur la similarit\'e cosinus des deux vecteurs repr\'esentant la similarit\'e textuelle entre des r\'eponses d'\'etudiant et la r\'ef\'erence. Plusieurs types de vecteurs ont \'et\'e utilis\'es (vecteur d'occurrences de mots, vecteur tf-idf, embeddings non contextualis\'es de fastText, embeddings contextualis\'es de CamemBERT et enfin Sentence Embeddings Multilingues ajust\'es sur des corpus multilingues). La meilleure performance du concours sur cette t\^ache a \'et\'e de 0.682 (pr\'ecision) et celle de notre \'equipe 0.639. Cette performance a \'et\'e obtenue avec les Sentence Embeddings Multilingues alors que celle des embeddings non ajust\'es ne s'est \'elev\'ee qu'\`a 0.55, sugg\'erant que de r\'ecents mod\`eles de langues pr\'e-entra{\^\i}n\'es doivent \^etre fine-tun\'es afin d'avoir des embeddings ad\'equats au niveau phrastique.",
    keywords = "\'evaluation automatique, similarit\'e textuelle, CamemBERT",
    url = "http://talnarchives.atala.org/ateliers/2021/DEFT/74.pdf"
}
