@inproceedings{Hiebel-Fort-Neveol-Ferret:TALN:2022,
    author = {Hiebel, Nicolas and Fort, Kar\"en and N\'ev\'eol, Aur\'elie and Ferret, Olivier},
    title = "CLISTER : Un corpus pour la similarit\'e s\'emantique textuelle dans des cas cliniques en fran\c{c}ais",
    booktitle = "Actes de la 29e Conf\'erence sur le Traitement Automatique des Langues Naturelles. Volume 1 : conf\'erence principale / Traduction de soumissions en cours \`a des conf\'erences internationales",
    month = "6",
    year = "2022",
    address = "Avignon, France",
    publisher = "Association pour le Traitement Automatique des Langues",
    pages = "18-27",
    note = "CLISTER : A Corpus for Semantic Textual Similarity in French Clinical Narratives",
    abstract = "Le TAL repose sur la disponibilit\'e de corpus annot\'es pour l'entra{\^\i}nement et l'\'evaluation de mod\`eles. Il existe tr\`es peu de ressources pour la similarit\'e s\'emantique dans le domaine clinique en fran\c{c}ais. Dans cette \'etude, nous proposons une d\'efinition de la similarit\'e guid\'ee par l'analyse clinique et l'appliquons au d\'eveloppement d'un nouveau corpus partag\'e de 1 000 paires de phrases annot\'ees manuellement en scores de similarit\'e. Nous \'evaluons ensuite le corpus par des exp\'eriences de mesure automatique de similarit\'e. Nous montrons ainsi qu'un mod\`ele de plongements de phrases peut capturer la similarit\'e avec des performances \`a l'\'etat de l'art sur le corpus DEFT STS (Spearman=0,8343). Nous montrons \'egalement que le contenu du corpus CLISTER est compl\'ementaire de celui de DEFT STS.",
    keywords = "Similarit\'e s\'emantique, D\'eveloppement de corpus, Texte clinique, Fran\c{c}ais.",
    url = "http://talnarchives.atala.org/TALN/TALN-2022/641.pdf"
}
