@inproceedings{Hiebel-Olivier-Fort-Neveol:CORIA-TALN:2023,
    author = {Hiebel, Nicolas and Olivier, Ferret and Fort, Kar\"en and N\'ev\'eol, Aur\'elie},
    title = "Les textes cliniques fran\c{c}ais g\'en\'er\'es sont-ils dangereusement similaires \`a leur source ? Analyse par plongements de phrases",
    booktitle = "Actes de CORIA-TALN 2023. Actes de la 30e Conf\'erence sur le Traitement Automatique des Langues Naturelles (TALN),  volume 2 : travaux de recherche originaux - articles courts",
    month = "6",
    year = "2023",
    address = "Paris, France",
    publisher = "Association pour le Traitement Automatique des Langues",
    pages = "46-54",
    note = "",
    abstract = "Les ressources textuelles disponibles dans le domaine biom\'edical sont rares pour des raisons de confidentialit\'e. Des donn\'ees existent mais ne sont pas partageables, c'est pourquoi il est int\'eressant de s'inspirer de ces donn\'ees pour en g\'en\'erer de nouvelles sans contrainte de partage. Une difficult\'e majeure de la g\'en\'eration de donn\'ees m\'edicales est que les donn\'ees g\'en\'er\'ees doivent ressembler aux donn\'ees originales sans compromettre leur confidentialit\'e. L'\'evaluation de cette t\^ache est donc difficile. Dans cette \'etude, nous \'etendons l'\'evaluation de corpus cliniques g\'en\'er\'es en fran\c{c}ais en y ajoutant une dimension s\'emantique \`a l'aide de plongements de phrases. Nous recherchons des phrases proches \`a l'aide de similarit\'e cosinus entre plongements, et analysons les scores de similarit\'e. Nous observons que les phrases synth\'etiques sont th\'ematiquement proches du corpus original, mais suffisamment \'eloign\'ees pour ne pas \^etre de simples reformulations qui compromettraient la confidentialit\'e.",
    keywords = "G\'en\'eration, \'Evaluation, Similarit\'e, Texte clinique, Texte synth\'etique, Fran\c{c}ais",
    url = "461752.pdf"
}
