@inproceedings{Touchent-Romary-De-La-Clergerie:CORIA-TALN:2023,
    author = "Touchent, Rian and Romary, Laurent and De La Clergerie, Eric",
    title = "CamemBERT-bio : Un mod\`ele de langue fran\c{c}ais savoureux et meilleur pour la sant\'e",
    booktitle = "Actes de CORIA-TALN 2023. Actes de la 30e Conf\'erence sur le Traitement Automatique des Langues Naturelles (TALN),  volume 1 : travaux de recherche originaux - articles longs",
    month = "6",
    year = "2023",
    address = "Paris, France",
    publisher = "Association pour le Traitement Automatique des Langues",
    pages = "323-334",
    note = "",
    abstract = "Les donn\'ees cliniques dans les h\^opitaux sont de plus en plus accessibles pour la recherche \`a travers les entrep\^ots de donn\'ees de sant\'e, cependant ces documents sont non-structur\'es. Il est donc n\'ecessaire d'extraire les informations des comptes-rendus m\'edicaux. L'utilisation du transfert d'apprentissage gr\^ace \`a des mod\`eles de type BERT comme CamemBERT ont permis des avanc\'ees majeures, notamment pour la reconnaissance d'entit\'es nomm\'ees. Cependant, ces mod\`eles sont entra{\^\i}n\'es pour le langage courant et sont moins performants sur des donn\'ees biom\'edicales. C'est pourquoi nous proposons un nouveau jeu de donn\'ees biom\'edical public fran\c{c}ais sur lequel nous avons poursuivi le pr\'e-entra{\^\i}nement de CamemBERT. Ainsi, nous pr\'esentons une premi\`ere version de CamemBERT-bio, un mod\`ele public sp\'ecialis\'e pour le domaine biom\'edical fran\c{c}ais qui montre un gain de 2,54 points de F-mesure en moyenne sur diff\'erents jeux d'\'evaluations de reconnaissance d'entit\'es nomm\'ees biom\'edicales.",
    keywords = "comptes rendus m\'edicaux, TAL clinique, CamemBERT, extraction d'information, biom\'edical, reconnaissance d'entit\'es nomm\'ees",
    url = "461902.pdf"
}
