@inproceedings{Kaan-Alkan-Grouin-Zweigenbaum:CORIA-TALN:2023,
    author = "Kaan Alkan, Atilla and Grouin, Cyril and Zweigenbaum, Pierre",
    title = "\'Etude de m\'ethodes d'augmentation de donn\'ees pour la reconnaissance d'entit\'es nomm\'ees en astrophysique",
    booktitle = "Actes de CORIA-TALN 2023. Actes de la 30e Conf\'erence sur le Traitement Automatique des Langues Naturelles (TALN),  volume 1 : travaux de recherche originaux - articles longs",
    month = "6",
    year = "2023",
    address = "Paris, France",
    publisher = "Association pour le Traitement Automatique des Langues",
    pages = "1-13",
    note = "",
    abstract = "Dans cet article nous \'etudions l'int\'er\^et de l'augmentation de donn\'ees pour le rep\'erage d'entit\'es nomm\'ees en domaine de sp\'ecialit\'e : l'astrophysique. Pour cela, nous comparons trois m\'ethodes d'augmentation en utilisant deux r\'ecents corpus annot\'es du domaine : DEAL et TDAC, tous deux en anglais. Nous avons g\'en\'er\'es les donn\'ees artificielles en utilisant des m\'ethodes \`a base de r\`egles et \`a base de mod\`eles de langue. Les donn\'ees ont ensuite \'et\'e ajout\'ees de mani\`ere it\'erative pour affiner un syst\`eme de d\'etection d'entit\'es. Les r\'esultats permettent de constater un effet de seuil : ajouter des donn\'ees artificielles au-del\`a d'une certaine quantit\'e ne pr\'esente plus d'int\'er\^et et peut d\'egrader la F-mesure. Sur les deux corpus, le seuil varie selon la m\'ethode employ\'ee, et en fonction du mod\`ele de langue utilis\'e. Cette \'etude met \'egalement en \'evidence que l'augmentation de donn\'ees est plus efficace sur de petits corpus, ce qui est coh\'erent avec d'autres \'etudes ant\'erieures. En effet, nos exp\'eriences montrent qu'il est possible d'am\'eliorer de 1 point la F-mesure sur le corpus DEAL, et jusqu'\`a 2 points sur le corpus TDAC.",
    keywords = "Rep\'erage d'entit\'es nomm\'ees, Augmentation de donn\'ees, Annotation, Astrophysique",
    url = "461930.pdf"
}
