@inproceedings{Mutuvi-Boros-Doucet-Jatowt-Lejeune-Odeo:TALN:2022,
    author = {Mutuvi, Stephen and Boros, Emanuela and Doucet, Antoine and Jatowt, Adam and Lejeune, Ga\"el and Odeo, Moses},
    title = "Fine-tuning de mod\`eles de langues pour la veille \'epid\'emiologique multilingue avec peu de ressources",
    booktitle = "Actes de la 29e Conf\'erence sur le Traitement Automatique des Langues Naturelles. Volume 1 : conf\'erence principale / Traduction de soumissions en cours \`a des conf\'erences internationales",
    month = "6",
    year = "2022",
    address = "Avignon, France",
    publisher = "Association pour le Traitement Automatique des Langues",
    pages = "76-85",
    note = "Fine-tuning Language Models for Low-resource Multilingual Epidemic Surveillance",
    abstract = "Les mod\`eles de langues pr\'e-entra{\^\i}n\'es connaissent un tr\`es grand succ\`es en TAL, en particulier dans les situations o\`u l'on dispose de suffisamment de donn\'ees d'entra{\^\i}nement. Cependant, il reste difficile d'obtenir des r\'esultats similaires dans des environnements multilingues avec peu de donn\'ees d'entra{\^\i}nement, en particulier dans des domaines sp\'ecialis\'es tels que la surveillance des \'epid\'emies. Dans cet article, nous explorons plusieurs hypoth\`eses concernant les facteurs qui pourraient avoir une influence sur les performances d'un syst\`eme d'extraction d'\'ev\'enements \'epid\'emiologiques dans un sc\'enario multilingue \`a faibles ressources : le type de mod\`ele pr\'e-entra{\^\i}n\'e, la qualit\'e du tokenizer ainsi que les caract\'eristiques des entit\'es \`a extraire. Nous proposons une analyse exhaustive de ces facteurs et observons une corr\'elation importante, quoique variable ; entre ces caract\'eristiques et les performances observ\'ees sur la base d'une t\^ache de veille \'epid\'emiologique multilingue \`a faibles ressources. Nous proposons aussi d'adapter les mod\`eles de langues \`a cette t\^ache en \'etendant le vocabulaire du tokenizer pr\'e-entra{\^\i}n\'e avec les entit\'es continues, qui sont des entit\'es qui ont \'et\'e divis\'ees en plusieurs sous-mots. Suite \`a cette adaptation, nous observons une am\'elioration notable des performances pour la plupart des mod\`eles et des langues \'evalu\'es.",
    keywords = "extraction d'\'ev\'enements \'epid\'emiologiques, langues peu dot\'ees, mod\`eles de langues.",
    url = "http://talnarchives.atala.org/TALN/TALN-2022/8981.pdf"
}
