@inproceedings{Martin-Muller-Javier-Ortiz-Suarez-Dupont-Romary-Villemonte-de-la-Clergerie-Sagot-Seddah:TALN:2020,
    author = "Martin, Louis and Muller, Benjamin and Javier Ortiz Su\'arez, Pedro and Dupont, Yoan and Romary, Laurent and Villemonte de la Clergerie, Eric and Sagot, Beno{\^\i}t and Seddah, Djam\'e",
    title = "Les mod\`eles de langue contextuels Camembert pour le fran\c{c}ais : impact de la taille et de l'h\'et\'erog\'en\'eit\'e des donn\'ees d'entrainement",
    booktitle = "Actes de la Conf\'erence sur le Traitement Automatique des Langues Naturelles. Volume 2 : Traitement Automatique des Langues Naturelles (Articles longs)",
    month = "6",
    year = "2020",
    address = "Nancy, France",
    publisher = "Association pour le Traitement Automatique des Langues",
    pages = "54-65",
    note = "C AMEM BERT Contextual Language Models for French: Impact of Training Data Size and Heterogeneity ",
    abstract = "Les mod\`eles de langue neuronaux contextuels sont d\'esormais omnipr\'esents en traitement automatique des langues. Jusqu'\`a r\'ecemment, la plupart des mod\`eles disponibles ont \'et\'e entra{\^\i}n\'es soit sur des donn\'ees en anglais, soit sur la concat\'enation de donn\'ees dans plusieurs langues. L'utilisation pratique de ces mod\`eles {\textemdash} dans toutes les langues sauf l'anglais {\textemdash} \'etait donc limit\'ee. La sortie r\'ecente de plusieurs mod\`eles monolingues fond\'es sur BERT (Devlin et al., 2019), notamment pour le fran\c{c}ais, a d\'emontr\'e l'int\'er\^et de ces mod\`eles en am\'eliorant l'\'etat de l'art pour toutes les t\^aches \'evalu\'ees. Dans cet article, \`a partir d'exp\'eriences men\'ees sur CamemBERT (Martin et al., 2019), nous montrons que l'utilisation de donn\'ees \`a haute variabilit\'e est pr\'ef\'erable \`a des donn\'ees plus uniformes. De fa\c{c}on plus surprenante, nous montrons que l'utilisation d'un ensemble relativement petit de donn\'ees issues du web (4Go) donne des r\'esultats aussi bons que ceux obtenus \`a partir d'ensembles de donn\'ees plus grands de deux ordres de grandeurs (138Go).",
    keywords = "Mod\`eles de langue contextuels, BERT, CamemBERT, impact jeu de donn\'ees.",
    url = "http://talnarchives.atala.org/TALN/TALN-2020/151.pdf"
}
