@inproceedings{Scholivet-Savary-Esteve-Candito-Ramisch:CORIA-TALN:2025,
    author = "Scholivet, Manon and Savary, Agata and Est\`eve, Louis and Candito, Marie and Ramisch, Carlos",
    title = "SELEXINI {\textendash} un grand corpus fran\c{c}ais, divers et pars\'e automatiquement",
    booktitle = "Actes de CORIA-TALN-RJCRI-RECITAL 2025. Actes des 32\`eme Conf\'erence sur le Traitement Automatique des Langues Naturelles (TALN),  volume 2 : traductions d'articles publi\'es",
    month = "6",
    year = "2025",
    address = "Marseille, France",
    publisher = "Association pour le Traitement Automatique des Langues",
    pages = "58-58",
    note = "",
    abstract = "L'annotation de grands corpus de texte est essentielle pour de nombreuses t\^aches de Traitement Automatique des Langues. Dans cet article, nous pr\'esentons SELEXINI, un grand corpus fran\c{c}ais annot\'e automatiquement en syntaxe. Ce corpus est compos\'e de deux parties : la partie BigScience, et la partie HPLT. Les documents de la partie HPLT ont \'et\'e s\'electionn\'es dans le but de maximiser la diversit\'e lexicale du corpus total SELEXINI. Une analyse de l'impact de cette s\'election sur la diversit\'e syntaxique a \'et\'e r\'ealis\'ee, ainsi qu'une \'etude de la qualit\'e des nouveaux mots issus de la partie HPLT du corpus SELEXINI. Nous avons pu montrer que malgr\'e l'introduction de nouveaux mots consid\'er\'es comme int\'eressants (formes de conjugaison rares, n\'eologismes, mots rares,...), les textes issus de HPLT sont extr\^emement bruit\'es. De plus, l'augmentation de la diversit\'e lexicale n'a pas permis d'augmenter la diversit\'e syntaxique.",
    keywords = "Corpus arbor\'e, Diversit\'e, Syntaxe, Parsing Automatique, \'Echantillonnage.",
    url = "https://talnarchives.atala.org/TALN/TALN-2025/35.pdf"
}
