@inproceedings{Boulanger-Lavergne-Rosset:CORIA-TALN:2023,
    author = "Boulanger, Hugo and Lavergne, Thomas and Rosset, Sophie",
    title = "Tri-apprentissage g\'en\'eratif : g\'en\'eration de donn\'ees pour de la reconnaissance d'entit\'ees nomm\'ees semi-supervis\'e",
    booktitle = "Actes de CORIA-TALN 2023. Actes de la 30e Conf\'erence sur le Traitement Automatique des Langues Naturelles (TALN),  volume 1 : travaux de recherche originaux - articles longs",
    month = "6",
    year = "2023",
    address = "Paris, France",
    publisher = "Association pour le Traitement Automatique des Langues",
    pages = "68-79",
    note = "",
    abstract = "Le d\'eveloppement de solutions de traitement automatique de la langue pour de nouvelles t\^aches n\'ecessite des donn\'ees, dont l'obtention est co\^uteuses. L'acc\`es aux donn\'ees peut \^etre limit\'e en raison de la nature sensible des donn\'ees. La plupart des travaux r\'ecents ont exploit\'e de grands mod\`eles pr\'e-entra{\^\i}n\'es pour initialiser des versions sp\'ecialis\'ees de ceux-ci. La sp\'ecialisation d'un tel mod\`ele n\'ecessite toujours une quantit\'e \'elev\'ee de donn\'ees \'etiquet\'ees sp\'ecifiques \`a la t\^ache cible. Nous utilisons l'apprentissage semi-supervis\'e pour entra{\^\i}ner des mod\`eles dans un contexte o\`u le nombre d'exemples \'etiquet\'es est limit\'e et le nombre de donn\'ees non \'etiquet\'ees est nul. Nous \'etudions plusieurs m\'ethodes pour g\'en\'erer le corpus non \'etiquet\'e n\'ecessaire \`a l'utilisation de l'apprentissage semi-supervis\'e. Nous introduisons les m\'ethodes de g\'en\'eration entre les \'episodes d'entra{\^\i}nement et utilisons les mod\`eles entra{\^\i}n\'es pour filtrer les exemples g\'en\'er\'es. Nous testons cette g\'en\'eration avec le tri-apprentissage et l'auto-apprentissage sur des corpus Anglais et Fran\c{c}ais.",
    keywords = "REN, g\'en\'eration, faible ressources, semi, supervision",
    url = "459392.pdf"
}
