@inproceedings{Liyanage-Buscaldi:CORIA-TALN:2023,
    author = "Liyanage, Vijini and Buscaldi, Davide",
    title = "La d\'etection de textes g\'en\'er\'es par des mod\`eles de langue : une t\^ache complexe? Une \'etude sur des textes acad\'emiques",
    booktitle = "Actes de CORIA-TALN 2023. Actes de l'atelier ''Analyse et Recherche de Textes Scientifiques'' (ARTS)@TALN 2023",
    month = "6",
    year = "2023",
    address = "Paris, France",
    publisher = "Association pour le Traitement Automatique des Langues",
    pages = "71-78",
    note = "",
    abstract = "L'\'emergence de mod\`eles de langage tr\`es puissants tels que GPT-3 a sensibilis\'e les chercheurs \`a la probl\'ematique de la d\'etection de textes acad\'emiques g\'en\'er\'es automatiquement, principalement dans un souci de pr\'evention de plagiat. Plusieurs \'etudes ont montr\'e que les mod\`eles de d\'etection actuels ont une pr\'ecision \'elev\'ee, en donnant l'impression que la t\^ache soit r\'esolue. Cependant, nous avons observ\'e que les ensembles de donn\'ees utilis\'es pour ces exp\'eriences contiennent des textes g\'en\'er\'es automatiquement \`a partir de mod\`eles pr\'e-entra{\^\i}n\'es. Une utilisation plus r\'ealiste des mod\`eles de langage consisterait \`a effectuer un fine-tuning sur un texte \'ecrit par un humain pour compl\'eter les parties manquantes. Ainsi, nous avons constitu\'e un corpus de textes g\'en\'er\'es de mani\`ere plus r\'ealiste et men\'e des exp\'eriences avec plusieurs mod\`eles de classification. Nos r\'esultats montrent que lorsque les ensembles de donn\'ees sont g\'en\'er\'es de mani\`ere r\'ealiste pour simuler l'utilisation de mod\`eles de langage par les chercheurs, la d\'etection de ces textes devient une t\^ache assez difficile.",
    keywords = "D\'etection de plagiat, D\'etection et v\'erification d'affirmations scientifiques, Jeux de donn\'ees compos\'es des textes scientifiques",
    url = "http://talnarchives.atala.org/ateliers/2023/ARTS/1467264.pdf"
}
