@inproceedings{Lepagnol-Gerald-Ghannay-Servan-Rosset:CORIA-TALN:2025,
    author = "Lepagnol, Pierre and Gerald, Thomas and Ghannay, Sahar and Servan, Christophe and Rosset, Sophie",
    title = "D\'etection des contaminations de LLM par extraction de donn\'ees : une revue de litt\'erature pratique",
    booktitle = "Actes de CORIA-TALN-RJCRI-RECITAL 2025. Actes des 32\`eme Conf\'erence sur le Traitement Automatique des Langues Naturelles (TALN),  volume 1 : articles scientifiques originaux",
    month = "6",
    year = "2025",
    address = "Marseille, France",
    publisher = "Association pour le Traitement Automatique des Langues",
    pages = "233-251",
    note = "",
    abstract = "Cet \'etat de l'art examine le probl\`eme de la contamination des donn\'ees d'entra{\^\i}nement dans les grands mod\`eles de langue (LLM). Ce ph\'enom\`ene se produit lorsque les mod\`eles sont \'evalu\'es sur des donn\'ees qu'ils ont d\'ej\`a rencontr\'ees durant leur entra{\^\i}nement, cr\'eant une fausse impression de performance. Cette \'etude propose une synth\`ese pratique pour la communaut\'e scientifique du traitement automatique des langues (TAL). Nous pr\'esentons un cadre d'analyse qui distingue diff\'erents niveaux de contamination ainsi que diff\'erentes m\'ethodes class\'ees selon l'acc\`es au mod\`ele (White/Gray/BlackBox) et les techniques utilis\'ees (Similarit\'e/Probabilit\'e/Extraction). Nous explorons particuli\`erement les m\'ethodes d'extraction de donn\'ees de LLM, les approches techniques, les mesures de performance et leurs limites. Dans une perspective pratique, nous avons synth\'etis\'e ces m\'ethodes sous la forme d'un arbre de d\'ecision pour s\'electionner la m\'ethode de d\'etection de contamination ad\'equate.",
    keywords = "contamination des donn\'ees, grands mod\`eles de langue, inf\'erence d'appartenance, extraction de donn\'ees, d\'etection de contamination",
    url = "https://talnarchives.atala.org/TALN/TALN-2025/62.pdf"
}
