@inproceedings{Semmar-Sanjuan:CORIA-TALN-2026:2026,
    author = "Semmar, Hichem and Sanjuan, Eric",
    title = "Analyse des dynamiques internes des LLMs pour distinguer m\'emorisation et hallucination",
    booktitle = "Actes de CORIA-TALN 2026. Actes de l'atelier sur l'\'evaluation des mod\`eles g\'en\'eratifs (LLM) et challenges (EvalLLM 2026)",
    month = "6",
    year = "2026",
    address = "Nantes, France",
    publisher = "Association pour le Traitement Automatique des Langues",
    pages = "1-12",
    note = "",
    abstract = "La m\'emorisation dans les grands mod\`eles de langage (LLMs) soul\`eve des enjeux importants dans les domaines sensibles impliquant la propri\'et\'e intellectuelle (IP) ou des donn\'ees personnelles, o\`u la fiabilit\'e et la tra\c{c}abilit\'e des contenus g\'en\'er\'es sont essentielles. Il demeure toutefois difficile de d\'eterminer si une r\'eponse r\'esulte d'une g\'en\'eralisation ou d'une exposition pr\'ealable aux donn\'ees d'entra{\^\i}nement sans acc\`es direct \`a celles-ci. Dans ce travail, on \'etudie si des signaux internes permettent de caract\'eriser un comportement de type m\'emorisation dans des mod\`eles \`a poids ouverts. En nous appuyant sur FACTUM, on analyse des m\'etriques internes telles que PFS et PAS afin d'\'etudier comment les mod\`eles \'equilibrent m\'emoire param\'etrique et information contextuelle. \`A l'aide d'un benchmark d\'eriv\'e de la litt\'erature COVID-19 soumise \`a des restrictions IP, on \'evalue des mod\`eles Llama 3.1 8B, Llama 3.2 3B et Ministral 3-3B \`a travers des m\'etriques de confiance classiques, notamment la perplexit\'e, l'entropie, l'\'energie et P(True). Les r\'esultats montrent que les signaux internes et probabilistes corr\`elent avec la justesse des r\'eponses, sugg\'erant que les dynamiques internes peuvent fournir des indices utiles pour analyser la m\'emorisation et l'exposition potentielle aux donn\'ees d'entra{\^\i}nement, avec des implications pour l'audit des mod\`eles et l'\'evaluation juridique.",
    keywords = "Grands mod\`eles linguistiques, d\'etection des hallucinations, m\'emorisation, exposition des donn\'ees d'entra{\^\i}nement, interpr\'etabilit\'e des mod\`eles, estimation de l'incertitude, perplexit\'e entropie, FACTUM, m\'emoire param\'etrique, r\'eglage fin, propri\'et\'e intellectuelle",
    url = "733565.pdf"
}
