@inproceedings{Petrov-Venant-Lareau-Lepage-Langlais:CORIA-TALN:2025,
    author = "Petrov, Alexander and Venant, Antoine and Lareau, Fran\c{c}ois and Lepage, Yves and Langlais, Philippe",
    title = "ALF : Un jeu de donn\'ees d'analogies fran\c{c}aises \`a grain fin pour l'\'evaluation de la connaissance lexicale des grands mod\`eles de langue",
    booktitle = "Actes de CORIA-TALN-RJCRI-RECITAL 2025. Actes des 32\`eme Conf\'erence sur le Traitement Automatique des Langues Naturelles (TALN),  volume 1 : articles scientifiques originaux",
    month = "6",
    year = "2025",
    address = "Marseille, France",
    publisher = "Association pour le Traitement Automatique des Langues",
    pages = "22-49",
    note = "",
    abstract = "La r\'evolution apport\'ee par les grands mod\`eles de langue (LLM) provient de l'\'etonnante fluidit\'e des textes qu'ils g\'en\`erent. Cette fluidit\'e soul\`eve une question scientifique essentielle : quelle quantit\'e de connaissance lexicale les LLM capturent-ils r\'eellement afin de produire un langage aussi fluide? Pour y r\'epondre, nous pr\'esentons ALF, un jeu de donn\'ees analogiqes librement accessible et dot\'e de riches informations lexicographiques fond\'ees sur la th\'eorie Sens-Texte. Il comprend 2600 analogies lexicales \`a grain fin avec lesquelles nous \'evaluons la capacit\'e lexicale de quatre LLM standards : ChatGPT-4o mini ,Llama3.0-8B ,Llama3.1-8B etQwen2.5-14B . En moyenne, ChatGPT et la s\'erie Llama obtiennent une pr\'ecision aux environs de 55\\%, tandis que Qwen est juste en dessous du seuil des 60\\%, ce qui montre qu'ALF pose un d\'efi consid\'erable. Nous identifions en outre certains types d'analogies et de m\'ethodes d'invite qui r\'ev\`elent des disparit\'es de performance.",
    keywords = "Grands mod\`eles de langue, s\'emantique du langage naturel, ressources et \'evaluation, th\'eorie Sens-Texte, analogies.",
    url = "https://talnarchives.atala.org/TALN/TALN-2025/12.pdf"
}
