@inproceedings{Kuhnast-Verlingue:CORIA-TALN:2025,
    author = "Kuhnast, Adrien and Verlingue, Loic",
    title = "Evaluation et analyse des performances des grands mod\`eles de langue sur des \'epreuves d{\textquoteright}examen de m\'edecine fran\c{c}ais",
    booktitle = "Actes de CORIA-TALN-RJCRI-RECITAL 2025. Actes de l'atelier Traitement du langage m\'edical \`a l{\textquoteright}\'epoque des LLMs 2025 (MLP-LLM)",
    month = "6",
    year = "2025",
    address = "Marseille, France",
    publisher = "Association pour le Traitement Automatique des Langues",
    pages = "14-24",
    note = "",
    abstract = "Les grands mod\`eles de langue (GMLs) ont d\'emontr\'e leur capacit\'e \`a r\'epondre correctement \`a des questions de m\'edecine sur des bases anglaises. Or, leur param\'etrage par apprentissage profond les soumet au biais linguistique et doivent ainsi \^etre \'evalu\'es dans la langue de l{\textquoteright}utilisateur. Nous avons \'evalu\'e des GMLs sur 278 questions \`a choix multiples provenant d{\textquoteright}examens de m\'edecine (Lyon-Est 2024) de diff\'erentes sp\'ecialit\'es et respectant les recommandations nationales. Nos r\'esultats montrent que les GMLs sont aussi bons que les \'etudiants mais qu{\textquoteright}il existe d{\textquoteright}importantes variations selon les sp\'ecialit\'es. Am\'eliorer la consigne en pr\'ecisant de s{\textquoteright}appuyer sur les recommandations fran\c{c}aises modifie significativement les notes obtenues ce qui d\'emontre la n\'ecessit\'e d{\textquoteright}\'eprouver les GMLs selon diff\'erents contextes g\'eographiques et linguistiques. Nous avons \'egalement analys\'e le type d{\textquoteright}erreur que font les GMLs ce qui ouvre la porte \`a des am\'eliorations plus cibl\'ees.",
    keywords = "Grand mod\`ele de langue, biais linguistique, base de donn\'ees fran\c{c}aise, type d{\textquoteright}erreur",
    url = "https://talnarchives.atala.org/ateliers/2025/MLP-LLM/188.pdf"
}
