@inproceedings{G-Moreno-Lovon-Melgarejo-Robin-Charlet-Damase-Michel-Tamine:CORIA-TALN:2025,
    author = "G Moreno, Jose and Lovon-Melgarejo, Jesus and Robin-Charlet, M'Rick and Damase-Michel, Christine and Tamine, Lynda",
    title = "PatientDx : Fusion des grands mod\`eles de langue pour la protection de la confidentialit\'e des donn\'ees dans le domaine de la sant\'e",
    booktitle = "Actes de CORIA-TALN-RJCRI-RECITAL 2025. Actes des 32\`eme Conf\'erence sur le Traitement Automatique des Langues Naturelles (TALN),  volume 2 : traductions d'articles publi\'es",
    month = "6",
    year = "2025",
    address = "Marseille, France",
    publisher = "Association pour le Traitement Automatique des Langues",
    pages = "53-54",
    note = "",
    abstract = "L{\textquoteright}affinage des grands mod\`eles de langue (abr\'eg\'e LLM de l{\textquoteright}anglais large language model) est devenu la pratique courante pour am\'eliorer la performance des mod\`eles sur une t\^ache donn\'ee. Cependant, cette am\'elioration de performance s{\textquoteright}accompagne d{\textquoteright}un co\^ut : l{\textquoteright}entra{\^\i}nement sur de vastes quantit\'es de donn\'ees annot\'ees potentiellement sensibles, ce qui soul\`eve d{\textquoteright}importantes pr\'eoccupations en mati\`ere de confidentialit\'e des donn\'ees. Le domaine de la sant\'e constitue l{\textquoteright}un des domaines les plus sensibles expos\'es aux probl\`emes de confidentialit\'e des donn\'ees. Dans cet article, nous pr\'esentons {\textquotedblleft}PatientDx{\textquotedblright}, une architecture de fusion de mod\`eles permettant de concevoir des LLM efficaces pour les t\^aches pr\'edictives en sant\'e sans n\'ecessiter d{\textquoteright}affinage ni d{\textquoteright}adaptation sur les donn\'ees des patients. Notre proposition repose sur des techniques r\'ecemment propos\'ees connues sous le nom de fusion de LLM et vise \`a optimiser une strat\'egie de fusion modulaire. {\textquotedblleft}PatientDx{\textquotedblright} utilise un mod\`ele pivot adapt\'e au raisonnement num\'erique et ajuste les hyperparam\`etres sur des exemples en fonction d{\textquoteright}une m\'etrique de performance, mais sans entra{\^\i}ner le LLM sur ces donn\'ees. Les exp\'eriences utilisant les t\^aches de pr\'ediction de mortalit\'e de l{\textquoteright}ensemble de donn\'ees MIMIC-IV montrent des am\'eliorations jusqu{\textquoteright}\`a 7\\% en termes d{\textquoteright}AUROC par rapport aux mod\`eles initiaux. De plus, nous confirmons que, compar\'ee aux mod\`eles affin\'es, notre proposition est moins sujette aux probl\`emes de fuite de donn\'ees sans nuire \`a la performance. Enfin, nous d\'emontrons qualitativement les capacit\'es de notre proposition \`a travers une \'etude de cas. Notre meilleur mod\`ele est publiquement disponible : https://huggingface.co/Jgmorenof/mistral\\_merged\\_0\\_4. Ceci est le r\'esum\'e de l{\textquoteright}article publi\'e {\textquotedblleft}PatientDx : Merging Large Language Models for Protecting Data-Privacy in Healthcare{\textquotedblright} dans l{\textquoteright}atelier CL4Health, NAACL 2025 (Moreno et al., 2025).",
    keywords = "grands mod\`eles de langue, fusion des mod\`eles, confidentialit\'e des donn\'ees.",
    url = "https://talnarchives.atala.org/TALN/TALN-2025/58.pdf"
}
