@inproceedings{Touchent-de-la-Clergerie:CORIA-TALN-2026:2026,
    author = "Touchent, Rian and de la Clergerie, Eric",
    title = "TABIB: Vers un Benchmark Adversarial Fran\c{c}ais pour les LLMs Biom\'edicaux",
    booktitle = "Actes de CORIA-TALN 2026. Actes de l'atelier sur l'\'evaluation des mod\`eles g\'en\'eratifs (LLM) et challenges (EvalLLM 2026)",
    month = "6",
    year = "2026",
    address = "Nantes, France",
    publisher = "Association pour le Traitement Automatique des Langues",
    pages = "191-206",
    note = "",
    abstract = "Nous pr\'esentons les premiers r\'esultats de TABIB (Testing Adversarial Behaviors In Biomedical LLMs), un benchmark d'\'evaluation comportementale des LLMs biom\'edicaux en fran\c{c}ais. Cette premi\`ere version s'appuie sur le th\'esaurus ANSM des interactions m\'edicamenteuses et la BDPM, avec sept protocoles que nous pr\'evoyons d'\'etendre. Les benchmarks existants \'evaluent la connaissance factuelle ; TABIB \'evalue la robustesse face \`a des perturbations qui pr\'eservent la s\'emantique de la question (substitution DCI/marque, ench\^assement contextuel, pression patient, changement de langue). Sur sept mod\`eles locaux (2B{\textendash}9B), les r\'esultats r\'ev\`elent des fragilit\'es significatives : la d\'etection d'interactions peut chuter jusqu'\`a 74 pp quand la paire est noy\'ee dans un compte-rendu clinique ; jusqu'\`a 28 \\% des conversations o\`u un patient conteste l'avis du mod\`ele finissent en conseil dangereux ; \`a cas cliniques identiques, certains profils d\'emographiques sont syst\'ematiquement prioris\'es en classement simultan\'e, alors que l'\'evaluation patient par patient ne r\'ev\`ele aucun biais",
    keywords = "\'evaluation de LLMs, benchmark fran\c{c}ais, domaine m\'edical, robustesse, biai",
    url = "733487.pdf"
}
