@inproceedings{Mallet-El-Khoury-Egyed-Zsigmond:CORIA-TALN:2025,
    author = {Mallet, Samuel and El Khoury, Joe and Egyed-Zsigmond, El\"od},
    title = "Repousser les limites des benchmarks actuels pour une \'evaluation r\'ealiste des LLMs en migration de code",
    booktitle = "Actes de CORIA-TALN-RJCRI-RECITAL 2025. Actes des 32\`eme Conf\'erence sur le Traitement Automatique des Langues Naturelles (TALN),  volume 1 : articles scientifiques originaux",
    month = "6",
    year = "2025",
    address = "Marseille, France",
    publisher = "Association pour le Traitement Automatique des Langues",
    pages = "682-696",
    note = "",
    abstract = "Les grands mod\`eles de langage (LLMs) offrent un potentiel important pour la migration de code, mais les benchmarks actuels cr\'eent une illusion de ma{\^\i}trise ne se traduisant pas par de bonnes performances sur des projets industriels complexes. Bien que des avanc\'ees comme RepoTransBench incluent des t\^aches \`a l'\'echelle de d\'ep\^ots complets, ces benchmarks restent irr\'ealistes : taille de projet trop limit\'ee, gestion simplifi\'ee des d\'ependances, faible diversit\'e technologique et absence de g\'en\'eration ou adaptation automatique des tests. Dans cet article, nous analysons ces limites et nous sugg\'erons de s'inspirer d'approches existantes dans des contextes monolingues, notamment la gestion des contextes longs et la g\'en\'eration automatique de tests, pour concevoir des benchmarks de migration plus r\'ealistes. Notre contribution vise \`a encourager la communaut\'e \`a d\'evelopper des \'evaluations plus repr\'esentatives des d\'efis industriels.",
    keywords = "Grand Mod\`eles de Langage, migration de code, \'evaluation, benchmarks.",
    url = "https://talnarchives.atala.org/TALN/TALN-2025/117.pdf"
}
