@inproceedings{Hoang-Ha:CORIA-TALN:2025,
    author = "Hoang Ha, Huy",
    title = "Pensez: Moins de donn\'ees, meilleur raisonnement {\textendash} Repenser les LLM fran\c{c}ais",
    booktitle = "Actes de CORIA-TALN-RJCRI-RECITAL 2025. Actes des 32\`eme Conf\'erence sur le Traitement Automatique des Langues Naturelles (TALN),  volume 1 : articles scientifiques originaux",
    month = "6",
    year = "2025",
    address = "Marseille, France",
    publisher = "Association pour le Traitement Automatique des Langues",
    pages = "573-598",
    note = "",
    abstract = "Les grands mod\`eles linguistiques (LLM) ont d\'emontr\'e des capacit\'es remarquables dans diverses t\^aches de traitement automatique du langage naturel. Cependant, l'obtention de performances \'elev\'ees dans des domaines sp\'ecialis\'es tels que le raisonnement math\'ematique et les langues autres que l'anglais n\'ecessite souvent un entra{\^\i}nement intensif. Cet article \'etudie l'affinage strat\'egique sur un petit ensemble de donn\'ees bilingue de haute qualit\'e, afin d'am\'eliorer \`a la fois les capacit\'es de raisonnement et la ma{\^\i}trise de la langue fran\c{c}aise d'un LLM. Nous d\'emontrons des am\'eliorations du raisonnement math\'ematique en utilisant seulement 2000 \'echantillons soigneusement s\'electionn\'es. Ces r\'esultats remettent en question l'hypoth\`ese dominante selon laquelle des ensembles de donn\'ees massifs sont une condition pr\'ealable \`a de solides performances de raisonnement pour les LLM.",
    keywords = "Large language models, S\'election de donn\'ees, Fran\c{c}ais, Raisonnement.",
    url = "https://talnarchives.atala.org/TALN/TALN-2025/49.pdf"
}
