@inproceedings{iyad-Nejah-Harzallah-Berio-Eslami:CORIA-TALN-2026:2026,
    author = "iyad Nejah, Dhaker and Harzallah, Mounira and Berio, Giuseppe and Eslami, Yasamin",
    title = "What Do Current Evaluation Practices Evaluate About LLMs in Ontology-Oriented Generation?Focused Review for Specialized-Domain Settings",
    booktitle = "Actes de CORIA-TALN 2026. Actes de l'atelier sur l'\'evaluation des mod\`eles g\'en\'eratifs (LLM) et challenges (EvalLLM 2026)",
    month = "6",
    year = "2026",
    address = "Nantes, France",
    publisher = "Association pour le Traitement Automatique des Langues",
    pages = "207-215",
    note = "Cette contribution r\'eexamine l{\textquoteright}\'evaluation des syst\`emes \`a base de grands mod\`eles de langue (LLM) pour la construction, la population et l{\textquoteright}enrichissement d{\textquoteright}ontologies dans des domaines sp\'ecialis\'es",
    abstract = "Cette contribution r\'eexamine l'\'evaluation des syst\`emes \`a base de grands mod\`eles de langue (LLM) pour la construction, la population et l'enrichissement d'ontologies dans des domaines sp\'ecialis\'es. \`A partir d'un corpus PRISMA(Page et al., 2021) de 20 \'etudes, elle propose un d\'eplacement de perspective : au lieu de partir principalement de la qualit\'e de l'artefact ontologique produit, elle demande ce que les protocoles d'\'evaluation caract\'erisent effectivement \`a propos du LLM. Trois vues analytiques sont distingu\'ees : l'\'evaluation au niveau de la t\^ache, o\`u le LLM est \'evalu\'e comme pr\'edicteur local ; l'\'evaluation au niveau de l'artefact, o\`u le LLM agit dans un cadre contraint par un sch\'ema ou un m\'etamod\`ele ; et l'\'evaluation au niveau du pipeline, o\`u le LLM intervient comme composant d'un syst\`eme plus large, souvent avec RAG. L'analyse montre que les protocoles caract\'erisent surtout soit des sorties locales, soit la qualit\'e de l'artefact final, soit le comportement de bout en bout du pipeline, tandis que la contribution propre du LLM reste plus rarement sp\'ecifi\'ee avec pr\'ecision. Trois limites ressortent alors : une faible caract\'erisation des capacit\'es de structuration du mod\`ele, une \'evaluation du grounding souvent m\'edi\'ee par la qualit\'e des sorties dans les syst\`emes avec RAG, et une reproductibilit\'e encore in\'egale.",
    keywords = "grands mod\`eles de langue, g\'en\'eration augment\'ee par recherche, ontologies, \'evalua- tion, domaines sp\'ecialis\'es",
    url = "733584.pdf"
}
