What Do Current Evaluation Practices Evaluate About LLMs in Ontology-Oriented Generation?Focused Review for Specialized-Domain Settings
Dhaker iyad Nejah, Mounira Harzallah, Giuseppe Berio, Yasamin Eslami
Abstract : Cette contribution réexamine l'évaluation des systèmes à base de grands modèles de langue (LLM) pour la construction, la population et l'enrichissement d'ontologies dans des domaines spécialisés. À partir d'un corpus PRISMA(Page et al., 2021) de 20 études, elle propose un déplacement de perspective : au lieu de partir principalement de la qualité de l'artefact ontologique produit, elle demande ce que les protocoles d'évaluation caractérisent effectivement à propos du LLM. Trois vues analytiques sont distinguées : l'évaluation au niveau de la tâche, où le LLM est évalué comme prédicteur local ; l'évaluation au niveau de l'artefact, où le LLM agit dans un cadre contraint par un schéma ou un métamodèle ; et l'évaluation au niveau du pipeline, où le LLM intervient comme composant d'un système plus large, souvent avec RAG. L'analyse montre que les protocoles caractérisent surtout soit des sorties locales, soit la qualité de l'artefact final, soit le comportement de bout en bout du pipeline, tandis que la contribution propre du LLM reste plus rarement spécifiée avec précision. Trois limites ressortent alors : une faible caractérisation des capacités de structuration du modèle, une évaluation du grounding souvent médiée par la qualité des sorties dans les systèmes avec RAG, et une reproductibilité encore inégale.
Keywords : grands modèles de langue, génération augmentée par recherche, ontologies, évalua- tion, domaines spécialisés