talnarchives

Une archive numérique francophone des articles de recherche en Traitement Automatique de la Langue.

Évaluation de métriques de RAG dans un contexte applicatif : une expérience, ses conclusions et ses limites

Quentin Brabant

Résumé : Cet article rapporte une expérience visant à évaluer la pertinence de différentes métriques de RAG. L'expérience s'appuie sur un jeu de données de type question-réponse, créé par des annotateurices à partir de données métier. Les réponses produites et les passages retrouvés par un système de RAG sont notés à l'aide de métriques d'évaluation du RAG issues de quatre bibliothèques (Ragas, DeepEval, RAGEval, Opik). Ces métriques sont comparées à des notes données par deux évaluateurices, ainsi qu'à des métriques standards telles que le rappel. Une analyse des corrélations est effectuée. Enfin, nous mettons en évidence certaines limites de notre méthodologie, que nous comparons à celles employées dans la littérature, afin de suggérer quelques pistes de recherche.

Mots clés : RAG, évaluation, métrique, llm-as-a-judge