De l'outil au scénario : génération automatique de benchmarks pour agents conversationnels
Alexandre Gallot, Louis Jourdain
Résumé : L'évaluation des agents conversationnels dotés d'outils réels reste coûteuse et difficile à généraliser. Nous proposons un système de génération automatique de scénarios d'évaluation synthétiques, fondé sur la modélisation de l'espace d'exécution comme un graphe de transition pondéré. À partir des seuls outils de l'agent, le pipeline audite chaque outil, construit un automate à états finis, pondère les transitions par une chaîne de Markov du premier ordre, puis hydrate des trajectoires échantillonnées en scénarios complets via des appels réels aux outils. Appliqué à delhIA (7 outils Météo-France), le système produit 50 tâches couvrant 6 outils (5,7 appels en moyenne) et est déployé sur 10 agents, 60 outils dans des domaines variés.
Mots clés : agent conversationnel, évaluation, données synthétiques, chaîne de Markov, LLM.