@inproceedings{Gallot-Jourdain:CORIA-TALN-2026:2026,
    author = "Gallot, Alexandre and Jourdain, Louis",
    title = "De l'outil au sc\'enario : g\'en\'eration automatique de benchmarks pour agents conversationnels",
    booktitle = "Actes de CORIA-TALN 2026. Actes de l'atelier sur l'\'evaluation des mod\`eles g\'en\'eratifs (LLM) et challenges (EvalLLM 2026)",
    month = "6",
    year = "2026",
    address = "Nantes, France",
    publisher = "Association pour le Traitement Automatique des Langues",
    pages = "38-63",
    note = "",
    abstract = "L'\'evaluation des agents conversationnels dot\'es d'outils r\'eels reste co\^uteuse et difficile \`a g\'en\'eraliser. Nous proposons un syst\`eme de g\'en\'eration automatique de sc\'enarios d'\'evaluation synth\'etiques, fond\'e sur la mod\'elisation de l'espace d'ex\'ecution comme un graphe de transition pond\'er\'e. \`A partir des seuls outils de l'agent, le pipeline audite chaque outil, construit un automate \`a \'etats finis, pond\`ere les transitions par une cha{\^\i}ne de Markov du premier ordre, puis hydrate des trajectoires \'echantillonn\'ees en sc\'enarios complets via des appels r\'eels aux outils. Appliqu\'e \`a delhIA (7 outils M\'et\'eo-France), le syst\`eme produit 50 t\^aches couvrant 6 outils (5,7 appels en moyenne) et est d\'eploy\'e sur 10 agents, 60 outils dans des domaines vari\'es.",
    keywords = "agent conversationnel, \'evaluation, donn\'ees synth\'etiques, cha{\^\i}ne de Markov, LLM.",
    url = "733466.pdf"
}
