@inproceedings{Salin:CORIA-TALN:2023,
    author = "Salin, Emmanuelle",
    title = "\'Etat des lieux des Transformers Vision-Langage : Un \'eclairage sur les donn\'ees de pr\'e-entra{\^\i}nement",
    booktitle = "Actes de CORIA-TALN 2023. Actes de la 30e Conf\'erence sur le Traitement Automatique des Langues Naturelles (TALN),  volume 3 : prises de position en TAL",
    month = "6",
    year = "2023",
    address = "Paris, France",
    publisher = "Association pour le Traitement Automatique des Langues",
    pages = "14-29",
    note = "",
    abstract = "Apr\`es avoir \'et\'e d\'evelopp\'ee en traitement automatique du langage, l'architecture Transformer s'est d\'emocratis\'ee dans de nombreux domaines de l'apprentissage automatique. Elle a permis de surpasser l'\'etat de l'art dans de nombreuses t\^aches et a conduit \`a la cr\'eation de tr\`es grands jeux de donn\'ees afin d'am\'eliorer les performances des mod\`eles. \textasciitilde\ En multimodalit\'e vision-langage, les r\'esultats encourageants des Transformers favorisent la collecte de donn\'ees image-texte \`a tr\`es grande \'echelle. Cependant, il est difficile d'\'evaluer la qualit\'e de ces nouveaux jeux de donn\'ees, ainsi que leur influence sur la performance de ces mod\`eles, car notre compr\'ehension des Transformers vision-langage est encore limit\'ee. Nous explorons les \'etudes du domaine pour mieux comprendre les processus de collecte des jeux de donn\'ees, les caract\'eristiques de ces donn\'ees et leurs impacts sur les performances des mod\`eles.",
    keywords = "Langage, Multimodalit\'e, Vision, Jeux de donn\'ees",
    url = "461390.pdf"
}
