talnarchives

Une archive numérique francophone des articles de recherche en Traitement Automatique de la Langue.

Etudes sur la géolocalisation de Tweets

Thibaud Martin

Résumé : La géolocalisation de textes non structurés est un problème de recherche consistant à extraire uncontexte géographique d'un texte court. Sa résolution passe typiquement par une recherche de termesspatiaux et de la désambiguïsation. Dans cet article, nous proposons une analyse du problème, ainsi que deux méthodes d'inférence pourdéterminer le lieu dont traite un texte : 1. Comparaison de termes spatiaux à un index géographique2. Géolocalisation de textes sans information géographique à partir d'un graphe de co-occurrencede termes (avec et sans composante temporelle) Nos recherches sont basées sur un dataset de 10 millions de Tweets traitant de lieux français, dont57 830 possèdent une coordonnée géographique.

Mots clés : TALN, géolocalisation de textes, fouille de donneés, Twitter