talnarchives

Une archive numérique francophone des articles de recherche en Traitement Automatique de la Langue.

Une catégorisation de fins de lignes non-supervisée

Pierre Zweigenbaum, Cyril Grouin, Thomas Lavergne

Résumé : Dans certains textes bruts, les marques de fin de ligne peuvent marquer ou pas la frontière d’une unité textuelle (typiquement un paragraphe). Ce problème risque d’influencer les traitements subséquents, mais est rarement traité dans la littérature. Nous proposons une méthode entièrement non-supervisée pour déterminer si une fin de ligne doit être vue comme un simple espace ou comme une véritable frontière d’unité textuelle, et la testons sur un corpus de comptes rendus médicaux. Cette méthode obtient une F-mesure de 0,926 sur un échantillon de 24 textes contenant des lignes repliées. Appliquée sur un échantillon plus grand de textes contenant ou pas des lignes repliées, notre méthode la plus prudente obtient une F-mesure de 0,898, valeur élevée pour une méthode entièrement non-supervisée.

Mots clés : Classification non-supervisée ; classification des fins de lignes ; paragraphes repliés.