@inproceedings{Keraghel-Nadif:CORIA-TALN:2025,
    author = "Keraghel, Imed and Nadif, Mohamed",
    title = "Graphes, NER et LLMs pour la classification non supervis\'ee de documents",
    booktitle = "Actes de CORIA-TALN-RJCRI-RECITAL 2025. Actes des 32\`eme Conf\'erence sur le Traitement Automatique des Langues Naturelles (TALN),  volume 2 : traductions d'articles publi\'es",
    month = "6",
    year = "2025",
    address = "Marseille, France",
    publisher = "Association pour le Traitement Automatique des Langues",
    pages = "31-31",
    note = "",
    abstract = "Les r\'ecents progr\`es en apprentissage automatique, notamment les mod\`eles de langage de grande taille (LLMs) tels que BERT et GPT, offrent des plongements contextuels riches qui am\'eliorent la repr\'esentation des textes. Cependant, les approches actuelles de clustering de documents n\'egligent souvent les relations profondes entre entit\'es nomm\'ees ainsi que le potentiel des repr\'esentations issues des LLMs. Cet article propose une nouvelle approche qui int\`egre la reconnaissance d'entit\'es nomm\'ees (NER) et les embeddings de LLMs dans un cadre fond\'e sur les graphes pour le clustering de documents. La m\'ethode construit un graphe dont les n{\oe}uds repr\'esentent les documents et dont les ar\^etes sont pond\'er\'ees par la similarit\'e entre entit\'es nomm\'ees, le tout optimis\'e au moyen d'un r\'eseau de neurones convolutifs sur graphes (GCN). Cela permet un regroupement plus efficace des documents s\'emantiquement proches. Les r\'esultats exp\'erimentaux indiquent que notre approche surpasse les m\'ethodes traditionnelles bas\'ees sur la cooccurrence, en particulier pour les documents riches en entit\'es nomm\'ees.",
    keywords = "Clustering de documents, Entit\'es nomm\'ees, LLMs, Graphes, Apprentissage de repr\'esentations.",
    url = "https://talnarchives.atala.org/TALN/TALN-2025/89.pdf"
}
