@inproceedings{Terzic:RECITAL:2019,
    author = "Terzic,Dusica",
    title = "Parsing des textes journalistiques en serbe \`{a} l'aide du logiciel Talismane",
    booktitle = "Actes de la Conf\'{e}rence sur le Traitement Automatique des Langues Naturelles - Volume III : RECITAL",
    month = "7",
    year = "2019",
    address = "Toulouse, France",
    publisher = "Association pour le Traitement Automatique des Langues",
    pages = "579-592",
    note = "Parsing of newspaper texts in Serbian using Talismane",
    abstract = "Cet article pr\'{e}sente la cr\'{e}ation d'un treebank journalistique serbe, ParCoJour. Il est compos\'{e} de 30K tokens et dot\'{e} de trois couches d'annotation : \'{e}tiquetage morphosyntaxique, lemmatisation et annotation syntaxique. Une fois construit, ParCoJour a \'{e}t\'{e} utilis\'{e} dans trois exp\'{e}riences afin d'\'{e}valuer l'impact du domaine textuel sur le parsing du serbe en comparant les performances de Talismane, un syst\`{e}me par apprentissage automatique, sur deux types de corpus, journalistique et litt\'{e}raire : 1) parsing du corpus journalistique avec un mod\`{e}le entra\^{\i}n\'{e} sur le corpus journalistique ; 2) parsing du corpus journalistique avec un mod\`{e}le entra\^{\i}n\'{e} sur le corpus litt\'{e}raire ; 3) parsing du corpus litt\'{e}raire avec un mod\`{e}le entra\^{\i}n\'{e} sur le corpus journalistique. Les r\'{e}sultats sont compar\'{e}s \`{a} ceux o\`{u} les deux corpus relevaient du domaine litt\'{e}raire. Le changement de domaine textuel dans la deuxi\`{e}me et la troisi\`{e}me exp\'{e}rience entra\^{\i}ne une baisse des performances, mais les r\'{e}sultats de parsing restent satisfaisants.",
    keywords = "Parsing, corpus d'entra\^{\i}nement, serbe, adaptation de domaine.",
    url = "https://talnarchives.atala.org/RECITAL/RECITAL-2019/12.pdf"
}
