Identification thématique hiérarchique : Application aux forums de discussions

Auteurs

Bigi, Brigitte

Smaïli, Kamel

Résumé

Les modèles statistiques du langage ont pour but de donner une représentation statistique de la langue mais souffrent de nombreuses imperfections. Des travaux récents ont montré que ces modèles peuvent être améliorés s’ils peuvent bénéficier de la connaissance du thème traité, afin de s’y adapter. Le thème du document est alors obtenu par un mécanisme d’identification thématique, mais les thèmes ainsi traités sont souvent de granularité différente, c’est pourquoi il nous semble opportun qu’ils soient organisés dans une hiérarchie. Cette structuration des thèmes implique la mise en place de techniques spécifiques d’identification thématique. Cet article propose un modèle statistique à base d’unigrammes pour identifier automatiquement le thème d’un document parmi une arborescence prédéfinie de thèmes possibles. Nous présentons également un critère qui permet au modèle de donner un degré de fiabilité à la décision prise. L’ensemble des expérimentations a été réalisé sur des données extraites du groupe ’fr’ des forums de discussion.

Mots-clés

langage

langage naturel

forum de discussion

corpus

corpus d’apprentissage

probabilité

Conférence

TALN - RECITAL - JEP 2002 : 9e conférence annuelle sur le Traitement Automatique des Langues Naturelles

Document

AC_0050.pdf