Les ngrammes dans la catégorisation automatique de textes arabes

Legrini, samira

Please use this identifier to cite or link to this item: https://dspace.univ-guelma.dz/jspui/handle/123456789/9220

Full metadata record

DC Field	Value	Language
dc.contributor.author	Legrini, samira	-
dc.date.accessioned	2020-11-08T08:01:19Z	-
dc.date.available	2020-11-08T08:01:19Z	-
dc.date.issued	2009	-
dc.identifier.uri	http://dspace.univ-guelma.dz:8080/xmlui/handle/123456789/9220	-
dc.description.abstract	La catégorisation automatique de textes est un domaine de recherche en plein essor, en raison de l’explosion de la quantité d’information disponible sous format électronique, et la difficulté d’accéder à l’information pertinente parmi toutes celles qui sont accessibles. Son principal enjeu est de rendre une application informatique capable d’assigner d’une façon autonome une catégorie à un document en se basant sur son contenu. Pour décrire le contenu des documents, la quasi-totalité des systèmes actuels se base sur la représentation sac de mots en raison de sa simplicité. Néanmoins avec une telle représentation le sens de termes dans la majorité des cas reste ambigu, de plus la description de certains concepts nécessite l’utilisation de quelques mots pris simultanément, mais pas séparément. Dans ce cas, l’utilisation des mots simple pour décrire ces concepts va engendrer une ambigüité sémantique L’objectif de ce mémoire est de proposer une approche qui tente de réduire cette ambigüité et d’améliorer les performances des systèmes de catégorisation de textes arabes en se basant sur des descripteurs plus informatifs et plus discriminants que les mots. L’idée de base de cette approche consiste à bénéficier des avantages liés à utilisation des Ngrammes et plus précisément les unigrames et les bi-grammes ayant un apport informationnel élevé pour la représentation des documents, et de tester leur influence sur les performances globales des systèmes de catégorisation de textes arabes. Afin d’évaluer cette approche, nous utilisons comme classifieur les machine à vecteur support (SVM), et comme base d’apprentissage un corpus en langue arabe. Notons que le choix des SVM est dû essentiellement à leur robustesse ainsi à leur capacité à traiter des espaces de données de grande dimensionnalité.	en_US
dc.language.iso	fr	en_US
dc.subject	catégorisation automatique de textes, langue arabe, N-gramme, SVM.	en_US
dc.title	Les ngrammes dans la catégorisation automatique de textes arabes	en_US
dc.type	Thesis	en_US
Appears in Collections:	Magister

Files in This Item:

File	Description	Size	Format
memoire samira legrini.pdf		112,23 MB	Adobe PDF	View/Open

Show simple item record

DSpace JSPUI

DSpace preserves and enables easy and open access to all types of digital content including text, images, moving images, mpegs and data sets