Le data minning c'est aussi des algorithmes de clustering ou de classification et c'est donc ce qui te permet de traiter automatiquement tes spams (par exemple avec un réseau baysien).
On avait du faire un projet en cours sur les spams... On utilisait du TF-IDF pour classifier une base de spams et sortir des informations "pertinantes" pour chaque spams (des noms, des adresses, des numéro de compte,...).
Bon par contre on connaissait déjà le nombre de catégories, donc ça rentre plus dans le classement supervisé.
Autrement au niveau des softs, il y a la librairie Lucene qui est vraiment bien pour manipuler du texte (recherche,...) et en plus y'a plein de bindings disponible.
[^] # Re: Fouille de données
Posté par pyknite . En réponse au journal Dans la série ; les LL m'impressionnent : la fouilles de données. Évalué à 1. Dernière modification le 24 août 2019 à 14:59.
On avait du faire un projet en cours sur les spams... On utilisait du TF-IDF pour classifier une base de spams et sortir des informations "pertinantes" pour chaque spams (des noms, des adresses, des numéro de compte,...).
Bon par contre on connaissait déjà le nombre de catégories, donc ça rentre plus dans le classement supervisé.
Autrement au niveau des softs, il y a la librairie Lucene qui est vraiment bien pour manipuler du texte (recherche,...) et en plus y'a plein de bindings disponible.