Principe d'un filtre bayesian NAIF (tous les prog anti-spam le sont):
on découpe un texte en mots.
on possède 2 bases de données.
La base de donnée A pour les textes de classe A, la base de données B pour les textes de classe B.
1)phase d'apprentissage.
Pour chacun des textes de classe A, on ajoute le texte dans la base s'il n'y est pas. On augmente son occurence si il y est déjà.
On fait une db qui fonctionne comme un hash Perl. Elle contient pour tous les mots trouvés, le nb de fois ou on les a vu.
On fait pareil avec les mots de la base B.
2) On cherche à classer un texte.
On découpe le texte en mots. Pour chaque mot on associe la proba d'appartenance en appliquant la loie de Baye (voir tes cours de terminal).
# Re: filtre bayesien: explications et code source
Posté par Cédric Foll . En réponse au journal filtre bayesien: explications et code source. Évalué à 1.
on découpe un texte en mots.
on possède 2 bases de données.
La base de donnée A pour les textes de classe A, la base de données B pour les textes de classe B.
1)phase d'apprentissage.
Pour chacun des textes de classe A, on ajoute le texte dans la base s'il n'y est pas. On augmente son occurence si il y est déjà.
On fait une db qui fonctionne comme un hash Perl. Elle contient pour tous les mots trouvés, le nb de fois ou on les a vu.
On fait pareil avec les mots de la base B.
2) On cherche à classer un texte.
On découpe le texte en mots. Pour chaque mot on associe la proba d'appartenance en appliquant la loie de Baye (voir tes cours de terminal).