• [^] # Re: Euh

    Posté par . En réponse au journal TrollMaster est là !. Évalué à 5.

    Pour entrainer un filtre bayesien à la bogofilter, il faut un oracle. Dans le cas du spam, on en a un excellent : une boite étiquetée "spam" et une "ham", du blanc et du noir bien distincts, avec rapidement des centaines ou milliers d'exemples à se mettre sous la dent.

    Mais là, pour utiliser la même technique, il faudrait se cogner des centaines de pages et dire au logiciel "tu vois, ça c'était un troll" ou bien "ça c'était une discussion saine". Ça serait terriblement rébarbatif à faire (sauf éventuellement en distribué avec beaucoup de contributeurs).

    Et quand bien même on trouverait les ressources pour le faire, je ne suis pas persuadé que le résultat serait terriblement précis. Un troll ne se reconnait pas à des mots clefs pondérés et considérés indépendament les uns des autres (ce sur quoi reposent je crois les filtre bayesiens) : une pages à 100 occurences de "Emacs" peut parfaitement être simplement technique, ainsi qu'une page avec 100 occurences de "Vi", alors que par contre une page avec 50 "Emacs" et 50 "Vi" est forcement trollesque. Et ça n'est qu'un exemple pour illustrer que le problème est différent, mais on pourrait penser à d'autres critères encore : par exemple, il y a des chances que dans un arbre de discussion comme les commentaires de linuxfr, des critères de formes (profondeurs de certaines branches, etc.) permettrait de détecter des trolls sans même regarder le lexique employé. Là, on arrive très loin du filtre bayesien. Enfin bref, vaste sujet, sûrement très rigolo pour des gens qui serait branchés analyse de textes, data mining et compagnie...