• [^] # Re: Euh

    Posté par . En réponse au journal TrollMaster est là !. Évalué à 2.

    Ce genre de classification statistique, ça marche généralement en établissant un profil du texte à partir de trigrammes (et non de mots, pour des raisons de pertinence).

    Donc en principe, si un document contenant une forte concentration des trigrammes d'"emacs" et de ceux de "vi" est trouvé, on peut le rapprocher des autres du même genre (en clair: des trolls emacs/vi).

    Bon ok, dans mon exemple, on détecterait aussi un comparatif emacs/vi comme étant un troll, mais à nous de lui apprendre à reconnaître certaines mots/trigrammes propres au troll ("god", "odw", "dwi" et "win", notamment).

    M'enfin hormis l'aspect rébarbatif de l'apprentissage, je ne vois pas bien en quoi ça serait impossible, ni en quoi ça serait très différent du filtrage antispam: on a un corpus à répartir en deux catégories (troll, pas-troll) suivant des fréquences d'apparition de motifs particuliers dans le texte. Si on voulait vraiment affiner (mais j'ai pas eu l'impression que trollmaster le fasse), on pourrait rajouter des critères de structure (distances minimales et maximales entre deux occurences de tel mot, etc.). Mais on doit pouvoir s'en sortir sans.