• [^] # Re: Base de données

    Posté par . En réponse à la dépêche Reprise de Dspam par la communauté. Évalué à 5.

    Il est vrai que je n'aurais peut-être pas dû donner ce chiffre sans plus d'explications.

    Il y a trois mode d'"entrainement" de Dspam:

    - Teft : Train on Everything. Dspam créé une signature est les jetons(tokens) propres à chaque mot-clé qu'il analyse pour chaque message qu'il voit passer. Ce mode génère énormément de données.
    - TOE: Train On Error. Dspam ne créé ces données que lorsque qu'on lui informe qu'il s'est trompé (en lui forwardant un spam non détecté par exemple). Ce mode génère bien moins de données et donc n'est à utilisé que lorsque Dspam à assez de données pour travailler (~2500 spam et 2500 ham d'analysés).
    - TUM: Train Until Mature: Dspam créé ces données jusqu'à ce qu'il en aie assez pour chaque token pour affirmer que le mail est un spam ou non. Agit comme en Teft tant qu'il n'a pas assez de données pour chaque token.

    L'idéal avec ce fonctionnement est d'abord d'entrainer Dspam avec un corpus représentatif de 2500 spam et 2500 ham. Ainsi on dit a Dspam qu'on est sur de ce qu'on lui donne à analyser et celui-ci ne crée que les données relatives à ces 2500 spam et ham, et on peut le configurer en TOE.

    Or pour ma part n'ayant pas de corpus valable et ayant plein d'espace disque, j'ai configuré Dspam en Teft pour la plupart des compte et en TUM pour certain. Ceci afin d'accélérer l'entrainement de Dspam et ainsi arriver aux fatidiques 2500 spam et ham correctement détectés au premier passage. A ce moment là je pourrais passer en TOE.

    A noter qu'un script de nettoyage de la base de donné est fourni pour virer les tokens orphelins (<5 il me semble) vieux de plus de 90 jours. En Teft cela n'a que très peu d'effet (car des nouveau tokens orphelins sont créés à chaque instant, dspam en créant à chaque message), par contre en TOE celaà doit être efficace pour garder une taille de base constante une fois que Dspam à toutes les données dont il a besoins pour bien filtrer.

    D'ailleurs, il serait intéressant de connaitre la taille des bases de ceux qui ont entrainé Dspam avec un corpus et utilisent uniquement TOE.