• # Combien ça marche bien ?

    Posté par (site web personnel) . En réponse au journal Détection de la syntaxe d'un langage informatique via un analyseur statistique naïf de type Bayésien. Évalué à 3.

    Il te serait utile de chiffrer la « qualité » de la détection en calculant le score F1 par exemple.

    Mais n'oublie surtout pas que si tu veux vraiment te lancer dans une méthode d'apprentissage avec des MMC ou des modèles n-grams (et plus), il va te falloir beaucoup de données. Plus d'auras de données et plus tes méthodes se concentreront sur ce qui est redondant (du coup, naturellement, les noms de variables ne seront pas pris en compte par exemple, le contenu des commentaires non plus mais peut-être que les 2 premiers caractères des commentaires sont précieux, etc.).

    Pour en revenir à ton programme bayésien, n'oublie-pas qu'un a priori bien estimé peu grandement aider (ex : P(python|"import xxx") est élevé).