pour information, un article très intéressant dans le Pour la Science de février 2004. :
C'est un algorithme qui classe (plus ou moins bien) des textes (tu peux utiliser alors le code source des pages en question), des langues, des musiques, des images (va pour le scrineshaute) en se basant sur la compression de données pour repérer les similarités.
# distance et comparaison générique...
Posté par aedrin . En réponse au journal Distance entre deux images.... Évalué à 3.
C'est un algorithme qui classe (plus ou moins bien) des textes (tu peux utiliser alors le code source des pages en question), des langues, des musiques, des images (va pour le scrineshaute) en se basant sur la compression de données pour repérer les similarités.
l'article en question : http://homepages.cwi.nl/~paulv/papers/SimilarityV3.pdf(...)
le papier original qui a inspiré l'article : http://homepages.cwi.nl/~paulv/papers/cluster.pdf(...)
Si quelqu'un sait s'il existe une implémentation ou est motivé pour en faire une, ça m'intéresse... ;-)