Une solution bourrine est de comparer la distance de levenshtein http://fr.wikipedia.org/wiki/Distance_de_Levenshtein entre chaque paire de lignes ( complexite n2 * complexite de chaque comparaison ) et de regarder a la main les plus faibles scores, tu decides quand t'arretes de regarder..
Sinon pour une solution en O(log n) il existe les Bk tree [0]. Il y a un lien pour une implementation en python sur la page wikipedia et le lien pour l'implementation en common lisp contient un jolie graphique expliquant le principe.
[0] La page wikipedia est un plutot vide. Une meilleur explication en anglais se trouve ici
[^] # Re: un bon algo
Posté par jiyuu . En réponse au message Détecter des lignes presque identiques. Évalué à 2.
Sinon pour une solution en O(log n) il existe les Bk tree [0]. Il y a un lien pour une implementation en python sur la page wikipedia et le lien pour l'implementation en common lisp contient un jolie graphique expliquant le principe.
[0] La page wikipedia est un plutot vide. Une meilleur explication en anglais se trouve ici