A mon avis, la normalisation est nécessaire avant. Du style convertir tous les caractères qui ne sont pas des lettres en espaces. Peut être aussi, convertir les caractères accentués (au sens UTF-8 je suppose) en caractères non accentués, les majuscules en minuscule.
Et je pense que lors du calcul de la distance de Levinstein, il faudrait aussi compter les ajouts de plusieurs caractères à la suite comme ayant un coût de 1 seulement. Voire un coût nul si on rajoute un mot complet.
Et ça doit pouvoir donner des résultats intéressants.
Ce serait bien que ce soit intégré à find ou grep aussi. Ou quelque chose qui puisse lire du find [-print0] et qui puisse être compris par xargs [-0]. Qu'on puisse faire des lignes de commande du style:
(Bien entandu dans ces cas là, il serait intelligent de ne prendre en compte que le basename.)
Si quelqu'un fait quelque chose, et qu'il arrive à quelque chose, se serait sympa de nous tenir au courant (astuce ou journal). Perso, je suis en plein partiels, donc pas maintenant :)
[^] # Re: Calcul de distance
Posté par Mildred (site web personnel) . En réponse au message Trouver des fichiers à nom similaires. Évalué à 2.
Et je pense que lors du calcul de la distance de Levinstein, il faudrait aussi compter les ajouts de plusieurs caractères à la suite comme ayant un coût de 1 seulement. Voire un coût nul si on rajoute un mot complet.
Et ça doit pouvoir donner des résultats intéressants.
Ce serait bien que ce soit intégré à find ou grep aussi. Ou quelque chose qui puisse lire du find [-print0] et qui puisse être compris par xargs [-0]. Qu'on puisse faire des lignes de commande du style:
find Documents -print0 | similar -z "Mon document.pdf"find Documents -print0 | similar -zZ "Mon document.txt" | xargs -0 grep 'pattern'
(Bien entandu dans ces cas là, il serait intelligent de ne prendre en compte que le basename.)
Si quelqu'un fait quelque chose, et qu'il arrive à quelque chose, se serait sympa de nous tenir au courant (astuce ou journal). Perso, je suis en plein partiels, donc pas maintenant :)