• [^] # Re: Bonne méthode?

    Posté par (site web personnel) . En réponse à la dépêche Google contre la pollution des sites web. Évalué à 4.

    > la fiabilité du moteur de recherche repose désormais sur le respect
    > d'une norme par les sites eux-mêmes

    La fiabilité des moteurs a toujours reposé sur le fait que le contenu est sites est pertinent. Si dans ton site qui parle de vélo tu met plein de fois le mot "mp3" le moteur ne sera plus fiable. C'est la même chose si tu intègres (malgré toi) plein de liens de spam qui n'ont rien à voir avec ton contenu.
    Il y a trois solutions :
    - faire en sorte que personne ne mette ces liens (on peut leur demander gentiment mais je doute que ça marche)
    - faire en sorte que le moteur sache quels sont les mauvais liens et les ignore (techniquement c'est dur voire impossible de faire ce tri automatiquement).
    - faire en sorte que ces liens ne comptes pas quand l'auteur les juge non pertinent

    Comme les deux premières solutions ne fonctionnent pas, on a pris la troisième.

    > puisque de nombreux liens pertinents (peut être plus que les liens
    > non pertinents d'ailleurs) vont être ignorés

    On ne fait que diminuer la quantité globale des liens pris en compte. Rien ne dit que la répartition des liens (hors spam) ne sera pas la même, donc que ça posera réellement problème dans les moteurs.

    > or, les blogs et les wiki sont les sites les plus rapides à réagir à l'actualité

    On ne désindexe pas les blogs (on savait déjà le faire), pas même les commentaires (on savait le faire aussi), mais seulement les liens des commentaires (ça on ne savait pas le faire).
    Le contenu des billets, le contenu des commentaires, les liens des billets .. tout ça ça marche encore.
    Puis ... si tu veux tout indexer rien ne t'empeche de ne pas utiliser la technique.

    > il existe maintenant des très bon filtres bayesiens pour filtrer les spams

    Ils se reposent sur le contenu. Un mail a un objectif différent d'un spam de page rank. Le premier cherche à te faire cliquer ou te convaincre, donc il lui faut du texte, souvent le même. On arrive à filtrer sur les mots qui reviennent souvent (tu vas gagner de l'argent, on va te l'agrandir, "ce n'est pas du spam", etc). Le spam par page rank, à part le lien lui même n'a besoin de rien. Difficile de faire un algo baeysien qui après avoir été entrainé sur le lien "golf" et "viagra" filtre le lien "PHP".

    Ceci dit l'idée n'est pas mauvaise, si je n'avais pas peur de faire écrouler mon serveur en implémentant ça dans les scripts PHP ça vaudrait le coup de tester.

    > et très facilement contournable

    comment ?

    > Si la concurrence propose mieux, google va vite être redépassé...

    C'est un accord fait *avec* la concurrence. MSN et Yahoo proposent la même chose (sinon ça aurait perdu tout intérêt).