• # de l'inutilité d'un moteur de recherche libre

    Posté par . En réponse à la dépêche Google et PageRank... L'avenir passe par le libre?. Évalué à 10.

    Apres moult lectures de l'articles, et quelques recherches sur l'auteur, je suis deçu par l'absence flagrante de qualité de cet article.

    l'article me semble etre une tartine rance issu d'un fond de confiture moisi. le propos est dur, je le reconnais, peut etre meme un peu exagéré, mais elle repose sur certaines observations que je fais sur le texte.

    Qu'un chercheur en mathematique fasse un article sur un algorithme d'un moteur de recherche et se pose sur le secret l'entourant, ne doit pas l'empecher de faire des recherches annexes, sur les personnes utilisant le moteur de recherche. Pourtant, cette personne ignore une grande partie, voire la plus grande partie des clients des moteurs de recherches : les webmasters & autres propriétaires de sites.

    L'utilisateur premier aurait du être l'internaute, le gentil surfeur, la menagere de plus de 50 ans, ... mais la réalité est tout autre, le premier utilisateur de moteur de recherche est celui qui veut voir son site etre dans les 10 premiers liens de google sur certains mots clés.

    L'article a été publié en novembre 2005, je présume qu'il n'a pas été écrit en 98 ou 99 mais plus probablement un peu avant novembre 2005. Durant la même année, j'ai eu pour mission de referencer certains sites, j'ai eu à me renseigner sur diverses techniques pour améliorer le réferencement sur google, yahoo, msn, et d'autres.

    Le premier point qui me chiffone est celui ci : l'auteur ne semble pas savoir ce qu'est le cloaking , le duplicate-content , les PR10 locaux, le PR spoofing, et tant d'autres techniques qui permettent d'etre classé dans les 10 premiers liens ...

    Dès que google a connu un peu de notoriété, le fameux article de Brin et Page fut publié, décortiqué, analysé, torturé pour comprendre un peu la mécanique sous-jacente ...

    Et pour faire un parallèle avec la cryptographie, Google a subit des attaques d'un nouveau genre à son encontre : des attaques de referencement.

    Google a donc modifié son algorithme au fil du temps car certaines de ces attaques nuisaient à la qualité des résultats.

    un exemple tres simple et un des premiers si je me souviens bien :
    si l'on regarde l'algo lui meme, on constate que si on reference X pages contenant une dizaine de liens vers diverses pages qui elle-meme pointent sur leur source et sur une destination unique, qui repointe sur certaines source de source, on peut creer des nébuleuse de PR 10 sans avoir aucune notoriété reelle.

    Pourquoi ? tout simplement par ce que l'algorithme manipule un graphe qui est en fait une foret de graphe, c'est a dire que ce graphe représentant internet peut etre coupé en sous graphe sans couper aucun lien existant.

    Maintenant, pour clarifier un point, cette attaque repose sur une contrainte budgetaire "avoir un portefeuille de domaine suffisament important" donc ce n'est pas avec 4 ou 10 domaines que l'on peut monter une attaque^W un referencement de la sorte :p

    Google a donc changer son algo pour gerer ce type de problemes.

    apres on trouve le tres classique SPAMlog :
    c'est la meme IP qui balance plusieurs milliers de requetes sur certaines pages d'un site avec differents referers. si ce site publie ses statistiques web, le site fourni une page de referencement permettant de falsifier le PR d'un site.

    Encore une fois, Google a cherché encore à contrer ce genre de choses.

    il y a les liens "no-follow" et d'autres solutions proposés qui ont un impact au niveau meme de l'algo utilisé par google.

    donc, l'algo d'origine quelqu'il soit, n'est plus le meme depuis des années :D ... et cette information et le pourquoi n'est meme pas evoqué dans l'article.

    donc à mon sens, le seul interet potentiel de l'article aurait pu etre une reflexion sur l'interet ou non de publier l'algorithme, mais serieusement, si l'on reflechit 30s, publier l'algorithme c'est accepter de prendre le risque de devoir mettre en faillite google.

    Quel est le lien entre la publication et ce risque de mise en faillite de google ?

    il est simple :
    un referenceur apres plusieurs mois d'analyse de l'algorithme, arrive a detourner l'algorithme de google, et fait apparaitre des liens pour son site de vente de Viagra quelque soit le mot clé utlisé dans sa recherche.

    si google ne trouve pas une parade rapide (quelques heures), le moteur de recherche sera totalement decredibilisé, et plus personne n'utilisera le moteur de google, donc google connaitra la nécessité d'une mise en faillite.

    Changer un algortihme de ce genre, ne se fait pas en quelques heures, c'est plusieurs mois de travail. l'expérience le prouve car il faut plusieurs mois pour que google detecte ce genre d'attaque encore aujourd'hui.

    Aujourd'hui, l'open source ne peut pas fournir de garantie contre ce genre de risque là ou le closed-source offre une garantie :
    celle que l'attaqant doivent tout refaire, tout réapprendre à chaque changement car il n'en a pas la connaissance.
    La boite noire est la meilleur garantie d'une certaine tranquilité pour les 99,99999% des personnes qui utilise google pour autre chose qu'améliorer son propre referencement ( le pouilleme restant etant ceux qui seront satisfait par du viagra pour tous les mots clés ).

    L'on peut me retorquer que sur l'argument du closed source pour éviter les détournement, l'article répond fort justement en disant : "Le Droit s'adapte pour prendre en compte l'évolution de la délinquance et personne n'en déduit que la loi doit être secrète." avec comme seul exemple, le google bombing. mais encore recemment, nous avons pu voir que certaines sociétés ont été victime de google bombing parce que leurs activités déplaisent à certains internautes.

    Sur la problematique de moyen, je tiens à rappeler qu'un nom de domaine s'achete à moins de 10 euros l'unité, et qu'un hébegement mutualisé est souvent offert avec chaque domaine, et qu'un serveur dédié coute moins de 20 ¤/mois chez certains hébergeurs.

    Apres, il y a une une erreur non-négligeable qui est commise, le droit est public et c'est ce qui garantie l'équité de chacun (dans une certaine mesure du moins). un algo de ce type pourrait etre public si il n'y a aucun moyen et/ou interet à le contourner.

    la loi s'adapte lentement, mais s'adapte, et surtout il y a le juge qui est createur et garant du droit à chaque fois qu'un tier lui demande de prendre position.

    La comparaison d'une chose reposant sur une propre faculté au vivant (pour certains de l'homme ) celle de conscience et d'independance d'etre, à une chose fonctionnant comme un automate-presse-puré est ... comment dire ... hum ... mais, si l'automate presse-puré avait une conscience, je pense qu'elle serait flatté :)( et d'un autre coté, un automate presse-puré avec une conscience ... pour moi, c'est un être vivant, mais c'est un autre débat ).

    toujours est il que cette possible garantie d'équité ne répond pas à la question importante :
    quelle garantie peut apporter le libre sur le fait que des qu'un algo critique est rendu public .cela facilite d'autant plus la pollution electronique ?

    Cet algorithme est utilisé par des centaines de millions de personnes, et peut etre détourné de sa finalité, par un individu qui ne publiera jamais sa technique garantir la perenité de son interet/placement/investissement/operation.

    Est ce que cet algorithme peut il etre rendu public ?

    Oui, si cet algo est formellement inviolable. Or, l'experience prouve le contraire, puisque google le modifie sans cesse.

    Oui, si il peut etre modifié rapidement sans nécessité de truquer la base de données ou de reconstruire l'integralité du savoir existant. Encore une fois, il est connu des referenceurs que google recalcule regulierement "from scratch" l'integralité de la base et que la convergence de l'algorithme est de l'ordre de plusieurs semaines voire quelques mois.

    Dans un algorithme de chiffrement, l'algorithme rendu public est rendu public de maniere incomplete : il manque les clés utilisés.

    A mon sens, rendre public cet algorithme, est comme si un admin libriste rendait public le mot de passe root de ses serveurs pour etre "open" jusqu'au bout.

    Ma conclusion, google faisant de l'open-source sur certains dossiers, n'a pas de raisons de publier cet algo & son code source parce que :
    - sa publication affaiblira la pertinence des resultats ( resultat deja connu, au travers du spamdex, googlebombing qui deviendrait un jeu d'enfants )
    - sa publication ne garantira à aucun moment ni à terme que l'algorithme pourra etre rendu insensible aux corruptions
    - sa publication ne garantira aucune amélioration de reactivité ou reduction de couts, par contre, cela a plus de risque d'augmenter les coûts

    Cette reflexion sur l'interet de publier l'algorithme de google, s'applique sans mal à tout projet de publication d'un algorithme de recherche, si cet algorithme est utilisé par un moteur de recherche "grand public". Cela implique, que un moteur de recherche libre est soit condamné à n'être utilisé que par 3 personnes, soit à devenir une usine à SPAMdex et donc à être tellement pollué que plus personne ne l'utilisera. La seule possibilité d'un moteur de recherche libre est plus de l'ordre d'un annuaire libre qui connaitrait un engoument equivalent que wikipédia ... mais wikipédia n'est il pas déjà un peu cela ?