• [^] # Re: cela tiens plus du bug que d'autre chose

    Posté par . En réponse au journal Quand Alexa.com me vole mon traffic, ou porter plainte sinon sur mon journal linuxfr ?. Évalué à 3.

    networks solution est juste le registrar qui a vendu le domaine alexa.com à son propriétaire :)

    les deux contacts dans le whois sont le contact administratif pour le domaine et le contact technique pour le domaine. il y a peu de chance d'obtenir une réponse de leur part.

    en regardant sur le site de alexa, j'ai trouvé cette page http://pages.alexa.com/company/contact.html qui permet de le contacter selon differente maniere.

    de toute facon le probleme est une collision entre 2 sites :
    l'un mindmillion ouvert en octobre 2004
    l'autre neoskills ouvert avant il me semble

    donc, là tu as un argument simple l'antériorité.

    j'ai regardé sur google, tu es PR 6 alors que mindmillion n'est que PR 4 .

    Sinon pour la base de données, elle n'a que tres peu de chance d'etre SQL, bien qu'elle puisse etre sur un modele relationnel ( chose peu probable aussi ). j'ai donné quelques explication de la chose recemment http://linuxfr.org/comments/676329,1.html et http://linuxfr.org/comments/677172,1.html

    pour ce qui est de rape-torture & co ... , ce n'est que des corelation entre les sites qu'un utilisateur visite et ton site qu'il a visité ... si le plug-in alexa detecte qu'il y a une correlation, alors il va le dire. Par contre, il me semble que Internet Explorer va t'etre d'un TRES GRAND secours, puisqu'il integre un module alexa gracieusement fourni par Microsoft. le meilleur moyen de la savoir est de lancer un anti-spyware et de regarder si il te dit "attention IE a une clé alexa".

    Pour la notion de dommage, c'est ambigu, puisque alexa, fourni essentiellement des informations pour le top "100 000". de plus, ton site ne montre pas explicitement son activité commercial, ce qui n'aidera pas les techniciens de alexa pour constater le probleme.

    D'un autre coté, peu de site font gaffe à certains points des RFC comme les Entity-Tag http://www.w3.org/Protocols/rfc2616/rfc2616-sec3.html#sec3.1(...) qui permettent bien souvent de lever les ambiguités.
    Quand on regarde http://www.w3.org/Protocols/rfc2616/rfc2616-sec13.html , et puisque les crawlers ont des caches des sites pour travailler en "off-line", les Etags peuvent aider à eviter les collisions dans bien des cas.

    je vais donner des nombre erronées mais qui permettent de comprendre le probleme. si pour un checksum il y a une probabilité de collision de 1 sur 1 cent milliard de documents cela veut dire que :
    - c'est une moyenne, il peut y avoir des zones a tres forte collision ( meme idées que les clés faibles pour de la cryptographie )
    - que la collision peut se produire sans avoir rempli toutes les possibilités
    - que si tu as un index de dix milliards de documents, tu n'as plus qu'une chance sur dix d'avoir une collision

    donc, il faut quand meme faire attention à avoir un site conforme aux normes pour reduire le risque de collision.