bah, si on relit leur papier universitaire de 1997 (1), à un moment (section 4.3 Crawling the Web) ils parlent de leur crawler (GoogleBot) et des ravages accidentels qu'il a parfois créé :
- un jeu en ligne a été plus que perturbé quand le petit robot a suivi des liens en GET. la réponse en général va être de dire que le W3C recommande que les formulaires qui modifient le contenu du site Web doivent plutôt utiliser des POST... soit. et encore, le désordre reste indiscutablement de la faute du robot qui suivait les liens comme un débile.
- le plus beau : There are also some people who do not know about the robots exclusion protocol, and think their page should be protected from indexing by a statement like, "This page is copyrighted and should not be indexed", which needless to say is difficult for web crawlers to understand.
ça, c'est du foutage de gueule pur et dur. sous prétexte que le robot ne sait pas interpréter les conditions d'utilisation d'un site, ils s'assoient sur ces conditions, se mettent hors la loi et se reposent sur l'utilisation d'un protocole de bonne conduite qui lui est certes pratique mais n'a pas de valeur juridique (d'ailleurs c'est juste un "s'il vous plait, n'allez pas voir dans /truc ni /machin" déclaratif, pas impératif comme un .htaccess) et est à l'initiative de l'éditeur du site Web. comme s'il fallait se promener avec une pancarte "non je n'ai pas envie d'écouter votre baratin s'il vous plait au revoir merci" pour circuler librement dans la rue et repousser toutes ces hordes de Témoins de Jehovah, militants de Force Ouvrière et autres représentants en suppositoires qui voudront absolument vous faire essayer un échantillon gratuit...
je crois que c'est ça le coeur du problème de Google, ils se déresponsabilisent de leurs propres limites, erreurs et boulettes diverses. ils diront que c'est la faute de la technologie. sans parler de quand leurs outils sont abusés de diverses manières... ah si, une fois ils ont fait un caca nerveux et Google Corp. a refusé de parler à CNET pendant quelques mois parce que ces derniers ont osé publiquement montrer que Google pouvait servir à faire du mal en faisant une démo de recherches d'informations sur l'un des fondateurs de Google. cette bouderie fut franchement bien ridicule et considérée comme telle par le reste des media "quelle mouche a donc piqué Google ?"
"do no evil" ? la bonne blague... depuis le premier jour, ils le font, parfois sans faire exprès, mais souvent en pleine connaissance de cause. on retrouve d'ailleurs aujourd'hui ce non-respect des Copyrights avec Google Print et leur art de manier l'ambiguïté : "on ne copie pas vos bouquins, on indexe leur contenu !" et un incroyable "si vous ne voulez pas qu'on scanne certains de vos bouquins, envoyez-nous une liste !". pourtant dans chaque bouquin il va y avoir un magnifique "all right reserved, including the right to reproduce this book or portions thereof in any form whatsoever". et ça reste des humains qui collectent les bouquins et les foutent dans la machine à scanner, on ne peut même pas invoquer un pauvre GoogleBot sans cervelle ici : ces prétendus bienfaiteurs de l'humanité imposent ici aux ayant-droits des contenus un opt-out comme le premier spammeur venu. chapeau bas, vraiment.
le Père Noël n'existe pas, vous savez. ne croyez pas un seul instant que Google est le Père Noël revenu sur Terre, le meilleur de la technologie pondue par des centaines de cerveaux brillants au service du Bien incarné (et gratuit, bordel, gratuit !), pas plus que ne l'est les Etats Unis que vous croyiez connaitre étant jeunes, le cerveau façonné par toutes les séries TV qui ont bercé votre enfance.
(je n'ai même pas parlé de l'absence de ligne éditoriale chez Google, des millions de pages et sites qui polluent le moteur de recherche et surtout de l'attitude affichée "on peut rien y faire", des cas divers de censure ici ou là (donc si, ils peuvent y faire quelque chose), des adwords achetés par un certain parti politique français néonazi^Wnéorépublicain, du GoogleBot qui ne connait ni Crawl-Delay ni équivalent, juste un "si il va trop vite, envoyez-nous un mail avec vos logs"...)
[^] # Re: Personne ne se rends compte de comment ça marche tout ça ???
Posté par Gniarf . En réponse au journal Google, the internet trust must go on.... Évalué à 6.
- un jeu en ligne a été plus que perturbé quand le petit robot a suivi des liens en GET. la réponse en général va être de dire que le W3C recommande que les formulaires qui modifient le contenu du site Web doivent plutôt utiliser des POST... soit. et encore, le désordre reste indiscutablement de la faute du robot qui suivait les liens comme un débile.
- le plus beau : There are also some people who do not know about the robots exclusion protocol, and think their page should be protected from indexing by a statement like, "This page is copyrighted and should not be indexed", which needless to say is difficult for web crawlers to understand.
ça, c'est du foutage de gueule pur et dur. sous prétexte que le robot ne sait pas interpréter les conditions d'utilisation d'un site, ils s'assoient sur ces conditions, se mettent hors la loi et se reposent sur l'utilisation d'un protocole de bonne conduite qui lui est certes pratique mais n'a pas de valeur juridique (d'ailleurs c'est juste un "s'il vous plait, n'allez pas voir dans /truc ni /machin" déclaratif, pas impératif comme un .htaccess) et est à l'initiative de l'éditeur du site Web. comme s'il fallait se promener avec une pancarte "non je n'ai pas envie d'écouter votre baratin s'il vous plait au revoir merci" pour circuler librement dans la rue et repousser toutes ces hordes de Témoins de Jehovah, militants de Force Ouvrière et autres représentants en suppositoires qui voudront absolument vous faire essayer un échantillon gratuit...
je crois que c'est ça le coeur du problème de Google, ils se déresponsabilisent de leurs propres limites, erreurs et boulettes diverses. ils diront que c'est la faute de la technologie. sans parler de quand leurs outils sont abusés de diverses manières... ah si, une fois ils ont fait un caca nerveux et Google Corp. a refusé de parler à CNET pendant quelques mois parce que ces derniers ont osé publiquement montrer que Google pouvait servir à faire du mal en faisant une démo de recherches d'informations sur l'un des fondateurs de Google. cette bouderie fut franchement bien ridicule et considérée comme telle par le reste des media "quelle mouche a donc piqué Google ?"
"do no evil" ? la bonne blague... depuis le premier jour, ils le font, parfois sans faire exprès, mais souvent en pleine connaissance de cause. on retrouve d'ailleurs aujourd'hui ce non-respect des Copyrights avec Google Print et leur art de manier l'ambiguïté : "on ne copie pas vos bouquins, on indexe leur contenu !" et un incroyable "si vous ne voulez pas qu'on scanne certains de vos bouquins, envoyez-nous une liste !". pourtant dans chaque bouquin il va y avoir un magnifique "all right reserved, including the right to reproduce this book or portions thereof in any form whatsoever". et ça reste des humains qui collectent les bouquins et les foutent dans la machine à scanner, on ne peut même pas invoquer un pauvre GoogleBot sans cervelle ici : ces prétendus bienfaiteurs de l'humanité imposent ici aux ayant-droits des contenus un opt-out comme le premier spammeur venu. chapeau bas, vraiment.
le Père Noël n'existe pas, vous savez. ne croyez pas un seul instant que Google est le Père Noël revenu sur Terre, le meilleur de la technologie pondue par des centaines de cerveaux brillants au service du Bien incarné (et gratuit, bordel, gratuit !), pas plus que ne l'est les Etats Unis que vous croyiez connaitre étant jeunes, le cerveau façonné par toutes les séries TV qui ont bercé votre enfance.
(1) http://www-db.stanford.edu/~backrub/google.html
(je n'ai même pas parlé de l'absence de ligne éditoriale chez Google, des millions de pages et sites qui polluent le moteur de recherche et surtout de l'attitude affichée "on peut rien y faire", des cas divers de censure ici ou là (donc si, ils peuvent y faire quelque chose), des adwords achetés par un certain parti politique français néonazi^Wnéorépublicain, du GoogleBot qui ne connait ni Crawl-Delay ni équivalent, juste un "si il va trop vite, envoyez-nous un mail avec vos logs"...)