mouais. d'expérience, msnbot ne le respecte pas vraiment, en particulier en suivant une URL externe vers une page précise sur ton site : là, qu'elle soit concernée par un robots.txt ou pas, qu'il ait déjà rencontré ce robots.txt avant ou pas, il s'en fout complet, il fait le GET. en général il fait un GET sur le robots.txt juste après, d'ailleurs.
alors pour certaines sections de mes sites (en général, parties dynamiques style wiki que les robots gèrent très mal, et sections temporaires avec des copies d'écrans et autres qui ont une durée de vie d'une semaine ou deux au grand maximum), j'ai carrément foutu les deux lignes qui vont bien dans un .htaccess. hop, au revoir.
sinon, pour le texte cité en haut...
*le robots.txt est une "règle de bonne conduite", ou de bon voisinnage, qu'il n'est pas OBLIGATOIRE de respecter.
*les gens qui font des moteurs de recherche ont souvent beaucoup de mal à mettre au point et "calibrer" leurs robots et se moquent éperdument des conséquences de leur progéniture (serveur web surchargé, denial of service), ils se contentent de répondre en gros "on est en test" et laissent faire le temps d'être sûrs de leurs dégats.
le cas s'est déjà produit avec PompOs, le robot de Free/Proxad/dir.com . en général on (Toto le webmaster avec son site à deux balles) n'a aucun recours à moins de jouer du .htaccess : rien ne dit que le robot respectera le robots.txt, qu'il soit bien éduqué ou pas : s'il est codé avec les pieds, ou mal réglé, il fera tout aussi bien n'importe quoi et foutra un site web à genoux tout pareil.
[^] # Re: bof
Posté par Gniarf . En réponse au journal MSN search utilise t'il les URL qui transitent sur MSN messenger ?. Évalué à 3.
alors pour certaines sections de mes sites (en général, parties dynamiques style wiki que les robots gèrent très mal, et sections temporaires avec des copies d'écrans et autres qui ont une durée de vie d'une semaine ou deux au grand maximum), j'ai carrément foutu les deux lignes qui vont bien dans un .htaccess. hop, au revoir.
sinon, pour le texte cité en haut...
*le robots.txt est une "règle de bonne conduite", ou de bon voisinnage, qu'il n'est pas OBLIGATOIRE de respecter.
*les gens qui font des moteurs de recherche ont souvent beaucoup de mal à mettre au point et "calibrer" leurs robots et se moquent éperdument des conséquences de leur progéniture (serveur web surchargé, denial of service), ils se contentent de répondre en gros "on est en test" et laissent faire le temps d'être sûrs de leurs dégats.
le cas s'est déjà produit avec PompOs, le robot de Free/Proxad/dir.com . en général on (Toto le webmaster avec son site à deux balles) n'a aucun recours à moins de jouer du .htaccess : rien ne dit que le robot respectera le robots.txt, qu'il soit bien éduqué ou pas : s'il est codé avec les pieds, ou mal réglé, il fera tout aussi bien n'importe quoi et foutra un site web à genoux tout pareil.