> ça les oblige à tester si la page contient /Powered by .*mod_spam_die.*/ > pour se douter que le contenu est aléatoire.
Techniquement ca suffirait, en réalité la diversité des possibilités anti-spam rend la démarche d'exclusion trop complexe.
> Ces astuces peuvent facilement être contournées par les crawlers, mais la > difficulté passe par la diversité.
voilà mon point, c'est vrai aussi pour le script dont on parle.
Maintenant ... envoyer un mail c'est presque ridicule en ressources, ils peuvent se permettre de tout récolter et envoyer le mail sans vérification, quitte à rayer ceux qui bouncent. Pire, souvent ca passe par des serveurs mails mal configurés, donc ca ne sont meme pas eux qui font la vérification du domaine et se tapent les erreurs.
Rajouter des emails bidons n'amène pas grand chose et ne les gène pas vraiment.
Par contre il y a deux méthodes :
- l'offuscation pour rendre l'email invisible. D'après pas mal de tests de tout le monde, les robots sont tres basiques et ne récupèrent que les noms de domaine des liens vers pages Web (auquel cas ils envoient à intranet@domain ou sales@domaine et quelques autres) et les chaines de caractères user@domain, que ce soit dans les liens ou pas.
Je ne peux pas affirmer que ca durera mais pour l'instant il semble meme que faire un lien mailto en encodant le mail avec des %xx à la place des lettres (codage d'url) rende invisible le mail aux robots (j'ai vu plusieurs études qui montraient ce fait) : ils ne décodent rien, ne comprennent pas la structure HTML, bref, simple moteur de recherche de user@domain. Ca permet de boycotter les robots sans pénaliser l'utilisateur (qui lui a un navigateur qui lit un peu mieux le HTML et pourra utiliser le lien).
- le pot de miel, c'est une démarche que j'aime bien. Poser en commentaire un lien mail (avec les balises HTML). Les robots collecteurs passent dessus, mailent, et se font blacklister.
Voir (entre autres) http://piegeacons.apinc.org/(...)
[^] # Re: lutte anti spam active
Posté par Éric (site web personnel) . En réponse au journal lutte anti spam active. Évalué à 2.
> pour se douter que le contenu est aléatoire.
Techniquement ca suffirait, en réalité la diversité des possibilités anti-spam rend la démarche d'exclusion trop complexe.
> Ces astuces peuvent facilement être contournées par les crawlers, mais la
> difficulté passe par la diversité.
voilà mon point, c'est vrai aussi pour le script dont on parle.
Maintenant ... envoyer un mail c'est presque ridicule en ressources, ils peuvent se permettre de tout récolter et envoyer le mail sans vérification, quitte à rayer ceux qui bouncent. Pire, souvent ca passe par des serveurs mails mal configurés, donc ca ne sont meme pas eux qui font la vérification du domaine et se tapent les erreurs.
Rajouter des emails bidons n'amène pas grand chose et ne les gène pas vraiment.
Par contre il y a deux méthodes :
- l'offuscation pour rendre l'email invisible. D'après pas mal de tests de tout le monde, les robots sont tres basiques et ne récupèrent que les noms de domaine des liens vers pages Web (auquel cas ils envoient à intranet@domain ou sales@domaine et quelques autres) et les chaines de caractères user@domain, que ce soit dans les liens ou pas.
Je ne peux pas affirmer que ca durera mais pour l'instant il semble meme que faire un lien mailto en encodant le mail avec des %xx à la place des lettres (codage d'url) rende invisible le mail aux robots (j'ai vu plusieurs études qui montraient ce fait) : ils ne décodent rien, ne comprennent pas la structure HTML, bref, simple moteur de recherche de user@domain. Ca permet de boycotter les robots sans pénaliser l'utilisateur (qui lui a un navigateur qui lit un peu mieux le HTML et pourra utiliser le lien).
- le pot de miel, c'est une démarche que j'aime bien. Poser en commentaire un lien mail (avec les balises HTML). Les robots collecteurs passent dessus, mailent, et se font blacklister.
Voir (entre autres) http://piegeacons.apinc.org/(...)