J'ai déjà essayé de mettre en place une fonctionnalité similaire (pour d'autres raisons) mais il y a quelque chose qui va vite limiter : le nombre de connexions au site à crawler.
Sur la quantité de données à récupérer, les accès simultannés, la vitesse a laquelle le crawler fait ses demandes (...) les sites croient souvent détecter un genre d'attaque (flood ou assimilé) ou alors une tentative de pompage plus générale des ressources. Et là c'est le drame, un déluge d'erreur 404, 500 ou alors un joli timeout de 24h. Limitation qui n'est appliqué sur les plages d'IP de google & Cie.
Donc un moteur de recherche, même décentralisé je ne suis pas sûr que ça marchera...
# Et le nombre de connexions au site ?
Posté par stopspam . En réponse au journal je découvre yacy, moteur de recherche p2p. Évalué à 4.
J'ai déjà essayé de mettre en place une fonctionnalité similaire (pour d'autres raisons) mais il y a quelque chose qui va vite limiter : le nombre de connexions au site à crawler.
Sur la quantité de données à récupérer, les accès simultannés, la vitesse a laquelle le crawler fait ses demandes (...) les sites croient souvent détecter un genre d'attaque (flood ou assimilé) ou alors une tentative de pompage plus générale des ressources. Et là c'est le drame, un déluge d'erreur 404, 500 ou alors un joli timeout de 24h. Limitation qui n'est appliqué sur les plages d'IP de google & Cie.
Donc un moteur de recherche, même décentralisé je ne suis pas sûr que ça marchera...