• [^] # Re: Gestion des modifications

    Posté par (site web personnel, Mastodon) . En réponse au journal Extraction de données du web - introduction à Scrapy (journal bookmark). Évalué à 4.

    Comment est gérée la modification de la structure d'une page ? Est-ce que des alertes sont remontées ?

    Je pense que ça doit être implémenté à la main (je ne connais pas assez pour répondre à coup sûr).

    Est-il prévu d'ajouter (ça existe peut-être déjà ) une I.A capable de détecter le type d'un site à partir d'une base de connaissance (annonces emploi, petites-annonces, blog...) et de produire les requêtes XPath ?

    Scrapy cherche à extraire des données structurées ; cela pré-suppose que l'on sait ce que l'on cherche. Dans ces conditions, les sites crawlés sont connus et la structure également.

    En clair, si tu veux crawler des sites d'annonce, par exemple pour agréger les annonces de X sites différents, tu définis tes règles pour chaque site, et ensuite tu lance un crawler pour chacun des sites (la conception de Scrapy fait que tu peux définir quelles règles s'appliquent à quels sites).

    Par contre ce n'est pas automatique et ça ne génère pas tes requêtes XPath pour la simple et bonne raison que c'est à toi de définir quelles sont les informations que tu recherches.

    #tracim pour la collaboration d'équipe __ #galae pour la messagerie email __ dirigeant @ algoo