• [^] # Re: Weboob

    Posté par (site web personnel, Mastodon) . En réponse au journal Extraction de données du web - introduction à Scrapy (journal bookmark). Évalué à 4.

    Scrapy commence son travail à partir d'une (ou plusieurs) requêtes (par défaut des urls, donc "crawlé" via un HTTP GET, mais le mécanisme est de gérer des requêtes).

    Ensuite, c'est toi qui définit la mécanique de crawling et l'enrichissement des requêtes/urls à crawler.

    Ma présentation est illustrée notamment par un exemple de crawling du site de l'APEC où les urls ne sont ni des boutons cliqués, ni des liens suivis mais des urls construites à partir des données trouvées dans les pages.

    #tracim pour la collaboration d'équipe __ #galae pour la messagerie email __ dirigeant @ algoo