• # Quelques pistes

    Posté par (site web personnel, Mastodon) . En réponse au message Extraction de données d'une page web. Évalué à 8. Dernière modification le 27 septembre 2023 à 07:12.

    Il faut que tu récupères le HTML puis que tu exécutes des opérations de sélection HTML (ça ressemble un peu à des requêtes xpath mais à un peu plus haut niveau).

    Un tutoriel sur le scraping : https://www.ionos.fr/digitalguide/sites-internet/developpement-web/web-scraping-avec-python/

    Requests ou curl, c'est juste la première étape.

    Conseils complémentaires (inutile ?) :

    • fais ton script étape par étape. Déjà si tu récupères les données (sans même les stocker) c'est une bonne étape de faite
    • fais plusieurs scripts indépendants avec comme format d'échange des fichiers CSV . Ainsi en cas de défaillance d'une étape tu pourras rejouer l'étape sans embarquer tout le traitement.

    CSV est un format standard en python, tu peux lire un fichier et le transformer en liste et dictionnaires python en 2/3 lignes donc c'est pas une étape douloureuse de passer par des fichiers intermédiaires.

    Regarde l'exemple utilisant BeautifulSoup dans le lien ci-dessus, ça devrait te parler.

    #tracim pour la collaboration d'équipe __ #galae pour la messagerie email __ dirigeant @ algoo