• # urllib + regexp

    Posté par (site web personnel) . En réponse au message récupérer la liste d'un répertoire web. Évalué à 2.

    Tu récupères l'index avec urllib2 et ensuite tu parses le contenu, non ?
    Les cibles des liens sont entourés de guillemets et commencent par "http://", ça devrait suffire pour construire une belle regexp. Ensuite tu lui applique la méthode findall() et ça devrait être bon.
    Fais gaffe à bien compiler ta regexp en "non-greedy" mais sinon je pense que ça devrait bien se passer