• [^] # Re: Plus de précision

    Posté par . En réponse au journal De l'ancien monde ... Génération d'index pour publications scientifiques/littéraire. Évalué à 6. Dernière modification le 19 octobre 2025 à 11:37.

    Les références sont du genre v:p avec v le volume et p la page (j'ai que le premier volume pour l'instant mais je soupçonne que les pages seront intervolumes)
    [...]
    J'ai déjà donné un coup de main avec python et nltk pour générer cette liste en partie

    Si j'ai bien compris, tu as déjà généré la liste des mots, mais tu as besoin de lui attribuer les ref. v:p, sans parler du travail de tri ensuite ?

    Dans PyMuPDF tu as le module fitz qui te permet d'importer chaque volume comme un objet "Document" qui est indexé par page.

    Ensuite, tu enumerate chaque objet pour y chercher chaque entrée de ta db, ça te donnera le numéro de page pour le volume traité pour chaque mot trouvé.

    https://coderivers.org/blog/python-fitz/ te montre clairement comment procéder.
    En gros :

    doc = fitz.open(volume)
    for num_pg, page in enumerate(doc, start=1):
     text = page.get_text()
     for word in db:
     # chercher word dans text