Les références sont du genre v:p avec v le volume et p la page (j'ai que le premier volume pour l'instant mais je soupçonne que les pages seront intervolumes)
[...]
J'ai déjà donné un coup de main avec python et nltk pour générer cette liste en partie
Si j'ai bien compris, tu as déjà généré la liste des mots, mais tu as besoin de lui attribuer les ref. v:p, sans parler du travail de tri ensuite ?
Dans PyMuPDF tu as le module fitz qui te permet d'importer chaque volume comme un objet "Document" qui est indexé par page.
Ensuite, tu enumerate chaque objet pour y chercher chaque entrée de ta db, ça te donnera le numéro de page pour le volume traité pour chaque mot trouvé.
[^] # Re: Plus de précision
Posté par sebas . En réponse au journal De l'ancien monde ... Génération d'index pour publications scientifiques/littéraire. Évalué à 6. Dernière modification le 19 octobre 2025 à 11:37.
Si j'ai bien compris, tu as déjà généré la liste des mots, mais tu as besoin de lui attribuer les ref. v:p, sans parler du travail de tri ensuite ?
Dans PyMuPDF tu as le module fitz qui te permet d'importer chaque volume comme un objet "Document" qui est indexé par page.
Ensuite, tu enumerate chaque objet pour y chercher chaque entrée de ta db, ça te donnera le numéro de page pour le volume traité pour chaque mot trouvé.
https://coderivers.org/blog/python-fitz/ te montre clairement comment procéder.
En gros :