ES n'indexe que le json que tu lui passe, il n’interprète rien d'autre.
C'est donc à toi de transformer les données dans un format json.
Tu peux ajouter ou extraire des metadata, genre "titre", "date" et le texte brut en le nommant "text" par ex.
Autant du HTML bien structuré, tu devrais pouvoir faire qqch d'assez fin, genre extraire des paragraphe ou qqch dans ce gout.
Autant du PDF, tu sera chanceux si tu récupères les mots dans l'ordre de lecture. Car il est possible de construire des PDF vraiment pas loin du sens du contenu. Il est à rappeler que ce format est destiné à de l'impression et certainement pas à de la gestion documentaire.
Après, si tu veux juste répondre à la question lequel de mes documents contient le mot "elastic", cela devrait le faire.
Il y a aussi de très bon logiciels d'indexation pour ordinateur personnel.
[^] # Re: Indexation de documents
Posté par steph1978 . En réponse à la dépêche Sortie d'Elasticsearch en version 1.0. Évalué à 2.
Avec un peu de poudre verte oui :)
ES n'indexe que le json que tu lui passe, il n’interprète rien d'autre.
C'est donc à toi de transformer les données dans un format json.
Tu peux ajouter ou extraire des metadata, genre "titre", "date" et le texte brut en le nommant "text" par ex.
Autant du HTML bien structuré, tu devrais pouvoir faire qqch d'assez fin, genre extraire des paragraphe ou qqch dans ce gout.
Autant du PDF, tu sera chanceux si tu récupères les mots dans l'ordre de lecture. Car il est possible de construire des PDF vraiment pas loin du sens du contenu. Il est à rappeler que ce format est destiné à de l'impression et certainement pas à de la gestion documentaire.
Après, si tu veux juste répondre à la question lequel de mes documents contient le mot "elastic", cela devrait le faire.
Il y a aussi de très bon logiciels d'indexation pour ordinateur personnel.
Bon courage.