Genre:
1. convertir les documents au format texte, puis avec des libs de NLP
2. faire la tokenization
3. récupérer les stems
4. calculer les distances entre les documents
C'est facile à scripter, et te permet de faire un PoC rapidement. Une petite interface web ad hoc n'est sans doute pas compliquée à faire, ou tout comme le scan automatique de documents stockés dans un espace dédié sur des disques réseaux partagés. Le support d'autres langues que l'anglais dépend fortement de la lib NLP que tu utilises.
Sinon, vaguement connexe, il y a prochainement un webinaire sur le text-mining et les brevets.
Fais-moisigne si tu as envie d'en savoir plus. J'ai fréquenté pendant longtemps le monde de la recherche en suisse, et la thématique m'intéresse beaucoup: ça peut être intéressant d'en parler.
# NLP ?
Posté par aurel (site web personnel, Mastodon) . En réponse au message logiciel de détection de plagiat. Évalué à 3. Dernière modification le 01 octobre 2016 à 09:22.
Genre:
1. convertir les documents au format texte, puis avec des libs de NLP
2. faire la tokenization
3. récupérer les stems
4. calculer les distances entre les documents
cf. https://stackoverflow.com/questions/8897593/similarity-between-two-text-documents.
C'est facile à scripter, et te permet de faire un PoC rapidement. Une petite interface web ad hoc n'est sans doute pas compliquée à faire, ou tout comme le scan automatique de documents stockés dans un espace dédié sur des disques réseaux partagés. Le support d'autres langues que l'anglais dépend fortement de la lib NLP que tu utilises.
Sinon, vaguement connexe, il y a prochainement un webinaire sur le text-mining et les brevets.
Fais-moi signe si tu as envie d'en savoir plus. J'ai fréquenté pendant longtemps le monde de la recherche en suisse, et la thématique m'intéresse beaucoup: ça peut être intéressant d'en parler.