Pour l'OCR des images, je recommande tesseract, j'ai testé récemment parce que je devais traduire un bon gros contract en chinois fourni sous forme d'impression écran de smartphone (une bonne centaine de png, il y a des fous sur terre). J'ai été impressionné du résultat.
Une ligne de bash et 20s plus tard, il reste juste à additionner les fichiers txt créés.
Faut juste penser à installer le paquet correspondant à la langue (pas vraiment la langue d'ailleurs, plutôt le jeu de caractères de la langue de ton document. Dans mon cas chi_sim pour chinois simplifié) en plus du logiciel lui-même.
# OCR en ligne de commande
Posté par xulops (site web personnel) . En réponse au message Reconnaissance Optique de Caractères sous Linux. Évalué à 1. Dernière modification le 10 janvier 2020 à 17:27.
Pour l'OCR des images, je recommande tesseract, j'ai testé récemment parce que je devais traduire un bon gros contract en chinois fourni sous forme d'impression écran de smartphone (une bonne centaine de png, il y a des fous sur terre). J'ai été impressionné du résultat.
Une ligne de bash et 20s plus tard, il reste juste à additionner les fichiers txt créés.
Faut juste penser à installer le paquet correspondant à la langue (pas vraiment la langue d'ailleurs, plutôt le jeu de caractères de la langue de ton document. Dans mon cas chi_sim pour chinois simplifié) en plus du logiciel lui-même.