Le test est rigoureux je l'accorde. L'auteur est aussi visiblement sérieux et bien intentionné.
Cela n'empêche pas le test de ne pas être significatif. Comme beaucoup de débutants (ce qu'Austin écrit clairement) l'auteur se laisse séduire par un test synthétique simple et extrapole des résultats qu'il n'aura pas dans une utilisation réelle.
La simple vérité c'est que la ROC a été un échec commercial parce qu'elle n'était pas fiable (ce qui a conduit par exemple HP à abandonner puis libérer le moteur qui est devenu OCRopus). Les gros projets de numérisation mettent en 1⁄2uvre des moyens humains (correcteurs) et matériels (numériseurs performants) bien supérieurs à ce qu'un particulier peut trouver acceptable en temps ou en argent. Les petits projets de numérisation... je cherche mais je n'en vois pas.
La ROC reste un gadget que les PME achètent avant de constater qu'elle n'est pas assez fiable pour leur être de la moindre utilité en pratique. (et ce n'est pas un problème de capteur, si on peur mettre des capteurs couleur dans les téléphones ça fait longtemps qu'on pourrait diffuser les capteurs N&B nécessaires à la ROC si les logiciels voulaient bien suivre)
En outre, l'essentiel des développements a été concentré sur l'anglais, donc dès qu'on s'éloigne du latin non accentué les résultats déjà pas terribles se dégradent fortement (témoin ce test simpliste où un seul moteur reconnaissait le é. Et ce en l'absence de traces ou même d'autres lettres accentuées qui auraient pu le perturber).
C'est triste mais les disciplines de traitement du langage naturel ont bénéficié depuis des années d'un traitement privilégié dans les universités et autres instituts informatiques, sans jamais donner de résultats à la hauteur de l'investissement.
ROC, reconnaissance vocale, traduction automatique, la liste des casseroles est longue. Les ordinateurs n'ont pas les mêmes points forts que les êtres humains.
Tout au plus arrive-t-on aujourd'hui à déchiffrer codes postaux et plaques d'immatriculation de manière à peu près fiable (à peu près, témoins les tracteurs qui ont reçu des contraventions autoroutières quand les radars automatiques ont été déployés)
Un ONR marchera sans doute beaucoup mieux - les notations musicales présentent beaucoup moins de variabilité qu'un texte libre.
[^] # Re: Très peu significatif
Posté par nimnim . En réponse à la dépêche État des lieux de la reconnaissance de caractères libre (OCR). Évalué à 5.
Cela n'empêche pas le test de ne pas être significatif. Comme beaucoup de débutants (ce qu'Austin écrit clairement) l'auteur se laisse séduire par un test synthétique simple et extrapole des résultats qu'il n'aura pas dans une utilisation réelle.
La simple vérité c'est que la ROC a été un échec commercial parce qu'elle n'était pas fiable (ce qui a conduit par exemple HP à abandonner puis libérer le moteur qui est devenu OCRopus). Les gros projets de numérisation mettent en 1⁄2uvre des moyens humains (correcteurs) et matériels (numériseurs performants) bien supérieurs à ce qu'un particulier peut trouver acceptable en temps ou en argent. Les petits projets de numérisation... je cherche mais je n'en vois pas.
La ROC reste un gadget que les PME achètent avant de constater qu'elle n'est pas assez fiable pour leur être de la moindre utilité en pratique. (et ce n'est pas un problème de capteur, si on peur mettre des capteurs couleur dans les téléphones ça fait longtemps qu'on pourrait diffuser les capteurs N&B nécessaires à la ROC si les logiciels voulaient bien suivre)
En outre, l'essentiel des développements a été concentré sur l'anglais, donc dès qu'on s'éloigne du latin non accentué les résultats déjà pas terribles se dégradent fortement (témoin ce test simpliste où un seul moteur reconnaissait le é. Et ce en l'absence de traces ou même d'autres lettres accentuées qui auraient pu le perturber).
C'est triste mais les disciplines de traitement du langage naturel ont bénéficié depuis des années d'un traitement privilégié dans les universités et autres instituts informatiques, sans jamais donner de résultats à la hauteur de l'investissement.
ROC, reconnaissance vocale, traduction automatique, la liste des casseroles est longue. Les ordinateurs n'ont pas les mêmes points forts que les êtres humains.
Tout au plus arrive-t-on aujourd'hui à déchiffrer codes postaux et plaques d'immatriculation de manière à peu près fiable (à peu près, témoins les tracteurs qui ont reçu des contraventions autoroutières quand les radars automatiques ont été déployés)
Un ONR marchera sans doute beaucoup mieux - les notations musicales présentent beaucoup moins de variabilité qu'un texte libre.