URL: https://linuxfr.org/users/duncan_idaho/journaux/google-livre-ses-n-grammes Title: Google livre ses N-Grammes ! Authors: Duncan Idaho Date: 2006年08月13日T12:48:32+02:00 Tags: Score: 0 Bonjour, il semble que la question du traitement automatique du langage intéresse quelques personnes ici (correcteur grammaticaux, thésaurus...) alors je me permet de relayer cette information que j'ai reçu il y a quelques jours. [http://googleresearch.blogspot.com/2006/08/all-our-n-gram-ar(...)](http://googleresearch.blogspot.com/2006/08/all-our-n-gram-are-belong-to-you.html)
All Our N-gram are Belong to You
Si vous n'avez aucune idée de ce qu'est un N-gramme, il y a un article (largement améliorable) sur wikipédia : [http://fr.wikipedia.org/wiki/N-gramme](http://fr.wikipedia.org/wiki/N-gramme) En gros, partant d'une unité textuelle (caractère, mot, phrase) on retient les n-séquences différentes et leur probabilité. Par exemple, on sait qu'en français, le bi-gramme (n-gramme de niveau 2) le plus fréquent est la séquence "de". Ceci informe, lors d'un traitement automatique, sur la lettre la plus fréquente apparaissant après un "d". Application : vous programmez un logiciel de reconnaissance de l'écriture, vous reconnaissez « mond* », avec « * » un caractère très mal reconnus, le logiciel hésite entre "e" et "l". Muni des n-gramme, il proposera certainement le choix "e" car "dl" est un bigramme très rare (bon, dans la vraie vie le logiciel dispose d'un dictionnaire qui va lui proposer "monde", qui existe, plutôt que "mondl", qui n'existe pas). Bref, c'est une ressource assez précieuse mais pas nécessairement facile à constituer (il n'est pas évident de récolter des corpus fiable, bien constitué, voir [http://fr.wikipedia.org/wiki/Corpus#Le_corpus_dans_la_scienc(...)](http://fr.wikipedia.org/wiki/Corpus#Le_corpus_dans_la_science) ). Google propose ici à la communauté scientifique :
We processed 1,011,582,453,213 words of running text and are publishing the counts for all 1,146,580,664 five-word sequences that appear at least 40 times. There are 13,653,070 unique words, after discarding words that appear less than 200 times.
En gros : plus d'un milliards de 5-gramme (énorme !), le tout sur 6 DVD...

AltStyle によって変換されたページ (->オリジナル) /