J'imagine qu'on est un peu à la frontière entre la recherche et les solutions vraiment fonctionnelles, et je suis conscient que, dans une certaine mesure, certaines solutions peuvent être inapplicables. Cependant, je ne pense pas qu'une base de données d'expressions prenne forcément beaucoup de place: une fois le vocabulaire indexé, il suffit de construire une base de données d'enchainements de mots, et ça fait beaucoup, beaucoup moins de combinaisons qu'on pourrait estimer par une analyse mathématique. Un correcteur basé sur des constructions grammaticales comme le tien doit déja, j'imagine, avoir une telle base, histoire de ne pas mettre du rouge partout sur les expressions non-grammaticales ("il faut raison garder", "autant que faire se peut", "entre quatre-z-yeux", etc). Il est clair que "est aller" n'est pas une expression correcte, alors que "est conseiller" l'est ; plutôt que d'essayer de construire une bdd hyper-complexe sur les catégories grammaticales des mots (verbe transitif sauf au passé simple dans l'expression xxx, sauf s'il y a un attribut du sujet), ma flemmardise naturelle me pousserait à concevoir une bdd automatiquement en analysant des textes, quitte à éventuellement limiter la taille de la base quand on la distribue. Rien que la liste des doublets de mots possibles corrigerait, à mon avis pifométrique, une majorité des erreurs de grammaire. D'ailleurs, tous les exemples que tu as cités seraient corrigés avec une bdd de doublets de mots corrects : le coup des "erreurs materiels", le coup de "est aller", etc. Et une telle base prendrait que dalle en espace disque (probablement moins que l'index des mots).
[^] # Re: IA
Posté par arnaudus . En réponse à la dépêche Grammalecte, correcteur grammatical. Évalué à 4. Dernière modification le 22 avril 2015 à 13:19.
J'imagine qu'on est un peu à la frontière entre la recherche et les solutions vraiment fonctionnelles, et je suis conscient que, dans une certaine mesure, certaines solutions peuvent être inapplicables. Cependant, je ne pense pas qu'une base de données d'expressions prenne forcément beaucoup de place: une fois le vocabulaire indexé, il suffit de construire une base de données d'enchainements de mots, et ça fait beaucoup, beaucoup moins de combinaisons qu'on pourrait estimer par une analyse mathématique. Un correcteur basé sur des constructions grammaticales comme le tien doit déja, j'imagine, avoir une telle base, histoire de ne pas mettre du rouge partout sur les expressions non-grammaticales ("il faut raison garder", "autant que faire se peut", "entre quatre-z-yeux", etc). Il est clair que "est aller" n'est pas une expression correcte, alors que "est conseiller" l'est ; plutôt que d'essayer de construire une bdd hyper-complexe sur les catégories grammaticales des mots (verbe transitif sauf au passé simple dans l'expression xxx, sauf s'il y a un attribut du sujet), ma flemmardise naturelle me pousserait à concevoir une bdd automatiquement en analysant des textes, quitte à éventuellement limiter la taille de la base quand on la distribue. Rien que la liste des doublets de mots possibles corrigerait, à mon avis pifométrique, une majorité des erreurs de grammaire. D'ailleurs, tous les exemples que tu as cités seraient corrigés avec une bdd de doublets de mots corrects : le coup des "erreurs materiels", le coup de "est aller", etc. Et une telle base prendrait que dalle en espace disque (probablement moins que l'index des mots).