Je présume qu'il stocke tous les mots d'un coté et qu'il fait les associations de mots de l'autre. Tous les mots de wikipedia, c'est principalement tous les mots du dictionnaire et tous les mots d'un dictionnaire de noms propre. Sachant qu'il ne stocke probablement pas tous les mots mais plutôt des bases de mot1 (tu ne stocke pas « maison » et « maisons » ni « administré », « administrés », « administrée » et « administrées »). Grosso modo je présume que ça lui permet de stocker les phrases non pas sous forme d'une suite de mots, mais sous forme d'une suite d'idées. Pour chaque idée, il a une série de mots qu'il peut dérivé (toutes ces formes connues dans le dictionnaires, transformation de chacun d'eux en l33t, casse bizarre, première lettre nombre dernière lettre, ajout de faute, écriture dans diverses langues, dans diverses dispositions de clavier, etc) et il ponctue entre chaque mot (espace, rien, virgule, point d'interrogation, d'exclamation, de suspension, les ponctuations d'autres langues que l'a notre,... (tiens il a peut être pas le point d'ironie :) )).
C'est une entropie monstrueuse, mais avec une puissance de calcul de folie ça doit pouvoir se faire (et ça se parallélise très facilement). Aujourd'hui prendre 2 à 4 cartes graphiques, une CPU à 8 cores, ça ne coûte pas bien cher. Au pire amazone te propose de louer sa puissance de calcul pour pas bien chère si tu ne veux pas investir.
Je pour les problèmes d'accès disque c'est probablement le goulot d'étranglement, il ne peux pas tous stocker en mémoire vive et même du SATA 3 avec des SSD (c'est du stockage qui reviens chère limite pas mal). Mais ça doit pouvoir s'optimiser comme il faut (ne traiter que des phrases qui utilisent les même idées en même temps par exemple.
Il doit être assez facile de découper le travail en envoyant une série de phrases à une machine (dans le cas d'un système distribué) avec toutes les idées dont la machine a besoin et de lui laisser faire le boulot pendant quelques minutes/heures avant de passer à une autre série de phrases.
Bref ça me semble pas insurmontable si on est motivé.
Tous les contenus que j'écris ici sont sous licence CC0 (j'abandonne autant que possible mes droits d'auteur sur mes écrits)
[^] # Re: Un peu trop alarmiste
Posté par barmic . En réponse au journal La proche fin des mots de passe. Évalué à 1.
Je présume qu'il stocke tous les mots d'un coté et qu'il fait les associations de mots de l'autre. Tous les mots de wikipedia, c'est principalement tous les mots du dictionnaire et tous les mots d'un dictionnaire de noms propre. Sachant qu'il ne stocke probablement pas tous les mots mais plutôt des bases de mot1 (tu ne stocke pas « maison » et « maisons » ni « administré », « administrés », « administrée » et « administrées »). Grosso modo je présume que ça lui permet de stocker les phrases non pas sous forme d'une suite de mots, mais sous forme d'une suite d'idées. Pour chaque idée, il a une série de mots qu'il peut dérivé (toutes ces formes connues dans le dictionnaires, transformation de chacun d'eux en l33t, casse bizarre, première lettre nombre dernière lettre, ajout de faute, écriture dans diverses langues, dans diverses dispositions de clavier, etc) et il ponctue entre chaque mot (espace, rien, virgule, point d'interrogation, d'exclamation, de suspension, les ponctuations d'autres langues que l'a notre,... (tiens il a peut être pas le point d'ironie :) )).
C'est une entropie monstrueuse, mais avec une puissance de calcul de folie ça doit pouvoir se faire (et ça se parallélise très facilement). Aujourd'hui prendre 2 à 4 cartes graphiques, une CPU à 8 cores, ça ne coûte pas bien cher. Au pire amazone te propose de louer sa puissance de calcul pour pas bien chère si tu ne veux pas investir.
Je pour les problèmes d'accès disque c'est probablement le goulot d'étranglement, il ne peux pas tous stocker en mémoire vive et même du SATA 3 avec des SSD (c'est du stockage qui reviens chère limite pas mal). Mais ça doit pouvoir s'optimiser comme il faut (ne traiter que des phrases qui utilisent les même idées en même temps par exemple.
Il doit être assez facile de découper le travail en envoyant une série de phrases à une machine (dans le cas d'un système distribué) avec toutes les idées dont la machine a besoin et de lui laisser faire le boulot pendant quelques minutes/heures avant de passer à une autre série de phrases.
Bref ça me semble pas insurmontable si on est motivé.
Tous les contenus que j'écris ici sont sous licence CC0 (j'abandonne autant que possible mes droits d'auteur sur mes écrits)