• [^] # Re: La LEN se défend

    Posté par . En réponse à la dépêche La LEN se défend. Évalué à 10.

    Il y a deux gros problemes avec les dits outils de detection.
    Ce sont ce qu'on apelle des outils d'analyse semantique, c'est a dire des outils capables de comprendre le contexte general et le message d'un contenu/d'une image.
    Ces outils ont souvent un systeme d'apprentissage et sont surtou utilises par deux grands groupes industriels :
    1) Les traducteurs
    2) La presse
    Ces outils fonctionnent par recoupment d'information et generalisation. Ils fonctionnent majoritairement dans un monde ou les gens cherchent a etre compris et a se demarquer. Il faut bien reconnaitre que dans ces deux domaines ces outils sont assez performants.
    Le seul de ses outils disponibles pour le grand public est "systran pro" encore qu'il y ait des traces d'analyse semantique dans certains traitements de texte, logiciel d'OCR et de reconnaisance vocale.

    Malheureusement l'analyse semantqiure est un des domaines dans lequels l'etre humain est tres tres en avance sur l'ordinateur. Il est extrement facile de rendre fou un analyseur semantique ou tout simplement de le faire se tromper completement.

    La reconnaissance de motifs qui est a la base de beaucoup d'outil d'analyse semantique est aussi un autre domaine dans lequel l'etre humain est beaucoup plus fort que l'ordinateur.

    S| \/0uS 3Cr|\/3z <--- comme ca un analyseur semantique va avoir du mal.

    De meme la reconnaissance de motif semi-complexe est impossible aux ordinateurs (cf la protection par message dans une image lors de l'inscription pour un compte AOL).

    La chose que les politiciens (et meme Bill Gates, si on en juge par sa declaration anti-spam) ne semblent pas comprendre et que l'on a pas affaire a un probleme technique. Il ne s'agit pas de resoudre un probleme regit par des lois physiques rigides, il s'agit de bloquer des humains qui vont tout faire pour passer. On a affaire a un combat intelligence humaine contre intelligence humaine. Ca ne veut pas dire qu'il faut baisser les bras, mais ca veut dire a coup sur que sur un nouveau systeme l'equipe d'en face trouvera un moyen de contourner le probleme.

    Et en ce qui concerne le Web on comence a voir pas mal de sites fortements illegaux (et dont du coup je ne donnerais pas les adresses) qui utilisent les CSS pour passer outre les verifs standards. Comment ? Tres simple : Vous pouvez casser une image et 150 images plus petites et recomposer derriere, vous pouvez choisir quelles informations faire apparaitre et dans quel ordre (pratique pour les serials numbers, mais a mon avis totu a fait utilisable pour d'autres choses) etc...

    L'analyse semantique informatique de donnees ecrites par des gens qui a) savent que les outils existent et b) ne veulent pas etre compris de ces outils est a l'heure actuelle techniquement impossible. Le fait que des outils comme les filtres baysiens fonctionnent est autant lie a la qualite du logiciel qu'a sa rarete (et donc les spammeurs/verolleurs ne voient pas l'interet de se defoncer pour moins de 0,5% des configs). Vouloir rendre obligatoire un type de filtre ou de moteur est stupide, car celui ci deviendra vite "connu" des personnes qui veulent passer au travers. Sans compter le fait qu'il est tres facile de "sur-entrainer" un analyseur syntaxique...

    Bref ce qui me gene c'est uen fois de plus la volonte de mettre en place un systeme dont on sait deja au niveau universitaire qu'il sera innefficace a terme...


    Kha