• [^] # Re: Easter egg ?

    Posté par . En réponse au journal Sous Debian. Évalué à 6.

    Le moteur de traduction de google s'appuie sur des grosses quantités de textes parallèles alignés (ie : textes traduction mutuelle, et les éléments de traduction sont associés). Du coup, dans beaucoup de cas, la phrase à traduire (ou un bout de la phrase) à déjà été traduite quelque part, et google le sait. C'est pourquoi google translate est devenu aussi performant ces dernières années.

    Ça ne résoud pas tous les problèmes : certains mots "rares" sont inconnus (typiquement, le vocabulaire scientifique), mais surtout, les couples de traduction impliquent toujours ou presque l'anglais. Il est facile de trouver des documents français <-> anglais ou japonais <-> anglais, mais les textes français <-> japonais sont eux très rares. Du coup, google ne sait pas comment traduire du français en japonais (d'où le recours une transition en anglais -- c'était impossible dans la version précédente).

    L'avenir (du moins je l'espère, c'est mon sujet de thèse :) c'est de s'appuyer sur des documents qui ne sont plus des traductions mutuelles, mais qui partagent un vocabulaire commun (par exemple, deux articles de journaux de la même période, sur un même sujet d'actualité). Il est possible d'extraire automatiquement le vocabulaire commun et de l'aligner, même si ça marche pas super pour le moment. Du coup, on peut compléter les bases de connaissances linguistiques automatiquement et les mettres à jour en fonction de l'évolution des langages et de l'introduction de nouveau vocabulaire.

    La classe, spa ?