URL: https://linuxfr.org/users/palkeo/journaux/de-la-prediction-de-l-auteur-d-un-journal-sur-linuxfr Title: De la prédiction de l'auteur d'un journal sur linuxfr Authors: palkeo Date: 2012年04月12日T15:27:54+02:00 License: CC By-SA Tags: intelligence_artificielle, censure, taln et classification Score: 60 Voici un journal relatant une petite expérience que j'ai faite, c'est peut-être un peu HS, mais je trouve ça cool donc je m'y risque :) Je me suis récemment demandé si il était possible, à partir d'une base de données de messages, de deviner l'auteur d'un message donné. J'ai donc codé un script qui, à partir de l'analyse statistique de nombreux journaux sur linuxfr, devrait déterminer l'auteur d'un journal inconnu. Le principe est simple : On regroupe les journaux de chaque auteur, et on regarde la densité de chaque mot, des caractères spéciaux (ponctuation...), des majuscules... Il suffit ensuite, de regarder si la densité de ces éléments dans un journal inconnu est plus ou moins proche de celle des journaux de chaque auteur connu. Il s'avère que ce système est plutôt concluant : Prenons [le dernier journal de paladar](https://linuxfr.org/users/paladar/journaux/surveillance-des-populations-siemens-recommence-en-syrie). Je le donne à manger à mon script, qui va classer les 77 personnes pour lesquelles j'ai plus de 5 journaux en mémoire (histoire d'avoir une base à peu près solide de référence pour chaque personne), par ordre de probabilité qu'elle ait posté le message. Après passage à la moulinette, mon script renvoie en première position paladar ! Il a donc, à partir de 8 lignes de texte, trouvé l'auteur du message parmi 77 personnes. Si je prend le dernier [journal](https://linuxfr.org/users/gnumdk/journaux/unity-vs-gnome-panel) de gnumdk, mon script sort gnumdk en 4è position (sur 77), il n'est donc pas premier, mais il est bien sorti de la masse. Pour [ce journal](https://linuxfr.org/users/niconico/journaux/hs-hacker-le-probleme-du-logement), niconico se retrouve en 2è position. Et pour finir, si je prend [une dépêche](https://linuxfr.org/news/sortie-de-la-version-4-7-du-compilateur-gcc), patrick_g sort bien en première place, alors que mon script à seulement vu quelques journaux qu'il a pu rédiger. On voit donc, qu'en faisant quelques statistiques sur un texte, on peut arriver à sortir l'auteur probable de ce dernier, avec pas mal de facilité. Après, il arrive parfois que le script ne soit pas du tout pertinent (pour des personnes ayant un style d'écriture ressemblant trop à d'autres, si il y a des citations...), mais il l'est dans un bon nombre de cas. La pertinence dépend d'ailleurs beaucoup de la taille du texte inconnu : Si il est tout petit, il est logique qu'il soit bien plus dur de trouver l'auteur. On imagine donc qu'avec des techniques plus évoluées, il est possible d'avoir des résultats assez impressionnants. Je vous donne l'archive contenant le fichier contenant les journaux ainsi que mes scripts, si vous souhaitez vous amuser, ou regarder le code source (les commentaires à ce sujet sont bienvenus). Je vous conseille d'utiliser [pypy](http://pypy.org/) pour faire tourner les scripts (ça pourra les accélérer). - [Code source (licence WTFPL)](http://www.palkeo.com/lib/exe/fetch.php?media=projets:detecteur-auteur.zip) - [Stylométrie sur wikipédia](https://fr.wikipedia.org/wiki/Stylom%C3%A9trie) PS : Je tiens à remercier les serveur de linuxfr pour leur coopération lors de l'aspiration des journaux.

AltStyle によって変換されたページ (->オリジナル) /