ton projet à l'air sympa, mais je pense que tu aurais un meilleur résultat en faisant une analyse lexicale et un parseur. Comme si tu voulais compiler le code. Et avec le nombres d'erreurs retournées utiliser les probabilités pour décider quel langage choisir.
Je pense qu'on peut y arriver avec uniquement les probabilités/fréquences des mots en comparant avec bon corpus d'exemple de code. Les N-gram sont probablement les plus pertinent avec les probabilités. Seulement le nom des variables sont une perte de temps à analyser et peuvent être communes à plusieurs langages, de même pour les bibliothèques.
Enfin je veux dire que je pense que tu arrivera à un résultat approximatif pour beaucoup de travail alors qu'il existe une méthode presque exacte: essayer de compiler ton programme.
Sinon peut-être une idée : recherche des tokens d'un langage dans un code (token du C par exemple) et puis comparer la proportion de token au reste du code et ensuite tu utilise les probabilités avec ton corpus de code C.
# Parsing compilation
Posté par jay . En réponse au journal Détection de la syntaxe d'un langage informatique via un analyseur statistique naïf de type Bayésien. Évalué à 1.
Hello,
ton projet à l'air sympa, mais je pense que tu aurais un meilleur résultat en faisant une analyse lexicale et un parseur. Comme si tu voulais compiler le code. Et avec le nombres d'erreurs retournées utiliser les probabilités pour décider quel langage choisir.
Je pense qu'on peut y arriver avec uniquement les probabilités/fréquences des mots en comparant avec bon corpus d'exemple de code. Les N-gram sont probablement les plus pertinent avec les probabilités. Seulement le nom des variables sont une perte de temps à analyser et peuvent être communes à plusieurs langages, de même pour les bibliothèques.
Enfin je veux dire que je pense que tu arrivera à un résultat approximatif pour beaucoup de travail alors qu'il existe une méthode presque exacte: essayer de compiler ton programme.
Sinon peut-être une idée : recherche des tokens d'un langage dans un code (token du C par exemple) et puis comparer la proportion de token au reste du code et ensuite tu utilise les probabilités avec ton corpus de code C.