On n'utilise plus mapreduce et Pig depuis assez longtemps maintenant (c'est à dire au moins 3 ans ;-) , c'est Hive+llap et SPARK.
Faire du Big Data sur un fichier csv (a priori petit ) ne sert à rien , le temps de latence est trop important.
Il faut faire le même exercice sur une base de plusieurs millions de lignes (quelques tera par exemple..)
[^] # Re: Python rulz!
Posté par Bruno (Mastodon) . En réponse au journal Huit ans et plus toutes ses dents. Évalué à 2.
On n'utilise plus mapreduce et Pig depuis assez longtemps maintenant (c'est à dire au moins 3 ans ;-) , c'est Hive+llap et SPARK.
Faire du Big Data sur un fichier csv (a priori petit ) ne sert à rien , le temps de latence est trop important.
Il faut faire le même exercice sur une base de plusieurs millions de lignes (quelques tera par exemple..)