Tiens encore le même refrain. Ca faisait longtemps.
Tu es en train de dire que les mecs qui gèrent les plus gros clusters en prod pour faire de l'analyse d'énorme volume de donnée sont tous des abrutis ? Et que tu sais vachement mieux que ce qui marche et ce qui marche pas malgré le fait que tu ne comprennes rien au problème ? "on parle de stockage et non de calcul" -> non non un map/reduce c'est pas calcul intensif...
C'est tellement une hérésie de le faire en Java que c'est développé par Yahoo! pour la prod de Yahoo!. Dans les quelques utilisateurs qui font des choix à la va vite en utilisant des trucs qui rament on retrouve facebook (2PB de donnée à traiter), Microsoft, cooliris, lastfm etc. Et y'a aussi quelques mecs qui connaissent vraiment rien au domaine, http://www.cloudera.com/about , qui se sont dit que ca marchait tellement mal que ca valait le coup de monter une boite. Et toi tu as des arguments pertinents en dehors de lieu commun ?
Hadoop, ca marche, c'est facile à déployer et ca scale. Ca joue dans la cours des plus grand puisque Yahoo! et Google se tirent la bourre sur les benchs. Tu pourrais peut être grappiller X% de perfs en utilisant un truc plus bas niveau mais ce n'est pas forcement le plus important. Tu as énormément de facteur qui influent sur le calcul, comme ton infrastructure, la taille de tes map/reduce, la redondance, la rack affinity etc. Et la facilité de déploiement et d'utilisation est aussi à prendre en compte.
Après personne ne t'oblige à écrire tes map/reduce en Java. Via pipe et streaming tu peux utiliser ce que tu veux.
[^] # Re: Pertinence de Java
Posté par ckyl . En réponse à la dépêche Yahoo libère son Hadoop. Évalué à 7.
Tu es en train de dire que les mecs qui gèrent les plus gros clusters en prod pour faire de l'analyse d'énorme volume de donnée sont tous des abrutis ? Et que tu sais vachement mieux que ce qui marche et ce qui marche pas malgré le fait que tu ne comprennes rien au problème ? "on parle de stockage et non de calcul" -> non non un map/reduce c'est pas calcul intensif...
C'est tellement une hérésie de le faire en Java que c'est développé par Yahoo! pour la prod de Yahoo!. Dans les quelques utilisateurs qui font des choix à la va vite en utilisant des trucs qui rament on retrouve facebook (2PB de donnée à traiter), Microsoft, cooliris, lastfm etc. Et y'a aussi quelques mecs qui connaissent vraiment rien au domaine, http://www.cloudera.com/about , qui se sont dit que ca marchait tellement mal que ca valait le coup de monter une boite. Et toi tu as des arguments pertinents en dehors de lieu commun ?
Hadoop, ca marche, c'est facile à déployer et ca scale. Ca joue dans la cours des plus grand puisque Yahoo! et Google se tirent la bourre sur les benchs. Tu pourrais peut être grappiller X% de perfs en utilisant un truc plus bas niveau mais ce n'est pas forcement le plus important. Tu as énormément de facteur qui influent sur le calcul, comme ton infrastructure, la taille de tes map/reduce, la redondance, la rack affinity etc. Et la facilité de déploiement et d'utilisation est aussi à prendre en compte.
Après personne ne t'oblige à écrire tes map/reduce en Java. Via pipe et streaming tu peux utiliser ce que tu veux.