• [^] # Re: Et MPI ?

    Posté par . En réponse au journal Petit tour d’horizon de la haute performance et du parallélisme. Évalué à 4.

    Pour python, je dirais plutôt que dans la majorité des cas du macro HPC, les performances sont largement suffisantes car le goulot d'étranglement sont les IOs (disques/réseaux) donc il n'est pas utile de se prendre la tête.

    Heu non pas vraiment.

    Si tu regardes tous les framework Python au dessus d'Hadoop et que tu restes sur des traitements simples, favorable à Python donc, tu prends un facteur entre 3 et 10.

    Tout ca au dessus d'un truc qui est déjà très lent. Hadoop MR c'est scalable et tolérant aux pannnes par design (ce qui veut pas dire que son problème s'exprime de manière scalable en MR), mais l'efficacité est moyenne à mauvaise. Si tu construits un truc pour ton problème c'est normalement plusieurs dizaines d'ordres de grandeurs que tu gagnes.

    Bref Python peut être un choix valable car 90% des jobs écrit sont fait à l'arrache et on se balance de leur efficacité modulo que ca tienne sur le cluster et que ca ne coute "que" 4x plus cher en matos. Mais dire que t'es IO bound et que Python ne change rien faut pas déconner. Sur les vrais jobs on bosse le design mais aussi énormement l'optim des implems de bas niveau ce qui donne des gains très significatifs.