Mais j’ai la désagréable impression de répondre à côté de la plaque ou d’avoir raté le point de ton commentaire.
pas complement, puisqu'il y a des precisions utiles.
Les calculs ont tendance a être lourds, aussi, la partie I/O, même si elle est lourde, représente rarement (jamais ?) plus de la moitié du temps de processing. Si on n’utilise pas au max les CPU, on perd donc du temps.
si ton CPU passe 50% de son temps à "attendre" les données des disques durs, alors tu "perd" du temps ;)
donc il est probable que quand un des noeuds veut acceder à des données qui sont sur les autres noeuds, il va utiliser du temps CPU et des I/O de cet autre noeud, qui n'est peut-etre pas dispo puisqu'en cours de calcul => donc de l'attente.
ton probleme actuel c'est que tes noeuds de cluster de calcul sont aussi des clusters de stockage.
si tu dissocies les 2, tes acces aux données ne sont plus conditionnés par la dispo des CPU de calcul,
de plus tu peux pousser la separation en ayant un systeme permettant de stocker :
- les données courantes sur un systeme avec des SSD (tu diminues fortement l'engorgement sur les I/O)
- les données d'archives sur un systeme "dormant" à base de disque dur,
bref le GRID de calcul, c'est une bonne idée, mais à mon avis il ne faut pas faire le GRID de stockage avec les memes machines.
[^] # Re: Type d'IO, Conso ?
Posté par NeoX . En réponse au message Remplacer un (petit) cluster pour consommer bcp moins tout en gardant de la puissance. Évalué à 2. Dernière modification le 26 octobre 2014 à 14:58.
pas complement, puisqu'il y a des precisions utiles.
si ton CPU passe 50% de son temps à "attendre" les données des disques durs, alors tu "perd" du temps ;)
donc il est probable que quand un des noeuds veut acceder à des données qui sont sur les autres noeuds, il va utiliser du temps CPU et des I/O de cet autre noeud, qui n'est peut-etre pas dispo puisqu'en cours de calcul => donc de l'attente.
ton probleme actuel c'est que tes noeuds de cluster de calcul sont aussi des clusters de stockage.
si tu dissocies les 2, tes acces aux données ne sont plus conditionnés par la dispo des CPU de calcul,
de plus tu peux pousser la separation en ayant un systeme permettant de stocker :
- les données courantes sur un systeme avec des SSD (tu diminues fortement l'engorgement sur les I/O)
- les données d'archives sur un systeme "dormant" à base de disque dur,
bref le GRID de calcul, c'est une bonne idée, mais à mon avis il ne faut pas faire le GRID de stockage avec les memes machines.