Un autre problème c'est que modifier le matos réseau ça coute du temps et de l'argent tandis que changer la config des machines, suivant de quoi tu part, ça coute du temps.
De plus, dans le cadre évoqué de serveurs de calculs, le réseau doit souvent être partagé entre les transferts de données via NFS et ceux effectués directement par l'algorithme pour la parllélisation du calcul.
Si une grosse majorité des données snt disponibles en local, on limite les transfert NFS et donc on libère de la bande passante pour MPI par exemple.
Donc le choix entre améliorer le réseau ou la localisation des données dépend de ce que tu fais. Dans mon cas par exemple, sur le petit cluster ou j'ai travaillé, j'ai gagner énormément en perf lorsque j'ai modifié un programme parrallèle pour qu'il utilise les disque dur locaux plustôt que le NFS pour le stockage des données.
Chaque machine accede dans plus de 80% des cas à ses données donc il reste moins de 20% du temps ou les données circules sur le réseau qui est quasiment entièrement libre pour les message de MPI.
Tout ça pour dire que le réseau est loin d'être la seule solution de même que le choix entre :
- données centralisées et cache local sur les machines ;
- donnée réparties et système d'accès à distance.
Il n'y a pas de solution miracle et ça dépend vraiment des applications qui tournent sur le système.
[^] # Re: Le tout est de savoir où est le goulot d'étranglement
Posté par beagf . En réponse au journal un home rapide. Évalué à 3.
De plus, dans le cadre évoqué de serveurs de calculs, le réseau doit souvent être partagé entre les transferts de données via NFS et ceux effectués directement par l'algorithme pour la parllélisation du calcul.
Si une grosse majorité des données snt disponibles en local, on limite les transfert NFS et donc on libère de la bande passante pour MPI par exemple.
Donc le choix entre améliorer le réseau ou la localisation des données dépend de ce que tu fais. Dans mon cas par exemple, sur le petit cluster ou j'ai travaillé, j'ai gagner énormément en perf lorsque j'ai modifié un programme parrallèle pour qu'il utilise les disque dur locaux plustôt que le NFS pour le stockage des données.
Chaque machine accede dans plus de 80% des cas à ses données donc il reste moins de 20% du temps ou les données circules sur le réseau qui est quasiment entièrement libre pour les message de MPI.
Tout ça pour dire que le réseau est loin d'être la seule solution de même que le choix entre :
- données centralisées et cache local sur les machines ;
- donnée réparties et système d'accès à distance.
Il n'y a pas de solution miracle et ça dépend vraiment des applications qui tournent sur le système.