• [^] # Re: Inquiétude

    Posté par (site web personnel) . En réponse à la dépêche Le Top 500 des supercalculateurs de novembre 2015. Évalué à 10.

    Y'a plein de facteurs qui rentrent en ligne de compte :
    - ce sont majoritairement des financements publics (pour les machines déclarées du top500), et y'en a plus beaucoup à cette échelle,
    - on atteint des limites physiques : Taille des salles, des clims, des alims électrique,
    - on atteint des limites sur l'interco (ben oui, tous ces CPU/GPU, faut qu'ils accèdent aux données, qu'ils discutent entre eux), sur le stockage et sur la programmation...

    Avec les technos d'aujourd'hui, il devient vraiment difficile de construire une machine à 300 000 cores CPU qui soit efficace (même en trichant avec les accélérateurs) dans un budget abordable (même pour une nation).

    Je parle pas d'un datacenter àla Google/Akamaï/Facebook, je parle d'une machine cohérente, avec un réseau d'interco à grand débit (>40GB/s), à faible latence (<1μs), avec moins de deux hop entre tous les cores CPU.

    En plus, ça devient un bordel à programmer avec les accélérateurs. On n'est plus dans les paradigmes "simples" que sont OpenMP et OpenMPI, on rajoute des couches (Cuda, OpenCL, ou la cuisine Intel). Déjà que la majorité des codes scientifiques courants n'arrivent pas à exploiter efficacement 128 cores... Et qu'il faut tous les reprendre...

    Sans oublier que certains passages à l'échelle, pour les codes qui scalent déjà bien, ne sont pas bloquant sur le nombre de cores de calcul exploitables, mais sur la quantité de mémoire par core de calcul, ou sur l'accessibilité de grands volumes de données par les cores (genre certains modèles de météo, de sismo, de mécaflu...) à des vitesses raisonnables.

    Et puis il y a aussi ce mur avec lequel tous les fabricants nous tannent depuis quelques années : l'EXASCALE !! En nous faisant aussi miroiter des trucs nouveaux trop bieng trop bieng de dans deux ans qui sont jamais dispo maintenant (l'arlésienne du memristor qu'accumule les années de retard, AMD et son architecture Fusion HPC). Donc, une grande partie des utilisateurs/financeurs sont attentistes. On renforce ce qui fonctionne, on apprends à bien exploiter le truc dans le datacenter avant de racheter encore un nouveau jouet au Dr. Machin (insert ici la discipline scientifique de ton choix).

    Ça explique le ralentissement observé ces dernières années...

    Proverbe Alien : Sauvez la terre ? Mangez des humains !