Nvidia propose depuis peu CUDA.
CUDA ( http://www.hardware.fr/articles/659-1/cuda-apercu.html ) est une sorte de compilateur/API au dessus de C permettant de refiler tous les calculs en flottants (matriciels, etc...) à la carte graphique, offrant la possibilité d'exploiter au mieux son parallélisme.
Le GPU G80/NV50 est doté de 128 unités de calculs. La plupart sont capables d'exécuter des additions et multiplications flottantes, ou des instructions du type FMAD qui effectue une multiplication plus addition (idéal pour les multiplications de matrices).
Certaines unités d'exécution proposent des instructions plus puissantes comme sinus, cosinus, racine carrée, etc...
16 "multiprocesseurs" contiennent chacun 8 processeurs et 8 ko de mémoire cache.
Pour le moment, CUDA ne permet de n'atteindre qu'une précision de 32 bits sur les flottants, mais les 64 devraient arriver bientôt.
De plus, la circuiterie interne des GPU n'est pas compatible IEEE
CUDA nécessite un driver spécifique disponible pour plusieurs OS dont Linux qui est ici bien servi.
Il propose une lib contenant des opérations pour FFT et de l'algèbre linéaire de base. Il y a même un plugin Matlab !
Bien évidemment la lib permet aussi d'injecter des résultats de calculs dans un rendu 3d.
C'est censé fonctionner avec GCC, mais j'ai pas testé, donc à vérifier. http://developer.nvidia.com/object/cuda.html
De plus, Nvidia s'apprête à sortir TESLA. Tesla http://www.nvidia.com/object/tesla_computing_solutions.html est un serveur lame intégrant plusieurs GPU et permettant, grâce à Cuda, d'exécuter toute sortes de calculs.
Il faut voir qu'un G80 (le processeur de la Gforce8800) atteint 300 Gflops, en calculs très spécialisé certes, mais 300 Gflops pour tout ce qui est calculs physique, génétique, réseau de neurones, etc...
Cette machine offre une infrastructure pour gérer le parallélisme.
Bref, je me demande si ce genre d'approche ne va pas séduire pas mal d'industriels, parce que 300 Gflops par GPU, il n'en faut que 3000 pour atteindre le pentaflop...
# Et Nvidia/ATI ?
Posté par Ontologia (site web personnel) . En réponse au journal BlueGene/P...enfin le petaflop !. Évalué à 6.
CUDA ( http://www.hardware.fr/articles/659-1/cuda-apercu.html ) est une sorte de compilateur/API au dessus de C permettant de refiler tous les calculs en flottants (matriciels, etc...) à la carte graphique, offrant la possibilité d'exploiter au mieux son parallélisme.
Le GPU G80/NV50 est doté de 128 unités de calculs. La plupart sont capables d'exécuter des additions et multiplications flottantes, ou des instructions du type FMAD qui effectue une multiplication plus addition (idéal pour les multiplications de matrices).
Certaines unités d'exécution proposent des instructions plus puissantes comme sinus, cosinus, racine carrée, etc...
16 "multiprocesseurs" contiennent chacun 8 processeurs et 8 ko de mémoire cache.
Pour le moment, CUDA ne permet de n'atteindre qu'une précision de 32 bits sur les flottants, mais les 64 devraient arriver bientôt.
De plus, la circuiterie interne des GPU n'est pas compatible IEEE
CUDA nécessite un driver spécifique disponible pour plusieurs OS dont Linux qui est ici bien servi.
Il propose une lib contenant des opérations pour FFT et de l'algèbre linéaire de base. Il y a même un plugin Matlab !
Bien évidemment la lib permet aussi d'injecter des résultats de calculs dans un rendu 3d.
C'est censé fonctionner avec GCC, mais j'ai pas testé, donc à vérifier.
http://developer.nvidia.com/object/cuda.html
De plus, Nvidia s'apprête à sortir TESLA. Tesla http://www.nvidia.com/object/tesla_computing_solutions.html est un serveur lame intégrant plusieurs GPU et permettant, grâce à Cuda, d'exécuter toute sortes de calculs.
Il faut voir qu'un G80 (le processeur de la Gforce8800) atteint 300 Gflops, en calculs très spécialisé certes, mais 300 Gflops pour tout ce qui est calculs physique, génétique, réseau de neurones, etc...
Cette machine offre une infrastructure pour gérer le parallélisme.
Bref, je me demande si ce genre d'approche ne va pas séduire pas mal d'industriels, parce que 300 Gflops par GPU, il n'en faut que 3000 pour atteindre le pentaflop...
NB : il y a aussi CTM d'ATI mais il parait que c'est assez difficile à utiliser.
http://ati.amd.com/companyinfo/researcher/Documents.html
« Il n’y a pas de choix démocratiques contre les Traités européens » - Jean-Claude Junker