Ce n'est pas vraiment des bases de données sur lesquels sont entraînés les modèles de Google, plutôt du texte issu de crawl web. Pour le papier cité, ils ont utilisé un dataset issus de common crawl, le C4.
Le problème avec les données textuelles issu du web, c'est qu'on y retrouve de nombreux biais de nos sociétés (sexisme, racisme,...). Ces biais se retrouvent dans les modèles entraînés sur ces données, c'est notamment ce dont parle le papier de Timnit Gebru.
[^] # Re: Késkidi ?
Posté par raphael0202 . En réponse au journal Google démantèle son éthique (et tout le monde s'en fout...). Évalué à 0.
Ce n'est pas vraiment des bases de données sur lesquels sont entraînés les modèles de Google, plutôt du texte issu de crawl web. Pour le papier cité, ils ont utilisé un dataset issus de common crawl, le C4.
Le problème avec les données textuelles issu du web, c'est qu'on y retrouve de nombreux biais de nos sociétés (sexisme, racisme,...). Ces biais se retrouvent dans les modèles entraînés sur ces données, c'est notamment ce dont parle le papier de Timnit Gebru.