La neutralité signifie que l'on ne prend pas parti, donc OSEF de l'orientation du corpus, on agrège tout ce qu'on trouve et on fait avec.
Accepter d'utiliser un corpus loin d'être neutre avec plein de défauts connus n'est pas ce que j'appelle faire preuve de neutralité en ne prenant pas parti.
C'est prendre le parti pour une situation présente ou passée, cela reste un choix discutable.
C'est d'autant plus dommageable que beaucoup considèrent ces LLM comme des outils parfaits, ne pouvant se tromper car après tout ce sont des machines. S'ils gardent les mêmes biais que les humains cela va renforcer la société dans cette direction. Ce n'est pas très responsable.
Ce que tu suggère s’appelle l'alignement et c'est tout sauf neutre, c'est précisément là où se trouve le biais qui conditionne l'orientation du llm.
Perso je part du principe que la neutralité n'existe pas vraiment dans ce dossier. C'est un objectif vain. La question est de déterminer des éléments à supprimer pour améliorer le résultat global en apprenant de nos erreurs passés. Je trouve très bien qu'il y ait des efforts pour éviter que ces outils ne recrachent des propos nazis facilement (même si c'est imparfait). Pourquoi ne pas faire de même dans d'autres contextes qu'on sait tout aussi problématique ?
Donc on peut appeler ça comme on veut, mais c'est pas un biais, c'est la réalité (encore une fois la novlangue).
C'est un biais car on part du principe que la situation actuelle est une sorte de fatalité. Sauf que la situation actuelle vient de processus documentés et anciens et qu'il faut mettre beaucoup d'effort pour rétablir la situation à une situation convenable.
Ne pas tenir compte du contexte de ces données c'est considérer qu'il n'y a aucun problème et rien à faire ce qui n'est pas très réaliste.
Par ailleurs d'un point de vu strictement pratique, les gens cherchent des boulots suivant leurs qualifications et envies, donc si on considère que de nombreux métiers soient genrés est un problème, il faut s'attaquer à toute la population, femmes comprises, qui semble préférer -entre autre- les métiers sociaux aux métiers manuels.
Le but d'un conseiller d'orientation c'est de se baser sur des compétences et envies, oui. Mais cela va au delà de ça.
L'objectif est que très souvent les demandeurs d'emplois n'ont qu'une vision parcellaire des emplois existants et des possibilités. Sans compter les préjugés existants pour certaines professions. En fait de manière générale à part quelques métiers courants on en connaît relativement peu et la vision qu'on en a de l'extérieur est souvent mauvaise.
Ce n'est pas pour rien que depuis quelques années beaucoup de secteurs d'activité, d'entreprises et autres font des portes ouvertes ou des vidéos promotionnelles pour élargir la vision des gens de ces métiers afin de gagner en visibilité pour avoir plus de candidats.
Et c'est l'objectif du conseiller d'orientation de faciliter le travail. Il est censé avoir une meilleure vision des emplois disponibles et des critères réels. Du coup il est normal qu'un conseiller d'orientation puisse soumettre à une femme un métier assez masculin car il n'y a rien qui ne justifie ce fait : le but est de casser l'image du métier et de proposer un emploi que la candidate n'aurait jamais envisagé d'elle même.
Si l'IA conseiller d'orientation reproduit les mêmes biais de notre société avec des images clichées en tête, il ne fera pas bien son travail et ne fera que de reproduire la situation existante.
Encore une fois, ouvrir le code permettrait de couper court aux polémiques.
Pas que le code, il faut les données et l'analyse de ces données !
Un LLM sans les données d'entrainement c'est une boîte noire, même avec le code et l'ensemble des facteurs qui la composent.
Je doute que les personne qui ont déployés cette IA aient un quelconque rapport avec des conseillers d'orientation, c'est plus probablement un sous-traitant.
Et c'est je pense dans ce cas une erreur de toute façon, faut toujours s'aider des gens du métier pour comprendre les données disponibles, dont leurs limites, et les exploiter au mieux.
Car avec des données publiques mal comprises ou mal contextualisées on peut en conclure des conneries.
Et je doute d'ailleurs qu'il y ait une volonté de nuire à quiconque.
Tu mélanges tout.
Je ne dis pas qu'il y a volonté de nuire. Je dis qu'il y a négligence. Un peu comme tu le fais en mode "le monde est comme ça, je prends les données sans me poser de question et je crache des résultats, ça semble marcher donc je suis content". Il y a une responsabilité derrière ces outils, après tout il y a des implications et si on ne cherche pas à faire au mieux on va devant de gros problèmes.
Note que c'est d'ailleurs pareil avec d'autres outils avec des impacts plus concrets. Par exemple il y a un intérêt croissant pour utiliser des LLM dans un usage médical pour le diagnostic. Pourtant les limites sont analysées et existent, malgré le fait que ces données soient factuelles :
Erreur de saisie ou de catégorisation des données ;
Usage de données anciennes avec des appareils ou analyses différents de ceux d'aujourd'hui ;
Évolution de la population qui est plus vieille et avec plus de pathologies chroniques multiples ce qui a des incidences notables ;
Évolution de la médecine qui a aussi amélioré le suivi, la prise en charge et le rétablissement des malades, certaines maladies ou stade de maladies sont plus rares qu'avant de fait ;
Apparitions de nouvelles maladies ou de complications nouvelles ;
Etc.
Tout cela justifie le fait de faire attention, à ne pas prendre les résultats sortis pour argent comptant, que ces données ne sont pas "neutres" car il y a de nombreux biais dedans et qu'il faut justement une collaboration entre médecin et développeurs ou analystes pour tenir compte de tout cela. Sinon le résultat sera mauvais.
[^] # Re: Pas convaincu
Posté par Renault (site web personnel) . En réponse au lien « Aux femmes la cuisine, aux hommes l’informatique » : le sexisme des IA (encore) prouvé. Évalué à 6.
Accepter d'utiliser un corpus loin d'être neutre avec plein de défauts connus n'est pas ce que j'appelle faire preuve de neutralité en ne prenant pas parti.
C'est prendre le parti pour une situation présente ou passée, cela reste un choix discutable.
C'est d'autant plus dommageable que beaucoup considèrent ces LLM comme des outils parfaits, ne pouvant se tromper car après tout ce sont des machines. S'ils gardent les mêmes biais que les humains cela va renforcer la société dans cette direction. Ce n'est pas très responsable.
Perso je part du principe que la neutralité n'existe pas vraiment dans ce dossier. C'est un objectif vain. La question est de déterminer des éléments à supprimer pour améliorer le résultat global en apprenant de nos erreurs passés. Je trouve très bien qu'il y ait des efforts pour éviter que ces outils ne recrachent des propos nazis facilement (même si c'est imparfait). Pourquoi ne pas faire de même dans d'autres contextes qu'on sait tout aussi problématique ?
C'est un biais car on part du principe que la situation actuelle est une sorte de fatalité. Sauf que la situation actuelle vient de processus documentés et anciens et qu'il faut mettre beaucoup d'effort pour rétablir la situation à une situation convenable.
Ne pas tenir compte du contexte de ces données c'est considérer qu'il n'y a aucun problème et rien à faire ce qui n'est pas très réaliste.
Le but d'un conseiller d'orientation c'est de se baser sur des compétences et envies, oui. Mais cela va au delà de ça.
L'objectif est que très souvent les demandeurs d'emplois n'ont qu'une vision parcellaire des emplois existants et des possibilités. Sans compter les préjugés existants pour certaines professions. En fait de manière générale à part quelques métiers courants on en connaît relativement peu et la vision qu'on en a de l'extérieur est souvent mauvaise.
Ce n'est pas pour rien que depuis quelques années beaucoup de secteurs d'activité, d'entreprises et autres font des portes ouvertes ou des vidéos promotionnelles pour élargir la vision des gens de ces métiers afin de gagner en visibilité pour avoir plus de candidats.
Et c'est l'objectif du conseiller d'orientation de faciliter le travail. Il est censé avoir une meilleure vision des emplois disponibles et des critères réels. Du coup il est normal qu'un conseiller d'orientation puisse soumettre à une femme un métier assez masculin car il n'y a rien qui ne justifie ce fait : le but est de casser l'image du métier et de proposer un emploi que la candidate n'aurait jamais envisagé d'elle même.
Si l'IA conseiller d'orientation reproduit les mêmes biais de notre société avec des images clichées en tête, il ne fera pas bien son travail et ne fera que de reproduire la situation existante.
Pas que le code, il faut les données et l'analyse de ces données !
Un LLM sans les données d'entrainement c'est une boîte noire, même avec le code et l'ensemble des facteurs qui la composent.
Et c'est je pense dans ce cas une erreur de toute façon, faut toujours s'aider des gens du métier pour comprendre les données disponibles, dont leurs limites, et les exploiter au mieux.
Car avec des données publiques mal comprises ou mal contextualisées on peut en conclure des conneries.
Tu mélanges tout.
Je ne dis pas qu'il y a volonté de nuire. Je dis qu'il y a négligence. Un peu comme tu le fais en mode "le monde est comme ça, je prends les données sans me poser de question et je crache des résultats, ça semble marcher donc je suis content". Il y a une responsabilité derrière ces outils, après tout il y a des implications et si on ne cherche pas à faire au mieux on va devant de gros problèmes.
Note que c'est d'ailleurs pareil avec d'autres outils avec des impacts plus concrets. Par exemple il y a un intérêt croissant pour utiliser des LLM dans un usage médical pour le diagnostic. Pourtant les limites sont analysées et existent, malgré le fait que ces données soient factuelles :
Tout cela justifie le fait de faire attention, à ne pas prendre les résultats sortis pour argent comptant, que ces données ne sont pas "neutres" car il y a de nombreux biais dedans et qu'il faut justement une collaboration entre médecin et développeurs ou analystes pour tenir compte de tout cela. Sinon le résultat sera mauvais.
Et c'est valable pour tout domaine.