Le biais / la neutralité d'une technologie. Son aspect ouvert/open-source/libre. Son utilité par rapport à sa consommation de ressource.
Pour faire du sous-titrage automatisé en français aujourd'hui, librement utilisable, il y a vosk/kaldi et maintenant Whisper (avec plein de variantes).
Les deux sont "openweight" dans le sens que les modèles sont libre d'être modifié. Il y a des variantes de Whisper "distillé" pour mieux fonctionner sur le français par exemple. A l'opposé des modèles de Google ou Microsoft dont on ne connaît rien.
Par contre on ne sait pas comment Whisper a été entraîné, ni sur quel données (bien que l'on se doute qu'OpenAI a scrappé youtube). Pour les modèles Kaldi, on a un peu plus idée sur quelles données ça a été entraîné (pas sur que toute les données soit libre, et que ce soit reproductible néanmoins).
Concernant les biais, d'un coté Kaldi retranscrit texto le son en phonème puis les phonèmes en mot. De l'autre whisper c'est plus une boite noir qui a été entraîné pour sous-titré des vidéos, donc il va retranscrire les onomatopé, il va sauter certains mots qui ne se disent qu'à l'oral mais pas à l'écrit, voir parfois halluciner et faire n'importe quoi (afficher du texte entre crochet aux moments des silence).
A la fin, Whisper transcrit mieux que kaldi, en échange d'un puissance de calcul décuplé (kaldi peux tourner sur une rasperry pi en direct, les modèles "normaux" de whisper il vaut mieux une carte graphique récente pour transcrire en direct).
Du coup, mitigé à propos du sous-titrage dans VLC, à la fois je suis ravi que tout un chacun puisse profiter de cette technologie qui fonctionne agréablement bien. Mais n'aurait il pas fallu attendre qu'un vrai modèle libre de Speech-to-text moderne voie le jour ?
# Un ptit ajout à propos du sous-titrage dans VLC
Posté par Titi . En réponse au journal L'IA est-elle compatible avec le Libre ?. Évalué à 0.
Journal intéressant !
Ca soulève plusieurs questionnement...
Le biais / la neutralité d'une technologie. Son aspect ouvert/open-source/libre. Son utilité par rapport à sa consommation de ressource.
Pour faire du sous-titrage automatisé en français aujourd'hui, librement utilisable, il y a vosk/kaldi et maintenant Whisper (avec plein de variantes).
Les deux sont "openweight" dans le sens que les modèles sont libre d'être modifié. Il y a des variantes de Whisper "distillé" pour mieux fonctionner sur le français par exemple. A l'opposé des modèles de Google ou Microsoft dont on ne connaît rien.
Par contre on ne sait pas comment Whisper a été entraîné, ni sur quel données (bien que l'on se doute qu'OpenAI a scrappé youtube). Pour les modèles Kaldi, on a un peu plus idée sur quelles données ça a été entraîné (pas sur que toute les données soit libre, et que ce soit reproductible néanmoins).
Concernant les biais, d'un coté Kaldi retranscrit texto le son en phonème puis les phonèmes en mot. De l'autre whisper c'est plus une boite noir qui a été entraîné pour sous-titré des vidéos, donc il va retranscrire les onomatopé, il va sauter certains mots qui ne se disent qu'à l'oral mais pas à l'écrit, voir parfois halluciner et faire n'importe quoi (afficher du texte entre crochet aux moments des silence).
A la fin, Whisper transcrit mieux que kaldi, en échange d'un puissance de calcul décuplé (kaldi peux tourner sur une rasperry pi en direct, les modèles "normaux" de whisper il vaut mieux une carte graphique récente pour transcrire en direct).
Du coup, mitigé à propos du sous-titrage dans VLC, à la fois je suis ravi que tout un chacun puisse profiter de cette technologie qui fonctionne agréablement bien. Mais n'aurait il pas fallu attendre qu'un vrai modèle libre de Speech-to-text moderne voie le jour ?