• [^] # Re: Reload

    Posté par (site web personnel, Mastodon) . En réponse au journal Comment bannir (presque) tout internet. Évalué à 8 (+5/-0).

    On nous a longtemps dit "indexer le web pour faire un nouveau moteur de recherche, oulah, ça coûte trop cher". Sauf que c'est bien ce que les LLM ont fait pour entrainer leurs modèles, non ? Et que ces bots semblent reproduire ? Soudain ça ne semble pas un coût si difficile pour des boites assez "neuves".

    Les millions de dollars semblent pleuvoir sur ces entreprises en ce moment. Du point de vue des investissements, on se souvient peut-être de WeWork, l'entreprise qui investissait dans l'immobilier en faisant croire qu'elle était une entreprise de la tech.

    Là, c'est l'inverse: des entreprises de la tech qui arrivent à convaincre les investisseurs que leurs dépense (en construcyion de datacenters, en matériel pour entraîner les modèles, en bots pour ingurgiter toujours plus de données), ce n'est pas de la tech, c'est de l'infrastructure. Et que l'investisseur qui a mis ses sous dans l'infrastructure, il aura une rente très intéressante pour les décennies à venir, à condition d'investir dès le début.

    Bref, si un investisseurs est prêt à verser des centaines de millions ou des milliards de dollars, indexer le web, ça devient tout à fait envisageable.

    Et il y a un autre aspect: les LLM sont très bon pour une chose, c'est stocker toutes ces informations, une fois digérées, de façon très compacte (c'est de la compression avec perte, comme on sait très bien le faire pour des flux vidéo par exemple). Ce qui explique pourquoi ils viennent re-demander les données sur les serveurs originaux, encore et encore: chez eux ils ne stockent que la version digérée, compressée par le LLM. Pas l'original. Ça coûte moins cher de venir le re-chercher à chaque fois.

    Et en fait, tous les gens qui prennent un abonnement à Netflix, Spotify, Google Workspace... c'est le même principe. Internet est tellement efficace que aujourd'hui ce n'est plus rentable de stocker ses données chez soi. Et, du coup, peut-être le web victime de son succès?

    Par ailleurs, j'ai toujours un gros problème avec "oulah, ça coûte trop cher". C'est souvent un moyen de dissuader les gens de se lancer et de protéger un monopole. En termes de moteur de recherche qui essaie d'indexer le web avec peu de moyens, https://about.marginalia-search.com parle de 200 dollars par mois, avec des résultats tout à fait honorables.