• [^] # Re: robot.txt

    Posté par (site web personnel) . En réponse au lien Drew Devault : Please stop externalizing your costs directly into my face . Évalué à 4.

    Les robots d'IA ne sont pas lancés au hasard sur les serveurs. Elles ciblent des types de contenus

    Je suis pas sur de voir en quoi ton affirmation sans substance serait plus juste que celle que tu récuses.

    Pour commencer, tu supposes que des robots indexent Sourcehut (et d'autres) pour avoir du code. Dans ce cas, pourquoi passer par https et pas via simplement git, qui a le bon goût d'être plus facile pour tout le monde ? Plus facile pour l’hébergeur car pas besoin de parser les infos de git pour afficher de la page, plus facile pour les scrapers, car pas besoin de nettoyer la page. Pas besoin de reconstituer le code via la structure ni rien.

    Et on sait que ça passe par https, car l'article dit: "If you think these crawlers respect robots.txt then you are several assumptions of good faith removed from reality".

    Mais ça illustre aussi un des soucis des discussions en cours, c'est que personne ne parle vraiment de la chaîne de production exacte, et on mets tout dans un gros nuage "IA" comme dans les diagrammes réseaux.

    En l’occurrence, si tu veux entraîner une IA générative, il te faut du contenu pour pondre les stats (aka, le modèle). Il y a assez peu d'acteurs qui ont les thunes pour ça, vu que ça coûte super cher. Il y a beaucoup plus d'acteurs qui vont prendre des modèles existants et faire des produits autour, et c'est sans doute pas ces acteurs qui scrapent quoi que ce soit.

    Mais il y a aussi un 3eme groupe, les gens qui vendent des données (avec ou sans le tagging qui va bien, un point aussi oublié) au groupe des gens qui entraînent des modéles. Et pour moi, c'est ce groupe qui contient les gens qui scrapent. De ce qu'on voit discuté ici ou la, c'est des bots qui sont au pire malicieux (pas de respect du robot.txt), au mieux codé n'importe comment. On voit que les bots mentent parfois sur le useragent (mais pas tous), qu'ils passent par des cloud providers pour avoir des IPs en masse (donc ALibaba, GCP, AWS, Azure, etc), voir par des connexions résidentiels. C'est ce qui est dit dans l'article de Drew.

    Fondamentalement, ce que je vais supposer, c'est qu'il ne s'agit pas des gros acteurs du style Google ou Microsoft. Les 2 ont des moteurs de recherches (Bing, Google Search) donc des données et des compétences en interne sur le sujet, voir une forge bien rempli (github) si on reste sur la question du code. Il n'y a sans doute pas la liberté institutionnel de faire n'importe quoi à grande échelle sans revue. Ensuite, il y a d'autres gros, comme AWS qui ne se préoccupe beaucoup des questions éthiques, mais je ne voit pas non plus la boite passé par des connexions résidentielles (cad des machines sans doute piratés), ne serait que parce que c'est pas gratuit, et ça laisse des traces.

    Du coup, si c'est pas les gros acteurs, il reste qui dans le domaine économique ? Les beaucoup moins gros (en taille). Les petites startup qui veulent faire du pognon rapidement, les groupes criminels mais pas trop qui vendent le fait de spammer les gens, qui font des escroqueries téléphoniques via des centres d'appel ou ils ferment les yeux. Et je mets OpenAI dans le lot aussi en tant que start-up (au niveau de la structure, pas du financement)

    Il y a quand même beaucoup qui colle. Dans ce genre de "petite boite", tu va avoir du code écrit sans supervision, parce que c'est une petite boite. Tu va avoir des gens avec un esprit de magouilleur pour gagner un peu de thunes (d’où les changements d'IP, d'user agent, etc). Le code va être pourri car un ingé senior va pas forcement vouloir aller la bas. Et bien sur, sans doute la même relativité éthique que le reste. Il y a suffisamment de pays économiquement dans la merde pour que ça arrive.

    Et on le voit, c'est pas le discours qu'on a, car implicitement, on blâme les GAFAMs/Big Tech. Bien sur, ce discours n'est pas arrivé par hasard, car ce sont les dites GAFAMs qui font des annonces et occupent médiatiquement le champ, et voir pour Mata, qui se prennent des procés. C'est aussi des entités connus, qu'on peut facilement blâmer pour ce qui va pas.

    Mais le fait de ne pas penser ces scrapers comme des entités qui commettent un crime fait que personne ne semble se poser la question d'impliquer la justice (ou alors, ne va pas suffisamment loin dans l'idée, cf ce thread).

    Une fois que tu commences à traiter ça comme un DDoS, et pas comme une façon de venir chouiner sur un bout de l'industrie comme Drew Devault ou Niccolò Venerandi, alors je pense que ça peut avancer.

    Ce n'est pas qu'une histoire de compétences en gestion de serveur, on ne peut pas accepter que le traffic soit multiplié 2 ou par 10 (ma copine) à cause des IA, la bande passante n'est pas gratuite.

    Mais en l’occurrence, le souci évoqué dans l'article n'est pas la bande passante, mais le temps d'admin sys (explicitement) et le CPU (implicitement). Et je ne peux pas parler pour Sourcehut, mais dans le cas de Pagure et du Gitlab de GNOME (jusqu'à son déplacement sur AWs) qui sont cité dans un autre article, la bande passante n'était sans doute pas le souci. Si c'était le cas, je l'aurais sans doute su car quand la bande passante du DC ou sont les 2 services est saturé, j'ai assez vite des alertes car mes machines sont aussi dans le même DC et comme je suis sur le papier responsable technique de ce bout de DC, j'ai aussi des gens qui me contactent plus vite que Nagios.

    Ce qui coinçait pour Pagure (vu que j'ai discuté avec les autres admins), c’était l'usage CPU, à savoir que les bots indexent des pages extrêmement coûteuses à générer coté serveur, et que du coup, le serveur ne peut plus faire son taf. Car quand les services sont pas en carafe ou lent, on va pas se mentir, on regarde quand même assez peu.

    C'est aussi ce que je comprends de Sourcehut, car l'article dit: "These bots crawl everything they can find, robots.txt be damned, including expensive endpoints like git blame, every page of every git log, and every commit in every repo".

    Que la BP soit un souci pour d'autres, j'en doute pas, c'est documenté. Par exemple, la BP a été mentionné pour Readthedocs dans l'article de libre.news de Niccolò Venerandi, (même si mais ce dernier a aussi clairement fait du remplissage vu qu'il ressort aussi le lien vers le blog de Daniel, et j'ai déjà dit ce que j'en pense).

    L'article de Libre.news pointe aussi que RTD (ReadTheDocs) a réussi en contactant une entreprise responsable à avoir une correction et vise un remboursement, chose qui n'est également jamais discuté et qui pourtant semble marcher, ce qui me renforce dans mon analyse, des gens veulent râler avant tout.