Si c'est par mot clef ce n'est pas du RAG, le RAG nécessite par définition une recherche sémantique via des embeddings.
Mais le doc peut être du récupéré par un moteur "classique" question index et un agent qui vient récupérer le doc complet.
Tu veut dire ne stocker que des couples embeddings/url ? Ça me paraît bien con. Tu paie le coût réseau, ça induit toute une classe de problème si l'URL n'est plus valide ou si elle t'injecte maintenant un payload au mieux non pertinent au pire hostile. Au moment où tu te rend compte du problème, tu dois refaire une recherche dans ton vector store pour aller chercher les résultats suivants et tu va vouloir invalider globalement ces entrées. Les index n'aiment pas particulièrement les update random...
Ça voudrait dire que tu as peu d'IP a bloquer pour supprimer le trafic, là où ce qu'on voit c'est bien plus d'IP ce qui me paraît plus aller vers des requêtes faites par les utilisateurs.
[^] # Re: combien de bots ?
Posté par barmic 🦦 . En réponse au journal Bloquer les bots avec Nginx de façon simple avec Nginx botcheck. Évalué à 2 (+0/-0).
Si c'est par mot clef ce n'est pas du RAG, le RAG nécessite par définition une recherche sémantique via des embeddings.
Tu veut dire ne stocker que des couples embeddings/url ? Ça me paraît bien con. Tu paie le coût réseau, ça induit toute une classe de problème si l'URL n'est plus valide ou si elle t'injecte maintenant un payload au mieux non pertinent au pire hostile. Au moment où tu te rend compte du problème, tu dois refaire une recherche dans ton vector store pour aller chercher les résultats suivants et tu va vouloir invalider globalement ces entrées. Les index n'aiment pas particulièrement les update random...
Ça voudrait dire que tu as peu d'IP a bloquer pour supprimer le trafic, là où ce qu'on voit c'est bien plus d'IP ce qui me paraît plus aller vers des requêtes faites par les utilisateurs.
https://linuxfr.org/users/barmic/journaux/y-en-a-marre-de-ce-gros-troll