• # GIGO

    Posté par . En réponse au journal machine learning - expérimentation foireuse. Évalué à 10. Dernière modification le 07 mars 2019 à 09:17.

    Tu viens d'expérimenter le principe du GIGO : Garbage in, Garbage out. Tes données sont de très mauvaise qualité, puisqu'elles sont bruitées et biaisées par rapport au prix de vente. Ton modèle ne peut donc te donner théoriquement que le prix à mettre sur l'annonce pour être dans la moyenne, et pas le prix que tu peux espérer tirer de ton véhicule.

    Ensuite, le machine learning pour ce genre de trucs, c'est de la blague. Tu fais une régression multivariée, tu regardes éventuellement le fit pour vérifier si tu n'as pas besoin de termes quadratiques (mais avec si peu de données, c'est peu probable que tu voies quelque chose), et hop, c'est bon.

    Enfin, regarder l'erreur moyenne (le r2) seule ne te dit pas grand chose, parce qu'un bon ajustement peut être attribuable à de l'overfitting (si tu mets 200 variables dans ta régression, tu vas pouvoir prédire parfaitement tes données). Si tu ne veux pas utiliser d'outils statistiques traditionnels (style sélection de modèles), tu peux toujours faire de la validation croisée (fitter le modèle sur par ex. 90% de tes données, et estimer l'erreur sur les 10% restants). En général, c'est très déprimant.