L'analyse basique faite ici était surement la première chose à faire (jusqu'à la ligne 11).
Je rajouterais: est-ce qu'utiliser des random forest ou autre est vraiment utile ici ?
Une rapide analyse des données montre qu'il y a une corrélation linéaire uniquement entre km et price... L'année, qu'on pourrait penser comme importante, ne semble pas primordiale (hormis pour les très vieux, ou les très récents).
Cette corrélation peut être corrigée à la marge en fonction de l'année, de la provenance (particulier vs pro) ou du département. Ici, une régression linéaire ultra-basique en km et price suffit amplement, surtout vu le nombre de données. Régression qu'on peut affiner à la main ou pas selon l'année, la provenance ou le département. Se lancer ne serait-ce que dans une régression linéaire multiple me semble inutile ici. Parfois, rester simple a du bon.
[^] # Re: Bon exemple jouet
Posté par zerbro81 . En réponse au journal machine learning - expérimentation foireuse. Évalué à 1.
L'analyse basique faite ici était surement la première chose à faire (jusqu'à la ligne 11).
Je rajouterais: est-ce qu'utiliser des random forest ou autre est vraiment utile ici ?
Une rapide analyse des données montre qu'il y a une corrélation linéaire uniquement entre km et price... L'année, qu'on pourrait penser comme importante, ne semble pas primordiale (hormis pour les très vieux, ou les très récents).
Cette corrélation peut être corrigée à la marge en fonction de l'année, de la provenance (particulier vs pro) ou du département. Ici, une régression linéaire ultra-basique en km et price suffit amplement, surtout vu le nombre de données. Régression qu'on peut affiner à la main ou pas selon l'année, la provenance ou le département. Se lancer ne serait-ce que dans une régression linéaire multiple me semble inutile ici. Parfois, rester simple a du bon.