Il y a plein de façons d'évaluer le résultat, et l'erreur moyenne n'est pas forcément le meilleur. La variance ajoute une courbure à l'erreur moyenne en pénalisant les fortes erreurs par rapport aux faibles, c'est peut-être plus intéressant?
Le prix de vente n'est clairement pas fonction de ces trois paramètres: si Alice
et Robert (enlève ton masque Bob, on t'a reconnu!) ont acheté la même voiture la même année au même prix et roulé le même nombre de kilomètres, il n'y pas de raison qu'ils souhaitent
la vendre au même prix. Si cela arrive dans te données, tu demandes de deviner une fonction "qui n'existe pas" dans tes données initiales, du coup ça a peu de chances de marcher. Pour t'en sortir tu as trois pistes: "lisser les données en moyennant les points proches" – définir une notion d'exception qui te permet de jarter ou pénaliser les points gênants – et finalement changer (raffiner...) la variable que tu veux modéliser. Mais bon ce qui est sûr, c'est que le problème n'est pas très bien conditionné.
(Un exemple de raffinement – que je préfère à prendre des moyennes – serait d'estimer de le "min" ou le "max" sur des points proches par exemple.)
Il faut vérifier que la date soit comprise contre une variable continue – car on y pense comme à l'âge – une erreur banale est de l'utiliser comme une variable classifiante (comme rouge, vert, bleu par exemple) ce qui fragmente l'échantillon.
Il y a une phase d'analyse des corrélations (où on parle des facteurs explicatifs qui permettent de reconstruire les corrélations). Est-ce que cela démontre une corrélation du prix de vente au prix de mise sur le marché par exemple?
Ta question de variables à ajouter est très pertinente, est-ce que par exemple la cote ARGUS mérite d'être dans le jeu de données?
soit il n'y a pas de corrélation entre mes features
Si tu utilises un paquet d'apprentissage automatique il y a certainement une petite analyse toute prête qui traîne quelque part qui te dira ça.
# Quelques améliorations possibles?
Posté par Michaël (site web personnel) . En réponse au journal machine learning - expérimentation foireuse. Évalué à 6.
Il y a plein de façons d'évaluer le résultat, et l'erreur moyenne n'est pas forcément le meilleur. La variance ajoute une courbure à l'erreur moyenne en pénalisant les fortes erreurs par rapport aux faibles, c'est peut-être plus intéressant?
Le prix de vente n'est clairement pas fonction de ces trois paramètres: si Alice
et Robert (enlève ton masque Bob, on t'a reconnu!) ont acheté la même voiture la même année au même prix et roulé le même nombre de kilomètres, il n'y pas de raison qu'ils souhaitent
la vendre au même prix. Si cela arrive dans te données, tu demandes de deviner une fonction "qui n'existe pas" dans tes données initiales, du coup ça a peu de chances de marcher. Pour t'en sortir tu as trois pistes: "lisser les données en moyennant les points proches" – définir une notion d'exception qui te permet de jarter ou pénaliser les points gênants – et finalement changer (raffiner...) la variable que tu veux modéliser. Mais bon ce qui est sûr, c'est que le problème n'est pas très bien conditionné.
(Un exemple de raffinement – que je préfère à prendre des moyennes – serait d'estimer de le "min" ou le "max" sur des points proches par exemple.)
Il faut vérifier que la date soit comprise contre une variable continue – car on y pense comme à l'âge – une erreur banale est de l'utiliser comme une variable classifiante (comme rouge, vert, bleu par exemple) ce qui fragmente l'échantillon.
Il y a une phase d'analyse des corrélations (où on parle des facteurs explicatifs qui permettent de reconstruire les corrélations). Est-ce que cela démontre une corrélation du prix de vente au prix de mise sur le marché par exemple?
Ta question de variables à ajouter est très pertinente, est-ce que par exemple la cote ARGUS mérite d'être dans le jeu de données?
Si tu utilises un paquet d'apprentissage automatique il y a certainement une petite analyse toute prête qui traîne quelque part qui te dira ça.