• [^] # Re: Bis repetita ;)

    Posté par . En réponse au journal Des virus, des hommes, et de la dynamique.. Évalué à 7.

    Pour compléter cette réponse, je vais formuler les choses différement.

    Tout d'abord du point de vue technique, le système d'équation n'est pas linéaire à cause du B\times I, ça n'a l'air de rien mais c'est toute la complexité du problème, et c'est ce qui induit le comportement du modèle.

    Ensuite sur le fond, beaucoup de méthodes en machine learning supposent un modèle qui est générique, et qui ne sera appris que via des données, un grand nombre, et avec des variables explicatives (autrement nommées covariables). Pour résumer la connaissance du phénomène est apportée par la donnée et non pas par le modèle.

    Une approche de modélisation, qu'elle soit par une modélisation déterministe type système dynamique (avec des modèles de type SIR par exemple) ou statistique (avec des extensions stochastiques du modèle SIR par exemple) reposent sur une autre approche, la connaissance est apportée dans le modèle, et non via les données.

    Des modèles que je manipule pour ma part son des modèles de croissance de plante et de modèlisation de couverts en agronomie, les agronomes mettent toute la connaissance qu'ils ont dans la croissance de la plante dans le modèle, et l'utilisation de ces modèles permet de comprendre les phénomènes impliqués.

    Un aspect très important est de comprendre pourquoi on fait une modèlisation, l'objectif est-il de:

    1. résumer, synthétiser, représenter un ensemble de données,
    2. comprendre les phénomènes impliqués,
    3. prédire des valeurs non observées, dans ce cas nous avons deux questions classiques:
      1. dans les gammes des valeurs observées, nous parlons d'interpolation,
      2. hors les gammes des valeurs observées, nous parlons d'extrapolation.

    Les méthodes de machine learning sont excellentes dans le 1, et dans le 3.1. Quand je dis excellente, je pèse mes mots. Les résultats sont bluffant sur des problèmes complexes en grande dimension comme on le voit en analyse d'image avec les méthodes de deep learning.

    Les méthodes plus orientées modèlisation sont pertinente dans le cas 1, 2, et 3.1 et 3.2. Elles ont souvent de moins bonnes performances dans les cas d'interpolation, mais leur performances ne s'effondrent pas en extrapolation.

    De manière générale, en prédiction d'extrapolation, les méthodes fondées sur des modèles sont d'autant plus pertinente que le modèle est simple.

    J'ai un peu caricaturé la situation, en effet certaines méthodes sont entre les deux, comme les méthodes à noyau où une connaissance du phénomène peut être utilisée dans la construction d'un noyau, et ça rentre dans le machine learning.

    Ici, l'objectif des modèles SIR sont ses capacités extrapolatrices, et le fait que nous voulons comprendre le phénomène pour savoir sur quoi agir. (Et mon objectif personnel n'était que de faire comprendre le phénomène).