Si, ça a potentiellement à voir. Je ne pense pas que ça soit un filtre bayésien, sans doute plus un modèle statistique genre regression logistique (plus stable, permet d'intégrer des variables différentes…). Mais je suis convaincu qu'il s'agit de machine learning et de classification supervisée.
Le principe général est d'avoir des exemples, de la forme
"Dans tel cas il s'est passé ça"
Ensuite on dérive de ça un modèle qui nous dit "dans tel cas, il est probable qu'il se passe ça".
Une grosse partie du travail est de décrire justement un cas. Pour un spam/non spam c'est presque facile, on fait la description par la liste des mots. Pour prédire le prix d'une maison, la description des cas peut inclure la taille de la maison, le nombre de fenêtre, le quartier…
La performance de tels système dépend énormément de ces caractéristiques (des features ou variables dans le jargon) et d'expérience, la qualité de ces features est souvent très peu intuitive. Les systèmes de classification automatique ne font rien de magiques et effectivement tu arriverais potentiellement à intuiter leurs résultats. Après, étant donné certaines informations, ils le font en général de manière bien plus précise et objective qu'un humain qui va soit plaquer son intuition sur des données qui ne la vérifie pas, soit avoir énormément de mal à imaginer les relations entre les données.
La question qu'on peut se poser est alors quelles seraient les features qu'ils utilisent pour prédire le crime. On peut imaginer l'heure, le taux de lumière, le quartier, le nombre de personne sur les caméras, le nombre ou le type de crimes/délits rapportés dans une durée précédente, la météo, le score de l'équipe locale au dernier match…. Intuitivement, je dirais que leur taux d'erreurs doit être assez énorme (contrairement par exemple à un classifieur de texte entre anglais/francais ou spam/non spam qui va sans doute atteindre un taux de succès proche de 100%). Leur objectif n'est pas le même, la décision finale étant de toute façon filtrée ensuite par policier puis procureur puis juge….
Concernant le fait que le modèle va influencer la suite, c'est vrai. Mais contrairement à une politique, le modèle se recalcule sans doute en quelques minutes avec les nouvelles données et peut donc s'adapter encore plus vite.
[^] # Re: rha
Posté par Fulgrim . En réponse au journal Le logiciel qui prédit les délits. Évalué à 4.
Si, ça a potentiellement à voir. Je ne pense pas que ça soit un filtre bayésien, sans doute plus un modèle statistique genre regression logistique (plus stable, permet d'intégrer des variables différentes…). Mais je suis convaincu qu'il s'agit de machine learning et de classification supervisée.
Le principe général est d'avoir des exemples, de la forme
"Dans tel cas il s'est passé ça"
Ensuite on dérive de ça un modèle qui nous dit "dans tel cas, il est probable qu'il se passe ça".
Une grosse partie du travail est de décrire justement un cas. Pour un spam/non spam c'est presque facile, on fait la description par la liste des mots. Pour prédire le prix d'une maison, la description des cas peut inclure la taille de la maison, le nombre de fenêtre, le quartier…
La performance de tels système dépend énormément de ces caractéristiques (des features ou variables dans le jargon) et d'expérience, la qualité de ces features est souvent très peu intuitive. Les systèmes de classification automatique ne font rien de magiques et effectivement tu arriverais potentiellement à intuiter leurs résultats. Après, étant donné certaines informations, ils le font en général de manière bien plus précise et objective qu'un humain qui va soit plaquer son intuition sur des données qui ne la vérifie pas, soit avoir énormément de mal à imaginer les relations entre les données.
La question qu'on peut se poser est alors quelles seraient les features qu'ils utilisent pour prédire le crime. On peut imaginer l'heure, le taux de lumière, le quartier, le nombre de personne sur les caméras, le nombre ou le type de crimes/délits rapportés dans une durée précédente, la météo, le score de l'équipe locale au dernier match…. Intuitivement, je dirais que leur taux d'erreurs doit être assez énorme (contrairement par exemple à un classifieur de texte entre anglais/francais ou spam/non spam qui va sans doute atteindre un taux de succès proche de 100%). Leur objectif n'est pas le même, la décision finale étant de toute façon filtrée ensuite par policier puis procureur puis juge….
Concernant le fait que le modèle va influencer la suite, c'est vrai. Mais contrairement à une politique, le modèle se recalcule sans doute en quelques minutes avec les nouvelles données et peut donc s'adapter encore plus vite.