Ca me semble assez simple (bon en meme temps j'ai fait ma these de doctorat sur le sujet donc ca aide...):
* Ils utilisent les mots clefs comme Google image
* En plus, ils calculent l'histogramme (probablement HSV) de l'image, et mappent ca sur une discretisation de l'espace de couleur (c'est-a-dire qu'ils determinent ce que "black", "blue", "red" signifient)
Au final, leurs images sont annotees avec des mots-clefs mais aussi avec des couleurs. C'est tres basique.
La ou ca pose probleme, c'est qu'ils laissent entendre qu'on peut chercher "red flower" pour trouver une fleur rouge, mais on cherche en fait une photo qui a du rouge ET une fleur. Que ce soit la fleur qui est rouge ou pas, on en sait rien.
Bon, il faut reconnaitre que savoir trouver "chien blanc" sans qu'un humain aie explicitement annote la photo avec ca releverait du miracle, parce qu'il faudrait reussir a identifier automatiquement quelle partie de la photo est un chien.
Trouver automatiquement ce genre d'information dans une photo marche pour une base de donnees specialisee : si tu veux faire une base de donnees de photos de chiens, tu peux ecrire des algos qui reconnaissent un chien par la forme et la texture. Mais dans une base de donnees generaliste, ne serait-ce que segmenter l'image en objets du monde reel est tres complique, car necessite une connaissance globale du monde.
Le plus deprimant la dedans, c'est que dans les annees 90 beaucoup de chercheurs affirmaient qu'annoter manuellement une base de donnees d'images demandait trop de travail et que personne ne le ferait, mais Flickr et consorts ont prouve l'inverse.
[^] # Re: Comment ça marche?
Posté par Erwan . En réponse au journal Une recherche d'image avec un peu de sémantique. Évalué à 1.
* Ils utilisent les mots clefs comme Google image
* En plus, ils calculent l'histogramme (probablement HSV) de l'image, et mappent ca sur une discretisation de l'espace de couleur (c'est-a-dire qu'ils determinent ce que "black", "blue", "red" signifient)
Au final, leurs images sont annotees avec des mots-clefs mais aussi avec des couleurs. C'est tres basique.
La ou ca pose probleme, c'est qu'ils laissent entendre qu'on peut chercher "red flower" pour trouver une fleur rouge, mais on cherche en fait une photo qui a du rouge ET une fleur. Que ce soit la fleur qui est rouge ou pas, on en sait rien.
Exemple: j'ai cherche "white dog" et voila ce que je trouve:
http://www.feelimage.net/photo/ImageDetail.asp?fi=1494255
http://www.feelimage.net/photo/ImageDetail.asp?fi=2809231
http://www.feelimage.net/photo/ImageDetail.asp?fi=436298
Du blanc, un chien... Mais pas un chien blanc.
Bon, il faut reconnaitre que savoir trouver "chien blanc" sans qu'un humain aie explicitement annote la photo avec ca releverait du miracle, parce qu'il faudrait reussir a identifier automatiquement quelle partie de la photo est un chien.
Trouver automatiquement ce genre d'information dans une photo marche pour une base de donnees specialisee : si tu veux faire une base de donnees de photos de chiens, tu peux ecrire des algos qui reconnaissent un chien par la forme et la texture. Mais dans une base de donnees generaliste, ne serait-ce que segmenter l'image en objets du monde reel est tres complique, car necessite une connaissance globale du monde.
Le plus deprimant la dedans, c'est que dans les annees 90 beaucoup de chercheurs affirmaient qu'annoter manuellement une base de donnees d'images demandait trop de travail et que personne ne le ferait, mais Flickr et consorts ont prouve l'inverse.