>>

Soutenance de thèse : Shuji Zhao

Titre de la thèse

Catégorisation par le Contenu Sémantique d'Objets Vidéo : Recherche et Reconnaissance d'Acteurs dans les Films
Content-Based Video Semantic Object Categorization: Actor Retrieval and Recognition in Movies

Date et lieu de la soutenance

Vendredi 10 juin 2011, 10h.
Université de Cergy-Pontoise, site du Jardin Tropical, salle 217.

Résumé

Dans cette thèse, nous proposons un nouveau système de recherche par le contenu de catégories sémantiques d'objets vidéo. A partir des séquences vidéo, nous détectons et extrayons les régions contenant le même objet (visage d'une personne, un modèle de voiture, etc.) au cours d'un plan-séquence. A partir de ce volume, appelé Track, nous extrayons un ensemble de caractéristiques visuelles spatio-temporellement cohérentes qui forme ainsi un Tube Spatio-Temporel représentant l'objet. Pour évaluer la similarité entre Tubes Spatio-Temporels, nous concevons des fonctions noyaux dédiées. À partir de ces noyaux, nous proposons des stratégies d'apprentissage supervisé et interactif, intégrées dans un cadre Machine à Vecteurs de Supports. Notre approche est évaluée sur des bases de données de films réels. Elle surpasse les méthodes de l'état de l'art pour la reconnaissance d'acteurs multi-classes. Notre méthode est également testée pour la recherche interactive d'un acteur dans une base de vidéo et sur une base de données de voitures, illustrant ainsi la généricité de la méthode et ses possibles extensions à tout type d'objets vidéo.

Abstract

In this thesis, we propose a new video object retrieval and recognition system based on visual content. From video sequences, we detect, then extract video objects such as face and car, and define the continuous content made of regions containing this object in successive frames. From this volume, called Track, we extract spatio-temporally consistent visual features to define the video object representation: Spatio-Temporal Tube. To evaluate the similarity between complex tube objects, we design a Spatio-Temporal Tube Kernel (STTK) function. Based on this kernel similarity we present both supervised and active learning strategies embedded in Support Vector Machine framework. Additionally, we propose a multi-class classification framework dealing with highly unbalanced datasets. Our approach is successfully evaluated on real movie databases. Our machine learning approach outperforms the state of the art methods for multi-class actor recognition. Our method is also evaluated for actor retrieval task and on a car database showing hence promising results for car identification task and the potential of extension to any category of video objects.

Composition du jury

  • Patrick PEREZ, Directeur de Recherche INRIA, IRISA / INRIA Rennes, rapporteur
  • Riccardo LEONARDI, Professeur, Università degli Studi di Brescia, rapporteur
  • Nicole VINCENT, Professeur, LIPADE, Université Paris Descartes, examinateur
  • Ivan LAPTEV, Chargé de recherche INRIA, NRIA Paris - Rocquencourt, examinateur
  • Sylvie PHILIPP-FOLIGUET, Professeur, ETIS, ENSEA / Université de Cergy-Pontoise / CNRS UMR 8051, directeur de thèse
  • Frédéric PRECIOSO, Maitre de conférences, ETIS, ENSEA / Université de Cergy-Pontoise / CNRS UMR 8051, co-directeur de thèse
  • Matthieu CORD, Professeur, LIP6 / UPMC-Sorbonne Universities , co-directeur de thèse

Retour