EP1468568A1 - Procede d'estimation du mouvement dominant dans une sequence d'images - Google Patents

Procede d'estimation du mouvement dominant dans une sequence d'images

Info

Publication number
EP1468568A1
EP1468568A1 EP02805377A EP02805377A EP1468568A1 EP 1468568 A1 EP1468568 A1 EP 1468568A1 EP 02805377 A EP02805377 A EP 02805377A EP 02805377 A EP02805377 A EP 02805377A EP 1468568 A1 EP1468568 A1 EP 1468568A1
Authority
EP
European Patent Office
Prior art keywords
movement
regression
motion
representation
image
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Withdrawn
Application number
EP02805377A
Other languages
German (de)
English (en)
Inventor
François Le Clerc
Sylvain Marrec
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Thomson Licensing SAS
Original Assignee
Thomson Licensing SAS
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Thomson Licensing SAS filed Critical Thomson Licensing SAS
Publication of EP1468568A1 publication Critical patent/EP1468568A1/fr
Withdrawn legal-status Critical Current

Links

Classifications

    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04NPICTORIAL COMMUNICATION, e.g. TELEVISION
    • H04N19/00Methods or arrangements for coding, decoding, compressing or decompressing digital video signals
    • H04N19/50Methods or arrangements for coding, decoding, compressing or decompressing digital video signals using predictive coding
    • H04N19/503Methods or arrangements for coding, decoding, compressing or decompressing digital video signals using predictive coding involving temporal prediction
    • H04N19/51Motion estimation or motion compensation
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04NPICTORIAL COMMUNICATION, e.g. TELEVISION
    • H04N5/00Details of television systems
    • H04N5/14Picture signal circuitry for video frequency region
    • H04N5/144Movement detection
    • H04N5/145Movement estimation
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06TIMAGE DATA PROCESSING OR GENERATION, IN GENERAL
    • G06T7/00Image analysis
    • G06T7/20Analysis of motion

Definitions

  • the invention relates to a method and device for estimating the dominant movement in a video plane. More specifically, the method is based on the analysis of the motion fields transmitted with the video in compression schemes using motion compensation. Such schemes are implemented in the MPEG-1, MPEG-2 and MPEG-4 video compression standards. There are known motion analysis methods based on the estimation, from motion vectors originating from compressed video streams of MPEG type, of a motion model which is most often refined:
  • M and v are the components of a vector ⁇ t present at the position (x ,, .y,) of the field of motion.
  • the estimation of the affine parameters a, b, c, d, e and f of the motion model is based on a technique of minimization of least squares errors. Such a process is described in the article by MA Smith and T. Kanade “Video Skimming and Characterization through the Combination of Image and Language Understanding" (acts of IEEE 1998 International Workshop on Content-Based Access of Image and Video Databases, pages 61 to 70). The authors of this article use the parameters of the affine model of motion, as well as the means û and v of the spatial components of the vectors of the field, to identify and classify the apparent motion.
  • the means of the components of the vectors i7 and v are analyzed to test the hypothesis of a panoramic.
  • a threshold of the variance associated with the number of motion vectors in each class ("bin" in English) of the histogram, for each of the two histograms, is then used to identify the presence of dominant movements of the "zoom" and " panoramic".
  • a secondary object is here defined as an object which occupies on the image a surface smaller than that of at least one other object of the image, the object associated with the dominant movement being that which occupies the largest surface in the picture.
  • the vectors of the compressed video stream which serve as the basis for the analysis of the movement do not always reflect the reality of the actual apparent movement of the image. Indeed, these vectors have been calculated in order to minimize the amount of information to be transmitted after motion compensation, not to estimate the physical motion of the pixels in the image.
  • a reliable estimation of a motion model from vectors from the compressed flux requires the use of a robust method, automatically eliminating from the calculation the motion vectors relating to secondary objects not following the dominant motion, as well as the vectors not corresponding to the physical movement of the main object of the image.
  • the invention presented here aims to overcome the drawbacks of the different families of methods of estimating the dominant movement presented above.
  • the subject of the invention is a method of detecting a dominant movement in a sequence of images performing a calculation of a field of motion vectors associated with an image, defining, for an image element of coordinates xi, yi. , one or more motion vectors of components ui, vi, characterized in that it also performs the following steps:
  • the robust regression is the method of the least median of the squares which consists in seeking, among a set of lines j, ri, j being the residue of the ith sample of coordinates xi, ui or yi, vi , compared to a straight line j, that providing the median value of the set of residual squares which is minimal:
  • the search for the least median of the squares of the residues is applied to a predefined number of lines each determined by a couple of samples drawn randomly in the space of representation of the movement considered.
  • the method performs, after the robust linear regression, a second non-robust linear regression making it possible to refine the estimates of the parameters of the motion model.
  • This second linear regression can exclude the points in the representation spaces whose regression residue from the first robust regression exceeds a predetermined threshold.
  • the method performs an equality test of the directing coefficients of the regression lines calculated in each of the representation spaces, based on a comparison of the sums of the squares of the residues obtained first by carrying out two separate regressions in each representation space, secondly by performing a global slope regression on the set of samples of the two representation spaces, and, if the test is positive, estimates the parameter k of the model by the arithmetic mean of the directing coefficients of the lines of regression obtained in each representation space.
  • the invention also relates to a device for implementing the method.
  • the method allows the implementation of robust methods of identifying the movement model at a reduced cost.
  • the main interest of the method described in the invention lies in the use of a space of judicious representation of the components of the motion vectors, which makes it possible to reduce the identification of the parameters of the motion model to a double regression linear.
  • FIG. 3 an illustration of the representation spaces of the motion vectors used in the invention
  • FIG. 4 the distribution of the theoretical vectors for a zoom movement centered in the representation spaces used in the invention
  • FIG. 5 the distribution of theoretical vectors for a movement of global oblique translation of the image in the representation spaces used in the invention
  • a flow diagram of the method of detecting the dominant movement The characterization of the dominant movement in a sequence of images requires the identification of a parametric model of apparent dominant movement. In the context of the exploitation of motion vector fields from compressed video streams, this model must represent the apparent motion in the 2D image plane. Such a model is obtained by approximating the projection onto the image plane of the movement of objects in three-dimensional space.
  • the 6-parameter affine model (a, b, c, d, e, f) presented above is commonly adopted in the literature.
  • the proposed method consists, basically, in identifying this parametric model of the movement, from fields of motion vectors which are provided in the video stream in order to effect the decoding thereof, when the coding principle calls upon techniques. motion compensation as used for example in the MPEG-1, MPEG-2 and MPEG-4 standards.
  • the method described in the invention is also applicable to motion vector fields which would have been calculated by a separate process from the images constituting the processed video sequence.
  • the adopted motion model is derived from a simplified linear model with 4 parameters (t x , t y , k, ⁇ ) which we will call SLM (acronym of the English expression Simplified Linear Model) , defined by :
  • (x ⁇ Yg) 1 coordinates of the reference point for the approximation of the 3D scene filmed by the camera into a 2D scene; this reference point will be assimilated to the point of coordinates (0, 0) 'of the image
  • t x , t y J vector representing the translation component of the movement
  • k divergence term representing the zoom component of the movement
  • rotation angle of the movement around the camera axis.
  • the objective sought is to identify the dominant movements caused by the movements and the optical transformations of the cameras, for example an optical zoom, in the video sequences. This is in particular to identify the camera movements which are statistically the most widespread in the composition of video documents, mainly grouping the translation and zoom movements, their combination, and the absence of movement, i.e. static or fixed plans.
  • the camera rotation effects very rarely observed in practice, are not taken into account: we therefore restrict the model to 3 parameters (t x , t y , k) by assuming that ⁇ ⁇ 0.
  • the advantage of this simplified parametric representation of the movement is that the parameters t x , t y and k, respectively describing the two components of translation and the zoom parameter of the movement model, can be estimated by linear regression in the representation spaces movement
  • the representation of a field of motion vectors in these spaces generally provides, for each of them, a cloud of points distributed around a line of slope k.
  • the process of estimating the parameters of the simplified model of movement is based on the application of a linear regression of robust type in each of the spaces of representation of the movement.
  • Linear regression is a mathematical operation which determines the line which best fits a cloud of points, for example by minimizing the sum of the squares of the distances from each point to this line.
  • This operation is, in the context of the invention, implemented using a robust statistical estimation technique, so as to guarantee a certain insensitivity to the presence of outliers in the data.
  • the estimation of the dominant movement model must be freed: - from the presence in the image of several objects, some of which follow secondary movements distinct from the dominant movement,
  • the motion vectors transmitted in a compressed video stream have been calculated with the aim of minimizing the amount of residual information to be transmitted after compensation for movement and not with the aim of providing the real movement of the objects constituting the imaged scene.
  • Figure 8 summarizes the different stages of the method for estimating the dominant movement in the sequence. Each of these steps is described in more detail below.
  • a first step 1 performs a normalization of the motion vector fields each associated with an image of the processed video sequence. These vector fields are assumed to have been calculated prior to the application of the algorithm, using a motion estimator.
  • the estimation of the movement can be carried out for rectangular blocks of pixels of the image, as in the methods of pairing of blocks of pixels called "block-matching", or provide a dense vector field, where a vector is estimated. for each pixel in the image.
  • the present invention preferentially, but not exclusively, deals with the case where the vector fields used have been calculated by a video encoder and transmitted in the compressed video stream for decoding purposes.
  • the motion vectors are estimated for the current image at the rate of one vector per rectangular block of the image, relative to a reference frame whose temporal distance to the current image is variable. Furthermore, for certain so-called “B” frames predicted bi-directionally, two motion vectors may have been calculated for the same block, one pointing from the current image to a past reference frame and the other from the current image to a future reference frame. A step of normalization of the vector fields is therefore essential in order to treat, in the steps subsequent, vectors calculated on time intervals of equal durations and pointing in the same direction.
  • the second step constructs the spaces for representing the movement presented above.
  • Each pair of points (x ,, ui) and (y ,, v,) corresponding to the representation of a vector of the motion field can be modeled relative to the regression lines in each of the spaces by:
  • FIG. 3 illustrates point clouds obtained after construction of these two spaces from a field of normalized motion vectors.
  • the parameters (ao, b 0 ) and (a ⁇ , b ⁇ ) obtained after the linear regressions in each of the representation spaces provide estimates of the parameters of the dominant motion model. So, the slopes ao and a ? correspond to a double estimate of the parameter of divergence k characterizing the zoom component, while the ordinates at the origin b 0 and bi correspond to an evaluation of the components t x and t y of translation.
  • FIGS 4 to 7 show some examples of possible configurations.
  • the next step 3 performs a robust linear regression for each of the movement representation spaces, with the aim of separating the data points representative of the real dominant movement from those corresponding either to the movement of secondary objects in the image, or vectors which do not translate the physical movement of the pixels with which they are associated.
  • robust estimation techniques There are several families of robust estimation techniques.
  • the regression lines are calculated so as to satisfy the criterion of the least median of the squares.
  • the calculation method briefly presented below, is described more fully in paragraph 3 of the article by P. Meer, D. Mintz and A. Rosenfeld “Robust Regression Methods for Computer Vision: A Review", published in International Journal of Computer Vision, volume 6 no.1, 1991, pages 59 to 70.
  • n, j the residue of the i th sample of a space representing the movement in which we seek to estimate the set E j of the regression parameters (slope and intercept of the regression line), we calculate Ej so as to meet the following criteria: min (medii 2 :)
  • the residue n, j corresponds to the residual error ⁇ u ⁇ or ⁇ v , - - depending on the representation space considered - associated with the modeling of the i th sample by the regression line of parameters E j .
  • the solution to this non-linear minimization problem requires a search for the line defined by Ej among all possible lines. In order to restrict the calculations, the search is limited to a finite set of p regression lines, defined by p pairs of points drawn randomly from the samples of the representation space studied. For each of the p lines, the squares of the residuals are calculated and sorted so as to identify the square of the square residue which has the median value. The regression line is estimated as the one that provides the smallest of these median values of the squares of the residuals.
  • the regression lines obtained by robust estimation in each representation space are then used to identify the outliers. For this purpose, we calculate, as a function of the median value of the square of the residue corresponding to the best regression line found, a robust estimate ⁇ of the standard deviation of the residues associated with the non-aberrant samples, under the assumption that they follow a Gaussian distribution, and we label as an aberrant sample any sample whose absolute value of the residue exceeds K times ⁇ . It is advantageous to fix the value of K at 2.5. Still in this step 3, we finally perform classic linear regressions, not robust, on the samples of each space of representation, excluding samples identified as outliers. These regressions provide refined estimates of the parameters (ao, bo) and (a ⁇ , b ⁇ ) which will be used in the rest of the process.
  • the next step 4 performs a linearity test of the regression lines in each of the representation spaces.
  • the purpose of this test is to verify that the point clouds in each space are effectively approximately distributed along lines, which does not guarantee the existence - systematic - of a regression line.
  • the linearity test is carried out, in each representation space, by comparing to a predetermined threshold the standard deviation of the residues resulting from the linear regression relating to the non-outlier samples.
  • the value of the threshold depends on the time normalization applied to the motion vectors in step 1 of the method. In the case where, after normalization, each vector represents a displacement corresponding to the time interval separating two interlaced frames, ie 40 ms for a transmission at 50 Hz, this threshold can advantageously be set at 6.
  • step 5 consists in verifying that the slopes ao and ai, which provide a double estimate of the divergence parameter k of the motion model, do not differ significantly.
  • the equality test of two regression slopes is a known problem, which is dealt with in some statistical works; we can for example consult the chapter devoted to analysis of variance in CR Rao's book “Linear Stafistical Inference and its Applications” published by Wiley editions (2 nd edition). This test is carried out in a conventional manner by calculating an overall regression slope relating to the set of non-outlier samples of the two representation spaces of the motion vector field.
  • the value of the divergence coefficient k of the dominant motion model is estimated by the arithmetic mean of the regression slopes a 0 and ai obtained in each of the representation spaces.
  • the parameters t x and t y are estimated respectively by the values of the intercepts bo and bi from the linear regressions in the representation spaces.
  • the vector ⁇ (k, t x , t y of the estimated parameters is used to decide the category in which to classify the dominant movement, namely: - static,
  • the classification algorithm is based on nullity tests of the model parameters, in accordance with the table below:
  • the nullity tests of the estimates of the parameters of the models can be carried out by simple comparison with a threshold of their absolute value. More sophisticated techniques, based on statistical modeling of the distribution of data can also be used. In this statistical framework, an example of an algorithm for deciding the nullity of model parameters based on likelihood tests is presented in the article by P. Bouthemy, M. Gelgon and F. Ganansia entitled "A unified approach to shot change detection and camera motion characterization ”, published in the journal IEEE Circuits and Systems for Video Technology volume 9 no. 7, October 1999, pages 1030 to 1044.
  • One application of the invention relates to video indexing from the selection of key images.
  • the video indexing process generally begins with a pre-processing, which aims to restrict the volume of information to be processed in the video stream to a set of key images selected in the sequence.
  • the video indexing treatments, and in particular the extraction of the visual attributes, are carried out exclusively on these key images, each of which is representative of the content of a segment of the video.
  • all of the keyframes should form a comprehensive summary of the video, and redundancies between the visual content of the keyframes should be avoided, so as to minimize the computational burden of the indexing process.
  • the method of estimating the dominant movement within each video plane makes it possible to optimize the selection of the key images, within each plane, with respect to these criteria, by adapting it to the dominant movement. .
  • the described method can also be used for the generation of metadata.
  • the dominant movements often coincide with the camera movements when shooting the video.
  • Some directors use specific camera movement sequences to communicate certain emotions or sensations to the viewer.
  • the method described in the invention can make it possible to detect these particular sequences in the video, and therefore to provide metadata relating to the atmosphere created by the director in certain passages of the video.
  • Another application of dominant motion detection is the detection or aid in the detection of ruptured planes. In fact, an abrupt change in the properties of the dominant movement in a sequence can only be caused by a break in the plane.
  • the method described in the invention allows the identification, in each image, of the support of the dominant movement. This support indeed coincides with all the pixels whose associated vector has not been identified as an outlier, in the sense of the dominant movement.

Landscapes

  • Engineering & Computer Science (AREA)
  • Multimedia (AREA)
  • Signal Processing (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • Physics & Mathematics (AREA)
  • General Physics & Mathematics (AREA)
  • Theoretical Computer Science (AREA)
  • Image Analysis (AREA)
  • Compression Or Coding Systems Of Tv Signals (AREA)
  • Compression, Expansion, Code Conversion, And Decoders (AREA)

Abstract

Le procédé effectuant un calcul 1 d'un champ de vecteurs de mouvement associé à une image, définissant, pour un élément d'image de coordonnées xi, yi, un ou plusieurs vecteurs de mouvement de composantes ui, vi, est caractérisé en ce qu'il réalise également les étapes suivantes: - modélisation du mouvement 2 à partir d'une représentation paramétrique simplifiée : ui = tx +k.xi vi = ty +k.yi avec tx, ty composantes d'un vecteur représentant la composante de translation du mouvement, k facteur de divergence caractérisant la composante de zoom du mouvement, - régression linéaire robuste 3 dans chacun des deux espaces de représentation du mouvement définis par les plans x,u et y,v, x, y, u et v représentant respectivement les axes des variables xi, yi, ui et vi, pour donner des droites de régression, - calcul des paramítres tx, ty, et k 4, 5 à partir des pentes et des ordonnées à l'origine des droites de régression. Les applications concernent la sélection d'images-clés pour l'indexation vidéo ou la génération de méta-données.

Description

PROCEDE D'ESTIMATION DU MOUVEMENT DOMINANT DANS UNE
SEQUENCE D'IMAGES.
L'invention concerne un procédé et dispositif d'estimation du mouvement dominant dans un plan vidéo. Plus précisément, le procédé se base sur l'analyse des champs de mouvement transmis avec la vidéo dans des schémas de compression utilisant une compensation du mouvement. De tels schémas sont mis en œuvre dans les normes de compression vidéo MPEG-1 , MPEG-2 et MPEG-4. II est connu des procédés d'analyse de mouvement basés sur l'estimation, à partir des vecteurs de mouvement issus des flux vidéo comprimés de type MPEG, d'un modèle de mouvement qui est le plus souvent affine:
où M et v sont les composantes d'un vecteur ώt présent à la position (x,, .y, )du champ de mouvement. L'estimation des paramètres affines a, b, c, d, e et f du modèle de mouvement s'appuie sur une technique de minimisation des erreurs aux moindres carrés. Un tel procédé est décrit dans l'article de M.A. Smith et T. Kanade « Video Skimming and Characterization through the Combination of Image and Language Understanding » (actes de IEEE 1998 International Workshop on Content-Based Access of Image and Video Databases, pages 61 à 70). Les auteurs de cet article utilisent les paramètres du modèle affine du mouvement, ainsi que les moyennes û et v des composantes spatiales des vecteurs du champ, pour identifier et classifier le mouvement apparent. Par exemple, pour déterminer si le mouvement est un zoom, ils vérifient qu'il existe un point de convergence (xo,.yo)c'u champ de vecteurs, tel que u(χ0,y0) = 0 et v(x0,y0)
= 0, au moyen de la condition suivante :
Les moyennes des composantes des vecteurs i7 et v sont analysées pour tester l'hypothèse d'un panoramique.
Il est également connu des procédés d'analyse de mouvement exploitant directement les champs de vecteurs issus du flux vidéo MPEG, sans passer par l'identification d'un modèle de mouvement. L'article de O.N. Gerek et Y. Altunbasak « Key Frame Sélection from MPEG Video Data » (actes du congrès Visual Communications and Image Processing '97, pages 920 à 925) décrit un tel procédé. La méthode consiste à construire, pour chaque champ de mouvement associé à une image du train binaire MPEG, deux histogrammes du champ de vecteurs, l'un relevant l'occurrence des vecteurs en fonction de leur direction, et le second en fonction de leur amplitude. Des exemples de tels histogrammes sont représentés sur les figures 1 et 2 : la figure 1 illustre une configuration où le mouvement apparent dans l'image est un zoom, alors que dans la figure 2 le mouvement dominant est un panoramique.
Un seuillage de la variance associée au nombre de vecteurs de mouvement dans chaque classe (« bin » en anglais) de l'histogramme, pour chacun des deux histogrammes, est ensuite utilisé pour identifier la présence de mouvements dominants de type "zoom" et "panoramique".
Les méthodes telles que celle proposée par Gerek et Altunbasak fournissent une information purement qualitative sur la catégorie du mouvement dominant, alors qu'une estimation quantitative sur l'amplitude du mouvement est souvent requise. Les méthodes telles que celle proposée par Smith et Kanade basées sur l'estimation d'un modèle paramétrique de mouvement fournissent ces informations quantitatives, mais sont souvent assez peu fiables. En effet, ces méthodes ne prennent pas en compte la présence dans la scène vidéo traitée de plusieurs objets suivant des mouvements apparents différents. La prise en compte des vecteurs associés aux objets secondaires est susceptible de fausser de manière significative l'estimation aux moindres carrés des paramètres du modèle de mouvement dominant. Un objet secondaire est ici défini comme un objet qui occupe sur l'image une surface inférieure à celle d'au moins un autre objet de l'image, l'objet associé au mouvement dominant étant celui qui occupe la plus grande surface dans l'image. Par ailleurs, même en présence d'un seul objet en mouvement dans l'image, les vecteurs du flux vidéo comprimé qui servent de base à l'analyse du mouvement ne reflètent pas toujours la réalité du mouvement apparent réel de l'image. En effet, ces vecteurs ont été calculés dans le but de minimiser la quantité d'information à transmettre après compensation de mouvement, et non d'estimer le mouvement physique des pixels de l'image.
Une estimation fiable d'un modèle de mouvement à partir des vecteurs issus du flux comprimé requiert l'utilisation d'une méthode robuste, éliminant automatiquement du calcul les vecteurs de mouvement relatifs à des objets secondaires ne suivant pas le mouvement dominant, ainsi que les vecteurs ne correspondant pas au mouvement physique de l'objet principal de l'image.
Des méthodes robustes d'estimation d' un modèle paramétrique de mouvement dominant ont déjà été proposées dans des contextes différents de l'utilisation de flux vidéo comprimés. Un exemple en est fourni dans l'article de P. Bouthemy, M. Gelgon et F. Ganansia intitulé « A unified approach to shot change détection and caméra motion characterization », paru dans la revue IEEE Circuits and Systems for Video Technology volume 9 n° 7, Octobre 1999, pages 1030 à 1044. Ces méthodes présentent l'inconvénient d'être très complexes à mettre en oeuvre.
L'invention présentée ici a pour but de pallier les inconvénients des différentes familles de méthodes d'estimation du mouvement dominant présentées ci-dessus.
L'invention a pour objet un procédé de détection d'un mouvement dominant dans une séquence d'images effectuant un calcul d'un champ de vecteurs de mouvement associé à une image, définissant, pour un élément d'image de coordonnées xi, yi, un ou plusieurs vecteurs de mouvement de composantes ui, vi, caractérisé en ce qu'il effectue également les étapes suivantes:
- modélisation du mouvement à partir d'une représentation paramétrique simplifiée : ui = tx +k.xi vi = ty +k.yi avec tx, ty composantes d'un vecteur représentant la composante de translation du mouvement, k facteur de divergence caractérisant la composante de zoom du mouvement, - régression linéaire robuste dans chacun des deux espaces de représentation du mouvement définis par les plans (x,u) et (y,v), x, y, u et v représentant respectivement les axes des variables xi, yi, ui et vi, pour donner des droites de régression, - calcul des paramètres tx, ty, et k à partir des pentes et des ordonnées à l'origine des droites de régression.
Selon un mode de mise en œuvre, la régression robuste est la méthode de la moindre médiane des carrés qui consiste à chercher, parmi un ensemble de droites j, ri,j étant le résidu du ième échantillon de coordonnées xi, ui ou yi, vi, par rapport à une droite j, celle fournissant la valeur médiane de l'ensemble des carrés des résidus qui est minimale:
Selon un mode de mise en oeuvre, la recherche de la moindre médiane des carrés des résidus est appliquée sur un nombre prédéfini de droites déterminées chacune par un couple d'échantillons tirés aléatoirement dans l'espace de représentation du mouvement considéré.
Selon un mode de mise en œuvre, le procédé effectue, après la régression linéaire robuste, une deuxième régression linéaire non-robuste permettant d'affiner les estimations des paramètres du modèle de mouvement. Cette deuxième régression linéaire peut exclure les points dans les espaces de représentation dont le résidu de régression issu de la première régression robuste excède un seuil prédéterminé.
Selon un mode de mise en œuvre, le procédé effectue un test d'égalité des coefficients directeurs des droites de régression calculées dans chacun des espaces de représentation, basé sur une comparaison des sommes des carrés des résidus obtenus premièrement en effectuant deux régressions séparées dans chaque espace de représentation, deuxièmement en effectuant une régression de pente globale sur l'ensemble des échantillons des deux espaces de représentation, et, dans le cas où le test est positif, estime le paramètre k du modèle par la moyenne arithmétique des coefficients directeurs des droites de régression obtenues dans chaque espace de représentation.
L'invention concerne également un dispositif pour la mise en œuvre du procédé. En exploitant un modèle paramétrique très simplifié, mais néanmoins suffisamment réaliste, du mouvement dominant dans une image vidéo, le procédé permet la mise en oeuvre de méthodes robustes d'identification du modèle de mouvement à un coût réduit. Plus précisément, l'intérêt principal du procédé décrit dans l'invention réside dans l'utilisation d'un espace de représentation judicieux des composantes des vecteurs de mouvement, qui permet de ramener l'identification des paramètres du modèle de mouvement à une double régression linéaire.
D'autres particularités et avantages de l'invention apparaîtront clairement dans la description suivante donnée à titre d'exemple non limitatif et faite en regard des figures annexées qui représentent :
- la figure 1 , un champ de vecteurs de mouvement théoriques correspondant à un "zoom", - la figure 2, un champ de vecteurs de mouvement théoriques correspondant à une scène pour laquelle le mouvement dominant de l'arrière-plan est de type "panoramique", et qui comporte également un objet secondaire suivant un mouvement distinct du mouvement dominant,
- la figure 3, une illustration des espaces de représentation des vecteurs de mouvement utilisés dans l'invention,
- le figure 4, la distribution des vecteurs théoriques pour un mouvement de zoom centré dans les espaces de représentation utilisés dans l'invention,
- le figure 5, la distribution des vecteurs théoriques pour un mouvement de translation oblique globale de l'image dans les espaces de représentation utilisés dans l'invention,
- le figure 6, la distribution des vecteurs théoriques pour un mouvement combiné de translation et zoom dans les espaces de représentation utilisés dans l'invention, - le figure 7, la distribution des vecteurs théoriques pour une scène statique (mouvement nul) dans les espaces de représentation utilisés dans l'invention,
- le figure 8, un organigramme de la méthode de détection du mouvement dominant. La caractérisation du mouvement dominant dans une séquence d'images passe par l'identification d'un modèle paramétrique de mouvement dominant apparent. Dans le contexte de l'exploitation de champs de vecteurs de mouvement issus de flux vidéo comprimés, ce modèle doit représenter le mouvement apparent dans le plan image 2D. Un tel modèle est obtenu par approximation de la projection sur le plan image du mouvement des objets dans l'espace tri-dimensionnel. A titre d'exemple, le modèle affine à 6 paramètres (a,b,c,d,e,f) présenté plus haut est couramment adopté dans la littérature. Le procédé proposé consiste, à la base, à identifier ce modèle paramétrique du mouvement, à partir de champs de vecteurs de mouvement qui sont fournis dans le flux vidéo afin d'en effectuer le décodage, lorsque le principe de codage fait appel à des techniques de compensation de mouvement telles qu'exploitées par exemple dans les normes MPEG-1 , MPEG-2 et MPEG-4. Toutefois, le procédé décrit dans l'invention est également applicable à des champs de vecteurs de mouvement qui auraient été calculés par un processus séparé à partir des images constituant la séquence vidéo traitée.
Dans le contexte de la présente invention, le modèle de mouvement adopté est dérivé d'un modèle linéaire simplifié à 4 paramètres (tx, ty, k, θ) que nous appellerons SLM (acronyme de l'expression anglaise Simplified Linear Model), défini par :
avec
(ui ? Vj ) : composantes du vecteur de mouvement apparent associé au pixel du plan image de coordonnées (x^y ,
(x^ Yg )1 : coordonnées du point de référence pour l'approximation de la scène 3D filmée par la caméra en une scène 2D ; ce point de référence sera assimilé au point de coordonnées (0 , 0)' de l'image, t x , t y J : vecteur représentant la composante de translation du mouvement, k : terme de divergence représentant la composante de zoom du mouvement, θ : angle de rotation du mouvement autour de l'axe de la caméra.
L'objectif recherché est d'identifier les mouvements dominants provoqués par les déplacements et les transformations optiques des caméras, par exemple un zoom optique, dans les séquences vidéo. Il s'agit en particulier d'identifier les mouvements de caméra qui sont statistiquement les plus répandus dans la composition des documents vidéo, regroupant majoritairement les mouvements de translation et de zoom, leur combinaison, et les absences de mouvement, c'est à dire les plans statiques ou fixes. Les effets de rotation de caméra, très rarement observés en pratique, ne sont pas pris en compte : on restreint donc le modèle aux 3 paramètres (tx, ty, k) en effectuant l'hypothèse que θ ≈ 0.
On a alors deux relations de linéarité entre les composantes des vecteurs et leur position spatiale dans l'image :
Uj = tx + k.Xj
L'avantage de cette représentation paramétrique simplifiée du mouvement est que les paramètres tx, ty et k, décrivant respectivement les deux composantes de translation et le paramètre de zoom du modèle de mouvement, peuvent être estimés par régression linéaire dans les espaces de représentation du mouvement Ainsi que l'illustre la figure 3, la représentation d'un champ de vecteurs de mouvement dans ces espaces fournit généralement, pour chacun d'entre eux, un nuage de points distribué autour d'une droite de pente k.
Le processus d'estimation des paramètres du modèle simplifié de mouvement est basé sur l'application d'une régression linéaire de type robuste dans chacun des espaces de représentation du mouvement. La régression linéaire est une opération mathématique qui détermine la droite s'ajustant au mieux à un nuage de points, par exemple en minimisant la somme des carrés des distances de chaque point à cette droite. Cette opération est, dans le contexte de l'invention, mise en œuvre à l'aide d'une technique d'estimation statistique robuste, de façon à garantir une certaine insensibilité vis-à-vis de la présence de valeurs aberrantes dans les données. En effet, l'estimation du modèle de mouvement dominant doit s'affranchir: - de la présence dans l'image de plusieurs objets dont certains suivent des mouvements secondaires distincts du mouvement dominant,
- de la présence de vecteurs de mouvements ne représentant pas le mouvement physique des objets. En effet, les vecteurs de mouvement transmis dans un flux vidéo comprimé ont été calculés dans le but de minimiser la quantité d'information résiduelle à transmettre après compensation de mouvement et non dans le but de fournir le mouvement réel des objets constituant la scène imagée.
La figure 8 synthétise les différentes étapes de la méthode d'estimation du mouvement dominant dans la séquence. Chacune de ces étapes est décrite plus précisément dans ce qui suit.
Une première étape 1 effectue une normalisation des champs de vecteurs de mouvement associés chacun à une image de la séquence vidéo traitée. Ces champs de vecteurs sont supposés avoir été calculés préalablement à l'application de l'algorithme, à l'aide d'un estimateur de mouvement. L'estimation du mouvement peut être effectuée pour des blocs rectangulaires de pixels de l'image, comme dans les méthodes d'appariement de blocs de pixels dites « block-matching », ou fournir un champ de vecteurs dense, où un vecteur est estimé pour chaque pixel de l'image. La présente invention traite préférentiellement, mais non exclusivement, le cas où les champs de vecteurs utilisés ont été calculés par un encodeur vidéo et transmis dans le flux vidéo comprimé à des fins de décodage. Dans le cas typique où le schéma d'encodage utilisé est conforme à une des normes MPEG-1 ou MPEG-2, les vecteurs de mouvement sont estimés pour l'image courante à raison d'un vecteur par bloc rectangulaire de l'image, relativement à une trame de référence dont la distance temporelle à l'image courante est variable. Par ailleurs, pour certaines trames dites « B » prédites de manière bi-directionnelle, deux vecteurs de mouvement peuvent avoir été calculés pour un même bloc, l'un pointant depuis l'image courante vers une trame de référence passée et l'autre depuis l'image courante vers une trame de référence future. Une étape de normalisation des champs de vecteurs est donc indispensable de façon à traiter, dans les étapes ultérieures, des vecteurs calculés sur des intervalles temporels de durées égales et pointant dans une même direction. Le paragraphe 3.2 de l'article de V. Kobla et D. Doermann intitulé « Compressed domain video indexing techniques using DCT and motion vector information in MPEG video », Proceedings of the SPIE vol. 3022, 1997, pages 200 à 211 , fournit un exemple de méthode permettant d'effectuer cette normalisation. D'autres techniques plus simples basées sur des approximations linéaires du mouvement sur les intervalles de calcul des vecteurs MPEG peuvent également être utilisées.
La deuxième étape référencée 2 effectue une construction des espaces de représentation du mouvement présentés plus haut. Chaque vecteur ô5i du champ de mouvement, de composantes et de position (x^y^)* , est représenté par un point dans chacun des deux espaces et v,=f(y/).
Chaque couple de points (x,,ui) et (y,,v,) correspondant à la représentation d'un vecteur du champ de mouvement peut être modélisé relativement aux droites de régression dans chacun des espaces par :
Ui = 0.Xi + b0 + εUi vi = a1.yi + b1 + εv.
ou
(ao,bo) sont les paramètres de la droite de régression à calculer dans l'espace Ui=f(Xj) ; εu; est l'erreur résiduelle correspondante.
(aι,bι) sont les paramètres de la droite de régression à calculer dans l'espace ; εv,- est l'erreur résiduelle correspondante.
La figure 3 illustre des nuages de points obtenus après construction de ces deux espaces à partir d'un champ de vecteurs de mouvement normalisé.
Les paramètres (ao,b0) et (aι,bι) obtenus à l'issue des régressions linéaires dans chacun des espaces de représentation fournissent des estimations des paramètres du modèle de mouvement dominant. Ainsi, les pentes ao et a? correspondent à une double estimation du paramètre de divergence k caractérisant la composante de zoom, alors que les ordonnées à l'origine b0 et bi correspondent à une évaluation des composantes tx et ty de translation.
Les figures 4 à 7 montrent quelques exemples de configurations possibles.
- distribution des données en cas de zoom centré pour la figure 4,
- distribution des données en cas de mouvement de translation oblique pour la figure 5, - distribution des données en cas de zoom décentré
(mouvement combinant un zoom et une translation) pour la figure 6,
- distribution des données en cas d'une absence de mouvement pour la figure 7.
L'étape suivante 3 effectue une régression linéaire robuste pour chacun des espaces de représentation du mouvement, dans le but de séparer les points de données représentatifs du mouvement dominant réel de ceux correspondant, soit au mouvement d'objets secondaires dans l'image, soit à des vecteurs ne traduisant pas le mouvement physique des pixels auxquels ils sont associés. II existe plusieurs familles de techniques d'estimation robuste.
Selon un mode préférentiel de réalisation de l'invention, les droites de régression sont calculées de manière à satisfaire le critère de la moindre médiane des carrés. La méthode de calcul, présentée brièvement ci-après, est décrite de manière plus complète au paragraphe 3 de l'article de P. Meer, D. Mintz et A. Rosenfeld « Robust Régression Methods for Computer Vision : A Review », paru dans International Journal of Computer Vision, volume 6 n° 1 , 1991 , pages 59 à 70.
Appelant n,j le résidu du ieme échantillon d'un espace de représentation du mouvement dans lequel on cherche à estimer l'ensemble Ej des paramètres de régression (pente et intercept de la droite de régression), on calcule Ej de manière à satisfaire le critère suivant : min(medii2:)
Le résidu n,j correspond à l'erreur résiduelle εu\ ou εv,- - suivant l'espace de représentation considéré - associée à la modélisation du ième échantillon par la droite de régression de paramètres Ej. La solution à ce problème de minimisation non-linéaire nécessite une recherche de la droite définie par Ej parmi toutes les droites possibles. Afin de restreindre les calculs, on limite la recherche à un ensemble fini de p droites de régression, définies par p couples de points tirés aléatoirement parmi les échantillons de l'espace de représentation étudié. Pour chacune des p droites, on calcule et on trie les carrés des résidus de façon à identifier le carré du résidu carré qui présente la valeur médiane. La droite de régression est estimée comme celle qui fournit la plus petite de ces valeurs médianes des carrés des résidus.
Le fait de sélectionner la droite de régression sur l'unique carré du résidu médian, plutôt que sur l'ensemble des résidus, confère au processus de régression son caractère robuste. En effet, il permet de ne pas prendre en compte des résidus de valeurs extrêmes, susceptibles de correspondre à des points de données aberrants et donc de fausser la régression. En testant par exemple p =12 droites, la probabilité qu'au moins un des p couples soit constitué de deux échantillons non-aberrants, c'est-à- dire représentatifs du mouvement dominant, est très proche de 1. Si la proportion d'échantillons aberrants est inférieure à 50%, ce que l'on suppose, un tel couple ne comportant pas d'échantillon aberrant fournit une droite de régression en meilleure adéquation avec le nuage d'échantillons - donc présentant un résidu carré médian plus faible - que n'importe quel couple de points comportant au moins un échantillon aberrant. On est alors quasiment assuré que la droite de régression finalement obtenue est définie par deux échantillons non aberrants, ce qui garantit la robustesse de la méthode vis-à- vis des échantillons aberrants.
Les droites de régression obtenues par estimation robuste dans chaque espace de représentation sont ensuite utilisées pour identifier les échantillons aberrants. Dans ce but, on calcule, en fonction de la valeur médiane du carré du résidu correspondant à la meilleure droite de régression trouvée, une estimation robuste σ de l'écart-type des résidus associés aux échantillons non aberrants, sous l'hypothèse qu'ils suivent une distribution gaussienne, et on étiquette comme échantillon aberrant tout échantillon dont la valeur absolue du résidu excède K fois σ . On peut avantageusement fixer la valeur de K à 2,5. Toujours dans cette étape 3, on effectue enfin des régressions linéaires classiques, non robustes, sur les échantillons de chaque espace de représentation, en excluant les échantillons identifiés comme aberrants. Ces régressions fournissent des estimations affinées des paramètres (ao,bo) et (aι,bι) qui seront utilisées dans la suite du procédé.
L'étape suivante 4 effectue un test de linéarité des droites de régression dans chacun des espaces de représentation. Ce test a pour but de vérifier que les nuages de points dans chaque espace sont effectivement approximativement distribués suivant des droites, ce que ne garantit aucunement l'existence - systématique - d'une droite de régression.
Le test de linéarité est effectué, dans chaque espace de représentation, en comparant à un seuil prédéterminé l'écart type des résidus issus de la régression linéaire portant sur les échantillons non aberrants. La valeur du seuil dépend de la normalisation temporelle appliquée aux vecteurs de mouvement à l'étape 1 du procédé. Dans le cas où, après normalisation, chaque vecteur représente un déplacement correspondant à l'intervalle de temps séparant deux trames entrelacées, soit 40 ms pour une transmission à 50 Hz, ce seuil peut avantageusement être fixé à 6.
Si au moins un des tests de linéarité effectués dans les deux espaces de représentation échoue, on considère que le champ de mouvement correspondant à l'image courante ne permet pas une estimation fiable d'un modèle de mouvement dominant. On positionne alors un drapeau signalant l'échec du processus d'estimation du mouvement dominant, et on traite l'image suivante.
Dans le cas contraire, on passe à l'étape suivante 5, qui consiste à vérifier que les pentes ao et ai, qui fournissent une double estimation du paramètre de divergence k du modèle de mouvement, ne diffèrent pas de manière significative. Le test d'égalité de deux pentes de régression est un problème connu, qui est traité dans certains ouvrages de statistique ; on pourra par exemple consulter le chapitre consacré à l'analyse de variance dans de livre de C.R. Rao « Linear Stafistical Inference and its Applications » paru aux éditions Wiley (2eme édition). On effectue de manière classique ce test en calculant une pente de régression globale portant sur l'ensemble des échantillons non aberrants des deux espaces de représentation du champ de vecteurs de mouvement. On forme ensuite le rapport de la somme des carrés des résidus relative à cette estimation de pente globale sur l'ensemble des données, à la somme sur les deux espaces des sommes des carrés des résidus relatives aux régressions séparées - ne portant que sur les échantillons non aberrants. On compare ce rapport à un seuil prédéterminé ; si le rapport est supérieur au seuil, l'hypothèse d'égalité des pentes de régression dans les deux espaces de représentation du mouvement n'est statistiquement pas valide. On positionne alors un drapeau signalant l'échec du processus d'estimation du mouvement dominant, et on traite l'image suivante. Dans le cas où le résultat du test est positif, on estime la valeur du coefficient de divergence k du modèle de mouvement dominant par la moyenne arithmétique des pentes de régression a0 et ai obtenues dans chacun des espaces de représentation. Les paramètres tx et ty sont estimés respectivement par les valeurs des intercepts bo et bi issus des régressions linéaires dans les espaces de représentation.
Dans le cas où le modèle de mouvement est considéré comme valide, c'est-à-dire si les tests effectués dans les étapes 4 et 5 ont été passés avec succès, une classification du mouvement dominant est effectuée lors de l'étape suivante référencée 6.
Le vecteur θ = (k, tx, ty des paramètres estimés est exploité pour décider de la catégorie dans laquelle classer le mouvement dominant, à savoir : - statique,
- translation pure,
- zoom pur,
- translation combinée avec un zoom.
L'algorithme de classification est basé sur des tests de nullité des paramètres du modèle, conformément au tableau ci-dessous :
Selon une technique simple, les tests de nullité des estimations des paramètres du modèles peuvent être effectués par simple comparaison à un seuil de leur valeur absolue. Des techniques plus élaborées, basées sur une modélisation statistique de la distribution des données, peuvent également être employées. Dans ce cadre statistique, un exemple d'algorithme de décision de la nullité des paramètres du modèle basé sur des tests de vraisemblance est présenté dans l'article de P. Bouthemy, M. Gelgon et F. Ganansia intitulé « A unified approach to shot change détection and caméra motion characterization », paru dans la revue IEEE Circuits and Systems for Video Technology volume 9 n° 7, Octobre 1999, pages 1030 à 1044.
Une application de l'invention concerne l'indexation vidéo à partir de la sélection d'images clés.
En effet, le processus d'indexation vidéo débute généralement par un pré-traitement, qui vise à restreindre le volume des informations à traiter dans le flux vidéo à un ensemble d'images clés sélectionnées dans la séquence. Les traitements d'indexation de la vidéo, et en particulier l'extraction des attributs visuels, s'effectuent exclusivement sur ces images clés, dont chacune est représentative du contenu d'un segment de la vidéo. Idéalement, l'ensemble des images clés doit former un résumé exhaustif de la vidéo, et les redondances entre le contenu visuel des images clés doivent être évitées, de façon à minimiser la charge de calcul du processus d'indexation. Le procédé d'estimation du mouvement dominant à l'intérieur de chaque plan vidéo permet d'optimiser la sélection des images clés, à l'intérieur de chaque plan, vis-à-vis de ces critères, en l'adaptant au mouvement dominant. Il est par exemple possible de cumuler les translations horizontales (respectivement verticales) de l'image, estimées par le paramètre tx (respectivement ty) à l'intérieur d'un plan, et d'échantillonner une nouvelle image clé dès que le cumul dépasse la largeur (respectivement la hauteur) d'une image.
Le procédé décrit peut également être exploité pour la génération de méta-données. Les mouvements dominants coïncident souvent avec les mouvements de caméra lors du tournage de la vidéo. Certains réalisateurs utilisent des séquences de mouvements de caméra particulières afin de communiquer au spectateur certaines émotions ou sensations. Le procédé décrit dans l'invention peut permettre de détecter ces séquences particulières dans la vidéo, et par conséquent de fournir des méta-données relatives à l'atmosphère créée par le réalisateur dans certains passages de la vidéo. Une autre application de la détection de mouvement dominant est la détection ou l'aide à la détection de ruptures de plans. En effet, un changement abrupt des propriétés du mouvement dominant dans une séquence ne peut être engendré que par une rupture de plan. Enfin, le procédé décrit dans l'invention permet l'identification, dans chaque image, du support du mouvement dominant. Ce support coïncide en effet avec l'ensemble des pixels dont le vecteur associé n'a pas été identifié comme aberrant, au sens du mouvement dominant. La connaissance du support du mouvement dominant fournit une segmentation de l'objet qui suit ce mouvement. Cette segmentation peut être exploitée soit pour effectuer une indexation séparée des objets constituants l'image, ce qui permet le traitement de requêtes partielles portant sur les objets et non sur la totalité des images, soit dans le cadre d'algorithmes de compression vidéo basés sur des objets, tels que par exemple ceux spécifiés dans la norme de compression vidéo MPEG-4.

Claims

REVENDICATIONS
1 Procédé d'estimation d'un mouvement dominant dans une séquence d'images effectuant un calcul (1) d'un champ de vecteurs de mouvement associé à une image, définissant, pour un élément d'image de coordonnées xi, yi, un ou plusieurs vecteurs de mouvement de composantes ui, vi, caractérisé en ce qu'il effectue également les étapes suivantes:
- modélisation du mouvement (2) à partir d'une représentation paramétrique simplifiée : ui = tx +k.xi vi = ty +k.yi avec tx, ty composantes d'un vecteur représentant la composante de translation du mouvement, k facteur de divergence caractérisant la composante de zoom du mouvement,
- régression linéaire robuste (3) dans chacun des deux espaces de représentation du mouvement définis par les plans (x,u) et (y,v), x, y, u et v représentant respectivement les axes des variables xi, yi, ui et vi, pour donner des droites de régression,
- calcul des paramètres tx, ty, et k (4, 5) à partir des ordonnées à l'origine et pentes des droites de régression.
2 Procédé selon la revendication 1 , caractérisé en ce que la régression robuste (3) est la méthode de la moindre médiane des carrés qui consiste à chercher, parmi un ensemble de droites j, rij étant le résidu du ième échantillon de coordonnées xi, ui ou yi, vi, par rapport à une droite j, celle fournissant la valeur médiane de l'ensemble des carrés des résidus qui est minimale.
3 Procédé selon la revendication 2, caractérisé en ce que la recherche de la moindre médiane des carrés des résidus (3) est appliquée sur un nombre prédéfini de droites déterminées chacune par un couple d'échantillons tirés aléatoirement dans l'espace de représentation du mouvement considéré.
3 Procédé selon la revendication 1 , caractérisé en ce qu'il effectue, après la régression linéaire robuste (3), une deuxième régression linéaire non-robuste permettant d'affiner les estimations des paramètres du modèle de mouvement.
4 Procédé selon la revendication 3, caractérisé en ce que la deuxième régression linéaire exclut les points dans les espaces de représentation dont le résidu de régression issu de la première régression robuste excède un seuil prédéterminé.
5 Procédé selon la revendication 1 , caractérisé en ce qu'il effectue un test d'égalité (5) des coefficients directeurs des droites de régression calculées dans chacun des espaces de représentation (4), basé sur une comparaison des sommes des carrés des résidus obtenus premièrement en effectuant deux régressions séparées dans chaque espace de représentation, deuxièmement en effectuant une régression de pente globale sur l'ensemble des échantillons des deux espaces de représentation, et, dans le cas où le test est positif, qu'il estime le paramètre k du modèle par la moyenne arithmétique des coefficients directeurs des droites de régression obtenues dans chaque espace de représentation.
6 Procédé selon la revendication 1 , caractérisé en ce que le mouvement dominant est classé dans une des catégories : translation, zoom, combinaison d'une translation et d'un zoom, image statique, selon les valeurs de tx, ty et k.
7 Procédé selon la revendication 1 , caractérisé en ce que le champ de vecteurs de mouvement est issu de l'encodage de la séquence vidéo considérée par un algorithme de compression utilisant la compensation du mouvement, tel que les algorithmes conformes aux normes de compression MPEG-1 , MPEG-2 ou MPEG-4. 8 Application du procédé selon la revendication 1 à la sélection d'images clés, une image étant sélectionnée en fonction du cumul, sur plusieurs images, des informations relatives aux paramètres calculés tx, ty, ou k.
9 Dispositif d'estimation d'un mouvement dominant dans une séquence d'images comportant un circuit de calcul (1 ) d'un champ de vecteurs de mouvement associé à une image, définissant, pour un élément d'image de coordonnées xi, yi, un ou plusieurs vecteurs de mouvement de composantes ui, vi, caractérisé en ce qu'il comporte également des moyens de calcul pour effectuer:
- une modélisation du mouvement (2) à partir d'une représentation paramétrique simplifiée : ui = tx +k.xi vi = ty +k.yi avec tx, ty composantes d'un vecteur représentant la composante de translation du mouvement, k facteur de divergence caractérisant la composante de zoom du mouvement,
- une régression linéaire robuste (3) dans chacun des deux espaces de représentation du mouvement définis par les plans (x,u) et (y,v), x, y, u et v représentant respectivement les axes des variables xi, yi, ui et vi, pour donner des droites de régression, - un calcul des paramètres tx, ty, et k (4, 5) à partir des ordonnées à l'origine et pentes des droites de régression.
EP02805377A 2001-12-19 2002-12-12 Procede d'estimation du mouvement dominant dans une sequence d'images Withdrawn EP1468568A1 (fr)

Applications Claiming Priority (3)

Application Number Priority Date Filing Date Title
FR0116466 2001-12-19
FR0116466A FR2833797B1 (fr) 2001-12-19 2001-12-19 Procede d'estimation du mouvement dominant dans une sequence d'images
PCT/FR2002/004316 WO2003055228A1 (fr) 2001-12-19 2002-12-12 Procede d'estimation du mouvement dominant dans une sequence d'images

Publications (1)

Publication Number Publication Date
EP1468568A1 true EP1468568A1 (fr) 2004-10-20

Family

ID=8870690

Family Applications (1)

Application Number Title Priority Date Filing Date
EP02805377A Withdrawn EP1468568A1 (fr) 2001-12-19 2002-12-12 Procede d'estimation du mouvement dominant dans une sequence d'images

Country Status (9)

Country Link
US (1) US20050163218A1 (fr)
EP (1) EP1468568A1 (fr)
JP (1) JP4880198B2 (fr)
KR (1) KR100950617B1 (fr)
CN (1) CN100411443C (fr)
AU (1) AU2002364646A1 (fr)
FR (1) FR2833797B1 (fr)
MX (1) MXPA04005991A (fr)
WO (1) WO2003055228A1 (fr)

Families Citing this family (20)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JPWO2005002206A1 (ja) * 2003-06-25 2006-08-10 ノキア コーポレイション 画像データの圧縮パラメータの値を制御するデジタル撮影装置、及び画像データの圧縮パラメータ値決定方法
CN101023676B (zh) * 2004-07-20 2012-06-27 高通股份有限公司 用于时间视频压缩中运动矢量预测的方法和设备
FR2875662A1 (fr) 2004-09-17 2006-03-24 Thomson Licensing Sa Procede de visualisation de document audiovisuels au niveau d'un recepteur, et recepteur apte a les visualiser
DE602006014723D1 (de) * 2005-11-30 2010-07-15 Nippon Kogaku Kk Bewegungsvektorschätzung
WO2009070508A1 (fr) 2007-11-30 2009-06-04 Dolby Laboratories Licensing Corp. Lissage temporel d'une estimation de déplacement
JP5039921B2 (ja) * 2008-01-30 2012-10-03 インターナショナル・ビジネス・マシーンズ・コーポレーション 圧縮システム、プログラムおよび方法
WO2009128208A1 (fr) * 2008-04-16 2009-10-22 株式会社日立製作所 Codeur d’image dynamique, décodeur d’image dynamique, procédé de codage d’image dynamique et procédé de décodage d’image dynamique
CN102160381A (zh) * 2008-09-24 2011-08-17 索尼公司 图像处理设备和方法
TWI477144B (zh) * 2008-10-09 2015-03-11 Htc Corp 影像調整參數計算方法及裝置,及其電腦程式產品
CN101726256B (zh) * 2008-10-27 2012-03-28 鸿富锦精密工业(深圳)有限公司 从影像轮廓中搜寻拐点的计算机系统及方法
CN102377992B (zh) * 2010-08-06 2014-06-04 华为技术有限公司 运动矢量的预测值的获取方法和装置
JP2012084056A (ja) * 2010-10-14 2012-04-26 Foundation For The Promotion Of Industrial Science 物体検出装置
US9442904B2 (en) * 2012-12-21 2016-09-13 Vmware, Inc. Systems and methods for applying a residual error image
US9939253B2 (en) * 2014-05-22 2018-04-10 Brain Corporation Apparatus and methods for distance estimation using multiple image sensors
JP6636615B2 (ja) 2015-08-24 2020-01-29 ホアウェイ・テクノロジーズ・カンパニー・リミテッド 動きベクトル場の符号化方法、復号方法、符号化装置、および復号装置
WO2019149529A1 (fr) * 2018-02-02 2019-08-08 Koninklijke Philips N.V. Correction de valeurs de fixation normalisée dans des études de tomographie par émission de positrons pré-traitement et post-traitement
KR102710599B1 (ko) 2018-03-21 2024-09-27 삼성전자주식회사 이미지 데이터 처리 방법 및 이를 위한 장치
CN111491183B (zh) * 2020-04-23 2022-07-12 百度在线网络技术(北京)有限公司 一种视频处理方法、装置、设备及存储介质
US11227396B1 (en) * 2020-07-16 2022-01-18 Meta Platforms, Inc. Camera parameter control using face vectors for portal
JP7056708B2 (ja) * 2020-09-23 2022-04-19 カシオ計算機株式会社 情報処理装置、情報処理方法及びプログラム

Family Cites Families (10)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
KR0181034B1 (ko) * 1995-03-18 1999-05-01 배순훈 특징점 기반 움직임 추정을 이용한 움직임 벡터 검출 방법 및 장치
US5802220A (en) * 1995-12-15 1998-09-01 Xerox Corporation Apparatus and method for tracking facial motion through a sequence of images
DE69716037T2 (de) * 1996-01-22 2003-07-03 Matsushita Electric Industrial Co., Ltd. Verfahren zur kodierung und dekodierung von digitalen bildern
EP1068576A1 (fr) * 1999-02-01 2001-01-17 Koninklijke Philips Electronics N.V. Descripteur pour une sequence video et systeme de recuperation d'images utilisant ledit descripteur
EP1050849B1 (fr) * 1999-05-03 2017-12-27 Thomson Licensing Procédé d'estimation d'un mouvement dominant entre deux trames
EP1050850A1 (fr) * 1999-05-03 2000-11-08 THOMSON multimedia Procédé d'estimation d'un vecteur de mouvement dominant entre deux trames
US6865582B2 (en) * 2000-01-03 2005-03-08 Bechtel Bwxt Idaho, Llc Systems and methods for knowledge discovery in spatial data
JP3681342B2 (ja) * 2000-05-24 2005-08-10 三星電子株式会社 映像コーディング方法
AU2001273306A1 (en) * 2000-07-05 2002-01-14 Camo, Inc. Method and system for the dynamic analysis of data
US7499077B2 (en) * 2001-06-04 2009-03-03 Sharp Laboratories Of America, Inc. Summarization of football video content

Non-Patent Citations (1)

* Cited by examiner, † Cited by third party
Title
FORMENTI P ET AL: "GLOBAL-LOCAL MOTION ESTIMATION IN MULTILAYER VIDEO CODING", OPTOMECHATRONIC MICRO/NANO DEVICES AND COMPONENTS III : 8 - 10 OCTOBER 2007, LAUSANNE, SWITZERLAND; [PROCEEDINGS OF SPIE , ISSN 0277-786X], SPIE, BELLINGHAM, WASH, vol. 1818, no. PART 02, 1 January 1992 (1992-01-01), pages 573 - 584, XP000911793, ISBN: 978-1-62841-730-2, DOI: 10.1117/12.131473 *

Also Published As

Publication number Publication date
CN100411443C (zh) 2008-08-13
JP4880198B2 (ja) 2012-02-22
FR2833797B1 (fr) 2004-02-13
JP2005513929A (ja) 2005-05-12
US20050163218A1 (en) 2005-07-28
KR100950617B1 (ko) 2010-04-01
AU2002364646A1 (en) 2003-07-09
CN1608380A (zh) 2005-04-20
WO2003055228A1 (fr) 2003-07-03
KR20040068291A (ko) 2004-07-30
MXPA04005991A (es) 2004-09-27
FR2833797A1 (fr) 2003-06-20

Similar Documents

Publication Publication Date Title
WO2003055228A1 (fr) Procede d'estimation du mouvement dominant dans une sequence d'images
EP2326091B1 (fr) Procédé et appareil de synchronisation de données vidéo
US7508990B2 (en) Apparatus and method for processing video data
US20080273751A1 (en) Detection and Tracking of Moving Objects from a Moving Platform in Presence of Strong Parallax
JP2005513929A6 (ja) 画像のシーケンスにおける主要な動きを推定する方法
US12056949B1 (en) Frame-based body part detection in video clips
Chen et al. Variational fusion of time-of-flight and stereo data for depth estimation using edge-selective joint filtering
CN114170325B (zh) 确定单应性矩阵的方法、装置、介质、设备和程序产品
CN112396074A (zh) 基于单目图像的模型训练方法、装置及数据处理设备
Baracchi et al. Facing image source attribution on iPhone X
Joshi et al. Tampering detection and localization in digital video using temporal difference between adjacent frames of actual and reconstructed video clip
CN114239736A (zh) 光流估计模型的训练方法和装置
Jung et al. Object Detection and Tracking‐Based Camera Calibration for Normalized Human Height Estimation
CN113592940A (zh) 基于图像确定目标物位置的方法及装置
Li et al. Detection of blotch and scratch in video based on video decomposition
US20060093215A1 (en) Methods of representing and analysing images
Milani et al. Audio tampering detection using multimodal features
Hu et al. Feature-based real-time video stabilization for vehicle video recorder system
Chittapur et al. Exposing digital forgery in video by mean frame comparison techniques
KR20160126985A (ko) 비디오의 방향을 결정하기 위한 방법 및 장치
Amer Object and event extraction for video processing and representation in on-line video applications
CN117132503A (zh) 一种图像局部高亮区域修复方法、系统、设备及存储介质
Springer et al. Robust Rotational Motion Estimation for efficient HEVC compression of 2D and 3D navigation video sequences
CN116453086A (zh) 识别交通标志的方法、装置和电子设备
Chunxian et al. Hybrid video stabilization for mobile vehicle detection on SURF in aerial surveillance

Legal Events

Date Code Title Description
PUAI Public reference made under article 153(3) epc to a published international application that has entered the european phase

Free format text: ORIGINAL CODE: 0009012

17P Request for examination filed

Effective date: 20040702

AK Designated contracting states

Kind code of ref document: A1

Designated state(s): AT BE BG CH CY CZ DE DK EE ES FI FR GB GR IE IT LI LU MC NL PT SE SI SK TR

AX Request for extension of the european patent

Extension state: AL LT LV MK RO

RIN1 Information on inventor provided before grant (corrected)

Inventor name: MARREC, SYLVAIN

Inventor name: LE CLERC, FRANEOIS

RAP1 Party data changed (applicant data changed or rights of an application transferred)

Owner name: THOMSON LICENSING

RAP1 Party data changed (applicant data changed or rights of an application transferred)

Owner name: THOMSON LICENSING

17Q First examination report despatched

Effective date: 20161114

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE APPLICATION IS DEEMED TO BE WITHDRAWN

18D Application deemed to be withdrawn

Effective date: 20170325