EP2852917A1 - Procede d'analyse parcimonieuse de signaux par approche non-orientee - Google Patents

Procede d'analyse parcimonieuse de signaux par approche non-orientee

Info

Publication number
EP2852917A1
EP2852917A1 EP13724250.9A EP13724250A EP2852917A1 EP 2852917 A1 EP2852917 A1 EP 2852917A1 EP 13724250 A EP13724250 A EP 13724250A EP 2852917 A1 EP2852917 A1 EP 2852917A1
Authority
EP
European Patent Office
Prior art keywords
decomposition
dictionary
atoms
atom
expression
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Withdrawn
Application number
EP13724250.9A
Other languages
German (de)
English (en)
Inventor
Quentin BARTHELEMY
Anthony Larue
Jérôme MARS
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Institut Polytechnique de Grenoble
Commissariat a lEnergie Atomique et aux Energies Alternatives CEA
Original Assignee
Institut Polytechnique de Grenoble
Commissariat a lEnergie Atomique et aux Energies Alternatives CEA
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Institut Polytechnique de Grenoble, Commissariat a lEnergie Atomique et aux Energies Alternatives CEA filed Critical Institut Polytechnique de Grenoble
Publication of EP2852917A1 publication Critical patent/EP2852917A1/fr
Withdrawn legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V40/00Recognition of biometric, human-related or animal-related patterns in image or video data
    • G06V40/20Movements or behaviour, e.g. gesture recognition
    • G06V40/28Recognition of hand or arm movements, e.g. recognition of deaf sign language
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F18/00Pattern recognition
    • G06F18/20Analysing
    • G06F18/21Design or setup of recognition systems or techniques; Extraction of features in feature space; Blind source separation
    • G06F18/213Feature extraction, e.g. by transforming the feature space; Summarisation; Mappings, e.g. subspace methods
    • G06F18/2136Feature extraction, e.g. by transforming the feature space; Summarisation; Mappings, e.g. subspace methods based on sparsity criteria, e.g. with an overcomplete basis

Definitions

  • the invention relates to a parsimonious decomposition method by non-oriented approach and a non-oriented dictionary learning method.
  • the invention relates to a method for decomposing movements. It applies in particular to the fields of robotics, computer vision, statistics and learning.
  • 3D space In the three-dimensional space also called 3D space, it is useful in many applications to be able to decompose the motion in time of an object composed of P points and N temporal samples.
  • This object can be described as the sum of K basic vectors. To describe this object, several models can be envisaged.
  • Each instant 3D shape A [n] ⁇ R 3 ' p can be described using the expression:
  • Sk CR 3 ' p represents the shape vectors.
  • the disadvantage of this model is that the base of the shape vectors is composed of specific forms specific to the studied object and needs to be re-estimated for each new object. To avoid this lack of flexibility, it is possible to exploit the duality between the base of forms and the base of trajectories used.
  • the trajectory database is defined independently of the data.
  • Each 3D trajectory B [p] ⁇ M 3 * N is defined by the expression:
  • a time trajectory 100 is decomposed into a sum 101 of one-dimensional vectors 102, each vector being weighted by a three-dimensional coefficient 103.
  • a multi-component signal 1 10 can be expressed as being the sum of 1 1 1 multi-component patterns 1 12 weighted by a scalar 1 13 as shown in Figure 1 b. Reduced to three components, a temporal trajectory in a 3D space of N samples is seen as the sum of 3D trajectories. In this case, the decomposition of each path y ⁇ M 3 * N can be described using the expression:
  • the index p is omitted in the following because the description focuses on the 3D trajectory of a single point.
  • each single-component trajectory 9 k relying on one of the patterns 1 D is multiplied by three coefficients, that is to say one coefficient per dimension.
  • each tri-component trajectory is decomposed with 3D patterns cp k , each pattern being multiplied by the scalar coefficient 1 13.
  • a trajectory corresponds to a weighted sum of several patterns 3D.
  • An object of the invention is in particular to overcome the aforementioned drawbacks.
  • the subject of the invention is a method of decomposing a three-dimensional coordinate frame y into a sum of trivariate atoms cp k weighted by a coefficient x k , a rotation matrix R k being applied to these weighted atoms, the method comprising the following steps iteratively applied:
  • the selected atoms are deduced from the dictionary ⁇ by time shifts ⁇ of the nuclei component.
  • the dictionary ⁇ is standardized and redundant.
  • at least one atom is selected during the selection step, said atom being the one that makes it possible to obtain the greatest decay in absolute value of the mean squared error is selected.
  • An optimization step may be applied after the calculation of the residue in order to adjust the weighting coefficients x k and the rotation matrices R k of the selected atoms, this optimization being carried out by orthogonal projection of the signal y on the selected atoms by minimization least squares to minimize the value of the residue.
  • the weighting coefficients x k and the rotation matrices R k are for example optimized so that the coefficients x k are updated while the matrices R k are fixed and vice versa, each update being based on the Gradient descent technique.
  • the subject of the invention is also a method of learning a dictionary composed of at least one nucleus, said dictionary being adapted for the decomposition of a three-dimensional coordinate frame.
  • the learning method comprises the following steps applied iteratively and consisting of:
  • the cores are for example initialized on uniform white noise and are standardized.
  • the update step is based on a stochastic gradient descent.
  • the invention also relates to a device for learning three-dimensional movements implementing the decomposition method described above.
  • FIG. 1 a illustrates a model of decomposition of a trajectory in a sum of scalar-weighted single-component vectors, one per dimension
  • FIG. 1b illustrates a model of decomposition of a temporal trajectory into a sum of multi-component motifs weighted by scalars
  • FIG. 3 is a diagram illustrating in simplified manner one embodiment of the 3DRI-OMP method
  • FIG. 4 gives an example of a three-dimensional registration method that can be used by the 3DRI-OMP method
  • FIG. 5 shows an exemplary step of optimization of the decomposition that can be implemented in one embodiment of the 3DRI-OMP method
  • FIG. 6 illustrates a method for learning 3D patterns from a set of signals that can be implemented in one embodiment of the 3DRI-DLA method
  • FIG. 7a represents an example of a dictionary comprising six trivariate nuclei at the initialization of the learning
  • FIG. 7b represents the same dictionary at the end of the training after application of the 3DRI-DLA method
  • FIG. 8 illustrates the rotational invariant 3D trajectories associated with a NOLD dictionary
  • FIG. 9a represents an example of an original 3D trajectory
  • FIG. 9b represents the same non-oriented reconstructed trajectory
  • FIG. 9c represents the oriented reconstructed trajectory
  • FIG. 10a represents an example of a 3D trajectory after rotation
  • FIG. 10b represents the same non-oriented reconstructed trajectory
  • FIG. 10c represents the oriented reconstructed trajectory.
  • the decomposition method described below deals with tri-component signals.
  • tri-component signals are distinguishable from so-called three-dimensional signals.
  • a temporal signal y ⁇ M 3 * N composed of N 3D coordinates is sometimes improperly called three-dimensional.
  • this signal is not three-dimensional but tri-component, that is to say trivariate or three-channel depending on the model used.
  • a three-dimensional signal is of the form y ⁇ ] 3 ⁇ 4 N1 * N2 * N3 j such as video frames or any other cubic data.
  • the parsimonious decomposition method described below uses a model invariant to 3D rotation.
  • This model is designated by the acronym 3DRI coming from the Anglo-Saxon expression "3D rotation invariant”.
  • Figure 2 illustrates this decomposition model.
  • This uses a sum 204 of 3D patterns 202 to decompose a multicomponent signal 200.
  • the units 204 are associated with a coefficient 201 and a rotation matrix 203.
  • This decomposition model is defined by the expression:
  • trajectory y can be represented as the weighted sum of rotatable 3D patterns.
  • the 3D patterns are also called atoms.
  • FIG. 3 is a diagram illustrating in a simplified manner a mode of implementation of the decomposition method according to the invention.
  • This family of processes is designated in the remainder of the description using the acronym 3DRI-OMP.
  • the method comprises a starting phase 31 1, a three-dimensional resetting phase 31 2, a finalization phase of the decomposition 31 3 and a stopping phase 314.
  • the set of steps implemented by this method are described in FIG. following the description.
  • the problem solved by the decomposition process is formalized.
  • the general principle of the process is introduced.
  • the three-dimensional registration is described in detail.
  • the other steps of the method are described in order to allow a global understanding of this example of implementation of the method according to the invention.
  • the matrices R will be considered as always orthogonal and thus checking the condition C 0 .
  • a rigid transformation composed of a 3D rotation R and a spatial translation T is considered here between the trivariate motif ⁇ and the original signal y.
  • the orthogonal problem of Procrustes consists in finding the parameters R and T such that:
  • a first method proposes a decomposition into singular values
  • a second method proposes a decomposition by unit quaternions
  • a third method proposes a decomposition by orthonormal matrices.
  • the multi-view problem reconstructs the y signal from several q> k observations taken from different angles, as shown in the article by B. Kamgar-Parsi, J. Jones, and A. Rosenfeld entitled Registration of multiple overlapping range images: scenes without distinctive features, IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 13, pp. 857-871, 1991. Since the different views overlap, the problem is given by the expression: min sr (7)
  • R k represents the rotation matrix
  • T k represents the translation associated with the trivariate pattern q> k. This formulation is different from the problem expressed by the expression (5). Indeed, in the expression (7), the union of the motifs is considered but not the sum as in the expression (5).
  • the problem can be solved by calculating the optimal registration matrix R by the method based on the orthonormal matrices for each sample ⁇ . Moreover, parameterized in this way, the method is not scaling invariant since there is no scaling factor x in the optimization. If there is no offset, the problem illustrated by the expression (6) of 3D registration is found.
  • y represents a set of N 3D points; ⁇ ⁇ a subset of N 3D points among the possible ⁇ , with ⁇ > ⁇ .
  • the ICP algorithm uses pattern signatures to identify the N indices ⁇ .
  • model (1) describes a 3D object as a linear combination of basic vectors of shapes.
  • the object is now a linear combination of basic vectors of trajectories. It should be noted that these two contributions come from the structure-of-motion of the computer vision community, usually referred to as "computer vision”.
  • An orthogonal projection is used to estimate 3D structures from 2D movements.
  • a redundant base composed of M> N elements is called a dictionary.
  • the dictionary elements are no longer called vectors but atoms.
  • the model of the expression (3) has been introduced in this domain, and the choice of atoms and the estimation of the coefficients are made by parsimonious multivariate approximation.
  • the model introduced by the expression (4) allows the atoms to rotate, but the associated rotational matrices must also be estimated.
  • nuclei In the case of invariance by translation, the objective is to encode the signal y sparingly as a sum of short structures called nuclei. These nuclei are characterized independently of their positions. This model is usually applied to time-series data and avoids block effects in the analysis of periodic large-period signals and gives a compact kernel dictionary.
  • a dictionary ⁇ For decomposition, a dictionary ⁇ is used.
  • This dictionary includes a set of predefined kernels. In this case it is said that the dictionary is compact.
  • the L kernels of the compact dictionary ⁇ can be translated and replicated at all possible positions to form the M atoms of a dictionary ⁇ .
  • the signal decomposition is performed in a series of steps performed over several iterations. After each iteration, the residual error ⁇ is estimated and the decomposition continues on this basis.
  • the N samples of the signal y, the residual error ⁇ and the atoms (m are indexed by the time t.
  • the nucleus ⁇ ( ⁇ ) is shifted to the sample ⁇ to form the atom ⁇ ( ⁇ - ⁇ ).
  • a completion of zeros is made to have N samples.
  • the set ⁇ contains the active translations ⁇ of the kernel ⁇ ( ⁇ ). For the few nuclei that generate all the atoms, the signal is expressed as follows:
  • the dictionary ⁇ is the concatenation of L matrices of Toeplitz and is L times over-complete. Since M> N, the dictionary is redundant and the linear system is therefore under-determined and accepts multiple solutions.
  • the introduction of constraints such as parsimony makes it possible to regularize the solution.
  • the parsimonious approximation selects K active atoms among the possible M and calculates their associated coefficients to have the best approximation of the signal y.
  • the problem of parsimonious approximation can be formulated using the expression: min. y (- ⁇ 3 ⁇ 4, (i -7) such that ⁇ x ⁇ ⁇ K (12)
  • K "M is a constant;
  • 0 represents the cardinal of the vector x.
  • the problem to solve to decompose the signal y can be expressed analytically in the following way: such as :
  • the second special case is that when each R k is equal to the identity matrix, we find the problem of parsimonious approximation described using the expression (12), and this with trivariate signals.
  • This case is solved by the algorithm Multivariate-OMP designated by the acronym M-OMP as shown in the article by Q. Barthakimy, A. Lame, A. Mayoue, D. Mercier and J. Mars entitled Shift & 2D rotation invariant sparse coding for multivariate signais, IEEE Trans. on Signal Processing, vol. 60, pp. 1597- 161 1, 2012.
  • FIG. 4 gives an example of a three-dimensional registration method that can be used by the 3DRI-OMP sparse decomposition method according to the invention.
  • the registration problem previously expressed by the expression (6) is considered here with a normed ⁇ pattern, but without spatial translation.
  • a decomposition into singular values can be implemented. For this, several methods are possible. Note that the technique of decomposition in singular values is referred to in the following description by the acronym SVD from the English expression "Singular Value Decomposition".
  • U ⁇ R 3 * 3 denotes the matrix of the orthonormal input vectors; ⁇ ⁇ R 3 * 3 denotes the matrix containing the singular values of M c ;
  • V ⁇ R 3 * 3 denotes matrix of orthonormal output vectors.
  • the 3DRI-OMP method illustrated with reference to FIG. 3 uses, as input data, a trivariate signal y ⁇ M 3 * N to be decomposed and a dictionary ⁇ of translatable kernels.
  • the dictionary is standardized. This means that the kernels composing this dictionary are normalized. Given this redundant dictionary, that is to say over-complete, the method produces a parsimonious approximation of the signal y. For this, once the execution of the process is triggered
  • an initialization step 301 allocates the studied signal y 302 to a residue ⁇ °.
  • the algorithm selects the atom that produces the greatest absolute decay in the mean squared error H ⁇ ⁇ "1
  • the correlation value trace ( ⁇ ⁇ ⁇ ⁇ ( ⁇ - ⁇ ) ⁇ ⁇ ⁇ "1 ( ⁇ ) ⁇ ) is calculated for each shift ⁇ , where R k ! iX is the optimal matrix for shifting ⁇ ( ⁇ - ⁇ ) on £ k" 1 (t).
  • the maximum of the absolute values of x k i, x is then sought 305 in order to select the optimal atom.
  • the optimal atom is characterized by its core index l k and its position x k
  • the vector x accumulates the active coefficients, that is to say the non-zero coefficients, which are the maximums of the correlation values, ie: x ⁇ - x U x kk
  • the associated optimal rotation matrices are grouped in R, ie:
  • an optimization step 307 it is possible to use an optimization step 307 to improve the solution obtained.
  • the results obtained in step 306 are used to initialize this optimization step 307.
  • the function of the optimization step 307 is to refine the calculation of the coefficients and rotation matrices by orthogonal projection of the signal y. on the selected atoms.
  • the coefficients and matrices obtained following the application of the previous steps 303, 305, 306 are corrected to take into account the new atom and give the least squares solution.
  • the optimization method solves by successive iterations the least squares problem described in the expression (13).
  • the exponent k of the variables ⁇ ⁇ ⁇ , ⁇ and is omitted to reduce the notations and the index ⁇ 1 ..k designates the different elements already selected at the iteration k.
  • the optimization procedure aims to solve this problem.
  • the following expression can be used:
  • Min XiR () designates the minimum of a function with respect to one or more variables
  • Arg () is the value or values that give the minimum.
  • the stopping criterion 308 can be chosen from among several candidates.
  • the stopping criterion can be based on a threshold on k, on a predefined number of iterations, on a threshold on the square root of the mean squared error
  • the result obtained using this method is a parsimonious K-approximation of y using the selected active elements:
  • the parsimonious decomposition method can also be described using the pseudo code given below.
  • FIG. 5 shows an exemplary step of optimization of the decomposition that can be implemented in one embodiment of the 3DRI-OMP three-dimensional sparse decomposition method.
  • updates of the coefficients x and rotational matrices R are implemented. These updates are performed alternately on x and R, in other words, one is updated while the other is fixed and vice versa. In addition, each update is based on a gradient descent.
  • the variables x, R and ⁇ ⁇ are initialized at the time of step 306.
  • An exponent i is added to the variables to mark the current iteration of the optimization procedure.
  • the coefficients x are then updated 502.
  • the LMS method an acronym derived from the Anglo-Saxon "least mean squares" can be used.
  • Each coefficient ⁇ ⁇ ⁇ can be updated using the expression:
  • ⁇ ', ⁇ ⁇ + ⁇ traceiR ⁇ 1 (t - ⁇ ⁇ ) e k (t) T ) (1 7) in which ⁇ denotes the adaptive descent step.
  • each of the nine elements of the N correlation matrices M c ( ⁇ , ⁇ ) £ k "1 (t) ⁇ ( ⁇ - ⁇ ) ⁇ can be calculated by fast Fourier transform with a complexity of 0 [N. log (N)] for all ⁇ Then the N readjustments are computed in O (N), so the resulting complexity is O [N.log (N)].
  • the process can easily be extended to larger dimensions, considering y ⁇ M D * N with D> 3. In this case, the physical meaning of the transformation matrix is lost.
  • Figure 6 illustrates a method of learning 3D patterns from a set of signals.
  • the model introduced with expression (1) describes a 3D object as a linear combination of basic pattern vectors. Since the shape base is dedicated to the object being studied, it must be re-estimated for each new object. A generalized EM algorithm can be used to learn three-dimensional forms adapted to the studied data.
  • an EM algorithm can be used to learn 1D trajectories adapted to the studied data.
  • DLA Dynamic Learning Algorithm
  • This learning process is designated by the acronym 3DRI-DLA. This process successively processes each learning signal y q 603.
  • a step 601 corresponds to a parsimonious 3D decomposition and a step 602 corresponds to an update of the dictionary.
  • the parsimonious 3D decomposition 601 can be performed using the 3DRI-OMP method described above.
  • tq is an abbreviation of the expression "such as”.
  • the update step of the dictionary 602 is based on the maximum likelihood criterion, under Gaussian bench noise hypothesis. For this, the following expression can be used:
  • the cores are normalized at the end of each iteration, and their lengths can be varied according to the energy present at their edges.
  • the two steps 601, 602 are applied to all the signals 604 of the signal base 603 used at the input of the method.
  • different stopping criteria can be used, such as for example the thresholding on rRMSE, an acronym derived from the English expression Relative Root Mean-Squared Error ", calculated on the set of learning or thresholding on j, that is to say on the number of iterations.
  • the characteristic elementary patterns of a set of signals have been learned empirically in the optimal dictionary which together provides parsimonious approximations for all the signals of this set.
  • 3DRI-OMP and 3DRI-DLA processes are independent of the motion capture system used. Thus, it may be of inertial, magnetic or optical type with active or passive markers. All these acquisition systems provide 3D spatial coordinates which are the motion signals processed by our methods.
  • Figures 7a and 7b show an example of a set of signals belonging to an unoriented dictionary.
  • the 3DRI-DLA and 3DRI-OMP methods are applied to speech signals of the LPC spoken-complete language.
  • This language associates labial joints with keys formed by the hand. Subsequently, only the movements of the hand are studied.
  • the hand can be placed in different configurations corresponding to consonants and in different face placements corresponding to vowels.
  • the signals are acquired by an optical acquisition system, providing the 3D spatial coordinates of a marker.
  • Q 57 raw signals are derived to give the speed signals v x , v y and v z . These three-dimensional signals are used as input signals for the application of the methods.
  • the 3DRI-DLA method is applied to the data previously described.
  • This learning method is compared with a known method of the M-DLA type.
  • a dictionary learned using the 3DRI-DLA method is said to be unoriented, and is thus designated using the acronym NOLD from the English expression "Non-Oriented Learned Dictionary" because the nuclei are invariant to rotation and no longer learned in a fixed orientation as is the case with a method of M-DLA type.
  • the dictionary thus obtained is illustrated using FIGS. 7a and 7b.
  • the solid lines 700 and dotted lines 701, 702 represent the three components v x , v y and v z .
  • FIG. 8 shows the rotational invariant 3D trajectories associated with the NOLD dictionary.
  • the stars 800, 801, 802, 803, 804, 805 represent the beginning of the trajectories. Due to the integration, nuclei of different speeds can give very similar trajectories. These trajectories, extracted by the 3DRI-DLA method, correspond to the basic motifs of the LPC gestural language.
  • the parsimonious decomposition process 3DRI-OMP is then applied with the NOLD dictionary, which gives a suitable and non-oriented decomposition.
  • the main atoms are those of higher amplitudes, and they concentrate the relevant information.
  • the secondary atoms encode the variabilities between the different realizations of the same gesture.
  • Figure 9a shows the original 3D trajectory of y 5 2
  • Figure 9b represents the non-oriented reconstructed trajectory
  • Figure 9c represents the oriented reconstructed trajectory.
  • Figure 10a represents the y 3D 5 trajectory 2 '
  • Figure 10b represents the non-oriented reconstructed trajectory
  • Figure 10c shows the reconstructed oriented path.
  • the non-oriented reconstructions of FIGS. 9b and 10b are identical. Indeed, the same atoms are used with the same amplitudes. Only rotations change. These rotations correspond to the random angle applied to the signal y 5 2- advantageous property of invariance to rotation of the non-oriented methods is thus illustrated. Conversely, the oriented methods give very different reconstructions results as illustrated in Figures 9c and 10c. It may be noted that the atoms used are not the same for each reconstruction. This demonstrates the limitation of a fixed-oriented dictionary in a particular direction, this limitation being avoided when rotation-invariant reconstruction methods are used.
  • the unoriented approach provides better reconstruction results whether the data is rotated or not.
  • it allows to obtain and use a compact dictionary whose nuclei can be rotated as well as decompositions invariant to 3D rotations.
  • the non-oriented approach can be implemented in robotics, especially in order to give robots a human approach and not more mechanical. Always in robotics, this approach can be implemented work in biometric recognition systems to identify an individual based on the characteristics of his walk. By performing a classification step on the parameters of our decompositions, it is possible to make this recognition.
  • this approach can be implemented for the recognition of 3D gestures.
  • the invention can also be implemented for object tracking, trajectory analysis, learning primitives movement. Following these treatments, it is then possible to perform gesture recognition.

Landscapes

  • Engineering & Computer Science (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • Theoretical Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • General Physics & Mathematics (AREA)
  • Social Psychology (AREA)
  • Human Computer Interaction (AREA)
  • Health & Medical Sciences (AREA)
  • Psychiatry (AREA)
  • Multimedia (AREA)
  • General Health & Medical Sciences (AREA)
  • Data Mining & Analysis (AREA)
  • Life Sciences & Earth Sciences (AREA)
  • Artificial Intelligence (AREA)
  • Bioinformatics & Cheminformatics (AREA)
  • Bioinformatics & Computational Biology (AREA)
  • Evolutionary Biology (AREA)
  • Evolutionary Computation (AREA)
  • General Engineering & Computer Science (AREA)
  • Image Analysis (AREA)
  • Processing Or Creating Images (AREA)

Abstract

L'invention a pour objet un procédé de décomposition d'une trame de coordonnées tridimensionnelles y en une somme d'atomes trivariés phi k pondérés par un coefficient ϰ k , une matrice de rotation R k étant appliquée à ces atomes pondérés. Le procédé comprenant les étapes suivantes appliquées de manière itérative : un recalage 3D (303) de l'ensemble des atomes tridimensionnels obtenus à partir d'un dictionnaire psi non orienté, le recalage étant effectué en utilisant la technique de décomposition en valeurs singulières afin d'obtenir un coefficient ϰ k et une matrice de rotation R k pour chaque atome; une sélection (305) d'au moins un atome, de son coefficient associé ϰ k et de sa matrice associée R k de manière à obtenir une décomposition parcimonieuse de la trame de coordonnées tridimensionnelles; un calcul du résidu de décomposition (306) après prise en compte du dernier atome sélectionné, ledit résidu étant utilisé par l'étape de recalage 3D de l'itération suivante.

Description

PROCEDE D'ANALYSE PARCIMONIEUSE DE SIGNAUX PAR
APPROCHE NON-ORIENTEE
L'invention concerne un procédé de décomposition parcimonieuse par approche non-orientée et un procédé d'apprentissage de dictionnaire non-orienté.
L'invention concerne un procédé de décomposition de mouvements. Elle s'applique notamment aux domaines de la robotique, de la vision par ordinateur, de la statistique et de l'apprentissage.
Dans l'espace tridimensionnel appelé aussi espace 3D, il est utile dans de nombreuses applications de pouvoir décomposer le mouvement dans le temps d'un objet composé de P points et de N échantillons temporels. Cet objet peut être décrit comme la somme de K vecteurs de base. Pour décrire cet objet, plusieurs modèles peuvent être envisagés.
Un objet 3D peut être décrit comme N nuages de points 3D successifs A[n] pour n = 1 ... N. Chaque forme 3D instantanée A[n] Θ R3'p peut être décrite en utilisant l'expression :
K
A[n] =∑ak [n] Sk \ k=l dans laquelle : ak[n] Θ R représente le coefficient instantané ; R représente l'ensemble des réels ;
Sk C R3'p représente les vecteurs de forme.
L'inconvénient de ce modèle est que la base des vecteurs de formes est composée de formes particulières spécifiques à l'objet étudié et a besoin d'être ré-estimée pour chaque nouvel objet. Pour éviter ce manque de flexibilité, il est possible d'exploiter la dualité entre la base de formes et la base de trajectoires utilisées. La base de trajectoires est définie indépendamment des données. L'objet 3D est décrit comme P trajectoires temporelles 3D B[p] pour p = 1 ... P. Chaque trajectoire 3D B[p] Θ M3*N est définie par l'expression :
B[p] =∑bk[P] 0k (2) k=l dans laquelle : bk[p] Θ M3*1 désigne les coefficients ; 9k Θ M1 *N désigne les vecteurs de trajectoires.
Dans ce cas, et comme cela est illustré avec la figure 1 a, une trajectoire temporelle 100 est décomposée en une somme 101 de vecteurs monodimensionnels 102, chaque vecteur étant pondéré par un coefficient tridimensionnel 103.
De manière alternative, un signal multi-composantes 1 10 peut s'exprimer comme étant la somme 1 1 1 de motifs multi-composantes 1 12 pondérés par un scalaire 1 13 comme illustré avec la figure 1 b. Réduite à trois composantes, une trajectoire temporelle dans un espace 3D de N échantillons est vue comme la somme de trajectoires 3D. Dans ce cas, la décomposition de chaque trajectoire y Θ M3*N peut être décrite en utilisant l'expression :
K
y =∑xk<pk 0) k=l dans laquelle : xk Θ R représente les coefficients de pondération ; cpk Θ M3*N représente les motifs 3D. Pour alléger la notation, l'indice p est omis dans la suite du fait que la description se concentre sur la trajectoire 3D d'un seul point.
Dans le modèle de l'expression (2) et de la figure 1 a, chaque trajectoire uni- composante 9k s'appuyant un des motifs 1 D est multipliée par trois coefficients, c'est-à-dire un coefficient par dimension. Dans le modèle de l'expression (3) et de la figure 1 b, chaque trajectoire tri-composantes est décomposée avec des motifs 3D cpk, chaque motif étant multiplié par le coefficient scalaire 1 13. Ainsi, une trajectoire correspond à une somme pondérée de plusieurs motifs 3D. L'avantage d'utiliser le modèle décrit par l'expression (3) et la figure 1 b est de travailler avec des trajectoires 3D dont les trois composantes peuvent être très différentes. Cependant, ces modèles nécessitent des dictionnaires de taille importante et la qualité de la décomposition est dégradée si un même mouvement est orienté de manière différente dans un même repère 3D.
Un but de l'invention est notamment de pallier les inconvénients précités.
A cet effet l'invention a pour objet un procédé de décomposition d'une trame de coordonnées tridimensionnelles y en une somme d'atomes trivariés cpk pondérés par un coefficient xk , une matrice de rotation Rk étant appliquée à ces atomes pondérés, le procédé comprenant les étapes suivantes appliquées de manière itérative :
- un recalage 3D de l'ensemble des atomes tridimensionnels obtenus à partir d'un dictionnaire ψ non orienté, le recalage étant effectué en utilisant la technique de décomposition en valeurs singulières afin d'obtenir un coefficient xk et une matrice de rotation Rk pour chaque atome ;
- une sélection d'au moins un atome, de son coefficient associé xk et de sa matrice associée Rk de manière à obtenir une décomposition parcimonieuse de la trame de coordonnées tridimensionnelles ;
- un calcul du résidu de décomposition après prise en compte du dernier atome sélectionné, ledit résidu étant utilisé par l'étape de recalage 3D de l'itération suivante. Selon un aspect de l'invention, les atomes sélectionnés sont déduits du dictionnaire ψ par décalages temporels τ des noyaux le composant.
Selon un autre aspect, le dictionnaire ψ est normé et redondant. Dans un mode de réalisation, au moins un atome est choisi durant l'étape de sélection, ledit atome celui permettant d'obtenir la plus forte décroissance en valeur absolue de l'erreur quadratique moyenne est sélectionné.
Une étape d'optimisation peut être appliquée après le calcul du résidu afin d'ajuster les coefficients de pondération xk et les matrices de rotation Rk des atomes sélectionnés, cette optimisation étant réalisée par projection orthogonale du signal y sur les atomes sélectionnés par minimisation des moindres carrés afin réduire le plus possible la valeur du résidu.
Les coefficients de pondération xk et les matrices de rotation Rk sont par exemple optimisés de manière à ce que les coefficients xk soient mis à jour pendant que les matrices Rk sont fixées et vice versa, chaque mise à jour étant basée sur la technique de descente de gradient.
L'invention a aussi pour objet un procédé d'apprentissage d'un dictionnaire composé d'au moins un noyau, ledit dictionnaire étant adapté pour la décomposition d'une trame de coordonnées tridimensionnelles.
Le procédé d'apprentissage comprend les étapes suivantes appliquées de manière itérative et consistant en :
- une initialisation des noyaux à apprendre ;
- une décomposition non-orientée par application du procédé de décomposition décrit précédemment à une base de signaux prédéterminée ;
- une mise à jour des noyaux basée sur le critère du maximum de vraisemblance sous hypothèse de bruit banc gaussien. Les noyaux sont par exemple initialisés sur du bruit blanc uniforme et sont normés.
Selon un aspect de l'invention, l'étape de mise à jour est basée sur une descente de gradient stochastique.
L'invention a aussi pour objet un dispositif d'apprentissage de mouvements tridimensionnels mettant en œuvre le procédé de décomposition décrit précédemment.
D'autres caractéristiques et avantages de l'invention apparaîtront à l'aide de la description qui suit donnée à titre illustratif et non limitatif, faite en regard des dessins annexés parmi lesquels : la figure 1 a illustre un modèle de décomposition d'une trajectoire temporelle en une somme de vecteurs monocomposantes pondérés par des scalaires, un par dimension ; la figure 1 b illustre un modèle de décomposition d'une trajectoire temporelle en une somme de motifs multi- composantes pondérés par des scalaires ;
- la figure 2 un modèle de décomposition utilisant un modèle invariant à la rotation 3D ;
la figure 3 présente un diagramme illustrant de manière simplifiée un mode de mise en œuvre du procédé 3DRI- OMP ;
- la figure 4 donne un exemple de méthode de recalage tridimensionnel pouvant être utilisé par le procédé 3DRI- OMP ;
la figure 5 présente un exemple d'étape d'optimisation de la décomposition pouvant être mise en œuvre dans un mode de réalisation du procédé 3DRI-OMP ; la figure 6 illustre un procédé d'apprentissage de motifs 3D a partir d'un ensemble de signaux pouvant être mise en œuvre dans un mode de réalisation du procédé 3DRI-DLA ;
la figure 7a représente un exemple de dictionnaire comprenant six noyaux trivariés à l'initialisation de l'apprentissage ;
la figure 7b représente le même dictionnaire à la fin de l'apprentissage après application du procédé 3DRI-DLA ; la figure 8 illustre les trajectoires 3D invariantes à la rotation associées à un dictionnaire NOLD ;
la figure 9a représente un exemple de trajectoire 3D originale, la figure 9b représente la même trajectoire reconstruite non- orientée et la figure 9c représente la trajectoire reconstruite orientée ;
la figure 10a représente un exemple de trajectoire 3D après rotation, la figure 10b représente la même trajectoire reconstruite non-orientée et la figure 10c représente la trajectoire reconstruite orientée. Le procédé de décomposition décrit ci-après traite des signaux tri- composantes. A noter que les signaux tri-composantes sont à distinguer de signaux dits tridimensionnelles. En effet, un signal temporel y Θ M3*N composé de N coordonnées 3D est parfois improprement appelé tridimensionnel. En fait, ce signal n'est pas tridimensionnel mais tri- composante, c'est-à-dire trivarié ou tricanal selon le modèle utilisé. Un signal tridimensionnel est de la forme y Θ ]¾N1 *N2*N3 j telle que les trames vidéo ou tout autre donnée cubique.
Le procédé de décomposition parcimonieuse décrit ci-après utilise un modèle invariant à la rotation 3D. Ce modèle est désigné par l'acronyme 3DRI venant de l'expression anglo-saxonne « 3D rotation invariant ». La figure 2 illustre ce modèle de décomposition. Celui-ci met en œuvre une somme 204 de motifs 3D 202 afin de décomposer un signal multi- composantes 200. Aux motifs 204 sont adjoints un coefficient 201 et une matrice de rotation 203. Ce modèle de décomposition est défini par l'expression :
K
y =∑¾¾ > (4) k=l dans laquelle Rk 6 M3*3 représente la matrice de rotation associée au motif trivarié cpk.
Chaque matrice de rotation Rk doit être orthogonale, c'est-à-dire qu'elle doit vérifier la condition noté C0 et correspondant à l'expression RkRk T=ld dans laquelle Id représente la matrice identité et (.)T représente l'opérateur « transposée ».
En utilisant ce modèle, la trajectoire y peut être représentée comme la somme pondérée de motifs 3D pouvant tourner. Dans la suite de la description, les motifs 3D sont aussi appelés atomes.
La figure 3 est un diagramme illustrant de manière simplifiée un mode de mise en œuvre du procédé de décomposition selon l'invention. Cette famille de procédés est désignée dans la suite de la description en utilisant le sigle 3DRI-OMP. Le procédé comprend une phase de démarrage 31 1 , une phase de recalage tridimensionnel 31 2, une phase de finalisation de la décomposition 31 3 et une phase d'arrêt 314. L'ensemble des étapes mises en œuvre par ce procédé sont décrites dans la suite de la description. Dans un premier temps, le problème que résout le procédé de décomposition est formalisé le principe général du procédé est introduit. Dans un deuxième temps, le recalage tridimensionnel est décrit en détail. Ensuite, les autres étapes du procédé sont décrites afin de permettre une compréhension globale de cet exemple de mise en œuvre du procédé selon l'invention. La décomposition d'un mouvement en utilisant un modèle 3DRI a pour objectif de déterminer les coefficients x = {χκ}κκ=ι et les matrices R = {Rk}Kk=i - Pour cela, il faut résoudre le problème que décrit l'expression suivante : y -∑Xk Rk < k = \..K, = Id (5) dans laquelle :
Il . Il représente la norme de Frobenius ; qui provient du produit scalaire matriciel défini par <A,B> = trace (ABT); et où la fonction trace() est la somme des éléments diagonaux. avec (.)T représentant l'opérateur transposé. Le procédé décrit ci-après vise à résoudre ce problème et se base sur une optimisation non-convexe utilisant le principe de l'OMP, acronyme venant de l'expression anglo-saxonne « Orthogonal Matching Pursuit ». Ce procédé de décomposition est désigné dans la suite par le sigle 3DRI-OMP.
Dans une deuxième partie, nous nous intéresserons aux motifs 3D et à la manière d'apprendre le dictionnaire de motifs le plus adapté aux données étudiées. Cet apprentissage fera appel à la méthode de décomposition que nous présentons maintenant.
Les matrices R seront considérées comme toujours orthogonales et donc vérifiant la condition C0. Une transformation rigide composée d'une rotation 3D R et d'une translation spatiale T est considérée ici entre le motif trivarié Φ et le signal original y. Le problème orthogonal de Procrustes consiste à trouver les paramètres R et T tels que :
2
minR T \\ y - R > - T\\ (6) Dans l'article de D. Eggert, A. Lorusso, et R. Fisher intitulé Estimating 3-D rigid body transformations: a comparison of four major algorithms, Machine Vision and Applications, vol. 9, pp. 272-290, 1997, les trois principales méthodes donnant une solution analytique pour ce problème de recalage rigide 3D sont passées en revue. Une première méthode propose une décomposition en valeurs singulières, une deuxième méthode propose une décomposition par quaternions unitaires et une troisième méthode propose une décomposition par matrices orthonormales.
D'autre part, le problème multi-vues reconstruit le signal y à partir de plusieurs observations q>k prises sous différents angles, comme indiqué dans l'article de B. Kamgar-Parsi, J. Jones, et A. Rosenfeld intitulé Registration of multiple overlapping range images: scènes without distinctive features, IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 13, pp. 857-871 , 1991 . Puisque les différentes vues se recouvrent, le problème est donné par l'expression : mins r (7)
k=l dans laquelle :
Rk représente la matrice de rotation ;
Tk représente la translation associée au motif trivarié q>k. Cette formulation est différente du problème exprimée par l'expression (5). En effet, dans l'expression (7), l'union des motifs est considérée mais pas la somme comme dans l'expression (5).
Dans l'article de l'article de J. Gower, "Generalized procrustes analysis," Psychometrika, vol. 40, pp. 33-51 , 1975, l'analyse de Procrustes généralisée est décrite et traite plusieurs éléments q>k résout le problème donné par l'expression suivante :
dans laquelle K > 2.
Ce problème, résolu en ajoutant quelques contraintes et une moyenne-groupée, est aussi différent du problème (5). Dans l'article de J. Gower et G. Dijksterhuis, intitulé Procrustes Problems, Oxford Univ. Press, Ed. Oxford Statistical Science Séries, 30, 2004, de multiples problèmes de Procrustes sont examinés ainsi que plusieurs généralisations. Cependant, le problème tel que décrit par l'expression (5) n'est pas traité. Dans l'approche désignée par l'expression anglo-saxonne « 3D curve matching » et en comparaison avec le problème donné par l'expression (6), la translation spatiale n'est plus considérée et ψ(ί) est un motif court translatable avec complétion de zéros pour avoir N échantillons. Le problème consiste à résoudre l'expression suivante : dans laquelle τ représente le décalage d'échantillons.
Le problème peut être résolu en calculant la matrice de recalage R optimale par la méthode basée sur les matrices orthonormales à chaque échantillon τ. De plus, paramétrée de cette façon, la méthode n'est pas invariante à l'échelle puisqu'il n'y a pas de facteur d'échelle x dans l'optimisation. S'il n'y a aucun décalage, le problème illustré par l'expression (6) de recalage 3D est retrouvé.
Quant à l'algorithme très connu ICP, acronyme venant de l'expression anglo-saxonne « Itérative Closest Point », celui-ci ne résout pas le problème donné par l'expression (5). Il permet de faire coïncider deux ensemble de points 3D, dont l'un est le sous ensemble de l'autre. Cet algorithme hautement non convexe résout le problème donné par l'expression suivante :
2
minr R T \\ y - R >r - Γ (10) dans laquelle :
y représente un ensemble de N points 3D ; φΓ un sous-ensemble de N points 3D parmi les η possible, avec η>Ν.
De plus, l'algorithme ICP utilise des signatures de formes pour identifier les N indices Γ.
Pour ce qui est de la décomposition tricomposantes, différents modèles traitant des signaux tricomposantes sont revus. Comme exposé dans l'Introduction, le modèle (1 ) décrit un objet 3D comme une combinaison linéaire de vecteurs de base de formes. Utilisant le modèle dual (2), l'objet est maintenant une combinaison linéaire de vecteurs de base de trajectoires. Il faut remarquer que ces deux contributions viennent du structure-from- motion de la communauté vision par ordinateur désignée habituellement par l'expression anglo-saxonne « computer vision ». Une projection orthogonale est utilisée pour estimer des structures 3D à partir de mouvements 2D.
En traitement du signal, une base redondante composée de M>N éléments est appelée dictionnaire. Dans ce cas, les éléments du dictionnaire ne sont plus appelés vecteurs mais atomes. Le modèle de l'expression (3) a été introduit dans ce domaine, et le choix des atomes et l'estimation des coefficients sont faits par approximation parcimonieuse multivariée. Le modèle introduit par l'expression (4) permet aux atomes de tourner mais l'on doit estimer en plus les matrices de rotation associées.
Dans la suite de la description, et dans le but de décrire le procédé de décomposition selon l'invention, la notion d'invariance par translation est introduite, puis la notion d'approximation parcimonieuse est expliquée et le principe de l'invariance par translation et par rotation 3D est présenté.
Dans le cas d'invariance par translation, l'objectif est de coder avec parcimonie le signal y comme une somme de structures courtes appelées noyaux. Ces noyaux sont caractérisés indépendamment de leurs positions. Ce modèle est habituellement appliqué aux données temps-séries et évite les effets de blocs dans l'analyse de signaux périodiques de large période et donne un dictionnaire de noyaux compact.
Pour la décomposition, un dictionnaire Ψ est utilisé. Ce dictionnaire comprend un ensemble de noyaux prédéfinis. On dit dans ce cas que le dictionnaire est compact. Les L noyaux du dictionnaire compact Ψ peuvent être translatés et sont répliqués à toutes les positions possibles afin de constituer les M atomes d'un dictionnaire Φ.
La décomposition du signal y est réalisée en une série d'étapes exécutées sur plusieurs itérations. Après chaque itération, l'erreur résiduelle ε est estimée et la décomposition continue sur cette base.
Les N échantillons du signal y, l'erreur résiduelle ε et les atomes ( m sont indicés par le temps t.
Les noyaux { ψι }Li=i peuvent être de longueurs différentes. Le noyau ψι(ΐ) est décalé à l'échantillon τ pour former l'atome ψι(ΐ- τ). Une complétion de zéros est faite pour avoir N échantillons. L'ensemble σι contient les translations actives τ du noyau ψι(ΐ). Pour les quelques noyaux qui engendrent tous les atomes, le signal y est exprimé de la manière suivante :
M L
y( = X ra( + f( = XX¾ ;(i- r) + f( (1 1 ) =l 1=1 .σι avec ε(ΐ) l'erreur résiduelle. Ainsi, le signal y est approché comme la somme pondérée de noyaux translatables ψι.
On introduit maintenant la notion d'approximation parcimonieuse. Du fait de l'invariance par translation, le dictionnaire Φ est la concaténation de L matrices de Toeplitz et est L fois sur-complet. Puisque M > N, le dictionnaire est redondant et le système linéaire est donc sous-déterminé et accepte de multiples solutions. L'introduction de contraintes telles que la parcimonie permet de régulariser la solution. L'approximation parcimonieuse sélectionne K atomes actifs parmi les M possibles et calcule leurs coefficients associés pour avoir la meilleure approximation du signal y. Le problème de l'approximation parcimonieuse peut être formulée en utilisant l'expression : min. y( -∑∑¾ , (i -7) tel que \\x\\ < K (12)
1=1 τ< σ, dans laquelle :
K « M est une constante ; ||x||0 représente le cardinal du vecteur x.
Mais ce problème est NP-difficile, l'acronyme NP venant de l'expression anglo-saxonne « non-deterministic polynomial time ». Ainsi, les algorithmes de poursuites non-convexes résolvent séquentiellement ce problème, comme les algorithmes connus MP, acronyme venant de l'expression anglo- saxonne « Matching Pursuit » et OMP, acronyme venant de l'expression anglo-saxonne « Orthogonal Matching Pursuit ».
En combinant les problèmes d'invariance par translation et par rotation 3D, le problème à résoudre pour décomposer le signal y peut s'exprimer analytiquement de la manière suivante : tel que :
≤K et Vl = l..L,Vr≡ a Rl TRl T T = Id (13)
Le procédé de décomposition parcimonieuse décrit ci-après s'appuie sur une optimisation non-convexe pour résoudre ce problème.
Le problème exprimé par l'expression (13) a deux cas particuliers déjà résolus.
Le premier cas particulier correspond au fait que lorsque K=1 , on retrouve le problème du « 3D curve matching » tel que précédemment défini par l'expression (9).
Le deuxième cas particulier est que lorsque chaque Rk est égal à la matrice identité, on retrouve le problème d'approximation parcimonieuse décrit à l'aide de l'expression (12), et ce avec des signaux trivariés. Ce cas est résolu par l'algorithme Multivariate-OMP désigné par l'acronyme M-OMP comme montré dans l'article de Q. Barthélémy, A. Lame, A. Mayoue, D. Mercier et J. Mars intitulé Shift & 2D rotation invariant sparse coding for multivariate signais, IEEE Trans. on Signal Processing, vol. 60, pp. 1597- 161 1 , 2012.
La figure 4 donne un exemple de méthode de recalage tridimensionnel pouvant être utilisé par le procédé 3DRI-OMP de décomposition parcimonieuse selon l'invention. Le problème de recalage exprimé précédemment par l'expression (6) est considéré ici avec un motif φ normé, mais sans translation spatiale. Les paramètres recherchés sont la rotation matrice de rotation R et le facteur d'échelle x : mm tel que RRT = Id (14) Pour résoudre le problème du recalage 3D, une décomposition en valeurs singulières peut être mise en œuvre. Pour cela, plusieurs méthodes sont envisageables. A noter que la technique de décomposition en valeurs singulières est désignée dans la suite de la description par l'acronyme SVD venant de l'expression anglo-saxonne « Singular Value Décomposition ».
Plusieurs méthodes de décomposition sont décrites dans l'article de D. Eggert, A. Lorusso, and R. Fisher intitulé Estimating 3-D rigid body transformations: a comparison of four major algorithms, Machine Vision and Applications, vol. 9, pp. 272-290, 1997. Un exemple de méthode pouvant être mise en œuvre dans le cadre du procédé de décomposition parcimonieuse 3DRI-OMP est décrit ci- après. D'autres méthodes permettant d'aboutir à un résultat équivalent peuvent également être utilisées.
Dans une première étape 400, une matrice de corrélation Mc = ycpT est déterminée. Sa SVD est calculée ensuite déterminée 401 en utilisant l'expression suivante :
(U,A1,V) = SVD(MC)
dans laquelle :
U Θ R3*3 désigne la matrice des vecteurs d'entrée orthonormés ; Λι Θ R3*3 désigne la matrice contenant les valeurs singulières de Mc;
V Θ R3*3 désigne matrice des vecteurs de sortie orthonormés.
Une matrice Λ2 est définie telle que Λ2 = diag ( 1 , 1 , det(UVT) ) G R3*3 est ensuite utilisée pour trouver 402 une matrice de rotation optimale R en utilisant l'expression : R = U Λ2 VT
Une valeur de corrélation x fournissant le facteur d'échelle est ensuite déterminée dans une quatrième étape 403 en utilisant l'expression : x = trace ( R φ y1 ) = trace ( Λ2 Λ1 ) > 0. dans laquelle : la fonction trace() est la somme des éléments diagonaux.
Le procédé 3DRI-OMP illustré à l'aide de la figure 3 utilise comme données d'entrée un signal trivarié y Θ M3*N à décomposer et un dictionnaire ψ de noyaux translatables. Le dictionnaire est normé. Cela signifie que les noyaux composant ce dictionnaire sont normés. Etant donné ce dictionnaire redondant, c'est-à-dire sur-complet, le procédé produit une approximation parcimonieuse du signal y. Pour cela, une fois que l'exécution du procédé est déclenchée
300, une étape d'initialisation 301 alloue le signal étudié y 302 à un résidu ε°.
A l'itération courante k, l'algorithme sélectionne l'atome qui produit la plus forte décroissance en valeur absolue de l'erreur quadratique moyenne H εκ"1 ||2, habituellement désignée par l'acronyme MSE venant de l'expression anglo-saxonne « mean square error ». C'est équivalent à trouver l'atome recalé qui est le plus corrélé au résidu £k"1.
La valeur de corrélation = trace (Ρ ιτ χψι(ΐ-τ)χεκ"1 (ΐ)τ) est calculée pour chaque décalage τ, Rk !iX étant la matrice optimale pour recaler ψι(ΐ-τ) sur £k"1 (t). Ainsi, l'algorithme de recalage 3D 303 est appliqué pour chaque τ et chaque 1=1 ..L.
Le maximum des valeurs absolues des xki,x est ensuite recherché 305 afin de sélectionner l'atome optimal. L'atome optimal est caractérisé par son indice de noyau lk et sa position xk
Dans une étape ultérieure 306, le vecteur x accumule les coefficients actifs, c'est-à-dire les coefficients non nuls, qui sont les maximums des valeurs de corrélation soit : x <— x U x k k Les matrices de rotation optimales associées sont regroupées dans R, soit :
R <- R U R, k k
En outre, l'erreur courante, c'est-à-dire le résidu, est calculée, soit :
Cependant, cette solution est sous-optimale en cas de recouvrement des atomes sélectionnés. En effet, dans ce cas, les valeurs des coefficients et des matrices ne sont pas la solution des moindres carrés du problème exposé à l'aide de l'expression (13).
Dans un mode de réalisation, il est possible d'utiliser une étape d'optimisation 307 afin d'améliorer la solution obtenue. Pour cela, les résultats obtenus à l'étape 306 sont utilisés pour initialiser cette étape d'optimisation 307. L'étape d'optimisation 307 a pour fonction d'affiner le calcul les coefficients et les matrices de rotation par projection orthogonale du signal y sur les atomes sélectionnés. Les coefficients et les matrices obtenus suite à l'application des étapes précédentes 303, 305, 306 sont corrigés afin de prendre en compte le nouvel atome et donner la solution des moindres carrés.
Le procédé d'optimisation résout par itérations successives le problème des moindres carrés décrit dans l'expression (13). Dans la suite de la description, l'exposant k des variables χκι et est omis pour alléger les notations et l'indice τ = 1 ..k désigne les différents éléments déjà sélectionnés à l'itération k.
A l'itération courante k :
• les coefficients actifs x = r
· les matrices actives R = )R,r κ r sont les solutions de l'expression suivante :
La procédure d'optimisation a pour objectif de résoudre ce problème. Pour cela, l'expression suivante peut être utilisée :
(x,R) <— arg{minXiR [expression (15)]} Dans laquelle :
MinXiR() désigne le minimum d'une fonction par rapport à une ou plusieurs variables ;
Arg() désigne la ou les valeurs qui donnent le minimum.
Pour choisir le moment d'arrêt de l'exécution du procédé, il est possible de mettre en œuvre un critère d'arrêt prédéfini et de surveiller si ce critère est vérifié. Si ce critère c'est le cas, l'exécution du procédé se termine 309. Sinon, k est incrémenté et une itération supplémentaire 310 est exécutée.
Le critère d'arrêt 308 peut être choisi parmi plusieurs candidats. A titre d'exemple, le critère d'arrêt peut se baser sur un seuillage sur k, sur un nombre d'itérations prédéfini, sur un seuillage sur la racine carrée de l'erreur quadratique moyenne || εκ || / || y ||, ou sur un seuillage sur la décroissance de la racine carrée de l'erreur quadratique moyenne.
Le résultat obtenu à l'aide de ce procédé est une approximation K- parcimonieuse de y en utilisant les éléments actifs sélectionnés : Le procédé de décomposition parcimonieuse peut être également décrit à l'aide du pseudo-code donné ci-après.
1 : initialisation : k = 1 , résidu ε° = y 2: répéter 3: pour I <— 1 , L faire 4: Recalage 3D : (x , R ) <- Reg_SVD ( ψ,(ΐ-τ) , £k"1 (t) ) 5: fin pour 6: Sélection : (lk,xk) <— arg max i,T χ ι,τ 7: Coefficients actifs : x <— x U x r, ,τ'
8: Matrices actives : R <- R U R
9: Résidu :
10: Procédure d'optimisation (x, R) <- arg minXiR (15) 1 1 : Résidu : y - y 12: k ^ k + 1 13: jusqu'à : critère d'arrêt
La figure 5 présente un exemple étape d'optimisation de la décomposition pouvant être mise en œuvre dans un mode de réalisation du procédé de décomposition parcimonieuse tridimensionnelle 3DRI-OMP.
Dans cet exemple, des mises à jour des coefficients x et des matrices de rotations R sont mises en œuvre. Ces mises à jour sont effectuées alternativement sur x et R, en d'autres termes, l'un est mis à jour pendant que l'autre est fixé et vice-versa. De plus, chaque mise à jour est basée sur une descente de gradient.
Au début de la procédure d'optimisation 500, les variables x, R et εκ sont initialisées au moment de l'étape 306. Un exposant i est ajouté sur les variables pour marquer l'itération courante de la procédure d'optimisation.
Les coefficients x sont alors mis à jour 502. Pour cela, la méthode LMS, acronyme venant de l'expression anglo-saxonne « least mean squares » peut être utilisée. Chaque coefficient χγΚ τΚ peut être mis à jour en utilisant l'expression :
χϊ',τ< = + ■ traceiR^1 (t - τκ ) ek (t)T ) (1 7) dans laquelle λι désigne le pas de descente adaptatif. Ce pas est à régler en fonction des données, et peut être par exemple choisi tel que λ' = 1 /i0 6.
Ensuite, le résidu est mis à jour 503 et les matrices de rotation R sont mises à jour 504. Cette dernière mise à jour doit garder l'orthogonalité des matrices de rotation R. On peut choisir une mise à jour multiplicative qui garde la matrice de rotation orthogonale en utilisant la variété de Stiefel. Chaque matrice de rotation est mise à jour en suivant la géodésique de la variété, comme montré dans l'expression :
R^ = e^ (- G' l)R^ (1 8) dans laquelle : G'"1 T est défini dans l'expression (1 9) :
G;' 1 = (R;;^ ¥ - τκ) ek {tf - ek (t) Ψικ (t - τκ)Τ R;] ) (1 9) μ est une constante choisie égale à 0.1 ; expm() est la fonction de l'exponentiel de matrice.
Alternativement, une mise à jour additive avec un terme de pénalisation de l'orthogonalité aurait pu être choisie. Le nombre d'itérations I peut être choisi constant ou fonction de k. De cette manière, les derniers coefficients ont plus d'itérations pour approcher la solution des moindres carrés que les premiers. Il faut noter aussi qu'il est inutile de faire la procédure d'optimisation à la première itération k=1 puisqu'il n'y a pas de corrélation dans le dictionnaire actif réduit à un seul atome.
Une implémentation possible de la procédure d'optimisation pour résoudre le problème représenté par l'expression (15) a été décrit. D'autres solutions peuvent également être mises en œuvre dans le cadre de l'invention pour améliorer l'optimisation des moindres carrés.
Il est à noter que le procédé de décomposition parcimonieuse 3DRI-OMP décrit notamment avec la figure 3 a une complexité algorithmique en 0(N2). Une implémentation plus rapide est possible. Pour cela, chacun des neuf éléments des N matrices de corrélation Mc (Ι,τ) = £k"1 (t) ψι(ΐ-τ)Τ peut être calculé par transformée de Fourier rapide avec une complexité en 0[N.log(N)] pour tous τ. Ensuite les N recalages sont calculés en O(N). La complexité résultante est donc de O [N.log(N)].
Le procédé peut être facilement étendu à de plus grandes dimensions, considérant y Θ MD*N avec D>3. Dans ce cas, le sens physique de la matrice de transformation est perdu. L'extension modifie seulement le recalage tridimensionnel, en étendant la définition de la variable interne Λ2 = diag ( 1 , ... 1 , det(UVT) ) Θ ED*D.
La figure 6 illustre un procédé de d'apprentissage de motifs 3D à partir d'un ensemble de signaux.
Avant de décrire en détails ce procédé, les techniques d'apprentissage les plus connues de l'état de la technique sont mentionnées. Le modèle introduit à l'aide de l'expression (1 ) décrit un objet 3D comme une combinaison linéaire de vecteurs de base de motifs. Etant donné que la base de formes est dédiée à l'objet étudié, elle doit être ré-estimée à chaque nouvel objet. Un algorithme EM généralisé peut être utilisé pour apprendre des formes tridimensionnelles adaptées aux données étudiées.
Utilisant le modèle dual de l'expression (2) qui représente un objet 3D avec des vecteurs de base de trajectoires, un algorithme EM peut être utilisé pour apprendre des trajectoires 1 D adaptées aux données étudiées.
D'autres techniques existantes sont désignées par l'acronyme DLA venant de l'expression anglo-saxonne « Dictionary Learning Algorithm ». Ces techniques apprennent empiriquement un dictionnaire dédié à un ensemble de signaux. Ces techniques comprennent deux étapes exécutées alternativement. L'une des étapes a pour objectif l'extraction des principaux motifs. C'est une étape d'approximation parcimonieuse. Ces motifs sont ensuite appris dans une autre étape de mise à jour du dictionnaire. A la fin de l'apprentissage, chaque signal de l'ensemble peut être décomposé avec parcimonie sur ce dictionnaire. Les techniques DLA sont différentes des techniques EM car elles utilisent la parcimonie dans l'étape de décomposition. La parcimonie fait émerger des données les motifs informatifs.
Le procédé décrit ci-après avec l'aide de la figure 6 permet de calculer un dictionnaire 3DRI à partir d'un ensemble de signaux trivariés.
Un ensemble d'apprentissage de signaux trivariés Y={yq}Q q=i est considéré et l'indice q est ajouté aux variables. Ce procédé d'apprentissage est désigné par le sigle 3DRI-DLA. Ce procédé traite successivement chaque signal d'apprentissage yq 603.
Au début de du procédé, les noyaux sont initialisés 600 sur du bruit blanc uniforme et sont normés. En suite, le procédé met en œuvre une alternance en ligne de deux étapes. Une étape 601 correspond à une décomposition 3D parcimonieuse et une étape 602 correspond à une mise à jour du dictionnaire.
La décomposition 3D parcimonieuse 601 peut être effectuée en utilisant le procédé 3DRI-OMP décrit précédemment. Pour cela, l'expression suivante peut être utilisée : x ,R = argmin ,w-XX¾¾, ,c-r) tq et V/ = l..L,Vre σι ,R, Rl T = Id (20) dans laquelle :
tq est une abréviation de l'expression « tel que ». L'étape de mise à jour du dictionnaire 602 est basée sur le critère du maximum de vraisemblance, sous hypothèse de bruit banc gaussien. Pour cela, l'expression suivante peut être utilisée :
Ψ = tq VH..L, H = 1 et VH ..L, œ , ,Λ, = Id
(21 )
Ce critère est habituellement optimisé par descente de gradient. Pour effectuer cette optimisation, une descente de gradient stochastique basée sur le LMS peut être choisie. Il a la particularité de traiter les matrices de rotation 3D et il est donc désigné par le sigle 3DRI-LMS. L'itération courante est notée j. Pour 1=1 ..L, chaque noyau trivarié ψι peut être mis à jour en utilisant l'expression suivante : ψ( (t) = ψΓ (£) + .∑ * ;r;? Rl ε;1 1 (t + T) (22) dans laquelle : t désigne les indices limités au support temporel de ψι ; λ2 désigne le pas de descente adaptatif, choisi tel que A2 J=1 /j ;
En outre, les noyaux sont normalisés à la fin de chaque itération, et leurs longueurs peuvent être modifiées en fonction de l'énergie présente sur leurs bords. Les deux étapes 601 , 602 sont appliquées à tous les signaux 604 de la base de signaux 603 utilisée en entrée du procédé.
Pour terminer 605 l'exécution du procédé, différent critères d'arrêt peuvent être utilisés, comme par exemple le seuillage sur le rRMSE, acronyme venant de l'expression anglo-saxonne Relative Root Mean- Squared Error », calculé sur l'ensemble d'apprentissage ou le seuillage sur j, c'est-à-dire sur le nombre d'itérations.
Suite à l'exécution du procédé d'apprentissage, les motifs élémentaires caractéristiques d'un ensemble de signaux ont été appris empiriquement dans le dictionnaire optimal qui donne conjointement des approximations parcimonieuses pour tous les signaux de cet ensemble.
Il est à noter que les procédés 3DRI-OMP et 3DRI-DLA sont indépendants du système de capture de mouvement utilisé. Ainsi, celui-ci peut être de type inertiel, magnétique ou optique avec des marqueurs actifs ou passifs. Tous ces systèmes d'acquisition fournissent des coordonnées spatiales 3D qui sont les signaux de mouvements traités par nos méthodes.
Les figures 7a et 7b donne un exemple d'ensemble de signaux appartenant à un dictionnaire non orienté.
A titre d'illustration, les procédés 3DRI-DLA et 3DRI-OMP sont appliquées à des signaux de mouvement du langage parlé-complété LPC.
Ce langage associe des articulations labiales à des clés formées par la main. Par la suite, seuls les mouvements de la main sont étudiés. La main peut être placée dans différentes configurations correspondants aux consonnes et dans différents placements sur le visage correspondants aux voyelles. Les signaux sont acquis par un système d'acquisition optique, fournissant les coordonnées spatiales 3D d'un marqueur. Q=57 signaux bruts sont dérivés pour donner les signaux de vitesse vx, vy et vz. Ces signaux tridimensionnels sont utilisés comme signaux d'entrées pour l'application des procédés.
Dans cet exemple, le procédé 3DRI-DLA est appliqué aux données décrites précédemment. Ce procédé d'apprentissage est comparée avec un procédé connu de type M-DLA. Un dictionnaire appris à l'aide du procédé 3DRI-DLA est dit non- orienté, et est désigné de la sorte en utilisant l'acronyme NOLD venant de l'expression anglo-saxonne « Non-Oriented Learned Dictionary », car les noyaux sont invariants à la rotation et non plus appris dans une orientation fixe comme c'est le cas avec un procédé de type M-DLA. Un dictionnaire NOLD est appris avec L=6 noyaux. Le dictionnaire ainsi obtenu est illustré à l'aide des figures 7a et 7b. Les lignes pleines 700, et en pointillées 701 , 702 représentent les trois composantes vx, vy et vz. L'erreur rRMSE moyennée sur l'ensemble d'apprentissage est de 21 .3%, avec K=15 atomes dans chaque décomposition.
La figure 7a représente le dictionnaire de L=6 noyaux trivariés à l'initialisation et la figure 7b représente ce même dictionnaire à la fin de l'apprentissage, c'est-à-dire après que le procédé 3DRI-DLA ait été exécuté.
Afin d'effectuer une comparaison, un dictionnaire orienté OLD, acronyme venant de l'expression anglo-saxonne « Oriented Learned Dictionary » est appris avec le procédé M-DLA utilisé dans un cas trivarié avec et L=6 noyaux. Son erreur rRMSE est de 30.9 % avec K=15 atomes.
Les signaux de vitesse sont intégrés afin de donner une représentation plus visuelle du dictionnaire. La figure 8 montre les trajectoires 3D invariantes à la rotation associées au dictionnaire NOLD. Les étoiles 800, 801 , 802, 803, 804, 805 représentent le début des trajectoires. Du fait de l'intégration, des noyaux de vitesses différents peuvent donner des trajectoires très ressemblantes. Ces trajectoires, extraites par le procédé 3DRI-DLA, correspondent aux motifs élémentaires du langage gestuel LPC.
Le procédé de décomposition parcimonieuse 3DRI-OMP est ensuite appliqué avec le dictionnaire NOLD, ce qui donne une décomposition adaptée et non-orientée. Les atomes principaux sont ceux de plus fortes amplitudes, et ils concentrent l'information pertinente. Les atomes secondaires codent les variabilités entre les différentes réalisations d'un même geste.
La trajectoire du signal yq avec q=52, q représentant l'indice courant sur les Q=57 signaux, est reconstruite avec ses cinq atomes principaux. La reconstruction non-orientée avec le NOLD et celle orientée avec le OLD sont comparées à l'aide des figures 9a, 9b et 9c. Par exemple, le signal the y52 est reconstruit comme la somme des noyaux NOLD d'indices trois, quatre et six qui sont utilisés trois fois dans des orientations différentes. Ils sont spécifiés par les amplitudes et les rotations données par le 3DRI- OMP.
La figure 9a représente la trajectoire 3D originale de y52, la figure 9b représente la trajectoire reconstruite non-orientée et la figure 9c représente la trajectoire reconstruite orientée.
Il apparaît de la figure 9b que le noyau NOLD d'indice six est utilisé trois fois dans des orientations différentes, alors que sur la figure 9c, le noyau OLD d'indice six est utilisé deux fois, mais sans qu'il soit possible de changer d'orientation pour mieux coïncider avec la trajectoire originale.
Maintenant, les signaux sont tournés de différents angles aléatoires et sont maintenant notés par (.)'. Le dictionnaire NOLD et le dictionnaire OLD appris précédemment sont conservés pour effectuer les décompositions des signaux tournés. Avec K=15, l'erreur rRMSE moyennée sur l'ensemble d'apprentissage est de 21 .3% pour le cas non-orienté et 83.1 % pour le cas orienté. Il est intéressant de remarquer que les erreurs rRMSE des décompositions non-orientées sont similaires dans les deux expériences.
Comme dans l'expérience précédente, la trajectoire du signal tourné y52' est reconstruite sur ces noyaux principaux comme illustré à l'aide des figures 10a, 10b et 10c. La figure 10a représente la trajectoire 3D de y52', la figure 10b représente la trajectoire reconstruite non-orientée et la figure 10c représente la trajectoire reconstruite orientée.
Avantageusement, les reconstructions non-orientées des figures 9b et 10b sont identiques. En effet, les mêmes atomes sont utilisés avec les mêmes amplitudes. Seules les rotations changent. Ces rotations correspondent à l'angle aléatoire appliqué au signal y52- La propriété avantageuse d'invariance à la rotation des méthodes non-orientées est ainsi illustrée. A l'inverse, les méthodes orientées donnent comme résultats des reconstructions très différentes comme illustrées sur les figure 9c et 10c. On peut notamment remarquer que les atomes utilisés ne sont pas les mêmes pour chaque reconstruction. Cela démontre la limitation d'un dictionnaire orienté figé dans une direction particulière, cette limitation étant évitée de lorsque les méthodes de reconstructions invariantes à la rotation sont utilisées.
L'approche non-orientée permet d'obtenir de meilleurs résultats de reconstruction que les données soient tournées ou non. En outre, elle permet l'obtention et l'utilisation d'un dictionnaire compact et dont les noyaux peuvent être tournés ainsi que des décompositions invariantes aux rotations 3D. L'approche non-orientée peut être mise en œuvre en robotique, notamment dans le but de donner aux robots une démarche humaine et non plus machinale. Toujours en robotique, cette approche peut être mise en œuvre dans des systèmes de reconnaissance biométrique permettant d'identifier un individu à partir des caractéristiques de sa marche. En effectuant une étape de classification sur les paramètres de nos décompositions, il est possible de faire cette reconnaissance.
Plus généralement, cette approche peut être mise en œuvre pour la reconnaissance de gestes 3D. En effet, l'invention peut aussi être mise en œuvre pour le suivi d'objet, l'analyse de trajectoires, l'apprentissage de primitives du mouvement. Suite à ces traitements, il est alors possible d'effectuer de la reconnaissance de geste.

Claims

REVENDICATIONS
1 - Procédé de décomposition d'une trame de coordonnées tridimensionnelles y en une somme d'atomes trivariés <pk (202) pondérés par un coefficient xk (201 ), une matrice de rotation Rk (203) étant appliquée à ces atomes pondérés, le procédé comprenant les étapes suivantes appliquées de manière itérative :
- un recalage 3D (303) de l'ensemble des atomes tridimensionnels obtenus à partir d'un dictionnaire ψ non orienté, le recalage étant effectué en utilisant la technique de décomposition en valeurs singulières afin d'obtenir un coefficient xk et une matrice de rotation Rk pour chaque atome ;
- une sélection (305) d'au moins un atome, de son coefficient associé xk et de sa matrice associée Rk de manière à obtenir une décomposition parcimonieuse de la trame de coordonnées tridimensionnelles ;
- un calcul du résidu de décomposition (306) après prise en compte du dernier atome sélectionné, ledit résidu étant utilisé par l'étape de recalage 3D de l'itération suivante.
2- Procédé selon la revendication 1 dans lequel les atomes sélectionnés sont déduits du dictionnaire ψ par décalages temporels τ des noyaux le composant.
3- Procédé selon l'une des revendications précédentes dans lequel le dictionnaire ψ est normé et redondant. Procédé selon l'une des revendications précédentes dans lequel durant l'étape de sélection (305) au moins un atome est choisi, ledit atome celui permettant d'obtenir la plus forte décroissance en valeur absolue de l'erreur quadratique moyenne est sélectionné.
Procédé selon l'une des revendications précédentes dans lequel une étape d'optimisation (307) est appliquée après le calcul du résidu (306) afin d'ajuster les coefficients de pondération xk et les matrices de rotation Rk des atomes sélectionnés, cette optimisation étant réalisée par projection orthogonale du signal y sur les atomes sélectionnés par minimisation des moindres carrés afin réduire le plus possible la valeur du résidu.
Procédé selon la revendication 5 dans lequel les coefficients de pondération xk et les matrices de rotation Rk sont optimisés de manière à ce que les coefficients xk soient mis à jour pendant que les matrices Rk sont fixées et vice versa (502, 504), chaque mise à jour étant basée sur la technique de descente de gradient.
Procédé de d'apprentissage d'un dictionnaire composé d'au moins un noyau, ledit dictionnaire étant adapté pour la décomposition d'une trame de coordonnées tridimensionnelles, le procédé comprenant les étapes suivantes appliquées de manière itérative et consistant en :
- une initialisation (600) des noyaux à apprendre ;
- une décomposition non-orientée (601 ) par application du procédé selon l'une des revendications 1 à 6 à une base de signaux (603) prédéterminée ;
- une mise à jour des noyaux (602) basée sur le critère du maximum de vraisemblance sous hypothèse de bruit banc gaussien 8- Procédé selon la revendication 7 dans lequel les noyaux sont initialisés (600) sur du bruit blanc uniforme et sont normés.
9- Procédé selon l'une des revendications 7 ou 8 dans lequel l'étape de mise à jour (602) est basée sur une descente de gradient stochastique.
10- Dispositif d'apprentissage de mouvements tridimensionnels mettant en œuvre le procédé de décomposition selon l'une des revendications 1 à 6.
EP13724250.9A 2012-05-21 2013-05-20 Procede d'analyse parcimonieuse de signaux par approche non-orientee Withdrawn EP2852917A1 (fr)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
FR1254616A FR2990787B1 (fr) 2012-05-21 2012-05-21 Procede d'analyse parcimonieuse de signaux par approche non-orientee
PCT/EP2013/060339 WO2013174775A1 (fr) 2012-05-21 2013-05-20 Procede d'analyse parcimonieuse de signaux par approche non-orientee

Publications (1)

Publication Number Publication Date
EP2852917A1 true EP2852917A1 (fr) 2015-04-01

Family

ID=47137799

Family Applications (1)

Application Number Title Priority Date Filing Date
EP13724250.9A Withdrawn EP2852917A1 (fr) 2012-05-21 2013-05-20 Procede d'analyse parcimonieuse de signaux par approche non-orientee

Country Status (3)

Country Link
EP (1) EP2852917A1 (fr)
FR (1) FR2990787B1 (fr)
WO (1) WO2013174775A1 (fr)

Families Citing this family (4)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN104297635B (zh) * 2014-10-14 2017-10-31 河南理工大学 基于原子稀疏分解与极限学习机的配电网故障选线方法
CN115343046B (zh) * 2022-07-22 2025-05-09 西安交通大学 基于特征导向正则参数的旋转机械稀疏表示诊断方法
CN117518081B (zh) * 2023-11-07 2024-11-29 哈尔滨工程大学 一种基于K-Means聚类的最小化交叉熵DOA估计方法
CN120298267B (zh) * 2025-06-11 2025-09-02 西安工程大学 基于快速惯性原始-对偶的图像处理方法、装置及介质

Non-Patent Citations (2)

* Cited by examiner, † Cited by third party
Title
None *
See also references of WO2013174775A1 *

Also Published As

Publication number Publication date
FR2990787A1 (fr) 2013-11-22
WO2013174775A1 (fr) 2013-11-28
FR2990787B1 (fr) 2017-03-31

Similar Documents

Publication Publication Date Title
Tsai et al. BANet: A blur-aware attention network for dynamic scene deblurring
US11645835B2 (en) Hypercomplex deep learning methods, architectures, and apparatus for multimodal small, medium, and large-scale data representation, analysis, and applications
Gauthier Conditional generative adversarial nets for convolutional face generation
Perera et al. A joint convolutional and spatial quad-directional lstm network for phase unwrapping
WO2010026028A1 (fr) Procede de reconnaissance de formes et systeme mettant en oeuvre le procede
WO2014079897A1 (fr) Procede de generation d&#39;un modele de visage en trois dimensions
WO2006003270A1 (fr) Procede pour la reconnaissance de visages, a analyse discriminante lineaire bidimensionnelle
EP2852917A1 (fr) Procede d&#39;analyse parcimonieuse de signaux par approche non-orientee
Yousef et al. High-speed image registration algorithm with subpixel accuracy
WO2006103240A1 (fr) Procédé d&#39;identification de visages à partir d&#39;images de visage, dispositif et programme d&#39;ordinateur correspondants
CN114118303A (zh) 基于先验约束的人脸关键点检测方法及装置
WO2020204898A1 (fr) Estimation de pose d&#39;appariement itératif multi-vues
Luo et al. Wavelet synthesis net for disparity estimation to synthesize dslr calibre bokeh effect on smartphones
Weng et al. Addressing the real-world class imbalance problem in dermatology
WO2019123642A1 (fr) Système, procédé et programme de reconnaissance d&#39;image, et système, procédé et programme d&#39;apprentissage de paramètre
CN116862948B (zh) 一种无人机目标跟踪预测方法及系统
CN119517057A (zh) 一种基于时频图卷积网络的语音增强方法及系统
FR2667711A1 (fr) Procede de reconnaissance d&#39;objets dans des images et son application au suivi d&#39;objets dans des sequences d&#39;images.
Piriyatharawet et al. Image denoising with deep convolutional and multi-directional LSTM networks under Poisson noise environments
Wang et al. Efficient degradation representation learning network for remote sensing image super-resolution
CN111079893B (zh) 用于干涉条纹图滤波的生成器网络的获取方法和装置
Karadağ et al. Experimental assessment of the performance of data augmentation with generative adversarial networks in the image classification problem
Patil et al. Deep hyperparameter transfer learning for diabetic retinopathy classification
Ginzburg et al. Selective sampling with Gromov–Hausdorff metric: Efficient dense-shape correspondence via confidence-based sample consensus
CN108961322B (zh) 一种适用于降落序列影像的误匹配剔除方法

Legal Events

Date Code Title Description
PUAI Public reference made under article 153(3) epc to a published international application that has entered the european phase

Free format text: ORIGINAL CODE: 0009012

17P Request for examination filed

Effective date: 20141113

AK Designated contracting states

Kind code of ref document: A1

Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC MK MT NL NO PL PT RO RS SE SI SK SM TR

AX Request for extension of the european patent

Extension state: BA ME

DAX Request for extension of the european patent (deleted)
17Q First examination report despatched

Effective date: 20170421

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE APPLICATION IS DEEMED TO BE WITHDRAWN

18D Application deemed to be withdrawn

Effective date: 20170704