EP1526508A1 - Procédé de sélection d'unités de synthèse - Google Patents

Procédé de sélection d'unités de synthèse Download PDF

Info

Publication number
EP1526508A1
EP1526508A1 EP04105204A EP04105204A EP1526508A1 EP 1526508 A1 EP1526508 A1 EP 1526508A1 EP 04105204 A EP04105204 A EP 04105204A EP 04105204 A EP04105204 A EP 04105204A EP 1526508 A1 EP1526508 A1 EP 1526508A1
Authority
EP
European Patent Office
Prior art keywords
pitch
segment
similarity
information
units
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Granted
Application number
EP04105204A
Other languages
German (de)
English (en)
Other versions
EP1526508B1 (fr
Inventor
François THALES Intellectual Property CAPMAN
Marc THALES Intellectual Property PADELLINI
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Thales SA
Original Assignee
Thales SA
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Thales SA filed Critical Thales SA
Publication of EP1526508A1 publication Critical patent/EP1526508A1/fr
Application granted granted Critical
Publication of EP1526508B1 publication Critical patent/EP1526508B1/fr
Anticipated expiration legal-status Critical
Expired - Lifetime legal-status Critical Current

Links

Images

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/0018Speech coding using phonetic or linguistical decoding of the source; Reconstruction using text-to-speech synthesis
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L13/00Speech synthesis; Text to speech systems
    • G10L13/06Elementary speech units used in speech synthesisers; Concatenation rules

Definitions

  • the invention relates to a method for selecting units of synthesis.
  • the indexing techniques of natural speech units have recently allowed the development of synthesis systems from the particularly powerful text. These techniques are now studied in the context of very low speech rate coding, together with algorithms borrowed from the field of speech recognition, Ref [1-5].
  • the main idea is to identify in the speech signal to be coded a almost optimal segmentation in elementary units. These units can be units obtained from a phonetic transcription, which has the disadvantage of having to be corrected manually for an optimal result, or automatically according to spectral stability criteria. From this type of segmentation, and for each segment, we look for unity synthesis in a dictionary obtained during a phase prior learning, and containing reference synthesis units.
  • the coding scheme used is to model the space acoustic of the speaker (or speakers) by Markov models hidden (HMM or Hidden Markov Models). These dependent models or independent of the speaker are obtained during a learning phase prior to using algorithms identical to those used in the speech recognition systems.
  • the essential difference lies in the fact that the models are learned on vectors grouped by classes automatically and not in a supervised way from a phonetic transcription.
  • the learning procedure then consists of automatically obtain the segmentation of learning signals (for example using the so-called temporal decomposition method), group segments obtained in a finite number of classes corresponding to the number of HMM models that we wish to build.
  • the number of models is directly related to the desired resolution for represent the acoustic space of the speaker (s).
  • these models make it possible to segment the signal to be coded using an algorithm from Viterbi. Segmentation allows to associate to each segment, the index of class and its length. This information is not sufficient to model spectral information, for each of the classes a realization of spectral trajectory is selected from among several so-called synthesis. These units are extracted from the learning base at its segmentation using HMM models. It is possible to take into account context for example by using multiple subclasses allowing for take into account transitions from one class to another. A first index indicates the class to which the segment belongs, a second index specifies the subclass to which it belongs as the index of class of the previous segment. The subclass index is therefore not transmit, and the class index must be stored for the next segment. The subclasses thus defined make it possible to take into account the different transitions to the class associated with the segment in question. To the information spectral one adds the information of prosody, that is to say the value of pitch and energy parameters and their evolutions.
  • a classic method is initially to select the unit closest to a spectral point of view then, once the unit selected, to code the prosody information, either independently of the selected unit.
  • the method according to the present invention proposes a novel method of selecting the closest synthesis unit together with modeling and quantification of additional information necessary at the level of the decoder for the reproduction of the speech signal.
  • information is a segment of speech to code and one uses as proximity criteria the fundamental frequency or pitch, or the spectral distortion, and / or the energy profile and a step of merge of the criteria used to determine the synthesis unit representative.
  • the method comprises for example a coding step and / or a pitch correction step by modifying the synthesis profile.
  • the step of encoding and / or correcting the pitch may be a Linear transformation of the pitch profile.
  • the method is for example used for the selection and / or the coding of synthesis units for a very low bit rate speech coder.
  • the speech signal is analyzed frame to frame to extract characteristic parameters (spectral parameters, pitch, energy).
  • This analysis is classically using a sliding window set on the horizon of the frame. This frame has a duration of the order of 20 ms, and the update is done with a shift of the analysis window of the order of 10 ms to 20 ms.
  • HMM Hidden Markov Model
  • model speech segments set of successive frames
  • phonemes if the learning phase is supervised (phonetic segmentation and transcription available) or to spectrally stable sounds in the case of a segmentation obtained from Automatic way.
  • 64 HMM models are used here, which make it possible recognition phase to associate with each segment the model index HMM identified, and therefore the class to which it belongs.
  • HMM models are also used with the help of a Viterbi type algorithm to be coding phase the segmentation and classification of each of the segments (belonging to a class). Each segment is therefore identified by an index between 1 and 64 which is transmitted to the decoder.
  • the decoder uses this index to find the synthesis unit in the dictionary built during the learning phase.
  • Units of synthesis that make up the dictionary are simply the sequences of parameters associated with the segments obtained on the learning corpus.
  • a dictionary class contains all units associated with the same model HMM. Each synthesis unit is therefore characterized by a sequence of spectral parameters, a sequence of pitch value (pitch profile), a sequence of gains (energy profile).
  • each class (from 1 to 64) of the dictionary is subdivided into 64 subclasses, where each subclass contains synthesis units that are temporally preceded by a segment belonging to the same class. This approach allows take into account the past context, and thus improve the recovery of the areas transients from one unit to another.
  • the present invention relates in particular to a method of selection of a multicriteria synthesis unit.
  • the process allows example to take into account simultaneously the pitch, the spectral distortion, and pitch and energy evolution profiles.
  • the method may comprise in a variant embodiment a pitch coding step by correction of the synthesis pitch profile detailed below.
  • the criterion relating to the evolution profile of the pitch makes it possible in part to consider the voicing information. It is however possible to disable when the segment is totally unvoiced, or the subclass selected is also unvoiced. Indeed, we can notice mainly three types of subclasses: the subclasses containing majority of voiced units, those containing predominantly unvoiced units, and subclasses containing predominantly units mixed.
  • the method according to the invention is not limited to optimizing the flow rate allocated to prosody information but also allows to keep for the coding phase the entirety of the synthesis units obtained during the learning phase with a constant number of bits to encode the unit of synthesis.
  • the synthesis unit is characterized by both the value pitch and its index. This approach allows in a scheme of speaker-independent coding to cover all pitch values possible and to select the synthesis unit taking into account in part characteristics of the speaker, there is indeed for the same speaker a correlation between the pitch variation range and the characteristics of the vocal tract (especially the length).
  • the similarity measure may be a spectral distance.
  • Step A9) comprises for example a step where the average the set of spectra of the same segment and the measure of similarity is an intercorrelation measure.
  • the spectral distortion criterion is for example calculated on harmonic structures resampled to constant pitch or resampled the pitch of the segment to be coded, after interpolation of initial harmonic structures.
  • the similarity criterion will depend on the spectral parameters used (for example the type of parameters used for the representation of the envelope).
  • spectral parameters for example the type of parameters used for the representation of the envelope.
  • LSP Line Spectral Pair, LSF, Line Spectral Frequencies
  • cepstral parameters are usually used, and they can either be derived from a linear prediction analysis (LPCC, Linear Prediction Cepstrum Coefficients) or estimated from a filter bank often on a Mel or Bark perceptual scale (MFCC, Mel Frequency Cepstrum Coefficients).
  • Pre-treatment then consists in estimating a spectral envelope from the amplitudes harmonics (linear or polynomial spline interpolation) and to resample the envelope thus obtained, either by using the frequency of the segment to be coded, either by using a frequency fundamental constant (100 Hz for example).
  • a fundamental frequency constant allows to pre-calculate all the harmonic structures of synthesis units during the learning phase.
  • Re-sampling is then only on the segment to be coded.
  • the similarity measure can then be estimated simply from the average harmonic structure of the segment to be coded, and that of the synthesis unit considered.
  • This measure of similarity can also be a standardized cross-correlation measurement. It can also be noted that resampling procedure can be done on a scale perceptual frequencies (Mel or Bark).
  • the method comprises a step of pitch coding by modifying the synthesis profile. This consists of resynthesizing a pitch profile from that of the synthesis unit selected and a linearly variable gain over the duration of the segment code. It is then sufficient to transmit an additional value for characterize the correction gain over the entire segment.
  • the flow associated with the prosody is then between 225 and 300 bits / sec, which leads to an overall bit rate between 450 and 600 bits / sec.

Landscapes

  • Engineering & Computer Science (AREA)
  • Computational Linguistics (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Physics & Mathematics (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Signal Processing (AREA)
  • Compression, Expansion, Code Conversion, And Decoders (AREA)
  • Transition And Organic Metals Composition Catalysts For Addition Polymerization (AREA)
  • Separation By Low-Temperature Treatments (AREA)

Abstract

Procédé de sélection d'unités de synthèse d'une information pouvant être décomposée en unités de synthèse comportant au moins les étapes suivantes :
pour un segment d'information considéré :
  • déterminer la valeur F0 de la fréquence fondamentale moyenne pour le segment d'information considéré,
  • sélectionner un sous-ensemble d'unités de synthèse défini comme étant celui dont les valeurs moyennes de pitch sont les plus proches de la valeur de pitch F0,
  • appliquer un ou plusieurs critères de proximité aux unités de synthèse sélectionnées pour déterminer une unité de synthèse représentative du segment d'information.

Description

L'invention concerne un procédé de sélection d'unités de synthèse.
Elle concerne par exemple un procédé de sélection et de codage d'unités de synthèse pour un codeur de parole très bas débit, par exemple inférieur à 600 bits/sec.
Les techniques d'indexation d'unités de parole naturelle ont récemment permis le développement de systèmes de synthèse à partir du texte particulièrement performants. Ces techniques sont dorénavant étudiées dans le cadre du codage à très bas débit de la parole, conjointement avec des algorithmes empruntés au domaine de la reconnaissance vocale, Ref [1-5]. L'idée principale consiste à identifier dans le signal de parole à coder, une segmentation quasi optimale en unités élémentaires. Ces unités peuvent être des unités obtenues à partir d'une transcription phonétique, qui a l'inconvénient de devoir être corrigée manuellement pour un résultat optimal, ou de façon automatique selon des critères de stabilité spectrale. A partir de ce type de segmentation, et pour chacun des segments, on cherche l'unité de synthèse la plus proche dans un dictionnaire obtenu lors d'une phase d'apprentissage préalable, et contenant des unités de synthèse de référence.
Le schéma de codage utilisé consiste à modéliser l'espace acoustique du locuteur (ou des locuteurs) par des modèles de Markov cachés (HMM ou Hidden Markov Models). Ces modèles dépendants ou indépendants du locuteur sont obtenus lors d'une phase d'apprentissage préalable à partir d'algorithmes identiques à ceux mis en oeuvre dans les systèmes de reconnaissance de la parole. La différence essentielle réside dans le fait que les modèles sont appris sur des vecteurs regroupés par classes de façon automatique et non de manière supervisée à partir d'une transcription phonétique. La procédure d'apprentissage consiste alors à obtenir de façon automatique la segmentation des signaux d'apprentissage (par exemple en utilisant la méthode dite de décomposition temporelle), à regrouper les segments obtenus dans un nombre fini de classes correspondant au nombre de modèles HMM que l'on souhaite construire. Le nombre de modèles est directement lié à la résolution recherchée pour représenter l'espace acoustique du ou des locuteurs. Une fois obtenus, ces modèles permettent de segmenter le signal à coder en utilisant un algorithme de Viterbi. La segmentation permet d'associer à chaque segment, l'indice de classe et sa longueur. Cette information n'étant pas suffisante pour modéliser l'information spectrale, pour chacune des classes une réalisation de trajectoire spectrale est sélectionnée parmi plusieurs unités dites de synthèse. Ces unités sont extraites de la base d'apprentissage lors de sa segmentation utilisant les modèles HMM. Il est possible de tenir compte du contexte par exemple en utilisant plusieurs sous-classes permettant de prendre en compte les transitions d'une classe vers l'autre. Un premier indice indique la classe à laquelle appartient le segment considéré, un deuxième indice précise la sous-classe à laquelle il appartient comme étant l'indice de classe du segment précédent. L'indice de sous-classe n'est donc pas à transmettre, et l'indice de classe doit être mémorisé pour le segment suivant. Les sous-classes ainsi définies permettent de tenir compte des différentes transitions vers la classe associée au segment considéré. A l'information spectrale on ajoute l'information de prosodie, c'est-à-dire la valeur des paramètres de pitch et d'énergie et leurs évolutions.
Dans l'optique de réaliser un codeur très bas débit, il est nécessaire d'optimiser l'allocation des bits et donc du débit entre les paramètres associés à l'enveloppe spectrale et à l'information de prosodie . Une méthode classique consiste dans un premier temps à sélectionner l'unité la plus proche d'un point de vue spectral puis, une fois l'unité sélectionnée, à coder l'information de prosodie, soit de façon indépendante de l'unité sélectionnée.
Le procédé selon la présente invention propose une nouvelle méthode de sélection de l'unité de synthèse la plus proche conjointement à la modélisation et à la quantification des informations supplémentaires nécessaires au niveau du décodeur pour la restitution du signal de parole.
L'invention concerne un procédé de sélection d'unités de synthèse d'une information pouvant être décomposée en unités de synthèse. Il
comporte au moins les étapes suivantes :
  • pour un segment d'information considéré :
    • déterminer la valeur F0 de la fréquence fondamentale moyenne pour le segment d'information considéré,
    • sélectionner un sous-ensemble d'unités de synthèse défini comme étant celui dont les valeurs moyennes de pitch sont les plus proches de la valeur de pitch F0,
    • appliquer un ou plusieurs critères de proximité aux unités de synthèse sélectionnées pour déterminer une unité de synthèse représentative du segment d'information.
  • L'information est par exemple un segment de parole à coder et l'on utilise comme critères de proximité la fréquence fondamentale ou pitch, ou la distorsion spectrale, et/ou le profil d'énergie et on exécute une étape de fusion des critères utilisés afin de déterminer l'unité de synthèse représentative.
    Le procédé comporte par exemple une étape de codage et/ou une étape de correction du pitch par modification du profil de synthèse.
    L'étape de codage et/ou correction du pitch peut être une transformation linéaire du profil du pitch d'origine.
    Le procédé est par exemple utilisé pour la sélection et/ou le codage d'unités de synthèse pour un codeur de parole très bas débit.
    L'invention présente notamment les avantages suivants :
    • le procédé permet d'optimiser le débit alloué à l'information de prosodie dans le domaine de la parole.
    • il permet de conserver, lors de la phase de codage, l'intégralité des unités de synthèse déterminées lors de la phase d'apprentissage avec cependant un nombre de bits constant pour coder l'unité de synthèse.
    • Dans un schéma de codage indépendant du locuteur, ce procédé offre la possibilité de couvrir l'ensemble des valeurs de pitch possibles (ou fréquences fondamentales) et de sélectionner l'unité de synthèse en tenant compte en partie des caractéristiques du locuteur.
    • La sélection peut s'appliquer à tout système basé sur une sélection d'unités et donc aussi à un système de synthèse à partir du texte.
    D'autres caractéristiques et avantages de l'invention apparaítront mieux à la lecture de la description qui suit d'un exemple de réalisation non limitatif annexé des figures qui représentent :
    • La figure 1 un schéma de principe de sélection de l'unité de synthèse associée au segment d'information à coder,
    • La figure 2 un schéma de principe d'estimation des critères de similarité pour le profil du pitch,
    • La figure 3 un schéma de principe d'estimation des critères de similarité pour le profil énergétique,
    • La figure 4 un schéma de principe d'estimation des critères de similarité pour l'enveloppe spectrale,
    • La figure 5 un schéma de principe du codage du pitch par correction du profil de pitch de synthèse.
    Afin de mieux faire comprendre l'idée mise en oeuvre dans la présente l'invention, l'exemple qui suit est donné à titre illustratif et nullement limitatif pour un procédé mis en oeuvre dans un vocodeur, en particulier la sélection et le codage d'unités de synthèse pour un codeur de parole très bas débit.
    Pour rappel, au niveau d'un vocodeur, le signal de parole est analysé trame à trame afin d'extraire les paramètres caractéristiques (paramètres spectraux, pitch, énergie). Cette analyse se fait classiquement à l'aide d'une fenêtre glissante définie sur l'horizon de la trame. Cette trame a une durée de l'ordre de 20 ms, et la mise à jour se fait avec un décalage de la fenêtre d'analyse de l'ordre de 10ms à 20 ms.
    Lors d'une phase d'apprentissage, un ensemble de modèles de Markov cachés (HMM, Hidden Markov Model) sont appris. Ils permettent de modéliser des segments de parole (ensemble de trames successives) pouvant être associés à des phonèmes si la phase d'apprentissage est supervisée (segmentation et transcription phonétique disponibles) ou à des sons spectralement stables dans le cas d'une segmentation obtenue de façon automatique. On utilise ici 64 modèles HMM, qui permettent lors de la phase de reconnaissance d'associer à chaque segment l'indice du modèle HMM identifié, et donc la classe à laquelle il appartient. Les modèles HMM servent aussi à l'aide d'un algorithme de type Viterbi à réaliser lors de la phase de codage la segmentation et la classification de chacun des segments (appartenance à une classe). Chaque segment est donc identifié par un indice compris entre 1 et 64 qui est transmis au décodeur.
    Le décodeur utilise cet indice pour retrouver l'unité de synthèse dans le dictionnaire construit lors de la phase d'apprentissage. Les unités de synthèse qui constituent le dictionnaire sont simplement les séquences de paramètres associés aux segments obtenus sur le corpus d'apprentissage.
    Une classe du dictionnaire contient l'ensemble des unités associées à un même modèle HMM. Chaque unité de synthèse est donc caractérisée par une séquence de paramètres spectraux, une séquence de valeur de pitch (profil de pitch), une séquence de gains (profil énergétique).
    Afin d'améliorer la qualité de la synthèse, chaque classe (de 1 à 64) du dictionnaire est subdivisée en 64 sous-classes, où chaque sous-classe contient les unités de synthèse qui sont précédées temporellement par un segment appartenant à une même classe. Cette approche permet de tenir compte du contexte passé, et donc d'améliorer la restitution des zones transitoires d'une unité vers l'autre.
    La présente invention concerne notamment un procédé de sélection d'une unité de synthèse multicritères. Le procédé permet par exemple de tenir compte simultanément du pitch, de la distorsion spectrale, et des profils d'évolution du pitch et de l'énergie.
    Le procédé de sélection pour un segment de parole à coder comporte par exemple les étapes de sélection schématisées à la figure 1 :
  • 1) Extraire le pitch moyen F0 (fréquence fondamentale moyenne) sur le segment à coder composé de plusieurs trames. Le pitch est par exemple calculé pour chaque trame T, les erreurs de pitch sont corrigées en tenant compte de l'ensemble du segment afin d'éliminer les erreurs de détection voisé/non voisé, et le pitch moyen est calculé sur l'ensemble des trames voisées du segment.
    Il est possible de représenter le pitch sur 5 bits, en utilisant par exemple un quantificateur non uniforme (compression logarithmique) appliqué à la période de pitch.
    La valeur du pitch de référence est par exemple obtenue à partir d'un générateur de prosodie dans le cas d'une application en synthèse.
  • 2) la valeur de pitch moyen F0 étant ainsi quantifiée, sélectionner un sous-ensemble d'unités de synthèse SE dans la sous-classe considérée. Le sous-ensemble est défini comme étant celui dont les valeurs moyennes de pitch sont les plus proches de la valeur de pitch F0.
    Dans la configuration précédente cela conduit à retenir de façon systématique les 32 unités les plus proches selon le critère du pitch moyen. Il est donc possible de retrouver ces unités au niveau du décodeur à partir du pitch moyen transmis.
  • 3) Parmi les unités de synthèse ainsi sélectionnées, appliquer un ou plusieurs critères de proximité ou de similarité, par exemple le critère de distorsion spectrale, et/ou le critère de profil d'énergie et/ou le critère de pitch pour déterminer l'unité de synthèse. Lorsque l'on utilise plusieurs critères, une étape de fusion 3b) est réalisée pour prendre la décision. L'étape de fusion des différents critères est réalisée par combinaison linéaire ou non-linéaire. Les paramètres utilisés pour réaliser cette combinaison peuvent être obtenus par exemple sur un corpus d'apprentissage en minimisant un critère de distorsion spectrale sur le signal re-synthétisé. Ce critère de distorsion peut avantageusement inclure une pondération perceptuelle soit au niveau des paramètres spectraux utilisés, soit au niveau de la mesure de distorsion. Dans le cas d'une loi de pondération non linéaire il est possible d'utiliser un réseau connexionniste (MLP, Multi Layer Perceptron par exemple), de la logique floue, ou une autre technique.
  • 4) Etape de codage du pitch
  • Le procédé peut comporter dans une variante de réalisation une étape de codage de pitch par correction du profil de pitch de synthèse exposée en détail ci-après.
    Le critère relatif au profil d'évolution du pitch permet en partie de tenir compte de l'information de voisement. Il est cependant possible de le désactiver lorsque le segment est totalement non voisé, ou que la sous-classe sélectionnée est aussi non voisée. En effet, on peut remarquer principalement trois types de sous-classes : les sous-classes contenant majoritairement des unités voisées, celles contenant majoritairement des unités non voisées, et les sous-classes contenant majoritairement des unités mixtes.
    Le procédé selon l'invention ne se limite pas à optimiser le débit alloué à l'information de prosodie mais permet aussi de conserver pour la phase de codage l'intégralité des unités de synthèse obtenues lors de la phase d'apprentissage avec un nombre de bits constant pour coder l'unité de synthèse. En effet l'unité de synthèse est caractérisée à la fois par la valeur de pitch et par son indice. Cette approche permet dans un schéma de codage indépendant du locuteur de couvrir l'ensemble des valeurs de pitch possibles et de sélectionner l'unité de synthèse en tenant compte en partie des caractéristiques du locuteur, il existe en effet pour un même locuteur une corrélation entre la plage de variation du pitch et les caractéristiques du conduit vocal (en particulier la longueur).
    On peut remarquer que le principe de sélection d'unités décrit peut s'appliquer à tout système dont le fonctionnement est basé sur une sélection d'unités et donc aussi à un système de synthèse à partir du texte.
    La figure 2 schématise un principe d'estimation des critères de similarité pour le profil du pitch.
    Le procédé comporte par exemple les étapes suivantes :
  • A1) sélectionner dans la sous-classe identifiée du dictionnaire des unités de synthèse et à partir de la valeur moyenne du pitch, les N unités les plus proches au sens du critère du pitch moyen. La suite du traitement se fait alors sur les profils de pitch associés à ces N unités. Le pitch est extrait lors de la phase d'apprentissage sur les unités de synthèse, et lors de la phase de codage sur le signal à coder. Les méthodes possibles pour l'extraction du pitch sont nombreuses, cependant les méthodes hybrides, combinant un critère temporel (AMDF, Average Magnitude Difference Function, ou autocorrélation normalisée) et un critère fréquentiel (HPS, Harmonic Power Sum, structure en peigne, ...) sont potentiellement plus robustes.
  • A2) aligner temporellement les N profils avce celui du segment à coder, par exemple par interpolation linéaire des N profils. Il est possible d'utiliser une technique d'alignement plus optimale basée sur un algorithme de programmation dynamique (DTW ou Dynamic Time Warping). L'algorithme s'applique sur les paramètres spectraux, les autres paramètres pitch, énergie, etc sont alignés de manière synchrone aux paramètres spectraux. Dans ce cas il faut transmettre les informations relatives au chemin d'alignement.
  • A3) calculer N mesures de similarités, entre les N profils de pitch alignés et le profil de pitch du segment de parole à coder pour obtenir les N coefficients de similarité {rp(1), rp(2), ....rp(N)}. Cette étape peut être réalisée au moyen d'une intercorrélation normalisée. L'alignement temporel peut être un alignement par ajustement simple des longueurs (interpolation linéaire des paramètres). L'utilisation d'une simple correction des longueurs des unités de synthèse permet notamment de ne pas transmettre d'information relative au chemin d'alignement, le chemin d'alignement étant partiellement pris en compte par les corrélations des profils de pitch et d'énergie.Dans le cas de segments mixtes (co-existence au sein d'un même segment de trames voisées et non voisées), l'utilisation des trames non voisées pour lesquelles le pitch est arbitrairement positionné à zéro permet de tenir compte dans une certaine mesure de l'évolution du voisement.La figure 3 schématise le principe d'estimation des critères de similarité pour le profil énergétique.
    Le procédé comporte par exemple les étapes suivantes :
  • A4) extraire les profils d'évolution de l'énergie pour les N unités sélectionnées comme indiqué précédemment, c'est-à-dire selon un critère de proximité du pitch moyen. Selon la technique de synthèse utilisée, le paramètre d'énergie utilisé peut soit correspondre à un gain (associé à un filtre de type LPC par exemple) ou une énergie (l'énergie calculée sur la structure harmonique dans le cas d'une modélisation harmonique/stochastique du signal). Enfin, l'estimation de l'énergie peut avantageusement se faire de manière synchrone du pitch (1 valeur d'énergie par période de pitch). Les profils énergétiques sont pré-calculés pour les unités de synthèse lors de la phase d'apprentissage.
  • A5) aligner temporellement les N profils avec celui des segments à coder, par exemple par interpolation linéaire, ou par programmation dynamique (alignement non-linéaire) de façon similaire à la méthode mise en oeuvre pour corriger le pitch.
  • A6) calculer N mesures de similarités, entre les profils des N valeurs d'énergie alignées et le profil d'énergie du segment de parole à coder pour obtenir les N coefficients de similarité {re(1), re(2), ...., re(N)}. Cette étape peut aussi être réalisée au moyen d'une intercorrélation normalisée. La figure 4 schématise le principe d'estimation des critères de similarité pour l'enveloppe spectrale.
    Le procédé comporte les étapes suivantes :
  • A7) aligner temporellement les N profils,
  • A8) déterminer les profils d'évolution des paramètres spectraux pour les N unités sélectionnées comme indiqué précédemment, c'est-à-dire selon un critère de proximité du pitch moyen. Il s'agit ici tout simplement de calculer le pitch moyen du segment à coder, et de considérer les unités de synthèse de la sous-classe associée (indice HMM courant pour définir la classe, indice HMM précédent pour définir la sous-classe) qui ont un pitch moyen proche.
  • A9) calculer N mesures de similarités, entre la séquence spectrale du segment à coder et les N séquences spectrales extraites des unités de synthèse sélectionnées pour obtenir les N coefficients de similarité {rs(1), rs(2), ...., rs(N)}. Cette étape peut être réalisée au moyen d'une intercorrélation normalisée.
  • La mesure de similarité peut être une distance spectrale.
    L'étape A9) comprend par exemple une étape où l'on moyenne l'ensemble des spectres d'un même segment et la mesure de similarité est une mesure d'intercorrélation.
    Le critère de distorsion spectrale est par exemple calculé sur des structures harmoniques ré-échantillonnées à pitch constant ou ré-échantillonnées au pitch du segment à coder, après interpolation des structures harmoniques initiales.
    Le critère de similarité va dépendre des paramètres spectraux utilisés (par exemple du type de paramètres utilisés pour la représentation de l'enveloppe). Plusieurs types de paramètres spectraux peuvent être utilisés, dans la mesure où ils permettent de définir une mesure de distorsion spectrale. Dans le domaine du codage de la parole, il est courant d'utiliser les paramètres LSP ou LSF (LSP, Line Spectral Pair, LSF, Line Spectral Frequencies) dérivés d'une analyse par prédiction linéaire. Dans le domaine de la reconnaissance vocale, les paramètres cepstraux sont généralement utilisés, et ils peuvent soit être dérivés d'une analyse par prédiction linéaire (LPCC, Linear Prediction Cepstrum Coefficients) ou estimés à partir d'un banc de filtres souvent sur une échelle perceptuelle de type Mel ou Bark (MFCC, Mel Frequency Cepstrum Coefficients). Il est aussi possible dans la mesure où on utilise une modélisation sinusoïdale de la composante harmonique du signal de parole, d'utiliser directement les amplitudes des fréquences harmoniques. Ces derniers paramètres étant estimés en fonction du pitch ne peuvent être utilisés directement pour calculer une distance. Le nombre de coefficients obtenus est en effet variable en fonction du pitch, contrairement aux paramètres LPCC, MFCC ou LSF. Un pré-traitement consiste alors à estimer une enveloppe spectrale à partir des amplitudes harmoniques (interpolation linéaire ou polynomiale de type spline) et à réechantillonner l'enveloppe ainsi obtenue, soit en utilisant la fréquence fondamentale du segment à coder, soit en utilisant une fréquence fondamentale constante (100 Hz par exemple). Une fréquence fondamentale constante permet de pré-calculer l'ensemble des structures harmoniques des unités de synthèse lors de la phase d'apprentissage. Le re-échantillonnage se fait alors uniquement sur le segment à coder. D'autre part, si on se limite à un alignement temporel par interpolation linéaire, il est possible de moyenner les structures harmoniques sur l'ensemble des segments considérés. La mesure de similarité peut alors être estimée simplement à partir de la structure harmonique moyenne du segment à coder, et celle de l'unité de synthèse considérée. Cette mesure de similarité peut aussi être une mesure d'intercorrélation normalisée. On peut aussi noter que la procédure de ré-échantillonnage peut s'effectuer sur une échelle perceptuelle des fréquences (Mel ou Bark).
    Pour la procédure d'alignement temporel il est possible d'utiliser soit un algorithme de programmation dynamique (DTW, Dynamic Time Warping), soit d'effectuer une interpolation linéaire simple (ajustement linéaire des longueurs). Dans l'hypothèse où l'on ne souhaite pas transmettre d'information supplémentaire relative au chemin d'alignement, il est préférable d'utiliser une simple interpolation linéaire des paramètres. La prise en compte du meilleur alignement est alors en partie réaliser par la procédure de sélection.
    Codage du pitch par modification du profil de synthèse
    Selon un mode de réalisation, le procédé comporte une étape de codage du pitch par modification du profil de synthèse. Cela consiste à resynthétiser un profil de pitch à partir de celui de l'unité de synthèse sélectionnée et un gain linéairement variable sur la durée du segment à coder. Il suffit alors de transmettre une valeur supplémentaire pour caractériser le gain correcteur sur l'ensemble du segment.
    Le pitch reconstruit au niveau du décodeur est donné par l'équation suivante : f 0(n) = g(n).f0S (n) = (a.n+b).f0S (n)    où f0S (n) est le pitch à la trame d'indice n de l'unité de synthèse.
    Cela correspond à une transformation linéaire du profil du pitch.
    Les valeurs optimales de a et b sont estimées au niveau du codeur en minimisant l'erreur quadratique moyenne :
    Figure 00120001
    ce qui conduit aux relations suivantes : a = (S4.S 2 - S5.S 1)(S2.S 2 - S3.S 1) et b = (S5.S 2 - S4.S 3) (S2.S 2 - S3.S 1)
    Figure 00130001
    Figure 00130002
    Figure 00130003
    Figure 00130004
    Figure 00130005
    Le coefficient a, ainsi que la valeur moyenne du pitch modélisé sont quantifiés et transmis : aq = Q[a]
    Figure 00130006
    La valeur du coefficient b est obtenu au niveau du décodeur à partir de la relation suivante : bq = f 0q - Σa q .n.f 0S (n) N f0S 〈f0S est le pitch moyen de l'unité de synthèse.
    Remarque : cette méthode de correction peut bien entendu s'appliquer au profil énergétique.
    Exemple de débit associé au schéma de codage
    Les informations relatives au débit associé au schéma de codage décrit précédemment sont les suivantes :
    • Indice de classe sur 6 bits (64 classes)
    • Indice de l'unité sélectionnée sur 5 bits (32 unités par sous-classe)
    • Longueur du segment sur 4 bits (de 3 à 18 trames)
    Le nombre moyen de segments par seconde se situe entre 15 et 20; ce qui conduit à un débit de base situé entre 225 et 300 bits/sec pour la configuration précédente. A ce débit de base vient s'ajouter le débit nécessaire pour représenter l'information de pitch et d'énergie.
    • FO moyen sur 5 bits
    • Coefficient correcteur du profil de pitch sur 5bits
    • Gain correcteur sur 5 bits
    Le débit associé à la prosodie se situe alors entre 225 et 300 bits/sec, ce qui conduit à un débit global entre 450 et 600 bits/sec.
    Références
  • [1] G. Baudoin, F. El Chami, "Corpus based very low bit rate speech coder", Proc. Conf. IEEE ICASSP 2003, Hong-Kong, 2003.
  • [2] G. Baudoin, J. Cernocky, P. Gournay, G. Chollet, "Codage de la parole à bas et très bas debit", Annales des télécommunications, Vol. 55, N 9-10 Pages 421-456, Nov. 2000.
  • [3] G. Baudoin, F. Capman, J. Cernocky, F. El-chami, M. Charbit, G. Chollet, D. Petrovska-Delacrétaz. "Advances in Very Low Bit Rate Speech Coding using Recognition and Synthesis Techniques", TSD' 2002, pp. 269-276, Brno, Czech Republic, Sept 2002.
  • [4] K.Lee, R.Cox, 'A segmental coder based on a concatenative TTS", in Speech Communications, Vol. 38, pp 89-100, 2002.
  • [5] K.Lee, R.Cox, "A very low bit rate speech coder based on a recognition/synthesis paradigm", in IEEE on ASSP, Vol; 9, pp 482-491, July 2001.
  • Claims (14)

    1. Procédé de sélection d'unités de synthèse d'une information pouvant être décomposée en unités de synthèse caractérisé en ce qu'il comporte au
      moins les étapes suivantes :
      pour un segment d'information considéré :
      déterminer la valeur F0 de la fréquence fondamentale moyenne pour le segment d'information considéré,
      sélectionner un sous-ensemble d'unités de synthèse défini comme étant celui dont les valeurs moyennes de pitch sont les plus proches de la valeur de pitch F0,
      appliquer un ou plusieurs critères de proximité aux unités de synthèse sélectionnées pour déterminer une unité de synthèse représentative du segment d'information.
    2. Procédé de sélection d'unités de synthèse selon la revendication 1 caractérisé en ce que l'information est un segment de parole à coder et en ce que l'on utilise comme critères de proximité la fréquence fondamentale ou pitch, la distorsion spectrale, et/ou le profil d'énergie et on exécute une étape de fusion des critères afin de déterminer l'unité de synthèse représentative.
    3. Procédé de sélection d'unités selon la revendication 1 caractérisé en ce que pour un segment de parole à coder le pitch de référence est obtenu à partir d'un générateur de prosodie.
    4. Procédé selon la revendication 2 caractérisé en ce que l'estimation du critère de similarité pour le profil du pitch comporte au moins les étapes suivantes :
      A1) sélectionner dans la sous-classe identifiée du dictionnaire des unités de synthèse et à partir de la valeur moyenne du pitch, les N unités les plus proches au sens du critère du pitch moyen,
      A2) aligner temporellement les N profils avec celui du segment à coder,
      A3) calculer N mesures de similarités, entre les N profils de pitch alignés et le profil du pitch du segment de parole à coder pour obtenir les N coefficients de similarité {rp(1), rp(2), ....rp(N)}.
    5. Procédé selon la revendication 2 caractérisé en ce que l'estimation de similarité pour le profil énergétique comporte au moins les étapes suivantes :
      A4) déterminer les profils d'évolution de l'énergie pour les N unités sélectionnées selon un critère de proximité du pitch moyen.
      A5) aligner temporellement les N profils avec celui du segment à coder,
      A6) calculer N mesures de similarités, entre les N profils de d'énergie alignés et le profil d'énergie du segment de parole à coder pour obtenir les N coefficients de similarité {re(1), re(2), ...., re(N)}.
    6. Procédé selon la revendication 2 caractérisé en ce que l'estimation des critères de similarité pour l'enveloppe spectrale comporte au moins les étapes suivantes :
      A7) aligner temporellement les N profils avec celui du segment à coder,
      A8) déterminer les profils d'évolution des paramètres spectraux pour les N unités sélectionnées selon un critère de proximité du pitch moyen,
      A9) calculer N mesures des similarités, entre la séquence spectrale du segment à coder et les N séquences spectrales extraites correspondant du segment de parole à coder pour obtenir les N coefficients de similarité {rs(1), rs(2), ...., rs(N)},
    7. Procédé selon l'une des revendications 4, 5 et 6 caractérisé en ce que l'alignement temporel est un alignement temporel obtenu par programmation dynamique (DTW) ou un alignement par ajustement linéaire des longueurs.
    8. Procédé selon l'une des revendications 4, 5 et 6 caractérisé en ce que la mesure de similarité est une mesure d'intercorrélation normalisée.
    9. Procédé selon la revendication 6 caractérisé en ce que la mesure de similarité est une mesure de distance spectrale.
    10. Procédé selon la revendication 6 caractérisé en ce que l'étape A9) comprend une étape où l'ensemble des spectres d'un même segment est moyenné et en ce que la mesure de similarité est une mesure d'intercorrélation.
    11. Procédé selon la revendication 6 caractérisé en ce que le critère de distorsion spectrale est calculé sur des structures harmoniques ré-échantillonnées à pitch constant ou ré-échantillonnées au pitch du segment à coder, après interpolation des structures harmoniques initiales.
    12. Procédé selon l'une des revendications 1 à 11 caractérisé en ce qu'il comporte une étape de codage et/ou une étape de correction du pitch par modification du profil de synthèse.
    13. Procédé selon la revendication 12 caractérisé en ce que l'étape de codage et/ou correction du pitch est une transformation linéaire du profil du pitch d'origine.
    14. Utilisation du procédé selon l'une des revendications 1 à 12 pour la sélection et/ou le codage d'unités de synthèse pour un codeur de parole très bas débit.
    EP04105204A 2003-10-24 2004-10-21 Procédé de sélection d'unités de synthèse Expired - Lifetime EP1526508B1 (fr)

    Applications Claiming Priority (2)

    Application Number Priority Date Filing Date Title
    FR0312494A FR2861491B1 (fr) 2003-10-24 2003-10-24 Procede de selection d'unites de synthese
    FR0312494 2003-10-24

    Publications (2)

    Publication Number Publication Date
    EP1526508A1 true EP1526508A1 (fr) 2005-04-27
    EP1526508B1 EP1526508B1 (fr) 2009-05-27

    Family

    ID=34385390

    Family Applications (1)

    Application Number Title Priority Date Filing Date
    EP04105204A Expired - Lifetime EP1526508B1 (fr) 2003-10-24 2004-10-21 Procédé de sélection d'unités de synthèse

    Country Status (6)

    Country Link
    US (1) US8195463B2 (fr)
    EP (1) EP1526508B1 (fr)
    AT (1) ATE432525T1 (fr)
    DE (1) DE602004021221D1 (fr)
    ES (1) ES2326646T3 (fr)
    FR (1) FR2861491B1 (fr)

    Families Citing this family (15)

    * Cited by examiner, † Cited by third party
    Publication number Priority date Publication date Assignee Title
    JP4265501B2 (ja) * 2004-07-15 2009-05-20 ヤマハ株式会社 音声合成装置およびプログラム
    JP4025355B2 (ja) * 2004-10-13 2007-12-19 松下電器産業株式会社 音声合成装置及び音声合成方法
    US7126324B1 (en) * 2005-11-23 2006-10-24 Innalabs Technologies, Inc. Precision digital phase meter
    ATE456130T1 (de) * 2007-10-29 2010-02-15 Harman Becker Automotive Sys Partielle sprachrekonstruktion
    US8401849B2 (en) * 2008-12-18 2013-03-19 Lessac Technologies, Inc. Methods employing phase state analysis for use in speech synthesis and recognition
    US8731931B2 (en) * 2010-06-18 2014-05-20 At&T Intellectual Property I, L.P. System and method for unit selection text-to-speech using a modified Viterbi approach
    US9664518B2 (en) * 2010-08-27 2017-05-30 Strava, Inc. Method and system for comparing performance statistics with respect to location
    CN102651217A (zh) * 2011-02-25 2012-08-29 株式会社东芝 用于合成语音的方法、设备以及用于语音合成的声学模型训练方法
    US9291713B2 (en) 2011-03-31 2016-03-22 Strava, Inc. Providing real-time segment performance information
    US9116922B2 (en) 2011-03-31 2015-08-25 Strava, Inc. Defining and matching segments
    US8620646B2 (en) * 2011-08-08 2013-12-31 The Intellisis Corporation System and method for tracking sound pitch across an audio signal using harmonic envelope
    US10453479B2 (en) 2011-09-23 2019-10-22 Lessac Technologies, Inc. Methods for aligning expressive speech utterances with text and systems therefor
    US8718927B2 (en) 2012-03-12 2014-05-06 Strava, Inc. GPS data repair
    US8886539B2 (en) * 2012-12-03 2014-11-11 Chengjun Julian Chen Prosody generation using syllable-centered polynomial representation of pitch contours
    WO2020171036A1 (fr) * 2019-02-20 2020-08-27 ヤマハ株式会社 Procédé de synthèse de signal sonore, procédé d'apprentissage de modèle génératif, système de synthèse de signal sonore et programme

    Citations (1)

    * Cited by examiner, † Cited by third party
    Publication number Priority date Publication date Assignee Title
    US20020065655A1 (en) * 2000-10-18 2002-05-30 Thales Method for the encoding of prosody for a speech encoder working at very low bit rates

    Family Cites Families (9)

    * Cited by examiner, † Cited by third party
    Publication number Priority date Publication date Assignee Title
    JPH10260692A (ja) * 1997-03-18 1998-09-29 Toshiba Corp 音声の認識合成符号化/復号化方法及び音声符号化/復号化システム
    JP2000056789A (ja) * 1998-06-02 2000-02-25 Sanyo Electric Co Ltd 音声合成装置及び電話機
    JP2000075878A (ja) * 1998-08-31 2000-03-14 Canon Inc 音声合成装置およびその方法ならびに記憶媒体
    US6574593B1 (en) * 1999-09-22 2003-06-03 Conexant Systems, Inc. Codebook tables for encoding and decoding
    US6581032B1 (en) * 1999-09-22 2003-06-17 Conexant Systems, Inc. Bitstream protocol for transmission of encoded voice signals
    JP3515039B2 (ja) * 2000-03-03 2004-04-05 沖電気工業株式会社 テキスト音声変換装置におけるピッチパタン制御方法
    JP3728172B2 (ja) * 2000-03-31 2005-12-21 キヤノン株式会社 音声合成方法および装置
    SE521600C2 (sv) * 2001-12-04 2003-11-18 Global Ip Sound Ab Lågbittaktskodek
    CA2388352A1 (fr) * 2002-05-31 2003-11-30 Voiceage Corporation Methode et dispositif pour l'amelioration selective en frequence de la hauteur de la parole synthetisee

    Patent Citations (1)

    * Cited by examiner, † Cited by third party
    Publication number Priority date Publication date Assignee Title
    US20020065655A1 (en) * 2000-10-18 2002-05-30 Thales Method for the encoding of prosody for a speech encoder working at very low bit rates

    Non-Patent Citations (4)

    * Cited by examiner, † Cited by third party
    Title
    BAUDOIN G ; EL CHAMI F: "Corpus based very low bit rate speech coding", 2003 IEEE INTERNATIONAL CONFERENCE ON ACOUSTICS, SPEECH, AND SIGNAL PROCESSING, vol. 1, 6 April 2003 (2003-04-06) - 10 April 2003 (2003-04-10), HONG KONG, CHINA, pages 792 - 795, XP002285304, ISBN: 0-7803-7663-3 *
    C.BAVEREL ET AL., CODAGE DE LA PAROLE À TRÈS BAS DÉBIT PAR INDEXATION D'UNITÉS DE TAILLE VARIABLE, 2001
    M. PADELLINI, F. CAPMAN, G. BAUDOIN: "Dynamic Unit Selection for Very Low Bit Rate Coding at 500 bits/sec", TSD 2004, 8 September 2004 (2004-09-08) - 11 September 2004 (2004-09-11), BRNO, CZ, XP002312723 *
    M. PADELLINI, G. BAUDOIN AND F. CAPMAN: "Codage de la parole a très bas débit par indexation d'unités de taille variable", RJC'2003, 5ÈMES RENCONTRES JEUNES CHERCHEURS EN PAROLE, 23 September 2003 (2003-09-23) - 26 September 2003 (2003-09-26), GRENOBLE, FRANCE, XP002285303 *

    Also Published As

    Publication number Publication date
    ES2326646T3 (es) 2009-10-16
    ATE432525T1 (de) 2009-06-15
    EP1526508B1 (fr) 2009-05-27
    FR2861491A1 (fr) 2005-04-29
    FR2861491B1 (fr) 2006-01-06
    US20050137871A1 (en) 2005-06-23
    DE602004021221D1 (de) 2009-07-09
    US8195463B2 (en) 2012-06-05

    Similar Documents

    Publication Publication Date Title
    EP1526508B1 (fr) Procédé de sélection d'unités de synthèse
    US20080082333A1 (en) Prosody Conversion
    FR2522179A1 (fr) Procede et appareil de reconnaissance de paroles permettant de reconnaitre des phonemes particuliers du signal vocal quelle que soit la personne qui parle
    JP2002533772A (ja) 可変レートスピーチコーディング
    US20020184009A1 (en) Method and apparatus for improved voicing determination in speech signals containing high levels of jitter
    JPH075892A (ja) 音声認識方法
    EP1606792B1 (fr) Procede d analyse d informations de frequence fondament ale et procede et systeme de conversion de voix mettant en oeuvre un tel procede d analyse
    JPH08123484A (ja) 信号合成方法および信号合成装置
    WO2005106853A1 (fr) Procede et systeme de conversion rapides d'un signal vocal
    Bhatt Simulation and overall comparative evaluation of performance between different techniques for high band feature extraction based on artificial bandwidth extension of speech over proposed global system for mobile full rate narrow band coder
    Khonglah et al. Speech enhancement using source information for phoneme recognition of speech with background music
    Lee et al. A segmental speech coder based on a concatenative TTS
    Albahri et al. Artificial bandwidth extension to improve automatic emotion recognition from narrow-band coded speech
    Fernandez Gallardo et al. Spectral sub-band analysis of speaker verification employing narrowband and wideband speech
    Miyamoto et al. Non-linear harmonic generation based blind bandwidth extension considering aliasing artifacts
    Min et al. Deep vocoder: Low bit rate compression of speech with deep autoencoder
    Berisha et al. Bandwidth extension of speech using perceptual criteria
    Bachhav et al. Exploiting explicit memory inclusion for artificial bandwidth extension
    JP2000514207A (ja) 音声合成システム
    JPH1097274A (ja) 話者認識方法及び装置
    EP1846918B1 (fr) Procede d'estimation d'une fonction de conversion de voix
    Sharma et al. Non-intrusive bit-rate detection of coded speech
    Salor et al. Dynamic programming approach to voice transformation
    CN119360823B (zh) 基于多子带生成策略的语音合成系统、方法、介质及设备
    Do et al. Objective evaluation of HMM-based speech synthesis system using kullback-leibler divergence.

    Legal Events

    Date Code Title Description
    PUAI Public reference made under article 153(3) epc to a published international application that has entered the european phase

    Free format text: ORIGINAL CODE: 0009012

    AK Designated contracting states

    Kind code of ref document: A1

    Designated state(s): AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HU IE IT LI LU MC NL PL PT RO SE SI SK TR

    AX Request for extension of the european patent

    Extension state: AL HR LT LV MK

    17P Request for examination filed

    Effective date: 20051007

    AKX Designation fees paid

    Designated state(s): AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HU IE IT LI LU MC NL PL PT RO SE SI SK TR

    17Q First examination report despatched

    Effective date: 20070612

    GRAP Despatch of communication of intention to grant a patent

    Free format text: ORIGINAL CODE: EPIDOSNIGR1

    GRAS Grant fee paid

    Free format text: ORIGINAL CODE: EPIDOSNIGR3

    GRAA (expected) grant

    Free format text: ORIGINAL CODE: 0009210

    AK Designated contracting states

    Kind code of ref document: B1

    Designated state(s): AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HU IE IT LI LU MC NL PL PT RO SE SI SK TR

    REG Reference to a national code

    Ref country code: GB

    Ref legal event code: FG4D

    Free format text: NOT ENGLISH

    REG Reference to a national code

    Ref country code: CH

    Ref legal event code: EP

    REG Reference to a national code

    Ref country code: IE

    Ref legal event code: FG4D

    Free format text: LANGUAGE OF EP DOCUMENT: FRENCH

    REF Corresponds to:

    Ref document number: 602004021221

    Country of ref document: DE

    Date of ref document: 20090709

    Kind code of ref document: P

    REG Reference to a national code

    Ref country code: DE

    Ref legal event code: R096

    Ref document number: 602004021221

    Country of ref document: DE

    Effective date: 20090709

    REG Reference to a national code

    Ref country code: ES

    Ref legal event code: FG2A

    Ref document number: 2326646

    Country of ref document: ES

    Kind code of ref document: T3

    PG25 Lapsed in a contracting state [announced via postgrant information from national office to epo]

    Ref country code: PT

    Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT

    Effective date: 20090927

    Ref country code: FI

    Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT

    Effective date: 20090527

    Ref country code: AT

    Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT

    Effective date: 20090527

    NLV1 Nl: lapsed or annulled due to failure to fulfill the requirements of art. 29p and 29m of the patents act
    PG25 Lapsed in a contracting state [announced via postgrant information from national office to epo]

    Ref country code: SI

    Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT

    Effective date: 20090527

    Ref country code: NL

    Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT

    Effective date: 20090527

    Ref country code: PL

    Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT

    Effective date: 20090527

    Ref country code: SE

    Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT

    Effective date: 20090827

    REG Reference to a national code

    Ref country code: IE

    Ref legal event code: FD4D

    PG25 Lapsed in a contracting state [announced via postgrant information from national office to epo]

    Ref country code: EE

    Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT

    Effective date: 20090527

    Ref country code: DK

    Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT

    Effective date: 20090527

    Ref country code: RO

    Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT

    Effective date: 20090527

    Ref country code: CZ

    Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT

    Effective date: 20090527

    Ref country code: IE

    Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT

    Effective date: 20090527

    PG25 Lapsed in a contracting state [announced via postgrant information from national office to epo]

    Ref country code: SK

    Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT

    Effective date: 20090527

    PG25 Lapsed in a contracting state [announced via postgrant information from national office to epo]

    Ref country code: BG

    Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT

    Effective date: 20090827

    PLBE No opposition filed within time limit

    Free format text: ORIGINAL CODE: 0009261

    STAA Information on the status of an ep patent application or granted ep patent

    Free format text: STATUS: NO OPPOSITION FILED WITHIN TIME LIMIT

    BERE Be: lapsed

    Owner name: THALES

    Effective date: 20091031

    26N No opposition filed

    Effective date: 20100302

    PG25 Lapsed in a contracting state [announced via postgrant information from national office to epo]

    Ref country code: MC

    Free format text: LAPSE BECAUSE OF NON-PAYMENT OF DUE FEES

    Effective date: 20091031

    REG Reference to a national code

    Ref country code: DE

    Ref legal event code: R097

    Ref document number: 602004021221

    Country of ref document: DE

    Effective date: 20100302

    PG25 Lapsed in a contracting state [announced via postgrant information from national office to epo]

    Ref country code: GR

    Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT

    Effective date: 20090828

    Ref country code: BE

    Free format text: LAPSE BECAUSE OF NON-PAYMENT OF DUE FEES

    Effective date: 20091031

    PG25 Lapsed in a contracting state [announced via postgrant information from national office to epo]

    Ref country code: LU

    Free format text: LAPSE BECAUSE OF NON-PAYMENT OF DUE FEES

    Effective date: 20091021

    PG25 Lapsed in a contracting state [announced via postgrant information from national office to epo]

    Ref country code: HU

    Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT

    Effective date: 20091128

    PG25 Lapsed in a contracting state [announced via postgrant information from national office to epo]

    Ref country code: TR

    Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT

    Effective date: 20090527

    PG25 Lapsed in a contracting state [announced via postgrant information from national office to epo]

    Ref country code: CY

    Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT

    Effective date: 20090527

    REG Reference to a national code

    Ref country code: FR

    Ref legal event code: PLFP

    Year of fee payment: 13

    REG Reference to a national code

    Ref country code: FR

    Ref legal event code: PLFP

    Year of fee payment: 14

    PGFP Annual fee paid to national office [announced via postgrant information from national office to epo]

    Ref country code: DE

    Payment date: 20171018

    Year of fee payment: 14

    PGFP Annual fee paid to national office [announced via postgrant information from national office to epo]

    Ref country code: CH

    Payment date: 20171013

    Year of fee payment: 14

    Ref country code: GB

    Payment date: 20171013

    Year of fee payment: 14

    Ref country code: ES

    Payment date: 20171102

    Year of fee payment: 14

    Ref country code: IT

    Payment date: 20171024

    Year of fee payment: 14

    REG Reference to a national code

    Ref country code: FR

    Ref legal event code: PLFP

    Year of fee payment: 15

    REG Reference to a national code

    Ref country code: DE

    Ref legal event code: R119

    Ref document number: 602004021221

    Country of ref document: DE

    REG Reference to a national code

    Ref country code: CH

    Ref legal event code: PL

    GBPC Gb: european patent ceased through non-payment of renewal fee

    Effective date: 20181021

    PG25 Lapsed in a contracting state [announced via postgrant information from national office to epo]

    Ref country code: DE

    Free format text: LAPSE BECAUSE OF NON-PAYMENT OF DUE FEES

    Effective date: 20190501

    PG25 Lapsed in a contracting state [announced via postgrant information from national office to epo]

    Ref country code: CH

    Free format text: LAPSE BECAUSE OF NON-PAYMENT OF DUE FEES

    Effective date: 20181031

    Ref country code: LI

    Free format text: LAPSE BECAUSE OF NON-PAYMENT OF DUE FEES

    Effective date: 20181031

    PG25 Lapsed in a contracting state [announced via postgrant information from national office to epo]

    Ref country code: GB

    Free format text: LAPSE BECAUSE OF NON-PAYMENT OF DUE FEES

    Effective date: 20181021

    Ref country code: IT

    Free format text: LAPSE BECAUSE OF NON-PAYMENT OF DUE FEES

    Effective date: 20181021

    REG Reference to a national code

    Ref country code: ES

    Ref legal event code: FD2A

    Effective date: 20191203

    PG25 Lapsed in a contracting state [announced via postgrant information from national office to epo]

    Ref country code: ES

    Free format text: LAPSE BECAUSE OF NON-PAYMENT OF DUE FEES

    Effective date: 20181022

    P01 Opt-out of the competence of the unified patent court (upc) registered

    Effective date: 20230517

    PGFP Annual fee paid to national office [announced via postgrant information from national office to epo]

    Ref country code: FR

    Payment date: 20230921

    Year of fee payment: 20