EP2543035B1 - Verfahren zur ermittlung von grundfrequenz-verläufen mehrerer signalquellen - Google Patents
Verfahren zur ermittlung von grundfrequenz-verläufen mehrerer signalquellen Download PDFInfo
- Publication number
- EP2543035B1 EP2543035B1 EP11708975.5A EP11708975A EP2543035B1 EP 2543035 B1 EP2543035 B1 EP 2543035B1 EP 11708975 A EP11708975 A EP 11708975A EP 2543035 B1 EP2543035 B1 EP 2543035B1
- Authority
- EP
- European Patent Office
- Prior art keywords
- model
- fundamental frequency
- tracking
- speakers
- signal
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Not-in-force
Links
- 238000000034 method Methods 0.000 title claims description 35
- 230000003993 interaction Effects 0.000 claims description 30
- 238000012549 training Methods 0.000 claims description 20
- 238000004422 calculation algorithm Methods 0.000 claims description 19
- 239000000203 mixture Substances 0.000 claims description 12
- 238000001228 spectrum Methods 0.000 description 40
- 238000009826 distribution Methods 0.000 description 23
- 230000001419 dependent effect Effects 0.000 description 7
- 238000004458 analytical method Methods 0.000 description 5
- 239000002131 composite material Substances 0.000 description 5
- 230000006870 function Effects 0.000 description 4
- 238000012545 processing Methods 0.000 description 4
- 238000010586 diagram Methods 0.000 description 3
- 230000000694 effects Effects 0.000 description 3
- 239000011159 matrix material Substances 0.000 description 3
- 238000000926 separation method Methods 0.000 description 3
- 230000007704 transition Effects 0.000 description 3
- 238000007476 Maximum Likelihood Methods 0.000 description 2
- 230000006835 compression Effects 0.000 description 2
- 238000007906 compression Methods 0.000 description 2
- 230000008569 process Effects 0.000 description 2
- 238000005070 sampling Methods 0.000 description 2
- 238000013179 statistical model Methods 0.000 description 2
- 238000005309 stochastic process Methods 0.000 description 2
- 241000665848 Isca Species 0.000 description 1
- 238000013459 approach Methods 0.000 description 1
- 238000004364 calculation method Methods 0.000 description 1
- 230000001186 cumulative effect Effects 0.000 description 1
- 238000005516 engineering process Methods 0.000 description 1
- 238000011156 evaluation Methods 0.000 description 1
- 230000006698 induction Effects 0.000 description 1
- 230000010365 information processing Effects 0.000 description 1
- 230000001537 neural effect Effects 0.000 description 1
- 238000010606 normalization Methods 0.000 description 1
- 238000005457 optimization Methods 0.000 description 1
- 230000010355 oscillation Effects 0.000 description 1
- 230000008447 perception Effects 0.000 description 1
- 230000005236 sound signal Effects 0.000 description 1
- 230000001629 suppression Effects 0.000 description 1
- 230000002123 temporal effect Effects 0.000 description 1
- 230000009466 transformation Effects 0.000 description 1
Images
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L25/00—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
- G10L25/90—Pitch determination of speech signals
Definitions
- the fundamental frequency is a fundamental quantity in the analysis, recognition, coding, compression and representation of speech.
- Speech signals can be described by the superimposition of sinusoidal vibrations.
- voiced sounds such as Vowels is the frequency of these oscillations either the fundamental frequency or a multiple of the fundamental frequency, the so-called harmonics or harmonics.
- voice signals can be assigned to specific signal sources by identifying the fundamental frequency of the signal.
- a high accuracy of the track of the multiple fundamental frequencies can be achieved, or fundamental frequency characteristics can be better associated with the respective signal sources or speakers.
- a training phase a) using speaker-specific information and the choice of a suitable interaction model in b) the computational effort is significantly minimized, so that the method can be performed quickly and with low resources. It is not mixed spectra with the respective individual speaker portions (in the simplest case two speakers and a corresponding fundamental frequency pair) trained, but the respective individual speaker parts, which further minimizes the computational effort and the number of training phases to be performed.
- the number of pitch states to be trained results from the observed frequency range and its subdivision (see below). For voice recordings, such a frequency range is 80 to 500 Hz, for example.
- the temporal sequence of the estimated pitch values can be modeled by a Hidden Markov Model (HMM) or by a Factorial Hidden Markov Model (FHMM), and these graphical models can be modeled by the Max-Sum Algorithm, the Junction Tree Algorithm or the Sum Product algorithm are used.
- HMM Hidden Markov Model
- FHMM Factorial Hidden Markov Model
- the spectrogram properties are determined by means of a Gaussian Mixture Model (GMM).
- GMM Gaussian Mixture Model
- the number of components of a GMM is determined by applying the Minimum Description Length (MDL) Criterion.
- MDL Criterion is used to select a model from a variety of possible models. For example, they differ Models, as in this case, only by the number of Gauss components used.
- AIC Akaike Information Criterion
- the interaction model is a linear model or the mixture-maximization (MixMax) interaction model or the ALGONQUIN interaction model.
- the tracking in c) takes place by means of the Factorial Hidden Markov Model (FHMM).
- FHMM Factorial Hidden Markov Model
- a number of algorithms can be used, for example, in variants of the invention, the sum-product algorithm or the max-sum algorithm are used.
- the invention relates to a simple and efficient modeling method for the fundamental frequency tracking of a plurality of simultaneously emitting signal sources, for example speakers in a conference or meeting situation.
- the method according to the invention will be presented on the basis of two speakers for reasons of traceability, however, the method can be applied to any number of subjects.
- the speech signals are single-channel, ie with only one recording means - e.g. Microphone - recorded.
- the short-term spectrum of a speech signal given a basic speech frequency can be described by means of probability distributions such as the Gaussian normal distribution.
- a single normal distribution, given by the parameters mean ⁇ and variance ⁇ 2 is usually not sufficient.
- the Gaussian Mixture Model or Gaussian Mixed Distribution Model - GMM.
- the GMM is composed of several individual Gaussian normal distributions.
- An M-fold Gaussian distribution with 3M-1 parameters can be described, Mean, variance, and weighting factor for each of the M Gaussian distributions (the weighting factor of the Mth Gauss component is redundant, hence the "-1").
- a special case of the "Expectation Maximization" algorithm is often used, as described below.
- 170 GMMs are trained (one GMM per pitch state) for each speaker using the EM (Expectation Maximization) algorithm.
- the model parameters must be adapted to maximize.
- the prerequisite for finding this maximum is that after each induction step and the calculation of a new model, the likelihood of the model increases.
- a number of superimposed Gaussian distributions and a GMM with arbitrary parameters eg mean, variance and weighting factors
- the iterative maximum likelihood (ML) estimation of the EM thus yields a representative model for the single-speaker speech signal, in the present case a speaker-dependent GMM p s i
- 170 GMMs must be trained, ie one GMM for each pitch state x i corresponding to the number of states defined above.
- GMMs are available for all fundamental frequency values of all speakers.
- the recorded and sampled with a sampling frequency of, for example, f s 16kHz single-channel speech signals are considered in sections.
- the observed (log) spectrum y (t) of the mixed signal ie the mixture of the two individual speaker signals, is modeled with the observation probability p (y (t)
- this observation probability for example, the most probable pitch states of both speakers can be determined at any given time, or the observation probability serves directly as input for the tracking algorithm used in step c).
- the (log) spectra of the individual speakers can be added to the mixed signal y; the magnitude spectra add up approximately, so for the log magnitude spectra: y ⁇ log (exp (s 1 ) + exp (s 2 )).
- the individual spectra according to the above-mentioned form are added in the magnitude spectrogram, that is, the mixed signal is approximately the sum of the magnitude spectra of the individual speakers.
- ⁇ 2 , ⁇ 2 ) forms the probability distribution of the mixed signal NV (y
- a further interaction model is used: According to the MixMax interaction model, the log spectrogram of two speakers can be approximated by the element-wise maximum of the log spectra of the individual speakers. This makes it possible to quickly obtain a good probability model of the observed mixed signal. As a result, the duration and computational effort of the learning phase are drastically reduced.
- the observed log magnitude spectrum y (t) of the composite signal is approximated by the elemental maxima of both single-speaker log magnitude spectra.
- the logarithmic magnitude spectrogram of the composite signal is approximated by elementwise maximum of both logarithmic single-speaker spectra.
- speaker i For a fixed fundamental frequency value with respect to a state x i (1) , speaker i generates a log spectrum, s i (t) , which is a realization of the single-speaker model p (s i (t)
- the GMMs for each state of each speaker must be determined, that is, twice the cardinality of the state variables.
- a total of 28,900 different fundamental frequency pairings result for each speaker, which results in a significantly increased computation effort.
- an FHMM is used in the described embodiment of the method according to the invention.
- the FHMM allows to track the states of multiple parallel Markov chains, with the available observations as a common effect of all Markov chains become.
- the results described under the point "interaction model" are used.
- the hidden state variables of the individual speakers are denoted by x k (t) , where k denotes the Markov chains (and thus the speakers) and the time index t runs from 1 to T.
- the Markov chains 1, 2 are in Fig. 2 the horizontally running shown.
- the assumption is that all hidden state variables have the cardinality
- the observed random variable is denoted by y (t) .
- the dependence of the hidden variables between two successive time periods is defined by the transition probability p (x k (1)
- the dependence of the observed random variable y (t) on the hidden variables of the same time segment is defined by the observation probability p (y (t)
- the output probability of the hidden variables in each chain is given as p (x k (1) ).
- x 1 t . x 2 t is generally obtained by marginalizing the unknown (log) spectra of the individual speakers: p y t
- x 1 t . x 2 t ⁇ ⁇ p y t
- y d gives the d-th element of the log spectrum y
- ⁇ i . x i m . d gives the dth element of the associated mean and variance
- ⁇ ⁇ - ⁇ y ⁇ NV x
- ⁇ d x represents the univariate cumulative normal distribution.
- Fig. 3 shows a schematic representation of the sequence of the method according to the invention with reference to a block diagram.
- a speech signal, or a composite signal of a plurality of individual signals, is recorded with one channel, for example with a microphone. This process step is designated by 100 in the block diagram.
- the speech signals of the individual speakers are modeled using training data in a training phase 101.
- EM Engineering Maximization
- a speaker-dependent GMM is trained for each of the 170 pitch states.
- the training phase is done for all possible states - in the described embodiment, for each of the two speakers, 170 states are between 80 and 500 Hz.
- a pitch-dependent spectrogram is trained by each speaker by means of GMM, the MDL Criterion being applied to the find optimal number of Gauss components.
- the GMMs or the associated parameters are stored, for example in a database.
- an interaction model preferably the MixMax interaction model
- the FHMM is applied. Using FHMM it is possible to access the states of several hidden Markov processes which run concurrently, considering the available observations as effects of the individual Markov processes.
Landscapes
- Engineering & Computer Science (AREA)
- Computational Linguistics (AREA)
- Signal Processing (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Physics & Mathematics (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Stereophonic System (AREA)
Description
- Die Erfindung betrifft ein Verfahren zur Ermittlung von Grundfrequenz-Verläufen mehrerer Signalquellen aus einer einkanaligen Audioaufnahme eines Mischsignals.
- Verfahren zur Verfolgung bzw. Trennung von einkanaligen Sprachsignalen über die wahrgenommene Grundfrequenz (der englische Fachbegriff "Pitch" wird im Rahmen der folgenden Ausführungen gleichbedeutend mit der wahrgenommenen Grundfrequenz verwendet) werden in einer Reihe von Algorithmen und Applikationen in der Sprach- und Audio-signalverarbeitung verwendet, wie z.B. bei der einkanaligen Quellentrennung (Single-Channel Blind Source Separation; SCSS) (D. Morgan et al., "Cochannel speaker separation by harmonic enhancement and suppression", IEEE Transactions on Speech and Audio Processing, Vol. 5, pp. 407-424, 1997), der Computational Auditory Scene Analysis (CASA) (DeLiang Wang, "On Ideal Binary Mask As the Computational Goal of Auditory Scene Analysis", P. Divenyi [Ed], Speech Separation by Humans and Machines, Kluwer Academic, 2004)und der Sprachkompression (R. Salami et al., "A toll quality 8 kb/s speech codec for the personal communications system (PCS)", IEEE Transactions on Vehicular Technology, Vol. 43, pp. 808-816,1994). Typische Anwendungen solcher Verfahren sind beispielsweise Konferenzsituationen, wo während eines Vortrags manchmal mehrere Stimmen hörbar sind und dadurch die Erkennungsrate einer automatischen Spracherkennung stark sinkt. Auch eine Anwendung in Hörgeräten ist möglich. Der Artikel "Finite Mixture Spectrogram Modeling for Multipitch Tracking Using A Factorial Hidden Markov Model", Michael Wohlmayr et al, ISCA Interspeech 2009, 6.-10. September 2009, Seiten 1079-1082, Brighton, offenbart ein Verfahren zur Ermittlung von Grundfrequenz-Verläufen mehrerer Signalquellen aus einer einkanaligen Audioaufnahme eines Mischsignals, bei dem in der Trainingsphase Mischspektren mit den jeweiligen Einzelsprecheranteilen trainiert werden. Zum Training werden gemischte Signale verwendet.
- Die Grundfrequenz ist eine fundamentale Größe in der Analyse, Erkennung, Codierung, Kompression und Darstellung von Sprache. Sprachsignale lassen sich durch die Überlagerung von sinusförmigen Schwingungen beschreiben. Für stimmhafte Laute wie z.B. Vokale ist dabei die Frequenz dieser Schwingungen entweder die Grundfrequenz oder ein Vielfaches der Grundfrequenz, die sog. Oberschwingungen bzw. Obertöne. Damit lassen sich Sprachsignale durch Identifizierung der Grundfrequenz des Signals bestimmten Signalquellen zuordnen.
- Während für den Fall eines einzelnen Sprechers bei rauscharmer Aufnahme bereits eine Reihe von erprobten Methoden für die Abschätzung bzw. die Verfolgung (Tracking) der Grundfrequenz in Verwendung ist, gibt es nach wie vor Probleme bei der Bearbeitung von minderwertigen (also mit Störgeräuschen wie Rauschen versehenen) Aufnahmen mehrerer gleichzeitig sprechender Personen.
- Mingyang Wu et al. schlagen in "A Multipitch Tracking Algorithm for Noisy Speech" (IEEE Transactions on Speech and Audio Processing, Volume 11, Issue 3, pp. 229-241, May 2003) eine Lösung für robustes mehrfaches Grundfrequenztracking bei Aufnahmen mit mehreren Sprechern vor. Die Lösung basiert auf dem unitären Modell für Grundfrequenzwahrnehmung, für das verschiedene Verbesserungen vorgeschlagen werden, um eine wahrscheinlichkeitstheoretische Darstellung der Periodizitäten des Signals zu erhalten. Die Nachverfolgung der Wahrscheinlichkeiten der Periodizitäten unter Verwendung des Hidden Markov Model (HMM) ermöglicht die Darstellung semikontinuierlicher Grundfrequenzverläufe. Nachteilig an dieser Lösung ist zum einen der hohe Rechenaufwand und die dadurch benötigten Rechnerressourcen, andererseits die Tatsache, dass eine ordnungsgemäße Zuordnung der Grundfrequenzen zu den passenden Signalquellen, bzw. Sprechern nicht möglich ist. Der Grund dafür ist die Tatsache, dass in diesem System keine sprecherspezifischen Informationen eingebunden werden bzw. zur Verfügung stehen, die eine derartige Verknüpfung von gemessenen Pitchwerten und Sprechern ermöglichen würde.
- Es ist daher eine Aufgabe der Erfindung, ein Verfahren für mehrfaches Grundfrequenztracking bereitzustellen, das eine sichere Zuordnung der ermittelten Grundfrequenzen zu Signalquellen bzw. Sprechern erlaubt und gleichzeitig eine geringe Speicher- und Rechenintensivität aufweist.
- Diese Aufgabe wird mit einem Verfahren der eingangs genannten Art erfindungsgemäß durch die folgenden Schritte gelöst:
- a) Ermitteln der Spektrogramm-Eigenschaften der Pitchzustände einzelner Signalquellen unter Benutzung von Trainingsdaten;
- b) Ermitteln der Wahrscheinlichkeiten der möglichen Grundfrequenzkombinationen der in dem Mischsignal enthaltenen Signalquellen durch Kombination der in a) ermittelten Eigenschaften mittels eines Interaktionsmodells;
- c) Tracken der Grundfrequenzverläufe der einzelnen Signalquellen im Mischsignal unter Verwendung der in b) ermittelten Wahrscheinlichkeiten.
- Dank der Erfindung lässt sich eine hohe Genauigkeit des Trackens der mehrfachen Grundfrequenzen erreichen, bzw. können Grundfrequenzverläufe besser den jeweiligen Signalquellen bzw. Sprechern zugeordnet werden. Durch eine Trainingsphase a) unter Verwendung sprecherspezifischer Informationen und die Wahl eines geeigneten Interaktionsmodells in b) wird der rechnerische Aufwand deutlich minimiert, sodass die Methode rasch und ressourcenarm durchgeführt werden kann. Dabei werden nicht Mischspektren mit den jeweiligen Einzelsprecheranteilen (im einfachsten Fall zwei Sprecher und ein entsprechendes Grundfrequenz-Paar) trainiert, sondern die jeweiligen Einzelsprecheranteile, was den Rechenaufwand und die Zahl der durchzuführenden Trainingsphasen weiter minimiert. Da je Signalquelle Pitchzustände aus einem abgegrenzten Frequenzbereich (z.B. 80 bis 500 Hz) betrachtet werden, ergibt sich bei Kombination der Zustände in Schritt b) eine begrenzte Anzahl von Grundfrequenzkombinationen, die als "mögliche" Grundfrequenzkombinationen bezeichnet werden. Der Begriff Spektrum steht in weiterer Folge für das Magnituden-Spektrum; je nach Wahl des Interaktionsmodells in b) werden das Kurzzeit-Magnitudenspektrum oder das logarithmische Kurzzeit-Magnitudenspektrum (log-Spektrum) verwendet.
- Die Anzahl der zu trainierenden Pitchzustände ergibt sich aus dem beobachteten Frequenzbereich und dessen Unterteilung (siehe weiter unten). Bei Sprachaufnahmen beträgt ein solcher Frequenzbereich beispielsweise 80 bis 500 Hz.
- Aus Sprachmodellen einzelner Sprecher kann mit Hilfe des in b) angewandten Interaktionsmodells ein Wahrscheinlichkeitsmodell aller im oben genannten Frequenzbereich möglichen Pitchkombinationen, bzw. für ein gewünschtes Sprecherpaar (also z.B. für eine Aufnahme, auf der zwei Sprecher zu hören sind), erhalten werden. Bei der Annahme von zwei Sprechern mit jeweils A Zuständen bedeutet das also, dass eine A x A-Matrix mit den Wahrscheinlichkeiten für alle möglichen Kombinationen ermittelt wird. Für die einzelnen Sprecher können auch Sprachmodelle verwendet werden, die eine Vielzahl von Sprechern beschreiben, beispielsweise, indem das Modell auf geschlechtsspezifische Merkmale abstellt (speaker-independent, bzw. gender-dependent).
- Für das Tracking in c) kann eine Reihe von Algorithmen verwendet werden. Beispielsweise kann die zeitliche Abfolge der geschätzen Pitchwerte durch ein Hidden Markov Model (HMM) oder auch durch ein Factorial Hidden Markov Model (FHMM) modelliert werden, und auf diese graphischen Modelle können der Max-Sum Algorithmus, der Junction-Tree Algorithmus oder der Sum-Product-Algorithmus zum Einsatz kommen. In einer Variante der Erfindung ist es auch möglich, die auf isolierten Zeitfenstern geschätzten Pitchwerte unabhängig voneinander zu betrachten und auszuwerten, ohne einen der oben genannten Tracking-Algorithmen anzusetzen.
- Für die Beschreibung der Spektrogramm-Eigenschaften kann ein allgemeines, parametrisches oder auch nichtparametrisches statistisches Modell verwendet werden. Günstigerweise werden in a) die Spektrogramm-Eigenschaften mittels eines Gaussian Mixture Modells (GMM) ermittelt.
- Vorteilhafterweise wird die Anzahl der Komponenten eines GMM durch Anwendung des Minimum-Description-Length (MDL) Criterion ermittelt. Das MDL-Criterion dient zur Wahl eines Modells aus einer Vielzahl möglicher Modelle. Beispielsweise unterscheiden sich die Modelle, wie im vorliegenden Fall, nur durch die Anzahl der verwendeten Gausskomponenten. Neben dem MDL-Criterion ist beispielsweise auch die Verwendung des Akaike Information Criterion (AIC) möglich.
- In b) werden als Interaktionsmodell ein lineares Modell oder das Mixture-Maximization (MixMax)-Interaktionsmodell oder das ALGONQUIN-Interaktionsmodell verwendet.
- Günstigerweise erfolgt das Tracken in c) mittels des Factorial Hidden Markov Modells (FHMM).
- Zur Durchführung des Trackings auf einem FHMM können eine Reihe von Algorithmen verwendet werden, beispielsweise werden in Varianten der Erfindung der Sum-Product Algorithmus oder der Max-Sum-Algorithmus verwendet.
- Im Folgenden wird die Erfindung anhand eines nicht einschränkenden Ausführungsbeispiels, das in der Zeichnung dargestellt ist, näher erläutert. In dieser zeigt schematisch:
- Fig. 1
- einen Faktorgraphen der grundfrequenzabhängigen Erzeugung eines aus zwei Einzelsprecher(log)spektren resultierenden (log-)Spektrums y eines Mischsignals,
- Fig. 2
- eine Darstellung des FHMM, und
- Fig. 3
- ein Blockdiagramm des erfindungsgemäßen Verfahrens.
- Die Erfindung betrifft ein einfaches und effizientes Modellierungsverfahren für das Grundfrequenztracking von mehreren gleichzeitig emittierenden Signalquellen, beispielsweise Sprechern in einer Konferenz- oder Besprechungssituation. Nachfolgend wird die erfindungsgemäße Methode aus Gründen der Nachvollziehbarkeit anhand von zwei Sprechern dargestellt, allerdings lässt sich das Verfahren auf eine beliebige Anzahl von Subjekten anwenden. Dabei sind die Sprachsignale einkanalig, werden also mit nur einem Aufnahmemittel - z.B. Mikrophon - aufgenommen.
- Das Kurzzeitspektrum eines Sprachsignals bei gegebener Sprachgrundfrequenz lässt sich mit Hilfe von Wahrscheinlichkeitsverteilungen wie der Gauß'schen Normalverteilung beschreiben. Eine einzelne Normalverteilung, gegeben durch die Parameter Mittelwert µ und Varianz σ2, reicht dabei zumeist nicht aus. Zur Modellierung allgemeiner, komplexer Wahrscheinlichkeitsverteilungen verwendet man üblicherweise Mischverteilungen wie beispielsweise das Gaussian Mixture Model (bzw. Gauß'sches Mischverteilungsmodell - GMM). Das GMM setzt sich additiv aus mehreren einzelnen Gauß'schen Normalverteilungen zusammen. Dabei kann eine M-fache Gaußverteilung mit 3M-1 Parametern beschrieben werden - Mittelwert, Varianz und Gewichtungsfaktor für jede der M Gaußverteilungen (der Gewichtungsfaktor der M-ten Gausskomponente ist redundant, daher das "-1"). Für die Modellierung beobachteter Datenpunkte durch ein GMM wird häufig ein Spezialfall des "Expectation Maximization"-Algorithmus verwendet, wie weiter unten beschreiben ist.
- Der Verlauf der Pitchzustände eines Sprechers kann näherungsweise durch eine Markovkette beschrieben werden. Die Markov-Eigenschaft dieser Zustandsketten besagt, dass der Folgezustand nur vom gegenwärtigen Zustand abhängt und nicht von vorangegangenen Zuständen.
- Bei der Analyse eines Sprachsignals zweier gleichzeitig sprechender Subjekte ist nur das resultierende Spektrum y(t) der Mischung der beiden einzelnen Sprachsignale verfügbar, nicht aber die Pitchzustände x1 (t) und x2 (t) der Einzelsprecher. Der tiefgestellte Index bei den Pitchzuständen bezeichnet dabei Sprecher 1 und 2, während der hochgestellte Zeitindex von t=1, ...., T verläuft. Diese einzelnen Pitchzustände sind verborgene Variablen. Zur Auswertung wird beispielsweise ein Hidden Markov Modell (HMM) verwendet, bei dem aus den beobachtbaren Zuständen (hier also aus dem resultierenden Spektrum y(t) der Mischung) auf die verborgenen Variablen bzw. Zustände geschlossen wird.
- Jede verborgene Variable hat im beschriebenen Ausführungsbeispiel |X| =170 Zustände mit Grundfrequenzen aus dem Intervall von 80 bis 500 Hz. Natürlich können auch mehr oder weniger Zustände aus anderen Grundfrequenzintervallen verwendet werden.
- Der Zustand "1" bedeutet "kein Pitch" (stimmlos bzw. keine Sprachaktivität), während Zustandswerte "2" bis "170" verschiedene Grundfrequenzen zwischen den oben genannten Werten bezeichnen. Im Speziellen wird der Pitch-Wert fo für die Zustände x>1 nach der Formel
ermittelt. Die Samplingrate beträgt fs=16 kHz. Das Pitch-Intervall wird also uneinheitlich aufgelöst; niedrige Pitch-Werte haben eine feinere Auflösung als hohe Pitch-Werte: Die Zustände 168, 169 und 170 haben Grundfrequenzen von 80,80 Hz (x=168), 80,40 Hz (x=169) und 80,00 Hz (x=170), während die Zustände 2, 3 und 4 die Grundfrequenzen 500,00 Hz (x=2), 484,84 Hz (x=3) und 470,58 Hz (x=4) haben. - Das erfindungsgemäße Verfahren umfasst im beschriebenen Ausführungsbeispiel die folgenden Schritte:
- Trainingsphase: Trainieren eines sprecherabhängigen GMM zur Modellierung des Kurzzeitspektrums für jeden der 170 Zustände (169 Grundfrequenzzustände sowie der Zustand "kein Pitch") jedes Einzelsprechers;
- Interaktions-Modell: Ermitteln einer wahrscheinlichkeitstheoretischen Darstellung für die Mischung der beiden Einzelsprecher unter Anwendung eines Interaktionsmodells, z.B. des MixMax-Interaktionsmodells; abhängig von der Wahl des Interaktionsmodells wird in der Trainingsphase entweder das Kurzzeit-Magnitudenspektrum oder das logarithmische Kurzzeit-Magnitüden-Spektrum modelliert.
- Tracking: Ermitteln der Grundfrequenztrajektorien der beiden Einzelsprecher unter Verwendung eines geeigneten Tracking Algorithmus, z.B. Junction-Tree oder Sum-Product (im vorliegenden Ausführungsbeispiel wird die Anwendung des Factorial Hidden Markov Modells (FHMM) beschrieben).
- In der erfindungsgemäßen Methode wird ein überwachtes Szenario angenommen, in dem die Sprachsignale der Einzelsprecher unter Ausnutzung von Trainingsdaten modelliert werden. Dabei können im Prinzip alle überwachten Trainingsrizethoden eingesetzt werden, also generative und diskriminative. Die Spektrogramm-Eigenschaften lassen sich durch ein allgemeines, parametrisches oder auch nicht-parametrisches statistisches Modell p(si|xi) beschreiben. Die Verwendung von GMMs stellt also einen Spezialfall dar.
- Im vorliegenden Ausführungsbeispiel werden unter Verwendung des EM (Expectation-Maximization)-Algorithmus für jeden Sprecher 170 GMMs trainiert (ein GMM pro Pitch-Zustand). Bei den Trainingsdaten handelt es sich beispielsweise um Tonaufnahmen von Einzelsprechern, also einen Satz von Ni log-Spektren von i Einzelsprechern,
zusammen mit den zugehörigen Pitch-Werten Diese Daten können automatisch mit einem Pitchtracker aus Einzelsprecheräufnahmen erzeugt werden. - Der EM-Algorithmus ist eine iterative Optimierungsmethode zum Abschätzen unbekannter Parameter beim Vorliegen von bekannten Daten wie Trainingsdaten. Dabei wird iterativ durch abwechselnde Klassifikation (Expectation-Schritt) und eine anschließende Anpassung der Modellparameter (Maximization-Schritt) die Wahrscheinlichkeit für das Auftreten eines stochastischen Prozesses bei einem vorgegebenen Modell maximiert.
- Da der stochastische Prozess - im vorliegenden Fall das Spektrum des Sprachsignals - durch die Trainingsdaten gegeben ist, müssen zur Maximierung die Modellparameter angepasst werden. Die Voraussetzung für das Auffinden dieses Maximums ist, dass nach jedem Induktionsschritt und der Berechnung eines neuen Modells der Likelihood des Modells ansteigt. Zur Initialisierung des Lernalgorithmus wird eine Anzahl überlagerter Gaussverteilungen und ein GMM mit beliebigen Parametern (z.B. Mittelwert, Varianz und Gewichtungsfaktoren) gewählt.
- Durch die iterative Maximum-Likelihood (ML)-Schätzung des EM erhält man also ein repräsentatives Modell für das Einzelsprecher-Sprachsignal, im vorliegenden Fall ein sprecherabhängiges GMM
Damit müssen für jeden Sprecher 170 GMMs trainiert werden, also ein GMM für jeden Pitch-Zustand xi entsprechend der oben definierten Anzahl von Zuständen. -
- Mi,x
i ≥ 1 bezeichnet dabei die Anzahl der Mischungskomponenten (also der Normalverteilungen, die zur Darstellung des Spektrums notwendig sind), ist der Gewichtungsfaktor jeder Komponente m =1,..., Mi,xi . "NV" bezeichnet die Normalverteilung. -
- Nach der Trainingsphase liegen also GMMs für alle Grundfrequenzwerte aller Sprecher vor. Im vorliegenden Ausführungsbeispiel bedeutet das: Zwei Sprecher mit je 170 Zuständen aus dem Frequenzintervall 80 bis 500 Hz. Es sei noch einmal darauf hingewiesen, dass es sich hier um ein Ausführungsbeispiel handelt und das Verfahren auch auf mehrere Signalquellen und andere Frequenzintervalle anwendbar ist.
- Zur Analyse werden die aufgenommenen und mit einer Samplingfrequenz von beispielsweise fs=16kHz gesampelten einkanaligen Sprachsignale zeitabschnittsweise betrachtet. In jedem Zeitabschnitt t wird das beobachtete (log-)Spektrum y(t) des Mischsignals, also der Mischung der beiden Einzelsprechersignale, mit der Beobachtungswahrscheinlichkeit p(y(t)|x1 (t),x2 (t)) modelliert. Anhand dieser Beobachtungswahrscheinlichkeit können beispielsweise die zu jedem Zeitpunkt wahrscheinlichsten Pitch-Zustände beider Sprecher ermittelt werden, oder die Beobachtungswahrscheinlichkeit dient direkt als Input für den in Schritt c) verwendeten Tracking-Algorithmus.
- Im Prinzip lassen sich die (log-)Spektren der einzelnen Sprecher, bzw. p(s1|x1) und p(s2|x2), zum Mischsignal y addieren; die Magnituden-Spektren addieren sich näherungsweise, daher gilt für die log-Magnitudenspektren: y≅log(exp(s1)+exp(s2)). Die Wahrscheinlichkeitsverteilung des Mischsignals ist also eine Funktion der beiden Einzelsignale, p(y)=f(p(s1), p(s2)). Die Funktion hängt nun davon ab, welches Interaktionsmodell gewählt wird.
- Dafür sind mehrere Herangehensweisen möglich. Beim linearen Modell werden im Magnitudenspektrogramm die Einzelspektren gemäß der oben angegebenen Form addiert, das Mischsignal ist also näherungsweise die Summe der Magnitudenspektren der Einzelsprecher. Vereinfacht ausgedrückt bildet also die Summe der Wahrscheinlichkeitsverteilungen der beiden Einzelsprecher, NV(s1|µ1, Σ1) und NV(s2|µ2, Σ2), die Wahrscheinlichkeitsverteilung des Mischsignals NV(y|µ1+µ2, Σ1+Σ2), wobei hier nur aus Gründen der besseren Verständlichkeit Normalverteilungen angeführt sind - gemäß der erfindungsgemäßen Methode handelt es sich bei den Wahrscheinlichkeitsverteilungen um GMMs.
- Im dargestellten Ausführungsbeispiel des erfindungsgemäßen Verfahrens wird ein weiteres Interaktionsmodell verwendet: Nach dem MixMax-Interaktionsmodell kann das log-Spektrogramm zweier Sprecher durch das elementweise Maximum der log-Spektra der Einzelsprecher approximiert werden. Damit ist es möglich, rasch ein gutes Wahrscheinlichkeitsmodell des beobachteten Mischsignals zu erhalten. Dadurch werden auch Dauer und Rechenaufwand der Lernphase drastisch reduziert.
- Für jeden Zeitabschnitt t gilt y(t) ≅ max(s1 (t), s2 (t), wobei si (t) das log-Magnitudenspektrum des Sprechers i ist. Das log-Magnitudenspektrum y(t) wird also erzeugt mittels eines stochastischen Modells, wie es in Fig. dargestellt ist.
- Darin produzieren die beiden Sprecher (i=1, 2) je ein log-Magnitudenspektrum si (t) in Abhängigkeit des Grundfrequenzzustandes xi (t). Das beobachtete log-Magnitudenspektrum y(t) des Mischsignals wird approximiert durch die elementweisen Maxima beider Einzelsprecher-log-Magnitudenspektren. Mit anderen Worten: Für jeden Frame des Zeitsignals (Samples des Zeitsignals werden in Frames zusammengefasst, und aus Samples eines Frames wird dann mittels FFT (Fast Fourier Transformation) und unter Ausschluss der Phaseninformation das Kurzzeitmagnitudenspektrum berechnet) wird das logarithmische Magnitudenspektrogramm des Mischsignals angenähert durch das elementweise Maximum beider logarithmischer Einzelsprecher-Spektren. Anstatt die nicht zugänglichen Sprachsignale der Einzelsprecher zu betrachten, werden die Wahrscheinlichkeiten der Spektren betrachtet, die zuvor einzeln gelernt werden konnten.
- Für einen fixen Grundfrequenz-Wert in Bezug auf einen Zustand xi (1) erzeugt Sprecher i ein log-Spektrum, si (t), das eine Realisierung der durch das Einzelsprechermodell p(si (t)|xi (t)) beschriebenen Verteilung darstellt.
-
- Bei Verwendung des MixMax-Interaktionsmodells müssen also die GMMs für jeden Zustand jedes Sprechers ermittelt werden, also zwei Mal die Kardinalität der Zustandsvariablen. Bei herkömmlichen Modellen resultieren bei den angenommenen 170 verschiedenen Grundfrequenzzuständen für jeden Sprecher insgesamt 28900 verschiedene Grundfrequenzpaarungen, was einen deutlich erhöhten Rechenaufwand bewirkt.
- Neben dem linearen Modell und dem MixMax-Interäktionsmodell können auch noch andere Modelle verwendet werden. Ein Beispiel dafür ist das Algonquin-Modell, wie es beispielsweise Brendan J. Frey et al. in "ALGONQUIN - Learning dynamic noise models from noisy speech for robust speech recognition" (Advances in Neural Information Processing Systems 14, MIT Press, Cambridge, pp. 1165-1172, January 2002) beschreiben.
- Wie auch beim MixMax-Interaktionsmodell wird mit dem Algonquin-Modell das log-Magnitudenspektrum der Mischung zweier Sprecher modelliert. Während beim MixMax-Interaktionsmodell y=max(s1,s2) gilt, hat das Algonquin-Modell folgende Form: y=s1+log(1+exp(s2-s1). Daraus kann wiederum die Wahrscheinlichkeitsverteilung des Mischsignals aus der Wahrscheinlichkeitsverteilung der Einzelsprechersignale abgeleitet werden.
- Wie schon erwähnt wird im dargestellten Ausführungsbeispiel des erfindungsgemäßen Verfahrens nur das MixMax-Interaktionsmodell behandelt.
- Die Aufgabe des Tracking beinhaltet im Prinzip das Suchen einer Sequenz von verborgenen Zuständen x*, die die bedingte Wahrscheinlichkeitsverteilung x*=arg maxxp(x|y) maximiert. Für das Tracking der Pitchverläufe über die Zeit wird im beschriebenen Ausführungsbeispiel des erfindungsgemäßen Verfahrens ein FHMM verwendet. Das FHMM erlaubt die Zustände mehrerer zeitlich parallel verlaufender Markovketten zu verfolgen, wobei die verfügbaren Beobachtungen als gemeinsamer Effekt aller einzelnen Markovketten betrachtet werden. Dabei werden die unter dem Punkt "Interaktionsmodell" beschriebenen Ergebnisse verwendet.
- Bei einem FHMM werden also mehrere Markov-Ketten parallel betrachtet, wie es beispielsweise in dem beschriebenen Ausführungsbeispiel der Fall ist, wo zwei Sprecher gleichzeitig sprechen. Die Situation, die sich damit ergibt, ist in
Fig. 2 dargestellt. - Wie oben erwähnt, werden die verborgenen Zustandsvariablen der Einzelsprecher mit xk (t) bezeichnet, wobei k die Markovketten (und damit die Sprecher) bezeichnet und der Zeitindex t von 1 bis T verläuft. Die Markovketten 1, 2 sind in
Fig. 2 die horizontal verlaufend dargestellt. Die Annahme lautet, dass alle verborgenen Zustandsvariablen die Kardinalität |X| haben, im beschriebenen Ausführungsbeispiel also 170 Zustände. Die beobachtete Zufallsvariable wird mit y(t) bezeichnet. - Die Abhängigkeit der verborgenen Variablen zwischen zwei aufeinander folgenden Zeitabschnitten ist definiert mit der Übergangswahrscheinlichkeit p(xk (1)|xk (t-1)). Die Abhängigkeit der beobachteten Zufallsvariablen y(t) von den verborgenen Variablen desselben Zeitabschnitts ist definiert mit der Beobachtungswahrscheinlichkeit p(y(t) |x1(t), x2 (t)), die, wie weiter oben bereits erwähnt, mittels eines Interaktionsmodelles erstellt werden kann. Die Ausgangswahrscheinlichkeit der verborgenen Variablen in jeder Kette ist gegeben als p(xk (1)).
-
- Beim FHMM ergeben sich je Markov-Kette eine |X| x |X| Übergangsmatrix zwischen zwei verborgenen Zuständen - beim HMM wäre eine |X2| x |X2| Übergangsmatrix erlaubt, also ungleich grösser.
-
- Damit ergibt sich für (1) bei Verwendung sprecherspezifischer GMMs, Marginalisierung über si und unter Verwendung des MixMax-Modells die folgende Darstellung:
wobei yd das d-te Element des log-Spektrums y ergibt, gibt das d-te Element des zugehörigen Mittelwerts und der Varianz, und stellt die univariate kumulative Normalverteilung dar. -
-
Fig. 3 zeigt in einer schematischen Darstellung den Ablauf des erfindungsgemäßen Verfahrens anhand eines Blockdiagramms. - Ein Sprachsignal, bzw. ein Signalgemisch aus mehreren Einzelsignalen, wird einkanalig aufgenommen, beispielsweise mit einem Mikrophon. Dieser Verfahrensschritt ist im Blockdiagramm mit 100 bezeichnet.
- In einem unabhängigen Verfahrensschritt, der beispielsweise im Vorfeld der Anwendung des Verfahrens durchgeführt wird, werden in einer Trainingsphase 101 die Sprachsignale der Einzelsprecher unter Ausnutzung von Trainingsdaten modelliert. Unter Verwendung des EM (Expectation-Maximization)-Algorithmus wird für jeden der 170 Pitch-Zustände jeweils ein sprecherabhängiges GMM trainiert. Die Trainingsphase erfolgt für alle möglichen Zustände - im beschriebenen Ausführungsbeispiel sind das für zwei Sprecher je 170 Zustände zwischen 80 und 500 Hz. Mit anderen Worten wird also ein grundfrequenzabhängiges Spektrogramm von jedem Sprecher mittels GMM trainiert, wobei das MDL-Criterion angewendet wird, um die optimale Anzahl von Gauss-Komponenten aufzufinden. In einem weiteren Schritt 102 werden die GMMs, bzw. die zugehörigen Parameter, abgelegt, beispielsweise in einer Datenbank.
- 103: Um eine wahrscheinlichkeitstheoretische Wiedergabe des Mischsignals von zwei oder mehr Sprechenden bzw. der Einzelsignalanteile des Mischsignals zu erhalten, wird ein Interaktiönsmodell, vorzugsweise das MixMax-Interaktionsmodell, angewandt. Anschließend wird im Rahmen des Trackens 104 der Grundfrequenzverläufe das FHMM angewandt. Mittels FHMM ist es möglich, die Zustände mehrerer verborgener Markov-Prozesse zu tracken, die gleichzeitig ablaufen, wobei die verfügbaren Beobachtungen als Auswirkungen der einzelnen Markov-Prozesse betrachtet werden.
Claims (6)
- Verfahren zur Ermittlung von Grundfrequeriz-Verläufen mehrerer Signalquellen aus einer einkanaligen Audioaufnahme eines Mischsignals, umfassend die folgenden Schritte:a) Ermitteln der Spektrogramm-Eigenschaften der Pitchzustände einzelner Signalquellen unter Benutzung von Trainingsdaten;b) Ermitteln der Wahrscheinlichkeiten der möglichen Grundfrequenzkombinationen der in dem Mischsignal enthaltenen Signalquellen durch Kombination der in a) ermittelten Eigenschaften mittels eines Interaktionsniodells;c) Tracken der Grundfrequenzverläufe der einzelnen Signalquellen im Mischsignal unter Verwendung der in b) ermittelten Wahrscheinlichkeiten.
- Verfahren nach Anspruch 1, dadurch gekennzeichnet, dass in a) die Spektrogramm-Eigenschaften mittels einem Gaussian Mixture Modell (GMM) ermittelt werden.
- Verfahren nach Anspruch 2, dadurch gekennzeichnet, dass weiters das Minimum-Decscription-Length Criterion angewandt wird, um die Anzahl der Komponenten des GMM zu ermittelt.
- Verfahren nach einem der Ansprüche 1 bis 3, dadurch gekennzeichnet, dass in b) als Interaktionsmodell ein lineares Modell oder das MixMax-Interaktionsmodell oder das ALGONQUIN-Interaktionsmodell verwendet werden.
- Verfahren nach einem der Ansprüche 1 bis 4, dadurch gekennzeichnet, dass das Tracken in c) mittels des Factorial Hidden Markov Modells (FHMM) erfolgt.
- Verfahren nach Anspruch 5, dadurch gekennzeichnet, dass zur Lösung des FHMM der Sum-Product Algorithmus oder der Max-Sum Algorithmus verwendet werden.
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| AT3152010A AT509512B1 (de) | 2010-03-01 | 2010-03-01 | Verfahren zur ermittlung von grundfrequenz-verläufen mehrerer signalquellen |
| PCT/AT2011/000088 WO2011106809A1 (de) | 2010-03-01 | 2011-02-22 | Verfahren zur ermittlung von grundfrequenz-verläufen mehrerer signalquellen |
Publications (2)
| Publication Number | Publication Date |
|---|---|
| EP2543035A1 EP2543035A1 (de) | 2013-01-09 |
| EP2543035B1 true EP2543035B1 (de) | 2013-12-11 |
Family
ID=44247016
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| EP11708975.5A Not-in-force EP2543035B1 (de) | 2010-03-01 | 2011-02-22 | Verfahren zur ermittlung von grundfrequenz-verläufen mehrerer signalquellen |
Country Status (4)
| Country | Link |
|---|---|
| US (1) | US20130151245A1 (de) |
| EP (1) | EP2543035B1 (de) |
| AT (1) | AT509512B1 (de) |
| WO (1) | WO2011106809A1 (de) |
Families Citing this family (3)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US11270721B2 (en) * | 2018-05-21 | 2022-03-08 | Plantronics, Inc. | Systems and methods of pre-processing of speech signals for improved speech recognition |
| EP4109058B1 (de) * | 2020-02-20 | 2026-04-08 | NISSAN MOTOR Co., Ltd. | Bildverarbeitungsvorrichtung und bildverarbeitungsverfahren |
| CN113851114B (zh) * | 2021-11-26 | 2022-02-15 | 深圳市倍轻松科技股份有限公司 | 语音信号的基频确定方法和装置 |
Family Cites Families (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US6226606B1 (en) * | 1998-11-24 | 2001-05-01 | Microsoft Corporation | Method and apparatus for pitch tracking |
-
2010
- 2010-03-01 AT AT3152010A patent/AT509512B1/de not_active IP Right Cessation
-
2011
- 2011-02-22 US US13/582,057 patent/US20130151245A1/en not_active Abandoned
- 2011-02-22 WO PCT/AT2011/000088 patent/WO2011106809A1/de not_active Ceased
- 2011-02-22 EP EP11708975.5A patent/EP2543035B1/de not_active Not-in-force
Also Published As
| Publication number | Publication date |
|---|---|
| EP2543035A1 (de) | 2013-01-09 |
| US20130151245A1 (en) | 2013-06-13 |
| AT509512B1 (de) | 2012-12-15 |
| WO2011106809A1 (de) | 2011-09-09 |
| AT509512A1 (de) | 2011-09-15 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| DE69414752T2 (de) | Sprecherunabhängiges Erkennungssystem für isolierte Wörter unter Verwendung eines neuronalen Netzes | |
| DE3306730C2 (de) | ||
| DE602004000382T2 (de) | Rauschadaptierung zur Spracherkennung | |
| DE112017001830B4 (de) | Sprachverbesserung und audioereignisdetektion für eine umgebung mit nichtstationären geräuschen | |
| DE69726526T2 (de) | Schema und Modelladaption bei Mustererkennung welche auf Taylorausdehnung basiert | |
| DE69311303T2 (de) | Sprachtrainingshilfe für kinder. | |
| DE69430082T2 (de) | Verfahren und Vorrichtung zur Sprachdetektion | |
| DE69830017T2 (de) | Verfahren und Vorrichtung zur Spracherkennung | |
| DE60023517T2 (de) | Klassifizierung von schallquellen | |
| DE69326044T2 (de) | Verfahren zur Erkennung von Sprachsignalen | |
| DE69010722T2 (de) | Spracherkennungssystem. | |
| DE60000403T2 (de) | Vorrichtung und Verfahren zur Modelladaption, Speichervorrichtung und Mustererkennungsvorrichtung | |
| EP3291234B1 (de) | Verfahren zum beurteilen einer qualität eines stimmeinsatzes eines sprechenden | |
| Varnet et al. | Using auditory classification images for the identification of fine acoustic cues used in speech perception | |
| Mohammadiha et al. | Nonnegative HMM for babble noise derived from speech HMM: Application to speech enhancement | |
| EP1193688A2 (de) | Verfahren zur Ermittlung eines Eigenraums zur Darstellung einer Mehrzahl von Trainingssprechern | |
| DE60312374T2 (de) | Verfahren und system zur trennung von mehreren akustischen signalen erzeugt durch eine mehrzahl akustischer quellen | |
| Aibinu et al. | Artificial neural network based autoregressive modeling technique with application in voice activity detection | |
| Mohammadiha et al. | Prediction based filtering and smoothing to exploit temporal dependencies in NMF | |
| DE602004008666T2 (de) | Verfolgen von Vokaltraktresonanzen unter Verwendung eines nichtlinearen Prädiktors | |
| EP1193689A2 (de) | Verfahren zur Ermittlung eines Eigenraums zur Darstellung einer Mehrzahl von Trainingssprechern | |
| DE112017006049B4 (de) | Verfahren und Vorrichtung zur Klangidentifizierung anhand periodischer Anzeichen | |
| AT509512B1 (de) | Verfahren zur ermittlung von grundfrequenz-verläufen mehrerer signalquellen | |
| EP3940692B1 (de) | Verfahren zum automatischen lippenlesen mittels einer funktionskomponente und zum bereitstellen der funktionskomponente | |
| DE102011084035A1 (de) | Vorrichtung, verfahren und computerprogramm zur bewertung einer wahrgenommenen audioqualität |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| PUAI | Public reference made under article 153(3) epc to a published international application that has entered the european phase |
Free format text: ORIGINAL CODE: 0009012 |
|
| 17P | Request for examination filed |
Effective date: 20120814 |
|
| AK | Designated contracting states |
Kind code of ref document: A1 Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC MK MT NL NO PL PT RO RS SE SI SK SM TR |
|
| REG | Reference to a national code |
Ref country code: DE Ref legal event code: R079 Ref document number: 502011001800 Country of ref document: DE Free format text: PREVIOUS MAIN CLASS: G10L0011040000 Ipc: G10L0025900000 |
|
| DAX | Request for extension of the european patent (deleted) | ||
| GRAP | Despatch of communication of intention to grant a patent |
Free format text: ORIGINAL CODE: EPIDOSNIGR1 |
|
| RIC1 | Information provided on ipc code assigned before grant |
Ipc: G10L 25/90 20130101AFI20130528BHEP |
|
| INTG | Intention to grant announced |
Effective date: 20130627 |
|
| GRAS | Grant fee paid |
Free format text: ORIGINAL CODE: EPIDOSNIGR3 |
|
| GRAA | (expected) grant |
Free format text: ORIGINAL CODE: 0009210 |
|
| AK | Designated contracting states |
Kind code of ref document: B1 Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC MK MT NL NO PL PT RO RS SE SI SK SM TR |
|
| REG | Reference to a national code |
Ref country code: GB Ref legal event code: FG4D Free format text: NOT ENGLISH |
|
| REG | Reference to a national code |
Ref country code: CH Ref legal event code: EP |
|
| REG | Reference to a national code |
Ref country code: AT Ref legal event code: REF Ref document number: 644939 Country of ref document: AT Kind code of ref document: T Effective date: 20140115 |
|
| REG | Reference to a national code |
Ref country code: IE Ref legal event code: FG4D Free format text: LANGUAGE OF EP DOCUMENT: GERMAN |
|
| REG | Reference to a national code |
Ref country code: DE Ref legal event code: R096 Ref document number: 502011001800 Country of ref document: DE Effective date: 20140206 |
|
| REG | Reference to a national code |
Ref country code: NL Ref legal event code: VDEP Effective date: 20131211 |
|
| PG25 | Lapsed in a contracting state [announced via postgrant information from national office to epo] |
Ref country code: FI Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20131211 Ref country code: SE Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20131211 Ref country code: NO Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20140311 Ref country code: LT Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20131211 Ref country code: NL Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20131211 Ref country code: HR Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20131211 |
|
| REG | Reference to a national code |
Ref country code: LT Ref legal event code: MG4D |
|
| PG25 | Lapsed in a contracting state [announced via postgrant information from national office to epo] |
Ref country code: LV Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20131211 Ref country code: RS Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20131211 Ref country code: CY Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20131211 |
|
| PG25 | Lapsed in a contracting state [announced via postgrant information from national office to epo] |
Ref country code: EE Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20131211 Ref country code: IS Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20140411 |
|
| PG25 | Lapsed in a contracting state [announced via postgrant information from national office to epo] |
Ref country code: ES Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20131211 Ref country code: CZ Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20131211 Ref country code: SK Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20131211 Ref country code: RO Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20131211 Ref country code: PL Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20131211 Ref country code: PT Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20140411 |
|
| BERE | Be: lapsed |
Owner name: TECHNISCHE UNIVERSITAT GRAZ Effective date: 20140228 |
|
| REG | Reference to a national code |
Ref country code: DE Ref legal event code: R097 Ref document number: 502011001800 Country of ref document: DE |
|
| PG25 | Lapsed in a contracting state [announced via postgrant information from national office to epo] |
Ref country code: MC Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20131211 Ref country code: LU Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20140222 |
|
| REG | Reference to a national code |
Ref country code: CH Ref legal event code: PL |
|
| PLBE | No opposition filed within time limit |
Free format text: ORIGINAL CODE: 0009261 |
|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: NO OPPOSITION FILED WITHIN TIME LIMIT |
|
| PG25 | Lapsed in a contracting state [announced via postgrant information from national office to epo] |
Ref country code: DK Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20131211 Ref country code: LI Free format text: LAPSE BECAUSE OF NON-PAYMENT OF DUE FEES Effective date: 20140228 Ref country code: CH Free format text: LAPSE BECAUSE OF NON-PAYMENT OF DUE FEES Effective date: 20140228 |
|
| 26N | No opposition filed |
Effective date: 20140912 |
|
| REG | Reference to a national code |
Ref country code: FR Ref legal event code: ST Effective date: 20141031 |
|
| REG | Reference to a national code |
Ref country code: IE Ref legal event code: MM4A |
|
| REG | Reference to a national code |
Ref country code: DE Ref legal event code: R097 Ref document number: 502011001800 Country of ref document: DE Effective date: 20140912 |
|
| PG25 | Lapsed in a contracting state [announced via postgrant information from national office to epo] |
Ref country code: FR Free format text: LAPSE BECAUSE OF NON-PAYMENT OF DUE FEES Effective date: 20140228 Ref country code: IE Free format text: LAPSE BECAUSE OF NON-PAYMENT OF DUE FEES Effective date: 20140222 Ref country code: BE Free format text: LAPSE BECAUSE OF NON-PAYMENT OF DUE FEES Effective date: 20140228 |
|
| PG25 | Lapsed in a contracting state [announced via postgrant information from national office to epo] |
Ref country code: SI Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20131211 |
|
| PGFP | Annual fee paid to national office [announced via postgrant information from national office to epo] |
Ref country code: DE Payment date: 20150219 Year of fee payment: 5 |
|
| GBPC | Gb: european patent ceased through non-payment of renewal fee |
Effective date: 20150222 |
|
| PG25 | Lapsed in a contracting state [announced via postgrant information from national office to epo] |
Ref country code: GB Free format text: LAPSE BECAUSE OF NON-PAYMENT OF DUE FEES Effective date: 20150222 |
|
| PG25 | Lapsed in a contracting state [announced via postgrant information from national office to epo] |
Ref country code: MT Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20131211 |
|
| PG25 | Lapsed in a contracting state [announced via postgrant information from national office to epo] |
Ref country code: SM Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20131211 |
|
| PG25 | Lapsed in a contracting state [announced via postgrant information from national office to epo] |
Ref country code: BG Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20131211 Ref country code: GR Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20140312 Ref country code: IT Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20131211 |
|
| PG25 | Lapsed in a contracting state [announced via postgrant information from national office to epo] |
Ref country code: HU Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT; INVALID AB INITIO Effective date: 20110222 Ref country code: TR Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20131211 |
|
| REG | Reference to a national code |
Ref country code: DE Ref legal event code: R119 Ref document number: 502011001800 Country of ref document: DE |
|
| PG25 | Lapsed in a contracting state [announced via postgrant information from national office to epo] |
Ref country code: DE Free format text: LAPSE BECAUSE OF NON-PAYMENT OF DUE FEES Effective date: 20160901 |
|
| REG | Reference to a national code |
Ref country code: AT Ref legal event code: MM01 Ref document number: 644939 Country of ref document: AT Kind code of ref document: T Effective date: 20160222 |
|
| PG25 | Lapsed in a contracting state [announced via postgrant information from national office to epo] |
Ref country code: AT Free format text: LAPSE BECAUSE OF NON-PAYMENT OF DUE FEES Effective date: 20160222 |
|
| PG25 | Lapsed in a contracting state [announced via postgrant information from national office to epo] |
Ref country code: MK Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20131211 |
|
| PG25 | Lapsed in a contracting state [announced via postgrant information from national office to epo] |
Ref country code: AL Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20131211 |




