EP1590795A1 - Generieren und löschen von aussprachevarianten zur verringerung der wortfehlerrate in der spracherkennung - Google Patents

Generieren und löschen von aussprachevarianten zur verringerung der wortfehlerrate in der spracherkennung

Info

Publication number
EP1590795A1
EP1590795A1 EP04704214A EP04704214A EP1590795A1 EP 1590795 A1 EP1590795 A1 EP 1590795A1 EP 04704214 A EP04704214 A EP 04704214A EP 04704214 A EP04704214 A EP 04704214A EP 1590795 A1 EP1590795 A1 EP 1590795A1
Authority
EP
European Patent Office
Prior art keywords
pronunciation
variants
pronunciation variants
word
recognition
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Withdrawn
Application number
EP04704214A
Other languages
English (en)
French (fr)
Inventor
Tobias Schneider
Andreas Schröer
Michael Wandinger
Günter DI STEINMASSL
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Unify GmbH and Co KG
Original Assignee
Siemens AG
Siemens Corp
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Siemens AG, Siemens Corp filed Critical Siemens AG
Publication of EP1590795A1 publication Critical patent/EP1590795A1/de
Withdrawn legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/06Creation of reference templates; Training of speech recognition systems, e.g. adaptation to the characteristics of the speaker's voice
    • G10L15/063Training
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/06Creation of reference templates; Training of speech recognition systems, e.g. adaptation to the characteristics of the speaker's voice
    • G10L15/063Training
    • G10L2015/0635Training updating or merging of old and new templates; Mean values; Weighting
    • G10L2015/0636Threshold criteria for the updating

Definitions

  • the phoneme sequences corresponding to them must be known for all words belonging to the vocabulary. These phoneme sequences are entered in the vocabulary. During the actual recognition process, a search is then carried out in the so-called Viterbi algorithm for the best path through the given phoneme sequences which correspond to the words. If there is no mere single word recognition, probabilities for transitions between the words can also be modeled and included in the Viterbi algorithm.
  • the phonetic model is inferred from the orthographic spelling by predefined rules or by statistical approaches. Since a written word is pronounced differently in different languages, several pronunciation variants can be generated in the vocabulary for each word. There are also numerous methods in the literature for generating pronunciation variants. The large number of pronunciation variants in turn reduces the word error rate.
  • speech recognition systems are adapted to their respective users.
  • word models Through
  • Transformation such as maximum likelihood linear regression (MLLR), or through model parameter prediction such as For example, Regression Model Prediction (RMP) or Maximum A Posteriori Prediction (MAP), which adapts the acoustic modeling of the feature space on which the word models are based, which is available, for example, as a hidden Markov model (HMM).
  • HMM hidden Markov model
  • the speech recognizer is thus changed from a speaker-independent to a speaker-dependent system.
  • the complexity i.e. the storage space consumption
  • the complexity increases with the number of possible words in the speech recognizer.
  • the object of the invention is to provide speech recognition with a reduced word error rate which is particularly adaptable and has only a very low resource consumption.
  • a method for speech recognition several pronunciation variants for a word to be recognized are stored, for example in the memory of a device which is set up for the method. Alternatively or in addition, these multiple pronunciation variants can also be generated and added to the vocabulary. Each time a word is recognized, it is registered for which word the pronunciation variant of the word is recognized. After several recognition processes, an evaluation of the Pronunciation variants made based on the number of times the pronunciation variants were recognized.
  • the frequency of detection is used here as the simplest and least resource-consuming criterion. - Of course, however, more complicated assessment methods are also conceivable, in which, for example, the degree of correspondence between the utterance to be recognized and the pronunciation variant recognized in each case is also taken into account.
  • the method can work with existing words stored in the vocabulary. However, the method gains a very decisive advantage if the word models can be dynamically expanded as an alternative or in addition. When adding a new word to the vocabulary
  • Vocabulary automatically generates several pronunciation variants of the new word and also added to the vocabulary.
  • pronunciation variants for a word can be generated, for example, by phoneme replacement, phoneme deletion and / or phoneme insertion.
  • pronunciation variants e.g. can also be created by adding noise to the spoken signal (signal in the broader sense, i.e. language, feature, phoneme chain).
  • a further pronunciation variant for the spoken word can be generated upon recognition based on an utterance from this utterance.
  • a particularly good utilization of the available memory can be achieved if a maximum number of pronunciation variants is generated for several words.
  • Another important aspect of the invention relates to the evaluation of the pronunciation variants.
  • the method advantageously saves storage space if the number of stored pronunciation variants is reduced on the basis of the evaluation of the pronunciation variants. This can be achieved, for example, by deleting pronunciation variants that are recognized less frequently.
  • Pronunciation variants whose confidence lies below a threshold value are preferably deleted.
  • the speech recognizer can still be kept speaker-independent if the requirement is also set that the canonical pronunciation variant of the word is never deleted.
  • a device that is set up to carry out the method described above can be implemented, for example, by providing means by which one or more method steps can be carried out in each case.
  • Advantageous configurations of the device result analogously to the advantageous configurations of the method.
  • a program product for a data processing system which contains code sections with which one of the described methods can be carried out on the data processing system, can be implemented by suitable implementation of the method in a programming language and translation into code executable by the data processing system.
  • the code sections are saved for this purpose. It is under a program product understood the program as a tradable product. It can be in any form, for example on paper, a computer-readable data medium or distributed over a network.
  • the proposed method is based on a dynamic expansion of the word models in combination with an assessment of the pronunciation variants.
  • Pronunciation variants optimally used by generating a maximum number of variants.
  • Pronunciation variants carried out.
  • these confidence levels are in each case summed up to already achieved confidence levels from previous recognition runs of the pronunciation variants; a simple “boolean” confidence is the value 1 here, if the pronunciation variant which was referenced for this recognition, the value 0 for all Other variants
  • An error detection can be determined, among other things, from the reaction of the user: for example, the detection is repeated or a command initiated by voice is aborted.
  • a further pronunciation variant for the spoken word can be generated upon recognition based on the utterance. Here it must again be ensured that there is no error detection. This step can also be done unnoticed by the user.
  • the accumulated confidence generated for each pronunciation variant is now used to reduce the vocabulary again at a given point in time. This is done by deleting those vocabulary entries whose accumulated confidence is below a certain threshold. These entries are generally pronunciation variants that have never or only rarely been referenced and are therefore not relevant for a recognition run.
  • the adaptation does not take place at the level of acoustic modeling (for example HMM). Instead, the adaptation is achieved by selecting one or more language variants. This selection is dependent on the referencing in the successful ones
  • Typein is the original, canonical
  • Deleting the pronunciation variants increases the reliability of recognition or rejection, since the relevant entries, that is to say the adapted models, are generally easier to distinguish discriminatively. At the same time, recognition is accelerated as the vocabulary becomes smaller.
  • word entries in the vocabulary are defined by their phoneme sequence or by a status sequence.
  • pronunciation variants can be generated by adding noise to the speech data.
  • Another way of creating variants is to modify the phoneme or state sequence obtained. This can be done with the help of random factors or with user-specific information, for example. »A mix-up matrix from the - last recognition runs.
  • a confusion matrix can be created, for example, by a second recognition run with phonemes.
  • Typein is used to infer the phoneme sequence from the orthographic spelling.
  • graphemes When assigning graphemes to phonemes, statistical methods are known which, in addition to the most likely phoneme sequence, are also alternative
  • Mr. Meier was called ten times by voice command.
  • the five variants were referenced as follows, which corresponds to the boolean confidence already mentioned:
  • Variant 1.2 6 6
  • Variant 1.3 0 0
  • the vocabulary is thus reduced by more than half.
  • Speech recognition (search) is reduced to the same extent.
  • Variant 2.1 / for a m a r t i n / Variant 2.2: / for a m a t n /
  • Variant-2.1 / for aU a r t i n
  • Variant-2.2 / for aU m A t n /
  • Mr. Meier is called three times, Ms. Martin is called five times by voice command.
  • the five variants are assessed with confidence as follows.
  • a criterion is now used here, i.e. a confidence measure that allows a statement about the reliability of the spoken utterance for each variant:
  • Variant-1.2 / h E r m al er / Original 2: / for a u m a r t e ⁇ /

Landscapes

  • Engineering & Computer Science (AREA)
  • Artificial Intelligence (AREA)
  • Computational Linguistics (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Physics & Mathematics (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Machine Translation (AREA)

Abstract

Ein Verfahren zur Spracherkennung basiert auf einer dynamischen Erweiterung der Wortmodelle in Kombination mit einer Bewertung der Aussprachevarianten.

Description

Beschreibung
Generieren und Löschen von Aussprachevarianten zur Verringerung der Wortfehlerrate in der Spracherkennung
In der phonembasierten Spracherkennung müssen für alle dem Vokabular zugehörigen Wörter die ihnen entsprechenden Phonemfolgen bekannt sein. Diese Phonemfolgen werden im Vokabular eingetragen. Während des eigentlichen Erkennungsvorgangs erfolgt dann im so genannten Viterbi- Algorithrαus eine Suche nach dem besten Pfad durch die gegebenen Phonemfolgen, die den Wörtern entsprechen. Findet keine bloße Einzelworterkennung statt, können auch Wahrscheinlichkeiten für Übergänge zwischen den Wörtern modelliert und in den Viterbi-Algorithmus einbezogen werden.
Problematisch erweist sich oft die Erkennung von gesprochenen Äußerungen, die von der kanonischen phonetischen Umschreibung eines Wortes, die üblicherweise im Vokabular verwendet wird, (Transkription) abweichen bzw. sich diskriminativ von den
Äußerungen unterscheiden, die während des Trainings eines Wortmodells zugrunde lagen.
Derartige Äußerungen können durch die vorhandenen Modelle nicht mehr richtig klassifiziert werden und es kommt zu einer Fehlerkennung. Die Ursachen dieser Unterschiede liegen unter anderem im speziellen Akzent des Sprechers wie auch in der jeweiligen Ausprägung der Äußerung, die beispielsweise schnell, undeutlich oder sehr langsam gesprochen sein kann. Stationäre und impulsive Störgeräusche können ebenfalls zu einer Fehlklassifikation führen.
Des Weiteren unterliegen technische Systeme, besonders Systeme auf so genannten embedded Plattformen, also beispielsweise in Mobiltelefonen, einer
Ressourcenbeschränkung, welche sich auf die Größe bzw. Mächtigkeit der Modellierung auswirkt. Viele AnwendungsSzenarien in der Spracherkennung beruhen auf einer Erweiterung der Wortmodelle im Spracherkenner bzw. der Adaption von bereits im Spracherkenner vorhandenen Wortmodellen.
Beim so genannten Sayln wird durch Einsprechen einer Äußerung (Enrollment) ein neues Wortmodell generiert. Durch ein zweimaliges Enrollment stehen dem Spracherkenner zwei unterschiedliche Aussprachevarianten für die Klassifikation eines Wortes zur Verfügung. Dadurch wird die Wortfehlerrate verringert, da die diskriminativen Unterschiede besser erfasst werden.
Beim so genannten Typein wird durch vordefinierte Regeln bzw. durch statistische Ansätze von der orthografischen Schreibweise auf das phonetische Modell geschlossen. Da ein geschriebenes Wort in unterschiedlichen Sprachen auch unterschiedlich ausgesprochen wird, können für jeweils ein Wort mehrere Aussprachevarianten im Vokabular generiert werden. In der Literatur existieren daneben zahlreiche Verfahren, Aussprachevarianten zu erzeugen. Durch die Vielzahl an Aussprachevarianten wird wiederum die Wortfehlerrate verringert.
Diesen Verfahren ist jedoch gemeinsam, dass zum Zeitpunkt der Modellierung nicht bekannt ist, welche der jeweiligen Aussprachevarianten für einen individuellen Anwender bei der Erkennung relevant sind. Dies ist insbesondere beim Typein der Fall, da der jeweilige Akzent des Sprechers nicht berücksichtigt wird.
Zur Verringerung der Wortfehlerrate werden SpracherkennungsSysteme auf ihren jeweiligen Benutzer angepasst. Bei der Adaption von Wortmodellen wird durch
Transformation, wie zum Beispiel Maximum Likelihood Linear Regression (MLLR) , oder durch Modellparameter-Vorhersage wie zum Beispiel Regression Model Prediction (RMP) oder Maximum A Posteriori Prediction (MAP) , die den Wortmodellen zugrunde liegende akustische Modellierung des Merkmalsraums adaptiert, die beispielsweise als Hidden-Markov-Modell (HMM) vorliegt. Dadurch wird ein Systemzustand erreicht, der auf den jeweiligen Anwender stark angepasst ist. Andere Benutzer hingegen werden in einem solchen System nicht mehr ausreichend gut erkannt.
Der Spracherkenner wird hier also von einem sprecherunabhängigen zu einem sprecherabhängigen System verändert .
Normalerweise steigt die Komplexität, das heißt der Speicherplatzverbrauch, mit der Anzahl an möglichen Worten im Spracherkenner. Bei embedded Systemen steht oft nur ein sehr begrenzter Speicherplatz zur Verfügung, der bei einer kleinen Anzahl an Wörtern im Spracherkenner nicht ausgenutzt wird.
Davon ausgehend liegt der Erfindung die Aufgabe zugrunde, eine Spracherkennung mit einer verringerten Wortfehlerrate zur Verfügung zu stellen, die besonders anpassungsfähig ist und nur einen sehr geringen Ressourcenverbrauch hat.
Diese Aufgabe wird durch die in den unabhängigen Ansprüchen angegebenen Erfindungen gelöst . Vorteilhafte Ausgestaltungen ergeben sich aus den Unteransprüchen.
Bei einem Verfahren zur Spracherkennung sind, beispielsweise im Speicher einer Vorrichtung, die für das Verfahren eingerichtet ist, zu einem zu erkennenden Wort mehrere Aussprachevarianten gespeichert. Alternativ oder ergänzend können diese mehreren Aussprachevarianten aber auch erst generiert und dem Vokabular hinzugefügt werden. Bei jedem Erkennungsvorgang wird für dieses Wort registriert, welche der Aussprachevarianten des Worts erkannt wird. Nach mehreren Erkennungsvorgängen wird dann eine Bewertung der Aussprachevarianten anhand der Tatsache vorgenommen, wie oft die Aussprachevarianten jeweils erkannt wurden.
Die Häufigkeit der Erkennung wird hier als einfachstes und am wenigsten Ressourcen verbrauchendes Kriterium herangezogen. - Natürlich sind aber auch kompliziertere Bewertungsverfahren denkbar, bei denen beispielsweise auch das Maß der Übereinstimmung zwischen der zu erkennenden Äußerung und der jeweils erkannten Aussprachevariante berücksichtigt wird.
Das Verfahren kann mit vorhandenen, im Vokabular abgespeicherten Wörtern arbeiten. Einen sehr entscheidenden Vorteil erhält das Verfahren allerdings, wenn sich die Wortmodelle alternativ oder ergänzend dynamisch erweitern lassen. Dazu werden bei Hinzufügen eines neuen Wortes zum
Vokabular automatisch mehrere Aussprachevarianten des neuen Wortes generiert und ebenfalls zum Vokabular hinzugefügt.
Mehrere Aussprachevarianten für ein Wort lassen sich beispielsweise durch Phonem-Ersetzung, Phonem-Auslöschung und/oder Phonem-Einfügung generieren.
Gerade bei länderunabhängigen Spracherkennern kann es auch vorteilhaft sein, wenn die Aussprachevarianten für verschiedene Sprachen generiert werden. '•■
Insbesondere beim Sayln können Aussprachevarianten z.B. auch durch Addition von Rauschen auf das eingesprochene Signal (Signal im weiteren Sinne, also Sprache, Merkmal, Phonemkette) erstellt werden.
Als Erweiterung kann aber alternativ oder zusätzlich auch bei der Erkennung aufgrund einer Äußerung aus dieser Äußerung eine weitere Aussprachevariante für das gesprochene Wort generiert werden. Eine besonders gute Ausnutzung des zur Verfügung stehenden Speichers lässt sich erreichen, wenn für mehrere Worte jeweils eine maximale Anzahl von Aussprachevarianten generiert wird.
Ein weiterer wichtiger Aspekt der Erfindung betrifft die Bewertung der Aussprachevarianten.
Mit dem Verfahren lässt sich vorteilhaft Speicherplatz sparen, wenn aufgrund der Bewertung der Aussprachevarianten die Anzahl der gespeicherten Aussprachevarianten reduziert wird. Dies lässt sich zum Beispiel dadurch erzielen, dass weniger häufig erkannte Aussprachevarianten gelöscht werden.
Vorzugsweise werden dabei solche Aussprachevarianten gelöscht, deren Konfidenz unter einem Schwellwert liegt.
Der Spracherkenner lässt sich hierbei aber auch weiterhin sprecherunabhängig halten, wenn zusätzlich die Vorgabe gemacht wird, dass die kanonische Aussprachevariante des Wortes nie gelöscht wird.
Eine Vorrichtung, die eingerichtet ist, das zuvor beschriebene Verfahren auszuführen, lässt sich beispielsweise durch das jeweilige Vorsehen von Mitteln realisieren, durch die jeweils einer oder mehrere Verfahrensschritte ausführbar sind. Vorteilhafte Ausgestaltungen der Vorrichtung ergeben sich analog zu den vorteilhaften Ausgestaltungen des Verf hrens .
Ein Programmprodukt für eine Datenverarbeitungsanlage, das Codeabschnitte enthält, mit denen eines der geschilderten Verfahren auf der Datenverarbeitungsanlage ausgeführt werden kann, lässt sich durch geeignete Implementierung des Verfahrens in einer Programmiersprache und Übersetzung in von der Datenverarbeitungsanlage ausführbaren Code ausführen. Die Codeabschnitte werden dazu gespeichert. Dabei wird unter einem Programmprodukt das Programm als handelbares Produkt verstanden. Es kann in beliebiger Form vorliegen, so zum Beispiel auf Papier, einem Compute lesbaren Datenträger oder über ein Netz verteilt.
Weitere wesentliche Vorteile und Merkmale der Erfindung ergeben sich aus der Beschreibung eines Ausführungsbeispiels .
Das vorgeschlagene Verfahren basiert auf einer dynamischen Erweiterung der Wortmodelle in Kombination mit einer Bewertung der Aussprachevarianten.
Zum Erkennervokabular werden beim Hinzufügen eines neuen Wortes gleichzeitig mehrere Aussprachevarianten dieses Wortes generiert die ebenfalls zum Vokabular hinzugefügt werden. Diese Varianten unterscheiden sich jeweils phonetisch und können, je nach verwendeter Technologie, auf unterschiedliche Art und Weise erstellt werden.
Dabei wird der zur Verfügung stehende Speichersatz für die
Aussprachevarianten optimal ausgenutzt, indem eine maximale Anzahl an Varianten erzeugt wird.
Bei jeder Erkennung wird neben der eigentlichen Klassifikation der Modelle eine Bewertung aller
Aussprachevarianten durchgeführt. Bei erfolgreicher Erkennung, also keine Fehlerkennung, werden diese Konfidenzen jeweils auf bereits erzielte Konfidenzen aus vorhergegangenen Erkennungsläufen der Aussprachevarianten aufsummiert, eine einfache „boolsche" Konfidenz ist hierbei der Wert 1, wenn die Aussprachevarianten die für diese Erkennung referenziert wurde, der Wert 0 für alle übrigen Varianten. Eine Fehlererkennung kann unter anderem aus der Reaktion des Benutzers bestimmt werden: Zum Beispiel wird die Erkennung wiederholt oder es erfolgt der Abbruch eines per Sprache initiierten Kommandos. Als Erweiterung kann bei der Erkennung aufgrund der Äußerung eine weitere Aussprachevariante für das gesprochene Wort generiert werden. Hierbei ist wieder sicherzustellen, dass keine Fehlererkennung vorliegt. Dieser Schritt kann auch vom Benutzer unbemerkt erfolgen.
Die bei der Erkennung zu jeder Aussprachevariante erzeugten akkumulierten Konfidenzen dienen nun dazu, das Vokabular zu einem gegebenen Zeitpunkt wieder zu verkleinern. Dies geschieht, indem diejenigen Vokabulareinträge gelöscht werden, deren akkumulierte Konfidenz unter einer bestimmten Schwelle liegen. Diese Einträge sind im Allgemeinen Aussprachevarianten, die nie oder nur selten referenziert wurden und sind demnach nicht relevant für einen Erkennungslauf .
Durch die gelöschten Aussprachevarianten steht nun wieder freier Speicherplatz für neue Worte im Vokabular zur Verfügung.
Die Adaption erfolgt im Gegensatz zum Stand der Technik nicht auf Ebene der akustischen Modellierung (zum Beispiel HMM) . Stattdessen wird die Adaption durch Auswahl einer oder mehrerer Sprachvarianten erzielt. Diese Auswahl ist dabei , abhängig von der Referenzierung in den erfolgreichen
Erkennungsläufen. Dabei wird der zur Verfügung stehende , Speicherplatz unabhängig von der Anzahl der zu erkennenden Worte optimal ausgenutzt.
Wird zum Beispiel bei Typein die originale, kanonische
Aussprachevariante weiterhin im Vokabular behalten, ist die Sprecherunabhängigkeit weiterhin gewährleistet. Wird das System durch mehrere Benutzer verwendet, erfolgt die Adaption auf alle Benutzer, da durchschnittlich die häufig referenzierten Aussprachevarianten aller Sprecher erhalten bleiben. Ein Vorteil gegenüber anderen Adaptionsverfahren ist, dass das ursprüngliche Systemverhalteh jederzeit wieder hergestellt werden kann, da das HMM, also die akustische Modellierung des Merkmalsraums, unangetastet bleibt. Zur Adaption sind keine weiteren Informationen erforderlich, wie zum Beispiel die Zuordnung der Zustände zu Merkmalen. Somit kann das Verfahren ohne großem zusätzlichen Code- und Speicheraufwand durchgeführt werden und ist damit auch für den Embeddedbereich geeignet.
Durch das Löschen der Aussprachevarianten wird die Erkennungs- bzw. Rückweisungszuverlässigkeit erhöht, da die relevanten Einträge, das heißt die adaptierten Modelle, im Allgemeinen diskriminativ besser zu unterscheiden sind. Gleichzeitig wird die Erkennung beschleunigt, da das Vokabular kleiner wird.
In einem phonembasierten SpracherkennungsSystem, zum Beispiel einem HMM-Erkenner, werden Worteinträge im Vokabular durch ihre Phonemfolge bzw. durch eine Zustandsfolge definiert.
Aussprachevarianten können im Falle des Sayln durch Addition von Rauschen auf die Sprachdaten erzeugt werden. Eine andere Art, Varianten zu erstellen, ist die gewonnene Phonem- bzw. Zustandsfolge zu modifizieren. Diese kann mit Hilfe von Zufallsfaktoren oder aber mit benutzerspezifischen Informationen, zum .»Beispiel eine Verwechslungsmatrix aus den - letzten Erkennungsläufen, geschehen. Eine Verwechslungsmatrix kann zum Beispiel durch einen zweiten Erkennungslauf mit Phonemen erstellt werden.
Mittels Typein wird von der orthografischen Schreibweise auf die Phonemfolge geschlossen. Bei der Zuordnung von Graphemen zu Phonemen sind statistische Verfahren bekannt, die neben der wahrscheinlichsten Phonemfolge auch alternative
Phonemfolgen liefern. Als Beispiel kann hier die Verwendung von Neuronalen Netzen dienen. Die Zuordnung kann dabei auch unter der Berücksichtigung einer jeweiligen Sprache erfolgen. Beispielsweise wird der Name "Martin" im Deutschen und im Französischen unterschiedlich ausgesprochen und daher ergeben sich zwei unterschiedliche Phonemfolgen. Natürlich können die Zustandsfolgen, wie beim Sayln, auch durch Zufallsfaktoren und benutzerabhängige Informationen generiert werden.
Beispiel 1
"Herr Meier" wird als neuer Eintrag in das Vokabular aufgenommen.
Mittels Typein wird folgende (deutschsprachige) kanonische Phonemfolge ermittelt:
Original-1 / h E r m al β /
Die Varianten könnten wie folgt aussehen. Es wird davon ausgegangen, dass insgesamt fünf Vokabulareinträge dem maximal zulässigen Speicherbedarf entsprechen:
Variante-1.1 / h e r m al 6 /
Variante-1.2 / h E r m al er / Variante-1.3 /. h 6 m al 6 /
Variante-1 . 4 / h e r m l e 6 /
Auswahl bzw. Bestimmung der Konfidenzen der Varianten
Herr Meier wurde zehnmal per Sprachkomraando angerufen. Die fünf Varianten wurden wie folgt referenziert, was der bereits genannten boolschen Konfidenz entspricht:
Aussprachevariante #Referenzierungen ΣKonfidenz Original-1: 4 4
Variante-1.1 : 0 0
Variante-1.2 : 6 6 Variante-1.3: 0 0
Variante- 1.4: • 0 0
Bei dem nun folgenden Adaptionsschritt werden alle Varianten mit der Konfidenz 0 gelöscht. Das Vokabular enthält damit nur noch die Varianten "Original-1" und "Variante-1.2 " .
Original-1: / h E r m al 6 / Variante-1.2 : / h E r m al er /
Das Vokabular wird somit um mehr als die Hälfte verkleinert.
Das heißt, die Belastung des Prozessors mit der
Spracherkennung (Suche) verringert sich im gleichen Maße.
Gleichzeitig verringert sich die Verwechslungsgefahr für andere Kommandos .
Da die kanonische Variante "Original-1" weiterhin vorhanden ist, ist die Sprecherunabhängigkeit für folgende Erkennungsläufe gewahrt.
Beispiel 2
Zu dem Vokabular in Beispiel 1 wird nun der Name "Frau Martin" mittels phonembasiertem Sayln hinzugefügt. Die ermittelte Phonemfolge lautet:
Original 2 : / f r aU m a r t e~ /
Die Varianten zu "Frau Martin" könnten folgendermaßen aussehen:
Variante-2.1 : / f r aU m A r t i n / Variante-2.2 : / f r aU m A t n /
Das Vokabular enthält nun folgende Einträge:
Original-1: / h E r al 6 / Variante-1.2 : / h E r m al er / Original 2: / f r aU m a r t e~ /
Variante-2.1: / f r aU A r t i n / Variante-2.2 : / f r aU m A t n /
Auswahl bzw. Bestimmung der Konfidenzen der Varianten
Herr Meier wird dreimal, Frau Martin wird fünfmal per Sprachkommando angerufen. Die fünf Varianten werden wie folgt mit Konfidenzen bewertet. Hierbei kommt nun ein Kriterium zum Einsatz, das heißt ein Konfidenzmaß, das für jede Variante eine Aussage über die Zuverlässigkeit der gesprochenen Äußerung zulässt:
Aussprachevariante #Referenzierungen ΣKonfidenz
Original-1 : 2 100
Variante-1.2 : 1 30
Original-2 : 3 60
Variante-2.1 : 1 10
Variante-2.2 : 1 20
Bei dem nun folgenden Adaptionsschritt werden alle Varianten gelöscht, die eine Konfidenz kleiner als 25 besitzen. Das Vokabular enthält damit nur noch die Varianten "Original-1" und "Variante-1.2" und "Original-2 " .
Original-1: / h E r al 6 /
Variante-1.2 : / h E r m al er / Original 2: / f r aU m a r t e~ /
Nun stehen wieder 2 freie Einträge für weitere Aussprachevarianten bzw. neue Worte zur Verfügung.

Claims

Patentansprüche
1. Verfahren zur Spracherkennung,
- bei dem zu einem Wort mehrere Aussprachevarianten vorliegen und/oder generiert werden,
- bei dem bei einem Erkennungsvorgang registriert wird, welche der Aussprachevarianten des Wortes erkannt wird,
- bei dem nach mehreren Erkennungsvorgängen eine Analyse der Häufigkeit der Erkennung der einzelnen Aussprachevarianten erfolgt.
2. Verfahren nach Anspruch 1 , bei dem die Aussprachevarianten durch Phonem-Ersetzung, Phonem-Auslöschung und/oder Phonem-Einfügung generiert sind.
3. Verfahren nach Anspruch 1 oder 2 , bei dem die Aussprachevarianten für unterschiedliche Sprachen generiert sind.
4. Verfahren nach einem der vorhergehenden Ansprüche, bei dem die Aussprachevarianten durch Addition von Rauschen generiert werden.
5. Verfahren nach einem der vorhergehenden Ansprüche, bei dem eine der Aussprachevarianten, insbesondere nach einem Erkennungsvorgang, aufgrund einer als das Wort erkannten Äußerung generiert ist.
6. Verfahren nach einem der vorhergehenden Ansprüche, bei dem für mehrere, insbesondere alle Worte jeweils eine maximal zulässige Anzahl von Aussprachevarianten vorgegeben ist .
7. Verfahren nach einem der vorhergehenden Ansprüche, bei dem aufgrund der Analyse der Häufigkeit der Erkennung der einzelnen Aussprachevarianten die Anzahl der gespeicherten Aussprachevarianten reduziert wird.
8. Verfahren nach Anspruch 7 , bei dem weniger häufig erkannte Aussprachevarianten gelöscht werden .
9. Verfahren nach Anspruch 8 , bei dem die Aussprachevarianten gelöscht werden, deren Konfidenz unter einem Schwellwert liegt.
10. Verfahren nach Anspruch 8 oder 9, bei dem die kanonische Aussprachevariante nicht gelöscht wird.
11. Vorrichtung, die eingerichtet ist, ein Verfahren nach einem der vorhergehenden Ansprüche auszuführen.
12. Programmprodukt für eine Datenverarbeitungsanlage, das Codeabschnitte enthält, mit denen ein Verfahren nach einem der Ansprüche 1 bis 10 auf einer Datenverarbeitungsanlage ausführbar ist.
EP04704214A 2003-02-04 2004-01-22 Generieren und löschen von aussprachevarianten zur verringerung der wortfehlerrate in der spracherkennung Withdrawn EP1590795A1 (de)

Applications Claiming Priority (3)

Application Number Priority Date Filing Date Title
DE10304460A DE10304460B3 (de) 2003-02-04 2003-02-04 Generieren und Löschen von Aussprachevarianten zur Verringerung der Wortfehlerrate in der Spracherkennung
DE10304460 2003-02-04
PCT/EP2004/000527 WO2004070702A1 (de) 2003-02-04 2004-01-22 Generieren und löschen von aussprachevarianten zur verringerung der wortfehlerrate in der spracherkennung

Publications (1)

Publication Number Publication Date
EP1590795A1 true EP1590795A1 (de) 2005-11-02

Family

ID=31502580

Family Applications (1)

Application Number Title Priority Date Filing Date
EP04704214A Withdrawn EP1590795A1 (de) 2003-02-04 2004-01-22 Generieren und löschen von aussprachevarianten zur verringerung der wortfehlerrate in der spracherkennung

Country Status (4)

Country Link
US (1) US20060143008A1 (de)
EP (1) EP1590795A1 (de)
DE (1) DE10304460B3 (de)
WO (1) WO2004070702A1 (de)

Families Citing this family (16)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US7280963B1 (en) * 2003-09-12 2007-10-09 Nuance Communications, Inc. Method for learning linguistically valid word pronunciations from acoustic data
US7624013B2 (en) * 2004-09-10 2009-11-24 Scientific Learning Corporation Word competition models in voice recognition
US7533018B2 (en) * 2004-10-19 2009-05-12 Motorola, Inc. Tailored speaker-independent voice recognition system
GB2424742A (en) * 2005-03-31 2006-10-04 Ibm Automatic speech recognition
US7983914B2 (en) * 2005-08-10 2011-07-19 Nuance Communications, Inc. Method and system for improved speech recognition by degrading utterance pronunciations
TW200926142A (en) * 2007-12-12 2009-06-16 Inst Information Industry A construction method of English recognition variation pronunciation models
US9275640B2 (en) * 2009-11-24 2016-03-01 Nexidia Inc. Augmented characterization for speech recognition
CN102687197B (zh) * 2010-01-22 2014-07-23 三菱电机株式会社 声音识别用词典制作装置、声音识别装置及声音合成装置
US9837070B2 (en) * 2013-12-09 2017-12-05 Google Inc. Verification of mappings between phoneme sequences and words
US9747897B2 (en) * 2013-12-17 2017-08-29 Google Inc. Identifying substitute pronunciations
DK179496B1 (en) 2017-05-12 2019-01-15 Apple Inc. USER-SPECIFIC Acoustic Models
US11043213B2 (en) * 2018-12-07 2021-06-22 Soundhound, Inc. System and method for detection and correction of incorrectly pronounced words
CN110277090B (zh) * 2019-07-04 2021-07-06 思必驰科技股份有限公司 用户个人的发音词典模型的自适应修正方法及系统
CN110990702B (zh) * 2019-12-04 2023-04-25 张家口智趣学科技有限公司 一种面向儿童自主阅读的推荐方法、客户端及服务器
CN115881087A (zh) * 2021-09-27 2023-03-31 纳宝株式会社 用于按口音采集发音的提供音频参与服务的方法、装置及计算机程序
CN116340463A (zh) * 2023-03-31 2023-06-27 北京有竹居网络技术有限公司 单词消歧方法、装置和电子设备

Family Cites Families (10)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
DE3931638A1 (de) * 1989-09-22 1991-04-04 Standard Elektrik Lorenz Ag Verfahren zur sprecheradaptiven erkennung von sprache
JPH0772840B2 (ja) * 1992-09-29 1995-08-02 日本アイ・ビー・エム株式会社 音声モデルの構成方法、音声認識方法、音声認識装置及び音声モデルの訓練方法
DE69517705T2 (de) * 1995-11-04 2000-11-23 International Business Machines Corp., Armonk Verfahren und vorrichtung zur anpassung der grösse eines sprachmodells in einem spracherkennungssystem
US6076053A (en) * 1998-05-21 2000-06-13 Lucent Technologies Inc. Methods and apparatus for discriminative training and adaptation of pronunciation networks
US6208964B1 (en) * 1998-08-31 2001-03-27 Nortel Networks Limited Method and apparatus for providing unsupervised adaptation of transcriptions
US6535849B1 (en) * 2000-01-18 2003-03-18 Scansoft, Inc. Method and system for generating semi-literal transcripts for speech recognition systems
US7181395B1 (en) * 2000-10-27 2007-02-20 International Business Machines Corporation Methods and apparatus for automatic generation of multiple pronunciations from acoustic data
EP1233406A1 (de) * 2001-02-14 2002-08-21 Sony International (Europe) GmbH Angepasste Spracherkennung für ausländische Sprecher
DE10119284A1 (de) * 2001-04-20 2002-10-24 Philips Corp Intellectual Pty Verfahren und System zum Training von jeweils genau einer Realisierungsvariante eines Inventarmusters zugeordneten Parametern eines Mustererkennungssystems
US6925154B2 (en) * 2001-05-04 2005-08-02 International Business Machines Corproation Methods and apparatus for conversational name dialing systems

Non-Patent Citations (1)

* Cited by examiner, † Cited by third party
Title
See references of WO2004070702A1 *

Also Published As

Publication number Publication date
WO2004070702A1 (de) 2004-08-19
US20060143008A1 (en) 2006-06-29
DE10304460B3 (de) 2004-03-11

Similar Documents

Publication Publication Date Title
DE60302407T2 (de) Umgebungs- und sprecheradaptierte Spracherkennung
DE112010005959B4 (de) Verfahren und System zur automatischen Erkennung eines Endpunkts einer Tonaufnahme
DE69519297T2 (de) Verfahren und vorrichtung zur spracherkennung mittels optimierter partieller buendelung von wahrscheinlichkeitsmischungen
DE10304460B3 (de) Generieren und Löschen von Aussprachevarianten zur Verringerung der Wortfehlerrate in der Spracherkennung
DE69818231T2 (de) Verfahren zum diskriminativen training von spracherkennungsmodellen
DE10306022B3 (de) Dreistufige Einzelworterkennung
JP3990136B2 (ja) 音声認識方法
EP1084490B1 (de) Anordnung und verfahren zur erkennung eines vorgegebenen wortschatzes in gesprochener sprache durch einen rechner
DE60318385T2 (de) Sprachverarbeitungseinrichtung und -verfahren, aufzeichnungsmedium und programm
DE10119284A1 (de) Verfahren und System zum Training von jeweils genau einer Realisierungsvariante eines Inventarmusters zugeordneten Parametern eines Mustererkennungssystems
DE60018696T2 (de) Robuste sprachverarbeitung von verrauschten sprachmodellen
EP1199704A2 (de) Auswahl der alternativen Wortfolgen für diskriminative Anpassung
DE10040063A1 (de) Verfahren zur Zuordnung von Phonemen
EP1282897A1 (de) Verfahren zum erzeugen einer sprachdatenbank für einen zielwortschatz zum trainieren eines spracherkennungssystems
DE60029456T2 (de) Verfahren zur Online-Anpassung von Aussprachewörterbüchern
EP1435087A1 (de) Verfahren zur erzeugung von sprachbausteine beschreibenden referenzsegmenten und verfahren zur modellierung von spracheinheiten eines gesprochenen testmusters
EP1457966A1 (de) Verfahren zum Ermitteln der Verwechslungsgefahr von Vokabulareinträgen bei der phonembasierten Spracherkennung
DE102005030965B4 (de) Erweiterung des dynamischen Vokabulars eines Spracherkennungssystems um weitere Voiceenrollments
EP1723636A1 (de) Benutzer- und vokabularadaptive bestimmung von konfidenz- und rückweisungsschwellen
EP1445759B1 (de) Benutzeradaptives Verfahren zur Geräuschmodellierung in Spracherkennung
DE10122087C1 (de) Verfahren zum Training und Betrieb eines Spracherkenners, Spracherkenner und Spracherkenner-Trainingssystem
DE102008062923A1 (de) Verfahren und Vorrichtung zur Erzeugung einer Trefferliste bei einer automatischen Spracherkennung
DE10302101A1 (de) Verfahren und Vorrichtung zum Trainieren eines Hidden Markov Modells, Computerprogramm-Element und Computerlesbares Speichermedium
EP2012303B1 (de) Verfahren zur Erkennung eines Sprachsignals
EP1677285B1 (de) Verfahren zur Ermittlung von Aussprachevarianten eines Wortes aus einem vorgebbaren Vokabular eines Spracherkennungssystems

Legal Events

Date Code Title Description
PUAI Public reference made under article 153(3) epc to a published international application that has entered the european phase

Free format text: ORIGINAL CODE: 0009012

17P Request for examination filed

Effective date: 20050620

AK Designated contracting states

Kind code of ref document: A1

Designated state(s): AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HU IE IT LI LU MC NL PT RO SE SI SK TR

AX Request for extension of the european patent

Extension state: AL LT LV MK

DAX Request for extension of the european patent (deleted)
RBV Designated contracting states (corrected)

Designated state(s): DE ES FR GB IT

17Q First examination report despatched

Effective date: 20100615

RAP1 Party data changed (applicant data changed or rights of an application transferred)

Owner name: SIEMENS ENTERPRISE COMMUNICATIONS GMBH & CO. KG

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE APPLICATION IS DEEMED TO BE WITHDRAWN

18D Application deemed to be withdrawn

Effective date: 20101228