EP2141941A2 - Verfahren zur Störgeräuschunterdrückung und zugehöriges Hörgerät - Google Patents
Verfahren zur Störgeräuschunterdrückung und zugehöriges Hörgerät Download PDFInfo
- Publication number
- EP2141941A2 EP2141941A2 EP09159848A EP09159848A EP2141941A2 EP 2141941 A2 EP2141941 A2 EP 2141941A2 EP 09159848 A EP09159848 A EP 09159848A EP 09159848 A EP09159848 A EP 09159848A EP 2141941 A2 EP2141941 A2 EP 2141941A2
- Authority
- EP
- European Patent Office
- Prior art keywords
- noise
- input signal
- signal
- cepstrum
- modified
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Withdrawn
Links
Images
Classifications
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04R—LOUDSPEAKERS, MICROPHONES, GRAMOPHONE PICK-UPS OR LIKE ACOUSTIC ELECTROMECHANICAL TRANSDUCERS; ELECTRIC HEARING AIDS; PUBLIC ADDRESS SYSTEMS
- H04R25/00—Electric hearing aids
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L21/00—Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
- G10L21/02—Speech enhancement, e.g. noise reduction or echo cancellation
- G10L21/0208—Noise filtering
- G10L21/0216—Noise filtering characterised by the method used for estimating noise
- G10L21/0232—Processing in the frequency domain
Definitions
- the invention relates to a specified in claim 1 method for noise reduction and a specified in claim 6 hearing aid with noise reduction.
- Hearing aids are portable hearing aids that are used to care for the hearing impaired.
- different types of hearing aids such as behind-the-ear hearing aids, hearing aids with external earphones and in-the-ear hearing aids, e.g. also provided Concha hearing aids or channel hearing aids.
- the hearing aids listed by way of example are worn on the outer ear or in the ear canal.
- bone conduction hearing aids, implantable or vibrotactile hearing aids are also available on the market. The stimulation of the damaged hearing takes place either mechanically or electrically.
- Hearing aids have in principle as essential components an input transducer, an amplifier and an output transducer.
- the input transducer is usually a sound receiver, z. As a microphone, and / or an electromagnetic receiver, for. B. an induction coil.
- the output transducer is usually used as an electroacoustic transducer, z. As miniature speaker, or as an electromechanical transducer, z. B. bone conduction, realized.
- the amplifier is usually integrated in a signal processing unit. This basic structure is in FIG. 1 shown using the example of a behind-the-ear hearing aid. In a hearing aid housing 1 for carrying behind the ear, one or more microphones 2 for receiving the sound from the environment are installed.
- a signal processing unit 3 which is also integrated in the hearing aid housing 1, processes the microphone signals and amplifies them.
- the output signal of the signal processing unit 3 is transmitted to a loudspeaker or listener 4, the one emits acoustic signal.
- the sound is optionally transmitted via a sound tube, which is fixed with an earmold in the ear canal, to the eardrum of the device carrier.
- the power supply of the hearing device and in particular the signal processing unit 3 is effected by a likewise integrated into the hearing aid housing 1 battery. 5
- the noise power can be estimated in principle by two approaches. Both methods can take place either broadband or preferably in a frequency domain decomposition by means of filter bank or short-time Fourier transformation:
- the complete (time-varying) input signal power is regarded as noise. If speech activity is detected, the noise estimate is kept constant at the value estimated prior to the onset of speech activity.
- the voice signal power in individual frequency ranges is almost always close to zero in the short term. If a mixture of speech and comparatively slowly time-varying noise is now the basis, the minima of the time-considered spectral signal power correspond to the noise power at these times.
- the interference signal power must lie between the detected minimums ("minimum tracking"). Such minimum tracking can be carried out, for example, with the aid of a smoothing filter, which can be used, for example, in R. Martin, "Noise power spectral density estimation based on optimal smoothing and minimum statistics", IEEE Trans. Speech Audio Processing, Vol. 9, No. 5, July 2001, pages 504-512 is described.
- the determination of the noise power is typically done separately for different frequency ranges of the input signal. For this purpose, the input signal is first split into individual frequency components by means of a filter bank or a Fourier transformation. These components are then processed separately.
- the object of the present invention is now to provide a further method and a hearing aid for improved noise suppression, in particular speech is less attacked and disturbing artifacts are effectively avoided.
- the stated object is achieved by the method of independent claim 1 and the hearing aid of independent claim 6.
- the input signal can be obtained from an acoustic signal recorded by a hearing aid.
- the advantage of processing in the cepstral range is that coefficients that are predominantly dominated by speech can be robustly determined. This allows the other coefficients to be assigned to the noise / noise.
- speech can be decomposed into the transfer function of the vocal tract and the excitation function.
- the information about the transfer function of the vocal tract is based on the lower cepstral coefficients.
- the information about the excitation function will essentially be found in a cepstral maximum in the upper cepstral area.
- the knowledge of the cepstral coefficients dominated by speech can be used as a priori knowledge for a robust noise reduction or for the reconstruction of a natural sounding residual noise. In particular, in the case of transient noises, an improved estimation and thus an improved auditory quality is possible.
- the invention also provides a hearing aid with noise suppression according to a method according to the invention. It comprises a signal processing unit with a noise power estimator, a voice power estimator and a first and / or second replacement unit for modifying cepstral coefficients.
- the invention also claims a computer program product with a computer program which has software means for carrying out a method according to the invention when the computer program is executed in a hearing device according to the invention.
- the lower cepstral coefficients contain the information about the envelope of the speech signal, and thus also about the formants important for the intelligibility. Formants are maxima of the spectral envelopes resulting from resonances of the vocal tract. In voiced sounds, maxima are found in the spectrum at multiples of the basic speech frequency. These maxima are essentially mapped to a strong maximum in the cepstrum.
- the lower cepstral coefficients and a maximum in the upper cepstral range contain the information about speech, while the remaining cepstral coefficients are most likely not from speech.
- the output signals of spectral noise reduction algorithms contain partly unnatural artifacts, for example, peaks in the spectral range which lead to the so-called "musical noise". These local spectral maxima change the fine structure of the spectrum, which is reflected in the upper cepstral bins. Since it is known in the cepstral area which coefficients are not likely to originate from the language, this information can be used to avoid spectral outliers in the output signal. For this purpose, the cepstral coefficients of certain parameters of the noise reduction algorithm are modified. For example, the modification can be done by replacing the cepstral coefficients that are most likely non-speech by the corresponding coefficients of the noisy signal.
- FIG. 2 illustrated flowchart of the method according to the invention for noise suppression could be implemented for example in a signal processing unit of a hearing aid.
- an electrical signal S which has been obtained, for example, from an acoustic ambient signal, enters the signal processing unit.
- the input signal S is first subjected to a discrete Fourier transformation DFT, which decomposes the input signal S into its spectral components with the spectral coefficients LS.
- DFT discrete Fourier transformation
- the cepstrings of the estimated noise power and voice power are formed by means of inverse Fourier transformation SCR, SCS of the logarithmic magnitude spectrum.
- SCR inverse Fourier transformation
- SCS inverse Fourier transformation
- the cepstral coefficients RLC, SLC are determined.
- the cepstrum with the cepstral coefficients LSC is likewise determined from the spectrum of the input signal LS.
- cepstres RLC, SLC, LSC are evaluated in the context of a first replacement strategy ES1 and used for a modification of the cepstral coefficients RLC, SLC noise power or the voice performance such that the best possible noise suppression of the input signal S and high naturalness of the output signal SR or aSR can be achieved.
- the first replacement strategy ES1 the modified cepstral coefficients mRLS, mSLS of the noise power and the voice power are determined.
- the weighting factors GF for the weighting of the spectral coefficients LS of the input signal are determined from the modified spectra mRLS, mSLS of the noise power and the voice power taking into account the spectrum LS of the input signal.
- the spectrum LS of the input signal is multiplied by the weighting factors.
- the modified spectral coefficients mLS formed thereby are subsequently converted into an interference-reduced output signal SR by an inverse discrete Fourier transformation.
- FIG. 3 the sequence of a further embodiment of the method according to the invention is shown. Until the generation of modified spectral coefficients mLS from an input signal S, the method is identical to that in FIG. 2 described.
- the cepstrum with the cepstral coefficients ALS is formed from the noise-reduced spectrum mLS by means of inverse Fourier transformation SCA of the logarithmic magnitude spectrum.
- SCA inverse Fourier transformation
- modified cepstral coefficients mALC of the noise-reduced output signal mLS are generated.
- a spectrum formation CSA is used to determine modified spectral coefficients mALS, which are then converted by an inverse discrete Fourier transformation IDFT into an artefact-reduced output signal aSR.
- the illustrated method steps can be implemented according to the invention in a digital signal processor of a hearing aid.
- This allows a high naturalness of an amplified sound signal with simultaneous noise suppression be achieved.
- the cepstral modification translates the fine structures present in the original, noisy signal into the enhanced output signal and / or voice power estimate and / or noise power estimation so that increased naturalness is achieved and / or non-stationary sounds are better mapped , Being able to appreciate rapidly changing sounds makes this process extremely interesting.
- Previously known methods only achieve a reduction of the spectral fluctuations, but at the same time reduce the temporal fine structure.
Landscapes
- Engineering & Computer Science (AREA)
- Health & Medical Sciences (AREA)
- Signal Processing (AREA)
- Acoustics & Sound (AREA)
- Physics & Mathematics (AREA)
- Computational Linguistics (AREA)
- Otolaryngology (AREA)
- Neurosurgery (AREA)
- General Health & Medical Sciences (AREA)
- Quality & Reliability (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Multimedia (AREA)
- Soundproofing, Sound Blocking, And Sound Damping (AREA)
- Noise Elimination (AREA)
- Compression, Expansion, Code Conversion, And Decoders (AREA)
- Circuit For Audible Band Transducer (AREA)
Abstract
Description
- Die Erfindung betrifft ein im Patentanspruch 1 angegebenes Verfahren zur Störgeräuschunterdrückung und ein im Patentanspruch 6 angegebenes Hörgerät mit Störgeräuschunterdrückung.
- Hörgeräte sind tragbare Hörvorrichtungen, die zur Versorgung von Schwerhörenden dienen. Um den zahlreichen individuellen Bedürfnissen entgegenzukommen, werden unterschiedliche Bauformen von Hörgeräten wie Hinter-dem-Ohr Hörgeräte, Hörgerät mit externem Hörer und In-dem-Ohr Hörgeräte, z.B. auch Concha-Hörgeräte oder Kanal-Hörgeräte bereitgestellt. Die beispielhaft aufgeführten Hörgeräte werden am Außenohr oder im Gehörgang getragen. Darüber hinaus stehen auf dem Markt aber auch Knochenleitungshörhilfen, implantierbare oder vibrotaktile Hörhilfen zur Verfügung. Dabei erfolgt die Stimulation des geschädigten Gehörs entweder mechanisch oder elektrisch.
- Hörgeräte besitzen prinzipiell als wesentliche Komponenten einen Eingangswandler, einen Verstärker und einen Ausgangswandler. Der Eingangswandler ist in der Regel ein Schallempfänger, z. B. ein Mikrofon, und/oder ein elektromagnetischer Empfänger, z. B. eine Induktionsspule. Der Ausgangswandler ist meist als elektroakustischer Wandler, z. B. Miniaturlautsprecher, oder als elektromechanischer Wandler, z. B. Knochenleitungshörer, realisiert. Der Verstärker ist üblicherweise in eine Signalverarbeitungseinheit integriert. Dieser prinzipielle Aufbau ist in
Figur 1 am Beispiel eines Hinter-dem-Ohr Hörgeräts dargestellt. In ein Hörgerätegehäuse 1 zum Tragen hinter dem Ohr sind ein oder mehrere Mikrofone 2 zur Aufnahme des Schalls aus der Umgebung eingebaut. Eine Signalverarbeitungseinheit 3, die ebenfalls in das Hörgerätegehäuse 1 integriert ist, verarbeitet die Mikrofonsignale und verstärkt sie. Das Ausgangssignal der Signalverarbeitungseinheit 3 wird an einen Lautsprecher bzw. Hörer 4 übertragen, der ein akustisches Signal ausgibt. Der Schall wird gegebenenfalls über einen Schallschlauch, der mit einer Otoplastik im Gehörgang fixiert ist, zum Trommelfell des Geräteträgers übertragen. Die Energieversorgung des Hörgeräts und insbesondere die der Signalverarbeitungseinheit 3 erfolgt durch eine ebenfalls ins Hörgerätegehäuse 1 integrierte Batterie 5. - Bei der Verarbeitung digitaler Sprachaufnahmen, z. B. mit digitalen Hörgeräten, ist es oft wünschenswert, störende Hintergrundgeräusche zu unterdrücken, ohne dabei das Nutzsignal (Sprache) zu beeinflussen. Hierfür sind Filterverfahren, welche das Kurzzeitspektrum des Signals beeinflussen, wie das Wiener-Filter, bekannt und geeignet. Allerdings setzen diese Verfahren eine genaue Schätzung der frequenzabhängigen Leistung des zu unterdrückenden Störgeräuschs aus einem Eingangssignal voraus. Ist diese Schätzung ungenau, wird entweder eine nicht zufriedenstellende Störgeräuschunterdrückung erreicht, das Wunschsignal wird angegriffen oder es entstehen zusätzliche künstlich erzeugte Störsignale, auch "musical tones" bzw. "musical noise" genannt. Methoden zur Störgeräuschschätzung, welche diese Probleme vollständig und effizient lösen, stehen noch nicht zur Verfügung.
- Bislang kann die Störgeräuschleistung prinzipiell durch zwei Ansätze geschätzt werden. Beide Methoden können entweder breitbandig oder bevorzugt in einer Frequenzbereichszerlegung mittels Filterbank oder Kurzzeit-Fourier-Transformation stattfinden:
- Solange keine Sprachaktivität festgestellt wird, betrachtet man die komplette (zeitveränderliche) Eingangssignalleistung als Störgeräusch. Sofern Sprachaktivität detektiert wird, hält man die Störgeräuschschätzung auf dem vor dem Einsetzen der Sprachaktivität geschätzten Wert konstant.
- Es ist bekannt, dass auch während einer Sprachaktivität die Sprachsignalleistung in einzelnen Frequenzbereichen immer wieder kurzfristig nahezu Null ist. Liegt nun eine Mischung aus Sprache und vergleichsweise langsam zeitveränderlichem Störgeräusch zugrunde, so entsprechen die Minima der zeitlich betrachteten spektralen Signalleistung der Störgeräuschleistung zu diesen Zeitpunkten. Zwischen den festgestellten Minima muss die Störsignalleistung liegen ("Minimum-Tracking"). Ein derartiges Minimum-Tracking kann beispielsweise mit Hilfe eines Glättungsfilters durchgeführt werden, das beispielsweise in R. Martin, "Noise power spectral density estimation based on optimal smoothing and minimum statistics", IEEE Trans. Speech Audio Processing, Vol. 9, Nr. 5, Juli 2001, Seiten 504 - 512 beschrieben ist. Die Ermittlung der Störgeräuschleistung erfolgt typischerweise getrennt für verschiedene Frequenzbereiche des Eingangssignals. Hierzu wird das Eingangssignal zunächst mittels einer Filterbank oder einer Fourier-Transformation in einzelne Frequenzkomponenten aufgespaltet. Diese Komponenten werden dann getrennt voneinander verarbeitet.
- Bei der oben genannten 1. Methode, stellt einerseits die zuverlässige Erkennung von Sprachaktivität ein Problem dar, andererseits ist es nicht möglich, zeitlich veränderliche Störgeräusche während gleichzeitiger Sprachaktivität zu verfolgen.
- Bei der oben beschriebenen 2. Methode sind grundsätzliche Widersprüche in der Einstellung des Algorithmus zu lösen: Wenn Sprache vorliegt, sollte die Störgeräuschschätzung nur langsam angepasst werden, um nicht durch schnelle Adaption Sprachanteile als Störgeräusche zu klassifizieren und hierdurch die Sprachqualität anzugreifen. Liegt keine Sprache vor, so sollte die Störleistungsschätzung ohne Verzögerung der temporalen Feinstruktur des Eingangssignals folgen. Hieraus ergeben sich für die Einstellparameter des Verfahrens, wie z. B. Glättungszeitkonstanten, Fensterlänge für eine Minimumsuche oder Gewichtungsfaktoren widersprüchliche Anforderungen, die bislang nur im Mittel optimal gelöst werden konnten. Außerdem ist diese Methode nicht in der Lage, schnellen Änderungen des Störsignals zu folgen.
- Eine weitere Möglichkeit zur Sprachverbesserung und der Unterdrückung von "Musical Tones" verspricht die "Cepstrale Glättung" der Gewichtung von spektralen Filtern. In C. Breithaupt et al., "Cepstral Smooting of Spectral Filter Gains for Speech Enhancement Without Musical Noise", IEEE Signal Processing Letters, Vol. 14, Nr. 12, Dezember 2007, Seiten 1036 bis 1039 wird beschrieben, dass eine rekursive, temporäre Glättung im Wesentlichen auf höhere cepstrale Koeffizienten angewandt wird, wobei jene Koeffizienten ausgenommen sind, welche die Tonhöheninformation repräsentieren. Dieses Verfahren ist auch bei nicht stationären Geräuschen wirksam.
- Die Aufgabe der vorliegenden Erfindung besteht nun darin, ein weiteres Verfahren und ein Hörgerät für eine verbesserte Störgeräuschunterdrückung anzugeben, wobei insbesondere Sprache weniger angegriffen wird und störende Artefakte effektiver vermieden werden.
- Gemäß der Erfindung wird die gestellte Aufgabe mit dem Verfahren des unabhängigen Patentanspruchs 1 und dem Hörgerät des unabhängigen Patentanspruchs 6 gelöst.
- Erfindungsgemäß umfasst das Verfahren zur Störgeräuschreduktion eines Eingangssignals eine Modifikation der Koeffizienten des Cepstrum des Eingangssignals, des veränderten Eingangssignals und/oder mindestens eines aus dem Eingangssignal gewonnenen Parameters, wobei zeitpunktabhängig ("Segment zu Segment" = Blockverarbeitung) cepstrale Koeffizienten eines Ersetzungssignals oder eines aus dem Ersetzungssignal gewonnenen Parameters übernommen werden (das entspricht einer von Zeitpunkt zu Zeitpunkt variierenden Übernahme), sowie eine Verwendung der modifizierten cepstralen Koeffizienten zur Bildung eines Ausgangssignals aus dem Eingangssignal, wobei das Ausgangssignal gegenüber dem Eingangssignal störgeräuschreduziert ist.
- In einer Weiterbildung kann das Eingangssignal aus einem von einem Hörgerät aufgenommenen akustischen Signal gewonnen werden.
- In einer weiteren Ausführungsform kann das Verfahren folgende Schritte umfassen:
- Bildung eines Rauschleistungsspektrums durch eine Störgeräuschabschätzung des Eingangssignals und/oder
- Bildung eines Sprachleistungsspektrums durch eine Störgeräuschabschätzung des Eingangssignals,
- Ermittlung des Cepstrum des Rauschleistungsspektrums und/oder
- Ermittlung des Cepstrum des Sprachleistungsspektrums,
- Ermittlung modifizierter cepstraler Koeffizienten für die ermittelten Cepstren des Rauschleistungsspektrums und/oder des Sprachleistungsspektrums mit Hilfe einer ersten Ersetzungsstrategie,
- Ermittlung der modifizierten Spektren der Rauschleistung und/oder der Sprachleistung aus den modifizierten Cepstren und
- Bildung des störgeräuschreduzierten Ausgangssignals durch Modifikation der spektralen Koeffizienten des Eingangssignals mittels der modifizierten Spektren der Rauschleistung und/oder der Sprachleistung.
- Des Weiteren kann das Verfahren folgende Schritte umfassen:
- Bildung des Cepstrum des Eingangssignals,
- Ermittlung modifizierter cepstraler Koeffizienten für das ermittelte Cepstrum des Eingangssignals mit Hilfe einer zweiten Ersetzungsstrategie und
- Bildung eines störgeräuschreduzierten Ausgangssignals aus dem modifizierten Cepstrum des Eingangssignals.
- In einer Weiterbildung kann das Verfahren folgende zusätzliche Schritte umfassen:
- Bildung des Cepstrum des störgeräuschreduzierten Ausgangssignals,
- Ermittlung modifizierter cepstraler Koeffizienten für das ermittelte Cepstrum des störgeräuschreduzierten Ausgangssignals mit Hilfe der zweiten Ersetzungsstrategie und
- Bildung eines weiteren Ausgangssignals aus dem modifizierten Cepstrum des störgeräuschreduzierten Ausgangssignals, welches gegenüber dem Ausgangssignal Artefakt-reduziert ist.
- Der Vorteil einer Verarbeitung im Cepstralbereich liegt darin, dass sich Koeffizienten robust bestimmen lassen, die vorwiegend durch Sprache dominiert sind. Dadurch lassen sich die übrigen Koeffizienten dem Rauschen/Störgeräuschen zuordnen. Sprache kann im Cepstralbereich in die Übertragungsfunktion des Vokaltrakts und die Anregungsfunktion zerlegt werden. Die Information über die Übertragungsfunktion des Vokaltrakts bildet sich auf die unteren cepstralen Koeffizienten ab. Bei stimmhaften Lauten wird sich die Information über die Anregungsfunktion im Wesentlichen in einem cepstralen Maximum im oberen Cepstralbereich wiederfinden. Die Kenntnis der cepstralen Koeffizienten die durch Sprache dominiert sind, kann als a priori Wissen für eine robuste Geräuschreduktion oder zur Rekonstruktion eines natürlich klingenden Restgeräuschs verwendet werden. Insbesondere ist für den Fall instationärer Geräusche eine verbesserte Schätzung und somit eine verbesserte auditive Qualität möglich.
- Erfindungsgemäß wird auch ein Hörgerät mit Störgeräuschunterdrückung nach einem erfindungsgemäßen Verfahren angegeben. Es umfasst eine Signalverarbeitungseinheit mit einem Rauschleistungsschätzer, einen Sprachleistungsschätzer und eine erste und/oder zweite Ersetzungseinheit zur Modifikation von cepstralen Koeffizienten.
- Die Erfindung beansprucht auch ein Computerprogrammprodukt mit einem Computerprogramm, das Softwaremittel zur Durchführung eines erfindungsgemäßen Verfahrens aufweist, wenn das Computerprogramm in einem erfindungsgemäßen Hörgerät ausgeführt wird.
- Weitere Besonderheiten und Vorteile der Erfindung werden aus den nachfolgenden Erläuterungen mehrerer Ausführungsbeispiele anhand von schematischen Zeichnungen ersichtlich.
-
- Figur 1:
- einen prinzipiellen Aufbau eines Hörgeräts gemäß Stand der Technik,
- Figur 2:
- ein Ablaufdiagramm einer erfindungsgemäßen cepstralen Modifikation und
- Figur 3:
- ein Ablaufdiagramm einer weiteren erfindungsgemäßen cepstralen Modifikation.
- Im Folgenden wird zuerst ein allgemeiner Überblick des erfindungsgemäßen Verfahrens zur Störgeräuschunterdrückung gegeben, ehe auf spezielle Ausführungsformen anhand der
Figuren 2 und3 eingegangen wird. - Das Cepstrum eines mit Geräuschen überlagerten Eingangssprachsignals s(t) lässt sich wie folgt ermitteln. Gegeben sei ein mit der Abtastrate fs abgetastetes, diskretes Zeitsignal s(t). Dieses Zeitsignal wird in Segmente der Länge M unterteilt. Die Segmente sind mit einem Vorschub von R zueinander versetzt und werden mit einem Analysefenster gewichtet. Die diskrete Fouriertransformierte der Segmente, Sk(l), ist indiziert durch den Frequenzindex k und den Segmentindex l. Das Cepstrum berechnet sich aus der inversen Fourier-Transformation des logarithmierten Betragsspektrums zu
wobei q den cepstralen Koeffizientenindex, den sogenannten Quefrenzindex, und IDFT{ } die inverse diskrete Fourier-Transformation bezeichnet. - Der nullte (q=0) cepstrale Koeffizient gibt Auskunft über den Gleichanteil des logarithmierten Betragsspektrums. Die unteren cepstralen Koeffizienten enthalten die Information über die Einhüllende des Sprachsignals, und somit auch über die für die Verständlichkeit wichtigen Formanten. Als Formanten bezeichnet man Maxima der spektralen Einhüllenden, die aus Resonanzen des Vokaltrakts resultieren. Bei stimmhaften Lauten finden sich im Spektrum Maxima an Vielfachen der Sprachgrundfrequenz. Diese Maxima werden im Cepstrum im Wesentlichen auf ein starkes Maximum abgebildet. Demnach enthalten die unteren cepstralen Koeffizienten und ein Maximum im oberen Cepstralbereich die Informationen über Sprache, während die übrigen cepstralen Koeffizienten mit hoher Wahrscheinlichkeit nicht von Sprache stammen.
- Die Ausgangssignale spektraler Geräuschreduktionsalgorithmen enthalten zum Teil unnatürliche Artefakte, beispielweise Überhöhungen im Spektralbereich die zu dem sogenanntem "Musical Noise" führen. Diese lokalen spektralen Maxima verändern die Feinstruktur des Spektrums, welche sich in den oberen cepstralen Bins wieder findet. Da im cepstralen Bereich bekannt ist, welche Koeffizienten mit hoher Wahrscheinlichkeit nicht von der Sprache stammen, lässt sich diese Information nutzen, um spektrale Ausreißer im Ausgangssignal zu vermeiden. Dazu werden die cepstralen Koeffizienten gewisser Parameter des Geräuschreduktionsalgorithmus modifiziert. Die Modifikation kann zum Beispiel durch eine Ersetzung der cepstralen Koeffizienten, die mit hoher Wahrscheinlichkeit nicht von Sprache stammen, durch die entsprechenden Koeffizienten des verrauschten Signals erfolgen.
- Die folgenden drei Parameter eignen sich für eine cepstrale Modifikation:
- die Rauschschätzung, und/oder
- die Sprachleistungsschätzung, und/oder
- das geräuschreduzierte Ausgangssignal.
- Das in
Figur 2 dargestellte Ablaufdiagramm des erfindungsgemäßen Verfahrens zur Störgeräuschunterdrückung könnte beispielsweise in einer Signalverarbeitungseinheit eines Hörgeräts umgesetzt werden. Über einen breitbandigen Signaleingang gelangt ein elektrisches Signal S, das zum Beispiel aus einem akustischen Umgebungssignal gewonnen wurde, in die Signalverarbeitungseinheit. Das Eingangssignal S wird zunächst einer Diskreten Fourier-Transformation DFT unterzogen, die das Eingangssignal S in seine spektralen Komponenten mit den spektralen Koeffizienten LS zerlegt. Mittels einer Rauschleistungsschätzung RL und einer Sprachleistungsschätzung SL werden die spektralen Koeffizienten RLS, SLS der Störgeräuschleistung bzw. der Sprachleistung abgeschätzt. - Aus den so gewonnenen spektralen Koeffizienten RLS, SLS werden mittels inverser Fouriertransformation SCR, SCS des logarithmierten Betragsspektrums die Cepstren der geschätzten Rauschleistung und Sprachleistung gebildet. Es werden somit die cepstralen Koeffizienten RLC, SLC ermittelt. Aus dem Spektrum des Eingangssignals LS wird ebenfalls das Cepstrum mit den cepstralen Koeffizienten LSC ermittelt.
- Alle drei Cepstren RLC, SLC, LSC werden im Rahmen einer ersten Ersetzungsstrategie ES1 ausgewertet und für eine Modifikation der cepstralen Koeffizienten RLC, SLC der Rauschleistung bzw. der Sprachleistung derart verwendet, dass eine möglichst optimale Störgeräuschunterdrückung des Eingangssignals S und hohe Natürlichkeit des Ausgangssignals SR oder aSR erzielt werden kann. Als Ergebnis der ersten Ersetzungsstrategie ES1 werden die modifizierten cepstralen Koeffizienten mRLS, mSLS der Rauschleistung und der Sprachleistung ermittelt.
- Aus den modifizierten cepstralen Koeffizienten mRLS, mSLS werden anschließend durch Rücktransformationen CSR, CSS modifizierte spektrale Koeffizienten mRLS, mSLS der Rauschleistung bzw. der Sprachleistung erzeugt. Mittels eines Gewichtungsverfahrens werden aus den modifizierten Spektren mRLS, mSLS der Rauschleistung und der Sprachleistung unter Berücksichtigung des Spektrums LS des Eingangssignals die Gewichtungsfaktoren GF für die Gewichtung der spektralen Koeffizienten LS des Eingangssignals ermittelt. Bei einer anschließenden Multiplikation MP wird das Spektrum LS des Eingangssignals mit den Gewichtungsfaktoren multipliziert. Die dadurch gebildeten modifizierten spektralen Koeffizienten mLS werden anschließend durch eine inverse diskrete Fourier-Transformation in ein störgeräuschreduziertes Ausgangssignal SR umgewandelt.
- In
Figur 3 ist der Ablauf einer weiteren Ausführungsform des erfindungsgemäßen Verfahrens dargestellt. Bis zur Generierung von modifizierten spektralen Koeffizienten mLS aus einem Eingangssignal S ist das Verfahren identisch dem inFigur 2 beschriebenen. - Vor einer Rücktransformation in den Zeitbereich wird aber aus dem störgeräuschreduzierten Spektrum mLS mittels inverser Fourier-Transformation SCA des logarithmierten Betragsspektrums das Cepstrum mit den cepstralen Koeffizienten ALS gebildet. Mit Hilfe einer zweiten Ersetzungsstrategie ES2, welche Artefakte unterdrücken soll, sowie unter Berücksichtigung des Cepstrum LSC des Eingangssignals S werden modifizierte cepstrale Koeffizienten mALC des störgeräuschreduzierten Ausgangssignals mLS erzeugt. Durch eine Spektrumsbildung CSA werden daraus modifizierte spektrale Koeffizienten mALS ermittelt, die anschließend durch eine inverse diskrete Fourier-Transformation IDFT in ein Artefakt-reduziertes Ausgangssignal aSR umgewandelt werden.
- Die dargestellten Verfahrensschritte können erfindungsgemäß in einen digitalen Signalprozessor eines Hörgeräts implementiert werden. Dadurch kann eine hohe Natürlichkeit eines verstärkten Schallsignals bei gleichzeitiger Störgeräuschunterdrückung erzielt werden. Die cepstrale Modifikation überträgt die im ursprünglichen, verrauschten Signal vorhandenen Feinstrukturen in das verbesserte Ausgangssignal und/oder in die Schätzung der Sprachleistung und/oder in die Schätzung der Rauschleistung, so dass eine erhöhte Natürlichkeit erreicht wird und/oder nicht-stationäre Geräusche besser abgebildet werden. Die Möglichkeit, schnell veränderliche Geräusche zu schätzen, macht dieses Verfahren außerordentlich interessant. Bisher bekannte Verfahren erzielen lediglich eine Reduktion der spektralen Fluktuationen, vermindern aber gleichzeitig die zeitliche Feinstruktur.
-
- 1
- Hörgerätegehäuse
- 2
- Mikrofon
- 3
- Signalverarbeitungseinheit
- 4
- Hörer
- 5
- Batterie
- aSR
- Artefakt-reduziertes Ausgangssignal
- CSA
- Spektrumbildung
- CSR
- Spektrumbildung des modifizierten Cepstrum der Rauschleistung
- CSS
- Spektrumbildung des modifizierten Cepstrum der Sprachleistung
- DFT
- Diskrete Fourier-Transformation
- ES1
- erste Ersetzungsstrategie
- ES2
- zweite Ersetzungsstrategie
- GF
- Gewichtungsfaktoren
- GW
- Ermittlung der Gewichtung der spektralen Koeffizienten
- IDFT
- inverse Diskrete Fourier-Transformation
- LS
- spektrale Koeffizienten des Eingangssignals S
- LSC
- cepstrale Koeffizienten des Eingangssignals S
- MP
- Multiplikation
- mALC
- modifizierte cepstrale Koeffizienten des störgeräuschreduzierten Ausgangssignals mLS
- mALS
- modifizierte spektrale Koeffizienten
- mLS
- spektrale Koeffizienten des störgeräuschreduzierten Eingangssignals S
- mRLC
- modifizierte cepstrale Koeffizienten der Rauschleistung
- mRLS
- modifizierte spektrale Koeffizienten der Rauschleistung
- mSLC
- modifizierte cepstrale Koeffizienten der Sprachleistung
- mSLS
- modifizierte spektrale Koeffizienten der Sprachleistung
- RL
- Rauschleistungsschätzung
- RLC
- cepstrale Koeffizienten der Rauschleistung
- RLS
- spektrale Koeffizienten der Rauschleistung
- S
- Eingangssignal
- SL
- Signalleistungsschätzung
- SLC
- cepstrale Koeffizienten der Sprachleistung
- SLS
- spektrale Koeffizienten der Sprachleistung
- SCR
- Cepstrumbildung aus dem Spektrum der Rauschleistung
- SCS
- Cepstrumbildung aus dem Spektrum der Signalleistung
- SCE
- Cepstrumbildung aus dem Spektrum des Eingangssignals
- SR
- geräuschreduziertes Ausgangssignal
Claims (7)
- Verfahren zur Störgeräuschreduktion eines Eingangssignals (S) gekennzeichnet durch:- eine Modifikation der Koeffizienten des Cepstrum des Eingangssignals (LSC), des veränderten Eingangssignals und/oder mindestens eines aus dem Eingangssignal gewonnenen Parameters (RLC, SLC), wobei zeitpunktabhängig cepstrale Koeffizienten eines Ersetzungssignals oder eines aus dem Ersetzungssignal gewonnenen Parameters übernommen werden, und- eine Verwendung der modifizierten cepstralen Koeffizienten (mRLC, mSLC, mALC) zur Bildung eines Ausgangssignals (SR, aSR) aus dem Eingangssignal (S), wobei das Ausgangssignal (SR, aSR) gegenüber dem Eingangssignal (S) störgeräuschreduziert ist.
- Verfahren nach Anspruch 1,
wobei das Eingangssignal (S) aus einem von einem Hörgerät aufgenommenen akustischen Signal gewonnen wird. - Verfahren nach Anspruch 1 oder 2 gekennzeichnet durch:- Bildung eines Rauschleistungsspektrums (RLS) durch eine Störgeräuschabschätzung (RL) des Eingangssignals (S, LS) und/oder- Bildung eines Sprachleistungsspektrums (SLS) durch eine Sprachleistungsabschätzung (SL) des Eingangssignals (S, SL),- Ermittlung (SCR) des Cepstrum (RLC) des Rauschleistungsspektrums (RLS) und/oder- Ermittlung (SCS) des Cepstrum (SLC) des Sprachleistungsspektrums (SLS),- Ermittlung modifizierter cepstraler Koeffizienten (mRLC, mSLC) für die ermittelten Cepstren (RLC, SLC) des Rauschleistungsspektrums (RLS) und/oder des Sprachleistungsspektrums (SLS) mit Hilfe einer ersten Ersetzungsstrategie (ES1),- Ermittlung (CSR, CSS) der modifizierten Spektren (mRLS, mSLS) der Rauschleistung und/oder der Sprachleistung aus den modifizierten Cepstren (mRLC, mSLC) und- Bildung (GW, MP, IDFT) des störgeräuschreduzierten Ausgangssignals (SR, mLS) durch Modifikation der spektralen Koeffizienten (LS) des Eingangssignals (S) mittels der modifizierten Spektren (mRLS, mSLS) der Rauschleistung und/oder der Sprachleistung.
- Verfahren nach Anspruch 1 oder 2 gekennzeichnet durch:- Bildung (SCE) des Cepstrum (LSC) des Eingangssignals )S, LS),- Ermittlung modifizierter cepstraler Koeffizienten für das ermittelte Cepstrum (LSC) des Eingangssignals (S, LS) mit Hilfe einer zweiten Ersetzungsstrategie (ES2) und- Bildung (GW; MP) eines störgeräuschreduzierten Ausgangssignals (SR) aus dem modifizierten Cepstrum (mLS) des Eingangssignals (S).
- Verfahren nach Anspruch 3 gekennzeichnet durch:- Bildung (SCA) des Cepstrum (ALC) des störgeräuschreduzierten Ausgangssignals (SR, mLS),- Ermittlung modifizierter cepstraler Koeffizienten (mALC) für das ermittelte Cepstrum (ALC) des störgeräuschreduzierten Ausgangssignals (SR, mLS) mit Hilfe der zweiten Ersetzungsstrategie (ES2) und- Bildung (CSA, IDFT) eines weiteren Ausgangssignals (aSR) aus dem modifizierten Cepstrum (mALC) des störgeräuschreduzierten Ausgangssignals (SR, mLS), welches gegenüber dem Ausgangssignal (SR, mLS) Artefakt-reduziert ist.
- Hörgerät mit Störgeräuschunterdrückung nach einem Verfahren der Ansprüche 1 bis 5 gekennzeichnet durch:eine Signalverarbeitungseinheit mit einem Rauschleistungsschätzer und mit einem Sprachleistungsschätzer sowie mit einer ersten und/oder zweiten Ersetzungseinheit zur Modifikation von cepstralen Koeffizienten.
- Computerprogrammprodukt mit einem Computerprogramm, das Softwaremittel zur Durchführung eines Verfahrens nach einem der Ansprüche 1 bis 5 aufweist, wenn das Computerprogramm in einem Hörgerät nach Anspruch 6 ausgeführt wird.
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| DE102008031150A DE102008031150B3 (de) | 2008-07-01 | 2008-07-01 | Verfahren zur Störgeräuschunterdrückung und zugehöriges Hörgerät |
Publications (2)
| Publication Number | Publication Date |
|---|---|
| EP2141941A2 true EP2141941A2 (de) | 2010-01-06 |
| EP2141941A3 EP2141941A3 (de) | 2014-01-01 |
Family
ID=41164008
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| EP09159848.2A Withdrawn EP2141941A3 (de) | 2008-07-01 | 2009-05-11 | Verfahren zur Störgeräuschunterdrückung und zugehöriges Hörgerät |
Country Status (3)
| Country | Link |
|---|---|
| US (1) | US20090257609A1 (de) |
| EP (1) | EP2141941A3 (de) |
| DE (1) | DE102008031150B3 (de) |
Cited By (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN102930870A (zh) * | 2012-09-27 | 2013-02-13 | 福州大学 | 利用抗噪幂归一化倒谱系数的鸟类声音识别方法 |
Families Citing this family (10)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| KR100661313B1 (ko) * | 2003-12-03 | 2006-12-27 | 한국전자통신연구원 | 평생 번호를 사용한 이동성 제공이 가능한 sip 기반의멀티미디어 통신 시스템 및 이동성 제공 방법 |
| US9838784B2 (en) | 2009-12-02 | 2017-12-05 | Knowles Electronics, Llc | Directional audio capture |
| US8880396B1 (en) * | 2010-04-28 | 2014-11-04 | Audience, Inc. | Spectrum reconstruction for automatic speech recognition |
| US9536540B2 (en) | 2013-07-19 | 2017-01-03 | Knowles Electronics, Llc | Speech signal separation and synthesis based on auditory scene analysis and speech modeling |
| WO2016040885A1 (en) | 2014-09-12 | 2016-03-17 | Audience, Inc. | Systems and methods for restoration of speech components |
| US9820042B1 (en) | 2016-05-02 | 2017-11-14 | Knowles Electronics, Llc | Stereo separation and directional suppression with omni-directional microphones |
| EP3582514B1 (de) * | 2018-06-14 | 2023-01-11 | Oticon A/s | Tonverarbeitungsvorrichtung |
| US20220417677A1 (en) * | 2021-06-24 | 2022-12-29 | Orcam Technologies Ltd. | Audio feedback for correcting sound degradation |
| CN115134731A (zh) * | 2022-04-18 | 2022-09-30 | 蒲琳琳 | 基于频率特征的智能助听器及算法 |
| CN116741201A (zh) * | 2023-06-27 | 2023-09-12 | 百瑞互联集成电路(上海)有限公司 | 音频接收端的啸叫检测方法、系统、解码方法及解码器 |
Family Cites Families (5)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US6990447B2 (en) * | 2001-11-15 | 2006-01-24 | Microsoft Corportion | Method and apparatus for denoising and deverberation using variational inference and strong speech models |
| US20030187637A1 (en) * | 2002-03-29 | 2003-10-02 | At&T | Automatic feature compensation based on decomposition of speech and noise |
| US7013272B2 (en) * | 2002-08-14 | 2006-03-14 | Motorola, Inc. | Amplitude masking of spectra for speech recognition method and apparatus |
| DE602004008973T2 (de) * | 2004-05-14 | 2008-05-15 | Loquendo-Società per Azioni | Rauschminderung für die automatische spracherkennung |
| WO2008083315A2 (en) * | 2006-12-31 | 2008-07-10 | Personics Holdings Inc. | Method and device configured for sound signature detection |
-
2008
- 2008-07-01 DE DE102008031150A patent/DE102008031150B3/de not_active Expired - Fee Related
-
2009
- 2009-05-11 EP EP09159848.2A patent/EP2141941A3/de not_active Withdrawn
- 2009-06-23 US US12/489,910 patent/US20090257609A1/en not_active Abandoned
Non-Patent Citations (2)
| Title |
|---|
| C. BREITHAUPT ET AL.: "Cepstral Smooting of Spectral Filter Gains for Speech Enhancement Without Musical Noise", IEEE SIGNAL PROCESSING LETTERS, vol. 14, no. 12, December 2007 (2007-12-01), pages 1036 - 1039 |
| R. MARTIN: "Noise power spectral density estimation based on optimal smoothing and minimum statistics", IEEE TRANS. SPEECH AUDIO PROCESSING, vol. 9, no. 5, July 2001 (2001-07-01), pages 504 - 512 |
Cited By (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN102930870A (zh) * | 2012-09-27 | 2013-02-13 | 福州大学 | 利用抗噪幂归一化倒谱系数的鸟类声音识别方法 |
| CN102930870B (zh) * | 2012-09-27 | 2014-04-09 | 福州大学 | 利用抗噪幂归一化倒谱系数的鸟类声音识别方法 |
Also Published As
| Publication number | Publication date |
|---|---|
| EP2141941A3 (de) | 2014-01-01 |
| DE102008031150B3 (de) | 2009-11-19 |
| US20090257609A1 (en) | 2009-10-15 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| DE102008031150B3 (de) | Verfahren zur Störgeräuschunterdrückung und zugehöriges Hörgerät | |
| DE602004004242T2 (de) | System und Verfahren zur Verbesserung eines Audiosignals | |
| DE10041512B4 (de) | Verfahren und Vorrichtung zur künstlichen Erweiterung der Bandbreite von Sprachsignalen | |
| EP2249587A2 (de) | Frequenzumsetzung mittels Warping der hochfrequenten spektralen Hüllkurve bei Hörgeräten | |
| EP2405673B1 (de) | Verfahren zum Lokalisieren einer Audioquelle und mehrkanaliges Hörsystem | |
| EP2109329A2 (de) | Mehrstufiges Schätzverfahren zur Störgeräuschreduktion und Hörvorrichtung | |
| WO2011110239A1 (de) | Enthallen von signalen einer binauralen hörvorrichtung | |
| DE60033039T2 (de) | Vorrichtung und verfahren zur unterdrückung von zischlauten unter verwendung von adaptiven filteralgorithmen | |
| EP2495724B1 (de) | Verfahren und Vorrichtung zum Schätzen eines Störgeräusches | |
| EP2584795B1 (de) | Verfahren zum Ermitteln einer Kompressionskennlinie | |
| EP2675191A2 (de) | Frequenzumsetzung in Hörhilfegeräten unter Verwendung einer zusätzlichen Spektralsynthese | |
| WO2001047335A2 (de) | Verfahren zur elimination von störsignalanteilen in einem eingangssignal eines auditorischen systems, anwendung des verfahrens und ein hörgerät | |
| EP1912470A2 (de) | Verfahren zur Dynamikkompression eines Audiosignals und entsprechende Hörvorrichtung | |
| EP1926087A1 (de) | Anpassung einer Hörvorrichtung an ein Sprachsignal | |
| EP2394271B1 (de) | Methode zur trennung von signalpfaden und anwendung auf die verbesserung von sprache mit elektro-larynx | |
| EP2219389B1 (de) | Vorrichtung und Verfahren zur Störgeräuschschätzung bei einer binauralen Hörgeräteversorgung | |
| CN111009259A (zh) | 一种音频处理方法和装置 | |
| DE102011006472B4 (de) | Verfahren zur Verbesserung der Sprachverständlichkeit mit einem Hörhilfegerät sowie Hörhilfegerät | |
| DE102024205064B4 (de) | Verfahren zum Betreiben eines Hörgeräts | |
| EP3961624B1 (de) | Verfahren zum betrieb einer hörvorrichtung in abhängigkeit eines sprachsignals | |
| EP3962115B1 (de) | Verfahren zur bewertung der sprachqualität eines sprachsignals mittels einer hörvorrichtung | |
| EP3048813B1 (de) | Verfahren und vorrichtung zur rauschunterdrückung basierend auf inter-subband-korrelation | |
| EP2622879B1 (de) | Verfahren und vorrichtung zur frequenzkompression | |
| Li et al. | Integrating Spectrotemporal Context into Features Based on Auditory Perception for Classification-based Speech Separation | |
| DE102020210918A1 (de) | Verfahren zum Betrieb einer Hörvorrichtung in Abhängigkeit eines Sprachsignals |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| PUAI | Public reference made under article 153(3) epc to a published international application that has entered the european phase |
Free format text: ORIGINAL CODE: 0009012 |
|
| AK | Designated contracting states |
Kind code of ref document: A2 Designated state(s): AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC MK MT NL NO PL PT RO SE SI SK TR |
|
| PUAL | Search report despatched |
Free format text: ORIGINAL CODE: 0009013 |
|
| AK | Designated contracting states |
Kind code of ref document: A3 Designated state(s): AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC MK MT NL NO PL PT RO SE SI SK TR |
|
| AX | Request for extension of the european patent |
Extension state: AL BA RS |
|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: THE APPLICATION IS DEEMED TO BE WITHDRAWN |
|
| 18D | Application deemed to be withdrawn |
Effective date: 20131203 |