DE69737489T2 - Formung des erkennbaren Rauschsignals in der Zeitdomäne mittels LPC-Voraussage im Frequenzraum - Google Patents

Formung des erkennbaren Rauschsignals in der Zeitdomäne mittels LPC-Voraussage im Frequenzraum Download PDF

Info

Publication number
DE69737489T2
DE69737489T2 DE69737489T DE69737489T DE69737489T2 DE 69737489 T2 DE69737489 T2 DE 69737489T2 DE 69737489 T DE69737489 T DE 69737489T DE 69737489 T DE69737489 T DE 69737489T DE 69737489 T2 DE69737489 T2 DE 69737489T2
Authority
DE
Germany
Prior art keywords
prediction
signal
spectral component
component signals
coded
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Expired - Lifetime
Application number
DE69737489T
Other languages
English (en)
Other versions
DE69737489D1 (de
Inventor
Juergen Heinrich Basking Ridge Herre
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Nokia of America Corp
Original Assignee
Lucent Technologies Inc
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Lucent Technologies Inc filed Critical Lucent Technologies Inc
Application granted granted Critical
Publication of DE69737489D1 publication Critical patent/DE69737489D1/de
Publication of DE69737489T2 publication Critical patent/DE69737489T2/de
Anticipated expiration legal-status Critical
Expired - Lifetime legal-status Critical Current

Links

Classifications

    • HELECTRICITY
    • H03ELECTRONIC CIRCUITRY
    • H03MCODING; DECODING; CODE CONVERSION IN GENERAL
    • H03M7/00Conversion of a code where information is represented by a given sequence or number of digits to a code where the same, similar or subset of information is represented by a different sequence or number of digits
    • H03M7/30Compression; Expansion; Suppression of unnecessary data, e.g. redundancy reduction
    • H03M7/3002Conversion to or from differential modulation
    • H03M7/3044Conversion to or from differential modulation with several bits only, i.e. the difference between successive samples being coded by more than one bit, e.g. differential pulse code modulation [DPCM]
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/02Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders
    • G10L19/03Spectral prediction for preventing pre-echo; Temporary noise shaping [TNS], e.g. in MPEG2 or MPEG4
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L21/00Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
    • G10L21/02Speech enhancement, e.g. noise reduction or echo cancellation
    • G10L21/0316Speech enhancement, e.g. noise reduction or echo cancellation by changing the amplitude
    • G10L21/0364Speech enhancement, e.g. noise reduction or echo cancellation by changing the amplitude for improving intelligibility

Landscapes

  • Engineering & Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Computational Linguistics (AREA)
  • Signal Processing (AREA)
  • Health & Medical Sciences (AREA)
  • Spectroscopy & Molecular Physics (AREA)
  • Human Computer Interaction (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Quality & Reliability (AREA)
  • Theoretical Computer Science (AREA)
  • Compression, Expansion, Code Conversion, And Decoders (AREA)

Description

  • Gebiet der Erfindung
  • Die vorliegende Erfindung betrifft das Gebiet des Audiosignalcodierens und insbesondere ein verbessertes Verfahren und eine verbesserte Vorrichtung zum Codieren von Audiosignalen auf der Basis eines psychoakustischen Modells.
  • Allgemeiner Stand der Technik
  • Während der letzten Jahre wurden sogenannte "psychoakustische Audiocoder" entwickelt, welche die Übertragung und Speicherung von qualitativ hochwertigen Audiosignalen mit Bitraten von etwa 1/12 oder weniger der bei einem herkömmlichen Compact-Disc-Medium (CD) gemeinhin verwendeten Bitrate ermöglichen. Derartige Coder nutzen die in einem Audiosignal auf Grund der Einschränkungen des menschlichen Hörapparats enthaltene Irrelevanz durch Codieren des Signals mit lediglich so großer Genauigkeit, wie erforderlich ist, um ein psychoakustisch nicht unterscheidbares rekonstruiertes (d.h. decodiertes) Signal zu ergeben. Von mehreren Normungsorganisationen wurden Normen erstellt, beispielsweise die Audionormen MPEG1 und MPEG2 der Moving Picture Experts Group der International Standardization Organization (ISO/MPEG). Psychoakustische Audiocoder sind beispielsweise im US-Patent Nr. 5,285,498, ausgegeben an James D. Johnston am 8. Feb. 1994, und im US-Patent Nr. 5,341,457, ausgegeben an Joseph L. Hall II und James D. Johnston am 23. Aug. 1994, ausführlich beschrieben.
  • Im Allgemeinen kann die Konstruktion eines psychoakustischen Audiocoder für monophone Audiosignale folgendermaßen beschrieben werden.
    • • Die Eingangsabtastungen werden durch Verwendung verschiedener Typen von Filterbänken und Transformationen, beispielsweise der bestens bekannten modifizierten diskreten Cosinus-Transformation (MDCT), von Polyphasenfilterbänken oder Hybridstrukturen, in eine unterabgetastete Spektraldarstellung umgewandelt.
    • • Durch Verwendung eines psychoakustischen Modells werden eine oder mehrere zeitabhängige Maskierungsschwellen für das Signal geschätzt. Diese Schwellen liefern den maximalen Codierfehler, der in das Audiosignal eingebunden werden kann, während dennoch eine psychoakustisch unbeeinträchtigte Signalqualität bestehen bleibt.
    • • Die Spektralwerte werden gemäß der Genauigkeit, die den Maskierungsschwellenschätzwerten entspricht, quantisiert und codiert. Auf diese Weise kann das Quantisierungsrauschen durch das entsprechende übertragene Signal verborgen (d.h. maskiert) werden und ist dadurch nach dem Decodieren nicht wahrnehmbar.
    • • Schließlich werden alle relevanten Informationen (z.B. codierte Spektralwerte und zusätzliche Nebeninformationen) in einen Bitstrom gepackt und zu dem Decoder übertragen.
  • Folglich sind die in einem entsprechenden Decoder verwendeten Verarbeitungen umgekehrt:
    • • Der Bitstrom wird decodiert und in codierte Spektraldaten und Nebeninformationen geparst.
    • • Die umgekehrte Quantisierung der quantisierten Spektralwerte wird durchgeführt.
    • • Die Spektralwerte werden mittels einer Synthesefilterbank in eine Zeitraumdarstellung zurück umgewandelt.
  • Mittels einer derartigen generischen Coderkonstruktion ist es möglich, die Irrelevanz, die in jedem Signal auf Grund der Einschränkungen des menschlichen Hörapparats enthalten ist, effizient zu nutzen. Insbesondere kann das Spektrum des Quantisierungsrauschens entsprechend der Form der Rauschmaskierungsschwelle des Signals geformt sein. Auf diese Weise kann das Rauschen, das sich aus dem Codierprozess ergibt, unter dem codierten Signal "verborgen" sein, und demnach kann eine psychoakustisch transparente Qualität bei hohen Kompressionsraten erreicht werden.
  • Ohne weitere Vorsichtsmaßnahmen liefert allerdings ein psychoakustischer Coder beim Codieren von transienten Signalen, beispielsweise von Kastagnetten- oder Glockenspieltönen, eventuell keine transparente Signalqualität. Dieses Problem ist darauf zurückzuführen, was gemeinhin als "Vorecho"-Problem bekannt ist, mit dem Fachleute vertraut sind. Insbesondere ist, während das zu codierende Signal eventuell nur in Abschnitten des Zeitfensters, das durch die Analysefilterbank des Coders verarbeitet wird, und einem bestimmten Moment starke Signalkomponenten enthält, der resultierende Codierfehler für gewöhnlich über die gesamte Fensterlänge ausgebreitet. Demnach kann das Quantisierungsrauschen über einen Zeitraum, beispielsweise von 20 Millisekunden oder mehr, verteilt sein, und es kann dadurch die Größe von Originalsignalkomponenten in bestimmten Signalbereichen übersteigen. Wenn man beispielsweise ein Kastagnettensignal mit einem "Ausschlag" im mittleren Abschnitt eines Analysefensters hernimmt, können die Rauschkomponenten des codierten Signals im Abschnitt des Fensters unmittelbar vor dem "Ausschlag" stärker als die Originalsignalkomponenten sein.
  • Bekannt ist, dass auf Grund der Eigenschaften des menschlichen Hörapparats derartige "Vorechos" nur dann maskiert werden, wenn keine erhebliche Menge des Codierungsrauschens länger als etwa 2 ms vor Beginn des Signals vorliegt. Andernfalls wird das Codierungsrauschen wahrscheinlich als "Vorecho"-Artefakt wahrgenommen – d.h. als ein kurzes rauschähnliches Ereignis, das dem Beginn des Signals vorangeht.
  • Eine Reihe von Verfahren wurden vorgeschlagen, um Vorecho-Artefakte in einem codierten/decodierten Signal zu vermeiden, das durch ein psychoakustisches Audiocodiersystem erzeugt wird:
    • 1) Ein Verfahren, welches verwendet wurde, ist, die Codierungsgenauigkeit der Spektralkoeffizienten des Filterbankfensters, welches zuerst den transienten Signalabschnitt abdeckt, zu erhöhen. Dies ist als "Vorechokontrolle" bekannt und beispielsweise in die MPEG1-Audionorm eingebunden. Da diese Lösung erheblich mehr Bits zum Codieren dieser Rahmen benötigt, kann ein derartiges Verfahren in einem Konstantbitraten-Coder nicht ohne weiteres angewandt werden. In einem bestimmten Maß kann lokalen Variationen im Bitratenbedarf durch Verwendung des herkömmlichen Verfahrens, welches als "Bitreservoir" bekannt und ebenfalls in die MPEG1-Audionorm eingebunden ist, Rechnung getragen werden. Dieses Verfahren gestattet die Bewältigung von Bitratenbedarfsspitzen durch Verwendung von Bits, die während des Codierens vorangegangener Rahmen beiseite gelegt wurden – demnach bleibt die durchschnittliche Bitrate immer noch konstant. In der Praxis muss jedoch die Größe des Bitreservoirs unrealistisch groß sein, um beim Codieren von Eingangssignalen von stark transienter Natur Artefakte zu vermeiden.
    • 2) Eine andere Strategie, die in zahlreichen herkömmlichen psychoakustischen Audiocodern verwendet wird, ist als Adaptive-Window-Switching bekannt. Dieses Verfahren, welches ebenfalls in die MPEG1-Audionorm eingebunden ist, passt die Größe der Filterbankfenster an die Eigenschaften des Eingabesignals an. Während Abschnitte des Signals, die relativ stationär sind, eine lange Fensterlänge benutzen (wie üblich ist), werden kurze Fenster verwendet, um die transienten Abschnitte des Signals zu codieren. Auf diese Weise kann der Spitzenbitbedarf erheblich reduziert werden, da die Bereiche, für welche eine hohe Codiergenauigkeit erforderlich ist, zeitlich eingeschränkt sind.
  • Ein wesentlicher Nachteil des Adaptive-Window-Switching-Verfahrens ist, dass es erhebliche zusätzliche Komplexität in den Coder einbindet und dessen Konstruktion verkompliziert. Da die verschiedenen Fenstergrößen verschiedene Parameter und Codierstrategien voraussetzen, besteht ein Coder, der Window-Switching verwendet, in Wirklichkeit aus im Wesentlichen zwei Codern, einem für die längere Fenstergröße und einem für die kürzere Fenstergröße. Darüber hinaus kann dieses Verfahren im Fall eines "gepitchten" Signals, das aus einer pseudostationären Reihe von impulsartigen Signalen besteht, beispielsweise der menschlichen Sprache, nicht effizient verwendet werden, ohne beträchtliche Einbußen bei der Codiereffizienz in Kauf zu nehmen. Auf Grund des Mechanismus der Spracherzeugung würde die temporale Ausbreitung des Quantisierungsrauschens bei Verwendung dieses Verfahrens nur durch ständiges Auswählen der kürzeren Fenstergröße vermieden. Dies wiederum würde infolge der reduzierten Codierverstärkung und des erhöhten Nebeninformationsaufwands zu einer erheblichen Abnahme der Codereffizienz führen.
    • 3) Ein drittes Verfahren, das verwendet wurde, um die temporale Ausbreitung des Quantisierungsrauschens zu vermeiden, ist, das Signal vor dem Durchführen der Spektralzerlegung einer Verstärkungsänderung/-modifi zierung zu unterziehen. Das dieser Herangehensweise zu Grunde liegende Prinzip ist, die Dynamik des Eingangssignals durch Anwendung einer Verstärkungsmodifikation vor seiner Codierung zu reduzieren. Die Parameter der Verstärkungsmodifikation werden dann im Bitstrom übertragen – mittels dieser Informationen kann der Prozess auf der Decoderseite umgekehrt werden.
  • Um für die meisten Signale eine gute Leistung zu erzielen, muss jedoch die Verarbeitung unabhängig auf verschiedene Teile des Frequenzspektrums angewandt werden, da transiente Ereignisse oft nur in bestimmten Abschnitten des Spektrums vorliegen. Dies kann mittels komplexerer Hybridfilterbänke durchgeführt werden, die eine getrennte Verstärkungsverarbeitung verschiedener Spektralkomponenten gestatten. Im Allgemeinen sind jedoch die Abhängigkeiten zwischen der Verstärkungsmodifikation und dem psychoakustischen Modell des Coders oftmals schwierig zu lösen.
  • "Mobile Radio Communications", R. Steele, Pentech Press, London, 1992, S. 188-191, offenbart die Verwendung von auf Sprachsignale angewandtem prädiktivem Codieren. Dies funktioniert durch Vorhersagen der Sprachsequenz, Bilden eines Fehlers zwischen der tatsächlichen Sprache und der vorhergesagten Sprache und Quantisieren der Fehlersequenz vor der Übertragung. Zwei Formen werden besprochen, nämlich D*PCM und DPCM, die dem entsprechen, was in diesem Dokument als "DPCM mit offenem Kreislauf" und "DPCM mit geschlossenem Kreislauf" bezeichnet wird (siehe Encoder 34 und 44 aus nachstehender 3 und 4 und Decoder 55 aus 5).
  • "Frequency domain coding of speech", J. M. Tribolet und R. E. Crochiere, IEEE Transactions on Acoustics, speech and signal processing, IEEE New York, US, Bd. ASSP-27, Nr. 5, S. 512-530, (1979), ist eine Abhandlung, welche herkömmliche Frequenzraum-Sprachcodierverfahren, einschließlich Subband- und Transformationscodierer, beschreibt. Die Beschreibung der Transformationscodierer regt die Verwendung einer adaptiven Quantisierung der Transformationskoeffizienten an. Die Beschreibung der Subband-Coder regt die mögliche Verwendung prädiktiver Codierverfahren an, wobei die Prädiktion über den Zeitverlauf hinsichtlich der Daten innerhalb eines bestimmten Subbandes durchgeführt wird.
  • Kurzdarstellung der Erfindung
  • Ein Verfahren und eine Vorrichtung gemäß der vorliegenden Erfindung werden in den unabhängigen Ansprüchen dargelegt, auf welche der Leser nunmehr verwiesen wird. Bevorzugte Merkmale werden in den abhängigen Ansprüchen dargelegt.
  • Gemäß einer veranschaulichenden Ausführungsform der vorliegenden Erfindung werden ein Verfahren und eine Vorrichtung bereitgestellt, welche die Nachteile von im Stand der Technik bekannten Verfahren beheben. Insbesondere wird die Formung von wahrnehmbarem Rauschen im Zeitraum durch Durchführen einer (linearen) Prädiktion (d.h. Filterung) im Frequenzraum erzielt. Infolgedessen wird die temporale Ausbreitung von Quantisierungsrauschen reduziert. Konkret werden gemäß einer veranschaulichenden Ausführungsform der vorliegenden Erfindung die folgenden Verarbeitungsschritte in einem Encoder zur Verwendung mit monophonen Signalen angewandt:
    • • Das zu codierende Audiosignal wird durch eine hochauflösende Filterbank/Transformation (wie jener, die für den "längeren Block" bei herkömmlichen psychoakustischen Codern verwendet werden, die sich Adaptive-Window-Switching bedienen) in Spektralkomponenten zerlegt.
    • • Durch Verwendung eines psychoakustischen Modells werden eine oder mehrere zeitabhängige Maskierungsschwellen für das Signal geschätzt. Diese Schwellen liefern den maximalen Codierfehler, der in das Audiosignal eingebunden werden kann, während dennoch eine psychoakustisch unbeeinträchtigte Signalqualität bestehen bleibt.
    • • Dann wird die Codierung der Spektralwerte mittels eines auf differentieller Pulscodemodulation (DPCM) basierendem Quantisierungs-/Codierungsschemas durchgeführt, welches hinsichtlich der Filterbankausgänge in Frequenz betrieben wird. Wie bei herkömmlichen psychoakustischen Codern kann das Ziel für die erforderliche Codierungsgenauigkeit durch das psychoakustische Modell angegeben werden.
    • • Schließlich werden alle relevanten Informationen (z.B. die codierten Spektralwerte und die erzeugten Nebeninformationen) in einen Bitstrom gepackt und zu dem Decoder übertragen. Insbesondere beinhalten die erzeugten Nebeninformationen einen Merker, welcher die Verwendung von DPCM-Codierung anzeigt, und gegebenenfalls Informationen über den Zielfrequenzbereich und das zum Codieren verwendete Filter.
  • Analog dazu führt ein entsprechender veranschaulichender Decoder gemäß einer veranschaulichenden Ausführungsform der vorliegenden Erfindung die folgenden Verarbeitungsschritte aus:
    • • Der Bitstrom wird decodiert und in codierte Spektraldaten und Nebeninformationen geparst.
    • • Die umgekehrte Quantisierung der quantisierten Spektralwerte wird durchgeführt. Insbesondere kann dies das DCPM-Decodieren von Spektralwerten umfassen, wenn die Verwendung von DPCM mittels Merker in den Nebeninformationen angegeben wurde.
    • • Die Spektralwerte werden mittels einer Synthesefilterbank in eine Zeitraumdarstellung zurück umgewandelt.
  • Die Auswahl des Typs von DPCM-Quantisierungs-/Codierungsschema (Prädiktor/Quantisierer-Kombination) kann verschiedene Vorteile für das Gesamtsystemverhalten ergeben. Konkret und gemäß einer ersten veranschaulichenden Ausführungsform der vorliegenden Erfindung wird ein DPCM-System mit geschlossenem Kreislauf verwendet. Wenngleich diese erste Ausführungsform eine Codierungsverstärkung für transiente Signale ergibt, wird bei einer bevorzugten Lösung gemäß einer zweiten Ausführungsform der vorliegenden Erfindung ein DPCM-System mit offenem Kreislauf verwendet. Diese zweite Ausführungsform ergibt vorteilhafterweise einen zeitgeformten Quantisierungsfehler am Ausgang des Decoders. Konkret wird, da die DPCM-Verarbeitung auf spektrale Koeffizienten angewandt wird, das Quantisierungsrauschen im decodierten Signal (nachdem die inverse Filterbank im Decoder angewandt wurde) in der Zeit geformt, wodurch das Quantisierungsrauschen unter dem eigentlichen Signal gehalten wird. Auf diese Weise werden temporale Probleme mit der Entmaskierung, entweder bei transienten oder "pitchigen" Signalen, vorteilhaft ohne Bedarf an erheblicher Übercodierung und deren entsprechendem Bitaufwand vermieden.
  • Kurzbeschreibung der Zeichnungen
  • 1 zeigt eine herkömmliche Vorrichtung zum Ausführen von psychoakustischem Codieren durch Verwendung eines PCM-Quantisierungs-/Codierungsschemas zur Verwendung beim Codieren von monophonen Audiosignalen.
  • 2 zeigt eine herkömmliche Vorrichtung zum Ausführen von psychoakustischem Decodieren gemäß der psychoakustischen Codierungsvorrichtung aus 1.
  • 3 zeigt einen psychoakustischen Audioencoder, der sich eines Prädiktionsschemas mit geschlossenem Kreislauf gemäß einer ersten veranschaulichenden Ausführungsform der vorliegenden Erfindung bedient.
  • 4 zeigt einen psychoakustischen Audioencoder, der sich eines Prädiktionsschemas mit offenem Kreislauf gemäß einer zweiten veranschaulichenden Ausführungsform der vorliegenden Erfindung bedient.
  • 5 zeigt einen psychoakustischen Audiodecoder gemäß einer veranschaulichenden Ausführungsform der vorliegenden Erfindung.
  • 6 zeigt ein Flussdiagramm eines Verfahrens zum Codieren von Audiosignalen gemäß einer veranschaulichenden Ausführungsform der vorliegenden Erfindung.
  • 7 zeigt ein Flussdiagramm eines Verfahrens zum Decodieren von codierten Audiosignalen gemäß einer veranschaulichenden Ausführungsform der vorliegenden Erfindung.
  • Ausführliche Beschreibung
  • Das vorliegende erfindungsgemäße Verfahren und die vorliegende erfindungsgemäße Vorrichtung bewältigen die Nachteile von im Stand der Technik bekannten Verfahren durch wirksames Ersetzen der Verwendung eines herkömmlichen Pulscodemodulations(PCM)-Quantisierungs-/Codierungsschemas, welches für gewöhnlich in herkömmlichen psychoakustischen Audiocodern verwendet wird, durch ein auf differenzieller Pulscodemodulation (DPCM) basierendes Quantisierungs-/Codierungsschema, wobei das DPCM-Schema hinsichtlich der Filterbankausgänge im Frequenzraum betrieben wird. (Sowohl PCM-Codierungs- als auch DPCM-Codierungsverfahren sind Fachleuten im Allgemeinen bestens bekannt).
  • 1 zeigt einen herkömmlichen psychoakustischen Encoder zur Verwendung beim Codieren monophoner Audiosignale. Der Encoder aus 1 führt die folgenden Schritte aus:
    • • Das Eingangssignal x(k) wird durch die Analysefilterbank/-transformation 12 in Spektralkoeffizienten zerlegt, was "n" Spektralkomponenten y(b, 0)...y(b, n-1) für jeden Analyseblock "b" ergibt, wobei "n" die Anzahl von Spektralkoeffizienten je Analyseblock (d.h. die Blockgröße) ist. Jede Spektralkomponente y(b, j) ist einer Analysefrequenz oder einem Analysefrequenzbereich gemäß der verwendeten Filterbank zugeordnet.
    • • Das psychoakustische Modell 14 schätzt die erforderliche Codierungsgenauigkeit für eine psychoakustisch transparente Qualität des codierten/decodierten Signals und erzeugt eine oder mehrere Maskierungsschwellen. Diese Informationen können beispielsweise das minimale Signal-Rausch-Verhältnis (SNR) umfassen, das in jedem Frequenzband erforderlich ist, und werden dem PCM-Encoder 16 bereitgestellt.
    • • Jede Spektralkomponente y(b, j) wird quantisiert und jeweils durch Quantisierer 16-0...16-(n-1) (die jeweils Quantisierungen Q0...DQ durchführen) auf Übertragungsindizes i(b, 0)...i(b, n-1) abgebildet. Diese Quantisierer führen eine Quantisierung/Codierung der Spektralkoeffizienten gemäß den psychoakustischen Maskierungsschwellen, die durch das psychoakustische Modell 14 erzeugt werden, durch.
    • • Die Indexwerte i(b, 0)...i(b, n-1) werden gemeinsam mit (optionalen) Nebeninformationen dem Bitstromencoder 18 zugeführt und hernach in dem codierten Bitstrom übertragen (z.B. zu einem Decoder). Alternativ dazu kann der codierte Bitstrom auf einem Audiosignalspeichermedium, beispielsweise einer Compact Disc (CD) oder einem Digital Audio Tape (DAT) für den späteren Wiederabruf gespeichert werden.
  • Gemäß bestimmten veranschaulichenden Ausführungsformen der vorliegenden Erfindung kann die Codiervorrichtung aus 1 durch Ersetzen des PCM-Encoders 16 durch einen Encoder vom DPCM-Typ vorteilhaft modifiziert werden, wobei das DPCM-Codieren im Frequenzraum durchgeführt wird. 3 und 4 zeigen zwei derartige veranschaulichende Ausführungsformen der vorliegenden Erfindung. Insbesondere kann eine veranschaulichende Ausführungsform der vorliegenden Erfindung durch Ersetzen des PCM-Encoders 16 der herkömmlichen Codiervorrichtung aus 1 durch das Modul 32 gemäß 3 realisiert werden, wodurch eine Codiervorrichtung gemäß einer ersten veranschaulichenden Ausführungsform der vorliegenden Erfindung entsteht. Analog dazu kann eine andere veranschaulichende Ausführungsform der vorliegenden Erfindung durch Ersetzen des PCM-Encoders 16 der herkömmlichen Codiervorrichtung aus 1 durch das in 4 dargestellte Modul 42 realisiert werden, wodurch eine Codiervorrichtung gemäß einer zweiten veranschaulichenden Ausführungsform der vorliegenden Erfindung entsteht. In jedem Fall wird der Eingang zu dem Quantisierer-/Codierungs-Kernel durch die Reihe der Spektralkoeffizienten y(b, 0)...y(b, n-1) angegeben. Das heißt, dass die DPCM-Codierung über den Frequenzraum durchgeführt wird, im Gegensatz zu beispielweise prädiktiver Codierung über den Zeitraum, was durch herkömmliche Subband-ADPCM-Coder durchgeführt wird, die Fachleuten bestens bekannt sind.
  • Konkret werden der Drehschalter 33 des veranschaulichenden Encoders aus 3 und der Drehschalter 43 des veranschaulichenden Encoders aus 4 jeweils verwendet, um die Spektralwerte y(b, 0)...y(b, n-1) vor der Quantisierung/Codierung durch DPCM-Encoder 34 bzw. 44 in eine serielle Reihenfolge zu bringen, und der Drehschalter 35 des veranschaulichenden Encoders aus 3 und der Drehschalter 46 des veranschaulichenden Encoders aus 4 werden jeweils verwendet, um die entsprechenden resultierenden Indexwerte i(b, 0)...i(b, n-1) daraufhin in eine parallele Reihenfolge zu bringen. Wenngleich in jedem der dargestellten veranschaulichenden Encoder die Verarbeitung der Spektralwerte y(b, 0)...y(b, n-1) vorteilhaft in der Reihenfolge ansteigender Frequenz durchgeführt wird, können andere veranschaulichende Ausführungsformen die Verarbeitung entweder in der Reihenfolge abnehmender Frequenz oder in anderen alternativen (z.B. nichtmonotonen) Reihenfolgen durchführen. Darüber hinaus kann auch nur eine Untermenge der Spektralwerte (und nicht alle "n" davon, wie hier dargestellt ist) den DPCM-Encodern 34 und 44 zur differentiellen Codierung bereitgestellt werden.
  • Insbesondere zeigt 3 eine erste veranschaulichende Ausführungsform eines Encoders gemäß der vorliegenden Erfindung, bei welchem ein Prädiktionsschema mit geschlossenem Kreislauf verwendet wird. Prädiktion mit geschlossenem Kreislauf ist ein herkömmliches Verfahren, das Durchschnittsfachleuten bestens bekannt ist. Beim veranschaulichenden psychoakustischen Audioencoder aus 3 wird allerdings eine Prädiktion mit geschlossenem Kreislauf auf die Spektralwerte (d.h. im Frequenzraum) angewandt. Insbesondere wird ein Prädiktionsfilter (das in der Figur als einen Prädiktor 36 und einen Addierer 39 aufweisend dargestellt ist) durch die quantisierten Ausgangswerte, die durch den Quantisierer 37 erzeugt werden, angesteuert, und der vorhergesagte wert wird durch den Subtrahierer 38 von dem Eingangssignal subtrahiert, so dass vorteilhaft nur das Prädiktionsfehlersignal quantisiert/codiert wird. Festzuhalten ist, dass der Quantisierer 37 jeweils Quantisierungen Q0...Qn-1 für jeden der Spektralkomponentenwerte y(b, 0)...y(b, n-1) durchführt, welche diesem durch den Drehschalter 33 (über den Subtrahierer 38) bereitgestellt werden. Die Verwendung des veranschaulichenden Encoders aus 3 führt vorteilhaft zu einer Codierungsverstärkung, wenn das Encodereingangssignal x(k) eine transiente Charakteristik aufweist.
  • 4 zeigt eine zweite veranschaulichende Ausführungsform eines Encoders gemäß der vorliegenden Erfindung, bei welchem ein Prädiktionsschema mit offenem Kreislauf verwendet wird. Prädiktion mit offenem Kreislauf ist ein herkömmliches Verfahren, das Durchschnittsfachleuten bestens bekannt ist. Beim veranschaulichenden psychoakustischen Audioencoder aus 4 wird allerdings eine Prädiktion mit offenem Kreislauf auf die Spektralwerte (d.h. im Frequenzraum) angewandt. Insbesondere wird ein Prädiktor 47 durch die unquantisierten Eingangswerte angesteuert, und der vorhergesagte Wert wird dann durch den Subtrahierer 48 von dem Eingangssignal subtrahiert, so dass vorteilhaft nur das Prädiktionsfehlersignal (durch den Quantisierer 45) quantisiert/codiert wird. Festzuhalten ist, dass der Quantisierer 45 jeweils Quantisierungen Q0...4n-1 für jeden der Spektralkomponentenwerte y(b, 0)...y(b, n-1) durchführt, für welche diesem entsprechende Prädiktionsfehlersignale durch den Drehschalter 43 (über den Subtrahierer 48) bereitgestellt werden.
  • Wie beim veranschaulichenden Encoder aus 3 wird die Verwendung des veranschaulichenden Encoders aus 4 vorteilhaft zu einer Codierungsverstärkung führen, wenn das Encodereingangssignal x(k) eine transiente Charakteristik aufweist. Darüber hinaus wird allerdings die Verwendung eines psychoakustischen Audioencoders, der sich der Lösung mit offenem Kreis lauf aus 4 bedient, vorteilhaft einen zeitgeformten Quantisierungsfehler im endgültigen rekonstruierten Ausgangssignal x'(k) eines entsprechenden Decoders ergeben. Dies folgt aus der Tatsache, dass Prädiktion mit offenem Kreislauf auf Spektralkoeffizienten angewandt wurde, so dass das Quantisierungsrauschen als in Zeit geformt erscheint, wodurch der Rauschpegel unter den Signalpegel gestellt wird. Auf diese Weise werden temporale Probleme mit Entmaskierung, entweder in transienten oder "pitchigen" Signalen, ohne Bedarf an erheblichem Übercodieren und dem entsprechenden Bitaufwand vorteilhaft vermieden.
  • Da bei den oben beschriebenen veranschaulichenden Ausführungsformen der vorliegenden Erfindung prädiktives Codieren auf Spektralraumdaten angewandt wird, gelten bestimmte Beziehungen, die für die klassische Prädiktion bekannt sind, bei vertauschtem Zeit- und Frequenzraum. Beispielsweise wird eine Prädiktionsverstärkung in Abhängigkeit von dem "Hüllkurvenflachheitsmaß" des Signals (im Gegensatz zum "Spektralflachheitsmaß") erzielt. Darüber hinaus ist bei dem in 4 dargestellten Fall mit offenem Kreislauf der Prädiktionsfehler in der Zeit (im Gegensatz zur Frequenz) geformt. Demnach kann das oben beschriebene Verfahren mit offenem Kreislauf tatsächlich als dem Anwenden eines adaptiven Zeitraumfensters durch Prädiktion im Frequenzraum gleichwertig angesehen werden, wobei Faltung mittels einiger Elemente im Frequenzraum effektiv verwendet wird, um Formung des Rauschens im Zeitraum zu instanziieren.
  • Wenngleich bei den oben beschriebenen Ausführungsformen der Prädiktionsprozess über das gesamte Frequenzspektrum (d.h. für alle Spektralkoeffizienten) durchgeführt wird, kann bei anderen veranschaulichenden Ausführungsformen die Prädiktion für nur einen Abschnitt des Spektrums (d.h. für eine Untermenge der Spektralkoeffizienten) durchgeführt werden. Darüber hinaus können verschiedene Prädiktorfilter vorteilhaft in verschiedenen Abschnitten des Signalspektrums verwendet werden. Auf diese Weise kann das vorliegende erfindungsgemäße Verfahren zur Rauschkontrolle im Zeitraum auf jedwede gewünschte frequenzabhängige Weise angewandt werden.
  • Um für das geeignete Decodieren des codierten Signals zu sorgen, weist der Bitstrom, der durch die veranschaulichenden Encoder aus 3 und 4 erzeugt wird, vorteilhafterweise bestimmte zusätzliche Nebeninformationen auf, die beispielsweise als zusätzlicher Eingang zum Bitstromencoder 18 aus 1 dargestellt sind. Bei verschiedenen veranschaulichenden Ausführungsformen der vorliegenden Erfindung kann beispielsweise ein Feld mit Nebeninformationen die Verwendung von DPCM-Codierung und die Anzahl von verwendeten verschiedenen Prädiktionsfiltern angeben. Dann können weitere Felder im Bitstrom für jedes Prädiktionsfilter übertragen werden, welche den Zielfrequenzbereich des entsprechenden Filters und dessen Filterkoeffizienten signalisieren.
  • 6 zeigt ein Flussdiagramm eines Verfahrens zum Codieren monophoner Audiosignale gemäß einer veranschaulichenden Ausführungsform der vorliegenden Erfindung. Das in diesem Flussdiagramm dargestellte veranschaulichende Beispiel implementiert bestimmte relevante Abschnitte eines psychoakustischen Audioencoders mit Prädiktion mit offenem Kreislauf und einem einzigen Prädiktionsfilter. Konkret führt Schritt 61 eine herkömmliche Berechnung der Spektralwerte mittels einer Analysefilterbank durch (wie beispielsweise durch die Analysefilterbank/Transformation 12 des herkömmlichen Encoders aus 1 durchgeführt wird). Dann werden in Schritt 62 die Ordnung des Prädiktionsfilters eingestellt und der Zielfrequenzbereich definiert. Diese Parameter können beispielsweise zu Zwecken der Veranschaulichung auf eine Filterordnung von 15 und einen Zielfrequenzbereich von 4 kHz bis 20 kHz eingestellt werden. Mit diesen veranschaulichenden Parameterwerten werden Vorechos und Nachechos beim Codieren von "pitchigen" Signalen vorteilhaft entfernt.
  • In Schritt 63 wird das Prädiktionsfilter durch Verwendung des Bereichs von Spektralkoeffizienten, welcher dem Zielfrequenzbereich entspricht, und durch Anwenden eines herkömmlichen Verfahrens zum prädikativen Codieren, welches für DPCM-Coder bestens bekannt ist, ermittelt. Beispielsweise kann die Autokorrelationsfunktion der Koeffizienten in einem herkömmlichen Levinson-Durbin-Rekursionsalgorithmus berechnet und verwendet werden, der Fachleuten bestens bekannt ist. Infolgedessen sind die Prädiktorfilterkoeffizienten, die entsprechenden Reflexionskoeffizienten ("PARCOR"-Koeffizienten) und die erwartete Prädiktionsverstärkung bekannt.
  • Wenn die erwartete Prädiktionsverstärkung eine bestimmte Schwelle (z.B. 2 dB) übersteigt, wie durch die Entscheidung 64 festgestellt wird, wird das DPCM-Codierverfahren der Schritte 65 bis 67 verwendet. Diesfalls werden die Prädiktionsfilterkoeffizienten quantisiert (in Schritt 65), wie es zur Übertragung an den Decoder als Teil der Nebeninformationen erforderlich ist. Dann wird (in Schritt 66) das Prädiktionsfilter auf den Bereich von Spektralkoeffizienten angewandt, der dem Zielfrequenzbereich entspricht, wo die quantisierten Filterkoeffizienten verwendet werden. Für alle weiteren Verarbeitungen wird der gegebene Bereich von Spektralkoeffizienten durch den Ausgang des Filterprozesses ersetzt. Schließlich wird (in Schritt 67) ein Feld des Bitstroms übertragen, das die Verwendung von DPCM-Codierung ("Prädiktionsmerker" ein) signalisiert, und der Zielfrequenzbereich, die Ordnung des Prädiktionsfilters und Informationen, welche dessen Filterkoeffizienten beschreiben, sind ebenfalls im Bitstrom enthalten. Wenn andererseits die erwartete Prädiktionsverstärkung die Entscheidungsschwelle nicht übersteigt, überträgt Schritt 68 ein Feld im Bitstrom, welches signalisiert, dass kein DPCM-Codieren verwendet wurde ("Prädiktionsmerker" aus). Schließlich wird in jedem der beiden Fälle der Quantisierungsprozess auf die Spektralkoeffizienten angewandt (Schritt 69), wobei die Quantisierung auf den psychoakustischen Maskierungsschwellen basiert, die durch das psychoakustische Modell des Encoders erzeugt werden.
  • Durch Verwendung einer Encoderausführungsform der vorliegenden Erfindung mit offenem Kreislauf (z.B. wie in der veranschaulichenden Vorrichtung von 3 und in dem veranschaulichenden Verfahren aus 6 dargestellt ist) kann ein unkomplizierter temporaler Rauschformungseffekt für bestimmte herkömmliche Blocktransformationen, einschließlich der diskreten Fourier-Transformation (DFT) oder der diskreten Cosinus-Transformation (DCT), erzielt werden, die beide Durchschnittsfachleuten bestens bekannt sind. Wenn beispielsweise ein psychoakustischer Coder gemäß der vorliegenden Erfindung eine kritisch unterabgetastete Filterbank mit überlappenden Fenstern verwendet – z.B. eine herkömmliche modifizierte diskrete Cosinus-Transformation (MDCT) oder eine andere herkömmliche Filterbank, die auf Time Domain Aliasing Cancellation (TDAC) basiert – unterliegt die resultierende temporale Rauschformung den der Filterbank innewohnenden Time-Domain-Aliasing-Effekten. Beispielsweise findet im Fall einer MDCT eine Spiegelungsoperation (d.h. Aliasing-Operation) je Fensterhälfte statt und das Quantisierungsrauschen erscheint innerhalb der linken bzw. der rechten Hälfte des Fensters nach dem Decodieren gespiegelt (d.h. aliasiert). Da der endgültige Filterbankausgang durch Anwendung eines Synthesefensters auf den Ausgang von jeder inversen Transformation und Durchführen eines Overlap-Add dieser Datensegmente erhalten wird, werden die unerwünschten aliasierten Komponenten in Abhängigkeit von dem verwendeten Synthesefenster gedämpft. Demnach ist es vorteilhaft, ein Filterbankfenster zu wählen, welches nur eine geringe Überlappung zwischen aufeinanderfolgenden Blöcken aufweist, so dass der temporale Aliasing-Effekt minimiert wird. Eine geeignete Strategie im Encoder kann beispielsweise ein Fenster mit einem geringen Maß an Überlappung für kritische Signale mit einem stark transienten Charakter adaptiv auswählen, während ein breiterer Fenstertyp, der eine bessere Frequenzselektivität ermöglicht, für stationäre Signale verwendet wird. Die Implementationsdetails einer derartigen Strategie sind für Fachleute offensichtlich.
  • 2 zeigt einen herkömmlichen psychoakustischen Decoder zur Verwendung beim Decodieren monophoner Audiosignale entsprechend dem herkömmlichen psychoakustischen Encoder aus 1. Der Decoder aus 2 führt die folgenden Schritte aus:
    • • Der ankommende Bitstrom wird geparst, und die Indexwerte i(b, 0)...i(b, n-1) werden durch den Decoder/Multiplexer 22 extrahiert.
    • • Durch Verwendung inverser Quantisierer 24-0 bis 24-(n-1) (die jeweils inverse Quantisierungen IQ0...IQn-1 ausführen) werden die quantisierten Spektralwerte yq(b, 1)...yq(b, n-1) durch den PCM-Decoder 24 rekonstruiert.
    • • Die quantisierten Spektralwerte yq(b, 1)...yq(b, n-1) werden durch die Synthesefilterbank 26 in eine Zeitraumdarstellung zurück umgewandelt, was das rekonstruierten Ausgangssignal x'(k) ergibt.
  • Gemäß einer veranschaulichenden Ausführungsform der vorliegenden Erfindung kann die herkömmliche Decodiervorrichtung aus 2 vorteilhaft modifiziert werden, indem der PCM-Decoder 24 durch einen Decoder vom DPCM-Typ ersetzt wird, wobei die DPCM-Decodierung im Frequenzraum erfolgt. 5 zeigt eine derartige Ausführungsform der vorliegenden Erfindung. Insbesondere kann eine veranschaulichende Ausführungsform der vorliegenden Erfindung durch Ersetzen des PCM-Decoders 24 der herkömmlichen Decodiervorrichtung aus 2 durch das Modul 52, welches in 5 dargestellt ist, realisiert werden, was eine Decodiervorrichtung gemäß einer veranschaulichenden Ausführungsform der vorliegenden Erfindung ergibt. Konkret wird der Eingang zum DPCM-Decoder 55 durch die Reihe von Indexwerten i(b, 0)...i(b, n-1) angegeben, welche vor dem Decodieren durch den Drehschalter 53 in eine serielle Reihenfolge gebracht werden. Die resultierenden Spektralwerte yq(b, 0)...yq(b, n-1) werden nach dem DPCM-Decodieren durch den Drehschalter 56 in eine parallele Reihenfolge gebracht.
  • Der DPCM-Decoder 55 weist einen inversen Quantisierer 54, einen Prädiktor 57 und einen Addierer 58 auf. Der inverse Quantisierer 54 führt inverse Quantisierungen IQ0...IQn-1 jeweils für jeden der Indexwerte i(b, 0)...i(b, n-1) durch, welche diesem durch den Drehschalter 53 bereitgestellt werden. Festzuhalten ist, dass, wenn der veranschaulichende Encoder mit offenem Kreislauf aus 4 verwendet wurde, um das Audiosignal zu codieren, die Kombination aus Prädiktor 57 und Addierer 58 des veranschaulichenden Decoders aus 5 ein Rauschformungsfilter realisieren, welches die temporale Form des Quantisierungsrauschens vorteilhaft regelt. Auch hier können, wenngleich der veranschaulichende Decoder aus 5 die Verarbeitung der Indexwerte i(b, 0)...i(b, n-1) in der Reihenfolge ansteigender Frequenz vorteilhaft durchführt, andere veranschaulichende Ausführungsformen die Verarbeitung entweder in der Reihenfolge abnehmender Frequenz oder in anderen alternativen (z.B. nicht monotonen) Reihenfolgen durchführen, vorzugsweise auf eine Weise, die mit der Reihenfolge, welche durch einen entsprechenden Encoder verwendet wird, übereinstimmt. Darüber hinaus kann nur eine Untermenge der Indexwerte (und nicht alle "n" davon, wie in diesem Dokument dargestellt ist) dem DPCM-Decoder 55 bereitgestellt werden, und/oder mehrere verschiedene Prädiktorfilter können für verschiedene Abschnitte des Signalspektrums verwendet werden, wiederum vorzugsweise auf eine Weise, welche mit dem spezifischen Verfahren, das durch einen entsprechenden Encoder verwendet wird, übereinstimmt. Festzuhalten ist ebenso, dass in letzterem Fall beispielsweise, um eine geeignete Decodierung des ankommenden Bitstroms durchzuführen, ein Decoder gemäß der vorliegenden Erfindung vorteilhaft zusätzliche Nebeninformationen evaluieren kann, welche durch einen entsprechenden Encoder übertragen wurden. Auf diese Weise kann der Decoder DPCM-Decodieren in jedem angegebenen Zielfrequenzbereich mit einem gewünschten entsprechenden Decoderprädiktionsfilter anwenden.
  • 7 zeigt ein Flussdiagramm eines Verfahrens zum Decodieren von monophonen Audiosignalen gemäß einer veranschaulichenden Ausführungsform der vorliegenden Erfindung. Das veranschaulichende Beispiel, das in diesem Flussdiagramm dargestellt ist, implementiert bestimmte relevante Abschnitte eines psychoakustischen Audiodecoders mit einem einzigen Prädiktionsfilter. Konkret führt Schritt 71 eine herkömmliche Rekonstruktion der Spektralkoeffizientenwerte durch inverse Quantisierung durch. Dann überprüft die Entscheidung 72 die Bitstrominformationen, um festzustellen, ob die Verwendung von DPCM-Codierung angegeben wird ("Prädiktionsmerker" ist auf ein). Wenn dies der Fall ist, wird der erweiterte Decodierungsprozess, der in Schritt 73 und 74 dargestellt ist, angewandt. Konkret werden die übertragenen Nebeninformationen im Bitstrom decodiert, um den Zielfrequenzbereich der DPCM-Codierung, die Ordnung des Prädiktionsfilters und Informationen, welche dessen Filterkoeffizienten beschreiben, zu ermitteln (Schritt 73). Dann wird das inverse Prädiktionsfilter auf den Bereich von Spektralkoeffizienten angewandt, der dem angegebenen Zielfrequenzbereich entspricht (Schritt 74). Für alle weiteren Verarbeitungen wird der gegebene Bereich von Spektralkoeffizienten durch den Ausgang des Filterungsprozesses ersetzt. Schließlich (und unabhängig von der durch die oben beschriebene Entscheidung 72 vorgenommenen Bestimmung) wird in Schritt 75 eine herkömmliche Synthesefilterbank von den Spektralkoeffizienten abgearbeitet.
  • Wenngleich in diesem Dokument eine Reihe konkreter Ausführungsformen dieser Erfindung dargestellt und beschrieben wurden, versteht es sich, dass diese Ausführungsformen lediglich die zahlreichen möglichen konkreten Anordnungen veranschaulichen, die durch Anwendung der Grundgedanken der Erfindung konzipiert werden können. Beispielsweise werden, wenngleich die veranschaulichenden Ausführungsformen, die in diesem Dokument dargestellt und beschrieben wurden, auf das Codieren und Decodieren von monophonen Audiosignalen beschränkt wurden, alternative Ausführungsformen, welche zum Codieren und Decodieren der mehrkanaligen (z.B. stereophonen) Audiosignale verwendet werden können, für Durchschnittsfachleute auf der Basis der in diesem Dokument bereitgestellten Offenbarung klar ersichtlich sein.

Claims (24)

  1. Verfahren zum Codieren eines Audiosignals, um ein codiertes Signal zu erzeugen, wobei das Codieren auf einem wahrnehmungsbezogenen Modell basiert, wobei das Verfahren folgende Schritte aufweist: (a) Durchführen einer Spektralzerlegung des Audiosignals in mehrere Spektralkomponentensignale; (b) Erzeugen eines Prädiktionssignals, welches für eine Prädiktion von einem der Spektralkomponentensignale repräsentativ ist, wobei die Prädiktion auf einem oder mehreren anderen der Spektralkomponentensignale basiert, wobei die Prädiktion über den Frequenzraum durchgeführt wird; (c) vergleichen des Prädiktionssignals mit dem einen der Spektralkomponentensignale, um ein Prädiktionsfehlersignal zu erzeugen; (d) Codieren des einen der Spektralkomponentensignale, um ein codiertes Spektralkomponentensignal zu erzeugen, wobei das Codieren auf dem Prädiktionsfehlersignal basiert und ferner auf dem wahrnehmungsbezogenen Modell basiert; und (e) Erzeugen des codierten Signals auf der Basis des codierten Spektralkomponentensignals.
  2. Verfahren nach Anspruch 1, wobei das Audiosignal Sprache aufweist.
  3. Verfahren nach Anspruch 1, wobei das Audiosignal Musik aufweist.
  4. Verfahren nach Anspruch 1, wobei der Schritt des Codierens des einen der Spektralkomponentensignale das Quantisieren des Prädiktionsfehlersignals aufweist.
  5. Verfahren nach Anspruch 1, wobei die Erzeugung des Prädiktionssignals und das Codieren des einen der Spektralkomponentensignale in einem geschlossenen Kreislauf durchgeführt werden.
  6. Verfahren nach Anspruch 1, wobei die Erzeugung des Prädiktionssignals und das Codieren des einen der Spektralkomponentensignale in einem offenen Kreislauf durchgeführt werden.
  7. Verfahren zum Decodieren eines codierten Audiosignals, um ein wiederhergestelltes Audiosignal zu erzeugen, wobei das codierte Signal mehrere codierte Spektralkomponentensignale aufweist, welche basierend auf einem wahrnehmungsbezogenen Modell codiert wurden, wobei das Verfahren folgende Schritte aufweist: (a) Decodieren eines ersten der codierten Spektralkomponentensignale; (b) Erzeugen eines Prädiktionssignals, welches für eine Prädiktion eines zweiten der Spektralkomponentensignale repräsentativ ist, wobei die Prädiktion auf dem Decodieren des ersten der codierten Spektralkomponentensignale basiert, wobei die Prädiktion über den Frequenzraum durchgeführt wird; (c) Decodieren des zweiten der Spektralkomponentensignale basierend auf dem Prädiktionssignal; und (d) Erzeugen des wiederhergestellten Audiosignals auf der Basis des Decodierens des ersten der codierten Spektralkomponentensignale und des Decodierens des zweiten der codierten Spektralkomponentensignale.
  8. Verfahren nach Anspruch 7, wobei das wiederhergestellte Audiosignal Sprache aufweist.
  9. Verfahren nach Anspruch 7, wobei das wiederhergestellte Audiosignal Musik aufweist.
  10. Verfahren nach Anspruch 7, wobei der Schritt des Decodierens des ersten der Spektralkomponentensignale das Durchführen einer inversen Quantisierung davon aufweist.
  11. Codierer zum Erzeugen eines codierten Signals aus einem Audiosignal, wobei das Codieren auf einem wahrnehmungsbezogenen Modell basiert, wobei der Codierer aufweist: (a) Mittel zum Zerlegen des Audiosignals in mehrere Spektralkomponentensignale; (b) Mittel zum Erzeugen eines Prädiktionssignals, welches für eine Prädiktion von einem der Spektralkomponentensignale repräsentativ ist, wobei die Prädiktion auf einem oder mehreren anderen der Spektralkomponentensignale basiert, wobei die Prädiktion über den Frequenzraum durchgeführt wird; (c) Mittel zum Vergleichen des Prädiktionssignals mit dem einen der Spektralkomponentensignale, um ein Prädiktionsfehlersignal zu erzeugen; (d) einen Codierer zum Erzeugen eines codierten Spektralkomponentensignals, welches für das eine der Spektralkomponentensignale repräsentativ ist, wobei das codierte Spektralkomponentensignal auf der Basis des Prädiktionsfehlersignals und ferner auf der Basis des wahrnehmungsbezogenen Modells erzeugt wird; und (e) Mittel zum Erzeugen des codierten Signals auf der Basis des codierten Spektralkomponentensignals.
  12. Codierer nach Anspruch 11, wobei der Codierer einen Quantisierer aufweist, der auf das Prädiktionsfehlersignal angewandt wird.
  13. Codierer nach Anspruch 11, wobei die Mittel zum Erzeugen des Prädiktionssignals und der Codierer in einem geschlossenen Kreislauf angeordnet sind.
  14. Codierer nach Anspruch 11, wobei die Mittel zum Erzeugen des Prädiktionssignals und der Codierer in einem offenen Kreislauf angeordnet sind.
  15. Decodierer zum Erzeugen eines wiederhergestellten Audiosignals aus einem codierten Audiosignal, wobei das codierte Audiosignal mehrere codierte Spektralkomponentensignale aufweist, welche basierend auf einem wahrnehmungsbezogenen Modell codiert wurden, wobei der Decodierer aufweist: (a) Mittel zum Decodieren eines ersten der codierten Spektralkomponentensignale; (b) Mittel zum Erzeugen eines Prädiktionssignals, welches für eine Prädiktion eines zweiten der Spektralkomponentensignale repräsentativ ist, wobei die Prädiktion auf dem Decodieren des ersten der codierten Spektralkomponenten signale basiert, wobei die Prädiktion über den Frequenzraum durchgeführt wird; (c) Mittel zum Decodieren des zweiten der Spektralkomponentensignale basierend auf dem Prädiktionssignal; und (d) Mittel zum Erzeugen des wiederhergestellten Audiosignals auf der Basis des Decodierens des ersten der codierten Spektralkomponentensignale und des Decodierens des zweiten der codierten Spektralkomponentensignale.
  16. Decodierer nach Anspruch 15, wobei das Mittel zum Decodieren des ersten der Spektralkomponentensignale einen darauf angewandten inversen Quantisierer aufweist.
  17. Speichermedium mit einem darauf aufgezeichneten codierten Audiosignal, wobei das codierte Audiosignal aus einem Audiosignal erzeugt wurde, und zwar mittels eines Codierverfahrens, welches auf einem wahrnehmungsbezogenen Modell basiert und folgende Schritte aufweist: (a) Durchführen einer Spektralzerlegung des Audiosignals in mehrere Spektralkomponentensignale; (b) Erzeugen eines Prädiktionssignals, welches für eine Prädiktion von einem der Spektralkomponentensignale repräsentativ ist, wobei die Prädiktion auf einem oder mehreren anderen der Spektralkomponentensignale basiert, wobei die Prädiktion über den Frequenzraum durchgeführt wird; (c) Vergleichen des Prädiktionssignals mit dem einen der Spektralkomponentensignale, um ein Prädiktionsfehlersignal zu erzeugen; (d) Codieren des einen der Spektralkomponentensignale, um ein codiertes Spektralkomponentensignal zu erzeugen, wobei das Codieren auf dem Prädiktionsfehlersignal basiert und ferner auf dem wahrnehmungsbezogenen Modell basiert; und (e) Erzeugen des codierten Audiosignals auf der Basis des codierten Spektralkomponentensignals.
  18. Speichermedium nach Anspruch 17, wobei das codierte Audiosignal Sprache aufweist.
  19. Speichermedium nach Anspruch 17, wobei das codierte Audiosignal Musik aufweist.
  20. Speichermedium nach Anspruch 17, wobei der Schritt des Codierens des einen der Spektralkomponentensignale das Quantisieren des Prädiktionsfehlersignals aufweist.
  21. Speichermedium nach Anspruch 17, wobei die Erzeugung des Prädiktionssignals und das Codieren des einen der Spektralkomponentensignale in einem geschlossenen Kreislauf durchgeführt wurden.
  22. Speichermedium nach Anspruch 17, wobei die Erzeugung des Prädiktionssignals und das Codieren des einen der Spektralkomponentensignale in einem offenen Kreislauf durchgeführt wurden.
  23. Speichermedium nach Anspruch 17, wobei das Speichermedium eine Compact Disc aufweist.
  24. Speichermedium nach Anspruch 17, wobei das Speichermedium ein Digital Audio Tape aufweist.
DE69737489T 1996-01-16 1997-01-07 Formung des erkennbaren Rauschsignals in der Zeitdomäne mittels LPC-Voraussage im Frequenzraum Expired - Lifetime DE69737489T2 (de)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
US08/585,086 US5781888A (en) 1996-01-16 1996-01-16 Perceptual noise shaping in the time domain via LPC prediction in the frequency domain
US585086 1996-01-16

Publications (2)

Publication Number Publication Date
DE69737489D1 DE69737489D1 (de) 2007-05-03
DE69737489T2 true DE69737489T2 (de) 2007-11-29

Family

ID=24339994

Family Applications (1)

Application Number Title Priority Date Filing Date
DE69737489T Expired - Lifetime DE69737489T2 (de) 1996-01-16 1997-01-07 Formung des erkennbaren Rauschsignals in der Zeitdomäne mittels LPC-Voraussage im Frequenzraum

Country Status (5)

Country Link
US (1) US5781888A (de)
EP (1) EP0785631B1 (de)
JP (1) JP3592473B2 (de)
CA (1) CA2194419C (de)
DE (1) DE69737489T2 (de)

Families Citing this family (48)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2891193B2 (ja) * 1996-08-16 1999-05-17 日本電気株式会社 広帯域音声スペクトル係数量子化装置
DE19730130C2 (de) * 1997-07-14 2002-02-28 Fraunhofer Ges Forschung Verfahren zum Codieren eines Audiosignals
US5913191A (en) * 1997-10-17 1999-06-15 Dolby Laboratories Licensing Corporation Frame-based audio coding with additional filterbank to suppress aliasing artifacts at frame boundaries
KR100304092B1 (ko) * 1998-03-11 2001-09-26 마츠시타 덴끼 산교 가부시키가이샤 오디오 신호 부호화 장치, 오디오 신호 복호화 장치 및 오디오 신호 부호화/복호화 장치
DE19829284C2 (de) * 1998-05-15 2000-03-16 Fraunhofer Ges Forschung Verfahren und Vorrichtung zum Verarbeiten eines zeitlichen Stereosignals und Verfahren und Vorrichtung zum Decodieren eines unter Verwendung einer Prädiktion über der Frequenz codierten Audiobitstroms
SE9903553D0 (sv) 1999-01-27 1999-10-01 Lars Liljeryd Enhancing percepptual performance of SBR and related coding methods by adaptive noise addition (ANA) and noise substitution limiting (NSL)
US6430529B1 (en) * 1999-02-26 2002-08-06 Sony Corporation System and method for efficient time-domain aliasing cancellation
DE19921122C1 (de) * 1999-05-07 2001-01-25 Fraunhofer Ges Forschung Verfahren und Vorrichtung zum Verschleiern eines Fehlers in einem codierten Audiosignal und Verfahren und Vorrichtung zum Decodieren eines codierten Audiosignals
US6850559B1 (en) 1999-06-28 2005-02-01 At&T Corp. System and methods for transmitting data
US7792681B2 (en) * 1999-12-17 2010-09-07 Interval Licensing Llc Time-scale modification of data-compressed audio information
US6842735B1 (en) * 1999-12-17 2005-01-11 Interval Research Corporation Time-scale modification of data-compressed audio information
US6567781B1 (en) 1999-12-30 2003-05-20 Quikcat.Com, Inc. Method and apparatus for compressing audio data using a dynamical system having a multi-state dynamical rule set and associated transform basis function
JP2001231035A (ja) * 2000-02-14 2001-08-24 Nec Corp 復号同期制御装置、復号装置、及び復号同期制御方法
US7099830B1 (en) 2000-03-29 2006-08-29 At&T Corp. Effective deployment of temporal noise shaping (TNS) filters
US6735561B1 (en) * 2000-03-29 2004-05-11 At&T Corp. Effective deployment of temporal noise shaping (TNS) filters
SE0001926D0 (sv) 2000-05-23 2000-05-23 Lars Liljeryd Improved spectral translation/folding in the subband domain
US6647365B1 (en) * 2000-06-02 2003-11-11 Lucent Technologies Inc. Method and apparatus for detecting noise-like signal components
US6778953B1 (en) * 2000-06-02 2004-08-17 Agere Systems Inc. Method and apparatus for representing masked thresholds in a perceptual audio coder
CA2341834C (en) * 2001-03-21 2010-10-26 Unitron Industries Ltd. Apparatus and method for adaptive signal characterization and noise reduction in hearing aids and other audio devices
KR100378796B1 (ko) * 2001-04-03 2003-04-03 엘지전자 주식회사 디지탈 오디오 부호화기 및 복호화 방법
US7516066B2 (en) * 2002-07-16 2009-04-07 Koninklijke Philips Electronics N.V. Audio coding
US7149591B2 (en) * 2003-10-01 2006-12-12 Cleveland State University Multi-resolution controller
US7379875B2 (en) * 2003-10-24 2008-05-27 Microsoft Corporation Systems and methods for generating audio thumbnails
US7356748B2 (en) * 2003-12-19 2008-04-08 Telefonaktiebolaget Lm Ericsson (Publ) Partial spectral loss concealment in transform codecs
US6980933B2 (en) * 2004-01-27 2005-12-27 Dolby Laboratories Licensing Corporation Coding techniques using estimated spectral magnitude and phase derived from MDCT coefficients
US7653255B2 (en) 2004-06-02 2010-01-26 Adobe Systems Incorporated Image region of interest encoding
US7639886B1 (en) 2004-10-04 2009-12-29 Adobe Systems Incorporated Determining scalar quantizers for a signal based on a target distortion
US7627481B1 (en) * 2005-04-19 2009-12-01 Apple Inc. Adapting masking thresholds for encoding a low frequency transient signal in audio data
US7684981B2 (en) * 2005-07-15 2010-03-23 Microsoft Corporation Prediction of spectral coefficients in waveform coding and decoding
US8392176B2 (en) * 2006-04-10 2013-03-05 Qualcomm Incorporated Processing of excitation in audio coding and decoding
DE102006022346B4 (de) * 2006-05-12 2008-02-28 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Informationssignalcodierung
US8428957B2 (en) * 2007-08-24 2013-04-23 Qualcomm Incorporated Spectral noise shaping in audio coding based on spectral dynamics in frequency sub-bands
MX2011000375A (es) * 2008-07-11 2011-05-19 Fraunhofer Ges Forschung Codificador y decodificador de audio para codificar y decodificar tramas de una señal de audio muestreada.
PL2489041T3 (pl) * 2009-10-15 2020-11-02 Voiceage Corporation Jednoczesne kształtowanie szumu w dziedzinie czasu i w dziedzinie częstotliwości dla przekształcenia tdac
US8924222B2 (en) 2010-07-30 2014-12-30 Qualcomm Incorporated Systems, methods, apparatus, and computer-readable media for coding of harmonic signals
US9208792B2 (en) 2010-08-17 2015-12-08 Qualcomm Incorporated Systems, methods, apparatus, and computer-readable media for noise injection
FR2973552A1 (fr) * 2011-03-29 2012-10-05 France Telecom Traitement dans le domaine code d'un signal audio code par codage micda
EP2887350B1 (de) 2013-12-19 2016-10-05 Dolby Laboratories Licensing Corporation Adaptive Quantisierungsrauschen-Filterung von decodierten Audiodaten
WO2016142002A1 (en) * 2015-03-09 2016-09-15 Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung E.V. Audio encoder, audio decoder, method for encoding an audio signal and method for decoding an encoded audio signal
EP3483880A1 (de) 2017-11-10 2019-05-15 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Zeitliche rauschformung
WO2019091573A1 (en) 2017-11-10 2019-05-16 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Apparatus and method for encoding and decoding an audio signal using downsampling or interpolation of scale parameters
EP3483882A1 (de) 2017-11-10 2019-05-15 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Steuerung der bandbreite in codierern und/oder decodierern
EP3483886A1 (de) 2017-11-10 2019-05-15 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Auswahl einer grundfrequenz
EP3483879A1 (de) 2017-11-10 2019-05-15 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Analyse-/synthese-fensterfunktion für modulierte geläppte transformation
WO2019091576A1 (en) 2017-11-10 2019-05-16 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Audio encoders, audio decoders, methods and computer programs adapting an encoding and decoding of least significant bits
EP3483878A1 (de) 2017-11-10 2019-05-15 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Audiodecoder mit auswahlfunktion für unterschiedliche verlustmaskierungswerkzeuge
EP3483884A1 (de) 2017-11-10 2019-05-15 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Signalfiltrierung
EP3483883A1 (de) 2017-11-10 2019-05-15 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Audiokodierung und -dekodierung mit selektiver nachfilterung

Family Cites Families (6)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
SE457402B (sv) * 1987-02-20 1988-12-19 Harald Brusewitz Foerfarande och anordning foer kodning och avkodning av bildinformation
US4875095A (en) * 1987-06-30 1989-10-17 Kokusai Denshin Denwa Kabushiki Kaisha Noise-shaping predictive coding system
US4943855A (en) * 1988-07-22 1990-07-24 At&T Bell Laboratories Progressive sub-band image coding system
US5341457A (en) * 1988-12-30 1994-08-23 At&T Bell Laboratories Perceptual coding of audio signals
US5285498A (en) * 1992-03-02 1994-02-08 At&T Bell Laboratories Method and apparatus for coding audio signals based on perceptual model
DE4320990B4 (de) * 1993-06-05 2004-04-29 Robert Bosch Gmbh Verfahren zur Redundanzreduktion

Also Published As

Publication number Publication date
EP0785631B1 (de) 2007-03-21
US5781888A (en) 1998-07-14
CA2194419A1 (en) 1997-07-17
JP3592473B2 (ja) 2004-11-24
CA2194419C (en) 2001-05-01
JPH09204197A (ja) 1997-08-05
EP0785631A2 (de) 1997-07-23
EP0785631A3 (de) 2000-10-11
DE69737489D1 (de) 2007-05-03

Similar Documents

Publication Publication Date Title
DE69731677T2 (de) Verbessertes Kombinationsstereokodierverfahren mit zeitlicher Hüllkurvenformgebung
DE19747132C2 (de) Verfahren und Vorrichtungen zum Codieren von Audiosignalen sowie Verfahren und Vorrichtungen zum Decodieren eines Bitstroms
DE60110679T3 (de) Perzeptuelle Kodierung von Audiosignalen unter Verwendung von getrennter Reduzierung von Irrelevanz und Redundanz
EP0954909B1 (de) Verfahren zum codieren eines audiosignals
DE19811039B4 (de) Verfahren und Vorrichtungen zum Codieren und Decodieren von Audiosignalen
DE69926821T2 (de) Verfahren zur signalgesteuerten Schaltung zwischen verschiedenen Audiokodierungssystemen
DE60310716T2 (de) System für die audiokodierung mit füllung von spektralen lücken
DE60202881T2 (de) Wiederherstellung von hochfrequenzkomponenten
US5781888A (en) Perceptual noise shaping in the time domain via LPC prediction in the frequency domain
DE69233094T2 (de) Verfahren und Anordnung zur Datenkompression bei welchem Quantisierungsbits einem Block in einem gegenwärtigen Rahmen in Abhängigkeit eines Blocks in einem vergangenen Rahmen zugeteilt werden
DE69631728T2 (de) Verfahren und Vorrichtung zur Sprachkodierung
DE69816810T2 (de) Systeme und verfahren zur audio-kodierung
DE4320990B4 (de) Verfahren zur Redundanzreduktion
DE69429499T2 (de) Verfahren und vorrichtung zum kodieren oder dekodieren von signalen und aufzeichnungsmedium
DE19730129C2 (de) Verfahren zum Signalisieren einer Rauschsubstitution beim Codieren eines Audiosignals
DE60029990T2 (de) Glättung des verstärkungsfaktors in breitbandsprach- und audio-signal dekodierer
DE69619054T2 (de) Verfahren und Vorrichtung zur Sprachkodierung
EP1697930B1 (de) Vorrichtung und verfahren zum verarbeiten eines multikanalsignals
DE69132885T2 (de) CELP-Kodierung niedriger Verzögerung und 32 kbit/s für ein Breitband-Sprachsignal
DE69431025T2 (de) Signalkodier- oder -dekodiergerät und Aufzeichnungsmedium
DE10217297A1 (de) Vorrichtung und Verfahren zum Codieren eines zeitdiskreten Audiosignals und Vorrichtung und Verfahren zum Decodieren von codierten Audiodaten
DE10297751B4 (de) Audiocodierverfahren und Vorrichtung, die die Harmonischen-Extraktion verwenden
DE10236694A1 (de) Vorrichtung und Verfahren zum skalierbaren Codieren und Vorrichtung und Verfahren zum skalierbaren Decodieren
DE60303346T2 (de) Encodier- und/oder Decodierverfahren für digitale Audiosignale, basierend auf Zeit-Frequenzkorrelation und Vorrichtung hierzu
DE69713712T2 (de) Sprachkodierer mit Sinusanalyse und Grundfrequenzsteuerung

Legal Events

Date Code Title Description
8364 No opposition during term of opposition