KR101366124B1 - 오디오 인코딩/디코딩에서의 인지 가중 장치 - Google Patents

오디오 인코딩/디코딩에서의 인지 가중 장치 Download PDF

Info

Publication number
KR101366124B1
KR101366124B1 KR1020087021500A KR20087021500A KR101366124B1 KR 101366124 B1 KR101366124 B1 KR 101366124B1 KR 1020087021500 A KR1020087021500 A KR 1020087021500A KR 20087021500 A KR20087021500 A KR 20087021500A KR 101366124 B1 KR101366124 B1 KR 101366124B1
Authority
KR
South Korea
Prior art keywords
band
sub
cognitive
gain compensation
filter
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Expired - Fee Related
Application number
KR1020087021500A
Other languages
English (en)
Other versions
KR20080093450A (ko
Inventor
슈테판 라고트
로망 트릴링
Original Assignee
오렌지
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by 오렌지 filed Critical 오렌지
Publication of KR20080093450A publication Critical patent/KR20080093450A/ko
Application granted granted Critical
Publication of KR101366124B1 publication Critical patent/KR101366124B1/ko
Expired - Fee Related legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Images

Classifications

    • G—PHYSICS
    • G10—MUSICAL INSTRUMENTS; ACOUSTICS
    • G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/04—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
    • G—PHYSICS
    • G10—MUSICAL INSTRUMENTS; ACOUSTICS
    • G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/02—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders
    • G10L19/0204—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders using subband decomposition
    • G10L19/0208—Subband vocoders
    • G—PHYSICS
    • G10—MUSICAL INSTRUMENTS; ACOUSTICS
    • G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/04—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
    • G10L19/08—Determination or coding of the excitation function; Determination or coding of the long-term prediction parameters
    • G10L19/12—Determination or coding of the excitation function; Determination or coding of the long-term prediction parameters the excitation function being a code excitation, e.g. in code excited linear prediction [CELP] vocoders
    • G—PHYSICS
    • G10—MUSICAL INSTRUMENTS; ACOUSTICS
    • G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/04—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
    • G10L19/16—Vocoder architecture
    • G10L19/18—Vocoders using multiple modes
    • G10L19/24—Variable rate codecs, e.g. for generating different qualities using a scalable representation such as hierarchical encoding or layered encoding

Landscapes

  • Engineering & Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • Computational Linguistics (AREA)
  • Signal Processing (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Quality & Reliability (AREA)
  • Spectroscopy & Molecular Physics (AREA)
  • Compression, Expansion, Code Conversion, And Decoders (AREA)

Abstract

본 발명은 서로 인접한 제 1 서브-대역 및 제 2 서브-대역으로 나누어진 주파수 대역에 있는 계층적 오디오 인코더에 관한 것이고, 상기 인코더는: 상기 주파수 대역의 제 1 서브-대역에서 원래 신호를 인코딩하기 위한 코어 인코더(305); 원래 신호로부터 그리고 코어 인코더에 의해 공급된 신호로부터 잔여 신호 {e)를 계산하기 위한 계산단(306); 잔여 신호 {e)의 인지 가중을 위한 장치(307)를 포함한다. 본 발명에 따르면, 인지 가중 장치는 이득 보상을 갖는 인지 가중 필터를 포함하고, 인지 가중 필터는 이득 보상을 갖는 인지 가중 필터의 출력에서의 신호와 제 2 서브-대역에서의 신호 사이의 스펙트럼 연속성을 수행할 수 있다. 본 발명은 디지털 신호들, 예를 들어, 말, 음악 등의 오디오-주파수 신호들의 전송 및 저장에 적용될 수 있다.

Description

오디오 인코딩/디코딩에서의 인지 가중 장치{DEVICE FOR PERCEPTUAL WEIGHTING IN AUDIO ENCODING/DECODING}
본 발명은 정해진 주파수 대역에서 오디오 신호를 코딩/디코딩하기 위한 인지 가중 장치에 관한 것이다. 본 발명은 또한 본 발명의 코딩/디코딩 장치를 포함하는 계층적 오디오 코더 및 계층적 오디오 디코더에 관한 것이다.
본 발명은 오디오-주파수 음성(speech), 음악 등의 신호들과 같은 디지털 신호들을 전송하고 저장하는 것에 특히 유리한 응용예를 발견한다.
오디오-주파수 음성, 음악 등의 신호들을 디지털화하고 압축하기 위한 다양한 기술들이 존재한다. 가장 흔한 방법들은 이하와 같다.
○ PCM 및 ADPCM 코딩과 같은 "파형 코딩" 방법들;
○ 코드 여기 선형 예측(CELP; code excited linear prediction) 코딩과 같은 "파라미터 분석/합성 코딩" 방법들;
○ "서브-대역 또는 변환 인지 코딩" 방법들
오디오 주파수 신호들을 코딩하기 위한 이러한 종래 기술들은 1995년 Elsevier, 편집자 W.B. Kleijn과 K.K. Paliwal에 의한 "Speech Coding and Synthesis(음성 코딩 및 합성)"에 기술된다.
이러한 맥락에서, 본 발명은 보다 상세하게 CELP 코딩 및 변환 코딩 기술들을 통합한 예측 변환 코딩 방법(predictive transform coding method)들을 제안한다.
통상적인 음성 코딩에서, 코더는 고정된 비트 레이트로 비트 스트림을 생성한다. 이러한 고정된 비트 레이트 제한은 코더 및 디코더(통상적으로 결합하여 "코덱"으로서 언급됨)의 구현 및 사용을 단순화한다. 그러한 시스템들의 예는 초당 64 킬로비트(64 kbps)에서의 ITU-T G.711 코딩 시스템, 8 kbps에서의 UIT-T G.729 코딩 시스템 및 12.2 kbps에서의 GSM-EFR 코딩 시스템이다.
그러나 이동 전화, VoIP(voice over IP), 애드혹 네트워크상의 통신과 같은 소정의 응용예들에서, 가변 비트 레이트로 비트 스트림을 생성하는 것이 바람직하고, 여기서 비트 레이트들은 미리 정의된 세트로부터 가져온다. 따라서, 고정된 비트 레이트 코딩보다 더 유연성 있는 다수의 다중 비트 레이트 코딩 기술들이 구별될 수 있다.
○ AMR-NB, AMR-WB, SMV, 및 VMR-WB 시스템들에 사용되는 것으로서, 소스 및/또는 채널 제어 멀티모드 코딩;
○ "스케일링 가능한" 것으로도 알려진, 계층적 코딩, 여기서, 계층적 코딩은 코어 비트 레이트 및 하나 이상의 향상 계층들을 포함하는 관점에서 계층적인 비트 스트림을 생성한다. 48 kbps, 56 kbps, 및 64 kbps에서의 G.722 시스템은 비트 레이트 스케일링 가능한 코딩의 단순한 예이다. MPEG-4 CELP 코덱은 비트 레이트 및 대역폭에서 스케일링가능하고, 그러한 코더들의 다른 예들은 B. Kovesi, D. Massaloux, A. Sollaud에 의한 논문, "A Scalable Speech and Audio Coding Scheme with Continuous Bitrate Flexibility(연속적인 비트 레이트 유연성을 가진 스케일링 가능한 음성 및 오디오 코딩 방법)", ICASSP 2004에서 발견될 수 있다.
○ 다중 표현 코딩(multiple description coding)
본 발명은 보다 상세하게 계층적 코딩에 관한 것이다.
계층적, 또는 "스케일링 가능한" 오디오 코딩의 기본 개념은 예를 들어, Y. Hiwasaki, T. Mori, H. Ohmuro, J. Ikedo, D. Tokumoto, 및 A. Kataoka에 의한 2004년 3월 논문, "Scalable Speech Coding Technology for High-Quality Ubiquitous Communications(고 품질 유비쿼터스 통신을 위한 스케일링 가능한 음성 코딩 기술)", NTT Technical Review에 기술된다.
이러한 타입의 코딩에서, 비트 스트림은 기본 계층 또는 코어 계층 및 하나 이상의 향상 계층을 포함한다. 기본 계층은 고정된 낮은 비트 레이트로 코어 "코덱"으로 알려진 코덱에 의해 생성되고, 그것은 코딩 품질의 소정의 최소 레벨을 보장하고 허용가능한 품질 레벨을 유지하기 위하여 디코더에 의해 수신되어야 한다.
향상 계층들은 품질을 향상시키기 위해 사용되고, 디코더에 의해 모두 수신되지 않을 수도 있다. 계층적 코딩의 주요 이점은 비트 레이트가 단순히 비트 스트림을 절단함으로써 적응될 수 있다는 것이다. 계층들의 가능한 개수, 즉, 비트 스트림 절단의 가능한 개수는 코딩 입도(coding granularity)를 정의하는데, 큰 입도 코딩에서는 비트 스트림이 소수 개의 계층들(2 내지 4개 계층들 정도)을 포함하는 반면, 미세한 입도 코딩은 예를 들어, 1kbps 정도의 증분을 제공한다.
본 발명은 보다 상세하게 전화 대역 및 하나 이상의 광 대역 향상 계층들에서 CELP 타입 코어 코더를 사용하는 비트 레이트 및 대역폭 스케일링 가능한 코딩 기술들에 관한 것이다. 그러한 시스템들의 예는 8 kbps, 14.2 kbps 및 24 kbps의 큰 입도를 가진 1999년 107회 컨벤션 AES, H. Taddei 등에 의한 논문, "A Scalable Three Bitrate (8, 14.2, and 24 kbps) Audio Coder(스케일링 가능한 3개의 비트레이트(8, 14.2 및 24 kbps) 오디오 코더)"에 제공되고, B. Kovesi 등에 의한 전술한 논문은 6.4 kbps 내지 32 kbps의 세밀한 입도에 관한 것이다.
2004년, ITU-T는 표준화된 계층적 코어 코더 프로젝트를 착수하였다. 이러한 G.729EV 코더(EV는 "임베디드 가변 비트레이트(embedded variable bitrate)"를 나타냄)는 공지된 G.729 코더에 대한 부가물이다. G.729EV 표준의 목적은 대화 서비스를 위하여 8 kbps 내지 32 kbps의 비트 레이트로 협대역(300 헤르츠(Hz) 내지 3400 Hz)으로부터 광대역(50 Hz 내지 7000 Hz)으로 확장된 대역을 가진 신호를 생성하는 G.729 코어 계층적 코더를 달성하는 것이다. 이러한 코더는 본질적으로 G.729 권고안과 상호작용할 수 있고, 이것은 기존의 VoIP 장비와의 호환성을 보장한다.
도 1에 도시된 8 kbps 내지 32 kbps 계층적 오디오 코더는 상기 프로젝트에 응하여 제안되었고, 2005년 7월 26일-8월 5일, 제네바, ITU-T 다큐먼트 COM 16, D135 (WP 3/16), Q.10/16, 연구 기간 2005-2008 "France Telecom G.729EV Candidate: High level description and complexity evaluation(프랑스 텔레콤 G.729EV 후보: 하이 레벨 표현 및 복잡도 평가)"에 기술된다. 이러한 코더는 캐스 케이드 CELP 코딩, 전체 대역(full band) 선형 예측 코딩(LPC)에 의한 대역 확장 및 예측 변환 코딩을 포함하는 3-계층 코딩을 달성한다. TDAC(시간 도메인 에일리어싱 소거) 코딩이 변형된 이산 코사인 변환(MDCT: modified discrete cosine transform)의 적용 다음에 적용된다. 예측 변환 코딩 계층은 전체 대역 인지 가중 필터
Figure 112008062442202-pct00001
를 사용한다.
인지 가중된 필터링에 의한 코딩 잡음의 성형(shaping) 개념은 W.B. Kleijn 등에 의한 전술한 공개 문헌에서 설명된다. 실질적으로, 인지 가중 필터링은 잡음 강도가 높은 주파수에서 신호를 감쇠시킴으로써 코딩 잡음을 성형하고, 상기 주파수에서 잡음은 보다 쉽게 마스킹될 수 있다.
협대역 CELP 코딩에 가장 폭넓게 사용되는 인지 가중 필터들은 형태
Figure 112011105409904-pct00002
로 이루어지고, 여기서,
Figure 112011105409904-pct00003
이고,
Figure 112011105409904-pct00004
는 5 밀리초(ms) 내지 30 ms의 길이를 가진 신호 세그먼트의 LPC 스펙트럼을 나타낸다. 그리하여, CELP 코딩에서 합성에 의한 분석은 이러한 타입의 필터에 의해 인지적으로 가중된 신호 도메인에서 2차 에러(quadratic error)를 최소화하는 것에 이른다.
그러나 G.729EV 표준화의 맥락에서 제안된 바와 같은 이러한 기술은 전체 대역 인지 가중 필터를 사용하는 것의 결점을 갖는다. 연관된 필터링은 계산 시간의 관점에서 상대적으로 복잡하다.
그리하여 본 발명의 대상에 의해 해결되어야 할 기술적 문제점은 정해진 주파수 대역의 전체에 걸쳐, 특히 계층적 오디오 코더의 광대역 0 내지 8000 Hz에 걸쳐, 전체 대역 인지 가중 필터링을 제공하는 정해진 주파수 대역 내 오디오 신호를 코딩/디코딩하기 위한 인지 가중 장치를 제안하는 것이고, 이러한 동작이 자원의 관점에서 비용이 많이 드는 긴 계산을 유도하지 않아야 한다.
전술한 기술적 문제점에 대한 본 발명에 따른 해결책은 상기 코딩/디코딩이 상기 정해진 주파수 대역 내 복수의 인접한 서브-대역들에서 달성되고, 상기 장치는 적어도 하나의 서브-대역에서 이득 보상을 갖는 인지 가중 필터를 포함하고, 상기 이득 보상을 갖는 인지 가중 필터는 자신의 출력 신호와 상기 서브-대역에 인접한 서브-대역들의 신호들 간의 스펙트럼 연속성을 구현하도록 적응되는 것이다.
그리하여 본 발명의 인지 가중 장치는 전체 코딩/디코딩 대역에 대해서가 아니라 하나 이상의 서브-대역들에 대하여 요구된 필터링을 달성하고, 이것은 계산들의 복잡도를 제한한다. 게다가, 인지 가중 필터의 이득들 사이에서 하나의 서브-대역과 다른 서브-대역과의 임의의 격차(disparity)는 이득 보상에 의해 제거되고, 그것은 전체 주파수 대역에 대해 스펙트럼 연속성을 보장한다. 따라서 그것을 구성하는 서브-대역들이 이러한 관점에서 별개로 프로세싱될지라도 본 발명은 인지 가중 필터링 이후에 동질 대역(homogeneous band)을 생성한다.
이것의 특히 중요한 이점은 전체-대역 변환 코딩이 서브-대역들에 대해 적용될 수 있다는 것인데, 상기 서브-대역들은 그렇지 않으면 별개로 필터링되기 때문에 균일하지 않을 것이다.
물론, 각각의 서브-대역은 인지 가중을 갖거나 갖지 않은 상태로 필터링될 수 있다. 그리하여 스펙트럼 연속성은 필터링된 서브-대역과 또 다른 필터링되지 않은 서브-대역 사이에, 또는 2개의 필터링된 서브-대역들 사이에 제공될 수 있다.
일 실시예에서, 이득 보상을 갖는 상기 인지 가중 필터는 인지 가중 필터 및 이득 보상 모듈을 포함한다.
특정 실시예에서, 이득 보상 모듈은 상기 인지 가중 필터의 출력에 배치된다.
또 다른 실시예에서, 이득 보상 모듈은 상기 인지 가중 필터의 입력에 배치된다.
또 다른 실시예에서, 이득 보상을 갖는 상기 인지 가중 필터는 이득 보상을 통합한 인지 가중 필터를 포함한다.
그때, 제 1 서브-대역에 있는 상기 인지 가중 필터는 형태
Figure 112011105409904-pct00005
로 이루어질 수 있고, 여기서,
Figure 112011105409904-pct00006
는 선형 예측 필터를 나타낸다. 이러한 경우, 본 발명은 상기 이득 보상이 이하에서 정의된 요소 fac에 의한 곱셈을 수행하여야 함을 나타내고, 여기서,
Figure 112011105409904-pct00007
는 선형 예측 필터
Figure 112011105409904-pct00008
의 계수들이다.
Figure 112008062442202-pct00009
차수 p 및 계수들
Figure 112008062442202-pct00010
를 가진 선형 예측 필터
Figure 112008062442202-pct00011
는 이하와 같이 정의된다.
Figure 112008062442202-pct00012
본 발명은 또한 인접한 제 1 서브-대역 및 제 2 서브-대역으로 나누어진 주파수 대역에서 사용하기 위한 계층적 오디오 코더에 관한 것이고, 상기 코더는 이하를 포함한다:
○ 상기 주파수 대역의 제 1 서브-대역의 원래 신호를 코딩하기 위한 코어 코더;
○ 상기 원래 신호 및 상기 코어 코더에서 나온 신호로부터 잔여 신호를 계산하기 위한 계산 단;
○ 상기 잔여 신호를 인지 가중하기 위한 장치;
상기 인지 가중 장치는 이득 보상을 가진 인지 가중 필터를 포함하고, 상기 이득 보상을 가진 인지 가중 필터는 자신의 출력 신호와 제 2 서브-대역 사이에서 스펙트럼 연속성을 구현하도록 적응된다는 것이 주목할 만하다.
이러한 실시예에서, 단지 제 1 서브-대역만이 인지 가중 필터링되고, 제 2 서브-대역은 필터링되지 않는다.
더욱이, 만약 상기 이득 보상된 인지 가중 필터가 제 1 서브-대역의 인지 가중 필터를 포함한다면, 본 발명은 제 1 서브-대역의 상기 인지 가중 필터가 형태
Figure 112008062442202-pct00013
로 이루어짐을 제시하고, 여기서,
Figure 112008062442202-pct00014
는 선형 예측 필터를 나타낸다. 이러한 상황에서, 제 1 서브-대역에서의 이득 보상은 이하와 같은 요소 fac1에 의한 곱셈을 수행한다.
Figure 112008062442202-pct00015
여기서,
Figure 112008062442202-pct00016
는 선형 예측 필터
Figure 112008062442202-pct00017
의 계수들이다.
유리하게, 제 1 서브-대역에서의 인지 가중 장치로부터 나온 신호 및 제 2 서브-대역에서의 원래 신호가 각각의 변환 분석 모듈들에 인가되고, 상기 변환 분석 모듈들은 상기 주파수 대역의 변환 코더에 연결된다.
본 발명의 계층적 오디오 코더의 변형 예에서, 상기 코더는 또한 제 2 서브-대역의 원래 신호를 인지 가중하기 위한 인지 가중 장치를 포함하고, 상기 인지 가중 장치는 이득 보상을 가진 인지 가중 필터의 출력 신호와 제 1 서브-대역에서의 인지 가중 장치의 출력 신호 사이에서 스펙트럼 연속성을 실현하도록 적응된 이득 보상을 가진 인지 가중 필터를 포함한다.
그리하여 이것은 인지 가중 필터링이 2개의 서브-대역들에서 별개로 수행되는 코더이다.
만약 이득 보상을 가진 상기 인지 가중 필터가 제 2 대역의 인지 가중 필터를 포함한다면, 제 2 서브-대역의 상기 인지 가중 필터는 형태
Figure 112008062442202-pct00018
로 이루어지고, 여기서,
Figure 112008062442202-pct00019
는 선형 예측 필터를 나타낸다. 이러한 예에서, 제 2 서브-대역의 상기 이득 보상은 이하와 같은 요소 fac2에 의한 곱셈을 수행한다.
Figure 112008062442202-pct00020
여기서,
Figure 112008065386819-pct00021
는 상기 선형 예측 필터의 계수들이다.
유리하게, 상기 선형 예측 필터의 계수들은 대역 확장모듈에 의해 공급된다.
제 1 서브-대역의 인지 가중 장치로부터 나온 신호 및 제 2 서브-대역의 인지 가중 장치로부터 나온 신호는 유리하게 각각의 변환 분석 모듈들에 인가되고, 상기 변환 분석 모듈들은 상기 주파수 대역에서의 변환 코더에 연결된다.
특정 실시예에서, 코어 코더는 선형 예측 기반 코더, 예를 들어, CELP 코더이다.
본 발명은 부가하여 인접한 제 1 및 제 2 서브-대역들로 나누어진 주파수 대역에서 사용하기 위한 계층적 오디오 디코더에 관한 것이고, 상기 디코더는 이하를 포함한다:
○ 본 발명에 따른 코더에 의해 코딩된 수신 신호를 상기 주파수 대역의 제 1 서브-대역에서 디코딩하도록 적응된 코어 디코더;
○ 상기 코더의 인지 가중 장치에 의해 제 1 서브-대역에서 가중된 잔여 신호를 나타내는 신호를 역으로 인지 가중하기 위한 역 인지 가중 장치(inverse perceptual weighting device);
상기 역 인지 가중 장치는 제 1 서브-대역의 코더의 이득 보상을 가진 인지 가중된 필터의 역인 이득 보상을 가진 인지 가중 필터를 포함한다는 점에서 주목할 만하다.
대안적으로, 본 발명은 상기 디코더가 또한 제 2 서브-대역에서 디코딩된 신호의 역 인지 가중 장치를 포함하고, 상기 역 인지 가중 장치가 제 2 서브-대역의 코더의 이득 보상을 가진 인지 가중된 필터의 역인 이득 보상을 갖는 인지 가중 필터를 포함한다는 것을 제시한다.
후자의 경우, 만약 이득 보상을 가진 상기 인지 가중 필터가 제 2 대역의 인지 가중된 필터를 포함한다면, 상기 이득 보상을 갖는 역 인지 가중 필터는 제 2 서브-대역의 역 인지 가중 필터를 포함한다. 특히, 제 2 서브-대역의 상기 역 인지 가중 필터는 형태
Figure 112008062442202-pct00022
로 이루어지고, 선형 예측 필터
Figure 112008062442202-pct00023
의 계수들은 대역 확장 모듈에 의해 공급된다.
본 발명은 부가하여 정해진 주파수 대역에서 오디오 신호를 코딩하는 인지 가중 방법에 관한 것이고, 상기 코딩은 상기 주파수 대역 내 복수의 인접한 서브-대역들에서 수행되며, 상기 방법은 적어도 하나의 서브-대역에서, 이득 보상을 가진 인지 가중 단계로부터 나온 신호와 상기 서브-대역에 인접한 서브-대역들의 신호들 간에 스펙트럼 연속성을 구현하도록 적응된 이득 보상을 가진 인지 가중 단계를 포함한다.
마지막으로, 본 발명은 신호를 코딩하기 위해 사용된 인지 가중 방법에 따라 정해진 주파수 대역에서 코딩된 오디오 신호를 디코딩하기 위한 인지 가중 방법에 관한 것으로서, 상기 방법은 상기 서브-대역에서, 이득 보상을 가진 상기 인지 가중 단계의 역인 이득 보상을 가진 인지 가중 단계를 포함한다.
비제한적인 예의 방식으로 제공된 첨부 도면을 참조한 이하의 설명은 본 발명이 어떻게 구성되는지, 그리고 실제로 어떻게 줄어들 수 있는지 명확히 설명한다.
도 1은 변환 코딩에 앞서 전체 대역 인지 가중 필터링을 수행하는 선행 기술 에 따른 계층적 오디오 코더의 다이어그램이다.
도 2는 본 발명의 계층적 오디오 코더의 하이-레벨 다이어그램이다.
도 3은 도 2의 코더의 인지 가중 장치의 다이어그램이다.
도 4는 제 1 서브-대역에서 본 발명에 따라 필터링되고 이득 보상된 신호의 크기 및 제 2 서브-대역에서 필터링되지 않은 신호의 크기를 보여주는 스펙트럼을 나타낸다.
도 5는 본 발명의 계층적 오디오 디코더의 하이-레벨 다이어그램이다.
도 6은 도 2의 계층적 오디오 코더의 변형 예의 다이어그램이다.
도 7은 도 5의 계층적 오디오 디코더의 변형 예의 다이어그램이다.
도 8은 제 1 서브-대역에서 본 발명에 따라 필터링되고 이득 보상된 신호의 크기 및 제 2 서브-대역에서 본 발명에 따라 필터링되고 이퀄라이징된 신호의 크기를 보여주는 스펙트럼을 나타낸다.
도 2는 8 kbps 내지 32 kbps의 비트 레이트에 대한 서브-대역 계층적 오디오 코더를 보여준다. 상기 도면은 대응하는 코딩 방법의 여러 단계들을 보여준다.
50 Hz 내지 7000 Hz의 "넓은" 주파수 대역에 있고 16 kHz로 샘플링된 입력 신호는 먼저 직각 위상 거울 필터(QMF: quadrature mirror filter)에 의해 2개의 인접한 서브-대역들로 나누어진다. 저 대역으로도 알려진 0 내지 4000 Hz의 제 1 서브-대역은 저역(L) 필터링(300) 및 데시메이션(decimation)(301)에 의해 획득되고, 고 대역으로도 알려진 4000 Hz 내지 8000 Hz의 제 2 서브-대역은 고역(H) 필터 링(302) 및 데시메이션(303)에 의해 획득된다. 바람직한 실시예에서, L 필터(300) 및 H 필터(302)는 길이 64로 이루어지고, J. Johnston에 의한 논문, "A filter family designed for use in quadrature mirror filter banks(직각 위상 거울 필터 뱅크들에 사용하기 위해 설계된 필터 계열", ICASSP, vol. 5, pp.291-294, 1980년에 기술된다.
제 1 서브-대역은 협대역 CELP 코어 코더(305)에 의한 코딩 이전에 50 Hz 아래의 성분들을 제거하는 고역 필터(304)에 의해 사전-프로세싱된다. 고역 필터링은 광대역이 50 Hz 내지 7000 Hz 범위를 커버하는 것으로서 정의된다는 사실을 고려한다. 이러한 실시예에서, 협대역 CELP 코딩은 도 1에 도시된 것에 대응하고, 어떠한 사전-프로세싱 필터도 구비하지 않은, 변형된 G.729 코딩 제 1 단(ITU-T 권고안 G.729, 1996년 3월 "Coding of Speech at 8 kbps using Conjugate Structure Algebraic Code Excited Linear Prediction(CS-ACELP)(켤레 구조 대수 코드 여기 선형 예측을 사용하는 8 kbps에서의 음성 코딩)"), 및 부가적인 고정된 사전으로 구성된 제 2 단을 사용하는 캐스케이드 CELP 코딩으로 구성된다. CELP 코딩에 의해 야기된 에러에 링크된 잔여 신호 e는 상기 단(306)에 의해 계산되고, 인지 가중 필터를 포함하는 장치(307)에 의해 인지 가중되어, 주파수 도메인의 이산 스펙트럼 Xlo를 얻기 위해 변형된 이산 코사인 변환(MDCT)(308)을 사용하여 분석되는 시간-도메인 신호 xlo를 획득한다.
도 3은 인지 가중 장치(307)를 보여주고, 여기서,
Figure 112008062442202-pct00024
는 각각
Figure 112008062442202-pct00025
및
Figure 112008062442202-pct00026
필터링 단들(501 및 502)을 포함하는 인지 가중 필터
Figure 112008062442202-pct00027
를 포함한다. 도 2에 도시된 바와 같이, 선형 예측 필터
Figure 112008062442202-pct00028
는 협대역 CELP 코딩에 기초한다. 인지 가중 장치(307)는 또한 필터(501, 502)로부터 나온 인지 가중 신호를 이하와 같이 정의된 요소 fac1에 의해 곱하기 위한 이득 보상 모듈(503)을 포함한다.
Figure 112008062442202-pct00029
여기서,
Figure 112008062442202-pct00030
는 필터
Figure 112008062442202-pct00031
의 계수들이다.
Figure 112008062442202-pct00032
바람직한 실시예에서, 계수들
Figure 112008062442202-pct00033
은 매 5 ms 서브-프레임마다 업데이트되고,
Figure 112008062442202-pct00034
= 0.96이고, = 0.6이다.
요소 fac1의 동등한 정의는 나이퀴스트(Nyquist) 주파수(4 kHz)에서 필터
Figure 112008062442202-pct00036
의 이득의 역수에 대응하고, 즉, z = -1에 대하여:
Figure 112008062442202-pct00037
이다.
제 2 서브-대역, 또는 고 대역에서의 스펙트럼 에일리어싱 소거(309)는 우선 데시메이션(303)과 결합하여 고역 필터링(302)에 의해 야기된 에일리어싱을 보상하도록 수행된다. 이러한 고 대역은 그 다음 7000 내지 8000 Hz 사이의 원래 신호의 성분들을 제거하는 저역 통과 필터(310)에 의해 사전-프로세싱된다. MDCT 변환(311)은 그 다음 주파수 도메인의 이산 스펙트럼(Xhi)을 얻기 위하여 시간 도메인의 결과 신호(xhi)에 적용된다. 그 다음 대역 확장(312)은 xhi 및 Xhi에 기초한다.
신호들(xlo 및 xhi)은 N개의 샘플들의 프레임들로 나누어지고, 길이 L = 2N의 MDCT 변환은 현재 및 미래 프레임들을 분석한다. 바람직한 실시예에서, xlo 및 xhi는 8 kHz에서 샘플링되고 N=160 (20 ms)인 협대역 신호들이다. 따라서 MDCT 변환들(Xlo 및 Xhi)은 N = 160개의 계수들을 포함하고, 각각의 계수는 4000/160 = 25 Hz의 주파수 대역을 나타낸다. 바람직한 실시예에서, MDCT 변환은 1991년 P. Duhamel, Y. Mahieux, J.P. Petit,에 의한 "A fast algorithm for the implementation of filter banks based on time domain aliasing cancellation(시간 도메인 에일리어싱 소거에 기초한 필터 뱅크들의 구현을 위한 고속 알고리즘)", ICSSP, vol. 3, pp. 2209-2212에 의해 기술된 알고리즘에 의해 구현된다.
저 대역 및 고 대역 MDCT 스펙트럼(Xlo 및 Xhi)은 변환 코딩 모듈(313)에서 코딩된다.
코딩 모듈들(305, 312 및 313)에 의해 생성된 비트 스트림들은 멀티플렉서(314)에서 멀티플렉싱되고 계층적 비트 스트림들로 구조화된다.
코딩은 20 ms 프레임들(즉, 320 샘플들의 블록들)에 의해 달성된다. 코딩 비트 레이트는 8 kbps, 12 kbps, 14 kbps 내지 32 kbps이다.
요소 fac1에 의한 이득 보상을 가진 인지 가중 단계의 이점은 도 4를 참조하여 이하에서 설명된다.
상기 도면은 총 주파수 대역을 제 1 서브-대역, 즉, 0 내지 4 kHz의 저 대역과 제 2 서브-대역, 즉, 4 내지 8 kHz의 고 대역으로 나누어진 것을 보여준다. 바람직한 실시예에서, MDCT 코더(313)는 이러한 2개의 서브-대역들에 적용되고, 이하를 갖는다:
○ 저 대역에서 MDCT 변환의 적용에 앞서 인지 가중 필터링
Figure 112008062442202-pct00038
및 이득 보상
○ 인지 가중 필터링 없이 고 대역에서 직접적인 MDCT 변환의 적용
서브-대역들에서의 이러한 2가지 동작은 각각 저 대역의
Figure 112008062442202-pct00039
의 크기 응답 및 고 대역의 0 dB에서의 평탄 응 답(flat response)에 의해 도 4에 다이어그램으로 도시된다. 후자인 평탄 응답은 MDCT 변환을 적용하기 이전에 고 대역에서 어떠한 프로세싱도 적용되지 않음을 보여준다. 요소 fac1에 의한 이득 보상은 4 kHz에서의 연속성을 보장하기 위하여
Figure 112008062442202-pct00040
의 크기 응답을 이동시킨다. 이러한 연속성은 매우 중요한데, 그 이유는 그것이 이어서 2개의 이산 스펙트럼(Xlo 및 Xhi)을 단일 벡터 X로 연합 동차 코딩(conjoint homogeneous coding)하는 것을 가능케 하고, 단일 벡터는 따라서 전체-대역 이산 스펙트럼을 나타낸다.
저 대역과 고 대역 사이의 연속성을 정의하기 위하여 본 명세서에서 사용되는 값 0 dB는 단지 예시적이라는 것을 아는 것이 중요하다.
도 2, 도 3 및 도 4를 참조하여 기술되었던 코더와 연관된 계층적 오디오 디코더가 도 5에 도시되고, 도 5는 상기 코더에 의해 코딩된 신호를 디코딩하는 단계들을 보여준다.
각각의 20 ms 프레임을 정의하는 비트들은 디멀티플렉서(700)에서 디멀티플렉싱된다. 8 kbps 내지 32 kbps에서 디코딩하는 것이 이하에서 기술되지만, 실제로는 비트 스트림은 8 kbps, 12 kbps, 14 kbps 또는 14 kbps와 32 kbps 사이로 절단될 수 있다.
8 kbps 및 12 kbps에서의 계층들의 비트 스트림은 0 내지 4000 Hz의 제 1 서브-대역(협대역)에서 제 1 합성을 생성하기 위하여 CELP 디코더(701)에 의해 사용된다. 14 kbps에서의 계층과 연관된 비트 스트림의 부분은 대역 확장 모듈(702)에 의해 디코딩되고, MDCT 변환(703)이 스펙트럼
Figure 112008062442202-pct00041
을 생성하기 위하여 4000 Hz 내지 7000 Hz의 제 2 서브-대역(고 대역)에서 획득된 신호에 적용된다. MDCT 디코딩(704)은 14 kbps 내지 32 kbps의 비트 레이트들과 연관된 비트 스트림으로부터 저 대역에서의 재구성된 스펙트럼
Figure 112008062442202-pct00042
및 고 대역에서의 재구성된 스펙트럼
Figure 112008062442202-pct00043
를 생성한다. 이러한 2개의 스펙트럼은 블록들(705 및 706)에서 역 MDCT 변환을 적용함으로써 시간-도메인 신호들
Figure 112008062442202-pct00044
및
Figure 112008062442202-pct00045
로 변환된다. 신호
Figure 112008062442202-pct00046
는 역 인지 가중 장치(707)에 의해 필터링한 이후에 합산기(708)에 의해 CELP 합성에 부가된다. 그 다음 결과가 709에서 후처리-필터링된다.
16 kHz에서 샘플링된 광 대역에서의 출력 신호는 오버샘플링을 적용하는 합성 QMF 필터 뱅크(710 및 712), 저역 통과 필터링(711), 고역 통과 필터링(713), 및 합산(714)을 사용하여 획득된다.
이득 보상을 갖는 인지 디코딩의 단계는 역 인지 가중 필터
Figure 112008062442202-pct00047
및 요소 1/fac1와 상기 역 인지 가중 필터로부터 나온 신호를 곱하기 위한 이득 보상 모듈을 포함하는 역 인지 가중 장치(707)
Figure 112008062442202-pct00048
에 의해 달성된다.
Figure 112008062442202-pct00049
여기서,
Figure 112008062442202-pct00050
는 협대역의 CELP 코딩으로부터 야기되는 필터
Figure 112008062442202-pct00051
의 계수들이다. 상기 코더에서, 계수들
Figure 112008062442202-pct00052
은 각각의 5 ms 서브-프레임마다 일정하게 유지된다.
도 6은 코더의 도 2 실시예의 변형 예를 보여준다.
상기 도면은 분석 필터 뱅크(900 내지 903), 블록들(904 내지 908)에 의한 저 대역의 프로세싱, 블록들(909 내지 910)에 의한 고 대역의 사전-프로세싱, MDCT 코더(913), 및 멀티플렉서(915)를 보여준다.
이러한 변형 예와 도 2 실시예 사이의 주된 차이점은 선형 예측(LPC) 분석과 제 2 서브-대역(고 대역)에서의 양자화의 통합이다. 고 대역에서 양자화된 LPC 계수들,
Figure 112011105409904-pct00053
은 대역 확장 모듈(911)에 의해 공급된다. LPC-기반 대역 확장은 본 발명의 범위를 벗어나므로 본 명세서에서 상세히 기술되지 않는다. 이러한 LPC 계수들은 MDCT 변환(913)을 적용하기 이전에 상기 장치(912)에서 이득 보상
Figure 112011105409904-pct00054
을 갖는 인지 가중 필터링의 적용을 가능하게 한다. 따라서 이러한 변형 예는 저 대역의 차이 신호 e 및 고 대역의 신호
Figure 112011105409904-pct00055
의 인지 가중에 이르고, 반면 전술한 실시예는 단지 저 대역의 차이 신호 e만을 인지 가중한다.
이러한 변형 예에서, 고 대역에서 이득 보상
Figure 112011105409904-pct00056
을 갖는 인지 가중 장치(912)는 저 대역의 필터
Figure 112011105409904-pct00057
와 동일한 형태를 취한다. 따라서 그것은 이하와 같이 정의된 이득 보상 요소 fac2가 수반되는 상기 타입
Figure 112011105409904-pct00058
의 필터이다.
Figure 112008062442202-pct00059
여기서,
Figure 112008062442202-pct00060
는 필터
Figure 112008062442202-pct00061
의 계수들이다:
Figure 112008062442202-pct00062
Figure 112008062442202-pct00063
= 0.96이고,
Figure 112008062442202-pct00064
= 0.6이다.
이러한 요소는 z = 1에 대하여 이하에 대응하고,
Figure 112008062442202-pct00065
즉, 주파수 0 Hz 또는 일단 주파수가 QMF 필터링 이전에 입력 신호의 주파수로 복귀한다면 사실 4 kHz에 대응하는 고 대역에서의 DC 성분에 대응한다.
2개의 서브-대역들에서의 이득 보상을 갖는 인지 가중의 이점은 도 8을 참조하여 설명되고, 도 8은 저 대역(0 내지 4 kHz) 및 고 대역(4 kHz 내지 8 kHz)으로의 분할을 보여준다. 여기서 고려되는 변형 예에서, MDCT 코더는 이러한 2개의 서브-대역들에 적용되고 이하를 구비한다:
○ 저 대역에서 MDCT 이전에 필터링
Figure 112008062442202-pct00066
○ 고 대역에서 MDCT 이전에 필터링
Figure 112008062442202-pct00067
이러한 2개 서브-대역 동작들은 각각 저 대역에서
Figure 112008062442202-pct00068
의 크기 응답 및 고 대역에서
Figure 112008062442202-pct00069
의 크기 응답에 의해 표현된다.
각각의 요소들 fac1 및 fac2에 의한 저 대역 및 고 대역에서의 이득 보상은 4 kHz에서 필터들의 응답들의 연속성을 보장한다. 그것은 2개의 이산 스펙트럼
Figure 112008062442202-pct00070
및
Figure 112008062442202-pct00071
을 이후에 단일 벡터로 코딩될 수 있게 하는 연속성이다. 다시, 저 대역과 고 대역 사이의 연속성을 정의하기 위하여 본 명세서에서 사용되는 값 0 dB은 단지 예시적이다.
이러한 변형 예에 대응하는 계층적 오디오 디코더는 도 7에 도시된다. 이전의 실시예의 디코더와 비교하여 유일한 차이점은 대역 확장 모듈(1002)에 의해 사용되는 양자화된 LPC 계수들
Figure 112011105409904-pct00072
의 복구 및 신호
Figure 112011105409904-pct00073
로 역 인지 가중 필터
Figure 112011105409904-pct00074
의 적용이다. 고 대역에서 사용된 역 필터링
Figure 112011105409904-pct00075
은 요소 1/fac2에 의한 이득 보상에 의해 수반되는
Figure 112011105409904-pct00076
타입으로 이루어지고, 여기서 fac2는 상기와 같이 정의된다.
본 발명은 또한 컴퓨터 또는 전용 장치에 의해 실행하기 위하여 매체 상에 저장된 일련의 명령들을 포함하는 컴퓨터 프로그램을 커버하고, 상기 명령들의 실행은 코딩 및/또는 디코딩을 위하여 본 발명의 인지 가중 방법을 수행한다.
전술한 컴퓨터 프로그램은 예를 들어, 본 발명의 인지 가중 장치에 설치되어 직접 실행가능한 프로그램이다.
물론, 본 발명은 전술한 실시예들에 제한되는 것이 아니다. 특히:
○ 파라미터들
Figure 112008062442202-pct00077
,
Figure 112008062442202-pct00078
,
Figure 112008062442202-pct00079
및
Figure 112008062442202-pct00080
의 수치 값은 앞에서 선택된 값 들과 상이할 수 있다.
○ 보상 요소는
Figure 112008062442202-pct00081
필터링 이전에 또는
Figure 112008062442202-pct00082
필터링과
Figure 112008062442202-pct00083
필터링 사이에 적용되거나,
Figure 112008062442202-pct00084
필터링 또는
Figure 112008062442202-pct00085
필터링 내로 통합될 수 있으며, 동일한 것이 요소 fac2 및 대응하는 역 필터들에 적용된다.
○ 인지 가중 필터가 반드시 형태
Figure 112008062442202-pct00086
로 이루어져야 하는 것은 아니다.
○ 2 이상의 서브-대역들이 전체 주파수 대역에서 정의될 수 있다.

Claims (29)

  1. 정해진 주파수 대역에서 오디오 신호의 코딩/디코딩을 하기 위한 인지 가중 장치로서,
    상기 코딩/디코딩은 상기 정해진 주파수 대역 내 복수의 인접한 서브-대역들에서 수행되고, 상기 장치는 적어도 하나의 서브-대역에서, 이득 보상을 갖는 인지 가중 필터(307)를 포함하고, 상기 이득 보상을 갖는 인지 가중 필터(307)는 상기 이득 보상을 갖는 인지 가중 필터의 출력 신호와 상기 서브-대역에 인접한 서브-대역들에서의 신호들 사이에서 스펙트럼 연속성을 구현하도록 적응되는,
    인지 가중 장치.
  2. 제1항에 있어서,
    상기 이득 보상을 갖는 인지 가중 필터(307)는 인지 가중 필터(501, 502) 및 이득 보상 모듈(503)을 포함하는,
    인지 가중 장치.
  3. 제1항에 있어서,
    상기 이득 보상을 갖는 인지 가중 필터는 이득 보상을 통합하는 인지 가중 필터를 포함하는,
    인지 가중 장치.
  4. 제2항 또는 제3항에 있어서,
    상기 인지 가중 필터는 형태
    Figure 112011105409904-pct00087
    로 이루어지고, 여기서,
    Figure 112011105409904-pct00088
    는 선형 예측 필터를 나타내고,
    Figure 112011105409904-pct00089
    및
    Figure 112011105409904-pct00090
    인,
    인지 가중 장치.
  5. 제4항에 있어서,
    상기 이득 보상은 이하와 같은 요소 fac에 의한 곱셈을 수행하고,
    Figure 112011105409904-pct00091
    여기서,
    Figure 112011105409904-pct00092
    는 상기 선형 예측 필터
    Figure 112011105409904-pct00093
    의 계수들인,
    인지 가중 장치.
  6. 인접한 제 1 서브-대역 및 제 2 서브-대역으로 나누어진 주파수 대역에 사용하기 위한 계층적 오디오 코더로서,
    상기 코더는:
    ○ 상기 주파수 대역의 제 1 서브-대역에서 원래 신호를 코딩하기 위한 코어 코더(305; 905);
    ○ 상기 원래 신호 및 상기 코어 코더로부터 나온 신호로부터 잔여 신호(e)를 계산하기 위한 단(306; 906);
    ○ 상기 잔여 신호(e)를 인지 가중하기 위한 장치;
    를 포함하고,
    상기 인지 가중 장치는 이득 보상을 갖는 인지 가중 필터(307; 907)를 포함하고, 상기 이득 보상을 갖는 인지 가중 필터는 상기 이득 보상을 갖는 인지 가중 필터의 출력 신호와 상기 제 2 서브-대역에서의 신호 사이에서 스펙트럼 연속성을 구현하도록 적응된,
    계층적 오디오 코더.
  7. 제6항에 있어서,
    상기 이득 보상을 갖는 인지 가중 필터(307)는 상기 제 1 서브-대역의 인지 가중 필터(501, 502)를 포함하는,
    계층적 오디오 코더.
  8. 제7항에 있어서,
    상기 제 1 서브 대역의 상기 인지 가중 필터(501, 502)는 형태
    Figure 112011105409904-pct00094
    로 이루어지고, 여기서,
    Figure 112011105409904-pct00095
    는 선형 예측 필터를 나타내고,
    Figure 112011105409904-pct00096
    및
    Figure 112011105409904-pct00097
    인,
    계층적 오디오 코더.
  9. 제8항에 있어서,
    상기 제 1 서브-대역에서의 이득 보상은 이하와 같은 요소 fac1에 의한 곱셈을 수행하고,
    Figure 112011105409904-pct00098
    여기서,
    Figure 112011105409904-pct00099
    는 상기 선형 예측 필터
    Figure 112011105409904-pct00100
    의 계수들인,
    계층적 오디오 코더.
  10. 제8항 또는 제9항에 있어서,
    상기 선형 예측 필터의 계수들은 상기 코어 코더(305)에 의해 공급되는,
    계층적 오디오 코더.
  11. 제6항 내지 제9항 중 어느 한 항에 있어서,
    상기 제 1 서브-대역의 상기 인지 가중 장치(307)로부터 나온 신호 및 상기 제 2 서브-대역의 원래 신호가 각각의 변환 분석 모듈들(308, 311)에 인가되고, 상기 변환 분석 모듈들은 상기 주파수 대역에 있는 변환 코더(313)에 연결되는,
    계층적 오디오 코더.
  12. 인접한 제 1 서브-대역 및 제 2 서브-대역으로 나누어진 주파수 대역에 사용하기 위한 계층적 오디오 디코더로서,
    상기 디코더는:
    ○ 제6항 내지 제9항 중 어느 한 항에 따른 코더에 의해 코딩된 수신 신호를 상기 주파수 대역의 제 1 서브-대역에서 디코딩하도록 적응된 코어 디코더(701; 1001);
    ○ 상기 코더의 인지 가중 장치(307; 907)에 의해 상기 제 1 서브-대역에서 가중된 잔여 신호(e)를 나타내는 신호를 역으로(inversely) 인지 가중하기 위한 역 인지 가중 장치
    를 포함하고,
    상기 역 인지 가중 장치(707; 1008)는 상기 제 1 서브-대역에서의 상기 코더의 이득 보상을 갖는 인지 가중 필터(307)의 역인 이득 보상을 갖는 인지 가중 필터를 포함하는,
    계층적 오디오 디코더.
  13. 정해진 주파수 대역에서 오디오 신호를 코딩하는 인지 가중 방법으로서,
    상기 코딩은 상기 주파수 대역 내 복수의 인접한 서브-대역들에서 수행되고, 상기 방법은 적어도 하나의 서브-대역에서, 이득 보상을 갖는 인지 가중 단계를 포함하고, 상기 이득 보상을 갖는 인지 가중 단계는 상기 이득 보상을 갖는 인지 가중 단계로부터 나온 신호와 상기 서브-대역에 인접한 서브-대역들에서의 신호들 사이에서 스펙트럼 연속성을 구현하도록 적응되는,
    인지 가중 방법.
  14. 제13항에 따른 방법에 따라 정해진 주파수 대역에서 코딩된 오디오 신호를 디코딩하기 위한 인지 가중 방법으로서,
    상기 방법은 상기 서브-대역에서 상기 이득 보상을 갖는 인지 가중 단계의 역인 이득 보상을 갖는 인지 가중 단계를 포함하는,
    인지 가중 방법.
  15. 컴퓨터 또는 전용 장치에 의한 실행을 위하여 일련의 명령들을 포함하는 컴퓨터 프로그램을 저장한 컴퓨터 판독가능 매체로서,
    상기 명령들의 실행은 제13항 또는 제14항에 따른 인지 가중 방법을 수행하는,
    컴퓨터 판독가능 매체.
  16. 삭제
  17. 삭제
  18. 삭제
  19. 삭제
  20. 삭제
  21. 삭제
  22. 삭제
  23. 삭제
  24. 삭제
  25. 삭제
  26. 삭제
  27. 삭제
  28. 삭제
  29. 삭제
KR1020087021500A 2006-02-14 2007-02-07 오디오 인코딩/디코딩에서의 인지 가중 장치 Expired - Fee Related KR101366124B1 (ko)

Applications Claiming Priority (3)

Application Number Priority Date Filing Date Title
FR0650538 2006-02-14
FR0650538 2006-02-14
PCT/FR2007/050760 WO2007093726A2 (fr) 2006-02-14 2007-02-07 Dispositif de ponderation perceptuelle en codage/decodage audio

Publications (2)

Publication Number Publication Date
KR20080093450A KR20080093450A (ko) 2008-10-21
KR101366124B1 true KR101366124B1 (ko) 2014-02-21

Family

ID=36952401

Family Applications (1)

Application Number Title Priority Date Filing Date
KR1020087021500A Expired - Fee Related KR101366124B1 (ko) 2006-02-14 2007-02-07 오디오 인코딩/디코딩에서의 인지 가중 장치

Country Status (7)

Country Link
US (1) US8260620B2 (ko)
EP (1) EP1989706B1 (ko)
JP (1) JP5117407B2 (ko)
KR (1) KR101366124B1 (ko)
CN (1) CN101385079B (ko)
AT (1) ATE531037T1 (ko)
WO (1) WO2007093726A2 (ko)

Families Citing this family (34)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US7461106B2 (en) * 2006-09-12 2008-12-02 Motorola, Inc. Apparatus and method for low complexity combinatorial coding of signals
GB2448201A (en) * 2007-04-04 2008-10-08 Zarlink Semiconductor Inc Cancelling non-linear echo during full duplex communication in a hands free communication system.
US8576096B2 (en) * 2007-10-11 2013-11-05 Motorola Mobility Llc Apparatus and method for low complexity combinatorial coding of signals
US8209190B2 (en) * 2007-10-25 2012-06-26 Motorola Mobility, Inc. Method and apparatus for generating an enhancement layer within an audio coding system
US20090234642A1 (en) * 2008-03-13 2009-09-17 Motorola, Inc. Method and Apparatus for Low Complexity Combinatorial Coding of Signals
US8639519B2 (en) * 2008-04-09 2014-01-28 Motorola Mobility Llc Method and apparatus for selective signal coding based on core encoder performance
PL2352147T3 (pl) * 2008-07-11 2014-02-28 Fraunhofer Ges Forschung Urządzenie i sposób kodowania sygnału audio
KR101395252B1 (ko) * 2008-07-11 2014-05-15 프라운호퍼 게젤샤프트 쭈르 푀르데룽 데어 안겐반텐 포르슝 에. 베. 스펙트럼 포락선의 수를 산출하기 위한 장치 및 그 방법
KR101170466B1 (ko) 2008-07-29 2012-08-03 한국전자통신연구원 Mdct 영역에서의 후처리 방법, 및 장치
CN104240713A (zh) 2008-09-18 2014-12-24 韩国电子通信研究院 编码方法和解码方法
FR2938688A1 (fr) 2008-11-18 2010-05-21 France Telecom Codage avec mise en forme du bruit dans un codeur hierarchique
US8175888B2 (en) 2008-12-29 2012-05-08 Motorola Mobility, Inc. Enhanced layered gain factor balancing within a multiple-channel audio coding system
US8200496B2 (en) * 2008-12-29 2012-06-12 Motorola Mobility, Inc. Audio signal decoder and method for producing a scaled reconstructed audio signal
US8140342B2 (en) * 2008-12-29 2012-03-20 Motorola Mobility, Inc. Selective scaling mask computation based on peak detection
US8219408B2 (en) * 2008-12-29 2012-07-10 Motorola Mobility, Inc. Audio signal decoder and method for producing a scaled reconstructed audio signal
CA2780962C (en) * 2009-11-19 2017-09-05 Telefonaktiebolaget L M Ericsson (Publ) Methods and arrangements for loudness and sharpness compensation in audio codecs
US8428936B2 (en) * 2010-03-05 2013-04-23 Motorola Mobility Llc Decoder for audio signal including generic audio and speech frames
US8423355B2 (en) * 2010-03-05 2013-04-16 Motorola Mobility Llc Encoder for audio signal including generic audio and speech frames
CN102223527B (zh) * 2010-04-13 2013-04-17 华为技术有限公司 频带加权量化编解码方法和装置
KR101747917B1 (ko) 2010-10-18 2017-06-15 삼성전자주식회사 선형 예측 계수를 양자화하기 위한 저복잡도를 가지는 가중치 함수 결정 장치 및 방법
FR2969360A1 (fr) * 2010-12-16 2012-06-22 France Telecom Codage perfectionne d'un etage d'amelioration dans un codeur hierarchique
US9037456B2 (en) * 2011-07-26 2015-05-19 Google Technology Holdings LLC Method and apparatus for audio coding and decoding
JP5737077B2 (ja) * 2011-08-30 2015-06-17 富士通株式会社 オーディオ符号化装置、オーディオ符号化方法及びオーディオ符号化用コンピュータプログラム
US9173025B2 (en) 2012-02-08 2015-10-27 Dolby Laboratories Licensing Corporation Combined suppression of noise, echo, and out-of-location signals
US8712076B2 (en) 2012-02-08 2014-04-29 Dolby Laboratories Licensing Corporation Post-processing including median filtering of noise suppression gains
US9129600B2 (en) 2012-09-26 2015-09-08 Google Technology Holdings LLC Method and apparatus for encoding an audio signal
FR3008533A1 (fr) * 2013-07-12 2015-01-16 Orange Facteur d'echelle optimise pour l'extension de bande de frequence dans un decodeur de signaux audiofrequences
EP3039675B1 (en) * 2013-08-28 2018-10-03 Dolby Laboratories Licensing Corporation Parametric speech enhancement
FR3011408A1 (fr) * 2013-09-30 2015-04-03 Orange Re-echantillonnage d'un signal audio pour un codage/decodage a bas retard
US10455080B2 (en) 2014-12-23 2019-10-22 Dolby Laboratories Licensing Corporation Methods and devices for improvements relating to voice quality estimation
WO2017050398A1 (en) 2015-09-25 2017-03-30 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Encoder, decoder and methods for signal-adaptive switching of the overlap ratio in audio transform coding
EP3288031A1 (en) 2016-08-23 2018-02-28 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Apparatus and method for encoding an audio signal using a compensation value
US20190051286A1 (en) * 2017-08-14 2019-02-14 Microsoft Technology Licensing, Llc Normalization of high band signals in network telephony communications
JP7150996B2 (ja) 2019-01-13 2022-10-11 華為技術有限公司 ハイレゾリューションオーディオ符号化

Citations (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
WO2001075759A1 (en) 2000-03-27 2001-10-11 Russell Randall A School commerce system and method
US6691082B1 (en) 1999-08-03 2004-02-10 Lucent Technologies Inc Method and system for sub-band hybrid coding

Family Cites Families (20)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US5371853A (en) * 1991-10-28 1994-12-06 University Of Maryland At College Park Method and system for CELP speech coding and codebook for use therewith
JP3139602B2 (ja) * 1995-03-24 2001-03-05 日本電信電話株式会社 音響信号符号化方法及び復号化方法
FR2734389B1 (fr) * 1995-05-17 1997-07-18 Proust Stephane Procede d'adaptation du niveau de masquage du bruit dans un codeur de parole a analyse par synthese utilisant un filtre de ponderation perceptuelle a court terme
US5778335A (en) * 1996-02-26 1998-07-07 The Regents Of The University Of California Method and apparatus for efficient multiband celp wideband speech and music coding and decoding
KR100261253B1 (ko) * 1997-04-02 2000-07-01 윤종용 비트율 조절이 가능한 오디오 부호화/복호화 방법및 장치
US6182031B1 (en) * 1998-09-15 2001-01-30 Intel Corp. Scalable audio coding system
DE60035453T2 (de) * 1999-05-11 2008-03-20 Nippon Telegraph And Telephone Corp. Auswahl des Synthesefilters für eine CELP Kodierung von breitbandigen Audiosignalen
US6446037B1 (en) * 1999-08-09 2002-09-03 Dolby Laboratories Licensing Corporation Scalable coding method for high quality audio
CA2290037A1 (en) * 1999-11-18 2001-05-18 Voiceage Corporation Gain-smoothing amplifier device and method in codecs for wideband speech and audio signals
US6523003B1 (en) * 2000-03-28 2003-02-18 Tellabs Operations, Inc. Spectrally interdependent gain adjustment techniques
AU2001245418A1 (en) * 2000-03-28 2001-10-08 Tellabs Operations, Inc. Perceptual spectral weighting of frequency bands for adaptive noise cancellation
WO2003056546A1 (fr) * 2001-12-25 2003-07-10 Ntt Docomo, Inc. Appareil de codage de signaux, procede de codage de signaux, et programme
US7283966B2 (en) * 2002-03-07 2007-10-16 Microsoft Corporation Scalable audio communications utilizing rate-distortion based end-to-end bit allocation
EP1483759B1 (en) * 2002-03-12 2006-09-06 Nokia Corporation Scalable audio coding
US7502743B2 (en) * 2002-09-04 2009-03-10 Microsoft Corporation Multi-channel audio encoding and decoding with multi-channel transform selection
US20040098255A1 (en) * 2002-11-14 2004-05-20 France Telecom Generalized analysis-by-synthesis speech coding method, and coder implementing such method
WO2004097796A1 (ja) * 2003-04-30 2004-11-11 Matsushita Electric Industrial Co., Ltd. 音声符号化装置、音声復号化装置及びこれらの方法
US7392195B2 (en) * 2004-03-25 2008-06-24 Dts, Inc. Lossless multi-channel audio codec
US7715573B1 (en) * 2005-02-28 2010-05-11 Texas Instruments Incorporated Audio bandwidth expansion
US7177804B2 (en) * 2005-05-31 2007-02-13 Microsoft Corporation Sub-band voice codec with multi-stage codebooks and redundant coding

Patent Citations (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US6691082B1 (en) 1999-08-03 2004-02-10 Lucent Technologies Inc Method and system for sub-band hybrid coding
WO2001075759A1 (en) 2000-03-27 2001-10-11 Russell Randall A School commerce system and method

Also Published As

Publication number Publication date
EP1989706A2 (fr) 2008-11-12
CN101385079B (zh) 2012-08-29
US8260620B2 (en) 2012-09-04
JP5117407B2 (ja) 2013-01-16
WO2007093726A2 (fr) 2007-08-23
WO2007093726A3 (fr) 2007-10-18
KR20080093450A (ko) 2008-10-21
US20090076829A1 (en) 2009-03-19
CN101385079A (zh) 2009-03-11
JP2009527017A (ja) 2009-07-23
EP1989706B1 (fr) 2011-10-26
ATE531037T1 (de) 2011-11-15

Similar Documents

Publication Publication Date Title
US8260620B2 (en) Device for perceptual weighting in audio encoding/decoding
JP4708446B2 (ja) 符号化装置、復号装置およびそれらの方法
JP5112309B2 (ja) 階層符号化/復号化装置
JP6173288B2 (ja) マルチモードオーディオコーデックおよびそれに適応されるcelp符号化
CN101622661B (zh) 一种数字语音信号的改进编解码方法
EP2255358B1 (en) Scalable speech and audio encoding using combinatorial encoding of mdct spectrum
RU2584463C2 (ru) Кодирование звука с малой задержкой, содержащее чередующиеся предсказательное кодирование и кодирование с преобразованием
US8812327B2 (en) Coding/decoding of digital audio signals
CA2609539A1 (en) Audio codec post-filter
US20130173275A1 (en) Audio encoding device and audio decoding device
KR101373207B1 (ko) 오디오 디코더에서 신호를 사후-프로세싱하는 방법
EP2132732B1 (en) Postfilter for layered codecs
JP5236033B2 (ja) 音声符号化装置、音声復号装置およびそれらの方法

Legal Events

Date Code Title Description
PA0105 International application

St.27 status event code: A-0-1-A10-A15-nap-PA0105

E13-X000 Pre-grant limitation requested

St.27 status event code: A-2-3-E10-E13-lim-X000

P11-X000 Amendment of application requested

St.27 status event code: A-2-2-P10-P11-nap-X000

P13-X000 Application amended

St.27 status event code: A-2-2-P10-P13-nap-X000

P11-X000 Amendment of application requested

St.27 status event code: A-2-2-P10-P11-nap-X000

P13-X000 Application amended

St.27 status event code: A-2-2-P10-P13-nap-X000

R15-X000 Change to inventor requested

St.27 status event code: A-3-3-R10-R15-oth-X000

R16-X000 Change to inventor recorded

St.27 status event code: A-3-3-R10-R16-oth-X000

PG1501 Laying open of application

St.27 status event code: A-1-1-Q10-Q12-nap-PG1501

A201 Request for examination
P11-X000 Amendment of application requested

St.27 status event code: A-2-2-P10-P11-nap-X000

P13-X000 Application amended

St.27 status event code: A-2-2-P10-P13-nap-X000

PA0201 Request for examination

St.27 status event code: A-1-2-D10-D11-exm-PA0201

P22-X000 Classification modified

St.27 status event code: A-2-2-P10-P22-nap-X000

R18-X000 Changes to party contact information recorded

St.27 status event code: A-3-3-R10-R18-oth-X000

R17-X000 Change to representative recorded

St.27 status event code: A-3-3-R10-R17-oth-X000

E902 Notification of reason for refusal
PE0902 Notice of grounds for rejection

St.27 status event code: A-1-2-D10-D21-exm-PE0902

P11-X000 Amendment of application requested

St.27 status event code: A-2-2-P10-P11-nap-X000

P13-X000 Application amended

St.27 status event code: A-2-2-P10-P13-nap-X000

PN2301 Change of applicant

St.27 status event code: A-3-3-R10-R13-asn-PN2301

St.27 status event code: A-3-3-R10-R11-asn-PN2301

P22-X000 Classification modified

St.27 status event code: A-2-2-P10-P22-nap-X000

E701 Decision to grant or registration of patent right
PE0701 Decision of registration

St.27 status event code: A-1-2-D10-D22-exm-PE0701

GRNT Written decision to grant
PR0701 Registration of establishment

St.27 status event code: A-2-4-F10-F11-exm-PR0701

PR1002 Payment of registration fee

St.27 status event code: A-2-2-U10-U12-oth-PR1002

Fee payment year number: 1

PG1601 Publication of registration

St.27 status event code: A-4-4-Q10-Q13-nap-PG1601

LAPS Lapse due to unpaid annual fee
PC1903 Unpaid annual fee

St.27 status event code: A-4-4-U10-U13-oth-PC1903

Not in force date: 20170218

Payment event data comment text: Termination Category : DEFAULT_OF_REGISTRATION_FEE

PC1903 Unpaid annual fee

St.27 status event code: N-4-6-H10-H13-oth-PC1903

Ip right cessation event data comment text: Termination Category : DEFAULT_OF_REGISTRATION_FEE

Not in force date: 20170218

R18-X000 Changes to party contact information recorded

St.27 status event code: A-5-5-R10-R18-oth-X000