KR101617816B1 - 스펙트럼 도메인 잡음 형상화를 사용하는 선형 예측 기반 코딩 방식 - Google Patents
스펙트럼 도메인 잡음 형상화를 사용하는 선형 예측 기반 코딩 방식 Download PDFInfo
- Publication number
- KR101617816B1 KR101617816B1 KR1020137024237A KR20137024237A KR101617816B1 KR 101617816 B1 KR101617816 B1 KR 101617816B1 KR 1020137024237 A KR1020137024237 A KR 1020137024237A KR 20137024237 A KR20137024237 A KR 20137024237A KR 101617816 B1 KR101617816 B1 KR 101617816B1
- Authority
- KR
- South Korea
- Prior art keywords
- spectrum
- spectral
- autocorrelation
- linear prediction
- audio encoder
- Prior art date
Links
- 230000003595 spectral effect Effects 0.000 title claims abstract description 99
- 238000007493 shaping process Methods 0.000 title claims abstract description 35
- 238000001228 spectrum Methods 0.000 claims abstract description 138
- 238000004364 calculation method Methods 0.000 claims abstract description 9
- 238000000354 decomposition reaction Methods 0.000 claims abstract description 9
- 238000000034 method Methods 0.000 claims description 27
- 230000005236 sound signal Effects 0.000 claims description 23
- 238000013139 quantization Methods 0.000 claims description 15
- 238000004590 computer program Methods 0.000 claims description 11
- 238000001914 filtration Methods 0.000 claims description 10
- 230000009466 transformation Effects 0.000 abstract description 4
- 230000008030 elimination Effects 0.000 abstract description 2
- 238000003379 elimination reaction Methods 0.000 abstract description 2
- 238000000844 transformation Methods 0.000 abstract description 2
- 230000001052 transient effect Effects 0.000 description 16
- 230000002123 temporal effect Effects 0.000 description 13
- 230000006870 function Effects 0.000 description 8
- 238000012546 transfer Methods 0.000 description 7
- 230000005284 excitation Effects 0.000 description 5
- 230000015572 biosynthetic process Effects 0.000 description 4
- 238000004422 calculation algorithm Methods 0.000 description 4
- 238000003786 synthesis reaction Methods 0.000 description 4
- 238000012360 testing method Methods 0.000 description 4
- 238000006243 chemical reaction Methods 0.000 description 3
- 238000010586 diagram Methods 0.000 description 3
- 230000000873 masking effect Effects 0.000 description 3
- 230000004048 modification Effects 0.000 description 3
- 238000012986 modification Methods 0.000 description 3
- 239000000969 carrier Substances 0.000 description 2
- 238000005259 measurement Methods 0.000 description 2
- 206010063659 Aversion Diseases 0.000 description 1
- 230000008901 benefit Effects 0.000 description 1
- 230000002457 bidirectional effect Effects 0.000 description 1
- 230000002902 bimodal effect Effects 0.000 description 1
- 230000015556 catabolic process Effects 0.000 description 1
- 238000004891 communication Methods 0.000 description 1
- 238000005056 compaction Methods 0.000 description 1
- 238000006731 degradation reaction Methods 0.000 description 1
- 230000001419 dependent effect Effects 0.000 description 1
- 238000003795 desorption Methods 0.000 description 1
- 238000002592 echocardiography Methods 0.000 description 1
- 239000000284 extract Substances 0.000 description 1
- 238000009432 framing Methods 0.000 description 1
- 230000006872 improvement Effects 0.000 description 1
- 230000007246 mechanism Effects 0.000 description 1
- 238000011045 prefiltration Methods 0.000 description 1
- 230000008569 process Effects 0.000 description 1
- 238000012545 processing Methods 0.000 description 1
- 230000009467 reduction Effects 0.000 description 1
- 230000004044 response Effects 0.000 description 1
- 230000002441 reversible effect Effects 0.000 description 1
- 230000007480 spreading Effects 0.000 description 1
Images
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/005—Correction of errors induced by the transmission channel, if related to the coding algorithm
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/04—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/02—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders
- G10L19/028—Noise substitution, i.e. substituting non-tonal spectral components by noisy source
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/04—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
- G10L19/08—Determination or coding of the excitation function; Determination or coding of the long-term prediction parameters
- G10L19/10—Determination or coding of the excitation function; Determination or coding of the long-term prediction parameters the excitation function being a multipulse excitation
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/04—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
- G10L19/08—Determination or coding of the excitation function; Determination or coding of the long-term prediction parameters
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10K—SOUND-PRODUCING DEVICES; METHODS OR DEVICES FOR PROTECTING AGAINST, OR FOR DAMPING, NOISE OR OTHER ACOUSTIC WAVES IN GENERAL; ACOUSTICS NOT OTHERWISE PROVIDED FOR
- G10K11/00—Methods or devices for transmitting, conducting or directing sound in general; Methods or devices for protecting against, or for damping, noise or other acoustic waves in general
- G10K11/16—Methods or devices for protecting against, or for damping, noise or other acoustic waves in general
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/012—Comfort noise or silence coding
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/02—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/02—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders
- G10L19/0212—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders using orthogonal transformation
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/02—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders
- G10L19/022—Blocking, i.e. grouping of samples in time; Choice of analysis windows; Overlap factoring
- G10L19/025—Detection of transients or attacks for time/frequency resolution switching
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/02—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders
- G10L19/03—Spectral prediction for preventing pre-echo; Temporary noise shaping [TNS], e.g. in MPEG2 or MPEG4
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/04—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
- G10L19/06—Determination or coding of the spectral characteristics, e.g. of the short-term prediction coefficients
- G10L19/07—Line spectrum pair [LSP] vocoders
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/04—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
- G10L19/08—Determination or coding of the excitation function; Determination or coding of the long-term prediction parameters
- G10L19/10—Determination or coding of the excitation function; Determination or coding of the long-term prediction parameters the excitation function being a multipulse excitation
- G10L19/107—Sparse pulse excitation, e.g. by using algebraic codebook
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/04—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
- G10L19/08—Determination or coding of the excitation function; Determination or coding of the long-term prediction parameters
- G10L19/12—Determination or coding of the excitation function; Determination or coding of the long-term prediction parameters the excitation function being a code excitation, e.g. in code excited linear prediction [CELP] vocoders
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/04—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
- G10L19/08—Determination or coding of the excitation function; Determination or coding of the long-term prediction parameters
- G10L19/12—Determination or coding of the excitation function; Determination or coding of the long-term prediction parameters the excitation function being a code excitation, e.g. in code excited linear prediction [CELP] vocoders
- G10L19/13—Residual excited linear prediction [RELP]
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/04—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
- G10L19/16—Vocoder architecture
- G10L19/18—Vocoders using multiple modes
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/04—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
- G10L19/16—Vocoder architecture
- G10L19/18—Vocoders using multiple modes
- G10L19/22—Mode decision, i.e. based on audio signal content versus external parameters
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L21/00—Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
- G10L21/02—Speech enhancement, e.g. noise reduction or echo cancellation
- G10L21/0208—Noise filtering
- G10L21/0216—Noise filtering characterised by the method used for estimating noise
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L25/00—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
- G10L25/03—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 characterised by the type of extracted parameters
- G10L25/06—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 characterised by the type of extracted parameters the extracted parameters being correlation coefficients
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L25/00—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
- G10L25/78—Detection of presence or absence of voice signals
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/02—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders
- G10L19/022—Blocking, i.e. grouping of samples in time; Choice of analysis windows; Overlap factoring
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/04—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
- G10L19/26—Pre-filtering or post-filtering
Landscapes
- Engineering & Computer Science (AREA)
- Physics & Mathematics (AREA)
- Multimedia (AREA)
- Acoustics & Sound (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Health & Medical Sciences (AREA)
- Signal Processing (AREA)
- Computational Linguistics (AREA)
- Spectroscopy & Molecular Physics (AREA)
- Quality & Reliability (AREA)
- General Physics & Mathematics (AREA)
- Mathematical Analysis (AREA)
- Mathematical Optimization (AREA)
- Mathematical Physics (AREA)
- Pure & Applied Mathematics (AREA)
- Theoretical Computer Science (AREA)
- Algebra (AREA)
- Compression, Expansion, Code Conversion, And Decoders (AREA)
Abstract
선형 예측 계수 계산뿐만 아니라 선형 예측 계수들을 기초로 하는 스펙트럼 도메인 형상화를 위한 입력 모두를 위하여 오디오 입력 신호의 일련의 스펙트럼을 포함하는 스펙트로그램으로의 스펙트럼 분해를 사용함으로써, 선형 예측 기반이고 스펙트럼 도메인 잡음 형상화를 사용하는 인코딩 개념은 예를 들면, 레이트/왜곡 비율에 대하여 상당한 코딩 효율에서 덜 복잡하게 제공된다. 만일 그러한 겹침 변환이 에일리어싱을 야기하고 변형 이산 코사인 변환과 같은 정밀하게 샘플링되는 겹침 변환들과 같은 시간 에일리어싱 제거를 필요하게 만드는 스펙트럼 분해를 위하여 사용되더라도 코딩 효율은 여전히 유지된다.
Description
본 발명은 통합 음성 및 오디오 코덱(USAC)으로부터 알려진 변환 코딩 여진(TCX)과 같은 주파수 도메인 잡음 형상화(frequency domain noise shaping)를 사용하는 선형 예측 기반 오디오 코덱에 관한 것이다.
상대적으로 새로운 오디오 코덱으로서, 통합 음성 및 오디오 코덱이 최근에 확정되었다. 통합 음성 및 오디오 코덱은 어떠한 스펙트럼 도메인 형상화가 데이터 스트림을 거쳐 전송된 선형 예측 계수들을 사용하여 제어되는가에 따라 고급 오디오 코딩 같은 코딩 방식, 선형 예측 코딩, 주로 대수 부호 여진 선형 예측을 사용하는 시간-도메인 코딩 방식 및 중간 코딩 방식을 형성하는 변환 코딩 여진 사이의 전환을 제공하는 코덱이다. 국제특허 WO 2011147950에서, 고급 오디오 코딩 같은 코딩 방식을 이용성으로부터 배제하고 코딩 방식을 대수 부호 여진 선형 예측 및 변환 코딩 여진만으로 한정함으로써 저지연(low delay) 적용들에 더 적합한 통합 음성 및 오디오 코덱 방식을 제공하는 것이 제안되었다. 또한 프레임 길이를 감소시키는 것이 제안되었다.
그러나, 쉽게 스펙트럼 도메인 형상화를 사용하는 선형 예측 기반 코딩 방식의 복잡도를 감소시키고 예를 들면, 레이트/왜곡(distortion)과 관련하여, 유사한 코딩 효율을 달성하는 가능성을 갖는 것이 바람직할 수 있다.
[1]: 통합 음성 및 오디오 코딩 코덱, ISO/IEC CD 23003-3, 2010년 9월 24일.
따라서, 유사하거나 또는 증가된 코딩 효율에서 복잡도 감소를 허용하는 스펙트럼 도메인 형상화를 사용하는 그러한 선형 예측 기반 코딩 방식을 제공하는 것이 본 발명의 목적이다.
본 발명의 목적은 첨부된 독립항들의 주제에 의해 달성된다.
만일 선형 예측 계수 계산뿐만 아니라 선형 예측 계수들을 기초로 하는 스펙트럼 도메인 형상화를 위한 입력 모두를 위하여 오디오 입력 신호의 일련의 스펙트럼을 포함하는 스펙트로그램(spectrogram)으로의 스펙트럼 분해(spectral decomposition)가 사용되면, 선형 예측 기반이고 스펙트럼 도메인 잡음 형상화를 사용하는 인코딩 개념은 예를 들면, 레이트/왜곡 비율에 대하여 상당한 코딩 효율에서 덜 복잡하게 제공될 것이다.
이와 관련하여, 만일 그러한 겹침 변환(lapped transform)이 에일리어싱(alising)을 야기하고 변형 이산 코사인 변환(MDCT)과 같은 정밀하게 샘플링되는 겹침 변환들과 같은 시간 에일리어싱 제거(time alising cancellation)를 필요하게 만드는 스펙트럼 분해를 위하여 사용되더라도 코딩 효율은 여전히 유지되는 것이 밝혀졌다.
본 발명의 양상들의 바람직한 구현들이 종속항들의 주제이다.
특히, 본 발명의 바람직한 실시 예들이 도면들을 참조하여 설명된다.
도 1은 비교 또는 실시 예에 따른 오디오 인코더의 블록 다이어그램을 도시한다.
도 2는 본 발명의 일 실시 예에 따른 오디오 인코더를 도시한다.
도 3은 도 2의 오디오 인코더에 대한 가능한 오디오 디코더 필터링의 블록 다이어그램이다.
도 4는 본 발명의 일 실시 예에 따른 대안의 오디오 인코더의 블록 다이어그램을 도시한다.
도 1은 비교 또는 실시 예에 따른 오디오 인코더의 블록 다이어그램을 도시한다.
도 2는 본 발명의 일 실시 예에 따른 오디오 인코더를 도시한다.
도 3은 도 2의 오디오 인코더에 대한 가능한 오디오 디코더 필터링의 블록 다이어그램이다.
도 4는 본 발명의 일 실시 예에 따른 대안의 오디오 인코더의 블록 다이어그램을 도시한다.
아래에 설명되는 주요 양상들의 이해 및 본 발명의 실시 예들의 장점을 돕기 위하여, 스펙트럼 도메인 잡음 형상화를 사용하는 선형 예측 기반 오디오 인코더를 도시한 도 1이 참조된다.
특히, 도 1의 오디오 인코더는 입력 오디오 신호(12)를 도 1에서 14로 표시된, 일련의 스펙트럼으로 구성되는 스펙트로그램으로 분해하기 위한 스펙트럼 분해기(spectral decomposer, 10)를 포함한다. 도 1에 도시된 것과 같이, 스펙트럼 분해기(10)는 입력 오디오 신호(12)를 시간 도메인으로부터 스펙트럼 도메인으로 전달하기 위하여 변환 이산 코사인 변환을 사용할 수 있다. 특히, 스펙트로그램(14)의 일련의 스펙트럼의 스펙트럼을 획득하기 위하여 윈도우잉된 부분들이 개별적으로 변형 이산 코사인 변환 모듈(18) 내의 각각의 변환의 대상이 되는 입력 오디오 신호(12)의 상호 오버래핑되는 부분들을 윈도우잉하기 위하여 윈도우어(windower, 16)가 스펙트럼 분해기(10)의 변형 이산 코사인 변환 모듈(18)에 선행한다. 그러나, 스펙트럼 분해기(10)는 대안으로서, 정밀하게 샘플링되는 겹침 변환들과 같은 에일리어싱을 야기하는 다른 겹침 변환을 사용할 수 있다.
또한, 도 1의 오디오 인코더는 그것으로부터 선형 예측 계수들을 유도하기 위하여 입력 오디오 신호를 분석하기 위한 선형 예측 분석기(20)를 포함한다. 도 1의 오디오 인코더의 스펙트럼 도메인 형상기(22)는 선형 예측 분석기(20)에 의해 제공되는 선형 예측 계수들을 기초로 하여 스펙트로그램(14)의 일련의 스펙트럼의 현재 스펙트럼을 스펙트럼으로(spectrally) 형상화하도록 구성된다. 특히, 스펙트럼 도메인 형상기(22)는 선형 예측 계수들을 분석기(20)로부터 스펙트럼 가중 값들로 전환하고 현재 스펙트럼을 스펙트럼으로 형성하거나 또는 형상화하기 위하여 나눔수(divisor)로서 후자의 가중 값들을 적용함으로써 선형 예측 분석 필터 전달 함수와 상응하는 전달 함수에 따라 스펙트럼 도메인 형상기(22)로 들어가는 현재 스펙트럼을 스펙트럼으로 형상화하도록 구성된다. 형상화된 스펙트럼은 도 1의 오디오 인코더의 양자화기(24) 내의 양자화의 대상이 된다. 스펙트럼 도메인 형상기(22)에서의 형상화 때문에, 디코더 면에서 양자화된 스펙트럼을 탈양자화에 이르는 양자화 잡음은 감춰지도록 전이되는데, 즉, 코딩은 가능한 한 인지적으로(perceptually) 투명해진다.
완전성만을 위하여, 일시적 잡음 형상화 모듈(26)은 선택적으로 스펙트럼 분해기(10)로부터 스펙트럼 도메인 형상기(22)로 전달된 스펙트럼을 일시적 잡음 형상화에 종속시킬 수 있으며, 저주파수 강조 모듈(low frequency emphasis module, 28)은 양자화(24) 이전에 스펙트럼 도메인 형상기(22)에 의해 각각의 형상화된 스펙트럼 출력을 적응적으로 필터링할 수 있다.
양자화되고 스펙트럼으로 형성화된 스펙트럼은 스펙트럼 형상화에서 사용된 선형 예측 계수들 상의 정보와 함께 데이터 스트림 내로 삽입되고 따라서, 디코딩 면에서 탈형상화 및 탈양자화가 실행될 수 있다.
오디오 코덱의 대부분은 일시적 잡음 형상기 모듈(26)인 하나를 제외하고는, 예를 들면, 새로운 오디오 코덱 통합 음성 및 오디오 코덱 및 특히 그것의 변환 코딩 여진 모듈 내에서 구현되고 설명된다. 따라서, 또 다른 상세한 설명을 위하여, 바람직하게는, 통합 음성 및 오디오 코딩 표준, 예를 들면, 선행기술문헌 [1}이 참조된다.
그럼에도 불구하고, 다음에 선형 예측 분석기(20)에 대한 더 많은 강조가 제공된다. 도 1에 도시된 것과 같이, 선형 예측 분석기(20)는 입력 오디오 신호(12) 상에 직접 작용한다. 전-강조 모듈(pre-emphasis module, 32)은 예를 들면, 유한 임펄스 응답(FIR) 필터링에 의한 것과 같이, 입력 오디오 신호(12)를 미리 필터링하고, 그 후에 자기상관(autocorrelation)이 윈도우어(34)의 연결(concatenation)에 의해 연속적으로 유래한다. 윈도우어(34)는 윈도우잉된 부분들이 시간에 따라 상호 오버래핑할 수 있는 미리 필터링된 입력 오디오 신호 이외의 윈도우잉된 부분들을 형성한다. 자기상관기(36)는 윈도우어(34)에 의해 출력된 윈도우잉된 부분 당 자기상관을 계산하고 다음의 선형 예측 파라미터 추정(estimate) 알고리즘에 더 적합한 자기상관들을 제공하기 위하여 자기상관들 상으로 래그 윈도우(lag window)를 제공하도록 레그 윈도우어(38)가 선택적으로 제공된다. 특히, 선형 예측 파라미터 추정기(40)는 래그 윈도우 출력을 수신하고 자기상관 당 선행 예측 계수들을 유래하기 위하여 윈도우잉된 자기상관들 상으로 예를 들면, 위너-레빈슨-더빈(Wiener-Levinson-Durbin) 또는 다른 적절한 알고리즘을 실행한다. 스펙트럼 도메인 형상기(22) 내에서, 결과로서 생기는 선형 예측 계수들은 모듈들(44, 46 및 48)을 통과한다. 모듈(42)은 데이터 스트림(30) 내의 선형 예측 계수들에 대한 정보를 디코딩 면으로 전달하는 책임이 있다. 도 1에 도시된 것과 같이, 선형 예측 계수 데이터 스트림 삽입기(linear prediction coefficient data stream inserter, 42)는 양자회된 계수들을 데이터 스트림(30) 내로 코딩하고 양자화된 예측 값들을 다시 선형 예측 코딩 계수들로 재변환하여 선 스펙트럼 쌍 또는 선 스펙트럼 주파수 도메인 내의 선형 예측 분석기(20)에 의해 결정되는 선형 예측 계수들의 양자화를 실행하도록 구성될 수 있다. 선택적으로, 선형 예측 계수들 상으로의 정보가 데이터 스트림(30) 내에 전달되는 업데이트 비율을 감소시키기 위하여 일부 보간이 사용될 수 있다. 따라서, 스펙트럼 도메인 형상기(22)로 들어가는 현재 스펙트럼에 관한 선형 예측 계수들이 일부 가중 과정을 받는데 책임이 있는 뒤따르는 모듈(46)은 그것들이 또한 디코딩 면에서 이용가능한 것과 같이 선형 예측 계수들로의 액세스, 즉, 양자화된 선형 예측 계수들로의 액세스를 갖는다. 뒤따르는 모듈(46)은 가중된 선형 예측 계수들을, 그리고 나서 인바운드 현재 스펙트럼을 스펙트럼으로 형상화하기 위하여 주파수 도메인 잡음 형상기 모듈(48)에 의해 적용되는, 스펙트럼 가중들로 전환한다.
위의 설명으로부터 자명한 것과 같이, 분석기(20)에 의해 실행되는 선형 예측 분석은 블록들(10 및 22)에서 실행되는 스펙트럼 분해 및 스펙트럼 도메인 형상화를 완전히 더하는 오버헤드를 야기하며, 따라서 계산적 오버헤드가 상당하다.
도 2는 상당한 코딩 효율을 제공하나, 감소된 코딩 복잡도를 갖는 본 발명의 일 실시 예에 따른 오디오 인코더를 도시한다.
간단히 설명하면, 본 발명의 일 실시 예를 도시한 도 2의 인코더에서, 도 1의 선형 예측 분석기는 스펙트럼 분해기(10) 및 스펙트럼 도메인 형상기(22) 사이에 직렬로 연결되는 연속되는 자기상관 컴퓨터(50) 및 선형 예측 계수 컴퓨터(52)에 의해 대체된다. 도 1로부터 도 2의 변형을 위한 동기 및 모듈의 상세한 기능을 나타내는 수학적 설명이 다음에서 제공될 것이다. 그러나, 도 2의 오디오 인코더의 계산적 오버헤드는 자기상관 및 자기상관 이전에 윈도우잉과 관련된 계산들의 시퀀스와 비교할 때 자기상관 컴퓨터(50)가 덜 복잡한 계산들에 관여하는 것을 고려하면 도 1의 오디오 인코더와 비교하여 감소되는 것은 자명하다.
도 2의 실시 예의 상세한 설명 및 수학적 프레임워크를 설명하기 전에, 도 2의 오디오 인코더의 구조가 간단히 설명된다. 특히, 일반적으로 참조 부호 60을 사용하여 표시되는 도 2의 오디오 인코더는 입력 오디오 신호를 수신하기 위한 입력(62) 및 오디오 인코더가 입력 오디오 신호(12)를 인코딩하려는 데이터 스트림(30)을 출력하기 위한 출력(64)을 포함한다. 스펙트럼 분해기, 일시적 잡음 형상기(temporal noise shaper, TNS, 26), 스펙트럼 도메인 형상기(22), 저주파수 강조기(low frequency emphasizer, 28) 및 양자화기(24)는 언급된 순서대로 입력(62) 및 출력(64) 사이에서 직렬로 연결된다. 일시적 잡음 형상기(26) 및 저주파수 강조기(28)는 선택적 모듈이며, 대안의 실시 예에 따라 빠질 수 있다. 만일 존재하면, 일시적 잡음 형상기(26)는 활성 가능한 적응적으로 존재할 수 있는데, 즉, 일시적 잡음 형상기(26)에 의한 일시적 잡음 형상은 예를 들면, 아래에 더 상세히 설명될 것과 같이 데이터 스트림(30)을 거쳐 디코딩 면으로 전달되려는 판정의 결과 함께, 입력 오디오 신호의 특성에 따라 활성화될 수 있거나 또는 불활성화될 수 있다.
도 1에 도시된 것과 같이, 도 2의 스펙트럼 도메인 형상기(22)는 도 1과 관련하여 설명된 것과 같이 내부적으로 재구성된다. 그러나, 도 2의 내부적 구성이 중요한 문제로 해석되어서는 안 되며 스펙트럼 도메인 형상기의 내부적 구조는 도 2에 도시된 정확한 구조와 비교될 때 또한 다를 수 있다.
도 2의 선형 예측 계수 컴퓨터(52)는 한편으로는 자기상관 컴퓨터 및 다른 한편으로는 스펙트럼 도메인 형상기(22) 사이에 직렬로 연결되는 래그 윈도우어(lag windower, 38) 및 선형 예측 계수 추정기(linear prediction coefficient estimator, 40)를 포함한다. 예를 들면, 래그 윈도우어는 선택적 특징이라는 것을 이해하여야 한다. 만일 존재하면, 자기상관 컴퓨터(50)에 의해 제공되는 개별 자기상관들 상에 래그 윈도우어(38)에 의해 적용되는 윈도우는 가우스(Gaussian) 또는 바이모달(bimodal) 형태의 윈도우일 수 있다. 선형 예측 계수 추정기(40)와 관련하여, 이는 반드시 위너-레빈슨-더빈 알고리즘을 사용할 필요는 없다. 오히려, 선형 예측 계수들을 계산하기 위하여 서로 다른 알고리즘이 사용될 수 있다.
내부적으로, 자기상관 컴퓨터(50)는 파워 스펙트럼 컴퓨터(power spectrum computer, 54), 그 뒤에 스케일 와퍼(scale warper)/스펙트럼 가중기(56), 차례로 그 뒤에 역 변환기(58)를 포함한다. 모듈들(54 내지 58)의 순서의 상세한 설명 및 중요성은 아래에 더 상세히 설명될 것이다.
형상기(22) 내의 스펙트럼 도메인 잡음 형상화뿐만 아니라 선형 예측 계수 계산 모두를 위하여 분해기(10)의 스펙트럼 분해를 공동 사용하는 것이 어떻게 가능한지를 이해하기 위하여, 이산 푸리에 변환(DFT)을 사용하여 자기상관이 계산될 수 있는 위너-힌친(Wierner-Khinichin) 정리가 고려되어야만 한다:
여기서
따라서, Rm은 이산 푸리에 변환이 Xk인 신호의 부분(xn)의 자기상관의 자기상관 계수들이다.
따라서, 만일 스펙트럼 분해기(10)가 겹침 변환을 구현하고 입력 오디오 신호(12)의 일련의 스펙트럼을 발생시키기 위하여 이산 푸리에 변환을 사용할 수 있으면, 자기상관 계산기(50)는 단지 방금 설명된 위너-힌친 정리를 따름으로써 그것의 출력에서 자기상관의 빠른 계산을 실행할 수 있다.
만일 자기상관의 모든 래그들을 위한 값이 필요하면, 스펙트럼 분해기(10)의 이산 푸리에 변환은 고속 푸리에 변환을 사용하여 실행될 수 있고 방금 설명된 공식을 사용하여 그것으로부터 자기상관을 유래하기 위하여 자기상관 컴퓨터(50) 내에서 역 고속 푸리에 변환이 사용될 수 있다. 그러나, M《 N 형태들이 필요할 때만, 스펙트럼 분해를 위한 고속 푸리에 변환을 사용하는 것이 빠를 수 있으며 관련 자기상관 계수들을 획득하기 위하여 역 이산 푸리에 변환을 직접 적용할 수 있다.
위에서 설명된 이산 푸리에 변환이 홀수 이산 푸리에 변환(ODFT), 즉,시간 시퀀스(x)의 일반화된 이산 푸리에 변환이 다음과 같이 정의되는, 홀수 주파수 이산 푸리에 변환으로 대체될 때 동일하게 적용된다:
그리고 홀수 이산 푸리에 변환을 위하여 다음이 설정된다:
a = 0 b=½
그러나, 만일 이산 푸리에 변환 또는 고속 푸리에 변환보다 변형 이산 코사인 변환이 도 2의 실시 예에서 사용되면, 이는 달라진다. 변형 이산 코사인 변환은 타입 Ⅳ의 이산 코사인 변환을 포함하고 실수치의(real-valued) 스펙트럼만을 드러낸다. 즉, 위상 정보는 이러한 변환에 의해 손실된다. 변형 이산 코사인 변환은 다음과 같이 나타낼 수 있다:
여기서 n=0..., 2N-1을 갖는 xn은 윈도우어(12)에 의한 출력으로서 입력 오디오 신호(12)의 현재 윈도우잉된 부분을 정의하고 Xk는 따라서 이러한 윈도우잉된 부분을 위하여 결과로서 생기는 스펙트럼의 k번째 스펙트럼 계수이다.
파워 스펙트럼 컴퓨터(54)는 다음에 따라 각각의 변환 계수(Xk)를 제곱함으로써 변형 이산 코사인 변환의 출력으로부터 파워 스펙트럼을 계산한다:
Xk에 의해 정의되는 변형 이산 코사인 변환 및 홀수 이산 푸리에 변환 스펙트럼(Xk ODFT) 사이의 관계는 다음과 같이 나타낼 수 있다:
이는 변형 이산 코사인 변환을 자기상관 과정에 실행하는 자기상관 컴퓨터(50)를 위한 입력으로서 홀수 이산 푸리에 변환 대신에 변형 이산 코사인 변환의 사용이 다음의 스펙트럼 가중을 갖는 홀수 이산 푸리에 변환으로부터 획득된 자기상관과 동등하다는 것을 의미한다:
그러나, 자기상관의 이러한 왜곡은 형상기(22) 내의 스펙트럼 도메인 형상화가 스펙트럼 분해기(10) 중의 하나와 같은, 주로 변형 이산 코사인 변환과 같이 정확하게 동일한 스펙트럼에서 발생하기 때문에 디코딩 면을 위하여 투명하다. 바꾸어 말하면, 도 2의 주파수 도메인 잡음 형상기(48)에 의한 주파수 도메인 잡음 형상화가 변형 이산 코사인 변환 내에서 적용되기 때문에, 스펙트럼 가중이 변형 이산 코사인 변환의 변조를 제거하고 도 1에 도시된 것과 같은 종래의 선형 예측 코딩과 유사한 결과를 생산하는 이러한 효율적인 수단들은 변형 이산 코사인 변환이 홀수 이산 푸리에 변환으로 대체될 때 생산할 수 있다.
따라서, 자기상관 컴퓨터(50) 내에서 역 변환기(58)는 역 홀수 이산 푸리에 변환을 실행하고 대칭적인 실제 입력의 역 홀수 이산 푸리에 변환은 이산 코사인 변환(DCT) 타입 Ⅱ와 동일하다:
따라서, 이는 도 2의 자기상관 컴퓨터(50) 내의 변형 이산 코사인 변환 기반 선형 예측 코딩의 빠른 계산을 허용하는데, 그 이유는 역 변환기(58)의 출력에서 역 홀수 이산 푸리에 변환에 의해 결정되는 것과 같은 자기상관은 방금 설명된 역 변환기(58) 내의 파워 스펙트럼 컴퓨터(54) 및 역 홀수 이산 푸리에 변환의 곱셈과 같은 아주 작은 계산 단계들만이 필요한 것과 같이 상대적으로 낮은 계산 비용이 들기 때문이다.
스케일 와퍼/스펙트럼 가중기(56)에 관하여 아직 상세히 설명되지 않았다. 특히, 이러한 모듈은 선택적이고 제외될 수 있거나 또는 주파수 도메인 간축기(frequency domain decimator)로 대체될 수 있다. 모듈(56)에 의해 실행되는 가능한 측정들에 관한 상세한 설명이 다음에서 설명된다. 그러나, 그 전에, 도 2에 도시된 일부 다른 구성요소에 대한 일부 상세 내용이 설명된다. 예를 들면, 래그 윈도우어(38)와 관련하여, 이는 추정기(40)에 의해 실행되는 선형 예측 계수 추정의 상태를 향상시키기 위하여 백색 잡음(white noise) 보상을 실행할 수 있다는 것을 이해하여야 한다. 모듈(46) 내에 실행된 선형 예측 코딩 가중은 선택적이나, 만일 존재하면, 이는 실제 대역폭 확장을 달성하도록 실행될 수 있다. 즉, 선형 예측 코딩의 극들은 예를 들면 다음과 같은 상수 팩터에 의해 오리진(origin)을 향하여 이동된다.
따라서, 실행된 선형 예측 코딩은 동시 마스킹(simultaneous masking)을 계산한다. 상수 γ=0.92 또는 0.85 및 0.95 사이의 어느 부분 모두 뛰어난 결과를 생산한다.
모듈(42)과 관련하여 데이터 스트림(30) 내로의 선형 예측 계수들에 관한 정보를 인코딩하기 위하여 가변 비트레이트 코딩 또는 일부 다른 엔트로피 코딩 방식이 사용될 수 있다는 것을 이해하여야 한다. 위에서 이미 설명된 것과 같이, 양자화는 선 스펙트럼 쌍/선 스펙트럼 주파수 도메인 내에서 실행될 수 있으나, 이미턴스 스펙트럼 쌍/이미턴스 스펙트럼 주파수 도메인이 또한 실현 가능하다.
변형 이산 코사인 변환 도메인의 경우에 변형 이산 코사인 변환 이득들로 불리는 스펙트럼 가중 값들 내로 전환시키는 선형 예측 코딩-대-변형 이산 코사인 변환 모듈(46)과 관련하여 예를 들면, 이러한 변환이 상세히 설명된 통합 음성 및 오디오 코덱에서 참조된다. 간단히 설명하면, 선형 예측 코딩 계수들은 변형 이산 코사인 변환 이득들을 획득하기 위하여 홀수 이산 푸리에 변환의 대상이 될 수 있는데, 그 역(inverse)은 그리고 나서 결과로서 생기는 가중들을 스펙트럼의 각각의 대역들 상으로 적용함으로써 모듈(48) 내의 스펙트럼을 형상화하기 위한 가중들과 같이 사용될 수 있다. 예를 들면, 16 선형 예측 계수들은 변형 이산 코사인 변환 이득들로 전환된다. 자연적으로, 반대를 사용하는 가중 대신에, 비-역(inverted) 형태의 변형 이산 코사인 변환 이득들을 사용하는 가중이 위에서 이미 설명된 것과 같은 양자화 잡음을 획득하기 위하여 선형 예측 코딩 합성 필터와 유사한 전달 함수를 획득하도록 디코더 면에서 사용된다. 따라서, 요약하면, 모듈(46) 내에서, 주파수 도메인 잡음 형상기(FDNS, 48)에 의해 사용되는 이득들은 홀수 이산 푸리에 변환을 사용하여 선형 예측 계수들로부터 획득되고 변형 이산 코사인 변환을 사용하는 경우에 변형 이산 코사인 변환으로 불린다.
완성을 위하여, 도 3은 데이터 스트림(30)으로부터 다시 오디오 신호를 재구성하기 위하여 사용될 수 있는 오디오 디코더를 위한 가능한 구현들을 도시한다. 도 3의 디코더는 선택적인, 저주파수 탈강조기(de-emphasizer, 80), 스펙트럼 도메인 탈형상기(82), 또한 선택적인, 일시적 잡음 탈형상기(84), 및 데이터 스트림(30)이 들어가는 오디오 디코더의 데이터 스트림 입력(88) 및 재구성된 오디오 신호가 출력되는 오디오 디코더의 출력(90) 사이에 직렬로 연결되는, 스펙트럼-대-시간 도메인 전환기(86)를 포함한다. 저주파수 탈강조기는 데이터 스트림으로부터 합성되고 스펙트럼으로 형상화된 스펙트럼을 수신하고 그것에 대해 필터링을 실행하는데, 이는 도 2의 저주파수 강조기의 전달 함수에 반비례한다. 그러나, 이미 설명된 것과 같이, 탈강조기(80)는 선택적이다.
스펙트럼 도메인 탈형상기(82)는 도 2의 스펙트럼 도메인 형상기(22)와 매우 유사한 구조를 갖는다. 특히, 내부적으로 이는 연속되는 선형 예측 코딩 추출기(92), 도 4의 선형 예측 코딩 가중기(44)와 동일한 선형 예측 코딩 가중기(94), 또한 도 2의 모듈(46)과 동일한, 선형 예측 코딩-대-변형 이산 코사인 변환 전환기(96), 및 도 2의 주파수 도메인 잡음 형상기(48)에 역으로 인바운드(탈양자화된) 스펙트럼 상으로, 즉, 선형 예측 추출기(92)에 의해 데이터 스트림(30)으로부터 추출되는 선형 예측 계수들의 선형 예측 합성 필터와 상응하는 전달 함수를 획득하기 위하여 나눗셈보다는 곱셈에 의해 변형 이산 코서인 변환 이득들을 적용하는 주파수 도메인 잡음 형상기(98)를 포함한다. 선형 예측 코딩 추출기(92)는 재구성되려는 오디오 신호의 연속적으로 상호 오버래핑하는 부분들을 위하여 데이터 스트림(30) 내로 코딩되는 개별 스펙트럼들을 위한 선형 예측 계수들을 획득하기 위하여 선 스펙트럼 쌍/선 스펙트럼 주파수 또는 이미턴스 스펙트럼 쌍/이미턴스 스펙트럼 주파수와 같은 상응하는 양자화 도메인으로부터 위에서 설명된 재변환을 실행할 수 있다.
시간 도메인 잡음 형상기(84)는 도 2의 모듈의 필터링을 뒤바꾸며, 이러한 모듈들을 위한 가능한 구현들이 아래에 더 상세히 설명된다. 그러나, 어떤 경우라도, 도 3의 일시적 잡음 형상기 모듈(84)은 선택적이고 또한 도 2의 일시적 잡음 형상기 모듈(26)과 관련하여 언급된 것과 같이 버려질 수 있다.
스펙트럼 컴포저(spectrum composer, 86)는 내부적으로, 예를 들면 역 변형 이산 코사인 변환을 개별적으로 인바운드 탈형상화된 스펙트럼 상으로 실행하기 위한 역 변환기(100), 그 뒤에 이들 사이에 시간 에일리어싱 제거를 실행하고 출력(90)에서 재구성되는 오디오 신호를 출력하기 위하여 재변환기(100)에 의해 출력되는 재구성된 윈도우잉된 버전들을 정확하게 일시적으로 등록하도록 구성되는 오버랩-가산 가산기(102)와 같은 에일리어싱 제거기를 포함한다.
위에서 이미 설명된 것과 같이, 데이터 스트림(30) 내에 전달된 선형 예측 코딩 계수들에 의해 정의되는 선형 예측 코딩 분석 필터와 상응하는 전달 함수에 따른 스펙트럼 도메인 형상화(22) 때문에, 양자화기(24) 내의 양자화, 예를 들면, 스펙트럼으로 평탄한(flat) 잡음은 마스킹 한계점 아래에 감춰지도록 하는 방법으로 디코딩 면에서 스펙트럼 도메인 탈형상기(82)에 의해 형상화된다.
디코더에서 일시적 잡음 형상기 모듈(26) 및 그 반대, 주로 모듈(84)을 구현하기 위하여 서로 다른 가능성들이 존재한다. 일시적 잡음 형상은 스펙트럼 도메인 형상기에 의해 스펙트럼으로 형성되는 개별 스펙트럼이 언급되는 시간 부분들 내의 일시적 의미로 잡음을 형상화하기 위한 것이다. 일시적 잡음 형상은 현재 스펙트럼이 언급하는 각각의 시간 도메인 부분 내에 존재하는 트랜지언트들의 경우에 특히 유용하다. 특정 실시 예에 따라, 일시적 잡음 형상기(26)는 스펙트럼 크기를 따라 스펙트럼 분해기(10)에 의해 출력되는 현재 스펙트럼 또는 스펙트럼의 시퀀스를 예측으로 필터링하도록 구성되는 스펙트럼 예측기로서 구현된다. 즉, 스펙트럼 예측기(26)는 또한 데이터 스트림(30) 내로 삽입될 수 있는 예측 필터 계수들을 결정한다. 이는 도 2의 쇄선에 의해 도시된다. 그 결과, 일시적 잡음 필터링된 스펙트럼은 스펙트럼 크기를 따라 평탄화되고 스펙트럼 도메인 및 시간 도메인 사이의 관계 대문에, 데이터 스트림(30) 내로 전송된 시간 도메인 잡음 형상 예측 필터들에 따른 시간 도메인 잡음 탈형상기(84) 내의 역 필터링, 탈형상화는 공격 또는 트랜지언트들이 발생하는 시간들 또는 시간 내의 잡음의 슴김 또는 압축에 이르게 한다. 그렇게 함으로써 이른바 전 에코(pre-echo)들이 방지된다.
바꾸어 말하면, 시간 도메인 잡음 형상기(26) 내의 현재 스펙트럼을 예측으로 필터링함으로써, 시간 도메인 잡음 형상기(26)는 스펙트럼 리마인더(spectrum reminder)로서, 즉, 스펙트럼 도메인 형상기(22)로 전달되는 예측으로 필터링된 스펙트럼으로서 획득되는데, 상응하는 예측 계수들이 데이터 스트림(30) 내로 삽입된다. 시간 도메인 잡음 탈형상기(84)는 차례로, 스펙트럼 도메인 탈형상기(82)로부터 탈형상화된 스펙트럼을 수신하고 데이터 스트림으로부터 수신되거나 또는 데이터 스트림(30)으로부터 추출되는 예측 필터들에 따라 이러한 스펙트럼을 역으로 필터링함으로써 스펙트럼 도메인을 따라 시간 도메인 필터링을 뒤바꾼다. 바꾸어 말하면, 시간 도메인 잡음 형상기(26)는 선형 예측 필터와 같은 분석 예측 필터를 사용하고, 반면에 시간 도메인 잡음 탈형상기(84)는 동일한 예측 계수들을 기초로 하여 상응하는 합성 필터를 사용한다.
이미 설명된 것과 같이, 오디오 인코더는 현재 스펙트럼과 상응하는 각각의 시간 부분에서 오디오 입력 신호(12)의 필터 예측 이득 또는 조성(tonality) 또는 일시성(transiency)에 따라 일시적 잡음 형상을 가능하게 하거나 불가능하게 하는 것을 판정하도록 구성된다. 다시, 판정에 대한 각각의 정보는 데이터 스트림(30) 내로 삽입된다.
다음에서, 자기상관 컴퓨터(50)가 도 2에 도시된 것과 같이 필터링되지 않은 스펙트럼보다는 예측으로 필터링된, 즉, 일시적 잡음 형상기-필터링된, 스펙트럼의 버전으로부터 자기상관을 계산하도록 구성되는 가능성이 논의된다. 두 가지 가능성이 존재한다. 일시적 접음 형상-필터링된 스펙트럼들은 일시적 잡음 형상기가 적용될 때마다 사용될 수 있거나, 또는 예를 들면, 인코딩되려는 입력 오디오 신호(12)의 특성들을 기초로 하여 오디오 인코더에 의해 선택되는 방식으로 사용될 수 있다. 따라서, 도 4의 오디오 인코더는 자기상관 컴퓨터(50)의 입력이 스펙트럼 분해기(10)의 출력뿐만 아니라 일시적 잡음 형상기 모듈(26)이 출력 모두에 연결된다는 점에서 도 2의 오디오 인코더와 다르다. 방금 언급된 것과 같이, 스펙트럼 분해기(10)에 의해 출력되는 것과 같이 일시적 잡음 형상기-필터링된 변형 이산 코사인 변환 스펙트럼은 컴퓨터(50) 내의 자기상관 계산을 위한 입력 또는 기초로서 사용될 수 있다. 방금 언급된 것과 같이, 일시적 잡음 형상기-필터링된 스펙트럼은 일시적 잡음 형상기가 적용될 때마다, 사용될 수 있거나 또는 오디오 인코더는 필터링되지 않은 스펙트럼 또는 일시적 잡음 형상기-필터링된 스펙트럼의 사용 사이에서 일시적 잡음 형상기가 적용된 스펙트럼을 위하여 판정할 수 있다. 판정은 위에서 설명된 것과 같이, 오디오 입력 신호의 특성들에 따라 만들어질 수 있다. 그러나, 판정은 디코더를 위하여 투명하며, 이는 단지 주파수 도메인 탈형상화를 위한 선형 예측 코딩 계수 정보를 적용한다. 또 다른 가능성은 일시적 잡음 형상기가 적용되는 스펙트럼을 위하여, 즉, 스펙트럼 분해기(10)의 선택된 변환 길이에 따라, 이러한 스펙트럼들을 위한 이러한 두 가지 선택 사이에서의 판정을 위하여 오디오 인코더가 일시적 잡음 형상기-필터링된 스펙트럼 및 필터링되지 않은 스펙트럼 사이를 전환시키는 것일 수 있다.
더 정확히 설명하면, 도 4의 분해기(10)는 입력 오디오 신호를 스펙트럼으로 분해하는데 있어서 서로 다른 변환 길이 사이에서 전환하도록 구성될 수 있는데 따라서 스펙트럼 분해기(10)에 의해 출력되는 스펙트럼은 서로 다른 스펙트럼 해상도일 수 있다. 즉, 스펙트럼 분해기(10)는 서로 다른 길이의 상호 오버래핑하는 부분들을 또한 다양한 길이의 변환들 또는 스펙트럼들 상으로 변환하기 위하여, 상응하는 오버래핑 시간 부분들의 길이와 상응하는 스펙트럼의 변환 길이로, 예를 들면, 변형 이산 코사인 변환과 같은 겹침 변환을 사용할 수 있다. 그러한 경우에 있어서, 자기상관 컴퓨터(50)는 현재 스펙트럼의 스펙트럼 해상도가 미리 결정된 기준을 충족하는 경우에 예측으로 필터링되거나 또는 일시적 잡음 형상기-필터링된 현재 스펙트럼으로부터, 또는 현재 스펙트럼의 스펙트럼 해상도가 미리 결정된 기준을 충족시키지 못하는 경우에 예측으로 필터링되지 않은, 즉, 필터링되지 않은 현재 스펙트럼으로부터 자기상관을 계산하도록 구성될 수 있다. 미리 결정된 기준은 예를 들면, 현재 스펙트럼의 스펙트럼 해상도가 일부 한계값을 초과하는 것일 수 있다. 예를 들면, 자기상관 계산을 위하여 일시적 잡음 형상기 모듈(26)에 의해 출력되는 것과 같은 일시적 잡음 형상기-출력된 스펙트럼의 사용은 15 ms보다 긴 프레임들과 같은 긴 프레임들(시간 부분들)을 위하여 유용하나, 예를 들면 15 ms 이하의 짧은 프레임을 위하여 바람직하지 않을 수 있으며, 따라서, 긴 프레임들을 위한 자기상관 컴퓨터(50) 내로의 입력은 일시적 잡음 형상기-필터링된 변형 이산 코사인 변환일 수 있으며, 반면에 짧은 프레임들을 위하여 분해기(10)에 의해 출력되는 것과 같은 변형 이산 코사인 변환 스펙트럼이 직접 사용될 수 있다.
아직까지, 인지적으로 관련된 변형들이 모듈(46)의 내의 파워 스펙트럼 상으로 실행되는 것이 설명되지 않았다. 이제 다양한 측정들이 설명되며, 그것들은 개별적으로 또는 결합하여 모든 실시 예들 및 지금까지 설명된 변형들에 적용될 수 있다. 특히, 스펙트럼 가중이 모듈(46)에 의해 파워 스펙트럼 컴퓨터(54)에 의해 출력되는 파워 스펙트럼 상으로 적용될 수 있다. 스펙트럼 가중은 다음과 같을 수 있다:
여기서 Sk는 위에서 이미 설명된 것과 같이 파워 스펙트럼의 계수들이다.
스펙트럼 가중은 음향심리학적 양상들에 따라 양자화 잡음들을 분산시키기 위한 메커니즘으로서 사용될 수 있다. 도 1에서의 전-강조와 상응하는 스펙트럼 가중이 다음에 의해 정의될 수 있다:
게다가, 스케일 와핑(scale warping)이 모듈(56) 내에서 사용될 수 있다. 전 스펙트럼은 예를 들면, l1의 샘플 길이의 프레임들 또는 시간 부분들과 상응하는 스펙트럼을 위한 M 대역들 및 l2의 샘플 길이를 갖는 프레임들의 시간 부분들과 상응하는 2M 대역들로 세분될 수 있는데, l2는 l1의 두 배일 수 있고, l1은 64, 128, 256일 수 있다. 특히, 나눗셈이 따를 수 있다:
대역 세분은 다음에 따른 바크 스케일(Bark scale)의 근사치에 대한 주파수 와핑을 포함할 수 있다:
대안으로서 대역들은 다음에 따른 선형 스케일을 형성하도록 동등하게 분포될 수 있다:
예를 들면, l1 길이의 프레임들의 스펙트럼들을 위하여, 대역들의 수는 20과 40 사이, 및 l2 길이의 프레임들에 속하는 스펙트럼을 위하여 48과 72 사이일 수 있는데, l1 길이의 프레임들의 스펙트럼들을 위한 32 대역 및 l2 길이의 프레임들의 스펙트럼들을 위한 64 대역이 바람직하다.
선택적인 모듈(56)에 의해 선택적으로 실행되는 것과 같은 스펙트럼 가중 및 주파수 와핑은 비트 할당(양자화 잡음 형상)의 수단으로서 고려될 수 있다. 전-강조와 상응하는 선형 스케일 내의 스펙트럼 가중은 μ=0.9 또는 0.8 및 0.95 사이에 있는 상수인 상수를 사용하여 실행될 수 있는데, 따라서 상응하는 전-강조는 대략 바크 스케일 와핑과 상응한다.
모듈(56) 내의 파워 스펙트럼의 변형은 파워 스펙트럼의 확산, 동시 마스킹의 모델링을 포함할 수 있으며, 따라서 선형 예측 코딩 가중 모듈들(44 및 94)을 대체한다.
만일 선형 스펙트럼이 사용되고 전-강조와 상응하는 스펙트럼 가중이 적용되면, 디코더 면에서, 즉 도 3의 오디오 디코더의 입력에서 획득되는 것과 같은 도 4의 오디오 인코더의 결과들은 도 1의 실시 예에 따라 획득되는 것과 같은 종래의 결과와 인지적으로 매우 유사하다.
일부 청취 테스트 결과들이 위에서 확인된 실시 예들을 사용하여 실행되었다. 테스트들로부터, 도 1에 도시된 것과 같은 종래의 선형 예측 코딩 분석 및 선형 스케일 변형 이산 코사인 변환 기반 선형 예측 코딩 분석은 다음과 같을 때 인지적으로 동등한 결과를 생산하였다:
종래의 선형 예측 코딩 분석 및 변형 이산 코사인 변환 기반 선형 예측 코딩 분석 사이의 사소한 차이는 아마도 선형 예측 코딩이 양자화 잡음 형상화를 위하여 사용되고 변형 이산 코사인 변환 계수들을 충분히 정확하게 코딩하는데 48 kbit/s로 충분한 비트들이 존재한다는 사실로부터 온다.
또한, 모듈(56) 내의 스케일 와핑의 적용에 의한 바크 스케일 또는 비-선형 스케일의 사용은 어떤 바크 스케일이 오디오 피스(piece)들 팻보이(Fatboy), 록유(RockYou), 웨이팅(Waiting), 보헤미안(bohemian), 푸거프리마이크(fuguepremikres), 크라프트베그크(Kraftwerk), 레스볼레루스(lesvolerus), 티어드롭(teardrop)을 위한 선형 스케일을 실행하는지에 따라 코딩 효율 또는 청취 테스트 결과들울 야기한다.
바크 스케일은 하키 및 린치핀(linchoin)에 대해서는 형편없이 실패한다. 바크 스케일에서 문제들을 갖는 또 다른 아이템은 비비로로(bibilolo)이나, 이는 그것이 특정 스펙트럼 구조를 갖는 실험 음악을 나타내기 때문에 테스트 내에 포함되지 않는다. 일부 청취자들이 또한 비비로로 아이템에 대하여 강한 혐오감을 표시하였다.
그러나, 도 2 및 4의 오디오 인코더를 위하여 서로 다른 스케일들 사이에서 전환하는 것이 가능하다. 즉, 모듈(56)은 잠시성 또는 조성과 같은 오디오 신호의 특성들에 따라 서로 다른 스펙트럼들을 위한 서로 다른 스케일을 적용할 수 있거나 또는 다중 양자화된 신호를 생산하기 위한 서로 다른 스케일 및 양자화된 신호들 중 어떠한 것이 인지적으로 최상인지를 결정하기 위한 측정을 사용할 수 있다. 스케일 전환이 두 비-전환된 버전(바크 및 선형 스케일)과 비교할 때 록유(RockYou) 및 린치핀 내의 트랜지언트들과 같은 트랜지언트들의 존재 하에서 향상을 야기한다는 것이 밝혀졌다.
위에서 설명된 실시 예들은 대부 부호 여진 선형 예측을 지원하는 코덱과 같은 다중 방식 오디오 코덱 내의 변환 코딩 여진 방식 및 변환 코딩 여진 유사 방식으로 위에서 설명된 실시 예에서와 같이 사용될 수 있다는 것을 이해하여야 한다. 프레이밍(frasming)으로서, 20 ms와 같은 일정한 길이의 프레임들이 사용될 수 있다. 이러한 방법으로, 매우 효율적인 통합 음성 및 오디오 코덱의 저지연 버전의 종류가 획득될 수 있다. 일시적 잡음 형상기로서, 고급 오디오 코딩-향상된 저지연(ELD)로부터의 일시적 잡음 형상기가 사용될 수 있다. 부가 정보를 위하여 사용되는 비트의 수를 감소시키기 위하여 필터들의 수는 하나는 600 ㎐ 내지 4500 ㎐ 사이에서 운용되고 두 번째는 4500 ㎐부터 코어 코더 스펙트럼의 끝까지 운용되는, 2로 고정될 수 있다. 필터들은 독립적으로 켜지고 꺼질 수 있다. 필터들은 파코어(parcor) 계수들을 사용하여 격자(lattice)로서 적용되고 전송될 수 있다. 필터의 최대 순차는 8로 설정될 수 있으며 필터 계수 당 4 비트가 사용될 수 있다. 필터의 순차 및 필터 계수들을 위하여 사용되는 비트의 수를 감소시키기 위하여 허프만 코딩이 사용될 수 있다.
장치의 맥락에서 일부 양상들이 설명되었으나, 이러한 양상들은 또한 블록 또는 장치가 방법 단계 또는 방법 단계의 특징에 상응하는, 상응하는 방법의 설명을 나타내는 것이 자명하다. 유사하게, 방법 단계의 맥락에서 설명된 양상들은 또한 상응하는 장치의 상응하는 블록 또는 아이템 또는 특징을 나타낸다. 일부 또는 모든 방법 단계는 예를 들면, 마이크로프로세서, 프로그램가능 컴퓨터 또는 전자 회로 같은, 하드웨어 장치에 의해 실행될 수 있거나 또는 이를 사용할 수 있다. 일부 실시 예들에서, 가장 중요한 방법 단계들 중 일부 하나 또는 그 이상이 그러한 장치에 의해 실행될 수 있다.
특정 구현 필요성에 따라, 본 발명의 실시 예들은 하드웨어 또는 소프트웨어에서 구현될 수 있다. 구현은 디지털 저장 매체, 예를 들면, 거기에 저장되는 전자적으로 판독가능한 신호들을 갖는, 플로피 디스크, DVD, CD, ROM,, PROM, EPROM, EEPROM 또는 플래시 메모리를 사용하여 실행될 수 있는데, 이는 각각의 방법이 실행되는 것과 같이 프로그램가능 컴퓨터 시스템과 협력한다(또는 협력할 수 있다). 따라서 디지털 저장 매체는 컴퓨터로 판독가능할 수 있다.
본 발명에 따른 일부 실시 예들은 여기에 설명된 방법들 중의 하나가 실행되는 것과 같이, 프로그램가능 컴퓨터 시스템과 협력할 수 있는, 전자적으로 판독가능한 제어 신호들을 갖는 비-일시적 데이터 캐리어를 포함한다.
일반적으로, 본 발명의 실시 예들은 프로그램 코드를 갖는 컴퓨터 프로그램 베춤으로서 구현될 수 있는데, 프로그램 코드는 컴퓨터 프로그램 제품이 컴퓨터상에 구동될 때 방법들 중의 하나를 실행하도록 작동할 수 있다. 프로그램 코드는 예를 들면 기계 판독가능 캐리어 상에 저장될 수 있다.
다른 실시 예들은 기계 판독가능 캐리어 상에 저장되는, 여기에 설명된 방법들 중의 하나를 실행하기 위한 컴퓨터 프로그램을 포함한다.
바꾸어 말하면, 따라서 본 발명의 방법의 일 실시 예는 컴퓨터 프로그램이 컴퓨터상에 구동할 때, 여기에 설명된 방법들 중의 하나를 실행하기 위한 프로그램 코드를 갖는 컴퓨터 프로그램이다.
본 발명의 방법의 또 다른 실시 예는 따라서 여기에 설명된 방법들 중의 하나를 실행하기 위하여 그것에 대해 기록된, 컴퓨터 프로그램을 포함하는 데이터 캐리어(또는 디지털 저장 매체, 또는 컴퓨터 판독가능 매체)이다. 데이터 캐리어, 디지털 저장 매체 또는 기록된 매체는 일반적으로 유형(tangible) 및/또는 비전이적일 수 있다.
본 발명의 방법의 또 다른 실시 예는 따라서 여기에 설명된 방법들 중의 하나를 실행하기 위한 컴퓨터 프로그램을 표현하는 신호들의 데이터 스트림 또는 시퀀스이다. 신호들의 데이터 스트림 또는 시퀀스는 예를 들면 데이터 통신 연결, 예를 들면 인터넷을 거쳐 전달되도록 구성될 수 있다.
또 다른 실시 예는 처리 수단들, 예를 들면, 여기에 설명된 방법들 중의 하나를 실행하거나 적용하도록 구성되는 컴퓨터, 또는 프로그램가능 논리 장치를 포함한다.
또 다른 실시 예는 여기에 설명된 방법들 중의 하나를 실행하기 위하여 거기에 설치된 컴퓨터 프로그램을 갖는 컴퓨터를 포함한다.
본 발명에 따른 또 다른 실시 예는 여기에 설명된 방법들 중 하나를 실행하기 위한 컴퓨터 프로그램을 수신기에 전달하도록(예를 들면, 전자적으로 또는 광학적으로) 구성되는 장치 또는 시스템을 포함한다. 수신기는 예를 들면, 컴퓨터, 모바일 기기 등일 수 있다. 장치 또는 시스템은 예를 들면, 컴퓨터 프로그램을 수신기에 전달하기 위한 파일 서버를 포함할 수 있다.
일부 실시 예들에서, 프로그램가능 논리 장치(예를 들면, 필드 프로그램가능 게이트 어레이(field programmable gate array))는 여기에 설명된 방법들의 기능들이 일부 또는 모두를 실행하도록 사용될 수 있다. 일부 실시 예들에서, 필드 프로그램가능 게이트 어레이는 여기에 설명된 방법들 중의 하나를 실행하기 위하여 마이크로프로세서와 협력할 수 있다. 일반적으로, 방법들은 바람직하게는 어떠한 하드웨어 장치에 의해 실행된다.
위에서 설명된 실시 예들은 단지 본 발명의 원리를 설명하기 위한 것이다. 여기에 설명된 배치들 및 내용들의 변형 및 변경들은 통상의 지식을 가진 자들에 자명할 것이라는 것을 이해하여야 한다. 따라서, 본 발명의 실시 예들의 설명에 의해 표현된 특정 상세 내용에 의한 것이 아니라 첨부된 청구항들의 범위에 의해서만 한정되는 것으로 의도된다.
10 : 스펙트럼 분해기
12 : 입력 오디오 신호
14 : 스펙트로그램
16 : 윈도우어
18 : 변형 이산 코사인 변환 모듈
20 : 선형 예측 분석기
22 : 스펙트럼 도메인 형상기
24 : 양자화기
26 : 일시적 잡음 형상화 모듈
28 : 저주파수 강조 모듈
32 :전-강조 모듈
34 : 윈도우어
36 : 자기상관기
38 : 레그 윈도우어
40 : 선형 예측 파라미터 추정기
42 : 선형 예측 계수 데이터 스트림 삽입기
46 :모듈
48 : 주파수 도메인 잡음 형상기 모듈
50 : 자기상관 컴퓨터
52 : 선형 예측 계수 컴퓨터
56 : 스케일 와퍼/스펙트럼 가중기
58 : 역 변환기
60 : 오디오 인코더
62 : 입력
64 : 출력
80 : 저주파수 탈강조기
82 : 스펙트럼 도메인 탈형상기
84 : 일시적 잡음 탈형상기
88 : 입력
90 : 출력
98 : 주파수 도메인 잡음 형상기
100 : 재변환기
102 : 오버랩-가산 가산기
12 : 입력 오디오 신호
14 : 스펙트로그램
16 : 윈도우어
18 : 변형 이산 코사인 변환 모듈
20 : 선형 예측 분석기
22 : 스펙트럼 도메인 형상기
24 : 양자화기
26 : 일시적 잡음 형상화 모듈
28 : 저주파수 강조 모듈
32 :전-강조 모듈
34 : 윈도우어
36 : 자기상관기
38 : 레그 윈도우어
40 : 선형 예측 파라미터 추정기
42 : 선형 예측 계수 데이터 스트림 삽입기
46 :모듈
48 : 주파수 도메인 잡음 형상기 모듈
50 : 자기상관 컴퓨터
52 : 선형 예측 계수 컴퓨터
56 : 스케일 와퍼/스펙트럼 가중기
58 : 역 변환기
60 : 오디오 인코더
62 : 입력
64 : 출력
80 : 저주파수 탈강조기
82 : 스펙트럼 도메인 탈형상기
84 : 일시적 잡음 탈형상기
88 : 입력
90 : 출력
98 : 주파수 도메인 잡음 형상기
100 : 재변환기
102 : 오버랩-가산 가산기
Claims (13)
- 변형 이산 코사인 변환을 사용하여, 오디오 입력 신호(12)를 일련의 스펙트럼의 스펙트로그램(14)으로 스펙트럼으로 분해하기 위한 스펙트럼 분해기(10);
상기 일련의 스펙트럼의 현재 스펙트럼으로부터 자기상관을 계산하도록 구성되는 자기상관 컴퓨터(50);
상기 자기상관을 기초로 하여 선형 예측 계수들을 계산하도록 구성되는 선형 예측 계수 컴퓨터(52);
상기 선형 예측 계수들을 기초로 하여 상기 현재 스펙트럼을 스펙트럼으로 형상화하도록 구성되는 스펙트럼 도메인 형상기(22); 및
상기 스펙트럼으로 형상화된 스펙트럼을 양자화하도록 구성되는 양자화 스테이지(24);를 포함하되,
상기 오디오 인코더는 상기 양자화된 스펙트럼으로 형상화된 스펙트럼 상의 정보 및 상기 선형 예측 계수들 상의 정보를 데이터 스트림 내로 삽입하도록 구성되며,
상기 자기상관 컴퓨터는 상기 현재 스펙트럼으로부터 상기 자기상관을 계산하는데 있어서, 상기 현재 스펙트럼으로부터 파워 스펙트럼을 계산하고, 상기 파워 스펙트럼을 역 홀수 이산 푸리에 변환에 종속시키도록 구성되는 것을 특징으로 하는 오디오 인코더.
- 제 1항에 있어서, 스펙트럼 크기를 따라 상기 현재 스펙트럼을 예측으로 필터링하도록 구성되는 스펙트럼 예측기(26)를 더 포함하며, 상기 스펙트럼 도메인 형상기는 상기 예측으로 필터링된 현재 스펙트럼을 스펙트럼으로 형상화하도록 구성되고, 상기 오디오 인코더는 상기 예측 필터링을 반전하는 방법에 대한 정보를 상기 데이터 스트림 내로 삽입하도록 구성되는 것을 특징으로 하는 오디오 인코더.
- 제 2항에 있어서, 상기 스펙트럼 예측기는 상기 스펙트럼 크기를 따라 상기 현재 스펙트럼 상의 선형 예측 필터링을 실행하도록 구성되고, 상기 오디오 인코더는 상기 예측 필터링을 반전하는 방법에 대한 정보가 나아가 상기 스펙트럼 크기를 따라 상기 현재 스펙트럼 상의 선형 예측 필터링의 기저를 이루는 선형 예측 계수들 상의 정보를 포함하는 것과 같이 구성되는 것을 특징으로 하는 오디오 인코더.
- 제 2항에 있어서, 상기 오디오 인코더는 상기 오디오 입력 신호 또는 필터 예측 이득의 조성 또는 일시성에 따라 상기 스펙트럼 예측기를 가능하게 하거나 또는 불가능하게 하는 것을 판정하도록 구성되고, 상기 오디오 인코더는 상기 판정 상의 정보를 삽입하도록 구성되는 것을 특징으로 하는 오디오 인코더.
- 제 2항에 있어서, 상기 자기상관 컴퓨터는 상기 예측으로 필터링되는 현재 스펙트럼으로부터 자기상관을 계산하도록 구성되는 것을 특징으로 하는 오디오 인코더.
- 제 2항에 있어서, 상기 스펙트럼 분해기(10)는 상기 스펙트럼이 서로 다른 스펙트럼 해상도가 되도록 하기 위하여 상기 오디오 입력 신호(12)를 스펙트럼으로 분해하는데 있어서 서로 다른 변환 길이들 사이에서 전환하도록 구성되며, 상기 자기상관 컴퓨터(50)는 미리 결정된 기준을 충족하는 상기 현재 스펙트럼의 스펙트럼 해상도의 경우에 상기 예측으로 필터링된 현재 스펙트럼으로부터 또는 상기 미리 결정된 기준을 충족하지 않는 상기 현재 스펙트럼의 스펙트럼 해상도의 경우에 상기 예측으로 필터링되지 않은 현재 스펙트럼으로부터 자기상관을 계산하도록 구성되는 것을 특징으로 하는 오디오 인코더.
- 제 6항에 있어서, 상기 자기상관 컴퓨터는 만일 상기 현재 스펙트럼의 상기 스펙트럼 해상도가 스펙트럼 해상도 한계값보다 높으면 상기 미리 결정된 기준이 충족되는 것과 같이 구성되는 것을 특징으로 하는 오디오 인코더.
- 제 1항에 있어서, 상기 자기상관 컴퓨터는 상기 현재 스펙트럼으로부터 상기 자기상관을 계산하는데 있어서, 상기 파워 스펙트럼을 인지적으로 가중하고 상기 파워 스펙트럼을 인지적으로 가중된 것과 같이 상기 역 홀수 이산 푸리에 변환에 종속시키도록 구성되는 것을 특징으로 하는 오디오 인코더.
- 제 8항에 있어서, 상기 자기상관 컴퓨터는 상기 현재 스펙트럼의 주파수 스케일을 변경하고 상기 변경된 주파수 스케일 내의 파워 스펙트럼의 상기 인지 가중을 실행하도록 구성되는 것을 특징으로 하는 오디오 인코더.
- 제 1항에 있어서, 상기 오디오 인코더는 양자화된 형태로 상기 선형 예측 계수들 상의 정보를 상기 데이터 스트림 내로 삽입하도록 구성되며, 상기 스펙트럼 도메인 형상기는 상기 양자화된 선형 예측 계수를 기초로 하여 상기 현재 스펙트럼을 스펙트럼으로 형상화하도록 구성되는 것을 특징으로 하는 오디오 인코더.
- 제 10항에 있어서, 상기 오디오 인코더는 상기 선형 예측 계수들 중 어떠한 양자화가 선 스펙트럼 쌍 또는 선 스펙트럼 주파수 도메인 내에 발생하는가에 따른 형태로 상기 선형 예측 계수들 상의 정보를 상기 데이터 스트림 내로 삽입하는 것을 특징으로 하는 오디오 인코더.
- 변형 이산 코사인 변환을 사용하여, 오디오 입력 신호(12)를 일련의 스펙트럼의 스펙트로그램(14)으로 스펙트럼으로 분해하는 단계;
상기 일련의 스펙트럼의 현재 스펙트럼으로부터 자기상관을 계산하는 단계;
상기 자기상관을 기초로 하여 선형 예측 계수들을 계산하는 단계;
상기 선형 예측 계수들을 기초로 하여 상기 현재 스펙트럼을 스펙트럼으로 형상화하는 단계;
상기 스펙트럼으로 형상화된 스펙트럼을 양자화하는 단계; 및
상기 양자화된 스펙트럼으로 형상화된 스펙트럼 상의 정보 및 상기 선형 예측 계수들 상의 정보를 데이터 스트림 내로 삽입하는 단계;를 포함하되,
상기 현재 스펙트럼으로부터 상기 자기상관의 계산은 상기 현재 스펙트럼으로부터 파워 스펙트럼을 계산하는 단계, 및 상기 파워 스펙트럼을 역 홀수 이산 푸리에 변환에 종속시키는 단계를 포함하는 것을 특징으로 하는 오디오 인코딩 방법.
- 컴퓨터상에 구동될 때, 제 12항에 따른 방법을 실행하기 위한 프로그램 코드를 갖는 컴퓨터 프로그램을 저장한 컴퓨터 판독가능 매체.
Applications Claiming Priority (3)
Application Number | Priority Date | Filing Date | Title |
---|---|---|---|
US201161442632P | 2011-02-14 | 2011-02-14 | |
US61/442,632 | 2011-02-14 | ||
PCT/EP2012/052455 WO2012110476A1 (en) | 2011-02-14 | 2012-02-14 | Linear prediction based coding scheme using spectral domain noise shaping |
Publications (2)
Publication Number | Publication Date |
---|---|
KR20130133848A KR20130133848A (ko) | 2013-12-09 |
KR101617816B1 true KR101617816B1 (ko) | 2016-05-03 |
Family
ID=71943596
Family Applications (1)
Application Number | Title | Priority Date | Filing Date |
---|---|---|---|
KR1020137024237A KR101617816B1 (ko) | 2011-02-14 | 2012-02-14 | 스펙트럼 도메인 잡음 형상화를 사용하는 선형 예측 기반 코딩 방식 |
Country Status (19)
Country | Link |
---|---|
US (1) | US9595262B2 (ko) |
EP (1) | EP2676266B1 (ko) |
JP (1) | JP5625126B2 (ko) |
KR (1) | KR101617816B1 (ko) |
CN (1) | CN103477387B (ko) |
AR (1) | AR085794A1 (ko) |
AU (1) | AU2012217156B2 (ko) |
BR (2) | BR112013020587B1 (ko) |
CA (1) | CA2827277C (ko) |
ES (1) | ES2534972T3 (ko) |
HK (1) | HK1192050A1 (ko) |
MX (1) | MX2013009346A (ko) |
MY (1) | MY165853A (ko) |
PL (1) | PL2676266T3 (ko) |
RU (1) | RU2575993C2 (ko) |
SG (1) | SG192748A1 (ko) |
TW (1) | TWI488177B (ko) |
WO (1) | WO2012110476A1 (ko) |
ZA (1) | ZA201306840B (ko) |
Families Citing this family (22)
Publication number | Priority date | Publication date | Assignee | Title |
---|---|---|---|---|
EP2311034B1 (en) * | 2008-07-11 | 2015-11-04 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Audio encoder and decoder for encoding frames of sampled audio signals |
BR112012007803B1 (pt) * | 2009-10-08 | 2022-03-15 | Fraunhofer-Gesellschaft Zur Forderung Der Angewandten Forschung E.V. | Decodificador de sinal de áudio multimodal, codificador de sinal de áudio multimodal e métodos usando uma configuração de ruído com base em codificação de previsão linear |
EP2707873B1 (en) * | 2011-05-09 | 2015-04-08 | Dolby International AB | Method and encoder for processing a digital stereo audio signal |
PT3121813T (pt) | 2013-01-29 | 2020-06-17 | Fraunhofer Ges Forschung | Preenchimento de ruído sem informação lateral para codificadores do tipo celp |
BR112016022466B1 (pt) * | 2014-04-17 | 2020-12-08 | Voiceage Evs Llc | método para codificar um sinal sonoro, método para decodificar um sinal sonoro, dispositivo para codificar um sinal sonoro e dispositivo para decodificar um sinal sonoro |
KR101837153B1 (ko) * | 2014-05-01 | 2018-03-09 | 니폰 덴신 덴와 가부시끼가이샤 | 주기성 통합 포락 계열 생성 장치, 주기성 통합 포락 계열 생성 방법, 주기성 통합 포락 계열 생성 프로그램, 기록매체 |
EP2980798A1 (en) * | 2014-07-28 | 2016-02-03 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Harmonicity-dependent controlling of a harmonic filter tool |
US10310826B2 (en) * | 2015-11-19 | 2019-06-04 | Intel Corporation | Technologies for automatic reordering of sparse matrices |
SG11201806256SA (en) | 2016-01-22 | 2018-08-30 | Fraunhofer Ges Forschung | Apparatus and method for mdct m/s stereo with global ild with improved mid/side decision |
EP3382701A1 (en) * | 2017-03-31 | 2018-10-03 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Apparatus and method for post-processing an audio signal using prediction based shaping |
EP3483886A1 (en) | 2017-11-10 | 2019-05-15 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Selecting pitch lag |
EP3483878A1 (en) | 2017-11-10 | 2019-05-15 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Audio decoder supporting a set of different loss concealment tools |
WO2019091573A1 (en) | 2017-11-10 | 2019-05-16 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Apparatus and method for encoding and decoding an audio signal using downsampling or interpolation of scale parameters |
WO2019091576A1 (en) | 2017-11-10 | 2019-05-16 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Audio encoders, audio decoders, methods and computer programs adapting an encoding and decoding of least significant bits |
EP3483879A1 (en) | 2017-11-10 | 2019-05-15 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Analysis/synthesis windowing function for modulated lapped transformation |
EP3483880A1 (en) | 2017-11-10 | 2019-05-15 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Temporal noise shaping |
EP3483884A1 (en) | 2017-11-10 | 2019-05-15 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Signal filtering |
EP3483882A1 (en) | 2017-11-10 | 2019-05-15 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Controlling bandwidth in encoders and/or decoders |
EP3483883A1 (en) | 2017-11-10 | 2019-05-15 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Audio coding and decoding with selective postfiltering |
EP4336497A3 (en) | 2018-07-04 | 2024-03-20 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Multisignal encoder, multisignal decoder, and related methods using signal whitening or signal post processing |
DE102020210917B4 (de) | 2019-08-30 | 2023-10-19 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung eingetragener Verein | Verbesserter M/S-Stereo-Codierer und -Decodierer |
CA3184222A1 (en) | 2020-07-07 | 2022-01-13 | Goran MARKOVIC | Audio decoder, audio encoder, and related methods using joint coding of scale parameters for channels of a multi-channel audio signal |
Family Cites Families (211)
Publication number | Priority date | Publication date | Assignee | Title |
---|---|---|---|---|
CA2568984C (en) | 1991-06-11 | 2007-07-10 | Qualcomm Incorporated | Variable rate vocoder |
US5408580A (en) | 1992-09-21 | 1995-04-18 | Aware, Inc. | Audio compression system employing multi-rate signal analysis |
SE501340C2 (sv) | 1993-06-11 | 1995-01-23 | Ericsson Telefon Ab L M | Döljande av transmissionsfel i en talavkodare |
BE1007617A3 (nl) | 1993-10-11 | 1995-08-22 | Philips Electronics Nv | Transmissiesysteem met gebruik van verschillende codeerprincipes. |
US5657422A (en) | 1994-01-28 | 1997-08-12 | Lucent Technologies Inc. | Voice activity detection driven noise remediator |
US5784532A (en) | 1994-02-16 | 1998-07-21 | Qualcomm Incorporated | Application specific integrated circuit (ASIC) for performing rapid speech compression in a mobile telephone system |
US5684920A (en) * | 1994-03-17 | 1997-11-04 | Nippon Telegraph And Telephone | Acoustic signal transform coding method and decoding method having a high efficiency envelope flattening method therein |
US5568588A (en) | 1994-04-29 | 1996-10-22 | Audiocodes Ltd. | Multi-pulse analysis speech processing System and method |
KR100419545B1 (ko) | 1994-10-06 | 2004-06-04 | 코닌클리케 필립스 일렉트로닉스 엔.브이. | 다른코딩원리들을이용한전송시스템 |
EP0720316B1 (en) * | 1994-12-30 | 1999-12-08 | Daewoo Electronics Co., Ltd | Adaptive digital audio encoding apparatus and a bit allocation method thereof |
SE506379C3 (sv) | 1995-03-22 | 1998-01-19 | Ericsson Telefon Ab L M | Lpc-talkodare med kombinerad excitation |
US5727119A (en) | 1995-03-27 | 1998-03-10 | Dolby Laboratories Licensing Corporation | Method and apparatus for efficient implementation of single-sideband filter banks providing accurate measures of spectral magnitude and phase |
JP3317470B2 (ja) | 1995-03-28 | 2002-08-26 | 日本電信電話株式会社 | 音響信号符号化方法、音響信号復号化方法 |
US5754733A (en) * | 1995-08-01 | 1998-05-19 | Qualcomm Incorporated | Method and apparatus for generating and encoding line spectral square roots |
US5659622A (en) | 1995-11-13 | 1997-08-19 | Motorola, Inc. | Method and apparatus for suppressing noise in a communication system |
US5890106A (en) | 1996-03-19 | 1999-03-30 | Dolby Laboratories Licensing Corporation | Analysis-/synthesis-filtering system with efficient oddly-stacked singleband filter bank using time-domain aliasing cancellation |
US5848391A (en) | 1996-07-11 | 1998-12-08 | Fraunhofer-Gesellschaft Zur Forderung Der Angewandten Forschung E.V. | Method subband of coding and decoding audio signals using variable length windows |
JP3259759B2 (ja) | 1996-07-22 | 2002-02-25 | 日本電気株式会社 | 音声信号伝送方法及び音声符号復号化システム |
US5960389A (en) | 1996-11-15 | 1999-09-28 | Nokia Mobile Phones Limited | Methods for generating comfort noise during discontinuous transmission |
JPH10214100A (ja) | 1997-01-31 | 1998-08-11 | Sony Corp | 音声合成方法 |
US6134518A (en) | 1997-03-04 | 2000-10-17 | International Business Machines Corporation | Digital audio signal coding using a CELP coder and a transform coder |
SE512719C2 (sv) | 1997-06-10 | 2000-05-02 | Lars Gustaf Liljeryd | En metod och anordning för reduktion av dataflöde baserad på harmonisk bandbreddsexpansion |
JP3223966B2 (ja) | 1997-07-25 | 2001-10-29 | 日本電気株式会社 | 音声符号化/復号化装置 |
US6070137A (en) | 1998-01-07 | 2000-05-30 | Ericsson Inc. | Integrated frequency-domain voice coding using an adaptive spectral enhancement filter |
DE69926821T2 (de) | 1998-01-22 | 2007-12-06 | Deutsche Telekom Ag | Verfahren zur signalgesteuerten Schaltung zwischen verschiedenen Audiokodierungssystemen |
GB9811019D0 (en) | 1998-05-21 | 1998-07-22 | Univ Surrey | Speech coders |
US6173257B1 (en) | 1998-08-24 | 2001-01-09 | Conexant Systems, Inc | Completed fixed codebook for speech encoder |
US6439967B2 (en) | 1998-09-01 | 2002-08-27 | Micron Technology, Inc. | Microelectronic substrate assembly planarizing machines and methods of mechanical and chemical-mechanical planarization of microelectronic substrate assemblies |
SE521225C2 (sv) | 1998-09-16 | 2003-10-14 | Ericsson Telefon Ab L M | Förfarande och anordning för CELP-kodning/avkodning |
US7272556B1 (en) | 1998-09-23 | 2007-09-18 | Lucent Technologies Inc. | Scalable and embedded codec for speech and audio signals |
US7124079B1 (en) | 1998-11-23 | 2006-10-17 | Telefonaktiebolaget Lm Ericsson (Publ) | Speech coding with comfort noise variability feature for increased fidelity |
FI114833B (fi) | 1999-01-08 | 2004-12-31 | Nokia Corp | Menetelmä, puhekooderi ja matkaviestin puheenkoodauskehysten muodostamiseksi |
DE19921122C1 (de) | 1999-05-07 | 2001-01-25 | Fraunhofer Ges Forschung | Verfahren und Vorrichtung zum Verschleiern eines Fehlers in einem codierten Audiosignal und Verfahren und Vorrichtung zum Decodieren eines codierten Audiosignals |
JP4024427B2 (ja) * | 1999-05-24 | 2007-12-19 | 株式会社リコー | 線形予測係数抽出装置、線形予測係数抽出方法、およびその方法をコンピュータに実行させるプログラムを記録したコンピュータ読み取り可能な記録媒体 |
JP2003501925A (ja) | 1999-06-07 | 2003-01-14 | エリクソン インコーポレイテッド | パラメトリックノイズモデル統計値を用いたコンフォートノイズの生成方法及び装置 |
JP4464484B2 (ja) | 1999-06-15 | 2010-05-19 | パナソニック株式会社 | 雑音信号符号化装置および音声信号符号化装置 |
US6236960B1 (en) | 1999-08-06 | 2001-05-22 | Motorola, Inc. | Factorial packing method and apparatus for information coding |
US6636829B1 (en) | 1999-09-22 | 2003-10-21 | Mindspeed Technologies, Inc. | Speech communication system and method for handling lost frames |
ES2269112T3 (es) | 2000-02-29 | 2007-04-01 | Qualcomm Incorporated | Codificador de voz multimodal en bucle cerrado de dominio mixto. |
JP2002118517A (ja) | 2000-07-31 | 2002-04-19 | Sony Corp | 直交変換装置及び方法、逆直交変換装置及び方法、変換符号化装置及び方法、並びに復号装置及び方法 |
FR2813722B1 (fr) | 2000-09-05 | 2003-01-24 | France Telecom | Procede et dispositif de dissimulation d'erreurs et systeme de transmission comportant un tel dispositif |
US6847929B2 (en) | 2000-10-12 | 2005-01-25 | Texas Instruments Incorporated | Algebraic codebook system and method |
US6636830B1 (en) | 2000-11-22 | 2003-10-21 | Vialta Inc. | System and method for noise reduction using bi-orthogonal modified discrete cosine transform |
CA2327041A1 (en) | 2000-11-22 | 2002-05-22 | Voiceage Corporation | A method for indexing pulse positions and signs in algebraic codebooks for efficient coding of wideband signals |
US7901873B2 (en) | 2001-04-23 | 2011-03-08 | Tcp Innovations Limited | Methods for the diagnosis and treatment of bone disorders |
US7136418B2 (en) | 2001-05-03 | 2006-11-14 | University Of Washington | Scalable and perceptually ranked signal coding and decoding |
KR100464369B1 (ko) | 2001-05-23 | 2005-01-03 | 삼성전자주식회사 | 음성 부호화 시스템의 여기 코드북 탐색 방법 |
US20020184009A1 (en) | 2001-05-31 | 2002-12-05 | Heikkinen Ari P. | Method and apparatus for improved voicing determination in speech signals containing high levels of jitter |
US20030120484A1 (en) | 2001-06-12 | 2003-06-26 | David Wong | Method and system for generating colored comfort noise in the absence of silence insertion description packets |
DE10129240A1 (de) | 2001-06-18 | 2003-01-02 | Fraunhofer Ges Forschung | Verfahren und Vorrichtung zum Verarbeiten von zeitdiskreten Audio-Abtastwerten |
US6879955B2 (en) | 2001-06-29 | 2005-04-12 | Microsoft Corporation | Signal modification based on continuous time warping for low bit rate CELP coding |
DE10140507A1 (de) | 2001-08-17 | 2003-02-27 | Philips Corp Intellectual Pty | Verfahren für die algebraische Codebook-Suche eines Sprachsignalkodierers |
US7711563B2 (en) | 2001-08-17 | 2010-05-04 | Broadcom Corporation | Method and system for frame erasure concealment for predictive speech coding based on extrapolation of speech waveform |
KR100438175B1 (ko) | 2001-10-23 | 2004-07-01 | 엘지전자 주식회사 | 코드북 검색방법 |
US6934677B2 (en) | 2001-12-14 | 2005-08-23 | Microsoft Corporation | Quantization matrices based on critical band pattern information for digital audio wherein quantization bands differ from critical bands |
US7240001B2 (en) | 2001-12-14 | 2007-07-03 | Microsoft Corporation | Quality improvement techniques in an audio encoder |
CA2365203A1 (en) | 2001-12-14 | 2003-06-14 | Voiceage Corporation | A signal modification method for efficient coding of speech signals |
DE10200653B4 (de) | 2002-01-10 | 2004-05-27 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Skalierbarer Codierer, Verfahren zum Codieren, Decodierer und Verfahren zum Decodieren für einen skalierten Datenstrom |
CA2388352A1 (en) | 2002-05-31 | 2003-11-30 | Voiceage Corporation | A method and device for frequency-selective pitch enhancement of synthesized speed |
CA2388439A1 (en) | 2002-05-31 | 2003-11-30 | Voiceage Corporation | A method and device for efficient frame erasure concealment in linear predictive based speech codecs |
CA2388358A1 (en) | 2002-05-31 | 2003-11-30 | Voiceage Corporation | A method and device for multi-rate lattice vector quantization |
US7302387B2 (en) | 2002-06-04 | 2007-11-27 | Texas Instruments Incorporated | Modification of fixed codebook search in G.729 Annex E audio coding |
US20040010329A1 (en) | 2002-07-09 | 2004-01-15 | Silicon Integrated Systems Corp. | Method for reducing buffer requirements in a digital audio decoder |
DE10236694A1 (de) | 2002-08-09 | 2004-02-26 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Vorrichtung und Verfahren zum skalierbaren Codieren und Vorrichtung und Verfahren zum skalierbaren Decodieren |
US7502743B2 (en) | 2002-09-04 | 2009-03-10 | Microsoft Corporation | Multi-channel audio encoding and decoding with multi-channel transform selection |
US7299190B2 (en) | 2002-09-04 | 2007-11-20 | Microsoft Corporation | Quantization and inverse quantization for audio |
ES2259158T3 (es) * | 2002-09-19 | 2006-09-16 | Matsushita Electric Industrial Co., Ltd. | Metodo y aparato decodificador audio. |
WO2004034379A2 (en) | 2002-10-11 | 2004-04-22 | Nokia Corporation | Methods and devices for source controlled variable bit-rate wideband speech coding |
US7343283B2 (en) | 2002-10-23 | 2008-03-11 | Motorola, Inc. | Method and apparatus for coding a noise-suppressed audio signal |
US7363218B2 (en) | 2002-10-25 | 2008-04-22 | Dilithium Networks Pty. Ltd. | Method and apparatus for fast CELP parameter mapping |
KR100463559B1 (ko) | 2002-11-11 | 2004-12-29 | 한국전자통신연구원 | 대수 코드북을 이용하는 켈프 보코더의 코드북 검색방법 |
KR100463419B1 (ko) | 2002-11-11 | 2004-12-23 | 한국전자통신연구원 | 적은 복잡도를 가진 고정 코드북 검색방법 및 장치 |
KR100465316B1 (ko) | 2002-11-18 | 2005-01-13 | 한국전자통신연구원 | 음성 부호화기 및 이를 이용한 음성 부호화 방법 |
KR20040058855A (ko) | 2002-12-27 | 2004-07-05 | 엘지전자 주식회사 | 음성 변조 장치 및 방법 |
AU2003208517A1 (en) | 2003-03-11 | 2004-09-30 | Nokia Corporation | Switching between coding schemes |
US7249014B2 (en) | 2003-03-13 | 2007-07-24 | Intel Corporation | Apparatus, methods and articles incorporating a fast algebraic codebook search technique |
US20050021338A1 (en) | 2003-03-17 | 2005-01-27 | Dan Graboi | Recognition device and system |
KR100556831B1 (ko) | 2003-03-25 | 2006-03-10 | 한국전자통신연구원 | 전역 펄스 교체를 통한 고정 코드북 검색 방법 |
WO2004090870A1 (ja) | 2003-04-04 | 2004-10-21 | Kabushiki Kaisha Toshiba | 広帯域音声を符号化または復号化するための方法及び装置 |
DE10321983A1 (de) | 2003-05-15 | 2004-12-09 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Vorrichtung und Verfahren zum Einbetten einer binären Nutzinformation in ein Trägersignal |
US7548852B2 (en) | 2003-06-30 | 2009-06-16 | Koninklijke Philips Electronics N.V. | Quality of decoded audio by adding noise |
DE10331803A1 (de) | 2003-07-14 | 2005-02-17 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Vorrichtung und Verfahren zum Umsetzen in eine transformierte Darstellung oder zum inversen Umsetzen der transformierten Darstellung |
CA2475282A1 (en) | 2003-07-17 | 2005-01-17 | Her Majesty The Queen In Right Of Canada As Represented By The Minister Of Industry Through The Communications Research Centre | Volume hologram |
DE10345995B4 (de) | 2003-10-02 | 2005-07-07 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Vorrichtung und Verfahren zum Verarbeiten eines Signals mit einer Sequenz von diskreten Werten |
DE10345996A1 (de) | 2003-10-02 | 2005-04-28 | Fraunhofer Ges Forschung | Vorrichtung und Verfahren zum Verarbeiten von wenigstens zwei Eingangswerten |
US7418396B2 (en) | 2003-10-14 | 2008-08-26 | Broadcom Corporation | Reduced memory implementation technique of filterbank and block switching for real-time audio applications |
US20050091041A1 (en) | 2003-10-23 | 2005-04-28 | Nokia Corporation | Method and system for speech coding |
US20050091044A1 (en) | 2003-10-23 | 2005-04-28 | Nokia Corporation | Method and system for pitch contour quantization in audio coding |
EP1711938A1 (en) | 2004-01-28 | 2006-10-18 | Koninklijke Philips Electronics N.V. | Audio signal decoding using complex-valued data |
BRPI0418527A (pt) | 2004-02-12 | 2007-05-15 | Nokia Corp | método para relatar uma qualidade de transmissão em fluxo, programa de computação com instruções operáveis, produto de programa de computação, sistema de transmissão em fluxo, cliente em um sistema de transmissão em fluxo, servidor em um sistema de transmissão em fluxo, e, protocolo para um sistema de transmissão em fluxo |
DE102004007200B3 (de) | 2004-02-13 | 2005-08-11 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Audiocodierung |
CA2457988A1 (en) | 2004-02-18 | 2005-08-18 | Voiceage Corporation | Methods and devices for audio compression based on acelp/tcx coding and multi-rate lattice vector quantization |
FI118834B (fi) | 2004-02-23 | 2008-03-31 | Nokia Corp | Audiosignaalien luokittelu |
FI118835B (fi) | 2004-02-23 | 2008-03-31 | Nokia Corp | Koodausmallin valinta |
WO2005086138A1 (ja) | 2004-03-05 | 2005-09-15 | Matsushita Electric Industrial Co., Ltd. | エラー隠蔽装置およびエラー隠蔽方法 |
WO2005096274A1 (fr) * | 2004-04-01 | 2005-10-13 | Beijing Media Works Co., Ltd | Dispositif et procede de codage/decodage audio ameliores |
GB0408856D0 (en) | 2004-04-21 | 2004-05-26 | Nokia Corp | Signal encoding |
JP2007538282A (ja) | 2004-05-17 | 2007-12-27 | ノキア コーポレイション | 各種の符号化フレーム長でのオーディオ符号化 |
JP4168976B2 (ja) | 2004-05-28 | 2008-10-22 | ソニー株式会社 | オーディオ信号符号化装置及び方法 |
US7649988B2 (en) | 2004-06-15 | 2010-01-19 | Acoustic Technologies, Inc. | Comfort noise generator using modified Doblinger noise estimate |
US8160274B2 (en) | 2006-02-07 | 2012-04-17 | Bongiovi Acoustics Llc. | System and method for digital signal processing |
US7630902B2 (en) | 2004-09-17 | 2009-12-08 | Digital Rise Technology Co., Ltd. | Apparatus and methods for digital audio coding using codebook application ranges |
KR100656788B1 (ko) | 2004-11-26 | 2006-12-12 | 한국전자통신연구원 | 비트율 신축성을 갖는 코드벡터 생성 방법 및 그를 이용한 광대역 보코더 |
AU2006208529B2 (en) | 2005-01-31 | 2010-10-28 | Microsoft Technology Licensing, Llc | Method for weighted overlap-add |
CN100593197C (zh) | 2005-02-02 | 2010-03-03 | 富士通株式会社 | 信号处理方法和装置 |
US20070147518A1 (en) | 2005-02-18 | 2007-06-28 | Bruno Bessette | Methods and devices for low-frequency emphasis during audio compression based on ACELP/TCX |
US8155965B2 (en) | 2005-03-11 | 2012-04-10 | Qualcomm Incorporated | Time warping frames inside the vocoder by modifying the residual |
US7707034B2 (en) | 2005-05-31 | 2010-04-27 | Microsoft Corporation | Audio codec post-filter |
RU2296377C2 (ru) | 2005-06-14 | 2007-03-27 | Михаил Николаевич Гусев | Способ анализа и синтеза речи |
CA2609945C (en) | 2005-06-18 | 2012-12-04 | Nokia Corporation | System and method for adaptive transmission of comfort noise parameters during discontinuous speech transmission |
FR2888699A1 (fr) | 2005-07-13 | 2007-01-19 | France Telecom | Dispositif de codage/decodage hierachique |
KR100851970B1 (ko) * | 2005-07-15 | 2008-08-12 | 삼성전자주식회사 | 오디오 신호의 중요주파수 성분 추출방법 및 장치와 이를이용한 저비트율 오디오 신호 부호화/복호화 방법 및 장치 |
US7610197B2 (en) | 2005-08-31 | 2009-10-27 | Motorola, Inc. | Method and apparatus for comfort noise generation in speech communication systems |
RU2312405C2 (ru) | 2005-09-13 | 2007-12-10 | Михаил Николаевич Гусев | Способ осуществления машинной оценки качества звуковых сигналов |
US20070174047A1 (en) | 2005-10-18 | 2007-07-26 | Anderson Kyle D | Method and apparatus for resynchronizing packetized audio streams |
US7720677B2 (en) | 2005-11-03 | 2010-05-18 | Coding Technologies Ab | Time warped modified transform coding of audio signals |
US8255207B2 (en) | 2005-12-28 | 2012-08-28 | Voiceage Corporation | Method and device for efficient frame erasure concealment in speech codecs |
WO2007080211A1 (en) | 2006-01-09 | 2007-07-19 | Nokia Corporation | Decoding of binaural audio signals |
CN101371296B (zh) | 2006-01-18 | 2012-08-29 | Lg电子株式会社 | 用于编码和解码信号的设备和方法 |
US20110057818A1 (en) * | 2006-01-18 | 2011-03-10 | Lg Electronics, Inc. | Apparatus and Method for Encoding and Decoding Signal |
US8032369B2 (en) | 2006-01-20 | 2011-10-04 | Qualcomm Incorporated | Arbitrary average data rates for variable rate coders |
FR2897733A1 (fr) | 2006-02-20 | 2007-08-24 | France Telecom | Procede de discrimination et d'attenuation fiabilisees des echos d'un signal numerique dans un decodeur et dispositif correspondant |
FR2897977A1 (fr) | 2006-02-28 | 2007-08-31 | France Telecom | Procede de limitation de gain d'excitation adaptative dans un decodeur audio |
EP1852848A1 (en) | 2006-05-05 | 2007-11-07 | Deutsche Thomson-Brandt GmbH | Method and apparatus for lossless encoding of a source signal using a lossy encoded data stream and a lossless extension data stream |
DE602007003023D1 (de) * | 2006-05-30 | 2009-12-10 | Koninkl Philips Electronics Nv | Linear-prädiktive codierung eines audiosignals |
US7959940B2 (en) | 2006-05-30 | 2011-06-14 | Advanced Cardiovascular Systems, Inc. | Polymer-bioceramic composite implantable medical devices |
JP4810335B2 (ja) | 2006-07-06 | 2011-11-09 | 株式会社東芝 | 広帯域オーディオ信号符号化装置および広帯域オーディオ信号復号装置 |
WO2008007699A1 (en) | 2006-07-12 | 2008-01-17 | Panasonic Corporation | Audio decoding device and audio encoding device |
WO2008007700A1 (fr) | 2006-07-12 | 2008-01-17 | Panasonic Corporation | Dispositif de décodage de son, dispositif de codage de son, et procédé de compensation de trame perdue |
US7933770B2 (en) | 2006-07-14 | 2011-04-26 | Siemens Audiologische Technik Gmbh | Method and device for coding audio data based on vector quantisation |
EP2549440B1 (en) | 2006-07-24 | 2017-01-11 | Sony Corporation | A hair motion compositor system and optimization techniques for use in a hair/fur graphics pipeline |
US7987089B2 (en) | 2006-07-31 | 2011-07-26 | Qualcomm Incorporated | Systems and methods for modifying a zero pad region of a windowed frame of an audio signal |
KR101041895B1 (ko) | 2006-08-15 | 2011-06-16 | 브로드콤 코포레이션 | 패킷 손실 후 디코딩된 오디오 신호의 시간 워핑 |
US7877253B2 (en) | 2006-10-06 | 2011-01-25 | Qualcomm Incorporated | Systems, methods, and apparatus for frame erasure recovery |
US8036903B2 (en) | 2006-10-18 | 2011-10-11 | Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung E.V. | Analysis filterbank, synthesis filterbank, encoder, de-coder, mixer and conferencing system |
DE102006049154B4 (de) | 2006-10-18 | 2009-07-09 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Kodierung eines Informationssignals |
US8126721B2 (en) | 2006-10-18 | 2012-02-28 | Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung E.V. | Encoding an information signal |
US8417532B2 (en) | 2006-10-18 | 2013-04-09 | Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung E.V. | Encoding an information signal |
US8041578B2 (en) | 2006-10-18 | 2011-10-18 | Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung E.V. | Encoding an information signal |
EP2076901B8 (en) | 2006-10-25 | 2017-08-16 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Apparatus and method for generating audio subband values and apparatus and method for generating time-domain audio samples |
DE102006051673A1 (de) | 2006-11-02 | 2008-05-15 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Vorrichtung und Verfahren zum Nachbearbeiten von Spektralwerten und Encodierer und Decodierer für Audiosignale |
AU2007331763B2 (en) | 2006-12-12 | 2011-06-30 | Fraunhofer-Gesellschaft Zur Forderung Der Angewandten Forschung E.V. | Encoder, decoder and methods for encoding and decoding data segments representing a time-domain data stream |
FR2911228A1 (fr) | 2007-01-05 | 2008-07-11 | France Telecom | Codage par transformee, utilisant des fenetres de ponderation et a faible retard. |
KR101379263B1 (ko) | 2007-01-12 | 2014-03-28 | 삼성전자주식회사 | 대역폭 확장 복호화 방법 및 장치 |
FR2911426A1 (fr) | 2007-01-15 | 2008-07-18 | France Telecom | Modification d'un signal de parole |
US7873064B1 (en) | 2007-02-12 | 2011-01-18 | Marvell International Ltd. | Adaptive jitter buffer-packet loss concealment |
SG179433A1 (en) | 2007-03-02 | 2012-04-27 | Panasonic Corp | Encoding device and encoding method |
JP4708446B2 (ja) | 2007-03-02 | 2011-06-22 | パナソニック株式会社 | 符号化装置、復号装置およびそれらの方法 |
EP2128855A1 (en) | 2007-03-02 | 2009-12-02 | Panasonic Corporation | Voice encoding device and voice encoding method |
DE102007013811A1 (de) | 2007-03-22 | 2008-09-25 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Verfahren zur zeitlichen Segmentierung eines Videos in Videobildfolgen und zur Auswahl von Keyframes für das Auffinden von Bildinhalten unter Einbeziehung einer Subshot-Detektion |
JP2008261904A (ja) | 2007-04-10 | 2008-10-30 | Matsushita Electric Ind Co Ltd | 符号化装置、復号化装置、符号化方法および復号化方法 |
US8630863B2 (en) | 2007-04-24 | 2014-01-14 | Samsung Electronics Co., Ltd. | Method and apparatus for encoding and decoding audio/speech signal |
CN101388210B (zh) | 2007-09-15 | 2012-03-07 | 华为技术有限公司 | 编解码方法及编解码器 |
EP2827327B1 (en) | 2007-04-29 | 2020-07-29 | Huawei Technologies Co., Ltd. | Method for Excitation Pulse Coding |
PT2165328T (pt) | 2007-06-11 | 2018-04-24 | Fraunhofer Ges Forschung | Codificação e descodificação de um sinal de áudio tendo uma parte do tipo impulso e uma parte estacionária |
US9653088B2 (en) | 2007-06-13 | 2017-05-16 | Qualcomm Incorporated | Systems, methods, and apparatus for signal encoding using pitch-regularizing and non-pitch-regularizing coding |
KR101513028B1 (ko) | 2007-07-02 | 2015-04-17 | 엘지전자 주식회사 | 방송 수신기 및 방송신호 처리방법 |
US8185381B2 (en) | 2007-07-19 | 2012-05-22 | Qualcomm Incorporated | Unified filter bank for performing signal conversions |
CN101110214B (zh) | 2007-08-10 | 2011-08-17 | 北京理工大学 | 一种基于多描述格型矢量量化技术的语音编码方法 |
US8428957B2 (en) * | 2007-08-24 | 2013-04-23 | Qualcomm Incorporated | Spectral noise shaping in audio coding based on spectral dynamics in frequency sub-bands |
ES2658942T3 (es) | 2007-08-27 | 2018-03-13 | Telefonaktiebolaget Lm Ericsson (Publ) | Análisis espectral/síntesis de baja complejidad utilizando resolución temporal seleccionable |
JP4886715B2 (ja) | 2007-08-28 | 2012-02-29 | 日本電信電話株式会社 | 定常率算出装置、雑音レベル推定装置、雑音抑圧装置、それらの方法、プログラム及び記録媒体 |
US8566106B2 (en) | 2007-09-11 | 2013-10-22 | Voiceage Corporation | Method and device for fast algebraic codebook search in speech and audio coding |
CN100524462C (zh) | 2007-09-15 | 2009-08-05 | 华为技术有限公司 | 对高带信号进行帧错误隐藏的方法及装置 |
US8576096B2 (en) | 2007-10-11 | 2013-11-05 | Motorola Mobility Llc | Apparatus and method for low complexity combinatorial coding of signals |
KR101373004B1 (ko) | 2007-10-30 | 2014-03-26 | 삼성전자주식회사 | 고주파수 신호 부호화 및 복호화 장치 및 방법 |
CN101425292B (zh) | 2007-11-02 | 2013-01-02 | 华为技术有限公司 | 一种音频信号的解码方法及装置 |
DE102007055830A1 (de) | 2007-12-17 | 2009-06-18 | Zf Friedrichshafen Ag | Verfahren und Vorrichtung zum Betrieb eines Hybridantriebes eines Fahrzeuges |
CN101483043A (zh) | 2008-01-07 | 2009-07-15 | 中兴通讯股份有限公司 | 基于分类和排列组合的码本索引编码方法 |
CN101488344B (zh) | 2008-01-16 | 2011-09-21 | 华为技术有限公司 | 一种量化噪声泄漏控制方法及装置 |
DE102008015702B4 (de) | 2008-01-31 | 2010-03-11 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Vorrichtung und Verfahren zur Bandbreitenerweiterung eines Audiosignals |
EP2250641B1 (en) | 2008-03-04 | 2011-10-12 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Apparatus for mixing a plurality of input data streams |
US8000487B2 (en) | 2008-03-06 | 2011-08-16 | Starkey Laboratories, Inc. | Frequency translation by high-frequency spectral envelope warping in hearing assistance devices |
FR2929466A1 (fr) | 2008-03-28 | 2009-10-02 | France Telecom | Dissimulation d'erreur de transmission dans un signal numerique dans une structure de decodage hierarchique |
EP2107556A1 (en) | 2008-04-04 | 2009-10-07 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Audio transform coding using pitch correction |
US8768690B2 (en) | 2008-06-20 | 2014-07-01 | Qualcomm Incorporated | Coding scheme selection for low-bit-rate applications |
MX2011000366A (es) | 2008-07-11 | 2011-04-28 | Fraunhofer Ges Forschung | Codificador y decodificador de audio para codificar y decodificar muestras de audio. |
ES2401487T3 (es) | 2008-07-11 | 2013-04-22 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Aparato y procedimiento para la codificación/decodificación de una señal de audio utilizando un esquema de conmutación de generación de señal ajena |
MX2011000375A (es) | 2008-07-11 | 2011-05-19 | Fraunhofer Ges Forschung | Codificador y decodificador de audio para codificar y decodificar tramas de una señal de audio muestreada. |
EP2144230A1 (en) | 2008-07-11 | 2010-01-13 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Low bitrate audio encoding/decoding scheme having cascaded switches |
PL2311033T3 (pl) | 2008-07-11 | 2012-05-31 | Fraunhofer Ges Forschung | Dostarczanie sygnału aktywującego dopasowanie czasowe i kodowanie sygnału audio z jego użyciem |
MY154452A (en) | 2008-07-11 | 2015-06-15 | Fraunhofer Ges Forschung | An apparatus and a method for decoding an encoded audio signal |
EP2144171B1 (en) | 2008-07-11 | 2018-05-16 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Audio encoder and decoder for encoding and decoding frames of a sampled audio signal |
US8380498B2 (en) | 2008-09-06 | 2013-02-19 | GH Innovation, Inc. | Temporal envelope coding of energy attack signal by using attack point location |
US8352279B2 (en) | 2008-09-06 | 2013-01-08 | Huawei Technologies Co., Ltd. | Efficient temporal envelope coding approach by prediction between low band signal and high band signal |
US8577673B2 (en) | 2008-09-15 | 2013-11-05 | Huawei Technologies Co., Ltd. | CELP post-processing for music signals |
DE102008042579B4 (de) | 2008-10-02 | 2020-07-23 | Robert Bosch Gmbh | Verfahren zur Fehlerverdeckung bei fehlerhafter Übertragung von Sprachdaten |
EP2345030A2 (en) | 2008-10-08 | 2011-07-20 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Multi-resolution switched audio encoding/decoding scheme |
KR101315617B1 (ko) | 2008-11-26 | 2013-10-08 | 광운대학교 산학협력단 | 모드 스위칭에 기초하여 윈도우 시퀀스를 처리하는 통합 음성/오디오 부/복호화기 |
CN101770775B (zh) | 2008-12-31 | 2011-06-22 | 华为技术有限公司 | 信号处理方法及装置 |
ES2901735T3 (es) | 2009-01-16 | 2022-03-23 | Dolby Int Ab | Transposición armónica mejorada de productos de cruce |
EP2382625B1 (en) | 2009-01-28 | 2016-01-06 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Audio encoder, audio decoder, encoded audio information, methods for encoding and decoding an audio signal and computer program |
US8457975B2 (en) | 2009-01-28 | 2013-06-04 | Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung E.V. | Audio decoder, audio encoder, methods for decoding and encoding an audio signal and computer program |
EP2214165A3 (en) | 2009-01-30 | 2010-09-15 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Apparatus, method and computer program for manipulating an audio signal comprising a transient event |
PL2234103T3 (pl) | 2009-03-26 | 2012-02-29 | Fraunhofer Ges Forschung | Urządzenie i sposób manipulacji sygnałem audio |
KR20100115215A (ko) | 2009-04-17 | 2010-10-27 | 삼성전자주식회사 | 가변 비트율 오디오 부호화 및 복호화 장치 및 방법 |
EP3764356A1 (en) | 2009-06-23 | 2021-01-13 | VoiceAge Corporation | Forward time-domain aliasing cancellation with application in weighted or original signal domain |
JP5267362B2 (ja) | 2009-07-03 | 2013-08-21 | 富士通株式会社 | オーディオ符号化装置、オーディオ符号化方法及びオーディオ符号化用コンピュータプログラムならびに映像伝送装置 |
CN101958119B (zh) | 2009-07-16 | 2012-02-29 | 中兴通讯股份有限公司 | 一种改进的离散余弦变换域音频丢帧补偿器和补偿方法 |
US8635357B2 (en) | 2009-09-08 | 2014-01-21 | Google Inc. | Dynamic selection of parameter sets for transcoding media data |
WO2011048118A1 (en) | 2009-10-20 | 2011-04-28 | Fraunhofer Gesellschaft zur Förderung der angewandten Forschung e.V. | Audio signal encoder, audio signal decoder, method for providing an encoded representation of an audio content, method for providing a decoded representation of an audio content and computer program for use in low delay applications |
EP4358082A1 (en) | 2009-10-20 | 2024-04-24 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Audio signal encoder, audio signal decoder, method for encoding or decoding an audio signal using an aliasing-cancellation |
ES2453098T3 (es) | 2009-10-20 | 2014-04-04 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Códec multimodo de audio |
CN102081927B (zh) | 2009-11-27 | 2012-07-18 | 中兴通讯股份有限公司 | 一种可分层音频编码、解码方法及系统 |
US8423355B2 (en) | 2010-03-05 | 2013-04-16 | Motorola Mobility Llc | Encoder for audio signal including generic audio and speech frames |
US8428936B2 (en) | 2010-03-05 | 2013-04-23 | Motorola Mobility Llc | Decoder for audio signal including generic audio and speech frames |
CN103069484B (zh) | 2010-04-14 | 2014-10-08 | 华为技术有限公司 | 时/频二维后处理 |
WO2011147950A1 (en) | 2010-05-28 | 2011-12-01 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Low-delay unified speech and audio codec |
ES2681429T3 (es) | 2011-02-14 | 2018-09-13 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Generación de ruido en códecs de audio |
WO2012110415A1 (en) | 2011-02-14 | 2012-08-23 | Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung E.V. | Apparatus and method for processing a decoded audio signal in a spectral domain |
WO2013075753A1 (en) | 2011-11-25 | 2013-05-30 | Huawei Technologies Co., Ltd. | An apparatus and a method for encoding an input signal |
-
2012
- 2012-02-14 BR BR112013020587-3A patent/BR112013020587B1/pt active IP Right Grant
- 2012-02-14 PL PL12705820T patent/PL2676266T3/pl unknown
- 2012-02-14 KR KR1020137024237A patent/KR101617816B1/ko active IP Right Grant
- 2012-02-14 AU AU2012217156A patent/AU2012217156B2/en active Active
- 2012-02-14 SG SG2013061387A patent/SG192748A1/en unknown
- 2012-02-14 CA CA2827277A patent/CA2827277C/en active Active
- 2012-02-14 ES ES12705820.4T patent/ES2534972T3/es active Active
- 2012-02-14 WO PCT/EP2012/052455 patent/WO2012110476A1/en active Application Filing
- 2012-02-14 JP JP2013553901A patent/JP5625126B2/ja active Active
- 2012-02-14 TW TW101104673A patent/TWI488177B/zh active
- 2012-02-14 BR BR112013020592-0A patent/BR112013020592B1/pt active IP Right Grant
- 2012-02-14 CN CN201280018265.3A patent/CN103477387B/zh active Active
- 2012-02-14 AR ARP120100477A patent/AR085794A1/es active IP Right Grant
- 2012-02-14 MX MX2013009346A patent/MX2013009346A/es active IP Right Grant
- 2012-02-14 MY MYPI2013002982A patent/MY165853A/en unknown
- 2012-02-14 RU RU2013142133/08A patent/RU2575993C2/ru active
- 2012-02-14 EP EP12705820.4A patent/EP2676266B1/en active Active
-
2013
- 2013-08-14 US US13/966,601 patent/US9595262B2/en active Active
- 2013-09-11 ZA ZA2013/06840A patent/ZA201306840B/en unknown
-
2014
- 2014-06-09 HK HK14105388.3A patent/HK1192050A1/xx unknown
Non-Patent Citations (2)
Title |
---|
3GPP TS 26.290 Extended AMR-WB+ codec; transcoding functions, pp24-30* |
R.lefebvre et al., hight quality coding of widband audio signals using transform coded excitation(TXC)* |
Also Published As
Publication number | Publication date |
---|---|
AU2012217156B2 (en) | 2015-03-19 |
BR112013020587A2 (pt) | 2018-07-10 |
BR112013020592A2 (pt) | 2016-10-18 |
PL2676266T3 (pl) | 2015-08-31 |
TWI488177B (zh) | 2015-06-11 |
AR085794A1 (es) | 2013-10-30 |
CN103477387A (zh) | 2013-12-25 |
BR112013020592B1 (pt) | 2021-06-22 |
EP2676266B1 (en) | 2015-03-11 |
KR20130133848A (ko) | 2013-12-09 |
WO2012110476A1 (en) | 2012-08-23 |
MY165853A (en) | 2018-05-18 |
CA2827277A1 (en) | 2012-08-23 |
AU2012217156A1 (en) | 2013-08-29 |
EP2676266A1 (en) | 2013-12-25 |
ZA201306840B (en) | 2014-05-28 |
JP2014510306A (ja) | 2014-04-24 |
ES2534972T3 (es) | 2015-04-30 |
TW201246189A (en) | 2012-11-16 |
RU2013142133A (ru) | 2015-03-27 |
CN103477387B (zh) | 2015-11-25 |
BR112013020587B1 (pt) | 2021-03-09 |
US20130332153A1 (en) | 2013-12-12 |
MX2013009346A (es) | 2013-10-01 |
US9595262B2 (en) | 2017-03-14 |
HK1192050A1 (en) | 2014-08-08 |
JP5625126B2 (ja) | 2014-11-12 |
RU2575993C2 (ru) | 2016-02-27 |
SG192748A1 (en) | 2013-09-30 |
CA2827277C (en) | 2016-08-30 |
Similar Documents
Publication | Publication Date | Title |
---|---|---|
KR101617816B1 (ko) | 스펙트럼 도메인 잡음 형상화를 사용하는 선형 예측 기반 코딩 방식 | |
CN103098126B (zh) | 音频编码器、音频解码器及利用复预测处理多信道音频信号的相关方法 | |
KR101953648B1 (ko) | 오디오 신호 디코딩 또는 인코딩을 위한 시간 도메인 레벨 조정 | |
CN103052983B (zh) | 音频或视频编码器、音频或视频解码器及编码和解码方法 | |
EP2676268B1 (en) | Apparatus and method for processing a decoded audio signal in a spectral domain | |
CN101425294B (zh) | 声音编解码与发送接收设备及编码方法、通信终端和基站 | |
CA2877161C (en) | Linear prediction based audio coding using improved probability distribution estimation | |
JP2010538314A (ja) | 切り換え可能な時間分解能を用いた低演算量のスペクトル分析/合成 | |
KR101484426B1 (ko) | Celp 기반 음성 코더에서의 오디오 신호 대역폭 확장 | |
EP2772912B1 (en) | Audio encoding apparatus, audio decoding apparatus, audio encoding method, and audio decoding method | |
EP3008725A1 (en) | Apparatus and method for audio signal envelope encoding, processing and decoding by splitting the audio signal envelope employing distribution quantization and coding | |
AU2013211560A1 (en) | Improved harmonic transposition |
Legal Events
Date | Code | Title | Description |
---|---|---|---|
A201 | Request for examination | ||
E902 | Notification of reason for refusal | ||
E701 | Decision to grant or registration of patent right | ||
GRNT | Written decision to grant |