RU2010120678A

RU2010120678A - Масштабируемое кодирование речи и аудио с использованием комбинаторного кодирования mdct-спектра

Info

Publication number: RU2010120678A
Application number: RU2010120678/08A
Authority: RU
Inventors: Юрий РЕЗНИК (US); Юрий РЕЗНИК; Пэнцзюнь ХУАН (US); Пэнцзюнь ХУАН
Original assignee: Квэлкомм Инкорпорейтед (US); Квэлкомм Инкорпорейтед
Priority date: 2007-10-22
Filing date: 2008-10-22
Publication date: 2011-11-27
Also published as: EP2255358A1; JP2013178539A; JP2011501828A; KR20100085994A; US20090234644A1; AU2008316860A1; EP2255358B1; WO2009055493A1; IL205131A0; CN101836251B; MX2010004282A; CN101836251A; US8527265B2; CN102968998A; AU2008316860B2; RU2459282C2; TWI407432B; BRPI0818405A2; CA2701281A1; TW200935402A

Abstract

1. Способ для кодирования в масштабируемом речевом и аудиокодеке, имеющем несколько слоев, содержащий этапы, на которых: ! - получают остаточный сигнал из слоя кодирования на основе линейного прогнозирования с возбуждением по коду (CELP), при этом слой кодирования на основе CELP содержит один или два предыдущих слоя в масштабируемом и аудиокодеке, и при этом остаточный сигнал является разностью между исходным аудиосигналом и восстановленной версией исходного аудиосигнала; ! - преобразуют остаточный сигнал, из предыдущего слоя, в слое преобразования типа дискретного косинусного преобразования (DCT), чтобы получать соответствующий спектр преобразования, имеющий множество спектральных линий; и ! - кодируют спектральные линии спектра преобразования с использованием технологии комбинаторного позиционного кодирования. ! 2. Способ по п.1, в котором слой преобразования DCT-типа является слоем модифицированного дискретного косинусного преобразования (MDCT), и спектр преобразования является MDCT-спектром. ! 3. Способ по п.1, в котором кодирование спектральных линий спектра преобразования включает в себя этап, на котором: ! - кодируют позиции выбранного поднабора спектральных линий на основе представления позиций спектральных линий с использованием технологии комбинаторного позиционного кодирования для позиций ненулевых спектральных линий. ! 4. Способ по п.1, дополнительно содержащий этапы, на которых: ! - разбивают множество спектральных линий на множество подполос; и ! - группируют последовательные подполосы в области. ! 5. Способ по п.4, дополнительно содержащий этап, на котором: ! - кодируют основной импульс, выбранный из множе

Claims

1. Способ для кодирования в масштабируемом речевом и аудиокодеке, имеющем несколько слоев, содержащий этапы, на которых:

- получают остаточный сигнал из слоя кодирования на основе линейного прогнозирования с возбуждением по коду (CELP), при этом слой кодирования на основе CELP содержит один или два предыдущих слоя в масштабируемом и аудиокодеке, и при этом остаточный сигнал является разностью между исходным аудиосигналом и восстановленной версией исходного аудиосигнала;

- преобразуют остаточный сигнал, из предыдущего слоя, в слое преобразования типа дискретного косинусного преобразования (DCT), чтобы получать соответствующий спектр преобразования, имеющий множество спектральных линий; и

- кодируют спектральные линии спектра преобразования с использованием технологии комбинаторного позиционного кодирования.

2. Способ по п.1, в котором слой преобразования DCT-типа является слоем модифицированного дискретного косинусного преобразования (MDCT), и спектр преобразования является MDCT-спектром.

3. Способ по п.1, в котором кодирование спектральных линий спектра преобразования включает в себя этап, на котором:

- кодируют позиции выбранного поднабора спектральных линий на основе представления позиций спектральных линий с использованием технологии комбинаторного позиционного кодирования для позиций ненулевых спектральных линий.

4. Способ по п.1, дополнительно содержащий этапы, на которых:

- разбивают множество спектральных линий на множество подполос; и

- группируют последовательные подполосы в области.

5. Способ по п.4, дополнительно содержащий этап, на котором:

- кодируют основной импульс, выбранный из множества спектральных линий для каждой из подполос в области.

6. Способ по п.4, дополнительно содержащий этап, на котором:

- кодируют позиции выбранного поднабора спектральных линий в рамках области на основе представления позиций спектральных линий с использованием технологии комбинаторного позиционного кодирования для позиций ненулевых спектральных линий;

- при этом кодирование спектральных линий спектра преобразования включает в себя этап, на котором формируют матрицу, на основе позиций выбранного поднабора спектральных линий, из всех возможных двоичных строк длины, равной всем позициям в области.

7. Способ по п.4, в котором области перекрываются, и каждая область включает в себя множество последовательных подполос.

8. Способ по п.1, в котором технология комбинаторного позиционного кодирования включает в себя этап, на котором:

- формируют лексикографический индекс для выбранного поднабора спектральных линий, при этом каждый лексикографический индекс представляет одну из множества возможных двоичных строк, представляющих позиции выбранного поднабора спектральных линий.

9. Способ по п.8, в котором лексикографический индекс представляет ненулевые спектральные линии в двоичной строке в меньшем числе битов, чем длина двоичной строки.

10. Способ по п.1, в котором технология комбинаторного позиционного кодирования включает в себя этап, на котором:

- формируют индекс, представляющий позиции спектральных линий в рамках двоичной строки, причем позиции спектральных линий кодируются на основе комбинаторной формулы:

- где n - длина двоичной строки, k - число выбранных спектральных линий, которые должны быть кодированы, и w_j представляет отдельные биты двоичной строки.

11. Способ по п.1, дополнительно содержащий этап, на котором:

- отбрасывают набор спектральных линий, чтобы сократить число спектральных линий, перед кодированием.

12. Способ по п.1, в котором восстановленная версия исходного аудиосигнала получается посредством этапов, на которых:

- синтезируют кодированную версию исходного аудиосигнала из слоя кодирования на основе CELP, чтобы получать синтезированный сигнал;

- повторно вводят предыскажения в синтезированный сигнал; и

- выполняют повышающую дискретизацию сигнала после повторного ввода предыскажений, чтобы получить восстановленную версию исходного аудиосигнала.

13. Устройство масштабируемого речевого и аудиокодера, содержащее:

- модуль слоя кодирования на основе линейного прогнозирования с возбуждением по коду (CELP), выполненный с возможностью формировать остаточный сигнал, при этом остаточный сигнал является разностью между исходным аудиосигналом и восстановленной версией исходного аудиосигнала;

- модуль слоя преобразования типа дискретного косинусного преобразования (DCT), выполненный с возможностью:

- получать остаточный сигнал из модуля слоя кодирования на основе линейного прогнозирования с возбуждением по коду (CELP), при этом модуль слоя кодирования на основе CELP содержит слой кодирования на основе CELP, имеющий один или два предыдущих слоя в масштабируемом речевом и аудиокодеке; и

- преобразовывать остаточный сигнал, из предыдущего слоя, в слое преобразования типа дискретного косинусного преобразования (DCT), чтобы получать соответствующий спектр преобразования, имеющий множество спектральных линий; и

- комбинаторный кодер спектра, выполненный с возможностью кодировать спектральные линии спектра преобразования с использованием технологии комбинаторного позиционного кодирования.

14. Устройство по п.13, в котором модуль слоя преобразования DCT-типа является модулем слоя модифицированного дискретного косинусного преобразования (MDCT), и спектр преобразования является MDCT-спектром.

15. Устройство по п.13, в котором кодирование спектральных линий спектра преобразования включает в себя:

- кодирование позиций выбранного поднабора спектральных линий на основе представления позиций спектральных линий с использованием технологии комбинаторного позиционного кодирования для позиций ненулевых спектральных линий.

16. Устройство по п.13, дополнительно содержащее:

- формирователь подполос, выполненный с возможностью разбивать множество спектральных линий на множество подполос; и

- формирователь областей, выполненный с возможностью группировать последовательные подполосы в области.

17. Устройство по п.16, дополнительно содержащее:

- кодер основных импульсов, выполненный с возможностью кодировать основной импульс, выбираемый из множества спектральных линий для каждой из подполос в области.

18. Устройство по п.16, дополнительно содержащее:

- кодер субимпульсов, выполненный с возможностью кодировать позиции выбранного поднабора спектральных линий в рамках области на основе представления позиций спектральных линий с использованием технологии комбинаторного позиционного кодирования для позиций ненулевых спектральных линий;

- при этом кодирование спектральных линий спектра преобразования включает в себя формирование матрицы, на основе позиций выбранного поднабора спектральных линий, из всех возможных двоичных строк длины, равной всем позициям в области.

19. Устройство по п.16, в котором области перекрываются, и каждая область включает в себя множество последовательных подполос.

20. Устройство по п.13, в котором технология комбинаторного позиционного кодирования включает в себя:

- формирование лексикографического индекса для выбранного поднабора спектральных линий, при этом каждый лексикографический индекс представляет одну из множества возможных двоичных строк, представляющих позиции выбранного поднабора спектральных линий.

21. Устройство по п.20, в котором лексикографический индекс представляет ненулевые спектральные линии в двоичной строке в меньшем числе битов, чем длина двоичной строки.

22. Устройство по п.13, в котором комбинаторный кодер спектра выполнен с возможностью формировать индекс, представляющий позиции спектральных линий в рамках двоичной строки, причем позиции спектральных линий кодируются на основе комбинаторной формулы:

23. Устройство по п.13, в котором восстановленная версия исходного аудиосигнала получается посредством следующего:

- синтезирование кодированной версии исходного аудиосигнала из слоя кодирования на основе CELP, чтобы получать синтезированный сигнал;

- повторный ввод предыскажений в синтезированный сигнал; и

- повышающая дискретизация сигнала после повторного ввода предыскажений, чтобы получать восстановленную версию исходного аудиосигнала.

24. Устройство масштабируемого речевого и аудиокодера, содержащее:

- средство для получения остаточного сигнала из слоя кодирования на основе линейного прогнозирования с возбуждением по коду (CELP), при этом слой кодирования на основе CELP содержит один или два предыдущих слоя в масштабируемом речевом и аудиокодеке, при этом остаточный сигнал является разностью между исходным аудиосигналом и восстановленной версией исходного аудиосигнала;

- средство для преобразования остаточного сигнала, из предыдущего слоя, в слое преобразования типа дискретного косинусного преобразования (DCT), чтобы получать соответствующий спектр преобразования, имеющий множество спектральных линий; и

- средство для кодирования спектральных линий спектра преобразования с использованием технологии комбинаторного позиционного кодирования.

25. Процессор, включающий в себя схему масштабируемого кодирования речи и аудио, выполненную с возможностью:

- получать остаточный сигнал из слоя кодирования на основе линейного прогнозирования с возбуждением по коду (CELP), при этом слой кодирования на основе CELP содержит один или два предыдущих слоя в речевом и аудиокодеке, при этом остаточный сигнал является разностью между исходным аудиосигналом и восстановленной версией исходного аудиосигнала;

- кодировать спектральные линии спектра преобразования с использованием технологии комбинаторного позиционного кодирования.

26. Машиночитаемый носитель, содержащий инструкции, применяемые для масштабируемого кодирования речи и аудио, которые, когда выполняются посредством одного или более процессоров, побуждают процессоры:

- получать остаточный сигнал из слоя кодирования на основе линейного прогнозирования с возбуждением по коду (CELP), при этом слой кодирования на основе CELP содержит один или два предыдущих слоя в масштабируемом речевом и аудиокодеке, при этом остаточный сигнал является разностью между исходным аудиосигналом и восстановленной версией исходного аудиосигнала;

27. Способ для декодирования в масштабируемом речевом и аудиокодеке, имеющем несколько слоев, содержащий этапы, на которых:

- получают индекс, представляющий множество спектральных линий спектра преобразования остаточного сигнала, при этом остаточный сигнал является разностью между исходным аудиосигналом и восстановленной версией исходного аудиосигнала из слоя кодирования на основе линейного прогнозирования с возбуждением по коду (CELP), при этом слой кодирования на основе CELP содержит один или два предыдущих слоя в масштабируемом речевом и аудиокодеке;

- декодируют индекс в верхнем слое посредством выполнения в обратном порядке технологии комбинаторного позиционного кодирования, используемой для того, чтобы кодировать множество спектральных линий спектра преобразования; и

- синтезируют версию остаточного сигнала с использованием декодированного множества спектральных линий спектра преобразования в слое обратного преобразования типа обратного дискретного косинусного преобразования (IDCT).

28. Способ по п.27, дополнительно содержащий этапы, на которых:

- принимают CELP-кодированный сигнал, кодирующий исходный аудиосигнал;

- декодируют CELP-кодированный сигнал, чтобы формировать декодированный сигнал; и

- комбинируют декодированный сигнал с синтезированной версией остаточного сигнала, чтобы получать восстановленную версию исходного аудиосигнала.

29. Способ по п.27, в котором синтезирование версии остаточного сигнала включает в себя этап, на котором:

- применяют обратное преобразование DCT-типа к спектральным линиям спектра преобразования, чтобы сформировать версию остаточного сигнала во временной области.

30. Способ по п.27, в котором декодирование спектральных линий спектра преобразования включает в себя этап, на котором:

- декодируют позиции выбранного поднабора спектральных линий на основе представления позиций спектральных линий с использованием технологии комбинаторного позиционного кодирования для позиций ненулевых спектральных линий.

31. Способ по п.27, в котором индекс представляет ненулевые спектральные линии в двоичной строке в меньшем числе битов, чем длина двоичной строки.

32. Способ по п.27, в котором слой обратного преобразования DCT-типа является слоем обратного модифицированного дискретного косинусного преобразования (IMDCT), и спектр преобразования является MDCT-спектром.

33. Способ по п.27, в котором полученный индекс представляет позиции спектральных линий в рамках двоичной строки, причем позиции спектральных линий кодируются на основе комбинаторной формулы:

34. Устройство масштабируемого речевого и аудиодекодера, содержащее:

- комбинаторный декодер спектра, выполненный с возможностью:

- получать индекс, представляющий множество спектральных линий спектра преобразования остаточного сигнала, при этом остаточный сигнал является разностью между исходным аудиосигналом и восстановленной версией исходного аудиосигнала из модуля слоя кодирования на основе линейного прогнозирования с возбуждением по коду (CELP), при этом модуль слоя кодирования на основе CELP содержит слой кодирования на основе CELP, имеющий один или два предыдущих слоя в масштабируемом речевом и аудиокодеке;

- декодировать индекс в верхнем слое посредством выполнения в обратном порядке технологии комбинаторного позиционного кодирования, используемой для того, чтобы кодировать множество спектральных линий спектра преобразования; и

- модуль слоя обратного преобразования типа обратного дискретного косинусного преобразования (IDCT), выполненный с возможностью синтезировать версию остаточного сигнала с использованием декодированного множества спектральных линий спектра преобразования.

35. Устройство по п.34, дополнительно содержащее:

- CELP-декодер, выполненный с возможностью:

- принимать CELP-кодированный сигнал, кодирующий исходный аудиосигнал;

- декодировать CELP-кодированный сигнал, чтобы формировать декодированный сигнал; и

- комбинировать декодированный сигнал с синтезированной версией остаточного сигнала, чтобы получать восстановленную версию исходного аудиосигнала.

36. Устройство по п.34, в котором при синтезировании версии остаточного сигнала, модуль слоя обратного преобразования IDCT-типа выполнен с возможностью применять обратное преобразование типа DCT к спектральным линиям спектра преобразования, чтобы сформировать версию остаточного сигнала во временной области.

37. Устройство по п.34, в котором индекс представляет ненулевые спектральные линии в двоичной строке в меньшем числе битов, чем длина двоичной строки.

38. Устройство масштабируемого речевого и аудиодекодера, содержащее:

- средство для получения индекса, представляющего множество спектральных линий спектра преобразования остаточного сигнала, при этом остаточный сигнал является разностью между исходным аудиосигналом и восстановленной версией исходного аудиосигнала из слоя кодирования на основе линейного прогнозирования с возбуждением по коду (CELP), при этом слой кодирования на основе CELP содержит один или два предыдущих слоя в масштабируемом речевом и аудиокодеке;

- средство для декодирования индекса в верхнем слое посредством выполнения в обратном порядке технологии комбинаторного позиционного кодирования, используемой для того, чтобы кодировать множество спектральных линий спектра преобразования; и

- средство для синтезирования версии остаточного сигнала с использованием декодированного множества спектральных линий спектра преобразования в слое обратного преобразования типа обратного дискретного косинусного преобразования (IDCT).

39. Процессор, включающий в себя схему масштабируемого декодирования речи и аудио, выполненную с возможностью:

- получать индекс, представляющий множество спектральных линий спектра преобразования остаточного сигнала, при этом остаточный сигнал является разностью между исходным аудиосигналом и восстановленной версией исходного аудиосигнала из слоя кодирования на основе линейного прогнозирования с возбуждением по коду (CELP), при этом слой кодирования на основе CELP содержит один или два предыдущих слоя в масштабируемом речевом и аудиокодеке;

- синтезировать версию остаточного сигнала с использованием декодированного множества спектральных линий спектра преобразования в слое обратного преобразования типа обратного дискретного косинусного преобразования (IDCT).

40. Машиночитаемый носитель, содержащий инструкции, применяемые для масштабируемого декодирования речи и аудио, которые, когда выполняются посредством одного или более процессоров, побуждают процессоры: