JP2023166543A

JP2023166543A - 伝送に関知しない呈示ベースのプログラム・ラウドネス

Info

Publication number: JP2023166543A
Application number: JP2023147277A
Authority: JP
Inventors: コッペンス，イェルーン; Koppens Jeroen; グレゴリーノークロス，スコット; Gregory Norcross Scott
Original assignee: Dolby International AB; Dolby Laboratories Licensing Corp
Current assignee: Dolby International AB; Dolby Laboratories Licensing Corp
Priority date: 2014-10-10
Filing date: 2023-09-12
Publication date: 2023-11-21
Also published as: EP4060661B1; EP3518236B8; US10453467B2; JP7023313B2; US11062721B2; JP7350111B2; CN107112023A; US20200258534A1; WO2016057530A1; CN107112023B; JP2017536020A; US20180012609A1; EP3518236B1; US20220005489A1; US20170249951A1; JP2020098368A; CN112164406A; EP3204943A1; JP2020129829A; EP4060661A1

Abstract

【課題】種々のオーディオ出力信号の間でラウドネスの一貫性保つためのフレームワークを提供する。【解決手段】デコーダにおいて、混合コンポーネント１１２のサブストリーム・デコード・コンポーネント２０２は、エンコードされたビットストリームＰを取得し、出力オーディオ信号１１４及びメタデータ２０５を抽出する。メタデータは、複数のダイナミックレンジ（ＤＲＣ）プロファイルのうちの1つに対応する圧縮曲線を示す圧縮曲線データ及びラウドネス・データを含む。ラウドネス・コンポーネント２１０は、メタデータ・サブストリーム２０５に含まれるラウドネス・データからラウドネス値を生成し、圧縮曲線データを使ってラウドネス値をＤＲＣ利得にマッピングし、ＤＲＣ利得を出力オーディオ信号に適用する。【選択図】図２

Description

関連出願への相互参照
本願は2014年10月10日に出願された米国仮特許出願第62/062,479号の優先権を主張するものである。同出願の内容はここに参照によってその全体において組み込まれる。

技術分野
本発明はオーディオ信号処理に関し、より詳細には、出力オーディオ信号の所望されるラウドネス・レベルを達成するためのオーディオ・データ・ビットストリームのエンコードおよびデコードに関する。

ドルビーAC-4は、リッチなメディア・コンテンツを効率的に頒布するためのオーディオ・フォーマットである。AC-4は、効率的な仕方でコンテンツを頒布およびエンコードするための、放送者およびコンテンツ制作者にとっての柔軟なフレームワークを提供する。コンテンツはいくつかのサブストリームを通じて頒布されることができる。たとえば、あるサブストリームにはM&E（音楽および効果）、第二のサブストリームにはダイアログである。一部のオーディオ・コンテンツについては、たとえばダイアログの言語をある言語から別の言語に切り換えること、あるいはたとえばコンテンツへのコメンタリー・サブストリームまたは視覚障害者のための説明を含む追加的なサブストリームを追加できることが有利であることがある。

消費者に呈示されるコンテンツの適正なレベル付けを保証するために、コンテンツのラウドネスがある程度の正確さをもって知られる必要がある。現行のラウドネス要件は、2dB（ATSC A/85）、0.5dB（EBU R128）の許容差をもち、一方、いくつかの仕様は0.1dBくらい低い許容差をもつ。つまり、コメンタリー・トラックをもち、第一の言語でのダイアログをもつ出力オーディオ信号のラウドネスは、コメンタリー・トラックがない、第二の言語でのダイアログをもつ出力オーディオ信号と実質的に同じラウドネスをもつべきということである。

ここで例示的実施形態について付属の図面を参照しつつ述べる。
例として、ビットストリームを処理し、出力オーディオ信号の所望されるラウドネス・レベルを達成するためのデコーダを示す一般化されたブロック図である。図１のデコーダの混合コンポーネントの第一の実施形態の一般化されたブロック図である。図１のデコーダの混合コンポーネントの第二の実施形態の一般化されたブロック図である。諸実施形態に基づく呈示データ構造を記述する図である。諸実施形態に基づくオーディオ・エンコーダの一般化されたブロック図である。図５のオーディオ・エンコーダによって形成されるビットストリームを示す図である。すべての図面は概略的であり、概して本開示を明快にするために必要な部分を示すだけである。一方、他の部分は省略されたり、単に示唆されるだけでであったりすることがある。特に断わりのない限り、同様の参照符号は異なる図における同様の部分を指す。

上記に鑑み、目的は、出力オーディオ信号にどんなコンテンツ・サブストリームが混合されるかとは関係なく、出力オーディオ信号についての所望されるラウドネス・レベルを提供することをねらいとする、エンコーダおよびデコーダならびに関連する方法を提供することである。

〈Ｉ．概観――デコーダ〉
第一の側面によれば、例示的実施形態は、デコード方法、デコーダおよびデコードのためのコンピュータ・プログラム・プロダクトを提案する。提案される方法、デコーダおよびコンピュータ・プログラム・プロダクトは一般に同じ特徴および利点をもちうる。

例示的実施形態によれば、それぞれオーディオ信号を表わす複数のコンテンツ・サブストリームを含むビットストリームを処理する方法が提供される。本方法は：前記ビットストリームから、一つまたは複数の呈示データ構造を抽出する段階であって、各呈示データ構造は前記コンテンツ・サブストリームのうち少なくとも一つへの参照を含み、各呈示データ構造はさらに、参照される一つまたは複数のコンテンツ・サブストリームの組み合わせを記述するラウドネス・データを表わすメタデータ・サブストリームへの参照を含む、段階と；前記一つまたは複数の呈示データ構造のうちのある選択された呈示データ構造および所望されるラウドネス・レベルを示すデータを受領する段階と；選択された呈示データ構造によって参照される一つまたは複数のコンテンツ・サブストリームをデコードする段階と；デコードされたコンテンツ・サブストリームに基づいて出力オーディオ信号を形成する段階とを含み、本方法はさらに、前記選択された呈示データ構造によって参照されるラウドネス・データに基づいて、前記デコードされた一つまたは複数のコンテンツ・サブストリームまたは前記出力オーディオ信号を処理して、前記所望されるラウドネス・レベルを達成することを含む。

選択された呈示データ構造および所望されるラウドネス・レベルを示すデータは典型的には、デコーダにおいて利用可能なユーザー設定である。ユーザーはたとえば、リモコンを使ってダイアログがフランス語である呈示データ構造を選択したり、および／または所望される出力ラウドネス・レベルを増減させたりしてもよい。多くの実施形態では、出力ラウドネス・レベルは再生装置のキャパシティに関係している。いくつかの実施形態によれば、出力ラウドネス・レベルはボリュームによって制御される。結果として、選択された呈示データ構造および所望されるラウドネス・レベルを示すデータは典型的には、デコーダによって受領されるビットストリームには含まれない。

本稿での用法では、「ラウドネス」は、音の強度の、モデル化された音響心理学的な測定値を表わす。換言すれば、ラウドネスは、平均的なユーザーによって知覚される音（単数または複数）のボリュームの近似を表わす。

本稿での用法では、「ラウドネス・データ」は、音響心理学的なラウドネス知覚をモデル化する関数による、特定の呈示データ構造のラウドネス・レベルの測定から帰結するデータをいう。換言すれば、参照される一つまたは複数のコンテンツ・サブストリームの組み合わせのラウドネス属性を示す値の集まりである。諸実施形態によれば、特定の呈示データ構造によって参照される前記一つまたは複数のコンテンツ・サブストリームの組み合わせの平均ラウドネス・レベルが測定されることができる。たとえば、ラウドネス・データは、特定の呈示データ構造によって参照される前記一つまたは複数のコンテンツ・サブストリームの（ITU-R BS.1770に基づく）dialnorm値を指してもよい。ツヴィッカー（Zwicker）のラウドネス・モデルへの修正および拡張を提供するグラスバーグ（Glasberg）のおよびムーア（Moore）のラウドネス・モデルのような、他の好適なラウドネス測定規格が使われてもよい。

本稿での用法では、「呈示データ構造（presentation data structure）」は、出力オーディオ信号のコンテンツに関係するメタデータを指す。出力オーディオ信号は「プログラム」とも称される。呈示データ構造は「呈示」とも称される。

オーディオ・コンテンツは、いくつかのサブストリームを通じて頒布されることができる。本稿での用法では、「コンテンツ・サブストリーム」は、そのようなサブストリームを指す。たとえば、コンテンツ・サブストリームは、オーディオ・コンテンツの音楽、オーディオ・コンテンツのダイアログまたは出力オーディオ信号に含まれるべきコメンタリー・トラックを含んでいてもよい。コンテンツ・サブストリームはチャネル・ベースであっても、オブジェクト・ベースであってもよい。後者の場合、時間依存の空間位置データがコンテンツ・サブストリームに含められる。コンテンツ・サブストリームはビットストリームに含まれてもよく、あるいはオーディオ信号の一部であってもよい（すなわち、チャネル・グループまたはオブジェクト・グループとして）。

本稿での用法では、「出力オーディオ信号」は、実際に出力されるオーディオ信号を指し、それがユーザーに対してレンダリングされる。

本発明者は、各呈示についてラウドネス・データ、たとえばdialnorm値を提供することにより、その特定の呈示をデコードするときに、参照される少なくとも一つのコンテンツ・サブストリームについてラウドネスが正確にいくらであるかを示す特定のラウドネス・データがデコーダに対して利用可能となることを認識するに至った。

従来技術では、各コンテンツ・サブストリームについてラウドネス・データが提供されることがある。各コンテンツ・サブストリームについてラウドネス・データを提供することの問題は、その場合、さまざまなラウドネス・データを呈示ラウドネスに組み合わせることがデコーダ任せになるということである。諸サブストリームの諸平均ラウドネスを表わす諸サブストリームの個々のラウドネス・データ値を加算してある呈示についてのラウドネス値に至ることは、正確でないことがあり、多くの場合、組み合わされたサブストリームの実際の平均ラウドネス値を生じない。それぞれの参照されるコンテンツ・サブストリームについてのラウドネス・データを加算することは、信号属性、ラウドネス・アルゴリズムおよび典型的に加法的でないラウドネス知覚の性質のため、数学的に不可能であることがあり、上記の許容差よりも大きい潜在的な不正確さにつながりうる。

本実施形態を使えば、選択された呈示についてのラウドネス・データによって提供される選択された呈示の平均ラウドネス・レベルと、所望されるラウドネス・レベルとの間の差が、こうして、出力オーディオ信号の再生利得を制御するために使用されうる。

上記のようにラウドネス・データを提供し、使用することにより、種々の呈示の間で、一貫したラウドネス、すなわち、所望されるラウドネス・レベルに近いラウドネスが達成されうる。さらに、一貫したラウドネスは、あるテレビ・チャネルでの異なるプログラムの間で、たとえばテレビ番組とそのコマーシャルとの間で、あるいはテレビ・チャネルを横断して、達成されうる。

例示的実施形態によれば、選択された呈示データ構造は二つ以上のコンテンツ・サブストリームを参照し、これらに適用されるべき少なくとも二つの混合係数をさらに参照し、出力信号の前記形成は、前記混合係数（単数または複数）を適用することによって、デコードされた一つまたは複数のコンテンツ・サブストリームを加法的に混合することをさらに含む。

少なくとも二つの混合係数を提供することによって、出力オーディオ信号のコンテンツの増大した柔軟性が達成される。

たとえば、選択された呈示データ構造は、前記二つ以上のコンテンツ・サブストリームの各サブストリームについて、それぞれのサブストリームに適用されるべき一つの混合係数を参照してもよい。この実施形態によれば、コンテンツ・サブストリームの間の相対的なラウドネス・レベルが変更されうる。たとえば、文化的な選好が、異なるコンテンツ・サブストリームの間の異なるバランスを要求することがある。スペイン語地域は音楽への注意を他ほど望まないという状況を考慮されたい。したがって、音楽サブストリームは3dB減衰させられる。他の実施形態によれば、前記二つ以上のコンテンツ・サブストリームの部分集合に、信号混合係数が適用されてもよい。

例示的実施形態によれば、ビットストリームは複数の時間フレームを含み、選択された呈示データ構造によって参照される混合係数は、各時間フレームについて独立して割り当て可能である。時間変化する混合係数を提供することの効果は、ダッキング（ducking）が達成されうるということである。たとえば、あるコンテンツ・サブストリームのある時間セグメントにわたるラウドネス・レベルが、別のコンテンツ・サブストリームの同じ時間セグメントにおける増大したラウドネスにより、低減されてもよい。

例示的実施形態によれば、ラウドネス・データは、ラウドネス関数の、そのオーディオ入力信号へのゲーティング（gating）の適用に関する値を表わす。

オーディオ入力信号は、エンコーダ側での、ラウドネス関数（たとえばdialnorm関数）が適用された信号である。すると、結果として得られるラウドネス・データはビットストリームにおいてデコーダに伝送される。ノイズ・ゲート（無音ゲートとも称される）は、オーディオ信号のボリュームを制御するために使われる電子装置またはソフトウェアである。ゲーティングとはそのようなゲートの使用である。ノイズ・ゲートは、閾値未満の値を示す信号を減衰させる。ノイズ・ゲートは、レンジ（range）として知られる固定量だけ信号を減衰させてもよい。その最も単純な形では、ノイズ・ゲートは、信号が、設定された閾値より上であるときにのみ通過することを許容する。

ゲーティングは、オーディオ入力信号におけるダイアログの存在にも基づいていてもよい。結果として、例示的実施形態によれば、ラウドネス・データは、ラウドネス関数の、そのオーディオ入力信号のダイアログを表わす時間セグメントに関係する値を表わす。他の実施形態によれば、ゲーティングは最小ラウドネス・レベルに基づく。そのような最小ラウドネス・レベルは、絶対的な閾値または相対的な閾値であってもよい。相対的な閾値は、絶対的な閾値を用いて測定されたラウドネス・レベルに基づいていてもよい。

例示的実施形態によれば、呈示データ構造はさらに、参照される一つまたは複数のコンテンツ・サブストリームについてのダイナミックレンジ圧縮（DRC）データへの参照を含み、本方法はさらに、DRCデータに基づいて、デコードされた一つまたは複数のコンテンツ・サブストリームまたは出力オーディオ信号を処理することを含む。ここで、該処理は、デコードされた一つまたは複数のコンテンツ・サブストリームまたは出力オーディオ信号に一つまたは複数のDRC利得を適用することを含む。

ダイナミックレンジ圧縮は、大きな音のボリュームを下げたり静かな音を増幅したりし、それによりオーディオ信号のダイナミックレンジを狭める、あるいは「圧縮する」。各呈示について一意的にDRCデータを提供することによって、選ばれる呈示が何であろうと、出力オーディオ信号の改善されたユーザー経験が達成されうる。さらに、各呈示についてDRCデータを提供することによって、複数の呈示のそれぞれにわたって、また上記のようにプログラム間で、またテレビ・チャネルを横断して、オーディオ出力信号の一貫したユーザー経験が達成されうる。

DRC利得は常に時間変化する。各時間セグメントにおいて、DRC利得は、オーディオ出力信号についての単一の利得またはサブストリーム毎に異なる複数のDRC利得であってもよい。DRC利得は、チャネルの諸グループに適用されてもよく、および／または周波数依存であってもよい。加えて、DRCデータに含まれるDRC利得は、二つ以上のDRC時間セグメントについてのDRC利得を表わしていてもよい。たとえば、エンコーダによって定義される時間フレームのサブフレームである。

例示的実施形態によれば、DRCデータは、前記一つまたは複数のDRC利得の少なくとも一つの集合を含む。こうして、DRCデータは、DRCモードに対応する複数のDRCプロファイルを含んでいてもよい。そのそれぞれがオーディオ出力信号の異なるユーザー経験を提供する。DRC利得を直接、DRCデータに含めることによって、デコーダの低減された計算量が達成されうる。

例示的実施形態によれば、DRCデータは少なくとも一つの圧縮曲線を含み、前記一つまたは複数のDRC利得は：あらかじめ定義されたラウドネス関数を使って前記一つまたは複数のコンテンツ・サブストリームまたは前記オーディオ出力信号の一つまたは複数のラウドネス値を計算し、前記圧縮曲線を使って前記一つまたは複数のラウドネス値をDRC利得にマッピングすることによって得られる。前記DRCデータにおいて圧縮曲線を提供し、それらの曲線に基づいてDRC利得を計算することによって、DRCデータをエンコーダに伝送するための必要とされるビットレートが低減されうる。あらかじめ定義されたラウドネス関数は、たとえば、ITU-R BS.1770勧告文書から取られてもよいが、任意の好適なラウドネス関数が使用されうる。

例示的実施形態によれば、ラウドネス値のマッピングは、DRC利得の平滑化動作を含む。このことの効果は、よりよく知覚される出力オーディオ信号でありうる。DRC利得を平滑化するための時定数は、DRCデータの一部として伝送されてもよい。そのような時定数は、信号属性に依存して異なっていてもよい。たとえば、いくつかの実施形態では、時定数は、ラウドネス値が直前の対応するラウドネス値よりも大きいときには、ラウドネス値が直前の対応するラウドネス値よりも小さいときに比べて小さくてもよい。

例示的実施形態によれば、参照されるDRCデータは、メタデータ・サブストリームに含まれる。これは、ビットストリームのデコードの複雑さを低減しうる。

例示的実施形態によれば、デコードされた一つまたは複数のコンテンツ・サブストリームのそれぞれは、そのコンテンツ・サブストリームのラウドネス・レベルを記述するサブストリーム・レベルでのラウドネス・データを含み、前記デコードされた一つまたは複数のコンテンツ・サブストリームまたは前記出力オーディオ信号の前記処理は、さらに、前記コンテンツ・サブストリームのラウドネス・レベルに基づいてラウドネス一貫性を提供することを保証することを含む。

本稿での用法では、「ラウドネス一貫性」とは、ラウドネスが異なる呈示の間で一貫している、すなわち異なるコンテンツ・サブストリームに基づいて形成された複数の出力オーディオ信号にわたって一貫していることをいう。さらに、この用語は、ラウドネスが異なるプログラムの間で、すなわちテレビ番組のオーディオ信号とコマーシャルのオーディオ信号のような完全に異なる出力オーディオ信号との間で、一貫していることをいう。さらに、この用語は、ラウドネスが、異なるテレビ・チャネルを横断して一貫していることをいう。

コンテンツ・サブストリームのラウドネス・レベルを記述するラウドネス・データを提供することは、いくつかの場合、デコーダがラウドネス一貫性を提供するのを助けることがある。たとえば、出力オーディオ信号の前記形成が代替的な混合係数を使って二つ以上のデコードされたコンテンツ・サブストリームを組み合わせることを含み、前記サブストリーム・レベルのラウドネス・データが、ラウドネス一貫性を提供するためにラウドネス・データを補償するために使われる場合である。これらの代替的な混合係数は、たとえばユーザーが（たとえばダイアログ向上、ダイアログ減衰、シーン・パーソナル化などをもって）デフォルト呈示から逸脱することを決める場合に、ユーザー入力から導出されてもよい。これは、ラウドネス準拠性を危うくすることがありうる。ユーザーによる影響は、オーディオ出力信号のラウドネスを、準拠規制から外れさせることがありうるからである。そうした場合にラウドネス一貫性を支援するために、本実施形態は、サブストリーム・レベルのラウドネス・データを伝送するオプションを提供する。

いくつかの実施形態によれば、前記コンテンツ・サブストリームのうち少なくとも一つへの参照は、前記コンテンツ・サブストリームのうち一つまたは複数からなる少なくとも一つのコンテンツ・サブストリーム・グループへの参照である。複数の呈示がコンテンツ・サブストリーム・グループ（たとえば、音楽に関係したコンテンツ・サブストリームおよび効果に関係したコンテンツ・サブストリームからなるサブストリーム・グループ）を共有できるので、これはデコーダの複雑さを低減しうる。これは、該ビットストリームを伝送するための要求されるビットレートをも減少させうる。

いくつかの実施形態によれば、選択された呈示データ構造は、あるコンテンツ・サブストリーム・グループについて、そのサブストリーム・グループを構成するコンテンツ・サブストリームのうち前記一つまたは複数のそれぞれに適用される単一の混合係数を参照する。

これは、コンテンツ・サブストリーム・グループ中のコンテンツ・サブストリームのラウドネス・レベルの相互の割合はOKだが、そのコンテンツ・サブストリーム・グループ中のコンテンツ・サブストリームの全体的なラウドネス・レベルは、前記選択された呈示データ構造によって参照される他のコンテンツ・サブストリーム（単数または複数）またはコンテンツ・サブストリーム・グループ（単数または複数）に比べて増大または減少させるべきである場合に有利でありうる。

いくつかの実施形態では、ビットストリームは複数の時間フレームを含み、前記一つまたは複数の呈示データ構造のうちの前記選択された呈示データ構造を示すデータは、各時間フレームについて独立して割り当て可能である。結果として、あるプログラムについて複数の呈示データ構造が受領される場合、前記選択された呈示データ構造は、プログラムの進行中に、たとえばユーザーによって、変更されてもよい。結果として、本実施形態は、出力オーディオのコンテンツを選択する、より柔軟な仕方を提供し、それでいて同時に、出力オーディオ信号のラウドネス一貫性を提供する。

いくつかの実施形態によれば、本方法はさらに：前記ビットストリームから、前記複数の時間フレームの第一のものについて、一つまたは複数の呈示データ構造を抽出し、前記ビットストリームから、前記複数の時間フレームの第二のものについて、前記複数の時間フレームの前記第一のものから抽出された前記一つまたは複数の呈示データ構造とは異なる一つまたは複数の呈示データ構造を抽出することを含み、前記選択された呈示データ構造を示すデータは、それが割り当てられている時間フレームについての選択された呈示データ構造を示す。結果として、複数の呈示データ構造が前記ビットストリームにおいて受領されてもよく、それらの呈示データ構造のいくつかは時間フレームの第一の集合に関係し、それらの呈示データ構造のいくつかは時間フレームの第二の集合に関係する。たとえば、コメンタリー・トラックは、前記プログラムのある時間セグメントについてのみ利用可能であってもよい。さらに、プログラムが進行中に、選択された呈示データ構造を選択するために、特定の時点において現在適用可能な諸呈示データ構造が使われてもよい。結果として、本実施形態は、出力オーディオのコンテンツを選択する、より柔軟な仕方を提供し、それでいて同時に、出力オーディオ信号のラウドネス一貫性を提供する。

いくつかの実施形態によれば、前記ビットストリームに含まれる前記複数のコンテンツ・サブストリームから、前記選択された呈示データ構造によって参照される前記一つまたは複数のコンテンツ・サブストリームのみがデコードされる。この実施形態は、低減された計算量をもつ効率的なデコーダを提供しうる。

いくつかの実施形態によれば、前記ビットストリームは、それぞれ前記複数のコンテンツ・ビットストリームのうち少なくとも一つを含む二つ以上の別個のビットストリームを含み、前記選択された呈示データ構造によって参照される前記一つまたは複数のコンテンツ・サブストリームをデコードする段階は：前記二つ以上の別個のビットストリームの各特定のビットストリームについて、その特定のビットストリームに含まれる参照されているコンテンツ・サブストリームからコンテンツ・サブストリーム（単数または複数）を別個にデコードすることを含む。この実施形態によれば、それぞれの別個のビットストリームは、別個のデコーダによって受領されてもよい。該デコーダは、該別個のビットストリームにおいて与えられる、前記選択された呈示データ構造に基づいて必要とされるコンテンツ・サブストリーム（単数または複数）をデコードする。別個のデコーダが並列に機能できるので、これはデコード速度を改善しうる。結果として、別個のデコーダによってなされるデコードは、少なくとも部分的には重なり合ってもよい。しかしながら、別個のデコーダによってなされるデコードが重なり合うことは必須ではないことは注意しおくべきである。

さらに、諸コンテンツ・サブストリームをいくつかのビットストリームに分割することによって、本実施形態は、前記少なくとも二つの別個のビットストリームを、後述するような異なるインフラストラクチャーを通じて受領することを許容する。結果として、本例示的実施形態は、デコーダにおいて前記複数のコンテンツ・サブストリームを受領するための、より柔軟な方法を提供する。

各デコーダは、デコードされたサブストリーム（単数または複数）を、前記選択された呈示データ構造によって参照されるラウドネス・データに基づいて処理し、および／またはDRC利得を適用し、および／またはデコードされたサブストリーム（単数または複数）に混合係数を適用してもよい。すると、処理されたまたは処理されていないコンテンツ・サブストリームは、前記少なくとも二つのデコーダのすべてから、出力オーディオ信号を形成するための混合コンポーネントに提供されてもよい。あるいはまた、混合コンポーネントは、ラウドネス処理を実行し、および／またはDRC利得を適用し、および／または混合係数を適用する。いくつかの実施形態では、第一のデコーダが、第一のインフラストラクチャー（たとえばケーブル・テレビ放送）を通じて前記二つ以上の別個のビットストリームの第一のビットストリームを受領してもよく、一方、第二のデコーダが、第二のインフラストラクチャーを通じて（たとえばインターネットを通じて）前記二つ以上の別個のビットストリームの第二のビットストリームを受領してもよい。いくつかの実施形態によれば、前記一つまたは複数の呈示データ構造は、前記二つ以上の別個のビットストリームのすべてにおいて存在する。この場合、呈示定義およびラウドネス・データはすべての別個のデコーダにおいて存在する。これは、混合コンポーネントまで、それらのデコードの独立した動作を許容する。対応するビットストリームに存在しないサブストリームへの参照は、外部で提供されるとして、示されてもよい。

例示的実施形態によれば、それぞれオーディオ信号を表わす複数のコンテンツ・サブストリームを含むビットストリームを処理するためのデコーダが提供される。本デコーダは：前記ビットストリームを受領するよう構成された受領コンポーネントと；前記ビットストリームから、一つまたは複数の呈示データ構造を抽出するよう構成されたデマルチプレクサであって、各呈示データ構造は前記コンテンツ・サブストリームのうち少なくとも一つへの参照を含み、さらに、参照される一つまたは複数のコンテンツ・サブストリームの組み合わせを記述するラウドネス・データを表わすメタデータ・サブストリームへの参照を含む、デマルチプレクサと；前記一つまたは複数の呈示データ構造のうちのある選択された呈示データ構造および所望されるラウドネス・レベルを示すデータを受領するよう構成された再生状態コンポーネントと；前記選択された呈示データ構造によって参照される前記一つまたは複数のコンテンツ・サブストリームをデコードし、デコードされたコンテンツ・サブストリームに基づいて出力オーディオ信号を形成するよう構成された混合コンポーネントとを含み、前記混合コンポーネントはさらに、前記所望されるラウドネス・レベルを達成するよう、前記選択された呈示データ構造によって参照されるラウドネス・データに基づいて、前記デコードされた一つまたは複数のコンテンツ・サブストリームまたは前記出力オーディオ信号を処理するよう構成されている。

〈ＩＩ．概観――エンコーダ〉
第二の側面によれば、例示的実施形態は、エンコード方法、エンコーダおよびエンコードのためのコンピュータ・プログラム・プロダクトを提案する。提案される方法、エンコーダおよびコンピュータ・プログラム・プロダクトは一般に、同じ特徴および利点を有しうる。一般に、第二の側面の特徴は、第一の側面の対応する特徴と同じ利点を有しうる。

例示的実施形態によれば、オーディオ・エンコード方法が提供される。本方法は：それぞれのオーディオ信号を表わす複数のコンテンツ・サブストリームを受領し；それぞれ前記複数のコンテンツ・サブストリームのうちの少なくとも一つを参照する一つまたは複数の呈示データ構造を定義し；前記一つまたは複数の呈示データ構造のそれぞれについて、あらかじめ定義されているラウドネス関数を適用して、参照される一つまたは複数のコンテンツ・サブストリームの組み合わせを記述するラウドネス・データを取得し、前記呈示データ構造から前記ラウドネス・データへの参照を含め；前記複数のコンテンツ・サブストリーム、前記一つまたは複数の呈示データ構造およびそれらの呈示データ構造によって参照される前記ラウドネス・データを含むビットストリームを形成することを含む。

上記のように、用語「コンテンツ・サブストリーム」は、ビットストリーム内およびオーディオ信号内両方のサブストリームを包含する。オーディオ・エンコーダは典型的には諸オーディオ信号を受領し、それが次いで諸ビットストリームにエンコードされる。それらのオーディオ信号はグループ化されてもよく、各グループは、個々のエンコーダ入力オーディオ信号として特徴付けられることができる。次いで、各グループがサブストリームにエンコードされてもよい。

いくつかの実施形態によれば、本方法はさらに：前記一つまたは複数の呈示データ構造のそれぞれについて、参照されている一つまたは複数のコンテンツ・サブストリームについてのダイナミックレンジ圧縮（DRC）データを決定する段階であって、該DRCデータは、少なくとも一つの所望される圧縮曲線または少なくとも一組のDRC利得を定量化する、段階と、前記DRCデータを前記ビットストリームに含める段階とを含む。

いくつかの実施形態によれば、本方法はさらに：前記複数のコンテンツ・サブストリームのそれぞれについて、前記あらかじめ定義されているラウドネス関数を適用して、そのコンテンツ・サブストリームのサブストリーム・レベルでのラウドネス・データを取得する段階と；前記サブストリーム・レベルでのラウドネス・データを前記ビットストリームに含める段階とを含む。

いくつかの実施形態によれば、前記あらかじめ定義されているラウドネス関数は、前記オーディオ信号のゲーティングの適用に関係する。

いくつかの実施形態によれば、前記あらかじめ定義されているラウドネス関数は、前記オーディオ信号の、ダイアログを表わす時間セグメントのみに関係する。

いくつかの実施形態によれば、前記あらかじめ定義されているラウドネス関数は：前記オーディオ信号の周波数依存の重み付け、前記オーディオ信号のチャネル依存の重み付け、前記オーディオ信号の、閾値未満の信号パワーをもつセグメントの無視、前記オーディオ信号のエネルギー測度の計算のうちの少なくとも一つを含む。

例示的実施形態によれば、オーディオ・エンコーダが提供される。本エンコーダは：あらかじめ定義されているラウドネス関数を適用して、それぞれのオーディオ信号を表わす一つまたは複数のコンテンツ・サブストリームの組み合わせを記述するラウドネス・データを取得するよう構成されているラウドネス・コンポーネントと；一つまたは複数の呈示データ構造を定義するよう構成されている呈示データ・コンポーネントであって、各呈示データ構造は、複数のコンテンツ・サブストリームのうちの一つまたは複数のコンテンツ・サブストリームへの参照および参照されるコンテンツ・サブストリームの組み合わせを記述するラウドネス・データへの参照を含む、呈示データ・コンポーネントと；前記複数のコンテンツ・サブストリーム、前記一つまたは複数の呈示データ構造およびそれらの呈示データ構造によって参照される前記ラウドネス・データを含むビットストリームを形成するよう構成されている多重化コンポーネントとを有する。

〈ＩＩＩ．例示的実施形態〉
図１は、例として、ビットストリームPを処理して、出力オーディオ信号１１４の所望されるラウドネス・レベルを達成するためのデコーダ１００の一般化されたブロック図を示している。

デコーダ１００は、それぞれオーディオ信号を表わす複数のコンテンツ・サブストリームを含むビットストリームPを受領するよう構成されている受領コンポーネント（図示せず）を有する。

デコーダ１００はさらに、ビットストリームPから、一つまたは複数の呈示データ構造１０４を抽出するよう構成されたデマルチプレクサ１０２を有する。各呈示データ構造は、前記コンテンツ・サブストリームの少なくとも一つへの参照を含む。換言すれば、呈示データ構造（presentation data structure）または呈示は、どのコンテンツ・サブストリームが組み合わされるべきかの記述である。上記のように、二つ以上の別個のサブストリームにおいて符号化されているコンテンツ・サブストリームが一つの呈示に組み合わされてもよい。

各呈示データ構造はさらに、参照されている一つまたは複数のコンテンツ・サブストリームの組み合わせを記述するラウドネス・データを表わすメタデータ・サブストリームへの参照を含む。

呈示データ構造の内容およびその種々の参照について、ここで、図４との関連で述べる。

図４では、抽出された一つまたは複数の呈示データ構造１０４によって参照されうる種々のサブストリーム４１２、２０５が示されている。三つの呈示データ構造１０４のうち、選択された呈示データ構造１１０が選ばれている。図４から明らかなように、ビットストリームPは、コンテンツ・サブストリーム４１２、メタデータ・サブストリーム２０５および前記一つまたは複数の呈示データ構造１０４を有する。コンテンツ・サブストリーム４１２は、音楽のためのサブストリーム、効果のためのサブストリーム、周囲音（ambience）のためのサブストリーム、英語のダイアログのためのサブストリーム、スペイン語のダイアログのためのサブストリーム、英語での付随オーディオ（AA: associated audio）、たとえば英語のコメンタリー・トラックのためのサブストリームおよびスペイン語でのAA、たとえばスペイン語のコメンタリー・トラックのためのサブストリームを含んでいてもよい。

図４では、すべてのコンテンツ・サブストリーム４１２が同じビットストリームPにおいて符号化されているが、上記したように、常にそうでなくてもよい。オーディオ・コンテンツの放送者は、オーディオ・コンテンツをクライアントに、すなわちデコーダに送信するために、単一ビットストリーム構成、たとえばMPEG規格における単一パケット識別子（PID: packet identifier）構成を、あるいは複数ビットストリーム構成、たとえば二PID構成を使ってもよい。

本開示は、呈示層とサブストリーム層の間に存するサブストリーム・グループの形の中間レベルを導入する。コンテンツ・サブストリーム・グループは、一つまたは複数のコンテンツ・サブストリームをグループ化または参照してもよい。すると、呈示は、コンテンツ・サブストリーム・グループを参照しうる。図４では、音楽、効果および周囲音のコンテンツ・サブストリームがグループ化されて、コンテンツ・サブストリーム・グループ４１０を形成している。これを選択された呈示データ構造１１０が参照する（４０４）。

コンテンツ・サブストリーム・グループは、コンテンツ・サブストリームを組み合わせることにおける、さらなる柔軟性をもたらす。特に、サブストリーム・グループ・レベルは、いくつかのコンテンツ・サブストリームを一意的なグループ、たとえば音楽、効果および周囲音を含むグループ４１０にまとめるまたはグループ化する手段を提供する。

これは、（たとえば音楽および効果のための、あるいは音楽、効果および周囲音のための）コンテンツ・サブストリーム・グループが二つ以上の呈示のために、たとえば英語またはスペイン語のダイアログとの関連で使用できるので、有利でありうる。同様に、あるコンテンツ・サブストリームが、二つ以上のコンテンツ・サブストリーム・グループにおいて使用されることもできる。

さらに、呈示データ構造のシンタックスに依存して、コンテンツ・サブストリーム・グループを使うことは、呈示のために、より多数のコンテンツ・サブストリームを混合する可能性を提供することがありうる。

いくつかの実施形態によれば、呈示１０４、１１０は常に一つまたは複数のサブストリーム・グループからなる。

図４における選択された呈示データ構造１１０は、コンテンツ・サブストリームのうちの一つまたは複数から構成されるコンテンツ・サブストリーム・グループ４１０への参照４０４を含む。選択された呈示データ構造１１０はさらに、スペイン語のダイアログのためのコンテンツ・サブストリームへの参照およびスペイン語でのAAのためのコンテンツ・サブストリームへの参照を含む。さらに、選択された呈示データ構造１１０は、参照される一つまたは複数のコンテンツ・サブストリームの組み合わせを記述するラウドネス・データ４０８を表わすメタデータ・サブストリーム２０５への参照４０６を含む。明らかに、前記複数の呈示データ構造１０４の他の二つの呈示データ構造が、選択された呈示データ構造１１０と同様のデータを含んでいてもよい。他の実施形態によれば、ビットストリームPは、前記メタデータ・サブストリーム２０５と同様の追加的なメタデータ・サブストリームを含んでいてもよい。ここで、追加的なメタデータ・サブストリームは他の呈示データ構造から参照される。換言すれば、前記複数の呈示データ構造１０４の各呈示データ構造が、専用のラウドネス・データを参照してもよい。

選択された呈示データ構造は時間とともに、すなわちユーザーがスペイン語コメンタリー・トラックAA(ES)をオフにすることに決める場合に、変化してもよい。換言すれば、ビットストリームPは複数の時間フレームを含み、前記一つまたは複数の呈示データ構造１０４のうちの前記選択された呈示データ構造を示すデータ（図１の参照符号１０８）は、各時間フレームについて独立して割り当て可能である。

上記のように、ビットストリームPは複数の時間フレームを含む。いくつかの実施形態によれば、前記一つまたは複数の呈示データ構造１０４はビットストリームPの異なる時間セグメントに関係していてもよい。換言すれば、デマルチプレクサ（図１の参照符号１０２）は、ビットストリームPから、前記複数の時間フレームの第一のものについては、一つまたは複数の呈示データ構造を抽出するよう構成されていて、さらに、ビットストリームPから、前記複数の時間フレームの第二のものについては、前記複数の時間フレームの前記第一のものから抽出された前記一つまたは複数の呈示データ構造とは異なる一つまたは複数の呈示データ構造を抽出するよう構成されていてもよい。この場合、前記選択された呈示データ構造を示すデータ（図１における参照符号１０８）は、それが割り当てられる時間フレームについての、選択された呈示データ構造を示す。

ここで、図１を参照するに、デコーダ１００はさらに、再生状態コンポーネント１０６を有する。再生状態コンポーネント１０６は、前記一つまたは複数の呈示データ構造１０４のうち選択された呈示データ構造１１０を示すデータ１０８を受領するよう構成される。データ１０８は、所望されるラウドネス・レベルをも含む。上記したように、データ１０８は、デコーダ１００によってデコードされるオーディオ・コンテンツの消費者によって与えられてもよい。所望されるラウドネス値は、出力オーディオ信号の再生のために使用される再生設備に依存して、デコーダ固有の設定であってもよい。消費者はたとえば、上記から理解されるように、オーディオ・コンテンツがスペイン語のダイアログを含むべきであることを選んでもよい。

デコーダ１００はさらに、再生状態コンポーネント１０６から前記選択された呈示データ構造１１０を受領し、ビットストリームPから前記選択された呈示データ構造１１０によって参照される前記一つまたは複数のコンテンツ・サブストリームをデコードする混合コンポーネントをさらに有する。いくつかの実施形態によれば、選択された呈示データ構造１１０によって参照される前記一つまたは複数のコンテンツ・サブストリームのみが、混合コンポーネントによってデコードされる。結果として、消費者がたとえばスペイン語のダイアログをもつ呈示を選んだ場合、英語のダイアログを表わすいかなるコンテンツ・サブストリームもデコードされない。これはデコーダ１００の計算量を低減する。

混合コンポーネント１１２は、デコードされたコンテンツ・サブストリームに基づいて出力オーディオ信号を形成するよう構成される。

さらに、混合コンポーネント１１２は、前記選択された呈示データ構造１１０によって参照されるラウドネス・データに基づいて、前記デコードされた一つまたは複数のコンテンツ・サブストリームまたは前記出力オーディオ信号を処理して、前記所望されるダイアログ・ラウドネス・レベルを達成するよう構成される。

図２および図３は、混合コンポーネント１１２の異なる実施形態を記述する。

図２では、ビットストリームPは、サブストリーム・デコード・コンポーネント２０２によって受領され、サブストリーム・デコード・コンポーネント２０２は、前記選択された呈示データ構造１１０に基づいて、前記選択された呈示データ構造１１０によって参照される前記一つまたは複数のコンテンツ・サブストリーム２０４を、ビットストリームPからデコードする。次いで、前記一つまたは複数のデコードされたコンテンツ・サブストリーム２０４は、前記デコードされたコンテンツ・サブストリーム２０４およびメタデータ・サブストリーム２０５に基づいて出力オーディオ信号１１４を形成するコンポーネント２０６に伝送される。コンポーネント２０６は、オーディオ出力信号を形成するとき、たとえば、コンテンツ・サブストリーム（単数または複数）２０４に含まれる時間依存の空間位置データがあればそれを考慮に入れてもよい。コンポーネント２０６はさらに、メタデータ・サブストリーム２０５に含まれるDRCデータを考慮に入れてもよい。あるいはまた、ラウドネス・コンポーネント２１０（後述）が該DRCデータに基づいて出力オーディオ信号１１４を処理する。いくつかの実施形態では、コンポーネント２０６は呈示データ構造１１０から混合係数（後述）を受領して（図２には示さず）、それらを対応するコンテンツ・サブストリーム２０４に適用する。次いで、出力オーディオ信号１１４*がラウドネス・コンポーネント２１０に伝送され、ラウドネス・コンポーネント２１０は、選択された呈示データ構造１１０によって参照されるラウドネス・データ（メタデータ・サブストリーム２０５に含まれる）およびデータ１０８に含まれる所望されるラウドネス・レベルに基づいて、前記所望されるラウドネス・レベルを達成するよう出力オーディオ信号１１４*を処理し、こうしてラウドネス処理された出力オーディオ信号１１４を出力する。

図３では、同様の混合コンポーネント１１２が示されている。図２で記述した混合コンポーネント１１２との違いは、出力オーディオ信号を形成するコンポーネント２０６とラウドネス・コンポーネント２１０が互いに位置を交換していることである。結果として、ラウドネス・コンポーネント２１０が、（メタデータ・サブストリーム２０５に含まれるラウドネス・データに基づいて）前記所望されるラウドネス・レベルを達成するよう前記デコードされた一つまたは複数のコンテンツ・サブストリーム２０４を処理して、一つまたは複数のラウドネス処理されたコンテンツ・サブストリーム２０４*を出力する。次いでこれらが出力オーディオ信号を形成するためのコンポーネント２０６に伝送されて、コンポーネント２０６がラウドネス処理された出力オーディオ信号１１４を出力する。図２との関連で述べたように、（メタデータ・サブストリーム２０５に含まれる）DRCデータは、コンポーネント２０６において、あるいはラウドネス・コンポーネント２１０においてのいずれかで適用されうる。さらに、いくつかの実施形態では、コンポーネント２０６は呈示データ構造１１０から混合係数（後述）を受領し（図３には示さず）、これらの係数を対応するコンテンツ・サブストリーム２０４*に適用する。

前記一つまたは複数の呈示データ構造１０４のそれぞれは、デコードされたときに呈示データ構造によって参照されるコンテンツ・サブストリームのラウドネスが実際にどうなるかを示す専用のラウドネス・データを含む。いくつかの実施形態によれば、ラウドネス・データは、ラウドネス関数の、そのオーディオ入力信号へのゲーティング（gating）を適用する値を表わす。たとえば、ラウドネス・データが帯域制限する（band-limiting）ラウドネス関数に基づく場合、雑音のみを含む周波数帯域は無視されうるので、オーディオ入力信号の背景雑音は、ラウドネス・データを計算するときに考慮に入れられない。

さらに、ラウドネス・データは、ラウドネス関数の、オーディオ入力信号の、ダイアログを表わす時間セグメントに関係する値を表わしてもよい。これはATSC A/85規格に沿ったもので、同規格ではdialnormは明示的にダイアログのラウドネスに関して定義されている（アンカー要素）：「dialnormパラメータの値はコンテンツのアンカー要素のラウドネスを示す」。

前記選択された呈示データ構造によって参照されるラウドネス・データに基づく、前記所望されるラウドネス・レベルORLを達成するための前記デコードされた一つまたは複数のコンテンツ・サブストリームまたは前記出力オーディオ信号の処理、あるいは出力オーディオ信号の平準化（leveling）g_Lは、こうして、上記に従って計算される呈示（presentation）のdialnorm、DN(pres)を使って実行されうる：
g_L＝ORL－DN(pres)
ここで、DN(pres)およびORLは典型的にはいずれもdB_FS（フルスケール1kHz正弦波（または矩形波）を基準とするdB）で表現される値である。

いくつかの実施形態によれば、前記選択された呈示データ構造は二つ以上のコンテンツ・サブストリームを参照し、前記選択された呈示データ構造はさらに、前記二つ以上のコンテンツ・サブストリームに適用されるべき少なくとも一つの混合係数を参照する。混合係数（単数または複数）は、選択された呈示によって参照されるコンテンツ・サブストリーム間の修正された相対ラウドネス・レベルを提供するために使用されうる。これらの混合係数は、コンテンツ・サブストリーム内のチャネル／オブジェクトを他のコンテンツ・サブストリーム（単数または複数）内のチャネル／オブジェクトと混合する前に、該コンテンツ・サブストリーム内のチャネル／オブジェクトに広帯域利得として適用されてもよい。

少なくとも一つの混合係数は典型的には静的であるが、ビットストリームの各時間フレームについて独立して割り当て可能であってもよい。たとえばダッキングを達成するためである。

結果として、混合係数は、ビットストリームにおいて各時間フレームについて伝送される必要がない。上書きされるまで有効であり続けることができる。

混合係数はコンテンツ・サブストリーム毎に定義されてもよい。換言すれば、選択された呈示データ構造は、前記二つ以上のサブストリームの各サブストリームについて、対応するサブストリームに適用されるべき一つの混合係数を参照してもよい。

他の実施形態によれば、混合係数はコンテンツ・サブストリーム・グループ毎に定義され、コンテンツ・サブストリーム・グループ内のすべてのコンテンツ・サブストリームに適用されてもよい。換言すれば、前記選択された呈示データ構造は、コンテンツ・サブストリーム・グループについて、そのサブストリーム・グループを構成するコンテンツ・サブストリームのうち前記一つまたは複数のそれぞれに適用される単一の混合係数を参照する。

さらにもう一つの実施形態によれば、前記選択された呈示データ構造は、前記二つ以上のコンテンツ・サブストリームのそれぞれに適用される単一の混合係数を参照してもよい。

下記の表１は、オブジェクト伝送の例を示している。オブジェクトは、いくつかのサブストリームにわたって分配されるカテゴリーにクラスタリングされている。すべての呈示データ構造は、ダイアログなしのオーディオ・コンテンツの主要部分を含む音楽および効果を組み合わせる。よって、この組み合わせは、コンテンツ・サブストリーム・グループである。選択された呈示データ構造に依存して、ある言語が選ばれる。たとえば英語（D#1）またはスペイン語D#2である。さらに、コンテンツ・サブストリームは英語での一つの付随オーディオ・サブストリーム（Desc#1）およびスペイン語での一つの付随オーディオ・サブストリーム（Desc#2）を含む。付随オーディオ（associated audio）は、オーディオ説明（audio description）、耳が遠い人のためのナレーター、視覚障害者のためのナレーター、コメンタリー・トラックなどといった向上オーディオ（enhancement audio）を含んでいてもよい。

呈示１では、適用されるべき、混合係数を介した混合利得はない。よって、呈示１は全く混合係数を参照しない。

文化的な選好のため、カテゴリー間での異なるバランスが要求されることがある。これは呈示２において例示されている。スペイン語地域は音楽に対してそれほど注意を欲しない状況を考えられたい。したがって、音楽サブストリームは3dB減衰させられる。この例では、呈示２は、前記二つ以上のサブストリームの各サブストリームについて、それぞれのサブストリームに適用されるべき一つの混合係数を参照する。

呈示３は、視覚障害者のためのスペイン語説明ストリームを含んでいる。このストリームはブースで録音されたものであり、そのまま呈示に混合するには大きすぎるので、6dB減衰させられる。この例では、呈示３は、前記二つ以上のサブストリームの各サブストリームについて、それぞれのサブストリームに適用されるべき一つの混合係数を参照する。

呈示４では、音楽サブストリームおよび効果サブストリームの両方が3dB減衰させられる。この場合、呈示４は、M&Eサブストリーム・グループについては、該M&Eサブストリーム・グループを構成するコンテンツ・サブストリームの前記一つまたは複数のそれぞれに適用されるべき単一の混合係数を参照する。

いくつかの実施形態によれば、オーディオ・コンテンツのユーザーまたは消費者は、出力オーディオ信号が前記選択された呈示データ構造から逸脱するようユーザー入力を提供することができる。たとえば、ユーザーによってダイアログ向上またはダイアログ減衰が要求されてもよく、あるいはユーザーは何らかの種類のシーン・パーソナル化、たとえば効果音のボリュームの増大などを実行したいことがありうる。換言すれば、出力オーディオ信号を形成するために二つ以上のデコードされたコンテンツ・サブストリームを組み合わせるときに使われる代替的な混合係数が提供されてもよい。これは、オーディオ出力信号のラウドネス・レベルに影響することがある。この場合にラウドネス一貫性を提供するために、デコードされた一つまたは複数のコンテンツ・サブストリームのそれぞれは、そのコンテンツ・サブストリームのラウドネス・レベルを記述するサブストリーム・レベルでのラウドネス・データを含んでいてもよい。次いで、サブストリーム・レベルのラウドネス・データは、ラウドネス一貫性を提供するためにラウドネス・データを補償するために使われてもよい。

サブストリーム・レベルでのラウドネス・データは、呈示データ構造によって参照されるラウドネス・データと同様であってもよく、有利には、任意的にはコンテンツ・サブストリームにおける概してより静かな信号をカバーするためにより大きなレンジを用いて、ラウドネス関数の値を表現していてもよい。

ラウドネス一貫性を達成するためにこのデータを使う多くの仕方がある。下記のアルゴリズムは例として示される。

DN(P)が呈示dialnormであり、DN(S_i)がサブストリームiのサブストリーム・ラウドネスであるとする。

デコーダが、音楽コンテンツ・サブストリームS_Mおよび効果コンテンツ・サブストリームS_Eを一つのコンテンツ・サブストリーム・グループS_M&Eとして、さらにはダイアログ・コンテンツ・サブストリームS_Dを参照する呈示に基づいてオーディオ出力信号を形成するところであり、9dBのダイアログ向上（dialog enhancement）DEを適用しつつ一貫したラウドネスを保ちたい場合、デコーダは、コンテンツ・サブストリーム・ラウドネス値を加算すること：

によって、DEがある場合の新たな呈示ラウドネスDN(P_DE)を予測することができる。

上記のように、呈示ラウドネスを近似するときにサブストリーム・ラウドネスのそのような加算を実行することは、実際のラウドネスとは非常に異なるラウドネスを生じることがある。よって、代替は、DEなしで近似を計算し、実際のラウドネスからのオフセットを見出すことである。

DEに対する利得は、異なるサブストリーム信号が互いに相互作用する仕方におけるプログラムの大きな修正ではないので、DN(P_DE)の近似は、前記オフセットを使ってそれを補正すると、より正確になる可能性が高い。

いくつかの実施形態によれば、呈示データ構造はさらに、参照される一つまたは複数のコンテンツ・サブストリーム２０４について、ダイナミックレンジ圧縮DRCデータへの参照を含む。DRCデータは、一つまたは複数のDRC利得を前記デコードされた一つまたは複数のコンテンツ・サブストリーム２０４または前記出力オーディオ信号１１４に適用することによって、前記デコードされた一つまたは複数のコンテンツ・サブストリーム２０４を処理するために使用されることができる。前記一つまたは複数のDRC利得は、DRCデータに含まれていてもよく、あるいはDRCデータに含まれる一つまたは複数の圧縮曲線に基づいて計算されることができる。その場合、デコーダ１００は参照される一つまたは複数のコンテンツ・サブストリーム２０４のそれぞれについて、あるいは出力オーディオ信号１１４について、あらかじめ定義されたラウドネス関数を使ってラウドネス値を計算し、次いで、圧縮曲線（単数または複数）を使ってDRC利得にマッピングするために、そのラウドネス値（単数または複数）を使う。ラウドネス値のマッピングは、DRC利得の平滑化動作を含んでいてもよい。

いくつかの実施形態によれば、呈示データ構造によって参照されるDRCデータは複数のDRCプロファイルに対応する。これらのDRCプロファイルは、それが適用される特定のオーディオ信号に対してカスタム仕立てにされる。これらのプロファイルは、圧縮なし（「なし」）から、かなり軽度の圧縮（たとえば、「ミュージック・ライト（Music Light）」）から非常に積極的な圧縮（たとえば「スピーチ（Speech）」）までの範囲がありうる。結果として、DRCデータは、複数セットのDRC利得または該複数セットのDRC利得が得られるもとになる複数の圧縮曲線を含んでいてもよい。

参照されるDRCデータは、諸実施形態によれば、図４のメタデータ・サブストリーム２０５に含まれていてもよい。

ビットストリームPは、いくつかの実施形態によれば、二つ以上の別個のビットストリームを含んでいてもよく、諸コンテンツ・サブストリームはこの場合、異なるビットストリーム中に符号化されてもよいことを注意しておくべきである。前記一つまたは複数の呈示データ構造は、この場合、有利には、別個のビットストリームのすべてに含まれ、つまり、それぞれの別個のビットストリームについて一つあるいくつかのデコーダが別個にかつ全く独立して、選択された呈示データ構造によって参照されるコンテンツ・サブストリームをデコードするために機能できる（また、各別個のデコーダに与えられる）。いくつかの実施形態によれば、それらのデコーダは並列に機能できる。各別個のデコーダは、それが受け取る別個のビットストリームに存在するサブストリームをデコードする。諸実施形態によれば、所望されるラウドネス・レベルを達成するために、各別個のデコーダは、それがデコードしたコンテンツ・サブストリームの処理を実行する。次いで、処理されたコンテンツ・サブストリームはさらなる混合コンポーネントに与えられて、該さらなる混合コンポーネントが所望されるラウドネス・レベルをもつ出力オーディオ信号を形成する。

他の実施形態によれば、各別個のデコーダはそのデコードされた、未処理のサブストリームを前記さらなる混合コンポーネントに与え、該さらなる混合コンポーネントが、ラウドネス処理を実行し、次いで選択された呈示データ構造によって参照される前記一つまたは複数のコンテンツ・サブストリームの全部から出力オーディオ信号を形成する、あるいは、まず前記一つまたは複数のコンテンツ・サブストリームを混合し、混合された信号に対してラウドネス処理を実行する。他の実施形態によれば、各別個のデコーダは、そのデコードされたサブストリームの二つ以上に対して混合動作を実行する。次いで、さらなる混合コンポーネントが、別個のデコーダの事前混合された寄与を混合する。

図５は、図６との関連で、例として、オーディオ・エンコーダ５００を示す。エンコーダ５００は、一つまたは複数の呈示データ構造５０６を定義するよう構成されている呈示データ・コンポーネント５０４を有し、各呈示データ構造は、複数のコンテンツ・サブストリーム５０２のうちの一つまたは複数のコンテンツ・サブストリーム６１２への参照６０４、６０５および参照されるコンテンツ・サブストリーム６１２の組み合わせを記述するラウドネス・データ５１０への参照６０８を含む。エンコーダ５００はさらに、あらかじめ定義されているラウドネス関数５１４を適用して、それぞれのオーディオ信号を表わす一つまたは複数のコンテンツ・サブストリームの組み合わせを記述するラウドネス・データ５１０を取るよう構成されているラウドネス・コンポーネント５０８を有する。エンコーダはさらに、前記複数のコンテンツ・サブストリーム、前記一つまたは複数の呈示データ構造５０６および前記一つまたは複数の呈示データ構造５０６によって参照される前記ラウドネス・データ５１０を含むビットストリームPを形成するよう構成されている多重化コンポーネント５１２を有する。ラウドネス・データ５１０は典型的にはいくつかのラウドネス・データ・インスタンスを含み、前記一つまたは複数の呈示データ構造５０６のそれぞれについて一つのインスタンスがある。

エンコーダ５００はさらに、前記一つまたは複数の呈示データ構造５０６のそれぞれについて、参照された一つまたは複数のコンテンツ・サブストリームについてのダイナミックレンジ圧縮DRCデータを決定するよう適応されていてもよい。DRCデータは、少なくとも一つの所望される圧縮曲線または少なくとも一組のDRC利得を定量化する。DRCデータはビットストリームPに含められる。DRCデータおよびラウドネス・データ５１０は、諸実施形態によれば、メタデータ・サブストリーム６１４に含められてもよい。上記で論じたように、ラウドネス・データは典型的には呈示に依存する。さらに、DRCデータも呈示依存であってもよい。これらの場合、特定の呈示データ構造についてのラウドネス・データおよび該当するならDRCデータは、その特定の呈示データ構造についての専用のメタデータ・サブストリーム６１４に含められる。

エンコーダはさらに、前記複数のコンテンツ・サブストリーム５０２のそれぞれについて、前記あらかじめ定義されたラウドネス関数を適用して、そのコンテンツ・サブストリームのサブストリーム・レベルでのラウドネス・データを取得し；前記サブストリーム・レベルでのラウドネス・データを前記ビットストリームに含めるよう適応されていてもよい。前記あらかじめ定義されたラウドネス関数は、オーディオ信号のゲーティングに関係していてもよい。他の実施形態によれば、前記あらかじめ定義されたラウドネス関数は、オーディオ信号の、ダイアログを表わす時間セグメントのみに関係していてもよい。前記あらかじめ定義されたラウドネス関数は、いくつかの実施形態によれば：
・前記オーディオ信号の周波数依存の重み付け、
・前記オーディオ信号のチャネル依存の重み付け、
・前記オーディオ信号の、閾値未満の信号パワーをもつセグメントの無視、
・前記オーディオ信号の、発話として検出されないセグメントの無視、
・前記オーディオ信号のエネルギー／パワー／二乗平均平方根の測度の計算のうちの少なくとも一つを含んでいてもよい。

上記から理解されるように、ラウドネス関数は非線形である。つまり、ラウドネス・データが異なるコンテンツ・サブストリームから計算されただけであった場合には、ある呈示についてのラウドネスは、参照されるコンテンツ・サブストリームのラウドネス・データを足し合わせることによって計算されることはできない。さらに、異なるオーディオ・トラック、すなわちコンテンツ・サブストリームを同時再生のために一緒に組み合わせるとき、異なるオーディオ・トラックのコヒーレント／インコヒーレント部分の間の、あるいは異なる周波数領域における組み合わされた効果が現われることがあり、これのためさらに、オーディオ・トラックについてのラウドネス・データの加算は数学的に不可能になる。

〈ＩＶ．等価物、拡張、代替その他〉
上記の記述を吟味したのちには本開示のさらなる実施形態が当業者には明白となるであろう。本記述および図面は実施形態および例を開示しているが、本開示はそうした特定の例に制約されるものではない。数多くの修正および変形が、付属の請求項によってのみ定義される本開示の範囲から外れることなく、なされることができる。請求項に現われる参照符号があったとしても、その範囲を限定するものと理解されるものではない。

さらに、図面、本開示および付属の請求項の吟味から、本開示を実施する際に、当業者によって開示される実施形態への変形が理解され、実施されることができる。請求項において、単語「有する／含む」は、他の要素やステップを排除するものではなく、単数形の表現は複数を排除するものではない。ある種の施策が互いに異なる従属請求項において記載されているというだけの事実が、それらの施策の組み合わせが有利に使用できないことを示すものではない。

上記で開示された装置および方法は、ソフトウェア、ファームウェア、ハードウェアまたはそれらの組み合わせとして実装されうる。ハードウェア実装では、上記の記述で言及された機能ユニットの間でのタスクの分割は必ずしも物理的なユニットへの分割に対応しない。むしろ、一つの物理的コンポーネントが複数の機能を有していてもよく、一つのタスクが協働するいくつかの物理的コンポーネントによって実行されてもよい。ある種のコンポーネントまたはすべてのコンポーネントは、デジタル信号プロセッサまたはマイクロプロセッサによって実行されるソフトウェアとして実装されてもよく、あるいはハードウェアとしてまたは特定用途向け集積回路として実装されてもよい。そのようなソフトウェアは、コンピュータ記憶媒体（または非一時的な媒体）および通信媒体（または一時的な媒体）を含みうるコンピュータ可読媒体上で頒布されてもよい。当業者にはよく知られているように、コンピュータ記憶媒体という用語は、コンピュータ可読命令、データ構造、プログラム・モジュールまたは他のデータのような情報の記憶のための任意の方法または技術において実装される揮発性および不揮発性、リムーバブルおよび非リムーバブル媒体を含む。コンピュータ記憶媒体は、これに限られないが、RAM、ROM、EEPROM、フラッシュメモリまたは他のメモリ技術、CD-ROM、デジタル多用途ディスク（DVD）または他の光ディスク記憶、磁気カセット、磁気テープ、磁気ディスク記憶または他の磁気記憶デバイスまたは、所望される情報を記憶するために使用されることができ、コンピュータによってアクセスされることができる他の任意の媒体を含む。さらに、通信媒体が典型的にはコンピュータ可読命令、データ構造、プログラム・モジュールまたは他のデータを、搬送波または他の転送機構のような変調されたデータ信号において具現し、任意の情報送達媒体を含むことは当業者にはよく知られている。

いくつかの態様を記載しておく。
〔態様１〕
それぞれオーディオ信号を表わす複数のコンテンツ・サブストリームを含むビットストリームを処理する方法であって：
前記ビットストリームから、一つまたは複数の呈示データ構造を抽出する段階であって、各呈示データ構造は前記コンテンツ・サブストリームのうち一つまたは複数への参照を含み、各呈示データ構造はさらに、参照される一つまたは複数のコンテンツ・サブストリームの組み合わせを記述するラウドネス・データを表わすメタデータ・サブストリームへの参照を含む、段階と；
前記一つまたは複数の呈示データ構造のうちのある選択された呈示データ構造および所望されるラウドネス・レベルを示すデータを受領する段階と；
前記選択された呈示データ構造によって参照される前記一つまたは複数のコンテンツ・サブストリームをデコードする段階と；
デコードされたコンテンツ・サブストリームに基づいて出力オーディオ信号を形成する段階とを含み、
当該方法はさらに、前記選択された呈示データ構造によって参照されるラウドネス・データに基づいて、前記所望されるラウドネス・レベルを達成するよう、前記デコードされた一つまたは複数のコンテンツ・サブストリームまたは前記出力オーディオ信号を処理することを含む、
方法。
〔態様２〕
前記選択された呈示データ構造は二つ以上のコンテンツ・サブストリームを参照し、これらに適用されるべき少なくとも二つの混合係数をさらに参照し、
出力オーディオ信号の前記形成は、前記混合係数（単数または複数）を適用することによって、前記デコードされた一つまたは複数のコンテンツ・サブストリームを加法的に混合することをさらに含む、
態様１記載の方法。
〔態様３〕
前記ビットストリームは複数の時間フレームを含み、前記選択された呈示データ構造によって参照される混合係数（単数または複数）は、各時間フレームについて独立して割り当て可能である、態様２記載の方法。
〔態様４〕
前記選択された呈示データ構造は、前記二つ以上のサブストリームの各サブストリームについて、それぞれのサブストリームに適用されるべき一つの混合係数を参照する、態様２または３記載の方法。
〔態様５〕
前記ラウドネス・データは、ラウドネス関数の、そのオーディオ入力信号へのゲーティングの適用に関する値を表わす、態様１ないし４のうちいずれか一項記載の方法。
〔態様６〕
前記ラウドネス・データは、ラウドネス関数の、そのオーディオ入力信号のダイアログを表わす時間セグメントに関係する値を表わす、態様５記載の方法。
〔態様７〕
前記呈示データ構造はさらに、参照される一つまたは複数のコンテンツ・サブストリームについてのダイナミックレンジ圧縮（DRC）データへの参照を含み、
当該方法はさらに、前記DRCデータに基づいて、前記デコードされた一つまたは複数のコンテンツ・サブストリームまたは前記出力オーディオ信号を処理することを含み、該処理は、前記デコードされた一つまたは複数のコンテンツ・サブストリームまたは前記出力オーディオ信号に一つまたは複数のDRC利得を適用することを含む、
態様１ないし６のうちいずれか一項記載の方法。
〔態様８〕
前記DRCデータは、前記一つまたは複数のDRC利得の少なくとも一つの集合を含む、態様７記載の方法。
〔態様９〕
前記DRCデータは少なくとも一つの圧縮曲線を含み、前記一つまたは複数のDRC利得は：
あらかじめ定義されたラウドネス関数を使って前記参照される一つまたは複数のコンテンツ・サブストリームまたは前記オーディオ出力信号の一つまたは複数のラウドネス値を計算し、
前記圧縮曲線を使って前記一つまたは複数のラウドネス値をDRC利得にマッピングすることによって得られる、
態様７記載の方法。
〔態様１０〕
ラウドネス値の前記マッピングは、前記DRC利得の平滑化動作を含む、態様９記載の方法。
〔態様１１〕
前記参照されるDRCデータは、前記メタデータ・サブストリームに含まれる、態様７ないし１０のうちいずれか一項記載の方法。
〔態様１２〕
前記デコードされた一つまたは複数のコンテンツ・サブストリームのそれぞれは、そのコンテンツ・サブストリームのラウドネス・レベルを記述するサブストリーム・レベルでのラウドネス・データを含み、前記デコードされた一つまたは複数のコンテンツ・サブストリームまたは前記出力オーディオ信号の前記処理は、さらに、前記コンテンツ・サブストリームのラウドネス・レベルに基づいてラウドネス一貫性を提供することを含む、態様１ないし１１のうちいずれか一項記載の方法。
〔態様１３〕
出力オーディオ信号の前記形成が、代替的な混合係数を使って二つ以上のデコードされたコンテンツ・サブストリームを組み合わせることを含み、前記サブストリーム・レベルのラウドネス・データが、ラウドネス一貫性を提供するためにラウドネス・データを補償するために使われる、態様１２記載の方法。
〔態様１４〕
前記代替的な混合係数が：ダイアログ向上およびダイアログ減衰の一方に関する、態様１３記載の方法。
〔態様１５〕
前記コンテンツ・サブストリームのうち少なくとも一つへの参照は、前記コンテンツ・サブストリームのうち一つまたは複数からなる少なくとも一つのコンテンツ・サブストリーム・グループへの参照である、態様１ないし１４のうちいずれか一項記載の方法。
〔態様１６〕
前記選択された呈示データ構造は、あるコンテンツ・サブストリーム・グループについて、そのサブストリーム・グループを構成する前記コンテンツ・サブストリームのうちの前記一つまたは複数のそれぞれに適用される単一の混合係数を参照する、態様１５が態様２を引用する場合の態様１５記載の方法。
〔態様１７〕
前記ビットストリームは複数の時間フレームを含み、前記一つまたは複数の呈示データ構造のうちの前記選択された呈示データ構造を示すデータは、各時間フレームについて独立して割り当て可能である、態様１ないし１６のうちいずれか一項記載の方法。
〔態様１８〕
前記ビットストリームから、前記複数の時間フレームの第一のものについて、一つまたは複数の呈示データ構造を抽出し、
前記ビットストリームから、前記複数の時間フレームの第二のものについて、前記複数の時間フレームの前記第一のものから抽出された前記一つまたは複数の呈示データ構造とは異なる一つまたは複数の呈示データ構造を抽出することを含み、
前記選択された呈示データ構造を示すデータは、それが割り当てられている時間フレームについての選択された呈示データ構造を示す、
態様１７記載の方法。
〔態様１９〕
前記ビットストリームに含まれる前記複数のコンテンツ・サブストリームから、前記選択された呈示データ構造によって参照される前記一つまたは複数のコンテンツ・サブストリームのみがデコードされる、態様１ないし１８のうちいずれか一項記載の方法。
〔態様２０〕
前記ビットストリームは、それぞれ前記複数のコンテンツ・サブストリームのうち少なくとも一つを含む二つ以上の別個のビットストリームを含み、前記選択された呈示データ構造によって参照される前記一つまたは複数のコンテンツ・サブストリームをデコードする段階は：
前記二つ以上の別個のビットストリームの各特定のビットストリームについて、その特定のビットストリームに含まれる参照されているコンテンツ・サブストリームからコンテンツ・サブストリーム（単数または複数）を別個にデコードすることを含む、
態様１ないし１９のうちいずれか一項記載の方法。
〔態様２１〕
それぞれオーディオ信号を表わす複数のコンテンツ・サブストリームを含むビットストリームを処理するためのデコーダであって：
前記ビットストリームを受領するよう構成された受領コンポーネントと；
前記ビットストリームから、一つまたは複数の呈示データ構造を抽出するよう構成されたデマルチプレクサであって、各呈示データ構造は前記コンテンツ・サブストリームのうち少なくとも一つへの参照を含み、さらに、参照される一つまたは複数のコンテンツ・サブストリームの組み合わせを記述するラウドネス・データを表わすメタデータ・サブストリームへの参照を含む、デマルチプレクサと；
前記一つまたは複数の呈示データ構造のうちのある選択された呈示データ構造および所望されるラウドネス・レベルを示すデータを受領するよう構成された再生状態コンポーネントと；
前記選択された呈示データ構造によって参照される前記一つまたは複数のコンテンツ・サブストリームをデコードし、デコードされたコンテンツ・サブストリームに基づいて出力オーディオ信号を形成するよう構成された混合コンポーネントとを有し、
前記混合コンポーネントはさらに、前記選択された呈示データ構造によって参照されるラウドネス・データに基づいて、前記所望されるラウドネス・レベルを達成するよう、前記デコードされた一つまたは複数のコンテンツ・サブストリームまたは前記出力オーディオ信号を処理するよう構成されている、
デコーダ。
〔態様２２〕
オーディオ・エンコード方法であって：
それぞれのオーディオ信号を表わす複数のコンテンツ・サブストリームを受領し；
それぞれ前記複数のコンテンツ・サブストリームのうちの少なくとも一つを参照する一つまたは複数の呈示データ構造を定義し；
前記一つまたは複数の呈示データ構造のそれぞれについて、あらかじめ定義されているラウドネス関数を適用して、参照される一つまたは複数のコンテンツ・サブストリームの組み合わせを記述するラウドネス・データを取得し、前記呈示データ構造から前記ラウドネス・データへの参照（６０８）を含め；
前記複数のコンテンツ・サブストリーム、前記一つまたは複数の呈示データ構造およびそれらの呈示データ構造によって参照される前記ラウドネス・データを含むビットストリームを形成することを含む、
方法。
〔態様２３〕
前記一つまたは複数の呈示データ構造のそれぞれについて、参照される一つまたは複数のコンテンツ・サブストリームについてのダイナミックレンジ圧縮（DRC）データを決定する段階であって、該DRCデータは、少なくとも一つの所望される圧縮曲線または少なくとも一組のDRC利得を定量化する、段階と、
前記DRCデータを前記ビットストリームに含める段階とをさらに含む、
態様２２記載の方法。
〔態様２４〕
前記複数のコンテンツ・サブストリームのそれぞれについて、前記あらかじめ定義されているラウドネス関数を適用して、そのコンテンツ・サブストリームのサブストリーム・レベルでのラウドネス・データを取得する段階と；
前記サブストリーム・レベルでのラウドネス・データを前記ビットストリームに含める段階とをさらに含む、
態様２２または２３記載の方法。
〔態様２５〕
前記あらかじめ定義されているラウドネス関数は、前記オーディオ信号のゲーティングに関係する、態様２２ないし２４のうちいずれか一項記載の方法。
〔態様２６〕
前記あらかじめ定義されているラウドネス関数は、前記オーディオ信号の、ダイアログを表わす時間セグメントのみに関係する、態様２５記載の方法。
〔態様２７〕
前記あらかじめ定義されているラウドネス関数は：
前記オーディオ信号の周波数依存の重み付け、
前記オーディオ信号のチャネル依存の重み付け、
前記オーディオ信号の、閾値未満の信号パワーをもつセグメントの無視、
前記オーディオ信号のエネルギー測度の計算のうちの少なくとも一つを含む、
態様２２ないし２６のうちいずれか一項記載の方法。
〔態様２８〕
あらかじめ定義されているラウドネス関数を適用して、それぞれのオーディオ信号を表わす一つまたは複数のコンテンツ・サブストリームの組み合わせを記述するラウドネス・データを取得するよう構成されているラウドネス・コンポーネントと；
一つまたは複数の呈示データ構造を定義するよう構成されている呈示データ・コンポーネントであって、各呈示データ構造は、複数のコンテンツ・サブストリームのうちの一つまたは複数のコンテンツ・サブストリームへの参照および参照されるコンテンツ・サブストリームの組み合わせを記述するラウドネス・データへの参照を含む、呈示データ・コンポーネントと；
前記複数のコンテンツ・サブストリーム、前記一つまたは複数の呈示データ構造および前記一つまたは複数の呈示データ構造によって参照される前記ラウドネス・データを含むビットストリームを形成するよう構成されている多重化コンポーネントとを有する、
オーディオ・エンコーダ。
〔態様２９〕
態様１ないし２０および２２ないし２７のうちいずれか一項記載の方法を実行するための命令をもつコンピュータ可読媒体を有するコンピュータ・プログラム・プロダクト。

Claims

デコード装置によって、エンコードされたビットストリームを取得する段階と；
前記デコード装置によって、前記エンコードされたビットストリームからオーディオ信号およびメタデータを抽出する段階であって、前記メタデータは圧縮曲線データおよびラウドネス・データを含み、前記圧縮曲線データは複数のダイナミックレンジ（DRC）プロファイルのうちの1つに対応する圧縮曲線を示す、段階と；
前記デコード装置によって、前記ラウドネス・データを使って一つまたは複数のラウドネス値を生成する段階と；
前記デコード装置によって、前記圧縮曲線データを使って前記一つまたは複数のラウドネス値をDRC利得にマッピングする段階と；
前記デコード装置によって、前記DRC利得を前記オーディオ信号に適用する段階とを含む、
方法。
前記DRC利得がチャネルのグループに適用される、請求項１記載の方法。
前記ラウドネス・データの少なくとも一部が、チャネルのグループ内の特定のチャネルに関連付けられる、請求項２記載の方法。
前記ラウドネス・データが、前記オーディオ信号のチャネル依存の重み付けを含むラウドネス関数を含む、請求項１記載の方法。
前記ラウドネス値をDRC利得にマッピングすることが、発話であるとして検出されない前記オーディオ信号のセグメントを破棄することを含む、請求項１記載の方法。
一つまたは複数のプロセッサと；
前記一つまたは複数のプロセッサによって実行されたときに前記一つまたは複数のプロセッサに動作を実行させる命令を記憶しているメモリとを有するデコード装置であって、前記動作は：
エンコードされたビットストリームを取得する段階と；
前記エンコードされたビットストリームからオーディオ信号およびメタデータを抽出する段階であって、前記メタデータは圧縮曲線データおよびラウドネス・データを含み、前記圧縮曲線データは複数のダイナミックレンジ圧縮（DRC）プロファイルのうちの1つに対応する圧縮曲線を示す、段階と；
前記ラウドネス・データを使って一つまたは複数のラウドネス値を生成する段階と；
前記圧縮曲線データを使って前記一つまたは複数のラウドネス値をDRC利得にマッピングする段階と；
前記DRC利得を前記オーディオ信号に適用する段階とを含む、
デコード装置。
前記DRC利得がチャネルのグループに適用される、請求項６記載のデコード装置。
前記ラウドネス・データの少なくとも一部が、チャネルのグループ内の特定のチャネルに関連付けられる、請求項７記載のデコード装置。
前記ラウドネス・データが、前記オーディオ信号のチャネル依存の重み付けを含むラウドネス関数を含む、請求項６記載のデコード装置。
前記ラウドネス値をDRC利得にマッピングすることが、発話であるとして検出されない前記オーディオ信号のセグメントを破棄することを含む、請求項６記載のデコード装置。
一つまたは複数のプロセッサによって実行されたときに前記一つまたは複数のプロセッサに請求項１ないし５のうちいずれか一項に記載の方法を実行させる命令が記憶されている非一時的なコンピュータ可読記憶媒体。
コンピュータ上で実行されたときに請求項１ないし５のうちいずれか一項に記載の方法を実行するための実行可能命令を有するコンピュータ・プログラム・プロダクト。