JP7599554B2 - テキストと音声を用いたフェイシャルアクションユニットの自動生成によるフェイシャルアニメーション制御 - Google Patents

テキストと音声を用いたフェイシャルアクションユニットの自動生成によるフェイシャルアニメーション制御 Download PDF

Info

Publication number
JP7599554B2
JP7599554B2 JP2023514901A JP2023514901A JP7599554B2 JP 7599554 B2 JP7599554 B2 JP 7599554B2 JP 2023514901 A JP2023514901 A JP 2023514901A JP 2023514901 A JP2023514901 A JP 2023514901A JP 7599554 B2 JP7599554 B2 JP 7599554B2
Authority
JP
Japan
Prior art keywords
text
speech
model
emotion
face
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Active
Application number
JP2023514901A
Other languages
English (en)
Other versions
JP2023540535A (ja
Inventor
カウシィク、ラクシュミシュ
クマール、サケット
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Sony Interactive Entertainment Inc
Original Assignee
Sony Interactive Entertainment Inc
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Sony Interactive Entertainment Inc filed Critical Sony Interactive Entertainment Inc
Publication of JP2023540535A publication Critical patent/JP2023540535A/ja
Application granted granted Critical
Publication of JP7599554B2 publication Critical patent/JP7599554B2/ja
Active legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Images

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L21/00Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
    • G10L21/06Transformation of speech into a non-audible representation, e.g. speech visualisation or speech processing for tactile aids
    • G10L21/10Transforming into visible information
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N20/00Machine learning
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06TIMAGE DATA PROCESSING OR GENERATION, IN GENERAL
    • G06T13/00Animation
    • G06T13/20Three-dimensional [3D] animation
    • G06T13/205Three-dimensional [3D] animation driven by audio data
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06TIMAGE DATA PROCESSING OR GENERATION, IN GENERAL
    • G06T13/00Animation
    • G06T13/20Three-dimensional [3D] animation
    • G06T13/40Three-dimensional [3D] animation of characters, e.g. humans, animals or virtual beings
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L25/00Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
    • G10L25/48Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use
    • G10L25/51Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use for comparison or discrimination
    • G10L25/63Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use for comparison or discrimination for estimating an emotional state
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L13/00Speech synthesis; Text to speech systems
    • G10L13/08Text analysis or generation of parameters for speech synthesis out of text, e.g. grapheme to phoneme translation, prosody generation or stress or intonation determination
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L13/00Speech synthesis; Text to speech systems
    • G10L13/08Text analysis or generation of parameters for speech synthesis out of text, e.g. grapheme to phoneme translation, prosody generation or stress or intonation determination
    • G10L13/10Prosody rules derived from text; Stress or intonation

Landscapes

  • Engineering & Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • Theoretical Computer Science (AREA)
  • General Physics & Mathematics (AREA)
  • Software Systems (AREA)
  • Multimedia (AREA)
  • Health & Medical Sciences (AREA)
  • Data Mining & Analysis (AREA)
  • Evolutionary Computation (AREA)
  • Computing Systems (AREA)
  • Computational Linguistics (AREA)
  • Signal Processing (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Acoustics & Sound (AREA)
  • Artificial Intelligence (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • Mathematical Physics (AREA)
  • General Engineering & Computer Science (AREA)
  • Medical Informatics (AREA)
  • Child & Adolescent Psychology (AREA)
  • Psychiatry (AREA)
  • General Health & Medical Sciences (AREA)
  • Hospice & Palliative Care (AREA)
  • Quality & Reliability (AREA)
  • Processing Or Creating Images (AREA)

Description

本願は、概して、コンピュータシミュレーション及び他のアプリケーションでのテキスト及び音声を使用したフェイシャルアクションユニット(FAU)の自動生成によるフェイシャルアニメーション制御に関する。
コンピュータゲームのアバターなどのコンピュータ化された画像の顔は、シミュレーションのプレイ中にアニメーション化され、リアルな効果が得られる。本明細書で理解されるように、アーティストは通常、人間の顔のそれぞれの筋肉点の収縮または弛緩をエミュレートすることによって、フレームごとに顔のそれぞれの部分をアニメーション化するために使用されるフェイシャルアニメーションユニット(FAU)を苦労して作成する必要がある。
装置は、少なくとも1つのプロセッサであって、コンピュータ化されたアバターの顔の画像を識別すること、という命令で構成された、少なくとも1つのプロセッサを含む。命令は、機械学習(ML)エンジンへのアバターに関連する第1のモダリティデータを入力すること、アバターに関連する第2モダリティデータをMLエンジンに入力すること、及びアバターの顔の画像をアニメーション化するのに役立つMLエンジンから出力を受け取ることに対して実行可能である。命令はまた、出力に従ってアバターの顔をアニメーション化することに対して実行可能である。
いくつかの実施形態で、出力は、複数のフェイシャルアクションユニット(FAU)を含み、各FAUは、顔の画像のそれぞれの部分に関係する。非限定的な例で、第1のモダリティデータがテキストを含み、第2のモダリティデータは音声を含む。
非限定的な例では、命令は、MLエンジンを使用して、第1及び第2のモダリティデータから感情アクション情報を導出することに対して実行可能である。出力は、感情アクション情報から生成された時間で整合された単語レベルの感情確率に少なくとも部分的に基づき得る。
別の態様では、方法が、既知の単語を話すアニメーション化された顔のトレーニングセットを使用して、機械学習(ML)モデルをトレーニングすることを含む。方法はまた、第1のテキストに従って単語を話すアニメーション化される第1の顔の画像を生成することを含む。方法は、第1のテキストをMLモデルに入力すること、及びMLモデルの出力に従って、第1のテキストによって示される第1の単語を話す第1の顔の画像をアニメーション化することをさらに含む。
例示的な実施形態では、方法は第1のテキストから感情と情緒を検出すること、第1のテキストを第1のテキストを表す音声と整合させて、整合されたテキスト/音声をレンダリングすること、及び感情、情緒、及び整合されたテキスト/音声をMLモデルに入力することを含み得る。方法はまた、ターゲット感情をMLモデルに入力することを含み得る。方法の例示的実装形態では、フェイシャルアクションを表すMLモダリティから第1の確率を受け取ること、感情を表すMLモデルから第2の確率を受け取ること、及び第1及び第2の確率を使用して、フェイシャルアクションユニット(FAU)を確立することを含み得る。次いで方法は、FAUに従って第1の顔の画像をアニメーション化することを含むことができる。
別の態様では、アセンブリが、アニメーション化されたコンピュータアバターを提示するように構成された少なくとも1つのディスプレイ、及び機械学習(ML)モデルを実行するための命令で構成された少なくとも1つのプロセッサを含む。命令は、アバターが話す音声を示すテキストを受け取ること、MLモデルを使用してテキストを処理し、フェイシャルアクションユニット(FAU)を生成すること、及びFAUに従ってコンピュータアバターをアニメーション化することに対して実行可能である。
本願の詳細は、その構造と動作との両方について、添付の図面を参照すると最もよく理解でき、図面において、類似の参照符号は、類似の部分を指す。
本原理による例を含む例示的なシステムのブロック図である。 例示的なコンピュータ化されたアバターの顔のスクリーンショットである。 例示的なフローチャート形式で例示的な全体的なロジックを示す。 機械学習(ML)エンジンのトレーニングプロセスを示す。 MLエンジンの推論プロセスを示す。
本開示は、概して、限定されることなく、コンピュータゲームネットワークなどの家電(CE)デバイスネットワークの態様を含むコンピュータエコシステムに関する。本明細書のシステムは、クライアントコンポーネントとサーバコンポーネントとの間でデータが交換され得るように、ネットワークを通じて接続され得るサーバコンポーネント及びクライアントコンポーネントを含み得る。クライアントコンポーネントは、Sony PlayStation(登録商標)などのゲームコンソールまたはMicrosoft(登録商標)もしくはNintendo(登録商標)もしくは他の製造者によって作成されたゲームコンソール、仮想現実(VR)ヘッドセット、拡張現実(AR)ヘッドセット、ポータブルテレビ(例えば、スマートテレビ、インターネット対応テレビ)、ラップトップ及びタブレットコンピュータなどのポータブルコンピュータ、ならびにスマートフォン及び以下で議論される追加の実施例を含む他のモバイルデバイスを含む、1つ以上のコンピューティングデバイスを含み得る。これらのクライアントデバイスは、様々な動作環境で動作し得る。例えば、クライアントコンピュータのいくつかは、実施例として、Linux(登録商標)オペレーティングシステム、Microsoft(登録商標)のオペレーティングシステム、またはUnix(登録商標)オペレーティングシステム、またはApple,Inc.(登録商標)もしくはGoogle(登録商標)によって制作されたオペレーティングシステムを採用し得る。これらの動作環境は、Microsoft(登録商標)もしくはGoogle(登録商標)もしくはMozilla(登録商標)によって作成されたブラウザ、または以下で議論されるインターネットサーバによってホストされるウェブサイトにアクセスできる他のブラウザプログラムなど、1つ以上の閲覧プログラムを実行するために使用され得る。また、本原理による動作環境を使用して、1つ以上のコンピュータゲームプログラムを実行し得る。
サーバ及び/またはゲートウェイは、インターネットなどのネットワークを通じてデータを受信及び送信するようにサーバを構成する命令を実行する1つ以上のプロセッサを含み得る。あるいは、クライアント及びサーバは、ローカルイントラネットまたは仮想プライベートネットワークを通じて接続することができる。サーバまたはコントローラは、Sony PlayStation(登録商標)などのゲームコンソール、パーソナルコンピュータなどによってインスタンス化され得る。
クライアントとサーバとの間でネットワークを通じて情報を交換し得る。この目的及びセキュリティのために、サーバ及び/またはクライアントは、ファイアウォール、ロードバランサ、テンポラリストレージ、及びプロキシ、ならびに信頼性及びセキュリティのための他のネットワークインフラストラクチャを含むことができる。1つ以上のサーバは、ネットワークメンバーにオンラインソーシャルウェブサイトなどの安全なコミュニティを提供する方法を実装する装置を形成し得る。
プロセッサは、アドレスライン、データライン及び制御ラインなどの様々なライン、並びにレジスタ及びシフトレジスタによって論理を実行することができる、シングルチッププロセッサまたはマルチチッププロセッサであってよい。
一実施形態に含まれるコンポーネントは、他の実施形態では、任意の適切な組み合わせで使用することができる。例えば、本明細書に記載される、及び/または図で示される様々なコンポーネントのいずれもは、組み合わされ、交換され、または他の実施形態から除外されてもよい。
「A、B及びCのうちの少なくとも1つを有するシステム」(同様に「A、BまたはCのうちの少なくとも1つを有するシステム」及び「A、B、Cのうちの少なくとも1つを有するシステム」)は、A単独、B単独、C単独、A及びBを一緒に、A及びCを一緒に、B及びCを一緒に、ならびに/またはA、B及びCを一緒に有するシステムなどを含む。
ここで、具体的に図1を参照すると、本原理による、上述され、以下でさらに説明される例示的なデバイスのうちの1つ以上を含み得る例示的なシステム10が示されている。システム10に含まれる例示的なデバイスのうちの第1のデバイスは、限定されることなく、テレビチューナ(同等に、テレビを制御するセットトップボックス)を備えたインターネット対応テレビなどのオーディオビデオデバイス(AVD)12などの家電(CE)デバイスである。代替として、AVD12は、また、コンピュータ制御型インターネット対応(「スマート」)電話、タブレットコンピュータ、ノートブックコンピュータ、HMD、ウェアラブルコンピュータ制御デバイス、コンピュータ制御型インターネット対応ミュージックプレイヤ、コンピュータ制御型インターネット対応ヘッドフォン、インプラント可能な皮膚用デバイスなどのコンピュータ制御型インターネット対応インプラント可能デバイス、などであってもよい。それにも関わらず、AVD12は、本原理を実施する(例えば、本原理を実施するように他のCEデバイスと通信し、本明細書に記載される論理を実行し、本明細書に記載されるいずれかの他の機能及び/または動作を行う)ように構成されることを理解されたい。
したがって、このような原理を実施するために、AVD12は、図1に示されているコンポーネントの一部または全てによって確立することができる。例えば、AVD12は、1つ以上のディスプレイ14を備えることができ、このディスプレイは、高解像度もしくは超高解像度「4K」またはそれ以上の解像度のフラットスクリーンによって実装されてもよく、ディスプレイのタッチを介したユーザ入力信号を受信するためにタッチ対応であってもよい。AVD12は、本原理に従ってオーディオを出力するための1つ以上のスピーカ16、及び可聴コマンドをAVD12に入力してAVD12を制御するためのオーディオ受信機/マイクロホンなどの、少なくとも1つの追加入力デバイス18を含み得る。例示的なAVD12は、また、1つ以上のプロセッサ24の制御の下、インターネット、WAN、LANなどの少なくとも1つのネットワーク22を通じて通信するための1つ以上のネットワークインタフェース20を含み得る。また、グラフィックプロセッサ24Aが含まれていてもよい。したがって、インタフェース20は、限定されることなく、Wi-Fi(登録商標)送受信機であり得て、このWi-Fi(登録商標)送受信機は、限定されることなく、メッシュネットワーク送受信機などの無線コンピュータネットワークインタフェースの実施例である。プロセッサ24は、その上に画像を提示するようにディスプレイ14を制御すること及びそこから入力を受信することなど、本明細書に記載されるAVD12の他の要素を含むAVD12が本原理を実施するように、制御することを理解されたい。さらに、ネットワークインタフェース20は、有線もしくは無線のモデムもしくはルータ、または、例えば、無線テレフォニ送受信機もしくは上述したWi-Fi(登録商標)送受信機などの他の適切なインタフェースであってよいことに留意されたい。
上記のものに加えて、AVD12はまた、例えば、別のCEデバイスに物理的に接続する高解像度マルチメディアインタフェース(HDMI(登録商標))ポートもしくはUSBポート、及び/またはヘッドフォンを通してAVD12からユーザにオーディオを提供するためにAVD12にヘッドフォンを接続するヘッドフォンポートなどの1つ以上の入力ポート26を含んでもよい。例えば、入力ポート26は、オーディオビデオコンテンツのケーブルまたは衛星ソース26aに有線でまたは無線で接続されてもよい。したがって、ソース26aは、別個のもしくは統合されたセットトップボックス、または衛星受信機であってよい。あるいは、ソース26aは、コンテンツを含むゲームコンソールまたはディスクプレイヤであってもよい。ソース26aは、ゲームコンソールとして実装されるとき、CEデバイス44に関連して以下で説明されるコンポーネントの一部または全てを含んでよい。
AVD12は、さらに、一時的信号ではない、ディスクベースストレージまたはソリッドステートストレージなどの1つ以上のコンピュータメモリ28を含んでもよく、これらのストレージは、場合によっては、スタンドアロンデバイスとしてAVDのシャーシ内で、またはAVプログラムを再生するためにAVDのシャーシの内部もしくは外部のいずれかでパーソナルビデオ録画デバイス(PVR)もしくはビデオディスクプレイヤとして、または取り外し可能メモリ媒体として具現化されてもよい。また、ある実施形態では、AVD12は、限定されることなく、携帯電話受信機、GPS受信機、及び/または高度計30などの位置または場所の受信機を含むことができ、位置または場所の受信機は、衛星もしくは携帯電話基地局から地理的位置情報を受信し、その情報をプロセッサ24に供給し、及び/またはAVD12がプロセッサ24と併せて配置されている高度を決定するように構成される。コンポーネント30はまた、通常、加速度計、ジャイロスコープ、及び磁力計の組み合わせを含み、AVD12の位置及び方向を3次元で決定する慣性測定ユニット(IMU)によって実装されてもよい。
AVD12の説明を続けると、いくつかの実施形態では、AVD12は、1つ以上のカメラ32を含んでよく、1つ以上のカメラは、サーマルイメージングカメラ、ウェブカメラなどのデジタルカメラ、及び/またはAVD12に統合され、本原理に従って写真/画像及び/またはビデオを収集するようプロセッサ24によって制御可能なカメラであってよい。また、AVD12に含まれるのは、Bluetooth(登録商標)及び/または近距離無線通信(NFC)技術を各々使用して、他のデバイスと通信するためのBluetooth(登録商標)送受信機34及び他のNFC要素36であってよい。例示的なNFC素子は、無線周波数識別(RFID)素子であってもよい。
さらにまた、AVD12は、プロセッサ24に入力を供給する1つ以上の補助センサ37(例えば、加速度計、ジャイロスコープ、サイクロメータなどの運動センサ、または磁気センサ、赤外線(IR)センサ、光学センサ、速度センサ及び/またはケイデンスセンサ、ジェスチャセンサ(例えば、ジェスチャコマンドを検知するための)など)を含み得る。AVD12は、プロセッサ24への入力をもたらすOTA(無線)TV放送を受信するための無線TV放送ポート38を含み得る。上記に加えて、AVD12はまた、赤外線データアソシエーション(IRDA)デバイスなどの赤外線(IR)送信機及び/またはIR受信機及び/またはIR送受信機42を含み得ることに留意されたい。電池(図示せず)は、電池を充電するために及び/またはAVD12に電力を供給するために運動エネルギーを電力に変えることができる運動エネルギーハーベスタのように、AVD12に電力を供給するために提供され得る。
さらに図1を参照すると、AVD12に加えて、システム10は、1つ以上の他のCEデバイスタイプを含み得る。一実施例では、第1のCEデバイス44は、AVD12に直接送信されるコマンドを介して及び/または後述のサーバを通して、コンピュータゲームの音声及びビデオをAVD12に送信するために使用することができるコンピュータゲームコンソールであり得る一方で、第2のCEデバイス46は第1のCEデバイス44と同様のコンポーネントを含み得る。図示の実施例では、第2のCEデバイス46は、プレイヤによって操作されるコンピュータゲームのコントローラとして、またはプレイヤ47によって装着されるヘッドマウントディスプレイ(HMD)として構成され得る。図示の実施例では、2つのCEデバイス44、46のみが示されているが、より少ないまたはより多くのデバイスが使用されてよいことは理解されよう。本明細書のデバイスは、AVD12について示されているコンポーネントの一部またはすべてを実装し得る。次の図に示されているコンポーネントのいずれかに、AVD12の場合に示されているコンポーネントの一部またはすべてが組み込まれることがある。
ここで、上述の少なくとも1つのサーバ50を参照すると、サーバは、少なくとも1つのサーバプロセッサ52と、ディスクベースストレージまたはソリッドステートストレージなどの少なくとも1つの有形コンピュータ可読記憶媒体54と、サーバプロセッサ52の制御下で、ネットワーク22を通じて図1の他のデバイスとの通信を可能にし、実際に、本原理に従ってサーバとクライアントデバイスとの間の通信を容易にし得る少なくとも1つのネットワークインタフェース56とを含む。ネットワークインタフェース56は、例えば、有線もしくは無線モデムもしくはルータ、Wi-Fi送受信機、または、例えば、無線テレフォニ送受信機などの他の適切なインタフェースであってよいことに留意されたい。
したがって、いくつかの実施形態では、サーバ50は、インターネットサーバまたはサーバ「ファーム」全体であってよく、「クラウド」機能を含んでもよく、「クラウド」機能を実行してもよく、システム10のデバイスが、例えば、ネットワークゲームアプリケーションの例示的な実施形態においてサーバ50を介して「クラウド」環境にアクセスし得るようにする。あるいは、サーバ50は、図1に示されている他のデバイスと同じ部屋にある、またはその近くにある、1つ以上のゲームコンソール、または他のコンピュータによって実装されてもよい。
図2は、コンピュータアバターの顔202が提示される本明細書の任意のディスプレイなどのディスプレイ200を示す。顔202は、人間の顔の対応する部分の弛緩または収縮をエミュレートするために、それぞれのフェイシャルアニメーションユニット(FAU)によって要求されるようにアニメーション化され得る、多くのエミュレートされたアンカーポイント204(明確にするために4つだけが示されている)を有する。
図3は、FAUを自動的に生成して顔202をアニメーション化するために使用できる全体的なロジックを示す。本明細書で説明するロジックは、本明細書で説明するプロセッサのうちの任意の1つまたは複数によって実行することができる。
ブロック300で始まり、機械学習(ML)エンジンが、図4を参照して説明されるように訓練される。ブロック302に進むと、顔のビデオ画像202が、例えばコンピュータシミュレーション、例えばコンピュータゲームにより生成され、顔に関連する対応するマルチモダリティデータがブロック304でMLエンジンに入力される。図5を参照してさらに十分に説明するように、マルチモダリティデータから、MLエンジンは、ブロック306でアバターの顔202のエミュレートされた筋肉をアニメーション化するために使用される予測FAUを生成する。
図4は、MLエンジンのトレーニングプロセスの例を示している。データベース400からのデータのトレーニングセットがアクセスされる。データのトレーニングセットには、話しているときに感情を表現する顔の画像が含まれている。換言すれば、データベースは、正しい表現をアニメーション化しながら既知のテキストを話すアバターのグラウンドトゥルースアニメーションを含む。
入力されるトレーニング画像ごとに、画像のそれぞれのアンカーポイント204がブロック402で画像から抽出される。言い換えれば、ブロック402は、フェイシャルアクションユニット(FAU)に使用される入力画像のアンカーポイントを生成する。また、音声信号及び音声信号が関連付けられているテキストは、ブロック404で抽出され、ブロック404での音声及びテキストがブロック402で抽出されたFAUに関連付けられていることが理解される。
ブロック406は、以下にさらに開示するように、音声とテキストが互いに時間的に整合していることを示す。図4のグラフ407によって表されるように、音素境界は、対応するテキスト407Bの音声信号407Aの音素境界から抽出される。このようにすると、x軸に沿った各インクリメンタルブロックが音声によって生成された音素を表し、音素がインクリメンタルブロックの隣接する境界407C、407Dの間で定められる。
強制整合ブロック406は、音素境界を使用して、感情注釈ブロック408で感情を時間において整合し、エキスパートが感情で入力に注釈を付ける感情注釈ブロック410で感情を整合し、音声特徴ブロック412で音声の特徴を整合させる。したがって、対応する感情、情緒、及び音声の特徴は、抽出された音素境界を使用して整合される。以下でさらに説明するように、「情緒」は感情の程度、例えば肯定的または否定的であることを指すことができ、「感情」は話者の感情的な状態、例えば幸福、悲しみ、怒りなどを指すことができる。音声における単語のスライディングウィンドウは、この方法で処理できる、例えば、単語1~3に第1の感情/情緒で注釈を付けることができ、単語2~4に第2の感情/情緒で注釈を付けることができる、等々であることに留意されたい。音声特徴412は、入力の組み合わされた特性を表すために生成される。ウィグナー・ヴィル分布関数及び時間周波数フィルタリング技法を含む技法を使用して音声特徴を生成することができる。
ブロック408、410、及び412の生成物は、ML感情アクション生成モデル414に供給され、モデルをトレーニングする。また、モデル414への入力は、ブロック402からのFAUと、モデル414をトレーニングするために使用される入力される(注釈付き)感情のグラウンドトゥルースであるターゲット感情416である。このようにすると、モデル414はデータベース400からの複数のデータセットでトレーニングされ、FAUを対応する音声及びテキスト及びターゲット感情と相関させて、フェイシャルアクションアンカー確率418及び時間で整合させた単語レベル感情確率420を出力し、その後、FAUに従ってアンカーポイント204を適切にアニメーション化することによって、顔(例えば、図2の顔202)をアニメーション化する際に使用することができる。
図5に移る前に、感情は、カテゴリ及び次元的な感情の分類の一方または両方を使用してグラウンドトゥルース416と比較するために、入力トレーニングセットで検出され得る。カテゴリ分類は、幸福、悲しみ、怒り、恐怖などを含む感情カテゴリを生成する。次元的な分類は、感情価と覚醒度の観点から感情の次元を生成する。
図5は、モデル414によるその後の推論処理を示し、図5では510とラベル付けされている。アニメ化されたアバターが話すテキスト500は、テキストを音声信号に変換するためにテキスト読み上げブロック502に入力される。さらに、または代わりに、テキストに対応する記録された、または生の人間の音声がブロック502に供給され得る。図4を参照して上で教示されたように整合されたものに対応するブロックの要素を時間的に整合させるために、図4のグラフ407と同じ特徴を有するグラフ507によって示されるように、図4のトレーニングプロセスについて説明されたのと同じ方法で、ブロック504で音声の特徴が抽出され、ブロック506でテキスト及び対応する音声から音素境界が抽出される。
ブロック500からのアバターが話すテキストは感情及び情緒検出ブロック508に送られ、図4からのトレーニングに従ってテキストから情緒及び感情を抽出する。ブロック508でテキストから抽出された感情及び情緒は、ブロック504からの音声の特徴及びブロック506からの整合されたテキスト/音声信号とともに、モデル510に入力される。所望であれば、ブロック512に示されるように、ターゲット感情がモデルに入力され得る。ターゲット感情は、ユーザが入力するか、機械学習を使用して入力されたテキストから導出される、注釈付きテキストの一部であってもよい。
そのトレーニングに基づいて、モデル510は、受け取った入力から、各アンカーポイント204のフェイシャルアクションの確率512と、時間で整合されたテキスト/音声信号から導出された感情の確率516を出力する。これらの確率の一方または両方に基づいて、投影されたアンカー位置518(すなわち、FAU)が得られ、各アニメーション化されたフレームが描写する顔の表情を確立する。ブロック500で、FAUがアバターのアニメーションに適用され、アバターがテキスト入力を話すときに正しい表情を与える。
いくつかの例示的な実施形態を参照して本原理を説明したが、これらは限定することを意図しておらず、各種の代替的な構成が本明細書で特許請求される主題を実施するために使用されてよいことは理解されよう。

Claims (16)

  1. 装置であって、
    少なくとも1つのプロセッサであって、
    コンピュータ化されたアバターの顔の画像を識別すること、
    前記アバターに関連する第1のモダリティデータであって、音声を含む前記第1のモダリティデータを識別すること、
    前記アバターに関連する第2のモダリティデータであって、テキストを含む前記第2のモダリティデータを識別すること、
    前記アバターの前記顔の前記画像をアニメーション化するのに役立つ、前記第1のモダリティデータに少なくとも部分的に基づく第1の情報及び前記第2のモダリティデータに少なくとも部分的に基づく第2の情報を受け取ること、及び
    前記第1の情報及び前記第2の情報の両方に従って前記アバターの前記顔をアニメーション化すること、
    のための命令で構成された、前記少なくとも1つのプロセッサ、
    を含み、
    前記命令は少なくとも1つの機械学習(ML)モデルにアクセスして前記アバターの前記顔をアニメーション化することを実行可能であり、前記MLモデルは前記アバターの前記顔の画像から導出されたアンカーポイントを受け取ってフェイシャルアクションユニット(FAU)を生成し、前記音声及び前記テキストを前記FAUに関連付けることを実行可能であり、
    前記命令は、前記音声から抽出された音素境界を少なくとも部分的に使用して前記音声及び前記テキストを時間的に互いに整合させることを実行可能であり、前記命令は、前記音声から抽出された前記音素境界を使用して感情及び感情の程度を前記音声及び前記テキストと時間において整合させることをさらに実行可能である、前記装置。
  2. 前記命令は、前記第1及び第2のモダリティデータから前記感情を導出することを実行可能である、請求項1に記載の装置。
  3. 前記情報は、前記感情から生成された時間で整合された単語レベルの感情確率に少なくとも部分的に基づく、請求項2に記載の装置。
  4. 方法であって、
    第1のテキスト及び第1の音声の両方に従って単語を話すアニメーション化される第1の顔の画像を生成すること、
    前記第1のテキスト及び前記第1の音声を時間において整合させること、及び
    前記第1のテキスト及び前記第1の音声に従って、第1の単語を話す前記第1の顔の前記画像をアニメーション化すること、
    を含み、
    前記第1の顔の前記画像は、前記第1の音声における単語のスライディングウィンドウを処理することによって少なくとも部分的にアニメーション化され、前記第1の音声における単語1~Nは第1の感情に関連付けられ、前記第1の顔の前記画像は前記第1の感情に従ってアニメーション化され、前記第1の音声における単語2~N+は第2の感情に関連付けられ、前記第1の顔の前記画像は前記第2の感情に従ってアニメーション化され、Nは2よりも大きい整数である、前記方法。
  5. 既知の単語を話すアニメーション化された顔のトレーニングセットを使用して、機械学習(ML)モデルをトレーニングすること、
    前記第1のテキスト及び前記第1の音声を前記MLモデルに入力すること、
    前記MLモデルの出力に従って、前記第1の顔の前記画像をアニメーション化すること、
    前記第1のテキストから感情と情緒を検出すること、
    前記第1のテキストを前記第1のテキストを表す音声と整合させて、整合されたテキスト/音声をレンダリングすること、及び
    前記感情、前記情緒、及び前記整合されたテキスト/音声を前記MLモデルに入力すること、
    を含む、請求項4に記載の方法。
  6. ターゲット感情を前記MLモデルに入力すること
    を含む、請求項5に記載の方法。
  7. 前記MLモデルからフェイシャルアクションを表す第1の確率を受け取ること
    を含む、請求項5に記載の方法。
  8. 前記MLモデルから感情を表す第2の確率を受け取ること
    を含む、請求項7に記載の方法。
  9. 前記第1及び第2の確率の一方または両方を使用して、フェイシャルアクションユニット(FAU)を確立すること
    を含む、請求項8に記載の方法。
  10. 前記FAUに従って前記第1の顔の前記画像をアニメーション化すること
    を含む、請求項9に記載の方法
  11. アセンブリであって、
    アニメーション化されたコンピュータアバターを提示するように構成された少なくとも1つのディスプレイ、
    機械学習(ML)モデルを実行するための命令で構成された少なくとも1つのプロセッサであって、前記命令は、
    前記アバターが話す音声を示すテキストを受け取ること、
    音声を受け取ること、
    前記音声から抽出された音素境界を少なくとも部分的に使用して前記テキスト及び前記音声を時間において整合させること、
    前記MLモデルを使用して前記テキスト及び前記音声を処理し、フェイシャルアクションユニット(FAU)を生成すること、及び
    前記FAUに従って前記コンピュータアバターをアニメーション化すること、
    に対して実行可能である、前記少なくとも1つのプロセッサ、
    を含む、前記アセンブリ。
  12. 前記命令は、
    前記テキストから感情及び情緒を検出すること、
    前記テキストを、前記テキストを表す音声に整合させて、整合されたテキスト/音声をレンダリングすること、及び
    前記感情、前記情緒、及び前記整合されたテキスト/音声を前記MLモデルに入力すること、に対して実行可能である、請求項11に記載のアセンブリ。
  13. 前記命令は、
    ターゲット感情を前記MLモデルに入力することに対して実行可能である、請求項12に記載のアセンブリ。
  14. 前記命令は、
    前記MLモデルからフェイシャルアクションを表す第1の確率を受け取ること
    に対して実行可能である、請求項11に記載のアセンブリ。
  15. 前記命令は、
    前記MLモデルから感情を表す第2の確率を受け取ること
    に対して実行可能である、請求項14に記載のアセンブリ。
  16. 前記命令は、
    前記第1及び第2の確率を使用して前記FAUを確立することに対して実行可能である、請求項15に記載のアセンブリ。
JP2023514901A 2020-09-03 2021-09-02 テキストと音声を用いたフェイシャルアクションユニットの自動生成によるフェイシャルアニメーション制御 Active JP7599554B2 (ja)

Applications Claiming Priority (5)

Application Number Priority Date Filing Date Title
US202063074310P 2020-09-03 2020-09-03
US63/074,310 2020-09-03
US17/396,664 US11756251B2 (en) 2020-09-03 2021-08-07 Facial animation control by automatic generation of facial action units using text and speech
US17/396,664 2021-08-07
PCT/US2021/048870 WO2022051497A1 (en) 2020-09-03 2021-09-02 Facial animation control by automatic generation of facial action units using text and speech

Publications (2)

Publication Number Publication Date
JP2023540535A JP2023540535A (ja) 2023-09-25
JP7599554B2 true JP7599554B2 (ja) 2024-12-13

Family

ID=80356873

Family Applications (1)

Application Number Title Priority Date Filing Date
JP2023514901A Active JP7599554B2 (ja) 2020-09-03 2021-09-02 テキストと音声を用いたフェイシャルアクションユニットの自動生成によるフェイシャルアニメーション制御

Country Status (5)

Country Link
US (1) US11756251B2 (ja)
EP (1) EP4208866A4 (ja)
JP (1) JP7599554B2 (ja)
CN (1) CN116508100A (ja)
WO (1) WO2022051497A1 (ja)

Families Citing this family (8)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
EP3815050B1 (en) * 2018-05-24 2024-01-24 Warner Bros. Entertainment Inc. Matching mouth shape and movement in digital video to alternative audio
US20210375023A1 (en) * 2020-06-01 2021-12-02 Nvidia Corporation Content animation using one or more neural networks
US12592018B1 (en) * 2022-04-05 2026-03-31 Electronic Arts Inc. Generating expressive facial animation data from speech audio using speech emotion recognition
US12548225B2 (en) * 2022-06-17 2026-02-10 Lemon Inc. Audio or visual input interacting with video creation
US20240013464A1 (en) * 2022-07-11 2024-01-11 Samsung Electronics Co., Ltd. Multimodal disentanglement for generating virtual human avatars
JP2024030802A (ja) * 2022-08-25 2024-03-07 株式会社スクウェア・エニックス モデル学習装置、モデル学習方法、及びモデル学習プログラム。
US12518455B2 (en) * 2022-12-14 2026-01-06 Samsung Electronics Co., Ltd. Machine learning-based approach for audio-driven avatar animation or other functions
US20250008290A1 (en) * 2023-06-27 2025-01-02 University Of Central Florida Research Foundation, Inc. Spatially Explicit Auditory Cues for Enhanced Situational Awareness

Citations (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2005352892A (ja) 2004-06-11 2005-12-22 Nippon Telegr & Teleph Corp <Ntt> 情報処理装置および情報処理プログラム
JP2007058846A (ja) 2005-07-27 2007-03-08 Advanced Telecommunication Research Institute International リップシンクアニメーション作成用の統計確率モデル作成装置、パラメータ系列合成装置、リップシンクアニメーション作成システム、及びコンピュータプログラム
WO2019160100A1 (ja) 2018-02-16 2019-08-22 日本電信電話株式会社 非言語情報生成装置、非言語情報生成モデル学習装置、方法、及びプログラム

Family Cites Families (28)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US6539354B1 (en) * 2000-03-24 2003-03-25 Fluent Speech Technologies, Inc. Methods and devices for producing and using synthetic visual speech based on natural coarticulation
CN1952850A (zh) * 2005-10-20 2007-04-25 中国科学院自动化研究所 基于动态基元选取的语音驱动三维人脸动画方法
EP2140341B1 (en) * 2007-04-26 2012-04-25 Ford Global Technologies, LLC Emotive advisory system and method
US20090157625A1 (en) * 2007-12-13 2009-06-18 Searete Llc, A Limited Liability Corporation Of The State Of Delaware Methods and systems for identifying an avatar-linked population cohort
US8224652B2 (en) * 2008-09-26 2012-07-17 Microsoft Corporation Speech and text driven HMM-based body animation synthesis
BRPI0904540B1 (pt) * 2009-11-27 2021-01-26 Samsung Eletrônica Da Amazônia Ltda método para animar rostos/cabeças/personagens virtuais via processamento de voz
US10628741B2 (en) 2010-06-07 2020-04-21 Affectiva, Inc. Multimodal machine learning for emotion metrics
US11484685B2 (en) * 2010-06-07 2022-11-01 Affectiva, Inc. Robotic control using profiles
US10628985B2 (en) * 2017-12-01 2020-04-21 Affectiva, Inc. Avatar image animation using translation vectors
US20120130717A1 (en) * 2010-11-19 2012-05-24 Microsoft Corporation Real-time Animation for an Expressive Avatar
US20190102706A1 (en) * 2011-10-20 2019-04-04 Affectomatics Ltd. Affective response based recommendations
US9721373B2 (en) * 2013-03-14 2017-08-01 University Of Southern California Generating instructions for nonverbal movements of a virtual character
WO2016070354A1 (en) * 2014-11-05 2016-05-12 Intel Corporation Avatar video apparatus and method
US10559111B2 (en) * 2016-06-23 2020-02-11 LoomAi, Inc. Systems and methods for generating computer ready animation models of a human head from captured data images
US9812151B1 (en) * 2016-11-18 2017-11-07 IPsoft Incorporated Generating communicative behaviors for anthropomorphic virtual agents based on user's affect
US11145100B2 (en) * 2017-01-12 2021-10-12 The Regents Of The University Of Colorado, A Body Corporate Method and system for implementing three-dimensional facial modeling and visual speech synthesis
US10210648B2 (en) * 2017-05-16 2019-02-19 Apple Inc. Emojicon puppeting
US10586368B2 (en) * 2017-10-26 2020-03-10 Snap Inc. Joint audio-video facial animation system
US10521946B1 (en) * 2017-11-21 2019-12-31 Amazon Technologies, Inc. Processing speech to drive animations on avatars
US11404063B2 (en) * 2018-02-16 2022-08-02 Nippon Telegraph And Telephone Corporation Nonverbal information generation apparatus, nonverbal information generation model learning apparatus, methods, and programs
CN111316203B (zh) 2018-07-10 2022-05-31 微软技术许可有限责任公司 自动生成形象的动作
CN113383384A (zh) * 2019-01-25 2021-09-10 索美智能有限公司 语音动画的实时生成
US11049332B2 (en) * 2019-03-07 2021-06-29 Lucasfilm Entertainment Company Ltd. Facial performance capture in an uncontrolled environment
US11069135B2 (en) * 2019-03-07 2021-07-20 Lucasfilm Entertainment Company Ltd. On-set facial performance capture and transfer to a three-dimensional computer-generated model
CA3137927A1 (en) * 2019-06-06 2020-12-10 Artie, Inc. Multi-modal model for dynamically responsive virtual characters
KR102078209B1 (ko) 2019-07-05 2020-02-17 주식회사 데커드에이아이피 텍스트 메시지를 브이모지로 표현하는 아바타 비주얼 변환 장치 및 메시지 변환 방법
US11593984B2 (en) * 2020-02-07 2023-02-28 Apple Inc. Using text for avatar animation
CN111369967B (zh) * 2020-03-11 2021-03-05 北京字节跳动网络技术有限公司 基于虚拟人物的语音合成方法、装置、介质及设备

Patent Citations (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2005352892A (ja) 2004-06-11 2005-12-22 Nippon Telegr & Teleph Corp <Ntt> 情報処理装置および情報処理プログラム
JP2007058846A (ja) 2005-07-27 2007-03-08 Advanced Telecommunication Research Institute International リップシンクアニメーション作成用の統計確率モデル作成装置、パラメータ系列合成装置、リップシンクアニメーション作成システム、及びコンピュータプログラム
WO2019160100A1 (ja) 2018-02-16 2019-08-22 日本電信電話株式会社 非言語情報生成装置、非言語情報生成モデル学習装置、方法、及びプログラム

Also Published As

Publication number Publication date
EP4208866A4 (en) 2024-08-07
CN116508100A (zh) 2023-07-28
US11756251B2 (en) 2023-09-12
US20220068001A1 (en) 2022-03-03
JP2023540535A (ja) 2023-09-25
WO2022051497A1 (en) 2022-03-10
EP4208866A1 (en) 2023-07-12

Similar Documents

Publication Publication Date Title
JP7599554B2 (ja) テキストと音声を用いたフェイシャルアクションユニットの自動生成によるフェイシャルアニメーション制御
US11281709B2 (en) System and method for converting image data into a natural language description
JP7470137B2 (ja) 視覚的特徴をサウンドタグに相関させることによるビデオタグ付け
KR20210040882A (ko) 동영상을 생성하기 위한 방법 및 장치
JP7277611B2 (ja) テキスト類似性を使用した視覚的タグのサウンドタグへのマッピング
US20190172240A1 (en) Facial animation for social virtual reality (vr)
US20220254082A1 (en) Method of character animation based on extraction of triggers from an av stream
US11183219B2 (en) Movies with user defined alternate endings
US20250111171A1 (en) Reducing latency in game chat translation
US20240378398A1 (en) Real world image detection to story generation to image generation
US12280508B2 (en) Reproducing fast eye movement using imaging of robot with limited actuator speed
JP7764618B2 (ja) ユーザの顔をゲームキャラクターと組み合わせ、変更されたキャラクターを共有するための技法
US20240179291A1 (en) Generating 3d video using 2d images and audio with background keyed to 2d image-derived metadata
US20240123340A1 (en) Haptic fingerprint of user&#39;s voice
CN117242498A (zh) 使用机器学习从视频帧中识别控制器动作
US12549824B2 (en) Machine narration
US20250108293A1 (en) Reducing latency in game chat by predicting sentence parts to input to ml model using division of chat between in-game and social
US20250378616A1 (en) Pose-Based Facial Expressions
CN120936998A (zh) 使用ai的实时内容元数据创建
WO2025254920A1 (en) Pose-based facial expressions
JP2025539932A (ja) 既存のオーディオチャネル内に追加のオーディオアセットチャネルを埋め込むための非可聴超音波周波数の利用

Legal Events

Date Code Title Description
A621 Written request for application examination

Free format text: JAPANESE INTERMEDIATE CODE: A621

Effective date: 20230427

A977 Report on retrieval

Free format text: JAPANESE INTERMEDIATE CODE: A971007

Effective date: 20240214

A131 Notification of reasons for refusal

Free format text: JAPANESE INTERMEDIATE CODE: A131

Effective date: 20240220

A521 Request for written amendment filed

Free format text: JAPANESE INTERMEDIATE CODE: A523

Effective date: 20240419

A131 Notification of reasons for refusal

Free format text: JAPANESE INTERMEDIATE CODE: A131

Effective date: 20240827

A521 Request for written amendment filed

Free format text: JAPANESE INTERMEDIATE CODE: A523

Effective date: 20241021

TRDD Decision of grant or rejection written
A01 Written decision to grant a patent or to grant a registration (utility model)

Free format text: JAPANESE INTERMEDIATE CODE: A01

Effective date: 20241126

A61 First payment of annual fees (during grant procedure)

Free format text: JAPANESE INTERMEDIATE CODE: A61

Effective date: 20241203

R150 Certificate of patent or registration of utility model

Ref document number: 7599554

Country of ref document: JP

Free format text: JAPANESE INTERMEDIATE CODE: R150