JP7820003B2 - 遮蔽分割に基づく3次元顔再構築方法及びシステム - Google Patents

遮蔽分割に基づく3次元顔再構築方法及びシステム

Info

Publication number
JP7820003B2
JP7820003B2 JP2025518868A JP2025518868A JP7820003B2 JP 7820003 B2 JP7820003 B2 JP 7820003B2 JP 2025518868 A JP2025518868 A JP 2025518868A JP 2025518868 A JP2025518868 A JP 2025518868A JP 7820003 B2 JP7820003 B2 JP 7820003B2
Authority
JP
Japan
Prior art keywords
face
segmentation
occlusion
image
target
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Active
Application number
JP2025518868A
Other languages
English (en)
Other versions
JP2025534398A (ja
Inventor
叶▲嬌▼ 汪
ユディ・アディクスマ・ヨハネス
Original Assignee
ビゴ テクノロジー ピーティーイー. リミテッド
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by ビゴ テクノロジー ピーティーイー. リミテッド filed Critical ビゴ テクノロジー ピーティーイー. リミテッド
Publication of JP2025534398A publication Critical patent/JP2025534398A/ja
Application granted granted Critical
Publication of JP7820003B2 publication Critical patent/JP7820003B2/ja
Active legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V10/00Arrangements for image or video recognition or understanding
    • G06V10/40Extraction of image or video features
    • G06V10/54Extraction of image or video features relating to texture
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06TIMAGE DATA PROCESSING OR GENERATION, IN GENERAL
    • G06T19/00Manipulating three-dimensional [3D] models or images for computer graphics
    • G06T19/20Editing of three-dimensional [3D] images, e.g. changing shapes or colours, aligning objects or positioning parts
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F18/00Pattern recognition
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06TIMAGE DATA PROCESSING OR GENERATION, IN GENERAL
    • G06T15/00Three-dimensional [3D] image rendering
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06TIMAGE DATA PROCESSING OR GENERATION, IN GENERAL
    • G06T17/00Three-dimensional [3D] modelling for computer graphics
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06TIMAGE DATA PROCESSING OR GENERATION, IN GENERAL
    • G06T7/00Image analysis
    • G06T7/10Segmentation; Edge detection
    • G06T7/11Region-based segmentation
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V10/00Arrangements for image or video recognition or understanding
    • G06V10/20Image preprocessing
    • G06V10/26Segmentation of patterns in the image field; Cutting or merging of image elements to establish the pattern region, e.g. clustering-based techniques; Detection of occlusion
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V10/00Arrangements for image or video recognition or understanding
    • G06V10/20Image preprocessing
    • G06V10/26Segmentation of patterns in the image field; Cutting or merging of image elements to establish the pattern region, e.g. clustering-based techniques; Detection of occlusion
    • G06V10/267Segmentation of patterns in the image field; Cutting or merging of image elements to establish the pattern region, e.g. clustering-based techniques; Detection of occlusion by performing operations on regions, e.g. growing, shrinking or watersheds
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V10/00Arrangements for image or video recognition or understanding
    • G06V10/70Arrangements for image or video recognition or understanding using pattern recognition or machine learning
    • G06V10/77Processing image or video features in feature spaces; using data integration or data reduction, e.g. principal component analysis [PCA] or independent component analysis [ICA] or self-organising maps [SOM]; Blind source separation
    • G06V10/774Generating sets of training patterns; Bootstrap methods, e.g. bagging or boosting
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V10/00Arrangements for image or video recognition or understanding
    • G06V10/70Arrangements for image or video recognition or understanding using pattern recognition or machine learning
    • G06V10/82Arrangements for image or video recognition or understanding using pattern recognition or machine learning using neural networks
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V40/00Recognition of biometric, human-related or animal-related patterns in image or video data
    • G06V40/10Human or animal bodies, e.g. vehicle occupants or pedestrians; Body parts, e.g. hands
    • G06V40/16Human faces, e.g. facial parts, sketches or expressions
    • G06V40/168Feature extraction; Face representation
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06VIMAGE OR VIDEO RECOGNITION OR UNDERSTANDING
    • G06V40/00Recognition of biometric, human-related or animal-related patterns in image or video data
    • G06V40/10Human or animal bodies, e.g. vehicle occupants or pedestrians; Body parts, e.g. hands
    • G06V40/16Human faces, e.g. facial parts, sketches or expressions
    • G06V40/168Feature extraction; Face representation
    • G06V40/171Local features and components; Facial parts ; Occluding parts, e.g. glasses; Geometrical relationships
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06TIMAGE DATA PROCESSING OR GENERATION, IN GENERAL
    • G06T2207/00Indexing scheme for image analysis or image enhancement
    • G06T2207/20Special algorithmic details
    • G06T2207/20081Training; Learning
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06TIMAGE DATA PROCESSING OR GENERATION, IN GENERAL
    • G06T2207/00Indexing scheme for image analysis or image enhancement
    • G06T2207/20Special algorithmic details
    • G06T2207/20084Artificial neural networks [ANN]
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06TIMAGE DATA PROCESSING OR GENERATION, IN GENERAL
    • G06T2207/00Indexing scheme for image analysis or image enhancement
    • G06T2207/30Subject of image; Context of image processing
    • G06T2207/30196Human being; Person
    • G06T2207/30201Face
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06TIMAGE DATA PROCESSING OR GENERATION, IN GENERAL
    • G06T2210/00Indexing scheme for image generation or computer graphics
    • G06T2210/22Cropping
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06TIMAGE DATA PROCESSING OR GENERATION, IN GENERAL
    • G06T2219/00Indexing scheme for manipulating 3D models or images for computer graphics
    • G06T2219/20Indexing scheme for editing of 3D models
    • G06T2219/2016Rotation, translation, scaling

Landscapes

  • Engineering & Computer Science (AREA)
  • Theoretical Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • General Physics & Mathematics (AREA)
  • Health & Medical Sciences (AREA)
  • Multimedia (AREA)
  • General Health & Medical Sciences (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • Software Systems (AREA)
  • Oral & Maxillofacial Surgery (AREA)
  • Evolutionary Computation (AREA)
  • Computer Graphics (AREA)
  • Artificial Intelligence (AREA)
  • Medical Informatics (AREA)
  • Computing Systems (AREA)
  • Databases & Information Systems (AREA)
  • Human Computer Interaction (AREA)
  • Geometry (AREA)
  • General Engineering & Computer Science (AREA)
  • Computer Hardware Design (AREA)
  • Architecture (AREA)
  • Bioinformatics & Cheminformatics (AREA)
  • Evolutionary Biology (AREA)
  • Data Mining & Analysis (AREA)
  • Bioinformatics & Computational Biology (AREA)
  • Life Sciences & Earth Sciences (AREA)
  • Image Analysis (AREA)
  • Image Processing (AREA)

Description

本願は、2022年10月20日に中国国家知識産権局に出願された、中国特許出願第202211286327.0号の優先権を主張するものであり、これらの全部の内容は参照により本願に組み込まれる。
本願の実施例は、コンピュータ技術分野に関し、特に遮蔽分割に基づく3次元顔再構築方法及びシステムに関する。
現在、3次元顔再構築技術は、映画・テレビ、ゲーム、医療及び生放送ソーシャルなどの分野において広く応用されている。例えば、生放送ソーシャル分野において、ユーザー2D顔画像を取得し、3次元顔再構築技術を利用してユーザー顔の3D(表情、テクスチャ)情報を復元し、そして、顔3D美型、3D化粧などの機能を実現することができる。実際応用シーンにおいて、ユーザー2D顔画像には、常に予想通りに完全な顔が含まれておらず、肢体や物体に遮蔽される可能性があるため、顔遮蔽分割を行い、顔遮蔽領域に位置決めされる必要がある。よって、3次元顔再構築した後、3次元顔再構築結果及び顔遮蔽分割結果に基づいて後処理を行い、顔3D美型、3D化粧などの機能の実施効果を保障する。
しかし、関連技術における3次元顔再構築応用シーンでは、3次元顔再構築モデルと顔遮蔽分割モデルとを独立して配備し、3次元顔再構築と遮蔽領域分割を、独立した2つのタスクとして処理する。配備プラットフォームの計算力に限りがあるため、同時に複数のモデルを配備すると、計算リソースを占用しすぎ、プラットフォームの計算ストレスを増大させ、プラットフォームの計算業務の実行に影響を与える。
本願の実施例には、遮蔽分割に基づく3次元顔再構築方法及びシステムが提供され、3次元顔再構築応用シーンにおいてモデル配備による計算リソースに対する占用を減少し、モデル計算量を圧縮し、3次元顔再構築応用シーンでの計算リソースの占用が多すぎる技術問題を解決する。
第1様態において、本願の実施例には、遮蔽分割に基づく3次元顔再構築方法が提供され、遮蔽分割に基づく3次元顔再構築方法は、
目標顔画像を予め構築されたパラメータ予測モデルに入力し、パラメータ予測モデルが、画像特徴抽出器と画像分割デコーダとを含み、パラメータ予測モデルが、画像特徴抽出器と画像分割デコーダの関連損失関数が設定状態に達するまで、複数の顔訓練ピクチャーと、顔訓練ピクチャーの顔キーポイント情報と、顔遮蔽分割領域とに基づいて、訓練を行うことと、
パラメータ予測モデルによって目標顔画像の目標顔再構築パラメータと目標顔遮蔽領域を出力し、顔再構築パラメータと顔遮蔽分割領域に基づいて3次元顔再構築後処理を行うことと、を含む。
第2様態において、本願の実施例には、遮蔽分割に基づく3次元顔再構築システムが提供され、遮蔽分割に基づく3次元顔再構築システムは、入力モジュールと、出力モジュールとを含み、
当該入力モジュールは、目標顔画像を予め構築されたパラメータ予測モデルに入力するように配置され、パラメータ予測モデルは、画像特徴抽出器と画像分割デコーダとを含み、パラメータ予測モデルは、画像特徴抽出器と画像分割デコーダの関連損失関数が設定状態に達するまで、複数の顔訓練ピクチャーと、顔訓練ピクチャーの顔キーポイント情報と、顔遮蔽分割領域とに基づいて、訓練を行い、
当該出力モジュールは、パラメータ予測モデルによって目標顔画像の目標顔再構築パラメータと目標顔遮蔽領域を出力し、顔再構築パラメータと顔遮蔽分割領域に基づいて3次元顔再構築後処理を行うように配置される。
第3様態において、本願の実施例には、遮蔽分割に基づく3次元顔再構築デバイスが提供され、遮蔽分割に基づく3次元顔再構築デバイスは、
メモリと、一つ又は複数のプロセッサとを含み、
前記メモリは、一つ又は複数のプログラムを記憶するように配置され、
前記一つ又は複数のプログラムは、前記一つ又は複数のプロセッサによって実行されると、前記一つ又は複数のプロセッサに、第1様態のような前記の遮蔽分割に基づく3次元顔再構築方法を実現させる。
第4様態において、本願の実施例には、コンピュータ読取り可能な記憶媒体が提供され、前記コンピュータ読取り可能な記憶媒体には、コンピュータ実行可能な命令が記憶され、前記コンピュータ実行可能な命令は、コンピュータプロセッサによって実行されると、第1様態のような前記の遮蔽分割に基づく3次元顔再構築方法を実行するように配置される。
第5様態において、本願の実施例には、コンピュータプログラム製品が提供され、前記コンピュータプログラム製品には、命令が含まれ、命令がコンピュータまたはプロセッサによって実行されると、コンピュータまたはプロセッサは、第1態様のような前記の遮蔽分割に基づく3次元顔再構築方法を実行する。
本願の実施例は、目標顔画像を予め構築されたパラメータ予測モデルに入力し、当該パラメータ予測モデルは、画像特徴抽出器と画像分割デコーダとを含み、パラメータ予測モデルは、画像特徴抽出器と画像分割デコーダの関連損失関数が設定状態に達するまで、複数の顔訓練ピクチャーと、顔訓練ピクチャーの顔キーポイント情報と、顔遮蔽分割領域とに基づいて訓練を行い、そして、パラメータ予測モデルによって目標顔画像の目標顔再構築パラメータと目標顔遮蔽領域を出力し、顔再構築パラメータと顔遮蔽分割領域に基づいて3次元顔再構築後処理を行う。上記技術手段を採用して、画像特徴抽出器と画像分割デコーダの関連損失関数が設定状態に達するまで、画像特徴抽出器と画像分割デコーダとが含まれるパラメータ予測モデルを訓練することで、パラメータ予測モデルに、3次元顔再構築と顔遮蔽分割機能とを融合させ、モデル配備による計算リソースに対する占用を減少し、モデルの冗長度を減少し、モデル計算量を圧縮し、3次元顔再構築効率を向上させることができる。
なお、本願の実施例は、目標顔再構築パラメータのパラメータ次元及び画像分割デコーダのチャネル数をカスタマイズすることで、パラメータ予測モデルの計算量を適応的に配置し、パラメータ予測モデルを、異なる計算力がサポートする配備環境に適応させることができる。
本願の実施例に提供される遮蔽分割に基づく3次元顔再構築方法のフローチャートである。 本願の実施例におけるパラメータ予測モデル訓練フローチャートである。 本願の実施例におけるパラメータ予測モデルのサンプルの入出力概略図である。 本願の実施例における画像前処理フローチャートである。 本願の実施例におけるパラメータ予測モデルの予測フローチャートである。 本願の実施例における目標顔画像処理フローチャートである。 本願の実施例に提供される遮蔽分割に基づく3次元顔再構築システムの構造概略図である。 本願の実施例に提供される遮蔽分割に基づく3次元顔再構築デバイスの構造概略図である。
本願の目的、技術案及び利点をより明確にするために、以下、図面を結合して本願の具体的な実施例について、さらに詳細に説明する。ここで説明する具体的な実施例は、本願を限定するものではなく、本願を説明するためにのみ使用されることが理解される。なお、説明の便宜のために、図面には、全ての内容ではなく、本願に係る部分のみが示される。例示的な実施例をより詳細に説明する前に言及すべきことは、いくつかの例示的な実施例が、フローチャートで説明する処理又は方法として記述されていることである。フローチャートでは、各動作(又はステップ)が逐次的な処理として説明されるが、この中の多くの動作は、並列、同時に発生又は同時に実施することができる。なお、各動作の順番は並べ替えることができる。その動作が完了すると、上記の処理が終了されることができるが、さらに、図面に含まれていない追加のステップを含むことができる。上記処理は、方法、関数、プロシージャ、サブルーチン、サブプログラムなどに対応することができる。
本願に提供される遮蔽分割に基づく3次元顔再構築方法は、画像特徴抽出器と画像分割デコーダとを融合するパラメータ予測モデルを訓練することで、パラメータ予測モデルが3次元顔再構築及び顔遮蔽領域分割の機能を結合できるようにすることを目的とする。これにより、モデル配備による計算リソースに対する占用を減少し、モデル計算量を圧縮する。伝統的な3次元顔再構築シーンは、3次元顔再構築を行う過程において、顔遮蔽が3次元顔の後処理機能に影響を与えることを回避するために、独立した顔遮蔽分割モデルを配備することで顔遮蔽領域を予測し、さらに、位置決めされた顔遮蔽領域に基づいて3次元顔後処理を行う。3次元顔再構築モデルと顔遮蔽分割モデルとを独立して配備するため、両者の間に冗長な画像処理ステップが存在し、3次元顔再構築と遮蔽領域とを独立した2つのタスク処理として分割することは、プラットフォームの計算ストレスを増大させ、プラットフォームの他の業務の実行に影響を与える。これに基づいて、本本願の実施例には、3次元顔再構築と遮蔽領域分割とを独立した2つのタスクとして処理することで、現在の3次元顔再構築応用シーンにおける計算リソースの占用が多すぎる技術問題を解決するものが提供される。
実施例:
図1には、本願の実施例に提供される遮蔽分割に基づく3次元顔再構築方法のフローチャートを示し、本実施例に提供される遮蔽分割に基づく3次元顔再構築方法は、遮蔽分割に基づく3次元顔再構築デバイスによって実行されることができ、当該遮蔽分割に基づく3次元顔再構築デバイスは、ソフトウェア及び/又はハードウェアの方式によって実現されることができ、当該遮蔽分割に基づく3次元顔再構築デバイスは、2つ又は複数の物理実体構成であってもよいし、1つの物理実体構成であってもよい。一般的に、当該遮蔽分割に基づく3次元顔再構築デバイスは、コンピュータ、携帯電話、タブレット、画像処理サーバなどの処理デバイスであってもよい。
以下、当該遮蔽分割に基づく3次元顔再構築デバイスを、遮蔽分割に基づく3次元顔再構築方法を実行する主体とすることを例として説明する。図1を参照し、当該遮蔽分割に基づく3次元顔再構築方法は、具体的に以下のことを含む。
S110、目標顔画像を予め構築されたパラメータ予測モデルに入力し、パラメータ予測モデルは、画像特徴抽出器と画像分割デコーダとを含み、パラメータ予測モデルは、画像特徴抽出器と画像分割デコーダの関連損失関数が設定状態に達するまで、複数の顔訓練ピクチャーと、顔訓練ピクチャーの顔キーポイント情報と、顔遮蔽分割領域とに基づいて、訓練を行う。
本願の実施例は、3次元顔再構築を行う時に、3次元顔画像を作成する準備ができている2D顔画像を予め構築されたパラメータ予測モデルに入力し、当該2D顔画像を目標顔画像として定義し、パラメータ予測モデルによって目標顔画像の3次元顔再構築パラメータと顔遮蔽領域を予測して、目標顔再構築パラメータと目標顔遮蔽領域として定義する。パラメータ予測モデルは、画像特徴抽出器と画像分割デコーダとを融合し、両者の間の関連損失関数に基づいて訓練を行うことで、3次元顔再構築と遮蔽領域分割タスクを並列処理し、モデル処理効率を向上させ、効果を相互に促進することができる。
これに先立ち、当該パラメータ予測モデルを予め訓練することで、パラメータ予測モデルが、3次元顔再構築及び遮蔽領域分割タスクを実行できるようにする。図2を参照し、パラメータ予測モデルの訓練プロセスは、
S1001、複数の顔訓練ピクチャーと、顔訓練ピクチャーの顔キーポイント情報と、顔遮蔽分割領域とを、訓練サンプルとすることと、
S1002、訓練サンプルに基づいて、パラメータ予測モデルを訓練し、画像特徴抽出器によって対応する顔予測キーポイント情報を出力し、画像分割デコーダによって顔予測遮蔽分割領域を出力し、顔予測キーポイント情報に基づいて3次元顔再構築を行い、3次元顔予測画像を生成することと、
S1003、3次元顔予測画像と、顔予測キーポイント情報と、顔予測遮蔽分割領域とを、予測サンプルとして、訓練サンプル及び予測サンプルに基づいて、画像特徴抽出器と画像分割デコーダの関連損失関数を計算し、関連損失関数が設定状態に達した場合に、パラメータ予測モデルの訓練プロセスを完了することと、
を含む。
本願の実施例がパラメータ予測モデル訓練を行う際に、複数の顔ピクチャーを顔訓練ピクチャーとして入力し、各顔訓練ピクチャーの顔キーポイント情報を取得し、予め訓練された顔領域分割モデルによって顔訓練ピクチャーの顔遮蔽分割領域を確定する。上記、複数の顔訓練ピクチャーと、顔訓練ピクチャーの顔キーポイント情報と、顔遮蔽分割領域とを訓練サンプルとして、パラメータ予測モデルの画像特徴抽出器及び画像分割デコーダに対して訓練を行う。
ここで、顔訓練ピクチャーを画像特徴抽出器に入力することで、対応する顔予測キーポイント情報を出力する。そして、顔予測キーポイント情報を3次元顔再構築モデルを入力して3次元顔再構築を行い、顔予測キーポイント情報に基づいて3次元顔モデルを確定し、微分可能なレンダラーによって、3次元顔モデルを2D平面に投影して2D画像にレンダリングし、対応する予測レンダリング画像、即ち3次元顔予測画像を得る。一方、画像特徴抽出器によって、顔訓練ピクチャーに基づいて画像特徴を抽出した後、画像分割デコーダに入力して顔画像分割を行い、即ち顔予測遮蔽分割領域を出力することができる。パラメータ予測モデルは、上記3次元顔予測画像と、顔予測キーポイント情報と、顔予測遮蔽分割領域とを予測サンプルとして、訓練サンプル及び予測サンプルに基づいて画像特徴抽出器と画像分割デコーダの関連損失関数を計算し、且つ関連損失関数が設定状態に達した場合に、パラメータ予測モデル訓練が完了することを確定する。
なお、訓練サンプルにおける顔訓練ピクチャーについて、ピクチャーの顔領域は、遮蔽領域を含むことができ、また顔遮蔽領域を含まないこともでき、異なる遮蔽状況についての顔訓練ピクチャーに対してパラメータ予測モデルの訓練を行うことで、モデル予測の安定性及び信頼性を向上させることができる。
本願の実施例は、関連損失関数を設計することにより、予測サンプルを、訓練原本に徐々に近づけることを目的とし、関連損失関数が設定状態にある場合、訓練サンプルと予測サンプルとの類似度が、モデル予測標準に適合しており、3次元顔再構築に適用できることを表す。
例示的には、図3に示すように、顔訓練ピクチャーI、顔訓練ピクチャーの顔キーポイント情報Im及び顔遮蔽分割領域Mを入力することで、上記モデル訓練の訓練プロセスに基づいて、対応する3次元顔予測画像I、顔予測キーポイント情報Im及び顔予測遮蔽分割領域Mを出力する。なお、パラメータ予測モデルから出力される3次元顔予測画像Iは、顔の非遮蔽の部分のみを再構築し、遮蔽物を有する状況について、対応する遮蔽物を再構築しない。図3に示すように、予測される3次元顔予測画像Iは、目の遮蔽物サングラスを再構築しない。これにより、顔遮蔽領域の、再構築される3次元顔に対する干渉を回避し、後続の3次元顔再構築後処理効果を最適化することができる。
実施例において、パラメータ予測モデルの関連損失関数は、分割損失関数、分割スケーリング損失関数及び顔再構築損失関数を含み、ここで、分割損失関数は、顔遮蔽分割領域と対応する顔予測遮蔽分割領域との間の差異を測るために使用され、分割スケーリング損失関数は、顔予測遮蔽分割領域に対してスケーリング調整を行うために使用され、顔再構築損失関数は、顔訓練ピクチャーと対応する3次元顔予測画像との間の差異を測るために使用される。
本願の実施例では、顔領域分割の関連損失関数と顔再構築される関連損失関数とを組み合わせて、分割スケーリング損失関数を導入して、3次元顔再構築と顔遮蔽分割との間のつながりを確立する。これにより、遮蔽が存在する場合、顔再構築パラメータの予測がより安定し、同時に顔遮蔽分割もより精確にすることができる。画像特徴抽出器と画像分割デコーダとを相互に促進するようにモデル訓練を完了させる。
また、分割スケーリング損失関数は、分割領域拡大関数と、分割領域収縮関数とを含み、分割領域拡大関数は、顔予測遮蔽分割領域を拡大させるために使用され、分割領域収縮関数は、顔予測遮蔽分割領域を収縮させるために使用される。
具体的には、分割損失関数を、
と表す。
分割スケーリング損失関数を、
と表す。
ここで、
は分割損失関数を表し、Mは顔遮蔽分割領域を表し、Mは顔予測遮蔽分割領域を表し、分割損失関数に基づいて、顔遮蔽分割領域と対応する顔予測遮蔽分割領域との間の差異を表し、Iは顔訓練ピクチャーを表し、Iは3次元顔予測画像を表し、
は顔遮蔽分割領域の画素数を表し、
は顔予測遮蔽分割領域の画素数を表し、xは画素値を表し、数式(3)及び数式(4)は分割領域拡大関数を表し、それは、ピクチャーが遮蔽されるか否かがその知覚特性に影響を与えない特徴、及び顔遮蔽分割領域画素数と顔予測遮蔽分割領域との間の比を最大化することを利用することで、予測される顔予測遮蔽分割領域をできるだけ外に拡大する傾向があり、同時に、数式(5)及び数式(6)は、分割領域収縮関数を表し、この数式(5)は、画素差値を比較する時に、顔訓練ピクチャーIと3次元顔予測画像Iとの間にわずかな変位誤差を許容できることを表し、数式(6)は、顔予測遮蔽分割領域を予測する場合、顔訓練ピクチャーIと3次元顔予測画像Iのレンダリングピクチャーとの間の知覚誤差ができるだけ近いべきであることを表し、数式(5)と(6)は、顔予測遮蔽分割領域に、画素レベル及び知覚層誤差が大きい部分を無視させることで、予測される顔予測遮蔽分割領域をできるだけ縮小する傾向がある。
上記数式(1)-数式(6)を総合すると、クロスエントロピー損失を利用して、顔予測遮蔽分割領域の基本輪郭を確保しつつ、分割スケーリング損失関数を利用して顔予測遮蔽分割領域に対して精密化調整を行うことができる。また、分割スケーリング損失関数を利用して顔再構築部分とつながりを確立し、同時に、顔予測遮蔽分割領域を加える場合、顔を再構築する知覚層と画素レベル誤差を考慮することで、3次元顔再構築と顔遮蔽分割タスクとを並列して行い、同時に両者の効果を相互に促進することができる。
なお、顔再構築損失関数は、
と表す。
ここで、数式(7)は、顔訓練ピクチャーIと3次元顔予測画像Iとが遮蔽されない部分で、画素レベルが類似しているべきであることを表し、数式(8)は、顔キーポイント情報Imと顔予測キーポイント情報Imとができるだけ適合すべきであることを表し、数式(9)は、顔訓練ピクチャーIと3次元顔予測画像Iが、モデル知覚に対して、類似であるべきであることを表す。
関連損失関数が設定状態に達するまで、上記画像特徴抽出器と画像分割デコーダの関連損失関数に基づいてパラメータ予測モデル訓練を行う場合、上記の関連損失関数数式(1)-(9)のように、設定値に収束されると、パラメータ予測モデルの訓練が完了し、パラメータ予測モデルの予測結果が予想標準に達したことを示す。
本願の実施例は、3次元顔再構築と顔分割タスクとを結合することで、1つのモデルにおいて3次元顔再構築パラメータ及び顔遮蔽領域を同時出力することを実現し、これにより、モデル配備のオーバーヘッドを減少する。また、分割損失関数、分割スケーリング損失関数及び顔再構築損失関数という3つの種類の損失関数を結合することで、モデルに3次元顔再構築と顔遮蔽分割タスクとの内在のつながりを学習させ、モデルの冗長度をより大きく解消することができ、そして、より小さなモデルを使用することで3次元顔再構築及び顔遮蔽分割タスクを完了することができる。これにより、モデル計算量を圧縮し、モデル処理効率を向上させる。
実施例において、当該既に構築されたパラメータ予測モデルに基づいて、目標顔画像の3次元顔再構築及び顔遮蔽分割を行う場合、本願の実施例は、目標顔画像に対して前処理を行うことで、前処理後の目標顔画像をパラメータ予測モデルに入力し、3次元顔再構築及び顔遮蔽分割を行う。
図4を参照し、目標顔画像の前処理プロセスは、
S1101、顔キーポイント検出器及びテンプレート顔キーポイントに基づいて目標顔画像を位置合わせし、目標顔画像の伸長及び並進パラメータを得ることと、
S1102、伸長及び並進パラメータに基づいて目標顔画像をクロップし、目標顔画像を標準顔寸法に適合させることと、
を含む。
目標顔画像の前処理は、主に、パラメータ予測モデルに入力するピクチャーデータに対して選別及び校正を行う。顔キーポイント検出器を用いてテンプレート顔キーポイントと目標顔画像の位置合わせを行うことで、前処理目標顔画像の伸長及び並進パラメータを得る。さらに、目標顔画像に対して対応するパラメータを用いて処理してクロップし、目標顔画像を標準顔寸法に適合させ、これにより、後続のパラメータ予測モデルの使用を容易にすることができる。異なる目標顔画像について、その画像における顔部分領域の寸法が異なり、パラメータ予測モデルの予測効果を保障するために、パラメータ予測モデルが目標顔画像を標準化して処理し、目標顔画像の顔部分領域を標準顔寸法に調整する必要があることが理解できる。
この後、前処理が完了した目標顔画像について、上記の予めの訓練が完了したパラメータ予測モデルに基づいてパラメータ予測を行う。
S120、パラメータ予測モデルによって目標顔画像の目標顔再構築パラメータと目標顔遮蔽領域を出力し、目標顔再構築パラメータと目標顔遮蔽領域に基づいて3次元顔再構築後処理を行う。
本願の実施例のパラメータ予測モデルは、前処理後の目標顔画像を入力として受け取り、モデル予測によって、同時に、対応する目標顔再構築パラメータと目標顔遮蔽領域を出力する。
具体的には、パラメータ予測モデルにおいて、目標顔画像を画像特徴抽出器に入力することで、対応する特徴図を得て、特徴図を統合して目標顔再構築パラメータを得て、特徴図を画像分割デコーダに入力し、画像分割デコーダによって画像分割を行い、目標顔遮蔽領域を得る。
パラメータ予測モデルの全体フレームワークは、図5に示すように、本願の実施例は、改良された軽量化mobilenet-v3ネットワークを画像レベル特徴抽出器として利用し、画像画素から完全的な3次元面部構造幾何学を学習し、移動端デバイスへの配備に、より適したものにする。同時に、本願の実施例は、軽量化の画像分割デコーダLR-ASPPを利用して、画像レベル特徴抽出器に接続し、深層特徴及び詳細情報を効率的に抽出することができ、効率的な画像分割を実現する。図5に、本願の実施例のパラメータ予測モデルの詳細構造を示し、パラメータ予測モデルは、前処理後の目標顔画像を入力として、一連のbneckブロックを経て一連の黄色特徴図を得て、そして、抽出した特徴を1x1畳み込みによって最終的に統合し、パラメータ予測ベクトル、即ち目標顔再構築パラメータを出力する。
画像レベル特徴抽出器のコア部品は、bneckモジュールであり、それは主にチャネル分離可能な畳み込み、SEチャネルアテンションメカニズム及び残差接続を実現する。チャネル分離可能な畳み込みにより、モデルは、より少ないパラメータを使用し、より良い特徴抽出効果を得て、SEチャネルアテンションメカニズムは、各チャネルの重みを調整するために使用され、残差接続を結合することで、モデルは、高低レベル特徴をよりよく結合することができ、モデルが3次元顔パラメータを学習するために基礎を築くことができる。
なお、本願の実施例は、3次元面部特徴を捕捉できる画像レベル特徴抽出器と顔分割タスクを実行する画像分割デコーダLR-ASPPとを接続することで、同時に目標顔再構築パラメータ及び目標顔遮蔽分割領域を出力することができる。画像分割デコーダLR-ASPP部分は、56x56と7x7のfeature mapを入力として、高レベル特徴図(7x7)についてSEチャネルアテンションメカニズムを使用して更なる特徴再校正を行う。その後、高低解像度特徴について1x1畳み込みをそれぞれ使用して分類した後、混合し、多レベルの混合特徴を利用して学習し、移動端画像の正確な分割を実現する。最終的に目標顔遮蔽分割領域を得ることができる。
選択肢の一つとして、画像特徴抽出器が出力する目標顔再構築パラメータのパラメータ次元、及び画像分割デコーダのチャネル数は、パラメータ予測モデルのモデル計算力配置に対応する。本願の実施例が最終的に出力する目標顔再構築パラメータの次元は、ユーザーによって自由に定義されることができ、ユーザーは、必要なモデルサイズ及び効果を結合して訓練段階で自由に指定することができる。最終的に出力する次元は、identity(顔ID)+expression(顔表情)+albedo(顔テクスチャ)+光照射(27次元)+pose(姿態、3次元)+translation(変換、3次元)の和に等しい。
なお、1つのwidthパラメータによってモデル構造全体の計算量を制御することもでき、当該パラメータは、モデル全体のチャネル数を制御することができる。実際の計測によると、width=0.5の時、モデル全体を20 MFLOPSに圧縮することができ、評価セットでの顔再構築及び遮蔽領域分割は、非常に良い効果を得ることができ、これにより、各種のローエンド機種に配備することを満たすことができ、異なる計算力配置のモジュールのニーズを満たすことができることを示す。実際応用シーン及び配備環境の指定の必要を結合して得たidentity(顔ID)、expression(顔表情)、albedo(顔テクスチャ)のパラメータ次元、及びwidthパラメータによって最終モデルを制御する計算量に基づいて、実際ニーズに合ったカスタマイズモデルを生成し、モデル設計の柔軟性を向上させる。
図6に提供されるステップa1-a5を参照し、上記パラメータ予測モデルに基づいて、前処理後の目標顔画像をパラメータ予測モデルに入力することで、パラメータ予測モデルの画像特徴抽出器によって画像特徴を取得し、画像特徴は、一方で、目標顔再構築パラメータを生成するために使用され、一方で、画像分割デコーダに入力され、目標顔遮蔽領域を生成し、さらに、目標顔再構築パラメータ及び目標顔遮蔽領域を出力して3次元顔再構築後処理を行い、パラメータ予測を完了する。
実施例において、3次元顔再構築後処理を行う際に、本願の実施例は、目標顔再構築パラメータに基づいて3次元顔再構築を行い、目標3次元顔モデルを生成し、目標3次元顔モデルは、目標3次元顔形状と、目標3次元顔テクスチャとを含み、目標3次元顔モデルにおける遮蔽領域について、目標顔遮蔽領域に基づいて目標顔画像を用いてレンダリングを行い、目標3次元顔モデルにおける非遮蔽領域について目標素材を用いてレンダリングを行う。
当該目標顔再構築パラメータに基づいて、予め生成された顔モデル基底を結合して3次元顔形状及び3次元顔テクスチャを再構築し、目標3次元顔モデルを生成する。
目標3次元顔モデル構築数式は、
である。
ここで、Sは3次元顔形状であり、Tは次元顔テクスチャであり、
は平均顔形状であり、
は平均顔テクスチャであり、
は、それぞれ顔ID、顔表情及び顔テクスチャのPCA基底であり、
は、それぞれ対応的に3次元顔モデルを生成するために使用される係数ベクトルであり、これらの係数ベクトルは、パラメータ予測モデルが予測した目標顔再構築パラメータから得られる。
パラメータ予測モデルが出力する他のパラメータ、例えば、姿態パラメータ及び並進パラメータについては、再構築後の3次元顔モデルに対して姿態矯正を行うために使用されることができ、光照射パラメータは、再構築される顔テクスチャに対して球面調和を処理するために使用され、結果をより生き生きと細かくすることができる。
なお、生放送シーンでの3D化粧を例として、本願の実施例の3次元顔再構築後処理に対して説明する。生放送3D化粧の時に、ユーザー顔画像によって再構築された3次元顔モデルに基づいて、3D化粧素材を貼り合わせることができ、そして、パラメータ予測モデルが予測する目標顔遮蔽領域に基づいて、最終のレンダリングテクスチャに対して計算する。遮蔽された領域の領域について、カメラが採集する原画(及び目標顔画像)を選択してレンダリングを行うことができ、遮蔽されない領域について、通常論理に従って3D化粧素材に対してレンダリングを行うことができる。これにより、「遮蔽された領域は、カメラが採集するオリジナルピクチャーを使用してレンダリングを行い、非遮蔽領域は、再構築3D化粧を使用してレンダリングを行う」という目的を達成することができ、ユーザーは美しい化粧の視覚効果を楽しむとともに、化粧効果が遮蔽物に浮かぶことを回避し、3D化粧効果を最適化する。
実際応用シーンにおいて、例えば、生放送、会議シーンでの3D美型化粧、3D特殊効果、医療整形モデリングなど、遮蔽を伴う可能性がある入力をリアルタイムで処理する任意の3次元顔再構築応用シーンで、本願の実施例の3次元顔再構築方法を使用することができ、本願の実施例は、具体的な応用環境ステップに対して制限を固定し、ここでは詳細な説明を省略する。
上記ように、目標顔画像を予め構築されたパラメータ予測モデルに入力し、当該パラメータ予測モデルは、画像特徴抽出器と画像分割デコーダとを含み、パラメータ予測モデルは、画像特徴抽出器と画像分割デコーダの関連損失関数が設定状態に達するまで、複数の顔訓練ピクチャーと、顔訓練ピクチャーの顔キーポイント情報と、顔遮蔽分割領域とに基づいて訓練を行い、そして、パラメータ予測モデルによって目標顔画像の目標顔再構築パラメータと目標顔遮蔽領域を出力し、顔再構築パラメータと顔遮蔽分割領域に基づいて3次元顔再構築後処理を行う。上記技術手段を採用して、画像特徴抽出器と画像分割デコーダの関連損失関数が設定状態に達するまで、画像特徴抽出器と画像分割デコーダとが含まれるパラメータ予測モデルを訓練することで、パラメータ予測モデルに3次元顔再構築と顔遮蔽分割機能とを融合させ、モデル配備による計算リソースに対する占用を減少し、モデルの冗長度を減少し、モデル計算量を圧縮し、3次元顔再構築効率を向上させることができる。
なお、本願の実施例は、目標顔再構築パラメータのパラメータ次元及び画像分割デコーダのチャネル数をカスタマイズすることで、パラメータ予測モデルの計算量を適応的に配置し、パラメータ予測モデルを、異なる計算力がサポートする配備環境に適応させることができる。
上記の実施例を基礎にして、図7は、本願に提供される遮蔽分割に基づく3次元顔再構築システムの構造概略図である。図7を参照し、本実施例に提供される遮蔽分割に基づく3次元顔再構築システムは、具体的に入力モジュールと出力モジュールとを含む。
ここで、入力モジュール21は、目標顔画像を予め構築されたパラメータ予測モデルに入力するように配置され、パラメータ予測モデルは、画像特徴抽出器と画像分割デコーダとを含み、パラメータ予測モデルは、画像特徴抽出器と画像分割デコーダの関連損失関数が設定状態に達するまで、複数の顔訓練ピクチャーと、顔訓練ピクチャーの顔キーポイント情報と、顔遮蔽分割領域とに基づいて、訓練を行う。
出力モジュール22は、パラメータ予測モデルによって目標顔画像の目標顔再構築パラメータと目標顔遮蔽領域を出力し、顔再構築パラメータと顔遮蔽分割領域に基づいて、3次元顔再構築後処理を行うように配置される。
具体的には、パラメータ予測モデルの訓練プロセスは、
複数の顔訓練ピクチャーと、顔訓練ピクチャーの顔キーポイント情報と、顔遮蔽分割領域とを訓練サンプルとすることと、
訓練サンプルに基づいて、パラメータ予測モデルを訓練し、画像特徴抽出器によって対応する顔予測キーポイント情報を出力し、画像分割デコーダによって顔予測遮蔽分割領域を出力し、顔予測キーポイント情報に基づいて3次元顔再構築を行い、3次元顔予測画像を生成することと、
3次元顔予測画像と、顔予測キーポイント情報と、顔予測遮蔽分割領域とを、予測サンプルとして、訓練サンプル及び予測サンプルに基づいて、画像特徴抽出器と画像分割デコーダの関連損失関数を計算し、関連損失関数が設定状態に達した場合に、パラメータ予測モデルの訓練プロセスを完了することと、を含む。
ここで、関連損失関数は、分割損失関数、分割スケーリング損失関数及び顔再構築損失関数を含み、分割損失関数は、顔遮蔽分割領域と対応する顔予測遮蔽分割領域との間の差異を測るために使用され、分割スケーリング損失関数は、顔予測遮蔽分割領域に対してスケーリング調整を行うために使用され、顔再構築損失関数は、顔訓練ピクチャーと対応する3次元顔予測画像との間の差異を測るために使用される。
分割スケーリング損失関数は、分割領域拡大関数と、分割領域収縮関数とを含み、分割領域拡大関数は、顔予測遮蔽分割領域を拡大させるために使用され、分割領域収縮関数は、顔予測遮蔽分割領域を収縮させるために使用される。
具体的には、入力モジュール21は、目標顔画像を画像特徴抽出器に入力し、対応する特徴図を得て、特徴図を統合して目標顔再構築パラメータを得て、特徴図を画像分割デコーダに入力し、画像分割デコーダによって画像分割を行い、目標顔遮蔽領域を得るように配置される。
画像特徴抽出器が出力する目標顔再構築パラメータのパラメータ次元、及び画像分割デコーダのチャネル数は、パラメータ予測モデルのモデル計算力配置に対応する。
具体的には、目標顔画像を予め構築されたパラメータ予測モデルに入力する前に、さらに、
顔キーポイント検出器及びテンプレート顔キーポイントに基づいて目標顔画像を位置合わせし、目標顔画像の伸長及び並進パラメータを得ることと、
伸長及び並進パラメータに基づいて目標顔画像をクロップし、目標顔画像を標準顔寸法に適合させることと、
を含む。
具体的には、出力モジュール22は、目標顔再構築パラメータに基づいて3次元顔再構築を行い、目標3次元顔モデルを生成するように配置され、目標3次元顔モデルは、目標3次元顔形状と、目標3次元顔テクスチャとを含み、目標3次元顔モデルにおける遮蔽領域について、目標顔遮蔽領域に基づいて目標顔画像を用いてレンダリングを行い、目標3次元顔モデルにおける非遮蔽領域について目標素材を用いてレンダリングを行う。
上記のように、目標顔画像を予め構築されたパラメータ予測モデルに入力し、当該パラメータ予測モデルは、画像特徴抽出器と画像分割デコーダとを含み、パラメータ予測モデルは、画像特徴抽出器と画像分割デコーダの関連損失関数が設定状態に達するまで、複数の顔訓練ピクチャーと、顔訓練ピクチャーの顔キーポイント情報と、顔遮蔽分割領域とに基づいて訓練を行い、そして、パラメータ予測モデルによって目標顔画像の目標顔再構築パラメータと目標顔遮蔽領域を出力し、顔再構築パラメータと顔遮蔽分割領域に基づいて3次元顔再構築後処理を行う。上記技術手段を採用して、画像特徴抽出器と画像分割デコーダの関連損失関数が設定状態に達するまで、画像特徴抽出器と画像分割デコーダとが含まれるパラメータ予測モデルを訓練することで、パラメータ予測モデルに、3次元顔再構築と顔遮蔽分割機能とを融合させ、モデル配備による計算リソースに対する占用を減少し、モデルの冗長度を減少し、モデル計算量を圧縮し、3次元顔再構築効率を向上させることができる。
なお、本願の実施例は、目標顔再構築パラメータのパラメータ次元及び画像分割デコーダのチャネル数をカスタマイズすることで、パラメータ予測モデルの計算量を適応的に配置し、パラメータ予測モデルを、異なる計算力がサポートする配備環境に適応させることができる。
本願の実施例に提供される遮蔽分割に基づく3次元顔再構築システムは、上記の実施例に提供される遮蔽分割に基づく3次元顔再構築方法を実行できるように配置され、対応する機能及び有益効果を具備することができる。
上記の実際の例を基礎にして、本願の実施例には、さらに、遮蔽分割に基づく3次元顔再構築デバイスが提供され、図8を参照し、当該遮蔽分割に基づく3次元顔再構築デバイスは、プロセッサ31と、メモリ32と、通信モジュール33と、入力装置34と、出力装置35とを含む。メモリ32は、コンピュータ読取り可能な記憶媒体として、ソフトウェアプログラム、コンピュータ実行可能なプログラム及びモジュール(例えば、本願の任意の実施例に記載される遮蔽分割に基づく3次元顔再構築方法に対応するプログラム命令/モジュール(例えば、遮蔽分割に基づく3次元顔再構築システム中の入力モジュール及び出力モジュール))を記憶するように配置される。通信モジュール33は、データ転送を行うように配置される。プロセッサ31は、メモリに記憶されるソフトウェアプログラム、命令及びモジュールを実行することで、デバイスの各種機能応用及びデータ処理を実行し、即ち上記の遮蔽分割に基づく3次元顔再構築方法を実現する。入力装置34は、入力した数字又は文字情報、及びデバイスのユーザー設置及び機能制御に関するキー信号入力を受け取るように配置されることができる。出力装置35は、ディスプレイなどの表示デバイスを含むことができる。上記に提供される遮蔽分割に基づく3次元顔再構築デバイスは、上記の実施例に提供される遮蔽分割に基づく3次元顔再構築方法を実行するように配置され、対応する機能及び有益効果を具備することができる。
上記の実施例を基礎にして、本願の実施例には、さらに、コンピュータ読取り可能な記憶媒体が提供され、前記コンピュータ読取り可能な記憶媒体には、コンピュータ実行可能な命令が記憶され、前記コンピュータ実行可能な命令は、コンピュータプロセッサによって実行される時に、遮蔽分割に基づく3次元顔再構築方法を実行するように配置され、記憶媒体は、任意の各種のタイプのメモリデバイス又は記憶デバイスであってもよい。もちろん、本願の実施例に提供されるコンピュータ読取り可能な記憶媒体の、コンピュータ実行可能な命令は、前記の遮蔽分割に基づく3次元顔再構築方法に限定されるものではなく、本願の任意の実施例に提供される遮蔽分割に基づく3次元顔再構築方法における関連動作を実行することもできる。
上記の実施例を基礎にして、本願の実施例には、さらに、コンピュータプログラム製品が提供され、本願の技術案は、本質的に、あるいは従来技術に貢献する部分または当該技術案の全部または一部は、ソフトウェア製品の様態で具現化することができ、当該コンピュータプログラム製品は記憶媒体に記憶され、いくつかの命令を含み、コンピュータデバイス、移動端末またはその中のプロセッサは、本願の各実施例の前記遮蔽分割に基づく3次元顔再構築方法の全部または部分のステップを実行する。
21 入力モジュール
22 出力モジュール
31 プロセッサ
32 メモリ
33 通信モジュール
34 入力装置
35 出力装置

Claims (12)

  1. 目標顔画像を予め構築されたパラメータ予測モデルに入力し、前記パラメータ予測モデルが、画像特徴抽出器と画像分割デコーダとを含み、前記パラメータ予測モデルが、前記画像特徴抽出器と前記画像分割デコーダの関連損失関数が設定状態に達するまで、複数の顔訓練ピクチャーと、前記顔訓練ピクチャーの顔キーポイント情報と、顔遮蔽分割領域に基づいて訓練を行うことと、
    前記パラメータ予測モデルによって前記目標顔画像の目標顔再構築パラメータと目標顔遮蔽領域を出力し、前記目標顔再構築パラメータと目標顔遮蔽領域に基づいて3次元顔再構築後処理を行うことと、
    を含む、
    遮蔽分割に基づく3次元顔再構築方法。
  2. 前記パラメータ予測モデルの訓練プロセスは、
    複数の前記顔訓練ピクチャーと、前記顔訓練ピクチャーの顔キーポイント情報と、顔遮蔽分割領域を訓練サンプルとし、
    前記訓練サンプルに基づいて前記パラメータ予測モデルを訓練し、前記画像特徴抽出器によって対応する顔予測キーポイント情報を出力し、前記画像分割デコーダによって顔予測遮蔽分割領域を出力し、前記顔予測キーポイント情報に基づいて3次元顔再構築を行い、3次元顔予測画像を生成し、
    前記3次元顔予測画像と、前記顔予測キーポイント情報と、前記顔予測遮蔽分割領域を予測サンプルとして、前記訓練サンプルと前記予測サンプルに基づいて、前記画像特徴抽出器と前記画像分割デコーダの関連損失関数を計算し、前記関連損失関数が設定状態に達した場合に、前記パラメータ予測モデルの訓練プロセスを完了する、
    請求項1に記載の遮蔽分割に基づく3次元顔再構築方法。
  3. 前記関連損失関数は、分割損失関数、分割スケーリング損失関数及び顔再構築損失関数を含み、
    前記分割損失関数は、前記顔遮蔽分割領域と対応する前記顔予測遮蔽分割領域との間の差異を測るために使用され、
    前記分割スケーリング損失関数は、前記顔予測遮蔽分割領域に対してスケーリング調整を行うために使用され、
    前記顔再構築損失関数は、前記顔訓練ピクチャーと対応する前記3次元顔予測画像との間の差異を測るために使用される、
    請求項2に記載の遮蔽分割に基づく3次元顔再構築方法。
  4. 前記分割スケーリング損失関数は、分割領域拡大関数と分割領域収縮関数とを含み、前記分割領域拡大関数は、前記顔予測遮蔽分割領域を拡大させるために使用され、前記分割領域収縮関数は、前記顔予測遮蔽分割領域を収縮させるために使用される、
    請求項3に記載の遮蔽分割に基づく3次元顔再構築方法。
  5. 前記パラメータ予測モデルによって前記目標顔画像の目標顔再構築パラメータと目標顔遮蔽領域を出力することは、
    前記目標顔画像を前記画像特徴抽出器に入力し、対応する特徴図を得て、前記特徴図を統合して目標顔再構築パラメータを得て、前記特徴図を前記画像分割デコーダに入力し、前記画像分割デコーダによって画像分割を行い、目標顔遮蔽領域を得ることを含む、
    請求項1から4のいずれか1項に記載の遮蔽分割に基づく3次元顔再構築方法。
  6. 前記画像特徴抽出器が出力する前記目標顔再構築パラメータのパラメータ次元、及び前記画像分割デコーダのチャネル数は、前記パラメータ予測モデルのモデル計算力配置に対応する、
    請求項1から4のいずれか1項に記載の遮蔽分割に基づく3次元顔再構築方法。
  7. 目標顔画像を予め構築されたパラメータ予測モデルに入力する前に、さらに、
    顔キーポイント検出器及びテンプレート顔キーポイントに基づいて前記目標顔画像を位置合わせし、前記目標顔画像の伸長及び並進パラメータを得ることと、
    前記伸長及び並進パラメータに基づいて前記目標顔画像をクロップし、前記目標顔画像を標準顔寸法に適合させることと、
    を含む、
    請求項1から4のいずれか1項に記載の遮蔽分割に基づく3次元顔再構築方法。
  8. 前記目標顔再構築パラメータと目標顔遮蔽領域に基づいて3次元顔再構築後処理を行うことは、
    前記目標顔再構築パラメータに基づいて3次元顔再構築を行い、目標3次元顔モデルを生成し、前記目標3次元顔モデルが目標3次元顔形状と目標3次元顔テクスチャとを含むことと、
    前記目標3次元顔モデルにおける遮蔽領域について、前記目標顔遮蔽領域に基づいて、前記目標顔画像を用いてレンダリングを行い、前記目標3次元顔モデルにおける非遮蔽領域について目標素材を用いてレンダリングを行うことと、
    を含む、
    請求項1から4のいずれか1項に記載の遮蔽分割に基づく3次元顔再構築方法。
  9. 入力モジュールと、出力モジュールとを含み、
    前記入力モジュールは、目標顔画像を予め構築されたパラメータ予測モデルに入力するように配置され、前記パラメータ予測モデルは、画像特徴抽出器と画像分割デコーダとを含み、前記パラメータ予測モデルは、前記画像特徴抽出器と前記画像分割デコーダの関連損失関数が設定状態に達するまで、複数の顔訓練ピクチャーと、前記顔訓練ピクチャーの顔キーポイント情報と、顔遮蔽分割領域に基づいて訓練を行い、
    前記出力モジュールは、前記パラメータ予測モデルによって前記目標顔画像の目標顔再構築パラメータと目標顔遮蔽領域を出力し、前記目標顔再構築パラメータと目標顔遮蔽分割領域に基づいて、3次元顔再構築後処理を行うように配置される、
    遮蔽分割に基づく3次元顔再構築システム。
  10. 一つ又は複数のプログラムを記憶するように配置されるメモリと、一つ又は複数のプロセッサとを含み、
    前記一つ又は複数のプログラムが前記一つ又は複数のプロセッサによって実行されると、請求項1から4のいずれか一項に記載の遮蔽分割に基づく3次元顔再構築方法を前記一つ又は複数のプロセッサに実現させる、
    遮蔽分割に基づく3次元顔再構築デバイス。
  11. コンピュータ実行可能な命令が記憶され、
    前記コンピュータ実行可能な命令が、コンピュータプロセッサによって実行されると、請求項1から4のいずれか一項に記載の遮蔽分割に基づく3次元顔再構築方法を実行するように配置される、
    コンピュータ読取り可能な記憶媒体。
  12. ンピュータ又はプロセッサによって実行されると、前記コンピュータ又はプロセッサに、請求項1から4のいずれか一項に記載の遮蔽分割に基づく3次元顔再構築方法を実行させる、
    コンピュータプログラム。
JP2025518868A 2022-10-20 2023-09-27 遮蔽分割に基づく3次元顔再構築方法及びシステム Active JP7820003B2 (ja)

Applications Claiming Priority (3)

Application Number Priority Date Filing Date Title
CN202211286327.0A CN115619933A (zh) 2022-10-20 2022-10-20 基于遮挡分割的三维人脸重建方法及系统
CN202211286327.0 2022-10-20
PCT/CN2023/122322 WO2024082950A1 (zh) 2022-10-20 2023-09-27 基于遮挡分割的三维人脸重建方法及系统

Publications (2)

Publication Number Publication Date
JP2025534398A JP2025534398A (ja) 2025-10-15
JP7820003B2 true JP7820003B2 (ja) 2026-02-25

Family

ID=84865148

Family Applications (1)

Application Number Title Priority Date Filing Date
JP2025518868A Active JP7820003B2 (ja) 2022-10-20 2023-09-27 遮蔽分割に基づく3次元顔再構築方法及びシステム

Country Status (4)

Country Link
US (1) US20260094395A1 (ja)
JP (1) JP7820003B2 (ja)
CN (1) CN115619933A (ja)
WO (1) WO2024082950A1 (ja)

Families Citing this family (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN115619933A (zh) * 2022-10-20 2023-01-17 百果园技术(新加坡)有限公司 基于遮挡分割的三维人脸重建方法及系统
CN117392292B (zh) * 2023-10-20 2024-04-30 联通在线信息科技有限公司 一种3d数字人生成方法及系统
CN119494798B (zh) * 2024-10-10 2025-10-14 浙江大学 基于强化学习图像内容筛选的人脸图像修复方法和系统

Citations (5)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN109063695A (zh) 2018-09-18 2018-12-21 图普科技(广州)有限公司 一种人脸关键点检测方法、装置及其计算机存储介质
CN114399590A (zh) 2021-12-23 2022-04-26 北京航空航天大学 一种基于人脸解析图的人脸遮挡移除和三维模型生成方法
CN114399593A (zh) 2021-12-23 2022-04-26 北京航空航天大学 基于深度学习的人脸眼镜移除和三维模型生成方法
CN114723884A (zh) 2022-04-02 2022-07-08 厦门美图之家科技有限公司 三维人脸重建方法、装置、计算机设备及存储介质
JP2022114443A (ja) 2021-01-26 2022-08-05 富士通株式会社 情報処理装置、情報処理方法及び顔画像分類装置

Family Cites Families (17)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN110443883B (zh) * 2019-07-08 2023-04-07 杭州电子科技大学 一种基于dropblock的单张彩色图片平面三维重建方法
US11594001B2 (en) * 2020-01-20 2023-02-28 Rapiscan Systems, Inc. Methods and systems for generating three-dimensional images that enable improved visualization and interaction with objects in the three-dimensional images
US11443484B2 (en) * 2020-05-15 2022-09-13 Microsoft Technology Licensing, Llc Reinforced differentiable attribute for 3D face reconstruction
CN112419170B (zh) * 2020-10-16 2023-09-22 上海哔哩哔哩科技有限公司 遮挡检测模型的训练方法及人脸图像的美化处理方法
CN112598591B (zh) * 2020-12-18 2024-06-07 北京达佳互联信息技术有限公司 图像处理方法、装置、电子设备及存储介质
CN112633144A (zh) * 2020-12-21 2021-04-09 平安科技(深圳)有限公司 人脸遮挡检测方法、系统、设备及存储介质
CN112580567B (zh) * 2020-12-25 2024-04-16 深圳市优必选科技股份有限公司 一种模型获取方法、模型获取装置及智能设备
CN112633191B (zh) * 2020-12-28 2024-09-06 百果园技术(新加坡)有限公司 一种三维人脸重建的方法、装置、设备和存储介质
CN114972619B (zh) * 2021-02-22 2025-01-10 南京大学 一种基于自对齐双重回归的单图像人脸三维重建方法
CN113111861A (zh) * 2021-05-12 2021-07-13 北京深尚科技有限公司 人脸纹理特征提取、3d人脸重建方法及设备及存储介质
CN113762136A (zh) * 2021-09-02 2021-12-07 北京格灵深瞳信息技术股份有限公司 人脸图像遮挡判断方法、装置、电子设备和存储介质
CN114399814B (zh) * 2021-12-23 2024-06-21 北京航空航天大学 一种基于深度学习的遮挡物移除和三维重建方法
CN114862697B (zh) * 2022-04-10 2025-03-25 复旦大学 一种基于三维分解的人脸盲修复方法
CN114898034B (zh) * 2022-04-18 2026-03-17 网易(杭州)网络有限公司 三维面部生成方法和装置、三维面部重演方法和装置
CN115131194B (zh) * 2022-04-22 2024-12-03 腾讯医疗健康(深圳)有限公司 一种图像合成模型的确定方法和相关装置
CN115115784B (zh) * 2022-07-20 2025-07-11 广东工业大学 一种三维人脸重建模型训练方法、系统及可读存储介质
CN115619933A (zh) * 2022-10-20 2023-01-17 百果园技术(新加坡)有限公司 基于遮挡分割的三维人脸重建方法及系统

Patent Citations (5)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN109063695A (zh) 2018-09-18 2018-12-21 图普科技(广州)有限公司 一种人脸关键点检测方法、装置及其计算机存储介质
JP2022114443A (ja) 2021-01-26 2022-08-05 富士通株式会社 情報処理装置、情報処理方法及び顔画像分類装置
CN114399590A (zh) 2021-12-23 2022-04-26 北京航空航天大学 一种基于人脸解析图的人脸遮挡移除和三维模型生成方法
CN114399593A (zh) 2021-12-23 2022-04-26 北京航空航天大学 基于深度学习的人脸眼镜移除和三维模型生成方法
CN114723884A (zh) 2022-04-02 2022-07-08 厦门美图之家科技有限公司 三维人脸重建方法、装置、计算机设备及存储介质

Also Published As

Publication number Publication date
CN115619933A (zh) 2023-01-17
US20260094395A1 (en) 2026-04-02
JP2025534398A (ja) 2025-10-15
WO2024082950A1 (zh) 2024-04-25

Similar Documents

Publication Publication Date Title
JP2025534398A (ja) 遮蔽分割に基づく3次元顔再構築方法及びシステム
KR20210074360A (ko) 이미지 처리 방법, 디바이스 및 장치, 그리고 저장 매체
CN113705295B (zh) 对象姿态迁移方法、装置、设备及存储介质
CN113628327A (zh) 一种头部三维重建方法及设备
CN115643349B (zh) 基于角色化身模型的视频处理方法、系统及相关设备
CN119832161A (zh) 一种稀疏视角复杂户外场景三维重建方法、电子设备及存储介质
CN116740261B (zh) 图像重建方法和装置、图像重建模型的训练方法和装置
CN116168152B (zh) 人脸图像生成方法、电子设备及计算机可读存储介质
CN116363320B (zh) 重建模型的训练和三维模型重建方法、装置、设备及介质
CN111754561B (zh) 基于自监督深度学习的光场图像深度恢复方法及系统
CN118736074B (zh) 一种视频生成方法、装置、设备以及存储介质
Zhang et al. Adaptive coding unit size convolutional neural network for fast 3D-HEVC depth map intracoding
CN120318383A (zh) 基于扩散变换器的单图像四维动态人体视频生成方法
CN120091196A (zh) 视频生成方法、装置、设备以及介质
CN120201259A (zh) 视频生成方法、装置、设备及存储介质
CN119743680A (zh) 视频生成方法、装置、电子设备、存储介质及计算机程序产品
CN119273591A (zh) 三维图像生成方法、设备、存储介质及程序产品
JP2025535488A (ja) 顔モデリングモデルの訓練方法およびその装置、モデリング方法およびその装置、電子機器、並びにコンピュータプログラム
CN118555381A (zh) 智能手机的双摄连续变焦方法及系统
CN116704130A (zh) 三维人体的重建方法、训练方法以及相关装置
CN116977159A (zh) 图像处理方法、装置、电子设备及计算机可读存储介质
CN115797727A (zh) 图像增广方法、装置、电子设备和存储介质
CN116129011A (zh) 视频处理方法、装置及计算机可读存储介质
CN115526985A (zh) 一种单图像三维头部重建方法及系统
Liu et al. Joint gaze-correction and beautification of DIBR-synthesized human face via dual sparse coding

Legal Events

Date Code Title Description
A521 Request for written amendment filed

Free format text: JAPANESE INTERMEDIATE CODE: A523

Effective date: 20250331

A621 Written request for application examination

Free format text: JAPANESE INTERMEDIATE CODE: A621

Effective date: 20250331

A871 Explanation of circumstances concerning accelerated examination

Free format text: JAPANESE INTERMEDIATE CODE: A871

Effective date: 20250331

A131 Notification of reasons for refusal

Free format text: JAPANESE INTERMEDIATE CODE: A131

Effective date: 20250909

A521 Request for written amendment filed

Free format text: JAPANESE INTERMEDIATE CODE: A523

Effective date: 20251208

TRDD Decision of grant or rejection written
A01 Written decision to grant a patent or to grant a registration (utility model)

Free format text: JAPANESE INTERMEDIATE CODE: A01

Effective date: 20260106

A61 First payment of annual fees (during grant procedure)

Free format text: JAPANESE INTERMEDIATE CODE: A61

Effective date: 20260204

R150 Certificate of patent or registration of utility model

Ref document number: 7820003

Country of ref document: JP

Free format text: JAPANESE INTERMEDIATE CODE: R150