WO2025257903A1 - 心理状態推定装置、学習方法、心理状態推定方法方法及びプログラム - Google Patents
心理状態推定装置、学習方法、心理状態推定方法方法及びプログラムInfo
- Publication number
- WO2025257903A1 WO2025257903A1 PCT/JP2024/021091 JP2024021091W WO2025257903A1 WO 2025257903 A1 WO2025257903 A1 WO 2025257903A1 JP 2024021091 W JP2024021091 W JP 2024021091W WO 2025257903 A1 WO2025257903 A1 WO 2025257903A1
- Authority
- WO
- WIPO (PCT)
- Prior art keywords
- psychological state
- embedded
- embedded expression
- user
- posterior probability
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Pending
Links
Classifications
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N20/00—Machine learning
Definitions
- the estimation results can be used as part of mental health care, by reflecting the interlocutor's psychological state (mental state) when generating comments about their reactions, or to quantify the psychological states of participants in web conferences, making them easier to understand.
- the database server 50 is composed of one or more computers.
- the database server 50 stores learning data that the psychological state estimation device 30 uses when performing machine learning.
- the psychological state estimation device 30, rather than the database server 50 may have a learning data DB (Data Base) that stores learning data.
- Data Base Data Base
- Fig. 2 is a diagram showing the electrical hardware configuration of the psychological state estimation device and database server according to the embodiment.
- the program that realizes processing on the computer is stored on a recording medium 1001, such as a CD-ROM or memory card.
- a recording medium 1001 storing the program is inserted into the drive device 1000, the program is installed from the recording medium 1001 to the auxiliary storage device 1002 via the drive device 1000.
- the program does not necessarily have to be installed from the recording medium 1001; it may be downloaded from another computer via the communication network 100.
- the auxiliary storage device 1002 stores the installed program as well as necessary files, data, etc.
- the memory device 1003 When an instruction to start a program is received, the memory device 1003 reads the program from the auxiliary storage device 1002 and stores it.
- the processor 1004 performs functions related to the device in accordance with the program stored in the memory device 1003.
- the processor 1004 may include not only a CPU (Central Processing Unit) but also a GPU (Graphics Processing Unit).
- the interface device 1005 is used as an interface for connecting to a communication network, etc.
- the display device 1006 displays a programmatic GUI (Graphical User Interface), etc.
- the input device 1007 is composed of a keyboard, mouse, buttons, or a touch panel, etc., and is used to input various operational instructions.
- the output device 1008 outputs the results of calculations to an external device (external display device, printer, etc.).
- the minimum information associated with the training data is a data ID for identifying the input data, a user ID for identifying the recorded user (person), a comprehension label which is correct answer data for the non-language (or paralanguage) to be estimated, and the video data which is the input data.
- the number of pixels in the video is indicated as the video data.
- Other labels such as user attributes (e.g., individual, age, gender) may also be included.
- data may be divided into sets for learning, development, or evaluation, or data expansion may be performed.
- contrast normalization, face detection, etc. may be used to specify the use of only certain regions. There are no specific specifications for the video codec, etc.
- the comprehension level label is a vector that represents the probability of a correct answer. For example, if the correct answer is comprehension level 1, the correct class is represented as 1, and other classes are represented as 0, as in [1, 0, 0, 0, 0]. In this case, the vector indicates the user's comprehension levels 1, 2, 3, 4, and 5 from left to right.
- the comprehension levels are as follows. The larger the number, the higher the comprehension level. Level 1: No understandingLevel 2: Somewhat little understandingLevel 3: Normal stateLevel 4: Somewhat understandingLevel 5: UnderstoodNote that comprehension labels can be assigned at either frame level or segment level of any length.In this example, we will assume that comprehension labels are assigned to segments of video data divided into five-second intervals.
- Fig. 4 is a functional configuration diagram of the psychological state estimation device in the learning phase according to an embodiment.
- the psychological state estimation device 30 in the learning phase has an acquisition unit 31, a linguistic information estimation unit 32, and a learning unit 33. Each of these units has a function realized by instructions from the processor 1004 in Figure 2 based on a program.
- the linguistic information estimation unit 32 also reads and stores the machine learning model (model parameters) Ma currently undergoing machine learning from the storage unit 40 constructed by the auxiliary storage device 1002 or the memory device 1003.
- the storage unit 39 also stores the trained machine learning model (model parameters) Mb, etc., after the machine learning model Ma has been trained by the linguistic information estimation unit 32.
- ⁇ Acquisition part> 3 from the database server 50 or the DB of its own device (mental state estimation device 30), and outputs the input data (image data or voice data) to the linguistic information estimation unit 32.
- the acquisition unit 31 also outputs the correct data to the learning unit 33.
- the linguistic information estimation unit 32 performs estimation using input data.
- a neural network is used to estimate the level of understanding on one of the five levels from video data showing the upper body of a subject.
- an estimation method using a neural network is shown, but known processing techniques such as batch normalization, dropout, and L1/L2 regularization may also be used at any point.
- any point in the model structure may be pre-trained using any task or method.
- the pre-trained machine learning model (model parameters) may be arbitrarily determined as to whether it can be trained or not.
- Figure 5 is a functional configuration diagram of the language information estimation unit.
- the language information estimation unit 32 has a feature extraction unit 321, an embedded expression calculation unit 322, a similarity calculation unit 323, and a posterior probability estimation unit 324.
- the feature extraction unit 321 and the similarity calculation unit 323 may or may not use a neural network (model parameters).
- the embedded expression calculation unit 322 and the posterior probability estimation unit 324 use a neural network (model parameters).
- the feature extraction unit 321 extracts features from the video data, which is input data acquired from the acquisition unit 31. It is preferable to use known features as the features.
- the video data itself may be used as the feature, or a feature such as a histogram of oriented gradients (HOG) for each frame of the video, or an embedded representation of a convolutional neural network (CNN) or transformer pre-trained on an arbitrary task may be used.
- HOG histogram of oriented gradients
- CNN convolutional neural network
- transformer pre-trained on an arbitrary task may be used.
- log mel-filterbank For audio data, it is recommended to use log mel-filterbank or MFCC (Mel Frequency Cepstrum Coefficients).
- preprocessing such as speech enhancement, noise removal, contrast normalization, facial region extraction, and feature normalization may be performed.
- data augmentation processing such as the superposition of noise or reverberation, or video rotation or noise addition may be performed.
- i indicates the data ID
- t indicates the chronological order of the interval
- D x indicates the dimension of the embedded representation. Note that if one interval of 30 FPS video data is 5 seconds, then x i t is 150 frames.
- Fig. 6A is a detailed functional block diagram of the embedded expression calculation unit.
- the embedded expression calculation unit 322 calculates the embedded expression from the features extracted by the feature extraction unit 321.
- the embedded representation calculation unit 322 calculates embedded representations that take time-series changes into account, using a model structure that can handle time series, such as an RNN or Transformer.
- the embedded representation calculation unit 322 then performs compression (pooling) in the time direction. In this case, it is advisable to use, for example, the output of the intermediate layer (hidden layer) at the final time of the RNN, statistics such as the average or variance over the entire time, or a weighted sum using weights in the time direction obtained by an attention mechanism, etc.
- D h is the number of output dimensions of RNN 1
- T is the interval (segment) length.
- the second embedded expression calculation unit 322b improves accuracy by taking into account time-series changes between all sections, but if a certain level of accuracy is sufficient, the second embedded expression calculation unit 322b may be unnecessary. In this case, the first embedded expression will be the final embedded expression output from the embedded expression calculation unit 322.
- a penalty (loss) for learning that focuses on the relationship between L KLD and L sim may be added. For example, if the comprehension level labels (correct data) a i t-1 and a i t of consecutive sections are the same, the similarity between their posterior probabilities P(c
- the output unit 35 acquires and outputs the estimation results, which are the posterior probabilities estimated by the language information estimation unit 32. Examples of this output include sending the results to a server or the like via the interface device 1005 and a communication network shown in FIG. 2, displaying the results on the display device 1006 shown in FIG. 2, or outputting the results to a printer or the like via the output device 1008.
- the second embedded expression calculation unit 322b uses RNN 2 , which is different from RNN 1 , to calculate a second embedded expression from the first embedded expression, taking into account time-series changes between all sections.
- the language information estimation unit 32 stores the trained machine learning model Mb as the updated model parameter set ⁇ b in the storage unit 40.
- Fig. 9 is a flowchart showing the processing in the estimation phase.
- the acquisition unit 31 acquires input data (image data or audio data) to be estimated based on a user input operation, and outputs the input data to the language information estimation unit 32.
- the feature extraction unit 321 extracts features from the input data.
- the first embedded representation calculation unit 322a calculates a first embedded representation from the feature amount, taking into account time-series changes within each interval, using RNN 1 and weighted sum (attention pooling) by the attention mechanism.
- the second embedded expression calculation unit 322b uses RNN 2 , which is different from RNN 1 , to calculate a second embedded expression from the first embedded expression, taking into account time-series changes between all sections.
- the similarity calculation unit 323 calculates the similarity of the second embedded expression relating to the specified time period to the second embedded expression relating to the immediately preceding time period.
- the posterior probability estimation unit 324 estimates the posterior probability (psychological state class) for the specified time segment by combining the embedded expression for the specified time segment obtained in process S23, the similarity obtained in process S24, and the posterior probability for the immediately preceding time segment.
- the output unit 35 acquires and outputs the estimation result, which is the posterior probability estimated by process S25.
- input data which is image data showing the same user or audio data showing the user's voice
- input data is used to estimate the posterior probability for a specific time segment by combining embedded expressions, similarities, and posterior probabilities for segments of the previous time.
- a machine learning model Ma is used that explicitly takes this into account.
- the machine learning model Ma then automatically determines whether a specific time segment from time t to time t+1 in a video and an immediately preceding time segment from time t-1 to time t are labeled the same or differently, and uses this determination result as a feature.
- the automatic determination results are inconsistent during the learning phase, for example, if the labels for the specific time segment and the immediately preceding time segment are estimated to be the same, but a direct comparison of the specific time segment and the immediately preceding time segment indicates that they should actually be labeled differently, a penalty is applied during the learning phase. This achieves the effect of improving the accuracy of estimating a user's psychological state, even in cases such as non-verbal or paralinguistic expressions, which vary greatly from person to person.
- the present invention is not limited to the above-described embodiment, and may have, for example, the following configurations or processes (operations).
- the hardware processor 1004 may be single or multiple.
Landscapes
- Engineering & Computer Science (AREA)
- Theoretical Computer Science (AREA)
- Software Systems (AREA)
- Data Mining & Analysis (AREA)
- Evolutionary Computation (AREA)
- Medical Informatics (AREA)
- Computer Vision & Pattern Recognition (AREA)
- Physics & Mathematics (AREA)
- Computing Systems (AREA)
- General Engineering & Computer Science (AREA)
- General Physics & Mathematics (AREA)
- Mathematical Physics (AREA)
- Artificial Intelligence (AREA)
- Measurement Of The Respiration, Hearing Ability, Form, And Blood Characteristics Of Living Organisms (AREA)
Abstract
本開示は、学習フェーズにおいてユーザの心理状態を推定する心理状態推定装置であって、前記ユーザが映し出された画像データ又は前記ユーザの音声が示された音声データである入力データの特徴量から、当該入力データにおける時間的な各区間内における時系列変化を考慮した埋込表現を算出する埋込表現算出部と、前記入力データにおいて、所定時刻の直前の時刻の区間に係る埋込表現に対する前記所定時刻の区間に係る埋込表現の類似度を算出する類似度算出部と、前記所定時刻の区間に係る埋込表現、前記類似度、及び直前の時刻の区分に係る事後確率を結合することで、前記所定時刻の区分に係る事後確率を推定する事後確率推定部と、前記推定された事後確率である推定結果と、前記ユーザの心理状態のクラスを示す正解データとを用いて、機械学習モデルに対して学習を行なう学習部と、を有する心理状態推定装置である。
Description
本開示は、ユーザによるジェスチャー等の非言語又はイントネーション等のパラ言語から、ユーザの心理状態を推定する技術に関する。
これまで、人間のジェスチャー等の非言語又はイントネーション等のパラ言語に表れる心の状態を自動推定しようとする技術の研究開発が行われてきた。例えば、エージェントやロボットとの対話において、それらの反応に関するコメントの生成時に対話相手の心理状態(心の状態)を反映させるようなメンタルヘルスケアの一環として推定結果を活用したり、WEB会議などで参加者の心理状態を数値化して把握しやすくしたりする等の利用法が期待されている。
このような非言語及びパラ言語に表れるユーザの心理状態の推定は、一般的には入力データ(例えば、音声や動画から抽出された特徴量等)から定義された心理状態(各ラベル)の事後確率などを出力する教師あり学習として定義される(非特許文献1)。この場合、多くの従来技術では、ある程度まとまった時間分の入力データからRNN(Recurrent Neural Networks)やTransformer等の時間方向の変化を考慮できる機械学習モデルを用いて心理状態を推定する。
このような心理状態を推定する技術における課題の1つとして、学習データと評価データとで、ユーザ(話者等)が異なると精度が著しく劣化することが課題として知られている(非特許文献2)。このことは、と学習データと評価データが同一人物のものであれば、高い精度を示すと言い換えられる。
Emotion Recognition on large video dataset based on Convolutional Feature Extractor and Recurrent Neural Network (D. Rangulov and M. Fahim), 2020
Adaptive Personalized Multiple Machine Learning Architecture for Estimating Human Emotional States (A. Matsufuji, E. Sato-Shimokawara, and T. Yamaguchi), 2020
しかしながら、上述のような知見の利用は、特徴量の傾向が類似するユーザによって機械学習された機械学習モデルを適用するといった方法に留まる。
本開示は、上述の事情に鑑みてなされたもので、個人差が大きい非言語又はパラ言語であっても、ユーザの心理状態を推定する精度を向上させることを目的とする。
上記目的を達成するため、本開示は、学習フェーズにおいてユーザの心理状態を推定する心理状態推定装置であって、前記ユーザが映し出された画像データ又は前記ユーザの音声が示された音声データである入力データの特徴量から、当該入力データにおける時間的な各区間内における時系列変化を考慮した埋込表現を算出する埋込表現算出部と、前記入力データにおいて、所定時刻の直前の時刻の区間に係る埋込表現に対する前記所定時刻の区間に係る埋込表現の類似度を算出する類似度算出部と、前記所定時刻の区間に係る埋込表現、前記類似度、及び直前の時刻の区分に係る事後確率を結合することで、前記所定時刻の区分に係る事後確率を推定する事後確率推定部と、前記推定された事後確率である推定結果と、前記ユーザの心理状態のクラスを示す正解データとを用いて、機械学習モデルに対して学習を行なう学習部と、を有する心理状態推定装置である。
以上説明したように本開示によれば、個人差が大きい非言語又はパラ言語であっても、ユーザの心理状態を推定する精度を向上させることができるという効果を奏する。
以下、図面に基づいて本発明の実施形態を説明する。なお、本発明は、以下に示される実施形態に限定されるものではなく、本発明の技術的思想を逸脱しない範囲内で各種の変更が可能である。各図面は、本発明を概念的に説明するためのものであるから、理解容易のために必要に応じて寸法、比又は数を誇張又は簡略化して表す場合がある。
〔実施形態のシステム構成〕
まず、図1を用いて、実施形態に係る通信システムの全体構成について説明する。図1は、実施形態に係る通信システムの全体構成図である。
まず、図1を用いて、実施形態に係る通信システムの全体構成について説明する。図1は、実施形態に係る通信システムの全体構成図である。
図1に示されているように、本実施形態の通信システム10は、心理状態推定装置30、及びデータベースサーバ50によって構築されている。心理状態推定装置30及びデータベースサーバ50は、LAN(Local Area Network)、インターネット等の通信ネットワーク100を介して通信することができる。
通信ネットワーク100には、通信事業者が管理及び(又は)運営しているISP(Internet Service Provider)ネットワーク等の専用のネットワークが含まれていてもよい。通信ネットワーク100の接続形態は、無線又は有線のいずれでも良い。
心理状態推定装置30は、単数又は複数のコンピュータによって構成されている。心理状態推定装置30が複数のコンピュータによって構成されている場合には、「心理状態推定装置」と示しても良いし、「心理状態推定システム」と示しても良い。心理状態推定装置30は、PC(personal computer)であるが、スマートフォン又はタブレット端末等であってもよい。
心理状態推定装置30は、動画に映し出されたユーザのジェスチャー等の非言語又は、音声で出力されたユーザのイントネーション等のパラ言語から、ユーザの心理状態を推定する装置である。心理状態は、例えば、理解度、感情、表情、納得度、満足度、緊急度、集中度等である。
データベースサーバ50は、単数又は複数のコンピュータによって構成されている。データベースサーバ50には、心理状態推定装置30が機械学習する場合に用いる学習データが記憶されている。なお、データベースサーバ50ではなく、心理状態推定装置30が、学習データを記憶する学習データDB(Data Base)を有していてもよい。
〔ハードウェア構成〕
次に、図2を用いて、心理状態推定装置30の電気的なハードウェア構成を説明する。図2は、実施形態に係る心理状態推定装置及びデータベースサーバの電気的なハードウェア構成図である。
次に、図2を用いて、心理状態推定装置30の電気的なハードウェア構成を説明する。図2は、実施形態に係る心理状態推定装置及びデータベースサーバの電気的なハードウェア構成図である。
図2に示すように、心理状態推定装置30は、それぞれバス1010で相互に接続されているドライブ装置1000、補助記憶装置1002、メモリ装置1003、プロセッサ1004、インターフェース装置1005、表示装置1006、入力装置1007、出力装置1008等を有する。
当該コンピュータでの処理を実現するプログラムは、例えば、CD-ROM又はメモリカード等の記録媒体1001によって心理状態推定方法される。プログラムを記憶した記録媒体1001がドライブ装置1000にセットされると、プログラムが記録媒体1001からドライブ装置1000を介して補助記憶装置1002にインストールされる。但し、プログラムのインストールは必ずしも記録媒体1001より行う必要はなく、通信ネットワーク100を介して他のコンピュータよりダウンロードするようにしてもよい。補助記憶装置1002は、インストールされたプログラムを格納すると共に、必要なファイルやデータ等を格納する。
メモリ装置1003は、プログラムの起動指示があった場合に、補助記憶装置1002からプログラムを読み出して格納する。プロセッサ1004は、メモリ装置1003に格納されたプログラムに従って、当該装置に係る機能を実現する。プロセッサ1004には、CPU(Central Processing Unit)だけでなくGPU(Graphics Processing Unit)が含まれていてもよい。
インターフェース装置1005は、通信ネットワーク等に接続するためのインターフェースとして用いられる。表示装置1006はプログラムによるGUI(Graphical User Interface)等を表示する。入力装置1007はキーボード及びマウス、ボタン、又はタッチパネル等で構成され、様々な操作指示を入力させるために用いられる。出力装置1008は演算結果を外部(外付けの表示装置、プリンター等)に出力する。
なお、データベースサーバ50は、心理状態推定装置30と同様のハードウェア構成を有しているため、説明を省略する。
〔学習データ〕
データベースサーバ50は、図3に示すような学習データを記憶している。図3は、学習データを示す図である。ここでは、音声データ及び動画データのうち、学習データとして動画データからユーザの理解度(心理状態の一例)のクラス(ランク)を推定する用いる場合について説明するが、音声データからユーザの理解度(心理状態の一例)のクラス(ランク)を推定してもよい。
データベースサーバ50は、図3に示すような学習データを記憶している。図3は、学習データを示す図である。ここでは、音声データ及び動画データのうち、学習データとして動画データからユーザの理解度(心理状態の一例)のクラス(ランク)を推定する用いる場合について説明するが、音声データからユーザの理解度(心理状態の一例)のクラス(ランク)を推定してもよい。
学習データには、最低限の情報として、入力データを識別するためのデータID、収録されたユーザ(人物)を識別するためのユーザID、推定したい非言語(又はパラ言語)に関する正解データである理解度ラベル、及び入力データである動画データが関連付けられている。ここでは、動画データとして、動画の画素数が示されている。なお、他にもユーザの属性(例えば、個人、年齢、性別)等のラベルが含まれてもよい。また、必要に応じて、学習、開発、又は評価のセットへの分割、又はデータ拡張を実施してもよい。更に、事前処理として、コントラストの正規化、顔検出などを用いたある領域のみの利用に特定してもよい。動画のコーデックなどは特に定めない。
ここでは、動画は30分程度のWEB会議等に参加する様子を撮影したものである。動画データはWEBカメラによって、30 frames per sec(FPS)で収録されたH.264形式のデータで、1辺が224ピクセルとなるようにリサイズするとよい。動画データは、合計X個存在し、S人のユーザ(参加者)によって収録された。
理解度ラベルは、正解確率を表すベクトルである。例えば、正解が理解度1の場合、[1, 0, 0, 0, 0]のように正解クラスを1、その他のクラスを0で表現する。この場合、ベクトルは左から、ユーザの理解度1,2,3,4,5を示す。各理解度は以下の通りである。なお、数字が大きいほど、理解度が高いことを表す。
理解度1:理解していない
理解度2:やや理解していない
理解度3:平常状態
理解度4:やや理解している
理解度5:理解している
なお、理解度ラベルは、フレーム単位でも、ある程度の任意の長さの区間(セグメント)単位でも、どちらの粒度で付与しても良い。ここでは、動画データのうち5秒ごとの時間的に区分けした区間に理解度ラベルが付与されているものとする。
理解度1:理解していない
理解度2:やや理解していない
理解度3:平常状態
理解度4:やや理解している
理解度5:理解している
なお、理解度ラベルは、フレーム単位でも、ある程度の任意の長さの区間(セグメント)単位でも、どちらの粒度で付与しても良い。ここでは、動画データのうち5秒ごとの時間的に区分けした区間に理解度ラベルが付与されているものとする。
〔学習フェーズにおける心理状態推定装置の機能構成〕
続いて、図4を用いて、学習フェーズにおける心理状態推定装置30の機能構成について説明する。図4は、実施形態に係り、学習フェーズにおける心理状態推定装置の機能構成図である。
続いて、図4を用いて、学習フェーズにおける心理状態推定装置30の機能構成について説明する。図4は、実施形態に係り、学習フェーズにおける心理状態推定装置の機能構成図である。
図4に示すように、学習フェーズにおける心理状態推定装置30は、取得部31、言語情報推定部32、及び学習部33を有する。これら各部は、プログラムに基づき図2のプロセッサ1004による命令によって実現される機能である。また、言語情報推定部32は、補助記憶装置1002又はメモリ装置1003によって構築される記憶部40から機械学習中の機械学習モデル(モデルパラメータ)Maを読み出して保持している。また、記憶部39には、言語情報推定部32によって機械学習モデルMaが学習された後の学習済み機械学習モデル(モデルパラメータ)Mb等が記憶される。
<取得部>
取得部31は、データベースサーバ50又は自装置(心理状態推定装置30)のDBから、図3に示すような学習データ(入力データ及び正解データ)を取得し、言語情報推定部32に入力データ(画像データ又は音声データ)を出力する。また、取得部31は、学習部33に正解データを出力する。
取得部31は、データベースサーバ50又は自装置(心理状態推定装置30)のDBから、図3に示すような学習データ(入力データ及び正解データ)を取得し、言語情報推定部32に入力データ(画像データ又は音声データ)を出力する。また、取得部31は、学習部33に正解データを出力する。
<言語情報推定部>
言語情報推定部32は、入力データを用いて推定を行う。本実施形態では、以下に示すように、ニューラルネットワークを用いて、対象者の上半身が映っている動画データから、上述の5段階の理解度を推定する場合について説明する。
言語情報推定部32は、入力データを用いて推定を行う。本実施形態では、以下に示すように、ニューラルネットワークを用いて、対象者の上半身が映っている動画データから、上述の5段階の理解度を推定する場合について説明する。
なお、本実施形態では、ニューラルネットワークを用いた推定手法を示すが、例えば、バッチ正規化(Batch Normalization)、ドロップアウト、L1/L2正則化等の公知技術の処理を任意の箇所で用いてもよい。また、モデル構造の任意の箇所を、任意のタスク又は手法で事前学習してもよい。また、この場合の事前学習済み機械学習モデル(モデルパラメータ)は、学習可とするか不可とするかに関しても任意に定めてよい。
続いて、図5及び図6A乃至図6Cを用いて、言語情報推定部32を詳細に説明する。図5は、言語情報推定部の機能構成図である。図5に示すように、言語情報推定部32は、特徴量抽出部321、埋込表現算出部322、類似度算出部323、及び事後確率推定部324を有している。なお、特徴量抽出部321及び類似度算出部323は、ニューラルネットワーク(モデルパラメータ)を用いてもよいし、用いなくてもよい。埋込表現算出部322及び事後確率推定部324は、ニューラルネットワーク(モデルパラメータ)を用いる。
(特徴量抽出部)
特徴量抽出部321は、取得部31から取得した入力データである動画データから特徴量を抽出する。特徴量は、公知のものを用いるとよい。例えば、動画データそのものを特徴量としてもよいし、動画のフレーム毎に、HOG(histogram of oriented gradients)等の特徴量、又は任意のタスクで事前学習されたCNN(Convolutional Neural Network)若しくはTransformerの埋込表現を用いてもよい。
特徴量抽出部321は、取得部31から取得した入力データである動画データから特徴量を抽出する。特徴量は、公知のものを用いるとよい。例えば、動画データそのものを特徴量としてもよいし、動画のフレーム毎に、HOG(histogram of oriented gradients)等の特徴量、又は任意のタスクで事前学習されたCNN(Convolutional Neural Network)若しくはTransformerの埋込表現を用いてもよい。
なお、音声データの場合は、log mel-filterbank又はMFCC(メル周波数ケプストラム係数)を用いるとよい。
更に、必要に応じて、音声強調、雑音除去、コントラスト正規化、顔周辺領域の切り出し、特徴量の正規化等の前処理を実施してもよい。特徴量の計算前には、データ拡張として、雑音若しくは残響の重畳、又は動画の回転若しくはノイズ付与等の処理を実施してもよい。
動画データからの理解度推定を実施する場合、動画データからは事前学習済みのCNNを用いて埋込表現を取得し、これを5秒ごとの区間に分割した場合の特徴量を以下に示す。
この場合、iはデータID、tは区間の時系列の順番、Dxは埋込表現の次元を示す。なお、30FPSの動画データを5秒で1区間とすると、xi tは150フレームとなる。
(埋込表現算出部)
次に、図6Aを用いて、埋込表現算出部322を詳細に説明する。図6Aは、埋込表現算出部の詳細な機能構成図である。
次に、図6Aを用いて、埋込表現算出部322を詳細に説明する。図6Aは、埋込表現算出部の詳細な機能構成図である。
埋込表現算出部322は、特徴量抽出部321によって抽出された特徴量から埋込表現を算出する。
埋込表現算出部322は、例えば、RNN又はTransformer等の時系列を扱うことのできるモデル構造を用いて、時系列変化を考慮した埋込表現を算出する。また、埋込表現算出部322は、次に時間方向に対する圧縮(pooling)を行う。この場合、例えば、RNNの最終時刻の中間層(隠れ層)の出力、又は全時間に対する平均若しくは分散等の統計量、Attention機構等によって得られる時間方向に対する重みを用いた重み付け和などを用いるとよい。
具体的には、埋込表現算出部322は、第1の埋込表現算出部322a及び第2の埋込表現算出部322bを有する。
第1の埋込表現算出部322aは、shared parameter(同じモデルパラメータ)を用いることで、RNN1及びAttention機構による重みづけ和(Attention Pooling)を用いて、特徴量xi
{1,2,…T}から、区間内における時系列変化を考慮した以下に示す第1の埋込表現を算出する。なお、RNN1は、(回帰型)ニューラルネットワーク又は第1の(回帰型)ニューラルネットワークの一例である。
ここで、Dhは、RNN1の出力次元数、Tは区間(セグメント)長を示す。
更に、第2の埋込表現算出部322bは、RNN1とは異なるRNN2を用いて、第1の埋込表現hi
{1,2,…T}から、全ての区間同士の時系列変化を考慮した以下に示す第2の埋込表現を算出する。第2の埋込表現が、埋込表現算出部322から出力される最終的な埋込表現となる。なお、RNN2は、第2の(回帰型)ニューラルネットワークの一例である。
ここで、Deは、RNN2の出力次元数を示す。
但し、学習時は、必ずしも動画データの始端時刻から終端時刻までの全ての区間を利用する必要はなく、任意の始端から終端までの所定の区間長を利用してもよい。また、RNN1の前段に時間方向を考慮しない全結合層の挿入や、1次元CNN(Convolutional Neural Network)等を用いた時間方向のダウンサンプリングを実施してもよい。
なお、第2の埋込表現算出部322bは、全ての区間同士の時系列変化を考慮するため、精度が向上するが、ある程度の精度でよければ、第2の埋込表現算出部322bは無くてもよい。この場合、第1の埋込表現が、埋込表現算出部322から出力される最終的な埋込表現となる。
(類似度算出部)
次に、図6Bを用いて、類似度算出部323を詳細に説明する。図6Bは、類似度算出部の詳細な機能構成図である。
次に、図6Bを用いて、類似度算出部323を詳細に説明する。図6Bは、類似度算出部の詳細な機能構成図である。
類似度算出部323は、所定の時刻の区間において埋込表現算出部322から取得した所定の埋込表現に対して、1つ前である直前の時刻の区間において埋込表現算出部322から取得した直前の埋込表現との同一性を比較して類似度を算出する。これら2つの埋込表現間(同士)の類似度は、公知のベクトル間の類似度として用いられているもの(例えば、ユークリッド距離、コサイン類似度、交差エントロピー、カルバック・ライブラー情報量)、サポートベクトルマシン、又は全結合層等を用いた機械学習可能な識別器を用いるとよい。
具体的には、類似度算出部323は、Discriminator(判別器)を用いて、所定の区間tの埋込表現ei
tと、この直前の区間t-1の埋込表現ei
t-1とが同一ラベル(クラス)に属するか否かを判定する。ここで、Discriminatorはコサイン類似度を用いるものと定義する。よって、類似度sim(ei
t-1,ei
t)は、以下の(式1)に示す通り定義できる。
なお、図6Bでは、t=1のDiscriminator部分は省略しているが、ここは、任意の方法でt=0に該当する区間の埋込表現を作成するとよい。例えば、乱数又は0(ゼロ)埋めされたベクトルを生成しても良いし、sim(ei t,ei t)のように同じ時刻の情報をコピーしたり、sim(ei t,ei t+1)のように次の時刻の情報を参考にしたりしてもよい。また、t=1だけでなく、全区間で前後の区間との類似度を算出してもよい。
(事後確率推定部)
次に、図6Cを用いて、事後確率推定部324を詳細に説明する。図6Cは、事後確率推定部の詳細な機能構成図である。
次に、図6Cを用いて、事後確率推定部324を詳細に説明する。図6Cは、事後確率推定部の詳細な機能構成図である。
事後確率推定部324は、区間毎に、埋込表現及び類似度を用いて、入力データが各クラス(ここでは、1~5)に属する確率である事後確率を推定して、当該事後確率としての推定結果を出力する。推定の処理には、RNNにおける全結合層等、ベクトルを入力として扱える任意の公知技術を用いるとよい。予測結果(事後確率)は、例えば、[0.6,0.2,0.1,0.05,0.05]である。なお、事後確率推定部324が用いるRNNは、第3のニューラルネットワークの一例である。但し、第2の埋込表現算出部322bを用いない場合、事後確率推定部324が用いるRNNは、第2のニューラルネットワークの一例である。
なお、音声データの場合には、任意の情報、例えば、RNN-Transducerを用いた音声認識(参考文献1)に開示されているように、直前の区間の推定結果を特徴量として加えても良い。この場合、直前の区間の推定結果に対して、何かしらの線形若しくは非線形変換を施してもよいし、又は時系列的な変化を考慮してもよいし考慮しなくてもよい。
<参考文献1>Streaming End-to-end Speech Recognition For Mobile Devices (Y. He +, 2019)
具体的には、事後確率推定部324は、所定の区間tにおける埋込表現ei t、当該埋込表現ei tと直前の区間t-1の埋込表現ei t-1との類似度sim(ei t-1,ei t)、及び直前の区間の以下に示す事後確率を結合する。
<参考文献1>Streaming End-to-end Speech Recognition For Mobile Devices (Y. He +, 2019)
具体的には、事後確率推定部324は、所定の区間tにおける埋込表現ei t、当該埋込表現ei tと直前の区間t-1の埋込表現ei t-1との類似度sim(ei t-1,ei t)、及び直前の区間の以下に示す事後確率を結合する。
ここでは、事後確率推定部324は、shared parameter(同じモデルパラメータ)を用いることで、全結合層(FC: fully-connected layer)を1層、及びSoftmax関数を用いた推定器を有する。よって、事後確率P(c|xi t)は以下の(式2)に示すように定義できる。
ここで、cは推定されるクラスIDを示す。また、下記2つは、上から順に、機械学習可能な重みと、バイアスパラメータを示す。
以上により、言語情報推定部の詳細な説明を終了する。
〈学習部〉
続いて、図3に戻り、学習部33について説明する。
続いて、図3に戻り、学習部33について説明する。
本実施形態では、学習部33は、事後確率が理解度ラベル(正解データ)に近くなるように、即ち、事後確率と理解度ラベルの誤差を表す損失が小さくなるように、機械学習モデルMaを最適化する。この場合、学習部33は、モデルパラメータ集合Ωaを更新し、学習済みモデルパラメータ集合Ωbを獲得する。損失関数及び更新法は、任意の公知技術を使う。
なお、モデルパラメータについては、上述したように、任意の他タスクで事前学習したものを混ぜてもよいし、任意の乱数で初期値を生成してもよい。また、モデルパラメータのうちの一部のパラメータを更新しなくてもよい。
具体的には、学習部33は、確率的勾配降下法を用いて、モデルパラメータ集合Ωaを更新する。この際、学習率等のハイパーパラメータには任意の値を用いる。例えば、事後確率P(c|xi
t)に対する損失関数は、カルバック・ライブラー情報量(Kullback-Leibler Divergence)を用いた損失関数LKLDであり、これは以下の(式3)のように定義される。
ここで、入力データの特徴量xi tの正解分布は、以下に示す通りである。
また、正解分布は、正解クラスの確率が1.0で、他クラスは全て0.0となっているone-hot vectorとして表現する。例えば、事後確率が上述のように[0.6,0.2,0.1,0.05,0.05]の場合、LKLD=-log(1.0/0.6)=-0.51となる。なお、正解分布として、任意の分布(例えば、正解クラスを中心とする正規分布を近似した正解分布)を用いてもよい。また、カルバック・ライブラー情報量に限らず、その他の確率密度関数に対応した損失関数を用いても良い。
この他にも、任意のタスクを補助的に同時にマルチタスク学習をしてもよい。例えば、理解度のようにラベル間に連続関係を定義可能なクラスであれば、それを考慮した回帰タスクなどをマルチタスク学習として加えても良い。
また、類似度sim(ei
t-1,ei
t)にも損失関数を用いた制約を加えてもよい。例えば、交差エントロピーを参考に、以下の(式4)に示すような損失関数Lsimを定義する。
ここで、ai tは特徴量xi tの理解度ラベル(正解データ)であり、学習部33は、ai t-1とai tが同一であれば、類似度sim(ei t-1,ei t)を最大化し、そうでなければ最小化するように学習する。また、この他にも絶対誤差や二乗誤差損失等を用いてもよい。
更に、LKLDとLsimの関係性に着目した学習に対するペナルティ(損失)を加えても良い。例えば、連続する区間の理解度ラベル(正解データ)ai
t-1とai
tが同じ場合には、これらの事後確率P(c│xi
t-1)とP(c│xi
t)の類似度は高いべきである。逆に、ai
t-1とai
tが異なる場合には、これらの事後確率P(c│xi
t-1)とP(c│xi
t)の類似度は低いべきである。これらのことに基づき、例えば、以下の(式5)に示すような損失関数Lpが定義できる。
ここで、sim(・)は、上述のように、コサイン類似度を用いるものとする。また、事後確率に限らず機械学習モデルMaの任意の箇所から取得される埋込表現に置き換えても良い。
モデル学習全体としては、複数の損失関数が存在するため、全体としての損失関数Lは、重み係数λ{1,2,3}を用いて、L=λ1LKLD+λ2Lsim+λ3Lpのように、重みづけ和として定義する。
〔推定(推論)フェーズにおける心理状態推定装置の機能構成〕
続いて、図7を用いて、推定フェーズにおける心理状態推定装置30の機能構成について説明する。図7は、実施形態に係り、推定フェーズにおける心理状態推定装置の機能構成図である。
続いて、図7を用いて、推定フェーズにおける心理状態推定装置30の機能構成について説明する。図7は、実施形態に係り、推定フェーズにおける心理状態推定装置の機能構成図である。
図7に示すように、推定フェーズにおける心理状態推定装置30は、取得部31、言語情報推定部32、及び出力部35を有する。これら各部は、プログラムに基づき図2のプロセッサ1004による命令によって実現される機能である。なお、学習フェーズにおける機能構成と同様の機能構成については、同一の符号を付して説明を省略する。また、ここでは、取得部31は、推定対象となる入力データ(画像データ又は音声データ)を取得する。
出力部35は、言語情報推定部32によって推定された事後確率である推定結果を取得して出力する。この出力する例としては、図2に示すインターフェース装置1005及び通信ネットワークを介してサーバ等に送信する場合、図2に示す表示装置1006に表示させる場合、出力装置1008を介してプリンタ等に出力する場合等が挙げられる。
〔学習フェーズにおける処理〕
続いて、図8を用いて、心理状態推定装置30の学習フェーズにおける処理について説明する。図8は、学習フェーズの処理を示すフローチャートである。
続いて、図8を用いて、心理状態推定装置30の学習フェーズにおける処理について説明する。図8は、学習フェーズの処理を示すフローチャートである。
S10:取得部31は、データベースサーバ50又は自装置(心理状態推定装置30)のDBから、図3に示すような学習データ(入力データ及び正解データ)を取得し、言語情報推定部32に入力データを出力する。
S11:特徴量抽出部321は、入力データから特徴量を抽出する。
S12:第1の埋込表現算出部322aは、RNN1及びAttention機構による重みづけ和(Attention Pooling)を用いて、特徴量から、各区間内における時系列変化を考慮した第1の埋込表現を算出する。
S13:第2の埋込表現算出部322bは、RNN1とは異なるRNN2を用いて、第1の埋込表現から、全ての区間同士の時系列変化を考慮した第2の埋込表現を算出する。
S14:類似度算出部323は、所定時刻の直前の時刻の区間に係る第2の埋込表現に対する所定時刻の区間に係る第2の埋込表現の類似度を算出する。
S15:事後確率推定部324は、処理S13による所定時刻の区間に係る埋込表現、処理S14による類似度、及び直前の時刻の区分に係る事後確率を結合することで、所定時刻の区分に係る事後確率を推定する。
S16:学習部33は、事後確率が、取得部31から取得した正解データ(心理状態のクラス)に近くなるように、モデルパラメータ集合Ωaを更新する。
S17:言語情報推定部32は、記憶部40に、更新後のモデルパラメータ集合Ωbとしての学習済み機械学習モデルMbを記憶する。
〔推定(論)フェーズにおける処理〕
続いて、図9を用いて、心理状態推定装置30の推定フェーズにおける処理について説明する。図9は、推定フェーズの処理を示すフローチャートである。
続いて、図9を用いて、心理状態推定装置30の推定フェーズにおける処理について説明する。図9は、推定フェーズの処理を示すフローチャートである。
S20:取得部31は、ユーザの入力操作により、推定対象の入力データ(画像データ又は音声データ)を取得し、言語情報推定部32に入力データを出力する。
S21:特徴量抽出部321は、入力データから特徴量を抽出する。
S22:第1の埋込表現算出部322aは、RNN1及びAttention機構による重みづけ和(Attention Pooling)を用いて、特徴量から、各区間内における時系列変化を考慮した第1の埋込表現を算出する。
S23:第2の埋込表現算出部322bは、RNN1とは異なるRNN2を用いて、第1の埋込表現から、全ての区間同士の時系列変化を考慮した第2の埋込表現を算出する。
S24:類似度算出部323は、直前の時刻の区間に係る第2の埋込表現に対する所定時刻の区間に係る第2の埋込表現の類似度を算出する。
S25:事後確率推定部324は、処理S23による所定時刻の区間に係る埋込表現、処理S24による類似度、及び直前の時刻の区分に係る事後確率を結合することで、所定時刻の区分に係る事後確率(心理状態のクラス)を推定する。
S26:出力部35は、処理S25によって推定された事後確率である推定結果を取得して出力する。
〔実施形態の主な効果〕
以上のように、本実施形態では、同一人物のユーザが映し出された画像データ又は当該ユーザの音声が示された音声データである入力データから、所定時刻の区間に係る埋込表現、類似度、及び直前の時刻の区分に係る事後確率を結合することで、所定時刻の区分に係る事後確率を推定することで、同一人物間であれば高い推定精度を示すことを活かして、それを明示的に考慮した機械学習モデルMaを用いた。そして、機械学習モデルMaは、動画の所定時刻t~t+1の所定区間と、直前の時刻t-1~tの直前区間に関し、同一ラベルか異なるラベルかを自動判定することで、この判定結果を特徴量として用いる。そして、学習フェーズにおいて、例えば、所定区間と直前区間のラベルをどちらも同じものと推定したが、所定区間と直前区間を直接比較すると、本来それらは異なるラベルが付くべきであると判定した場合等のように、自動判定結果が矛盾する場合には、学習フェーズにおいて、ペナルティを与えることとした。これにより、個人差が大きい非言語又はパラ言語のような場合であっても、ユーザの心理状態を推定する精度を向上させることができるという効果を奏する。
以上のように、本実施形態では、同一人物のユーザが映し出された画像データ又は当該ユーザの音声が示された音声データである入力データから、所定時刻の区間に係る埋込表現、類似度、及び直前の時刻の区分に係る事後確率を結合することで、所定時刻の区分に係る事後確率を推定することで、同一人物間であれば高い推定精度を示すことを活かして、それを明示的に考慮した機械学習モデルMaを用いた。そして、機械学習モデルMaは、動画の所定時刻t~t+1の所定区間と、直前の時刻t-1~tの直前区間に関し、同一ラベルか異なるラベルかを自動判定することで、この判定結果を特徴量として用いる。そして、学習フェーズにおいて、例えば、所定区間と直前区間のラベルをどちらも同じものと推定したが、所定区間と直前区間を直接比較すると、本来それらは異なるラベルが付くべきであると判定した場合等のように、自動判定結果が矛盾する場合には、学習フェーズにおいて、ペナルティを与えることとした。これにより、個人差が大きい非言語又はパラ言語のような場合であっても、ユーザの心理状態を推定する精度を向上させることができるという効果を奏する。
〔補足〕
本発明は上述の実施形態に限定されるものではなく、例えば、以下に示すような構成又は処理(動作)であってもよい。
本発明は上述の実施形態に限定されるものではなく、例えば、以下に示すような構成又は処理(動作)であってもよい。
(1)心理状態推定装置30はコンピュータとプログラムによっても実現できるが、このプログラムを(非一時的)記録媒体に記録して提供することも可能であり、またインターネット等の通信ネットワークを介して当該プログラムを提供することも可能である。
(2)ハードウェアであるプロセッサ1004は、単一であっても複数であってもよい。
10 通信システム
30 心理状態推定装置
31 取得部
32 言語情報推定部
33 学習部
35 出力部
40 記憶部
322 埋込表現算出部
322a 第1の埋込表現算出部
322b 第2の埋込表現算出部
323 類似度算出部
324 事後確率推定部
30 心理状態推定装置
31 取得部
32 言語情報推定部
33 学習部
35 出力部
40 記憶部
322 埋込表現算出部
322a 第1の埋込表現算出部
322b 第2の埋込表現算出部
323 類似度算出部
324 事後確率推定部
Claims (8)
- 学習フェーズにおいてユーザの心理状態を推定する心理状態推定装置であって、
前記ユーザが映し出された画像データ又は前記ユーザの音声が示された音声データである入力データの特徴量から、当該入力データにおける時間的な各区間内における時系列変化を考慮した埋込表現を算出する埋込表現算出部と、
前記入力データにおいて、所定時刻の直前の時刻の区間に係る埋込表現に対する前記所定時刻の区間に係る埋込表現の類似度を算出する類似度算出部と、
前記所定時刻の区間に係る埋込表現、前記類似度、及び直前の時刻の区分に係る事後確率を結合することで、前記所定時刻の区分に係る事後確率を推定する事後確率推定部と、
前記推定された事後確率である推定結果と、前記ユーザの心理状態のクラスを示す正解データとを用いて、機械学習モデルに対して学習を行なう学習部と、
を有する心理状態推定装置。 - 前記埋込表現算出部は、
前記特徴量から、各区間内における時系列変化を考慮した第1の埋込表現を算出する第1の埋込表現算出部と、
前記第1の埋込表現から、前記入力データにおける全ての区間同士の時系列変化を考慮した第2の埋込表現としての前記埋込表現を算出する第2の埋込表現算出部と、
を有する請求項1に記載の心理状態推定装置。 - 学習フェーズにおいてユーザの心理状態を推定する心理状態推定装置が実行する学習方法であって、
前記ユーザが映し出された画像データ又は前記ユーザの音声が示された音声データである入力データの特徴量から、当該入力データにおける時間的な各区間内における時系列変化を考慮した埋込表現を算出する埋込表現算出処理と、
前記入力データにおいて、所定時刻の直前の時刻の区間に係る埋込表現に対する前記所定時刻の区間に係る埋込表現の類似度を算出する類似度算出処理と、
前記所定時刻の区間に係る埋込表現、前記類似度、及び直前の時刻の区分に係る事後確率を結合することで、前記所定時刻の区分に係る事後確率を推定する事後確率推定処理と、
前記推定した事後確率である推定結果と、前記ユーザの心理状態のクラスを示す正解データとを用いて、機械学習モデルに対して学習を行なう学習処理と、
を有する心理状態推定方法。 - コンピュータに、請求項3に記載の方法を実行させるプログラム。
- 推定フェーズにおいてユーザの心理状態を推定する心理状態推定装置であって、
前記ユーザが映し出された画像データ又は前記ユーザの音声が示された音声データである入力データの特徴量から、当該入力データにおける時間的な各区間内における時系列変化を考慮した埋込表現を算出する埋込表現算出部と、
前記入力データにおいて、所定時刻の直前の時刻の区間に係る埋込表現に対する前記所定時刻の区間に係る埋込表現の類似度を算出する類似度算出部と、
前記所定時刻の区間に係る埋込表現、前記類似度、及び直前の時刻の区分に係る事後確率を結合することで、前記所定時刻の区分に係る事後確率を推定する事後確率推定部と、
前記推定された事後確率である推定結果を出力する出力部と、
を有する心理状態推定装置。 - 前記埋込表現算出部は、
前記特徴量から、各区間内における時系列変化を考慮した第1の埋込表現を算出する第1の埋込表現算出部と、
前記第1の埋込表現から、前記入力データにおける全ての区間同士の時系列変化を考慮した第2の埋込表現としての前記埋込表現を算出する第2の埋込表現算出部と、
を有する請求項5に記載の心理状態推定装置。 - 推定フェーズにおいてユーザの心理状態を推定する心理状態推定装置が実行する心理状態推定方法であって、
前記ユーザが映し出された画像データ又は前記ユーザの音声が示された音声データである入力データの特徴量から、当該入力データにおける時間的な各区間内における時系列変化を考慮した埋込表現を算出する埋込表現算出処理と、
前記入力データにおいて、所定時刻の直前の時刻の区間に係る埋込表現に対する前記所定時刻の区間に係る埋込表現の類似度を算出する類似度算出処理と、
前記所定時刻の区間に係る埋込表現、前記類似度、及び直前の時刻の区分に係る事後確率を結合することで、前記所定時刻の区分に係る事後確率を推定する事後確率推定処理と、
前記推定した事後確率である推定結果を出力する出力処理と、
を実行する心理状態推定方法。 - コンピュータに、請求項7に記載の方法を実行させるプログラム。
Priority Applications (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| PCT/JP2024/021091 WO2025257903A1 (ja) | 2024-06-10 | 2024-06-10 | 心理状態推定装置、学習方法、心理状態推定方法方法及びプログラム |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| PCT/JP2024/021091 WO2025257903A1 (ja) | 2024-06-10 | 2024-06-10 | 心理状態推定装置、学習方法、心理状態推定方法方法及びプログラム |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| WO2025257903A1 true WO2025257903A1 (ja) | 2025-12-18 |
Family
ID=98050687
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| PCT/JP2024/021091 Pending WO2025257903A1 (ja) | 2024-06-10 | 2024-06-10 | 心理状態推定装置、学習方法、心理状態推定方法方法及びプログラム |
Country Status (1)
| Country | Link |
|---|---|
| WO (1) | WO2025257903A1 (ja) |
Citations (3)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP2020531898A (ja) * | 2017-08-22 | 2020-11-05 | ▲騰▼▲訊▼科技(深▲セン▼)有限公司 | 音声感情検出方法、装置、コンピュータ機器、及び記憶媒体 |
| WO2023032016A1 (ja) * | 2021-08-30 | 2023-03-09 | 日本電信電話株式会社 | 推定方法、推定装置および推定プログラム |
| WO2023032014A1 (ja) * | 2021-08-30 | 2023-03-09 | 日本電信電話株式会社 | 推定方法、推定装置および推定プログラム |
-
2024
- 2024-06-10 WO PCT/JP2024/021091 patent/WO2025257903A1/ja active Pending
Patent Citations (3)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| JP2020531898A (ja) * | 2017-08-22 | 2020-11-05 | ▲騰▼▲訊▼科技(深▲セン▼)有限公司 | 音声感情検出方法、装置、コンピュータ機器、及び記憶媒体 |
| WO2023032016A1 (ja) * | 2021-08-30 | 2023-03-09 | 日本電信電話株式会社 | 推定方法、推定装置および推定プログラム |
| WO2023032014A1 (ja) * | 2021-08-30 | 2023-03-09 | 日本電信電話株式会社 | 推定方法、推定装置および推定プログラム |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| Anumula et al. | Feature representations for neuromorphic audio spike streams | |
| US20190341025A1 (en) | Integrated understanding of user characteristics by multimodal processing | |
| CN111930914B (zh) | 问题生成方法和装置、电子设备以及计算机可读存储介质 | |
| US20250078569A1 (en) | Object emotion analysis method and apparatus and electronic device | |
| CN106448670A (zh) | 基于深度学习和强化学习的自动回复对话系统 | |
| CN114127849A (zh) | 语音情感识别方法和装置 | |
| CN113935336B (zh) | 用于语音对话的话术策略确定方法、装置及电子设备 | |
| CN114372701B (zh) | 客服质量的评价方法、装置、存储介质及设备 | |
| CN115294962A (zh) | 语音合成模型的训练方法、装置、设备及存储介质 | |
| US20240346735A1 (en) | System and method for generating videos depicting virtual characters | |
| CN119539821B (zh) | 基于人工智能的消费者保护方法、装置及存储介质 | |
| Alroobaea | Cross-corpus speech emotion recognition with transformers: Leveraging handcrafted features and data augmentation | |
| CN121000952A (zh) | 视频生成方法、装置、电子设备、存储介质和程序产品 | |
| CN119292466A (zh) | 基于多模态的数字人交互方法及系统 | |
| US12347416B2 (en) | Systems and methods to automate trust delivery | |
| Tao et al. | A semi-supervised high-quality pseudo labels algorithm based on multi-constraint optimization for speech deception detection | |
| CN121350948A (zh) | 基于异构情感语义图与长序列情绪建模的数字人构建方法及装置 | |
| CN120449822A (zh) | 一种文本编码方法、装置、计算机设备及存储介质 | |
| CN120899250A (zh) | 基于多模态感知的老年人情绪识别方法及装置 | |
| US12217758B2 (en) | Automated systems and methods that generate affect-annotated timelines | |
| CN120561726A (zh) | 一种态叠加的多模态情感计算系统及方法 | |
| US20240320519A1 (en) | Systems and methods for providing a digital human in a virtual environment | |
| US12412562B2 (en) | Systems and methods to improve trust in conversations | |
| JP7700863B2 (ja) | 推定方法、推定装置および推定プログラム | |
| CN114067956A (zh) | 健康数据处理方法及装置 |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| 121 | Ep: the epo has been informed by wipo that ep was designated in this application |
Ref document number: 24943384 Country of ref document: EP Kind code of ref document: A1 |