JP6855737B2

JP6855737B2 - 情報処理装置、評価システムおよびプログラム

Info

Publication number: JP6855737B2
Application number: JP2016197553A
Authority: JP
Inventors: 耕輔丸山; 伊藤　篤; 篤伊藤; 鈴木　譲; 譲鈴木; 河野　功幸; 功幸河野
Original assignee: Fuji Xerox Co Ltd; Fujifilm Business Innovation Corp
Current assignee: Fujifilm Business Innovation Corp
Priority date: 2016-10-05
Filing date: 2016-10-05
Publication date: 2021-04-07
Anticipated expiration: 2036-10-05
Also published as: JP2018060374A

Description

本発明は、情報処理装置、評価システムおよびプログラムに関する。

従来、面接の進行や面接志望者の評価を支援するシステムが考えられている。特許文献１には、求人主体側の管理システムと、応募者側の動画機能及びＴＶ電話機能付携帯電話又はコンピュータ端末と、これらを接続する通信網とを含む人材募集・応募支援システムが開示されている。同文献に記載された従来技術において、管理システムは、求人情報及び応募案内情報提供、応募情報受信を行うＷＥＢサーバと、メール送受信を行うメールサーバと、オンライン面接、採用可否評価を行う担当者端末と、情報蓄積処理手段とを有する。コンピュータ端末、携帯電話は、求人情報の検索、氏名等の文字情報を含む応募情報による応募、動画機能に基づくＴＶ電話による採用担当者とのオンライン面接、求人主体側の管理システムからの採用可否情報のメールでの受信を行う。

また、特許文献２には、通信ネットワークを介して接続された受講者端末に対して面接試験用教材コンテンツを配信するイーラーニングシステムが開示されている。同文献に記載されたシステムは、業界別及び又は職種別に面接試験用教材コンテンツを格納する教材ファイルと、受講者端末から入力された業界及び又は職種に対応した面接試験用質問を質問に対する複数の回答例及び回答時のアドバイスと共に教材ファイルに格納された面接試験用教材コンテンツの中から検索し受講者端末に送信する質問処理手段とを備える。

特開２００７−２６５３６９号公報特開２００８−１６５１２３号公報

面接においては、面接官（面接する者）の質問に対する面接志望者（面接を受ける者）の受け答えのような言語情報だけでなく、面接志望者の姿勢や所作などの非言語情報も参酌される。しかし従来、面接の支援システムにおいて非言語情報の評価は行われていなかった。

本発明は、面接において面接志望者に対する非言語情報に基づく評価を支援するシステムを提供することを目的とする。

本発明の請求項１に係る情報処理装置は、
動画データに映っている人体の部位を特定し、特定された部位の動作を検出する動作検出部と、
前記動作検出部により検出された人体の部位の動作に基づき、予め定められた評価項目における評価対象として定義された行動を抽出する行動抽出部と、
前記行動抽出部により抽出された行動を発話中の行動か否かに応じて分類する分類部と、
前記行動抽出部により抽出された行動に関し、前記分類部により分類された発話中の行動である場合と非発話中の行動である場合の各々に対して設定された前記評価項目および当該評価項目ごとの評価基準に基づき、発話中の行動および非発話中の行動に対する各々の当該評価項目ごとの評価を行う評価部と、
を備えることを特徴とする、情報処理装置である。
本発明の請求項２に係る情報処理装置は、
前記評価部は、前記分類部による分類に基づき、前記行動抽出部により抽出された行動の少なくとも一部に対し、発話中に行われた行動と発話中でないときに行われた行動とで異なる評価を行うことを特徴とする、請求項１に記載の情報処理装置である。
本発明の請求項３に係る情報処理装置は、
前記分類部は、前記行動抽出部により抽出された行動のうち、口を動かす動作に基づいて、発話中か否かを特定することを特徴とする、請求項１または請求項２に記載の情報処理装置である。
本発明の請求項４に係る情報処理装置は、
前記分類部は、前記動画データと共に取得された音声に基づいて、または、当該音声と前記行動抽出部により抽出された行動のうちの口を動かす動作とに基づいて、発話中か否かを特定することを特徴とする、請求項１または請求項２に記載の情報処理装置である。
本発明の請求項５に係る評価システムは、
動画データを取得する取得手段と、
前記取得手段により取得された動画データを解析して動画に映っている人物の行動を評価する行動評価手段と、
前記行動評価手段による評価結果を出力する出力手段と、を備え、
前記行動評価手段は、
動画データに映っている人体の部位を特定し、特定された部位の動作を検出する動作検出部と、
前記動作検出部により検出された人体の部位の動作に基づき、予め定められた評価項目における評価対象として定義された行動を抽出する行動抽出部と、
前記行動抽出部により抽出された行動を発話中の行動か否かに応じて分類する分類部と、
前記行動抽出部により抽出された行動に関し、前記分類部により分類された発話中の行動である場合と非発話中の行動である場合の各々に対して設定された前記評価項目および当該評価項目ごとの評価基準に基づき、発話中の行動および非発話中の行動に対する各々の当該評価項目ごとの評価を行う評価部と、
を備えることを特徴とする、評価システムである。
本発明の請求項６に係る評価システムは、
前記行動評価手段の前記分類部は、前記行動抽出部により抽出された行動のうち、口を動かす動作に基づいて、発話中か否かを特定することを特徴とする、請求項５に記載の評価システムである。
本発明の請求項７に係る評価システムは、
音声を収録する音声収録手段をさらに備え、
前記行動評価手段の前記分類部は、前記取得手段により取得された前記動画データと共に前記音声収録手段により収録された音声に基づいて、または、当該音声と前記行動抽出部により抽出された行動のうちの口を動かす動作とに基づいて、発話中か否かを特定することを特徴とする、請求項５に記載の評価システムである。
本発明の請求項８に係るプログラムは、
コンピュータを、
動画データに映っている人体の部位を特定し、特定された部位の動作を検出する動作検出手段と、
前記動作検出手段により検出された人体の部位の動作に基づき、予め定められた評価項目における評価対象として定義された行動を抽出する行動抽出手段と、
前記行動抽出手段により抽出された行動を発話中の行動か否かに応じて分類する分類手段と、
前記行動抽出手段により抽出された行動に関し、前記分類手段により分類された発話中の行動である場合と非発話中の行動である場合の各々に対して設定された前記評価項目および当該評価項目ごとの評価基準に基づき、発話中の行動および非発話中の行動に対する各々の当該評価項目ごとの評価を行う評価手段として機能させること、
を特徴とする、プログラムである。

請求項１の発明によれば、言語情報に基づいて面接志望者を評価する構成と比較して、発話中や発話していないときの非言語情報としての行動に基づく評価を支援することができる。
請求項２の発明によれば、言語情報に基づいて面接志望者を評価する構成と比較して、発話中の行動か否かの区別を非言語情報としての行動の評価に反映させ、精度の高い評価を行うことができる。
請求項３の発明によれば、非言語情報としての行動として抽出される動作を用いることにより、効率よく発話中か否かの判断を行うことができる。
請求項４の発明によれば、音声情報を参酌することにより、発話中か否かの判断を精度よく行うことができる。
請求項５の発明によれば、言語情報に基づいて面接志望者を評価する構成と比較して、取得手段により取得した動画を用いて、発話中や発話していないときの非言語情報としての行動に基づく評価を支援することができる。
請求項６の発明によれば、非言語情報としての行動として抽出される動作を用いることにより、効率よく発話中か否かの判断を行うことができる。
請求項７の発明によれば、音声情報を参酌することにより、発話中か否かの判断を精度よく行うことができる。
請求項８の発明によれば、言語情報に基づいて面接志望者を評価する構成と比較して、本発明のプログラムを実行するコンピュータにおいて、発話中や発話していないときの非言語情報としての行動に基づく評価を支援することができる。

本実施形態が適用される非言語情報評価システムの構成例を示す図である。情報処理装置のハードウェア構成例を示す図である。情報処理装置の機能構成を示す図である。端末装置のハードウェア構成例を示す図である。端末装置の機能構成を示す図である。フレーム間特徴量を用いて人体に関わる領域を特定する手法を説明する図であり、図６（Ａ）は、動画の１フレームにおいて、人物が横を向いて椅子に座っている様子を示す図、図６（Ｂ）は、動画の別の１フレームにおいて、同じ人物が前方へ乗り出した様子を示す図である。本実施形態の非言語情報評価システムにおいて、ビデオカメラにより撮影された画像の例を示す図である。

＜本実施形態が適用される非言語情報評価システムの構成＞
図１は、本実施形態が適用される非言語情報評価システムの構成例を示す図である。図１に示すように、本実施形態による非言語情報評価システム１０は、動画取得装置としてのビデオカメラ１００と、動画解析装置としての情報処理装置２００と、情報処理装置２００による解析結果を出力する出力装置としての端末装置３００とを備える。ビデオカメラ１００と情報処理装置２００、情報処理装置２００と端末装置３００は、それぞれネットワーク２０を介して接続されている。

ネットワーク２０は、ビデオカメラ１００と情報処理装置２００および情報処理装置２００と端末装置３００の間で情報通信を行えるものであれば特に限定されず、例えばインターネットやＬＡＮ（Local Area Network）等としてよい。情報通信に用いられる通信回線は、有線であっても無線であっても良い。ビデオカメラ１００と情報処理装置２００とを接続するネットワーク２０と、情報処理装置２００と端末装置３００とを接続するネットワーク２０とは、共通のネットワークであってもよいし、異なるネットワークであってもよい。また、特に図示しないが、ネットワーク２０にはネットワークや通信回線を接続するためのゲートウェイやハブ等の中継装置が適宜設けられる。

本実施形態の非言語情報評価システム１０は、評価対象である面接志望者の動画を解析して、動作や顔の表情といった非言語情報を抽出し、抽出された非言語情報に基づき評価対象を評価する。評価対象の面接志望者は、一人とする場合もあるし、複数人を一度に対象とする場合もある。評価項目や評価内容は、面接の目的や形式等に応じて設定される。本実施形態における具体的な評価方法については後述する。

図１に示すシステムにおいて、ビデオカメラ１００は、動画データの取得手段の一例であり、評価対象である面接志望者を撮影する。本実施形態では、ビデオカメラ１００により撮影された面接志望者の動画を解析し、動作や顔の表情といった非言語情報が抽出される。したがって、一度に撮影する面接志望者の人数および配置等に応じて、面接志望者の動作や表情が識別できるように、ビデオカメラ１００の種類や設置台数が設定される。例えば、１台のビデオカメラ１００で面接志望者の正面から撮影するように構成してもよいし、複数台のビデオカメラ１００で複数の角度から（相異なる向きで）面接志望者を撮影するように構成してもよい。また、複数人の面接志望者に対して同時に面接を行う場合、１台のビデオカメラ１００で複数人の面接志望者を１画面に収めるように撮影してもよいし、複数台のビデオカメラ１００で各面接志望者を個別に撮影してもよい。また、本実施形態において、ビデオカメラ１００は、撮影した動画をデジタル・データとして、ネットワーク２０を介して情報処理装置２００へ送信する機能を備える。

情報処理装置２００は、行動評価手段の一例であり、ビデオカメラ１００により撮影された動画を解析して評価対象である面接志望者（以下、評価対象者と呼ぶ）に関する非言語情報を抽出し、評価するコンピュータ（サーバ）である。情報処理装置２００は、単体のコンピュータにより構成してもよいし、ネットワーク２０に接続された複数のコンピュータにより構成してもよい。後者の場合、後述する本実施形態の情報処理装置２００としての機能は、複数のコンピュータによる分散処理にて実現される。

図２は、情報処理装置２００のハードウェア構成例を示す図である。図２に示すように、情報処理装置２００は、制御手段および演算手段であるＣＰＵ（Central Processing Unit）２０１と、ＲＡＭ２０２およびＲＯＭ２０３と、外部記憶装置２０４と、ネットワーク・インターフェイス２０５とを備える。ＣＰＵ２０１は、ＲＯＭ２０３に格納されているプログラムを実行することにより、各種の制御および演算処理を行う。ＲＡＭ２０２は、ＣＰＵ２０１による制御や演算処理において作業メモリとして用いられる。ＲＯＭ２０３は、ＣＰＵ２０１が実行するプログラムや制御において用いられる各種のデータを格納している。外部記憶装置２０４は、例えば磁気ディスク装置や、データの読み書きが可能で不揮発性の半導体メモリで実現され、ＲＡＭ２０２に展開されてＣＰＵ２０１により実行されるプログラムや、ＣＰＵ２０１による演算処理の結果を格納する。ネットワーク・インターフェイス２０５は、ネットワーク２０に接続して、ビデオカメラ１００や端末装置３００との間でデータの送受信を行う。なお、図２に示す構成例は、情報処理装置２００をコンピュータで実現するハードウェア構成の一例に過ぎない。情報処理装置２００の具体的構成は、以下に説明する機能を実現し得るものであれば、図２に示す構成例に限定されない。

図３は、情報処理装置２００の機能構成を示す図である。図３に示すように、情報処理装置２００は、動画データ取得部２１０と、領域識別部２２０と、動作検出部２３０と、非言語情報抽出部２４０と、分類部２４５と、反応評価部２５０と、出力部２６０とを備える。

動画データ取得部２１０は、例えば図２に示すコンピュータにおいて、ＣＰＵ２０１がプログラムを実行し、ネットワーク・インターフェイス２０５を制御することにより実現される。動画データ取得部２１０は、ネットワーク２０を介してビデオカメラ１００から動画データを受信する。受信した動画データは、例えば図２に示すＲＡＭ２０２や外部記憶装置２０４に格納される。

領域識別部２２０は、例えば図２に示すコンピュータにおいて、ＣＰＵ２０１がプログラムを実行することにより実現される。領域識別部２２０は、動画データ取得部２１０により取得された動画を解析し、後段の非言語情報抽出部２４０により非言語情報として抽出される評価対象者の部位が映っている領域を識別する。具体的には、人体（全体）が映っている領域、人体の頭部、体部、腕部、手部、指などが映っている領域、頭部の顔、目、口、鼻、耳などが映っている領域、上半身、下半身が映っている領域、その他身体の各特徴点が映っている領域等を識別する（以下、人体の全体や一部分を特に区別せず、部位、身体の部位などと呼ぶ）。識別対象の部位としては、予め定められた部位を全て識別してもよいし、後段の非言語情報抽出部２４０による抽出や反応評価部２５０による評価の内容に基づき、これらの処理に用いられる部位のみを識別してもよい。

動作検出部２３０は、例えば図２に示すコンピュータにおいて、ＣＰＵ２０１がプログラムを実行することにより実現される。動作検出部２３０は、領域識別部２２０の識別結果に基づき、各領域に映っている身体の部位を特定し、特定した部位ごとの動作を検出する。具体的には、頭の動き、顔の向き、顔の構成部位（目、口など）の動き、腕や脚の動き、身体の向き、身体の移動（歩きまわる等）等の動作を検出する。検出対象の動作としては、予め定められた部位についての予め定められた動作を全て対象として検出してもよいし、後段の非言語情報抽出部２４０による抽出や反応評価部２５０による評価の内容に基づき、これらの処理に用いられる部位の動作のみを検出してもよい。

非言語情報抽出部２４０は、例えば図２に示すコンピュータにおいて、ＣＰＵ２０１がプログラムを実行することにより実現される。非言語情報抽出部２４０は、動作検出部２３０により検出された部位の動きに基づき、評価対象者の行動のうち、反応評価部２５０の評価項目ごとの評価に用いられるもの（非言語情報）を抽出する。言い換えれば、非言語情報抽出部２４０は、評価対象者の発する非言語情報として定義された行動を抽出する行動抽出部である。具体的には、例えば、うなずく動作、顔を特定の方向に向けたり顔の向きを変えたりする動作、表情の変化、口を動かして発言する動作、欠伸（あくび）をする動作、居眠りしているときの動き、目くばせをする動作、挙手、筆記動作、キーボードを打つ動作、振り向く動作、貧乏ゆすりなどを抽出する。

分類部２４５は、例えば図２に示すコンピュータにおいて、ＣＰＵ２０１がプログラムを実行することにより実現される。分類部２４５は、非言語情報抽出部２４０により抽出された非言語情報としての行動を、評価対象者が話者であるときの行動と、評価対象者が話者でないときの行動とに分類する。すなわち、話者を特定する話者情報と非言語情報としての行動とを関連付ける。非言語情報として抽出される行動には、その行動が評価対象者の発話中に行われた行動か、他者の発話中に行われた行動かによって意義の変わるものがある。そこで、本実施形態では、評価対象者の発話中の行動と、発話していないときの行動とを分類する。この分類は、評価対象者の全ての行動に対して行ってもよいし、評価対象者の発話中に行われた行動か、他者の発話中に行われた行動かによって意義の変わる行動に対して行ってもよい。

反応評価部２５０は、例えば図２に示すコンピュータにおいて、ＣＰＵ２０１がプログラムを実行することにより実現される。反応評価部２５０は、非言語情報抽出部２４０により抽出された評価項目ごとの非言語情報の行動に対し、評価項目ごとに予め定められた評価基準に基づいて、評価対象者の反応を評価する。また、分類部２４５により分類された行動に関しては、発話中の行動か否かを加味して評価を行う。

出力部２６０は、例えば図２に示すコンピュータにおいて、ＣＰＵ２０１がプログラムを実行し、ネットワーク・インターフェイス２０５を制御することにより実現される。出力部２６０は、ネットワーク２０を介して、反応評価部２５０による評価結果の情報を端末装置３００に送信する。

端末装置３００は、出力手段の一例であり、情報処理装置２００による評価結果を出力する情報端末（クライアント）である。端末装置３００としては、例えばパーソナルコンピュータ、タブレット端末、スマートフォン等の出力手段として画像表示手段を備えた装置が用いられる。

図４は、端末装置３００のハードウェア構成例を示す図である。図４に示すように、端末装置３００は、ＣＰＵ３０１と、ＲＡＭ３０２およびＲＯＭ３０３と、表示装置３０４と、入力装置３０５と、ネットワーク・インターフェイス３０６とを備える。ＣＰＵ３０１は、ＲＯＭ３０３に格納されているプログラムを実行することにより、各種の制御および演算処理を行う。ＲＡＭ３０２は、ＣＰＵ３０１による制御や演算処理において作業メモリとして用いられる。ＲＯＭ３０３は、ＣＰＵ２０１が実行するプログラムや制御において用いられる各種のデータを格納している。表示装置３０４は、例えば液晶ディスプレイにより構成され、ＣＰＵ３０１の制御により画像を表示する。入力装置３０５は、例えばキーボードやマウス、タッチセンサ等の入力デバイスで実現され、操作者の入力操作を受け付ける。一例として、端末装置３００がタブレット端末やスマートフォン等である場合は、液晶ディスプレイとタッチセンサとが組み合わされたタッチパネルが表示装置３０４および入力装置３０５として機能する。ネットワーク・インターフェイス３０６は、ネットワーク２０に接続して、ビデオカメラ１００や端末装置３００との間でデータの送受信を行う。なお、図４に示す構成例は、端末装置３００をコンピュータで実現するハードウェア構成の一例に過ぎない。端末装置３００の具体的構成は、以下に説明する機能を実現し得るものであれば、図４に示す構成例に限定されない。

図５は、端末装置３００の機能構成を示す図である。図５に示すように、本実施形態の端末装置３００は、評価結果取得部３１０と、表示画像生成部３２０と、表示制御部３３０と、操作受け付け部３４０とを備える。

評価結果取得部３１０は、例えば図４に示すコンピュータにおいて、ＣＰＵ３０１がプログラムを実行し、ネットワーク・インターフェイス３０６を制御することにより実現される。評価結果取得部３１０は、ネットワーク２０を介して情報処理装置２００から評価結果のデータを受信する。受信した評価結果のデータは、例えば図４のＲＡＭ３０２に格納される。

表示画像生成部３２０は、例えば図４に示すコンピュータにおいて、ＣＰＵ３０１がプログラムを実行することにより実現される。表示画像生成部３２０は、評価結果取得部３１０により取得された評価結果のデータに基づき、評価結果を示す出力画像を生成する。生成される出力画像の構成や表示態様は、評価項目や評価内容等に応じて設定し得る。出力画像の詳細については後述する。

表示制御部３３０は、例えば図４に示すコンピュータにおいて、ＣＰＵ３０１がプログラムを実行することにより実現される。表示制御部３３０は、表示画像生成部３２０により生成された出力画像を、例えば図４に示すコンピュータにおける表示装置３０４に表示させる。また、表示制御部３３０は、表示装置３０４への表示に関する命令を受け付け、受け付けた命令に基づいて表示の切り替え等の制御を行う。

操作受け付け部３４０は、例えば図４に示すコンピュータにおいて、ＣＰＵ３０１がプログラムを実行することにより実現される。操作受け付け部３４０は、操作者が入力装置３０５により行った入力操作を受け付ける。そして、操作受け付け部３４０により受け付けた操作にしたがって、表示制御部３３０が表示装置３０４への出力画像等の表示制御を行う。

＜領域識別部の処理＞
情報処理装置２００の領域識別部２２０による処理について説明する。領域識別部２２０は、ビデオカメラ１００により撮影された動画から、その動画に映っている人物の動作に係る部位を識別する。この部位の識別には、既存の種々の画像解析技術を適用してよい。例えば、顔や笑顔の識別は、デジタルカメラ等で実現されている既存の識別手法を用いてよい。また、動画に映されている特定の形状の部分（領域）やそのような複数の部分の配置等に基づいて、身体の部位が映っている領域を特定し得る。さらに一例として、フレーム間特徴量に基づく識別を行ってもよい。具体的には、動画データの連続する２枚以上のフレームの差分に基づき、フレーム間特徴量を求める。ここで、フレーム間特徴量としては、例えば、色の境界（エッジ）、色の変化量、これらによって特定される領域の移動方向や移動量などが用いられる。予め設定された時間分のフレーム間特徴量を累積し、フレームごとのフレーム間特徴量の距離や類似度に基づいて、フレーム間特徴量を分類、統合する。これにより、動画において連携して変化する領域が特定され、身体の部位が映っている領域が識別される。

図６は、フレーム間特徴量を用いて人体に関わる領域を特定する手法を説明する図である。図６（Ａ）は、動画の１フレームにおいて、人物が横を向いて椅子に座っている様子を示し、図６（Ｂ）は、動画の別の１フレームにおいて、同じ人物が前方へ乗り出した様子を示している。図６に示す例において、領域識別部２２０は、図６（Ａ）に映っている色の境界や変化量に基づき、近似する色が映っている範囲を特定する。そして、領域識別部２２０は、図６（Ａ）のフレームと図６（Ｂ）のフレームとを対比し、対応する色の範囲の移動方向および移動量に基づき、画像中の破線の枠で囲まれた領域２２１において、複数個の色の範囲が連携して動いていることを認識し、この領域２２１を人体の上半身が映っている領域として識別する。図６（Ａ）、（Ｂ）を参照すると、人体（上半身）を構成する色の範囲の動きに応じて、領域２２１の位置や大きさが変化している。なお、ここでは図６（Ａ）、（Ｂ）の２つのフレームを対比したが、３つ以上のフレームを対比して色の範囲の変化等のフレーム間特徴量を累積した結果に基づいて人体が映っている領域を識別するようにしてもよい。

＜動作検出部の処理＞
動作検出部２３０による処理について説明する。動作検出部２３０は、領域識別部２２０により識別された身体の部位が映っている領域を解析して、具体的にどの部位が映っているかを特定し、特定した部位ごとの動きを検出する。この動きの検出には、既存の種々の画像解析技術を適用してよい。検出される動きは、特定された部位ごとに身体動作として起こり得る動きである。例えば、目を閉じたり口を開けたりする動き、視線の変化、顔の向きを上下や左右に変える動き、肘の曲げ伸ばしや腕を振る動き、手指の曲げ伸ばしや手を開いたり閉じたりする動き、腰の曲げ伸ばしや体を捻じる動き、膝の曲げ伸ばしや脚を振る動き、歩行等による身体の移動などが検出される。なお、これらの動きは例示に過ぎず、本実施形態の非言語情報評価システム１０で検出し得る動きは、上記に提示した動きに限定されない。本実施形態では、動作検出部２３０は、領域識別部２２０で領域として識別された全ての部位の動きを検出してもよいし、後段の非言語情報抽出部２４０で抽出される動作を特定するための動き等に限定して検出してもよい。例えば、非言語情報抽出部２４０でうなずく動作のみを抽出するのであれば、顔の向きを上下に変えるような頭の動きを検出すればよい。

＜非言語情報抽出部の処理＞
非言語情報抽出部２４０による処理について説明する。非言語情報抽出部２４０は、動作検出部２３０により検出された部位の動きに基づいて、評価対象者が意識的にまたは無意識的に行った意味のある行動を非言語情報として抽出する。例えば、顔の向きを上下に変える動きからうなずくという動作を抽出したり、口を動かす動きから発話や欠伸という動作を抽出したり、腕を上げる動きから挙手という動作を抽出したりする。非言語情報の抽出は、単に動作検出部２３０により検出された部位の動きのみに基づいて行われるのではなく、例えば、検出された動きの前後における該当部位の動き、周囲の部位や他の人物の動き、動きが検出された場面や文脈（背景）等の情報も参酌して行われる。具体例を挙げると、顔の向きを上下に連続的に変える動きが特定の時間内で行われたとき、この動きは、うなずきの動作として抽出される。一方、顔の向きが上を向き、ある程度の時間が経過した後に下方向へ動いてもとに戻ったとき、この動きは、思考するために上方を見上げた動作として抽出される。また、顔の向きが下を向き、ある程度の時間が経過したとき、この動作は、居眠りしていることを示す動作として抽出される。なお、これらの動作や参酌情報は例示に過ぎず、本実施形態の非言語情報評価システム１０で非言語情報として抽出し得る動作や参酌情報は、上記に提示した動作や情報に限定されない。

＜分類部の処理＞
分類部２４５による処理について説明する。分類部２４５は、まず、非言語情報抽出部２４０により抽出された非言語情報としての行動のうち、発話を表す行動を検出する。例えば、口の連続的な開閉動作を発話動作として検出し得る。次に、分類部２４５は、非言語情報抽出部２４０により抽出された非言語情報としての他の行動を、評価対象者が話者であるときの行動と、評価対象者が話者でないときの行動とに分類する。この分類により、非言語情報として抽出された行動の意義が変わる。例えば、評価対象者自身の発話中に身振り手振りを行うことは発話内容を補足する意義を有することがあるのに対し、他者の発話中に身振り手振りを行うことは他者の発話に注意を向けていないことを表すことがある。また、髪に触れたり、視線や顔の向きを動かしたりする動作は、自身の発話中の行動であれば、あまり否定的な評価とはならないが、他者の発話中の行動では、非常に否定的な評価の根拠となり得る。なお、非言語情報として抽出される行動であっても、評価対象者の発話中か否かを無視してよい（意義の変わらない）行動もあると考えられる。そこで、評価対象者のどのような行動に対して、評価対象者の発話中の行動か否かに基づく分類を行うかは、面接の目的や形式等に応じて予め設定してもよい。

また、ここでは、特定の評価対象者の行動がその評価対象者の発話時の行動か否かについて分類したが、さらに、その行動が面接官の発話中の行動か否か、他の評価対象者の発話中の行動か否か（複数の面接志望者が同時に面接されている場合）、誰も発話していないときの行動か否か等について分類しても良い。例えば、複数の評価対象者（面接志望者）が同時に面接を受ける場合、発話している評価対象者を特定し、その評価対象者の行動は発話中の行動として、他の評価対象者の行動は発話していないときの行動として、異なる評価を行う。

＜反応評価部の処理＞
反応評価部２５０による処理について説明する。反応評価部２５０は、非言語情報抽出部２４０により抽出された非言語情報に基づき、面接における評価対象者（面接志望者）の反応を評価する。例えば、上述したように、自身の発話以外のときに手が動いたり、顔の向きが頻繁に変わったりした場合は、低い（悪い）評価値が与えられる。また、質問に対する応答の動作が、予め定められた第１の基準時間よりも早く行われた（すなわち応答が速い）場合は、高い（良い）評価値が与えられ、第１の基準時間よりも長い予め定められた第２の基準時間よりも遅く行われた（すなわち、応答が遅い）場合は、低い評価値が与えられる。その他、話者から視線を外したり、視線が下向きであったり、面接の内容や進行とは関係なく手や足が動いたりした場合は、低い評価値が与えられる等、面接の目的等に応じて様々な評価項目および評価基準を設定してよい。面接全般における評価対象者に対する評価は、例えば、面接中に非言語情報としての行動が出現するたびに与えられた評価値を合計して得る。

また、反応評価部２５０は、非言語情報としての行動が出現したか否かという二値的な評価だけでなく、どの程度強い反応かを表す多値的な評価を行っても良い。多値的な評価を行う場合、反応評価部２５０において評価される評価項目に応じて、その評価に用いられる非言語情報として定義された（抽出される）行動（以下、反応行動）の種類および反応行動の出現態様が設定される。言い換えると、同じ反応行動であっても、その出現態様に応じて異なる評価となる。例えば、非言語情報として抽出される特定の反応行動が１回行われた場合と、複数回繰り返されたり、一定時間以上継続したりした場合とでは評価が異なる。

さらに、多値的な評価を行う場合、例えば、その評価項目における反応行動の種類、出現頻度、継続時間などに基づいて、評価の程度を特定してもよい。一例として、面接に対する集中度を評価するための評価対象の反応行動として、うなずく動作が定義されている場合を考える。この場合、一回だけ軽くうなずく動作よりも、複数回繰り返してうなずく動作や、大きな身振りでうなずく動作の方が高い評価値を与える設定としても良い。

＜適用例＞
図７は、本実施形態の非言語情報評価システム１０において、ビデオカメラ１００により撮影された画像の例を示す図である。図７に示す例では、一人の評価対象者（面接志望者）が画面に捉えられている。ここでは、一人の面接官と一人の評価対象者との面接が行われているものとする。したがって、話者は面接官か評価対象者のいずれか一方となる。図示の例において、評価対象者は正面（ビデオカメラ１００の方向）を向いており、面接官は画像に入っていない。このような場面では、評価対象者自身が話者でないときの動作や、視線や顔の向きを正面から外したり頻繁に動かしたりするような動作は、評価を下げる大きな要素となる。一方、面接官が複数いる場合、評価対象者は、各面接官に視線を合わせるため、発話中であっても、発話していないときであっても、度々、視線や顔の向きを変えることが考えられる。したがって、評価基準については、面接の形式等に応じて、様々な設定が行われることが必要である。

＜他の構成例等＞
以上、本実施形態による非言語情報評価システム１０について説明したが、本実施形態の具体的構成は上記のものに限定されない。例えば、上記の構成では、ビデオカメラ１００で取得した動画を情報処理装置２００が処理し、得られた評価結果を出力手段としての端末装置３００が表示出力するシステム構成とした。これに対し、情報処理装置２００が、別途撮影され、記憶装置に蓄積された面接の動画を解析し、面接志望者の評価を行う構成としても良い。

また、上記の実施形態では、評価対象者の口の動きに基づいて話者か否かを判別することとした。これに対し、動画と同時に音声データを収録し、動画の口の動きに加えて発話音声や音声解析により得られる言語情報を参酌して、評価対象者が発話中か否かを判定しても良い。動画と音声データとを対比することにより、話者を特定する精度を向上させ得る。さらにまた、話者を特定するために、動画における口の動きを用いず、発話音声や発話音声から得られる言語情報のみに基づいて話者を特定しても良い。

発話中か否かの特定に音声データを用いる場合、音声収録手段として、例えば、ビデオカメラ１００に設けられているマイクロフォンを用いることができる。収録された音声は、動画と共に情報処理装置２００へ送られる。情報処理装置２００においては、動画データ取得部２１０が、音声取得部として機能し、動画と共に音声を取得する。また、単に発話音声を用いるだけでなく音声解析により得られる言語情報を用いる場合は、情報処理装置２００において、音声解析部を備える。音声解析部は、例えば、図２に示すコンピュータにおいて、ＣＰＵ２０１がプログラムを実行することにより実現される。具体的な音声解析の技術としては、既存の種々の解析技術を適用してよい。

さらにまた、本実施形態において、情報処理装置２００が出力手段を兼ねる構成としてもよい。すなわち、情報処理装置２００と端末装置３００とを分けず、例えば、情報処理装置２００自身が液晶ディスプレイ等の表示装置を備える構成とし、評価結果の表示出力を行うようにしてもよい。

１０…非言語情報評価システム、２０…ネットワーク、１００…ビデオカメラ、２００…情報処理装置、２０１…ＣＰＵ、２０２…ＲＡＭ、２０３…ＲＯＭ、２０４…外部記憶装置、２０５…ネットワーク・インターフェイス、２１０…動画データ取得部、２２０…領域識別部、２３０…動作検出部、２４０…非言語情報抽出部、２４５…分類部、２５０…反応評価部、２６０…出力部、３００…端末装置、３０１…ＣＰＵ、３０２…ＲＡＭ、３０３…ＲＯＭ、３０４…表示装置、３０５…入力装置、３０６…ネットワーク・インターフェイス、３１０…評価結果取得部、３２０…表示画像生成部、３３０…表示制御部、３４０…操作受け付け部

Claims

動画データに映っている人体の部位を特定し、特定された部位の動作を検出する動作検出部と、
前記動作検出部により検出された人体の部位の動作に基づき、予め定められた評価項目における評価対象として定義された行動を抽出する行動抽出部と、
前記行動抽出部により抽出された行動を発話中の行動か否かに応じて分類する分類部と、
前記行動抽出部により抽出された行動に関し、前記分類部により分類された発話中の行動である場合と非発話中の行動である場合の各々に対して設定された前記評価項目および当該評価項目ごとの評価基準に基づき、発話中の行動および非発話中の行動に対する各々の当該評価項目ごとの評価を行う評価部と、
を備えることを特徴とする、情報処理装置。
前記評価部は、前記分類部による分類に基づき、前記行動抽出部により抽出された行動の少なくとも一部に対し、発話中に行われた行動と発話中でないときに行われた行動とで異なる評価を行うことを特徴とする、請求項１に記載の情報処理装置。
前記分類部は、前記行動抽出部により抽出された行動のうち、口を動かす動作に基づいて、発話中か否かを特定することを特徴とする、請求項１または請求項２に記載の情報処理装置。
前記分類部は、前記動画データと共に取得された音声に基づいて、または、当該音声と前記行動抽出部により抽出された行動のうちの口を動かす動作とに基づいて、発話中か否かを特定することを特徴とする、請求項１または請求項２に記載の情報処理装置。
動画データを取得する取得手段と、
前記取得手段により取得された動画データを解析して動画に映っている人物の行動を評価する行動評価手段と、
前記行動評価手段による評価結果を出力する出力手段と、を備え、
前記行動評価手段は、
動画データに映っている人体の部位を特定し、特定された部位の動作を検出する動作検出部と、
前記動作検出部により検出された人体の部位の動作に基づき、予め定められた評価項目における評価対象として定義された行動を抽出する行動抽出部と、
前記行動抽出部により抽出された行動を発話中の行動か否かに応じて分類する分類部と、
前記行動抽出部により抽出された行動に関し、前記分類部により分類された発話中の行動である場合と非発話中の行動である場合の各々に対して設定された前記評価項目および当該評価項目ごとの評価基準に基づき、発話中の行動および非発話中の行動に対する各々の当該評価項目ごとの評価を行う評価部と、
を備えることを特徴とする、評価システム。
前記行動評価手段の前記分類部は、前記行動抽出部により抽出された行動のうち、口を動かす動作に基づいて、発話中か否かを特定することを特徴とする、請求項５に記載の評価システム。
音声を収録する音声収録手段をさらに備え、
前記行動評価手段の前記分類部は、前記取得手段により取得された前記動画データと共に前記音声収録手段により収録された音声に基づいて、または、当該音声と前記行動抽出部により抽出された行動のうちの口を動かす動作とに基づいて、発話中か否かを特定することを特徴とする、請求項５に記載の評価システム。
コンピュータを、
動画データに映っている人体の部位を特定し、特定された部位の動作を検出する動作検出手段と、
前記動作検出手段により検出された人体の部位の動作に基づき、予め定められた評価項目における評価対象として定義された行動を抽出する行動抽出手段と、
前記行動抽出手段により抽出された行動を発話中の行動か否かに応じて分類する分類手段と、
前記行動抽出手段により抽出された行動に関し、前記分類手段により分類された発話中の行動である場合と非発話中の行動である場合の各々に対して設定された前記評価項目および当該評価項目ごとの評価基準に基づき、発話中の行動および非発話中の行動に対する各々の当該評価項目ごとの評価を行う評価手段として機能させること、
を特徴とする、プログラム。