JP2002264058A

JP2002264058A - ロボット視聴覚システム

Info

Publication number: JP2002264058A
Application number: JP2001067846A
Authority: JP
Inventors: Kazuhiro Nakadai; 一博中臺; Kenichi Hidai; 健一日台; Hiroshi Okuno; 博奥乃; Hiroaki Kitano; 宏明北野
Original assignee: Japan Science and Technology Corp
Current assignee: Japan Science and Technology Agency
Priority date: 2001-03-09
Filing date: 2001-03-09
Publication date: 2002-09-18
Anticipated expiration: 2021-03-09
Also published as: JP3843740B2

Abstract

(57)【要約】【課題】対象に対する視覚及び聴覚の追跡を行なうた
めのリアルタイム処理を可能にするようにした、ロボッ
ト視聴覚システムを提供する。【解決手段】聴覚モジュール２０がマイクの音響信号
からピッチ抽出，音源の分離及び定位により話者の音源
を同定して聴覚イベント２８を抽出し、視覚モジュール
３０がカメラの画像から話者の顔識別と定位により視覚
イベント３９を抽出し、ロボットを水平方向に回動させ
るモータ制御モジュール４０がモータの回転位置からモ
ータイベント４９を抽出し、各モジュールを制御するア
ソシエーションモジュール６０が聴覚イベント，視覚イ
ベント及びモータイベントから聴覚ストリーム６５及び
視覚ストリーム６６を生成し、これらを関連付けてアソ
シエーションストリーム６７を生成して、アテンション
制御モジュール６４が駆動モータ制御のプランニングの
ためのアテンション制御を行なう。

Description

【発明の詳細な説明】

【０００１】

【発明の属する技術分野】本発明はロボット、特に人型
または動物型ロボットにおける視聴覚システムに関する
ものである。

【０００２】

【従来の技術】近年、このような人型または動物型ロボ
ットにおいては、視覚，聴覚の能動知覚が注目されてき
ている。能動知覚とは、ロボット視覚やロボット聴覚等
の知覚を担当する知覚装置を、知覚すべき対象に追従す
るように、これらの知覚装置を支持する例えば頭部を、
駆動機構により姿勢制御するものである。

【０００３】ここで、能動視覚に関しては、少なくとも
知覚装置であるカメラが、駆動機構による姿勢制御によ
ってその光軸方向が対象に向かって保持され、対象に対
して自動的にフォーカシングやズームイン，ズームアウ
ト等を行うことにより、対象をカメラによって撮像する
ようになっており、種々の研究が行なわれている。

【０００４】これに対して、能動聴覚に関しては、少な
くとも知覚装置であるマイクが、駆動機構による姿勢制
御によって、その指向性が対象に向かって保持され、対
象からの音がマイクによって集音される。このような能
動聴覚は、例えば本出願人による特願２０００−２２６
７７号（ロボット聴覚システム）に開示されており、視
覚情報を参照して音源の方向付けを行なうようにしてい
る。

【０００５】

【発明が解決しようとする課題】ところで、これらの能
動視覚及び能動聴覚は、ロボットの向き（水平方向）を
変更するためのモータ制御モジュールと密接に関連があ
り、特定の対象に対して、能動視覚及び能動聴覚を働か
せるためには、ロボットを特定の対象に向ける、即ちア
テンション制御を行なう必要がある。しかしながら、視
覚及び聴覚をモータ制御モジュールの制御と統合させる
ためには、視覚及び聴覚の追跡を行なうためのリアルタ
イム処理が必要であるが、従来のロボット開発において
は、単一音源を対象としたリアルタイム処理を行なうも
のは実現されているが、例えば複数の人間が互いに話を
しているような状況において、リアルタイム処理によ
り、各人を同定して、能動聴覚を行なうことは行なわれ
ていない。

【０００６】この発明は、以上の点にかんがみて、対象
に対する視覚及び聴覚の追跡を行なうためのリアルタイ
ム処理を可能にし、さらに視覚，聴覚，モータ等のセン
サー情報を統合して、何れかの情報が欠落したとして
も、相互に補完することにより追跡を継続し得るように
した、ロボット視聴覚システムを提供することを目的と
している。

【０００７】

【課題を解決するための手段】前記目的は、この発明に
よれば、外部の音を集音する少なくとも一対のマイクを
含む聴覚モジュールと、ロボットの前方を撮像するカメ
ラを含む視覚モジュールと、ロボットを水平方向に回動
させる駆動モータを含むモータ制御モジュールと、前記
聴覚モジュール，視覚モジュール及びモータ制御モジュ
ールからのイベントを統合してストリームを生成するア
ソシエーションモジュールと、アソシエーションモジュ
ールにより生成されたストリームに基づいてアテンショ
ン制御を行なうアテンション制御モジュールと、を備え
ているロボット視聴覚システムであって、前記聴覚モジ
ュールが、マイクからの音響信号に基づいてピッチ抽
出，音源の分離及び定位から少なくとも一人の話者の音
源を同定してその聴覚イベントを抽出し、前記視覚モジ
ュールが、カメラにより撮像された画像に基づいて各話
者の顔識別と定位からその視覚イベントを抽出し、前記
モータ制御モジュールが、駆動モータの回転位置に基づ
いてモータイベントを抽出することにより、前記アソシ
エーションモジュールが、聴覚モジュールからの聴覚イ
ベント，視覚モジュールからの視覚イベント及びモータ
制御モジュールからのモータイベントに基づいて聴覚ス
トリーム及び視覚ストリームを生成し、さらにこれらを
関連付けてアソシエーションストリームを生成して、前
記アテンション制御モジュールが、これらのストリーム
に基づいてモータ制御モジュールの駆動モータ制御のプ
ランニングのためのアテンション制御を行なうことを特
徴とするロボット視聴覚システムにより、達成される。

【０００８】また、前記目的は、この発明によれば、外
部の音を集音する少なくとも一対のマイクを含む聴覚モ
ジュールと、ロボットの前方を撮像するカメラを含む視
覚モジュールと、ロボットを水平方向に回動させる駆動
モータを含むモータ制御モジュールと、前記聴覚モジュ
ール，視覚モジュール及びモータ制御モジュールからの
イベントを統合してストリームを生成するアソシエーシ
ョンモジュールと、アソシエーションモジュールにより
生成されたストリームに基づいてアテンション制御を行
なうアテンション制御モジュールとを備えている人型ま
たは動物型のロボットの視聴覚システムであって、前記
聴覚モジュールが、マイクからの音響信号に基づいて、
ピッチ抽出，音源の分離及び定位から少なくとも一人の
話者の音源を同定してその聴覚イベントを抽出し、前記
視覚モジュールが、カメラにより撮像された画像に基づ
いて、各話者の顔識別と定位からその視覚イベントを抽
出し、前記モータ制御モジュールが、駆動モータの回転
位置に基づいてモータイベントを抽出することにより、
前記アソシエーションモジュールが、聴覚モジュールか
らの聴覚イベント，視覚モジュールからの視覚イベント
及びモータ制御モジュールからのモータイベントに基づ
いて聴覚ストリーム及び視覚ストリームを生成して、さ
らにこれらを関連付けてアソシエーションストリームを
生成して、前記アテンション制御モジュールが、これら
のストリームに基づいてモータ制御モジュールの駆動モ
ータ制御のプランニングのためのアテンション制御を行
なうことを特徴とするロボット視聴覚システムにより、
達成される。

【０００９】本発明によるロボット視聴覚システムは、
好ましくは、前記アソシエーションモジュールが、聴覚
ストリーム及び視覚ストリームを生成する際に、非同期
で生成される聴覚イベント，視覚イベント及びモータイ
ベントを相互に同期させる。

【００１０】本発明によるロボット視聴覚システムは、
好ましくは、前記アソシエーションモジュールがサーバ
であって、前記聴覚モジュール，視覚モジュール及びモ
ータ制御モジュールがそれぞれサーバに接続されたクラ
イアントである。

【００１１】本発明によるロボット視聴覚システムは、
好ましくは、前記サーバと各クライアントが、相互にＬ
ＡＮ接続されている。

【００１２】本発明によるロボット視聴覚システムは、
好ましくは、前記アテンション制御モジュールが、アテ
ンション制御の際に、アソシエーションストリーム，聴
覚ストリーム及び視覚ストリームの順に優先させる。

【００１３】前記構成によれば、聴覚モジュールが、マ
イクが集音した外部の対象からの音から調波構造を利用
してピッチ抽出を行なうことにより、音源毎の方向を得
て、個々の話者の音源を同定し、その聴覚イベントを抽
出する。また、視覚モジュールが、カメラにより撮像さ
れた画像から、パターン認識による各話者の顔識別と定
位から個々の話者の視覚イベントを抽出する。さらに、
モータ制御モジュールが、ロボットを水平方向に回動さ
せる駆動モータの回転位置に基づいてロボットの方向を
検出することによって、モータイベントを抽出する。な
お、前記イベントとは、各時点において音または顔が検
出され、ピッチ及び方向等の特徴が抽出されて、話者同
定や顔識別等が行なわれること、あるいは駆動モータが
回転される状態を示しており、ストリームとは、時間的
に連続するイベントを示している。

【００１４】ここで、アソシエーションモジュールは、
このようにしてそれぞれ抽出された聴覚イベント，視覚
イベント及びモータイベントに基づいて、各話者の聴覚
ストリーム及び視覚ストリームを生成し、さらにこれら
のストリームを関連付けてアソシエーションストリーム
を生成して、アテンション制御モジュールが、これらの
ストリームに基づいてアテンション制御を行なうことに
より、モータ制御モジュールの駆動モータ制御のプラン
ニングを行なう。アテンションとは、ロボットが対象で
ある話者を、聴覚的及び／又は視覚的に「注目」するこ
とであり、アンテンション制御とは、モータ制御モジュ
ールによりその向きを変えることにより、ロボットが前
記話者に注目するようにすることである。そして、アテ
ンション制御モジュールは、このプランニングに基づい
て、モータ制御モジュールの駆動モータを制御すること
により、ロボットの方向を対象である話者に向ける。こ
れにより、ロボットが対象である話者に対して正対する
ことにより、聴覚モジュールが当該話者の声を感度の高
い正面方向にてマイクにより正確に集音，定位すること
ができると共に、視覚モジュールが当該話者の画像をカ
メラにより良好に撮像することができるようになる。

【００１５】従って、このような聴覚モジュール，視覚
モジュール及びモータ制御モジュールと、アソシエーシ
ョンモジュール及びアテンション制御モジュールとの連
携によって、ロボットの聴覚及び視覚がそれぞれ有する
曖昧性が互いに補完されることになり、所謂ロバスト性
が向上し、複数の話者であっても、各話者をそれぞれ知
覚することができる。また、例えば聴覚イベントまたは
視覚イベントの何れか一方が欠落したときであっても、
視覚イベントまたは聴覚イベントのみに基づいて、対象
である話者をアソシエーションモジュールが知覚するこ
とができるので、リアルタイムにモータ制御モジュール
の制御を行なうことができる。

【００１６】前記アソシエーションモジュールが、聴覚
ストリーム及び視覚ストリームを生成する際に、聴覚イ
ベント，視覚イベント及びモータイベントを相互に同期
させる場合には、それぞれ非同期で生成された聴覚イベ
ント，視覚イベント及びモータイベントが互いに同期す
ることによって、アソシエーションモジュールでのこれ
らのイベントの互いに異なる生成周期及び遅延時間が吸
収されることになり、聴覚イベントから成る聴覚ストリ
ームと視覚イベントから成る視覚ストリームが互いに近
い距離に存在した場合には、相互に関連付けてより高次
のアソシエーションストリームを生成することができ
る。

【００１７】前記アソシエーションモジュールがサーバ
であって、前記聴覚モジュール，視覚モジュール及びモ
ータ制御モジュールがそれぞれサーバに接続されたクラ
イアントであり、さらに前記サーバと各クライアント
が、相互にＬＡＮ接続されている場合には、各モジュー
ルが、それぞれ互いにＬＡＮ接続されたサーバ及びクラ
イアントにより分散処理されることにより、高速にリア
ルタイム処理を行なうことができる。

【００１８】前記アテンション制御モジュールが、アテ
ンション制御を行なう際に、アソシエーションストリー
ム，聴覚ストリーム及び視覚ストリームの順に優先させ
る場合には、アソシエーションストリームを主体とし
て、聴覚ストリーム及び視覚ストリームを補助的に参照
して、対象である話者に対するアテンション制御を行な
うことにより、例えば対象である話者の視覚イベントを
取得することができず、視覚ストリームが生成されない
ときでも、連続的に聴覚イベントを取得して聴覚ストリ
ームを生成することができるので、聴覚ストリームに基
づいてアテンション制御を行なうことにより、連続した
リアルタイム処理を行なうことができる。さらに、複数
の同種類のストリームが存在する場合には、状況に応じ
て、最も古いストリームを優先したり、最も新しいスト
リームを優先することができる。

【００１９】

【発明の実施の形態】以下、図面に示した実施形態に基
づいて、この発明を詳細に説明する。図１乃至図４はこ
の発明によるロボット視聴覚システムの一実施形態を備
えた実験用の人型ロボットの全体構成を示している。図
１において、人型ロボット１０は、４ＤＯＦ（自由度）
のロボットとして構成されており、ベース１１と、ベー
ス１１上にて一軸（垂直軸）周りに回動可能に支持され
た胴体部１２と、胴体部１２上にて、三軸方向（垂直
軸，左右方向の水平軸及び前後方向の水平軸）の周りに
揺動可能に支持された頭部１３と、を含んでいる。

【００２０】前記ベース１１は固定配置されていてもよ
く、脚部として動作可能としてもよい。また、ベース１
１は、移動可能な台車等の上に載置されていてもよい。
前記胴体部１２は、ベース１１に対して垂直軸の周り
に、図１にて矢印Ａで示すように回動可能に支持されて
おり、図示しない駆動手段によって回転駆動されると共
に、図示の場合、防音性の外装によって覆われている。

【００２１】前記頭部１３は胴体部１２に対して連結部
材１３ａを介して支持されており、この連結部材１３ａ
に対して前後方向の水平軸の周りに、図１にて矢印Ｂで
示すように揺動可能に、また左右方向の水平軸の周り
に、図２にて矢印Ｃで示すように揺動可能に支持されて
いると共に、前記連結部材１３ａが、胴体部１２に対し
てさらに前後方向の水平軸の周りに、図１にて矢印Ｄで
示すように揺動可能に支持されており、それぞれ図示し
ない駆動手段によって、各矢印Ａ，Ｂ，Ｃ，Ｄ方向に回
転駆動される。

【００２２】ここで、前記頭部１３は、図３に示すよう
に全体が防音性の外装１４により覆われていると共に、
前側にロボット視覚を担当する視覚装置としてのカメラ
１５を、また両側にロボット聴覚を担当する聴覚装置と
しての一対のマイク１６（１６ａ，１６ｂ）を備えてい
る。

【００２３】前記外装１４は、例えばウレタン樹脂等の
吸音性の合成樹脂から構成されており、頭部１３の内部
をほぼ完全に密閉することにより、頭部１３の内部の遮
音を行なうように構成されている。尚、胴体部１２の外
装も、同様にして吸音性の合成樹脂から構成されてい
る。前記カメラ１５は公知の構成であって、例えば所謂
パン，チルト，ズームの３ＤＯＦ（自由度）を有する市
販のカメラが適用され得る。

【００２４】前記マイク１６は、それぞれ頭部１３の側
面において、前方に向かって指向性を有するように取り
付けられている。ここで、マイク１６の左右の各マイク
１６ａ，１６ｂは、それぞれ図１及び図２に示すよう
に、外装１４の両側にて前方に向いた段部１４ａ，１４
ｂにて、内側に取り付けられ、段部１４ａ，１４ｂに設
けられた貫通穴を通して、前方の音を集音すると共に、
外装１４の内部の音を拾わないように、適宜の手段によ
り遮音されている。これにより、マイク１６ａ，１６ｂ
は、所謂バイノーラルマイクとして構成されている。
尚、マイク１６ａ，１６ｂの取付位置の近傍において、
外装１４は人間の外耳形状に形成されていてもよい。

【００２５】図４は、前記マイク１６及びカメラ１５を
含むロボット視聴覚システムの電気的構成を示してい
る。図４において、視聴覚システム１７は、パーティ受
付及びコンパニオン用ロボットとしての構成であり、聴
覚モジュール２０，視覚モジュール３０，モータ制御モ
ジュール４０，対話モジュール５０及びアソシエーショ
ンモジュール６０から構成されている。以下、図４の各
部を拡大して示す図５〜図９をも参照しつつさらに説明
する。説明の便宜上、聴覚モジュール２０をブロック１
として図５に拡大して示し、視覚モジュール３０をブロ
ック２として図６に拡大して示し、モータ制御モジュー
ル４０をブロック３として図７に拡大して示し、対話モ
ジュール５０をブロック４として図８に拡大して示し、
さらに、アソシエーションモジュール６０をブロック５
として図９に拡大して示す。ここで、アソシエーション
モジュール６０（ブロック５、図９）はサーバから構成
されていると共に、他のモジュール、即ち聴覚モジュー
ル２０（ブロック１、図５），視覚モジュール３０（ブ
ロック２、図６），モータ制御モジュール４０（ブロッ
ク３、図７），対話モジュール５０（ブロック４、図
８）は、それぞれクライアントから構成されており、互
いに非同期で動作する。

【００２６】尚、前記サーバ及び各クライアントは、例
えばパーソナルコンピュータにより構成されており、例
えば１００Ｂａｓｅ−Ｔ等のネットワーク７０を介し
て、例えばＴＣＰ／ＩＰプロトコルにより、相互にＬＡ
Ｎ接続されている。また、各モジュール２０，３０，４
０，５０，６０は、それぞれ階層的に分散して、具体的
には下位から順次にデバイス層，プロセス層，特徴層，
イベント層から構成されている。

【００２７】図５に示すように、前記聴覚モジュール２
０は、デバイス層としてのマイク１６と、プロセス層と
してのピーク抽出部２１，音源定位部２２，音源分離部
２３と、特徴層（データ）としてのピッチ２４，水平方
向２５と、イベント層としての聴覚イベント生成部２６
及びビューア２７と、から構成されている。

【００２８】これにより、聴覚モジュール２０は、マイ
ク１６からの音響信号に基づいて、ピーク抽出部２１に
より左右のチャンネル毎に一連のピークを抽出して、左
右のチャンネルで同じか類似のピークをペアとする。こ
こで、ピーク抽出は、パワーがしきい値以上で且つ極大
値であって、例えば９０Ｈｚ乃至３ｋＨｚの間の周波数
であるという条件のデータのみを透過させる帯域フィル
タを使用することにより行なわれる。このしきい値は、
周囲の暗騒音を計測して、さらに感度パラメータ、例え
ば１０ｄＢを加えた値として定義される。

【００２９】そして、聴覚モジュール２０は、各ピーク
が調波構造を有していることを利用して、左右のチャン
ネル間でより正確なピークのペアを見つけ、左右のチャ
ンネルのピークの各ペアについて、音源分離部２３によ
り、逆ＦＦＴ（高速フーリエ変換）を適用して、各音源
からの混合音から調波構造を有する音を分離する。これ
により、聴覚モジュール２０は、分離した各音につい
て、音源定位部２２により、左右のチャンネルから同じ
周波数の音響信号を選択して、例えば５度毎にＩＰＤ
（両耳間位相差）及びＩＩＤ（両耳間強度差）を求め
る。

【００３０】そして、聴覚モジュール２０の音源定位部
２２は、所謂聴覚エピポーラ幾何を利用して、ロボット
１０の正面を０度として±９０度の範囲で、仮説推論に
よるＩＰＤＰｈの仮説を生成して、

【数１】により分離した音と各仮説間の距離ｄ（θ）を計算す
る。ここで、ｎ_f＜１．５ｋＨｚは、周波数が１．５ｋ
Ｈｚ以下である倍音である。これは、左右のマイク１５
のベースラインからＩＰＤが１．２乃至１．５ｋＨｚ以
下の周波数に対して有効であるので、今回の実験では
１．５ｋＨｚ以下としたものである。

【００３１】ＩＩＤについては、ＩＰＤと同様に、分離
した音の各倍音の左右チャンネル間のパワー差から求め
られる。ただし、ＩＩＤについては、仮説推論ではな
く、

【数２】による判別関数を用いて、音源が左右何れかを判定する
ものとする。即ち、周波数ｆの各倍音のＩＩＤをＩ
_s（ｆ）としたとき、音源は、Ｉが正であればロボット
の左方向に、Ｉが負であれば右方向に、そしてほぼ０で
あれば正面方向に存在することになる。ここで、ＩＩＤ
の仮説生成には、ロボット１０の頭部形状を考慮した膨
大な計算が必要となることから、リアルタイム処理を考
慮して、ＩＰＤと同様の仮説推論は行なわない。

【００３２】そして、聴覚モジュール２０の音源定位部
２２は、前記距離ｄ（θ）から、確立密度関数

【数３】を利用して、ＩＰＤの確信度ＢＦ_IPD（θ）を計算す
る。ここで、ｍ，ｓは、それぞれｄ（θ）の平均と分散
であり、ｎはｄの個数である。また、ＩＩＤの確信度Ｂ
Ｆ_IID（θ）は、３０度＜θ≦９０度で、前記Ｉが＋の
とき０．３５，−のとき０．６５、−３０度＜θ≦３０
度で、前記Ｉが＋のとき０．５，−のとき０．５、−９
０度≦θ＜−３０度で、前記Ｉが＋のとき０．６５，−
のとき０．３５となる。

【００３３】そして、このようにして得られたＩＰＤの
確信度ＢＦ_IPD（θ）及びＩＩＤの確信度ＢＦ
_IID（θ）を、

【数４】で示されるＤｅｍｐｓｔｅｒ−Ｓｈａｆｅｒ理論により
統合して、確信度ＢＦ_IP _D+IID（θ）を生成する。これ
により、聴覚モジュール２０は、聴覚イベント生成部２
６により、音源方向として尤度の高い順に上位２０個の
確信度ＢＦ_IPD+IID（θ）と方向（θ）のリストと、ピ
ッチにより、聴覚イベント２８を生成する。

【００３４】このようにして、聴覚モジュール２０は、
マイク１６からの音響信号に基づいて、ピッチ抽出，音
源の分離及び定位から、少なくとも一人の話者の音源を
同定して、その聴覚イベントを抽出し、ネットワーク７
０を介してアソシエーションモジュール６０に対して送
信するようになっている。尚、聴覚モジュール２０にお
ける上述した処理は、４０ｍ秒毎に行なわれる。

【００３５】ビューア２７は、このようにして生成され
た聴覚イベント２８をクライアントの画面上に表示する
ものであり、具体的には図１１（Ａ）に示すように、左
側のウインドウに、聴覚イベント２８のパワースペクト
ルと抽出したピークを、右側のウインドウに、縦軸を相
対的な方位角，横軸をピッチ（周波数）とする聴覚イベ
ントを表示する。ここで、聴覚イベントは、音源定位の
確信度を円の直径とする円により表現されている。

【００３６】図６に示すように、前記視覚モジュール３
０は、デバイス層としてのカメラ１５と、プロセス層と
しての顔発見部３１，顔識別部３２，顔定位部３３と、
特徴層（データ）としての顔ＩＤ３４，顔方向３５と、
イベント層としての視覚イベント生成部３６及びビュー
ア３７と、から構成されている。

【００３７】これにより、視覚モジュール３０は、カメ
ラからの画像信号に基づいて、顔発見部３１により例え
ば肌色抽出により各話者の顔を検出し、顔識別部３２に
て前もって登録されている顔データベース３８により検
索して、一致した顔があった場合、その顔ＩＤ３４を決
定して当該顔を識別すると共に、顔定位部３３により当
該顔方向３５を決定（定位）する。尚、顔識別部３２に
よる顔データベース３８の検索の結果、一致した顔がな
かった場合には、顔学習部３８ａが、顔発見部３１が検
出した顔を顔データベース３８に登録する。

【００３８】ここで、視覚モジュール３０は、顔発見部
３１が画像信号から複数の顔を見つけた場合、各顔につ
いて前記処理、即ち識別及び定位そして追跡を行なう。
その際、顔発見部３１により検出された顔の大きさ，方
向及び明るさがしばしば変化するので、顔発見部３１
は、顔領域検出を行なって、肌色抽出と相関演算に基づ
くパターンマッチングの組合せによって、２００ｍ秒以
内に複数の顔を正確に検出できるようになっている。

【００３９】また、顔識別部３２は、顔発見部３１によ
り検出された各顔領域画像を、判別空間に射影し、顔デ
ータベース３８に前もって登録された顔データとの距離
ｄを計算する。この距離ｄは、登録顔数（Ｌ）に依存す
るので、

【数５】により、パラメータの依存しない確信度Ｐｖに変換され
る。ここで、判別空間の基底となる判別行列は、公知の
オンラインＬＤＡにより、通常のＬＤＡと比較して少な
い計算により更新され得るので、リアルタイムに顔デー
タを登録することが可能である。

【００４０】顔定位部３３は、二次元の画像平面におけ
る顔位置を三次元空間に変換し、顔が画像平面にて
（ｘ，ｙ）に位置する幅と高さがそれぞれＸ及びＹであ
るｗ×ｗピクセルであるとすると、三次元空間における
顔位置は、以下の各式で与えられる方位角θ，高さφ及
び距離ｒのセットとして得られる。

【数６】

【数７】

【数８】ここで、Ｃ₁及びＣ₂は、探索画像サイズ（Ｘ，Ｙ）と
カメラの画角そして実際の顔の大きさにより定義される
定数である。

【００４１】そして、視覚モジュール３０は、各顔毎
に、顔ＩＤ（名前）３４及び顔方向３５から、視覚イベ
ント生成部３６により視覚イベント３９を生成する。詳
細には、視覚イベント３９は、各顔毎に、上位５つの確
信度付きの顔ＩＤ（名前）３４と位置（距離ｒ，水平角
度θ及び垂直角度φ）から構成されている。

【００４２】尚、ビューア３７は、視覚イベントをクラ
イアントの画面上に表示するものであり、具体的には、
図１１（Ｂ）に示すように、カメラ１５による画像と、
顔識別の確信度付きで抽出した顔の顔ＩＤと、定位の結
果である位置のリストを表示する。ここで、カメラ１５
による画像には、発見し同定された顔が長方形の枠で囲
まれて表示されている。複数の顔が発見された場合に
は、各顔について、それぞれ同定を示す長方形の枠と、
定位の結果としてのリストが表示される。

【００４３】図７に示すように、前記モータ制御モジュ
ール４０は、デバイス層としてのモータ４１及びポテン
ショメータ４２と、プロセス層としてのＰＷＭ制御回路
４３，ＡＤ変換回路４４及びモータ制御部４５と、特徴
層としてのロボット方向４６と、イベント層としてのモ
ータイベント生成部４７と、ビューア４８と、から構成
されている。

【００４４】これにより、モータ制御モジュール４０
は、アテンション制御モジュール６４（後述）からの指
令に基づいてモータ制御部４５によりＰＷＭ制御回路４
３を介してモータ４１を駆動制御すると共に、モータ４
１の回転位置をポテンショメータ４２により検出して、
ＡＤ変換回路４４を介してモータ制御部４５によりロボ
ット方向４６を抽出し、モータイベント生成部４７によ
りモータ方向情報から成るモータイベント４９を生成す
る。

【００４５】なお、ビューア４８は、モータイベントを
クライアントの画面上に三次元的に表示するものであっ
て、具体的には図１２（Ａ）に示すように、モータイベ
ント４９によるロボットの向きと動作速度を、例えばＯ
ｐｅｎＧＬにより実装されている三次元ビューアを利用
して、リアルタイムに三次元表示するようになってい
る。

【００４６】図８に示すように、前記対話モジュール５
０は、デバイス層としてのスピーカ５１及びマイク１６
と、プロセス層としての音声合成回路５２，対話制御回
路５３及び自声抑制回路５４，音声認識回路５５と、か
ら構成されている。

【００４７】これにより、対話モジュール５０は、後述
するアソシエーションモジュール６０により対話制御回
路５３を制御し、音声合成回路５２によりスピーカ５１
を駆動することによって、対象とする話者に対して所定
の音声を発すると共に、マイク１６からの音響信号から
自声抑制回路５４によりスピーカ５１からの音を除去し
た後、音声認識回路５５により対象とする話者の音声を
認識する。なお、前記対話モジュール５０は、階層とし
ての特徴層及びイベント層を備えていない。

【００４８】ここで、対話制御回路５３は、例えばパー
ティ受付ロボットの場合には、現在のアテンションを継
続することが最優先となるが、パーティロボットの場合
には、最も最近に関連付けられたストリームに対して、
アテンション制御される。

【００４９】図９に示すように、前記アソシエーション
モジュール６０は、上述した聴覚モジュール２０，視覚
モジュール３０，モータ制御モジュール４０，対話モジ
ュール５０に対して、階層的に上位に位置付けられてお
り、各モジュール２０，３０，４０，５０のイベント層
の上位であるストリーム層を構成している。具体的に
は、前記アソシエーションモジュール６０は、聴覚モジ
ュール２０，視覚モジュール３０及びモータ制御モジュ
ール４０からの非同期イベント６１ａ即ち聴覚イベント
２８，視覚イベント３９及びモータイベント４９を同期
させて同期イベント６１ｂにする同期回路６２と、これ
らの同期イベント６１ｂを相互に関連付けて、聴覚スト
リーム６５，視覚ストリーム６６及びアソシエーション
ストリーム６７を生成するストリーム生成部６３と、さ
らにアテンション制御モジュール６４と、ビューア６８
を備えている。

【００５０】前記同期回路６２は、聴覚モジュール２０
からの聴覚イベント２８，視覚モジュール３０からの視
覚イベント３８及びモータ制御モジュール４０からのモ
ータイベント４９を同期させて、同期聴覚イベント，同
期視覚イベント及び同期モータイベントを生成する。そ
の際、聴覚イベント２８及び視覚イベント３８は、同期
モータイベントによって、その座標系が絶対座標系に変
換されることになる。

【００５１】ここで、各イベントの実際に観測されてか
らネットワーク７０を介してアソシエーションモジュー
ル６０に到着するまでの遅延時間は、例えば聴覚イベン
ト２８では４０ｍ秒、視覚イベント３９では２００ｍ
秒、モータイベント４９では１００ｍであり、ネットワ
ーク７０における遅延が１０乃至２００ｍ秒であり、さ
らに到着周期も異なることによるものである。従って、
各イベントの同期を取るために、聴覚モジュール２０，
視覚モジュール３０及びモータ制御モジュール４０から
の聴覚イベント２８，視覚イベント３９及びモータイベ
ント４９は、それぞれ実際の観測時間を示すタイムスタ
ンプ情報を備えており、図示しない短期記憶回路にて、
例えば２秒間の間だけ一旦記憶される。

【００５２】そして、同期回路６２は、短期記憶回路に
記憶された各イベントを、上述した遅延時間を考慮し
て、実際の観測時間と比較して５００ｍ秒の遅延時間を
備えるように、同期プロセスにより取り出す。これによ
り、同期回路６２の応答時間は５００ｍ秒となる。ま
た、このような同期プロセスは例えば１００ｍ秒周期で
動作するようになっている。尚、各イベントは、それぞ
れ互いに非同期でアソシエーションモジュール６０に到
着するので、同期を取るための観測時刻と同時刻のイベ
ントが存在するとは限らない。従って、同期プロセス
は、同期を取るための観測時刻前後に発生したイベント
に対して、線形補間による補間を行なうようになってい
る。

【００５３】また、ストリーム生成部６３は、以下の点
に基づいて、ストリーム６５，６６，６７の生成を行な
う。１．聴覚イベント２８は、同等または倍音関係にある
ピッチを備え、方向が±１０度以内で最も近い聴覚スト
リーム６５に接続される。尚、±１０度以内の値は、聴
覚エピポーラ幾何の精度を考慮して選定されたもので
あ。２．視覚イベント３９は、共通の顔ＩＤ３４を有し且
つ４０ｃｍの範囲内で最も近い視覚ストリーム６６に接
続される。尚、４０ｃｍの範囲内の値は、秒速４ｍ以上
で人間が移動することがないということを前提として選
定されたものである。３．すべてのストリームに対して探索を行なった結
果、接続可能なストリーム６５，６６が存在しないイベ
ントがある場合には、当該イベント２８，３９は、新た
なストリーム６５，６６を構成することになる。５．既に存在しているストリーム６５，６６は、これ
らに接続されるイベント２８，３９がない場合には、最
大で５００ｍ秒間は存続するが、その後もイベントが接
続されない状態が継続すると、消滅する。６．聴覚ストリーム６５と視覚ストリーム６６が±１
０度以内に近接する状態が１秒間のうち５００ｍ秒以上
継続する場合、これの聴覚ストリーム６５と視覚ストリ
ーム６６は、同一話者に由来するものであるとみなさ
れ、互いに関係付けられて、アソシエーションストリー
ム６７が生成される。７．アソシエーションストリーム６７は、聴覚イベン
ト２８または視覚イベント３９が３秒間以上接続されな
い場合には、関係付けが解除され、既存の聴覚ストリー
ム６５または視覚ストリーム６６のみが存続する。８．アソシエーションストリーム６７は、聴覚ストリ
ーム６５及び視覚ストリーム６６の方向差が３秒間、±
３０度以上になった場合には、関係付けが解除され、個
々の聴覚ストリーム６５及び視覚ストリーム６６に戻
る。

【００５４】これにより、ストリーム生成部６３は、同
期回路６２からの同期聴覚イベント及び同期視覚イベン
トに基づいて、これらの時間的つながりを考慮してイベ
ントを接続することにより、聴覚ストリーム６５及び視
覚ストリーム６６を生成すると共に、相互の結び付きの
強い聴覚ストリーム６５及び視覚ストリーム６６を関係
付けて、アソシエーションストリーム６７を生成するよ
うになっており、逆にアソシエーションストリーム６７
を構成する聴覚ストリーム６５及び視覚ストリーム６６
の結び付きが弱くなれば、関係付けを解除するようにな
っている。

【００５５】また、アテンション制御モジュール６４
は、モータ制御モジュール４０の駆動モータ制御のプラ
ンニングのためのアテンション制御を行なうものであ
り、その際アソシエーションストリーム６７，聴覚スト
リーム６５そして視覚ストリーム６６の順に優先的に参
照して、アテンション制御を行なう。そして、アテンシ
ョン制御モジュール６４は、聴覚ストリーム６５及び視
覚ストリーム６６の状態とアソシエーションストリーム
６７の存否に基づいて、ロボット１０の動作プランニン
グを行ない、駆動モータ４１の動作の必要があれば、モ
ータ制御モジュール４０に対して動作指令としてのモー
タイベントをネットワーク７０を介して送信する。

【００５６】ここで、アテンション制御モジュール６４
におけるアテンション制御は、連続性とトリガに基づい
ており、連続性により同じ状態を保持しようとし、トリ
ガにより最も興味のある対象を追跡しようとする。従っ
て、アテンション制御は、１．アソシエーションストリームの存在は、ロボット
１０に対して正対して話している人が現在も存在してい
る、あるいは近い過去に存在していたことを示している
ので、このようなロボット１０に対して話している人に
対して、高い優先度でアテンションを向けて、トラッキ
ングを行なう必要がある。２．マイク１６は無指向性であるので、カメラの視野
角のような検出範囲が存在せず、広範囲の聴覚情報を得
ることができるので、視覚ストリームより聴覚ストリー
ムの優先度を高くすべきである。という二つの点を考慮
して、以下の原則に従ってアテンションを向けるストリ
ームを選択して、トラッキングを行なう。１．アソシエーションストリームのトラッキングを最
優先する。２．アソシエーションストリームが存在しない場合、
聴覚ストリームのトラッキングを優先する。３．アソシエーションストリーム及び聴覚ストリーム
が存在しない場合、視覚ストリームのトラッキングを優
先する。４．複数の同じ種類のストリームが存在する場合、最
も古いストリームのトラッキングを優先する。このようにして、アテンション制御モジュール６４は、
アテンション制御を行なって、モータ制御モジュール４
０の駆動モータ４１の制御のプランニングを行ない、こ
のプランニングに基づいて、モータコマンド６６を生成
し、ネットワーク７０を介してモータ制御モジュール４
０に伝送する。これにより、モータ制御モジュール４０
では、このモータコマンド６６に基づいて、モータ制御
部４５がＰＷＭ制御を行なって、駆動モータ４１を回転
駆動させて、ロボット１０を所定方向に向けるようにな
っている。

【００５７】尚、ビューア６８は、このようにして生成
された各ストリームをサーバの画面上に表示するもので
あり、具体的には図１２（Ｂ）に示すように、レーダチ
ャート及びストリームチャートにより表示する。ここ
で、レーダチャートは、その瞬間におけるストリームの
状態、より詳細にはカメラの視野角と音源方向を示し、
ストリームチャートは、アソシエーションストリーム
（太線図示）と聴覚ストリーム及び視覚ストリーム（細
線図示）を示している。

【００５８】本発明実施形態による人型ロボット１０は
以上のように構成されており、パーティ受付ロボットと
して対象とする話者に対して、図１０を参照して、以下
のように動作する。先づ、図１０（Ａ）に示すように、
ロボット１０は、パーティ会場の入口前に配置されてい
る。そして、図１０（Ｂ）に示すように、パーティ参加
者Ｐがロボット１０に接近してくるが、ロボット１０
は、まだ当該参加者Ｐを認識していない。ここで、参加
者Ｐがロボット１０に対して例えば「こんにちは」と話
し掛けると、ロボット１０は、マイク１６が当該参加者
Ｐの音声を拾って、聴覚モジュール２０が音源方向を伴
う聴覚イベント２８を生成して、ネットワーク７０を介
してアソシエーションモジュール６０に伝送する。

【００５９】これにより、アソシエーションモジュール
６０は、この聴覚イベント２８に基づいて聴覚ストリー
ム２９を生成する。このとき、視覚モジュール３０は参
加者Ｐがカメラ１５の視野内に入っていないので、視覚
イベント３９を生成しない。従って、アソシエーション
モジュール６０は、聴覚イベント２８のみに基づいて、
聴覚ストリーム２９を生成し、アテンション制御モジュ
ール６４は、この聴覚ストリーム２９をトリガーとし
て、ロボット１０を参加者Ｐの方向に向けるようなアテ
ンション制御を行なう。

【００６０】このようにして、図１０（Ｃ）に示すよう
に、ロボット１０が参加者Ｐの方向を向き、所謂声によ
るトラッキングが行なわれる。そして、視覚モジュール
３０がカメラ１５による参加者Ｐの顔の画像を取り込ん
で、視覚イベント３９を生成して、当該参加者Ｐの顔を
顔データベース３８により検索し、顔識別を行なうと共
に、その結果である顔ＩＤ２４及び画像をネットワーク
７０を介してアソシエーションモジュール６０に伝送す
る。尚、当該参加者Ｐの顔が顔データベース３８に登録
されていない場合には、視覚モジュール３０は、その旨
をネットワーク７０を介してアソシエーションモジュー
ルに伝送する。

【００６１】このとき、ロボット１０は、聴覚イベント
２８及び視覚イベント３９によりアソシエーションスト
リーム６５を生成しており、このアソシエーションスト
リーム６５によりアテンション制御モジュール６４は、
そのアテンション制御を変更しないので、ロボット１０
は、参加者Ｐの方向を向き続ける。従って、参加者Ｐが
移動したとしても、ロボット１０は、アソシエーション
ストリーム６５によりモータ制御モジュール４０を制御
することにより、参加者Ｐを追跡して、視覚モジュール
３０のカメラ１５が参加者Ｐを継続して撮像し得るよう
になっている。

【００６２】そして、アソシエーションモジュール６０
は、聴覚モジュール２０の音声認識回路５５に入力を与
えて、音声認識回路５５はその音声認識結果を対話制御
回路５３に与える。これにより、対話制御回路５３は音
声合成を行なってスピーカ５１から発声する。このと
き、音声認識回路５５がマイク１６からの音響信号から
スピーカ５１からの音を自声抑制回路５４により低減す
ることにより、ロボット１０は自身の発声を無視して、
相手の声をより正確に認識することができる。

【００６３】ここで、音声合成による発声は、参加者Ｐ
の顔が前記顔データベース３８に登録されているか否か
で異なる。参加者Ｐの顔が顔データベース３８に登録さ
れている場合には、アソシエーションモジュール６０
は、視覚モジュール３０からの顔ＩＤ２４に基づいて、
対話モジュール５０を制御して、音声合成により「こん
にちは。ＸＸＸさんですか？」と参加者Ｐに対して質問
する。これに対して、参加者Ｐが「はい。」と答える
と、対話モジュール５０がマイク１６からの音響信号に
基づいて、音声認識回路５５により「はい」を認識して
対話制御回路５３により音声合成を行ない、スピーカ５
１から「ようこそＸＸＸさん、どうぞ部屋にお入り下さ
い。」と発声する。

【００６４】また、参加者Ｐの顔が顔データベース３８
に登録されていない場合には、アソシエーションモジュ
ール６０は、対話モジュール５０を制御して、音声合成
により「こんにちは。あなたのお名前を教えていただけ
ますか？」と参加者Ｐに対して質問する。これに対し
て、参加者Ｐが「ＸＸＸです。」と自分の名前を答える
と、対話モジュール５０がマイク１６からの音響信号に
基づいて、音声認識回路５５により「ＸＸＸ」を認識し
て、対話制御回路５３により音声合成を行ない、スピー
カ５１から「ようこそＸＸＸさん、どうぞ部屋にお入り
下さい。」と発声する。このようにして、図１０（Ｄ）
に示すようにロボット１０は、参加者Ｐの認識を行なっ
て、パーティ会場への入場を誘導すると共に、視覚モジ
ュール３０で当該参加者Ｐの顔の画像と名前「ＸＸＸ」
を顔データベース３８に登録させる。

【００６５】また、人型ロボット１０はパーティロボッ
トとして以下のように動作する。この場合、人型ロボッ
ト１０は、聴覚モジュール２０による聴覚イベント２８
及び視覚モジュール３０による視覚イベント３９と、ア
ソシエーションモジュール６０によるアソシエーション
ストリーム６５に基づいて、複数の話者を聴覚及び視覚
により認識していると共に、複数の話者のうちの一人の
話者を追跡したり、あるいは途中で他の話者に切り換え
て追跡することができる。尚、パーティロボットの場合
には、ロボット１０は、受動的な役割を果たす、即ちパ
ーティ参加者の「話を聴き」、あるいは「話者を見る」
のみであり、対話モジュール５０により発声することは
ない。

【００６６】また、パーティロボットとしての人型ロボ
ット１０は、パーティ受付ロボットと顔データベース３
８を共用し、あるいはパーティ受付ロボットの顔データ
ベース３８が転送または複写されるようにしてもよい。
この場合、パーティロボットとしての人型ロボット１０
は、パーティ参加者全員を常に顔識別によって認識する
ことができる。

【００６７】このようにして、本発明実施形態による人
型ロボット１０によれば、聴覚モジュール２０及び視覚
モジュール３０からの聴覚イベント及び視覚イベントに
基づいて、アソシエーションモジュール６０が聴覚スト
リーム，視覚ストリームそしてアソシエーションストリ
ームを生成することによって、複数の対象である話者を
認識しているので、何れかのイベントが欠落したり明確
に認識できなくなった場合、例えば話者が移動して「見
えなく」なった場合でも聴覚により、また話者が話をせ
ず「聞こえなく」なった場合でも視覚により、リアルタ
イムに複数の話者を聴覚的及び／又は視覚的にトラッキ
ングすることができる。

【００６８】上述した実施形態において、人型ロボット
１０は、４ＤＯＦ（自由度）を有するように構成されて
いるが、これに限らず、任意の動作を行なうように構成
されたロボットに本発明によるロボット聴覚システムを
組み込むことも可能である。また、上述した実施形態に
おいては、本発明によるロボット視聴覚システムを人型
ロボット１０に組み込んだ場合について説明したが、こ
れに限らず、犬型等の各種動物型ロボットや、その他の
形式のロボットに組み込むことも可能であることは明ら
かである。さらに、上述した実施形態においては、アテ
ンション制御の際に、複数の同じ種類のストリームが存
在する場合、最も古いストリームのトラッキングを優先
するようになっているが、これに限らず、他のストリー
ム、例えば最も新しいストリームのトラッキングを優先
させるようにしてもよい。

【００６９】

【発明の効果】以上述べたように、この発明によれば、
聴覚モジュールが、マイクが集音した外部の対象からの
音から、調波構造を利用してピッチ抽出を行なうことに
より、音源毎の方向を得て、個々の話者の音源を同定し
て、その聴覚イベントを抽出する。また、視覚モジュー
ルが、カメラにより撮像された画像から、パターン認識
による話者の顔識別と定位から、個々の話者の視覚イベ
ントを抽出する。さらに、モータ制御モジュールが、ロ
ボットを水平方向に回動させる駆動モータの回転位置に
基づいて、ロボットの方向を検出することによって、モ
ータイベントを抽出する。

【００７０】ここで、アソシエーションモジュールは、
このようにしてそれぞれ抽出された聴覚イベント，視覚
イベント及びモータイベントに基づいて、各話者の聴覚
ストリーム及び視覚ストリームを生成し、さらにこれら
のストリームを関連付けてアソシエーションストリーム
を生成して、これらのストリームに基づいてアテンショ
ン制御を行なうことにより、モータ制御モジュールの駆
動モータ制御のプランニングを行なう。そして、アテン
ション制御モジュールは、このプランニングに基づいて
モータ制御モジュールの駆動モータを制御することによ
り、ロボットの方向を対象である話者に向ける。これに
より、ロボットが対象である話者に対して正対すること
により、聴覚モジュールが当該話者の声を、感度の高い
正面方向にてマイクにより正確に集音，定位することが
できる共に、視覚モジュールが当該話者の画像をカメラ
により良好に撮像することができるようになる。

【００７１】従って、このような聴覚モジュール，視覚
モジュール及びモータ制御モジュールと、アソシエーシ
ョンモジュール及びアテンション制御モジュールとの連
携によって、ロボットの聴覚及び視覚がそれぞれ有する
曖昧性が互いに補完されることになり、所謂ロバスト性
が向上し、複数の話者であっても、各話者をそれぞれ知
覚することができる。また、例えば聴覚イベントまたは
視覚イベントの何れか一方が欠落したときであっても、
視覚イベントまたは聴覚イベントのみに基づいて、対象
である話者をアテンション制御が追跡することができる
ので、リアルタイムにモータ制御モジュールの制御を行
なうことができる。さらに、イベント及びストリームと
いうシンボリックな情報を扱うことによって、より高次
な処理を実現することができると共に、ネットワークを
介して伝送されるデータ量が抑制されることにより、通
信のトラフィックが軽くなるので、視聴覚システム全体
やビューアにおけるリアルタイム処理に寄与する。これ
により、本発明によれば、対象に対する視覚及び聴覚の
追跡を行なうためのリアルタイム処理を可能にするよう
にした、極めて優れたロボット視聴覚システムが提供さ
れる。

【図面の簡単な説明】

【図１】この発明によるロボット聴覚装置の第一の実施
形態を組み込んだ人型ロボットの外観を示す正面図であ
る。

【図２】図１の人型ロボットの側面図である。

【図３】図１の人型ロボットにおける頭部の構成を示す
概略拡大図である。

【図４】図１の人型ロボットにおけるロボット視聴覚シ
ステムの電気的構成を示すブロック図である。

【図５】図４におけるブロック１の聴覚モジュールを拡
大して示す電気的構成のブロック図である。

【図６】図４におけるブロック２の視覚モジュールを拡
大して示す電気的構成のブロック図である。

【図７】図４におけるブロック３のモータ制御モジュー
ルを拡大して示す電気的構成のブロック図である。

【図８】図４におけるブロック４の対話モジュールを拡
大して示す電気的構成のブロック図である。

【図９】図４におけるブロック５のアソシエーションモ
ジュールを拡大して示す電気的構成のブロック図であ
る。

【図１０】図４のロボット視聴覚システムにおけるパー
ティ受付ロボットとしての動作例を示す図である。

【図１１】図４のロボット視聴覚システムにおける
（Ａ）聴覚モジュール，（Ｂ）視覚モジュールのビュー
アの画面例を示す図である。

【図１２】図４のロボット視聴覚システムにおける
（Ｃ）モータ制御モジュール，（Ｄ）アソシエーション
モジュールのビューアの画面例を示す図である。

【符号の説明】

１０人型ロボット１１ベース１２胴体部１３頭部１３ａ連結部材１４外装１５カメラ（ロボット視覚）１６，１６ａ，１６ｂマイク（ロボット聴覚）１７ロボット視聴覚システム２０聴覚モジュール３０視覚モジュール４０モータ制御モジュール５０対話モジュール６０アソシエーションモジュール６４アテンション制御モジュール７０ネットワーク

フロントページの続き (51)Int.Cl.⁷ 識別記号ＦＩテーマコート゛(参考）Ｇ１０Ｌ 15/00 Ｇ１０Ｌ 3/00 ５４５ＡＨ０４Ｎ 7/18 ５５１ＨＦターム(参考） 3C007 AS36 JS05 KS11 KS39 KT01 MT14 WA02 WA03 WB17 WB19 WC25 WC26 5B057 AA05 BA02 BA04 DA07 DB02 DB06 DB09 DC32 DC40 5C054 AA01 CC02 FC11 FF05 HA04 5D015 AA03

Claims

【特許請求の範囲】

【請求項１】外部の音を集音する少なくとも一対のマ
イクを含む聴覚モジュールと、ロボットの前方を撮像するカメラを含む視覚モジュール
と、ロボットを水平方向に回動させる駆動モータを含むモー
タ制御モジュールと、前記聴覚モジュール，視覚モジュール及びモータ制御モ
ジュールからのイベントを統合してストリームを生成す
るアソシエーションモジュールと、アソシエーションモジュールにより生成されたストリー
ムに基づいてアテンション制御を行なうアテンション制
御モジュールと、を備えているロボット視聴覚システム
であって、前記聴覚モジュールが、マイクからの音響信号に基づい
て、ピッチ抽出，音源の分離及び定位から、少なくとも
一人の話者の音源を同定して、その聴覚イベントを抽出
し、前記視覚モジュールが、カメラにより撮像された画像に
基づいて、各話者の顔識別と定位から、その視覚イベン
トを抽出し、前記モータ制御モジュールが、駆動モータの回転位置に
基づいて、モータイベントを抽出することにより、前記アソシエーションモジュールが、聴覚モジュールか
らの聴覚イベント，視覚モジュールからの視覚イベント
及びモータ制御モジュールからのモータイベントに基づ
いて、聴覚ストリーム及び視覚ストリームを生成し、さ
らにこれらを関連付けてアソシエーションストリームを
生成して、前記アテンション制御モジュールが、これらのストリー
ムに基づいてモータ制御モジュールの駆動モータ制御の
プランニングのためのアテンション制御を行なうことを
特徴とする、ロボット視聴覚システム。
【請求項２】外部の音を集音する少なくとも一対のマ
イクを含む聴覚モジュールと、ロボットの前方を撮像するカメラを含む視覚モジュール
と、ロボットを水平方向に回動させる駆動モータを含むモー
タ制御モジュールと、前記聴覚モジュール，視覚モジュール及びモータ制御モ
ジュールからのイベントを統合してストリームを生成す
るアソシエーションモジュールと、アソシエーションモジュールにより生成されたストリー
ムに基づいてアテンション制御を行なうアテンション制
御モジュールと、を備えている人型または動物型のロボ
ットの視聴覚システムであって、前記聴覚モジュールが、マイクからの音響信号に基づい
て、ピッチ抽出，音源の分離及び定位から、少なくとも
一人の話者の音源を同定して、その聴覚イベントを抽出
し、前記視覚モジュールが、カメラにより撮像された画像に
基づいて各話者の顔識別と定位からその視覚イベントを
抽出し、前記モータ制御モジュールが、駆動モータの回転位置に
基づいてモータイベントを抽出することにより、前記アソシエーションモジュールが、聴覚モジュールか
らの聴覚イベント，視覚モジュールからの視覚イベント
及びモータ制御モジュールからのモータイベントに基づ
いて、聴覚ストリーム及び視覚ストリームを生成して、
さらにこれらを関連付けてアソシエーションストリーム
を生成して、前記アテンション制御モジュールが、これらのストリー
ムに基づいてモータ制御モジュールの駆動モータ制御の
プランニングのためのアテンション制御を行なうことを
特徴とする、ロボット視聴覚システム。
【請求項３】前記アソシエーションモジュールが、聴
覚ストリーム及び視覚ストリームを生成する際に、非同
期に生成される聴覚イベント，視覚イベント及びモータ
イベントを相互に同期させることを特徴とする、請求項
１または２に記載のロボット視聴覚システム。
【請求項４】前記アソシエーションモジュールがサー
バであって、前記聴覚モジュール，視覚モジュール及び
モータ制御モジュールがそれぞれサーバに接続されたク
ライアントであることを特徴とする、請求項１から３の
何れかに記載のロボット視聴覚システム。
【請求項５】前記サーバと各クライアントが、相互に
ＬＡＮ接続されていることを特徴とする、請求項４に記
載のロボット視聴覚システム。
【請求項６】前記アテンション制御モジュールが、ア
テンション制御を行なう際に、アソシエーションストリ
ーム，聴覚ストリーム及び視覚ストリームの順に優先さ
せることを特徴とする、請求項１から５の何れかに記載
のロボット視聴覚システム。
【請求項７】前記アソシエーションモジュールが、聴
覚ストリーム及び視覚ストリームを生成する際に、聴覚
イベント，視覚イベント及びモータイベントを相互に同
期させることを特徴とする、請求項１から６の何れかに
記載のロボット視聴覚システム。