JPH01277297A - 音声認識装置 - Google Patents

音声認識装置

Info

Publication number
JPH01277297A
JPH01277297A JP63106221A JP10622188A JPH01277297A JP H01277297 A JPH01277297 A JP H01277297A JP 63106221 A JP63106221 A JP 63106221A JP 10622188 A JP10622188 A JP 10622188A JP H01277297 A JPH01277297 A JP H01277297A
Authority
JP
Japan
Prior art keywords
dictionary
axis
pattern
orthogonal
learning
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
JP63106221A
Other languages
English (en)
Inventor
Tsuneo Nitta
恒雄 新田
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Toshiba Corp
Original Assignee
Toshiba Corp
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Toshiba Corp filed Critical Toshiba Corp
Priority to JP63106221A priority Critical patent/JPH01277297A/ja
Publication of JPH01277297A publication Critical patent/JPH01277297A/ja
Pending legal-status Critical Current

Links

Abstract

(57)【要約】本公報は電子出願前の出願データであるた
め要約のデータは記録されません。

Description

【発明の詳細な説明】 [発明の目的] (産業上の利用分野) 本発明は特定のグループ構成員により共通に利用でき、
上記グループ構成員からの少ない学習パターンで高い認
識性能を得ることのできる音声認識装置に関する。
(従来の技術) 音声による情報の入出力は人間にとって自然性が高く、
マン・マシン・インターフェースとして優れており、従
来より種々研究されている。現在、実用化されている音
声認識装置の殆んどは単語音声を認識する方式のもので
、一般的にはtAB図に示すように構成されている。
この装置は発声人力された音声を電気信号に変換して取
込み、バンド・パス・フィルタ等からなる音響分析部l
にて音響分析し、始端・終端検出部2にてその単語音声
区間を検出する。そして入力音声の上記単語音声区間の
音響分析データ(特徴情報;音声パターン)と、標準パ
ターン辞書3に予め登録されている認識対象単語の各標
準パターンとの類似度や距離等をパターン・マツチング
部4にて計算し、その計算結果を判定部5にて判定して
、例えば類似度値の最も高い標準パターンのカテゴリ名
を前記入力音声に対する認識結果として求めるものとな
っている。
しかしこのようにパターンφマツチング法による音声認
識では入力音声パターンと予め登録されている標準パタ
ーンとの時間軸方向のずれ(パターン変形)が問題とな
る。そこで従来では、専ら線形伸縮や、動的計画法(D
 P)に代表される非線形伸縮等により、上述した時間
軸方向のずれに対する課題を解消している。
一方、このようなパターン型マツチング法とは別に、予
め収集された学習パターンから直交化辞書を作成し、こ
の直交化辞書を用いて音声認識する方式(部分空間法)
が提唱されている。この方式は第4図にその構成例を示
すように、音響分析されて音声区間検出された音声パタ
ーンから、標本点抽出部Bにて上記音声区間を等分割し
た所定点数の標本点を抽出し、(特徴ベクトルの数×標
本点数)で示される標本パターンを求める。このような
標本パターンを認識対象とするカテゴリ毎に所定数ずつ
収集してパターン蓄積部7に格納する。そしてグラム・
シュミット(GS)直交化部8において、上記パターン
蓄積部7に収集された所定数(3個以上)の標本パター
ンを用いて以下に示す手順で直交化辞書9を作成する。
即ち、上記直交化辞書9の作成は、各カテゴリ毎にその
カテゴリのm回目の学習パターンをaIIlとし、3回
発声された学習パターンを用いる場合には、 ■ 1回目の学習データa1を第1軸の辞書b1とし、 b1″″ai                 ・・
・(1)これを直交化辞書9に登録する。
■ 2回目の学習データa2からグラム−シュミットの
直交化式を用い、 なる計算を行い、++ b 211が一定値より大きい
場合、これを第2軸の辞書b2として前記直交化辞書9
に登録する。但し、(・)は内積、1111はノルムを
示す。
■ そして3回目の学習データa3から、なる計算を行
い、++ b a Itが一定値より大きい場合、これ
を第3軸の辞書b3として前記直交化辞書9に登録する
。但し、第2軸の辞書が求められていない場合には、上
記(2)式の計算を行う。
以上の■〜■の処理を各カテゴリについて繰返し実行し
て直交化辞書9を予め形成しておく。
類似度計算部IOは上述した如く作成された直交化辞書
9と、入力音声パターンXとの間でとして、カテゴリi
の直交化辞書b  との間の1、r 類似度を計算するもので、この類似度値に従って上記入
力音声パターンXが認識される。尚、上記カテゴリiの
直交化辞書b  は予め正規化され1、r たちのであり、K1はカテゴリiの辞書の個数(軸数)
を示している。
このようなGS直交化を用いることにより、その認識性
能の大幅な向上が図られている。また微分フィルタを用
いて時間軸方向および周波数方向の変動を吸収した直交
化辞書を作成し、更にその認識性能の向上を図ることも
試みられている。
ところがこの種の装置にあっては、専ら特定の話者に対
しての標準音声辞書を作成している。この為、別の話者
が上記音声認識装置を利用しようとする場合には、その
都度、音声辞書を変更する必要が生じた。そこで多数の
話者から数多くの学習パターンを収集して直交化辞書を
作成することが考えられているが、その辞書作成が徒に
複雑化し、認識性能の高い辞書を得ることが困難化する
等の不具合が生じた。
(発明が解決しようとする問題点) このように従来の直交化辞書を用いた部分空間法による
音声認識にあっては、複数の話者から収集された学習パ
ターンから如何にして性能の高い直交化辞書を効率良く
作成するかと云う点で課題が残されている。また直交化
辞書の作成に必要な複数の話者の学習パターンを如何に
して効率良く収集し、直交化辞書を作成するかと云う点
でも問題があった。
本発明はこのような事情を考慮してなされたもので、そ
の目的とするところは、複数の話者から収集される少な
い学習パターンにて認識性能の高い直交化辞書を効率的
に作成し、複数の利用者にて利用可能な認識性能の高い
音声認識装置を提供することにある。
[発明の構成] (聞届点を解決するための手段) 本発明は入力音声を分析処理して求められる入力音声パ
ターンと、予め収集された学習パターンに基いて作成さ
れている直交化辞書との間で類似度を計算して上記入力
音声を認識する音声認識装置において、 上記直交化辞書として最初に登録する話者の学習パター
ンから基本となる直交軸を決定して基準となる辞書を作
成し、2番目以降の話者の学習パターンからの辞書作成
については、既に登録されている辞書の軸と直交する新
たな軸を決定しながら、この新たな軸の辞書を登録する
か否かを、例えばその軸のノルムの値から判定し、前記
直交化辞書を順次構築していくようにしたことを特徴と
するものである。
(作用) 本発明によれば、最初に登録対象となった話者からの学
習パターンから基本となる直交軸が決定されて辞書の作
成が行なわれ、その後、次の話者からの学習パターンに
基づく辞書作成に際しては、既に作成されている辞書の
軸と直交する軸が求められ、この新たな軸についての辞
書が求められる。そしてそのノルムの値を判定すること
によって辞書に追加登録するか否かを調べ、辞書として
有用な場合にのみその辞書登録が行なわれる。
この結果、複数の話者の学習パターンから、そのパター
ン変動要素を効率良く表現した直交化辞書を構築してい
くことが可能となり、認識性能の高い直交化辞書を得る
ことが可能となる。しかも基本となる直交軸の辞書に対
して、他の話者の変動パターンを直交ベクトルの組に効
率良く組入れて辞書表現することが可能となるので、そ
の計算量を少なくし、簡易に効率良く辞書を作成してい
くことが可能となる。
(実施例) 以下、図面を参照して本発明の一実施例につき説明する
第1図は本発明に係る一実施例方式を適用して構成され
る音声認識装置の概略構成図で、第4図に示した従来装
置と同一部分には同一符号を付して示しである。
この実施例装置が特徴とするところは、パターン蓄積部
7に蓄積された学習パターンを用いて直交化辞書9を作
成する手段として、直交ベクトル計算部8a、直交ベク
トル登録判定部8b、および残差ノルムメモリ8cとか
らなる直交化辞書作成部8を設け、第2図にこの直交化
辞書作成部8における処理概念を模式的に示すように、
先ず最初(1人目)の話者から求められた学習パターン
に従って、基本となる直交軸を決定して最初の辞書を作
成し、その後の2人目以降の話者から求められる学習パ
ターンに従う辞書作成については、上記基本軸に直交す
る軸(既に登録されている辞書の各軸にそれぞれ直交す
る軸)の辞書を求め、この辞書を登録するか否かを逐次
判定しながら前記辞書に加えていくことで、直交化辞書
9を構築していくようにした点を特徴としている。
尚、ここではパターン蓄積部7に収集される学習パター
ンとしては、例えばj  (−1,2,〜6)で示され
る6点の音響分析された特徴ベクトルからなり、その音
声区間をk (−0,1,2,〜11)として11等分
する12個の標本点に亙って採取したデータ系列として
与えられるものとして説明する。
しかして前記直交化辞書作成部8は、カテゴリiについ
て、最初の話者から3個ずつ収集した際のm番目の学習
パターンをam(j、k)としたとき、この最初の話者
に対する直交化辞@9を次のようにして作成している。
ら、その平均パターンA   を (j、k) [j−1,2,〜1B、  k−0,1,2,〜17]
として求める。
■ しかる後、上述した如くして求めた平均パターンA
(j、k)を用いて、 bl(j、k)   (j、に−1)    (j、k
)   (j、に+1)−A         +2*
A       +A[j=1,2.〜IL  k−1
,2,〜16]         ・・・(6)なる演
算にて第1軸の辞書b   を求め、これ1(j、k) を直交化辞書9に登録する。この辞書bl(j、k)は
前記平均パターンA   を時間軸方向に平滑化(j、
k) したものとして求められ、直交化辞書9の基準となる第
1軸の辞書データとして登録される。
■ しかる後、前記平均パターンA(j、k)を用い、
b2(j、k)    U、に−1)   U、に+1
)−−A     +A [j−1,2,〜 1B、   k−1,2,〜 16
コ              ・・・(7)なる演算
にて第2軸の辞書b2(j、k)を求め、これを正規化
した後に前記直交化辞書9に登録する。
この辞” b2U、k)は前記平均パターンA(j、k
)を時間軸方向に微分したものとして求められる。
尚、このようにして計算される第2軸の辞書b2<j、
k)は、前記第1軸の辞書b   に対して1 (j 
、k) 完全には直交していないことから、 82(j、k)−b2(j、k) −(b2(j、k)   l(j、k))” 1(j、
k)φb なる再直交化処理を施し、この再直交化された辞書デー
タB2U、k)を正規化後、新たな第2軸の辞書b  
 として前記直交化辞書9に登録するよ2(j、k) うにしても良い。
尚、最初の話者からの学習パターンに従う直交化辞書を
ここでは第2軸まで作成する例を示したが、更に2次微
分を行なう等して3軸以降の辞書を作成することも勿論
可能である。
■ しかる後、上述した如く求められる直交化辞書につ
いて、直交ベクトル計算部8aにて前記パターン蓄積部
7に格納されている学習パターンから、上記直交化辞書
に直交する付加辞書を次のようにして作成する。
即ち、この付加辞書の作成は、前記パターン蓄積部7に
収集された学習パターンam(j、k)について、既に
求められている直交化辞書の軸数をPとしたとき [n ml、2.〜p 、 mmL、2.〜Mlなるグ
ラムシュミットの直交化式を演算して行われる。そして
この新しく求められた直交ベクトル(付加辞書)b  
を直交ベクトル登録判定部8bP+■ に与え、そのノルムllb   IIが所定値よりも大
I きい場合、これを付加辞書としてパターン正規化処理を
施した後に前記直交化辞書9に登録する。
この際、上記ノルムIlb   11の値を残差ノルム
pm テーブル8Cに登録する。
以上の■〜■の処理を各カテゴリ毎に繰返し実行するこ
とによって各カテゴリiについての直交化辞書9が作成
される。そして最初の話者からの学習パターンに従う直
交化辞書作成が終了する。
次に2人目以降の話者からの学習パターンを用いた辞書
作成については、パターン蓄積部7に格納された学習パ
ターンについて上述した■に示される処理だけを実行す
る。つまり前記パターン蓄積部7に収集された学習パタ
ーンall(j、k)について、既に求められている直
交化辞書の軸数をPとしたとき、前述した [ n w 1.2.〜p 、 m −1,2,〜Ml
なるグラムシュミットの直交化式を演算して新たな軸の
辞書を求める。そしてこの新しく求められた直交ベクト
ル(新たな軸の辞書)b  を前記P十鳳 直交ベクトル登録判定部8bに与え、そのノルム11b
   IIが所定値よりも大きい場合、これを新P+■ たに登録すべき辞書としてパターン正規化処理を施した
後に前記直交化辞書9に登録する。
尚ミ新たに求められた軸の辞書の前記直交化辞書9への
登録に際しては、直交化辞書9として予め定められてい
る軸数を越えることがある。このような場合、新たな軸
の辞書登録を中止すると、その辞書を得た話者に対する
認識性能が劣化する虞れがある。そこでこのような場合
には、前記残差ノルムメモリ8cからそのカテゴリiに
ついての各軸での残差ノルムllb   I+をそれぞ
れ読出し、pm 新たな軸の残差ノルムの値と比較する。そして既に登録
された辞書の中で、その残差ノルムの値が小さいものが
あれば、その残差ノルムに対応する辞書(直交ベクトル
)を前記直交化辞書9から抹消し、代わりに前述した新
しく求められた辞書(直交ベクトル)を辞書登録する。
この場合、残差ノルムメモリ8cにおける対応ノルムの
値も書替えることは勿論のことである。
以上のようにして最初の話者の学習パターンから求めら
れる直交軸の辞書を基本として、次の話者から求められ
る学習パターンに従う直交ベクトルを順次辞書登録して
直交化辞書9を構築していく。この結果、一定の人数範
囲内であれば、その全ての登録話者の入力音声パターン
に対して認識性能の高い直交化辞書9を得ることが可能
となり、その認識性能の向上を図ることが可能となる。
また上述したように簡単な演算処理によって新たな軸の
辞書を逐次作成していくので、その処理負担が非常に軽
く、複数の話者に適応し得る直交化辞書9を効率的に作
成することが可能となる等の効果が奏せられる。
次表は男性5名1女性3名から数字音声と人名からなる
30語の音声データをそれぞれ13回に亙って収集し、
そのうちの3回分を学習用、残り10回分を認識性能評
価に用いた実験例を示すものである。
表 尚、この表における話者Aは比較的性能の悪い話者であ
り、話者Bは性能の良い話者である。またこれらの結果
は、10名の話者の全てが辞書登録を終えた時点での直
交化辞書セットを用いたときの認識性能を示している。
尚、参考として上記話者A、Bが単独で、所謂特定話者
で直交化辞書を作成したときの認識性能はそれぞれ92
.5%。
98.3%であった。
この実験データに示されるように、本方式によれば10
名程度の登録話者に対して上述した如く直交化辞書9を
作成することで、その登録順序に拘らず全ての登録話者
に対して安定に、また比較的高い性能で音声認識し得る
ことが明らがとなった。
尚、本発明は上述した実施例に限定されるものではない
。ここでは最初の登録話者がら2軸の直交化辞書を作成
する例について説明したが、更に多くの軸数の直交化辞
書を作成することも可能である。この場合、直交化フィ
ルタの係数としては幾つかのバリエーションが考えられ
るが、要は学習パターンを平滑、1次微分、2次微分、
・・・すれば良いものであり、種々変形して実施するこ
とができる。また学習パターンの次元数等も特に限定さ
れるものでもない。更には新たに作成する辞書の軸数も
学習パターン数に応じて定めれば良く、グラムシュミッ
ト以外の直交化法を用いて辞書を作成することも可能で
ある。その他、本発明はその要旨を逸脱しない範囲で変
形して実施可能である。
[発明の効果] 以上説明したように本発明によれば複数の話者から収集
した学習パターンを用いて、これらの話者に対応可能な
直交化辞書を簡易に、且つ性能良く生成していくことが
可能なので、少ない学習パターンでパターンの変動を効
果的に表現した辞書を得ることができ、その認識性能の
向上を図り得る等の実用上多大なる効果を奏する。
【図面の簡単な説明】
第1図は本発明の一実施例に係る音声認識装置の概略構
成図、第2図は実施例装置における直交化辞書作成の概
念を模式的に示す図、第3図および第4図はそれぞれ従
来の音声認識装置の概略構成を示す図である。 ■・・・音響分析部、2・・・始端・終端検出部、5・
・・判定部、′8・・・標本点抽出部、7・・・パター
ン蓄積部、訃・・直交化辞書作成部、9・・・直交化辞
書、1G・・・類似度演算部、8a・・・直交ベクトル
計算部、8b・・・直交ベクトル登録判定部、8c・・
・残差ノルムメモリ。 出願人代理人 弁理士 鈴江武彦

Claims (1)

  1. 【特許請求の範囲】 入力音声を分析処理して求められる入力音声パターンと
    、予め収集された複数話者の学習パターンに基いて作成
    されている直交化辞書との間で類似度を計算して上記入
    力音声を認識する音声認識装置において、 上記直交化辞書として最初に登録する話者の学習パター
    ンから基本となる直交軸を決定し、2番目以降の話者の
    学習パターンからの辞書作成は、既に登録されている辞
    書の軸と直交する新たな軸を決定し、この新たな軸の辞
    書を登録するか否かを判定して前記直交化辞書を構築す
    ることを特徴とする音声認識装置。
JP63106221A 1988-04-28 1988-04-28 音声認識装置 Pending JPH01277297A (ja)

Priority Applications (1)

Application Number Priority Date Filing Date Title
JP63106221A JPH01277297A (ja) 1988-04-28 1988-04-28 音声認識装置

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
JP63106221A JPH01277297A (ja) 1988-04-28 1988-04-28 音声認識装置

Publications (1)

Publication Number Publication Date
JPH01277297A true JPH01277297A (ja) 1989-11-07

Family

ID=14428088

Family Applications (1)

Application Number Title Priority Date Filing Date
JP63106221A Pending JPH01277297A (ja) 1988-04-28 1988-04-28 音声認識装置

Country Status (1)

Country Link
JP (1) JPH01277297A (ja)

Similar Documents

Publication Publication Date Title
Kabil et al. On Learning to Identify Genders from Raw Speech Signal Using CNNs.
Das et al. Recognition of isolated words using features based on LPC, MFCC, ZCR and STE, with neural network classifiers
Uddin et al. Gender recognition from human voice using multi-layer architecture
Dey et al. DNN based speaker embedding using content information for text-dependent speaker verification
Sunny et al. Recognition of speech signals: an experimental comparison of linear predictive coding and discrete wavelet transforms
CN109147146A (zh) 语音取号的方法及终端设备
Kaneko et al. A hierarchical decision approach to large-vocabulary discrete utterance recognition
Krishna et al. Emotion recognition using dynamic time warping technique for isolated words
JPS6273391A (ja) パタ−ン認識学習装置
JPH0225898A (ja) 音声認識装置
Kamble et al. Emotion recognition for instantaneous Marathi spoken words
Semary et al. Using voice technologies to support disabled people
Mohanta et al. Human emotional states classification based upon changes in speech production features in vowel regions
Sunny et al. Feature extraction methods based on linear predictive coding and wavelet packet decomposition for recognizing spoken words in malayalam
JPH01277297A (ja) 音声認識装置
Sharma et al. A Natural Human-Machine Interaction via an Efficient Speech Recognition System
Mittal et al. Multiclass SVM based Spoken Hindi Numerals Recognition.
Sunny et al. Development of a speech recognition system for speaker independent isolated Malayalam words
Telembici et al. Results on the MFCC extraction for improving audio capabilities of TIAGo service robot
JPH0225899A (ja) 音声認識装置
Dhakal Novel Architectures for Human Voice and Environmental Sound Recognitionusing Machine Learning Algorithms
JP2514985B2 (ja) 音声認識方式
JPH0194394A (ja) 音声認識方式
JPH0194397A (ja) 音声認識方式
Dhole et al. An Overview of Speaker Recognition: Conceptual Framework and CNN based Identification Technique