KR101300839B1

KR101300839B1 - 음성 검색어 확장 방법 및 시스템

Info

Publication number: KR101300839B1
Application number: KR1020070133727A
Authority: KR
Inventors: 조정미; 곽병관; 김남훈; 한익상
Original assignee: 삼성전자주식회사
Priority date: 2007-12-18
Filing date: 2007-12-18
Publication date: 2013-09-10
Also published as: US8155956B2; KR20090066106A; US20090157383A1

Abstract

본 발명은 음성 검색어 확장 방법 및 시스템에 관한 것으로, 입력 신호로부터 사용자의 음성 구간을 검출하여, 상기 음성 구간으로부터 특징 벡터를 추출하고, 상기 특징 벡터를 적어도 하나 이상의 음소 시퀀스로 변환하여 생성하고, 상기 음소 시퀀스를 단어 사전에 등록되어 있는 단어들과 매칭하여, 언어적으로 의미가 있는 단어의 열(string)을 추출하여 검색어로 선택하고, 상기 선택한 검색어가 기 선정된 제1 언어(Language) 인지의 여부를 판단하여, 상기 판단 결과 제1 언어가 아닌 언어인 경우, 상기 검색어를 음소/문자소 변환 모델(Phoneme to Grapheme Model)을 이용하여 변환하여 제1 언어로 구성된 검색어를 생성하고, 상기 제1 언어로 구성된 검색어를 이용하여 검색을 실행하여, 검색어를 확장함으로써, 모국어/외국어뿐만 아니라 발음 변이까지 모두 고려하여 검색어를 확장할 수 있다.

음성 인식, 음성 검색, 검색어 확장, 외국어 검색

Description

음성 검색어 확장 방법 및 시스템{VOICE QUERY EXTENSION METHOD AND SYSTEM}

본 발명은 음성 검색어 확장 방법 및 시스템에 관한 것으로, 특히 검색어를 확장하여 검색 성공률을 높인 음성 검색어 확장 방법 및 시스템에 관한 것이다.

모바일 인터넷 환경이 일반화되면서, 모바일 단말기를 통한 웹 검색이나 웹을 통하여 컨텐츠를 다운로드 하는 등, 모바일 단말기의 사용이 증대되고 있다.

그러나 모바일 단말기의 버튼 입력 방식은 모바일 단말기 자체의 휴대성을 고려한 특성상, 버튼이 소형화되어 있으며 검색어 입력 속도가 느리고 그에 따라 사용자는 불편함을 느끼게 된다. 예를 들어, 모바일 단말기의 방향키를 이용한 웹 페이지 네비게이션은 속도가 느리고, 커서 이동과 버튼 입력의 동기화가 잘 이루어지지 않아, 효율적인 웹 네비게이션이 어렵다. 그에 따라 쉽고 효율적인 모바일 웹 검색 방법으로 음성에 기반한 웹 인터페이스가 요구되고 있다.

이와 같은 모바일 단말기의 환경에 따른 사용자의 요구에 따라, 음성 인식을 통한 모바일 단말기의 웹 검색 등이 사용되고 있다.

일반적으로 음성 인식은 사용자의 입력 음성에서 특징을 추출하고 분석하여 미리 등록된 인식 목록(인식 사전)에서 가장 근접한 결과를 찾아내는 방식이다. 이러한 방식을 음성 기반 웹 검색에 적용을 하게 되면 외국어로 이루어진 검색어 입력시, 그에 대한 인식 결과를 검색어로 생성하게 된다.

이와 같은, 음성 인식에 의한 검색은 인식 목록 내에 검색어가 존재하지 않는 경우, 검색이 불가능하였다.

본 발명은 상기와 같은 종래 기술을 개선하기 위해 안출된 것으로서, 다국어 사전을 이용하여 모국어 사전에 등록되지 않은 미등록어를 인식함으로써 인식 성공률을 높이는 것을 목적으로 한다.

또한 본 발명은, 외국어 음성 입력일지라도 모국어 검색어로 검색이 가능하도록 검색어를 확장하여, 사용자가 의도했던 범위 내에서의 검색 성공률을 높이는 것을 목적으로 한다.

또한 본 발명은, 외국어 음성 입력시 모국어 사용자의 발음 변이를 적용한 검색어 확장을 통해 검색 성공률을 높이는 것을 목적으로 한다.

상기의 목적을 이루고 종래기술의 문제점을 해결하기 위하여 본 발명의 일측에 따른 음성 검색어 확장 방법은, 입력 신호로부터 사용자의 음성 구간을 검출하고, 상기 음성 구간으로부터 특징 벡터를 추출하는 단계, 상기 특징 벡터를 적어도 하나 이상의 음소 시퀀스로 변환하여 생성하는 단계, 상기 음소 시퀀스를 단어 사전에 등록되어 있는 단어들과 매칭하여, 언어적으로 의미가 있는 단어의 열(string)을 추출하여 검색어로 선택하는 단계, 상기 선택한 검색어가 기 선정된 제1 언어(Language) 인지의 여부를 판단하여, 상기 판단 결과 제1 언어가 아닌 언어인 경우, 상기 검색어를 음소/문자소 변환 모델(Phoneme to Grapheme Model)을 이용하여 변환하여 제1 언어로 구성된 검색어를 생성하는 단계, 및 상기 제1 언어 로 구성된 검색어를 이용하여, 검색하는 단계를 포함한다.

본 발명의 또 다른 일측에 따르면, 상기 단어의 열을 추출하여 검색어로 선택하는 단계는, 상기 음소 시퀀스를 제1 언어의 단어 사전에 등록되어 있는 단어들과 매칭하여, 상기 매칭의(비교한) 결과 수치가 특정 역치(threshold)보다 높은 단어의 열이 존재하는 경우, 상기 단어의 열을 검색어로 선택하고, 상기 매칭의 결과 수치가 특정 역치보다 높은 단어의 열이 존재하지 않는 경우, 제2 언어의 단어 사전에 등록되어 있는 단어들과 매칭하여, 상기 단어의 열을 검색어로 선택한다.

본 발명의 또 다른 일측에 따르면, 상기 단어의 열을 추출하여 검색어로 선택하는 단계는, 상기 음소 시퀀스를 제2 언어의 단어 사전에 등록되어 있는 단어들과 매칭하여, 상기 매칭의 결과, 수치가 특정 역치보다 높은 단어의 열이 존재하는 경우, 상기 단어의 열을 검색어로 선택하고, 상기 매칭의 결과, 수치가 특정 역치보다 높은 단어의 열이 존재하지 않는 경우, 상기 매칭의 결과 수치가 가장 높은 단어의 열을 검색어로 선택한다.

본 발명의 또 다른 일측에 따르면, 상기 단어 열을 추출하여 검색어로 선택하는 단계는, 상기 음소 시퀀스를 제1 언어 및 제2 언어의 단어 사전을 포함하여 구성되는 통합 단어 사전에 등록되어 있는 단어들과 매칭하여, 상기 매칭의 결과 수치가 특정 역치보다 높은 단어의 열이 존재하는 경우, 상기 단어의 열을 검색어로 추출하고, 상기 매칭의 결과 수치가 특정 역치보다 높은 단어의 열이 존재하지 않는 경우, 상기 매칭의 결과 수치가 가장 높은 단어의 열을 검색어로 선택한다.

본 발명의 또 다른 일측에 따르면, 상기 특징 벡터를 적어도 하나 이상의 음 소 시퀀스로 변환하여 생성하는 단계는, 어쿠스틱 모델(Acoustic Model)을 적용하여, 상기 특징 벡터를 적어도 하나 이상의 음소 시퀀스로 변환하여 생성한다.

본 발명의 또 다른 일측에 따르면, 상기 음소 시퀀스를 단어 사전에 등록되어 있는 단어들과 매칭하여, 언어적으로 의미가 있는 단어의 열을 추출하여 검색어로 선택하는 단계는, 폰 컨퓨전 매트릭스(Phone Confusion Matrix)를 적용하여 상기 음소 시퀀스를 상기 단어 사전에 등록되어 있는 단어들과 매칭한다.

본 발명의 또 다른 일측에 따르면, 상기 음소 시퀀스를 단어 사전에 등록되어 있는 단어들과 매칭하여, 언어적으로 의미가 있는 단어의 열을 추출하여 검색어로 선택하는 단계는, 언어 모델(Language Model)을 통하여 언어적으로 의미가 있는 단어의 열을 추출하여 검색어로 선택한다.

이하 첨부된 도면들 및 첨부된 도면들에 기재된 내용들을 참조하여 본 발명의 바람직한 실시예를 상세하게 설명하지만, 본 발명이 실시예들에 의해 제한되거나 한정되는 것은 아니다. 각 도면에 제시된 동일한 참조부호는 동일한 부재를 나타낸다.

도 1은 본 발명의 일례에 따른 음성 검색어 확장의 방법의 개념도이다. 도 1을 참조하여 본 발명의 일례에 따른 음성 검색어 확장 방법을 설명한다.

일반적으로 음성 인식은 사용자의 입력 음성에서 특징을 추출하고 분석하여 미리 등록된 인식 목록(인식 사전)에서 가장 근접한 결과를 찾아내는 방식이다. 이러한 방식을 음성 기반 웹 검색에 적용을 하게 되면 외국어로 이루어진 검색어 입 력시, 외국어 검색어 인식 결과를 검색어로 생성하게 된다.

도 1에서와 같이 한국인 사용자가 "프리즌 브레이크"라는 음성 검색어를 입력하면, 음소 디코더(Phonetic Decoder: 110)는 입력된 음성 검색어의 특징 벡터를 음소 시퀀스(120)로 변환하여 생성한다.

단어 디코더(Lexical Decoder: 140)는 이와 같은 음소 시퀀스(120)를 단어 사전에 등록되어 있는 단어들과 매칭하여, 언어적으로 의미가 있는 단어의 열을 추출하여 검색어로 선택한다. 그러나, "프리즌", "브레이크"라는 단어는 외국어이기 때문에 한국어 인식 사전에는 없을 가능성(160)이 높다. 하지만 "prison", "break"는 영어 관점에서는 보통 명사이므로 영어 인식 사전에는 등록(170)되어 있다. 따라서 사용자 음성을 인식한 결과, "prison break"라는 인식 결과가 생성되고, 음소/문자소 변환 모델(Phoneme to Grapheme Model)을 이용하여 검색어를 생성하는 다국어 검색 확장부(Query Generator: 180)를 통하여, 모국어에 해당하는 검색을 실행한다.

즉, 모국어가 한국어인 경우 검색어는 "프리즌 브레이크", "프리즌 브레익", "Prison Break"등이 사용될 수 있다.

따라서, 음성 검색어 입력시, 외국어 검색어뿐만 아니라 모국어 검색어로도 확장함으로써 검색 성공률과 만족도를 높일 수 있다. 이러한 개념은 한국어뿐만 아니라, 일본어(195), 중국어(미도시) 등 언어에 관계없이, 모국어가 아닌 외국어 검색어를 음성으로 입력하고자 할 때 모두 적용될 수 있다.

이 경우, 구글 검색 엔진과 같이 글로벌한 검색 엔진을 통해 검색할 경우, 영어 사이트 대상 검색이 된다. 즉, 네이버(Naver)와 같은 국내용 검색 엔진을 통해 검색을 할 경우, 색인어가 "prison", "break"인 사이트를 대상으로 검색을 진행한다. 그러나 한국인 사용자의 경우 "프리즌 브레이크", "prison break"(또는 "프리즌 브레익") 중 어떤 검색어 입력을 의도했는지 분명하지 않으므로, 이 두 가지 검색어 모두를 적용하여 검색했을 때 사용자가 원하는 검색 결과를 얻을 가능성이 높다.

도 2는 본 발명의 일례에 따른 음성 검색어 확장 시스템의 구성도이다. 도2를 참조하여 본 발명의 일례에 따른 음성 검색어 확장 시스템을 설명한다.

도 2에 도시된 바와 같이 본 발명의 일례에 따른 음성 검색어 확장 시스템은, 신호 처리부(Signal Processing Front-end: 210), 음소 디코더(Phonetic Decoder: 220), 단어 디코더(Lexical Decoder: 230), 다국어 검색 확장부(Multilingual Query Extension: 240), 및 단어 사전(Word Dictionary: 250) 등을 포함하여 구성된다.

신호 처리부(210)는 입력 신호로부터 사용자의 음성 구간을 검출하고 상기 음성 구간으로부터 특징 벡터를 추출한다. 이때, 신호 처리부(210)는 입력 신호로부터 배경 잡음 등을 제거하고 사용자의 음성 구간을 검출하며, 음성 구간에서 음성 인식에 사용될 특징 벡터를 추출한다.

음소 디코더(220)는 상기 특징 벡터를 적어도 하나 이상의 음소 시퀀스로 변환하여 생성한다. 이때, 음소 디코더(220)는 어쿠스틱 모델(Acoustic Model: 225)을 적용하여, 상기 특징 벡터를 적어도 하나 이상의 음소 시퀀스로 변환하여 생성 한다.

단어 디코더(230)는 상기 음소 시퀀스를 단어 사전에 등록되어 있는 단어들과 매칭하여, 언어적으로 의미가 있는 단어의 열을 추출하여 검색어로 선택하는데, 이때 폰 컨퓨전 매트릭스(Phone Confusion Matrix)를 적용하여 상기 음소 시퀀스를 상기 단어 사전에 등록되어 있는 단어들과 매칭할 수 있다.

특히, 단어 디코더(230)는 상기 음소 시퀀스를 제1 언어(예를 들어 한국어)의 단어 사전에 등록되어 있는 단어들과 매칭하여, 상기 매칭의 결과 수치가 특정 역치보다 높은 단어의 열이 존재하는 경우, 상기 단어의 열을 검색어로 선택한다. 또한, 상기 매칭의 결과 수치가 특정 역치보다 높은 단어의 열이 존재하지 않는 경우, 제2 언어(예를 들어, 영어 또는 일어)의 단어 사전(252, 253)에 등록되어 있는 단어들과 매칭하여, 상기 단어의 열을 검색어로 선택한다.

또한, 단어 디코더(230)는 상기 음소 시퀀스를 제2 언어의 단어 사전(252, 253)에 등록되어 있는 단어들과 매칭하여, 상기 매칭의 결과 수치가 특정 역치보다 높은 단어의 열이 존재하는 경우, 상기 단어의 열을 검색어로 선택하고, 상기 매칭의 결과 수치가 특정 역치보다 높은 단어의 열이 존재하지 않는 경우, 상기 매칭의(비교한) 결과 수치가 가장 높은 단어의 열을 검색어로 선택한다.

또는, 상기 음소 시퀀스를 제1 언어 및 제2 언어의 단어 사전을 포함하여 구성되는 통합 단어 사전(254)에 등록되어 있는 단어들과 매칭하여, 상기 매칭의 결과 수치가 특정 역치보다 높은 단어의 열이 존재하는 경우, 상기 단어의 열을 검색어로 선택하고, 상기 매칭의 결과 수치가 특정 역치보다 높은 단어의 열이 존재하지 않는 경우, 상기 매칭의 결과 수치가 가장 높은 단어의 열을 검색어로 선택할 수 있다.

뿐만 아니라, 단어 디코더(230)는 언어 모델(Language Model)을 통하여 언어적으로 의미가 있는 단어의 열을 추출하여 검색어로 선택할 수 있다.

다국어 검색 확장부(240)는 상기 선택한 검색어가 기 선정된 제1 언어 인지(예를 들어 한국어)의 여부를 판단하여, 상기 판단 결과 제1 언어가 아닌 언어인 경우, 상기 검색어를 음소/문자소 변환 모델(Phoneme to Grapheme Model)을 이용하여 변환하여 제1 언어로 구성된 검색어를 생성한다. 이때, 음소/문자소 변환 모델은 해당 언어간의 발음 변이 등을 고려하는데 사용된다.

또한, 상기 모국어 검색어를 이용하여 검색하는 검색부(미도시)를 더 포함하여 구성될 수 있다.

도 3은 본 발명의 일례에 따른 음성 검색어 확장 방법을 도시한 흐름도로서, 보다 상세하게는, 음성 인식시 다국어 사전을 단계적으로 적용할 경우의 단어 디코더(lexical decoder)의 알고리즘을 설명하는 흐름도이다.

도 3을 참조하여 본 발명의 일례에 따른 음성 검색어 확장 방법을 설명한다.

n개(적어도 하나 이상)의 음소 시퀀스(phoneme sequence)를 수신하고(S310), 수신한 음소 시퀀스를 모국어 사전(예를 들어 한국어 사전)과 매치하여 본다(S320).

음소 시퀀스를 모국어 사전과 비교하여(S330), 매칭 점수(matching score)가 역치(threshold)보다 높은 단어가 존재할 경우, 해당 단어로 검색어를 구성한 다(S340).

한편, 매칭 점수가 역치보다 높은 단어가 존재하지 않을 경우, n개의 음소 시퀀스를 외국어 사전(예를 들어 영어 사전)과 매치하게 된다(S350).

상기 매치 결과(S360), 매칭 점수가 역치보다 높은 단어가 존재하는 경우, 외국어 사전으로부터 외국어 검색어를 구성하고(S370), 상기 매치 결과 매칭 점수가 역치보다 낮은 경우에는, 매칭 가장 잘되는 검색어를 선택한다(S380).

도 4는 본 발명의 또 다른 일례에 따른 음성 검색어 확장 방법을 도시한 흐름도로서, 보다 상세하게는 음성 인식시 모국어, 외국어 사전을 통합하여 적용할 경우의 단어 디코더(lexical decoder)의 알고리즘을 설명하는 흐름도이다.

도 4를 참조하여 본 발명의 일례에 따른 음성 검색어 확장 방법을 설명한다.

n개(적어도 하나 이상)의 음소 시퀀스(phoneme sequence)를 수신하고(S410), 수신한 음소 시퀀스를 통합 사전(Universal Dictionary)과 매치하여 본다(S420).

음소 시퀀스를 모국어 사전과 비교하여(S430), 매칭 점수(matching score)가 역치(threshold)보다 높은 단어가 존재할 경우, 해당 단어로 검색어를 구성한다(S440).

한편, 매칭 점수가 역치보다 높은 단어가 존재하지 않을 경우, 매칭 가장 잘되는 검색어를 선택한다(S450).

도 5는 본 발명의 또 다른 일례에 따른 음성 검색어 확장 방법을 도시한 흐름도로서, 인식된 검색어에 모국어가 아닌 단어가 포함되어 있는 경우 음성 검색어를 확장하는 알고리즘을 도시한 흐름도이다.

n개(적어도 하나 이상)의 음소 시퀀스(phoneme sequence)를 수신하고(S510), 인식된 검색어에 외국어(예를 들어 영어)가 포함되어 있는지의 여부를 판단하여(S520), 인식된 검색어에 외국어가 포함되어 있는 경우, 음소/문자소 변환 룰(Phone to Grapheme rule)을 적용하여 사전의 발음 열(String)로부터 모국어 검색어(예를 들어 한국어)를 생성한다(S530). 음소/문자소 변환 룰(phone to grapheme rule)은 음소(phone)를 해당하는 문자소로 변환하는 규칙으로, 언어마다 음소 셋(phone set)과 변환 규칙 등이 모두 다르다.

이와 같이 생성된 모국어 검색어를, 발음의 변이를 고려하여 확장한다(S540). 예를 들어, "midnight blue"라는 영어 음성 입력은, 한국어로 확장될 경우 "미드나이트 블루", "미드나잇 블루" 등으로 확장될 수 있다.

이후, 상기와 같이 생성되고 확장된 모국어 검색어를 이용하여 검색을 실행하게 되고(S550), 인식된 검색어에 외국어가 포함되어 있지 않은 경우에는, 모국어 검색어인 것으로 판단하여 검색을 실행하여(S560), 검색에 따른 검색 결과를 표시한다(S570).

도 6은 본 발명의 일례에 따른 다국언어 검색어 확장 알고리즘을 도시한 도면으로서, 보다 상세하게는 한국어와 일본어 검색어의 확장에 대한 도면이다. 도 6을 참조하여 본 발명의 일례에 따른 다국언어 검색어 확장 알고리즘을 설명한다.

도 6은 "Prison Break"를 예로 한, 한국어의 음소(phone: 610) 및 그에 대응되는 문자소(grapheme: 620), 일본어의 음소(630) 및 그에 대응되는 문자소(640)를 도시하고 있다.

일반적으로 음소(phone)와 문자소(grapheme)는 n 대 m(n:m) 매칭이며, 음소 콘텍스트(phone context)에 따라 해당 문자소(grapheme)가 달라질 수 있다. 즉, 음소(phone) 'TH'는 주변 음소 콘텍스트(phone context)에 따라서 한국어 'ㄷ', 'ㅈ', ㄸ', 'ㅆ' 모두 가능하며, 음소(phone) 'F', 'P'는 한국어의 경우 모두 'ㅍ'에 해당한다. 이러한 언어의 발음 차이에 따른 발음 변이를 고려하여, 생성된 검색어를 확장하여 검색어를 구성한다.

발음 변이에 따른 한국어 검색어 확장의 예는 아래와 같다. 이러한 현상은 한국어에서만 발생하는 것이 아니라, 외국어를 발생할 경우 공통적으로 발생한다.

다음은 본 발명에서 제안하는 방식을 통해 확장된 검색어의 예로서, 영어 음성 입력을 한국어로 확장한 예이다.

- break: 브레이크/브레익

- awards: 어워드/어워즈

- algorithm: 알고리즘/알고리듬

- midnight: 미드나이트/미드나잇

- prison break/프리즌 브레이크/프리즌 브레익

- super junior/슈퍼 주니어/수퍼 주니어

- 서울 drama awards/서울 드라마 어워즈/서울 드라마 어워드

- midnight blue/미드나이트 블루/미드나잇 블루

또한, 다음은 일본어 음성 입력을 한국어로 확장한 예이다.

- もののけ姬/모노노케 히메

도 7은 본 발명의 또 다른 일례에 따른 음성 검색어 확장 방법을 도시한 흐름도이다. 도 7을 참조하여 본 발명의 일례에 따른 음성 검색어 확장 방법을 설명한다.

입력 신호로부터 사용자의 음성 구간을 검출하고(S710), 상기 음성 구간으로부터 특징 벡터를 추출한다.

이후, 상기 특징 벡터를 적어도 하나 이상의 음소 시퀀스로 변환하여 생성한다(S730). 이때, 어쿠스틱 모델(Acoustic Model)을 적용하여, 상기 특징 벡터를 적어도 하나 이상의 음소 시퀀스로 변환하여 생성할 수 있다.

이와 같이 생성된 음소 시퀀스를 단어 사전에 등록되어 있는 단어들과 매칭하여, 언어적으로 의미가 있는 단어의 열(string)을 추출하여 검색어로 선택한다(S740).

특히, 상기 음소 시퀀스를 단어 사전에 등록되어 있는 단어들과 매칭하여, 언어적으로 의미가 있는 단어의 열을 추출하여 검색어로 선택할 수 있는데, 이때 폰 컨퓨전 매트릭스(Phone Confusion Matrix)를 적용하여 상기 음소 시퀀스를 상기 단어 사전에 등록되어 있는 단어들과 매칭할 수 있다.

또한, 상기 음소 시퀀스를 제1 언어(예를 들어 한국어)의 단어 사전에 등록되어 있는 단어들과 매칭하여, 상기 매칭의 결과 수치가 특정 역치보다 높은 단어의 열이 존재하는 경우, 상기 단어의 열을 검색어로 선택한다. 또한, 상기 매칭의 결과 수치가 특정 역치보다 높은 단어의 열이 존재하지 않는 경우, 제2 언어(예를 들어, 영어 또는 일어)의 단어 사전에 등록되어 있는 단어들과 매칭하여, 상기 단어의 열을 검색어로 선택한다.

뿐만 아니라, 상기 음소 시퀀스를 제2 언어의 단어 사전에 등록되어 있는 단어들과 매칭하여, 상기 매칭의 결과 수치가 특정 역치보다 높은 단어의 열이 존재하는 경우, 상기 단어의 열을 검색어로 선택하고, 상기 매칭의 결과 수치가 특정 역치보다 높은 단어의 열이 존재하지 않는 경우, 상기 매칭의 결과 수치가 가장 높은 단어의 열을 검색어로 선택한다.

또 다른 실시예로서, 상기 음소 시퀀스를 제1 언어 및 제2 언어의 단어 사전을 포함하여 구성되는 통합 단어 사전에 등록되어 있는 단어들과 매칭하여, 상기 매칭의 결과 수치가 특정 역치보다 높은 단어의 열이 존재하는 경우, 상기 단어의 열을 검색어로 선택하고, 상기 매칭의 결과 수치가 특정 역치보다 높은 단어의 열이 존재하지 않는 경우, 상기 매칭의 결과 수치가 가장 높은 단어의 열을 검색어로 선택할 수 있다.

한편, 언어 모델(Language Model)을 통하여 언어적으로 의미가 있는 단어의 열을 추출하여 검색어로 선택할 수 있다.

이후, 상기 선택한 검색어가 기 선정된 제1 언어(Language) 인지의 여부를 판단하여(S750), 상기 판단 결과 제1 언어가 아닌 언어인 경우, 상기 검색어를 음 소/문자소 변환 모델(Phoneme to Grapheme Model)을 이용하여 변환하여 제1 언어로 구성된 검색어를 생성한다(S760). 이때, 음소/문자소 변환 모델은 해당 언어간의 발음 변이 등을 고려하는데 사용된다.

이후, 상기 제1 언어로 구성된 검색어를 이용하여 검색을 실행한다.

이와 같이, 본 발명에 따르면 음성 검색어 확장을 적용하면 하나의 언어의 하나의 검색어로만 인식되는 것이 아니라, 모국어/외국어뿐만 아니라 발음 변이까지 모두 고려하여 검색어를 확장할 수 있으므로, 검색의 성공률과 사용자 만족도를 높일 수 있다.

또한 본 발명의 실시예들은 다양한 컴퓨터로 구현되는 동작을 수행하기 위한 프로그램 명령을 포함하는 컴퓨터 판독 가능 매체를 포함한다. 상기 컴퓨터 판독 가능 매체는 프로그램 명령, 데이터 파일, 데이터 구조 등을 단독으로 또는 조합하여 포함할 수 있다. 상기 프로그램 명령은 본 발명을 위하여 특별히 설계되고 구성된 것들이거나 당업자에게 공지되어 사용 가능한 것일 수도 있다. 컴퓨터 판독 가능 기록 매체의 예에는 하드 디스크, 플로피 디스크 및 자기 테이프와 같은 자기 매체(magnetic media), CD-ROM, DVD와 같은 광기록 매체(optical media), 플롭티컬 디스크(floptical disk)와 같은 자기-광 매체(magneto-optical media), 및 롬(ROM), 램(RAM), 플래시 메모리 등과 같은 프로그램 명령을 저장하고 수행하도록 특별히 구성된 하드웨어 장치가 포함된다. 프로그램 명령의 예에는 컴파일러에 의해 만들어지는 것과 같은 기계어 코드뿐만 아니라 인터프리터 등을 사용해서 컴퓨터에 의해서 실행될 수 있는 고급 언어 코드를 포함한다. 본 발명에서 설명된 이 동 단말 또는 기지국의 동작의 전부 또는 일부가 컴퓨터 프로그램으로 구현된 경우, 상기 컴퓨터 프로그램을 저장한 컴퓨터 판독 가능 기록 매체도 본 발명에 포함된다.

이상과 같이 본 발명은 비록 한정된 실시예와 도면에 의해 설명되었으나, 본 발명은 상기의 실시예에 한정되는 것은 아니며, 본 발명이 속하는 분야에서 통상의 지식을 가진 자라면 이러한 기재로부터 다양한 수정 및 변형이 가능하다.

그러므로, 본 발명의 범위는 설명된 실시예에 국한되어 정해져서는 아니되며, 후술하는 특허청구범위뿐 아니라 이 특허청구범위와 균등한 것들에 의해 정해져야 한다.

도 1은 본 발명의 일례에 따른 음성 검색어 확장의 방법의 개념도이다.

도 2는 본 발명의 일례에 따른 음성 검색어 확장 시스템의 구성도이다.

도 3은 본 발명의 일례에 따른 음성 검색어 확장 방법을 도시한 흐름도이다.

도 4는 본 발명의 또 다른 일례에 따른 음성 검색어 확장 방법을 도시한 흐름도이다.

도 5는 본 발명의 또 다른 일례에 따른 음성 검색어 확장 방법을 도시한 흐름도이다.

도 6은 본 발명의 일례에 따른 다국언어 검색어 확장 알고리즘을 도시한 도면이다.

도 7은 본 발명의 또 다른 일례에 따른 음성 검색어 확장 방법을 도시한 흐름도이다.

<도면의 주요 부분에 대한 부호의 설명>

210: 신호 처리부 220: 음소 디코더

225: 어쿠스틱 모델 230: 단어 디코더

235: 폰 컨퓨전 매트릭스 240: 다국어 검색 확장부

245; 음소/문자소 변환 모델 250: 단어 사전
*251: 한국어 사전 252: 영어 사전

삭제

253: 일어 사전 254: 통합 사전

260: 언어 모델

Claims

입력 신호로부터 사용자의 음성 구간을 검출하고, 상기 음성 구간으로부터 특징 벡터를 추출하는 단계;

상기 특징 벡터를 적어도 하나 이상의 음소 시퀀스로 변환하여 생성하는 단계;

상기 음소 시퀀스를 단어 사전에 등록되어 있는 단어들과 매칭하여, 언어적으로 의미가 있는 단어의 열(string)을 추출하여 검색어로 선택하는 단계;

상기 선택한 검색어가 기 선정된 제1 언어(language)인지의 여부를 판단하여, 상기 판단의 결과 상기 제1 언어가 아닌 언어인 경우, 상기 검색어를 음소/문자소 변환 모델(Phoneme to Grapheme Model)을 이용하여 변환하여 상기 제1 언어로 구성된 검색어를 생성하는 단계; 및

상기 제1 언어로 구성된 검색어를 이용하여, 검색하는 단계

를 포함하는 음성 검색어 확장 방법.
제1항에 있어서,

상기 단어의 열을 추출하여 검색어로 선택하는 단계는,

상기 음소 시퀀스를 상기 제1 언어의 단어 사전에 등록되어 있는 단어들과 매칭하여, 상기 매칭의 결과 수치가 특정 역치(threshold)보다 높은 단어의 열이 존재하는 경우, 상기 단어의 열을 검색어로 선택하고,

상기 매칭의 결과 수치가 상기 특정 역치보다 높은 단어의 열이 존재하지 않는 경우, 제2 언어의 단어 사전에 등록되어 있는 단어들과 매칭하여, 상기 단어의 열을 검색어로 선택하는

음성 검색어 확장 방법.
제2항에 있어서,

상기 단어의 열을 추출하여 검색어로 선택하는 단계는,

상기 음소 시퀀스를 상기 제2 언어의 단어 사전에 등록되어 있는 단어들과 매칭하여, 상기 매칭의 결과 수치가 특정 역치보다 높은 단어의 열이 존재하는 경우, 상기 단어의 열을 검색어로 선택하고,

상기 매칭의 결과 수치가 특정 역치보다 높은 단어의 열이 존재하지 않는 경우, 수치가 가장 높은 매칭된 단어의 열(string)을 검색어로 선택하는

음성 검색어 확장 방법.
제1항에 있어서,

상기 단어 열을 추출하여 검색어로 선택하는 단계는,

상기 음소 시퀀스를 제1 언어 및 제2 언어의 단어 사전을 포함하여 구성되는 통합 단어 사전에 등록되어 있는 단어들과 매칭하여, 상기 매칭의 결과 수치가 특정 역치보다 높은 단어의 열이 존재하는 경우, 상기 단어의 열을 검색어로 추출하고,

상기 매칭의 결과 수치가 특정 역치보다 높은 단어의 열이 존재하지 않는 경우, 수치가 가장 높은 매칭된 단어의 열을 검색어로 선택하는

음성 검색어 확장 방법.
제1항에 있어서,

상기 특징 벡터를 적어도 하나 이상의 음소 시퀀스로 변환하여 생성하는 단계는,

어쿠스틱 모델(Acoustic Model)을 적용하여, 상기 특징 벡터를 적어도 하나 이상의 음소 시퀀스로 변환하여 생성하는

음성 검색어 확장 방법.
제1항에 있어서,

상기 음소 시퀀스를 단어 사전에 등록되어 있는 단어들과 매칭하여, 언어적으로 의미가 있는 단어의 열을 추출하여 검색어로 선택하는 단계는,

폰 컨퓨전 매트릭스(Phone Confusion Matrix)를 적용하여 상기 음소 시퀀스를 상기 단어 사전에 등록되어 있는 단어들과 매칭하는

음성 검색어 확장 방법.
제1항에 있어서,

상기 음소 시퀀스를 단어 사전에 등록되어 있는 단어들과 매칭하여, 언어적으로 의미가 있는 단어의 열을 추출하여 검색어로 선택하는 단계는,

언어 모델(Language Model)을 통하여 언어적으로 의미가 있는 단어의 열을 추출하여 검색어로 선택하는

음성 검색어 확장 방법.
제1항 내지 제7항 중 어느 한 항의 방법을 실행하는 프로그램을 기록한 컴퓨터 판독가능 기록 매체.
입력 신호로부터 사용자의 음성 구간을 검출하고 상기 음성 구간으로부터 특징 벡터를 추출하는 신호 처리부;

상기 특징 벡터를 적어도 하나 이상의 음소 시퀀스로 변환하여 생성하는 음소 디코더;

상기 음소 시퀀스를 단어 사전에 등록되어 있는 단어들과 매칭하여, 언어적으로 의미가 있는 단어의 열을 추출하여 검색어로 선택하는 단어 디코더;

상기 선택한 검색어가 기 선정된 제1 언어 인지의 여부를 판단하여, 상기 판단 결과 제1 언어가 아닌 언어인 경우, 상기 검색어를 음소/문자소 변환 모델(Phoneme to Grapheme Model)을 이용하여 변환하여 상기 제1 언어로 구성된 검색어를 생성하는 다국어 검색 확장부; 및

상기 제1 언어로 구성된 검색어를 이용하여, 검색하는 검색부

를 포함하는 음성 검색어 확장 시스템.
제9항에 있어서,

상기 단어 디코더는,

상기 음소 시퀀스를 상기 제1 언어의 단어 사전에 등록되어 있는 단어들과 매칭하여, 상기 매칭의 결과 수치가 특정 역치보다 높은 단어의 열이 존재하는 경우, 상기 단어의 열을 검색어로 선택하고,

상기 매칭의 결과 수치가 특정 역치보다 높은 단어의 열이 존재하지 않는 경우, 제2 언어의 단어 사전에 등록되어 있는 단어들과 매칭하여, 상기 단어의 열을 검색어로 선택하는

음성 검색어 확장 시스템.
제10항에 있어서,

상기 단어 디코더는,

상기 음소 시퀀스를 상기 제2 언어의 단어 사전에 등록되어 있는 단어들과 매칭하여, 상기 매칭의 결과 수치가 특정 역치보다 높은 단어의 열이 존재하는 경우, 상기 단어의 열을 검색어로 선택하고,

상기 매칭의 결과 수치가 특정 역치보다 높은 단어의 열이 존재하지 않는 경우, 수치가 가장 높은 매칭된 단어의 열을 검색어로 선택하는

음성 검색어 확장 시스템.
제9항에 있어서,

상기 단어 디코더는,

상기 음소 시퀀스를 제1 언어 및 제2 언어의 단어 사전을 포함하여 구성되는 통합 단어 사전에 등록되어 있는 단어들과 매칭하여, 상기 매칭의 결과 수치가 특정 역치보다 높은 단어의 열이 존재하는 경우, 상기 단어의 열을 검색어로 선택하고,

상기 매칭의 결과 수치가 특정 역치보다 높은 단어의 열이 존재하지 않는 경우, 수치가 가장 높은 매칭된 단어의 열을 검색어로 선택하는

음성 검색어 확장 시스템.
제9항에 있어서,

상기 음소 디코더는,

어쿠스틱 모델(Acoustic Model)을 적용하여, 상기 특징 벡터를 적어도 하나 이상의 음소 시퀀스로 변환하여 생성하는

음성 검색어 확장 시스템.
제9항에 있어서,

상기 단어 디코더는,

폰 컨퓨전 매트릭스(Phone Confusion Matrix)를 적용하여 상기 음소 시퀀스를 상기 단어 사전에 등록되어 있는 단어들과 매칭하는

음성 검색어 확장 시스템.
제9항에 있어서,

상기 단어 디코더는,

언어 모델(Language Model)을 통하여 언어적으로 의미가 있는 단어의 열을 추출하여 검색어로 선택하는

음성 검색어 확장 시스템.