WO2022039578A1

WO2022039578A1 - 화자들의 음성을 처리하기 위한 음성 처리 장치

Info

Publication number: WO2022039578A1
Application number: PCT/KR2021/011205
Authority: WO
Inventors: 김정민
Original assignee: 주식회사 아모센스
Priority date: 2020-08-21
Filing date: 2021-08-23
Publication date: 2022-02-24
Also published as: US20230260509A1

Abstract

음성 처리 장치가 개시된다. 음성 처리 장치는 화자의 음성과 연관된 입력 음성 데이터를 수신하도록 구성되는 음성 데이터 수신 회로, 화자의 화자 단말로부터 단말 ID를 포함하는 무선 신호를 수신하도록 구성되는 무선 신호 수신 회로, 메모리 및 무선 신호에 기초하여 화자 단말의 위치를 나타내는 단말 위치 데이터를 생성하고, 생성된 단말 위치 데이터와 단말 ID를 매칭하여 메모리에 저장하도록 구성되는 프로세서를 포함하고, 프로세서는, 입력 음성 데이터를 이용하여 제1위치를 나타내는 제1화자 위치 데이터 및 제1위치에서 발화된 제1음성과 연관된 제1출력 음성 데이터를 생성하고, 메모리를 참조하여 제1화자 위치 데이터에 대응하는 제1단말 ID를 리드하고, 제1단말 ID와 제1출력 음성 데이터를 매칭하여 저장한다.

Description

화자들의 음성을 처리하기 위한 음성 처리 장치

본 발명의 실시 예들은 화자들의 음성을 처리하기 위한 음성 처리 장치에 관한 것이다.

마이크(microphone)는 음성을 인식하고, 인식된 음성을 전기적인 신호인 음성 신호로 변환하는 장치이다. 회의실이나 교실과 같이 복수의 화자(speaker)들이 위치하는 공간 내에 마이크가 배치되는 경우, 상기 마이크는 복수의 화자들로부터 나온 음성들을 모두 수신하고, 복수의 화자들의 음성에 연관된 음성 신호들을 생성한다. 따라서, 복수의 화자들이 동시에 발언하는 경우, 복수의 화자들의 음성 신호들을 분리하는 것이 필요하다. 나아가, 분리된 음성 신호들 각각이 어느 화자에 의한 것인지 파악할 필요가 있다.

본 발명이 해결하고자 하는 과제는 입력 음성 데이터를 이용하여 화자의 위치를 판단하고, 입력 음성 데이터를 화자별로 분리할 수 있는 음성 처리 장치를 제공하는 것에 있다.

본 발명이 해결하고자 하는 과제는 화자 단말의 위치를 결정하고, 입력 음성 데이터의 화자의 위치를 판단하고, 화자의 위치와 대응하는 위치에 존재하는 화자 단말을 식별함으로써, 음성 데이터와 연관된 음성의 화자를 쉽게 식별할 수 있는 음성 처리 장치를 제공하는 것에 있다.

본 발명이 해결하고자 하는 과제는 화자들이 소지하는 화자 단말기에 대응하는 권한 수준에 따라 분리 음성 신호를 처리할 수 있는 음성 처리 장치를 제공하는 것에 있다.

본 발명의 실시 예들에 따른 음성 처리 장치는, 화자의 음성과 연관된 입력 음성 데이터를 수신하도록 구성되는 음성 데이터 수신 회로, 화자의 화자 단말로부터 단말 ID를 포함하는 무선 신호를 수신하도록 구성되는 무선 신호 수신 회로, 메모리 및 무선 신호에 기초하여 화자 단말의 위치를 나타내는 단말 위치 데이터를 생성하고, 생성된 단말 위치 데이터와 단말 ID를 매칭하여 메모리에 저장하도록 구성되는 프로세서를 포함하고, 프로세서는, 입력 음성 데이터를 이용하여 제1위치를 나타내는 제1화자 위치 데이터 및 제1위치에서 발화된 제1음성과 연관된 제1출력 음성 데이터를 생성하고, 메모리를 참조하여 제1화자 위치 데이터에 대응하는 제1단말 ID를 리드하고, 제1단말 ID와 제1출력 음성 데이터를 매칭하여 저장한다.

본 발명의 실시 예들에 따른 음성 처리 장치는, 복수의 화자들에 의해 발화된 음성들에 응답하여 음성 신호를 생성하도록 구성되는 마이크, 음성 신호를 음성들 각각의 음원 위치에 기초하여 음원 분리함으로써, 음성들 각각과 연관된 분리 음성 신호를 생성하도록 구성되는 음성 처리 회로, 화자들의 화자 단말기들의 단말 위치를 측정하도록 구성되는 측위 회로 및 화자 단말기들 각각에 대한 권한 수준을 나타내는 권한 수준 정보를 저장하는 메모리를 포함하고, 음성 처리 회로는, 분리 음성 신호의 음원 위치와 대응하는 단말 위치를 갖는 화자 단말기를 결정하고, 권한 수준 정보를 참조하여, 결정된 화자 단말기에 대응하는 권한 수준에 따라 분리 음성 신호를 처리한다.

본 발명의 실시 예들에 따른 음성 처리 장치는 입력 음성 데이터를 이용하여 화자의 위치를 판단하고, 입력 음성 데이터를 화자별로 분리할 수 있는 효과가 있다.

본 발명의 실시 예들에 따른 음성 처리 장치는 화자 단말의 위치를 결정하고, 입력 음성 데이터의 화자의 위치를 판단하고, 화자의 위치와 대응하는 위치에 존재하는 화자 단말을 식별함으로써, 음성 데이터와 연관된 음성의 화자를 쉽게 식별할 수 있는 효과가 있다.

본 발명의 실시 예들에 따른 음성 처리 장치는 화자들이 소지하는 화자 단말기에 대응하는 권한 수준에 따라 분리 음성 신호를 처리할 수 있는 효과가 있다.

도 1은 본 발명의 실시 예들에 따른 음성 처리 시스템을 나타낸다.

도 2는 본 발명의 실시 예들에 따른 음성 처리 장치를 나타낸다.

도 3은 본 발명의 실시 예들에 따른 음성 처리 장치의 작동 방법을 나타내는 플로우 차트이다.

도 4 내지 도 6은 본 발명의 실시 예들에 따른 음성 처리 장치의 동작을 설명하기 위한 도면이다.

도 7은 본 발명의 실시 예들에 따른 음성 처리 장치의 작동을 나타내는 플로우 차트이다.

도 8 내지 도 10은 본 발명의 실시 예들에 따른 음성 처리 장치의 작동을 설명하기 위한 도면이다.

도 11은 본 발명의 실시 예들에 따른 음성 처리 장치의 동작을 설명하기 위한 도면이다.

도 12은 본 발명의 실시 예들에 따른 음성 처리 장치를 나타낸다.

도 13은 본 발명의 실시 예들에 따른 음성 처리 장치를 나타낸다.

도 14는 본 발명의 실시 예들에 따른 화자 단말기를 나타낸다.

도 15 내지 도 17은 본 발명의 실시 예들에 따른 음성 처리 장치의 동작을 설명하기 위한 도면이다.

도 18은 본 발명의 실시 예들에 따른 화자 단말기의 권한 수준을 나타낸다.

도 19는 본 발명의 실시 예들에 따른 음성 처리 장치의 작동 방법을 나타내는 플로우 차트이다.

도 20은 본 발명의 실시 예들에 따른 음성 처리 장치의 작동을 설명하기 위한 도면이다.

이하, 첨부된 도면들을 참조하여 본 발명의 실시 예들을 설명한다.

도 1은 본 발명의 실시 예들에 따른 음성 처리 시스템을 나타낸다. 도 1을 참조하면, 본 발명의 실시 예들에 따른 음성 처리 시스템(10)은 화자(SPK1~SPK4)의 음성을 수신하고, 화자(SPK1~SPK4)의 음성에 대응하는 음성 데이터를 화자 별로 분리할 수 있다. 실시 예들에 따라, 음성 처리 시스템(10)은 화자(SPK1~SPK4)의 음성에 기초하여 화자(SPK1~SPK4)의 위치를 결정하고, 결정된 위치에 기초하여 음성 데이터를 화자(SPK1~SPK4) 별로 분리할 수 있다.

음성 처리 시스템(10)은 화자(SPK1~SPK4)의 화자 단말기들(ST1~ST4), 화자(SPK1~SPK4)의 음성을 수신하도록 구성되는 복수의 마이크로폰(100-1~100-n (n은 자연수); 집합적으로 100) 및 음성 처리 장치(200)를 포함할 수 있다.

화자(SPK1~SPK4)는 각 위치(P1~P4)에 위치할 수 있다. 실시 예들에 따라, 각 위치(P1~P4)에 위치한 화자(SPK1~SPK4)는 음성을 발화(pronounce)할 수 있다. 예컨대, 제1위치(P1)에 위치한 제1화자(SPK1)는 제1음성을 발화할 수 있고, 제2위치(P2)에 위치한 제2화자(SPK2)는 제2음성을 발화할 수 있고, 제3위치(P3)에 위치한 제3화자(SPK3)는 제3음성을 발화할 수 있고, 제4위치(P4)에 위치한 제4화자(SPK4)는 제4음성을 발화할 수 있다. 한편, 본 발명의 실시 예들이 화자의 수에 한정되는 것은 아니다.

화자(SPK1~SPK4) 각각에 대응하는 화자 단말(ST1~ST4)은 무선 신호를 송신할 수 있다. 실시 예들에 따라, 화자 단말(ST1~ST4)은 화자 단말(ST1~ST4) 각각을 식별하기 위한 단말 ID를 포함하는 무선 신호를 송신할 수 있다. 예컨대, 화자 단말(ST1~ST4)는 ZigBee, Wi-Fi, BLE(bluetooth low energy), UWB(ultra-wideband) 등의 무선 통신 방식에 따라, 무선 신호를 송신할 수 있다.

후술하는 바와 같이, 화자 단말(ST1~ST4)로부터 전송된 무선 신호는 화자 단말(ST1~ST4)의 위치를 계산하는 데 사용될 수 있다.

화자(SPK1~SPK4)의 음성은 복수의 마이크로폰(100)에 의해 수신될 수 있다. 복수의 마이크로폰(100)은 화자(SPK1~SPK4)의 음성을 수신할 수 있는 공간에 배치될 수 있다.

복수의 마이크로폰(100)은 음성과 연관된 음성 신호(VS1~VSn)를 생성할 수 있다. 실시 예들에 따라, 복수의 마이크로폰(100)은 각 위치(P1~P4)에 위치한 화자(SPK1~SPK4)의 음성을 수신하고, 화자(SPK1~SPK4)의 음성을 전기적인 신호인 음성 신호(VS1~VSn)로 변환할 수 있다. 예컨대, 제1마이크로폰(100-1)은 화자(SPK1~SPK4)의 음성을 수신하고, 화자(SPK1~SPK4)의 음성과 연관된 제1음성 신호(VS1)를 생성할 수 있다. 제1마이크로폰(100-1)에 의해 생성된 제1음성 신호(VS1)는 적어도 하나 이상의 화자(SPK1~SPK4)의 음성에 대응할 수 있다.

한편, 본 명세서에서 설명되는 음성 신호는 아날로그 타입의 신호 또는 디지털 타입의 데이터일 수 있다. 실시 예들에 따라, 아날로그 타입의 신호와 디지털 타입의 데이터는 상호 변환될 수 있고, 신호의 타입(아날로그 또는 디지털)이 바뀌더라도 포함된 정보는 실질적으로 동일하므로, 본 발명의 실시 예들에 대한 설명에 있어서, 디지털 타입의 음성 신호와 아날로그 타입의 음성 신호를 혼용하여 설명하도록 한다.

복수의 마이크로폰(100)은 음성 신호들(VS1~VSn)을 출력할 수 있다. 실시 예들에 따라, 복수의 마이크로폰(100)은 음성 신호들(VS1~VSn)을 음성 처리 장치(200)로 전송할 수 있다. 예컨대, 복수의 마이크로폰(100)은 유선 방식 또는 무선 방식에 따라 음성 신호들(VS1~VSn)을 음성 처리 장치(200)로 전송할 수 있다.

복수의 마이크로폰(100)은 빔포밍(beamforming) 마이크로 구성되어, 다방향(multi-direction)으로부터 음성을 입력받을 수 있다. 실시 예들에 따라, 복수의 마이크로폰(100)은 서로 이격되어 배치되어, 하나의 마이크 어레이를 구성할 수 있으나, 본 발명의 실시 예들이 이에 한정되는 것은 아니다.

복수의 마이크로폰(100) 각각은 임의의 특정 방향의 음성을 수신하도록 구성되는 지향성 마이크이거나, 또는, 모든 방향의 음성을 수신하도록 구성되는 무지향성 마이크일 수 있다.

음성 처리 장치(200)는 연산 처리 기능을 갖는 컴퓨팅 장치일 수 있다. 실시 예들에 따라, 음성 처리 장치(200)는 컴퓨터, 노트북, 모바일 디바이스, 스마트폰 또는 웨어러블 디바이스로 구현될 수 있으나, 이에 한정되는 것은 아니다. 예컨대, 음성 처리 장치(200)는 연산 처리 기능을 갖는 적어도 하나의 집적 회로를 포함할 수 있다.

음성 처리 장치(200)는 화자 단말(ST1~ST4)로부터 전송된 무선 신호를 수신할 수 있다. 실시 예들에 따라, 음성 처리 장치(200)는 화자 단말(ST1~ST4)로부터 전송된 무선 신호에 기초하여, 화자 단말(ST1~ST4)의 공간적 위치를 계산하고, 화자 단말(ST1~ST4)의 위치를 나타내는 단말 위치 데이터를 생성할 수 있다.

음성 처리 장치(200)는 단말 위치 데이터와 대응하는 단말 ID를 매칭하여 저장할 수 있다.

음성 처리 장치(200)는 화자(SPK1~SPK4)의 음성과 연관된 입력 음성 데이터를 수신하고, 입력 음성 데이터로부터 화자(SPK1~SPK4) 각각의 개별적인 음성을 나타내는 음성 데이터를 분리(또는 생성)할 수 있다.

실시 예들에 따라, 음성 처리 장치(200)는 복수의 마이크로폰(100)으로 부터 전송되는 음성 신호들(VS1~VSn)을 수신하고, 음성 신호들(VS1~VSn)로부터 화자(SPK1~SPK4)의 음성과 연관된 입력 음성 데이터를 획득할 수 있다.

한편, 본 명세서에서는 음성 처리 장치(200)가 복수의 마이크로폰(100)으로부터 음성 신호들(VS1~VSn)을 수신하여 화자(SPK1~SPK4)의 음성과 연관된 입력 음성 데이터를 획득하는 것을 가정하고 설명하나, 실시 예들에 따라, 음성 처리 장치(200)는 화자(SPK1~SPK4)의 음성과 연관된 입력 음성 데이터를 외부 장치로부터 수신하는 것도 가능하다.

음성 처리 장치(200)는 화자(SPK1~SPK4)의 음성과 연관된 입력 음성 데이터를 이용하여 화자(SPK1~SPK4)의 위치(즉, 음원의 위치)를 결정할 수 있다. 실시 예들에 따라, 음성 처리 장치(200)는 복수의 마이크로폰들(100) 사이의 거리, 복수의 마이크로폰들(100) 각각이 화자(SPK1~SPK4)의 음성을 수신한 시점들 사이의 차이, 화자(SPK1~SPK4)의 음성의 크기 중 적어도 하나에 기초하여, 화자(SPK1~SPK4)의 음성과 연관된 입력 음성 데이터로부터, 음원의 위치(즉, 화자의 위치)를 나타내는 화자 위치 데이터를 생성할 수 있다.

음성 처리 장치(200)는 음성의 음원의 위치(즉, 화자(SPK1~SPK4)의 위치)를 나타내는 화자 위치 데이터에 기초하여, 입력 음성 데이터를 화자의 위치(즉, 음원의 위치)에 따라 분리할 수 있다. 실시 예들에 따라, 음성 처리 장치(200)는 화자 위치 데이터에 기초하여, 입력 음성 데이터로부터 특정 위치로부터 발화된 음성과 연관된 출력 음성 데이터를 생성할 수 있다.

예컨대, 제1화자(SPK1)와 제2화자(SPK2)가 시간적으로 중첩해서 발화하는 경우, 제1화자(SPK1)와 제2화자(SPK2)의 음성은 중첩되므로, 입력 음성 데이터 또한 제1화자(SPK1)의 음성과 연관된 음성 데이터와 제2화자(SPK2)의 음성관 연관된 음성 데이터를 포함할 수 있다. 상술한 바와 같이, 음성 처리 장치(200)는 제1화자(SPK1)의 음성 및 제2화자(SPK2)의 음성과 연관된 입력 음성 데이터로부터 제1화자(SPK1) 및 제2화자(SPK2) 각각의 위치를 나타내는 화자 위치 데이터를 생성하고, 화자 위치 데이터에 기초하여 입력 음성 데이터로부터 제1화자(SPK1)의 음성을 나타내는 제1출력 음성 데이터와, 제2화자(SPK2)의 음성을 나타내는 제2출력 음성 데이터를 생성할 수 있다. 이 때, 제1출력 음성 데이터는 화자들(SPK1~SPK4)의 음성들 중 제1화자(SPK1)의 음성과 가장 높은 연관도를 가지는 음성 데이터일 수 있다. 다시 말하면, 제1출력 음성 데이터에 포함된 음성 성분 중에서 제1화자(SPK1)의 음성 성분의 비중이 가장 높을 수 있다.

본 발명의 실시 예들에 따른 음성 처리 장치(200)는 입력 음성 데이터를 이용하여 화자(SPK1~SPK4)의 위치를 나타내는 화자 위치 데이터를 생성하고, 화자 위치 데이터에 대응하는 단말 ID를 결정하고, 결정된 단말 ID와 화자(SPK1~SPK4) 각각의 음성과 연관된 출력 음성 데이터를 서로 매칭하여 저장할 수 있다.

즉, 음성 처리 장치(200)는 화자(SPK1~SPK4) 각각의 음성과 연관된 음성 데이터를, 화자(SPK1~SPK4)의 화자 단말(ST1~ST4)의 단말 ID와 매칭시켜 저장할 수 있고, 이에 따라, 화자(SPK1~SPK4)의 음성과 연관된 음성 데이터는 단말 ID를 통해 식별될 수 있다. 다시 말하면, 다수의 화자가 동시에 음성을 발화하더라도, 음성 처리 장치(200)는 음성 데이터를 화자 별로 분리할 수 있는 효과가 있다.

실시 예들에 따라, 본 발명의 실시 예들에 따른 음성 처리 시스템(10)은 서버(300)를 더 포함할 수 있고, 음성 처리 장치(200)는 화자(SPK1~SPK4)의 음성과 연관된 출력 음성 데이터를 서버(300)로 전송할 수 있다.

실시 예들에 따라, 서버(300)는 출력 음성 데이터를 텍스트 데이터로 변환하고, 변환된 텍스트 데이터를 음성 처리 장치(200)로 전송하고, 음성 처리 장치(200)는 변환된 화자(SPK1~SPK4)의 음성과 연관된 텍스트 데이터를 단말 ID와 매칭하여 저장할 수 있다. 또한, 서버(300)는 제1언어의 텍스트 데이터를 제2언어의 텍스트 데이터로 변환하여 음성 처리 장치(200)로 전송할 수 있다.

실시 예들에 따라, 본 발명의 실시 예들에 따른 음성 처리 시스템(10)은 스피커(400)를 더 포함할 수 있다. 음성 처리 장치(200)는 화자(SPK1~SPK4)의 음성과 연관된 출력 음성 데이터를 스피커(400)로 전송할 수 있다. 스피커(400)는 화자(SPK1~SPK4)의 음성에 대응하는 음성을 출력할 수 있다.

도 2는 본 발명의 실시 예들에 따른 음성 처리 장치를 나타낸다. 도 2를 참조하면, 음성 처리 장치(200)는 무선 신호 수신 회로(210), 음성 데이터 수신 회로(220), 메모리(230) 및 프로세서(240)를 포함할 수 있다. 실시 예들에 따라, 음성 처리 장치(200)는 음성 데이터 출력 회로(250)를 선택적으로 더 포함할 수 있다.

무선 신호 수신 회로(210)는 화자 단말(ST1~ST4)로부터 전송된 무선 신호를 수신할 수 있다. 실시 예들에 따라, 무선 신호 수신 회로(210)는 안테나를 포함할 수 있고, 안테나를 통해 화자 단말(ST1~ST4)로부터 전송된 무선 신호를 수신할 수 있다.

음성 수신 회로(220)는 화자(SPK1~SPK4)의 음성과 연관된 입력 음성 데이터를 수신할 수 있다. 실시 예들에 따라, 음성 수신 회로(220)는 유선 통신 방식 또는 무선 통신 방식에 따라 화자(SPK1~SPK4)의 음성과 연관된 입력 음성 데이터를 수신할 수 있다.

실시 예들에 따라, 음성 수신 회로(220)는 ADC(analog to digital) 컨버터를 포함하고, 복수의 마이크로폰(100)으로부터 아날로그 타입의 음성 신호들(VS1~VSn)을 수신하고, 음성 신호들(VS1~VSn)을 디지털 타입의 입력 음성 데이터로 변환하고, 변환된 입력 음성 데이터를 저장할 수 있다.

실시 예들에 따라, 음성 수신 회로(220)는 무선 통신 방식에 따라 통신 가능한 통신 회로를 포함하고, 통신 회로를 통해 입력 음성 데이터를 수신할 수 있다.

메모리(230)는 음성 처리 장치(200)의 작동에 필요한 데이터를 저장할 수 있다. 실시 예들에 따라, 메모리(230)는 비휘발성 메모리 및 휘발성 메모리 중 적어도 하나를 포함할 수 있다.

프로세서(240)는 음성 처리 장치(200)의 전반적인 동작을 제어할 수 있다. 실시 예들에 따라, 프로세서(240)는 무선 신호 수신 회로(210), 음성 데이터 수신 회로(220), 메모리(230) 및 음성 데이터 출력 회로(250)의 동작을 제어하기 위한 제어 명령을 생성하고, 무선 신호 수신 회로(210), 음성 데이터 수신 회로(220), 메모리(230) 및 음성 데이터 출력 회로(250) 각각으로 전송할 수 있다.

프로세서(240)는 연산 처리 기능을 갖는 집적회로로 구현될 수 있다. 예컨대, 프로세서(240)는 CPU(central processing unit), MCU(micro controller unit), DSP(digital signal processor), GPU(graphics processing unit), ASIC(application specific integrated circuit) 또는 FPGA(field programmable gate array)를 포함할 수 있으나, 본 발명의 실시 예들이 이에 한정되는 것은 아니다.

본 명세서에서 설명되는 프로세서(240)는 하나 또는 그 이상의 소자로 구현될 수 있다. 예컨대, 프로세서(240)는 복수의 서브 프로세서들을 포함할 수 있다.

프로세서(240)는 무선 신호 수신 회로(210)에 의해 수신된 화자 단말(ST1~ST4)의 무선 신호에 기초하여, 화자 단말(ST1~ST4)의 위치를 측정할 수 있다.

실시 예들에 따라, 프로세서(240)는 화자 단말(ST1~ST4)의 무선 신호의 수신 강도에 기초하여, 화자 단말(ST1~ST4)의 위치를 측정하고, 화자 단말(ST1~ST4)의 위치를 나타내는 단말 위치 데이터를 생성할 수 있다.

실시 예들에 따라, 프로세서(240)는 화자 단말(ST1~ST4)에 포함된 타임 스탬프를 이용하여 무선 신호의 이동 시간(time of flight (TOF))을 계산하고, 계산된 이동 시간에 기초하여 화자 단말(ST1~ST4)의 위치를 측정하고, 화자 단말(ST1~ST4)의 위치를 나타내는 단말 위치 데이터를 생성할 수 있다. 프로세서(240)는 생성된 단말 위치 데이터를 메모리(230)에 저장할 수 있다.

이 외에도, 프로세서(240)는 다양한 무선 통신 방식에 따라 무선 신호에 기초하여 화자 단말(ST1~ST4)의 위치를 나타내는 단말 위치 데이터를 생성할 수 있으며, 본 발명의 실시 예들이 단말 위치 데이터를 생성하기 위한 구체적인 방식에 한정되는 것은 아니다.

프로세서(240)는 화자(SPK1~SPK4)의 음성과 연관된 입력 음성 데이터를 이용하여 화자(SPK1~SPK)의 위치(즉, 음성의 음원 위치)를 판단하고, 화자(SPK1~SPK4)의 위치를 나타내는 화자 위치 데이터를 생성할 수 있다. 예컨대, 프로세서(240)는 화자 위치 데이터를 메모리(230)에 저장할 수 있다.

프로세서(240)는 복수의 마이크로폰들(100) 사이의 거리, 복수의 마이크로폰들(100) 각각이 화자(SPK1~SPK4)의 음성을 수신한 시점들 사이의 차이, 화자(SPK1~SPK4)의 음성의 크기 중 적어도 하나에 기초하여, 화자(SPK1~SPK4)의 음성과 연관된 입력 음성 데이터로부터 화자(SPK1~SPK4)의 위치를 나타내는 화자 위치 데이터를 생성할 수 있다.

프로세서(240)는 화자(SPK1~SPK4)의 위치를 나타내는 화자 위치 데이터에 기초하여, 입력 음성 데이터를 화자의 위치(즉, 음원의 위치)에 따라 분리할 수 있다. 예컨대, 음성 처리 장치(200)는 입력 음성 데이터와 화자 위치 데이터에 기초하여, 입력 음성 데이터로부터 각 화자(SPK1~SPK4)의 음성과 연관된 출력 음성 데이터를 생성할 수 있고, 출력 음성 데이터와 해당하는 화자 위치 데이터를 매칭하여 저장할 수 있다.

실시 예들에 따라, 프로세서(240)는 제1화자(SPK1)의 음성 및 제2화자(SPK2)의 음성과 연관된 중첩된 입력 음성 데이터로부터 제1화자(SPK1) 및 제2화자(SPK2) 각각의 위치를 나타내는 화자 위치 데이터를 생성하고, 화자 위치 데이터에 기초하여 중첩된 입력 음성 데이터로부터 제1화자(SPK1)의 음성과 연관된 제1출력 음성 데이터와 제2화자(SPK2)의 음성과 연관된 제2출력 음성 데이터를 생성할 수 있다. 예컨대, 프로세서(240)는 제1출력 음성 데이터와 제1화자 위치 데이터를 매칭하여 저장하고, 제2출력 음성 데이터와 제2화자 위치 데이터를 매칭하여 저장할 수 있다.

프로세서(240)는 음성 데이터에 대응하는 단말 ID를 결정할 수 있다. 실시 예들에 따라, 프로세서(240)는 음성 데이터와 대응하는 화자 위치 데이터가 나타내는 위치와 동일 또는 인접한 위치를 나타내는 단말 위치 데이터를 결정하고, 단말 위치 데이터에 대응하는 단말 ID를 결정할 수 있다. 화자 위치 데이터와 단말 위치 데이터가 동일 또는 인접한 위치를 나타내므로, 화자 위치 데이터에 대응하는 단말 ID는 해당 음성을 발언한 화자의 화자 단말의 단말 ID가 된다. 따라서, 단말 ID를 통해 음성 데이터에 대응하는 화자를 식별할 수 있다.

음성 데이터 출력 회로(250)는 화자(SPK1~SPK4)의 음성과 연관된 출력 음성 데이터를 출력할 수 있다. 실시 예들에 따라, 음성 데이터 출력 회로(250)는 유선 통신 방식 또는 무선 통신 방식에 따라 화자(SPK1~SPK4)의 음성과 연관된 출력 음성 데이터를 출력할 수 있다.

음성 데이터 출력 회로(250)는 화자(SPK1~SPK4)의 음성과 연관된 출력 음성 데이터를 서버(300) 또는 스피커(400)로 출력할 수 있다.

실시 예들에 따라, 음성 데이터 출력 회로(250)는 DAC(digital to analog) 컨버터를 포함하고, 디지털 타입의 출력 음성 데이터를 아날로그 타입의 음성 신호로 변환하고, 변환된 음성 신호를 스피커(400)로 출력할 수 있다.

실시 예들에 따라, 음성 신호 출력 회로(250)는 통신 회로를 포함하고, 출력 음성 데이터를 서버(300) 또는 스피커(400)로 전송할 수 있다.

음성 데이터 수신 회로(220)에 의해 수신된 화자(SPK1~SPK4)의 음성과 연관된 입력 음성 데이터와, 음성 데이터 출력 회로(250)에 의해 출력되는 화자(SPK1~SPK4)의 음성과 연관된 출력 음성 데이터는 데이터 관점에서 상이할 수 있으나, 동일한 음성을 나타낼 수 있다.

도 3은 본 발명의 실시 예들에 따른 음성 처리 장치의 작동 방법을 나타내는 플로우 차트이다. 도 3을 참조하여 설명되는 작동 방법은 컴퓨터 판독 가능한 저장 매체에 저장된 프로그램의 형태로 구현될 수 있다.

도 3을 참조하면, 음성 처리 장치(200)는 화자 단말(ST1~ST4)로부터 화자 단말(ST1~ST4)의 단말 ID를 포함하는 무선 신호를 수신할 수 있다(S110). 실시 예들에 따라, 음성 처리 장치(200)는 화자 단말(ST1~ST4)로부터 화자 단말(ST1~ST4)의 단말 ID를 및 화자 식별자를 포함하는 무선 신호를 수신할 수 있다(S110).

음성 처리 장치(200)는 수신된 무선 신호에 기초하여, 화자 단말(ST1~ST4)의 위치를 나타내는 단말 위치 데이터를 생성할 수 있다(S120).

실시 예들에 따라, 음성 처리 장치(200)는 무선 신호의 수신 강도에 기초하여, 화자 단말(ST1~ST4)의 위치를 나타내는 단말 위치 데이터를 생성할 수 있다.

또한, 실시 예들에 따라, 음성 처리 장치(200)는 무선 신호에 포함된 타임 스탬프에 기초하여, 화자 단말(ST1~ST4)의 위치를 나타내는 단말 위치 데이터를 생성할 수 있다. 예컨대, 음성 처리 장치(200)는 화자 단말(ST1~ST4)와 UWB 방식에 따라 통신하고, UWB 측위 기술을 이용하여 화자 단말(ST1~ST4)의 위치를 나타내는 단말 위치 데이터를 생성할 수 있다.

음성 처리 장치(200)는 생성된 단말 위치 데이터(TPD)와 단말 ID(TID)를 매칭하여 메모리(230)에 저장할 수 있다(S130). 예컨대, 음성 처리 장치(200)는 제1화자 단말(ST1)의 위치를 나타내는 제1단말 위치 데이터와, 제1화자 단말(ST1)의 제1단말 ID를 매칭하여 저장할 수 있다.

도 4 내지 도 6은 본 발명의 실시 예들에 따른 음성 처리 장치의 동작을 설명하기 위한 도면이다. 도 4 내지 도 6을 참조하면, 음성 처리 장치(200)는 화자 단말(ST1~ST4)로부터의 무선 신호를 이용하여, 화자 단말(ST1~ST4)의 단말 ID와 화자 단말(ST1~ST4)의 위치를 나타내는 단말 위치 데이터를 저장함으로써, 화자 단말(ST1~ST4)의 위치를 사전에 등록 및 저장할 수 있다.

제1화자(SPK1)는 제1위치(P1)에 위치하고, 제2화자(SPK2)는 제2위치(P2)에 위치하고, 제3화자(SPK3)는 제3위치(P3)에 위치하고, 제4화자(SPK4)는 제4위치(P4)에 위치한다. 음성 처리 장치(200)는 화자 단말(ST1~ST4)로부터 전송된 무선 신호를 수신할 수 있다. 무선 신호는 단말 ID(TID)를 포함할 수 있다. 실시 예들에 따라, 무선 신호는 대응하는 화자(SPK1~SPK4)를 식별하기 위한 화자 식별자(SID)를 더 포함할 수 있다. 예컨대, 화자 식별자(SID)는 화자(SPK1~SPK4)에 의한 입력에 따라 화자 단말(TS1~TS4)에 의해 생성된 데이터일 수 있다.

음성 처리 장치(200)는 무선 신호를 이용하여 화자 단말(ST1~ST4)의 위치를 나타내는 단말 위치 데이터(TPD)를 생성할 수 있고, 단말 위치 데이터(TPD)와 대응하는 단말 ID(TID)를 매칭하여 저장할 수 있다.

도 4에 도시된 바와 같이, 제1화자(SPK1)의 제1화자 단말(ST1)로부터 무선 신호가 출력되면, 음성 처리 장치(200)는 제1화자 단말(ST1)의 무선 신호를 수신하고, 수신된 무선 신호에 기초하여 제1화자 단말(ST1)의 위치를 나타내는 제1단말 위치 데이터(TPD1)를 생성할 수 있고, 제1단말 위치 데이터(TPD1)와 제1단말 ID(TID1)를 매칭하여 저장할 수 있다. 실시 예들에 따라, 제1화자 단말(ST1)로부터 무선 신호는 제1화자(SPK1)를 나타내는 제1화자 단말자(SID1)를 더 포함할 수 있고, 음성 처리 장치(200)는 제1단말 위치 데이터(TPD1), 제1단말 ID(TID1) 및 제1화자 식별자(SID1)를 매칭하여 저장할 수 있다.

도 5에 도시된 바와 같이, 제2화자(SPK2)의 제2화자 단말(ST2)로부터 무선 신호가 출력되면, 음성 처리 장치(200)는 제2화자 단말(ST2)의 무선 신호를 수신하고, 수신된 무선 신호에 기초하여 제2화자 단말(ST2)의 위치를 나타내는 제2단말 위치 데이터(TPD2)를 생성할 수 있고, 제2단말 위치 데이터(TPD2)와 제2단말 ID(TID2)를 매칭하여 저장할 수 있다. 실시 예들에 따라, 제2화자 단말(ST2)로부터 무선 신호는 제2화자(SPK2)를 나타내는 제2화자 단말자(SID2)를 더 포함할 수 있고, 음성 처리 장치(200)는 제2단말 위치 데이터(TPD2), 제2단말 ID(TID2) 및 제2화자 식별자(SID2)를 매칭하여 저장할 수 있다.

도 6에 도시된 바와 같이, 제3화자(SPK3)의 제3화자 단말(ST3) 및 제4화자(SPK4)의 제4화자 단말(ST4)로부터 무선 신호가 출력되면, 음성 처리 장치(200)는 제3화자 단말(ST3) 및 제4화자 단말(ST4)의 무선 신호를 수신하고, 수신된 무선 신호에 기초하여 제3화자 단말(ST3)의 위치를 나타내는 제3단말 위치 데이터(TPD3) 및 제4화자 단말(ST4)의 위치를 나타내는 제4단말 위치 데이터(TPD4)를 생성할 수 있다.

음성 처리 장치(200)는 제3단말 위치 데이터(TPD3)와 제3단말 ID(TID3)를 매칭하여 저장할 수 있고, 제4단말 위치 데이터(TPD4)와 제4단말 ID(TID4)를 매칭하여 저장할 수 있다.

도 7은 본 발명의 실시 예들에 따른 음성 처리 장치의 작동을 나타내는 플로우 차트이다. 도 7을 참조하여 설명되는 작동 방법은 컴퓨터 판독 가능한 저장 매체에 저장된 프로그램의 형태로 구현될 수 있다.

도 7을 참조하면, 음성 처리 장치(200)는 화자(SPK1~SPK4)의 음성에 관련된 입력 음성 데이터를 수신할 수 있다(S120). 음성 처리 장치(200)는 수신된 입력 음성 데이터를 저장할 수 있다.

예컨대, 음성 처리 장치(200)는 복수의 마이크로폰(100)으로부터 아날로그 타입의 음성 신호들을 수신하고, 음성 신호들로부터 입력 음성 데이터를 획득할 수 있다. 예컨대, 음성 처리 장치(200)는 무선 통신 방식에 따라 입력 음성 데이터를 수신할 수 있다.

음성 처리 장치(200)는 입력 음성 데이터를 이용하여, 화자(SPK1~SPK4)의 위치를 나타내는 화자 위치 데이터 및 각 화자의 음성과 연관된 출력 음성 데이터를 생성할 수 있다(S220).

음성 처리 장치(200)는 입력 음성 데이터를 이용하여, 입력 음성 데이터와 연관된 음성의 음원의 위치를 계산할 수 있다. 이 때, 음성 데이터의 음원의 위치는 곧 화자(SPK1~SPK4)의 위치가 된다. 음성 처리 장치(200)는 계산된 음원의 위치를 나타내는 화자 위치 데이터를 생성할 수 있다.

음성 처리 장치(200)는 입력 음성 데이터를 이용하여, 화자(SPK1~SPK4)의 음성과 연관된 출력 음성 데이터를 생성할 수 있다.

*80실시 예들에 따라, 음성 처리 장치(200)는 화자 위치 데이터에 기초하여, 입력 음성 데이터로부터 화자 위치 데이터에 대응하는 출력 음성 데이터를 생성할 수 있다. 예컨대, 음성 처리 장치(200)는 화자 위치 데이터에 기초하여, 입력 음성 데이터로부터 제1위치에 대응하는 제1출력 음성 데이터를 생성할 수 있다. 즉, 제1출력 음성 데이터는 제1위치에 위치한 화자의 음성과 연관된 음성 데이터일 수 있다. 다시 말하면, 음성 처리 장치(200)는 입력 음성 데이터를 위치 별로 분리하여, 각 위치에 대응하는 출력 음성 데이터를 생성할 수 있다.

예컨대, 음성 처리 장치(200)는 화자 위치 데이터와, 화자 위치 데이터에 대응하는 출력 음성 데이터를 매칭하여 저장할 수 있다.

음성 처리 장치(200)는 화자 위치 데이터에 대응하는 단말 ID를 결정할 수 있다(S230). 실시 예들에 따라, 음성 처리 장치(200)는 저장된 단말 위치 데이터 중에서 화자 위치 데이터에 대응하는 단말 위치 데이터를 결정하고, 결정된 단말 위치 데이터와 매칭되어 저장된 단말 ID를 결정할 수 있다. 예컨대, 음성 처리 장치(200)는 메모리(230)에 저장된 단말 위치 데이터 중에서, 화자 위치 데이터가 나타내는 위치와 동일 또는 인접한 위치를 나타내는 단말 위치 데이터를, 화자 위치 데이터에 대응하는 단말 위치 데이터로서 결정할 수 있다.

예컨대, 단말 ID는 화자 단말(ST1~ST4)를 식별하기 위한 데이터이고, 화자 단말(ST1~ST4) 각각은 화자(SPK1~SPK4)에 대응하는 것이므로, 화자 위치 데이터에 대응하는 단말 ID는, 화자 위치 데이터에 대응하는 위치에 위치한 화자를 나타낼 수 있다. 예컨대, 제1화자 위치 데이터가 제1위치(P1)를 나타내는 경우, 제1화자 위치 데이터에 대응하는 단말 ID는 제1위치(P1)에 위치한 제1화자(SPK1)의 제1화자 단말(ST1)의 제1단말 ID일 수 있다.

음성 처리 장치(200)는 화자 위치 데이터에 대응하는 단말 ID와, 화자 위치 데이터에 대응하는 출력 음성 데이터를 매칭하여 저장할 수 있다(S240). 예컨대, 음성 처리 장치(200)는 제1화자 위치 데이터에 대응하는 제1단말 ID를 결정하고, 제1단말 ID와 제1화자 위치 데이터에 대응하는 제1출력 음성 데이터를 매칭하여 저장할 수 있다.

예컨대, 상술한 바와 같이, 화자 위치 데이터에 대응하는 단말 ID는, 화자 위치 데이터에 대응하는 위치에 위치한 화자의 화자 단말을 나타낼 수 있다. 또한, 화자 위치 데이터에 대응하는 출력 음성 데이터는 화자 위치 데이터에 대응하는 위치에서의 음성과 연관된다. 따라서, 화자 위치 데이터에 대응하는 단말 ID를 통해, 화자 위치 데이터에 대응하는 출력 음성 데이터의 화자의 화자 단말을 식별할 수 있다. 예컨대, 제1화자 위치 데이터가 제1위치(P1)를 나타내는 경우, 제1화자 위치 데이터에 대응하는 제1출력 음성 데이터는 제1화자(SPK1)의 음성과 연관된 음성 데이터이고, 제1화자 위치 데이터에 대응하는 제1단말 ID는 제1화자 단말(ST1)의 단말 ID이다.

따라서, 본 발명의 실시 예들에 따르면, 입력 음성 데이터로부터 화자 위치 데이터와 화자 위치 데이터에 대응하는 출력 음성 데이터를 생성하고, 화자 위치 데이터와 단말 위치 데이터를 비교하여, 출력 음성 데이터의 화자(또는 화자 단말)을 식별할 수 있는 효과가 있다.

도 8 내지 도 10은 본 발명의 실시 예들에 따른 음성 처리 장치의 작동을 설명하기 위한 도면이다. 도 8 내지 도 10을 참조하면, 음성 처리 장치(200)는 단말 위치 데이터(TPD) 및 단말 위치 데이터(TPD)에 대응하는 단말 ID(TID)를 저장할 수 있다. 예컨대, 제1단말 위치 데이터(TPD)는 제1위치(P1)를 나타낼 수 있고, 제1단말 ID(TID1)은 제1화자 단말(ST1)을 식별하기 위한 데이터일 수 있다.

도 8에 도시된 바와 같이, 제1화자(SPK1)가 제1음성 "◎◎◎"을 발화한다. 음성 처리 장치(200)는 제1음성 "◎◎◎"과 연관된 입력 음성 데이터를 수신할 수 있다. 예컨대, 복수의 마이크로폰(100)은 제1음성 "◎◎◎"에 대응하는 음성 신호들(VS1~VSn)을 생성할 수 있고, 음성 처리 장치(200)는 제1화자(SPK1)의 음성 "◎◎◎"에 대응하는 음성 신호들(VS1~VSn)을 수신하고, 음성 신호들(VS1~VSn)로부터 입력 음성 데이터를 생성할 수 있다.

음성 처리 장치(200)는 제1음성 "◎◎◎"과 연관된 입력 음성 데이터를 이용하여, 음성 "◎◎◎"의 음원의 위치, 즉, 제1화자(SPK1)의 제1위치(P1)를 나타내는 제1화자 위치 데이터를 생성할 수 있다.

또한, 음성 처리 장치(200)는 제1화자 위치 데이터를 이용하여, 입력 음성 데이터로부터 제1위치(P1)에서 발화된 음성과 연관된 제1출력 음성 데이터(OVD1)를 생성할 수 있다. 예컨대, 제1출력 음성 데이터(OVD1)는 음성 "◎◎◎"과 연관될 수 있다.

음성 처리 장치(200)는 메모리(230)에 저장된 단말 위치 데이터(TPD) 중에서 제1화자 위치 데이터와 대응하는 제1단말 위치 데이터(TPD1)를 결정할 수 있다. 예컨대, 제1화자 위치 데이터가 나타내는 위치와 제1단말 위치 데이터(TPD1)가 나타내는 위치 사이의 거리는, 기준 거리 미만일 수 있다.

음성 처리 장치(200)는 제1단말 위치 데이터(TPD1)에 매칭되어 저장된 제1단말 ID(TID1)을 결정할 수 있다. 예컨대, 음성 처리 장치(200)는 제1단말 ID(TID1)를 리드할 수 있다.

음성 처리 장치(200)는 제1출력 음성 데이터(OVD1)와 제1단말 ID(TID1)를 매칭하여 저장할 수 있다. 실시 예들에 따라, 음성 처리 장치(200)는 음성 "◎◎◎"과 연관된 입력 음성 데이터의 수신 시점(예컨대, t1), 제1출력 음성 데이터(OVD1) 및 제1단말 ID(TID1)을 매칭하여 저장할 수 있다.

즉, 음성 처리 장치(200)는 제1위치(P1)에서 발화된 음성 "◎◎◎"과 연관된 제1출력 음성 데이터(OVD1)와 제1단말 ID(TID1)을 매칭하여 저장할 수 있고, 제1단말 ID(TID1)은 제1화자 단말(ST1)을 나타내므로, 사용자는 제1단말 ID(TID1)를 이용하면, 음성 "◎◎◎"은 제1화자(SPK1)로부터 발화되었음을 식별할 수 있다.

도 9을 참조하면, 도 8과 마찬가지로, 음성 처리 장치(200)는 제2화자(SPK2)에 의해 발화된 제2음성 "☆☆☆"과 연관된 입력 음성 데이터를 수신하고, 입력 음성 데이터를 이용하여, 음성 "☆☆☆"의 음원의 위치, 즉, 제2화자(SPK2)의 제2위치(P2)를 나타내는 제2화자 위치 데이터를 생성할 수 있다.

또한, 음성 처리 장치(200)는 제2화자 위치 데이터를 이용하여, 입력 음성 데이터로부터 제2위치(P2)에서 발화된 음성 "☆☆☆"과 연관된 제2출력 음성 데이터(OVD2)를 생성할 수 있다.

음성 처리 장치(200)는 메모리(230)에 저장된 단말 위치 데이터(TPD) 중에서 제2화자 위치 데이터와 대응하는 제2단말 위치 데이터(TPD2)를 결정하고, 제2단말 위치 데이터(TPD2)에 매칭되어 저장된 제2단말 ID(TID2)을 결정하고, 제2단말 ID(TID2)를 리드할 수 있다. 음성 처리 장치(200)는 음성 "☆☆☆"과 연관된 제2출력 음성 데이터(OVD2)와 제2단말 ID(TID2)를 매칭하여 저장할 수 있다.

도 10을 참조하면, 음성 처리 장치(200)는 제3화자(SPK3)에 의해 발화된 제3음성 "□□□" 및 제4화자(SPK4)에 의해 발화된 제4음성 "△△△"과 연관된 입력 음성 데이터를 수신할 수 있다.

음성 처리 장치(200)는 제3화자(SPK3)의 음성 "□□□"과 제4화자(SPK4)의 음성 "△△△"이 중첩된 음성과 연관된 (중첩된) 입력 음성 데이터를 수신하고, 중첩된 입력 음성 데이터를 이용하여, 제3화자(SPK3)의 제3위치(P3)를 나타내는 제3화자 위치 데이터 및 제4화자(SPK4)의 제4위치(P4)를 나타내는 제4화자 위치 데이터를 생성할 수 있다.

또한, 음성 처리 장치(200)는 제3 및 제4화자 위치 데이터를 이용하여, 중첩된 입력 음성 데이터로부터 제3위치(P3)에서 발화된 음성 "□□□"과(만) 연관된 제3출력 음성 데이터(OVD3) 및 제4위치(P4)에서 발화된 음성 "△△△"과(만) 연관된 제4출력 음성 데이터(OVD4)를 생성할 수 있다.

즉, 음성 처리 장치(200)는 음성 "□□□"과 음성 "△△△"이 중첩된 입력 음성 데이터로부터, 음성 "□□□"과 연관된 제3출력 음성 데이터(OVD3) 및 음성 "△△△"과 연관된 제4출력 음성 데이터(OVD4)를 분리 및 생성할 수 있다.

음성 처리 장치(200)는 메모리(230)에 저장된 단말 위치 데이터(TPD) 중에서 제3화자 위치 데이터와 대응하는 제3단말 위치 데이터(TPD3)를 결정하고, 제3단말 위치 데이터(TPD3)에 매칭되어 저장된 제3단말 ID(TID3)을 결정하고, 제3단말 ID(TID3)를 리드할 수 있다. 음성 처리 장치(200)는 제3화자(SPK3)에 의해 발화된 음성 "□□□"과 연관된 제3출력 음성 데이터(OVD3)와 제3단말 ID(TID3)를 매칭하여 저장할 수 있다.

또한, 음성 처리 장치(200)는 메모리(230)에 저장된 단말 위치 데이터(TPD) 중에서 제4화자 위치 데이터와 대응하는 제4단말 위치 데이터(TPD4)를 결정하고, 제4단말 위치 데이터(TPD4)에 매칭되어 저장된 제4단말 ID(TID4)을 결정하고, 제4단말 ID(TID4)를 리드할 수 있다. 음성 처리 장치(200)는 제4화자(SPK4)에 의해 발화된 음성 "△△△"과 연관된 제4출력 음성 데이터(OVD4)와 제4단말 ID(TID4)를 매칭하여 저장할 수 있다.

본 발명의 실시 예들에 따른 음성 처리 장치(200)는 중첩된 음성과 연관된 입력 음성 데이터로부터, 각 위치의 화자로부터 발화된 음성과 연관된 출력 음성 데이터를 분리할 수 있을 뿐만 아니라, 각 화자의 음성과 연관된 출력 음성 데이터를 해당하는 화자의 화자 단말 ID와 매칭하여 저장할 수 있는 효과가 있다.

도 11은 본 발명의 실시 예들에 따른 음성 처리 장치의 동작을 설명하기 위한 도면이다. 도 11을 참조하면, 음성 처리 장치(200)는 입력 음성 데이터를 수신하고, 입력 음성 데이터를 이용하여 화자 위치 데이터 및 화자 위치 데이터에 대응하는 출력 음성 데이터를 생성하고, 출력 음성 데이터를 이용하여 회의록(MIN)을 생성할 수 있다. 생성된 회의록(MIN)은 문서 파일, 이미지 파일 또는 음성 파일의 형태로 저장될 수 있으나, 이에 한정되는 것은 아니다.

음성 처리 장치(200)는 단말 위치 데이터와 화자 위치 데이터를 비교하여, 화자 위치 데이터에 대응하는 단말 ID를 결정하고, 화자 위치 데이터에 대응하는 출력 음성 데이터와, 화자 위치 데이터에 대응하는 단말 ID를 매칭하여 저장할 수 있다.

또한, 음성 처리 장치(200)는 각 화자 단말 ID에 대응하는 화자를 식별하기 위한 화자 식별자를 별도로 저장할 수 있다. 예컨대, 음성 처리 장치(200)는 제1위치(P1)의 제1화자(SPK1)의 제1화자 단말(ST1)의 제1단말 ID과, 제1화자(SPK1)를 나타내는 제1화자 식별자를 매칭하여 저장할 수 있다. 따라서, 음성 처리 장치(200)는 출력 음성 데이터와 매칭된 단말 ID를 통해, 화자를 식별하기 위한 화자 식별자를 리드함으로써 출력 음성 데이터의 화자를 식별할 수 있다.

음성 처리 장치(200)는 각 화자(SPK1~SPK40의 출력 음성 데이터와, 출력 음성 데이터에 매칭되는 단말 ID(또는 화자 식별자)를 이용하여, 회의록(MIN)을 생성할 수 있다. 예컨대, 음성 처리 장치(200)는 입력 음성 데이터가 수신된 시점을 이용하여, 각 화자의 음성을 시간 순으로 정렬하여 회의록(MIN)을 생성할 수 있다.

도 11에 도시된 바와 같이, 순차적으로, 제1화자(SPK1)가 "◎◎◎"를 발화하고, 제2화자(SPK2)가 음성 "☆☆☆"를 발화하고, 제3화자(SPK3)가 음성 "□□□"을 발화하고, 제4화자(SPK4)가 음성 "△△△"을 발화한다. 제1화자(SPK1) 내지 제4화자(SPK4)의 발화는 시간적으로 중첩될 수 있다.

음성 처리 장치(200)는 음성 "◎◎◎", "☆☆☆", "□□□" 및 "△△△"과 연관된 입력 음성 데이터를 수신하고, 음성 "◎◎◎", "☆☆☆", "□□□" 및 "△△△" 각각에 대한 화자 위치 데이터, 그리고 음성 "◎◎◎", "☆☆☆", "□□□" 및 "△△△" 각각과 연관된 출력 음성 데이터를 생성할 수 있다. 또한, 음성 처리 장치(200)는 음성 "◎◎◎", "☆☆☆", "□□□" 및 "△△△" 각각과 연관된 출력 음성 데이터와 대응하는 단말 ID를 매칭하여 저장할 수 있다.

음성 처리 장치(200)는 서로 매칭되어 저장된 출력 음성 데이터와 단말 ID를 이용하여, 회의록(MIN)을 생성할 수 있다. 예컨대, 음성 처리 장치(200)는 출력 음성 데이터에 대응하는 화자를, 단말 ID에 대응하는 화자로서 기록할 수 있다.

실시 예들에 따라, 음성 처리 장치(200)는 각각의 출력 음성 데이터를 텍스트 데이터로 변환하고, 텍스트 데이터 및 매칭된 단말 ID를 이용하여, 각 텍스트 데이터에 대한 화자가 기록된 회의록(MIN)을 생성할 수 있다. 회의록(MIN)의 텍스트 데이터는 시간 순으로 정렬되어 배치될 수 있다.

도 12는 본 발명의 실시 예들에 따른 음성 처리 장치를 나타낸다. 도 12를 참조하면, 음성 처리 장치(500)는 도 1의 음성 처리 장치(200)의 기능을 수행하 수 있다. 실시 예들에 따라, 음성 처리 장치(500)는 차량(700) 내에 배치되어 차량(700) 내에 위치한 화자들(SPK1~SPK4)의 음성을 처리할 수 있다.

상술한 바와 같이, 본 발명의 실시 예들에 따른 음성 처리 장치는 화자들(SPK1~SPK4) 각각의 화자 단말(ST1~ST4)의 단말 ID를 통해 화자들(SPK1~SPK4) 각각의 음성을 구별할 수 있다. 나아가, 본 발명의 실시 예들에 따른 음성 처리 장치는 각 화자 단말에 대응하는 권한 수준에 따라 화자들(SPK1~SPK4) 각각의 음성 신호를 처리할 수 있다.

음성 처리 장치(500)는 차량(700)(또는 차량(700)의 컨트롤러(예컨대, ECU(electronic controller unit) 등))과 데이터를 주고받을 수 있다. 실시 예들에 따라, 음성 처리 장치(500)는 차량(700)의 컨트롤러를 제어하기 위한 명령어를 컨트롤러로 전송할 수 있다. 실시 예들에 따라, 음성 처리 장치(500)는 차량(700)의 컨트롤러와 일체로 형성되어 차량(700)의 동작을 제어할 수 있다. 다만, 본 명세서에는 차량(700)의 컨트롤러와 음성 처리 장치(500)가 분리된 것으로 가정하고 설명한다.

차량(700) 내의 각 좌석에는 복수의 화자들(SPK1~SPK4)이 위치할 수 있다. 실시 예들에 따라, 제1화자(SPK1)는 전행(front row)의 왼쪽 좌석에 위치할 수 있고, 제2화자(SPK2)는 전행의 오른쪽 좌석에 위치할 수 있고, 제3화자(SPK3)는 후행(back row)의 왼쪽 좌석에 위치할 수 있고, 제4화자(SPK4)는 후행의 오른쪽 좌석에 위치할 수 있다.

본 발명의 실시 예들에 따른 음성 처리 장치(500)는 차량(700) 내의 화자들(SPK1~SPK4)의 음성들을 수신하고, 화자들 각각의 음성과 연관된 분리 음성 신호를 생성할 수 있다. 예컨대, 음성 처리 장치(500)는 제1화자의 음성과 연관된 제1분리 음성 신호를 생성할 수 있다. 이 때, 제1분리 음성 신호에 포함된 음성 성분 중에서 제1화자(SPK1)의 음성 성분의 비중이 가장 높을 수 있다. 즉, 이하 본 명세서에서 설명되는 분리 음성 신호는 도 1 내지 도 11을 참조하여 설명된 출력 음성 데이터에 대응한다.

음성 처리 장치(500)는 분리 음성 신호를 처리할 수 있다. 본 명세서에서, 음성 처리 장치(500)가 분리 음성 신호를 처리한다는 것은, 음성 처리 장치(500)가 분리 음성 신호를 차량(700)(또는 차량(700)을 제어하기 위한 컨트롤러)로 전송하는 동작, 분리 음성 신호로부터 차량(700)을 제어하기 위한 명령어를 인식하고 인식된 명령어에 대응하는 동작 명령을 결정하고, 결정된 동작 명령을 차량(700)으로 전송하는 동작, 또는 음성 처리 장치(500)가 분리 음성 신호에 대응하는 동작 명령에 따라 차량(700)을 제어하는 동장을 의미할 수 있다.

본 발명의 실시 예들에 따른 음성 처리 장치(500)는 화자들(SPK1~SPK4)이 소지하는 화자 단말기들(ST1~ST4)의 위치를 결정하고, 화자 단말기들(ST1~ST4)에 허용된 권한 수준에 따라 각 음원 위치의 분리 음성 신호를 처리할 수 있다. 즉, 음성 처리 장치(500)는 화자들(SPK1~SPK4) 각각의 음성과 연관된 분리 음성 신호를, 동일한(혹은 연관된) 위치에 있는 화자 단말기(ST1~ST4)의 권한 수준에 따라, 처리할 수 있다. 예컨대, 음성 처리 장치(500)는 제1음원 위치에서 발화된 음성의 분리 음성 신호를, 상기 제1음원 위치에 있는 화자 단말기에 할당된 권한 수준에 따라 처리할 수 있다.

한편, 차량(700)을 음성을 통해 제어하는 경우, 차량(700)의 동작 안정성을 위해 화자들(SPK1~SPK4)의 음성에 대한 권한 수준을 설정할 필요가 있다. 예를 들어, 차량(700)의 소유주의 음성은 높은 권한 수준이 할당될 수 있는 반면, 동석하는 아이들의 음성은 낮은 권한 수준이 할당될 수 있다.

한편, 이 경우, 음성 처리 장치(500)에 의해 인식된 각 음성이 어떤 화자의 것인지 구별하는 것이 필요한데, 음성 자체의 특징으로부터 화자를 구별하는 것은 처리 과정이 복잡하며 처리 시간이 오래 걸릴 뿐만 아니라, 정확도가 낮다.

반면, 본 발명의 실시 예들에 따른 음성 처리 장치(500)는 화자들(SPK1~SPK4) 각각이 소지하는 화자 단말기(ST1~ST4)의 위치를 통해, 각 음성이 발화된 음원 위치에 대응하는 화자 단말기(ST1~ST4)를 식별하고, 식별된 화자 단말기에 대응하는 권한 수준에 따라 음성을 처리할 수 있다.

따라서, 본 발명의 실시 예들에 따르면 화자들(SPK1~SPK4)의 각 음성을 쉽게 식별할 수 있어 음성의 처리 속도가 향상될 뿐만 아니라, 권한 수준에 따라 음성을 처리하므로 음성 제어에 대한 안정성(또는 보안성)이 향상되는 효과가 있다.

실시 예들에 따라, 음성 처리 장치(500)는 화자 단말기(ST1~ST4) 각각으로부터 전송되는 신호를 이용하여, 화자 단말기(ST1~ST4) 각각의 위치를 결정할 수 있다.

차량(700)은 자동차, 기차, 오토바이, 선박, 항공기 등 도로, 해로, 선로 및 항로 상을 주행하는 수송 또는 운송 수단으로서 정의될 수 있다. 실시 예들에 따라, 차량(700)은 동력원으로서 엔진을 구비하는 내연기관 차량, 동력원으로서 엔진과 전기 모터를 구비하는 하이브리드 차량, 동력원으로서 전기 모터를 구비하는 전기 차량 등을 모두 포함하는 개념일 수 있다.

차량(700)은 음성 처리 장치(500)로부터 음성 신호를 수신하고, 수신된 음성 신호에 응답하여 특정 동작을 수행할 수 있다. 또한, 실시 예들에 따라, 차량(700)은 음성 처리 장치(500)로부터 전송된 동작 명령에 따라 특정 동작을 수행할 수 있다.

도 13은 본 발명의 실시 예들에 따른 음성 처리 장치를 나타낸다. 도 13을 참조하면, 음성 처리 장치(500)는 마이크(510), 음성 처리 회로(520), 메모리(530), 통신 회로(540), 측위 회로(550)를 포함할 수 있다. 실시 예들에 따라, 음성 처리 장치(500)는 스피커(560)를 선택적으로 더 포함할 수 있다.

마이크(510)의 기능 및 구조는 마이크로폰들(100)의 기능 및 구조와 대응하고, 음성 처리 회로(520) 및 측위 회로(550)의 기능 및 구조는 프로세서(240)의 기능 및 구조와 대응할 수 있고, 통신 회로(540)의 기능 및 구조는 무선 신호 수신 회로(210) 및 음성 수신 회로(220)의 기능 및 구조와 대응할 수 있다. 즉, 이하 별도의 설명이 없더라도, 음성 처리 장치(500)의 각 구성들은 음성 처리 장치(200)의 각 구성들의 기능을 수행할 수 있는 것으로 이해되어야 하며, 이하에서는 차이점에 대해서만 설명한다.

음성 처리 회로(520)는 마이크(510)에 의해 생성된 음성 신호를 이용하여, 화자들(SPK1~SPK4) 각각의 음성과 연관된 분리 음성 신호를 추출(또는 생성)할 수 있다.

음성 처리 회로(520)는 음성 신호들 사이의 시간 지연(또는 위상 지연)을 이용하여 음성 신호들 각각의 음원 위치(즉, 화자들(SPK1~SPK4)의 위치)를 결정할 수 있다. 예컨대, 음성 처리 회로(520)는 음성 신호들 각각의 음원 위치(즉, 화자들(SPK1~SPK4)의 위치)를 나타내는 음원 위치 정보를 생성할 수 있다.

음성 처리 회로(520)는 결정된 음원 위치에 기초하여, 음성 신호로부터 화자들(SPK1~SPK4) 각각의 음성과 연관된 분리 음성 신호를 생성할 수 있다. 예컨대, 음성 처리 회로(520)는 특정 위치(또는 방향)에서 발화된 음성과 연관된 분리 음성 신호를 생성할 수 있다. 실시 예들에 따라, 음성 처리 회로(520)는 분리 음성 신호 및 음원 위치 정보를 매칭하여 저장할 수 있다.

메모리(530)는 음성 처리 장치(500)의 동작에 필요한 데이터를 저장할 수 있다. 실시 예들에 따라, 메모리(530)는 분리 음성 신호 및 음원 위치 정보를 저장할 수 있다.

통신 회로(540)는 차량(700)으로 데이터를 전송하거나, 또는, 차량(700)으로부터 데이터를 수신할 수 있다.

통신 회로(540)는 음성 처리 회로(520)의 제어에 따라, 분리 음성 신호를 차량(700)으로 전송할 수 있다. 실시 예들에 따라, 통신 회로(540)는 분리 음성 신호와 함께 음원 위치 정보를 함께 전송할 수 있다.

측위 회로(550)는 화자 단말기들(ST1~ST4)의 위치를 측정하고, 위치를 나타내는 단말 위치 정보를 생성할 수 있다. 실시 예들에 따라, 측위 회로(550)는 화자 단말기들(ST1~ST4)로부터 출력된 무선 신호를 이용하여 화자 단말기들(ST1~ST4)의 위치를 측정할 수 있다.

예컨대, 측위 회로(550)는 UWB(ultra-wide band), WLAN(wireless local area network), ZigBee, Bluetooth 또는 RFID(radio frequency identification) 방식에 따라 화자 단말기들(ST1~ST4)의 위치를 측정할 수 있으나, 본 발명의 실시 예들이 위치 측정 방식 자체에 한정되는 것은 아니다.

실시 예들에 따라, 측위 회로(550)는 무선 신호를 송수신하기 위한 안테나(551)를 포함할 수 있다.

스피커(560)는 음성 신호에 해당하는 음성을 출력할 수 있다. 실시 예들에 따라, 스피커(560)는 (결합 또는 분리) 음성 신호에 기초하여 진동을 발생할 수 있고, 스피커(560)의 진동에 따라 음성이 재생될 수 있다.

도 14는 본 발명의 실시 예들에 따른 화자 단말기를 나타낸다. 도 3에 도시된 화자 단말기(600)는 도 1에 도시된 화자 단말기들(ST1~ST4)을 나타낸다. 도 3을 참조하면, 화자 단말기(600)는 입력부(610), 통신부(620), 제어부(630) 및 저장부(640)를 포함할 수 있다.

입력부(610)는 사용자의 입력(예컨대, 푸시, 터치, 클릭 등)을 검출하고, 검출 신호를 생성할 수 있다. 예컨대, 입력부(610)는 터치 패널 또는 키보드일 수 있으나, 이에 한정되는 것은 아니다.

통신부(620)는 외부 장치와 통신을 수행할 수 있다. 실시 예들에 따라, 통신부(620)는 외부 장치로부터 데이터를 수신하거나, 또는 외부 장치로 데이터를 전송할 수 있다.

통신부(620)는 화자 단말기(600)의 위치 측정을 위해, 음성 처리 장치(500)와 무선 신호를 주고받을 수 있다. 실시 예들에 따라, 통신부(620)는 음성 처리 장치(500)로부터 수신된 무선 신호를 수신하고, 무선 신호의 수신 특성을 나타내는 변수(수신 시점, 수신 각도, 수신 세기 등)와 관련된 데이터를 음성 처리 장치(500)로 전송할 수 있다. 또한, 실시 예들에 따라, 통신부(620)는 통신부(620)는 음성 처리 장치(500)로 무선 신호를 전송하고, 무선 신호의 전송 특성을 나타내는 변수(전송 시점, 전송 각도, 전송 세기 등)과 관련된 데이터를 음성 처리 장치(500)로 전송할 수 있다.

예컨대, 통신부(620)는 ToF(time of flight), TDoA(time difference of arrival), AoA(angle of arrival), RSSI(received signal strength indicator) 방식에 따라 화자 단말기(600)의 위치를 측정하기 위해, 음성 처리 장치(500)와 무선 신호를 주고받을 수 있다.

실시 예들에 따라, 통신부(620)는 무선 신호를 송수신하기 위한 안테나(321)를 포함할 수 있다.

제어부(630)는 화자 단말기(600)의 전반적인 동작을 제어할 수 있다. 실시 예들에 따라, 제어부(630)는 저장부(640)에 저장된 프로그램(또는 애플리케이션)을 로딩하고, 로딩에 따라 해당 프로그램의 동작을 수행할 수 있다.

실시 예들에 따라, 제어부(630)는 음성 처리 장치(500)와 화자 단말기(600) 사이의 위치 측정을 수행하도록, 통신부(620)를 제어할 수 있다.

제어부(630)는 연산 처리 기능을 갖는 프로세서를 포함할 수 있다. 예컨대, 제어부(630)는 CPU(central processing unit), MCU(micro controller unit), GPU(graphics processing unit), AP(application processor) 등을 포함할 수 있으나, 이에 한정되는 것은 아니다.

저장부(640)는 화자 단말기(600)의 동작에 필요한 데이터를 저장할 수 있다. 실시 예들에 따라, 저장부(640)는 화자 단말기(600)의 동작에 필요한 설정 값들 및 애플리케이션들을 저장할 수 있다.

도 15 내지 도 17은 본 발명의 실시 예들에 따른 음성 처리 장치의 동작을 설명하기 위한 도면이다. 도 15 내지 도 17을 참조하면, 각 위치(FL, FR, BL, BR)에 위치한 화자들(SPK1~SPK4) 각각이 발화할 수 있다.

음성 처리 장치(500)는 음성 신호들 사이의 시간 지연(또는 위상 지연)을 이용하여 음성들의 음원 위치(즉, 화자들(SPK1~SPK4)의 위치)를 결정하고, 결정된 음원 위치에 기초하여, 화자들(SPK1~SPK4) 각각의 음성과 연관된 분리 음성 신호를 생성할 수 있다.

도 15에 도시된 바와 같이, 제1화자(SPK1)가 음성 'AAA'을 발화한다. 음성 'AAA'가 발화되면, 음성 처리 장치(500)는 음성 'AAA'에 응답하여, 제1화자(SPK1)의 음성 'AAA'과 연관된 분리 음성 신호를 생성할 수 있다. 상술한 바와 같이, 음성 처리 장치(500)는 수신되는 음성들의 음원 위치들에 기초하여, 수신되는 음성들 중에서 제1화자(SPK1)의 위치에서 발화된 음성 'AAA'와 연관된 분리 음성 신호를 생성할 수 있다.

실시 예들에 따라, 음성 처리 장치(500)는 제1화자(SPK1)의 음성 'AAA'와 연관된 제1분리 음성 신호와 음성 'AAA'의 음원 위치(즉, 제1화자(SPK1)의 위치)인 'FL(전행 왼쪽)'을 나타내는 제1음원 위치 정보를 메모리(530)에 저장할 수 있다. 예컨대, 도 15에 도시된 바와 같이, 제1분리 음성 신호와 제1음원 위치 정보는 서로 매칭되어 저장될 수 있다.

도 16에 도시된 바와 같이, 제2화자(SPK2)가 음성 'BBB'를 발화한다. 음성 'BBB'가 발화되면, 음성 처리 장치(500)는 수신되는 음성들의 음원 위치들에 기초하여, 제2화자(SPK2)의 음성 'BBB'와 연관된 제2분리 음성 신호를 생성할 수 있다.

실시 예들에 따라, 음성 처리 장치(500)는 제2화자(SPK2)의 음성 'BBB'와 연관된 제2분리 음성 신호와 음성 'BBB'의 음원 위치(즉, 제2화자(SPK2)의 위치)인 'FR(전행 오른쪽)'을 나타내는 제2음원 위치 정보를 메모리(530)에 저장할 수 있다.

도 17에 도시된 바와 같이, 제3화자(SPK3)가 음성 'CCC'를 발화하고, 제4화자(SPK4)가 음성 'DDD'를 발화한다. 음성 처리 장치(500)는 수신되는 음성들의 음원 위치들에 기초하여, 제3화자(SPK3)의 음성 'CCC'와 연관된 제3분리 음성 신호 및 제4화자(SPK4)의 음성 'DDD'와 연관된 제4분리 음성 신호 각각을 생성할 수 있다.

실시 예들에 따라, 음성 처리 장치(500)는 제3화자(SPK3)의 음성 'CCC'와 연관된 제3분리 음성 신호와 음성 'CCC'의 음원 위치(즉, 제3화자(SPK3)의 위치)인 'BL(후행 왼쪽)'을 나타내는 제3음원 위치 정보를 메모리(530)에 저장할 수 있고, 제4화자(SPK4)의 음성 'DDD'와 연관된 제4분리 음성 신호와 음성 'DDD'의 음원 위치(즉, 제4화자(SPK4)의 위치)인 'BR(후행 오른쪽)'을 나타내는 제4음원 위치 정보를 메모리(530)에 저장할 수 있다.

도 18은 본 발명의 실시 예들에 따른 화자 단말기의 권한 수준을 나타낸다. 도 18을 참조하면, 음성 처리 장치(500)는 화자 단말기(ST1~ST4)를 식별하기 위한 단말 ID, 및 화자 단말기(ST1~ST4)의 권한 수준을 나타내는 권한 수준 정보를 저장할 수 있다. 실시 예들에 따라, 음성 처리 장치(500)는 단말 ID 및 권한 수준 정보를 서로 매칭하여 저장할 수 있다. 예컨대, 음성 처리 장치(500)는 단말 ID 및 권한 수준 정보를 메모리(530)에 저장할 수 있다.

화자 단말기(ST1~ST4)의 권한 수준은, 화자 단말기(ST1~ST4)의 단말 위치와 대응하는 음원 위치에서 발화된 분리 음성 신호의 처리 여부를 결정하기 위한 것일 수 있다. 즉, 음성 처리 장치(500)는 분리 음성 신호와 대응하는 화자 단말기를 결정하고, 화자 단말기에 할당된 권한 수준에 따라 분리 음성 신호를 처리할 수 있다.

특히, 차량(700)을 음성으로 제어하는 경우, 본 발명의 실시 예들에 따르면, 일정 수준 이상의 권한 수준을 갖는 화자(또는 화자 단말기)의 음성만 처리할 수 있어, 차량 제어의 안정성이 훨씬 더 향상되는 효과가 있다.

실시 예들에 따라, 음성 처리 장치(500)는 분리 음성 신호와 대응하는 화자 단말기의 권한 수준이 기준 수준 이상일 때, 해당하는 분리 음성 신호를 처리할 수 있다. 예컨대, 기준 수준이 2인 경우, 음성 처리 장치(500)는 기준 수준 '2' 미만의 권한 수준을 갖는 제4화자 단말기(ST4)와 대응하는 제4분리 음성 신호를 처리하지 않을 수 있다. 한편, 미처리된 분리 음성 신호에 대한 정보는 음성 처리 장치(500)에 저장될 수 있다.

또한, 실시 예들에 따라, 음성 처리 장치(500)는 분리 음성 신호와 대응하는 화자 단말기의 권한 수준이 높을수록, 해당하는 분리 음성 신호를 우선 순위로 처리할 수 있다. 예컨대, 제1화자 단말기(ST1)의 권한 수준이 '4'로 가장 높으므로, 음성 처리 장치(500)는 제1화자 단말기(ST1)에 대응하는 제1분리 음성 신호를 가장 우선적으로 처리할 수 있다.

한편, 비록 도 18에는 4가지 수준의 권한 수준이 나타나 있으나, 실시 예들에 따라, 권한 수준은 2가지 수준일 수 있다. 즉, 권한 수준은 처리가 허용된 제1수준 및 처리가 허용되지 않는 제2수준의 2가지 수준을 포함할 수도 있다.

도 19는 본 발명의 실시 예들에 따른 음성 처리 장치의 작동 방법을 나타내는 플로우 차트이다. 도 19를 참조하면, 음성 처리 장치(500)는 화자들(SPK1~SPK4)의 음성에 응답하여 분리 음성 신호 및 음원 위치 정보를 생성할 수 있다(S210). 실시 예들에 따라, 음성 처리 장치(500)는 화자들(SPK1~SPK4) 각각의 음성과 연관된 분리 음성 신호, 그리고 각 음성의 음원 위치를 나타내는 음원 위치 정보를 생성할 수 있다.

음성 처리 장치(500)는 화자들(SPK1~SPK4)의 화자 단말기(ST1~ST4)의 위치를 결정할 수 있다(S220). 실시 예들에 따라, 음성 처리 장치(500)는 화자 단말기(ST1~ST4)로부터 전송되는 무선 신호를 이용하여, 화자 단말기(ST1~ST4)의 위치를 결정할 수 있다.

음성 처리 장치(500)는 분리 음성 신호에 대응하는 화자 단말기(ST1~ST4)를 결정할 수 있다(S230). 실시 예들에 따라, 음성 처리 장치(500)는 분리 음성 신호의 음원 위치와 대응하는 위치를 갖는 화자 단말기(ST1~ST4)를 결정할 수 있다.

실시 예들에 따라, 음성 처리 장치(500)는 차량(700) 내의 각 구역들(FL, FR, BL, BR)을 기준으로, 동일 구역에 대응하는 분리 음성 신호와 화자 단말기를 매칭할 수 있다. 예컨대, 음성 처리 장치(500)는 차량(700)의 전행 왼쪽 'FL'에 대응하는 제1화자 단말기(ST1)와 제1분리 음성 신호를 매칭할 수 있다.

음성 처리 장치(500)는 분리 음성 신호를 대응하는 화자 단말기에 할당된 권한 수준에 따라 처리할 수 있다(S240). 실시 예들에 따라, 음성 처리 장치(500)는 메모리(530)로부터 권한 수준 정보를 리드하고, 각 분리 음성 신호를, 각 분리 음성 신호에 대응하는(또는 매칭된) 화자 단말기의 권한 수준에 따라 처리할 수 있다.

예컨대, 제1화자(SPK1)의 음성에 대응하는 제1분리 음성 신호는 'FL(전행 왼쪽)'에서 발화되었으므로, 'FL(전행 왼쪽)'에 대응하는 제1화자 단말기(ST1)의 권한 수준에 따라 처리할 수 있다.

도 20은 본 발명의 실시 예들에 따른 음성 처리 장치의 작동을 설명하기 위한 도면이다. 도 20을 참조하면, 제1화자(SPK1)는 음성 '문 열어줘'를 음원 위치 'FL(전행 왼쪽)'에서 발화하고, 제3화자(SPK3)는 음성 '음악 틀어줘'를 음원 위치 'BL(후행 왼쪽)'에서 발화하고, 제4화자(SPK4)는 음성 '시동 꺼줘'를 음원 위치 'BR(후행 오른쪽)'에서 발화한다.

한편, 음성 처리 장치(500)에 저장된 권한 수준 정보에 따르면, 제1화자 단말기(ST1)에 대한 권한 수준은 '4'이고, 제2화자 단말기(ST2)에 대한 권한 수준은 '2'이고, 제3화자 단말기(ST3)에 대한 권한 수준은 '2'이고, 제4화자 단말기(ST4)에 대한 권한 수준은 '1'이다. 이 때, 음성 처리 장치(500)는 권한 수준이 기준 수준(예컨대, '2') 이상인 화자 단말기와 대응하는 분리 음성 신호만을 처리할 수 있다.

음성 처리 장치(500)는 화자들의 음성('문 열어줘', '음악 틀어줘' 및 '시동 꺼줘')에 응답하여, 음성들 각각에 대응하는 분리 음성 신호를 생성할 수 있다. 또한, 음성 처리 장치(500)는 화자들의 음성('문 열어줘', '음악 틀어줘' 및 '시동 꺼줘') 각각의 음원 위치('FL', 'BL' 및 'BR')를 나타내는 음원 위치 정보를 생성할 수 있다.

음성 처리 장치(500)는 화자들의 음성이 입력되면, 화자 단말기들(ST1~ST4) 각각의 단말 위치를 결정할 수 있다. 실시 예들에 따라, 음성 처리 장치(500)는 화자 단말기들(ST1~ST4) 각각과 무선 신호를 주고받음으로써, 화자 단말기들(ST1~ST4) 각각의 단말 위치를 결정할 수 있다. 음성 처리 장치(500)는 화자 단말기들(ST1~ST4)의 단말 위치를 나타내는 단말 위치 정보를 저장할 수 있다. 이 때, 단말 위치 정보는 화자 단말기들(ST1~ST4)의 단말 ID와 매칭되어 저장될 수 있다.

음성 처리 장치(500)는 화자들(SPK1~SPK4) 각각의 음성과 관련된 분리 음성 신호를, 분리 음성 신호와 대응하는 화자 단말기(ST1~ST4)에 할당된 권한 수준에 따라 처리할 수 있다. 실시 예들에 따라, 음성 처리 장치(500)는 기준 수준 이상의 권한 수준이 할당된 화자 단말기(ST1~ST4)와 대응하는 분리 음성 신호만을 처리할 수 있으나, 본 발명의 실시 예들이 이에 한정되는 것은 아니다.

도 20에 도시된 바와 같이, 음성 처리 장치(500)는 제1화자(SPK1)의 음성 '문 열어줘'와 관련된 제1분리 음성 신호의 처리 여부를, 제1분리 음성 신호와 대응하는 제1화자 단말기(ST1)의 권한 수준 '4'에 따라 결정할 수 있다. 실시 예들에 따라, 음성 처리 장치(500)는 제1분리 음성 신호의 위치 'FL'와 대응하는 단말 위치를 갖는 제1화자 단말기(ST1)를 식별하고, 제1화자 단말기(ST1)의 권한 수준을 리드하고, 리드된 권한 수준에 따라 제1분리 음성 신호를 처리할 수 있다. 예컨대, 기준 수준이 2이므로, 음성 처리 장치(500)는 제1분리 음성 신호를 처리할 수 있고, 이에 따라, 차량(700)은 음성 '문 열어줘'에 대응하는 동작(예컨대, 문 열림 동작)을 수행할 수 있다.

또한, 도 20에 도시된 바와 같이, 음성 처리 장치(500)는 제4화자(SPK4)의 음성 '시동 꺼줘'와 관련된 제4분리 음성 신호의 처리 여부를, 제4분리 음성 신호와 대응하는 제4화자 단말기(ST4)의 권한 수준 '1'에 따라 결정할 수 있다. 실시 예들에 따라, 음성 처리 장치(500)는 제4분리 음성 신호의 위치 'BR'와 대응하는 단말 위치를 갖는 제4화자 단말기(ST4)를 식별하고, 제4화자 단말기(ST4)의 권한 수준을 리드하고, 리드된 권한 수준에 따라 제4분리 음성 신호를 처리할 수 있다. 예컨대, 기준 수준이 2이므로, 음성 처리 장치(500)는 제4분리 음성 신호를 처리하지 않을 수 있다. 즉, 이 경우 차량(700)은 제4화자(SPK4)가 '시동 꺼줘'라는 음성을 발화했음에도, '시동 꺼줘'에 대응하는 동작을 수행하지 않을 수 있다.

이상과 같이 실시 예들이 비록 한정된 실시 예와 도면에 의해 설명되었으나, 해당 기술분야에서 통상의 지식을 가진 자라면 상기의 기재로부터 다양한 수정 및 변형이 가능하다. 예를 들어, 설명된 기술들이 설명된 방법과 다른 순서로 수행되거나, 및/또는 설명된 시스템, 구조, 장치, 회로 등의 구성요소들이 설명된 방법과 다른 형태로 결합 또는 조합되거나, 다른 구성요소 또는 균등물에 의하여 대치되거나 치환되더라도 적절한 결과가 달성될 수 있다.

그러므로, 다른 구현들, 다른 실시예들 및 특허청구범위와 균등한 것들도 후술하는 특허청구범위의 범위에 속한다.

Claims

화자의 음성과 연관된 입력 음성 데이터를 수신하도록 구성되는 음성 데이터 수신 회로;

상기 화자의 화자 단말로부터 단말 ID를 포함하는 무선 신호를 수신하도록 구성되는 무선 신호 수신 회로;

메모리; 및

상기 무선 신호에 기초하여 상기 화자 단말의 위치를 나타내는 단말 위치 데이터를 생성하고, 생성된 단말 위치 데이터와 상기 단말 ID를 매칭하여 상기 메모리에 저장하도록 구성되는 프로세서를 포함하고,

상기 프로세서는,

상기 입력 음성 데이터를 이용하여 제1위치를 나타내는 제1화자 위치 데이터 및 상기 제1위치에서 발화된 제1음성과 연관된 제1출력 음성 데이터를 생성하고,

상기 메모리를 참조하여 상기 제1화자 위치 데이터에 대응하는 제1단말 ID를 리드하고,

상기 제1단말 ID와 상기 제1출력 음성 데이터를 매칭하여 저장하는,

음성 처리 장치.
제1항에 있어서,

상기 입력 음성 데이터는 복수의 마이크로폰들에 의해 생성된 음성 신호들로부터 생성된 것인,

음성 처리 장치.
제2항에 있어서, 상기 프로세서는,

상기 복수의 마이크로폰들 사이의 거리 및 상기 음성 신호가 상기 복수의 마이크로폰에 의해 수신되는 시점에 기초하여, 상기 제1화자 위치 데이터를 생성하는,

음성 처리 장치.
제1항에 있어서, 상기 프로세서는,

상기 무선 신호의 수신 강도에 기초하여 상기 화자 단말의 위치를 나타내는 단말 위치 데이터를 생성하는,

음성 처리 장치.
제1항에 있어서, 상기 프로세서는,

상기 무선 신호에 포함된 타임 스탬프를 이용하여 상기 무선 신호의 이동 시간(time of flight)을 계산하고, 이동 시간에 기초하여 상기 화자 단말의 위치를 나타내는 단말 위치 데이터를 생성하는,

음성 처리 장치.
제1항에 있어서, 상기 프로세서는,

상기 메모리를 참조하여, 상기 단말 위치 데이터 중에서 상기 제1화자 위치 데이터와 인접한 위치를 나타내는 제1단말 위치 데이터를 결정하고,

상기 메모리를 참조하여, 상기 단말 ID 중에서 제1단말 위치 데이터와 매칭되어 저장된 상기 제1단말 ID를 리드하는,

음성 처리 장치.
제1항에 있어서, 상기 프로세서는,

상기 입력 음성 데이터를 이용하여, 제2위치를 나타내는 제2화자 위치 데이터 및 상기 제2위치에서 발화된 제2음성과 연관된 제2출력 음성 데이터를 생성하고,

상기 메모리를 참조하여, 상기 단말 ID 중 상기 제2화자 위치 데이터에 대응하는 제2단말 ID를 리드하고,

상기 제2단말 ID와 상기 제2출력 음성 데이터를 매칭하여 저장하는,

음성 처리 장치.
제1항에 있어서,

상기 메모리는 화자 단말에 대한 권한 수준을 나타내는 권한 수준 정보를 저장하고,

상기 프로세서는,

상기 권한 수준 정보를 참조하여, 상기 제1단말 ID에 대응하는 권한 수준에 따라 상기 제1출력 음성 데이터를 처리하는,

음성 처리 장치.
제8항에 있어서,

상기 음성 처리 장치는 차량 내에 설치되고,

상기 프로세서에 의한 상기 제1출력 음성 데이터의 처리는,

상기 제1출력 음성 데이터로부터 상기 차량을 제어하기 위한 명령어를 인식하고, 인식된 명령어에 대응하는 동작 명령을 결정하는 것을 포함하는,

음성 처리 장치.
제8항에 있어서, 상기 프로세서는,

상기 제1단말 ID에 대응하는 권한 수준이 기준 수준 이상이면 상기 제1출력 음성 데이터를 처리하고,

상기 제1단말 ID에 대응하는 권한 수준이 상기 기준 수준 미만이면 상기 제1출력 음성 데이터를 처리하지 않는,

음성 처리 장치.
복수의 화자들에 의해 발화된 음성들에 응답하여 음성 신호를 생성하도록 구성되는 마이크;

상기 음성 신호를 상기 음성들 각각의 음원 위치에 기초하여 음원 분리함으로써, 상기 음성들 각각과 연관된 분리 음성 신호를 생성하도록 구성되는 음성 처리 회로;

상기 화자들의 화자 단말기들의 단말 위치를 측정하도록 구성되는 측위 회로; 및

상기 화자 단말기들 각각에 대한 권한 수준을 나타내는 권한 수준 정보를 저장하는 메모리를 포함하고,

상기 음성 처리 회로는,

상기 분리 음성 신호의 음원 위치와 대응하는 단말 위치를 갖는 화자 단말기를 결정하고,

상기 권한 수준 정보를 참조하여, 결정된 화자 단말기에 대응하는 권한 수준에 따라 상기 분리 음성 신호를 처리하는,

음성 처리 장치.
제11항에 있어서,

상기 음성 처리 장치는 차량 내에 설치되고,

상기 음성 처리 회로에 의한 상기 분리 음성 신호의 처리는,

상기 분리 음성 신호로부터 상기 차량을 제어하기 위한 명령어를 인식하고, 인식된 명령어에 대응하는 동작 명령을 결정하는 것을 포함하는,

음성 처리 장치.
제11항에 있어서, 상기 음성 처리 회로는,

결정된 화자 단말기에 대응하는 권한 수준이 기준 수준 이상이면 상기 분리 음성 신호를 처리하고,

결정된 화자 단말기에 대응하는 권한 수준이 기준 수준 미만이면 상기 분리 음성 신호를 처리하지 않는,

음성 처리 장치.