KR20200094493A

KR20200094493A - 음성사후분포그램추출기와 tts 및 보코더를 이용한 음성 변조 어플리케이션의 동작방법

Info

Publication number: KR20200094493A
Application number: KR1020190012042A
Authority: KR
Inventors: 김남형
Original assignee: 김남형
Priority date: 2019-01-30
Filing date: 2019-01-30
Publication date: 2020-08-07

Abstract

본 발명은 음성사후분포그램추출기와 TTS 및 보코더를 이용한 음성 변조 어플리케이션의 동작방법에 관한 것으로서 음성데이터 추출기에 의하여 음성 데이터에서 MFCC 및 기저음을 추출할 수 있게 하고, 음성 사후 분포그램 DNN에 의하여 MFCC를 음성사후 분포그램으로 바꿀 수 있게 하고, 음성합성 DNN에 의하여 음성사후 분포그램으로 원하는 사람의 목소리로 바꿀 수 있게 하고, 선형 기저음 변환부에 의하여 입력된 음성의 기저음을 변환하고자 하는 음성에 맞출 수 있게 하고, 음성 복원부에 의하여 상술된 선형 기저음 변환부의 출력물과 음성합성 DNN을 받아 최종 음성 합성물을 출력할 수 있게 함으로써 높은품질의 음성변조 결과물을 얻게하도록 함으로써 기존의 화자의 기저음정보를 반영하지 못하는 문제점을 해소 하도록 한 것이다.
즉 본 발명은, 음성변조를 위한 음성모델 부호화를 이용한 음성합성 기술 및 장치에 있어서 음성이 컴퓨터에 저장될 수 있도록 마이크와 ADC를 구성한 음성데이터 녹음부, 음성 데이터에서 MFCC 및 기저음을 추출할 수 있게 보코더를 이용한 음성데이터 추출기, MFCC를 음성사후 분포그램으로 바꿀 수 있게 학습한 음성 사후 분포그램 DNN, 음성사후 분포그램으로 원하는 사람의 목소리로 바꿀 수 있게 학습한 음성합성 DNN, 입력된 음성의 기저음을 변환하고자 하는 음성에 맞출 수 있게 목표 화자 기저음의 평균과 분산을 이용해 선형 변환을 진행하고 이를 다시 보코더로 재합성하는 방식으로 원 화자의 음정 정보를 복원하는 것을 특징으로한 선형 기저음 변환부, 상술된 선형 기저음 변환부의 출력물과 음성합성 DNN을 받아 최종 음성 합성물을 출력할 수 있게 보코더를 내장한 음성 복원부로 구성한 것이다.
따라서, 본 발명은 음성데이터 추출기에 의하여 음성 데이터에서 MFCC 및 기저음을 추출할 수 있게 하고, 음성 사후 분포그램 DNN에 의하여 MFCC를 음성사후 분포그램으로 바꿀 수 있게 하고, 음성합성 DNN에 의하여 음성사후 분포그램으로 원하는 사람의 목소리로 바꿀 수 있게 하고, 선형 기저음 변환부에 의하여 입력된 음성의 기저음을 변환하고자 하는 음성에 맞출 수 있게 하고, 음성 복원부에 의하여 상술된 선형 기저음 변환부의 출력물과 음성합성 DNN을 받아 최종 음성 합성물을 출력할 수 있게 함으로써 높은품질의 음성변조 결과물을 얻게하도록 함으로써 기존의 화자의 기저음정보를 반영하지 못하는 문제점을 해소하도록 한 효과를 갖는 것이다.

Description

음성사후분포그램추출기와 TTS 및 보코더를 이용한 음성 변조 어플리케이션의 동작방법{Operating Method for Voice-Conversion Application with Phonetic-Posteriorgram Extractor , TTS and Vocoder}

본 발명은 음성사후분포그램추출기와 TTS 및 보코더를 이용한 음성 변조 어플리케이션의 동작방법에 관한 것으로서,

더욱 상세하게는 음성변조를 위한 음성모델 부호화를 이용한 음성합성 기술 및 장치에 있어서,

음성이 컴퓨터에 저장될 수 있도록 마이크와 ADC를 구성한 음성데이터 녹음부, 음성 데이터에서 MFCC 및 기저음을 추출할 수 있게 보코더를 이용한 음성데이터 추출기, MFCC를 음성사후 분포그램으로 바꿀 수 있게 학습한 음성 사후 분포그램 DNN, 음성사후 분포그램으로 원하는 사람의 목소리로 바꿀 수 있게 학습한 음성합성 DNN, 입력된 음성의 기저음을 변환하고자 하는 음성에 맞출 수 있게 목표 화자 기저음의 평균과 분산을 이용해 선형 변환을 진행하고 이를 다시 보코더로 재합성하는 방식으로 원 화자의 음정 정보를 복원하는 것을 특징으로한 선형 기저음 변환부, 상술된 선형 기저음 변환부의 출력물과 음성합성 DNN을 받아 최종 음성 합성물을 출력할 수 있게 보코더를 내장한 음성 복원부로 구성 하여서,

음성데이터 추출기에 의하여 음성 데이터에서 MFCC 및 기저음을 추출할 수 있게 하고, 음성 사후 분포그램 DNN에 의하여 MFCC를 음성사후 분포그램으로 바꿀 수 있게 하고, 음성합성 DNN에 의하여 음성사후 분포그램으로 원하는 사람의 목소리로 바꿀 수 있게 하고, 선형 기저음 변환부에 의하여 입력된 음성의 기저음을 변환하고자 하는 음성에 맞출 수 있게 하고, 음성 복원부에 의하여 상술된 선형 기저음 변환부의 출력물과 음성합성 DNN을 받아 최종 음성 합성물을 출력할 수 있게 함으로써 높은품질의 음성변조 결과물을 얻게하도록 함을 목적으로 한 것이다.

일반적으로 음성변조를 위한 음성모델 부호화를 이용한 음성합성 기술 및 장치는 사용자 목소리를 다른사람의 목소리로 변조하는 것이다.

상기한 바와 같이 음성변조를 위한 음성모델 부호화를 이용한 음성합성 기술 및 장치는 음성모델 부호화기, 음성모델 코드 변환기, 음성모델 복호화기, 음성합성기로 구성된 것이다.

이상과 같은 음성변조를 위한 음성모델 부호화를 이용한 음성합성 기술 및 장치는 음성모델 부호화기, 음성모델 코드 변환기, 음성모델 복호화기, 음성합성기를 거쳐 음성을 변조하는 것이다.

그러나 상기한 바와 같은 종래의 음성변조를 위한 음성모델 부호화를 이용한 음성합성 기술 및 장치는 화자의 기저음정보를 반영하지 못하는 문제점이 있었다.

대한민국 출원번호 10-2017-0044719 호

이에 본 발명은 종래의 음성변조를 위한 음성모델 부호화를 이용한 음성합성 기술 및 장치가 화자의 기저음정보를 반영하지 못하는 문제점을 해결하기 위한 것이다.

즉, 본 발명은 음성이 컴퓨터에 저장될 수 있도록 마이크와 ADC를 구성한 음성데이터 녹음부, 음성 데이터에서 MFCC 및 기저음을 추출할 수 있게 보코더를 이용한 음성데이터 추출기, MFCC를 음성사후 분포그램으로 바꿀 수 있게 학습한 음성 사후 분포그램 DNN, 음성사후 분포그램으로 원하는 사람의 목소리로 바꿀 수 있게 학습한 음성합성 DNN, 입력된 음성의 기저음을 변환하고자 하는 음성에 맞출 수 있게 목표 화자 기저음의 평균과 분산을 이용해 선형 변환을 진행하고 이를 다시 보코더로 재합성하는 방식으로 원 화자의 음정 정보를 복원하는 것을 특징으로한 선형 기저음 변환부, 상술된 선형 기저음 변환부의 출력물과 음성합성 DNN을 받아 최종 음성 합성물을 출력할 수 있게 보코더를 내장한 음성 복원부로 구성한 것이다.

따라서 본 발명은 음성이 컴퓨터에 저장될 수 있도록 마이크와 ADC를 구성한 음성데이터 녹음부, 음성 데이터에서 MFCC 및 기저음을 추출할 수 있게 보코더를 이용한 음성데이터 추출기, MFCC를 음성사후 분포그램으로 바꿀 수 있게 학습한 음성 사후 분포그램 DNN, 음성사후 분포그램으로 원하는 사람의 목소리로 바꿀 수 있게 학습한 음성합성 DNN, 입력된 음성의 기저음을 변환하고자 하는 음성에 맞출 수 있게 목표 화자 기저음의 평균과 분산을 이용해 선형 변환을 진행하고 이를 다시 보코더로 재합성하는 방식으로 원 화자의 음정 정보를 복원하는 것을 특징으로한 선형 기저음 변환부, 상술된 선형 기저음 변환부의 출력물과 음성합성 DNN을 받아 최종 음성 합성물을 출력할 수 있게 보코더를 내장한 음성 복원부로 구성 함으로써, 음성데이터 추출기에 의하여 음성 데이터에서 MFCC 및 기저음을 추출할 수 있게 하고, 음성 사후 분포그램 DNN에 의하여 MFCC를 음성사후 분포그램으로 바꿀 수 있게 하고, 음성합성 DNN에 의하여 음성사후 분포그램으로 원하는 사람의 목소리로 바꿀 수 있게 하고, 선형 기저음 변환부에 의하여 입력된 음성의 기저음을 변환하고자 하는 음성에 맞출 수 있게 하고, 음성 복원부에 의하여 상술된 선형 기저음 변환부의 출력물과 음성합성 DNN을 받아 최종 음성 합성물을 출력할 수 있게 함으로써 높은품질의 음성변조 결과물을 얻게하도록 한 효과를 갖는 것이다.

도 1: 본 발명의 시스템의 흐름도

즉, 본 발명은 음성이 컴퓨터에 저장될 수 있도록 마이크와 ADC를 구성한 (001)음성데이터 녹음부, 음성 데이터에서 MFCC 및 기저음을 추출할 수 있게 보코더를 이용한 (002)음성데이터 추출기, MFCC를 음성사후 분포그램으로 바꿀 수 있게 학습한 (003)음성 사후 분포그램 DNN, 음성사후 분포그램으로 원하는 사람의 목소리로 바꿀 수 있게 학습한 (004)음성합성 DNN, 입력된 음성의 기저음을 변환하고자 하는 음성에 맞출 수 있게 목표 화자 기저음의 평균과 분산을 이용해 선형 변환을 진행하고 이를 다시 보코더로 재합성하는 방식으로 원 화자의 음정 정보를 복원하는 것을 특징으로한 (005)선형 기저음 변환부, 상술된 선형 기저음 변환부의 출력물과 음성합성 DNN을 받아 최종 음성 합성물을 출력할 수 있게 보코더를 내장한 (006)음성 복원부로 구성 된 것이다.

여기서, (002)음성데이터 추출기는 음성 데이터에서 MFCC 및 기저음을 추출할 수 있게 보코더를 이용한 것이다.

여기서, (003)음성 사후 분포그램 DNN은 MFCC를 음성사후 분포그램으로 바꿀 수 있게 학습한 것이다.

여기서, (004)음성합성 DNN은 음성사후 분포그램으로 원하는 사람의 목소리로 바꿀 수 있게 학습한 것이다.

여기서, (005)선형 기저음 변환부는 입력된 음성의 기저음을 변환하고자 하는 음성에 맞출 수 있게 목표 화자 기저음의 평균과 분산을 이용해 선형 변환을 진행하고 이를 다시 보코더로 재합성하는 방식으로 원 화자의 음정 정보를 복원하는 것을 특징으로한 것이다.

여기서, (006)음성 복원부는 상술된 선형 기저음 변환부의 출력물과 음성합성 DNN을 받아 최종 음성 합성물을 출력할 수 있게 보코더를 내장한 것이다.

이하, 본 발명의 사용과정에 대하여 설명하면 다음과 같다.

상기한 바와 같이 본 발명은 음성변조를 위한 음성모델 부호화를 이용한 음성합성 기술 및 장치에 있어서 음성이 컴퓨터에 저장될 수 있도록 마이크와 ADC를 구성한 (001)음성데이터 녹음부, 음성 데이터에서 MFCC 및 기저음을 추출할 수 있게 보코더를 이용한 (002)음성데이터 추출기, MFCC를 음성사후 분포그램으로 바꿀 수 있게 학습한 (003)음성 사후 분포그램 DNN, 음성사후 분포그램으로 원하는 사람의 목소리로 바꿀 수 있게 학습한 (004)음성합성 DNN, 입력된 음성의 기저음을 변환하고자 하는 음성에 맞출 수 있게 목표 화자 기저음의 평균과 분산을 이용해 선형 변환을 진행하고 이를 다시 보코더로 재합성하는 방식으로 원 화자의 음정 정보를 복원하는 것을 특징으로한 (005)선형 기저음 변환부, 상술된 선형 기저음 변환부의 출력물과 음성합성 DNN을 받아 최종 음성 합성물을 출력할 수 있게 보코더를 내장한 (006)음성 복원부로 구성된 본 발명을 적용하여 실시하게 되면, 화자의 기저음정보를 반영하지 못하는 문제점을 해소하도록 한 것이다.

또한 본 발명의 실시에 있어, 보코더를 이용한 (002)음성데이터 추출기로 구성한 본 발명을 적용하여 실시하게 되면, 음성 데이터에서 MFCC 및 기저음을 추출할 수 있게 될 것이다.

또한 본 발명의 실시에 있어, 학습한 (003)음성 사후 분포그램 DNN으로 구성한 본 발명을 적용하여 실시하게 되면, MFCC를 음성사후 분포그램으로 바꿀 수 있게 될 것이다.

또한 본 발명의 실시에 있어, 학습한 (004)음성합성 DNN으로 구성한 본 발명을 적용하여 실시하게 되면, 음성사후 분포그램으로 원하는 사람의 목소리로 바꿀 수 있게 될 것이다.

또한 본 발명의 실시에 있어, 목표 화자 기저음의 평균과 분산을 이용해 선형 변환을 진행하고 이를 다시 보코더로 재합성하는 방식으로 원 화자의 음정 정보를 복원하는 것을 특징으로한 (005)선형 기저음 변환부로 구성한 본 발명을 적용하여 실시하게 되면, 입력된 음성의 기저음을 변환하고자 하는 음성에 맞출 수 있게 될 것이다.

또한 본 발명의 실시에 있어, 보코더를 내장한 (006)음성 복원부로 구성한 본 발명을 적용하여 실시하게 되면, 상술된 선형 기저음 변환부의 출력물과 음성합성 DNN을 받아 최종 음성 합성물을 출력할 수 있게 될 것이다.

001: 음성데이터 녹음부, 002: 음성데이터 추출기, 003: 음성 사후 분포그램 DNN, 004: 음성합성 DNN, 005: 선형 기저음 변환부, 006: 음성 복원부

Claims

음성변조를 위한 음성모델 부호화를 이용한 음성합성 기술 및 장치에 있어서,
음성이 컴퓨터에 저장될 수 있도록 마이크와 ADC를 구성한 (001)음성데이터 녹음부, 음성 데이터에서 MFCC 및 기저음을 추출할 수 있게 보코더를 이용한 (002)음성데이터 추출기, MFCC를 음성사후 분포그램으로 바꿀 수 있게 학습한 (003)음성 사후 분포그램 DNN, 음성사후 분포그램으로 원하는 사람의 목소리로 바꿀 수 있게 학습한 (004)음성합성 DNN, 입력된 음성의 기저음을 변환하고자 하는 음성에 맞출 수 있게 목표 화자 기저음의 평균과 분산을 이용해 선형 변환을 진행하고 이를 다시 보코더로 재합성하는 방식으로 원 화자의 음정 정보를 복원하는 것을 특징으로한 (005)선형 기저음 변환부, 상술된 선형 기저음 변환부의 출력물과 음성합성 DNN을 받아 최종 음성 합성물을 출력할 수 있게 보코더를 내장한 (006)음성 복원부로 구성 된 것을 특징으로 하는 음성사후분포그램추출기와 TTS 및 보코더를 이용한 음성 변조 어플리케이션의 동작방법.
제 1항에 있어서,
(002)음성데이터 추출기를 통하여 음성 데이터에서 MFCC 및 기저음을 추출할 수 있게 보코더를 이용함을 특징으로 하는 음성사후분포그램추출기와 TTS 및 보코더를 이용한 음성 변조 어플리케이션의 동작방법.
제 1항에 있어서,
(003)음성 사후 분포그램 DNN을 통하여 MFCC를 음성사후 분포그램으로 바꿀 수 있게 학습함을 특징으로 하는 음성사후분포그램추출기와 TTS 및 보코더를 이용한 음성 변조 어플리케이션의 동작방법.
제 1항에 있어서,
(004)음성합성 DNN을 통하여 음성사후 분포그램으로 원하는 사람의 목소리로 바꿀 수 있게 학습함을 특징으로 하는 음성사후분포그램추출기와 TTS 및 보코더를 이용한 음성 변조 어플리케이션의 동작방법.
제 1항에 있어서,
(005)선형 기저음 변환부를 통하여 입력된 음성의 기저음을 변환하고자 하는 음성에 맞출 수 있게 목표 화자 기저음의 평균과 분산을 이용해 선형 변환을 진행하고 이를 다시 보코더로 재합성하는 방식으로 원 화자의 음정 정보를 복원하는 것을 특징으로함을 특징으로 하는 음성사후분포그램추출기와 TTS 및 보코더를 이용한 음성 변조 어플리케이션의 동작방법.
제 1항에 있어서,
(006)음성 복원부를 통하여 상술된 선형 기저음 변환부의 출력물과 음성합성 DNN을 받아 최종 음성 합성물을 출력할 수 있게 보코더를 내장함을 특징으로 하는 음성사후분포그램추출기와 TTS 및 보코더를 이용한 음성 변조 어플리케이션의 동작방법.