WO2017069556A1 - 전자 장치, 그의 음성 인식 방법 및 비일시적 컴퓨터 판독가능 기록매체 - Google Patents

전자 장치, 그의 음성 인식 방법 및 비일시적 컴퓨터 판독가능 기록매체 Download PDF

Info

Publication number
WO2017069556A1
WO2017069556A1 PCT/KR2016/011888 KR2016011888W WO2017069556A1 WO 2017069556 A1 WO2017069556 A1 WO 2017069556A1 KR 2016011888 W KR2016011888 W KR 2016011888W WO 2017069556 A1 WO2017069556 A1 WO 2017069556A1
Authority
WO
WIPO (PCT)
Prior art keywords
voice
speech
unit
trigger information
preprocessing
Prior art date
Application number
PCT/KR2016/011888
Other languages
English (en)
French (fr)
Inventor
송명석
Original Assignee
삼성전자 주식회사
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by 삼성전자 주식회사 filed Critical 삼성전자 주식회사
Priority to US15/761,506 priority Critical patent/US10796688B2/en
Publication of WO2017069556A1 publication Critical patent/WO2017069556A1/ko

Links

Images

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/06Creation of reference templates; Training of speech recognition systems, e.g. adaptation to the characteristics of the speaker's voice
    • G10L15/065Adaptation
    • G10L15/07Adaptation to the speaker
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/22Procedures used during a speech recognition process, e.g. man-machine dialogue
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/06Creation of reference templates; Training of speech recognition systems, e.g. adaptation to the characteristics of the speaker's voice
    • G10L15/063Training
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/20Speech recognition techniques specially adapted for robustness in adverse environments, e.g. in noise, of stress induced speech
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/28Constructional details of speech recognition systems
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/08Speech classification or search
    • G10L2015/088Word spotting
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/22Procedures used during a speech recognition process, e.g. man-machine dialogue
    • G10L2015/223Execution procedure of a spoken command
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L21/00Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
    • G10L21/02Speech enhancement, e.g. noise reduction or echo cancellation
    • G10L21/0208Noise filtering
    • G10L21/0216Noise filtering characterised by the method used for estimating noise
    • G10L2021/02161Number of inputs available containing the signal or the noise to be suppressed
    • G10L2021/02166Microphone arrays; Beamforming
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L21/00Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
    • G10L21/02Speech enhancement, e.g. noise reduction or echo cancellation
    • G10L21/0208Noise filtering
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L21/00Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
    • G10L21/02Speech enhancement, e.g. noise reduction or echo cancellation
    • G10L21/0208Noise filtering
    • G10L21/0216Noise filtering characterised by the method used for estimating noise

Definitions

  • the present invention relates to an electronic device, a speech recognition method thereof, and a non-transitory computer readable recording medium. More particularly, the electronic device, a speech recognition method thereof, and a non-transitory device capable of efficiently performing preprocessing using a speech recognition result.
  • a computer readable recording medium A computer readable recording medium.
  • a user command is input using a tool such as a keyboard and a remote controller.
  • a tool such as a keyboard and a remote controller.
  • interest in speech recognition is increasing.
  • the user may be at a location having various angles and distances from the electronic device that performs voice recognition.
  • Microphone array technology can be applied to provide the same speech recognition based human-machine interaction to users present at multiple locations.
  • Microphone array technology uses a plurality of microphones to reinforce a sound source (voice) in a target direction and to remove a sound source (noise) incident in the remaining direction.
  • the microphone-array-based preprocessing removes the noise and the audio-enhanced audio signal is passed to the speech recognizer for speech recognition by the trigger / word / sentence recognizer.
  • the reason for the preprocessing is that as the mismatch between training and test data increases in a low signal-to-noise ratio (SNR) noise environment, the performance of the speech recognizer degrades significantly. Because it becomes. Accordingly, various signal processing (or preprocessing) techniques are used to improve the resistance of the speech recognizer to noise.
  • SNR signal-to-noise ratio
  • a speech signal is processed using a method using a noise reduction algorithm.
  • a signal processing based speech detector has a problem in that speech-like noise having a frequency characteristic similar to speech cannot be distinguished from speech. Accordingly, the electronic device for speech recognition enhances speech in a completely different direction to cause speech distortion.
  • the preprocessing unit and the speech recognition unit operate independently, and the speech recognition unit starts operation after the preprocessing unit finishes the audio signal processing.
  • information useful to the preprocessor may not be used among the results generated by the speech recognition unit. Accordingly, in the conventional preprocessing technique, the above-described error is inevitable, and there is an increasing demand for a method for solving the above-described error.
  • the present invention has been made to solve the above-described problems, and an object thereof is to provide an electronic device, a speech recognition method thereof, and a non-transitory computer readable recording medium capable of receiving feedback of speech recognition results and improving speech recognition performance.
  • an electronic device including: an audio input unit configured to receive sound sources at different locations, and generate a plurality of voice signals, a preprocessor for preprocessing the plurality of voice signals; Speech recognition is performed by using the voice signal processed by the preprocessor, and the voice recognition unit generates trigger information when a preset trigger is detected as a result of the voice recognition.
  • the preprocessor includes the trigger generated by the voice recognition unit.
  • the voice signal may be processed according to the trigger information to generate an enhanced voice signal.
  • the apparatus may further include a detector configured to detect a direction of speech using the plurality of voice signals, wherein the detector receives feedback of the trigger information generated by the voice recognizer, changes a search range, and changes the search range.
  • the direction of ignition can be detected.
  • the sensing unit may detect a uttering direction for all directions, and if the trigger information is fed back, the sensing unit may detect a uttering direction only for a search range corresponding to the detected uttering direction.
  • the apparatus may further include a voice detector configured to distinguish between the voiced section and the unvoiced section by using the plurality of voice signals, wherein the voice detector receives the trigger information generated by the voice recognizer and feeds the feedback to the voiced section after voice detection.
  • the judging period may be changed, and the meteor section and the silent section may be distinguished using the changed judgment time.
  • the voice detector may distinguish between the voiced section and the unvoiced section by using a predetermined determination time, and when the trigger information is fed back, by using a second determination time longer than the predetermined determination time. You can distinguish between the meteor and the silent section.
  • the preprocessor may change a preprocessing method of the plurality of voice signals according to whether the trigger information is a voiced period and generate a voice signal enhanced by the changed preprocessing method.
  • the preprocessor may include a first configuration for generating an unvoiced signal from which speech is removed using a plurality of speech signals and a second configuration for generating an enhanced speech signal using the generated unvoiced signal.
  • the trigger information generated by the speech recognition unit may be fed back to change the degree of filtering to generate an unvoiced signal.
  • the second configuration may receive the feedback of the trigger information and change the degree of noise removal to generate an enhanced voice signal.
  • the apparatus may further include a display unit for displaying an image and a controller for controlling the display unit to display an image corresponding to the voice recognition result.
  • the apparatus may further include a communication unit configured to transfer the voice recognition result to an external device.
  • the apparatus may further include a speaker unit configured to output a voice output event corresponding to the voice recognition result.
  • the voice recognition method of the electronic device for generating the plurality of voice signals by receiving a sound source from different locations, the pre-processing for the plurality of voice signals Performing voice recognition using the preprocessed voice signal; generating a trigger information when a preset trigger is detected as a result of the voice recognition; feeding back the generated trigger information, according to the trigger information. And changing the manner of performing the preprocessing and generating the enhanced speech signal by processing the plurality of speech signals in the changed preprocessing manner.
  • the method may further include detecting a utterance direction using the plurality of voice signals, and the changing of the feedback signal may include: feeding back the generated trigger to change a search range and changing a utterance direction in the changed search range.
  • Sensing may include.
  • the firing direction when the trigger information is not fed back, the firing direction may be detected in all directions, and when the trigger information is fed back, the firing direction may be detected only for a search range corresponding to the detected firing direction. .
  • the method may further include distinguishing between the voiced section and the unvoiced section by using the plurality of voice signals, and the changing of the feedback information may include feeding back the generated trigger information to change the time determined as the voiced section after the voiced detection. And distinguishing between the voiced section and the unvoiced section by using the changed determination time.
  • the voiced section and the unvoiced section are divided by using a predetermined determination time, and when the trigger information is fed back, a second determination time longer than the predetermined determination time is used. It is possible to distinguish between the meteor section and the silent section.
  • the preprocessing method of the plurality of voice signals may be changed according to whether the trigger information is a meteor period.
  • the generating of the enhanced voice signal may include generating an unvoiced signal from which voice is removed using a plurality of voice signals and generating an enhanced voice signal by using the generated unvoiced signal.
  • the unvoiced signal may be generated by changing the degree of filtering by receiving the generated trigger information.
  • the generating of the enhanced voice signal may include receiving feedback of the trigger information and changing the degree of noise reduction to generate the enhanced voice signal.
  • a non-transitory computer readable recording medium including a program for executing a voice recognition method of an electronic device according to an embodiment of the present invention for achieving the above object, receives a plurality of voices from different sources Generating a signal, performing preprocessing on the plurality of voice signals, performing voice recognition using the preprocessed voice signal, generating trigger information when a preset trigger is detected as a result of voice recognition; Feedbacking the generated trigger information, changing a preprocessing method according to the trigger information, and processing the plurality of voice signals using the changed preprocessing method to generate an enhanced voice signal It may include a recognition method.
  • voice recognition performance of an electronic device may be improved.
  • 1A is a schematic block diagram illustrating a configuration of an electronic device according to an embodiment of the present disclosure
  • 1B is a schematic block diagram illustrating a configuration of an electronic device according to another embodiment of the present disclosure.
  • FIG. 2 is a block diagram illustrating a preprocessor of an electronic device according to an embodiment of the present disclosure
  • FIG. 3 is a block diagram illustrating a beamforming unit of an electronic device according to an embodiment of the present disclosure
  • FIG. 4 is a diagram for describing a voice recognition unit of an electronic device according to an embodiment of the present disclosure
  • FIG. 5 is a block diagram illustrating in detail a configuration of an electronic device according to an embodiment of the present disclosure
  • FIGS. 6A and 6B illustrate an audio input unit of an electronic device according to various embodiments of the present disclosure
  • FIG. 7 is a diagram for describing transmission of signals and information in an electronic device according to an embodiment of the present disclosure.
  • FIG. 8 is a flowchart illustrating a voice recognition method of an electronic device according to an embodiment of the present disclosure.
  • first and second may be used to describe various components, but the components are not limited by the terms. The terms are only used to distinguish one component from another.
  • first component may be referred to as the second component, and similarly, the second component may also be referred to as the first component.
  • FIG. 1A is a block diagram schematically illustrating a configuration of an electronic device 100 according to an embodiment of the present disclosure.
  • the electronic device 100 may include an audio input unit 110, a preprocessor 120, and a voice recognition unit 130.
  • the electronic device 100 may be implemented as any electronic device capable of voice recognition such as a display device such as a smart TV, a smart phone, a tablet PC, an audio device, an interactive voice recognition device, and a navigation device. .
  • a display device such as a smart TV, a smart phone, a tablet PC, an audio device, an interactive voice recognition device, and a navigation device.
  • the audio input unit 110 may receive a user voice.
  • the audio input unit 110 may include a plurality of microphones, and may receive a sound source at different positions to generate a plurality of voice signals.
  • the number of channels is determined according to the number of microphones constituting the audio input unit 110.
  • the microphones may be arranged at regular intervals or in a predetermined pattern according to the number thereof. For example, if four microphones are arranged at intervals of 90 degrees around the electronic device 100, the audio input unit 110 may generate a four-channel voice signal using the voices of the users received by the four microphones. have.
  • the preprocessor 120 may generate a preprocessed voice signal by performing pre-processing on the plurality of voice signals. Preprocessing refers to a series of processes performed prior to speech recognition. The preprocessor 120 may directly or indirectly feedback the information generated by the speech recognizer 130, and adaptively change the preprocessing scheme based on the feedback.
  • the preprocessor 120 may include a voice detector 121, a detector 123, and a beamformer 125.
  • the voice detector 121 may detect a voice section (hereinafter, voiced section) including a user's speech and a noise section (hereinafter, voiceless section) that does not include a user's speech from the voice signal.
  • the detector 123 may estimate an input direction and a distance of a sound source using gain and delay information of a voice input signal for each channel.
  • the beamformer 125 may generate a voice signal enhanced in a target direction by applying a gain and a delay to the voice input signal for each channel using a spatial filtering method.
  • the voice recognition unit 130 performs voice recognition using the enhanced voice signal. For example, the voice recognition unit 130 may detect and recognize the trigger word from the input voice signal, and generate a word / sentence speech recognition result from the voice signal after the trigger word is recognized. In addition, when a preset trigger is detected as a result of the speech recognition, the voice recognition unit 130 may generate trigger information and transmit the trigger information to the preprocessor 120.
  • FIG. 1B is a block diagram illustrating a configuration of an electronic device 100 according to another embodiment of the present disclosure.
  • the electronic device 100 may further include a configuration of the mode determination unit 140. This corresponds to an embodiment in which a function to be processed by the preprocessor 120 or the voice recognition unit 130 is implemented in a separate configuration.
  • the mode determination unit 140 may determine the state of the current electronic device 100 based on the information generated by the voice recognition unit 130. For example, the mode determination unit 140 may provide information such as whether the state of the electronic device 100 is waiting to recognize a trigger word, whether the trigger word is recognized and waiting for a voice signal to recognize a word / sentence. It may be delivered to the preprocessor 120.
  • the preprocessor 120 may include a voice detector 121, a detector 123, and a beamformer 125.
  • the preprocessor 120 may be implemented as a single chip such as a digital signal processor (DSP) or a central processing unit (CPU).
  • DSP digital signal processor
  • CPU central processing unit
  • the preprocessor 120 may change the preprocessing method by receiving feedback of the voice recognition result. For example, the preprocessor 120 may receive feedback on voice recognition results such as whether a voiced section is detected and whether a trigger word is recognized. The preprocessor 120 may change the preprocessing method such as the length of the hangover, the voice search range, and the adaptive speed of the adaptive filter using the feedback information.
  • the voice detector 121 may detect a voice section (hereinafter, voiced section) including a user's speech and a noise section (hereinafter, voiceless section) that does not include a user's speech from the voice signal. For example, the voice detector 121 may distinguish whether the voiced or unvoiced section is performed on a frame basis. The voice detector 121 may transmit the generated voice section information to the detector 123 and the beamformer 125.
  • voiced section including a user's speech and a noise section (hereinafter, voiceless section) that does not include a user's speech from the voice signal.
  • voice detector 121 may distinguish whether the voiced or unvoiced section is performed on a frame basis.
  • the voice detector 121 may transmit the generated voice section information to the detector 123 and the beamformer 125.
  • the voice detector 121 may adjust the weight to be determined as the voiced section using the voice recognition information. For example, the voice detector 121 may change the time (or the number of frames) determined as the voiced section after the voiced detection in the trigger information. The voice detector 121 may divide the voice signal from the voiced section and the voiceless section based on the changed criteria.
  • the voice detector 121 may adjust a weight to be determined as a meteor section by changing a hang-over section.
  • the hangover refers to a period in which a voice is also determined for subsequent framing after the voice is detected once. For example, when the length of the hangover is set to infinity, the voice detector 121 detects all the frames after the frame determined as the meteor section once as the meteor section. On the contrary, if the hangover is set to the minimum, the voice detector 121 determines whether the voiced section or the unvoiced section is independently for each frame. As such, the setting of the hangover length plays an important role in the reliability of the voice section information generated by the voice detector 121.
  • the voice detector 121 may change the time determined as the meteor section after the meteor detection according to the feedback trigger information. In addition, the voice detector 121 may distinguish the voiced section and the unvoiced section by using the changed determination time.
  • the speech detector 121 increases the hangover length to reduce the noise of the speech section detection. It can increase the toughness. For example, the voice detector 121 may adjust the hangover length as shown in Equation 1 below.
  • Trigger ON refers to a case in which the current trigger word is recognized by the speech recognition information generated by the speech recognition unit 130 or the recognition score of the trigger word is higher than a preset value.
  • the voice detector 121 may set a large hangover length determined as the voiced section.
  • trigger OFF means that the current trigger word is not recognized by the voice traffic information or the recognition score of the trigger word is lower than a preset value.
  • the voice detector 121 may set the hangover length to be short to determine whether the voice is a voiced section.
  • the score is a value that quantifies the probability that the target speech component is present in the frame.
  • the electronic device 100 may experimentally optimize and set a threshold score value that may determine that the target voice component exists.
  • the voice recognition unit 130 may determine whether the target voice component is a voice section by comparing the score in the corresponding frame with a predetermined threshold score value.
  • the voice detector 121 may change a weight to be determined as a meteor interval according to the state of the electronic device 100 determined by the mode determiner 140. For example, if it is determined that the electronic device 100 is waiting to recognize a trigger word, the voice detector 121 may increase a weight to be determined as an unvoiced section. As another example, when it is determined that the electronic device 100 is waiting for a voice signal input to recognize a word / sentence after recognizing a trigger word, the voice detector 121 may increase a weight to be determined as a meteor period.
  • the detector 123 may receive a voice signal, voice section information, and voice recognition information to detect an incident angle of the input voice signal. That is, the detector 123 may detect the direction of speech using a plurality of voice signals. For example, the detector 123 may generate the target direction angle information in units of frames from the input signal. When only the voice section exists in the voice signal, the target direction angle information for each frame is small in variance and is distributed close to the actual target direction. On the contrary, when the voice signal is noisy, the angle information for each frame has a tendency to be evenly distributed in all directions.
  • the sensor 123 may generate normalized angle information by estimating a direction in which the voice signal is most likely to be incident using the target direction angle information, the voice section information, and the voice recognition information in units of frames.
  • the detector 123 may transmit the generated angle information to the beamformer 125.
  • the detector 123 may detect the direction of speech by changing the search range according to the voice recognition information. For example, the detector 123 may adjust a weight to an angle at which the voice signal is incident by using the voice recognition information generated by the voice recognizer 130. In addition, the detector 123 may estimate an incident angle of the voice signal using the adjusted weight.
  • the sensing unit 123 may set a search section as shown in Equation 2.
  • Voice Activity Detection (VAD) OFF means when the voice section information generated by the voice detector 121 is determined to be an unvoiced section. In this case, the detector 123 maintains the previous search section as it is.
  • VAD ON means a case where the voice detection unit 121 determines that the voiced section. 'VAD ON and trigger OFF' is detected as a meteor section, but when the trigger word is not recognized or the recognition score of the trigger word is lower than a preset value based on the voice recognition information. In this case, the detector 123 needs to widen the search range for trigger word recognition. The detector 123 may set a wider range to the left or right than the previously generated search range angle as the search range.
  • 'VAD ON and trigger ON' is detected as a meteor interval, and means a case where a trigger word is recognized or a recognition score of the trigger word is higher than a preset value. In other words, this case corresponds to a case in which the user's speech is likely to continue in the trigger word detection direction. In this case, the detector 123 may narrow the previously generated search range to the trigger word detection direction.
  • the detector 123 may detect the speech direction in all directions. On the contrary, when the trigger information is fed back, the detector 123 may detect the speech direction only for the search range corresponding to the detected speech direction.
  • the beamformer 125 may generate a voice signal enhanced in a target direction by applying a gain and a delay to the voice input signal for each channel using a spatial filtering method.
  • 3 is a diagram for describing a configuration of the beamformer 125 of the electronic device 100 according to an embodiment of the present disclosure.
  • the beamformer 125 includes a fixed beamformer 125-1, a block matrix 125-3, and a multiple-input canceller 125-. 5) and a post-filter 125-7.
  • the post filter unit 125-7 may be implemented as a separate module.
  • the beamforming unit 125 may adjust parameters of an internal module using voice recognition information in generating a reduced voice signal.
  • the fixed beamforming unit 125-1 may receive a voice signal and angle information.
  • the fixed beamformer 125-1 may amplify the signal input in the angular direction in which the voice is sensed and generate a voice signal amplified in the target direction.
  • the block matrix unit 125-3 may receive a voice signal, angle information, voice section information, and trigger recognition information.
  • the block matrix unit 125-3 removes a signal input in a corresponding angular direction to generate a voice signal from which a target direction signal is removed. That is, the block matrix unit 125-3 may remove reference parts of the user from the voice signal to generate reference data about noise.
  • the block matrix unit 125-3 may transfer the reference data about the generated noise to the multiple input canceller 125-5.
  • the multi-input canceller 125-5 may receive a voice signal, voice interval information, and trigger recognition information from which the target direction signal generated by the block matrix unit 125-3 is removed. In addition, the multi-input canceller 125-5 may remove the noise leakage included in the output of the fixed beamformer 125-1 to generate the enhanced voice signal.
  • the block matrix unit 125-3 generates a voice preference from which a signal of a desired direction is removed. To this end, the block matrix unit 125-3 sets the adaptive filter to adapt to the direction in which the voice exists.
  • the block matrix unit 125-3 may set an adaptive filter in the same manner as in Equation 3 below.
  • Voice Activity Detection (VAD) OFF means when the voice section information generated by the voice detector 121 is determined to be an unvoiced section.
  • the block matrix unit 125-3 may set the step size of the adaptive filter to a minimum. This is because in the unvoiced section, it is important to prevent overfitting rather than fast adaptation.
  • VAD ON means a case where the voice detection unit 121 determines that the voiced section. 'VAD ON and trigger OFF' is detected as a meteor section, but when the trigger word is not recognized or the recognition score of the trigger word is lower than a preset value based on the voice recognition information.
  • the block matrix unit 125-3 can set the step size of the adaptive filter to the middle.
  • the block matrix unit 125-3 sets the step size of the adaptive filter to the maximum, thereby quickly adapting the filter.
  • the multi-input canceller 125-5 uses the voice signal from which the target direction signal generated by the block matrix unit 125-3 is removed to remove noise leakage included in the output of the fixed beamformer 125-1. Can be removed to produce an enhanced voice signal. To this end, the multi-input canceller 125-5 may output an audio signal in which noise is eliminated as much as possible by adapting an adaptive filter in a section where only noise exists.
  • the multi-input canceller 125-5 may set an adaptive filter in the same manner as in Equation 4 below.
  • Voice Activity Detection (VAD) OFF means when the voice section information generated by the voice detector 121 is determined to be an unvoiced section.
  • the multiple input canceller 125-5 may set the step size of the adaptive filter to the maximum. This is because the multiple input canceller 125-5 needs fast adaptation in the unvoiced section.
  • VAD ON means a case where the voice detection unit 121 determines that the voiced section. 'VAD ON and trigger OFF' is detected as a meteor section, but when the trigger word is not recognized or the recognition score of the trigger word is lower than a preset value based on the voice recognition information.
  • the multiple input canceller 125-5 may set the step size of the adaptive filter to an intermediate value.
  • the multiple input canceller 125-5 may set the step size of the adaptive filter to a minimum.
  • the post filter unit 125-7 may remove noise that is not removed by the spatial filtering method.
  • the post filter unit 125-7 may be an amplified voice signal generated in the target direction generated by the fixed beamforming unit 125-1, and an enhanced voice signal generated by the multiple input canceller 125-5. Voice section information and voice recognition information may be input. By using this, the post filter unit 125-7 may remove the noise that the fixed beamforming unit 125-1 may not remove by the spatial filtering method.
  • the post filter unit 125-7 may need to adjust the degree of noise reduction according to the situation.
  • the post filter unit 125-7 may set the noise removing strength in the manner as shown in Equation 5 below.
  • Voice Activity Detection (VAD) OFF means when the voice section information generated by the voice detector 121 is determined to be an unvoiced section.
  • the post filter unit 125-7 may set the noise canceling intensity to be the largest. This is because the information required for speech recognition is least likely to be removed along with noise cancellation.
  • VAD ON means a case where the voice detection unit 121 determines that the voiced section. 'VAD ON and trigger OFF' is detected as a meteor section, but when the trigger word is not recognized or the recognition score of the trigger word is lower than a preset value based on the voice recognition information. In this case, the post filter section 125-7 can set the removal strength to an intermediate level.
  • the post filter unit 125-7 may reduce the noise removal intensity to reduce the possibility of speech distortion.
  • the beamformer 125 may use the information determined by the mode determiner 140. For example, when the state of the electronic device 100 waits for a trigger word by the mode determination unit 140, the beamformer 125 may set a parameter coefficient for noise removal to the maximum. As another example, when the state of the electronic device 100 recognizes a trigger word and is waiting for input of a voice signal for word / sentence recognition by the mode determination unit 140, the beamformer 125 performs voice distortion.
  • the parameter coefficient can be set in the direction of minimizing.
  • the speech recognizer 130 may include a trigger recognizer 131 and a word / phrase recognizer 133.
  • the trigger recognizer 131 may detect the trigger signal from the enhanced voice signal generated by the preprocessor 120.
  • the trigger recognition unit 131 may generate trigger information including a trigger recognition score and whether recognition is completed.
  • the trigger recognizer 131 may transmit the generated trigger information to the preprocessor 120.
  • the word / phrase recognizer 133 may recognize the word / phrase from the enhanced speech signal generated by the preprocessor 120. For example, the word / phrase recognition unit 133 may perform an operation only when the trigger recognition is completed in the trigger recognition unit 131. The word / phrase recognizer 133 may generate information including a word / phrase recognition score and whether recognition is completed.
  • the electronic device 100 may include the display unit 150, the communication unit 160, and the speaker unit in addition to the audio input unit 110, the preprocessor 120, and the voice recognition unit 130. 170 and the controller 180 may be further included. The description of the preprocessor 120 and the voice recognition unit 130 will be omitted.
  • the display unit 150 may display an image.
  • the display unit 150 may be implemented as a liquid crystal display (LCD), an organic light emitting display (OLED), a plasma display panel (PDP), or the like. It is possible to provide various display screens that can be provided through.
  • the display unit 150 may display an image corresponding to a voice recognition result of the voice recognition unit 130. For example, the display 150 may display a response message corresponding to the voice of the user as text or an image.
  • the voice recognition unit 130 recognizes a channel change command, and the controller 180 controls the display unit 150 to display the changed channel. can do.
  • the communicator 160 communicates with an external device.
  • the external device may be implemented as a cloud server.
  • the communicator 160 may transmit a voice recognition result to an external device and receive corresponding information from the external device.
  • the communication unit 160 may include various communication modules such as a short range wireless communication module (not shown), a wireless communication module (not shown), and the like.
  • the short range wireless communication module is a module for performing communication with an external device located in a short range according to a short range wireless communication scheme such as Bluetooth, ZigBee.
  • the wireless communication module is a module connected to an external network and performing communication according to a wireless communication protocol such as WiFi or IEEE.
  • the wireless communication module performs communication by connecting to a mobile communication network according to various mobile communication standards such as 3G (3rd Generation), 3GPP (3rd Generation Partnership Project), Long Term Evoloution (LTE), LTE Advanced (LTE-A), etc. It may further include a mobile communication module.
  • 3G 3rd Generation
  • 3GPP 3rd Generation Partnership Project
  • LTE Long Term Evoloution
  • LTE-A LTE Advanced
  • the speaker unit 170 may output voice.
  • the speaker unit 170 may output a voice output event corresponding to the voice recognition result.
  • the speaker unit 170 may give a feeling that the user is talking to the electronic device 100.
  • the controller 180 may control the overall configuration of the electronic device 100. For example, information transfer between the audio input unit 110, the preprocessor 120, and the voice recognition unit 130 may be performed through the control of the controller 180.
  • the audio input unit 110 may be integrally formed with the upper side, the front side, the side, or the like of the electronic device 100, or may be provided as a separate means and connected to the electronic device 100 through a wired or wireless interface.
  • the audio input unit 110 includes a plurality of microphones and receives sound sources at different positions.
  • the audio input unit 110 may include six microphones 110-1, 110-2, 110-3, 110-4, 110-5, arranged at intervals of 60 degrees around the electronic device 100. 110-6).
  • the audio input unit 110 uses a user voice received from six microphones 110-1, 110-2, 110-3, 110-4, 110-5, and 110-6 to output a six channel voice signal.
  • the detector 123 may estimate an input direction and a distance of a sound source using gain and delay information of a voice input signal for each channel.
  • the audio input unit 110 is not necessarily limited to having a plurality of microphones in the form shown in FIG. 6A.
  • the audio input unit 110 may be disposed outside or inside the electronic device 100, and the number of microphones is not limited to six.
  • the audio input unit 110 illustrated in FIG. 6A is described as a device provided separately from the electronic device 100, but the audio input unit 110 of FIG. 6A is integrally attached to one side of the electronic device 100. May be used.
  • FIG. 6B is a diagram for describing a sound source input method according to an exemplary embodiment using a plurality of external audio input units.
  • an electronic device 100 is disposed in an area of a house.
  • the audio input unit 110 included in the electronic device 100 is called a main audio input unit, and the other audio input units 111, 113, and 115 provided separately from the electronic device 100 are called sub-audio input units. .
  • the sub audio input units 111, 113, and 115 may be disposed in other areas of the house.
  • the electronic device 100 and the plurality of sub audio input units 111, 113, and 115 may be connected to each other through a network to form an Internet of Things (IoT) environment.
  • IoT Internet of Things
  • each device may be connected to each other via a home network, Bluetooth, Wi-Fi, Wi-Fi Direct, and the like.
  • Each of the sub audio input units 111, 113, and 115 may be configured of a plurality of microphones, similar to the main audio input unit 110, to receive sound sources at different positions.
  • the electronic device 100 may stop the operation of receiving the sound source from the remaining audio input units.
  • the electronic device 100 may not process sound sources input from the remaining audio input units 110, 111, and 115. This is because the sound sources input to the remaining audio input units 110, 111, and 115 are more likely to be caused by noise than by the user.
  • the sub audio input unit 113 near the user may generate a user's voice as a voice signal of a plurality of channels using a plurality of microphones provided.
  • the sub audio input unit 113 may transmit the generated multiple channel voice signals to the network-connected electronic device 100.
  • the detector 123 of the electronic device 100 estimates the direction of the user and the distance from the sub audio input unit 113 in the region where the user is located, using gain and delay information of a voice input signal for each channel. can do.
  • the electronic device 100 may determine an area where the user is located by using an internal camera, a CCTV, or the like included in the IoT environment. In addition, the electronic device 100 may activate only the audio input unit disposed in the area where the user is located.
  • FIG. 7 is a diagram for describing transmission of signals and information in the electronic device 100 according to an embodiment of the present disclosure. Referring to FIG. 7, a path for transmitting signals and information between the audio input unit 110, the preprocessor 120, and the voice recognition unit 130 will be described.
  • the audio input unit 110 receives a sound source at different positions to generate a plurality of voice signals.
  • the voice signal generated by the audio input unit 110 is input to the voice detector 121, the detector 123, the fixed beamforming unit 125-1, and the block matrix unit 125-3.
  • the voice detector 121 may generate voice section information by dividing the voiced section and the unvoiced section by using the input voice signal.
  • the generated voice interval information may be transmitted to the detector 123, the block matrix unit 125-3, the multiple input canceller 125-5, and the post filter unit 125-7.
  • the detector 123 may detect the direction of speech using the input voice signal.
  • the detector 123 may generate angle information and transmit the angle information to the fixed beamforming unit 125-1 and the block matrix unit 125-3.
  • the fixed beamforming unit 125-1 performs spatial filtering using the input voice signal and the angle information.
  • the fixed beamformer 125-1 may transmit the voice signal enhanced by spatial filtering to the post filter unit 125-7.
  • the block matrix unit 125-3 may remove the voice in a desired direction from the input voice signal and transmit the removed voice to the multiple input canceller 125-5. Using the voice interval information and the trigger information, the block matrix unit 125-3 may set an adaptive speed of the adaptive filter.
  • the multiple voice canceller 125-5 may receive a voice signal from which the voice in the target direction is removed from the block matrix unit 125-3. By using this, the multiple voice canceller 125-5 may eliminate noise leakage other than the intended direction. Using the voice interval information and the trigger information, the multiple voice canceller 125-5 may set an adaptive speed of the adaptive filter.
  • the post filter unit 125-7 may remove noise that is not removed by the spatial filtering method. Using the voice section information and the trigger information, the post filter unit 125-7 may adjust the degree of noise removal accordingly. Then, the filter unit 125-7 may transfer the voice signal enhanced by the noise removing unit to the voice recognition unit 130.
  • the speech recognition unit 130 may generate information that can be used by the preprocessor 120 from the speech recognition result.
  • the trigger recognition unit 131 may generate trigger information on whether a trigger word is input.
  • the trigger recognition unit 131 transmits trigger information to the voice detector 121, the detector 123, the block matrix unit 125-3, the multiple input canceller 125-5, and the post filter unit 125-7. ) Can be fed back.
  • the electronic device 100 may estimate the state of the electronic device 100 and the user from the voice recognition result, and the preprocessor may use the estimated information to estimate the voice. It is possible to increase the speech recognition success rate by varying the signal preprocessing method.
  • FIG. 8 is a flowchart illustrating a voice recognition method of the electronic device 100 according to an embodiment of the present disclosure.
  • the electronic device 100 may first receive sound sources at different locations and generate a plurality of voice signals (S810). For example, the electronic device 100 may generate a multichannel voice signal through a microphone array configured with a plurality of microphones. The electronic device 100 may determine the direction and distance from which the sound source is uttered, based on a difference in time when a sound source is input to the plurality of microphones.
  • the electronic device 100 may perform preprocessing on the plurality of input voice signals (S820).
  • the electronic device 100 may perform voice recognition using the preprocessed voice signal.
  • the electronic device 100 may determine whether a preset trigger is detected in the voice recognition result (S840). If a predetermined trigger is detected as a result of the voice recognition in operation S840-Y, the electronic device 100 may generate trigger information in operation S850.
  • the trigger information may be information on whether the trigger is recognized or the trigger recognition score.
  • the electronic device 100 may change a method of performing preprocessing by feeding back the generated trigger information. For example, the electronic device 100 may change the time determined as the meteor section after the meteor detection. As another example, the electronic device 100 may change the search angle range for detecting the speech direction. As another example, the electronic device 100 may change the adaptive speed of the adaptive filter or change the degree of noise removal.
  • the electronic device 100 may generate a reinforced voice signal by processing the plurality of voice signals in a changed preprocessing manner (S870).
  • the change in the preprocessing manner may include at least one of the above-described change in the meteor interval determination time, the change in the search angle range, the change in the adaptation speed of the adaptive filter, and the change in the degree of noise removal.
  • the state of the electronic device and the user may be estimated from the voice recognition information.
  • the methods described above may be embodied in the form of program instructions that may be executed by various computer means and may be recorded in a computer readable medium.
  • the computer readable medium may include program instructions, data files, data structures, etc. alone or in combination.
  • Program instructions recorded on the media may be those specially designed and constructed for the purposes of the present invention, or they may be of the kind well-known and available to those having skill in the computer software arts.
  • Examples of computer-readable recording media include magnetic media such as hard disks, floppy disks, and magnetic tape, optical media such as CD-ROMs, DVDs, and magnetic disks, such as floppy disks.
  • Examples of program instructions include not only machine code generated by a compiler, but also high-level language code that can be executed by a computer using an interpreter or the like.
  • the hardware device may be configured to operate as one or more software modules to perform the operations of the present invention, and vice versa.

Landscapes

  • Engineering & Computer Science (AREA)
  • Acoustics & Sound (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Physics & Mathematics (AREA)
  • Computational Linguistics (AREA)
  • Multimedia (AREA)
  • Artificial Intelligence (AREA)
  • Circuit For Audible Band Transducer (AREA)
  • Quality & Reliability (AREA)
  • Signal Processing (AREA)
  • Telephone Function (AREA)
  • User Interface Of Digital Computer (AREA)

Abstract

전자 장치, 그의 음성 인식 방법 및 비일시적 컴퓨터 판독가능 기록매체가 제공된다. 본 발명의 일 실시 예에 따른 전자 장치는, 서로 다른 위치에서 음원을 입력받아 복수의 음성 신호를 생성하는 오디오 입력부, 복수의 음성 신호에 대한 전처리를 수행하는 전처리부 및 전처리부에서 처리된 음성 신호를 이용하여 음성 인식을 수행하고, 음성 인식 결과 기설정된 트리거가 감지되면 트리거 정보를 생성하는 음성 인식부를 포함하고, 전처리부는, 음성 인식부에서 생성된 트리거 정보를 피드백 받아, 트리거 정보에 따라 전처리 방식을 변경하고, 변경된 전처리 방식으로 복수의 음성 신호를 처리하여 강화된 음성 신호를 생성할 수 있다.

Description

전자 장치, 그의 음성 인식 방법 및 비일시적 컴퓨터 판독가능 기록매체
본 발명은 전자 장치, 그의 음성 인식 방법 및 비일시적 컴퓨터 판독가능 기록매체에 관한 것으로, 더욱 구체적으로는, 음성 인식 결과를 이용하여 전처리를 효율적으로 할 수 있는 전자 장치, 그의 음성 인식 방법 및 비일시적 컴퓨터 판독가능 기록매체에 관한 것이다.
사용자가 모바일 기기나 디스플레이 기기와 같은 다양한 전자 기기를 이용할 때 기존에는 키보드, 리모컨과 같은 도구를 이용하여 사용자 명령을 입력하였다. 하지만, 최근 사용자 명령의 입력 방식이 다변화됨에 따라 음성 인식에 대한 관심이 높아지고 있다.
사용자는 음성 인식을 수행하는 전자 장치로부터 다양한 각도 및 거리를 갖는 위치에 존재할 수 있다. 여러 위치에 존재하는 사용자에게 동일한 음성 인식 기반의 인간-기계 인터렉션을 제공하기 위해서 마이크 어레이 기술이 적용될 수 있다. 마이크 어레이 기술은 복수의 마이크를 사용하여 목적 방향의 음원(음성)을 강화하고, 나머지 방향에서 입사하는 음원(잡음)은 제거하는 기술이다.
마이크 어레이 기반 전처리에 의해 잡음이 제거되고 음성이 강화된 오디오 신호는 음성 인식기로 전달되어 트리거/단어/문장 인식기에 의해 음성 인식 기능을 수행하게 된다. 전처리가 필요한 이유는, 낮은 신호 대 잡음 비(signal to noise ration, SNR)의 잡음 환경에서 훈련(training)과 테스트(test) 데이터의 불일치(mismatch)가 커짐에 따라, 음성 인식기의 성능은 크게 저하되기 때문이다. 이에 따라, 음성 인식기의 잡음에 대한 저항력을 향상시키기 위한 다양한 신호처리(혹은 전처리) 기술이 사용되고 있다.
예를 들어, 종래의 전처리 기술에서는 잡음 경감 알고리즘을 사용하는 방식을 이용하여 음성 신호를 처리하였다. 하지만, 종래의 전처리 기술에는 전처리부에서 잘못된 판단을 할 경우, 연속적으로 오류를 발생/증폭시키는 문제점이 존재한다. 예를 들어, 신호 처리 기반 음성 검출기는 음성과 유사한 주파수 특성을 갖는 잡음(speech-like noise)을 음성과 구분하지 못하는 문제점을 갖는다. 이에 따라, 음성 인식을 위한 전자 장치는 전혀 다른 방향의 음성을 강화하여 음성 왜곡을 일으키게 된다.
종래의 전처리 기술은 전처리부와 음성 인식부가 독립적으로 운영되며, 전처리부에서 오디오 신호처리를 마친 이후에 음성 인식부가 동작을 시작하게 된다. 이와 같은 전처리 기술에서는 음성 인식부가 생성하는 결과 중 전처리부에 유용한 정보가 사용되지 못하게 된다. 이에 따라 종래의 전처리 기술은 상술한 오류 발생이 불가피하였으며, 이를 해결하기 위한 방법에 대한 요구가 증가하고 있다.
본 발명은 상술한 문제점을 해결하기 위한 것으로, 음성 인식 결과를 피드백 받아서, 음성 인식 성능을 향상시킬 수 있는 전자 장치, 그의 음성 인식 방법 및 비일시적 컴퓨터 판독가능 기록매체를 제공함을 목적으로 한다.
상기 목적을 달성하기 위한 본 발명의 일 실시 예에 따른 전자 장치는, 서로 다른 위치에서 음원을 입력받아 복수의 음성 신호를 생성하는 오디오 입력부, 상기 복수의 음성 신호에 대한 전처리를 수행하는 전처리부 및 상기 전처리부에서 처리된 음성 신호를 이용하여 음성 인식을 수행하고, 음성 인식 결과 기설정된 트리거가 감지되면 트리거 정보를 생성하는 음성 인식부를 포함하고, 상기 전처리부는, 상기 음성 인식부에서 생성된 상기 트리거 정보를 피드백 받아, 상기 트리거 정보에 따라 복수의 음성 신호를 처리하여 강화된 음성 신호를 생성할 수 있다.
그리고, 상기 복수의 음성 신호를 이용하여 발화 방향을 감지하는 감지부를 더 포함하고, 상기 감지부는, 상기 음성 인식부에서 생성된 상기 트리거 정보를 피드백 받아, 검색 범위를 변경하고, 상기 변경된 검색 범위에서 발화 방향을 감지할 수 있다.
또한, 상기 감지부는, 상기 트리거 정보가 피드백 되지 않으면 전 방향에 대해서 발화 방향을 감지하고, 상기 트리거 정보가 피드백 되면 기 감지된 발화 방향에 대응되는 검색 범위에 대해서만 발화 방향을 감지할 수 있다.
그리고, 상기 복수의 음성 신호를 이용하여 유성 구간과 무성 구간을 구분하는 음성 검출부를 더 포함하고, 상기 음성 검출부는, 상기 음성 인식부에서 생성된 상기 트리거 정보를 피드백 받아, 유성 검출 이후 유성 구간으로 판단하는 시간을 변경하고, 변경된 판단 시간을 이용하여 유성 구간과 무성 구간을 구분할 수 있다.
또한, 상기 음성 검출부는, 상기 트리거 정보가 피드백 되지 않으면 기설정된 판단 시간을 이용하여 유성 구간과 무성 구간을 구분하고, 상기 트리거 정보가 피드백 되면 상기 기설정된 판단 시간보다 긴 제2 판단 시간을 이용하여 유성 구간과 무성 구간을 구분할 수 있다.
그리고, 상기 전처리부는, 상기 트리거 정보, 유성 구간인지 여부에 따라 복수의 음성 신호의 전처리 방식을 변경하고, 변경된 전처리 방식으로 강화된 음성 신호를 생성할 수 있다.
또한, 상기 전처리부는, 복수의 음성 신호를 이용하여 음성이 제거된 무성 신호를 생성하는 제1 구성 및 상기 생성된 무성 신호를 이용하여 강화된 음성 신호를 생성하는 제2 구성을 포함하며, 상기 제1 구성은, 상기 음성 인식부에서 생성된 상기 트리거 정보를 피드백 받아, 필터링 정도를 변경하여 무성 신호를 생성할 수 있다.
그리고, 상기 제2 구성은, 상기 트리거 정보를 피드백 받아, 잡음 제거 정도를 변경하여 강화된 음성 신호를 생성할 수 있다.
또한, 영상을 표시하는 디스플레이부 및 상기 음성 인식 결과에 대응되는 영상이 표시되도록 상기 디스플레이부를 제어하는 제어부를 더 포함할 수 있다.
그리고, 상기 음성 인식 결과를 외부 장치로 전달하는 통신부를 더 포함할 수 있다.
또한, 상기 음성 인식 결과에 대응되는 음성 출력 이벤트를 출력하는 스피커부를 더 포함할 수 있다.
한편, 상기 목적을 달성하기 위한 본 발명의 일 실시 예에 따른 전자 장치의 음성 인식 방법은, 서로 다른 위치에서 음원을 입력받아 복수의 음성 신호를 생성하는 단계, 상기 복수의 음성 신호에 대한 전처리를 수행하는 단계, 상기 전처리된 음성 신호를 이용하여 음성 인식을 수행하는 단계, 음성 인식 결과 기설정된 트리거가 감지되면 트리거 정보를 생성하는 단계, 상기 생성된 트리거 정보를 피드백 하여, 상기 트리거 정보에 따라 상기 전처리를 수행하는 방식을 변경하는 단계 및 상기 변경된 전처리 수행 방식으로 상기 복수의 음성 신호를 처리하여 강화된 음성 신호를 생성하는 단계를 포함할 수 있다.
그리고, 상기 복수의 음성 신호를 이용하여 발화 방향을 감지하는 단계를 더 포함하고, 상기 변경하는 단계는, 상기 생성된 트리거를 피드백 하여, 검색 범위를 변경하는 단계 및 상기 변경된 검색 범위에서 발화 방향을 감지하는 단계를 포함할 수 있다.
또한, 상기 피드백 제어 단계는, 상기 트리거 정보가 피드백 되지 않으면 전 방향에 대해서 발화 방향을 감지하고, 상기 트리거 정보가 피드백 되면 기 감지된 발화 방향에 대응되는 검색 범위에 대해서만 발화 방향을 감지할 수 있다.
그리고, 상기 복수의 음성 신호를 이용하여 유성 구간과 무성 구간을 구분하는 단계를 더 포함하고, 상기 변경하는 단계는, 상기 생성된 트리거 정보를 피드백 하여, 유성 검출 이후 유성 구간으로 판단하는 시간을 변경하는 단계 및 상기 변경된 판단 시간을 이용하여 유성 구간과 무성 구간을 구분하는 단계를 포함할 수 있다.
한편, 상기 변경하는 단계는, 상기 트리거 정보가 피드백 되지 않으면 기설정된 판단 시간을 이용하여 유성 구간과 무성 구간을 구분하고, 상기 트리거 정보가 피드백 되면 상기 기설정된 판단 시간보다 긴 제2 판단 시간을 이용하여 유성 구간과 무성 구간을 구분할 수 있다.
그리고, 상기 변경하는 단계는, 상기 트리거 정보, 유성 구간인지 여부에 따라 복수의 음성 신호의 전처리 방식을 변경할 수 있다.
또한, 상기 강화된 음성 신호를 생성하는 단계는, 복수의 음성 신호를 이용하여 음성이 제거된 무성 신호를 생성하는 단계 및 상기 생성된 무성 신호를 이용하여 강화된 음성 신호를 생성하는 단계를 포함하며, 상기 무성 신호를 생성하는 단계는, 상기 생성된 트리거 정보를 피드백 받아 필터링 정도를 변경하여 무성 신호를 생성할 수 있다.
그리고, 상기 강화된 음성 신호를 생성하는 단계는, 상기 트리거 정보를 피드백 받아, 잡음 제거 정도를 변경하여 강화된 음성 신호를 생성할 수 있다.
한편, 상기 목적을 달성하기 위한 본 발명의 일 실시 예에 따른 전자 장치의 음성 인식 방법을 실행하기 위한 프로그램을 포함하는 비일시적 컴퓨터 판독가능 기록매체는, 서로 다른 위치에서 음원을 입력받아 복수의 음성 신호를 생성하는 단계, 상기 복수의 음성 신호에 대한 전처리를 수행하는 단계, 상기 전처리된 음성 신호를 이용하여 음성 인식을 수행하는 단계, 음성 인식 결과 기설정된 트리거가 감지되면 트리거 정보를 생성하는 단계, 상기 생성된 트리거 정보를 피드백 하여, 상기 트리거 정보에 따라 전처리를 수행하는 방식을 변경하는 단계 및 상기 변경된 전처리 수행 방식으로 상기 복수의 음성 신호를 처리하여 강화된 음성 신호를 생성하는 단계를 포함하는 음성 인식 방법을 포함할 수 있다.
이상과 같은 본 발명의 다양한 실시 예에 따르면, 전자 장치의 음성 인식 성능이 향상될 수 있다.
도 1a는 본 발명의 일 실시 예에 따른 전자 장치의 구성을 설명하기 위한 개략적인 블럭도,
도 1b는 본 발명의 다른 실시 예에 따른 전자 장치의 구성을 설명하기 위한 개략적인 블럭도,
도 2는 본 발명의 일 실시 예에 따른 전자 장치의 전처리부를 설명하기 위한 블럭도,
도 3은 본 발명의 일 실시 예에 따른 전자 장치의 빔포밍부를 설명하기 위한 블럭도,
도 4는 본 발명의 일 실시 예에 따른 전자 장치의 음성 인식부를 설명하기 위한 도면,
도 5는 본 발명의 일 실시 예에 따른 전자 장치의 구성을 상세히 설명하기 위한 블럭도,
도 6a 및 도 6b는 본 발명의 다양한 실시 예에 따른 전자 장치의 오디오 입력부를 설명하기 위한 도면,
도 7은 본 발명의 일 실시 예에 따른 전자 장치에서의 신호, 정보의 전달을 설명하기 위한 도면, 그리고,
도 8은 본 발명의 일 실시 예에 따른 전자 장치의 음성 인식 방법을 설명하기 위한 흐름도이다.
이하에서는 본 발명의 바람직한 실시 예가 첨부된 도면을 참조하여 상세히 설명한다. 본 발명을 설명함에 있어서, 관련된 공지 기능 혹은 구성에 대한 구체적인 설명이 본 발명의 요지를 불필요하게 흐릴 수 있다고 판단된 경우 그 상세한 설명은 생략한다. 그리고 후술되는 용어들은 본 발명에서의 기능을 고려하여 정의된 용어들로서 이는 사용자, 운용자 또는 관례 등에 따라 달라질 수 있다. 그러므로 그 정의는 본 명세서 전반에 걸친 내용을 토대로 내려져야 할 것이다.
제1, 제2 등과 같이 서수를 포함하는 용어는 다양한 구성요소들을 설명하는데 사용될 수 있지만, 구성요소들은 용어들에 의해 한정되지는 않는다. 용어들은 하나의 구성요소를 다른 구성요소로부터 구별하는 목적으로만 사용된다. 예를 들어, 본 발명의 권리 범위를 벗어나지 않으면서 제1 구성요소는 제2 구성요소로 명명될 수 있고, 유사하게 제2 구성요소도 제1 구성요소로 명명될 수 있다. 및/또는 이라는 용어는 복수의 관련된 항목들의 조합 또는 복수의 관련된 항목들 중의 어느 하나의 항목을 포함한다.
본 명세서에서 사용한 용어는 실시예를 설명하기 위해 사용된 것으로, 본 발명을 제한 및/또는 한정하려는 의도가 아니다. 단수의 표현은 문맥상 명백하게 다르게 뜻하지 않는 한, 복수의 표현을 포함한다. 본 명세서에서, 포함하다 또는 가지다 등의 용어는 명세서상에 기재된 특징, 숫자, 동작, 동작, 구성요소, 부품 또는 이들을 조합한 것이 존재함을 지정하려는 것이지, 하나 또는 그 이상의 다른 특징들이나 숫자, 동작, 동작, 구성요소, 부품 또는 이들을 조합한 것들의 존재 또는 부가 가능성을 미리 배제하지 않는 것으로 이해되어야 한다.
도 1a는 본 발명의 일 실시 예에 따른 전자 장치(100)의 구성을 개략적으로 도시한 블럭도이다. 도 1a를 참조하면, 전자 장치(100)는 오디오 입력부(110), 전처리부(120), 음성 인식부(130)를 포함할 수 있다.
본 발명의 일 실시 예에 따른 전자 장치(100)는 스마트 TV와 같은 디스플레이 장치, 스마트 폰, 타블렛 피씨, 오디오 장치, 대화형 음성 인식 장치, 네비게이션 등 음성 인식이 가능한 모든 전자 기기로 구현될 수 있다.
오디오 입력부(110)는 사용자의 음성을 수신할 수 있다. 예를 들어, 오디오 입력부(110)는 복수의 마이크로 구성되어, 서로 다른 위치에서 음원을 입력받아 복수의 음성 신호를 생성할 수 있다. 오디오 입력부(110)를 구성하는 마이크의 개수에 따라 채널 수가 결정된다. 마이크는 그 개수에 따라 일정한 간격 또는 기 설정된 패턴으로 배치될 수 있다. 예를 들어, 4개의 마이크가 전자 장치(100)의 둘레에 90도 간격으로 배치된 경우, 오디오 입력부(110)는 4개의 마이크에 수신된 사용자의 음성을 이용하여 4채널 음성 신호를 생성할 수 있다.
전처리부(120)는 복수의 음성 신호에 대한 전처리(pre-processing)를 수행하여 전처리된 음성 신호를 생성할 수 있다. 전처리란 음성 인식 이전에 수행되는 일련의 처리를 의미한다. 전처리부(120)는 음성 인식부(130)에서 생성된 정보를 직접 또는 간접적으로 피드백 받아서, 이를 바탕으로 전처리 방식을 적응적으로 변경할 수 있다.
전처리부(120)는 음성 검출부(121), 감지부(123), 빔포밍부(125)를 포함할 수 있다. 음성 검출부(121)는 음성 신호로부터 사용자의 발화가 포함된 음성 구간(이하, 유성 구간) 및 사용자의 발화가 포함되지 않은 잡음 구간(이하, 무성 구간)을 검출할 수 있다. 감지부(123)는 채널 별 음성 입력 신호의 이득(gain) 및 지연 정보를 이용하여 음원의 입력 방향 및 거리를 추정할 수 있다. 빔포밍부(125)는 공간 필터링 방식을 이용하여 채널 별 음성 입력 신호에 이득 및 지연을 가하여 목적 방향에 대해 강화된 음성 신호를 생성할 수 있다.
전처리부(120)의 구체적인 동작에 대해서는 도 2 및 도 3을 참조하여 후술하기로 한다.
음성 인식부(130)는 강화된 음성 신호를 이용하여 음성 인식을 수행한다. 예를 들어, 음성 인식부(130)는 입력된 음성 신호로부터 트리거 단어를 검출 및 인식하고, 트리거 단어가 인식된 이후의 음성 신호로부터 단어/문장 음성 인식 결과를 생성할 수 있다. 그리고, 음성 인식부(130)는 음성 인식 결과 기설정된 트리거가 감지되면 트리거 정보를 생성하여 전처리부(120)로 전달할 수 있다.
음성 인식부(130)의 구체적인 동작에 대해서는 도 4를 참조하여 후술하기로 한다.
도 1b는 본 발명의 다른 실시 예에 따른 전자 장치(100)의 구성을 설명하기 위한 블럭도이다. 본 발명의 다른 실시 예에 따르면, 전자 장치(100)는 모드 판단부(140) 구성을 더 포함할 수 있다. 이는 전처리부(120) 또는 음성 인식부(130)에서 처리할 기능을 별도의 구성으로 구현한 실시 예에 해당한다.
모드 판단부(140)는 음성 인식부(130)에서 생성된 정보를 바탕으로 현재 전자 장치(100)의 상태를 판단할 수 있다. 예를 들어, 모드 판단부(140)는 전자 장치(100)의 상태가 트리거 단어를 인식하고자 기다리는 상태인지, 트리거 단어가 인식되어 단어/문장 인식을 위해 음성 신호를 기다리고 있는 상태인지 등의 정보를 전처리부(120)에 전달할 수 있다.
도 2는 본 발명의 일 실시 예에 따른 전처리부(120)의 구성을 설명하기 위한 도면이다. 도 2를 참조하면 전처리부(120)는 음성 검출부(121), 감지부(123) 및 빔포밍부(125)를 포함할 수 있다. 예를 들어, 전처리부(120)는 DSP(Disital Signal Processor) 또는 CPU(Central Processing Unit)와 같은 단일 칩으로 구현될 수 있다.
전처리부(120)는 음성 인식 결과를 피드백 받아 전처리 방식을 변경할 수 있다. 예를 들어, 전처리부(120)는 유성 구간 검출 여부, 트리거 단어 인식 여부와 같은 음성 인식 결과에 대한 정보를 피드백 받을 수 있다. 그리고, 전처리부(120)는 피드백 받은 정보를 이용하여, 행오버의 길이, 음성 검색 범위, 적응 필터의 적응 속도와 같은 전처리 방식을 변경할 수 있다.
음성 검출부(121)는 음성 신호로부터 사용자의 발화가 포함된 음성 구간(이하, 유성 구간) 및 사용자의 발화가 포함되지 않은 잡음 구간(이하, 무성 구간)을 검출할 수 있다. 예를 들어, 음성 검출부(121)는 프레임 단위로 유성 구간인지 무성 구간인지를 구분할 수 있다. 음성 검출부(121)는 생성한 음성 구간 정보를 감지부(123) 및 빔포밍부(125)로 전송할 수 있다.
음성 검출부(121)는 음성 인식 정보를 이용하여 유성 구간으로 판단할 가중치를 조정할 수 있다. 예를 들어, 음성 검출부(121)는 트리거 정보에 유성 검출 이후 유성 구간으로 판단하는 시간(또는 프레임 수)을 변경할 수 있다. 음성 검출부(121)는 변경된 기준을 기초로 입력된 음성 신호를 유성 구간과 무성 구간을 구분할 수 있다.
본 발명의 일 실시 예에 따르면, 음성 검출부(121)는 행오버(hang-over) 구간을 변경하여, 유성 구간으로 판단할 가중치를 조정할 수 있다. 행오버란 음성이 한번 검출된 이후 이어지는 프레밍에 대해서도 음성으로 판정하는 기간을 의미한다. 예를 들어, 행오버의 길이를 무한대로 설정하면, 음성 검출부(121)는 한번 유성 구간으로 판정된 프레임 이후의 모든 프레임은 모두 유성 구간으로 검출한다. 반대로, 행오버를 최소로 설정하면, 음성 검출부(121)는 매 프레임에 대해 독립적으로 유성 구간인지 무성 구간인지 여부를 결정하게 된다. 이와 같이, 행오버 길이의 설정은 음성 검출부(121)에서 생성한 음성 구간 정보의 신뢰도에 중요한 역할을 한다.
본 발명의 일 실시 예에 따르면, 음성 검출부(121)는 피드백 된 트리거 정보에 따라 유성 검출 이후 유성 구간으로 판단하는 시간을 변경할 수 있다. 그리고, 음성 검출부(121)는 변경된 판단 시간을 이용하여 유성 구간과 무성 구간을 구분할 수 있다. 음성 인식부(130)에서 트리거가 인식된 경우, 이후의 단어/문장 인식을 위한 사용자의 발화 음성이 존재할 확률이 높기 때문에, 음성 검출부(121)는 행오버 길이를 늘림으로써 음성 구간 검출의 잡음에 대한 강인성을 높일 수 있다. 예를 들어, 음성 검출부(121)는 수학식 1과 같이 행오버 길이를 조정할 수 있다.
수학식 1
Figure PCTKR2016011888-appb-M000001
트리거 온(trigger ON)은 음성 인식부(130)에서 생성된 음성 인식 정보에 의해 현재 트리거 단어가 인식 되었거나, 트리거 단어의 인식 스코어가 기설정된 값보다 높은 경우를 의미한다. 이러한 경우에, 음성 검출부(121)는 유성 구간으로 판단하는 행오버 길이를 크게 설정할 수 있다.
반대로, 트리거 오프(trigger OFF)는 음성 인신 정보에 의해 현재 트리거 단어가 인식되지 않았거나, 트리거 단어의 인식 스코어가 기설정된 값보다 낮은 경우를 의미한다. 이러한 경우에, 음성 검출부(121)는 행오버 길이를 짧게 설정하여 유성 구간인지 여부를 판단할 수 있다.
스코어란 해당 프레임에서 목표 음성 성분이 존재할 가능성을 수치화한 값이다. 전자 장치(100)는 목표 음성 성분이 존재하는 것으로 판단할 수 있는 임계 스코어 값을 실험적으로 최적화하여 설정할 수 있다. 그리고, 음성 인식부(130)는 해당 프레임에서의 스코어와 기설정된 임계 스코어 값을 비교하여 목표 음성 성분이 존재하는 음성 구간인지 여부를 판단할 수 있다.
본 발명의 다른 실시 예에 따르면, 음성 검출부(121)는 모드 판단부(140)에서 판단한 전자 장치(100)의 상태에 따라 유성 구간으로 판단할 가중치를 변경할 수도 있다. 예를 들어, 전자 장치(100)가 트리거 단어를 인식하고자 기다리는 상태로 판단되면, 음성 검출부(121)는 무성 구간으로 판정될 가중치를 증가시킬 수 있다. 다른 예로, 전자 장치(100)가 트리거 단어 인식 후 단어/문장 인식을 위해 음성 신호 입력을 기다리고 있는 상태로 판단되면, 음성 검출부(121)는 유성 구간으로 판정될 가중치를 증가시킬 수 있다.
감지부(123)는 음성 신호, 음성 구간 정보, 음성 인식 정보를 입력받아 입력된 음성 신호의 입사 각도를 감지할 수 있다. 즉, 감지부(123)는 복수의 음성 신호를 이용하여 발화 방향을 감지할 수 있다. 예를 들어, 감지부(123)는 입력 신호로부터 목적 방향 각도 정보를 프레임 단위로 생성할 수 있다. 음성 신호에 유성 구간만이 존재하는 경우, 프레임별 목적 방향 각도 정보는 분산이 작고 실제 목적 방향에 가깝게 분포한다. 반대로, 음성 신호에 잡음이 많은 경우에는, 프레임별 각도 정보는 전방향에 고르게 분포하는 경항을 갖는다.
그리고, 감지부(123)는 프레임 단위의 목적 방향 각도 정보, 음성 구간 정보 및 음성 인식 정보를 이용하여 음성 신호가 입사할 가능성이 가장 높은 방향을 추정하여 정규화된 각도 정보를 생성할 수 있다. 감지부(123)는 생성한 각도 정보를 빔포밍부(125)로 전달할 수 있다.
본 발명의 일 실시 예에 따르면, 감지부(123)는 음성 인식 정보에 따라 검색 범위를 변경하여 발화 방향을 감지할 수 있다. 예를 들어, 감지부(123)는 음성 인식부(130)에서 생성한 음성 인식 정보를 이용하여, 음성 신호가 입사하는 각도에 가중치를 조정할 수 있다. 그리고, 감지부(123)는 조정된 가중치를 이용하여 음성 신호의 입사 각도를 추정할 수 있다.
본 발명의 일 실시 예에 따르면, 감지부(123)는 수학식 2와 같이 검색 구간을 설정할 수 있다.
수학식 2
Figure PCTKR2016011888-appb-M000002
VAD(Voice Activity Detection) OFF는 음성 검출부(121)에서 생성한 음성 구간 정보가 무성 구간으로 판정된 경우일 때를 의미한다. 이러한 경우, 감지부(123)는 이전의 검색 구간을 그대로 유지한다.
VAD ON은 음성 검출부(121)에서 유성 구간으로 판정된 경우를 의미한다. 'VAD ON and trigger OFF'는 유성 구간으로 검출되었으나, 음성 인식 정보에 의할 때 트리거 단어가 인식되지 않았거나 트리거 단어의 인식 스코어가 기설정된 값보다 낮은 경우를 의미한다. 이 경우에, 감지부(123)는 트리거 단어 인식을 위하여 검색 범위를 넓힐 필요성이 있다. 감지부(123)는 이전에 생성된 검색 범위 각도보다 좌우로 넓은 범위를 검색 범위로 설정할 수 있다.
'VAD ON and trigger ON'은 유성 구간으로 검출되고, 트리거 단어가 인식되거나 트리거 단어의 인식 스코어가 기설정된 값보다 높은 경우를 의미한다. 즉, 이 경우는 트리거 단어 검출 방향에서, 사용자의 발화가 이어질 가능성이 높은 경우에 해당한다. 이러한 경우에, 감지부(123)는 이전에 생성된 검색 범위를 트리거 단어 검출 방향으로 좁힐 수 있다.
예를 들어, 트리거 정보가 피드백 되지 않으면, 감지부(123)는 전 방향에 대해서 발화 방향을 감지할 수 있다. 반대로, 트리거 정보가 피드백 되면, 감지부(123)는 기 감지된 발화 방향에 대응되는 검색 범위에 대해서만 발화 방향을 감지할 수 있다.
빔포밍부(125)는 공간 필터링 방식을 이용하여 채널 별 음성 입력 신호에 이득 및 지연을 가하여 목적 방향에 대해 강화된 음성 신호를 생성할 수 있다. 도 3은 본 발명의 일 실시 예에 따른 전자 장치(100)의 빔포밍부(125)의 구성을 설명하기 위한 도면이다. 도 3을 참조하면, 빔포밍부(125)는 고정 빔포밍부(Fixed Beamformer, 125-1), 블록 매트릭스부(Blocking matrix, 125-3), 다중 입력 상쇄부(Multiple-input canceller, 125-5) 및 후 필터부(Post-filter, 125-7)를 포함할 수 있다. 다른 예로, 후 필터부(125-7)는 별도의 모듈로 구현될 수도 있다.
본 발명의 일 실시 예에 따르면, 빔포밍부(125)는 감화된 음성 신호를 생성함에 있어서, 음성 인식 정보를 이용하여 내부 모듈의 파라미터를 조정할 수 있다.
고정 빔포밍부(125-1)는 음성 신호 및 각도 정보를 입력받을 수 있다. 그리고, 고정 빔포밍부(125-1)는 음성이 감지된 각도 방향에서 입력되는 신호를 증폭하여, 목적 방향에 대해 증폭된 음성 신호를 생성할 수 있다.
블록 매트릭스부(125-3)는 음성 신호, 각도 정보, 음성 구간 정보 및 트리거 인식 정보를 입력받을 수 있다. 그리고, 블록 매트릭스부(125-3)는 해당 각도 방향에서 입력되는 신호를 제거하여 목적 방향 신호를 제거한 음성 신호를 생성한다. 즉, 블록 매트릭스부(125-3)는 음성 신호에서 사용자의 음성 부분을 제거하여, 잡음에 대한 기준(reference) 데이터를 생성할 수 있다. 그리고, 블록 매트릭스부(125-3)는 생성된 잡음에 대한 기준 데이터를 다중 입력 상쇄부(125-5)에 전달할 수 있다.
다중 입력 상쇄부(125-5)는 블록 매트릭스부(125-3)에서 생성된 목적 방향 신호가 제거된 음성 신호, 음성 구간 정보, 트리거 인식 정보를 입력받을 수 있다. 그리고, 다중 입력 상쇄부(125-5)는 고정 빔포밍부(125-1)의 출력에 포함된 잡음 leakage를 제거하여 강화된 음성 신호를 생성할 수 있다.
이하에서는 블록 매트릭스부(125-3) 및 다중 입력 상쇄부(125-5)의 적응 필터 설정 방법을 설명하기로 한다.
본 발명의 일 실시 예에 따르면, 블록 매트릭스부(125-3)는 목적 방향의 신호를 제거한 음성 선호를 생성한다. 이를 위하여, 블록 매트릭스부(125-3)는 음성이 존재하는 방향으로 적응 필터가 적응하도록 설정한다.
예를 들어, 블록 매트릭스부(125-3)는 수학식 3과 같은 방식으로 적응 필터를 설정할 수 있다.
수학식 3
Figure PCTKR2016011888-appb-M000003
VAD(Voice Activity Detection) OFF는 음성 검출부(121)에서 생성한 음성 구간 정보가 무성 구간으로 판정된 경우일 때를 의미한다. 이러한 경우, 블록 매트릭스부(125-3)는 적응 필터의 스텝 사이즈를 최소로 설정할 수 있다. 무성 구간에서는 빠른 적응 보다는 오버 피팅을 방지하는 것이 중요하기 때문이다.
VAD ON은 음성 검출부(121)에서 유성 구간으로 판정된 경우를 의미한다. 'VAD ON and trigger OFF'는 유성 구간으로 검출되었으나, 음성 인식 정보에 의할 때 트리거 단어가 인식되지 않았거나 트리거 단어의 인식 스코어가 기설정된 값보다 낮은 경우를 의미한다. 이 경우에, 블록 매트릭스부(125-3)는 적응 필터의 스텝 사이즈를 중간으로 설정할 수 있다.
'VAD ON and trigger ON'은 유성 구간으로 검출되고, 트리거 단어가 인식되거나 트리거 단어의 인식 스코어가 기설정된 값보다 높은 경우를 의미한다. 즉, 이 경우는 트리거 단어 검출 방향에서, 사용자의 발화가 이어질 가능성이 높은 경우에 해당한다. 이러한 경우에, 블록 매트릭스부(125-3)는 적응 필터의 스텝 사이즈를 최대로 설정하여, 빠르게 필터를 적응시킨다.
다중 입력 상쇄부(125-5)는 블록 매트릭스부(125-3)에서 생성된 목적 방향 신호가 제거된 음성 신호를 이용하여, 고정 빔포밍부(125-1)의 출력에 포함된 잡음 leakage를 제거하여 강화된 음성 신호를 생성할 수 있다. 이를 위해, 다중 입력 상쇄부(125-5)는 잡음만 존재하는 구간에서 적응 필터를 적응하여 잡음을 최대한 제거한 음성 신호를 출력할 수 있다.
예를 들어, 다중 입력 상쇄부(125-5)는 수학식 4와 같은 방식으로 적응 필터를 설정할 수 있다.
수학식 4
Figure PCTKR2016011888-appb-M000004
VAD(Voice Activity Detection) OFF는 음성 검출부(121)에서 생성한 음성 구간 정보가 무성 구간으로 판정된 경우일 때를 의미한다. 이러한 경우, 다중 입력 상쇄부(125-5)는 적응 필터의 스텝 사이즈를 최대로 설정할 수 있다. 다중 입력 상쇄부(125-5)는 무성 구간에서 빠른 적응이 필요하기 때문이다.
VAD ON은 음성 검출부(121)에서 유성 구간으로 판정된 경우를 의미한다. 'VAD ON and trigger OFF'는 유성 구간으로 검출되었으나, 음성 인식 정보에 의할 때 트리거 단어가 인식되지 않았거나 트리거 단어의 인식 스코어가 기설정된 값보다 낮은 경우를 의미한다. 이 경우에, 다중 입력 상쇄부(125-5)는 적응 필터의 스텝 사이즈를 중간으로 설정할 수 있다.
'VAD ON and trigger ON'은 유성 구간으로 검출되고, 트리거 단어가 인식되거나 트리거 단어의 인식 스코어가 기설정된 값보다 높은 경우를 의미한다. 즉, 이 경우는 트리거 단어 검출 방향에서, 사용자의 발화가 이어질 가능성이 높은 경우에 해당한다. 이러한 경우에, 다중 입력 상쇄부(125-5)는 적응 필터의 스텝 사이즈를 최소로 설정할 수 있다.
후 필터부(125-7)는 공간 필터링 방식에 의해 제거되지 못한 잡음을 제거할 수 있다. 예를 들어, 후 필터부(125-7)는 고정 빔포밍부(125-1)에서 생성된 목적 방향에 대해 증폭된 음성 신호, 다중 입력 상쇄부(125-5)에서 생성된 강화된 음성 신호, 음성 구간 정보, 음성 인식 정보를 입력받을 수 있다. 이를 이용하여, 후 필터부(125-7)는 고정 빔포밍부(125-1)에서 공간 필터링 방식에 의해 미처 제거하지 못한 잡음을 제거할 수 있다.
후 필터부(125-7)는 상황에 따라 잡음 제거 정도를 조절할 필요성이 있다. 예를 들어, 후 필터부(125-7)는 수학식 5와 같은 방식으로 잡음 제거 강도를 설정할 수 있다.
수학식 5
Figure PCTKR2016011888-appb-M000005
VAD(Voice Activity Detection) OFF는 음성 검출부(121)에서 생성한 음성 구간 정보가 무성 구간으로 판정된 경우일 때를 의미한다. 이러한 경우, 후 필터부(125-7)는 잡음 제거 강도를 가장 크게 설정할 수 있다. 음성 인식에 필요한 정보가 잡음 제거와 함께 제거될 가능성이 가장 낮기 때문이다.
VAD ON은 음성 검출부(121)에서 유성 구간으로 판정된 경우를 의미한다. 'VAD ON and trigger OFF'는 유성 구간으로 검출되었으나, 음성 인식 정보에 의할 때 트리거 단어가 인식되지 않았거나 트리거 단어의 인식 스코어가 기설정된 값보다 낮은 경우를 의미한다. 이 경우에, 후 필터부(125-7)는 제거 강도를 중간 수준으로 설정할 수 있다.
'VAD ON and trigger ON'은 유성 구간으로 검출되고, 트리거 단어가 인식되거나 트리거 단어의 인식 스코어가 기설정된 값보다 높은 경우를 의미한다. 즉, 이 경우는 트리거 단어 검출 방향에서, 사용자의 발화가 이어질 가능성이 높은 경우에 해당한다. 이러한 경우에, 후 필터부(125-7)는 잡음 제거 강도를 줄여 음성의 왜곡이 발생할 가능성을 줄일 수 있다.
본 발명의 다른 실시 예에 따르면, 빔포밍부(125)는 모드 판단부(140)에서 판단된 정보를 이용할 수 있다. 예를 들어, 모드 판단부(140)에 의해 전자 장치(100)의 상태가 트리거 단어를 기다리는 상태인 경우에, 빔포밍부(125)는 잡음 제거를 위한 파라미터 계수를 최대로 설정할 수 있다. 다른 예로, 모드 판단부(140)에 의해 전자 장치(100)의 상태가 트리거 단어를 인식하고 단어/문장 인식을 위한 음성 신호 입력을 기다리고 있는 상태인 경우에, 빔포밍부(125)는 음성 왜곡을 최소화하는 방향으로 파라미터 계수를 설정할 수 있다.
도 4는 본 발명의 일 실시 예에 따른 전자 장치(100)의 음성 인식부(130)의 구성을 설명하기 위한 도면이다. 도 4를 참조하면, 음성 인식부(130)는 트리거 인식부(131) 및 단어/문장 인식부(133)를 포함할 수 있다.
트리거 인식부(131)는 전처리부(120)에서 생성된 강화된 음성 신호로부터 트리거 신호를 검출할 수 있다. 그리고, 트리거 인식부(131)는 트리거 인식 스코어 및 인식 완료 여부를 포함하는 트리거 정보를 생성할 수 있다. 트리거 인식부(131)는 생성된 트리거 정보를 전처리부(120)로 전송할 수 있다.
단어/문장 인식부(133)는 전처리부(120)에서 생성된 강화된 음성 신호로부터 단어/문장을 인식할 수 있다. 예를 들어, 단어/문장 인식부(133)는 트리거 인식부(131)에서 트리거 인식이 완료된 경우에만 동작을 수행할 수 있다. 단어/문장 인식부(133)는 단어/문장 인식 스코어 및 인식 완료 여부를 포함하는 정보를 생성할 수 있다.
도 5는 본 발명의 일 실시 예에 따른 전자 장치(100)의 구성을 상세히 설명하기 위한 도면이다. 본 발명의 일 실시 예에 따르면, 전자 장치(100)는 상술한 오디오 입력부(110), 전처리부(120) 및 음성 인식부(130) 외에 디스플레이부(150), 통신부(160), 스피커부(170) 및 제어부(180)를 더 포함할 수 있다. 전처리부(120) 및 음성 인식부(130)에 대한 설명은 상술한바 중복 설명은 생략하기로 한다.
디스플레이부(150)는 영상을 표시할 수 있다. 디스플레이부(150)는 액정 표시 장치(Liquid Crystal Display, LCD), 유기 전기 발광 다이오드(Organic Light Emitting Display, OLED) 또는 플라즈마 표시 패널(Plasma Display Panel, PDP) 등으로 구현되어, 전자 장치(100)를 통해 제공 가능한 다양한 디스플레이 화면을 제공할 수 있다. 디스플레이부(150)는 음성 인식부(130)의 음성 인식 결과에 대응되는 영상을 표시할 수 있다. 예를 들어, 디스플레이부(150)는 사용자의 음성에 대응되는 응답 메시지를 텍스트 또는 이미지로 디스플레이할 수 있다. 다른 예로, 전자 장치(100)가 채널 변경을 원하는 사용자 명령을 수신하면, 음성 인식부(130)는 채널 변경 명령을 인식하고, 제어부(180)는 디스플레이부(150)가 변경된 채널을 표시하도록 제어할 수 있다.
통신부(160)는 외부 장치와 통신을 수행한다. 예를 들어, 외부 장치는 클라우드 서버 등으로 구현될 수 있다. 통신부(160)는 외부 장치에 음성 인식 결과를 송신하고, 대응되는 정보를 외부 장치로부터 수신할 수 있다. 이를 위해, 통신부(160)는 근거리 무선 통신 모듈(미도시), 무선 통신 모듈(미도시) 등과 같은 다양한 통신 모듈을 포함할 수 있다. 여기에서, 근거리 무선 통신 모듈이란 블루투스, 지그비 방식 등과 같은 근거리 무선 통신 방식에 따라, 근거리에 위치한 외부 기기와 통신을 수행하기 위한 모듈이다. 또한, 무선 통신 모듈이란 WiFi, IEEE 등과 같은 무선 통신 프로토콜에 따라 외부 네트워크에 연결되어 통신을 수행하는 모듈이다. 이 밖에 무선 통신 모듈은 3G(3rd Generation), 3GPP(3rd Generation Partnership Project), LTE(Long Term Evoloution), LTE-A(LTE Advanced) 등과 같은 다양한 이동 통신 규격에 따라 이동 통신망에 접속하여 통신을 수행하는 이동 통신 모듈을 더 포함할 수도 있다.
스피커부(170)는 음성을 출력할 수 있다. 예를 들어, 스피커부(170)는 음성 인식 결과에 대응되는 음성 출력 이벤트를 출력할 수 있다. 스피커부(170)를 통해 사용자에게 전자 장치(100)와 대화하고 있다는 느낌을 줄 수도 있다.
제어부(180)는 전자 장치(100)의 전반적인 구성을 제어할 수 있다. 예를 들어, 오디오 입력부(110), 전처리부(120) 및 음성 인식부(130) 간의 정보 전달이 제어부(180)의 제어를 통해 이루어질 수도 있다.
이하에서는, 오디오 입력부(110)의 구성에 대하여 도 6a 및 도 6b를 참조하여 설명하기로 한다.
오디오 입력부(110)는 전자 장치(100)의 상측이나 전면 방향, 측면 방향 등에 일체화된 일체형으로 형성될 수도 있고, 별도의 수단으로 마련되어 전자 장치(100)와 유선 또는 무선 인터페이스로 연결될 수도 있다.
도 6a는 오디오 입력부(110)가 복수의 마이크로 구성되어, 서로 다른 위치에서 음원을 입력받는 실시 예를 도시한 도면이다. 도 6a를 참조하면, 오디오 입력부(110)는 전자 장치(100)의 둘레에 60도 간격으로 배치된 6개의 마이크(110-1, 110-2, 110-3, 110-4, 110-5, 110-6)로 구성될 수 있다. 이러한 경우, 오디오 입력부(110)는 6개의 마이크(110-1, 110-2, 110-3, 110-4, 110-5, 110-6)에서 수신된 사용자 음성을 이용하여 6채널 음성 신호를 생성할 수 있다. 감지부(123)는 채널 별 음성 입력 신호의 이득(gain) 및 지연 정보를 이용하여 음원의 입력 방향 및 거리를 추정할 수 있다.
다만, 오디오 입력부(110)는 반드시 도 6a에 도시된 형태로 복수의 마이크를 구비하는 것으로 한정되는 것은 아니다. 오디오 입력부(110)는 전자 장치(100)의 외부 또는 내부에 배치될 수 있으며, 마이크의 수도 6개로 한정되는 것이 아니다.
상술한 부분에서는 도 6a에 도시된 오디오 입력부(110)가 전자 장치(100)와 별도로 마련된 장치인 것으로 설명하였으나, 도 6a의 오디오 입력부(110)가 전자 장치(100)의 일 측에 일체형으로 부착되어 사용될 수도 있다.
도 6b는 복수의 외부 오디오 입력부를 이용하는 실시 예에 따른 음원 입력 방법을 설명하기 위한 도면이다. 도 6b를 참조하면, 집안의 일 구역에 전자 장치(100)가 배치되어 있다. 설명의 편의를 위해서, 전자 장치(100)에 포함된 오디오 입력부(110)를 메인 오디오 입력부라 하고, 전자 장치(100)와 별도로 마련된 다른 오디오 입력부(111, 113, 115)를 서브 오디오 입력부라 한다.
예를 들어, 집안의 다른 구역에는 서브 오디오 입력부(111, 113, 115)가 배치될 수 있다. 전자 장치(100)와 복수의 서브 오디오 입력부(111, 113, 115)는 네트워크를 통해 서로 연결되어 IoT(Internet of Things) 환경을 형성할 수 있다. 구체적으로, 각 장치들은 홈네트워크, 블루투스(Bluetooth), 와이파이, 와이파이 다이렉트 등으로 서로 연결될 수 있다. 그리고, 각각의 서브 오디오 입력부(111, 113, 115) 또한 메인 오디오 입력부(110)와 마찬가지로 복수의 마이크로 구성되어 서로 다른 위치에서 음원을 입력받을 수 있다.
만일 메인 오디오 입력부(110) 및 복수의 서브 오디오 입력부(111, 113, 115) 중 하나에 음원이 입력되면, 전자 장치(100)는 나머지 오디오 입력부에서 음원을 입력받는 동작이 중단되도록 할 수 있다.
예를 들어, 사용자가 서브 오디오 입력부 중 하나(113)가 배치된 방에 위치한다고 가정할 수 있다. 사용자의 음성이 사용자 근방의 서브 오디오 입력부(113)로 입력되면, 전자 장치(100)는 나머지 오디오 입력부(110, 111, 115)에서 입력되는 음원을 처리하지 않을 수 있다. 왜냐하면, 나머지 오디오 입력부(110, 111, 115)에 입력되는 음원은 사용자에 의한 것이 아니라 노이즈에 의한 것일 확률이 높기 때문이다.
이어서, 사용자 근방의 서브 오디오 입력부(113)는 구비된 복수의 마이크를 이용하여, 사용자의 음성을 복수 채널의 음성 신호로 생성할 수 있다. 그리고, 서브 오디오 입력부(113)는 생성된 복수 채널의 음성 신호를 네트워크 연결된 전자 장치(100)로 전송할 수 있다. 전자 장치(100)의 감지부(123)는 채널 별 음성 입력 신호의 이득(gain) 및 지연 정보를 이용하여, 사용자가 위치하는 영역에서의 사용자의 방향 및 서브 오디오 입력부(113)와의 거리를 추정할 수 있다.
본 발명의 또 다른 실시 예에 따르면, IoT 환경에 포함된 내부 카메라, CCTV 등을 이용하여, 전자 장치(100)는 사용자가 위치하는 영역을 판단할 수 있다. 그리고, 전자 장치(100)는 사용자가 위치하는 영역에 배치된 오디오 입력부만을 활성화할 수 있다.
도 7은 본 발명의 일 실시 예에 따른 전자 장치(100)에서의 신호, 정보의 전달을 설명하기 위한 도면이다. 도 7을 참조하여, 오디오 입력부(110), 전처리부(120) 및 음성 인식부(130) 간의 신호, 정보의 전달 경로를 설명하기로 한다.
오디오 입력부(110)는 서로 다른 위치에서 음원을 입력받아 복수의 음성 신호를 생성한다. 오디오 입력부(110)에서 생성된 음성 신호는 음성 검출부(121), 감지부(123), 고정 빔포밍부(125-1) 및 블록 매트릭스부(125-3)에 입력된다.
음성 검출부(121)는 입력된 음성 신호를 이용하여 유성 구간과 무성 구간을 구분하여 음성 구간 정보를 생성할 수 있다. 생성된 음성 구간 정보는 감지부(123), 블록 매트릭스부(125-3), 다중 입력 상쇄부(125-5) 및 후 필터부(125-7)로 전달될 수 있다.
감지부(123)는 입력된 음성 신호를 이용하여 발화 방향을 감지할 수 있다. 감지부(123)는 각도 정보를 생성하여 고정 빔포밍부(125-1), 블록 매트릭스부(125-3)로 전달할 수 있다.
고정 빔포밍부(125-1)는 입력된 음성 신호 및 각도 정보를 이용하여 공간 필터링을 수행한다. 그리고, 고정 빔포밍부(125-1)는 공간 필터링으로 강화된 음성 신호를 후 필터부(125-7)로 전달할 수 있다.
블록 매트릭스부(125-3)는 입력된 음성 신호에서 목적 방향의 음성을 제거하여 다중 입력 상쇄부(125-5)로 전달할 수 있다. 음성 구간 정보 및 트리거 정보를 이용하여, 블록 매트릭스부(125-3)는 적응 필터의 적응 속도를 설정할 수 있다.
다중 음성 상쇄부(125-5)는 블록 매트릭스부(125-3)에서 목적 방향의 음성을 제거한 음성 신호를 입력받을 수 있다. 이를 이용하여, 다중 음성 상쇄부(125-5)는 목적 방향 이외의 잡음 leakage를 제거할 수 있다. 음성 구간 정보 및 트리거 정보를 이용하여, 다중 음성 상쇄부(125-5)는 적응 필터의 적응 속도를 설정할 수 있다.
후 필터부(125-7)는 공간 필터링 방식에 의해 제거되지 못한 잡음을 제거할 수 있다. 음성 구간 정보 및 트리거 정보를 이용하여, 후 필터부(125-7)는 따라 잡음 제거 정도를 조절할 수 있다. 그리고, 후 필터부(125-7)는 잡음 제거로 강화된 음성 신호를 음성 인식부(130)로 전달할 수 있다.
음성 인식부(130)는 음성 인식 결과로부터 전처리부(120)에서 이용할 수 있는 정보를 생성할 수 있다. 예를 들어, 트리거 인식부(131)는 트리거 단어가 입력되었는지 여부에 대한 트리거 정보를 생성할 수 있다. 그리고, 트리거 인식부(131)는 트리거 정보를 음성 검출부(121), 감지부(123), 블록 매트릭스부(125-3), 다중 입력 상쇄부(125-5) 및 후 필터부(125-7)에 피드백할 수 있다.
상술한 바와 같은 본 발명의 다양한 실시 예에 따른 전자 장치(100)에 의하여, 음성 인식 결과로부터 전자 장치(100) 및 사용자의 상태 등을 추정할 수 있으며, 전처리부에서는 추정된 정보를 이용하여 음성 신호 전처리 방식을 가변하여 음성 인식 성공률을 높일 수 있다.
도 8 은 본 발명의 일 실시 예에 따른 전자 장치(100)의 음성 인식 방법을 설명하기 위한 흐름도이다.
도 8을 참조하면, 전자 장치(100)는 우선 서로 다른 위치에서 음원을 입력받아 복수의 음성 신호를 생성할 수 있다(S810). 예를 들어, 전자 장치(100)는 복수의 마이크로 구성된 마이크 어레이를 통하여 다채널 음성 신호를 생성할 수 있다. 복수의 마이크에 음원이 입력되는 시간의 차이 등을 통해, 전자 장치(100)는 음원이 발화된 방향 및 거리를 판단할 수 있다.
이어서, 전자 장치(100)는 입력된 복수의 음성 신호에 대한 전처리를 수행할 수 있다(S820). 그리고, 전자 장치(100)는 전처리된 음성 신호를 이용하여 음성 인식을 수행할 수 있다(S830).
전자 장치(100)는 음성 인식 결과에서 기설정된 트리거가 감지되었는지 판단할 수 있다(S840). 만일, 음성 인식 결과 기설정된 트리거가 감지되면(S840-Y), 전자 장치(100)는 트리거 정보를 생성할 수 있다(S850). 예를 들어, 트리거 정보는 트리거 인식 여부 또는 트리거 인식 스코어에 대한 정보일 수 있다.
그리고, 전자 장치(100)는 생성된 트리거 정보를 피드백 하여, 전처리를 수행하는 방식을 변경할 수 있다(S860). 예를 들어, 전자 장치(100)는 유성 검출 이후 유성 구간으로 판단하는 시간을 변경할 수 있다. 다른 예로, 전자 장치(100)는 발화 방향을 감지하는 검색 각도 범위를 변경할 수 있다. 또 다른 예로, 전자 장치(100)는 적응 필터의 적응 속도를 변경하거나, 잡음 제거 정도를 변경할 수 있다.
이어서, 전자 장치(100)는 변경된 전처리 수행 방식으로 복수의 음성 신호를 처리하여 강화된 음성 신호를 생성할 수 있다(S870). 전처리 수행 방식의 변경은 상술한 유성 구간 판단 시간에 대한 변경, 검색 각도 범위에 대한 변경, 적응 필터의 적응 속도에 대한 변경 및 잡음 제거 정도에 대한 변경 중 적어도 하나를 포함할 수 있다.
이상과 같은 다양한 실시 예들에 따르면, 음성 인식 정보로부터 전자 장치 및 사용자의 상태 등을 추정할 수 있다. 또한, 이를 기반으로 사용자가 음성을 발화할 확률, 사용자의 위치, 사용자 음성의 강도 등에 대한 가중치를 조절하여 음성 인식 성공률을 높일 수 있다.
상기에서 설명된 방법들은 다양한 컴퓨터 수단을 통하여 수행될 수 있는 프로그램 명령 형태로 구현되어 컴퓨터 판독 가능 매체에 기록될 수 있다. 상기 컴퓨터 판독 가능 매체는 프로그램 명령, 데이터 파일, 데이터 구조 등을 단독으로 또는 조합하여 포함할 수 있다. 상기 매체에 기록되는 프로그램 명령은 본 발명을 위하여 특별히 설계되고 구성된 것들이거나 컴퓨터 소프트웨어 당업자에게 공지되어 사용 가능한 것일 수도 있다. 컴퓨터 판독 가능 기록 매체의 예에는 하드 디스크, 플로피 디스크 및 자기 테이프와 같은 자기 매체(magnetic media), CD-ROM, DVD와 같은 광 기록 매체(optical media), 플롭티컬 디스크(floptical disk)와 같은 자기-광 매체(magneto-optical media), 및 롬(ROM), 램(RAM), 플래시 메모리 등과 같은 프로그램 명령을 저장하고 수행하도록 특별히 구성된 하드웨어 장치가 포함된다. 프로그램 명령의 예에는 컴파일러에 의해 만들어지는 것과 같은 기계어 코드뿐만 아니라 인터프리터 등을 사용해서 컴퓨터에 의해서 실행될 수 있는 고급 언어 코드를 포함한다. 상기의 하드웨어 장치는 본 발명의 동작을 수행하기 위해 하나 이상의 소프트웨어 모듈로서 작동하도록 구성될 수 있으며, 그 역도 마찬가지이다.
이상과 같이 본 발명은 비록 한정된 실시 예와 도면에 의해 설명되었으나, 본 발명은 상기의 실시 예에 한정되는 것은 아니며, 본 발명이 속하는 분야에서 통상의 지식을 가진 자라면 이러한 기재로부터 다양한 수정 및 변형이 가능하다. 그러므로, 본 발명의 범위는 설명된 실시 예에 국한되어 정해져서는 아니 되며, 후술하는 특허청구범위뿐 아니라 이 특허청구범위와 균등한 것들에 의해 정해져야 한다.

Claims (15)

  1. 서로 다른 위치에서 음원을 입력받아 복수의 음성 신호를 생성하는 오디오 입력부;
    상기 복수의 음성 신호에 대한 전처리를 수행하는 전처리부; 및
    상기 전처리부에서 처리된 음성 신호를 이용하여 음성 인식을 수행하고, 음성 인식 결과 기설정된 트리거가 감지되면 트리거 정보를 생성하는 음성 인식부;를 포함하고,
    상기 전처리부는,
    상기 음성 인식부에서 생성된 상기 트리거 정보를 피드백 받아, 상기 트리거 정보에 따라 전처리 방식을 변경하고, 변경된 전처리 방식으로 상기 복수의 음성 신호를 처리하여 강화된 음성 신호를 생성하는 전자 장치.
  2. 제1항에 있어서,
    상기 복수의 음성 신호를 이용하여 발화 방향을 감지하는 감지부;를 더 포함하고,
    상기 감지부는,
    상기 음성 인식부에서 생성된 상기 트리거 정보를 피드백 받아, 검색 범위를 변경하고, 상기 변경된 검색 범위에서 발화 방향을 감지하는 전자 장치.
  3. 제2항에 있어서,
    상기 감지부는,
    상기 트리거 정보가 피드백 되지 않으면, 전 방향에 대해서 발화 방향을 감지하고,
    상기 트리거 정보가 피드백 되면, 기 감지된 발화 방향에 대응되는 검색 범위에 대해서만 발화 방향을 감지하는 것을 특징으로 하는 전자 장치.
  4. 제1항에 있어서,
    상기 복수의 음성 신호를 이용하여 유성 구간과 무성 구간을 구분하는 음성 검출부;를 더 포함하고,
    상기 음성 검출부는,
    상기 음성 인식부에서 생성된 상기 트리거 정보를 피드백 받아, 유성 검출 이후 유성 구간으로 판단하는 시간을 변경하고, 변경된 판단 시간을 이용하여 유성 구간과 무성 구간을 구분하는 것을 특징으로 하는 전자 장치.
  5. 제4항에 있어서,
    상기 음성 검출부는,
    상기 트리거 정보가 피드백 되지 않으면, 기설정된 판단 시간을 이용하여 유성 구간과 무성 구간을 구분하고,
    상기 트리거 정보가 피드백 되면, 상기 기설정된 판단 시간보다 긴 제2 판단 시간을 이용하여 유성 구간과 무성 구간을 구분하는 것을 특징으로 하는 전자 장치.
  6. 제4항에 있어서,
    상기 전처리부는,
    상기 트리거 정보, 유성 구간인지 여부에 따라 복수의 음성 신호의 전처리 방식을 변경하고, 변경된 전처리 방식으로 강화된 음성 신호를 생성하는 전자 장치.
  7. 제1항에 있어서,
    상기 전처리부는,
    복수의 음성 신호를 이용하여 음성이 제거된 무성 신호를 생성하는 제1 구성; 및
    상기 생성된 무성 신호를 이용하여 강화된 음성 신호를 생성하는 제2 구성;을 포함하며,
    상기 제1 구성은,
    상기 음성 인식부에서 생성된 상기 트리거 정보를 피드백 받아, 필터링 정도를 변경하여 무성 신호를 생성하는 것을 특징으로 하는 전자 장치.
  8. 제7항에 있어서,
    상기 제2 구성은,
    상기 트리거 정보를 피드백 받아, 잡음 제거 정도를 변경하여 강화된 음성 신호를 생성하는 것을 특징으로 하는 전자 장치.
  9. 제1항에 있어서,
    영상을 표시하는 디스플레이부; 및
    상기 음성 인식 결과에 대응되는 영상이 표시되도록 상기 디스플레이부를 제어하는 제어부;를 더 포함하는 것을 특징으로 하는 전자 장치.
  10. 제1항에 있어서,
    상기 음성 인식 결과를 외부 장치로 전달하는 통신부;를 더 포함하는 것을 특징으로 하는 전자 장치.
  11. 제1항에 있어서,
    상기 음성 인식 결과에 대응되는 음성 출력 이벤트를 출력하는 스피커부;를 더 포함하는 것을 특징으로 하는 전자 장치.
  12. 서로 다른 위치에서 음원을 입력받아 복수의 음성 신호를 생성하는 단계;
    상기 복수의 음성 신호에 대한 전처리를 수행하는 단계;
    상기 전처리된 음성 신호를 이용하여 음성 인식을 수행하는 단계;
    음성 인식 결과 기설정된 트리거가 감지되면 트리거 정보를 생성하는 단계;
    상기 생성된 트리거 정보를 피드백 하여, 상기 트리거 정보에 따라 상기 전처리를 수행하는 방식을 변경하는 단계; 및
    상기 변경된 전처리 수행 방식으로 상기 복수의 음성 신호를 처리하여 강화된 음성 신호를 생성하는 단계; 를 포함하는 전자 장치의 음성 인식 방법.
  13. 제12항에 있어서,
    상기 복수의 음성 신호를 이용하여 발화 방향을 감지하는 단계;를 더 포함하고,
    상기 변경하는 단계는,
    상기 생성된 트리거 정보를 피드백 하여, 검색 범위를 변경하는 단계; 및
    상기 변경된 검색 범위에서 발화 방향을 감지하는 단계;를 포함하는 것을 특징으로 하는 음성 인식 방법.
  14. 제13항에 있어서,
    상기 피드백 제어 단계는,
    상기 트리거 정보가 피드백 되지 않으면, 전 방향에 대해서 발화 방향을 감지하고,
    상기 트리거 정보가 피드백 되면, 기 감지된 발화 방향에 대응되는 검색 범위에 대해서만 발화 방향을 감지하는 것을 특징으로 하는 음성 인식 방법.
  15. 제12항에 있어서,
    상기 복수의 음성 신호를 이용하여 유성 구간과 무성 구간을 구분하는 단계;를 더 포함하고,
    상기 변경하는 단계는,
    상기 생성된 트리거 정보를 피드백 하여, 유성 검출 이후 유성 구간으로 판단하는 시간을 변경하는 단계; 및
    상기 변경된 판단 시간을 이용하여 유성 구간과 무성 구간을 구분하는 단계;를 포함하는 것을 특징으로 하는 음성 인식 방법.
PCT/KR2016/011888 2015-10-21 2016-10-21 전자 장치, 그의 음성 인식 방법 및 비일시적 컴퓨터 판독가능 기록매체 WO2017069556A1 (ko)

Priority Applications (1)

Application Number Priority Date Filing Date Title
US15/761,506 US10796688B2 (en) 2015-10-21 2016-10-21 Electronic apparatus for performing pre-processing based on a speech recognition result, speech recognition method thereof, and non-transitory computer readable recording medium

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
KR10-2015-0146422 2015-10-21
KR1020150146422A KR102476600B1 (ko) 2015-10-21 2015-10-21 전자 장치, 그의 음성 인식 방법 및 비일시적 컴퓨터 판독가능 기록매체

Publications (1)

Publication Number Publication Date
WO2017069556A1 true WO2017069556A1 (ko) 2017-04-27

Family

ID=58557428

Family Applications (1)

Application Number Title Priority Date Filing Date
PCT/KR2016/011888 WO2017069556A1 (ko) 2015-10-21 2016-10-21 전자 장치, 그의 음성 인식 방법 및 비일시적 컴퓨터 판독가능 기록매체

Country Status (3)

Country Link
US (1) US10796688B2 (ko)
KR (1) KR102476600B1 (ko)
WO (1) WO2017069556A1 (ko)

Cited By (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US20190172455A1 (en) * 2017-12-04 2019-06-06 Samsung Electronics Co., Ltd. Electronic apparatus, method for controlling thereof and computer readable recording medium
WO2019147427A1 (en) * 2018-01-23 2019-08-01 Google Llc Selective adaptation and utilization of noise reduction technique in invocation phrase detection
EP3852099A4 (en) * 2018-09-11 2022-06-01 Nippon Telegraph And Telephone Corporation KEYWORD DETECTION DEVICE, KEYWORD DETECTION METHOD AND PROGRAM

Families Citing this family (17)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN106782585B (zh) * 2017-01-26 2020-03-20 芋头科技(杭州)有限公司 一种基于麦克风阵列的拾音方法及系统
US10789949B2 (en) * 2017-06-20 2020-09-29 Bose Corporation Audio device with wakeup word detection
JP6991041B2 (ja) * 2017-11-21 2022-01-12 ヤフー株式会社 生成装置、生成方法、および生成プログラム
KR102459920B1 (ko) * 2018-01-25 2022-10-27 삼성전자주식회사 저전력 에코 제거를 지원하는 애플리케이션 프로세서, 이를 포함하는 전자 장치 및 그 동작 방법
US11150869B2 (en) * 2018-02-14 2021-10-19 International Business Machines Corporation Voice command filtering
JP7186375B2 (ja) * 2018-03-29 2022-12-09 パナソニックIpマネジメント株式会社 音声処理装置、音声処理方法および音声処理システム
US10586538B2 (en) * 2018-04-25 2020-03-10 Comcast Cable Comminications, LLC Microphone array beamforming control
US11238856B2 (en) 2018-05-01 2022-02-01 International Business Machines Corporation Ignoring trigger words in streamed media content
US11200890B2 (en) 2018-05-01 2021-12-14 International Business Machines Corporation Distinguishing voice commands
TWI719385B (zh) * 2019-01-11 2021-02-21 緯創資通股份有限公司 電子裝置及其語音指令辨識方法
KR20200132613A (ko) * 2019-05-16 2020-11-25 삼성전자주식회사 웨이크 언 보이스(Wake on Voice, WoV) 기술을 이용한 음성 인식 수행 방법 및 장치
US11380312B1 (en) * 2019-06-20 2022-07-05 Amazon Technologies, Inc. Residual echo suppression for keyword detection
US11355108B2 (en) 2019-08-20 2022-06-07 International Business Machines Corporation Distinguishing voice commands
KR20210031265A (ko) * 2019-09-11 2021-03-19 삼성전자주식회사 전자 장치 및 그 동작방법
CN111312214B (zh) * 2020-03-31 2022-12-16 广东美的制冷设备有限公司 空调器的语音识别方法、装置、空调器和可读存储介质
CN113450767A (zh) * 2021-06-24 2021-09-28 平安国际智慧城市科技股份有限公司 语音识别测试方法、装置、测试设备及存储介质
CN114694638A (zh) * 2022-04-19 2022-07-01 深圳市未艾智能有限公司 一种语音唤醒方法、终端及存储介质

Citations (5)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US20050049864A1 (en) * 2003-08-29 2005-03-03 Alfred Kaltenmeier Intelligent acoustic microphone fronted with speech recognizing feedback
KR20110028095A (ko) * 2009-09-11 2011-03-17 삼성전자주식회사 실시간 화자 적응을 통한 음성 인식 시스템 및 방법
KR20140057018A (ko) * 2012-11-02 2014-05-12 현대모비스 주식회사 스마트 피드백 음성인식 시스템
WO2015092400A1 (en) * 2013-12-18 2015-06-25 Cirrus Logic International (Uk) Limited Voice command triggered speech enhancement
KR20150087025A (ko) * 2014-01-21 2015-07-29 삼성전자주식회사 전자 장치 및 이의 음성 인식 방법

Family Cites Families (10)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
KR100762588B1 (ko) 2001-06-26 2007-10-01 엘지전자 주식회사 화자적응과 오입력 거절을 결합한 음성인식 방법
US6937980B2 (en) 2001-10-02 2005-08-30 Telefonaktiebolaget Lm Ericsson (Publ) Speech recognition using microphone antenna array
US20040064315A1 (en) * 2002-09-30 2004-04-01 Deisher Michael E. Acoustic confidence driven front-end preprocessing for speech recognition in adverse environments
EP1473964A3 (en) 2003-05-02 2006-08-09 Samsung Electronics Co., Ltd. Microphone array, method to process signals from this microphone array and speech recognition method and system using the same
ATE405925T1 (de) 2004-09-23 2008-09-15 Harman Becker Automotive Sys Mehrkanalige adaptive sprachsignalverarbeitung mit rauschunterdrückung
ATE403928T1 (de) * 2006-12-14 2008-08-15 Harman Becker Automotive Sys Sprachdialogkontrolle basierend auf signalvorverarbeitung
KR101750338B1 (ko) 2010-09-13 2017-06-23 삼성전자주식회사 마이크의 빔포밍 수행 방법 및 장치
US8924204B2 (en) * 2010-11-12 2014-12-30 Broadcom Corporation Method and apparatus for wind noise detection and suppression using multiple microphones
US20130282373A1 (en) * 2012-04-23 2013-10-24 Qualcomm Incorporated Systems and methods for audio signal processing
KR20140147587A (ko) * 2013-06-20 2014-12-30 한국전자통신연구원 Wfst를 이용한 음성 끝점 검출 장치 및 방법

Patent Citations (5)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US20050049864A1 (en) * 2003-08-29 2005-03-03 Alfred Kaltenmeier Intelligent acoustic microphone fronted with speech recognizing feedback
KR20110028095A (ko) * 2009-09-11 2011-03-17 삼성전자주식회사 실시간 화자 적응을 통한 음성 인식 시스템 및 방법
KR20140057018A (ko) * 2012-11-02 2014-05-12 현대모비스 주식회사 스마트 피드백 음성인식 시스템
WO2015092400A1 (en) * 2013-12-18 2015-06-25 Cirrus Logic International (Uk) Limited Voice command triggered speech enhancement
KR20150087025A (ko) * 2014-01-21 2015-07-29 삼성전자주식회사 전자 장치 및 이의 음성 인식 방법

Cited By (13)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US20190172455A1 (en) * 2017-12-04 2019-06-06 Samsung Electronics Co., Ltd. Electronic apparatus, method for controlling thereof and computer readable recording medium
US10957316B2 (en) * 2017-12-04 2021-03-23 Samsung Electronics Co., Ltd. Electronic apparatus, method for controlling thereof and computer readable recording medium
KR102193629B1 (ko) 2018-01-23 2020-12-21 구글 엘엘씨 호출 구문 검출에서 노이즈 감소 기술의 선택적 적응 및 활용
KR20200103846A (ko) * 2018-01-23 2020-09-02 구글 엘엘씨 호출 구문 검출에서 노이즈 감소 기술의 선택적 적응 및 활용
CN111742362A (zh) * 2018-01-23 2020-10-02 谷歌有限责任公司 在调用短语检测中选择性地适配和利用噪声降低技术
KR20200142122A (ko) * 2018-01-23 2020-12-21 구글 엘엘씨 호출 구문 검출에서 노이즈 감소 기술의 선택적 적응 및 활용
US10706842B2 (en) 2018-01-23 2020-07-07 Google Llc Selective adaptation and utilization of noise reduction technique in invocation phrase detection
WO2019147427A1 (en) * 2018-01-23 2019-08-01 Google Llc Selective adaptation and utilization of noise reduction technique in invocation phrase detection
US11417324B2 (en) 2018-01-23 2022-08-16 Google Llc Selective adaptation and utilization of noise reduction technique in invocation phrase detection
KR102609430B1 (ko) 2018-01-23 2023-12-04 구글 엘엘씨 호출 구문 검출에서 노이즈 감소 기술의 선택적 적응 및 활용
CN111742362B (zh) * 2018-01-23 2024-04-09 谷歌有限责任公司 在调用短语检测中选择性地适配和利用噪声降低技术
US11984117B2 (en) 2018-01-23 2024-05-14 Google Llc Selective adaptation and utilization of noise reduction technique in invocation phrase detection
EP3852099A4 (en) * 2018-09-11 2022-06-01 Nippon Telegraph And Telephone Corporation KEYWORD DETECTION DEVICE, KEYWORD DETECTION METHOD AND PROGRAM

Also Published As

Publication number Publication date
US10796688B2 (en) 2020-10-06
KR102476600B1 (ko) 2022-12-12
KR20170046294A (ko) 2017-05-02
US20180268808A1 (en) 2018-09-20

Similar Documents

Publication Publication Date Title
WO2017069556A1 (ko) 전자 장치, 그의 음성 인식 방법 및 비일시적 컴퓨터 판독가능 기록매체
WO2018070639A1 (ko) 전자 장치 및 전자 장치의 오디오 신호 처리 방법
WO2018038379A1 (ko) 음성 인식을 위한 전자 장치 및 이의 제어 방법
KR102282366B1 (ko) 음성 향상 방법 및 그 장치
US20210005216A1 (en) Multi-person speech separation method and apparatus
US20230353928A1 (en) Automatic active noise reduction (anr) control to improve user interaction
US9830924B1 (en) Matching output volume to a command volume
EP3253071A1 (en) Sound signal detector
WO2012036424A2 (en) Method and apparatus for performing microphone beamforming
JP2018049143A (ja) 音声取得システムおよび音声取得方法
WO2021049795A1 (en) Electronic device and operating method thereof
WO2020130549A1 (en) Electronic device and method for controlling electronic device
WO2018155981A1 (ko) 음성 인식 트리거를 제공하기 위한 방법, 시스템 및 비일시성의 컴퓨터 판독 가능한 기록 매체
WO2007138503A1 (en) Method of driving a speech recognition system
JP2002311990A5 (ko)
WO2021071271A1 (en) Electronic apparatus and controlling method thereof
WO2020138662A1 (ko) 전자 장치 및 그의 제어 방법
WO2021040201A1 (ko) 전자 장치 및 이의 제어 방법
WO2015030340A1 (ko) 핸즈프리 자동 통역 서비스를 위한 단말 장치 및 핸즈프리 장치와, 핸즈프리 자동 통역 서비스 방법
WO2020202621A1 (ja) 無人移動体及び情報処理方法
JPH0398967A (ja) エレベータの呼び登録装置
WO2024053822A1 (en) System and method for receiving a voice command
WO2022054978A1 (ko) 자연어 또는 비자연어를 구분하는 스마트 히어링 디바이스, 인공지능 히어링 시스템 및 그 방법
WO2021107464A1 (en) Electronic device and control method thereof
WO2023182718A1 (en) Systems and methods for dynamically adjusting a listening time of a voice assistant device

Legal Events

Date Code Title Description
121 Ep: the epo has been informed by wipo that ep was designated in this application

Ref document number: 16857813

Country of ref document: EP

Kind code of ref document: A1

WWE Wipo information: entry into national phase

Ref document number: 15761506

Country of ref document: US

NENP Non-entry into the national phase

Ref country code: DE

122 Ep: pct application non-entry in european phase

Ref document number: 16857813

Country of ref document: EP

Kind code of ref document: A1