EP4413563A1 - Procédé d'analyse d'un signal sonore bruité pour la reconnaissance de mots clé de commande et d'un locuteur du signal sonore bruité analysé - Google Patents

Procédé d'analyse d'un signal sonore bruité pour la reconnaissance de mots clé de commande et d'un locuteur du signal sonore bruité analysé

Info

Publication number
EP4413563A1
EP4413563A1 EP22793176.3A EP22793176A EP4413563A1 EP 4413563 A1 EP4413563 A1 EP 4413563A1 EP 22793176 A EP22793176 A EP 22793176A EP 4413563 A1 EP4413563 A1 EP 4413563A1
Authority
EP
European Patent Office
Prior art keywords
sound signal
sound
group
speaker
noisy
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
EP22793176.3A
Other languages
German (de)
English (en)
Inventor
Bijan MOHAMMADI
Jean-Michel Linotte
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Centre National de la Recherche Scientifique CNRS
Universite de Montpellier
Original Assignee
Centre National de la Recherche Scientifique CNRS
Universite de Montpellier
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Centre National de la Recherche Scientifique CNRS, Universite de Montpellier filed Critical Centre National de la Recherche Scientifique CNRS
Publication of EP4413563A1 publication Critical patent/EP4413563A1/fr
Pending legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/08Speech classification or search
    • G10L15/16Speech classification or search using artificial neural networks
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L25/00Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
    • G10L25/78Detection of presence or absence of voice signals
    • G10L25/84Detection of presence or absence of voice signals for discriminating voice from noise
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/08Learning methods
    • G06N3/09Supervised learning
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/06Creation of reference templates; Training of speech recognition systems, e.g. adaptation to the characteristics of the speaker's voice
    • G10L15/063Training
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/20Speech recognition techniques specially adapted for robustness in adverse environments, e.g. in noise, of stress induced speech
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L17/00Speaker identification or verification techniques
    • G10L17/04Training, enrolment or model building
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L17/00Speaker identification or verification techniques
    • G10L17/18Artificial neural networks; Connectionist approaches
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/08Speech classification or search
    • G10L2015/088Word spotting

Definitions

  • TITLE Process for the analysis of a noisy sound signal for the recognition of command keywords and of a speaker of the noisy sound signal analyzed
  • the technical field of the invention is that of the analysis of sound signals and in particular that of the analysis of noisy sound signals for the recognition of command keywords and their speaker.
  • the present invention relates to a method for analyzing a noisy sound signal and in particular a method for analyzing a noisy sound signal for the recognition of at least one group of command keywords and a speaker of the noisy sound signal.
  • the present invention also relates to a system for implementing the method according to the invention.
  • These connected speakers are capable of analyzing sound signals to identify and recognize predefined command keywords present in the analyzed sound signal and send the corresponding commands via a wireless link to the home automation objects concerned.
  • the identification and recognition of command keywords is generally carried out as soon as a particular keyword, known as the activation keyword, has been detected to avoid triggering commands inadvertently.
  • the connected speaker does not always succeed in recognizing the command keywords present in a sound signal, in particular when the speaker has a particular accent or uses a language not represented in the training database.
  • the invention offers a solution to the problems mentioned above, by making it possible to recognize each command keyword present in a sound signal regardless of the linguistic specificities of its speaker.
  • a first aspect of the invention relates to a method for analyzing a noisy sound signal for the recognition of at least one group of command keywords and of a speaker of the analyzed noisy sound signal, the sound signal noise to be analyzed being recorded by at least one microphone and the method comprising the following steps:
  • the surrounding noise being a noise generated by the sound environment of the speaker
  • Supervised training of an artificial neural network on the training data base to obtain a trained artificial neural network capable of providing from a sound signature obtained from a noisy sound signal, a speaker prediction and at least one command keyword group prediction;
  • the artificial neural network is trained to be able both to recognize each command keyword present in the analyzed sound signal, and to identify the speaker of the analyzed sound signal.
  • the training is carried out on a training database comprising, for each speaker to be recognized, a plurality of sound signatures obtained from non-noisy sound signals recorded by the speaker himself, thus presenting the specificities of the speaker such as their language or accent, and the command keywords the speaker wants to use.
  • the recognition of the speaker by the artificial neural network is therefore facilitated without the need for a phoneme translation step or a language understanding step, and each speaker can personalize the command keywords used.
  • the training database takes into account the noise near the microphone, which improves the performance of the artificial neural network on the sound signals recorded by the microphone presenting a similar noise.
  • the training is carried out on a single training database allowing on the one hand the learning of the command keywords by the artificial neural network, and on the other hand the identification of characteristics biometrics allowing the speaker to be recognized by the artificial neural network.
  • the quantity of data necessary for training the artificial neural network is therefore much lower than what is necessary in the state of the art where these two tasks are carried out separately on two distinct training databases.
  • the method according to the first aspect of the invention may have one or more additional characteristics among the following, considered individually or according to all technically possible combinations.
  • the trained artificial neural network is also capable of providing, from a sound signature, an activation binary prediction relating to the detection or not of at least one group of words activation keys, each sound signature of the training database being further associated with an activation binary, the step of using the trained artificial neural network further making it possible to obtain a prediction of binary d activation.
  • the trained artificial neural network is also capable of providing, from a sound signature, a prediction of a termination bit relating to the detection or not of at least one group of termination keywords, each sound signature of the training database being further associated with a termination binary, the step of using the trained artificial neural network making it possible to further obtain a termination bit prediction.
  • the trained artificial neural network is also capable of providing, from a sound signature, at least one binding binary prediction relating to the detection or not of at least one group of linking keywords, each sound signature of the training database being further associated with at least one linking bit and, if the value of the linking bit corresponds to the detection of at at least one group of binding keywords, to at least a second group of control keywords, the step of using the trained artificial neural network further obtaining a binding bit prediction and at least one prediction second group of command keywords.
  • the performance of the artificial neural network for the recognition of command keywords is increased in the case where the analyzed sound signal has at least a first group of command keywords and a second group of command keywords , since the range of the analyzed sound signal comprising the first group of control keywords is delimited by the group of activation keywords on the one hand and the group of linking keywords on the other hand.
  • At least one non-noisy sound signal recorded during the step of forming the training database is pronounced by a moving speaker.
  • the artificial neural network has better performance for the recognition of command keywords on the sound signals uttered by mobile speakers, without having to multiply the number of microphones required, thanks to the spatialization of the data.
  • the training database is updated on request, at regular intervals, or automatically after detection of a modification of the sound environment of the microphone.
  • the training database is updated to adapt to the noise near the microphone, which may vary.
  • the supervised training step of the artificial neural network is performed as soon as the training database is updated.
  • a second aspect of the invention relates to a system for implementing the method according to the invention comprising: at least one microphone configured to record noisy or non-noisy sound signals, and the surrounding noise; at least one local computer configured to: calculate sound signatures from noisy sound signals obtained via at least one microphone; using the artificial neural network trained on calculated sound signatures; at least one main computer configured to: constitute the training database from sound signatures calculated by the local computer; supervised training of the artificial neural network on the constituted training database.
  • the system according to the invention further comprises at least one storage device configured to store each noiseless sound signal recorded.
  • the method according to the invention can be carried out offline, that is to say locally.
  • the system according to the invention comprises a plurality of independent or coupled microphones.
  • the quality of the recorded sound signals is better, in particular the errors due to echoes are reduced.
  • the system according to the invention comprises a local computer per microphone.
  • the central computer carries out the training of the artificial neural network which requires significant computing resources, and communicates the trained artificial neural network to each local computer which processes the sound signals recorded by the corresponding microphone.
  • the local computer and the central computer correspond to a single computer.
  • a third aspect of the invention relates to a computer program product comprising instructions which, when the program is executed on a computer, lead the latter to implement the steps of the method according to the invention.
  • a fourth aspect of the invention relates to a computer-readable recording medium comprising instructions which, when executed by a computer, lead the latter to implement the steps of the method according to the invention.
  • Figure 1 is a block diagram illustrating the sequence of steps of a method according to the invention.
  • Figure 2 shows a schematic representation of a first embodiment of a system according to the invention.
  • Figure 3 shows a schematic representation of a second embodiment of the system according to the invention.
  • Figure 4 shows a schematic representation of a third embodiment of the system according to the invention.
  • a first aspect of the invention relates to a method for analyzing a sound signal making it possible both to recognize each group of command keywords present in the analyzed sound signal and to identify the speaker of the analyzed sound signal. .
  • the analyzed sound signal is recorded by at least one microphone and noisy, that is to say it includes a useful non-noisy sound signal pronounced by the speaker and noise generated by the sound environment of the speaker, otherwise known as environmental noise, for example a signal generated by a television or a vacuum cleaner.
  • environmental noise for example a signal generated by a television or a vacuum cleaner.
  • Surrounding noise is continuously changing and can be both stationary, for example generated by ventilation, and unsteady, for example generated by a computer keyboard.
  • the invention was tested by considering the sound files corresponding to the following environments: interior of a vehicle, traffic noise, vacuum cleaner, drill, keyboard, musical instruments, singing, white noise, etc.
  • non-noisy sound signal means a sound signal whose signal-to-noise ratio is strictly greater than 15 dB.
  • noise signal means a sound signal whose signal-to-noise ratio is less than 15 dB.
  • microphone designates both a single microphone and a network of microphones comprising a plurality of microphones located in the same place and aimed at improving the quality of the recorded sound signals.
  • keyword group means an intent sentence or "intent sentence” in English.
  • group of keywords does not need to have any meaning, nor to be in an existing language.
  • group of command keywords means a group of words making it possible to trigger a command for a connected electronic device.
  • the group of command keywords “lower the sound” makes it possible to trigger a command from a connected speaker broadcasting music so that the speaker lowers the volume
  • the group of command keywords “turn off the light” allows you to trigger a command from a connected lamp illuminating a room so that the lamp turns off.
  • a group of command keywords comprises at least one word.
  • the number of commands that can be triggered is limited and depends in particular on the number of connected electronic devices.
  • the commands that can be triggered are chosen by a user.
  • Each command is associated with at least one group of command keywords making it possible to trigger the command.
  • the command to turn off an air conditioner can be associated with both the "turn off the air conditioner” command keyword group and the "turn off the air conditioner” command keyword group.
  • the speaker of the analyzed sound signal is identified from among a group of speakers comprising a finite number of speakers.
  • FIG. 1 is a block diagram illustrating the sequence of steps of the method 100 according to the invention.
  • a first step 101 of the method 100 according to the invention consists in building a training database.
  • the first step 101 comprises a first sub-step 1011 consisting, for each speaker of the group of speakers, in recording at least one non-noisy sound signal pronounced by the speaker.
  • each non-noisy sound signal can be recorded by the microphone that recorded the analyzed noisy sound signal or by another microphone.
  • Each non-noisy sound signal is for example uttered by the speaker when he is moving, that is to say that the non-noisy sound signal is uttered in different distinct positions.
  • a second sub-step 1012 consists for the microphone having recorded the analyzed noisy sound signal, in recording the surrounding noise.
  • a third sub-step 1013 consists in adding the noise recorded in the second sub-step 1012 to each non-noisy sound signal recorded in the first sub-step 101 to obtain a noisy sound signal.
  • a fourth sub-step 1014 consists in calculating a sound signature for each noisy sound signal obtained in the third sub-step 1013.
  • a fifth sub-step 1015 consists, for each sound signature calculated in the fourth step 1014, in associating the calculated sound signature: with the speaker who uttered the non-noisy sound signal on the basis of which the sound signature was calculated; at least one group of control keywords present in the non-noisy sound signal.
  • the information associated with each non-noisy sound signal during the fifth sub-step 1015 is for example provided by the speaker during a configuration phase.
  • the training database constituted then comprises each sound signature calculated in the fourth sub-step 1014 associated with the speaker and with the group of command keywords associated with the sound signature during the fifth sub-step 1015.
  • the training database constituted in the first step 101 can be updated on request, at regular intervals, or automatically after detection of a modification of the sound environment of the microphone.
  • the microphone To detect a change in the sound environment of the microphone, the microphone records for example the surrounding noise permanently, on request or at regular intervals and it is considered for example that there is a change in the sound environment of the microphone if a difference of at least 3 dB is observed between two recordings of the surrounding noise by the microphone.
  • a second step 102 of the method 100 according to the invention consists in training in a supervised manner an artificial neural network on the training database constituted in the first step 101 .
  • the artificial neural network can be any artificial neural network capable of performing multi-label classification or "multi-label classification" in English.
  • Supervised training otherwise called supervised learning, makes it possible to train an artificial neural network for a predefined task, by updating its parameters so as to minimize a cost function corresponding to the error between the data of output provided by the artificial neural network and the real output datum, i.e. what the artificial neural network should output to fulfill the predefined task on a certain input datum.
  • a training database therefore comprises input data, each associated with a real output data.
  • the training database comprises a plurality of sound signatures, each sound signature of the plurality of sound signatures being obtained from a noisy sound signal and associated with: a speaker of the noisy sound signal corresponding to the signature sound; at least one group of control keywords identified in the noisy sound signal corresponding to the sound signature.
  • the input data are the sound signatures and the real output data are the speaker and the command keyword group(s).
  • the supervised training of the artificial neural network therefore consists in updating the parameters so as to minimize a cost function taking into account the error between the speaker prediction provided by the artificial neural network from a sound signature from the training database and the speaker associated with the sound signature in the training database, and the error between the control keyword group prediction provided by the artificial neural network to from the sound signature and the command keyword group associated with the sound signature in the training database.
  • the cost function is for example the binary cross-entropy function.
  • Each sound signature of the training database is, for example, of the cepstral coefficient type of frequency Mel of the corresponding noisy sound signal, of the i-vector type obtained from the corresponding noisy sound signal or of the x-vector type obtained from the corresponding noisy sound signal.
  • the second step 102 is for example carried out as soon as the training database is updated.
  • a third step 103 of the method 100 according to the invention consists in calculating a sound signature from the analyzed sound signal.
  • the sound signature calculated in the third step 103 is of the same type as the sound signatures of the training database.
  • a fourth step 104 of the method 100 according to the invention consists in using the artificial neural network trained in the second step 102 on the sound signature calculated in the third step 103.
  • the artificial neural network then provides a speaker prediction, and at least one command keyword group prediction.
  • the speaker prediction corresponds to a speaker among the group of speakers or to a parameter indicating that the speaker is not known.
  • the command keyword group prediction corresponds to a group of command keywords encountered during supervised training or to a parameter indicating that the command keyword group is not known or does not exist.
  • the artificial neural network therefore performs a multi-label classification giving the identity of the speaker or detecting an unknown speaker via a first group of labels and giving the group of control keywords possibly detected for the speaker detected via a second label group.
  • the analyzed sound signal can also include a group of activation keywords preceding the group or groups of command keywords.
  • a group of activation keywords comprises at least one word.
  • a group of activation keywords is for example “hello” or "please”.
  • a sound signal allowing the triggering of a command causing the stopping of an air conditioner therefore includes, for example, the useful sound signal "hello stop air conditioning >>, "hello” being the activation keyword group and "stop air conditioning” being the command keyword group.
  • each sound signature of the training database is also associated with an activation bit relating to the detection or not of at least one group of activation keywords in the noisy sound signal. corresponding to the sound signature, that is to say worth 1 if at least one group of activation keywords is present and 0 otherwise, and the artificial neural network also provides, at the fourth step 104, a binary prediction activation.
  • the speaker Alternatively to the use of a group of activation keywords, before the recording of a sound signal, the speaker must for example wait for a certain duration, for example of the order of one second, before speaking the command keyword group(s).
  • the analyzed sound signal can also include a group of termination keywords following the group or groups of command keywords.
  • a group of termination keywords comprises at least one word.
  • a group of termination keywords is for example “end” or “thank you”.
  • a sound signal allowing the triggering of a command causing the stopping of an air conditioner therefore includes, for example, the useful sound signal “hello, stop the air conditioning thank you", where "hello” is the enable keyword group, "stop air conditioning” is the command keyword group, and "thank you” is the termination keyword group.
  • each sound signature of the training database is also associated with a termination bit relating to the detection or not of at least one group of termination keywords in the noisy sound signal corresponding to the sound signature, and the artificial neural network also provides in the fourth step 104, a termination bit prediction.
  • the analyzed sound signal can also comprise a group of linking keywords situated between two groups of command keywords.
  • a group of linking keywords comprises at least one word.
  • a group of linking keywords is for example “and” or “then”.
  • a sound signal allowing the triggering of a command causing the stopping of an air conditioner and the extinction of the light therefore comprises for example the helpful beep "hello turn off the aircon then turn off the light", "hello” being the activation keyword group, "stop the aircon” being the first control keyword group, "then >> being the linking keyword group, and "turn off the light” being the second command keyword group.
  • each sound signature of the training database is also associated with at least one link bit relating to the detection or not of at least one group of link keywords in the noisy sound signal.
  • the artificial neural network also provides to the fourth step 104, a link bit prediction and a second control keyword group prediction.
  • the training database includes sound signatures obtained from noisy sound signals uttered by moving speakers, an average absolute error of 9% is obtained for the prediction of command keyword groups.
  • a second aspect of the invention relates to a system 200 allowing the implementation of the method 100 according to the invention.
  • FIG. 2 shows a schematic representation of a first embodiment of the system 200 according to the invention.
  • FIG. 3 shows a schematic representation of a second embodiment of the system 200 according to the invention.
  • FIG. 4 shows a schematic representation of a third embodiment of the system 200 according to the invention.
  • the system 200 comprises: at least one microphone 201 configured to record noisy sound signals, non-noisy sound signals and surrounding noise; at least one local computer 202-1 configured to: calculate sound signatures from noisy sound signals obtained via at least one microphone 201; using the artificial neural network trained on calculated sound signatures; at least one central computer 202-2 configured to: constitute the training database from calculated sound signatures; supervised training of the artificial neural network on the constituted training database; the local computer 202-1 possibly being confused with the central computer 202-2.
  • the system 200 comprises for example a plurality of independent or coupled microphones 201.
  • the system 200 comprises for example four microphones 201, which makes it possible to cover 360°.
  • the system 200 comprises at least one microphone 201 physically connected to a single computer 202 playing both the role of local computer 202-1 and the role of central computer 202-2.
  • the system 200 comprises a single microphone 201 physically connected to a computer 202.
  • the system 200 comprises at least one microphone 201 connected via a wired or wireless link to a single computer 200 playing both the role of local computer 202-1 and the role of central computer 202-2.
  • the system 200 comprises two microphones 201 connected via a wireless link to a computer 202.
  • the system 200 according to the third embodiment comprises at least one microphone 201, each microphone 201 being connected physically or via a wired or wireless link to a local computer 202-1 and each local computer 202-1 being connected via a wired or wireless link to a central computer 202-2.
  • the system 200 includes two microphones 201 each physically connected to a local computer 202-1 and each local computer 202-1 being connected via a wireless link to a central computer 202-2.
  • the system 200 according to the invention can also comprise a storage device 203, for example a memory.
  • the storage device 203 stores for example each non-noisy sound signal recorded during the first sub-step 101 1 or each non-noisy sound signal recorded during the first sub-step 101 1 by a given microphone 201.
  • the system 200 according to the invention is for example a communication gateway and more particularly a connected enclosure.
  • the proposed approach is more generic than commercial tools.
  • the proposed approach makes it possible to achieve the noise or speech detection (VAD), command detection (CMD), sound environment identification (ASC) and speaker identification (SPEAKER ID); while the proposed commercial solutions only allow noise or speech detection (VAD) and command detection (CMD) or speaker identification (SPEAKER ID).
  • the proposed approach therefore adapts effectively and quickly to the conditions of use in which it is implemented.
  • the approach guarantees the robustness of speaker recognition (“voice” columns) and command word recognition (“command” column ).
  • voice voice
  • command command
  • the learning time of the model is systematically less than 1 s to achieve a high success rate, whereas with tools known from the state of the art this time is greater than 1 h.
  • the proposed approach requires a small amount of memory compared to the known methods of the state of the art, which generally require more than 1 GB of RAM for training the model and disk space to store the training database.

Landscapes

  • Engineering & Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Computational Linguistics (AREA)
  • Artificial Intelligence (AREA)
  • Evolutionary Computation (AREA)
  • Theoretical Computer Science (AREA)
  • Signal Processing (AREA)
  • Biophysics (AREA)
  • Data Mining & Analysis (AREA)
  • Biomedical Technology (AREA)
  • General Health & Medical Sciences (AREA)
  • Molecular Biology (AREA)
  • Computing Systems (AREA)
  • General Engineering & Computer Science (AREA)
  • General Physics & Mathematics (AREA)
  • Mathematical Physics (AREA)
  • Software Systems (AREA)
  • Life Sciences & Earth Sciences (AREA)
  • Measurement Of Mechanical Vibrations Or Ultrasonic Waves (AREA)
  • Soundproofing, Sound Blocking, And Sound Damping (AREA)

Abstract

24 ABREGE Procédé d'analyse d'un signal sonore bruité pour la reconnaissance de mots clés de commande et d'un locuteur du signal sonore bruité analysé 5 Un aspect de l'invention concerne un procédé d'analyse d'un signal sonore bruité pour la reconnaissance d'au moins un groupe de mots clés de commande et d'un locuteur du signal sonore bruité analysé, le signal sonore bruité étant enregistré par un microphone et le procédé comprenant les étapes suivantes : - Entraînement supervisé d'un réseau de neurones artificiels sur une base de 10 données d'entraînement pour obtenir un réseau de neurones artificiels entraîné capable de fournir à partir d'une signature sonore obtenue à partir d'un signal sonore bruité, une prédiction de locuteur et au moins une prédiction de groupe de mots clés de commande, la base de données d'entraînement comprenant une pluralité de signatures sonores chacune 15 associées à un locuteur et à au moins un groupe de mots clés de commande; - Calcul d'une signature sonore du signal sonore bruité analysé; - Utilisation du réseau de neurones artificiels entraîné sur la signature sonore calculée, pour obtenir une prédiction de locuteur et au moins une prédiction 20 de groupe de mots clés de commande.

Description

DESCRIPTION
TITRE : Procédé d’analyse d’un signal sonore bruité pour la reconnaissance de mots clé de commande et d’un locuteur du signal sonore bruité analysé
DOMAINE TECHNIQUE DE L’INVENTION
[0001 ] Le domaine technique de l’invention est celui de l’analyse de signaux sonores et en particulier celui de l’analyse de signaux sonores bruités pour la reconnaissance de mots clés de commande et de leur locuteur.
[0002] La présente invention concerne un procédé d’analyse d’un signal sonore bruité et en particulier un procédé d’analyse d’un signal sonore bruité pour la reconnaissance d’au moins un groupe de mots clés de commande et d’un locuteur du signal sonore bruité. La présente invention concerne également un système pour la mise en oeuvre du procédé selon l’invention.
ARRIERE-PLAN TECHNOLOGIQUE DE L’INVENTION
[0003] Avec l’explosion du nombre d’objets domotiques dans les foyers, le besoin d’une commande centralisée permettant de contrôler à distance chaque objet domotique est apparu.
[0004] Pour répondre à ce besoin, des passerelles de communication et plus particulièrement des enceintes connectées ont été développées. Ces passerelles de communication existent également dans le milieu industriel pour d’autres types d’équipements, tels que des robots, des machines-outils ou encore des portails commandés.
[0005] Ces enceintes connectées sont capables d’analyser des signaux sonores pour identifier et reconnaître des mots clés de commande prédéfinis présents dans le signal sonore analysé et envoyer via une liaison sans fil les commandes correspondantes, aux objets domotiques concernés. L’identification et la reconnaissance des mots clés de commande est en général réalisée dès qu’un mot clé particulier, dit mot clé d’activation, a été détecté pour éviter de déclencher des commandes de manière intempestive.
[0006] Ces enceintes utilisent un algorithme d’apprentissage automatique en ligne, ayant été entraîné de manière supervisée sur une base de données d’entraînement stockée sur un nuage informatique, ou « cloud >> en anglais. La base de données d’entraînement comporte une multitude de signaux sonores chacun associés au mot clé d’activation et aux mots clés de commande présents dans le signal sonore. A l’issue de l’entraînement, l’algorithme est capable de détecter le mot clé d’activation et de reconnaître chaque mot clé de commande présent dans un signal sonore que l’algorithme a rencontré lors de son entraînement.
[0007] Cependant, l’enceinte connectée ne parvient pas toujours à reconnaître les mots clés de commande présents dans un signal sonore, en particulier quand le locuteur a un accent particulier ou utilise une langue non représentée dans la base de données d’entraînement.
[0008] Il existe donc un besoin d’un algorithme permettant d’analyser des signaux sonores pour reconnaître des mots clés de commande, quelles que soient les spécificités linguistiques du locuteur.
RESUME DE L’INVENTION
[0009] L’invention offre une solution aux problèmes évoqués précédemment, en permettant de reconnaître chaque mot clé de commande présent dans un signal sonore quelles que soient les spécificités linguistiques de son locuteur.
[0010] Un premier aspect de l’invention concerne un procédé d’analyse d’un signal sonore bruité pour la reconnaissance d’au moins un groupe de mots clés de commande et d’un locuteur du signal sonore bruité analysé, le signal sonore bruité à analyser étant enregistré par au moins un microphone et le procédé comprenant les étapes suivantes :
Constitution d’une base de données d’entraînement comprenant les sous- étapes suivantes :
Pour chaque locuteur à reconnaître, enregistrement d’au moins un signal sonore non bruité prononcé par le locuteur ;
Enregistrement par le microphone du bruit environnant, le bruit environnant étant un bruit généré par l’environnement sonore du locuteur ;
Pour chaque signal sonore non bruité enregistré, ajout du bruit enregistré au signal sonore non bruité pour obtenir un signal sonore bruité ; Pour chaque signal sonore bruité obtenu, calcul d’une signature sonore du signal sonore bruité obtenu ;
Pour chaque signature sonore calculée, association de la signature sonore calculée au locuteur ayant prononcé le signal sonore non bruité correspondant et à au moins un groupe de mots clés de commande ;
Entraînement supervisé d’un réseau de neurones artificiels sur la base de données d’entraînement pour obtenir un réseau de neurones artificiels entraîné capable de fournir à partir d’une signature sonore obtenue à partir d’un signal sonore bruité, une prédiction de locuteur et au moins une prédiction de groupe de mots clés de commande ;
Calcul d’une signature sonore du signal sonore bruité analysé ;
Utilisation du réseau de neurones artificiels entraîné sur la signature sonore calculée, pour obtenir une prédiction de locuteur et au moins une prédiction de groupe de mots clés de commande.
[001 1 ] Grâce à l’invention, le réseau de neurones artificiels est entraîné pour être capable à la fois de reconnaître chaque mot clé de commande présent dans le signal sonore analysé, et d’identifier le locuteur du signal sonore analysé.
[0012] Comme le locuteur du signal sonore est identifié, il est possible de n’autoriser le déclenchement des commandes correspondant aux mots clés de commande reconnus que quand le locuteur identifié appartient à un groupe de locuteurs approuvés.
[0013] L’entraînement est réalisé sur une base de données d’entraînement comportant pour chaque locuteur à reconnaître, une pluralité de signatures sonores obtenues à partir de signaux sonores non bruités enregistrés par le locuteur lui-même, présentant donc les spécificités du locuteur comme sa langue ou son accent, et les mots clés de commande que le locuteur souhaite utiliser. La reconnaissance du locuteur par le réseau de neurones artificiels est donc facilitée sans qu’il y ait besoin d’étape de traduction en phonème ou d’étape de compréhension du langage, et chaque locuteur peut personnaliser les mots clés de commande utilisés.
[0014] De plus, la base de données d’entraînement prend en compte le bruit à proximité du microphone, ce qui améliore les performances du réseau de neurones artificiels sur les signaux sonores enregistrés par le microphone présentant un bruit similaire. [0015] Par ailleurs, l’entraînement est réalisé sur une unique base de données d’entraînement permettant d’une part l’apprentissage des mots clé de commande par le réseau de neurones artificiels, et d’autre part l’identification de caractéristiques biométriques permettant de reconnaître le locuteur par le réseau de neurones artificiels. La quantité de données nécessaires à l’apprentissage du réseau de neurones artificiels est donc bien inférieure à ce qui est nécessaire dans l’état de l’art où ces deux tâches sont réalisées séparément sur deux bases de données d’entraînement distinctes.
[0016] Outre les caractéristiques qui viennent d’être évoquées dans le paragraphe précédent, le procédé selon le premier aspect de l’invention peut présenter une ou plusieurs caractéristiques complémentaires parmi les suivantes, considérées individuellement ou selon toutes les combinaisons techniquement possibles.
[0017] Selon une variante de réalisation, le réseau de neurones artificiels entraîné est en outre capable de fournir à partir d’une signature sonore, une prédiction de binaire d’activation relatif à la détection ou non d’au moins un groupe de mots clés d’activation, chaque signature sonore de la base de données d’entraînement étant associée en outre à un binaire d’activation, l’étape d’utilisation du réseau de neurones artificiels entraîné permettant d’obtenir en outre une prédiction de binaire d’activation.
[0018] Selon une variante de réalisation compatible avec la variante de réalisation précédente, le réseau de neurones artificiels entraîné est en outre capable de fournir à partir d’une signature sonore, une prédiction de binaire de terminaison relatif à la détection ou non d’au moins un groupe de mots clés de terminaison, chaque signature sonore de la base de données d’entraînement étant associée en outre à un binaire de terminaison, l’étape d’utilisation du réseau de neurones artificiels entraîné permettant d’obtenir en outre une prédiction de binaire de terminaison.
[0019] Ainsi, les performances du réseau de neurones artificiels pour la reconnaissance des mots clés de commande sont augmentées puisque la plage du signal sonore analysé comprenant des mots clés de commande est délimitée par le groupe de mots clés d’activation d’une part et le groupe de mots clés de terminaison d’autre part. [0020] Selon une variante de réalisation compatible avec les variantes de réalisation précédentes, le réseau de neurones artificiels entraîné est en outre capable de fournir à partir d’une signature sonore, au moins une prédiction de binaire de liaison relatif à la détection ou non d’au moins un groupe de mots clés de liaison, chaque signature sonore de la base de données d’entraînement étant associée en outre à au moins un binaire de liaison et, si la valeur du binaire de liaison correspond à la détection d’au moins un groupe de mots clés de liaison, à au moins un deuxième groupe de mots clés de commande, l’étape d’utilisation du réseau de neurones artificiels entraîné permettant d’obtenir en outre une prédiction de binaire de liaison et au moins une prédiction de deuxième groupe de mots clés de commande.
[0021 ] Ainsi, les performances du réseau de neurones artificiels pour la reconnaissance des mots clés de commande sont augmentées dans le cas où le signal sonore analysé présente au moins un premier groupe de mots clés de commande et un deuxième groupe de mots clés de commande, puisque la plage du signal sonore analysé comprenant le premier groupe de mots clés de commande est délimitée par le groupe de mots clés d’activation d’une part et le groupe de mots clés de liaison d’autre part.
[0022] Selon une variante de réalisation compatible avec les variantes de réalisation précédentes, au moins un signal sonore non bruité enregistré lors de l’étape de constitution de la base de données d’entrainement est prononcé par un locuteur en mouvement.
[0023] Ainsi, le réseau de neurones artificiels présente de meilleures performances pour la reconnaissance des mots clés de commande sur les signaux sonores prononcés par des locuteurs mobiles, sans avoir à multiplier le nombre de microphones nécessaires, grâce à la spatialisation des données.
[0024] Selon une variante de réalisation compatible avec les variantes de réalisation précédentes, la base de données d’entraînement est mise à jour sur requête, à intervalle régulier, ou automatiquement après détection d’une modification de l’environnement sonore du microphone.
[0025] Ainsi, la base de données d’entraînement est mise à jour pour s’adapter au bruit à proximité du microphone qui peut varier. [0026] Selon une sous-variante de réalisation de la variante de réalisation précédente, l’étape d’entraînement supervisé du réseau de neurones artificiels est réalisée dès que la base de données d’entraînement est mise à jour.
[0027] Un deuxième aspect de l’invention concerne un système pour la mise en oeuvre du procédé selon l’invention comprenant : au moins un microphone configuré pour enregistrer des signaux sonores bruités ou non bruités, et le bruit environnant ; au moins un calculateur local configuré pour : calculer des signatures sonores à partir de signaux sonores bruités obtenus via au moins un microphone ; utiliser le réseau de neurones artificiels entraîné sur des signatures sonores calculées ; au moins un calculateur principal configuré pour : constituer la base de données d’entraînement à partir de signatures sonores calculées par le calculateur local ; entraîner de manière supervisée le réseau de neurones artificiels sur la base de données d’entraînement constituée.
[0028] Selon une variante de réalisation, le système selon l’invention comprend en outre au moins un dispositif de stockage configuré pour stocker chaque signal sonore non bruité enregistré.
[0029] Ainsi, le procédé selon l’invention peut être réalisé hors ligne, c’est-à-dire en local.
[0030] Selon une variante de réalisation compatible avec la variante de réalisation précédente, le système selon l’invention comprend une pluralité de microphones indépendants ou couplés.
[0031 ] Ainsi, la qualité des signaux sonores enregistrés est meilleure, en particulier les erreurs dues aux échos sont diminuées.
[0032] Selon une variante de réalisation compatible avec les variantes de réalisation précédentes, le système selon l’invention comprend un calculateur local par microphone. [0033] Ainsi, le calculateur central réalise l’entraînement du réseau de neurones artificiels qui nécessite des ressources de calcul importantes, et communique le réseau de neurones artificiels entraîné à chaque calculateur local qui traite les signaux sonores enregistrés par le microphone correspondant.
[0034] Selon une variante de réalisation compatible avec les variantes de réalisation précédentes, le calculateur local et le calculateur central correspondent à un unique calculateur.
[0035] Un troisième aspect de l’invention concerne un produit-programme d’ordinateur comprenant des instructions qui, quand le programme est exécuté sur un ordinateur, conduisent celui-ci à mettre en oeuvre les étapes du procédé selon l’invention.
[0036] Un quatrième aspect de l’invention concerne un support d'enregistrement lisible par ordinateur comprenant des instructions qui, lorsqu'elles sont exécutées par un ordinateur, conduisent celui-ci à mettre en oeuvre les étapes du procédé selon l’invention.
[0037] L’invention et ses différentes applications seront mieux comprises à la lecture de la description qui suit et à l’examen des figures qui l’accompagnent.
BREVE DESCRIPTION DES FIGURES
[0038] Les figures sont présentées à titre indicatif et nullement limitatif de l’invention.
La figure 1 est un schéma synoptique illustrant l’enchaînement des étapes d’un procédé selon l’invention.
La figure 2 montre une représentation schématique d’un premier mode de réalisation d’un système selon l’invention.
La figure 3 montre une représentation schématique d’un deuxième mode de réalisation du système selon l’invention.
La figure 4 montre une représentation schématique d’un troisième mode de réalisation du système selon l’invention. DESCRIPTION DETAILLEE
[0039] Sauf précision contraire, un même élément apparaissant sur des figures différentes présente une référence unique.
[0040] Un premier aspect de l’invention concerne un procédé d’analyse d’un signal sonore permettant à la fois de reconnaître chaque groupe de mots clés de commande présent dans le signal sonore analysé et d’identifier le locuteur du signal sonore analysé.
[0041 ] Le signal sonore analysé est enregistré par au moins un microphone et bruité, c’est-à-dire qu’il comporte un signal sonore utile non bruité prononcé par le locuteur et du bruit généré par l’environnement sonore du locuteur, autrement appelé bruit environnant, par exemple un signal généré par un téléviseur ou un aspirateur. Le bruit environnant est continuellement changeant et peut être aussi bien stationnaire, par exemple généré par une ventilation, qu’instationnaire, par exemple généré par un clavier d’ordinateur.
[0042] L’invention a été testée en considérant les fichiers sonores correspondant aux environnements suivants : intérieur d’un véhicule, bruit de circulation, aspirateur, perceuse, clavier, instruments de musique, chant, bruit blanc, etc.
[0043] On entend par « signal sonore non bruité >>, un signal sonore dont le rapport signal sur bruit est strictement supérieur à 15 dB.
[0044] On entend par « signal sonore bruité >>, un signal sonore dont le rapport signal sur bruit est inférieur à 15 dB.
[0045] Dans la suite de la description, on désigne par « microphone >> aussi bien un microphone unique qu’un réseau de microphones comprenant une pluralité de microphones situés à un même endroit et visant à améliorer la qualité des signaux sonores enregistrés.
[0046] On entend par « groupe de mots clés >>, une phrase d’intention ou « intent sentence >> en anglais.
[0047] Dans le cadre de l’invention, le groupe de mots clés n’a pas besoin d’avoir une quelconque signification, ni d’être dans une langue existante. [0048] On entend par « groupe de mots clés de commande >>, un groupe de mots permettant de déclencher une commande d’un appareil électronique connecté.
[0049] Par exemple, le groupe de mots clés de commande « baisse le son >> permet de déclencher une commande d’une enceinte connectée diffusant de la musique pour que l’enceinte baisse le volume, et le groupe de mots clés de commande « éteins la lumière >> permet de déclencher une commande d’une lampe connectée éclairant une pièce pour que la lampe s’éteigne.
[0050] Un groupe de mots clés de commande comporte au moins un mot.
[0051 ] Le nombre de commandes pouvant être déclenchées est limité et dépend notamment du nombre d’appareils électroniques connectés.
[0052] Les commandes pouvant être déclenchées sont choisies par un utilisateur.
[0053] Chaque commande est associée à au moins un groupe de mots clés de commande permettant de déclencher la commande. Par exemple, la commande permettant d’éteindre un climatiseur peut être associée à la fois au groupe de mots clés de commande « arrête la climatisation >> et au groupe de mots clés de commande « éteins le climatiseur >>.
[0054] Le locuteur du signal sonore analysé est identifié parmi un groupe de locuteurs comportant un nombre fini de locuteurs.
[0055] La [Fig. 1 ] est un schéma synoptique illustrant l’enchaînement des étapes du procédé 100 selon l’invention.
[0056] Une première étape 101 du procédé 100 selon l’invention consiste à constituer une base de données d’entraînement.
[0057] La première étape 101 comporte une première sous-étape 1011 consistant pour chaque locuteur du groupe de locuteurs, à enregistrer au moins un signal sonore non bruité prononcé par le locuteur.
[0058] Par exemple, en moyenne 20 secondes de signaux sonores non bruités sont enregistrées pour chaque locuteur du groupe de locuteurs. [0059] Chaque signal sonore non bruité peut être enregistré par le microphone ayant enregistré le signal sonore bruité analysé ou par un autre microphone.
[0060] Chaque signal sonore non bruité est par exemple prononcé par le locuteur quand il est en mouvement, c’est-à-dire que le signal sonore non bruité est prononcé en différentes positions distinctes.
[0061 ] Une deuxième sous-étape 1012 consiste pour le microphone ayant enregistré le signal sonore bruité analysé, à enregistrer le bruit environnant.
[0062] Une troisième sous-étape 1013 consiste à ajouter le bruit enregistré à la deuxième sous-étape 1012 à chaque signal sonore non bruité enregistré à la première sous-étape 101 pour obtenir un signal sonore bruité.
[0063] Une quatrième sous-étape 1014 consiste à calculer une signature sonore pour chaque signal sonore bruité obtenu à la troisième sous-étape 1013.
[0064] Une cinquième sous-étape 1015 consiste pour chaque signature sonore calculée à la quatrième étape 1014, à associer la signature sonore calculée : au locuteur ayant prononcé le signal sonore non bruité sur la base duquel la signature sonore a été calculée ; à au moins un groupe de mots clés de commande présent dans le signal sonore non bruité.
[0065] Les informations associées à chaque signal sonore non bruité lors de la cinquième sous-étape 1015 sont par exemple fournies par le locuteur lors d’une phase de configuration.
[0066] La base de données d’entraînement constituée comprend alors chaque signature sonore calculée à la quatrième sous-étape 1014 associée au locuteur et au groupe de mots clés de commande associés à la signature sonore lors de la cinquième sous-étape 1015. [0067] La base de données d’entraînement constituée à la première étape 101 peut être mise à jour sur requête, à intervalle régulier, ou automatiquement après détection d’une modification de l’environnement sonore du microphone.
[0068] Pour détecter une modification de l’environnement sonore du microphone, le microphone enregistre par exemple le bruit environnant en permanence, sur requête ou à intervalle régulier et on considère par exemple qu’il y a une modification de l’environnement sonore du microphone si une différence d’au moins 3 dB est constatée entre deux enregistrements du bruit environnant par le microphone.
[0069] Il y a par exemple modification de l’environnement sonore du microphone quand une source sonore apparaît à proximité du microphone, par exemple par l’allumage d’un téléviseur ou d’un aspirateur.
[0070] Une deuxième étape 102 du procédé 100 selon l’invention consiste à entraîner de manière supervisée un réseau de neurones artificiels sur la base de données d’entraînement constituée à la première étape 101 .
[0071 ] Le réseau de neurones artificiels peut être n’importe quel réseau de neurones artificiels capable de réaliser de la classification multi-label ou « multi-label classification >> en anglais.
[0072] L’entraînement supervisé, autrement appelé apprentissage supervisé, permet d’entraîner un réseau de neurones artificiels à une tâche prédéfinie, en mettant à jour ses paramètres de manière à minimiser une fonction de coût correspondant à l’erreur entre la donnée de sortie fournie par le réseau de neurones artificiels et la vraie donnée de sortie, c’est-à-dire ce que le réseau de neurones artificiels devrait fournir en sortie pour remplir la tâche prédéfinie sur une certaine donnée d’entrée.
[0073] Une base de données d’entraînement comporte donc des données d’entrée, chacune associée à une vraie donnée de sortie.
[0074] La base de données d’entraînement comprend une pluralité de signatures sonores, chaque signature sonore de la pluralité de signatures sonores étant obtenue à partir d’un signal sonore bruité et associée à : un locuteur du signal sonore bruité correspondant à la signature sonore ; à au moins un groupe de mots clés de commande identifié dans le signal sonore bruité correspondant à la signature sonore.
[0075] Ainsi, les données d’entrée sont les signatures sonores et les vraies données de sortie sont le locuteur et le ou les groupes de mots clés de commande.
[0076] L’entraînement supervisé du réseau de neurones artificiels consiste donc à mettre à jour les paramètres de manière à minimiser une fonction de coût prenant en compte l’erreur entre la prédiction de locuteur fournie par le réseau de neurones artificiels à partir d’une signature sonore de la base de données d’entraînement et le locuteur associé à la signature sonore dans la base de données d’entraînement, et l’erreur entre la prédiction de groupe de mots clés de commande fourni par le réseau de neurones artificiels à partir de la signature sonore et le groupe de mots clés de commande associé à la signature sonore dans la base de données d’entraînement.
[0077] La fonction de coût est par exemple la fonction d'entropie croisée binaire.
[0078] Toutes les signatures sonores de la base de données d’entraînement sont de même type.
[0079] Chaque signature sonore de la base de données d’entraînement est par exemple du type coefficients cepstraux de fréquence Mel du signal sonore bruité correspondant, du type i-vecteur obtenu à partir du signal sonore bruité correspondant ou du type x-vecteur obtenu à partir du signal sonore bruité correspondant.
[0080] La deuxième étape 102 est par exemple réalisée dès que la base de données d’entraînement est mise à jour.
[0081 ] Une troisième étape 103 du procédé 100 selon l’invention consiste à calculer une signature sonore à partir du signal sonore analysé.
[0082] La signature sonore calculée à la troisième étape 103 est de même type que les signatures sonores de la base de données d’entraînement. [0083] Une quatrième étape 104 du procédé 100 selon l’invention consiste à utiliser le réseau de neurones artificiels entraîné à la deuxième étape 102 sur la signature sonore calculée à la troisième étape 103.
[0084] Le réseau de neurones artificiels fournit alors une prédiction de locuteur, et au moins une prédiction de groupe de mots clés de commande.
[0085] La prédiction de locuteur correspond à un locuteur parmi le groupe de locuteurs ou à un paramètre indiquant que le locuteur n’est pas connu.
[0086] La prédiction de groupe de mots clés de commande correspond à un groupe de mots clés de commande rencontrés lors de l’entraînement supervisé ou à un paramètre indiquant que le groupe de mots clés de commande n’est pas connu ou inexistant.
[0087] Le réseau de neurones artificiels réalise donc une classification multi-label donnant l’identité du locuteur ou détectant un locuteur inconnu via un premier groupe de labels et donnant le groupe des mots clés de commande éventuellement détecté pour le locuteur détecté via un deuxième groupe de labels.
[0088] En plus des groupes de mots clés de commande, le signal sonore analysé peut également comporter un groupe de mots clés d’activation précédant le ou les groupes de mots clés de commande.
[0089] Un groupe de mots clés d’activation comprend au moins un mot.
[0090] Un groupe de mots clés d’activation est par exemple « bonjour >> ou « s’il te plaît ».
[0091 ] Dans le cas où le signal sonore analysé comporte un groupe de mots clés d’activation, un signal sonore permettant le déclenchement d’une commande entraînant l’arrêt d’un climatiseur comporte donc par exemple le signal sonore utile « bonjour arrête la climatisation >>, « bonjour >> étant le groupe de mots clés d’activation et « arrête la climatisation >> étant le groupe de mots clés de commande.
[0092] Dans ce cas, chaque signature sonore de la base de données d’entraînement est également associée à un binaire d’activation relatif à la détection ou non d’au moins un groupe de mots clés d’activation dans le signal sonore bruité correspondant à la signature sonore, c’est-à-dire valant 1 si au moins un groupe de mots clés d’activation est présent et 0 sinon, et le réseau de neurones artificiels fournit également à la quatrième étape 104, une prédiction de binaire d’activation. [0093] Alternativement à l’utilisation d’un groupe de mots clés d’activation, avant l’enregistrement d’un signal sonore, le locuteur doit par exemple attendre une certaine durée, par exemple de l’ordre d’une seconde, avant de prononcer le ou les groupes de mots clés de commande.
[0094] En plus des groupes de mots clés d’activation et de commande, le signal sonore analysé peut également comporter un groupe de mots clés de terminaison suivant le ou les groupes de mots clés de commande.
[0095] Un groupe de mots clés de terminaison comprend au moins un mot.
[0096] Un groupe de mots clés de terminaison est par exemple « fin >> ou « merci ».
[0097] Dans le cas où le signal sonore analysé comporte un groupe de mots clés de terminaison, un signal sonore permettant le déclenchement d’une commande entraînant l’arrêt d’un climatiseur comporte donc par exemple le signal sonore utile « bonjour arrête la climatisation merci >>, « bonjour >> étant le groupe de mots clés d’activation, « arrête la climatisation >> étant le groupe de mots clés de commande et « merci >> étant le groupe de mots clés de terminaison.
[0098] Dans ce cas, chaque signature sonore de la base de données d’entraînement est également associée à un binaire de terminaison relatif à la détection ou non d’au moins un groupe de mots clés de terminaison dans le signal sonore bruité correspondant à la signature sonore, et le réseau de neurones artificiels fournit également à la quatrième étape 104, une prédiction de binaire de terminaison.
[0099] Le signal sonore analysé peut également comporter un groupe de mots clés de liaison situé entre deux groupes de mots clés de commande.
[00100] Un groupe de mots clés de liaison comprend au moins un mot.
[00101 ] Un groupe de mots clés de liaison est par exemple « et >> ou « puis >>.
[00102] Dans le cas où le signal sonore analysé comporte un groupe de mots clés de liaison, un signal sonore permettant le déclenchement d’une commande entraînant l’arrêt d’un climatiseur et l’extinction de la lumière comporte donc par exemple le signal sonore utile « bonjour arrête la climatisation puis éteins la lumière >>, « bonjour >> étant le groupe de mots clés d’activation, « arrête la climatisation >> étant le premier groupe de mots clés de commande, « puis >> étant le groupe de mots clés de liaison, et« éteins la lumière >> étant le deuxième groupe de mots clés de commande. [00103] Dans ce cas, chaque signature sonore de la base de données d’entraînement est également associée à au moins un binaire de liaison relatif à la détection ou non d’au moins un groupe de mots clés de liaison dans le signal sonore bruité correspondant à la signature sonore, et à au moins un deuxième groupe de mots clés de commande si la valeur du binaire de liaison correspond à la détection d’au moins un groupe de mots clés de liaison, et le réseau de neurones artificiels fournit également à la quatrième étape 104, une prédiction de binaire de liaison et une prédiction de deuxième groupe de mots clés de commande.
[00104] En utilisant le procédé 100 selon l’invention sur un signal sonore bruité de 5 secondes avec un rapport signal sur bruit égal à 20 pour un ensemble de 20 groupes de mots clés de commande, on obtient : un taux d’erreur équivalent, ou « Equal Error Rate >> en anglais, de 6% pour la prédiction de locuteur ; une erreur absolue moyenne, ou « Mean Absolute Error >> en anglais, de 7% pour la prédiction de groupes de mots clés de commande.
[00105] Si la base de données d’entraînement comporte des signatures sonores obtenues à partir de signaux sonores bruités prononcés par des locuteurs en mouvement, une erreur absolue moyenne de 9% est obtenue pour la prédiction de groupes de mots clés de commande.
[00106] Un deuxième aspect de l’invention concerne un système 200 permettant la mise en oeuvre du procédé 100 selon l’invention.
[00107] La [Fig. 2] montre une représentation schématique d’un premier mode de réalisation du système 200 selon l’invention.
[00108] La [Fig. 3] montre une représentation schématique d’un deuxième mode de réalisation du système 200 selon l’invention.
[00109] La [Fig. 4] montre une représentation schématique d’un troisième mode de réalisation du système 200 selon l’invention.
[001 10] Quel que soit le mode de réalisation, le système 200 selon l’invention comprend : au moins un microphone 201 configuré pour enregistrer des signaux sonores bruités, des signaux sonores non bruités et le bruit environnant ; au moins un calculateur local 202-1 configuré pour : calculer des signatures sonores à partir de signaux sonores bruités obtenus via au moins un microphone 201 ; utiliser le réseau de neurones artificiels entraîné sur des signatures sonores calculées ; au moins un calculateur central 202-2 configuré pour : constituer la base de données d’entraînement à partir de signatures sonores calculées ; entraîner de manière supervisée le réseau de neurones artificiels sur la base de données d’entraînement constituée ; le calculateur local 202-1 étant éventuellement confondu avec le calculateur central 202-2.
[001 1 1 ] Le système 200 selon l’invention comporte par exemple une pluralité de microphones 201 indépendants ou couplés.
[001 12] Le système 200 selon l’invention comporte par exemple quatre microphones 201 , ce qui permet de couvrir 360°.
[001 13] Le système 200 selon le premier mode de réalisation comporte au moins un microphone 201 connecté physiquement à un unique calculateur 202 jouant à la fois le rôle de calculateur local 202-1 et le rôle de calculateur central 202-2.
[001 14] Sur la figure 2, le système 200 comporte un unique microphone 201 connecté physiquement à un calculateur 202.
[001 15] Le système 200 selon le deuxième mode de réalisation comporte au moins un microphone 201 connecté via une liaison filaire ou sans fil à un unique calculateur 200 jouant à la fois le rôle de calculateur local 202-1 et le rôle de calculateur central 202-2.
[001 16] Sur la figure 3, le système 200 comporte deux microphones 201 connectés via une liaison sans fil à un calculateur 202. [001 17] Le système 200 selon le troisième mode de réalisation comporte au moins un microphone 201 , chaque microphone 201 étant connecté physiquement ou via une liaison filaire ou sans fil à un calculateur local 202-1 et chaque calculateur local 202-1 étant connecté via une liaison filaire ou sans fil à un calculateur central 202-2.
[001 18] Sur la figure 4, le système 200 comporte deux microphones 201 chacun connectés physiquement à un calculateur local 202-1 et chaque calculateur local 202- 1 étant connecté via une liaison sans fil à un calculateur central 202-2.
[001 19] Le système 200 selon l’invention peut également comporter un dispositif de stockage 203, par exemple une mémoire.
[00120] Le dispositif de stockage 203 stocke par exemple chaque signal sonore non bruité enregistré lors de la première sous-étape 101 1 ou chaque signal sonore non bruité enregistré lors de la première sous-étape 101 1 par un microphone 201 donné.
[00121 ] Le système 200 selon l’invention est par exemple une passerelle de communication et plus particulièrement une enceinte connectée.
[00122] Afin de mettre en évidence les performances de l’approche proposée dans l’invention, une comparaison est proposée, dans le tableau 1 ci-dessous, avec trois outils commercialisés de l’état de l’art.
[00123] Cette étude comparative met en avant la rapidité de mise en oeuvre de l’approche selon l’invention, avec des durées d’apprentissage et d’inférence bien inférieures à ce qui est proposé par d’autres solutions de l’état de l’art, tout en nécessitant un très petit espace mémoire pour le stockage du modèle. Ceci est avantageusement possible grâce à l’exécution locale, et non sur un nuage/cloud pour l’apprentissage et l’inférence du modèle, et par l’utilisation d’une base de données d’apprentissage de taille réduite (moins de 10 Mo), contrairement aux autres solutions dont cette base de données excède les 100 Go.
[00124] En outre, les performances de l’approche proposée, mesurées par le taux d’acceptation de commande, sont aussi bonne, voire meilleure, que les autres outils.
[00125] Enfin, du point de vue applicatif, l’approche proposée est plus générique que les outils du commerce. En particulier, l’approche proposée permet de réaliser la détection de bruit ou de parole (VAD), la détection d’une commande (CMD), l’identification de l’environnement sonore (ASC) et l’identification du locuteur (SPEAKER ID) ; tandis que les solutions du commerce proposées permettent uniquement la détection de bruit ou de parole (VAD) et la détection d’une commande (CMD) ou l’identification du locuteur (SPEAKER ID).
[00126] [Tableau 1 ]
[00127] Dans cette étude comparative ont notamment été évaluées les performances de l’invention dans différents contextes. Trois d’entre eux sont résumés dans le tableau 2, ci-dessous, et mettent en lumière l’efficacité et la rapidité de l’approche proposée pour la reconnaissance de locuteur et de mots clefs. Le tableau contient des métriques d’évaluation du procédé selon l’invention après 20 secondes d’apprentissage de la voix du locuteur et 12 émissions de mots de commande dans des environnements sonores différents.
[00128] L’approche proposée s’adapte donc efficacement et rapidement aux conditions d’utilisation dans lesquelles elle est implémentée. En particulier, pour des rapports signal à bruit (RSB) pénalisants, avec des niveaux de bruit élevées, l’approche garantie la robustesse de la reconnaissance du locuteur (colonnes « voix ») et la reconnaissance des mots de commande (colonne « commande »). Il peut être observé que la durée d’apprentissage du modèle est systématiquement inférieure à 1 s pour atteindre un taux de succès élevé, alors qu’avec des outils connus de l’état de l’art cette durée est supérieure à 1 h. [00129] Il est également noté que l’approche proposée requiert une quantité de mémoire faible comparativement aux méthodes connues de l’état de l’art, qui nécessitent généralement plus de 1 Go de mémoire vive pour l’entraînement du modèle et d’espace disque pour stocker la base de données d’apprentissage. [00130] [Tableau 2]

Claims

REVENDICATIONS
[Revendication 1 ] Procédé (100) d’analyse d’un signal sonore bruité pour la reconnaissance d’au moins un groupe de mots clés de commande et d’un locuteur du signal sonore bruité analysé, le signal sonore bruité à analyser étant enregistré par au moins un microphone (201 ) et le procédé (100) étant caractérisé en ce qu’il comprend les étapes suivantes :
- Constitution (101 ) d’une base de données d’entraînement comprenant les sous-étapes suivantes : o Pour chaque locuteur à reconnaître, enregistrement d’au moins un signal sonore non bruité prononcé par le locuteur (101 1 ) ; o Enregistrement par le microphone (201 ) du bruit environnant (1012), le bruit environnant étant un bruit généré par l’environnement sonore du locuteur ; o Pour chaque signal sonore non bruité enregistré, ajout du bruit enregistré au signal sonore non bruité pour obtenir un signal sonore bruité (1013) ; o Pour chaque signal sonore bruité obtenu, calcul d’une signature sonore du signal sonore bruité obtenu (1014) ; o Pour chaque signature sonore calculée, association de la signature sonore calculée au locuteur ayant prononcé le signal sonore non bruité correspondant et à au moins un groupe de mots clés de commande (1015) ;
- Entraînement supervisé (102) d’un réseau de neurones artificiels sur la base de données d’entraînement constituée pour obtenir un réseau de neurones artificiels entraîné capable de fournir à partir d’une signature sonore obtenue à partir d’un signal sonore bruité, une prédiction de locuteur et au moins une prédiction de groupe de mots clés de commande ;
- Calcul (103) d’une signature sonore du signal sonore bruité analysé ;
- Utilisation (104) du réseau de neurones artificiels entraîné sur la signature sonore calculée, pour obtenir une prédiction de locuteur et au moins une prédiction de groupe de mots clés de commande. [Revendication 2] Procédé (100) selon la revendication 1 , dans lequel le réseau de neurones artificiels entraîné est en outre capable de fournir à partir d’une signature sonore, une prédiction de binaire d’activation relatif à la détection ou non d’au moins un groupe de mots clés d’activation, chaque signature sonore de la base de données d’entraînement étant associée en outre à un binaire d’activation, l’étape (104) d’utilisation du réseau de neurones artificiels entraîné permettant d’obtenir en outre une prédiction de binaire d’activation.
[Revendication s] Procédé (100) selon l’une quelconque des revendications précédentes, dans lequel le réseau de neurones artificiels entraîné est en outre capable de fournir à partir d’une signature sonore, une prédiction de binaire de terminaison relatif à la détection ou non d’au moins un groupe de mots clés de terminaison, chaque signature sonore de la base de données d’entraînement étant associée en outre à un binaire de terminaison, l’étape (104) d’utilisation du réseau de neurones artificiels entraîné permettant d’obtenir en outre une prédiction de binaire de terminaison.
[Revendication 4] Procédé (100) selon l’une quelconque des revendications précédentes, dans lequel le réseau de neurones artificiels entraîné est en outre capable de fournir à partir d’une signature sonore, au moins une prédiction de binaire de liaison relatif à la détection ou non d’au moins un groupe de mots clés de liaison, chaque signature sonore de la base de données d’entraînement étant associée en outre à au moins un binaire de liaison et, si la valeur du binaire de liaison correspond à la détection d’au moins un groupe de mots clés de liaison, à au moins un deuxième groupe de mots clés de commande, l’étape (104) d’utilisation du réseau de neurones artificiels entraîné permettant d’obtenir en outre une prédiction de binaire de liaison et au moins une prédiction de deuxième groupe de mots clés de commande.
[Revendication s] Procédé (100) selon l’une quelconque des revendications précédentes, dans lequel au moins un signal sonore non bruité enregistré lors de l’étape (101 ) de constitution de la base de données d’entrainement est prononcé par un locuteur en mouvement. [Revendication 6] Procédé (100) selon l’une quelconque des revendications précédentes, dans lequel la base de données d’entraînement est mise à jour sur requête, à intervalle régulier, ou automatiquement après détection d’une modification de l’environnement sonore du microphone (201 ).
[Revendication 7] Procédé (100) selon la revendication 6, dans lequel l’étape (102) d’entraînement supervisé du réseau de neurones artificiels est réalisée dès que la base de données d’entraînement est mise à jour.
[Revendication s] Système (200) pour la mise en oeuvre du procédé (100) selon l’une quelconque des revendications précédentes, comprenant :
- Au moins un microphone (201 ) configuré pour enregistrer des signaux sonores bruités ou non bruités et le bruit environnant ;
- Au moins un calculateur local (202-1 ) configuré pour : o calculer des signatures sonores à partir de signaux sonores bruités obtenus via au moins un microphone (201 ) ; o utiliser le réseau de neurones artificiels entraîné sur des signatures sonores calculées ;
- Au moins un calculateur principal (202-2) configuré pour : o constituer la base de données d’entraînement à partir de signatures sonores calculées par le calculateur local (202-1 ) ; o entraîner de manière supervisée le réseau de neurones artificiels sur la base de données d’entraînement constituée.
[Revendication 9] Système (200) selon la revendication 8, comprenant en outre au moins un dispositif de stockage (203) configuré pour stocker chaque signal sonore non bruité enregistré.
[Revendication 10] Système selon la revendication 8 ou 9, comprenant une pluralité de microphones (101 ) indépendants ou couplés.
[Revendication 1 1 ] Système selon l’une quelconque des revendications 8 à 10, comportant un calculateur local (202-1 ) par microphone (201 ). [Revendication 12] Système selon l’une quelconque des revendications 8 à 11 , dans lequel le calculateur local (202-1 ) et le calculateur central (202-2) correspondent à un unique calculateur (202). [Revendication 13] Produit-programme d’ordinateur comprenant des instructions qui, quand le programme est exécuté sur un ordinateur, conduisent celui-ci à mettre en oeuvre les étapes du procédé (100) selon l’une quelconque des revendications 1 à 7.
[Revendication 14] Support d'enregistrement lisible par ordinateur comprenant des instructions qui, lorsqu'elles sont exécutées par un ordinateur, conduisent celui-ci à mettre en oeuvre les étapes du procédé (100) selon l’une quelconque des revendications 1 à 7.
EP22793176.3A 2021-10-05 2022-10-03 Procédé d'analyse d'un signal sonore bruité pour la reconnaissance de mots clé de commande et d'un locuteur du signal sonore bruité analysé Pending EP4413563A1 (fr)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
FR2110510A FR3127839B1 (fr) 2021-10-05 2021-10-05 Procédé d’analyse d’un signal sonore bruité pour la reconnaissance de mots clé de commande et d’un locuteur du signal sonore bruité analysé
PCT/EP2022/077461 WO2023057384A1 (fr) 2021-10-05 2022-10-03 Procédé d'analyse d'un signal sonore bruité pour la reconnaissance de mots clé de commande et d'un locuteur du signal sonore bruité analysé

Publications (1)

Publication Number Publication Date
EP4413563A1 true EP4413563A1 (fr) 2024-08-14

Family

ID=78483395

Family Applications (1)

Application Number Title Priority Date Filing Date
EP22793176.3A Pending EP4413563A1 (fr) 2021-10-05 2022-10-03 Procédé d'analyse d'un signal sonore bruité pour la reconnaissance de mots clé de commande et d'un locuteur du signal sonore bruité analysé

Country Status (4)

Country Link
US (1) US20240296859A1 (fr)
EP (1) EP4413563A1 (fr)
FR (1) FR3127839B1 (fr)
WO (1) WO2023057384A1 (fr)

Families Citing this family (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
WO2022253003A1 (fr) * 2021-05-31 2022-12-08 华为技术有限公司 Procédé d'amélioration de la parole et dispositif associé
US12597434B2 (en) * 2021-11-09 2026-04-07 Dolby Laboratories Licensing Corporation Control of speech preservation in speech enhancement
US12586598B2 (en) * 2023-06-05 2026-03-24 Infineon Technologies Americas Corp. Audio distortion removal based on a set of reference audio samples

Family Cites Families (13)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US9432611B1 (en) * 2011-09-29 2016-08-30 Rockwell Collins, Inc. Voice radio tuning
KR102420518B1 (ko) * 2015-09-09 2022-07-13 삼성전자주식회사 자연어 처리 시스템, 자연어 처리 장치, 자연어 처리 방법 및 컴퓨터 판독가능 기록매체
US11693622B1 (en) * 2015-09-28 2023-07-04 Amazon Technologies, Inc. Context configurable keywords
US11373672B2 (en) * 2016-06-14 2022-06-28 The Trustees Of Columbia University In The City Of New York Systems and methods for speech separation and neural decoding of attentional selection in multi-speaker environments
EP4235645B1 (fr) * 2016-07-06 2025-01-29 DRNC Holdings, Inc. Système et procédé pour personnaliser des interfaces vocales pour maison intelligente à l'aide de profils vocaux personnalisés
US9990926B1 (en) * 2017-03-13 2018-06-05 Intel Corporation Passive enrollment method for speaker identification systems
US11775891B2 (en) * 2017-08-03 2023-10-03 Telepathy Labs, Inc. Omnichannel, intelligent, proactive virtual agent
US10757148B2 (en) * 2018-03-02 2020-08-25 Ricoh Company, Ltd. Conducting electronic meetings over computer networks using interactive whiteboard appliances and mobile devices
TWI719385B (zh) * 2019-01-11 2021-02-21 緯創資通股份有限公司 電子裝置及其語音指令辨識方法
US11276397B2 (en) * 2019-03-01 2022-03-15 DSP Concepts, Inc. Narrowband direction of arrival for full band beamformer
WO2021062705A1 (fr) * 2019-09-30 2021-04-08 大象声科(深圳)科技有限公司 Procédé de détection en temps réel de mot-clé de discours à canal monophonique résistant
US11798550B2 (en) * 2020-03-26 2023-10-24 Snap Inc. Speech-based selection of augmented reality content
US11881219B2 (en) * 2020-09-28 2024-01-23 Hill-Rom Services, Inc. Voice control in a healthcare facility

Also Published As

Publication number Publication date
WO2023057384A1 (fr) 2023-04-13
FR3127839A1 (fr) 2023-04-07
FR3127839B1 (fr) 2024-04-12
US20240296859A1 (en) 2024-09-05

Similar Documents

Publication Publication Date Title
EP4413563A1 (fr) Procédé d'analyse d'un signal sonore bruité pour la reconnaissance de mots clé de commande et d'un locuteur du signal sonore bruité analysé
KR102509464B1 (ko) 발언 분류기
KR102374519B1 (ko) 문맥상의 핫워드들
EP3234945B1 (fr) Affectation d'applications dans des systèmes basés sur la parole
US8635243B2 (en) Sending a communications header with voice recording to send metadata for use in speech recognition, formatting, and search mobile search application
US8949266B2 (en) Multiple web-based content category searching in mobile search application
CN110097870B (zh) 语音处理方法、装置、设备和存储介质
CN111460111A (zh) 评估自动对话服务的重新训练推荐
US20170148429A1 (en) Keyword detector and keyword detection method
US20110054899A1 (en) Command and control utilizing content information in a mobile voice-to-speech application
US20110054896A1 (en) Sending a communications header with voice recording to send metadata for use in speech recognition and formatting in mobile dictation application
US20110054895A1 (en) Utilizing user transmitted text to improve language model in mobile dictation application
US20110054900A1 (en) Hybrid command and control between resident and remote speech recognition facilities in a mobile voice-to-speech application
US20110060587A1 (en) Command and control utilizing ancillary information in a mobile voice-to-speech application
US20110054894A1 (en) Speech recognition through the collection of contact information in mobile dictation application
US20110054898A1 (en) Multiple web-based content search user interface in mobile search application
US20110054897A1 (en) Transmitting signal quality information in mobile dictation application
FR2743238A1 (fr) Dispositif de telecommunication reagissant a des ordres vocaux et procede d'utilisation de celui-ci
CN113889091A (zh) 语音识别方法、装置、计算机可读存储介质及电子设备
CN108877779B (zh) 用于检测语音尾点的方法和装置
EP3627510B1 (fr) Filtrage d'un signal sonore acquis par un systeme de reconnaissance vocale
CN116013370A (zh) 一种语音情感分类及合成方法、系统、装置及存储介质
CN119559941A (zh) 基于意图识别的智能打断语音机器人对话的方法及装置
US20250182773A1 (en) Methods and apparatuses for speech enhancement
CN113241061B (zh) 语音识别结果的处理方法、装置、电子设备和存储介质

Legal Events

Date Code Title Description
STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: UNKNOWN

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE INTERNATIONAL PUBLICATION HAS BEEN MADE

PUAI Public reference made under article 153(3) epc to a published international application that has entered the european phase

Free format text: ORIGINAL CODE: 0009012

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: REQUEST FOR EXAMINATION WAS MADE

17P Request for examination filed

Effective date: 20240412

AK Designated contracting states

Kind code of ref document: A1

Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC ME MK MT NL NO PL PT RO RS SE SI SK SM TR

DAV Request for validation of the european patent (deleted)
DAX Request for extension of the european patent (deleted)
STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: EXAMINATION IS IN PROGRESS

17Q First examination report despatched

Effective date: 20250908