EP4531677A1 - Procédé de test d'audiométrie vocale mettant en oeuvre une reconnaissance vocale et dispositif électronique associé - Google Patents

Procédé de test d'audiométrie vocale mettant en oeuvre une reconnaissance vocale et dispositif électronique associé

Info

Publication number
EP4531677A1
EP4531677A1 EP23731373.9A EP23731373A EP4531677A1 EP 4531677 A1 EP4531677 A1 EP 4531677A1 EP 23731373 A EP23731373 A EP 23731373A EP 4531677 A1 EP4531677 A1 EP 4531677A1
Authority
EP
European Patent Office
Prior art keywords
response
character string
patient
training
phoneme
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
EP23731373.9A
Other languages
German (de)
English (en)
Inventor
Nicolas WALLAERT
Hadrien JEAN
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
My Medical Assistant
Original Assignee
My Medical Assistant
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by My Medical Assistant filed Critical My Medical Assistant
Publication of EP4531677A1 publication Critical patent/EP4531677A1/fr
Pending legal-status Critical Current

Links

Classifications

    • AHUMAN NECESSITIES
    • A61MEDICAL OR VETERINARY SCIENCE; HYGIENE
    • A61BDIAGNOSIS; SURGERY; IDENTIFICATION
    • A61B5/00Measuring for diagnostic purposes; Identification of persons
    • A61B5/12Audiometering
    • A61B5/121Audiometering evaluating hearing capacity
    • A61B5/123Audiometering evaluating hearing capacity subjective methods
    • AHUMAN NECESSITIES
    • A61MEDICAL OR VETERINARY SCIENCE; HYGIENE
    • A61BDIAGNOSIS; SURGERY; IDENTIFICATION
    • A61B5/00Measuring for diagnostic purposes; Identification of persons
    • A61B5/48Other medical applications
    • A61B5/4803Speech analysis specially adapted for diagnostic purposes
    • AHUMAN NECESSITIES
    • A61MEDICAL OR VETERINARY SCIENCE; HYGIENE
    • A61BDIAGNOSIS; SURGERY; IDENTIFICATION
    • A61B5/00Measuring for diagnostic purposes; Identification of persons
    • A61B5/72Signal processing specially adapted for physiological signals or for diagnostic purposes
    • A61B5/7235Details of waveform analysis
    • A61B5/7264Classification of physiological signals or data, e.g. using neural networks, statistical classifiers, expert systems or fuzzy systems
    • A61B5/7267Classification of physiological signals or data, e.g. using neural networks, statistical classifiers, expert systems or fuzzy systems involving training the classification device

Definitions

  • the invention relates to a speech audiometry method.
  • Speech audiometry testing procedures carried out by an audiologist make it possible to determine a patient's audio perception of linguistic expressions, particularly words.
  • the recognition of the response is implemented by the audiologist or more generally a person (in other words: human), which requires the mobilization of a person throughout the duration of the test.
  • the training step is preferably repeated with at least several different second patients.
  • the training step is repeated (for example, at least 10,000 times) for, as input, less than 300 different expressions (and for example, more than 50 words) constituting lists, for different second patients.
  • these lists are Lafon's cochlear lists or Fournier's disyllabic lists;
  • the training step can be repeated for a greater number of words.
  • the first part is for example the neural network described in the article:
  • the data is for example an audio file (or part of an audio file) comprising the audio recording of the first response (for example in a format called "wav", in English for "Waveform Audio File Format” translated into French by the expression waveform audio format).
  • the first part is trained from labeled data.
  • the data is an image file, for example a spectrogram obtained from the first vocal response.
  • image file for example a spectrogram obtained from the first vocal response.
  • Input can be carried out using a keyboard or any other type of human-machine interface.
  • the first reception of a first response and/or the second reception of the second response is for example carried out by a microphone.
  • the artificial neural network can be implemented by the central unit which can have the architecture of a computer, a microprocessor and a microcontroller.
  • the hearing abilities of the first patient can be determined in a conventional manner.
  • the method is implemented for example by an electronic device.
  • the invention further relates to a computer program comprising instructions, executable by a microprocessor or a microcontroller, for implementing the method according to the invention, when the computer program is executed by a microprocessor or a microcontroller.
  • an element such as the electronic device, the central unit, or another element is "configured to” carry out a step or an operation, by the fact that the element comprises means for (in other words “is configured for” or “is suitable for”) to carry out the step or operation.
  • These are preferably electronic means, for example a computer program, data in memory and/or specialized electronic circuits.
  • the first part 430 is for example as described in the article:
  • the expression can consist of a single word or a single word and an article preceding this word (such as "the log") or a phrase.
  • the expression may include a logatom (i.e., a word without meaning) or be made up of logatoms.
  • patient 210 can respond “dru” when pronouncing this word.
  • Steps S90, S100, S110 and S120 can be repeated for different expressions for which the neural network 400 has been trained. Thus, the hearing of patient 200 is evaluated.
  • step S70' the character string "F” is received from the keyboard 160 by the central processing unit 110.
  • “F” indicates that the patient 210 sent an erroneous response, because "cru” is different from “dru". .
  • the character string “V” would indicate that patient 210 issued an accurate response.
  • the character string “FVV” can be received from the keyboard 160 by the central processing unit 110. “F” indicates that the patient 210 issued an incorrect response and “V” that the following phonemes are correct, because “c” is different from “d”.

Landscapes

  • Health & Medical Sciences (AREA)
  • Life Sciences & Earth Sciences (AREA)
  • Engineering & Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • Public Health (AREA)
  • Pathology (AREA)
  • Biophysics (AREA)
  • Biomedical Technology (AREA)
  • Heart & Thoracic Surgery (AREA)
  • Medical Informatics (AREA)
  • Molecular Biology (AREA)
  • Surgery (AREA)
  • Animal Behavior & Ethology (AREA)
  • General Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Veterinary Medicine (AREA)
  • Artificial Intelligence (AREA)
  • Evolutionary Computation (AREA)
  • Fuzzy Systems (AREA)
  • Mathematical Physics (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • Physiology (AREA)
  • Psychiatry (AREA)
  • Signal Processing (AREA)
  • Otolaryngology (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Measurement Of The Respiration, Hearing Ability, Form, And Blood Characteristics Of Living Organisms (AREA)
  • Pharmaceuticals Containing Other Organic And Inorganic Compounds (AREA)

Abstract

Procédé de test d'audiométrie vocale d'un premier patient (200) comprenant les étapes suivantes : -Première émission acoustique de l'enregistrement d'une expression linguistique comprenant au moins un phonème d'émission, -Première réception acoustique d'une première réponse vocale du premier patient à la première émission acoustique comprenant un moins un phonème de réponse, -Détermination, par un réseau de neurones artificiel comprenant une entrée et une sortie à partir d'une donnée en entrée obtenue à partir de la première réponse, d'une première chaine de caractères en sortie représentative du au moins un phonème de réponse, -Comparaison de la première chaine de caractères avec une deuxième chaine de caractère, représentative dudit au moins phonème d'entrée,

Description

    Procédé de test d’audiométrie vocale mettant en œuvre une reconnaissance vocale et dispositif électronique associé
  • L’invention concerne un procédé d’audiométrie vocale.
  • Les procédés de test d’audiométrie vocale menés par un audiologiste permettent de déterminer la perception audio par un patient d’expressions linguistiques notamment de mots.
  • Ces procédés comprennent :
    • L’émission acoustique d’un enregistrement d’une expression linguistique,
    • La réception acoustique et la reconnaissance de la réponse d’un premier patient, et
    • La comparaison de l’expression linguistique avec la réponse du patient.
  • La reconnaissance de la réponse est mise en œuvre par l’audiologiste ou plus généralement une personne (autrement dit : humain), ce qui nécessite la mobilisation d’une personne pendant toute la durée du test.
  • Pour remédier à cet inconvénient, l’invention concerne un procédé de test d’audiométrie vocale d’un premier patient comprenant les étapes suivantes :
    • Première émission acoustique d’un enregistrement d’une expression linguistique comprenant au moins un phonème d’émission (Le premier patient reproduit ensuite par la parole ce qu’il a entendu. Autrement dit il émet une première réponse vocale),
    • Première réception acoustique d’une première réponse vocale du premier patient à la première émission acoustique comprenant au moins un phonème de réponse,
    • Détermination, par un réseau de neurones artificiel comprenant une entrée et une sortie, à partir d’une donnée en entrée obtenue à partir de la première réponse, d’une première chaine de caractères en sortie représentative du au moins un phonème de réponse,
    • Comparaison de la première chaine de caractères avec une deuxième chaine de caractère, représentative dudit au moins phonème d’entrée (autrement dit : représentative dudit au moins un phonème d’émission),
  • Le réseau de neurones artificiel étant entrainé, préalablement à l’étape de détermination, par la mise en œuvre (ou la répétition) des étapes d’entrainement suivantes (et le procédé de test peut comprendre ces étapes) :
    • Deuxième émission acoustique de l’expression (Le deuxième patient mentionné ci-dessous reproduit ensuite par la parole ce qu’il a entendu. Autrement dit il émet une réponse vocale),
    • Deuxième réception acoustique d’une deuxième réponse vocale d’un deuxième patient à la deuxième émission acoustique, la deuxième réponse comprenant au moins un phonème d’entrainement (la deuxième réponse est alors par exemple enregistrée en mémoire, par exemple, dans un fichier audio),
    • Ecoute de la deuxième réponse par un humain (donc par exemple du fichier audio),
    • Réception d’une troisième chaine de caractères représentative du au moins phonème d’entrainement,
    • Entrainement supervisé du réseau de neurones artificiel à partir de la deuxième réponse en entrée étiquetée par la troisième chaine de caractère (i.e. : l’entrainement du réseau de neurones tend à ce que le réseau de neurones produise en sortie la troisième chaine de caractère lorsque la deuxième réponse est reçue en entrée).
  • Ainsi, le réseau de neurones permet d’automatiser l’acquisition de la réponse du patient. L’entrainement du réseau de neurones à partir de l’expression permet :
    • D’éviter une surinterprétation comme dans les réseaux de neurones de reconnaissance vocale classiques (i.e. : les réseaux de neurones classiques recherchent le mot de la langue le plus proche, même si le patient n’a pas répondu ce mot)
    • Le réseau est entrainé pour reconnaitre la réponse d’un patient, même lorsque le mot répondu par le patient n’est pas un mot de la langue. Puisque le réseau est entrainé durant des tests audiométriques vocaux, il reçoit des mots qui ne sont pas des mots de la langue (parce que les mots émis sont sans signification, ou parce que le patient répond avec une erreur).
  • Les étapes du procédé ci-dessus peuvent être répétées de manière à évaluer l’audition du premier patient, par exemple pour des mots différents en entrée (dans l’expression) pour lequel le réseau de neurones a été entrainé. L’intensité de l’émission acoustique peut varier durant cette répétition pour estimer les seuils d’intelligibilité vocale du patient.
  • Selon un mode de réalisation, l’expression est constituée d’un mot (ou plusieurs mots isolés) ou d’un mot (ou plusieurs mots) précédés d’un article isolé. En variante, l’expression est constituée de plus d’un mot (ou de plus de deux mots) ou d’une ou plusieurs phrases.
  • L’étape d’entrainement est préférentiellement répétée avec plusieurs deuxièmes patients différents au moins. Selon un mode de réalisation, l’étape d’entrainement est répétée (par exemple, au moins 10000 fois) pour, en entrée, moins de 300 expressions différentes (et par exemple, plus de 50 mots) constituant des listes, pour différents deuxièmes patients. Par exemple, ces listes sont les listes cochléaires de Lafon ou les listes dissyllabiques de Fournier ;
  • En variante, l’étape d’entrainement peut être répétée pour un nombre supérieur de mots.
  • Préférentiellement, les étapes d’entrainement (ou les étapes du procédé) sont répétées (par exemple au moins 10 000 fois) pour une série d’expressions différentes et/ou pour différents deuxièmes patients.
  • La série d’expressions différentes est constituée (ou comprend) de moins de 2000 expressions différentes, par exemple, de moins de 300 expressions différentes, (la série d’expressions différentes en comprenant par exemple au moins 10).
  • Par exemple, les étapes du procédé de test audiométrique sont répétées pour une partie de la série d’expressions.
  • Selon un mode de réalisation, tout ou partie des différents deuxièmes patients sont malentendants (ou le deuxième patient est malentendant). Un patient est malentendant si, par exemple, au moins l’une de ses oreilles présente une perte auditive moyenne de plus de 20 (ou 41 ou 71) décibels sur au moins une fréquence audiométrique, par exemple, égale à 500 hertz, 1 000 hertz, 2 000 hertz ou 4 000 hertz.
  • L’entrée du réseau de neurones peut être constitué de plusieurs expressions. Il est effet plus efficace de permettre au réseau de neurones de travailler sur plusieurs expressions en même temps.
  • Par exemple, le réseau de neurones comprend une première partie, comprenant une première série de couches du réseau de neurones, apte à produire un vecteur encodant la donnée en entrée, et une deuxième partie, comprenant au moins une couche du réseau de neurones, apte à produire la première chaine de caractères en sortie à partir du vecteur, la première partie étant pré-entrainé (et le procédé peut comprendre cette étape de pré-entrainement), préalablement aux étapes d’entrainement, à partir de plus de 10000 , au moins, expressions (ou mots) différentes (et d’au plus 10000000 d’expressions différentes ou mots différents) en entrée.
  • Selon un mode de réalisation, au moins une portion de la première partie (par exemple, connexe avec l’entrée) est à poids (i.e. : des connexions entre les couches) fixes durant l’étape d’entrainement. Le reste du réseau de neurones, en dehors de ladite au moins une portion, est modifié durant l’entrainement.
  • En variante toute la première partie peut être entrainée.
  • La première partie est par exemple le réseau de neurones décrit dans l’article :
  • Alexei Baevski, Yuhao Zhou, Abdelrahman-Mohamed, Michael Auli : «wav2vec 2.0 : A Framework for Self-Supervised Learning of Speech Représentations » NeurIPS 2020.
  • Selon un mode de réalisation, dans cette première partie, les poids, de l’encodeur convolutionnel (noté f) de l’article qui produit une représentation latente de l’entrée sont fixes durant l’étape d’entrainement. Le reste de la première partie, en particulier le transformeur (note g) est modifié lors de l’entrainement.
  • D’autres réseaux de neurones que celui présenté dans cet article sont bien entendu envisageables.
  • La donnée est par exemple un fichier audio (ou une partie d’un fichier audio) comprenant l’enregistrement audio de la première réponse (par exemple selon un format dit « wav », en Anglais pour «Waveform Audio File Format » traduit en français par l’expression  format audio de forme d’onde).
  • Selon un mode de réalisation, la première partie est pré-entrainée à partir d’une entrée tronquée (par exemple, on a supprimé certaines partie de l’enregistrement audio).
  • En variante, la première partie est entrainée à partir de données labélisées.
  • Ainsi, à la suite du pré-entrainement, la première partie est apte à encoder un fichier audio (ou des données audio) en entrée en un vecteur comportant une représentation de contexte.
  • En variante, la donnée est un fichier image, par exemple un spectrogramme obtenu à partir de la première réponse vocale. Une telle approche est par exemple présentée pour une reconnaissance vocale générale dans l’article suivant :
  • Zhang, Wei, et al. « Towards end-to-end speech recognition with deep multipath convolutional neural networks. » International Conference on Intelligent Robotics and Applications. Springer, Cham, 2019.
  • Par exemple, les étapes d’entrainement comportent l’étape suivante :
    • Saisie, par un clavier, de la troisième chaine de caractères par l’humain, suite à l’étape d’écoute.
  • La saisie peut être réalisée par un clavier ou tout autre type d’interface homme-machine.
  • Le dispositif électronique mémorise par exemple l’enregistrement de l’expression vocale en mémoire.
  • La première émission acoustique de l’enregistrement d’une expression linguistique peut par exemple être réalisée par un casque audio ou un haut-parleur.
  • La deuxième émission acoustique de l’enregistrement d’une expression linguistique peut par exemple être également réalisée par un casque audio ou un haut parleur.
  • La première réception d’une première réponse et/ou la deuxième réception de la deuxième réponse est par exemple réalisée par un microphone.
  • Le réseau de neurones artificiel est par exemple un réseau convolutionnel. La première partie peut comporter un transformer. Dans le cas où la première partie est le réseau de neurones présentée dans l’article Alexei Baevski et al. ci-dessus, la deuxième partie peut être constituée d’une seule couche de sortie comprenant tous les phonèmes contenus dans les listes (le vecteur de sortie indique quels phonèmes étaient en entrée).
  • Le réseau de neurones artificiels peut être mis en œuvre par l’unité centrale qui peut avoir l’architecture d’un ordinateur, d’un microprocesseur et d’un microcontrôleur.
  • Suite à la comparaison de la première chaine de caractères avec la deuxième chaine de caractère, les capacités auditives du premier patient peuvent être déterminées de manière conventionnelle.
  • L’écoute de la deuxième réponse peut être réalisée par un casque audio.
  • Chacun des casques audios ci-dessus peut être remplacé par un haut-parleur.
  • Le procédé est mis en œuvre par exemple par un dispositif électronique.
  • L’invention concerne donc aussi un dispositif électronique de test audiométrique configuré pour mettre en œuvre les étapes du procédé selon l’invention.
  • L’invention concerne en outre un programme d’ordinateur comprenant des instructions, exécutables par un microprocesseur ou un microcontrôleur, pour la mise en œuvre du procédé selon l’invention, lorsque le programme d’ordinateur est exécuté par un microprocesseur ou un microcontrôleur.
  • Les caractéristiques et avantages du dispositif électronique et du programme d’ordinateur sont identiques à ceux du procédé, c’est pourquoi, ils ne sont pas repris ici.
  • Selon une variante, l’invention concerne un procédé d’audiométrie vocale d’un premier patient comprenant les étapes suivantes :
    • Première émission acoustique d’un enregistrement d’une expression linguistique comprenant au moins un phonème d’émission (Le premier patient reproduit ensuite par la parole ce qu’il a entendu. Autrement dit il émet une réponse vocale),
    • Première réception acoustique d’une première réponse vocale du premier patient à la première émission acoustique comprenant au moins un phonème de réponse,
    • Détermination, par un réseau de neurones artificiel comprenant une entrée et une sortie, à partir d’une donnée en entrée obtenue à partir de la première réponse, d’une première chaine de caractères en sortie représentative d’une comparaison dudit au moins un phonème de réponse avec le au moins un phonème d’émission,
  • Le réseau de neurones artificiel étant entrainé, préalablement à l’étape de détermination, par la mise en œuvre (ou la répétition) des étapes d’entrainement suivantes (et le procédé de test peut comprendre ces étapes) :
    • Deuxième émission acoustique de l’expression (Le deuxième patient mentionné ci-dessous reproduit ensuite par la parole ce qu’il a entendu. Autrement dit il émet une deuxième réponse vocale),
    • Deuxième réception acoustique d’une deuxième réponse vocale d’un deuxième patient à la deuxième émission acoustique, la deuxième réponse comprenant au moins un phonème d’entrainement (la deuxième réponse est alors par exemple enregistrée en mémoire, par exemple, dans un fichier audio),
    • Réception d’une troisième chaine de caractères représentative d’une comparaison dudit au moins un phonème d’émission avec le au moins un phonème de d’entrainement,
    • Entrainement supervisé du réseau de neurones artificiel à partir de la deuxième réponse en entrée étiquetée par la troisième chaine de caractère (i.e. : l’entrainement du réseau de neurones tend à ce que le réseau de neurones produise en sortie la troisième chaine de caractère lorsque la deuxième réponse est reçue en entrée).
  • Les capacités auditives du premier patient peuvent être déterminées de manière conventionnelle à partir de la première chaine de caractère.
  • Par rapport au procédé de test d’audiométrie vocale, le procédé d’audiométrie vocale peut présenter l’avantage de ne pas nécessiter une réception du phonème d’entrainement, ce qui peut éviter, par exemple, une saisie durant l’entrainement suite à la deuxième réponse.
  • Les avantages et caractéristiques du procédé d’audiométrie vocale sont identiques à ceux du procédé de test d’audiométrie vocale ci-dessus (sans qu’il soit nécessaire de les répéter ici), mise à part concernant l’étape d’écoute et de comparaison.
  • L’invention concerne donc aussi un dispositif électronique audiométrique configuré pour mettre en œuvre les étapes du procédé d’audiométrie selon l’invention.
  • L’invention concerne en outre un programme d’ordinateur comprenant des instructions, exécutables par un microprocesseur ou un microcontrôleur, pour la mise en œuvre du procédé d’audiométrie vocale selon l’invention, lorsque le programme d’ordinateur est exécuté par un microprocesseur ou un microcontrôleur.
  • Les caractéristiques et avantages du dispositif électronique audiométrique et du programme d’ordinateur sont identiques à ceux du procédé d’audiométrie, c’est pourquoi, ils ne sont pas repris ici.
  • On entend qu’un élément tel que le dispositif électronique, l’unité centrale, ou un autre élément est « configuré pour » réaliser une étape ou une opération, par le fait que l’élément comporte des moyens pour (autrement dit « est conformé pour » ou « est adapté pour ») réaliser l’étape ou l’opération. Il s’agit préférentiellement de moyens électroniques, par exemple un programme d’ordinateur, des données en mémoire et/ou des circuits électroniques spécialisés.
  • Lorsqu’une étape ou une opération est réalisée ou mis en œuvre par un tel élément, cela implique généralement que l’élément comporte des moyens pour (autrement dit « est conformé pour » ou « est adapté pour ») réaliser l’étape ou l’opération. Il s’agit également par exemple de moyens électroniques, par exemple un programme d’ordinateur, des données en mémoire et/ou des circuits électroniques spécialisés.
  • D’autres caractéristiques et avantages de la présente invention apparaitront plus clairement à la lecture de la description détaillée qui suit comprenant des modes de réalisation de l’invention donnés à titre d’exemples nullement limitatifs et illustrés par les dessins annexés, dans lesquels :
  • représente un dispositif électronique selon un mode de réalisation de l’invention.
  • représente un réseau de neurones artificiel selon l’invention
  • représente le procédé selon l’invention, dans un premier exemple de réalisation, mis en œuvre par le dispositif électronique de la .
  • représente le procédé selon l’invention, dans un deuxième exemple de réalisation, mis en œuvre par le dispositif électronique de la .
  • Description détaillée d’un exemple de réalisation de l’invention
  • En référence à la , le réseau de neurones 400 comprend un première partie 430, comprenant une première série de couches du réseau de neurones, apte à produire un vecteur 450 encodant une donnée en entrée 410, et une deuxième partie 440, comprenant au moins une couche de neurones, apte à produire la première chaine de caractères en sortie 420 à partir du vecteur 450.
  • La donnée en entrée 410 est par exemple un fichier audio comprenant l’expression (par exemple selon un format dit « wav », en Anglais pour «Waveform Audio File Format » traduit en français par l’expression  format audio de forme d’onde).
  • Par exemple, le réseau de neurones 400 est mis en œuvre par l’unité centrale 110.
  • En référence aux figures 1, 2, 3, et 4, à l’étape S10, la première partie 430 est pré-entrainé, préalablement aux étapes d’entrainement ci-dessous, à partir de centaines d’heures de fichiers audio en entrée 410, comprenant plus de 10000 expressions linguistiques différentes (et d’au plus 10000000 de moins premiers mots différents).
  • Préférentiellement, il s’agit d’expressions quelconques d’un langage naturel.
  • Il s’agit d’un entrainement auto-supervisé.
  • L’entrée 410 est par exemple tronquées (par exemple, on a supprimé certaines parties du fichier audio).
  • La première partie 430 est par exemple tel que celui décrit dans l’article :
  • Alexei Baevski, Yuhao Zhou, Abdelrahman-Mohamed, Michael Auli : «wav2vec 2.0 : A Framework for Self-Supervised Learning of Speech Représentations » NeurIPS 2020.
  • Durant le pré-entrainement, par exemple, cette première partie 430 tente de prédire les parties tronquées de l’entrée 410 et/ou utilise un coût contractif (en anglais « constrative loss ») pour évaluer la performance et modifier les poids du réseau de neurones (Une fonction de coût quantifie l’erreur du réseau de neurones en comparaison de l’étiquette et représente le coût en fonction des combinaisons de paramètres du réseau de neurones).
  • Ainsi, à la suite du pré-entrainement, la première partie 430 est apte à encoder un fichier audio (ou des données audio) en entrée 410 en un vecteur 450 comportant une représentation des expressions linguistiques contenues dans le fichier audio.
  • Selon un mode de réalisation, dans cette première partie 430, les poids, de l’encodeur convolutionnel 431 (noté f) dans l’article Alexei Baevski et al. ci-dessus qui produit une représentation latente de l’entrée, sont fixes durant l’étape d’entrainement. Le reste 432 de la première partie 430, en particulier dans le transformeur (note g), dans l’article Alexei Baevski et al. ci-dessus, est modifié lors de l’entrainement.
  • La deuxième partie 440 peut être une seule couche de sortie comprenant tous les phonèmes contenus dans les listes (le vecteur de sortie indique quels phonèmes sont connnus). Un « softmax » et un « log » peuvent être appliqués à la sortie. Cette couche peut être linéaire, c’est-à-dire comportant une fonction d’activation linéaire.
  • A l’étape S20, le dispositif électronique 100 commande l’émission d’une expression linguistique par un casque 170.
  • L’expression linguistique est par exemple le mot « cru ».
  • L’expression peut être constituée d’un seul mot ou d’un seul mot et d’un article précédent ce mot (comme par exemple « le rondin ») ou d’une phrase.
  • L’expression peut comprendre un logatome (c’est-à-dire, un mot sans signification) ou être constitué de logatomes.
  • A l’étape S30, le patient 210 répond en reproduisant par la parole ce qu’il a entendu.
  • A l’étape S40, l’unité centrale 110 (qui a par exemple l’architecteur d’un ordinateur, d’un microprocesseur ou d’un microcontrôleur) reçoit la réponse vocale du patient, par l’intermédiaire du microphone 130 et l’enregistre en mémoire 111 sous la forme d’un fichier audio.
  • Par exemple, le patient 210 peut répondre « dru» en prononçant ce mot.
  • A l’étape S50, la réponse enregistrée est ensuite écoutée par l’opérateur humain 220 à l’aide du casque 180.
  • A l’étape S60, l’opérateur humain 220 saisi « dru » par le clavier 160 une chaine de caractères par l’opérateur 220.
  • A l’étape S70, la chaine de caractères « dru » est reçue du clavier 160 par l’unité centrale 110.
  • A l’étape S80, le réseau de neurone est entrainé à partir de la réponse enregistrée (sous la forme d’un fichier audio) en entrée 410 étiquetée par la chaine de caractère « dru ».
  • Selon un mode de réalisation, les étapes d’entrainement S20, S30, S40, S50, S60, S70 et S80 sont répétées (par exemple, au moins dix mil fois), pour des patients différents, pour une série d’expression différentes à la place de l’expression « cru ».
  • La série d’expressions différentes peut être constituée de moins de 300 expressions différentes ou moins de 2000 expressions différentes.
  • La série d’expression différentes peut être constituée par exemple des listes cochléaires de Lafon comprenant 20 listes de 17 mots, soit 340 expressions, numérotées de 1 à 20. La table 1 comporte un extrait de ces listes (plus précisément les listes 1 à 6).
  • Par exemple, les étapes S20, S30, S40, S50, S60, S70 et S80 peuvent être réalisées pour 6500 patients :
    • 3500 patients pour chaque mot des listes 1 à 5, puis
    • 1500 (autres) patients pour chaque mot des listes 6 à 10, puis
    • 2000 (autres) patients pour chaque mot des listes 11 à 15, puis pour
    • 2500 (autres) patients pour chaque mot des listes 16 à 20.
  • Liste 1 Liste 2  Liste 3)  Liste 4  Liste 5  Liste 6
    Buée
    Ride
    Foc
    Agis
    Vague
    Croc
    Lobe
    Mieux
    Natte
    Col
    Fort
    Soupe
    Tonte
    Vêle
    Nage
    Souche
    Rogne
    Bile
    Dros sage
    Gaine
    Fil
    Cru
    Boule
    Cale
    Bonne
    Rive
    Sol
    Tempe
    Fauve
    Phase
    Mule
    Chatte
    Règne
    Rôde
    Fente
    Tige
    Grain
    Cave
    Bulle
    Somme
    Maine
    Preux
    Bord
    Rouille
    Oser
    Site
    Bouée
    Sauve
    Chance
    Gagne
    Abbé
    Sud
    Fausse
    Joute
    Dague
    Acquis
    Ville
    Mare
    Noce
    Appas
    Route
    Cil
    Fete
    Veule
    Chaise
    Bache
    Souille
    Balle
    Soude
    Mur
    Nef
    Change
    Gage
    Trou
    Mal
    Tonne
    Peur
    Rampe
    Puce
    Cor
    Vite
    Rance
    Mouche
    Fille
    bille
    doute
    Bille
    Doute
    Faine
    Longe
    Gave
    Seul
    Ami
    Tasse
    Chene
    Pré
    Sur
    Crin
    Vol
    Front
    Ruse
    Louche
    Bagne
  • Sur les 10500 patients, 3000 peuvent être malentendants par exemple.
  • Pour l’entrainement, la fonction de coût utilisée est par exemple de type classification temporelle connexionniste.
  • A l’étape S90, un test audiométrique sur un patient 200 est initié par le dispositif électronique 100. Pour simplifier la description de ce mode de réalisation, le pré-entrainement, l’entrainement sur le patient 210, et le test audiométrique sur le patient 200 sont réalisés par le même dispositif électronique 100, mais de manière générale, le plus souvent, ces trois étapes sont réalisées par des dispositifs différents.
  • A l’étape S90, l’expression « cru » est émise par l’unité centrale 110 à l’aide du casque 120. L’expression peut être mémorisé en mémoire 111.
  • Le patient 200 peut répondre par exemple « dru» en prononçant ce mot.
  • A l’étape S100, l’unité centrale 110 reçoit la réponse vocale « dru » du patient par l’intermédiaire du microphone 130 et l’enregistre sur la forme d’un fichier audio.
  • A l’étape S110, le réseau de neurones 400, mis en œuvre par l’unité centrale 110, détermine en sortie 420 la chaine de caractère « dru » à partir de la réponse du patient 200 sous forme de fichier audio en entrée 410 du réseau de neurones 400.
  • A l’étape S120, « cru » est comparé avec « dru » pour évaluer l’audition du patient 200.
  • Les étapes S90, S100, S110 et S120 peuvent être répétées pour des expressions différentes pour lequel le réseau de neurones 400 a été entrainée. Ainsi, l’audition du patient 200 est évaluée.
  • Par exemple, les étapes S90, S100, S110 et S120 peuvent être répétées pour les autres mots de la liste 2 table 1.
  • Le réseau de neurones artificiel 400 est par exemple un réseau convolutionnel. La première partie 430 peut comporter un transformer.
  • La représente un deuxième exemple de réalisation du procédé selon l’invention. Dans ce deuxième exemple, les étapes respectivement S10’, S20’, S30’, S40’, S90’ et S100’ sont identiques aux étapes respectivement S10, S20, S30, S40. S90 et S100,
  • A l’étape S70’, la chaine de caractères « F » est reçue du clavier 160 par l’unité centrale 110. « F » indique que la patient 210 a émis une réponse erronée, car « cru » est différent de « dru ». La chaine de caractère « V » indiquerait que le patient 210 a émis une réponse exacte. Dans un autre exemple, la chaine de caractère « FVV » peut être reçu du clavier 160 par l’unité centrale 110. « F » indique que la patient 210 a émis une réponse erronée et « V » que les phonèmes suivants sont corrects, car « c » est différent de « d ».
  • A l’étape S80’, le réseau de neurone est entrainé à partir de la réponse enregistrée (sous la forme d’un fichier audio) en entrée 410 étiquetée par la chaine de caractère « F » ou « FVV »
  • Les étapes d’entrainement peuvent être répétées de la même manière que pour le premier exemple de la .
  • A l’étape S110’, pour évaluer l’audition du patient 200, le réseau de neurones 400, mis en œuvre par l’unité centrale 110, détermine en sortie 420 la chaine de caractère « F » ou « FVV » à partir de la réponse du patient 200 sous forme de fichier audio en entrée 410 du réseau de neurones 400.
  • Les étapes S90’, S100’, S110’ peuvent être répétées pour des expressions différentes pour lequel le réseau de neurones 400 a été entrainée. Ainsi, l’audition du patient 200 est évaluée.

Claims (15)

  1. Procédé de test d’audiométrie vocale d’un premier patient (200) comprenant les étapes suivantes :
    • Première émission acoustique (S90) d’un enregistrement d’une expression linguistique comprenant au moins un phonème d’émission,
    • Première réception acoustique (S100) d’une première réponse vocale du premier patient à la première émission acoustique comprenant un moins un phonème de réponse,
    • Détermination (S110), par un réseau de neurones artificiel (400) comprenant une entrée (410) et une sortie (420), à partir d’une donnée en entrée (410) obtenue à partir de la première réponse, d’une première chaine de caractères en sortie (420) représentative du au moins un phonème de réponse,
    • Comparaison (S120) de la première chaine de caractères avec une deuxième chaine de caractère, représentative dudit au moins phonème d’entrée,
    Le réseau de neurones artificiel (400) étant entrainé, préalablement à l’étape de détermination, par la mise en œuvre des étapes d’entrainement suivantes :
    • Deuxième émission acoustique (S20) de l’expression,
    • Deuxième réception acoustique (S30) d’une deuxième réponse vocale d’un deuxième patient (210) à la deuxième émission acoustique, la deuxième réponse comprenant au moins un phonème d’entrainement,
    • Réception d’une troisième chaine de caractères (S70) représentative du au moins phonème d’entrainement,
    • Entrainement supervisé (S80) du réseau de neurones artificiel (400) à partir de la deuxième réponse en entrée (410) étiquetée par la troisième chaine de caractère.
  2. Procédé de test d’audiométrie vocale selon la revendication 1 dans lequel l’expression est constituée d’un seul mot ou d’un seul mot et d’un article précédent ce mot.
  3. Procédé de test d’audiométrie vocale selon la revendication 1 dans lequel l’expression est constituée de plus d’un mot.
  4. Procédé de test d’audiométrie vocale selon l’une quelconque des revendications précédentes dans lequel le réseau de neurones (400) comprend une première partie (430), comprenant une première série de couches du réseau de neurones, apte à produire un vecteur (450) encodant la donnée en entrée (410), et une deuxième partie (440), comprenant au moins une couche de neurones, apte à produire la première chaine de caractères en sortie (420) à partir du vecteur (450).
  5. Procédé de test d’audiométrie vocale selon la revendication précédente dans lequel la première partie (430) est pré-entrainée, préalablement aux étapes d’entrainement, à partir de plus de 10000, mots différents.
  6. Procédé de test d’audiométrie vocale selon la revendication 4 ou 5 dans lequel la première partie (430) est pré-entrainée à partir d’une entrée (410) tronquée.
  7. Procédé de test d’audiométrie vocale selon l’une quelconque des revendications 4 à 6 dans lequel une portion de la première partie (430) est à poids fixes durant l’étape d’entrainement supervisé.
  8. Procédé de test d’audiométrie vocale selon l’une quelconque des revendications précédentes dans lequel la donnée est un fichier audio comprenant l’expression.
  9. Procédé de test d’audiométrie vocale selon l’une quelconque des revendications précédentes dans lequel les étapes d’entrainement comportent l’étape suivante :
    • Saisie, par un clavier, de la troisième chaine de caractères par un humain.
  10. Procédé de test d’audiométrie vocale selon l’une quelconques des revendications précédentes dans lequel les étapes d’entrainement sont répétées pour différents deuxièmes patients.
  11. Procédé de test d’audiométrie vocale selon la revendication précédente dans lequel tout ou partie des différents deuxièmes patients sont malentendants.
  12. Procédé de test d’audiométrie vocale selon l’une quelconques des revendications précédentes dans lequel les étapes d’entrainement sont répétées pour une série d’expression différentes.
  13. Procédé de test d’audiométrie vocale selon la revendication précédente dans lequel la série d’expressions différentes est constituée de moins de 2000 expressions différentes.
  14. Dispositif électronique (100) de test audiométrique configuré pour mettre en œuvre les étapes du procédé selon l’une quelconque des revendications 1 à 13.
  15. Programme d’ordinateur comprenant des instructions, exécutables par un microprocesseur ou un microcontrôleur, pour la mise en œuvre du procédé selon l’une quelconque des revendications 1 à 13, lorsque le programme d’ordinateur est exécuté par le microprocesseur ou le microcontrôleur.
EP23731373.9A 2022-05-25 2023-05-24 Procédé de test d'audiométrie vocale mettant en oeuvre une reconnaissance vocale et dispositif électronique associé Pending EP4531677A1 (fr)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
FR2205043A FR3135890A1 (fr) 2022-05-25 2022-05-25 Procédé de test d’audiométrie vocale mettant en œuvre une reconnaissance vocale et dispositif électronique associé
PCT/IB2023/055334 WO2023228103A1 (fr) 2022-05-25 2023-05-24 Procédé de test d'audiométrie vocale mettant en œuvre une reconnaissance vocale et dispositif électronique associé

Publications (1)

Publication Number Publication Date
EP4531677A1 true EP4531677A1 (fr) 2025-04-09

Family

ID=84053202

Family Applications (1)

Application Number Title Priority Date Filing Date
EP23731373.9A Pending EP4531677A1 (fr) 2022-05-25 2023-05-24 Procédé de test d'audiométrie vocale mettant en oeuvre une reconnaissance vocale et dispositif électronique associé

Country Status (4)

Country Link
EP (1) EP4531677A1 (fr)
CA (1) CA3256395A1 (fr)
FR (1) FR3135890A1 (fr)
WO (1) WO2023228103A1 (fr)

Family Cites Families (4)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US9363614B2 (en) * 2014-02-27 2016-06-07 Widex A/S Method of fitting a hearing aid system and a hearing aid fitting system
WO2017165551A1 (fr) * 2016-03-22 2017-09-28 Sri International Systèmes et procédés de reconnaissance vocale dans des conditions de canal invisible et bruyante
KR20210074632A (ko) * 2019-12-12 2021-06-22 엘지전자 주식회사 음소 기반 자연어 처리
RU2743049C1 (ru) * 2020-09-07 2021-02-15 Общество С Ограниченной Ответственностью "Центр Коррекции Слуха И Речи "Мелфон" (Ооо "Цкср "Мелфон") Способ доврачебной оценки качества распознавания речи, скрининговой аудиометрии и программно-аппаратный комплекс, его реализующий

Also Published As

Publication number Publication date
WO2023228103A1 (fr) 2023-11-30
CA3256395A1 (fr) 2023-11-30
FR3135890A1 (fr) 2023-12-01

Similar Documents

Publication Publication Date Title
US11856369B1 (en) Methods and systems implementing phonologically-trained computer-assisted hearing aids
US12603087B2 (en) Voice recognition using accelerometers for sensing bone conduction
CN107053186B (zh) 对话装置、机器人、对话方法以及存储介质
KR102803661B1 (ko) 통화들 및 오디오 메시지들로부터 다른 화자들의 음성 필터링
US10825353B2 (en) Device for enhancement of language processing in autism spectrum disorders through modifying the auditory stream including an acoustic stimulus to reduce an acoustic detail characteristic while preserving a lexicality of the acoustics stimulus
US20200160881A1 (en) Language disorder diagnosis/screening
CN112530400A (zh) 基于深度学习的文本生成语音的方法、系统、装置及介质
WO2021035067A1 (fr) Mesure de la compétence linguistique à partir de données d'électroencéphalographie
GB2599928A (en) Apparatus and method for audio data analysis
WO2021171956A1 (fr) Dispositif d'identification de haut-parleur, procédé d'identification de haut-parleur et programme
WO2023228103A1 (fr) Procédé de test d'audiométrie vocale mettant en œuvre une reconnaissance vocale et dispositif électronique associé
Shekar et al. Development of CNN-based cochlear implant and normal hearing sound recognition models using natural and auralized environmental audio
US7340398B2 (en) Selective sampling for sound signal classification
FR2769117A1 (fr) Procede d'apprentissage dans un systeme de reconnaissance de parole
Ifukube Sound-based assistive technology
US11741989B2 (en) Non-verbal utterance detection apparatus, non-verbal utterance detection method, and program
WO2025198624A1 (fr) Gestion d'attention basée sur la détection de nom dans des systèmes de contrôle de bruit actif sur la base d'une segmentation acoustique automatisée
Ebel et al. Human speech recognition performance on the 1994 CSR spoke 10 corpus
Mclennan et al. A Comprehensive Approach to Specificity Effects in Spoken‐Word Recognition
EP1741092B1 (fr) Reconnaissance vocale par modelisation contextuelle d'unites vocales
Abavisani et al. Automatic estimation of intelligibility measure for consonants in speech
JP2021033215A (ja) 情報処理装置、情報処理方法及びプログラム
CN114999522B (zh) 基于说话人辅助信息的特定说话人语音提取方法及装置
Yilmaz et al. Speech reception threshold measurement using automatic speech recognition
KR20230168324A (ko) 청각 장애 대상의 듣기 발달 단계에 따른 청지각 훈련 시스템

Legal Events

Date Code Title Description
STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: UNKNOWN

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE INTERNATIONAL PUBLICATION HAS BEEN MADE

PUAI Public reference made under article 153(3) epc to a published international application that has entered the european phase

Free format text: ORIGINAL CODE: 0009012

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: REQUEST FOR EXAMINATION WAS MADE

17P Request for examination filed

Effective date: 20250102

AK Designated contracting states

Kind code of ref document: A1

Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC ME MK MT NL NO PL PT RO RS SE SI SK SM TR

DAX Request for extension of the european patent (deleted)
RAV Requested validation state of the european patent: fee paid

Extension state: MA

Effective date: 20250102

Extension state: TN

Effective date: 20250102