EP4627575A1 - Procede de caracterisation d'un filtre pour le traitement d'une voix d'un individu, dispositif de communication - Google Patents

Procede de caracterisation d'un filtre pour le traitement d'une voix d'un individu, dispositif de communication

Info

Publication number
EP4627575A1
EP4627575A1 EP23813732.7A EP23813732A EP4627575A1 EP 4627575 A1 EP4627575 A1 EP 4627575A1 EP 23813732 A EP23813732 A EP 23813732A EP 4627575 A1 EP4627575 A1 EP 4627575A1
Authority
EP
European Patent Office
Prior art keywords
signal
coefficients
voice
filter
model
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
EP23813732.7A
Other languages
German (de)
English (en)
Inventor
Jonas GUERCHE
Gabriel GUERCHE
Denis Efimov
Rosane USHIROBIRA
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
52 Hertz
Centre National de la Recherche Scientifique CNRS
Ecole Centrale de Lille
Institut National de Recherche en Informatique et en Automatique INRIA
Universite de Lille
Original Assignee
52 Hertz
Centre National de la Recherche Scientifique CNRS
Ecole Centrale de Lille
Institut National de Recherche en Informatique et en Automatique INRIA
Universite de Lille
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by 52 Hertz, Centre National de la Recherche Scientifique CNRS, Ecole Centrale de Lille, Institut National de Recherche en Informatique et en Automatique INRIA, Universite de Lille filed Critical 52 Hertz
Publication of EP4627575A1 publication Critical patent/EP4627575A1/fr
Pending legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L21/00Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
    • G10L21/02Speech enhancement, e.g. noise reduction or echo cancellation
    • G10L21/0316Speech enhancement, e.g. noise reduction or echo cancellation by changing the amplitude
    • G10L21/0364Speech enhancement, e.g. noise reduction or echo cancellation by changing the amplitude for improving intelligibility
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L21/00Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
    • G10L21/02Speech enhancement, e.g. noise reduction or echo cancellation
    • G10L21/0316Speech enhancement, e.g. noise reduction or echo cancellation by changing the amplitude
    • G10L21/0364Speech enhancement, e.g. noise reduction or echo cancellation by changing the amplitude for improving intelligibility
    • G10L2021/03643Diver speech

Definitions

  • the invention relates to a method for processing and correcting an altered audio stream coming from an individual having, for example, a mouthpiece in their mouth allowing them to breathe underwater and comprising a microphone.
  • the field of the invention relates to methods implemented by a computer embedded in electronic equipment to be executed in real time, without an external connection and configured to make an audio stream distorted by the presence of an element held in place more intelligible. mouth.
  • a fault is that the signal captured is hardly intelligible due to the labial part of the mouthpiece preventing the user from moving their lips sufficiently. There is a need to reconstruct intelligible sound using a voice processing process.
  • the method is repeated for a plurality of acquisitions of first signals, each first acquired signal corresponding to the pronunciation of a new set of phonemes by the same subject, the calculation of the error and its minimization being carried out for each new first signal acquired.
  • An advantage is to carry out the method of the invention for a few phonemes, that is to say a few sentences to allow a filter to be characterized quickly.
  • An advantage is to allow rapid training of the algorithm from 3 or 4 sentences spoken by an individual.
  • the equipment can be quickly ready, configured and trained just before use, for example just before making a dive.
  • the system of differential equations is of the first order.
  • An advantage is the simplification of calculations and therefore the saving in calculation time.
  • the characterization method comprises:
  • the first model is a linear model and is written: where G, F and H are matrices whose coefficients are to be determined, the dimension of the matrix being determined by the order of the linear system of differential equations, y(t) is the signal that we seek to identify approaching the second signal, and x(t) is a state variable internal to the first model.
  • the model is a non-linear model and is written: where G, F and H are matrices whose coefficients are to be determined, the dimension of the matrix being determined by the order of the system of differential equations, NN designates a non-linear filter, y(t) is the signal that 'we seek to identify approaching the second signal, and x(t) is a state variable internal to the first model,
  • the calculation of the error minimization step is carried out from the implementation of a neural network whose coefficients are calculated by a regression to minimize the error.
  • An advantage is the simplicity and speed of learning.
  • the invention relates to a computer program product comprising a memory and a calculator for executing code instructions implementing the method of the invention.
  • An advantage is to allow characterization of a filter on any type of equipment, for example a smart phone, called a Smartphone, or any other mobile electronic equipment from which the characterization filter can be developed then transferred to a diving equipment.
  • the invention relates to a method of processing a voice of a given subject comprising:
  • the invention relates to a communication device comprising a mouthpiece intended to be worn in the mouth of a subject comprising:
  • a microphone to acquire an acoustic signal coming from the subject's voice; an electronic card comprising an audio filter, an analog-digital converter, a calculator for sampling the digitized signal, a memory for recording the coefficients of a filter to be applied to the sampled signal and a calculator for generating an output signal, said coefficients recorded being calculated from a method of the invention.
  • the invention relates to a first computer-implemented method for configuring a filter for processing and correcting an audio stream. This process is called the process of characterizing a filter for processing a voice.
  • the invention also relates to a second computer-implemented method intended to be embedded and executed in electronic equipment to communicate in particular underwater.
  • This second method implements a filter characterized by the first method.
  • first process can be executed before the second process or an alternative to the second process.
  • second process achieves the same end goal of processing the audio stream of a diver with a mouthpiece in their mouth as they speak to make it intelligible.
  • the invention also relates to the communication device forming an element of an underwater Walkie-Talkie system.
  • This is a voice communication device between divers.
  • This device generally includes a tip containing the electronics necessary to record and reproduce the sound.
  • the tip includes an electronic interface such as a cable allowing it to be connected to a housing.
  • An electronic card arranged in the housing includes components for recording the coefficients of the filter defining its characterization and for carrying out data processing and transmission and reception of the audio signal.
  • An advantage of the invention is to create a voice communication device for scuba diving with little or no modification to the diver's equipment. This constraint involves using a regulator tip as a means of receiving and emitting the audible sound signal. The voice being modified by the mouthpiece and its intelligibility thus being reduced, the invention makes it possible to recover part of the degraded intelligibility thanks to the filter which was characterized by the first process.
  • the microphone can be integrated into an elastic covering which can be protected by a protective wall arranged frontally on the microphone sensor.
  • the protective wall advantageously reduces the difficulties of integrating the microphone into the covering.
  • the mouthpiece 1 preferably comprises a labial portion 42.
  • the labial portion 42 is intended to be covered by the user's lips during use.
  • Said labial portion 42 comprises a light or lights allowing the passage of air on either side of the labial portion.
  • this light or these lights allow the passage of air from the channel of the regulator towards the mouth of the subject during use.
  • the labial portion 42 makes it possible to create with the user's lips a tight closure between the external environment and the air passage light(s).
  • the labial portion 42 extends between a breathing zone comprising the acoustic conduction plates 20 and a connection means 43.
  • the connection means 43 advantageously allows the mouthpiece to cooperate with a diving regulator.
  • the connection means 43 is of tubular shape whose walls are rigid or flexible.
  • Figures 1 and 2 relate more particularly to the steps of a process for processing a PROCi audio stream implementing a filter characterized by a method for characterizing the filter according to the invention.
  • the audio stream processed by the PROCi processing method is denoted SAG).
  • This audio stream is acquired and filtered using the Fi filter characterized by a first method of characterizing the CARAC-i filter.
  • the application of the Fi filter makes it possible to reconstruct part of the intelligibility lost by the presence of the EMi tip in an individual's mouth.
  • the invention therefore relates to a method denoted PROCi in Figure 2 which consists of applying APPi the filter Fi to an acquired input ACQo of an audio stream corresponding to the voice of an individual, the filter Fi being characterized by a first method denoted CARACi which is described below using Figures 3 and 4.
  • Figures 3 and 4 therefore relate more particularly to the stages of a CARACi characterization process of a filter from a few sequences spoken by a user with a mouthpiece in the mouth and the same sequences pronounced without a mouthpiece in the mouth. The filter is then used for the diver's equipment.
  • the audio streams processed by the CARACi characterization process of a Fi filter are denoted Si(t) and 82(f).
  • Figure 1 represents in particular the passage of the audio and sound flow in coding within different components.
  • Figure 1 represents the mouthpiece EM1, also denoted 1 in Figure 5, of an underwater communication device. It may include a portion to be held in the mouth, for example formed by two acoustic conduction plates 20.
  • the tip 1 preferably comprises a labial portion 42 and a connection 43 with, for example, a regulator (not shown). Openings 61 and 62 are preferably provided for the passage of air between the mouth and the regulator.
  • a MIC microphone (not shown in Figure 5) makes it possible to acquire the sounds produced by an individual speaking into the mouthpiece 1 before transmitting the signal to a CANi analog-digital converter.
  • the invention relates to any other mechanical architecture of a mouthpiece 1 intended to be connected to a regulator.
  • the device of the invention can include different variants, in particular on the number of channels envisaged, on the presence or not of acoustic conduction plates, their arrangement and their material.
  • a vibrating element 3 can be used to transcribe the audio emitted by another individual and thus allow listening by bone conduction.
  • another system could be used to transcribe the voice and its intelligibility which was processed by the process of the invention.
  • Figure 3 describes two branches of a process.
  • the first branch comprises a step ACQi of acquiring an incoming audio stream Si(t) comprising a first set of phonemes distorted by the mouthpiece 1.
  • the second branch comprises the acquisition of an incoming audio stream 82(f ) comprising the same set of phonemes defining a second audio stream not distorted by the presence of a mouthpiece 1.
  • the phonemes are the same and are preferentially acquired by the same user. Indeed, in order to allow learning and definition of the optimal filter coefficients, it is necessary to isolate as much as possible the influence of the deformation linked to the presence of tip 1 in the mouth.
  • the invention is particularly relevant in the case where the two sequences of phonemes are substantially the same. Learning will also be even more efficient when the same individual pronounces the two audio streams Si(t) and 82(f)
  • the phonemes can, for example, correspond to a few sentences to be pronounced with and without a mouthpiece 1.
  • the invention thus proposes an embodiment in which an individual pronounces two same groups of sentences with and without a tip.
  • Phonemes can correspond to a grouping of letters, syllables or sentences.
  • the two groups preferably include the same group of phonemes and the same ordering of these phonemes within the sequence pronounced by an individual, with and without a device.
  • the recording of the audio stream made with the mouthpiece is processed in particular by a differentiator.
  • the recording of the audio stream made without the mouthpiece is used as the desired output when creating the filter.
  • a differentiator of the invention may comprise a set of components for performing the mathematical operations of differentiation, i.e. providing an output proportional to the derivative of the input with respect to one or more variables.
  • the invention makes it possible to consider in the algorithm all of the pronounced sentences comprising a plurality of letters, syllables or sentences. In this case, they are all processed together.
  • each spoken sentence includes a plurality of letters, syllables and each sentence is processed independently of the others.
  • the sentences can be defined in such a way as to obtain a distribution of syllables most representative of the language that can be used in an underwater environment and in a given language.
  • the sentences selected for learning and characterizing the filter Fi comprise a representative sample of the different labials, in particular syllables comprising the following letters: B, P, M, F, V.
  • the sentences can be displayed on a display of the diving equipment so that the latter reads them.
  • the sentences are displayed on a display of an electronic terminal such as that of a Smartphone by means of a application allowing you to select a language.
  • CARACi characterization method can be carried out according to the embodiments directly on the diving equipment or on a Smartphone.
  • the filter is thus characterized from a Smartphone, different possibilities can be implemented to transfer the characterized filter to a memory of an electronic card placed on the diving equipment, such as the mouthpiece.
  • the display of sentences includes a cursor making it possible to indicate a reading speed.
  • the display may include graphic indications making it possible to indicate to a user a reading sequence with or without a mouthpiece in order to acquire the two sets of sentences.
  • a user can use an electronic terminal such as a Smartphone, that is to say a smart phone or any other arrangement comprising a microphone.
  • the two sequences of spoken sentences can be recorded using the microphone of the electronic terminal and transmitted to a remote server to carry out the method of the invention. According to this mode, the process is carried out remotely and can benefit from significant calculation resources.
  • the characteristics of the filter can be calculated by a remote server having significant calculation resources without hardware constraints linked to a particular mobile equipment.
  • the voice signal emitted by a user can be acquired by a mobile electronic device, such as a Smartphone, otherwise called a smart phone, and transmitted to a remote server.
  • the filter calculated by the remote server can then be re-transmitted to the Smartphone or on-board electronic diving equipment.
  • a user can use diving equipment comprising an electronic module comprising a computer and a memory.
  • learning is carried out using fewer resources than a server.
  • the algorithm is then optimized to be executed in a constrained environment.
  • An advantage is not needing a network connection, this case can be interesting in a sea diving environment, for example when you are on a boat far from the coast.
  • Another advantage is to use the microphone of the diving equipment.
  • learning will be all the more effective as it overcomes the gaps linked to differences in equipment between the equipment used for learning and that used for operating the characterized filter.
  • the filter can be calculated on an electronic terminal of the Smartphone type from a downloaded application making it possible to exploit the calculation resources of the electronic terminal.
  • a wireless connection can be provided allowing the loading of the filter Fi calculated by a resource other than that of the diving equipment so that it is recorded in a memory or a resource of said diving equipment.
  • the signal from the microphone with the mouthpiece arranged in the mouth of an individual is called the first signal If, the signal acquired by a microphone without the mouthpiece being arranged in the mouth of an individual is called the second signal S2.
  • These signals Si and S2 are acquired with the aim of characterizing an audio filter.
  • this microphone is the microphone of the diving equipment, for example that arranged in the part of the distal tip located between the part intended to be positioned in the mouth and the regulator.
  • the microphone is the microphone of an electronic terminal such as that of a smartphone type mobile telephone. In the latter case, an individual positions the mouthpiece 1 in the mouth and says the few sentences near the microphone of the electronic terminal to train the algorithm executed by the latter.
  • a Known corrective filter can be used to correct the signal acquired by the Smartphone.
  • the conversion and encoding advantageously include sampling of each signal.
  • an analog - digital conversion step is implemented and sampling is carried out of the acquired audio signal.
  • the first signal Si corresponding to the sentences pronounced with the mouthpiece in the mouth are sampled according to a first ECH1 sampling.
  • the sampling of the signals implemented in the CARAC1 characterization process of the filter F1 and in the PROC1 processing process can be identical, that is to say that the sampling frequency, the measurements carried out on the samples by grouping of the latter, considering time windows, are configured identically.
  • the invention could implement sampling specific to the characterization of the filter F1 and sampling specific to the process of processing the audio stream spoken by a diver.
  • the sampling frequencies could be different.
  • An advantage is to consume less information during the processing stages during a dive in which we wish to keep the communication link as long as possible while in the learning and characterization phase of the filter F1, more sampling fine, that is to say allowing more samples to be obtained, allows a more efficient F1 filter to be obtained.
  • sampling leading to the recording of digital values is configured for a high value of 96,000 samples per second.
  • a lower number of samples can make it possible to obtain very good results also with a value between 4000 and 8000 samples per second.
  • a number of sliding samples is kept in memory during real-time calculation cycles of the average values.
  • a number of samples of between 200 and 400 samples is kept for each real-time calculation cycle.
  • prior filtering can be carried out before sampling. This last filtering aims to eliminate noise or restrict the signal analysis band.
  • the invention comprises the implementation of a low-pass filter whose cutoff frequency depends on the sampling frequency.
  • a suitable filter makes it possible to filter the effect produced by the bubbles during breathing or when emitting a sound from the mouth of a diver.
  • the specific frequency can be filtered so as to improve intelligibility upstream of the construction of the characteristic filter Fi.
  • a selection of samples is chosen.
  • the selection of a set of samples amounts to choosing a set of time windows Tfi each comprising a subset of samples from which the average values will be calculated.
  • a step of calculating characteristic frequencies of the spectrum of the acquired signal can be carried out.
  • An advantage is to select a few frequencies comprising either the greatest signal intensities or the frequencies having the greatest spectral density, for example by considering the spectral power of the acquired signal. These selected frequencies make it possible to select an interval around the frequency to retain samples characteristic of the audio stream.
  • This method saves time and calculations and therefore makes it possible to embed the method of the invention in an electronic component on which learning can be carried out to define the characteristic filter Fi quickly.
  • characteristic frequencies can be configured to determine between 5 and 20 intervals around each frequency making it possible to define between 5 and 20 sample time windows.
  • Figure 6 represents an output Si (t) corresponding to the audio stream acquired with a tip and an output 82 (f) corresponding to the audio stream acquired without a tip.
  • the sentences made up of phonemes in each signal Si(t) and 82(f) are identical in this example.
  • the duration of the audio stream Si (t) is longer than the duration of the audio stream 82(f) due to the fact that the speaking speed is slowed down by the presence of the mouthpiece in mouth.
  • the method of the invention makes it possible to take into account in the model used the distortion of the sound induced by the speed of speech and therefore of the sound of the audio stream which is recorded and filtered.
  • An advantage of the invention is to take into consideration in the characterization of the filter the signal artifacts linked to the deformation of the signal induced by the change of speed and the acceleration of the sound pronounced by a diver.
  • the method of the invention is based on the implementation of a method based on the theory of homogeneity by the definition of a homogeneous differentiator. This method makes it possible to carry out a finite-time estimation of noisy signals.
  • An advantage of the method of the invention is that the algorithms implemented are simple, particularly fast and non-asymptotic in nature unlike traditional methods.
  • An advantage of such a method is to produce the derivative of a signal in a determined period of time, regardless of the complexity of the signal in question.
  • Finite-time homogeneous differentiators have the advantage of detecting rapid changes in a signal and other analyzes requiring the calculation of the derivative.
  • This method allows the estimation of the derivatives of the signal according to the chosen order by considering all of the sampled data. In order to smooth estimates and reduce artifacts linked to acquisition errors or the noisy signal, average values are calculated in order to make the method of the invention more robust.
  • the finite-time homogeneous differentiator calculates the differences between successive samples of the signal. According to one embodiment, the differentiator subtracts the current value possibly averaged from the sample from the previous value to obtain an approximation of the instantaneous derivative at this instant.
  • the method makes it possible to estimate ESTi a first set of values of data relating to the signal acquired over predefined time windows Tfi, each first window Tfi comprising a given number of samples of the signal.
  • the physical quantity relating to the acquired signal is the amplitude of the signal.
  • the method makes it possible to estimate the average values of the amplitude of the signal taken over a set of samples of a given time window.
  • the homogeneous finite-time differentiator includes a mechanism for managing transients, that is to say rapid changes in the signal which can cause approximation errors.
  • These mechanisms may include, for example, filters or interpolation techniques to smooth the results.
  • the method takes into consideration a value linked to the dynamics of the signal: its speed.
  • the method of the invention makes it possible to estimate EST 2 a second set of physical quantities relating to the dynamics of the signal.
  • the speed values of the first signal Si are estimated.
  • Speed refers to how quickly sentences are spoken.
  • a method called of the homogeneous finite-time differentiator DHT is implemented. The differentiator is applied to a plurality of first predefined time windows each comprising a set of samples.
  • the method takes into consideration another value linked to the dynamics of the signal: its acceleration.
  • the method of the invention makes it possible to estimate EST3 a third set of physical quantities relating to the dynamics of the signal.
  • the acceleration values of the first signal Si are estimated. Acceleration corresponds to variations in the speed with which sentences are spoken.
  • an equivalent method called the finite-time homogeneous differentiator DHT is also implemented. The differentiator is applied to a plurality of first predefined time windows each comprising a set of samples. The samples are preferably the same as those considered to estimate the speeds.
  • the invention therefore makes it possible to construct a filter receiving the signal Si and its derivatives as input and calculating an estimate of the signal S2.
  • the filter coefficients are trained to perform this transformation.
  • MA is defined by the following matrix:
  • the matrix MA, the vector C and the function Theta(t) are used to define the homogeneous differentiator in finite time.
  • the method includes a step of generating the filter coefficients as soon as one of the two conditions Ci or C2 is verified.
  • the succession of iteration steps corresponds to the learning step of the algorithm which results in producing filter coefficients making it possible to reconstruct the signal SB) from an input signal SAG) according to the processing method PROC1 of the invention.
  • a nonlinear MOD2 model can be used to implement the invention.
  • the transfer function W can be expressed otherwise using an equivalent representation in state space using the matrices G, F, H and a neural network block NN used to complement the linear model and to improve its accuracy.
  • the error is minimized by taking into consideration the nonlinear part NN.
  • filter F1 is a nonlinear filter.
  • a method for calculating the coefficients of the nonlinear filter F1 can be implemented using a neural network.
  • a forward propagation neural network is produced with the result obtained with the linear filter.
  • the invention comprises the implementation of a CNN type network, defining a convolutional neural network.
  • a conventional feedforward network with a hidden layer that uses sigmoidal activation functions achieves good learning performance.
  • learning also includes the phase of calculating the network coefficients by a regression carried out at each iteration.
  • neural networks can be used.
  • the method of the invention is based on the implementation of an algorithm allowing the calculation of coefficients integrating iterative phases comprising the calculation of an error.
  • This algorithm is called a “learning algorithm” or “learning function” insofar as it takes into account intermediate steps making it possible to converge towards a result leading to the construction of the characteristic filter F1.
  • an initial filter Fi is pre-trained and recorded in a device memory.
  • Such an initial filter Fi can be trained with different voice profiles such as female voice profiles, male voice profiles, child voice profiles.
  • Certain vocal range or timbre can be used to pre-train an initial Fi filter within the equipment.
  • An interest is to define initial coefficients making it possible to improve the convergence of the error below a given threshold during learning.
  • the CARACi characterization method of the invention can be used with a first configuration.
  • the first configuration can benefit from additional calculation resources, thus the order of the system can be increased, as well as the samples or even a greater number of training sentences can be available.
  • a non-linear model MOD2 can be used to define the initial filter Fi and one or the linear model can be used to train the model with the real voice of the diver.
  • the PROC1 processing method of the invention can be implemented to correct an error also during the diving phase, for example with supervised or unsupervised training.
  • a repeated sentence or a signal indicating poor understanding can be used to label model outputs in order to improve the construction of a filter F2 during the PROC1 processing process.
  • the method of the invention can comprise three successive trainings of the model or models which can be carried out at times spaced apart from each other.
  • a first training of the model makes it possible to define an initial filter Fi from a first configuration of the CARAC1 characterization process, for example with a preselected voice corresponding to a first signal 82(f).
  • a second training of the model makes it possible to define a characteristic filter F1 from a second configuration of the CARAC1 characterization process with the diver's voice corresponding to a second signal S2(t). This second training can be carried out with initial model coefficients which were calculated from the first training.
  • a third training can be carried out during communications using the PROCi processing process and automatic labeling of the outputs which can be deduced from the analysis of the audio stream of one or both divers, such as for example:
  • the mouthpiece 1 may comprise signal transmission means connected to the microphone 5 and/or the vibrating element 3.
  • the transmission means may comprise electronic cables and/or a conduction sheet. These transmission means can be at least partially integrated into an elastic covering.
  • FIG. 5 represents an example of an acoustic conduction plate 20 arranged so as to be bitten by the user wearing the mouthpiece 1.
  • the mouthpiece 1 comprises in in addition to a transducer type vibrating element.
  • the vibrating element is connected to the conduction plate so as to transmit vibrations from the vibrating element to the acoustic conduction plate.
  • the vibrating element 3 is configured to convert audio input to acoustic output and acoustically couple to the upper and/or lower teeth of the diver to conduct the acoustic output from the upper teeth of the diver through the skull to propagate the acoustic signal up to the diver's inner ear via the skull and jaw bones when the diver wears the tip in the mouth.
  • the acoustic conduction plate 20 is configured to acoustically engage and couple with the surface of the plunger teeth and is configured to conduct the vibrations of the vibrating element 3 in response to an electrical signal.
  • the vibration of the vibrating element 3 produces an acoustic output signal which is acoustically conducted to the diver's teeth, via the acoustic conduction plate, then through his jaw bones and skull to the inner ear , including the cochlea, where it is perceived as a sound.

Landscapes

  • Engineering & Computer Science (AREA)
  • Computational Linguistics (AREA)
  • Quality & Reliability (AREA)
  • Signal Processing (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Physics & Mathematics (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Circuit For Audible Band Transducer (AREA)
  • Telephone Function (AREA)
  • Telephonic Communication Services (AREA)

Abstract

Procédé de caractérisation d'un filtre (F1) pour le traitement d'une voix d'un sujet donné, ladite voix étant acquise par un micro agencé dans un embout buccal, ledit procédé comportant :10  Acquisition d'un premier signal correspondant à une voix d'un sujet déformée;  Acquisition d'un second signal correspondant à une voix d'un sujet non déformé;  Echantillonnage du premier signal;15  Estimation de valeurs moyennes de l'amplitude du premier signal;  Estimation de valeurs de vitesse du signal à partir d'une méthode du différenciateur homogène en temps-fini;  Calcul d'un premier ensemble de coefficients;20  Calcul d'une erreur entre un ensemble d'échantillons du second signal et les échantillons obtenus en sortie du premier modèle,  Itération(s) du calcul des coefficients du premier modèle.

Description

PROCEDE DE CARACTERISATION D’UN FILTRE POUR LE TRAITEMENT D’UNE VOIX D’UN INDIVIDU, DISPOSITIF DE COMMUNICATION
Domaine de l’invention
L’invention concerne un procédé pour traiter et corriger un flux audio altéré provenant d’un individu ayant par exemple en bouche un embout buccal lui permettant de respirer sous l’eau et comportant un micro. Le domaine de l’invention se rapporte aux procédés mis en œuvre par un ordinateur embarqué dans un équipement électronique pour être exécuté en temps réel, sans connexon extérieure et configurés pour rendre plus intelligible un flux audio déformé par la présence d’un élément maintenu en bouche.
État de la technique
On connait le document US2012/0213034 décrivant un embout buccal de détendeur à mettre dans la bouche et comprenant un microphone ainsi qu’un écouteur à conduction osseuse faisant vibrer un plateau de conduction acoustique pour faire passer le signal par les dents de l’utilisateur.
Un défaut est que le signal capté est peu intelligible du fait de la partie labiale de l’embout buccal empêchant l’utilisateur de bouger les lèvres de manière suffisante. Il existe un besoin de reconstruire un son intelligible à partir d’un procédé de traitement de la voix.
Un premier problème est que le flux audio dépend beaucoup de l’individu qui prononce les phrases qui sont déformées par la présence de l’embout. Un second problème est que certains algorithmes demandent des temps de calculs importants qui ne permettent pas d’obtenir un traitement en temps réel de la voix d’un individu, sur un système embarqué, rendant ainsi difficile la communication entre deux individus au moyen de ce type d’équipement. Tout au plus il est possible de récupérer la voix d’un nageur et de la traiter en différé.
L’invention propose un procédé mis en œuvre par ordinateur, notamment un ordinateur embarqué, tel qu’une unité de commande électronique, appelé MCU, un microprocesseur, un microcontrôleur ou un FPGA. Le procédé de l’invention permet la reconstruction et/ou la correction de certaines syllabes par un traitement en temps réel du flux audio acquis par un microphone situé au voisinage de la bouche d’un plongeur. Le procédé de l’invention permet notamment de transmettre ou de traiter en réception le flux audio afin qu’un autre plongeur puisse écouter de manière intelligible le flux audio émis par un premier plongeur.
Résumé de l’invention
Selon un premier aspect l’invention concerne un procédé de caractérisation d’un filtre pour le traitement d’une voix d’un sujet donné, ladite voix étant acquise par un micro agencé dans un dispositif d’aide à la respiration sous-marine destiné à être porté à proximité de la bouche d’un sujet, ledit procédé comportant :
■ Acquisition d’au moins un premier signal correspondant à la prononciation d’un premier ensemble de phonèmes par ledit sujet donné ; ledit premier signal correspondant à une voix d’un sujet acquise par le micro du dispositif d’aide à la respiration sous-marine lorsque ce dernier est porté par ledit sujet ;
■ Acquisition d’au moins un second signal correspondant à la prononciation du premier ensemble de phonèmes par ledit sujet ; ledit second signal correspondant à une voix d’un sujet acquise par un micro sans que le sujet porte un dispositif d’aide à la respiration sous-marine ;
■ Pour le premier signal, exécution des étapes suivantes :
■ Echantillonnage du premier signal ;
■ Estimation d’un premier ensemble de valeurs moyennes de l’amplitude du premier signal sur une pluralité de premières fenêtres prédéfinies, chaque première fenêtre comportant une pluralité d’échantillons du premier signal ;
■ Estimation d’un second ensemble de valeurs de vitesse du signal à partir d’une méthode du différenciateur homogène en temps-fini sur la pluralité de premières fenêtres prédéfinies ;
■ Calcul d’un premier ensemble de coefficients d’un système d’équations différentielles représentant un premier modèle dont les solutions sont le premier et le second ensemble de valeurs ; ■ Calcul d’une erreur entre au moins un ensemble d’échantillons du second signal et les échantillons obtenus en sortie du premier modèle exécuté avec des valeurs du premier signal et les coefficients estimés,
■ Itération(s) du calcul des coefficients du premier modèle en minimisant à chaque itération ladite erreur calculée, le nombre d’itérations étant configuré pour minimiser l’erreur en dessous d’un seuil prédéfini de manière à définir des coefficients d’exploitation, lesdits coefficients d’exploitation définissant les coefficients du filtre.
Un avantage est de permettre une caractérisation d’un filtre audio afin de reconstruire ensuite un son intelligible lorsqu’une voix est déformé par un embout buccal. Un avantage de la méthode de l’invention est de proposer un algorithme peu gourmand en puissance de calcul et en mémoire pour être implémenté sur un calculateur embarqué. Un autre avantage est de permettre un encodage en lignes de code simple et comportant un minimum de lignes de codes. Un autre avantage est de permettre un algorithme adaptatif à l’utilisateur et à son environnement.
Selon un mode de réalisation, le procédé de caractérisation comprend une étape de filtrage du premier signal réalisée préalablement à l’échantillonnage.
Un avantage est de permettre une caractérisation d’un filtre audio s’affranchissant des bruits, c’est-à-dire une caractérisation de la déformation induite de la voix du fait de l’équipement présent en bouche.
Selon un mode de réalisation, l’échantillonnage du premier signal comprend les étapes suivantes :
■ Analyse de la densité spectrale du signal afin de déterminer des seuils caractéristiques d’amplitude ou de puissance ;
■ Sélection d’un ensemble de fréquences caractéristiques pour lesquelles les seuils sont dépassés ;
■ Echantillonnage de segments du premier signal autour de chaque fréquence caractéristique ;
■ Génération d’un ensemble d’échantillons pour le traitement du premier signal. Un avantage est de focaliser les temps de calculs sur les zones d’intérêts de la voix, c’est à dire les fréquences caractéristiques de la voix d’un individu, notamment celle qui un maximum de signal utile.
Selon un mode de réalisation, l’échantillonnage produit entre 400 et 96000 échantillons pendant une 1 seconde.
Un intérêt est de permettre différents modes de fonctionnement selon si on souhaite privilégier le temps de calcul ou la qualité du signal.
Un échantillonnage à 4000 échantillons par seconde permet notamment de garder un spectre de la voix entre 300 Hz et 1300 Hz et réduire la puissance de calcul.
Selon un mode de réalisation, le procédé est répété pour une pluralité d’acquisitions de premiers signaux, chaque premier signal acquis correspondant à la prononciation d’un nouvel ensemble de phonèmes par le même sujet, le calcul de l’erreur et sa minimisation étant réalisés pour chaque nouveau premier signal acquis.
Un avantage est de réaliser le procédé de l’invention pour quelques phonèmes, c’est-à-dire quelques phrases pour permettre de caractériser un filtre rapidement. Un avantage est de permettre un entrainement rapide de l’algorithme à partir de 3 ou 4 phrases prononcées par un individu. Ainsi, l’équipement peut être rapidement prêt, configuré et entrainé juste avant son utilisation, par exemple juste avant de réaliser une plongée.
Selon un mode de réalisation, le système d’équations différentielles est du premier ordre.
Un avantage est la simplification des calculs et donc le gain en temps de calcul.
Selon un mode de réalisation, le procédé de caractérisation comprend :
■ Estimation d’un troisième ensemble de valeurs d’accélération du signal à partir de la méthode du différenciateur homogène en temps-fini sur la pluralité de premières fenêtres prédéfinies ;
■ Calcul d’un premier ensemble de coefficients d’un système d’équations différentielles du premier ordre représentant un premier modèle dont les solutions sont le premier et le second ensemble de valeurs. Un avantage est l’amélioration de la caractérisation du filtre permettant une meilleure reconstruction de la voie déformée d’un individu.
Selon un mode de réalisation, le procédé de caractérisation comprend :
■ Estimation d’un Nième ensemble de valeurs d’une dérivée d’ordre N du signal à partir de la méthode du différenciateur homogène en temps-fini sur la pluralité de premières fenêtres prédéfinies ;
■ Calcul d’un premier ensemble de coefficients d’un système d’équations différentielles du Nième ordre représentant un premier modèle dont les solutions sont le premier et le second ensemble de valeurs.
Un avantage est l’amélioration de la caractérisation du filtre permettant une meilleure reconstruction de la voie déformée d’un individu.
Selon un mode de réalisation, le premier modèle est un modèle linéaire et s’écrit : où G, F et H sont des matrices dont les coefficients sont à déterminer, la dimension de la matrice étant déterminée par l’ordre du système linéaire d’équations différentielles, y(t) est le signal qu’on cherche à identifier approchant le second signal, et x(t) est une variable d’état interne au premier modèle.
Selon un mode de réalisation, le modèle est un modèle non-linéaire et s’écrit : où G, F et H sont des matrices dont les coefficients sont à déterminer, la dimension de la matrice étant déterminée par l’ordre du système d’équations différentielles, NN désigne un filtre non-linéaire, y(t) est le signal qu’on cherche à identifier approchant le second signal, et x(t) est une variable d’état interne au premier modèle,
■ le procédé comportant en outre, un calcul d’un ensemble de coefficients d’un réseau de neurones à partir d’une régression configurée pour minimiser l’erreur. Ce modèle est un autre modèle que le modèle linéaire. Nous utilisons par la suite la notation de premier modèle pour désigner l’un et l’autre des deux modèles.
Selon un mode de réalisation, le calcul de l’étape de minimisation de l’erreur est réalisé à partir de la mise en œuvre d’un réseau de neurones dont les coefficients sont calculés par une régression pour minimiser l’erreur.
Un avantage est la simplicité et la rapidité de l’apprentissage.
Selon un mode de réalisation, à chaque itération une première condition est vérifiée, ladite première condition étant la vérification que l’erreur est inférieure à un seuil prédéfini et/ou qu’une seconde condition est vérifiée, ladite seconde condition étant la vérification qu’un nombre d’itérations prédéfini a été réalisé, le procédé comportant une étape de génération des coefficients du filtre dès qu’une des deux conditions est vérifiée.
Selon un autre aspect, l’invention concerne un produit programme d’ordinateur comportant une mémoire et un calculateur pour exécuter des instructions de codes mettant en œuvre le procédé de l’invention.
Un avantage est de permettre une caractérisation d’un filtre sur n’importe quel type d’équipement par exemple un téléphone intelligent, appelé Smartphone, ou encore tout autre équipement électronique mobile à partir duquel le filtre de caractérisation peut être élaboré puis transféré sur un équipement de plongée.
Selon un autre aspect, l’invention concerne un procédé de traitement d’une voix d’un sujet donné comprenant :
■ Acquisition d’un signal correspondant à une voix acquise par un micro agencé dans dispositif d’aide à la respiration sous-marine destiné à être porté dans la bouche d’un sujet, la voix acquise étant définie par un signal audio acquis en temps réel correspondant à une voix d’un sujet déformée par la présence de l’embout buccal en bouche ;
■ Application d’un premier modèle entrainé selon la méthode de caractérisation du filtre de l’invention, ladite application visant à obtenir un second signal de voix transformée à partir du premier signal de la voix déformée par un dispositif d’aide à la respiration sous-marine. Un avantage est d’équiper en avance des équipements avec une pré-configuration du filtre et d’adapter l’entrainement avec la voix d’un individu donné.
Selon un autre aspect, l’invention concerne un dispositif de communication comprenant un embout buccal destiné à être porté dans la bouche d’un sujet comprenant :
■ un micro pour acquérir un signal acoustique provenant de la voix du sujet ; une carte électronique comportant un filtre audio, un convertisseur analogique-numérique, un calculateur pour échantillonner le signal numérisé, une mémoire pour enregistrer les coefficients d’un filtre à appliquer au signal échantillonné et un calculateur permettant de générer un signal de sortie, lesdits coefficients enregistrés étant calculés à partir d’une méthode de l’invention.
Description de l’invention
L’invention se rapporte à un premier procédé mis en œuvre par ordinateur pour configurer un filtre de traitement et de correction d’un flux audio. Ce procédé est dénommé procédé de caractérisation d’un filtre pour le traitement d’une voix.
L’invention concerne également un second procédé mis en œuvre par ordinateur destiné à être embarqué et exécuté dans un équipement électronique pour communiquer notamment sous l’eau. Ce second procédé met en œuvre un filtre caractérisé par le premier procédé.
Ces deux procédés peuvent être exécutés l’un dans le prolongement de l’autre de manière successive ou de manière espacée dans le temps. Toutefois, on note que le premier procédé peut être exécuté au préalable du second procédé ou d’une alternative du second procédé. Néanmoins, il réalise le même objectif final de traiter le flux audio d’un plongeur ayant un embout buccal en bouche lorsqu’il s’exprime pour le rendre intelligible.
L’invention concerne également le dispositif de communication formant un élément d’un système de Talkie-Walkie sous-marin. Il s’agit d’un appareil de communication vocal entre plongeurs. Ce dispositif comporte généralement un embout contenant l’électronique nécessaire pour enregistrer et restituer le son. L’embout comporte une interface électronique telle qu’un câble lui permettant d’être relié à un boîtier. Une carte électronique agencée dans le boitier comprend des composants pour enregistrer les coefficients du filtre définissant sa caractérisation et pour réaliser les traitements de données et d’émission et de réception du signal audio.
Un intérêt de l’invention est de créer un appareil de communication vocale pour la plongée sous-marine en ne modifiant pas ou peu l’équipement du plongeur. Cette contrainte implique d’utiliser un embout de détendeur comme moyen de réception et d’émission du signal sonore audible. La voix étant modifiée par l’embout et son intelligibilité étant ainsi diminuée, l’invention permet de récupérer une partie de l’intelligibilité dégradée grâce au filtre qui a été caractérisé par le premier procédé.
Microphone
Selon un mode de réalisation, le micro peut être fixé sur une partie mécanique conduisant le flux d’air créé par la voix du plongeur, cette partie mécanique comprend au moins un canal ou une lumière s’étendant entre l’embout et le détendeur. Ainsi, selon différents modes de réalisation, le micro peut être fixé entre l’embout et le détendeur de manière à capter le flux audio prononcé par un plongeur. L’invention se rapporte à tous ces modes de réalisation.
Selon un autre exemple, le microphone peut être intégré dans un revêtement élastique peut être protégé par une paroi de protection agencée frontalement au capteur du microphone. La paroi de protection permet avantageusement de réduire les difficultés d’intégration du microphone dans le revêtement.
L’embout buccal 1 comprend préférentiellement une portion labiale 42. La portion labiale 42 est destinée à être recouverte par les lèvres de l’utilisateur pendant utilisation. Ladite portion labiale 42 comprend une lumière ou des lumières permettant le passage de l’air de part et d’autre de la portion labiale. Avantageusement, cette lumière ou ces lumières permet(tent) le passage de l’air depuis le canal du détendeur vers la bouche du sujet pendant utilisation. La portion labiale 42 permet de créer avec les lèvres de l’utilisateur une fermeture étanche entre l’environnement extérieur et la ou les lumière(s) de passage d’air. La portion labiale 42 s’étend entre une zone de respiration comprenant les plateaux de conduction acoustique 20 et un moyen de connexion 43. Le moyen de connexion 43 permet avantageusement de faire coopérer l’embout avec un détendeur de plongée. Selon un mode de réalisation, le moyen de connexion 43 est de forme tubulaire dont les parois sont rigides ou souples.
Procédé de caractérisation / procédé de traitement
Les figures 1 et 2 se rapportent plus particulièrement aux étapes d’un procédé de traitement d’un flux audio PROCi mettant en œuvre un filtre caractérisé par un procédé de caractérisation du filtre selon l’invention.
Le flux audio traité par le procédé de traitement PROCi est noté SAG). Ce flux audio est acquis et filtré grâce au filtre Fi caractérisé par un premier procédé de caractérisation du filtre CARAC-i. L’application du filtre Fi permet de reconstruire une partie de l’intelligibilité perdue par la présence de l’embout EMi en bouche d’un individu.
L’invention concerne donc un procédé noté PROCi sur la figure 2 qui consiste à appliquer APPi le filtre Fi à une entrée acquise ACQo d’un flux audio correspondant à la voix d’un individu, le filtre Fi étant caractérisé par un premier procédé noté CARACi qui est décrit ci-après grâce aux figures 3 et 4.
Les figures 3 et 4 se rapportent donc plus particulièrement aux étapes d’un procédé de caractérisation CARACi d’un filtre à partir de quelques séquences prononcées par un utilisateur ayant un embout en bouche et les mêmes séquences prononcés sans embout en bouche. Le filtre étant ensuite utilisé pour l’équipement du plongeur.
Les flux audio traités par le procédé de caractérisation CARACi d’un filtre Fi sont notés Si(t) et 82(f).
Le procédé CARAC1 comporte un apprentissage d’une fonction caractérisant le filtre afin d’être adapté pour corriger la déformation induite par la présence d’un embout en bouche et pour prendre en compte un type de voix, sa nature, sa tessiture, son timbre, etc.
La figure 1 représente notamment le passage du flux audio et son en codage au sein de différents composants. A cet effet, la figure 1 représente l’embout buccal EM1, noté également 1 sur la figure 5, d’un dispositif de communication sous-marine. Il peut comprendre une portion à maintenir en bouche par exemple formé par deux plateaux de conductions acoustiques 20. L’embout 1 comprend préférentiellement une portion labiale 42 et une connexion 43 avec par exemple un détendeur (non représenté). Des ouvertures 61 et 62 sont préférentiellement ménagées pour le passage de l’air entre la bouche et le détendeur. Un microphone MIC (non représenté sur la figure 5) permet d’acquérir les sons produits par un individu parlant dans l’embout buccal 1 avant de transmettre le signal à un convertisseur analogique numérique CANi. L’invention se rapporte à toute autre architecture mécanique d’un embout buccal 1 destiné à être raccordé à un détendeur. Notamment, le dispositif de l’invention peut comprendre différentes variantes, notamment sur le nombre de canaux envisagés, sur la présence ou non de plateaux de conductions acoustiques, leur disposition et leur matériau.
Dans l’exemple de la figure 5, un élément vibrant 3 peut être utilisé pour retranscrire l’audio émis par un autre individu et ainsi permettre une écoute par conduction osseuse. Un autre système pourrait toutefois être utilisé afin de retranscrire la voix et son intelligibilité qui a été traitée par le procédé de l’invention.
Phonèmes pour l’apprentissage
La figure 3 décrit deux branches d’un procédé. La première branche comprend une étape ACQi d’acquisition d’un flux audio entrant Si(t) comportant un premier ensemble de phonèmes déformé par l’embout buccal 1. La seconde branche comporte l’acquisition d’un flux audio entrant 82(f) comportant le même ensemble de phonèmes définissant un second flux audio non déformé par la présence d’un embout buccal 1 . Préférentiellement, les phonèmes sont les mêmes et sont préférentiellement acquis par le même utilisateur. En effet, afin de permettre un apprentissage et une définition des coefficients du filtre optimal, il est nécessaire d’isoler au maximum l’influence de la déformation liée à la présence de l’embout 1 en bouche. Ainsi, l’invention est particulièrement pertinente dans le cas où les deux séquences de phonèmes sont sensiblement les mêmes. L’apprentissage sera également d’autant plus performant lorsqu’un même individu prononcera les deux flux audio Si(t) et 82(f)
Les phonèmes peuvent par exemple correspondre à quelques phrases à prononcer avec et sans embout buccal 1 . L’invention propose ainsi un mode de réalisation dans lequel un individu prononce deux mêmes groupes de phrases avec et sans embout. Les phonèmes peuvent correspondre à un groupement de lettres, de syllabes ou de phrases. Les deux groupes comprennent préférentiellement un même groupe de phonèmes et un même ordonnancement de ces phonèmes au sein de la séquence prononcé par un individu, avec et sans appareil.
On comprend qu’un apprentissage d’un algorithme se basant sur quelques phrases prononcées, par exemple entre 1 et 10 phrases permet un apprentissage rapide pour l’utilisateur.
L'enregistrement du flux audio réalisé avec l’embout buccal est traité notamment par un différenciateur. L’enregistrement du flux audio réalisé sans l’embout buccal est utilisé comme la sortie souhaitée lors de la création du filtre.
Un différentiateur de l’invention peut comprendre un ensemble de composants pour effectuer les opérations mathématiques de différenciation, c'est-à-dire fournissant une sortie proportionnelle à la dérivée de l'entrée par rapport à une ou plusieurs variables.
Selon une première variante, l’invention permet de considérer dans l’algorithme l’ensemble des phrases prononcées comprenant une pluralité de lettres, syllabes ou phrases. Dans ce cas, elles sont toutes traitées ensemble.
Selon une seconde variante, l’invention permet de considérer chaque phrase dans l’algorithme de manière séquentielle et indépendante les unes des autres. Dans ce cas, chaque phrase prononcée comprend une pluralité de lettres, syllabes et chaque phrase est traitée indépendamment des autres.
Les phrases peuvent être définies de manière à obtenir une répartition de syllabes les plus représentatives du langage pouvant être utilisé dans un environnement sous-marin et dans une langue donnée.
Selon un exemple de réalisation, les phrases sélectionnées pour l’apprentissage et la caractérisation du filtre Fi comprennent un échantillon représentatif des différentes labiales, notamment des syllabes comprenant les lettres suivantes : B, P, M, F, V.
Selon un mode de réalisation, les phrases peuvent être affichées sur un afficheur de l’équipement de plongée de sorte que ce dernier les lise. Selon un autre exemple, les phrases sont affichées sur un afficheur d’un terminal électronique tel que celui d’un Smartphone au moyen d’une application permettant de sélectionner une langue. Ainsi, on comprend que le procédé de caractérisation CARACi peut être effectué selon les modes de réalisation directement sur l’équipement de plongée ou sur un Smartphone. Lorsque le filtre est ainsi caractérisé à partir d’un Smartphone, différentes possibilités peuvent être mises en œuvre pour transférer le filtre caractérisé sur une mémoire d’une carte électronique disposée sur l’équipement de plongée, telle que l’embout buccal.
Selon un mode de réalisation, l’affichage des phrases comprend un curseur permettant d’indiquer une vitesse de lecture. L’affichage peut comprendre des indications graphiques permettant d’indiquer à un utilisateur une séquence de lecture avec ou sans embout en bouche afin d’acquérir les deux ensembles de phrases.
Ressources de calculs du filtre F1
Afin de réaliser cette étape préliminaire, selon un premier mode de réalisation, un utilisateur peut utiliser un terminal électronique tel qu’un Smartphone, c’est-à-dire un téléphone intelligent ou tout autre disposition comportant un micro. Les deux séquences de phrases prononcées peuvent être enregistrées grâce au microphone du terminal électronique et être émises à un serveur distant pour réaliser le procédé de l’invention. Selon ce mode, le procédé est réalisé à distance et peut profiter de ressources de calculs importantes.
Notamment, selon un mode préféré, les caractéristiques du filtre peuvent être calculées par un serveur distant disposant de ressources de calculs importantes sans contraintes matérielles liées à un équipement mobile en particulier. A cet effet, le signal de la voix émise par un utilisateur peut être acquis par un dispositif électronique mobile, tel qu’un Smartphone, autrement appelé téléphone intelligent, et être transmis à un serveur distant. Le filtre calculé par le serveur distant peut dans un second temps être réémis vers le Smartphone ou l’équipement électronique embarqué de plongée.
Selon un second mode de réalisation, un utilisateur peut utiliser l’équipement de plongée comportant un module électronique comportant un calculateur et une mémoire. Dans ce cas de figure, l’apprentissage est réalisé à partir de ressources moins importantes qu’un serveur. L’algorithme est alors optimisé pour être exécuté dans un environnement contraint. Un avantage est de n’avoir pas besoin de connexion réseau, ce cas peut se révéler intéressant dans un environnement de plongée en mer par exemple lorsqu’on se situe sur un bateau loin des côtes. Un autre avantage est d’utiliser le micro de l’équipement de plongée. Ainsi, l’apprentissage sera d’autant plus efficace qu’il s’affranchira des écarts liés aux différences de matériels entre l’équipement servant pour l’apprentissage et celui utilisé pour l’exploitation du filtre caractérisé.
Selon un troisième mode de réalisation hybride, le filtre peut être calculé sur un terminal électronique de type Smartphone à partir d’une application téléchargée permettant d’exploiter les ressources de calculs du terminal électronique. Un intérêt est de réaliser le filtre avec un peu plus de ressources que le cas d’une carte électronique embarquée dans l’équipement de plongée tout en permettant de réaliser l’opération localement, c’est-à-dire sans mise en œuvre d’un serveur distant.
Lorsque l’opération est réalisée par un terminal électronique de type Smartphone, il peut être prévu une liaison sans fil permettant le chargement du filtre Fi calculé par une autre ressource que celle de l’équipement de plongée pour qu’il soit enregistré dans une mémoire ou une ressource dudit équipement de plongée.
Mode d’acquisition du signal audio
Le signal issu du micro avec l’embout buccal agencé dans la bouche d’un individu est dénommé le premier signal Si, le signal acquis par un micro sans que l’embout buccal soit agencé dans la bouche d’un individu est dénommé le second signal S2. Ces signaux Si et S2 sont acquis dans l’objectif de caractériser un filtre audio.
Préférentiellement, un même et unique micro est utilisé pour acquérir les deux signaux Si et S2. Ce mode de réalisation permet de s’affranchir des caractéristiques intrinsèques du micro et de l’influence de ce dernier sur le signal acquis. Selon un mode de réalisation, ce micro est le micro de l’équipement de plongé, par exemple celui agencé dans la partir de l’embout distal situé entre la partie destinée à être positionnée en bouche et le détendeur. Selon un autre mode de réalisation, le micro est le micro d’un terminal électronique tel que celui d’un téléphone mobile de type Smartphone. Dans ce dernier cas, un individu positionne l’embout buccal 1 en bouche et dit les quelques phrases à proximité du micro du terminal électronique pour entrainer l’algorithme exécuté par ce dernier. Selon un mode de réalisation, un filtre correctif connu peut être utilisé afin de corriger le signal acquis par le Smartphone.
D’autres modes de réalisation peuvent être mis en œuvre, notamment des modes impliquant l’utilisation des signaux acquis par des différents micros.
Selon un mode de réalisation, les deux signaux Si et S2 encodés numériquement après leur conversion dans un convertisseur analogique - numérique, appelée CAN. La conversion et l’encodage comprennent avantageusement un échantillonnage de chaque signal.
De la même manière lors de l’acquisition du signal dans le procédé de traitement utilisant un filtre caractérisé, une étape de conversion analogique - numérique est mise en œuvre et un échantillonnage est opéré du signal audio acquis.
Selon un mode de réalisation, le premier signal Si correspondant aux phrases prononcées avec l’embout buccal en bouche sont échantillonnés selon un premier échantillonnage ECH1. Les échantillonnages des signaux mis en œuvre dans le procédé de caractérisation CARAC1 du filtre F1 et dans le procédé de traitement PROC1 peuvent être identiques, c’est-à-dire que la fréquence d’échantillonnage, les mesures réalisées sur les échantillons par regroupement de ces derniers en considérant des fenêtres temporelles sont configurés identiquement. Toutefois, l’invention pourrait mettre en œuvre un échantillonnage propre à la caractérisation du filtre F1 et un échantillonnage propre au procédé de traitement du flux audio prononcé par un plongeur. Typiquement, dans ce mode de réalisation, les fréquences d’échantillonnage pourraient être différentes. Un intérêt est de consommer moins d’information lors des étapes de traitement lors d’une plongée dans laquelle on souhaite conserver le plus longtemps possible la liaison de communication alors que dans la phase d’apprentissage et de caractérisation du filtre F1, un échantillonnage plus fin, c’est-à-dire permettant d’obtenir plus d’échantillons permet d’obtenir un filtre F1 plus performant.
Selon un exemple de réalisation, un échantillonnage aboutissant à l’enregistrement de valeurs numériques est configuré pour une valeur haute à 96000 échantillons par seconde. Toutefois, un nombre d’échantillon plus faible peut permettre d’obtenir de très bons résultats également avec une valeur comprise entre 4000 et 8000 échantillons par seconde. Lors de l’acquisition du signal audio, un nombre d’échantillons glissants est conservé en mémoire pendant des cycles de calculs en temps réels des valeurs moyennes. Un nombre d’échantillons compris entre 200 et 400 échantillons est conservés à chaque cycle de calculs en temps réel.
Filtre passe-bande ou passe-bas additionnel
Selon un exemple de réalisation, un filtrage préalable peut être réalisé avant l’échantillonnage. Ce dernier filtrage a pour objectif d’éliminer un bruit ou de restreindre la bande d’analyse du signal.
Selon un exemple, l’invention comprend la mise en œuvre d’un filtre passe-bas dont la fréquence de coupure dépend de la fréquence d'échantillonnage. Selon un exemple de réalisation, un filtre adapté permet de filtrer l’effet produit par les bulles lors de la respiration ou lors d’émission d’un son par la bouche d’un plongeur. La fréquence spécifique peut être filtré de manière à améliorer l’intelligibilité en amont de la construction du filtre caractéristique Fi.
Sélection d’échantillons
Selon un exemple de réalisation, afin de diminuer le temps de calcul, une sélection d’échantillons est choisie. A cette fin, la sélection d’un ensemble d’échantillons revient à choisir un ensemble de fenêtres temporelles Tfi comportant chacune un sous ensemble d’échantillons à partir desquels les valeurs moyennes seront calculées.
Afin de sélectionner les meilleurs échantillons ou les meilleurs groupes d’échantillons pour définir un filtre caractéristique Fi performant, une étape de calcul de fréquences caractéristiques du spectre du signal acquis peut être réalisée. Un intérêt est de sélectionner quelques fréquences comportant soit les plus grandes intensités de signaux ou les fréquences ayant la grande densité spectrale, par exemple en considérant la puissance spectrale du signal acquis. Ces fréquences sélectionnées permettent de sélectionner un intervalle autour de la fréquence pour retenir des échantillons caractéristiques du flux audio.
Cette méthode permet un gain de temps et de calculs et permet donc d’embarquer le procédé de l’invention dans un composant électronique sur lequel l’apprentissage peut être réalisé pour définir le filtre caractéristique Fi rapidement. Selon un exemple entre 5 et 20 fréquences caractéristiques peuvent être configurés pour déterminer entre 5 et 20 intervalles autour de chaque fréquence permettant de définir entre 5 et 20 fenêtres temporelles d’échantillons.
Vitesse et accélération des sons prononcés
La figure 6 représente une sortie Si (t) correspondant au flux audio acquis avec un embout et une sortie 82(f) correspondant au flux audio acquis sans embout. On rappelle que les phrases constituées de phonèmes dans chaque signal Si(t) et 82(f) sont identiques dans cet exemple. On remarque sur le graphique de la figure 6 que la durée du flux audio Si (t) est plus longue que la durée du flux audio 82(f) du fait que la vitesse d’élocution est ralentie par la présence de l’embout en bouche.
Le procédé de l’invention permet de prendre en compte dans le modèle utilisé la déformation du son induite par la vitesse d’élocution et donc du son du flux audio qui est enregistrée et filtré.
Un intérêt de l’invention est de prendre en considération dans la caractérisation du filtre les artefacts du signal liés à la déformation du signal induite par le changement de vitesse et de l’accélération du son prononcé par un plongeur.
Estimation des grandeurs moyennes
Le procédé de l’invention s’appuie sur la mise en œuvre d’une méthode reposant sur la théorie de l’homogénéité par la définition d’un différentiateur homogène. Cette méthode permet de réaliser une estimation en temps fini de signaux bruités. Un avantage de la méthode de l’invention est que les algorithmes mis en œuvre sont simples, particulièrement rapides et de nature non asymptotique contrairement aux méthodes traditionnelles.
Un avantage d’une telle méthode est de produire la dérivée d'un signal en un laps de temps déterminé, quelle que soit la complexité du signal en question. Les différenciateurs homogènes en temps fini ont l’avantage d’une détection de changements rapides dans un signal et d'autres analyses nécessitant le calcul de la dérivée.
Cette méthode permet l’estimation des dérivées du signal selon l’ordre choisi en considérant l’ensemble des données échantillonnées. Afin de lisser les estimations et de réduire les artefacts liés à des erreurs d’acquisitions ou du signal bruité, des valeurs moyennes sont calculées afin de rendre le procédé de l’invention plus robuste.
Le différenciateur homogène en temps fini calcule les différences entre les échantillons successifs du signal. Selon un mode de réalisation, le différenciateur soustrait la valeur actuelle éventuellement moyennée de l'échantillon de la valeur précédente pour obtenir une approximation de la dérivée instantanée à cet instant.
Le procédé permet d’estimer ESTi un premier ensemble de valeurs d’une donnée relative au signal acquis sur des fenêtres de temps prédéfinies Tfi, chaque première fenêtre Tfi comportant un nombre donné d’échantillons du signal.
Selon un mode de réalisation, une normalisation temporelle est réalisée pour obtenir une approximation de la dérivée en unités de dérivée par rapport au temps. Le résultat obtenu du calcul des différences entre échantillons peut être normalisé en fonction de l'intervalle de temps entre les échantillons si ces derniers varient.
Ainsi, selon un exemple, la grandeur physique relative au signal acquis est l’amplitude du signal. Selon un mode de réalisation, le procédé permet d’estimer les valeurs moyennes de l’amplitude du signal prise sur un ensemble d’échantillon d’une fenêtre temporelle donnée.
D’autres grandeurs physiques peuvent être utilisées ou traitées selon le procédé de l’invention, toutefois le mode de réalisation si après détaillé est relatif autre traitement des valeurs moyennes des amplitudes du signal acquis.
Selon un mode de réalisation, le différenciateur homogène en temps fini inclut un mécanisme pour gérer les transitoires, c'est-à-dire les changements rapides dans le signal qui peuvent provoquer des erreurs d'approximation. Ces mécanismes peuvent inclure par exemple des filtres ou des techniques d'interpolation pour lisser les résultats.
Le procédé prend en considération une valeur liée à la dynamique du signal : sa vitesse. A cet effet, le procédé de l’invention permet d’estimer EST2 un second ensemble de grandeurs physiques relatif à la dynamique du signal. Selon un exemple, les valeurs de vitesse du premier signal Si sont estimées. La vitesse correspond à la rapidité avec laquelle les phrases sont prononcées. Afin de calculer la vitesse du premier signal Si , une méthode dite du différenciateur homogène en temps fini DHT est mise en œuvre. Le différenciateur est appliqué sur une pluralité de premières fenêtres temporelles prédéfinies comportant chacune un ensemble d’échantillons.
Selon un exemple amélioré, le procédé prend en considération une autre valeur liée à la dynamique du signal : son accélération. A cet effet, le procédé de l’invention permet d’estimer EST3 un troisième ensemble de grandeurs physiques relatif à la dynamique du signal. Selon un exemple, les valeurs d’accélération du premier signal Si sont estimées. L’accélération correspond aux variations de la vitesse avec laquelle les phrases sont prononcées. Afin de calculer l’accélération du premier signal Si , une méthode équivalente dite du différenciateur homogène en temps fini DHT est mise en œuvre également. Le différenciateur est appliqué sur une pluralité de premières fenêtres temporelles prédéfinies comportant chacune un ensemble d’échantillons. Les échantillons sont préférentiellement les mêmes que ceux considérés pour estimer les vitesses.
De la même manière, lors du procédé de traitement PROC1, les valeurs des dérivées et accélérations du signal en entrée SAG) qui est issue d’un signal correspondant à un flux audio d’un plongeur acquis avec un embout en bouche peuvent être calculées. Un intérêt est de générer le flux de sortie SB ) à partir du filtre F1 caractérisé par le procédé de caractérisation CARAC1 obtenu dans la phase d’apprentissage.
Modélisation du système dynamique
Le procédé de l’invention permet de définir un modèle basé sur la modélisation des systèmes dynamiques et de résoudre le problème posé par l’obtention d’une solution approchée en optimisant les calculs par itération en minimisant une erreur. L’erreur peut être définie par la connaissance de l’entrée du système et la sortie du système. Une problématique résolue par l’invention est de définir un modèle qui converge suffisamment rapidement pour définir un filtre F1 opérationnel et performant permettant de reconstruire par la suite le flux audio déformé par la présence de l’embout.
Le signal 82(f) désigne la voix normale en entrée qui n’a pas subi de déformation, et peut définir la sortie souhaitée du modèle. Le modèle de déformation de la voix du fait de la présence de l’embout peut être représenté par cette égalité : S^t) = W(p) ■ S2(t), où p est l’opérateur de différentiation par rapport à la variable temps, p = d/dt et W une fonction de transfert. Le signal 82(f) défini la sortie du système dynamique dans la phase d’apprentissage du modèle. Il convient donc de définir le problème inverse consistant à trouver 82(f) à partir de Si(t).
Le problème inverse revient à calculer la fonction inverse W-1 qui représente un modèle apprenant qu’on cherche à optimiser afin de calculer le signal SB ) représenté sur la figure 2 correspondant au flux audio corrigé lorsque le signal 82(f) connu ne sera plus disponible. Les premières séquences audio 82(f) permettent donc de réaliser un entrainement du modèle afin de paramétrer un filtre F1 audio entrainé, c’est-à-dire dont les coefficients ont été produits par un algorithme comportant une opération de régression ou d’itération visant à minimiser une erreur.
Les coefficients ainsi produits sont les coefficients d’exploitation permettant de définir un filtre F1 opérationnel.
L’invention permet donc de générer un « modèle appris » pour dans un second temps utiliser un filtre caractéristique F1 au sein de l’équipement pour corriger le flux audio déformé par la présence de l’embout en bouche.
Le problème inverse peut
L’invention permet donc de construire un filtre recevant le signal Si et ses dérivées en entrée et calculant une estimation du signal S2. Les coefficients du filtre sont entraînés afin de réaliser cette transformation.
Modèle linéaire
Ce qui peut s’écrire en termes de la théorie des systèmes dynamiques à l’équation suivante selon un modèle linéaire MOD1 où x(t) est une variable interne au système : x(t) = G ■ x(t) + F ■ Sl(t)
S2(t) = H ■ x(t) où les matrices G, F et H sont utilisées pour décrire la dynamique de déformation de la voix dans un modèle linéaire.
La fonction de transfert W peut être exprimée autrement en utilisant une représentation équivalente dans l'espace d'états en utilisant les matrices G, F, H. Le système définit ainsi le filtre.
Selon un mode de réalisation, afin de résoudre ce système, une première hypothèse est de considérer un signal suffisamment lisse 82(f) afin de considérer une fonction dérivable ayant un ensemble de dérivées constituant différents ordres de la fonction 82(f) = y(t) où y(t) est la sortie du modèle MODi ou MOD2. Ainsi, l’ensemble des dérivées, s’écrit [y(n)], « n » étant l’ordre la dérivée du signal échantillonné et étant supérieure ou égal à 1 .
La sortie recherchée peut être modélisée par un vecteur z défini par le système d’équations différentielles qu’on cherche à estimer :
Z = [yd), y(2) y(3) y(n-1)]T et y(n)(t) = Thêta(t)
Il s’agit de l’ensemble des dérivées premières, secondes, troisièmes et ainsi de suite jusqu’à la nième dérivée. Le nombre de dérivées considérées définies la dimension du système.
En considérant un ordre des dérivées retenues égal à 2 pour simplifier les calculs il est possible de définir un modèle MOD1 simple du système qui soit performant. La suite est décrite pour un ordre n afin d’illustrer un mode plus général de réalisation.
On peut définir le système équivalent suivant : z = MA ■ z + Phi(t)~ y = C - z
Dans laquelle MA est définie par la matrice suivante :
0 1 0 0 0
0 0 1 0 0
MA =
0 0 0 0 1
0 0 0 0 0
Et « C » est un vecteur défini par le vecteur suivant :
C = [1 , 0, 0 ... , 0]
Et est un vecteur défini par le vecteur suivant :
Phi(t) = [0, ... , Thêta(t)]T
La matrice MA, le vecteur C et la fonction Thêta(t) sont utilisés pour définir le différenciateur homogène en temps fini.
On note {x}a(pfta = |x|a(pfta ■ sign(x), où alpha est strictement supérieur à 0 et x est un réel.
Le différentiateur homogène en temps fini est défini par le système suivant pour i = 2, ... , n-1 : Où è est l
Les coefficients ki, kn forment un polynôme de Hurwitz. Un intérêt de l’utilisation d’un polynôme de Hurwitz est que ses coefficients assurent la stabilité du différenciateur. Le polynôme de Hurwitz est un polynôme à une variable à coefficients réels, dont les racines sont toutes à partie réelle strictement négative. L’utilisation d’un tel type de polynôme trouve un intérêt dans la résolution d’équations différentielles linéaires à coefficients constants, notamment pour l’analyse de la stabilité des systèmes dynamiques. Le différenciateur est utilisé pour générer les entrées pour le filtre.
Il est possible dans la résolution de ce système de choisir de manière appropriée pour assurer l’homogénéité du système les coefficients (ai, ... an) dans l’espace des réels strictement positifs de dimension n.
Selon un exemple, pour un A donné dans l’intervalle [1 - 1 /(n-1 ), 1 ], les séquences (n, ... , rn) et (ai, ... an) peuvent être choisi ainsi : ri = 1 - (i - 1) ■ A , avec 1 < i < n a t = 1 - i ■ A , avec 1 < i < n
Les coefficients (n, r2, ... , rn) et (ai, a2, ... , an) peuvent être déterminés dans l’espace vectoriel Rn en considérant des réels positifs. Rn est l’ensemble des n-uplets (xi, X2, ... , xn) avec (xi, X2, ... , xn) réels.
Le différenciateur est un système homogène qui peut être défini avec les poids « n », puis les coefficients « a » sont définis de la manière indiquée par la relation précédente.
De manière à assurer une convergence à temps fini, selon un exemple, la méthode peut être modélisée en prenant en compte les conditions nécessaires à la théorie de l’homogénéité. Dans ce cette hypothèse, il est possible d’écrire que y(i1)(t) = zj(t), j = 1 , ... , n après un temps fini des transitoires.
La dynamique des erreurs de différenciation prend la forme du système s
On connait, en ayant choisi les coefficients qui puissent définir un polynôme de Hurwitz qu’il existe A dans l’intervalle [1 -1 /(n-1 ), 1 ] suffisamment proche de 1 tel que l’équation (1 ) est globalement stable à temps fini.
L’un des principaux avantages des systèmes homogènes stables en temps fini est la rapidité de leur taux de convergence et leur robustesse par rapport à différentes perturbations.
En raison du terme Thêta(t), il est impossible d’obtenir la convergence de l’erreur à zéro sans avoir des connaissances supplémentaires sur ce signal Thêta(t). Ce problème peut être surmonté en supposant que y(t) est localement polynomial et que sur un petit intervalle de temps, Thêta(t) = 0. Dans ce cas, il est alors possible de récupérer les dérivées.
Selon un mode de réalisation, le procédé comportant un nombre d’itérations visant à répéter la séquence de calcul des coefficients jusqu’à ce qu’une erreur calculée soit inférieure à un seuil donné.
Afin de quantifier la performance des résultats obtenus avec l’algorithme final, une erreur est définie basée sur la norme de la différence des sons reconstruits et sons originels.
Selon un mode de réalisation, à chaque itération une première condition Ci est vérifiée. Selon un exemple la première condition Ci correspond à la vérification que l’erreur est inférieure à un seuil prédéfini. Selon un exemple, une seconde condition C2 est vérifiée. La seconde condition C2 est la vérification qu’un nombre d’itérations prédéfini a été réalisé.
Avantageusement, le procédé comporte une étape de génération des coefficients du filtre dès qu’une des deux conditions Ci ou C2 est vérifiée.
La succession des étapes d’itérations correspond à l’étape d’apprentissage de l’algorithme qui aboutit à produire des coefficients du filtre permettant de reconstruire le signal SB ) à partir d’un signal d’entrée SAG) selon le procédé de traitement PROC1 de l’invention.
Modèle non linéaire
Selon une alternative de réalisation, un modèle non linéaire MOD2 peut être utilisé pour mettre en œuvre l’invention. Le système définissant le filtre peut alors s’écrire ainsi : x(t) = G ■ x(t) + F ■ Sl(t)
S2(t) = H ■ x(t) + MV(x(t),Sl(t)) où NN désigne un filtre non-linéaire et les matrices G, F, H sont utilisés pour décrire la dynamique de déformation de la voix dans un modèle non linéaire.
La fonction de transfert W peut être exprimée autrement en utilisant une représentation équivalente dans l'espace d'états en utilisant les matrices G, F, H et un bloc de réseau neuronal NN utilisé pour compléter le modèle linéaire et pour améliorer sa précision.
Dans cette mise en œuvre le filtre Fi = NN correspond à une correction additionnelle qui permet de corriger l’erreur de modélisation du modèle linéaire. Dans ce cas, l’erreur est minimisée en prenant en considération la partie non linéaire NN.
Dans le cas d’une mise en œuvre d’un modèle non linéaire MOD2, le filtre F1 est un filtre non linéaire. Selon un exemple, une méthode de calcul des coefficients du filtre non linéaire F1 peut être mise en œuvre à partir d’un réseau de neurones. À cette fin, un réseau de neurones à propagation avant est produit avec le résultat obtenu avec le filtre linéaire. Selon un exemple, l’invention comprend la mise en œuvre d’un réseau de type CNN, définissant un réseau de neurones convolutif. Dans cet exemple de mise en œuvre, un réseau d'anticipation conventionnel avec une couche cachée qui utilise des fonctions d'activation sigmoïdales permet d’obtenir de bonnes performances d’apprentissage.
Dans le cas d’un filtre non linéaire, l’apprentissage comprend également la phase de calcul des coefficients du réseau par une régression effectué à chaque itération.
Selon d’autres exemples, d’autres réseaux de neurones peuvent être utilisés.
Le procédé de l’invention repose sur la mise en œuvre d’un algorithme permettant le calcul de coefficients intégrant des phases itératives comportant le calcul d’une erreur. Cet algorithme est dit « algorithme apprenant » ou « fonction apprenante » dans la mesure où il prend en compte des étapes intermédiaires permettant de converger vers un résultat aboutissant à la construction du filtre caractéristique F1.
Une fois le filtre F1 déterminé l’ensemble des paramètres du modèle MOD1 pour le modèle linéaire et du modèle MOD2 pour le modèle non linéaire sont déterminés. Les modèles peuvent ensuite être appliqués de manière à prédire la sorite SB ) sur la figure 2. Les figures 3 et 4 représentent l’étape de calcul de l’erreur er(t) à chaque itération à chaque en considérant S2(t) acquis directement et la sortie y(t) estimé.
Selon un mode de réalisation, un filtre initial Fi est pré-entrainé et enregistré dans une mémoire d’un équipement. Un tel filtre initial Fi peut être entrainé avec des profils de voix différents tels que des profils de voix de femme, de voix d’homme, voix d’enfant. Certains tessiture ou timbre de voix peuvent être utilisé pour pré-entrainé un filtre initial Fi au sein de l’équipement. Un intérêt est de définir des coefficients initiaux permettant d’améliorer la convergence de l’erreur en dessous d’un seuil donné lors de l’apprentissage.
Afin de définir un filtre initial Fi, la méthode de caractérisation CARACi de l’invention peut être utilisée avec une première configuration. La première configuration peut bénéficier de ressources de calculs supplémentaires, ainsi l’ordre du système peut être augmenté, ainsi que les échantillons ou encore on peut disposer d’un plus grand nombre de phrases d’entrainement. Dans cette configuration, un modèle non linéaire MOD2 peut être utilisé pour définir le filtre initial Fi et un ou le modèle linéaire peut être utilisé pour entrainer le modèle avec la véritable voix du plongeur.
Selon un autre mode de réalisation, le procédé de traitement PROC1 de l’invention peut être mis en œuvre pour corriger une erreur également pendant la phase de plongée par exemple avec un entrainement supervisé ou non supervisé.
Par exemple, une phrase répétée ou un signal indiquant une mauvaise compréhension peut être utilisé afin de labelliser des sorties du modèles afin d’améliorer la construction d’un filtre F2 lors du procédé de traitement PROC1.
Selon un exemple de réalisation, le procédé de l’invention peut comprendre trois entraînements successifs du modèle ou des modèles pouvant être réalisés à des moments espacés entre eux. Un premier entrainement du modèle permet de définir un filtre initial Fi à partir d’une première configuration du procédé de caractérisation CARAC1 par exemple avec une voix présélectionnée correspondant à un premier signal 82(f).
Un second entrainement du modèle permet de définir un filtre caractéristique F1 à partir d’une seconde configuration du procédé de caractérisation CARAC1 avec la voix du plongeur correspondant à un second signal S2(t). Ce second entrainement peut être réalisé avec des coefficients du modèle initiaux qui ont été calculés à partir du premier entrainement.
Enfin, un troisième entrainement peut être réalisé lors des communications en utilisant le procédé de traitement PROCi et une labellisation automatique des sorties qui peut être déduites de l’analyse du flux audio d’un ou des deux plongeurs, tels que par exemple :
- Les répétitions de phrases prononcées à des mêmes vitesses ou à des vitesses différentes ;
- L’identification de phrase prédéfinie telle que « pas compris », « je ne comprends pas », « peux-tu répéter », etc. ;
- Un changement de respiration ou une détection d’un taux de bulles ;
- Etc.
Conversion du signal filtré et transmis pour conduction osseuse
Selon un mode de réalisation, la sortie filtrée par le filtre Fi caractérisé par le procédé de caractérisation CARACi du filtre est transmise via une interface de communication sans fil à un autre dispositif de communication d’un autre nageur. Selon un exemple, la sortie audio filtrée est modulée sur une fréquence porteuse. L’invention est compatible de toute forme de transmission sans fil par voie électromagnétique telle qu’une liaison radio ou par émission d’ondes sonores ou ultrasonores. Différentes modulations peuvent être utilisées, que ce soit de la modulation de fréquence, d’amplitude. Selon un mode de réalisation, le signal audio filtré est transmis en étant modulé par une technique d’évasion de fréquences.
L’embout buccal 1 peut comprendre des moyens de transmission de signal connectés au microphone 5 et/ou à l’élément vibrant 3. Les moyens de transmission peuvent comprendre des câbles électroniques et/ou une nappe de conduction. Ces moyens de transmissions peuvent être au moins partiellement intégré dans un revêtement élastique.
Lorsque le signal transmis d’un équipement à l’autre est démodulé en réception, le signal audio peut être converti de manière faire vibrer un plateau de conduction osseuse. La figure 5 représente un exemple de plateau de conduction acoustique 20 agencé de manière à être mordu par l’utilisateur portant l’embout buccal 1. Selon cet exemple, l’embout buccal 1 comprend en outre un élément vibrant de type transducteur. L’élément vibrant est connecté au plateau de conduction de manière à transmettre les vibrations de l’élément vibrant au plateau de conduction acoustique.
L’élément vibrant 3 est configuré pour convertir une entrée audio en une sortie acoustique et se coupler acoustiquement aux dents supérieures et/ou inférieures du plongeur pour conduire la sortie acoustique des dents supérieures du plongeur à travers le crâne pour propager le signal acoustique jusqu’à l’oreille interne du plongeur via les os du crâne et de la mâchoire lorsque le plongeur porte l'embout dans la bouche.
Le plateau de conduction acoustique 20 est conçu et agencé pour se coupler acoustiquement aux dents supérieures de l’utilisateur pour conduire la sortie acoustique des dents supérieures du plongeur à travers le crâne jusqu'à la cochlée afin de générer un son audible dans au moins une des oreilles internes du plongeur lorsque le plongeur porte l'embout buccal 1.
Le plateau de conduction acoustique 20 est configuré pour s'engager et se coupler acoustiquement à la surface des dents du plongeur et est configuré pour conduire les vibrations de l’élément vibrant 3 en réponse à un signal électrique. La vibration de l’élément vibrant 3 produit un signal de sortie acoustique qui est conduit acoustiquement vers les dents du plongeur, via le plateau de conduction acoustique, puis à travers les os de sa mâchoire et de son crâne jusqu'à l'oreille interne, y compris la cochlée, où il est perçu comme un son.

Claims

REVENDICATIONS Procédé de caractérisation (CARAC-i) d’un filtre (Fi) pour le traitement (PROCi) d’une voix d’un sujet donné, ladite voix étant acquise par un micro agencé dans un dispositif d’aide à la respiration sous-marine destiné à être porté à proximité de la bouche d’un sujet, ledit procédé comportant :
■ Acquisition (ACQ1) d’au moins un premier signal (Si) correspondant à la prononciation d’un premier ensemble de phonèmes par ledit sujet donné; ledit premier signal (Si) correspondant à une voix d’un sujet acquise par le micro du dispositif d’aide à la respiration sous-marine lorsque ce dernier est porté par ledit sujet;
■ Acquisition (ACQ2) d’au moins un second signal (S2) correspondant à la prononciation du premier ensemble de phonèmes (PHR1) par ledit sujet; ledit second signal (S2) correspondant à une voix d’un sujet acquise par un micro sans que le sujet porte un dispositif d’aide à la respiration sous- marine;
■ Pour le premier signal (Si), exécution des étapes suivantes :
■ Echantillonnage (ECH1) du premier signal (Si) pour générer une pluralité d’échantillons à partir du premier signal (Si) ;
■ Estimation (EST1) d’un premier ensemble (ENS1) de valeurs moyennes de l’amplitude du premier signal (Si) sur une pluralité de premières fenêtres prédéfinies, chaque première fenêtre comportant une pluralité d’échantillons du premier signal (Si) ;
■ Estimation (EST2) d’un second ensemble (ENS2) de valeurs de vitesse du signal (Si) à partir d’une méthode du différenciateur homogène en temps-fini sur la pluralité de premières fenêtres prédéfinies;
■ Calcul (ESTF) d’un premier ensemble de coefficients d’un système d’équations différentielles représentant un premier modèle (MODi, MOD2) dont les solutions sont le premier et le second ensemble de valeurs (ENS1, ENS2) ;
■ Calcul d’une erreur (Er) entre au moins un ensemble d’échantillons du second signal (S2) et les échantillons obtenus en sortie du premier modèle (MOD1, MOD2) exécuté avec des valeurs du premier signal (Si) et les coefficients estimés (G, F, H),
■ Itération(s) du calcul des coefficients du premier modèle (MOD1, MOD2) en minimisant à chaque itération ladite erreur (Er) calculée, le nombre d’itérations étant configuré pour minimiser l’erreur en dessous d’un seuil prédéfini de manière à définir des coefficients d’exploitation, lesdits coefficients d’exploitation définissant les coefficients du filtre (F1).
2. Procédé de caractérisation selon la revendication 1 , caractérisé en ce qu’il comprend une étape de filtrage du premier signal (Si) réalisée préalablement à l’échantillonnage.
3. Procédé de caractérisation selon l’une quelconque des revendications 1 à 2, caractérisé en ce que l’échantillonnage du premier signal (Si) comprend les étapes suivantes :
■ Analyse de la densité spectrale du signal (Si) afin de déterminer des seuils caractéristiques d’amplitude ou de puissance ;
■ Sélection d’un ensemble de fréquences caractéristiques pour lesquelles lesdits seuils déterminés sont dépassés ;
■ Echantillonnage de segments du premier signal (Si) autour de chaque fréquence caractéristique sélectionnée ;
■ Génération d’un ensemble d’échantillons (ECH1) pour le traitement du premier signal (Si) à partir de chaque segment échantillonné.
4. Procédé de caractérisation selon l’une quelconque des revendications 1 à 3, caractérisé en ce que l’échantillonnage (ECH1) produit entre 400 et 96000 échantillons pendant une 1 seconde. Procédé de caractérisation selon l’une quelconque des revendications 1 à 4 caractérisé en ce que le procédé est répété pour une pluralité d’acquisitions de premiers signaux (Si), chaque premier signal (Si) acquis correspondant à la prononciation d’un nouvel ensemble de phonèmes par le même sujet, le calcul de l’erreur (Er) et sa minimisation étant réalisés pour chaque nouveau premier signal (Si) acquis. Procédé de caractérisation selon l’une quelconque des revendications 1 à 5 caractérisé en ce que le système d’équations différentielles est du premier ordre. Procédé de caractérisation selon l’une quelconque des revendications 1 à 6 caractérisé en ce qu’il comprend :
■ Estimation (EST3) d’un troisième ensemble (ENS3) de valeurs d’accélération du signal (Si) à partir de la méthode du différenciateur homogène en temps-fini sur la pluralité de premières fenêtres prédéfinies;
■ Calcul (ESTF) d’un premier ensemble de coefficients d’un système d’équations différentielles du premier ordre représentant un premier modèle (MOD1, MOD2) dont les solutions sont le premier et le second ensemble de valeurs (ENS1, ENS2, ENS3). Procédé de caractérisation selon l’une quelconque des revendications 1 à 7 caractérisé en ce qu’il comprend :
■ Estimation (ESTN) d’un Nième ensemble (ENSN) de valeurs d’une dérivée d’ordre N du signal (Si) à partir de la méthode du différenciateur homogène en temps-fini sur la pluralité de premières fenêtres prédéfinies ;
■ Calcul (ESTF) d’un premier ensemble de coefficients d’un système d’équations différentielles du Nième ordre représentant un premier modèle (MOD1, MOD2) dont les solutions sont le premier et le second ensemble de valeurs (ENS1, ENS2, ENSN). Procédé de caractérisation selon l’une quelconque des revendications 1 à 8 caractérisé en ce que le premier modèle est un modèle linéaire où G, F et H sont des matrices dont les coefficients sont à déterminer, la dimension de la matrice étant déterminée par l’ordre du système linéaire d’équations différentielles, y(t) est le signal qu’on cherche à identifier approchant le second signal (S2), et x(t) est une variable d’état interne au premier modèle (MOD1). Procédé de caractérisation selon l’une quelconque des revendications 1 à 8 caractérisé en ce que le premier modèle est un modèle non- linéaire
■ d
■ y où G, F et H sont des matrices dont les coefficients sont à déterminer, la dimension de la matrice étant déterminée par l’ordre du système d’équations différentielles, NN désigne un filtre non-linéaire, y(t) est le signal qu’on cherche à identifier approchant le second signal (S2), et x(t) est une variable d’état interne au premier modèle (MOD2),
■ le procédé comportant en outre, un calcul (ESTNN) d’un ensemble de coefficients d’un réseau de neurones à partir d’une régression configurée pour minimiser l’erreur (Er). Procédé de caractérisation selon l’une quelconque des revendications 1 à 10 caractérisé en ce que le calcul de l’étape de minimisation (ESTF, ESTNN) de l’erreur (Er) est réalisé à partir de la mise en œuvre d’un réseau de neurones dont les coefficients sont calculés par une régression pour minimiser l’erreur (Er). Procédé de caractérisation selon l’une quelconque des revendications 1 à 11 caractérisé en ce que à chaque itération une première condition est vérifiée, ladite première condition étant la vérification que l’erreur est inférieure à un seuil prédéfini et/ou qu’une seconde condition est vérifiée, ladite seconde condition étant la vérification qu’un nombre d’itérations prédéfini a été réalisé, le procédé comportant une étape de génération des coefficients du filtre dès qu’une des deux conditions est vérifiée. Procédé de traitement (PROCi) d’une voix d’un sujet donné comprenant :
■ Acquisition d’un signal (SAG)) correspondant à une voix acquise par un micro agencé dans dispositif d’aide à la respiration sous- marine destiné à être porté dans la bouche d’un sujet, la voix acquise étant définie par un signal audio acquis en temps réel (SA) correspondant à une voix d’un sujet déformée par la présence de l’embout buccal en bouche ;
■ Application (APPi) d’un premier modèle (MODi) entrainé selon la méthode de caractérisation du filtre (Fi) de l’une quelconque des revendications 1 à 12, ladite application (APPi) visant à obtenir un second signal (SB) de voix transformée à partir du premier signal (SA) de la voix déformée par un dispositif d’aide à la respiration sous-marine (EBi). Dispositif de communication comprenant un embout buccal (1 ) destiné à être porté dans la bouche d’un sujet comprenant :
■ un micro pour acquérir un signal acoustique provenant de la voix du sujet ; une carte électronique comportant un filtre audio, un convertisseur analogique-numérique, un calculateur pour échantillonner le signal numérisé, une mémoire pour enregistrer les coefficients d’un filtre (Fi ) à appliquer au signal échantillonné (SA(t)) et un calculateur permettant de générer un signal de sortie (SB(t)), lesdits coefficients enregistrés étant calculés à partir d’une méthode selon l’une quelconque des revendication 1 à 12. Produit programme d’ordinateur comprenant des instructions qui, lorsque le programme est exécuté par le dispositif de communication, conduisent ledit dispositif de communication à mettre en œuvre les étapes du procédé de l’une quelconque des revendications 1 à 12.
EP23813732.7A 2022-11-28 2023-11-28 Procede de caracterisation d'un filtre pour le traitement d'une voix d'un individu, dispositif de communication Pending EP4627575A1 (fr)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
FR2212450A FR3142639B1 (fr) 2022-11-28 2022-11-28 Procede de caracterisation d’un filtre pour le traitement d’une voix d’un individu, dispositif de communication
PCT/EP2023/083395 WO2024115504A1 (fr) 2022-11-28 2023-11-28 Procede de caracterisation d'un filtre pour le traitement d'une voix d'un individu, dispositif de communication

Publications (1)

Publication Number Publication Date
EP4627575A1 true EP4627575A1 (fr) 2025-10-08

Family

ID=86007125

Family Applications (1)

Application Number Title Priority Date Filing Date
EP23813732.7A Pending EP4627575A1 (fr) 2022-11-28 2023-11-28 Procede de caracterisation d'un filtre pour le traitement d'une voix d'un individu, dispositif de communication

Country Status (3)

Country Link
EP (1) EP4627575A1 (fr)
FR (1) FR3142639B1 (fr)
WO (1) WO2024115504A1 (fr)

Family Cites Families (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US7254535B2 (en) * 2004-06-30 2007-08-07 Motorola, Inc. Method and apparatus for equalizing a speech signal generated within a pressurized air delivery system
WO2012112811A2 (fr) 2011-02-18 2012-08-23 Incube Labs, Llc Appareil, système et procédé pour la signalisation sous-marine de messages audio à un plongeur
US20220199103A1 (en) * 2020-12-23 2022-06-23 Plantronics, Inc. Method and system for improving quality of degraded speech

Also Published As

Publication number Publication date
WO2024115504A1 (fr) 2024-06-06
FR3142639B1 (fr) 2024-11-29
FR3142639A1 (fr) 2024-05-31

Similar Documents

Publication Publication Date Title
CN110415687B (zh) 语音处理方法、装置、介质、电子设备
Liu et al. Deep neural network architectures for modulation classification
CN113053400B (zh) 音频信号降噪模型的训练方法、音频信号降噪方法及设备
JP3485508B2 (ja) 顔画像伝送方法およびシステムならびに当該システムで用いられる顔画像送信装置および顔画像再生装置
JP7636088B2 (ja) 音声強調方法、装置、機器及びコンピュータプログラム
EP0557166B1 (fr) Procédé de réduction de bruit acoustique dans un signal de parole
CN105139864B (zh) 语音识别方法和装置
EP1356461A1 (fr) Procede et dispositif de reduction de bruit
CN116030823B (zh) 一种语音信号处理方法、装置、计算机设备及存储介质
EP0932964A1 (fr) Procede et dispositif d&#39;egalisation aveugle des effets d&#39;un canal de transmission sur un signal de parole numerique
CN113571079A (zh) 语音增强方法、装置、设备及存储介质
AU2022321906A1 (en) Deciphering of detected silent speech
CN112767959A (zh) 语音增强方法、装置、设备及介质
WO2019232867A1 (fr) Procédé et appareil de discrimination vocale, et dispositif informatique et support de stockage
EP4627575A1 (fr) Procede de caracterisation d&#39;un filtre pour le traitement d&#39;une voix d&#39;un individu, dispositif de communication
KR102471709B1 (ko) 다자간 화상 회의 또는 화상 교육을 위한 노이즈 및 에코 제거 시스템과 그 방법
CN116825117B (zh) 一种具有隐私保护功能的麦克风及其隐私保护方法
Cai et al. Speech quality evaluation: A new application of digital watermarking
WO2020049263A1 (fr) Dispositif de rehaussement de la parole par implementation d&#39;un reseau de neurones dans le domaine temporel
FR2627887A1 (fr) Systeme de reconnaissance de parole et procede de formation de modeles pouvant etre utilise dans ce systeme
Ou et al. Concealing audio packet loss using frequency-consistent generative adversarial networks
CN115273873A (zh) 基于深度学习的语音增强方法及装置
CN113571081A (zh) 语音增强方法、装置、设备及存储介质
CN111883172A (zh) 用于音频丢包修复的神经网络训练方法、装置和系统
CN120544589B (zh) 语音数据丢失恢复处理方法、装置、设备及存储介质

Legal Events

Date Code Title Description
STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: UNKNOWN

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE INTERNATIONAL PUBLICATION HAS BEEN MADE

PUAI Public reference made under article 153(3) epc to a published international application that has entered the european phase

Free format text: ORIGINAL CODE: 0009012

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: REQUEST FOR EXAMINATION WAS MADE

17P Request for examination filed

Effective date: 20250620

AK Designated contracting states

Kind code of ref document: A1

Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC ME MK MT NL NO PL PT RO RS SE SI SK SM TR

DAV Request for validation of the european patent (deleted)
DAX Request for extension of the european patent (deleted)
STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: EXAMINATION IS IN PROGRESS

17Q First examination report despatched

Effective date: 20260306