EP4315328A1 - Estimation d'un masque optimise pour le traitement de donnees sonores acquises - Google Patents

Estimation d'un masque optimise pour le traitement de donnees sonores acquises

Info

Publication number
EP4315328A1
EP4315328A1 EP22714494.6A EP22714494A EP4315328A1 EP 4315328 A1 EP4315328 A1 EP 4315328A1 EP 22714494 A EP22714494 A EP 22714494A EP 4315328 A1 EP4315328 A1 EP 4315328A1
Authority
EP
European Patent Office
Prior art keywords
sound data
time
sound
mask
frequency
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Granted
Application number
EP22714494.6A
Other languages
German (de)
English (en)
Other versions
EP4315328B1 (fr
Inventor
Alexandre Guerin
Henrique TOMAZ-AMORIM
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Orange SA
Original Assignee
Orange SA
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Orange SA filed Critical Orange SA
Publication of EP4315328A1 publication Critical patent/EP4315328A1/fr
Application granted granted Critical
Publication of EP4315328B1 publication Critical patent/EP4315328B1/fr
Active legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L21/00Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
    • G10L21/02Speech enhancement, e.g. noise reduction or echo cancellation
    • G10L21/0208Noise filtering
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L21/00Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
    • G10L21/02Speech enhancement, e.g. noise reduction or echo cancellation
    • G10L21/0208Noise filtering
    • G10L21/0216Noise filtering characterised by the method used for estimating noise
    • G10L2021/02161Number of inputs available containing the signal or the noise to be suppressed
    • G10L2021/02166Microphone arrays; Beamforming

Definitions

  • This description relates to the processing of sound data, in particular in the context of distant sound recording.
  • Far-field sound recording occurs, for example, when a speaker is far from sound recording equipment.
  • it offers advantages manifested by real ergonomic comfort for the user to interact "hands-free" with a service in use: make a phone call, issue voice commands via "smartspeaker" type equipment (Google Home®, Amazon Echo®, etc.).
  • this distant sound recording induces certain artefacts: the reverberation and the surrounding noises appear amplified due to the remoteness of the user. These artefacts degrade the intelligibility of the speaker's voice, and consequently the functioning of the services. It appears that communication is more difficult, whether with a human or a voice recognition engine.
  • hands-free terminals such as smartspeakers or teleconferencing "octopuses" are generally equipped with a microphone antenna which makes it possible to enhance the useful signal by reducing these disturbances.
  • Antenna-based enhancement exploits the spatial information encoded during the multi-channel recording and specific to each source to discriminate the signal of interest from other noise sources.
  • a mask denoted (respectively is defined as a real, usually in the range [0; 1] , such as an estimate of the signal of interest (respectively noise n(t,f )) is obtained by simple multiplication of this mask with the observations x(t,f), i.e.:
  • a method for processing sound data acquired by a plurality of microphones is proposed, in which:
  • a direction of arrival of a sound coming from at least one acoustic source of interest is determined
  • a weighting mask is developed to be applied in the temp-frequency domain to the sound data acquired to construct an acoustic signal representing the sound coming from the source of interest and enhanced with respect to ambient noise.
  • the term "representative quantity" of a signal amplitude is understood here to mean the amplitude of the signal but also its energy or else its power, etc.
  • the aforementioned ratios can be estimated by dividing the amplitude (or energy, or power, etc.) of the signal represented by the filtered sound data by the amplitude (or energy, or power, etc. ) of the signal represented by the acquired (thus raw) sound data.
  • the weighting mask thus obtained is then representative, at each time-frequency point of the time-frequency domain, of a degree of preponderance of the acoustic source of interest, with respect to ambient noise.
  • the weighting mask can be estimated to directly build an acoustic signal representing the sound coming from the source of interest, and enhanced with respect to ambient noise, or even to calculate second spatial filters which can be more effective for reduce the noise more strongly than in the aforementioned case of a direct construction.
  • the aforementioned first spatial filtering (applied to the data acquired before estimating the ratios) can be of the “Delay and Sum” type.
  • the amplitude of the signals represents these phase shifts inherent in the distances between microphones.
  • this first spatial filtering can be of the MPDR type (for “Minimum Power Distortionless Response”). It has the advantage of better reducing the surrounding noise, while keeping the useful signal intact, and does not require any information other than the direction of arrival.
  • MPDR Maximum Power Distortionless Response
  • w MPDR the spatial filtering of the MPDR type
  • a s represents a vector defining the direction of arrival of the sound (or "steering vector")
  • R x is a spatial covariance matrix estimated at each time-frequency point (t,f) by a relation of kind :
  • - card is the “cardinal” operator
  • - x(t 1 ,f 1 ) is a vector representing the sound data acquired in the time-frequency domain
  • x(t 1 ,f 1 ) H is its Hermitian conjugate.
  • the method may optionally include a subsequent step of refining the weighting mask to denoise its estimate.
  • the estimation can be denoised by smoothing by applying, for example, local averages, defined heuristically.
  • this estimate can be denoised by defining an a priori mask distribution model.
  • the first approach makes it possible to keep complexity low, while the second approach, based on a model, obtains better performance, at the cost of increased complexity.
  • the elaborated weighting mask can be further refined by smoothing at each time-frequency point by applying a local statistical operator, calculated on a time-frequency neighborhood of the time-frequency point ( t,f ) considered.
  • This operator can take the form of an average, a Gaussian filter, a median filter, or other.
  • the elaborated weighting mask can also be refined by smoothing at each time-frequency point, by applying a probabilistic approach comprising:
  • the mask can be considered as a uniform random variable in an interval [0,1].
  • the probabilistic estimator of the mask M s (t, f) can for example be representative of a maximum likelihood, over a plurality of observations of a pair of variables, representing respectively: - an acoustic signal resulting from the application of the weighting mask to the data sound acquired, and
  • the purpose of these two embodiments is thus to refine the mask after its estimation.
  • the mask obtained (optionally refined) can be applied directly to the acquired data (raw, picked up by the microphones) or used to construct a second spatial filter to be applied to these acquired data.
  • the construction of the acoustic signal representing the sound coming from the source of interest and enhanced with respect to ambient noise may involve the application of a second spatial filtering, obtained from the weighting mask.
  • - x(t 1 ,f 1 ) is a vector representing the sound data acquired in the time-frequency domain, and x(t 1 ,f 1 ) H its Hermitian conjugate, and is the expression of the weighting mask in the domain time-frequency.
  • the second spatial filtering can be of the MWF type for
  • Multichannel Wiener Filter and in this case spatial covariance matrices R s and R n are estimated, respectively of the acoustic signal representing the sound from the source of interest, and of the ambient noise, the spatial filtering of the MWF type being given by : where: - ⁇ (t,f) is a neighborhood of a time-frequency point (t,f), - card is the “cardinal” operator,
  • - x(t 1 ,f 1 ) is a vector representing the sound data acquired in the time-frequency domain, and x(t 1 ,f 1 ) H its Hermitian conjugate, and is the expression of the weighting mask in the domain time-frequency.
  • the spatial covariance matrix R n above represents the “ambient noise”.
  • the latter may in reality comprise emissions from sound sources which have not, however, been retained as being the sound source of interest. Separate processing operations can be carried out for each source for which a direction of arrival has been detected (for example dynamically) and, in the processing for a given source, the emissions from the other sources are considered to form part of the noise.
  • the spatial filtering carried out of the MWF type for example, can be derived from the masking estimated for the most advantageous time-frequency points because the acoustic source of interest is preponderant there. It should also be noted that two joint optimizations can be carried out, one for the covariance R s of the acoustic signal involving the sought-after time-frequency mask M s and the other for the covariance R n of the ambient noise involving a mask M n linked to the noise (by then selecting time-frequency points at which the noise alone is preponderant).
  • the solution described above thus makes it possible, in general, to estimate in a time-frequency domain an optimal mask in the time-frequency points where the source of interest is preponderant, from the sole information of direction of arrival of the source of interest, without neural network input (either to apply the mask directly to the acquired data, or to construct a second spatial filtering to be applied to the acquired data).
  • This description also proposes a computer program comprising instructions for the implementation of all or part of a method as defined herein when this program is executed by a processor.
  • a non-transitory, computer-readable recording medium on which such a program is recorded is provided.
  • the present description also proposes a device comprising (as illustrated in FIG. 3) at least one interface for receiving (IN) sound data acquired by a plurality of microphones (MIC) and a processing circuit (PROC, MEM) configured to: - from the sound data acquired by the plurality of microphones, determine a direction of arrival of a sound from at least one acoustic source of interest,
  • a device comprising (as illustrated in FIG. 3) at least one interface for receiving (IN) sound data acquired by a plurality of microphones (MIC) and a processing circuit (PROC, MEM) configured to: - from the sound data acquired by the plurality of microphones, determine a direction of arrival of a sound from at least one acoustic source of interest,
  • the device may also comprise an output interface (reference OUT in FIG. 3) to deliver this acoustic signal.
  • This interface OUT can be connected to a voice recognition module for example to correctly interpret commands from a user, despite ambient noise, the acoustic signal delivered having then been processed according to the method presented above.
  • FIG. 1 [0046] [Fig. 1] schematically shows a possible context for implementing the method presented above.
  • FIG. 2 illustrates a succession of steps that a method within the meaning of the present description may comprise, according to a particular embodiment.
  • Fig. 3 illustrates a succession of steps that a method within the meaning of the present description may comprise, according to a particular embodiment.
  • FIG. 3 schematically shows an example of a sound data processing device according to one embodiment.
  • the processing circuit of the device DIS presented previously may typically comprise a memory MEM capable of storing in particular the instructions of the aforementioned computer program, as well as a processor PROC capable to cooperate with the memory MEM to execute the computer program.
  • the output interface OUT can supply a voice recognition module MOD of a personal assistant capable of identifying in the aforementioned acoustic signal a voice command from a user UT who, as illustrated in FIG. 1, can pronounce a voice command picked up by a microphone antenna MIC, and this in particular in the presence of ambient noise and/or sound reverberations REV, generated by the walls and/or partitions of a room for example in which the user is located UT.
  • the processing of the acquired sound data within the meaning of the present description and which is detailed below, nevertheless makes it possible to overcome such difficulties.
  • FIG. 2 An example of an overall method within the meaning of the present description is illustrated in FIG. 2.
  • the method begins with a first step S1 of acquiring the sound data picked up by the microphones. Then, a time-frequency transform of the signals acquired in step S3 is performed, after an apodization carried out in step S2.
  • the direction of arrival of the sound from the source of interest (DoA) can then be estimated in step S4 by giving in particular the vector a s (f) of this direction of arrival (or "steering vector") .
  • step S5 a first spatial filtering is applied to the sound data acquired by the microphones, for example in the time-frequency space, and according to the direction of arrival DoA.
  • the first spatial filtering can be of the Delay and Sum or MPDR type and it is “centered” on the DoA.
  • the filter is of the MPDR type
  • the acquired data expressed in the time-frequency domain are used, in addition to the DoA, to build the filter (arrow illustrated in dotted lines for this purpose).
  • amplitude (or energy or power) ratios are estimated between the filtered acquired data and the raw acquired data (denoted by x(t,f) in the time-frequency domain) .
  • This estimation of the ratios in the time-frequency domain makes it possible to construct a first, approximate form of the weighting mask already favoring the DoA at step S7 because the aforementioned ratios are of high levels mainly in the direction of arrival DoA.
  • step S8 it is then possible to provide a subsequent step S8, optional, consisting in smoothing this first mask in order to refine it.
  • step S9 it is also possible to generate a second spatial filtering from this refined mask. This second filtering can then then be applied in the time-frequency domain to the sound data acquired in order to generate, in step S10, an acoustic signal substantially devoid of noise and which can then be interpreted properly by a voice recognition module or other.
  • This vector is called “observation” or “mixture”.
  • the signals may be the signals picked up directly by the microphones of the antenna, or a combination of these microphone signals as in the case of an antenna collecting the signals according to a representation in ambiophonic format (also called “ambisonic”).
  • step S3 the different quantities (signals, covariance matrices, masks, filters), are expressed in a time-frequency domain, in step S3, as follows:
  • F ⁇ . is for example the short-term Fourier transform of size L:
  • Enhancement filters can be defined according to the information available. They can then be used for the deduction of the mask in the time-frequency domain.
  • steering vector For a source s of given position, we note a s the column vector which points in the direction of this source (the direction of arrival of the sound), vector called “steering vector”.
  • the steering vector of a plane wave of incidence ⁇ with respect to the antenna is defined at l step S4 in the frequency domain by:
  • c is the speed of sound in air.
  • the first channel here corresponds to the last sensor encountered by the sound wave. This steering vector then gives the direction of arrival of the sound or "DOA".
  • the steering vector can also be given by the relationship:
  • step S5 From the mere knowledge of the direction of arrival of a sound source (or DOA), in step S5 it is possible to define a filter of the delay-and-sum (DS) type which points in the direction from this source, as follows: [0070] is the transpose-conjugate operator of a matrix or a vector.
  • ⁇ (t, f) is a more or less wide neighborhood around the time-frequency point (t,f), and card is the “cardinal” operator.
  • the noise spatial covariance matrix can be calculated in the same way as that of the useful signal, and more particularly in the form:
  • the aim here is to estimate these time-frequency masks M s (t,f) and M n (t,f).
  • the direction of arrival of the sound (or “DOA”, obtained in step S4), coming from the useful source s at time t, denoted doa s (t), is considered to be known.
  • This DOA can be estimated by a localization algorithm such as “SRP-phat” ([@diBiaseSRPPhat]), and tracked by a tracking algorithm such as a Kalman filter for example. It can be composed of a single component as in the case of a linear antenna, or of azimuth and elevation components ( ⁇ , ⁇ ) in the case of a spherical antenna of the ambisonic type for example.
  • ⁇ , ⁇ azimuth and elevation components
  • w s which points in the direction of the useful source.
  • This filter can be of the Delay and Sum type, or hereinafter of the w MPDR type presented by:
  • step S7 This enhanced signal makes it possible to calculate a preliminary mask at step S7, given by the ratios of step S6: where x ref is a reference channel resulting from the capture, and y a positive real y typically takes the integer values (for example 1 for the amplitude or 2 for the energy). It should be noted that when y ® ⁇ , the mask tends towards the binary mask indicating the preponderance of the source with respect to the noise.
  • the first channel which is the omnidirectional channel
  • this may be the signal corresponding to any sensor.
  • this mask corresponds to the expression: which defines a mask at desired behavior, namely close to 1 when the signal s is preponderant, and close to 0 when the noise is preponderant.
  • the enhanced signal although already in a better condition than the raw signals acquired, may still contain noise and can be improved. by a mask estimation refinement processing (step S8).
  • the mask refinement step S8 is described below. Although this step is advantageous, it is in no way essential, and can be carried out optionally, for example if the mask estimated for the filtering in step S7 turns out to be noisy beyond a chosen threshold. To limit the noise of the mask, a soft(.) smoothing function is applied in step S8.
  • the application of this smoothing function can amount to estimating a local average, at each time-frequency point, for example as follows:
  • [0097] defines a neighborhood of the considered time-frequency point (t,f).
  • u th is a threshold to be adjusted according to the desired level.
  • R a random variable defined by:
  • - corresponds to the enhanced signal (i.e filtered by an MPDR or DS enhancement filter)
  • - x corresponds to a particular channel of the mix
  • M S follows a normal distribution, with a zero mean and a variance which depends on M s , as follows:
  • the mask can be calculated using probabilistic estimators.
  • M s (t,f) the estimator of the mask M s (t,f) in the sense of maximum likelihood.
  • - card is the “cardinal” operator, is a vector representing the sound data acquired in the domain time-frequency, and its Hermitian conjugate, and is the expression of the weighting mask in the time-frequency domain.
  • the MWF-type spatial filtering is then given by:
  • step S10 an acoustic signal representing the sound coming from the source of interest and enhanced with respect to the ambient noise (typically delivered by the output interface OUT of the device illustrated in FIG. 3).
  • the present technical solutions can find application in particular in the enhancement of speech by complex filters, for example of the MWF type ([@laurelineLSTM], [@amelieUnet]), which ensures good hearing quality and a high rate of automatic speech recognition, without the need for a neural network.
  • the approach can be used for the detection of keywords or "wake-up words" or even the transcription of a speech signal.

Landscapes

  • Engineering & Computer Science (AREA)
  • Computational Linguistics (AREA)
  • Quality & Reliability (AREA)
  • Signal Processing (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Physics & Mathematics (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Circuit For Audible Band Transducer (AREA)

Abstract

La présente description concerne un traitement de données sonores acquises par une pluralité de microphones (MIC), dans lequel : - à partir des signaux acquis par la pluralité de microphones, on détermine une direction d'arrivée d'un son issu d'au moins une source acoustique d'intérêt (S4), - on applique aux données sonores un filtrage spatial fonction de la direction d'arrivée du son (S5), - on estime dans le domaine temps-fréquence des ratios d'une grandeur représentative d'une amplitude de signal, entre les données sonores filtrées d'une part et les données sonores acquises d'autre part (S6), - en fonction des ratios estimés, on élabore un masque de pondération à appliquer dans le domaine temp-fréquence aux données sonores acquises (S7) en vue de construire un signal acoustique représentant le son issu de la source d'intérêt et rehaussé par rapport à du bruit ambiant (S10; S9- S10).

Description

Description
Titre : Estimation d'un masque optimisé pour le traitement de données sonores acquises
Domaine technique [0001] La présente description concerne le traitement de données sonores, notamment en contexte de prise de son lointaine.
[0002] La prise de son lointaine ou (“far-field” en anglais) se manifeste par exemple lorsqu'un locuteur est éloigné d'un équipement de prise de son. Elle offre toutefois des avantages se manifestant par un réel confort ergonomique pour l'utilisateur pour interagir “les mains-libres” avec un service en cours d'utilisation: passer un appel téléphonique, émettre des commandes vocales via un équipement de type « smartspeaker » (Google Home®, Amazon Echo®, etc).
[0003] En contrepartie, cette prise de son lointaine induit certains artefacts : la réverbération et les bruits environnants apparaissent amplifiés du fait de l'éloignement de l'utilisateur. Ces artefacts dégradent l'intelligibilité de la voix du locuteur, et par suite le fonctionnement des services. Il apparaît que la communication est plus difficile, que ce soit avec un humain ou un moteur de reconnaissance vocale.
[0004] Aussi, les terminaux mains-libres (comme les smartspeakers ou les « pieuvres » de téléconférence) sont généralement équipés d'une antenne de microphones qui permet de rehausser le signal utile en réduisant ces perturbations. Le rehaussement à base d'antenne exploite les informations spatiales encodées lors de l'enregistrement multicanal et propres à chaque source pour discriminer le signal d'intérêt des autres sources de bruit.
[0005] De nombreuses techniques de traitement d'antenne existent telles qu'un filtre de type « Delay and Sum » réalisant un filtrage purement spatial grâce à la seule connaissance de la direction d'arrivée de la source d'intérêt ou d'autres sources, ou encore un filtre « MVDR » (pour « Minimum Variance Distorsionless Response ») se montrant un peu plus efficace grâce à la connaissance, en plus de la direction d'arrivée de la source d'intérêt, de la distribution spatiale du bruit. D'autres filtres encore plus performants comme les filtres de Wiener Multicanal nécessitent de disposer en outre de la distribution spatiale de la source d'intérêt.
[0006] En pratique, la connaissance de ces distributions spatiales découle de celle d'une carte temps-fréquence qui indique les points de cette carte dominés par la parole, et les points dominés par le bruit. L'estimation de cette carte, que l'on appelle aussi masque, est généralement inférée par un réseau de neurones préalablement entraîné. [0007] Ci-après on note : x(t,f) = s(t,f) + n(t,f) un signal qui contient un mélange constitué et parole et bruit dans le domaine temps-fréquence, où s(t,f ) est la parole et n(t,f ) le bruit.
[0008] Un masque, noté (respectivement est défini comme un réel, généralement dans l'intervalle [0; 1] , tel qu'une estimation du signal d'intérêt (respectivement du bruit n(t,f )) est obtenue par simple multiplication de ce masque avec les observations x(t,f), soit :
[0009]
[0010] [0011] On cherche alors une estimation de masques et qui puisse mener à la dérivation de filtres de séparation ou de rehaussement qui soient efficaces.
Technique antérieure
[0012] L'utilisation de réseaux de neurones profonds (selon une approche mettant en œuvre une « intelligence artificielle ») a été utilisée pour la séparation de sources. Une description d'une telle réalisation est présentée par exemple dans le document
[@umbachChallenge] dont les références sont données en annexe ci-après. Des architectures telles que les plus simples de type dit "Feed Forward" (FF) ont été investiguées et ont montré leur efficacité comparées aux méthodes de traitement du signal, généralement basées sur des modèles (comme décrit dans la référence
[@heymannNNmask]). Des architectures « récurrentes » de type dit « LSTM » (Long-Short Term Memory, comme décrit dans [@laurelineLSTM]) ou Bi-LSTM (comme décrit dans [@heymannNNmask]), qui permettent de mieux exploiter les dépendances temporelles des signaux, montrent de meilleures performances, en contrepartie d'un coût de calcul très élevé. Pour réduire ce coût computationnel, que ce soit pour l'entraînement ou l'inférence, des architectures convolutionnelles dites « CNN » (Convolutional Neural Network) ont été proposées avec succès ([@amelieUnet], [@janssonUnetSinger]), améliorant les performances et réduisant le coût de calcul, avec en sus la possibilité de paralléliser les calculs. Si les approches d'intelligence artificielle pour la séparation exploitent généralement des caractéristiques dans le domaine temps-fréquence, des architectures purement temporelles ont aussi été employées avec succès ([@stollerWaveUnet]).
[0013] Toutes ces approches de rehaussement et de séparation par intelligence artificielle montrent une réelle valeur ajoutée pour les tâches où le bruit pose problème : transcriptions, reconnaissance, détection. Cependant, ces architectures ont en commun un coût élevé en termes de mémoire et de puissance de calcul. Les modèles de réseau de neurones profonds sont composées de dizaines de couches et des centaines de milliers, voire des millions, de paramètres. Par ailleurs, leur apprentissage nécessite de grandes bases des données exhaustives, annotées et enregistrées en conditions réalistes pour garantir une généralisation à toutes les conditions d'utilisation.
Résumé
[0014] La présente description vient améliorer la situation.
[0015] Il est proposé un procédé de traitement de données sonores acquises par une pluralité de microphones, dans lequel :
- à partir des données sonores acquises par la pluralité de microphones, on détermine une direction d'arrivée d'un son issu d'au moins une source acoustique d'intérêt,
- on applique aux données sonores un filtrage spatial fonction de la direction d'arrivée du son,
- on estime dans le domaine temps-fréquence des ratios d'une grandeur représentative d'une amplitude de signal, entre les données sonores filtrées d'une part et les données sonores acquises d'autre part,
- en fonction des ratios estimés, on élabore un masque de pondération à appliquer dans le domaine temp-fréquence aux données sonores acquises pour construire un signal acoustique représentant le son issu de la source d'intérêt et rehaussé par rapport à du bruit ambiant.
[0016] On entend ici par « grandeur représentative » d'une amplitude de signal, l'amplitude du signal mais aussi son énergie ou encore sa puissance, etc. Ainsi, les ratios précités peuvent être estimés en divisant l'amplitude (ou l'énergie, ou la puissance, etc.) du signal que représentent les données sonores filtrées par l'amplitude (ou l'énergie, ou la puissance, etc.) du signal que représentent les données sonores acquises (donc brutes).
[0017] Le masque de pondération ainsi obtenu est alors représentatif, en chaque point temps-fréquence du domaine temps-fréquence, d'un degré de prépondérance de la source acoustique d'intérêt, par rapport à du bruit ambiant.
[0018] Le masque de pondération peut être estimé pour construire directement un signal acoustique représentant le son issu de la source d'intérêt, et rehaussé par rapport à du bruit ambiant, ou encore pour calculer de seconds filtres spatiaux qui peuvent être plus efficaces pour réduire plus fortement le bruit que dans le cas précité d'une construction directe.
[0019] De manière générale, il est alors possible d'obtenir un masque temps-fréquence sans faire appel aux réseaux de neurones, avec pour seule connaissance a priori la direction d'arrivée de la source utile. Ce masque permet par la suite d'implémenter des filtres de séparation efficaces comme par exemple le filtre MVDR (pour « Minimum Variance Distorsionless Response ») ou ceux issus de la famille des filtres de Wiener Multicanal. L'estimation au fil de l'eau de ce masque permet de dériver des filtres à faible latence. En outre, son estimation reste efficace y compris en conditions adverses où le signal d'intérêt est noyé dans le bruit environnant.
[0020] Dans une réalisation, le premier filtrage spatial précité (appliqué aux données acquises avant d'estimer les ratios) peut être de type « Delay and Sum ».
[0021] En pratique, on peut appliquer dans ce cas des délais successifs aux signaux captés par les microphones agencés le long d'une antenne par exemple. Comme les distances entre les microphones et donc les déphasages inhérents à ces distances entre ces signaux captés sont connus, on peut procéder ainsi à une mise en phase de tous ces signaux que l'on peut sommer ensuite.
[0022] Dans le cas d'une transformation des signaux acquis dans le domaine ambisonique, l'amplitude des signaux représente ces déphasages inhérents aux distances entre microphones. Là encore, il est possible de pondérer ces amplitudes pour mettre en œuvre un traitement que l'on peut qualifier de « Delay and Sum ».
[0023] Dans une variante, ce premier filtrage spatial peut être de type MPDR (pour « Minimum Power Distortionless Response »). Il a l'avantage de mieux réduire le bruit environnant, tout en conservant le signal utile intact, et ne nécessite pas d'autre information que la direction d'arrivée. Ce type de procédé est décrit par exemple dans le document [@gannotResume] dont le contenu est détaillé plus loin et dont la référence complète est donnée en annexe.
[0024] Ici néanmoins, le filtrage spatial de type MPDR, noté wMPDR, peut être donné dans une réalisation particulière par :
[0025]
[0026] où as représente un vecteur définissant la direction d'arrivée du son (ou « steering vector »), et Rx est une matrice de covariance spatiale estimée en chaque point temps- fréquence (t,f) par une relation de type : où :
- Ω(t,f) est un voisinage du point temps-fréquence (t,f),
- card est l'opérateur « cardinal », - x(t1,f1) est un vecteur représentant les données sonores acquises dans le domaine temps-fréquence, et x(t1,f1)H son conjugué hermitien.
[0027] Par ailleurs, comme indiqué précédemment, le procédé peut comporter optionnellement une étape ultérieure d'affinage du masque de pondération pour débruiter son estimation.
[0028] Pour mener cette étape ultérieure, l'estimation peut être débruitée par lissage en appliquant par exemple des moyennes locales, définies heuristiquement.
[0029] Alternativement, cette estimation peut être débruitée par définition d'un modèle a priori de distribution de masque.
[0030] La première approche permet de conserver une complexité faible, tandis-que la seconde approche, basée sur un modèle, obtient de meilleures performances, au prix d'une complexité accrue.
[0031] Ainsi, dans un premier mode de réalisation, le masque de pondération élaboré peut être en outre affiné par lissage en chaque point temps-fréquence en appliquant un opérateur statistique local, calculé sur un voisinage temps-fréquence du point temps- fréquence ( t,f ) considéré. Cet opérateur peut prendre la forme d'une moyenne, d'un filtre Gaussien, d'un filtre médian, ou autre.
[0032] Dans un second mode de réalisation, pour mener la deuxième approche précitée, le masque de pondération élaboré peut être en outre affiné par lissage en chaque point temps-fréquence, en appliquant une approche probabiliste comportant :
- considérer le masque de pondération comme une variable aléatoire,
- définir un estimateur probabiliste d'un modèle de la variable aléatoire,
- chercher un optimum de l'estimateur probabiliste pour améliorer le masque de pondération. [0033] Typiquement, le masque peut être considéré comme une variable aléatoire uniforme dans un intervalle [0,1].
[0034] L'estimateur probabiliste du masque M s(t,f) peut être par exemple représentatif d'un maximum de vraisemblance, sur une pluralité d'observations d'un couple de variables , représentant respectivement : - un signal acoustique issu de l'application du masque de pondération aux données sonores acquises, et
- les données sonores acquises xt , lesdites observations étant choisies dans un voisinage / du point temps-fréquence ( t,f ) considéré.
[0035] Ces deux modes de réalisation ont ainsi pour vocation d'affiner le masque après son estimation. Comme indiqué précédemment, le masque obtenu (affiné optionnellement) peut être appliqué directement, aux données acquises (brutes, captées par les microphones) ou servir à construire un second filtre spatial à appliquer à ces données acquises.
[0036] Ainsi, dans ce deuxième cas, la construction du signal acoustique représentant le son issu de la source d'intérêt et rehaussé par rapport à du bruit ambiant, peut impliquer l'application d'un second filtrage spatial, obtenu à partir du masque de pondération.
[0037] Ce second filtrage spatial peut être de type MVDR pour « Minimum Variance Distorsionless Response », et dans ce cas, on estime au moins une matrice de covariance spatiale Rn du bruit ambiant, le filtrage spatial de type MVDR étant donné par WMVDR = où :
- (t, f) est un voisinage d'un point temps-fréquence (t,f),
- card est l'opérateur « cardinal »,
- x(t1,f1) est un vecteur représentant les données sonores acquises dans le domaine temps-fréquence, et x(t1,f1)H son conjugué hermitien, et est l'expression du masque de pondération dans le domaine temps-fréquence.
[0038] Alternativement, le second filtrage spatial peut être de type MWF pour
« Multichannel Wiener Filter », et dans ce cas on estime des matrices de covariance spatiale Rs et Rn, respectivement du signal acoustique représentant le son issu de la source d'intérêt, et du bruit ambiant, le filtrage spatial de type MWF étant donné par : où : - Ω(t,f) est un voisinage d'un point temps-fréquence (t,f), - card est l'opérateur « cardinal »,
- x(t1,f1) est un vecteur représentant les données sonores acquises dans le domaine temps-fréquence, et x(t1,f1)H son conjugué hermitien, et est l'expression du masque de pondération dans le domaine temps-fréquence.
[0039] La matrice de covariance spatiale Rn ci-dessus représente le « bruit ambiant ». Ce dernier peut en réalité comporter des émissions de sources sonores qui n'ont pas été retenues toutefois comme étant la source sonore d'intérêt. Des traitements séparés peuvent être opérés pour chaque source dont une direction d'arrivée a été détectée (par exemple en dynamique) et, dans le traitement pour une source donnée, les émissions des autres sources sont considérées comme faisant partie du bruit.
[0040] On comprend dans cette forme de réalisation comment le filtrage spatial réalisé, de type MWF par exemple, peut être issu du masquage estimé pour des points temps- fréquence les plus avantageux car la source acoustique d'intérêt y est prépondérante. Il convient de noter en outre que deux optimisations conjointes peuvent être menées, l'une pour la covariance Rs du signal acoustique faisant intervenir le masque temps-fréquence recherché Ms et l'autre pour la covariance Rn du bruit ambiant faisant intervenir un masque Mn lié au bruit (en sélectionnant alors des points temps-fréquence en lesquels le bruit seul est prépondérant).
[0041] La solution décrite ci-avant permet ainsi, de façon générale, d'estimer dans un domaine temps-fréquence un masque optimal dans les points temps-fréquence où la source d'intérêt est prépondérante, à partir de la seule information de direction d'arrivée de la source d'intérêt, sans apport de réseau de neurones (soit pour appliquer le masque directement aux données acquises, soit pour construire un second filtrage spatial à appliquer aux données acquises).
[0042] La présente description propose aussi un programme informatique comportant des instructions pour la mise en œuvre de tout ou partie d'un procédé tel que défini dans les présentes lorsque ce programme est exécuté par un processeur. Selon un autre aspect, il est proposé un support d'enregistrement non transitoire, lisible par un ordinateur, sur lequel est enregistré un tel programme.
[0043] La présente description propose aussi un dispositif comportant (comme illustré sur la figure 3) au moins une interface de réception (IN) de données sonores acquises par une pluralité de microphones (MIC) et un circuit de traitement (PROC, MEM) configuré pour : - à partir des données sonores acquises par la pluralité de microphones, déterminer une direction d'arrivée d'un son issu d'au moins une source acoustique d'intérêt,
- appliquer aux données sonores un filtrage spatial fonction de la direction d'arrivée du son,
- estimer dans le domaine temps-fréquence des ratios d'une grandeur représentative d'une amplitude de signal, entre les données sonores filtrées d'une part et les données sonores acquises d'autre part, et
- en fonction des ratios estimés, élaborer un masque de pondération à appliquer dans le domaine temp-fréquence aux données sonores acquises pour construire un signal acoustique représentant le son issu de la source d'intérêt et rehaussé par rapport à du bruit ambiant. [0044] Ainsi, le dispositif peut comporter en outre une interface de sortie (référence OUT de la figure 3) pour délivrer ce signal acoustique. Cette interface OUT peut être reliée à un module de reconnaissance vocale par exemple pour interpréter correctement des commandes d'un utilisateur, malgré du bruit ambiant, le signal acoustique délivré ayant été alors traité selon le procédé présenté plus haut.
Brève description des dessins
[0045] D'autres caractéristiques, détails et avantages apparaîtront à la lecture de la description détaillée ci-après, et à l'analyse des dessins annexés, sur lesquels :
Fig. 1 [0046] [Fig. 1] montre schématiquement un contexte possible de mise en œuvre du procédé présenté ci-avant.
Fig. 2
[0047] [Fig. 2] illustre une succession d'étapes que peut comporter un procédé au sens de la présente description, selon un mode de réalisation particulier. Fig. 3
[0048] [Fig. 3] montre schématiquement un exemple de dispositif de traitement de données sonores selon un mode de réalisation.
Description des modes de réalisation [0049] En référence encore à la figure 3 ici, le circuit de traitement du dispositif DIS présenté précédemment peut comporter typiquement une mémoire MEM apte à stocker notamment les instructions du programme informatique précité, ainsi qu'un processeur PROC apte à coopérer avec la mémoire MEM pour exécuter le programme informatique. [0050] Typiquement, l'interface de sortie OUT peut alimenter un module MOD de reconnaissance vocale d'un assistant personnel capable d'identifier dans le signal acoustique précité une commande vocale d'un utilisateur UT qui, comme illustré sur la figure 1, peut prononcer une commande vocale captée par une antenne de microphones MIC, et ce notamment en présence de bruit ambiant et/ou de réverbérations sonores REV, générées par les murs et/ou cloisons d'une pièce par exemple dans laquelle se situe l'utilisateur UT. Le traitement des données sonores acquises, au sens de la présente description et qui est détaillé ci-après, permet néanmoins de surmonter de telles difficultés.
[0051] Un exemple de procédé global au sens de la présente description est illustré sur la figure 2. Le procédé commence par une première étape S1 d'acquisition des données sonores captées par les microphones. Ensuite, il est procédé à une transformée temps- fréquence des signaux acquis à l'étape S3, après une apodisation réalisée à l'étape S2. La direction d'arrivée du son issu de la source d'intérêt (DoA) peut ensuite être estimée à l'étape S4 en donnant en particulier le vecteur as (f) de cette direction d'arrivée (ou « steering vector »). Ensuite, à l'étape S5, il est appliqué un premier filtrage spatial aux données sonores acquises par les microphones, par exemple dans l'espace temps-fréquence, et en fonction de la direction d'arrivée DoA. Le premier filtrage spatial peut être de type Delay and Sum ou MPDR et il est « centré » sur la DoA. Dans le cas où le filtre est de type MPDR, les données acquises exprimées dans le domaine temps-fréquence sont utilisées, en outre de la DoA, pour construire le filtre (flèche illustrée en traits pointillés à cet effet). Ensuite, à l'étape S6, il est estimé des ratios d'amplitude (ou d'énergie ou de puissance) entre les données acquises filtrées et les données acquises brutes (notées x(t,f) dans le domaine temps-fréquence). Cette estimation des ratios dans le domaine temps-fréquence permet de construire une première forme, approximative, du masque de pondération favorisant déjà la DoA à l'étape S7 car les ratios précités sont de niveaux élevés principalement dans la direction d'arrivée DoA. On peut prévoir ensuite une étape ultérieure S8, optionnelle, consistant à lisser ce premier masque pour l'affiner. Ensuite, à l'étape S9 (optionnelle également), il est possible en outre de générer un second filtrage spatial à partir de ce masque affiné. Ce second filtrage peut être appliqué alors ensuite dans le domaine temps- fréquence aux données sonores acquises afin de générer à l'étape S10 un signal acoustique dénué substantiellement de bruit et qui peut alors être interprété proprement par un module de reconnaissance vocale ou autre. On détaille ci-après chacune des étapes de ce procédé.
[0052] On note ci-après x(t) un signal d'antenne composé de N canaux, organisés sous forme d'un vecteur colonne à l'étape S1 : [0053]
[0054] Ce vecteur est nommé « observation » ou « mélange ».
[0055] Les signaux peuvent être les signaux captés directement par les microphones de l'antenne, ou une combinaison de ces signaux microphoniques comme dans le cas d'une antenne collectant les signaux selon une représentation au format ambiophonique (dit aussi « ambisonique »).
[0056] Dans la suite, les différentes quantités (signaux, matrices de covariance, masques, filtres), sont exprimées dans un domaine temps-fréquence, à l'étape S3, comme suit :
[0057]
[0058] où F{.) est par exemple la transformée de Fourier à court-terme de taille L :
[0059]
[0060] Dans la relation précédente, est une version potentiellement apodisée à l'étape S2 par une fenêtre w(k) et complétée avec des 0 de la variable x(t):
[0061]
[0062] avec M ≤ L et où w(k) est une fenêtre d'apodisation de type Hann ou autre.
[0063] On peut définir plusieurs filtres de rehaussement selon les informations dont on dispose. Ils pourront être alors utilisés pour la déduction du masque dans le domaine temps- fréquence.
[0064] Pour une source s de position donnée, on note as le vecteur colonne qui pointe dans la direction de cette source (la direction d'arrivée du son), vecteur appelé « steering vector ». Dans le cas d'une antenne uniforme linéaire formée de N capteurs, où chaque capteur est espacé de son voisin d'une distance d, le steering vector d'une onde plane d'incidence θ par rapport à l'antenne est défini à l'étape S4 dans le domaine fréquentiel par :
[0065] où c est la célérité du son dans l'air. [0066] Le premier canal correspond ici au dernier capteur rencontré par l'onde sonore. Ce steering vector donne alors la direction d'arrivée du son ou « DOA ».
[0067] Dans le cas d'une antenne ambisonique 3D d'ordre 1, typiquement au format SID/N3D, le steering vector peut être donné aussi par la relation :
[0068] où le couple (θ, Φ) correspond à l'azimuth et l'élévation de la source par rapport à l'antenne.
[0069] A partir de la seule connaissance de la direction d'arrivée d'une source sonore (ou DOA), à l'étape S5 on peut définir un filtre de type delay-and-sum (DS) qui pointe dans la direction de cette source, comme suit : [0070] est l'opérateur transposé-conjugué d'une matrice ou d'un vecteur.
[0071] On peut également utiliser un filtre un peu plus complexe, mais également plus performant, comme le filtre MPDR (pour « Minimum Power Distortionless Response »). Ce filtre nécessite, en plus de la direction d'arrivée du son émis par la source, la distribution spatiale du mélange x à travers sa matrice de covariance spatiale Rx :
[0072] où la covariance spatiale du signal multidimensionnel capté par l'antenne x est donnée par la relation suivante :
[0073]
[0074] Des détails d'une telle mise en œuvre sont décrits notamment dans la référence [@gannotResume] précisée en annexe.
[0075] Enfin, si on dispose des matrices de covariance spatiale Rs et Rn du signal d'intérêt s et du bruit n, on peut utiliser une famille de filtres beaucoup plus efficaces pour appliquer le second filtrage spatial précité (décrit plus loin en référence à l'étape S9 de la figure 2). On indique simplement ici qu'à titre d'exemple, on peut utiliser comme second filtrage un filtrage spatial de type MWF pour « Multichannel Wiener Filter », donné par l'équation suivante :
[0076]
[0077] et faisant intervenir les matrices de covariance spatiale représentant la distribution spatiale de l'énergie acoustique, émise par une source d'intérêt Rs ou par du bruit ambiant Rn , et se propageant dans l'environnement acoustique. En pratique, les propriétés acoustiques - réflexion, diffraction, diffusion - des matériaux des parois rencontrées par les ondes sonores - murs, plafond, sol, vitrage, etc. - varient fortement en fonction de la bande de fréquences considérée. Par la suite, cette distribution spatiale de l'énergie dépend également de la bande de fréquences. Par ailleurs, dans le cas de sources mobiles, cette covariance spatiale peut varier au cours du temps.
[0078] Une façon d'estimer la covariance spatiale du mélange x est d'opérer une intégration temps-fréquence locale :
[0079]
[0080] où Ω(t, f) est un voisinage plus ou moins large autour du point temps-fréquence ( t,f ), et card est l'opérateur « cardinal ».
[0081] A partir de là, il est déjà possible d'estimer le premier filtrage wMPDR qui peut être appliqué à l'étape S5.
[0082] Pour les matrices Rs et Rn , la situation est différente car elles ne sont pas directement accessibles depuis les observations et doivent être estimées. En pratique, on utilise un masque M s(t,f) (respectivement Mn(t,f)) qui permet de “sélectionner” les points temps-fréquence où la source utile (respectivement le bruit) est prépondérante, ce qui permet de calculer ensuite sa matrice de covariance par une intégration classique, par pondération avec un masque adéquat de type :
[0083]
[0084] Le masque du bruit M n(t,f) peut être dérivé directement du masque utile (i.e. associé à la source d'intérêt) M s(t,f) par la formule : M n(t,f) = 1 - M Dans ce cas, la matrice de covariance spatiale de bruit peut se calculer de la même façon que celle du signal utile, et plus particulièrement sous la forme :
[0085]
[0086] L'objectif visé ici est d'estimer ces masques temps-fréquence M s(t,f) et Mn(t,f).
[0087] On considère connue la direction d'arrivée du son (ou « DOA », obtenue à l'étape S4), issu de la source utile s à l'instant t, notée doas(t). Cette DOA peut être estimée par un algorithme de localisation comme le « SRP-phat » ([@diBiaseSRPPhat]), et suivie par un algorithme de suivi ou (« tracking ») comme un filtre de Kalman par exemple. Elle peut être composée d'une seule composante comme dans le cas d'une antenne linéaire, ou des composantes d'azimut et d'élévation (θ, Φ) dans le cas d'une antenne sphérique de type ambisonique par exemple. [0088] Ainsi, à partir de la seule connaissance de la DOA de la source utile s, on cherche à l'étape S7 à estimer ces masques. On dispose d'une version rehaussée du signal utile dans le domaine temps-fréquence. Cette version rehaussée est obtenue par application à l'étape S5 d'un filtre spatial ws qui pointe dans la direction de la source utile. Ce filtre peut être de type Delay and Sum, ou ci-après de type wMPDR présenté par :
[0089] ) eXiS,e
[0090] A partir de ce filtre, on rehausse le signal d'intérêt s par application du filtre à l'étape S5 :
[0091]
[0092] Ce signal rehaussé permet de calculer un masque préliminaire à l'étape S7, donné par les ratios de l'étape S6 : où xref est un canal de référence issu de la captation, et y un réel positif y prend typiquement les valeurs entières (par exemple 1 pour l'amplitude ou 2 pour l'énergie). Il convient de noter que lorsque y ® ¥ , le masque tend vers le masque binaire indiquant la prépondérance de la source par rapport au bruit.
[0093] Par exemple, pour une antenne ambisonique, on peut utiliser le premier canal qui est le canal omnidirectionnel. Dans le cas d'une antenne linéaire, ce peut être le signal correspondant à un quelconque capteur.
[0094] Dans le cas idéal où le signal est parfaitement rehaussé par le filtre ws, et γ = 1, ce masque correspond à l'expression : ce qui définit un masque au comportement souhaité, à savoir proche de 1 lorsque le signal s est prépondérant, et proche de 0 lorsque le bruit est prépondérant. En pratique, du fait de l'effet de l'acoustique et des imperfections de mesure dans la DOA de la source, le signal rehaussé, quoique déjà dans une meilleure condition que les signaux bruts acquis, peut comporter encore du bruit et peut être perfectionné par un traitement de raffinement de l'estimation du masque (étape S8).
[0095] On décrit ci-après l'étape S8 de raffinement du masque. Bien que cette étape soit avantageuse, elle n'est en rien essentielle, et peut être menée optionnellement, par exemple si le masque estimé pour le filtrage à l'étape S7 s'avère bruité au-delà d'un seuil choisi. [0096] Pour limiter le bruit du masque, on applique une fonction de lissage soft(. ), à l'étape S8. L'application de cette fonction de lissage peut revenir à estimer une moyenne locale, en chaque point temps-fréquence, par exemple comme suit:
[0097] définit un voisinage du point temps-fréquence considéré (t,f).
[0098] On peut alternativement choisir une moyenne pondérée par un noyau Gaussien par exemple, ou encore un opérateur de médiane qui est plus robuste aux valeurs aberrantes.
[0099] Cette fonction de lissage peut être appliquée, soit aux observations , soit au filtre comme suit : [0100]
[0101] Pour améliorer l'estimation, on peut appliquer une première étape de saturation, qui permet de garantir que le masque soit bien dans l'intervalle [0,1] :
[0102]
[0103] En effet, le procédé précédent mène parfois à une sous-estimation des masques. Il peut être intéressant de “redresser” les estimations précédentes par l'application d'une fonction de saturation du type :
[0104]
[0105] où uth est un seuil à régler selon le niveau souhaité. [0106] Une autre façon d'estimer le masque à partir des observations brutes consiste, plutôt que d'opérer des opérations de moyennage, à adopter une approche probabiliste, en posant R une variable aléatoire définie par :
[0107]
- correspond au signal rehaussé (i.e filtré par un filtre de rehaussement MPDR ou DS), - x correspond à un canal particulier du mélange et
- Ms correspond au masque de la source utile estimé précédemment : ce peut être ou les différentes variantes de
[0108] Ces variables peuvent être considérées comme dépendantes du temps et de la fréquence. [0109] La variable R|MS suit une distribution normale, avec une moyenne nulle et une variance qui dépend de Ms, comme suit :
[0110]
[0111] [0112] où est l'opérateur variance.
[0113] On peut également admettre une distribution a priori pour Ms. Comme il s'agit d'un masque, avec des valeurs comprises entre 0 et 1, on pose que le masque suit une loi uniforme dans l'intervalle [0,1] :
[0114] [0115] On peut définir une autre distribution favorisant la parcimonie du masque, comme une loi exponentielle par exemple, dans une variante.
[0116] À partir du modèle imposé pour les variables décrites, on peut calculer le masque en utilisant des estimateurs probabilistes. Ici on décrit l'estimateur du masque M s(t,f) au sens du maximum de vraisemblance. [0117] On suppose que l'on dispose d'un certain nombre d'observations / du couple de variables On peut sélectionner par exemple un ensemble d'observations en choisissant un pavé temps-fréquence autour du point (t,f) où l'on estime M s(t,f) :
[0118]
[0119] La fonction de vraisemblance du masque s'écrit : [0120]
[0121] L'estimateur au sens du maximum de vraisemblance est donné directement par l'expression avec :
[0122] sont les variances des variables
[0123] Encore une fois, pour éviter les valeurs hors de l'intervalle [0,1], on peut appliquer une opération de saturation du type :
[0124]
[0125] La procédure par approche probabiliste est moins bruitée que celle par moyennage local. Elle présente, au prix d'une complexité plus élevée du fait du calcul nécessaire des statistiques locales, une variance plus faible. Cela permet par exemple de correctement estimer les masques en l'absence de signal utile.
[0126] Le procédé peut se poursuivre à l'étape S9 par l'élaboration du second filtrage spatial à partir du masque de pondération donnant en particulier la matrice Ms (ainsi que la matrice propre au bruit Mn = 1 - Ms) pour construire un second filtre par exemple de type MWF en estimant les matrices de covariance spatiale Rs et Rn propres à la source d'intérêt et au bruit, respectivement, et données par : où :
- Ω(t, f) est un voisinage d'un point temps-fréquence
- card est l'opérateur « cardinal », est un vecteur représentant les données sonores acquises dans le domaine temps-fréquence, et son conjugué hermitien, et est l'expression du masque de pondération dans le domaine temps-fréquence.
[0127] Le filtrage spatial de type MWF est alors donné par :
[0128] Il convient de noter en variante que si le second filtrage retenu est de type MVDR, alors le second filtrage est donné par avec où Ω(t,f ) et card sont définis comme précédemment.
[0129] Une fois ce second filtrage spatial appliqué aux données acquises x(t,f), on peut appliquer une transformée inverse (de l'espace temps-fréquence à l'espace direct) et obtenir à l'étape S10 un signal acoustique représentant le son issu de la source d'intérêt et rehaussé par rapport au bruit ambiant (délivré typiquement par l'interface de sortie OUT du dispositif illustré sur la figure 3).
Application industrielle [0130] Les présentes solutions techniques peuvent trouver à s'appliquer notamment dans le rehaussement de la parole par des filtres complexes par exemple de type MWF ([@laurelineLSTM], [@amelieUnet]), ce qui assure une bonne qualité auditive et un taux élevé de reconnaissance automatique de parole, sans besoin de réseau de neurones. L'approche peut être utilisées pour la détection de mots-clés ou "wake-up words" où même la transcription d'un signal de parole.
Liste des documents cités
[0131] À toute fin utile, les éléments non-brevets suivants sont cités :
[0132] [@amelieUnet] : Amélie Bosca et al. “Dilated U-net based approach for multichannel speechenhancement from First-Order Ambisonics recordings”. In:Computer Speech& Language(2020), pp. 37-51
[0133] [@laurelineLSTM] : L. Perotin et al. “Multichannel speech séparation with récurrent neuralnetworks from high-order Ambisonics recordings”. ln:Proc. of ICASSP.ICASSP 2018 - IEEE International Conférence on Acoustics, Speech andSignal Processing. 2018, pp. 36- 40.
[0134] [@umbachChallenge] : Reinhold Heab-Umbach et al. “Far-Field Automatic Speech Récognition”. arXiv:2009.09395v1 .
[0135] [@heymannNNmask] : J. Heymann, L. Drude, and R. Haeb-Umbach, “Neural network based spectral mask estimation for acoustic beamforming,” in Proc of ICASSP, 2016, pp. 196-200.
[0136] [@janssonUnetSinger] : A. Jansson, E. Humphrey, N. Montecchio, R. Bittner, A. Kumar, and T. Weyde, “Singing voice séparation with deep U-net convolutional networks,” in Proc of Int. Soc. for Music Inf. Retrieval, 2017, pp. 745-751.
[0137] [@stollerWaveUnet] : D. Stoller, S. Ewert, and S. Dixon, “Wave-U-Net: a multi-scale neural network for end-to-end audio source séparation,” in Proc of Int. Soc. for Music Inf. Retrieval, 2018, pp. 334-340.
[0138] [@gannotResume] : Sharon Gannot et al. “A Consolidated Perspective on Multimicrophone Speech Enhancement and Source Séparation”. ln:IEEE/ACM Transac tions on Audio, Speech, and Language Processing25.4 (Apr. 2017), pp. 692-730. issn: 2329-9304.doi:10.1109/TASLP.2016.2647702. [0139] [@diBiaseSRPPhat] : J. Dibiase, H. Silverman, and M. Brandstein, “Robust localization in réverbérant rooms,” in Microphone Arrays: Signal Processing Techniques and Applications. Springer, 2001, pp. 157-180.

Claims

Revendications
[Revendication 1] Procédé de traitement de données sonores acquises par une pluralité de microphones (MIC), dans lequel :
- à partir des données sonores acquises par la pluralité de microphones, on détermine une direction d'arrivée d'un son issu d'au moins une source acoustique d'intérêt,
- on applique aux données sonores un filtrage spatial fonction de la direction d'arrivée du son,
- on estime dans le domaine temps-fréquence des ratios d'une grandeur représentative d'une amplitude de signal, entre les données sonores filtrées d'une part et les données sonores acquises d'autre part,
- en fonction des ratios estimés, on élabore un masque de pondération à appliquer dans le domaine temp-fréquence aux données sonores acquises pour construire un signal acoustique représentant le son issu de la source d'intérêt et rehaussé par rapport à du bruit ambiant.
[Revendication 2] Procédé selon l'une des revendications précédentes, dans lequel le filtrage spatial est de type « Delay and Sum ».
[Revendication 3] Procédé selon la revendication 1, dans lequel le filtrage spatial est appliqué dans le domaine temps-fréquence et est de type MPDR, pour « Minimum Power Distortionless Response ».
[Revendication 4] Procédé selon la revendication 3, dans lequel le filtrage spatial de type
MPDR, noté wMPDR, est donné par où as représente un vecteur définissant la direction d'arrivée du son, et Rx (t,f) est une matrice de covariance spatiale estimée en chaque point temps-fréquence (t,f) par une relation de type : où : - Ω(t, f) est un voisinage du point temps-fréquence (t,f),
- card est l'opérateur « cardinal »,
- x(t1,f1) est un vecteur représentant les données sonores acquises dans le domaine temps-fréquence, et x(t1,f1)H son conjugué hermitien.
[Revendication 5] Procédé selon l'une des revendications précédentes, dans lequel le masque de pondération élaboré est en outre affiné par lissage en chaque point temps- fréquence en appliquant un opérateur statistique local, calculé sur un voisinage temps- fréquence du point temps-fréquence (t,f) considéré.
[Revendication 6] Procédé selon l'une des revendications 1 à 4, dans lequel le masque de pondération élaboré est en outre affiné par lissage en chaque point temps-fréquence, et dans lequel on applique une approche probabiliste comportant :
- considérer le masque de pondération comme une variable aléatoire, - définir un estimateur probabiliste d'un modèle de la variable aléatoire,
- chercher un optimum de l'estimateur probabiliste pour améliorer le masque de pondération.
[Revendication 7] Procédé selon la revendication 6, dans lequel le masque est considéré comme une variable aléatoire uniforme dans un intervalle [0,1].
[Revendication 8] Procédé selon l'une des revendications 6 et 7, dans lequel l'estimateur probabiliste du masque M s(t,f) est représentatif d'un maximum de vraisemblance, sur une pluralité d'observations d'un couple de variables , représentant respectivement :
- un signal acoustique issu de l'application du masque de pondération aux données sonores acquises, et
- les données sonores acquises , lesdites observations étant choisies dans un voisinage du point temps-fréquence ( t,f ) considéré.
[Revendication 9] Procédé selon les revendications précédentes, dans lequel la construction du signal acoustique représentant le son issu de la source d'intérêt et rehaussé par rapport à du bruit ambiant, comporte l'application d'un second filtrage spatial, obtenu à partir du masque de pondération élaboré.
[Revendication 10] Procédé selon la revendication 9, dans lequel le second filtrage spatial est de type MVDR pour « Minimum Variance Distorsionless Response », et on estime au moins une matrice de covariance spatiale R n(t,f) du bruit ambiant, le filtrage spatial de type MVDR étant donné par avec : où :
- Ω(t, f) est un voisinage d'un point temps-fréquence (t,f),
- card est l'opérateur « cardinal »,
- x(t1,f1) est un vecteur représentant les données sonores acquises dans le domaine temps-fréquence, et c(A<fi)H son conjugué hermitien, et est l'expression du masque de pondération dans le domaine temps-fréquence.
[Revendication 11] Procédé selon la revendication 9, dans lequel le second filtrage spatial est de type MWF pour « Multichannel Wiener Filter », et on estime des matrices de covariance spatiale Rs et Rn, respectivement du signal acoustique représentant le son issu de la source d'intérêt, et du bruit ambiant, le filtrage spatial de type MWF étant donné par où :
- Ω(t, f) est un voisinage d'un point temps-fréquence (t,f),
- card est l'opérateur « cardinal »,
- x(t1,f1) est un vecteur représentant les données sonores acquises dans le domaine temps-fréquence, et x(t1,f1)H son conjugué hermitien, et est l'expression du masque de pondération dans le domaine temps-fréquence.
[Revendication 12] Programme informatique comportant des instructions pour la mise en œuvre du procédé selon l'une des revendications précédentes lorsque ce programme est exécuté par un processeur. [Revendication 13] Dispositif comportant au moins une interface de réception (IN) de données sonores acquises par une pluralité de microphones (MIC) et un circuit de traitement (PROC, MEM) configuré pour :
- à partir des données sonores acquises par la pluralité de microphones, déterminer une direction d'arrivée d'un son issu d'au moins une source acoustique d'intérêt, - appliquer aux données sonores un filtrage spatial fonction de la direction d'arrivée du son,
- estimer dans le domaine temps-fréquence des ratios d'une grandeur représentative d'une amplitude de signal, entre les données sonores filtrées d'une part et les données sonores acquises d'autre part, et
- en fonction des ratios estimés, élaborer un masque de pondération à appliquer dans le domaine temp-fréquence aux données sonores acquises pour construire un signal acoustique représentant le son issu de la source d'intérêt et rehaussé par rapport à du bruit ambiant.
EP22714494.6A 2021-04-01 2022-03-18 Estimation d'un masque optimise pour le traitement de donnees sonores acquises Active EP4315328B1 (fr)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
FR2103400A FR3121542A1 (fr) 2021-04-01 2021-04-01 Estimation d’un masque optimisé pour le traitement de données sonores acquises
PCT/FR2022/050495 WO2022207994A1 (fr) 2021-04-01 2022-03-18 Estimation d'un masque optimise pour le traitement de donnees sonores acquises

Publications (2)

Publication Number Publication Date
EP4315328A1 true EP4315328A1 (fr) 2024-02-07
EP4315328B1 EP4315328B1 (fr) 2025-12-24

Family

ID=75850368

Family Applications (1)

Application Number Title Priority Date Filing Date
EP22714494.6A Active EP4315328B1 (fr) 2021-04-01 2022-03-18 Estimation d'un masque optimise pour le traitement de donnees sonores acquises

Country Status (5)

Country Link
US (1) US12462825B2 (fr)
EP (1) EP4315328B1 (fr)
CN (1) CN117121104A (fr)
FR (1) FR3121542A1 (fr)
WO (1) WO2022207994A1 (fr)

Families Citing this family (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
WO2022215199A1 (fr) * 2021-04-07 2022-10-13 三菱電機株式会社 Dispositif de traitement d'informations, procédé de sortie et programme de sortie
WO2026082689A1 (fr) * 2024-10-14 2026-04-23 Ws Audiology A/S Procédé de fonctionnement d'un système de dispositif audio et système de dispositif audio

Family Cites Families (5)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US9747922B2 (en) * 2014-09-19 2017-08-29 Hyundai Motor Company Sound signal processing method, and sound signal processing apparatus and vehicle equipped with the apparatus
US10522167B1 (en) * 2018-02-13 2019-12-31 Amazon Techonlogies, Inc. Multichannel noise cancellation using deep neural network masking
CN110503972B (zh) * 2019-08-26 2022-04-19 北京大学深圳研究生院 语音增强方法、系统、计算机设备及存储介质
US11373668B2 (en) * 2019-09-17 2022-06-28 Bose Corporation Enhancement of audio from remote audio sources
US20240282327A1 (en) * 2023-02-22 2024-08-22 Qualcomm Incorporated Speech enhancement using predicted noise

Also Published As

Publication number Publication date
US12462825B2 (en) 2025-11-04
WO2022207994A1 (fr) 2022-10-06
EP4315328B1 (fr) 2025-12-24
FR3121542A1 (fr) 2022-10-07
CN117121104A (zh) 2023-11-24
US20240212701A1 (en) 2024-06-27

Similar Documents

Publication Publication Date Title
CN109597022B (zh) 声源方位角运算、定位目标音频的方法、装置和设备
EP1356461B1 (fr) Procede et dispositif de reduction de bruit
JP6480644B1 (ja) マルチチャネル音声認識のための適応的オーディオ強化
EP3807669B1 (fr) Localisation de sources sonores dans un environnement acoustique donné
EP4046390B1 (fr) Localisation perfectionnee d&#39;une source acoustique
EP2772916A1 (fr) Procédé de débruitage d&#39;un signal audio par un algorithme à gain spectral variable à dureté modulable dynamiquement
EP4315328B1 (fr) Estimation d&#39;un masque optimise pour le traitement de donnees sonores acquises
CN118899005B (zh) 一种音频信号处理方法、装置、计算机设备及存储介质
EP4248231A1 (fr) Localisation perfectionnée d&#39;une source acoustique
EP3627510B1 (fr) Filtrage d&#39;un signal sonore acquis par un systeme de reconnaissance vocale
EP4523210A1 (fr) Alignement temporel de signaux à l&#39;aide de l&#39;attention
Sharma et al. Development of a speech separation system using frequency domain blind source separation technique
EP3025342A1 (fr) Procédé de suppression de la réverbération tardive d&#39;un signal sonore
CN112289335B (zh) 语音信号的处理方法、装置及拾音设备
US20230368766A1 (en) Temporal alignment of signals using attention
CN116564328B (zh) 一种用于施工区域的智能音箱语音去噪方法
WO2020049263A1 (fr) Dispositif de rehaussement de la parole par implementation d&#39;un reseau de neurones dans le domaine temporel
US20260025634A1 (en) Audio processing system and method for deep fake detection
US20250182775A1 (en) Spatial region based audio separation
FR3143932A1 (fr) Obtention d’une réponse impulsionnelle d’une salle
WO2025132469A1 (fr) Mécanisme d&#39;attention pour l&#39;estimation d&#39;un délai et l&#39;alignement de deux signaux
EP3828886A1 (fr) Procede et systeme pour separer dans un flux audio la composante voix et la composante bruit

Legal Events

Date Code Title Description
STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: UNKNOWN

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE INTERNATIONAL PUBLICATION HAS BEEN MADE

PUAI Public reference made under article 153(3) epc to a published international application that has entered the european phase

Free format text: ORIGINAL CODE: 0009012

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: REQUEST FOR EXAMINATION WAS MADE

17P Request for examination filed

Effective date: 20231027

AK Designated contracting states

Kind code of ref document: A1

Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC MK MT NL NO PL PT RO RS SE SI SK SM TR

DAV Request for validation of the european patent (deleted)
DAX Request for extension of the european patent (deleted)
STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: EXAMINATION IS IN PROGRESS

17Q First examination report despatched

Effective date: 20250225

GRAP Despatch of communication of intention to grant a patent

Free format text: ORIGINAL CODE: EPIDOSNIGR1

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: GRANT OF PATENT IS INTENDED

INTG Intention to grant announced

Effective date: 20250812

GRAS Grant fee paid

Free format text: ORIGINAL CODE: EPIDOSNIGR3

GRAA (expected) grant

Free format text: ORIGINAL CODE: 0009210

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE PATENT HAS BEEN GRANTED

AK Designated contracting states

Kind code of ref document: B1

Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC MK MT NL NO PL PT RO RS SE SI SK SM TR

REG Reference to a national code

Ref country code: CH

Ref legal event code: F10

Free format text: ST27 STATUS EVENT CODE: U-0-0-F10-F00 (AS PROVIDED BY THE NATIONAL OFFICE)

Effective date: 20251224

Ref country code: GB

Ref legal event code: FG4D

Free format text: NOT ENGLISH

REG Reference to a national code

Ref country code: DE

Ref legal event code: R096

Ref document number: 602022027395

Country of ref document: DE

PGFP Annual fee paid to national office [announced via postgrant information from national office to epo]

Ref country code: GB

Payment date: 20260220

Year of fee payment: 5

REG Reference to a national code

Ref country code: LT

Ref legal event code: MG9D

PG25 Lapsed in a contracting state [announced via postgrant information from national office to epo]

Ref country code: NO

Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT

Effective date: 20260324

PGFP Annual fee paid to national office [announced via postgrant information from national office to epo]

Ref country code: DE

Payment date: 20260219

Year of fee payment: 5

PG25 Lapsed in a contracting state [announced via postgrant information from national office to epo]

Ref country code: HR

Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT

Effective date: 20251224

Ref country code: FI

Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT

Effective date: 20251224

PGFP Annual fee paid to national office [announced via postgrant information from national office to epo]

Ref country code: AT

Payment date: 20260301

Year of fee payment: 5

PG25 Lapsed in a contracting state [announced via postgrant information from national office to epo]

Ref country code: RS

Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT

Effective date: 20260324

PGFP Annual fee paid to national office [announced via postgrant information from national office to epo]

Ref country code: FR

Payment date: 20260219

Year of fee payment: 5

PG25 Lapsed in a contracting state [announced via postgrant information from national office to epo]

Ref country code: LV

Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT

Effective date: 20251224