EP1958186A1 - Procede de mesure de la qualite percue d'un signal audio degrade par la presence de bruit - Google Patents
Procede de mesure de la qualite percue d'un signal audio degrade par la presence de bruitInfo
- Publication number
- EP1958186A1 EP1958186A1 EP06842121A EP06842121A EP1958186A1 EP 1958186 A1 EP1958186 A1 EP 1958186A1 EP 06842121 A EP06842121 A EP 06842121A EP 06842121 A EP06842121 A EP 06842121A EP 1958186 A1 EP1958186 A1 EP 1958186A1
- Authority
- EP
- European Patent Office
- Prior art keywords
- signal
- test
- noise
- calculation
- distances
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Withdrawn
Links
- 230000005236 sound signal Effects 0.000 title claims abstract description 76
- 238000000034 method Methods 0.000 title claims abstract description 60
- 238000012360 testing method Methods 0.000 claims abstract description 94
- 230000000873 masking effect Effects 0.000 claims abstract description 71
- 238000004364 calculation method Methods 0.000 claims description 66
- 230000015556 catabolic process Effects 0.000 claims description 36
- 238000006731 degradation reaction Methods 0.000 claims description 36
- 230000009467 reduction Effects 0.000 claims description 24
- 230000000694 effects Effects 0.000 claims description 21
- 238000001514 detection method Methods 0.000 claims description 17
- 238000005192 partition Methods 0.000 claims description 15
- 238000004590 computer program Methods 0.000 claims description 4
- 230000008520 organization Effects 0.000 claims description 3
- 238000012935 Averaging Methods 0.000 claims 1
- 230000006870 function Effects 0.000 description 30
- 230000003595 spectral effect Effects 0.000 description 9
- 238000006243 chemical reaction Methods 0.000 description 8
- 238000011156 evaluation Methods 0.000 description 7
- 238000004891 communication Methods 0.000 description 5
- 230000008901 benefit Effects 0.000 description 4
- 238000004422 calculation algorithm Methods 0.000 description 4
- 238000012937 correction Methods 0.000 description 4
- 230000008569 process Effects 0.000 description 4
- 238000005070 sampling Methods 0.000 description 4
- 238000001914 filtration Methods 0.000 description 3
- 230000007480 spreading Effects 0.000 description 3
- 239000000654 additive Substances 0.000 description 2
- 230000000996 additive effect Effects 0.000 description 2
- 230000008859 change Effects 0.000 description 2
- XOFYZVNMUHMLCC-ZPOLXVRWSA-N prednisone Chemical compound O=C1C=C[C@]2(C)[C@H]3C(=O)C[C@](C)([C@@](CC4)(O)C(=O)CO)[C@@H]4[C@@H]3CCC2=C1 XOFYZVNMUHMLCC-ZPOLXVRWSA-N 0.000 description 2
- 238000012545 processing Methods 0.000 description 2
- 230000035807 sensation Effects 0.000 description 2
- 238000001228 spectrum Methods 0.000 description 2
- 230000003044 adaptive effect Effects 0.000 description 1
- 230000005540 biological transmission Effects 0.000 description 1
- 238000011161 development Methods 0.000 description 1
- 238000002474 experimental method Methods 0.000 description 1
- 230000003993 interaction Effects 0.000 description 1
- 238000005259 measurement Methods 0.000 description 1
- 230000008447 perception Effects 0.000 description 1
- 239000013589 supplement Substances 0.000 description 1
- 230000001629 suppression Effects 0.000 description 1
- 230000002123 temporal effect Effects 0.000 description 1
- 238000011282 treatment Methods 0.000 description 1
- 230000001755 vocal effect Effects 0.000 description 1
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L25/00—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
- G10L25/48—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use
- G10L25/69—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use for evaluating synthetic or decoded voice signals
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L21/00—Speech or voice signal processing techniques to produce another audible or non-audible signal, e.g. visual or tactile, in order to modify its quality or its intelligibility
- G10L21/02—Speech enhancement, e.g. noise reduction or echo cancellation
- G10L21/0208—Noise filtering
Definitions
- the present invention relates generally to the fields of speech signal processing and psychoacoustics. More precisely, the invention relates to a method and a device making it possible to objectively assess the perceived quality of an audio signal degraded by the presence of noise, and in particular when such an audio signal is processed by a noise reduction function.
- noise reduction function also called noise suppression or denoising function
- a noise reduction function aims to reduce the level of background noise in a voice communication, or having at least one component vocal It is of specific interest when one of the interlocutors of this communication is immersed in a noisy environment which strongly harms the intelligibility of his voice
- the noise reduction algorithms are based on a continuous estimation of the level of background noise from the incident signal and from a voice activity detection making it possible to distinguish the periods of noise alone from those with useful speech signal Filtering of the incident speech signal, corresponding to the signal! of noisy speech is then carried out so as to reduce the contribution of the noise determined from the noise estimate
- the aim of the present invention is to solve the drawbacks of the prior art by providing a method and a device for objective calculation of a score equivalent to the subjective score as indicated in the document "ITU-T Recommendation P.835", characterizing the perceived quality of an audio signal degraded by the presence of noise.
- the method according to the invention applies both to any noisy audio signal and to a noisy audio signal processed by a noise reduction function, in particular in the parameters for calculating the objective score according to the invention. Indeed, even if in general the invention will be used to evaluate the perceived quality of a degraded audio signal at the output of a communication equipment implementing a noise reduction function, the invention also applies to noisy signals not treated by such a function.
- the case of using the invention on any noisy audio signal is therefore a special case of the more general case of using the invention on a noisy audio signal processed by a noise reduction function.
- two embodiments are presented.
- the second embodiment, applying to any noisy audio signal is easily deduced therefrom.
- the terms “degraded audio signal” designate the evaluated audio signal, that is to say the signal processed for the first embodiment, or the noisy signal for the second embodiment.
- the invention proposes, in a first embodiment, a method for calculating an objective note of the perceived quality of an audio signal degraded by the presence of noise and processed by a noise reduction function, said method comprising a preliminary step of obtaining a predefined test audio signal containing a sign! useful with no noise, a noisy signal, obtained by adding a predefined noise signal to the test signal, and a processed signal, obtained by applying the noise reduction function to the noisy signal, said method being characterized by what it includes:
- This process has the advantage of a simple, immediate and rapid implementation unlike subjective tests. It can be implemented in software on a computer or be integrated into equipment for measuring the performance of noise reduction functions.
- psychoacoustic loudness can be defined as the character of the auditory sensation linked to the acoustic pressure and to the structure of the sound. In other words, it is the sonic strength of a sound or noise as a hearing sensation (cf. Office de la langue relie, 1988). Loudness is represented by a psychoacoustic loudness scale (in sones). On the other hand, loudness density, also known as “subjective intensity”, is a particular measure of loudness.
- the method according to the first embodiment of the invention comprises the steps of:
- the partition step which uses masking thresholds and distances calculated on the test and processed signals, makes it possible to take account of different types of degradations of the processed signal, and thus to obtain an objective note of the processed signal very close the subjective score that would be obtained with subjective tests.
- the invention also relates, in a second embodiment of the invention, to a method for calculating an objective note of the perceived quality of an audio signal degraded by the presence of noise, said method comprising a prior step of obtaining a predefined test audio signal containing a useful noise-free signal and a noisy signal, obtained by adding a predefined noise signal to the test signal, said method being characterized in that it comprises:
- the method according to the second embodiment of the invention comprises the steps of:
- the partition step makes it possible to take account of different types of degradation of the noisy signal, and thus to obtain an objective score of the noisy signal very close to the subjective note which would be obtained with subjective tests.
- the partition step is followed by a step of classification of the degraded audio signal as a function of the types of degradations present in said signal, the calculation of the objective note taking account of this classification.
- the step of calculating averages is preceded by a step of changing the frame rate.
- This step makes it possible to work on frames of longer periods, more representative of the periods over which a listener would perceive the degraded audio signal (during subjective tests.
- the step of calculating the objective note is followed by a step of calculating an objective note on the MOS scale of the perceived quality of the degraded audio signal.
- This step provides an objective rating of the degraded audio signal on the same standard scale as that used in the subjective tests of "ITU-T Recommendation P.835".
- the calculation of the masking thresholds of an audio signal frame uses a hybrid model between the Johnston masking model and the ISO masking model, from the English "International Standard Organization".
- the invention also relates to test equipment intended for evaluating an objective score of the perceived quality of an audio signal degraded by the presence of noise, characterized in that it comprises means suitable for implementing the method according to the one of the embodiments of the invention.
- the invention also relates to a computer program on an information medium, comprising instructions adapted to the implementation of the method according to one of the embodiments of the invention, when said program is loaded and executed in a computer system.
- FIG. 1 represents a test environment intended to calculate an objective note of the perceived quality of an audio signal degraded by the presence of noise and processed by a noise reduction function, according to a first embodiment of the invention
- FIG. 2 is a flowchart illustrating a method for calculating an objective score of the perceived quality of an audio signal degraded by the presence of noise and processed by a noise reduction function according to a first embodiment of the method according to the invention.
- FIG. 3 is a flowchart illustrating a method for calculating an objective note of the perceived quality of an audio signal degraded by the presence of noise according to a second embodiment of the method according to the invention.
- FIG. 4 is a flowchart illustrating the method of calculating the loudness density and the masking threshold of an audio signal frame, as well as the method of calculating the cepstral distance between two corresponding frames of two audio signals, according to FIG. 'invention.
- the principle of the method according to the invention is the same in these two embodiments, in particular the calculation method is exactly the same, but in the second embodiment the audio signal processed by a noise reduction function is taken equal at the noisy signal.
- the second embodiment can in fact be considered as a particular case of the first realization mode, with a noise reduction function inhibited.
- the perceived quality of an audio signal degraded by the presence of noise and processed by a noise reduction function is evaluated objectively in a test environment represented in the figure. 1.
- Such a test environment comprises a source of SSA audio signals delivering a test audio signal x (n) containing only the useful signal, that is to say one devoid of noise, for example a speech signal, and a noise source SB delivering a predefined noise signal.
- this predefined noise signal is added to the chosen test signal x (n), as represented by the addition operator AD.
- the audio signal resulting from this addition of noise to the test signal x (n) is denoted xb (n) and is designated by the expression "noisy signal”.
- the noisy signal xb (n) then constitutes the input signal from a noise reduction MRB module implementing a noise reduction function delivering an audio signal y (n) designated by the expression "processed signal” ".
- the processed signal y (n) is therefore an audio signal containing useful signal and residual noise.
- the processed signal y (n) is then delivered to an EQT test equipment implementing an objective evaluation method of the perceived quality of the processed signal, according to the invention.
- the method according to the invention is implemented in the EQT test equipment in the form of a computer program.
- the EQT test equipment optionally includes electronic hardware means for implementing the method according to the invention.
- the EQT test equipment receives as input the test signal x (n) and the noisy signal xb (n).
- the EQT test equipment outputs an evaluation result RES 1 which is an objective note NOS_MOS of the perceived quality of the signal! treaty y (n).
- the mode of calculation of this objective note NOSJMGS will be described below.
- the aforementioned audio signals x (n), xb (n) and y (n) are signals sampled in a digital format, n denoting any sample. These signals are for example supposed to be sampled at the sampling frequency of 8 kHz (kilo Hertz)
- the test signal x (n) is a speech signal devoid of noise.
- the noisy signal xb (n) then represents the initial voice signal x (n) degraded by a noisy environment (noise background or ambient noise), and the signal y (n) represents the signal xb (n) after noise reduction
- the signal x (n) is generated in an anechoic chamber
- the signal x (n) can also be generated in a "quiet" room having an "average" reverberation time , less than 0.5 seconds
- the noisy signal xb (n) is obtained by adding a predetermined contribution of noise to the signal x (n)
- the signal y (n) is obtained either at the output of a noise reduction algorithm implemented on a personal computer, or at the output from a noise reduction network equipment and in the latter case, the signal y (n) is taken from a MIC encoder (pulse modulation and coding)
- the method for calculating the objective score NOSJVIOS of the perceived quality of the signa! treats y (n) according to the invention is represented in the form of an algorithm comprising steps ai a ai 1
- ai the signals x (n), xb (n) and y (n) are respectively divided into successive time windows called frames.
- Each signal frame denoted m contains a predetermined number of signal samples.
- Step ai consists therefore in a change of cadence of each of these signals.
- the signals x (n), xb (n) and y (n) passed in frame rate produce the signals x [m] xb [m] and y [m] respectively m is the index of the frame considered
- the calculated values are calculated on each frame m of this set of frames, and therefore all have a frame index m.
- a voice activity detection is performed on the signal x [m] so as to determine whether each respective current frame of index m of the signals xb [m] and y [m], is a frame containing only noise, or a frame containing speech, ie useful signal. This determination is made by comparing the signals xb [m] and y [m] with the noise-free test signal x [m].
- Each silence frame of x [m] corresponds temporally to a noise frame for the signals xb [m] and y [m]
- each speech frame of x [m] corresponds to a speech frame for the xb [m] and y [m] signals.
- variable DAV [m] represented in FIG. 2 result of the voice activity detection, is equal to 1 for the speech frames of x [m], y [m] and xb [m ], and is 0 for the silence frames of x [m] and the noise frames of xb [m] and y [m].
- a step a3 loudness measurements are carried out on the frames of the signals x [m], xb [m] and y [m], whatever the result of the detection of voice activity on these frames.
- cepstral distance dc_xy [m] between the frames m of the signals x [m] and y [m] is calculated.
- the loudness densities S ⁇ (m, b), S x (m, h), and S xb (m, b) of the respective frames y [m], x [mj and xb are calculated.
- [m], b being the number of a critical band in the Barks domain.
- the sampling frequency being 8 kHz
- the calculated values having the critical band index b are calculated on each of the 18 critical bands considered.
- a step a4 the hybrid masking thresholds of the signals x [m] and y [m] are calculated.
- a global hybrid mask threshold S mage (m, b) of the processed signal taking the minimum of the thresholds calculated on the following signals x [m] and y [m] the following equation:
- T x (m, b) is the hybrid masking threshold of the signal x [m] on the frame m and the critical band b
- the hybrid masking threshold S ma ⁇ uuge (m, b) is taken equal to the hybrid masking threshold of the signal x [m], or to the hybrid masking threshold of the signal y [m], these two thresholds being very close each other in practice.
- the masking threshold S mm ⁇ Mgt , (m, b) is taken equal to the minimum of the masking thresholds calculated on the signals x [m] and y [m], that is to say using the masking threshold model of JD Johnston in his article
- the masking threshold S mmqm ⁇ ge (m, h) is also possible, in the method according to the invention, to take the masking threshold S mmqm ⁇ ge (m, h) equal to Johnston masking threshold of signal x [m], or Johnston masking threshold of signal y [m], or ISO masking threshold of signal x [m], or even ISO masking threshold of signal y [
- a masking threshold makes it possible to consider that a degradation lower than this threshold is not felt by the user and therefore should not be counted in the perceived degradations, which is taken into account when step a8.
- a step a5 the distances in mean value d ⁇ x ⁇ m, b) and d xh ⁇ (m, b) are calculated respectively between the loudness densities of the signal y [m] and the loudness densities of the signal x [m] , and between the loudness densities of the signal xb [m] and the loudness densities of the signal y [m]. More precisely, these distances are given for each frame m and each critical band b by the following equations:
- a partition is made of the distances d YY (mb) thus calculated, or more precisely of the doublets (m, b), by comparison with the hybrid masking thresholds calculated in step a4.
- k being an index varying from 1 to 3, defined as follows: -
- the distances belonging to the part (1) subset obey the following conditions:
- a step a7 one passes from the frame rate m to a frame rate p, where p is an integer number of times the size of a frame m, for example 20 times the size of a frame m.
- p is an integer number of times the size of a frame m, for example 20 times the size of a frame m.
- weighted averages of the absolute values of the distances d rx (m, b) are carried out by the corresponding loudness densities S x (m, b). These averages are performed on a set P of frames p, P equal for example to 24, and on the 18 critical bands b considered in the Barks domain. They each differ according to the doublets (m, b) taken into account in their calculation, these being chosen according to the part subset (k) to which they belong, and according to the result of the voice activity detection. DAVfmj, determined in step a2, on the frame m.
- the parameter deg (1) characterizes the residual noise on frames without voice activity
- the parameter deg ⁇ 2) characterizes the subtractive degradations due to noise on the frames with voice activity
- the parameter deg (3) characterizes the additive degradations due to noise on the frames with voice activity
- the deg (4) parameter characterizes the overall degradation due to noise on frames with voice activity.
- a step a9 the processed signal is classified according to the different types of noise degradation present in the signal. For this, we calculate for each subset part (k) defined in step a6, a proportion "size (k)" of doublets (m, b) for which the distances d ⁇ x (m, h) belong to this subset part (k).
- the size proportion (k), k being the subset index and therefore varying from 1 to 3, is defined by the following equation: number of doublets (m, b) such that: d ⁇ x (m, b) depart (k)
- number of doublets (m, b) the number of doublets (m, b) being in this embodiment equal to 250 frames m times 18 critical bands b.
- the degradation class t of the processed signal is then obtained by carrying out the following tests on the size (1) and size (3) proportions previously obtained:
- the processed signal obtains the degradation class 1.
- the thresholds used to define these proportions are examples which can be modified according to additional experiments allowing to improve the process according to the invention.
- NOS ⁇ (i, t) * deg (z) + ⁇ (5, t) * Deviation _type (d ⁇ x (m, b)) + ⁇ (6, t) * Deviation __ type (d xb ⁇ ⁇ m, b)) + ⁇ (7, () * ⁇ dc x ⁇ )
- DA v ⁇ + ⁇ (S, t)
- the coefficients ⁇ ⁇ 1, t) to ⁇ ⁇ 8, t) are weighting coefficients predefined as a function of each of the six classes of degradations t. For example, if the degradation class t determined in step a9 is equal to 1, the coefficients ⁇ (1, 1) to ⁇ (8.1) are used in the calculation of the note NOS. These coefficients were determined so as to obtain a maximum correlation between the subjective data coming from a subjective test database, and the objective NOS scores calculated by this linear combination using the test signals, noisy and processed x [m ], xb [m] and y [m] used during these same subjective tests and representative of the six classes of degradation defined in step a9.
- the subjective test database is for example a database of notes obtained with groups of listeners in accordance with "ITU-T Recommendation P.835", in which these notes are called "speech signal" notes.
- weighting coefficients by using a subjective test database is not essential at each step of calculating an objective NOS score. In fact, these coefficients must be obtained before the first use of the process, and can be the same for all the uses of the process. These coefficients are nevertheless bound to change when new subjective data are added to the subjective test database used.
- an objective score NOS_MOS of the signal processed on the MOS scale is calculated using for example a polynomial function of order 3, according to the following equation:
- NOS _ MOS ] TA (/, t) (NOS) ' " ', where the coefficients ⁇ (1, t) to ⁇ (4, t), are determined for each degradation class t of the signal processed so that that the objective score obtained NOS-MOS characterizes the signal processed on the MOS scale, that is to say on a scale of 1 to 5.
- the perceived quality of an audio signal degraded by the presence of noise is evaluated objectively.
- the same test environment is used as in FIG. 1, but by removing the module Noise reduction MRB.
- the audio signal source SSA delivers a test audio signal x (n) containing only the useful signal, to which is added a predefined noise signal generated by the noise source SB, to obtain the output of the addition operator.
- test signal x (n) and the noisy signal xb (n) are then directly sent to the input of the EQT test equipment implementing a method for objective evaluation of the perceived quality of the degraded audio signal xb ( n) according to the invention
- the signals x (n) and xb (n) are assumed to be sampled at the sampling frequency 8 kHz
- the EQT test equipment outputs an evaluation result RES, which is an objective note NOS_MOS of the perceived quality of the degraded audio signal xb (n)
- the method for calculating the objective score NOS_MOS of the perceived quality of the degraded audio signal xb (n) is represented in the form of an algorithm comprising steps b1 to b11 These steps are similar to steps ai to a1 1 previously described in the first embodiment, and will therefore be a little less detailed It is indeed to be noted that if the calculation steps ai a a1 1 are applied with the signal y (n) equal to the signal xb (n) in the case of the first embodiment, we arrive at the second embodiment
- a voice activity detection is performed on the test signal x [m] so as to determine whether each respective current frame of index m of the noisy signal xb [m] is a frame containing only noise or a frame containing speech.
- the variable DAV [m] represented in FIG. 3 result of the detection of voice activity, is equal to 1 for the speech frames of the signals x [m] and xb [m], and is equal to 0 for the silence frames of the signal x [m] and the noise frames of the signal xb [m].
- a step b3 the loudness densities S ⁇ (m, b), and S xb (m, b) of the respective frames x [m] and xb [m] are calculated, b being the number of one of the 18 bands critics considered in the Barks domain, as well as the cepstral distance dç_xxb [m] between the m frames of the signals x [m] and xb [m].
- a step b4 the hybrid masking thresholds of the signals x [m] and xb [m] are calculated for each frame m and each critical band b.
- the global hybrid masking threshold S mmishing (m, b) of the noisy signal is then obtained by taking the minimum of these thresholds, according to the following equation:
- S nuu ⁇ ⁇ Jm, b) is taken equal to the minimum of Johnston masking thresholds, or at least ISO masking thresholds, signals x [m] and xb [m]. It is also possible to choose the masking threshold S mMq ⁇ age ⁇ m, b) equal to the Johnston masking threshold or to the ISO masking threshold of the signal x [m], or to the Johnston masking threshold or to the masking threshold ISO signal y [m].
- a step b5 the distances in mean value d xhx (m, b) between the loudness densities of the signal xb [m] and the loudness densities of the signal x [m] are calculated. More precisely, these distances are given for each frame m and each critical band b by the following equations:
- the loudness densities values S x (m, b) and S Xh (m, b) being those calculated in step b3.
- a partition is made of the distances d XhX (m, b) thus calculated, or more precisely of the doublets (m, b), by comparison with the hybrid masking thresholds calculated in step b4.
- k being an index varying from 1 to 3, defined as follows:
- a step b7 one passes from the frame rate m to a frame rate p, where p is an integer number of times the size of a frame m, for example 20 times the size of a frame m.
- weighted averages of the absolute values of the distances d XhX (m, b) are carried out by the corresponding loudness densities S x (m, b). These averages are performed on a set P of frames p, P equal for example to 12, and on the 18 critical bands b considered in the Barks domain. They each differ according to the doublets (m, b) taken into account in their calculation, these being chosen according to the part (k) subsets to which they belong, and according to the result of the voice activity detection. DAV [m], determined in step a2, on the frame m.
- these parameters each correspond to a type of degradation, which makes it possible to obtain an objective note of the degraded signal closer to the results of the subjective tests than if only an overall degradation was taken into account. due to noise on the noisy signal.
- the noisy signal degradation class t is then obtained by carrying out the following tests on the size (1) and size (3) proportions previously obtained:
- step a9 taking into account this classification of the degradation of the noisy signal in the calculation of the objective score of the signal noisiness allows a result closer to the corresponding subjective score to be obtained than if this classification were not taken into account.
- a r i denotes the mean cepstral distance between the signals x [m] and xb [m] calculated on the speech frames of these signals,
- the coefficients ⁇ (1, t) to ⁇ (7, t) are weighting coefficients predefined as a function of each of the six degradation classes t.
- an objective score NOS_MOS of the noisy signal on the MOS scale is calculated using for example a polynomial function of order 3, according to the following equation:
- N0S_M0S ⁇ (i J) (NOS) '- 1 , where the coefficients ⁇ (1, t) to ⁇ (4, t), are determined for each degradation class t of the noisy signal so that the note objective obtained NOS-MOS characterizes the noisy signal on the MOS scale, i.e. on a scale of 1 to 5.
- the calculation according to the invention of the loudness densities S ⁇ ⁇ m, b) of a frame of any index m of a given audio signal u [m], comprises steps d to c6,
- the calculation according to the invention of the hybrid masking threshold of a frame of any index m of a given audio signal u [m], comprises steps d to c5 and c7 to c9,
- step d a windowing is applied to the frames of index m of the signals u [m] and v [m], for example a windowing of the Hanning, Hamming or equivalent type.
- a windowing of the Hanning, Hamming or equivalent type we then obtain two windowed frames u_w [m] and v_w [m].
- step d for example during step a3 for the calculation of the cepstral distance dc_xy [m], we go to step c10, then to step c2 for the calculation of the densities of loudness and hybrid masking thresholds of the signals x [m] and y [m], necessary in step a3.
- step c2 for the signal xb [m] during step a3, for example, we pass directly from step d to step c2 for the calculation of the loudness densities of the signal xb [m] on the frame of index m .
- a fast Fourier transform (FFT) is applied to the windowed frame u_w [m] and a corresponding frame U (m, f) is obtained in the frequency domain.
- FFT fast Fourier transform
- the power spectral density ⁇ u (m, f) of the frame U (m, f) is calculated. Such a calculation is known to those skilled in the art and will therefore not be detailed here.
- step c4 we apply to the spectral power density ⁇ Lt (m, f) obtained in the previous step, a conversion of the frequency axis to the Barks scale, and we therefore obtain a density power spectral, B LI (m, b), on the Barks scale, also called Bark spectrum.
- step c5 we apply to the spectral power density on the Barks scale, B 1 , (m, b), a convolution with the function of spreading currently used in psychoacoustics, and one obtains consequently a spectral density spread out on the scale of the Barks, noted Eu (ITUb).
- This spreading function was formulated mathematically and a possible expression is:
- step c5 for example during step a3 for the signals x [m] and y [m], we go to steps c7 to c9 for the calculation of the hybrid masking thresholds of the signals x [ m] and y [m], then in step c6 for the calculation of the loudness densities of these signals, since for these two signals the two calculations are necessary.
- step a3 for the signal xb [m] we pass for example directly to step c6 for the calculation of loudness densities.
- step c6 the spread spectral density E ⁇ (m, b) previously obtained is converted into loudness densities expressed in sones.
- a calibration of the spectral density spread over the Barks scale, E 1 , (m, b) is carried out by the respective power scaling and loudness scaling factors commonly used in psychoacoustics.
- the conversion on the scale of the phones is carried out by relying on the isonia curves (Fletcher curves) in accordance with standard NF ISO 226 "Normal isonic lines”.
- the conversion to sones is carried out in accordance with Zwicker's law according to which: 'ÎN (phone) -40 ⁇
- step c6 there are as many loudness density values, S ⁇ (m, b), of the frame of index m for the critical band b, as there are critical bands considered in l Barks scale, b being the critical band index.
- This last step c6 of loudness density calculation corresponds to a conversion from the Barks domain to the Sones domain, making it possible to calculate a subjective intensity, that is to say as perceived by the human ear.
- step c7 the tone coefficient ⁇ (m) of the frame of index m is calculated according to the following equation:
- the coefficient of tone ⁇ of a basic signal is a measure allowing to show if certain pure frequencies emerge from this signal, it is equivalent to a tonal density. Indeed "the more the coefficient of tonality has is close to 0, the more the signal is assimilated to noise. Conversely, the closer the tone coefficient ⁇ to 1, the more the signal has a majority tonal component. A tone coefficient ⁇ close to 1 therefore attests to the presence of a useful signal, or speech signal.
- correction thresholds 0 (m, b) are calculated for each critical band b of the frame m, making it possible to take into account the asymmetry between the masking of a tonal by noise and of a noise by a tonal.
- the level of correction applied to the spread spectrum thus depends on the harmonic nature or not of the signal which is determined by means of the tone coefficient ⁇ (m) previously calculated.
- An expression of the correction thresholds 0 (m, b) according to the invention is given by the formula:
- NMT Is ⁇ (b) from the English "Noise Masking Tone”. is the corrective value in decibels to be applied for the critical band b in the case of a noise masking a tonal, according to this same psychoacoustic model.
- the hybrid masking thresholds are calculated for each critical band b on the frame of the signal u [m].
- the hybrid masking thresholds T 1 (m, h) are given by the following equation:
- the calculation of the hybrid masking thresholds T 1 . (m, b) according to the invention uses a hybrid model between the psychoacoustic model number 1 of the ISO standard and the Johnston model, described in the article cited above, insofar as the tone coefficient used is that defined in the Johnston model while the corrective values TMN lso (b) and NMT 150 (b) used are those defined in the model of the ISO standard. This overcomes the arithmetic complexity of calculating the tone coefficient according to the model of the ISO standard, which differs for each critical band b. The calculation load of the method according to the invention is thus reduced.
- step c10 the cepstral distance dc_uv [m] is calculated.
- dc_uv [m] the cepstral distance dc_uv [m]
- the coefficients ⁇ a, ⁇ and ⁇ a'J are the linear prediction coefficients of the LPC analysis, according to the English "Linear Predictive Coding", of order 10, calculated respectively on the frame of index m of the signal u [m] and on the frame of index m of the signal v [m]
- the number N being taken equal to twice the order of the self-regressive model of the LPC analysis.
- the energy difference (c o -cO) 2 will not be taken into account in the calculation, since it is insignificant on the perceptual level.
- the mean of the cepstral distances dc_xy [m] and dc_xxb [m] is calculated. Indeed, for example the cepstral distance over time dc_xy [m] allows to visualize the temporal distribution of the degradations of the processed signal y [m] compared to the test signal x [m].
- the average (dc ⁇ l ) ,, AV _ ⁇ of the cepstral distances dc_xy [m] on the speech frames makes it possible to obtain a single note for the processed signal y [m
- step a9 is independent of steps a7 and a8 .
- steps for example ordered according to the list ⁇ ai, a3, a5, a4, a6, a9, a7, a2, a8, a10, a11 ⁇ , with the calculation of the cepstral distance between the signals x [m] and y [m] which is carried out in step a10 instead of being done in step a3.
Landscapes
- Engineering & Computer Science (AREA)
- Computational Linguistics (AREA)
- Signal Processing (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Physics & Mathematics (AREA)
- Acoustics & Sound (AREA)
- Multimedia (AREA)
- Quality & Reliability (AREA)
- Compression, Expansion, Code Conversion, And Decoders (AREA)
- Measurement Of Mechanical Vibrations Or Ultrasonic Waves (AREA)
Abstract
L'invention concerne un procédé de calcul d'une note objective (NOS) de la qualité perçue d'un signal audio dégradé par la présence de bruit et traité par une fonction de réduction de bruit, ledit procédé comprenant une étape préalable d'obtention d'un signal audio prédéfini de test (x[m]) contenant un signal utile dépourvu de bruit, d'un signal bruité (xb[m]), obtenu en additionnant un signal de bruit prédéfini au signal de test (x[m]), et d'un signal traité (y[m]), obtenu par application de la fonction de réduction de bruit au signal bruité (xb[m]), ledit procédé étant caractérisé en ce qu'il comporte: une étape (a5) de mesure de distances (d<SUB>YX</SUB> (m,b)) entre des densités de sonie calculées sur le signal traité (y[m]) et des densités de sonie calculées sur le signal de test (x[m]) ; et une étape (a6) de comparaison desdites distances (d<SUB>YX</SUB> (m,b)) avec des seuils de masquage (S <SUB>masquage
Description
Procédé de mesure de la qualité perçue d'un signal audio dégradé par la présence de bruit
La présente invention se situe de manière générale dans les domaines du traitement du signal de parole et de la psychoacoustique. Plus précisément l'invention concerne un procédé et un dispositif permettant d'évaluer objectivement la qualité perçue d'un signal audio dégradé par la présence de bruit, et notamment lorsqu'un tel signal audio est traité par une fonction de réduction de bruit
Dans le domaine de la transmission de signaux audio, une fonction de réduction de bruit, aussi appelée fonction de suppression de bruit ou de débruitage, a pour objectif de réduire le niveau de bruit de fond dans une communication vocale, ou ayant au moins une composante vocale Elle présente un intérêt spécifique lorsque l'un des interlocuteurs de cette communication est immergé dans un milieu bruité qui nuit fortement à l'intelligibilité de sa voix Les algorithmes de réduction de bruit sont basés sur une estimation en continu du niveau du bruit de fond à partir du signal incident et d'une détection d'activité vocale permettant de distinguer les périodes de bruit seul de celles avec du signal de parole utile Un filtrage du signal de parole incident, correspondant au signa! de parole bruité est ensuite effectué de façon à réduire la contribution du bruit déterminée à partir de l'estimée du bruit
La qualité perçue d'un signal vocal dégradé en présence de bruit est évaluée aujourd'hui de manière subjective seulement en se basant sur l'exploitation de résultats de tests mis en œuvre selon le document "Recommandation UIT-T P 835 (11/2003)" Cette évaluation est faite sur une échelle de type MOS, d'après l'anglais "Mean Opinion Score" qui donne une note de un a cinq du signal vocal dégrade appelé "speech signal" dans ce même document îl est a noter qu'une précédente demande de brevet français
FR0501747 déposée par la demanderesse propose une solution pour mesurer la gêne due au bruit dans un signal audio. Cependant cette dernière solution s'attache à obtenir une note objective de la gêne due au bruit dans un signal audio, correspondant à la note appelée "background" dans la recommandation "UIT-T P.835", et non à obtenir une note objective sur le signal audio lui-même, note qui s'avère plus complexe à définir.
L'inconvénient majeur de la technique d'évaluation actuelle de la qualité perçue d'un signal audio dégradé est la nécessité de mettre en oeuvre des tests subjectifs, cette mise en œuvre étant très lourde et très coûteuse. En effet chaque contexte particulier, c'est-à-dire un type de signal incident associé à un type de bruit et une fonction de réduction de bruit, nécessite de mettre un panel de personnes en situation d'écoute réelle d'échantillons de parole afin de leur demander de noter le signal audio dégradé selon une échelle de type MOS.
C'est pourquoi le développement de méthodes objectives alternatives pouvant compléter ou suppléer les méthodes subjectives est un sujet de grand intérêt. L'illustration la plus frappante de ce phénomène est le modèle de qualité d'écoute, en constante évolution, contenu dans les documents "Recommandation UIT-T P.862 (02/2001)" et " Recommandation UIT-T P.862.1 (11/2003)". Néanmoins ce modèle ne s'applique pas à l'évaluation de la qualité perçue d'un signal audio dégradé par la présence de bruit. En effet, l'utilisation de ce modèle pour tenter de noter objectivement un signal audio dégradé par la présence de bruit donne des résultats n'ayant qu'une très faible corrélation avec les notes "speech signal" sur l'échelle MOS que l'on obtient avec les tests subjectifs correspondants de la recommandation "UIT-T P.835".
La présente invention a pour but de résoudre les inconvénients de Ia technique antérieure en fournissant un procédé et un dispositif de calcul objectif d'une note équivalente à la note subjective telie qu'indiquée dans ie
document "Recommandation UIT-T P.835", caractérisant la qualité perçue d'un signal audio dégradé par la présence de bruit. Le procédé selon l'invention s'applique aussi bien à un signal audio bruité quelconque qu'à un signal audio bruité traité par une fonction de réduction de bruit, notamment dans les paramètres de calcul de la note objective selon l'invention. En effet, même si en général l'invention sera utilisée pour évaluer la qualité perçue d'un signal audio dégradé en sortie d'un équipement de communication implémentant une fonction de réduction de bruit, l'invention s'applique aussi aux signaux bruités non traités par une telle fonction. Le cas d'utilisation de l'invention sur un signal audio bruité quelconque est donc un cas particulier du cas plus général d'utilisation de l'invention sur un signal audio bruité traité par une fonction de réduction de bruit. Afin de bien décrire ces deux cas d'utilisation, deux modes de réalisation sont présentés. Cependant le second mode de réalisation, s'appliquant à un signal audio bruité quelconque, se déduit aisément de celui-ci. Dans la suite, lorsque le mode de réalisation n'est pas précisé, les termes "signal audio dégradé" désignent le signal audio évalué, c'est-à-dire le signal traité pour le premier mode de réalisation, ou le signal bruité pour le second mode de réalisation.
A cette fin, l'invention propose, dans un premier mode de réalisation, un procédé de calcul d'une note objective de la qualité perçue d'un signal audio dégradé par la présence de bruit et traité par une fonction de réduction de bruit, ledit procédé comprenant une étape préalable d'obtention d'un signal audio prédéfini de test contenant un signa! utile dépourvu de bruit, d'un signal bruité, obtenu en additionnant un signai de bruit prédéfini au signal de test, et d'un signal traité, obtenu par application de Ia fonction de réduction de bruit au signal bruité, ledit procédé étant caractérisé en ce qu'il comporte:
- une étape de mesure de distances entre des densités de sonie calculées sur Ie signal traité et des densités de sonie caicuiées sur !e signai de test,
- et une étape de comparaison desdites distances avec des seuils de masquage calculés sur au moins un des signaux de test et traité.
Ce procédé a l'avantage d'une mise en œuvre simple, immédiate et rapide contrairement aux tests subjectifs. Il peut être mis en œuvre dans un logiciel sur un ordinateur ou être intégré dans un équipement de mesure de la performance des fonctions de réduction de bruit. On rappellera ici que l'expression "sonie psychoacoustique" peut être définie comme le caractère de la sensation auditive lié à la pression acoustique et à la structure du son. En d'autres termes, il s'agit de la force sonore d'un son ou d'un bruit en tant que sensation auditive (cf. Office de la langue française, 1988). La sonie est représentée par une échelle de sonie psychoacoustique (en sones). D'autre part, la densité de sonie, encore désignée par "intensité subjective", est une mesure particulière de la sonie.
Selon une caractéristique préférée, le procédé selon le premier mode de réalisation de l'invention comporte les étapes de :
- Détection d'activité vocale sur le signal de test,
- Calcul de densités de sonie sur le signal traité, le signal bruïté et le signal de test,
- Calcul sur au moins un des signaux traité et de test, de seuils de masquage,
- Calcul de distances entre lesdites densités de sonie du signal traité et lesdites densités de sonie du signal de test, ainsi que de distances entre lesdites densités de sonie du signal traité et tesdites densités de sonie du signal bruité,
- Partition des distances ainsi calculées entre les densités de sonie du signal traité et les densités de sonie du signal de test par comparaison avec tesdits seuils de masquage,
- Calcul de moyennes des distances ainsi partitionnées en fonction de ladite partition et du résultat de la détection d'activité vocale, afin
d'obtenir des paramètres caractéristiques de différents types de dégradations dues au bruit dans le signal traité,
- Calcul d'une note objective du signal traité, utilisant les paramètres ainsi obtenus, les distances calculées à l'étape de calcul de distances, et des données subjectives issues d'une base de données de tests. L'étape de partition, qui utilise des seuils de masquage et des distances calculées sur les signaux de test et traité, permet de tenir compte de différents types de dégradations du signal traité, et d'obtenir ainsi une note objective du signal traité très proche de la note subjective qui serait obtenue avec des tests subjectifs.
L'invention concerne aussi, dans un second mode de réalisation de l'invention, un procédé de calcul d'une note objective de la qualité perçue d'un signal audio dégradé par la présence de bruit, ledit procédé comprenant une étape préalable d'obtention d'un signal audio prédéfini de test contenant un signal utile dépourvu de bruit et d'un signal bruité, obtenu en additionnant un signal de bruit prédéfini au signal de test, ledit procédé étant caractérisé en ce qu'il comporte:
- une étape de mesure de distances entre des densités de sonie calculées sur le signal bruité et des densités de sonie calculées sur le signal de test,
- et une étape de comparaison desdites distances avec des seuils de masquage calculés sur au moins un des signaux bruité et de test.
Les avantages de ce second mode de réalisation de l'invention sont similaires à ceux du premier mode de réalisation de l'invention, mais ce second mode de réalisation de l'invention s'applique à un signal audio bruité quelconque.
Selon une caractéristique préférée, le procédé selon le second mode de réalisation de l'invention comporte les étapes de :
- Détection d'activité vocale sur le signal de test,
- Calcul de densités de sonie sur Ie signai bruité et Ie signal de test,
- Calcul sur au moins un des signaux bruité et de test, de seuils de masquage,
- Calcul de distances entre lesdites densités de sonie du signal de test et lesdites densités de sonie du signal bruité,
- Partition des distances ainsi calculées par comparaison avec lesdits seuils de masquage,
- Calcul de moyennes des distances ainsi partitionnées en fonction de ladite partition et du résultat de la détection d'activité vocale, afin d'obtenir des paramètres caractéristiques de différents types de dégradations dues au bruit dans le signal bruité,
- Calcul d'une note objective du signal bruité, utilisant les paramètres ainsi obtenus, les distances ainsi calculées, et des données subjectives issues d'une base de données de tests.
L'étape de partition permet de tenir compte de différents types de dégradations du signal bruité, et d'obtenir ainsi une note objective du signal bruité très proche de la note subjective qui serait obtenue avec des tests subjectifs.
Selon une caractéristique préférée de ces modes de réalisation de l'invention, l'étape de partition est suivie d'une étape de classification du signal audio dégradé en fonction des types de dégradations présents dans ledit signal, le calcul de la note objective tenant compte de cette classification.
Le fait de classifier le signal audio dégradé permet d'adapter le calcul de la note objective du signal audio dégradé, à la dégradation particulière de ce signal audio, afin d'obtenir une note objective encore plus proche de celle qui serait obtenue avec des tests subjectifs.
Selon une autre caractéristique préférée, l'étape de calcul de moyennes est précédée d'une étape de changement de cadence de trames.
Cette étape permet de travailler sur des trames de périodes plus longues, plus représentatives des périodes sur lesquelles un auditeur percevrait le signal audio dégradé (ors de tests subjectifs.
Selon une autre caractéristique préférée, l'étape de calcul de la note objective est suivie d'une étape de calcul d'une note objective sur l'échelle MOS de la qualité perçue du signal audio dégradé.
Cette étape permet d'obtenir une note objective du signal audio dégradé sur la même échelle standard que celle utilisée dans les tests subjectifs de la "Recommandation UIT-T P.835".
Selon une autre caractéristique préférée, le calcul des seuils de masquage d'une trame de signal audio utilise un modèle hybride entre le modèle de masquage de Johnston et le modèle de masquage ISO, d'après l'anglais "International Standard Organisation".
L'utilisation de ce modèle hybride permet de diminuer le nombre de calculs, par rapport à la seule utilisation du modèle de masquage ISO, dans la réalisation du procédé selon l'invention.
L'invention concerne également un équipement de test destiné à évaluer une note objective de la qualité perçue d'un signal audio dégradé par la présence de bruit, caractérisé en ce qu'il comporte des moyens adaptés à mettre en oeuvre le procédé selon l'un des modes de réalisation de l'invention.
L'invention concerne encore un programme d'ordinateur sur un support d'informations, comportant des instructions adaptées à la mise en oeuvre du procédé selon l'un des modes de réalisation de l'invention, lorsque ledit programme est chargé et exécuté dans un système informatique.
Les avantages de cet équipement de test ou de ce programme d'ordinateur sont identiques à ceux mentionnés plus haut en relation avec le procédé selon l'un des modes de réalisation de l'invention.
D'autres caractéristiques et avantages apparaîtront à la lecture de modes de réalisation préférés décrits en référence aux figures dans lesquelles
la figure 1 représente un environnement de test destiné à calculer une note objective de la qualité perçue d'un signal audio dégradé par la présence de bruit et traité par une fonction de réduction de bruit, selon un premier mode de réalisation de l'invention,
la figure 2 est un organigramme illustrant un procédé de calcul d'une note objective de la qualité perçue d'un signal audio dégradé par la présence de bruit et traité par une fonction de réduction de bruit selon un premier mode de réalisation du procédé selon l'invention, la figure 3 est un organigramme illustrant un procédé de calcul d'une note objective de la qualité perçue d'un signal audio dégradé par la présence de bruit selon un second mode de réalisation du procédé selon l'invention,
la figure 4 est un organigramme illustrant le mode de calcul de la densité de sonie et du seuil de masquage d'une trame de signal audio, ainsi que le mode de calcul de la distance cepstrale entre deux trames correspondantes de deux signaux audio, selon l'invention.
Deux modes de réalisation du procédé selon l'invention sont décrits dans la suite, le premier étant appliqué à un signal audio bruité traité par une fonction de réduction de bruit, et le second étant appliqué à un signal audio bruité quelconque. Le principe du procédé selon l'invention est le même dans ces deux modes de réalisation, en particulier le procédé de calcul est exactement le même, mais dans le second mode de réalisation le signal audio traité par une fonction de réduction de bruit est pris égal au signal bruité. Le second mode de réalisation peut en effet être considéré comme un cas particulier du premier mode de réafisation, avec une fonction de réduction de bruit inhibée.
Selon un premier mode de réalisation du procédé selon l'invention, la qualité perçue d'un signal audio dégradé par la présence de bruit et traité par une fonction de réduction de bruit est évaluée de manière objective dans un environnement de test représenté à la figure 1. Un tel environnement de test comprend une source de signaux audio SSA délivrant un signal audio de test x(n) ne contenant que du signal utile, c'est-à-dire dépourvu de bruit, par exemple un signal de parole, et une source de bruit SB délivrant un signal de bruit prédéfini.
Aux fins de test, ce signal de bruit prédéfini est ajouté au signal de test x(n) choisi, comme représenté par l'opérateur d'addition AD. Le signal audio résultant de cette addition de bruit au signal de test x(n) est noté xb(n) et est désigné par l'expression "signal bruité".
Le signal bruité xb(n) constitue alors le signal d'entrée d'un module MRB de réduction de bruit mettant en oeuvre une fonction de réduction de bruit délivrant en sortie un signal audio y(n) désigné par l'expression "signal traité". Le signal traité y(n) est donc un signal audio contenant du signal utile et un bruit résiduel.
Le signal traité y(n) est ensuite délivré à un équipement de test EQT mettant en oeuvre un procédé d'évaluation objective de la qualité perçue du signal traité, selon l'invention. Typiquement le procédé selon l'invention est implémenté dans l'équipement de test EQT sous la forme d'un programme d'ordinateur. En plus ou en remplacement de moyens logiciels, l'équipement de test EQT comporte éventuellement des moyens matériels électroniques pour irnpiémenter le procédé selon l'invention. Outre le signal y(n), l'équipement de test EQT reçoit en entrée le signal de test x(n) et le signal bruité xb(n).
L'équipement de test EQT délivre en sortie un résultat d'évaluation RES1 qui est une note objective NOS_MOS de la qualité perçue du signa! traité y(n). Le mode de catcul de cette note objective NOSJMGS sera décrit plus bas.
Les signaux audio précités x(n), xb(n) et y(n) sont des signaux échantillonnés dans un format numérique, n désignant un échantillon quelconque Ces signaux sont par exemple supposés échantillonnés à la fréquence d'échantillonnage de 8 kHz (kilo Hertz)
Dans le mode de réalisation décrit et représenté ICI, le signal de test x(n) est un signal de parole dépourvu de bruit Le signal bruité xb(n) représente alors le signal vocal initial x(n) dégradé par un environnement bruité (bruit de fond ou bruit ambiant), et le signal y(n) représente le signal xb(n) après réduction de bruit
Selon un exemple de mise en oeuvre de l'invention, le signal x(n) est généré dans une chambre anéchoique Cependant, le signal x(n) peut être aussi généré dans une pièce "calme" ayant un temps de réverbération "moyen", inférieur à 0,5 seconde
Le signal bruité xb(n) est obtenu en ajoutant une contribution prédéterminée de bruit au signal x(n) Le signal y(n) est obtenu soit en sortie d'un algorithme de réduction de bruit implante sur un ordinateur personnel, soit à la sortie d'un équipement réseau réducteur de bruit et dans ce dernier cas, le signal y(n) est prélevé au niveau d'un codeur MIC (modulation par impulsion et codage)
En référence à la figure 2, le procédé de calcul de la note objective NOSJVIOS de la qualité perçue du signa! traite y(n) selon l'invention est représente sous la forme d'un algorithme comportant des étapes ai a ai 1
Dans une étape ai , les signaux x(n), xb(n) et y(n) sont respectivement découpes en fenêtres temporelles successives appelées trames Chaque trame de signal notée m contient un nombre prédétermine d'échantillons du signal l'étape ai consiste donc en un changement de cadence de chacun de ces signaux Les signaux x(n), xb(n) et y(n) passes en cadence de trames produisent respectivement les signaux x[m] xb[m] et y[m] ou m est l'indice de la trame considérée
Dans la suite, on travaille sur un ensemble de trames. Par exemple si on utilise 8 secondes de signal de test échantillonné à 8kHz, on pourra travailler sur 250 trames x[m] de 256 échantillons de signal x(n). De plus les valeurs calculées le sont sur chaque trame m de cet ensemble de trames, et ont donc toutes un indice de trame m.
Dans une étape a2, une détection d'activité vocale (DAV) est effectuée sur le signal x[m] de manière à déterminer si chaque trame respective courante d'indice m des signaux xb[m] et y[m], est une trame contenant seulement du bruit, ou une trame contenant de la parole, c'est-à-dire du signal utile. Cette détermination se fait par comparaison des signaux xb[m] et y[m] avec le signal de test x[m] dénué de bruit. Chaque trame de silence de x[m] correspond en effet temporellement à une trame de bruit pour les signaux xb[m] et y[m], tandis que chaque trame de parole de x[m] correspond à une trame de parole pour les signaux xb[m] et y[m].
En sortie de l'étape a2, la variable DAV[m] représentée sur la figure 2, résultat de la détection d'activité vocale, vaut 1 pour les trames de parole de x[m], y[m] et xb[m], et vaut 0 pour les trames de silence de x[m] et les trames de bruit de xb[m] et y[m].
Dans une étape a3, des mesures de sonie sont effectuées sur les trames des signaux x[m], xb[m] et y[m], quelque soit le résultat de la détection d'activité vocale sur ces trames. De plus la distance cepstrale dc_xy[m] entre les trames m des signaux x[m] et y[m] est calculée.
Plus précisément, à cette étape, on calcule les densités de sonie Sγ(m,b) , Sx(m,h) , et Sxb(m,b) des trames respectives y[m], x[mj et xb[m], b étant le numéro d'une bande critique dans le domaine des Barks. Dans cet exemple de réalisation, la fréquence d'échantillonnage étant de 8kHz, on travaille sur 18 bandes critiques et il y a donc 18 valeurs de densités de sonie à calculer pour chaque trame m. Dans Ia suite, les valeurs calculées ayant l'indice b de bande critique sont calculées sur chacune des 18 bandes critiques considérées.
Le calcul des densités de sonie S,,(m.b) d'une trame m quelconque d'un signal audio donné u, ainsi que le calcul de la distance cepstrale dc_uv[m] entre une trame m quelconque d'un signal audio donné u et la trame m d'un signal audio donné v, seront détaillé plus loin en liaison avec la figure 4.
Dans une étape a4, on calcule les seuils de masquage hybrides des signaux x[m] et y[m]. On obtient alors pour chaque trame m et chaque bande critique b, un seuil de masque hybride global Smamage(m,b) du signal traité, en prenant le minimum des seuils calculés sur les signaux x[m] et y[m] suivant l'équation suivante:
SιmaιlumΛm,b) = mm(Tx(m,b)Jy(m,h)) où
- min(p,q) est le minimum des variables p et q,
- Tx (m,b) est le seuil de masquage hybride du signal x[m] sur la trame m et la bande critique b,
- et Tγ(m,b) le seuil de masquage hybride du signal y[m] sur la trame m et la bande critique b.
En variante le seuil de masquage hybride S ma^uuge(m,b) est pris égal au seuil de masquage hybride du signal x[m], ou au seuil de masquage hybride du signal y[m], ces deux seuils étant très proches l'un de l'autre en pratique.
Le calcul du seuil de masquage hybride T1 (m.b) ό'une trame m dans la bande critique b d'un signal audio donné u, sera détaillé plus loin en liaison avec la figure 4.
En variante, îe seuil de masquage SmmψMgt,(m,b) est pris égal au minimum des seuils de masquage calculés sur les signaux x[m] et y[m], soit en utilisant le modèle de seuil de masquage de J. D. Johnston dans son article
"Transform coding of audio signais using perceptual noise criteria" du journal "IEEE Journal on seiecîβd areas in communications, vol.6, n°21 February
1988", soit en utilisant le seuil de masquage défini dans le modèle psychoacoustique numéro 1 de la norme ISO. Il est également possible, dans le procédé selon l'invention, de prendre le seuil de masquage S mmqmιge(m,h) égal au seuil de masquage de Johnston du signal x[m], ou au seuil de masquage de Johnston du signal y[m], ou au seuil de masquage ISO du signal x[m], ou encore au seuil de masquage ISO du signal y[m]. En pratique, on préfère utiliser le modèle hybride pour calculer le seuil de masquage Sma,φ4age(m,b) , car ce modèle, étant moins complexe en termes de calculs que le modèle ISO mais plus juste que le modèle de Johnston, est un compromis entre le modèle de Johnston et le modèle ISO.
L'utilisation d'un seuil de masquage permet de considérer qu'une dégradation inférieure à ce seuil n'est pas ressentie par l'utilisateur et ne doit donc pas être comptabilisée dans les dégradations perçues, ce qui est pris en compte à l'étape a8.
Dans une étape a5, on calcule les distances en valeur moyenne dγx{m,b) et dxhγ (m,b) respectivement entre les densités de sonie du signal y[m] et les densités de sonie du signal x[m], et entre les densités de sonie du signal xb[m] et les densités de sonie du signal y[m]. Plus précisément, ces distances sont données pour chaque trame m et chaque bande critique b par les équations suivantes:
dÏX (m,b) = {S γ (m, b) - Sx (m. b))
dxbγ (m, b) = (SXh (m, b) - Sy (m, b)) ,
les valeurs des densités de sonie S1 {m, b) , Sx (m,b) . et S Xh(m,b) étant celles calculées à l'étape a3.
Dans une étape aβ, on effectue une partition des distances dYY (m.b) ainsi calculées, ou plus précisément des doublets (m,b), par comparaison avec les seuils de masquage hybrides calculés à l'étape a4. On obtient ainsi trois sous-ensembles part(k), k étant un indice variant de 1 à 3, définis de la manière suivante:
- Les distances appartenant au sous-ensemble part(1 ) obéissent aux conditions suivantes:
{dγx (m, b) > 0)& (dÏX (m, b) > Smauιuage (m, h))
- Les distances appartenant au sous-ensemble part(2) obéissent aux conditions suivantes:
(dγx (m, b) > -Smauμιuge(m,b))& (dÏX (m,b) < Smaaψl^{m,b))
- Les distances appartenant au sous-ensemble part(3) obéissent aux conditions suivantes:
{dγx {m, b) < 0) & (dγx (m, b) < -Smasquage (m, b))
Dans une étape a7, on passe de la cadence de trame m à une cadence de trame p, où p vaut un nombre entier de fois la taille d'une trame m, par exemple 20 fois la taille d'une trame m. On travaille donc maintenant sur des trames plus longues, ce qui permet de considérer les dégradations du signal traité sur une période de plusieurs centaines de millisecondes. En effet la perception de la qualité du signal traité n'est pas représentative sur une durée trop courte, et les trames m de 256 échantillons ne permettent de ne percevoir le signal que sur 16 millisecondes en tenant compte de cinquante pourcent de recouvrement des trames.
Dans une étape a8, on effectue des moyennes pondérées des valeurs absolues des distances drx (m,b) par les densités de sonie Sx (m,b) correspondantes. Ces moyennes s'effectuent sur un ensemble P de trames p, P valant par exemple 24, et sur les 18 bandes critiques b considérées dans le domaine des Barks. Elles diffèrent chacune en fonction des doublets (m,b) pris en compte dans leur calcul, ceux-ci étant choisis en fonction des sous- ensemble part(k) auxquels ils appartiennent, et en fonction du résultat de la détection d'activité vocale DAVfmj, déterminé à l'étape a2, sur la trame m.
On obtient ainsi quatre paramètres, deg{1), deg{2), deg(3) et deg{4), définis par les équations suivantes:
Ces paramètres correspondent chacun à un type de dégradation, ce qui permet d'obtenir une note objective du signal traité plus proche des résultats des tests subjectifs que si l'on ne tenait compte que d'une dégradation globale due au bruit sur le signal traité. Ainsi:
- Le paramètre deg(1 ) caractérise le bruit résiduel sur les trames sans activité vocale,
- Le paramètre deg{2) caractérise les dégradations soustractives dues au bruit sur les trames avec activité vocaie,
- Le paramètre deg(3) caractérise les dégradations additives dues au bruit sur les trames avec activité vocale,
- Le paramètre deg(4) caractérise la dégradation globale due au bruit sur les trames avec activité vocale.
Dans une étape a9, on classifie le signal traité en fonction des différents types de dégradations dues au bruit présentes dans le signal. Pour cela, on calcule pour chaque sous-ensemble part(k) défini à l'étape a6, une proportion "taille(k)" de doublets (m,b) pour lesquels les distances dγx (m, h) appartiennent à ce sous-ensemble part(k). La proportion taille(k), k étant l'indice de sous-ensemble et donc variant de 1 à 3, est définie par l'équation suivante: nombre de doublets (m,b) tels que: dγx(m,b) epart(k)
nombre de doublets (m,b) le nombre de doublets (m,b) étant dans cet exemple de réalisation égal à 250 trames m fois 18 bandes critiques b.
On obtient ensuite la classe t de dégradation du signal traité en effectuant les tests suivants sur les proportions taille(1 ) et taille(3) précédemment obtenues:
(taille(l) > 0,5) & (tailleO) < 0,l) => t = l
(taille(\) > 0.5) & (0,1 < to//fe(3) < 0,5) => / = 2
(taille(X) > 0,5) & (tailleQ) > 0,5) => t = 3
(taille(l) < 0,5) & {tailleQ) < 0,1 ) => t = 4
(taille(l) < 0,5)& (θ,l < IaMe(J) < 0,5) => t = 5
(lailleQ) < 0,5)& (laille(3) > 0,5) => / = 6
Ainsi, si la proportion taiile(1) est supérieure à 0,5, c'est-à-dire que la partition part(1) est majoritaire, ce qui correspond à une dégradation additive majoritaire, et si la proportion taille(3) est inférieure à 0,1 , ce qui correspond à
une dégradation soustractive minoritaire, alors le signal traité obtient la classe de dégradation 1. Il est à noter que les seuils utilisés pour définir ces proportions, valant ici 0,1 et 0,5, sont des exemples modifiables en fonction d'expériences supplémentaires permettant d'améliorer le procédé selon l'invention.
La prise en compte de cette classification de la dégradation du signal traité dans le calcul de l'étape suivante permet d'obtenir une note objective du signal traité plus proche de la note subjective correspondante que si l'on ne tenait pas compte de cette classification.
Dans une étape a10, le calcul d'une note objective intermédiaire NOS est obtenue par la combinaison linéaire suivante:
NOS = ∑ω(i,t) * deg(z) + ω(5,t) * Ecart _type(dγx (m,b)) + ω(6, t) * Ecart __ type(dxbγ {m, b)) + ω(7,() * {dcxγ )DA v=ι + ω(S, t) où:
- les paramètres deg(i) sont ceux obtenus à l'issue de l'étape a8,
- l'opérateur "Ecart_type(z(m,b))" désigne l'écart-type de la variable z(m,b) sur l'ensemble des trames m et des bandes critiques b,
- * symbolise l'opérateur de multiplication dans l'espace des nombres réels,
- + symbolise l'opérateur d'addition dans l'espace des nombres réels,
- di Y (m,b) et dλhγ (m,b) sont les distances en valeur moyenne calculées à l'étape a5,
- (dck} )£MÎ =1 désigne la distance cepstrale moyenne entre les signaux x[m] et y[m] calculée sur les trames de parole de ces signaux, c'est-à- dire la moyenne des distances cepstrales dc_xy[m] calculées sur les trames de parole des signaux x[m] et y[m] à l'étape a3,
- les coefficients ω{1 ,t) à ω{8,t) sont des coefficients de pondération prédéfinis en fonction de chacune des six classes de dégradations t.
Par exemple si la classe de dégradation t déterminée à l'étape a9 vaut 1 , on utilise dans le calcul de la note NOS les coefficients ω(1 ,1) à ω(8,1). Ces coefficients ont été déterminés de manière à obtenir une corrélation maximale entre les données subjectives issues d'une base de données de tests subjectifs, et les notes objectives NOS calculées par cette combinaison linéaire en utilisant les signaux de tests, bruités et traités x[m], xb[m] et y[m] utilisés lors de ces mêmes tests subjectifs et représentatifs des six classes de dégradations définies à l'étape a9. La base de données de tests subjectifs est par exemple une base de données de notes obtenues avec des groupes d'auditeurs conformément à la "Recommandation UIT-T P.835", dans laquelle ces notes sont appelées notes "speech signal".
Il est à noter que l'obtention des coefficients de pondération par l'utilisation d'une base de données de tests subjectifs n'est pas indispensable à chaque étape de calcul d'une note objective NOS. En effet, ces coefficients doivent être obtenus préalablement à la première utilisation du procédé, et peuvent être les mêmes pour toutes les utilisations du procédé. Ces coefficients sont néanmoins amenés à évoluer lorsque de nouvelles données subjectives viendront alimenter la base de données de tests subjectifs utilisée.
Enfin dans une dernière étape a11 , une note objective NOS_MOS du signal traité sur l'échelle MOS est calculée en utilisant par exemple une fonction polynomiale d'ordre 3, suivant l'équation suivante:
4
NOS _ MOS = ]T A(/, t)(NOS) '"' , où les coefficients λ(1 ,t) à λ(4,t), sont déterminés pour chaque classe de dégradation t du signal traité de manière à ce que la note objective obtenue NOS-MOS caractérise le signal traité sur l'échelle MOS, c'est-à-dire sur une échelle de 1 à 5.
Le fait d'utiliser une fonction polynomiale d'ordre 3 permet d'obtenir une note objective sur ['échelle MOS très proche de Ia note subjective MOS que
donnerait un groupe d'auditeurs dans le cadre d'un test subjectif conforme à la "Recommandation UIT-T P 835"
Selon un second mode de réalisation du procédé l'invention, la qualité perçue d'un signal audio dégradé par la présence de bruit est évaluée de manière objective On utilise le même environnement de test qu'à la figure 1 , mais en ôtant le module MRB de réduction de bruit. La source de signaux audio SSA délivre un signal audio de test x(n) ne contenant que du signal utile, auquel est ajouté un signal de bruit prédéfini généré par la source de bruit SB, pour obtenir en sortie de l'opérateur d'addition AD un signal bruité xb(n)
Le signal de test x(n) et le signal bruité xb(n) sont alors directement envoyés à l'entrée de l'équipement de test EQT mettant en oeuvre un procédé d'évaluation objective de la qualité perçue du signal audio dégradé xb(n) selon l'invention Comme dans le premier mode de réalisation, les signaux x(n) et xb(n) sont supposés échantillonnés à la fréquence d'échantillonnage 8 kHz
L'équipement de test EQT délivre en sortie un résultat d'évaluation RES, qui est une note objective NOS_MOS de la qualité perçue du signal audio dégradé xb(n)
En référence à la figure 3, le procédé de calcul de la note objective NOS_MOS de la qualité perçue du signal audio dégradé xb(n) selon l'invention est représenté sous la forme d'un algorithme comportant des étapes b1 à b11 Ces étapes sont similaires aux étapes ai à a1 1 précédemment décrites dans le premier mode de réalisation, et seront donc un peu moins détaillées II est en effet a noter que si l'on applique les étapes de calcul ai a a1 1 avec le signal y(n) égal au signal xb(n) dans le cas du premier mode de réalisation on aboutit au deuxième mode de réalisation
Dans une étape b1 les signaux x(n) et xb(rι) sont découpes en trames x[rr] et xb[m] d'indice temporel m
Dans une étape b2, une détection d'activité vocale (DAV) est effectuée sur le signal de test x[m] de manière à déterminer si chaque trame respective courante d'indice m du signal bruité xb[m] est une trame contenant seulement du bruit ou une trame contenant de la parole. En sortie de l'étape b2, la variable DAV[m] représentée sur la figure 3, résultat de la détection d'activité vocale, vaut 1 pour les trames de parole des signaux x[m] et xb[m], et vaut 0 pour les trames de silence du signal x[m] et les trames de bruit du signal xb[m].
Dans la suite, on travaille sur un ensemble de trames. Par exemple si on utilise 8 secondes de signal de test échantillonné à 8kHz, on pourra travailler sur 250 trames x[m] de 256 échantillons de signal x(n). De plus les valeurs calculées le sont sur chaque trame m de cet ensemble de trames, et ont donc toutes un indice de trame m.
Dans une étape b3, on calcule les densités de sonie Sχ(m,b) , et Sxb(m,b) des trames respectives x[m] et xb[m], b étant le numéro d'une des 18 bandes critiques considérées dans le domaine des Barks, ainsi que la distance cepstrale dç_xxb[m] entre les trames m des signaux x[m] et xb[m].
Dans une étape b4, on calcule pour chaque trame m et chaque bande critique b, les seuils de masquage hybrides des signaux x[m] et xb[m]. On obtient alors le seuil de masquage hybride global S mmquage(m,b) du signal bruité en prenant le minimum de ces seuils, suivant l'équation suivante:
S ma,4uage ("», b) = miti( Tx (/», t), Tχb (w, O)) où min(p,q) est te minimum des variables p et q, Tx(m,b) est le seuil de masquage hybride du signal x[m] et Tλb(m,b) le seuil de masquage hybride du signal xb[m|. En variante le seuil de masquage hybride Smmqua$e(m,b)est pris égal au seuil de masquage hybride du signal x[m], ou à celui du signai xb[m], ces deux seuils étant très proches l'un de l'autre en pratique. En autre variante, le seuil de masquage Snuuι^Jm,b) est pris égal au minimum des
seuils de masquage de Johnston, ou au minimum des seuils de masquage ISO, des signaux x[m] et xb[m]. Il est également possible de choisir le seuil de masquage S mMqιιage{m,b) égal au seuil de masquage de Johnston ou au seuil de masquage ISO du signal x[m], ou encore au seuil de masquage de Johnston ou au seuil de masquage ISO du signal y[m].
Dans une étape b5, on calcule les distances en valeur moyenne dxhx(m,b) entre les densités de sonie du signal xb[m] et les densités de sonie du signal x[m]. Plus précisément, ces distances sont données pour chaque trame m et chaque bande critique b par les équations suivantes:
dχbχ (m> b) = (sχh (m> b) ~ sx im- b))
les valeurs des densités de sonie Sx(m,b) et SXh (m, b) étant celles calculées à l'étape b3.
Dans une étape b6, on effectue une partition des distances dXhX(m,b) ainsi calculées, ou plus précisément des doublets (m,b), par comparaison avec les seuils de masquage hybrides calculés à l'étape b4. On obtient ainsi trois sous-ensembles part(k), k étant un indice variant de 1 à 3, définis de la manière suivante:
- Les distances appartenant au sous-ensemble part(1) obéissent aux conditions suivantes:
{dxbx (m, b) > 0) & {dxbX (m, b) > Smmqaagc (m, b)}
- Les distances appartenant au sous-ensemble part(2) obéissent aux conditions suivantes:
{dybx (m, b) > ~SMJt(ιUaJjn,b))& {cLm (m.b) < Smuιquuge(m,b))
- Les distances appartenant au sous-ensemble part(3) obéissent aux conditions suivantes:
(dxtι (m,b) < 0)& {dΛ7> (m. b) < ~SmaHlιaJ, m,b))
Dans une étape b7, on passe de la cadence de trame m à une cadence de trame p, où p vaut un nombre entier de fois la taille d'une trame m, par exemple 20 fois la taille d'une trame m.
Dans une étape b8, on effectue des moyennes pondérées des valeurs absolues des distances dXhX (m,b) par les densités de sonie Sx(m,b) correspondantes. Ces moyennes s'effectuent sur un ensemble P de trames p, P valant par exemple 12, et sur les 18 bandes critiques b considérées dans le domaine des Barks. Elles diffèrent chacune en fonction des doublets (m,b) pris en compte dans leur calcul, ceux-ci étant choisis en fonction des sous- ensembles part(k) auxquels ils appartiennent, et en fonction du résultat de la détection d'activité vocale DAV[m], déterminé à l'étape a2, sur la trame m.
On obtient ainsi quatre paramètres, deg(1), deg(2), deg(3) et deg(4), définis par les équations suivantes:
Comme à l'étape a8, ces paramètres correspondent chacun à un type de dégradation, ce qui permet d'obtenir une note objective du signal dégradé plus proche des résultats des tests subjectifs que si l'on ne tenait compte que d'une dégradation globale due au bruit sur le signal bruité.
Dans une étape b9, on classifie le signal bruité en fonction des différents types de dégradations dues au bruit présentes dans le signal. Pour cela, on calcule pour chaque sous-ensemble part(k) défini à l'étape b6, une proportion taille(k) de doublets (m,b), k variant de 1 à 3, définie par l'équation suivante:
nombre de doublets (m,b) tels que: dχbx(m,b) epart(k) taille(k) = nom ~bre d ~e~Z dou ZbTletTsZ (m, Zb) le nombre de doublets (m,b) étant dans cet exemple de réalisation égal à 250 trames m fois 18 bandes critiques b.
On obtient ensuite la classe t de dégradation du signal bruité en effectuant les tests suivants sur les proportions taille(1 ) et taille(3) précédemment obtenues:
{tailleQ) > 0,5) & {tailleQ) < 0,l) => / = 1
(tailleQ) > 0,5) & (θ,l < IaUIe(T) < 0,5) => t = 2
(tailled) > 0,5) & (tai!le(3) > 0,5) => t = 3
(taille(l) < 0,5) & (tai!le(3) < 0,1) => / = 4
((UiUe(I) < 0.5)& (OJ < taiUe(3) < 0.5) => t = 5
(tai He(I) < 0.5) & (tailleβ) > 0,5) =-> ( = 6
De manière similaire à l'étape a9, la prise en compte de cette classification de la dégradation du signai bruité dans Ie calcul de la note objective du signal
bruité permet d'obtenir un résultat plus proche de la note subjective correspondante que si l'on ne tenait pas compte de cette classification.
Dans une étape b10, le calcul d'une note objective intermédiaire NOS est obtenue par la combinaison linéaire suivante:
NOS - £ ω(i, t) * deg(/) I + ω(5, 0 * Ecart _ type{dxbλ {m, b)) + V ,=i J
+ ω(6,t) *(dcχ γh )υAV=ι + ω(7,t)
où:
- les paramètres deg(i) sont ceux obtenus à l'issue de l'étape bδ,
- l'opérateur "Ecart_type(z(m,b))" désigne l'écart-type de la variable z(m,b) sur l'ensemble des trames m et des bandes critiques b,
- * symbolise l'opérateur de multiplication dans l'espace des nombres réels,
- + symbolise l'opérateur d'addition dans l'espace des nombres réels,
- dxbX {m,b) sont des distances en valeur moyenne calculées à l'étape b5,
{dc ±xb)i )A r=i désigne la distance cepstrale moyenne entre les signaux x[m] et xb[m] calculée sur les trames de parole de ces signaux,
- les coefficients ω(1 ,t) à ω(7,t) sont des coefficients de pondération prédéfinis en fonction de chacune des six classes de dégradations t.
Ces coefficients ont été déterminés de manière à obtenir une corrélation maximale entre les données subjectives issues d'une base de données de tests subjectifs, et les notes objectives NOS calculées par cette combinaison linéaire en utilisant les signaux de tests x[m] et les signaux bruités xb[m] utilisés lors de ces mêmes tests subjectifs et représentatifs des six classes de dégradations définies à l'étape b9. Tout comme pour l'étape a10, l'obtention des coefficients de pondération par l'utilisation d'une base de données de tests subjectifs n'est pas indispensable à chaque étape de calcul d'une note objective NOS.
Enfin dans une dernière étape b11 , une note objective NOS_MOS du signal bruité sur l'échelle MOS est calculée en utilisant par exemple une fonction polynomiale d'ordre 3, suivant l'équation suivante:
N0S_M0S =∑λ(i J)(NOS)'-1 , où les coefficients λ(1 ,t) à λ(4,t), sont déterminés pour chaque classe de dégradation t du signal bruité de manière à ce que la note objective obtenue NOS-MOS caractérise le signal bruité sur l'échelle MOS, c'est-à-dire sur une échelle de 1 à 5.
Les calculs des densités de sonie et du seuil de masquage hybride d'une trame d'un signal audio, utilisés dans les étapes a3, a4, b3 et b4, ainsi que le calcul de la distance cepstrale entre deux trames de deux signaux audio, utilisé aux étapes a10 et b10, sont maintenant décrits en relation avec la figure 4, selon un mode de réalisation préféré de l'invention.
Dans les étapes d à c10 représentées à la figure 4 et exposées ci- après:
- le calcul selon l'invention des densités de sonie Sυ{m,b) d'une trame d'indice m quelconque d'un signal audio donné u[m], comprend les étapes d à c6,
- le calcul selon l'invention du seuil de masquage hybride d'une trame d'indice m quelconque d'un signal audio donné u[m], comprend les étapes d à c5 et c7 à c9,
- et le calcul selon l'invention de la distance cepstrale dc_uv[m] entre une trame d'indice m quelconque d'un signal audio donné u [m] et Ia trame d'indice m d'un autre signal audio donné v[m], comprend les étapes d et c10.
Dans ce qui suit, on considère une trame d'indice m quelconque d'un signal u[m], et )a trame m d'un signal v[m], sachant que tout ou partie des
trames des signaux considérés subissent le même traitement. Les signaux u[m] et v[m] représentent n'importe lesquels des signaux x[m], xb[m], ou y[m] définis plus haut.
A l'étape d , on applique aux trames d'indice m des signaux u[m] et v[m] un fenêtrage, par exemple un fenêtrage de type Hanning, Hamming ou équivalent. On obtient alors deux trames fenêtrées u_w[m] et v_w[m].
A l'issue de l'étape d , par exemple lors de l'étape a3 pour le calcul de la distance cepstrale dc_xy[m], on passe à l'étape c10, puis à l'étape c2 pour le calcul des densités de sonie et des seuils de masquage hybrides des signaux x[m] et y[m], nécessaire à l'étape a3. En revanche pour le signal xb[m] lors de l'étape a3 on passe par exemple directement de l'étape d à l'étape c2 pour le calcul des densités de sonie du signal xb[m] sur la trame d'indice m.
A l'étape suivante c2, on applique à la trame fenêtrée u_w[m], une transformée de Fourier rapide (FFT) et on obtient en conséquence une trame correspondante U(m,f) dans le domaine fréquentiel.
A l'étape suivante c3, on calcule la densité spectrale de puissance γu (m,f) de la trame U(m,f). Un tel calcul est connu de l'homme du métier et ne sera pas, par conséquent, détaillé ici.
A l'étape c4, on applique à la densité spectrale de puissance γLt(m,f) obtenue à l'étape précédente, une conversion de l'axe des fréquences à l'échelle des Barks, et on obtient en conséquence une densité spectrale de puissance, BLI (m,b) , sur l'échelle des Barks, appelée aussi spectre de Bark.
Pour une fréquence d'échantillonnage de 8kHz, 18 bandes critiques doivent être considérées. Ce type de conversion est connu de l'homme du métier, Ie principe de cette conversion Hertz/Bark consiste à additionner toutes les contributions fréquentielles présentes dans la bande critique considérée de l'échelle des Barks.
Ensuite, à l'étape c5, on applique à la densité spectrale de puissance sur l'échelle des Barks, B1, (m, b) , une convolutîon avec la fonction
d'étalement couramment utilisée en psychoacoustique, et on obtient en conséquence une densité spectrale étalée sur l'échelle des Barks, notée Eu(ITUb) . Cette fonction d'étalement a été formulée mathématiquement et une expression possible est:
101oglO(£(é)) = 15.81 + 7.5 * (b + 0.474) - 17.5 * ^O +O + 0.474)2) , où E(b) est la fonction d'étalement appliquée à la bande critique b considérée dans l'échelle des Barks et * symbolise l'opérateur de multiplication dans l'espace des nombres réels. Cette étape permet de prendre en compte l'interaction des bandes critiques adjacentes.
A l'issue de l'étape c5, par exemple lors de l'étape a3 pour les signaux x[m] et y[m], on passe aux étapes c7 à c9 pour le calcul des seuils de masquage hybrides des signaux x[m] et y[m], puis à l'étape c6 pour le calcul des densités de sonie de ces signaux, puisque pour ces deux signaux les deux calculs sont nécessaires. En revanche lors de l'étape a3 pour le signal xb[m] on passe par exemple directement à l'étape c6 pour le calcul des densités de sonie.
A l'étape c6, on convertit la densité spectrale étalée Eυ (m, b) obtenue précédemment en densités de sonie exprimées en sones. Pour cela, on opère une calibration de la densité spectrale étalée sur l'échelle des Barks, E1, (m, b) , par les facteurs respectifs d'échelonnement en puissance et d'échelonnement en sonie couramment utilisés en psychoacoustique. Le document "Recommandation UIT-T P.862", sections 10.2.1.3 et 10.2.1.4, donne un exemple d'une telle calibration par les facteurs précités. On convertit ensuite sur l'échelle des phones Ia grandeur obtenue. La conversion sur i'écheile des phones est effectuée en s'appuyant sur fes courbes d'isosonie (courbes de Fletcher) conformément à la norme NF ISO 226 "Lignes isosoniques normales". On effectue alors une conversion sur l'échelle des sones de la grandeur précédemment convertie en phones. La conversion en sones est effectuée conformément à la loi de Zwicker selon laquelle :
' ÎN(phone)-40 ^
N(sone) = 2 nv 10
Pour obtenir plus d'information sur la conversion phone/sone, on pourra se reporter au document "PSYCHOACOUSTIQUE, L'oreille récepteur d'information", de E. Zwicker et R. Feldtkeller, édition Masson, 1981.
A l'issue de l'étape c6, on dispose d'autant de valeurs de densité de sonie, Sυ(m,b) , de la trame d'indice m pour la bande critique b, que de bandes critiques considérées dans l'échelle des Barks , b étant l'indice de bande critique.
Cette dernière étape c6 de calcul de densités de sonie correspond à une conversion du domaine des Barks vers le domaine des Sones, permettant de calculer une intensité subjective, c'est-à-dire telle que perçue par l'oreille humaine.
A l'étape c7, le coefficient de tonalité α(m) de la trame d'indice m est calculé selon l'équation suivante:
où * symbolise l'opérateur de multiplication dans l'espace des nombres réels, f représente l'indice fréquentiel de la densité spectrale de puissance, et N désigne la taille de la transformée de Fourier rapide. Ce calcul est effectué selon le principe défini par J. D. Johnston dans son article "Transform coding of audio signais using perceptual noise criteria" du journal "IEEE Journal on selected areas in communications, vol.6, n°2, February 1988".
Le coefficient de tonalité α d'un signal de base est une mesure permettant de montrer si certaines fréquences pures ressortent de ce signal, il est équivalent à une densité tonale. En effet» plus le coefficient de tonalité a
est proche de 0, plus Ie signal est assimilé à du bruit. A l'inverse, plus le coefficient de tonalité α est proche de 1 , plus le signal est à composante tonale majoritaire. Un coefficient de tonalité α proche de 1 atteste donc de la présence de signal utile, ou signal de parole.
A l'étape suivante c8, on calcule des seuils de correction 0(m,b) pour chaque bande critique b de la trame m, permettant de prendre en compte l'asymétrie entre le masquage d'une tonale par un bruit et d'un bruit par une tonale. Le niveau de correction appliquée au spectre étalé dépend ainsi de la nature harmonique ou non du signal qui est déterminée grâce au coefficient de tonalité α(m) précédemment calculé. Une expression des seuils de correction 0(m,b) selon l'invention est donnée par la formule:
O(m, b) = a(m)TMN ,sυ{b) + (1 - a(m))NMTιS0 (b)
où
- α(m) est le coefficient de tonalité calculé à l'étape c7,
- TMN JS0 (b) , d'après l'anglais "Tone Masking Noise", est la valeur corrective en décibels à appliquer pour la bande critique b dans le cas d'une tonale masquant un bruit, selon le modèle psychoacoustique numéro 1 de la norme ISO, d'après l'anglais "International Standard Organisation", utilisé dans le codage "MPEG-2 ISO/MPEG IS-11172",
- et NMTIsυ(b) , d'après l'anglais " Noise Masking Tone". est la valeur corrective en décibels à appliquer pour la bande critique b dans le cas d'un bruit masquant une tonale, selon ce même modèle psychoacoustique.
A l'étape suivante c9, on calcule les seuils de masquage hybrides pour chaque bande critique b sur la trame du signal u[m]. Les seuils de masquage hybrides T1 {m, h) sont donnés par l'équation suivante:
T1 ( m, b) - min ((£ ( m. b) - ()( m.
Où
- min(p,q) est le minimum des variables p et q,
- E0, (m, b) est la densité spectrale étalée calculée à l'étape c5,
- O(m,b) est le seuil de correction calculé à l'étape c8 pour la bande
critique b,
- β(b) est le seuil absolu d'audition pour la bande critique b.
Le calcul des seuils de masquage hybrides T1. (m, b) selon l'invention utilise un modèle hybride entre le modèle psychoacoustique numéro 1 de la norme ISO et le modèle de Johnston, décrit dans l'article cité plus haut, dans la mesure où le coefficient de tonalité utilisé est celui défini dans le modèle de Johnston tandis que les valeurs correctives TMNlso(b)et NMT150 (b) utilisées sont celles définies dans le modèle de la norme ISO. Ceci permet de s'affranchir de la complexité arithmétique du calcul du coefficient de tonalité selon le modèle de la norme ISO, qui diffère pour chaque bande critique b. La charge de calculs du procédé selon l'invention s'en trouve ainsi allégée. Pour plus d'informations sur le calcul de ces seuils de masquage hybrides, on pourra se reporter à la thèse de Valérie Turbin présentée au Centre National d'Etudes des Télécommunications en décembre 1998 et intitulée "Combinaison du filtrage adaptatif et du filtrage optimal pour réaliser l'annulation d'écho acoustique dans le contexte de téléconférence".
Enfin à l'étape c10 la distance cepstrale dc_uv[m] est calculée. Pour cela on calcule les coefficients cepstraux {c,} et {c'i} respectivement de la trame d'indice m du signal u[m] et de la trame d'indice m du signal v[m], donnés par les équations suivantes: V i>0, C1 c_
'-1 ( t- \
V ï>0, c'≈-a'. -Yl 1 - - \c' , a\ et c" = c' cc = log(cτ:)
c, = logtσ'2 )
ou
- les coefficients {a,} et {a'J sont les coefficients de prédiction linéaire de l'analyse LPC, d'après l'anglais "Linear Prédictive Coding", d'ordre 10, calculés respectivement sur la trame d'indice m du signal u[m] et sur la trame d'indice m du signal v[m]
- σ2 est la puissance du signal u[m] mesurée sur la trame d'indice m du signal u[m]
- σ'2 est la puissance du signal v[m] mesurée sur la trame d'indice m du signal v[m]
La distance cepstrale dc_uv[m] est alors calculée par la formule suivante:
le nombre N étant pris égal au double de l'ordre du modèle auto-régressif de l'analyse LPC. Dans la pratique, la différence d'énergie (co-cO)2 ne sera pas prise en compte dans le calcul, car peu significative sur le plan perceptif.
Il est à noter qu'aux étapes a10 et b10, on calcule la moyenne des distances cepstrales dc_xy[m] et dc_xxb[m]. En effet, par exemple la distance cepstrale au cours du temps dc_xy[m] permet de visualiser la distribution temporelle des dégradations du signal traité y[m] par rapport au signal de test x[m]. La moyenne (dcλl ),,AV_ι des distances cepstrales dc_xy[m] sur les trames de parole permet d'obtenir une note unique pour le signal traité y[m|. Pour plus de détail sur le calcul et Ia signification de la distance cepstrale, on pourra se reporter à la thèse de Christophe Veaux, présentée à l'Ecole Nationale Supérieure des Télécommunications le 20 janvier 2005 et intitulée "Etude de traitements en réception pour l'amélioration de la qualité de la parole ". il est de plus à noter que dans les modes de réalisation du procédé selon l'invention précédemment décrits, l'ordre des étapes ai à a11 et b1 à b11 est donné à titre d'exemple. Cet ordre est en effet modifiable suivant que
les résultats obtenus à l'issue d'une étape sont réutilisés à l'étape suivante ou à une étape plus en aval, ce qui permet de produire encore plusieurs variantes de réalisation. Ainsi le résultat de la détection d'activité vocale à l'étape a2 n'est utilisée qu'à partir de l'étape a8, le calcul du seuil de masquage à l'étape a4 n'est utilisé qu'à l'étape a6, le calcul de la distance cepstrale entre les signaux x[m] et y[m] à l'étape a3 n'est utilisé qu'à l'étape a 10, et l'étape a9 est indépendante des étapes a7 et a8. Dans une variante du premier mode de réalisation du procédé selon l'invention, on a donc des étapes par exemple ordonnées suivant la liste {ai , a3, a5, a4, a6, a9, a7, a2, a8, a10, a11}, avec le calcul de la distance cepstrale entre les signaux x[m] et y[m] qui est effectué à l'étape a10 au lieu de l'être à l'étape a3.
Claims
1. Procédé de calcul d'une note objective (NOS) de la qualité perçue d'un signal audio dégradé par la présence de bruit et traité par une fonction de réduction de bruit, ledit procédé comprenant une étape préalable d'obtention d'un signal audio prédéfini de test (x[m]) contenant un signal utile dépourvu de bruit, d'un signal bruité (xb[m]), obtenu en additionnant un signal de bruit prédéfini au signal de test (x[m]), et d'un signal traité (y[m]), obtenu par application de la fonction de réduction de bruit au signal bruité (xb[m]), ledit procédé étant caractérisé en ce qu'il comporte:
- une étape (a5) de mesure de distances (dγx (m,b) ) entre des densités de sonie calculées sur le signal traité (y[m]) et des densités de sonie calculées sur le signal de test (x[m]),
- et une étape (a6) de comparaison desdites distances (drx(m,b) ) avec des seuils de masquage {Smasι4uajζe(jn,b) ) calculés sur au moins un des signaux de test (x[m]) et traité (y[m]).
2. Procédé selon la revendication 1 , caractérisé en ce qu'il comporte les étapes de :
- Détection (a2) d'activité vocale sur le signal de test (x[m]),
- Calcul (a3) de densités de sonie sur le signal traité (y[m]), le signal bruité (xb[m]) et le signal de test (x[m]),
- Calcul (a4) sur au moins un des signaux traité (y[m]) et de test (x[m]), de seuils de masquage (Sιιhnφιuie(m,b) ),
- Calcul (a5) de distances {(d] Y(m,h) )) entre lesdites densités de sonie du signal traité (y[m]) et lesdites densités de sonie du signal de test CκpTi]), ainsi que de distances (dt ll, (mj?) ) entre lesdites densités de
sonie du signal traité (y[m]) et lesdites densités de sonie du signal bruité (xb[m]),
- Partition (a6) des distances ((dÏX(m.b) )) ainsi calculées entre lesdites densités de sonie du signal traité (y[m]) et lesdites densités de sonie du signal de test (x[m]) par comparaison avec lesdits seuils de masquage {SmasιμnmÀm,b) ),
- Calcul (a8) de moyennes des distances ((dn. (m,b) )) ainsi partitionnées en fonction de ladite partition et du résultat de la détection d'activité vocale (DAV[m]), afin d'obtenir des paramètres (deg(1 ), deg(2), deg(3), deg(4)) caractéristiques de différents types de dégradations dues au bruit dans le signal traité (y[m]),
- Calcul (a10) d'une note objective du signal traité (y[m]), utilisant les paramètres (deg(1 ), deg(2), deg(3), deg(4)) ainsi obtenus, les distances ((dγx(m,b) ), dγhr (m,b) ) calculées à l'étape (a5) de calcul de distances, et des données subjectives issues d'une base de données de tests.
3. Procédé de calcul d'une note objective (NOS) de la qualité perçue d'un signal audio dégradé par la présence de bruit, ledit procédé comprenant une étape préalable d'obtention d'un signal audio prédéfini de test (x[m]) contenant un signal utile dépourvu de bruit et d'un signal bruité (xb[m]), obtenu en additionnant un signal de bruit prédéfini au signal de test (x[m]), ledit procédé étant caractérisé en ce qu'il comporte:
- une étape (b5) de mesure de distances {dxbk (m,b) ) entre des densités de sonie calculées sur le signal bruité (xb[m]) et des densités de sonie calculées sur le signal de test (xfm]),
- et une étape (b6) de comparaison desdites distances {dλhκ (m.b) ) avec des seuils de masquage (Slι:JUIMΛ,Jm..b) ) calculés sur au moins un des signaux bruité (xb[m]) et de test (x[m]).
4, Procédé selon Ia revendication 3, caractérisé en ce qu'il comporte les étapes de :
- Détection (b2) d'activité vocale sur le signal de test (x[m]),
- Calcul (b3) de densités de sonie sur le signal bruité (xb[m]) et le signal de test (x[m]),
- Calcul (b4) sur au moins un des signaux bruité (xb[m]) et de test (x[m]), de seuils de masquage (Smaqaage(m,b) ),
- Calcul (b5) de distances (dxhx(m,b) ) entre lesdites densités de sonie du signal de test (x[m]) et lesdites densités de sonie du signal bruité (xb[m]),
- Partition (b6) des distances (dXhX(m,b) ) ainsi calculées par comparaison avec lesdits seuils de masquage (Smmψωgύ(m,b) ),
- Calcul (b8) de moyennes des distances (dγhγ (m,h) ) ainsi partitionnées en fonction de ladite partition et du résultat de la détection d'activité vocale (DAV[m])( afin d'obtenir des paramètres (deg(1 ), deg(2), deg(3), deg(4)) caractéristiques de différents types de dégradations dues au bruit dans le signal bruité (xb[m]),
- Calcul (b10) d'une note objective (NOS) du signal bruité (xb[m]), utilisant les paramètres (deg(1 ), deg(2), deg(3), deg(4)) ainsi obtenus, les distances {dxhx (m,b) ) ainsi calculées, et des données subjectives issues d'une base de données de tests.
5. Procédé selon la revendication 2 ou 4, caractérisé en ce que l'étape (a6, bβ) de partition est suivie d'une étape de classification (a9, b9) du signal audio dégradé en fonction des types de dégradations présents dans ledit signal, Ie calcul de la note objective (NOS) tenant compte de cette classification (t).
6. Procédé selon l'une quelconque des revendications 2, 4 ou 5, caractérisé en ce que l'étape (a8, b8) de calcul de moyennes est précédée d'une étape (a7, b7) de changement de cadence de trames.
7. Procédé selon l'une quelconque des revendications 2, 4, 5 ou 6, caractérisé en ce que l'étape de calcul (a10, b10) de la note objective (NOS) est suivie d'une étape (a11 , b11) de calcul d'une note objective (NOS_MOS) sur l'échelle MOS de la qualité perçue du signal audio dégradé par la présence de bruit.
8. Procédé selon l'une quelconque des revendications 2, 4, 5, 6 ou 7, caractérisé en ce que le calcul des seuils de masquage (Smai<juaj,e(m,b)) d'une trame du signal audio utilise un modèle hybride entre le modèle de masquage de Johnston et le modèle de masquage ISO, d'après l'anglais "International Standard Organisation".
9. Equipement de test destiné à évaluer une note objective (NOS) de la qualité perçue d'un signal audio dégradé par Ia présence de bruit, caractérisé en ce qu'il comporte des moyens adaptés à mettre en œuvre un procédé selon l'une quelconque des revendications 1 à 8.
10. Programme d'ordinateur sur un support d'informations, caractérisé en ce qu'il comporte des instructions adaptées à la mise en œuvre d'un procédé selon l'une quelconque des revendications 1 à 8, lorsque ledit programme est chargé et exécuté dans un système informatique.
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| FR0553807A FR2894707A1 (fr) | 2005-12-09 | 2005-12-09 | Procede de mesure de la qualite percue d'un signal audio degrade par la presence de bruit |
| PCT/FR2006/051310 WO2007066049A1 (fr) | 2005-12-09 | 2006-12-08 | Procede de mesure de la qualite percue d'un signal audio degrade par la presence de bruit |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| EP1958186A1 true EP1958186A1 (fr) | 2008-08-20 |
Family
ID=36649493
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| EP06842121A Withdrawn EP1958186A1 (fr) | 2005-12-09 | 2006-12-08 | Procede de mesure de la qualite percue d'un signal audio degrade par la presence de bruit |
Country Status (4)
| Country | Link |
|---|---|
| US (1) | US20090161882A1 (fr) |
| EP (1) | EP1958186A1 (fr) |
| FR (1) | FR2894707A1 (fr) |
| WO (1) | WO2007066049A1 (fr) |
Families Citing this family (7)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| FR2944640A1 (fr) * | 2009-04-17 | 2010-10-22 | France Telecom | Procede et dispositif d'evaluation objective de la qualite vocale d'un signal de parole prenant en compte la classification du bruit de fond contenu dans le signal. |
| WO2012094827A1 (fr) | 2011-01-14 | 2012-07-19 | Huawei Technologies Co., Ltd. | Procédé et appareil d'amélioration de qualité vocale |
| CN102231279B (zh) * | 2011-05-11 | 2012-09-26 | 武汉大学 | 基于听觉关注度的音频质量客观评价系统及方法 |
| EP2595146A1 (fr) * | 2011-11-17 | 2013-05-22 | Nederlandse Organisatie voor toegepast -natuurwetenschappelijk onderzoek TNO | Procédé et appareil pour évaluer l'intelligibilité d'un signal vocal dégradé |
| US9225310B1 (en) * | 2012-11-08 | 2015-12-29 | iZotope, Inc. | Audio limiter system and method |
| EP2922058A1 (fr) * | 2014-03-20 | 2015-09-23 | Nederlandse Organisatie voor toegepast- natuurwetenschappelijk onderzoek TNO | Procédé et appareil pour évaluer la qualité d'un signal vocal dégradé |
| EP3217399B1 (fr) | 2016-03-11 | 2018-11-21 | GN Hearing A/S | Amélioration vocale de filtrage de kalman utilisant une approche basée sur un manuel de codage |
Family Cites Families (3)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| EP0730798A1 (fr) * | 1993-11-25 | 1996-09-11 | BRITISH TELECOMMUNICATIONS public limited company | Procede et appareil permettant de tester un equipement de telecommunications |
| US6490552B1 (en) * | 1999-10-06 | 2002-12-03 | National Semiconductor Corporation | Methods and apparatus for silence quality measurement |
| FR2875633A1 (fr) * | 2004-09-17 | 2006-03-24 | France Telecom | Procede et dispositif d'evaluation de l'efficacite d'une fonction de reduction de bruit destinee a etre appliquee a des signaux audio |
-
2005
- 2005-12-09 FR FR0553807A patent/FR2894707A1/fr active Pending
-
2006
- 2006-12-08 US US12/086,299 patent/US20090161882A1/en not_active Abandoned
- 2006-12-08 WO PCT/FR2006/051310 patent/WO2007066049A1/fr not_active Ceased
- 2006-12-08 EP EP06842121A patent/EP1958186A1/fr not_active Withdrawn
Non-Patent Citations (1)
| Title |
|---|
| See references of WO2007066049A1 * |
Also Published As
| Publication number | Publication date |
|---|---|
| FR2894707A1 (fr) | 2007-06-15 |
| WO2007066049A1 (fr) | 2007-06-14 |
| US20090161882A1 (en) | 2009-06-25 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| EP2419900B1 (fr) | Procede et dispositif d'evaluation objective de la qualite vocale d'un signal de parole prenant en compte la classification du bruit de fond contenu dans le signal | |
| Kilgour et al. | Fr\'echet audio distance: A metric for evaluating music enhancement algorithms | |
| EP2415047B1 (fr) | Classification du bruit de fond contenu dans un signal sonore | |
| Braun et al. | Effect of noise suppression losses on speech distortion and ASR performance | |
| CN102576535B (zh) | 用于确定音频系统的感知质量的方法和系统 | |
| Kumar | Comparative performance evaluation of MMSE-based speech enhancement techniques through simulation and real-time implementation | |
| Santos et al. | Speech dereverberation with context-aware recurrent neural networks | |
| CN106663450A (zh) | 用于评估劣化语音信号的质量的方法及装置 | |
| EP1849157B1 (fr) | Procede de mesure de la gene due au bruit dans un signal audio | |
| CN114429763A (zh) | 语音音色风格实时变换技术 | |
| EP1958186A1 (fr) | Procede de mesure de la qualite percue d'un signal audio degrade par la presence de bruit | |
| Lu | Enhancement of single channel speech using perceptual-decision-directed approach | |
| RU2312405C2 (ru) | Способ осуществления машинной оценки качества звуковых сигналов | |
| Gunawan et al. | Speech enhancement using temporal masking and fractional Bark gammatone filters | |
| Bahadur et al. | Performance measurement of a hybrid speech enhancement technique | |
| Medina et al. | Impulsive noise detection for speech enhancement in HHT domain | |
| Santos et al. | Towards the development of a non-intrusive objective quality measure for dnn-enhanced speech | |
| FR3085784A1 (fr) | Dispositif de rehaussement de la parole par implementation d'un reseau de neurones dans le domaine temporel | |
| Naithani et al. | Subjective evaluation of deep neural network based speech enhancement systems in real-world conditions | |
| FR2875633A1 (fr) | Procede et dispositif d'evaluation de l'efficacite d'une fonction de reduction de bruit destinee a etre appliquee a des signaux audio | |
| Pourmand et al. | Computational auditory models in predicting noise reduction performance for wideband telephony applications | |
| Santos | A non-intrusive objective speech intelligibility metric tailored for cochlear implant users in complex listening environments | |
| Bolarinwa et al. | Development of a Signal Processing Algorithm for Feedback (Noise) Reduction in Hearing Aids Using the Spectral Subtraction Technique | |
| Voran | Estimation of speech intelligibility and quality | |
| Rahali et al. | Enhancement of noise-suppressed speech by spectral processing implemented in a digital signal processor |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| PUAI | Public reference made under article 153(3) epc to a published international application that has entered the european phase |
Free format text: ORIGINAL CODE: 0009012 |
|
| 17P | Request for examination filed |
Effective date: 20080613 |
|
| AK | Designated contracting states |
Kind code of ref document: A1 Designated state(s): AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HU IE IS IT LI LT LU LV MC NL PL PT RO SE SI SK TR |
|
| 17Q | First examination report despatched |
Effective date: 20091228 |
|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: THE APPLICATION IS DEEMED TO BE WITHDRAWN |
|
| 18D | Application deemed to be withdrawn |
Effective date: 20100508 |