EP4695798A1 - Traitement optimisé de réduction de canaux d'un signal audio stéréophonique - Google Patents
Traitement optimisé de réduction de canaux d'un signal audio stéréophoniqueInfo
- Publication number
- EP4695798A1 EP4695798A1 EP24718188.6A EP24718188A EP4695798A1 EP 4695798 A1 EP4695798 A1 EP 4695798A1 EP 24718188 A EP24718188 A EP 24718188A EP 4695798 A1 EP4695798 A1 EP 4695798A1
- Authority
- EP
- European Patent Office
- Prior art keywords
- phase
- channels
- reduction processing
- signal
- frame
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Pending
Links
Classifications
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/008—Multichannel audio signal coding or decoding using interchannel correlation to reduce redundancy, e.g. joint-stereo, intensity-coding or matrixing
-
- G—PHYSICS
- G10—MUSICAL INSTRUMENTS; ACOUSTICS
- G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
- G10L19/00—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
- G10L19/02—Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using spectral analysis, e.g. transform vocoders or subband vocoders
- G10L19/022—Blocking, i.e. grouping of samples in time; Choice of analysis windows; Overlap factoring
- G10L19/025—Detection of transients or attacks for time/frequency resolution switching
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04S—STEREOPHONIC SYSTEMS
- H04S1/00—Two-channel systems
- H04S1/007—Two-channel systems in which the audio signals are in digital form
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04S—STEREOPHONIC SYSTEMS
- H04S2400/00—Details of stereophonic systems covered by H04S but not provided for in its groups
- H04S2400/03—Aspects of down-mixing multi-channel audio to configurations with lower numbers of playback channels, e.g. 7.1 -> 5.1
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04S—STEREOPHONIC SYSTEMS
- H04S2420/00—Techniques used stereophonic systems covered by H04S but not provided for in its groups
- H04S2420/03—Application of parametric coding in stereophonic audio systems
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04S—STEREOPHONIC SYSTEMS
- H04S2420/00—Techniques used stereophonic systems covered by H04S but not provided for in its groups
- H04S2420/07—Synergistic effects of band splitting and sub-band processing
Definitions
- the present invention relates to the general field of audio signal processing.
- the invention relates in particular to the channel reduction processing commonly called "downmix", of a multichannel audio signal.
- Downmix of a multichannel audio signal.
- Of particular interest is the processing of reducing a stereophonic signal to a monophonic signal.
- This type of processing finds applications in general in the field of audio technologies, and more specifically in the field of audio coding, whether at the encoding or decoding stage.
- Downmixing consists of deducing, from a combination of the N channels of a multichannel signal x, a signal y consisting of a smaller number M of channels. In practice, this consists of defining a function such as :
- stereo signals can be obtained by capturing them from a pair of stereo microphones. There are a number of microphone pairs that can be used to create this type of content.
- the MS pair for "Mid-Side” is another very widespread pair composed of a cardioid microphone, and a second microphone called a "figure of 8" oriented at 90°.
- phase stereo pairs Another category of so-called phase stereo pairs consists of using microphones that are distant from each other, thus creating a phase difference between the channels for sources located closer to one of the microphones.
- the best known is the AB pair which uses 2 omnidirectional microphones spaced a few centimeters to several meters apart.
- Another very widespread pair is the ORTF pair which uses both a phase difference by spacing the microphones 17cm apart and an amplitude difference by cardioid directivities (the microphones have an angle around 90°).
- the binaural pair consists of placing omnidirectional microphones in the ears of an artificial head: this type of device makes it possible to natively create content that can be listened to on headphones.
- passive downmixing The simplest method to create a downmixed signal is called passive downmixing. It consists of averaging the left and right channels of the stereo signal such that:
- k is the index of the frame of size L
- N the size of the FFT
- the left and right signals will either add (constructive interference) or cancel each other out (destructive interference), thus creating level variations and coloration effects of the reduced signal
- the coloration comes from the comb filtering effect: the effects of constructive and destructive interference manifest themselves in different frequency bands, thus modifying the balance and therefore the timbre of the signal from the downmix compared to the original.
- the downmix of the e-AAC+ codec implements a level correction which ensures that the energy level of the reduced signal, in each frequency band, remains comparable to the original one:
- the input 2-channel signal x(m) is deinterleaved (block 701) to find the two left and right channels. Then a frequency analysis with windowing and Fourier transform (blocks 702 and 703) is performed to obtain the spectra of the 2 channels, and the cross-correlation based on the phase spectra is estimated (block 704) before determining the time difference between the channels (denoted here ITD even if it is formally an ICTD between 2 channels) by peak search (block 705); block 705 also provides the correlation level R* corresponding to the ITD.
- the scaling factors are then determined as follows (block 706):
- the 2 channels are combined into a mono signal in block 706 according to this gain g (with a smoothing of the gain value applied sample by sample at each start of frame). Then, the energies of the left and right channels and of the mono signal are determined (block 708, 709, 710).
- the left and right channels are separately reinjected (added) in blocks 713 and 713 to the mono signal from block 706 according to an energy compensation determined in block 711 with respective scale factors defined in blocks 712 and 713.
- the IPD applied is that estimated by averaging over a Bark band and not the IPD calculated for each frequency band, the latter proving to be particularly noisy and variable from one frame to another.
- This indicator allows to measure whether the signals are rather in phase (ISD ⁇ 1), that is to say with a phase difference or IPD in the interval or rather in phase opposition (ISD > 1), i.e. with an IPD in the interval .
- ISD ⁇ 1 phase difference or IPD in the interval or rather in phase opposition
- ISD > 1 phase difference or IPD in the interval
- rephasing is important to avoid coloration and level loss effects.
- an ISD value close to 1 is representative of one channel being predominant over the other; in the latter case, rephasing is not important, the downmix being approximately equal to the predominant signal. It is, however, important to avoid modifying the phase of the right channel if it is predominant.
- a downmix type selection mechanism is proposed as follows:
- the method proposed in this patent application requires applying filtering in the spectral domain, the reconstruction of the reduced signal being carried out from the short-term inverse Fourier transform (TFCT or FFT in English) of the signal M(f,k).
- This type of filtering generates a circular convolution which creates audible artifacts: echo, pre-echo, crackles.
- an implementation with a frame overlap can be used associated with a suitable windowing (window for analysis and/or synthesis) guaranteeing a reconstruction of the filtered signal.
- OLA Overlap-and-Add
- the invention improves the state of the art.
- the invention aims at a method of processing channel reduction of a stereophonic signal to obtain a monophonic signal, comprising a selection for a stereophonic signal frame, between:
- a first channel reduction processing mode comprising filtering with re-phasing on each of the channels of the stereophonic signal according to an angle defined by half of the phase difference determined between the two channels of the stereophonic signal
- a second channel reduction processing mode comprising filtering with phase re-phasing on only one of the channels of the stereophonic signal according to an angle defined by the phase difference determined between the two channels of the stereophonic signal
- the selection of the first processing mode, respectively of the second processing mode being a function of the value of a phase indicator determined per frame.
- Selecting the first processing mode has an advantage in situations where the intensity of the right channel is predominant (phase indicator, ISD, close to 1) and participates mainly in the downmix: it undergoes a reduced spectral modification, which is in practice almost inaudible.
- the invention thus improves the existing system by proposing a selection of a downmix method adapted in the case of signals in phase or unbalanced sound intensity.
- the method further comprises a step of determining a phase indicator for each frequency f, representative of a measurement of the degree of phase opposition between the frequency components of the channels of the stereo signal, then of a phase indicator per frame of the stereophonic signal calculated according to the frequency percentage for which the phase indicator per frequency exceeds a first threshold. In one embodiment, if the phase indicator per frame is lower, respectively higher, than a second threshold, the first channel reduction processing mode, respectively the second channel reduction processing mode is applied to the current frame.
- this frame-based decision makes it possible to avoid significant phase shifts between frequencies and other audible artifacts that can appear when the decision varies from one frequency to another as in state-of-the-art methods.
- a time difference indicator between stereo channels is determined per frame of the stereo signal, a third channel reduction process being implemented in the event that the indicator is greater than a threshold.
- a comparison of the phase indicator per frame, to the second threshold is carried out in order to determine the application of a first or a second channel reduction processing for this frame.
- This comparison of the time shift indicator is then carried out before the comparison of the phase indicator to another threshold.
- the phase difference determined between the two channels of the stereo signal is smoothed over time by a forgetting factor.
- phase difference can vary rapidly over time.
- filters used for the different channel reduction treatments can vary very rapidly from one frame to another, which causes discontinuities that are sometimes audible during the transition from one frame to another. Smoothing the phase difference therefore makes it possible to limit this effect.
- the channel reduction processing corresponds to a filtering of the channels by filters, the method comprising a preliminary phase of determining the filters before application to the stereo signal by at least one truncation and windowing operation.
- This preliminary phase of determining the filters includes, in one embodiment, the following adaptation steps: - obtaining the impulse responses of the filters corresponding to the channel reduction processing;
- the application of the channel reduction processing by adapted filters is carried out from one frame to another by a crossfading step taking into account the impulse responses of the filters used for the frame preceding the current frame.
- This crossfade transition helps avoid audible artifacts when the filters are very different between two successive frames, for example when a new source appears.
- the invention relates to a channel reduction processing device comprising a processing circuit for implementing the steps of the channel reduction processing method as described above.
- the invention relates to a computer program comprising instructions for implementing the channel reduction processing method as described above, when executed by a processor.
- the invention relates to a storage medium, readable by a processor, storing a computer program comprising instructions for executing the channel reduction processing method described above.
- FIG 1a illustrates channels of a stereophonic signal, in phase as described previously
- FIG 1b illustrates channels of a stereophonic signal, in phase opposition as described previously
- FIG. 1 illustrates another embodiment of a filter calculation for channel reduction processing, as well as a channel reduction processing selection
- FIG. 1 illustrates an exemplary structural embodiment of a channel reduction processing device according to an embodiment of the invention.
- a stereophonic signal x composed of two channels (x 1 (n) and x 2 (n)) also called right channel and left channel initially cut in 201, into frames of L samples (x 1 (k,l) and x 2 (k,l), k being the frame index and n the sample index).
- Block 202 applies a FFT type transform (for "Fast Fourier Transform" in English), to obtain signals in the frequency domain (X 1 (k,f) and X 2 (k,f), f being the frequency index).
- a selection and a determination of the channel reduction filter to be applied to a signal frame are then carried out. This step will be described with reference to The filter thus determined is conditioned (or adapted) in 204 to make it causal and optimize it in order to reduce the processing complexity.
- the filter is determined and adapted for the current frame, it is applied at 205 to this current frame.
- a crossfade is performed taking into account the filter of the previous frame .
- a first or second channel reduction processing to be applied to a current frame of the stereo signal is selected and determined.
- a first method of channel reduction processing T1 is here defined by shifting the left and right channels of the stereo signal simultaneously by an angle defined by half the phase difference (IPD) determined between the two channels of the stereo signal.
- IPD phase difference
- This method avoids excess reverberation type degradation generated by a classic downmix (average of the two signals) or comb filtering type in the event of a time lag between the two channels.
- a second T2 downmix method is for example defined as that proposed in the previously cited Samsudin document.
- the channels of the stereo signal in the frequency domain (X 1 (k,f) and X 2 (k,f)), are used on the one hand to calculate a phase indicator at 301, representative of a measurement of the degree of phase opposition between the channels of the stereo signal and on the other hand the phase difference between the channels (IPD) at 303.
- the phase indicator is for example defined by the ISD indicator for “Inter-Spectral Distance” as defined above.
- the ISD is determined per stereophonic signal frame so that the decision to select a first channel reduction process (first downmix) or a second can be made on a frame-by-frame basis.
- This frame-based decision makes it possible to avoid significant phase shifts between frequencies and other audible artifacts that can appear when the decision varies from one frequency to another, as in the patent application cited above.
- a decision criterion based on the ISD phase indicator is defined according to the following equation at 302:
- This criterion measures the percentage of frequencies whose criterion is favorable to downmixing with re-phasing, that is to say when .
- the decision is made to apply the first downmix as defined above, with rephasing, when exceeds a certain threshold , which we set for example at 70%.
- phase difference IPD is obtained between the two channels of the stereo signal by where ⁇ indicates the phase of the complex operand.
- the frame decision may sometimes be insufficient because the IPD, as calculated by the above formula, varies very rapidly over time. Also, filters
- One way to smooth the IPD is to apply a first-order IIR low-pass filter at 304, such as:
- the forgetting coefficient is chosen ad-hoc. It may be interesting to choose a large forgetting coefficient in the low frequencies, typically below 5kHz, because this allows to maintain phase coherence in the low part of the spectrum from one frame to another, the spectrum of speech signals being stationary, particularly in its low part and the particular ear sensitive to the phase in this part of the spectrum. Conversely, it is interesting to choose a low forgetting coefficient in the high frequencies: in the high frequencies, typically above 5kHz, the phase continuity of speech signals is less marked and the ear is less sensitive to phase discontinuities in this part of the spectrum.
- FIG. 4 now details block 204 of Figure 2.
- the filters such as for example defined in the downmix methods T1 and T2 defined above are reconditioned or further adapted to avoid circular convolution.
- the impulse responses thus defined are classically non-causal.
- a classical technique to make them causal consists in performing a rotation of L/2 samples to center the response at L/2.
- the disadvantage is that the filter thus reconstructed then has a latency of L/2.
- This filter has the advantage of generally having a maximum (in absolute value) on its first sample, which guarantees zero latency. In terms of frequency response, it has a phase approximately equal to the optimal rephasing filter .
- P depends on different criteria: a value of P close to N ⁇ 2 guarantees a quasi-optimal phase re-matching, while a lower value limits the computing power required for filtering. A lower value of P also smooths the phase of the filter. This has an advantage with filters defined by T2 processing as defined above where the phase varies very quickly from one frequency to another: these variations can result in a very high group delay that is perceptible to the human ear. A low value of P allows all or part of these artifacts to be eliminated.
- the filter thus truncated , especially when P ⁇ N ⁇ 2, or even P ⁇ N ⁇ 2, has an impulse response tail that does not tend towards 0. This creates audible discontinuities of the clicking type at the transition between 2 frames. Also, to avoid these audible artifacts, we weight with a window , in 403, such as:
- This window can be a half-triangular window, or even a half-Hann window:
- the filters Due to its truncation and windowing, the filters have reduced energy compared to that of the optimal filter : the latter, as a pure phase-shifting filter, has a norm of 1/2 by construction. Also, we can proceed to a normalization of the energy of the filter thus truncated and windowed, in 404, such that:
- Each channel is filtered by its phase shifter filter in 503:
- the mono downmix is then created by adding the two channels back into phase at 505:
- the filters can be very different between two successive frames, for example when a new source appears. In this case, the transition between And can become audible.
- a cross-fade step can be applied. To achieve this cross-fade, the filters are applied to the current frame over a number of samples X:
- the number of samples needed for the cross-fade will have to be determined experimentally, depending on the size of the filters, the sampling frequency, etc.
- the signal from the downmix is created in 506, from a cross-fade according to the following equation:
- one solution is to calculate the downmixes of each method for the current frame k and to operate a transition from one downmix to the other by cross-fade. More precisely, in the case of a transition from a T1 (or T2) method to the T3 method, the downmix can be performed between the mono downmixes of the 2 methods, i.e. at the output of T1 (or T2) and the signal of the T3 method. The downmix can also be performed between the output of T1 (or T2) and the signal d(n). In the latter case, the energy compensation of the T3 method (adapt_gain) would apply permanently to all methods.
- the decision to switch from one method to the other may be motivated by criteria other than the ISD, for example parameters already calculated by the T3 method (Param. data of the ) such as the ITD, by choosing to apply the T3 method when the ITD is very significant for example, or any other criterion or combination of criteria.
- criteria other than the ISD for example parameters already calculated by the T3 method (Param. data of the ) such as the ITD, by choosing to apply the T3 method when the ITD is very significant for example, or any other criterion or combination of criteria.
- the device 800 comprises a processing circuit typically including: - a memory MEM1 for storing instruction data of a computer program within the meaning of the invention; - an INT1 interface for receiving a stereo audio signal x; - a processor PROC1 for receiving this signal and processing it by executing the computer program instructions stored in the memory MEM1, with a view to carrying out channel reduction processing; in particular, the processor being capable of controlling the processing modules as described with reference to FIGS. 2 to 5; and - a COM 1 communication interface for transmitting the reduced signals, resulting from the channel reduction processing, y, to another processing module, for example a coding or decoding module of an audio signal coder or decoder.
- a processing circuit typically including: - a memory MEM1 for storing instruction data of a computer program within the meaning of the invention; - an INT1 interface for receiving a stereo audio signal x; - a processor PROC1 for receiving this signal and processing it by executing the computer program instructions stored in the memory MEM1, with a
- This type of process can be used during point-to-point conversations if one of the participants makes a stereo or binaural sound recording.
- This type of process can also be present during multi-party conferences: the conference bridge spatializes the scene by creating a stereo scene, but not all participants necessarily have stereo reproduction capabilities. It is then appropriate to downmix the scene in mono for these participants.
- the invention can also be applied to audio decoding: in this case, it is the user's renderer (restitution module) which will perform the downmix of the stereo content to adapt to the user's reduced capacities (single speaker for example).
Landscapes
- Engineering & Computer Science (AREA)
- Physics & Mathematics (AREA)
- Multimedia (AREA)
- Acoustics & Sound (AREA)
- Signal Processing (AREA)
- Computational Linguistics (AREA)
- Health & Medical Sciences (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Human Computer Interaction (AREA)
- Mathematical Physics (AREA)
- Spectroscopy & Molecular Physics (AREA)
- Stereophonic System (AREA)
Abstract
Traitement optimisé de réduction de canaux d'un signal audio stéréophonique L'invention se rapporte à un procédé de traitement de réduction de canaux d'un signal stéréophonique pour obtenir un signal monophonique, comportant une sélection (305) pour une trame de signal stéréophonique, entre : - un premier mode de traitement de réduction de canaux (Tl) comportant un filtrage avec remise en phase sur chacun des canaux du signal stéréophonique selon un angle défini par la moitié de la différence de phase déterminée (303, 304) entre les deux canaux du signal stéréophonique, et un deuxième mode de traitement de réduction de canaux (T2) comportant un filtrage avec remise en phase sur un seul des canaux du signal stéréophonique selon un angle défini par la différence de phase déterminée (303, 304) entre les deux canaux du signal stéréophonique, la sélection du premier mode de traitement, respectivement du deuxième mode de traitement, étant fonction de la valeur d'un indicateur de phase déterminé par trame (302). L'invention se rapporte également à un dispositif de traitement de réduction de canaux mettant en œuvre le procédé.
Description
- La présente invention se rapporte au domaine général du traitement de signaux audio. L’invention se rapporte en particulier au traitement de réduction de canaux appelé couramment « downmix », d’un signal audio multicanal. On s’intéresse en particulier au traitement de réduction d’un signal stéréophonique à un signal monophonique.
- Ce type de traitement trouve des applications de manière générale dans le domaine des technologies audio, et plus précisément dans le domaine du codage audio, que ce soit à l’étape d’encodage ou du décodage.
- Le downmix consiste à déduire, à partir d’une combinaison des N canaux d’un signal multicanal x, un signal y constitué d’un nombre inférieur M de canaux. En pratique, cela consiste à définir une fonction
telle que : -
, avec - Dans cette invention, on s’intéresse au cas particulier M=1 et N=2, on parlera alors de downmix mono. Dans le cas N=2, on parle de contenu ou signal stéréo, où la voie 1 (
) est référencée comme la voie gauche ou L (pour Left), et la voie 2 ( ) comme la voie droite ou R (pour Right). Dans le cas du signal y obtenu après traitement de réduction, on parle de signal monophonique ou mono, que l’on notera M par la suite. - Ces signaux stéréo peuvent être issus d’une captation à partir d’un couple de microphones stéréo. Il existe un certain nombre de couples de microphones permettant de créer ce type de contenus.
- Parmi les plus populaires, on peut citer le couple XY composé de 2 microphones cardioïdes présentant une différence d’angle d’orientation entre 90° et 135°. Le couple MS pour « Mid-Side » est un autre couple très répandu composé d’un microphone de directivité cardioïde, et d’un second microphone dit en « figure de 8 » orienté à 90°. Par combinaison de ces 2 micros (somme/différence), on peut créer les voies gauche et droite de contenu stéréo. Ces couples sont dits coïncidents, c’est-à-dire que les capsules microphoniques ne présentent pas de retard entre elles, la spatialisation étant perçue par la différence d’intensité sonore entre les voies gauche et droite.
- Une autre catégorie de couples dits à stéréophonie de phase consiste à utiliser des microphones distants l’un de l’autre, créant ainsi une différence de phase entre les voies pour les sources situés plus proche de l’un des micros. Le plus connu est le couple AB qui exploite 2 microphones onmidirectionnels espacés de quelques centimètres à plusieurs mètres. Un autre couple très répandu est le couple ORTF qui exploite à la fois une différence de phase par un espacement de 17cm des microphones et une différence d’amplitude par des directivités cardioïdes (les microphones présentent un angle autour de 90°). Le couple binaural consiste à placer des microphones omnidirectionnels dans les oreilles d’une tête artificielle : ce type de dispositif permet de créer nativement des contenus que l’on peut écouter au casque.
- La méthode la plus simple pour créer un signal réduit par downmix est celle dite downmix passif. Elle consiste à effectuer une moyenne des voies gauche et droite du signal stéréo tel que :
-
- ou dans le domaine fréquentiel :
-
- où
est la transformée de Fourier à court-terme de (ou FFT en anglais pour « Fast Fourier Transform »), f étant l’indice de la fréquence et k l’indice de la trame : - où k est l’indice de la trame de taille L, et N la taille de la FFT,
une fenêtre d’apodisation de taille, de type sinus ou Hann ou autre, adaptée à la taille de la trame. peut être le signal lui-même ou une version augmentée avec des 0 (0-padding) : par exemple, dans le cas où la taille de la trame L est inférieure à la taille de la FFT N, peut être : -
- Cette méthode, très simple, fonctionne très bien dans les situations où les voies droite et gauche sont en phase. Cependant, dans les situations où les microphones ne sont pas coïncidents et présentent des différences de phase, un tel mixage génère un filtrage en peigne, qui se manifeste par une coloration du signal d’origine. Cela est dû au fait qu’en fonction de l’espacement des microphones, de la position de la source par rapport au couple de microphones et de la fréquence, les voies gauche et droite d’une même source peuvent se trouver soit en phase comme représenté en figure 1a, soit en opposition de phase comme représenté en figure 1b. Aussi, lors du downmix, les signaux gauche et droite vont soit s’additionner (interférence constructive), soit s’annuler (interférence destructive), créant ainsi des variations de niveau et des effets de coloration du signal réduit
. La coloration vient de l’effet du filtrage en peigne : les effets d’interférences constructives et destructives se manifestent dans des bandes de fréquences différentes, modifiant ainsi l’équilibre et donc le timbre du signal issu du downmix par rapport à l'original. - Pour corriger ce défaut de niveau d’intensité suivant les fréquences, le downmix du codec e-AAC+ implémente une correction de niveau
qui assure que le niveau d’énergie du signal réduit, dans chaque bande de fréquence, reste comparable à celui d’origine : -
, avec -
- Cette approche permet de compenser dans une certaine mesure la baisse d’intensité du downmix. Cependant, cette compensation mène à des suramplifications lorsque les signaux sont proches de l’opposition de phase : aussi, en pratique, le facteur de correction
est capé (un facteur 2 semble une limite haute). - Dans la même approche, La
décrit une méthode de réduction de canaux de stéréo à mono intégrée dans le codec candidat IVAS public disponible à l’adresse : - https:/forge.3gpp.org/rep/ivas-codec-pc/ivas-codec/-/tree/main
- Le signal à 2 canaux d’entrée x(m) est dé-entrelaçé (bloc 701) pour trouver les deux canaux gauche et droite. Ensuite une analyse fréquentielle avec fenêtrage et transformée de Fourier (blocs 702 et 703) est effectuée pour obtenir les spectres des 2 canaux, et l’intercorrélation sur la base des spectres de phase est estimée (bloc 704) avant de déterminer la différence de temps entre les canaux (notée ici ITD même s’il s’agit formellement d’une ICTD entre 2 canaux) par recherche de pic (bloc 705) ; le bloc 705 fournit également le niveau de corrélation R* correspondant à l’ITD.
- Les facteurs de réduction d’échelle sont ensuite déterminés comme suit (bloc 706) :
- si (itd != 0):
- g = - 0.5 * R* + 0.5 si itd>0
- 0.5 * R* + 0.5 si itd<0
- sinon
- g = 0.5
- Les 2 canaux sont combinés en un signal mono dans le bloc 706 selon ce gain g (avec un lissage de la valeur du gain appliqué échantillon par échantillon à chaque début de trame). Ensuite, les énergies des canaux gauche et droit et du signal mono sont déterminées (bloc 708, 709, 710). Les canaux gauche et droite sont séparément réinjectés (ajoutés) dans les blocs 713 et 713 au signal mono issu du bloc 706 en fonction d’une compensation d’énergie déterminée dans le bloc 711 avec des facteurs d’échelle respectifs définis dans les blocs 712 et 713.
- Ces méthodes, en sus de la coloration du signal issu du downmix, liée au filtrage en peigne imparfaitement corrigé, souffrent d’un surplus de réverbération liée à la sommation de signaux en déphasage. En effet, la compensation d’un retard identique pour toutes les fréquences n’est pas réaliste, ce retard étant lié aux différentes sources composant le contenu. En pratique, cela amène, outre une coloration supplémentaire, une perte potentielle d’intelligibilité des sources, défaut que la compensation de niveau ne peut corriger.
- D’autres approches de downmix cherchent à éviter les défauts précités. Le principe de ces méthodes est de remettre en phase les signaux gauche et droite avant leur sommation. Dans le dans le document intitulé "A stereo to mono downmixing scheme for MPEG-4 parametric stereo encoder" par Samsudin, E. Kurniawati, N. Boon Poh, F. Sattar, S. George, dans Proc. ICASSP, 2006, il est proposé une méthode qui consiste à appliquer, dans le domaine fréquentiel, un déphasage φ sur l’une des voies, généralement la droite, afin de la remettre en phase avec la voie gauche, tel que :
-
- Le déphasage idéal est donné par ce qu’on appelle l’IPD pour « Inter-channel Phase Difference » en anglais :
-
- où
est le conjugué de et ∠ indique la phase de l’opérande complexe. - Il est calculé dans le domaine fréquentiel : cela permet de remettre en phase les composantes spectrales de différentes sources, une source avec son propre IPD pouvant être prépondérante dans une bande de fréquence f, tandis qu’une autre source avec un IPD différent peut être prépondérante dans une autre bande f’.
- Dans le cas du codec MPEG4 décrit dans le document Samsudin cité ci-dessus, l’IPD appliqué est celui estimé par moyennage sur une bande de Bark et non pas l’IPD calculé pour chaque bande de fréquence, ces derniers s’avérant particulièrement bruités et variables d’une trame à l’autre.
- Dans la demande de brevet publiée WO2017103418, il est proposé une méthode de downmix qui fait un mélange entre la méthode proposée par Samsudin et le dowmix passif. Notamment, il propose un indicateur ISD pour « Inter-Spectral Distance » qui permet de choisir, bande de fréquence par bande de fréquence, quelle est la méthode la plus adaptée à la remise en phase des signaux :
-
- Cet indicateur permet de mesurer si les signaux sont plutôt en phase (ISD < 1), c’est-à-dire avec une différence de phase ou IPD dans l’intervalle
ou plutôt en opposition de phase (ISD > 1), i.e. avec une IPD dans l’intervalle . Lorsqu’ils sont en opposition de phase, une grande valeur d’ISD est synonyme d’un niveau comparable entre la voie gauche et la voie droite et la remise en phase est importante pour éviter les effets de coloration et de perte de niveau. A contrario, une valeur d’ISD proche de 1 est représentative d’un canal prépondérant par rapport à l’autre ; dans ce cas dernier cas, la remise en phase n’a pas d’importance, le downmix étant à peu près égal au signal prépondérant. Il est, cependant, important d’éviter de modifier la phase du canal droit si celui-ci est prépondérant. Aussi, dans cette demande de brevet, il est proposé un mécanisme de sélection de type de downmix suivant : -
- Le downmix passif proposé dans la demande de brevet suscité, pour les situations de faible ISD introduit parfois une réverbération accrue.
- D’autre part, la méthode proposée dans cette demande de brevet nécessite d’appliquer un filtrage dans le domaine spectral, la reconstruction du signal réduit étant réalisé à partir de la transformée inverse de Fourier à court terme (TFCT ou FFT en anglais) du signal M(f,k). Ce type de filtrage engendre une convolution circulaire qui crée des artefacts audibles : écho, pré-écho, grésillements. Pour masquer ces artefacts, on peut utiliser une implémentation avec un recouvrement de trames (overlap) associé à un fenêtrage adapté (fenêtre à l’analyse et/ou à la synthèse) garantissant une reconstruction du signal filtré. De manière générale, ce recouvrement n’est pas compatible avec le fonctionnement des codeurs audio qui travaillent avec des trames adjacentes, i.e. sans recouvrement (N=L) ; de plus, ce type de reconstruction induit un retard, généralement d’une demi-trame qui est le recouvrement classique, ce qui n’est pas acceptable pour un codeur qui a des contraintes fortes en termes de latence.
- Une autre implémentation de type addition-recouvrement (OLA pour« Overlap-and-Add » en anglais) est également possible : cette méthode nécessite une étape de remplissage par des 0 (« 0-padding ») sur les signaux et les filtres pour éviter la convolution circulaire. Cependant, les tests montrent qu’avec de tels filtres dont la phase varie très rapidement d’une trame à l’autre, une approche de type OLA ne permet pas de masquer complètement les artefacts à la transition de certaines trames, les artefacts restant alors audibles.
- L’invention vient améliorer l’état de la technique.
- A cet effet, l’invention vise un procédé de traitement de réduction de canaux d’un signal stéréophonique pour obtenir un signal monophonique, comportant une sélection pour une trame de signal stéréophonique, entre :
- - un premier mode de traitement de réduction de canaux comportant un filtrage avec remise en phase sur chacun des canaux du signal stéréophonique selon un angle défini par la moitié de la différence de phase déterminée entre les deux canaux du signal stéréophonique, et
- un deuxième mode de traitement de réduction de canaux comportant un filtrage avec remise en phase sur un seul des canaux du signal stéréophonique selon un angle défini par la différence de phase déterminée entre les deux canaux du signal stéréophonique,
- la sélection du premier mode de traitement, respectivement du deuxième mode de traitement, étant fonction de la valeur d’un indicateur de phase déterminé par trame.
- Ainsi, en recalant les deux voies du signal stéréo selon le premier mode de traitement, cela limite voire annule l’ajout de réverbération. D’autre part, le recalage par la moitié de la différence de phase déterminée entre les deux canaux du signal stéréo, limite fortement la coloration des spectres des signaux gauche et droite modifiés par rapport à la méthode Samsudin cité ci-dessus qui modifie le seul canal droit par la différence de phase.
- La sélection entre les deux modes de traitement permet d’adapter le traitement aux canaux du signal stéréo.
- La sélection du premier mode de traitement présente un avantage dans les situations où l’intensité du canal droit est prépondérante (indicateur de phase, ISD, proche de 1) et participe majoritairement au downmix : il subit une modification spectrale réduite, qui est en pratique quasiment inaudible.
- L’invention améliore ainsi l’existant en proposant une sélection d’une méthode de downmix adaptée dans le cas de signaux en phase ou d’intensité sonore déséquilibrées.
- Dans un mode de réalisation, le procédé comporte en outre une étape de détermination d’un indicateur de phase pour chaque fréquence f, représentatif d’une mesure de degré d’opposition de phase entre les composantes fréquentielles des canaux du signal stéréo, puis d’un indicateur de phase par trame du signal stéréophonique calculé selon le pourcentage de fréquence pour lequel l’indicateur de phase par fréquence dépasse un premier seuil.
Dans un mode de réalisation, si l’indicateur de phase par trame est inférieur, respectivement supérieur, à un deuxième seuil, le premier mode de traitement de réduction de canaux, respectivement le deuxième mode de traitement de réduction de canaux est appliqué à la trame courante. - Ainsi, cette décision par trame permet de s’affranchir des déphasages importants entre les fréquences et d’autres d’artefacts audibles qui peuvent apparaitre lorsque la décision varie d’une fréquence à l’autre comme dans les méthodes de l’état de l’art.
- Dans un autre mode de réalisation, un indicateur de différence de temps entre les canaux stéréo est déterminé par trame du signal stéréo, un troisième traitement de réduction de canaux étant mis en œuvre dans le cas où l’indicateur est supérieur à un seuil.
- Ainsi, un autre critère est appliqué pour sélectionner, dans ce mode de réalisation une autre méthode de traitement de réduction des canaux, appelé troisième traitement.
- Dans un mode particulier de réalisation, prenant en compte l’indicateur de différence de temps entre les canaux stéréo, déterminé par trame du signal stéréo, dans le cas où cet indicateur est inférieur à un seuil, une comparaison de l’indicateur de phase par trame, au deuxième seuil est effectuée afin de déterminer l’application d’un premier ou d’un deuxième traitement de réduction de canaux pour cette trame.
- Cette comparaison de l’indicateur de décalage temporel est alors effectuée en amont de la comparaison de l’indicateur de phase à un autre seuil. Ces différentes comparaisons permettent d’adapter au mieux le traitement de réduction des canaux aux caractéristiques du signal stéréo.
- Dans un mode de réalisation, la différence de phase déterminée entre les deux canaux du signal stéréo, est lissée dans le temps par un facteur d’oubli.
- En effet, la différence de phase peut varier rapidement dans le temps. Aussi, les filtres utilisés pour les différents traitements de réduction de canaux peuvent varier très rapidement d’une trame à l’autre, ce qui engendre des discontinuités parfois audibles lors de la transition d’une trame à l’autre. Le lissage de la différence de phase permet donc de limiter cet effet.
- Dans un mode de réalisation, le traitement de réduction de canaux correspond à un filtrage des canaux par des filtres, le procédé comportant une phase préalable de détermination des filtres avant application au signal stéréo par au moins une opération de troncature et de fenêtrage.
- Cette adaptation des filtres permet d’éviter une convolution circulaire et une latence qui peuvent exister dans les méthodes de l’état de l’art.
- Cette phase préalable de détermination des filtres comporte, dans un mode de réalisation, les étapes d’adaptation suivantes :
- obtention des réponses impulsionnelles des filtres correspondant au traitement de réduction de canaux ; - - troncature d’une partie des réponses impulsionnelles ;
- - pondération de la partie restante par l’application d’une fenêtre de pondération ;
- normalisation des réponses impulsionnelles résultantes du fenêtrage pour obtenir les filtres adaptés, à appliquer à une trame de signal stéréo. - Avantageusement, l’application du traitement de réduction de canaux par des filtres adaptés s’effectue d’une trame à l’autre par une étape de fondu enchainé en prenant en compte les réponses impulsionnelles des filtres utilisés pour la trame précédant la trame courante.
- Cette transition par fondu enchainé, permet d’éviter les artefacts audibles lorsque les filtres sont très différents entre deux trames successives, par exemple lorsqu’une nouvelle source apparaît.
- L’invention vise un dispositif de de traitement de réduction de canaux comportant un circuit de traitement pour la mise en œuvre des étapes du procédé de traitement de réduction de canaux tel que décrit précédemment.
- L’invention se rapporte à un programme informatique comportant des instructions pour la mise en œuvre du procédé de traitement de réduction de canaux tel que décrit précédemment, lorsqu’il est exécuté par un processeur.
- Enfin l’invention se rapporte à un support de stockage, lisible par un processeur, mémorisant un programme informatique comportant des instructions pour l’exécution du procédé de traitement de réduction de canaux décrit précédemment.
- D’autres caractéristiques et avantages de l’invention apparaîtront plus clairement à la lecture de la description suivante de modes de réalisation particuliers, donnés à titre de simples exemples illustratifs et non limitatifs, et des dessins annexés, parmi lesquels :
- [Fig 1a] illustre des canaux d’un signal stéréophonique, en phase tel que décrit précédemment ;
- [Fig 1b] illustre des canaux d’un signal stéréophonique, en opposition de phase tel que décrit précédemment ;
-
illustre sous forme de schéma bloc une chaine de traitement de réduction de canaux dans un mode de réalisation de l’invention ; -
illustre un mode de réalisation d’un calcul de filtre pour le traitement de réduction de canaux, ainsi qu’une sélection de traitement de réduction de canaux ; -
illustre un mode de réalisation d’une phase d’adaptation d’un filtre de traitement de réduction de canaux ; -
illustre un mode de réalisation d’une transition de l’application du traitement de réduction de canaux lors d’une transition entre deux trames de signal stéréo ; -
illustre un autre mode de réalisation d’un calcul de filtre pour le traitement de réduction de canaux, ainsi qu’une sélection de traitement de réduction de canaux ; -
illustre une méthode de traitement de réduction de canaux existant décrit précédemment ; -
illustre un exemple de réalisation structurelle d’un dispositif de traitement de réduction de canaux selon un mode de réalisation de l’invention. - La
montre un exemple d’une chaine de traitement d’un signal audio stéréophonique, le traitement comportant un traitement de réduction de canaux dit « downmix ». - A l’entrée de cette chaine de traitement, un signal stéréophonique x composé de deux canaux (x1(n) et x2(n)) encore appelés voie droite et voie gauche dans un premier temps découpé en 201, en trames de L échantillons (x1(k,l) et x2(k,l), k étant l’indice de la trame et n l’indice de l’échantillon). Le bloc 202 applique une transformée de type FFT (pour « Fast Fourier Transform » en anglais), pour obtenir des signaux dans le domaine fréquentiel (X1(k,f) et X2(k,f), f étant l’indice de la fréquence). En 203, une sélection et une détermination du filtre de réduction de canaux à appliquer à une trame de signal sont ensuite effectuées. Cette étape sera décrite en référence à la
. Le filtre ainsi déterminé est conditionné (ou adapté) en 204 pour le rendre causal et l’optimiser afin de diminuer la complexité de traitement. - Cette phase d’adaptation est décrite en référence à la
. - Une fois le filtre déterminé et adapté pour la trame courante, il est appliqué en 205 à cette trame courante. Afin d’éviter des artefacts audibles dus à un changement de filtres entre deux trames, un fondu enchainé est effectué en prenant en compte le filtre de la trame précédente
. - Cette étape sera décrite en référence à la
. - La
décrit un mode de réalisation détaillé du bloc 203 de la . Dans ce bloc de traitement, il est sélectionné et déterminé un premier ou un deuxième traitement de réduction de canaux à appliquer à une trame courante du signal stéréophonique. - Une première méthode de traitement de réduction de canaux T1 est ici défini en décalant les canaux gauche et droite du signal stéréophonique simultanément d’un angle défini par la moitié de la différence de phase (IPD) déterminée entre les deux canaux du signal stéréo. On a ainsi un signal de downmix, de la façon suivante :
-
- Cette méthode permet d’éviter une dégradation de type surplus de réverbération généré par un downmix classique (moyenne des deux signaux) ou de type filtrage en peigne en cas de décalage temporel entre les deux voies.
- Ce downmix ainsi défini peut-être vu, dans le domaine fréquentiel comme un filtrage selon l’équation suivante :
-
- avec
et . - Une deuxième méthode de downmix T2 est par exemple défini comme celle proposée dans le document Samsudin précédemment cité.
- Dans cette deuxième méthode, on a alors
et - Les canaux du signal stéréo, dans le domaine fréquentiel (X1(k,f) et X2(k,f)), servent d’une part à calculer un indicateur de phase en 301, représentatif d’une mesure de degré d’opposition de phase entre les canaux du signal stéréo et d’autre part la différence de phase entre les canaux (IPD) en 303.
- L’indicateur de phase est par exemple défini par l’indicateur ISD pour « Inter-Spectral Distance » tel que défini ci-dessus.
- Dans le mode de réalisation décrit ici, l’ISD est déterminé par trame de signal stéréophonique afin que la décision de sélection d’un premier traitement de réduction de canaux (premier downmix) ou d’un deuxième puisse se faire trame par trame.
- Cette décision par trame permet de s’affranchir des déphasages importants entre les fréquences et d’autres d’artefacts audibles qui peuvent apparaitre lorsque la décision varie d’une fréquence à l’autre comme dans la demande de brevet citée précédemment.
- Pour appliquer une décision par trame, un critère de décision selon l’indicateur de phase ISD est défini selon l’équation suivante en 302 :
-
- Ce critère mesure le pourcentage de fréquences dont le critère est favorable au downmix avec remise en phase, c'est-à-dire quand
. La décision est prise d’appliquer le premier downmix tel que défini ci-dessus, avec remise en phase, lorsque dépasse un certain seuil , que l’on fixe par exemple à 70%. - On a alors en 305 la décision suivante de sélection de downmix entre T1 et T2:
-
- En 303, la différence de phase IPD est obtenue entre les deux canaux du signal stéréo par
où ∠ indique la phase de l’opérande complexe. - Cependant, la décision à la trame peut être parfois insuffisante car l’IPD, telle que calculée selon la formule ci-dessus, varie très rapidement dans le temps. Aussi, les filtres
-
, peuvent varier très rapidement d’une trame à l’autre, ce qui engendre des discontinuités parfois audibles lors de la transition d’une trame à l’autre. Pour limiter cet effet, on pourra utiliser une version lissée de l’IPD dans le temps pour calculer les filtres . Une manière de lisser l’IPD est d’appliquer un filtrage passe-bas de type IIR d’ordre 1, en 304, tel que : -
- Le coefficient d’oubli
est choisi de manière ad-hoc. Il peut être intéressant de choisir un coefficient d’oubli important dans les basses fréquences, typiquement en dessous de 5kHz, car cela permet de garder une cohérence de phase dans la partie basse du spectre d’une trame à l’autre, le spectre des signaux de parole étant stationnaire, notamment dans sa partie basse et l’oreille particulière sensible à la phase dans cette partie du spectre. A contrario, il est intéressant de choisir un faible coefficient d’oubli dans les hautes fréquences : dans les fréquences hautes, typiquement au-dessus de 5kHz, la continuité de phase des signaux de parole est moins marquée et l’oreille est moins sensible aux discontinuités de phase dans cette partie du spectre. - On pourra choisir un coefficient d’oubli de la forme suivante :
-
- Les valeurs
, , et sont déterminées de façon expérimentale. Dans le cas de trames adjacentes de longueur L=20ms, on pourra choisir le jeu suivant de paramètres suivant : -
, - La figure 4 détaille à présent le bloc 204 de la figure 2. Les filtres
tels que par exemple définis dans les méthodes de downmix T1 et T2 définis ci-dessus sont reconditionnés ou encore adaptés pour éviter la convolution circulaire. - Dans une première étape, en 401, on calcule les réponses impulsionnelles
des filtres , tel que : -
- où les filtres
sont de taille N, dimension de la FFT. - Les réponses impulsionnelles ainsi définies sont classiquement non causales. Une technique classique pour les rendre causales consiste à effectuer une rotation de L/2 échantillons pour centrer la réponse en L/2. L’inconvénient est que le filtre ainsi reconstruit présente alors une latence de L/2. Pour éviter cette latence, on choisit de tronquer le filtre, en 402, en ne conservant qu’une portion de la première moitié de la réponse impulsionnelle
de la manière suivante : -
- Ce filtre présente l’avantage d’avoir généralement un maximum (en valeur absolue) sur son premier échantillon, ce qui garantit une latence nulle. En termes de réponse en fréquence, il présente une phase à peu près égale au filtre optimal de remise en phase
. - Le choix de P dépend de différents critères : une valeur de P proche de N⁄2 garantit une remise en phase quasi optimale, tandis qu’une valeur plus réduite permet de limiter la puissance de calcul nécessaire pour le filtrage. Une valeur réduite de P a également pour conséquence de lisser la phase du filtre. Cela présente un avantage avec des filtres définis par le traitement T2 tel que défini ci-dessus où la phase varie très rapidement d’une fréquence à l’autre : ces variations peuvent se traduire par un délai de groupe très élevé et perceptible par l’oreille humaine. Une faible valeur de P permet de supprimer toute ou partie de ces artefacts.
- Le filtre ainsi tronqué
, notamment lorsque P<N⁄2, voire P≪N⁄2, présente une queue de réponse impulsionnelle qui ne tend pas vers 0. Cela crée des discontinuités audibles de type cliquetis à la transition entre 2 trames. Aussi, pour éviter ces artefacts audibles, on pondère avec une fenêtre , en 403, tel que : -
- où
est monotone décroissante et dont les coefficients tendent vers 0 lorsque n tend vers P. Cela permet de réduire l’énergie des échantillons de la fin du filtre et d’éviter des discontinuités lors de la transition entre des filtres de trames consécutives. - Cette fenêtre peut être une demi-fenêtre triangulaire, ou encore une demi-fenêtre de Hann :
-
- Du fait de sa troncature et du fenêtrage, les filtres
possèdent une énergie réduite par rapport à celle du filtre optimal : ce dernier, en tant que filtre déphaseur pur, possède une norme 1/2 par construction. Aussi, on pourra procéder à une normalisation de l’énergie du filtre ainsi tronqué et fenêtré, en 404, tel que : -
- Où
est la norme 2 d’un vecteur. La décrit à présent en détails le bloc 205 de la où une implémentation de type OLS (pour « Overlap-and-Save » en anglais) du filtrage est opéré soit dans le domaine temporel ou fréquentiel. Le choix du domaine sera réalisé en fonction de la complexité qui dépend de la taille du filtre relativement à celle de la trame à traiter. - On présente ici une implémentation de type OLS dans le domaine temporel, avec des trames adjacentes de taille L.
- Dans un premier temps, on concatène, en 501, la trame actuelle avec les P-1 échantillons de la trame précédente (principe du Save) :
-
- Chaque voie est filtrée par son filtre déphaseur en 503 :
-
- Le downmix mono est alors créé par somme des deux voies remises en phase en 505 :
-
- Dans la pratique, les filtres peuvent être très différents entre deux trames successives, par exemple lorsqu’une nouvelle source apparaît. Dans ce cas, la transition entre
et peut devenir audible. Pour éviter ces artefacts, on peut appliquer une étape de fondu enchainé ou « cross-fade » en anglais. Pour réaliser ce cross-fade, on applique les filtres à la trame actuelle sur un nombre d’échantillons X : -
- Ceci est réalisé par le bloc 502 de la
. - Le nombre d’échantillons nécessaires au cross-fade devra être déterminé expérimentalement, en fonction de la taille des filtres, de la fréquence d’échantillonnage, …
- On crée un ensuite le downmix mono
en 504, à partir de filtres de la trame précédente : -
- Le signal issu du downmix
est créé en 506, à partir d’un cross-fade selon l’équation suivante : -
- Où
est une fonction monotone décroissante, avec et avec ε une valeur proche de 0 ou nulle. Typiquement, on pourra choisir une demi-fenêtre de Hann : -
- Il est à noter que, dans une intégration avec d’autres méthodes de downmix comme sur la
, les méthodes ne peuvent pas être toujours représentées par une opération de filtrage. C’est le cas de la méthode T3 de la ou toute autre méthode dont le gain dépend du niveau instantané du signal. - On a illustré sur la
, un dispositif de traitement de réduction de canaux 600, au sens de l’invention. - Dans ce cas, une solution est de calculer les downmix de chaque méthode pour la trame courante k et d’opérer une transition d’un downmix à l’autre par cross-fade. Plus précisément, dans le cas d’une transition d’une méthode T1 (ou T2) à la méthode T3, le downmix peut être réalisé entre les downmix mono des 2 méthodes, i.e. en sortie de T1 (ou T2) et le signal de la méthode T3. On peut aussi opérer le dowmix entre la sortie de T1 (ou T2) et le signal d(n). Dans ce dernier cas, la compensation d’énergie de la méthode T3 (adapt_gain) s’appliquerait en permanence à toutes les méthodes. La décision du basculement d’une méthode à l’autre pourra être motivée par d’autres critères que l’ISD, par exemple des paramètres déjà calculés par la méthode T3 (données Param. de la
) comme l’ITD, en choisissant d’appliquer la méthode T3 lorsque l’ITD est très important par exemple, ou toute autre critère ou combinaison de critères. - On a illustré sur la
, un dispositif de traitement de réduction de canaux 800, au sens de l’invention. - Le dispositif 800 comporte un circuit de traitement incluant typiquement :
- une mémoire MEM1 pour stocker des données d’instructions d’un programme informatique au sens de l’invention;
- une interface INT1 de réception d’un signal audio stéréo x ;
- un processeur PROC1 pour recevoir ce signal et le traiter en exécutant les instructions de programme informatique que stocke la mémoire MEM1, en vue d’effectuer un traitement de réduction de canaux ; en particulier, le processeur étant apte à piloter les modules de traitement tels que décrits en référence aux figures 2 à 5; et
- une interface de communication COM 1 pour transmettre les signaux réduits, issus du traitement de réduction de canaux, y, à un autre module de traitement, par exemple un module de codage ou de décodage d’un codeur ou d’un décodeur de signal audio. - Bien entendu, cette
illustre un exemple d’une réalisation structurelle d’un dispositif de traitement de réduction de canaux au sens de l’invention. Les figures 2 à 7 commentées ci-dessus décrivent en détails des réalisations fonctionnelles de ce dispositif. - Les applications de ce type de traitement de réduction de canaux se trouvent par exemple dans le codage audio, par exemple lorsque le distant n’a pas les capacités de restituer sur son terminal un son stéréo. Dans ce cas, il n’est pas nécessaire de transporter un signal stéréo et cela permet d’économiser de la bande passante. Ce type de procédé peut intervenir lors de conversations en point à point si l’un des participants fait une prise son stéréo ou binaurale. Ce type de procédé peut également être présent lors de conférence à plusieurs : le pont de conférence spatialise la scène en créant une scène stéréo, mais tous les participants n’ont pas nécessairement des capacités de restitution stéréo. Il convient alors d’effectuer un downmix de la scène en mono pour ces participants.
- L’invention peut également s’appliquer pour un décodage audio : dans ce cas, c’est le renderer (module de restitution) de l’utilisateur qui va effectuer le downmix du contenu stéréo pour s’adapter aux capacités réduites de l’utilisateur (simple haut-parleur par exemple).
Claims (11)
- Procédé de traitement de réduction de canaux d’un signal stéréophonique pour obtenir un signal monophonique, comportant une sélection (305) pour une trame de signal stéréophonique, entre :
- un premier mode de traitement de réduction de canaux (T1) comportant un filtrage avec remise en phase sur chacun des canaux du signal stéréophonique selon un angle défini par la moitié de la différence de phase déterminée (303, 304) entre les deux canaux du signal stéréophonique, et
un deuxième mode de traitement de réduction de canaux (T2) comportant un filtrage avec remise en phase sur un seul des canaux du signal stéréophonique selon un angle défini par la différence de phase déterminée (303, 304) entre les deux canaux du signal stéréophonique,
la sélection du premier mode de traitement, respectivement du deuxième mode de traitement, étant fonction de la valeur d’un indicateur de phase déterminé par trame (302). - Procédé selon la revendication 1, dans lequel le procédé comporte en outre une étape de détermination d’un indicateur de phase pour chaque fréquence f (
) représentatif d’une mesure de degré d’opposition de phase entre les composantes fréquentielles des canaux du signal stéréo puis d’un indicateur de phase par trame du signal stéréophonique ( ) calculé selon le pourcentage de fréquence pour lequel l’indicateur de phase par fréquence dépasse un premier seuil. - Procédé selon la revendication 2 dans lequel, si l’indicateur de phase par trame est inférieur, respectivement supérieur, à un deuxième seuil (
), le premier mode de traitement de réduction de canaux, respectivement le deuxième mode de traitement de réduction de canaux est appliqué à la trame courante. - Procédé selon l’une des revendications précédentes dans lequel un indicateur de différence de temps entre les canaux stéréo est déterminé par trame du signal stéréo, un troisième traitement de réduction de canaux étant mis en œuvre dans le cas où l’indicateur est supérieur à un seuil.
- Procédé selon l’une des revendications précédentes, dans lequel un indicateur de différence de temps entre les canaux stéréo est déterminé par trame du signal stéréo et dans lequel dans le cas où cet indicateur est inférieur à un seuil, une comparaison de l’indicateur de phase par trame, au deuxième seuil, est effectuée afin de déterminer l’application d’un premier ou d’un deuxième traitement de réduction de canaux pour cette trame.
- Procédé selon l’une des revendications 1 à 5, dans lequel la différence de phase déterminée entre les deux canaux du signal stéréo est lissée dans le temps par un facteur d’oubli.
- Procédé selon l’une des revendications précédentes, dans lequel le traitement de réduction de canaux correspond à un filtrage des canaux par des filtres, le procédé comportant une phase préalable de détermination des filtres avant application au signal stéréo par au moins une opération de troncature et de fenêtrage.
- Procédé selon la revendication 7, dans lequel la phase préalable de détermination des filtres comporte les étapes d’adaptation suivantes :
- obtention des réponses impulsionnelles des filtres correspondant au traitement de réduction de canaux ;
- troncature d’une partie des réponses impulsionnelles ;
- pondération de la partie restante par l’application d’une fenêtre de pondération ;
- normalisation des réponses impulsionnelles résultantes du fenêtrage pour obtenir les filtres adaptés, à appliquer à une trame de signal stéréo. - Procédé selon la revendication 8, dans lequel l’application du traitement de réduction de canaux par des filtres adaptés s’effectue d’une trame à l’autre par une étape de fondu enchainé en prenant en compte les réponses impulsionnelles des filtres utilisés pour la trame précédant la trame courante.
- Dispositif de traitement de réduction de canaux comportant un circuit de traitement pour la mise en œuvre des étapes du procédé de traitement de réduction de canaux selon l’une des revendications 1 à 9.
- Support de stockage, lisible par un processeur, mémorisant un programme informatique comportant des instructions pour l’exécution du procédé de selon l’une des revendications 1 à 9.
Applications Claiming Priority (4)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| FR2303719A FR3147898A1 (fr) | 2023-04-13 | 2023-04-13 | Traitement optimisé de réduction de canaux d’un signal audio stéréophonique |
| FR2304288A FR3148316A1 (fr) | 2023-04-27 | 2023-04-27 | Traitement optimisé de réduction de canaux d’un signal audio stéréophonique |
| FR2305109A FR3149160A1 (fr) | 2023-05-23 | 2023-05-23 | Traitement optimisé de réduction de canaux d’un signal audio stéréophonique |
| PCT/EP2024/059644 WO2024213554A1 (fr) | 2023-04-13 | 2024-04-10 | Traitement optimisé de réduction de canaux d'un signal audio stéréophonique |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| EP4695798A1 true EP4695798A1 (fr) | 2026-02-18 |
Family
ID=90720283
Family Applications (3)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| EP24718189.4A Pending EP4695799A1 (fr) | 2023-04-13 | 2024-04-10 | Traitement optimisé de réduction de canaux d'un signal audio stéréophonique |
| EP24718455.9A Pending EP4695800A1 (fr) | 2023-04-13 | 2024-04-10 | Traitement optimisé de réduction de canaux d'un signal audio stéréophonique |
| EP24718188.6A Pending EP4695798A1 (fr) | 2023-04-13 | 2024-04-10 | Traitement optimisé de réduction de canaux d'un signal audio stéréophonique |
Family Applications Before (2)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| EP24718189.4A Pending EP4695799A1 (fr) | 2023-04-13 | 2024-04-10 | Traitement optimisé de réduction de canaux d'un signal audio stéréophonique |
| EP24718455.9A Pending EP4695800A1 (fr) | 2023-04-13 | 2024-04-10 | Traitement optimisé de réduction de canaux d'un signal audio stéréophonique |
Country Status (4)
| Country | Link |
|---|---|
| EP (3) | EP4695799A1 (fr) |
| KR (3) | KR20250168299A (fr) |
| CN (3) | CN121079736A (fr) |
| WO (3) | WO2024213554A1 (fr) |
Family Cites Families (6)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US6005948A (en) * | 1997-03-21 | 1999-12-21 | Sony Corporation | Audio channel mixing |
| WO2009141775A1 (fr) * | 2008-05-23 | 2009-11-26 | Koninklijke Philips Electronics N.V. | Appareil paramétrique de mixage amplificateur stéréo, décodeur paramétrique stéréo, appareil paramétrique de mixage réducteur stéréo, codeur paramétrique stéréo |
| WO2010036062A2 (fr) * | 2008-09-25 | 2010-04-01 | Lg Electronics Inc. | Procédé et appareil de traitement d'un signal |
| TWI557723B (zh) * | 2010-02-18 | 2016-11-11 | 杜比實驗室特許公司 | 解碼方法及系統 |
| FR3045915A1 (fr) | 2015-12-16 | 2017-06-23 | Orange | Traitement de reduction de canaux adaptatif pour le codage d'un signal audio multicanal |
| CN109859766B (zh) * | 2017-11-30 | 2021-08-20 | 华为技术有限公司 | 音频编解码方法和相关产品 |
-
2024
- 2024-04-10 KR KR1020257033710A patent/KR20250168299A/ko active Pending
- 2024-04-10 KR KR1020257033512A patent/KR20250168287A/ko active Pending
- 2024-04-10 EP EP24718189.4A patent/EP4695799A1/fr active Pending
- 2024-04-10 WO PCT/EP2024/059644 patent/WO2024213554A1/fr not_active Ceased
- 2024-04-10 WO PCT/EP2024/059646 patent/WO2024213556A1/fr not_active Ceased
- 2024-04-10 CN CN202480024741.5A patent/CN121079736A/zh active Pending
- 2024-04-10 EP EP24718455.9A patent/EP4695800A1/fr active Pending
- 2024-04-10 CN CN202480022528.0A patent/CN120898244A/zh active Pending
- 2024-04-10 CN CN202480022254.5A patent/CN120917512A/zh active Pending
- 2024-04-10 EP EP24718188.6A patent/EP4695798A1/fr active Pending
- 2024-04-10 WO PCT/EP2024/059645 patent/WO2024213555A1/fr not_active Ceased
- 2024-04-10 KR KR1020257033511A patent/KR20260004325A/ko active Pending
Also Published As
| Publication number | Publication date |
|---|---|
| KR20260004325A (ko) | 2026-01-08 |
| WO2024213554A1 (fr) | 2024-10-17 |
| CN121079736A (zh) | 2025-12-05 |
| WO2024213556A1 (fr) | 2024-10-17 |
| EP4695799A1 (fr) | 2026-02-18 |
| KR20250168299A (ko) | 2025-12-02 |
| EP4695800A1 (fr) | 2026-02-18 |
| WO2024213555A1 (fr) | 2024-10-17 |
| CN120898244A (zh) | 2025-11-04 |
| CN120917512A (zh) | 2025-11-07 |
| KR20250168287A (ko) | 2025-12-02 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| EP3391370B1 (fr) | Traitement de réduction de canaux adaptatif pour le codage d'un signal audio multicanal | |
| EP1992198B1 (fr) | Optimisation d'une spatialisation sonore binaurale a partir d'un encodage multicanal | |
| EP2374123B1 (fr) | Codage perfectionne de signaux audionumeriques multicanaux | |
| EP2374124B1 (fr) | Codage perfectionne de signaux audionumériques multicanaux | |
| EP2104936B1 (fr) | Codage par transformee, utilisant des fenetres de ponderation et a faible retard | |
| EP2304721B1 (fr) | Synthese spatiale de signaux audio multicanaux | |
| FR2966634A1 (fr) | Codage/decodage parametrique stereo ameliore pour les canaux en opposition de phase | |
| WO2017153697A1 (fr) | Codage et décodage optimisé d'informations de spatialisation pour le codage et le décodage paramétrique d'un signal audio multicanal | |
| EP2319037B1 (fr) | Reconstruction de données audio multicanal | |
| EP2589045B1 (fr) | Codage/décodage prédictif linéaire adaptatif | |
| WO2024213554A1 (fr) | Traitement optimisé de réduction de canaux d'un signal audio stéréophonique | |
| FR3147898A1 (fr) | Traitement optimisé de réduction de canaux d’un signal audio stéréophonique | |
| FR3148316A1 (fr) | Traitement optimisé de réduction de canaux d’un signal audio stéréophonique | |
| WO2011073600A1 (fr) | Codage/decodage parametrique stereo avec optimisation du traitement de reduction des canaux | |
| FR3149160A1 (fr) | Traitement optimisé de réduction de canaux d’un signal audio stéréophonique | |
| EP4042418B1 (fr) | Détermination de corrections à appliquer a un signal audio multicanal, codage et décodage associés | |
| FR3157767A1 (fr) | Traitement de réduction de canaux d’un signal audio stéréophonique par remise en phase optimisée | |
| FR3157766A1 (fr) | Transition entre deux modes de traitement de réduction de canaux avec contrôle de niveau optimisé. | |
| JP2026513987A (ja) | ステレオオーディオ信号のチャネルを低減するための最適化処理 | |
| WO2023232823A1 (fr) | Titre: codage audio spatialisé avec adaptation d'un traitement de décorrélation | |
| FR2911227A1 (fr) | Codage par transformee, utilisant des fenetres de ponderation et a faible retard | |
| FR3164561A1 (fr) | Post-traitement d’un signal audio selon un modèle de post-traitement issu d’un entrainement optimisé | |
| WO2009081002A1 (fr) | Traitement d'un flux audio 3d en fonction d'un niveau de presence de composantes spatiales |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: UNKNOWN |
|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: THE INTERNATIONAL PUBLICATION HAS BEEN MADE |
|
| PUAI | Public reference made under article 153(3) epc to a published international application that has entered the european phase |
Free format text: ORIGINAL CODE: 0009012 |
|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: REQUEST FOR EXAMINATION WAS MADE |
|
| 17P | Request for examination filed |
Effective date: 20251106 |
|
| AK | Designated contracting states |
Kind code of ref document: A1 Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC ME MK MT NL NO PL PT RO RS SE SI SK SM TR |