EP3275212B1 - Verfahren zur analyse und dekomposition von stereoaudiosignalen - Google Patents
Verfahren zur analyse und dekomposition von stereoaudiosignalen Download PDFInfo
- Publication number
- EP3275212B1 EP3275212B1 EP16713352.9A EP16713352A EP3275212B1 EP 3275212 B1 EP3275212 B1 EP 3275212B1 EP 16713352 A EP16713352 A EP 16713352A EP 3275212 B1 EP3275212 B1 EP 3275212B1
- Authority
- EP
- European Patent Office
- Prior art keywords
- time
- frequency
- signal
- audio signal
- panning
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Active
Links
- 230000005236 sound signal Effects 0.000 title claims description 147
- 238000000034 method Methods 0.000 title claims description 35
- 238000004091 panning Methods 0.000 claims description 132
- 230000001419 dependent effect Effects 0.000 claims description 68
- 238000001914 filtration Methods 0.000 claims description 6
- 230000002596 correlated effect Effects 0.000 claims description 5
- 230000006870 function Effects 0.000 description 26
- 238000013459 approach Methods 0.000 description 8
- 230000036962 time dependent Effects 0.000 description 7
- 238000001228 spectrum Methods 0.000 description 5
- 230000008901 benefit Effects 0.000 description 4
- 230000000875 corresponding effect Effects 0.000 description 4
- 230000009466 transformation Effects 0.000 description 4
- 238000012935 Averaging Methods 0.000 description 3
- 238000004458 analytical method Methods 0.000 description 3
- 238000004364 calculation method Methods 0.000 description 3
- 230000007613 environmental effect Effects 0.000 description 3
- 238000012545 processing Methods 0.000 description 3
- 238000000354 decomposition reaction Methods 0.000 description 2
- 230000000694 effects Effects 0.000 description 2
- 238000004519 manufacturing process Methods 0.000 description 2
- 230000004044 response Effects 0.000 description 2
- 230000006978 adaptation Effects 0.000 description 1
- 230000002730 additional effect Effects 0.000 description 1
- 238000004090 dissolution Methods 0.000 description 1
- 238000000605 extraction Methods 0.000 description 1
- 238000012804 iterative process Methods 0.000 description 1
- 238000002156 mixing Methods 0.000 description 1
- 230000010363 phase shift Effects 0.000 description 1
- 239000007787 solid Substances 0.000 description 1
- 238000012546 transfer Methods 0.000 description 1
Images
Classifications
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04S—STEREOPHONIC SYSTEMS
- H04S3/00—Systems employing more than two channels, e.g. quadraphonic
- H04S3/008—Systems employing more than two channels, e.g. quadraphonic in which the audio signals are in digital form, i.e. employing more than two discrete digital channels
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04S—STEREOPHONIC SYSTEMS
- H04S5/00—Pseudo-stereo systems, e.g. in which additional channel signals are derived from monophonic signals by means of phase shifting, time delay or reverberation
- H04S5/005—Pseudo-stereo systems, e.g. in which additional channel signals are derived from monophonic signals by means of phase shifting, time delay or reverberation of the pseudo five- or more-channel type, e.g. virtual surround
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04S—STEREOPHONIC SYSTEMS
- H04S2400/00—Details of stereophonic systems covered by H04S but not provided for in its groups
- H04S2400/05—Generation or adaptation of centre channel in multi-channel audio systems
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04S—STEREOPHONIC SYSTEMS
- H04S2400/00—Details of stereophonic systems covered by H04S but not provided for in its groups
- H04S2400/11—Positioning of individual sound objects, e.g. moving airplane, within a sound field
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04S—STEREOPHONIC SYSTEMS
- H04S2420/00—Techniques used stereophonic systems covered by H04S but not provided for in its groups
- H04S2420/07—Synergistic effects of band splitting and sub-band processing
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04S—STEREOPHONIC SYSTEMS
- H04S3/00—Systems employing more than two channels, e.g. quadraphonic
- H04S3/02—Systems employing more than two channels, e.g. quadraphonic of the matrix type, i.e. in which input signals are combined algebraically, e.g. after having been phase shifted with respect to each other
Definitions
- the invention relates to a method for analyzing and decomposing a stereo audio signal and to a method for generating a multichannel audio signal.
- the impression can be created that phantom sound sources are distributed to a listening area between the listener and the two playback devices.
- the level difference between the first and the second audio signal primarily provides information about which azimuthal direction the sound appears to come from relative to the listener. This information is merely one-dimensional and therefore can not naturally produce a realistic reproduction of spatiality.
- the azimuth angle of the possible positioning of phantom sound sources is limited to the area which is spanned by a first link between the listener and the left-hand display device and by a second link between the listener and the right-hand display device.
- Multi-channel audio systems with, for example, five or seven playback devices thus give the listener a much more detailed spatial impression. However, this added benefit is essentially broken when the recording is available only as a stereo audio signal.
- the WO 2010/028 784 A1 discloses a further method for decomposing a stereo audio signal into a diffuse ambient sound component on the one hand and into directed direct sound components on the other hand, wherein the directions are estimated from which the direct sound components seem to come from.
- the object of the present invention is therefore to reconstruct the spatial information about the arrangement of the sound sources contained in a stereo audio signal with a lower computational effort while maintaining or improving the sound quality.
- This stereo audio signal has a first audio signal for a left playback device and a second audio signal for a right playback device.
- the method provides the following steps: First, the first audio signal is converted into a first time-frequency representation.
- the second audio signal is converted into a second time-frequency representation.
- the transfer of the audio signals in the time-frequency representation can be done by any method.
- the short-time Fourier transform (STFT) is used.
- a first equation is set up which relates the first time-frequency representation to the product of a first time and frequency dependent panning coefficient with the time and frequency dependent signal of a direct sound source located in a listening area between the left display and the right display
- a second equation is set up which relates the second time-frequency representation to the product of a second time- and frequency-dependent panning coefficient with the same signal of the same direct sound source.
- the panning coefficients are designed to position the direct sound source in the listening area.
- the panning coefficients and / or a position coefficient corresponding to the difference of the squares of the panning coefficients are then determined as solutions of the equation system formed from the two equations.
- To the stereo audio signal usually has a variety of independent sound sources contributed.
- the portion of the first and the second audio signal that is accessible to directional hearing is therefore composed of contributions from these individual sound sources.
- Each of these individual contributions is the product of a time- and frequency-dependent complex amplitude and a panning coefficient that depends on the positioning of the sound source relative to the listener.
- the left and the right audio signal are, if one disregards ambient signals, in each case sums over such individual contributions. Since the ambient signals are diffuse, uniformly distributed over all spatial directions and also small compared to the direct signal, they can be disregarded in the equation system for determining the panning coefficients. The equation system is thereby much easier solvable.
- the complex amplitude of this combined sound source is direction independent.
- the directional dependence lies solely in the panning coefficients.
- the system of equations can be mathematically transformed and the panning coefficients can be derived from the first and second channels of the panning coefficient Determine stereo signal.
- the combination between the two panning coefficients makes it possible to solve the system of equations by simple mathematical transformation and to give the panning coefficients a closed formula in the time-frequency representations of the left and the right audio signal. In the current operation of the method, solutions of the equation system are therefore particularly quickly available by inserting the time-frequency representations in the closed formula.
- the equation system is solved under the additional condition that the sum of the squares of the panning coefficients is constant.
- the sum of these squares is equal to 1 for the constant-power panning commonly used in music production. This causes the sound source to be perceived as loud no matter what its position in the listening area.
- the panning coefficients contain the complete information on what frequency the signal seems to come from and at what time in the listening area.
- the time-frequency representations of the first and second audio signals in phase with the time and frequency-dependent complex amplitude of the direct sound source.
- the first panning coefficient results as the root of the ratio of the square of the sum of the time-frequency representation of the first audio signal (counter) and the sum of the squares of the sum of the time-frequency representation of the first and second audio signal (denominator).
- the second panning coefficient is the root of the ratio of the square of the sum of the time-frequency representation of the second audio signal (numerator) and the sum of the squares of the time-frequency representation of the first and second audio signals (denominator).
- the position coefficient is determined from the ratio of the difference of the magnitude squares of both time-frequency representations to the sum of the magnitude squares of both time-frequency representations.
- An alternative embodiment of the invention also starts from a first audio signal for a left-hand display device and a second audio signal for a right-hand display device.
- the first audio signal is converted into a first time-frequency representation
- the second audio signal is converted into a second time-frequency representation.
- the time- and frequency-dependent power of the first audio signal is determined from the first time-frequency representation, and from the second time-frequency representation, the time- and frequency-dependent power of the second audio signal is determined. Accordingly, the equations for the panning coefficients are also changed.
- a first equation is set up which relates the time and frequency dependent power of the first audio signal to the product of the square of a first time and frequency dependent panning coefficient with the time and frequency dependent power of one in a listening area between the left display device and the first right playback device arranged direct sound source.
- a second equation is set up which relates the time and frequency dependent power of the second audio signal to the product of the square of a second time and frequency dependent panning coefficient with the same time and frequency dependent power of the same direct sound source.
- the panning coefficients are designed to position the direct sound source in the listening area.
- the panning coefficients, and / or a position coefficient corresponding to the ratio of a difference of the panning coefficients to the sum of the panning coefficients are determined as solutions of the equation system formed from the two equations.
- a filterbank typically includes a plurality of bandpass filters connected in parallel, each passing through the portion of the signal falling within a particular frequency band. The signal at the output of each of these bandpass filters is a time dependent signal. The totality of all these signals, together with the information to which frequency band each signal corresponds, forms a time-frequency representation.
- Such a time-frequency representation can be obtained in this way for a faster and easier than with the short-time Fourier transform (STFT).
- STFT short-time Fourier transform
- low order and low group delay bandpass filters can be used.
- time-frequency representation also facilitates the frequency-dependent processing of the signal.
- the frequency resolution can be varied by covering a less interesting frequency range with a wide bandpass filter, while covering a frequency range of particular interest with many narrow bandpass filters.
- the frequency resolution is always an equidistant raster.
- the time and frequency dependent power of at least one audio signal at a point of interest may be determined as a weighted sum of the time and frequency dependent power of the audio signal at an earlier time and the square of the time frequency representation of that audio signal at the time of interest.
- the time in the time-frequency representation is discretized, the earlier time may be a discrete time unit before the point of interest.
- the instantaneous power of an audio signal can thus be determined, for example, via a recursive averaging from the time-frequency representation.
- the equation system is solved under the additional condition that the sum of the squares of the panning coefficients is constant, the position coefficient being calculated from the ratio of the difference between the roots of the time and time frequency-dependent power of both audio signals to the sum of the roots of the time and frequency-dependent power of both audio signals is determined.
- the resolution of the system of equations to the panning coefficients takes place in a completely analogous manner to the approach over the time-frequency representations and the signal of the direct sound source.
- the panning coefficients and possibly the position coefficient are only expressed by other quantities.
- the first panning coefficient is determined as the root of the ratio of the time- and frequency-dependent power of the first audio signal to the sum of the time- and frequency-dependent powers of both audio signals.
- the second panning coefficient is accordingly determined as the root of the ratio of the time- and frequency-dependent power of the second audio signal to the sum of the time- and frequency-dependent powers of both audio signals.
- the time and frequency dependent power of at least one audio signal at a point of interest is determined as the weighted sum of the time and frequency dependent power of the audio signal at an earlier time and the square of the time frequency representation of that audio signal at the time of interest.
- the stereo audio signal will not only contain a directional direct signal component. Instead, the first and the second audio signal will each be superimposed with a diffuse ambient signal. Therefore, in a further particularly advantageous embodiment of the invention from the panning coefficients the signal of the direct sound source (direct signal) and / or two non-directional, i. not correlated with the direct sound source, detected ambient signals.
- the first environment signal is included only in the time-frequency representation of the first audio signal
- the second environment signal is included only in the time-frequency representation of the second audio signal.
- the listening experience is more accurately reproduced when only the direct signal is reproduced in a directed manner using the panning coefficients.
- the diffuse ambient signal should also be rendered diffused.
- the direct signal and the ambient signals are determined by an iterative method based on an iteration rule which relates the direct signal of each iteration and / or a contribution to this signal the ambient signals of the previous iteration.
- the volume of a contribution to the direct signal may be set as the arithmetic mean of the volumes of both previous iteration's ambient signals. This is based on the assumption that the direct signal is present in the first and second audio signal with the same phase and the ambient signals are phase-shifted to it.
- the approximation can be refined by recalculating the panning coefficients from the ambient signals of the previous iterations at each iteration.
- the ambient signals of the previous iteration can be evaluated as time-frequency representations of a left and a right audio signal, so that the panning coefficients can be calculated as described above by solving a system of equations.
- the first ambient signal is then corrected at each iteration by an amount which is the product of the newly calculated first panning coefficient with the direct signal, or with the signal contribution, according to the current iteration.
- the second ambient signal is corrected at each iteration by an amount that is the product of the newly calculated second panning coefficient with the direct signal, or with the signal contribution, according to the current iteration.
- the entire direct signal results as the sum of the signal contributions determined in all individual iterations. Since both the iteratively calculated panning coefficients and the iteratively determined direct signal are only estimates in each case, it is not guaranteed that the sum of the first signal weighted by the first panning coefficient and the first panning coefficient Ambient signal exactly corresponds to the value of the time-frequency representation of the first audio signal. Analogously, it can not be guaranteed that the sum of the second panning coefficient-weighted direct signal and the second surround signal accurately reproduces the value of the time-frequency representation of the second audio signal.
- the direct signal and the ambient signals together do not necessarily obey the signal model, which was based on the division of the time-frequency representations of the first and the second audio signal in each case a directed and a diffuse portion. Therefore, it is advantageous not to continue to use directly the environment signals determined in the last iteration but to determine the first environment signal as the difference between the first time-frequency representation and the direct signal weighted with the first panning coefficient according to the first iteration.
- the second ambient signal should be determined as the difference between the second time-frequency representation and the direct signal weighted with the second panning coefficient according to the first iteration.
- Another advantageous approach for determining the environment signals not correlated with the direct sound source is based on the assumption that both environmental signals sound similar, but are decorrelated by different propagation paths and reflections.
- a first equation is set up which relates the first time-frequency representation to the sum of the product of the first panning coefficient with the time- and frequency-dependent signal of the direct sound source and the filtering of a single common environment signal having a first decorrelation function.
- a second equation is set up, which relates the second time-frequency representation to the sum of the product of the second panning coefficient with the time- and frequency-dependent signal of the direct sound source and from the Filter the common ambient signal with a second decorrelation function.
- the filtering of a signal with a decorrelation function can be realized, for example, by a convolution of the signal with the decorrelation function.
- the time- and frequency-dependent signal of the direct sound source, and / or the common environment signal are determined as solutions of the equation system formed from the two equations.
- the decorrelation functions may be initialized by various methods known in the art to obtain realistic-sounding decorrelated signals. Typically, the functions are generated in such a way that results in random frequency responses.
- filtering and in particular a convolution
- filtering can be approximately expressed as frequency band-wise multiplication by the decorrelation function.
- the decorrelation function may be represented, for example, per frequency band by a gain factor and a phase rotation.
- the time- and frequency-dependent signal of the direct sound source becomes advantageous as the difference between the frequency-band-wise product of the first time-frequency representation with the second decorrelation function and the frequency-band-wise product of the second time-frequency representation with the first decorrelation function divided by the difference between the second time-frequency representation frequency bandwise product of the first panning coefficient with the second decorrelation function and the frequency bandwise product of the second panning coefficient with the first decorrelation function.
- the common ambient signal becomes advantageous as the difference between the product of the second time-frequency representation with the first panning coefficient and the product of the first time-frequency representation with the second panning coefficient divided by the difference between the frequency bandwise product of the first first panning coefficients with the second decorrelation function and the frequency bandwise product of the second panning coefficient with the first decorrelation function.
- the stereo audio signal has a first audio signal for a left-hand reproduction device and a second audio signal for a right-hand reproduction device.
- the stereo audio signal is first analyzed by a method according to the invention. Subsequently, a plurality of repanning coefficients is determined from the panning coefficients, wherein each of these repeating coefficients is assigned a sound channel of a plurality of sound channels of the multichannel audio signal.
- the repeating coefficients for the plurality of audio channels are designed to position a direct sound source in a listening area between a plurality of multichannel audio signal playback devices.
- the signal of the direct sound source (direct signal) is now offset with a first Repanning coefficient and assigned to a first sound channel. It is charged with a second repanning coefficient and assigned to a second sound channel. Finally, it is also charged with a third repanning coefficient and assigned to a third sound channel.
- the first surround signal is additively added to the first sound channel
- the second surround signal is additively added to the third sound channel
- each audio channel is converted into a respective reproduction signal of the multi-channel audio signal, each playback signal is provided for each one reproducing device.
- the determination of the repanning coefficients represents a redistribution of the direction-dependent direct signal to any loudspeaker arrangement.
- the ambient signal is then superimposed additively on a selection of loudspeakers.
- any method according to the prior art may be used, for example the method according to DE 10 2012 017 296 B4 or even the " vector base amplitude panning "according to (Ville Pulkki," Virtual sound source positioning using vector based amplitude panning ", Journal of the Audio Engineering Society, Vol. 45, Issue 6, pp. 456-466, June 1997 ).
- the extracted direct and ambient sound signals can be used not only for the immediate playback of the stereo audio signal as an upgraded multi-channel audio signal. For example, they can be saved for later playback and / or manipulated before playback to enhance the listening experience with additional effects.
- the signal of the direct sound source (direct signal) from the ratio of the sum of both time-frequency representations of the audio signals (counter) to the sum of both panning coefficients (denominator) is determined.
- the ambient signals can also be calculated from the ratio of a difference between the time-frequency representation of the first audio signal, weighted by the second panning coefficient, and the time-frequency representation of the second audio signal, weighted by the first panning coefficient (counter). , to the sum of both panning coefficients (denominator).
- FIG. 1 illustrates sketchily the assumption, the introduction of which significantly simplifies the determination of the panning coefficients 310 (a L (b, k)) and 320 (a R (b, k)).
- the time is given below basically as the block number b of the block obtained in the short-time Fourier transform (STFT).
- STFT short-time Fourier transform
- the frequency band or frequency index is indexed with k.
- the stereo audio signal comprises a first audio signal 110 for a left playback device 810 and a second audio signal 120 for a right playback device 820.
- STFT short time Fourier transform
- the first audio signal 110 is written into its time-frequency representation 115 (X L (b , k)).
- the second audio signal 120 is converted to its time-frequency representation 125 (X R (b, k)).
- the handset is located at position 1 on the edge of the listening area 890.
- the equilateral triangle defined by the handset 1, the left display device 810, and the right hand display device 820 is designated 891 and is inscribed in the circular listening area 890.
- a single direct sound source 813 whose volume 330 varies as a function of the time b and the frequency k along the solid circular arc 892 at the edge of the listening area 890 in the area between the left playback device 810 and the right playback device 820 moves. This movement is also dependent on the time b and the frequency k.
- the current azimuthal position ⁇ (b, k) of the direct sound source 813 on the circular arc determines the panning coefficients 310 and 320.
- the signal strength 330 is multiplicatively weighted by the second panning coefficient 320, the time-frequency representation 125 of the second audio signal 120 is obtained.
- FIG. 2 illustrates the relationship between the first and second panning coefficients 310 and 320 on the one hand and the position coefficient 390 ( ⁇ ) on the other hand.
- the values of these coefficients over the azimuth position ⁇ are plotted from the left L through the center M to the right R.
- the panning coefficients 310 and 320 do not extend linearly as a function of the azimuth position ⁇ .
- the position coefficient 390 on the other hand, has the advantage that it runs continuously from the left L through the center M to the right R.
- FIG. 3 clarifies the repanning for the purpose of reproducing the stereo audio signal as a multichannel audio signal.
- the direct sound source signal 330 is weighted with repeating coefficients 410 (g 1 ), 420 (g 2 ) and 430 (g 3 ) to sound channels 580, 585 and 590 reproduced on the three loudspeakers L, C and R.
- the determination of the repanning coefficients 410, 420 and 430 is based on the panning coefficients 310 and 320 determined during the analysis of the stereo signal.
- the environment signals 510 and 520 which are furthermore determined during the analysis are additively superimposed on the audio channels 580 and 590 on the one hand. On the other hand, they are played on additional speakers RL and RR.
- All speakers L, C, R, RL and RR are arranged on a circle K which simultaneously defines the listening area 890 around the listener 1.
- the angular positions of the loudspeakers L, C and R are each 30 degrees apart.
- the angular positions of the loudspeakers RL and C or RR and C are each 115 degrees apart.
- FIG. 4 Sketchy illustrates the alternative access to the panning coefficients 310 and 320 via equations in performances.
- the two audio signals 110 and 120 are in this example each with a filter bank 150 in Time range decomposed.
- each filter is still a time dependent signal.
- the information, from which filter the signal comes, so to which band index k it belongs, is the frequency information.
- These functions together form the time and frequency dependent power P L, R (b, k) of the left audio signal 110 and the right audio signal 120 denoted by reference numerals 115a and 125a, respectively. This power is on the left side of the equation.
- the product is the square of the panning coefficient a L, R (b, k) with the power P s (b, k) (reference numeral 330a) of the desired direct signal, indicated by reference symbols 310 and 320, respectively s (b, k) (reference numeral 330).
- FIG. 5 is on FIG. 1 Ajar and sketches sketch out how the panning coefficients 310 (a L (b, k)) and 320 (a R (b, k)) in the next step, the direct signal 330 (S (b, k)) and the two ambient signals 510 (N L (b, k)) and 520 (N R (b, k)) can be determined.
- the time-frequency representation 115 (X L (b, k)) of the first audio signal 110 is uniquely determined by the first equation from the searched first surrounding signal 510, the also sought after direct signal 330 and the known first panning coefficients 310.
- the time-frequency representation 125 (X R (b, k)) of the second audio signal 120 uniquely emerges from the searched second surround signal 520, the wanted direct signal 330, and the known second panning coefficient 320 via a second equation.
- These two equations contain three unknown quantities. To get a definite solution, one of the unknowns is eliminated.
- both ambient signals 510 and 520 sound similar. It is therefore assumed that they are due to the same common surround signal 530 (N (b, k)) which was filtered with only two different decorrelation functions 540 (H L (k)) and 550 (H R (k)).
- the decorrelation functions 540 and 550 are not known, they can be represented by the prior art, for example, as filter functions with random frequency response. This approximation is sufficient to be able to resolve the two equations after the direct signal 330 and the common environment signal 530.
- the processing is based on a signal model which contains the first audio signal 110 (x L (n)) for the left-hand reproduction device 810 or the second audio signal 120 (x R (n)) contained in a stereo audio signal, recorded at discrete points in time n right playback device 820
- the left channel x L and the right channel x R also contain the respective non-directional, diffuse ambient signals n L (n) and n R (n).
- the panning coefficients a L, j and a R, j respectively indicate a direction-dependent weighting, with which the source-dependent source signals s j (n) enter into the first audio signal x L or into the second audio signal x R ,
- STFT short-time Fourier transform
- time-frequency representation was obtained by short-time Fourier transform (STFT)
- b is usually called the block index
- k the frequency index.
- the time-frequency representation was obtained directly from the time-dependent signals, for example with a Filter bank, b is usually referred to as a time index and k as a band index, since the discretization of the frequencies is determined by the respectively passed by the bandpass filters frequency bands.
- STFT short-time Fourier transform
- the signals x L , x R and S are generally complex valued, while the panning coefficients a L and a R are real valued, since in the signal model according to equations (7) and (8) a pure amplitude panning is performed, ie only the Amplitude is directional. It follows that both X L (b, k) and X R (b, k) are in phase with S (b, k).
- the panning coefficients a L and a R in this approximation are thus directly linked to the power density spectra (time-frequency representations) X L and X R of the first and second audio signals, which together give the stereo audio signal.
- the position coefficient ⁇ b k
- 2 be calculated.
- This position coefficient ⁇ (b, k) allows a very effective position calculation by simply considering the difference power spectrum and the overall power of the signal.
- P L (b, k) is the power of the left channel X L
- P R (b, k) is the power of the right channel X R
- P S is the power of the direct signal S.
- a power P X (b, k) corresponds to the power density spectrum
- the square of the instantaneous signal is therefore used as a measure of how much the instantaneous power P x (b, k) changes at the time b compared to the previous time b-1, ⁇ is a weighting factor, with which the adherence to the previous trend for the instantaneous power P x (b, k) is weighed against the consideration of new information. This is preferably to be chosen so small that a stable estimate of the average power takes place, without causing by transients or short-term signal changes to strong fluctuations.
- a further adaptation to the ear can take place here by replacing the powers P L (b, k) and P R (b, k) in each case by their roots in equation (15a).
- the position coefficient ⁇ (b, k) then gives an even more realistic impression of the position of the direct sound source.
- This self-consistent solution is characterized in particular by the fact that it allows a good extraction of heavily panned, ie highly direction-dependent, direct signals.
- N L, I and N R, I obtained in the last iteration I are not used as ambient signals N L and N R , but these are finally calculated from the total result ⁇ for the direct signal and the first approximate values â L , 1 and â R , 1 calculated for the panning coefficients:
- N ⁇ L X L - a ⁇ L .
- I ⁇ S ⁇ N ⁇ R X R - a ⁇ R .
- the panning coefficients refined during the iterative process according to equations (17) and (18) are used exclusively for the division of the signals X L and X R into direct signal ⁇ and ambient signals N L and N R.
- the panning coefficients obtained from the solution of the equation system (13-14) are furthermore used.
- Filtering can be expressed in a time-frequency representation as bandwise multiplication with a gain factor and a phase rotation.
- X R b k a R b k ⁇ S b k + H R b k ⁇ N b k associated with the direct signal S and the surrounding signal N.
- the general form of the decorrelation functions H L, R (b, k) can, if the time-frequency representations X L (b, k) and X R (b, k) were obtained from a complete transformation in the frequency domain, approximately Short-term Fourier transform (STFT), as a complex spectrum H L .
- R k ⁇ k ⁇ exp I ⁇ k . 0 ⁇ ⁇ k ⁇ 1 . 0 ⁇ ⁇ k ⁇ ⁇ with a frequency-dependent amplitude ⁇ (k) and phase ⁇ (k).
- N ⁇ b k a ⁇ L b k ⁇ X R b k - a ⁇ R b k ⁇ X L b k a ⁇ L b k ⁇ H R k - a ⁇ R b k ⁇ H L k for the estimated direct signal S and for the common environment signal N.
- x R b k a R b k ⁇ s b k + H R k ⁇ n b k ,
- ⁇ b k H R k ⁇ x L b k - H L k ⁇ x R b k H R k ⁇ a ⁇ L b k - H L k ⁇ a ⁇ R b k .
- n ⁇ b k a ⁇ L b k ⁇ x R b k - a ⁇ R b k ⁇ x L b k a ⁇ L b k ⁇ H R k - a ⁇ R b k ⁇ H L k as the solutions for the direct and environmental signals.
Landscapes
- Engineering & Computer Science (AREA)
- Physics & Mathematics (AREA)
- Acoustics & Sound (AREA)
- Signal Processing (AREA)
- Multimedia (AREA)
- Stereophonic System (AREA)
Description
- Die Erfindung betrifft ein Verfahren zur Analyse und Dekomposition eines Stereo-Audiosignals sowie ein Verfahren zum Erzeugen eines Mehrkanalaudiosignals.
- Mit der Aufzeichnung eines Stereoaudiosignals, wobei in der Regel ein erstes Audiosignal für eine linke Wiedergabeeinrichtung und ein zweites Audiosignal für eine rechte Wiedergabeeinrichtung verwendet wird, lässt sich der Eindruck erzeugen, dass Phantomschallquellen auf einen Hörbereich zwischen dem Hörer und den beiden Wiedergabeeinrichtungen verteilt sind.
- Dabei liefert der Pegelunterschied zwischen dem ersten und dem zweiten Audiosignal primär die Information, aus welcher azimutalen Richtung relativ zum Hörer der Schall zu kommen scheint. Diese Information ist lediglich eindimensional und kann daher naturgemäß keine realistische Reproduktion von Räumlichkeit herstellen. Zudem ist der Azimutwinkel der möglichen Positionierung von Phantomschallquellen auf den Bereich beschränkt, der durch eine erste Verbindungsstrecke zwischen dem Hörer und der linken Wiedergabeeinrichtung und durch eine zweite Verbindungsstrecke zwischen dem Hörer und der rechten Wiedergabeeinrichtung aufgespannt wird. Des Weiteren ist es nur mit zwei Wiedergabeeinrichtungen nicht möglich Räumlichkeit zu simulieren, da hierfür der Schall aus allen Raumrichtungen abgestrahlt und auf den Hörer treffen müsste.
- Mehrkanalaudiosysteme mit beispielsweise fünf oder sieben Wiedergabeeinrichtungen vermitteln dem Hörer daher einen deutlich detaillierteren räumlichen Eindruck. Dieser Zusatznutzen liegt jedoch im Wesentlichen brach, wenn die Aufnahme nur als Stereoaudiosignal zur Verfügung steht.
- Aus der
DE 10 2012 017 296 B4 ist ein Verfahren zum Erzeugen eines Mehrkanalaudiosignals aus einem Stereoaudiosignal bekannt. Damit lassen sich gerichtete Direktschallanteile und diffuse Umgebungsschallanteile in einem Stereoaudiosignal trennen sowie die Richtungsinformation der Direktschallanteile bestimmen, um anschließend alle Signalbestandteile auf einer Mehrkanalwiedergabeeinrichtung abzuspielen. Allerdings ist dieses Verfahren sehr rechenaufwändig. - Die
WO 2010/028 784 A1 offenbart ein weiteres Verfahren zur Zerlegung eines Stereoaudiosignals in einen diffusen Umgebungsschallanteil einerseits und in gerichtete Direktschallanteile andererseits, wobei auch die Richtungen geschätzt werden, aus denen die Direktschallanteile zu kommen scheinen. - Aufgabe der vorliegenden Erfindung ist daher, bei gleichbleibender oder besserer Klangqualität die in einem Stereoaudiosignal enthaltene räumliche Information über die Anordnung der Schallquellen mit einem geringeren Rechenaufwand zu rekonstruieren.
- Diese Aufgabe wird erfindungsgemäß gelöst durch Verfahren zur Analyse gemäß Haupt- und Nebenanspruch sowie durch ein Verfahren zum Erzeugen eines Mehrkanalaudiosignals gemäß weiterem Nebenanspruch. Weitere vorteilhafte Ausgestaltungen ergeben sich aus den daraus rückbezogenen Unteransprüchen.
- Im Rahmen der Erfindung wurde ein Verfahren zur Analyse und Dekomposition eines Stereoaudiosignals entwickelt. Dieses Stereoaudiosignal weist ein erstes Audiosignal für eine linke Wiedergabeeinrichtung und ein zweites Audiosignal für eine rechte Wiedergabeeinrichtung auf.
- Erfindungsgemäß sieht das Verfahren folgende Schritte vor:
Zunächst wird das erste Audiosignal in eine erste Zeit-Frequenz-Darstellung überführt. Das zweite Audiosignal wird in eine zweite Zeit-Frequenz-Darstellung überführt. Die Überführung der Audiosignale in die Zeit-Frequenz-Darstellung kann mit beliebigen Verfahren erfolgen. Bevorzugt wird die Kurzzeit-Fourier-Transformation (STFT) verwendet. - Nun wird eine erste Gleichung aufgestellt, die die erste Zeit-Frequenz-Darstellung in Beziehung setzt zum Produkt eines ersten zeit- und frequenzabhängigen Panning-Koeffizienten mit dem zeit- und frequenzabhängigen Signal einer in einem Hörbereich zwischen der linken Wiedergabeeinrichtung und der rechten Wiedergabeeinrichtung angeordneten Direktschallquelle. Es wird eine zweite Gleichung aufgestellt, die die zweite Zeit-Frequenz-Darstellung in Beziehung setzt zum Produkt eines zweiten zeit- und frequenzabhängigen Panning-Koeffizienten mit dem gleichen Signal der gleichen Direktschallquelle. Dabei sind die Panning-Koeffizienten dazu ausgebildet, die Direktschallquelle in dem Hörbereich zu positionieren.
- Es werden nun die Panning-Koeffizienten und/oder ein Positionskoeffizient, der der Differenz der Quadrate der Panning-Koeffizienten entspricht, als Lösungen des aus beiden Gleichungen gebildeten Gleichungssystems ermittelt. Zu dem Stereoaudiosignal hat in der Regel eine Vielzahl unabhängiger Schallquellen beigetragen. Derjenige Anteil des ersten und des zweiten Audiosignals, der dem Richtungshören zugänglich ist, setzt sich also aus Beiträgen dieser einzelnen Schallquellen zusammen. Jeder dieser einzelnen Beiträge ist das Produkt einer zeit- und frequenzabhängigen komplexen Amplitude und eines Panning-Koeffizienten, der von der Positionierung der Schallquelle relativ zum Hörer abhängt. Das linke und das rechte Audiosignal sind, wenn man jeweils von Umgebungssignalen absieht, jeweils Summen über solche Einzelbeiträge. Da die Umgebungssignale diffus, über alle Raumrichtungen gleichverteilt und außerdem klein gegenüber dem Direktsignal sind, können sie in dem Gleichungssystem für die Ermittlung der Panning-Koeffizienten unberücksichtigt bleiben. Das Gleichungssystem wird dadurch deutlich einfacher lösbar.
- Bei der Aufstellung des Gleichungssystems wird die vereinfachende Annahme gemacht, dass alle gleichzeitig aktiven Schallquellen zu einer einzigen Schallquelle mit zeit- und frequenzabhängiger komplexer Amplitude zusammengefasst werden können. Dies ist möglich, da bei einer ausreichend großen Zeit-Frequenz-Auflösung der Zeit-Frequenz-Darstellung davon auszugehen ist, dass zu einem bestimmten Zeitpunkt und in einem bestimmten Frequenzband nur eine einzige dominante Schallquelle existiert.
- Dabei ist die komplexe Amplitude dieser zusammengefassten Schallquelle richtungsunabhängig. Die Richtungsabhängigkeit steckt allein in den Panning-Koeffizienten. Durch die Zusammenfassung der einzelnen Schallquellen lassen sich nun der erste und der zweite Panning-Koeffizient jeder Schallquelle zu einem Paar zeit- und frequenzabhängiger Panning-Koeffizienten für die zusammengefasste Schallquelle vereinen.
- Unter der Annahme, dass der erste und der zweite Panning-Koeffizient miteinander verknüpft sind, lässt sich das Gleichungssystem mathematisch umformen, und die Panning-Koeffizienten lassen sich aus dem ersten und zweiten Kanal des Stereosignals ermitteln. Die Verknüpfung zwischen den beiden Panning-Koeffizienten ermöglicht es, das Gleichungssystem durch einfaches mathematisches Umformen zu lösen und für die Panning-Koeffizienten eine geschlossene Formel in den Zeit-Frequenz-Darstellungen des linken und des rechten Audiosignals anzugeben. Im laufenden Betrieb des Verfahrens sind Lösungen des Gleichungssystems also besonders schnell durch Einsetzen der Zeit-Frequenz-Darstellungen in die geschlossene Formel erhältlich.
- Das Gleichungssystem wird unter der zusätzlichen Bedingung gelöst, dass die Summe der Quadrate der Panning-Koeffizienten konstant ist. Die Summe dieser Quadrate ist bei dem in der Musikproduktion üblicherweise verwendeten Constant-Power-Panning gleich 1. Diese führt dazu, dass die Schallquelle unabhängig von ihrer Position im Hörbereich gleich laut wahrgenommen wird.
- Die Panning-Koeffizienten enthalten die vollständige Information, auf welcher Frequenz das Signal zu welcher Zeit von welchem Ort im Hörbereich zu kommen scheint.
- Da sich die einzelnen Schallquellen inkohärent überlagern und die Aufnahme des Stereoaudiosignals ebenfalls inkohärent erfolgt, ändert eine unterschiedliche Positionierung der Schallquellen im Hörbereich nur die Amplitude des aufgenommenen Stereoaudiosignals, nicht jedoch dessen Phase. Daher sind auch die Zeit-Frequenz-Darstellungen des ersten und zweiten Audiosignals in Phase mit der zeit- und frequenzabhängigen komplexen Amplitude der Direktschallquelle. Damit kürzen sich die Phasenterme aus dem beschriebenen Gleichungssystem und nach umstellen ergibt sich der erste Panning-Koeffizient als Wurzel aus dem Verhältnis des Betragsquadrats der Zeit-Frequenz-Darstellung des ersten Audiosignals (Zähler) und der Summe der Betragsquadrate der Zeit-Frequenz-Darstellung des ersten und zweiten Audiosignals (Nenner). Analog ergibt sich der zweite Panning-Koeffizient als Wurzel aus dem Verhältnis des Betragsquadrats der Zeit-Frequenz-Darstellung des zweiten Audiosignals (Zähler) und der Summe der Betragsquadrate der Zeit-Frequenz-Darstellung des ersten und zweiten Audiosignals (Nenner).
- Der Positionskoeffizient wird aus dem Verhältnis der Differenz der Betragsquadrate beider Zeit-Frequenz-Darstellungen zur Summe der Betragsquadrate beider Zeit-Frequenz-Darstellungen ermittelt.
- Eine alternative Ausgestaltung der Erfindung startet ebenfalls von einem ersten Audiosignal für eine linke Wiedergabeeinrichtung und einem zweiten Audiosignal für eine rechte Wiedergabeeinrichtung. Das erste Audiosignal wird in eine erste Zeit-Frequenz-Darstellung überführt, und das zweite Audiosignal wird in eine zweite Zeit-frequenz-Darstellung überführt.
- In dieser Ausgestaltung wird aus der ersten Zeit-Frequenz-Darstellung die zeit- und frequenzabhängige Leistung des ersten Audiosignals ermittelt, und aus der zweiten Zeit-Frequenz-Darstellung wird die zeit- und frequenzabhängige Leistung des zweiten Audiosignals ermittelt. Dementsprechend werden auch die Gleichungen für die Panning-Koeffizienten abgeändert.
- Es wird eine erste Gleichung aufgestellt, die die zeit- und frequenzabhängige Leistung des ersten Audiosignals in Beziehung setzt zum Produkt des Quadrats eines ersten zeit- und frequenzabhängigen Panning-Koeffizienten mit der zeit- und frequenzabhängigen Leistung einer in einem Hörbereich zwischen der linken Wiedergabeeinrichtung und der rechten Wiedergabeeinrichtung angeordneten Direktschallquelle.
- Es wird eine zweite Gleichung aufgestellt, die die zeit- und frequenzabhängige Leistung des zweiten Audiosignals in Beziehung setzt zum Produkt des Quadrats eines zweiten zeit- und frequenzabhängigen Panning-Koeffizienten mit der gleichen zeit- und frequenzabhängigen Leistung der gleichen Direktschallquelle.
- Analog zu dem oben beschriebenen ersten Ansatz für das Gleichungssystem, in dem die Gleichungen die Zeit-Frequenz-Darstellungen mit dem Signal der Direktschallquelle verknüpfen, sind die Panning-Koeffizienten dazu ausgebildet, die Direktschallquelle in dem Hörbereich zu positionieren. Die Panning-Koeffizienten, und/oder ein Positionskoeffizient, der dem Verhältnis einer Differenz der Panning-Koeffizienten zur Summe der Panning-Koeffizienten entspricht, werden als Lösungen des aus beiden Gleichungen gebildeten Gleichungssystems ermittelt.
- Die Aufstellung des Gleichungssystems in Leistungen, statt direkt in Zeit-Frequenz-Darstellungen und Signal der Direktschallquelle, ist dadurch motiviert, dass das Panning ein reines Amplitudenpanning ist. Folglich sind beide Audiosignale in Phase mit dem Signal der Direktschallquelle. Wenn die Zeit-Frequenz-Darstellungen beispielsweise mit einer Kurzzeit-Fourier-Transformation (STFT) gewonnen wurden, lässt sich eine Leistung unmittelbar als Betragsquadrat des zugehörigen Leistungsdichtespektrums ausdrücken. Der Ansatz über die Leistungen ist dann äquivalent zum Ansatz über die Zeit-Frequenz-Darstellungen und das Signal der Direktschallquelle.
- Der Ansatz über die Leistungen bietet jedoch den zusätzlichen Vorteil, dass er allgemeiner ist. Er ist auch dann anwendbar, wenn keine 1:1-Transformation der zeitabhängigen Audiosignale in einen Frequenzbereich vorliegt, sondern lediglich eine Aufspaltung dieser Audiosignale in mehrere zeitabhängige Signale, die zu den Beiträgen bestimmter Frequenzbänder korrespondieren. Eine solche Aufspaltung kann beispielsweise mit einer Filterbank hergestellt werden. Eine Filterbank enthält typischerweise mehrere parallel geschaltete Bandpassfilter, die jeweils den Anteil des Signals, der in einen bestimmtes Frequenzband fällt, passieren lassen. Das Signal am Ausgang eines jeden dieser Bandpassfilter ist ein zeitabhängiges Signal. Die Gesamtheit aller dieser Signale bildet zusammen mit der Information, zu welchem Frequenzband ein jedes Signal korrespondiert, eine Zeit-Frequenz-Darstellung.
- Eine derartige Zeit-Frequenz-Darstellung kann auf diese Weise zum Einen schneller und einfacher erhalten werden als mit der Kurzzeit-Fourier-Transformation (STFT). Beispielsweise können Bandpassfilter niedriger Ordnung und mit geringer Gruppenlaufzeit verwendet werden. Zum Anderen erleichtert eine derartige Zeit-Frequenz-Darstellung auch die frequenzabhängige Bearbeitung des Signals. Beispielsweise lässt sich die Frequenzauflösung variieren, indem ein weniger interessierender Frequenzbereich mit einem breiten Bandpassfilter abgedeckt wird, während ein besonders interessierender Frequenzbereich mit vielen schmalen Bandpassfiltern abgedeckt wird. Demgegenüber ist bei der Kurzzeit-Fourier-Transformation die Frequenzauflösung immer ein äquidistantes Raster.
- Es ist nicht erforderlich, dass eine geschlossene Formel für die Berechnung der jeweiligen zeit- und frequenzabhängigen Leistung aus den Zeit-Frequenz-Darstellungen der beiden Audiosignale existiert. Es ist beispielsweise auch möglich, diese Leistung auf numerischem Wege näherungsweise zu ermitteln. Beispielsweise kann die zeit- und frequenzabhängige Leistung mindestens eines Audiosignals zu einem interessierenden Zeitpunkt als gewichtete Summe aus der zeit- und frequenzabhängigen Leistung des Audiosignals zu einem früheren Zeitpunkt und dem Quadrat der Zeit-Frequenz-Darstellung dieses Audiosignals zu dem interessierenden Zeitpunkt ermittelt werden. Ist die Zeit in der Zeit-Frequenz-Darstellung beispielsweise diskretisiert, so kann der frühere Zeitpunkt insbesondere eine diskrete Zeiteinheit vor dem interessierenden Zeitpunkt liegen. Die momentane Leistung eines Audiosignals kann also beispielsweise über eine rekursive Mittelung aus der Zeit-Frequenz-Darstellung ermittelt werden.
- Das Gleichungssystem wird unter der zusätzlichen Bedingung gelöst, dass die Summe der Quadrate der Panning-Koeffizienten konstant ist, wobei der Positionskoeffizient aus dem Verhältnis der Differenz der Wurzeln der zeit- und frequenzabhängigen Leistungen beider Audiosignale zur Summe der Wurzeln der zeit- und frequenzabhängigen Leistungen beider Audiosignale ermittelt wird.
- Das Auflösen des Gleichungssystems zu den Panning-Koeffizienten erfolgt in völlig analoger Weise zum Ansatz über die Zeit-Frequenz-Darstellungen und das Signal der Direktschallquelle. Die Panning-Koeffizienten und ggfs. der Positions-Koeffizient sind lediglich durch andere Größen ausgedrückt.
- Vorteilhaft wird daher der erste Panning-Koeffizient als Wurzel aus dem Verhältnis der zeit- und frequenzabhängigen Leistung des ersten Audiosignals zur Summe der zeit- und frequenzabhängigen Leistungen beider Audiosignale ermittelt. Der zweite Panning-Koeffizient wird dementsprechend als Wurzel aus dem Verhältnis der zeit- und frequenzabhängigen Leistung des zweiten Audiosignals zur Summe der zeit- und frequenzabhängigen Leistungen beider Audiosignale ermittelt.
- Vorteilhaft wird die zeit- und frequenzabhängige Leistung mindestens eines Audiosignals zu einem interessierenden Zeitpunkt als gewichtete Summe aus der zeit- und frequenzabhängigen Leistung des Audiosignals zu einem früheren Zeitpunkt und dem Quadrat der Zeit-Frequenz-Darstellung dieses Audiosignals zu dem interessierenden Zeitpunkt ermittelt.
- Im Allgemeinen wird das Stereoaudiosignal nicht nur einen richtungsabhängigen Direktsignalanteil enthalten. Stattdessen werden das erste und das zweite Audiosignal jeweils mit einem diffusen Umgebungssignal überlagert sein. Daher werden in einer weiteren besonders vorteilhaften Ausgestaltung der Erfindung aus den Panning-Koeffizienten das Signal der Direktschallquelle (Direktsignal) und/oder zwei nicht richtungsabhängige, d.h. nicht mit der Direktschallquelle korrelierte, Umgebungssignale ermittelt. Dabei ist das erste Umgebungssignal nur in der Zeit-Frequenz-Darstellung des ersten Audiosignals enthalten, und das zweite Umgebungssignal ist nur in der Zeit-Frequenz-Darstellung des zweiten Audiosignals enthalten. Das Hörerlebnis wird genauer reproduziert, wenn nur das Direktsignal mit Hilfe der Panning-Koeffizienten in gerichteter Form wiedergegeben wird. Das diffuse Umgebungssignal sollte auch diffus wiedergegeben werden.
- Vorteilhaft werden das Direktsignal und die Umgebungssignale mit einem iterativen Verfahren bestimmt ausgehend von einer Iterationsvorschrift, die das Direktsignal einer jeder Iteration, und/oder einen Beitrag zu diesem Signal, in Beziehung setzt zu den Umgebungssignalen der vorherigen Iteration. Beispielsweise kann in jeder Iteration die Lautstärke eines Beitrags zum Direktsignal als arithmetisches Mittel der Lautstärken beider Umgebungssignale der vorherigen Iteration festgelegt werden. Dies geht von der Annahme aus, dass das Direktsignal im ersten und zweiten Audiosignal mit gleicher Phase vorliegt und die Umgebungssignale dazu Phasenverschoben sind.
- Die Näherung kann verfeinert werden, indem bei jeder Iteration die Panning-Koeffizienten aus den Umgebungssignalen der vorherigen Iterationen neu berechnet werden. Hierfür können beispielsweise die Umgebungssignale der vorherigen Iteration als Zeit-Frequenz-Darstellungen eines linken und eines rechten Audiosignals gewertet werden, so dass die Panning-Koeffizienten wie zuvor beschrieben durch Lösen eines Gleichungssystems berechnet werden können.
- Vorteilhaft wird dann das erste Umgebungssignal bei jeder Iteration um einen Betrag korrigiert, der das Produkt aus dem neu berechneten ersten Panning-Koeffizienten mit dem Direktsignal, oder mit dem Signalbeitrag, gemäß der aktuellen Iteration ist. Analog wird das zweite Umgebungssignal bei jeder Iteration um einen Betrag korrigiert, der das Produkt aus dem neu berechneten zweiten Panning-Koeffizienten mit dem Direktsignal, oder mit dem Signalbeitrag, gemäß der aktuellen Iteration ist. Der Hintergedanke ist hierbei, dass die Lösung selbstkonsistent sein soll: Ein Signal, das sich im Nachhinein als mit dem Signal der Direktschallquelle korreliert und somit als Teil des Direktsignals erweist, kann offensichtlich nicht zum diffusen Umgebungssignal zählen.
- Nach Durchlauf aller Iterationen ergibt sich das gesamte Direktsignal als Summe der in allen einzelnen Iterationen ermittelten Signalbeiträge. Da sowohl die iterativ berechneten Panning-Koeffizienten als auch das iterativ bestimmte Direktsignal nur jeweils Schätzungen sind, ist nicht garantiert, dass die Summe aus dem mit dem ersten Panning-Koeffizienten gewichteten Direktsignal und dem ersten Umgebungssignal genau den Wert der Zeit-Frequenz-Darstellung des ersten Audiosignals entspricht. Analog kann nicht garantiert werden, dass die Summe aus dem mit dem zweiten Panning-Koeffizienten gewichteten Direktsignal und dem zweiten Umgebungssignal genau den Wert der Zeit-Frequenz-Darstellung des zweiten Audiosignals reproduziert. Das Direktsignal und die Umgebungssignale gehorchen zusammen also nicht notwendigerweise dem Signalmodell, das der Aufteilung der Zeit-Frequenz-Darstellungen des ersten und des zweiten Audiosignals in jeweils einen gerichteten und einen diffusen Anteil zu Grunde lag. Daher ist es vorteilhaft, nicht unmittelbar die in der letzten Iteration ermittelten Umgebungssignale weiterzuverwenden, sondern das erste Umgebungssignal als Differenz aus der ersten Zeit-Frequenz-Darstellung und dem mit dem ersten Panning-Koeffizienten gemäß der ersten Iteration gewichteten Direktsignal zu ermitteln. Analog sollte das zweite Umgebungssignal als Differenz zwischen der zweiten Zeit-Frequenz-Darstellung und dem mit dem zweiten Panning-Koeffizienten gemäß der ersten Iteration gewichteten Direktsignal ermittelt werden.
- Ein weiterer vorteilhafter Ansatz für die Ermittlung der nicht mit der Direktschallquelle korrelierten Umgebungssignale geht von der Annahme aus, dass beide Umgebungssignale zwar ähnlich klingen, aber durch unterschiedliche Ausbreitungswege und Reflexionen dekorreliert sind.
- Es wird eine erste Gleichung aufgestellt, die die erste Zeit-Frequenz-Darstellung in Beziehung setzt zur Summe aus dem Produkt des ersten Panning-Koeffizienten mit dem zeit- und frequenzabhängigen Signal der Direktschallquelle sowie aus der Filterung eines einzigen gemeinsamen Umgebungssignals mit einer ersten Dekorrelationsfunktion.
- Es wird eine zweite Gleichung aufgestellt, die die zweite Zeit-Frequenz-Darstellung in Beziehung setzt zur Summe aus dem Produkt des zweiten Panning-Koeffizienten mit dem zeit- und frequenzabhängigen Signal der Direktschallquelle sowie aus der Filterung des gemeinsamen Umgebungssignals mit einer zweiten Dekorrelationsfunktion.
- Dabei kann die Filterung eines Signals mit einer Dekorrelationsfunktion beispielsweise durch eine Faltung des Signals mit der Dekorrelationsfunktion realisiert sein.
- Das zeit- und frequenzabhängige Signal der Direktschallquelle, und/oder das gemeinsame Umgebungssignal, werden als Lösungen des aus den beiden Gleichungen gebildeten Gleichungssystems ermittelt.
- Die Dekorrelationsfunktionen können mit verschiedenen nach Stand der Technik bekannten Verfahren initialisiert werden, um realistisch klingende dekorrelierte Signale zu erhalten. Typischerweise werden dazu die Funktionen so erzeugt, dass sich zufällige Frequenzgänge ergeben.
- In einer Zeit-Frequenz-Darstellung lässt sich eine Filterung, und hier insbesondere eine Faltung, näherungsweise als frequenzbandweise Multiplikation mit der Dekorrelationsfunktion ausdrücken. Hierin kann die Dekorrelationsfunktion beispielsweise pro Frequenzband durch einen Verstärkungsfaktor und eine Phasendrehung repräsentiert werden.
- Vorteilhaft wird somit das zeit- und frequenzabhängige Signal der Direktschallquelle als Differenz zwischen dem frequenzbandweisen Produkt der ersten Zeit-Frequenz-Darstellung mit der zweiten Dekorrelationsfunktion und dem frequenzbandweisen Produkt der zweiten Zeit-Frequenz-Darstellung mit der ersten Dekorrelationsfunktion, dividiert durch die Differenz zwischen dem frequenzbandweisen Produkt des ersten Panning-Koeffizienten mit der zweiten Dekorrelationsfunktion und dem frequenzbandweisen Produkt des zweiten Panning-Koeffizienten mit der ersten Dekorrelationsfunktion, ermittelt.
- Vorteilhaft wird somit das gemeinsame Umgebungssignal als Differenz zwischen dem Produkt der zweiten Zeit-Frequenz-Darstellung mit dem ersten Panning-Koeffizienten und dem Produkt der ersten Zeit-Frequenz-Darstellung mit dem zweiten Panning-Koeffizienten, dividiert durch die Differenz zwischen dem frequenzbandweisen Produkt des ersten Panning-Koeffizienten mit der zweiten Dekorrelationsfunktion und dem frequenzbandweisen Produkt des zweiten Panning-Koeffizienten mit der ersten Dekorrelationsfunktion, ermittelt.
- Im Rahmen der Erfindung wurde auch ein Verfahren zum Erzeugen eines Mehrkanalaudiosignals aus einem Stereoaudiosignal entwickelt. Dabei weist das Stereoaudiosignal ein erstes Audiosignal für eine linke Wiedergabeeinrichtung und ein zweites Audiosignal für eine rechte Wiedergabeeinrichtung auf.
- Erfindungsgemäß wird das Stereoaudiosignal zunächst mit einem Verfahren gemäß der Erfindung analysiert. Anschließend wird aus den Panning-Koeffizienten eine Mehrzahl von Repanning-Koeffizienten ermittelt, wobei jeder dieser Repanning-Koeffizienten einen Tonkanal einer Mehrzahl von Tonkanälen des Mehrkanalaudiosignals zugeordnet wird. Dabei sind die Repanning-Koeffizienten für die Mehrzahl von Tonkanälen ausgeführt, eine Direktschallquelle in einem Hörbereich zwischen einer Mehrzahl von Wiedergabeeinrichtungen für das Mehrkanalaudiosignal zu positionieren. Das Signal der Direktschallquelle (Direktsignal) wird nun mit einem ersten Repanning-Koeffizienten verrechnet und einem ersten Tonkanal zugeordnet. Es wird mit einem zweiten Repanning-Koeffizienten verrechnet und einem zweiten Tonkanal zugeordnet. Es wird schließlich auch mit einem dritten Repanning-Koeffizienten verrechnet und einem dritten Tonkanal zugeordnet. Diese Signale dieser drei Tonkanäle können entweder direkt wiedergegeben oder für eine spätere Wiedergabe bzw. Weiterverarbeitung gespeichert werden.
- Vorteilhaft wird das erste Umgebungssignal dem ersten Tonkanal additiv hinzugefügt, und das zweite Umgebungssignal wird dem dritten Tonkanal additiv hinzugefügt.
- In einer weiteren vorteilhaften Ausgestaltung der Erfindung wird jeder Tonkanal in jeweils ein Wiedergabesignal des Mehrkanalaudiosignals überführt, wobei jedes Wiedergabesignal für jeweils eine Wiedergabeeinrichtung vorgesehen ist.
- Die Ermittlung der Repanning-Koeffizienten stellt eine Umverteilung des richtungsabhängigen Direktsignals auf eine beliebige Lautsprecheranordnung dar. Das Umgebungssignal wird anschließend auf eine Auswahl von Lautsprechern additiv überlagert. Für das Repanning kann ein beliebiges Verfahren gemäß Stand der Technik verwendet werden, beispielsweise das Verfahren gemäß
DE 10 2012 017 296 B4 oder auch das "vector base amplitude panning" gemäß (Ville Pulkki, "Virtual sound source positioning using vector based amplitude panning", Journal of the Audio Engineering Society, Vol. 45, Issue 6, pp. 456-466, June 1997). - In einer weiteren vorteilhaften Ausgestaltung der Erfindung lassen sich die extrahierten Direkt- und Umgebungsschallsignale nicht nur für die unmittelbare Wiedergabe des Stereo-Audiosignals als aufgewertetes Mehrkanalaudiosignal nutzen. Sie können beispielsweise für eine spätere Wiedergabe abgespeichert und/oder vor der Wiedergabe manipuliert werden, um das Hörerlebnis mit weiteren Effekten aufzuwerten.
- Es wurde erkannt, dass bei der oben beschriebenen iterativen Berechnung des Direktsignals und der Umgebungssignale für eine gegen Unendlich strebende Iterationszahl beide Umgebungssignale gegen betragsmäßig gleiche Werte mit unterschiedlichen Vorzeichen streben. Sie sind also bis auf einen Phasenfaktor identisch. Mit dieser zusätzlichen Vereinfachung können das Direktsignal und die Umgebungssignale im laufenden Betrieb mit besonders wenig Rechenaufwand unmittelbar erhalten werden.
- In einer weiteren besonders vorteilhaften Ausgestaltung der Erfindung wird somit das Signal der Direktschallquelle (Direktsignal) aus dem Verhältnis der Summe beider Zeit-Frequenz-Darstellungen der Audiosignale (Zähler) zur Summe beider Panning-Koeffizienten (Nenner) ermittelt wird. Weiterhin können auch die Umgebungssignale aus dem Verhältnis einer Differenz zwischen der Zeit-Frequenz-Darstellung des ersten Audiosignals, gewichtet mit dem zweiten Panning-Koeffizienten, und der Zeit-Frequenz-Darstellung des zweiten Audiosignals, gewichtet mit dem ersten Panning-Koeffizienten (Zähler), zur Summe beider Panning-Koeffizienten (Nenner) ermittelt werden.
- Nachfolgend wird der Gegenstand der Erfindung anhand von Figuren erläutert, ohne dass der Gegenstand der Erfindung hierdurch beschränkt wird. Es ist gezeigt:
- Figur 1
- Skizzenhafte Darstellung der vereinfachenden Annahme für die Ermittlung der Panning-Koeffizienten
- Figur 2
- Linearisierung der Azimut-Position durch Einführung des Positions-Koeffizienten Ψ
- Figur 3
- Repanning zwecks Wiedergabe als Mehrkanalaudiosignal
- Figur 4
- Zugang zu den Panning-Koeffizienten über Gleichungen in Leistungen
- Figur 5
- Bestimmung der Umgebungssignale und des Direktsignals aus den Panning-Koeffizienten über ein weiteres Gleichungssystem
-
Figur 1 verdeutlicht skizzenhaft die Annahme, deren Einführung die Bestimmung der Panning-Koeffizienten 310 (aL(b,k)) und 320 (aR(b,k)) deutlich vereinfacht. In Zeit-Frequenz-Darstellung wird die Zeit im Folgenden grundsätzlich als Blocknummer b des bei der Kurzzeit-Fourier-Transformation (STFT) erhaltenen Blocks angegeben. Das Frequenzband bzw. der Frequenzindex wird mit k indiziert. - Das Stereoaudiosignal umfasst ein erstes Audiosignal 110 für eine linke Wiedergabeeinrichtung 810 und ein zweites Audiosignal 120 für eine rechte Wiedergabeeinrichtung 820. Durch Kurzzeit-Fourier-Transformation (STFT) wird das erste Audiosignal 110 in seine Zeit-Frequenz-Darstellung 115 (XL(b,k)) überführt. Ebenso wird das zweite Audiosignal 120 in seine Zeit-Frequenz-Darstellung 125 (XR(b,k)) überführt.
- Der Hörer ist an der Position 1 am Rand des Hörbereichs 890 angeordnet. Das durch den Hörer 1, die linke Wiedergabeeinrichtung 810 und die rechte Wiedergabeeinrichtung 820 definierte gleichseitige Dreieck trägt das Bezugszeichen 891 und ist in den kreisförmigen Hörbereich 890 einbeschrieben. Für die Ermittlung der Panning-Koeffizienten 310 und 320 wird nun gemäß der Erfindung angenommen, dass sich eine einzige Direktschallquelle 813, deren Lautstärke 330 in Abhängigkeit der Zeit b und der Frequenz k variiert, entlang des durchgezogenen Kreisbogens 892 am Rand des Hörbereichs 890 im Bereich zwischen der linken Wiedergabeeinrichtung 810 und der rechten Wiedergabeeinrichtung 820 bewegt. Diese Bewegung ist ebenfalls von der Zeit b und von der Frequenz k abhängig. Die aktuelle azimutale Position ϕ(b,k) der Direktschallquelle 813 auf dem Kreisbogen bestimmt die Panning-Koeffizienten 310 und 320. Die komplexe Amplitude 330 der Direktschallquelle 813 ergibt, wenn man sie multiplikativ mit den ersten Panning-Koeffizienten 310 gewichtet, die Zeit-Frequenz-Darstellung 115 des ersten Audiosignals 110. Wird die Signalstärke 330 dagegen mit dem zweiten Panning-Koeffizienten 320 multiplikativ gewichtet, erhält man die Zeit-Frequenz-Darstellung 125 des zweiten Audiosignals 120.
-
Figur 2 verdeutlicht den Zusammenhang zwischen dem ersten und zweiten Panning-Koeffizienten 310 und 320 einerseits und dem Positionskoeffizienten 390 (Ψ) andererseits. Aufgetragen ist jeweils der Wert dieser Koeffizienten über der Azimutposition ϕ von links L über Mitte M nach rechts R. Die Panning-Koeffizienten 310 und 320 verlaufen in Abhängigkeit der Azimut-Position ϕ nicht linear. Der Positionskoeffizient 390 hat demgegenüber den Vorteil, dass er von links L über Mitte M nach rechts R durchgehend linear verläuft. -
Figur 3 verdeutlicht das Repanning zwecks Wiedergabe des Stereoaudiosignals als Mehrkanalaudiosignal. Das Signal 330 der Direktschallquelle wird mit Repanning-Koeffizienten 410 (g1), 420 (g2) und 430 (g3) gewichtet auf Tonkanäle 580, 585 und 590 übertragen, die auf den drei Lautsprechern L, C und R wiedergegeben werden. In die Ermittlung der Repanning-Koeffizienten 410, 420 und 430 gehen die bei der Analyse des Stereosignals ermittelten Panning-Koeffizienten 310 und 320 ein. Die bei der Analyse weiterhin ermittelten Umgebungssignale 510 und 520 werden zum Einen den Tonkanälen 580 und 590 additiv überlagert. Zum Anderen werden sie auf zusätzlichen Lautsprechern RL und RR wiedergegeben. Alle Lautsprecher L, C, R, RL und RR sind auf einem Kreis K angeordnet, der gleichzeitig den Hörbereich 890 um den Hörer 1 definiert. Die Winkelpositionen der Lautsprecher L, C und R liegen jeweils um 30 Grad auseinander. Die Winkelpositionen der Lautsprecher RL und C bzw. RR und C liegen jeweils um 115 Grad auseinander. -
Figur 4 verdeutlicht skizzenhaft den alternativen Zugang zu den Panning-Koeffizienten 310 und 320 über Gleichungen in Leistungen. Die beiden Audiosignale 110 und 120 werden in diesem Beispiel jeweils mit einer Filterbank 150 im Zeitbereich zerlegt. Die inFigur 4 beispielhaft gezeichnete Filterbank 150 enthält vier Bandpassfilter, die mit Bandindizes k=1, k=2, k=3 und k=4 gekennzeichnet sind. Der Filter mit Bandindex k=1 lässt nur Frequenzen ω mit 0<ω≤ω1 passieren. Der Filter mit Bandindex k=2 lässt nur Frequenzen ω mit ω1<ω≤ω2 passieren. Der Filter mit Bandindex k=3 lässt nur Frequenzen ω mit ω2<ω≤ω3 passieren. Schließlich lässt der Filter mit Bandindex k=4 nur Frequenzen ω mit ω3<ω≤ω4 passieren. - Das Ausgangssignal eines jeden Filters ist nach wie vor ein zeitabhängiges Signal. In der Information, aus welchem Filter das Signal kommt, also zu welchem Bandindex k es gehört, steckt die Frequenzinformation. Alle Ausgangssignale xL,R(b,k=1-4) bilden somit zusammen eine Zeit-Frequenz-Darstellung 115 bzw. 125 der Audiosignale 110 bzw. 120. Aus den Ausgangssignalen xL,R(b,k=1-4) wird im Schritt 145 jeweils über eine rekursive Mittelung die zugehörige momentane Leistung PL,R(b,k=1-4) ermittelt. Diese Funktionen bilden gemeinsam die mit dem Bezugszeichen 115a bzw. 125a bezeichnete zeit- und frequenzabhängige Leistung PL,R(b,k) des linken Audiosignals 110 bzw. des rechten Audiosignals 120. Diese Leistung steht auf der linken Seite der Gleichung.
- Auf der rechten Seite der Gleichung steht das Produkt aus dem Quadrat des mit dem Bezugszeichen 310 bzw. 320 bezeichneten Panning-Koeffizienten aL,R(b,k) mit der Leistung Ps(b,k) (Bezugszeichen 330a) des gesuchten Direktsignals s(b,k) (Bezugszeichen 330).
-
Figur 5 ist anFigur 1 angelehnt und verdeutlicht skizzenhaft, wie aus den Panning-Koeffizienten 310 (aL(b,k)) und 320 (aR(b,k)) im nächsten Schritt das Direktsignal 330 (S(b,k)) sowie die beiden Umgebungssignale 510 (NL(b,k)) und 520 (NR(b,k)) ermittelt werden können. Die Zeit-Frequenz-Darstellung 115 (XL(b,k)) des ersten Audiosignals 110 geht über eine erste Gleichung eindeutig aus dem gesuchten ersten Umgebungssignal 510, dem ebenfalls gesuchten Direktsignal 330 und dem bekannten ersten Panning-Koeffizienten 310 hervor. Ebenso geht die Zeit-Frequenz-Darstellung 125 (XR(b,k)) des zweiten Audiosignals 120 über eine zweite Gleichung eindeutig aus dem gesuchten zweiten Umgebungssignal 520, dem gesuchten Direktsignal 330 und dem bekannten zweiten Panning-Koeffizienten 320 hervor. Diese beiden Gleichungen enthalten drei unbekannte Größen. Um eine eindeutige Lösung zu erhalten, wird eine der Unbekannten eliminiert. - Zu diesem Zweck wird ausgenutzt, dass beide Umgebungssignale 510 und 520 ähnlich klingen. Es wird daher angenommen, dass sie auf das gleiche gemeinsame Umgebungssignal 530 (N(b,k)) zurückgehen, welches lediglich mit zwei unterschiedlichen Dekorrelationsfunktionen 540 (HL(k)) und 550 (HR(k)) gefiltert wurde. Die Dekorrelationsfunktionen 540 und 550 sind zwar nicht bekannt, lassen sich aber nach Stand der Technik beispielsweise als Filterfunktionen mit zufälligem Frequenzgang darstellen. Diese Näherung ist ausreichend, um die beiden Gleichungen nach dem Direktsignal 330 und dem gemeinsamen Umgebungssignal 530 auflösen zu können.
- Im Folgenden wird ein Ausführungsbeispiel des erfindungsgemäßen Verfahrens mathematisch erläutert:
Der Verarbeitung liegt ein Signalmodell zu Grunde, welches das in einem Stereoaudiosignal enthaltene, an diskreten Zeitpunkten n aufgenommene erste Audiosignal 110 (xL(n)) für die linke Wiedergabeeinrichtung 810 bzw. das zweite Audiosignal 120 (xR(n)) für die rechte Wiedergabeeinrichtung 820 als die gewichtete Summe einzelner Quellsignale sj(n) beschreibt, wobei j=1,...,J die einzelnen Schallquellen indiziert. Der linke Kanal xL und der rechte Kanal xR enthalten außerdem die jeweils nicht richtungsabhängigen, diffusen Umgebungssignale nL(n) bzw. nR(n). Die Panning-Koeffizienten aL,j bzw. aR,j geben jeweils eine richtungsabhängige Gewichtung an, mit der die nur von der Zeit abhängigen Quellsignale sj(n) in das erste Audiosignal xL bzw. in das zweite Audiosignal xR eingehen. -
- Die Signale können nun auf verschiedene Weise in eine Zeit-Frequenz-Darstellung überführt werden. Beispielsweise kann eine Kurzzeit-Fouriertransformation (STFT) durchgeführt werden. Eine Zeit-Frequenz-Darstellung kann aber auch unmittelbar aus den zeitabhängigen Signalen erhalten werden. Beispielsweise können die Signale mit einer Filterbank, die aus mehreren parallel geschalteten Bandpassfiltern besteht, in Anteile zerlegt werden, die ein jeder dieser Bandpassfilter durchlässt. Jeder dieser Anteile ist dann nach wie vor ein zeitabhängiges Signal. Unabhängig davon, auf welchem Wege die Zeit-Frequenz-Darstellung erhalten wurde, lässt sie sich als
schreiben. Wurde die Zeit-Frequenz-Darstellung durch Kurzzeit-Fouriertransformation (STFT) erhalten, bezeichnet man b üblicherweise als Blockindex und k als Frequenzindex. Wurde die Zeit-Frequenz-Darstellung hingegen unmittelbar aus den zeitabhängigen Signalen erhalten, beispielsweise mit einer Filterbank, bezeichnet man b üblicherweise als Zeitindex und k als Bandindex, da die Diskretisierung der Frequenzen durch die jeweils von den Bandpassfiltern durchgelassenen Frequenzbänder bestimmt wird. - Die Koeffizienten aR,j und aL,j können weiterhin zu einem Positions-Koeffizienten
zusammengefasst werden. Dieser steht in einem linearen Zusammenhang zur Azimut-Position, wobei der Wertebereich von [-1,...,1] sich auf maximal links bzw. maximal rechts gepannte Signale abbildet (Figur 2 ). Dies erlaubt eine intuitive Zuordnung zwischen dem Wert des Koeffizienten und der tatsächlichen Position im Stereopanorama. -
- Unter der Annahme, dass in den Gleichungen (3) und (4) in einem Frequenzband k jeweils nur eine dominante Quelle auftritt, können die einzelnen Quellen Sj(b,k) zu einer einzigen ungepannten Mischquelle (Direktschallquelle) mit einer zeit- und frequenzabhängigen komplexen Amplitude S(b,k) = ∑Sj(b,k) zusammengeführt werden. Die Auswirkung dieser Mischquelle auf die Signale XL(b,k) bzw. XR(b,k) ist dann ebenfalls zeit- und frequenzabhängig und wird durch die Panning-Koeffizienten aL(b,k) bzw. aR(b,k) beschrieben:
-
-
- Die Signale xL , xR und S sind im Allgemeinen komplexwertig, während die Panning-Koeffizienten aL und aR reellwertig sind, da in dem Signalmodell gemäß den Gleichungen (7) und (8) ein reines Amplitudenpanning durchgeführt wird, d.h. nur die Amplitude richtungsabhängig ist. Daraus folgt, dass sowohl XL(b,k) als auch XR(b,k) in Phase mit S(b,k) sind. In den Polardarstellungen
sind also die Phasen φL von XL, φR von XR und φS von S identisch, so dass sich die Phasenterme kürzen lassen: - Die Panning-Koeffizienten aL und aR sind in dieser Näherung also unmittelbar mit den Leistungsdichtespektren (Zeit-Frequenz-Darstellungen) XL und XR des ersten und zweiten Audiosignals, die zusammen das Stereoaudiosignal ergeben, verknüpft.
-
-
- Hierin ist PL(b,k) die Leistung des linken Kanals XL, PR(b,k) ist die Leistung des rechten Kanals XR, und PS ist die Leistung des Direktsignals S.
- Wurde die Zeit-Frequenz-Darstellung durch Kurzzeit-Fourier-Transformation (STFT) erhalten, entspricht eine Leistung PX(b,k) dem Leistungsdichtespektrum |X(b,k)|2.
- Wurde die Zeit-Frequenz-Darstellung hingegen beispielsweise durch Filterbankzerlegung im Zeitbereich erhalten, existiert nicht notwendigerweise eine geschlossene Formel für die momentane Leistung Px(b,k) pro Band k. Diese momentane Leistung lässt sich jedoch beispielsweise über rekursive Mittelung
gewinnen. Der Kleinbuchstabe x symbolisiert, dass die Zeit-Frequenz-Darstellung x(b,k) durch Zerlegung im Zeitbereich erhalten wurde. - Das Quadrat des momentanen Signals wird also als Maß dafür gewertet, wie stark sich die momentane Leistung Px(b,k) zum Zeitpunkt b gegenüber dem vorherigen Zeitpunkt b-1 ändert, α ist ein Gewichtungsfaktor, mit dem das Festhalten am bisherigen Trend für die momentane Leistung Px(b,k) gegen die Berücksichtigung neuer Informationen abgewogen wird. Dieser ist vorzugsweise so klein zu wählen, dass eine stabile Schätzung der mittleren Leistung erfolgt, ohne dass es durch Transienten oder kurzzeitige Signaländerungen zu starken Schwankungen kommt.
-
- Alternativ kann je nach Bedarf und Anwendung auch der Positions-Koeffizient
berechnet werden. Optional kann hierbei eine weitere Anpassung an das Gehör erfolgen, indem in Gleichung (15a) die Leistungen PL(b,k) und PR(b,k) jeweils durch ihre Wurzeln ersetzt werden. Der Positions-Koeffizient Ψ(b,k) vermittelt dann einen noch realistischeren Eindruck von der Position der Direktschallquelle. - Auf Grund der vereinfachenden Annahmen, unter denen die Panning-Koeffizienten aL und aR sowie die Position Ψ gewonnen wurden, sind diese Größen Näherungswerte. Sie werden im Folgenden zur Unterscheidung von den exakten Werten gemäß dem Signalmodell mit âL , âR bzw. Ψ̂ bezeichnet.
- Zur Extraktion des Direktsignals S und der Umgebungssignale NL und NR aus den Summensignalen XL und XR (Gleichungen (3) und (4)) kommt ein iteratives Verfahren zum Einsatz. Aus dem linken Eingangskanal XL und dem rechten Eingangskanal XR werden schrittweise Direktsignalbeiträge Ŝi extrahiert, die am Ende zum Direktsignal Ŝ der Direktschallquelle zusammengefasst werden. Die Differenz zwischen dem mit den Panning-Koeffizienten aL und aR gewichteten Direktsignal Ŝ und den Eingangssignalen XL bzw. XR ist eine Näherung für die Umgebungssignale NL bzw. NR. Die Indices (b,k) werden im Folgenden auf Grund der besseren Übersichtlichkeit nicht mehr explizit angegeben.
-
- Ausgehend hiervon werden gemäß den Iterationsvorschriften
die Panning-Koeffizienten verfeinert und ein Direktsignalbeitrag berechnet. Bei der ersten Iteration haben die Panning-Koeffizienten genau die Werte gemäß den Gleichungen (13) und (14) als Startwerte. Die Berechnung des Direktsignalbeitrags Ŝi gemäß Gleichung (19) geht davon aus, dass das Direktsignal im ersten und zweiten Audiosignal mit gleicher Phase vorliegt und die Umgebungssignale dazu phasenverschoben sind. - Vor der nächsten Iteration werden die Umgebungssignale über
in dem Sinne selbstkonsistent nachgeführt, dass ein Signalanteil, der sich als ein mit der Direktschallquelle 813 korrelierter Direktsignalanteil erwiesen hat, nicht gleichzeitig zum diffusen Umgebungssignal gehören kann. Diese selbstkonsistente Lösung zeichnet sich insbesondere dadurch aus, dass sie eine gute Extraktion stark gepannter, d.h. stark richtungsabhängiger, Direktsignale ermöglicht. -
- Bei der Ermittlung der Panning-Koeffizienten aL,i und aR,i sowie der Signalanteile Ŝi wurde ausschließlich Selbstkonsistenz mit den Umgebungssignalen N̂L,i und N̂R,i gefordert, ohne dass das Signalmodell gemäß den Gleichungen (3) und (4) herangezogen wurde. Daher ist nicht sichergestellt, dass die letztendlich erhaltenen Werte für N̂L , N̂R und Ŝ diesem Signalmodell gehorchen. Da sich eine Verletzung des Signalmodells stärker auf den Höreindruck auswirkt als eine Abweichung im diffusen Umgebungssignal, wird der Erfüllung des Signalmodells Priorität gegenüber einer möglichst exakten Näherung für N̂L und N̂R eingeräumt. Daher werden nicht die bei der letzten Iteration I erhaltenen Werte N̂L,I und N̂R,I als Umgebungssignale N̂L und N̂R verwendet, sondern diese werden am Ende aus dem Gesamtergebnis Ŝ für das Direktsignal und den ersten Näherungswerten â L,1 und â R,1 für die Panning-Koeffizienten berechnet:
- Die während des iterativen Verfahrens gemäß den Gleichungen (17) und (18) verfeinerten Panning-Koeffizienten werden ausschließlich für die Aufteilung der Signale XL und XR in Direktsignal Ŝ und Umgebungssignale N̂L und N̂R verwendet. Für das Repanning auf eine Konfiguration von mehr als zwei Lautsprechern werden weiterhin die aus der Lösung des Gleichungssystems (13-14) erhaltenen Panning-Koeffizienten verwendet.
-
-
-
- Im Folgenden wird ein allgemeinerer Ansatz zur Bestimmung des Direktsignals und der Umgebungssignale aus den Panning-Koeffizienten gegeben. Dieser Ansatz geht von der Annahme aus, dass beide Umgebungssignale ähnlich klingen, jedoch durch unterschiedliche Ausbreitungswege und Reflexionen dekorreliert sind.
-
-
- Die allgemeine Form der Dekorrelationsfunktionen HL,R(b,k) kann, sofern die Zeit-Frequenz-Darstellungen XL(b,k) und XR(b,k) aus einer vollständigen Transformation in den Frequenzbereich gewonnen wurden, etwa mittels Kurzzeit-Fourier-Transformation (STFT), als komplexes Spektrum
mit einer frequenzabhängigen Amplitude γ(k) und Phase φ(k), beschrieben werden. -
- Werden Zeit-Frequenz-Darstellungen xL(b,k) und xR(b,k) mit einer Filterbank gewonnen, werden die Gleichungen (31) und (32) zu
worin die Benennung von h, x, a, s und n in Kleinbuchstaben wiederum verdeutlicht, dass es sich um Größen im Zeitbereich handelt. Die Dekorrelationsfunktionen HL und HR lassen sich jetzt nicht mehr so einfach anwenden wie im Frequenzbereich. Mit der Einschränkung wonach die Dekorrelationsfunktion pro Band nur Phasenverschiebungen von 0 (+1) und π (-1) erzeugen kann, vereinfachen sich die Gleichungen (36) und (37) zu -
-
- 1
- Position des Hörers
- 110
- erstes (linkes) Audiosignal xL des Stereoaudiosignals
- 115
- Zeit-Frequenz-Darstellung XL des ersten Audiosignals 110
- 115a
- zeit- und frequenzabhängige Leistung PL des Signals 110
- 120
- zweites (rechtes) Audiosignal xR des Stereoaudiosignals
- 125
- Zeit-Frequenz-Darstellung XR des zweiten Audiosignals 120
- 125a
- zeit- und frequenzabhängige Leistung PR des Signals 120
- 145
- Ermittlung der zeit- und frequenzabhängigen Leistung 115a, 125a
- 150
- Filterbank
- 310
- Panning-Koeffizienten aL(b,k) des ersten Audiosignals 110
- 320
- Panning-Koeffizienten aR(b,k) des zweiten Audiosignals 120
- 330
- komplexe Amplitude S(b,k) der Direktschallquelle 813
- 330a
- zeit- und frequenzabhängige Leistung PS des Signals 330
- ϕ
- azimutale Position der Direktschallquelle 813
- 390
- Positionskoeffizient Ψ
- 410
- erster Repanning-Koeffizient g1 für ersten Tonkanal 580
- 420
- zweiter Repanning-Koeffizient g2 für zweiten Tonkanal 585
- 430
- dritter Repanning-Koeffizient g3 für dritten Tonkanal 590
- 510
- erstes (linkes) Umgebungssignal NL
- 520
- zweites (rechtes) Umgebungssignal NR
- 530
- gemeinsames Umgebungssignal N(b,k)
- 540
- erste Dekorrelationsfunktion HL(k)
- 550
- zweite Dekorrelationsfunktion HR(k)
- 580
- erster Tonkanal für Lautsprecher auf Position L (links)
- 585
- zweiter Tonkanal für Lautsprecher auf Position C (Mitte)
- 590
- dritter Tonkanal für Lautsprecher auf Position R (rechts)
- 810
- linke Wiedergabeeinrichtung für das erste Audiosignal 110
- 813
- Direktschallquelle
- 820
- rechte Wiedergabeeinrichtung für das zweite Audiosignal 120
- 890
- Hörbereich vor dem Hörer 1 bzw. um den Hörer 1
- 891
- gleichseitiges Dreieck im Hörbereich 890
- 892
- Kreisbogen am Rand des Hörbereichs 890
- L, C, R
- Lautsprecherpositionen Links, Mitte, Rechts für das Repanning
- RL, RR
- zusätzliche Lautsprecherpositionen für Umgebungssignale 510, 520
Claims (14)
- Verfahren zur Analyse eines Stereoaudiosignals, wobei das Stereoaudiosignal ein erstes Audiosignal (110) für eine linke Wiedergabeeinrichtung (810) und ein zweites Audiosignal (120) für eine rechte Wiedergabeeinrichtung (820) aufweist, mit folgende Schritten:das erste Audiosignal (110) wird in eine erste Zeit-Frequenz-Darstellung (115) überführt, und das zweite Audiosignal (120) wird in eine zweite Zeit-Frequenz-Darstellung (125) überführt;aus der ersten Zeit-Frequenz-Darstellung (115) wird die zeit- und frequenzabhängige Leistung (115a) des ersten Audiosignals (110) ermittelt (145), und aus der zweiten Zeit-Frequenz-Darstellung (125) wird die zeit- und frequenzabhängige Leistung (125a) des zweiten Audiosignals (120) ermittelt (145);es wird eine erste Gleichung aufgestellt, die die zeit- und frequenzabhängige Leistung (115a) des ersten Audiosignals (110) in Beziehung setzt zum Produkt des Quadrats eines ersten zeit- und frequenzabhängigen Panning-Koeffizienten (310) mit der zeit- und frequenzabhängigen Leistung (330a) einer in einem Hörbereich (890) zwischen der linken Wiedergabeeinrichtung (810) und der rechten Wiedergabeeinrichtung (820) angeordneten Direktschallquelle (813);es wird eine zweite Gleichung aufgestellt, die die zeit- und frequenzabhängige Leistung (125a) des zweiten Audiosignals (120) in Beziehung setzt zum Produkt des Quadrats eines zweiten zeit- und frequenzabhängigen Panning-Koeffizienten (320) mit der gleichen zeit- und frequenzabhängigen Leistung (330a) der gleichen Direktschallquelle (813);wobei die Panning-Koeffizienten (310) und (320) dazu ausgebildet sind, die Direktschallquelle (813) in dem Hörbereich (890) zu positionieren;ein Positionskoeffizient (390), der dem Verhältnis einer Differenz der Panning-Koeffizienten (310) und (320) zur Summe der Panning-Koeffizienten (310) und (320) entspricht, wird als Lösung des aus beiden Gleichungen gebildeten Gleichungssystems ermittelt,dadurch gekennzeichnet, dass das Gleichungssystem unter der zusätzlichen Bedingung gelöst wird, dass die Summe der Quadrate der Panning-Koeffizienten (310) und (320) konstant ist, wobei der Positionskoeffizient (390) aus dem Verhältnis der Differenz der Wurzeln der zeit- und frequenzabhängigen Leistungen (125a, 115a) beider Audiosignale (110, 120) zur Summe der Wurzeln der zeit- undfrequenzabhängigen Leistungen (125a, 115a) beider Audiosignale (110, 120) ermittelt wird.
- Verfahren nach Anspruch 1, dadurch gekennzeichnet, dass der erste Panning-Koeffizient (310) als Wurzel aus dem Verhältnis der zeit- und frequenzabhängigen Leistung (115a) des ersten Audiosignals (110) zur Summe der zeit- und frequenzabhängigen Leistungen (115a, 125a) beider Audiosignale (110, 120) ermittelt wird und dass der zweite Panning-Koeffizient (320) als Wurzel aus dem Verhältnis der zeit- und frequenzabhängigen Leistung (125a) des zweiten Audiosignals (120) zur Summe der zeit- und frequenzabhängigen Leistungen (115a, 125a) beider Audiosignale (110, 120) ermittelt wird.
- Verfahren nach einem der Ansprüche 1 bis 2, dadurch gekennzeichnet, dass die zeit- und frequenzabhängige Leistung (115a, 125a) mindestens eines Audiosignals (110, 120) zu einem interessierenden Zeitpunkt als gewichtete Summe aus der zeit- und frequenzabhängigen Leistung (115a, 125a) des Audiosignals zu einem früheren Zeitpunkt und dem Quadrat der Zeit-Frequenz-Darstellung (115, 125) dieses Audiosignals (110, 120) zu dem interessierenden Zeitpunkt ermittelt wird (145).
- Verfahren zur Analyse eines Stereoaudiosignals, wobei das Stereoaudiosignal ein erstes Audiosignal (110) für eine linke Wiedergabeeinrichtung (810) und ein zweites Audiosignal (120) für eine rechte Wiedergabeeinrichtung (820) aufweist, mit folgenden Schritten:das erste Audiosignal (110) wird in eine erste Zeit-Frequenz-Darstellung (115) überführt, und das zweite Audiosignal (120) wird in eine zweite Zeit-Frequenz-Darstellung (125) überführt;es wird eine erste Gleichung aufgestellt, die die erste Zeit-Frequenz-Darstellung (115) in Beziehung setzt zum Produkt eines ersten zeit- und frequenzabhängigen Panning-Koeffizienten (310) mit dem zeit- und frequenzabhängigen Signal (330) einer in einem Hörbereich (890) zwischen der linken Wiedergabeeinrichtung (810) und der rechten Wiedergabeeinrichtung (820) angeordneten Direktschallquelle (813);es wird eine zweite Gleichung aufgestellt, die die zweite Zeit-Frequenz-Darstellung (125) in Beziehung setzt zum Produkt eines zweiten zeit- und frequenzabhängigen Panning-Koeffizienten (320) mit dem gleichen Signal (330) der gleichen Direktschallquelle (813);wobei die Panning-Koeffizienten (310) und (320) dazu ausgebildet sind, die Direktschallquelle (813) in dem Hörbereich (890) zu positionieren;ein Positionskoeffizient (390), der der Differenz der Quadrate der Panning-Koeffizienten (310) und (320) entspricht, wird als Lösung des aus beiden Gleichungen gebildeten Gleichungssystems ermittelt,wobei das Gleichungssystem unter der zusätzlichen Bedingung gelöst wird, dass die Summe der Quadrate der Panning-Koeffizienten (310) und (320) konstant ist,dadurch gekennzeichnet, dass der Positionskoeffizient (390) aus dem Verhältnis der Differenz der Betragsquadrate beider Zeit-Frequenz-Darstellungen (115) und (125) zur Summe der Betragsquadrate beider Zeit-Frequenz-Darstellungen (115) und (125) ermittelt wird.
- Verfahren nach Anspruch 4, dadurch gekennzeichnet, dass der erste Panning-Koeffizient (310) als Wurzel aus dem Verhältnis des Quadrats der Zeit-Frequenz-Darstellung (115) des ersten Audiosignals (110) zur Summe der Quadrate der Zeit-Frequenz-Darstellungen (115) und (125) beider Audiosignale (110) und (120) ermittelt wird und dass der zweite Panning-Koeffizient (320) als Wurzel aus dem Verhältnis der Zeit-Frequenz-Darstellung (125) des zweiten Audiosignals (120) zur Summe der Quadrate der Zeit-Frequenz-Darstellungen (115) und (125) beider Audiosignale (110) und (120) ermittelt wird.
- Verfahren nach einem der Ansprüche 1 bis 5, dadurch gekennzeichnet, dass aus den Panning-Koeffizienten (310) und (320) das Signal (330) der Direktschallquelle (813)
und/oder
zwei nicht mit dieser Direktschallquelle (813) korrelierte Umgebungssignale (510) und (520), wobei das erste Umgebungssignal (510) nur in der Zeit-Frequenz-Darstellung (115) des ersten Audiosignals (110) und das zweite Umgebungssignal (520) nur in der Zeit-Frequenz-Darstellung (125) des zweiten Audiosignals (120) enthalten ist, ermittelt werden. - Verfahren nach Anspruch 6, gekennzeichnet durch folgende Schritte:es wird eine erste Gleichung aufgestellt, die die erste Zeit-Frequenz-Darstellung (115) in Beziehung setzt zur Summe aus dem Produkt des ersten Panning-Koeffizienten (310) mit dem zeit- und frequenzabhängigen Signal (330) der Direktschallquelle (813) sowie aus der Filterung eines einzigen gemeinsamen Umgebungssignals (530) mit einer ersten Dekorrelationsfunktion (540);es wird eine zweite Gleichung aufgestellt, die die zweite Zeit-Frequenz-Darstellung (125) in Beziehung setzt zur Summe aus dem Produkt des zweiten Panning-Koeffizienten (320) mit dem zeit- und frequenzabhängigen Signal (330) der Direktschallquelle (813) sowie aus der Filterung des gemeinsamen Umgebungssignals (530) mit einer zweiten Dekorrelationsfunktion (550);das zeit- und frequenzabhängige Signal (330) der Direktschallquelle (813), und/oder das gemeinsame Umgebungssignal (530), werden als Lösungen des aus den beiden Gleichungen gebildeten Gleichungssystems ermittelt.
- Verfahren nach Anspruch 7, dadurch gekennzeichnet, dass das zeit- und frequenzabhängige Signal (330) der Direktschallquelle (813) als Differenz zwischen dem frequenzbandweisen Produkt der ersten Zeit-Frequenz-Darstellung (115) mit der zweiten Dekorrelationsfunktion (550) und dem frequenzbandweisen Produkt der zweiten Zeit-Frequenz-Darstellung (125) mit der ersten Dekorrelationsfunktion (540), dividiert durch die Differenz zwischen der Faltung des ersten Panning-Koeffizienten (310) mit der zweiten Dekorrelationsfunktion (550) und dem frequenzbandweisen Produkt des zweiten Panning-Koeffizienten (320) mit der ersten Dekorrelationsfunktion (540), ermittelt wird.
- Verfahren nach einem der Ansprüche 7 bis 8, dadurch gekennzeichnet, dass das gemeinsame Umgebungssignal (530) als Differenz zwischen dem Produkt der zweiten Zeit-Frequenz-Darstellung (125) mit dem ersten Panning-Koeffizienten (310) und dem Produkt der ersten Zeit-Frequenz-Darstellung (115) mit dem zweiten Panning-Koeffizienten (320), dividiert durch die Differenz zwischen dem frequenzbandweisen Produkt des ersten Panning-Koeffizienten (310) mit der zweiten Dekorrelationsfunktion (550) und dem frequenzbandweisen Produkt des zweiten Panning-Koeffizienten (320) mit der ersten Dekorrelationsfunktion (540), ermittelt wird.
- Verfahren nach Anspruch 6, dadurch gekennzeichnet, dass das Signal (330) der Direktschallquelle (813) und die Umgebungssignale (510, 520) mit einem iterativen Verfahren bestimmt werden ausgehend von einer Iterationsvorschrift, die das Signal (330) der Direktschallquelle einer jeden Iteration, und/oder einen Beitrag zu diesem Signal, in Beziehung setzt zu den Umgebungssignalen (510, 520) der vorherigen Iteration.
- Verfahren nach Anspruch 10, dadurch gekennzeichnet, dass bei jeder Iteration die Panning-Koeffizienten (310) und (320) aus den Umgebungssignalen (510, 520) der vorherigen Iteration neu berechnet werden.
- Verfahren nach Anspruch 11, dadurch gekennzeichnet, dass das erste Umgebungssignal (510) bei jeder Iteration um einen Betrag korrigiert wird, der das Produkt aus dem neu berechneten ersten Panning-Koeffizienten (310) mit dem Signal (330) der Direktschallquelle (813) gemäß der aktuellen Iteration ist, und dass das zweite Umgebungssignal (520) bei jeder Iteration um einen Betrag korrigiert wird, der das Produkt aus dem neu berechneten zweiten Panning-Koeffizienten (320) mit dem Signal (330) der Direktschallquelle (813) gemäß der aktuellen Iteration ist.
- Verfahren nach einem der Ansprüche 6 oder 10 bis 12, dadurch gekennzeichnet, dass das Signal (330) der Direktschallquelle (813) aus dem Verhältnis der Summe beider Zeit-Frequenz-Darstellungen (115) und (125) zur Summe beider Panning-Koeffizienten (310) und (320) ermittelt wird.
- Verfahren nach einem der Ansprüche 6 oder 10 bis 12, dadurch gekennzeichnet, dass die Umgebungssignale aus dem Verhältnis einer Differenz zwischen der Zeit-Frequenz-Darstellung (115) des ersten Audiosignals (110), gewichtet mit dem zweiten Panning-Koeffizienten (320), und der Zeit-Frequenz-Darstellung (125) des zweiten Audiosignals (120), gewichtet mit dem ersten Panning-Koeffizienten (310), zur Summe beider Panning-Koeffizienten (310) und (320) ermittelt wird.
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| DE102015104699.7A DE102015104699A1 (de) | 2015-03-27 | 2015-03-27 | Verfahren zur Analyse und Dekomposition von Stereoaudiosignalen |
| PCT/EP2016/056163 WO2016156091A1 (de) | 2015-03-27 | 2016-03-21 | Verfahren zur analyse und dekomposition von stereoaudiosignalen |
Publications (2)
| Publication Number | Publication Date |
|---|---|
| EP3275212A1 EP3275212A1 (de) | 2018-01-31 |
| EP3275212B1 true EP3275212B1 (de) | 2019-06-26 |
Family
ID=55646555
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| EP16713352.9A Active EP3275212B1 (de) | 2015-03-27 | 2016-03-21 | Verfahren zur analyse und dekomposition von stereoaudiosignalen |
Country Status (4)
| Country | Link |
|---|---|
| US (1) | US10284988B2 (de) |
| EP (1) | EP3275212B1 (de) |
| DE (1) | DE102015104699A1 (de) |
| WO (1) | WO2016156091A1 (de) |
Families Citing this family (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| EP3373604B1 (de) | 2017-03-08 | 2021-09-01 | Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. | Vorrichtung und verfahren zur bereitstellung eines räumlichkeitsmasses in assoziation mit einem audiostrom |
Family Cites Families (7)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US5594800A (en) * | 1991-02-15 | 1997-01-14 | Trifield Productions Limited | Sound reproduction system having a matrix converter |
| US7257231B1 (en) * | 2002-06-04 | 2007-08-14 | Creative Technology Ltd. | Stream segregation for stereo signals |
| CN101518103B (zh) * | 2006-09-14 | 2016-03-23 | 皇家飞利浦电子股份有限公司 | 多通道信号的甜点操纵 |
| KR101296757B1 (ko) * | 2008-09-11 | 2013-08-14 | 프라운호퍼 게젤샤프트 쭈르 푀르데룽 데어 안겐반텐 포르슝 에. 베. | 마이크로폰 신호를 기반으로 공간 큐의 세트를 제공하는 장치, 방법 및 컴퓨터 프로그램과, 2채널 오디오 신호 및 공간 큐의 세트를 제공하는 장치 |
| KR101567461B1 (ko) | 2009-11-16 | 2015-11-09 | 삼성전자주식회사 | 다채널 사운드 신호 생성 장치 |
| KR101871234B1 (ko) | 2012-01-02 | 2018-08-02 | 삼성전자주식회사 | 사운드 파노라마 생성 장치 및 방법 |
| DE102012017296B4 (de) | 2012-08-31 | 2014-07-03 | Hamburg Innovation Gmbh | Erzeugung von Mehrkanalton aus Stereo-Audiosignalen |
-
2015
- 2015-03-27 DE DE102015104699.7A patent/DE102015104699A1/de not_active Withdrawn
-
2016
- 2016-03-21 EP EP16713352.9A patent/EP3275212B1/de active Active
- 2016-03-21 US US15/562,151 patent/US10284988B2/en active Active
- 2016-03-21 WO PCT/EP2016/056163 patent/WO2016156091A1/de not_active Ceased
Non-Patent Citations (1)
| Title |
|---|
| None * |
Also Published As
| Publication number | Publication date |
|---|---|
| DE102015104699A1 (de) | 2016-09-29 |
| EP3275212A1 (de) | 2018-01-31 |
| WO2016156091A1 (de) | 2016-10-06 |
| US20180084360A1 (en) | 2018-03-22 |
| US10284988B2 (en) | 2019-05-07 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| DE102006050068B4 (de) | Vorrichtung und Verfahren zum Erzeugen eines Umgebungssignals aus einem Audiosignal, Vorrichtung und Verfahren zum Ableiten eines Mehrkanal-Audiosignals aus einem Audiosignal und Computerprogramm | |
| DE102017102134B4 (de) | Global optimierte Nachfilterung mit der Kleinste-Quadrate-Methode für die Sprachverbesserung | |
| EP2891334B1 (de) | Erzeugung von mehrkanalton aus stereo-audiosignalen | |
| EP3005737B1 (de) | Mischpult, verfahren und computerprogramm zum bereitstellen eines tonsignals | |
| EP2206113B1 (de) | Vorrichtung und verfahren zum erzeugen eines multikanalsignals mit einer sprachsignalverarbeitung | |
| EP3117631B1 (de) | Vorrichtung und verfahren zum verarbeiten eines signals im frequenzbereich | |
| DE602005006385T2 (de) | Vorrichtung und verfahren zum konstruieren eines mehrkanaligen ausgangssignals oder zum erzeugen eines downmix-signals | |
| EP2036400B1 (de) | Erzeugung dekorrelierter signale | |
| DE602005005186T2 (de) | Verfahren und system zur schallquellen-trennung | |
| EP2919652B1 (de) | Bearbeiten von audiosignalen für eine tinnitustherapie | |
| EP2005421A1 (de) | Vorrichtung und verfahren zum erzeugen eines umgebungssignals | |
| DE69629934T2 (de) | Umgekehrte transform-schmalband/breitband tonsynthese | |
| WO2006094635A1 (de) | Vorrichtung und verfahren zum erzeugen eines codierten stereo-signals eines audiostücks oder audiodatenstroms | |
| WO2015049334A1 (de) | Verfahren und vorrichtung zum downmixen eines multikanalsignals und zum upmixen eines downmixsignals | |
| DE102008056704B4 (de) | Verfahren zum Erzeugen eines abwärtskompatiblen Tonformates | |
| DE3806915A1 (de) | Reverb- (nachhall-) generator | |
| DE2249039C2 (de) | Verfahren zur Aufnahme und Wiedergabe von richtungsbezogener Schallinformation | |
| WO2015049332A1 (de) | Ableitung von multikanalsignalen aus zwei oder mehreren grundsignalen | |
| WO2016156091A1 (de) | Verfahren zur analyse und dekomposition von stereoaudiosignalen | |
| WO2015128379A1 (de) | Kodierung und dekodierung eines niederfrequenten kanals in einem audiomultikanalsignal | |
| WO2015128376A1 (de) | Autonome residualbestimmung und gewinnung von residualarmen zusatzsignalen | |
| DE102019217189A1 (de) | Wellenfeldverarbeitungsverfahren | |
| EP2952016B1 (de) | Verfahren zur mehrkanaltonbearbeitung in einem mehrkanaltonsystem | |
| EP1130577B1 (de) | Verfahren zur Rekonstruktion tieffrequenter Sprachanteile aus mittelhohen Frequenzanteilen | |
| DE112006002548T5 (de) | Vorrichtung und Verfahren zur Wiedergabe von virtuellem Zweikanal-Ton |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: THE INTERNATIONAL PUBLICATION HAS BEEN MADE |
|
| PUAI | Public reference made under article 153(3) epc to a published international application that has entered the european phase |
Free format text: ORIGINAL CODE: 0009012 |
|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: REQUEST FOR EXAMINATION WAS MADE |
|
| 17P | Request for examination filed |
Effective date: 20171012 |
|
| AK | Designated contracting states |
Kind code of ref document: A1 Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC MK MT NL NO PL PT RO RS SE SI SK SM TR |
|
| AX | Request for extension of the european patent |
Extension state: BA ME |
|
| DAV | Request for validation of the european patent (deleted) | ||
| DAX | Request for extension of the european patent (deleted) | ||
| GRAP | Despatch of communication of intention to grant a patent |
Free format text: ORIGINAL CODE: EPIDOSNIGR1 |
|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: GRANT OF PATENT IS INTENDED |
|
| INTG | Intention to grant announced |
Effective date: 20180919 |
|
| GRAJ | Information related to disapproval of communication of intention to grant by the applicant or resumption of examination proceedings by the epo deleted |
Free format text: ORIGINAL CODE: EPIDOSDIGR1 |
|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: REQUEST FOR EXAMINATION WAS MADE |
|
| GRAS | Grant fee paid |
Free format text: ORIGINAL CODE: EPIDOSNIGR3 |
|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: GRANT OF PATENT IS INTENDED |
|
| GRAP | Despatch of communication of intention to grant a patent |
Free format text: ORIGINAL CODE: EPIDOSNIGR1 |
|
| INTC | Intention to grant announced (deleted) | ||
| INTG | Intention to grant announced |
Effective date: 20190206 |
|
| GRAA | (expected) grant |
Free format text: ORIGINAL CODE: 0009210 |
|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: THE PATENT HAS BEEN GRANTED |
|
| AK | Designated contracting states |
Kind code of ref document: B1 Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC MK MT NL NO PL PT RO RS SE SI SK SM TR |
|
| REG | Reference to a national code |
Ref country code: GB Ref legal event code: FG4D Free format text: NOT ENGLISH |
|
| REG | Reference to a national code |
Ref country code: CH Ref legal event code: EP |
|
| REG | Reference to a national code |
Ref country code: AT Ref legal event code: REF Ref document number: 1149724 Country of ref document: AT Kind code of ref document: T Effective date: 20190715 |
|
| REG | Reference to a national code |
Ref country code: DE Ref legal event code: R096 Ref document number: 502016005243 Country of ref document: DE |
|
| REG | Reference to a national code |
Ref country code: IE Ref legal event code: FG4D Free format text: LANGUAGE OF EP DOCUMENT: GERMAN |
|
| REG | Reference to a national code |
Ref country code: NL Ref legal event code: MP Effective date: 20190626 |
|
| PG25 | Lapsed in a contracting state [announced via postgrant information from national office to epo] |
Ref country code: NO Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20190926 Ref country code: AL Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20190626 Ref country code: FI Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20190626 Ref country code: SE Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20190626 Ref country code: HR Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20190626 Ref country code: LT Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20190626 |
|
| REG | Reference to a national code |
Ref country code: LT Ref legal event code: MG4D |
|
| PG25 | Lapsed in a contracting state [announced via postgrant information from national office to epo] |
Ref country code: GR Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20190927 Ref country code: BG Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20190926 Ref country code: RS Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20190626 Ref country code: LV Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20190626 |
|
| PG25 | Lapsed in a contracting state [announced via postgrant information from national office to epo] |
Ref country code: CZ Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20190626 Ref country code: RO Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20190626 Ref country code: EE Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20190626 Ref country code: NL Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20190626 Ref country code: PT Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20191028 Ref country code: SK Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20190626 |
|
| PG25 | Lapsed in a contracting state [announced via postgrant information from national office to epo] |
Ref country code: IT Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20190626 Ref country code: SM Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20190626 Ref country code: IS Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20191026 Ref country code: ES Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20190626 |
|
| PG25 | Lapsed in a contracting state [announced via postgrant information from national office to epo] |
Ref country code: TR Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20190626 |
|
| PG25 | Lapsed in a contracting state [announced via postgrant information from national office to epo] |
Ref country code: DK Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20190626 Ref country code: PL Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20190626 |
|
| PG25 | Lapsed in a contracting state [announced via postgrant information from national office to epo] |
Ref country code: IS Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20200224 |
|
| REG | Reference to a national code |
Ref country code: DE Ref legal event code: R097 Ref document number: 502016005243 Country of ref document: DE |
|
| PLBE | No opposition filed within time limit |
Free format text: ORIGINAL CODE: 0009261 |
|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: NO OPPOSITION FILED WITHIN TIME LIMIT |
|
| PG2D | Information on lapse in contracting state deleted |
Ref country code: IS |
|
| 26N | No opposition filed |
Effective date: 20200603 |
|
| PG25 | Lapsed in a contracting state [announced via postgrant information from national office to epo] |
Ref country code: SI Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20190626 |
|
| PG25 | Lapsed in a contracting state [announced via postgrant information from national office to epo] |
Ref country code: MC Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20190626 |
|
| REG | Reference to a national code |
Ref country code: CH Ref legal event code: PL |
|
| REG | Reference to a national code |
Ref country code: BE Ref legal event code: MM Effective date: 20200331 |
|
| PG25 | Lapsed in a contracting state [announced via postgrant information from national office to epo] |
Ref country code: LU Free format text: LAPSE BECAUSE OF NON-PAYMENT OF DUE FEES Effective date: 20200321 |
|
| PG25 | Lapsed in a contracting state [announced via postgrant information from national office to epo] |
Ref country code: CH Free format text: LAPSE BECAUSE OF NON-PAYMENT OF DUE FEES Effective date: 20200331 Ref country code: LI Free format text: LAPSE BECAUSE OF NON-PAYMENT OF DUE FEES Effective date: 20200331 Ref country code: IE Free format text: LAPSE BECAUSE OF NON-PAYMENT OF DUE FEES Effective date: 20200321 |
|
| PG25 | Lapsed in a contracting state [announced via postgrant information from national office to epo] |
Ref country code: BE Free format text: LAPSE BECAUSE OF NON-PAYMENT OF DUE FEES Effective date: 20200331 |
|
| REG | Reference to a national code |
Ref country code: AT Ref legal event code: MM01 Ref document number: 1149724 Country of ref document: AT Kind code of ref document: T Effective date: 20210321 |
|
| PG25 | Lapsed in a contracting state [announced via postgrant information from national office to epo] |
Ref country code: MT Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20190626 Ref country code: CY Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20190626 |
|
| PG25 | Lapsed in a contracting state [announced via postgrant information from national office to epo] |
Ref country code: MK Free format text: LAPSE BECAUSE OF FAILURE TO SUBMIT A TRANSLATION OF THE DESCRIPTION OR TO PAY THE FEE WITHIN THE PRESCRIBED TIME-LIMIT Effective date: 20190626 |
|
| PG25 | Lapsed in a contracting state [announced via postgrant information from national office to epo] |
Ref country code: AT Free format text: LAPSE BECAUSE OF NON-PAYMENT OF DUE FEES Effective date: 20210321 |
|
| PGFP | Annual fee paid to national office [announced via postgrant information from national office to epo] |
Ref country code: FR Payment date: 20230322 Year of fee payment: 8 |
|
| PGFP | Annual fee paid to national office [announced via postgrant information from national office to epo] |
Ref country code: GB Payment date: 20230323 Year of fee payment: 8 Ref country code: DE Payment date: 20230329 Year of fee payment: 8 |
|
| REG | Reference to a national code |
Ref country code: DE Ref legal event code: R119 Ref document number: 502016005243 Country of ref document: DE |
|
| GBPC | Gb: european patent ceased through non-payment of renewal fee |
Effective date: 20240321 |
|
| PG25 | Lapsed in a contracting state [announced via postgrant information from national office to epo] |
Ref country code: DE Free format text: LAPSE BECAUSE OF NON-PAYMENT OF DUE FEES Effective date: 20241001 |
|
| PG25 | Lapsed in a contracting state [announced via postgrant information from national office to epo] |
Ref country code: GB Free format text: LAPSE BECAUSE OF NON-PAYMENT OF DUE FEES Effective date: 20240321 |
|
| PG25 | Lapsed in a contracting state [announced via postgrant information from national office to epo] |
Ref country code: FR Free format text: LAPSE BECAUSE OF NON-PAYMENT OF DUE FEES Effective date: 20240331 |
|
| PG25 | Lapsed in a contracting state [announced via postgrant information from national office to epo] |
Ref country code: GB Free format text: LAPSE BECAUSE OF NON-PAYMENT OF DUE FEES Effective date: 20240321 Ref country code: FR Free format text: LAPSE BECAUSE OF NON-PAYMENT OF DUE FEES Effective date: 20240331 Ref country code: DE Free format text: LAPSE BECAUSE OF NON-PAYMENT OF DUE FEES Effective date: 20241001 |














