EP1417676A2 - Verfahren und vorrichtung zum erzeugen einer kennung für ein audiosignal, zum aufbauen einer instrumentendatenbank und zum bestimmen der art eines instruments - Google Patents

Verfahren und vorrichtung zum erzeugen einer kennung für ein audiosignal, zum aufbauen einer instrumentendatenbank und zum bestimmen der art eines instruments

Info

Publication number
EP1417676A2
EP1417676A2 EP02785403A EP02785403A EP1417676A2 EP 1417676 A2 EP1417676 A2 EP 1417676A2 EP 02785403 A EP02785403 A EP 02785403A EP 02785403 A EP02785403 A EP 02785403A EP 1417676 A2 EP1417676 A2 EP 1417676A2
Authority
EP
European Patent Office
Prior art keywords
amplitude
identifier
instrument
audio signal
time
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Granted
Application number
EP02785403A
Other languages
English (en)
French (fr)
Other versions
EP1417676B1 (de
Inventor
Frank Klefenz
Karlheinz Brandenburg
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Fraunhofer Gesellschaft zur Foerderung der Angewandten Forschung eV
Original Assignee
Fraunhofer Gesellschaft zur Foerderung der Angewandten Forschung eV
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Fraunhofer Gesellschaft zur Foerderung der Angewandten Forschung eV filed Critical Fraunhofer Gesellschaft zur Foerderung der Angewandten Forschung eV
Publication of EP1417676A2 publication Critical patent/EP1417676A2/de
Application granted granted Critical
Publication of EP1417676B1 publication Critical patent/EP1417676B1/de
Anticipated expiration legal-status Critical
Expired - Lifetime legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10HELECTROPHONIC MUSICAL INSTRUMENTS; INSTRUMENTS IN WHICH THE TONES ARE GENERATED BY ELECTROMECHANICAL MEANS OR ELECTRONIC GENERATORS, OR IN WHICH THE TONES ARE SYNTHESISED FROM A DATA STORE
    • G10H1/00Details of electrophonic musical instruments
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10HELECTROPHONIC MUSICAL INSTRUMENTS; INSTRUMENTS IN WHICH THE TONES ARE GENERATED BY ELECTROMECHANICAL MEANS OR ELECTRONIC GENERATORS, OR IN WHICH THE TONES ARE SYNTHESISED FROM A DATA STORE
    • G10H2210/00Aspects or methods of musical processing having intrinsic musical character, i.e. involving musical theory or musical parameters or relying on musical knowledge, as applied in electrophonic musical tools or instruments
    • G10H2210/031Musical analysis, i.e. isolation, extraction or identification of musical elements or musical parameters from a raw acoustic signal or from an encoded audio signal
    • G10H2210/056Musical analysis, i.e. isolation, extraction or identification of musical elements or musical parameters from a raw acoustic signal or from an encoded audio signal for extraction or identification of individual instrumental parts, e.g. melody, chords, bass; Identification or separation of instrumental parts by their characteristic voices or timbres
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10HELECTROPHONIC MUSICAL INSTRUMENTS; INSTRUMENTS IN WHICH THE TONES ARE GENERATED BY ELECTROMECHANICAL MEANS OR ELECTRONIC GENERATORS, OR IN WHICH THE TONES ARE SYNTHESISED FROM A DATA STORE
    • G10H2240/00Data organisation or data communication aspects, specifically adapted for electrophonic musical tools or instruments
    • G10H2240/121Musical libraries, i.e. musical databases indexed by musical parameters, wavetables, indexing schemes using musical parameters, musical rule bases or knowledge bases, e.g. for automatic composing methods
    • G10H2240/145Sound library, i.e. involving the specific use of a musical database as a sound bank or wavetable; indexing, interfacing, protocols or processing therefor

Definitions

  • the present invention relates to audio signals and in particular to the acoustic identification of musical instruments, the tones of which occur in the audio signal.
  • the present invention is based on the recognition that the amplitude-time representation is a tone which is generated from egg nem instrument, a significantly meaningful ⁇ rer fingerprint as the overtone spectrum of an instrument.
  • an identifier of an audio signal which comprises a sound generated by an instrument, is therefore extracted from an amplitude-time representation of the audio signal.
  • the amplitude-time representation of the audio signal is a discrete representation, the amplitude-time representation having a plurality of successive amplitude values or “samples” for a plurality of successive times, with a time being assigned to each amplitude value.
  • the identifiers in the instrument database can be used as reference identifiers for musical instrument identification.
  • a test audio signal which comprises a tone of an instrument whose type is to be determined, is processed in order to obtain a test identifier for the test audio signal.
  • the test identifier is compared with the reference identifiers available in the database.
  • the statement can be made that the instrument from which the test audio signal originates is of the type of instrument from which the reference identification originates which fulfills the predetermined similarity criterion.
  • a distance metric may conveniently be introduced by a so-called nearest-Neighbor- search form min ⁇ . ⁇ A 0 i - a 0r efr • ⁇ • / (a n i - a nre f) ⁇ Runaway ⁇ leads can be.
  • no polynomial adaptation is used, but the population numbers of the discrete amplitude lines are determined in a time window and used to determine an identifier for the audio signal or for the musical instrument from which the audio signal originates ,
  • a compromise between the scope of data of the identifier and the specificity or uniqueness of the identifier for a musical instrument type should be sought.
  • An identifier with a large amount of data typically has a better distinctive character or is a more specific fingerprint for an instrument, but brings with it problems in database evaluation due to the large amount of data.
  • an identifier with less data content tends to be less distinctive, but enables much more efficient and faster processing with an instrument database.
  • a compromise is therefore made between the amount of data in the identifier and the distinctive character of the identifier.
  • the user is free to set up very sophisticated databases which, for an arbitrarily large number of instruments, comprise an arbitrarily large number of tones and - optimally - each tone of the tonal range which can be produced by the individual instrument.
  • More sophisticated databases can also have their own identifiers for each tone, but with different lengths, i.e. H. whole, half, quarter, eighth, sixteenth or thirty-second.
  • Still other, more sophisticated databases can also include identifiers for different game techniques, such as: B. vibrato, etc.
  • An advantage of the present invention is that the amplitude profile of a sound played by an instrument includes a very high degree of peculiarity for each instrument, so that a signal identifier based on the amplitude-time representation has a high degree of distinctive character with a reasonable amount of data .
  • essentially all tones of musical instruments can be classified into four phases, namely the attack phase, the decay phase, the sustain phase and the release phase, that is to say in a response, decay, endurance and decay , This makes it possible, particularly when polynomial fits are used, to divide or classify the polynomials into these four phases.
  • a piano tone has a very short pick-up phase, which is also followed by a very short decay phase, followed by a relatively long sustain and decay phase (when the piano pedal is depressed).
  • a wind instrument typically also has a very short pick-up phase, which, depending on the length of the tone played, is followed by a longer sustaining phase, which is concluded by a very short decay phase.
  • Similar characteristics See amplitude curves can be derived for a variety of different types of instruments and are either reflected directly in a fitted polynomial or "smeared" over a time window in the population numbers for discrete amplitude lines.
  • FIG. 1 is a block diagram representation of the inventive concept for generating an identifier for an audio signal
  • FIG. 2 shows a detailed illustration of the device for extracting an identifier for the audio signal from FIG. 1 according to an exemplary embodiment of the present invention
  • FIG. 3 shows a detailed illustration of the device for extracting an identifier for the audio signal from FIG. 1 according to another exemplary embodiment of the present invention
  • FIG. 4 is a block diagram representation of an apparatus for determining the type of an instrument in accordance with the present invention.
  • FIG. 5 shows an amplitude-time representation of an audio signal with a polynomial function drawn in, the coefficients of which represent the identifier for the audio signal;
  • Fig. 6 shows an amplitude-time representation of a test audio signal to illustrate the amplitude line population numbers
  • Fig. 7 is a frequency-time representation of an audio signal to illustrate the frequency line population numbers.
  • FIG. 1 shows a block diagram representation of a device or a method for generating an identifier for an audio signal.
  • An audio signal comprising a sound played by an instrument is present at an input 12 of the device.
  • This discrete amplitude-time representation is generated from the audio signal by means of a device 14 for generating a discrete amplitude-time representation.
  • the identifier for the audio signal is then output from this amplitude-time representation of the audio signal at an output 18, with which, as will be explained later, a musical instrument identification is possible.
  • the sound field specifically emitted by a musical instrument is preferably converted into an audio PCM signal sequence.
  • the signal sequence is then transferred according to the invention into an amplitude / time tuple space and preferably into a frequency / time tuple space.
  • Several representations or identifiers are formed from the amplitude / time tuple distribution and the (optional) frequency / time tuple distribution, which are compared with stored representations or identifiers in a musical instrument database. For this purpose, musical instruments are determined with high precision on the basis of their specifically characteristic amplitude characteristics.
  • the Hough transformation is preferably used to generate a discrete amplitude / time representation.
  • the Hough transformation is described in U.S. Patent No. 3,069,654 to Paul VC Hough.
  • the Hough transformation is used for the detection of complex structures and in particular for the automatic detection of complex lines in photographs or other image representations.
  • the Hough transform is used to extract signal edges with specified time lengths from the time signal.
  • a signal edge is initially specified by its length in time. In the ideal case of a sine wave, a signal edge would be defined by the rising edge of the sine function from 0 to 90 °. Alternatively, the signal edge could also be specified by the increase in the sine function from - 90 ° to + 90 °.
  • the time length of a signal edge takes into account the sampling frequency with which the samples were generated, corresponds to a certain number of sample values.
  • the length of a signal edge can thus be easily specified by specifying the number of samples that the signal edge is to comprise.
  • a signal edge as a signal edge only if the signal edge is continuous and has a monotonous course, that is to say has a monotonically increasing course in the case of a positive signal edge.
  • negative signal edges ie monotonically falling signal edges, can also be detected.
  • Another criterion for the classification of signal edges is that a signal edge is only detected as a signal edge if it covers a certain level range. In order to suppress noise disturbances, it is preferred to specify a minimum level range or amplitude range for a signal edge, wherein monotonically rising signal edges below this range are not detected as signal edges.
  • a sine function with a fixed frequency ⁇ c which is also referred to as center frequency, and a different amplitude A, which depends on the amplitude value yi of the current data point, is obtained.
  • the above function is calculated for angles from 0 to ⁇ / 2, and the amplitude values obtained for each angle are entered in a histogram in which the respective bin is increased by 1.
  • the start value of all bins is 0. Due to the nature of the Hough transformation, there are bins with many entries or few entries. Bins with multiple entries indicate a signal edge. These bins must now be searched for signal edge detection.
  • the graph 1 / A (phi) is plotted for each pair of values yi, ti in the (1 / A, phi) space.
  • the (1 / A, phi) space is made up of a discrete rectangular grid of histogram bins. Since the (1 / A, phi) space is rasterized in both 1 / A and phi in bins, the graph is plotted in the discrete representation by incrementing the bins by 1 that are swept by the graph.
  • an audio signal is present in a sequence of samples which has a sampling frequency of e.g. B. 44.1 kHz is based.
  • the individual samples (samples) are therefore 22.68 ⁇ s apart.
  • the center frequency for the above equation is set to 261 Hz in a preferred embodiment of the present invention.
  • This frequency f c always remains the same.
  • the period of this center frequency f c is 3.83 ms.
  • the ratio between the period duration, which is given by the center frequency f c , and the period duration, which is given by the sampling frequency of the audio signal, is thus 168.95.
  • the determination equation does not seek complete sine waves, however, but only signal edges that differ from z. B. 0 to ⁇ / 2 extend.
  • a signal edge corresponds here to a quarter wave of the sine, with yi at a time t j for each sample value .
  • about 42 discrete phase values or phase bins can be calculated.
  • the phase progress of The discrete phase value or bin to next is about 2.143 degrees or 0.0374.
  • the signal edge detection takes place as follows.
  • the first sample of the sequence of samples is started.
  • the value yi of the first sample at time ti is inserted into the determination equation together with time ti.
  • the phase ⁇ is run through from 0 to ⁇ / 2, using the increment phase described above, so that 42 value pairs result in the (1 / a, ⁇ ) space for the first sample.
  • the next sample value and the time (y 2 , t 2 ) assigned to it are taken into the determination equation, in order then to increment the phase ⁇ again from 0 to ⁇ / 2, so that 42 new values are again in the
  • Values are offset by a ⁇ value in the positive ⁇ direction. This is carried out gradually for all the sample values under consideration, the 1 / a- ⁇ tuples obtained for each new sample value being entered in the (1 / a, ⁇ ) space increased by one ⁇ increment.
  • the two-dimensional histogram thus results in that after an entry phase, which typically relates to the first 42 ⁇ values in the (1 / a, ⁇ ) space, a maximum of 42 1 / a values are assigned to each ⁇ value.
  • the (1 / a, ⁇ ) space is rasterized not only in ⁇ but also in 1 / a.
  • 31 1 / a bins or halftone dots are preferably used for the halftoning.
  • the 42 1 / a values, which are assigned to each phase value in the (1 / a, ⁇ ) space, are distributed depending on the trajectories calculated by the determination equation in
  • the ⁇ value following this reference ⁇ value indicates a time increment which is equal to the inverse of the sampling frequency on which the audio signal is based, that is to say 1/44, 1 kHz or 22, 68 ⁇ s.
  • the second ⁇ value after the reference ⁇ value then corresponds to a time of 2 x 22.68 ⁇ s or 45.36 ⁇ s etc.
  • the 100th ⁇ value after the reference ⁇ value would then be an absolute time (based on the specified time zero) of 2.268 ms.
  • the number of signal edges detected from the two-dimensional histogram can be set by selecting the nxm environment differently for the search for a local maximum. If a large neighborhood environment is chosen with regard to the amplitude quantization and the ⁇ quantization, fewer signal edges result than in the case where the neighborhood environment is chosen to be very small.
  • FIG. 2 shows a more detailed illustration of block 16 of FIG. 1, ie the device for extracting an identifier for the audio signal.
  • a polynomial function is adapted to the amplitude-time representation by means 26a.
  • a polynomial is used n-th order, wherein the n polynomial coefficients of the resulting polynomial used by a device 26b to obtain the advertising ⁇ the identifier for the audio signal.
  • the order n of the fit polynomial is chosen such that the residuals of the amplitude-time distribution for this polynomial order n become less than a predetermined threshold.
  • an order 10 polynomial was used. It can be seen that the polynomial with an order 10 already provides a good adaptation to the amplitude-time representation of the audio signal. A lower-order polynomial would very likely not be as good at the amplitude-time Representation follow, but would be easier to handle in database processing to identify the musical instrument with regard to the calculation in the database search. On the other hand, a polynomial of an even higher degree than degree 10 would span an even higher n-dimensional vector space than the audio signal identifier, which would make the instrument database calculation more complex.
  • the concept according to the invention is flexible in that polynomial orders of different heights can be selected for different applications.
  • FIG. 3 shows a more detailed block diagram of block 16 of FIG. 1 according to another embodiment of the present invention.
  • the population numbers of the discrete amplitude values of the amplitude-time representation are determined in a predetermined time window, in which case the identifier for the audio signal, as shown in a block 36b, is determined using the population numbers supplied by block 36a becomes.
  • FIG. 6 shows an amplitude-time representation for the tone ais 4 of an alto saxophone, which is played for a duration of about 0.7 s.
  • amplitude-time representation it is preferred to carry out an amplitude quantization.
  • Such an amplitude quantization on, for example, 31 discrete amplitude lines results from the selection of the bins in the Hough transformation.
  • the amplitude-time representation is obtained in a different way, it is advisable, in order to limit the amount of data for the signal identification, to carry out an amplitude line quantization which goes well beyond the quantization inherent in any digital arithmetic unit. From the diagram shown in FIG. 6, the number of amplitude values lying on this line can easily be calculated for each discrete amplitude line (an imaginary horizontal line through FIG. 6). will hold. This results in the population numbers for each amplitude line.
  • the amplitude / time tuples are due to the transformation process on a discrete grid, formed by a plurality of amplitude levels which can be specified as amplitude lines at certain amplitude distances from one another.
  • a characteristic of every musical instrument is how many lines are occupied, which lines are occupied, and the respective population numbers.
  • the number of populations of each line given by the number of amplitude / time tuples of the same amplitude in a time interval of a certain length, is counted. These population numbers alone could already be used as a signal identifier.
  • These population number ratios n0: nl, n0: n2, nl: n2, ... are no longer dependent on the absolute amplitude, but merely provide the relation of the individual amplitude levels to one another.
  • the population number ratios are determined in a window of predetermined length. By specifying the window length and dividing the population number ratios by the window length, the population density (number of entries / window length) is formed for each amplitude line.
  • the population density is determined over the entire time axis by a sliding window of length h and a step size m.
  • the population density numbers are also preferably standardized by relating the numbers to the window length and the pitch. In particular in the case where the amplitude / time tuples are determined on the basis of a signal edge detection by means of the Hough transformation, the higher the pitch, the higher the number of amplitude values in a window of a certain length.
  • the population density number normalization to the pitch eliminates this dependency, so that normalized positions Pulse density numbers of different tones can be compared.
  • the standard deviation of the amplitude spectrum around the mean amplitude is determined by the amplitude / time tuple space.
  • the standard deviation indicates how strongly the amplitudes scatter around the mean amplitude.
  • the amplitude standard deviation is a specific measure and therefore a specific identifier for each musical instrument.
  • the scatter indicates how strongly the amplitudes scatter around the amplitude standard deviation.
  • the amplitude spread is a specific measure and therefore a specific identifier for each musical instrument.
  • FIGS. 1 to 3 leads to deriving from an audio signal, which comprises a tone of an instrument, an identifier which is characteristic of the instrument from which the tone originates.
  • This identifier can be used for various things, as will be explained with reference to FIG. 4.
  • various reference identifiers 40a, 40b can be stored in an instrument database in association with the instrument from which the respective reference identifier originates.
  • a test identifier is generated from a test audio signal by a test instrument by means of a device 42, which will in principle be constructed as shown in FIGS. 1 to 3.
  • the test identifier is then compared to the reference identifiers using various database algorithms known in the art, for musical instrument identification.
  • the instrument database can be equipped in various ways. Basically, the musical instrument database is derived from a collection of tones that have been recorded by various musical instruments. For each musical instrument, a set of tones is recorded in semitone levels starting from a lowest to a highest tone. An amplitude / time tuple space distribution and optionally a frequency / time tuple space distribution is created for each tone of the musical instrument. For each musical instrument, a set of amplitude / time tuple spaces is generated over the entire tonal range of the musical instrument, starting from the lowest tone in semitone steps up to the highest tone.
  • the musical instrument database is formed from all the amplitude / time tuple spaces and frequency / time tuple spaces of the recorded musical instruments stored in the database.
  • it is preferred to create several identifiers (polynomial coefficients on the one hand or population density sizes on the other hand or both types together) for each tone of a musical instrument namely for a thirty-second note, a sixteenth note, an eighth note, a quarter note, a half note and a whole note, the note lengths being averaged over the duration of the tone for each instrument.
  • the set of polynomial curves over the entire pitch and length of an instrument represents the musical instrument in the database.
  • various playing techniques for a musical instrument are also optionally stored in the music database.
  • a played tone of an initially unknown musical instrument is converted into an amplitude / time tuple distribution in the amplitude / time tuple space and (optionally) a frequency / time tuple distribution in the frequency / time tuple space.
  • the pitch of the tone is then preferably determined from the frequency / time tuple space.
  • a database comparison is then only carried out using the reference identifiers which relate to the pitch determined for the test audio signal.
  • the residual to the test identifier is determined for each of the reference identifiers.
  • the residual minimum that results when comparing all reference identifiers with the test identifier is assumed as an indication of the presence of the musical instrument represented by the test identifier.
  • the identifier spans an n-dimensional vector space, in particular in the case of the polynomial coefficients, whose n-dimensional distance from the n-dimensional vector space of a reference identifier can be calculated not only qualitatively but also quantitatively.
  • a similarity criterion could then be that the residual, ie the n-dimensional distance of the test identifier from the reference identifier, is minimal (in comparison to the other reference identifiers) or that the residual is smaller than a predetermined threshold .
  • the polynomial fit is related to a fixed reference starting point. Therefore, the first signal edge of an audio signal is set as the reference start point of the polynomial curve.
  • the reference start edge for the polynomial curve is set after a change in pitch and the reference start point is placed in the transition between two pitches. If the change in pitch cannot be determined, the unknown distribution is generally “pulled” over the entire set of all reference identifiers in the instrument database by always shifting the test identifier by a certain step against the reference identifier.
  • FIG. 5 shows a polynomial fit of an order 10 polynomial for a vibrato-played flute tone from the standard work McGill's Master Samples Reference CD.
  • the tone is ais 5.
  • the distance of the polyno minima after the transient process immediately gives the vibrato in Hertz of the instrument.
  • a tone-on phase 50, a hold phase 51 and a decay phase 52 are shown for each tone.
  • the ringing phase 50 and the ringing phase 52 are relatively short.
  • the decay phase of a piano tone would be rather long, which means that the characteristic amplitude profile of a piano tone can be distinguished from the characteristic amplitude profile of a flute.
  • a frequency-time representation can also be used in addition to the amplitude-time representation can be used to complement musical instrument recognition.
  • 7 shows the frequency population numbers for an alto saxophone, specifically for the tone ais 4 (in American notation), which is played for a duration of 0.7 s, which corresponds to a duration of approximately 34,000 PCM samples with a recording frequency of 44.1 kHz.
  • the broad line in Fig. 7 indicates that the ais 4 was played at 466 Hz.
  • the frequency-time distribution and the amplitude-time distribution of FIGS. 7 and 6 correspond to one another, ie represent the same tone.
  • the frequency-time distribution can also be used to determine the fundamental tone line resulting for each musical instrument, which indicates the frequency of the tone played.
  • the fundamental tone line is used to determine whether the tone lies within the range of the tone that can be generated by the musical instrument, and then to select only those representations in the music database at the same pitch.
  • the frequency-time distribution can therefore be used to perform a pitch determination.
  • frequency-time distribution can also be used to improve musical instrument identification.
  • the standard deviation around the fundamental tone line is determined in the frequency / time tuple space.
  • the standard deviation indicates how strongly the frequency values scatter around the middle frequency.
  • the standard deviation is a specific measure for each musical instrument.
  • Bach trumpet and violin have z. B. a high standard deviation.
  • the frequency / time tuple space scattering is determined by the Stan ⁇ deviation.
  • the scatter indicates how strongly the frequency values scatter around the standard deviation.
  • the scatter is a specific measure for each musical instrument.
  • the frequency / time tuples are due to the transformation process on a discrete grid, formed by several frequency lines at certain frequency intervals. A characteristic of every musical instrument is how many frequencies are occupied, which lines are occupied and the respective population number. Many musical instruments have characteristic frequency / time tuple distributions. In addition to the fundamental tone line, there are other distinct frequency lines or frequency ranges. Instruments with characteristic frequency lines and frequency ranges are e.g. B. Violin, oboe, trumpet and saxophone.
  • a frequency spectrum is formed for each tone by counting the population numbers of the frequency lines.
  • the frequency spectrum of the unknown distribution is compared with all frequency spectra. If the comparison yields a maximum agreement, it is assumed that the closest frequency spectrum represents the musical instrument.
  • the oboe oscillates in two frequency modes so that two frequency lines are defined at a defined frequency spacing. If these two frequency lines are pronounced, the frequency / time tuple distribution is most likely due to an oboe.
  • Several musical instruments have population states in a group of adjacent frequency lines that define a fixed frequency range above the fundamental tone line at a defined frequency spacing.
  • the cor accentuate oscillates frequency-modulated cyclically between two opposite frequency arcs.
  • the English horn is detected by the cyclic frequency modulation.
  • the CD is a sound archive of recorded musical instrument notes over the entire range of an instrument in semitone steps.
  • the amplitude-time representation was used, a tuple in the amplitude-time representation representing the amplitude of a signal edge found at time t, preferably of the Hough transformation.
  • a frequency-time representation is also used, a tuple in the frequency-time representation indicating the frequency of two successive signal edges at the time of occurrence.
  • a frequency amplitude scatter representation can optionally also be used in order to use further information for instrument recognition.
  • the scatter representation the amplitude versus frequency scatter is plotted, resulting in a dumbbell or club shape, which is also characteristic of the instrument.
  • the attack phase and the decay phase are expanded to strip bands.
  • the amplitude-time display shows a typical ADSR envelope with a very short attack phase and a steep-sided, wide decay band.
  • the sound recording of Violin Natural Harmonics Ton b5 987 Hz in the analysis shows a greater frequency spread at the beginning and at the end.
  • the amplitude-time representation shows a broad attack band, a transition to a broad decay band and a rise again in the sustain phase, with the scatter representation showing a relatively large spread. If the tone g6 is played on a Bach trumpet with a frequency of 1568 Hz, there is a high standard deviation, which is time-dependent at the beginning and at the end and widened at the end.
  • the amplitude-time representation shows a typical ADSR curve with a steep attack phase and a modulated decay phase up and down.
  • the bassoon shows a typical ADSR envelope for wind instruments with an attack phase and a transition to the sustain phase and an abrupt termination, i.e. H . an abrupt release phase.
  • the soprano saxophone shows a small standard deviation with its tone a5 with a frequency of 880 Hz.
  • tone With regard to the amplitude-time representation, there is an immediate transition to steady-state (sustain), with the occupation states being time-dependent.
  • a piccolo flute is played with a tone g7 at 3136 Hz, the frequency fundamental tone line can be seen, although there are very many subharmonics.
  • the amplitude-time representation shows an immediate transition to steady state, with the occupation states being time-dependent.
  • the scatter display shows a widely distributed characteristic.
  • the bass trombone shows a clear fundamental frequency line when its tone e3 is played at 164 Hz and shows a slow rise to steady state in the amplitude-time representation.
  • the bass clarinet, tone c3, 130 Hz again shows a pronounced fundamental frequency line and an additional frequency band between 800 and 1200 Hz.
  • the amplitude-time representation shows a steady state with large amplitude fluctuations. Pronounced dumbbells appear in the scatter display.
  • the cor accentuate which belongs to the oboe family, does not show a pronounced fundamental frequency line when the tone e5 is played at 659 Hz, but shows frequency modulation between two frequency modes.
  • the steady-state phase in the amplitude-time representation is time-dependent. Several secondary lines are shown in the scatter display.
  • the tone cis5, 554 Hz, played by a French horn shows two frequency lines, which makes it impossible to determine the fundamental frequency clearly. There is an oscillation between two frequency modes.
  • the amplitude-time representation shows a typical attack phase and a typical steady-state for wind instruments.
  • the frequency determination is carried out before the amplitude-time representation determination in order to narrow the search space in a database, since before the individual instrument is determined, the sound played per se, i.e. the present pitch is determined. Then all you have to do in the database is search through the group of entries relating to the particular tone.

Landscapes

  • Physics & Mathematics (AREA)
  • Engineering & Computer Science (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Auxiliary Devices For Music (AREA)
  • Information Retrieval, Db Structures And Fs Structures Therefor (AREA)
  • Electrophonic Musical Instruments (AREA)
  • Measurement Of Mechanical Vibrations Or Ultrasonic Waves (AREA)

Description

VERFAHREN UND VORRICHTUNG ZUM ERZEUGEN EINER KENNUNG
FÜR EIN AUDIOSIGNAL, VERFAHREN UND VORRICHTUNG
ZUM AUFBAUEN EINER INSTRUMENTENDATENBANK UND
VERFAHREN UND VORRICHTUNG ZUM BESTIM- MEN DER ART EINES INSTRUMENTS
BESCHREIBUNG
Die vorliegende Erfindung bezieht sich auf Audiosignale und insbesondere auf die akustische Identifikation von Musikinstrumenten, deren Töne in dem Audiosignal auftreten.
Im Zuge der Nutzbarmachung weit verbreiteter Musikdatenban- ken für eine Recherche in denselben besteht oftmals der Wunsch, festzustellen, von welchem Musikinstrument ein Ton erzeugt worden ist, der in einem Audiosignal enthalten ist. So könnte beispielsweise der Wunsch bestehen, eine Musikdatenbank zu durchsuchen, um die Stücke aus der Musikdaten- bank herauszufinden, in denen z. B. eine Trompete oder ein Altsaxophon vorkommt.
Bekannte Verfahren zur Musikinstrumentenerkennung basieren auf Frequenzauswertungen. Hier werden die verschiedenen Mu- sikinstrumente nach ihren Obertönen bzw. nach ihrem spezifischen Obertonspektrum klassifiziert. Ein solches Verfahren ist in B. Kostek, A. Czyzewski, „Representing Musical Instrument Sounds for Their Automatic Classification", J. Audio Eng. Soc, Bd. 49, No. 9, September 2001, zu finden.
Musikinstrumentenerkennungsverfahren, die auf einer Frequenzdarstellung aufbauen, um Musikinstrumente zu erkennen, haben den Nachteil, daß viele Musikinstrumente nicht erkannt werden, da das charakteristische Spektrum, das von einem Musikinstrument erzeugt wird, möglicherweise ein zu gering unterscheidungskräftiger „Fingerabdruck" des Musikinstruments ist. Die Aufgabe der vorliegenden Erfindung besteht darin, ein Konzept zu schaffen, durch das eine präzisere Musikinstrumentenerkennung ermöglicht wird.
Diese Aufgabe wird durch ein Verfahren und eine Vorrichtung zum Erzeugen einer Kennung für ein Audiosignal gemäß Patentanspruch 1 bzw. 21, durch ein Verfahren und eine Vorrichtung zum Aufbauen einer Instrumenten-Datenbank gemäß Patentanspruch 15 bzw. 22 oder durch ein Verfahren und eine Vorrichtung zum Bestimmen der Art eines Instruments gemäß Patentanspruch 20 oder 23 gelöst.
Der vorliegenden Erfindung liegt die Erkenntnis zugrunde, daß die Amplituden-Zeit-Darstellung eines Tons, der von ei- nem Instrument erzeugt wird, ein wesentlich aussagefähige¬ rer Fingerabdruck als das Oberton-Spektrum eines Instruments ist. Erfindungsgemäß wird daher eine Kennung eines Audiosignals, das einen von einem Instrument erzeugten Ton umfaßt, aus einer Amplituden-Zeit-Darstellung des Audiosig- nals extrahiert. Die Amplituden-Zeit-Darstellung des Audiosignals ist eine diskrete Darstellung, wobei die Amplituden-Zeit-Darstellung für eine Mehrzahl von aufeinanderfolgenden Zeitpunkten eine Mehrzahl von aufeinanderfolgenden Amplitudenwerten oder „Samples" aufweist, wobei jedem Amp- litudenwert ein Zeitpunkt zugeordnet ist.
Wenn mit der auf der Amplituden-Zeit-Darstellung des Audiosignals basierenden Kennung eine Instrumenten-Datenbank aufgebaut wird, bei der jeder Kennung eine Instrumentenart zugeordnet ist, so können die Kennungen in der Instrumenten-Datenbank als Referenzkennungen zur Musikinstrumentenidentifikation eingesetzt werden. Hierzu wird ein Test- Audiosignal, das einen Ton eines Instruments umfaßt, dessen Art bestimmt werden soll, verarbeitet, um eine Test-Kennung für das Test-Audiosignal zu erhalten. Die Test-Kennung wird mit den in der Datenbank vorhandenen Referenz-Kennungen verglichen. Wird ein vorbestimmtes Ähnlichkeitskriterium zwischen der Testkennung und zumindest einer Referenz- Kennung erfüllt, so kann die Aussage getroffen werden, daß das Instrument, von dem das Test-Audiosignal stammt, von der Instrumentenart ist, von der die Referenz-Kennung stammt, die das vorbestimmte Ähnlichkeitskriterium erfüllt.
Bei einem bevorzugten Ausführungsbeispiel der vorliegenden Erfindung wird die Kennung, sei es Test- oder Referenz- Kennung, aus der Amplituden-Zeit-Darstellung derart extrahiert, daß ein Polynom an die Amplituden-Zeit-Darstellung angepaßt wird, wobei die Polynom-Koeffizienten aik (i = 1, ... , n) des Ergebnis-Polynoms k einen n-dimensionalen Vektorraum aufspannen, der die Kennung für das Audiosignal darstellt. Damit kann günstigerweise eine Abstandsmetrik eingeführt werden, durch die eine sog. Nearest-Neighbor- Suche der Form minι{a0i - a0refr •■•/ (ani - anref) } durchge¬ führt werden kann.
Bei einem bevorzugten alternativen Ausführungsbeispiel der vorliegenden Erfindung wird keine Polynomanpassung einge- setzt, sondern es werden die Populationszahlen der diskreten Amplitudenlinien in einem Zeitfenster ermittelt und dazu verwendet, eine Kennung für das Audiosignal bzw. für das Musikinstrument, von dem das Audiosignal stammt, zu ermitteln.
Generell wird ein Kompromiß zwischen Datenumfang der Kennung und Spezifizität bzw. Eigenartigkeit der Kennung für eine Musikinstrumentenart anzustreben sein. So hat eine Kennung mit einem großen Dateninhalt typischerweise eine bessere Unterscheidungskraft bzw. ist ein spezifischerer Fingerabdruck für ein Instrument, bringt jedoch aufgrund des großen Dateninhalts Probleme bei der Datenbankauswertung mit sich. Andererseits hat eine Kennung mit geringerem Dateninhalt tendenziell eine geringere Unterscheidungs- kraft, ermöglicht jedoch eine wesentlich effizientere und schnellere Verarbeitung bei einer Instrumenten-Datenbank. Je nach Anwendungsfall wird daher ein eigener Kompromiß zwischen Datenmenge der Kennung und Unterscheidungskraft der Kennung anzustreben sein.
Dasselbe trifft für die Art und Weise der Ausgestaltung der Instrumenten-Datenbank zu. Dem Benutzer steht es frei, sehr ausgefeilte Datenbanken anzulegen, die für eine beliebig große Anzahl von Instrumenten eine beliebig große Anzahl von Tönen und - optimalerweise - jeden Ton des von dem einzelnen Instrument erzeugbaren Tonumfangs umfassen. Weiter ausgefeilte Datenbanken können eigene Kennungen auch für jeden Ton, jedoch mit unterschiedlicher Länge, d. h. als Ganze, Halbe, Viertel, Achtel, Sechzehntel oder Zweiunddreißigstel, umfassen. Wieder andere, noch ausgefeiltere Datenbanken, können auch Kennungen für verschiedene Spiel- techniken umfassen, wie z. B. Vibrato, etc.
Ein Vorteil der vorliegenden Erfindung besteht darin, daß der Amplitudenverlauf eines von einem Instrument gespielten Tons eine sehr hohe Eigenartigkeit für jedes Instrument u - faßt, so daß eine Signalkennung, die auf der Amplituden- Zeit-Darstellung basiert, eine hohe Unterscheidungskraft bei vertretbarem Datenumfang aufweist. Darüber hinaus sind im wesentlichen alle Töne von Musikinstrumenten in vier Phasen zu klassifizieren, nämlich in die Attack-Phase, in die Decay-Phase, in die Sustain-Phase und in die Release- Phase, d. h. in ein Anklingen, Abklingen, Aushalten und Ausklingen. Dies ermöglicht es insbesondere dann, wenn Po- lynomfits verwendet werden, die Polynome in diese vier Phasen aufzuteilen bzw. zu klassifizieren. Lediglich der An- schaulichkeit halber hat beispielsweise ein Klavierton eine sehr kurze Anklingphase, der eine ebenfalls sehr kurze Abkling-Phase folgt, an die sich eine relativ lange Aushalte- und Auskling-Phase anschließt (wenn das Pedal des Klaviers gedrückt ist) . Dagegen hat ein Blasinstrument typi- scherweise ebenfalls eine sehr kurze Anklingphase, der jedoch abhängig von der Länge des gespielten Tons eine längere Aushalte-Phase folgt, die von einer sehr kurzen Auskling-Phase abgeschlossen wird. Ähnliche charakteristi- sehe Amplitudenverläufe sind für eine Vielzahl unterschiedlicher Instrumentenarten ableitbar und schlagen sich entweder direkt in einem gefitteten Polynom oder „verschmiert" über ein Zeitfenster in den Populationszahlen für diskrete Amplitudenlinien nieder.
Bevorzugte Ausführungsbeispiele der vorliegenden Erfindung werden nachfolgend bezugnehmend auf die beiliegenden Zeichnungen näher erläutert. Es zeigen:
Fig. 1 eine Blockdiagrammdarstellung des erfindungsgemäßen Konzepts zum Erzeugen einer Kennung für ein Audiosignal;
Fig. 2 eine Detaildarstellung der Einrichtung zum Extrahieren einer Kennung für das Audiosignal von Fig. 1 gemäß einem Ausführungsbeispiel der vorliegenden Erfindung;
Fig. 3 eine Detaildarstellung der Einrichtung zum Extrahieren einer Kennung für das Audiosignal von Fig. 1 gemäß einem anderen Ausführungsbeispiel der vorliegenden Erfindung;
Fig. 4 eine Blockdiagrammdarstellung einer Vorrichtung zum Bestimmen der Art eines Instruments gemäß der vorliegenden Erfindung;
Fig. 5 eine Amplituden-Zeit-Darstellung eines Audiosig- nals mit einer eingezeichneten Polynomfunktion, deren Koeffizienten die Kennung für das Audiosig- nal darstellen;
Fig. 6 eine Amplituden-Zeit-Darstellung eines Test- Audiosignals zur Veranschaulichung der Amplitudenlinien-Populationszahlen; und Fig. 7 eine Frequenz-Zeit-Darstellung eines Audiosignals zur Veranschaulichung der Frequenzlinien- Populationszahlen .
Fig. 1 zeigt eine Blockschaltbilddarstellung einer Vorrichtung bzw. eines Verfahrens zum Erzeugen einer Kennung für ein Audiosignal. Ein Audiosignal, das einen von einem Instrument gespielten Ton umfaßt, liegt an einem Eingang 12 der Vorrichtung an. Aus dem Audiosignal wird mittels einer Einrichtung 14 zum Erzeugen einer diskreten Amplituden- Zeit-Darstellung diese diskrete Amplituden-Zeit-Darstellung erzeugt. Mittels einer Einrichtung 16 wird dann aus dieser Amplituden-Zeit-Darstellung des Audiosignals an einem Ausgang 18 die Kennung für das Audiosignal ausgegeben, mit der, wie es später ausgeführt wird, eine Musikinstrumentenidentifikation möglich ist.
Zur Identifikation von Musikinstrumenten wird somit das von einem Musikinstrument spezifisch charakteristisch emittier- te Schallfeld vorzugsweise in eine Audio-PCM-Signalfolge gewandelt. Die Signalfolge wird dann erfindungsgemäß in einen Amplitude/Zeit-Tupelraum und vorzugsweise in einen Fre- quenz/Zeit-Tupelraum überführt. Aus der Amplitude/Zeit- Tupelverteilung und der (optionalen) Frequenz/Zeit- Tupelverteilung werden mehrere Repräsentationen oder Kennungen gebildet, die mit gespeicherten Repräsentationen bzw. Kennungen in einer Musikinstrumenten-Datenbank verglichen werden. Hierzu werden Musikinstrumente anhand ihrer spezifisch charakteristischen Amplituden-Charakteristika mit hoher Präzision bestimmt.
Zur Erzeugung einer diskreten Amplituden/Zeit-Darstellung wird vorzugsweise die Hough-Transformation verwendet. Die Hough-Transformation ist in dem U.S. -Patent Nr. 3,069,654 von Paul V. C. Hough beschrieben. Die Hough-Transformation dient zur Erkennung von komplexen Strukturen und insbesondere zur automatischen Erkennung von komplexen Linien in Photographien oder anderen Bilddarstellungen. In ihrer An- wendung gemäß der vorliegenden Erfindung wird die Hough- Transformation dazu verwendet, um aus dem Zeitsignal Signalflanken mit spezifizierten zeitlichen Längen zu extrahieren. Eine Signalflanke wird zunächst durch ihre zeitliche Länge spezifiziert. Im Idealfall einer Sinuswelle wäre eine Signalflanke durch die ansteigende Flanke der Sinusfunktion von 0 bis 90° definiert. Alternativ könnte die Signalflanke auch durch den Anstieg der Sinus-Funktion von - 90° bis +90° spezifiziert sein.
Liegt das Zeitsignal als Folge von zeitlichen Abtastwerten vor, so entspricht die zeitliche Länge einer Signalflanke unter Berücksichtigung der Abtastfrequenz, mit der die Sam- ples erzeugt worden sind, einer bestimmten Anzahl von Ab- tastwerten. Die Länge einer Signalflanke kann somit ohne weiteres durch Angabe der Anzahl der Abtastwerte, die die Signalflanke umfassen soll, spezifiziert werden.
Darüber hinaus wird es bevorzugt, eine Signalflanke nur dann als Signalflanke zu detektieren, wenn dieselbe stetig ist und einen monotonen Verlauf hat, also im Falle einer positiven Signalflanke einen monoton steigenden Verlauf hat. Selbstverständlich können auch negative Signalflanken, also monoton fallende Signalflanken detektiert werden.
Ein weiteres Kriterium zur Klassifizierung von Signalflanken besteht darin, daß eine Signalflanke nur dann als Signalflanke detektiert wird, wenn sie einen bestimmten Pegelbereich überstreicht. Um Rauschstörungen auszublenden, wird es bevorzugt, für eine Signalflanke einen minimalen Pegelbereich oder Amplitudenbereich vorzugeben, wobei monoton steigende Signalflanken unterhalb dieses Bereichs nicht als Signalflanken detektiert werden.
In anderen Worten ausgedrückt, wird die Hough- Transformation folgendermaßen eingesetzt. Für jedes Wertepaar yi, ti des Audiosignals wird die Hough-Transformation nach folgender Vorschrift durchgeführt: 1/A = 1/yι * sin(ωc tj. - φ) .
Somit erhält man für jeden Datenpunkt (y , t±) eine Sinus- funktion mit fester Frequenz ωc, die auch als Center- Frequency bezeichnet wird, und unterschiedlicher Amplitude A, die von dem Amplitudenwert yi des aktuellen Datenpunkts abhängt. Die obige Funktion wird für Winkel von 0 bis π/2 berechnet, und die für jeden Winkel erhaltenen Amplituden- werte werden in ein Histogramm eingetragen, in dem das jeweilige Bin um 1 erhöht wird. Der Startwert aller Bins ist 0. Aufgrund der Eigenschaft der Hough-Transformation gibt es Bins mit vielen Einträgen bzw. wenigen Einträgen. Bins mit mehreren Einträgen deuten auf eine Signalflanke hin. Zur Signalflankendetektion müssen diese Bins nun gesucht werden.
Nach der Vorschrift wird der Graph 1/A(phi) für jedes Wertepaar yi, ti im (1/A, phi)-Raum aufgetragen. Der (1/A, phi)-Raum ist aus einem diskreten rechteckigen Raster von Histogrammbins aufgebaut. Da der (1/A, phi)-Raum sowohl in 1/A als auch in phi in Bins gerastert ist, wird der Graph in der diskreten Darstellung aufgetragen, indem diejenigen Bins um 1 inkrementiert werden, die vom Graph überstrichen werden.
Schneiden sich mehrere Graphen aufgrund der Hough- Transformationsvorschrift in einem Bin, ergeben sich Häufungspunkte und ein 2D-Histrogramm bildet sich heraus, in dem hohe Histogrammeinträge in dem Bin angeben, daß eine Signalflanke zur Zeit t mit der Amplitude A vorgelegen hat, wobei die Amplitude aus dem Amplitudenindex des Bins und die Auftrittszeit aus dem Zeitindex des Bins berechnet wird. Aus dem Histogramm wird in einer n x m Nachbar- Schaftsumgebung das lokale Maximum herausgesucht, und die Indizes des gefundenen lokalen Maximums geben nach Umrechnung in den kontinuierlichen Raum (A, phi) die Amplitude A und den Auftrittszeitpunkt t an. Diese Werte sind in den Beispielen als Ai(ti)-Tupel aufgetragen.
Im nachfolgenden wird ein Zahlenbeispiel für die Signal- flankendetektion, die vorstehend allgemein erläutert worden ist, gegeben. Typischerweise liegt ein Audiosignal in einer Folge von Abtastwerten vor, der eine Abtastfrequenz von z. B. 44,1 kHz zugrunde liegt. Die einzelnen Abtastwerte (Sam- ples) haben damit einen zeitlichen Abstand von 22,68 μs .
Die Center-Frequency für die vorstehend genannte Bestimmungsgleichung wird bei einem bevorzugten Ausführungsbeispiel der vorliegenden Erfindung auf 261 Hz eingestellt. Diese Frequenz fc bleibt immer gleich. Die Periode dieser Center-Frequency fc beträgt 3,83 ms. Damit beträgt das Ver- hältnis zwischen der Periodendauer, die durch die Center- Frequency fc gegeben ist, und der Periodendauer, die durch die Abtastfrequenz des Audiosignals gegeben ist, 168,95.
Wenn die vorstehende Bestimmungsgleichung zur Signalflan- kendetektion gemäß einem bevorzugten Ausführungsbeispiel der vorliegenden Erfindung betrachtet wird, so ergibt sich, daß für die vorstehend genannten Zahlenwerte, wenn die Phase φ von 0 bis 2 π inkrementiert wird, 168,95 Phasenwerte durchlaufen werden.
Wie es vorstehend ausgeführt worden ist, werden durch die Bestimmungsgleichung jedoch keine kompletten Sinuswellen gesucht, sondern lediglich Signalflanken, die sich von z. B. 0 bis π/2 erstrecken. Eine Signalflanke entspricht hier einer Viertelwelle des Sinus, wobei für jeden Abtastwert yi zu einem Zeitpunkt tj. etwa 42 diskrete Phasenwerte bzw. Phasen-Bins berechnet werden. Der Phasenfortschritt von ei- nem diskreten Phasenwert oder Bin zum nächsten liegt hier bei etwa 2,143 Grad oder 0,0374 beträgt.
Im einzelnen findet die Signalflankendetektion folgenderma- ßen statt. Es wird mit dem ersten Abtastwert der Folge von Abtastwerten begonnen. Der Wert yi des ersten Abtastwerts zum Zeitpunkt ti wird zusammen mit dem Zeitpunkt ti in die Bestimmungsgleichung eingesetzt. Dann wird die Phase φ von 0 bis π/2 durchlaufen, und zwar unter Verwendung der oben beschriebenen Inkrementphase, so daß sich für den ersten Abtastwert 42 Wertepaare im (1/a, φ) -Raum ergeben. Daraufhin wird der nächste Abtastwert und der demselben zugeordnete Zeitpunkt (y2, t2) genommen, in die Bestimmungsgleichung eingesetzt, um dann die Phase φ wieder von 0 bis π/2 zu inkrementieren, so daß sich wiederum 42 neue Werte im
(1/a, φ) -Raum ergeben, die jedoch bezüglich der ersten 42
Werte um einen φ-Wert in positiver φ-Richtung versetzt sind. Dies wird für sämtliche betrachteten Abtastwerte nach und nach durchgeführt, wobei für jeden neuen Abtastwert die erhaltenen 1/a-φ-Tupel um ein φ-Inkrement erhöht in den (1/a, φ) -Raum eingetragen werden. Damit ergibt sich das zweidimensionale Histogramm, dahingehend, daß nach einer Eintrittsphase, die typischerweise die ersten 42 φ-Werte im (1/a, φ) -Raum betrifft, jedem φ-Wert maximal 42 1/a-Werte zugeordnet sind.
Wie es ausgeführt worden ist, ist der (1/a, φ) -Raum nicht nur in φ sondern auch in 1/a gerastert. Hierzu werden vorzugsweise 31 1/a-Bins oder Rasterpunkte für die Rasterung verwendet. Die 42 1/a-Werte, die jedem Phasen-Wert im (1/a, φ) -Raum zugeordnet sind, verteilen sich abhängig von den durch die Bestimmungsgleichung berechneten Trajektorien im
(1/a, φ) -Raum gleichmäßig oder ungleichmäßig. Findet eine gleichmäßige Verteilung statt, so ist diesem φ-Wert keine Signalflanke zugeordnet. Ist jedoch einem bestimmten φ-Wert eine ungleichmäßige Verteilung der Histogrammeinträge bei einem bestimmten 1/a-Wert zugeordnet, wobei dieser Wert auch bezüglich eines oder mehrerer Nachbar-φ-Werte ein lo- kales Maximum ist, so deutet dies auf eine Signalflanke mit einer Amplitude hin, die gleich den Inversen des 1/a- Rasterpunkt ist. Der Auftrittszeitpunkt ergibt sich unmittelbar aus dem entsprechenden φ-Wert, bei dem die ungleich- mäßige Verteilung zugunsten eines bestimmten 1/a-Bins stattgefunden hat. Prinzipiell kann der Auftrittszeitpunkt beliebig skaliert werden, da eine solche Skalierung sämtliche detektierten Signalflanken gleichermaßen betrifft.
Bei einem bevorzugten Ausführungsbeispiel der vorliegenden Erfindung wird es jedoch bevorzugt, die ersten 41 φ-Werte unberücksichtigt zu lassen und den 42-ten φ-Wert als Referenzzeitpunkt (t = 0) zu definieren. Der diesem Referenz-φ- Wert, der t = 0 entspricht, folgende φ-Wert deutet dann auf ein Zeitinkrement hin, das gleich dem Inversen der Abtastfrequenz, die dem Audiosignal zugrunde liegt, ist, also 1/44, 1 kHz oder 22,68 μs . Der zweite φ-Wert nach dem Referenz-φ-Wert entspricht dann einem Zeitpunkt von 2 x 22,68 μs oder 45,36 μs etc. Der beispielsweise 100-ste φ-Wert nach dem Referenz-φ-Wert würde dann einer absoluten Zeit (bezogen auf den festgelegten Zeitnullpunkt) von 2,268 ms entsprechen. Hätte das zweidimensionale Histogramm im (1/a, φ)-Raum zu diesem 100-sten Phasenwert nach dem Referenz- Phasenwert ein lokales Maximum hinsichtlich einer n x m- Nachbarschaftsumgebung, die je nach Bedarf gewählt werden kann, so würde eine Signalflanke detektiert sein, die einerseits durch den 1/a-Bin, in dem die Häufung ist, hinsichtlich ihrer Amplitude definiert ist, und die den dem 100-sten φ-Wert nach dem Referenz-φ-Wert zugeordneten Auf- trittszeitpunkt von beispielsweise 2,268 ms hat. Das Amplituden-Zeit-Diagramm von Fig. 5 enthält eine Folge von solchermaßen detektierten Signalflanken im Amplituden-Zeit- Raum, der durch die entsprechende Umrechnung für die Amplitude (Inversion) und die Zeit (Zuordnung von Zeit zu Pha- se) dem (1/a, φ) -Raum entspricht, wobei jedoch auch hier eine wesentliche Datenreduktion durch die lokale Maximumbildung in dem (1/a, φ)-Raum stattfindet. Aus den vorstehenden Ausführungen ist zu sehen, daß die Anzahl der aus dem zweidimensionale Histogramm detektierten Signalflanken dadurch einstellbar ist, daß die nxm-Umgebung für die Suche nach einem lokalen Maximum unterschiedlich gewählt wird. Wird eine große Nachbarschaftsumgebung hinsichtlich der Amplitudenquantisierung und der φ- Quantisierung gewählt, so ergeben sich weniger Signalflanken als in dem Fall, bei dem die Nachbarschaftsumgebung sehr klein gewählt wird. Auch hieraus zeigt sich die gute Skalierbarkeitseigenschaft des erfindungsgemäßen Konzepts, da sich viele Signalflanken unmittelbar in einer besseren Kennzeichnungskraft der letztendlich extrahierten Kennung niederschlagen, da jedoch auch die Länge bzw. der Speicherbedarf dieser Kennung zunimmt. Andererseits führen weniger Signalflanken typischerweise zu einer kompakteren Kennung, wobei jedoch ein Verlust an Kennzeichnungskraft auftreten kann.
Fig. 2 zeigt eine detailliertere Darstellung des Blocks 16 von Fig. 1, d. h. der Einrichtung zum Extrahieren einer Kennung für das Audiosignal. Ausgehend von der Amplituden- Zeit-Darstellung wird, wie es in Fig. 2 gezeigt ist, durch eine Einrichtung 26a eine Polynomfunktion an die Amplituden-Zeit-Darstellung angepaßt. Hierzu wird ein Polynom n- ter Ordnung verwendet, wobei die n Polynomkoeffizienten des Ergebnis-Polynoms durch eine Einrichtung 26b verwendet wer- den, um die Kennung für das Audiosignal zu erhalten. Die Ordnung n des Fit-Polynoms wird so gewählt, daß die Residuen der Amplituden-Zeit-Verteilung für diese Polynomordnung n kleiner als eine vorbestimmte Schwelle werden.
So wurde beispielsweise bei dem in Fig. 5 gezeigten Beispiel, das einen Polynomfit für eine Vibrato-gespielte Flöte umfaßt, ein Polynom mit der Ordnung 10 verwendet. Es ist zu sehen, daß das Polynom mit einer Ordnung 10 bereits eine gute Anpassung an die Amplituden-Zeit-Darstellung des Audiosignals liefert. Ein Polynom geringerer Ordnung würde sehr wahrscheinlich nicht so gut der Amplituden-Zeit- Darstellung folgen, würde jedoch bei der Datenbankverarbeitung zur Identifikation des Musikinstruments hinsichtlich der Berechnung bei der Datenbanksuche einfacher zu handhaben sein. Andererseits würde ein Polynom noch höheren Grads als der Grad 10 einen noch höheren n-dimensionalen Vektorraum als die Audiosignalkennung aufspannen, was die Instru- menten-Datenbank-Berechnung aufwendiger gestalten würde. Das erfindungsgemäße Konzept ist dahingehend flexibel, daß für verschiedene Anwendungsfälle verschieden hohe Polynom- Ordnungen ausgewählt werden können.
Fig. 3 zeigt ein detaillierteres Blockschaltbild des Blocks 16 von Fig. 1 gemäß einem anderen Ausführungsbeispiel der vorliegenden Erfindung. Hierbei wird eine Ermittlung der Populationszahlen der diskreten Amplitudenwerte der Amplituden-Zeit-Darstellung in einem vorbestimmten Zeitfenster durchgeführt, wobei dann die Kennung für das Audiosignal, wie es in einem Block 36b dargestellt ist, unter Verwendung der von dem Block 36a gelieferten Populationszahlen ermit- telt wird.
Ein Beispiel dafür ist in Fig. 6 gezeigt. Fig. 6 zeigt eine Amplituden-Zeit-Darstellung für den Ton ais 4 eines Altsaxophons, der für eine Dauer von etwa 0,7 s gespielt wird. Für die Amplituden-Zeit-Darstellung wird es bevorzugt, eine Amplituden-Quantisierung durchzuführen. So ergibt sich eine solche Amplituden-Quantisierung auf beispielsweise 31 diskrete Amplitudenlinien durch die Auswahl der Bins bei der Hough-Transformation. Wird die Amplituden-Zeit-Darstellung auf andere Art und Weise gewonnen, so empfiehlt es sich, um die Datenmenge für die Signalkennung zu begrenzen, eine Amplitudenlinien-Quantisierung durchzuführen, die über die jedem digitalen Rechenwerk inhärente Quantisierung deutlich hinausgeht. Aus dem in Fig. 6 gezeigten Diagramm kann nun ohne weiteres für jede diskrete Amplitudenlinie (eine gedachte waagrechte Linie durch Fig. 6) die Anzahl der auf dieser Linie liegenden Amplitudenwerte durch Abzählen er- halten werden. Damit ergeben sich die Populationszahlen für jede Amplitudenlinie.
Die Amplituden/Zeit-Tupel liegen, wie es ausgeführt worden ist, bedingt durch das Transformationsverfahren auf einem diskreten Raster, gebildet durch mehrere Amplitudenstufen, die als Amplitudenlinien in bestimmten Amplitudenabständen zueinander angebbar sind. Charakteristisch für jedes Musikinstrument ist, wie viele Linien besetzt sind, welche Li- nien besetzt sind, und die jeweiligen Populationszahlen. Die durch die Anzahl der Amplitude/Zeit-Tupel gleicher Amplitude in einem Zeitintervall bestimmter Länge gegebene Populationszahl jeder Linie wird abgezählt. Diese Populationszahlen alleine könnten bereits als Signalkennung verwen- det werden. Es wird jedoch bevorzugt, die Populationszahlenverhältnisse der einzelnen Linien nO, nl, n2 , ... zu bilden. Diese Populationszahlenverhältnisse n0:nl, n0:n2, nl:n2, ... sind nicht mehr von der absoluten Amplitude abhängig, sondern liefern lediglich die Relation der einzel- nen Amplitudenstufen zueinander.
Die Populationszahlenverhältnisse werden in einem Fenster vorbestimmter Länge bestimmt. Durch die Angabe der Fensterlänge und durch Division der Populationszahlenverhältnisse durch die Fensterlänge wird die Populationsdichte (Zahl der Einträge/Fensterlänge) für jede Amplitudenlinie gebildet. Die Populationsdichte wird über die gesamte Zeitachse durch ein gleitendes Fenster der Länge h und einer Schrittweite m bestimmt. Die Populationsdichtezahlen werden ferner vor- zugsweise normiert, indem die Zahlen auf die Fensterlänge und die Tonhöhe bezogen werden. Insbesondere in dem Fall, bei dem die Amplituden/Zeit-Tupel auf der Basis einer Signalflankendetektion mittels der Hough-Transformation ermittelt werden, ist die Anzahl der Amplitudenwerte in ei- nem Fenster bestimmter Länge um so höher, je höher die Tonhöhe ist. Die Populationsdichtezahlennormierung auf die Tonhöhe eliminiert diese Abhängigkeit, so daß normierte Po- pulationsdichtezahlen unterschiedlicher Töne miteinander verglichen werden können.
Ferner wird es bevorzugt, im Amplitude/Zeit-Tupelraum den Mittelwert des Amplitudenspektrums zu bestimmen. Durch den Amplitude/Zeit-Tupelraum wird die Standardabweichung des Amplitudenspektrums um die mittlere Amplitude bestimmt. Die Standardabweichung gibt an, wie stark die Amplituden um die mittlere Amplitude streuen. Die Amplitudenstandardabwei- chung ist eine spezifische Maßzahl und damit eine spezifische Kennung für jedes Musikinstrument.
Ferner wird es bevorzugt, im Amplitude/Zeit-Tupelraum die Streuung der Amplituden um die Amplituden- Standardabweichung zu bestimmen. Die Streuung gibt an, wie stark die Amplituden um die Amplitudenstandardabweichung streuen. Die Amplitudenstreuung ist eine spezifische Maßzahl und damit eine spezifische Kennung für jedes Musikinstrument .
Die in den Fig. 1 bis 3 beschriebene Vorgehensweise führt dazu, von einem Audiosignal, das einen Ton eines Instruments umfaßt, eine Kennung abzuleiten, die charakteristisch für das Instrument ist, von dem der Ton stammt. Diese Ken- nung kann, wie es anhand von Fig. 4 dargelegt wird, für verschiedene Dinge verwendet werden. Zunächst können verschiedene Referenz-Kennungen 40a, 40b in Zuordnung zu dem Instrument, von dem die jeweilige Referenz-Kennung stammt, in einer Instrumenten-Datenbank abgespeichert werden. Um eine Musikinstrumentenidentifikation durchzuführen, wird mittels einer Einrichtung 42, die prinzipiell so aufgebaut sein wird, wie es anhand der Fig. 1 bis 3 dargestellt ist, aus einem Test-Audiosignal von einem Test-Instrument eine Test-Kennung erzeugt. In der Instrumenten-Datenbank wird daraufhin, zur Musikinstrumentenidentifikation, die Test- Kennung mit den Referenz-Kennungen unter Verwendung verschiedener in der Technik bekannter Datenbankalgorithmen verglichen. Wird eine Referenz-Kennung in der Instrumenten- Datenbank gefunden, die der Test-Kennung bezüglich eines vorgegebenen Ähnlichkeits-Kriteriums 41 ähnlich ist, so wird festgestellt, daß die Art des Instruments, von dem der Ton stammt, der in dem Test-Audiosignal enthalten ist, gleich der Art des Instruments ist, dem eine Referenz- Kennung 40a, 40b zugeordnet ist. Damit kann das Musikinstrument, von dem der Ton stammt, der in dem Test- Audiosignal enthalten ist, anhand der Referenz-Kennungen in der Instrumenten-Datenbank identifiziert werden.
Je nach Aufwand, der ausgeführt werden soll, kann die Instrumenten-Datenbank unterschiedlich umfassend ausgestattet werden. Grundsätzlich wird die Musikinstrumenten-Datenbank von einer Sammlung von Tönen abgeleitet, die von verschie- denen Musikinstrumenten aufgenommen worden sind. Für jedes Musikinstrument ist ein Satz von Tönen in Halbtonstufen beginnend von einem tiefsten bis zu einem höchsten Ton aufgezeichnet. Für jeden Ton des Musikinstruments wird eine Amp- litude/Zeit-Tupelraumverteilung und optional eine Fre- quenz/Zeit-Tupelraumverteilung angelegt. Für jedes Musikinstrument wird ein Satz von Amplitude/Zeit-Tupelräumen über den gesamten Tonumfang des Musikinstruments beginnend vom tiefsten Ton in Halbtonstufen bis zum höchsten Ton generiert. Die Musikinstrumenten-Datenbank wird aus allen in der Datenbank gespeicherten Amplitude/Zeit-Tupelräumen und Frequenz/Zeit-Tupelräumen der aufgenommenen Musikinstrumente gebildet. Darüber hinaus wird es bevorzugt, für jeden Ton eines Musikinstruments mehrere Kennungen (Polynomkoeffizienten einerseits oder Populationsdichte-Größen anderer- seits oder beide Arten zusammen) anzulegen, und zwar jeweils für eine zweiunddreißigstel Note, eine sechzehntel Note, eine achtel Note, eine viertel Note, eine halbe Note und eine ganze Note, wobei die Notenlängen gemittelt werden über die Tondauer für jedes Instrument. Der Satz der Poly- nomkurven über die gesamten Tonstufen und Tonlängen eines Instruments repräsentiert das Musikinstrument in der Datenbank. Zudem werden optional verschiedene Spieltechniken für ein Musikinstrument ebenfalls in der Musikdatenbank gespei- chert, indem die entsprechenden Amplitude/Zeit- Tupelverteilungen und Frequenz/Zeit-Tupelverteilungen gespeichert werden und entsprechende Kennungen hierfür bestimmt und schließlich in der Instrumenten-Datenbank abgelegt werden. Der zusammengefaßte Satz der Kennungen der Musikinstrumente für die gegebenen Noten der Musikinstrumente und die gegebenen Notenlängen und die Spieltechniken ergibt zusammen die Instrumenten-Datenbank, die in Fig. 4 schematisch dargestellt ist.
Zur Musikinstrumentenidentifikation wird ein gespielter Ton eines zunächst unbekannten Musikinstruments in eine Ampli- tude/Zeit-Tupelverteilung im Amplitude/Zeit-Tupelraum und (optional) eine Frequenz/Zeit-Tupelverteilung im Fre- quenz/Zeit-Tupelraum überführt. Aus dem Frequenz/Zeit- Tupelraum wird dann vorzugsweise die Tonhöhe des Tons bestimmt. Hierauf wird ein Datenbankvergleich nur mehr unter Verwendung der Referenzkennungen durchgeführt, die sich auf die für das Test-Audiosignal bestimmte Tonhöhe beziehen.
Für jede der Referenz-Kennungen wird das Residuum zu der Test-Kennung bestimmt. Das Residuumminimum, das sich beim Vergleich aller Referenz-Kennungen mit der Test-Kennung ergibt, wird als ein Indiz für das Vorliegen des von der Test-Kennung repräsentierten Musikinstruments angenommen.
Wie es ausgeführt worden ist, spannt die Kennung insbesondere im Fall der Polynomkoeffizienten einen n-dimensionalen Vektorraum auf, dessen n-dimensionaler Abstand zu dem n- di ensionalen Vektorraum einer Referenz-Kennung nicht nur qualitativ, sondern quantitativ berechnet werden kann. Ein Ähnlichkeits-Kriterium könnte dann sein, daß das Residuum, d. h. der n-dimensionale Abstand der Test-Kennung von der Referenz-Kennung, minimal ist (im Vergleich zu den anderen Referenz-Kennungen) oder daß das Residuum kleiner als eine vorbestimmte Schwelle ist. Selbstverständlich ist es auch möglich, einen mehrstufigen Vergleich durchzuführen, der- art, daß zunächst das Instrument an sich, dann eine Tonlänge und schließlich eine Spieltechnik ausgewertet werden.
Insbesondere bei dem in Fig. 2 gezeigten Ausführungsbei- spiel, bei dem ein Polynomfit durchgeführt wird, sei darauf hingewiesen, daß der Polynomfit auf einen festen Bezugsanfangspunkt bezogen ist. Daher wird die erste Signalflanke eines Audiosignals als Bezugsanfangspunkt der Polynomkurve gesetzt. Um aus einer Folge von gebunden gespielten Tönen ein Musikinstrument zu erkennen, ist die Auswahl einer Bezugssignalflanke nicht eindeutig gegeben. Die Setzung der Bezugsanfangsflanke für die Polynomkurve wird nach einer Tonhöhenänderung vorgenommen und der Bezugsanfangspunkt in den Übergang zwischen zwei Tonhöhen gelegt. Ist die Tonhö- henänderung nicht bestimmbar, wird im allgemeinen Fall die unbekannte Verteilung über den gesamten Satz aller Referenz-Kennungen in der Instrumenten-Datenbank „gezogen", indem die Test-Kennung um immer eine bestimmte Schrittweise gegen die Referenz-Kennung verschoben wird.
Wie es bereits ausgeführt worden ist, zeigt Fig. 5 ein Polynomfit eines Polynoms der Ordnung 10 für einen vibrato- gespielten Flötenton aus dem Standardwerk McGills Master Samples Reference CD. Der Ton ist ais 5. Der Abstand der Polyno minima nach dem Einschwingvorgang ergibt unmittelbar das Vibrato in Hertz des Instruments. Ferner ist bei jedem Ton eine Anklingphase 50, eine Halte-Phase 51 und eine Ausklingphase 52 gezeigt.
Aus Fig. 5 ist ersichtlich, daß die Anklingphase 50 und die Ausklingphase 52 relativ kurz sind. Im Gegensatz dazu wäre die Ausklingphase eines Klaviertons eher lang, wodurch das charakteristische Amplitudenprofil eines Klaviertons gegenüber dem charakteristischen Amplitudenprofil einer Flöte unterscheidbar ist.
Wie es bereits ausgeführt worden ist, kann neben der Amplituden-Zeit-Darstellung auch eine Frequenz-Zeit-Darstellung verwendet werden, um die Musikinstrumentenerkennung zu ergänzen. Hierzu zeigt Fig. 7 die Frequenz-Populationszahlen für ein Altsaxophon, und zwar für den Ton ais 4 (in amerikanischer Notation), der für die Dauer von 0,7 s gespielt wird, was einer Dauer von etwa 34.000 PCM-Samples bei einer Aufnähmetrequenz von 44,1 kHz entspricht. Die im großen und ganzen gebildete Linie in Fig. 7 zeigt an, daß das ais 4 bei 466 Hz gespielt wurde. Es sei darauf hingewiesen, daß die Frequenz-Zeit-Verteilung und die Amplituden-Zeit- Verteilung der Fig. 7 und 6 zueinander korrespondieren, d. h. den gleichen Ton darstellen.
Die Frequenz-Zeit-Verteilung kann ferner dazu verwendet werden, um die sich für jedes Musikinstrument ergebende Grundtonlinie zu bestimmen, die die Frequenz des gespielten Tons angibt. Die Grundtonlinie wird genutzt, um zu bestimmen, ob der Ton in dem vom Musikinstrument erzeugbaren Tonumfang liegt, und um dann nur diejenigen Repräsentationen in der Musikdatenbank zur gleichen Tonhöhe auszuwählen. Die Frequenz-Zeit-Verteilung kann daher dazu verwendet werden, um eine Tonhöhenbestimmung durchzuführen.
Die Frequenz-Zeit-Verteilung kann jedoch darüber hinaus dazu verwendet werden, um die Musikinstrumentenidentifikation zu verbessern. Hierzu wird im Frequenz/Zeit-Tupelraum die Standardabweichung um die Grundtonlinie bestimmt. Die Standardabweichung gibt an, wie stark die Frequenzwerte um die mittlere Frequenz streuen. Die Standardabweichung ist eine spezifische Maßzahl für jedes Musikinstrument. Bachtrompete und Violine haben z. B. eine hohe Standardabweichung.
Im Frequenz/Zeit-Tupelraum wird die Streuung um die Stan¬ dardabweichung bestimmt. Die Streuung gibt an, wie stark die Frequenzwerte um die Standardabweichung streuen. Die Streuung ist eine spezifische Maßzahl für jedes Musikinstrument . Die Frequenz/Zeit-Tupel liegen bedingt durch das Transformationsverfahren auf einem diskreten Raster, gebildet durch mehrere Frequenzlinien in bestimmten Frequenzabständen zueinander. Charakteristisch für jedes Musikinstrument ist, wie viele Frequenzen besetzt sind, welche Linien besetzt sind und die jeweilige Populationszahl. Viele Musikinstrumente weisen charakteristische Frequenz/Zeit- Tupelverteilungen auf. Zusätzlich zur Grundtonlinie sind weitere ausgeprägte Frequenzlinien bzw. Frequenzbereiche vorhanden. Instrumente mit charakteristischen Frequenzlinien und Frequenzbereichen sind z. B. Violine, Oboe, Trompete und Saxophon. Für jeden Ton wird ein Frequenzspektrum gebildet, indem die Populationszahlen der Frequenzlinien abgezählt werden. Das Frequenzspektrum der unbekannten Ver- teilung wird mit allen Frequenzspektren verglichen. Ergibt der Vergleich eine maximale Übereinstimmung, wird angenommen, daß das nächstliegende Frequenzspektrum das Musikinstrument repräsentiert. Die Oboe oszilliert in zwei Frequenzmodi, so daß sich zwei Frequenzlinien in einem defi- nierten Frequenzabstand ausprägen. Sind diese zwei Frequenzlinien ausgeprägt, geht die Frequenz/Zeit- Tupelverteilung höchstwahrscheinlich auf eine Oboe zurück. Mehrere Musikinstrumente haben über der Grundtonlinie in einem definierten Frequenzabstand Populationszustände in einer Gruppe von benachbarten Frequenzlinien, die einen festen Frequenzbereich definieren. Das Englischhorn oszilliert frequenzmoduliert zyklisch zwischen zwei gegenläufigen Frequenzbögen. Das Englischhorn wird durch die zyklische Frequenzmodulation nachgewiesen.
Beim Klavier treten im Frequenz/Zeit-Tupelraum vertikale Strukturen auf, die durch das Anklingverhalten eines Ka- viertons verursacht werden. Mit einem gleitenden Histogrammverfahren wird bestimmt, ob über der Grundtonli- nie Histogrammeinträge in einem bestimmten Zeitintervall vorliegen. Die Zahl der Histogrammeinträge normiert zu einer Mindestanzahl ist ein Maß dafür, ob ein Ton von einem Klavier erzeugt wurde. Wie es bereits ausgeführt worden ist, weisen verschiedene Musikinstrumente und insbesondere auch verschiedene Töne von Musikinstrumenten und auch verschiedene Spielweisen von Musikinstrumenten unterschiedliche Amplituden-Zeit-Verläufe auf. Diese Eigenschaft wird für die erfindungsgemäße Musik- instrumentenkennung eingesetzt.
Musikinstrumente weisen die typischen Phasen Attack (Anklingen) , Decay (Abfallen) , Sustain (Aushalten) und Release (Ausklingen) auf, wobei bei einigen Instrumenten, z.B. die Decay-Phase nahezu verschwunden ist, und wobei bei einigen Musikinstrumenten ferner die Sustain-Phase und die Release- Phase ineinander übergehen können.
Nachfolgend wird auf verschiedene Amplituden-Zeit- Darstellungen von Musikinstrumenten eingegangen, wobei die Audio-Samples der McGill Master Series Collection verwendet werden. Die CD ist ein Tonarchiv von aufgezeichneten Noten von Musikinstrumenten über den gesamten Tonumfang eines In- struments in Halbtonschritten. Für die nachfolgenden Ergebnisse wurden jeweils die ersten 0,7 Sekunden eines Tons untersucht. Erfindungsgemäß wurde die Amplituden-Zeit- Darstellung verwendet, wobei ein Tupel in der Amplituden- Zeit-Darstellung die Amplitude einer zur Zeit t von vor- zugsweise der Hough-Transformation gefundenen Signalflanke darstellt. Optional wird ferner, wie es ausgeführt worden ist, eine Frequenz-Zeit-Darstellung verwendet, wobei ein Tupel in der Frequenz-Zeit-Darstellung die Frequenz zweier aufeinanderfolgender Signalflanken zum Auftrittszeitpunkt angibt. Ferner kann ebenfalls optional eine Frequenz- A plitude-Scatter-Darstellung verwendet werden, um weitere Informationen für eine Instrumentenerkennung zu verwenden. Aus einer Analyse des Tons b5 in amerikanischer Notation mit einer Frequenz von 987,77 Hz, gespielt auf einem Stein- way und weich angeschlagen, ergibt sich der typische ADSR- Amplitudenverlauf für ein Klavier, nämlich eine steile Attack-Phase und eine steile Decay-Phase. In der Scatter- Darstellung ist die Amplituden- gegen die Frequenzstreuung aufgetragen, wobei sich eine Hantel- bzw. Keulenform ergibt, die ebenfalls charakteristisch für das Instrument ist.
Wird der gleiche Ton b5 mit hartem Anschlag gespielt, so ergibt sich im Frequenzplot eine kleinere Standardabweichung, wobei die Streuung zeitabhängig ist. Am Anfang und am Ende ist die Streuung stärker als in der Mitte. In der Amplituden-Zeit-Darstellung wird die Attack-Phase und wird die Decay-Phase zu Streifenbändern aufgeweitet.
Wird der Ton b4 mit einer Frequenz von 493 Hz auf einer e- lektrischen Gitarre unverstärkt und unverzerrt gespielt, so ergibt sich eine klare Frequenzgrundlinie, die eine geringere Standardabweichung als das Klavier hat. In der Ampli- tuden-Zeit-Darstellung ergibt sich eine typische ADSR- Hüllkurve mit einer sehr kurzen Attack-Phase und einem steilflankigen, breiten Decay-Band.
Die Tonaufzeichnung von Violine Natural Harmonics Ton b5 987 Hz ergibt in der Analyse eine größere Frequenzstreuung am Anfang und am Ende. In der Amplituden-Zeit-Darstellung zeigt sich ein breites Attack-Band, ein Übergang zu einem breiten Decay-Band und ein Wiederanstieg in der Sustain- Phase, wobei sich in der Streudarstellung eine relativ große Streuung ergibt. Wird auf einer Bachtrompete der Ton g6 mit einer Frequenz von 1568 Hz gespielt , so ergibt sich eine hohe Standardabweichung, die am Anfang und am Ende zeitabhängig ist und eine Aufweitung am Ende aufweist . In der Amplituden-Zeit- Darstellung ergibt sich ein typischer ADSR-Verlauf mit einer steilen Attack-Phase und einer modulierten Decay-Phase auf und ab .
Wird auf einem Fagott der Ton b3 mit einer Frequenz von 246 Hz gespielt, so ergibt sich bei der Bestimmung der Frequenz eine geringe Standardabweichung . Das Fagott zeigt eine typische ADSR-Hüllkurve für Blasinstrumente mit einer Attack- Phase und einem Übergang in die Sustain-Phase und einem abruptem Abbruch, d . h . einer abrupten Release-Phase .
Das Sopransaxophon zeigt bei seinem Ton a5 mit einer Frequenz von 880 Hz eine geringe Standardabweichung . Bezüglich der Amplituden-Zeit-Darstellung zeigt sich ein sofortiger Übergang zum Steady-State ( Sustain) , wobei die Besetzungszustände zeitabhängig sind.
Wird eine Piccolo-Flöte mit einem Ton g7 bei 3136 Hz gespielt, so ist die Frequenzgrundtonlinie erkennbar, wobei jedoch sehr viele Subharmonische existieren. In der Amplituden-Zeit-Darstellung zeigt sich ein sofortiger Übergang in den Steady-State, wobei die Besetzungszustände zeitabhängig sind. Die Scatter-Darstellung zeigt eine weit verteilte Charakteristik.
Die Baßposaune zeigt, wenn ihr Ton e3 mit 164 Hz gespielt wird, eine eindeutige Grundfrequenzlinie und zeigt in der Amplituden-Zeit-Darstellung einen langsamen Anstieg zum Steady-State . Die Baßklarinette, Ton c3, 130 Hz zeigt wiederum eine ausgeprägte Grundfrequenzlinie und ein zusätzliches Frequenzband zwischen 800 und 1200 Hz. In der Amplituden-Zeit- Darstellung zeigt sich ein Steady-State mit großen Amplitu- denschwankungen . In der Scatter-Darstellung zeigen sich ausgeprägte Hanteln.
Das Englischhorn, das zur Familie der Oboen gehört, zeigt, wenn der Ton e5 mit 659 Hz gespielt wird, keine ausgeprägte Grundfrequenzlinie, sondern es zeigt sich eine Frequenzmodulation zwischen zwei Frequenzmoden. Die Steady-State- Phase in der Amplituden-Zeit-Darstellung ist zeitabhängig. In der Streudarstellung zeigen sich mehrere Nebenlinien.
Der Ton cis5, 554 Hz, gespielt von einem Waldhorn zeigt zwei Frequenzlinien, wodurch keine eindeutige Grundfre- quenzbeStimmung möglich ist. Es zeigt sich eine Oszillation zwischen zwei Frequenzmodi. In der Amplituden-Zeit- Darstellung zeigt sich eine typische Attack-Phase und ein typischer Steady-State für Blasinstrumente.
Vorzugsweise wird die Frequenz-Bestimmung vor der Amplituden-Zeit-Darstellungsbestimmung ausgeführt, um den Suchraum in einer Datenbank einzugrenzen, da, bevor das einzelne In- strument bestimmt wird, der gespielte Ton an sich, d.h. die vorliegende Tonhöhe, ermittelt wird. Dann muß in der Datenbank lediglich noch die Gruppe von Einträgen durchsucht werden, die sich auf den bestimmten Ton beziehen.

Claims

PATENTANSPRÜCHE
1. Verfahren zum Erzeugen einer Kennung für ein Audiosig- nal, das als eine Folge von Abtastwerten vorliegt und einen von einem Instrument erzeugten Ton umfaßt, mit folgenden Schritten:
Erzeugen (14) einer diskreten Amplituden-Zeit- Darstellung des Audiosignals durch Detektieren von Signalflanken in der Folge von Abtastwerten,
wobei jeder detektierten Signalflanke ein Amplitudenwert, der eine Amplitude der detektierten Signalflanke anzeigt, und ein Zeitwert, der einen Zeitpunkt eines Auftretens der Signalflanke in dem Audiosignal anzeigt, zugeordnet sind, und
wobei die Amplituden-Zeit-Darstellung eine Folge von aufeinanderfolgenden detektierten Signalflan- ken aufweist; und
Extrahieren (16) der Kennung für das Audiosignal aus der Amplituden-Zeit-Darstellung.
2. Verfahren gemäß Anspruch 1, bei dem im Schritt des Erzeugens (14) ansteigende Signalflanken in dem Audiosignal detektiert werden.
3. Verfahren gemäß Anspruch 2, bei dem eine Signalflanke eine Sinusfunktion von einem Winkel von 0° bis zu einem Winkel von 90° umfaßt.
4. Verfahren gemäß Anspruch 3, bei dem im Schritt des Erzeugens (14) eine Hough-Transformation durchgeführt wird.
5. Verfahren gemäß einem der vorhergehenden Ansprüche, bei dem der Schritt (16) des Extrahierens folgende Schritte aufweist:
Anpassen (26a) eines Polynoms mit einer Anzahl von Polynomkoeffizienten an die Amplituden-Zeit-Darstellung, wobei die Signalkennung auf den Polynom-Koeffizienten basiert .
6. Verfahren gemäß Anspruch 5, bei dem die Anzahl von Polynomkoeffizienten, die eine Ordnung des Polynoms festlegt, so bestimmt wird, daß eine Abweichung der Amplituden-Zeit-Darstellung von dem Polynom kleiner als ein Polynomfunktionsschwellenwert ist.
Verfahren gemäß Anspruch 5 oder 6, bei dem ein Bezugsanfangspunkt des Polynoms zu einem Anfangszeitpunkt gesetzt wird, bei dem die zugeordnete Amplitude einen Bezugsschwellenwert überschreitet .
Verfahren gemäß einem der vorhergehenden Ansprüche,
bei dem die Amplitudenwerte der Amplituden-Zeit- Darstellungen in eine Mehrzahl von diskreten Amplitu- denlinien quantisiert sind, und
bei dem der Schritt des Extrahierens folgende Merkmale aufweist:
für die Amplitudenlinien der Mehrzahl von Amplitudenlinien, Ermitteln (36a) der Anzahl von Zeitpunkten, denen Amplitudenwerte zugeordnet sind, die auf einer diskreten Amplitudenlinie liegen, in einem vorgegebenen Zeitfenster, um Populati- onszahlen für die Mehrzahl von Amplitudenlinien zu erhalten, wobei die Signalkennung auf den Populationszahlen für die Mehrzahl von Amplitudenlinien basiert (26b) .
9. Verfahren gemäß Anspruch 8, bei dem im Schritt des Extrahierens nach dem Schritt des Ermitteins Populationszahlenverhältnisse zwischen den Populationszahlen der Mehrzahl von Amplitudenlinien gebildet werden.
10. Verfahren gemäß Anspruch 9, bei dem die Populationszahlenverhältnisse durch eine Länge des vorgegebenen Zeitfensters dividiert werden, um eine Populationsdichte für jede Amplitudenlinie zu erhalten.
11. Verfahren gemäß einem der vorhergehenden Ansprüche, bei dem vor dem Schritt des Extrahierens eine Bestimmung der Tonhöhe durchgeführt wird.
12. Verfahren gemäß Anspruch 11,
bei dem die Populationsdichte für jede Amplitudenlinie der Mehrzahl von Amplitudenlinien auf die Tonhöhe bezogen wird.
13. Verfahren gemäß einem der Ansprüche 8 bis 12,
bei dem im Schritt des Extrahierens
ein Mittelwert der in dem vorgegebenen Zeitfenster vorhandenen Amplitudenwerte bestimmt wird, und/oder
eine Standardabweichung der in dem vorgegebenen Zeitfenster vorhandenen Amplitudenwerte bestimmt wird, und/oder
eine Streuung der Amplitudenwerte um die Amplituden- standardabweichung bestimmt wird, wobei die Kennung für das Audiosignal auf dem Mittelwert und/oder der Standardabweichung und/oder der Streuung basiert.
14. Verfahren gemäß einem der vorhergehenden Ansprüche,
bei dem ferner eine diskrete Frequenz-Zeit-Darstellung erzeugt wird, und
bei dem die Kennung für das Audiosignal ferner aus der Frequenz-Zeit-Darstellung extrahiert wird.
15. Verfahren zum Aufbauen einer Instrumenten-Datenbank mit folgenden Schritten:
Bereitstellen eines Audiosignals, das einen Ton eines ersten einer Mehrzahl von Instrumenten umfaßt;
Erzeugen einer ersten Kennung für das erste Audiosig- nal gemäß einem der Ansprüche 1 bis 14;
Bereitstellen eines zweiten Audiosignals, das einen Ton eines zweiten einer Mehrzahl von Instrumenten umfaßt;
Erzeugen einer zweiten Kennung für das zweite Audiosignal gemäß einem der Ansprüche 1 bis 14; und
Speichern der ersten Kennung als erste Referenz- Kennung (40a) und der zweiten Kennung als zweite Referenz-Kennung (40b) in der Instrumenten-Datenbank in Zuordnung zu einem Hinweis auf das erste bzw. das zweite Instrument.
16. Verfahren gemäß Anspruch 15, bei dem sowohl für das erste als auch das zweite Instrument eine Mehrzahl von Kennungen für eine Mehrzahl von unterschiedlichen Tönen erzeugt und gespeichert werden.
17. Verfahren gemäß Anspruch 16, bei dem für jedes Instrument in Halbtonstufen von einem tiefsten bis zu einem höchsten von diesem Instrument erzeugbaren Ton jeweils eine Kennung erzeugt und gespeichert wird.
18. Verfahren gemäß Anspruch 16 oder 17, bei dem ferner für jeden Ton eines Instruments Kennungen für verschiedene Tonlängen erzeugt und gespeichert werden.
19. Verfahren gemäß einem der Ansprüche 15 bis 18,
bei dem für verschiedene Spieltechniken eines Instruments verschiedene Kennungen erzeugt und gespeichert werden.
20. Verfahren zum Bestimmen der Art eines Instruments, von dem ein Ton stammt, der in einem Test-Audiosignal enthalten ist, mit folgenden Schritten:
Erzeugen einer Test-Kennung für das Test-Audiosignal gemäß einem der Ansprüche 1 bis 14;
Vergleichen der Test-Kennung mit einer Mehrzahl von Referenz-Kennungen (40a, 40b) in einer Instrumenten- Datenbank, wobei die Instrumenten-Datenbank gemäß einem der Ansprüche 15 bis 19 erzeugt ist; und
Feststellen, daß die Art des Instruments, von dem der Ton stammt, der in dem Test-Audiosignal enthalten ist, gleich der Art des Instruments ist, dem eine Referenz- Kennung zugeordnet ist, die der Test-Kennung bezüglich eines vorgegebenen Ähnlichkeitskriteriums (41) ähnlich ist .
21. Vorrichtung zum Erzeugen einer Kennung für ein Audiosignal, das als eine Folge von Abtastwerten vorliegt und einen von einem Instrument erzeugten Ton umfaßt, mit folgenden Merkmalen:
einer Einrichtung zum Erzeugen (14) einer diskreten Amplituden-Zeit-Darstellung des Audiosignals durch Detektieren von Signalflanken in der Folge von Abtast- werten,
wobei jeder detektierten Signalflanke ein Ampli- tudenwert, der eine Amplitude der detektierten
Signalflanke anzeigt, und ein Zeitwert, der einen Zeitpunkt eines Auftretens der Signalflanke in dem Audiosignal anzeigt, zugeordnet sind, und
wobei die Amplituden-Zeit-Darstellung eine Folge von aufeinanderfolgenden detektierten Signalflanken aufweist; und
einer Einrichtung zum Extrahieren (16) der Kennung für das Audiosignal aus der Amplituden-Zeit-Darstellung.
22. Vorrichtung zum Aufbauen einer Instrumenten-Datenbank mit folgenden Merkmalen:
einer Einrichtung zum Bereitstellen eines Audiosignals, das einen Ton eines ersten einer Mehrzahl von Instrumenten umfaßt;
einer Einrichtung zum Erzeugen einer ersten Kennung für das erste Audiosignal gemäß Anspruch 21;
einer Einrichtung zum Bereitstellen eines zweiten Audiosignals, das einen Ton eines zweiten einer Mehrzahl von Instrumenten umfaßt;
einer Einrichtung zum Erzeugen einer zweiten Kennung für das zweite Audiosignal gemäß Anspruch 21; und einer Einrichtung zum Speichern der ersten Kennung als erste Referenz-Kennung (40a) und der zweiten Kennung als zweite Referenz-Kennung (40b) in der Instrumenten- Datenbank in Zuordnung zu einem Hinweis auf das erste bzw. das zweite Instrument.
23. Vorrichtung zum Bestimmen der Art eines Instruments, von dem ein Ton stammt, der in einem Test-Audiosignal enthalten ist, mit folgenden Merkmalen:
einer Einrichtung zum Erzeugen einer Test-Kennung für das Test-Audiosignal gemäß Anspruch 21;
einer Einrichtung zum Vergleichen der Test-Kennung mit einer Mehrzahl von Referenz-Kennungen (40a, 40b) in einer Instrumenten-Datenbank, wobei die Instrumenten- Datenbank gemäß Anspruch 22 aufgebaut ist;
einer Einrichtung zum Feststellen, daß die Art des Instru- ments, von dem der Ton stammt, der in dem Test-Audiosignal enthalten ist, gleich der Art des Instruments ist, dem eine Referenz-Kennung zugeordnet ist, die der Test-Kennung bezüglich eines vorgegebenen Ähnlichkeitskriteriums (41) ähnlich ist.
EP02785403A 2001-11-23 2002-11-21 VERFAHREN UND VORRICHTUNG ZUM ERZEUGEN EINER KENNUNG FÜR EIN AUDIOSIGNAL, ZUM AUFBAUEN EINER INSTRUMENTENDATENBANK UND ZUM BESTIMMEN DER ART EINES MusikINSTRUMENTS Expired - Lifetime EP1417676B1 (de)

Applications Claiming Priority (3)

Application Number Priority Date Filing Date Title
DE10157454 2001-11-23
DE10157454A DE10157454B4 (de) 2001-11-23 2001-11-23 Verfahren und Vorrichtung zum Erzeugen einer Kennung für ein Audiosignal, Verfahren und Vorrichtung zum Aufbauen einer Instrumentendatenbank und Verfahren und Vorrichtung zum Bestimmen der Art eines Instruments
PCT/EP2002/013100 WO2003044769A2 (de) 2001-11-23 2002-11-21 Verfahren und vorrichtung zum erzeugen einer kennung für ein audiosignal, zum aufbauen einer instrumentendatenbank und zum bestimmen der art eines instruments

Publications (2)

Publication Number Publication Date
EP1417676A2 true EP1417676A2 (de) 2004-05-12
EP1417676B1 EP1417676B1 (de) 2005-03-09

Family

ID=7706681

Family Applications (1)

Application Number Title Priority Date Filing Date
EP02785403A Expired - Lifetime EP1417676B1 (de) 2001-11-23 2002-11-21 VERFAHREN UND VORRICHTUNG ZUM ERZEUGEN EINER KENNUNG FÜR EIN AUDIOSIGNAL, ZUM AUFBAUEN EINER INSTRUMENTENDATENBANK UND ZUM BESTIMMEN DER ART EINES MusikINSTRUMENTS

Country Status (5)

Country Link
US (1) US7214870B2 (de)
EP (1) EP1417676B1 (de)
AT (1) ATE290709T1 (de)
DE (2) DE10157454B4 (de)
WO (1) WO2003044769A2 (de)

Families Citing this family (15)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
DE10232916B4 (de) * 2002-07-19 2008-08-07 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Vorrichtung und Verfahren zum Charakterisieren eines Informationssignals
DE102004022659B3 (de) * 2004-05-07 2005-10-13 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Vorrichtung zum Charakterisieren eines Tonsignals
US7273978B2 (en) 2004-05-07 2007-09-25 Fraunhofer-Gesellschaft Zur Foerderung Der Angewandten Forschung E.V. Device and method for characterizing a tone signal
JP4948118B2 (ja) * 2005-10-25 2012-06-06 ソニー株式会社 情報処理装置、情報処理方法、およびプログラム
JP4465626B2 (ja) * 2005-11-08 2010-05-19 ソニー株式会社 情報処理装置および方法、並びにプログラム
DE102006014507B4 (de) * 2006-03-19 2009-05-07 Technische Universität Dresden Verfahren und Vorrichtung zur Klassifikation und Beurteilung von Musikinstrumenten gleicher Instrumentengruppen
JP4665836B2 (ja) * 2006-05-31 2011-04-06 日本ビクター株式会社 楽曲分類装置、楽曲分類方法、及び楽曲分類プログラム
US20080200224A1 (en) 2007-02-20 2008-08-21 Gametank Inc. Instrument Game System and Method
US8907193B2 (en) 2007-02-20 2014-12-09 Ubisoft Entertainment Instrument game system and method
US9120016B2 (en) 2008-11-21 2015-09-01 Ubisoft Entertainment Interactive guitar game designed for learning to play the guitar
US20110028218A1 (en) * 2009-08-03 2011-02-03 Realta Entertainment Group Systems and Methods for Wireless Connectivity of a Musical Instrument
JP2011164171A (ja) * 2010-02-05 2011-08-25 Yamaha Corp データ検索装置
JP2012226106A (ja) * 2011-04-19 2012-11-15 Sony Corp 楽曲区間検出装置および方法、プログラム、記録媒体、並びに楽曲信号検出装置
US11140018B2 (en) * 2014-01-07 2021-10-05 Quantumsine Acquisitions Inc. Method and apparatus for intra-symbol multi-dimensional modulation
US10382246B2 (en) * 2014-01-07 2019-08-13 Quantumsine Acquisitions Inc. Combined amplitude-time and phase modulation

Family Cites Families (14)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US3069654A (en) * 1960-03-25 1962-12-18 Paul V C Hough Method and means for recognizing complex patterns
US5541354A (en) * 1994-06-30 1996-07-30 International Business Machines Corporation Micromanipulation of waveforms in a sampling music synthesizer
US5712953A (en) * 1995-06-28 1998-01-27 Electronic Data Systems Corporation System and method for classification of audio or audio/video signals based on musical content
US5814750A (en) * 1995-11-09 1998-09-29 Chromatic Research, Inc. Method for varying the pitch of a musical tone produced through playback of a stored waveform
US5872727A (en) * 1996-11-19 1999-02-16 Industrial Technology Research Institute Pitch shift method with conserved timbre
US6124542A (en) * 1999-07-08 2000-09-26 Ati International Srl Wavefunction sound sampling synthesis
GR1003625B (el) 1999-07-08 2001-08-31 Μεθοδος χημικης αποθεσης συνθετων επικαλυψεων αγωγιμων πολυμερων σε επιφανειες κραματων αλουμινιου
US6124544A (en) * 1999-07-30 2000-09-26 Lyrrus Inc. Electronic music system for detecting pitch
IL151527A0 (en) * 2000-03-02 2003-04-10 Univ Southern California Mutated cyclyn g1 protein
US6545209B1 (en) * 2000-07-05 2003-04-08 Microsoft Corporation Music content characteristic identification and matching
DE10109648C2 (de) * 2001-02-28 2003-01-30 Fraunhofer Ges Forschung Verfahren und Vorrichtung zum Charakterisieren eines Signals und Verfahren und Vorrichtung zum Erzeugen eines indexierten Signals
EP1253529A1 (de) * 2001-04-25 2002-10-30 Sony France S.A. Verfahren und Vorrichtung zum Identifizieren des Informationstyps, z.B. zum Identifizieren des Namensinhalts einer Musikdatei
KR100455751B1 (ko) * 2001-12-18 2004-11-06 어뮤즈텍(주) 연주악기의 소리정보를 이용한 음악분석장치
DE10232916B4 (de) * 2002-07-19 2008-08-07 Fraunhofer-Gesellschaft zur Förderung der angewandten Forschung e.V. Vorrichtung und Verfahren zum Charakterisieren eines Informationssignals

Non-Patent Citations (1)

* Cited by examiner, † Cited by third party
Title
See references of WO03044769A2 *

Also Published As

Publication number Publication date
DE10157454B4 (de) 2005-07-07
HK1062737A1 (en) 2004-11-19
WO2003044769A3 (de) 2004-03-11
ATE290709T1 (de) 2005-03-15
EP1417676B1 (de) 2005-03-09
US7214870B2 (en) 2007-05-08
US20040255758A1 (en) 2004-12-23
WO2003044769A2 (de) 2003-05-30
DE10157454A1 (de) 2003-06-12
DE50202436D1 (de) 2005-04-14

Similar Documents

Publication Publication Date Title
DE10117870B4 (de) Verfahren und Vorrichtung zum Überführen eines Musiksignals in eine Noten-basierte Beschreibung und Verfahren und Vorrichtung zum Referenzieren eines Musiksignals in einer Datenbank
DE69904640T2 (de) Verfahren zum ändern des oberweyllengehalts einer komplexen wellenform
EP2099024B1 (de) Verfahren zur klangobjektorientierten Analyse und zur notenobjektorientierten Bearbeitung polyphoner Klangaufnahmen
EP1417676B1 (de) VERFAHREN UND VORRICHTUNG ZUM ERZEUGEN EINER KENNUNG FÜR EIN AUDIOSIGNAL, ZUM AUFBAUEN EINER INSTRUMENTENDATENBANK UND ZUM BESTIMMEN DER ART EINES MusikINSTRUMENTS
DE69607223T2 (de) Verfahren zur Tonhöhenerkennung, insbesondere für Zupf- oder Perkussionsinstrumente
EP1371055B1 (de) Vorrichtung zum analysieren eines audiosignals hinsichtlich von rhythmusinformationen des audiosignals unter verwendung einer autokorrelationsfunktion
WO2004010327A2 (de) Vorrichtung und verfahren zum charakterisieren eines informationssignals
WO2002073592A2 (de) Verfahren und vorrichtung zum charakterisieren eines signals und verfahren und vorrichtung zum erzeugen eines indexierten signals
EP1280138A1 (de) Verfahren zur Analyse von Audiosignalen
EP1388145B1 (de) Vorrichtung und verfahren zum analysieren eines audiosignals hinsichtlich von rhythmusinformationen
DE19709930A1 (de) Tonprozessor, der die Tonhöhe und die Hüllkurve eines akustischen Signals frequenzangepaßt nachweist
DE102004028694B3 (de) Vorrichtung und Verfahren zum Umsetzen eines Informationssignals in eine Spektraldarstellung mit variabler Auflösung
DE19500751A1 (de) Verfahren zum Erkennen eines Tonbeginns bei geschlagenen oder gezupften Musikinstrumenten
Hinrichs et al. Classification of guitar effects and extraction of their parameter settings from instrument mixes using convolutional neural networks
DE10117871C1 (de) Verfahren und Vorrichtung zum Extrahieren einer Signalkennung, Verfahren und Vorrichtung zum Erzeugen einer Datenbank aus Signalkennungen und Verfahren und Vorrichtung zum Referenzieren eines Such-Zeitsignals
Kostek Soft computing-based recognition of musical sounds
WO2006005448A1 (de) Verfahren und vorrichtung zur rhythmischen aufbereitung von audiosignalen
Forberg Automatic conversion of sound to the MIDI-format
DE102004022659B3 (de) Vorrichtung zum Charakterisieren eines Tonsignals
DE112024000624T5 (de) Verfahren zur verwendung von iir-filtern, um einem audioton die gleichen spektralen eigenschaften eines anderen audiotons zu ermöglichen
EP1743324B1 (de) Vorrichtung und verfahren zum analysieren eines informationssignals
Hinrichs et al. Settings from Instrument Mixes Using
da Costa et al. Artigo de Congresso
de Paula et al. Timbre representation of a single musical instrument
DE102009029615A1 (de) Verfahren und Anordnung zur Verarbeitung von Audiodaten sowie ein entsprechendes Computerprogramm und ein entsprechendes computer-lesbares Speichermedium

Legal Events

Date Code Title Description
PUAI Public reference made under article 153(3) epc to a published international application that has entered the european phase

Free format text: ORIGINAL CODE: 0009012

GRAP Despatch of communication of intention to grant a patent

Free format text: ORIGINAL CODE: EPIDOSNIGR1

17P Request for examination filed

Effective date: 20040225

AK Designated contracting states

Kind code of ref document: A2

Designated state(s): AT BE BG CH CY CZ DE DK EE ES FI FR GB GR IE IT LI LU MC NL PT SE SK TR

RTI1 Title (correction)

Free format text: METHOD AND DEVICE FOR GENERATING AN IDENTIFIER FOR AN AUDIO SIGNAL, FOR CREATING A MUSICAL INSTRUMENT DATABASE AND FOR D

GRAS Grant fee paid

Free format text: ORIGINAL CODE: EPIDOSNIGR3

RIN1 Information on inventor provided before grant (corrected)

Inventor name: BRANDENBURG, KARLHEINZ

Inventor name: KLEFENZ, FRANK

REG Reference to a national code

Ref country code: HK

Ref legal event code: DE

Ref document number: 1062737

Country of ref document: HK

GRAA (expected) grant

Free format text: ORIGINAL CODE: 0009210

RBV Designated contracting states (corrected)

Designated state(s): AT CH DE FR GB LI NL

RIN1 Information on inventor provided before grant (corrected)

Inventor name: KLEFENZ, FRANZ

Inventor name: BRANDENBURG, KARLHEINZ

AK Designated contracting states

Kind code of ref document: B1

Designated state(s): AT CH DE FR GB LI NL

REG Reference to a national code

Ref country code: GB

Ref legal event code: FG4D

Free format text: NOT ENGLISH

REG Reference to a national code

Ref country code: CH

Ref legal event code: EP

REG Reference to a national code

Ref country code: IE

Ref legal event code: FG4D

Free format text: GERMAN

REF Corresponds to:

Ref document number: 50202436

Country of ref document: DE

Date of ref document: 20050414

Kind code of ref document: P

GBT Gb: translation of ep patent filed (gb section 77(6)(a)/1977)

Effective date: 20050413

REG Reference to a national code

Ref country code: HK

Ref legal event code: GR

Ref document number: 1062737

Country of ref document: HK

ET Fr: translation filed
PLBE No opposition filed within time limit

Free format text: ORIGINAL CODE: 0009261

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: NO OPPOSITION FILED WITHIN TIME LIMIT

26N No opposition filed

Effective date: 20051212

PGFP Annual fee paid to national office [announced via postgrant information from national office to epo]

Ref country code: AT

Payment date: 20091120

Year of fee payment: 8

Ref country code: CH

Payment date: 20091124

Year of fee payment: 8

PGFP Annual fee paid to national office [announced via postgrant information from national office to epo]

Ref country code: NL

Payment date: 20091123

Year of fee payment: 8

REG Reference to a national code

Ref country code: NL

Ref legal event code: V1

Effective date: 20110601

REG Reference to a national code

Ref country code: CH

Ref legal event code: PL

PG25 Lapsed in a contracting state [announced via postgrant information from national office to epo]

Ref country code: LI

Free format text: LAPSE BECAUSE OF NON-PAYMENT OF DUE FEES

Effective date: 20101130

Ref country code: CH

Free format text: LAPSE BECAUSE OF NON-PAYMENT OF DUE FEES

Effective date: 20101130

PG25 Lapsed in a contracting state [announced via postgrant information from national office to epo]

Ref country code: AT

Free format text: LAPSE BECAUSE OF NON-PAYMENT OF DUE FEES

Effective date: 20101121

Ref country code: NL

Free format text: LAPSE BECAUSE OF NON-PAYMENT OF DUE FEES

Effective date: 20110601

REG Reference to a national code

Ref country code: FR

Ref legal event code: PLFP

Year of fee payment: 14

REG Reference to a national code

Ref country code: FR

Ref legal event code: PLFP

Year of fee payment: 15

REG Reference to a national code

Ref country code: FR

Ref legal event code: PLFP

Year of fee payment: 16

PGFP Annual fee paid to national office [announced via postgrant information from national office to epo]

Ref country code: DE

Payment date: 20190430

Year of fee payment: 17

PGFP Annual fee paid to national office [announced via postgrant information from national office to epo]

Ref country code: FR

Payment date: 20190521

Year of fee payment: 17

PGFP Annual fee paid to national office [announced via postgrant information from national office to epo]

Ref country code: GB

Payment date: 20190523

Year of fee payment: 17

REG Reference to a national code

Ref country code: DE

Ref legal event code: R119

Ref document number: 50202436

Country of ref document: DE

GBPC Gb: european patent ceased through non-payment of renewal fee

Effective date: 20191121

PG25 Lapsed in a contracting state [announced via postgrant information from national office to epo]

Ref country code: DE

Free format text: LAPSE BECAUSE OF NON-PAYMENT OF DUE FEES

Effective date: 20200603

Ref country code: FR

Free format text: LAPSE BECAUSE OF NON-PAYMENT OF DUE FEES

Effective date: 20191130

Ref country code: GB

Free format text: LAPSE BECAUSE OF NON-PAYMENT OF DUE FEES

Effective date: 20191121