ES2730697T3 - Estimación de audibilidad de muestras de audio - Google Patents

Estimación de audibilidad de muestras de audio Download PDF

Info

Publication number
ES2730697T3
ES2730697T3 ES16192913T ES16192913T ES2730697T3 ES 2730697 T3 ES2730697 T3 ES 2730697T3 ES 16192913 T ES16192913 T ES 16192913T ES 16192913 T ES16192913 T ES 16192913T ES 2730697 T3 ES2730697 T3 ES 2730697T3
Authority
ES
Spain
Prior art keywords
audio
audibility
matrix
mix
audio sample
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Active
Application number
ES16192913T
Other languages
English (en)
Inventor
Emilio Molina
Pedro Cano
Alex Ciurana
Johannes Lyda
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
BMAT Licensing SL
Original Assignee
BMAT Licensing SL
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by BMAT Licensing SL filed Critical BMAT Licensing SL
Application granted granted Critical
Publication of ES2730697T3 publication Critical patent/ES2730697T3/es
Active legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Classifications

    • G—PHYSICS
    • G10—MUSICAL INSTRUMENTS; ACOUSTICS
    • G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L25/00—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
    • G10L25/03—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 characterised by the type of extracted parameters
    • G10L25/18—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 characterised by the type of extracted parameters the extracted parameters being spectral information of each sub-band
    • G—PHYSICS
    • G10—MUSICAL INSTRUMENTS; ACOUSTICS
    • G10L—SPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L25/00—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
    • G10L25/48—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use
    • G10L25/69—Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use for evaluating synthetic or decoded voice signals
    • H—ELECTRICITY
    • H03—ELECTRONIC CIRCUITRY
    • H03G—CONTROL OF AMPLIFICATION
    • H03G5/00—Tone control or bandwidth control in amplifiers
    • H03G5/005—Tone control or bandwidth control in amplifiers of digital signals

Landscapes

  • Engineering & Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • Computational Linguistics (AREA)
  • Signal Processing (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Spectroscopy & Molecular Physics (AREA)
  • Two-Way Televisions, Distribution Of Moving Picture Or The Like (AREA)
  • Circuits Of Receivers In General (AREA)

Abstract

Un procedimiento para estimar la audibilidad de una muestra de audio en una mezcla de audio de un programa de medio de radio difusión, que comprende: proporcionar una matriz de representación de una mezcla de audio, comprendiendo la mezcla de audio la muestra de audio y un audio adicional; proporcionar una matriz de representación de la muestra de audio; restar la matriz de representación de la muestra de audio a la matriz de representación de la mezcla de audio para generar una matriz de diferencias; aplicar un modelo de audibilidad a la matriz de diferencias para generar una matriz de audibilidad; determinar un nivel de audibilidad para cada elemento de la matriz de audibilidad; promediar los niveles de audibilidad determinados de la matriz para estimar la audibilidad de la muestra de audio.

Description

DESCRIPCIÓN
Estimación de audibilidad de muestras de audio
La presente divulgación se refiere a procedimientos para estimar la audibilidad de muestras de audio en programas de medios de radio difusión.
ANTECEDENTES
El uso de muestras de audio, especialmente muestras de música, en programas de medios de radio difusión es bastante común y puede tener propósitos muy diferentes. En algunos casos, los tipos de audio, por ejemplo, la música, juegan un papel importante en un programa y se percibe claramente en primer plano. Sin embargo, en muchas otras situaciones, dicho audio puede ser apenas perceptible porque tiene un volumen muy bajo o puede estar enmascarado por otros sonidos (por ejemplo, voz). En dichas situaciones, es posible que la música no sea lo suficientemente audible como para tenerla en cuenta con fines de derechos de autor o copyright.
Dado que las muestras de audio (por ejemplo, música, según se ha mencionado) en programas de medios de radio difusión normalmente se mezclan con otros sonidos (por ejemplo, voz), medir su nivel de audibilidad es un reto. Por un lado, el nivel de potencia relativa de la muestra de audio dentro de la mezcla de audio es desconocido a priori. La solución trivial para determinar la potencia relativa de la muestra de audio es medirla en la etapa de producción, en la que las distintas pistas aún son independientes en la mesa de mezclas. Sin embargo, esta medición generalmente no se realiza en la producción de la radio difusión en el mundo real. Un ejemplo de medición de audibilidad en una mezcla de sonidos lo proporciona el documento EP 2579247 A1.
Sería deseable proporcionar un procedimiento alternativo para estimar la audibilidad de muestras de audio en mezclas de audio en programas de medios de radio difusión.
RESUMEN
Se proponen unos procedimientos para estimar la audibilidad percibida de muestras de audio en programas de medios de radio difusión. De acuerdo con el procedimiento propuesto, se puede procesar una representación aproximada en tiempo-frecuencia (por ejemplo, un output de bancos de filtros) de dos audios involucrados: un programa de medio de radio difusión (que puede comprender una o más mezclas de audio) y una muestra de audio ajustada en ganancia y alineada en el tiempo. La muestra de audio requiere estar alineada en el tiempo con la mezcla de audio, y la potencia de la muestra de audio alineada requiere ser adaptada a la potencia de la música dentro de la mezcla de audio.
Una forma de conseguir esta alineación puede ser anotar información de potencia y de alineación en el tiempo en una etapa de producción, en la que las pistas aún no están mezcladas; Sin embargo, esto no es habitual en los escenarios del mundo real. Existen otras formas, tales como las técnicas de huellas de audio, para conseguir una alineación óptima en el tiempo y un ajuste de ganancia.
Una vez que estas dos representaciones en tiempo-frecuencia (en forma de matriz) están disponibles, pueden ser restadas término a término para generar una nueva matriz, en lo sucesivo denominada matriz de diferencias. Esta matriz de diferencias generalmente tiene una magnitud baja en las regiones de tiempo-frecuencia que no tienen sonidos superpuestos sobre la muestra de audio.
La matriz de diferencias se puede procesar luego utilizando la potencia absoluta de la muestra de audio con el fin de identificar regiones en las que no es audible debido a su baja potencia (incluso sin estar enmascarada). El resultado de este último proceso es una matriz de audibilidad. Esta matriz de audibilidad se puede procesar en intervalos de tiempo de, por ejemplo, 0,5 s para generar una curva promedio que indique la audibilidad de la música a lo largo del tiempo.
En un primer aspecto, se propone un procedimiento de estimar la audibilidad de una muestra de audio en una mezcla de audio de un programa de medio de radio difusión según la reivindicación independiente 1. El procedimiento comprende proporcionar una matriz de representación de una mezcla de audio, comprendiendo la mezcla de audio la muestra de audio y un audio adicional; proporcionar una matriz de representación de la muestra de audio; restar la matriz de representación de la muestra de audio a la matriz de representación de la mezcla de audio para generar una matriz de diferencias; aplicar un modelo de audibilidad a la matriz de diferencias para generar una matriz de audibilidad; determinar un nivel de audibilidad para cada elemento de la matriz de audibilidad; y promediar los niveles de audibilidad determinados de la matriz para estimar la audibilidad de la muestra de audio. Esto permite determinar si una muestra de audio es audible en la mezcla de audio. A partir de entonces, es posible decidir si la muestra de audio se puede tener en cuenta con fines de atribución de derechos de autor.
En algunos ejemplos, el procedimiento puede comprender además una alineación en el tiempo y un ajuste de ganancia entre la matriz de representación de la muestra de audio y la matriz de representación de la mezcla de audio. Alinear en el tiempo puede comprender alinear en el tiempo usando picos espectrales. El uso de picos espectrales permite una correspondencia de audio simple, resistente al ruido y eficiente, ya que no necesita procesar toda la información de audio, sino solo unos pocos cientos de picos.
El ajuste de ganancia también se puede calcular utilizando picos espectrales, ya que proporcionan información suficiente para relacionar la potencia de los picos en la muestra de audio y la potencia de los picos en la mezcla.
En algunos ejemplos, la matriz de representación puede ser una matriz de representación en tiempo-frecuencia de baja resolución (por ejemplo, un output de bancos de filtros). Esto permite reducir la cantidad de información a procesar y a evitar detalles de alta resolución imperceptibles con afectación al resultado final.
En algunos ejemplos, el modelo de audibilidad puede ser un modelo de contorno de igual sonoridad, tal como un modelo de Fletcher-Munson. Esto permite determinar unos umbrales absolutos de audibilidad con mayor precisión, ya que tiene en cuenta los factores psico acústicos.
En algunos ejemplos, el procedimiento puede comprender además aplicar un modelo de enmascaramiento psico acústico a la mezcla de audio para generar la matriz de representación de la mezcla de audio. Esto permite producir un valor de audibilidad más preciso, ya que tiene en cuenta efectos de enmascaramiento que podrían reducir la audibilidad real de ciertas frecuencias.
En algunos ejemplos, el promedio se puede realizar en intervalos de tiempo para estimar la audibilidad de la muestra de audio en la mezcla de audio en cada intervalo de tiempo. Esto permite determinar partes de una muestra de audio que pueden ser más audibles y partes de la muestra de audio que pueden ser menos audibles. En base a la determinación, puede tener lugar un porcentaje de atribución de derechos de autor para cada intervalo de tiempo.
En algunos ejemplos, el procedimiento puede comprender además cuantificar la audibilidad estimada en un número predeterminado de niveles de audibilidad. Por ejemplo, se pueden establecer cuatro niveles de audibilidad y se puede atribuir la muestra de audio o partes de la muestra de audio a uno de los cuatro niveles.
En algunos ejemplos, la muestra de audio puede ser música y el audio adicional puede ser voz. Este es un escenario típico en programas de medios de radio difusión, tales como programas de entrevistas o programas de noticias, en los que la música se reproduce en el fondo de una discusión o una presentación.
En algunos ejemplos, el procedimiento puede comprender además proporcionar un programa de medio de radio difusión y proporcionar una hoja cue. El programa de medio de radio difusión puede comprender la mezcla de audio y la hoja cue puede comprender una indicación de la hora de inicio y la hora de finalización de la muestra de audio en el programa de medio de radio difusión. Esto puede ser proporcionado en una etapa de post producción. El uso de hojas cue permite automatizar el recorte de audio para estimar la audibilidad de cada muestra de audio individual.
En algunos ejemplos, la mezcla de audio puede comprender una pluralidad de muestras de audio y un audio adicional. El procedimiento puede comprender además recortar la mezcla de audio para aislar la parte de la mezcla de audio correspondiente a una sola muestra de audio. Esto puede permitir procesar y estimar la audibilidad de cada muestra de audio de la mezcla de audio.
BREVE DESCRIPCIÓN DE LOS DIBUJOS
A continuación, se describirán ejemplos no limitativos de la presente divulgación, con referencia a los dibujos adjuntos, en los que:
La Figura 1 ilustra esquemáticamente un diagrama de flujo de un procedimiento de estimar la audibilidad de una muestra de audio en una mezcla de audio de un programa de medio de radio difusión según un ejemplo;
La Figura 2A ilustra esquemáticamente una señal de audio con partes de señal de audibilidad variable;
La Figura 2B ilustra esquemáticamente una curva de audibilidad;
La Figura 3 ilustra esquemáticamente un diagrama de flujo de un procedimiento de estimar la audibilidad de una muestra de audio en una mezcla de audio de un programa de medio de radio difusión según otro ejemplo;
La Figura 4 ilustra esquemáticamente un diagrama de flujo de un procedimiento de estimar la audibilidad de una muestra de audio en una mezcla de audio de un programa de medio de radio difusión según otro ejemplo;
La Figura 5 ilustra esquemáticamente un proceso automático de hojas cue de radio difusión para estimar la audibilidad de varias muestras de audio de acuerdo con un ejemplo.
DESCRIPCIÓN DETALLADA DE EJEMPLOS
La Figura 1 ilustra esquemáticamente un diagrama de flujo de un procedimiento de estimar la audibilidad de una muestra de audio en una mezcla de audio de un programa de medio de radio difusión según un ejemplo. Se puede proporcionar una matriz de representación en tiempo-frecuencia de una mezcla de audio en el bloque 105. Se puede proporcionar una matriz de representación en tiempo-frecuencia alineada de una muestra de audio en el bloque 110. La muestra de audio puede ser música o una canción. Puede suponerse que la mezcla de audio comprende una copia de la muestra de audio junto con otro audio adicional, por ejemplo, voz. Luego se puede realizar una estimación de audibilidad 100. En el bloque 115, la matriz de representación de la muestra de audio puede ser restada de la matriz de representación de la mezcla de audio para generar una matriz de diferencias. Una vez que se ha generado la matriz de diferencias, se puede usar la información proporcionada por la matriz de diferencias para evitar que las regiones de muy baja potencia (incluso si no están enmascaradas) se consideren inaudibles. Para este propósito, se puede aplicar en el bloque 120 un modelo de audibilidad, por ejemplo: curvas de Fletcher-Munson, que se basa en experimentos psico acústicos, para determinar un umbral de audibilidad absoluto. Esto puede proporcionar una matriz de audibilidad como output. Luego, en el bloque 125, se pueden identificar las diversas regiones de tiempo-frecuencia potencialmente audibles, proporcionando así una curva de audibilidad 130.
La Figura 2A ilustra esquemáticamente una señal de audio con partes de señal de audibilidad variable. Una primera y una cuarta regiones A y D, respectivamente, se pueden caracterizar como regiones de audibilidad baja, una segunda región B como una región de audibilidad media y una tercera y una quinta regiones C y E, respectivamente, como no audibles. La Figura 2B ilustra esquemáticamente una curva de audibilidad. El eje horizontal representa el tiempo y el eje vertical el porcentaje de audibilidad desde 0% hasta 100%.
La audibilidad promedio se puede calcular promediando la curva de audibilidad. Este promedio puede entonces cuantificarse en, por ejemplo, cuatro categorías:
Audibilidad entre 0% y 10%: no audible
Audibilidad entre 10% y 30%: audibilidad baja
Audibilidad entre 30% y 70%: audibilidad media
Audibilidad entre 70% y 100%: audibilidad alta
La Figura 3 ilustra esquemáticamente un diagrama de flujo de un procedimiento de estimar la audibilidad de una muestra de audio en una mezcla de audio de un programa de medio de radio difusión según otro ejemplo. En el ejemplo de la Figura 3, se puede usar un modelo de enmascaramiento psico acústico para procesar la representación en tiempo-frecuencia de la mezcla de audio antes de realizar la resta. De manera similar al ejemplo comentado con referencia a la Figura 1, se puede proporcionar una matriz de representación de una mezcla de audio en el bloque 305. Luego, se puede realizar una estimación de la audibilidad 300. En el bloque 307, se puede usar un modelo de enmascaramiento psico acústico para procesar la representación en tiempo-frecuencia de la mezcla de audio. El modelo de enmascaramiento puede identificar los componentes tonales y no tonales de la señal de audio, y se aplica una función de enmascaramiento alrededor de cada uno de ellos. La suma de todas las funciones de enmascaramiento puede determinar el umbral de enmascaramiento, que puede ser concatenado fotograma a fotograma con el fin de crear el umbral de enmascaramiento en tiempo-frecuencia en forma de matriz según se especifica, por ejemplo, en la norma ISO/IEC 11172-3: 1993. El resultado puede ser una representación en tiempo-frecuencia del umbral de enmascaramiento. Cualquier sonido por debajo de este umbral se puede considerar enmascarado y, por lo tanto, se puede considerar inaudible. En el ejemplo de la Figura 3, la matriz de representación de la mezcla de audio es reemplazada por la representación en tiempo-frecuencia del umbral de enmascaramiento de la mezcla. De esta manera, se puede mejorar la estimación de la audibilidad para los casos en los que el enmascaramiento auditivo es perceptible. En el bloque 310 se puede proporcionar una representación matricial en tiempo-frecuencia alineada de una muestra de audio. La muestra de audio puede ser música o una canción. Luego, en el bloque 315, la matriz de representación de la muestra de audio puede ser restada de la matriz de umbral de enmascaramiento en tiempo-frecuencia de la mezcla de audio para generar una matriz de diferencias. Luego, nuevamente, de manera similar al ejemplo anterior, se puede aplicar un modelo de audibilidad en el bloque 320 para determinar un umbral de audibilidad absoluto. Esto puede proporcionar una matriz de audibilidad como output. Luego, en el bloque 325, las diversas regiones de tiempo-frecuencia potencialmente audibles pueden ser identificadas en la matriz de audibilidad. Entonces se puede generar una curva de audibilidad 330.
La Figura 4 ilustra esquemáticamente un diagrama de flujo de un procedimiento de estimar la audibilidad de una muestra de audio en una mezcla de audio de un programa de medio de radio difusión según otro ejemplo. En el ejemplo de la Figura 4, se usan los picos espectrales (también llamados puntos de referencia) para encontrar el ajuste de ganancia y el desplazamiento en tiempo de la muestra de audio en la mezcla de audio. Estas técnicas se aplican normalmente en la determinación de huellas de audio, y permiten encontrar la correspondencia o coincidencia óptima de un conjunto de puntos entre una consulta (es decir, la mezcla de audio) y una referencia (es decir, la muestra de audio). Se puede usar cualquier conjunto de picos espectrales, o puntos de referencia, capaces de resumir el contenido de audio original. En su definición más simple, los picos espectrales pueden ser máximos locales en la representación en tiempo-frecuencia (por ejemplo, transformada de Fourier de tiempo corto, transformada de Q constante, etc.). Estos picos espectrales se pueden usar para encontrar la alineación óptima entre dos audios que contienen la misma información (correspondencia o coincidencia). La alineación se puede realizar buscando picos con la misma frecuencia en la consulta y la referencia, y el mismo desplazamiento de tiempo relativo. Esta información coincidente es almacenada como una lista de picos comunes. Esta información se puede usar para calcular la alineación en el tiempo y la relación de amplitud entre la referencia y la consulta, en la que:
Alineación tiempo = ubicación tiempo en consulta - ubicación tiempo en referencia
y
Relación amplitud = amplitud en consulta/amplitud en referencia
Esta información se puede usar para alinear en el tiempo y ajustar la ganancia de la muestra con el fin de que suene como suena en la mezcla.
En la Figura 4, se proporciona la mezcla de audio en el bloque 405 y la muestra de audio en el bloque 410. Luego, se puede realizar la estimación de la alineación en el tiempo y la potencia relativa de la muestra de audio en la mezcla de audio en el bloque 400. En el bloque 415, se alinean las dos señales en el tiempo usando picos espectrales. El bloque 415 puede proporcionar la posición exacta en el tiempo de la muestra de audio en la mezcla de audio y la potencia de la muestra de audio en la mezcla. Luego, se proporcionan el vector de la señal de muestra de audio, la posición exacta en el tiempo de la muestra de audio en la mezcla de audio y la potencia de la muestra de audio en la mezcla al bloque 420, en el que se genera un tiempo desplazado y una señal de audio vectorial ajustada. En el bloque 425, se genera una representación matricial en tiempo-frecuencia 430 del vector de señal de audio. Ésta ya viene alineada en el tiempo del bloque 415. En paralelo, en el bloque 435 se genera una representación matricial en tiempo-frecuencia 440 del vector de señal de mezcla de audio. Luego, se proporcionan las dos matrices al bloque 450 en el que puede tener lugar la estimación de la audibilidad de acuerdo con los ejemplos proporcionados en este documento y luego se puede proporcionar una curva de audibilidad 460.
La Figura 5 ilustra esquemáticamente un proceso automático de hojas cue de radio difusión para estimar la audibilidad de varias muestras de audio de acuerdo con un ejemplo. En el bloque 505, se puede proporcionar el archivo de audio de un programa de medio de radio difusión como un vector de señal de audio largo. En el bloque 510, se pueden proporcionar los archivos de audio de las muestras de audio que pueden estar presentes en el programa de medio de radio difusión como un vector de señal de audio. En el bloque 515 se puede proporcionar la hoja cue. Los vectores se pueden recortar con el uso de la hoja cue en el bloque 520. El recorte puede generar un primer conjunto de vectores de señal de mezcla de audio 522n y un segundo conjunto de vectores de muestra de audio 524n. Los elementos de los conjuntos se pueden corresponder entre sí. Para cada par de vector de señal de mezcla de audio y vector de señal de muestra de audio, el proceso puede continuar en el bloque 525 con la estimación de la alineación en el tiempo y la potencia relativa de la muestra de audio en la mezcla de audio. Luego, en los bloques 530 y 535, se puede generar una matriz de representación en tiempo-frecuencia de la mezcla de audio y de la muestra de audio, respectivamente. Finalmente, en el bloque 540, puede tener lugar la estimación de la audibilidad utilizando procedimientos como los descritos en este documento para generar la curva de audibilidad 550.
Aunque solo se han descrito varios ejemplos en este documento, son posibles otras alternativas, modificaciones, usos y/o equivalentes de los mismos. Además, también se cubren todas las combinaciones posibles de los ejemplos descritos. Por lo tanto, el alcance de la presente divulgación no debe ser limitado por ejemplos particulares, sino que se debe determinar solo por medio de una lectura imparcial de las siguientes reivindicaciones. Los signos de referencia relacionados con los dibujos que se encuentran entre paréntesis en una reivindicación son únicamente para intentar aumentar la inteligibilidad de la reivindicación y no se deben interpretar como limitantes del alcance de la reivindicación.
Además, aunque los ejemplos descritos con referencia a los dibujos comprenden aparatos/sistemas informáticos y procesos realizados en aparatos/sistemas informáticos, la invención también se extiende a programas informáticos, particularmente programas informáticos en un portador, adaptados para poner en práctica el sistema.

Claims (15)

REIVINDICACIONES
1. Un procedimiento para estimar la audibilidad de una muestra de audio en una mezcla de audio de un programa de medio de radio difusión, que comprende:
proporcionar una matriz de representación de una mezcla de audio, comprendiendo la mezcla de audio la muestra de audio y un audio adicional;
proporcionar una matriz de representación de la muestra de audio;
restar la matriz de representación de la muestra de audio a la matriz de representación de la mezcla de audio para generar una matriz de diferencias;
aplicar un modelo de audibilidad a la matriz de diferencias para generar una matriz de audibilidad; determinar un nivel de audibilidad para cada elemento de la matriz de audibilidad;
promediar los niveles de audibilidad determinados de la matriz para estimar la audibilidad de la muestra de audio.
2. El procedimiento según la reivindicación 1, que comprende además una alineación en el tiempo entre la matriz de representación de la muestra de audio y la matriz de representación de la mezcla de audio.
3. El procedimiento según la reivindicación 2, en el que alinear en el tiempo comprende alinear en el tiempo usando picos espectrales.
4. El procedimiento según cualquiera de las reivindicaciones 1 a 3, que comprende además un ajuste de ganancia entre la matriz de representación de la muestra de audio y la matriz de representación de la mezcla de audio.
5. El procedimiento según cualquiera de las reivindicaciones 1 a 4, en el que la matriz de representación es una matriz de representación en tiempo-frecuencia de baja resolución.
6. El procedimiento según cualquiera de las reivindicaciones 1 a 5, en el que el modelo de audibilidad es un modelo de contorno de igual sonoridad.
7. El procedimiento según cualquiera de las reivindicaciones 1 a 6, en el que el modelo de audibilidad es un modelo de Fletcher-Munson.
8. El procedimiento según cualquiera de las reivindicaciones 1 a 7, que comprende además aplicar un modelo de enmascaramiento psico acústico a la mezcla de audio para generar la matriz de representación de la mezcla de audio.
9. El procedimiento según cualquiera de las reivindicaciones 1 a 8, en el que el promediado comprende promediar en intervalos de tiempo para estimar la audibilidad de la muestra de audio en la mezcla de audio en cada intervalo de tiempo.
10. El procedimiento según cualquiera de las reivindicaciones 1 a 9, que comprende además cuantificar la audibilidad estimada en un número predeterminado de niveles de audibilidad.
11. El procedimiento según cualquiera de las reivindicaciones 1 a 8, en el que la muestra de audio es música y el audio adicional es voz.
12. El procedimiento según cualquiera de las reivindicaciones 1 a 11, que comprende además
proporcionar un programa de medio de radio difusión, comprendiendo el programa de medio de radio difusión la mezcla de audio,
proporcionar una hoja cue, comprendiendo la hoja cue una indicación del momento de inicio y del momento de finalización de la muestra de audio en el programa de medio de radio difusión.
13. El procedimiento según la reivindicación 12, en el que la mezcla de audio comprende una pluralidad de muestras de audio y un audio adicional.
14. El procedimiento según la reivindicación 13, que comprende además recortar la mezcla de audio para aislar cada muestra de audio.
15. El procedimiento según la reivindicación 14, que comprende además estimar la audibilidad de cada muestra de audio del programa de radio difusión.
ES16192913T 2016-10-07 2016-10-07 Estimación de audibilidad de muestras de audio Active ES2730697T3 (es)

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
EP16192913.8A EP3306608B1 (en) 2016-10-07 2016-10-07 Estimating audibility of audio samples

Publications (1)

Publication Number Publication Date
ES2730697T3 true ES2730697T3 (es) 2019-11-12

Family

ID=57113213

Family Applications (1)

Application Number Title Priority Date Filing Date
ES16192913T Active ES2730697T3 (es) 2016-10-07 2016-10-07 Estimación de audibilidad de muestras de audio

Country Status (2)

Country Link
EP (1) EP3306608B1 (es)
ES (1) ES2730697T3 (es)

Families Citing this family (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN115265635B (zh) * 2022-09-29 2023-04-07 浙江中科凯泽科技有限公司 一种基于数据分析的工业机器视觉检测管理系统

Family Cites Families (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US8849432B2 (en) * 2007-05-31 2014-09-30 Adobe Systems Incorporated Acoustic pattern identification using spectral characteristics to synchronize audio and/or video
US9589550B2 (en) * 2011-09-30 2017-03-07 Harman International Industries, Inc. Methods and systems for measuring and reporting an energy level of a sound component within a sound mix

Also Published As

Publication number Publication date
EP3306608B1 (en) 2019-03-13
EP3306608A1 (en) 2018-04-11

Similar Documents

Publication Publication Date Title
ES2452557T3 (es) Procesador de audio espacial y método para proveer parámetros espaciales en base a una señal de entrada acústica
CN107004427B (zh) 增强多声道音频信号内语音分量的信号处理装置
ES2892773T3 (es) Procesador de audio para generar una señal reverberada a partir de una señal directa y método para el mismo
ES2749575T3 (es) Procesamiento avanzado basado en un banco de filtros complejo, exponencial y modulado
ES2773794T3 (es) Aparato y procedimiento para estimar una diferencia de tiempos entre canales
ES2733544T3 (es) Determinador de coeficientes de filtro de ecualización, aparato, procesador de coeficientes de filtro de ecualización, sistema y procedimientos
ES2323294T3 (es) Dispositivo de decodificacion con una unidad de decorrelacion.
US8194889B2 (en) Hybrid digital/analog loudness-compensating volume control
ES2959448T3 (es) Método y aparato de detección de actividad de voz
AU2008314183B2 (en) Device and method for generating a multi-channel signal using voice signal processing
ES2754260T3 (es) Aparato y método para generar una señal de salida que emplea un descomponedor
US9646625B2 (en) Audio correction apparatus, and audio correction method thereof
ES2755675T3 (es) Aparato y método para escalado de señales centrales y mejora estereofónica basada en una relación señal a mezcla a dos canales
MX2012009785A (es) Aparato para generar señal de mezcla descendente mejorada, metodo para generar señal de mezcla descendente mejorada y programa de computadora.
BR112013014173B1 (pt) Aparelho e método para decompor um sinal de entrada utilizando uma curva de referência pré-calculada
RU2010134915A (ru) Способ и устройство для обработки аудиосигнала
CN113273225B (zh) 音频处理
US9966081B2 (en) Method and apparatus for synthesizing separated sound source
JP2014072871A5 (es)
CN112951265B (zh) 音频处理方法、装置、电子设备和存储介质
Park et al. The absence of Rab27a accelerates the degradation of Melanophilin
ES2340784T3 (es) Aparato y metodo para sintetizar tres canales de salida, utilizando dos canales de entrada.
EP3306608B1 (en) Estimating audibility of audio samples
TW200734200A (en) Iptical authentication
CN108932953B (zh) 一种音频均衡函数确定方法、音频均衡方法及设备