EP4726717A1 - Procédé et dispositif de codage et de décodage audio - Google Patents

Procédé et dispositif de codage et de décodage audio

Info

Publication number
EP4726717A1
EP4726717A1 EP25208330.8A EP25208330A EP4726717A1 EP 4726717 A1 EP4726717 A1 EP 4726717A1 EP 25208330 A EP25208330 A EP 25208330A EP 4726717 A1 EP4726717 A1 EP 4726717A1
Authority
EP
European Patent Office
Prior art keywords
layers
audio
quantization
signal
compressed
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
EP25208330.8A
Other languages
German (de)
English (en)
Inventor
Martin DE CLOSETS
Cong Bang HUYNH
Baptiste MORISSE
Rodolphe LAMPE
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Thales SA
Original Assignee
Thales SA
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Thales SA filed Critical Thales SA
Publication of EP4726717A1 publication Critical patent/EP4726717A1/fr
Pending legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L19/04Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis using predictive techniques
    • G10L19/16Vocoder architecture
    • G10L19/18Vocoders using multiple modes
    • G10L19/24Variable rate codecs, e.g. for generating different qualities using a scalable representation such as hierarchical encoding or layered encoding
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L19/00Speech or audio signals analysis-synthesis techniques for redundancy reduction, e.g. in vocoders; Coding or decoding of speech or audio signals, using source filter models or psychoacoustic analysis
    • G10L2019/0001Codebooks
    • G10L2019/0007Codebook element generation
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L25/00Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
    • G10L25/27Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 characterised by the analysis technique
    • G10L25/30Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 characterised by the analysis technique using neural networks

Landscapes

  • Engineering & Computer Science (AREA)
  • Quality & Reliability (AREA)
  • Computational Linguistics (AREA)
  • Signal Processing (AREA)
  • Health & Medical Sciences (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Human Computer Interaction (AREA)
  • Physics & Mathematics (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Compression, Expansion, Code Conversion, And Decoders (AREA)

Abstract

Ce dispositif comporte un codeur audio (4) audio entraîné par apprentissage machine pour fournir en sortie, pour un signal audio d'entrée (SE), un signal compressé formé de symboles représentés sur un nombre N de couches de quantification successives et un décodeur audio (6) configuré pour reconstruire un signal audio reconstruit (SR) à partir d'un signal compressé formé de symboles, comportant un module de réduction de débit (14), mettant en œuvre un modèle de réduction de débit préalablement entraîné par apprentissage machine sur une base de données de signaux audio compressés, pour prédire à partir des N1 premières couches de quantification, un nombre N2 de couches de quantification suivantes, dites couches de raffinement, le modèle de réduction de débit étant un réseau de neurones récurrent et un module (16) de formation d'un signal compressé enrichi, fourni ensuite à un module de décodage (18) pour obtenir le signal audio reconstruit.

Description

  • La présente invention concerne un procédé et un dispositif de codage et de décodage audio, ainsi qu'un programme d'ordinateur associé.
  • L'invention se situe dans le domaine du codage et décodage audio, pour la réalisation de dispositifs de codage et décodage audio, également appelés codecs audio.
  • Plus particulièrement, l'invention se situe dans le domaine des codecs audio à bas ou très débit, embarquables sur des plateformes ayant des ressources calculatoires et énergétiques limitées.
  • De nombreuses applications pratiques nécessitent une communication audio, par exemple de commandes ou d'informations prononcées par un opérateur à destination d'un opérateur distant, en temps réel et de qualité suffisante pour la compréhension.
  • De manière connue, il est nécessaire de compresser les signaux audio, en particulier les signaux de parole, pour permettre leur transmission sur un réseau de communication à débit contraint. Des dispositifs de codage et décodage audio ont été mis au point à cet effet. De tels dispositifs sont utilisés dans de nombreux systèmes de communication, par exemple des systèmes de communication radio ou des systèmes de visioconférence.
  • Une problématique à résoudre est d'obtenir la restitution la plus fidèle possible du signal audio avant compression, avec le débit de transmission le plus bas possible, ou en d'autres termes, le meilleur taux de compression possible.
  • A cet effet, de nombreux systèmes de codage et décodage audio ont été mis au point. Récemment, des systèmes à base d'intelligence artificielle ont été proposés.
  • En plus des contraintes de débit et de qualité de restitution, il est également important de considérer la limitation de la consommation des ressources calculatoires et énergétiques d'un dispositif de codage et décodage audio, afin de permettre de l'embarquer sur des plateformes à ressources calculatoires et/ou énergétiques réduites.
  • Le but de l'invention est alors de remédier à ce problème, en proposant un procédé et dispositif de codage et décodage audio qui allie un fort taux de compression, une bonne qualité de reconstruction et une faible consommation de ressources.
  • A cet effet, l'invention a pour objet un procédé de codage et décodage audio, mis en œuvre dans un dispositif de codage et décodage audio comportant un codeur audio mettant en œuvre un modèle de compression et de quantification entraîné par apprentissage machine pour fournir en sortie, pour un signal audio d'entrée, un signal compressé formé de symboles représentés sur un nombre N de couches de quantification successives, les N1 premières couches de quantification desdites N couches de quantification correspondant à un premier débit de compression, et un décodeur audio configuré pour reconstruire un signal audio reconstruit à partir d'un signal compressé formé de symboles. Ce procédé comporte les étapes suivantes mises en œuvre par un processeur de calcul:
    • application d'un modèle de réduction de débit, préalablement entraîné par apprentissage machine sur une base de données de signaux audio compressés, pour prédire à partir des N1 premières couches de quantification, un nombre N2 de couches de quantification suivantes, dites couches de raffinement, le modèle de réduction de débit étant un réseau de neurones récurrent, ledit modèle de réduction de débit étant mis en œuvre sur un signal compressé reçu,
    • formation d'un signal compressé enrichi par ajout desdites couches de raffinement, le signal compressé enrichi étant fourni à un module de décodage audio pour obtenir le signal audio reconstruit.
  • Avantageusement, l'utilisation d'un modèle de réduction de débit permet de prédire, au décodage, les couches de raffinement pour obtenir un signal compressé enrichi et par conséquent un signal audio reconstruit de meilleure qualité. En d'autres termes, à partir d'un signal compressé à bas débit, grâce à l'utilisation du modèle de réduction de débit, un signal compressé enrichi correspondant à une compression à haut débit est obtenu. De plus avantageusement l'utilisation d'un réseau de neurones récurrent permet une mise en œuvre avec une consommation faible de ressources calculatoires et énergétiques, ce qui est particulièrement utile pour l'utilisation d'un tel procédé dans des systèmes de communication embarqués.
  • Le procédé de codage et décodage audio selon l'invention peut également présenter une ou plusieurs des caractéristiques ci-dessous, prises indépendamment ou selon toutes les combinaisons techniquement envisageables.
  • L'application d'un modèle de réduction de débit comporte une application d'une transformation de chaque symbole du signal compressé reçu en un vecteur de dimension prédéterminée, lesdits vecteurs formant une suite temporelle de vecteurs qui sont fournis en entrée dudit réseau de neurones récurrent.
  • Le réseau de neurones récurrent est formé d'une succession de couches de récurrence, chaque couche de récurrence comportant une pluralité de blocs de récurrence.
  • Le nombre de couches de récurrence est inférieur ou égal à 10.
  • Une dimension interne et une dimension de sortie dudit réseau de neurones récurrent sont réduites par application d'un paramètre de division.
  • Le paramètre de division a une valeur choisie, de préférence comprise entre 5 et 30.
  • Selon un autre aspect, l'invention concerne un dispositif de codage et de décodage audio comportant un codeur audio mettant en œuvre un modèle de compression et de quantification entraîné par apprentissage machine pour fournir en sortie, pour un signal audio d'entrée, un signal compressé formé de symboles représentés sur un nombre N de couches de quantification successives, les N1 premières couches de quantification desdites N couches de quantification correspondant à un premier débit de compression, et un décodeur audio configuré pour reconstruire un signal audio reconstruit à partir d'un signal compressé formé de symboles, comportant un processeur de calcul configuré pour mettre en œuvre :
    • un module de réduction de débit, mettant en œuvre un modèle de réduction de débit préalablement entraîné par apprentissage machine sur une base de données de signaux audio compressés, pour prédire à partir des N1 premières couches de quantification, un nombre N2 de couches de quantification suivantes, dites couches de raffinement, le modèle de réduction de débit étant un réseau de neurones récurrent, ledit modèle de réduction de débit étant mis en œuvre sur signal compressé reçu,
    • un module de formation d'un signal compressé enrichi par ajout desdites couches de raffinement, le signal compressé enrichi étant fourni à un module de décodage pour obtenir le signal audio reconstruit.
  • Selon un autre aspect, l'invention concerne un support d'enregistrement d'informations, sur lequel sont mémorisées des instructions logicielles pour l'exécution d'un procédé de codage et décodage audio tel que brièvement décrit ci-dessus, lorsque ces instructions sont exécutées par un dispositif électronique programmable.
  • Selon un aspect particulier, le module de réduction de débit est configuré pour appliquer une transformation de chaque symbole du signal compressé reçu en un vecteur de dimension prédéterminée, lesdits vecteurs formant une suite temporelle de vecteurs qui sont fournis en entrée dudit réseau de neurones récurrent.
  • Selon un aspect particulier, le réseau de neurones récurrent est formé d'une succession de couches de récurrence, chaque couche de récurrence comportant une pluralité de blocs de récurrence, le nombre de couches de récurrence étant inférieur ou égal à 10.
  • Selon un autre aspect, l'invention concerne un programme d'ordinateur comportant des instructions logicielles qui, lorsqu'elles sont mises en œuvre par un dispositif électronique programmable, mettent en œuvre un procédé de codage et décodage audio tel que brièvement décrit ci-dessus.
  • L'invention apparaîtra plus clairement à la lecture de la description qui va suivre, donnée uniquement à titre d'exemple non limitatif, et faite en référence aux dessins dans lesquels :
    • la figure 1 est une représentation schématique d'un système de codage/décodage audio selon un mode de réalisation;
    • la figure 2 est un synoptique des principaux blocs fonctionnels d'un module de réduction de débit selon un mode de réalisation ;
    • la figure 3 est un logigramme d'un procédé de codage/décodage audio selon un mode de réalisation;
    • la figure 4 est un schéma fonctionnel des d'un dispositif de codage/décodage audio selon un mode de réalisation.
  • L'invention s'applique dans le cadre de codage/décodage des signaux audio avec compression bas et très bas débit, et trouve en particulier des applications dans les dispositifs de communication audio embarqués sur tout type de plateforme, par exemple des dispositifs de communication portables.
  • La compression audio bas débit désigne une compression entre 1 et 5 kbps (kilo bits par seconde). La compression audio très bas débit correspond un débit inférieur à 1kbps.
  • Les signaux audio traités sont typiquement des signaux de parole, prononcés par un opérateur.
  • En référence à la figure 1, un système 2 de codage et décodage audio comporte un codeur et émetteur 4, appelé codeur 4 par la suite, et un récepteur et décodeur 6, appelé décodeur 6 par la suite.
  • Un signal audio SE est fourni en entrée d'un bloc de compression 8 du codeur 4, qui met en œuvre un modèle de compression entraîné par apprentissage machine, sur une base de données de signaux audio. Par exemple, le modèle de compression est un réseau de neurones.
  • De manière connue, un réseau de neurones comporte une succession ordonnée de couches de neurones dont chacune prend ses entrées sur les sorties de la couche précédente.
  • Plus précisément, chaque couche comprend des neurones prenant leurs entrées sur les sorties des neurones de la couche précédente, ou bien sur les variables d'entrée pour la première couche.
  • En variante, des structures de réseaux de neurones plus complexes peuvent être envisagées avec une couche qui peut être reliée à une couche plus lointaine que la couche immédiatement précédente.
  • À chaque neurone est également associée une opération, c'est-à-dire un type de traitement, à effectuer par ledit neurone au sein de la couche de traitement correspondante.
  • Chaque couche est reliée aux autres couches par une pluralité de synapses. Un poids synaptique est associé à chaque synapse, et chaque synapse forme une liaison entre deux neurones. C'est souvent un nombre réel, qui prend des valeurs positives comme négatives. Dans certains cas, le poids synaptique est un nombre complexe.
  • Chaque neurone est propre à effectuer une somme pondérée des valeur(s) reçue(s) de la part des neurones de la couche précédente, chaque valeur étant alors multipliée par le poids synaptique respectif de chaque synapse, ou liaison, entre ledit neurone et les neurones de la couche précédente, puis à appliquer une fonction d'activation, typiquement une fonction non-linéaire, à ladite somme pondérée, et à délivrer en sortie dudit neurone, en particulier aux neurones de la couche suivante qui lui sont connectés, la valeur résultant de l'application de la fonction d'activation. La fonction d'activation permet d'introduire une non-linéarité dans le traitement effectué par chaque neurone. La fonction sigmoïde, la fonction tangente hyperbolique, la fonction de Heaviside sont des exemples de fonction d'activation.
  • En complément facultatif, chaque neurone est également apte à appliquer, en outre, un facteur multiplicatif, et un biais additif, à la sortie de la fonction d'activation, et la valeur délivrée en sortie dudit neurone est alors le produit de la valeur facteur multiplicatif et de la valeur issue de la fonction d'activation, additionnée du biais.
  • Un réseau de neurones à convolution est aussi parfois dénommé réseau de neurones convolutif ou par le sigle CNN qui renvoie à la dénomination anglaise de « Convolutional Neural Networks ».
  • Dans un réseau de neurones à convolution, chaque neurone d'une même couche présente exactement le même schéma de connexion que ses neurones voisins, mais à différentes positions d'entrée. Le motif de connexion est appelé noyau de convolution ou, plus souvent, « kernel » en référence à la dénomination anglaise correspondante.
  • Une couche de neurones entièrement connectée est une couche dans laquelle les neurones de ladite couche sont chacun connectés à tous les neurones de la couche précédente.
  • Un tel type de couche est plus souvent dénommé selon le terme anglais de « fully connected », et parfois désigné sous la dénomination « couche dense ».
  • Les valeurs des poids, facteurs multiplicateurs et biais le cas échéant sont apprises lors d'une phase d'apprentissage machine pour réaliser la tâche de classification ou de prédiction.
  • En sortie du bloc de compression 8 est appliqué un bloc de quantification 10.
  • Par exemple, le bloc de quantification 10 est mis en œuvre en apprenant un dictionnaire représentant l'espace des signaux audio compressés. Le bloc de quantification associe alors à un vecteur d'entrée l'indice du mot du dictionnaire le plus proche de ce vecteur. Cette méthode de quantification est appelée « quantification vectorielle »
  • En sortie du bloc de quantification 10 est obtenu, pour le signal audio SE d'entrée, un signal compressé et quantifié Sc correspondant, comprenant une série de symboles (ou « tokens » en anglais) s-c1,...,s-ct, chaque symbole ayant une valeur quantifiée sur un nombre N donné de niveaux de quantification ou niveaux de profondeur, représentés sur un axe de profondeur.
  • A titre d'exemple non limitatif, dans la figure 1, N=8.
  • En notant M le nombre de valeurs possibles par niveau de quantification, le nombre de valeurs possibles des symboles est alors égale à MN.
  • Selon la dimension de profondeur, les symboles formant le signal compressé sont représentés en N couches de quantification successives, chaque couche correspondant à un niveau de quantification, partant d'un premier niveau de quantification (ou de profondeur) 1, correspondant à la quantification la plus grossière, jusqu'au niveau de quantification (ou de profondeur) N correspondant à la quantification la plus fine.
  • Ainsi, les N1 premières couches de quantification, par exemple N1=3, correspondent à un premier débit de compression, qui est un bas débit, alors que les N couches de quantification correspondent à un deuxième débit de compression qui est plus haut que le premier débit de compression.
  • En d'autres termes, le premier débit de compression correspond à un premier taux de compression et le deuxième débit de compression correspond à un deuxième taux de compression, le premier taux de compression étant plus élevé que le deuxième taux de compression.
  • En vue de faciliter la transmission sur un réseau de communication 5, de préférence le premier taux de compression est appliqué.
  • Une portion SC1 du signal compressé, correspondant aux N1 premières couches de quantification, par exemple N1 compris entre N/4 et 3*N/4, est transmise via le réseau de communication 5 vers le récepteur et décodeur 6. La portion Sc1 est un signal compressé correspondant à une compression de premier débit de compression, de bas ou très bas débit, du signal audio SE.
  • Le décodeur 6 comporte un module 14 de réduction de débit, qui met en œuvre un modèle de réduction de débit 15, préalablement entraîné sur une base de données de signaux audio compressés, les signaux audio compressés de cette base de données pouvant être différents des signaux audio compressés correspondants au signaux audio de la base de données utilisée pour l'entraînement du codeur, le modèle de réduction de débit étant entraîné par apprentissage machine pour prédire à partir des N1 premières couches de quantification, N2 couches de quantification suivantes, dites couches de raffinement, respectant la condition N1+N2 inférieur ou égal à N (i.e. N2 inférieur ou égal à N-N1).
  • Par exemple, N2=N-N1.
  • Dans l'exemple illustré dans la figure 1, N2=5.
  • Ainsi, avantageusement, le module 14 de réduction de débit permet de prédire les couches de raffinement 12 qui n'ont pas été transmises pour tous les symboles transmis, le débit correspondant à ces couches de raffinement étant alors économisé.
  • Le décodeur 6 comprend en outre un module 16 de recomposition, qui recompose un signal compressé enrichi, à N1+N2 couches de quantification, à partir du signal compressé reçu et des couches de raffinement prédites.
  • Le signal compressé enrichi est fourni en entrée d'un module de décodage 18 qui fournit un signal audio reconstruit SR.
  • Avantageusement, le signal audio reconstruit SR est de meilleure qualité qu'un signal audio reconstruit en fournissant en entrée du décodeur 6 uniquement la portion SC1 du signal compressé correspondant aux N1 premières couches de quantification seulement.
  • Avantageusement, le module 14 de réduction de débit met en œuvre un réseau de neurones récurrent, par exemple un réseau de neurones LSTM (pour « Long Short Term Memory »).
  • La figure 2 illustre un mode de réalisation d'un module 14 de réduction de débit à base d'un réseau de neurones récurrent.
  • Le module de réduction de débit 14 reçoit en entrée une portion de signal compressé correspondant aux N1 premières couches de quantification, et comprenant T symboles successifs, chaque symbole étant codé sur N1 couches de quantification.
  • Le module 14 est configuré pour mettre en œuvre une transformation 30 de chaque symbole s-cj en un vecteur Xj de dimension prédéterminée Dim. Une telle transformation est connue sous le nom de « embedding » en anglais.
  • La dimension prédéterminée Dim est typiquement égale à 64, 128 ou 256, de préférence égale à 64 afin de limiter la taille des vecteurs et par conséquent, de limiter le nombre de calculs.
  • Une suite temporelle de vecteurs X1,.. XT représentés dans un espace discret de dimension Dim, également appelé espace latent, est obtenue.
  • Le module 14 de réduction de débit est configuré pour appliquer à l'étape 32 un modèle récurrent LSTM. Les vecteurs X1....XT sont alors fournis, dans un ordre temporel croissant, au réseau de neurones récurrent.
  • L'étape 32 d'application d'un modèle récurrent LSTM met en œuvre de blocs de récurrence 341 à 34L sur L niveaux ou couches de récurrence. Chaque bloc de récurrence applique des opérations prédéfinies.
  • Pour une couche de récurrence donnée, chaque bloc de récurrence 34j prend en entrée des résultats de calculs correspondants appliqués à des éléments précédents temporellement. Pour une couche de récurrence suivante, on utilise en entrée les sorties de la couche de récurrence précédente.
  • Dans l'exemple, pour une couche de récurrence d'indice I, un bloc de récurrence prend en entrée des éléments c t 1 l , h t 1 l qui sont des résultats du bloc de récurrence précédent temporelle (indice temporel t-1) de la même couche de récurrence et un élément h t l 1 de sortie de la couche de récurrence précédente d'indice I-1.
  • Pour la première couche de récurrence, les éléments X1... XT sont fournis en entrée.
  • Avantageusement, le modèle de réseau de neurones récurrent utilisé est dimensionné pour avoir un nombre de paramètres restreint, et un nombre d'opérations à effectuer restreint, de manière à consommer moins de ressources mémoire et calculatoires.
  • De préférence, afin de limiter le nombre de ressources calculatoires utilisées, le nombre L de couches de récurrence est limité, par exemple L est inférieur ou égal à 10.
  • De préférence, la dimension interne (dimension des résultats intermédiaires, vecteurs C et H) et la dimension de sortie du réseau de neurones récurrent LSTM est réduite à M/div, où « div » est un paramètre de division à ajuster pour respecter des contraintes de complexité calculatoire.
  • Par exemple, le paramètre de division « div » a une valeur choisie de sorte à limiter le nombre de paramètres mis en œuvre dans le réseau de neurones récurrent à un nombre maximal prédéterminé.
  • Par exemple, le paramètre de division « div » a une valeur comprise entre 5 et 30
  • Le module de réduction de débit 14 est configuré pour appliquer ensuite une étape 36 de projection (communément appelée couche dense) pour transformer l'espace latent de sortie du réseau de neurones récurrent vers des prédictions de probabilités non normalisées des couches de raffinement correspondantes. Le nombre de prédictions est égal à (N2xM)xT.
  • En sortie, le module de réduction de débit fournit les N2 couches de raffinement prédites (référence 12), à partir des probabilités obtenues à l'étape 36.
  • Avantageusement, le module de réduction de débit 14 décrit réalise une prédiction de toutes les couches de raffinement simultanément, ce qui permet d'améliorer la complexité temporelle.
  • Les principales étapes d'un procédé de codage et décodage audio dans un mode de réalisation sont décrites en référence à la figure 3.
  • Côté codeur, le procédé comporte, sur un signal audio SE d'entrée, la mise en œuvre 40 d'un modèle 42 de compression et de quantification.
  • De préférence le modèle de compression et de quantification est un modèle entraîné par apprentissage machine sur une base de données de signaux audio, de préférence de signaux audio de bonne qualité (intelligible, sans bruit...).
  • Par exemple dans un mode de réalisation le modèle de compression et de quantification est formé d'un réseau de neurones et d'une couche de quantification vectorielle comme décrit ci-dessus.
  • Le procédé comporte ensuite une étape de transmission 44 d'un signal compressé formé des N1 premières couches de quantification, représentation grossière du signal audio d'entrée correspondant à un codage à bas ou très bas débit.
  • Côté décodeur, le signal compressé est reçu à l'étape de réception 46.
  • Ensuite, le modèle de réduction de débit préalablement entraîné est mis en œuvre à l'étape 48 sur le signal compressé reçu pour prédire N2 couches de quantification non transmises. Par exemple, un module de réduction de débit tel que décrit ci-dessus en référence à la figure 2 est mis en œuvre.
  • Le procédé comprend alors une étape 50 de formation d'un signal compressé enrichi, à N1+N2 couches de quantification.
  • Ce signal compressé enrichi est fourni en entrée d'un décodeur 52, qui permet de reconstruire un signal audio dit signal audio reconstruit, SR, à partir d'un signal compressé par le modèle de compression et de quantification 42.
  • Dans un mode de réalisation, le procédé de codage et décodage audio est mis en œuvre par un dispositif de codage et décodage audio, également appelé codec audio.
  • La figure 4 illustre schématiquement un codec audio 60 configuré pour mettre en œuvre un procédé de codage et de décodage audio, selon un mode de réalisation.
  • Le codec audio 60 est un dispositif électronique programmable.
  • Le dispositif 60 comporte au moins un processeur de calcul 62, au moins une unité de mémoire électronique 64, une interface de communication 66 et optionnellement, une interface homme-machine 68, adaptées à communiquer via un bus de communication 65.
  • La mémoire électronique 64 est configurée pour mémoriser le modèle 42 de compression et de quantification, préalablement entraîné pour cette tâche, ainsi que le modèle de réduction de débit 15, préalablement entraîné pour cette tâche.
  • Le processeur de calcul 62 est configuré pour exécuter un module codeur 70, qui applique le modèle de compression et quantification sur un signal audio d'entrée, pour fournir un signal compressé, appliqué lors du codage d'un signal audio.
  • Le processeur de calcul 62 est également configuré pour exécuter les modules suivants, lors d'un décodage d'un signal audio :
    • un module 72 de réduction de débit, configuré pour appliquer le modèle de réduction de débit préalablement entraîné sur une base de données de signaux audio compressés, pour prédire à partir des N1 premières couches de quantification, un nombre N2 de couches de quantification suivantes,
    • un module 74 de formation d'un signal compressé enrichi,
    • un module de décodage 76, qui met en œuvre un décodage adapté pour reconstruire un signal audio à partir d'un signal compressé par le codeur audio 70.
  • Dans un mode de réalisation, les modules 70, 72, 74, 76 sont réalisés sous forme d'instructions logicielles formant un programme d'ordinateur, qui, lorsqu'il est exécuté par un dispositif électronique programmable, met en œuvre un procédé d'analyse automatique de désapprentissage d'au moins une classe par un modèle de classification de données selon l'invention.
  • En variante non représentée, les modules 70, 72, 74, 76 sont réalisés chacun sous forme de composants logiques programmables, tels que des FPGA (de l'anglais Field Programmable Gate Array), des microprocesseurs, des composants GPGPU (de l'anglais General-purpose processing on graphies processing), ou encore de circuits intégrés dédiés, tels que des ASIC (de l'anglais Application Specific Integrated Circuit).
  • Le programme d'ordinateur comportant des instructions logicielles est en outre apte à être enregistré sur un support d'enregistrement d'informations, non-transitoire et lisible par ordinateur. Ce support lisible par ordinateur est par exemple, un médium apte à mémoriser les instructions électroniques et à être couplé à un bus d'un système informatique. A titre d'exemple, ce support est un disque optique, un disque magnéto-optique, une mémoire ROM, une mémoire RAM, tout type de mémoire non-volatile (par exemple EPROM, EEPROM, FLASH, NVRAM), une carte magnétique ou une carte optique.
  • Avantageusement, le procédé décrit permet de réaliser un gain de débit en passant de 2400 bits/seconde à 600bits/seconde tout en conservant une qualité audio et une intelligibilité suffisante.
  • Avantageusement, le procédé de codage et décodage audio décrit peut être mis en en œuvre dans un codec a faible consommation énergétique, typiquement à moins de 50mW grâce à la mise en œuvre de modèles de réseau de neurones à nombre de paramètres restreint, typiquement inférieur à 2millions.

Claims (10)

  1. Procédé de codage et décodage audio, mis en œuvre dans un dispositif de codage et décodage audio comportant un codeur audio (4) mettant en œuvre un modèle de compression et de quantification entraîné par apprentissage machine pour fournir en sortie, pour un signal audio d'entrée, un signal compressé formé de symboles représentés sur un nombre N de couches de quantification successives, les N1 premières couches de quantification desdites N couches de quantification correspondant à un premier débit de compression, et un décodeur audio (6) configuré pour reconstruire un signal audio reconstruit à partir d'un signal compressé formé de symboles,
    le procédé étant caractérisé en ce qu'il comporte les étapes suivantes mises en œuvre par un processeur de calcul:
    - application (48) d'un modèle de réduction de débit (15), préalablement entraîné par apprentissage machine sur une base de données de signaux audio compressés, pour prédire à partir des N1 premières couches de quantification, un nombre N2 de couches de quantification suivantes, dites couches de raffinement, le modèle de réduction de débit (15) étant un réseau de neurones récurrent, ledit modèle de réduction de débit (15) étant mis en œuvre sur un signal compressé reçu (SC1),
    - formation (50) d'un signal compressé enrichi par ajout desdites couches de raffinement, le signal compressé enrichi étant fourni à un module de décodage audio pour obtenir le signal audio reconstruit.
  2. Procédé selon la revendication 1, dans lequel l'application d'un modèle de réduction de débit (15) comporte une application d'une transformation (30) de chaque symbole du signal compressé reçu en un vecteur de dimension prédéterminée, lesdits vecteurs formant une suite temporelle de vecteurs qui sont fournis en entrée dudit réseau de neurones récurrent.
  3. Procédé selon la revendication 1 ou 2, dans lequel ledit réseau de neurones récurrent est formé d'une succession de couches de récurrence, chaque couche de récurrence comportant une pluralité de blocs de récurrence.
  4. Procédé selon la revendication 3, dans lequel le nombre de couches de récurrence est inférieur ou égal à 10.
  5. Procédé selon l'une des revendications 3 ou 4, dans lequel une dimension interne et une dimension de sortie dudit réseau de neurones récurrent sont réduites par application d'un paramètre de division.
  6. Procédé selon la revendication 4, dans lequel ledit paramètre de division a une valeur choisie, de préférence comprise entre 5 et 30.
  7. Programme d'ordinateur comportant des instructions logicielles qui, lorsqu'elles sont exécutées par un dispositif de codage et de décodage audio, mettent en œuvre un procédé de codage et décodage audio conforme aux revendications 1 à 6.
  8. Dispositif de codage et de décodage audio, comportant un codeur audio (4) mettant en œuvre un modèle de compression et de quantification entraîné par apprentissage machine pour fournir en sortie, pour un signal audio d'entrée, un signal compressé formé de symboles représentés sur un nombre N de couches de quantification successives, les N1 premières couches de quantification desdites N couches de quantification correspondant à un premier débit de compression, et un décodeur audio (6) configuré pour reconstruire un signal audio reconstruit à partir d'un signal compressé formé de symboles, caractérisé en ce qu'il comporte un processeur de calcul (62) configuré pour mettre en œuvre :
    - un module de réduction de débit (72), mettant en œuvre un modèle de réduction de débit (15) préalablement entraîné par apprentissage machine sur une base de données de signaux audio compressés, pour prédire à partir des N1 premières couches de quantification, un nombre N2 de couches de quantification suivantes, dites couches de raffinement, le modèle de réduction de débit étant un réseau de neurones récurrent, ledit modèle de réduction de débit (15) étant mis en œuvre sur signal compressé reçu,
    - un module (74) de formation d'un signal compressé enrichi par ajout desdites couches de raffinement, le signal compressé enrichi étant fourni à un module de décodage (76) pour obtenir le signal audio reconstruit.
  9. Dispositif selon la revendication 8, dans lequel ledit module de réduction de débit (72) est configuré pour appliquer une transformation (30) de chaque symbole du signal compressé reçu en un vecteur de dimension prédéterminée, lesdits vecteurs formant une suite temporelle de vecteurs qui sont fournis en entrée dudit réseau de neurones récurrent.
  10. Dispositif selon la revendication 8 ou 9, dans lequel ledit réseau de neurones récurrent est formé d'une succession de couches de récurrence, chaque couche de récurrence comportant une pluralité de blocs de récurrence, le nombre de couches de récurrence étant inférieur ou égal à 10.
EP25208330.8A 2024-10-14 2025-10-13 Procédé et dispositif de codage et de décodage audio Pending EP4726717A1 (fr)

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
FR2411062A FR3167473A1 (fr) 2024-10-14 2024-10-14 Procédé et dispositif de codage et de décodage audio

Publications (1)

Publication Number Publication Date
EP4726717A1 true EP4726717A1 (fr) 2026-04-15

Family

ID=95025045

Family Applications (1)

Application Number Title Priority Date Filing Date
EP25208330.8A Pending EP4726717A1 (fr) 2024-10-14 2025-10-13 Procédé et dispositif de codage et de décodage audio

Country Status (2)

Country Link
EP (1) EP4726717A1 (fr)
FR (1) FR3167473A1 (fr)

Citations (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US20220044694A1 (en) * 2018-10-29 2022-02-10 Dolby International Ab Methods and apparatus for rate quality scalable coding with generative models

Patent Citations (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US20220044694A1 (en) * 2018-10-29 2022-02-10 Dolby International Ab Methods and apparatus for rate quality scalable coding with generative models

Non-Patent Citations (3)

* Cited by examiner, † Cited by third party
Title
JENRUNGROT TEERAPAT ET AL: "LMCodec: A Low Bitrate Speech Codec with Causal Transformer Models", ICASSP 2023 - 2023 IEEE INTERNATIONAL CONFERENCE ON ACOUSTICS, SPEECH AND SIGNAL PROCESSING (ICASSP), IEEE, 4 June 2023 (2023-06-04), pages 1 - 5, XP034451243, DOI: 10.1109/ICASSP49357.2023.10095442 *
XUE JIANG ET AL: "Latent-Domain Predictive Neural Speech Coding", ARXIV.ORG, CORNELL UNIVERSITY LIBRARY, 201 OLIN LIBRARY CORNELL UNIVERSITY ITHACA, NY 14853, 25 May 2023 (2023-05-25), XP091517840, DOI: 10.1109/TASLP.2023.3277693 *
ZAL\'AN BORSOS ET AL: "AudioLM: a Language Modeling Approach to Audio Generation", ARXIV.ORG, CORNELL UNIVERSITY LIBRARY, 201 OLIN LIBRARY CORNELL UNIVERSITY ITHACA, NY 14853, 7 September 2022 (2022-09-07), XP091312688 *

Also Published As

Publication number Publication date
FR3167473A1 (fr) 2026-04-17

Similar Documents

Publication Publication Date Title
EP0608174B1 (fr) Systeme de codage-décodage prédictif d'un signal numérique de parole par transformée adaptative à codes imbriqués
GB2624754A (en) Image and object inpainting with diffusion models
US12198298B2 (en) Video processing method and apparatus
US12322007B2 (en) Systems and methods for color palette optimization
US20180176570A1 (en) Deep learning based on image encoding and decoding
WO2022207573A1 (fr) Autoencodeur multimodal a fusion de donnees latente amelioree
US20220207352A1 (en) Methods and systems for generating recommendations for counterfactual explanations of computer alerts that are automatically detected by a machine learning algorithm
EP1794748B1 (fr) Procédé de traitement de données par passage entre domaines différents de sous-bandes
US20220207353A1 (en) Methods and systems for generating recommendations for counterfactual explanations of computer alerts that are automatically detected by a machine learning algorithm
EP0020220B1 (fr) Dispositif de décodage binaire et système de transmission comportant un tel dispositif
CN117436408A (zh) 一种语义通信方法、装置、设备以及存储介质
CN115361555B (zh) 图像编码方法、图像编码方法、装置以及计算机存储介质
CN110633735A (zh) 基于小波变换的渐进式深度卷积网络图像识别方法及装置
US20230262237A1 (en) System and methods for video analysis
Carra et al. DNN split computing: Quantization and run-length coding are enough
EP4487323B1 (fr) Codage et décodage optimisé d'un signal audio utilisant un auto-encodeur à base de réseau de neurones
EP4726717A1 (fr) Procédé et dispositif de codage et de décodage audio
WO2007107659A2 (fr) Quantification vectorielle contrainte
EP0364333A1 (fr) Procédé et dispositif de validation de plots, pour radar, avec mise à jour autoadaptative
EP1836699B1 (fr) Procédé et dispositif de codage audio optimisé entre deux modèles de prediction à long terme
FR2646543A1 (fr) Procede pour l'analyse de textures et analyseur
FR2597282A1 (fr) Procede de quantification dans un codage par transformation pour la transmission de signaux d'image
CN114067785A (zh) 语音深度神经网络训练方法、装置、存储介质及电子装置
EP0456804B1 (fr) Procede de compression d'images par auto-organisation d'un reseau neuronal
EP4078816B1 (fr) Procede et dispositif de codage binaire de signaux pour implementer des operations mac numeriques a precision dynamique

Legal Events

Date Code Title Description
PUAI Public reference made under article 153(3) epc to a published international application that has entered the european phase

Free format text: ORIGINAL CODE: 0009012

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE APPLICATION HAS BEEN PUBLISHED

AK Designated contracting states

Kind code of ref document: A1

Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC ME MK MT NL NO PL PT RO RS SE SI SK SM TR