EP4630969A1 - Procédé et dispositif de codage et décodage de séquences d'images - Google Patents
Procédé et dispositif de codage et décodage de séquences d'imagesInfo
- Publication number
- EP4630969A1 EP4630969A1 EP23818383.4A EP23818383A EP4630969A1 EP 4630969 A1 EP4630969 A1 EP 4630969A1 EP 23818383 A EP23818383 A EP 23818383A EP 4630969 A1 EP4630969 A1 EP 4630969A1
- Authority
- EP
- European Patent Office
- Prior art keywords
- group
- sequence
- images
- characteristic
- maps
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Pending
Links
Classifications
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04N—PICTORIAL COMMUNICATION, e.g. TELEVISION
- H04N19/00—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals
- H04N19/10—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals using adaptive coding
- H04N19/134—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals using adaptive coding characterised by the element, parameter or criterion affecting or controlling the adaptive coding
- H04N19/136—Incoming video signal characteristics or properties
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/04—Architecture, e.g. interconnection topology
- G06N3/045—Combinations of networks
- G06N3/0455—Auto-encoder networks; Encoder-decoder networks
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/04—Architecture, e.g. interconnection topology
- G06N3/0475—Generative networks
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/04—Architecture, e.g. interconnection topology
- G06N3/0499—Feedforward networks
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/08—Learning methods
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04N—PICTORIAL COMMUNICATION, e.g. TELEVISION
- H04N19/00—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals
- H04N19/10—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals using adaptive coding
- H04N19/102—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals using adaptive coding characterised by the element, parameter or selection affected or controlled by the adaptive coding
- H04N19/132—Sampling, masking or truncation of coding units, e.g. adaptive resampling, frame skipping, frame interpolation or high-frequency transform coefficient masking
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04N—PICTORIAL COMMUNICATION, e.g. TELEVISION
- H04N19/00—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals
- H04N19/50—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals using predictive coding
- H04N19/59—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals using predictive coding involving spatial sub-sampling or interpolation, e.g. alteration of picture size or resolution
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04N—PICTORIAL COMMUNICATION, e.g. TELEVISION
- H04N19/00—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals
- H04N19/90—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals using coding techniques not provided for in groups H04N19/10-H04N19/85, e.g. fractals
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/04—Architecture, e.g. interconnection topology
- G06N3/044—Recurrent networks, e.g. Hopfield networks
- G06N3/0442—Recurrent networks, e.g. Hopfield networks characterised by memory or gating, e.g. long short-term memory [LSTM] or gated recurrent units [GRU]
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/04—Architecture, e.g. interconnection topology
- G06N3/0464—Convolutional networks [CNN, ConvNet]
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/08—Learning methods
- G06N3/084—Backpropagation, e.g. using gradient descent
Definitions
- the invention relates to the general field of coding of digital image sequences. It concerns more particularly the compression of digital videos.
- Digital videos are generally subject to source coding aimed at compressing them in order to limit the resources necessary for their transmission and/or storage.
- Encoding an image is generally carried out by dividing the image into several rectangular blocks, and encoding these blocks of pixels according to a given processing sequence.
- the processing of a block typically includes a prediction of the pixels of the block carried out using previously encoded and then decoded pixels present in the image being encoded, in which case we speak of " Intra prediction”, or previously encoded images, in which case we speak of “Inter prediction”.
- Autoencoders are learning algorithms based on artificial neural networks, which make it possible to construct a new representation of a data set.
- the architecture of an autoencoder consists of two parts: the encoder and the decoder.
- the encoder is made up of a set of layers of neurons, which process the data in order to construct new so-called “encoded” representations, also called “latent representations”.
- the decoder's neuron layers receive these representations and filter them in an attempt to reconstruct the original data.
- the differences between the reconstructed data and the initial data make it possible to measure the error made by the autoencoder.
- the training consists of modifying the parameters of the autoencoder in order to reduce the reconstruction error measured on the different samples of the dataset.
- the performance of such autoencoder-based systems comes at the cost of a considerable increase in memory footprint and complexity compared to conventional approaches as proposed by compression standards. They can have millions of parameters and can require up to a million MACs (multiply-accumulate) to decode a single pixel. This makes such decoders much more complex than conventional decoders, which could hinder the adoption of learning-based compression.
- transformation of characteristic maps we mean a mathematical operation which makes it possible to transform the values of a first map into the values of a second map.
- a first card called the card of the first group, intended for coding, is arbitrary.
- a second map called a transformed map, or map of the second group, is at the same resolution as the input images, that is to say it has as many values as an input image (resp. to decode) contains samples (N).
- the transformation may include, for example, interpolation, oversampling, filtering, quantization, Fourier transform, etc.
- neural network or “synthetic neural network”, we mean a neural network such as a convolutional neural network, a multilayer perceptron, an LSTM (for “Long Short Term Memory” in English), etc.
- processing by a neural network we mean the application of a function expressed by a neural network to the input characteristic vector to produce an output vector representative of the sample to be coded (resp. decode).
- This output vector may include one or more data representative of the sample.
- construction step we mean a step which aims to construct the parameters representative of the image, before their effective coding.
- the construction substeps can be iterated as necessary to obtain an acceptable performance measure.
- steps of a coding or decoding process should not be interpreted as being linked to a notion of temporal succession. In other words, the steps can be carried out in an order different from that indicated in the independent encoding or decoding claim, or even in parallel.
- the coding method constructs the coding parameters, from a sequence of input images, by training a neural network on characteristic vectors associated with a position of a sample to be coded in each of the input images. These feature vectors are constructed from feature maps which can be at the resolution of the input images, or at a lower resolution. During training, or construction, the parameters of the neural network and the values of the feature maps are updated according to a performance measure, for example of the flow-distortion type. When the training is completed, that is to say the performance measurement obtained is satisfactory, the actual coding of the parameters of the neural network and the values of the characteristic maps can be carried out and stored or transmitted to the decoder. .
- the training process makes it possible to refine the parameters of the neural network and/or the values of the feature maps until an adequate representation in terms of performance is obtained, for example a desired balance between the generated flow and the distortion suffered by the input images.
- the training of the values of the feature maps and the parameters of the neural network can be joint.
- the coding method according to the invention makes it possible to effectively compress the image signal by exploiting the intra-image spatial redundancies but also the inter-image redundancies between the images of the sequence, whether it is a sequence of video images or a plurality of multi-view images, a series of medical images, etc.
- the decoding method is simple since it suffices to decode the feature maps and the neural network to reconstruct a decoded version of a sequence of images.
- Such a neural network can advantageously be very simple in structure with few parameters.
- the method comprises a step of transforming said first group of characteristic maps to obtain a second group of characteristic maps at the resolution of the images of the sequence, the method being characterized in that said characteristic vector is constructed from said characteristic maps of the second group.
- the characteristic maps are divided into two groups, one of which is reserved for the extraction of the characteristic vectors and the other for coding.
- At least one of the characteristic maps of the first group is of lower resolution than that of said images to be encoded (resp. decode) and the transformation operation includes oversampling.
- the compression of the characteristic maps is more effective since at least one of the characteristic maps of the first group, to be encoded (resp. decode) has fewer values than if it were at the resolution of the images.
- one of the feature maps in the first group may be at 1/2 resolution, that is, it has half as many abscissa and ordinate values as the input image. contains samples, i.e. in total 4 times fewer values than a feature map at image resolution.
- the characteristic map of the second group which corresponds to a transformation of this map of the first group is of identical resolution to that of the images.
- the transformation therefore comprises in this case at least one oversampling operation to obtain the same number of values in this transformed map as one of the input images (resp. to be decoded) has samples.
- At least one of said characteristic maps of the first group is of identical resolution to that of the images to be encoded (resp. decode).
- At least one of the characteristic maps allows significant fidelity and respect for the details of the initial resolution of the images of the sequence.
- the transformation in this case preserves the number of values of the transformed feature map. It can be reduced to identity (no processing is carried out on the values of the map of the first group) or include a filtering operation, quantification, a Fourier transformation, etc.
- quantification is essential for the proper functioning of the system if the characteristic maps include for example floating or real values. It is necessary to quantify them before coding them and/or providing them as input to the neural network.
- inverse quantification is not always necessary, depending on the embodiments.
- the construction of said characteristic vector comprises a sub-step of extracting a value from said at least one characteristic map at a position identical to that of the current samples in the images to be encoded (resp. decode).
- the characteristic vector is extracted from the characteristic maps, which can be any, and in particular at a resolution lower than that of the images to be encoded (resp. decode), before undergoing processing.
- processing may for example correspond to quantification of the extracted data, or to scaling, or to filtering, etc.
- quantification is essential for the proper functioning of the system if the characteristic maps include, for example, floating or real values. It is necessary to quantify them before coding them and/or providing them as input to the neural network. On the other hand, during decoding, inverse quantification is not necessary, depending on the embodiments.
- the method comprises a step of constructing a group of additional feature maps, and the feature vector is further constructed from said additional feature maps.
- these additional cards of a third group constructed in an identical manner to the encoder and the decoder, are neither stored nor transmitted at the level of the encoder, nor decoded at the level of the decoder. They thus make it possible to benefit from additional data to improve compression without degrading the throughput. They can for example include coordinates, causal data available in the cards of the first or second group, data concerning other images already processed by the encoder or decoder, etc.
- an additional card contains a value representative of the temporal distance between the images of the video.
- the invention also relates to a computer program on a recording medium, this program being capable of being implemented in a computer or a control device conforming to the invention.
- This program includes instructions adapted to the implementation of the corresponding process.
- This program may use any programming language, and be in the form of source code, object code, or intermediate code between source code and object code, such as in a partially compiled form, or in any other desirable shape.
- the invention also relates to an information medium or a recording medium readable by a computer, and comprising computer program instructions mentioned above.
- Information or recording media can be any entity or device capable of storing programs.
- the media may comprise a storage means, such as a ROM, for example a CD-ROM or a microelectronic circuit ROM, or even a magnetic recording means, for example a floppy disk or a hard disk, a DNA sequence, or flash memory.
- the information or recording media can be transmissible media such as an electrical or optical signal, which can be conveyed via an electric or optical cable, by radio link, by wireless optical link or by other ways.
- the program according to the invention can in particular be downloaded onto an Internet type network.
- each information or recording medium may be an integrated circuit in which the program is incorporated, the circuit being adapted to execute or to be used in the execution of a method according to the invention.
- Figure 1 schematically represents a coding device used in the context of the invention
- Figure 2 schematically represents a decoding device used in the context of the invention
- Figure 3 illustrates an example of a synthetic artificial neural network used in the context of the invention for coding and decoding
- Figure 4 is a flowchart representing an example of a coding method which can be implemented by the coding device of Figure 1;
- Figure 5 illustrates a coding method used in one embodiment of the invention
- Figure 6 is a flowchart representing an example of a decoding method which can be implemented by the decoding device of Figure 2;
- Figure 7 illustrates a decoding method used in one embodiment of the invention.
- Figure 1 schematically represents an ENC coding device.
- This ENC coding device includes a GEN module for generating characteristic maps, a SE transformation module, an XTR data extraction module, a TT module for processing and quantification, an MLP module corresponding to a network of artificial neurons, an NNC module for coding a neural network, an FMC module for coding characteristic maps, an EVAL module for evaluating a performance function, an MAJ update module, an optional FME generation module additional feature cards.
- the ENC coding device can be implemented by means of an electronic device comprising a processor and a memory, not shown; each of the modules mentioned above can then be produced by the cooperation of the processor and computer program instructions stored in the aforementioned memory and designed to carry out the functionalities of the module concerned, in particular as described below, when these instructions are executed by the processor.
- the ENC coding device of Figure 1 receives as input a sequence of at least two images to be coded, denoted I(Pvn), each respectively comprising a plurality of Pvn samples.
- the subscript v indicates the image number in the sequence of V images.
- the index n indicates the pixel number in an image of N pixels.
- the image I(Pvn) can represent a two-dimensional image and the sequence a plurality of two-dimensional images (video sequence, stereoscopic, multiscopic components, series of medical images, etc.).
- an image of the sequence is represented by means of at least one two-dimensional representation, such as a matrix of pixels, each pixel comprising a vector of red (R), green (G), blue ( B), or, alternatively, a luminance component and at least one chrominance component.
- the location of each pixel is defined by its abscissa and ordinate coordinates (x n and y n ) in the image.
- the sequence is a sequence of gray level images represented using a two-dimensional representation, such as a pixel matrix, each pixel having a gray level component, or luminance. In this case the vector representative of the pixel is reduced to a single component.
- the GEN module for generating characteristic maps is configured to generate a plurality of M characteristic maps of a first group, denoted FMi, from the sequence of input images I(P V n).
- the optional FME module can also generate one or more additional cards, numbering L, which will be neither stored nor transmitted, denoted FMEi.
- the SE module performs a transformation of the first group of feature maps to generate a second group of feature maps at the same resolution as the images of the input sequence.
- the optional SE module can quantify the values of the cards of the first group using a quantizer Q to generate an ordered collection of quantized values. Recall that the quantification of a value refers to the matching of this value with a member of a discrete set of possible code symbols.
- the set of possible code symbols may consist of integer values, and the quantization system performs simple rounding from an actual value to an integer value.
- quantification consists of multiplication by a given value then rounding.
- the SE module performs a transformation of the values of at least one of the characteristic maps, for example oversampling, interpolation, filtering, etc.
- a transformed feature map of the second group is of the same resolution as the images of the input sequence.
- the characteristic maps which are coded can be of lower resolution than that of the images to be coded, while the maps of the second group, which are used for the construction of the characteristic vectors, are at the same resolution as the sequence of images, which makes extraction easier.
- the SE module is absent, in this case the values which will be used to construct the characteristic vector are extracted from the first group of characteristic maps.
- the extracted values constitute the vector Z n .
- Z n is a J-tuple, that is to say it contains J elements, or Zi data.
- the index n refers to the characteristic vector of the sequence of current samples, or pixels, P' vn .
- the optional TT module processes the extracted values to generate the vector Z n .
- the TT module can perform quantification of the data extracted from the set of feature maps. Treatment may include other operations, such as filtering, scaling, etc.
- the SE module is not used and if the feature maps of the first group are at resolutions lower than that of the images of the sequence, the TT module can take into account the coordinates of the values in the resolution maps lower.
- the MLP module is a neural network defined by K parameters Wk, capable of processing the vector Z n , or J-Uplet, as input, to generate as output a sequence of vectors representative of a sequence of samples P ' vn to code.
- the neural network is, according to one embodiment, an MLP, or Multi Layer Perceptron, consisting of an input layer adapted to the input format (the J-tuple), optionally one or more hidden layer(s). ), and an output layer adapted to the output format of the output vectors, generally a plurality of vectors each comprising A elements.
- A is equal to 3 and an output vector is a triplet (R, G, B) of one of the N pixels P' vn of the image v, encoded then decoded.
- the NNC module carries out the coding of the neural network, in particular its Wk parameters.
- the NNC module carries out a coding simulation, followed by 'a decoding, intended for the evaluation module. It updates parameter values based on the results of a performance measurement carried out by the EVAL module. Subsequently, it carries out the effective coding of the parameters of the neural network Wk.
- the encoded parameters are denoted Wck.
- the coding simulation can be identical to the actual coding, or achieve an approximation of it.
- the FMC module carries out the coding of the FMi maps, that is to say the values of the characteristic maps of the first group (excluding the additional FMEi maps and the maps of the second group, optionally resulting from oversampling by the SE module).
- the FMC module carries out a coding simulation, followed by 'a decoding, intended for the evaluation module. Subsequently, it carries out the actual coding of the values of the FMi cards.
- the coded cards are denoted FMci.
- the coding simulation can be identical to the actual coding, or produce an approximation of it.
- the coding module quantifies if necessary the latent representation of the values from the cards in the first group using a quantifier to generate an ordered collection of quantized values. Then the coding module compresses the quantified data, for example using entropy type coding.
- the EVAL module carries out an evaluation and minimization of coding performance.
- the evaluation function is for example of the flow-distortion type.
- the minimization can be carried out by gradient descent, or any other method within the reach of those skilled in the art.
- the MAJ module updates the values of the FMi cards to be encoded according to the results of the performance function.
- Figure 2 schematically represents a DEC decoding device.
- the DEC coding device of Figure 2 receives as input a first group of encoded data organized into M FMci characteristic maps (also called FM layers) and the encoded parameters Wck of the neural network. It decodes the N sample sequences Pdvn of the V images of the sequence to be decoded.
- M FMci characteristic maps also called FM layers
- This DEC decoding device comprises an NND neural network decoding module, an FMD module for decoding characteristic maps, an XTR' data extraction module, an inverse transformation module SE', a TT module. ' for processing and inverse quantification, an MLP' module corresponding to a neural network, an optional FME' module for generating additional characteristic maps. It produces as output a sequence of decoded images, denoted I(Pd vn ), each comprising respectively a plurality of decoded samples Pd vn .
- FMdi The cards decoded by the FMD module, numbering M, are denoted FMdi.
- the parameters decoded by the NND module are denoted Wdk.
- the decoder can also generate one or more additional cards, denoted FME'i, in the number of L, identical to the additional FMEi cards generated by the encoder.
- the module SE' carries out a transformation of the first group of decoded FMdi feature maps to generate a second group of feature maps at the same resolution as the images to be decoded, denoted FMS'i.
- the module SE' optionally performs an inverse quantification corresponding to the quantification carried out at the encoder. Inverse quantification is not necessary if the quantizer Q of the encoder has simply rounded the real values submitted to it. Quantification inverse is not necessary either if the neural network is able to take into account a quantification of its input data. Otherwise, the decoder carries out the inverse operation of the quantizer Q.
- the module SE' carries out a transformation of the values of the characteristic maps, for example oversampling, interpolation, filtering, etc., similar to that carried out by the encoder.
- a transformed feature map of the second group is of the same resolution as the images of the sequence to be decoded.
- the module SE’ is absent, in this case the values which will be used to construct the characteristic vector are extracted from the first group of characteristic maps.
- the module XTR' is identical to the module embodiments described previously), for a sequence of current samples Pd vn to be decoded, as a function of the coordinates of the samples in the respective images to be decoded.
- J M.
- J M+L.
- the extracted values constitute the vector Zd n .
- Zd n is a J-tuple, that is to say it has J elements, or zdi data.
- the optional module TT' processes the extracted values to generate the vector Zd n .
- the TT module can perform inverse quantification of the data extracted from the set of feature maps.
- the processing may include other operations, such as filtering, scaling, etc., similar to those performed by the encoder.
- the MLP' module is a neural network defined by K parameters Wdk, capable of processing the vector Zd n , or J-Uplet, as input, to generate as output a sequence of vectors representative of a sequence of samples Pd vn , each comprising A elements.
- A 3 and an output vector is the triplet (R, G, B) of one of the N pixels Pd vn of the image v to be decoded.
- the MLP' module is identical in structure to the MLP module, and its parameters are either identical if the coding of its parameters Wk is lossless, or different if the coding is carried out with losses.
- the DEC decoding device can be implemented by means of an electronic device comprising a processor and a memory, not shown; each of the modules mentioned above can then be produced by the cooperation of the processor and computer program instructions stored in the aforementioned memory and designed to carry out the functionalities of the module concerned, in particular as described below, when these instructions are executed by the processor
- Figure 3 illustrates an example of a synthetic artificial neural network used in the context of embodiments of the invention in coding and decoding.
- a vector representation of a sequence of current samples (a vector Z n or Zdn from the characteristic maps FMi/FMSi and FMEi or FMdi/FMS'i and FME'i) is applied as input (this is that is to say on an input layer) of the MLP or MLP' synthesis artificial neural network.
- the artificial neural network produces at output a plurality of vectors P' vn or Pd vn representative of the reconstructed (at coding) or decoded (at decoding) samples, according to one embodiment the color components (R, G, B or Y ,U,V) constituting the color pixels of a sequence of images.
- the sequence of images corresponds to two images, each sequence of samples has two samples and the corresponding vectors are denoted Pdi n and Pd2n.
- the MLP synthesis artificial neural network is trained on the sequence of images, so as to minimize the differences between the input representation of the sequence of current images I(P vn ) and its representation I (P' V n) as output, while also minimizing the amount of data to be encoded.
- the EVAL module carries out a performance measurement in this sense.
- Figure 4 is a flowchart representing an example of a coding method which can be implemented by the coding device of Figure 1.
- the sequence is a sequence of two-dimensional images
- each sample sequence to be coded is therefore a set of pixels P vn with coordinates (x n , y n ) in the respective images I(P V n) of the sequence to be coded.
- a first phase learning is carried out in order to determine, for an input sequence I(Pvn), the values of the maps FMi and the parameters Wk to optimize a global cost function. Learning is for example carried out by gradient descent, followed by updating the parameters of the MLP neural network and the values of the FMi feature maps.
- the cost function can be of the flow-distortion, or flow, or distortion, or perceptual type.
- To measure the rate R it is necessary to simulate the coding of the FMi cards, then measure the associated coding rate (the size of the stream B 1).
- the coding of the Wk parameters is not simulated because their influence is less important than that of the characteristic maps.
- the coding of the parameters Wk is also simulated and the associated flow rate (the size of the flow B2) is measured.
- the distortion D it is necessary to simulate the coding then the decoding of at least part of the image sequence, to obtain at least one sequence of pixels P' vn resulting from a simulation of coding then decoding samples of index n, then measuring the difference between this part of the input image sequence I(P vn ) and a corresponding part of the sequence I(P' vn ) encoded then decoded.
- the FMi cards and the Wk parameters are encoded to produce the coded values FMd and Wck before transmission or storage. They constitute the compressed representation of the input sequence I(P V n).
- an input sequence I(P V n) to be coded comprising at least two images, each of them comprising a plurality of N samples P n , is provided as input to the method .
- these images are temporal images of a video sequence.
- these images are images of a series of images, for example medical.
- these images are multiview or 3D components of a multiview or 3D image or sequence of images.
- step E21 the M FMi cards of the first group are initialized. Subsequently, the Wk parameters of the MLP neural network and the values of the FMi maps must be optimized during the construction phase.
- the FMi cards are of the same resolution as the images of the input sequence I(P vn ) and therefore each include the same number of values N as there are samples P vn to be coded in each image v.
- the FMi cards are of resolution less than or equal to that of the images of the input sequence I(P vn ) and therefore include, for at least one of them, a number N' of values to be coded less than N.
- the first FMi card is at the resolution of the images and each following card is at half the resolution of the previous one.
- FMi cards are of the same resolution, lower than that of the images of the input sequence I(Pvn).
- the FMi maps are transformed to provide a second group of transformed FMSi feature maps.
- the feature vectors are preferably extracted from the transformed maps of the second group, and not directly from the maps of the first group.
- the characteristic vectors are therefore extracted indirectly from the maps of the first group.
- the maps of the second group are neither stored nor transmitted, they are only used to construct the characteristic vectors.
- the FMi cards are initialized with predefined constant values.
- the feature maps are initialized by a set of random real values.
- one or more FMEi maps, forming an additional group of L additional characteristic maps, are generated, and complete the first group. They are used to construct the characteristic vector but are neither stored nor transmitted.
- the FMi characteristic maps of the first group are subsequently updated, or refined, during a step E22, by the MAJ update module of the encoder during its learning.
- the FMi cards of the first group are coded by the FMC module of the encoder.
- this operation is a coding simulation.
- this operation is an effective coding and the coded values constitute stream B 1.
- the simulation can be identical to the effective coding but it can also be different (for example, simplified).
- any known technique aimed at compressing the values of the cards can be used.
- the FMi cards are coded in order (FMi, FM2,..., FM4), and the variables of each card in a predefined order, for example lexicographical.
- Each card undergoes entropic coding.
- the entropy coding produces a compressed stream B 1 whose flow rate is measured subsequently during a step E29.
- the M cards of the first group FMi are transformed by the module SE to generate cards of the second group FMSi at the resolution of the images of the input sequence.
- M FMSi cards are generated.
- each FMi card is transformed into an FMSi card.
- At least one FMi card has a resolution lower than that of the images of the sequence to be coded and the transformation operation includes oversampling so that the transformed FMSi card includes the same number of samples as the images of the sequence.
- Oversampling consists of adding values to the FMSi maps to achieve the resolution of the images in the input sequence. It can be simple (by nearest neighbor replication) or include interpolation (linear, polynomial, filtering, etc.).
- values are extracted by the module XTR from the transformed FMi or possibly FMSi cards, and optionally FMEi. additional. This extraction is carried out as a function of the coordinates (x n , y n ) of the sequence of current P vn samples of the input images. It can also be carried out depending on the resolution of the map considered.
- the characteristic vector Z n results directly from this extraction.
- Z n is a J-tuple (zi, Z2, . . ., zj), consisting of the values of the FMi or FMSi cards (and optionally FMEi) located at the coordinates (x n , y n ) of a current pixel P vn , as will be illustrated in support of Figure 5.
- Z n is a J-tuple constructed from values taken from the FMi maps (and optionally FMEi) at coordinates which may be different depending on the maps. For example, if the FMi (and/or FMEi) maps are at different resolutions because they have been downsampled, the coordinates are adapted (by scaling) to correspond to the resolution of each map.
- an FMi card which is at half the resolution of the input signal
- the vector Z n is processed by the MLP neural network to generate as output the sequence of samples P vn to be coded, according to one embodiment the triplets (R, G, B) P' vn samples (the P vn samples encoded then decoded).
- the structure and parameters Wk of the neural network are initialized for example during the first iteration of this step. These parameters are subsequently updated, or refined, during the construction phase, during subsequent iterations of the process.
- the parameters of the neural network are initialized by predefined values known to give a satisfactory result (for example, following training on a corpus of image sequences).
- the parameters Wk of the neural network are initialized by a set of random values.
- the parameters Wk of the MLP neural network are quantified and coded.
- this operation is a coding simulation.
- this operation is an effective coding and the coded values constitute stream B2.
- the simulation can be identical to the actual coding but it can also be different (for example, simplified). Any known technique can be used for this purpose, for example the neural network coding standard proposed by the MPEG-7 part 17 standard, also called NNR (Neural Network Representation). Note that in this case, it is necessary to choose the amount of degradation that the coding brings to the Wk parameters.
- a performance measure is evaluated.
- the coding simulation rates associated with the characteristic maps of the first group (simulation of flow B 1 by coding of FMi maps) and optionally with the parameters of the neural network (simulation of flow B 2 by coding of Wk parameters) are measured.
- the cost function is of the rate-distortion type, denoted (D+L*R), where D for example the quadratic error measured between the input images and the decoded images (or the error measured on a sample subset of the images).
- D is calculated from a perceptual function such as the SSIM (for Structural SIMilarity), or MSSIM (for Multi-scale Structural SIMilarity).
- R is the simulated flow rate of flow B 1; according to another embodiment, R is the total flow rate used to encode this image, that is to say the sum of the simulated flow rates of B 1 and B2.
- L is a parameter that adjusts the flow-distortion trade-off. Other cost functions are possible.
- step E22 As long as the cost function has not reached its minimum, the performance measurement is not satisfactory, and the process is repeated from step E22.
- This minimization can be carried out by a mechanism known as gradient descent with updating of the parameters during step E22 for the values of the characteristic maps and E27 for the network parameters.
- Streams B 1 and B2 can be concatenated to produce a final stream.
- the stream B2 of the coded parameters of the neural network is stored or transmitted before the stream B 1, in order to be able to be decoded before the stream B 1.
- Figure 5 illustrates an coding method used in one embodiment of the invention.
- a sequence of two images I(Pin) and I(P2n) is to be coded.
- a sequence of V images I(P vn ) is applied as input to the coding method and device.
- the samples, or pixels are processed in sequence of two, two pixels being taken from the respective images at a position denoted (x n , y n ), with n varying from 1 to N.
- Pin is taken from image 1 at position (x n , y n ) and P2n is taken from image 2 at position (x n , y n )).
- the FMi cards generated are 4 in number. In a preferred mode, there are 7 in number.
- the second FM2 card is half resolution (in each dimension) of the FMi card. Each additional map is half resolution of the previous map. This structure makes it possible to reduce the number of variables in the feature maps, which facilitates coding and learning while minimizing the coding cost.
- the FM2 card is oversampled by the SE module by a factor of 2 in each dimension, according to a process illustrated in support of Figure 6.
- the FM3 card is oversampled by a factor of 4 in each dimension, and the FM4 map with a factor of 8 in each dimension.
- the FMi layers are quantified by the module SE.
- an additional card FMEO has been introduced, which will be neither coded nor transmitted.
- This additional card typically includes data that can assist the MLP network in the task of image reconstruction.
- the cards added can be one or more from the following, non-limiting list:
- [135] A map containing data representative of the temporal difference between the frames of the video being encoded. For example, if the first and last frames of the video are 8 frames apart, all samples in the map contain the value 8.
- [136] A map representing a map of characteristics of an image distinct from the images currently being processed, capable of providing information on the images to be coded, for example a previously processed map.
- the vector Z n is a 4-tuple (Z1...Z4) consisting of the values extracted from the FMSi maps located at the coordinates (x n , y n ) of the sequence of current pixels P vii .
- the vector Z n consisting of the values extracted (quantified) from the FMSi cards is processed by the MLP neural network to generate as output a sequence of vectors, according to the example two triplets representative of the samples Pin and P2n to be coded.
- the output vectors are in this embodiment the triplets (R, G, B) of the pixels P'i n and P'2n encoded then decoded.
- the triplets are inserted into the decoded images I(P'in) and I(P'2n) at the positions (x n , y n ) of the color components (R', G', B') of the two images.
- the vector Z n is extracted directly from the FMi layers, at the positions recalculated according to the size of the maps, then the extracted values are optionally processed and quantified after extraction.
- the vector Z n is a 5-tuple (Z0...Z4), the value zo being extracted from the additional map FMEO.
- Figure 6 is a flowchart representing an example of a decoding method which can be implemented by the decoding device of Figure 2.
- the streams B 1 and B2 are extracted from the encoded stream BS. They contain respectively the coded representations of the maps of the first group FMci and the parameters Wc k .
- the M FMdi cards are generated by decoding the FMci values.
- decoding any known technique similar to that used in the encoder can be used, preferably entropic decoding.
- the FMdi cards are decoded in order (FMdi, FMd2,... FMd4), and the variables of each card in a predefined order, for example lexicographical.
- the FMdi cards have a resolution lower than or equal to that of the images of sequence I (Pd vii) to be reconstructed.
- one or more FME'i maps forming an additional group of L additional characteristic maps, are generated and complete the first group. They are not decoded but generated by the decoder in an identical manner to the generation of the encoder. They typically include data that can assist the MLP’ network in the task of reconstructing the images of the sequence.
- FME'i maps are generated and complete the first group. They are not decoded but generated by the decoder in an identical manner to the generation of the encoder. They typically include data that can assist the MLP’ network in the task of reconstructing the images of the sequence.
- the M cards of the first group FMdi are transformed by the module SE to generate cards of the second group FMS'i at the resolution of the images of the input sequence.
- M FMS’i maps are generated.
- each FMdi card is transformed into an FMSi card.
- At least one FMdi card has a resolution lower than that of the images of the sequence to be coded and the transformation operation includes oversampling so that the transformed FMS'i card includes the same number of samples as images from the input sequence.
- oversampling consists of adding values to the FMS’i cards to achieve the resolution of the images in the input sequence. It can be simple (by nearest neighbor replication) or include interpolation (linear, polynomial, filtering, etc.)
- the transformation can optionally include inverse quantification of the extracted values, if necessary.
- inverse quantification is not obligatory.
- values are extracted by the module XTR' from the FMdi cards or possibly transformed FMS'i, and optionally additional FME'i. This extraction is carried out according to the coordinates (x n , y n ) of the sequence of current samples P vn to decode images of the sequence. It can also be carried out depending on the resolution of the map considered.
- the characteristic vector Zd n results directly from this extraction.
- Zd n is a J-tuple (zi, Z2, . . . , zj), consisting of the values of the cards FMdi or FMS'i (and optionally FME'i) located at the coordinates (x n , y n ) of a current pixel Pd vn , as will be illustrated in support of Figure 7.
- a vector Zd n is constructed by the module TT' from the values extracted from the FMdi cards of the first group or the FMS'i cards from the second group and possibly FME 'i of the additional group, for each sequence of samples Pd vn of coordinates (x n , y n ) of the input images to be decoded, as a function of the coordinates (x n , y n ).
- This step is identical to step E26 which was described for the encoder in support of Figure 4 and the embodiments described apply.
- the extraction may include inverse quantification of the extracted values or of the vector Zd n formed, if necessary.
- the parameters Wdk of the MLP' neural network are generated by decoding the values Wck of the flow B2.
- any known decoding technique corresponding to that of coding which was used by the coder can be used.
- the MLP' neural network is similar to the MLP network, that is to say it has the same structure and has the same parameters, except for coding, which can be produced with or without losses.
- stream B2 is decoded before stream B l, in order to be able to have the neural network before starting to decode the sample sequences.
- the vector Zd n is processed by the MLP' neural network to generate as output the current sequence of samples Pd vn to be decoded, according to one embodiment the triplets (R, G, B) Pd vn samples.
- the samples are inserted into the decoded images I(Pd vn ) at the positions (x n , y n ) of the color components (Rd, Gd, Bd) of the respective images of the sequence.
- This step is identical to step E27 which was described for the encoder in support of Figure 4.
- FIG. 7 illustrates a decoding method used in one embodiment of the invention.
- a sequence of two images I(Pdi n ) and I(Pd2n) is to be decoded.
- a sequence of V images I(Pd vn ) is decoded by the decoding method and device.
- the samples, or pixels are processed in sequence of two, two pixels being decoded and reconstructed in the respective images at a position denoted (xn, y n ), with n varying from 1 to N.
- Pdi n is inserted in image 1 at position (x n , y n ) and Pd2n is inserted in image 2 at position (x n , yn)).
- the first FMdi card has the same resolution as image I, and therefore includes WxH variables, where W represents the width of the image in pixels, and H its height.
- the second FMd2 card has half the resolution (in each dimension) of the FMdi card. Each additional map is half resolution of the previous map. This structure makes it possible to reduce the number of variables in the characteristic maps, which facilitates decoding while minimizing the coding cost.
- the FMd2 card is oversampled by the SE’ module by a factor of 2 in each dimension, according to any oversampling process within the reach of those skilled in the art.
- the FMds map is oversampled by a factor of 4 in each dimension, and the FMd4 map by a factor of 8 in each dimension.
- the FMS'i cards are of the same resolution as the image to be decoded, and therefore have WxH values, where W represents the width of the image in pixels, and H its height.
- the vector Zd n is a 4-tuple (Z1...Z4) consisting of the values of the FMS'i maps located at the coordinates (x n , y n ) of the sequence of current pixels Pd vn .
- the vector Zd n is optionally dequantized then processed by the MLP' neural network to generate as output the respective triplets (R, G, B) or (Y,U,V) of the two samples Pd vn (Pdi n and Pd2n) at decode.
- the triplets (R, G, B or Y,U,V) are inserted into the respective decoded images I(Pdi n ) and I(Pd2n) at coordinates (x n , y n ) in the color components (Rd, Gd, Bd) or (Yd, Ud, Vd) images.
- the vector Zd n is a 5-tuple.
Landscapes
- Engineering & Computer Science (AREA)
- Theoretical Computer Science (AREA)
- Physics & Mathematics (AREA)
- General Health & Medical Sciences (AREA)
- Computing Systems (AREA)
- Biomedical Technology (AREA)
- Biophysics (AREA)
- Computational Linguistics (AREA)
- Data Mining & Analysis (AREA)
- Evolutionary Computation (AREA)
- Life Sciences & Earth Sciences (AREA)
- Molecular Biology (AREA)
- Artificial Intelligence (AREA)
- General Engineering & Computer Science (AREA)
- General Physics & Mathematics (AREA)
- Mathematical Physics (AREA)
- Software Systems (AREA)
- Health & Medical Sciences (AREA)
- Multimedia (AREA)
- Signal Processing (AREA)
- Compression Or Coding Systems Of Tv Signals (AREA)
Abstract
L'invention concerne un procédé et dispositif de codage et décodage d'une séquence d'au moins deux images comprenant une pluralité d'échantillons. Le procédé de décodage comporte les étapes suivantes : - décodage d'un premier groupe de cartes de caractéristiques; - décodage d'un ensemble de paramètres représentatifs d'un réseau de neurones; - pour une séquence d'échantillons, dits échantillons courants, desdites images respectives de la séquence à décoder, associés à une position dans lesdites images respectives : - construction d'un vecteur caractéristique à partir des cartes de caractéristiques dudit premier groupe, en fonction de ladite position desdits échantillons courants; - traitement dudit vecteur par un réseau de neurones artificiels défini par les paramètres décodés pour fournir une séquence de vecteurs représentatifs respectivement desdits échantillons courants.
Description
Description
Titre de l'invention : Procédé et dispositif de codage et décodage de séquences d’images.
Technique antérieure
[1] L’invention se rapporte au domaine général du codage de séquences d’images numériques. Elle concerne plus particulièrement la compression des vidéos numériques.
[2] Les vidéos numériques font en général l’objet d’un codage source visant à les compresser afin de limiter les ressources nécessaires à leur transmission et/ou à leur stockage. Il existe de nombreux standards de codage, tels que les standards des organismes ITU/MPEG (H.264/AVC, H.265/HEVC, H.266/VVC, etc.) ainsi que leurs extensions (MVC, SVC, 3D- HEVC, etc.).
[3] L’encodage d’une image est généralement effectué en divisant l’image en plusieurs blocs rectangulaires, et en encodant ces blocs de pixels selon une séquence de traitement donnée. Dans les techniques existantes de compression vidéo, le traitement d’un bloc comprend typiquement une prédiction des pixels du bloc effectuée à l’aide de pixels précédemment codés puis décodés présents dans l’image en cours d’encodage, auquel cas on parle de « prédiction Intra », ou d’images précédemment codées, auquel cas on parle de « prédiction Inter ». Cette exploitation des redondances spatiales et/ou temporelles permet d’éviter de transmettre ou de stocker la valeur des pixels de chaque bloc de pixels, en représentant certains au moins des blocs par un résiduel représentant une différence entre les valeurs de prédiction des pixels du bloc et les valeurs réelles des pixels du bloc prédit.
[4] Les formats vidéo ne cessant d'évoluer pour compresser toujours davantage et s’adapter à la variété de formats attendus et des réseaux de communication, les possibilités de prédiction deviennent de plus en plus grandes et les algorithmes de codage et décodage classiques très complexes.
[5] En plus de ces approches classiques proposées par les normes de compression (MPEG, ITU), les approches basées sur l’intelligence artificielle, et notamment neuronales, tendent à se développer.
[6] Certaines de ces approches neuronales peuvent être vues comme une simple extension de la notion de compétition des techniques de compression susmentionnées, telles que la compétition de mode de prédiction et transformation en codage vidéo.
[7] D’autres approches utilisent le concept « d’auto-encodeur ». Les auto-encodeurs sont des algorithmes d’apprentissage à base de réseaux de neurones artificiels, qui permettent de construire une nouvelle représentation d’un jeu de données. L’architecture d’un auto-encodeur est constituée de deux parties : l’encodeur et le décodeur. L’encodeur est constitué par un ensemble de couches de neurones, qui traitent les données afin de construire de nouvelles représentations dites “encodées”, appelées aussi « représentations latentes ». À leur tour, les couches de neurones du décodeur reçoivent ces représentations et les filtrent afin d’essayer de reconstruire les données de départ. Les différences entre les données reconstruites et les données initiales permettent de mesurer l’erreur commise par l’auto-encodeur. L’entraînement consiste à modifier les paramètres de l’auto-encodeur afin de réduire l’erreur de reconstruction mesurée sur les différents échantillons du jeu de données. Les performances de tels systèmes à base d'auto-encodeur se font au prix d'une augmentation considérable de l'empreinte mémoire et de la complexité comparativement aux approches conventionnelles telles que proposées par les normes de compression. Ils peuvent avoir des millions de paramètres et peuvent nécessiter jusqu'à un million de MAC (multiplication-accumulation) pour décoder un seul pixel. Cela rend de tels décodeurs bien plus complexes que les décodeurs conventionnels, ce qui pourrait entraver l'adoption de la compression basée sur l'apprentissage.
[8] Plus récemment, une technique simple d’encodage d’image fondé sur un réseau de neurones a été décrite dans l’article « Compression with Implicit Neural representations » d’Emilien Dupont et al. (arXiv:2103.03123). La technique de codage proposée consiste à ajuster un réseau de neurones à une image, quantifier les poids du réseau et les transmettre. Au moment du décodage, le réseau de neurones est évalué à chaque position de pixel pour reconstruire l'image. Une telle technique reste cependant inefficace en termes de compression et suppose de coder indépendamment les images de la vidéo.
[9] Il existe donc un besoin pour une solution permettant de coder/compresser une séquence d’images de manière simple et efficace.
Exposé de l’invention
[10] L’invention vise un procédé de codage d’une pluralité d’images selon la revendication 1 et un procédé de décodage d’une pluralité d’images selon la revendication 8.
[11] Au sens de l’invention, on entend par encodage, ou « codage », l’opération qui consiste à représenter un ensemble d’échantillons, ou pixels, sous une forme compacte portée par
exemple par un train binaire numérique. On entend par décodage l’opération qui consiste à traiter un train binaire numérique pour restituer des échantillons décodés.
[12] Par « séquence d’images » on entend une pluralité d’images bidimensionnelles ordonnées, par exemple temporellement dans le cas d’une vidéo. Selon un autre exemple, les images peuvent être des vues d’une même scène représentée en multivues. Selon un autre exemple, les images peuvent être une pluralité d’images temporelles et multivues (vidéo immersive).
[13] Par « échantillon », on entend une valeur prélevée dans une image de la séquence. L’échantillonnage d’un signal produit une suite de valeurs discrètes nommées échantillons. Dans le cas d’un signal d’image, l’échantillon prend le nom de pixel qui peut être par exemple un pixel couleur représenté traditionnellement par un triplet de valeurs, par exemple (R, G, B) ou (Y,U,V).). La position de l’échantillon est repérée par ses coordonnées en abscisse (x) et ordonnée (y) dans l’image. Une séquence d'échantillons désigne une série d'échantillons considérés aux mêmes coordonnées dans la série d'images respectives de la séquence d'images.
[14] Par « cartes de caractéristiques », on entend une représentation abstraite d’une séquence d’images, c’est-à-dire au moins deux images, comportant une pluralité de données variables, que l’on appelle aussi valeurs, par exemple des nombres réels. Ces cartes sont aussi désignées sous le terme de « représentation latente ».
[15] Par « transformation des cartes de caractéristiques », on entend une opération mathématique qui permet de transformer les valeurs d’une première carte en valeurs d’une seconde carte. Une première carte, dite carte du premier groupe, destinée au codage, est quelconque. Une seconde carte, dite carte transformée, ou carte du second groupe, est à la même résolution que les images d’entrée, c’est-à-dire qu’elle comporte autant de valeurs qu'une image d’entrée (resp. à décoder) comporte d’échantillons (N). La transformation peut comporter par exemple une interpolation, un suréchantillonnage, un filtrage, une quantification, une transformée de Fourier, etc.
[16] Par « vecteur caractéristique de données construit à partir des cartes de caractéristiques en fonction d’une position » on entend un vecteur constitué d’un ou plusieurs éléments, ou données, de préférence discrètes, les données étant construites à partir des cartes de caractéristiques à une position déterminée par celle des échantillons en cours de traitement dans les images. Ce vecteur caractéristique est celui qui est appliqué à l’entrée du réseau de neurones. Dans le cas d’une image, un tel vecteur peut être constitué par exemple à partir d’une
pluralité de valeurs prélevées dans chacune des cartes de caractéristiques aux mêmes coordonnées en abscisse et en ordonnée que les échantillons à coder (resp. à décoder). Une fois que ces valeurs sont prélevées dans les cartes de caractéristiques, elles peuvent être traitées pour constituer le vecteur caractéristique, avant l’entrée dans le réseau de neurones, par exemple par une quantification, un filtrage, une interpolation, etc.
[17] Par « réseau de neurones », ou « réseau de neurones de synthèse », on entend un réseau neuronal tels un réseau neuronal convolutif, un perceptron multicouche, un LSTM (pour « Long Short Term Memory » en anglais), etc. Le réseau de neurones est défini par exemple par une pluralité de couches de neurones artificiels et par un ensemble de fonctions d'activation, de pondération et d’addition (par exemple, une couche peut calculer y = f(Ax+b), où y et b sont des vecteurs de dimension N, x un vecteur de dimension M, A est une matrice de dimension MxN, et f est la fonction d’activation).
[18] Par « paramètre du réseau de neurones », on entend une des valeurs qui caractérise le réseau de neurones, par un exemple un poids associé à l’un des neurones (coefficient de filtre, pondération, biais, valeur affectant le fonctionnement de la non-linéarité, etc.)
[19] Par « traitement par un réseau de neurones », on entend l’application d’une fonction exprimée par un réseau de neurones au vecteur caractéristique d’entrée pour produire un vecteur de sortie représentatif de l’échantillon à coder (resp. décoder). Ce vecteur de sortie peut comporter une ou plusieurs données représentatives de l’échantillon.
[20] Par « mesure de performance », on entend une mesure entre au moins une valeur d’un échantillon à coder et une valeur décodée dudit échantillon. La mesure peut évaluer par exemple une distorsion, ou une erreur perceptive. Elle peut être effectuée sur un échantillon ou une pluralité d’échantillons (par exemple, les échantillons courants, ou les images courantes, etc.). La mesure peut comporter aussi une mesure du débit, notamment associé au codage du réseau de neurones et/ou au codage des cartes de caractéristiques du premier groupe. La mesure peut être une mesure conjointe entre le débit et la distorsion au travers de leur pondération. Comme il est bien connu de l’état de l’art, il est généralement procédé à une minimisation de la valeur de cette mesure jusqu’à atteindre une valeur cible.
[21] Par « étape de construction », on entend une étape qui vise à construire les paramètres représentatifs de l’image, avant leur codage effectif. Les sous-étapes de construction peuvent être réitérées autant que nécessaire pour obtenir une mesure de performance acceptable.
[22] De manière générale, on considère que les étapes d’un procédé de codage ou décodage ne doivent pas être interprétées comme étant liées à une notion de succession temporelle. Autrement dit, les étapes peuvent être effectuées dans un ordre différent de celui indiqué dans la revendication indépendante de codage ou de décodage, voire en parallèle.
[23] Le procédé de codage selon l’invention réalise une construction des paramètres de codage, à partir d’une séquence d’images d’entrée, en entraînant un réseau de neurones sur des vecteurs caractéristiques associés à une position d’un échantillon à coder dans chacune des images d’entrée. Ces vecteurs caractéristiques sont construits à partir de cartes de caractéristiques qui peuvent être à la résolution des images d’entrée, ou à une résolution inférieure. Au cours de l’entraînement, ou construction, les paramètres du réseau de neurones et les valeurs des cartes de caractéristiques sont mis à jour en fonction d’une mesure de performance, par exemple de type débit-distorsion. Lorsque l’entraînement est terminé, c’est- à-dire que la mesure de performance obtenue est satisfaisante, le codage effectif des paramètres du réseau de neurones et des valeurs des cartes de caractéristiques peut être effectué et mémorisé ou transmis à destination du décodeur.
[24] Avantageusement, le processus d’entraînement permet de raffiner les paramètres du réseau de neurones et/ou les valeurs des cartes de caractéristiques jusqu’à obtenir une représentation adéquate en termes de performance, par exemple un équilibre souhaité entre le débit généré et la distorsion subie par les images d’entrée. L’entraînement des valeurs des cartes de caractéristiques et des paramètres du réseau de neurones peut être conjoint. Avantageusement, le procédé de codage selon l’invention permet de compresser efficacement le signal d’image en exploitant les redondances spatiales intra-images mais aussi les redondances inter-images entre les images de la séquence, qu’il s’agisse d’une séquence d’images vidéo ou d’une pluralité d’images multivues, d’une série d’images médicales, etc.
[25] Avantageusement, le procédé de décodage est simple puisqu'il suffit de décoder les cartes de caractéristiques et le réseau de neurones pour reconstituer une version décodée d'une séquence d'images.
[26] Un tel réseau de neurones peut avantageusement être de structure très simple avec peu de paramètres.
[27] Selon des modes de réalisation du procédé de codage ou de décodage :
[28] - Le procédé comporte une étape de transformation dudit premier groupe de cartes de caractéristiques pour obtenir un second groupe de cartes de caractéristiques à la résolution des
images de la séquence, le procédé étant caractérisé en ce que ledit vecteur caractéristique est construit à partir desdites cartes de caractéristiques du second groupe.
[29] Avantageusement selon ce mode, les cartes de caractéristiques sont divisées en deux groupes dont l’un est réservé à l’extraction des vecteurs caractéristiques et l’autre au codage. On peut ainsi dissocier les deux procédés dont la finalité est différente : les cartes du premier groupe, à coder (resp. décoder), doivent être compressées le plus efficacement possibles, alors que les cartes du second groupe doivent pouvoir faciliter le processus d’extraction et de construction du vecteur caractéristique.
[30] - Selon une variante, une au moins des cartes de caractéristiques du premier groupe est de résolution inférieure à celle desdites images à coder (resp. décoder) et l’opération de transformation comporte un suréchantillonnage. Avantageusement selon ce mode, la compression des cartes de caractéristiques est plus efficace puisque l’une au moins des cartes de caractéristiques du premier groupe, à coder (resp. décoder) comporte moins de valeurs que si elle était à la résolution des images. Par exemple, l’une des cartes de caractéristiques du premier groupe peut être à la résolution 1/2, c’est-à-dire qu’elle comporte deux fois moins de valeurs en abscisse et en ordonnée que l’image d’entrée comporte d’échantillons, soit au total 4 fois moins de valeurs qu’une carte de caractéristiques à la résolution de l’image. En revanche, la carte de caractéristique du second groupe qui correspond à une transformation de cette carte du premier groupe est de résolution identique à celle des images. La transformation comporte donc dans ce cas au moins une opération de suréchantillonnage pour obtenir le même nombre de valeurs dans cette carte transformée que l'une des images d’entrée (resp. à décoder) comporte d’échantillons.
[31] - Une au moins desdites cartes de caractéristiques du premier groupe est de résolution identique à celle des images à coder (resp. décoder).
[32] Avantageusement selon ce mode, l’une au moins des cartes de caractéristiques, à la même résolution que les images d’entrée à coder (resp. à décoder) permet une fidélité importante et le respect des détails de la résolution initiale des images de la séquence. Selon un mode de réalisation, la transformation conserve dans ce cas le nombre de valeurs de la carte de caractéristiques transformée. Elle peut être réduite à l’identité (aucun traitement n’est effectué sur les valeurs de la carte du premier groupe) ou comporter une opération de filtrage, de quantification, une transformation de Fourier, etc. Au codage, la quantification est indispensable au bon fonctionnement du système si les cartes de caractéristiques comportent
par exemple des valeurs flottantes, ou réelles. Il est nécessaire de les quantifier avant de les coder et/ou de les fournir en entrée du réseau de neurones. Au décodage en revanche, la quantification inverse n’est pas toujours nécessaire, selon les modes de réalisation.
[33] - La construction dudit vecteur caractéristique comporte une sous-étape d’extraction d’une valeur de ladite au moins une carte de caractéristiques à une position identique à celle des échantillons courants dans les images à coder (resp. décoder).
[34] Avantageusement, il est possible d’extraire une valeur d’une carte de caractéristique du premier ou du second groupe, à la même position que les échantillons dans les images de la séquence (images d’entrée pour le codage, images à décoder pour le décodage), pour constituer un élément du vecteur caractéristique. Ce procédé est simple à mettre en œuvre. Par exemple, si l’on dispose de J cartes de caractéristiques en entrée, de même résolution que les images de la séquence, une simple extraction des valeurs des cartes aux coordonnées des échantillons courants (à la même abscisse et la même coordonnée dans la carte de caractéristiques) permet de construire directement le vecteur caractéristique de J éléments.
[35] - La construction dudit vecteur caractéristique comporte les sous-étapes suivantes :
- extraction d’une pluralité de valeurs desdites cartes de caractéristiques dudit premier groupe en fonction de ladite position desdits échantillons courants ;
- traitement desdites valeurs extraites pour obtenir le vecteur caractéristique.
[36] Avantageusement selon ce mode, le vecteur de caractéristiques est extrait des cartes de caractéristiques, qui peuvent être quelconques, et notamment à une résolution inférieure à celle des images à coder (resp. décoder), avant de subir un traitement. Un tel traitement peut par exemple correspondre à une quantification des données extraites, ou à une mise à l’échelle, ou à un filtrage, etc. Au codage, la quantification est indispensable au bon fonctionnement du système si les cartes de caractéristiques comportent par exemple des valeurs flottantes, ou réelles. Il est nécessaire de les quantifier avant de les coder et/ou de les fournir en entrée du réseau de neurones. Au décodage en revanche, la quantification inverse n’est pas nécessaire, selon les modes de réalisation.
[37] - Le procédé comporte une étape de construction d’un groupe de cartes de caractéristiques supplémentaires, et le vecteur caractéristique est en outre construit à partir desdites cartes de caractéristiques supplémentaires. Avantageusement, ces cartes supplémentaires d’un troisième groupe, construites de manière identique au codeur et au décodeur, ne sont ni stockées, ni transmises au niveau du codeur, ni décodées au niveau du
décodeur. Elles permettent ainsi de bénéficier de données supplémentaires pour améliorer la compression sans dégrader le débit. Elles peuvent par exemple comprendre des coordonnées, des données causales disponibles dans les cartes du premier ou du second groupe, des données concernant d’autres images déjà traitées par le codeur ou décodeur, etc.
[38] Selon une variante, une carte supplémentaire contient une valeur représentative de la distance temporelle entre les images de la vidéo.
[39] - Le codage (resp. décodage) dudit premier groupe de cartes de caractéristiques comporte une sous-étape de codage (resp. décodage) entropique. Avantageusement, le codage entropique permet d’exploiter les redondances des images qui peuvent persister dans les cartes de caractéristiques, les images de la séquence étant ainsi compressées plus efficacement.
[40] Corrélativement, l’invention vise aussi un dispositif de codage et un dispositif de décodage de séquences d'images.
[41] Les caractéristiques et avantages du procédé de codage ou décodage s’appliquent de la même façon au dispositif de codage ou décodage selon l’invention et vice versa.
[42] L’invention vise également un programme d’ordinateur sur un support d’enregistrement, ce programme étant susceptible d’être mis en œuvre dans un ordinateur ou un dispositif de contrôle conforme à l’invention. Ce programme comporte des instructions adaptées à la mise en œuvre du procédé correspondant. Ce programme peut utiliser n’importe quel langage de programmation, et être sous la forme de code source, code objet, ou de code intermédiaire entre code source et code objet, tel que dans une forme partiellement compilée, ou dans n’importe quelle autre forme souhaitable.
[43] L’invention vise aussi un support d'information ou un support d’enregistrement lisible par un ordinateur, et comportant des instructions de programme d'ordinateur mentionné ci- dessus. Les supports d'information ou d’enregistrement peuvent être n'importe quel entité ou dispositif capable de stocker les programmes. Par exemple, les supports peuvent comporter un moyen de stockage, tel qu'une ROM, par exemple un CD-ROM ou une ROM de circuit microélectronique, ou encore un moyen d'enregistrement magnétique, par exemple une disquette ou un disque dur, une séquence d’ADN, ou une mémoire flash. D'autre part, les supports d'information ou d’enregistrement peuvent être des supports transmissibles tels qu'un signal électrique ou optique, qui peut être acheminé via un câble électrique ou optique, par lien radio, par lien optique sans fil ou par d'autres moyens.
[44] Le programme selon l'invention peut être en particulier téléchargé sur un réseau de type Internet.
[45] Alternativement, chaque support d'informations ou d’ enregistrement peut être un circuit intégré dans lequel le programme est incorporé, le circuit étant adapté pour exécuter ou pour être utilisé dans l'exécution d’un procédé conforme à l’invention.
Brève description des dessins
[46] D’autres caractéristiques et avantages de la présente invention ressortiront de la description faite ci-dessous, en référence aux dessins annexés qui en illustrent des exemples de réalisation dépourvus de tout caractère limitatif.
[Fig. 1] La figure 1 représente schématiquement un dispositif de codage utilisé dans le cadre de l’invention ;
[Fig. 2] la figure 2 représente schématiquement un dispositif de décodage utilisé dans le cadre de l’invention ;
[Fig. 3] la figure 3 illustre un exemple de réseau de neurones artificiels de synthèse utilisé dans le cadre de l’invention au codage et au décodage ;
[Fig. 4] la figure 4 est un logigramme représentant un exemple de procédé de codage qui peut être mis en œuvre par le dispositif de codage de la figure 1 ;
[Fig. 5] la figure 5 représente de manière illustrée un procédé de codage utilisé dans un mode de réalisation de l’invention ;
[Fig. 6] la figure 6 est un logigramme représentant un exemple de procédé de décodage qui peut être mis en œuvre par le dispositif de décodage de la figure 2 ;
[Fig. 7] la figure 7 représente de manière illustrée un procédé de décodage utilisé dans un mode de réalisation de l’invention.
Description des modes de réalisation
[47] La figure 1 représente schématiquement un dispositif de codage ENC.
[48] Ce dispositif de codage ENC comprend un module GEN de génération de cartes de caractéristiques, un module SE de transformation, un module XTR d’extraction de données, un module TT de traitement et quantification, un module MLP correspondant à un réseau de
neurones artificiels, un module NNC de codage de réseau de neurones, un module FMC de codage des cartes de caractéristiques, un module EVAL d’évaluation d’une fonction de performance, un module MAJ de mise à jour, un module FME optionnel de génération de cartes de caractéristiques supplémentaires.
[49] Le dispositif de codage ENC peut être mis en œuvre au moyen d’un dispositif électronique comprenant un processeur et une mémoire, non représentés ; chacun des modules mentionnés ci-dessus peut alors être réalisé par la coopération du processeur et d’instructions de programme d’ordinateur mémorisées dans la mémoire susmentionnée et conçues pour effectuer les fonctionnalités du module concerné, notamment comme décrit ci-dessous, lorsque ces instructions sont exécutées par le processeur.
[50] Le dispositif de codage ENC de la figure 1 reçoit en entrée une séquence d'au moins deux images à coder, notée I(Pvn), comportant chacune respectivement une pluralité d'échantillons Pvn. L'indice v indique le numéro d'image dans la séquence de V images. L'indice n indique le numéro de pixel dans une image de N pixels. L’image I(Pvn) peut représenter une image bidimensionnelle et la séquence une pluralité d’images bidimensionnelles (séquence vidéo, composantes stéréoscopiques, multiscopiques, série d’images médicales, etc.). Dans un mode de réalisation, une image de la séquence est représentée au moyen d’au moins une représentation bidimensionnelle, telle qu’une matrice de pixels, chaque pixel comportant un vecteur de composantes rouge (R), verte (G), bleue (B), ou, en variante, une composante de luminance et au moins une composante de chrominance. L'emplacement de chaque pixel est défini par ses coordonnées en abscisse et ordonnée (xn et yn) dans l'image. Dans un mode de réalisation, la séquence est une séquence d’images en niveau de gris représentées au moyen d’une représentation bidimensionnelle, telle qu’une matrice de pixels, chaque pixel comportant une composante de niveaux de gris, ou luminance. Dans ce cas le vecteur représentatif du pixel est réduit à une seule composante.
[51] Comme cela sera décrit plus en détail plus loin en référence aux figures 4 à 7 :
[52] Le module GEN de génération de cartes de caractéristiques est configuré pour générer une pluralité de M cartes de caractéristiques d’un premier groupe, notées FMi, à partir de la séquence d’images d’entrée I(PVn). Le module FME facultatif peut aussi générer une ou plusieurs cartes supplémentaires, au nombre de L, qui ne seront ni stockées ni transmises, notées FMEi.
[53] Dans un mode de réalisation, le module SE réalise une transformation du premier groupe de cartes de caractéristiques pour générer un second groupe de cartes de caractéristiques à la même résolution que les images de la séquence d’entrée. Le module SE, optionnel, peut réaliser une quantification des valeurs des cartes du premier groupe en utilisant un quantificateur Q pour générer une collection ordonnée de valeurs quantifiées. On rappelle que la quantification d'une valeur fait référence à la mise en correspondance de cette valeur avec un membre d'un ensemble discret de symboles de code possibles. Par exemple, l'ensemble de symboles de code possibles peut être constitué de valeurs entières, et le système de quantification réalise un simple arrondi d’une valeur réelle à une valeur entière. Selon un autre exemple, la quantification consiste en une multiplication par une valeur donnée puis un arrondi. Puis le module SE effectue une transformation des valeurs d’au moins une des cartes de caractéristiques, par exemple un suréchantillonnage, une interpolation, un filtrage, etc. À l’issue de la transformation, une carte de caractéristiques transformée du second groupe est de même résolution que les images de la séquence d’entrée. Avantageusement selon ce mode, les cartes de caractéristiques qui sont codées peuvent être de résolution inférieure à celle des images à coder, alors que les cartes du second groupe, qui servent à la construction des vecteurs caractéristiques, sont à la même résolution que la séquence d’images, ce qui facilite l’extraction.
[54] Dans un mode de réalisation, le module SE est absent, dans ce cas les valeurs qui serviront à construire le vecteur caractéristique sont extraites du premier groupe de cartes de caractéristiques. Le module XTR réalise une extraction de valeurs dans les cartes de caractéristiques FMi (et/ou FMSi et/ou FMEi, selon l’un des modes de réalisation décrits précédemment), pour une séquence d’échantillons courants Pvn à coder, en fonction de ses coordonnées dans les images d’entrée respectives. Par exemple si l’on cherche à coder les échantillons Pm aux coordonnées (xn, yn) de l’image numéro 1 et P2n aux coordonnées (xn, yn) de l’image numéro 2 de la séquence, le module XTR réalise une extraction de valeurs dans les cartes à des positions imposées par les coordonnées (xn, yn) des pixels courants.
[55] Dans un mode de réalisation, les valeurs extraites constituent le vecteur Zn. Zn est un J- uplet, c’est-à-dire qu’il comporte J éléments, ou données Zi. L’indice n réfère au vecteur caractéristique de la séquence d’échantillons courants, ou pixels, P’vn.
[56] Dans un mode de réalisation, le module TT, optionnel, réalise un traitement des valeurs extraites, pour générer le vecteur Zn. Le module TT peut réaliser une quantification des données extraites de l’ensemble de cartes de caractéristiques. Le traitement peut comporter d’autres
opérations, comme un filtrage, une mise à l’échelle, etc. En particulier, si le module SE n’est pas utilisé et si les cartes de caractéristiques du premier groupe sont à des résolutions inférieures à celle des images de la séquence, le module TT peut prendre en compte les coordonnées des valeurs dans les cartes de résolutions inférieures.
[57] On notera que l’un au moins des modules SE ou TT doit effectuer une quantification des cartes de caractéristiques.
[58] Le module MLP est un réseau de neurones défini par K paramètres Wk, apte à traiter le vecteur Zn, ou J-Uplet, en entrée, pour générer en sortie une séquence de vecteurs représentatifs d’une séquence d’échantillons P’vn à coder. Le réseau de neurones est selon un mode de réalisation un MLP, ou Multi Layer Perceptron, constitué d’une couche d’entrée adaptée au format d’entrée (le J-uplet), optionnellement une ou plusieurs couche(s) cachée(s), et une couche de sortie adaptée au format de sortie des vecteurs de sortie, de manière générale une pluralité de vecteurs comportant chacun A éléments. Selon un mode de réalisation, A est égal à 3 et un vecteur de sortie est un triplet (R, G, B) de l’un des N pixels P’vn de l’image v, codé puis décodé.
[59] Le module NNC réalise le codage du réseau de neurones, notamment de ses paramètres Wk. Durant le processus d’entraînement, ou de construction, du codage, c’est-à-dire tant que l’étape d’évaluation d’une performance n’est pas satisfaisante, le module NNC réalise une simulation de codage, suivi d’un décodage, à destination du module d’évaluation. Il met à jour les valeurs des paramètres en fonction des résultats d’une mesure de performance réalisée par le module EVAL. Par la suite, il effectue le codage effectif des paramètres du réseau de neurones Wk. Les paramètres codés sont notés Wck. De manière connue, la simulation de codage peut être identique au codage effectif, ou en réaliser une approximation.
[60] Le module FMC réalise le codage des cartes FMi, c’est-à-dire des valeurs des cartes de caractéristiques du premier groupe (à l’exclusion des cartes supplémentaires FMEiet des cartes du second groupe, résultant optionnellement d’un suréchantillonnage par le module SE). Durant le processus d’entraînement, ou de construction, du codage, c’est-à-dire tant que l’étape d’évaluation d’une performance n’est pas satisfaisante, le module FMC réalise une simulation de codage, suivi d’un décodage, à destination du module d’évaluation. Par la suite, il effectue le codage effectif des valeurs des cartes FMi. Les cartes codées sont notées FMci. De manière connue, la simulation de codage peut être identique au codage effectif, ou en réaliser une approximation. Le module de codage quantifie si nécessaire la représentation latente des
valeurs des cartes du premier groupe en utilisant un quantificateur pour générer une collection ordonnée de valeurs quantifiées. Puis le module de codage compresse les données quantifiées, en utilisant par exemple un codage de type entropique.
[61] Le module EVAL réalise une évaluation et minimisation d’une performance de codage. La fonction d’évaluation est par exemple de type débit-distorsion. La minimisation peut être effectuée par une descente de gradient, ou tout autre procédé à la portée de l’homme du métier.
[62] Le module MAJ réalise une mise à jour des valeurs des cartes FMi à encoder en fonction des résultats de la fonction de performance.
[63] La figure 2 représente schématiquement un dispositif de décodage DEC.
[64] Le dispositif de codage DEC de la figure 2 reçoit en entrée un premier groupe de données encodées organisées en M cartes de caractéristiques FMci (dites aussi couches FM) et les paramètres encodés Wck du réseau de neurones. Il décode les N séquences d’échantillons Pdvn des V images de la séquence à décoder.
[65] Ce dispositif de décodage DEC comprend un module NND de décodage de réseau de neurones, un module FMD de décodage des cartes de caractéristiques, un module XTR’ d’extraction de données, un module SE’ de transformation inverse, un module TT’ de traitement et quantification inverse, un module MLP’ correspondant à un réseau de neurones, un module FME’ optionnel de génération de cartes de caractéristiques supplémentaires. Il produit en sortie une séquence d’images décodées, notées I(Pdvn), comportant chacune respectivement une pluralité d’échantillons décodés Pdvn.
[66] Les cartes décodées par le module FMD, au nombre de M, sont notées FMdi. Les paramètres décodés par le module NND sont notés Wdk.
[67] Le décodeur peut aussi générer une ou plusieurs cartes supplémentaires, notées FME’i, au nombre de L, identiques aux cartes supplémentaires FMEi générées par le codeur.
[68] Dans un mode de réalisation, le module SE’ réalise une transformation du premier groupe de cartes de caractéristiques FMdi décodées pour générer un second groupe de cartes de caractéristiques à la même résolution que les images à décoder, notées FMS’i. Le module SE’ effectue optionnellement une quantification inverse correspondant à la quantification effectuée au codeur. La quantification inverse n’est pas nécessaire si le quantificateur Q du codeur a réalisé un simple arrondi des valeurs réelles qui lui sont soumises. La quantification
inverse n’est pas nécessaire non plus si le réseau de neurones est apte à prendre en compte une quantification de ses données d’entrée. Sinon, le décodeur réalise l’opération inverse du quantificateur Q. Puis le module SE’ effectue une transformation des valeurs des cartes de caractéristiques, par exemple un suréchantillonnage, une interpolation, un filtrage, etc., similaire à celle effectuée par le codeur. À l’issue de la transformation, une carte de caractéristiques transformée du second groupe est de même résolution que les images de la séquence à décoder.
[69] Dans un mode de réalisation, le module SE’ est absent, dans ce cas les valeurs qui serviront à construire le vecteur caractéristique sont extraites du premier groupe de cartes de caractéristiques.
[70] Le module XTR’ est identique au module XTR de la figure 1. Il réalise une extraction de valeurs des M cartes de caractéristiques FMdi, (et/ou FMS’i et/ou FME’i, selon l’un des modes de réalisation décrits précédemment), pour une séquence d’échantillons courants Pdvn à décoder, en fonction des coordonnées des échantillons dans les images à décoder respectives. Dans un mode de réalisation, J=M. Dans un mode de réalisation, J=M+L.
[71] Dans un mode de réalisation, les valeurs extraites constituent le vecteur Zdn. Zdn est un J-uplet, c’est-à-dire qu’il comporte J éléments, ou données zdi.
[72] Dans un mode de réalisation, le module TT’ , optionnel, réalise un traitement des valeurs extraites, pour générer le vecteur Zdn. Le module TT peut réaliser une quantification inverse des données extraites de l’ensemble de cartes de caractéristiques. Le traitement peut comporter d’autres opérations, comme un filtrage, une mise à l’échelle, etc., similaires à ceux effectués par le codeur.
[73] Le module MLP’ est un réseau de neurones défini par K paramètres Wdk, apte à traiter le vecteur Zdn, ou J-Uplet, en entrée, pour générer en sortie une séquence de vecteurs représentatifs d’une séquence d’échantillons Pdvn, comportant chacun A éléments. Selon un mode de réalisation, A=3 et un vecteur de sortie est le triplet (R, G, B) de l’un des N pixels Pdvn de l’image v à décoder. Le module MLP’ est de structure identique au module MLP, et ses paramètres sont soit identiques si le codage de ses paramètres Wk est sans perte, soit différents si le codage est réalisé avec pertes.
[74] Lorsque toutes les séquences d’échantillons Pdvn ont été décodées, on dispose d’une séquence d’images reconstruites, selon l’exemple V images I(Pdvn) comportant chacune N échantillons.
[75] Le dispositif de décodage DEC peut être mis en œuvre au moyen d’un dispositif électronique comprenant un processeur et une mémoire, non représentés ; chacun des modules mentionnés ci-dessus peut alors être réalisé par la coopération du processeur et d’instructions de programme d’ordinateur mémorisées dans la mémoire susmentionnée et conçues pour effectuer les fonctionnalités du module concerné, notamment comme décrit ci-dessous, lorsque ces instructions sont exécutées par le processeur
[76] La figure 3 illustre un exemple de réseau de neurones artificiels de synthèse utilisé dans le cadre de modes de réalisation de l’invention au codage et au décodage.
[77] Le réseau de neurones artificiels de synthèse MLP au codage et le réseau de neurones artificiels de synthèse MLP’ au décodage sont définis par une structure identique, comprenant par exemple une pluralité de couches de neurones artificiels, et par un ensemble de poids et fonctions d’activation associés respectivement aux neurones artificiels du réseau concerné.
[78] Une représentation vectorielle d’une séquence d’échantillons courants (un vecteur Zn ou Zdn issu des cartes de caractéristiques FMi/FMSi et FMEi ou FMdi/FMS’i et FME’i) est appliquée en entrée (c’est-à-dire sur une couche d’entrée) du réseau de neurones artificiels de synthèse MLP ou MLP’. Le réseau de neurones artificiels produit en sortie une pluralité de vecteurs P’vn ou Pdvn représentatifs des échantillons reconstruits (au codage) ou décodés (au décodage), selon un mode de réalisation les composantes de couleur (R, G, B ou Y,U,V) constitutives des pixels couleur d’une séquence d’images. Sur la figure 3, la séquence d’images correspond à deux images, chaque séquence d’échantillons comporte deux échantillons et les vecteurs correspondants sont notés Pdin et Pd2n.
[79] La concaténation de tous les pixels reconstruits dans chacune des images de la séquence de sortie constitue la séquence d’images décodées (au décodeur), ou reconstruites (au codeur).
[80] Au codeur, le réseau de neurones artificiels de synthèse MLP est entraîné sur la séquence d’images, de sorte à minimiser les différences entre la représentation en entrée de la séquence d’images courantes I(Pvn) et sa représentation I(P’Vn) en sortie, tout en minimisant également la quantité de données à encoder. Le module EVAL effectue une mesure de performance en ce sens.
[81] Une fois que l’entraînement est terminé, les paramètres du réseau sont encodés, soit sans pertes, auquel cas le réseau de neurones MLP’ est identique à MLP, soit avec pertes, auquel cas le réseau MLP’ peut être légèrement différent de MLP.
[82] La figure 4 est un logigramme représentant un exemple de procédé de codage qui peut être mis en œuvre par le dispositif de codage de la figure 1.
[83] Selon ce mode de réalisation, la séquence est une séquence d’images bidimensionnelles, chaque séquence d’échantillon à coder est donc un ensemble de pixels Pvn de coordonnées (xn, yn) dans les images respectives I(PVn) de la séquence à coder.
[84] L’encodage se déroule en deux phases principales :
[85] Dans une première phase, dite phase de construction, un apprentissage est réalisé, afin de déterminer, pour une séquence d’entrée I(Pvn), les valeurs des cartes FMi et des paramètres Wk pour optimiser une fonction de coût globale. L’apprentissage est par exemple réalisé par une descente de gradient, suivie d’une mise à jour des paramètres du réseau de neurones MLP et des valeurs des cartes de caractéristiques FMi. Comme il est connu dans l’état de l’art, la fonction de coût peut être de type débit-distorsion, ou débit, ou distorsion, ou perceptuelle. Pour mesurer le débit R, il est nécessaire de simuler le codage des cartes FMi, puis de mesurer le débit de codage associé (la taille du flux B 1). Selon un mode de réalisation, on ne simule pas le codage des paramètres Wk car leur influence est moins importante que celle des cartes de caractéristiques. Selon un mode de réalisation, on simule aussi le codage des paramètres Wk et on mesure le débit associé (la taille du flux B2). Pour mesurer la distorsion D, il est nécessaire de simuler le codage puis le décodage d’une partie au moins de la séquence d’images, pour obtenir au moins une séquence de pixels P’vn résultant d’une simulation de codage puis de décodage des échantillons d’indice n, puis de mesurer l'écart entre cette partie de la séquence d’images I(Pvn) en entrée et une partie correspondante de la séquence I(P’vn) codée puis décodée.
[86] Puis lors d’une deuxième phase, dite phase de codage, les cartes FMi et les paramètres Wk sont encodés pour produire les valeurs codées FMd et Wck avant transmission ou stockage. Ils constituent la représentation compressée de la séquence d’entrée I(PVn).
[87] On va maintenant décrire les étapes d’un procédé selon un mode de réalisation de l’invention.
[88] Lors d’une étape E20, une séquence d’entrée I(PVn) à coder, comportant au moins deux images, chacune d’entre elles comportant une pluralité de N échantillons Pn, est fournie en entrée du procédé. Selon un mode de réalisation, ces images sont des images temporelles d’une séquence vidéo. Selon un mode de réalisation, ces images sont des images d’une série d’images, par exemple médicales. Selon un mode de réalisation, ces images sont des composantes multivues ou 3D d’une image ou séquence d’images multivues ou 3D.
[89] Lors d’une étape E21, les M cartes FMi du premier groupe sont initialisées. Par la suite, les paramètres Wk du réseau de neurones MLP et les valeurs des cartes FMi doivent être optimisés durant la phase de construction.
[90] Selon un mode de réalisation, les cartes FMi sont de même résolution que les images de la séquence d’entrée I(Pvn) et comportent donc chacune le même nombre de valeurs N qu’il y a d’échantillons Pvn à coder dans chaque image v.
[91] Selon un mode de réalisation, les cartes FMi sont de résolution inférieure ou égale à celle des images de la séquence d’entrée I(Pvn) et comportent donc, pour au moins l’une d’entre elles, un nombre N’ de valeurs à coder inférieur à N. Selon une variante, la première carte FMi est à la résolution des images et chaque carte suivante est à une résolution moitié de la précédente.
[92] Selon un mode de réalisation, plusieurs cartes FMi sont de même résolution, inférieure à celle des images de la séquence d’entrée I(Pvn).
[93] Selon un mode de réalisation, les cartes FMi sont transformées pour fournir un second groupe de cartes de caractéristiques transformées FMSi. Dans ce mode, les vecteurs caractéristiques sont extraits de préférence des cartes transformées du second groupe, et non directement des cartes du premier groupe. Dans ce mode, les vecteurs caractéristiques sont donc extraits indirectement des cartes du premier groupe. Les cartes du second groupe ne sont ni stockées ni transmises, elles servent uniquement à la construction des vecteurs caractéristiques.
[94] Selon un mode de réalisation, les cartes FMi sont initialisées par des valeurs constantes prédéfinies.
[95] Selon un autre mode de réalisation, les cartes de caractéristiques sont initialisées par un ensemble de valeurs réelles aléatoires.
[96] Selon un mode de réalisation, une ou plusieurs cartes FMEi, formant un groupe supplémentaire de L cartes de caractéristiques supplémentaires, sont générées, et complètent le premier groupe. Elles servent à la construction du vecteur caractéristique mais ne sont ni stockées ni transmises.
[97] Les cartes de caractéristiques FMi du premier groupe sont par la suite mises à jour, ou raffinées, lors d’une étape E22, par le module de mise à jour MAJ du codeur au cours de son apprentissage.
[98] Lors d’une étape E23, les cartes FMi du premier groupe sont codées par le module FMC du codeur. Durant la phase de construction, cette opération est une simulation de codage. Durant la phase de codage, cette opération est un codage effectif et les valeurs codées constituent le flux B 1. La simulation peut être identique au codage effectif mais elle peut aussi être différente (par exemple, simplifiée). Pour ce codage, on peut utiliser toute technique connue visant à compresser les valeurs des cartes.
[99] Dans un mode de réalisation, les cartes FMi sont codées dans l’ordre (FMi, FM2,..., FM4), et les variables de chaque carte dans un ordre prédéfini, par exemple lexicographique. Chaque carte subit un codage entropique. Le codage entropique produit un flux compressé B 1 dont le débit est mesuré ultérieurement au cours d’une étape E29.
[100] Lors d’une étape E24, selon un mode de réalisation, les M cartes du premier groupe FMi sont transformées par le module SE pour générer des cartes du second groupe FMSi à la résolution des images de la séquence d’entrée.
[101] Selon un mode de réalisation, M cartes FMSi sont générées.
[102] Selon un mode de réalisation, chaque carte FMi est transformée en une carte FMSi.
[103] Selon un mode de réalisation, au moins une carte FMi est de résolution inférieure à celle des images de la séquence à coder et l’opération de transformation comporte un suréchantillonnage pour que la carte FMSi transformée comporte le même nombre d’échantillons que les images de la séquence. Le suréchantillonnage consiste à rajouter des valeurs dans les cartes FMSi pour atteindre la résolution des images de la séquence d’entrée. Il peut être simple (par réplication du plus proche voisin) ou comporter une interpolation (linéaire, polynomiale, par filtrage, etc.).
[104] Lors d’une étape E25, des valeurs sont extraites par le module XTR des cartes FMi ou éventuellement FMSi transformées, et optionnellement FMEi. supplémentaires. Cette extraction
est réalisée en fonction des coordonnées (xn, yn) de la séquence d’échantillons Pvn courants des images d’entrée. Elle peut aussi être réalisée en fonction de la résolution de la carte considérée. Les séquences d’échantillons à coder sont par exemple traitées par ordre séquentiel, de n=l à n=N.
[105] Selon un mode de réalisation, le vecteur Zn caractéristique résulte directement de cette extraction.
[106] Selon un mode de réalisation, lors d’une étape E26, le vecteur Zn caractéristique est construit par le module TT à partir des valeurs extraites des cartes FMi ou FMSi et optionnellement FMEi pour chaque séquence d’échantillons Pvn de coordonnées (xn, yn) des images d’entrée. Le traitement peut comporter une quantification des valeurs extraites ou du vecteur Zn constitué, si nécessaire. Le traitement peut comporter d’autres opérations, comme un filtrage, une mise à l’échelle, l’application d’une fonction quelconque, de préférence monotone, etc.
[107] Dans un mode de réalisation, Zn comporte autant de valeurs que de cartes FMi ou FMSi (et optionnellement FMEi) en entrée. Dans ce cas on a J=M(+L).
[108] Dans un mode de réalisation, Zn est un J-uplet (zi, Z2, . . . , zj), constitué des valeurs des cartes FMi ou FMSi (et optionnellement FMEi) situées aux coordonnées (xn, yn) d’un pixel courant Pvn, comme il sera illustré à l’appui de la figure 5.
[109] Dans un mode de réalisation, Zn est un J-uplet construit à partir de valeurs prélevées dans les cartes FMi (et optionnellement FMEi) à des coordonnées qui peuvent être différentes selon les cartes. Par exemple, si les cartes FMi (et/ou FMEi) sont à des résolutions différentes parce qu’elles ont été sous-échantillonnées, les cordonnées sont adaptées (par une mise à l’échelle) pour correspondre à la résolution de chaque carte.
[110] Dans un mode de réalisation, Zn est un J-uplet construit à partir de valeurs prélevées dans les cartes FMi (et optionnellement FMEi) en appliquant le traitement à une ou plusieurs valeurs des cartes, par exemple un filtrage des valeurs voisines de la valeur ciblée dans une carte. Par exemple, dans une carte FMi qui se trouve à la même résolution que le signal d’entrée, on peut extraire les valeurs situées aux coordonnées (xn, yn), (xn-l, yn), (xn, yn-l) et (xn-1, yn-l) et appliquer un traitement à ces valeurs (filtrages, moyennage, interpolation, etc.) pour obtenir la valeur finale (zi) de l’élément i du vecteur Zn relative à cette carte FMi ou FMEi. Selon un autre exemple, dans une carte FMi qui se trouve à une résolution moitié du signal d’entrée, on peut considérer les valeurs situées aux coordonnées (xn/2, yn/2), (xn/2-l, yn/2),
(xn/2, y n/2- 1) et (xn/2-1, yn/2- 1) et appliquer un traitement à ces valeurs (filtrages, moyennage, interpolation, etc.) pour obtenir la valeur finale (z0 de l’élément i du vecteur Zn relative à cette carte FMi ou FMEi.
[111] Lors d’une étape E27, le vecteur Zn est traité par le réseau de neurones MLP pour générer en sortie la séquence d’échantillons Pvn à coder, selon un mode de réalisation les triplets (R, G, B) des échantillons P’vn (les échantillons Pvn codés puis décodés).
[112] La structure et les paramètres Wk du réseau de neurones sont initialisés par exemple lors de la première itération de cette étape. Ces paramètres sont par la suite mis à jour, ou raffinés, au cours de la phase de construction, lors des itérations ultérieures du procédé.
[113] Selon un mode de réalisation, les paramètres du réseau de neurones sont initialisés par des valeurs prédéfinies connues pour donner un résultat satisfaisant (par exemple, à la suite d’un entraînement sur un corpus de séquences d’images).
[114] Selon un autre mode de réalisation, les paramètres Wk du réseau de neurones sont initialisés par un ensemble de valeurs aléatoires.
[115] Lors d’une étape E28, les paramètres Wk du réseau de neurones MLP sont quantifiés et codés. Durant la phase de construction, cette opération est une simulation de codage. Durant la phase de codage, cette opération est un codage effectif et les valeurs codées constituent le flux B2. La simulation peut être identique au codage effectif mais elle peut aussi être différente (par exemple, simplifiée). On peut utiliser à cette fin toute technique connue, par exemple la norme de codage de réseaux de neurones proposée par le standard MPEG-7 partie 17, aussi appelée NNR (Neural Network Representation). On notera que dans ce cas, il faut choisir la quantité de dégradation que le codage apporte aux paramètres Wk.
[116] Lors d’une étape E29, une mesure de performance est évaluée.
[117] À cet effet, les débits de simulation de codage associés aux cartes de caractéristiques du premier groupe (simulation du flux B 1 par codage des cartes FMi) et optionnellement aux paramètres du réseau de neurones (simulation du flux B 2 par codage des paramètres Wk) sont mesurés.
[118] Selon un mode de réalisation, la fonction de coût est de type débit-distorsion, notée (D+L*R), où D par exemple l’erreur quadratique mesurée entre les images d’entrée et les images décodées (ou l’erreur mesurée sur un sous-ensemble d’échantillon des images). Selon un autre exemple, D est calculé à partir d’une fonction perceptive telle que le SSIM (pour
Structural SIMilarity), ou MSSSIM (pour Multi-scale Structural SIMilarity). Selon un mode de réalisation, R est le débit simulé du flux B 1 ; selon un autre mode de réalisation, R est le débit total utilisé pour coder cette image, c’est-à-dire la somme des débits simulés de B 1 et B2. L est un paramètre qui règle le compromis débit-distorsion. D’autres fonctions de coût sont possibles.
[119] Tant que la fonction de coût n’a pas atteint son minimum, la mesure de performance n’est pas satisfaisante, et le procédé est réitéré à partir de l’étape E22. Cette minimisation peut être effectuée par un mécanisme connu comme une descente de gradient avec mise à jour des paramètres au cours de l’étape E22 pour les valeurs des cartes de caractéristiques et E27 pour les paramètres du réseau.
[120] Lors d’une étape EF, si la fonction de coût a atteint son minimum, l’entraînement s’arrête. Si une version codée correspondant à la dernière simulation des paramètres du réseau de neurones (Wk) et des cartes de caractéristiques (FM0 est disponible, les flux B1 et B2 peuvent en être constitués. Selon un autre mode de réalisation, le codage effectif les paramètres mis à jour du réseau de neurones (Wk) et des valeurs des cartes de caractéristiques (FM0 est effectué à cette étape pour produire les paramètres encodés Wck et FMd qui constituent des flux B1 etB2.
[121] Les flux B 1 et B2 peuvent être concaténés pour produire un flux final. Selon un mode de réalisation, le flux B2 des paramètres codés du réseau de neurones est stocké ou transmis avant le flux B 1 , afin de pouvoir être décodé avant le flux B 1.
[122] La figure 5 représente de manière illustrée un procédé de codage utilisé dans un mode de réalisation de l’invention.
[123] Dans cette illustration, une séquence de deux images I(Pin) et I(P2n) est à coder. De manière générale, une séquence de V images I(Pvn) est appliquée en entrée du procédé et dispositif de codage. Dans cette illustration, les échantillons, ou pixels, sont traités par séquence de deux, deux pixels étant prélevés dans les images respectives à une position notée (xn, yn), avec n variant de 1 à N. (Pin est prélevé dans l’image 1 à la position (xn, yn) et P2n est prélevé dans l’image 2 à la position (xn, yn)).
[124] Dans ce mode de réalisation, les cartes FMi générées sont au nombre de 4. Dans un mode préféré, elles sont au nombre de 7.
[125] La première carte FMi a la même résolution que l’image I, et comporte donc N=WxH variables, où W représente la largeur de l’image en pixels, et H sa hauteur. La seconde carte FM2 est de résolution moitié (dans chaque dimension) de la carte FMi. Chaque carte supplémentaire est de résolution moitié de la carte précédente. Cette structure permet de réduire le nombre de variables des cartes de caractéristiques ce qui facilite le codage et l’apprentissage tout en minimisant le coût de codage.
[126] La carte FM2 est suréchantillonnée par le module SE d’un facteur 2 dans chaque dimension, selon un procédé illustré à l’appui de la figure 6. La carte FM3 est suréchantillonnée d’un facteur 4 dans chaque dimension, et la carte FM4 d’un facteur 8 dans chaque dimension.
[127] Les cartes FMSi résultantes sont de même résolution que les images I(Pvn), et comportent donc chacune WxH valeurs, où W représente la largeur de l’image en pixels et H sa hauteur (N=WxH).
[128] Selon ce mode de réalisation, les couches FMi sont quantifiées par le module SE.
[129] D’autres types de structure sont possibles, par exemple on peut utiliser un taux de réduction différent de un demi entre les cartes (un quart, ou un tiers, etc.).
[130] Selon une variante présentée en pointillés, les cartes de caractéristiques sont au nombre de 5 : une carte supplémentaire FMEo a été introduite, qui ne sera ni codée ni transmise. Cette carte supplémentaire comporte typiquement des données qui peuvent assister le réseau MLP dans la tâche de reconstruction des images. Ainsi, les cartes ajoutées peuvent être une ou plusieurs parmi la liste suivante, non limitative :
[131] - Une carte comportant en chaque point l’abscisse de ce point.
[132] - Une carte comportant en chaque point l’ordonnée de ce point.
[133] - Une carte comportant en chaque point un codage positionnel (comme décrit par exemple à l’adresse Internet https://skosmos.loterre.fr/P66/fr/page/-K0D65X2X-X).
[134] - Une carte représentant une image distincte des images en cours de traitement, susceptible d’apporter des informations sur les images à coder, par exemple une image ou séquence d’images précédemment traitée.
[135] - Une carte contenant une donnée représentative de la différence temporelle entre les images de la vidéo en train d’être codée. Par exemple, si la première et la dernière image de la vidéo sont distantes de 8 images, tous les échantillons de la carte contiennent la valeur 8.
[136] - Une carte représentant une carte de caractéristiques d’une image distincte des images en cours de traitement, susceptible d’apporter des informations sur les images à coder, par exemple une carte précédemment traitée.
[137] - Une carte comportant la valeur d’un échantillon déjà décodé de la même carte, par exemple l’échantillon précédent dans l’ordre de décodage.
[138] Dans ce mode de réalisation, le vecteur Zn est un 4-uplet (Z1...Z4) constitué des valeurs extraites des cartes FMSi situées aux coordonnées (xn, yn) de la séquence de pixels courants P vii. Le vecteur Zn constitué des valeurs extraites (quantifiées) des cartes FMSi est traité par le réseau de neurones MLP pour générer en sortie une séquence de vecteurs, selon l’exemple deux triplets représentatifs des échantillons Pin et P2n à coder. Les vecteurs de sortie sont dans ce mode de réalisation les triplets (R, G, B) des pixels P’in et P’2n codés puis décodés. Les triplets sont insérés dans les images décodées I(P’in) et I(P’2n) aux positions (xn, yn) des composantes couleur (R’, G’, B’) des deux images.
[139] Dans un autre mode de réalisation, non représenté, le vecteur Zn est extrait directement des couches FMi, aux positions recalculées en fonction de la taille des cartes, puis les valeurs extraites sont éventuellement traitées et quantifiées après extraction.
[140] Selon la variante présentée en pointillés, le vecteur Zn est un 5-uplet (Z0...Z4), la valeur zo étant extraite de la carte supplémentaire FMEo.
[141] La figure 6 est un logigramme représentant un exemple de procédé de décodage qui peut être mis en œuvre par le dispositif de décodage de la figure 2.
[142] Lors d’une étape E30, les flux B 1 et B2 sont extraits du flux encodé BS. Ils contiennent respectivement les représentations codées des cartes du premier groupe FMci et des paramètres Wck.
[143] Lors d’une étape E31, les M cartes FMdi sont générées par décodage des valeurs FMci. Pour ce décodage, on peut utiliser toute technique connue similaire à celle utilisée au codeur, de préférence un décodage entropique. Dans un mode de réalisation, les cartes FMdi sont décodées dans l’ordre (FMdi, FMd2,... FMd4), et les variables de chaque carte dans un ordre prédéfini, par exemple lexicographique.
[144] Selon des modes de réalisation tels que décrits pour le codeur :
[145] - Les cartes FMdi sont de même résolution que les images de la séquence I (Pdvn) à reconstituer, c’est-à-dire qu’elles comportent N=WxH valeurs.
[146] - Les cartes FMdi sont de résolution inférieure ou égale à celle des images de la séquence I (Pd vii) a reconstituer.
[147] - Plusieurs cartes FMdi sont de même résolution, inférieure à celle des images de la séquence.
[148] Lors d’une étape E32, selon un mode de réalisation, une ou plusieurs cartes FME’i, formant un groupe supplémentaire de L cartes de caractéristiques supplémentaires, sont générées et complètent le premier groupe. Elles ne sont pas décodées mais générées par le décodeur de manière identique à la génération du codeur. Elles comportent typiquement des données qui peuvent assister le réseau MLP’ dans la tâche de reconstruction des images de la séquence. La liste non limitative de cartes de caractéristiques supplémentaires possibles décrite à l’appui de la figure 5 pour le codeur s’applique ici.
[149] Lors d’une étape E33, selon un mode de réalisation, les M cartes du premier groupe FMdi sont transformées par le module SE pour générer des cartes du second groupe FMS’ià la résolution des images de la séquence d’entrée.
[150] Selon un mode de réalisation, M cartes FMS’i sont générées.
[151] Selon un mode de réalisation, chaque carte FMdi est transformée en une carte FMSi.
[152] Selon un mode de réalisation, au moins une carte FMdi est de résolution inférieure à celle des images de la séquence à coder et l’opération de transformation comporte un suréchantillonnage pour que la carte FMS’i transformée comporte le même nombre d’échantillons que des images de la séquence d’entrée. Comme au codeur, le suréchantillonnage consiste à rajouter des valeurs dans les cartes FMS’i pour atteindre la résolution des images de la séquence d’entrée. Il peut être simple (par réplication du plus proche voisin) ou comporter une interpolation (linéaire, polynomiale, par filtrage, etc.)
[153] La transformation peut optionnellement comporter une quantification inverse des valeurs extraites, si nécessaire. Cependant la quantification inverse n’est pas obligatoire.
[154] Lors d’une étape E34, des valeurs sont extraites par le module XTR’ des cartes FMdi ou éventuellement FMS’i transformées, et optionnellement FME’i supplémentaires. Cette extraction est réalisée en fonction des coordonnées (xn, yn) de la séquence d’échantillons courants Pvn à décoder des images de la séquence. Elle peut aussi être réalisée en fonction de
la résolution de la carte considérée. Les séquences d’échantillons à décoder sont par exemple traitées par ordre séquentiel, de n=l à n=N.
[155] Selon un mode de réalisation, le vecteur Zdn caractéristique résulte directement de cette extraction.
[156] Notamment, dans un mode de réalisation, Zdn est un J-uplet (zi, Z2, . . . , zj), constitué des valeurs des cartes FMdi ou FMS’i (et optionnellement FME’i) situées aux coordonnées (xn, yn) d’un pixel courant Pdvn, comme il sera illustré à l’appui de la figure 7.
[157] Selon un mode de réalisation, lors d’une étape E35, un vecteur Zdn est construit par le module TT’ à partir des valeurs extraites des cartes FMdi du premier groupe ou des cartes FMS’i du second groupe et éventuellement FME’i du groupe supplémentaire, pour chaque séquence d’échantillons Pdvn de coordonnées (xn, yn) des images d’entrée à décoder, en fonction des coordonnées (xn, yn). Cette étape est identique à l’étape E26 qui a été décrite pour le codeur à l’appui de la figure 4 et les modes de réalisation décrits s’appliquent. L’extraction peut comporter une quantification inverse des valeurs extraites ou du vecteur Zdn constitué, si nécessaire.
[158] Lors d’une étape E36, les paramètres Wdk du réseau de neurones MLP’ sont générés par décodage des valeurs Wck du flux B2. On peut utiliser à cette fin toute technique connue de décodage correspondant à celle de codage qui a été utilisée par le codeur. Le réseau de neurones MLP’ est semblable au réseau MLP, c’est-à-dire qu’il est de même structure et comporte les mêmes paramètres, au codage près, qui peut être réalisé avec ou sans pertes.
[159] Selon un mode de réalisation, le flux B2 est décodé avant le flux B l, afin de pouvoir disposer du réseau de neurones avant de commencer à décoder les séquences d’échantillons.
[160] Lors d’une étape E37, le vecteur Zdn est traité par le réseau de neurones MLP' pour générer en sortie la séquence d’échantillons Pdvn courante à décoder, selon un mode de réalisation les triplets (R, G, B) des échantillons Pdvn. Les échantillons sont insérés dans les images décodées I(Pdvn) aux positions (xn, yn) des composantes couleur (Rd, Gd, Bd) des images respectives de la séquence. Cette étape est identique à l’étape E27 qui a été décrite pour le codeur à l’appui de la figure 4.
[161] Lorsque toutes les séquences d’échantillons ont été traitées, la séquence d’images décodées correspondante est disponible.
[162] La figure 7 représente de manière illustrée un procédé de décodage utilisé dans un mode de réalisation de l’invention.
[163] Dans cette illustration, une séquence de deux images I(Pdin) et I(Pd2n) est à décoder. De manière générale, une séquence de V images I(Pdvn) est décodée par le procédé et dispositif de décodage. Dans cette illustration, les échantillons, ou pixels, sont traités par séquence de deux, deux pixels étant décodés et reconstruits dans les images respectives à une position notée (xn, yn), avec n variant de 1 à N. (Pdin est inséré dans l’image 1 à la position (xn, yn) et Pd2n est inséré dans l’image 2 à la position (xn, yn)).
[164] Dans ce mode de réalisation, les cartes FMdi sont au nombre de 4. Dans un mode préféré, elles sont au nombre de 7.
[165] Dans ce mode de réalisation, la première carte FMdi a la même résolution que l’image I, et comporte donc WxH variables, où W représente la largeur de l’image en pixels, et H sa hauteur. La seconde carte FMd2 est de résolution moitié (dans chaque dimension) de la carte FMdi. Chaque carte supplémentaire est de résolution moitié de la carte précédente. Cette structure permet de réduire le nombre de variables des cartes de caractéristiques ce qui facilite le décodage tout en minimisant le coût de codage.
[166] La carte FMd2 est suréchantillonnée par le module SE’ d’un facteur 2 dans chaque dimension, selon tout procédé de suréchantillonnage à la portée de l'homme du métier. La carte FMds est suréchantillonnée d’un facteur 4 dans chaque dimension, et la carte FMd4 d’un facteur 8 dans chaque dimension.
[167] Les cartes FMS’i sont de même résolution que l’image à décoder, et comportent donc WxH valeurs, où W représente la largeur de l’image en pixels, et H sa hauteur.
[168] Dans ce mode de réalisation, le vecteur Zdn est un 4-uplet (Z1...Z4) constitué des valeurs des cartes FMS’i situées aux coordonnées (xn, yn) de la séquence de pixels courants Pdvn. Le vecteur Zdn est optionnellement déquantifié puis traité par le réseau de neurones MLP’ pour générer en sortie les triplets (R, G, B) ou (Y,U,V) respectifs des deux échantillons Pdvn (Pdin et Pd2n) à décoder. Les triplets (R, G, B ou Y,U,V) sont insérés dans les images respectives décodées I(Pdin) et I(Pd2n) aux coordonnées (xn, yn) dans les composantes couleur (Rd, Gd, Bd) ou (Yd, Ud, Vd) des images.
[169] Selon une variante présentée en pointillés, les cartes sont au nombre de 5 : une carte supplémentaire FME’o a été introduite. Dans ce mode de réalisation, le vecteur Zdn est un 5- uplet.
Claims
[Revendication 1] Procédé de codage d’une séquence d’au moins deux images (I(PVn), I(Pin), I(P2n)) comprenant des échantillons (Pvn, Pin,, P2n) à coder comportant les étapes suivantes :
- une étape de construction, comportant les sous-étapes de :
- construction (E21, E22) d’un premier groupe de cartes de caractéristiques (FM0;
- pour une séquence d’échantillons, dits échantillons courants (Pvn, Pin,P2n), desdites images respectives de la séquence, associés à une position (xn, yn) dans lesdites images respectives :
- construction (E25) d’un vecteur caractéristique (Zn) à partir desdites cartes de caractéristiques (FMi) dudit premier groupe, en fonction de ladite position (xn, yn) desdits échantillons courants (Pin, P211), et ;
- traitement (E27) dudit vecteur (Zn) par un réseau de neurones artificiels (MLP) défini par un ensemble de paramètres (Wk), pour fournir une séquence de vecteurs représentatifs respectivement de valeurs décodées (P’in, P’2n) desdits échantillons courants ;
- mise à jour (E22, E27) d'au moins une valeur d’une desdites cartes de caractéristiques dudit premier groupe et/ou d’au moins un paramètre dudit réseau, en fonction d’une mesure de performance de codage,
- une étape de codage (E23, E28, EF) dudit premier groupe de cartes de caractéristiques (FMi) et dudit ensemble de paramètres (Wk).
[Revendication 2] Procédé de codage d’une séquence d’images selon la revendication 1, caractérisé en ce qu’il comporte une étape de transformation (E24) dudit premier groupe de carte de caractéristiques (FMi) pour obtenir un second groupe de cartes de caractéristiques (FMSi) à la résolution des images de la séquence d’entrée, et en ce que ledit vecteur caractéristique (Zn) est construit à partir desdites cartes de caractéristiques transformées (FMSi) du second groupe obtenues à partir desdites cartes de caractéristiques (FMi) dudit premier groupe.
[Revendication 3] Procédé de codage selon la revendication 2, caractérisé en ce qu’une au moins desdites cartes de caractéristiques du premier groupe (FMi) est de résolution inférieure à celle desdites images à coder et en ce que l’opération de transformation comporte un suréchantillonnage.
[Revendication 4] Procédé de codage selon l’une des revendications précédentes, caractérisé en ce que la construction dudit vecteur (Zn) caractéristique comporte une sous-étape d’extraction d’une valeur de ladite au moins une carte de caractéristiques (FMi, FMSi.) à une position identique (xn, yn) à celle des échantillons courants (Pvn) dans lesdites images à coder.
[Revendication 5] Procédé de codage selon la revendication 1, caractérisé en ce que la construction dudit vecteur caractéristique (Zn) comporte les sous-étapes suivantes :
- extraction d’une pluralité de valeurs desdites cartes de caractéristiques dudit premier groupe (FMi) en fonction de ladite position (xn, yn) desdits échantillons courants (Pvn) ;
- traitement (E26) desdites valeurs extraites pour obtenir le vecteur caractéristique.
[Revendication 6] Procédé de codage selon l’une des revendications précédentes, caractérisé en ce qu’il comporte une étape de construction (E21, E22) d’un groupe supplémentaire de cartes de caractéristiques (FMEi), et en ce que le vecteur caractéristique est en outre construit à partir desdites cartes de caractéristiques du groupe supplémentaire.
[Revendication 7] Procédé de codage selon l’une des revendications précédentes, caractérisé en ce que le codage dudit premier groupe de cartes de caractéristiques comporte une sous-étape de codage entropique.
[Revendication 8] Procédé de décodage d’une séquence d’au moins deux images (I(Pdvn), I(Pdin), I(Pd2n)) comprenant des échantillons (Pvn, Pin, P2n) à décoder comportant les étapes suivantes :
- décodage (E31) d’un premier groupe de cartes de caractéristiques (FMdi) ;
- décodage (E36) d’un ensemble de paramètres (Wdk) représentatifs d’un réseau de neurones (MLP’) ;
- pour une séquence d’échantillons, dits échantillons courants (Pdvn), desdites images respectives de la séquence à décoder, associés à une position (xn, yn) dans lesdites images respectives :
- construction (E34) d’un vecteur caractéristique (Zdn) à partir des cartes de caractéristiques dudit premier groupe (FMdi), en fonction de ladite position (xn, yn) desdits échantillons courants, et :
- traitement (E37) dudit vecteur (Zdn) par un réseau de neurones artificiels (MLP’) défini par les paramètres décodés (Wdk) pour fournir une séquence de vecteurs représentatifs respectivement desdits échantillons courants (Pdvn).
[Revendication 9] Procédé de décodage selon la revendication 8, caractérisé en ce qu’il comporte une étape de transformation (E33) dudit premier groupe de cartes de caractéristiques décodées (FMdi) pour obtenir un second groupe de cartes de caractéristiques (FMS’i) à la résolution des images de la séquence d’entrée et en ce que ledit vecteur caractéristique (Zdn) est construit à partir desdites cartes de caractéristiques transformées (FMS’i) du second groupe obtenues à partir desdites cartes de caractéristiques décodées (FMdi) dudit premier groupe.
[Revendication 10] Procédé de décodage selon la revendication 9, caractérisé en ce qu’une au moins desdites cartes de caractéristiques du premier groupe (FMdi) est de résolution inférieure à celle desdites images à décoder et en ce que l’opération de transformation comporte un suréchantillonnage.
[Revendication 11] Procédé de décodage selon l’une des revendications 8 à 10, caractérisé en ce que la construction dudit vecteur (Zdn) caractéristique comporte une sous- étape d’extraction (E34) d’une valeur de ladite au moins une carte de caractéristiques (FMdi, FMS’i) à une position identique (xn, yn) à celle des échantillons courants (Pdvn) dans lesdites images à décoder.
[Revendication 12] Procédé de décodage selon la revendication 8, caractérisé en ce que la construction dudit vecteur caractéristique (Zdn) comporte les sous-étapes suivantes :
- extraction d’une pluralité de valeurs desdites cartes de caractéristiques dudit premier groupe (FMdi) en fonction de ladite position (xn, yn) desdits échantillons courants (Pdvn) ;
- traitement (E35) desdites valeurs extraites pour obtenir le vecteur caractéristique.
[Revendication 13] Procédé de décodage selon l’une des revendications 8 à 12, caractérisé en ce qu’il comporte une étape de construction (E32) d’un groupe supplémentaire de cartes de caractéristiques (FME’i) et en ce que le vecteur caractéristique est en outre construit à partir desdites cartes de caractéristiques du groupe supplémentaire.
[Revendication 14] Procédé de décodage selon l’une des revendications 8 à 13, caractérisé en ce que le décodage (E31) dudit premier groupe de cartes de caractéristiques comporte une sous-étape de décodage entropique.
[Revendication 15] Dispositif de codage d’une séquence d’au moins deux images (I(Pvn), I(Pin), I(P2n)) comprenant des échantillons (Pvn, Pin, P2n) à coder, caractérisé en ce que ledit dispositif est configuré pour mettre en œuvre :
- construction (GEN, MAJ) d’un premier groupe de cartes de caractéristiques (FMQ ;
- pour une séquence d’échantillons, dits échantillons courants (Pvn, Pin, P2n), desdites images respectives de la séquence, associés à une position (xn, yn) dans lesdites images respectives:
- construction (XTR) d’un vecteur caractéristique (Zn) à partir desdites cartes de caractéristiques (FM0 dudit premier groupe, en fonction de ladite position (xn, yn) desdits échantillons courants (Pin, P2n) ;
- traitement (MLP) dudit vecteur (Zn) par un réseau de neurones artificiels (MLP) défini par un ensemble de paramètres (Wk), pour fournir une séquence de vecteurs représentatifs respectivement de valeurs décodées (P’ in, P’2n) desdits échantillons courants;
- mise à jour (MAJ, NND) d'au moins une valeur d’une desdites cartes de caractéristiques et/ou d’au moins un paramètre dudit réseau, en fonction d’une mesure de performance de codage ;
- une étape de codage (FMC, NNC) dudit premier groupe de cartes de caractéristiques (FMi) et dudit ensemble de paramètres (Wk).
[Revendication 16] Dispositif de décodage d’une séquence d’au moins deux images (I(Pd VI1X I(Pdin), I(Pd2n)) comprenant des échantillons (Pdvn, Pdin, Pd2n) à décoder, caractérisé en ce que ledit dispositif est configuré pour mettre en œuvre :
- décodage (FMD) d’un premier groupe de cartes de caractéristiques (FMdi) ;
- décodage (NND) d’un ensemble de paramètres (Wdk) représentatifs d’un réseau de neurones (MLP’) ;
- pour une séquence d’échantillons, dits échantillons courants (Pdvn), desdites images respectives de la séquence à décoder, associés à une position (xn, yn) dans lesdites images respectives :
- construction (E34, XTR’) d’un vecteur caractéristique (Zdn) à partir des cartes de caractéristiques dudit premier groupe (FMdi), en fonction de ladite position (xn, yn) desdits échantillons courants, et :
- traitement (E36, MLP’) dudit vecteur (Zdn) par un réseau de neurones artificiels (MLP’) défini par les paramètres décodés (Wdk) pour fournir une séquence de vecteurs représentatifs respectivement desdits échantillons courants (Pdvn).
[Revendication 17] Programme d’ordinateur comportant des instructions pour l’exécution des étapes d'un procédé de codage ou de décodage selon la revendication 1 ou 8 lorsque ledit programme est exécuté par un ordinateur.
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| FR2213098A FR3143247A1 (fr) | 2022-12-09 | 2022-12-09 | Procédé et dispositif de codage et décodage de séquences d’images. |
| PCT/EP2023/084249 WO2024121110A1 (fr) | 2022-12-09 | 2023-12-05 | Procédé et dispositif de codage et décodage de séquences d'images |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| EP4630969A1 true EP4630969A1 (fr) | 2025-10-15 |
Family
ID=86331763
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| EP23818383.4A Pending EP4630969A1 (fr) | 2022-12-09 | 2023-12-05 | Procédé et dispositif de codage et décodage de séquences d'images |
Country Status (6)
| Country | Link |
|---|---|
| EP (1) | EP4630969A1 (fr) |
| JP (1) | JP2026502078A (fr) |
| KR (1) | KR20250120372A (fr) |
| CN (1) | CN120604241A (fr) |
| FR (1) | FR3143247A1 (fr) |
| WO (1) | WO2024121110A1 (fr) |
-
2022
- 2022-12-09 FR FR2213098A patent/FR3143247A1/fr active Pending
-
2023
- 2023-12-05 JP JP2025533283A patent/JP2026502078A/ja active Pending
- 2023-12-05 KR KR1020257022642A patent/KR20250120372A/ko active Pending
- 2023-12-05 EP EP23818383.4A patent/EP4630969A1/fr active Pending
- 2023-12-05 CN CN202380093199.4A patent/CN120604241A/zh active Pending
- 2023-12-05 WO PCT/EP2023/084249 patent/WO2024121110A1/fr not_active Ceased
Also Published As
| Publication number | Publication date |
|---|---|
| CN120604241A (zh) | 2025-09-05 |
| JP2026502078A (ja) | 2026-01-21 |
| WO2024121110A1 (fr) | 2024-06-13 |
| FR3143247A1 (fr) | 2024-06-14 |
| KR20250120372A (ko) | 2025-08-08 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| WO2024121109A1 (fr) | Procédé et dispositif de codage et décodage d'images | |
| WO2024240496A1 (fr) | Procédé et dispositif de codage et décodage d'images | |
| FR3026261A1 (fr) | Procede de codage et de decodage d'images integrales, dispositif de codage et de decodage d'images integrales et programmes d'ordinateur correspondants | |
| EP4630969A1 (fr) | Procédé et dispositif de codage et décodage de séquences d'images | |
| WO2024121108A1 (fr) | Procédé et dispositif de codage et décodage d'images. | |
| WO2024121107A1 (fr) | Procédé et dispositif de codage et décodage d'images. | |
| WO2024260629A1 (fr) | Procédé et dispositif de codage et décodage de séquences d'images | |
| WO2024260628A1 (fr) | Procédé et dispositif de codage et décodage de séquences d'images | |
| WO2024240497A1 (fr) | Procédé et dispositif de codage et décodage d'images. | |
| WO2025056653A1 (fr) | Procédé et dispositif de codage et décodage d'images | |
| WO2025056651A1 (fr) | Procédé et dispositif de codage et décodage de séquences d'images | |
| WO2022175626A1 (fr) | Determination d'un mode de codage d'image | |
| WO2026003293A1 (fr) | Procédé et dispositif de codage et décodage d'un signal | |
| WO2026087142A1 (fr) | Procédé et dispositif de codage et décodage d'images | |
| WO2026003351A1 (fr) | Procédé et dispositif de codage et décodage d'un signal | |
| WO2026003354A1 (fr) | Procédé et dispositif de codage et décodage d'un signal | |
| WO2025120066A1 (fr) | Procédé et dispositif de codage et décodage contextuel de séquences d'images | |
| WO2026003294A1 (fr) | Procédé et dispositif de codage et décodage d'un signal | |
| WO2025180860A1 (fr) | Procédé et dispositif de codage et décodage d'images avec mécanisme de correction | |
| WO2025180859A1 (fr) | Procédé et dispositif de codage et décodage d'images avec mécanisme de correction | |
| WO2025056649A1 (fr) | Procédé et dispositif de codage et décodage d'images avec mécanisme d'attention. |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: UNKNOWN |
|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: THE INTERNATIONAL PUBLICATION HAS BEEN MADE |
|
| PUAI | Public reference made under article 153(3) epc to a published international application that has entered the european phase |
Free format text: ORIGINAL CODE: 0009012 |
|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: REQUEST FOR EXAMINATION WAS MADE |
|
| 17P | Request for examination filed |
Effective date: 20250603 |
|
| AK | Designated contracting states |
Kind code of ref document: A1 Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC ME MK MT NL NO PL PT RO RS SE SI SK SM TR |
|
| DAV | Request for validation of the european patent (deleted) | ||
| DAX | Request for extension of the european patent (deleted) |