WO2009147181A1 - Construction d'une nouvelle structure de representation de l'image s'appuyant sur des objets semantiques au sein d'un flux video compresse, procede et dispositif associes - Google Patents
Construction d'une nouvelle structure de representation de l'image s'appuyant sur des objets semantiques au sein d'un flux video compresse, procede et dispositif associes Download PDFInfo
- Publication number
- WO2009147181A1 WO2009147181A1 PCT/EP2009/056828 EP2009056828W WO2009147181A1 WO 2009147181 A1 WO2009147181 A1 WO 2009147181A1 EP 2009056828 W EP2009056828 W EP 2009056828W WO 2009147181 A1 WO2009147181 A1 WO 2009147181A1
- Authority
- WO
- WIPO (PCT)
- Prior art keywords
- objects
- image
- stream
- header
- group
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Ceased
Links
Classifications
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04N—PICTORIAL COMMUNICATION, e.g. TELEVISION
- H04N19/00—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals
- H04N19/10—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals using adaptive coding
- H04N19/102—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals using adaptive coding characterised by the element, parameter or selection affected or controlled by the adaptive coding
- H04N19/129—Scanning of coding units, e.g. zig-zag scan of transform coefficients or flexible macroblock ordering [FMO]
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04N—PICTORIAL COMMUNICATION, e.g. TELEVISION
- H04N19/00—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals
- H04N19/20—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals using video object coding
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04N—PICTORIAL COMMUNICATION, e.g. TELEVISION
- H04N19/00—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals
- H04N19/60—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals using transform coding
- H04N19/61—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals using transform coding in combination with predictive coding
-
- H—ELECTRICITY
- H04—ELECTRIC COMMUNICATION TECHNIQUE
- H04N—PICTORIAL COMMUNICATION, e.g. TELEVISION
- H04N19/00—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals
- H04N19/70—Methods or arrangements for coding, decoding, compressing or decompressing digital video signals characterised by syntax aspects related to video coding, e.g. related to compression standards
Definitions
- the present invention provides a novel image representation structure based on semantic objects within a compressed video stream, as well as the method for obtaining such a structure. It will, for example, be used in video surveillance applications.
- object a related set of pixels, blocks or macroblocks of an image that has an own displacement within the sequence of the image relative to the other objects.
- the segmentation of the object is thus generally performed in the direction of movement. From this segmentation, a set of descriptors can be extracted and can characterize this or these object (s).
- descriptors can be low, or even very low level (color, luminance histogram, size, etc.) or higher level (type of object, trajectory, etc. .). They enrich the segmentation of a semantic character, allowing to add these elements to the description based on the movement. It is thus possible to define a person, a vehicle or the bottom of an image as an object.
- An object or group of objects can then be defined as a set of objects linked by a common descriptor chosen by the user at the time of compression of the video stream.
- a group of objects will contain, for example, all the red objects, those moving to the right or people within an image.
- portion corresponds to a sub-part of an object consisting of macroblocks that belong to the same set defined by the user.
- MPEG video compression standards such as the MPEG-1, MPEG-2 and the MPEG-4 standards.
- the principle of the MPEG-4 compression standard is the decomposition of audiovisual scenes into several hierarchical media objects. These objects are called Audio Visual Objects or Audio Visual Object (AVO).
- An AVO can be a video stream, an audio stream, a text, a graph, and so on.
- MPEG-4 provides coding methods for individual objects, for example MPEG-4 Part2 for video objects and MPEG-4 Part3 for audio objects.
- a visual scene will be seen as the composition of AVO according to a script describing their spatial and temporal relations.
- Individual access to objects requires the scene to be represented as the composition of various objects that will then be assembled to recreate the scene.
- This object approach then allows a very large number of operations on an MPEG-4 sequence: adding, deleting or moving an object, geometric transformation, changing point of view, etc.
- a video object or in English Video Object (VO) is an object that the user can access and that he can handle easily.
- a video object VO at a given moment is a video object or Video Object Plane (VOP) object plane corresponding to a video object of arbitrary shape at a fixed moment.
- VOP Video Object Plane
- the MPEG-4 standard has also provided VOP object video object hierarchies associated with different degrees of accessibility, a VOP can be sub-divided into several sub-VOPs. In general, three types of VOP are considered.
- a single VOP the representation is then reduced to the well-known case of a single scene. Two VOPs, a case that corresponds to the partitioning of the scene into various VOPs, using the traditional 2D video sequences as input.
- VOPs Two or more VOPs allow by combination the reconstruction of a scene from several sources. This assumes that the data is exploitable at the beginning of the production process.
- a scene is a composition of separate objects.
- the VOP shape, motion, and texture information is encoded into separate video object layer (VOL) layers for separate VOP decoding.
- the video verification model MPEG-4 VM uses an identical algorithm to encode information relating to the shape, the movement and the texture in each layer. However, the shape information is not transmitted if the sequence to be encoded contains only rectangular sized images.
- Each VOP represents an image whose type can be Intra (I), Predictive (P) or Bidirectional (B).
- a type I VOP is coded independently of the others, it provides the access points in the bit stream. It serves as a reference for encoding VOPs of type "P" and "B".
- a P-type VOP can be predicted by motion compensation from an "I” or "P” VOP preceding it in the stream. It is also used for coding "B" type images.
- the macroblocks that compose it can be predicted either by simple forward or backward motion compensation from VOP "P" or "I”, or by double compensation of forward and backward motion.
- the input images that must be encoded for each VOP are arbitrary in shape and the position and shape of the images vary over time in respect of a reference window. All VOLs that must be encoded for an input sequence are defined with reference to the reference window whose size is constant. In fact, when encoding, objects in a stream are encoded relative to each other in a dependent manner.
- the profiles defined in H.264 limit the number of groups of portions or "slices-group”: 1 for the main profile, "main” according to the name Anglo-Saxon (which makes impossible any division by semantic object) , 8 for the basic profiles and extended, “baseline” and “extended” according to the English name, which limits to 7 the number of moving objects in a scene (the 8 ⁇ m ⁇ slices group then being assigned to the bottom of the image). Both cases remain too restrictive in the case of site monitoring.
- each slice can be defined as a sub-portion of the macroblock stream.
- the object of the invention concerns a new hierarchical structure for representing an image based on a semantic approach. It has among other advantages that of coding the objects present in a video stream independently while producing a single stream without additional cost for compression.
- the invention relates to a method for defining a structure of an image in a compressed video stream composed of a structure having at least one of the features previously described, characterized in that it comprises at least the following steps: > defining within an image at least one object or group of objects, a group of objects being defined as a set of objects linked by one or more common descriptor (s) chosen at the time of the compressing said stream, said object comprising one or more portions or "slices" corresponding to a sub-part of the image consisting of macroblocks belonging to the same set, and
- the method may comprise at least the following steps:
- it inserts an object group header upstream of an object header to designate a set of objects.
- the compressed video stream being composed of one or more images having a structure having one of the aforementioned characteristics
- the method is characterized in that it comprises at least one decoding step comprising the selection of descriptors associated with one or more objects. or one or more groups of objects and a step of decoding said selected objects or groups of objects and a step of decompressing said objects or groups of objects.
- the invention also relates to a device for generating a frame structure of an image in a video stream characterized in that it comprises at least one means adapted to perform the steps of the method according to one of the preceding claims.
- the device may comprise at least the following elements: an encoder comprising at least: a means for analyzing images of a first stream F1 in order to segment the images and to extract the desired descriptors for a group of objects or an object,
- a decoder for compressing the different objects or groups of objects and transmitting them in the form of a stream F2, a decoder comprising at least:
- a module adapted to decode the different headers inserted in said video stream F2 and to interpret the information they contain,
- a buffer memory for executing a pass-over during the reconstitution of an object, making it possible to leave a block as it is in the buffer of the decoder at the time of its decoding
- a module adapted to identify the different objects or groups of objects satisfying a decoding request
- FIGS. 1A and 1B an exemplary image structure according to the invention described in the data flow representation and also according to a tree distribution,
- FIG. 2 the manner in which an object portion requiring a reconstruction different from the rest of the object is described
- FIG. 3 an exemplary implementation of the decoding of objects in an image having a structure according to the invention
- FIG. FIG. 5 the notion of multireference passage corresponding to the Anglo-Saxon name "multi-reference pass-over”
- FIG. 6, an example of an associated device.
- the object of the present invention relates in particular to a new hierarchical image representation structure which implements a visual object approach within a single compressed video stream. This allows among other things to decode the objects present in a single stream independently and without additional cost.
- the new structure :
- FIGS. 1A and 1B Such a hierarchical structure is, for example, described in FIGS. 1A and 1B.
- the subject of the present invention relates to a single video stream having a structure such as that described in FIG.
- the groups of objects may comprise several objects having a common parameter.
- a group of objects is defined, for example, by a common descriptor chosen by the user for compression as defined above.
- FIG. 1A schematizes an exemplary structure for an image in a single video stream according to the invention.
- the video stream is divided into several zones each corresponding to an image designated Z 1 for image 1 and Z 1 more generally.
- the video stream is composed of several images, themselves composed of one or more group (s) of objects; each group of objects is composed of one or more object (s), themselves made up of one or more "slice (s)".
- a group of objects can be reduced in some cases an object.
- Each of these elements of the hierarchy will be identified within the flow by a clean header, allowing optimized navigation and access in terms of sub stream portion search. Indeed, the headers can directly contain the descriptors which allowed to distinguish the slices / objects / groups of objects, and which will therefore be exploitable at the time of navigation.
- the proposed segmentation is motion-based, since each object is defined as a connected set of pixels, blocks, or macroblocks that have their own motion within the image sequence relative to other objects.
- a set of descriptors will be extracted for each of the detected objects, and that a classification (supervised or not) will be carried out to form the groups of objects.
- the result obtained thus makes it possible, by the different stages which lead to it, to speak of indexation by the movement.
- the video stream comprises, for example, a header Ei corresponding to the header of the image i and containing all the information relating to this image, such as, for example, the number of groups of objects or of objects in the image, their layout, as well as the compression settings of the image.
- the header Ei is followed by a group of objects Egoj- j header which contains in particular the descriptors used to characterize the groups of objects.
- the Egoj header. j is followed by an object header Eo ⁇ j - k which contains in particular the descriptors characterizing this object.
- the object header E ⁇ - jk is followed by a slice header ESj- j -ki which will be used for the reconstruction of the image at a video decoder.
- a slice header is followed by the associated data D ⁇ contained in the slice portion of the object contained in the image i.
- the image 1 is described by these headers and data according to the following description.
- an image header E 1 an object group header EgO 1-1 , an object header Eo 1- - I-1 , a header slice Es 1- - I- - I -1 , data D 1- - I- - I -1 , an object header Eo 1- -I -2 , a slice header Es-i -1-2-1 , DM -2 -I data, EsM-2-2 slice header, D1-1-2-2 data, Egoi- 2 object group header, E01-2-1 object header , a slice header Es 1-2 -M, data Es 1-2 .-! - !, a header slice Es- ⁇ -2-1-2, data D 1-2-1-2 and a new image header E 2 .
- the hierarchical structure thus makes it possible to reconstruct a complete scene described by the tree in FIGS. 1 B and 3: within the image 1 (Ei header) there are two groups of objects (EgOi -1 and EgO 1- 2 ).
- the first includes two objects (E01-1-1 and Eo 1-1-2 ).
- the first object consists of a single slice (ES1-1-1-1) while the second one has two slices (Esi-i- 2 -i and Esi-i- 2-2 ).
- the second object group consists of a single object (E1-2- 1 ) with two slices declared by the headers Es 1-2 -II and Esi -2-1-2 - Following the latest data representative of the first image, will be arranged similarly different headers and data areas corresponding to a second image, whose distribution begins from the header E 2 corresponding to the second image.
- This structure is created at the level of the video coder and allows the decoder level direct access to any type of object or object group present in the stream.
- An example of an encoder and a decoder are described in FIG. 5.
- the portions, or slices, as defined within this hierarchical structure each correspond to a rectangular region within an object. They will thus be declared via two extreme macroblocks on the same principle as a bounding box, as shown in Figure 2.
- FIG. 2 illustrates such slice-cutting for an object, by representing an object 1 in which a part 2 requires a different reconstruction: two extreme macroblocks (3 and 4) define a slice corresponding to the hatched part I and requiring, for example, a intra block reconstruction against a normal prediction for Part II which will remain unchanged, for example, with respect to the previous image via a zero motion estimation vector or a pass-over mechanism as described below.
- This new slice definition determines a rectangular portion within an object and not a sub-portion in the video stream as it is commonly found.
- FIG. 3 represents a scene which is described according to the hierarchy presented in FIG. 1B: the flux is represented by two images, the image n and the image n + 1.
- Image n is subdivided into 2 groups of objects; the first corresponds to moving objects (2 vehicles), the second to the bottom.
- the group “moving objects” therefore includes two vehicles.
- the first car is rebuilt from a single “slice” ES- M, or portion, by motion estimation for example.
- the second vehicle has meanwhile "two slices” Es- ⁇ -1-2-1 and Es- ⁇ -1-2-2: this can be explained by the fact that it 'enters' the image, allowing an estimation of movement on the front of the vehicle while the back will have to be coded intra.
- a second group of objects (group n ° 2) of the image n corresponds to the bottom of the image, immobile or quasi-immobile.
- each macroblock of the object in the image N will be predicted only from this same object (in the image (s) reference (s) according to the type of image being compressed).
- This step requires the prediction of the position of the object in the current image at the time of compression. This can be done using a tracking method, better known by the Anglo-Saxon name "tracking".
- each object is declared and positioned. Each object is then only predicted from its previous occurrences, allowing independent coding of objects in the stream.
- the declaration of the objects is done for example by using an MBAmap similar to that present in the standard MPEG-4 part 10 / H.264.
- This card can itself be compressed by applying motion compensation similar to that used on the rest of the image.
- the process will take into account this image-by-image update of the MBAmap, constantly changing the slice / object layout in the image.
- the decoder will be strongly impacted by this constant renewal.
- the new data structure according to the invention makes it possible to decode and possibly display on a monitor only the object or objects. required during the sequence without encountering reconstruction problems. Undecoded objects will leave spaces without information. This can be very relevant depending on the intended applications. For example, only vehicles are needed for license plate recognition; only the background and the actors present in a sub-window of the image must be decoded if the user has zoomed during the viewing.
- This division which is thus accompanied by the possibility of independently decoding the objects, brings new access to the data. It will then be possible to directly access a given level of hierarchy in the structure or frame corresponding to the image, therefore to the parts of the image considered significant, by quickly navigating within the headers image / object group / objects or "slice" in the stream and actually reach the relevant information faster.
- This navigation can be done in several ways. Either the user knows what he is looking for (for example a red object) in which case when he asks for the decoding of the video stream he will trigger a request to only decode the groups of objects or objects whose descriptors correspond to this that he wishes.
- the navigation can also be performed interactively, in a first step of "parsing" of the video stream, the different descriptors present in the stream can be retrieved. Knowing these descriptors the user can then make a specific request indicating which image (s), which group (s) of objects or which object (s) he / she wishes to decode. "Interactive" decoding can also be done by decoding an image on which the user will select (by clicking on it for example) the portions of the image that he wishes to continue to visualize before starting the decompression of the continuation of the flux.
- the method according to the invention thus implements so-called "semantic" navigation based on a definition of hierarchy or category of objects rather than another, contrary to the prior art which uses a temporal or spatial sub-portion of 'a sequence.
- the presence of the descriptors at the heart of the stream also allows an indexing process and therefore a request from a single stream.
- the metadata is embedded in the compressed video and does not require separate transmission and / or encoding. An implementation of the method will therefore make it possible to use these data without having to resort to other tools as is the case in MPEG-4, where the video coding part 2 or 10 must be accompanied by the metadata management part. (MPEG-4 Party).
- FIG. 5 shows the concept of a reference m ulti passage corresponding to the Anglo-Saxon name “multi-reference pass-over", a concept which is not currently known to the Applicant.
- the "pass-over” allows to leave a block as it is in the decoder buffer at the time of its decoding. It corresponds to a motion prediction with a null vector.
- the contribution of multireference plays especially when a fixed object, the background of an image for example, undergoes an occlusion during several images and is then again present.
- the method uses "pass-over" of an image, that is to say that the buffer of the device for the reconstitution of an object remains unchanged in the defined area.
- the device according to the invention represented in FIG. 5, comprises an encoder and a decoder comprising, for example: at the coder
- an image analysis means 11 of the stream F1 in order to segment the images and to extract the desired descriptors for a group of objects or an object represented by the same reference 12, a module 13 for defining an image representation structure according to the invention.
- This module starting from the analysis previously carried out, will create the appropriate headers, for example N ⁇ i object headers for an image i, possibly Ngoi headings group of objects for the groups of objects contained in the image i, NsOi for the slice headers included in the objects of image i,
- an encoder 14 for compressing the different objects or groups of objects and transmitting them in the form of a stream F2. at the level of the decoder 20
- a module 21 capable of decoding the different headers inserted in the video stream and of interpreting the information they contain, a buffer memory 22 making it possible to execute a "pass-over" mechanism during the reconstitution of an object, the buffer memory module 22 inputs the module 21 and the decoder module 24, and for output the decoder module 24 (24 is in I / O since a looping takes place between the old images and those reconstructed).
- a module 23 making it possible to identify the different objects or groups of objects satisfying the decoding request made by the user
- a decoder 24 for decompressing the data associated with the different objects.
- the object of the present invention offers, in particular, the advantages of providing a frame structure in which the objects are individually accessible and can be decoded independently. This saves the decoding time of the image because it will then be possible to directly access a given hierarchy level, therefore to the parts of the image considered significant, by browsing quickly within the image / group headers. objects / objects or slice in the stream.
- the new structure according to the invention makes it possible in particular to evoke the notion of semantic navigation, since instead of choosing a spatial or temporal sub-portion of a sequence, it makes it possible to opt for a category of objects rather than another. This completes and extends the notion of "universal access to the stream" that appeared in MPEG-4.
- the new multi-reference pass-over concept allows reconstruction with minimal coding cost after occlusion.
- the representation of a scene semantically does not require a scene description scheme or placement of each object in the scene. Metadata is present directly in the stream. It is therefore not necessary to implement a standard, only the sub-part related to the video encoder provides access to various elements of the stream.
- the method and the novel image structure according to the invention offer the possibility of declaring as many objects and groups of objects as it is necessary and decided by a user. Thus, the non-limitation of the number of objects and group of objects makes it possible to envisage the processing of high resolution sequences in the future.
Landscapes
- Engineering & Computer Science (AREA)
- Multimedia (AREA)
- Signal Processing (AREA)
- Compression Or Coding Systems Of Tv Signals (AREA)
Abstract
Procédé permettant de définir une structure d'une image dans un flux vidéo compressé caractérisé en ce qu'il comporte au moins les étapes suivantes : définir au sein d'une image i au moins un objet Oi-i-i ou un groupe d'objets goi-i-i, un groupe d'objets étant défini comme un ensemble d'objets liés par un ou plusieurs descripteur(s) commun(s) choisi au moment de la compression dudit flux, ledit objet comprenant une ou plusieurs portions ou « slices » Si-i-i correspondant à une sous-partie de l'image constituée de macroblocs qui appartiennent à un même ensemble, et insérer au niveau d'un objet un ou plusieurs descripteur(s) ou à un groupe d'objets un ou plusieurs descripteur(s) commun(s).
Description
CONSTRUCTION D'UNE NOUVELLE STRUCTURE DE
REPRESENTATION DE L'IMAGE S'APPUYANT SUR DES OBJETS
SEMANTIQUES AU SEIN D'UN FLUX VIDEO COMPRESSE, PROCEDE
ET DISPOSITIF ASSOCIES
L'invention concerne une nouvelle structure de représentation de l'image s'appuyant sur des objets sémantiques au sein d'un flux vidéo compressé, ainsi que le procédé permettant d'obtenir une telle structure. Elle sera, par exemple, utilisée dans des applications de vidéo surveillance. Dans la suite de la description, le Demandeur définit sous le mot « objet », un ensemble connexe de pixels, blocs ou macroblocs d'une image qui présente un déplacement propre au sein de la séquence de l'image par rapport aux autres objets. La segmentation de l'objet est ainsi généralement effectuée au sens du mouvement. A partir de cette segmentation, un ensemble de descripteurs peuvent être extraits et permettent de caractériser ce ou ces objet(s). Ces descripteurs, déterminés et/ou choisis par l'implantation réalisée du procédé, peuvent être bas, voire très bas niveau (couleur, histogramme de luminance, taille, etc.) ou de plus haut niveau (type d'objet, trajectoire, etc.). Ils enrichissent la segmentation d'un caractère sémantique, permettant d'ajouter ces éléments à la description basée sur le mouvement. Il est ainsi possible de définir une personne, un véhicule ou encore le fond d'une image comme objet.
Un objet ou un groupe d'objets pourra alors être définissable comme un ensemble d'objets liés par un descripteur commun choisi par l'utilisateur au moment de la compression du flux vidéo. Un groupe d'objets contiendra ainsi par exemple l'ensemble des objets rouges, ceux se déplaçant vers la droite ou encore des personnes au sein d'une image.
L'expression « portion » plus connue dans le domaine sous l'expression anglo-saxonne « slice » correspond à une sous-partie d'un objet constituée de macroblocs qui appartiennent à un même ensemble défini par l'utilisateur.
Actuellement, plusieurs techniques sont utilisées pour la compression vidéo. Il est ainsi possible de citer les standards de compression vidéo MPEG, comme par exemple les standards MPEG-1 , MPEG-2 ainsi que le standard MPEG-4. Le principe du standard de compression MPEG-4 est la décomposition des scènes audiovisuelles en plusieurs objets médias hiérarchisés. Ces objets sont appelés objets audio visuels ou selon la dénomination anglo-saxonne Audio Visual Object (AVO). Un AVO peut être un flux vidéo, un flux audio, un texte, un graphique, etc. MPEG-4 fournit des méthodes de codage pour les objets individuels, par exemple MPEG-4 Part2 pour les objets vidéo et MPEG-4 Part3 pour les objets audio. Ainsi, une scène visuelle va être vue comme la composition d'AVO selon un script décrivant leurs relations spatiales et temporelles. L'accès individuel aux objets impose à la scène d'être représentée comme la composition d'objets divers qui seront ensuite assemblés pour recréer la scène. Cette approche objet permet alors de très nombreuses opérations sur une séquence MPEG- 4 : ajout, suppression ou déplacement d'un objet, transformation géométrique, changement de point de vue, etc.
Un objet vidéo ou en anglo-saxon Video Object (VO) est un objet auquel l'utilisateur peut accéder et qu'il peut manipuler aisément. Un objet vidéo VO à un instant donné est un plan objet vidéo ou en anglo-saxon Video Object Plane (VOP) correspondant donc à un objet vidéo de forme arbitraire à un instant fixé. Afin d'augmenter les possibilités de manipulation, le standard MPEG-4 a aussi prévu des hiérarchies de plans vidéo objet VOPs associées à différents degrés d'accessibilité, un VOP peut être sous-divisé en plusieurs sous-VOPs. En général, trois types de VOP sont considérés. Un unique VOP, la représentation se ramène alors au cas bien connu d'une unique scène. Deux VOPs, cas qui correspond au partitionnement de la scène en divers VOPs, en utilisant les séquences vidéo 2D traditionnelles en entrée. Deux VOPs ou plus permettent par combinaison la reconstruction d'une scène à partir de plusieurs sources. Cela suppose alors que les données sont exploitables au début du processus de production. Une scène est une
composition d'objets séparés. Les informations relatives à la forme, au mouvement et à la texture des VOPs sont codées dans des couches d'objets vidéo VOL (pour Video Object Layer selon la dénomination anglo-saxonne) séparées afin de permettre le décodage séparé des VOPs. Le modèle de vérification vidéo MPEG-4 VM, selon la dénomination anglo-saxonne « Vérification Mode/ », utilise un algorithme identique pour coder des informations relatives à la forme, le mouvement et la texture dans chaque couche. Cependant, l'information concernant la forme n'est pas transmise si la séquence qui doit être codée ne contient que des images de taille rectangulaire. Chaque VOP représente une image dont le type peut être Intra (I), Prédictif (P) ou Bidirectionnel (B). Un VOP de type I est codé indépendamment des autres, il fournit les points d'accès dans le train binaire. Il sert de référence au codage des VOP de type "P" et "B". Un VOP de type P peut être prédit par compensation de mouvement à partir d'un VOP "I" ou "P" le précédant dans le flux. Il sert aussi au codage des images de type "B". Enfin pour un VOP de type B, les macroblocs qui le composent peuvent être prédits soit par simple compensation de mouvement avant ou arrière à partir de VOP "P" ou "I", soit par double compensation de mouvement avant et arrière. En général, les images en entrée qui doivent être codées pour chaque VOP sont de forme arbitraire et la position et la forme des images varient dans le temps en respect d'une fenêtre de référence. Toutes les VOL qui doivent être codées pour une séquence en entrée sont définies en référence à la fenêtre de référence dont la taille est constante. En fait, lors du codage, les objets présents dans un flux sont codés les uns par rapport aux autres d'une manière dépendante.
Avec cette technique, pour masquer certaines informations contenues dans une image, des calques ou encore des masques sont utilisés. Un des inconvénients de cette technique est qu'elle nécessite un flux de données compressées par objet, et par conséquent un processus de décodage par objet à visualiser.
L'utilisation des portions jusque MPEG-4 Parti 0 / H.264 s'avère délicat : si l'on considère qu'il est possible de définir pour chaque image la forme d'un objet, permettant une déclaration image par image de la carte d'allocation des macroblocs (ou selon l'expression anglo-saxonne MBAmap pour MacroBlocs Allocation map), la gestion dynamique de cette dernière n'est couverte par aucune procédure décrite dans la norme. Dès lors, les décodeurs actuels attendront une image Intra après toute mise à jour de la MBAmap, ce qui s'avère très restrictif. De plus, les profils définis dans H.264 limitent le nombre de groupes de portions ou « slices-group » : 1 pour le profil principal, « main » selon la dénomination anglo-saxonne (ce qui rend impossible tout découpage par objet sémantique), 8 pour les profils de base et étendu, « baseline » et « extended » selon la dénomination anglo- saxonne, ce qui limite à 7 le nombre d'objets mobiles dans une scène (le 8θmθ slices group étant alors attribué au fond de l'image). Les deux cas restent trop restrictifs dans le cas d'une surveillance de site.
Au sein d'un « slices group >>, chaque slice peut être défini comme une sous portion du flux de macroblocs. On peut ainsi choisir un nombre de lignes de macrobloc au sein d'un objet, mais pas précisément une zone telle qu'un rectangle derrière un objet mobile.
L'objet de l'invention concerne une nouvelle structure hiérarchique de représentation d'une image s'appuyant sur une approche sémantique. Elle présente entre autres avantages celui de coder les objets présents dans un flux vidéo de manière indépendante tout en ne produisant qu'un unique flux sans surcoût pour la compression.
L'invention concerne un procédé permettant de définir une structure d'une image dans un flux vidéo compressé composé d'une structure présentant l'une des caractéristiques au moins énoncée précédemment caractérisé en ce qu'il comporte au moins les étapes suivantes :
> définir au sein d'une image au moins un objet ou un groupe d'objets, un groupe d'objets étant défini comme un ensemble d'objets liés par un ou plusieurs descripteur(s) commun(s) choisi au moment de la compression dudit flux, ledit objet comprenant une ou plusieurs portions ou « slices » correspondant à une sous-partie de l'image constituée de macroblocs qui appartiennent à un même ensemble, et
> insérer au niveau d'un objet un ou plusieurs descripteur(s) ou à un groupe d'objets un ou plusieurs descripteur(s) commun(s).
Le procédé peut comporter au moins les étapes suivantes :
> insérer un en-tête image correspondant à l'identité d'une image présente dans ledit flux,
> insérer au moins un en-tête objet associé à un ou plusieurs objets présents dans l'image, > insérer au moins un en-tête slice associé à un desdits objets,
> positionner les données représentatives des objets définis.
Il insère par exemple un en-tête groupe d'objets en amont d'un en-tête objet pour désigner un ensemble d'objets.
Le flux vidéo compressé étant composé d'une ou plusieurs images ayant une structure présentant l'une des caractéristiques précitées, le procédé est caractérisé en ce qu'il comporte au moins une étape de décodage comprenant la sélection de descripteurs associés à un ou plusieurs objets ou un ou plusieurs groupes d'objets et une étape de décodage desdits objets ou groupes d'objets sélectionnés et une étape de décompression desdits objets ou groupes d'objets.
L'invention concerne aussi un dispositif permettant de générer une structure de trame d'une image dans un flux vidéo caractérisé en ce qu'il comporte au moins un moyen adapté à exécuter les étapes du procédé selon l'une des revendications précédentes. Le dispositif peut comporter au moins les éléments suivants : un codeur comportant au moins :
> un moyen d'analyse d'images d'un premier flux F1 afin de segmenter les images et d'en extraire les descripteurs souhaités pour un groupe d'objets ou un objet,
> un module permettant de définir une structure de représentation d'image précitée,
> un codeur permettant de compresser les différents objets ou les groupes d'objets et les transmettre sous la forme d'un flux F2, un décodeur comportant au moins :
> un module adapté à décoder les différentes en-têtes insérés dans ledit flux vidéo F2 et interpréter les informations qu'ils contiennent,
> une mémoire tampon permettant d'exécuter un « pass-over » lors de la reconstitution d'un objet, permettant de laisser un bloc tel qu'il est dans la mémoire tampon du décodeur au moment de son décodage,
> un module adapté à identifier les différents objets ou groupes d'objets satisfaisants une requête de décodage,
> un décodeur permettant de décompresser les données associées aux différents objets.
D'autres caractéristiques et avantages du dispositif selon l'invention apparaîtront mieux à la lecture de la description qui suit d'un exemple de réalisation donné à titre illustratif et nullement limitatif annexé des figures qui représentent :
> les figures 1 A et 1 B, un exemple de structure image selon l'invention décrite dans la représentation de flux de données et aussi selon une distribution d'arbre,
> la figure 2, la manière dont est décrite une portion d'objet nécessitant une reconstruction différente du reste de l'objet,
> la figure 3, un exemple de mise en œuvre du décodage des objets dans une image ayant une structure selon l'invention, > la figure 4,
> la figure 5, la notion de passage multiréférence correspondant à la dénomination anglo-saxonne « multi-reference pass-over », et
> la figure 6, un exemple de dispositif associé.
L'objet de la présente invention concerne notamment une nouvelle structure hiérarchique de représentation de l'image qui met en œuvre une approche par objet visuel au sein d'un unique flux vidéo compressé. Cela permet entre autre de décoder les objets présents dans un unique flux de manière indépendante et sans coût additionnel. La nouvelle structure :
Image
|-> Groupe d'objets • Objet
|-> slice
repose sur la hiérarchie suivante au niveau de chaque image : une Image est composée de Groupe d'Objets, eux-mêmes comprenant des Objets, constitués de « Slices ». Une telle structure hiérarchique est, par exemple, décrite aux figures 1A et 1 B. Contrairement au standard habituellement utilisé, l'objet de la présente invention concerne un unique flux vidéo ayant une structure telle que celle décrite à la figure 1 A. Dans certains cas d'application, les groupes d'objets peuvent comprendre plusieurs objets ayant un paramètre commun. Ainsi, un groupe d'objets est défini par exemple, par un descripteur commun choisi par l'utilisateur à la compression tel qu'il a été défini précédemment. La figure 1 A schématise un exemple de structure pour une image dans un unique flux vidéo selon l'invention. Le flux vidéo est découpé en plusieurs zones correspondant chacune à une image, désignée Z1 pour l'image 1 et Zi de manière plus générale. Selon la structure hiérarchique proposée, le flux vidéo est composé de plusieurs images, elles-mêmes composées d'un ou plusieurs groupe(s) d'objets ; chaque groupe d'objets est composé d'un ou plusieurs objet(s), eux-mêmes constitués de une ou plusieurs « slice(s) ». Un groupe d'objets peut se réduire dans certains cas un objet. Chacun de ces éléments de la
hiérarchie sera identifié au sein du flux par un en-tête propre, permettant une navigation et un accès optimisés en terme de recherche de sous portion du flux. En effet, les en-têtes pourront directement contenir les descripteurs qui ont permis de distinguer les slices / objets / groupes d'objets, et qui seront donc exploitables au moment de la navigation. D'une part, la segmentation proposée repose sur le mouvement, puisque chaque objet est défini comme un ensemble connexe de pixels, blocs ou macroblocs présentant un déplacement propre au sein de la séquence d'images par rapport aux autres objets. D'autre part, c'est à partir de cette segmentation qu'un ensemble de descripteurs sera extrait pour chacun des objets détectés, et qu'une classification (supervisée ou non) sera effectuée pour former les groupes d'objets. Le résultat obtenu permet donc, de par les différentes étapes qui y mènent, de parler d'indexation par le mouvement. Le flux vidéo comprend, par exemple, un en-tête Ei correspondant à l'en-tête de l'image i et contenant toutes les informations relatives à cette image, comme, par exemple, le nombre de groupes d'objets ou d'objets dans l'image, leur disposition, ainsi que les paramètres de compression de l'image. L'en-tête Ei est suivi d'un en-tête groupe d'objets Egoj-j qui contient notamment les descripteurs utilisés pour caractériser les groupes d'objets. L'en-tête Egoj.j est suivi d'un en-tête objet Eoμj-k qui contient notamment les descripteurs caractérisant cet objet. L'en-tête objet Eθi-j-k est suivi d'un entête slice ESj-j-k-i qui sera utilisé pour la reconstruction de l'image au niveau d'un décodeur vidéo. Un en-tête slice est suivi des données associées D^ contenues dans la portion ou « slice » de l'objet contenu dans l'image i. Dans l'exemple des figures 1 A et 1 B, l'image 1 est décrite par ces en-têtes et données selon la description suivante. Au sein du flux peuvent être identifiés dans l'ordre de lecture : un en-tête image E1, un entête groupe d'objet EgO1-1, un en-tête objet Eo1--I-1, un en-tête slice Es1--I--I -1, des données D1--I--I -1, un entête objet Eo1--I-2, un en-tête slice Es-i -1-2-1, des données DM-2-I , un en-tête slice EsM-2-2, des données D1-1-2-2, un en-tête groupe d'objets Egoi-2, un entête objet E01-2-1, un en-tête slice Es1-2-M, des données Es1-2.-!--!, un en-tête
slice Es-ι-2-1-2, des données D 1-2-1-2 et un nouvel en-tête image E2. L'ordre de ces paquets est donné à titre illustratif et n'est aucunement restrictif. On pourra par exemple regrouper l'ensemble des en-têtes au commencement d'une nouvelle image dans le flux, qui seront suivis de l'ensemble des données (auxquelles on accédera via un pointeur présent dans l'en-tête correspondant ou un code de départ, ou start code selon l'expression anglo- saxonne, spécifique). Il est également possible d'ordonner les objets dans le flux selon leur taille : les petits objets seront privilégiés (a priori les objets mobiles) en début de structure image, ceux plus important (dont fera vraisemblablement partie le fond) en fin de structure. Cela permettra d'accélérer encore le processus de décodage en cas de visualisation partielle.
La structure hiérarchique permet ainsi de reconstituer une scène complète décrite par l'arbre aux figures 1 B et 3 : au sein de l'image 1 (en-tête Ei) se trouvent deux groupes d'objets (EgOi-1 et EgO1-2). Le premier comprend deux objets (E01-1-1 et Eo1-1-2). Le premier objet est constitué d'un unique slice (ES1-1-1-1) alors que le second en comporte deux (Esi-i-2-i et Esi-i-2-2). Le deuxième groupe d'objet est constitué d'un seul objet (E1-2-1) comprenant deux slices déclarés par les en-têtes Es1-2-I-I et Esi -2-1-2 - A la suite des dernières données représentatives de la première image, seront disposées de manière similaire les différents en-têtes et zones de données correspondant à une deuxième image, dont la répartition commence à partir de l'en-tête E2 correspondant à la deuxième image. Cette structure se retrouve créée au niveau du codeur vidéo et permet au niveau du décodeur un accès direct à tout type d'objet ou groupe d'objet présent dans le flux. Un exemple de codeur et de décodeur sont décrits à la figure 5. Les portions, ou slices, telles que définis au sein de cette structure hiérarchique, correspondent chacune à une région rectangulaire au sein d'un objet. Elles seront ainsi déclarées via deux macroblocs extrêmes sur le même principe qu'une boîte englobante, comme illustré dans la figure 2. L'un des principaux intérêts de cette définition est de permettre des codages
différents de sous-parties d'un même objet. En effet, la segmentation telle que proposée dans la structure permet de séparer les objets sémantiques différents. Mais même s'il est sémantiquement cohérent, un objet peut requérir des traitements différents selon les sous-portions qui le constituent. Ainsi par exemple, dans la figure 4, la voiture à gauche V1 entre dans le champ de vision entre les deux images intégralement représentées. La voiture représente un objet sémantique cohérent et sera donc déclarée au niveau hiérarchique « objet ». Pour reconstruire la voiture V1 dans la seconde image 12, une estimation de mouvement peut être pratiquée sur l'avant AV1 de la voiture qui était déjà présent dans l'image précédente 11. En revanche l'arrière ARV1 n'était pas dans le champ de vision de la caméra et ne peut donc être estimé par compensation de mouvement ; il sera donc codé Intra. La définition des « slices » telle que proposée ici permet donc au sein d'un même objet de fournir deux types de reconstruction différents, sans avoir à déclarer celle-ci pour chaque bloc ou macrobloc, tout en préservant la structure hiérarchique. A l'exemple précédemment cité, on peut ajouter la possibilité de reconstruction après occlusion par mécanisme de multi- reference pass-over, tel que décrit ci-après, et rendu possible par cette définition des slices. La figure 2 illustre un tel découpage en slice pour un objet, en représentant un objet 1 dans lequel une partie 2 nécessite une reconstruction différente : deux macroblocs extrêmes (3 et 4) définissent un slice correspondant à la partie hachurée I et nécessitant par exemple une reconstruction par blocs intra contre une prédiction normale pour la partie II qui restera par exemple inchangée par rapport à l'image précédente via un vecteur estimation de mouvement nul ou un mécanisme de pass-over comme décrit ci-après. Cette nouvelle définition de slice détermine une portion rectangulaire au sein d'un objet et non une sous-portion dans le flux vidéo comme il est généralement trouvé. La figure 3 représente une scène qui est décrite selon la hiérarchie présentée à la figure 1 B : le flux y est représenté par deux images, l'image n
et l'image n+1. L'image n est sous-divisée en 2 groupes d'objets ; le premier correspond aux objets mobiles (2 véhicules), le second au fond. Le groupe « objets mobiles » comprend donc deux véhicules. La première voiture est reconstruite à partir d'un unique « slice » ES-M.-M OU portion, par estimation de mouvement par exemple. Le second véhicule comporte quant à lui « deux slices » Es-ι-1-2-1 et Es-ι-1-2-2 : cela pourra s'expliquer par le fait qu'il 'rentre' dans l'image, permettant une estimation de mouvement sur l'avant du véhicule alors que l'arrière devra être codé intra. Un deuxième groupe d'objets (groupe n°2) de l'image n correspond au fond de l'image, immobile ou quasi-immobile. A ce groupe d'objets 2 est associé un unique objet 2-1 auquel sont associés deux « slices » Es1-2-i-i et Esi-2-i-2- Le découpage des objets s'accompagne d'une restriction de la compensation de mouvement d'une image sur l'autre à l'intérieur de l'objet. Ainsi, chaque macrobloc de l'objet dans l'image N ne sera prédit qu'à partir de ce même objet (dans la ou les image(s) référence selon le type d'image en cours de compression). Cette étape requiert la prédiction de la position de l'objet dans l'image en cours au moment de la compression. Cela peut être réalisé en utilisant une méthode de suivi, plus connue sous la dénomination anglo- saxonne « tracking ». Avant d'initialiser l'estimation et la compensation de mouvement, chaque objet est ainsi déclaré et positionné. Chaque objet est alors uniquement prédit à partir de ses précédentes occurrences, permettant un codage indépendant des objets dans le flux.
La déclaration des objets se fait par exemple en utilisant une MBAmap semblable à celle présente dans le standard MPEG-4 part 10/H.264. Cette carte pourra elle-même être compressée en appliquant une compensation de mouvement similaire à celle utilisée sur le reste de l'image. Le procédé prendra en compte cette mise à jour image par image de la MBAmap, modifiant constamment la disposition des slices/objets dans l'image. Le décodeur sera fortement impacté par ce renouvellement constant. De fait, la nouvelle structure de données selon l'invention, permet de décoder et éventuellement d'afficher sur un moniteur uniquement le ou les objets
requis au cours de la séquence sans rencontrer de problèmes de reconstruction. Les objets non décodés laisseront quant à eux des espaces sans information. Cela peut être très pertinent selon les applications visées. Par exemple, seuls les véhicules sont nécessaires pour la reconnaissance de plaque d'immatriculation ; seuls le fond et les acteurs présents dans une sous-fenêtre de l'image doivent être décodés si l'utilisateur a zoomé lors du visionnage.
Ce découpage qui s'accompagne donc de la possibilité de décoder indépendamment les objets, apporte un nouvel accès aux données. Il sera alors possible d'accéder directement à un niveau de hiérarchie donné dans la structure ou trame correspondant à l'image, donc aux parties de l'image considérée comme significative, en naviguant rapidement au sein des entêtes image/groupe d'objets/objets ou « slice » dans le flux et de fait atteindre plus vite l'information pertinente. Cette navigation peut s'effectuer de plusieurs façons. Soit l'utilisateur sait ce qu'il cherche (par exemple un objet rouge) auquel cas lorsqu'il demandera le décodage du flux vidéo il déclenchera une requête demandant de ne décoder que les groupes d'objets ou objets dont les descripteurs correspondent à ce qu'il souhaite. La navigation peut également s'effectuer de façon interactive, lors d'une première étape de « parsing » du flux vidéo, les différents descripteurs présents dans le flux peuvent être récupérés. Connaissant ces descripteurs l'utilisateur peut alors faire une requête spécifique indiquant quelle(s) image(s), quel(s) groupe(s) d'objets ou quel(s) objet(s) il souhaite décoder. Le décodage « interactif » peut également s'effectuer en décodant une image sur laquelle l'utilisateur va sélectionner (en cliquant dessus par exemple) les portions de l'image qu'il souhaite continuer à visualiser avant de lancer la décompression de la suite du flux. Le procédé selon l'invention met ainsi en œuvre une navigation dite « sémantique » basée sur une définition de hiérarchie ou de catégorie d'objets plutôt qu'une autre, contrairement à l'art antérieur qui utilise une sous-portion temporelle ou spatiale d'une séquence.
La présence des descripteurs au cœur du flux permet également un procédé d'indexation et donc de requête à partir d'un unique flux. Les métadonnées sont noyées dans la vidéo compressée et ne requièrent pas de transmission et/ou codage séparé. Une implantation du procédé permettra donc d'utiliser ces données sans avoir à recourir à d'autres outils comme c'est le cas dans MPEG-4, où la partie 2 ou 10 de codage vidéo doit être accompagnée de la partie de gestion des métadonnées (MPEG-4 Parti ). Sur la figure 5 est représentée la notion de passage m ulti référence correspondant à la dénomination anglo-saxonne « multi-reference pass- over », notion qui n'est pas connue actuellement à la connaissance du Demandeur. Le « pass-over » permet de laisser un bloc tel qu'il est dans la mémoire tampon du décodeur au moment de son décodage. Il correspond à une prédiction de mouvement avec un vecteur nul. L'apport de la multiréférence joue notamment lorsqu'un objet fixe, le fond d'une image par exemple, subit une occlusion pendant plusieurs images et est ensuite à nouveau présent. Avant l'occlusion, le procédé utilise des « pass-over » d'une image, c'est-à-dire que la mémoire tampon du dispositif permettant la reconstitution d'un objet reste inchangé dans la zone définie. Lors de l'occlusion il n'y a plus de reconstruction de l'objet considéré sur la zone masquée, derrière l'objet mobile. Enfin, lorsque la partie masquée est à nouveau visible il est alors possible de reconstruire par un pointeur sur une image précédant l'occlusion, cette image référence étant indicée N-x sur la figure 4. Une unique déclaration au niveau slice permettra de reconstruire toute une zone par mécanisme de pass-over, sans nécessiter d'information supplémentaire pour chaque bloc ou macrobloc. Cette nouvelle reconstruction de l'image nécessite de conserver dans la mémoire tampon plusieurs images précédant l'image actuelle, vers lesquels pointeront les pass-over définis au niveau du codeur. Au niveau du codeur, il sera donc nécessaire de déterminer les occlusions d'une partie d'un objet pour chaque image, ce qui pourra se faire par exemple par une étude du mouvement global de chaque objet par rapport aux autres. Les parties précédemment
masquées seront alors préférentiellement reconstruites par pass-over et non plus par blocs Intra comme ce pouvait être le cas avec les standards actuels. Sur le plan de la compression, la transmission de la table d'allocation MBAmap en utilisant la compensation de mouvement et du fait de sa faible résolution n'aura que peu d'impact en terme de débit pour le flux vidéo.
En revanche, avec un découpage de l'image selon le principe énoncé précédemment et qui retranscrit au plus près la segmentation au sens du mouvement des différents objets indépendamment les uns des autres, il devient possible de faire de l'effacement de vecteur estimation de mouvement, ceux-ci pouvant être reconstruits au niveau du décodeur par rapport au déplacement, la forme, la taille ou encore toute autre particularité de l'objet.
Pour mettre en œuvre l'invention le dispositif selon l'invention, représenté 10 sur la figure 5, comporte un codeur et un décodeur comprenant, par exemple : au niveau du codeur
> un moyen d'analyse d'images 1 1 du flux F1 afin de segmenter les images et d'en extraire les descripteurs souhaités pour un groupe d'objets ou un objet représenté par la même référence 12, > un module 13 permettant de définir une structure de représentation d'image selon l'invention. Ce module, à partir de l'analyse précédemment réalisée, va créer les en-têtes appropriés, par exemple Nθi en-têtes objets pour une image i, éventuellement Ngoi en-têtes groupe d'objets pour les groupes d'objets contenus dans l'image i, NsOi pour les en-têtes des slices inclus dans les objets de l'image i,
> un codeur 14 permettant de compresser les différents objets ou les groupes d'objets et les transmettre sous la forme d'un flux F2. au niveau du décodeur 20
> un module 21 capable de décoder les différentes en-têtes insérés dans le flux vidéo et d'interpréter les informations qu'ils contiennent,
> une mémoire tampon 22 permettant d'exécuter un mécanisme de « pass-over » lors de la reconstitution d'un objet, le module mémoire tampon 22 a pour entrées le module 21 et le module décodeur 24, et pour sortie le module décodeur 24 (24 est en E/S puisqu'un bouclage a lieu entre les anciennes images et celles reconstruites).
> un module 23 permettant d'identifier les différents objets ou groupes d'objets satisfaisants la requête de décodage effectuée par l'utilisateur,
> un décodeur 24 permettant de décompresser les données associées aux différents objets.
L'objet de la présente invention offre notamment comme avantages d'offrir une structure de trame dans laquelle les objets sont accessibles individuellement et décodables indépendamment. Cela permet de gagner en temps de décodage de l'image car il sera alors possible d'accéder directement à un niveau de hiérarchie donné, donc aux parties de l'image considérées comme significatives, en naviguant rapidement au sein des entêtes image / groupes d'objets / objets ou slice dans le flux. La nouvelle structure selon l'invention permet notamment d'évoquer la notion de navigation sémantique, puisqu'au lieu de choisir une sous-portion spatiale ou temporelle d'une séquence, elle permet d'opter pour une catégorie d'objets plutôt qu'une autre. Cela complète et étend la notion « d'accès universel au flux » apparue dans MPEG-4. Le nouveau concept de multi-référence pass- over permet une reconstruction avec un coût de codage minimal après occlusion.
Contrairement au standard actuel tel que MPEG-4, la représentation d'une scène sémantiquement ne requiert pas de schéma de description de scène ni de placement de chaque objet dans la scène. Les Métadonnées sont présentes directement dans le flux. Il n'est donc pas nécessaire d'implanter tout un standard, seule la sous-partie liée au codeur vidéo permet d'accéder à divers éléments du flux.
Le procédé et la structure nouvelle d'images selon l'invention offrent la possibilité de déclarer autant d'objets et groupes d'objets qu'il est nécessaire et décidé par un utilisateur. Ainsi la non limitation du nombre d'objets et groupe d'objets permet d'envisager le traitement de séquences haute résolution dans l'avenir.
Claims
REVENDICATIONS
1 - Procédé permettant de définir une structure d'une image dans un flux vidéo compressé composé d'images (t) ayant une image (i) comprenant au moins un objet, ledit objet comprenant une ou plusieurs portions ou "slices" correspondant à une sous-partie de l'image constitué de macroblocs qui appartiennent à un même ensemble caractérisé en ce qu'il comporte au moins les étapes suivantes :
> définir au sein d'une image (i) au moins un objet OI-M OU un groupe d'objets goμ-i, un groupe d'objets étant défini comme un ensemble d'objets liés par un ou plusieurs descripteur(s) commun(s) choisi au moment de la compression dudit flux, ledit objet comprenant une ou plusieurs portions ou « slices » s\.\.\-\ correspondant à une sous-partie de l'image constituée de macroblocs qui appartiennent à un même ensemble, et
> insérer au niveau d'un objet un ou plusieurs descripteur(s) ou à un groupe d'objets un ou plusieurs descripteur(s) commun(s).
2 - Procédé selon la revendication 1 , caractérisé en ce qu'il comporte au moins les étapes suivantes :
> insérer un en-tête image Ei correspondant à l'identité d'une image (i) présente dans ledit flux,
> insérer au moins un en-tête objet Eoj-j-k associé à un ou plusieurs objets présents dans l'image, > insérer au moins un en-tête slice ESJ-J-M associé à un desdits objets,
> positionner les données Dj-J-M représentatives des objets définis.
3 - Procédé selon la revendication 2, caractérisé en ce qu'il insère un en-tête groupe d'objets en amont d'un en-tête objet pour désigner un ensemble d'objets.
4 - Procédé selon la revendication 1 , caractérisé en ce que l'on détermine une portion rectangulaire au sein d'un objet Eoμ-i au moyen d'une portion ou slice déclaré par un en-tête ESM-M et en ce que ladite portion est délimitée par deux macroblocs extrêmes.
5 - Procédé selon l'une des revendications précédentes dans lequel le flux vidéo compressé est composé d'une ou plusieurs images ayant une structure selon la revendication 1 , caractérisé en ce qu'il comporte au moins une étape de décodage comprenant la sélection de descripteurs associés à un ou plusieurs objets ou un ou plusieurs groupes d'objets et une étape de décodage desdits objets ou groupes d'objets sélectionnés et une étape de décompression desdits objets ou groupes d'objets.
6 - Dispositif permettant de générer une structure de trame d'une image dans un flux vidéo, caractérisé en ce qu'il comporte au moins les éléments suivants : un codeur comportant au moins :
> un moyen d'analyse d'images (1 1 ) d'un premier flux F1 afin de segmenter les images (i) et d'en extraire les descripteurs souhaités pour un groupe d'objets ou un objet,
> un module (13) permettant de définir une structure de représentation d'image selon l'une des revendications 1 à 10,
> un codeur (14) permettant de compresser les différents objets ou les groupes d'objets et les transmettre sous la forme d'un flux F2, un décodeur comportant au moins :
> un module (21 ) adapté à décoder les différentes en-têtes insérés dans ledit flux vidéo F2 et interpréter les informations qu'ils contiennent,
> une mémoire tampon (22) permettant d'exécuter un « pass-over » lors de la reconstitution d'un objet, permettant de laisser un bloc tel qu'il est dans la mémoire tampon du décodeur au moment de son décodage,
> un module (23) adapté à identifier les différents objets ou groupes d'objets satisfaisants une requête de décodage,
> un décodeur (24) permettant de décompresser les données associées aux différents objets.
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| FR0803065A FR2932056B1 (fr) | 2008-06-03 | 2008-06-03 | Construction d'une nouvelle structure de representation de l'image s'appuyant sur des objets semantiques au sein d'un flux video compresse, procede et dispositif associes |
| FR0803065 | 2008-06-03 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| WO2009147181A1 true WO2009147181A1 (fr) | 2009-12-10 |
Family
ID=40227887
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| PCT/EP2009/056828 Ceased WO2009147181A1 (fr) | 2008-06-03 | 2009-06-03 | Construction d'une nouvelle structure de representation de l'image s'appuyant sur des objets semantiques au sein d'un flux video compresse, procede et dispositif associes |
Country Status (2)
| Country | Link |
|---|---|
| FR (1) | FR2932056B1 (fr) |
| WO (1) | WO2009147181A1 (fr) |
-
2008
- 2008-06-03 FR FR0803065A patent/FR2932056B1/fr active Active
-
2009
- 2009-06-03 WO PCT/EP2009/056828 patent/WO2009147181A1/fr not_active Ceased
Non-Patent Citations (2)
| Title |
|---|
| DHONDT Y ET AL: "Flexible macroblock ordering as a content adaptation tool in H.264/AVC", PROCEEDINGS OF THE SPIE, SPIE, BELLINGHAM, VA; US, vol. 6015, 24 October 2005 (2005-10-24), pages 601506/1 - 9, XP007901849 * |
| RONG LUO ET AL: "A Hierarchical Scheme of Flexible Macroblock Ordering for ROI based H.264/AVC Video Coding", ADVANCED COMMUNICATION TECHNOLOGY, 2008. ICACT 2008. 10TH INTERNATIONAL CONFERENCE ON, IEEE, PISCATAWAY, NJ, USA, 17 February 2008 (2008-02-17), pages 1579 - 1582, XP031245410, ISBN: 978-89-5519-136-3 * |
Also Published As
| Publication number | Publication date |
|---|---|
| FR2932056B1 (fr) | 2011-01-07 |
| FR2932056A1 (fr) | 2009-12-04 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| Casas et al. | 4d video textures for interactive character appearance | |
| US20200020132A1 (en) | Visual quality of video based point cloud compression using one or more additional patches | |
| KR20210088630A (ko) | 포인트 클라우드 코딩 구조 | |
| Almeida et al. | Online video summarization on compressed domain | |
| EP2172024B1 (fr) | Procedes et dispositifs de codage et de decodage d'une sequence d'images representee a l'aide de tubes de mouvement, produits programme d'ordinateur et signal correspondants | |
| US12432370B2 (en) | Information processing device and information processing method | |
| WO2009147184A1 (fr) | Procede et systeme permettant de proteger des la compression la confidentialite des donnees d'un flux video lors de sa transmission | |
| US20250173838A1 (en) | Temporally consistent human image animation method | |
| US20250385995A1 (en) | Learning-based light field compression for tensor display | |
| Jeong et al. | Sub‐bitstream packing based lightweight tiled streaming for 6 degree of freedom immersive video | |
| US11004237B2 (en) | Palette coding for color compression of point clouds | |
| CN1352856A (zh) | 视频序列结构的自动提取方法 | |
| Yu et al. | Hierarchical distortion learning for fast lossy compression of point clouds | |
| Shi et al. | Volumetric video compression through neural-based representation | |
| Wang et al. | A surveillance video analysis and storage scheme for scalable synopsis browsing | |
| US20250379989A1 (en) | Concatenation of video data with selective transcoding | |
| WO2009147181A1 (fr) | Construction d'une nouvelle structure de representation de l'image s'appuyant sur des objets semantiques au sein d'un flux video compresse, procede et dispositif associes | |
| KR101163774B1 (ko) | 비디오 압축용 장치 및 프로세스 | |
| WO2020070409A1 (fr) | Codage et décodage d'une vidéo omnidirectionnelle | |
| Van Le et al. | Specular detection and rendering for immersive multimedia | |
| FR3096538A1 (fr) | Procédé et dispositif de traitement de données de vidéo multi-vues | |
| Rai et al. | PackUV: Packed Gaussian UV Maps for 4D Volumetric Video | |
| Yildiz et al. | Fast non-linear video synopsis | |
| WO2010109133A1 (fr) | Procede et dispositif de stockage d'une partie d'un flux video. | |
| CN117391961A (zh) | 画质增强模型训练方法、装置、计算机设备和存储介质 |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| 121 | Ep: the epo has been informed by wipo that ep was designated in this application |
Ref document number: 09757562 Country of ref document: EP Kind code of ref document: A1 |
|
| DPE1 | Request for preliminary examination filed after expiration of 19th month from priority date (pct application filed from 20040101) | ||
| NENP | Non-entry into the national phase |
Ref country code: DE |
|
| 122 | Ep: pct application non-entry in european phase |
Ref document number: 09757562 Country of ref document: EP Kind code of ref document: A1 |