EP2353163A1 - Procede de decoupage de contenu multimedia, dispositif et programme d'ordinateur correspondant - Google Patents

Procede de decoupage de contenu multimedia, dispositif et programme d'ordinateur correspondant

Info

Publication number
EP2353163A1
EP2353163A1 EP09760211A EP09760211A EP2353163A1 EP 2353163 A1 EP2353163 A1 EP 2353163A1 EP 09760211 A EP09760211 A EP 09760211A EP 09760211 A EP09760211 A EP 09760211A EP 2353163 A1 EP2353163 A1 EP 2353163A1
Authority
EP
European Patent Office
Prior art keywords
scenes
cutting
tree
chapters
chapter
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Ceased
Application number
EP09760211A
Other languages
German (de)
English (en)
Inventor
Patrick Lechat
Sid Ahmed Berrani
Benoit Besset
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Orange SA
Original Assignee
France Telecom SA
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by France Telecom SA filed Critical France Telecom SA
Publication of EP2353163A1 publication Critical patent/EP2353163A1/fr
Ceased legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G11INFORMATION STORAGE
    • G11BINFORMATION STORAGE BASED ON RELATIVE MOVEMENT BETWEEN RECORD CARRIER AND TRANSDUCER
    • G11B27/00Editing; Indexing; Addressing; Timing or synchronising; Monitoring; Measuring tape travel
    • G11B27/10Indexing; Addressing; Timing or synchronising; Measuring tape travel
    • G11B27/19Indexing; Addressing; Timing or synchronising; Measuring tape travel by using information detectable on the record carrier
    • G11B27/28Indexing; Addressing; Timing or synchronising; Measuring tape travel by using information detectable on the record carrier by using information signals recorded by the same method as the main recording

Definitions

  • a method of dividing multimedia content, device and corresponding computer program A method of dividing multimedia content, device and corresponding computer program.
  • the present invention relates to the field of chapter definition for multimedia content.
  • the present invention relates more particularly to a method of chapitrage of multimedia contents which comprise at least one video stream.
  • the adaptation of these contents takes several aspects: - an adaptation of the image resolution, aspect ratio width / height; transcoding to mobile formats (3GP); a cutting of the original video of multimedia contents in short chapters.
  • the invention relates more particularly to this last point.
  • the division of a video into chapters also called “chapters” makes it possible to adapt to the "mobile" consumption of multimedia content, consisting of short content particularly adapted for viewing in a mobile situation. It has indeed been found that the viewing of a multimedia content on a mobile terminal did not exceed, in general, the ten minutes. This is particularly because the screens of mobile terminals are relatively small. Also, for ease of viewing, the long contents are divided into segments (chapters) of five to ten minutes which facilitates the resumption of viewing of video content after an interruption. 2 SOLUTIONS OF THE PRIOR ART
  • Time constraints dictate that the division must produce files (chapters) of homogeneous duration. For example, a time constraint may require that files be between five and ten minutes long. A second temporal constraint may require that each duration, taken independently, can not differ by more than one minute from the average duration of the files produced.
  • Semantic constraints also called editorial constraints
  • the division should preferably be done on a change of plans, at the ends of a scene, the scene being the elementary semantic unit resulting from the concatenation of plans forming a unit, taking place in the same place at the same time (each plan is characterized by a continuity of filmed content, so without cut or change of view).
  • a dialogue, a telephone conversation, an action observed from several points of view are scenes that we do not wish to cut at the time of division into chapters It is therefore understood that the manual creation of the cutting of files, which takes into account both temporal constraints and editorial constraints is long, tedious and expensive
  • the generally observed approach is thus of the "bottom-up" type, starting from the elementary entities that are the plans to define groups of similar plans then scenes.
  • the result obtained by these techniques is very dependent on characteristics extracted from the audio / video stream aiming to group the shots, of mixing criteria when several characteristics are used to group the shots (color, texture of the picture, power and sound frequencies). , the granula ⁇ té chosen to form clusters (or groupings) of plans, criteria retained to merge clusters into scenes.
  • These techniques require the use of several comparison thresholds having a direct impact on the result and creating scenes more or less respectful of the desired semantic division.
  • the invention overcomes these disadvantages of the prior art.
  • the invention relates in fact to a method of cutting, in at least two chapters, a multimedia content comprising at least one video stream,
  • such a method comprises: a segmentation phase of said at least one video stream into a plurality of plans defining scenes; a phase of analysis of similarities between scenes, associating at least one proximity information with at least two scenes considered; a phase of constructing chapters of said video stream according to said proximity information of said scenes and at least one predetermined time division constraint, which defines at least one information characterizing the duration of a chapter; a construction phase of said chapters, according to said cutting hypotheses.
  • said resemblance analysis phase comprises a step of constructing a resemblance tree comprising a hierarchy of scenes constructed by merging similar scenes; said phase of constructing chapter partitioning hypotheses comprises a step of creating at least one global hypothesis of cutting said multimedia content according to said resemblance tree and according to said at least one predetermined time-division constraint, said at least one at least one global partitioning hypothesis comprising a plurality of local chapter splitting assumptions; and said phase of constructing said chapters includes a step of selecting at least one global partitioning hypothesis from among said constructed partitioning assumptions.
  • the invention makes it possible to respect both temporal constraints and editorial constraints by constructing a hierarchical data structure that iteratively associates scenes with each other to form higher level scenes.
  • said at least one predetermined time-division constraint comprises at least a maximum duration of a chapter of said multimedia content and / or at least a minimum duration of a chapter of said multimedia content.
  • said cutting method further comprises a verification phase of the validity of said at least one overall hypothesis of chapters of said video stream by relating to a segmentation of at least one audio stream of said multimedia content.
  • the invention makes it possible to validate the global switching hypotheses as a function of the audio stream that accompanies the video stream, to ensure that the chapters that have been defined are coherent with the audio stream of the content.
  • the invention ensures that chapters defined using the resemblance structure do not cut a dialogue or a speech flow in an untimely manner.
  • said step of constructing said resemblance tree comprises: a step of determining at least one descriptor for at least one plane of said plurality of planes; a step of calculating a distance between the descriptors of at least two planes; a step of melting said planes having a minimum distance, forming a scene; a step of inserting said scene into said resemblance tree.
  • the invention makes it possible to group the shots of the video stream into a first level of scenes.
  • These first stages of construction of the resemblance tree allow, from the plans, which constitute elementary scenes to define a first level of the hierarchy of scenes in the resemblance tree.
  • said step of determining the descriptors of said planes of said plurality of planes comprises, for a current plan: a subsampling step of said current plan in a plurality of representative images of said current plan; a step of calculating at least one descriptor for at least some of said images of said plurality of images; a step of merging said at least one calculated descriptor, delivering a descriptor of said current plan.
  • the invention realizes a characterization of a plane based on several images representative of the plane and not on a single image of the plane.
  • said step of merging said planes takes into account a maximum duration between two plans to be merged.
  • the invention makes it possible to ensure that each scene formed from planes having a minimum distance does not exceed a predetermined duration.
  • This maximum duration can prevent the merger of two plans that are separated by too long a distance.
  • this parameter avoids, in an extreme case, that two planes that are located at both ends of the video stream are merged. In a more conventional manner, this parameter avoids the merger of plans that would for example be 10 minutes apart, which could correspond to the maximum length of a chapter.
  • the scenes directly from the planes are constructed according to a maximum duration between two plans to merge which can for example be of the order of the minute, so that each of the elementary scenes defined in the resemblance tree respects constraints of proximities of the planes and a constraint of duration.
  • said descriptor is representative of a colo ⁇ mét ⁇ que distribution of a plurality of images composing a plane.
  • the invention implements a simple colo ⁇ metric distribution, which does not take into account the spatiality characteristics and is therefore suitable for calculating the distance between planes for the invention.
  • the color distribution is particularly suitable because it relates different frames of the same physical scene (eg the different frames of a dialogue scene in the same scenery).
  • said step of constructing said resemblance tree comprises at least one iteration of the following steps calculating a distance between at least some of said scenes of said resemblance tree, - grouping scenes of said plurality of scenes within said resemblance tree, according to said distances of scenes computed so that scenes of a lower hierarchical level are grouped together in a scene of a higher hierarchical level in said tree
  • the invention constructs a tree in which scenes of a lower level are used to define the scenes of the higher level by comparing the distances separating these scenes and grouping the scenes of the lower level according to these distances.
  • a distance calculation function which can for example take into account the descriptors of the planes that make up the scenes whose distance is to be calculated.
  • said step of constructing said resemblance tree ends when said scene grouping step delivers a single scene for the entire video stream
  • the process of creating the resemblance tree stops when a single scene is obtained by grouping scenes of the lower level.
  • the resemblance tree comprises a plurality of scenes. in which the planes constitute the basic unit for obtaining the scenes.
  • the invention makes it possible to construct a resemblance tree which makes it possible to associate the plans with each other in order to construct scenes and to associate, iteratively. or recursively these scenes together to form a set of scenes that are hierarchically grouped within the likeness tree
  • said phase of building chapter splitting hypotheses comprises - a step of searching, within the tree of similarity, of a plurality local assumptions of cutting said flow, said local breakdown assumptions unitarily respecting said at least one temporal cutting constraint; a step of combining said local partitioning assumptions forming said at least one global partitioning hypothesis; a step of inserting said at least one global partition hypothesis into a list of global hypotheses grouping said global hypotheses.
  • the invention makes it possible to construct global partitioning hypotheses, that is to say a set of candidate chapters, which may be suitable for the division of the multimedia content, according to the local hypotheses obtained thanks firstly to the grouping of scenes and secondly to the temporal constraint of cutting.
  • Global assumptions can be based on very variable local assumptions of cutting. Thus, some global hypotheses in the list can propose cuts of the flow in three parts whereas others can propose cuts in five parts.
  • the selection of the global hypothesis chosen for the cut can either be done after an audio segmentation that allows the hypotheses to be compared to moments of speech and non-speech.
  • the overall hypothesis retained can also be selected according to other criteria such as a minimum number of chapters or the average distance separating the local hypotheses composing the global hypothesis selected or a combination of such criteria.
  • the invention also relates to a device for chapter-splitting a multimedia content comprising at least one video stream.
  • such a device comprises: means for segmenting said at least one video stream into a plurality of plans defining scenes; means for analyzing similarities between scenes, associating the less a proximity information to at least two scenes considered; means for constructing chapters of said video stream as a function of said proximity information of said scenes and at least one predetermined time-division constraint, which defines at least one information characterizing the duration of a chapter; means for constructing said chapters, according to said cutting hypotheses.
  • Such a device may also contain complementary means for implementing the cutting method as described above.
  • the invention also relates to a computer program comprising instructions for implementing the cutting method described above when this program is executed by a processor, or a computer program product downloadable from a communication network and / or stored on a computer-readable and / or executable medium by a processor, comprising program code instructions for implementing the chopping method described above, when executed by a processor. 4 LIST OF FIGURES
  • FIG. 1 presents a division of a video stream into a plane
  • FIG. 2A illustrates a first embodiment of the cutting according to the invention
  • FIG. 2B illustrates a second embodiment of cutting according to the invention
  • FIG. 3 describes a method for calculating a plan descriptor according to the invention
  • - Figure 4 presents the method of calculating the resemblance tree according to the invention
  • FIG. 5 illustrates a similarity tree obtained by grouping similar scenes according to the invention
  • FIG. 6 presents cutting hypotheses using the similarity tree of FIG. 5.
  • the general principle of the invention is based on taking into account the temporal constraint for the creation of the chapters of the multimedia content.
  • This temporal constraint is taken into account by realizing, on the one hand, hypotheses of cutting the multimedia content according to a particular method, taking into account a maximum duration of separation in scenes.
  • the temporal constraint is also taken into account by performing a verification on the other hand to determine, among several given partitioning assumptions, which ones best respect the temporal constraint.
  • the invention therefore defines a method of cutting, in at least two chapters, a multimedia content (CM) comprising at least one video stream
  • CM multimedia content
  • the method of the invention comprises a segmentation phase (FIG. 2A, 201) of the video stream in a plurality of planes.
  • This segmentation phase (FIG. 2A, 201) makes it possible, as described in FIG. 1, to partition the video stream (FV) in the plane P / to Pn, each of these planes comprising a set of images.
  • the method of the invention also comprises: a phase of analysis of resemblances between the planes which associates proximity information between the plans considered (FIG.
  • This temporal cutting constraint defines at least one piece of information that characterizes the duration of a chapter.
  • the method makes it possible to obtain one or more chapter splitting results (RES).
  • the similarity analysis phase (202) comprises a step of constructing a resemblance tree, which is a hierarchical structure that makes it possible, firstly, to group the plans into one another. function of proximity information and secondly to iteratively build the assumptions of grouping plans.
  • This construction of the plan clustering assumptions includes a step of creating at least one global hypothesis of cutting the multimedia content according to the similarity tree.
  • a global slicing hypothesis comprises, according to the invention, a plurality of local hypotheses for cutting multimedia content into chapters.
  • the invention hierarchically represents the plans and scenes of the video of the multimedia content.
  • the possibilities of cutting the video are as numerous as the possibilities of partitioning the tree into several sub-trees.
  • each leaf of the tree represents a plane and each node grouping two sheets or more nodes in the higher levels represents a "possible scene”.
  • the invention makes it possible to approach this behavior by implementing a hierarchical classification algorithm to reveal the similarities between temporally close planes that most often belong to the same scene. These similarities are represented in the lowest level of the tree. These similarities are detected using the proximity information between plans. To determine the proximity between plans and to construct the classification of these plans between them, the inventors chose to use only one descriptor (the color distribution) and only one modality (the video). Such an approach makes it possible to avoid introducing parameters or thresholds to be set a priori (no mixture of characteristics).
  • this color distribution is generally not dependent on the spatial evolution of the plane: for example if a camera moves in space while always aiming for the same character, the colorimetric distribution of the plan does not evolve much, to the difference of a spatial distribution for example.
  • the color distribution is therefore particularly well suited to the first phase of grouping shots in order to constitute possible scenes.
  • such a distribution is simple to implement.
  • Other types of proximity determination functions are of course conceivable as long as they make it possible to establish a grouping of shots into scenes and then a grouping of scenes into other higher-ranking scenes.
  • a mixed analysis based on the video on the one hand and on the audio on the other hand is however implemented.
  • the audio analysis makes it possible to detect the scenes of dialogues not to be cut in the middle of a dialogue.
  • the inventors have therefore placed an audio analysis (206) at the end of the validation process of the global cutting hypotheses.
  • This audio analysis has the function of filtering the hypotheses extracted from the video analysis which cut the multimedia content into chapters which certainly respect the temporal constraints, but cut dialogue scenes in an impromptu way.
  • the solution adopted to obtain cutting assumptions is therefore based on two prior segmentation of the contents • a video segmentation (201) cutting the content of video clips (detection of sharp transitions or progressive); the audio segmentation (205) generates, by spectral analysis, segments of three types: silence, speech or no word.
  • the tree of resemblance is a hierarchical data structure in which the plans resulting from the segmentation constitute the leaves of the tree. These sheets will be successively used to build a tree of scenes, each scene of higher rank in the tree being made up of at least two scenes of lower rank, and this according to proximity information.
  • the invention proceeds before cutting the video into plans. This division is performed according to the methods of the state of the art by detection of sudden or progressive transitions. A set of plans is thus obtained, as shown in Figure 3 (plans Pi, Pj and Pk). These plans constitute the basic scenes of the tree of resemblance. The plans are therefore elementary scenes.
  • each image descriptor is merged into a global descriptor in the plane: H 1 and H J in the example of Figure 3.
  • Hi is the descriptor of the plane Pj
  • Hj is the descriptor Plan Pj.
  • This histogram is calculated on each sub-sampled image of the plane (the images II to In, for example in FIG. 3), the fusion being carried out by summation of all the histograms resulting from the selected images and then normalization so as to make comparable the long and short shots (for which the number of images would be different).
  • the value D must be chosen sufficiently large to be greater than all Chi-square distances calculated for ⁇ T J ⁇ T _ In practice, a value of 10 6 , or the maximum value representable by the variable may be used. In this embodiment, the calculated distances are inserted in a triangular matrix. These distances thus serve as starting points for the construction of the similarity tree according to the invention.
  • DS is the distance between the scene S 1 and the scene S J ;
  • T represents the set of planes belonging to the scene S ';
  • r represents the set of planes belonging to the scene S J ;
  • LJ represents the distance between the plane k of the scene S and the plane / of the scene S J.
  • the distance between two scenes is considered as the minimum distance between the respective planes of these two scenes.
  • a first step will thus consist in calculate a first series of possible scenes, of rank immediately superior to the planes (which constitute the leaves of the similarity tree according to the invention).
  • the following steps will consist in successively calculating, from the lower-ranked scenes, scenes of the next higher rank
  • N histograms denoted H are calculated for each of the N planes of the video
  • a list L of scenes (401), initially containing N elements is created: each scene is composed of a single plane, resulting from the initial segmentation of the video. The scenes that make up this list constitute the leaves of the tree.
  • the distance DS * ' the minimum distance between all the pairs (i, j) among the N scenes of L is calculated.
  • a new scene S N connecting S k to S 1 (402) is added to the list L of scenes for the minimum distance found.
  • the scenes S * and S 1 are removed from L Then the number of scenes of 1 is incremented to form a new scene identifier;
  • step 4 is repeated until list L contains only one scene
  • the next phase according to the invention consists in extracting from this tree hypotheses of cutting the video stream based precisely on the distances that separate the scenes.
  • the search and extraction of hypotheses are carried out by traversing the tree from top to bottom.
  • the scenes with the highest distance are searched in priority to build the cutting hypotheses.
  • An important parameter of the extraction is the taking into account of the temporal constraint, which makes it possible to determine a maximum duration and a minimum duration of a chapter.
  • the search and the extraction of hypotheses are carried out according to the following parameters: the duration of the video is D ID ; the maximum duration of chapters is D MAX ; the minimum duration of the chapters is fixed at D M ⁇ X / 2 to avoid the non-feasibility of the constraints: thus one ensures to always find a suitable solution to the constraints; a maximum variation around the average, D V ⁇ R is defined. It makes it possible to ensure a homogeneity constraint of duration between the chapters.
  • the extraction phase of the cutting hypotheses presented in relation to FIGS. 5 and 6 is as follows: 1. the chapter duration constraint [D MAX / 2, D MAX ] determines the validity interval for the choice of cutting assumptions (in dotted line in Figure 5). 2. The descending run from the node allows to define the best cutting points: Figure 6 shows how the best score hypothesis is chosen: for each node, the min and max times are extracted from the boundaries of all the nodes. plans lying under the considered node
  • the path above may be iterated several times, so as to extract several local assumptions cutting, so that the 1 st hypothesis has the strongest score, the second having the next lower score, and so on .
  • each local hypothesis on the 1st chapter involves a new range of validity to the end of the second chapter, and thus new local assumptions for the end of the second chapter. So for 5 local assumptions 1 chapter 25 local hypotheses will be evaluated for the second chapter (5 new local hypotheses cut for the second chapter for each of the 5 local assumptions cutting 1 chapter). Local hypotheses are thus combined to form global hypotheses of divisions. These combinations are not random, however, since a given local hypothesis can not be combined with any other. It is necessarily combined with a local hypothesis which allowed to assume a division of a first chapter.
  • each global hypothesis including a variable number of chapters 6 chapters of 5 mn or 5 chapters of 6 mn are potentially possible
  • an average score (average of the scores of each cut) 8.
  • the list of global hypotheses is sorted according to the mean scores of the hypotheses • the highest average score corresponding to the best sequence of cuts
  • each global hypothesis score being the average of the average distances of the scenes which compose each local hypothesis of cutting
  • the set of global hypothesis lists is compared to the audio segmentation.
  • This audio segmentation differentiates three types of temporal segments silences, speech segments and those of non-speech
  • a list of local hypotheses (that is to say a global hypothesis) is validated if the local hypotheses of cutting constituting it are located in segments of non-speech type, of a duration greater than TNP (parameter of the 'application). Providing that the non-speech time within which a cut is allowed must be greater than the parameter TNP (for example 10 seconds) makes it possible to be sure not to cut in the middle of a dialogue.

Landscapes

  • Television Signal Processing For Recording (AREA)
  • Information Retrieval, Db Structures And Fs Structures Therefor (AREA)

Abstract

L'invention concerne un procédé de découpage, en au moins deux chapitres, d'un contenu multimédia comprenant au moins un flux vidéo. Selon l'invention, un tel procédé comprend : une phase de segmentation dudit au moins un flux vidéo en une pluralité de plans définissant des scènes; une phase d'analyse de ressemblances entre des scènes, associant au moins une information de proximité à au moins deux scènes considérées; une phase de construction d'hypothèses de découpage en chapitres dudit flux vidéo en fonction desdites informations de proximité desdites scènes et d'au moins une contrainte temporelle de découpage prédéterminée, laquelle définit au moins une information caractérisant la durée d'un chapitre; une phase de construction desdits chapitres, en fonction desdites hypothèses de découpage.

Description

Procédé de découpage de contenu multimédia, dispositif et programme d'ordinateur correspondant.
1 DOMAINE DE L'INVENTION
La présente invention se rapporte au domaine de la définition de chapitre pour les contenus multimédia.
La présente invention se rapporte plus particulièrement à un procédé de chapitrage de contenus multimédias qui comportent au moins un flux vidéo.
La numérisation de la chaine de transmission TV, l'accroissement des capacités de bande passante offerte par le haut débit fixe (ADSL, FTTH) et mobile (EDGE, UMTS, HSDPA) permettent maintenant une réelle convergence de l'accès aux contenus multimédias à travers les différentes situations (chez soi, en mobilité...) et sur une variété importante de terminaux de réception (PC, TV et set-top-box, terminaux mobiles) aux capacités très différentes tant en termes de débits que de résolutions. Proposer les mêmes contenus multimédias sur télévision, ordinateur, et terminal mobile, comme le propose certains services dit « convergents », suppose une adaptation du format initial pour les terminaux auxquels les contenus sont destinés. Pour une diffusion sur un terminal mobile, l'adaptation de ces contenus prend plusieurs aspects : - une adaptation de la résolution des images, du rapport d'aspect largeur / hauteur ; un transcodage vers les formats mobile (3GP) ; un découpage de la vidéo originale des contenus multimédia en chapitres courts. L'invention porte plus particulièrement sur ce dernier point. Le découpage d'une vidéo en chapitres (opération également appelée « chapitrage ») permet de s'adapter à la consommation « mobile » des contenus multimédia, constitués de contenus courts particulièrement adaptés pour un visionnage en situation de mobilité. Il a été en effet constaté que le visionnage d'un contenu multimédia sur un terminal mobile n'excédait pas, en général, la dizaine de minutes. Ceci est du notamment au fait que les écrans des terminaux mobiles sont de taille relativement réduite. Aussi, pour faciliter le visionnage, les contenus longs sont découpés en segments (chapitres) de cinq à dix minutes ce qui permet de faciliter la reprise de visionnage d'un contenu vidéo après une interruption. 2 SOLUTIONS DE L'ART ANTERIEUR
Dans l'état actuel de la technique, le chapitrage des contenus destinés à être visionnés sur des terminaux mobiles est réalisé manuellement. La détermination des instants de découpe du contenu est une opération longue, fastidieuse et coûteuse. Elle nécessite en effet de jouer la vidéo à proximité des points de césure envisagés pour les déterminer précisément en fonction des contraintes temporelles et des contraintes sémantiques.
Les contraintes temporelles imposent que le découpage doit produire des fichiers (chapitres) de durées homogènes. Par exemple, une contrainte temporelle peut imposer que les fichiers aient une durée comprise entre cinq et dix minutes. Une seconde contramte temporelle peut imposer que chaque durée, prise indépendamment, ne peut pas différer de plus d'une minute de la durée moyenne des fichiers produits.
Ainsi, ces contraintes appliquées à un contenu d'une durée de vingt-cinq minutes, permet d'obtenir plusieurs hypothèses globales de découpe : trois fichiers de durées variant entre sept minutes et vingt secondes et neuf minutes et vingt secondes ; quatre fichiers d'une durée de cinq minutes et quinze secondes à sept minutes et quinze secondes ; - ou encore cinq fichiers d'une durée comprise entre cinq et six minutes.
Les contraintes sémantiques (encore appelées contraintes éditoriales) imposent que le découpage doit préférentiellement se faire sur un changement de plans, aux extrémités d'une scène, la scène étant l'unité sémantique élémentaire résultant de la concaténation de plans formant une unité, se déroulant dans un même lieu au même moment (chaque plan se caractérisant par une continuité du contenu filmé, donc sans coupure ou changement de prise de vue). A titre d'exemple, un dialogue, une conversation téléphonique, une action observée de plusieurs points de vue constituent des scènes que l'on ne souhaitera pas couper au moment du découpage en chapitres On comprend donc que la création manuelle du découpage des fichiers, qui prend en compte à la fois les contraintes temporelles et les contraintes éditoπales est longue, fastidieuse et coûteuse
Des solutions de création automatique de chapitres existent. Elles permettent, à partir d'un contenu en entrée, d'obtenir un découpage en chapitres en fonction de contraintes éditoπales. Ces solutions proposent des techniques d'interprétation du contenu sémantique des vidéos en vue de la génération automatique de chapitres, à des fins de navigation. Ces travaux procèdent donc majoritairement par regroupement de plans similaires (opération appelée
« clusteπng ») en vue de constituer ces scènes. Ce regroupement est réalisé par extraction de caractéristiques vidéo (et également audio dans certains cas) sur des images-clé extraites des plans. Les scènes sont finalement formées par fusion des regroupements de plans, en utilisant un seuil absolu de comparaison
L'approche généralement constatée est donc de type « bottom-up », partant des entités élémentaires que sont les plans pour définir des groupes de plans similaires puis des scènes. Le résultat obtenu par ces techniques est très dépendant de caractéristiques extraites du flux audio / vidéo visant a regrouper les plans , de critères de mélange lorsque plusieurs caractéristiques sont utilisées pour regrouper les plans (couleur, texture de l'image, puissance et fréquences sonores ) , de la granulaπté choisie pour former les clusters (ou regroupements) de plans , des critères retenus pour fusionner les clusters en scènes. Ces techniques nécessitent l'utilisation de plusieurs seuils de comparaison ayant un impact direct sur le résultat et créant des scènes plus ou moins respectueuses du découpage sémantique souhaité.
Ces techniques ne permettent cependant pas de résoudre les problèmes liés aux contraintes temporelles. En effet, les scènes obtenues ne sont par exemple pas homogènes en termes de durée . seules les contraintes éditoriales sont prises en compte de sorte qu'un chapitre peut avoir une durée de cinq minutes et le chapitre suivant une durée de vingt minutes. Ces techniques ne sont donc pas adaptées au découpage de contenus pour des terminaux mobiles 3 RESUME DE L'INVENTION
L'invention permet de pallier ces inconvénients de l'art antérieur. L'invention concerne en effet un procédé de découpage, en au moins deux chapitres, d'un contenu multimédia comprenant au moins un flux vidéo,
Selon l'invention, un tel procédé comprend : - une phase de segmentation dudit au moins un flux vidéo en une pluralité de plans définissant des scènes ; une phase d'analyse de ressemblances entre des scènes, associant au moins une information de proximité à au moins deux scènes considérées ; une phase de construction d'hypothèses de découpage en chapitres dudit flux vidéo en fonction desdites informations de proximité desdites scènes et d'au moins une contrainte temporelle de découpage prédéterminée, laquelle définit au moins une information caractérisant la durée d'un chapitre ; une phase de construction desdits chapitres, en fonction desdites hypothèses de découpage.
Ainsi, à la différence des techniques de l'art antérieur dont le but n'est pas de créer des chapitres qui respectent à la fois des contraintes temporelles et éditoriales, mais simplement de regrouper les plans en scènes afin de permettre de naviguer de façon non-linéaire dans le programme ou d'en proposer un résumé le procédé de l'invention permet d'obtenir un découpage du contenu multimédia en fonction d'une contrainte temporelle et d'une contrainte éditoπale, ce qui permet à la fois de respecter l'esprit du contenu, en ne chapitrant pas à des moments inopportuns, et les contraintes définissant une durée pour les chapitres.
En particulier, ladite phase d'analyse de ressemblances comprend une étape de construction d'un arbre de ressemblance comprenant une hiérarchie de scènes construite par fusion de scènes similaires ; ladite phase de construction d'hypothèses de découpage en chapitres comprend une étape de création d'au moins une hypothèse globale de découpage dudit contenu multimédia en fonction dudit arbre de ressemblance et en fonction de ladite au moms une contrainte temporelle de découpage prédéterminée, ladite au moins une hypothèse globale de découpage comprenant une pluralité d'hypothèses locales de découpage en chapitres ; et ladite phase de construction desdits chapitres comprend une étape de sélection d'au moins une hypothèse globale de découpage parmi lesdites hypothèses de découpage construites. Ainsi, l'invention permet de respecter à la fois des contraintes temporelles et des contraintes éditoπales en construisant une structure de données hiérarchique qui associe de manière itérative les scènes entre elles pour former des scènes de niveau supérieur. Cette structure permet d'émettre des hypothèses de découpage qui respectent les contraintes temporelles de découpage en chapitres. Selon une caractéristique particulière de l'invention, ladite au moms une contrainte temporelle de découpage prédéterminée comprend au moins une durée maximum d'un chapitre dudit contenu multimédia et/ou au moins une durée minimum d'un chapitre dudit contenu multimédia.
Ceci permet d'adapter le découpage du contenu afin que la durée de chacun des chapitres créés n'excède pas une durée maximum prédéterminée et/ou d'adapter le découpage du contenu afin que la durée de chacun des chapitres créés ne soit pas inférieure à une durée minimum prédéterminée.
Selon un mode de réalisation particulier de l'invention, ledit procédé de découpage comprend en outre une phase de vérification de la validité de ladite au moins une hypothèse globale de découpage en chapitres dudit flux vidéo par rapport à une segmentation d'au moins un flux audio dudit contenu multimédia.
Ainsi l'invention permet de valider les hypothèses globales de découpage en fonction du flux audio qui accompagne le flux vidéo, pour s'assurer que les chapitres qui ont été définis sont cohérents avec le flux audio du contenu. En d'autres termes, l'invention assure que les chapitres définis à l'aide de la structure de ressemblance ne coupent pas un dialogue ou un flux de parole de manière inopportune.
Selon un aspect particulier de l'invention, ladite étape de construction dudit arbre de ressemblance comprend : - une étape de détermination d'au moins un descripteur pour au moins un plan de ladite pluralité de plans ; une étape de calcul d'une distance entre les descripteurs d'au moins deux plans ; une étape de fusion desdits plans présentant une distance minimum, formant une scène ; une étape d'insertion de ladite scène au sein dudit arbre de ressemblance.
Ainsi, l'invention permet de regrouper les plans du flux vidéo en un premier niveau de scènes. Ces premières étapes de construction de l'arbre de ressemblance permettent, à partir des plans, qui constituent des scènes élémentaires de définir un premier niveau de la hiérarchie des scènes dans l'arbre de ressemblance.
En particulier, ladite étape de détermination des descripteurs desdits plans de ladite pluralité de plans comprend, pour un plan courant : une étape de sous-échantillonage dudit plan courant en une pluralité d'images représentatives dudit plan courant ; une étape de calcul d'au moins un descripteur pour au moins certaines desdites images de ladite pluralité d'images ; une étape de fusion dudit au moins un descripteur calculé, délivrant un descripteur dudit plan courant. Ainsi, à la différence des techniques de l'art antérieur, l'invention réalise une caractérisation d'un plan en se basant sur plusieurs images représentatives du plan et non pas sur une seule image du plan.
En particulier, ladite étape de fusion desdits plans tient compte d'une durée maximum entre deux plans à fusionner. Ainsi, l'invention permet d'assurer que chaque scène formée à partir de plans présentant une distance minimum n'excède pas une durée prédéterminée. Cette durée maximum peπnet d'éviter la fusion de deux plans qui sont séparés d'une durée trop éloignée. Par exemple ce paramètre évite, dans un cas extrême, que deux plans qui sont situés aux deux extrémités du flux vidéo soient fusionnés. De manière plus conventionnelle, ce paramètre évite de fusionner des plans qui seraient par exemple éloignés de dix minutes, durée qui pourrait correspondre à la longueur maximum d'un chapitre.
Ainsi, les scènes issues directement des plans sont construites en fonction d'une durée maximum entre deux plans à fusionner qui peut par exemple être de l'ordre de la minute, de sorte que chacune des scènes élémentaires définies dans l'arbre de ressemblance respecte des contraintes de proximités des plans et une contrainte de durée.
Selon une caractéristique particulière de l'invention, ledit descripteur est représentatif d'une distribution coloπmétπque d'une pluralité d'images composant un plan.
Ainsi à la différence des techniques de l'art antérieur qui font appel à de multiples descripteurs, et notamment à des descripteurs spatiaux qui permettent d'identifier les changements de structures spatiales des plans, l'invention met en œuvre une distribution coloπmétrique simple, qui ne tient pas compte des caractéristiques de spatiahté et est donc adaptée au calcul de distance entre plans pour l'invention. En effet, la distribution colorimétrique est particulièrement adaptée car elle met en relation des cadrages différents d'une même scène physique (par exemple les différents cadrages d'une scène de dialogue dans les mêmes décors). Selon un mode de réalisation particulier de l'invention, ladite étape de construction dudit arbre de ressemblance comprend au moins une itération des étapes suivantes calcul d'une distance entre au moins certaines desdites scènes dudit arbre de ressemblance , - regroupement de scènes de ladite pluralité de scènes au sein dudit arbre de ressemblance, en fonction desdites distances de scènes calculées de sorte que des scènes d'un niveau hiérarchique inférieur soient regroupées au sein d'une scène d'un niveau hiérarchique supérieur dans ledit arbre
Ainsi, l'invention construit un arbre dans laquelle les scènes d'un niveau inférieur servent à définir les scènes du niveau supérieur en comparant les distances qui séparent ces scènes et en regroupant les scènes du niveau inférieur en fonction de ces distances Le calcul des distances entre scènes d'un niveau inférieur fait intervenir une fonction de calcul de distance qui peut par exemple prendre en compte les descripteurs des plans qui composent les scènes dont on souhaite calculer la distance.
En particulier, ladite étape de construction dudit arbre de ressemblance prend fin lorsque ladite étape de regroupement de scène délivre une unique scène pour l'ensemble du flux vidéo
Ainsi, le processus de création de l'arbre de ressemblance s'arrête quand une scène unique est obtenue en regroupant des scènes du niveau inférieur A l'issue de la création de cette dernière scène, l'arbre de ressemblance comprend une pluralité de scènes dans laquelle les plans constituent l'unité de base d'obtention des scènes En d'autres termes, l'invention permet de construire un arbre de ressemblance qui permet d'associer les plans entre eux pour construire des scènes et d'associer, itérativement ou récursivement ces scènes entre elles pour former un ensemble de scènes qui sont regroupées hiérarchiquement au sein de l'arbre de ressemblance
Selon un mode de réalisation particulier de l'invention, ladite phase de construction d'hypothèses de découpage en chapitres comprend - une étape de recherche, au sein de l'arbre de ressemblance, d'une pluralité d'hypothèses locales de découpage dudit flux, lesdites hypothèses locales de découpage respectant unitairement ladite au moins une contrainte temporelle de découpage ; une étape de combinaison desdites hypothèses locales de découpage formant ladite au moins une hypothèse globale de découpage ; une étape d'insertion de ladite au moins une hypothèse globale de découpage dans une liste d'hypothèses globales regroupant lesdites hypothèses globales.
Ainsi, l'invention permet de construire des hypothèses globales de découpage, c'est-à-dire un ensemble de chapitres candidats, qui peuvent convenir au découpage du contenu multimédia, en fonction des hypothèses locales obtenues grâce d'une part au regroupement de scènes et d'autre part à la contrainte temporelle de découpage.
Les hypothèses globales peuvent se baser sur des hypothèses locales de découpe très variables. Ainsi, certaines hypothèses globales de la liste peuvent proposer des découpes du flux en trois parties alors que d'autres peuvent proposer des découpes en cinq parties. La sélection de l'hypothèse globale retenue pour la découpe pourra soit être réalisée après une segmentation audio qui permet de confronter les hypothèses à des moments de paroles et de non paroles. L'hypothèse globale retenue pourra également être sélectionnée en fonction d'autres critères tels qu'un nombre minimum de chapitres ou la distance moyenne séparant les hypothèses locales composant l'hypothèse globale sélectionnée ou encore une combinaison de tels critères.
Selon un autre aspect, l'invention concerne également un dispositif de découpage en chapitres d'un contenu multimédia comprenant au moins un flux vidéo.
Selon l'invention un tel dispositif comprend : des moyens de segmentation dudit au moins un flux vidéo en une pluralité de plans définissant des scènes ; - des moyens d'analyse de ressemblances entre des scènes, associant au moins une information de proximité à au moins deux scènes considérées ; des moyens de construction d'hypothèses de découpage en chapitres dudit flux vidéo en fonction desdites informations de proximité desdites scènes et d'au moins une contrainte temporelle de découpage prédéterminée, laquelle définit au moins une information caractérisant la durée d'un chapitre ; des moyens de construction desdits chapitres, en fonction desdites hypothèses de découpage.
Un tel dispositif peut également contenir des moyens complémentaires de mise en œuvre du procédé de découpage tel que décrit précédemment
L'invention concerne également un programme d'ordinateur comportant des instructions pour la mise en œuvre du procédé de découpage décrit précédemment lorsque ce programme est exécuté par un processeur, ou un produit programme d'ordinateur téléchargeable depuis un réseau de communication et/ou stocké sur un support lisible par ordinateur et/ou exécutable par un processeur, comprenant des instructions de code de programme pour la mise en œuvre du procédé découpage décrit précédemment, lorsqu'il est exécuté par un processeur. 4 LISTE DES FIGURES
D'autres caractéristiques et avantages de l'invention apparaîtront plus clairement à la lecture de la description suivante d'un mode de réalisation préférentiel, donné à titre de simple exemple îllustratif et non limitatif, et des dessins annexés, parmi lesquels : la figure 1 présente un découpage d'un flux vidéo en plan ; la figure 2A illustre un premier mode de réalisation du découpage selon l'invention ; la figure 2B illustre une deuxième mode de réalisation du découpage selon l'invention ; la figure 3 décrit une méthode de calcul d'un descripteur de plan selon l'invention ; - la figure 4 présente la méthode de calcul de l'arbre de ressemblance selon l'invention ; la figure 5 illustre un arbre de ressemblance obtenu par regroupement de scènes similaires selon l'invention ; la figure 6 présente des hypothèses de découpage en utilisant l'arbre de ressemblance de la figure 5.
5 DESCRIPTION DETAILLEE DE L'INVENTION
5.1 Rappel du principe de l'invention
Le principe général de l'invention repose sur la prise en compte de la contrainte temporelle pour la création des chapitres du contenu multimédia. Cette contrainte temporelle est prise en compte en réalisant d'une part des hypothèses de découpe du contenu multimédia selon un procédé particulier, tenant compte lui-même d'une durée maximum de séparation dans des scènes. La contrainte temporelle est également prise en compte en réalisant d'autre part une vérification permettant de déterminer, parmi plusieurs hypothèses de découpages données, quelles sont celles qui respectent le mieux la contrainte temporelle.
L'invention définit donc un procédé de découpage, en au moins deux chapitres, d'un contenu multimédia (CM) comprenant au moins un flux vidéo
(FV). Le contenu peut également comprendre un flux audio (FA). Le principe de l'invention est décrit en relation avec les figures 1 et 2A. Le procédé de l'invention comprend une phase de segmentation (Figure 2A, 201) du flux vidéo en une pluralité de plans. Cette phase de segmentation (Figure 2A, 201) permet, comme cela est décrit en figure 1, de réaliser un découpage du flux vidéo (FV) en plan P/ à Pn, chacun de ces plans comprenant un ensemble d'images. Le procédé de l'invention comprend également : - une phase d'analyse de ressemblances entre les plans qui associe une information de proximité entre les plans considérés (Figure 2A, 202) , une phase de construction d'hypothèses de regroupement de plans en fonction des informations de proximité (Figure 2 A, 203) ; une phase de construction desdits chapitres, en fonction d'une part des hypothèses de regroupement et d'autre part d'une contrainte temporelle (CT) de découpage prédéterminée (Figure 2A, 204). Cette contrainte temporelle de découpage définit au moins une information qui caractérise la durée d'un chapitre.
Le procédé permet d'obtenir un ou plusieurs résultats de découpage en chapitres (RES).
Selon l'invention, la phase d'analyse de ressemblances (202) comprend une étape de construction d'un arbre de ressemblance, qui est une structure hiérarchique qui permet d'une part, dans un premier temps, de regrouper les plans entre en fonction des informations de proximité et d'autre part de construire itérativement les hypothèses de regroupement de plans. Cette construction des hypothèses de regroupement de plans comprend une étape de création d'au moins une hypothèse globale de découpage du contenu multimédia en fonction de l'arbre de ressemblance. Une hypothèse globale de découpage comprend, selon l'invention, une pluralité d'hypothèses locales de découpage du contenu multimédia en chapitres.
En d'autres termes, l'invention représente hiérarchiquement les plans et scènes de la vidéo du contenu multimédia. Les possibilités de découpe de la vidéo sont ainsi aussi nombreuses que les possibilités de partitionnement de l'arbre en plusieurs sous-arbres. Selon l'invention, chaque feuille de l'arbre représente un plan et chaque nœud regroupant deux feuilles ou plusieurs nœuds dans les niveaux supérieurs représente une "scène possible".
Comme l'état de la technique ne fournit pas de solution permettant de passer directement du niveau signal (la découpe en plans) au niveau sémantique (l'association de ces plans en scènes par le réalisateur), l'invention permet d'approcher ce comportement en mettant en œuvre un algorithme de classification hiérarchique permettant de faire apparaître les similarités entre plans temporellement proches qui appartiennent le plus souvent à la même scène. Ces similarités sont représentées dans le niveau le plus bas de l'arbre. Ces similarités sont détectées à l'aide de l'information de proximité entre plans. Pour déterminer la proximité entre plans et construire la classification de ces plans entre eux, les inventeurs ont choisi de n'utiliser qu'un seul descripteur (la distribution colorimétrique) et qu'une seule modalité (la vidéo). Une telle approche permet d'éviter d'introduire des paramètres ou seuils à fixer a priori (pas de mélange de caractéristiques). De plus, cette distribution colorimétrique n'est généralement pas dépendante de l'évolution spatiale du plan : par exemple si une caméra se déplace dans l'espace en visant toujours un même personnage, la distribution colorimétrique du plan n'évolue pas beaucoup, à la différence d'une distribution spatiale par exemple. La distribution colorimétrique est donc particulièrement bien adaptée à la première phase de regroupement de plans en vue de constituer des scènes possibles. De plus, comme nous le verrons par la suite, une telle distribution est simple à mettre en œuvre. D'autres types de fonctions de détermination de la proximité sont bien entendu envisageables du moment qu'elles permettent d'établir un regroupement de plans en scènes puis un regroupement de scènes en d'autres scènes de rang supérieur
Dans un mode de réalisation particulier de l'invention (figure 2B), une analyse mixte basée sur la vidéo d'une part et sur l'audio d'autre part est cependant mise en œuvre. L'analyse audio permet de déceler les scènes de dialogues à ne pas découper en plein milieu d'un dialogue. Dans ce mode de réalisation, les inventeurs ont donc placé une analyse audio (206) en fin de processus de validation des hypothèses globales de découpage. Cette analyse audio a pour fonction de filtrer les hypothèses extraites de l'analyse vidéo qui coupent le contenu multimédia en chapitres qui certes respectent les contraintes temporelles, mais coupent des scènes de dialogue de manière impromptue. Ainsi, dans ce mode de réalisation (figure 2B), la solution retenue pour obtenir des hypothèses de découpage s'appuie donc sur deux segmentations préalables du contenu une segmentation vidéo (201) découpe le contenu en plans vidéo (détection des transitions brutales ou progressives) ; - la segmentation audio (205) génère, par analyse spectrale, des segments de trois types: silence, parole ou non parole.
Ainsi, on assure que les résultats de découpage en chapitres obtenus ne contiendront pas une découpe dans laquelle un dialogue sera coupé de manière inopiné. Bien entendu, si une seule possibilité de découpage en chapitres existe compte tenu des contraintes temporelles et que cette possibilité de découpage entraine une découpe d'un dialogue, alors cette possibilité sera quand même retenue puisque selon l'invention, la contrainte temporelle prime sur les autres contraintes.
Par la suite, on présente en détail les phases permettant d'obtenir un découpage du contenu multimédia selon l'invention. Il est clair cependant que l'invention ne se limite pas à ce mode de réalisation particulier, mais peut également être mise en œuvre selon d'autres modes opératoires. Par exemple, l'arbre de ressemblance peut être remplacé par toute autre structure de donnés de nature hiérarchique. 5.2 Description d'un mode de réalisation
On présente dans ce mode de réalisation, la mise en œuvre des différentes phases permettant d'obtenir un découpage selon le procédé de l'invention. On rappelle que, selon l'invention, on réalise un découpage du flux vidéo en plan et que ces plans servent de base à la construction d'un arbre de ressemblance lequel est ensuite utilisé pour définir des hypothèses de découpe respectant des contraintes temporelles et des contraintes éditoriales. 5.2.1 Construction de l'arbre de ressemblance
L'arbre de ressemblance est une structure de données hiérarchique dans laquelle les plans issus de la segmentation constituent les feuilles de l'arbre. Ces feuilles vont être successivement utilisées pour construire une arborescence de scènes, chaque scène de rang supérieur dans l'arbre étant constituée d'au moins deux scènes de rang inférieur, et ce en fonction d'informations de proximité.
Pour construire l'arbre de ressemblance, l'invention procède préalablement à un découpage de la vidéo en plans. Ce découpage est réalisé selon les méthodes de l'état de la technique par détection des transitions brutales ou progressives. Un ensemble de plans est ainsi obtenu, tel que présenté en figure 3 (plans Pi, Pj et Pk). Ces plans constituent les scènes de base de l'arbre de ressemblance. Les plans sont donc des scènes élémentaires.
Pour construire l'arbre de ressemblance il est nécessaire de procéder à une caractérisation des plans issus du découpage pour pouvoir déterminer leurs proximités les uns par rapport aux autres. Alors que, pour caractériser un plan, les techniques antérieures procèdent majoritairement par sélection d'images clés représentatives des plans issus de la segmentation vidéo, les inventeurs ont choisi un descripteur permettant une caractérisation plus représentative de l'ensemble du plan et déterminer des informations de proximités (des distances comme cela est expliqué par la suite) en adéquation avec le problème que l'invention se propose de résoudre.
Pour cela, un sous-échantillonnage de l'ensemble du plan est réalisé (des images sont extraites du plan que l'on souhaite caractériser, par exemple les images II à In). Chacune de ces images est individuellement caractérisée, c'est-à- dire que l'on calcul le descripteur de cette image. Finalement, pour caractériser le plan, chaque descripteur d'image est fusionné au sein d'un descripteur global au plan : H1 et HJ dans l'exemple de la figure 3. Hi est le descripteur du plan Pj et Hj est le descripteur du plan Pj. Plus particulièrement, dans ce mode de réalisation de l'invention, le descripteur retenu par les inventeurs est un histogramme tridimensionnel représentant la distribution colorimétrique d'une image dans l'espace de couleur RVB (Rouge, Vert, Bleu). Cet histogramme est construit par quantification vectorielle uniforme sur les trois dimensions R, V et B, chaque dimension étant quantifiée uniformément sur huit segments. On obtient ainsi un histogramme composé de 83=512 valeurs.
Cet histogramme est calculé sur chaque image sous-échantillonnée du plan (les images II à In par exemple sur la figure 3), la fusion étant réalisée par sommation de tous les histogrammes issus des images sélectionnées puis normalisation de sorte à rendre comparable les plans longs et courts (pour lesquels le nombre d'images serait différent).
Comme cela a déjà été introduit, le choix de ce descripteur est justifié par la sémantique associée : les inventeurs ont constaté qu'une scène est généralement localisée en un lieu unique, même si chaque plan est filmé sous des angles différents. La distribution colorimétrique étant indépendante de la localisation des objets de la scène, elle permet donc d'associer entre eux différentes vues d'une même scène. Elle est donc capable de mettre en relation les différents plans d'un dialogue par exemple, alors que d'autres types de caractérisation de plans ne le sont pas.
Pour débuter la construction de l'arbre de ressemblance, il est nécessaire de définir une distance entre plans, c'est-à-dire dans ce mode de réalisation de l'invention, une distance entre les descripteurs représentatifs des plans que sont les histogrammes H'. Cette distance constitue l'information de proximité entre plans. La distance utilisée, dite distance de Chi-Deux, est la suivante : si ΔT'J < ΔT MAX
DIJ = £=0 m +Hi
DMAX sinon où ΔT'J constitue le temps séparant les milieux des plans i et j. Selon l'invention, une durée maximale entre plans ΔT a été introduite pour assurer la proximité temporelle entre plans d'une même scène. En effet, une scène étant constituée de plans temporellement proches, l'ajout de cette contrainte permet de s'assurer que deux plans ayant une distance donnée sont proches temporellement. Expérimentalement, cette valeur a été fixée à une minute par les inventeurs, l'algorithme n'étant pas sensible à des variations modérées de celle-ci (du fait du principe de calcul de distance entre scènes). La valeur D doit être choisie suffisamment grande pour être supérieure à toutes les distances de Chi-Deux calculées pour ΔTJ < ΔT _ En pratique, une valeur de 106, ou la valeur maximale représentable par la variable peuvent être utilisées. Dans ce mode de réalisation, les distances calculées sont insérées dans une matrice triangulaire Ces distances servent ainsi de base de départ à la construction de l'arbre de ressemblance selon l'invention.
Selon l'invention, il est également nécessaire de calculer des distances entre scènes (ce sont des informations de proximité entre scènes qui servent au regroupement de celles-ci en des scènes d'ordre supérieur) En effet, les distances entre plan vont permettre dans un premier temps de déterminer des « scènes possibles », qui seront elle-même regroupées en un ensemble de scènes possibles d'ordre supérieur, comme cela est décrit par la suite Les distances entre scènes sont définies de manière suivante :
DSι] = min D ker' ,lerJ
DS est la distance entre la scène S1 et la scène SJ ; T représente l'ensemble des plans appartenant à la scène S' ; - r représente l'ensemble des plans appartenant à la scène SJ ;
LJ représente la distance entre le plan k de la scène S et le plan / de la scène SJ.
Ainsi, la distance entre deux scènes est considérée comme la distance minimum qui sépare les plans respectifs de ces deux scènes.
La construction de l'arbre de ressemblance en tant que tel est un processus itératif (ou récursif selon l'implémentation qui en est faite) consistant à calculer successivement, en partant des distances entre plans, des scènes possibles Une première étape va donc consister à calculer une première série de scènes possibles, de rang immédiatement supérieur aux plans (lesquels constituent les feuilles de l'arbre de ressemblance selon l'invention). Les étapes suivantes consisteront à calculer successivement, à partir des scènes de rang inférieur, des scènes du rang immédiatement supérieur
Ce processus est décrit en relation avec la figure 4 1. N histogrammes notés H sont calculés pour chacun des N plans de la vidéo ;
2. Une matrice triangulaire inférieure M des distances Dij (j=0..N-l, j=0..N- 1) entre plans est calculée ; 3. Une liste L de scènes (401), contenant initialement N éléments est créée : chaque scène est composée d'un seul plan, issu de la segmentation initiale de la vidéo. Les scènes qui composent cette liste constituent les feuilles de l'arbre.
4. La distance DS*', distance minimale entre tous les couples (i,j) parmi les N scènes de L est calculée. Une nouvelle scène SN reliant Sk à S1 (402) est ajoutée à la liste L de scènes pour la distance minimale trouvée. Les scènes S* et S1 sont retirées de L On incrémente ensuite le nombre de scènes de 1 pour constituer un nouvel identifiant de scène ;
5. Le processus de l'étape 4 est réitéré jusqu'à ce que la liste L ne contienne plus qu'une seule scène ;
On présente, en relation avec la figure 5, l'arbre final obtenu sur une décomposition temporelle initialement constituée de 24 plans. Plus les plans puis les scènes sont similaires, plus leur fusion intervient bas sur l'axe des ordonnées (la distance qui les séparent est faible). Une fusion avec une ordonnée importante signifie que les scènes sont différentes car la distance entre les scènes fusionnées est élevée. 5.2.2 Extraction des hypothèses de découpe
L'arbre de ressemblance préalablement construit a permis de rassembler les plans en scènes, chaque scène étant caractérisée par une distance (également appelé score qui est représenté sur l'axe des ordonnées de la figure 5).
La phase suivante selon l'invention consiste à extraire de cet arbre des hypothèses de découpe du flux vidéo en se basant justement sur les distances qui séparent les scènes. La recherche et l'extraction des hypothèses sont réalisées en parcourant l'arbre du haut vers le bas. Les scènes ayant la distance la plus élevée sont recherchées en priorité pour construire les hypothèses de découpe. Un paramètre important de l'extraction est la prise en compte de la contrainte temporelle, qui permet de déterminer une durée maximum et une durée minimum d'un chapitre. Ainsi, la recherche et l'extraction d'hypothèses sont réalisées en fonction des paramètres suivants : la durée de la vidéo est D ID ; la durée maximum des chapitres est DMAX ; la durée minimum des chapitres est fixée à DMΛX/2 pour éviter la non- réalisabilité des contraintes : ainsi on assure de toujours trouver une solution convenant aux contraintes ; - une variation maximum autour de la moyenne, DVΛR est définie. Elle permet d'assurer une contrainte d'homogénéité de durée entre les chapitres.
En d'autres termes, elle permet d'assurer que la durée des chapitres est homogène.
Une fois l'arbre de ressemblance entre scènes construit, la phase suivante consiste, selon l'invention, à choisir les meilleurs instants de découpe en chapitres, selon les contraintes suivantes : chaque chapitre doit avoir une durée comprise entre DMAX/2 et DMΛX. compte-tenu d'un nombre N de chapitres, la durée de chaque chapitre doit être comprise entre DMEAN - DVAR et DMEAN + DVAR, où DMEAN = DVIDE0/N. La phase d'extraction des hypothèses de découpe, présentée en relation avec les figures 5 et 6 est la suivante : 1. la contrainte de durée de chapitre [DMAX/2, DMAX ] détermine l'intervalle de validité pour le choix des hypothèses de découpe (en pointillé sur la figure 5). 2. le parcours descendant depuis le nœud permet de définir les meilleurs points de découpe : la figure 6 montre comment se fait le choix de l'hypothèse de meilleur score : pour chaque nœud, on extrait les temps min et max des frontières de tous les plans se situant sous le nœud considéré
(trois exemples sont proposés pour les nœuds A, B et C : Amin, Amax, Bmin, Bmax cm,n et cmax) Si l'une ou l'autre des bornes MIN ou MAX est située dans l'intervalle de validité c'est-à-dire dans l'intervalle de temps ou la durée du chapitre est correct par rapport aux contraintes temporelles, alors cette hypothèse de découpe pour le chapitre considéré est retenue, associée au score correspond au nœud considéré (score de A, de B ou de C pour l'exemple de la figure 6). Cette hypothèse de découpe est appelée hypothèse locale puisqu'elle représente une découpe possible d'un chapitre.
3. le parcours ci-dessus peut être itéré plusieurs fois, de manière à extraire plusieurs hypothèses locales de découpe, de telle sorte que la 1 re hypothèse ait le score le plus fort, la seconde ayant le score immédiatement inférieure, et ainsi de suite.
4. chaque hypothèse locale faite sur le 1er chapitre implique un nouvel intervalle de validité pour la fin du second chapitre, et donc de nouvelles hypothèses locales pour la fin du second chapitre. Ainsi, pour 5 hypothèses locales retenues pour le 1er chapitre, 25 hypothèses locales seront évaluées pour le second chapitre (5 nouvelles hypothèses locales de découpe pour le deuxième chapitre pour chacune des 5 hypothèses locales de découpe du 1er chapitre). Les hypothèses locales sont donc combinées pour former des hypothèses globales de découpages. Ces combinaisons ne sont cependant pas aléatoire puisqu'une hypothèse locale donnée ne peut pas être combinée à n'importe qu'elle autre. Elle est forcément combinée avec une hypothèse locale ayant permis de présumer un découpage d'un premier chapitre.
5. une liste d'hypothèses globales de découpe est construite, comprenant une découpe pour chaque chapitre : par exemple le 1er choix pour le 1er chapitre, le 2nd choix pour le 2ème chapitre, le 1er choix pour le 3ème chapitre...
Cette liste grossissant en O(nn), les inventeurs ont eu l'idée de limiter son grossissement : un nombre limité d'hypothèses locales par numéro de chapitre est imposé (5 pour le 1er, 5 pour le 2nd, 4 pour le 3ème, 4 pour le 4ème, 2 pour le 5ème .. 1 pour le neme si n > 10 par exemple)
6. chaque hypothèse globale est validée au niveau de son dernier chapitre celui-ci doit en effet vérifier également les contraintes de durée de chapitres. Si la contrainte n'est pas vérifiée, l'hypothèse globale correspondante est retirée de la liste d'hypothèses globales.
7. à chaque hypothèse globale (comprenant un nombre variable de chapitres 6 chapitres de 5 mn ou 5 chapitres de 6 mn sont potentiellement possibles), est attribué un score moyen (moyenne des scores de chaque découpe) 8. la liste d'hypothèses globales est triée suivant les scores moyens des hypothèses le score moyen le plus élevé correspondant à la meilleure séquence de découpes
Ainsi, l'extraction des hypothèses globales de découpe permet d'obtenir un ensemble d'hypothèses, classées par score, chaque score d'hypothèse globale étant la moyenne des distances moyennes des scènes qui compose chaque hypothèse locale de découpe
A ce stade, deux possibilités sont offertes : selon le premier mode de réalisation présenté en relation avec la figure 2A, on sélectionne immédiatement l'hypothèse globale présentant le score le plus élevé au sein de cette liste d'hypothèses globale et on procède au découpage du contenu multimédia en fonction des points de découpe associés aux hypothèses locales retenues dans l'hypothèse globale sélectionnée.
Selon le deuxième mode de réalisation présenté en relation avec la figure 2B, on procède à une vérification des hypothèses globales en fonction d'une segmentation audio préalablement à la sélection définitive d'une hypothèse globale 5 2 3 Validation ou reiet des hypothèses globale par analyse audio
L'ensemble des listes d'hypothèses globales, triées par score, est comparé à la segmentation audio. Cette segmentation audio différencie trois types de segments temporaux les silences, les segments de parole et ceux de non-parole Une liste d'hypothèses locales (c'est-à-dire une hypothèse globale) est validée si les hypothèses locales de découpe la constituant se situent dans des segments de type non-parole, d'une durée supérieure à TNP (paramètre de l'application). Le fait de prévoir que le temps de non parole au sein duquel une découpe est autorisée doit être supérieur au paramètre TNP (par exemple 10 secondes) permet d'être sur de ne pas couper au milieu d'un dialogue. Il est fréquent, en effet, que des dialogues contiennent des moments de silence Ces moments ne sont généralement pas longs, de l'ordre de quelques secondes tout au plus, mais il est nécessaire de ne pas découper à ces instants. Ainsi le paramètre TNP permet d'être sur que l'on ne coupera pas dans ces quelques secondes de silence au milieu du dialogue.
Il existe une exception dans le cas où la découpe se situe dans la 1ère seconde d'un segment de parole suivant un segment de non parole de durée supérieure à TNP (permet de gérer les dialogues en avance sur le changement de scène). En effet, les inventeurs ont constaté qu'il est fréquent qu'un dialogue débute préalablement à l'apparition de l'image Une telle caractéristique est par exemple vérifiée dans des contenus de type « série télévisée ». Dès lors, il ne faut pas écarter une hypothèse de découpe au motif que celle-ci débute dans un dialogue. Il y a heu, au contraire, de rechercher si un segment de type non parole n'est pas présent par exemple une seconde avant l'instant de découpe proposé par l'hypothèse locale si cela est le cas, la découpe sera alors faite une seconde avant l'instant qui avait été prévu dans l'hypothèse locale
La première liste d'hypothèses validée par l'analyse audio est finalement retenue Dans le cas où aucune liste n'est validée par l'analyse audio, c'est la liste au score le plus important qui est retenue, indépendamment de l'analyse audio

Claims

REVENDICATIONS
1. Procédé de découpage, en au moins deux chapitres, d'un contenu multimédia comprenant au moins un flux vidéo, caractérisé en ce qu'il comprend : - une phase de segmentation dudit au moins un flux vidéo en une pluralité de plans définissant des scènes ; une phase d'analyse de ressemblances entre des scènes, associant au moins une information de proximité à au moins deux scènes considérées ; une phase de construction d'hypothèses de découpage en chapitres dudit flux vidéo en fonction desdites informations de proximité desdites scènes et d'au moins une contrainte temporelle de découpage prédéterminée, laquelle définit au moins une information caractérisant la durée d'un chapitre ; une phase de construction desdits chapitres, en fonction desdites hypothèses de découpage.
2. Procédé de découpage selon la revendication 1 , caractérisé en ce que ladite phase d'analyse de ressemblances comprend une étape de construction d'un arbre de ressemblance comprenant une hiérarchie de scènes construite par fusion de scènes similaires ; et en ce que ladite phase de construction d'hypothèses de découpage en chapitres comprend une étape de création d'au moins une hypothèse globale de découpage dudit contenu multimédia en fonction dudit arbre de ressemblance et en fonction de ladite au moins une contrainte temporelle de découpage prédéterminée, ladite au moins une hypothèse globale de découpage comprenant une pluralité d'hypothèses locales de découpage en chapitres et en ce que ladite phase de construction desdits chapitres comprend une étape de sélection d'au moins une hypothèse globale de découpage parmi lesdites hypothèses de découpage construites.
3. Procédé de découpage selon la revendication 1 , caractérisé en ce que ladite au moins une contrainte temporelle de découpage prédéterminée comprend au moins une durée maximum d'un chapitre dudit contenu multimédia et/ou au moins une durée minimum d'un chapitre dudit contenu multimédia.
4. Procédé de découpage selon la revendication 1, caractérisé en ce qu'il comprend en outre une phase de vérification de la validité de ladite au moins une hypothèse globale de découpage en chapitres dudit flux vidéo par rapport à une segmentation d'au moins un flux audio dudit contenu multimédia.
5. Procédé de découpage selon la revendication 2, caractérisé en ce que ladite étape de construction dudit arbre de ressemblance comprend : une étape de détermination d'au moins deux descripteurs pour au moins deux plans de ladite pluralité de plans ; - une étape de calcul d'une distance entre les descripteurs d'au moins deux plans ; une étape de fusion desdits plans présentant une distance minimum, formant une scène ; une étape d'insertion de ladite scène au sein dudit arbre de ressemblance.
6. Procédé de découpage selon la revendication 5, caractérisé en ce que ladite étape de détermination des descripteurs desdits plans de ladite pluralité de plans comprend, pour un plan courant : une étape de sous-échantillonage dudit plan courant en une pluralité d'images représentatives dudit plan courant ; - une étape de calcul d'au moins un descripteur pour au moins certaines desdites images de ladite pluralité d'images ; une étape de fusion dudit au moins un descripteur calculé, délivrant un descripteur dudit plan courant.
7. Procédé de découpage selon la revendication 5, caractérisé en ce que ladite étape de fusion desdits plans tient compte d'une durée maximum entre deux plans à fusionner.
8. Procédé de découpage selon la revendication 5, caractérisé en ce que ledit descripteur est représentatif d'une distribution coloπmétrique d'une pluralité d'images composant un plan.
9. Procédé de découpage selon la revendication 2, caractérisé en ce que ladite étape de construction dudit arbre de ressemblance comprend au moins une itération des étapes suivantes : - calcul d'une distance entre au moins certaines desdites scènes dudit arbre de ressemblance ; regroupement de scènes de ladite pluralité de scènes au sein dudit arbre de ressemblance, en fonction desdites distances de scènes calculées de sorte que des scènes d'un niveau hiérarchique inférieur soient regroupées au sein d'une scène d'un niveau hiérarchique supérieur dans ledit arbre.
10. Procédé de découpage selon la revendication 9, caractérisé en ce que ladite étape de construction dudit arbre de ressemblance prend fin lorsque ladite étape de regroupement de scène délivre une unique scène pour l'ensemble du flux vidéo.
11. Procédé de découpage selon l'une quelconque des revendications 2 à 4, caractérisé en ce que ladite phase de construction d'hypothèses de découpage en chapitres comprend : une étape de recherche, au sein de l'arbre de ressemblance, d'une pluralité d'hypothèses locales de découpage dudit flux, lesdites hypothèses locales de découpage respectant unitairement ladite au moins une contrainte temporelle de découpage ; une étape de combinaison desdites hypothèses locales de découpage formant ladite au moins une hypothèse globale de découpage ; une étape d'insertion de ladite au moins une hypothèse globale de découpage dans une liste d'hypothèses globales regroupant lesdites hypothèses globales.
12. Dispositif de découpage en chapitres d'un contenu multimédia comprenant au moins un flux vidéo caractérisé en ce qu'il comprend : - des moyens de segmentation dudit au moins un flux vidéo en une pluralité de plans définissant des scènes ; des moyens d'analyse de ressemblances entre des scènes, associant au moins une information de proximité à au moins deux scènes considérées ; des moyens de construction d'hypothèses de découpage en chapitres dudit flux vidéo en fonction desdites informations de proximité desdites scènes et d'au moins une contrainte temporelle de découpage prédéterminée, laquelle définit au moins une information caractérisant la durée d'un chapitre ; des moyens de construction desdits chapitres, en fonction desdites hypothèses de découpage.
13. Programme d'ordinateur caractérisé en ce qu'il comprend des instructions de code de programme pour la mise en œuvre du procédé de découpage selon la revendication 1, lorsque ce programme est exécuté par un processeur.
EP09760211A 2008-11-13 2009-10-26 Procede de decoupage de contenu multimedia, dispositif et programme d'ordinateur correspondant Ceased EP2353163A1 (fr)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
FR0857722 2008-11-13
PCT/FR2009/052050 WO2010055242A1 (fr) 2008-11-13 2009-10-26 Procede de decoupage de contenu multimedia, dispositif et programme d'ordinateur correspondant

Publications (1)

Publication Number Publication Date
EP2353163A1 true EP2353163A1 (fr) 2011-08-10

Family

ID=40474773

Family Applications (1)

Application Number Title Priority Date Filing Date
EP09760211A Ceased EP2353163A1 (fr) 2008-11-13 2009-10-26 Procede de decoupage de contenu multimedia, dispositif et programme d'ordinateur correspondant

Country Status (2)

Country Link
EP (1) EP2353163A1 (fr)
WO (1) WO2010055242A1 (fr)

Families Citing this family (4)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
EP2408190A1 (fr) * 2010-07-12 2012-01-18 Mitsubishi Electric R&D Centre Europe B.V. Détection de limites vidéo sémantiques
EP2642487A1 (fr) * 2012-03-23 2013-09-25 Thomson Licensing Segmentation vidéo à multigranularité personnalisée
BR112015021139A2 (pt) * 2013-03-08 2017-07-18 Thomson Licensing método e aparelho para segmentação automática de vídeo
FR3099674B1 (fr) * 2019-08-03 2022-04-08 Synchronized Procede et appareil d’enrichissement de contenu multimedia par des meta-informations

Family Cites Families (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
WO2000045603A1 (fr) * 1999-01-29 2000-08-03 Sony Corporation Procede de traitement des signaux et dispositif de traitement de signaux video/vocaux
US7224892B2 (en) * 2001-06-26 2007-05-29 Canon Kabushiki Kaisha Moving image recording apparatus and method, moving image reproducing apparatus, moving image recording and reproducing method, and programs and storage media
US7296231B2 (en) * 2001-08-09 2007-11-13 Eastman Kodak Company Video structuring by probabilistic merging of video segments

Non-Patent Citations (2)

* Cited by examiner, † Cited by third party
Title
None *
See also references of WO2010055242A1 *

Also Published As

Publication number Publication date
WO2010055242A1 (fr) 2010-05-20

Similar Documents

Publication Publication Date Title
EP0406074B1 (fr) Procédé de segmentation du champ de mouvement d&#39;une image pour le codage d&#39;images vidéo
US9813784B1 (en) Expanded previously on segments
EP3225027B1 (fr) Procédé de composition d&#39;une représentation vidéo intermédiaire
EP2353163A1 (fr) Procede de decoupage de contenu multimedia, dispositif et programme d&#39;ordinateur correspondant
WO2008074877A1 (fr) Procede de creation d&#39;un nouveau sommaire d&#39;un document audiovisuel comportant deja un sommaire et des reportages et recepteur mettant en œuvre le procede
EP2524324B1 (fr) Procede de navigation parmi des identificateurs places dans des zones et recepteur mettant en oeuvre le procede
EP3378232B1 (fr) Procédé de traitement de données codées, procédé de réception de données codées, dispositifs, et programmes d&#39;ordinateurs associés
FR2815151A1 (fr) Procede de recherche d&#39;images dans un film et dispositif faisant application dudit procede
WO2009081016A1 (fr) Procede d&#39;analyse d&#39;un contenu multimedia, produit programme d&#39;ordinateur et dispositif d&#39;analyse correspondants
EP3245794A1 (fr) Procédé de transmission d&#39;un flux de données utilisant un protocole de diffusion en direct
FR3053555A1 (fr) Procede de codage d&#39;une image numerique, procede de decodage, dispositifs, terminal et programmes d&#39;ordinateurs associes
Furini et al. On using clustering algorithms to produce video abstracts for the web scenario
EP1182878A1 (fr) Système de communication, émetteur, récepteur, méthode utilisant un descripteur de stockage de données
EP1343327B1 (fr) Procédé pour effectuer un traitement sur un contenu multimedia
EP2401700B1 (fr) Traitement d&#39;un flux de données numériques
WO2018114108A1 (fr) Procede d&#39;enregistrement d&#39;un programme telediffuse a venir
FR2816793A1 (fr) Dispositif de traitement d&#39;information multimedia
EP4078959B1 (fr) Procede d&#39;encodage d&#39;une image numerique en vue de sa compression
EP4564823A1 (fr) Passerelle pour encodage local de contenus de télévision numérique terrestre en segments de contenus adaptatifs sur http (has)
EP2145499B1 (fr) Procédé de fourniture de services personnalisés à un terminal par un réseau visité
Gan et al. A Zero Decoding Approach to Video Classification
WO2010089488A1 (fr) Procède de fusion de segments de programmes audiovisuels, dispositif, et produit programme d&#39;ordinateur correspondant
EP1209614A1 (fr) Procédés de partition d&#39;un ensemble d&#39;objets et procédé de recherche dans une partition d&#39;un ensemble d&#39;objets
WO2017093467A1 (fr) Procede de gestion de contenus video pour leur edition selectionnant des moments ponctuels et utilisant des modeles adaptifs automatisables
WO2013014290A1 (fr) Procédé de codage d&#39;une image après redimensionnement par suppression de pixels

Legal Events

Date Code Title Description
PUAI Public reference made under article 153(3) epc to a published international application that has entered the european phase

Free format text: ORIGINAL CODE: 0009012

17P Request for examination filed

Effective date: 20110601

AK Designated contracting states

Kind code of ref document: A1

Designated state(s): AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC MK MT NL NO PL PT RO SE SI SK SM TR

RIN1 Information on inventor provided before grant (corrected)

Inventor name: BERRANI, SID, AHMED

Inventor name: BESSET, BENOIT

Inventor name: LECHAT, PATRICK

RIN1 Information on inventor provided before grant (corrected)

Inventor name: LECHAT, PATRICK

Inventor name: BESSET, BENOIT

Inventor name: BERRANI, SID, AHMED

DAX Request for extension of the european patent (deleted)
RAP1 Party data changed (applicant data changed or rights of an application transferred)

Owner name: ORANGE

17Q First examination report despatched

Effective date: 20140328

REG Reference to a national code

Ref country code: DE

Ref legal event code: R003

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE APPLICATION HAS BEEN REFUSED

18R Application refused

Effective date: 20180405