EP1839213A1 - Procede de generation d'index textuel a partir d'une annotation vocale - Google Patents

Procede de generation d'index textuel a partir d'une annotation vocale

Info

Publication number
EP1839213A1
EP1839213A1 EP06704145A EP06704145A EP1839213A1 EP 1839213 A1 EP1839213 A1 EP 1839213A1 EP 06704145 A EP06704145 A EP 06704145A EP 06704145 A EP06704145 A EP 06704145A EP 1839213 A1 EP1839213 A1 EP 1839213A1
Authority
EP
European Patent Office
Prior art keywords
images
vocabulary
voice
context
annotation
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Withdrawn
Application number
EP06704145A
Other languages
German (de)
English (en)
Inventor
Delphine Charlet
Michel Plu
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Orange SA
Original Assignee
France Telecom SA
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by France Telecom SA filed Critical France Telecom SA
Publication of EP1839213A1 publication Critical patent/EP1839213A1/fr
Withdrawn legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/50Information retrieval; Database structures therefor; File system structures therefor of still image data
    • G06F16/58Retrieval characterised by using metadata, e.g. metadata not derived from the content or metadata generated manually
    • G06F16/5866Retrieval characterised by using metadata, e.g. metadata not derived from the content or metadata generated manually using information manually generated, e.g. tags, keywords, comments, manually generated location and time information
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/50Information retrieval; Database structures therefor; File system structures therefor of still image data

Definitions

  • the field of the invention is that of image management. More specifically, the invention relates to a technique for producing and associating textual indexes (also called textual annotations) to images.
  • the invention applies in particular, but not exclusively, to the association of textual indexes with an image or a video sequence taken by a portable electronic device such as a digital camera, a digital video camera, a mobile telephone or a handheld computer. .
  • descriptor indexes (hereinafter also referred to as descriptor elements) are used to facilitate the management of these many images. Two methods of description are known in the state of the art for producing and associating descriptor indexes with images.
  • the "objective" description by image analysis is a first method
  • This first method also allows the recognition of person or monument contained in a reference dictionary, and thus, if necessary to obtain the corresponding descriptor indexes.
  • the "intentional" description by textual or vocal annotation is a second method according to which the user annotates a photograph so as to declare that which seems to be the most relevant and / or what may be missing from the image, for example a relationship, the age of a person, etc. It is well known in the prior art that the "intentional” description can be used as a complementary mode of the "objective” description. These description methods, used alone or in combination, have been an important advance in the descriptor element and image management mechanism. However, they have a number of disadvantages.
  • the user may not remember what has been photographed, for example the name of a particular monument.
  • the person who ranks the photos in the digital album may not be the user who made the different shots, so this person does not necessarily know the exact content of each photo and can by therefore produce irrelevant or erroneous textual annotations.
  • an objective of the invention is to provide a technique for generating reliable textual indexes, based on voice annotations, which is simple and effective to implement, especially in terms of defining the vocabulary to be recognized by a user. voice recognition performed on these voice memos.
  • the invention also aims to provide such a technique which, in at least one embodiment, is inexpensive and compatible with all existing digital cameras.
  • a method of generating at least one text index associated with a set of images comprising at least one image, starting from at least one voice annotation previously associated with said set of images, said method comprising a voice recognition step applied to said at least one voice annotation with a predetermined recognizable vocabulary, so as to perform a search in said at least one voice annotation of at least one word contained in said vocabulary to be recognized, the one or more words identified during the search forming said text index.
  • a method advantageously comprises a step of defining said vocabulary to be recognized, which itself comprises the following steps: definition of a context; search in a linguistic system of a list of words associated with said context and forming said vocabulary to be recognized.
  • the invention is based on an entirely new and inventive approach to the definition of the vocabulary to be recognized. Indeed, this definition of the vocabulary to be searched is done automatically, from a context.
  • the present invention covers both the case in which one or more word (s) of the vocabulary to be recognized can (wind) be identified in the vocal annotation, that the case in which no word of the vocabulary to recognize is present (and therefore could not be identified) in the voice annotation.
  • said set of images comprises at least one photo and / or at least one video sequence.
  • said context comprises at least one context element belonging to the group comprising: at least one information relating to said set of images, provided by at least one user through a man / machine interface; at least one piece of information relating to the geographical position of the place of shooting of said set of images, provided by a location device; at least one information relating to said set of images, resulting from the processing of said set of images by an image analysis module; at least one user profile comprising at least one profile information relating to a user; at least one piece of information understood in a default context.
  • a context element is information relating to the set of images (for example a photo) coming from a software tool, from the creator (photographer) or from any other user having knowledge of the existence of this Photo.
  • contextual information of different natures can be combined to provide an even more precise context.
  • context we mean for example the first names and / or the most common surnames. In this case, in the absence of any other context element, we use this default context which makes it possible to search among the given names and / or common names.
  • said method comprises a step of selecting a language model according to at least one context element of said context, and in that said voice recognition step is performed in transcription mode, with the language model selected.
  • the invention also relates to a computer program product comprising program code instructions for executing the steps of the aforementioned method, when said program is executed on a computer.
  • the invention further relates to a storage medium, possibly totally or partially removable, readable by a computer, storing a set of instructions executable by said computer to implement the above method.
  • the invention also relates to a device for generating at least one text index associated with a set of images comprising at least one image, from at least one voice annotation previously associated with said set of images, comprising means for defining said vocabulary to be recognized, including themselves:
  • the invention also relates to an apparatus for recording images and recording associated voice annotations, comprising the device for generating at least one aforementioned text index.
  • the invention also relates to an apparatus for managing / viewing images and recording associated voice annotations, comprising the device for generating at least one aforementioned text index. 5.
  • FIG. 1 shows a functional chain for generating textual indexes of a particular embodiment of the generation method of the invention
  • FIG. 2 represents a flowchart of a particular embodiment of the generation method of the invention
  • FIG. 3 presents the structure of a particular embodiment of a device for generating textual indexes according to the invention
  • FIG. 4 shows the structure of a particular embodiment of an image taking apparatus according to the invention
  • FIG. 5 shows the structure of a particular embodiment of an image management / vision apparatus according to the invention.
  • the general principle of the invention is based on a technique for automatically generating a vocabulary to be recognized (from a context), used to identify by voice recognition applied to a voice annotation of the keywords or expressions, so as to generate a textual index associated with an image.
  • the automatic production technique of a vocabulary to be recognized according to the invention can notably make different context-element-providing modules coexist. Such a technique can notably use in parallel and / or jointly several context elements of identical and / or distinct natures to provide a vocabulary to be recognized more precisely.
  • This method of generating textual indexes according to the invention makes for example a language system comprising a lexicon and a semantic network.
  • a voice recognition module 12 receives: on a first input, a voice annotation 15 associated with a photo 14
  • a vocabulary 17 to recognize on a second input, a vocabulary 17 to recognize, so as to allow searching in the voice annotation 15 of the words contained in the vocabulary to recognize, then automatically generate a textual index 16 which will be associated with this photo.
  • the vocabulary to be recognized 17 is automatically generated by a generation module 11 which receives the picture 14 as input.
  • This generation module of the vocabulary to be recognized 11 comprises several modules for providing context elements, among which one finds an image processing module 111, a textual input module 112, a geographic location module 113 (for example of the GPS type), and a user profile management module 116.
  • This module 11 also comprises a data module. extraction of the vocabulary to be recognized 114 which receives the aforementioned contextual elements and questions according to these a linguistic system 115.
  • the linguistic system 115 thus receives as input a set of context elements (themes) specific to a photo or a series of photos.
  • the context elements are themes entered by the user.
  • a theme for example "Pink Granite Coast”
  • search the linguistic system for the vocabulary for the vocabulary (tourist in this example) associated with this theme.
  • the linguistic system 115 searches from these contextual elements the language used by the user.
  • this system looks for each element of context in a data structure specific to this language, also called lexicon.
  • Each lexicon is composed of words associated with concepts.
  • the set of words corresponds to all inflected forms of language, place nominations, monuments, or any geographical element such as rivers, rivers.
  • These elements and nominations are for example defined in a thesaurus such as the TGN (Getty Thesaurus of geography names) (see www.getty.edu/research/tools/vocabulary/tgn/).
  • the linguistic system 115 searches, for each concept associated in the lexicon to each context element, the neighboring concepts in a data structure called semantic network.
  • This semantic network connects concepts by typed relationships. These relationships can be, for example, synonymy, composition, geographic inclusion or other relationships. By definition, a concept is said to be close to another if there is a relationship between them.
  • the linguistic system 115 then returns the set of associated words in the lexicon to each of these neighboring concepts.
  • the vocabulary to be searched is then composed of the words returned by the linguistic system 115 (including the context elements entered by the user) for each set of context elements entered by a user. It should be noted that several of these sets can be associated with the same picture if several users have produced context elements for this photo.
  • the theme of the photo series is coupled with information resulting from the analysis of the photo by the image processing module 111. For example, the user has made many photos all over Brittany, and when he returns the theme Brittany in its indexing application, the language system generates a vocabulary too large to allow speech recognition with satisfactory performance (tens of thousands of entrances, between religious heritage, prehistoric, maritime, daunting, landscape).
  • the image analysis module 111 recognizes a church in the picture and the linguistic system 115 is then restricted (by the extraction module 114) to the only list of the remarkable churches of Brittany, of more reasonable size for the speech recognition .
  • the image analysis module 111 recognizes that there is a person in the photo, and the application (and more specifically the extraction module 114) also launches voice search for first names or familiar names, in a list that can be either generic (ie the 2000 most common first names, as well as the names of family links (mom, dad, etc) is personalized by the user, a combination of both, so that the application will be able to produce, by rotating the voice recognition module 12 in keyword detection mode on the vocabulary of the churches and on the first names, starting from the vocal annotation: "that it is Patrick in front of Brissevenez ", the textual indexes:" Patrick, Brissevenez ".
  • the application having knowledge that the photo contains a person and a church, uses a language model defined specifically for the theme (person, place) and allows the recognition module 12 to produce the written transcript of the entire vocal annotation: "That's Patrick in front of Brissevenez".
  • the application has a profile of the user (names of his relatives, hobbies, vocabulary of text annotations of previously indexed photos), provided by the management module of user profiles 116, and generates the vocabulary to search according to this profile.
  • the extraction module 114 interrogates the linguistic system 115 with a theme (for example "the pink granite coast") but imposing a geographical restriction resulting from a piece of information. position given for example by a GPS function available on some cameras.
  • a theme for example "the pink granite coast”
  • FIG. 2 illustrates the sequential sequence of the different steps in a particular embodiment of the method according to the invention.
  • a shooting phase comprises a first step 20, during which the user takes a picture by means of an electronic device having both "digital pictures” and “voice annotations” functions.
  • a voice recording phase comprises a step 21, during which the user records a voice annotation using the apparatus used in step 20.
  • the following steps relate to a definition phase of the vocabulary to be recognized.
  • context elements are defined from one or more information that can be provided directly by the user himself (via a human / machine interface 112 of the microphone, keyboard, etc. type). a positioning system of the GPS type 113, or by an image processing module 111 (information relating to an image analysis), a user profile management module 116, etc.
  • step 23 the language used by the user is searched from at least one of these context elements.
  • step 24 a list of words associated with the context elements is searched in an appropriate linguistic system 115, so as to establish a vocabulary to be recognized.
  • the next step is related to a phase of generating textual indexes.
  • the voice activity of the user is processed by voice recognition means 12, so as to perform a search in the voice annotation previously recorded in step 21 of words or expressions contained in the vocabulary to be recognized. Words or phrases identified during the search form the textual index.
  • FIG. 3 shows the structure of a text index generation device 32 according to the invention, which comprises a memory 322, and a processing unit 321 equipped with a microprocessor ⁇ P, which is controlled by a computer program (or application) 323 implementing the method according to the invention.
  • the processing unit 321 receives as input a voice annotation 31 associated with a set of images.
  • the microprocessor ⁇ P processes this voice annotation, according to the instructions of the program 323, to generate textual indexes 33 representative of the words identified in the voice annotation.
  • FIG. 4 shows the structure of an image taking apparatus 41 according to the invention, which comprises the text index generating device 32 described in FIG. 3, and an image taking unit 411 equipped with an image sensor Ci, which cooperates with a voice recording unit 412.
  • the image pickup unit 411 receives a signal representative of an image 42 captured by the image sensor Ci
  • the image unit voice record 412 receives a signal representative of a voice annotation 43.
  • These two signals are transmitted to the text index generator 32, which first analyzes the signal representative of an image and then uses the representative signal a voice annotation, so as to automatically produce relevant textual indexes.
  • FIG. 5 shows the structure of an image management / vision apparatus 51 according to the invention, which comprises the text index generating device 32 described in FIG. 3, and a management unit / image view. 511, which cooperates with a voice recording unit 512.
  • the management unit / image view 511 captures an image 52 in a given context, the voice recording unit 512 receives a voice annotation 53 associated with this image .
  • These two pieces of information are transmitted to the text index generating device 32, which initially analyzes the captured image, then performs a voice recognition in the voice annotation, so as to produce textual indexes representative of the words identified in the text. voice annotation.
  • the invention proposes a method for generating a text index associated with at least one image from a voice annotation, recorded by means of an image management / viewing apparatus or a video recording device.
  • digital shooting equipped with a voice memo recorder This method has many advantages, including that of automatically defining a vocabulary to be recognized from a context (for example a theme entered by the user, a GPS data, a user profile, an image analysis, etc.). , so as to perform a search in the voice annotation of words or phrases contained in such a vocabulary to recognize.

Landscapes

  • Engineering & Computer Science (AREA)
  • Theoretical Computer Science (AREA)
  • Data Mining & Analysis (AREA)
  • Databases & Information Systems (AREA)
  • Physics & Mathematics (AREA)
  • General Engineering & Computer Science (AREA)
  • General Physics & Mathematics (AREA)
  • Library & Information Science (AREA)
  • Information Retrieval, Db Structures And Fs Structures Therefor (AREA)

Abstract

L'invention concerne un procédé de génération d'un index textuel (16) associé à des images à partir d'une annotation vocale (15). Selon l'invention, un tel procédé comprend une étape de reconnaissance vocale (25) appliquée à l'annotation vocale (15) avec un vocabulaire à reconnaître (17) prédéterminé, de façon à effectuer une recherche dans l'annotation vocale (15) d'au mo ins un mot contenu dans le vocabulaire à reconnaître (17), le ou les mots identifiés au cours de la recherche formant l'index textuel (16). L'invention comprend en outre une étape de définition du vocabulaire à reconnaître, comprenant elle-même une étape de définition (22) d'un contexte et une étape de recherche (24) dans un système linguistique d'une liste de mots associés au contexte et formant le vocabulaire à reconnaître (17).

Description

PROCEDE DE GENERATION D' INDEX TEXTUEL A PARTIR D' UNE ANNOTATION VOCALE
1. Domaine de l'invention
5 Le domaine de l'invention est celui de la gestion d'images. Plus précisément, l'invention concerne une technique permettant de produire et d'associer des index textuels (aussi appelés annotations textuelles) à des images. L'invention s'applique notamment, mais non exclusivement, à l'association d'index textuels à une image ou une séquence vidéo prise par un appareil 10 électronique portable du type appareil photo numérique, caméscope numérique, téléphone mobile ou encore ordinateur de poche.
2. Solutions et inconvénients de l'art antérieur
De façon générale, la photo numérique a profondément modifié l'accès à l'image. En effet la multiplication des appareils électroniques disposant d'une
15 fonction « prise de vue numérique » et le coût nul associé à chaque prise de vue ont entraîné la prolifération des photos numériques. Actuellement, de plus en plus d'usagers possèdent un appareil de prise de vue numérique leur permettant de réaliser et de stocker une grande quantité d'images dans une mémoire amovible ou intégrée dans l'appareil.
20 Généralement, des index descripteurs (aussi appelés par la suite éléments descripteurs) sont utilisés pour faciliter la gestion de ces nombreuses images. On connaît, dans l'état de la technique, deux méthodes de description permettant de produire et d'associer des index descripteurs à des images.
La description « objective » par analyse d'image est une première méthode
25 selon laquelle l'analyse d'une image permet de fournir des éléments descripteurs, par exemple de type portrait, paysage de compagne, mer, montagne, etc. Cette première méthode permet en outre la reconnaissance de personne ou de monument contenus dans un dictionnaire de références, et donc, le cas échéant d'obtenir les index descripteurs correspondants.
30 La description « intentionnelle » par annotation textuelle ou vocale est une seconde méthode selon laquelle l'usager annote une photo de façon à déclarer ce qui lui semble être le plus pertinent et/ou ce qui peut être absent de l'image, par exemple un lien de parenté, l'âge d'une personne, etc. Il est bien connu de l'art antérieur que la description « intentionnelle » peut être utilisée comme un mode complémentaire de la description « objective ». Ces méthodes de description, utilisées seules ou en combinaison, ont représenté un progrès important dans le mécanisme de production d'éléments descripteurs et de gestion d'images. Cependant, ils présentent un certain nombre d'inconvénients.
Tout d'abord, la description « objective » par analyse d'image permet uniquement de générer des index descripteurs concernant le contenu strict de la photo, sans autre information.
Un autre inconvénient de cette première méthode connue, réside dans le fait que les performances en reconnaissance de visages, monuments, etc. sont encore assez limitées. Contrairement à la description « objective » par analyse d'image, la description « intentionnelle » par annotation est une technique de production d'index descripteurs permettant d'acquérir et de fournir des annotations relatives aux détails et/ou au sens donné par l'usager à des images numériques.
Néanmoins, lorsqu'une annotation textuelle est réalisée à peu près simultanément à la prise de vue, l'ergonomie de cette seconde méthode connue est limitée par le fait que l'utilisateur doit, dans les conditions de la prise de photo qui sont parfois inconfortables et difficiles (temps de pluie, neige, etc.), entrer manuellement au moyen d'un clavier alphanumérique, généralement de petite taille, son annotation. En revanche, lorsqu'une annotation textuelle est réalisée postérieurement à la prise de vue, par exemple au moment où un usager classe ses multiples photos dans un album numérique au moyen d'un ordinateur personnel, cette méthode ne favorise pas forcément l'intelligibilité en terme de connaissance du contenu de chaque photo et du nombre de photo à indexer. En effet, ce classement pouvant se faire longtemps après la prise de vue, l'usager est contraint de regarder chaque photo pour déterminer son contenu et produire son annotation textuelle. Par ailleurs, l'usager peut ne pas se souvenir de ce qui a été photographié, par exemple le nom d'un monument particulier. En outre, la personne qui effectue le classement des photos dans l'album numérique peut ne pas être l'usager qui a réalisé les différents clichés, de ce fait cette personne n'a pas forcément connaissance du contenu exact de chaque photo et peut par conséquent produire des annotations textuelles non pertinentes ou erronées.
Pour remédier à ces problèmes, il est traditionnellement envisagé d'utiliser une description « intentionnelle » par annotations vocales. Ceci permet par exemple à un usager d'enregistrer, juste après une prise de vue, une phrase au moyen d'un microphone embarqué dans un appareil de type téléphone mobile, appareil photo numérique, etc.
Ainsi, l'usager sait ce qu'il vient de photographier, et l'enregistrement d'une annotation vocale est une tâche beaucoup plus simple et ergonomique que l'entrée d'une annotation textuelle. La difficulté est cependant déplacée dans l'exploitation de ces annotations vocales. En effet, il ne suffit pas de stocker des annotations vocales associées aux photos, mais il faut produire des index textuels à partir des ces annotations vocales.
Il faut donc pour cela effectuer de la reconnaissance vocale sur chaque annotation vocale, pour transcrire l'annotation vocale toute entière ou uniquement un ou plusieurs mots-clés contenus dans celle-ci. Plusieurs modes peuvent être envisagés pour effectuer cette reconnaissance vocale.
Parmi ces modes de traitement, on trouve :
- un mode « indexation phonétique » tel que décrit notamment dans la publication suivante : Ferrieux, A. & Peillon, S. : « Phoneme-level indexing for fast and vocabulary independent voice/voice retrieval » (ou « Indexation phonétique rapide et récupération de vocabulaire vocale » en français), ESCA ETRW workshop on Accessing information in Spoken Audio, Cambridge, Angleterre, 19-20 avril 1999, pp. 60-63 ;
- un mode « détection de mot-clé » tel que décrit notamment dans la publication suivante : Rosé, R.C., Paul,D.B. : « A Hidden Markov- Model based keyword récognition System » (ou « dispositif de reconnaissance de mots-clés basé sur un modèle de Markov » en français), ICASSP 1990, pp. 129-132 ; et - un mode « transcription oral-écrit » tel que décrit notamment dans la publication suivante : Makhoul et al., « Speech and Languages technologies for audio indexing and retrieval » (ou « Technologies vocales et de langages pour indexation et récupération sonore » en français), Proceedings of the IEEE, vol.88, n.8, août 2000, pp.1338- 1353.
La technique actuelle de génération d'index textuels à partir d'annotations vocales, par application d'une reconnaissance vocale à ces annotations vocales, présente des inconvénients.
En effet, en mode « indexation phonétique », comme en mode « détection de mot-clé », il est indispensable de définir les mots ou expressions que l'on recherche (que l'on appelle aussi vocabulaire recherché). Par ailleurs, en mode « transcription oral-écrit », il est en outre nécessaire de définir le modèle complet du vocabulaire (et relations entre les mots du vocabulaire, appelé modèle de langage) que l'on souhaite transcrire. Comme les performances de la reconnaissance vocale sont dépendantes de la taille du vocabulaire à reconnaître, il n'est pas réaliste de rechercher dans les annotations vocales « tous les mots possibles », si tant est qu'une telle liste existe. L'usager qui souhaite exploiter ses annotations vocales (pour générer des index textuels par reconnaissance vocale) est contraint d'établir, pour chaque annotation vocale, une liste de mots-clés ou d'expressions qu'il recherche (ou plus précisément que la reconnaissance vocale recherche) dans l'annotation. En d'autres termes, l'usager doit définir lui-même, pour chaque annotation vocale, un vocabulaire à reconnaître dans cette annotation vocale.
L'inconvénient de cette solution actuelle est qu'il s'agit d'une tâche qui peut s'avérer extrêmement fastidieuse et qui a une limite intrinsèque : l'usager ne peut retrouver dans son annotation que des mots-clés qu'il recherche. Par ailleurs, cette recherche se faisant postérieurement à la prise de vue, l'usager peut avoir oublié les noms précis des monuments qu'il a photographiés
(ou ignorer quels monuments ont été photographiés si la personne qui effectue le classement n'est pas celle qui a pris les photos). En conséquence, il ne pourra pas faire rechercher ces noms précis par la reconnaissance vocale.
En outre, et en particulier pour les raisons exposées ci-dessus, cette méthode de production d'index textuels à partir d'annotations vocales n'est pas optimale.
3. Objectifs de l'invention L'invention a notamment pour objectif de pallier ces inconvénients de l'art antérieur. Plus précisément, un objectif de l'invention est de fournir une technique de génération d'index textuels fiables, à partir d'annotations vocales, qui soit simple et efficace à mettre en œuvre, notamment en terme de définition du vocabulaire à reconnaître par une reconnaissance vocale effectuée sur ces annotations vocales.
Un autre objectif de l'invention est de fournir une telle technique, qui soit ergonomique et supprime, ou tout le moins limite, les opérations de saisie manuelle devant être effectuées par l'utilisateur pour définir le vocabulaire à reconnaître par la reconnaissance vocale. Encore un autre objectif de l'invention est de fournir une telle technique, qui soit notamment bien adaptée aux usagers souhaitant, ultérieurement à la prise de vue, rechercher et/ou trier aisément une multitude d'images, sans devoir se souvenir du contenu exact de chaque image.
L'invention a également pour objectif de fournir une telle technique qui, dans au moins un mode de réalisation, soit peu coûteuse et compatible avec tous les appareils de prise de vues numériques existants.
4. Résumé de l'invention
Ces objectifs, ainsi que d'autres qui apparaîtront par la suite, sont atteints à l'aide d'un procédé de génération d'au moins un index textuel associé à un ensemble d'images comprenant au moins une image, à partir d'au moins une annotation vocale préalablement associée audit ensemble d'images, ledit procédé comprenant une étape de reconnaissance vocale appliquée à ladite au moins une annotation vocale avec un vocabulaire à reconnaître prédéterminé, de façon à effectuer une recherche dans ladite au moins une annotation vocale d'au moins un mot contenu dans ledit vocabulaire à reconnaître, le ou les mots identifiés au cours de la recherche formant ledit index textuel. Selon l'invention, un tel procédé comprend avantageusement une étape de définition dudit vocabulaire à reconnaître, comprenant elle-même les étapes suivantes : définition d'un contexte ; recherche dans un système linguistique d'une liste de mots associés audit contexte et formant ledit vocabulaire à reconnaître.
Ainsi, l'invention repose sur une approche tout à fait nouvelle et inventive de la définition du vocabulaire à reconnaître. En effet, cette définition du vocabulaire à rechercher s'effectue de façon automatique, à partir d'un contexte.
L'utilisateur est donc libéré de cette tâche fastidieuse. Il est à noter que si l'utilisateur peut être impliqué dans la définition du contexte (par exemple pour fournir un thème d'une série de photos), ce n'est pas obligatoire et en tout état de cause beaucoup moins contraignant que d'avoir à définir seul le vocabulaire à rechercher (cas de la technique actuelle).
Il est à noter que la présente invention couvre aussi bien le cas dans lequel un ou plusieurs mot(s) du vocabulaire à reconnaître peut(vent) être identifié(s) dans l'annotation vocale, que le cas dans lequel aucun mot du vocabulaire à reconnaître n'est présent (et n'a donc pu être identifié) dans l'annotation vocale.
En effet, c'est aussi un résultat de savoir qu'il n'y a aucun des mots du vocabulaire à reconnaître dans l'annotation vocale. Par ailleurs, lorsqu'un usager a au préalable enregistré et associé une annotation vocale à un ensemble de photos, les index textuels produits selon l'invention sont attribués à cet ensemble de photos.
Selon un aspect avantageux de l'invention, ledit ensemble d'images comprend au moins une photo et/ou au moins une séquence vidéo. De façon préférentielle, ledit contexte comprend au moins un élément de contexte appartenant au groupe comprenant : au moins une information relative audit ensemble d'images, fournie par au moins un utilisateur grâce à une interface homme/machine ; au moins une information relative à la position géographique du lieu de prise de vue dudit ensemble d'images, fournie par un dispositif de localisation ; au moins une information relative audit ensemble d'images, résultant du traitement dudit ensemble d'images par un module d'analyse d'image ; au moins un profil d'utilisateur comprenant au moins une information de profil relative à un utilisateur ; au moins une information comprise dans un contexte par défaut. De manière générale, un élément de contexte est une information relative à l'ensemble d'images (par exemple une photo) provenant d'un outil logiciel, du créateur (photographe) ou de tout autre usager ayant connaissance de l'existence de cette photo. En outre, des informations contextuelles de natures différentes peuvent être associées pour fournir un contexte encore plus précis.
Par contexte par défaut, on entend par exemple les prénoms et/ou les noms de famille les plus fréquents. Dans ce cas, en l'absence de tout autre élément de contexte, on utilise ce contexte par défaut qui permet de rechercher parmi les prénoms et/ou noms usuels.
De façon avantageuse, ledit procédé comprend une étape de sélection d'un modèle de langage en fonction d'au moins un élément de contexte dudit contexte, et en ce que ladite étape de reconnaissance vocale est effectuée en mode transcription, avec le modèle de langage sélectionné. L'invention concerne également un produit programme d'ordinateur comprenant des instructions de code de programme pour l'exécution des étapes du procédé précité, lorsque ledit programme est exécuté sur un ordinateur.
L'invention concerne en outre un moyen de stockage, éventuellement totalement ou partiellement amovible, lisible par un ordinateur, stockant un jeu d'instructions exécutables par ledit ordinateur pour mettre en œuvre le procédé précité. L'invention concerne encore un dispositif de génération d'au moins un index textuel associé à un ensemble d'images comprenant au moins une image, à partir d'au moins une annotation vocale préalablement associée audit ensemble d'images, comprenant des moyens de définition dudit vocabulaire à reconnaître, comprenant eux-mêmes :
- des moyens de définition d'un contexte ;
- des moyens de recherche dans un système linguistique d'une liste de mots associés audit contexte et formant ledit vocabulaire à reconnaître.
L'invention concerne également un appareil de prise d'images et d'enregistrement d'annotations vocales associées, comprenant le dispositif de génération d'au moins un index textuel précité.
L'invention concerne aussi un appareil de gestion/vision d'images et d'enregistrement d'annotations vocales associées, comprenant le dispositif de génération d'au moins un index textuel précité. 5. Liste des figures
D'autres caractéristiques et avantages de l'invention apparaîtront plus clairement à la lecture de la description suivante d'un mode de réalisation préférentiel, donné à titre de simple exemple illustratif et non limitatif, et des dessins annexés, parmi lesquels : - la figure 1 présente une chaîne fonctionnelle de génération d'index textuels d'un mode de réalisation particulier du procédé de génération de l'invention ; la figure 2 représente un organigramme d'un mode de réalisation particulier du procédé de génération de l'invention ; - la figure 3 présente la structure d'un mode de réalisation particulier d'un dispositif de génération d'index textuels selon l'invention ; la figure 4 présente la structure d'un mode de réalisation particulier d'un appareil de prise d'images selon l'invention ; et la figure 5 présente la structure d'un mode de réalisation particulier d'un appareil de gestion/vision d'images selon l'invention.
6. Description détaillée de l'invention Le principe général de l'invention repose sur une technique de production automatique d'un vocabulaire à reconnaître (à partir d'un contexte), utilisé pour identifier par reconnaissance vocale appliquée à une annotation vocale des mots- clés ou expressions, de façon à générer un index textuel associé à une image. La technique de production automatique d'un vocabulaire à reconnaître selon l'invention peut notamment faire cohabiter différents modules de fourniture d'élément de contexte. Une telle technique peut notamment utiliser en parallèle et/ou conjointement plusieurs éléments de contexte de natures identiques et/ou distinctes pour fournir un vocabulaire à reconnaître plus précis. Ce procédé de génération d'index textuels selon l'invention fait par exemple intervenir un système linguistique comprenant un lexique et un réseau sémantique.
Cette approche est notamment illustrée en figure 1.
De façon classique, on suppose qu'un module de reconnaissance vocale 12 reçoit : sur une première entrée, une annotation vocale 15 associée à une photo 14
(par exemple au moyen d'un appareil disposant à la fois de la fonction de prise de vues numériques et de prises d'annotations vocales associées) ; sur une seconde entrée, un vocabulaire à reconnaître 17, de façon à permettre la recherche dans l'annotation vocale 15 des mots contenus dans le vocabulaire à reconnaître, puis de générer automatiquement un index textuel 16 qui va être associé à cette photo.
Selon l'invention, le vocabulaire à reconnaître 17 est généré automatiquement par un module de génération 11 qui reçoit en entrée la photo 14. Ce module de génération du vocabulaire à reconnaître 11 comprend plusieurs modules de fourniture d'éléments de contexte, parmi lesquels on trouve un module de traitement d'image 111, un module de saisie textuelle 112, un module de localisation géographique 113 (par exemple de type GPS), et un module de gestion de profils utilisateurs 116. Ce module 11 comprend en outre un module d'extraction du vocabulaire à reconnaître 114 qui reçoit les éléments de contexte précités et interroge en fonction de ceux-ci un système linguistique 115. Le système linguistique 115 reçoit donc en entrée en ensemble d'éléments de contexte (thèmes) propre à une photo ou à une série de photos.
On décrit maintenant un premier exemple d'application du procédé selon l'invention, dans lequel les éléments de contexte sont des thèmes saisis par l'utilisateur. On suppose par exemple qu'à l'aide du module de saisie textuelle 112, l'utilisateur a entré un thème (par exemple « côte de Granit Rosé ») pour que l'application aille chercher dans le système linguistique le vocabulaire (touristique dans cet exemple) associé à ce thème.
Dans un premier temps, le système linguistique 115 recherche à partir de ces éléments de contexte la langue utilisée par l'usager.
Dans un second temps, ce système recherche chaque élément de contexte dans une structure de données spécifique à cette langue, aussi appelée lexique. Chaque lexique est composé de mots associés à des concepts. L'ensemble des mots correspond à l'ensemble des formes fléchies de la langue, des nominations de lieu, de monuments, ou tout élément géographique comme des rivières, fleuves. Ces éléments et nominations sont par exemple définis dans un thésaurus tel que le TGN (Getty Thésaurus of géographie names) (cf. www.getty.edu/research/tools/vocabulary/tgn/).
Le système linguistique 115 recherche ensuite, pour chaque concept associé dans le lexique à chaque élément de contexte, les concepts voisins dans une structure de données appelée réseau sémantique. Ce réseau sémantique relie les concepts par des relations typées. Ces relations peuvent être par exemple des relations de synonymies, de composition, d'inclusion géographique ou autre. Par définition, un concept est dit voisin d'un autre s'il existe une relation entre eux. Le système linguistique 115 retourne alors l'ensemble des mots associés dans le lexique à chacun de ces concepts voisins.
Le vocabulaire à rechercher est alors composé des mots retournés par le système linguistique 115 (y inclus les éléments de contexte saisis par l'utilisateur) pour chaque ensemble d'éléments de contexte saisis par un usager. Il est à noter que plusieurs de ces ensembles peuvent être associés à une même photo si plusieurs utilisateurs ont produit des éléments de contexte pour cette photo. Dans un second exemple d'application du procédé de l'invention, le thème de la série de photo est couplé avec une information résultant de l'analyse de la photo par le module de traitement d'image 111. Par exemple, l'utilisateur a fait de nombreuses photos dans toute la Bretagne, et lorsqu'il rentre le thème Bretagne dans son application d'indexation, le système linguistique génère un vocabulaire de trop grande taille pour permettre une reconnaissance vocale aux performances satisfaisantes (des dizaines de milliers d'entrées, entre le patrimoine religieux, préhistorique, maritime, monumental, paysage). Le module d'analyse d'image 111 reconnaît une église sur la photo et le système linguistique 115 est alors restreint (par le module d'extraction 114) à la seule liste des églises remarquables de Bretagne, de taille plus raisonnable pour la reconnaissance vocale.
Dans un troisième exemple d'application du procédé de l'invention, le module d'analyse d'image 111 reconnaît qu'il y a une personne sur la photo, et l'application (et plus précisément le module d'extraction 114) lance également la recherche vocale de prénoms ou de noms familiers, dans une liste qui peut être soit générique (i.e. les 2000 prénoms les plus fréquents, ainsi que les noms de liens familiaux (maman, papa, etc) soit personnalisée par l'utilisateur, soit une combinaison des deux. Ainsi, l'application pourra produire, en faisant tourner le module de reconnaissance vocale 12 en mode détection de mot-clé sur le vocabulaire des églises et sur les prénoms, à partir de l'annotation vocale : « ça, c'est Patrick devant Brélévenez », les index textuels : « Patrick, Brélévenez ».
Dans un quatrième exemple d'application du procédé de l'invention, l'application ayant connaissance que la photo contient une personne et une église, utilise un modèle de langage défini spécifiquement pour le thème (personne, lieu) et permet au module de reconnaissance vocale 12 de produire la transcription écrite de la totalité de l'annotation vocale : « ça, c'est Patrick devant Brélévenez ».
Dans un cinquième exemple d'application du procédé de l'invention, l'application dispose d'un profil de l'utilisateur (noms de ses proches, hobbies, vocabulaire des annotations textuelles des photos antérieurement indexées), fourni par le module de gestion de profils utilisateurs 116, et génère le vocabulaire à rechercher en fonction de ce profil.
Dans un sixième exemple d'application du procédé de l'invention, le module d'extraction 114 interroge le système linguistique 115 avec un thème (par exemple « la côte de Granit Rosé ») mais en imposant une restriction géographique découlant d'une information de position donnée par exemple par une fonction GPS disponible sur certains appareils de prise de vue.
La figure 2 illustre l'enchaînement successif des différentes étapes dans un mode de réalisation particulier du procédé selon l'invention.
Une phase de prise de vue comprend une première étape 20, au cours de laquelle l'usager prend une photo au moyen d'un appareil électronique disposant à la fois des fonctions « prise de vues numériques » et « prise d'annotations vocales ».
Une phase d'enregistrement vocale comprend une étape 21, au cours de laquelle l'usager enregistre une annotation vocale au moyen de l'appareil utilisé à l'étape 20.
Les étapes suivantes sont relatives à une phase de définition du vocabulaire à reconnaître.
Lors de l'étape 22, des éléments de contexte sont définis à partir d'une ou plusieurs informations pouvant être fournies directement par l'usager lui-même (via une interface homme/machine 112 de type microphone, clavier, etc.), un système de positionnement de type GPS 113, ou encore par un module de traitement d'image 111 (information relative à une analyse d'image), un module de gestion de profils utilisateurs 116, etc.
Lors de l'étape 23, on recherche à partir d'au moins un de ces éléments de contexte la langue utilisée par l'usager.
Ensuite, lors de l'étape 24, on recherche dans un système linguistique approprié 115 une liste de mots associés aux éléments de contexte, de façon à établir un vocabulaire à reconnaître.
L'étape suivante est relative à une phase de génération d'index textuels. Enfin, lors de l'étape 25, l'activité vocale de l'usager est traitée par des moyens de reconnaissance vocale 12, de façon à effectuer une recherche dans l'annotation vocale précédemment enregistrée à l'étape 21 de mots ou expressions contenus dans le vocabulaire à reconnaître. Les mots ou expressions identifiés au cours de la recherche forment l'index textuel.
La figure 3 présente la structure d'un dispositif de génération d'index textuel 32 selon l'invention, qui comprend une mémoire 322, et une unité de traitement 321 équipée d'un microprocesseur μP, qui est piloté par un programme d'ordinateur (ou application) 323 mettant en œuvre le procédé selon l'invention. L'unité de traitement 321 reçoit en entrée une annotation vocale 31 associée à un ensemble d'images. Le microprocesseur μP traite cette annotation vocale, selon les instructions du programme 323, pour générer des index textuels 33 représentatifs des mots identifiés dans l'annotation vocale.
La figure 4 présente la structure d'un appareil de prise d'images 41 selon l'invention, qui comprend le dispositif de génération d'index textuel 32 décrit à la figure 3, et une unité de prise d'image 411 équipé d'un capteur d'image Ci, qui coopère avec une unité d'enregistrement vocale 412. L'unité de prise d'image 411 reçoit un signal représentatif d'une image 42 saisie par le capteur d'image Ci, et l'unité d'enregistrement vocale 412 reçoit un signal représentatif d'une annotation vocale 43. Ces deux signaux sont transmis vers le dispositif de génération d'index textuel 32, qui analyse dans un premier temps le signal représentatif d'une image, puis exploite le signal représentatif d'une annotation vocale, de façon à produire automatiquement des index textuels pertinents.
La figure 5 présente la structure d'un appareil de gestion/vision d'images 51 selon l'invention, qui comprend le dispositif de génération d'index textuel 32 décrit à la figure 3, et une unité de gestion/vision d'image 511, qui coopère avec une unité d'enregistrement vocale 512. L'unité de gestion/vision d'image 511 capte une image 52 dans un contexte donné, l'unité d'enregistrement vocale 512 reçoit une annotation vocale 53 associée à cette image. Ces deux informations sont transmises vers le dispositif de génération d'index textuel 32, qui analyse dans un premier temps l'image captée, puis effectue une reconnaissance vocale dans l'annotation vocale, de façon à produire des index textuels représentatifs des mots identifiés dans l'annotation vocale. En résumé, l'invention propose un procédé de génération d'un index textuel associé à au moins une image à partir d'une annotation vocale, enregistrée au moyen d'un appareil de gestion/vision d'images ou d'un appareil de prise de vue numérique équipé d'un enregistreur d'annotations vocales. Ce procédé présente de nombreux avantages, dont celui de définir automatiquement un vocabulaire à reconnaître à partir d'un contexte (par exemple un thème saisi par l'utilisateur, une donnée GPS, un profil utilisateur, une analyse d'image, etc.), de façon à effectuer une recherche dans l'annotation vocale de mots ou d'expressions contenus dans un tel vocabulaire à reconnaître.

Claims

REVENDICATIONS
1. Procédé de génération d'au moins un index textuel associé à un ensemble d'images comprenant au moins une image (14), à partir d'au moins une annotation vocale (15) préalablement associée audit ensemble d'images, ledit procédé comprenant une étape de reconnaissance vocale (25) appliquée à ladite au moins une annotation vocale (15) avec un vocabulaire à reconnaître (17) prédéterminé, de façon à effectuer une recherche dans ladite au moins une annotation vocale (15) d'au moins un mot contenu dans ledit vocabulaire à reconnaître (17), le ou les mots identifiés au cours de la recherche formant ledit index textuel (16), caractérisé en ce qu'il comprend une étape de définition dudit vocabulaire à reconnaître, comprenant elle-même : une étape de définition d'un contexte (22); une étape de recherche (24) dans un système linguistique d'une liste de mots associés audit contexte et formant ledit vocabulaire à reconnaître.
2. Procédé selon la revendication 1, caractérisé en ce que ledit ensemble d'images comprend au moins une photo (14) et/ou au moins une séquence vidéo.
3. Procédé selon l'une quelconque des revendications 1 et 2, caractérisé en ce que ledit contexte comprend au moins un élément de contexte appartenant au groupe comprenant : au moins une information relative audit ensemble d'images, fournie par au moins un utilisateur grâce à une interface homme/machine
(112) ; au moins une information relative à la position géographique du lieu de prise de vue dudit ensemble d'images, fournie par un dispositif de localisation (113) ; au moins une information relative audit ensemble d'images, résultant du traitement dudit ensemble d'images par un module d'analyse d'image (111) ; - au moins un profil d'utilisateur comprenant au moins une information de profil relative à un utilisateur ; au moins une information comprise dans un contexte par défaut.
4. Procédé selon l'une quelconque des revendications 1 à 3, caractérisé en ce que ledit procédé comprend une étape de sélection (23) d'un modèle de langage en fonction d'au moins un élément de contexte dudit contexte, et en ce que ladite étape de reconnaissance vocale (25) est effectuée en mode transcription, avec le modèle de langage sélectionné.
5. Produit programme d'ordinateur (323), caractérisé en ce qu'il comprend des instructions de code de programme pour l'exécution des étapes du procédé selon l'une quelconque des revendications 1 à 4, lorsque ledit programme est exécuté sur un ordinateur.
6. Moyen de stockage (322), éventuellement totalement ou partiellement amovible, lisible par un ordinateur, stockant un jeu d'instructions exécutables par ledit ordinateur pour mettre en œuvre le procédé selon l'une quelconque des revendications 1 à 4.
7. Dispositif de génération (32) d'au moins un index textuel associé à un ensemble d'images comprenant au moins une image, à partir d'au moins une annotation vocale préalablement associée audit ensemble d'images, ledit dispositif comprenant des moyens de reconnaissance vocale permettant, quand ils traitent ladite au moins une annotation vocale avec un vocabulaire à reconnaître prédéterminé, d'effectuer une recherche dans ladite au moins une annotation vocale d'au moins un mot contenu dans ledit vocabulaire à reconnaître, le ou les mots identifiés au cours de la recherche formant ledit index textuel, caractérisé en ce qu'il comprend des moyens de définition dudit vocabulaire à reconnaître, comprenant eux-mêmes : des moyens de définition d'un contexte ; - des moyens de recherche dans un système linguistique d'une liste de mots associés audit contexte et formant ledit vocabulaire à reconnaître.
8. Appareil de prise d'images (41) et d'enregistrement d'annotations vocales associées, permettant de prendre un ensemble d'images comprenant au moins une image, et d'associer au moins une annotation vocale audit ensemble d'images, caractérisé en ce qu'il comprend un dispositif de génération (32) d'au moins un index textuel selon la revendication 7.
9. Appareil de gestion/vision d'images (51) et d'enregistrement d'annotations vocales associées, permettant de recevoir un ensemble d'images comprenant au moins une image, et de recevoir ou générer au moins une annotation vocale associée audit ensemble d'images, caractérisé en ce qu'il comprend un dispositif de génération (32) d'au moins un index textuel selon la revendication 7.
EP06704145A 2005-01-19 2006-01-12 Procede de generation d'index textuel a partir d'une annotation vocale Withdrawn EP1839213A1 (fr)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
FR0500547 2005-01-19
PCT/EP2006/050193 WO2006077196A1 (fr) 2005-01-19 2006-01-12 Procede de generation d'index textuel a partir d'une annotation vocale

Publications (1)

Publication Number Publication Date
EP1839213A1 true EP1839213A1 (fr) 2007-10-03

Family

ID=34981744

Family Applications (1)

Application Number Title Priority Date Filing Date
EP06704145A Withdrawn EP1839213A1 (fr) 2005-01-19 2006-01-12 Procede de generation d'index textuel a partir d'une annotation vocale

Country Status (2)

Country Link
EP (1) EP1839213A1 (fr)
WO (1) WO2006077196A1 (fr)

Families Citing this family (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
FR2907243A1 (fr) 2006-10-17 2008-04-18 France Telecom Procede et systeme de determination d'une probabilite de presence d'une personne dans au moins une partie d'une image et programme d'ordinateur correspondant.
US20110257972A1 (en) * 2010-04-15 2011-10-20 Markus Agevik System and method for location tracking using audio input
CN103425668A (zh) * 2012-05-16 2013-12-04 联想(北京)有限公司 信息检索方法及电子设备

Family Cites Families (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US20020184196A1 (en) * 2001-06-04 2002-12-05 Lehmeier Michelle R. System and method for combining voice annotation and recognition search criteria with traditional search criteria into metadata
AU2002345519A1 (en) 2002-07-09 2004-02-02 Centre National De La Recherche Scientifique Annotation of digital images using text
WO2004043029A2 (fr) * 2002-11-08 2004-05-21 Aliope Limited Gestion multimedia

Non-Patent Citations (1)

* Cited by examiner, † Cited by third party
Title
See references of WO2006077196A1 *

Also Published As

Publication number Publication date
WO2006077196A1 (fr) 2006-07-27

Similar Documents

Publication Publication Date Title
US7574453B2 (en) System and method for enabling search and retrieval operations to be performed for data items and records using data obtained from associated voice files
JP3936243B2 (ja) 音声注釈を使用した、画像におけるイベントを区分及び識別するための方法及びシステム
EP1364316A2 (fr) Dispositif d'extraction d'informations d'un texte a base de connaissances
EP1836651B1 (fr) Procédé de recherche, reconnaissance et localisation d'un terme dans l'encre, dispositif, programme d'ordinateur correspondants
FR2910143A1 (fr) Procede pour predire automatiquement des mots dans un texte associe a un message multimedia
WO2004062263A1 (fr) Procede et dispositif permettant l'annotation et la recherche automatiques de contenus numeriques distants
US20150371629A9 (en) System and method for enabling search and retrieval operations to be performed for data items and records using data obtained from associated voice files
US7451090B2 (en) Information processing device and information processing method
WO2014191703A1 (fr) Procédé de recherche dans une base de données
EP2851891B1 (fr) Terminal mobile utilisateur et procédé de commande d'un tel terminal
EP1839213A1 (fr) Procede de generation d'index textuel a partir d'une annotation vocale
FR2825556A1 (fr) Generation d'une description dans un langage de balisage d'une structure d'un contenu multimedia
EP2902927B1 (fr) Procédé et dispositif d'étiquetage d'au moins un objet multimédia
CA3154695A1 (fr) Procede et systeme pour editorialiser des contenus d'enregistrements audio ou audiovisuels numeriques d'une intervention orale
EP2388973B1 (fr) Procédé de récupération automatique de documents annexes dans une édition multimédia
FR3138225A1 (fr) Procédé d’annotation, dispositif électronique et produit programme d’ordinateur correspondant
FR2934694A1 (fr) Procede d'indexation de documents multimedias permettant la creation et la diffusion d'albums personnalises.
WO2020229760A1 (fr) Procede d'indexation multidimensionnelle de contenus textuels
FR2891071A1 (fr) Procede et systeme pour generer une animation visuelle a partir d'informations stockees dans une base de donnees multimedia.
WO2007088254A1 (fr) Systeme d'information structure, relationnel et incremental
WO2022129760A2 (fr) Procede de collecte de donnees, procede d'exploitation de donnees collectees, dispositif electronique et produits programme d'ordinateur et support correspondants
FR2867583A1 (fr) Correcteur semantique, syntaxique et/ou lexical et procede d'interaction vocale, support d'enregistrement et programme d'ordinateur pour sa mise en oeuvre
FR2991077A1 (fr) Systeme interactif de resolution contextuelle d'informations provenant d'un systeme semantique
FR2894351A1 (fr) Procede et systeme de creation de personnifications virtuelles, utilisation de ce procede dans un systeme de recherche d'informations par dialogue automatique et programme d'ordinateur associe.
Chen et al. USING SPEECH ANNOTATION FOR HOME DIGITAL IMAGE INDEXING AND RETRIEVAL

Legal Events

Date Code Title Description
PUAI Public reference made under article 153(3) epc to a published international application that has entered the european phase

Free format text: ORIGINAL CODE: 0009012

17P Request for examination filed

Effective date: 20070626

AK Designated contracting states

Kind code of ref document: A1

Designated state(s): AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HU IE IS IT LI LT LU LV MC NL PL PT RO SE SI SK TR

DAX Request for extension of the european patent (deleted)
17Q First examination report despatched

Effective date: 20100415

RAP1 Party data changed (applicant data changed or rights of an application transferred)

Owner name: ORANGE

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE APPLICATION IS DEEMED TO BE WITHDRAWN

18D Application deemed to be withdrawn

Effective date: 20160802