EP1470502A2 - Systeme et procede d indexation et de recherche a extension de requetes, moteurs d indexation et de recherche - Google Patents

Systeme et procede d indexation et de recherche a extension de requetes, moteurs d indexation et de recherche

Info

Publication number
EP1470502A2
EP1470502A2 EP03718820A EP03718820A EP1470502A2 EP 1470502 A2 EP1470502 A2 EP 1470502A2 EP 03718820 A EP03718820 A EP 03718820A EP 03718820 A EP03718820 A EP 03718820A EP 1470502 A2 EP1470502 A2 EP 1470502A2
Authority
EP
European Patent Office
Prior art keywords
terms
indexing
initial
request
knowledge base
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
EP03718820A
Other languages
German (de)
English (en)
Inventor
Stéphane Martin
Guillaume Allys
Luc De Bois
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Orange SA
Original Assignee
France Telecom SA
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by France Telecom SA filed Critical France Telecom SA
Publication of EP1470502A2 publication Critical patent/EP1470502A2/fr
Pending legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/90Details of database functions independent of the retrieved data types
    • G06F16/95Retrieval from the web
    • G06F16/951Indexing; Web crawling techniques
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/30Information retrieval; Database structures therefor; File system structures therefor of unstructured textual data
    • G06F16/31Indexing; Data structures therefor; Storage structures
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/30Information retrieval; Database structures therefor; File system structures therefor of unstructured textual data
    • G06F16/33Querying
    • G06F16/3331Query processing
    • G06F16/3332Query translation
    • G06F16/3338Query expansion

Definitions

  • the present invention relates to an indexing and search system. More specifically, the invention relates to an indexing and search system of the type comprising means for storing an indexing base, means for indexing resources for creating and updating the database. indexing, means for finding resources suitable for interrogating the indexing base from a request, and means for extending requests for obtaining an extended request, from an initial request formulated by a user and comprising initial terms, by adding to this initial request terms close to the initial terms.
  • the invention also relates to an indexing method and a search method implemented by this system, as well as to indexing and search engines.
  • indexing and search systems include a semantic knowledge base comprising a set of terms, each term being possibly associated with other terms of this same base which are semantically close to it.
  • the search means enrich the initial request formulated by the user with terms extracted from the knowledge base and which are semantically close to the initial terms of the query.
  • This extension of the initial query by adding new neighboring terms, can be repeated. In this way, the documentary search will be carried out on the basis of an extended query comprising a greater number of terms than the initial query.
  • indexing and search systems impose a maximum predetermined number of terms in the extended query. These search and indexing systems stop the extension of the query when the maximum is reached, which makes the choice of the terms of the extended query arbitrary. Documentary research is therefore less time consuming, but at the expense of its relevance.
  • the invention aims to remedy the drawbacks of the aforementioned conventional indexing and search systems, by providing a system allowing the extension of initial requests while preserving the efficiency of the document search.
  • the subject of the invention is therefore an indexing and search system of the aforementioned type, characterized in that the extension means include means for limiting the extension of the initial request by adding to it only of neighboring terms non-general initial terms, that is to say not comprising too many neighboring terms.
  • an indexing and search system makes it possible to limit the extension of the initial request in a relevant manner, that is to say by favoring the extension from precise terms rather than from general terms.
  • It includes means for extracting terms from each resource and means for generalizing the indexing of said resource by adding, to these extracted terms, general terms with which they are neighbors;
  • the means for extending the request comprise means for generalizing the initial request by adding, to the initial terms of the request, general terms with which they are neighboring;
  • the extension means comprise a semantic knowledge base comprising a set of terms among which are found the initial terms of the request, each term being optionally associated with a list of at least one neighboring term taken from this base of semantic knowledge;
  • a term of the semantic knowledge base is a general term if it is associated with a list comprising a number of neighboring terms greater than a predetermined threshold
  • the system comprises means for generating a limitation knowledge base and a generalization knowledge base from the semantic knowledge base, the limitation knowledge base being associated with the extension limitation means and the generalization knowledge base being independent of the limitation knowledge base and associated with the means for generalizing the initial request;
  • the limitation knowledge base comprises all the terms of the semantic knowledge base, and its terms corresponding to the general terms of the semantic knowledge base are not associated with any list of neighboring terms; and the generalization knowledge base comprises all of the terms of the semantic knowledge base, and the lists of neighboring terms which it contains comprise only the terms corresponding to general terms of the semantic knowledge base.
  • the subject of the invention is also a method of searching for indexed resources comprising the following steps:
  • extension step comprises a substep of extension of the initial request by adding to it- ci only of neighboring terms of the non general initial terms, ie not comprising too many neighboring terms.
  • a method of searching for indexed resources according to the invention may also include the characteristic that the extension step comprises a sub-step of generalizing the initial request by adding, to the initial terms of the request, terms generals of which they are neighbors.
  • the invention also relates to a method of indexing resources comprising a step of extracting terms from each resource, characterized in that it further comprises a step of generalizing the indexing of said resource by l addition to these extracted terms of general terms with which they are neighbors.
  • the invention also relates to a resource indexing engine comprising means for extracting terms from each resource, characterized in that it includes means for generalizing the indexing of said resource by adding , to these extracted terms, from general terms with which they are neighbors.
  • the subject of the invention is a search engine for indexed resources comprising means for extracting initial terms from an initial request formulated by a user, means for searching for resources suitable for interrogating an indexing base. from a request, and request extension means for obtaining an extended request from the initial request, characterized in that the extension means comprise means for limiting the extension of the initial request by adding thereto only neighboring terms of the non-general initial terms, that is to say not comprising too many neighboring terms.
  • a search engine according to the invention may also include the characteristic that the extension means include means for generalization of the initial request by adding, to the initial terms of the request, general terms with which they are neighbors.
  • FIG. 1 schematically shows the general structure of an indexing and search system according to the invention.
  • Figures 2 and 3 show the structure of knowledge bases of the indexing and search system shown in Figure 1, according to two distinct embodiments.
  • the indexing and search system represented in FIG. 1 comprises storage means 10. It further comprises an indexing engine 12 and a search engine 14, both connected to the storage means 10.
  • the indexing engine 12 includes means 16 for extracting terms receiving as input a documentary resource 18 from any documentary base accessible, for example, by the Internet.
  • the means 16 supply terms Ti, T 2 automatically extracted from document 18 and representative of it.
  • Each term extracted from the document 18 is transmitted to means 20a for extending the indexing.
  • the means 20a for extending the indexing supply the terms Ti and T 2 associated with terms close to T ⁇ and T 2 coming from the storage means 10. For example, they provide a term T 3 , semantic neighbor of the term " TY They transmit T * ⁇ , T 2 and T 3 to indexing means 22.
  • a reference D1 of the document 18 is also transmitted to the indexing means 22.
  • the extraction means 16 also transmit to the indexing means 22 data specifying the respective positions Pi and P 2 of the terms extracted Ti and T 2 in document 18.
  • the function of the indexing means 22 is to transfer all of this data to the storage means 10.
  • the storage means 10 comprise an indexing base 24.
  • This indexing base 24 consists of triplets each comprising a term, a reference to a document from which this term has been extracted, and the position of the term in this document.
  • the indexing base comprises, according to the example given above, a first triplet (Ti, Di, Pi), a second triplet (T 2 , Di, P 2 ) and a third triplet (T 3 , D ⁇ p .,).
  • T 3 which is obtained from Ti is associated with the position Pi of Ti in DL
  • the storage means 10 also comprise a semantic knowledge base 26 comprising a set of terms.
  • semantic knowledge base 26 represent all the terms recognized by the indexing and search system, therefore in particular the terms Ti, T 2 , and T 3 .
  • Each term of the semantic knowledge base 26 is, optionally, associated with a list of at least one semantically neighboring term taken from this same knowledge base 26.
  • the storage means 10 also include two separate knowledge bases 28 and 30, constructed from the semantic knowledge base 26.
  • the first of these two distinct knowledge bases is a limitation knowledge base 28 which includes the same terms as knowledge base 26.
  • its terms corresponding to the general terms of knowledge base 26 are not associated with any list. of neighboring terms, contrary to the corresponding general terms of the semantic knowledge base 26.
  • the second knowledge base is a generalization knowledge base 30 which includes all of the terms of the knowledge base 26.
  • the lists of neighboring terms which it contains comprise only terms corresponding to general terms of the knowledge base 26.
  • Knowledge base 26 is useful for generating the knowledge bases for indexing 28 and generalization 30, but is not used by the indexing and search system. Its presence in the storage means 10 is therefore not necessary for the operation of the indexing and search system. It is only necessary for updating knowledge bases 28 and 30 when all of the stored terms are modified.
  • the means 20a for indexing extension are connected in reading mode to the generalization knowledge base 30.
  • the means 20a for indexing extension receive an input term, they supply this term as output as well as general terms belonging to the list of terms close to the term received as input, this list being provided by the generalization knowledge base 30.
  • the assembly consisting of the means 20a for extending the indexing and the knowledge base of generalization 30 thus form means 20 for generalization of indexing.
  • the search engine 14 comprises means for extracting terms 32 from an initial request 34 formulated by a user. These extraction means 32 receive as input a request 34 as formulated by the user and supply as output a list of terms extracted from this request and contained in knowledge base 26, such as the term Ri.
  • first means 35a for extending requests This list of terms is supplied to first means 35a for extending requests.
  • the first means 35a for extending requests are connected in reading mode to the generalization knowledge base 30 and form therewith means 35 for generalizing the initial request. 34.
  • the first means 35a for request extension provide the term Ri as well as terms R 2 and R 3 belonging to the list of neighboring terms associated with the term Ri in the generalization knowledge base 30.
  • the terms Ri, R 2 and R 3 are provided at the input of second means 36a for request extension.
  • These second request extension means 36a are identical to the first request extension means 35a, but they are connected in reading mode to the limitation knowledge base 28.
  • the general terms of the request base knowledge 28 are not associated with any list of related terms.
  • the second request extension means 36a associated with this limitation knowledge base 28 form means 36 for limiting the extension of the request.
  • These means provide an extended request at the output consisting of the terms Ri, R 2 and R 3 , as well as a term R 4 supplied by the limitation knowledge base 28.
  • the means 35 for generalization and the means 36 for limiting the extension constitute, possibly with the knowledge base 26, means 38 for extending the initial request. These means can be activated several times, according to an iterative process, in order to gradually extend the initial request and provide at the output a final request transmitted to search means 40.
  • search means 40 are connected to the indexing base 24 of the storage means 10 and supply, in response to the initial request formulated by the user 34, a set 42 of documentary resources selected according to the terms Ri, R 2 , R 3 and R 4 of the extended request.
  • a first embodiment of the knowledge base 26 is shown in FIG. 2, in graphic form.
  • the graphs have vertices, such as vertices A, B, C, D, E, F and G, each representing a term in the knowledge base.
  • the vertices are possibly linked together by oriented arcs representing semantic links whose meaning is "has a direct neighbor term".
  • the term A has for direct neighbor the term B.
  • a term Y is close to a term X if there is a path of at most two arcs oriented from X to Y.
  • the term B has for direct neighbor the term E. This term E is therefore close to the term A.
  • a term in knowledge base 26 is a general term if it has at least five direct neighbors.
  • the term A is a general term. Indeed it has six direct neighbors, including B and C.
  • the term B has as its only direct neighbor the term F.
  • the term C has three direct neighbors, B, F and G.
  • the terms B, C, E, F and G are therefore terms close to the term A.
  • the term C has four neighbors, B, E, F and G.
  • the term B has three neighbors, D, E and F.
  • the term D has six neighbors including, A and C and the term E has two neighbors, D and A.
  • the terms F and G have no neighbors.
  • the general term A has no direct neighbors since it is a general term in knowledge base 26. However, all other terms have the same direct neighbors as in the knowledge base 26. In other words, only the oriented arcs originating from A are deleted in the limitation knowledge base 28.
  • the generalization knowledge base 30 also includes the same terms as the knowledge base 26. But the direct vicinity of a term of this base is the set of terms corresponding to general terms of the knowledge base 26 of which it is neighbor in this initial base. Thus, in this generalization knowledge base 30, only the term A, which is the only general term in knowledge base 26, is the direct neighbor of other terms. It is notably the direct neighbor of the terms B, C, E, F and G, which are its neighbors in the initial knowledge base, but is not the direct neighbor of the term D, which does not belong to its neighborhood in knowledge base 26.
  • the generalization knowledge base 30 provides the means 20a with general terms close to the terms extracted from the documents 18.
  • the limitation knowledge base 28 does not provide the second request extension means 36a with terms close to the general terms of the request, since the corresponding oriented arcs have been deleted. Indeed, this would be useless, since the documents containing the terms of the semantic neighborhood of the general terms of the request have been indexed with respect to them, thanks to the means 20 of generalization of the indexing.
  • the second embodiment represented in FIG. 3 differs from the first embodiment by the generation of the knowledge bases of limitation 28 and of generalization 30 from the knowledge base 26.
  • each term corresponding to a general term in the knowledge base 26 is represented by several terms of which all but one are artificial.
  • the real instance of a general term has for direct vicinity only the set of general artificial instances.
  • All the other terms of the limitation knowledge base 28 have the same semantic neighborhood as the corresponding terms of knowledge base 26.
  • the semantic neighborhood of a term in the generalization knowledge base 30 is the set of general terms of which it is part of the semantic neighborhood in the knowledge base 26, but each of these general terms is represented in the neighborhood by its instance. real or an artificial instance, depending on the distance between this general term and the term considered.
  • the terms B and C have as neighbors the real instance of the general term A while the terms E, and F and G, which are not neighbors of the general term A, are neighbors of the artificial instance of A.
  • a request comprising the only general term A will make it possible to find a documentary resource comprising the only term B with a higher level of relevance than a documentary resource comprising the only term E.
  • the extension of the request comprising the general term A in a query comprising the general term A and its artificial instance makes it possible to find the second document, but with a level of relevance lower than the first document, due to the distance between the general term A and its artificial instance in the limitation knowledge base 28. It clearly appears that a search extension and indexing system according to the invention makes it possible to optimize the search for documentary resources by controlling the extension of a request.
  • the storage means 10 may not include a limitation knowledge base 28 and a generalization knowledge base 30 generated from the knowledge base 26.
  • the means 20 for generalizing the indexing are completely integrated in the indexing engine 12 and are connected in reading mode to the knowledge base 26. They then comprise means for extracting only general terms from the base of knowledge 26, whose terms supplied to them as an input are similar.
  • the means for generalizing queries 35 are completely integrated into the search engine 14 and are identical to the means 20 for generalizing indexing.
  • the means for limiting the extension 36 are completely integrated into the search engine 14 and are linked in reading to the knowledge base 26. They are adapted to add to the terms which are supplied to them, only terms close to the initial non-general terms of the knowledge base 26.

Landscapes

  • Engineering & Computer Science (AREA)
  • Theoretical Computer Science (AREA)
  • Databases & Information Systems (AREA)
  • Data Mining & Analysis (AREA)
  • Physics & Mathematics (AREA)
  • General Engineering & Computer Science (AREA)
  • General Physics & Mathematics (AREA)
  • Computational Linguistics (AREA)
  • Software Systems (AREA)
  • Information Retrieval, Db Structures And Fs Structures Therefor (AREA)

Abstract

Ce système d'indexation et de recherche comporte des moyens (10) de stockage d'une base d'indexation (26), des moyens (22) d'indexation de ressources (18) pour la création et la mise à jour de la base d'indexation (24), des moyens (40) de recherche de ressources adaptés pour interroger la base d'indexation (24) à partir d'une requête, et des moyens (38) d'extension de requêtes pour l'obtention d'une requête étendue, à partir d'une requête initiale (34) formulée par un utilisateur et comportant des termes initiaux (R1), par l'ajout à cette requête initiale (34) de termes voisins des termes initiaux. Les moyens d'extension (38) comportent en outre des moyens (36) de limitation de l'extension de la requête initiale par l'ajout à celle-ci uniquement de termes voisins des termes initiaux non généraux, c'est-à-dire ne comportant pas un trop grand nombre de termes voisins. Des moyens (20) de généralisation de l'indexation peuvent également être mise en oeuvre selon l'invention.

Description

Système et procédés d'indexation et de recherche à extension de requêtes, moteurs d'indexation et de recherche
La présente invention concerne un système d'indexation et de recherche. Plus précisément, l'invention concerne un système d'indexation et de recherche du type comportant des moyens de stockage d'une base d'indexation, des moyens d'indexation de ressources pour la création et la mise à jour de la base d'indexation, des moyens de recherche de ressources adaptés pour interroger la base d'indexation à partir d'une requête, et des moyens d'extension de requêtes pour l'obtention d'une requête étendue, à partir d'une requête initiale formulée par un utilisateur et comportant des termes initiaux, par l'ajout à cette requête initiale de termes voisins des termes initiaux.
L'invention concerne également un procédé d'indexation et un procédé de recherche mis en oeuvre par ce système, ainsi que des moteurs d'indexation et de recherche.
En général, les systèmes d'indexation et de recherche comportent une base de connaissance sémantique comportant un ensemble de termes, chaque terme étant éventuellement associé à d'autres termes de cette même base qui lui sont sémantiquement proches. Ainsi, lorsqu'un utilisateur formule une requête, pour obtenir en retour des documents pertinents indexés par les moyens d'indexation, les moyens de recherche enrichissent la requête initiale formulée par l'utilisateur de termes extraits de la base de connaissance et qui sont sémantiquement proches des termes initiaux de la requête. Cette extension de la requête initiale, par l'ajout de nouveaux termes voisins peut être réitérée. De la sorte, la recherche documentaire sera effectuée à partir d'une requête étendue comportant un plus grand nombre de termes que la requête initiale.
Cependant, parmi les termes de la base de connaissance sémantique, certains comportent un grand nombre de termes voisins, parce qu'ils sont très généraux.
Si, lors de l'extension d'une requête, celle-ci comporte de tels termes généraux, elle risque de comporter finalement un trop grand nombre de termes et la recherche documentaire risque d'être peu efficace et consommatrice de temps.
Pour pallier ce problème, certains systèmes d'indexation et de recherche imposent un nombre prédéterminé maximal de termes dans la requête étendue. Ces systèmes de recherche et d'indexation arrêtent l'extension de la requête lorsque le maximum est atteint, ce qui rend arbitraire le choix des termes de la requête étendue. La recherche documentaire est alors moins consommatrice de temps, mais au détriment de sa pertinence. L'invention vise à remédier aux inconvénients des systèmes d'indexation et de recherche classiques précités, en fournissant un système permettant l'extension de requêtes initiales tout en préservant l'efficacité de la recherche documentaire.
L'invention a donc pour objet un système d'indexation et de recherche du type précité, caractérisé en ce que les moyens d'extension comportent des moyens de limitation de l'extension de la requête initiale par l'ajout à celle-ci uniquement de termes voisins des termes initiaux non généraux, c'est-à-dire ne comportant pas un trop grand nombre de termes voisins.
Ainsi, un système d'indexation et de recherche selon l'invention permet de limiter l'extension de la requête initiale de façon pertinente, c'est-à-dire en favorisant l'extension à partir de termes précis plutôt qu'à partir de termes généraux.
Un système d'indexation et de recherche selon l'invention peut en outre comporter l'une ou plusieurs des caractéristiques suivantes :
- il comporte des moyens d'extraction de termes à partir de chaque ressource et des moyens de généralisation de l'indexation de ladite ressource par l'ajout, à ces termes extraits, de termes généraux dont ils sont voisins ;
- les moyens d'extension de la requête comportent des moyens de généralisation de la requête initiale par l'ajout, aux termes initiaux de la requête, de termes généraux dont ils sont voisins ; - les moyens d'extension comportent une base de connaissance sémantique comprenant un ensemble de termes parmi lesquels se trouvent les termes initiaux de la requête, chaque terme étant de façon optionnelle associé à une liste d'au moins un terme voisin pris dans cette base de connaissance sémantique ;
- un terme de la base de connaissance sémantique est un terme général s'il est associé à une liste comportant un nombre de termes voisins supérieur à un seuil prédéterminé ;
- le système comporte des moyens de génération d'une base de connaissance de limitation et d'une base de connaissance de généralisation à partir de la base de connaissance sémantique, la base de connaissance de limitation étant associée aux moyens de limitation de l'extension et la base de connaissance de généralisation étant indépendante de la base de connaissance de limitation et associée aux moyens de généralisation de la requête initiale ;
- la base de connaissance de limitation comporte l'ensemble des termes de la base de connaissance sémantique, et ses termes correspondant aux termes généraux de la base de connaissance sémantique ne sont associés à aucune liste de termes voisins ; et - la base de connaissance de généralisation comporte l'ensemble des termes de la base de connaissance sémantique, et les listes de termes voisins qu'elle contient comportent uniquement les termes correspondant à des termes généraux de la base de connaissance sémantique. L'invention a également pour objet un procédé de recherche de ressources indexées comprenant les étapes suivantes :
- émission d'une requête initiale formulée par un utilisateur et comportant des termes initiaux ;
- extension de la requête initiale par l'ajout à cette requête initiale de termes voisins des termes initiaux, caractérisé en ce que l'étape d'extension comporte une sous-étape d'extension de la requête initiale par l'ajout à celle-ci uniquement de termes voisins des termes initiaux non généraux, c'est-à-dire ne comportant pas un trop grand nombre de termes voisins. Un procédé de recherche de ressources indexées selon l'invention peut en outre comporter la caractéristique selon laquelle l'étape d'extension comprend une sous- étape de généralisation de la requête initiale par l'ajout, aux termes initiaux de la requête, de termes généraux dont ils sont voisins.
L'invention a également pour objet un procédé d'indexation de ressources comportant une étape d'extraction de termes à partir de chaque ressource, caractérisé en ce qu'il comporte en outre une étape de généralisation de l'indexation de ladite ressource par l'ajout, à ces termes extraits, de termes généraux dont ils sont voisins.
L 'invention a également pour objet un moteur d'indexation de ressources comportant des moyens d'extraction de termes à partir de chaque ressource, caractérisé en ce qu'il comporte des moyens de généralisation de l'indexation de ladite ressource par l'ajout, à ces termes extraits, de termes généraux dont ils sont voisins.
Enfin, l'invention a pour objet un moteur de recherche de ressources indexées comportant des moyens d'extraction de termes initiaux à partir d'une requête initiale formulée par un utilisateur, des moyens de recherche de ressources adaptés pour interroger une base d'indexation à partir d'une requête, et des moyens d'extension de requêtes pour l'obtention d'une requête étendue à partir de la requête initiale, caractérisé en ce que les moyens d'extension comportent des moyens de limitation de l'extension de la requête initiale par l'ajout à celle-ci uniquement de termes voisins des termes initiaux non généraux, c'est-à-dire ne comportant pas un trop grand nombre de termes voisins. Un moteur de recherche selon l'invention peut en outre comporter la caractéristique selon laquelle les moyens d'extension comportent des moyens de généralisation de la requête initiale par l'ajout, aux termes initiaux de la requête, de termes généraux dont ils sont voisins.
L'invention sera mieux comprise à l'aide de la description qui va suivre, donnée uniquement à titre d'exemple et faite en se référant aux dessins annexés, sur lesquels :
- la figure 1 représente schématiquement la structure générale d'un système d'indexation et de recherche selon l'invention ; et
- les figures 2 et 3 représentent la structure de bases de connaissances du système d'indexation et de recherche représenté à la figure 1 , selon deux modes de réalisation distincts.
Le système d'indexation et de recherche représenté à la figure 1 comporte des moyens de stockage 10. Il comporte en outre un moteur d'indexation 12 et un moteur de recherche 14, tous les deux reliés aux moyens de stockage 10.
Le moteur d'indexation 12 comporte des moyens 16 d'extraction de termes recevant en entrée une ressource documentaire 18 issue d'une base documentaire quelconque accessible, par exemple, par le réseau Internet. Par un procédé d'extraction connu, les moyens 16 fournissent des termes T-i, T2 extraits automatiquement du document 18 et représentatifs de celui-ci. Chaque terme extrait du document 18 est transmis à des moyens 20a d'extension de l'indexation. Les moyens 20a d'extension de l'indexation fournissent en sortie les termes Ti et T2 associés à des termes voisins de Tι et T2 issus des moyens de stockage 10. Par exemple, ils fournissent un terme T3, voisin sémantique du terme "TY Ils transmettent T*ι, T2 et T3 à des moyens d'indexation 22.
Une référence D1 du document 18 est également transmise aux moyens d'indexation 22. Enfin, les moyens d'extraction 16 transmettent aussi aux moyens d'indexation 22 des données précisant les positions respectives Pi et P2 des termes extraits Ti et T2 dans le document 18. Les moyens d'indexation 22 ont pour fonction de transférer toutes ces données vers les moyens de stockage 10.
Pour cela, les moyens de stockage 10 comportent une base d'indexation 24. Cette base d'indexation 24 est constituée de triplets comprenant chacun un terme, une référence vers un document à partir duquel a été extrait ce terme, et la position du terme dans ce document. Ainsi, la base d'indexation comporte, selon l'exemple donné précédemment, un premier triplet (T-i, Di, Pi), un deuxième triplet (T2, Di, P2) et un troisième triplet (T3, D^ p.,). On notera que le terme T3 qui est obtenu à partir de Ti est associé à la position Pi de Ti dans DL Les moyens de stockage 10 comportent en outre une base de connaissance sémantique 26 comportant un ensemble de termes. Les termes contenus dans cette base de connaissance sémantique 26 représentent l'ensemble des termes reconnus par le système d'indexation et de recherche, donc notamment les termes Ti, T2, et T3. Chaque terme de la base de connaissance sémantique 26 est, de façon optionnelle, associé à une liste d'au moins un terme sémantiquement voisin pris dans cette même base de connaissance 26.
Les moyens de stockage 10 comportent également deux bases de connaissance distinctes 28 et 30, construites à partir de la base de connaissance sémantique 26.
La première de ces deux bases de connaissance distinctes est une base de connaissance de limitation 28 qui comporte les mêmes termes que la base de connaissance 26. Par contre, ses termes correspondant aux termes généraux de la base de connaissances 26 ne sont associés à aucune liste de termes voisins, contrairement aux termes généraux correspondants de la base de connaissance sémantique 26.
La seconde base de connaissance est une base de connaissance de généralisation 30 qui comporte l'ensemble des termes de la base de connaissances 26. Les listes de termes voisins qu'elle contient comportent uniquement des termes correspondant à des termes généraux de la base de connaissances 26. La base de connaissances 26 est utile pour la génération des bases de connaissance d'indexation 28 et de généralisation 30, mais n'est pas utilisée par le système d'indexation et de recherche. Sa présence dans les moyens de stockage 10 n'est donc pas nécessaire pour le fonctionnement du système d'indexation et de recherche. Elle est seulement nécessaire pour la mise à jour des bases de connaissance 28 et 30 lorsque l'ensemble des termes stockés est modifié.
Les moyens 20a d'extension de l'indexation sont reliés en lecture à la base de connaissance de généralisation 30. Ainsi, lorsque les moyens 20a d'extension de l'indexation reçoivent un terme en entrée, ils fournissent en sortie ce terme ainsi que des termes généraux appartenant à la liste de termes voisins du terme reçu en entrée, cette liste étant fournie par la base de connaissance de généralisation 30. L'ensemble constitué des moyens 20a d'extension de l'indexation et de la base de connaissance de généralisation 30 forment ainsi des moyens 20 de généralisation de l'indexation.
Le moteur de recherche 14 comporte des moyens d'extraction de termes 32 à partir d'une requête initiale 34 formulée par un utilisateur. Ces moyens d'extraction 32 reçoivent en entrée une requête 34 telle que formulée par l'utilisateur et fournissent en sortie une liste de termes extraits de cette requête et contenus dans la base de connaissances 26, tels que le terme R-i.
Cette liste de termes est fournie à des premiers moyens 35a d'extension de requêtes. De même que les moyens 20a d'extension de l'indexation, les premiers moyens 35a d'extension de requêtes sont reliés en lecture à la base de connaissance de généralisation 30 et forment avec celle-ci des moyens 35 de généralisation de la requête initiale 34. En sortie, les premiers moyens 35a d'extension de requêtes fournissent le terme Ri ainsi que des termes R2 et R3 appartenant à la liste de termes voisins associée au terme Ri dans la base de connaissance de généralisation 30.
Les termes Ri, R2 et R3 sont fournis en entrée de seconds moyens 36a d'extension de requêtes. Ces seconds moyens 36a d'extension de requête sont identiques aux premiers moyens 35a d'extension de requête, mais ils sont reliés en lecture à la base de connaissance de limitation 28. Comme cela a été dit précédemment, les termes généraux de la base de connaissance 28 ne sont associés à aucune liste de termes voisins. Ainsi, les seconds moyens 36a d'extension de requête associés à cette base de connaissance de limitation 28 forment des moyens 36 de limitation de l'extension de la requête. Ces moyens fournissent en sortie une requête étendue constituée des termes Ri, R2 et R3, ainsi que d'un terme R4 fourni par la base de connaissance de limitation 28.
Les moyens 35 de généralisation et les moyens 36 de limitation de l'extension constituent, avec éventuellement la base de connaissance 26, des moyens 38 d'extension de la requête initiale. Ces moyens peuvent être activés plusieurs fois, selon un procédé itératif, pour étendre progressivement la requête initiale et fournir en sortie une requête définitive transmise à des moyens de recherche 40.
Ces moyens de recherche 40 sont reliés à la base d'indexation 24 des moyens de stockage 10 et fournissent en réponse à la requête initiale formulée par l'utilisateur 34, un ensemble 42 de ressources documentaires sélectionnées en fonction des termes Ri, R2,R3et R4 de la requête étendue. Un premier mode de réalisation de la base de connaissance 26 est représenté à la figure 2, sous forme graphique.
Sur cette figure, les graphes comportent des sommets, tels que les sommets A, B, C, D, E, F et G, chacun représentant un terme de la base de connaissance. Les sommets sont éventuellement reliés entre eux par des arcs orientés représentant des liens sémantiques dont la signification est «a pour terme voisin direct». Ainsi, le terme A a pour voisin direct le terme B. On peut considérer qu'un terme Y est voisin d'un terme X s'il existe un chemin d'au plus deux arcs orientés de X vers Y. Ainsi, le terme B a pour voisin direct le terme E. Ce terme E est donc voisin du terme A.
On peut, en outre, considérer qu'un terme de la base de connaissance 26 est un terme général si celui-ci a au moins cinq voisins directs.
Dans l'exemple représenté, seul le terme A est un terme général. En effet il comporte six voisins directs, dont B et C. Le terme B comporte comme unique voisin direct le terme F. Le terme C comporte trois voisins directs, B, F et G. Les termes B, C, E, F et G sont donc des termes voisins du terme A. Le terme C comporte quatre voisins, B, E, F et G. Le terme B comporte trois voisins, D, E et F. Le terme D comporte six voisins dont, A et C et le terme E comporte deux voisins, D et A. Les termes F et G ne comportent aucun voisin.
Dans la base de connaissance de limitation 28, le terme général A ne comporte aucun voisin direct puisqu'il est un terme général dans la base de connaissance 26. Par contre, tous les autres termes comportent les mêmes voisins directs que dans la base de connaissances 26. C'est-à-dire que seuls les arcs orientés ayant A pour origine sont supprimés dans la base de connaissance de limitation 28.
La base de connaissance de généralisation 30 comporte elle aussi les mêmes termes que la base de connaissances 26. Mais le voisinage direct d'un terme de cette base est l'ensemble des termes correspondant à des termes généraux de la base de connaissances 26 dont il est voisin dans cette base initiale. Ainsi, dans cette base de connaissance de généralisation 30, seul le terme A, qui est le seul terme général de la base de connaissances 26, est le voisin direct d'autres termes. Il est notamment le voisin direct des termes B, C, E, F et G, qui sont ses voisins dans la base de connaissances initiale, mais n'est pas le voisin direct du terme D, qui n'appartient pas à son voisinage dans la base de connaissances 26.
Ainsi, lors de l'indexation de documents, tels que le document 18, la base de connaissance de généralisation 30 fournit aux moyens 20a des termes généraux voisins des termes extraits des documents 18. Par contre, lors de l'extension d'une requête, la base de connaissance de limitation 28 ne fournit pas aux seconds moyens 36a d'extension de requête, les termes voisins des termes généraux de la requête, puisque les arcs orientés correspondants ont été supprimés. En effet, ce serait inutile, puisque les documents contenant les termes du voisinage sémantique des termes généraux de la requête ont été indexés vis-à-vis de ceux-ci, grâce aux moyens 20 de généralisation de l'indexation. Le second mode de réalisation représenté à la figure 3 diffère du premier mode de réalisation par la génération des bases de connaissance de limitation 28 et de généralisation 30 à partir de la base de connaissance 26.
Ce mode de réalisation permet d'introduire la notion de distance entre un document et les termes vis-à-vis desquels il est indexé, par la création de termes artificiels. Ainsi, dans la base de connaissance de limitation 28, chaque terme correspondant à un terme général de la base de connaissance 26 est représenté par plusieurs termes dont tous sauf un sont artificiels. L'instance réelle d'un terme général n'a pour voisinage direct que l'ensemble des instances artificielles générales. Tous les autres termes de la base de connaissance de limitation 28 ont le même voisinage sémantique que les termes correspondants de la base de connaissance 26.
Enfin, on définit des distances entre les instances réelles des termes généraux et chaque instance artificielle correspondante.
Dans la base de connaissances de généralisation 30, seuls ont un voisin direct les termes qui, dans la base de connaissance initiale, font partie du voisinage d'un terme général.
Le voisinage sémantique d'un terme dans la base de connaissances de généralisation 30 est l'ensemble des termes généraux dont il fait partie du voisinage sémantique dans la base de connaissance 26, mais chacun de ces termes généraux est représenté dans le voisinage par son instance réelle ou une instance artificielle, en fonction de la distance entre ce terme général et le terme considéré.
Ainsi, comme représenté sur la figure 3, dans la base de connaissance de généralisation 30, les termes B et C ont pour voisins l'instance réelle du terme général A alors que les termes E, et F et G, qui ne sont pas des voisins du terme général A, sont voisins de l'instance artificielle de A.
Grâce à ce mode de réalisation, une requête comportant le seul terme général A permettra de retrouver une ressource documentaire comportant le seul terme B avec un niveau de pertinence plus élevé qu'une ressource documentaire comportant le seul terme E. L'extension de la requête comportant le terme général A en une requête comportant le terme général A et son instance artificielle permet de retrouver le second document, mais avec un niveau de pertinence inférieur au premier document, du fait de la distance entre le terme général A et son instance artificielle dans la base de connaissance de limitation 28. Il apparaît clairement qu'un système d'indexation et de recherche à extension de requêtes selon l'invention permet d'optimiser la recherche de ressources documentaires en maîtrisant l'extension d'une requête.
On notera cependant que l'invention n'est pas limitée au mode de réalisation décrit précédemment.
En effet, en variante, les moyens de stockage 10 peuvent ne pas comporter de base de connaissance de limitation 28 et de base de connaissance de généralisation 30 générées à partir de la base de connaissance 26.
Dans ce cas, les moyens 20 de généralisation de l'indexation sont complètement intégrés dans le moteur d'indexation 12 et sont reliés en lecture à la base de connaissance 26. Ils comportent alors des moyens d'extraction uniquement de termes généraux de la base de connaissance 26, dont les termes qui leurs sont fournis en entrée sont voisins.
De la même façon, dans ce cas, les moyens de généralisation de requêtes 35 sont complètement intégrés dans le moteur de recherche 14 et sont identiques aux moyens 20 de généralisation de l'indexation.
Enfin, dans ce cas également, les moyens de limitation de l'extension 36 sont complètement intégrés dans le moteur de recherche 14 et sont reliés en lecture à la base de connaissance 26. Ils sont adaptés pour ajouter aux termes qui leurs sont fournis, uniquement des termes voisins des termes initiaux non généraux de la base de connaissance 26.

Claims

REVENDICATIONS
1. Système d'indexation et de recherche comportant des moyens (10) de stockage d'une base d'indexation (24), des moyens (22) d'indexation de ressources (18) pour la création et la mise à jour de la base d'indexation (24), des moyens (40) de recherche de ressources adaptés pour interroger la base d'indexation (24) à partir d'une requête, et des moyens (38) d'extension de requêtes pour l'obtention d'une requête étendue, à partir d'une requête initiale (34) formulée par un utilisateur et comportant des termes initiaux (Ri), par l'ajout à cette requête initiale (34) de termes voisins des termes initiaux, caractérisé en ce que les moyens d'extension (38) comportent des moyens (36) de limitation de l'extension de la requête initiale par l'ajout à celle-ci uniquement de termes voisins des termes initiaux non généraux, c'est-à-dire ne comportant pas un trop grand nombre de termes voisins.
2. Système d'indexation et de recherche selon la revendication 1 , caractérisé en ce qu'il comporte des moyens (18) d'extraction de termes (T-i ,T2 ) à partir de chaque ressource (18) et des moyens (20) de généralisation de l'indexation de ladite ressource (18) par l'ajout, à ces termes extraits, de termes généraux (T3) dont ils sont voisins.
3. Système d'indexation et de recherche selon la revendication 1 ou 2, caractérisé en ce que les moyens (38) d'extension de la requête comportent des moyens (35) de généralisation de la requête initiale par l'ajout, aux termes initiaux de la requête, de termes généraux dont ils sont voisins.
4. Système d'indexation et de recherche selon l'une quelconque des revendications 1 à 3, caractérisé en ce que les moyens d'extension (38) comportent une base de connaissance sémantique (26) comprenant un ensemble de termes (Ti, T2, T3, Ri, R2, R3, R ; A, B, C, D, E, F, G) parmi lesquels se trouvent les termes initiaux (R-i) de la requête, chaque terme étant de façon optionnelle associé à une liste d'au moins un terme voisin pris dans cette base de connaissance sémantique.
5. Système d'indexation et de recherche selon la revendication 4, caractérisé en ce qu'un terme (Ti, T2, T3, R^ R2, R3, R4 ; A, B, C, D, E, F, G) de la base de connaissance sémantique (26) est un terme général s'il est associé à une liste comportant un nombre de termes voisins supérieur à un seuil prédéterminé.
6. Système d'indexation et de recherche selon les revendications 4 et 5, caractérisé en ce qu'il comporte des moyens de génération d'une base de connaissance de limitation (28) et d'une base de connaissance de généralisation (30) à partir de la base de connaissance sémantique (26), la base de connaissance de limitation étant associée aux moyens de limitation de l'extension et la base de connaissance de généralisation étant indépendante de la base de connaissance de limitation et associée aux moyens (35) de généralisation (35) de la requête initiale.
7. Système d'indexation et de recherche selon la revendication 6, caractérisé en ce que la base de connaissance de limitation (28) comporte l'ensemble des termes de la base de connaissance sémantique et en ce que ses termes correspondant aux termes généraux de la base de connaissance sémantique ne sont associés à aucune liste de termes voisins.
8. Système d'indexation et de recherche selon la revendication 6 ou 7, caractérisé en ce que la base de connaissance de généralisation (30) comporte l'ensemble des termes de la base de connaissance sémantique, et en ce que les listes de termes voisins qu'elle contient comportent uniquement les termes correspondant à des termes généraux de la base de connaissance sémantique.
9. Procédé de recherche de ressources indexées (18) comprenant les étapes suivantes : - émission d'une requête initiale (34) formulée par un utilisateur et comportant des termes initiaux (R-i) ;
- extension de la requête initiale (34) par l'ajout à cette requête initiale de termes voisins des termes initiaux (Ri), caractérisé en ce que l'étape d'extension comporte une sous-étape d'extension de la requête initiale par l'ajout à celle-ci uniquement de termes (R4) voisins des termes initiaux non généraux, c'est-à-dire ne comportant pas un trop grand nombre de termes voisins.
10. Procédé de recherche de ressources indexées (18) selon la revendication 9, caractérisé en ce que l'étape d'extension comprend une sous-étape de généralisation de la requête initiale par l'ajout, aux termes initiaux de la requête, de termes généraux (R2, R3) dont ils sont voisins.
11. Procédé d'indexation de ressources comportant une étape d'extraction de termes (Ti, T2) à partir de chaque ressource (48), caractérisé en ce qu'il comporte en outre une étape de généralisation de l'indexation de ladite ressource par l'ajout, à ces termes extraits, de termes généraux (T3) dont ils sont voisins.
12. Moteur d'indexation (12) de ressources (18) comportant des moyens (16) d'extraction de termes à partir de chaque ressource, caractérisé en ce qu'il comporte des moyens (20) de généralisation de l'indexation de ladite ressource par l'ajout, à ces termes extraits, de termes généraux dont ils sont voisins.
13. Moteur de recherche (14) de ressources indexées (18) comportant des moyens (32) d'extraction de termes initiaux à partir d'une requête initiale (34) formulée par un utilisateur, des moyens (40) de recherche de ressources (18) adaptés pour interroger une base d'indexation (24) à partir d'une requête (34), et des moyens (38) d'extension de requêtes pour l'obtention d'une requête étendue à partir de la requête initiale, caractérisé en ce que les moyens d'extension (38) comportent des moyens (36) de limitation de l'extension de la requête initiale par l'ajout à celle-ci uniquement de termes voisins des termes initiaux non généraux, c'est-à-dire ne comportant pas un trop grand nombre de termes voisins.
14. Moteur de recherche (14) de ressources indexées selon la revendication 13, caractérisé en ce que les moyens d'extension (38) comportent des moyens (35) de généralisation de la requête initiale par l'ajout, aux termes initiaux de la requête, de termes généraux dont ils sont voisins.
EP03718820A 2002-01-31 2003-01-30 Systeme et procede d indexation et de recherche a extension de requetes, moteurs d indexation et de recherche Pending EP1470502A2 (fr)

Applications Claiming Priority (3)

Application Number Priority Date Filing Date Title
FR0201166A FR2835334A1 (fr) 2002-01-31 2002-01-31 Systeme et procedes d'indexation et de recherche a extension de requetes, moteurs d'indexation et de recherche
FR0201166 2002-01-31
PCT/FR2003/000287 WO2003065249A2 (fr) 2002-01-31 2003-01-30 Systeme et procede d'indexation et de recherche a extension de requetes, moteurs d'indexation et de recherche

Publications (1)

Publication Number Publication Date
EP1470502A2 true EP1470502A2 (fr) 2004-10-27

Family

ID=27619791

Family Applications (1)

Application Number Title Priority Date Filing Date
EP03718820A Pending EP1470502A2 (fr) 2002-01-31 2003-01-30 Systeme et procede d indexation et de recherche a extension de requetes, moteurs d indexation et de recherche

Country Status (4)

Country Link
US (1) US20050234871A1 (fr)
EP (1) EP1470502A2 (fr)
FR (1) FR2835334A1 (fr)
WO (1) WO2003065249A2 (fr)

Families Citing this family (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US7672928B2 (en) * 2004-09-30 2010-03-02 Microsoft Corporation Query forced indexing
US7979461B2 (en) * 2007-02-15 2011-07-12 Medio Systems, Inc. Extended index searching

Family Cites Families (8)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US5850561A (en) * 1994-09-23 1998-12-15 Lucent Technologies Inc. Glossary construction tool
US5649221A (en) * 1995-09-14 1997-07-15 Crawford; H. Vance Reverse electronic dictionary using synonyms to expand search capabilities
US6076051A (en) * 1997-03-07 2000-06-13 Microsoft Corporation Information retrieval utilizing semantic representation of text
US6154213A (en) * 1997-05-30 2000-11-28 Rennison; Earl F. Immersive movement-based interaction with large complex information structures
US6128613A (en) * 1997-06-26 2000-10-03 The Chinese University Of Hong Kong Method and apparatus for establishing topic word classes based on an entropy cost function to retrieve documents represented by the topic words
GB2338089A (en) * 1998-06-02 1999-12-08 Sharp Kk Indexing method
US6735583B1 (en) * 2000-11-01 2004-05-11 Getty Images, Inc. Method and system for classifying and locating media content
US7133862B2 (en) * 2001-08-13 2006-11-07 Xerox Corporation System with user directed enrichment and import/export control

Non-Patent Citations (2)

* Cited by examiner, † Cited by third party
Title
SATOH K ET AL: "IMPROVEMENTS ON QUERY TERM EXPANSION AND RANKING FORMULA", TEXT RETRIEVAL CONFERENCE. PROCEEDINGS, XX, XX, 1 November 1995 (1995-11-01), pages 475 - 481, XP001133729 *
See also references of WO03065249A3 *

Also Published As

Publication number Publication date
US20050234871A1 (en) 2005-10-20
WO2003065249A3 (fr) 2004-03-25
FR2835334A1 (fr) 2003-08-01
WO2003065249A2 (fr) 2003-08-07

Similar Documents

Publication Publication Date Title
EP2188744B1 (fr) Installation de gestion d'une base de données
EP1364316A2 (fr) Dispositif d'extraction d'informations d'un texte a base de connaissances
FR2799023A1 (fr) Procede de classification thematique de documents, module de classification thematique et moteur de recherche incorporant un tel module
EP0593354A1 (fr) Procédé d'aide à l'optimisation d'une requête d'un système de gestion de base de données relationnel
EP1470501A2 (fr) Procedes et systemes de recherche et d'association de ressources d'information telles que des pages web
EP1316220A1 (fr) Procede de compression/decompression de documents structures
FR3043817A1 (fr) Procede de recherche d’informations au sein d’un ensemble d’informations
EP3503483B1 (fr) Procédé et serveur d'attribution d'adresses topologiques à des commutateurs de réseau, programme d'ordinateur et grappe de serveurs correspondants
EP1926032A1 (fr) Procede de recherche hierarchique sur un graphe conditionnel
WO2014173882A1 (fr) Procédé et dispositif d'extraction automatique de thèmes à partir d'au moins un document contenant du texte
EP1470502A2 (fr) Systeme et procede d indexation et de recherche a extension de requetes, moteurs d indexation et de recherche
CN100524300C (zh) 内容定向的索引和搜索方法与系统
FR2854259A1 (fr) Systeme d'aide a la generation de requetes et procede correspondant
EP1054332B1 (fr) Système et procédé de gestion d'attributs dans un environnement orienté objet
EP1211614A1 (fr) Procédé de recherche dans une structure hiérarchique d'objets
FR3099600A1 (fr) Méthode de jugement du degré de similarité entre deux systèmes techniques quelconques
BE1013153A3 (fr) Procede et systeme de prelevement d'information.
EP2439659A1 (fr) Procédé de mise à jour d'un index inversé et serveur mettant en oeuvre ce procédé
EP2245555A1 (fr) Procede d'identification d'un document multimedia dans une base de reference, programme d'ordinateur, et dispositif d'identification correspondants
EP1801716A1 (fr) Diffusion de données par groupement
FR3108190A1 (fr) Procédé et système de détection d’un motif commun dans un ensemble de fichiers texte
Khrouf et al. Conception d'entrepôts de documents décisionnels.
FR3138220A1 (fr) Procédé de détection d'anomalies réseau
FR2939538A1 (fr) Procede de recherche de correspondances entres differentes sources de donnees.
WO2006077196A1 (fr) Procede de generation d'index textuel a partir d'une annotation vocale

Legal Events

Date Code Title Description
PUAI Public reference made under article 153(3) epc to a published international application that has entered the european phase

Free format text: ORIGINAL CODE: 0009012

17P Request for examination filed

Effective date: 20040729

AK Designated contracting states

Kind code of ref document: A2

Designated state(s): AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HU IE IT LI LU MC NL PT SE SI SK TR

AX Request for extension of the european patent

Extension state: AL LT LV MK RO

17Q First examination report despatched

Effective date: 20041229

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: EXAMINATION IS IN PROGRESS