EP3058484A1 - Procede de decouverte d'un ensemble de sources definissant des pages web - Google Patents
Procede de decouverte d'un ensemble de sources definissant des pages webInfo
- Publication number
- EP3058484A1 EP3058484A1 EP14795947.2A EP14795947A EP3058484A1 EP 3058484 A1 EP3058484 A1 EP 3058484A1 EP 14795947 A EP14795947 A EP 14795947A EP 3058484 A1 EP3058484 A1 EP 3058484A1
- Authority
- EP
- European Patent Office
- Prior art keywords
- index
- url
- profile
- relevance
- page
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Withdrawn
Links
Classifications
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F16/00—Information retrieval; Database structures therefor; File system structures therefor
- G06F16/90—Details of database functions independent of the retrieved data types
- G06F16/95—Retrieval from the web
- G06F16/951—Indexing; Web crawling techniques
Definitions
- the field of the invention relates to methods for exploring web pages of a network such as the Internet.
- the field of the invention applies to methods for discovering new sources of unknown data a priori from a set of URLs known to a user or keywords.
- the field of the invention relates to crawlers and their applications for the discovery of poorly referenced sources within a network.
- a second drawback is that the search results are strongly conditioned to the definition of the terms or expressions chosen to build a query.
- the user does not always know, a priori, the wording of the terms of the domain he wants to discover.
- it may happen that the user has difficulty in formulating an effective query because the terms can have several meanings, several spellings, different synonyms, etc.
- Some search engines do not allow you to define nuances or complex queries.
- the crawlers take into account the importance of certain tags such as the title or URLs of a WEB page, or a part of that page.
- the URLs of the pages explored are not themselves or little taken into account to explore new pages.
- Chakrabarti, van den Berg & Dom 1999 discloses a method for taking into account the tree structure of an internet directory and interpreting it as a taxonomic basis defining links between URLs to define levels of relevance.
- this classification has the disadvantage of favoring sources known or already well referenced.
- One of the objectives of the agents is to find relevant results with regard to search criteria and to take into account the results of the other agents.
- a disadvantage of this architecture is that part of the WEB remains unexplored and is not suitable for taking into account new URLs.
- the invention aims to overcome the aforementioned drawbacks.
- An object of the invention relates to a method of discovering a set of sources defining WEB pages.
- the process advantageously comprises:
- One advantage is to allow a formulation of a query independent of the terminology chosen by a user but by taking into account a set of WEB pages defining a problem around one or more interest (s).
- Another advantage is to allow to model complex queries. Another advantage is to allow the collection of unknown URLs that will themselves be explored.
- the collection of a set of data of each page designated by a seed comprises:
- the semantic distance is calculated by a comparison of the keywords and / or common concepts of the profile index and a seed taking into account the indices of relevance.
- One advantage is to take into account the semantic modeling of terms and concepts, their approximation by taking into account the type of relationship between concept and their level of relationship. With regard to keywords, their occurrence can be taken into account to determine a relevance index.
- the indices of relevance of concepts can be high when for example a set of concepts includes concepts close by their relation.
- the exploration priority index attributed to a URL is identical to the relevance level of the WEB page comprising the said URL.
- the exploration priority index attributed to a URL is calculated by taking into account the relevance level of the WEB page and a local context of a URL of said WEB page.
- the local context of a URL comprises keywords and concepts either of the URL or of a paragraph comprising said URL of the WEB page.
- the collection of a data set of each page designated by a URL comprises:
- a collection of data from at least one "parent" WEB page corresponding to a URL pointing to a page of a seed is explored when the first level of relevance is greater than a first predefined threshold, the keywords and concepts. of the parent page being referenced in the profile index, and the URLs of the parent page are stored in memory and ordered in the URL list.
- a URL of the ordered list having a crawling priority index greater than a second predefined threshold, can be automatically defined as a new seed in the seeds list of the user profile, a new profile index being redefined by a user. calculation of the relevance indices of the keywords and the concepts of the profile.
- a relevant URL can define a new seed that allows for the consideration of new keywords or concepts.
- a set of keywords of the profile index having a relevance index greater than a third predefined threshold makes it possible to define a query of a search engine, a set of first results defining a set of new seeds in the seed list of the user profile, a new profile index being redefined by calculating the relevance indices of the keywords and the concepts of the profile.
- One advantage is to take into account sources from a conventional search engine to supplement seeds already identified by the user. This allows to inject other seeds to find other pages.
- the ordered list of URLs is reordered according to a calculation of the new search priority indexes of each URL, said indices being recalculated during the redefinition of a new profile.
- One advantage is to obtain an updated list of the ordered URL list according to a level of exploration priority. This allows to obtain relevant results in a minimum of time. URLs with a high crawl priority index are searched first.
- each keyword and / or concept can be weighted according to a weighting index calculated from a user instruction.
- a relevance feedback mechanism allows the user to provide a satisfaction indicator for a given page. This return makes it possible to generate a weighting index reflected on each keyword and concept of said web page.
- the user instruction comprises at least one satisfaction indicator of at least one key word or at least one concept making it possible to generate a new relevance index of said at least one key word or of said at least one concept when they are already stored in the index.
- the user instruction comprises the definition of at least one key word or concept and an associated index of relevance and the addition of said at least one keyword or of said at least one concept in the thematic index.
- each URL collected during the exploration is integrated in the ordered list of URLs according to its exploration priority index.
- a comparison of the exploration priority indices of a URL before and after the update of a user profile allows to generate a regression index of a keyword or a concept newly taken into account in the index following the update of the user profile.
- a list of pages is generated and ordered in ascending or descending order of the level of relevance of each page.
- FIG. 1 is a synthetic scheme of three steps of the inventive method
- FIG. 2 is a block diagram of the principles of exploration according to the method of the invention.
- FIG. 3 an example case of a new seed taken into account in the user profile according to the method of the invention.
- Figure 1 shows a block diagram of the main steps of the method of the invention.
- a first step is to define a user profile noted PROFIL in Figure 1.
- the user profile includes at least one list of links defining URLs pointing to a web page of a server on the Internet.
- the URL list is initially defined by a user. They are called “seeds" because they are a starting point for a search on a network of a set of WEB pages.
- This seed list includes at least one URL but preferably includes a plurality of URLs.
- the user profile includes a list of keywords and / or a list of concepts that have been extracted from the pages corresponding to the seeds, or given by the user.
- a concept is defined according to a given ontology that can be modeled for example in a semantic database.
- the concepts may be interrelated in some cases and may be independent of other concepts in other cases.
- a link exists between two concepts, it can define a transverse relation or a hierarchical relation.
- a hierarchical relationship may establish a relationship between the "car” concept and the "diesel car” concept.
- a cross-sectional relationship may correspond, for example, to the relationship between the two concepts: "car” and "bus”.
- the concepts "car” and “bus” may have a parent concept "transport vehicle” which establishes two hierarchical relationships with the concepts children "car” and "bus”.
- a level of a relationship can correspond to the number of links in the semantic model separating two concepts.
- the concept “motorcycle” and the concept “handlebar” can have a level of relation equal to 1.
- the concepts “transport vehicle” and the concept “handlebar” can have a level of relation equal to 2.
- a key word can include a term or a set of terms.
- a key word can form a sentence, see a paragraph.
- the keywords can be contextualized by a field also called "tag".
- a field defines the nature of a term or group of terms, for example: a text field, a link field, a title field, and so on.
- an automatic natural language processing can be used.
- the latter makes it possible to take into account the language of a term, the different spellings of certain terms, the rules of grammar and conjugation that apply to a term or a series of terms, the semantic roots of terms or expressions , anaphoras and synomymes, etc.
- the URLs contained in each crawled page can also be collected as data in the profile index.
- the terms that make up a URL can be indexed and get an index of relevance.
- occurrences of terms in multiple URLs may also have a weighting of their relevance index.
- the user profile includes a profile index rated INDEX PROFIL.
- the latter includes the keywords and concepts extracted from the WEB pages corresponding to the seeds as well as a relevance index for each keyword and each concept.
- the index of relevance can be calculated according to the occurrences of the keywords and the occurrences of the concepts found in the Web pages pointed by each seed.
- the relevance index of a concept can take into account the relationships between concepts generated at the time of collection of WEB pages of the seeds, and the type of established relationship: hierarchical or transverse and the level of relationship.
- the method of the invention therefore comprises a manual step which consists in defining a set of seeds such as URLs for example.
- the method then comprises an automatic step of collecting data from the WEB pages of the seeds and extracting the keywords and concepts and assigning each of them a relevance index.
- the method of the invention is capable of indexing all the data extracted from the WEB pages of the seeds.
- the method of the invention makes it possible to assign a level of relevance to each WEB page corresponding to a seed for example by summing the indices of relevance of the keywords and concepts of the WEB page.
- a second step noted EX consists of an exploration of a network such as for example Internet and logics and prioritization of exploration of WEB pages.
- the crawling step can change the user profile by adding new seeds and reorienting the crawl by modifying the start URLs and recalculating all cues and levels. relevance of the WEB pages whose URLs were collected. A new seed, as detailed below, can also be used to recalculate the priority indexes of the URLs collected during the exploration.
- a third step is to present a list of ordered results of WEB pages collected in order of relevance to a user. Exploration and collection
- FIG. 2 provides a better understanding of the principles of network exploration comprising WEB pages according to the method of the invention. It is considered that the step of developing the profile and in particular the profile index are already established.
- a crawler is executed by means of a calculator, a machine such as a PC or a server from each seed. Web pages corresponding to the seeds are analyzed and retrieved as a set of data, part of which is indexed in the profile index as previously detailed.
- FIG. 2 shows a URL block Q which defines the URLs of the searched web pages.
- the Q URL block includes URLs that define URLs that are collected as you crawl.
- the Q URL block may also include seed URLs.
- the arrow 10 makes it possible to define the operation which consists of choosing a first collected URL and starting the exploration of the corresponding WEB page.
- the operation of choosing a URL is done in order of priority.
- the method of the invention makes it possible to organize an ordered list of URLs according to a priority of exploration. This ordered list corresponds to the URL Q list.
- the Q URL block includes the retrieved URLs as well as their browsing priority index.
- a query 1 1 can find the WEB page on the network and collect all the data on said page.
- the recovery of the data of a page is shown schematically by the arrow 12.
- a DOC database makes it possible to temporarily archive the collected data of all the pages explored.
- the URLs of each searched WEB page are stored in an L memory.
- a calculation operation of a crawling priority index is performed to record the URL and its crawling priority index in the ordered URL list.
- Data from the DOC database is indexed in an index IND RESULT which allows to associate each page collected a level of relevance.
- the relevance level of a WEB page is calculated from a semantic distance established between the profile index and the data of the collected WEB page.
- the semantic distance may correspond to a comparison operation of the data collected with the data of the user profile by means of a function for measuring the similarity of the data.
- the similarity function is represented by block C of FIG.
- Block C makes it possible to carry out similarity operations by making the comparisons between the user profile and the data collected from a WEB page.
- Block C comprises calculation means such as a computer of a PC or a server.
- the calculator of the block C makes it possible to assign on the one hand a level of relevance to each page explored and an index of exploration priority to each URL extracted from a WEB page collected. This last operation is represented by the arrow 16 in FIG.
- a “relevance index” a value assigned to a keyword or a concept, this attribution takes place as soon as the user profile is constituted or modified.
- a “relevance level” a value assigned to a WEB page. Web pages corresponding to the seeds can also have a level of relevance.
- An "exploration priority index” a value assigned to a URL to classify it in the URL block Q.
- the URL stack Q is constantly modified by the addition of new collected URLs having a crawling priority index.
- the new URL is inserted in the ordered list between two URLs already present whose exploration priority indexes are respectively lower and higher than the new index of the new URL.
- New keywords or concepts The user profile may include the addition of keywords and concepts in addition to those already defined.
- keywords and concepts can be defined manually by a user, for example by means of an interface for editing his user profile.
- these can be retrieved from the pages already collected and judged as relevant by the user.
- the keywords and / or concepts already existing in the profile will have their weighting increase
- neighboring concepts that is to say hierarchically or transversally close to those already present in the profile, can be imported from a semantic base.
- the DBpedia database collects semantic concepts similar to those collected through seeds.
- each of its operations may be subject to validation by the user.
- the method of the invention makes it possible to take into account new seeds during the exploration.
- New seeds can be defined for example manually by a user who wishes to improve during exploration the position of the starting point of the exploration. He may also wish to reorient research by taking into account a new seed.
- the seed web page is crawled and the data is collected to generate a relevancy level of the page.
- URLs from this same page are retrieved and a crawl priority index is assigned to each URL to be ordered in the URL Q list.
- new keywords and concepts are extracted from the WEB page corresponding to the new seed
- each relevance index is recalculated according to the data collected from the new seed.
- the relevancy levels of each WEB page in the IND RESULT index are recalculated to reorder a new results list taking into account the new seed.
- the system can also propose as a new seed a URL of a link pointing to a seed already defined in the user profile.
- a seed can automatically be defined when the relevance level of a page exceeds a predefined threshold.
- an alert can be raised to warn the user and if necessary ask him confirmation of the taking into account of the new seed.
- the method of the invention allows, in this case, to feed the profile of a new seed.
- the profile index is then modified, the indices of relevance are automatically recalculated as explained above.
- a new seed can also be defined automatically when a collected URL is detected in the same local context of a web page of a seed already present in the user profile.
- the local context can be defined by a section of a WEB page or by a tag grouping the two URLs, such as a "title" tag. This may be the case when bibliographic sources are cited together.
- the local context can also be defined by a paragraph corresponding to a number of terms or sentences before and after the URL concerned, or by a thematic segmentation method.
- the method can make it possible to extract a number N of pages having the highest relevance levels before and after taking into account a new seed.
- the user can then be asked to choose the list of results that best fits his expectations.
- the decision to add or delete a new seed can be made by the user.
- This decision refines the relevant keywords and concepts in the user profile in particular by generating a weighting index that applies to each relevance index concerned by the decision of the user
- An index of relevance is for example concerned by the decision of the user when before and after the addition of the seed its variation is greater than a predefined threshold.
- a user can assign a satisfaction index to a page collected and ordered in the index of the results.
- a user action may consist in removing the page from the list.
- a weighting index can be applied to the indices of relevance of the keywords and concepts in common between the deleted page of the INDEX RESULT with the INDEX PROFILE. They are discounted in the sense that their importance is less taken into account when calculating the relevance levels of the pages.
- the URL associated with the removed page can also be removed from the URL Q list.
- a user action may consist in applying a manual weighting to one or more keywords or selected concepts in the profile index. It can also be to add a concept or a keyword not already present in the index of profile during the collection of the pages corresponding to the seeds.
- an operation may consist in applying a weighting index to a passage of a WEB page such as a paragraph.
- the keywords and concepts belonging to this paragraph can inherit a favorable weighting in the profile index.
- the browsing priority index of said URLs may inherit an index of favorable weighting to increase for example the exploration priority index.
- the action of the user may be to indicate a particular importance on certain keywords, concepts, pages or URLs but it may also consist of indicating a lack of interest.
- the weighting generated by the method of the invention may be a positive or negative weighting.
- the method of the invention can be parameterized to collect WEB page data for a predefined duration.
- its operation can be continuous so as to embellish new pages, new seeds and make new calculations of relevance index and exploration priority index as and when exploration.
- the exploration priority index of a URL address may correspond to the level of relevance of the WEB page that understands it. In this case, all URLs on a WEB page inherit the same browse priority index.
- the exploration priority index may be a combination of the relevance level of the WEB page and a local index corresponding to a local relevance of the WEB page defining a context to the URL.
- the context can be for example the terms included in the URL or the terms of a paragraph including the URL.
- Concepts can be generated from the context terms of the URL and be taken into account in the calculation of exploration priority indices.
- FIG. 3 represents a case in which the profile comprises 3 seeds of departure.
- the 3 seeds are 3 URLs that each point to 3 WEB pages: P1, P2, P3.
- Each page Pi comprises a number of links defining URLs pointing to other WEB pages: P4, P5, P6, P7, P8 and P9 in the example of FIG.
- Each URL, denoted URL j j in FIG. 3, of each page, denoted by P , is stored in the base L.
- the method of the invention makes it possible to calculate an exploration priority index as detailed above.
- Figure 3 illustrates the case where the URL 91 includes a crawling priority index higher than a predefined threshold allowing it to be reinjected in the user profile as a new seed thus defining a 4 th seed. The user can confirm or not this action to validate a new profile. If the new seed is accepted, the user profile can reindex all the keywords and concepts already stored with the taking into account of the data corresponding to the new page pointed by URL91.
- the method of the invention advantageously makes it possible to define a particularly efficient mode of exploration for discovering sources of data that are poorly referenced on the WEB.
- the manner of defining the user profile makes it possible to take effective account of a user's interests, in particular by semantic modeling of his expression of interests.
Landscapes
- Engineering & Computer Science (AREA)
- Databases & Information Systems (AREA)
- Theoretical Computer Science (AREA)
- Data Mining & Analysis (AREA)
- Physics & Mathematics (AREA)
- General Engineering & Computer Science (AREA)
- General Physics & Mathematics (AREA)
- Information Transfer Between Computers (AREA)
- Information Retrieval, Db Structures And Fs Structures Therefor (AREA)
Abstract
Le procédé de découverte d'un ensemble de sources définissant des pages WEB comprend : • une définition d'un profil utilisateur comprenant: - une liste d'adresses URL définissant chacune une graine; - un index de profil; • une collecte d'un ensemble de données de chaque page désignée par une URL de la graine, la collecte comprenant: - une définition d'un ensemble de mots clefs; - une attribution d'au moins un indice de pertinence; - une indexation de chaque mot clef dans l'index de profil; • une collecte des URL de chaque page WEB explorée; • une attribution d'un niveau de pertinence à chaque page collectée; • un calcul d'un indice de priorité d'exploration de chaque URL; • une création d'une liste ordonnée d'URL selon leur indice de priorité d'exploration; • un choix d'une nouvelle URL pour explorer automatiquement une nouvelle page WEB.
Description
PROCEDE DE DECOUVERTE D'UN ENSEMBLE DE SOURCES DEFINISSANT DES PAGES WEB
DOMAINE
Le domaine de l'invention concerne les procédés permettant d'explorer les pages WEB d'un réseau tel que le réseau internet. Le domaine de l'invention s'applique aux procédés permettant de découvrir de nouvelles sources de données non connues à priori à partir d'un ensemble d'URL connu d'un utilisateur ou de mots clés. En outre, le domaine de l'invention concerne des robots d'exploration et leurs applications pour la découverte de sources faiblement référencées au sein d'un réseau. ETAT DE L'ART
Actuellement, il existe des moteurs de recherche connus du grand public qui permettent de présenter des résultats pertinents au vu d'une requête formulée par un utilisateur. Les résultats obtenus sont essentiellement organisés selon la popularité des pages.
Ainsi, plus une page web est populaire, plus sa pertinence est élevée dans son référencement.
Ceci présente un premier inconvénient lorsque l'utilisateur s'intéresse à des sources de données peu connues du grand public et qui sont faiblement indexées ou peu visitées.
Un second inconvénient est que les résultats de la recherche sont fortement conditionnés à la définition des termes ou expressions choisis pour construire une requête. Or, l'utilisateur ne connaît pas toujours, à priori, la formulation des termes du domaine qu'il souhaite découvrir. Par ailleurs, il peut arriver que l'utilisateur ait du mal à formuler une requête efficace car les termes peuvent avoir plusieurs sens, plusieurs orthographes, différents synonymes, etc. Certains moteurs de recherche ne permettent pas de définir des nuances ou des requêtes complexes.
Les robots d'exploration prennent en compte l'importance de certaines balises telles que le titre ou les URL d'une page WEB, ou encore une partie de ladite page. En revanche, les URL des pages explorées ne sont elles-mêmes pas ou peu prises en compte pour explorer de nouvelles pages. Par exemple, Chakrabarti, van den Berg & Dom 1999 divulgue une
méthode permettant de prendre en compte l'arborescence d'un annuaire internet et de l'interpréter comme une base taxonomique définissant des liens entre URL pour définir des niveaux de pertinence. En revanche, cette classification a l'inconvénient de favoriser des sources connues ou déjà bien référencées.
Il existe également des approches multi-agents, les agents étant des robots comme par exemple des robots d'exploration. Ces approches sont basées sur des modèles d'intelligence artificielle pour explorer le WEB en répartissant les charges de calculs et les temps de découvertes.
Un des objectifs des agents est de trouver des résultats pertinents au regard de critères de recherche et la prise en compte des résultats des autres agents. Un inconvénient de cette architecture est qu'une partie du WEB reste inexplorée et qu'elle n'est pas adaptée à la prise en compte de nouvelles URL.
RESUME DE L'INVENTION
L'invention vise à pallier aux inconvénients précités.
Un objet de l'invention concerne un procédé de découverte d'un ensemble de sources définissant des pages WEB. Le procédé comprend avantageusement :
• une définition d'un profil utilisateur comprenant :
o une liste d'adresses URL définissant chacune une graine, chaque URL définissant un accès vers une page WEB comprenant un ensemble de données ;
o un ensemble de mots clefs et/ou de concepts ;
• une collecte d'un ensemble de données de chaque page désignées par une URL de la graine, la collecte comprenant :
o une définition d'un ensemble de mots clefs issus des termes collectés de chaque page ;
o une attribution d'au moins un indice de pertinence à au moins un mot clef selon au moins une donnée d'occurrence de chacun d'eux ;
o un ajout de chaque mots clefs dans le profil ;
• une collecte des URL de chaque page WEB explorée dans une mémoire ;
• une attribution d'un niveau de pertinence à chaque page collectée, le niveau de pertinence étant issu d'un calcul d'une distance sémantique entre les données de l'index de profil et les données collectées d'une page ;
• un calcul d'un indice de priorité d'exploration de chaque URL à collecter ;
• une création d'une liste ordonnée d'URL selon leur indice de priorité d'exploration ;
• un choix d'une nouvelle URL pour explorer automatiquement une nouvelle page WEB, le choix de l'URL étant déterminé par l'indice de priorité d'exploration de la liste d'URL ordonnée.
Un avantage est de permettre une formulation d'une requête indépendante de la terminologie choisie par un utilisateur mais par la prise en compte d'un ensemble de pages WEB définissant une problématique autour d'un ou plusieurs intérêt(s).
Un avantage est de permettre de modéliser des requêtes complexes. Un autre avantages est de permettre de collecter des URL non connues qui seront-elles-mêmes explorées.
Avantageusement, la collecte d'un ensemble de données de chaque page désignée par une graine comprend :
.· une génération d'un ensemble de concepts à partir d'une base de données sémantique ;
• une attribution d'au moins un indice de pertinence à au moins un concept
• une indexation du concept dans l'index de profil.
Avantageusement, la distance sémantique est calculée par une comparaison des mots clefs et/ou concepts communs de l'index de profil et d'une graine en prenant en compte les indices de pertinence.
Un avantage est de permettre de prendre en compte la modélisation sémantique de termes et concepts, leur rapprochement par la prise en compte du type de relation entre concept et leur niveau de relation. En ce qui concerne les mots clefs, leur occurrence peut être prise en compte pour déterminer un indice de pertinence. Les indices de pertinence des
concepts peuvent être élevés lorsque par exemple un ensemble de concepts comprend des concepts proches par leur relation.
Selon un mode de réalisation, l'indice de priorité d'exploration attribué à une URL est identique au niveau de pertinence de la page WEB comprenant la dite URL.
Selon un autre mode de réalisation, l'indice de priorité d'exploration attribué à une URL est calculé par la prise en compte du niveau de pertinence de la page WEB et d'un contexte local d'une URL de la dite page WEB.
Avantageusement, le contexte local d'une URL comprend des mots clefs et des concepts soit de l'URL, soit d'un paragraphe comprenant ladite URL de la page WEB.
Avantageusement, la collecte d'un ensemble de données de chaque page désignée par une URL comprend :
• la normalisation du contenu de la page ;
• la désambiguïsation sémantique des concepts générés.
Avantageusement, une collecte des données d'au moins une page WEB dite « parente » correspondant à une URL pointant vers une page d'une graine est explorée lorsque le premier niveau de pertinence est supérieur à un premier seuil prédéfini, les mots clefs et concepts de la page parente étant référencés dans l'index de profil, et les URL de la page parente étant stockées dans la mémoire et ordonnées dans la liste d'URL.
Avantageusement, une URL de la liste ordonnée, ayant un indice de priorité d'exploration supérieur à un second seuil prédéfini, peut être automatiquement définie comme une nouvelle graine dans la liste des graines du profil utilisateur, un nouvel index de profil étant redéfini par un calcul des indices de pertinence des mots clefs et des concepts du profil.
Un avantage est d'améliorer le profil utilisateur avec des pages jugées pertinentes par l'utilisateur. Une URL pertinente peut définir une nouvelle graine permettant la prise en compte de nouveaux mots clefs ou concepts.
Avantageusement, un ensemble de mots clefs de l'index de profil ayant un indice de pertinence supérieur à un troisième seuil prédéfini permet de définir une requête d'un moteur de recherche, un ensemble de premiers
résultats définissant un ensemble de graines nouvelles dans la liste de graines du profil utilisateur, un nouvel index de profil étant redéfini par un calcul des indices de pertinence des mots clefs et des concepts du profil.
Un avantage est de prendre en compte des sources issues d'un moteur de recherche conventionnel pour compléter les graines déjà repérées par l'utilisateur. Ceci permet d'injecter d'autres graines permettant de trouver d'autres pages.
Avantageusement, la liste ordonnée d'URL est réordonnée selon un calcul des nouveaux d'indices de priorité d'exploration de chaque URL, lesdits indices étant recalculés lors de la redéfinition d'un nouveau profil.
Un avantage est de permettre d'obtenir une liste à jour de la liste d'URL ordonnée selon un niveau de priorité d'exploration. Cela permet d'obtenir des résultats pertinents en un minimum de temps. Les URL ayant un important indice de priorité d'exploration sont explorées en priorité.
Avantageusement, chaque mot clef et/ou de concept peut être pondéré selon un indice de pondération calculé à partir d'une consigne utilisateur. Selon un mode de réalisation, un mécanisme de retour de pertinence permet à l'utilisateur de fournir un indicateur de satisfaction pour une page donnée. Ce retour permet de générer un indice de pondération répercuté sur chaque mot clef et concept de ladite page WEB.
Selon un autre mode de réalisation, la consigne utilisateur comprend au moins un indicateur de satisfaction d'au moins un mot clef ou au moins un concept permettant de générer un nouvel indice de pertinence dudit au moins un mot clef ou dudit au moins un concept lorsqu'ils sont déjà stockés dans l'index.
Selon un autre mode de réalisation, la consigne utilisateur comprend la définition d'au moins un mot clef ou d'un concept et d'un indice de pertinence associé et l'ajout dudit au moins un mot clef ou dudit au moins un concept dans l'index thématique.
Avantageusement, chaque URL collectée lors de l'exploration est intégrée dans la liste ordonnée d'URL en fonction de son indice de priorité d'exploration.
Avantageusement, une comparaison des indices de priorité d'exploration d'une URL avant et après la mise à jour d'un profil utilisateur
permet de générer un indice de régression d'un mot clef ou d'un concept nouvellement pris en compte dans l'index suite à la mise à jour du profil utilisateur.
Avantageusement, une liste de pages est générée et ordonnée selon un ordre croissant ou décroissant du niveau de pertinence de chaque page.
BREVE DESCRIPTION DES FIGURES
D'autres caractéristiques et avantages de l'invention ressortiront à la lecture de la description détaillée qui suit, en référence aux figures annexées, qui illustrent :
■ figure 1 : un schéma synthétique de trois étapes du procédé de l'invention ;
■ figure 2 : un schéma fonctionnel des principes d'exploration selon le procédé de l'invention ;
■ figure 3 : un cas d'exemple d'une nouvelle graine prise en compte dans le profil utilisateur selon le procédé de l'invention.
DESCRIPTION
La figure 1 représente un schéma fonctionnel des principales étapes du procédé de l'invention.
Définition du profil utilisateur
Une première étape consiste à définir un profil utilisateur noté PROFIL sur la figure 1 .
Le profil utilisateur comprend au moins une liste de liens définissant des URL pointant vers une page web d'un serveur sur le réseau internet. La liste d'URL est au départ définie par un utilisateur. Elles sont dénommées « graines », car elles constituent un point de départ d'une recherche sur un réseau d'un ensemble de pages WEB. Cette liste de graines comprend au moins une URL mais elle comprend préférentiellement une pluralité d'URL.
Le profil utilisateur comprend une liste de mots clefs et/ou une liste de concepts qui ont été extraits des pages correspondants aux graines, ou donnés par l'utilisateur.
Un concept est défini selon une ontologie donnée qui peut être modélisée par exemple dans une base sémantique. Ainsi, les concepts
peuvent avoir des relations entre eux dans certains cas et peuvent être indépendants vis à vis d'autres concepts dans d'autres cas. Lorsqu'un lien existe entre deux concepts, il peut définir une relation transversale ou une relation hiérarchique. Par exemple, une relation hiérarchique peut établir une relation entre le concept « voiture » et le concept « voiture à moteur diesel ». Une relation transversale peut correspondre par exemple à la relation entre les deux concepts : « voiture » et « bus ». Dans ce dernier cas, les concepts « voiture » et « bus » peuvent avoir un concept parent « véhicule de transport » qui établit deux relations hiérarchiques avec les concepts enfants « voiture » et « bus ».
Un niveau d'une relation peut correspondre au nombre de liens dans le modèle sémantique séparant deux concepts. Par exemple, le concept « moto » et le concept « guidon » peuvent avoir un niveau de relation égal à 1 . Dans ce cas, en conservant notre exemple précédent, les concepts « véhicule de transport » et le concept « guidon » peuvent avoir un niveau de relation égale à 2.
Les concepts sont en général générés à partir de termes et de leur occurrence à partir d'une base sémantique. Un mot clef peut comprendre un terme ou un ensemble de termes.
En outre, un mot clef peut former une phrase, voir un paragraphe.
Les mots clefs peuvent être contextualisés par un champ également appelé « balise ». Un champ permet de définir la nature d'un terme ou d'un groupe de termes comme par exemple : un champ texte, un champ lien, un champ titre, etc.
L'analyse des mots, des champs et de leur occurrence dans une page WEB permet de définir des mots clefs.
Selon un mode de réalisation amélioré, un traitement automatique du langage naturel peut être utilisé. Ce dernier permet de prendre en compte la langue d'un terme, les différentes orthographes de certains termes, les règles de grammaire et de conjugaison qui s'appliquent à un terme ou une suite de termes, les racines sémantiques de termes ou d'expressions, les anaphores et les synomymes, etc.
Les URL contenues dans chaque page explorée peuvent également être collectées en tant que données dans l'index de profil. Les termes qui composent une URL peuvent être indexés et obtenir un indice de
pertinence. En outre, les occurrences des termes présents dans plusieurs URL peuvent avoir également une pondération de leur indice de pertinence.
Le profil utilisateur comprend un index de profil noté INDEX PROFIL. Ce dernier comprend les mots clefs et concepts extraits des pages WEB correspondantes aux graines ainsi qu'un indice de pertinence pour chaque mot clef et chaque concept. L'indice de pertinence peut être calculé en fonction des occurrences des mots clefs et des occurrences des concepts trouvés dans les pages WEB pointés par chaque graine. En outre, l'indice de pertinence d'un concept peut prendre en compte les relations entre concepts générés au moment de la collecte des pages WEB des graines, et du type de relation établie : hiérarchique ou transversale et du niveau de relation.
Pour établir le profil utilisateur, le procédé de l'invention comprend donc une étape manuelle qui consiste à définir un ensemble de graines comme des URL par exemple. Le procédé comprend ensuite une étape automatique de collecte des données des pages WEB des graines et d'extraction des mots clefs et concepts et une attribution à chacun d'eux d'un indice de pertinence.
A ce stade, le procédé de l'invention est capable d'indexer l'ensemble des données extraites des pages WEB des graines. En outre, le procédé de l'invention permet d'attribuer un niveau de pertinence à chaque page WEB correspondante à une graine par exemple en sommant les indices de pertinence des mots clefs et concepts de la page WEB.
II peut exister d'autres modes de calcul prenant en compte l'importance de mots clefs ou de concepts, les niveaux de relation ou leur type.
Une seconde étape notée EX consiste en une exploration d'un réseau comme par exemple internet et des logiques et priorisation d'exploration de pages WEB. En outre, selon un mode de réalisation, l'étape d'exploration peut permettre de modifier le profil utilisateur en ajoutant de nouvelles graines et réorienter l'exploration par une modification des URL de départ et en recalculant tous les indices de pertinence et les niveaux de pertinence des pages WEB dont les URL ont été collectées. Une nouvelle graine comme détaillée ci-après peut également engager le recalcul des indices de priorité des URL collectées lors de l'exploration.
Enfin, une troisième étape consiste à présenter une liste de résultats ordonnés de pages WEB collectées selon un ordre de pertinence à un utilisateur. Exploration et collecte
La figure 2 permet de mieux comprendre les principes de l'exploration du réseau comprenant des pages WEB selon le procédé de l'invention. On considère que l'étape d'élaboration du profil et notamment de l'index de profil sont déjà établis.
Un robot d'exploration est exécuté au moyen d'un calculateur, d'une machine telle qu'un PC ou un serveur à partir de chaque graine. Les pages WEB correspondantes aux graines sont analysées et récupérées sous forme d'un ensemble de données dont une partie est indexée dans l'index de profil comme détaillé précédemment.
La figure 2 représente un bloc URL Q qui définit les URL des pages WEB explorées. Le bloc URL Q comprend les URL qui définissent des URL collectées au fur et à mesure de l'exploration. En outre, le bloc URL Q peut également comprendre les URL des graines.
La flèche 10 permet de définir l'opération qui consiste à choisir une première URL collectée et à commencer l'exploration de la page WEB correspondante. L'opération consistant à choisir une URL est effectuée selon un ordre de priorité. En effet, le procédé de l'invention permet d'organiser une liste d'URL ordonnée selon un ordre de priorité d'exploration. Cette liste ordonnée correspond à la liste URL Q. En conséquence, le bloc URL Q comprend les URL récupérées ainsi que leur indice de priorité d'exploration.
Lorsqu'une URL est choisie pour explorer une page WEB une requête 1 1 permet de retrouver la page WEB sur le réseau et de collecter toutes les données de ladite page. La récupération des données d'une page est schématisée par la flèche 12. Une base DOC permet d'archiver temporairement les données collectées de toutes les pages explorées. Les URL de chaque page WEB explorée sont stockées dans une mémoire L. Une opération de calcul d'un indice de priorité d'exploration est effectué de sorte à enregistrer l'URL ainsi que son indice de priorité d'exploration dans la liste ordonnée URL Q.
Des données de la base DOC sont indexées dans un index IND RESULT qui permet d'associer à chaque page collectée un niveau de pertinence. Le niveau de pertinence d'une page WEB est calculé à partir d'une distance sémantique établie entre l'index de profil et les données de la page WEB collectée.
La distance sémantique peut correspondre à une opération de comparaison des données collectées avec les données du profil utilisateur au moyen d'une fonction de mesure de la similarité des données. La fonction de similarité est représentée par le bloc C de la figure 2.
Les opérations d'affectation des niveaux de pertinence des pages WEB collectées à partir d'une mesure de similarité avec le profil utilisateur sont représentées par la flèche 17 de la figure 2.
Le bloc C permet d'effectuer les opérations de similarité en effectuant les comparaisons entre le profil utilisateur et les données collectées d'une page WEB.
Le bloc C comprend des moyens de calcul tels qu'un calculateur d'un PC ou d'un serveur. Le calculateur du bloc C permet d'affecter d'une part un niveau de pertinence à chaque page explorée et un indice de priorité d'exploration à chaque URL extraite d'une page WEB collectée. Cette dernière opération est représentée par la flèche 16 sur la figure 2.
On nomme ainsi :
• Un « indice de pertinence » : une valeur attribuée à un mot clef ou à un concept, cette attribution a lieu dès lors que le profil utilisateur est constitué ou modifié.
• Un « niveau de pertinence » : une valeur affectée à une page WEB. Les pages WEB correspondantes aux graines peuvent avoir également un niveau de pertinence.
• Un « indice de priorité d'exploration » : une valeur affectée à une URL pour la classer dans la pile du bloc URL Q.
Ainsi, lors de la collecte, la pile URL Q est constamment modifiée par l'ajout de nouvelles URL collectées ayant un indice de priorité d'exploration. La nouvelle URL est intercalée dans la liste ordonnée entre deux URL déjà présentes dont les indices de priorité d'exploration sont respectivement inférieurs et supérieurs au nouvel indice de la nouvelle URL.
Modification du profil utilisateur
Nouveaux mots clefs ou concepts
Le profil utilisateur peut comprendre l'ajout de mots clefs et de concepts en plus de ceux déjà définis.
Selon une variante de réalisation, des mots clefs et concepts peuvent être définis manuellement par un utilisateur par exemple au moyen d'une interface d'édition de son profil utilisateur.
Selon une seconde variante, ces derniers peuvent être récupérés dans les pages déjà collectées et jugées comme pertinentes par l'utilisateur. Dans ce cas, les mots clefs et/ou concepts déjà existants dans le profil verront leur pondération augmenter,
Selon une troisième variante, des concepts voisins, c'est-à-dire hiérarchiquement ou transversalement proches de ceux déjà présents dans le profil, peuvent être importés d'une base sémantique.
A titre d'exemple, la base DBpedia permet de collecter des concepts sémantiques proches de ceux collectés grâce aux graines.
Selon les modes d'implémentation, chacune de ses opérations peuvent être soumises à une validation de l'utilisateur.
Nouvelle Graine
Le procédé de l'invention permet de prendre en compte de nouvelles graines lors de l'exploration. De nouvelles graines peuvent être définies par exemple manuellement par un utilisateur qui souhaite améliorer en cours d'exploration la position du point de départ de l'exploration. Il peut également souhaiter réorienter la recherche par la prise en compte d'une nouvelle graine.
Dans ce cas, la page Web de la graine est explorée et les données sont collectées de sorte à générer un niveau de pertinence de la page. En outre, les URL de cette même page sont extraites et un indice de priorité d'exploration est affecté à chaque URL pour être ordonnée dans la liste URL Q.
Lorsqu'une nouvelle graine est définie, les indices de pertinence des mots clefs et des concepts déjà présents dans l'index de profil sont impactés puisque :
- d'une part, de nouveaux mots clefs et concepts sont extraits de la page WEB correspondant à la nouvelle graine ;
- d'autre part, des mots clefs et concepts extraits de la page de la nouvelle graine et déjà existant dans le profil utilisateur
permettent d'améliorer par exemple l'indice de pertinence car leur occurrence augmente.
Dans ce cas, chaque indice de pertinence est recalculé en fonction des données collectées issues de la nouvelle graine. En outre, les niveaux de pertinence de chaque page WEB de l'index IND RESULT sont recalculés de sorte à réordonner une nouvelle liste de résultats en prenant en compte la nouvelle graine.
Le système peut également proposer comme nouvelle graine une URL d'un lien pointant vers une graine déjà définie dans le profil utilisateur.
Selon un mode de réalisation, une graine peut automatiquement être définie lorsque le niveau de pertinence d'une page dépasse un seuil prédéfini. En outre, une alerte peut être levée pour en avertir l'utilisateur et au besoin lui demander la confirmation de la prise en compte de la nouvelle graine.
Le procédé de l'invention permet, dans ce cas de figure, d'alimenter le profil d'une nouvelle graine. L'index de profil est alors modifié, les indices de pertinences sont recalculés automatiquement comme exposé précédemment.
Une nouvelle graine peut également être définie automatiquement lorsqu'une URL collectée est détectée dans le même contexte local d'une page WEB d'une graine déjà présente dans le profil utilisateur.
Le contexte local peut être défini par une section d'une page WEB ou par une balise regroupant les deux URL, comme une balise « titre » par exemple. Cela peut être le cas quand des sources bibliographiques sont citées conjointement.
Le contexte local peut également être défini par un paragraphe correspondant à un nombre de termes ou de phrases avant et après l'URL considérée, ou par un procédé de segmentation thématique.
Lorsqu'une graine est ajoutée, le procédé peut permettre d'extraire un nombre N de pages ayant les niveaux de pertinence les plus élevés avant et après la prise en compte d'une nouvelle graine. L'utilisateur peut alors être invité à choisir la liste de résultats qui correspond le mieux à ses attentes. Dans ce cas, la décision d'ajout ou de suppression d'une nouvelle graine peut être prise par l'utilisateur. Cette décision permet d'affiner les mots clefs et concepts pertinents dans le profil utilisateur
notamment par la génération d'un indice de pondération qui s'applique à chaque indice de pertinence concerné par la décision de l'utilisateur
Un indice de pertinence est par exemple concerné par la décision de l'utilisateur lorsqu'avant et après l'ajout de la graine sa variation est supérieure à un seuil prédéfini.
Indice de satisfaction, indice de pondération
Selon un mode de réalisation, un utilisateur peut attribuer un indice de satisfaction à une page collectée et ordonnée dans l'index des résultats.
Selon une première variante, une action de l'utilisateur peut consister à retirer la page de la liste. Dans ce cas, un indice de pondération peut être appliqué aux indices de pertinence des mots clefs et des concepts en commun entre la page supprimée de l'INDEX RESULT avec l'INDEX PROFIL. Ils sont décotés au sens ou leur importance est moins prise en compte dans le calcul des niveaux de pertinence des pages. L'URL associée à la page retirée peut être également retirée de la liste URL Q.
Lorsqu'une action d'un utilisateur affecte l'index de profil, alors tous les niveaux de pertinence de pages déjà collectées peuvent être recalculés et la liste de pages est alors réordonnée. Les indices de priorité d'exploration des URL collectées et issues des pages collectées peuvent également être recalculés. Dans ce dernier cas, la liste URL Q est réordonnée.
Selon une seconde variante, une action de l'utilisateur peut consister à appliquer une pondération manuellement à un ou des mots clefs ou concepts choisis dans l'index de profil. Il peut s'agir également d'ajouter un concept ou un mot clef non déjà présent dans l'index de profil lors de la collecte des pages correspondantes aux graines.
Selon une troisième variante, une opération peut consister à appliquer un indice de pondération à un passage d'une page WEB comme par exemple un paragraphe. Dans ce cas, les mots clefs et concepts appartenant à ce paragraphe peuvent hériter d'une pondération favorable dans l'index de profil. En outre, si une ou plusieurs URL est /sont comprise(s) dans un paragraphe sélectionné dans une page WEB par un utilisateur alors l'indice de priorité d'exploration desdites URL peut hériter d'un indice de
pondération favorable permettant d'augmenter par exemple l'indice de priorité d'exploration.
L'action de l'utilisateur peut consister à indiquer une importance particulière sur certains mots clefs, concepts, pages ou URL mais elle peut également consister à indiquer un manque d'intérêt. Ainsi la pondération générée par le procédé de l'invention peut être une pondération positive ou négative.
Indice de priorité d'exploration
Selon un mode de réalisation, le procédé de l'invention peut être paramétré pour collecter des données de pages WEB pendant une durée prédéfinie. Selon un autre mode de réalisation, son fonctionnement peut être continu de sorte à agrémenter de nouvelles pages, de nouvelles graines et d'effectuer de nouveaux calculs d'indice de pertinence et d'indice de priorité d'exploration au fur et à mesure de l'exploration.
Selon un mode de réalisation simplifié, l'indice de priorité d'exploration d'une adresse URL peut correspondre au niveau de pertinence de la page WEB qui la comprend. Dans ce cas, toutes les URL d'une page WEB héritent du même indice de priorité d'exploration.
Selon une première variante, l'indice de priorité d'exploration peut être une combinaison du niveau de pertinence de la page WEB et d'un indice local correspondant à une pertinence locale de la page WEB définissant un contexte à l'URL. Le contexte peut être par exemple les termes compris dans l'URL ou encore les termes d'un paragraphe comprenant l'URL. Des concepts peuvent être générés à partir des termes du contexte de l'URL et être pris en compte dans le calcul des indices de priorité d'exploration.
La figure 3 représente un cas de figure dans lequel le profil comprend 3 graines de départ. Les 3 graines sont 3 URL qui pointent chacune vers 3 pages WEB : P1 , P2, P3. Chaque page Pi comprend un certain nombre de liens définissant des URL pointant vers d'autres pages WEB : P4, P5, P6, P7, P8 et P9 dans l'exemple de la figure 3.
Chaque URL, noté URLjj sur la figure 3, de chaque page, notée P,, est stockée dans la base L. Pour chaque URL, le procédé de l'invention permet de calculer un indice de priorité d'exploration comme détaillé précédemment. La figure 3 illustre le cas où l'URL 91 comprend un indice de priorité d'exploration supérieur à un seuil prédéfini lui permettant d'être
réinjectée dans le profil utilisateur comme un nouvelle graine définissant alors une 4eme graine. L'utilisateur peut confirmer ou non cette action de sorte à valider un nouveau profil. Si la nouvelle graine est acceptée, le profil utilisateur peut réindexer tous les mots clefs et concepts déjà stockés avec la prise en compte des données correspondants à la nouvelle page pointée par URL91.
Dans ce cas de figure, tous les indices de priorité d'exploration collectés dans la liste L sont recalculés avec la prise en compte du nouveau profil modifié.
Le procédé de l'invention permet avantageusement de définir un mode d'exploration particulièrement efficace pour découvrir des sources de données peu référencées sur le WEB. En outre, la manière de définir le profil d'utilisateur permet une prise en compte efficace des intérêts d'un utilisateur notamment par une modélisation sémantique de son expression d'intérêts.
Claims
REVENDICATIONS
Procédé de découverte d'un ensemble de sources définissant des pages WEB, caractérisé en ce que le procédé comprend :
• une définition d'un profil utilisateur (PROFIL) comprenant : o une liste d'adresses URL (Gi) définissant chacune une graine, chaque URL définissant un accès vers une page WEB (Pi) comprenant un ensemble de données et ; o un index de profil (INDEX PROFIL);
• une collecte d'un ensemble de données de chaque page (Pi) désignée par une URL de la graine (Gi), la collecte comprenant :
o une définition d'un ensemble de mots clefs issus des termes collectés de chaque page ;
o une attribution d'au moins un indice de pertinence à au moins un mot clef selon au moins une donnée d'occurrence de chacun d'eux ;
o une indexation de chaque mot clef dans l'index de profil (INDEX PROFIL);
• une collecte des URL de chaque page WEB explorée dans une mémoire (L);
• une attribution d'un niveau de pertinence à chaque page collectée (Pi), le niveau de pertinence étant issu d'un calcul d'une distance sémantique entre les données de l'index de profil (INDEX PROFIL) et les données collectées d'une page (Pi) ;
• un calcul d'un indice de priorité d'exploration de chaque URL collectée ;
• une création d'une liste ordonnée d'URL (URL Q) selon leur indice de priorité d'exploration ;
• un choix d'une nouvelle URL pour explorer automatiquement une nouvelle page WEB, le choix de l'URL étant déterminé par l'indice de priorité d'exploration de la liste d'URL ordonnée.
2. Procédé de découverte d'un ensemble de sources définissant des pages WEB, caractérisé en ce que la collecte d'un ensemble de données de chaque page désignée par une graine comprend :
• une génération d'un ensemble de concepts à partir d'une base de données sémantique ;
• une attribution d'au moins un indice de pertinence à au moins un concept
• une indexation du concept dans l'index de profil (INDEX PROFIL).
Distance sémantique
3. Procédé de découverte selon l'une quelconque des revendications 1 à
2, caractérisé en ce que la distance sémantique est calculée par une comparaison (C) des mots clefs et/ou concepts communs de l'index de profil et d'une graine en prenant en compte les indices de pertinence.
Contexte global
4. Procédé de découverte selon l'une quelconque des revendications 1 à
3, caractérisé en ce que l'indice de priorité d'exploration attribué à une URL est identique au niveau de pertinence de la page WEB comprenant la dite URL.
Contexte local
5. Procédé de découverte selon l'une quelconque des revendications 1 ou 3, caractérisé en ce que l'indice de priorité d'exploration attribué à une URL est calculé par la prise en compte du niveau de pertinence de la page WEB et d'un contexte local d'une URL de la dite page WEB.
6. Procédé de découverte selon la revendication 5, caractérisé en ce que le contexte local d'une URL comprend des mots clefs et des concepts soit de l'URL, soit d'un paragraphe comprenant ladite URL de la page WEB.
Collecte des données
7. Procédé de découverte selon l'une quelconque des revendications 1 à
6, caractérisé en ce que la collecte d'un ensemble de données de chaque page désignée par une URL comprend :
• la normalisation du contenu de la page ;
• la désambiguïsation sémantique des concepts générés.
Back links
8. Procédé de découverte selon l'une quelconque des revendications 1 à
7, caractérisé en ce qu'une collecte des données d'au moins une page WEB dite « parente » correspondant à une URL pointant vers une page d'une graine est explorée lorsque le premier niveau de pertinence est supérieur à un premier seuil prédéfini, les mots clefs et concepts de la page parente étant référencés dans l'index de profil, et les URL de la page parente étant stockées dans la mémoire et ordonnées dans la liste d'URL.
Nouvelle graine, nouveau profil
9. Procédé de découverte selon l'une quelconque des revendications 1 à 8, caractérisé en ce qu'une URL de la liste ordonnée, ayant un indice de priorité d'exploration supérieur à un second seuil prédéfini, peut être automatiquement définie comme une nouvelle graine dans la liste des graines du profil utilisateur, un nouvel index de profil étant redéfini par un calcul des indices de pertinence des mots clefs et des concepts du profil.
Requête de mots clefs
10. Procédé de découverte selon l'une quelconque des revendications 1 à 8, caractérisé en ce qu'un ensemble de mots clefs de l'index de profil ayant un indice de pertinence supérieur à un troisième seuil prédéfini permet de définir une requête d'un moteur de recherche, un ensemble de premiers résultats définissant un ensemble de graines nouvelles dans la liste de graines du profil utilisateur, un nouvel index de profil étant redéfini par un calcul des indices de pertinence des mots clefs et des concepts du profil.
1 1 . Procédé de découverte selon l'une quelconque des revendications 9 ou 10, caractérisé en ce que la liste ordonnée d'URL est réordonnée
selon un calcul des nouveaux d'indices de priorité d'exploration de chaque URL, lesdits indices étant recalculés lors de la redéfinition d'un nouveau profil.
Pondérateur, Données utilisateur
12. Procédé de découverte selon l'une quelconque des revendications 1 à 1 1 , caractérisé en ce que chaque mot clef et/ou de concept peut être pondéré selon un indice de pondération calculé à partir d'une consigne utilisateur.
13. Procédé de découverte selon la revendication 12, caractérisé en ce que la consigne utilisateur comprend un indicateur de satisfaction d'une page WEB permettant de générer un indice de pondération répercuté sur chaque mots clefs et concept de ladite page WEB.
14. Procédé de découverte selon la revendication 12, caractérisé en ce que la consigne utilisateur comprend au moins un indicateur de satisfaction d'au moins un mot clef ou au moins un concept permettant de générer un nouvel indice de pertinence dudit au moins un mot clef ou dudit au moins un concept lorsqu'ils sont déjà stockés dans l'index.
15. Procédé de découverte selon la revendication 12, caractérisé en ce que la consigne utilisateur comprend la définition d'au moins un mot clef ou d'un concept et d'un indice de pertinence associé et l'ajout dudit au moins un mot clef ou dudit au moins un concept dans l'index thématique.
MAJ URL dans index
16. Procédé de découverte selon l'une quelconque des revendications 1 à 13, caractérisé en ce que chaque URL collectée lors de l'exploration est intégrée dans la liste ordonnée d'URL en fonction de son indice priorité d'exploration.
17. Procédé de découverte selon l'une quelconque des revendications 15 à 16, caractérisé en ce qu'une comparaison des indices de priorité d'exploration d'une URL avant et après la mise à jour d'un profil utilisateur permet de générer un indice de régression d'un mot clef
ou d'un concept nouvellement pris en compte dans l'index suite à la mise à jour du profil utilisateur.
Résultat utilisateur (retours)
18. Procédé de découverte selon l'une quelconque des revendications 1 à 16, caractérisé en ce qu'une liste de pages est générée et ordonnée selon un ordre croissant ou décroissant du niveau de pertinence de chaque page et stockée dans une mémoire (DOC).
19. Procédé de découverte selon la revendication 18, caractérisé en ce qu'un nombre de pages ayant un niveau de pertinence supérieur à un quatrième seuil est indexé dans un index de résultats (INDEX RESULT) et affiché sur un moyen d'affichage.
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| FR1302389A FR3011959B1 (fr) | 2013-10-15 | 2013-10-15 | Procede de decouverte d'un ensemble de sources definissant des pages web |
| PCT/EP2014/002780 WO2015055307A1 (fr) | 2013-10-15 | 2014-10-15 | Procede de decouverte d'un ensemble de sources definissant des pages web |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| EP3058484A1 true EP3058484A1 (fr) | 2016-08-24 |
Family
ID=50543069
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| EP14795947.2A Withdrawn EP3058484A1 (fr) | 2013-10-15 | 2014-10-15 | Procede de decouverte d'un ensemble de sources definissant des pages web |
Country Status (3)
| Country | Link |
|---|---|
| EP (1) | EP3058484A1 (fr) |
| FR (1) | FR3011959B1 (fr) |
| WO (1) | WO2015055307A1 (fr) |
-
2013
- 2013-10-15 FR FR1302389A patent/FR3011959B1/fr active Active
-
2014
- 2014-10-15 EP EP14795947.2A patent/EP3058484A1/fr not_active Withdrawn
- 2014-10-15 WO PCT/EP2014/002780 patent/WO2015055307A1/fr not_active Ceased
Non-Patent Citations (1)
| Title |
|---|
| JUNGHOO C ET AL: "Efficient crawling through URL ordering", COMPUTER NETWORKS AND ISDN SYSTEMS, NORTH HOLLAND PUBLISHING. AMSTERDAM, NL, vol. 30, no. 1-7, 1 April 1998 (1998-04-01), pages 161 - 172, XP004121430, ISSN: 0169-7552, DOI: 10.1016/S0169-7552(98)00108-1 * |
Also Published As
| Publication number | Publication date |
|---|---|
| FR3011959B1 (fr) | 2018-06-01 |
| WO2015055307A1 (fr) | 2015-04-23 |
| FR3011959A1 (fr) | 2015-04-17 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| JP2022073981A (ja) | ソースコード取得 | |
| CN110399457A (zh) | 一种智能问答方法和系统 | |
| FR3043816B1 (fr) | Procede de suggestion de contenus extraits d’un ensemble de sources d’information | |
| CN112883165B (zh) | 一种基于语义理解的智能全文检索方法及系统 | |
| US10740385B1 (en) | Identifying visual portions of visual media files responsive to search queries | |
| FR2909198A1 (fr) | Procede et disositif de filtrage d'elements d'un document structure a partir d'une expression. | |
| WO2007116042A1 (fr) | Procede de de-doublonnage rapide d'un ensemble de documents ou d'un ensemble de donnees contenues dans un fichier | |
| EP3058484A1 (fr) | Procede de decouverte d'un ensemble de sources definissant des pages web | |
| FR3031823A1 (fr) | Lemmatisateur semantique base sur des dictionnaires ontologiques. | |
| WO2003032196A2 (fr) | Procede d'indexation et de comparaison de documents multimedia | |
| WO2013117872A1 (fr) | Procede d'identification d'un ensemble de phrases d'un document numerique, procede de generation d'un document numerique, dispositif associe | |
| WO2020229760A1 (fr) | Procede d'indexation multidimensionnelle de contenus textuels | |
| EP3114597B1 (fr) | Procédé d'analyse d'une pluralité de messages, produit programme d'ordinateur et dispositif associés | |
| CN112559820B (zh) | 基于深度学习的样本数据集智能出题方法、装置及设备 | |
| FR2975553A1 (fr) | Aide a la recherche de contenus videos sur un reseau de communication | |
| WO2007088254A1 (fr) | Systeme d'information structure, relationnel et incremental | |
| FR3041126A1 (fr) | Procede de fiabilisation automatique d'une base de donnees structurees | |
| FR2966949A1 (fr) | Procede pour l’automatisation de la constitution d’une base de donnees structuree de professionnels | |
| EP2153359A1 (fr) | Procede de classification d'un ensemble de documents electroniques | |
| WO2020079109A1 (fr) | Dispositif de traitement automatique de texte par ordinateur | |
| FR3144348A1 (fr) | Procédé mis en œuvre par ordinateur pour une indexation d’une pluralité de textes à indexer et procédé de recherche correspondant | |
| CN112905540A (zh) | 检索文件的方法和装置 | |
| FR2878050A1 (fr) | Systeme et procede de dialogue pour la recherche d'informations dans un ensemble de ressources textuelles | |
| An et al. | The research of ontology-based personalized query approach from heterogeneous distributed data resource | |
| WO2020169898A1 (fr) | Procédé de fourniture d'une information pertinente associée à un brevet |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| PUAI | Public reference made under article 153(3) epc to a published international application that has entered the european phase |
Free format text: ORIGINAL CODE: 0009012 |
|
| 17P | Request for examination filed |
Effective date: 20160513 |
|
| AK | Designated contracting states |
Kind code of ref document: A1 Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC MK MT NL NO PL PT RO RS SE SI SK SM TR |
|
| AX | Request for extension of the european patent |
Extension state: BA ME |
|
| DAX | Request for extension of the european patent (deleted) | ||
| 17Q | First examination report despatched |
Effective date: 20190208 |
|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: THE APPLICATION IS DEEMED TO BE WITHDRAWN |
|
| 18D | Application deemed to be withdrawn |
Effective date: 20190820 |