EP2153359A1 - Procede de classification d'un ensemble de documents electroniques - Google Patents

Procede de classification d'un ensemble de documents electroniques

Info

Publication number
EP2153359A1
EP2153359A1 EP08788165A EP08788165A EP2153359A1 EP 2153359 A1 EP2153359 A1 EP 2153359A1 EP 08788165 A EP08788165 A EP 08788165A EP 08788165 A EP08788165 A EP 08788165A EP 2153359 A1 EP2153359 A1 EP 2153359A1
Authority
EP
European Patent Office
Prior art keywords
graph
documents
weight
vertices
partition
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Withdrawn
Application number
EP08788165A
Other languages
German (de)
English (en)
Inventor
Jérôme GALTIER
Jean Fonlupt
Alexandre Skoda
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Orange SA
Original Assignee
France Telecom SA
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by France Telecom SA filed Critical France Telecom SA
Publication of EP2153359A1 publication Critical patent/EP2153359A1/fr
Withdrawn legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/90Details of database functions independent of the retrieved data types
    • G06F16/95Retrieval from the web
    • G06F16/951Indexing; Web crawling techniques
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/90Details of database functions independent of the retrieved data types
    • G06F16/95Retrieval from the web
    • G06F16/953Querying, e.g. by the use of web search engines
    • G06F16/9532Query formulation

Definitions

  • the invention relates to the field of telecommunications, and more particularly to search engines for electronic documents.
  • the invention relates to a method of classifying a set of electronic documents having links between them, for example hypertext links.
  • a set results for example from a search performed by a user using a search engine on an Internet type network, the electronic documents being in this case web pages accessible via a telecommunications network.
  • Search engines use several techniques for sorting or sorting pages from a search.
  • PageRank is used in the implementation of the search engine Google (trademark) and described in the document "The Page Rank Quotation: Bringing Order on the Web" by L. Page, S. Brin, R. Motwani and T. Winograd; Technical Report, Computer Science Department, Stanford University, 1998.
  • the PageRank method orders pages based on their visibility on the Web.
  • This method carries out a probabilistic analysis of this simulated navigation in order to determine the probability for the user to find himself on a given page during such random navigation from page to page.
  • the rank of a page is even higher than the number of times this page is cited by other pages is high.
  • the invention aims in particular to detect this type of situation to avoid this problem.
  • the invention aims to detect "document communities", a community that can simply be defined by a set of documents that have many links between them and few links with the rest of the graph. These community identification methods advantageously make it possible to distinguish documents containing homonyms.
  • separative Some are called separative. These are methods in which the representative graph of documents and their links is partitioned into different groups, removing arcs that are highly likely to link different communities.
  • edge-betweeness This notion characterizing, for a given arc, the number of shorter paths between two points of the graph which pass through this arc.
  • the idea behind this algorithm is that the arcs that are between different communities are the ones with the highest edge-betweeness since all paths from one community to another must go through these arcs.
  • the algorithm proposed in this document calculates the value of "edge-betweeness” for each of the arcs, then removes from the graph the arcs for which the aforementioned value is the highest and recalculates iteratively the values for the remaining arcs.
  • the Girvan-Newman algorithm has a major disadvantage in that it is of a very high complexity, more precisely in 0 (m 2 n) for a graph of ⁇ nodes and m arcs. This algorithm can therefore not in practice be used to detect communities within the Web, the above-mentioned graphs comprising in this case several hundreds of thousands of nodes.
  • the invention also aims to solve the aforementioned drawbacks of the state of the art by proposing a method of low complexity to identify within a very large set of electronic documents subsets, including subsets corresponding Thematic communities, which can detect cases of spamming in the web.
  • the invention relates to a method of classifying a set of electronic documents into a plurality of subsets of documents, comprising: a step of representing the set of documents in the form of a graph; in which a vertex represents a document and an arc between two vertices represents at least a hypertext link between the documents represented by these vertices; and
  • a step of determining a partition of all the vertices of the graph this partition being obtained by calculating the intrinsic force of the graph, each of the subsets of documents being constituted by all the electronic documents represented by the vertices included in the same part of said partition thus obtained.
  • the invention relates to a device for classifying a set of electronic documents, comprising:
  • Each part of the partition thus obtained constitutes a related subgraph, namely a subgraph in which there is at least one path between any two vertices of this subgraph.
  • the invention lies in particular in the fact of assimilating each subset of documents thus obtained to a community of documents.
  • the implementation of the classification method according to the invention thus allows the determination of a community of documents solely from the links existing between these documents and not from their semantic content.
  • the document classification method uses a step of calculating the intrinsic strength of the graph representing these documents.
  • the number of nodes is relatively small, of the order of one hundred.
  • is the set of partitions of the set E of the vertices of the graph G; - ⁇ Si, ..., S p ⁇ is a partition belonging to the set ⁇ and including p subsets Si, ..., S p of the set E;
  • - represents the integer part of x.
  • the force is a minimum value taken on all possible partitions of the graph, independent of the number of subsets in the partition.
  • This characteristic is particularly advantageous because it is not necessary to impose a priori a constraint on the number of communities to be identified in the set of documents.
  • the partition obtained by the classification method according to the invention is that for which a minimum number of arcs has been removed in this graph.
  • the subsets obtained during the calculation of the intrinsic force are either constituted by a single vertex, or subsets whose force is greater than or equal to that of the initial graph, that is to say subassemblies comprising a number of disjoint covering trees important and therefore strongly connected.
  • the step of calculating the intrinsic force of the graph uses an iterative method, at each iteration, we associate a weight to each of the arcs and select, among the trees covering the graph, a tree covering minimum weight. This association is performed such that the weight of the selected trees during the previous iterations verifies a predetermined constraint, the iterations being repeated until the weight of the minimum weight covering tree also satisfies this constraint.
  • the strength of the graph and therefore the minimal weight covering tree in the graph are determined using the Kruskal method.
  • This algorithm is of low complexity (O (m 2 ) (log (m)) 2 ).
  • O (m 2 ) (log (m)) 2 For more information, one skilled in the art can refer to JB Kruskal's document "On the shortest spanning subtree of a graph and the traveling salesman problem", Proc. Am. Math. Soc., 7 (1): 48-50, Feb. 1956.
  • the strength of the graph is determined by applying a technique for solving linear equations under constraints.
  • the various steps of the electronic document classification method are determined by computer program instructions.
  • the invention also relates to a computer program on an information medium, this program being capable of being implemented in a device for classifying electronic documents or more generally in a computer, this program comprising instructions adapted to the implementation of the steps of a method of classifying electronic documents as described above.
  • This program can use any programming language, and be in the form of source code, object code, or intermediate code between source code and object code, such as in a partially compiled form, or in any other form desirable shape.
  • the invention also relates to a computer-readable information medium, comprising instructions of a computer program as mentioned above.
  • the information carrier may be any entity or device capable of storing the program.
  • the medium may comprise storage means, such as a ROM, for example a CD ROM or a microelectronic circuit ROM, or a magnetic recording medium, for example a floppy disk or a disk. hard.
  • the information medium may be a transmissible medium such as an electrical or optical signal, which may be conveyed via an electrical or optical cable, by radio or by other means.
  • the program according to the invention can be downloaded in particular on an Internet type network.
  • the information carrier may be an integrated circuit in which the program is incorporated, the circuit being adapted to execute or to be used in the execution of the process in question.
  • FIG. 1 represents a graph on which the method for classifying electronic documents according to the invention can be applied
  • FIGS. 2A to 2C represent parts of the graph of FIG. 1;
  • FIG. 3 represents an electronic document classification device according to the invention in a particular embodiment
  • FIG. 4 represents, in flowchart form, the main steps of a method for classifying electronic documents according to the invention in a particular embodiment
  • FIGS. 5A to 6F detail the different iterations of an electronic document classification method according to the invention applied to the graph of FIG. 1.
  • FIG. 1 represents a graph G whose vertices S1 to S6 represent electronic documents and arcs A1 to A8 represent hypertext links between the documents.
  • the force ⁇ of the graph G is adapted from the Gusfield formula, and defined by the following equation:
  • is the set of partitions of the set E of the vertices of the graph G;
  • - ⁇ Si, ..., S p ⁇ is a partition belonging to the set ⁇ and including p subsets Si, ..., S p of the set E;
  • - ⁇ (Si, ..., Sp) is the set of arcs of the graph G having ends in different S 1 , S 1 of the partition ⁇ Si, ..., S p ⁇ ;
  • the strength of the graph therefore takes a value in the set of reals, not necessarily complete.
  • each partition Ci of the partition has either a single vertex S5 or S6, or a related sub-graph.
  • FIGS. 2A, 2B and 2C thus serve to illustrate a fundamental characteristic of the invention according to which the force of each of the subsets of the initial graph is greater than or equal to that of this graph.
  • the method of classifying electronic documents according to the invention does not concern the force itself of the graph G. But it uses the method of calculating the force to partition the graph G, each part of the score thus obtained comprising representative summits of a subset of electronic documents constituting a community of electronic documents.
  • the portion C1 represents a first-level community, the documents represented by the vertices S1, S2, S3 and S4 being strongly interconnected.
  • the CIl part constitutes a sub-community of the first-level community, the documents represented by the S2 and S3 summits being more strongly linked within this community.
  • FIG. 3 there is shown a device 10 for classifying electronic documents according to the invention in a particular embodiment.
  • the electronic document classification device 10 has the conventional architecture of a computer.
  • the classification device 10 comprises a processor 11, a random access memory RAM 12, a read-only memory ROM 13 and communication means 14.
  • the classification device 10 is adapted to receive electronic documents via the communication means 14. , to represent all of these documents in the form of a graph G and to store a data structure representative of this graph in the random access memory 12.
  • the read-only memory 13 stores a computer program according to the invention; program comprising instructions for carrying out the steps of an electronic document classification method according to the invention, the main of which will now be described with reference to FIGS. 4 and 5A to 6F.
  • the set of electronic documents is represented in the form of the graph G, as illustrated in FIG.
  • the method according to the invention then comprises an iterative method for calculating the intrinsic force of the graph G, this method comprising mainly: a step E20 during which a positive or zero weight is associated with each of the arcs A1 to A8 and selected (Step E30) a minimum weight covering tree by ensuring that the trees determined during the previous iterations all satisfy a predetermined constraint.
  • each of these trees must check the constraint that their weight is greater than or equal to 1. At each iteration, it is verified, during an E40 test, whether the minimum weight covering tree satisfies this constraint too.
  • the step of calculating the intrinsic force of the graph G stops.
  • This shaft Ti is shown in FIG. 6A. Its weight is zero since all the arcs Al, A5, A8, A7, A6 of this tree have a zero weight.
  • step E40 it is checked whether the weight of all the cover trees selected so far, namely the Ti-tree, has a weight greater than or equal to 1.
  • step E20 a new iteration is performed by associating (step E20) weights with the different arcs of the shaft, so that the shaft Ti satisfies the aforementioned constraint.
  • the shaft Ti has a weight equal to 1 and the stress is verified.
  • This tree T 2 is represented in FIG. 6B.
  • step E40 it is checked whether all the trees selected so far, namely the trees Ti and T 2 have a weight greater than or equal to 1.
  • a new iteration is performed by associating (step E20) a weight with each of the arcs of the graph G, so that the constraints are verified for the shafts Ti and T 2 .
  • the shafts Ti and T 2 have a weight greater than or equal to 1 and the stress is verified.
  • step E40 is negative and a fourth iteration is performed. During this fourth iteration, we associate a weight to each of the arcs of the graph G so that the trees Ti, T 2 and T 3 have a weight greater than or equal to 1.
  • a tree T 4 of minimum weight is sought in the graph G of FIG. 5D.
  • the shaft T 4 of FIG. 6D is obtained, this shaft being of zero weight.
  • step E40 is still negative.
  • This tree is of zero weight.
  • step E20 a weight is assigned to each of the arcs A1 to A8 of the graph G, so that all the trees Ti to T 5 have a weight greater than or equal to 1.
  • each of the shafts Ti to T 5 has a weight equal to 1. Then we look for the minimum weight tree in the graph G of FIG. 5F.
  • This tree T 6 is represented in FIG. 6F.
  • the weight of this tree T 6 is equal to 1.
  • the result of the test E40 is positive and the calculation of the intrinsic force of the graph G stops.
  • the intrinsic force ⁇ of the graph G namely 1.5, corresponds to the sum of the weights of the arcs of the graph of FIG. 5F.
  • Each of the related subsets obtained by calculating the strength of the graph after removing non-zero weight arcs forms part of a partition of the graph.
  • each of these subsets corresponds exactly to a portion Ci of the partition ⁇ C1, C2, C3 ⁇ of FIG. 2A.
  • all the electronic documents represented by the vertices included in one of these parts Ci constitute a class of documents comparable to a community of documents.
  • the computation of the force of the graph G with the determination of the partition of this graph is performed by applying a method of solving linear equations under constraints.
  • Known equation solving software such as CPLEX TM, X-PRESS TM, or COIN Linear Programming TM can be used for this purpose.
  • This calculation method has a low complexity and makes it possible to determine the partition of the graph in a very reduced computation time, and without resorting to an iterative method - whose convergence can be slow.
  • the calculation time is therefore greatly reduced compared to the method described for the first embodiment of the invention.
  • a vertex r of the graph G is arbitrarily chosen.
  • V the set of vertices of the graph G
  • E the set of arcs of G.
  • the initial graph G is transformed into a directed graph G2 which has the same vertices as G and which at each arc e (v, w) of E connecting the vertices v and w of V, associates two arcs oriented f (v, w) and f (w, v).
  • the set of oriented arcs f (v, w) is denoted E2.
  • a positive variable ⁇ a variable y e ( V , w) associated with each arc e (v, w) of E and representing the weight of this arc
  • a variable gk, v associated with each pair of vertices (k, v) of V
  • a positive variable m k , f ( V , w) associated with each vertex k of V and each oriented arc f (v, w) of E2.
  • the values of the variable y e ( U , v), that is to say the weights of the arcs, are determined for the set of arcs e (u, v) of E by the application of a method for solving linear equations, respecting the constraints (1) to (3) above and so that the sum of the values of the weights y e ( U , v), when e (u , v) goes through the set E, which is minimal.
  • a step E730 identical to the step E50, the communities are determined from the graph G and the values of the weights y e ( U , v) determined: the arcs of non-zero weight of the graph G are deleted.
  • the related subsets of the graph G present after this deletion form a partition of the graph G.
  • all the electronic documents represented by the vertices included in one of the sub- Sets of the resulting partition constitute a class of documents comparable to a community of documents.
  • the method according to the invention can be used not only to detect spamming problems, but also to facilitate the identification by a user of subsets of documents from among a set of documents, obtained for example from a search engine. research.
  • a presentation to a user of the subsets obtained is performed at the end of the method according to the invention by means of a terminal equipped with a user interface.
  • Different ways of representing these subsets are possible: by lists of names of documents, in the form of graphs, electronic files containing several files, etc.
  • the invention therefore has a particularly interesting application in the field of search engines for the Web.

Landscapes

  • Engineering & Computer Science (AREA)
  • Databases & Information Systems (AREA)
  • Theoretical Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • Data Mining & Analysis (AREA)
  • General Engineering & Computer Science (AREA)
  • General Physics & Mathematics (AREA)
  • Mathematical Physics (AREA)
  • Information Retrieval, Db Structures And Fs Structures Therefor (AREA)

Abstract

Ce procédé de classification de documents électroniques comporte une étape de représentation dudit ensemble de documents sous forme d'un graphe, dans lequel un sommets (S1-S6) représente un documents et un arc (A1-A8) entre deux sommets, un ou plusieurs liens hypertextes entre ces documents; et une étape de détermination d'une partition (C1-C3) de l'ensemble des sommets (S1-S6) du graphe (G), cette partition étant obtenue par calcul de la force intrinsèque du graphe (G), chacun des sous-ensembles de documents étant constitué par l'ensemble des documents électroniques représentés par les sommets compris dans une même partie de ladite partition (C1-C3).

Description

Procédé de classification d'un ensemble de documents électroniques
Arrière-plan de l'invention
L'invention se rapporte au domaine des télécommunications, et plus particulièrement aux moteurs de recherche de documents électroniques.
Plus précisément, l'invention concerne un procédé de classification d'un ensemble de documents électroniques comportant des liens entre eux, par exemple des liens hypertextes. Un tel ensemble résulte par exemple d'une recherche effectuée par un utilisateur au moyen d'un moteur de recherche sur un réseau de type Internet, les documents électroniques étant dans ce cas des pages Web accessibles via un réseau de télécommunications.
Les moteurs de recherche utilisent plusieurs techniques pour le classement ou le tri de pages issues d'une recherche.
Parmi les techniques connues d'exploration d'un ensemble de pages Web, certaines reposent sur la sémantique, une page étant classée comme étant d'autant plus pertinente qu'elle comporte un grand nombre d'occurrences du ou des mots recherchés. Ces techniques sont sensibles à une pratique, connue sous la dénomination anglo-saxonne de "spamming" visant à faire figurer dans une page donnée un très grand nombre de fois les mots utilisés couramment par les internautes dans leurs requêtes de recherche, ce qui a pour effet de faire apparaître la page comme pertinente. On connaît également des techniques exploitant la structure topologique du Web, qui consistent à classer les pages Web en leur attribuant un rang, le rang d'une page étant calculé en fonction des liens existant entre cette page et les autres pages.
Une telle méthode, connue sous le terme anglais "PageRank" est utilisée dans la mise en œuvre du moteur de recherche Google (marque déposée) et décrite dans le document "The PageRank Citation Ranking: Bringing Order on the Web" de L. Page, S. Brin, R. Motwani et T. Winograd ; Technical Report, Computer Science Department, Stanford University, 1998. La méthode "PageRank" ordonne les pages en fonction de leur visibilité sur le Web. Dans cette méthode, on simule une navigation aléatoire de page en page sur le Web en suivant les liens hypertextes. Cette navigation correspond à celle provoquée par un utilisateur accédant au Web lorsque ce dernier active aléatoirement un des liens hypertextes se trouvant dans une page visualisée, afin d'accéder à une autre page. Cette méthode procède à une analyse probabiliste de cette navigation simulée afin de déterminer la probabilité, pour l'utilisateur, de se retrouver sur une page donnée lors d'une telle navigation aléatoire de page en page.
Le rang d'une page est d'autant plus élevé que le nombre de fois où cette page est citée par d'autres pages est élevé.
L'homme de métier comprendra qu'il suffit de créer artificiellement un grand nombre de documents pointant sur une page donnée pour donner un rang élevé à cette page.
L'invention vise en particulier à détecter ce type de situation afin d'éviter ce problème.
A cet effet, l'invention vise à détecter des "communautés de documents", une communauté pouvant simplement être définie par un ensemble de documents qui possèdent beaucoup de liens entre eux et peu de liens avec le reste du graphe. Ces méthodes d'identification de communautés permettent avantageusement de distinguer les documents contenant des homonymes.
On connaît plusieurs méthodes visant à détecter des communautés au sein d'un ensemble de documents électroniques.
Ces méthodes reposent sur une représentation graphique du Web dans laquelle chaque sommet représente un document et les arcs entre les sommets représentent des liens hypertextes entre ces documents.
Parmi ces méthodes, certaines sont dites séparatives. Ce sont des méthodes dans lesquelles on partitionne le graphe représentatif des documents et de leurs liens en différents groupes, en retirant des arcs fortement susceptibles de relier différentes communautés.
Le document M. EJ. Newman, M. Girvan "Community structure in social and biological networks" Proc. Natl. Acad. Sci. USA,99:8271-8276,
2002 propose un algorithme connu sous le nom anglo-saxon "edge- betweeness", cette notion caractérisant, pour un arc donné, le nombre de plus courts chemins entre deux points du graphe qui passent par cet arc. L'idée derrière cet algorithme est que les arcs qui sont entre différentes communautés sont ceux dont le "edge-betweeness" est le plus élevé puisque tous les chemins allant d'une communauté à une autre doivent passer par ces arcs. L'algorithme proposé dans ce document calcule la valeur de "edge-betweeness" pour chacun des arcs, puis enlève du graphe les arcs pour lesquels la valeur précitée est la plus élevée puis recalcule de façon itérative les valeurs pour les arcs restants.
L'algorithme Girvan-Newman présente un inconvénient majeur en ce qu'il est d'une complexité très élevée, plus précisément en 0(m2n) pour un graphe de π nœuds et m arcs. Cet algorithme ne peut donc pas en pratique être utilisé pour détecter des communautés au sein du Web, les graphes précités comportant en l'espèce plusieurs centaines de milliers de nœuds.
Il est par ailleurs très difficile de déterminer jusqu'à quel point il faut découper le graphe, c'est à dire quand il faut s'arrêter d'enlever des arcs. Par ailleurs, dans les découpages en communautés effectués, aucune notion de pertinence d'un redécoupage par rapport au découpage initial n'apparaît. En outre, le découpage final obtenu est dépendant des découpages obtenus lors d'une itération précédente et du nombre de communautés de ces découpages précédents. De plus, il y a peu de chance que cette algorithme « isole » rapidement des communautés qui sont peu liées au reste du monde, alors que le but de notre classification est précisément d'identifier et d'élaguer rapidement ces communautés.
Objet et résumé de l'invention
L'invention a aussi pour objectif de résoudre les inconvénients susmentionnés de l'état de la technique en proposant un procédé de faible complexité pour identifier au sein d'un très grand ensemble de documents électroniques des sous-ensembles, notamment des sous-ensembles correspondant à des communautés thématiques, et qui permettent de détecter les cas de spamming dans le web..
Selon un premier aspect, l'invention concerne un procédé de classification d'un ensemble de documents électroniques en une pluralité de sous-ensembles de documents, comportant : - une étape de représentation de l'ensemble de documents sous forme d'un graphe, dans lequel un sommet représente un document et un arc entre deux sommets représente au moins un lien hypertexte entre les documents représentés par ces sommets ; et
- une étape de détermination d'une partition de l'ensemble des sommets du graphe, cette partition étant obtenue par calcul de la force intrinsèque du graphe, chacun des sous-ensembles de documents étant constitué par l'ensemble des documents électroniques représentés par les sommets compris dans une même partie de ladite partition ainsi obtenue.
Corrélativement, l'invention concerne un dispositif de classification d'un ensemble de documents électroniques, comportant :
- des moyens de représentation de l'ensemble de documents sous forme d'un graphe, dans lequel un sommet représente un document et un arc entre deux sommets représente au moins un lien hypertexte entre les documents représentés par ces sommets; et - des moyens de détermination d'une partition de l'ensemble des sommets du graphe, cette partition étant obtenue par calcul de la force intrinsèque du graphe, chacun des sous-ensembles de documents étant constitué par l'ensemble des documents électroniques représentés par les sommets compris dans une même partie de ladite partition ainsi obtenue.
Chaque partie de la partition ainsi obtenue, constitue un sous- graphe connexe, à savoir un sous-graphe dans lequel, il existe au moins un chemin entre deux sommets quelconques de ce sous-graphe.
L'invention réside en particulier dans le fait d'assimiler chaque sous-ensemble de documents ainsi obtenu à une communauté de documents.
La mise en œuvre du procédé de classification selon l'invention permet ainsi la détermination d'une communauté de documents uniquement à partir des liens existant entre ces documents et non pas à partir de leur contenu sémantique.
De cette manière, on peut notamment s'affranchir des problèmes de spamming liés à la prise en compte de la sémantique dans la recherche de documents. En effet cette méthode permet de détecter les pages artificiellement créées pour faire augmenter la popularité d'une page cible, car ces pages ont une connectivité assez faible avec le reste du graphe et sont facilement identifiées comme une communauté à part. Le procédé de classification de documents selon l'invention utilise une étape de calcul de la force intrinsèque du graphe représentant ces documents.
L'homme du métier comprendra que dans de tels réseaux, le nombre de nœuds est relativement faible, de l'ordre d'une centaine.
Gusfield propose, dans le document "Connectivity and edge- disjoint spanning trees". Inform. Process. Lett., 16(2):87-89, 1983 de caractériser un graphe G par sa force σ, où :
équation (1)
dans laquelle :
- π est l'ensemble des partitions de l'ensemble E des sommets du graphe G ; - {Si, ..., Sp} est une partition appartenant à l'ensemble π et comprenant p sous-ensembles Si, ..., Sp de l'ensemble E ;
- δ(Si,..., Sp) est l'ensemble des arcs du graphe G ayant des extrémités dans différents S1, Sj de la partition {Si, ..., Sp} ;
- |δ(Si,..., Sp)| est le nombre d'arcs compris dans l'ensemble
- représente la partie entière de x.
Il a déjà été démontré (théorème de Tutte, Nash-Williams) que la force σ ainsi définie du graphe, est égale au nombre d'arbres couvrants disjoints de ce graphe, un arbre couvrant un graphe étant un arbre qui contient tous les sommets de ce graphe.
On remarque que la force est une valeur minimale prise sur toutes les partitions possibles du graphe, indépendante du nombre de sous-ensembles dans la partition. Cette caractéristique est particulièrement avantageuse car il n'est pas nécessaire d'imposer a priori une contrainte sur le nombre de communautés à identifier dans l'ensemble des documents. Autrement dit, pour un graphe connexe donné, la partition obtenue par le procédé de classification selon l'invention est celle pour laquelle un nombre minimum d'arcs a été supprimé dans ce graphe.
Cela permet d'effectuer une classification des documents de « haut niveau », une classe de documents ainsi obtenue pouvant à son tour être partitionnée en sous-classes en appliquant le procédé de classement à cette classe.
Les sous-ensembles obtenus lors du calcul de la force intrinsèque sont soit constitués par un sommet unique, soit des sous- ensembles dont la force est supérieure ou égale à celle du graphe initial, c'est-à-dire des sous-ensembles comportant un nombre d'arbres couvrants disjoints important et donc fortement connectés.
En ce sens, il est pertinent d'assimiler ces sous-ensembles à des communautés thématiques de documents. Dans un mode préféré de réalisation de l'invention, l'étape de calcul de la force intrinsèque du graphe utilise une méthode itérative, à chaque itération, on associe un poids à chacun des arcs et on sélectionne, parmi les arbres couvrant du graphe, un arbre couvrant de poids minimum. Cette association est effectuée de telle sorte que le poids des arbres sélectionnés au cours des itérations précédentes vérifie une contrainte prédéterminée, les itérations étant répétées jusqu'à ce que le poids de l'arbre couvrant de poids minimum vérifie aussi cette contrainte.
De façon très avantageuse, on obtient ainsi un algorithme de faible complexité, à savoir une complexité en O(m2)(log(m))2 par itération, bien inférieure à la complexité de l'algorithme de Girvan-Newman.
On peut notamment utiliser les programmes CPLEX,X-PRESS ou CLP connus de l'homme du métier.
Selon un premier mode de réalisation de l'invention, on détermine la force du graphe et donc l'arbre couvrant de poids minimum dans le graphe en utilisant la méthode de Kruskal.
Cet algorithme est de faible complexité (O(m2)(log(m))2). Pour plus de renseignements, l'homme du métier pourra se reporter au document de J. B. Kruskal "On the shortest spanning subtree of a graph and the travelling salesman problem", Proc. Am. Math. Soc, 7(1) : 48-50, Feb. 1956. Selon un deuxième mode de réalisation de l'invention, on détermine la force du graphe par application d'une technique de résolution d'équations linéaires sous contraintes.
Dans un mode particulier de réalisation, les différentes étapes du procédé de classification de documents électroniques sont déterminées par des instructions de programmes d'ordinateurs.
En conséquence, l'invention vise aussi un programme d'ordinateur sur un support d'informations, ce programme étant susceptible d'être mis en œuvre dans un dispositif de classification de documents électroniques ou plus généralement dans un ordinateur, ce programme comportant des instructions adaptées à la mise en œuvre des étapes d'un procédé de classification de documents électroniques tel que décrit ci-dessus. Ce programme peut utiliser n'importe quel langage de programmation, et être sous la forme de code source, code objet, ou de code intermédiaire entre code source et code objet, tel que dans une forme partiellement compilée, ou dans n'importe quelle autre forme souhaitable. L'invention vise aussi un support d'informations lisible par un ordinateur, et comportant des instructions d'un programme d'ordinateur tel que mentionné ci-dessus.
Le support d'informations peut être n'importe quelle entité ou dispositif capable de stocker le programme. Par exemple, le support peut comporter un moyen de stockage, tel qu'une ROM, par exemple un CD ROM ou une ROM de circuit microélectronique, ou encore un moyen d'enregistrement magnétique, par exemple une disquette (floppy dise) ou un disque dur.
D'autre part, le support d'informations peut être un support transmissible tel qu'un signal électrique ou optique, qui peut être acheminé via un câble électrique ou optique, par radio ou par d'autres moyens. Le programme selon l'invention peut être en particulier téléchargé sur un réseau de type Internet.
Alternativement, le support d'informations peut être un circuit intégré dans lequel le programme est incorporé, le circuit étant adapté pour exécuter ou pour être utilisé dans l'exécution du procédé en question.
Brève description des dessins D'autres caractéristiques et avantages de la présente invention ressortiront de la description faite ci-dessous, en référence aux dessins annexés qui en illustrent un exemple de réalisation dépourvu de tout caractère limitatif. Sur les figures :
- la figure 1 représente un graphe sur lequel on peut appliquer le procédé de classification de documents électroniques conforme à l'invention ;
- les figures 2A à 2C représentent des parties du graphe de la figure 1 ;
- la figure 3 représente un dispositif de classification de documents électroniques conforme à l'invention dans un mode particulier de réalisation ;
- la figure 4 représente, sous forme d'organigramme, les principales étapes d'un procédé de classification de documents électroniques conforme à l'invention dans un mode particulier de réalisation ; et
- les figures 5A à 6F détaillent les différentes itérations d'un procédé de classification de documents électroniques conforme à l'invention appliqué au graphe de la figure 1.
Description détaillée d'un mode de réalisation
La figure 1 représente un graphe G dont les sommets Sl à S6 représentent des documents électroniques et les arcs Al à A8 représentent des liens hypertextes entre les documents.
La force σ du graphe G, utilisée dans ce mode de réalisation, est adaptée de la formule de Gusfield, et définie par l'équation ci-après :
équation (2)
dans laquelle : - π est l'ensemble des partitions de l'ensemble E des sommets du graphe G ;
- {Si, ..., Sp} est une partition appartenant à l'ensemble π et comprenant p sous-ensembles Si, ..., Sp de l'ensemble E ; - δ(Si,..., Sp) est l'ensemble des arcs du graphe G ayant des extrémités dans différents S1, S1 de la partition {Si, ..., Sp} ;
- |δ(Si,..., Sp)| est le nombre d'arcs compris dans l'ensemble
Selon l'invention, la force du graphe prend donc une valeur dans l'ensemble des réels, non nécessairement entière.
Selon l'invention, lors du calcul de la force du graphe, on affecte des poids à chacun des arcs du graphe G de telle sorte que le poids de l'arbre couvrant de poids minimum vérifie une contrainte prédéterminée. Cette contrainte est que ce poids minimum soit supérieur ou égal à une valeur de seuil égale à 1. N'importe quel coefficient multiplicateur, entier ou réel, strictement positif, peut bien entendu être appliqué à cette valeur de seuil et aux valeurs de poids.
A la figure 2A, on a représenté la partition {Cl, C2, C3} de G vérifiant l'équation (1). Chaque partition Ci de la partition comporte soit un sommet unique S5 ou S6, soit un sous-graphe connexe.
Dans cet exemple δ(Cl, C2, C3) = {A6, A7, A8} et σ, force du graphe G = 1,5.
A la figure 2B, on a représenté la partition {Cil, C12, C13} de la partie Cl vérifiant l'équation (1).
Dans cet exemple, δ(Cll, C12, C13) = {Al, A2, A3} et la force σ de Cl = 1,5. A la figure 2C, on a représenté la partition {Cl 11, Cl 12} de la partie CIl vérifiant l'équation (1).
Dans cet exemple, δ(Clll, Cl 12) = {A4, A5} et la force σ du sous-ensemble CIl = 2.
Les trois figures 2A, 2B et 2C permettent d'illustrer ainsi une caractéristique fondamentale de l'invention selon laquelle la force de chacun des sous-ensembles du graphe de départ est supérieure ou égale à celle de ce graphe.
Le procédé de classement de documents électroniques selon l'invention ne s'intéresse pas à la force proprement dite du graphe G. Mais il utilise le procédé de calcul de la force pour partitionner le graphe G, chaque partie de la partition ainsi obtenue comportant des sommets représentatifs d'un sous-ensemble de documents électroniques constituant une communauté de documents électroniques.
Ainsi, dans l'exemple précédent, la partie Cl représente communauté de premier niveau, les documents représentés par les sommets Sl, S2, S3 et S4 étant fortement liés entre eux.
A un second niveau, la partie CIl constitue une sous- communauté de la communauté de premier niveau, les documents représentés par les sommets S2 et S3 étant plus fortement liés au sein de cette communauté.
A la figure 3, on a représenté un dispositif 10 de classification de documents électroniques conforme à l'invention dans un mode particulier de réalisation.
Dans l'exemple décrit ici, le dispositif 10 de classification de documents électroniques selon l'invention a l'architecture conventionnelle d'un ordinateur.
Il comporte un processeur 11, une mémoire vive de type RAM 12, une mémoire morte de type ROM 13 et des moyens de communication 14. Le dispositif 10 de classification selon l'invention est adapté à recevoir des documents électroniques via les moyens de communication 14, à représenter l'ensemble de ces documents sous forme d'un graphe G et à mémoriser une structure de données représentatives de ce graphe dans la mémoire vive 12. La mémoire morte 13 mémorise un programme d'ordinateur conforme à l'invention, ce programme comportant des instructions pour l'exécution des étapes d'un procédé de classification de documents électroniques conforme à l'invention et dont les principales vont maintenant être décrites en référence aux figures 4 et 5A à 6F. Au cours d'une première étape ElO de ce procédé, on représente l'ensemble des documents électroniques sous la forme du graphe G, comme illustré à la figure 1.
En pratique, cela revient à représenter chacun des documents par un sommet Sl à S6, à identifier dans ces documents les liens hypertextes vers d'autres documents, et à chaque fois qu'un tel lien est identifié, à tracer un arc entre les sommets représentatifs des documents liés.
Ainsi, l'homme du métier comprendra que, dans l'exemple de la figure 1, les documents représentés par les sommets S2 et S3 sont liés par deux liens hypertextes représentés par les arcs A4 et A5.
Le procédé selon l'invention comporte ensuite une méthode itérative pour calculer la force intrinsèque du graphe G, cette méthode comportant principalement : - une étape E20 au cours de laquelle on associe un poids positif ou nul à chacun des arcs Al à A8 et on sélectionne (étape E30) un arbre couvrant de poids minimum en s'assurant que les arbres déterminés au cours des itérations précédentes vérifient tous une contrainte prédéterminée. Dans le mode de réalisation décrit ici, chacun de ces arbres doit vérifier la contrainte selon laquelle leur poids est supérieur ou égal à 1. A chaque itération, on vérifie, au cours d'un test E40 si l'arbre couvrant de poids minimum vérifie lui aussi cette contrainte.
Si tel est le cas, l'étape de calcul de la force intrinsèque du graphe G s'arrête.
Au contraire, si le poids de l'arbre couvrant de poids minimum est strictement inférieur à 1, on retourne à l'étape E20 pour associer un nouveau poids aux arcs du graphe G en respectant la contrainte précitée pour tous les arbres sélectionnés jusqu'alors. Nous allons maintenant détailler cet algorithme sur le graphe G de la figure 1.
Lors de la première itération, du fait qu'il n'y a aucun arbre sélectionné au cours d'une étape précédente, il n'y a pas encore de contrainte, on associe un poids y nul à chacun des arcs A1, comme représenté à la figure 5A. Puis, on cherche, en appliquant l'algorithme de Kruskal, l'arbre couvrant de poids minimum dans le graphe.
Cet arbre Ti est représenté à la figure 6A. Son poids est nul puisque tous les arcs Al, A5, A8, A7, A6 de cet arbre ont un poids nul. On vérifie, au cours de l'étape E40, si le poids de tous les arbres couvrants sélectionnés jusqu'alors, à savoir l'arbre Ti, a un poids supérieur ou égal à 1.
Comme ce n'est pas le cas, on effectue une nouvelle itération en associant (étape E20) des poids aux différents arcs de l'arbre, de sorte que l'arbre Ti vérifie la contrainte précitée.
Pour cela (voir figure 5B), on affecte, par exemple, le poids 1 à l'arc Al. Bien entendu, on aurait pu choisir d'affecter le poids 1 à un autre arc, par exemple A2, ou encore les poids 0,3 et 0,7 aux arcs Al et A3, ...
De ce fait, l'arbre Ti a un poids égal à 1 et la contrainte est vérifiée.
On cherche alors, dans le graphe G de la figure 5B, un arbre couvrant de poids minimum.
Cet arbre T2 est représenté à la figure 6B.
Le poids de cet arbre T2 est nul. On vérifie, au cours de l'étape E40, si tous les arbres sélectionnés jusqu'alors, à savoir les arbres Ti et T2 ont un poids supérieur ou égal à 1.
Ce n'est pas le cas puisque l'arbre T2 a un poids nul.
On effectue une nouvelle itération en associant (étape E20) un poids à chacun des arcs du graphe G, de sorte que les contraintes soient vérifiées pour les arbres Ti et T2.
Comme représenté à la figure 5C, on affecte, par exemple, le poids 1 à l'arc A8 et le poids 0 à tous les autres arcs.
De la sorte, les arbres Ti et T2 ont un poids supérieur ou égal à 1 et la contrainte est vérifiée.
On cherche ensuite, au cours d'une étape E30, un arbre de poids minimum dans le graphe G de la figure 5C.
On obtient ainsi l'arbre T3 de la figure 6C.
Cet arbre est de poids nul. En conséquence, le test de l'étape E40 est négatif et on effectue une quatrième itération. Au cours de cette quatrième itération, on associe un poids à chacun des arcs du graphe G de sorte que les arbres Ti, T2 et T3 ont un poids supérieur ou égal à 1.
Comme représenté à la figure 5D, on affecte le poids y7 = 1 à l'arc A7 et un poids nul à tous les autres arcs.
De cette sorte, les poids des arbres Ti, T2 et T3 sont égaux à 1 et la contrainte est vérifiée.
On cherche ensuite, au cours d'une étape E30, un arbre T4 de poids minimum dans le graphe G de la figure 5D. On obtient l'arbre T4 de la figure 6D, cet arbre étant de poids nul.
En conséquence, le test de l'étape E40 est encore négatif.
On effectue donc une cinquième itération et on associe, comme représenté à la figure 5 E' le poids y6 = 1 à l'arc A6 du graphe G, tous les autres arcs étant affectés avec un poids nul.
De la sorte, tous les arbres Ti à T4 ont un poids égal à 1 et la contrainte est vérifiée.
Puis, en référence à la figure 6E, on cherche un arbre de poids minimum dans le graphe G de la figure 5E. On obtient ainsi l'arbre T5 de la figure 6E.
Cet arbre est de poids nul.
Donc le résultat du test E40 est négatif. Et on effectue une sixième itération.
Au cours de l'étape E20, on associe un poids à chacun des arcs Al à A8 du graphe G, de sorte que tous les arbres Ti à T5 aient un poids supérieur ou égal à 1.
En référence à la figure 5F, on associe le poids 0,5 aux arcs A6, A7 et A8 et un poids nul aux autres arcs.
De la sorte, chacun des arbres Ti à T5 a un poids égal à 1. Puis on cherche l'arbre de poids minimum dans le graphe G de la figure 5F.
Cet arbre T6 est représenté à la figure 6F.
Le poids de cet arbre T6 est égal à 1.
De ce fait, le résultat du teste E40 est positif et le calcul de la force intrinsèque du graphe G s'arrête. L'homme du métier notera que la force σ intrinsèque du graphe G, à savoir 1.5, correspond à la somme des poids des arcs du graphe de la figure 5F.
Le résultat du test E40 étant positif, on détermine, au cours d'une étape E50, les communautés à partir du graphe de la figure 5F.
Pour cela, on supprime les arcs de poids non nul de ce graphe, à savoir, dans cet exemple, les arcs A6, A7 et A8.
On obtient ainsi trois sous-ensembles connexes du graphe G à savoir : - le sommet S5 ;
- le sommet S6 ; et
- le sous-graphe constitué par les sommets Sl à S4 reliés par les arcs Al à A5.
Chacun des sous-ensembles connexes obtenus par calcul de la force du graphe après suppression des arcs de poids non nul forme une partie d'une partition du graphe.
Dans l'exemple décrit ici, chacun de ces sous-ensembles correspond exactement à une partie Ci de la partition {Cl, C2, C3} de la figure 2A.
Conformément à l'invention, l'ensemble des documents électroniques représentés par les sommets compris dans l'une de ces parties Ci constituent une classe de documents assimilable à une communauté de documents.
Selon un deuxième mode de réalisation de l'invention, le calcul de la force du graphe G avec la détermination de la partition de ce graphe est effectué par application d'une méthode de résolution d'équations linéaires sous contraintes. Des logiciels de résolution d'équations connus tels que CPLEX™, X-PRESS™, ou COIN Linear Programming™ sont utilisables dans ce but.
Cette méthode de calcul présente une faible complexité et permet de déterminer la partition du graphe en un temps de calcul très réduit, et sans faire appel à une méthode itérative - dont la convergence peut être lente. Le temps de calcul est donc fortement réduit par rapport à la méthode décrite pour le premier mode de réalisation de l'invention.
Il est décrit ci-dessus, par référence à la figure 7, comment le calcul de la force d'un graphe peut être effectué par application d'une méthode de résolution d'équations linéaires sous contraintes.
Selon ce deuxième mode de réalisation, lors d'une étape initiale E700, est choisi arbitrairement un sommet r du graphe G. On note V l'ensemble des sommets du graphe G et E l'ensemble des arcs de G.
Lors d'une étape E710, le graphe G initial est transformé en un graphe orienté G2 qui possède les mêmes sommets que G et qui à chaque arc e(v,w) de E reliant les sommets v et w de V, associe deux arcs orientés f(v,w) et f(w,v). L'ensemble des arcs orientés f(v,w) est noté E2.
Les variables réelles suivantes sont définies: une variable positive φ, une variable ye(V,w) associée à chaque arc e(v,w) de E et représentant le poids de cet arc, une variable gk,v associée à chaque couple de sommets (k,v) de V, une variable positive mk,f(V,w) associée à chaque sommet k de V et à chaque arc orienté f(v,w) de E2.
De plus, les variables intermédiaires suivantes sont définies en fonction des variables précédentes:
Sf(V,w) la somme, associée à l'arc orienté f(v,w), de toutes les valeurs des variables mk,f(V,W) pour k parcourant l'ensemble de sommets V-
{r}, • tk la somme de toutes les valeurs des variables gk,r pour k parcourant l'ensemble de sommets V-{r}, tt la somme de toutes les valeurs des variables gk,k pour k parcourant l'ensemble de sommets V-{r},
Les contraintes (1) à (3) suivantes sont définies : (1) Pour chaque arc orienté f(v,w) de E2 et chaque sommet k différent de r, la somme gk,w - gk,v + rnk,f(V,W) est positive.
(2) Pour chaque arc orienté f(v,w) de E2, correspondant à l'arc non-orienté e(v,w) de E, la somme φ - sf(V,w) + ye(v,w) est positive. (3) La somme tk - tt - (n-l)φ - 1 est positive, où n est le nombre de sommets de l'ensemble V.
Lors d'une étape E720, les valeurs de la variable ye(U,v) , c'est-à- dire les poids des arcs sont déterminées pour l'ensemble des arcs e(u,v) de E par l'application d'une méthode de résolution d'équations linéaires, en respectant les contraintes (1) à (3) ci-dessus et de manière à ce que la somme des valeurs des poids ye(U,v), lorsque e(u,v) parcourt l'ensemble E, soit minimale.
Il est possible de démontrer que les valeurs des poids ye(U,v) ainsi obtenues sont telles que pour tout arbre couvrant T du graphe G la somme des ye(U,v) pour e(u,v) parcourant T est supérieure ou égale à 1.
Lors d'une étape E730, identique à l'étape E50, les communautés sont déterminées à partir du graphe G et des valeurs des poids ye(U,v) déterminées: les arcs de poids non nul du graphe G sont supprimés. Les sous-ensembles connexes du graphe G présents après cette suppression forment une partition du graphe G.
Conformément à l'invention, l'ensemble des documents électroniques représentés par les sommets compris dans l'un des sous- ensembles de la partition obtenue constituent une classe de documents assimilable à une communauté de documents.
Le procédé selon l'invention est utilisable, non seulement pour détecter des problèmes de spamming, mais également pour faciliter l'identification par un utilisateur de sous-ensembles de documents parmi un ensemble de documents, obtenus par exemple à partir d'un moteur de recherche. Dans cette optique, une présentation à un utilisateur des sous- ensembles obtenus est effectuée à l'issue du procédé selon l'invention au moyen d'un terminal équipé d'une interface utilisateur. Différents modes de représentation de ces sous-ensembles sont possibles: par listes de noms de documents, sous forme de graphes, de dossiers électroniques contenant plusieurs fichiers, etc. L'invention trouve donc une application particulièrement intéressante dans le domaine des moteurs de recherche pour le Web.

Claims

REVENDICATIONS
1. Procédé de classification d'un ensemble de documents électroniques en une pluralité de sous-ensembles de documents, comportant :
- une étape (ElO) de représentation dudit ensemble de documents sous forme d'un graphe (G), dans lequel un sommet (S1-S6) représente un document et un arc (A1-A8) entre deux sommets représente au moins un lien hypertexte entre les documents représentés par ces sommets ; et
- une étape (E20-E40) de détermination d'une partition (C1-C3) de l'ensemble des sommets (S1-S6) dudit graphe (G), cette partition étant obtenue par calcul de la force intrinsèque dudit graphe (G), chacun desdits sous-ensembles de documents étant constitué par l'ensemble des documents électroniques représentés par les sommets compris dans une même partie (Ci) de ladite partition (C1-C3).
2. Procédé de classification selon la revendication 1, caractérisé en ce que lors dudit calcul, on associe un poids à chacun des arcs dudit graphe de telle sorte que le poids de l'arbre couvrant de poids minimum vérifie une contrainte prédéterminée, chacun desdits sous-ensembles correspondant à un sous-ensemble connexe d'un graphe final obtenu par suppression dans ledit graphe des arcs de poids non nul.
3. Procédé de classification selon la revendication 2, caractérisé en ce que ladite étape de calcul de la force intrinsèque dudit graphe utilise une méthode itérative dans laquelle, à chaque itération, on sélectionne (E30), parmi les arbres couvrant dudit graphe (G), un arbre (T1) couvrant de poids minimum, ladite association étant effectuée de telle sorte que le poids des arbres sélectionnés au cours des itérations précédentes vérifie ladite contrainte, les itérations étant répétées jusqu'à ce que le poids de l'arbre (T6) couvrant de poids minimum vérifie aussi ladite contrainte.
4. Procédé de classification selon la revendication 3, caractérisé en ce que chacune desdites itérations utilise une méthode linéaire.
5. Procédé de classification selon la revendication 3 ou 4, caractérisé en ce qu'on détermine ledit arbre (T1) couvrant de poids minimum dans ledit graphe (G) en utilisant la méthode de Kruskal.
6. Procédé de classification selon la revendication 2, caractérisé en ce qu'on détermine ledit arbre (T1) couvrant de poids minimum dans ledit graphe (G) en utilisant une méthode de résolution d'équations linéaires sous contraintes.
7. Dispositif (10) de classification d'un ensemble de documents électroniques, comportant : - des moyens (11-13) de représentation dudit ensemble de documents sous forme d'un graphe (G), dans lequel un sommet (A1-A6) représente un document et un arc (A1-A8) entre deux sommets représente au moins un lien hypertexte entre les documents représentés par ces sommets; et - des moyens (11-13) de détermination d'une partition (C1-C3) de l'ensemble des sommets (S1-S6) dudit graphe (G), cette partition étant obtenue par calcul de la force intrinsèque dudit graphe (G), chacun desdits sous-ensembles de documents étant constitué par l'ensemble des documents électroniques représentés par les sommets compris dans une même partie (Ci) de ladite partition (C1-C3).
8. Programme d'ordinateur comportant des instructions pour l'exécution des étapes du procédé de classification de documents selon l'une quelconque des revendications 1 à 6 lorsque ledit programme est exécuté par un ordinateur (10).
9. Support d'enregistrement (13) lisible par un ordinateur (10) sur lequel est enregistré un programme d'ordinateur comprenant des instructions pour l'exécution des étapes du procédé de classification de documents selon l'une quelconque des revendications 1 à 6.
EP08788165A 2007-05-29 2008-04-11 Procede de classification d'un ensemble de documents electroniques Withdrawn EP2153359A1 (fr)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
FR0755293 2007-05-29
PCT/FR2008/050646 WO2008148959A1 (fr) 2007-05-29 2008-04-11 Procede de classification d'un ensemble de documents electroniques

Publications (1)

Publication Number Publication Date
EP2153359A1 true EP2153359A1 (fr) 2010-02-17

Family

ID=38754537

Family Applications (1)

Application Number Title Priority Date Filing Date
EP08788165A Withdrawn EP2153359A1 (fr) 2007-05-29 2008-04-11 Procede de classification d'un ensemble de documents electroniques

Country Status (2)

Country Link
EP (1) EP2153359A1 (fr)
WO (1) WO2008148959A1 (fr)

Families Citing this family (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN106970779B (zh) * 2017-03-30 2020-01-03 重庆大学 一种面向内存计算的流式平衡图划分方法

Family Cites Families (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US7523117B2 (en) * 2005-05-04 2009-04-21 West Virginia University Research Corporation Method for data clustering and classification by a graph theory model—network partition into high density subgraphs

Non-Patent Citations (1)

* Cited by examiner, † Cited by third party
Title
See references of WO2008148959A1 *

Also Published As

Publication number Publication date
WO2008148959A1 (fr) 2008-12-11

Similar Documents

Publication Publication Date Title
EP1483693B1 (fr) Representation informatique d'une structure de donnees arborescente et methodes de codage/decodage associees
EP1470501B1 (fr) Procedes et systemes de recherche et d'association de ressources d'information telles que des pages web
FR3043816B1 (fr) Procede de suggestion de contenus extraits d’un ensemble de sources d’information
WO2008003875A2 (fr) Procédé de réduction du coût par action d'une campagne d'annonce publicitaire sur internet, et optimisant au maximum le nombre d'action effectué par des internautes
EP3118751A1 (fr) Procédé d'extraction de mots clés, dispositif et programme d'ordinateur correspondant
FR2801991A1 (fr) Procede et dispositif de recherche d'images basee sur le contenu prenant en compte le contenu de regions d'interet
EP4070228A1 (fr) Sauvegarde de documents en blocs
FR3062504A1 (fr) Detection automatique de fraudes dans un flux de transaction de paiement par reseaux de neurones integrant des informations contextuelles
EP3671578A1 (fr) Procédé d'analyse d'une simulation de l'exécution d'un circuit quantique
FR2909198A1 (fr) Procede et disositif de filtrage d'elements d'un document structure a partir d'une expression.
EP1912170A1 (fr) Dispositif informatique de corrélation propagative
WO2008148959A1 (fr) Procede de classification d'un ensemble de documents electroniques
EP1746521A1 (fr) Procédé de classement d'un ensemble de documents électroniques du type pouvant contenir des liens hypertextes vers d'autres documents électroniques
WO2007034096A1 (fr) Procede de tri d'un ensemble de documents electroniques
EP1635273A1 (fr) Construction informatique d'un arbre lexical
FR2902913A1 (fr) Procede et dispositif de codage d'une note de similarite semantique et spatiale entre concepts d'une ontologie memorisee sous forme de treillis numerote hierarchiquement
EP3622445B1 (fr) Procede, mise en oeuvre par ordinateur, de recherche de regles d'association dans une base de donnees
EP2584476A1 (fr) Prise en compte de la diversité du chemin pour la détermination de l'importance d'une unité d'information dans un parcours aléatoire au sein d'un réseau d'information
FR3045857A1 (fr) Procede et dispositif de classement d'un ensemble d'elements informatiques
FR2901037A1 (fr) Procede et dispositif de generation de motifs structurels de reference aptes a representer des donnees hierarchisees
FR2970100A1 (fr) Procede de generation d'un carnet d'adresses consolide
WO2009103872A1 (fr) Moniteur de système de communication par messages amélioré
BE1021329B1 (fr) Methode implementee par ordinateur pour la recherche d'annonces de vente de produits de seconde main.
WO2001095146A2 (fr) Systeme et procede permettant l'importation semi-automatique de fragments de ressources d'informations
FR3041126A1 (fr) Procede de fiabilisation automatique d'une base de donnees structurees

Legal Events

Date Code Title Description
PUAI Public reference made under article 153(3) epc to a published international application that has entered the european phase

Free format text: ORIGINAL CODE: 0009012

17P Request for examination filed

Effective date: 20091021

AK Designated contracting states

Kind code of ref document: A1

Designated state(s): AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC MT NL NO PL PT RO SE SI SK TR

AX Request for extension of the european patent

Extension state: AL BA MK RS

17Q First examination report despatched

Effective date: 20100422

DAX Request for extension of the european patent (deleted)
GRAP Despatch of communication of intention to grant a patent

Free format text: ORIGINAL CODE: EPIDOSNIGR1

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE APPLICATION IS DEEMED TO BE WITHDRAWN

18D Application deemed to be withdrawn

Effective date: 20110909