WO2014013191A2 - Procede de mesure d'un indice caracterisant le contenu d'un document numerique - Google Patents

Procede de mesure d'un indice caracterisant le contenu d'un document numerique Download PDF

Info

Publication number
WO2014013191A2
WO2014013191A2 PCT/FR2013/051713 FR2013051713W WO2014013191A2 WO 2014013191 A2 WO2014013191 A2 WO 2014013191A2 FR 2013051713 W FR2013051713 W FR 2013051713W WO 2014013191 A2 WO2014013191 A2 WO 2014013191A2
Authority
WO
WIPO (PCT)
Prior art keywords
documents
digital
index
criteria
digital documents
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Ceased
Application number
PCT/FR2013/051713
Other languages
English (en)
Other versions
WO2014013191A3 (fr
Inventor
Luigi Lancieri
Eric LEPRETRE
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Centre National de la Recherche Scientifique CNRS
Universite Lille 1 Sciences et Technologies
Original Assignee
Centre National de la Recherche Scientifique CNRS
Universite Lille 1 Sciences et Technologies
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Centre National de la Recherche Scientifique CNRS, Universite Lille 1 Sciences et Technologies filed Critical Centre National de la Recherche Scientifique CNRS
Publication of WO2014013191A2 publication Critical patent/WO2014013191A2/fr
Publication of WO2014013191A3 publication Critical patent/WO2014013191A3/fr
Anticipated expiration legal-status Critical
Ceased legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/30Information retrieval; Database structures therefor; File system structures therefor of unstructured textual data
    • G06F16/33Querying
    • G06F16/332Query formulation
    • G06F16/3325Reformulation based on results of preceding query
    • G06F16/3326Reformulation based on results of preceding query using relevance feedback from the user, e.g. relevance feedback on documents, documents sets, document terms or passages
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/30Information retrieval; Database structures therefor; File system structures therefor of unstructured textual data
    • G06F16/31Indexing; Data structures therefor; Storage structures
    • G06F16/316Indexing structures

Definitions

  • the present invention relates to methods for evaluating the relevance of a digital document. More particularly, the invention relates to a method for measuring an index characterizing the content of a digital document. Such an index being able to describe the content of such a document. STATE OF THE ART
  • lexicons of terms or expressions are implemented in order to complete the processing of the content of this digital document by a semantic analysis of the terms that constitute it.
  • Each digital document, in these processes, is then considered as a set of words (BOW acronym for "Bag Of Words") represented by a vector of characteristics, vectors then classified according to Bayesian network type learning techniques, for example a Na ⁇ ve Bayes (NB), Maximum Entropy (ME) or Support Vector Machine (SVM) classification model.
  • NB Na ⁇ ve Bayes
  • ME Maximum Entropy
  • SVM Support Vector Machine
  • these methods implement processing processes for taking into account the order of the words constituting these texts, syntactic structures and semantic relations between the words, for example: role-based POS (Part Of Speech). words in sentences, WR (Word Relation) n-gram for dependency relationships between words, TF-IDF (TermFrequency - Inverse Document Frequency) for weighting according to the frequency of each word.
  • the present invention aims to solve these problems resulting from the disadvantages of the state of the art. DISCLOSURE OF THE INVENTION
  • a problem that arises is to improve the performance of measurement methods of an index characterizing the content of a digital document.
  • the present invention proposes to automate and optimize the measurement methods of an index characterizing the content of a digital document.
  • the invention makes it possible to increase the genericity and to reduce the processing time implemented by such a method which significantly reduces the need for human intervention, in particular for the constitution of the dictionary.
  • the invention requires a reduced implementation cost compared to state of the art processes without impact on its effectiveness.
  • the invention remains independent of the language used in the digital documents to be the subject of an index measurement characterizing the content of a digital document.
  • one aspect of the invention relates to a method of measuring an index (I) characterizing the content of a digital document (M) comprising descriptive elements from a differential dictionary (( D,) i e [i; N]) comprising two sets Ui and 1 of criteria, said criteria relating to elements having a format similar to that of the descriptive elements of (M) and each being associated with a coefficient of relevance ( HK), said method comprising the following steps:
  • the set (U1) comprises criteria of the same category (((Ci) j e [ i ; N ] ) + HK) with HK> 0 and said set (U2) comprises criteria of the same category (((Cj) I [i; N]) + HK) with HKO;
  • the differential dictionary ((D,) ie [; N] ) is generated from the following steps:
  • the comparison step comprises one of the following substeps:
  • the generation of the differential dictionary ((D,) ie [i ; N ] ) comprises a criterion design step by the association with the element identified during the step of comparing a coefficient of relevance HK corresponding to the potentially negative difference between indices 11 and 12;
  • the two source digital documents (S1, S2) are generated during the following steps: ⁇ concatenation of initial digital documents (C) into two distinct digital documents ((A,) ie [i ; N]) and ((Bj) ie [i ; N]), and
  • the initial digital documents (C) are extracted from the database from queries comprising terms of primers whose semantic characteristics are opposable; the initial digital documents (C) are extracted from the database without the use of queries comprising primer terms but according to the so-called collection criteria of said initial digital documents (C); - the dictionary ((D,) ie [; N] ) generated on the basis of the separate digital documents ((A,) ie [1; N] ) and ((B,) ie [1; N] ) is applied to initial digital documents C so as to classify them according to their index (I) and to generate new separate digital documents ((A,) ie [i ; N]) and ((Bj) ie [i ; N]);
  • a synthetic dictionary (S) is produced from several dictionaries ((D,) ie [ i ; N ]).
  • FIG. 1 represents a flow diagram relating to the method according to one embodiment of the invention
  • FIG. 2 shows a flow chart for generating a differential dictionary ((D,) ie [i, N] according to one embodiment of the invention ,;
  • FIG. 3 represents a more detailed flow diagram relating to the generation of a differential dictionary ((D,) ie [1; N] according to one embodiment of the invention
  • FIG. 4 represents a flow chart relating to the generation of a a differential dictionary ((D,) ie [ i ; N] according to another embodiment of the invention.
  • the method for measuring an index I characterizing the content of a digital document M is implemented by a computing device.
  • this computer device corresponds, in a non-limiting manner, to all devices comprising:
  • Processing means at least one microprocessor, and memory means (volatile memory and / or non-volatile and / or mass);
  • input means such as a keyboard and / or a mouse and / or touch screen, or voice control means; display means;
  • the means of communication of this device relate for example to the following technologies and / or standards:
  • these communication means are compatible with the communication means of the server implementing the databases.
  • the processing means of this computing device are able to implement a computer code relating to an algorithm corresponding to a computer program, stored in the memory means of the computing device, comprising instructions able to perform the processing necessary to perform the steps of the method according to one embodiment of the invention.
  • the method for measuring an index I characterizing the content of a digital document M is made from, in particular, a differential dictionary ((Di) ie [1; N] ).
  • This index I in this embodiment of the invention makes it possible to measure the emotional valence (for example the positive or negative feeling) of the descriptive elements constituting the content of the digital document M that are for example the textual expressions, the terms , language expressions or words.
  • the constituent elements of the content of the digital document M can refer to a set of characters or else to graphic symbols representing a phoneme or a syllable, or even one or more sense units (for example an ideogram).
  • the digital document M corresponds to all types or digital file formats to the extent that their content can be exploited by said method.
  • this digital document M is in a nonlimiting manner, a textual document is a text.
  • this digital document M is an audio or video document
  • the content thereof can then be converted into graphic symbols (eg text), according to well-known conversion technologies of the state of the art. art, in order to be exploitable by the method according to one embodiment of the invention.
  • the differential dictionary ((Di) ie [1; N] ) comprises two sets U1 and U2 of criteria. These criteria make it possible to measure this index by determining the emotional valence of the elements constituting the content of the digital document.
  • Each of the two sets of criteria U1 and U2 comprises, for example, for the set U1 of criteria, elements relating to positively connoted terms, and for the set U2 of elements referring to negatively connoted terms. More precisely, these criteria correspond to an association of the element, here the term, with a coefficient of relevance: HK.
  • This element for U1 is ((Ci) ie [ i ; N] ) and for U2 ((Cj) I [i; N]).
  • These elements Ci) j e [i ; N]) and ((Cj) j e [i ; N]) are of the same format as those which constitute the digital document M.
  • this digital document M consists of ideograms then the elements Ci) j e [i ; N]) and ((Cj) j e [i ; N]) will be ideograms. If, as in the present embodiment of the invention, the digital document M consists of terms, then the elements ((Ci) ie [ i ; N] ) and ((C j ) I [i ; N ] ) will be terms .
  • the redundancy indices 11 and 12 are defined in greater detail below, and correspond to the occurrence frequency of this term in respectively each of the separate digital documents respectively ((Ai) ie [1; N] ) and ((Bi ) ie [i; N]) -
  • a given term present both in the separate digital documents respectively ((Ai) ie [ i ; N] ) and ((Bi) ie [ i ; N] ) we will consider for example that the redundancy of this term in the document ((Ai) i e [i; N]) is 11 and its redundancy in the document ((Bi) ie [1; N] ) is 12.
  • HK therefore represents the frequency difference (otherwise known as the differential frequency) d appearance of the term between the distinct digital documents ((Ai) ie [ i ; N] ) and ((Bi) ie [ i ; N ]).
  • This differential dictionary ((Di) ie [1; N] ) is used to measure the index I characterizing the content of the digital document M.
  • the differential dictionary ((Di) ie [ i ; N ]) allows the view the method by which it is generated to bring an optimal precision in the measurement of this index I. This precision is such that the method allows for example to determine the emotional feeling that emanates from a digital document M such as fear, trust, etc.
  • This method comprises a step of applying these criteria to the elements of the content of said digital document M so as to determine the number of elements N1 and N2 of the content of the digital document M respectively corresponding to one of the criteria of said sets U1 and U2.
  • This step consists of checking in the dictionary ((Di) ie [ i ; N ]) the presence of each element of N. If the element is present with a positive value HK then the element is considered to belong to the element. together U1. If it is present matches a negative HK value, it is considered to belong to the set U2.
  • the digital document M corresponds to a textual document coming for example from the Internet, or from the contents of an electronic mail, etc.
  • the measurement of the index I characterizing the content of this textual document, is carried out as follows:
  • this index I is calculated by the execution of an operation by the processing means of the computing device. This operation then relates to:
  • the digital document M is archived in a database with the value of this index and the domain to which this document relates. This digital document M is then classified in this database of digital documents according to the value of its index I.
  • the value of I evolving between a value of zero and one represents the level of feeling, all the more positive if it is close to one and all the more negative if it is close to zero.
  • the type of feeling (confidence, satisfaction, fear, ..) as well as the domain (Restoration, computer purchase, politics, ..) is induced by the content of the dictionary ((Di) ie [ i ; N ] ) .
  • this dictionary is generated notably from two distinct digital documents ((Ai) ie [i ; N] ) and ((Bi) ie [i; N]). which can be obtained from two different embodiments: a so-called supervised mode and another unsupervised mode.
  • the supervised approach retains its interest because it allows a greater control of the human on the constitution of the differential dictionary and to address more types of feelings than in the unsupervised embodiment.
  • the differential dictionary ((Di) ie [ i ; N] ) implemented in the method of measurement of the index I is generated from: a comparison step between two digital source documents S1 and S2, each comprising a list of elements associated with an index 11 and an index 12 of redundancy and
  • these two source documents S1 and S2 relate to the same technical field or context, such as for example the restoration or computing, and are generated by the computer device from a first time of keywords, also called primers keywords or primer terms. These key words of primers are provided by an operator.
  • the source document S1 includes elements that define this domain differently than those included in the source document S2.
  • these key words of primers can be terms intended to evaluate:
  • primers can be informed by an operator with the essential constraint that on the semantic feature these terms can be opposed.
  • these keywords defining the characteristics of the domain may correspond to a positive or negative feeling or opinion.
  • this differential dictionary ((Di) i e [i; N])
  • two to three key words of primers by categories (positive or negative) are necessary.
  • the computing device From these keywords, the computing device generates a query so as to perform a search in the database, or alternatively in other databases or the Internet.
  • This search then aims to retrieve initial digital documents C in each of the categories - positive, negative - from a request including positive key words and another request including negative key words.
  • the initial digital documents C are subsequently converted to the format of textual documents containing these terms if these initial digital documents C are in different formats.
  • the constraint here is to collect a number of initial digital documents C of close sizes in sufficient number (at least 10). However, one can tolerate a certain dispersion: for example, 10% of the initial digital documents C may be 2 to 3 times the average size of the initial digital documents C constituting the result of the search.
  • the necessary number is fixed by the constraint induced by the size of the documents A and B of the order of 100 to 150 kb per file corresponding to a document. This size is sufficient. Performance improves very little with larger sizes. Indeed, if the sizes are too small the proportion of "useless" terms can be very different from a separate digital document to another. By increasing the size, the frequency of useless terms increases and stabilizes at an identical level in the two separate digital documents.
  • Unnecessary terms are statistically represented in two separate digital documents ((Ai) ie [ i ; N ]) and ((Bi) ie [ i ; N ]).
  • these distinct digital documents ((Ai) ie [ i ; N ]) and ((Bi) ie [i; N]) relate to files having a "sufficient" size and the like (see further step consistency check)
  • this equivalence is detected and the useless terms are then deleted.
  • the advantage of preserving useful terms and eliminating others is all the better as the lists are of similar sizes.
  • the content of these two files is the subject of a particular treatment to control that the occurrence of each keyword defined above (terms of use). primers provided by the user) and included in this content, is greater than a threshold K2.
  • the threshold k2 300. From this value the results obtained are considered to be better. This step is simply to verify that the few key words of primers are sufficiently present in the two separate digital documents.
  • the value 300 of the threshold k2 is an element to control the quality of two separate digital documents. It implies that enough initial C digital documents have been found covering the target area (eg quality of restaurants, popularity of computer hardware, etc.). Note the link between this value and that of the size constraint (100-150ko) mentioned above which represents approximately 20,000 terms per discrete digital document (A, B). The 300 terms represent 1 .5% of this total. Thus apart from extreme cases (eg, primers, misspelled words), the 300 terms are reached without problems if the constraint of 100-150 kb is satisfied. This step is therefore especially a control mode. If this step fails, it is necessary to redo a search for initial documents C. This search can be partial by replacing only the 30% of the initial documents C in which the terms of primers are least represented.
  • the distinct digital documents ((Ai) ie [ i ; N] ) and ((Bi) ie [ i ; N] ) can be obtained from different way.
  • the device sends a request to the database, and alternatively to other databases or on the Internet.
  • This request provides initial digital documents C pertaining to the same domain, for example restoration or computer science.
  • This search then aims to find initial digital documents C which are subsequently converted to the format of textual documents containing these terms if these initial digital documents C are in different formats.
  • These initial digital documents C here textual documents must be of the same nature and belong to the same field, for example, notices on online merchants of computer products.
  • the sources of information from which these initial digital documents are derived C must be sources of opinion as opposed to purely descriptive sources.
  • smartphone usage patterns may not be appropriate because they are descriptive and do not contain opinions or value judgments.
  • a forum a blog or a site containing consumer reviews, or any other known source (or possibly superficially verified) containing opinions on smartphones may be appropriate.
  • these initial digital documents C are processed in order to filter each of these initial digital documents C according to three so-called "collection" criteria:
  • these initial digital documents C must be in sufficient number (at least 10) and of close sizes, that is to say, comprise substantially the same number of terms. In some cases, however, some dispersion may be tolerated: for example, 10% of the initial digital documents C may be 2 to 3 times the average size of the initial digital documents C constituting the result of the search.
  • the number of initial documents C must be such that each document (A, B) aggregating the documents C has a size of 100 to 150 kb.
  • - contextuality a semantic, superficial analysis of these initial digital documents C is carried out in order to verify that the elements constituting each of these initial digital documents C relate to a vocabulary close to the desired context. For example the evaluation of restaurants differs from the evaluation of computer equipment. This constraint of contextuality is naturally satisfied when the initial source of information is deemed to be dedicated to the chosen context. For example, knowing that a website is dedicated to sharing user reviews of smartphones is enough as a contextuality index. The fact that some documents derogate from this rule is not a problem as long as they are not in the majority.
  • a certain number of initial digital documents C collected are then concatenated in the two distinct digital documents ((Ai) ie [ i ; N ]) and ((Bi) ie [ i ; N ] ).
  • These initial digital documents C retain their autonomy because, despite their distribution and concatenation in the two distinct digital documents ((Ai) i e [i; N]) and ((Bi) ie [ i ; N ]), it is possible to isolate them individually.
  • these initial digital documents C are isolated by textual separators in the separate digital documents ((Ai) ie [ i ; N ]) and ((Bi) ie [ i ; N ]) in which they are concatenated. But this isolation can be achieved in different ways.
  • a computer is able to implement the various embodiments of the invention.
  • the two distinct digital documents ((Ai) ie [ i ; N] ) and ((Bi) ie [ i ; N] ) have a size of the order of 100 to 150 kb. file corresponding to each document.
  • a size of the order of 100 to 150 kb. file corresponding to each document 100 to 150 kb. file corresponding to each document.
  • negatively connoted texts are longer than positively connoted ones.
  • the distinct digital documents ((A,) ie [; N] ) and ((Bi) i e [i; N]) that have been obtained are therefore the distinct digital documents A1 and B1 on the basis of of which the differential dictionary D1 has been generated.
  • the dictionary D1 thus already allows in terms of probability to separate the initial documents C connoted negatively from those positively connoted. Indeed, even if in this initial phase, the distribution of the initial documents C was random, the positive terms (respectively negative) will be isolated and separated by the constitution process of the dictionary. This separation capacity will improve as the steps progress following: generations of the new dictionaries (D2, D3, ..) from the successive reclassifications of the initial documents C.
  • k4 5
  • Dj ie [i; N]
  • a given term is added in the synthetic dictionary S, if it is contained in at least one of the N differential dictionaries and if the value of the sum SG of the number of appearances of each term in these N differential dictionaries ((Dj ) ie [i ; N ] ), is greater than a limit K8 x N.
  • this substep of selection can be performed differently taking into account for a given term the following conditions: the sum SG is greater than the product K8 by the number of differential dictionaries included in this set; the sum SJ is greater than the product K9 by the maximum possible frequency is the highest cumulative frequency (FM). FM is the maximum cumulative frequency found, that is, the frequency with the highest cumulative frequency.
  • the elaborate decision-making method first allows to collect the most present words in the N dictionaries (ie cumulative appearance) and we make sure that this subset of connoted terms is also sufficiently present in the vocabulary in general, that is to say in frequency.
  • K8 and K9 correspond to 0.25 (ie 1/4). This value can be modified according to the relevance and the optimization that one wants to obtain for this synthetic dictionary S.
  • This differential dictionary ((D,) ie [; N] ) and / or synthetic S will be used as a reference for measuring a digital document M corresponding for example to an unknown text document.
  • the differential dictionaries ((Di) ie [1; N] ) and / or synthetic S obtained are archived in the database according to the domain to which they relate.
  • the present embodiment finds a particular application in the context of the measurement of the index I of a digital document M revealing for example the feeling that can emanate from such document.
  • Such an index measurement tool I can be implemented in many Internet services (e-reputation, satisfaction measure or customer experience, ).
  • This tool can be declined in a multitude of different contexts - sale of computers, sale of clothing - and can be submitted without any difficulty to linguistic variations - language change, language changes or language use of users: language sms -.

Landscapes

  • Engineering & Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • Theoretical Computer Science (AREA)
  • Data Mining & Analysis (AREA)
  • Databases & Information Systems (AREA)
  • General Engineering & Computer Science (AREA)
  • General Physics & Mathematics (AREA)
  • Mathematical Physics (AREA)
  • Software Systems (AREA)
  • Computational Linguistics (AREA)
  • Information Retrieval, Db Structures And Fs Structures Therefor (AREA)
  • Machine Translation (AREA)

Description

PROCEDE DE MESURE D'UN INDICE CARACTERISANT LE CONTENU
D'UN DOCUMENT NUMERIQUE
DOMAINE TECHNIQUE DE L'INVENTION [001] La présente invention concerne les procédés d'évaluation de la pertinence d'un document numérique. Plus particulièrement, l'invention concerne un procédé de mesure d'un indice caractérisant le contenu d'un document numérique. Un tel indice étant apte à décrire le contenu d'un tel document. ÉTAT DE LA TECHNIQUE
[002] Dans les domaines relatifs au classement de documents numériques, ou encore de tri de tels documents en vu de leur utilisation dans le cadre de moteur de recherche par exemple, il y a un besoin croissant de procédé permettant de mesurer la pertinence de tels documents. [003] La nature de ces documents numériques, textes d'opinion traitant de sujets variés, et l'identification plus précise de l'objet de tel document, requièrent une définition des outils d'analyse qui soient plus fine et donc susceptibles de permettre une identification plus précise quant au sens du contenu de tels documents, par exemple par l'extraction et la quantification de sentiments qui peuvent y être exprimés.
[004] On connaît par exemple dans l'état de l'art, des procédés qui prévoient le classement de documents numériques à partir de la détermination de la teneur des termes mentionnés dans le contenu de ces documents. Pour ce faire de tels procédés prévoient l'utilisation d'outils d'analyse capable d'extraire et de quantifier les éléments du contenu de ce document numérique.
Dans de tels procédés, des lexiques de termes ou d'expressions sont mis en œuvre afin de compléter le traitement du contenu de ce document numérique par une analyse sémantique des termes qui le constituent. Chaque document numérique, dans ces procédés, est alors considéré comme un ensemble de mots (BOW acronyme de « Bag Of Words ») représenté par un vecteur de caractéristiques, vecteurs classés ensuite selon des techniques d'apprentissage de type réseau bayésien, par exemple un modèle de classification Naïve Bayes(NB), d'entropie maximale (ME Maximum Entropy) ou encore de Support Vector Machine (SVM).
De plus ces procédés mettent en œuvre des processus de traitement pour la prise en compte de l'ordre des mots constituant ces textes, des structures syntaxiques et des relations sémantiques entre les mots comme par exemple : POS (Part Of Speech) reposant sur le rôle des mots dans les phrases, WR (Word Relation) n-gram pour les relations de dépendances entre les mots, TF-IDF (TermFrequency - Inverse Document Frequency) pour la pondération en fonction de la fréquence de chaque mot.
[005] Cependant un inconvénient majeur de tels procédés réside dans le fait que lors de la phase d'apprentissage, il est nécessaire qu'une intervention humaine conséquente soit réalisée lors de l'évaluation des textes de références.
On comprendra que de telles interventions humaines ont pour inconvénients principaux de prendre du temps et de nécessiter des compétences spécifiques avec un haut niveau de technicité. Ces contraintes ont pour conséquences de fournir des résultats ayant une portée limitée en termes de généricité (une langue, un seul contexte, ..).
[006] La présente invention vise alors résoudre ces problèmes résultant des inconvénients de l'état de l'art. DIVULGATION DE L'INVENTION
[007] Un problème qui se pose est donc d'améliorer les performances de procédés de mesure d'un indice caractérisant le contenu d'un document numérique. [008] La présente invention se propose d'automatiser, et d'optimiser les procédés de mesure d'un indice caractérisant le contenu d'un document numérique.
[009] L'invention permet d'augmenter la généricité et de réduire le temps de traitement mis en œuvre par un tel procédé qui réduit notablement le besoin d'intervention humaine, en particulier, pour la constitution du dictionnaire.
[0010] L'invention requiert un coût de mis en œuvre réduit par rapport aux procédés de l'état de l'art sans conséquence sur son efficacité.
[0011] De plus, l'invention reste indépendante de la langue utilisé dans les documents numériques devant faire l'objet d'une mesure d'indice caractérisant le contenu d'un document numérique.
[0012] Dans ce dessein, un aspect de l'invention se rapporte à procédé de mesure d'un indice (I) caractérisant le contenu d'un document numérique (M) comportant des éléments descriptifs à partir d'un dictionnaire différentiel ((D,) ie[i ;N]) comprenant deux ensembles Ui et 1 de critères, lesdits critères se rapportant à des éléments ayant un format similaire à celui des éléments descriptifs de (M) et étant chacun associé à un coefficient de pertinence (HK), ledit procédé comportant les étapes suivantes:
• application des critères desdits ensembles Ui et U2 aux éléments descriptifs du contenu dudit document numérique (M) de sorte à déterminer les nombres N1 et N2 d'éléments descriptifs dudit contenu correspondant aux critères desdits ensembles respectivement U1 et U2, et
• calcul de l'indice (I) compris dans un intervalle de valeurs [0,1 ] par l'exécution de l'opération : N1/(N1 + N2). [0013] Selon des modes de réalisation particuliers :
- l'ensemble (U1 ) comporte des critères de même catégorie (((Ci) je[i ;N])+H K) avec HK>0 et ledit ensemble (U2) comporte des critères de même catégorie (((Cj)je[i ;N]) + HK) avec HKO ; - le dictionnaire différentiel ((D,) ie[ ;N]) est généré à partir des étapes suivantes :
• comparaison entre deux documents numériques sources (S1 ,S2), comprenant chacun une liste d'éléments associés avec respectivement un indice et un indice de redondance ;
• conception de critères ;
- l'étape de comparaison comporte l'une des sous-étapes suivantes :
• identification d'un élément compris dans un seul des documents numériques sources (S1 ,S2), ou · identification d'un élément compris dans les deux documents numériques sources (S1 ,S2), et que son indice (h , b) dans l'un de ces deux documents soit x fois supérieure à son indice (h , b) dans l'autre de ces deux documents ;
- la génération du dictionnaire différentiel ((D,) ie[i ;N]) comporte une étape de conception de critères par l'association à l'élément identifié lors de l'étape de comparaison d'un coefficient de pertinence HK correspondant à la différence potentiellement négative entre les indices 11 et 12 ;
- les deux documents numériques sources (S1 ,S2) sont générés lors des étapes suivantes : · concaténation de documents numériques initiaux (C) en deux documents numériques distincts ((A,) ie[i ;N]) et ((Bj) ie[i ;N]), et
• classement des éléments contenus dans chacun de ces documents numériques distincts ((A,) ie[1 ;N]) et ((B,) ie[1 ;N]) en fonction de leurs indices de redondances ( ,b) ;
- les documents numériques initiaux (C) sont extraits de base de données à partir de requêtes comportant des termes d'amorces dont les caractéristiques sémantiques sont opposables ; - les documents numériques initiaux (C) sont extraits de base de données sans l'utilisation de requêtes comportant des termes d'amorces mais en fonction des critères dits de collectes desdits documents numériques initiaux (C) ; - le dictionnaire ((D,) ie[ ;N]) généré sur la base des documents numériques distincts ((A,) ie[1 ;N]) et ((B,) ie[1 ;N]) est appliqué aux documents numériques initiaux C de sorte à les classer en fonction de leur indice (I) et à générer de nouveaux documents numériques distincts ((A,) ie[i ;N]) et ((Bj) ie[i ;N]) ;
- Il comprend la génération d'un dictionnaire ((D,) ie[ ;N]) à partir des nouveaux documents numériques distincts ((A,) ie[ ;N]) et ((B,) ie[ ;N]), et
- un dictionnaire synthétique (S) est réalisé à partir de plusieurs dictionnaires ((D,) ie[i ;N]).
DESCRIPTION DES FIGURES
D'autres avantages et caractéristiques de l'invention apparaîtront mieux à la lecture de la description d'un mode de réalisation préféré qui va suivre, en référence à la figure 1 , réalisé à titre d'exemple indicatif et non limitatif :
- figure 1 représente un organigramme relatif au procédé selon un mode de réalisation de l'invention ;
- figure 2 représente un organigramme relatif à la génération d'un dictionnaire différentiel ((D,) ie[i ;N] selon un mode de réalisation de l'invention,;
- figure 3 représente un organigramme plus détaillé portant sur la génération d'un dictionnaire différentiel ((D,) ie[1 ;N] selon un mode de réalisation de l'invention, et - figure 4 représente un organigramme portant sur la génération d'un dictionnaire différentiel ((D,) ie[i ;N] selon un autre mode de réalisation de l'invention.
MODES DE REALISATION DE L'INVENTION. [0014] Dans un mode de réalisation de l'invention le procédé de mesure d'un indice I caractérisant le contenu d'un document numérique M est mis en œuvre par un dispositif informatique.
[0015] De manière générale, ce dispositif informatique correspond, de manière non limitative, à tous dispositifs comprenant :
- des moyens de traitement : au moins un microprocesseur, et des moyens de mémoire (mémoire volatile et/ou non volatile et/ou de masse) ;
- des moyens de saisie, tel qu'un clavier et/ou une souris et/ou écran tactile, ou encore à des moyens de commande vocale ; - des moyens d'affichage ;
- des moyens de communication ;
Les moyens de communication de ce dispositif se rapportent par exemple aux technologies et/ou normes suivantes :
- WI-FI (abréviation de wirelessfidelity) et/ou Wimax, et GPRS (General Packet Radio Service), GSM, UMTS, HSDPA ou IMS (IP
MultimediaSubsystem), ou
- Ethernet.
[0016] On notera, en particulier, que ces moyens de communication sont compatibles avec les moyens de communication du serveur mettant en œuvre les bases de données.
[0017] Les moyens de traitement de ce dispositif informatique sont aptes à mettre en œuvre un code informatique se rapportant à un algorithme correspondant à un programme d'ordinateur, archivé dans les moyens de mémoire du dispositif informatique, comportant des instructions aptes à effectuer les traitements nécessaires pour réaliser les étapes du procédé selon un mode de réalisation de l'invention. [0018]Ainsi qu'il est illustré à la figure 1 , le procédé de mesure d'un indice I caractérisant le contenu d'un document numérique M est réalisé à partir notamment d'un dictionnaire différentiel ((Di) ie[1 ;N]).
[0019] Cet indice I dans ce mode de réalisation de l'invention permet de mesurer la valence émotionnelle (par exemple le sentiment positif ou négatif) des éléments descriptifs constitutifs du contenu du document numérique M que sont par exemple les expressions textuelles, les termes, les expressions du langage ou les mots. A titre d'exemple les éléments constitutifs du contenu du document numérique M peuvent se rapporter à un ensemble de caractères ou encore à des symboles graphiques représentant un phonème ou une syllabe, ou encore une ou plusieurs unités de sens (par exemple un idéogramme).
Dans les modes de réalisation décrits, ces éléments constitutifs du contenu de document numérique sont de manière non limitative des termes. [0020] Le document numérique M correspond à tous les types ou formats de fichiers numériques dans la mesure où leur contenu peut être exploité par ledit procédé. Dans le présent mode de réalisation, ce document numérique M est de manière non limitative, un document textuel soit un texte.
[0021] Si par exemple, ce document numérique M est un document audio ou vidéo, le contenu de celui-ci peut alors être converti en symboles graphiques (e.g texte), selon des technologies de conversion bien connues de l'état de l'art, afin d'être exploitable par le procédé selon un mode de réalisation de l'invention.
[0022] Le dictionnaire différentiel ((Di) ie[1 ;N]) comprend deux ensembles U1 et U2 de critères. Ces critères permettent de mesurer cet indice en déterminant la valence émotionnelle des éléments constituant le contenu du document numérique.
[0023] Chacun des deux ensembles de critères U1 et U2 comprend par exemple pour l'ensemble U1 de critères, des éléments se rapportant à des termes connotés positivement, et pour l'ensemble U2 des éléments se rapportant à des termes connotés négativement. Plus précisément, ces critères correspondent à une association de l'élément, ici le terme, avec un coefficient de pertinence : HK. Cet élément pour U1 est ((Ci)ie[i ;N]) et pour U2 ((Cj)je[i ;N]). Ces éléments Ci)je[i ;N]) et ((Cj)je[i ;N]) sont du même format que ceux qui constituent le document numérique M. Si ce document numérique M est constitué d'idéogrammes alors les éléments Ci)je[i ;N]) et ((Cj)je[i ;N]) seront des idéogrammes. Si comme dans le présent mode de réalisation de l'invention le document numérique M est constitué de termes alors les éléments ((Ci)ie[i ;N]) et ((Cj)je[i ;N]) seront des termes. HK correspond à la différence potentiellement négative entre les indices 11 et 12. HK est une fréquence différentielle. Soit HK= 11 -12.
Les indices de redondances 11 et 12 sont définis plus en détail par la suite, et correspondent à la fréquence d'apparitions de ce terme dans respectivement chacun des documents numériques distincts respectivement ((Ai)ie[1 ;N]) et ((Bi)ie[i ;N])- Autrement dit pour un terme donné présent à la fois dans les documents numériques distincts respectivement ((Ai)ie[i ;N]) et ((Bi)ie[i ;N]) on considérera par exemple que la redondance de ce terme dans le document ((Ai)ie[i ;N]) est 11 et sa redondance dans le document ((Bi)ie[1 ;N]) est 12. Si le terme est présent 2 fois dans le document ((Ai)ie[1 ;N]) et absent du document ((Bi)ie[i ;N]) alors 11 =2 et 12=0. Les indices de redondances 11 et 12 selon le même raisonnement sont également utilisés dans les documents numériques sources (S1 ,S2).
Par conséquent, compte tenu du fait que ((Ai)ie[1 ;N]) et ((Bi)ie[1 ;N]) sont de tailles comparables, HK représente donc la différence de fréquence (autrement appelé fréquence différentielle) d'apparition du terme entre les documents numériques distincts ((Ai)ie[i ;N]) et ((Bi)ie[i ;N]).
Ces documents numériques distincts respectivement ((Ai)ie[i ;N]) et ((Bi)ie[i ;N]) correspondent par exemple à du texte.
[0024] On comprend bien que l'ensemble - U1 comporte des critères de même catégorie : ((C,) ,e[i ;N]) + HK (avec HK>0)
- U2 comporte des critères de même catégorie : ((Cj)je[i ;N]) + HK (avec HK<0)
[0025] Ce dictionnaire différentiel ((Di)ie[1 ;N]) est utilisé pour mesurer l'indice I caractérisant le contenu du document numérique M. Le dictionnaire différentiel ((Di)ie[i ;N]) permet au regard de la méthode par laquelle il est généré d'apporter une précision optimale dans la mesure de cet indice I. Cette précision est telle que le procédé permet par exemple de déterminer le sentiment émotionnel qui émane d'un document numérique M tel que la peur, la confiance, etc ..
[0026] Ce procédé comprend une étape d'application de ces critères aux éléments du contenu dudit document numérique M de sorte à déterminer le nombre d'élément N1 et N2 du contenu du document numérique M correspondant respectivement à un des critères desdits ensembles U1 et U2. Cette étape consiste à vérifier dans le dictionnaire ((Di)ie[i ;N]) la présence de chaque élément de N. Si l'élément est présent assorti d'une valeur HK positive alors l'élément est considéré appartenir à l'ensemble U1 . Si il est présent assortit d'une valeur HK négative, il est considéré appartenir à l'ensemble U2. Par exemple, lorsque le document numérique M correspond à un document textuel provenant par exemple d'Internet, ou d'un contenu d'un courrier électronique, etc.. La mesure de l'indice I, caractérisant le contenu de ce document textuel, est réalisée de la manière suivante :
- détermination du nombre d'éléments N1 ici des termes de ce document textuel correspondant aux critères compris dans l'ensemble U1 ;
- détermination du nombre d'éléments N2 ici des termes de ce document textuel correspondant aux critères compris dans l'ensemble U2.
[0027] Une fois les critères appliqués aux éléments du contenu de ce document numérique M et les nombres N1 et N2 obtenus, une valeur de cet indice I est calculée par l'exécution d'une opération par les moyens de traitement du dispositif informatique. Cette opération se rapporte alors à :
I = N1/ (N1 + N2).
[0028] Une fois la valeur de cet indice I déterminée le document numérique M est archivé dans une base de données avec la valeur de cet indice et le domaine auquel ce document se rapporte. Ce document numérique M est alors classé dans cette base de données de documents numériques en fonction de la valeur de son indice I.
[0029] Par conséquent, la valeur de I évoluant entre une valeur de zéro et de un représente le niveau du sentiment, d'autant plus positif s'il est proche de un et d'autant plus négatif s'il est proche de zéro. Le type de sentiment (confiance, satisfaction, peur, ..) ainsi que le domaine (Restauration, achat informatique, politique, ..) est induit par le contenu du dictionnaire ((Di)ie[i ;N]).
[0030]Ainsi qu'il est illustré aux figures 2 et 3, ce dictionnaire est généré à partir notamment de deux documents numériques distincts ((Ai)ie[i ;N]) et ((Bi)ie[i ;N]), lesquelles peuvent être obtenus à partir de deux modes de réalisation différents : un mode dit supervisé et un autre mode dit non supervisé.
[0031] On notera que l'approche non supervisée est la plus performante compte tenu du besoin très limité d'intervention humaine.
Cependant l'approche supervisée garde de son intérêt car elle permet un contrôle plus important de l'humain sur la constitution du dictionnaire différentiel et d'aborder plus de type de sentiments que dans le mode de réalisation non supervisé. [0032] Dans le premier mode de réalisation dit supervisé, le dictionnaire différentiel ((Di)ie[i ;N]) mis en œuvre dans le procédé de mesure de l'indice I est généré à partir de : - une étape de comparaison entre deux documents numériques sources S1 et S2, comprenant chacun une liste d'éléments associés avec respectivement un indice 11 et un indice 12 de redondance et
- une étape de conception de critères. [0033] Dans ce mode de réalisation, ces deux documents sources S1 et S2 se rapportent à un même domaine technique ou contexte, comme par exemple la restauration ou l'informatique, et sont générés par le dispositif informatique à partir dans un premier temps de mots clés, encore appelés mot clés d'amorces ou termes d'amorces. Ces mots clés d'amorces sont fournis par un opérateur.
Le document source S1 comporte des éléments qui définissent ce domaine de manière différente de ceux compris dans le document source S2.
Ces mots clés d'amorces caractérisent un domaine donné en correspondant à des termes exprimant un sentiment ou une opinion, ou encore des caractéristiques de ce domaine.
Par exemple ces mots clés d'amorces peuvent être des termes visant à évaluer :
- la réputation de restaurants comme par exemple : succulent, chaleureux (termes positifs) ; froid, mauvais (termes négatifs); - la réputation d'un vendeur de matériel informatique : fiable, compétent
(termes positifs); pannes, incompétent (termes négatifs) ;
- le sentiment de sécurité perçu : confiance, réticence.
Ces termes d'amorces peuvent être renseignés par un opérateur avec pour contrainte essentielle que sur la caractéristique sémantique ces termes puissent être opposés. Par exemple ces mots clés définissant les caractéristiques du domaine peuvent correspondre à un sentiment ou une opinion positive et négative. Pour la restauration : succulent (terme positif) ; mauvais (terme négatif). On dit ici que les caractéristiques sémantiques de ces mots clefs sont opposables. [0034] Dans le cadre de la génération de ce dictionnaire différentiel ((Di)ie[i ;N]), de manière générale deux à trois mots clés d'amorces par catégories (positif ou négatif) sont nécessaires.
[0035]A partir de ces mots clés, le dispositif informatique génère une requête de manière à réaliser une recherche dans la base de données, ou de manière alternative dans d'autres bases de données ou encore Internet. Cette recherche vise alors à retrouver des documents numériques initiaux C dans chacune des catégories - positif, négatif - à partir d'une requête comprenant des mots clefs d'amorces positifs et une autre requête comprenant des mots clefs d'amorces négatifs. Les documents numériques initiaux C sont par la suite convertis au format de documents textuels contenant ces termes si ces documents numériques initiaux C sont dans des formats différents.
[0036] Ces documents numériques initiaux C sont ensuite concaténés en deux documents numériques distincts ((Ai)ie[i ;N]) et ((Bi)ie[i ;N]) qui correspondent chacun à une catégorie positive ou négative.
[0037] La contrainte ici est de recueillir un nombre de documents numériques initiaux C de tailles proches en nombre suffisant (10 au minimum). On peut toutefois tolérer une certaine dispersion : par exemple, 10 % des documents numériques initiaux C pourront être de 2 à 3 fois la taille moyenne des documents numériques initiaux C constituant le résultat de la recherche. Le nombre nécessaire est fixé par la contrainte induite par la taille des documents A et B de l'ordre de 100 à 150 ko par fichier correspondant à un document. Cette taille est suffisante. Les performances s'améliorent très peu avec des tailles plus importantes. En effet, si les tailles sont trop faibles la proportion de termes « inutiles » pourra être très différente d'un document numérique distinct à l'autre. En augmentant la taille, la fréquence des termes inutiles augmente et se stabilise à un niveau identique dans les deux documents numériques distincts. Aller au delà de cette taille n'apporte rien dans la performance du processus de discrimination. [0038] Ces deux documents numériques distincts ((Ai)ie[i ;N]) et ((Bi)ie[i ;N]) se rapportent à des fichiers qui sont de manière générale de taille similaire.
Ces documents numériques distincts ((Ai)ie[1 ;N]) et ((Bi)ie[1 ;N]) font par la suite l'objet d'un traitement particulier lors d'une étape d'analyse fréquentielle afin d'identifier les termes de leur contenu et leur fréquence d'apparitions, soit leur indice de redondance 11 et 12.
En effet, ces deux documents numériques distincts ((Ai)ie[i ;N]) et ((Bi)ie[i ;N]) contiennent des termes connotés qu'il convient d'identifier. On sait simplement que l'un contient plutôt des termes négatifs et l'autre des termes positifs. Dans ce mode de réalisation de l'invention, les termes d'amorces ont été choisis en conséquence. Donc, chacun des documents numériques distincts ((Ai)ie[i ;N]) et ((Bi)ie[i ;N]) contient des termes utiles (termes connotés négativement ou positivement) et des termes inutiles (articles, mots non connotés,..). Les termes inutiles sont statistiquement autant représentés dans les deux documents numériques distincts ((Ai)ie[i ;N]) et ((Bi)ie[i ;N]). En considérant par exemple que ces documents numériques distincts ((Ai)ie[i ;N]) et ((Bi)ie[i ;N]) sont relatifs à des fichiers ayant une taille « suffisante » et similaire (voir plus loin étape de vérification de cohérence), on détecte alors cette équivalence et les termes inutiles sont alors supprimés. L'avantage relatif à la conservation des termes utiles et l'élimination des autres est d'autant meilleur que les listes sont de tailles proches.
La suppression des termes inutiles est réalisée automatiquement car pour qu'un terme soit retenu dans le cadre de la génération d'un dictionnaire il faut, que lors d'une étape de sélection, que ce terme soit compris au moins dans un des deux documents ((Ai)ie[i ;N]) et ((Bi)ie[i ;N]) et que son indice de redondance (11 , 12) dans l'un des deux documents ((Ai)ie[i ;N]) et ((Bi)ie[i ;N]) soit x fois supérieure à son indice redondance (11 , 12) dans l'autre des deux documents ((Ai)ie[1 ;N]) et ((Bi)ie[1 ;N]). Par exemple x=2.
Soit 11 > 2 x l2 ou 12 > 2 x 11 . Du fait que les termes inutiles ont des fréquences d'apparition proches quelque soit la polarité du sentiment exprimés (Ai, Bi). Ils ne satisferont jamais les contraintes suivantes : 11 > 2 x 12 ou 12 > 2 x 11 . Et donc ces termes ne seront pas conservés dans le dictionnaire différentiel.
[0039] Lors d'une étape de vérification de la cohérence des fichiers A et B, le contenu de ces deux fichiers fait l'objet d'un traitement particulier visant à contrôler que l'occurrence de chaque mot clef défini précédemment (termes d'amorces renseignés par l'utilisateur) et compris dans ce contenu, soit supérieure à un seuil K2.
Dans le présent mode de réalisation le seuil k2=300. A partir de cette valeur les résultats obtenus sont considérés comme étant meilleurs. Cette étape consiste simplement à vérifier que les quelques mots clés d'amorces sont suffisamment présents dans les deux documents numériques distincts. La valeur de 300 du seuil k2 est un élément permettant de contrôler la qualité des deux documents numériques distincts. Il implique que l'on a trouvé suffisamment de documents numériques initiaux C couvrant le domaine cible (par ex qualité des restaurants, popularité d'un matériel informatique, etc). On remarquera le lien entre cette valeur et celle de la contrainte de taille (100-150ko) évoqué plus haut qui représente à peu prés 20 000 termes par documents numériques distincts(A,B). Les 300 termes représentent 1 .5% de ce total. Ainsi en dehors de cas extrêmes (eg. mots amorces, mal orthographiés), les 300 termes sont atteints sans problèmes si la contrainte des 100-150 ko est satisfaite. Cette étape est donc surtout un mode de contrôle. Si cette étape échoue, il convient de refaire une recherche de documents initiaux C. Cette recherche pourra être partielle en ne remplaçant que les 30 % des documents initiaux C dans lesquels les termes d'amorces sont les moins représentés.
[0040] Dans un autre mode de réalisation dit non supervisé, illustré à la figure 4, les documents numériques distincts ((Ai)ie[i ;N]) et ((Bi)ie[i ;N]) peuvent être obtenus de manière différente.
En effet, dans cet autre mode de réalisation, l'utilisation de mots clefs d'amorces visant la réalisation d'une recherche pour trouver des documents numériques initiaux C n'est pas nécessaire. Pour ce faire, le dispositif émet une requête vers la base de données, et de manière alternative vers d'autres bases de données ou encore sur Internet. Cette requête fournit des documents numériques initiaux C se rapportant à un même domaine par exemple la restauration ou encore l'informatique. Cette recherche vise alors à retrouver des documents numériques initiaux C qui sont par la suite convertis au format de documents textuels contenant ces termes si ces documents numériques initiaux C sont dans des formats différents. Ces documents numériques initiaux C, ici des documents textuels doivent être de même nature et appartenir au même domaine, par exemple, des avis sur des marchands en lignes de produits informatiques.
De plus, il faut que les sources d'informations dont sont issues ces documents numériques initiaux C soient des sources porteuses d'opinions par opposition à des sources uniquement descriptives. Par exemple, les modes d'emplois de smartphones ne peuvent pas convenir car elles sont descriptives et ne contiennent pas d'opinions ou de jugements de valeurs. Par contre un forum, un blog ou encore un site contenant des avis de consommateurs, ou tout autre source réputée (ou éventuellement vérifiée superficiellement) contenir des opinions sur les smartphones peut alors convenir. Pour cela, ces documents numériques initiaux C font l'objet d'un traitement qui vise à filtrer chacun de ces documents numériques initiaux C en fonction de trois critères dits de « collecte » :
- bipolarité: Ces textes doivent avoir une probabilité « raisonnable » d'être connotés positivement ou négativement. Il n'est pas nécessaire de connaître le sens (positif ou négatif) de cette polarité. Peu importe que certains textes soient neutres mais ils ne doivent pas être majoritaires.
- taille : ces documents numériques initiaux C doivent être en nombre suffisant (10 au minimum) et de tailles proches c'est-à-dire comporter sensiblement le même nombre de termes. Dans certains cas on peut toutefois tolérer une certaine dispersion : par exemple, 10 % des documents numériques initiaux C pourront être de 2 à 3 fois la taille moyenne des documents numériques initiaux C constituant le résultat de la recherche. Le nombre de documents initiaux C doit être tel que chacun documents (A,B) agrégeant les documents C ait une taille de 100 à 150 ko.
- contextualité : une analyse sémantique, superficielle, de ces documents numériques initiaux C est réalisée afin de vérifier que les éléments constituant chacun des ces documents numériques initiaux C se rapporte à un vocabulaire proche du contexte souhaité. Par exemple l'évaluation des restaurants diffère de l'évaluation de matériel informatique. Cette contrainte de contextualité est naturellement satisfaite lorsque la source d'information initiale est réputée dédiée au contexte choisi. Par exemple, savoir qu'un site web est consacré au partage d'avis d'usagers de Smartphones suffit comme indice de contextualité. Le fait que certains documents dérogent à cette règle n'est pas un problème pourvu qu'ils ne soient pas majoritaires.
Chacun de ces trois critères peut être vérifié superficiellement pour l'ensemble de la source de documents et ce de manière non limitative par un système informatique ou encore un opérateur.
Dès lors seuls les documents numériques initiaux C respectant ces trois critères sont conservés.
[0041] Dans une des étapes mise en œuvre un certain nombre de documents numériques initiaux C collectés sont ensuite concaténés dans les deux documents numériques distincts ((Ai)ie[i ;N]) et ((Bi)ie[i ;N]). Ces documents numériques initiaux C gardent leur autonomie car malgré leur répartition et concaténation dans les deux documents numériques distincts ((Ai)ie[i ;N]) et ((Bi)ie[i ;N]) il est possible de les isoler individuellement. En effet, ces documents numériques initiaux C sont isolés par des séparateurs textuels dans les documents numériques distincts ((Ai)ie[i ;N]) et ((Bi)ie[i ;N]) dans lesquels ils sont concaténés. Mais cet isolement peut être réalisé de différentes manières.
Cette notion d'autonomie est importante car dans le cadre de la mise en œuvre des différents modes de réalisation de l'invention, il faut pouvoir : - compter le nombre documents numériques initiaux C qui doivent être en nombre identique dans les deux documents numériques distincts ((Ai)ie[i ;N]) et ((Bi)ie[1 ;N]), et
- noter chacun des documents numériques initiaux C en calculant l'indice I.
Dans le présent cas, un ordinateur est apte à mettre en œuvre les différents modes de réalisation de l'invention.
Ainsi, dans un premier temps, l'ensemble des documents numériques initiaux C sont concaténés aléatoirement à part égale en deux documents numériques distincts ((Ai)ie[i ;N]) et ((Bi)ie[i ;N]). Malgré cette concaténation les documents numériques initiaux restent séparables. Cette concaténation n'est aléatoire que dans une première itération. Aux itérations suivantes, la concaténation prendra en compte la valeur de l'indice I qui sera calculé sur chacun des documents initiaux de manière à les classer. Dans ce mode de réalisation dit non supervisé, les deux documents numériques distincts ((Ai)ie[i ;N]) et ((Bi)ie[i ;N]) ont une taille de l'ordre de 100 à 150 ko par fichier correspondant à chaque document. Cependant, on notera que statistiquement, les textes connotés négativement sont plus longs que ceux connotés positivement. Comme nous le verrons plus loin, nous mettons à profit ce fait connu de l'état de l'art pour distinguer automatiquement parmi les deux documents A et B, celui qui est connoté négativement.
Ces documents numériques distincts ((Ai)ie[i ;N]) et ((Bi)ie[i ;N]) font par la suite l'objet d'un traitement particulier lors d'une étape d'analyse fréquentielle afin d'identifier les termes de leur contenu et leur fréquence d'apparitions, soit leur indice de redondance 11 et 12. Cette étape permettant la détermination des indices de redondance 11 et 12 est similaire à celle mise en œuvre dans le mode de réalisation dit supervisé et qui aboutit à la constitution d'un dictionnaire différentiel
[0042] Par ailleurs, dans l'optique d'améliorer la qualité des documents numériques distincts ((Ai)ie[i ;N]) et ((Bi)ie[i ;N]) sur la base desquels est générés le dictionnaire différentiel ((Di)ie[i ;N]), il est procédé à une mesure d'indice I sur les documents numériques initiaux C qui ont contribués à l'obtention dudit dictionnaire différentiel ((Di)ie[i ;N]). L'objectif de cette mesure qui reflète le niveau de connotation (positif/négatif) est de pouvoir mieux classer ensemble les documents initiaux les plus positifs et les séparer des plus négatifs. En effet le document numérique distinct ((A,) ie[ ;N]) ou ((B,) ie[ ;N]) correspond chacun à une concaténation de documents numériques initiaux C connotés négativement ou positivement. Cependant, à ce stade nous ne savons pas lequel des deux documents (A B) est celui qui est connoté négativement. Le système informatique prend cette décision en se basant sur la taille des fichiers. Cecui qui est le plus long des deux sera celui qui est connoté négativement.
[0043] Dans notre exemple les documents numériques distincts ((A,) ie[ ;N]) et ((Bi) ie[i ;N]) qui ont été obtenus sont donc les documents numériques distincts A1 et B1 sur la base desquels le dictionnaire différentiel D1 a été généré.
[0044] A partir notamment de ce dictionnaire différentiel D1 , les valeurs d'indice I obtenues pour chacun de ces documents numériques initiaux C permettent de classer ces documents de sorte à obtenir des documents numériques distincts A2 et B2. A2 et B2 correspondant respectivement par exemple à de nouvelles catégories : positive et négative. A chacune de ces itérations on applique le principe précédent : classement à part égale des documents initiaux dans deux fichiers Ai, Bi, le plus long étant désigné comme celui connoté négativement.
[0045] Rappelons qu'une valeur de l'indice I, caractérisant le contenu d'un document numérique, inférieure à 0,5 est un indice de connotation négative et ce d'autant plus que cette valeur de I se rapproche de 0. Lors que cette valeur de I se rapproche de 1 , I est alors un indice de connotation positive.
[0046] Le dictionnaire D1 permet donc déjà en termes de probabilité de séparer les documents initiaux C connotée négativement de ceux connotés positivement. En effet, même si dans cette phase initiale, la répartition des documents initiaux C a été aléatoire, les termes positifs (resp négatifs) seront isolés et séparés par le processus de constitution du dictionnaire. Cette capacité de séparation va s'améliorer au fur et à mesure des étapes suivantes : générations des nouveaux dictionnaires (D2, D3, ..) à partir des reclassements successifs des documents initiaux C.
[0047] Par la suite selon les étapes de génération d'un dictionnaire différentiel ((D,) ie[1 ;N]) à partir de documents numériques distincts ((A,) ie[1 ;N]) et ((Bi) ie[i ;N]) ont obtient alors sur la base des documents numériques distincts A2 et B2 optimisés un dictionnaire différentiel D2.
[0048] Ces étapes visant à l'amélioration de la qualité des documents numériques distincts ((A,) ie[ ;N]) et ((B,) ie[ ;N]) sont alors réitérées selon un processus de cycles sur la base des nouveaux documents numériques distincts ((A,) ie[ ;N]) et ((B,) ie[ ;N]) et du dictionnaire différentiel ((D,) ie[ ;N]) obtenus jusqu'à ce que la différence de contenu entre deux dictionnaires différentiels successifs soit inférieure à un certain niveau k4.
[0049] On comprend qu'il s'agit ici d'évaluer la différence entre deux dictionnaires successifs. L'algorithme qui produit les dictionnaires converge et au fur et à mesure des itérations, il y a de moins en moins de différences entre deux dictionnaires successifs. Seuls les dictionnaires suffisamment différents sont utiles dans la phase qui suit. Cette différence k4 est exprimée en % de termes différents d'une étape sur l'autre. Dés qu'il y a moins de 5% de mots différents, le processus de création des dictionnaires est stoppé (dictionnaire considéré comme stable).
[0050]Ainsi, ce processus d'amélioration de la qualité des documents numériques distincts ((Ai)ie[i ;N]) et ((Bi)ie[i ;N]) s'arrête par exemple si k4=5, c'est-à-dire si moins de 5% des critères constituant un dictionnaire différentiel ((Dj) ie[i ;N]) ont changé par rapport au dictionnaire différentiel précédent. [0051] De manière générale, afin d'éviter une oscillation infinie de ce processus le nombre d'itérations est limité à 20 cycles.
[0052] Les différents dictionnaires différentiels ((Di) ie[ ;N]) obtenus durant ce processus d'amélioration sont alors combinés de sorte à générer un dictionnaire synthétique S. Cette étape de génération du dictionnaire synthétique S est réalisée selon les sous-étapes suivantes :
- pour chacun des termes contenus dans les N dictionnaires différentiels ((Di) ie[i ;N]), une somme SG du nombre d'apparitions de chaque terme dans ces N dictionnaires différentiels ((D,) ie[i ;N]) est réalisée ;
- pour chacun des termes contenus dans les N dictionnaires différentiels ((Di) ie[i ;N]), une somme SJ de la valeur de HK en valeur absolue de ce terme dans les N dictionnaires différentiels ((Di) ie[i ;N]) est réalisée. Le terme pour lequel cette somme SJ est la plus élevée est le terme de fréquence maximale FM possible. On remarquera que la fréquence HK dont il est question ici est une fréquence différentielle. La somme SJ est donc une somme de fréquences différentielles.
Ainsi, un terme donné est ajouté dans le dictionnaire synthétique S, s'il est contenu dans au moins un des N dictionnaires différentiel et si la valeur de la somme SG du nombre d'apparitions de chaque terme dans ces N dictionnaires différentiels ((Dj) ie[i ;N]), est supérieure à une limite K8 x N.
La valeur K8 =1/4=0,25 car dans cet exemple on ne prend en compte un terme que s'il est présent au moins dans le quart des dictionnaires différentiels de cet ensemble : indication de sa représentativité. Cette valeur peut être modifiée en fonction de la pertinence et de l'optimisation que l'on veut obtenir pour ce dictionnaire synthétique S.
De manière alternative, cette sous-étape de sélection peut être réalisée autrement en prenant en compte pour un terme donnée les conditions suivantes : la somme SG est supérieure au produit K8 par le nombre de dictionnaires différentiels compris dans cet ensemble ; la somme SJ est supérieure au produit K9 par le max fréquence possible est la fréquence cumulée la plus importante(FM). FM est la fréquence cumulée maximale constatée, c'est-à-dire celle du terme ayant la fréquence cumulée la plus importante.
La méthode de décision élaboré permet d'abord de collecter les mots les plus présents dans les N dictionnaires (ie cumul d'apparition) et on s'assure que ce sous-ensemble de termes connotés est aussi suffisamment présent dans le vocabulaire en général, c'est-à-dire en fréquence.
De manière générale les valeurs de K8 et K9 correspondent à 0,25 (soit 1/4). Cette valeur peut être modifiée en fonction de la pertinence et de l'optimisation que l'on veut obtenir pour ce dictionnaire synthétique S. [0053]Ainsi, ce procédé permet d'obtenir un dictionnaire différentiel ((D,) ie[i ;N]) et/ ou synthétique S par domaine d'application, dans lequel chaque critère qui la compose comporte un terme avec un indicateur de valence émotionnelle : par exemple le terme « bien» est connoté positivement, donc indicateur hk=+1 , le terme « mal » est connoté négativement, donc indicateur hk=-1 . Ce dictionnaire différentiel ((D,) ie[ ;N]) et/ ou synthétique S sera utilisé comme référence pour mesurer un document numérique M correspondant par exemple à un document textuel inconnu.
En appliquant, à ce document numérique M les critères du dictionnaire différentiel ((D,) ie[1 ;N]) et/ ou synthétique S on mesure alors un indice I représentatif de la connotation globale du document textuel inconnu.
On notera que l'indice I révélant par exemple la valence émotionnelle ne se limite pas à la simple bipolarité positif/négatif, d'autres sentiments comme : la peur, la confiance, peuvent aussi être mesurés.
[0054] Les dictionnaires différentiels ((Di) ie[1 ;N]) et/ ou synthétiques S obtenus sont archivés dans la base de données en fonction du domaine auquel ils se rapportent.
[0055]Ainsi qu'on l'aura compris, le présent mode de réalisation trouve une application particulière dans le cadre de la mesure de l'indice I d'un document numérique M révélant par exemple le sentiment qui peut émaner d'un tel document. Un tel outil de mesure d'indice I peut être mis en œuvre dans bon nombre de services sur Internet (e-réputation, mesure de satisfaction ou de l'expérience client, ...).
[0056] Cet outil peut se décliner dans une multitude de contexte différents - vente d'ordinateurs, vente de vêtements - et peut être soumis sans aucune difficulté aux variations linguistiques - changement de langue, évolutions des langues ou usages linguistiques des usagers : langage sms -.
[0057] La présente solution permet tout en gardant de bonnes performances de la mesure de cet indice I de :
- déterminer de manière optimale une mesure fine et précise de la pertinence d'un document numérique M ;
- accélérer la production de dictionnaires différentiels ((Di)ie[i ;N]) et/ ou synthétiques S adaptés à différent domaine ;
- limiter les traitements manuels qui peuvent être réalisés par des opérateurs, dès lors d'automatiser ce type de processus ; - limiter les compétences nécessaires - techniques, linguistiques - à la production des dictionnaires différentiels ((Di) ie[i ;N]) et/ ou synthétiques S ;
- ne pas requérir l'utilisation de dictionnaires formels (par exemple académique)

Claims

Revendications
1 . Procédé de mesure d'un indice (I) caractérisant le contenu d'un document numérique (M) comportant des éléments descriptifs à partir d'un dictionnaire différentiel ((D,) ie[ ;N]) comprenant deux ensembles Ui et U2 de critères, lesdits critères se rapportant à des éléments ayant un format similaire à celui des éléments descriptifs de (M) et étant chacun associé à un coefficient de pertinence (HK), ledit procédé comportant les étapes suivantes :
- application des critères desdits ensembles U1 et U2 aux éléments descriptifs du contenu dudit document numérique (M) de sorte à déterminer les nombres N1 et N2 d'éléments descriptifs dudit contenu correspondant aux critères desdits ensembles respectivement U1 et U2, et
- calcul de l'indice (I) compris dans un intervalle de valeurs [0,1 ] par l'exécution de l'opération : N1/(N1 + N2).
2. Procédé selon la revendication précédente, caractérisé en ce que ledit ensemble (U1 ) comporte des critères de même catégorie (((C,) ,e[i ;N])+HK) avec HK>0 et ledit ensemble (U2) comporte des critères de même catégorie (((Cj) je[i ;N]) + HK) avec HK<0.
3. Procédé selon l'une des revendications précédentes caractérisé en ce que ledit dictionnaire différentiel ((D,) ie[ ;N]) est généré à partir des étapes suivantes :
• comparaison entre deux documents numériques sources (S1 ,S2), comprenant chacun une liste d'éléments associés avec respectivement un indice et un indice l2 de redondance ;
• conception de critères.
4. Procédé selon la revendication précédente caractérisé en ce que ladite étape de comparaison comporte l'une des sous-étapes suivantes :
- identification d'un élément compris dans un seul des documents numériques sources (S1 ,S2), ou - identification d'un élément compris dans les deux documents numériques sources (S1 ,S2), et que son indice (h , I2) dans l'un de ces deux documents soit x fois supérieure à son indice (h, l2) dans l'autre de ces deux documents.
5. Procédé selon la revendication précédente caractérisé en ce que la génération du dictionnaire différentiel ((D,) ie[1 ;N]) comporte une étape de conception de critères par l'association à l'élément identifié lors de l'étape de comparaison d'un coefficient de pertinence HK correspondant à la différence potentiellement négative entre les indices 11 et 12.
6. Procédé selon l'une des revendications 4 ou 5, caractérisé en ce que les deux documents numériques sources (S1 ,S2) sont générés lors des étapes suivantes :
- concaténation de documents numériques initiaux (C) en deux documents numériques distincts ((A,) ie[1 ;N]) et ((B,) ie[1 ;N]), et
- classement des éléments contenus dans chacun de ces documents numériques distincts ((A,) ie[1 ;N]) et ((B,) ie[1 ;N]) en fonction de leurs indices de redondances ( . )-
7. Procédé selon la revendication précédente, caractérisé en ce que les documents numériques initiaux (C) sont extraits de base de données à partir de requêtes comportant des termes d'amorces dont les caractéristiques sémantiques sont opposables..
8. Procédé selon l'une des revendications précédentes 1 à 6, caractérisé en ce que les documents numériques initiaux (C) sont extraits de base de données sans l'utilisation de requêtes comportant des termes d'amorces mais en fonction des critères dits de collectes desdits documents numériques initiaux (C).
9. Procédé selon les revendications 6 à 8, caractérisé en ce que le dictionnaire ((Di) ie[1 ;N]) généré sur la base des documents numériques distincts ((A,) ie[i ;N]) et ((Bi) ie[i ;N]) est appliqué aux documents numériques initiaux C de sorte à les classer en fonction de leur indice (I) et à générer de nouveaux documents numériques distincts ((A,) ie[i ;N]) et ((Bj) ie[i ;N])-
10. Procédé selon la revendication précédente, caractérisé en ce qu'il comprend la génération d'un dictionnaire ((D,) ie[i ;N]) à partir des nouveaux documents numériques distincts ((A,) ie[i ;N]) et ((Bj) ie[i ;N])-
1 1 . Procédé selon la revendication précédente, caractérisé en ce qu'un dictionnaire synthétique (S) est réalisé à partir de plusieurs dictionnaires ((D,) ie[i ;N])-
PCT/FR2013/051713 2012-07-17 2013-07-16 Procede de mesure d'un indice caracterisant le contenu d'un document numerique Ceased WO2014013191A2 (fr)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
FR1256922A FR2993687A1 (fr) 2012-07-17 2012-07-17 Procede de mesure d'un indice caracterisant le contenu d'un document numerique
FR1256922 2012-07-17

Publications (2)

Publication Number Publication Date
WO2014013191A2 true WO2014013191A2 (fr) 2014-01-23
WO2014013191A3 WO2014013191A3 (fr) 2014-03-06

Family

ID=48170537

Family Applications (1)

Application Number Title Priority Date Filing Date
PCT/FR2013/051713 Ceased WO2014013191A2 (fr) 2012-07-17 2013-07-16 Procede de mesure d'un indice caracterisant le contenu d'un document numerique

Country Status (2)

Country Link
FR (1) FR2993687A1 (fr)
WO (1) WO2014013191A2 (fr)

Non-Patent Citations (4)

* Cited by examiner, † Cited by third party
Title
BO PANG ET AL: "Thumbs up?: sentiment classification using machine learning techniques", PROCEEDINGS OF THE CONFERENCE ON EMPIRICAL METHODS IN NATURAL LANGUAGE PROCESSING (EMNLP), PHILADELPHIA, JULY 2002, ASSOCIATION FOR COMPUTATIONAL LINGUISTICS, PHILADELPHIA, USA, vol. 10, 6 juillet 2002 (2002-07-06), pages 79-86, XP002627841, DOI: 10.3115/1118693.1118704 *
JUSTIN MARTINEAU ET AL: "Delta TFIDF: An Improved Feature Space for Sentiment Analysis", PROCEEDINGS OF THE THIRD INTERNATIONAL CONFERENCE ON WEBLOGS AND SOCIAL MEDIA, ICWSM 2009, 1 janvier 2009 (2009-01-01), pages 258-261, XP055069054, San Jose, CA, USA ISBN: 978-1-57-735421-5 *
STEFANO BACCIANELLA ET AL: "SENTIWORDNET 3.0: An Enhanced Lexical Resource for Sentiment Analysis and Opinion Mining", PROCEEDINGS OF THE INTERNATIONAL CONFERENCE ON LANGUAGE RESOURCES AND EVALUATION, LREC 2010, 1 janvier 2010 (2010-01-01), pages 2200-2004, XP055069046, La Valetta, Malta *
YUMING LIN ET AL: "An Information Theoretic Approach to Sentiment Polarity Classification", PROCEEDINGS OF THE 2ND JOINT WICOW/AIRWEB WORKSHOP ON WEB QUALITY, 1 janvier 2012 (2012-01-01), pages 35-40, XP055069051, New York, USA DOI: 10.1145/2184305.2184313 ISBN: 978-1-45-031237-0 *

Also Published As

Publication number Publication date
WO2014013191A3 (fr) 2014-03-06
FR2993687A1 (fr) 2014-01-24

Similar Documents

Publication Publication Date Title
KR102880628B1 (ko) 감성 분석에 의한 토픽 결정 방법 및 장치
US20130297582A1 (en) Peer sharing of personalized views of detected information based on relevancy to a particular user&#39;s personal interests
CN106557558A (zh) 一种数据分析方法及装置
US8825641B2 (en) Measuring duplication in search results
CN105447169B (zh) 文献归一方法、文献搜索方法及对应装置
US20160034581A1 (en) Detection and handling of aggregated online content using decision criteria to compare similar or identical content items
EP3782054A1 (fr) Procédé et dispositif de vérification de l&#39;auteur d&#39;un message court
Chen et al. ExpertSeer: a keyphrase based expert recommender for digital libraries
Fersellia et al. Sentiment analysis of shopee food application user satisfaction using the c4. 5 decision tree method
CN104951478A (zh) 信息处理方法和信息处理装置
Gaphari Investigating the impact of utilizing the K-nearest neighbor and Levenshtein distance algorithms for Arabic sentiment analysis on mobile applications
JP4879775B2 (ja) 辞書作成方法
EP2013776A1 (fr) Procede de de-doublonnage rapide d&#39;un ensemble de documents ou d&#39;un ensemble de donnees contenues dans un fichier
CN100458788C (zh) 一种互联网音频文件的聚类方法、搜索方法及系统
WO2014013191A2 (fr) Procede de mesure d&#39;un indice caracterisant le contenu d&#39;un document numerique
Dařena et al. Clients’ freely written assessment as the source of automatically mined opinions
US9342795B1 (en) Assisted learning for document classification
EP1727060A1 (fr) Procédé et dispositif de construction et d&#39;utilisation d&#39;une table de profils réduits de parangons, produit programme d&#39;ordinateur correspondant
Imran et al. Twitter Sentimental Analysis using Machine Learning Approaches for SemeVal Dataset
KR101549188B1 (ko) 브랜드 이미지 측정장치 및 측정방법
EP2812814A1 (fr) Procede d&#39;identification d&#39;un ensemble de phrases d&#39;un document numerique, procede de generation d&#39;un document numerique, dispositif associe
CN103559305B (zh) 文件搜寻系统及其方法
Erfina et al. Indonesian Analysis Sentiment on Non Fungible Token (NFT)
Satar et al. Sentiment Analysis of Hotel Reviews Using Word2Vec Embeddings, TF-IDF and Machine
CN112598427B (zh) 售后服务的方法、装置、电子设备及存储介质

Legal Events

Date Code Title Description
121 Ep: the epo has been informed by wipo that ep was designated in this application

Ref document number: 13744761

Country of ref document: EP

Kind code of ref document: A2

122 Ep: pct application non-entry in european phase

Ref document number: 13744761

Country of ref document: EP

Kind code of ref document: A2