EP4639397A1 - Procédé d'analyse non supervisée d'un ensemble de données textuelles lié à l'exécution de processus métiers - Google Patents
Procédé d'analyse non supervisée d'un ensemble de données textuelles lié à l'exécution de processus métiersInfo
- Publication number
- EP4639397A1 EP4639397A1 EP23828206.5A EP23828206A EP4639397A1 EP 4639397 A1 EP4639397 A1 EP 4639397A1 EP 23828206 A EP23828206 A EP 23828206A EP 4639397 A1 EP4639397 A1 EP 4639397A1
- Authority
- EP
- European Patent Office
- Prior art keywords
- verbatims
- words
- typical
- semantic
- semantic entities
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Pending
Links
Classifications
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F40/00—Handling natural language data
- G06F40/30—Semantic analysis
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F40/00—Handling natural language data
- G06F40/20—Natural language analysis
- G06F40/279—Recognition of textual entities
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F40/00—Handling natural language data
- G06F40/20—Natural language analysis
- G06F40/279—Recognition of textual entities
- G06F40/284—Lexical analysis, e.g. tokenisation or collocates
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F40/00—Handling natural language data
- G06F40/20—Natural language analysis
- G06F40/279—Recognition of textual entities
- G06F40/289—Phrasal analysis, e.g. finite state techniques or chunking
- G06F40/295—Named entity recognition
Definitions
- TITLE Process for unsupervised analysis of a set of textual data linked to the execution of business processes
- the invention lies in the field of automatic analysis of unstructured textual data. More particularly, the invention relates for example to the analysis of textual data from business application logs.
- a main disadvantage of approaches based on supervised learning is that they require a particularly significant human investment to build a labeled learning base large enough to allow obtaining reliable results. More precisely, each sample of such a training database must be annotated manually, which is extremely time-consuming.
- Another significant disadvantage of these solutions based on supervised learning lies in the fact that the classification carried out is carried out on the basis of predefined categories, that is to say previously identified and selected by a human operator. In other words, these solutions do not allow the automatic discovery of new categories (eg new feelings, new objects of a feeling, etc.) which would appear over time and which would not have been identified manually as soon as possible. the origin in the learning base used.
- the present technique makes it possible to propose a solution aimed at remedying certain disadvantages of the prior art.
- the present technique relates in effect to a method of analyzing a set of textual data, called a set of verbatims, each verbatim comprising an ordered sequence of words, this method comprising: a step of determining combinations of recurring words in said verbatims, and of identifying common motifs within said recurring word combinations; a step of identifying synonymy relationships between words of the same syntactic function within said common patterns, and of grouping said synonymous words of the same syntactic function within the same data structures, called semantic entities; a step of determining typical actions based on said semantic entities, a typical action being representative of similar contexts of operations identifiable in said verbatims.
- the present technique makes it possible to identify, from a set of verbatims, typical actions representative of various operation contexts detected in the verbatims.
- the present technique makes it possible to draw up, at a fine degree of granularity and in an unsupervised manner, an overview of the different contexts of operations identifiable in a set of verbatims.
- said grouping into semantic entities further comprises taking into account derivation relationships and/or spelling corrections between words of said common patterns.
- the present technique offers a certain flexibility when analyzing textual data, taking into account potential reformulations or spelling errors in the terms used in the verbatims.
- said semantic entities comprise semantic entities of the verb, noun, or adjective type
- a typical action comprises a semantic entity of the verb type and at least one semantic entity of the noun or adjective type.
- semantic entities are categorized, allowing a detailed analysis of the data identified in the verbatims, depending on whether they represent an object (semantic entity of noun type), an action (semantic entity of verb type), or a description ( semantic entity of adjective type).
- said method comprises the association of said typical actions with said verbatims, a typical action being associated to a verbatim when a combination of words present in said verbatim is associated with a common motif comprising at least one word associated with the verb type semantic entity of said type action and at least one word associated with said at least one semantic entity of type noun or adjective of said type action.
- said determination of typical actions comprises the identification of conditional relationships between said semantic entities, based on a probability of coexistence of words of said semantic entities within the same verbatims.
- said determination of typical actions comprises the construction of at least one graph according to said conditional relationships, and the use of said at least one graph to group said typical actions into sub-themes, and said sub-themes into themes.
- said method further comprises a step of segmenting said verbatims into textual segments, and determining a polarity associated with each of said textual segments.
- the present technique also makes it possible to associate different parts of the verbatims with categories of feelings expressed there by users, among for example a negative feeling (i.e. the expression of dissatisfaction), a neutral feeling (i.e. neither satisfied nor dissatisfied), or a positive feeling (i.e. the expression of satisfaction).
- a negative feeling i.e. the expression of dissatisfaction
- a neutral feeling i.e. neither satisfied nor dissatisfied
- a positive feeling i.e. the expression of satisfaction
- said method comprises a step of weighting said typical actions, a typical action being weighted in function of the polarities associated with the textual segments of the verbatims with which said typical action is associated.
- the present technique also relates to an electronic device for analyzing a set of textual data, called a set of verbatims, each verbatim comprising an ordered sequence of words, said device comprising: means for determining combinations recurring words in said verbatims, and identification of common patterns within said recurring word combinations; means for identifying synonymous relationships between words with the same syntactic function within said common patterns, and for grouping said synonymous words with the same syntactic function within the same data structures, called semantic entities; means for determining typical actions, as a function of conditional relationships identified between said semantic entities within said verbatims, a typical action being representative of similar contexts of operations identifiable in said verbatims.
- the means of said electronic device can be adapted to the implementation of any of the embodiments of the method of the present application.
- the proposed technique also relates to a computer program product downloadable from a communications network and/or stored on a computer readable medium and/or executable by a microprocessor, comprising program code instructions for executing an analysis method as described above, when executed on a computer.
- the proposed technique also relates to a computer-readable recording medium on which is recorded a computer program comprising program code instructions for the execution of the steps of the method as described above, in any of its embodiments.
- a recording medium can be any entity or device capable of storing the program.
- the support may comprise a storage means, such as a ROM, for example a CD ROM or a microelectronic circuit ROM, or even a magnetic recording means, for example a USB key or a hard disk.
- such a recording medium may be a transmissible medium such as an electrical or optical signal, which may be conveyed via an electrical or optical cable, by radio or by other means, so that the program computer it contains can be executed remotely.
- the program according to the invention can in particular be downloaded onto a network, for example the Internet network.
- FIG 1 illustrates the main steps of a textual data analysis process, in a particular embodiment of the proposed technique
- FIG 2 presents an example of an extract of a directed graph obtained as part of the analysis of a set of verbatims, in a particular embodiment of the proposed technique
- FIG 3 describes a simplified architecture of an electronic device for implementing the proposed technique, in a particular embodiment.
- the present application makes it possible to remedy some of the aforementioned drawbacks.
- a technique making it possible to analyze, in an automatic and unsupervised manner, a corpus of unstructured textual data, in order to extract relevant information, for example business knowledge.
- the present technique proves to be advantageous for facilitating the exploitation of data from logs generated at the level of business applications now widely deployed within companies (eg applications for customer relationship management, incident management, etc.).
- the business knowledge that this technique makes it possible to extract includes, for example, the identification of problems with the execution of certain business processes, the determination of feedback (or “feedback” in English) and/or the feelings of the actors involved in these business processes (eg reasons for satisfaction or dissatisfaction), or even the determination of the recurring nature of certain business activities.
- the proposed technique notably offers a better compromise than existing solutions, in that it allows data extraction at a relatively fine level of granularity while limiting the human investment (ie the number of non-automated manual operations) necessary for achieve this result.
- the proposed technique also makes it possible to automatically structure the extracted information, by organizing it into automatically identified sub-themes and themes.
- the present technique is not limited to raw data extraction, but it also aims to provide automatic structuring of relevant data according to different levels of granularity, i.e. at different levels of generalization, thus making their easier operation.
- the present technique relates to a process for analyzing a set - or corpus - of textual data. More particularly, in the context of the present technique, these textual data are designated under the generic term "verbatims", a verbatim corresponding to a set of words entered by a user within, for example, a business application, with regard to one or more given objects (for example a benefit, an incident, a service, etc.). A verbatim can thus be assimilated to a coherent set of words, carrying meaning and based on structures specific to a language, allowing for example a user to express a feeling (negative, neutral or positive), but also possibly the object and the reasons for this feeling.
- Such textual data are for example stored in the form of text files or within dedicated fields of one or more databases.
- step 12 a determination of recurring word combinations within the verbatims is implemented, then common patterns are identified within these word combinations. According to a particular characteristic, a common pattern groups together, for example, semantically equivalent word combinations among the determined word combinations.
- step 12 aims to discover combinations of words which are recurrent in all of the verbatims, and to group together the combinations of words which are used to express the same general idea, by associating them with the same common motive.
- step 12 makes it possible to demonstrate that all these expressions form various semantic representations of the same idea - in this case the resolution of a problem - by associating them with the same common motif.
- two concepts are identifiable in the previous example: a first concept linked to the action of finding a solution, characterized by the words “restore”, “resolve”, and “troubleshoot” , associated with the syntactic function “verb”; a second concept linked to the notion of difficulty, characterized by the words “problem” and “concern”, associated with the syntactic function “noun”.
- MC ⁇ ( ⁇ 'adjust', 'troubleshoot', 'resolve' ⁇ , 'verb'), ( ⁇ 'problem', 'concern' ⁇ , 'noun') ⁇ .
- step 12 is implemented via carrying out a succession of sub-steps comprising: the generation, for each verbatim of all the verbatims, of possible combinations of words, called candidate combinations , according to a predetermined distance threshold and a predetermined length threshold; calculating the number of occurrences of each candidate combination in all of the verbatims, and filtering the candidate combinations according to their number of occurrences, such filtering may for example consist of eliminating candidate combinations which do not appear sufficiently in all the verbatims (i.e.
- step 13 data structures, called semantic entities, are constructed on the basis of the common patterns identified in step 12.
- semantic entity we mean more particularly a data structure comprising a set of synonymous words with the same syntactic function.
- step 13 includes the identification, by means of a dictionary of synonyms, of synonymy relationships between words with the same syntactic function (verbs, nouns or adjectives) within common patterns, and the grouping of synonymous words of the same syntactic function per semantic entity.
- the semantic entities include: semantic entities of the "verb” type, also called action entities, grouping together the synonymous verbs identified in the set of common patterns; semantic entities of the “adjective” type, also called description entities, grouping together the synonymous adjectives identified in all the common patterns; semantic entities of the “name” type, also called nominal entities, grouping together synonymous nouns identified in all common patterns.
- the construction of semantic entities includes, in addition to taking into account synonymy relationships, taking into account derivation relationships and spelling correction relationships between the words present within the common patterns.
- step 13 taking into account derivation relations makes it possible to bring together derived words during the implementation of step 13. For example, if a common pattern includes the word "resolve”, the derived word “resolution” is also considered for the creation of semantic entities even if it has not been identified as such within the common patterns obtained at the end of step 12.
- step 12 of identifying common patterns made it possible to highlight, among others, the following concepts (or groups of words): ⁇ ' surely_question', 'question' , 'problem_difficulty', 'question_question', 'question_problem', 'concern', 'concern_problem', 'problem', 'question' ⁇ .
- step 13 makes it possible to construct a semantic entity of type “name” EN in which the following different nouns are grouped together, because they are identified as being synonymous: EN: 'difficulty_interrogation_problem_problem_concern_question_affair'
- step 12 of identifying common patterns made it possible to highlight, among others, the following concepts (or groups of words): ⁇ 'pleasant_friendly', 'sympathetic' , 'pleasant_friendly_sympathetic', 'kind', 'pleasant', 'friendly_sympathetic', 'friendly_friendly', 'amiable_avenant_cordial_gentH', 'benevolent_sympathetic' ⁇ .
- step 13 makes it possible to construct a semantic entity of “adjective” type ED in which the following different adjectives are grouped together, because they are identified as being synonymous:
- step 14 the semantic entities constructed in step 13 are used to determine typical actions representative of similar contexts of operations (or use) identifiable in the set EV of the verbatims analyzed.
- a typical action comprises a semantic entity of verb type and at least one semantic entity of noun or adjective type.
- the verb type semantic entity defines the type of operation associated with the action (e.g. an installation, a modification, a cancellation, etc.);
- the semantic entity of type name defines the object which undergoes the effect of the type of operation carried out (e.g. the fiber, an appointment, etc.);
- the adjective type semantic entity (or description entity) defines the manner in which the type of operation was carried out (e.g. late, incorrect, etc.).
- a first mode of grouping relates to the common patterns identified in step 12.
- the common motives which simultaneously include: at least one word (ie a concept) belonging to or having a derivative belonging to the semantic entity of the verb type of the type action considered; at least one other word (ie another concept) belonging to or having a derivative belonging to the semantic entity of the noun or adjective type of the type action considered.
- the common motives 'install fiber' and 'fiber installation' are associated with the same typical action, because the word 'installation' is one of the derivatives of the verb type semantic entity (i.e. of the action entity) including the verb 'install'; the common motives 'answer question' and 'answer problem' are associated with the same type action, because on the one hand the word 'response' is one of the derivatives of the semantic entity of the verb type (i.e. of the entity of action) including the verb 'respond', and on the other hand the words 'question' and 'problem' belong to the same semantic entity of noun type (i.e. to the same nominal entity).
- a second mode of grouping is operated, on the basis of conditional relationships between semantic entities, identified within the verbatims.
- these conditional relationships between semantic entities are identified as a function of a probability of coexistence of words of said semantic entities within the same verbatims.
- conditional relationships are for example considered: so-called global conditional relationships, characterizing the identification of dependency relationships between semantic entities of noun or adjective type within the same verbatims; so-called contextual conditional relationships, characterizing the identification of dependency relationships between semantic entities of noun or adjective type within the same verbatims, in the presence of a particular semantic entity of action.
- a conditional relationship between two semantic entities of noun or adjective type is considered confirmed when the probability of coexistence of words of said semantic entities within the same verbatims is greater than a certain predetermined threshold, for one or other of the two types of conditional relationships previously presented.
- new typical actions are determined, a typical action comprising on the one hand all the semantic entities of the noun or adjective type which are linked by global or contextual conditional relationships associated with the presence of the same semantic entity of verb type, and on the other hand the semantic entity of verb type in question.
- a common motive being associated with a given typical action when it includes: at least one word (ie a concept) belonging to or having a derivative belonging to the semantic entity of verb type of the type action considered; at least one other word (ie another concept) belonging to or having a derivative belonging to a semantic entity of noun or adjective type of the type action considered.
- the determination of typical actions comprises the construction of at least one graph according to the conditional relationships identified, and the use of this graph to group the typical actions into subthemes, and the subthemes in themes.
- This directed graph is, for example, constructed from previously identified global conditional relationships. More particularly, in this example given for purely illustrative purposes, each node of the graph corresponds to a semantic entity of name type, and each oriented link between two nodes corresponds to a global conditional relationship identified between the corresponding nodes. Each link is also associated with a weight, corresponding to the number of times the linked nodes have together formed contextual conditional relationships in the context of different verb-type semantic entities (ie action entities).
- the weight “2” is associated with the link between these two nominal semantic entities, representative of the fact that two distinct contexts of operation (or use) have been identified in the linked verbatims with these nominal semantic entities (ie a context in which these objects are mentioned as part of a installation operation, and another in which these objects are mentioned as part of a verification operation).
- a graph thus constructed is interesting in that it can be used to automatically determine possible groupings between semantic entities of the same type (and more particularly of noun or adjective type), at different levels of granularity.
- such a graph makes it possible for example to identify sub-themes, a sub-theme being representative of a set of semantic entities of noun or adjective type which coexist in the same verbatims (without necessarily be the object of the same action entities), or in other words, which share the same context of operation.
- a sub-theme groups together for example all the child nodes which descend from exactly the same parent nodes.
- an additional rule excluding from a sub-theme the child nodes associated with a link of zero weight is also applied (such a rule implemented in the context of the previous example then leading for example to the exclusion of the nominal semantic entity “welding” of the ST13 sub-theme, the weight of the link between the semantic entity “welding” and its parent the semantic entity “fiber” being zero).
- the subthemes thus identified are in turn grouped into themes, on the basis of a predetermined rule.
- a theme is for example defined by the union of subthemes sharing parent nodes in common.
- such a construction rule allows the automatic obtaining (i.e. without user intervention) of two themes: the theme Tl grouping together the sub-themes ST11, ST12 and ST13 which have as parent nodes the nominal semantic entities “.fibre” and/or “cable_ constitu_ligne”; the theme T2 including the sub-theme ST21 which has as its parent node the nominal semantic entity “device_telephone_tv_television”.
- the analysis method according to the present technique also comprises, for example in parallel to steps 12, 13 and 14, a step 11 comprising the segmentation of the verbatims into textual segments, and the determination of a polarity associated with each of said textual segments.
- polarity we mean here an attribute representative of a feeling and/or an emotional state associated with the textual segment considered. Such an attribute can for example qualify the expression within the textual segment considered of satisfaction or, on the contrary, dissatisfaction of a user, possibly to different degrees.
- the segmentation of a verbatim is carried out automatically (ie without manual intervention), for example on the basis of punctuation characters present in the verbatim (eg commas, semicolons, periods, etc.).
- the segmentation also takes into account predefined textual separators, including by example of key words classically used to introduce a notion of contradiction (eg the words “however”, “on the other hand”, “but”, “nevertheless”, “on the other hand”, etc.).
- each textual segment is thus associated with a polarity or category of feeling among, for example, the following categories: a negative feeling (i.e. the expression of dissatisfaction), a neutral feeling (i.e. neither satisfied, nor dissatisfied), a positive feeling (i.e. the expression of satisfaction).
- a negative feeling i.e. the expression of dissatisfaction
- a neutral feeling i.e. neither satisfied, nor dissatisfied
- a positive feeling i.e. the expression of satisfaction
- the determination of the polarities associated with the textual segments is based on the use of a BERT language model (from English “Bidirectional Encoder Representations from Transformers”) pretrained to carry out sentiment analysis operations.
- the typical actions obtained at the end of steps 12, 13 and 14 are weighted according to the polarities associated with the textual segments as identified in step 11.
- the proposed technique makes it possible to associate a textual segment with a typical action on the one hand and with a polarity on the other hand, it is possible to establish a link between polarities and typical actions, that is- that is to say between a user feeling and a reason (or cause) of this feeling.
- the proposed technique makes it possible more particularly to identify trends at a fine level of granularity, taking into account the number of textual segments within which a particular feeling is associated with a particular reason.
- the typical actions being also organized into automatically determined sub-themes and themes
- the present technique also makes it possible in one embodiment to establish a tree structure (for example in the form of a graph) of the typical actions by sub-themes and themes according to each type of polarity identified.
- Such a tree structure can in particular serve as a basis for the construction of a graphical interface allowing a user to explore, at different levels of granularity, feelings and reasons for feelings automatically extracted from a set of verbatims, thus greatly facilitating the exploitation. It can also be used to automatically generate various summary reports linked to business applications (particularly in the field of customer relationship management), such as satisfaction reports for example.
- the present technique also relates to an electronic device for analyzing a set of textual data, called a set of verbatims, this device being capable of implementing the method previously described in any of its embodiments.
- such an electronic device comprises: means for determining recurring word combinations in said verbatims, and for identifying common patterns within said recurring word combinations; means for identifying synonymous relationships between words with the same syntactic function within said common patterns, and for grouping said synonymous words with the same syntactic function within the same data structures, called semantic entities; means for determining typical actions, as a function of conditional relationships identified between said semantic entities within said verbatims, a typical action being representative of similar contexts of operations identifiable in said verbatims.
- Figure 3 represents, in a schematic and simplified manner, the structure of such an electronic device, in a particular embodiment.
- this electronic device takes for example the form of a processing server connected via a communications network to at least one remote data source within which verbatims are stored, or even of a server processing unit itself hosting one or more business applications capable of generating verbatim reports.
- the electronic device comprises for example a memory 31 consisting of a buffer memory M, a processing unit 32, equipped for example with a microprocessor pP, and controlled by the computer program Pg 33, implementing the analysis method according to the invention.
- the code instructions of the computer program 33 are loaded into the buffer memory before being executed by the processor of the processing unit 32.
- the processing unit 32 receives as input E a set of textual data, or set of verbatims, each verbatim comprising an ordered sequence of words.
- the microprocessor of the processing unit 32 then carries out the steps of the method previously described, according to the instructions of the computer program 33, to deliver at output S data comprising at least one set of typical actions representative of similar contexts of operations identifiable in said verbatims.
- the output S takes for example the form of a structured set of data in which the typical actions are grouped by sub-themes, and the sub-themes by themes, according to different types of polarities (or feelings , eg negative, neutral, or positive) associated identified in all of the verbatims.
Landscapes
- Engineering & Computer Science (AREA)
- Theoretical Computer Science (AREA)
- Health & Medical Sciences (AREA)
- Artificial Intelligence (AREA)
- Audiology, Speech & Language Pathology (AREA)
- Computational Linguistics (AREA)
- General Health & Medical Sciences (AREA)
- Physics & Mathematics (AREA)
- General Engineering & Computer Science (AREA)
- General Physics & Mathematics (AREA)
- Machine Translation (AREA)
Abstract
L'invention se rapporte à un procédé d'analyse d'un ensemble de données textuelles, dit ensemble (EV) de verbatims, chaque verbatim comprenant une suite ordonnée de mots. Un tel procédé comprend: - une étape (12) de détermination de combinaisons de mots récurrentes dans lesdits verbatims, et d'identification de motifs communs au sein desdites combinaisons de mots récurrentes; - une étape (13) d'identification de relations de synonymie entre des mots de même fonction syntaxique au sein desdits motifs communs, et de regroupement desdits mots synonymes de même fonction syntaxique au sein de mêmes structures de données, dites entités sémantiques; - une étape (14) de détermination d'actions types en fonction desdites entités sémantiques, une action type étant représentative de contextes similaires d'opérations identifiables dans lesdits verbatims.
Description
DESCRIPTION
TITRE : Procédé d'analyse non supervisée d'un ensemble de données textuelles lié à l'exécution de processus métiers
Domaine technique
L'invention se situe dans le domaine de l'analyse automatique de données textuelles non structurées. Plus particulièrement, l'invention se rapporte par exemple à l'analyse de données textuelles issues des journaux d'applications métiers.
Art antérieur
Dans de nombreux domaines, et plus particulièrement dans le contexte de la gestion des activités d'une entreprise, il est fréquent que des applications métiers soient utilisées pour collecter des données textuelles rédigées librement par un utilisateur dans un langage naturel, par exemple au sein d'une zone de saisie d'un formulaire mis à disposition via un outil informatique. À titre d'exemples de telles données textuelles, on peut notamment citer les verbatims de divers interlocuteurs (e.g. clients, salariés, etc.) collectés via des applications de gestion de la relation client, les commentaires issus de tickets de remontées d'incidents, les échanges tracés au sein d'un système de gestion de plaintes des clients, etc.
La nature non structurée de ces données les rend toutefois particulièrement difficiles à exploiter, à tout le moins de manière complètement automatique. Aussi, des opérations manuelles laborieuses et chronophages restent souvent nécessaires pour extraire de ces données textuelles des informations utiles, comme par exemple le ressenti d'un utilisateur (e.g. sa satisfaction ou son insatisfaction) ou encore l'objet et les raisons de ce ressenti.
Des techniques de fouille des données textuelles ont bien été développées pour faciliter ces opérations, mais ces solutions existantes, qui peuvent être réparties en deux grandes catégories - les solutions reposant sur une approche basée sur un apprentissage supervisé d'une part, et les solutions reposant sur une approche basée sur un apprentissage non supervisé d'autre part - présentent généralement plusieurs inconvénients, comme détaillé ci-après.
Un inconvénient principal des approches basées sur un apprentissage supervisé est qu'elles requièrent un investissement humain particulièrement conséquent pour construire une base d'apprentissage labellisée suffisamment volumineuse pour permettre l'obtention de
résultats fiables. Plus précisément, chaque échantillon d'une telle base d'apprentissage doit être annoté manuellement, ce qui est extrêmement coûteux en temps. Un autre inconvénient important de ces solutions basées sur un apprentissage supervisé réside dans le fait que la classification opérée est effectuée sur la base de catégories prédéfinies, c'est-à-dire préalablement identifiées et sélectionnées par un opérateur humain. En d'autres termes, ces solutions ne permettent pas la découverte automatique de nouvelles catégories (e.g. de nouveaux ressentis, de nouveaux objets d'un ressenti, etc.) qui apparaîtraient au cours du temps et qui n'auraient pas été identifiées manuellement dès l'origine dans la base d'apprentissage utilisée.
Les approches actuelles basées sur un apprentissage non supervisé ne surmontent qu'en partie certains des inconvénients précités. Elles nécessitent certes un investissement humain globalement moins important que celui requis pour la mise en oeuvre des solutions basées sur un apprentissage supervisé, mais cet investissement reste tout de même relativement conséquent, puisque la construction d'une base d'apprentissage volumineuse reste requise (même s'il n'est pas nécessaire dans ce cas de l'annoter manuellement).
Par ailleurs, quelle que soit l'approche considérée, on constate également que le niveau de granularité des résultats générés par les solutions existantes est souvent relativement grossier. Par exemple, nombre de ces solutions existantes se limitent à déterminer de manière automatique un ressenti ou un sentiment des utilisateurs, sans nécessairement fournir d'informations sur les raisons pouvant expliquer ce ressenti. Aussi, une intervention humaine importante reste souvent nécessaire même après la mise en oeuvre de ces solutions automatisées, afin de décomposer les résultats obtenus en des niveaux de granularité plus fins et permettre ainsi une exploitation plus intéressante et plus pertinente des données textuelles disponibles.
Il existe donc un besoin pour une solution permettant d'améliorer l'analyse des données textuelles non structurées collectées via des applications ou des processus métiers, notamment en permettant la mise en oeuvre d'une analyse automatisée plus fine de ces données.
Résumé de l'invention
La présente technique permet de proposer une solution visant à remédier à certains inconvénients de l'art antérieur. Selon un premier aspect, la présente technique se rapporte en
effet à un procédé d'analyse d'un ensemble de données textuelles, dit ensemble de verbatims, chaque verbatim comprenant une suite ordonnée de mots, ce procédé comprenant : une étape de détermination de combinaisons de mots récurrentes dans lesdits verbatims, et d'identification de motifs communs au sein desdites combinaisons de mots récurrentes ; une étape d'identification de relations de synonymie entre des mots de même fonction syntaxique au sein desdits motifs communs, et de regroupement desdits mots synonymes de même fonction syntaxique au sein de mêmes structures de données, dites entités sémantiques ; une étape de détermination d'actions types en fonction desdites entités sémantiques, une action type étant représentative de contextes similaires d'opérations identifiables dans lesdits verbatims.
De cette manière, la présente technique permet d'identifier, à partir d'un ensemble de verbatims, des actions types représentatives de divers contextes d'opération détectés dans les verbatims. Ainsi, la présente technique permet de dresser, à un degré de granularité fin et de manière non supervisée, un panorama des différents contextes d'opérations identifiables dans un ensemble de verbatims.
Dans un mode de réalisation particulier, ledit regroupement en entités sémantiques comprend en outre la prise en compte de relations de dérivation et/ou de corrections orthographiques entre des mots desdits motifs communs.
De cette manière, la présente technique offre une certaine flexibilité lors de l'analyse des données textuelles, en tenant compte de potentielles reformulations ou erreurs orthographiques dans les termes utilisés dans les verbatims.
Dans un mode de réalisation particulier, lesdites entités sémantiques comprennent des entités sémantiques de type verbe, nom, ou adjectif, et une action type comprend une entité sémantique de type verbe et au moins une entité sémantique de type nom ou adjectif.
De cette manière, les entités sémantiques sont catégorisées, permettant une analyse fine des données identifiées dans les verbatims, selon qu'elles représentent un objet (entité sémantique de type nom), une action (entité sémantique de type verbe), ou une description (entité sémantique de type adjectif).
Selon une caractéristique particulière de ce mode de réalisation, ledit procédé comprend l'association desdites actions types auxdits verbatims, une action type étant associée
à un verbatim lorsqu'une combinaison de mots présente dans ledit verbatim est associée à un motif commun comprenant au moins un mot associé à l'entité sémantique de type verbe de ladite action type et au moins un mot associé à ladite au moins une entité sémantique de type nom ou adjectif de ladite action type.
De cette manière, les actions types sont rattachées aux verbatims au sein desquels elles apparaissent.
Dans un mode de réalisation particulier, ladite détermination d'actions types comprend l'identification de relations conditionnelles entre lesdites entités sémantiques, en fonction d'une probabilité de coexistence de mots desdites entités sémantiques au sein de mêmes verbatims.
De cette manière, des actions types complémentaires sont identifiées sur la base de critères de dépendances identifiés dans certains verbatims
Selon une caractéristique particulière de ce mode de réalisation, ladite détermination d'actions types comprend la construction d'au moins un graphe en fonction desdites relations conditionnelles, et l'utilisation dudit au moins un graphe pour grouper lesdites actions types en sous-thématiques, et lesdites sous-thématiques en thématiques.
De cette manière, un classement automatique des actions type en sous-thématiques et thématiques est mis en oeuvre, permettant l'obtention d'un panorama des différents contextes d'opérations identifiables dans un ensemble de verbatims à différents degrés de granularité, comprenant au moins un degré de granularité fin (i.e. la catégorisation en actions type) et des degrés de granularité plus généraux (catégorisation en sous-thématiques et thématiques).
Dans un mode de réalisation particulier, ledit procédé comprend en outre une étape de segmentation desdits verbatims en segments textuels, et de détermination d'une polarité associée à chacun desdits segments textuels.
De cette manière, la présente technique permet également d'associer différentes parties des verbatims à des catégories de ressenti qui y sont exprimées par des utilisateurs, parmi par exemple un ressenti négatif (i.e. l'expression d'une insatisfaction), un ressenti neutre (i.e. ni satisfait, ni insatisfait), ou un ressenti positif (i.e. l'expression d'une satisfaction).
Selon une caractéristique particulière de ce mode de réalisation, ledit procédé comprend une étape de pondération desdites actions types, une action type étant pondérée en
fonction des polarités associées aux segments textuels des verbatims auxquels ladite action type est associée.
De cette manière, la présente technique permet non seulement d'établir un lien entre polarités et actions types, c'est-à-dire entre un ressenti d'utilisateur et une raison de ce ressenti, mais également de dégager des tendances en prenant compte le nombre de segments textuels au sein desquels un ressenti particulier est associé à une raison particulière.
Selon un autre aspect, la présente technique se rapporte également à un dispositif électronique d'analyse d'un ensemble de données textuelles, dit ensemble de verbatims, chaque verbatim comprenant une suite ordonnée de mots, ledit dispositif comprenant : des moyens de détermination de combinaisons de mots récurrentes dans lesdits verbatims, et d'identification de motifs communs au sein desdites combinaisons de mots récurrentes ; des moyens d'identification de relations de synonymie entre des mots de même fonction syntaxique au sein desdits motifs communs, et de regroupement desdits mots synonymes de même fonction syntaxique au sein de mêmes structures de données, dites entités sémantiques ; des moyens de détermination d'actions type, en fonction de relations conditionnelles identifiées entre lesdites entités sémantiques au sein desdits verbatims, une action type étant représentative de contextes similaires d'opérations identifiables dans lesdits verbatims.
Les moyens dudit dispositif électronique peuvent être adaptés à la mise en oeuvre l'un quelconque des modes de réalisation du procédé de la présente demande.
Selon un autre aspect, la technique proposée se rapporte également à un produit programme d'ordinateur téléchargeable depuis un réseau de communication et/ou stocké sur un support lisible par ordinateur et/ou exécutable par un microprocesseur, comprenant des instructions de code de programme pour l'exécution d'un procédé d'analyse tel que décrit précédemment, lorsqu'il est exécuté sur un ordinateur.
La technique proposée vise également un support d'enregistrement lisible par un ordinateur sur lequel est enregistré un programme d'ordinateur comprenant des instructions de code de programme pour l'exécution des étapes du procédé tel que décrit précédemment, dans l'un quelconque de ses modes de réalisation.
Un tel support d'enregistrement peut être n'importe quelle entité ou dispositif capable de stocker le programme. Par exemple, le support peut comporter un moyen de stockage, tel qu'une ROM, par exemple un CD ROM ou une ROM de circuit microélectronique, ou encore un moyen d'enregistrement magnétique, par exemple une clé USB ou un disque dur.
D'autre part, un tel support d'enregistrement peut être un support transmissible tel qu'un signal électrique ou optique, qui peut être acheminé via un câble électrique ou optique, par radio ou par d'autres moyens, de sorte que le programme d'ordinateur qu'il contient est exécutable à distance. Le programme selon l'invention peut être en particulier téléchargé sur un réseau, par exemple le réseau Internet.
Les différents modes de réalisation mentionnés ci-dessus sont combinables entre eux pour la mise en oeuvre de l'invention.
Figures
D'autres caractéristiques et avantages de l'invention apparaîtront plus clairement à la lecture de la description suivante d'un mode de réalisation préférentiel, donné à titre de simple exemple illustratif et non limitatif, et des dessins annexés, parmi lesquels :
[Fig 1] illustre les principales étapes d'un procédé d'analyse de données textuelles, dans un mode de réalisation particulier de la technique proposée ;
[Fig 2] présente un exemple d'un extrait de graphe orienté obtenu dans le cadre de l'analyse d'un ensemble de verbatims, dans un mode de réalisation particulier de la technique proposée ; [Fig 3] décrit une architecture simplifiée d'un dispositif électronique pour la mise en oeuvre de la technique proposée, dans un mode de réalisation particulier.
Description détaillée de l'invention
La présente demande permet de remédier à certains des inconvénients précités.
Plus particulièrement, il est proposé une technique permettant d'analyser, de manière automatique et non supervisée, un corpus de données textuelles non structurées, afin d'en extraire des informations pertinentes, par exemple des connaissances métiers. Bien que ce domaine d'utilisation soit donné à titre illustratif et non limitatif, la présente technique se révèle en effet avantageuse pour faciliter l'exploitation de données issues des journaux générés au niveau des applications métiers maintenant largement déployées au sein des entreprises (e.g.
applications de gestion de la relation client, de gestion des incidents, etc.). Les connaissances métiers que la présente technique permet d'extraire comprennent par exemple l'identification de problèmes d'exécution de certains processus métiers, la détermination des retours (ou «.feedback » en anglais) et/ou des ressentis des acteurs impliqués dans ces processus métiers (e.g. motifs de satisfaction ou d'insatisfaction), ou encore la détermination du caractère récurrent de certaines activités métiers. La technique proposée offre notamment un meilleur compromis que les solutions existantes, en ce qu'elle permet une extraction de données à un niveau de granularité relativement fin tout en limitant l'investissement humain (i.e. le nombre d'opérations manuelles non automatisées) nécessaire pour parvenir à ce résultat.
Comme détaillé par la suite, dans un mode de réalisation particulier, la technique proposée permet également de structurer de manière automatique les informations extraites, en les organisant en sous-thématiques et thématiques automatiquement identifiées. En d'autres termes, la présente technique ne se limite pas à de l'extraction brute de données, mais elle vise également à fournir une structuration automatique des données pertinentes selon différents niveaux de granularité, i.e. à différents niveaux de généralisation, rendant ainsi leur exploitation plus facile.
Selon un premier aspect, la présente technique se rapporte à un procédé d'analyse d'un ensemble - ou corpus - de données textuelles. Plus particulièrement, dans le cadre de la présente technique, ces données textuelles sont désignées sous le terme générique de « verbatims », un verbatim correspondant à un ensemble de mots saisis par un utilisateur au sein par exemple d'une application métier, eu égard à un ou plusieurs objets donnés (par exemple une prestation, un incident, un service, etc.). Un verbatim peut ainsi être assimilé à un ensemble cohérent de mots, porteur de sens et reposant sur des structures propres à une langue, permettant par exemple à un utilisateur d'exprimer un ressenti (négatif, neutre ou positif), mais également éventuellement l'objet et les raisons de ce ressenti. De telles données textuelles sont par exemple stockées sous forme de fichiers texte ou au sein de champs dédiés d'une ou plusieurs bases de données.
On présente maintenant, en relation avec la figure 1, le principe général d'un procédé d'analyse d'un ensemble de verbatims, dans un mode de réalisation particulier de la technique proposée. Un tel procédé est mis en oeuvre par un dispositif électronique ayant accès à au moins une source de données comprenant un ensemble EV de verbatims (VI, ..., Vn) à traiter.
Dans une étape 12, une détermination de combinaisons de mots récurrentes au sein des verbatims est mise en oeuvre, puis des motifs communs sont identifiés au sein de ces combinaisons de mots. Selon une caractéristique particulière, un motif commun regroupe par exemple les combinaisons de mots sémantiquement équivalentes parmi les combinaisons de mots déterminées. En d'autres termes, l'étape 12 vise à découvrir des combinaisons de mots qui sont récurrentes dans l'ensemble des verbatims, et à opérer des regroupements des combinaisons de mots qui sont utilisées pour exprimer une même idée générale, en les associant à un même motif commun.
En supposant par exemple qu'on identifie dans les verbatims une récurrence des combinaisons de mots suivantes « dépanner un problème », « régler mon souci », « résoudre ce problème », « régler le problème », « résoudre un souci », la mise en oeuvre de l'étape 12 permet de mettre en évidence que toutes ces expressions forment diverses représentations sémantiques d'une même idée - en l'espèce la résolution d'un problème - en les associant à un même motif commun.
Plus particulièrement, deux concepts (i.e. deux groupes de mots particuliers) sont identifiables dans l'exemple précédent : un premier concept lié à l'action de trouver une solution, caractérisé par les mots « rétablir », « résoudre », et « dépanner », associés à la fonction syntaxique « verbe » ; un deuxième concept lié à la notion de difficulté, caractérisé par les mots « problème », et « souci », associés à la fonction syntaxique « nom ».
Toutes les combinaisons précédentes peuvent ainsi être regroupées sous une même étiquette commune, i.e. un même motif commun MC regroupant un ensemble de concepts, définie par exemple par une structure de données pouvant prendre la forme non limitative suivante :
MC : {({'régler', 'dépanner', 'résoudre'}, 'verbe'), ({'problème', 'souci'}, 'nom')}.
Dans un mode de réalisation particulier, l'étape 12 est mise en oeuvre via la réalisation d'une succession de sous-étapes comprenant : la génération, pour chaque verbatim de l'ensemble des verbatims, de combinaisons possibles de mots, dite combinaisons candidates, en fonction d'un seuil de distance et d'un seuil de longueur prédéterminés ;
le calcul du nombre d'occurrences de chaque combinaison candidate dans l'ensemble des verbatims, et un filtrage des combinaisons candidates en fonction de leur nombre d'occurrences, un tel filtrage pouvant par exemple consister à éliminer les combinaisons candidates qui n'apparaissent pas suffisamment dans l'ensemble des verbatims (c'est-à-dire dont le nombre d'occurrences est inférieur à un seuil prédéterminé) ; la fusion des combinaisons candidates proches (sur la base, par exemple, d'opérations préalables de lemmatisation des mots des combinaisons candidates) ; la détermination de l'ensemble des mots synonymes de chaque mot des combinaisons candidates, au moyen d'un dictionnaire de synonyme (prenant par exemple la forme d'une base de données lexicales) accessible du dispositif électronique ; l'utilisation des mots synonymes déterminés pour identifier des motifs communs à des combinaisons candidates : plus particulièrement, deux combinaisons candidates sont considérées comme similaires et regroupées au sein d'un même groupe associé à un même motif commun lorsque ces deux combinaisons candidates ont un même nombre de mots ayant les mêmes fonctions syntaxiques, et lorsque que pour chaque mot ml de l'une des deux combinaisons candidates il existe un mot m2 dans l'autre des deux combinaisons candidates tel que les mots ml et m2 sont synonymes.
Ainsi, plusieurs groupes de combinaisons candidates, associés chacun à un motif commun, sont obtenus à l'issue de l'étape 12.
Dans une étape 13, des structures de données, appelées entités sémantiques, sont construites sur la base des motifs communs identifiés en étape 12. Par entité sémantique, on entend plus particulièrement une structure de données comprenant un ensemble de mots synonymes de même fonction syntaxique. Ainsi, l'étape 13 comprend l'identification, au moyen d'un dictionnaire de synonymes, de relations de synonymie entre des mots de même fonction syntaxique (verbes, noms ou adjectifs) au sein des motifs communs, et le regroupement des mots synonymes de même fonction syntaxique par entité sémantique.
Selon une caractéristique particulière, les entités sémantiques comprennent : des entités sémantiques de type « verbe », également dénommée entités d'action, regroupant les verbes synonymes identifiés dans l'ensemble des motifs communs ;
des entités sémantiques de type « adjectif », également dénommée entités de description, regroupant les adjectifs synonymes identifiés dans l'ensemble des motifs communs ; des entités sémantiques de type « nom », également dénommée entités nominales, regroupant les noms synonymes identifiés dans l'ensemble des motifs communs.
Dans un mode de réalisation particulier, la construction des entités sémantiques comprend, outre la prise en compte de relations de synonymie, la prise en compte de relations de dérivation et de relations de correction orthographique entre les mots présents au sein des motifs communs.
Plus particulièrement, la prise en compte de relations de dérivation permet de rapprocher des mots dérivés lors de la mise en oeuvre de l'étape 13. Par exemple, si un motif commun comprend le mot « résoudre », le mot dérivé « résolution » est également considéré pour la création des entités sémantiques même s'il n'a pas été identifié en tant que tel au sein des motifs communs obtenus à l'issue de l'étape 12.
De manière analogue, la prise en compte de relations de correction orthographique permet de rapprocher un mot incorrectement orthographié de son équivalent correctement orthographié lors de la mise en oeuvre de l'étape 13. Par exemple, des approximations orthographiques liées à l'oubli d'accent ou à la présence d'accents incorrect, ou à la substitution de certains caractères associés au même son (e.g. '/' et
'c' et 'q', 'x' et 'c', etc.), sont également considérées pour la création des entités sémantiques : ainsi les mots 'problème' et 'problème' sont par exemple considéré comme équivalents, et regroupés dans une même entité sémantique.
On présente ci-après, à titre purement illustratif, deux exemples d'entités sémantiques susceptibles d'être obtenue à l'étape 13.
Dans un premier exemple, on suppose par exemple que l'étape 12 d'identification de motifs communs a permis la mise en évidence, parmi d'autres, des concepts (ou groupes de mots) suivants : {'affaire_question', 'question', 'difficulté_problème', 'interrogation_question', 'problème_question', 'souci', 'probleme_souci', 'problème', 'interrogation'}. Sur la base des relations précédemment présentées (synonymie, dérivation, correction orthographique), l'étape 13 permet de construire une entité sémantique de type « nom » EN dans laquelle les différents noms suivants sont regroupés, car identifiés comme étant synonymes :
EN : 'difficulté_interrogation_problème_probleme_ souci_question_affaire'
Dans un deuxième exemple, on suppose par exemple que l'étape 12 d'identification de motifs communs a permis la mise en évidence, parmi d'autres, des concepts (ou groupes de mots) suivants : {'agréable_aimable', 'sympathique', 'agréable_aimable_sympathique', 'gentil', 'agréable', 'aimable_sympathique', 'avenant_sympathique', 'aimable_avenant_cordial_gentH', 'bienveillant_sympathique'}. Sur la base des relations précédemment présentées (synonymie, dérivation, correction orthographique), l'étape 13 permet de construire une entité sémantique de type « adjectif » ED dans laquelle les différents adjectifs suivants sont regroupés, car identifiés comme étant synonymes :
ED : 'agréable_ aimable_bienveillant_cordial_gentil_avenant_sympathique'
Ainsi, plusieurs entités sémantiques de différents types sont obtenues à l'issue de l'étape 13.
Dans une étape 14, les entités sémantiques construites à l'étape 13 sont utilisées pour déterminer des actions types représentatives de contextes similaires d'opérations (ou d'utilisation) identifiables dans l'ensemble EV des verbatims analysés.
Selon une caractéristique particulière, une action type comprend une entité sémantique de type verbe et au moins une entité sémantique de type nom ou adjectif.
Plus particulièrement : l'entité sémantique de type verbe (ou entité d'action) définit le type d'opération associé à l'action (e.g. une installation, une modification, une annulation, etc.) ; l'entité sémantique de type nom (ou entité nominale) définit l'objet qui subit l'effet du type d'opération réalisé (e.g. la fibre, un rendez-vous, etc.) ; l'entité sémantique de type adjectif (ou entité de description) définit la manière selon laquelle le type d'opération a été réalisé (e.g. tardive, incorrecte, etc.).
Plusieurs modes de regroupements peuvent être opérés pour déterminer des actions types.
En premier lieu, dans un mode de réalisation particulier, un premier mode de regroupement porte sur les motifs communs identifiés en étape 12.
Plus particulièrement, il s'agit ici d'associer à une action type donnée (i.e. de regrouper ensemble) les motifs communs qui comprennent simultanément :
au moins un mot (i.e. un concept) appartenant ou ayant un dérivé appartenant à l'entité sémantique de type verbe de l'action type considérée ; au moins un autre mot (i.e. un autre concept) appartenant ou ayant un dérivé appartenant à l'entité sémantique de type nom ou adjectif de l'action type considérée.
Ainsi, par exemple, selon ce premier mode de regroupement : les motifs communs 'installer fibre' et 'installation fibre' sont associés à une même action type, car le mot 'installation' fait partie des dérivés de l'entité sémantique de type verbe (i.e. de l'entité d'action) comprenant le verbe 'installer' ; les motifs communs ‘répondre interrogation' et ‘réponse problème' sont associés à une même action type, car d'une part le mot 'réponse' fait partie des dérivés de l'entité sémantique de type verbe (i.e. de l'entité d'action) comprenant le verbe 'répondre', et d'autre part les mots 'interrogation' et 'problème' appartiennent à la même entité sémantique de type nom (i.e. à la même entité nominale).
En deuxième lieu, dans un autre mode de réalisation particulier complémentaire ou alternatif au précédent, un deuxième mode de regroupement est opéré, sur la base de relations conditionnelles entre entités sémantiques, identifiées au sein des verbatims. Selon une caractéristique particulière, ces relations conditionnelles entre entités sémantiques sont identifiées en fonction d'une probabilité de coexistence de mots desdites entités sémantiques au sein de mêmes verbatims.
Dans ce cadre, deux types de relations conditionnelles sont par exemple considérés : des relations conditionnelles dites globales, caractérisant l'identification de relations de dépendances entre des entités sémantiques de type nom ou adjectif au sein de mêmes verbatims ; des relations conditionnelles dites contextuelles, caractérisant l'identification de relations de dépendances entre des entités sémantiques de type nom ou adjectif au sein de mêmes verbatims, en présence d'une entité sémantique d'action particulière.
Selon une caractéristique particulière, une relation conditionnelle entre deux entités sémantiques de type nom ou adjectif est considérée comme confirmée lorsque la probabilité de coexistence de mots desdites entités sémantiques au sein de mêmes verbatims est supérieure à un certain seuil prédéterminé, pour l'un ou l'autre des deux types de relations conditionnelles précédemment présentés.
Sur la base des relations conditionnelles identifiées, de nouvelles actions types sont déterminées, une action type comprenant d'une part l'ensemble des entités sémantiques de type noms ou adjectifs qui sont liées par des relations conditionnelles globales ou contextuelles associées à la présence d'une même entité sémantiques de type verbe, et d'autre part l'entité sémantique de type verbe en question. Une association de certains motifs communs à ces nouvelles actions types est également mise en oeuvre, un motif commun étant associé à une action type donnée lorsqu'il comprend : au moins un mot (i.e. un concept) appartenant ou ayant un dérivé appartenant à l'entité sémantique de type verbe de l'action type considérée ; au moins un autre mot (i.e. un autre concept) appartenant ou ayant un dérivé appartenant à une entité sémantique de type nom ou adjectif de l'action type considérée.
Dans un mode de réalisation particulier, la détermination des actions types comprend la construction d'au moins un graphe en fonction des relations conditionnelles identifié, et l'utilisation de ce graphe pour grouper les actions types en sous-thématiques, et les sous- thématiques en thématiques.
Un exemple d'un extrait d'un tel graphe est présenté en relation avec la figure 2, dans un mode de réalisation particulier de la technique proposée. Ce graphe orienté est par exemple construit à partir des relations conditionnelles globales préalablement identifiées. Plus particulièrement, dans cet exemple donné à titre purement illustratif, chaque nœud du graphe correspond à une entité sémantique de type nom, et chaque lien orienté entre deux nœuds correspond à une relation conditionnelle globale identifiée entre les nœuds correspondants. Chaque lien est par ailleurs associé à un poids, correspondant au nombre de fois où les nœuds liés ont formé ensemble des relations conditionnelles contextuelles dans le contexte d'entités sémantiques de type verbe (i.e. d'entités d'actions) différentes. Par exemple, si dans l'ensemble des verbatims analysés les entités sémantiques nominales « fibre » et « gaine » sont toujours associées ensemble en présence de l'un ou l'autre de l'une ou l'autre des entités d'action associées aux verbes « installer » et « vérifier », le poids « 2 » est associé au lien entre ces deux entités sémantiques nominales, représentatif du fait que deux contextes d'opération (ou d'utilisation) distinct ont été identifiés dans les verbatims en lien avec ces entités sémantiques nominales (i.e. un contexte dans lequel ces objets sont mentionnés dans le cadre d'une
opération d' installation, et un autre dans lequel ces objets sont mentionnés dans le cadre d'une opération de vérification).
Un graphe ainsi construit est intéressant en ce qu'il peut être utilisé pour déterminer de manière automatique des regroupements possibles entre entités sémantiques de même type (et plus particulièrement de type nom ou adjectif), à différents niveaux de granularité.
Ainsi, sur la base de règles prédéterminées, un tel graphe permet par exemple d'identifier des sous-thématiques, une sous-thématique étant représentative d'un ensemble d'entités sémantiques de type nom ou adjectif qui coexistent dans les mêmes verbatims (sans nécessairement être l'objet des mêmes entités d'action), ou autrement dit, qui partagent un même contexte d'opération.
Selon un exemple de construction, une sous-thématique regroupe par exemple l'ensemble des noeuds enfants qui descendent exactement des mêmes noeuds parents.
Par exemple, appliquée à l'extrait de graphe illustré sur la figure 2, une telle règle de construction permet l'obtention automatique (i.e. sans intervention d'un utilisateur) de quatre sous-thématiques : la sous-thématique ST11 comprenant les entités sémantiques nominales « électricien » et « trou » ayant pour nœud parent l'entité sémantique nominale « cable_câble_ligne » ; la sous-thématique ST12 comprenant les entités sémantiques nominales « goulotte », « gaine » et « adsl » ayant pour nœuds parents les entités sémantiques nominales « fibre » et « cable_câble_ligne » ; la sous-thématique ST13 comprenant les entités sémantiques nominales « soudure » et « garage » ayant pour nœud parent l'entité sémantique nominale «.fibre » ; la sous-thématique ST21 comprenant les entités sémantiques nominales « wifi », « portable », « ordinateur » et « décodeur » ayant pour nœud parent l'entité sémantique nominale « appareil_téléphone_tv_télévision ».
Éventuellement, une règle supplémentaire excluant d'une sous-thématique les nœuds enfants associés à un lien de poids nul est également appliquée (une telle règle mise en œuvre dans le cadre de l'exemple précédent conduisant alors par exemple à l'exclusion de l'entité sémantique nominale « soudure » de la sous-thématique ST13, le poids du lien entre l'entité sémantique « soudure » et son parent l'entité sémantique «fibre » étant nul).
Selon une caractéristique particulière, les sous-thématiques ainsi identifiées sont à leur tour regroupées en thématiques, sur la base d'une règle prédéterminée.
Selon un exemple de construction, une thématique est par exemple définie par l'union des sous-thématiques partageant des noeuds parents en commun.
Par exemple, appliquée à l'extrait de graphe illustré sur la figure 2, une telle règle de construction permet l'obtention automatique (i.e. sans intervention d'un utilisateur) de deux thématiques : la thématique Tl regroupant les sous-thématiques ST11, ST12 et ST13 qui ont pour noeuds parents les entités sémantiques nominales «.fibre » et/ou « cable_câble_ligne » ; la thématique T2 comprenant la sous-thématique ST21 qui a pour nœud parent l'entité sémantique nominale « appareil_téléphone_tv_télévision ».
Ainsi, la mise en œuvre des étapes 12, 13 et 14 permet l'identification, à partir d'un ensemble de verbatims, d'actions types représentatives de divers contextes d'opération détectés dans les verbatims, et leur classement automatique en sous-thématiques et thématiques. En d'autres termes, la présente technique permet de dresser selon une approche non supervisée un panorama des différents contextes d'opérations identifiables dans un ensemble de verbatims, à différents degrés de granularité, comprenant au moins un degré de granularité fin (i.e. la catégorisation en actions type) et des degrés de granularité plus généraux (catégorisation en sous-thématiques et thématiques).
Dans un mode de réalisation particulier, le procédé d'analyse selon la présente technique comprend également, par exemple de manière parallèle aux étapes 12, 13 et 14, une étape 11 comprenant la segmentation des verbatims en segments textuels, et la détermination d'une polarité associée à chacun desdits segments textuels. Par polarité, on entend ici un attribut représentatif d'un sentiment et/ou d'un état émotif associé au segment textuel considéré. Un tel attribut peut par exemple qualifier l'expression au sein du segment textuel considéré d'une satisfaction ou au contraire d'une insatisfaction d'un utilisateur, éventuellement à différents degrés.
La segmentation d'un verbatim est opérée de manière automatique (i.e. sans intervention manuelle), par exemple sur la base de caractères de ponctuation présents dans le verbatim (e.g. virgules, points-virgules, points, etc.). Selon une caractéristique particulière, la segmentation tient également compte de séparateurs textuels prédéfinis, comprenant par
exemple des mots-clés classiquement utilisés pour introduire une notion de contradiction (e.g. les mots « cependant », « par contre », « mais », « néanmoins », « en revanche », etc.).
A l'issue de l'étape 11, chaque segment textuel est ainsi associé à une polarité ou catégorie de ressenti parmi par exemple les catégories suivantes : un ressenti négatif (i.e. l'expression d'une insatisfaction), un ressenti neutre (i.e. ni satisfait, ni insatisfait), un ressenti positif (i.e. l'expression d'une satisfaction). Selon une caractéristique particulière, la détermination des polarités associées aux segments textuels repose sur l'utilisation d'un modèle de langage BERT (de l'anglais « Bidirectional Encoder Representations from Transformers ») préentraîné pour réaliser des opérations d'analyse de sentiments.
Dans un mode de réalisation particulier, dans une étape 15, les actions types obtenues à l'issue des étapes 12, 13 et 14 sont pondérées en fonction des polarités associées aux segments textuels telles qu'identifiées en étape 11. En d'autres termes, dans la mesure ou la technique proposée permet d'associer un segment textuel à une action type d'une part et à une polarité d'autre part, il est possible d'établir un lien entre polarités et actions types, c'est-à-dire entre un ressenti d'utilisateur et une raison (ou cause) de ce ressenti. La technique proposée permet plus particulièrement de dégager des tendances à un niveau de granularité fin, en prenant compte le nombre de segments textuels au sein desquels un ressenti particulier est associé à une raison particulière.
Selon une caractéristique particulière, les actions types étant par ailleurs organisées en sous-thématiques et thématique automatiquement déterminées, la présente technique permet également dans un mode de réalisation d'établir une arborescence (par exemple sous la forme d'un graphe) des actions types par sous-thématiques et thématiques selon chaque type de polarité identifié.
Une telle arborescence peut notamment servir de fondement à la construction d'une interface graphique permettant à un utilisateur d'explorer à différents niveaux de granularité, des ressentis et raisons des ressentis automatiquement extraits d'un ensemble de verbatims, en facilitant ainsi grandement l'exploitation. Elle peut également être utilisée pour générer de manière automatique divers rapports de synthèse en lien avec des applications métiers (notamment dans le domaine de la gestion de la relation clients), tels que des rapports de satisfaction par exemple.
Selon un autre aspect, la présente technique se rapporte également à un dispositif électronique d'analyse d'un ensemble de données textuelles, dit ensemble de verbatims, ce dispositif étant apte à mettre en oeuvre le procédé précédemment décrit dans l'un quelconque de ses modes de réalisation. Plus particulièrement, un tel dispositif électronique comprend : des moyens de détermination de combinaisons de mots récurrentes dans lesdits verbatims, et d'identification de motifs communs au sein desdites combinaisons de mots récurrentes ; des moyens d'identification de relations de synonymie entre des mots de même fonction syntaxique au sein desdits motifs communs, et de regroupement desdits mots synonymes de même fonction syntaxique au sein de mêmes structures de données, dites entités sémantiques ; des moyens de détermination d'actions type, en fonction de relations conditionnelles identifiées entre lesdites entités sémantiques au sein desdits verbatims, une action type étant représentative de contextes similaires d'opérations identifiables dans lesdits verbatims.
La figure 3 représente, de manière schématique et simplifiée, la structure d'un tel dispositif électronique, dans un mode de réalisation particulier. Dans un mode de réalisation particulier, ce dispositif électronique prend par exemple la forme d'un serveur de traitement connecté via un réseau de communication à au moins une source de données distante au sein de laquelle sont stockés des verbatims, ou encore d'un serveur de traitement hébergeant lui- même une ou plusieurs applications métiers susceptibles de générer des verbatims.
Le dispositif électronique selon la technique proposée comprend par exemple une mémoire 31 constituée d'une mémoire tampon M, une unité de traitement 32, équipée par exemple d'un microprocesseur pP, et pilotée par le programme d'ordinateur Pg 33, mettant en oeuvre le procédé d'analyse selon l'invention.
À l'initialisation, les instructions de code du programme d'ordinateur 33 sont chargées dans la mémoire tampon avant d'être exécutées par le processeur de l'unité de traitement 32. L'unité de traitement 32 reçoit en entrée E un ensemble de données textuelles, ou ensemble de verbatims, chaque verbatim comprenant une suite ordonnée de mots.
Le microprocesseur de l'unité de traitement 32 réalise alors les étapes du procédé précédemment décrit, selon les instructions du programme d'ordinateur 33, pour délivrer en sortie S des données comprenant au moins un ensemble d'actions types représentatives de
contextes similaires d'opérations identifiables dans lesdits verbatims. Dans un mode de réalisation particulier, la sortie S prend par exemple la forme d'un ensemble structuré de données dans lequel les actions types sont regroupées par sous-thématiques, et les sous- thématiques par thématiques, selon différents types de polarités (ou ressenti, e.g. négatif, neutre, ou positif) associés identifiés dans l'ensemble des verbatims.
Claims
1. Procédé d'analyse d'un ensemble de données textuelles, dit ensemble (EV) de verbatims, chaque verbatim comprenant une suite ordonnée de mots, ledit procédé étant mis en oeuvre par un dispositif électronique, ledit procédé étant caractérisé en ce qu'il comprend : une étape (11) de segmentation desdits verbatims en segments textuels, et de détermination d'une polarité associée à chacun desdits segments textuels ; une étape (12) de détermination de combinaisons de mots récurrentes dans lesdits verbatims, et d'identification de motifs communs au sein desdites combinaisons de mots récurrentes ; une étape (13) d'identification de relations de synonymie entre des mots de même fonction syntaxique au sein desdits motifs communs, et de regroupement desdits mots synonymes de même fonction syntaxique au sein de mêmes structures de données, dites entités sémantiques ; une étape (14) de détermination d'actions types en fonction desdites entités sémantiques, une action type étant représentative de contextes similaires d'opérations identifiables dans lesdits verbatims ; une étape (15) de pondération desdites actions types, une action type étant pondérée en fonction des polarités associées aux segments textuels des verbatims auxquels ladite action type est associée.
2. Procédé d'analyse selon la revendication 1 caractérisé en ce que ledit regroupement en entités sémantiques comprend en outre la prise en compte de relations de dérivation et/ou de corrections orthographiques entre des mots desdits motifs communs.
3. Procédé selon la revendication 1, caractérisé en ce que lesdites entités sémantiques comprennent des entités sémantiques de type verbe, nom, ou adjectif, et en ce qu'une action type comprend une entité sémantique de type verbe et au moins une entité sémantique de type nom ou adjectif.
4. Procédé d'analyse selon la revendication 3, caractérisé en ce qu'il comprend l'association desdites actions types auxdits verbatims, une action type étant associée à un verbatim lorsqu'une combinaison de mots présente dans ledit verbatim est associée à un motif commun comprenant au moins un mot associé à l'entité sémantique de type verbe de ladite action type et au moins un mot associé à ladite au moins une entité sémantique de type nom ou adjectif de ladite action type.
5. Procédé d'analyse selon la revendication 1 caractérisé en ce que ladite détermination d'actions types comprend l'identification de relations conditionnelles entre lesdites entités sémantiques, en fonction d'une probabilité de coexistence de mots desdites entités sémantiques au sein de mêmes verbatims.
6. Procédé d'analyse selon la revendication 5 caractérisé en ce que ladite détermination d'actions types comprend la construction d'au moins un graphe en fonction desdites relations conditionnelles, et l'utilisation dudit au moins un graphe pour grouper lesdites actions types en sous-thématiques, et lesdites sous-thématiques en thématiques.
7. Dispositif électronique d'analyse d'un ensemble de données textuelles, dit ensemble de verbatims, chaque verbatim comprenant une suite ordonnée de mots, ledit dispositif étant caractérisé en ce qu'il comprend : des moyens de segmentation desdits verbatims en segments textuels, et de détermination d'une polarité associée à chacun desdits segments textuels ; des moyens de détermination de combinaisons de mots récurrentes dans lesdits verbatims, et d'identification de motifs communs au sein desdites combinaisons de mots récurrentes ; des moyens d'identification de relations de synonymie entre des mots de même fonction syntaxique au sein desdits motifs communs, et de regroupement desdits mots synonymes de même fonction syntaxique au sein de mêmes structures de données, dites entités sémantiques ;
des moyens de détermination d'actions type, en fonction de relations conditionnelles identifiées entre lesdites entités sémantiques au sein desdits verbatims, une action type étant représentative de contextes similaires d'opérations identifiables dans lesdits verbatims ; des moyens de pondération desdites actions types, une action type étant pondérée en fonction des polarités associées aux segments textuels des verbatims auxquels ladite action type est associée.
8. Produit programme d'ordinateur téléchargeable depuis un réseau de communication et/ou stocké sur un support lisible par ordinateur et/ou exécutable par un microprocesseur, caractérisé en ce qu'il comprend des instructions de code de programme pour l'exécution d'un procédé d'analyse d'un ensemble de données textuelles selon l'une quelconque des revendications 1 à 6, lorsqu'il est exécuté par un ordinateur.
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| FR2213866A FR3143792A1 (fr) | 2022-12-19 | 2022-12-19 | Procédé d’analyse non supervisée d’un ensemble de données textuelles lié à l’exécution de processus métiers |
| PCT/EP2023/086308 WO2024133050A1 (fr) | 2022-12-19 | 2023-12-18 | Procédé d'analyse non supervisée d'un ensemble de données textuelles lié à l'exécution de processus métiers |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| EP4639397A1 true EP4639397A1 (fr) | 2025-10-29 |
Family
ID=85462390
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| EP23828206.5A Pending EP4639397A1 (fr) | 2022-12-19 | 2023-12-18 | Procédé d'analyse non supervisée d'un ensemble de données textuelles lié à l'exécution de processus métiers |
Country Status (3)
| Country | Link |
|---|---|
| EP (1) | EP4639397A1 (fr) |
| FR (1) | FR3143792A1 (fr) |
| WO (1) | WO2024133050A1 (fr) |
Family Cites Families (1)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US9535902B1 (en) * | 2013-06-28 | 2017-01-03 | Digital Reasoning Systems, Inc. | Systems and methods for entity resolution using attributes from structured and unstructured data |
-
2022
- 2022-12-19 FR FR2213866A patent/FR3143792A1/fr active Pending
-
2023
- 2023-12-18 WO PCT/EP2023/086308 patent/WO2024133050A1/fr not_active Ceased
- 2023-12-18 EP EP23828206.5A patent/EP4639397A1/fr active Pending
Also Published As
| Publication number | Publication date |
|---|---|
| FR3143792A1 (fr) | 2024-06-21 |
| WO2024133050A1 (fr) | 2024-06-27 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| US11734329B2 (en) | System and method for text categorization and sentiment analysis | |
| US8862460B2 (en) | System, method, and program for processing text using object coreference technology | |
| Tizard et al. | Can a conversation paint a picture? mining requirements in software forums | |
| US10430469B2 (en) | Enhanced document input parsing | |
| US10430405B2 (en) | Apply corrections to an ingested corpus | |
| EP1836651B1 (fr) | Procédé de recherche, reconnaissance et localisation d'un terme dans l'encre, dispositif, programme d'ordinateur correspondants | |
| EP1364316A2 (fr) | Dispositif d'extraction d'informations d'un texte a base de connaissances | |
| FR2896603A1 (fr) | Procede et dispositif pour extraire des informations et les transformer en donnees qualitatives d'un document textuel | |
| US10592236B2 (en) | Documentation for version history | |
| US10558691B2 (en) | Sentiment normalization based on current authors personality insight data points | |
| Karakus et al. | Call center performance evaluation using big data analytics | |
| US12135736B2 (en) | Automated systems and methods for generating technical questions from technical documents | |
| CA3131157A1 (fr) | Systeme et procede pour categorisation de texte et analyse de sentiments | |
| US11416539B2 (en) | Media selection based on content topic and sentiment | |
| Foucault et al. | Automatic classification of tweets for analyzing communication behavior of museums | |
| EP4639397A1 (fr) | Procédé d'analyse non supervisée d'un ensemble de données textuelles lié à l'exécution de processus métiers | |
| Narr et al. | Extracting semantic annotations from twitter | |
| Putra et al. | Zero-shot anomaly detection in a forensic timeline | |
| US20230186190A1 (en) | Ticket embedding based on multi-dimensional it data | |
| FR3135802A1 (fr) | Procédé de génération supervisée d’un graphe sémantique virtuel de connaissances spécialisées | |
| FR3060800A1 (fr) | Procede et dispositif d'indexation automatique d'un document textuel | |
| WO2018015515A1 (fr) | Procedes de partage d'opinion, equipements et programmes d'ordinateur pour la mise en oeuvre des procedes | |
| Mahin et al. | Real-time Twitter Trending Topics Detection and Sentiment Analysis Using Data Mining Technique | |
| Althuniyan et al. | Toward Insightful Evaluation of Speech-To-Text Technology Using Explainable AI | |
| WO2022129760A2 (fr) | Procede de collecte de donnees, procede d'exploitation de donnees collectees, dispositif electronique et produits programme d'ordinateur et support correspondants |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: UNKNOWN |
|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: THE INTERNATIONAL PUBLICATION HAS BEEN MADE |
|
| PUAI | Public reference made under article 153(3) epc to a published international application that has entered the european phase |
Free format text: ORIGINAL CODE: 0009012 |
|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: REQUEST FOR EXAMINATION WAS MADE |
|
| 17P | Request for examination filed |
Effective date: 20250611 |
|
| AK | Designated contracting states |
Kind code of ref document: A1 Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC ME MK MT NL NO PL PT RO RS SE SI SK SM TR |
|
| DAV | Request for validation of the european patent (deleted) | ||
| DAX | Request for extension of the european patent (deleted) |