WO2006013233A1 - Procede et dispositif de traitement automatique d’un langage - Google Patents

Procede et dispositif de traitement automatique d’un langage Download PDF

Info

Publication number
WO2006013233A1
WO2006013233A1 PCT/FR2004/001692 FR2004001692W WO2006013233A1 WO 2006013233 A1 WO2006013233 A1 WO 2006013233A1 FR 2004001692 W FR2004001692 W FR 2004001692W WO 2006013233 A1 WO2006013233 A1 WO 2006013233A1
Authority
WO
WIPO (PCT)
Prior art keywords
syntactic
node
nodes
concepts
text
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Ceased
Application number
PCT/FR2004/001692
Other languages
English (en)
Inventor
Johannes Heinecke
Alain Cozannet
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Orange SA
Original Assignee
France Telecom SA
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by France Telecom SA filed Critical France Telecom SA
Priority to PCT/FR2004/001692 priority Critical patent/WO2006013233A1/fr
Publication of WO2006013233A1 publication Critical patent/WO2006013233A1/fr
Anticipated expiration legal-status Critical
Ceased legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F40/00Handling natural language data
    • G06F40/20Natural language analysis
    • G06F40/253Grammatical analysis; Style critique

Definitions

  • the invention relates to the parsing of a language within the framework of the TALN (Automatic Processing of Natural Language).
  • TALN Automatic Processing of Natural Language
  • the automatic processing of a language is conventionally used to allow a computer to understand texts or requests formulated by users either in a written way, or vocally, in order to launch different services.
  • the automatic processing of written or vocal textual information conventionally uses a deep syntactic analysis followed by a generation of a semantic representation of the content of the text. Such a representation can then be the basis of an automatic translation into another language, the elaboration of a summary or an automatic classification of the text, etc.
  • lexicons multiply lexical entries, according to more or less relevant criteria of meaning in order to take into account as many possible meanings as possible.
  • the object of the invention is to provide a method and a device for analyzing a language making it possible to attribute to an utterance the meaning or meanings that it conveys, in the context in which it is located.
  • the invention proposes, according to a first aspect, a method of automatically processing a language by parsing a written text or utterance and semantic analysis of said text to deduce the meaning.
  • simultaneous parsing and semantic analysis are carried out simultaneously.
  • ontological rules are thus used during the linguistic analysis of a text in order to verify or to falsify a syntactic relation immediately after its creation, that is to say after the application of morpho-syntactic rules.
  • the meanings of linguistic structures that contradict an ontological model can then be deleted.
  • a syntactic tree is created consisting of a set of nodes each formed of a word or a phrase and each associated with a syntactic category and a dependency function connecting two nodes of said tree.
  • the text is semantically analyzed to validate the elaboration of a branch of the tree between two nodes linked by a syntactic function.
  • an ontology is used which defines the concepts associated with each node and the roles linking these concepts, and one validates a branch of the syntax tree linking two nodes when a role allows a link between the concepts associated with the nodes.
  • an ontological representation of the text is developed by associating with each node of each pair of nodes linked by a
  • a syntactic function is a set of variables comprising a concept translating the meaning of the node and an ontological formula linking said nodes, so as to elaborate the set of ontological formulas or representations linking the nodes of the text.
  • automatic language processing comprises the steps of: associating, at each node, at least one concept translating the meaning of the node by interrogating a first database;
  • the concept of the main node is replaced by the combination of the concepts of the linked nodes.
  • the subject of the invention is also a device for automatically processing a language for implementing a method as defined above, comprising a processing module associated with a first database in which an ontology is stored.
  • this device further comprises a morphological analyzer associated with a third database in which a lexicon is stored.
  • FIG. 1 is a block diagram of a device for automatically processing a language according to the invention
  • Figures 2 to 5 illustrate the development of a formula or ontological relationship between nodes
  • FIG. 6 is a flowchart illustrating the main phases of the method according to the invention.
  • Fig. 7 is a diagram illustrating an example of an ontology.
  • FIGS. 8 to 11 are diagrams illustrating an example of elaboration of an ontological representation of a text.
  • FIG. 1 shows a block diagram of a device for automatic processing of a language according to the invention, designated by the general reference numeral 10.
  • automatic processing of a language is meant, in the context of the present description, the syntactic and semantic analysis of a sentence or a text.
  • This device 10 is intended to develop, from a text to be analyzed, written or stated, a syntax tree using ontological knowledge.
  • the device 10 essentially comprises a morphological analyzer 12 receiving, as input, a TX text to be analyzed and a processing module 14 ensuring the actual analysis of the nodes, that is to say the words or phrases of the text TX to elaborate the syntax tree.
  • the morphological analyzer 12 is associated with a database in which a lexicon is stored in order to carry out a preliminary analysis of the TX text in order to perform a lexical search, a search of the forms of the nodes, and an identification of the fixed af
  • the processing module 14 is, in turn, connected to a first ON database in which are stored concepts and ontological relations which define the ontology, and to a second database RS in which are stored syntax rules for associating each node with a syntactic category and a syntactic dependency function between two nodes.
  • the processing implemented by the processing module is constituted by a conventional type of analysis, within the reach of a person skilled in the art. It will not be described in detail later.
  • each node is associated with a quintuple Q formed by a set of attributes I 1 , C, I 2 , R, and F, such that each five quintuple Q is represented by the formula:
  • I 2 is another identifier associated with the concept C in the attributes F and R, if they are indicated; - R designates a role, ie a link or notion of access to the concept C of the head node; and
  • - F is an ontological formula linked to the node.
  • a concept defines the meaning attached to a node. For example, as described later with reference to an exemplary implementation of the invention, a "go" node may be attached to the concept
  • a role defines access to a leading node.
  • an "airplane" dependent node may be linked to a “flying" head node by the "transport means” role.
  • the roles between the nodes are deduced from the ontology. For example, if a node A is a category of prepositions and B a nominal group, the role is either named from the lexical information on the preposition deduced from the parsing, or developed from the concept related to the dependent node.
  • Figures 2 to 5 illustrate different scenarios.
  • the continuous lines correspond to known elements, the discontinuous traits corresponding to elements or notions to discover.
  • the nodes and the roles linking these nodes are constituted only by continuous lines, it is a question of validating a hypothesis.
  • ontology modeling in the ON database is performed in such a way as to satisfy these conditions of use.
  • This modeling deals in particular with the definition of roles in order to specify whether they form a specific entity, constrained by domains and co-domains and also to specify whether to create a new instance of a role when this role is specified within a concept.
  • the knowledge associated with words whose meaning is associated with roles which is the case of prepositions, can be written as a list of pairs of pairs "name of the role-co-domain" or possibly be determinable. If multiple couples are allowed, both the role name and the subdomain must be written in the ontological object, which adds an interpretive rule to the object. Indeed, if the concept and role are determined, then the concept must be interpreted as the co-domain of the determined role.
  • the ontological analysis implemented by the processing module 14 during the parsing consists in particular of finding a role from two end nodes, under the constraint expressed by the introduced syntactic link, or to check the compatibility concepts of head and dependent nodes and a corresponding role with the ontological rules.
  • This method begins with a first step 16 during which the morphological analyzer 12 proceeds to a reading of the database LX and during which the processing module 14 reads the databases RS and ON.
  • the morphological analyzer 12 proceeds to the morphological analysis of the TX text. It is essentially to carry out a lexical search, to identify the forms, affixes, ...
  • the processing module 14 proceeds to attach one or more concepts C or R roles every word in the sentence.
  • the RS syntax rules are applied to the sentence to establish a syntactic relationship between two words or nodes.
  • step 24 If there is no other concept combination (step 24), and no concept combination is validated, the syntactic relationship is rejected (step 26). The procedure then returns to the previous phase. On the contrary, if there are other concept combinations, we consider a concept or the partial ontological formula of the main node and the secondary node (step 28). In the next step 30, it is checked whether the syntactic relation is validated by the ontology provided by using the concepts C of the words or ontological representations R already constructed of the nodes.
  • step 32 it is determined whether the main node still has a simple concept or role. If this is the case, we replace this concept by the combination of the concept of the main node with the concept, the role or the partial ontological formula of the dependent node (step 34). In the opposite case, that is to say if the main node is already associated with a partial ontological formula, we add the concept or partial ontological formula of the dependent node to the partial ontological formula of the main node (step 36).
  • step 38 it is checked whether there are other non validated syntactic relationships so as to continue processing with other syntactic-ontological rules. If there is no other rule that applies, then the sentence can not be further analyzed. The representation of the sentence is then delivered (step 40).
  • the morphological analyzer 12 has previously provided the following information:
  • the TX text is processed by the processing module 14.
  • the RS database provides a set of syntactical rules while the ON database provides the concepts, roles, and ontological relationships of the concepts for each node.
  • FIG. 7 An example of ontology usable for the treatment of the sentence in French "I would like to go from Paris to Madrid tomorrow".
  • the ontology represented in this figure has been extremely simplified, for the sake of clarity.
  • dotted relationships between two C concepts indicate that concepts are missing between two represented concepts.
  • a dependent concept can be related to a head concept when this dependent concept specifies a generic notion associated with the head concept. They can also be linked by a role R.
  • this concept of head can be related to the concepts “travel by car”, “journey by train”, “fly”, to the extent that these concepts constitute precisions of the concept generic "displacement”.
  • the concepts "place of arrival” and “place of departure” can be related to the concept of "displacement” by the roles “arrive from” and “share from”, respectively.
  • the ontological representation is generated, the syntactic relationships that can not be validated by the ontology being immediately deleted. For example, while parsing would allow associating a person behind the preposition "de” to indicate possession, a syntactic branch thus created would be immediately deleted as no corresponding path exists in the ontology that provides for that the concept of "displacement” can only be associated with "place of departure” or "place of arrival” concepts by roles R “arrives from” and "part of” respectively.
  • the syntactic analysis defines that the syntactic relation "subject” links the node “I” (secondary node) and the node “would” (head node).
  • the concepts C associated with these nodes are respectively “speaker” and "will”.
  • the ontological validation is positive (step 22), that is to say that one can combine the two concepts to associate with the node “would want” a partial ontological formula which contains the ontological formulas "will (w)", " speaker (s) "and an additional role f (w, s) indicating who is the subject of the verb" want ".
  • Figure 11 shows the result of the entire process.
  • the role “belongs” is not validated because the concept “go” and its more generic concepts do not have such a role in RS ontology.
  • the syntactic relation between the modal verb "would” and the adverb "tomorrow” is also suppressed because the ontology has no role linking the concept "will” and the concept “tomorrow” or more generic concepts than “tomorrow”. ".

Landscapes

  • Engineering & Computer Science (AREA)
  • Theoretical Computer Science (AREA)
  • Health & Medical Sciences (AREA)
  • Artificial Intelligence (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Computational Linguistics (AREA)
  • General Health & Medical Sciences (AREA)
  • Physics & Mathematics (AREA)
  • General Engineering & Computer Science (AREA)
  • General Physics & Mathematics (AREA)
  • Machine Translation (AREA)

Abstract

Pour procéder au traitement automatique d'un langage, on procède à une analyse syntaxique d'un texte écrit ou énoncé et à une analyse sémantique du texte pour en déduire le sens. L'analyse syntaxique et sémantique sont effectuées simultanément.

Description

Procédé et dispositif de traitement automatique d'un langage
L'invention concerne l' analyse syntaxique d'un langage dans le cadre du TALN (Traitement Automatique de Langue Naturelle). Le traitement automatique d'un langage est classiquement utilisé pour permettre à un ordinateur de comprendre des textes ou des requêtes formulées par des utilisateurs soit de manière écrite, soit vocalement, afin de lancer différents services.
Une telle analyse, qui permet la compréhension d'une information textuelle ou vocale sont généralement nécessaires afin d' abréger des documents longs sans perdre des informations importantes, de reformuler ou paraphraser un texte, de traduire automatiquement un texte ou de chercher des réponses adéquates à une question précise, comme c' est par exemple le cas dans les moteurs de recherche.
Le traitement automatique d'une information textuelle écrite ou vocale utilise classiquement une analyse syntaxique profonde suivie d'une génération d'une représentation sémantique du contenu du texte. Une telle représentation peut être alors la base d' une traduction automatique dans une autre langue, de l' élaboration d'un résumé ou d'une classification automatique du texte, ...
Dans l' état de la technique, au cours de l' analyse syntaxique du texte, aucune information sémantique n' est accessible autre que des informations de sémantique lexicale liées au sens des mots du texte. En effet, les outils de traduction automatique, autres que ceux qui sont basés sur l'utilisation de théories statistiques, sont basés sur une analyse syntaxique pour en déduire la structure syntaxique du texte, suivie d' une analyse sémantique ou ontologique afin de déterminer la structure sémantique du texte. Il est alors procédé à l' élaboration d'une représentation pivot indépendante de la langue source et de la langue cible. A partir de cette représentation, il est procédé à l' élaboration d'une représentation sémantique en tenant compte de la langue cible, puis d' une structure syntaxique afin de générer les formes lexicales nécessaires du texte traduit.
Les informations de la sémantique lexicale ne suffisent jamais à éviter la génération d' arbres syntaxiques sémantiquement incorrects. En effet, la présence d'homonymes dans un texte analysé engendre l'élaboration d' arbres syntaxiques en un nombre correspondant au nombre de significations de chaque terme, alors qu' un seul de ces arbres correspond à la signification exacte du texte. Ainsi, l'utilisation d'un lexique de très grande capacité ou le souhait de couvrir un domaine très large ou ambigu risque d' engendrer un très grand nombre de résultats incohérents.
Ainsi, les techniques de traitement automatique de langage selon lesquelles on procède à une analyse syntaxique suivie par une construction sémantique afin de générer une représentation ontologiquement correcte du contenu d'un texte présentent un certain nombre d' inconvénients.
Tout d' abord, la recherche d'une exhaustivité conduit à conserver des possibilités de faible représentativité. L'utilisation de méthodes de pondération ou de lexiques spécialisés permet de réduire cet inconvénient, mais sans s' attaquer à leurs causes.
Par ailleurs, les lexiques démultiplient les entrées lexicales, en fonction de critères de signification plus ou moins pertinents afin de prendre en compte le plus de significations possibles.
Au vu de ce qui précède, le but de l'invention est de fournir un procédé et un dispositif d' analyse d'un langage permettant d' attribuer à un énoncé le ou les sens qu'il véhicule, dans le contexte dans lequel il se situe.
Dans ce but, l' invention propose, selon un premier aspect, un procédé de traitement automatique d'un langage par analyse syntaxique d'un texte écrit ou énoncé et analyse sémantique dudit texte pour en déduire le sens. Selon l'invention, on procède simultanément à l' analyse syntaxique et à l' analyse sémantique.
L' analyse syntaxique et l' analyse sémantique simultanées permettent de valider une analyse syntaxique incohérente, c'est-à-dire asémantique ou en conflit avec des règles ontologiques de base. Ces règles ontologiques sont ainsi utilisées au cours de l' analyse linguistique d' un texte afin de vérifier ou de falsifier une relation syntaxique immédiatement après sa création, c' est-à-dire après l' application de règles morpho-syntaxiques. Les sens de structures linguistiques qui contredisent un modèle ontologique peuvent alors être supprimées.
Grâce à l' élimination des relations syntaxiques qui n' ont pu être vérifiées ontologiquement, il est possible de baisser les ambiguïtés très tôt au cours d'un traitement de texte. Cette diminution des données va en conséquence fortement augmenter la vitesse du traitement des textes.
Selon une autre caractéristique du procédé selon l' invention, au cours de l' analyse syntaxique, on élabore un arbre syntaxique constitué d'un ensemble de nœuds formé chacun d'un mot ou d'une locution et associés chacun à une catégorie syntaxique et à une fonction syntaxique de dépendance reliant deux nœuds dudit arbre. En outre, au cours de l' élaboration de l' arbre syntaxique, on procède à l' analyse sémantique du texte pour valider l' élaboration d' une branche de l' arbre entre deux nœuds liés par une fonction syntaxique. Selon une autre caractéristique du procédé, au cours de l' analyse sémantique, on utilise une ontologie qui définit les concepts associés à chaque nœud et des rôles liant ces concepts, et l'on valide une branche de l' arbre syntaxique liant deux nœuds lorsqu'un rôle autorise une liaison entre les concepts associés aux nœuds. Dans un mode de mise en œuvre, au cours de l' analyse sémantique, on élabore une représentation ontologique du texte en associant à chaque nœud de chaque paire de nœuds liés par une fonction syntaxique un ensemble de variables comprenant un concept traduisant la signification du nœud et une formule ontologique liant lesdits nœuds, de manière à élaborer l' ensemble des formules ou représentations ontologiques liant les nœuds du texte. On peut en outre combiner les formules ontologiques entre les nœuds liés par une fonction syntaxique de manière à élaborer une formule ontologique globale pour le texte.
Dans un mode de mise en œuvre particulier, le traitement automatique du langage comprend les étapes consistant à : - associer, à chaque nœud, au moins un concept traduisant le sens du nœud par interrogation d'une première base de données ;
- interroger une deuxième base de données dans laquelle sont stockées des règles syntaxiques pour établir une relation syntaxique liant un nœud principal et un nœud secondaire ; et
- tenter de combiner les concepts du nœud principal et du nœud secondaire, la relation syntaxique étant validée si l'étape au cours de laquelle on tente de combiner les concepts a abouti.
De préférence, après validation de la relation syntaxique, on remplace le concept du nœud principal par la combinaison des concepts des nœuds liés.
De même, après validation de la relation syntaxique, on peut rajouter le concept du nœud secondaire à une formule ontologique du nœud principal.
Selon encore une autre caractéristique du procédé selon l' invention, on prévoit en outre une étape d' analyse morphologique de chaque nœud du texte pour en déterminer sa forme en consultant une troisième base de données dans laquelle est stocké un lexique des nœuds. L' invention a également pour objet un dispositif de traitement automatique d'un langage pour la mise en œuvre d'un procédé tel que défini ci-dessus, comprenant un module de traitement associé à une première base de données dans laquelle est stockée une ontologie qui définit des concepts associés à chaque nœud et des rôles liant ces concepts et une deuxième base de données (RS) dans laquelle sont stockées des règles syntaxiques, le module de traitement comprenant des moyens pour élaborer un arbre syntaxique comprenant un ensemble de branches liants deux nœuds formés chacun d' un mot ou d'une locution et associés chacun à une catégorie syntaxique et à une fonction syntaxique de dépendance reliant les deux nœuds de la branche qui sont extraites de la deuxième base de données, chaque branche de l' arbre étant validée lorsqu'un rôle autorise une liaison entre les concepts associés aux nœuds. Selon une autre caractéristique de l'invention, ce dispositif comporte en outre un analyseur morphologique associé à une troisième base de données dans laquelle est stocké un lexique.
D' autres buts, caractéristiques et avantages de l'invention apparaîtront à la lecture de la description suivante, donnée uniquement à titre d'exemple non limitatif, et faite en référence aux dessins annexés sur lesquels :
- la figure 1 est un schéma synoptique d'un dispositif de traitement automatique d'un langage conforme à l'invention ; - les figures 2 à 5 illustrent l'élaboration d'une formule ou relation ontologique entre des nœuds ;
- la figure 6 est un organigramme illustrant les principales phases du procédé selon l'invention ; la figure 7 est un schéma illustrant un exemple d'une ontologie ; et
- les figures 8 à 11 sont des schémas illustrant un exemple d'élaboration d'une représentation ontologique d'un texte. Sur la figure 1, on a représenté un schéma synoptique d'un dispositif de traitement automatique d' un langage conforme à l'invention, désigné par la référence numérique générale 10. Par traitement automatique d'un langage, on entend, dans le cadre de la présente description, l' analyse syntaxique et sémantique d'une phrase ou d'un texte.
Ce dispositif 10 est destiné à élaborer, à partir d'un texte à analyser, écrit ou énoncé, un arbre syntaxique utilisant des connaissances ontologiques. Comme on le voit sur cette figure, le dispositif 10 comporte essentiellement un analyseur morphologique 12 recevant, en entrée, un texte TX à analyser et un module de traitement 14 assurant l' analyse proprement dite des nœuds, c' est-à-dire des mots ou locutions du texte TX afin d'élaborer l' arbre syntaxique. L' analyseur morphologique 12 est associé à une base de données dans laquelle est stocké un lexique pour procéder à une analyse préalable du texte TX afin de réaliser à une recherche lexicale, à une recherche des formes des nœuds, à une identification des af fixes,... Le module de traitement 14 est, quant à lui, raccordé à une première base de données ON dans laquelle sont stockées concepts et des relations ontologiques qui définissent l' ontologie, et à une deuxième base de données RS dans laquelle sont stockées des règles syntaxiques permettant d' associer à chaque nœud une catégorie syntaxique et une fonction syntaxique de dépendance entre deux nœuds.
En ce qui concerne l' analyse syntaxique du texte, le traitement mis en œuvre par le module de traitement est constitué par une analyse de type classique, à la portée d' un homme du métier. Elle ne sera donc pas décrite en détail par la suite.
On notera cependant qu'elle consiste à interroger la base de données RS afin d' établir une relation syntaxique entre les nœuds du texte, deux à deux, les règles ontologiques étant alors appliquées pour valider chaque branche d'une structure arborescente ainsi créée.
Il s' agit alors de valider une hypothèse H consistant en une dépendance syntaxique entre deux nœuds constituée par une fonction syntaxique orientée liant un nœud de tête et un nœud dépendant.
Pour ce faire, à chaque nœud est associé un quintuple Q formé par un ensemble d' attributs I1, C, I2, R, et F, tel que chaque quintuple Q soit représenté par la formule :
Q(I1, C, I2, R, F) Dans laquelle :
- I1 désigne un identifiant du quintuple ;
C est un concept lié au nœud de tête ;
I2 est un autre identifiant associé au concept C dans les attributs F et R, s'ils sont renseignés ; - R désigne un rôle, c' est-à-dire un lien ou une notion d' accès au concept C du nœud de tête ; et
- F est une formule ontologique liée au nœud.
Un concept définit le sens attaché à un nœud. Par exemple, comme décrit par la suite en référence à un exemple de mise en œuvre de l'invention, à un nœud « aller » peut être attaché le concept
« déplacement » ou « déplacement en avion », en fonction du pas du traitement mis en œuvre.
Un rôle définit l' accès à un nœud de tête. Ainsi, par exemple un nœud dépendant « avion » peut être lié à un nœud de tête « voler » par le rôle « moyen de transport ».
Les rôles entre les nœuds sont déduits de l' ontologie. Par exemple, si un nœud A est une catégorie de prépositions et B un groupe nominal, le rôle est soit nommé à partir des informations lexicales sur la préposition déduite de l' analyse syntaxique, soit élaboré à partir du concept lié au nœud dépendant.
Les figures 2 à 5 illustrent différents cas de figure. Sur ces figures, les traits continus correspondent à des éléments connus, les traits discontinus correspondant à des élément ou notions à découvrir. Lorsque les nœuds et les rôles liant ces nœuds ne sont constitués que par des traits continus, il s' agit de valider une hypothèse.
Sur les figures 2 à 5, les cercles symbolisent des concepts ou des formules ontologiques, les flèches représentant un rôle ayant le concept comme cible. Ces quatre cas de figure résument la communication avec les moyens d' élaboration de l' arbre syntaxique. Il convient de noter que, dans certains cas, l'orientation du rôle n' est pas connue. Par exemple, sur la figure 2, il convient de chercher à relier deux concepts C par un rôle R à découvrir. En référence à la figure 3, il peut également s' agir de relier deux concepts par un rôle connu et donc de valider une hypothèse. Il peut encore s' agir d' attribuer un rôle R à un concept connu (figure 4) ou, comme visible sur la figure 5, de chercher pour deux ensembles rôle-concept connus, un concept acceptant ces rôles et des co-domaines ou cibles (« range » en langue anglaise) compatibles avec les concepts.
On notera que la modélisation de l' ontologie dans la base ON est réalisée de manière à satisfaire ces conditions d'usage. Cette modélisation porte en particulier sur la définition des rôles afin de spécifier notamment s'ils forment une entité spécifique, contrainte par domaines et co-domaines et également afin de spécifier si l' on doit créer une nouvelle instance d'un rôle lorsque ce rôle est spécifié au sein d'un concept. Du point de vue lexical, la connaissance associée à des mots dont le sens est associé à des rôles, ce qui est le cas des prépositions, peut s' écrire comme une liste de couples de paires « nom du rôle-co- domaine » ou éventuellement être déterminable. Si plusieurs couples sont permis, il faut pouvoir inscrire à la fois le nom du rôle et le sous- domaine dans l' objet ontologique, ce qui ajoute une règle d'interprétation sur l' objet. En effet, si le concept et le rôle sont déterminés, alors le concept doit être interprété comme le co-domaine du rôle déterminé.
L' analyse ontologique mise en œuvre par le module de traitement 14 lors de l' analyse syntaxique consiste notamment soit à retrouver un rôle à partir de deux nœuds d' extrémités, sous la contrainte exprimée par le lien syntaxique introduit, soit à vérifier la compatibilité des concepts de nœuds de tête et dépendant et d'un rôle correspondant avec les règles ontologiques.
On va maintenant décrire en référence à la figure 6, un exemple de mise en œuvre d'un procédé selon l'invention.
Ce procédé débute par une première étape 16 au cours de laquelle l' analyseur morphologique 12 procède à une lecture de la base de données LX et au cours de laquelle le module de traitement 14 lit les bases de données RS et ON. Lors de l'étape 18 suivante, l' analyseur morphologique 12 procède à l' analyse morphologique du texte TX. Il s' agit essentiellement d' effectuer une recherche lexicale, d' identifier les formes, les affixes, ... Au cours de cette étape 18, le module de traitement 14 procède au rattachement d'un ou de plusieurs concepts C ou rôles R à chaque mot de la phrase.
Lors de l' étape 20 suivante, les règles syntaxiques RS sont appliquées à la phrase afin d' établir une relation syntaxique entre deux mots ou nœuds.
Pour chaque relation syntaxique établie entre un nœud principal et un nœud secondaire, on essaye de valider la relation syntaxique en combinant chaque concept du nœud principal et chaque concept du nœud secondaire ou, pour un pas ultérieur, une formule ou représentation ontologique partielle (étape 22).
S'il n'existe pas d' autre combinaison de concept (étape 24), et si aucune combinaison de concept n' est validée, on rejette la relation syntaxique (étape 26) . La procédure retourne alors à la phase 20 précédente. Au contraire, s'il existe d' autres combinaisons de concept, on considère un concept ou la formule ontologique partielle du nœud principal et du nœud secondaire (étape 28). Lors de l'étape 30 suivante, on vérifie si la relation syntaxique est validée par l' ontologie fournie en utilisant les concepts C des mots ou des représentations ontologiques R déjà construites des nœuds.
Après validation, lors de l'étape 32 suivante, on détermine si le nœud principal a toujours un concept ou un rôle simple. Si tel est le cas, on remplace ce concept par la combinaison du concept du nœud principal avec le concept, le rôle ou la formule ontologique partielle du nœud dépendant (étape 34). Dans le cas contraire, c'est-à-dire si le nœud principal est déjà associé à une formule ontologique partielle, on rajoute le concept ou la formule ontologique partielle du nœud dépendant à la formule ontologique partielle du nœud principal (étape 36) .
Lors de l'étape 38 suivante, on vérifie s'il y a d' autres relation syntaxiques non validées de manière à continuer le traitement avec d' autres règles syntaxico-ontologiques. S'il n'y a pas d' autre règle qui s' applique, la phrase ne peut alors être davantage analysée. La représentation de la phrase est alors délivrée (étape 40).
A titre d'exemple, on va maintenant décrire succinctement le traitement mis en œuvre au sein du module de traitement 14 lors de l' analyse de la phrase en langue française « Je voudrais aller de Paris à Madrid demain ». Comme on le conçoit, cette phrase présente une ambiguïté : en effet, l' adverbe « demain » peut s' appliquer soit au verbe « vouloir » soit au verbe « aller ».
L' analyseur morphologique 12 a préalablement fourni les informations suivantes :
mot forme concepts/rôles je pronom, lère pers. du singulier locuteur voudrais verbe modal, lère pers. du singulier vouloir aller verbe, infinitif aller, voler de préposition départ de, appartient, objet, à préposition arrive de, est à, reçoit, appartient
Paris nom propre Paris
Madrid nom propre Madrid demain adverbe demain
Après analyse morphologique, le texte TX est traité par le module de traitement 14. La base de données RS fournit un ensemble de règles syntaxiques tandis que la base de données ON fournit les concepts, les rôles et les relations ontologiques des concepts pour chaque nœud.
On a représenté sur la figure 7 un exemple d' ontologie utilisable pour le traitement de la phrase en langue française « Je voudrais aller de Paris à Madrid demain ». Comme on le conçoit, l' ontologie représentée sur cette figure a été extrêmement simplifiée, par souci de clarté. En particulier, des relations en pointillés entre deux concepts C indiquent que des concepts manquent entre deux concepts représentés. Sur cette figure sont représentés un ensemble de concepts C ainsi que les rôles liant deux concepts. Un concept dépendant peut être relié à un concept de tête lorsque ce concept dépendant spécifie une notion générique associée au concept de tête. Ils peuvent également être reliés par un rôle R.
Par exemple, en ce qui concerne le concept « déplacement », ce concept de tête peut être relié à des concepts « voyage par automobile », « voyage par train », « voler », dans la mesure où ces concepts constituent des précisions du concept générique « déplacement » .
De même, les concepts « lieu d' arrivée » et « lieu de départ » peuvent être reliés au concept « déplacement » par les rôles « arrive de » et « part de », respectivement. Comme indiqué précédemment, au cours de la création de l' arbre syntaxique par le module de traitement 14, la représentation ontologique est générée, les relations syntaxiques qui ne peuvent pas être validées par l'ontologie étant immédiatement supprimées. Par exemple, alors que l' analyse syntaxique autoriserait d' associer une personne derrière la préposition « de » pour indiquer la possession, une branche syntaxique ainsi créée serait immédiatement supprimée dans la mesure où aucun chemin correspondant n'existe dans l' ontologie qui prévoit que le concept « déplacement » ne peut être associé qu' à des concepts « lieu de départ » ou « lieu d' arrivée » par des rôles R « arrive de » et « part de », respectivement.
On a représenté sur la figure 8 quelques quintuples Q utilisés lors de l'élaboration de l' ontologie.
En se référant maintenant à la figure 9, l' analyse syntaxique définit que la relation syntaxique « sujet » lie le nœud « je » (nœud secondaire) et le nœud « voudrais » (nœud de tête). Les concepts C associés à ces nœuds sont respectivement « locuteur » et « vouloir ». La validation ontologique est positive (étape 22), c' est-à-dire que l'on peut combiner les deux concepts pour associer au nœud « voudrait » une formule ontologique partielle qui contient les formules ontologique « vouloir(w) », « locuteur (s) » et un rôle additionnel f (w,s) indiquant qui est le sujet du verbe « vouloir ».
Par la suite, les relations syntaxiques entre « aller » et « de », « à » et « demain », « de » et « Paris » et « à » et « Madrid » sont établies et combinées afin d' obtenir une formule ontologique partielle.
Comme on le voit sur la figure 9, les rôles « appartient » du nœud « de » et « est_à » du nœud « à » ne sont pas retenus parce que l' ontologie ne permet pas un rôle « appartient » ou un rôle « est_à », à partir des concepts « voler » ou « aller ».Une relation syntaxique entre les mots « voudrait » et « aller » est alors établie. Les nœuds n'ont plus une liste de concepts mais déjà une formule ontologique partielle. Après validation de cette relation syntaxique, les formules ontologiques sont combinées comme indiqué précédemment en référence à la figure 6 (étape 36).
Lorsque des relations syntaxiques validées ont pu être établies entre tous les mots du texte, on obtient une formule ontologique complète (figure 10).
Il est possible de créer des arbres syntaxiques supplémentaires si les règles syntaxiques le permettent, ce qui entraînerait la génération d' autres formules ontologiques. Dans l' exemple représenté, la grammaire et le lexique sont très réduits et ne permettent pas d' autre solution.
On a représenté sur la figure 11 le résultat du processus entier. Comme on le voit sur cette figure, le rôle « appartient » n'est pas validé car le concept « aller » et ses concepts plus génériques n'ont pas un tel rôle dans l'ontologie RS. La relation syntaxique entre le verbe modal « voudrait » et l' adverbe « demain » est également supprimée car l' ontologie n' a pas de rôle liant le concept « vouloir » et le concept « demain » ou les concepts plus génériques que « demain ».

Claims

REVENDICATIONS
1. Procédé de traitement automatique d'un langage par analyse syntaxique d' un texte écrit ou énoncé et analyse sémantique dudit texte pour en déduire le sens, caractérisé en ce que l' analyse syntaxique et l' analyse sémantique sont effectuées simultanément.
2. Procédé selon la revendication 1, caractérisé en ce qu' au cours de l' analyse syntaxique, on élabore un arbre syntaxique constitué d'un ensemble de nœuds formés chacun d'un mot ou d'une locution et associés chacun à une catégorie syntaxique et à une fonction syntaxique de dépendance reliant deux nœuds dudit arbre, et en ce qu' au cours de l' élaboration de l' arbre syntaxique, on procède à l' analyse sémantique du texte pour valider l' élaboration d' une branche de l' arbre entre deux nœuds liés par une fonction syntaxique.
3. Procédé selon la revendication 2, caractérisé en ce qu' au cours de l' analyse sémantique, on utilise une ontologie qui définit les concepts associés à chaque nœud et des rôles liant ces concepts, et l' on valide une branche de l' arbre syntaxique liant deux nœuds lorsqu'un rôle autorise une liaison entre les concepts associés aux nœuds.
4. Procédé selon l'une quelconque des revendications 1 à 3, caractérisé en ce qu' au cours de l' analyse sémantique, on élabore une représentation ontologique du texte en associant à chaque nœud de chaque paire de nœuds liés par une fonction syntaxique un ensemble de variables comprenant un concept traduisant la signification du nœud et une formule ontologique liant lesdits nœuds, de manière à élaborer l' ensemble des formules ontologiques liant les nœuds du texte.
5. Procédé selon la revendication 4, caractérisé en ce que l' on combine les formules ontologiques entre les nœuds liés par une fonction syntaxique de manière à élaborer une formule ontologique globale pour le texte.
6. Procédé selon l'une quelconque des revendications 1 à 5, caractérisé en ce qu'il comporte les étapes consistant à :
- associer à chaque nœud au moins un concept (C) traduisant le sens du nœud par interrogation d'une première base de données (ON) ;
- interroger une deuxième base de données (RS) dans laquelle sont stockées des règles syntaxiques pour établir une relation syntaxique liant un nœud principal et un nœud secondaire ; et
- tenter de combiner les concepts du nœud principal et du nœud secondaire, la relation syntaxique étant validée si l'étape au cours de laquelle on tente de combiner les concepts a abouti.
7. Procédé selon la revendication 6, caractérisé en ce qu' après validation de la relation syntaxique on remplace le concept du nœud principal par la combinaison des concepts des nœuds liés.
8. Procédé selon la revendication 6, caractérisé en ce qu' après validation de la relation syntaxique on rajoute le concept du nœud secondaire à une formule ontologique du nœud principal.
9. Procédé selon l'une quelconque des revendications 6 à 8, caractérisé en ce qu'il comporte en outre une étape d' analyse morphologique de chaque nœud du texte pour en déterminer sa forme en consultant une troisième base de données dans laquelle est stocké un lexique des nœuds.
10. Dispositif de traitement automatique d'un langage, pour la mise en œuvre d'un procédé selon l'une quelconque des revendications
1 à 8, caractérisé en ce qu'il comprend un module de traitement (14) associé à une première base de données (ON) dans laquelle est stockée une ontologie qui définit des concepts associés à chaque nœud et des rôles liant ces concepts et une deuxième base de données (RS) dans laquelle sont stockées des règles syntaxiques, le module de traitement comprenant des moyens pour élaborer un arbre syntaxique comprenant un ensemble de branches liants deux nœuds formés chacun d'un mot ou d'une locution et associés chacun à une catégorie syntaxique et à une fonction syntaxique de dépendance reliant les deux nœuds de la branche qui sont extraites de la deuxième base de données, chaque branche de l'arbre étant validée lorsqu'un rôle autorise une liaison entre les concepts associés aux nœuds.
11. Dispositif selon la revendication 10, caractérisé en ce qu'il comporte en outre un analyseur morphologique (12) associé à une troisième base de données (LX) dans laquelle est stocké un lexique.
PCT/FR2004/001692 2004-07-01 2004-07-01 Procede et dispositif de traitement automatique d’un langage Ceased WO2006013233A1 (fr)

Priority Applications (1)

Application Number Priority Date Filing Date Title
PCT/FR2004/001692 WO2006013233A1 (fr) 2004-07-01 2004-07-01 Procede et dispositif de traitement automatique d’un langage

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
PCT/FR2004/001692 WO2006013233A1 (fr) 2004-07-01 2004-07-01 Procede et dispositif de traitement automatique d’un langage

Publications (1)

Publication Number Publication Date
WO2006013233A1 true WO2006013233A1 (fr) 2006-02-09

Family

ID=34958621

Family Applications (1)

Application Number Title Priority Date Filing Date
PCT/FR2004/001692 Ceased WO2006013233A1 (fr) 2004-07-01 2004-07-01 Procede et dispositif de traitement automatique d’un langage

Country Status (1)

Country Link
WO (1) WO2006013233A1 (fr)

Cited By (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
FR2906049A1 (fr) * 2006-09-19 2008-03-21 Alcatel Sa Procede, mis en oeuvre par ordinateur, de developpement d'une ontologie a partir d'un texte en langage naturel
JP2020528825A (ja) * 2017-07-25 2020-10-01 シーメンス エナジー インコーポレイテッド 所望の超合金組成物を堆積させる方法

Citations (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
WO2002035376A2 (fr) * 2000-10-27 2002-05-02 Science Applications International Corporation Analyseur ontologique permettant de traiter des langues naturelles

Patent Citations (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
WO2002035376A2 (fr) * 2000-10-27 2002-05-02 Science Applications International Corporation Analyseur ontologique permettant de traiter des langues naturelles

Non-Patent Citations (4)

* Cited by examiner, † Cited by third party
Title
FAY-VARNIER C ET AL: "MODULES SYNTAXIQUES DES SYSTEMES D'ANALYSE DU FRANCAIS", TECHNIQUE ET SCIENCE INFORMATIQUES, L'AFCET, PARIS, FR, vol. 10, no. 6, January 1991 (1991-01-01), pages 403 - 425, XP000329148, ISSN: 0752-4072 *
IBRAHIM M H ET AL: "TARO: an interactive, object-oriented tool for building natural language systems", TOOLS FOR ARTIFICIAL INTELLIGENCE, 1989. ARCHITECTURES, LANGUAGES AND ALGORITHMS, IEEE INTERNATIONAL WORKSHOP ON FAIRFAX, VA, USA 23-25 OCT. 1989, LOS ALAMITOS, CA, USA,IEEE COMPUT. SOC, US, 23 October 1989 (1989-10-23), pages 108 - 113, XP010017412, ISBN: 0-8186-1984-8 *
KISE K ET AL: "A METHOD OF POST-PROCESSING FOR CHARACTER RECOGNITION BASED ON SYNTACTIC AND SEMANTIC ANALYSIS OF SENTENCES", SYSTEMS & COMPUTERS IN JAPAN, SCRIPTA TECHNICA JOURNALS. NEW YORK, US, vol. 27, no. 9, 1 August 1996 (1996-08-01), pages 94 - 107, XP000627484, ISSN: 0882-1666 *
LYTINEN S L: "Dynamically combining syntax and semantics in natural language processing", PROCEEDINGS AAAI-86: FIFTH NATIONAL CONFERENCE ON ARTIFICIAL INTELLIGENCE, 11 August 1986 (1986-08-11), PHILADELPHIA, PA, US, pages 574 - 578, XP008043272, ISBN: 0-934613-13-3 *

Cited By (5)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
FR2906049A1 (fr) * 2006-09-19 2008-03-21 Alcatel Sa Procede, mis en oeuvre par ordinateur, de developpement d'une ontologie a partir d'un texte en langage naturel
EP1903454A1 (fr) * 2006-09-19 2008-03-26 Alcatel Lucent Procédé, mis en oeuvre par ordinateur, de développement d'une ontologie à partir d'un texte en langage naturel
WO2008034802A1 (fr) * 2006-09-19 2008-03-27 Alcatel Lucent Procédé utilisé par des ordinateurs pour développer une ontologie à partir d'un texte en langage naturel
KR101416682B1 (ko) * 2006-09-19 2014-07-08 알까뗄 루슨트 자연어로 된 텍스트로부터 온톨로지를 개발하기 위한, 컴퓨터들에 의해 사용되는 방법
JP2020528825A (ja) * 2017-07-25 2020-10-01 シーメンス エナジー インコーポレイテッド 所望の超合金組成物を堆積させる方法

Similar Documents

Publication Publication Date Title
US8346756B2 (en) Calculating valence of expressions within documents for searching a document index
Bloom Language development: Form and function in emerging grammars.
US7584092B2 (en) Unsupervised learning of paraphrase/translation alternations and selective application thereof
US9448995B2 (en) Method and device for performing natural language searches
US7587389B2 (en) Question answering system, data search method, and computer program
US8027948B2 (en) Method and system for generating an ontology
US11468050B2 (en) Learning user synonyms from sequenced query sessions
Derwojedowa et al. Words, concepts and relations in the construction of Polish WordNet
JP2016115294A (ja) 情報検索方法及びデバイス
Khered et al. Dial2MSA-verified: A multi-dialect Arabic social media dataset for neural machine translation to Modern Standard Arabic
US20090063131A1 (en) Methods and systems for language representation
WO2006013233A1 (fr) Procede et dispositif de traitement automatique d’un langage
EP3629218A1 (fr) Correction orthographique, analyse morphologique et syntaxique pour un language potentiellement non-grammatical
Loáiciga Pronominal anaphora and verbal tenses in machine translation
FR2876815A1 (fr) Analyse critique de l'ordre des pronoms clitiques en francais
EP3248111A1 (fr) Procédé de lemmatisation, dispositif et programme correspondant
EP1376395A2 (fr) Procédé et dispositif pour élaborer une forme abrégée d'un terme
Perera et al. Utilizing typed dependency subtree patterns for answer sentence generation in question answering systems
KR101117298B1 (ko) 온톨로지 기반 한국어 의미 분석 시스템 및 방법
US11500867B2 (en) Identification of multiple foci for topic summaries in a question answering system
Mille et al. Multilingual summarization in practice: the case of patent claims
Torjmen et al. A NooJ Tunisian dialect translator
KR101117790B1 (ko) 품사별 결합 정보를 이용한 형태소 분석 시스템 및 방법
Ghosh et al. Clause identification and classification in bengali
Goh et al. A multilevel natural language query approach conversational agent systems

Legal Events

Date Code Title Description
AK Designated states

Kind code of ref document: A1

Designated state(s): AE AG AL AM AT AU AZ BA BB BG BR BW BY BZ CA CH CN CO CR CU CZ DE DK DM DZ EC EE EG ES FI GB GD GE GH GM HR HU ID IL IN IS JP KE KG KP KR KZ LC LK LR LS LT LU LV MA MD MG MK MN MW MX MZ NA NI NO NZ OM PG PH PL PT RO RU SC SD SE SG SK SL SY TJ TM TN TR TT TZ UA UG US UZ VC VN YU ZA ZM ZW

AL Designated countries for regional patents

Kind code of ref document: A1

Designated state(s): BW GH GM KE LS MW MZ NA SD SL SZ TZ UG ZM ZW AM AZ BY KG KZ MD RU TJ TM AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HU IE IT LU MC NL PL PT RO SE SI SK TR BF BJ CF CG CI CM GA GN GQ GW ML MR NE SN TD TG

NENP Non-entry into the national phase

Ref country code: DE

WWW Wipo information: withdrawn in national office

Country of ref document: DE

122 Ep: pct application non-entry in european phase