EP4695698A1 - Dispositif et procédé automatisé de collecte, de classification et de hiérarchisation d'un corpus de documents relationnels - Google Patents
Dispositif et procédé automatisé de collecte, de classification et de hiérarchisation d'un corpus de documents relationnelsInfo
- Publication number
- EP4695698A1 EP4695698A1 EP24720099.1A EP24720099A EP4695698A1 EP 4695698 A1 EP4695698 A1 EP 4695698A1 EP 24720099 A EP24720099 A EP 24720099A EP 4695698 A1 EP4695698 A1 EP 4695698A1
- Authority
- EP
- European Patent Office
- Prior art keywords
- calculation device
- documents
- identifiers
- cited
- document
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Pending
Links
Classifications
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F16/00—Information retrieval; Database structures therefor; File system structures therefor
- G06F16/30—Information retrieval; Database structures therefor; File system structures therefor of unstructured textual data
- G06F16/35—Clustering; Classification
- G06F16/353—Clustering; Classification into predefined classes
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F16/00—Information retrieval; Database structures therefor; File system structures therefor
- G06F16/30—Information retrieval; Database structures therefor; File system structures therefor of unstructured textual data
- G06F16/35—Clustering; Classification
- G06F16/355—Creation or modification of classes or clusters
Definitions
- the present invention relates to an automated device for collecting, classifying and prioritizing a corpus of relational documents into two complementary hierarchical groupings and an automated method for collecting, classifying and prioritizing a corpus of relational documents into two complementary hierarchical groupings. It applies to any set of documents including a bibliography containing the references cited in each document, and for example, to the field of search engines for scientific publications, research articles, theses, books and patents.
- the present invention also aims at a method for automatically generating textual content guided by an automated method for collecting, classifying and prioritizing a corpus of relational documents into two complementary hierarchical groupings. It applies to any set of files including a bibliography containing the references cited in each file, and for example, to the field of search engines for scientific publications, research articles, theses, books and patents.
- the main difficulty for an individual wishing to understand a subject covered in a large number of documents is to be able to identify units of meaning to which the documents in question belong, but also to identify which are the document(s) and/or important themes of the field, that is to say those documents and/or themes necessary for a good understanding of the subject.
- search engines make it possible to identify, on the basis of a query, documents that are relevant to keywords or the semantic meaning of the query and to sort these documents based on relevance to the query only.
- these search engines have sorting functions, allowing sorting in alphabetical order, by author name or by publication date for example.
- search engines are limited to quantifying the query-results adequacy, without worrying about the general meaning of interpretation of the results.
- these search engines do not provide individuals with a set of documents ranked both according to the query formulated and the specific characteristics of these documents allowing to improve the search results to bring out the main themes linked to the query as well as the founding documents linked to this query.
- search engines that allow to identify, on the basis of a query, files relevant to keywords or the semantic meaning of the query and allows to sort these files according to the relevance with regard to the query only.
- these search engines have sorting functions, allowing to sort in alphabetical order, by name of the author or by date of publication for example.
- search engines are limited to quantifying the query-results adequacy, without worrying about the general meaning of interpretation of the results.
- these search engines do not provide individuals with a set of files that are hierarchical both according to the query formulated and the specific characteristics of these files that make it possible to improve the search results to bring out the main themes related to the query as well as the founding files related to this query.
- search engines do not perform any intelligent, statistical and contextual filtering and/or grouping of files based on the search performed.
- LLM large language models
- Such large language models are very effective for thematically grouping files in a given corpus of files.
- these large language models consume considerable computing and energy resources to be trained and implemented, on the one hand, and these large language models suffer from so-called hallucination effects on the other hand.
- hallucination effects originate from the probabilistic approach, step by step, implemented during the generation of a response to a given query. The main consequence of these hallucination effects is to make search engines based on large language models inaccurate or even false and therefore unusable.
- FIG. 1 schematically represents a particular succession of steps of the method which is the subject of the present invention
- Figure 2 schematically represents a particular embodiment of a device which is the subject of the present invention
- Figure 3 schematically represents a graphical representation of a first partial result of the method which is the subject of the present invention
- Figure 4 schematically represents a graphical representation of a second partial result of the method which is the subject of the present invention
- Figure 5 schematically represents a succession of states of a corpus of documents from an initial extracted corpus
- FIG. 6 schematically represents a particular succession of steps of the method which is the subject of the present invention
- Figure 7 schematically represents a particular embodiment of a computer architecture capable of carrying out the method which is the subject of the present invention.
- Figure 8 schematically represents a particular succession of steps of the method which is the subject of the present invention.
- inventive concepts may be implemented by one or more methods or devices described herein, several examples of which are provided herein.
- the actions or steps performed in carrying out the method or device may be ordered in any suitable manner. Accordingly, it is possible to construct embodiments in which the actions or steps are performed in a different order than that illustrated, which may include performing certain acts simultaneously, even if they are presented as sequential acts in the illustrated embodiments.
- a reference to "A and/or B", when used in conjunction with open language such as “comprising” may refer, in one embodiment, to A only (optionally including elements other than B); in another embodiment, to B only (optionally including elements other than A); in yet another embodiment, to both A and B (optionally including other elements); etc.
- the expression "at least one”, in reference to a list of one or more elements, is to be understood to mean at least one element selected from one or more elements in the list of elements, but not necessarily including at least one of each element specifically listed in the list of elements and not excluding any combination of elements in the list of elements.
- This definition also allows for the optional presence of elements other than the elements specifically identified in the list of elements to which the expression “at least one” refers, whether or not related to those specifically identified elements.
- “at least one of A and B” may refer, in one embodiment, to at least one, optionally including more than one, A, without B present (and optionally including elements other than B); in another embodiment, to at least one, optionally including more than one, B, without A present (and optionally including elements other than A); in yet another embodiment, to at least one, optionally including more than one, A, and at least one, optionally including more than one, B (and optionally including other elements); etc.
- computing device designate any electronic assembly capable of executing instructions representative of a step of an algorithm or of the method which is the subject of the present invention.
- Such a computing device is exemplified with regard to FIG. 2.
- input means designate any means of interaction from an external system or user and a computing device.
- Such an input means may correspond, for example, to an API (for "Application Programming Interface") or to a human-machine interface (such as a keyboard and/or a mouse) which may be associated with a graphical user interface (translated from "graphic user interface", or "GUI").
- API Application Programming Interface
- GUI graphical user interface
- computer interfaces refers to any means of interaction from a computing device to an external system or user.
- a computer interface may correspond, for example, to an API or a human-machine interface (such as a screen) that can be associated with a graphical user interface.
- document database designate any database or computer memory, structured or not, allowing the execution of a search query for documents (or document identifiers) and the extraction of such documents.
- expert system refers to any computer program designed to simulate the expertise and decision-making of a human specialist. These systems are a specific application of artificial intelligence and rely primarily on domain-specific knowledge to solve complex problems at a level comparable to that of a human expert.
- the documents recorded in the document database include, for at least some of the documents, bibliographic metadata such as:
- documents and “files” are interchangeable and both refer to content stored in a computer memory comprising at least one of text, an image, a video or an audio element and at least one reference to another document or at least one other file stored in the computer memory.
- a reference may correspond to an address or a bijective unit reference.
- An "identifier” is any bijective digital representation of an object, such as a document for example.
- a document identifier corresponds, for example, to a document number.
- a measure of the relative intensity of connectivity of a member of a partition with all other members of the same partition is called a "communality index”.
- This commonality index corresponds to the intensity with which each cited reference or each citing document contributes to the unity of meaning of its cluster of belonging.
- the commonality index implemented during training step 120 measures the relative intensity with which each reference in a partition is co-cited with all other references classified in the same partition.
- the present invention implements a logic of quantification of thought and brain pathways, in the sense of cognitive sciences, contributing to an improvement in the brain activity of users who implement it, this improvement resulting in better memorization and understanding of the information contained in a corpus of documents resulting from a keyword search.
- step 150 of determining, by a calculation device, at least one commonality index for at least one cited document identifier of the first partitioned set and
- the selection of such a numerical indicator representative of a scientific discipline can have at least one of the following effects: the corpus of documents implemented during the extraction step 110 is selected according to the digital indicator representative of a scientific discipline and/or the large trained language model implemented during the provision step 725, as represented with respect to FIG. 7, is selected to correspond to a large trained language model associated with said digital indicator representative of a scientific discipline.
- the defined query is executed by a computing device interacting with a document database.
- a computing device interacting with a document database.
- Such an extraction step 110 is common in the field of search engines and is not recalled here.
- a documentary corpus is obtained.
- a documentary corpus is formed of at least one citing document identifier associated with at least one set of metadata, at least one such set of metadata comprising at least one document identifier cited by the citing document associated with the set of metadata.
- Such a corpus may comprise the citing and/or cited documents or only identifiers of citing and/or cited documents, as well as metadata associated with these citing documents, such metadata being able to include a link representative of an address on a computer network of said document.
- a document identifier "A” may be associated with a metadata set that contains, as a cited document identifier, a document identifier "B".
- a cites B that is, B is a cited document for A and A is a citing document for B.
- the terms "cited document” and “cited reference” are, for all intents and purposes, interchangeable.
- training step 111 computer processing is performed to collect at least one cited document identifier in at least one set of metadata associated with at least one citing document identifier of the extracted corpus.
- each cited document identifier of the set of metadata associated with each citing document is collected.
- training step 111 computer processing is performed to collect at least one citing document identifier from the extracted corpus.
- This list of citing document identifiers forms the second set.
- no collection is performed, the second set being formed from the result of extraction step 110.
- a text processing algorithm may for example be implemented.
- Such an algorithm may have the purpose of removing unnecessary characters from document identifiers, or of reorganizing elements of a character string representative of a document identifier, with a view to reconciling such document strings.
- reconciliation here is meant the implementation of a character string matching algorithm, configured to produce a proximity index between several character strings.
- Such an algorithm makes it possible, when a proximity index is greater than a specific threshold value, to determine that two distinct character strings are representative of the same cited document. This makes it possible, in particular, to create correspondence tables between character strings considered synonymous or even to replace one character string with another.
- the method 100 may comprise a pre-cleaning step configured to remove from the extracted corpus the excess occurrences of identifiers of the same cited document.
- the input errors are corrected, in particular by eliminating excess space characters, special characters, unnecessary or redundant characters for example.
- harmonization step 116 computer processing is performed to correct, in the second set, the incorrect cited document identifiers, i.e. the cited document identifiers incorrectly representing these cited documents.
- a cited document identifier associated with a citing document identifier may be replaced by a cited document identifier identified, during step 115, as correct (or majority).
- an ad-hoc cited document identifier is defined for a plurality of strings considered to be close and implemented to replace each iteration of the strings belonging to this plurality.
- an identifier of an entry in a correspondence table is defined for a plurality of character strings considered to be close and implemented to replace each iteration of the character strings belonging to this plurality.
- step 160 of forming a second partitioned grouping of classified and hierarchical citing document identifiers
- step 120 of forming a first partitioned grouping of identifiers of classified and hierarchized cited documents the objective is to hierarchize the methodologies and theoretical foundations linked to the subject of the query and therefore to the extracted corpus.
- a first threshold value is set, either automatically based on a default initialization instruction, or by a user via a human-machine interface, or by a third-party computer program via an API for example.
- This initialization step 125 may optionally include a step 225 of definition by a calculation device of a default value for at least one criterion among:
- the first threshold value is adjusted so as to provide a sample of the extracted corpus, corresponding to the first set, sufficient to allow efficient implementation of the step 140 of determining a co-citation index.
- this automatic adjustment step 130 is configured to modify the value of the minimum percentage of the number of document identifiers to be retained if no result validates a rule associated with at least one criterion implemented during the initialization step 125.
- At least one of the following rules may be implemented:
- the total number of documents must be greater than the minimum percentage of the number of document identifiers of the extracted corpus to be retained multiplied by the number of documents of the extracted corpus
- the number of cited documents must be greater than the total number of document identifiers associated with a number of cited documents greater than or equal to a specific threshold value.
- Automatic adjustment step 130 may also not take place if the characteristics of the first grouping allow it.
- the method 100 which is the subject of the present invention may comprise a step (not shown) of readjusting the first threshold value initialized or adjusted.
- a readjustment step may implement a graphical input interface associated with an input means allowing a user to manually readjust the first threshold value.
- the first adjusted threshold value is implemented during the filtration step 135, carried out for example by selecting a number of documents corresponding to the total number of documents obtained at the end of the extraction step 110, from the document identifier associated with the greatest number of document identifiers cited, and this in decreasing manner in depending on the number of document identifiers cited, until the total number of documents is reached.
- a matrix associating each pair of cited document identifiers is formed and filled according to the number of times that this pair of cited document identifiers is identified in the metadata associated with the citing documents.
- This determination step 140 is therefore carried out by counting.
- Such an algorithm corresponds to a reference co-citation analysis, or “RCCA” (for “Reference Co-Citation Analysis”).
- a step (not shown) of normalization of the results obtained can be carried out downstream of the determination step 140.
- This determination step 140 can be carried out during the partitioning step 145.
- Reduction step 141 reduces, for example, the reference co-citation matrix obtained in step 140 over all cited references into a sub-matrix whose rows and columns are composed of the references identified in automatic adjustment step 130.
- partitions of cited document identifiers are formed and correspond to main themes in the first grouping.
- Any partitioning (“clustering”) or classification algorithm can be implemented during this partitioning step 145.
- Such an algorithm can correspond, for example, to a k-means algorithm, fuzzy partitioning, pyramid partitioning or hierarchical classification.
- step 150 of determining at least one communality index the following equation may be implemented, for example and without limitation:
- - nk corresponds to the number of document identifiers cited in partition k
- - Ck(Rj) corresponds to the connectivity of the cited document identifier Rj in partition k, i.e. the number of cited document identifiers in partition k with which the cited document identifier Rj is connected and
- - Sk(Rj) corresponds to the connectivity strength of the cited document identifier Rj in partition k, that is, to the average of the number of cited document identifiers in partition k with which the cited document identifier Rj is connected.
- the average number of identifiers cited can be determined by the following equation, for example and without limitation:
- - nk corresponds to the number of document identifiers cited in partition k
- - ay corresponds to the number of co-citations of the cited document identifiers Rj and Rj by documents in the corpus.
- the cited documents forming the first grouping are classified among themselves globally (i.e. without taking into account the partitions) and/or within a given partition.
- this prioritization step 155 can be carried out according to a score associated with each cited document identifier, such a score being representative of the importance of the cited document in the first grouping.
- prioritization step 155 is implemented during provisioning step 200 described below.
- a second threshold value is initialized manually or automatically, similar to initialization step 125.
- step 165 of initializing step 160 of forming the second reduced set comprises a step 230 of defining, by a calculation device, a default value for at least one criterion among:
- the adjustment step 170 of the second reduced set formation step 160 is configured to:
- the adjustment step 170 of the step 160 of forming the second reduced set is configured to:
- Definition step 230 is performed manually or automatically, similarly to definition step 225.
- Dynamic adjustment step 170 is performed similarly to adjustment step 130, for example.
- step 170 of adjusting step 160 of forming the second grouping is configured to:
- the method 100 which is the subject of the present invention may comprise a step (not shown) of readjusting the second threshold value initialized or adjusted.
- a readjustment step may implement a graphical input interface associated with an input means allowing a user to manually readjust the second threshold value.
- Filtration step 175 is performed, for example, in a similar manner to filtration step 135, depending on whether the second threshold value was adjusted during adjustment step 170 or not.
- the determination step 180 is performed, for example, by establishing a matrix representative of each pair of citing document identifiers in the second set and by counting, for each pair of citing document identifiers, the number of document identifiers cited in common.
- Such an algorithm corresponds to a bibliographic coupling analysis of citing documents, or “DBCA” (for “Document Cishing Coupling Analysis”).
- Reduction step 181 reduces, for example, the bibliographic document coupling matrix obtained in step 180 over all citing documents into a sub-matrix whose rows and columns are composed of the citing documents identified in automatic adjustment step 170.
- the partitioning step 185 is carried out, for example, by implementing a suitable partitioning or classification algorithm.
- a suitable partitioning or classification algorithm may correspond, for example, to a k-means algorithm, fuzzy partitioning, pyramidal partitioning or hierarchical classification.
- Step 190 of determining at least one communality index is carried out, for example, by implementing the following equation:
- - nk corresponds to the number of document identifiers cited in partition k
- - Ck(Dj) corresponds to the connectivity of the document identifier Dj in the partition k, that is to say to the number of document identifiers in the partition k with which the cited document identifier Dj is connected and
- - Sk(Dj) corresponds to the connectivity strength of the document identifier Dj in partition k, that is, to the average of the number of document identifiers in partition k with which the cited document identifier Dj is connected.
- the connectivity strength of document identifier Dj in partition k can be determined by implementing the following equation:
- - R corresponds to the number of cited document identifiers shared by document identifiers Dj and Dj.
- Prioritization step 195 is performed, for example, in a manner similar to prioritization step 155.
- the second hierarchical grouping is implemented during supply stage 200.
- the provisioning step 200 is carried out, for example, by implementing a graphical user interface adapted to the display of the first and second hierarchical groupings.
- each partition, 501 and 502 being associated with citing documents, 503 and 504, each citing document being associated with a particular highlighting, representative of the importance of the citing document in the second set (size of the circle) and/or in the partition (intensity of the color of the circle).
- This automated device 300 for collecting, classifying and prioritizing a corpus of relational documents into two complementary hierarchical groupings comprises a computer memory 325, storing computer instructions, and a calculation device 310, which, when this calculation device executes the instructions stored in the computer memory, executes the following steps:
- a cleaning step by a calculation device, of at least one identifier of the same document cited in the first set, by the implementation of a character string matching algorithm, to harmonize the identifiers of the same cited document,
- a step of forming, by a calculation device, a second partitioned grouping of identifiers of classified and hierarchical citing documents comprising:
- FIG. 2 Shown in Figure 2, which is not to scale, is a block diagram that illustrates an exemplary computer system with which an embodiment of a method of the present invention may be implemented.
- a computer system 305 and instructions for implementing the disclosed technologies in the hardware, software, or combination of hardware and software are schematically depicted, such as in the form of boxes and circles, at the same level of detail that is commonly used by those of ordinary skill in the art to which this disclosure pertains to communicate computer architecture and computer system implementations.
- the computer system 305 includes an input/output (I/O) subsystem 320 that may include a bus and/or one or more other communication mechanisms for communicating information and/or instructions between components of the computer system 305 over electronic signal paths.
- the input/output subsystem 320 may include an input/output controller, a memory controller, and at least one input/output port.
- the electronic signal paths are shown schematically in the drawings, for example, as lines, one-way arrows, or two-way arrows.
- At least one processor 310 is coupled to the I/O subsystem 320 to process information and instructions.
- the processor 310 may include, for example, a general purpose microprocessor or microcontroller and/or a special purpose microprocessor such as an embedded system or graphics processing unit (GPU) or a digital signal processor or an ARM processor.
- the processor 310 may include an integrated arithmetic logic unit (ALU) or may be coupled to a separate ALU.
- ALU integrated arithmetic logic unit
- the computer system 305 includes one or more memories 325, such as a main memory, that is coupled to the I/O subsystem 320 to electronically digitally store data and instructions to be executed by the processor 310.
- the memory 325 may include volatile memory such as various forms of random access memory (RAM) or other dynamic storage devices.
- RAM random access memory
- the memory 325 may also be used to store temporary variables or other intermediate information during execution of the instructions to be executed by the processor 310.
- Such instructions when stored in a non-transitory computer-readable storage medium accessible to the processor 310, may transform the computer system 305 into a special purpose machine that is customized to perform the operations specified in the instructions.
- the computer system 305 further includes non-volatile memory such as a read-only memory (ROM) 330 or other static storage device coupled to the I/O subsystem 320 for storing information and instructions for the processor 310.
- the ROM 330 may include various forms of programmable ROM (PROM) such as erasable PROM (EPROM) or electrically erasable PROM (EEPROM).
- a persistent storage unit 315 may include various forms of non-volatile random access memory (NVRAM), such as a memory FLASH, or solid state storage, a magnetic disk, or an optical disk such as a CD-ROM or DVD-ROM and may be coupled to the I/O subsystem 320 to store information and instructions.
- NVRAM non-volatile random access memory
- Memory 315 is an example of a non-transitory computer-readable medium that may be used to store instructions and data that, when executed by the processor 310, cause execution of computer-implemented methods for performing the techniques of this document.
- the instructions in memory 325, ROM 330, or storage 315 may comprise one or more sets of instructions that are organized into modules, methods, objects, functions, routines, or calls.
- the instructions may be organized as one or more computer programs, operating system services, or application programs, including mobile applications.
- the instructions may comprise an operating system and/or system software; one or more libraries to support multimedia, programming, or other functions; data protocol instructions or stacks to implement TCP/IP, HTTP, or other communication protocols; file format processing instructions to parse or render files encoded using HTML, XML, JPEG, MPEG, or PNG; user interface instructions to render or interpret commands for a graphical user interface (GUI), command line interface, or text-based user interface; application software such as an office suite, Internet access applications, design and manufacturing applications, graphics applications, audio applications, software engineering applications, educational applications, games, or miscellaneous applications.
- the instructions may implement a web server, a web application server, or a web client.
- the instructions may be organized as a presentation layer, an application layer, and a data storage layer such as a relational database system using Structured Query Language (SQL) or no SQL, an object store, a graph database, a flat file system, or other data storage.
- SQL Structured Query Language
- object store e.g., a graph database
- flat file system e.g., a flat file system
- the computer system 305 may be coupled via the I/O subsystem 320 to at least one output device 335.
- the output device 335 is a digital computer display.
- Exemplary displays that may be used in various embodiments include a touch screen or a light emitting diode (LED) display or a liquid crystal display (LCD) or an e-paper display.
- the computer system 305 may include one or more other types of output devices 335, either in place of or in addition to a display device.
- Exemplary other output devices 335 include printers, ticket printers, plotters, projectors, sound cards or video cards, speakers, buzzers or piezoelectric or other audible devices, LED or LCD lights or indicators, haptic devices, actuators, or servos.
- At least one input device 340 is coupled to the I/O subsystem 320 to communicate signals, data, command selections, or gestures to the processor 310.
- Examples of input devices 340 include touch screens, microphones, digital still and video cameras, alphanumeric and other keys, keyboards, graphics tablets, image scanners, joysticks, clocks, switches, buttons, dials, sliders.
- a control device 345 may perform cursor control or other automated control functions such as navigating a graphical interface on a display screen, alternatively or in addition to input functions.
- the control device 345 may be a touchpad, mouse, trackball, or cursor direction keys to communicate directional information and control selections to the processor 310 and to control movement of the cursor on the display 335.
- the input device may have at least two degrees of freedom in two axes, a first axis (e.g., x) and a second axis (e.g., y), which allows the device to specify positions in a plane.
- An input device is a wired, wireless, or optical control device, such as a joystick, wand, console, steering wheel, pedal, gear shift mechanism, or other type of control device.
- An input device 340 may include a combination of several different input devices, such as a video camera and a depth sensor.
- the computing system 305 may include an Internet of Things (IoT) device in which one or more of the output device 335, the input device 340, and the control device 345 are omitted.
- IoT Internet of Things
- the input device 340 may include one or more cameras, motion detectors, thermometers, microphones, seismic detectors, other sensors or detectors, measuring devices, or encoders
- the output device 335 may include a special purpose display such as a single-line LED or LCD display, one or more indicators, a display panel, a meter, a valve, a solenoid, an actuator, or a servo motor.
- the output device 335 may include hardware, software, firmware, and interfaces to generate position report packets, notifications, pulse or heartbeat signals, or other recurring data transmissions that specify a position of the computer system 305, alone or in combination with other application-specific data, directed to the host 350 or server 355.
- the computer system 305 may implement the techniques described herein using custom hardwired logic, at least one ASIC (Application-specific integrated circuit) or FPGA (Field-programmable gate array), firmware, and/or program instructions or logic that, when configured, can be used to perform the techniques described herein. loaded and used or executed in combination with the computer system, cause or program the computer system to operate as a special purpose machine.
- the techniques described herein are executed by the computer system 305 in response to the processor 310 executing at least one sequence of at least one instruction contained in the main memory 325. These instructions may be read into the main memory 325 from another storage medium, such as the memory 315. Execution of the sequences of instructions contained in the main memory 325 causes the processor 310 to execute the process steps described herein.
- hardwired circuits may be used in place of or in combination with software instructions.
- Non-volatile media include, for example, optical or magnetic disks, such as memory 315.
- Volatile media include dynamic memory, such as memory 325.
- Common forms of storage media include, for example, a hard disk drive, a solid state drive, a flash drive, a magnetic data storage medium, any optical or physical data storage medium, a memory chip, and the like.
- Storage media are distinct from, but may be used in conjunction with, transmission media.
- Transmission media assist in the transfer of information between storage media.
- transmission media include coaxial cables, copper wires, and optical fibers, including the wires that make up a bus of the I/O subsystem 320.
- Transmission media may also take the form of acoustic or light waves, such as those generated during radio and infrared data communications.
- the instructions may initially be transported on a magnetic disk or solid-state drive of a remote computer.
- the remote computer may load the instructions into its dynamic memory and send the instructions over a communications link such as a fiber optic or coaxial cable or a telephone line using a modem.
- a modem or router local to the computer system 305 may receive the data over the communications link and convert the data into a format that can be read by the computer system 305.
- a receiver such as a radio frequency antenna or an infrared detector may receive the data transported in a wireless or optical signal and suitable circuitry may provide the data to the I/O subsystem 320, for example by placing the data on a bus.
- the I/O subsystem 320 transports the data to the memory 325, from which the processor 310 retrieves and executes instructions. Instructions received by memory 325 may optionally be stored on memory 315 before or after execution by processor 310.
- the computer system 305 also includes a communication interface 360 coupled to a bus 320.
- the communication interface 360 provides a bidirectional data communication coupling to the one or more network links 365 that are directly or indirectly connected to at least one communication network, such as a network 370 or a public or private cloud on the Internet.
- the communication interface 360 may be an Ethernet network interface, an Integrated Services Digital Network (ISDN) card, a cable modem, a satellite modem, or a modem to provide a data communication connection to a corresponding type of communication line, such as an Ethernet cable or a wireline of any type or a fiber optic line or a telephone line.
- ISDN Integrated Services Digital Network
- the network 370 broadly represents a local area network (LAN), a wide area network (WAN), a campus network, an Internet network, or any combination thereof.
- the 360 communication interface may include a LAN card to provide a data communication connection to a compatible LAN, or a cellular radiotelephone interface that is wired to send or receive cellular data according to cellular radiotelephone wireless network standards, or a satellite radio interface that is wired to send or receive digital data according to satellite wireless network standards.
- the 360 communication interface sends and receives electrical, electromagnetic, or optical signals over signal paths that carry digital data streams representing various types of information.
- the network link 365 typically provides electrical, electromagnetic, or optical data communication directly or via at least one network to other data devices, using, for example, satellite, cellular, Wi-Fi, or BLUETOOTH technology.
- the network link 365 may provide a connection through a network 370 to a host computer 350.
- the network link 365 may provide a connection through the network 370 or to other computing devices via interconnect devices and/or computers that are operated by an Internet service provider (ISP) 375.
- the ISP 375 provides data communication services through a global packet data communication network represented by the Internet 380.
- a server computer 355 may be coupled to the Internet 380.
- the server 355 broadly represents any computer, data center, virtual machine or virtual computing instance with or without a hypervisor, or computer running a containerized program system such as DOCKER or KUBERNETES.
- the server 355 may represent an electronic digital service that is implemented using more than one computer or instance and that is accessed and used by transmitting web service requests, Uniform Resource Locator (URL) strings with parameters in Hypertext Transfer Protocol (HTTP) payloads.
- URL Uniform Resource Locator
- the computer system 305 and the server 355 may form elements of a distributed computing system that includes other computers, a processing partition, a server farm, or other organization of computers that cooperate to perform tasks or run applications or services.
- the server 355 may include one or more sets of instructions that are organized as modules, methods, objects, functions, routines, or calls.
- the instructions may be organized as one or more computer programs, operating system services, or application programs, including mobile applications.
- the instructions may include an operating system and/or system software; one or more libraries to support multimedia, programming, or other functions; data protocol stacks or instructions for implementing TCP/IP (for "Transmission control protocol / Internet protocol"), HTTP or other communication protocols; file format processing instructions for parsing or rendering files encoded using HTML (for "Hypertext markup language"), XML (for "Extensible markup language”), JPEG (for "Joint Photographie Experts Group”), MPEG (for "Moving picture experts group”) or PNG (for "Portable Networks Graphie”); user interface instructions for rendering or interpreting commands for a graphical user interface (GUI), a command line interface or a text-based user interface; application software such as an office suite, Internet access applications, design and manufacturing applications, graphics applications, audio applications, software engineering applications, educational applications, games, or miscellaneous applications.
- GUI graphical user interface
- the server 355 may include a web application server that hosts a presentation layer, an application layer, and a data storage layer such as a relational database system using Structured Query Language (SQL) or no SQL, an object store, a graph database, a flat file system, or other data storage.
- SQL Structured Query Language
- object store an object store
- graph database a graph database
- flat file system a flat file system
- the computer system 305 may send messages and receive data and instructions, including program code, via the network(s), network link 365, and communications interface 360.
- a server 355 may transmit requested code for an application program via the Internet 380, ISP 375, local area network 370, and communications interface 360.
- the received code may be executed by processor 310 as received, and/or stored in memory 315, or other non-volatile memory for later execution.
- Execution of instructions as described in this section may implement a process as an instance of a computer program that is currently executing and consists of program code and its current activity.
- a process may consist of multiple threads that execute instructions concurrently.
- a computer program is a passive collection of instructions, while a process may be the actual execution of those instructions.
- Multiple processes may be associated with the same program; for example, having multiple instances of the same program open often means that more than one process is currently executing. Multitasking may be implemented to allow multiple processes to share the processor 310.
- each processor 310 or processor core executes only one task at a time
- the computer system 305 may be programmed to implement multitasking to allow each processor to switch between currently executing tasks without having to wait for each task to complete.
- the switches may be performed when tasks perform input/output operations, when a task indicates that it can be switched, or upon hardware interrupts.
- Time sharing may be implemented to enable rapid response to user interactive applications by rapidly performing context switches to give the appearance of multiple processes running simultaneously.
- an operating system may prevent direct communication between independent processes, by providing strictly mediated and controlled interprocess communication functionality.
- a set of keywords defined by a user or a third-party system, are collected and stored in a temporary computer memory.
- Such an input step 705 may implement an API or a human-machine interface, such as a keyboard, a mouse and a graphical user interface for example.
- Extraction step 710 may be performed in a manner similar to extraction step 110 as described with respect to FIG. 1.
- Training step 715 is performed, for example, as described with respect to FIG. 1.
- the metadata extraction step 745 is performed, for example, by implementing a computer program executed by a computing device.
- a computer program is, for example, configured to extract the title, at least one name of an author, a publication journal, a publication year, and/or at least one cited publication identifier.
- the determination step 720 is carried out, for example, by implementing a computer program executed by a computing device. During this calculation step 720, two distinct queries in natural language are each formed by the concatenation of a standardized query text representative of a content generation instruction.
- Such a query corresponds, for example, to a so-called “gap” query, i.e. a character string containing variables, representative of the extracted metadata, partitions or sub-partitions and/or a grouping.
- a so-called “gap” query i.e. a character string containing variables, representative of the extracted metadata, partitions or sub-partitions and/or a grouping.
- Such a query is then provided, through a graphical interface or a software interface (API type) to a large trained language model.
- API type software interface
- At least one query for a large language model is representative of a query for labeling at least one partition of at least one cluster.
- At least one query for a large language model is representative of a query to generate a summary of at least one partition of at least one cluster.
- At least one large language model query is representative of a subpartition identification query for at least one partition of at least one cluster.
- the large language model is trained using a supervised and/or reinforcement learning method.
- This large language model can be trained on data distributed by scientific or intellectual disciplines.
- At least one large language model query is representative:
- the provisioning step 725 is carried out, for example, by implementing a computer program executed by a computing device.
- an API or a robotic process automation system (RPA) may be implemented, for example.
- the large language model trained may correspond, for example, to ChatGPT (Registered Trademark) or to a large language model trained specifically on a corpus of a scientific field corresponding to the scientific field of the files sought.
- the reception step 730 is carried out, for example, by the implementation of a computer program executed by a computing device. During this reception step 730, an API is for example implemented.
- the provisioning step 735 is carried out, for example, by implementing a computer program executed by a computing device. During this provisioning step 735, an API is for example implemented.
- the method 700 which is the subject of the present invention comprises a step of determining a sub-partition of at least one partition of at least one grouping.
- the method 700 which is the subject of the present invention comprises:
- the selection step 740 may implement an API or a human-machine interface, such as a keyboard, a mouse and a graphical user interface for example.
- This selection step 740 may constitute, for example, the selection of an item in a list, each item being representative of a discipline.
- a discipline may correspond, for example, to a scientific discipline such as medicine or economics.
- the selection step 745 can be carried out manually, then optionally merging with the selection step 740, or automatically, via a set of instructions representative of a computer program for example.
- each available trained large language model is associated with a tag or numeric indicator representative of a discipline associated with that trained large language model.
- the selected trained large language model corresponds to the trained large language model associated with the discipline numeric indicator that corresponds to the discipline numeric indicator selected during the selection step 740.
- the method 700 which is the subject of the present invention comprises at least one step of training a large language model, associated with a digital discipline identifier, on a corpus of relational documents filtered to correspond to documents of the determined discipline.
- Figure 8 schematically represents a particular combination of the successions of steps illustrated in Figures 1 and 6, the corpora formed at the output of the method 100 represented in Figure 1 being implemented to form queries to a large language model as described with regard to Figure 6.
- FIG. 7 schematically represents a particular embodiment of a computer architecture 800 capable of carrying out a particular embodiment of the method 700 which is the subject of the present invention.
- This computer architecture 800 comprises:
- a text search engine 810 configured to, based on the keywords 805 entered, provide a corpus 815 of relational files or documents,
- a natural language query 840 combined with the first grouping 835 of files or with data representative of the first grouping of files, to form a content generation query to be addressed to a large language model 845,
- a query 870 in natural language combined with the second grouping 865 of files or with data representative of the second grouping of files, to form a filtration and/or sorting query to be addressed to a large language model 875,
- a large language model 875 configured to produce text content that depends on the query 870.
- the present invention aims to remedy all or part of these drawbacks.
- the present invention aims at an automated method for collecting, classifying and prioritizing a corpus of relational documents into two complementary hierarchical groupings, characterized in that it comprises:
- a cleaning step by a calculation device, of at least one identifier of the same document cited in the first set, by the implementation of a character string matching algorithm, to harmonize the identifiers of the same cited document, - a step of harmonization, by a calculation device, of identifiers of documents cited in the second set according to the result of the cleaning step, then, concomitantly:
- a step of forming, by a calculation device, a second partitioned grouping of identifiers of classified and hierarchical citing documents comprising:
- a filtration step by a calculation device, of the second set as a function of the second adjusted threshold value, - a step of determining, by a calculation device, an index of documents cited in common representative of a number of documents cited in common for at least one pair of identifiers of documents citing the second filtered set,
- a corpus relevant to a query is extracted and processed in such a way as to bring out two distinct and complementary hierarchical groupings, representative of the influential documents in the cognitive constitution of the extracted corpus from the extracted corpus and the main themes from the extracted corpus.
- These corpora can, due to the distinct filtration steps, present a different number of documents and, due to the distinct hierarchization steps, order the relevance of the documents in a distinct manner within each corpus.
- the initialization step of the first grouping formation step comprises a step of defining, by a calculation device, a default value for at least one criterion among:
- the adjustment step of the first grouping formation step is configured to modify the value of the minimum percentage of the number of document identifiers to be retained if no result validates a rule associated with at least one criterion implemented during the initialization step.
- the initialization step of the step of forming the second reduced set comprises a step of defining, by a calculation device, a default value for at least one criterion among:
- the adjusting step of the second reduced set forming step is configured to:
- the method which is the subject of the present invention comprises:
- - a step of determining, by the calculation device, two queries for a large language model, as a function of the first and second partitioned groupings and the extracted metadata associated with said groupings, each query being representative of a query for generating textual content, - a step of providing, by the calculation device, the two determined requests to a large trained language model,
- At least one query for a large language model is representative of a query for labeling at least one partition of at least one cluster.
- the method which is the subject of the present invention comprises:
- the present invention aims at an automated device for collecting, classifying and prioritizing a corpus of relational documents into two complementary hierarchical groupings, which comprises a computer memory, storing computer instructions, and a calculation device, which, when this calculation device executes the instructions stored in the computer memory, executes the following steps:
- a cleaning step by a calculation device, of at least one identifier of the same document cited in the first set, by the implementation of a character string matching algorithm, to harmonize the identifiers of the same cited document,
- the present invention aims at a method for automatic generation of textual content guided by a method as aimed at by the first aspect of the present invention, each file of the unique corpus being associated with at least one keyword, which comprises:
- a corpus relevant to a query is extracted and processed in such a way as to bring out two distinct and complementary hierarchical groupings, representative of the influential files in the cognitive constitution of the extracted corpus from the extracted corpus and the main themes from the extracted corpus.
- These corpora can, due to the distinct filtration steps, present a different number of files and, due to the distinct hierarchization steps, order the relevance of the files in a distinct manner within each corpus.
- each grouping is provided to a user or stored in computer memory.
- the groupings are filtered and sorted statistically, by implementing a large language model configured to perform this filtering and sorting without user intervention.
- the mechanism implemented by the present invention can be said to be a "guided generative transformer" (GGT). That is to say, the mechanism implemented by the present invention makes it possible to transform an unordered set of text metadata having a bibliography, into two partitioned sets from which labeled textual contents are generated, summarizing the texts, with their supporting sources.
- GTT guided generative transformer
- Such an invention may be based only on metadata, thus avoiding any infringement of copyright and other related intellectual property rights.
- At least one query for a large language model is representative of a query for labeling at least one partition of at least one cluster.
- At least one query for a large language model is representative of a query to generate a summary of at least one partition of at least one cluster.
- At least one large language model query is representative of a subpartition identification query for at least one partition of at least one cluster.
- the method which is the subject of the present invention comprises a step of determining a sub-partition of at least one partition of at least one grouping.
- At least one large language model query is representative:
- the method which is the subject of the present invention comprises:
- the statistical training step comprises a step of training, by a calculation device, a first partitioned grouping of identifiers of classified and hierarchical cited files, which comprises:
- the initialization step of the second grouping formation step comprises a step of defining, by a calculation device, a default value for at least one criterion among:
- the adjustment step of the second grouping formation step is configured to:
- the present invention aims at a device for automatic generation of textual content guided by an expert system for applying Bibliometric techniques from a single corpus of relational files recorded in a database, each file of the single corpus being associated with at least one keyword, which comprises a computer memory, storing computer instructions, and a calculation device, which, When this computing device executes the instructions stored in the computer memory, it performs the following steps:
Landscapes
- Engineering & Computer Science (AREA)
- Theoretical Computer Science (AREA)
- Data Mining & Analysis (AREA)
- Databases & Information Systems (AREA)
- Physics & Mathematics (AREA)
- General Engineering & Computer Science (AREA)
- General Physics & Mathematics (AREA)
- Information Retrieval, Db Structures And Fs Structures Therefor (AREA)
Abstract
Le procédé (100) objet de la présente invention a pour objectif de fournir deux groupements documentaires hiérarchisés et complémentaires à partir d'une requête unique d'extraction de documents issus d'une base de données de documents. Le procédé (100) comporte une étape (115) de nettoyage et deux étapes formation (120, 160) des deux groupements hiérarchisés selon deux algorithmes distincts.
Description
DESCRIPTION
DISPOSITIF ET PROCÉDÉ AUTOMATISÉ DE COLLECTE, DE CLASSIFICATION ET DE HIÉRARCHISATION D’UN CORPUS DE DOCUMENTS RELATIONNELS
Domaine technique de l’invention
La présente invention vise un dispositif automatisé de collecte, de classification et de hiérarchisation d’un corpus de documents relationnels en deux groupements hiérarchisés complémentaires et un procédé automatisé de collecte, de classification et de hiérarchisation d’un corpus de documents relationnels en deux groupements hiérarchisés complémentaires. Elle s’applique à tout ensemble de documents incluant une bibliographie contenant les références citées dans chaque document, et par exemple, au domaine des moteurs de recherche de publications scientifiques, d’articles de recherches, de thèses, de livres et de brevets.
La présente invention vise également un procédé de génération automatique d’un contenu textuel guidée par un procédé automatisé de collecte, de classification et de hiérarchisation d’un corpus de documents relationnels en deux groupements hiérarchisés complémentaires. Elle s’applique à tout ensemble de fichiers incluant une bibliographie contenant les références citées dans chaque fichier, et par exemple, au domaine des moteurs de recherche de publications scientifiques, d’articles de recherches, de thèses, de livres et de brevets.
Etat de la technique
Les approches décrites dans cette section sont des approches qui pourraient être poursuivies, mais pas nécessairement des approches qui ont été conçues ou poursuivies précédemment. Par conséquent, il convient de ne pas supposer que l'une ou l'autre des approches décrites dans cette section constitue un art antérieur du seul fait de son inclusion dans cette section.
Le nombre de documents accessibles aux individus croit annuellement de manière significative, si bien qu’il en résulte une difficulté pour ces individus à faire sens de l’ensemble des informations disponibles dans ces documents.
Pour l’essentiel, ces documents accessibles font référence à d’autres documents, de manière plus ou moins méthodique. Par exemple, les publications scientifiques et les brevets citent l’état de l’art antérieur considéré comme pertinent, tandis que des ouvrages de références font références à d’autres ouvrages ou autres références scientifiques. On dit de tels documents qu’ils sont relationnels, c’est-à-dire qu’ils s’inscrivent à travers leur bibliographie dans des familles de documents dont l’analyse, actuellement experte et complexe, révèle des unités de sens non explicitées.
La principale difficulté, pour un individu désirant appréhender un sujet traité dans une pluralité importante de documents, est de parvenir à identifier des unités de sens auxquelles appartiennent les documents visés, mais également d’identifier quels sont le ou les documents
et/ou thèmes importants du domaine, c’est-à- ces documents et/ou thèmes nécessaires à la bonne compréhension du sujet.
Aujourd’hui, la mise en œuvre de moteurs de recherche ordinaires permet d’identifier, sur la base d’une requête, des documents pertinents au regard de mots clés ou du sens sémantique de la requête et permet de trier ces documents en fonction de la pertinence au regard de la requête uniquement. Occasionnellement, ces moteurs de recherches disposent de fonctions de tri, permettant de trier par ordre alphabétique, par nom de l’auteur ou par date de publication par exemple.
Toutefois, de tels moteurs de recherche se limitent à quantifier l’adéquation requête- résultats, sans se soucier du sens d’interprétation général des résultats. Dit autrement, ces moteurs de recherches ne permettent pas de fournir aux individus un ensemble de documents hiérarchisés à la fois en fonction de la requête formulée et de caractéristiques propres de ces documents permettant d’améliorer les résultats de la recherche pour faire émerger les thèmes principaux liés à la requête ainsi que les documents fondateurs liés à cette requête.
On connaît, d’une part, la mise en œuvre de moteurs de recherche ordinaires qui permettent d’identifier, sur la base d’une requête, des fichiers pertinents au regard de mots clés ou du sens sémantique de la requête et permet de trier ces fichiers en fonction de la pertinence au regard de la requête uniquement. Occasionnellement, ces moteurs de recherches disposent de fonctions de tri, permettant de trier par ordre alphabétique, par nom de l’auteur ou par date de publication par exemple.
Toutefois, de tels moteurs de recherche se limitent à quantifier l’adéquation requête- résultats, sans se soucier du sens d’interprétation général des résultats. Dit autrement, ces moteurs de recherches ne permettent pas de fournir aux individus un ensemble de fichiers hiérarchisés à la fois en fonction de la requête formulée et de caractéristiques propres de ces fichiers permettant d’améliorer les résultats de la recherche pour faire émerger les thèmes principaux liés à la requête ainsi que les fichiers fondateurs liés à cette requête.
De plus, de tels moteurs de recherche ne procèdent à aucun filtrage et/ou regroupement de fichiers intelligent, statistique et contextuel à la recherche réalisée.
On connaît, d’autre part, des moteurs de recherche basés sur la mise en œuvre de grands modèles de langage (traduit de « large language model », abrégé LLM). De tels grands modèles de langages sont très efficaces pour regrouper thématiquement des fichiers dans un corpus de fichiers donnés. Toutefois, ces grands modèles de langage consomment des ressources informatiques et énergétiques considérables pour être entraînés et mis en œuvre, d’une part, et ces grands modèles de langage souffrent d’effets dits d’hallucination d’autre part. Ces effets d’hallucination ont pour origine l’approche probabiliste, de proche en proche, mise en œuvre au cours de la génération d’une réponse à une requête donnée. Ces effets d’hallucination ont pour principale conséquence de rendre des moteurs de recherche basés sur des grands modèles de langage inexacts voire faux et donc inutilisables.
Brève description des figures
D’autres avantages, buts et caractéristiques particulières de l’invention ressortiront de la description non limitative qui suit d’au moins un mode de réalisation particulier du dispositif et du procédé objets de la présente invention, en regard des dessins annexés, dans lesquels :
La figure 1 représente, schématiquement, une succession d’étapes particulière du procédé objet de la présente invention,
La figure 2 représente, schématiquement, un mode de réalisation particulier d’un dispositif objet de la présente invention,
La figure 3 représente, schématiquement, une représentation graphique d’un premier résultat partiel du procédé objet de la présente invention,
La figure 4 représente, schématiquement, une représentation graphique d’un deuxième résultat partiel du procédé objet de la présente invention,
La figure 5 représente, schématiquement, une succession d’états d’un corpus de documents à partir d’un corpus extrait initial,
La figure 6 représente, schématiquement, une succession d’étapes particulière du procédé objet de la présente invention,
La figure 7 représente, schématiquement, un mode de réalisation particulier d’une architecture informatique susceptible de réaliser le procédé objet de la présente invention et
La figure 8 représente, schématiquement, une succession d’étapes particulière du procédé objet de la présente invention.
Description des modes de réalisation
La présente description est donnée à titre non limitatif, chaque caractéristique d’un mode de réalisation pouvant être combinée à toute autre caractéristique de tout autre mode de réalisation de manière avantageuse.
On note dès à présent que les figures ne sont pas à l’échelle.
Comme on le comprend à la lecture de la présente description, divers concepts inventifs peuvent être mis en œuvre par une ou plusieurs méthodes ou dispositifs décrits ci-après, dont plusieurs exemples sont ici fournis. Les actions ou étapes réalisées dans le cadre de la réalisation du procédé ou du dispositif peuvent être ordonnées de toute manière appropriée. En conséquence, il est possible de construire des modes de réalisation dans lesquels les actions ou étapes sont exécutées dans un ordre différent de celui illustré, ce qui peut inclure l'exécution de certains actes simultanément, même s'ils sont présentés comme des actes séquentiels dans les modes de réalisation illustrés.
L'expression "et/ou", telle qu'elle est utilisée dans le présent document et dans les revendications, doit être comprise comme signifiant 'Tun ou l'autre ou les deux" des éléments ainsi
conjoints, c'est-à-dire des éléments qui sont présents de manière conjonctive dans certains cas et de manière disjonctive dans d'autres cas. Les éléments multiples énumérés avec "et/ou" doivent être interprétés de la même manière, c'est-à-dire "un ou plusieurs" des éléments ainsi conjoints. D'autres éléments peuvent éventuellement être présents, autres que les éléments spécifiquement identifiés par la clause "et/ou", qu'ils soient liés ou non à ces éléments spécifiquement identifiés. Ainsi, à titre d'exemple non limitatif, une référence à "A et/ou B", lorsqu'elle est utilisée conjointement avec un langage ouvert tel que "comprenant" peut se référer, dans un mode de réalisation, à A seulement (incluant éventuellement des éléments autres que B) ; dans un autre mode de réalisation, à B seulement (incluant éventuellement des éléments autres que A) ; dans un autre mode de réalisation encore, à A et B (incluant éventuellement d'autres éléments) ; etc.
Tel qu'utilisé ici dans la description et dans les revendications, "ou" doit être compris de manière inclusive.
Telle qu'elle est utilisée dans la présente description et dans les revendications, l'expression "au moins un", en référence à une liste d'un ou de plusieurs éléments, doit être comprise comme signifiant au moins un élément choisi parmi un ou plusieurs éléments de la liste d'éléments, mais n'incluant pas nécessairement au moins un de chaque élément spécifiquement énuméré dans la liste d'éléments et n'excluant pas toute combinaison d'éléments dans la liste d'éléments. Cette définition permet également la présence facultative d'éléments autres que les éléments spécifiquement identifiés dans la liste des éléments auxquels l'expression "au moins un" fait référence, qu'ils soient liés ou non à ces éléments spécifiquement identifiés. Ainsi, à titre d'exemple non limitatif, "au moins l'un de A et B" (ou, de manière équivalente, "au moins l'un de A ou B", ou, de manière équivalente, "au moins l'un de A et/ou B") peut se référer, dans un mode de réalisation, à au moins un, incluant éventuellement plus d'un, A, sans B présent (et incluant éventuellement des éléments autres que B) ; dans un autre mode de réalisation, à au moins un, comprenant éventuellement plus d'un, B, sans A présent (et comprenant éventuellement des éléments autres que A) ; dans encore un autre mode de réalisation, à au moins un, comprenant éventuellement plus d'un, A, et au moins un, comprenant éventuellement plus d'un, B (et comprenant éventuellement d'autres éléments) ; etc.
Dans les revendications, ainsi que dans la description ci-dessous, toutes les expressions transitoires telles que "comprenant", "incluant", "portant", "ayant", "contenant", "impliquant", "tenant", "composé de", et autres, doivent être comprises comme étant ouvertes, c'est-à-dire comme signifiant incluant mais non limité à. Seules les expressions transitoires "consistant en" et "consistant essentiellement en" doivent être comprises comme des expressions transitoires fermées ou semi-fermées, respectivement.
On note que les termes « dispositif de calcul » désignent tout ensemble électronique susceptible d’exécuter des instructions représentatives d’une étape d’un algorithme ou du procédé objet de la présente invention. Un tel dispositif de calcul est exemplifié en regard de la figure 2.
On note que les termes « moyens de saisie » désignent tout moyen d’interaction depuis un système ou utilisateur externe et un dispositif de calcul. Un tel moyen de saisie peut correspondre, par exemple, à une API (pour « Application Programing Interface », traduit par interface de programmation applicative) ou à une interface homme-machine (telle un clavier et/ou une souris) pouvant être associée à une interface graphique utilisateur (traduit de « graphie user interface », ou « GUI »).
On note que les termes « interfaces informatiques » désignent tout moyen d’interaction depuis un dispositif de calcul vers un système ou utilisateur externe. Une telle interface informatique peut correspondre, par exemple, à une API ou à une interface homme-machine (telle un écran) pouvant être associée à une interface graphique utilisateur.
On note que les termes « base de données de documents » désignent toute base de données ou mémoire informatique, structurée ou non, permettant l’exécution d’une requête de recherche de documents (ou d’identifiants de document) et l’extraction de tels documents.
On note que les termes « système expert » désignent tout programme informatique conçu pour simuler l'expertise et la prise de décision d'un spécialiste humain. Ces systèmes sont une application spécifique de l'intelligence artificielle et se fondent principalement sur des connaissances spécifiques à un domaine pour résoudre des problèmes complexes à un niveau comparable à celui d'un expert humain.
On note que le terme « bibliométrie » désigne une discipline technique qui s'attache à l'analyse quantitative de la littérature scientifique et technique. La bibliométrie utilise des méthodes statistiques et mathématiques pour évaluer et quantifier la production et la dissémination de documents de recherche, tels que des articles de journaux, des livres, et des brevets.
Les documents enregistrés dans la base de données de documents comportent, pour au moins une partie des documents, des métadonnées bibliographiques telles :
- au moins un numéro de publication,
- au moins un auteur,
- au moins un titre,
- au moins un abrégé, et/ou
- au moins un identifiant de document cité.
On note que les termes « documents » et « fichiers » sont interchangeables et qu’ils désignent tous deux des contenus stockés dans une mémoire informatique comportant au moins un élément parmi du texte, une image, une vidéo ou un son et au moins une référence à un autre document ou à au moins un autre fichier stocké dans la mémoire informatique. Une telle référence peut correspondre à une adresse ou à une référence unitaire bijective.
On appelle « identifiant » toute représentation numérique bijective d’un objet, tel un document par exemple. Un identifiant de document correspond, par exemple, à un numéro de
publication du document ou à une chaine de caractères représentative, par exemple, au moins des auteurs et de l’année de publication.
On appelle « partitionnement » ou « clustering » le résultat de toute classification automatique.
On appelle « indice de communalité » une mesure de l’intensité relative de connectivité d’un membre d’une partition avec tous les autres membres de la même partition.
Cet indice de communalité correspond à l’intensité avec laquelle chaque référence citée ou chaque document citant contribue à l'unité de sens de son cluster d'appartenance.
L’indice de communalité mis en œuvre au cours de l’étape 120 de formation mesure l'intensité relative avec laquelle chaque référence d'une partition est co-citée avec toutes les autres références classées dans la même partition.
L’indice de communalité mis en œuvre au cours de l’étape 160 de formation mesure l'intensité relative avec laquelle chaque document d'une partition partage des références citées dans sa bibliographie avec tous les autres documents classés dans la même partition.
De tels indices de communalité représentent une approche radicalement différente des approches contemporaines, basées sur les distances ou les liens entre documents.
De tels indices permettent, à un niveau cognitif, aux utilisateurs de mieux appréhender et absorber l’information que lors de la mise en œuvre des approches contemporaines.
A cet égard, la présente invention met en œuvre une logique de quantification de la pensée et des cheminements cérébraux, au sens des sciences cognitives, contribuant à une amélioration de l’activité cérébrale d’utilisateurs qui la mettent en œuvre, cette amélioration se traduisant par une meilleure mémorisation et compréhension de l’information contenue dans un corpus de documents issu d’une recherche par mots-clés.
On observe, sur la figure 1 , qui n’est pas à l’échelle, une vue schématique d’un mode de réalisation du procédé 100 objet de la présente invention. Ce procédé 100 automatisé de collecte, de classification et de hiérarchisation d’un corpus de documents relationnels en deux groupements hiérarchisés complémentaires comporte :
- une étape 105 de définition, par un dispositif de calcul, d’une requête informatique,
- une étape 110 d’extraction, par un dispositif de calcul et depuis une base de données informatiques, d’un corpus représenté par au moins un identifiant représentatif d’un document, dit « document citant » et d’au moins un jeu de métadonnées associées à au moins un dit identifiant de document citant, au moins une dite métadonnée étant représentative d’un identifiant d’un autre document, dit « document cité »,
- une étape 111 de formation, par un dispositif de calcul, d’un premier ensemble d’identifiants de documents cités et d’un deuxième ensemble d’identifiants de documents citant correspondant au corpus extrait,
- une étape 115 de nettoyage, par un dispositif de calcul, d’au moins un identifiant d’un même document cité dans le premier ensemble, par la mise en œuvre d’un algorithme de correspondance de chaînes de caractères, pour harmoniser les identifiants d’un même document cité,
- une étape 116 d’harmonisation, par un dispositif de calcul, d’identifiants de documents cités dans le deuxième ensemble en fonction du résultat de l’étape 115 de nettoyage, puis, de manière concomitante :
- une étape 120 de formation, par un dispositif de calcul, d’un premier groupement partitionné d’identifiants de documents cités classifiés et hiérarchisés, comportant :
- une étape 125 d’initialisation d’une première valeurseuil, par un dispositif de calcul, représentative d’un niveau de pertinence minimal d’un document cité associé à la requête informatique définie,
- une étape 130 d’ajustement automatique de la première valeur seuil, par un dispositif de calcul, en fonction de caractéristiques numériques représentatives du corpus extrait,
- une étape 135 de filtration, par un dispositif de calcul, du premier ensemble en fonction de la première valeur seuil ajustée,
- une étape 140 de détermination, par un dispositif de calcul, d’un indice de cocitation pour au moins une paire d’identifiants de documents cités du premier ensemble, filtré, en fonction d’un nombre de co-référencements de ladite paire d’identifiants de documents cités dans le deuxième ensemble,
- une étape 141 de réduction du premier ensemble filtré,
- une étape 145 de partitionnement, par un dispositif de calcul, du premier ensemble en fonction d’au moins un indice de co-citation déterminé,
- une étape 150 de détermination, par un dispositif de calcul, d’au moins un indice de communalité pour au moins un identifiant de document cité du premier ensemble partitionné et
- une étape 155 de hiérarchisation, par un dispositif de calcul, d’identifiants de documents cités du premier ensemble partitionné, pour former le premier groupement,
- une étape 160 de formation, par un dispositif de calcul, d’un deuxième groupement partitionné d’identifiants de documents citant, classifiés et hiérarchisés, comportant :
- une étape 165 d’initialisation d’une deuxième valeur seuil, par un dispositif de calcul, représentative d’un niveau de pertinence minimal d’un document citant associé à la requête informatique définie,
- une étape 170 d’ajustement dynamique de la deuxième valeur seuil, par un dispositif de calcul, en fonction de caractéristiques numériques représentatives du corpus extrait,
- une étape 175 de filtration, par un dispositif de calcul, du deuxième ensemble en fonction de la deuxième valeur seuil ajustée,
- une étape 180 de détermination, par un dispositif de calcul, d’un indice de documentés cités en commun représentatif d’un nombre de documents cités en commun pour au moins une paire d’identifiants de documents citant du deuxième ensemble filtré,
- une étape 181 de réduction du deuxième ensemble filtré,
- une étape 185 de partitionnement, par un dispositif de calcul, du deuxième ensemble réduit en fonction d’au moins un indice de documents cités en commun déterminé,
- une étape 190 de détermination, par un dispositif de calcul, d’au moins un indice de communalité pour au moins un identifiant de document citant du deuxième ensemble partitionné et
- une étape 195 de hiérarchisation, par un dispositif de calcul, d’identifiant de documents citant du deuxième ensemble, pour former le deuxième groupement et
- une étape 200 de fourniture, sur une interface numérique, du premier et du deuxième groupement hiérarchisés.
Au cours de l’étape 105 de définition, un moyen de saisie peut être mis en œuvre pour formuler une requête constituée d’expressions booléennes et/ou de mots-clés à rechercher dans une base de données de documents. Une telle requête peut être formulée, par exemple, à l’aide d’un clavier interagissant avec un champ de saisie d’une interface graphique, une validation de la requête ainsi saisie entraînant l’exécution de la recherche dans la base de données de documents. Une telle étape 105 de définition est réalisée, par exemple, sur un ordinateur personnel relié, par un moyen de communication (tel Internet, par exemple) à un serveur informatique responsable de l’exécution de requêtes de recherche dans la base de données de documents. Une telle étape 105 de définition peut être réalisée dans un client lourd d’un programme informatique organisé selon une architecture client-serveur.
En amont de l’étape 105 de définition, de l’étape 110 d’extraction ou de l’étape 111 de formation, le procédé 100 objet de la présente invention peut comporter une étape 101 de sélection d’un indicateur numérique représentatif d’une discipline scientifique. Une telle discipline correspond, par exemple, à la médecine, à l’ingénierie, au droit ou au management par exemple.
La sélection d’un tel indicateur numérique représentatif d’une discipline scientifique peut avoir pour effet au moins l’un des effets suivants :
le corpus de documents mis en œuvre au cours de l’étape 110 d’extraction est sélectionné en fonction de l’indicateur numérique représentatif d’une discipline scientifique et/ou le grand modèle de langage entraîné mis en œuvre au cours de l’étape 725 de fourniture, tel que représenté en regard de la figure 7, est sélectionné pour correspondre à un grand modèle de langage entraîné associé au dit indicateur numérique représentatif d’une discipline scientifique.
Au cours de l’étape 110 d’extraction, la requête définie est exécutée par un dispositif de calcul interagissant avec une base de données de documents. Une telle étape 110 d’extraction est ordinaire dans le domaine des moteurs de recherche et n’est pas rappelée ici.
À l’issue de cette étape 110 d’extraction, un corpus documentaire est obtenu. Un tel corpus documentaire est formé d’au moins un identifiant de document citant associé à au moins un jeu de métadonnées, au moins un tel jeu de métadonnées comportant au moins un identifiant de document cité par le document citant associé au jeu de métadonnées. Un tel corpus peut comporter les documents citant et/ou cités ou seulement des identifiants de documents citant et/ou cités, ainsi que des métadonnées associées à ces documents citant, de telles métadonnées pouvant inclure un lien représentatif d’une adresse sur un réseau informatique dudit document.
Par exemple, un identifiant de document « A » peut être associé à un jeu de métadonnées comportant, en guise d’identifiant de document cité, un identifiant de document « B ». On dit alors que A cite B, c’est-à-dire que B est un document cité pour A et que A est un document citant pour B. Les termes « document cité » et « référence citée » sont, à toutes fins utiles, interchangeables.
Au cours de l’étape 111 de formation, par exemple, un traitement informatique est réalisé pour collecter au moins un identifiant de document cité dans au moins un jeu de métadonnées associées à au moins un identifiant de document citant du corpus extrait. Préférentiellement, chaque identifiant de document cité du jeu de métadonnées associé à chaque document citant est collecté.
Cette liste d’identifiants de documents cités forme le premier ensemble.
Au cours de l’étape 111 de formation, par exemple, un traitement informatique est réalisé pour collecter au moins un identifiant de document citant du corpus extrait.
Cette liste d’identifiants de documents citant forme le deuxième ensemble. Alternativement, aucune collecte n’est réalisée, le deuxième ensemble étant formé à partir du résultat de l’étape 110 d’extraction.
Au cours de l’étape 115 de nettoyage, un algorithme de traitement de texte peut par exemple être mis en œuvre. Un tel algorithme peut avoir pour finalité de retirer des caractères inutiles d’identifiants de documents, ou de réorganisation d’éléments d’une chaine de caractères représentative d’un identifiant de document, en vue du rapprochement de telles chaines de documents. Par rapprochement, on entend ici la mise en œuvre d’un algorithme de correspondance de chaînes de caractères, configuré pour produire un indice de proximité entre plusieurs chaines de caractères. Un tel algorithme permet, lorsqu’un indice de proximité est
supérieur à une valeur seuil déterminée, de déterminer que deux chaines de caractères distinctes sont représentatives d’un même document cité. Ceci permet, notamment, de constituer des tables de correspondance entre chaines de caractères considérées comme synonymes voire de procéder au remplacement d’une chaine de caractère par une autre.
En amont de l’étape 115 de nettoyage, le procédé 100 peut comporter une étape de prénettoyage configurée pour retirer du corpus extrait les occurrences surnuméraires d’identifiants d’un même document cité. Au cours de cette étape de pré-nettoyage, les erreurs de saisie sont corrigées, notamment par élimination des caractères d’espacement excédentaires, des caractères spéciaux, des caractères inutiles ou redondants par exemple.
Au cours de l’étape 116 d’harmonisation, par exemple, un traitement informatique est réalisé afin de corriger, dans le deuxième ensemble, les identifiants de documents cités erronés, c’est-à-dire les identifiants de documents cités représentant incorrectement ces documents cités.
Au cours d’une telle étape 116 d’harmonisation, un identifiant de document cité associé à un identifiant de document citant peut être remplacé par un identifiant de document cité identifié, au cours de l’étape 115, comme correct (ou majoritaire).
Dans des variantes, un identifiant de document cité ad-hoc est défini pour une pluralité de chaines de caractères considérées comme proches et mis en œuvre pour remplacer chaque itération des chaines de caractères appartenant à cette pluralité.
Dans des variantes, un identifiant d’une entrée dans une table de correspondance est défini pour une pluralité de chaines de caractères considérées comme proches et mis en œuvre pour remplacer chaque itération des chaines de caractères appartenant à cette pluralité.
Une fois les premier et deuxième ensembles nettoyés, deux étapes sont réalisées de manière concomitante, ou parallèles :
- l’étape 120 de formation d’un premier groupement partitionné d’identifiants de documents cités classifiés et hiérarchisés et
- l’étape 160 de formation d’un deuxième groupement partitionné d’identifiants de documents citant classifiés et hiérarchisés.
Au cours de l’étape 120 de formation d’un premier groupement partitionné d’identifiants de documents cités classifiés et hiérarchisés, l’objectif est de hiérarchiser les méthodologies et fondements théoriques liés au sujet de la requête et donc au corpus extrait.
Au cours de l’étape 125 d’initialisation, une première valeur seuil est fixée, soit automatiquement en fonction d’une instruction d’initialisation par défaut, soit par un utilisateur via une interface homme-machine, soit par un programme informatique tiers via une API par exemple.
Cette étape 125 d’initialisation peut comporter, de manière optionnelle, une étape 225 de définition par un dispositif de calcul, d’une valeur par défaut pour au moins un critère parmi :
- un pourcentage minimal du nombre d’identifiants de documents citant du corpus extrait à retenir,
- un nombre minimal d’identifiants de documents cités,
- un nombre maximal d’identifiants de documents cités et/ou
- un nombre total d’identifiants de documents cités associés à un nombre de documents citant, ledit nombre étant supérieur ou égal à une valeur seuil déterminée, au moins un dit critère étant mis en œuvre au cours de l’étape 130 d’ajustement et/ou l’étape 135 de filtration de l’étape 120 de formation du premier groupement.
Les valeurs particulières pour ces critères dépendent du cas d’usage particulier d’implémentation.
Au cours de l’étape 130 d’ajustement automatique, la première valeur seuil est ajustée de sorte à fournir un échantillon du corpus extrait, correspondant au premier ensemble, suffisant pour permettre une mise en œuvre efficace de l’étape 140 de détermination d’un indice de co-citation.
Par exemple, cette étape 130 d’ajustement automatique est configurée pour modifier la valeur du pourcentage minimal du nombre d’identifiants de documents à retenir si aucun résultat ne valide une règle associée à au moins un critère mis en œuvre au cours de l’étape 125 d’initialisation.
Par exemple, au moins une des règles suivantes peut être mise en œuvre :
- le nombre total de documents doit être supérieur au pourcentage minimal du nombre d’identifiants de documents du corpus extrait à retenir multiplié par le nombre de documents du corpus extrait,
- le nombre de documents doit être supérieur au nombre minimal de documents défini et/ou
- le nombre de documents cités doit être supérieur au nombre total d’identifiants de documents associés à un nombre de documents cités supérieur ou égal à une valeur seuil déterminée.
Si aucune telle règle ne peut être appliquée, la valeur de pourcentage minimal du nombre d’identifiants de documents est réduite et ce de manière incrémentale, jusqu’à ce que l’ensemble des règles puisse être appliqué.
L’étape 130 d’ajustement automatique peut également ne pas avoir lieu si les caractéristiques du premier groupement le permettent.
De manière optionnelle, le procédé 100 objet de la présente invention peut comporter une étape (non représentée) de réajustement de la première valeur seuil initialisée ou ajustée. Une telle étape de réajustement peut mettre en œuvre une interface graphique de saisie associée à un moyen de saisie permettant à un utilisateur de réajuster manuellement la première valeur seuil.
La première valeur seuil ajustée est mise en œuvre au cours de l’étape 135 de filtration, réalisée par exemple par la sélection d’un nombre de documents correspondant au nombre total de documents obtenu à l’issue de l’étape 110 d’extraction, à partir de l’identifiant de document associé au plus grand nombre d’identifiants de documents cités, et ce de manière décroissante en
fonction du nombre d’identifiants de documents cités, et ce jusqu’à ce que le nombre total de documents soit atteint.
Au cours de l’étape 140 de détermination, une matrice associant chaque paire d’identifiants de documents cités est formée et remplie en fonction du nombre de fois que cette paire d’identifiants de documents cités est identifiée dans les métadonnées associées aux documents citant. Cette étape 140 de détermination est donc réalisée par comptage. Un tel algorithme correspond à une analyse de co-citations de références citées, ou « RCCA » (pour « Reference Co-Citation Analysis »).
En aval de l’étape 140 de détermination, une étape (non représentée) de normalisation des résultats obtenus peut être réalisée. Cette étape 140 de détermination peut être réalisée au cours de l’étape 145 de partitionnement.
L’étape 141 de réduction réduit, par exemple, la matrice de co-citation de références obtenue à l’étape 140 sur l’ensemble des références citées en une sous-matrice dont les lignes et les colonnes sont composées des références identifiées dans l’étape 130 d’ajustement automatique.
Au cours de l’étape 145 de partitionnement, des partitions d’identifiants de documents cités sont formées et correspondent à des thématiques principales dans le premier groupement. Tout algorithme de partitionnement (« clustering ») ou de classification peut être mis en œuvre au cours de cette étape 145 de partitionnement. Un tel algorithme peut correspondre, par exemple, à un algorithme k-means, de fuzzy partitioning, de partitioning pyramidal ou de classification hiérarchique.
Au cours de l’étape 150 de détermination d’au moins un indice de communalité, l’équation suivante peut être mise en œuvre, par exemple et à titre non limitatif :
Dans laquelle :
- nk correspond au nombre d’identifiants de documents cités dans la partition k,
- Hk(Ri)k correspond à l’indice de communalité d’un identifiant de document cité dans la partition k,
- Ck(Rj) correspond à la connectivité de l’identifiant de document cité Rj dans la partition k, c’est-à-dire au nombre d’identifiants de documents cités dans la partition k avec laquelle l’identifiant de document cité Rj est connecté et
- Sk(Rj) correspond à la force de connectivité de l’identifiant de document cité Rj dans la partition k, c’est-à-dire à la moyenne du nombre d’identifiants de documents cités dans la partition k avec laquelle l’identifiant de document cité Rj est connecté.
La moyenne du nombre d’identifiants cités peut être déterminée par l’équation suivante, par exemple et à titre non limitatif :
Dans laquelle :
- nk correspond au nombre d’identifiants de documents cités dans la partition k,
- Sk(Rj) correspond à la force de connectivité de l’identifiant de document cité Rj dans la partition k et
- ay correspond au nombre de co-citations des identifiants de documents cités Rj et Rj par des documents du corpus.
Au cours de l’étape 155 de hiérarchisation, les documents cités formant le premier groupement sont classés entre eux de manière globale (c’est-à-dire sans prendre en compte les partitions) et/ou au sein d’un partition donné. Dit autrement, cette étape 155 de hiérarchisation peut être réalisée en fonction d’un score associé à chaque identifiant de document cité, un tel score étant représentatif de l’importance du document cité dans le premier groupement.
Le résultat de l’étape 155 de hiérarchisation est mis en œuvre au cours de l’étape 200 de fourniture décrite ci-après.
Au cours de l’étape 165 d’initialisation, une deuxième valeur seuil est initialisée manuellement ou automatiquement, de manière similaire à l’étape 125 d’initialisation.
Dans des modes de réalisation, l’étape 165 d’initialisation de l’étape 160 de formation du deuxième ensemble réduit comporte une étape 230 de définition, par un dispositif de calcul, d’une valeur par défaut pour au moins un critère parmi :
- une date de publication du document citant,
- un nombre normalisé de citation du document citant,
- un nombre minimal d’identifiants de documents citant,
- un nombre maximal d’identifiants de documents citant et/ou
- un nombre total d’identifiants de documents citant, ledit nombre étant supérieur ou égal à une valeur seuil déterminée et inférieure ou égale à une valeur plafond déterminée, au moins un dit critère étant mis en œuvre au cours de l’étape 170 d’ajustement et/ou l’étape 175 de filtration de l’étape de formation du deuxième ensemble réduit.
Ces modes de réalisation permettent de réaliser une filtration optimale des résultats au sein du deuxième ensemble réduit, au regard des traitements réalisés au cours de l’étape de formation du deuxième ensemble réduit.
Dans des modes de réalisations, l’étape d’ajustement 170 de l’étape 160 de formation du deuxième ensemble réduit est configurée pour :
- conserver dans l’analyse uniquement les documents citant publiés après une date déterminée,
- augmenter la valeur de citation normalisée minimale requise pour réduire le nombre de documents citant à retenir si le nombre total d’identifiants de documents citant conservés dépasse un nombre maximal de documents à conserver, et
- réduire la valeur de citation normalisée minimale requise pour réduire le nombre de documents citant à retenir si le nombre total d’identifiants de documents citant conservés est inférieur au nombre minimal de documents à conserver.
Dans des modes de réalisations particuliers, , l’étape d’ajustement 170 de l’étape 160 de formation du deuxième ensemble réduit est configurée pour :
- considérer dans l’analyse uniquement les documents citant publiés après une date déterminée qui est fixée par défaut comme A - 5 où A est l’année d’utilisation de la solution par l’utilisateur et,
- augmenter la valeur de citation normalisée minimale requise pour réduire le nombre de documents citant à retenir si le nombre total d’identifiants de documents citant conservés par l’application du premier critère dépasse le nombre plafond de documents à conserver, l’augmentation de la valeur maximale n’ayant pas de limite, et
- réduire la valeur de citation normalisée minimale requise pour réduire le nombre de documents citant à retenir si le nombre total d’identifiants de documents citant conservés par l’application du premier critère est inférieure au nombre plancher de documents à conserver, la valeur minimale ne pouvant pas descendre en dessous de zéro.
Ces modes de réalisation permettent de réaliser un filtrage dynamique des résultats obtenus en fonction de caractéristiques propres au deuxième ensemble réduit extrait.
L’étape 230 de définition est réalisée manuellement ou automatiquement, de manière similaire à l’étape 225 de définition.
L’étape 170 d’ajustement dynamique est réalisée de manière similaire à l’étape 130 d’ajustement, par exemple.
Dans des modes de réalisation particuliers, l’étape 170 d’ajustement de l’étape 160 de formation du deuxième groupement est configurée pour :
- réduire la valeur dynamique si le nombre total d’identifiants de documents associés à un nombre normalisé de documents cités est inférieur au nombre minimal d’identifiants de documents et
- augmenter la valeur dynamique si le nombre total d’identifiants de documents associés à un nombre normalisé de documents cités est supérieur au nombre maximal d’identifiants de documents.
De manière optionnelle, le procédé 100 objet de la présente invention peut comporter une étape (non représentée) de réajustement de la deuxième valeur seuil initialisée ou ajustée. Une telle étape de réajustement peut mettre en œuvre une interface graphique de saisie associée à un moyen de saisie permettant à un utilisateur de réajuster manuellement la deuxième valeur seuil.
L’étape 175 de filtration est réalisée, par exemple, de manière similaire à l’étape 135 de filtration, en fonction de la deuxième valeur seuil ajustée au cours de l’étape 170 d’ajustement ou non.
À l’issue de cette étape 175 de filtration, un deuxième ensemble filtré est obtenu.
L’étape 180 de détermination est réalisée, par exemple, par l’établissement d’une matrice représentative de chaque paire d’identifiants de documents citant dans le deuxième ensemble et par le compte, pour chaque paire d’identifiants de documents citant, du nombre d’identifiants de documents cités en commun. Un tel algorithme correspond à une analyse de couplage bibliographique de documents citant, ou « DBCA » (pour « Document Bibliographie Coupling Analysis »).
L’étape 181 de réduction réduit, par exemple, la matrice de couplage bibliographique de documents obtenue à l’étape 180 sur l’ensemble des documents citant en une sous-matrice dont les lignes et les colonnes sont composées des documents citant identifiés dans l’étape 170 d’ajustement automatique.
L’étape 185 de partitionnement est réalisée, par exemple, par la mise en œuvre d’un algorithme de partitioning ou de classification adapté. Un tel algorithme peut correspondre, par exemple, à un algorithme k-means, de fuzzy partitioning, de partitioning pyramidal ou de classification hiérarchique.
L’étape 190 de détermination d’au moins un indice de communalité est réalisé, par exemple, en mettant en œuvre l’équation suivante :
Dans laquelle :
- nk correspond au nombre d’identifiants de documents cités dans la partition k,
- Hk(Dj) correspond à l’indice de communalité d’un identifiant de document dans un partition k,
- Ck(Dj) correspond à la connectivité de l’identifiant de document Dj dans la partition k, c’est- à-dire au nombre d’identifiants de documents dans la partition k avec laquelle l’identifiant de document cité Dj est connecté et
- Sk(Dj) correspond à la force de connectivité de l’identifiant de document Dj dans la partition k, c’est-à-dire à la moyenne du nombre d’identifiants de documents dans la partition k avec laquelle l’identifiant de document cité Dj est connecté.
La force de connectivité de l’identifiant de document Dj dans la partition k peut être déterminée par la mise en œuvre de l’équation suivante :
Dans laquelle :
- rik correspond au nombre d’identifiants de documents cités dans la partition k,
- Ck(Dj) correspond à la force de connectivité de l’identifiant de document Dj dans la partition k et
- R correspond au nombre d’identifiants de documents cités partagés par les identifiants de documents Dj et Dj.
L’étape 195 de hiérarchisation est réalisée, par exemple, de manière similaire à l’étape 155 de hiérarchisation.
Le deuxième groupement hiérarchisé est mis en œuvre au cours de l’étape 200 de fourniture.
L’étape 200 de fourniture est réalisée, par exemple, par la mise en œuvre d’une interface graphique utilisateur adaptée à l’affichage des premier et deuxième groupement hiérarchisés.
Deux résultats de cette étape 200 de fourniture sont visibles en figures 3 à 5 :
- on observe, en figure 3, une représentation graphique de partitions, 401 et 402, du premier ensemble, chaque partition, 401 et 402, étant associée à des documents cités, 403 et 404, chaque document cité étant associé à une mise en exergue particulière, représentative de l’importance du document cité dans le premier ensemble (taille du cercle) et/ou dans la partition (intensité du coloris du lien) et
- on observe, en figure 4, une représentation graphique de partitions, 501 et 502, du premier ensemble, chaque partition, 501 et 502, étant associée à des documents citant, 503 et 504, chaque document citant étant associé à une mise en exergue particulière, représentative de l’importance du document citant dans le deuxième ensemble (taille du cercle) et/ou dans la partition (intensité du coloris du cercle).
On observe, en figure 5, une succession d’états de traitements d’un corpus 600 extrait initial, parmi lesquels :
- trois documents citant, 605, 610 et 615 sont associés à des documents cités, 605’, 610’ et 615’, dans le corpus 600 extrait,
- plusieurs documents cités, 605’, 610’ et 615’, sont associés à un document citant, 605, 610 et 615,
- si deux ou plus documents cités sont identiques (par exemple ceux marqués par un carré noir en haut à gauche), seul un tel document cité est retenu pour éviter les doublons et
- si deux ou plus documents cités sont différents mais représentatifs d’un même contenu (par exemple celui marqué par un carré hachuré), ce qui se traduit par une légère différence dans les chaines de caractères identifiant ces documents, un des deux ou plus document est corrigé pour correspondre à une chaine de caractère unique.
Il résulte de ces opérations la constitution du premier ensemble nettoyé, dont le résultat est utilisé pour obtenir le deuxième ensemble harmonisé, dans lequel les documents citant, 605”, 610”
et 615”, sont associés à des documents cités corrigés évitant les risques de doublons et de confusion quant à l’unicité de ces documents cités.
On observe, en figure 2, schématiquement, un mode de réalisation particulier d’un dispositif 300 ou système informatique capable de mettre en œuvre le procédé 100 objet de la présente invention. Ce dispositif 300 automatisé de collecte, de classification et de hiérarchisation d’un corpus de documents relationnels en deux groupements hiérarchisés complémentaires, comporte une mémoire 325 informatique, stockant des instructions informatiques, et un dispositif 310 de calcul, qui, lorsque ce dispositif de calcul exécute les instructions stockées dans la mémoire informatique, exécute les étapes suivantes :
- une étape de définition, par un dispositif de calcul, d’une requête informatique,
- une étape d’extraction, par un dispositif de calcul et depuis une base de données informatiques, d’un corpus représenté par au moins un identifiant représentatif d’un document, dit « document citant » et d’au moins un jeu de métadonnées associées à au moins un dit identifiant de document citant, au moins une dite métadonnée étant représentative d’un identifiant d’un autre document, dit « document cité »,
- une étape de formation, par un dispositif de calcul, d’un premier ensemble d’ identifiants de documents cités et d’un deuxième ensemble d’identifiants de documents citant correspondant au corpus extrait,
- une étape de nettoyage, par un dispositif de calcul, d’au moins un identifiant d’un même document cité dans le premier ensemble, par la mise en œuvre d’un algorithme de correspondance de chaînes de caractères, pour harmoniser les identifiants d’un même document cité,
- une étape d’harmonisation, par un dispositif de calcul, d’identifiants de documents cités dans le deuxième ensemble en fonction du résultat de l’étape de nettoyage, puis, de manière concomitante :
- une étape de formation, par un dispositif de calcul, d’un premier groupement partitionné d’identifiants de documents cités classifiés et hiérarchisés, comportant :
- une étape d’initialisation d’une première valeur seuil, par un dispositif de calcul, représentative d’un niveau de pertinence minimal d’un document cité associé à la requête informatique définie,
- une étape d’ajustement automatique de la première valeur seuil, par un dispositif de calcul, en fonction de caractéristiques numériques représentatives du corpus extrait,
- une étape de filtration, par un dispositif de calcul, du premier ensemble en fonction de la première valeur seuil ajustée,
- une étape de détermination, par un dispositif de calcul, d’un indice de co-citation pour au moins une paire d’identifiants de documents cités du premier ensemble,
filtré, en fonction d’un nombre de co- référencements de ladite paire d’identifiants de documents cités dans le deuxième ensemble,
- une étape de réduction de la matrice de co-citation de références ajustée en fonction des identifiants de références citées composant le premier ensemble filtré,
- une étape de partitionnement, par un dispositif de calcul, du premier ensemble en fonction d’au moins un indice de co-citation déterminé,
- une étape de détermination, par un dispositif de calcul, d’au moins un indice de communalité pour au moins un identifiant de document cité du premier ensemble partitionné et
- une étape de hiérarchisation, parun dispositif de calcul, d’identifiants de documents cités du premier ensemble partitionné, pour former le premier groupement,
- une étape de formation, par un dispositif de calcul, d’un deuxième groupement partitionné d’identifiants de documents citant classifiés et hiérarchisés, comportant :
- une étape d’initialisation d’une deuxième valeur seuil, par un dispositif de calcul, représentative d’un niveau de pertinence minimal d’un document citant associé à la requête informatique définie,
- une étape d’ajustement dynamique de la deuxième valeur seuil, par un dispositif de calcul, en fonction de caractéristiques numériques représentatives du corpus extrait,
- une étape de filtration, par un dispositif de calcul, du deuxième ensemble en fonction de la deuxième valeur seuil ajustée,
- une étape de détermination, par un dispositif de calcul, d’un indice de documentés cités en commun représentatif d’un nombre de documents cités en commun pour au moins une paire d’identifiants de documents citant du deuxième ensemble filtré,
- une étape de réduction de la matrice de couplage bibliographique de documents ajustée en fonction des identifiants de documents composant le deuxième ensemble filtré,
- une étape de partitionnement, par un dispositif de calcul, du deuxième ensemble réduit en fonction d’au moins un indice de documents cités en commun déterminé,
- une étape de détermination, par un dispositif de calcul, d’au moins un indice de communalité pour au moins un identifiant de document citant du deuxième ensemble partitionné et
- une étape de hiérarchisation, par un dispositif de calcul, d’identifiant de documents citant du deuxième ensemble, pour former le deuxième groupement et
- une étape de fourniture, sur une interface numérique, du premier et du deuxième groupement hiérarchisés.
On observe, sur la figure 2, qui n’est pas à l’échelle, un schéma fonctionnel qui illustre un exemple de système informatique avec lequel un mode de réalisation d’un procédé objet de la présente invention peut être mis en œuvre. Dans l'exemple de la figure 2, un système informatique 305 et des instructions pour la mise en œuvre des technologies divulguées dans le matériel, le logiciel, ou une combinaison de matériel et de logiciel, sont représentés schématiquement, par exemple sous forme de boîtes et de cercles, au même niveau de détail qui est couramment utilisé par les personnes de compétence ordinaire dans l'art auquel cette divulgation se rapporte pour communiquer sur l'architecture des ordinateurs et les mises en œuvre des systèmes informatiques.
Le système informatique 305 comporte un sous-système d'entrée/sortie (dit « I/O », pour « Input/Output », traduit par Entrée/sortie en français) 320 qui peut comporter un bus et/ou un ou plusieurs autres mécanismes de communication pour communiquer des informations et/ou des instructions entre les composants du système informatique 305 sur des chemins de signaux électroniques. Le sous-système d'entrée/sortie 320 peut comporter un contrôleur d'entrée/sortie, un contrôleur de mémoire et au moins un port d'entrée/sortie. Les chemins de signaux électroniques sont représentés schématiquement dans les dessins, par exemple sous forme de lignes, de flèches unidirectionnelles ou de flèches bidirectionnelles.
Au moins un processeur 310, ou dispositif de calcul, est couplé au sous-système I/O 320 pour traiter les informations et les instructions. Le processeur 310 peut comporter, par exemple, un microprocesseur ou un microcontrôleur à usage général et/ou un microprocesseur à usage spécial tel qu'un système intégré ou une unité de traitement graphique (GPU) ou un processeur de signaux numériques ou un processeur ARM. Le processeur 310 peut comporter une unité arithmétique et logique (UAL) intégrée ou peut être couplé à une UAL séparée.
Le système informatique 305 comporter une ou plusieurs mémoire 325, telle qu'une mémoire principale, qui est couplée au sous-système I/O 320 pour stocker numériquement de manière électronique des données et des instructions à exécuter par le processeur 310. La mémoire 325 peut comporter une mémoire volatile telle que diverses formes de mémoire vive (RAM) ou tout autre dispositif de stockage dynamique. La mémoire 325 peut également être utilisée pour stocker des variables temporaires ou d'autres informations intermédiaires pendant l'exécution des instructions à exécuter par le processeur 310. De telles instructions, lorsqu'elles sont stockées dans un support de stockage lisible par ordinateur non transitoire accessible au processeur 310, peuvent transformer le système informatique 305 en une machine à usage spécial qui est personnalisée pour effectuer les opérations spécifiées dans les instructions.
Le système informatique 305 comporte, de plus, une mémoire non volatile telle qu'une mémoire morte (ROM) 330 ou un autre dispositif de stockage statique couplé au sous-système I/O 320 pour stocker des informations et des instructions pour le processeur 310. La ROM 330 peut comporter diverses formes de ROM programmable (PROM) telles que la PROM effaçable (EPROM) ou la PROM effaçable électriquement (EEPROM). Une unité de stockage persistant 315 peut comporter diverses formes de mémoire vive non volatile (NVRAM), telle qu'une mémoire
FLASH, ou un stockage à l'état solide, un disque magnétique ou un disque optique tel qu'un CD- ROM ou un DVD-ROM et peut être couplée au sous-système I/O 320 pour stocker des informations et des instructions. La mémoire 315 est un exemple de support lisible par ordinateur non transitoire qui peut être utilisé pour stocker des instructions et des données qui, lorsqu'elles sont exécutées par le processeur 310, provoquent l'exécution de méthodes mises en œuvre par ordinateur pour exécuter les techniques du présent document.
Les instructions dans la mémoire 325, la ROM 330 ou le stockage 315 peuvent comporter un ou plusieurs ensembles d'instructions qui sont organisés en modules, méthodes, objets, fonctions, routines ou appels. Les instructions peuvent être organisées comme un ou plusieurs programmes informatiques, services de système d'exploitation ou programmes d'application, y compris les applications mobiles. Les instructions peuvent comporter un système d'exploitation et/ou un logiciel système ; une ou plusieurs bibliothèques pour prendre en charge des fonctions multimédia, de programmation ou autres ; des instructions ou des piles de protocoles de données pour mettre en œuvre des protocoles de communication TCP/IP, HTTP ou autres ; des instructions de traitement de format de fichier pour analyser ou rendre des fichiers codés en utilisant HTML, XML, JPEG, MPEG ou PNG ; des instructions d'interface utilisateur pour rendre ou interpréter des commandes pour une interface utilisateur graphique (dite « GUI », pour « Graphie User interface », traduit par interface utilisateur graphique), une interface de ligne de commande ou une interface utilisateur textuelle ; un logiciel d'application tel qu'une suite bureautique, des applications d'accès à Internet, des applications de conception et de fabrication, des applications graphiques, des applications audio, des applications de génie logiciel, des applications éducatives, des jeux ou des applications diverses. Les instructions peuvent mettre en œuvre un serveur web, un serveur d'applications web ou un client web. Les instructions peuvent être organisées sous la forme d'une couche de présentation, d'une couche d'application et d'une couche de stockage de données telles qu'un système de base de données relationnelle utilisant un langage d'interrogation structuré (SQL) ou aucun SQL, un magasin d'objets, une base de données graphique, un système de fichiers plats ou tout autre stockage de données.
Le système informatique 305 peut être couplé via le sous-système I/O 320 à au moins un dispositif de sortie 335. Dans un mode de réalisation, le dispositif de sortie 335 est un écran d'ordinateur numérique. Des exemples d'affichage qui peuvent être utilisés dans divers modes de réalisation comprennent un écran tactile ou un affichage à diodes électroluminescentes (DEL) ou un affichage à cristaux liquides (LCD) ou un affichage sur papier électronique. Le système informatique 305 peut comporter un ou plusieurs autres types de dispositifs de sortie 335, en remplacement ou en plus d'un dispositif d'affichage. Des exemples d'autres dispositifs de sortie 335 comportent des imprimantes, des imprimantes de tickets, des traceurs, des projecteurs, des cartes son ou des cartes vidéo, des haut-parleurs, des buzzers ou des dispositifs piézoélectriques ou d'autres dispositifs audibles, des lampes ou des indicateurs LED ou LCD, des dispositifs haptiques, des actionneurs ou des servos.
Au moins un dispositif d'entrée 340 est couplé au sous-système I/O 320 pour communiquer des signaux, des données, des sélections de commandes ou des gestes au processeur 310. Des exemples de dispositifs d'entrée 340 comportent des écrans tactiles, des microphones, des caméras numériques fixes et vidéo, des touches alphanumériques et autres, des claviers, des tablettes graphiques, des scanners d'images, des joysticks, des horloges, des interrupteurs, des boutons, des cadrans, des glissières.
Un autre type de dispositif d'entrée est un dispositif de commande 345, qui peut effectuer une commande de curseur ou d'autres fonctions de commande automatisée telles que la navigation dans une interface graphique sur un écran d'affichage, alternativement ou en plus des fonctions d'entrée. Le dispositif de commande 345 peut être un pavé tactile, une souris, une boule de commande ou des touches de direction du curseur pour communiquer des informations de direction et des sélections de commande au processeur 310 et pour commander le mouvement du curseur sur l'écran 335. Le dispositif d'entrée peut avoir au moins deux degrés de liberté dans deux axes, un premier axe (par exemple, x) et un deuxième axe (par exemple, y), ce qui permet au dispositif de spécifier des positions dans un plan. Un autre type de dispositif d'entrée est un dispositif de commande filaire, sans fil ou optique, tel qu'un joystick, une baguette, une console, un volant, une pédale, un mécanisme de changement de vitesse ou tout autre type de dispositif de commande. Un dispositif d'entrée 340 peut inclure une combinaison de plusieurs dispositifs d'entrée différents, tels qu'une caméra vidéo et un capteur de profondeur.
Dans un autre mode de réalisation, le système informatique 305 peut comprendre un dispositif de l'internet des objets (dit « loT », pour « Internet of things ») dans lequel un ou plusieurs du dispositif de sortie 335, du dispositif d'entrée 340 et du dispositif de commande 345 sont omis. Ou, dans un tel mode de réalisation, le dispositif d'entrée 340 peut comporter une ou plusieurs caméras, des détecteurs de mouvement, des thermomètres, des microphones, des détecteurs sismiques, d'autres capteurs ou détecteurs, des dispositifs de mesure ou des codeurs et le dispositif de sortie 335 peut comprendre un affichage à usage spécial tel qu'un affichage LED ou LCD à ligne unique, un ou plusieurs indicateurs, un panneau d'affichage, un compteur, une vanne, un solénoïde, un actionneur ou un servomoteur.
Le dispositif de sortie 335 peut comporter du matériel, des logiciels, des microprogrammes et des interfaces pour générer des paquets de rapport de position, des notifications, des signaux d'impulsion ou de battement de cœur, ou d'autres transmissions de données récurrentes qui spécifient une position du système informatique 305, seul ou en combinaison avec d'autres données spécifiques à l'application, dirigées vers l'hôte 350 ou le serveur 355.
Le système informatique 305 peut mettre en œuvre les techniques décrites dans le présent document en utilisant une logique câblée personnalisée, au moins un ASIC (pour « Applicationspecific integrated circuit », traduit par « circuit intégré propre à une application ») ou un FPGA (pour « Field-programmable gate array », traduit par « réseau de portes programmables in situ), un microprogramme et/ou des instructions de programme ou une logique qui, lorsqu'ils sont
chargés et utilisés ou exécutés en combinaison avec le système informatique, provoquent ou programment le système informatique pour qu'il fonctionne comme une machine à usage spécifique. Selon un mode de réalisation, les techniques décrites ici sont exécutées par le système informatique 305 en réponse au processeur 310 qui exécute au moins une séquence d'au moins une instruction contenue dans la mémoire principale 325. Ces instructions peuvent être lues dans la mémoire principale 325 à partir d'un autre support de stockage, tel que la mémoire 315. L'exécution des séquences d'instructions contenues dans la mémoire principale 325 amène le processeur 310 à exécuter les étapes du processus décrites dans le présent document. Dans d'autres modes de réalisation, des circuits câblés peuvent être utilisés à la place ou en combinaison avec des instructions logicielles.
Le terme "support de stockage", tel qu'il est utilisé dans le présent document, désigne tout support non transitoire qui stocke des données et/ou des instructions permettant à une machine de fonctionner d'une manière spécifique. Ces supports de stockage peuvent comporter des supports non volatils et/ou des supports volatils. Les supports non volatils comprennent, par exemple, les disques optiques ou magnétiques, tels que la mémoire 315. Les supports volatils comportent la mémoire dynamique, telle que la mémoire 325. Les formes courantes de supports de stockage comportent, par exemple, un disque dur, un lecteur à semi-conducteurs, un lecteur flash, un support de stockage de données magnétique, tout support de stockage de données optique ou physique, une puce mémoire, etc.
Les supports de stockage sont distincts des supports de transmission, mais peuvent être utilisés conjointement avec eux. Les supports de transmission participent au transfert d'informations entre les supports de stockage. Par exemple, les supports de transmission comportent les câbles coaxiaux, les fils de cuivre et les fibres optiques, y compris les fils qui constituent un bus du sous-système I/O 320. Les supports de transmission peuvent également prendre la forme d'ondes acoustiques ou lumineuses, telles que celles générées pendant les communications de données par ondes radio et infrarouges.
Diverses formes de supports peuvent être impliquées dans le transport d'au moins une séquence d'au moins une instruction vers le processeur 310 pour exécution. Par exemple, les instructions peuvent initialement être transportées sur un disque magnétique ou un lecteur à semi- conducteurs d'un ordinateur distant. L'ordinateur distant peut charger les instructions dans sa mémoire dynamique et envoyer les instructions sur un lien de communication tel qu'un câble à fibre optique ou coaxial ou une ligne téléphonique en utilisant un modem. Un modem ou un routeur local au système informatique 305 peut recevoir les données sur la liaison de communication et convertir les données dans un format qui peut être lu par le système informatique 305. Par exemple, un récepteur tel qu'une antenne de radiofréquence ou un détecteur infrarouge peut recevoir les données transportées dans un signal sans fil ou optique et un circuit approprié peut fournir les données au sous-système I/O 320, par exemple en plaçant les données sur un bus. Le sous- système I/O 320 transporte les données vers la mémoire 325, à partir de laquelle le processeur
310 récupère et exécute les instructions. Les instructions reçues par la mémoire 325 peuvent éventuellement être stockées sur la mémoire 315 avant ou après l'exécution par le processeur 310.
Le système informatique 305 comporte également une interface de communication 360 couplée à un bus 320. L'interface de communication 360 fournit un couplage de communication de données bidirectionnel à la ou aux liaisons réseau 365 qui sont directement ou indirectement connectées à au moins un réseau de communication, tel qu'un réseau 370 ou un nuage public ou privé sur Internet. Par exemple, l'interface de communication 360 peut être une interface de réseau Ethernet, une carte de réseau numérique à intégration de services (RNIS), un modem câble, un modem satellite ou un modem pour fournir une connexion de communication de données à un type correspondant de ligne de communication, par exemple un câble Ethernet ou un câble métallique de tout type ou une ligne à fibre optique ou une ligne téléphonique. Le réseau 370 représente largement un réseau local (dit « LAN », pour « Local Area Network »), un réseau étendu (dit « WAN », pour « Wide Area Network »), un réseau de campus, un réseau Internet, ou toute combinaison de ceux-ci. L'interface de communication 360 peut comporter une carte LAN pour fournir une connexion de communication de données à un LAN compatible, ou une interface de radiotéléphone cellulaire qui est câblée pour envoyer ou recevoir des données cellulaires selon les normes de réseau sans fil de radiotéléphone cellulaire, ou une interface de radio satellite qui est câblée pour envoyer ou recevoir des données numériques selon les normes de réseau sans fil de satellite. Dans n'importe quelle mise en œuvre de ce type, l'interface de communication 360 envoie et reçoit des signaux électriques, électromagnétiques ou optiques sur des trajets de signaux qui transportent des flux de données numériques représentant divers types d'informations.
La liaison réseau 365 fournit typiquement une communication de données électrique, électromagnétique ou optique directement ou par l'intermédiaire d'au moins un réseau à d'autres dispositifs de données, en utilisant, par exemple, la technologie satellite, cellulaire, Wi-Fi ou BLUETOOTH. Par exemple, la liaison réseau 365 peut fournir une connexion à travers un réseau 370 à un ordinateur hôte 350.
En outre, la liaison réseau 365 peut fournir une connexion par l'intermédiaire du réseau 370 ou à d'autres dispositifs informatiques via des dispositifs d'interconnexion et/ou des ordinateurs qui sont exploités par un fournisseur de services Internet (ISP) 375. Le FAI 375 fournit des services de communication de données par l'intermédiaire d'un réseau mondial de communication de données par paquets représenté par Internet 380. Un ordinateur serveur 355 peut être couplé à Internet 380. Le serveur 355 représente largement tout ordinateur, centre de données, machine virtuelle ou instance informatique virtuelle avec ou sans hyperviseur, ou ordinateur exécutant un système de programme conteneurisé tel que DOCKER ou KUBERNETES. Le serveur 355 peut représenter un service numérique électronique qui est mis en œuvre à l'aide de plus d'un ordinateur ou d'une instance et auquel on accède et qu'on utilise en transmettant des demandes de services Web, des chaînes de localisateurs de ressources uniformes (dit « URL », pour« Uniform Resource Locator ») avec des paramètres dans des charges utiles HTTP (pour « Hypertext transfer
protocol », traduit par « protocole de transfert hypertexte », des appels d'API (pour « application programing interface », traduit par « interface de programmation applicative »), des appels de services d'applications ou d'autres appels de services. Le système informatique 305 et le serveur 355 peuvent former des éléments d'un système informatique distribué qui comprend d'autres ordinateurs, une partition de traitement, une ferme de serveurs ou une autre organisation d'ordinateurs qui coopèrent pour effectuer des tâches ou exécuter des applications ou des services. Le serveur 355 peut comporter un ou plusieurs ensembles d'instructions qui sont organisés sous forme de modules, de méthodes, d'objets, de fonctions, de routines ou d'appels. Les instructions peuvent être organisées comme un ou plusieurs programmes informatiques, services de système d'exploitation ou programmes d'application, y compris des applications mobiles. Les instructions peuvent comporter un système d'exploitation et/ou un logiciel système ; une ou plusieurs bibliothèques pour prendre en charge des fonctions multimédia, de programmation ou autres ; des instructions ou des piles de protocoles de données pour mettre en œuvre des protocoles de communication TCP/IP (pour « Transmission control protocol / Internet protocol », traduit par « protocole de contrôle de transmission / protocole internet »), HTTP ou autres ; des instructions de traitement de format de fichier pour analyser ou rendre des fichiers codés en utilisant HTML (pour « Hypertext markup language », traduit par « langage de balisage hypertexte »), XML (for « Extensible markup language », traduit par « langage de balisage extensible »), JPEG (pour « Joint Photographie Experts Group », traduit par « Groupe joint d’experts photographiques), MPEG (pour « Moving picture experts group », traduit par groupe d’experts d’images en mouvement ») ou PNG (for « Portable Networks Graphie », traduit par « graphiques portables pour réseaux »); des instructions d'interface utilisateur pour rendre ou interpréter des commandes pour une interface utilisateur graphique (GUI), une interface de ligne de commande ou une interface utilisateur textuelle ; un logiciel d'application tel qu'une suite bureautique, des applications d'accès à Internet, des applications de conception et de fabrication, des applications graphiques, des applications audio, des applications de génie logiciel, des applications éducatives, des jeux ou des applications diverses. Le serveur 355 peut comprendre un serveur d'application web qui héberge une couche de présentation, une couche d'application et une couche de stockage de données telles qu'un système de base de données relationnelle utilisant un langage d'interrogation structuré (dit « SQL », pour « Structured Query Language ») ou aucun SQL, un magasin d'objets, une base de données graphique, un système de fichiers plats ou tout autre stockage de données.
Le système informatique 305 peut envoyer des messages et recevoir des données et des instructions, y compris du code de programme, par l'intermédiaire du ou des réseaux, de la liaison réseau 365 et de l'interface de communication 360. Dans l'exemple Internet, un serveur 355 peut transmettre un code demandé pour un programme d'application par l'intermédiaire d'Internet 380, du FAI 375, du réseau local 370 et de l'interface de communication 360. Le code reçu peut être
exécuté par le processeur 310 au fur et à mesure de sa réception, et/ou stocké dans la mémoire 315, ou dans une autre mémoire non volatile pour une exécution ultérieure.
L'exécution d'instructions telle que décrite dans cette section peut mettre en œuvre un processus sous la forme d'une instance d'un programme informatique en cours d'exécution et constitué d'un code de programme et de son activité actuelle. Selon le système d'exploitation (dit « OS », « operating system »), un processus peut être constitué de plusieurs fils d'exécution qui exécutent des instructions simultanément. Dans ce contexte, un programme informatique est une collection passive d'instructions, tandis qu'un processus peut être l'exécution réelle de ces instructions. Plusieurs processus peuvent être associés au même programme ; par exemple, l'ouverture de plusieurs instances du même programme signifie souvent que plus d'un processus est en cours d'exécution. Le multitâche peut être mis en œuvre pour permettre à plusieurs processus de partager le processeur 310. Bien que chaque processeur 310 ou noyau du processeur exécute une seule tâche à la fois, le système informatique 305 peut être programmé pour mettre en œuvre le multitâche afin de permettre à chaque processeur de basculer entre les tâches en cours d'exécution sans avoir à attendre la fin de chaque tâche. Dans un mode de réalisation, les commutations peuvent être effectuées lorsque les tâches effectuent des opérations d’entrée/sortie, lorsqu'une tâche indique qu'elle peut être commutée, ou sur des interruptions matérielles. Le partage du temps peut être mis en œuvre pour permettre une réponse rapide aux applications interactives des utilisateurs en effectuant rapidement des commutations de contexte pour donner l'impression d'une exécution simultanée de plusieurs processus. Dans un mode de réalisation, pour des raisons de sécurité et de fiabilité, un système d'exploitation peut empêcher la communication directe entre des processus indépendants, en fournissant une fonctionnalité de communication interprocessus strictement médiatisée et contrôlée.
On observe, en figure 6, schématiquement, un mode de réalisation particulier du procédé 700 objet de la présente invention. Ce procédé 700 de génération automatique d’un contenu textuel guidée par un système expert d’application de techniques bibliométriques tel que décrit en regard des figures 1 et 3 à 5, chaque fichier du corpus unique étant associé à au moins un mot-clé, comporte :
- une étape 705 de saisie, via une interface de saisie associée à un dispositif de calcul, d’un ensemble de mots-clés de recherche,
- une étape 710 d’extraction, par un dispositif de calcul, d’un corpus extrait de fichiers relationnels à partir du corpus unique de fichiers enregistrés dans la base de données, en fonction des mots-clés recherchés et de mots-clés associés à chaque fichier du corpus unique, et un jeu de métadonnées associé à chaque fichier du corpus unique,
- une étape 715 de formation statistique, par le dispositif de calcul, de deux groupements complémentaires de fichiers distincts, en fonction du corpus extrait et des métadonnées associées à chaque fichier du corpus extrait, pour former :
- un premier groupement partitionné d’identifiants de fichiers cités classifiés et hiérarchisés,
- un deuxième groupement partitionné d’identifiants de fichiers citant classifiés et hiérarchisés,
- une étape 745 d’extraction des métadonnées de chaque groupement,
- une étape 720 de détermination, par le dispositif de calcul, de deux requêtes pour grand modèle de langage, en fonction des premier et deuxième groupements partitionnés et des métadonnées extraites associées auxdits groupements, chaque requête étant représentative d’une requête de génération d’un contenu textuel,
- une étape 725 de fourniture, par le dispositif de calcul, des deux requêtes déterminées à un grand modèle de langage entraîné,
- une étape 730 de réception, par le dispositif de calcul, du premier et du deuxième contenu textuel généré et
- une étape 735 de fourniture, via une interface informatique, du premier et du deuxième contenu textuel généré.
Au cours de l’étape 705 de saisie, un ensemble de mots-clés, définis par un utilisateur ou un système tiers, sont collectés et stockés dans une mémoire informatique temporaire. Une telle étape 705 de saisie peut mettre en œuvre une API ou une interface homme-machine, telle un clavier, une souris et une interface graphique utilisateur par exemple.
L’étape 710 d’extraction peut être réalisée de manière similaire à l’étape 110 d’extraction telle que décrite au regard de la figure 1.
L’étape 715 de formation est réalisée, par exemple, telle que décrite en regard de la figure 1.
L’étape 745 d’extraction de métadonnées est réalisée, par exemple, par la mise en œuvre d’un programme informatique exécuté par un dispositif de calcul. Un tel programme informatique est par exemple configuré pour extraire, le titre, au moins un nom d’un auteur, une revue de publication, une année de publication, et/ou au moins un identifiant de publication citée.
L’étape 720 de détermination est réalisée, par exemple, par la mise en œuvre d’un programme informatique exécuté par un dispositif de calcul. Au cours de cette étape 720 de calcul, deux requêtes distinctes en langage naturel sont formées, chacune, par la concaténation d’un texte de requête standardisé représentatif d’une instruction de génération de contenu.
Une telle requête correspond, par exemple, à une requête dite « à trous », c’est-à-dire à une chaine de caractères comportant des variables, représentatives des métadonnées extraites, des partitions ou sous-partitions et/ou d’un groupement.
Une telle requête est ensuite fournie, par le biais d’une interface graphique ou d’une interface logicielle (de type API) à un grand modèle de langage entraîné.
Tl
Dans des modes de réalisations particuliers, au moins une requête pour grand modèle de langage est représentative d’une requête de labélisation d’au moins une partition d’au moins un groupement.
Dans des modes de réalisations particuliers, au moins une requête pour grand modèle de langage est représentative d’une requête de génération d’un résumé d’au moins une partition d’au moins un groupement.
Dans des modes de réalisations particuliers, au moins une requête pour grand modèle de langage est représentative d’une requête d’identification de sous-partition pour au moins une partition d’au moins un groupement.
Dans des modes de réalisations particuliers, le grand modèle de langage est entraîné en suivant une méthode d’apprentissage supervisé et/ou par renforcement. Ce grand modèle de langage peut être entraîné sur des données réparties par disciplines scientifiques ou intellectuelles.
Dans des modes de réalisations particuliers, au moins une requête pour grand modèle de langage est représentative :
- d’une requête de labélisation d’au moins une sous-partition d’au moins un groupement et/ou
- d’une requête de génération d’un résumé d’au moins une sous-partition d’au moins un groupement.
L’étape 725 de fourniture est réalisée, par exemple, par la mise en œuvre d’un programme informatique exécuté par un dispositif de calcul. Au cours de cette étape 725 de fourniture, une API ou un système d’automatisation de processus robotique (traduit de « robotic process automation », abrégé RPA) peut être mis en œuvre par exemple. Le grand modèle de langage entraîné peut correspondre, par exemple, à ChatGPT (Marque déposée) ou à un grand modèle de langage entraîné spécifiquement sur un corpus d’un domaine scientifique correspondant au domaine scientifique des fichiers recherchés.
L’étape 730 de réception est réalisée, par exemple, par la mise en œuvre d’un programme informatique exécuté par un dispositif de calcul. Au cours de cette étape 730 de réception, une API est par exemple mise en œuvre.
L’étape 735 de fourniture est réalisée, par exemple, par la mise en œuvre d’un programme informatique exécuté par un dispositif de calcul. Au cours de cette étape 735 de fourniture, une API est par exemple mise en œuvre.
Dans des modes de réalisation particuliers, le procédé 700 objet de la présente invention comporte une étape de détermination d’une sous-partition d’au moins une partition d’au moins un groupement.
Dans des modes de réalisations particuliers, le procédé 700 objet de la présente invention comporte :
- une étape 740 de sélection, via une interface de saisie, d’un indicateur représentatif d’une discipline d’application et
- en amont de l’étape 725 de fourniture des requêtes déterminées à un grand modèle de langage entraîné, une étape 745 de sélection d’un grand modèle de langage entraîné, parmi une pluralité de grands modèles de langage entraînés, en fonction de l’indicateur représentatif d’une discipline d’application sélectionné.
L’étape 740 de sélection peut mettre en œuvre une API ou une interface homme-machine, telle un clavier, une souris et une interface graphique utilisateur par exemple. Cette étape 740 de sélection peut constituer, par exemple, en la sélection d’un item dans une liste, chaque item étant représentatif d’une discipline. Une discipline peut correspondre, par exemple, à une discipline scientifique telle la médecine ou l’économie.
L’étape 745 de sélection peut être réalisée manuellement, se confondant alors optionnellement avec l’étape 740 de sélection, ou automatiquement, via un ensemble d’instructions représentatives d’un programme informatique par exemple.
Dans des variantes, chaque grand modèle de langage entraîné disponible est associé à un attribut (« tag », en anglais) ou indicateur numérique représentatif d’une discipline associée à ce grand modèle de langage entraîné. Ainsi, le grand modèle de langage entraîné sélectionné correspond au grand modèle de langage entraîné associé à l’indicateur numérique de discipline qui correspond à l’indicateur numérique de discipline sélectionné au cours de l’étape 740 de sélection.
Dans des modes de réalisation particuliers, le procédé 700 objet de la présente invention comporte au moins une étape d’entraînement d’un grand modèle de langage, associé à un identifiant numérique de discipline, sur un corpus de documents relationnels filtrés pour correspondre à des documents de la discipline déterminée.
La figure 8 représente, schématiquement, une combinaison particulière des successions d’étapes illustrées en figures 1 et 6, les corpus formés en sortie du procédé 100 représenté en figure 1 étant mis en œuvre pour former des requêtes à un grand modèle de langage tel que décrit en regard de la figure 6.
La figure 7 représente, schématiquement, un mode de réalisation particulier d’une architecture 800 informatique susceptible de réaliser un mode réalisation particulier du procédé 700 objet de la présente invention. Cette architecture 800 informatique comporte :
- un ensemble de mots-clés 805 saisis via une interface de saisie,
- un moteur 810 de recherche textuelle configuré pour, en fonction des mots-clés 805 saisis, fournir un corpus 815 de fichiers, ou de documents, relationnels,
- un moyen 820 de prétraitement statistique du corpus 825 de fichiers pour paramétrer deux moyens, 830 et 860, de formation statistique de groupements, 835 et 865, le corpus, 825 et 855, prétraité étant fourni aux moyens, 830 et 860, de formation statistique de groupements,
- un moyen 830 de formation statistique d’un premier groupement 835 de fichiers en un groupement par unité de sens en fonction du résultat du moyen 820 de prétraitement et du corpus 825 prétraité,
- une requête 840 en langage naturel, combinée avec le premier groupement 835 de fichiers ou à des données représentatives du premier groupement de fichiers, pour former une requête de génération de contenu à adresser à un grand modèle de langage 845,
- un grand modèle de langage 845 configuré pour produire un contenu textuel qui dépend de la requête 840,
- un moyen 860 de formation statistique d’un deuxième groupement 865 de fichiers en un groupement par recherche de sens en fonction du résultat du moyen 820 de prétraitement et du corpus 855 prétraité,
- une requête 870 en langage naturel, combinée avec le deuxième groupement 865 de fichiers ou à des données représentatives du deuxième groupement de fichiers, pour former une requête de filtration et/ou de triage à adresser à un grand modèle de langage 875,
- un grand modèle de langage 875 configuré pour produire un contenu textuel qui dépend de la requête 870.
Présentation de l’invention
La présente invention vise à remédier à tout ou partie de ces inconvénients.
À cet effet, selon un premier aspect, la présente invention vise un procédé automatisé de collecte, de classification et de hiérarchisation d’un corpus de documents relationnels en deux groupements hiérarchisés complémentaires, caractérisé en ce qu’il comporte :
- une étape de définition, par un dispositif de calcul, d’une requête informatique,
- une étape d’extraction, par un dispositif de calcul et depuis une base de données informatiques, d’un corpus représenté par au moins un identifiant représentatif d’un document, dit « document citant » et d’au moins un jeu de métadonnées associées à au moins un dit identifiant de document citant, au moins une dite métadonnée étant représentative d’un identifiant d’un autre document, dit « document cité »,
- une étape de formation, par un dispositif de calcul, d’un premier ensemble d’ identifiants de documents cités et d’un deuxième ensemble d’identifiants de documents citant correspondant au corpus extrait,
- une étape de nettoyage, par un dispositif de calcul, d’au moins un identifiant d’un même document cité dans le premier ensemble, par la mise en œuvre d’un algorithme de correspondance de chaînes de caractères, pour harmoniser les identifiants d’un même document cité,
- une étape d’harmonisation, par un dispositif de calcul, d’identifiants de documents cités dans le deuxième ensemble en fonction du résultat de l’étape de nettoyage, puis, de manière concomitante :
- une étape de formation, par un dispositif de calcul, d’un premier groupement partitionné d’identifiants de documents cités classifiés et hiérarchisés, comportant :
- une étape d’initialisation d’une première valeur seuil, par un dispositif de calcul, représentative d’un niveau de pertinence minimal d’un document cité associé à la requête informatique définie,
- une étape d’ajustement automatique de la première valeur seuil, par un dispositif de calcul, en fonction de caractéristiques numériques représentatives du corpus extrait,
- une étape de filtration, par un dispositif de calcul, du premier ensemble en fonction de la première valeur seuil ajustée,
- une étape de détermination, par un dispositif de calcul, d’un indice de co-citation pour au moins une paire d’identifiants de documents cités du premier ensemble, filtré, en fonction d’un nombre de co- référencements de ladite paire d’identifiants de documents cités dans le deuxième ensemble,
- une étape de réduction de la matrice de co-citation de références ajustée en fonction des identifiants de références citées composant le premier ensemble filtré,
- une étape de partitionnement, par un dispositif de calcul, du premier ensemble en fonction d’au moins un indice de co-citation déterminé,
- une étape de détermination, par un dispositif de calcul, d’au moins un indice de communalité pour au moins un identifiant de document cité du premier ensemble partitionné et
- une étape de hiérarchisation, parun dispositif de calcul, d’identifiants de documents cités du premier ensemble partitionné, pour former le premier groupement,
- une étape de formation, par un dispositif de calcul, d’un deuxième groupement partitionné d’identifiants de documents citant classifiés et hiérarchisés, comportant :
- une étape d’initialisation d’une deuxième valeur seuil, par un dispositif de calcul, représentative d’un niveau de pertinence minimal d’un document citant associé à la requête informatique définie,
- une étape d’ajustement dynamique de la deuxième valeur seuil, par un dispositif de calcul, en fonction de caractéristiques numériques représentatives du corpus extrait,
- une étape de filtration, par un dispositif de calcul, du deuxième ensemble en fonction de la deuxième valeur seuil ajustée,
- une étape de détermination, par un dispositif de calcul, d’un indice de documentés cités en commun représentatif d’un nombre de documents cités en commun pour au moins une paire d’identifiants de documents citant du deuxième ensemble filtré,
- une étape de réduction de la matrice de couplage bibliographique de documents ajustée en fonction des identifiants de documents composant le deuxième ensemble filtré,
- une étape de partitionnement, par un dispositif de calcul, du deuxième ensemble réduit en fonction d’au moins un indice de documents cités en commun déterminé,
- une étape de détermination, par un dispositif de calcul, d’au moins un indice de communalité pour au moins un identifiant de document citant du deuxième ensemble partitionné et
- une étape de hiérarchisation, par un dispositif de calcul, d’identifiant de documents citant du deuxième ensemble, pour former le deuxième groupement et
- une étape de fourniture, sur une interface numérique, du premier et du deuxième groupement hiérarchisés.
Grâce à ces dispositions, un corpus pertinent au regard d’une requête est extrait et traité de sorte à faire émerger deux groupements hiérarchisés, distincts et complémentaires, représentatifs des documents influents dans la constitution cognitive du corpus extrait issus du corpus extrait et des thématiques principales issues du corpus extrait. Ces corpus peuvent, du fait des étapes de filtration distinctes, présenter un nombre de documents différents et, du fait des étapes de hiérarchisation distinctes, ordonner la pertinence des documents de manière distinctes au sein de chaque corpus.
Dans des modes de réalisation, l’étape d’initialisation de l’étape de formation du premier groupement comporte une étape de définition, par un dispositif de calcul, d’une valeur par défaut pour au moins un critère parmi :
- un pourcentage minimal du nombre d’identifiants de documents citant du corpus extrait à retenir,
- un nombre minimal d’identifiants de documents cités,
- un nombre maximal d’identifiants de documents cités et/ou
- un nombre total d’identifiants de documents cités associés à un nombre de documents citant, ledit nombre étant supérieur ou égal à une valeur seuil déterminée, au moins un dit critère étant mis en œuvre au cours de l’étape d’ajustement et/ou l’étape de filtration de l’étape de formation du premier groupement.
Ces modes de réalisation permettent de réaliser une filtration optimale des résultats au sein du premier groupement, au regard des traitements réalisés au cours de l’étape de formation du premier groupement.
Dans des modes de réalisation, l’étape d’ajustement de l’étape de formation du premier groupement est configurée pour modifier la valeur du pourcentage minimal du nombre d’ identifiants de documents à retenir si aucun résultat ne valide une règle associée à au moins un critère mis en œuvre au cours de l’étape d’initialisation.
Ces modes de réalisation permettent de réaliser un filtrage dynamique des résultats obtenus en fonction de caractéristiques propres au corpus extrait.
Dans des modes de réalisation, l’étape d’initialisation de l’étape de formation du deuxième ensemble réduit comporte une étape de définition, par un dispositif de calcul, d’une valeur par défaut pour au moins un critère parmi :
- une date de publication du document citant,
- un nombre normalisé de citation du document citant,
- un nombre minimal d’identifiants de documents,
- un nombre maximal d’identifiants de documents et/ou
- un nombre total d’identifiants de documents citant, ledit nombre étant supérieur ou égal à une valeur seuil déterminée et inférieure ou égale à une valeur plafond déterminée, au moins un dit critère étant mis en œuvre au cours de l’étape d’ajustement et/ou l’étape de filtration de l’étape de formation du deuxième ensemble réduit.
Ces modes de réalisation permettent de réaliser une filtration optimale des résultats au sein du deuxième ensemble réduit, au regard des traitements réalisés au cours de l’étape de formation du deuxième ensemble réduit.
Dans des modes de réalisations, l’étape d’ajustement de l’étape de formation du deuxième ensemble réduit est configurée pour :
- conserver dans l’analyse uniquement les documents citant publiés après une date déterminée,
- augmenter la valeur de citation normalisée minimale requise pour réduire le nombre de documents citant à retenir si le nombre total d’identifiants de documents citant conservés dépasse un nombre maximal de documents à conserver, et
- réduire la valeur de citation normalisée minimale requise pour réduire le nombre de documents citant à retenir si le nombre total d’identifiants de documents citant conservés est inférieur au nombre minimal de documents à conserver.
Ces modes de réalisation permettent de réaliser un filtrage dynamique des résultats obtenus en fonction de caractéristiques propres au deuxième ensemble réduit extrait.
Dans des modes de réalisations, le procédé objet de la présente invention comporte :
- une étape de détermination, par le dispositif de calcul, de deux requêtes pour grand modèle de langage, en fonction des premier et deuxième groupements partitionnés et des métadonnées extraites associées auxdits groupements, chaque requête étant représentative d’une requête de génération d’un contenu textuel,
- une étape de fourniture, par le dispositif de calcul, des deux requêtes déterminées à un grand modèle de langage entraîné,
- une étape de réception, par le dispositif de calcul, du premier et du deuxième contenu textuel généré et
- une étape de fourniture, via une interface informatique, du premier et du deuxième contenu textuel généré.
Dans des modes de réalisations, au moins une requête pour grand modèle de langage est représentative d’une requête de labélisation d’au moins une partition d’au moins un groupement.
Dans des modes de réalisations, au moins une requête pour grand modèle de langage est représentative d’une requête de génération d’un résumé d’au moins une partition d’au moins un groupement.
Dans des modes de réalisations, au moins une requête pour grand modèle de langage est représentative d’une requête d’identification de sous-partition pour au moins une partition d’au moins un groupement.
Dans des modes de réalisations, le procédé objet de la présente invention comporte une étape de détermination d’une sous-partition d’au moins une partition d’au moins un groupement.
Dans des modes de réalisations, au moins une requête pour grand modèle de langage est représentative :
- d’une requête de labélisation d’au moins une sous-partition d’au moins un groupement et/ou
- d’une requête de génération d’un résumé d’au moins une sous-partition d’au moins un groupement.
Dans des modes de réalisations, le procédé objet de la présente invention comporte :
- une étape de sélection, via une interface de saisie, d’un indicateur représentatif d’une discipline d’application et
- en amont de l’étape de fourniture des requêtes déterminées à un grand modèle de langage entraîné, une étape de sélection d’un grand modèle de langage entraîné, parmi une pluralité de grands modèles de langage entraînés, en fonction de l’indicateur représentatif d’une discipline d’application sélectionné.
Selon un deuxième aspect, la présente invention vise un dispositif automatisé de collecte, de classification et de hiérarchisation d’un corpus de documents relationnels en deux groupements hiérarchisés complémentaires, qui comporte une mémoire informatique, stockant des instructions informatiques, et un dispositif de calcul, qui, lorsque ce dispositif de calcul exécute les instructions stockées dans la mémoire informatique, exécute les étapes suivantes :
- une étape de définition, par un dispositif de calcul, d’une requête informatique,
- une étape d’extraction, par un dispositif de calcul et depuis une base de données informatiques, d’un corpus représenté par au moins un identifiant représentatif d’un
document, dit « document citant » et d’au moins un jeu de métadonnées associées à au moins un dit identifiant de document citant, au moins une dite métadonnée étant représentative d’un identifiant d’un autre document, dit « document cité »,
- une étape de formation, par un dispositif de calcul, d’un premier ensemble d’ identifiants de documents cités et d’un deuxième ensemble d’identifiants de documents citant correspondant au corpus extrait,
- une étape de nettoyage, par un dispositif de calcul, d’au moins un identifiant d’un même document cité dans le premier ensemble, par la mise en œuvre d’un algorithme de correspondance de chaînes de caractères, pour harmoniser les identifiants d’un même document cité,
- une étape d’harmonisation, par un dispositif de calcul, d’identifiants de documents cités dans le deuxième ensemble en fonction du résultat de l’étape de nettoyage, puis, de manière concomitante :
- une étape de formation, par un dispositif de calcul, d’un premier groupement partitionné d’identifiants de documents cités classifiés et hiérarchisés, comportant :
- une étape d’initialisation d’une première valeur seuil, par un dispositif de calcul, représentative d’un niveau de pertinence minimal d’un document cité associé à la requête informatique définie,
- une étape d’ajustement automatique de la première valeur seuil, par un dispositif de calcul, en fonction de caractéristiques numériques représentatives du corpus extrait,
- une étape de filtration, par un dispositif de calcul, du premier ensemble en fonction de la première valeur seuil ajustée,
- une étape de détermination, par un dispositif de calcul, d’un indice de co-citation pour au moins une paire d’identifiants de documents cités du premier ensemble, filtré, en fonction d’un nombre de co- référencements de ladite paire d’identifiants de documents cités dans le deuxième ensemble,
- une étape de réduction de la matrice de co-citation de références ajustée en fonction des identifiants de références citées composant le premier ensemble filtré,
- une étape de partitionnement, par un dispositif de calcul, du premier ensemble en fonction d’au moins un indice de co-citation déterminé,
- une étape de détermination, par un dispositif de calcul, d’au moins un indice de communalité pour au moins un identifiant de document cité du premier ensemble partitionné et
- une étape de hiérarchisation, parun dispositif de calcul, d’identifiants de documents cités du premier ensemble partitionné, pour former le premier groupement,
- une étape de formation, par un dispositif de calcul, d’un deuxième groupement partitionné d’identifiants de documents citant classifiés et hiérarchisés, comportant :
- une étape d’initialisation d’une deuxième valeur seuil, par un dispositif de calcul, représentative d’un niveau de pertinence minimal d’un document citant associé à la requête informatique définie,
- une étape d’ajustement dynamique de la deuxième valeur seuil, par un dispositif de calcul, en fonction de caractéristiques numériques représentatives du corpus extrait,
- une étape de filtration, par un dispositif de calcul, du deuxième ensemble en fonction de la deuxième valeur seuil ajustée,
- une étape de détermination, par un dispositif de calcul, d’un indice de documentés cités en commun représentatif d’un nombre de documents cités en commun pour au moins une paire d’identifiants de documents citant du deuxième ensemble filtré,
- une étape de réduction de la matrice de couplage bibliographique de documents ajustée en fonction des identifiants de documents composant le deuxième ensemble filtré,
- une étape de partitionnement, par un dispositif de calcul, du deuxième ensemble réduit en fonction d’au moins un indice de documents cités en commun déterminé,
- une étape de détermination, par un dispositif de calcul, d’au moins un indice de communalité pour au moins un identifiant de document citant du deuxième ensemble partitionné et
- une étape de hiérarchisation, par un dispositif de calcul, d’identifiant de documents citant du deuxième ensemble, pour former le deuxième groupement et
- une étape de fourniture, sur une interface numérique, du premier et du deuxième groupement hiérarchisés.
Les avantages obtenus par la mise en œuvre du dispositif objet de la présente invention sont similaires aux avantages obtenus par la mise en œuvre du procédé objet de la présente invention.
Selon un troisième aspect, la présente invention vise un procédé de génération automatique d’un contenu textuel guidée par un procédé tel que visé par le premier aspect de la présente invention, chaque fichier du corpus unique étant associé à au moins un mot-clé, qui comporte :
- une étape de saisie, via une interface de saisie associée à un dispositif de calcul, d’un ensemble de mots-clés de recherche,
- une étape d’extraction, par un dispositif de calcul, d’un corpus extrait de fichiers relationnels à partir du corpus unique de fichiers enregistrés dans la base de données, en fonction des
mots-clés recherchés et de mots-clés associés à chaque fichier du corpus unique, et un jeu de métadonnées associé à chaque fichier du corpus unique,
- une étape de formation statistique, par le dispositif de calcul, de deux groupements complémentaires de fichiers distincts, en fonction du corpus extrait et des métadonnées associées à chaque fichier du corpus extrait, pour former :
- un premier groupement partitionné d’identifiants de fichiers cités classifiés et hiérarchisés,
- un deuxième groupement partitionné d’identifiants de fichiers citant classifiés et hiérarchisés,
- une étape d’extraction des métadonnées de chaque groupement,
- une étape de détermination, par le dispositif de calcul, de deux requêtes pour grand modèle de langage, en fonction des premier et deuxième groupements partitionnés et des métadonnées extraites associées auxdits groupements, chaque requête étant représentative d’une requête de génération d’un contenu textuel,
- une étape de fourniture, par le dispositif de calcul, des deux requêtes déterminées à un grand modèle de langage entraîné,
- une étape de réception, par le dispositif de calcul, du premier et du deuxième contenu textuel généré et
- une étape de fourniture, via une interface informatique, du premier et du deuxième contenu textuel généré.
Grâce à ces dispositions, un corpus pertinent au regard d’une requête est extrait et traité de sorte à faire émerger deux groupements hiérarchisés, distincts et complémentaires, représentatifs des fichiers influents dans la constitution cognitive du corpus extrait issus du corpus extrait et des thématiques principales issues du corpus extrait. Ces corpus peuvent, du fait des étapes de filtration distinctes, présenter un nombre de fichiers différents et, du fait des étapes de hiérarchisation distinctes, ordonner la pertinence des fichiers de manière distincte au sein de chaque corpus.
Ainsi, chaque groupement est fourni à un utilisateur ou enregistré dans une mémoire informatique.
De plus les groupements sont filtrés et triés de manière statistique, par la mise en œuvre d’un grand modèle de langage configuré pour réaliser ce filtrage et ce triage sans intervention de la part d’un utilisateur.
Ainsi mis en œuvre, un tel grand modèle de langage ne peut pas subir d’effet d’hallucination en ce qui concerne les fichiers identifiés, car ceux-ci sont identifiés préalablement par la mise en œuvre d’un moteur de recherche ordinaire doublée par la mise en œuvre d’une approche statistique, et bibliométrique, du corpus obtenu en réponse à la mise en œuvre du rapport de recherche.
De plus, le mécanisme mis en œuvre par la présente invention peut être dit de « transformateur génératif guidé » (traduit de « Guided Generative Transformer », abrégé GGT). C’est-à-dire que le mécanisme mis en œuvre par la présente invention permet de transformer un ensemble non ordonné des métadonnées de textes ayant une bibliographie, en deux ensembles partitionnés à partir desquels on génère des contenus textuels labellisés et résumant les textes, avec leurs sources justificatives.
De plus, ainsi mis en œuvre, un tel grand modèle de langage nécessite peu de ressources informatiques et énergétiques pour réaliser l’étape de filtrage et de triage.
De plus, une telle invention peut ne se baser que sur des métadonnées, évitant ainsi toute atteinte au droit d’auteur et aux autres droits de la propriété intellectuelle connexes.
Dans des modes de réalisation particuliers, au moins une requête pour grand modèle de langage est représentative d’une requête de labélisation d’au moins une partition d’au moins un groupement.
Dans des modes de réalisation particuliers, au moins une requête pour grand modèle de langage est représentative d’une requête de génération d’un résumé d’au moins une partition d’au moins un groupement.
Dans des modes de réalisation particuliers, au moins une requête pour grand modèle de langage est représentative d’une requête d’identification de sous-partition pour au moins une partition d’au moins un groupement.
Dans des modes de réalisation particuliers, le procédé objet de la présente invention comporte une étape de détermination d’une sous-partition d’au moins une partition d’au moins un groupement.
Dans des modes de réalisation particuliers, au moins une requête pour grand modèle de langage est représentative :
- d’une requête de labélisation d’au moins une sous-partition d’au moins un groupement et/ou
- d’une requête de génération d’un résumé d’au moins une sous-partition d’au moins un groupement.
Dans des modes de réalisation particuliers, le procédé objet de la présente invention comporte :
- une étape de sélection, via une interface de saisie, d’un indicateur représentatif d’une discipline d’application et
- en amont de l’étape de fourniture des requêtes déterminées à un grand modèle de langage entraîné, une étape de sélection d’un grand modèle de langage entraîné, parmi une pluralité de grands modèles de langage entraînés, en fonction de l’indicateur représentatif d’une discipline d’application sélectionné.
Ces modes de réalisations améliorent significativement la pertinence des résultats des grands modèles de langages, entraînés spécifiquement pour une pluralité de disciplines.
Dans des modes de réalisation particuliers, l’étape de formation statistique comporte une étape de formation, par un dispositif de calcul, d’un premier groupement partitionné d’identifiants de fichiers cités classifiés et hiérarchisés, qui comporte :
- une étape d’initialisation d’une première valeur seuil, par un dispositif de calcul, représentative d’un niveau de pertinence minimal d’un fichier cité associé à la requête informatique définie,
- une étape d’ajustement automatique de la première valeur seuil, par un dispositif de calcul, en fonction de caractéristiques numériques représentatives du corpus extrait,
- une étape de filtration, par un dispositif de calcul, du premier ensemble en fonction de la première valeur seuil ajustée,
- une étape de détermination, par un dispositif de calcul, d’un indice de co-citation pour au moins une paire d’identifiants de fichiers cités du premier ensemble, filtré, en fonction d’un nombre de co-référencements de ladite paire d’identifiants de fichiers cités dans le deuxième ensemble,
- une étape de réduction du premier ensemble filtré,
- une étape de partitionnement, par un dispositif de calcul, du premier ensemble en fonction d’au moins un indice de co-citation déterminé, - une étape de détermination, par un dispositif de calcul, d’au moins un indice de communalité pour au moins un identifiant de fichier cité du premier ensemble partitionné et
- une étape de hiérarchisation, par un dispositif de calcul, d’identifiants de fichiers cités du premier ensemble partitionné, pour former le premier groupement.
Dans des modes de réalisation particuliers, l’étape de formation statistique comporte une étape de formation, par un dispositif de calcul, d’un deuxième groupement partitionné d’identifiants de fichiers citant classifiés et hiérarchisés, qui comporte :
- une étape d’initialisation d’une deuxième valeur seuil, par un dispositif de calcul, représentative d’un niveau de pertinence minimal d’un fichier citant associé à la requête informatique définie,
- une étape d’ajustement dynamique de la deuxième valeur seuil, par un dispositif de calcul, en fonction de caractéristiques numériques représentatives du corpus extrait,
- une étape de filtration, par un dispositif de calcul, du deuxième ensemble en fonction de la deuxième valeur seuil ajustée,
- une étape de détermination, par un dispositif de calcul, d’un indice de fichiers cités en commun représentatif d’un nombre de fichiers cités en commun pour au moins une paire d’identifiants de fichiers citant du deuxième ensemble filtré,
- une étape de réduction du deuxième ensemble filtré,
- une étape de partitionnement, par un dispositif de calcul, du deuxième ensemble réduit en fonction d’au moins un indice de fichiers cités en commun déterminé,
- une étape de détermination, par un dispositif de calcul, d’au moins un indice de communaliste pour au moins un identifiant de fichier citant du deuxième ensemble partitionné et
- une étape de hiérarchisation, par un dispositif de calcul, d’identifiant de fichiers citant du deuxième ensemble, pour former le deuxième groupement.
Dans des modes de réalisation particuliers, l’étape d’initialisation de l’étape de formation du deuxième groupement comporte une étape de définition, par un dispositif de calcul, d’une valeur par défaut pour au moins un critère parmi :
- une date de publication du fichier citant,
- un nombre normalisé de citations du fichier citant,
- un nombre minimal d’identifiants de fichiers,
- un nombre maximal d’identifiants de fichiers et/ou
- un nombre total d’identifiants de fichiers citant, ledit nombre étant supérieur ou égal à une valeur seuil déterminée et inférieure ou égale à une valeur plafond déterminée, au moins un dit critère étant mis en œuvre au cours de l’étape d’ajustement et/ou l’étape de filtration de l’étape de formation du deuxième ensemble réduit.
Ces modes de réalisation permettent de réaliser une filtration optimale des résultats au sein du deuxième ensemble réduit, au regard des traitements réalisés au cours de l’étape de formation du deuxième ensemble réduit.
Dans des modes de réalisation particuliers, l’étape d’ajustement de l’étape de formation du deuxième groupement est configurée pour :
- conserver dans l’analyse uniquement les fichiers citant publiés après une date déterminée,
- augmenter la valeur de citation normalisée minimale requise pour réduire le nombre de fichiers citant à retenir si le nombre total d’identifiants de fichiers citant conservés dépasse un nombre maximal de fichiers à conserver, et
- réduire la valeur de citation normalisée minimale requise pour réduire le nombre de fichiers citant à retenir si le nombre total d’identifiants de fichiers citant conservés est inférieur au nombre minimal de fichiers à conserver.
Ces modes de réalisation permettent de réaliser un filtrage dynamique des résultats obtenus en fonction de caractéristiques propres au deuxième ensemble réduit extrait.
Selon un quatrième aspect, la présente invention vise un dispositif de génération automatique d’un contenu textuel guidée par un système expert d’application de techniques bibliométriques à partir d’un corpus unique de fichiers relationnels enregistrés dans une base de données, chaque fichier du corpus unique étant associé à au moins un mot-clé, qui comporte une mémoire informatique, stockant des instructions informatiques, et un dispositif de calcul, qui,
lorsque ce dispositif de calcul exécute les instructions stockées dans la mémoire informatique, exécute les étapes suivantes :
- une étape de saisie, via une interface de saisie associée à un dispositif de calcul, d’un ensemble de mots-clés de recherche,
- une étape d’extraction, par un dispositif de calcul, d’un corpus extrait de fichiers relationnels à partir du corpus unique de fichiers enregistrés dans la base de données, en fonction des mots-clés recherchés et de mots-clés associés à chaque fichier du corpus unique, et un jeu de métadonnées associé à chaque fichier du corpus unique,
- une étape de formation statistique, par le dispositif de calcul, de deux groupements complémentaires de fichiers distincts, en fonction du corpus extrait et des métadonnées associées à chaque fichier du corpus extrait, pour former :
- un premier groupement partitionné d’identifiants de fichiers cités classifiés et hiérarchisés,
- un deuxième groupement partitionné d’identifiants de fichiers citant classifiés et hiérarchisés,
- une étape d’extraction des métadonnées de chaque groupement,
- une étape de détermination, par le dispositif de calcul, de deux requêtes pour grand modèle de langage, en fonction des premier et deuxième groupements partitionnés et des métadonnées extraites associées auxdits groupements, chaque requête étant représentative d’une requête de génération d’un contenu textuel,
- une étape de fourniture, par le dispositif de calcul, des deux requêtes déterminées à un grand modèle de langage entraîné,
- une étape de réception, par le dispositif de calcul, du premier et du deuxième contenu textuel généré et
- une étape de fourniture, via une interface informatique, du premier et du deuxième contenu textuel généré.
Les avantages obtenus par la mise en œuvre du dispositif objet de la présente invention sont similaires aux avantages obtenus par la mise en œuvre du procédé objet de la présente invention.
Claims
1. Procédé (100, 900) automatisé de collecte, de classification et de hiérarchisation d’un corpus de documents relationnels en deux groupements hiérarchisés complémentaires, caractérisé en ce qu’il comporte :
- une étape 105 de définition, par un dispositif de calcul, d’une requête informatique,
- une étape 110 d’extraction, par un dispositif de calcul et depuis une base de données informatiques, d’un corpus représenté par au moins un identifiant représentatif d’un document, dit « document citant » et d’au moins un jeu de métadonnées associées à au moins un dit identifiant de document citant, au moins une dite métadonnée étant représentative d’un identifiant d’un autre document, dit « document cité »,
- une étape 111 de formation, par un dispositif de calcul, d’un premier ensemble d’identifiants de documents cités et d’un deuxième ensemble d’identifiants de documents citant correspondant au corpus extrait,
- une étape 115 de nettoyage, par un dispositif de calcul, d’au moins un identifiant d’un même document cité dans le premier ensemble, par la mise en œuvre d’un algorithme de correspondance de chaînes de caractères, pour harmoniser les identifiants d’un même document cité,
- une étape 116 d’harmonisation, par un dispositif de calcul, d’identifiants de documents cités dans le deuxième ensemble en fonction du résultat de l’étape 115 de nettoyage, puis, de manière concomitante :
- une étape 120 de formation, par un dispositif de calcul, d’un premier groupement partitionné d’identifiants de documents cités classifiés et hiérarchisés, comportant :
- une étape 125 d’initialisation d’une première valeurseuil, par un dispositif de calcul, représentative d’un niveau de pertinence minimal d’un document cité associé à la requête informatique définie,
- une étape 130 d’ajustement automatique de la première valeur seuil, par un dispositif de calcul, en fonction de caractéristiques numériques représentatives du corpus extrait,
- une étape 135 de filtration, par un dispositif de calcul, du premier ensemble en fonction de la première valeur seuil ajustée,
- une étape 140 de détermination, par un dispositif de calcul, d’un indice de cocitation pour au moins une paire d’identifiants de documents cités du premier ensemble, filtré, en fonction d’un nombre de co-référencements de ladite paire d’identifiants de documents cités dans le deuxième ensemble,
- une étape 141 de réduction du premier ensemble filtré,
- une étape 145 de partitionnement, par un dispositif de calcul, du premier ensemble en fonction d’au moins un indice de co-citation déterminé,
- une étape 150 de détermination, par un dispositif de calcul, d’au moins un indice de communalité pour au moins un identifiant de document cité du premier ensemble partitionné et
- une étape 155 de hiérarchisation, par un dispositif de calcul, d’identifiants de documents cités du premier ensemble partitionné, pour former le premier groupement,
- une étape 160 de formation, par un dispositif de calcul, d’un deuxième groupement partitionné d’identifiants de documents citant, classifiés et hiérarchisés, comportant :
- une étape 165 d’initialisation d’une deuxième valeur seuil, par un dispositif de calcul, représentative d’un niveau de pertinence minimal d’un document citant associé à la requête informatique définie,
- une étape 170 d’ajustement dynamique de la deuxième valeur seuil, par un dispositif de calcul, en fonction de caractéristiques numériques représentatives du corpus extrait,
- une étape 175 de filtration, par un dispositif de calcul, du deuxième ensemble en fonction de la deuxième valeur seuil ajustée,
- une étape 180 de détermination, par un dispositif de calcul, d’un indice de documentés cités en commun représentatif d’un nombre de documents cités en commun pour au moins une paire d’identifiants de documents citant du deuxième ensemble filtré,
- une étape 181 de réduction du deuxième ensemble filtré,
- une étape 185 de partitionnement, par un dispositif de calcul, du deuxième ensemble réduit en fonction d’au moins un indice de documents cités en commun déterminé,
- une étape 190 de détermination, par un dispositif de calcul, d’au moins un indice de communalité pour au moins un identifiant de document citant du deuxième ensemble partitionné et
- une étape 195 de hiérarchisation, par un dispositif de calcul, d’identifiant de documents citant du deuxième ensemble, pour former le deuxième groupement et
- une étape 200 de fourniture, sur une interface numérique, du premier et du deuxième groupement hiérarchisés.
2. Procédé (100, 900) selon la revendication 1 , dans lequel l’étape (125) d’initialisation de l’étape (120) de formation du premier groupement comporte une étape (225) de définition, par un dispositif de calcul, d’une valeur par défaut pour au moins un critère parmi :
- un pourcentage minimal du nombre d’identifiants de documents citant du corpus extrait à retenir,
- un nombre minimal d’identifiants de documents cités,
- un nombre maximal d’identifiants de documents cités et/ou
- un nombre total d’identifiants de documents cités associés à un nombre de documents citant, ledit nombre étant supérieur ou égal à une valeur seuil déterminée, au moins un dit critère étant mis en œuvre au cours de l’étape (130) d’ajustement et/ou l’étape (135) de filtration de l’étape de formation du premier groupement.
3. Procédé (100, 900) selon la revendication 2, dans lequel l’étape (130) d’ajustement de l’étape (120) de formation du premier groupement est configurée pour modifier la valeur du pourcentage minimal du nombre d’identifiants de documents à retenir si aucun résultat ne valide une règle associée à au moins un critère mis en œuvre au cours de l’étape (125) d’initialisation.
4. Procédé (100, 900) selon l’une des revendications 1 à 3, dans lequel l’étape (165) d’initialisation de l’étape (160) de formation du deuxième groupement comporte une étape (230) de définition, par un dispositif de calcul, d’une valeur par défaut pour au moins un critère parmi :
- une date de publication du document citant,
- un nombre normalisé de citation du document citant,
- un nombre minimal d’identifiants de documents,
- un nombre maximal d’identifiants de documents et/ou
- un nombre total d’identifiants de documents citant, ledit nombre étant supérieur ou égal à une valeur seuil déterminée et inférieure ou égale à une valeur plafond déterminée, au moins un dit critère étant mis en œuvre au cours de l’étape d’ajustement et/ou l’étape de filtration de l’étape de formation du deuxième ensemble réduit.
5. Procédé (100, 900) selon la revendication 4, dans lequel l’étape (170) d’ajustement de l’étape (160) de formation du deuxième groupement est configurée pour :
- conserver dans l’analyse uniquement les documents citant publiés après une date déterminée,
- augmenter la valeur de citation normalisée minimale requise pour réduire le nombre de documents citant à retenir si le nombre total d’identifiants de documents citant conservés dépasse un nombre maximal de documents à conserver, et
- réduire la valeur de citation normalisée minimale requise pour réduire le nombre de documents citant à retenir si le nombre total d’identifiants de documents citant conservés est inférieur au nombre minimal de documents à conserver.
6. Procédé (900) selon l’une des revendications 1 à 5, qui comporte :
- une étape (920) de détermination, par le dispositif de calcul, de deux requêtes pour grand modèle de langage, en fonction des premier et deuxième groupements partitionnés et des
métadonnées extraites associées auxdits groupements, chaque requête étant représentative d’une requête de génération d’un contenu textuel,
- une étape (925) de fourniture, par le dispositif de calcul, des deux requêtes déterminées à un grand modèle de langage entraîné,
- une étape (930) de réception, par le dispositif de calcul, du premier et du deuxième contenu textuel généré et
- une étape (935) de fourniture, via une interface informatique, du premier et du deuxième contenu textuel généré.
7. Procédé (900) selon la revendication 6, dans lequel au moins une requête pour grand modèle de langage est représentative d’une requête de labélisation d’au moins une partition d’au moins un groupement.
8. Procédé (900) selon l’une des revendications 6 ou 7, dans lequel au moins une requête pour grand modèle de langage est représentative d’une requête de génération d’un résumé d’au moins une partition d’au moins un groupement.
9. Procédé (900) selon l’une des revendications 6 à 8, dans lequel au moins une requête pour grand modèle de langage est représentative d’une requête d’identification de sous-partition pour au moins une partition d’au moins un groupement.
10. Procédé (900) selon l’une des revendications 6 à 9, qui comporte une étape de détermination d’une sous-partition d’au moins une partition d’au moins un groupement.
11. Procédé (900) selon l’une des revendications 9 ou 10, dans lequel au moins une requête pour grand modèle de langage est représentative :
- d’une requête de labélisation d’au moins une sous-partition d’au moins un groupement et/ou
- d’une requête de génération d’un résumé d’au moins une sous-partition d’au moins un groupement.
12. Procédé (900) selon l’une des revendications 6 à 12, qui comporte :
- une étape (940) de sélection, via une interface de saisie, d’un indicateur représentatif d’une discipline d’application et
- en amont de l’étape (925) de fourniture des requêtes déterminées à un grand modèle de langage entraîné, une étape (945) de sélection d’un grand modèle de langage entraîné, parmi une pluralité de grands modèles de langage entraînés, en fonction de l’indicateur représentatif d’une discipline d’application sélectionné.
13. Dispositif (300) automatisé de collecte, de classification et de hiérarchisation d’un corpus de documents relationnels en deux groupements hiérarchisés complémentaires, caractérisé en ce qu’il comporte une mémoire (325) informatique, stockant des instructions informatiques, et un dispositif (310) de calcul, qui, lorsque ce dispositif de calcul exécute les instructions stockées dans la mémoire informatique, exécute les étapes suivantes :
- une étape de définition, par un dispositif de calcul, d’une requête informatique,
- une étape d’extraction, par un dispositif de calcul et depuis une base de données informatiques, d’un corpus représenté par au moins un identifiant représentatif d’un document, dit « document citant » et d’au moins un jeu de métadonnées associées à au moins un dit identifiant de document citant, au moins une dite métadonnée étant représentative d’un identifiant d’un autre document, dit « document cité »,
- une étape de formation, par un dispositif de calcul, d’un premier ensemble d’ identifiants de documents cités et d’un deuxième ensemble d’identifiants de documents citant correspondant au corpus extrait,
- une étape de nettoyage, par un dispositif de calcul, d’au moins un identifiant d’un même document cité dans le premier ensemble, par la mise en œuvre d’un algorithme de correspondance de chaînes de caractères, pour harmoniser les identifiants d’un même document cité,
- une étape d’harmonisation, par un dispositif de calcul, d’identifiants de documents cités dans le deuxième ensemble en fonction du résultat de l’étape de nettoyage, puis, de manière concomitante :
- une étape de formation, par un dispositif de calcul, d’un premier groupement partitionné d’identifiants de documents cités classifiés et hiérarchisés, comportant :
- une étape d’initialisation d’une première valeur seuil, par un dispositif de calcul, représentative d’un niveau de pertinence minimal d’un document cité associé à la requête informatique définie,
- une étape d’ajustement automatique de la première valeur seuil, par un dispositif de calcul, en fonction de caractéristiques numériques représentatives du corpus extrait,
- une étape de filtration, par un dispositif de calcul, du premier ensemble en fonction de la première valeur seuil ajustée,
- une étape de détermination, par un dispositif de calcul, d’un indice de co-citation pour au moins une paire d’identifiants de documents cités du premier ensemble, filtré, en fonction d’un nombre de co- référencements de ladite paire d’identifiants de documents cités dans le deuxième ensemble,
- une étape de réduction de la matrice de co-citation de références ajustée en fonction des identifiants de références citées composant le premier ensemble filtré,
- une étape de partitionnement, par un dispositif de calcul, du premier ensemble en fonction d’au moins un indice de co-citation déterminé,
- une étape de détermination, par un dispositif de calcul, d’au moins un indice de communalité pour au moins un identifiant de document cité du premier ensemble partitionné et
- une étape de hiérarchisation, parun dispositif de calcul, d’identifiants de documents cités du premier ensemble partitionné, pour former le premier groupement,
- une étape de formation, par un dispositif de calcul, d’un deuxième groupement partitionné d’identifiants de documents citant classifiés et hiérarchisés, comportant :
- une étape d’initialisation d’une deuxième valeur seuil, par un dispositif de calcul, représentative d’un niveau de pertinence minimal d’un document citant associé à la requête informatique définie,
- une étape d’ajustement dynamique de la deuxième valeur seuil, par un dispositif de calcul, en fonction de caractéristiques numériques représentatives du corpus extrait,
- une étape de filtration, par un dispositif de calcul, du deuxième ensemble en fonction de la deuxième valeur seuil ajustée,
- une étape de détermination, par un dispositif de calcul, d’un indice de documentés cités en commun représentatif d’un nombre de documents cités en commun pour au moins une paire d’identifiants de documents citant du deuxième ensemble filtré,
- une étape de réduction de la matrice de couplage bibliographique de documents ajustée en fonction des identifiants de documents composant le deuxième ensemble filtré,
- une étape de partitionnement, par un dispositif de calcul, du deuxième ensemble réduit en fonction d’au moins un indice de documents cités en commun déterminé,
- une étape de détermination, par un dispositif de calcul, d’au moins un indice de communalité pour au moins un identifiant de document citant du deuxième ensemble partitionné et
- une étape de hiérarchisation, par un dispositif de calcul, d’identifiant de documents citant du deuxième ensemble, pour former le deuxième groupement et
- une étape de fourniture, sur une interface numérique, du premier et du deuxième groupement hiérarchisés.
Applications Claiming Priority (3)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| FR2303709A FR3147880A1 (fr) | 2023-04-13 | 2023-04-13 | Dispositif et procédé automatisé de collecte, de classification et de hiérarchisation d’un corpus de documents relationnels |
| FR2306677A FR3147881A1 (fr) | 2023-04-13 | 2023-06-26 | Dispositif et procédé automatisé de collecte, de classification et de hiérarchisation d’un corpus de documents relationnels |
| PCT/EP2024/060187 WO2024213798A1 (fr) | 2023-04-13 | 2024-04-15 | Dispositif et procédé automatisé de collecte, de classification et de hiérarchisation d'un corpus de documents relationnels |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| EP4695698A1 true EP4695698A1 (fr) | 2026-02-18 |
Family
ID=90810583
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| EP24720099.1A Pending EP4695698A1 (fr) | 2023-04-13 | 2024-04-15 | Dispositif et procédé automatisé de collecte, de classification et de hiérarchisation d'un corpus de documents relationnels |
Country Status (2)
| Country | Link |
|---|---|
| EP (1) | EP4695698A1 (fr) |
| WO (1) | WO2024213798A1 (fr) |
Family Cites Families (3)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| FR320E (fr) | 1900-03-08 | 1902-12-11 | Spuehl Heinrich | Moteur électrique pour éventails dits pankhas |
| TW201123064A (en) * | 2009-12-30 | 2011-07-01 | Univ Nat Taiwan Science Tech | Method for patent valuation and computer-readable storage medium |
| US9461876B2 (en) * | 2012-08-29 | 2016-10-04 | Loci | System and method for fuzzy concept mapping, voting ontology crowd sourcing, and technology prediction |
-
2024
- 2024-04-15 EP EP24720099.1A patent/EP4695698A1/fr active Pending
- 2024-04-15 WO PCT/EP2024/060187 patent/WO2024213798A1/fr not_active Ceased
Also Published As
| Publication number | Publication date |
|---|---|
| WO2024213798A1 (fr) | 2024-10-17 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| US11417131B2 (en) | Techniques for sentiment analysis of data using a convolutional neural network and a co-occurrence network | |
| US11704321B2 (en) | Techniques for relationship discovery between datasets | |
| US11200248B2 (en) | Techniques for facilitating the joining of datasets | |
| EP2836935B1 (fr) | Trouver données dans | |
| WO2016049460A1 (fr) | Système de langage déclaratif et de visualisation permettant des transformations et des réparations de données recommandées | |
| WO2016049437A9 (fr) | Techniques d'analyse de similarité et d'enrichissement de données à l'aide de sources de connaissances | |
| CN107111608A (zh) | 从语言输入数据自动生成n‑元和概念关系 | |
| Brescia et al. | DAMEWARE: A web cyberinfrastructure for astrophysical data mining | |
| Zeng et al. | Mobile visual search model for Dunhuang murals in the smart library | |
| Pintye et al. | Big data and machine learning framework for clouds and its usage for text classification | |
| Sharma et al. | Proliferating Cloud Density through Big Data Ecosystem, Novel XCLOUDX Classification and Emergence of as-a-Service Era | |
| Janev | Semantic intelligence in big data applications | |
| US20260052295A1 (en) | Apparatus and method for generating a dynamically self-modifying graphical interface | |
| US20250005285A1 (en) | Automatic generation of treebank parse data for training constituency parsers | |
| Quddus | Machine Learning with Apache Spark Quick Start Guide: Uncover patterns, derive actionable insights, and learn from big data using MLlib | |
| WO2024213798A1 (fr) | Dispositif et procédé automatisé de collecte, de classification et de hiérarchisation d'un corpus de documents relationnels | |
| FR3158814A3 (fr) | Procédé et dispositif de génération automatique d’un contenu textuel guidée par un système expert d’application de techniques bibliométriques | |
| FR3147881A1 (fr) | Dispositif et procédé automatisé de collecte, de classification et de hiérarchisation d’un corpus de documents relationnels | |
| Körner et al. | Mastering Azure Machine Learning: Perform large-scale end-to-end advanced machine learning in the cloud with Microsoft Azure Machine Learning | |
| Christ et al. | A reference architecture for semantic content management systems | |
| US20260094015A1 (en) | Dynamic prompt creation for enhanced generative ai interactions | |
| WO2008043392A1 (fr) | Procede pour traiter des informations | |
| Ye | Development of the Data Model and Search Engine for a Moment Retrieval Application | |
| Mao | Pathway Curator: An Online Webserver for Extracting Genes and Interactions from Figures | |
| WO2026059574A1 (fr) | Plateforme d'ia de traitement et d'interrogation d'objets spécifiés |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: UNKNOWN |
|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: THE INTERNATIONAL PUBLICATION HAS BEEN MADE |
|
| PUAI | Public reference made under article 153(3) epc to a published international application that has entered the european phase |
Free format text: ORIGINAL CODE: 0009012 |
|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: REQUEST FOR EXAMINATION WAS MADE |
|
| 17P | Request for examination filed |
Effective date: 20251104 |
|
| AK | Designated contracting states |
Kind code of ref document: A1 Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC ME MK MT NL NO PL PT RO RS SE SI SK SM TR |