WO2021185826A1 - Procédé de consolidation d'un ensemble de données pour de la maintenance prédictive et dispositifs associés - Google Patents
Procédé de consolidation d'un ensemble de données pour de la maintenance prédictive et dispositifs associés Download PDFInfo
- Publication number
- WO2021185826A1 WO2021185826A1 PCT/EP2021/056668 EP2021056668W WO2021185826A1 WO 2021185826 A1 WO2021185826 A1 WO 2021185826A1 EP 2021056668 W EP2021056668 W EP 2021056668W WO 2021185826 A1 WO2021185826 A1 WO 2021185826A1
- Authority
- WO
- WIPO (PCT)
- Prior art keywords
- data
- phase
- consolidation
- algorithm
- equipment
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Ceased
Links
Classifications
-
- G—PHYSICS
- G05—CONTROLLING; REGULATING
- G05B—CONTROL OR REGULATING SYSTEMS IN GENERAL; FUNCTIONAL ELEMENTS OF SUCH SYSTEMS; MONITORING OR TESTING ARRANGEMENTS FOR SUCH SYSTEMS OR ELEMENTS
- G05B23/00—Testing or monitoring of control systems or parts thereof
- G05B23/02—Electric testing or monitoring
- G05B23/0205—Electric testing or monitoring by means of a monitoring system capable of detecting and responding to faults
- G05B23/0218—Electric testing or monitoring by means of a monitoring system capable of detecting and responding to faults characterised by the fault detection method dealing with either existing or incipient faults
- G05B23/0221—Preprocessing measurements, e.g. data collection rate adjustment; Standardization of measurements; Time series or signal analysis, e.g. frequency analysis or wavelets; Trustworthiness of measurements; Indexes therefor; Measurements using easily measured parameters to estimate parameters difficult to measure; Virtual sensor creation; De-noising; Sensor fusion; Unconventional preprocessing inherently present in specific fault detection methods like PCA-based methods
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N20/00—Machine learning
- G06N20/10—Machine learning using kernel methods, e.g. support vector machines [SVM]
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/08—Learning methods
- G06N3/088—Non-supervised learning, e.g. competitive learning
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N5/00—Computing arrangements using knowledge-based models
- G06N5/04—Inference or reasoning models
- G06N5/046—Forward inferencing; Production systems
- G06N5/047—Pattern matching networks; Rete networks
Definitions
- the present invention relates to a method for consolidating, in particular the quality, of a set of equipment maintenance data, the set of data being intended for a prediction system suitable for predicting a failure of the equipment from of the dataset.
- the present invention also relates to a prediction system, a computer program product and an associated readable information medium.
- a rare event such as a failure or removal of equipment
- a rare event is an event that occurs, for example, less than 20% of the equipment's uptime and a removal of the equipment is maintenance or a change of the equipment.
- a prediction system allows such anticipation, from maintenance data collected, for example, during the use of the equipment.
- Such a prediction system outputs prediction data representative of the probability that the equipment will experience a failure.
- a method for consolidating, in particular the quality, of a set of equipment maintenance data, the set of data being intended for a prediction system suitable for predicting a failure of the equipment.
- equipment from the set of data
- the consolidation method being implemented by a consolidation system, the method comprising a data formatting phase, to obtain formatted data, a validation phase of the content of the formatted data, to obtain validated data, a phase of determining anomalies in the validated data, the abnormal data being discarded or corrected, to obtain normal data
- the anomalies determination phase comprising the application of two distinct learning algorithms, in particular unsupervised machine learning, and a phase of normal data reliability to reduce any inconsistencies present in the normal data to obtain a consolidated data set.
- the present process proposes a set of processing modules, making use of unsupervised machine learning techniques (which refers to the French name of "machine learning”), to automatically exclude abnormal data, explain their anomalies, and methodically correct the various data quality problems.
- unsupervised machine learning techniques which refers to the French name of "machine learning”
- the consolidation method comprises one or more of the following characteristics, taken in isolation or according to all the technically possible combinations:
- the first learning algorithm is an anomaly detection algorithm and the second learning algorithm is an anomaly localization algorithm.
- the anomaly detection algorithm is an LOF algorithm.
- the anomalies determination phase an extraction of characteristics is implemented from the data validated before the application of the two learning algorithms.
- the extracted characteristics are data concatenations or data obtained by applying mathematical operations, in particular an arithmetic mean.
- the data reliability phase includes, for each missing item of data identified in the data, a step of extrapolation of the normal missing data from other data.
- the validation phase includes testing the compliance of the data with predefined rules, non-compliant data being discarded.
- the present description also relates to a system for consolidating, in particular the quality, of a set of equipment maintenance data, the set of data being intended for a prediction system suitable for predicting a failure of the equipment at from the set of data, the consolidation system comprising a data formatting unit suitable for formatting incident data to obtain formatted data, a unit for validating the content of the formatted data, to obtain validated data, a unit for determination of anomalies in the validated data, the abnormal data being discarded, to obtain normal data, the anomaly determination unit being able to apply two separate learning algorithms, in particular unsupervised machine learning, and a normal data reliability unit to reduce any inconsistencies present in the normal data to obtain a donation set born consolidated.
- the present description also relates to a computer program product comprising a readable information medium, on which is stored a computer program comprising program instructions, the computer program being loadable on a data processing unit. and adapted to cause the implementation of steps of a method as previously described when the computer program is implemented on the data processing unit.
- the present description also relates to a readable information medium comprising program instructions forming a computer program, the computer program being loadable on a data processing unit and adapted to cause the implementation of steps of. a method as described above when the computer program is implemented on the data processing unit.
- FIG. 1 a schematic view of an equipment and a consolidation system from a structural point of view
- FIG. 3 a flowchart of an example of the implementation of a consolidation process.
- the equipment 6 is, for example, electronic equipment such as avionics equipment.
- the equipment 6 is any type of equipment, electronic or not, the deposits of which are to be anticipated over time.
- the equipment 6 is an aircraft piloting system.
- an aircraft is a means of transport capable of ascending and moving at altitude, within the Earth's atmosphere.
- An example of an aircraft is a helicopter or an airplane.
- the aircraft is an airplane.
- the equipment 6 is part of another system, including a transport system such as a train or an automobile.
- the consolidation system 10 is suitable for consolidating a set of maintenance data for an equipment 6 (and in particular the quality), the data set being intended for a prediction system suitable for predicting a failure of the equipment 6. from the dataset
- the consolidation system 10 can be seen as a computer interacting with a computer program product 12 as shown schematically in Figure 1.
- the interaction between the consolidation system 10 and the computer program product 12 enables a method of consolidating a data set to be implemented.
- the consolidation process is thus a process implemented by computer.
- Consolidation System 10 is a desktop computer.
- consolidation system 10 is a rack mounted computer, laptop, tablet, personal digital assistant (PDA), or smartphone.
- the computer is adapted to operate in real time and / or is in an on-board system, in particular in a vehicle such as an airplane.
- the consolidation system 10 comprises a calculation unit 14, a user interface 16 and a communication device 18.
- the computing unit 14 is an electronic circuit designed to manipulate and / or transform data represented by electronic or physical quantities in registers of the consolidation system 10 and / or memories into other similar data corresponding to physical data in register memories or other types of display devices, transmission devices or storage devices.
- the computing unit 14 includes a single-core or multi-core processor (such as a central processing unit (CPU), a graphics processing unit (GPU), a microcontroller, and a digital signal processor ( DSP)), a programmable logic circuit (such as an application-specific integrated circuit (ASIC), an in-situ programmable gate array (FPGA), a programmable logic device (PLD), and programmable logic arrays (PLA)), a state machine, a logic gate, and discrete hardware components.
- a single-core or multi-core processor such as a central processing unit (CPU), a graphics processing unit (GPU), a microcontroller, and a digital signal processor ( DSP)
- a programmable logic circuit such as an application-specific integrated circuit (ASIC), an in-situ programmable gate array (FPGA), a programmable logic device (PLD), and programmable logic arrays (PLA)
- ASIC application-specific integrated circuit
- FPGA in-situ programmable
- the calculation unit 14 comprises a data processing unit 20 suitable for processing data, in particular by performing calculations, memories 22 suitable for storing data and a reader 24 suitable for reading a computer readable medium.
- User interface 16 includes an input device 26 and an output device 28.
- the input device 26 is a device allowing the user of the consolidation system 10 to enter information or orders on the consolidation system 10.
- the input device 26 is a keyboard.
- input device 26 is a pointing device (such as a mouse, touchpad, and graphics tablet), voice recognition device, eye tracker, or haptic device (motion analysis).
- the output device 28 is a graphical user interface, i.e. a display unit designed to provide information to the user of the consolidation system 10.
- the output device 28 is a display screen allowing a visual presentation of the output.
- the device for output is a printer, augmented and / or virtual display unit, loudspeaker or other sound generating device for presenting the output in sound form, a unit producing vibrations and / or odors or a unit suitable for produce an electrical signal.
- the input device 26 and the output device 28 are the same component forming human-machine interfaces, such as an interactive screen.
- Communication device 18 enables one-way or two-way communication between the components of consolidation system 10.
- communication device 18 is a bus communication system or an input / output interface.
- the presence of the communication device 18 allows that, in certain embodiments, the components of the consolidation system 10 are distant from each other.
- the computer program product 12 includes a computer readable medium 32.
- Computer readable medium 32 is a tangible device readable by reader 24 of calculator 14.
- the computer readable medium 32 is not a transient signal per se, such as radio waves or other freely propagating electromagnetic waves, such as light pulses or electronic signals.
- Such a computer readable storage medium 32 is, for example, an electronic storage device, a magnetic storage device, an optical storage device, an electromagnetic storage device, a solid-state storage device or any combination of. these.
- the computer readable storage medium 32 is a mechanically encoded device, such as punch cards or relief structures in a groove, floppy disk, hard disk, ROM. (ROM), random access memory (RAM), programmable read-only erasable memory (EROM), electrically erasable and readable memory (EEPROM), magneto-optical disc, static random access memory (SRAM), compact disc ( CD-ROM), Digital Versatile Disk (DVD), USB flash drive, floppy disk, flash memory, solid-state disk (SSD), or PC card such as a PCMCIA memory card.
- a computer program is stored on the computer readable storage medium 32.
- the computer program includes one or more stored program instruction sequences.
- Such program instructions when executed by the data processing unit 20, result in the execution of steps of the analysis process.
- the form of program instructions is a form of source code, a computer-executable form, or any form intermediate between a source code and a computer-executable form, such as the form resulting from the conversion of the source code through an interpreter. , an assembler, a compiler, a linker or a locator.
- the program instructions are microcode, firmware instructions, state definition data, integrated circuit configuration data (eg, VHDL), or object code.
- Program instructions are written in any combination of one or more languages, for example, an object-oriented programming language (C ++, JAVA, Python), a procedural programming language (eg C language).
- object-oriented programming language C ++, JAVA, Python
- procedural programming language eg C language
- the program instructions are downloaded from an external source via a network, as is notably the case for applications.
- the computer program product comprises a computer readable data medium on which the program instructions are stored or a data medium signal on which the program instructions are encoded.
- the computer program product 12 comprises instructions which can be loaded into the data processing unit 20 and adapted to cause the execution of the analysis method when they are executed by the processing unit. data 20.
- the execution is entirely or partially carried out either on the consolidation system 10, that is to say a single computer, or in a system distributed between several computers (in particular via the. use of cloud computing).
- the consolidation system 10 in operation can be interpreted as comprising a formatting unit 40, a validation unit 42, an anomaly determination unit 44 and a reliability unit 46.
- the validation unit 42 includes a standardization module 48, an evaluation module 50.
- the anomaly determination unit 44 comprises an extraction module 52, an anomaly detection module 54 and an anomaly location module 56.
- the reliability unit 46 comprises an extrapolation module 58, a first elimination module 60 and a second elimination module 62.
- FIG. 3 is a flowchart illustrating an example of implementation of the consolidation method.
- the consolidation process includes a P1 formatting phase, a P2 validation phase, a P3 anomalies determination phase and a P4 reliability phase.
- the consolidation method is applied to raw data which may come from several places, in particular a repair shop or from elements that have occurred during operation of the equipment 6, more particularly during a theft.
- the formatting unit 40 formats incident data.
- the formatting unit 40 takes as input collected raw data and outputs data formatted according to a predefined format.
- the predefined format is a table presenting columns with predefined data types. For example, each entry in a column is a number or each entry in a column is text.
- a table corresponding to the predefined format which brings together several data is called a data set.
- the formatting unit 40 ensures that raw data is converted to the predefined format without modifying the background of the data.
- the formatting unit 40 thus applies to the raw data an information extraction and restructuring algorithm according to the predefined format.
- An example of such an algorithm is an algorithm which transforms data in xml format into an array. If implemented in the Python language, it can use the Ixml package in order to parse xmls.
- the formatting unit 40 also converts the encoding of the data to conform the encoding to the predefined encoding.
- the formatting unit 40 When the formatting unit 40 is unable to format the raw data, the formatting unit 40 quarantines all of the raw data intended to form a set in quarantine pending manual intervention to determine why. raw data cannot conform to the predefined format.
- the validation phase P2 includes a standardization step E21 and an evaluation step E22.
- the validation unit 42 filters the formatted data so as to keep only valid data.
- data is valid when the content of the data conforms to a set of predefined rules.
- the predefined rules are most often syntactic rules.
- a column entitled “country name” imposes as a predefined rule that all the country names present in the column belong to a list of known countries.
- a second example of a predefined rule is that a column is filled with only an integer between two values. By way of illustration, this is the case for a column which gives the age of technicians.
- the standardization step E21 aims to comply with the aforementioned predefined rules.
- the normalization module 48 converts the data to comply with the predefined rule or rules.
- the standardization module 48 is a standardization module.
- the normalization module 48 is able to replace a piece of data with a synonymous piece of data or to convert a piece of data supplied in a first unit into a second unit.
- the normalization module 48 thus makes it possible to obtain data sets which verify the predefined rules.
- the evaluation module 50 tests whether each data set verifies the predefined rules.
- the evaluation module 50 sends the data set to quarantine pending manual intervention.
- the evaluation module 50 validates the data set.
- the phase of determining anomalies P3 comprises an extraction step E31, a step of detecting anomalies E32, a step of locating anomalies E33.
- the extraction module 52 associates a set of characteristics with each data set.
- the characteristics can be the mean value (especially arithmetic) of the data, the minimum value of the data and the maximum value of the data.
- An example of such digital data is the age of the technician in charge of the repair or the length of his professional experience.
- certain characteristics can be calculated using several variables.
- a characteristic in the case where the dataset has two variables, a characteristic can be the number of rows where the two variables differ.
- the anomaly detection module 54 simply denoted detection module 54 in what follows, is able to detect an anomaly in a data set.
- the detection module 54 is able to apply an algorithm to incident data organized into data sets.
- the algorithm applied by the detection module 54 is an anomaly detection algorithm. Such an algorithm is often referred to by the corresponding English name of “outlier detection”.
- the detection module 54 algorithm is an unsupervised learning algorithm, including an unsupervised machine learning algorithm.
- the algorithm takes as input the characteristics obtained in the extraction step for a data set to be evaluated and the characteristics obtained in the extraction step for data sets prior to the data set to be evaluated and outputs a score.
- the score indicates the deviation of the characteristics of the dataset to be examined from the usual values.
- the score is a quantification of the abnormality of the data set to be evaluated.
- the score is a number between 0 and 1.
- the algorithm of the detection module 54 learns from a historical database and is applied to the datasets to be evaluated.
- the anomaly detection algorithm relearns with each new incident data set.
- Such an algorithm is well suited to detecting subtle anomalies but does not provide any indication of the nature of the anomaly.
- LOF refers to the English name of "Local Outlier Factor" which literally means local factor of anomalies.
- the LOF algorithm advantageously uses a measure of the local density deviation of a dataset from older datasets.
- the previous example relating to the age of the technicians can be used, which would be a digital datum whose characteristic “average value” is input to the algorithm of the module. detection 54.
- the algorithm compares with the averages of ages from previous datasets, the algorithm checks whether the dataset to be evaluated is similar or different.
- the algorithm examines whether the average of the ages of the technicians in the dataset to be evaluated has increased significantly compared to the means of the previous datasets. Similarly, the algorithm examines whether the mean has significantly decreased.
- the output of the algorithm will correspond to a score indicating that the dataset to be evaluated is abnormal.
- the presence or absence of an anomaly was determined.
- the anomaly localization module 56 For each set of data detected as abnormal, the anomaly localization module 56, simply called the localization module 56 in what follows, seeks to determine the column (s) (s ) abnormal data set.
- the location module 56 complements the detection module 54 by providing a precise location of the anomaly, and thereby an explanation for the fact that the data set is considered abnormal.
- the locator module 56 applies an algorithm to each characteristic of an anomalous data set independently to determine whether the characteristic is responsible for the anomaly detected by the detection module 54.
- An example of such an algorithm is a Hampel filter algorithm. Such an algorithm is more often referred to by the corresponding English name of “Hampel Filter”.
- the Hampel filter algorithm works in the following way: for a given characteristic, a time window is fixed by the algorithm (6 months for example) and a sliding median is carried out by the algorithm based on the extractions of previous characteristics. The algorithm similarly calculates a median deviation which measures how much the characteristic usually varies in previous datasets. The value of the characteristic in the new extraction is then compared with the current median value: if the difference exceeds the median difference, an alert is issued for the column concerned.
- Such an algorithm thus makes it possible to automatically detect the columns responsible for the anomalies detected with the detection module 54.
- the responsible column (the columns in some cases) for the anomaly of each abnormal data set is found.
- the P4 reliability phase includes an extrapolation step E41, a first elimination step E42 and a second elimination step E43.
- the reliability unit aims to transform normal data into confidence data, the confidence data can be considered as reference data.
- the extrapolation module 58 completes the missing data from the dataset.
- the extrapolation module 58 detects missing data and extrapolates the other data to obtain missing data.
- the other data are, for example, the same data from older sets or data of the same nature from the data set.
- the extrapolation is carried out by applying an average, in particular an arithmetic average.
- the elimination module 60 eliminates conflicting data.
- the first elimination module 60 detects conflicting data using known information.
- An example of contradictory data is: in a dataset, one column indicates that a technician is 20 years old on a given date and another column indicates that on the same date, the same technician has 30 years of seniority in his position. Then, the first elimination module 60 resolves the contradiction, for example by eliminating one of the two data items.
- the second elimination module 62 implements the second elimination step E43.
- the second elimination module 62 seeks to detect duplicates and eliminate the unnecessary occurrence.
- the data are confidence data.
- the consolidation process guarantees greatly increased reliability of the stored data.
- the data, or more precisely the datasets, can then be used in a serene manner, limiting the risks of distorting subsequent analyzes.
- the consolidation method guarantees the validity of the data (that is to say the conformity to a precise data schema and predefined syntactic rules), completeness (the data is said to be complete if there is no no lack of information, such as empty fields or pre-filtered lines), uniqueness of data, absence of inconsistency in all data, accuracy of data and non-obsolescence of data.
- the method thus enables the prediction system to be trained on better quality data.
- the method can also be used to predict a failure of the equipment 6 from the data set, the data then being data relevant for the prediction, for example data selected over a predefined period of time before the instant. prediction, for example 40 flights prior to the next flight for which it is sought to predict whether an item of equipment 6 will fail.
- the method is compatible with any type of data involved in maintenance.
- the maintenance data of an equipment item includes any data having an impact on the operation of the equipment 6.
- the maintenance data includes the manufacturing data of the equipment 6 (in particular where? When? Who ? how?), the data in use of the equipment 6 (in particular the monitoring of the behavior by sensors, for example, the behavior thermal, usage time, consumption or other) and equipment maintenance and / or repair data 6 (including where? when? who? how?).
- maintenance data will be limited to one of the above data types.
- the method could consist in verifying that the measurements are included in a possible interval and do not result from an error of a sensor or that the measurements are expressed in the same unit. , that certain values are not missing (even if it means interpolating them on the basis of the measurement of the previous time and the posterior time).
- the method can also take into account adaptations from one sensor to another or even temporal drifts of a sensor.
Landscapes
- Physics & Mathematics (AREA)
- General Physics & Mathematics (AREA)
- Engineering & Computer Science (AREA)
- Automation & Control Theory (AREA)
- Management, Administration, Business Operations System, And Electronic Commerce (AREA)
- Debugging And Monitoring (AREA)
- Testing And Monitoring For Control Systems (AREA)
Abstract
L'invention concerne un procédé de consolidation d'un ensemble de données de maintenance d'un équipement, l'ensemble de données étant destiné à un système de prédiction propre à prédire une panne de l'équipement à partir de l'ensemble de données, le procédé de consolidation étant mis en œuvre par un système de consolidation et comportant : - une phase de formatage des données, - une phase de validation du contenu des données formatées, - une phase de détermination d'anomalies dans les données validées, les données anormales étant écartées ou corrigées, pour obtenir des données normales, la phase de détermination d'anomalies comprenant l'application de deux algorithmes d'apprentissage distincts, et - une phase de fiabilisation des données normales pour diminuer les incohérences éventuelles présentes dans les données normales pour obtenir un ensemble de données consolidées.
Description
Procédé de consolidation d’un ensemble de données pour de la maintenance prédictive et dispositifs associés
La présente invention concerne un procédé de consolidation, notamment de la qualité, d’un ensemble de données de maintenance d’un équipement, l’ensemble de données étant destiné à un système de prédiction propre à prédire une panne de l’équipement à partir de l’ensemble de données. La présente invention se rapporte également à un système de prédiction, un produit programme d’ordinateur et un support lisible d’informations associés.
Dans le domaine de la maintenance prédictive, il s’agit d’anticiper un événement rare, tel qu’une panne ou une dépose d’un équipement, avant qu’un tel événement ne se produise. Par définition, un événement rare est un événement survenant, par exemple, moins de 20% du temps de fonctionnement de l’équipement et une dépose de l’équipement est une maintenance ou un changement de l’équipement.
Le rôle d’une telle maintenance prédictive est crucial pour les équipements avioniques dans la mesure où une faille d’un équipement entraîne une mise au sol de l’avion affecté.
L’utilisation d’un système de prédiction permet une telle anticipation, à partir de données de maintenance collectées, par exemple, lors de l’utilisation de l’équipement. Un tel système de prédiction fournit en sortie des données de prédiction représentatives de la probabilité que l’équipement subisse une panne.
Toutefois, en pratique, les systèmes de prédiction connus ne donnent pas entière satisfaction notamment du fait d’un taux de fausse alerte trop élevé, ce qui génère des opérations de maintenance coûteuses et inutiles.
Il existe donc un besoin pour un procédé permettant d’obtenir un système de prédiction présentant une meilleure précision, et notamment un taux de fausse alerte plus faible.
A cet effet, il est proposé un procédé de consolidation, notamment de la qualité, d’un ensemble de données de maintenance d’un équipement, l’ensemble de données étant destiné à un système de prédiction propre à prédire une panne de l’équipement à partir de l’ensemble de données, le procédé de consolidation étant mis en œuvre par un système de consolidation, le procédé comportant une phase de formatage des données, pour obtenir des données formatées, une phase de validation du contenu des données formatées, pour obtenir des données validées, une phase de détermination d’anomalies dans les données validées, les données anormales étant écartées ou corrigées, pour
obtenir des données normales, la phase de détermination d’anomalies comprenant l’application de deux algorithmes d’apprentissage, en particulier d’apprentissage automatique non supervisé, distincts, et une phase de fiabilisation des données normales pour diminuer les incohérences éventuelles présentes dans les données normales pour obtenir un ensemble de données consolidées.
Un tel procédé résulte des travaux originaux du demandeur.
En effet, le demandeur lorsqu’il a été confronté au problème d’améliorer la prédiction de panne a fait face à de multiples voies d’amélioration.
Notamment, le demandeur a beaucoup exploré d’améliorer les calculs menés par le procédé.
Toutefois, lors de cette analyse, le demandeur a identifié un problème plus spécifique.
En effet, il est crucial de disposer de données de maintenance fiables, avant leur exploitation via des systèmes de prédiction. Cependant, les données collectées dans l’industrie présentent fréquemment des anomalies, telles que des manques, des incohérences ou des champs invalides. L’utilisation de données anormales peut engendrer des biais et fausser les prédictions issues des systèmes de prédiction.
Pour lever ces risques, le présent procédé propose un ensemble de modules de traitement, faisant appel à des techniques de machine learning (qui renvoie à la dénomination française d’« apprentissage automatique») non supervisé, pour automatiquement exclure les données anormales, expliquer leurs anomalies, et corriger de manière méthodique les différents problèmes de qualité de la donnée.
Suivant des modes de réalisation particuliers, le procédé de consolidation comprend une ou plusieurs des caractéristiques suivantes, prise(s) isolément ou suivant toutes les combinaisons techniquement possibles :
- le premier algorithme d’apprentissage est un algorithme de détection d’anomalies et le deuxième algorithme d’apprentissage est un algorithme de localisation d’anomalies. - l’algorithme de détection d’anomalies est un algorithme de LOF.
- l’algorithme est un filtre de Hampel.
- lors de la phase de détermination d’anomalies, il est mis en œuvre une extraction de caractéristiques à partir des données validées avant l’application des deux algorithmes d’apprentissage.
- les caractéristiques extraites sont des concaténations de données ou des données obtenues par application d’opérations mathématiques, en particulier une moyenne arithmétique.
- la phase de fiabilisation des données comporte, pour chaque donnée manquante identifiée dans les données, une étape d’extrapolation des données normales manquantes à partir d’autres données.
- la phase de fiabilisation des données des étapes d’élimination des éventuels doublons et des éventuelles incohérences.
- la phase de validation comporte le test de la conformité des données avec des règles prédéfinies, les données non conformes étant écartées.
La présente description concerne aussi un système de consolidation, notamment de la qualité, d’un ensemble de données de maintenance d’un équipement, l’ensemble de données étant destiné à un système de prédiction propre à prédire une panne de l’équipement à partir de l’ensemble de données, le système de consolidation comprenant une unité de formatage des données propre à formater des données incidentes pour obtenir des données formatées, une unité de validation du contenu des données formatées, pour obtenir des données validées, une unité de détermination d’anomalies dans les données validées, les données anormales étant écartées, pour obtenir des données normales, l’unité de détermination d’anomalies étant propre à appliquer deux algorithmes d’apprentissage, en particulier d’apprentissage automatique non supervisé, distincts, et une unité de fiabilisation des données normales pour diminuer les incohérences éventuelles présentes dans les données normales pour obtenir un ensemble de données consolidées.
La présente description se rapporte aussi à un produit programme d’ordinateur comportant un support lisible d’informations, sur lequel est mémorisé un programme d’ordinateur comprenant des instructions de programme, le programme d’ordinateur étant chargeable sur une unité de traitement de données et adapté pour entraîner la mise en œuvre d’étapes d’un procédé tel que précédemment décrit lorsque le programme d’ordinateur est mis en œuvre sur l’unité de traitement des données.
La présente description concerne aussi un support lisible d’informations comportant des instructions de programme formant un programme d’ordinateur, le programme d’ordinateur étant chargeable sur une unité de traitement de données et adapté pour entraîner la mise en œuvre d’étapes d’un procédé tel que précédemment décrit lorsque le programme d’ordinateur est mis en œuvre sur l’unité de traitement de données.
D'autres caractéristiques et avantages de l'invention apparaîtront à la lecture de la description qui suit de modes de réalisation de l'invention, donnée à titre d'exemple uniquement et en référence aux dessins qui sont :
- figure 1, une vue schématique d’un équipement et d’un système de consolidation d’un point de vue structurel,
- figure 2, une autre représentation schématique de l’équipement et du système de consolidation de la figure 1 d’un point de vue fonctionnel, et
- figure 3, un ordinogramme d’un exemple de mise en œuvre d’un procédé de consolidation.
Un équipement 6 et un système de consolidation 10 sont représentés sur la figure 1.
L’équipement 6 est, par exemple, un équipement électronique tel qu’un équipement avionique.
Alternativement, l’équipement 6 est n’importe quel type d’équipement, électronique ou non, dont des déposes sont à anticiper au cours du temps.
Par exemple, l’équipement 6 est un système de pilotage d’un aéronef. Par définition, un aéronef est un moyen de transport capable de s'élever et de se mouvoir en altitude, au sein de l'atmosphère terrestre. Un hélicoptère ou un avion est un exemple d’aéronef.
Selon l’exemple décrit, l’aéronef est un avion.
En variante, l’équipement 6 fait partie d’un autre système, notamment un système de transport comme un train ou une automobile.
Le système de consolidation 10 est propre à consolider un ensemble de données de maintenance d’un équipement 6 (et en particulier la qualité), l’ensemble de données étant destiné à un système de prédiction propre à prédire une panne de l’équipement 6 à partir de l’ensemble de données
D’un point de vue strictement matériel, le système de consolidation 10 peut être vu comme un calculateur interagissant avec un produit programme d’ordinateur 12 comme schématiquement représenté sur la figure 1 .
L’interaction entre le système de consolidation 10 et le produit programme d’ordinateur 12 permet la mise en œuvre d’un procédé de consolidation d’un ensemble de données. Le procédé de consolidation est ainsi un procédé mis en œuvre par ordinateur.
Le système de consolidation 10 est un ordinateur de bureau. En variante, le système de consolidation 10 est un ordinateur monté sur un rack, un ordinateur portable, une tablette, un assistant numérique personnel (PDA) ou un smartphone.
Dans des modes de réalisation spécifiques, l'ordinateur est adapté pour fonctionner en temps réel et/ou est dans un système embarqué, notamment dans un véhicule tel qu'un avion.
Dans le cas de la figure 1 , le système de consolidation 10 comprend une unité de calcul 14, une interface utilisateur 16 et un dispositif de communication 18.
L’unité de calcul 14 est un circuit électronique conçu pour manipuler et/ou transformer des données représentées par des quantités électroniques ou physiques dans des registres du système de consolidation 10 et/ou des mémoires en d'autres données similaires correspondant à des données physiques dans les mémoires de registres ou d'autres types de dispositifs d'affichage, de dispositifs de transmission ou de dispositifs de mémorisation.
En tant qu’exemples spécifiques, l’unité de calcul 14 comprend un processeur monocœur ou multicœurs (tel qu’une unité de traitement centrale (CPU), une unité de traitement graphique (GPU), un microcontrôleur et un processeur de signal numérique (DSP)), un circuit logique programmable (comme un circuit intégré spécifique à une application (ASIC), un réseau de portes programmables in situ (FPGA), un dispositif logique programmable (PLD) et des réseaux logiques programmables (PLA)), une machine à états, une porte logique et des composants matériels discrets.
L’unité de calcul 14 comprend une unité de traitement de données 20 adaptée pour traiter des données, notamment en effectuant des calculs, des mémoires 22 adaptées à stocker des données et un lecteur 24 adapté à lire un support lisible par ordinateur.
L'interface utilisateur 16 comprend un dispositif d'entrée 26 et un dispositif de sortie 28.
Le dispositif d’entrée 26 est un dispositif permettant à l'utilisateur du système de consolidation 10 de saisir sur le système de consolidation 10 des informations ou des commandes.
Sur la figure 1, le dispositif d’entrée 26 est un clavier. En variante, le dispositif d’entrée 26 est un périphérique de pointage (tel qu'une souris, un pavé tactile et une tablette graphique), un dispositif de reconnaissance vocale, un oculomètre ou un dispositif haptique (analyse des mouvements).
Le dispositif de sortie 28 est une interface utilisateur graphique, c’est-à-dire une unité d’affichage conçue pour fournir des informations à l’utilisateur du système de consolidation 10.
Sur la figure 1, le dispositif de sortie 28 est un écran d’affichage permettant une présentation visuelle de la sortie. Dans d'autres modes de réalisation, le dispositif de
sortie est une imprimante, une unité d'affichage augmenté et/ou virtuel, un haut-parleur ou un autre dispositif générateur de son pour présenter la sortie sous forme sonore, une unité produisant des vibrations et/ou des odeurs ou une unité adaptée à produire un signal électrique. Dans un mode de réalisation spécifique, le dispositif d'entrée 26 et le dispositif de sortie 28 sont le même composant formant des interfaces homme-machine, tel qu'un écran interactif.
Le dispositif de communication 18 permet une communication unidirectionnelle ou bidirectionnelle entre les composants du système de consolidation 10. Par exemple, le dispositif de communication 18 est un système de communication par bus ou une interface d'entrée / sortie.
La présence du dispositif de communication 18 permet que, dans certains modes de réalisation, les composants du système de consolidation 10 soient distants les uns des autres. Le produit programme informatique 12 comprend un support lisible par ordinateur 32.
Le support lisible par ordinateur 32 est un dispositif tangible lisible par le lecteur 24 de la calculatrice 14.
Notamment, le support lisible par ordinateur 32 n'est pas un signal transitoire en soi, tels que des ondes radio ou d'autres ondes électromagnétiques à propagation libre, telles que des impulsions lumineuses ou des signaux électroniques.
Un tel support de stockage lisible par ordinateur 32 est, par exemple, un dispositif de stockage électronique, un dispositif de stockage magnétique, un dispositif de stockage optique, un dispositif de stockage électromagnétique, un dispositif de stockage à semi- conducteur ou toute combinaison de ceux-ci.
En tant que liste non exhaustive d'exemples plus spécifiques, le support de stockage lisible par ordinateur 32 est un dispositif codé mécaniquement, tel que des cartes perforées ou des structures en relief dans une gorge, une disquette, un disque dur, une mémoire morte (ROM), une mémoire vive (RAM), une mémoire effaçable programmable en lecture seule (EROM), une mémoire effaçable électriquement et lisible (EEPROM), un disque magnéto-optique, une mémoire vive statique (SRAM), un disque compact (CD-ROM), un disque numérique polyvalent (DVD), une clé USB, un disque souple, une mémoire flash, un disque à semi-conducteur (SSD) ou une carte PC telle qu'une carte mémoire PCMCIA.
Un programme d'ordinateur est stocké sur le support de stockage lisible par ordinateur 32. Le programme d'ordinateur comprend une ou plusieurs séquences d'instructions de programme mémorisées.
De telles instructions de programme, lorsqu'elles sont exécutées par l'unité de traitement de données 20, entraînent l'exécution d'étapes du procédé d’analyse.
Par exemple, la forme des instructions de programme est une forme de code source, une forme exécutable par ordinateur ou toute forme intermédiaire entre un code source et une forme exécutable par ordinateur, telle que la forme résultant de la conversion du code source via un interpréteur, un assembleur, un compilateur, un éditeur de liens ou un localisateur. En variante, les instructions de programme sont un microcode, des instructions firmware, des données de définition d’état, des données de configuration pour circuit intégré (par exemple du VHDL) ou un code objet.
Les instructions de programme sont écrites dans n’importe quelle combinaison d’un ou de plusieurs langages, par exemple un langage de programmation orienté objet (C++, JAVA, Python), un langage de programmation procédural (langage C par exemple).
Alternativement, les instructions du programme sont téléchargées depuis une source externe via un réseau, comme c'est notamment le cas pour les applications. Dans ce cas, le produit programme d'ordinateur comprend un support de données lisible par ordinateur sur lequel sont stockées les instructions de programme ou un signal de support de données sur lequel sont codées les instructions de programme.
Dans chaque cas, le produit programme d'ordinateur 12 comprend des instructions qui peuvent être chargées dans l'unité de traitement de données 20 et adaptées pour provoquer l'exécution du procédé d’analyse lorsqu'elles sont exécutées par l'unité de traitement de données 20. Selon les modes de réalisation, l'exécution est entièrement ou partiellement réalisée soit sur le système de consolidation 10, c'est-à-dire un ordinateur unique, soit dans un système distribué entre plusieurs ordinateurs (notamment via l’utilisation de l’informatique en nuage).
D’un point de vue fonctionnel, ainsi que visible à la figure 2, le système de consolidation 10 en fonctionnement peut s’interpréter comme comportant une unité de formatage 40, une unité de validation 42, une unité de détermination d’anomalies 44 et une unité de fiabilisation 46.
L’unité de validation 42 comporte un module de normalisation 48, un module d’évaluation 50.
L’unité de détermination d’anomalies 44 comporte un module d’extraction 52, un module de détection d’anomalies 54 et un module de localisation d’anomalies 56.
L’unité de fiabilisation 46 comporte un module d’extrapolation 58, un premier module d’élimination 60 et un deuxième module d’élimination 62.
Le fonctionnement du système de consolidation 10 sera maintenant mieux compris en référence à la figure 3 qui est un ordinogramme illustrant un exemple de mise en œuvre du procédé de consolidation.
Le procédé de consolidation comporte une phase de formatage P1 , une phase de validation P2, une phase de détermination d’anomalies P3 et une phase de fiabilisation P4.
Le procédé de consolidation s’applique à des données brutes pouvant provenir de plusieurs endroits, notamment un atelier de réparation ou d’éléments survenus en fonctionnement de l’équipement 6, plus particulièrement lors d’un vol.
Lors de la phase de formatage P1 , l’unité de formatage 40 formate des données incidentes.
L’unité de formatage 40 prend en entrée des données brutes collectées et donne en sortie des données formatées selon un format prédéfini.
Selon l’exemple décrit, le format prédéfini est un tableau présentant des colonnes avec des types de données prédéfinis. Par exemple, chaque entrée d’une colonne est un nombre ou chaque entrée d’une colonne est un texte.
Dans la suite de la description, un tableau correspondant au format prédéfini qui rassemble plusieurs données est appelé un jeu de données.
L’unité de formatage 40 assure qu’une donnée brute soit convertie au format prédéfini sans modification du fond de la donnée.
L’unité de formatage 40 applique ainsi aux données brutes un algorithme d’extraction d’information et de restructuration selon le format prédéfini.
Un exemple de tel algorithme est un algorithme qui transforme des données au formai xml en tableau. S’il est implémenté dans le langage Python, il peut faire appel au package Ixml afin d’analyser les xml. L’unité de formatage 40 convertit également l’encodage des données pour conformer l’encodage à l’encodage prédéfini.
Lorsque l’unité de formatage 40 est dans l’incapacité de formater les données brutes, l’unité de formatage 40 met l’ensemble des données brutes destinés à former un jeu en quarantaine dans l’attente d’une intervention manuelle pour déterminer pourquoi les données brutes ne peuvent pas se conformer au format prédéfini.
La phase de validation P2 comporte une étape de normalisation E21 et une étape d’évaluation E22.
Lors de la phase de validation P2, l’unité de validation 42 filtre les données formatées pour ne conserver que des données valides.
Dans le contexte du présent procédé, une donnée est valide lorsque le contenu de la donnée est conforme à un ensemble de règles prédéfinies.
Les règles prédéfinies sont le plus souvent des règles syntaxiques.
Plusieurs exemples de règles sont donnés dans ce qui suit.
Selon un premier exemple, une colonne intitulée « nom du pays » impose comme règle prédéfinie que tous les noms de pays présents dans la colonne appartiennent à une liste de pays connus.
Un deuxième exemple de règle prédéfinie est qu’une colonne soit remplie uniquement de nombre entier compris entre deux valeurs. A titre d’illustration, c’est le cas pour une colonne qui donne l’âge de techniciens.
Selon un troisième exemple, il est exigé que tous les champs contenant des poids soient exprimés en kilogrammes.
L’étape de normalisation E21 vise à respecter les règles prédéfinies précitées.
Le module de normalisation 48 convertit les données pour respecter la ou les règles prédéfinies.
En ce sens, le module de normalisation 48 est un module de standardisation.
A titre d’exemple, le module de normalisation 48 est propre à remplacer une donnée par une donnée synonyme ou à convertir une donnée fournie en une première unité en une deuxième unité.
Le module de normalisation 48 permet ainsi d’obtenir des jeux de données qui vérifient les règles prédéfinies.
Lors de l’étape d’évaluation E22, le module d’évaluation 50 teste si chaque jeu de données vérifie les règles prédéfinies.
Si une seule des règles prédéfinies n’est pas respectée, le module d’évaluation 50 envoie le jeu de données en quarantaine en attente d’une intervention manuelle.
Si toutes les règles prédéfinies sont respectées, le module d’évaluation 50 valide le jeu de données.
A l’issue de la phase de validation P2, il est ainsi obtenu des jeux de données valides, chaque jeu de données invalide ayant été écarté.
La phase de détermination d’anomalies P3 comporte une étape d’extraction E31 , une étape de détection d’anomalies E32, une étape de localisation d’anomalies E33.
Lors de l’étape d’extraction E31 , le module d’extraction 52 associe à chaque jeu de données un ensemble de caractéristiques.
Par exemple, pour des données qui sont des variables numériques, les caractéristiques peuvent être la valeur moyenne (arithmétique notamment) des données, la valeur minimale des données et la valeur maximale des données.
Un exemple de telles données numériques est l’âge du technicien en charge de la réparation ou la durée de son expérience de la profession.
Selon un autre exemple, certaines caractéristiques peuvent être calculées en utilisant plusieurs variables. À titre d’illustration, dans le cas où le jeu de données comporte deux variables, une caractéristique peut être le nombre de lignes où les deux variables diffèrent.
A l’issue de l’étape d’extraction E31 , il est ainsi obtenu un ensemble de caractéristiques extraites.
Lors de l’étape de détection d’anomalies E32, le module de détection d’anomalies 54, simplement noté module de détection 54 dans ce qui suit, est propre à détecter une anomalie dans un jeu de données.
Plus précisément, le module de détection 54 est propre à appliquer un algorithme sur des données incidentes organisées en jeux de données.
L’algorithme appliqué par le module de détection 54 est un algorithme de détection d’anomalies. Un tel algorithme est souvent désigné sous la dénomination anglaise correspondante de « outlier détection ».
Un tel algorithme permet de déterminer les données qui s’écartent de l’habitude.
L’algorithme du module de détection 54 est un algorithme d’apprentissage non supervisée, notamment un algorithme d’apprentissage automatique non supervisée.
L’algorithme prend en entrée les caractéristiques obtenues à l’étape d’extraction pour un jeu de données à évaluer et les caractéristiques obtenues à l’étape d’extraction pour des jeux de données antérieurs au jeu de données à évaluer et donne en sortie un score.
Le fait de disposer des caractéristiques obtenues à l’étape d’extraction pour des jeux de données antérieurs permet à l’algorithme de constituer des valeurs habituelles pour chaque caractéristique.
Le score indique la déviation des caractéristiques du jeu de données à examiner par rapport aux valeurs habituelles.
Autrement formulé, le score est une quantification de l’anormalité du jeu de données à évaluer.
Par exemple, le score est un nombre entre 0 et 1 .
L’algorithme du module de détection 54 apprend sur une base de données historique et est appliqué sur les jeux de données à évaluer.
Plus précisément, pour tenir compte de l’évolution des jeux de données dans le temps, l’algorithme de détections d’anomalie réapprend à chaque nouveau jeu de données incidents.
Un tel algorithme est bien adapté pour détecter des anomalies subtiles mais ne fournit aucune indication sur la nature de l’anomalie.
Un exemple particulier de tel algorithme de détection d’anomalies est l’algorithme de LOF. L’acronyme LOF renvoie à la dénomination anglaise de « Local Outlier Factor » qui signifie littéralement facteur local d’anomalies.
L’algorithme de LOF utilise avantageusement une mesure de la déviation locale de densité d’un jeu de données par rapport aux anciens jeux de données.
Pour illustrer le fonctionnement du module de détection 54 sur un exemple particulier, il peut être utilisé l’exemple précédent concernant l’âge des techniciens qui serait une donnée numérique dont la caractéristique « valeur moyenne » est mise en entrée de l’algorithme du module de détection 54.
L’algorithme compare alors avec les moyennes des âges provenant des précédents jeux de données, l’algorithme vérifie si le jeu de données à évaluer est similaire ou différente.
Notamment, l’algorithme examine si la moyenne des âges des techniciens dans le jeu de données à évaluer a augmenté significativement par rapport aux moyennes des précédents jeux de données. Similairement, l’algorithme examine si la moyenne a diminué significativement.
Si le jeu de données à évaluer est détecté comme anormal, la sortie de l’algorithme correspondra à un score indiquant que le jeu de données à évaluer est anormal.
D’autres algorithmes peuvent être utilisés ici comme un réseau de neurones ou une machine à support de vecteur.
A l’issue de l’étape de détection d’anomalies E32, pour chaque jeu de données, il a été déterminé la présence ou non d’une anomalie.
Lors de l’étape de recherche d’anomalies E33, pour chaque jeu de données détecté comme anormal, le module de localisation d’anomalies 56, dit simplement module de localisation 56 dans ce qui suit, cherche à déterminer la ou les colonne(s) anormale(s) du jeu de données.
En d’autres termes, le module de localisation 56 complète le module de détection 54 en fournissant une localisation précise de l’anomalie, et par là une explication au fait que le jeu de données soit considéré comme anormal.
Le module de localisation 56 applique un algorithme sur chaque caractéristique d’un jeu de données anormal indépendamment pour déterminer si la caractéristique est responsable de l’anomalie détectée par le module de détection 54.
Un exemple de tel algorithme est un algorithme de filtre de Hampel. Un tel algorithme est plus souvent désigné sous la dénomination anglaise correspondante de « Hampel Filter ».
L’algorithme de filtre de Hampel fonctionne de la manière suivante : pour une caractéristique donnée, une fenêtre temporelle est fixée par l’algorithme (6 mois par exemple) et une médiane glissante est effectuée par l’algorithme en se basant sur les extractions de caractéristiques précédentes. L’algorithme calcule de même un écart médian qui mesure à quel point la caractéristique varie habituellement dans les jeux de données précédents. La valeur de la caractéristique dans la nouvelle extraction est alors comparée à la valeur médiane actuelle : si l’écart dépasse l’écart médian une alerte est lancée pour la colonne concernée.
Un tel algorithme permet ainsi de détecter automatiquement les colonnes responsables des anomalies détectées avec le module de détection 54.
A l’issue de l’étape de recherche E33, la colonne responsable (les colonnes dans certains cas) de l’anomalie de chaque jeu de données anormal est trouvée.
A l’issue de la phase de détermination d’anomalies P3, il reste uniquement les données normales qui sont envoyées à la phase de fiabilisation P4.
La phase de fiabilisation P4 comporte une étape d’extrapolation E41, une première étape d’élimination E42 et une deuxième étape d’élimination E43.
Lors de la phase de fiabilisation P4, l’unité de fiabilisation vise à transformer les données normales en données de confiance, les données de confiance pouvant être considérées comme des données de référence.
Lors de l’étape d’extrapolation E41, le module d’extrapolation 58 complète les données manquantes du jeu de données.
Pour cela, le module d’extrapolation 58 détecte une donnée manquante et extrapole les autres données pour obtenir une donnée manquante.
Les autres données sont, par exemple, les mêmes données de jeux plus anciens ou des données de même nature du jeu de données.
A titre d’illustration, l’extrapolation est mise en œuvre par application d’une moyenne, notamment une moyenne arithmétique.
Lors de la première étape d’élimination, le module d’élimination 60 élimine les données contradictoires.
Pour cela, le premier module d’élimination 60 détecte les données contradictoires à l’aide d’informations connues.
Un exemple de données contradictoire est suivant : dans un jeu de données, une colonne indique qu’un technicien a 20 ans à une date donnée et une autre colonne
indique qu’à la même date, le même technicien a 30 ans d’ancienneté dans son poste. Puis, le premier module d’élimination 60 résout la contradiction, par exemple en éliminant une des deux données.
Dans l’exemple proposé, pour lever la contradiction détectée, il est utilisé une donnée complémentaire qui est la date de l’embauche dudit technicien.
Ensuite, le deuxième module d’élimination 62 met en œuvre la deuxième étape d’élimination E43.
Le deuxième module d’élimination 62 cherche à détecter les doublons et à éliminer l’occurrence inutile.
A l’issue de la quatrième phase de fiabilisation P4, les données sont des données de confiance.
Le procédé de consolidation garantit une fiabilisation fortement accrue des données mémorisées. Les données, ou plus précisément les jeux de données, peuvent alors être utilisées de manière sereine, en limitant les risques de fausser les analyses ultérieures.
Plus précisément, le procédé de consolidation garantit la validité des données (c’est-à-dire la conformité à un schéma de données précis et des règles syntaxiques prédéfinies), la complétude (les données sont dites complètes s’il n’y a pas de manque d’information, tels que des champs vides ou des lignes préfiltrées), l’unicité des données, l’absence d’incohérence dans l’ensemble des données, la précision des données et la non-obsolescence des données.
Le procédé permet ainsi d’entraîner le système de prédiction sur des données de meilleure qualité.
Ceci implique que le procédé permet d’obtenir un système de prédiction présentant une meilleure précision, et notamment un taux de fausse alerte plus faible.
Le procédé peut également être utilisé pour prédire une panne de l’équipement 6 à partir de l’ensemble de données, les données étant alors des données pertinentes pour la prédiction, par exemple des données sélectionnées sur une période de temps prédéfini avant l’instant de prédiction, par exemple 40 vols antérieurs au prochain vol pour lequel on cherche à prédire si un équipement 6 va tomber en panne.
En outre, le procédé est compatible avec tout type de données intervenant dans la maintenance. En effet, les données de maintenance d’un équipement incluent toute donnée ayant un impact sur le fonctionnement de l’équipement 6. En particulier, les données de maintenance comprennent les données de fabrication de l’équipement 6 (notamment où ? quand ? qui ? comment ?), les données en utilisation de l’équipement 6 (notamment le suivi du comportement par des capteurs, par exemple, le comportement
thermique, le temps d’utilisation, la consommation ou autres) et les données d’entretien et/ou de réparation de l’équipement 6 (notamment où ? quand ? qui ? comment ?). Dans certains cas, les données de maintenance seront limitées à l’un des types de données précitées. Par exemple, pour le cas de données issues de capteurs, le procédé pourra consister à vérifier que les mesures sont comprises dans un intervalle possible et ne résultent pas d’une erreur d’un capteur ou encore que les mesures sont exprimées dans la même unité, qu’il ne manque pas certaines valeurs (quitte à les interpoler sur la base de la mesure de l’instant antérieur et de l’instant postérieur). Le procédé peut également prendre en compte des adaptations d’un capteur à un autre ou encore des dérives temporelles d’un capteur.
Claims
1. Procédé de consolidation, notamment de la qualité, d’un ensemble de données de maintenance d’un équipement (6), l’ensemble de données étant destiné à un système de prédiction propre à prédire une panne de l’équipement (6) à partir de l’ensemble de données, le procédé de consolidation étant mis en œuvre par un système de consolidation (10), le procédé comportant :
- une phase de formatage des données, pour obtenir des données formatées,
- une phase de validation du contenu des données formatées, pour obtenir des données validées,
- une phase de détermination d’anomalies dans les données validées, les données anormales étant écartées ou corrigées, pour obtenir des données normales, la phase de détermination d’anomalies comprenant l’application de deux algorithmes d’apprentissage, en particulier d’apprentissage automatique non supervisé, distincts, et
- une phase de fiabilisation des données normales pour diminuer les incohérences éventuelles présentes dans les données normales pour obtenir un ensemble de données consolidées.
2. Procédé de consolidation selon la revendication 1 , dans lequel le premier algorithme d’apprentissage est un algorithme de détection d’anomalies et le deuxième algorithme d’apprentissage est un algorithme de localisation d’anomalies.
3. Procédé de consolidation selon la revendication 2, dans lequel l’algorithme de détection d’anomalies est un algorithme de LOF.
4. Procédé de consolidation selon la revendication 2 ou 3, dans lequel l’algorithme est un filtre de Hampel.
5. Procédé de consolidation selon l’une quelconque des revendications 1 à 4, dans lequel, lors de la phase de détermination d’anomalies, il est mis en œuvre une extraction de caractéristiques à partir des données validées avant l’application des deux algorithmes d’apprentissage.
6. Procédé de consolidation selon la revendication 5, dans lequel les caractéristiques extraites sont des concaténations de données ou des données obtenues par application d’opérations mathématiques, en particulier une moyenne arithmétique.
7. Procédé de consolidation selon l’une quelconque des revendications 1 à 6, dans lequel la phase de fiabilisation des données comporte, pour chaque donnée manquante identifiée dans les données, une étape d’extrapolation des données normales manquantes à partir d’autres données.
8. Procédé de consolidation selon l’une quelconque des revendications 1 à
7, dans lequel la phase de fiabilisation des données des étapes d’élimination des éventuels doublons et des éventuelles incohérences.
9. Procédé de consolidation selon l’une quelconque des revendications 1 à
8, dans lequel la phase de validation comporte le test de la conformité des données avec des règles prédéfinies, les données non conformes étant écartées.
10. Système de consolidation (10), notamment de la qualité, d’un ensemble de données de maintenance d’un équipement (6), l’ensemble de données étant destiné à un système de prédiction propre à prédire une panne de l’équipement (6) à partir de l’ensemble de données, le système de consolidation (10) comprenant:
- une unité de formatage des données propre à formater des données incidentes pour obtenir des données formatées,
- une unité de validation du contenu des données formatées, pour obtenir des données validées,
- une unité de détermination d’anomalies dans les données validées, les données anormales étant écartées, pour obtenir des données normales, l’unité de détermination d’anomalies étant propre à appliquer deux algorithmes d’apprentissage, en particulier d’apprentissage automatique non supervisé, distincts, et
- une unité de fiabilisation des données normales pour diminuer les incohérences éventuelles présentes dans les données normales pour obtenir un ensemble de données consolidées.
11. Produit programme d’ordinateur (12) comportant un programme d’ordinateur comprenant des instructions de programme, le programme d’ordinateur étant chargeable sur une unité de traitement de données (20) et adapté pour entraîner la mise en œuvre d’étapes d’un procédé selon l’une quelconque des revendications 1 à 9 lorsque le programme d’ordinateur est mis en œuvre sur l’unité de traitement des données (20).
12. Support lisible d’informations (32) comportant des instructions de programme formant un programme d’ordinateur, le programme d’ordinateur étant chargeable sur une unité de traitement de données (20) et adapté pour entraîner la mise en œuvre d’étapes d’un procédé selon l’une quelconque des revendications 1 à 9 lorsque le programme d’ordinateur est mis en œuvre sur l’unité de traitement de données (20).
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| FR2002546A FR3108186B1 (fr) | 2020-03-16 | 2020-03-16 | Procédé de consolidation d'un ensemble de données pour de la maintenance prédictive et dispositif associé |
| FRFR2002546 | 2020-03-16 |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| WO2021185826A1 true WO2021185826A1 (fr) | 2021-09-23 |
Family
ID=71661993
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| PCT/EP2021/056668 Ceased WO2021185826A1 (fr) | 2020-03-16 | 2021-03-16 | Procédé de consolidation d'un ensemble de données pour de la maintenance prédictive et dispositifs associés |
Country Status (2)
| Country | Link |
|---|---|
| FR (1) | FR3108186B1 (fr) |
| WO (1) | WO2021185826A1 (fr) |
Citations (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| EP3107000A2 (fr) * | 2015-06-17 | 2016-12-21 | Tata Consultancy Services Limited | Système et procédé permettant de détecter des valeurs aberrantes en temps réel pour un signal temps-série univarié |
| CN110471946A (zh) * | 2019-07-08 | 2019-11-19 | 广东工业大学 | 一种基于网格剪枝的lof离群点检测方法及系统 |
-
2020
- 2020-03-16 FR FR2002546A patent/FR3108186B1/fr active Active
-
2021
- 2021-03-16 WO PCT/EP2021/056668 patent/WO2021185826A1/fr not_active Ceased
Patent Citations (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| EP3107000A2 (fr) * | 2015-06-17 | 2016-12-21 | Tata Consultancy Services Limited | Système et procédé permettant de détecter des valeurs aberrantes en temps réel pour un signal temps-série univarié |
| CN110471946A (zh) * | 2019-07-08 | 2019-11-19 | 广东工业大学 | 一种基于网格剪枝的lof离群点检测方法及系统 |
Non-Patent Citations (4)
| Title |
|---|
| ANTUNES ANTONIO LORVAO ET AL: "Adding Value to Sensor Data of Civil Engineering Structures: Automatic Outlier Detection", 2018 9TH INTERNATIONAL CONFERENCE ON INFORMATION, INTELLIGENCE, SYSTEMS AND APPLICATIONS (IISA), IEEE, 23 July 2018 (2018-07-23), pages 1 - 6, XP033511174, DOI: 10.1109/IISA.2018.8633586 * |
| CHENG ZHANGYU CHENGZY@WHUT EDU CN ET AL: "Outlier detection using isolation forest and local outlier factor", PROCEEDINGS OF THE CONFERENCE ON RESEARCH IN ADAPTIVE AND CONVERGENT SYSTEMS, ACMPUB27, NEW YORK, NY, USA, 24 September 2019 (2019-09-24), pages 161 - 168, XP058471793, ISBN: 978-1-4503-6843-8, DOI: 10.1145/3338840.3355641 * |
| LIGHTFOOT LEONARD ET AL: "The effects of synthetically augmented training data on parameter tuning for anomaly detection algorithms", DEFENSE TRANSFORMATION AND NET-CENTRIC SYSTEMS 2011, SPIE, 1000 20TH ST. BELLINGHAM WA 98225-6705 USA, vol. 8062, no. 1, 13 May 2011 (2011-05-13), pages 1 - 11, XP060014074, DOI: 10.1117/12.883526 * |
| XU ZEKUN ET AL: "Automatic Hyperparameter Tuning Method for Local Outlier Factor, with Applications to Anomaly Detection", 2019 IEEE INTERNATIONAL CONFERENCE ON BIG DATA (BIG DATA), IEEE, 9 December 2019 (2019-12-09), pages 4201 - 4207, XP033721319, DOI: 10.1109/BIGDATA47090.2019.9006151 * |
Also Published As
| Publication number | Publication date |
|---|---|
| FR3108186B1 (fr) | 2022-03-25 |
| FR3108186A1 (fr) | 2021-09-17 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| US10255550B1 (en) | Machine learning using multiple input data types | |
| US10366371B2 (en) | Method and apparatus for processing service requests | |
| US10589749B2 (en) | Method and system for early detection of vehicle parts failure | |
| US11004012B2 (en) | Assessment of machine learning performance with limited test data | |
| US20200104990A1 (en) | Region of interest weighted anomaly detection | |
| CN108228428B (zh) | 用于输出信息的方法和装置 | |
| US9715662B2 (en) | Inconsistency detection between structured and non-structured data | |
| CN112613995A (zh) | 异常诊断方法和装置 | |
| CN111210225B (zh) | 交易系统的状态监控方法、装置、设备和存储介质 | |
| US20230206251A1 (en) | Technologies for using machine learning to assess products and product suppliers | |
| CA3053894A1 (fr) | Prediction de defauts a l'aide de donnees historiques d'inspection | |
| US11487782B2 (en) | Data visualization and parsing system | |
| US12266077B2 (en) | Deep learning of entity resolution rules | |
| US20240331121A1 (en) | Systems and methods for auditing image inspection quality | |
| Lockwood et al. | Tests of sunspot number sequences: 3. Effects of regression procedures on the calibration of historic sunspot data | |
| WO2022112583A1 (fr) | Procédé d'évaluation de la performance d'un algorithme de prédiction et dispositifs associés | |
| CN117237126B (zh) | 一种保险平台及保险数据处理方法 | |
| CN114647554A (zh) | 分布式管理集群的性能数据监控方法及装置 | |
| WO2021140957A1 (fr) | Dispositif de traitement d'informations, procédé de traitement d'informations, et programme | |
| EP3846047A1 (fr) | Procédé et système d'identification de variables pertinentes | |
| CN116843452A (zh) | 风险监管方法、装置、设备、介质和程序产品 | |
| WO2021185826A1 (fr) | Procédé de consolidation d'un ensemble de données pour de la maintenance prédictive et dispositifs associés | |
| US20220269984A1 (en) | Continuous learning process using concept drift monitoring | |
| EP3163463A1 (fr) | Dispositif d'estimation de corrélation et procédé correspondant | |
| WO2024189560A1 (fr) | Système et procédé de détection robuste de tendances dans des données séquentielles |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| 121 | Ep: the epo has been informed by wipo that ep was designated in this application |
Ref document number: 21711577 Country of ref document: EP Kind code of ref document: A1 |
|
| NENP | Non-entry into the national phase |
Ref country code: DE |
|
| 122 | Ep: pct application non-entry in european phase |
Ref document number: 21711577 Country of ref document: EP Kind code of ref document: A1 |