EP4437560A1 - Procédé de prédiction du risque de survenue d'une mort subite et dispositifs associés - Google Patents

Procédé de prédiction du risque de survenue d'une mort subite et dispositifs associés

Info

Publication number
EP4437560A1
EP4437560A1 EP22822001.8A EP22822001A EP4437560A1 EP 4437560 A1 EP4437560 A1 EP 4437560A1 EP 22822001 A EP22822001 A EP 22822001A EP 4437560 A1 EP4437560 A1 EP 4437560A1
Authority
EP
European Patent Office
Prior art keywords
data
group
predefined
subject
data relating
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
EP22822001.8A
Other languages
German (de)
English (en)
Inventor
Xavier JOUVEN
Younes YOUSSFI
Wulfran BOUGOUIN
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Medykal Ag
Groupe Des Ecoles Nationales D'economie Et Statistique
Assistance Publique Hopitaux de Paris APHP
Institut National de la Sante et de la Recherche Medicale INSERM
Universite Paris Cite
Original Assignee
Medykal Ag
Groupe Des Ecoles Nationales D'economie Et Statistique
Assistance Publique Hopitaux de Paris APHP
Institut National de la Sante et de la Recherche Medicale INSERM
Universite Paris Cite
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Medykal Ag, Groupe Des Ecoles Nationales D'economie Et Statistique, Assistance Publique Hopitaux de Paris APHP, Institut National de la Sante et de la Recherche Medicale INSERM, Universite Paris Cite filed Critical Medykal Ag
Publication of EP4437560A1 publication Critical patent/EP4437560A1/fr
Pending legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G16INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
    • G16HHEALTHCARE INFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR THE HANDLING OR PROCESSING OF MEDICAL OR HEALTHCARE DATA
    • G16H50/00ICT specially adapted for medical diagnosis, medical simulation or medical data mining; ICT specially adapted for detecting, monitoring or modelling epidemics or pandemics
    • G16H50/20ICT specially adapted for medical diagnosis, medical simulation or medical data mining; ICT specially adapted for detecting, monitoring or modelling epidemics or pandemics for computer-aided diagnosis, e.g. based on medical expert systems
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/04Architecture, e.g. interconnection topology
    • G06N3/044Recurrent networks, e.g. Hopfield networks
    • G06N3/0442Recurrent networks, e.g. Hopfield networks characterised by memory or gating, e.g. long short-term memory [LSTM] or gated recurrent units [GRU]
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/08Learning methods
    • G06N3/094Adversarial learning
    • GPHYSICS
    • G16INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
    • G16HHEALTHCARE INFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR THE HANDLING OR PROCESSING OF MEDICAL OR HEALTHCARE DATA
    • G16H10/00ICT specially adapted for the handling or processing of patient-related medical or healthcare data
    • G16H10/60ICT specially adapted for the handling or processing of patient-related medical or healthcare data for patient-specific data, e.g. for electronic patient records
    • GPHYSICS
    • G16INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
    • G16HHEALTHCARE INFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR THE HANDLING OR PROCESSING OF MEDICAL OR HEALTHCARE DATA
    • G16H20/00ICT specially adapted for therapies or health-improving plans, e.g. for handling prescriptions, for steering therapy or for monitoring patient compliance
    • G16H20/10ICT specially adapted for therapies or health-improving plans, e.g. for handling prescriptions, for steering therapy or for monitoring patient compliance relating to drugs or medications, e.g. for ensuring correct administration to patients
    • GPHYSICS
    • G16INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
    • G16HHEALTHCARE INFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR THE HANDLING OR PROCESSING OF MEDICAL OR HEALTHCARE DATA
    • G16H20/00ICT specially adapted for therapies or health-improving plans, e.g. for handling prescriptions, for steering therapy or for monitoring patient compliance
    • G16H20/60ICT specially adapted for therapies or health-improving plans, e.g. for handling prescriptions, for steering therapy or for monitoring patient compliance relating to nutrition control, e.g. diets
    • GPHYSICS
    • G16INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
    • G16HHEALTHCARE INFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR THE HANDLING OR PROCESSING OF MEDICAL OR HEALTHCARE DATA
    • G16H50/00ICT specially adapted for medical diagnosis, medical simulation or medical data mining; ICT specially adapted for detecting, monitoring or modelling epidemics or pandemics
    • G16H50/70ICT specially adapted for medical diagnosis, medical simulation or medical data mining; ICT specially adapted for detecting, monitoring or modelling epidemics or pandemics for mining of medical data, e.g. analysing previous cases of other patients

Definitions

  • the present invention relates to a method for predicting the risk of occurrence of sudden death in a subject.
  • the present invention also relates to a computer program product and a readable information medium involved in the implementation of the prediction method.
  • Sudden death is defined as unexpected death with no obvious extracardiac cause, occurring with rapid collapse in the presence of a witness, or in the absence of a witness occurring within an hour of the onset of symptoms. This pathology affects 30,000 to 40,000 people per year in France, and approximately 300,000 people per year in Europe.
  • the prognosis remains extremely poor, with survival below 10% in several recent studies.
  • Several tools have been proposed to improve the prognosis, concerning prehospital management, in particular via the chain of survival, early cardiac massage by witnesses, early defibrillation or hospital management (by early coronary management or application of therapeutic hypothermia).
  • the description describes a method for predicting the risk of sudden death occurring in a subject, the method being implemented by computer and comprising the steps of receiving data relating to the health course of a subject, determining from the data relating to the course of health of the membership of the subject to a group among a set of predefined groups, each group being associated with a set of predefined data, to obtain a determined group and a set determined predefined data, searching, for each determined predefined datum, the value of the predefined datum for the subject, to obtain a set of values specific to the subject, and applying a neural network to the values specific to the subject to obtain a risk of occurrence of sudden death in the subject, the neural network being specific to the determined group.
  • the present method differs from a machine learning method for the analysis of the electrocardiogram signal or populations at high cardiovascular risk. Indeed, this type of process is limited to populations at cardiovascular risk.
  • the present invention proposes a prediction on the general population and not only on populations at cardiovascular risk. Indeed, the populations at cardiovascular risk represent only 5% of the population whereas it is necessary to be able to predict the risk of sudden death on the other 95%.
  • the present invention makes it possible to tell whether you are more at risk of dying of sudden death if you have not had your annual dental scaling or are taking psychotropic drugs.
  • the method thus makes it possible to identify people with a high probability of rapidly dying suddenly and requiring implantation of an implanted defibrillator. These people are for the most part not the people classically considered for sudden death since they are not part of the populations at cardiovascular risk. Yet they represent 90% of the total population at risk of sudden death.
  • the present process therefore makes it possible to fight effectively against the scourge of sudden death.
  • the prediction method has one or more of the following characteristics, taken in isolation or according to all the technically possible combinations:
  • each neural network is a gated recurrent neural network.
  • the data received are data relating to the subject's health course during the previous five years.
  • each predefined data is the presence of a disorder or the taking of a drug.
  • the number of predefined data of a group is between 10 and 30, preferably between 15 and 25, advantageously equal to 20.
  • - a group is associated with predefined data relating to a breathing disorder or the taking of a product limiting respiratory disorders.
  • - a group is associated with predefined data relating to a neurological disorder or to the taking of a product limiting neurological disorders.
  • - a group is associated with predefined data relating to a cancerous disorder or the taking of a product limiting cancerous disorders.
  • - a group is associated with predefined data relating to an addiction-related disorder or to the taking of a product limiting addiction-related disorders.
  • - a group is associated with predefined data relating to a disorder linked to aging or to the taking of a product limiting disorders linked to aging.
  • - a group is associated with predefined data relating to a cardiac disorder or to the taking of a product limiting cardiac disorders.
  • the groups are obtained by applying a technique of partitioning into k-means on a set of data comprising data relating to the health course of a set of subjects and each predefined datum of a group is obtained by applying a tool for analyzing language on a data set comprising data relating to the health course of the set of subjects.
  • the data set includes artificial data generated by applying a function to data relating to the health course of a set of subjects.
  • the function is an adversarial neural network.
  • the description also describes a computer program product comprising program instructions forming a computer program stored on a readable information medium, the computer program being loadable on a data processing unit and implementing a method evaluation as previously described when the computer program is implemented on the data processing unit.
  • the description also relates to a readable information medium comprising program instructions forming a computer program, the computer program being loadable on a data processing unit and implementing an evaluation method as previously described when the computer program is implemented on the data processing unit.
  • FIG. 2 is a flowchart of an example of implementation of a method for predicting the risk of occurrence of sudden death in a subject.
  • FIG. 1 A system 10 and a computer program product 12 are shown in Figure 1.
  • the interaction between the system 10 and the computer program product 12 allows the implementation of a method for predicting the risk of occurrence of sudden death in a subject.
  • the prediction method is thus a computer-implemented method.
  • System 10 is a desktop computer.
  • system 10 is a rack-mounted computer, laptop, tablet, personal digital assistant (PDA), or smartphone.
  • PDA personal digital assistant
  • the system 10 comprises a computer 14, a user interface 16 and a communication device 18.
  • the calculator 14 is an electronic circuit designed to manipulate and/or transform data represented by electronic or physical quantities in registers of the system 10 and/or memories into other similar data corresponding to physical data in the register memories. or other types of display devices, transmission devices or storage devices.
  • the computer 14 includes a single-core or multi-core processor (such as a central processing unit (CPU), a graphics processing unit (GPU), a microcontroller, and a digital signal processor (DSP)) , programmable logic circuit (such as application-specific integrated circuit (ASIC), field-programmable gate array (FPGA), programmable logic device (PLD) and programmable logic arrays (P LA)), machine states, a logic gate and discrete hardware components.
  • a single-core or multi-core processor such as a central processing unit (CPU), a graphics processing unit (GPU), a microcontroller, and a digital signal processor (DSP)
  • programmable logic circuit such as application-specific integrated circuit (ASIC), field-programmable gate array (FPGA), programmable logic device (PLD) and programmable logic arrays (P LA)
  • machine states such as a logic gate and discrete hardware components.
  • the computer 14 comprises a data processing unit 20 suitable for processing data, in particular by performing calculations, memories 22 suitable for storing data and a reader 24 suitable for reading a computer-readable medium.
  • the user interface 16 includes an input device 26 and an output device 28.
  • the input device 26 is a device allowing the user of the system 10 to enter information or commands on the system 10.
  • the input device 26 is a keyboard.
  • the input device 26 is a pointing device (such as a mouse, touchpad, and graphics tablet), a voice recognition device, an eye tracker, or a haptic (motion analysis) device.
  • the output device 28 is a graphical user interface, i.e. a display unit designed to provide information to the user of the system 10.
  • the output device 28 is a display screen allowing a visual presentation of the output.
  • the output device 28 is a printer, augmented and/or virtual display unit, speaker, or other sound generating device for presenting the output in sound form, a generating unit vibrations and/or odors or a unit adapted to produce an electrical signal.
  • the input device 26 and the output device 28 are the same component forming human-machine interfaces, such as an interactive screen.
  • the communication device 18 allows unidirectional or bidirectional communication between the components of the system 10.
  • the communication device 18 is a bus communication system or an input/output interface.
  • the presence of the communication device 18 allows that, in certain embodiments, the components of the computer 14 are distant from each other.
  • Computer program product 12 includes computer readable medium 30.
  • the computer-readable medium 30 is a tangible device readable by the reader 14 of the computer 14.
  • the computer-readable medium 30 is not a transient signal per se, such as radio waves or other freely propagating electromagnetic waves, such as light pulses or electronic signals.
  • Such a computer-readable storage medium is, for example, an electronic storage device, a magnetic storage device, an optical storage device, an electromagnetic storage device, a semiconductor storage device, or any combination thereof. these.
  • the computer-readable storage medium 30 is a mechanically encoded device, such as punched cards or raised structures in a groove, floppy disk, hard disk, read only memory (ROM), random access memory (RAM), erasable programmable read-only memory (EROM), electrically erasable and readable memory (EEPROM) , magneto-optical disk, static random access memory (SRAM), compact disk (CD-ROM), digital versatile disk (DVD), USB flash drive, floppy disk, flash memory, solid-state disk (SSD) or a PC card such as a PCMCIA memory card.
  • ROM read only memory
  • RAM random access memory
  • EROM erasable programmable read-only memory
  • EEPROM electrically erasable and readable memory
  • magneto-optical disk magneto-optical disk
  • SRAM static random access memory
  • CD-ROM compact disk
  • DVD digital versatile disk
  • USB flash drive floppy disk
  • SSD solid-state disk
  • PC card such as a PCMCIA memory card.
  • a computer program is stored on the computer-readable storage medium 30.
  • the computer program includes one or more sequences of stored program instructions.
  • Such program instructions when executed by data processing unit 20, cause steps of the estimation method to be executed.
  • the form of program instructions is source code form, computer executable form, or any intermediate form between source code and computer executable form, such as the form resulting from source code conversion through an interpreter , assembler, compiler, linker, or locator.
  • the program instructions are microcode, firmware instructions, state definition data, integrated circuit configuration data (eg VHDL) or object code.
  • Program instructions are written in any combination of one or more languages, for example an object-oriented programming language (FORTRAN, C++, JAVA, HTML), a procedural programming language (C language for example).
  • object-oriented programming language for example
  • C++ JAVA
  • HTML JAVA
  • C language for example
  • program instructions are downloaded from an external source via a network, as is notably the case for applications.
  • the computer program product comprises a computer-readable data carrier on which the program instructions are stored or a data carrier signal on which the program instructions are encoded.
  • the computer program product 12 comprises instructions which can be loaded into the data processing unit 20 and adapted to cause the execution of the prediction method when they are executed by the data processing unit. data 20.
  • the execution is entirely or partially carried out either on the system 10, that is to say a single computer, or in a system distributed between several computers (in particular via the use of the cloud computing).
  • FIG. 2 is a flowchart illustrating an example of implementation of the prediction method.
  • the method is a method of predicting the risk of sudden death occurring in a subject.
  • the subject is an adult human subject.
  • the human subject has any medical profile.
  • the subject may, in particular, not be at cardiovascular risk.
  • the process is intended to apply to any type of population.
  • the process comprises two phases, a preparation phase P1 and an operating phase P2.
  • the preparation phase P1 is implemented by the system 10 or another system. Generally, the P1 preparation phase is implemented well before the P2 operation phase.
  • the preparation phase P1 comprises three steps: a formation step E50, a determination step E52 and a training step E54.
  • the exploitation phase P2 will now be described, which comprises a reception step E56, a determination step E58, a search step E60 and an application step E62.
  • the system 10 receives data relating to the subject's health course for the previous five years.
  • the data relating to the subject are therefore care data.
  • the data relating to the health course lists the hospital stays of a subject, the disorders detected in him, the examinations carried out and the treatments applied.
  • the data relating to the health course are obtained using the subject's answers to questions relating to his previous health course.
  • the duration of 5 years is chosen because the applicant has been able to show that a shorter duration leads to less reliable predictions and that a longer duration does not improve the reliability of the predictions.
  • the data relating to the health course is not recorded signal data, such as an electrocardiogram signal. Only the results of interpretation are taken into account.
  • health journey data is broader than a collection of recorded heart disease signals.
  • the data relating to the health course includes data concerning any type of pathology.
  • health journey data will indicate when scalings have occurred as well as lab results.
  • the data relating to the health course thus includes data chosen from the following classes: medication taken, history, doctor's visit, list of pathologies, laboratory results, intervention of the firefighters, visit to the emergency room and so on.
  • the data relating to the health course includes all the previous classes.
  • the system 10 applies a classification function to the data received at the reception step E50 to determine the group which is the closest.
  • the groups are predefined groups that exhibit relatively similar behaviors with respect to the risk of sudden death occurring.
  • the groups were obtained by applying a k-means partitioning technique to a data set comprising data relating to the health course of a set of subjects.
  • the dataset is, in Applicant's experiments, representative of the general population.
  • the dataset also has enough data related to the occurrence of sudden death to allow the groups to be obtained.
  • the data set includes artificial data generated by applying a function to data relating to the health course of a set of topics.
  • the function is an adversarial neural network which is adapted to generate from care pathway data
  • each group is associated with a set of predefined data.
  • each predefined datum is the presence of a disorder or the intake (administration) of a product.
  • Each predefined datum of a group is obtained by applying a language analysis tool to a set of data comprising data relating to the health course of the set of subjects.
  • the number of predefined data of a group is between 10 and 30, preferably between 15 and 25, advantageously equal to 20.
  • the number of data of the “presence of a disorder” type and the number of data of the “administered product” type are equal.
  • the predefined groups include:
  • - a group is associated with predefined data relating to a cardiac disorder or to the taking of a drug limiting cardiac disorders.
  • the groups, the predefined data are obtained by implementing the step of forming a database E50 and the step of determining the groups and the predefined data E52.
  • the system 10 searches, for each predefined datum determined, the value of the predefined datum for the subject, to obtain a set of values specific to the subject.
  • Such research can, for example, be reduced to an extraction of data from the care pathway.
  • value is here understood in a broad sense as including both binary values (did or did not take the drug) or quantification values (typically a scale between 1 to 10 for pain). It is also possible alternatively or in addition to obtain these values by means of questions to the subject or to nursing staff.
  • the system 10 applies a neural network to the values specific to the subject to obtain a risk of occurrence of sudden death in the subject, the neural network being specific to the determined group.
  • the neural network was learned beforehand, in particular by using the same data which made it possible to find the predefined groups. This corresponds to training stage E54 of the first phase P1.
  • system 10 has in memory the attributes of each predefined group as well as the specific neural networks.
  • neural networks are specific in that their inputs are the values of the predefined data associated with the group considered.
  • the neural network will take as input 10 predefined data values relating to a breathing disorder and 10 values of intake of a drug limiting respiratory disorders.
  • each neural network is a gated recurrent neural network.
  • the probability value is for example expressed as a score for the next three months.
  • the process therefore makes it possible to effectively predict the risk of sudden death.
  • the main objective of these experiments is to predict the occurrence of sudden death in adults, by comparing case data (subjects who have suffered sudden death) and those of four control populations: - population 1: patients with ischemic heart disease who did not experience sudden death,
  • the information relating to the occurrence of the event (Utstein criteria), the management (pre and intra-hospital) and the outcome of the patients (in terms of survival and neurological prognosis) are collected prospectively, with multiple sources and frequent quality checks (making it possible to assess the completeness of 99% of cases in the area of interest).
  • This collection received a favorable opinion from the Advisory Committee on the processing of information in research material (CCTIRS, file N 12.336) and an authorization from the CNIL (decision DR-2012-445).
  • control populations were defined and collected from the medico-administrative databases of the Health Insurance. These populations contain 4 different cohorts of controls, with for each cohort a pairing of 3 controls for 1 control, matched on sex, age and department of residence. 288,000 control individuals were therefore included in these experiments.
  • a control group representative of the general population, was formed with 3 controls for 1 case. 72,000 controls were therefore randomly selected in Paris and in the 3 adjacent departments (Hauts de Seine, Seine- Saint-Denis and Val de Marne), excluding individuals previously included in the three populations defined above.
  • the SNDS is a pseudo-anonymised medico-administrative data warehouse covering the entire French population and containing all the care presented for reimbursement. It is managed by the Caisse Nationale de l'Assurance Maladie and allows link health insurance data (SNIIRAM database), hospital data (PMSI database) and medical causes of death (INSERM C thoroughlyDC database).
  • the data analyzed in this study correspond to all of the individual health and medical consumption data that gave rise to reimbursement: examinations and medical devices, hospitalizations, drugs and long-term illnesses.
  • the Applicant has developed a classification model (more often referred to under the corresponding English name of “clustering”) of the sudden death population, by exploiting the care trajectories observed over a period of 5 years before cardiac arrest.
  • this algorithm includes the use of a language analysis tool followed by the use of a k-means partitioning algorithm.
  • the language analysis tool makes it possible to represent patients based on the temporal information contained in their care trajectory.
  • the Claimant used the Word2Vec algorithm.
  • the k-means partitioning algorithm is more often referred to by the corresponding English term “k-means”.
  • the algorithm makes it possible to identify relevant groups (“clusters”) for the prediction of sudden death.
  • Group 1 the characteristics of which are explained below.
  • the first group is characterized by the following elements: Table 1
  • the fourth group is characterized by the following elements: [Table 13]
  • the applicant compared the performance of different statistical techniques of supervised classification.
  • the applicant has iteratively divided the data into two sets: a training set and a test set with a ratio of 9 to 1 (for 10 data available, 9 are used for training and 1 for testing.
  • the games are modified so that the proportion of sudden death (sometimes referred to by the term SCD for the corresponding English denomination of "Sudden Cardiac Death" literally meaning sudden death by cardiac arrest) in a game is the same in each of the games. .
  • the applicant then calculated the area under the curve (more often designated by the acronym AUC referring to the corresponding English name of "Area Under Curve”), the positive prediction value (more often designated by the acronym PPV referring to the corresponding English denomination of “Positive Predictive Value”) and sensitivity.
  • the techniques compared are 3 techniques namely:
  • Tables 29 to 32 give the performances on 4 models for a prediction of sudden death at one year.
  • the first M1 model corresponds to the SCD comparison with the general population
  • the second M2 model corresponds to the SCD comparison with acute myocardial infarction (more often designated by the acronym AMI which refers to the corresponding English denomination of "Acute Myocardial Infarction”
  • the third model M3 corresponds to the comparison SCD with chronic heart failure (more often designated by the acronym HF which refers to the corresponding English name of "Heart Failure")
  • the fourth model M4 corresponds to the comparison SCD with ischemic heart disease (more often referred to by the acronym IHD which refers to the corresponding English name of "Ischemic Heart Disease”).
  • the applicant has selected a gated recurrent neural network.
  • the applicant used the 7 groups determined using the aforementioned classification technique and resorted to data augmentation techniques (more often referred to as "data augmentation") to artificially increase the number of cases of sudden death in each of the groups during the training phases of the neural network. This makes it possible to compensate for the imbalance of each group (1 case of sudden death for 12 control individuals).
  • GAN Generic Adversarial Networks
  • An algorithm for predicting the risk of occurrence of sudden death in a subject for each group is thus obtained.
  • the output of the algorithm developed by the applicant is then a quarterly score (there are therefore 4 risk scores for a time window of 1 year) and adapted according to the population (one of the 7 groups) to which the individual belongs.
  • the applicant also used an algorithm for interpreting the results.
  • the algorithm selected by the plaintiff is the SAE, an abbreviation which refers to the name “Shapley Additive Explanation” literally meaning Shapley’s additive explanation. This makes it possible to obtain the most important risk factors that explain these predictions for each individual.

Landscapes

  • Engineering & Computer Science (AREA)
  • Health & Medical Sciences (AREA)
  • Public Health (AREA)
  • Medical Informatics (AREA)
  • General Health & Medical Sciences (AREA)
  • Biomedical Technology (AREA)
  • Data Mining & Analysis (AREA)
  • Primary Health Care (AREA)
  • Epidemiology (AREA)
  • Theoretical Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • Pathology (AREA)
  • Databases & Information Systems (AREA)
  • Computational Linguistics (AREA)
  • Artificial Intelligence (AREA)
  • Mathematical Physics (AREA)
  • Software Systems (AREA)
  • General Engineering & Computer Science (AREA)
  • Life Sciences & Earth Sciences (AREA)
  • Computing Systems (AREA)
  • Molecular Biology (AREA)
  • Evolutionary Computation (AREA)
  • Biophysics (AREA)
  • General Physics & Mathematics (AREA)
  • Bioinformatics & Cheminformatics (AREA)
  • Medicinal Chemistry (AREA)
  • Chemical & Material Sciences (AREA)
  • Nutrition Science (AREA)
  • Medical Treatment And Welfare Office Work (AREA)
  • Measuring And Recording Apparatus For Diagnosis (AREA)
  • Management, Administration, Business Operations System, And Electronic Commerce (AREA)

Abstract

La présente invention concerne un procédé de prédiction du risque de survenue d'une mort subite chez un sujet, le procédé étant mis en œuvre par ordinateur et comprenant les étapes de : - réception de données relatives au parcours de santé d'un sujet, - détermination à partir des données reçues de l'appartenance du sujet à un groupe parmi un ensemble de groupes prédéfinis, chaque groupe étant associé à un ensemble de données prédéfinies, - recherche, pour chaque donnée prédéfinie déterminée, de la valeur de la donnée prédéfinie pour le sujet, pour obtenir un ensemble de valeurs propres au sujet, et - application d'un réseau de neurones sur les valeurs propres au sujet pour obtenir un risque de survenue d'une mort subite chez le sujet, le réseau de neurones étant spécifique du groupe déterminé.

Description

Procédé de prédiction du risque de survenue d’une mort subite et dispositifs associés
DOMAINE TECHNIQUE DE L’INVENTION
La présente invention concerne un procédé de prédiction du risque de survenue d’une mort subite chez un sujet. La présente invention se rapporte également à un produit programme d’ordinateur et un support lisible d’informations impliqués dans le mise en œuvre du procédé de prédiction.
ARRIERE-PLAN TECHNOLOGIQUE DE L’INVENTION
La mort subite est définie comme une mort inattendue sans cause extracardiaque évidente, survenant avec un effondrement rapide en présence d’un témoin, ou en l’absence de témoin survenant dans l’heure après le début des symptômes. Cette pathologie touche 30 000 à 40 000 personnes par an en France, et environ 300 000 personnes par an en Europe.
Le pronostic demeure extrêmement sombre, avec une survie inférieure à 10% dans plusieurs études récentes. Plusieurs outils ont été proposés pour améliorer le pronostic, concernant la prise en charge préhospitalière, notamment via la chaîne de survie, le massage cardiaque précoce par les témoins, la défibrillation précoce ou la prise en charge hospitalière (par la prise en charge coronaire précoce ou l’application d’une hypothermie thérapeutique).
Les résultats en termes de survie restent néanmoins décevants, en dépit d’un infléchissement récent selon certaines études.
Considérant ces résultats modestes sur le versant thérapeutique, plusieurs alternatives préventives ont été proposées pour prévenir la survenue de tels événements. Ainsi, le développement des traitements antiarythimiques et des défibrillateurs automatiques implantables ont permis une prévention significative chez des patients identifiés à haut risque de mort subite.
L’optimisation de l’usage de ces traitements préventifs repose donc sur l’identification des patients à risque.
Dans ce contexte, si de nombreuses recherches ont été menées sur le versant "post-événement", notamment sur le soin apporté aux patients victimes d’une mort subite, la prédiction de la survenue d’un tel événement reste difficile. L’identification des patients à risque demeure donc un enjeu de recherche majeur, avec des résultats jusqu’à présent décevants. Certains groupes de patients à très haut risque de mort subite ont été identifiés (cardiopathies pro-arythmogènes spécifiques, structurelles ou électriques) et bénéficient d’ores et déjà d’une prise en charge rythmologique spécialisée.
Mais du point de vue épidémiologique, ceux-ci ne constituent qu’une fraction très restreinte de l’ensemble de la population concernée, et la grande majorité des patients victimes d’une mort subite ne font pas partie de ces populations. En effet, le principal pourvoyeur de morts subites demeure à l’heure actuelle la cardiopathie ischémique, que ce soit à l’occasion d’un évènement aigu (infarctus du myocarde) ou lors du suivi de ces malades. La cohorte des patients atteints d’une cardiopathie ischémique est très importante, et seule une faible proportion d’entre eux présentera au cours de l’évolution une mort subite.
Il existe par conséquent une discordance entre une population à très haut risque individuel mais d’effectif limité (cardiopathies pro-arythmogènes spécifiques, structurelles ou électriques) et une population à faible risque individuel mais d’effectif très important (cardiopathies ischémiques), qui constitue donc l’essentiel des patients victimes de mort subite en population générale.
Le challenge de la prédiction de la mort subite demeure donc entier, puisque la plupart des patients ne peuvent bénéficier d’une stratification individuelle du risque, en l’absence de facteurs de risque en population clairement identifiés (à l’inverse du risque cardiovasculaire global par exemple, pour lequel des outils tels que le score de Framingham permettent une évaluation du risque individuel).
Certains facteurs de risque, notamment les antécédents familiaux, ont été proposés pour stratifier ce risque individuel. Parmi la population des patients atteints de cardiopathie ischémique, qui constituent la majorité des victimes de mort subite, la prédiction repose actuellement essentiellement sur la fraction d’éjection du ventricule gauche, avec des résultats relativement décevants.
RESUME DE L’INVENTION
Il existe donc un besoin pour un procédé permettant de prédire le risque de survenue d’une mort subite chez un sujet.
A cet effet, la description décrit un procédé de prédiction du risque de survenue d’une mort subite chez un sujet, le procédé étant mis en œuvre par ordinateur et comprenant les étapes de réception de données relatives au parcours de santé d’un sujet, de détermination à partir des données relatives au parcours de santé de l’appartenance du sujet à un groupe parmi un ensemble de groupes prédéfinis, chaque groupe étant associé à un ensemble de données prédéfinies, pour obtenir un groupe déterminé et un ensemble de données prédéfinies déterminées, de recherche, pour chaque donnée prédéfinie déterminée, de la valeur de la donnée prédéfinie pour le sujet, pour obtenir un ensemble de valeurs propres au sujet, et d’application d’un réseau de neurones sur les valeurs propres au sujet pour obtenir un risque de survenue d’une mort subite chez le sujet, le réseau de neurones étant spécifique du groupe déterminé.
Le présent procédé diffère d’un procédé de machine learning pour l'analyse du signal de d'électrocardiogramme ou des populations à haut risque cardiovasculaire. En effet, ce type de procédé est limité aux populations à risque cardiovasculaire.
Par contraste, la présente invention propose une prédiction sur la population générale et non seulement sur les populations à risque cardiovasculaire. En effet, les populations à risque cardiovasculaire ne représentent que 5% de la population alors qu’il convient d’être capable de prédire le risque de mort subite sur les 95% autre.
Cela conduit à l’identification de nouveaux groupes, les 8 groupes mentionnés dans la présente demande. A ce jour, aucun de ces groupes n’avaient été identifié ainsi.
Par exemple, la présente invention permet de dire si vous êtes plus à risque de mourir de mort subite si vous n'avez pas fait vos détartrages de dents annuel ou prenez des médicaments psychotropes.
Le procédé permet ainsi d'identifier des personnes à forte probabilité de faire une mort subite rapidement et nécessitant une implantation d'un défibrillateur implanté. Ces personnes ne sont en grande majorité pas les personnes classiquement considérés pour la mort subite puisque ne faisant partie des populations à risque cardiovasculaire. Elles représentent pourtant 90% de la population totale à risque de mort subite.
Le présent procédé permet donc de lutter efficacement contre le fléau qu’est la mort subite.
Selon des modes de réalisation particuliers, le procédé de prédiction présente une ou plusieurs des caractéristiques suivantes, prise(s) isolément ou selon toutes les combinaisons techniquement possibles :
- chaque réseau de neurones est un réseau de neurones récurrents à porte.
- les données reçues sont des données relatives au parcours de santé du sujet durant les cinq années précédentes.
- chaque donnée prédéfinie est la présence d’un trouble ou la prise d’un médicament.
- le nombre de données prédéfinies d’un groupe est compris entre 10 et 30, de préférence compris entre 15 et 25, avantageusement égal à 20.
- un groupe est associé à des données prédéfinies relatives à un trouble de la respiration ou à la prise d’un produit limitant les troubles respiratoires. - un groupe est associé à des données prédéfinies relatives à un trouble neurologique ou à la prise d’un produit limitant les troubles neurologiques.
- un groupe est associé à des données prédéfinies relatives à un trouble cancéreux ou à la prise d’un produit limitant les troubles cancéreux.
- un groupe est associé à des données prédéfinies relatives à un trouble lié à une addiction ou à la prise d’un produit limitant les troubles liés à une addiction.
- un groupe est associé à des données prédéfinies relatives à un trouble lié au vieillissement ou à la prise d’un produit limitant les troubles liés au vieillissement.
- un groupe est associé à des données prédéfinies relatives à un trouble cardiaque ou à la prise d’un produit limitant les troubles cardiaques.
- les groupes sont obtenus par application d’une technique de partitionnement en k- moyennes sur un ensemble de données comprenant des données relatives au parcours de santé d’un ensemble de sujets et chaque donnée prédéfinie d’un groupe est obtenue par application d’un outil d’analyse du langage sur un ensemble de données comprenant des données relatives au parcours de santé de l’ensemble de sujets.
- l’ensemble de données comporte des données artificielles générés par application d’une fonction sur des données relatives au parcours de santé d’un ensemble de sujets.
- la fonction est un réseau de neurones adverse.
La description décrit également un produit programme d’ordinateur comportant des instructions de programme formant un programme d’ordinateur mémorisé sur un support lisible d’informations, le programme d’ordinateur étant chargeable sur une unité de traitement de données et mettant en œuvre un procédé d’évaluation tel que précédemment décrit lorsque le programme d’ordinateur est mis en œuvre sur l’unité de traitement des données.
La description concerne également un support lisible d’informations comportant des instructions de programme formant un programme d’ordinateur, le programme d’ordinateur étant chargeable sur une unité de traitement de données et mettant en œuvre un procédé d’évaluation tel que précédemment décrit lorsque le programme d’ordinateur est mis en œuvre sur l’unité de traitement de données.
BREVE DESCRIPTION DES FIGURES
Des caractéristiques et avantages de l’invention apparaîtront à la lecture de la description qui va suivre, donnée uniquement à titre d’exemple non limitatif, et faite en référence aux dessins annexés, sur lesquels : - la figure 1 est une représentation schématique d’un système et d’un produit programme d’ordinateur, et
- la figure 2 est un ordinogramme d’un exemple de mise en œuvre d’un procédé de prédiction du risque de survenue d’une mort subite chez un sujet.
DESCRIPTION DETAILLEE DE MODES DE REALISATION PREFERES
DESCRIPTION DU SYSTEME UTILISE
Un système 10 et un produit programme d’ordinateur 12 sont représentés sur la figure 1.
L’interaction entre le système 10 et le produit programme d’ordinateur 12 permet la mise en œuvre d’un procédé de prédiction du risque de survenue d’une mort subite chez un sujet. Le procédé de prédiction est ainsi un procédé mis en œuvre par ordinateur.
Le système 10 est un ordinateur de bureau. En variante, le système 10 est un ordinateur monté sur un rack, un ordinateur portable, une tablette, un assistant numérique personnel (PDA) ou un smartphone.
Dans le cas de la figure 1 , le système 10 comprend un calculateur 14, une interface utilisateur 16 et un dispositif de communication 18.
Le calculateur 14 est un circuit électronique conçu pour manipuler et/ou transformer des données représentées par des quantités électroniques ou physiques dans des registres du système 10 et/ou des mémoires en d'autres données similaires correspondant à des données physiques dans les mémoires de registres ou d'autres types de dispositifs d'affichage, de dispositifs de transmission ou de dispositifs de mémorisation.
En tant qu’exemples spécifiques, le calculateur 14 comprend un processeur monocœur ou multicœurs (tel qu’une unité de traitement centrale (CPU), une unité de traitement graphique (GPU), un microcontrôleur et un processeur de signal numérique (DSP)), un circuit logique programmable (comme un circuit intégré spécifique à une application (ASIC), un réseau de portes programmables in situ (FPGA), un dispositif logique programmable (PLD) et des réseaux logiques programmables (P LA)) , une machine à états, une porte logique et des composants matériels discrets.
Le calculateur 14 comprend une unité de traitement de données 20 adaptée pour traiter des données, notamment en effectuant des calculs, des mémoires 22 adaptées à stocker des données et un lecteur 24 adapté à lire un support lisible par ordinateur.
L'interface utilisateur 16 comprend un dispositif d'entrée 26 et un dispositif de sortie 28. Le dispositif d’entrée 26 est un dispositif permettant à l'utilisateur du système 10 de saisir sur le système 10 des informations ou des commandes.
Sur la figure 1 , le dispositif d’entrée 26 est un clavier. En variante, le dispositif d’entrée 26 est un périphérique de pointage (tel qu'une souris, un pavé tactile et une tablette graphique), un dispositif de reconnaissance vocale, un oculomètre ou un dispositif haptique (analyse des mouvements).
Le dispositif de sortie 28 est une interface utilisateur graphique, c’est-à-dire une unité d’affichage conçue pour fournir des informations à l’utilisateur du système 10.
Sur la figure 1 , le dispositif de sortie 28 est un écran d’affichage permettant une présentation visuelle de la sortie. Dans d'autres modes de réalisation, le dispositif de sortie 28 est une imprimante, une unité d'affichage augmenté et/ou virtuel, un haut-parleur ou un autre dispositif générateur de son pour présenter la sortie sous forme sonore, une unité produisant des vibrations et/ou des odeurs ou une unité adaptée à produire un signal électrique.
Dans un mode de réalisation spécifique, le dispositif d'entrée 26 et le dispositif de sortie 28 sont le même composant formant des interfaces homme-machine, tel qu'un écran interactif.
Le dispositif de communication 18 permet une communication unidirectionnelle ou bidirectionnelle entre les composants du système 10. Par exemple, le dispositif de communication 18 est un système de communication par bus ou une interface d'entrée / sortie.
La présence du dispositif de communication 18 permet que, dans certains modes de réalisation, les composants du calculateur 14 soient distants les uns des autres.
Le produit programme informatique 12 comprend un support lisible par ordinateur 30.
Le support lisible par ordinateur 30 est un dispositif tangible lisible par le lecteur 14 du calculateur 14.
Notamment, le support lisible par ordinateur 30 n'est pas un signal transitoire en soi, tels que des ondes radio ou d'autres ondes électromagnétiques à propagation libre, telles que des impulsions lumineuses ou des signaux électroniques.
Un tel support de stockage lisible par ordinateur 30 est, par exemple, un dispositif de stockage électronique, un dispositif de stockage magnétique, un dispositif de stockage optique, un dispositif de stockage électromagnétique, un dispositif de stockage à semi- conducteur ou toute combinaison de ceux-ci.
En tant que liste non exhaustive d'exemples plus spécifiques, le support de stockage lisible par ordinateur 30 est un dispositif codé mécaniquement, tel que des cartes perforées ou des structures en relief dans une gorge, une disquette, un disque dur, une mémoire morte (ROM), une mémoire vive (RAM), une mémoire effaçable programmable en lecture seule (EROM), une mémoire effaçable électriquement et lisible (EEPROM), un disque magnéto-optique, une mémoire vive statique (SRAM), un disque compact (CD-ROM), un disque numérique polyvalent (DVD), une clé USB, un disque souple, une mémoire flash, un disque à semi-conducteur (SSD) ou une carte PC telle qu'une carte mémoire PCMCIA.
Un programme d'ordinateur est stocké sur le support de stockage lisible par ordinateur 30. Le programme d'ordinateur comprend une ou plusieurs séquences d'instructions de programme mémorisées.
De telles instructions de programme, lorsqu'elles sont exécutées par l'unité de traitement de données 20, entraînent l'exécution d'étapes du procédé d’estimation.
Par exemple, la forme des instructions de programme est une forme de code source, une forme exécutable par ordinateur ou toute forme intermédiaire entre un code source et une forme exécutable par ordinateur, telle que la forme résultant de la conversion du code source via un interpréteur, un assembleur, un compilateur, un éditeur de liens ou un localisateur. En variante, les instructions de programme sont un microcode, des instructions firmware, des données de définition d’état, des données de configuration pour circuit intégré (par exemple du VHDL) ou un code objet.
Les instructions de programme sont écrites dans n’importe quelle combinaison d’un ou de plusieurs langages, par exemple un langage de programmation orienté objet (FORTRAN, C++, JAVA, HTML), un langage de programmation procédural (langage C par exemple).
Alternativement, les instructions du programme sont téléchargées depuis une source externe via un réseau, comme c'est notamment le cas pour les applications. Dans ce cas, le produit programme d'ordinateur comprend un support de données lisible par ordinateur sur lequel sont stockées les instructions de programme ou un signal de support de données sur lequel sont codées les instructions de programme.
Dans chaque cas, le produit programme d'ordinateur 12 comprend des instructions qui peuvent être chargées dans l'unité de traitement de données 20 et adaptées pour provoquer l'exécution du procédé de prédiction lorsqu'elles sont exécutées par l'unité de traitement de données 20. Selon les modes de réalisation, l'exécution est entièrement ou partiellement réalisée soit sur le système 10, c'est-à-dire un ordinateur unique, soit dans un système distribué entre plusieurs ordinateurs (notamment via l’utilisation de l’informatique en nuage).
Le fonctionnement du système 10 est maintenant décrit en référence à la figure 2 qui est un ordinogramme illustrant un exemple de mise en œuvre du procédé de prédiction. Le procédé est un procédé de prédiction du risque de survenue d’une mort subite chez un sujet.
A titre d’exemple non limitatif, le sujet est un sujet humain adulte.
Le sujet humain a n’importe quel profil médical. Le sujet peut, en particulier, ne pas être à risque cardiovasculaire.
Le procédé a vocation à s’appliquer à tout type de population.
Le procédé comporte deux phases, une phase de préparation P1 et une phase d’exploitation P2.
Selon les cas, la phase de préparation P1 est mis en œuvre par le système 10 ou un autre système. Généralement la phase de préparation P1 est mise en œuvre bien avant la phase d’exploitation P2.
En l’espèce, comme cela sera décrit plus tard, la phase de préparation P1 comporte trois étapes : une étape de formation E50, une étape de détermination E52 et une étape d’entraînement E54.
Il va maintenant être décrit la phase d’exploitation P2 qui comporte une étape de réception E56, une étape de détermination E58, une étape de recherche E60 et une étape d’application E62.
Lors de l’étape de réception E56, le système 10 reçoit des données relatives au parcours de santé du sujet des cinq années précédentes.
Les données relatives au sujet sont donc des données de soin.
Les données relatives au parcours de santé répertorient les séjours hospitaliers d’un sujet, les troubles détectés chez lui, les examens réalisés et les traitements appliqués.
En France, ces données sont disponibles par le biais d’un organisme public, typiquement la sécurité sociale ou l’Agence Régionale de Santé.
Néanmoins, il pourrait être envisagé que les données relatives au parcours de santé soient obtenues à l’aide des réponses du sujet à des questions relatives à son parcours de santé antérieur.
La durée de 5 ans est choisie car la demanderesse a pu montrer qu’une durée moindre conduit à des prédictions moins fiables et qu’une durée supérieure ne permet pas de gagner en fiabilité des prédictions.
Il peut être précisé ici que les données relatives au parcours de santé ne sont pas des données de signaux enregistrés, tel un signal d’électrocardiogramme. Seules les résultats d’interprétation sont pris en compte.
En outre, les données relatives au parcours de santé sont plus larges qu’une collection de signaux enregistrés relatives aux cardiopathies. En particulier, les données relatives au parcours de santé regroupent des données concernant tout type de pathologie. Par exemple, les données relatives au parcours de santé vont tout aussi bien indiquer quand des détartrages ont eu lieu que des résultats de laboratoire.
De plus, les données relatives au parcours de santé sont hétérogènes au sens où elles regroupent des données de nature différente.
Les données relatives au parcours de santé regroupent ainsi des données choisies dans les classes suivantes : médicaments pris, antécédents, visite de médecins, liste des pathologies, résultats de laboratoire, intervention des pompiers, visite aux urgence et ainsi de suite.
De préférence, les données relatives au parcours de santé regroupent l’ensemble des classes précédentes.
Lors de l’étape de détermination E58, le système 10 cherche parmi un ensemble de groupes prédéfinis à quel groupe appartient le sujet.
Pour cela, le système 10 applique une fonction de classification sur les données reçues à l’étape de réception E50 pour déterminer le groupe qui est le plus proche.
Les groupes sont des groupes prédéfinis qui présentent des comportements relativement similaires par rapport au risque de survenue de la mort subite.
Les groupes ont été obtenus par application d’une technique de partitionnement en k-moyennes sur un ensemble de données comprenant des données relatives au parcours de santé d’un ensemble de sujets.
L’ensemble de données est, dans les expériences de la demanderesse, représentatif de la population générale.
L’ensemble de données comporte également suffisamment de données liées à la survenue d’une mort subite pour permettre l’obtention des groupes.
En présence d’un échantillon insuffisant ou mal équilibré (sous-représentation des cas de mort subite), l’ensemble de données comporte des données artificielles générés par application d’une fonction sur des données relatives au parcours de santé d’un ensemble de sujets.
Selon un exemple particulier, la fonction est un réseau de neurones adverse qui est adapté pour générer à partir de données de parcours de soins
Par ailleurs, chaque groupe est associé à un ensemble de données prédéfinies.
Dans l’exemple décrit, chaque donnée prédéfinie est la présence d’un trouble ou la prise (administration) d’un produit. Chaque donnée prédéfinie d’un groupe est obtenue par application d’un outil d’analyse du langage sur un ensemble de données comprenant des données relatives au parcours de santé de l’ensemble de sujets.
Le nombre de données prédéfinies d’un groupe est compris entre 10 et 30, de préférence compris entre 15 et 25, avantageusement égal à 20.
Par ailleurs, de préférence, le nombre de données du type « présence d’un trouble » et le nombre de données du type « produit administré » sont égaux.
Selon l’exemple décrit, les groupes prédéfinis comprennent :
- un groupe associé à des données prédéfinies relatives à un trouble de la respiration ou à la prise d’un médicament limitant les troubles respiratoires,
- un groupe associé à des données prédéfinies relatives à un trouble neurologique ou à la prise d’un médicament limitant les troubles neurologiques,
- un groupe associé à des données prédéfinies relatives à un trouble cancéreux ou à la prise d’un médicament limitant les troubles cancéreux,
- un groupe associé à des données prédéfinies relatives à un trouble lié à une addiction ou à la prise d’un médicament limitant les troubles liés à une addiction, et
- un groupe associé à des données prédéfinies relatives à un trouble lié au vieillissement ou à la prise d’un médicament limitant les troubles liés au vieillissement, et
- un groupe est associé à des données prédéfinies relatives à un trouble cardiaque ou à la prise d’un médicament limitant les troubles cardiaques.
Dans certains cas, il peut y avoir plusieurs groupes portant sur le même trouble. Notamment, il peut être favorable, comme le montre les expériences de la demanderesse, d’avoir deux groupes portant sur les troubles cardiaques.
Dans chacun des cas, les groupes, les données prédéfinies sont obtenues par mise en œuvre l’étape de formation d’une base de données E50 et l’étape de détermination des groupes et des données prédéfinies E52.
Lors d’une étape de recherche E60, le système 10 recherche, pour chaque donnée prédéfinie déterminée, la valeur de la donnée prédéfinie pour le sujet, pour obtenir un ensemble de valeurs propres au sujet.
Une telle recherche peut, par exemple, se réduire à une extraction des données du parcours de soin.
Le terme « valeur » est ici entendu dans une acceptation large comme incluant à la fois des valeurs binaires (a pris ou non le médicament) ou des valeurs de quantification (typiquement une échelle entre 1 à 10 pour la douleur). Il est également possible en variante ou en complément d’obtenir ces valeurs par le biais de questions au sujet ou à du personnel soignant.
Lors de l’étape d’application E62, le système 10 applique un réseau de neurones sur les valeurs propres au sujet pour obtenir un risque de survenue d’une mort subite chez le sujet, le réseau de neurones étant spécifique du groupe déterminé.
Le réseau de neurones a été appris préalablement, notamment en utilisant les mêmes données qui ont permis de trouver les groupes prédéfinis. Cela correspond à l’tape d’entraînement E54 de la première phase P1 .
Cela signifie que le système 10 a en mémoire les attributs de chaque groupe prédéfini ainsi que les réseaux de neurones spécifiques.
Ces réseaux de neurones sont spécifiques en ce que leurs entrées sont les valeurs des données prédéfinies associées au groupe considéré.
Typiquement pour le groupe associé à des données prédéfinies relatives à un trouble de la respiration ou à la prise d’un médicament limitant les troubles respiratoires, le réseau de neurones prendra en entrée 10 valeurs de données prédéfinies relatives à un trouble de la respiration et 10 valeurs de prise d’un médicament limitant les troubles respiratoires.
En outre, dans l’exemple décrit, chaque réseau de neurones est un réseau de neurones récurrents à porte.
La valeur de probabilité est par exemple exprimée sous la forme d’un score pour les trois prochains mois.
Tout forme de score peut néanmoins être envisagée pour donner le résultat du calcul du réseau de neurones.
Le procédé permet donc de prédire avec efficacité le risque de survenue d’une mort subite.
Cela est montré dans la section suivante.
RESULTATS EXPERIMENTAUX
Le présent procédé a fait l’objet d’expériences de la part de la Demanderesse, expériences qui sont maintenant décrites.
OBJECTIF DES EXPERIENCES
L’objectif principal de ces expériences est de prédire la survenue de la mort subite de l’adulte, en comparant les données de cas (sujets victimes de mort subite) et celles de quatre populations de contrôles : - population 1 : patients atteints d’une cardiopathie ischémique n’ayant pas présenté de mort subite,
- population 2 : patients ayant présenté un syndrome coronarien aigu sans mort subite,
- population 3 : Patients atteints d’une insuffisance cardiaque chronique sans mort subite, et
- population 4 : individus représentatifs de la population générale.
Ces expériences utilisent conjointement du registre du Centre d’Expertise de la Mort Subite et des bases de données médico-administratives de l’Assurance Maladie. Leur intérêt scientifique a été évalué par la Société Française de Cardiologie, qui en a souligné l’intérêt de santé publique, et l’apport majeur qu’elles constituent.
Ces expériences ont cherché à et d’autre part à construire des groupes de patients au sein de la population de mort subite, pour identifier et représenter l’hétérogénéité de cette population, et les facteurs de risque qui leur sont associés d’une part développer un algorithme de prédiction de survenue de la mort subite, à partir des trajectoires de soin observées avant l’événement.
DONNEES UTILISEES
Description de la cohorte étudiée
Cas inclus
Le Centre d’Expertise de la Mort subite collecte depuis mai 2011 l’ensemble des cas de morts subites survenus dans une zone géographique donnée (Paris et les 3 départements adjacents, Hauts de Seine, Seine-Saint-Denis et Val de Marne), qui représente au total un bassin de population de 6,6 millions d’habitants soit 10% de la population française. Cette collection est rendue possible par une collaboration étagée entre les services de secours préhospitaliers (Brigade des Sapeurs pompiers de Paris, SAMU), hospitaliers (services de réanimation et de cardiologie) et l’institut Médico-Légal de Paris.
Pour l’ensemble des cas inclus, les informations relatives à la survenue de l’événement (critères Utstein), à la prise en charge (pré et intra hospitalière) et au devenir des patients (en terme de survie et de pronostic neurologique) sont recueillies prospectivement, avec des sources multiples et des contrôles qualités fréquents (permettant d’évaluer l’exhaustivité à 99% des cas dans la zone d’intérêt). Cette collection a fait l’objet d’un avis favorable du Comité consultatif sur le traitement de l'information en matière de recherche (CCTIRS, dossier N 12.336) et d’une autorisation de la CNIL (décision DR-2012-445).
La population des cas de notre étude est donc constituée des patients inclus dans le registre du CEMS, ayant présenté une mort subite entre le 15 mai 2011 et le 31 décembre 2020. Sur la période d’étude considérée de 9 ans (2011-2020), cela représente 24 000 cas inclus.
Populations de contrôles
Les populations de contrôles ont été définies et collectées à partir des bases médico-administratives de l’Assurance Maladie. Ces populations contiennent 4 cohortes différentes de témoins, avec pour chaque cohorte un appariement de 3 témoins pour 1 contrôle, appariés sur le sexe, l’âge et le département de résidence. 288 000 individus contrôles ont donc été inclus dans ces expériences.
Concernant la première population (patients atteints d’une cardiopathie ischémique), afin de réaliser un appariement de 3 contrôles pour 1 cas, 72 000 individus contrôles ont été sélectionnés dans cette population. L’identification des patients atteints d’un syndrome coronaire aigu a été réalisée selon une méthode de cartographie médicale précédemment décrite.
La même méthodologie a été suivi pour la deuxième population (patients ayant présenté un syndrome coronarien aigu) et troisième population (patients atteints d’une insuffisance cardiaque chronique).
Pour la quatrième population (individus représentatifs de la population générale), un groupe témoin, représentatif de la population générale, a été constitué avec 3 témoins pour 1 cas. 72 000 témoins ont donc été tirés au sort à Paris et dans les 3 départements adjacents (Hauts de Seine, Seine-Saint-Denis et Val de Marne), en excluant les individus préalablement inclus dans les trois populations définies précédemment.
Description des données utilisées
Dans le cadre de ces expériences, ont été collecte l'antériorité médicale des 24 000 cas de mort subites et 288 000 individus contrôles décrits précédemment, sur une période de 5 à 10 ans avant l'événement. Ces informations sont extraites des bases médico- administratives de l’Assurance Maladie, à partir du Système National des Données de Santé (SNDS).
Le SNDS est un entrepôt de données médico-administratives pseudo-anonymisées couvrant l'ensemble de la population française et contenant l'ensemble des soins présentés au remboursement. Il est géré par la Caisse Nationale de l’Assurance Maladie et permet de chaîner les données de l'Assurance Maladie (base SNIIRAM), les données des hôpitaux (base PMSI) et les causes médicales de décès (base du CépiDC de l'INSERM).
Il contient aujourd’hui plus de 3 000 variables et représente un flux annuel de 1 ,2 milliards de feuilles de soins, 1 1 millions de séjours hospitaliers et 500 millions d'actes médicaux.
Les données analysées dans cette étude correspondent à l’ensemble des données individuelles de santé et de consommation médicale ayant donné lieu à un remboursement : examens et dispositifs médicaux, hospitalisations, médicaments et affections de longues durée.
METHODES STATISTIQUES
Classification de la population de mort subite
La Demanderesse a développé un modèle de classification (plus souvent désigné sous l’appellation anglaise correspondante de « clustering ») de la population de mort subite, en exploitant les trajectoires de soin observées sur une période de 5 ans avant l’arrêt cardiaque.
Pour cela, il est utilisé un algorithme de classification non-supervisée. Cela permet d’identifier et de représenter l'hétérogénéité des cas de mort subite, et les facteurs de risque qui leur sont associés.
Plus précisément, cet algorithme comprend l’emploi d’un outil d’analyse du langage suivi de l’emploi d’un algorithme de partitionnement en k-moyennes.
L’outil d’analyse du langage permet de représenter les patients à partir de l’information temporelle contenue dans leur trajectoire de soin. En l’espèce, la Demanderesse a utilisé l’algorithme Word2Vec.
L’algorithme de partitionnement en k-moyennes est plus souvent désigné sous le terme anglais correspondant de « k-means ». L’algorithme permet d’identifier des groupes (« clusters ») pertinents pour la prédiction de la mort subite.
En l’espèce, cela a conduit la demanderesse à déterminer sept groupes dont les caractéristiques sont explicitées dans ce qui suit. Groupe 1 :
Le premier groupe est caractérisé par les éléments suivants : Tableau 1
Tableau 2 Tableau 3
Tableau 4 Groupe 2 :
Le deuxième groupe est caractérisé par les éléments suivants :
Tableau 5
Tableau 6 Tableau 7
Tableau 8 Groupe 3 :
Le troisième groupe est caractérisé par les éléments suivants :
Tableau 9
Tableau 10 Tableau 11
Tableau 12 Groupe 4 :
Le quatrième groupe est caractérisé par les éléments suivants : [Table 13]
Tableau 13
Tableau 14
Tableau 15
Tableau 16
Groupe 5 :
Le cinquième groupe est caractérisé par les éléments suivants :
Tableau 17
Tableau 18
Tableau 19
Tableau 20
Groupe 6 :
Le sixième groupe est caractérisé par les éléments suivants :
Tableau 21
Tableau 22
Tableau 23
Tableau 24 Groupe 7 :
Le septième groupe est caractérisé par les éléments suivants :
Tableau 25
Tableau 26 Tableau 27
Tableau 28 Algorithme de prédiction de survenue de la mort subite
Dans le cadre de ces expériences, la demanderesse a développé un algorithme permettant de prédire la survenue de la mort subite de l’adulte dans une fenêtre temporelle de 1 an, à partir des trajectoires de soin observées sur une période de 5 ans avant l'événement.
Pour cela, la demanderesse a comparé les performances de différentes techniques statistiques de classification supervisée.
Pour cela, la demanderesse a entraîné et comparé chacune des techniques an utilisant une validation croisée en 10 parties consolidées.
Plus précisément, la demanderesse a itérativement divisé les données en deux jeux : un jeu d’entraînement et un jeu de test avec un ratio de 9 pour 1 (pour 10 données disponibles, 9 sont utilisées pour l’entraînement et 1 pour le test. En outre, les jeux sont modifiés pour que la proportion de mort subite (parfois désignée par le terme SCD pour la dénomination anglaise correspondante de « Sudden Cardiac Death » signifiant littéralement mort subite par arrêt cardiaque) dans un jeu soit la même dans chacun des jeux.
La demanderesse a alors calculé l’aire sous la courbe (plus souvent désignée par l’acronyme AUC renvoyant à la dénomination anglaise correspondante de « Area Under Curve »), la valeur de prédiction positive (plus souvent désignée par l’acronyme PPV renvoyant à la dénomination anglaise correspondante de « Positive Predictive Value ») et la sensibilité.
Les techniques comparés sont 3 techniques à savoir :
• une première technique T 1 : régression logistique,
• une deuxième technique T2 : arbres de décision, et
• une troisième technique T3 : K plus proches voisins.
Les tableaux 29 à 32 donnent les performances sur 4 modèles pour une prédiction de la mort subite à un an.
Le premier modèle M1 correspond à la comparaison SCD avec la population générale, le deuxième modèle M2 correspond à la comparaison SCD avec l’infarctus aigu du myocarde (plus souvent désigné par l’acronyme AMI qui renvoie à la dénomination anglaise correspondante de « Acute Myocardial Infarction »), le troisième modèle M3 correspond à la comparaison SCD avec l’insuffisance cardiaque chronique (plus souvent désigné par l’acronyme HF qui renvoie à la dénomination anglaise correspondante de « Heart Failure ») et le quatrième modèle M4 correspond à la comparaison SCD avec la cardiopathie ischémique (plus souvent désigné par l’acronyme IHD qui renvoie à la dénomination anglaise correspondante de « Ischemic Heart Disease »).
Les résultats obtenus sont les suivants :
Tableau 29 : Performance pour le premier modèle M1
Tableau 30 : Performance pour le deuxième modèle M2
Tableau 31 : Performance pour le troisième modèle M3 Tableau 32 : Performance pour le quatrième modèle M4
Aucune de ces techniques n’étant satisfaisante, la demanderesse s’est orientée vers une technique de réseaux de neurones. L’entraînement a été fait sur chacun des jeux de données précités avec les mêmes quatre modèles précédents.
Parmi celle-ci, la demanderesse a sélectionné un réseau de neurones récurrents à portes.
Cela permet d’obtenir pour chacun des modèles précités des performances d’aire sous la courbe, de prédiction positive PPV et une sensibilité bien meilleures.
Pour améliorer encore ces résultats, la demanderesse a utilisé les 7 groupes déterminés grâce à la technique de classification précitée et a eu recours à des techniques d’augmentation de données (plus souvent désignée sous le terme « data augmentation ») pour d’augmenter artificiellement le nombre de cas de mort subites dans chacun des groupes lors des phases d’entraînement du réseau de neurones. Cela permet de compenser le déséquilibre de chaque groupe (1 cas de mort subite pour 12 individus contrôles).
Pour l’augmentation des données, la demanderesse a utilisé un réseau adverse génératif. Un tel réseau est plus souvent désigné par l’acronyme GAN qui renvoie à la dénomination anglaise correspondante de « Generative Adversarial Networks ». La demanderesse a, en effet, observé qu’un réseau GAN est bien adapté pour la génération de données médicales.
Il est ainsi obtenu un algorithme de prédiction du risque de survenue d’une mort subite chez un sujet pour chaque groupe. La sortie de l’algorithme développée par la demanderesse est alors un score trimestriel (il y a donc 4 scores de risque pour une fenêtre temporelle de 1 an) et adapté selon la population (un des 7 groupes) à laquelle l’individu appartient.
La demanderesse a également utilisé un algorithme d’interprétation des résultats. En l’espèce, l’algorithme sélectionné par la demanderesse est le SAE, abréviation qui renvoie à la dénomination « Shapley Additive Explanation » signifiant littéralement explication additive de Shapley. Cela permet d’obtenir les facteurs de risques les plus importants qui expliquent ces prédictions pour chaque individu.

Claims

34 REVENDICATIONS
1. Procédé de prédiction du risque de survenue d’une mort subite chez un sujet, le procédé étant mis en œuvre par ordinateur et comprenant les étapes de :
- réception de données relatives au parcours de santé d’un sujet,
- détermination à partir des données relatives au parcours de santé de l’appartenance du sujet à un groupe parmi un ensemble de groupes prédéfinis, chaque groupe étant associé à un ensemble de données prédéfinies, pour obtenir un groupe déterminé et un ensemble de données prédéfinies déterminées,
- recherche, pour chaque donnée prédéfinie déterminée, de la valeur de la donnée prédéfinie pour le sujet, pour obtenir un ensemble de valeurs propres au sujet, et
- application d’un réseau de neurones sur les valeurs propres au sujet pour obtenir un risque de survenue d’une mort subite chez le sujet, le réseau de neurones étant spécifique du groupe déterminé.
2. Procédé de prédiction selon la revendication 1 , dans lequel chaque réseau de neurones est un réseau de neurones récurrents à porte.
3. Procédé de prédiction selon la revendication 1 ou 2, dans lequel les données reçues sont des données relatives au parcours de santé du sujet durant les cinq années précédentes.
4. Procédé de prédiction selon l’une quelconque des revendications 1 à 3, dans lequel chaque donnée prédéfinie est la présence d’un trouble ou la prise d’un médicament.
5. Procédé de prédiction selon l’une quelconque des revendications 1 à 4, dans lequel le nombre de données prédéfinies d’un groupe est compris entre 10 et 30, de préférence compris entre 15 et 25, avantageusement égal à 20.
6. Procédé de prédiction selon l’une quelconque des revendications 1 à 5, dans lequel :
- un groupe est associé à des données prédéfinies relatives à un trouble de la respiration ou à la prise d’un produit limitant les troubles respiratoires,
- un groupe est associé à des données prédéfinies relatives à un trouble neurologique ou à la prise d’un produit limitant les troubles neurologiques,
- un groupe est associé à des données prédéfinies relatives à un trouble cancéreux ou à la prise d’un produit limitant les troubles cancéreux, 35
- un groupe est associé à des données prédéfinies relatives à un trouble lié à une addiction ou à la prise d’un produit limitant les troubles liés à une addiction,
- un groupe est associé à des données prédéfinies relatives à un trouble lié au vieillissement ou à la prise d’un produit limitant les troubles liés au vieillissement, et
- un groupe est associé à des données prédéfinies relatives à un trouble cardiaque ou à la prise d’un produit limitant les troubles cardiaques.
7. Procédé de prédiction selon l’une quelconque des revendications 1 à 6, dans lequel les groupes sont obtenus par application d’une technique de partitionnement en k- moyennes sur un ensemble de données comprenant des données relatives au parcours de santé d’un ensemble de sujets et chaque donnée prédéfinie d’un groupe est obtenue par application d’un outil d’analyse du langage sur un ensemble de données comprenant des données relatives au parcours de santé de l’ensemble de sujets.
8. Procédé de prédiction selon la revendication 7, dans lequel l’ensemble de données comporte des données artificielles générés par application d’une fonction sur des données relatives au parcours de santé d’un ensemble de sujets.
9. Procédé de prédiction selon la revendication 8, dans lequel la fonction est un réseau de neurones adverse.
10. Produit programme d’ordinateur comportant des instructions de programme formant un programme d’ordinateur mémorisé sur un support lisible d’informations, le programme d’ordinateur étant chargeable sur une unité de traitement de données et mettant en œuvre un procédé d’évaluation selon l’une quelconque des revendications 1 à 9 lorsque le programme d’ordinateur est mis en œuvre sur l’unité de traitement des données.
11. Support lisible d’informations comportant des instructions de programme formant un programme d’ordinateur, le programme d’ordinateur étant chargeable sur une unité de traitement de données et mettant en œuvre un procédé d’évaluation selon l’une quelconque des revendications 1 à 9 lorsque le programme d’ordinateur est mis en œuvre sur l’unité de traitement de données.
EP22822001.8A 2021-11-23 2022-11-23 Procédé de prédiction du risque de survenue d'une mort subite et dispositifs associés Pending EP4437560A1 (fr)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
FR2112396A FR3129517A1 (fr) 2021-11-23 2021-11-23 Procédé de prédiction du risque de survenue d’une mort subite et dispositifs associés
PCT/EP2022/082993 WO2023094455A1 (fr) 2021-11-23 2022-11-23 Procédé de prédiction du risque de survenue d'une mort subite et dispositifs associés

Publications (1)

Publication Number Publication Date
EP4437560A1 true EP4437560A1 (fr) 2024-10-02

Family

ID=81851350

Family Applications (1)

Application Number Title Priority Date Filing Date
EP22822001.8A Pending EP4437560A1 (fr) 2021-11-23 2022-11-23 Procédé de prédiction du risque de survenue d'une mort subite et dispositifs associés

Country Status (7)

Country Link
EP (1) EP4437560A1 (fr)
JP (1) JP2024539472A (fr)
KR (1) KR20240157630A (fr)
CN (1) CN119054025A (fr)
FR (1) FR3129517A1 (fr)
TW (1) TW202331742A (fr)
WO (1) WO2023094455A1 (fr)

Families Citing this family (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US12257060B2 (en) 2021-03-29 2025-03-25 Pacesetter, Inc. Methods and systems for predicting arrhythmia risk utilizing machine learning models

Also Published As

Publication number Publication date
FR3129517A1 (fr) 2023-05-26
JP2024539472A (ja) 2024-10-28
WO2023094455A1 (fr) 2023-06-01
TW202331742A (zh) 2023-08-01
CN119054025A (zh) 2024-11-29
KR20240157630A (ko) 2024-11-01

Similar Documents

Publication Publication Date Title
Côté et al. Artificial intelligence in nutrition research: perspectives on current and future applications
Hossain et al. Machine learning-based classification of Parkinson’s disease patients using speech biomarkers
US20200097814A1 (en) Method and system for enabling interactive dialogue session between user and virtual medical assistant
Coyle et al. Social isolation, loneliness and health among older adults
Dai et al. Improving depression prediction using a novel feature selection algorithm coupled with context-aware analysis
US20200211709A1 (en) Method and system to provide medical advice to a user in real time based on medical triage conversation
McGilvray et al. Electronic health record-based deep learning prediction of death or severe decompensation in heart failure patients
Burns et al. Health status of returning refugees, internally displaced persons, and the host community in a post-conflict district in northern Sri Lanka: a cross-sectional survey
Tlachac et al. Studentsadd: Rapid mobile depression and suicidal ideation screening of college students during the coronavirus pandemic
Byeon A prediction model for mild cognitive impairment using random forests
Saxena et al. [Retracted] A Comprehensive Review of Various Diabetic Prediction Models: A Literature Survey
Ru et al. Comparison of machine learning algorithms for predicting hospital readmissions and worsening heart failure events in patients with heart failure with reduced ejection fraction: modeling study
Acciaroli et al. Mitigation of rebound hyperglycemia with real-time continuous glucose monitoring data and predictive alerts
Gruda et al. All about that trait: Examining extraversion and state anxiety during the SARS-CoV-2 pandemic using a machine learning approach
Pylieva et al. Improving automatic categorization of technical vs. laymen medical words using fasttext word embeddings
Cichosz et al. A conditional generative adversarial network for synthesis of continuous glucose monitoring signals
Hu et al. The role of leisure activities in the relationship between marital transition in later midlife and psychological well-being trajectories
Liu et al. YouTube for patient education: A deep learning approach for understanding medical knowledge from user-generated videos
Young The Science and Technology of Growing Young, Updated Edition: An Insider's Guide to the Breakthroughs that Will Dramatically Extend Our Lifespan... and What You Can Do Right Now
EP4437560A1 (fr) Procédé de prédiction du risque de survenue d'une mort subite et dispositifs associés
Vaughn et al. The effect of mortality salience on women's judgments of male faces
Lenzi et al. Mapping obesity and diabetes’ representation on Twitter: the case of Italy
Voskergian et al. Engineering novel features for diabetes complication prediction using synthetic electronic health records
Manjulatha et al. A novel hybrid attention-based dilated network for depression classification model from multimodal data using improved heuristic approach
Clark Toward suicidal ideation detection with lexical network features and machine learning

Legal Events

Date Code Title Description
STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: UNKNOWN

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE INTERNATIONAL PUBLICATION HAS BEEN MADE

PUAI Public reference made under article 153(3) epc to a published international application that has entered the european phase

Free format text: ORIGINAL CODE: 0009012

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: REQUEST FOR EXAMINATION WAS MADE

17P Request for examination filed

Effective date: 20240522

AK Designated contracting states

Kind code of ref document: A1

Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC ME MK MT NL NO PL PT RO RS SE SI SK SM TR

DAV Request for validation of the european patent (deleted)
DAX Request for extension of the european patent (deleted)