EP4377699A1 - Procede de caracterisation d'une tumeur - Google Patents

Procede de caracterisation d'une tumeur

Info

Publication number
EP4377699A1
EP4377699A1 EP22760870.0A EP22760870A EP4377699A1 EP 4377699 A1 EP4377699 A1 EP 4377699A1 EP 22760870 A EP22760870 A EP 22760870A EP 4377699 A1 EP4377699 A1 EP 4377699A1
Authority
EP
European Patent Office
Prior art keywords
nucleosides
tumor
grade
biological sample
individual
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
EP22760870.0A
Other languages
German (de)
English (en)
Inventor
Eric Rivals
Christophe HIRTZ
Alexandre David
Sébastien RELLIER
Luc Bauchet
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Centre National de la Recherche Scientifique CNRS
Institut National de la Sante et de la Recherche Medicale INSERM
Centre Hospitalier Universitaire de Montpellier
Universite de Montpellier
Original Assignee
Centre National de la Recherche Scientifique CNRS
Institut National de la Sante et de la Recherche Medicale INSERM
Centre Hospitalier Universitaire de Montpellier
Universite de Montpellier
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Centre National de la Recherche Scientifique CNRS, Institut National de la Sante et de la Recherche Medicale INSERM, Centre Hospitalier Universitaire de Montpellier, Universite de Montpellier filed Critical Centre National de la Recherche Scientifique CNRS
Publication of EP4377699A1 publication Critical patent/EP4377699A1/fr
Pending legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G16INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
    • G16HHEALTHCARE INFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR THE HANDLING OR PROCESSING OF MEDICAL OR HEALTHCARE DATA
    • G16H50/00ICT specially adapted for medical diagnosis, medical simulation or medical data mining; ICT specially adapted for detecting, monitoring or modelling epidemics or pandemics
    • G16H50/50ICT specially adapted for medical diagnosis, medical simulation or medical data mining; ICT specially adapted for detecting, monitoring or modelling epidemics or pandemics for simulation or modelling of medical disorders
    • GPHYSICS
    • G01MEASURING; TESTING
    • G01NINVESTIGATING OR ANALYSING MATERIALS BY DETERMINING THEIR CHEMICAL OR PHYSICAL PROPERTIES
    • G01N33/00Investigating or analysing materials by specific methods not covered by groups G01N1/00 - G01N31/00
    • G01N33/48Biological material, e.g. blood, urine; Haemocytometers
    • G01N33/50Chemical analysis of biological material, e.g. blood, urine; Testing involving biospecific ligand binding methods; Immunological testing
    • G01N33/53Immunoassay; Biospecific binding assay; Materials therefor
    • G01N33/575Immunoassay; Biospecific binding assay; Materials therefor for cancer
    • G01N33/57557Immunoassay; Biospecific binding assay; Materials therefor for cancer of other specific parts of the body, e.g. brain
    • CCHEMISTRY; METALLURGY
    • C12BIOCHEMISTRY; BEER; SPIRITS; WINE; VINEGAR; MICROBIOLOGY; ENZYMOLOGY; MUTATION OR GENETIC ENGINEERING
    • C12NMICROORGANISMS OR ENZYMES; COMPOSITIONS THEREOF; PROPAGATING, PRESERVING, OR MAINTAINING MICROORGANISMS; MUTATION OR GENETIC ENGINEERING; CULTURE MEDIA
    • C12N15/00Mutation or genetic engineering; DNA or RNA concerning genetic engineering, vectors, e.g. plasmids, or their isolation, preparation or purification; Use of hosts therefor
    • C12N15/09Recombinant DNA-technology
    • C12N15/10Processes for the isolation, preparation or purification of DNA or RNA
    • C12N15/1003Extracting or separating nucleic acids from biological samples, e.g. pure separation or isolation methods; Conditions, buffers or apparatuses therefor
    • GPHYSICS
    • G01MEASURING; TESTING
    • G01NINVESTIGATING OR ANALYSING MATERIALS BY DETERMINING THEIR CHEMICAL OR PHYSICAL PROPERTIES
    • G01N30/00Investigating or analysing materials by separation into components using adsorption, absorption or similar phenomena or using ion-exchange, e.g. chromatography or field flow fractionation
    • G01N30/02Column chromatography
    • G01N30/62Detectors specially adapted therefor
    • G01N30/72Mass spectrometers
    • G01N30/7233Mass spectrometers interfaced to liquid or supercritical fluid chromatograph
    • GPHYSICS
    • G01MEASURING; TESTING
    • G01NINVESTIGATING OR ANALYSING MATERIALS BY DETERMINING THEIR CHEMICAL OR PHYSICAL PROPERTIES
    • G01N30/00Investigating or analysing materials by separation into components using adsorption, absorption or similar phenomena or using ion-exchange, e.g. chromatography or field flow fractionation
    • G01N30/02Column chromatography
    • G01N30/88Integrated analysis systems specially adapted therefor, not covered by a single one of the groups G01N30/04 - G01N30/86
    • GPHYSICS
    • G01MEASURING; TESTING
    • G01NINVESTIGATING OR ANALYSING MATERIALS BY DETERMINING THEIR CHEMICAL OR PHYSICAL PROPERTIES
    • G01N33/00Investigating or analysing materials by specific methods not covered by groups G01N1/00 - G01N31/00
    • G01N33/48Biological material, e.g. blood, urine; Haemocytometers
    • G01N33/50Chemical analysis of biological material, e.g. blood, urine; Testing involving biospecific ligand binding methods; Immunological testing
    • G01N33/53Immunoassay; Biospecific binding assay; Materials therefor
    • G01N33/575Immunoassay; Biospecific binding assay; Materials therefor for cancer
    • G01N33/57535Immunoassay; Biospecific binding assay; Materials therefor for cancer of the large intestine, e.g. colon, rectum or anus
    • GPHYSICS
    • G01MEASURING; TESTING
    • G01NINVESTIGATING OR ANALYSING MATERIALS BY DETERMINING THEIR CHEMICAL OR PHYSICAL PROPERTIES
    • G01N33/00Investigating or analysing materials by specific methods not covered by groups G01N1/00 - G01N31/00
    • G01N33/48Biological material, e.g. blood, urine; Haemocytometers
    • G01N33/50Chemical analysis of biological material, e.g. blood, urine; Testing involving biospecific ligand binding methods; Immunological testing
    • G01N33/68Chemical analysis of biological material, e.g. blood, urine; Testing involving biospecific ligand binding methods; Immunological testing involving proteins, peptides or amino acids
    • G01N33/6803General methods of protein analysis not limited to specific proteins or families of proteins
    • G01N33/6848Methods of protein analysis involving mass spectrometry
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/02Neural networks
    • G06N3/08Learning methods
    • G06N3/09Supervised learning
    • GPHYSICS
    • G16INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
    • G16HHEALTHCARE INFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR THE HANDLING OR PROCESSING OF MEDICAL OR HEALTHCARE DATA
    • G16H10/00ICT specially adapted for the handling or processing of patient-related medical or healthcare data
    • G16H10/60ICT specially adapted for the handling or processing of patient-related medical or healthcare data for patient-specific data, e.g. for electronic patient records
    • GPHYSICS
    • G01MEASURING; TESTING
    • G01NINVESTIGATING OR ANALYSING MATERIALS BY DETERMINING THEIR CHEMICAL OR PHYSICAL PROPERTIES
    • G01N30/00Investigating or analysing materials by separation into components using adsorption, absorption or similar phenomena or using ion-exchange, e.g. chromatography or field flow fractionation
    • G01N30/02Column chromatography
    • G01N2030/022Column chromatography characterised by the kind of separation mechanism
    • G01N2030/027Liquid chromatography
    • GPHYSICS
    • G01MEASURING; TESTING
    • G01NINVESTIGATING OR ANALYSING MATERIALS BY DETERMINING THEIR CHEMICAL OR PHYSICAL PROPERTIES
    • G01N30/00Investigating or analysing materials by separation into components using adsorption, absorption or similar phenomena or using ion-exchange, e.g. chromatography or field flow fractionation
    • G01N30/02Column chromatography
    • G01N30/88Integrated analysis systems specially adapted therefor, not covered by a single one of the groups G01N30/04 - G01N30/86
    • G01N2030/8809Integrated analysis systems specially adapted therefor, not covered by a single one of the groups G01N30/04 - G01N30/86 analysis specially adapted for the sample
    • G01N2030/8813Integrated analysis systems specially adapted therefor, not covered by a single one of the groups G01N30/04 - G01N30/86 analysis specially adapted for the sample biological materials
    • G01N2030/8827Integrated analysis systems specially adapted therefor, not covered by a single one of the groups G01N30/04 - G01N30/86 analysis specially adapted for the sample biological materials involving nucleic acids

Definitions

  • the present invention relates to an in vitro method for characterizing a tumor, based on the quantitative analysis of modified and unmodified nucleosides isolated from a biological sample. More particularly, the subject of the invention is a method for predicting the grade of a glial tumour. According to another particular aspect, the subject of the invention is a method for detecting the presence of a tumour.
  • the present invention therefore lies in the fields of oncology and molecular biology more particularly applied to medical diagnosis.
  • characterization of a tumor is an essential prerequisite for choosing the most appropriate treatment for the patient.
  • characterization of a tumor is meant the characterization of the status or degree of evolution of a given tumor, it may be in particular for example the evaluation of the degree of evolution of a tumor of a known tissue, the attribution to a tumor of a previously defined grade, or any other characterization such as in particular the determination of the initial or metastatic nature of a tumor.
  • Gliomas or glial tumors, are the most common tumors of the central nervous system, they are characterized by significant variability in age of onset, grading, histological features and ability to progress and eventually metastasize.
  • Gliomas are classified according to their morphology and degree of malignancy.
  • the consensus classification of the World Health Organization (WHO) assigns a degree of malignancy from I to IV to gliomas, with glioblastomas, or grade IV tumors, being the most aggressive and deadliest form.
  • WHO World Health Organization
  • gliomas and glioblastomas are related to the current lack of effective diagnostic strategies.
  • the selection of a personalized treatment requires an accurate classification of tumors.
  • the main diagnostic methods used clinically for the detection of gliomas are based on neurological tests and neuroimaging methods, performed when the disease is already at an advanced stage.
  • Diagnosis of the tumor requires analysis of the patient's tissues from a biopsy or surgical resection. From this sample, several molecular analyzes are carried out: candidate gene expression test, DNA copy number counting, methylation profiling, phospho-protein pathway profiling and genetic sequencing.
  • biopsy-based diagnoses have limitations regarding tumor grading and patient stratification.
  • the grades of the glioma are difficult to distinguish, and more particularly grades II and III.
  • the establishment of the grade requires a delicate anatomo-pathological analysis, often carried out independently by two specialists.
  • Grade II denotes a benign tumor while grade III represents a transition to glioblastoma multiforme, which is the most aggressive state.
  • Janzer's publication (“Neuropathologic and molecular pathology of gliomas.” R-C Janzer, Rev. Med. Switzerland, 5, 1501-4, 2009) describes the classification of gliomas according to the WHO, based on histological and immuno-histochemical criteria , as well as on genetic profiles highlighting the alteration of cell DNA: determination of hypermethylation of the MGMT gene promoter (for glioblastomas) and detection of loss of chromosomes lp and 19q (for tumors oligodendrogliales).
  • the inventors have now developed a method for characterizing a tumor which exploits the quantitative data of the epitranscriptome.
  • the epitranscriptome encompasses all of the chemical modifications carried by the bases of ribonucleic acids (RNA), a set which is also referred to by the term “epigenetics of RNA”.
  • a method according to the invention comprises supplying a biological sample from a subject suffering from a tumor and obtaining quantities of modified and unmodified nucleosides from said sample, said quantities being grouped together in a vector (in the mathematical sense of the term).
  • a method according to the invention comprises the subsequent computer analysis of said vector for the characterization of a tumor. Said characterization of a tumor makes it possible to predict clinical and medical information about the tumor from the sample subject to analysis.
  • a method according to the invention comprises the computer analysis of said vector for the prediction of the grade of said tumor.
  • epitopranscriptomic profile or quite simply “profile”, the vector which groups together the quantities of each nucleoside, modified or unmodified.
  • the modified and unmodified nucleosides are derived from: i) total RNA extracted from cells of a biological sample from a patient, ii) extracellular RNA from a biological sample from a patient, and/or iii) an extract of metabolites from a biological sample isolated from a patient.
  • the nucleosides from the total RNA extracted from cells of a biological sample from a patient and/or from the extracellular RNA from a biological sample from a patient are obtained by the fragmentation of the RNA into nucleotides then their dephosphorylation.
  • the nucleosides derived from an extract of metabolites from a biological sample isolated from a patient are obtained by extracting the metabolites from a biological sample then dephosphorylation of said metabolites, according to appropriate methods well known to those skilled in the art.
  • Said metabolites are in particular derived from the catabolism of RNA, the nucleosides present in monomeric form can also be designated by the expression of so-called “free” nucleosides.
  • the modified and unmodified nucleosides are the nucleosides present in the total RNA extracted from cells from a biopsy of said tumour.
  • nucleosides is meant the glycosamines consisting of a nucleic base linked to the anomeric carbon atom of a pentose residue by a glycosidic bond from the NI nitrogen atom of a pyrimidine or the N9 atom of a purine.
  • pentose is ribose
  • nucleosides designates in this case ribonucleosides.
  • RNA nucleosides are also referred to as “epitranscriptomic marks” or “epitranscriptomic modifications”.
  • RNA nucleosides Table 1 which can be used for the characterization of tumours
  • modified nucleosides which can be used in a method according to the invention, in particular in the analysis of gliomas, are listed (Table 2).
  • Table 1 Table 1
  • an epitranscriptomic profile can include, according to the needs of the application, a greater number of modified nucleosides, to be determined from among the known nucleosides (Jonkhout et al, “The RNA landscape modification in human disease”, RNA, Dec;23 (12): 1754-1769, 2017).
  • a complete list of all modified nucleosides, which may, depending on the needs of the analysis, be included in the transcriptomic profiles is publicly available.
  • the epitranscriptomic profile of a sample characterizes said sample.
  • Said epitranscriptomic profile can be obtained by any known technique of the state of the art, and in particular by mass spectrometry, in particular by mass spectrometry coupled with chromatography.
  • the step of analyzing the epitranscriptomic profile for clinical prediction purposes is based on a supervised automatic learning method. Learning is performed on the profiles from a cohort, that is to say cell samples for which the clinical characteristic variable to be predicted is known beforehand. The “computer model” thus created by learning can then be used (in prediction mode) in order to predict the clinical variable for any new sample.
  • the inventors have also developed a method for normalizing the raw quantitative data making it possible to obtain an epitranscriptomic profile containing comparable relative quantities.
  • a method according to the invention makes it possible to predict the grade of a glioma from a biological sample of a patient suffering from a tumor , in particular from a sample comprising tumor cells. More particularly, a method according to the invention makes it possible to distinguish grades II and III of a glioma from a sample comprising tumor cells.
  • a method according to the invention makes it possible to predict the survival of a patient from a sample biological material isolated from said patient, in particular from a tumor sample.
  • the inventors have also developed a method for detecting the presence of a tumor in an individual, from a biological sample isolated from this individual, comprising the steps of: a) isolating the nucleosides of said biological sample, by extracting : i) total cellular RNA and its fragmentation into nucleosides, ii) extracellular RNA and its fragmentation into nucleosides, and/or iii) nucleosides from monomeric catabolites, b) isolation and determination of a respective quantity of at least 3, preferably at least 5, preferably at least 10 preferably at least 20, different nucleosides obtained during step a), and c) establishment, for said biological sample, of a nucleoside profile from the respective amounts of each of the nucleosides obtained during step b), said profile being characteristic of the presence of said tumour.
  • the technical steps of a method for detecting the presence of a tumor in an individual have the same characteristics as the technical steps of a method for characterizing a tumor.
  • a method according to the invention is therefore advantageously used to characterize a tumour.
  • a method according to the invention is advantageously used to detect the presence of a tumour.
  • the subject of the invention is an in vitro method for characterizing a tumor of an individual, from a biological sample isolated from this individual, comprising the steps of: a) isolation of the nucleosides of said sample biological, by extracting: i) total cellular RNA and its fragmentation into nucleosides, ii) extracellular RNA and its fragmentation into nucleosides, and/or iii) nucleosides from monomeric catabolites, b) isolation and determination of a respective quantity of at least 3, preferably at least 5, preferably at least 10 preferably at least 20, different nucleosides obtained during step a), and c) establishment, for said biological sample, of a profile of nucleosides from the respective quantities of each of the nucleosides obtained during step b), said profile being characteristic of said tumour.
  • a method according to the invention is based on the simultaneous analysis of the quantity of different nucleosides derived from the total cellular RNA of a biological sample, and/or derived from the extracellular RNA and its fragmentation into nucleosides and/or derived from nucleosides obtained from monomeric catabolites present in said sample, a method according to the invention therefore comprises the simultaneous analysis of multiple variables, and not the quantitative detection of a single marker.
  • profile or “nucleoside profile” is meant a vector of quantities of nucleosides.
  • total cellular RNA is meant all of the cellular RNA extracted according to well-known and accessible methods.
  • Total cellular RNA includes transfer RNA (tRNA), messenger RNA (mRNA), ribosomal RNA (rRNA), and other non-coding RNAs. Said total cellular RNA is therefore present here in a polymeric form.
  • extracellular RNA is meant all of the extracellular RNA present in polymeric form, extracted according to well-known and accessible methods. This polymeric form of extracellular RNA is in particular also designated by the expression “circulating RNA”. Said extracellular RNA is derived from the in vivo enzymatic degradation of transport RNA (tRNA), messenger RNA (mRNA) and/or ribosomal RNA (rRNA) and other types of RNA, in particular RNAs not coding.
  • tRNA transport RNA
  • mRNA messenger RNA
  • rRNA ribosomal RNA
  • nucleosides derived from monomeric catabolites is meant the nucleosides obtained, according to well-known and accessible methods, from the catabolites present in a monomeric form in the sample. These monomeric catabolites are derived from the in vivo enzymatic degradation of transport RNA (tRNA), messenger RNA (mRNA) and/or ribosomal RNA (rRNA) and other types of RNA, in particular non- coding.
  • tRNA transport RNA
  • mRNA messenger RNA
  • rRNA ribosomal RNA
  • isolated and determination of a respective quantity of at least 3 different nucleosides is meant the isolation and determination of a quantity of each of the “at least 3” nucleosides taken individually.
  • the subject of the invention is therefore an in vitro method for characterizing a tumor of an individual, from a biological sample isolated from this individual, comprising the steps of: a) isolating the nucleosides of said biological sample by the extraction of the total cellular RNA and its fragmentation into nucleosides, b) isolation and determination of a respective quantity of at least 3, preferably at least 5, preferably at least 10 preferably at least least 20, different nucleosides obtained during step a), and c) establishment, for said biological sample, of a profile of nucleosides from the respective quantities of each of the nucleosides obtained during step b), said profile being characteristic of said tumour.
  • the nucleosides can also be present in the biological sample in an extracellular polymeric form, in particular also designated by the expression “circulating RNA”. Nucleosides can also be present in a monomeric form (metabolites) in the biological sample. Said extracellular RNAs and monomeric nucleosides are derived from the in vivo enzymatic degradation of transport RNA (tRNA), messenger RNA (mRNA) and/or ribosomal RNA (rRNA) and other types of RNA, in particular non-coding RNAs.
  • tRNA transport RNA
  • mRNA messenger RNA
  • rRNA ribosomal RNA
  • a method according to the invention is based on the simultaneous analysis of the amount of different nucleosides from the extracellular RNA of a biological sample.
  • the subject of the invention is an in vitro method for characterizing a tumor of an individual, from a biological sample isolated from this individual, comprising the steps of: a) isolation of the nucleosides said biological sample, by the extraction of the extracellular RNA and its fragmentation into nucleosides, b) isolation and determination of a respective quantity of at least 3, preferably at least 5, preferably at least 10 preferably at least 20, different nucleosides obtained during step a), and c) establishment, for said biological sample, of a profile of nucleosides from the respective quantities of each of the nucleosides obtained during step b), said profile being characteristic of said tumour.
  • a method according to the invention is based on the simultaneous analysis of the quantity of different nucleosides resulting from the monomeric catabolites present in a biological sample.
  • the subject of the invention is an in vitro method for characterizing a tumor of an individual, from a biological sample isolated from this individual, comprising the steps of: a) isolation of the nucleosides said biological sample, by extracting the monomeric catabolites present in said sample, b) isolation and determination of a respective quantity of at least 3, preferably at least 5, preferably at least 10 preferably at least 20, nucleosides different values obtained during step a), and c) establishment, for said biological sample, of a profile of nucleosides from the respective quantities of each of the nucleosides obtained during step b), said profile being characteristic of said tumor.
  • said biological sample is in particular to be chosen from: a solid biological sample, particularly a biopsy, and more particularly a biopsy of said tumor, and a liquid biological sample, in particular a sample of a bodily fluid from said individual, more particularly a sample of blood, plasma, serum or urine.
  • biopsy we mean the removal of a very small part of an organ or tissue.
  • the biological sample is a biopsy
  • the first embodiment of the method according to the invention in which the total cellular RNA is extracted then fragmented, is preferred.
  • the biological sample is a liquid biological sample
  • the second and the third embodiment of the method according to the invention in which respectively the extracellular RNA is extracted then fragmented, or in which the RNA in the form of isolated nucleosides is extract, are preferred.
  • said biological sample is of sufficient volume, or comprises a sufficient number of cells, to allow a reliable quantitative determination of at least 3 nucleosides resulting from the fragmentation of an extract of total cellular RNA of said sample.
  • the cellular RNA is total is extracted according to a method chosen from the methods accessible to those skilled in the art, in particular a method as described in the present example.
  • a liquid sample such as blood or urine
  • said sample is treated beforehand if necessary, in particular in order to eliminate any interfering compounds, to concentrate said sample and/or to determine a standard value of concentration of a reference element, such as creatinine in urine, this standard value serving to calibrate the concentration of the sample from which the nucleoside profile is established.
  • the total cellular RNA, the extracellular RNA and the isolated nucleosides are obtained from a biological sample by any method known to a person skilled in the art, said method comprises in particular an extraction step, optionally a fragmentation step, and a dephosphorylation step.
  • the subject of the invention is therefore an in vitro method for characterizing a tumor of an individual from a biopsy of said tumor, said method comprising the preparation, from said biopsy, of an extract of total cellular RNA and fragmentation of said RNA into nucleosides.
  • At least 3 isolated nucleosides from the biological sample obtained by i) the preparation of an extract of total cellular RNA and its fragmentation into nucleosides, ii) by the preparation of an extract of the extracellular RNA and its fragmentation into nucleosides, and/or iii) by the extraction of the isolated nucleosides, are isolated and their quantity respectively determined, said at least 3 nucleosides are chosen from: unmodified nucleosides: adenosine (A), cytidine (C), guanosine (G), uridine
  • Modified nucleosides result from the action of a large number of highly specific enzymes, nucleosides in particular undergo methylation and rearrangement of carbon-nitrogen bonds.
  • Said modified nucleosides are all modified nucleosides known at the date of this application, these nucleosides are cited in particular in the publication by Jonkhout et al ("The RNA modification landscape in human disease", RNA, Dec; 23 (12): 1754-1769, 2017), and in Table 2 of this application.
  • said at least 3 nucleosides are chosen from the groups consisting of: unmodified nucleosides: adenosine (A), cytidine (C), guanosine (G), uridine ( U),
  • said at least 3 nucleosides are chosen from the groups consisting of: unmodified nucleosides: adenosine (A), cytidine (C), guanosine (G), uridine (U), and
  • a method which is the subject of the invention comprises the isolation and the quantitative determination of at least 3, 4, 5, 6, 7, 8, 9, 10, 11, 12, 13, 14 , 15, 16, 17, 18, 19, 20, 21, 22, 23, 24, 25, 26, 27, 28 or 29 different nucleosides resulting from the fragmentation of the total RNA of said biological sample.
  • a method which is the subject of the invention comprises the isolation and the quantitative determination of at least 3, 4, 5, 6, 7, 8, 9, 10, 11, 12, 13, 14, 15, 16, 17, 18, 19, 20, 21, 22, 23, 24, 25, 26, 27, 28 or 29 different nucleosides resulting from the fragmentation of the extracellular RNA of said biological sample.
  • a method which is the subject of the invention comprises the isolation and the quantitative determination of at least 3, 4, 5, 6, 7, 8, 9, 10, 11, 12, 13, 14, 15, 16, 17, 18, 19, 20, 21, 22, 23, 24, 25, 26, 27, 28 or 29 different nucleosides resulting from the extraction of nucleosides from said biological sample.
  • a method which is the subject of the invention comprises the isolation and the quantitative determination of at least 3 different nucleosides resulting from the fragmentation of the total RNA of said biological sample and/or from the fragmentation of the extracellular RNA and/or the extraction of isolated nucleosides, said nucleosides being chosen from the following: adenosine (A), cytidine (C), guanosine (G), uridine (U), 2'-0- methyladenosine (Am ), 1-methyladenosine (mlA), N6,N6-dimethyladenosine (m66A), N6,N6,2'-0-trimethyladenosine (m66Am), N6-methyladenosine (m6A), N6,2'-0-dimethyladenosine (m6Am) , N4-acetylcytidine (ac4C), 2'-0-methylcytidine (Cm), 5- hydroxymethylcy
  • the isolation and the determination of a respective quantity of at least 3 nucleosides are implemented by any means of analysis known to those skilled in the art. These means include in particular chromatography, in particular high performance reverse phase liquid chromatography (RP-HPLC) or capillary electrophoresis (CE).
  • RP-HPLC high performance reverse phase liquid chromatography
  • CE capillary electrophoresis
  • spectrometry means in particular mass spectrometry. More specifically, these means include liquid chromatography-tandem mass spectrometry (LC-MS/MS), an analytical technique that combines the separating power of liquid chromatography with the mass analysis capability highly sensitive and selective triple quadrupole mass spectrometry. The strength of this technique lies in the separation power of liquid chromatography for a wide range of compounds, combined with the ability of mass spectrometry to quantify compounds with a high degree of sensitivity and selectivity, depending unique mass/charge (m/z) transitions of each compound of interest.
  • LC-MS/MS liquid chromatography-tandem mass spectrometry
  • the mixture of nucleosides obtained by fragmentation is analyzed using high performance liquid chromatography coupled with tandem mass spectrometry (LC-MS/MS) of the triple quadrupole type in the Multiple Reaction Monitoring (MRM) mode.
  • MRM mode is a highly sensitive and specific technique that allows the quantification of molecules by mass spectrometry. This scanning mode is dependent on tandem mass spectrometry and more particularly on triple quadrupoles or hybrid trap mass spectrometry systems.
  • the MRM scan mode is based on the selection of ions of specific mass and charge of a molecule, ions called precursor ions or parent ions, as well as on the corresponding fragment ions after fragmentation in the collision cell.
  • the first quadrupole will allow the precise selection of the specific precursor ions of the molecules of interest which will then be fragmented in the second quadrupole.
  • the resulting fragment ions are then selected in the third quadrupole.
  • the two ions mass/charge then correspond to a highly specific transition of the molecule of interest.
  • the subject of the invention is an in vitro method for characterizing a tumor of an individual, from a biopsy of this individual, comprising the steps of: a) preparation, from of said biological sample, of an extract of total cellular RNA and fragmentation of the polymeric RNA into nucleosides, b) isolation and determination of a respective quantity of at least 3, preferably at least 5, preferably at least 10, preferably at least 20, different nucleosides from step a), c) establishment, for said biological sample, of a profile of nucleosides from the respective amounts of each of the nucleosides obtained during step b), said profile being characteristic of said tumour.
  • the subject of the invention is an in vitro method for characterizing a tumor of an individual, said tumor being a tumor located in one of the following organs: rectum, colon, breast, pancreas, kidney, lung, or hematologic tumor, including leukemia.
  • the subject of the invention is an in vitro method for characterizing a glial tumor of an individual, from a biological sample isolated from this individual, comprising the steps of: a) preparation , from said biological sample, of an extract of total cellular RNA and fragmentation of said RNA into nucleosides, b) isolation and determination of a respective quantity of at least 3, preferably at least 5, preferably at least 10, preferably at least 20, different nucleosides from step a), c) establishment, for said biological sample, of a profile of nucleosides from the respective amounts of each of the nucleosides obtained during step b), said profile being characteristic of said tumour, and d) prediction of a grade of said glial tumor by a first previously trained classification model, from the profile established during step c).
  • glial tumor or "glioma” refer to various brain tumors that develop from normal glial cells in the brain.
  • the grade of a glial tumor represents the most important determinant for the survival of an individual carrying such a tumor.
  • Non-tumor brain tissue is characterized by many cells with normal characteristics and few mitotic characteristics, without endothelial proliferation.
  • Grade II tumors also called “astroblastomas” include a greater number of cells comprising polymorphic nuclei in mitosis.
  • Grade III tumors are also called “anaplastic astroblastomas”.
  • Grade IV tumors correspond to glioblastoma multiforme.
  • classification model means a previously trained automatic learning algorithm, in particular during supervised learning, as well as a set of learning data allowing the training of the aforementioned algorithm, and a set of evaluation data.
  • said first classification model may comprise: an automatic learning algorithm, more particularly a supervised learning neural network, or a multi-class probabilistic classification algorithm, trained beforehand with a set of learning data .
  • the training data are specific to the question asked and, on the other hand, specific to the type of cancer targeted.
  • the training phase of the learning algorithm uses the learning data to produce a classification model, which is itself specific to the question asked and specific to the type of cancer targeted.
  • the learning phase infers the parameters of the model based on this data and the question. For example, for a grade determination question, the classification model returns one response among four possible responses if four grades are distinguished.
  • the classification model answers with "tumor" or "healthy", i.e. a choice among two possible answers.
  • the classification model produced by the learning phase is a program implemented on a computer in order to obtain a prediction on the question considered from the data of an epitranscriptomic profile from a sample.
  • This program is downloadable and installable, thus allowing installation on a system other than the one on which it was produced.
  • the training data set can comprise a multitude of data pairs, each of the data pairs comprising a first data item representing a nucleoside profile and a second data item representing the tumor grade for this profile.
  • the training data set may include a training set and a test set, also referred to as "(evaluation set)[CFi]", of the model.
  • the model can thus be tested on the training set and the test set can be used to determine whether the model has been learned successfully or not.
  • the training game and the test game may be different.
  • the test set may correspond to part of the training set.
  • the training data set can be formed beforehand from data obtained in the laboratory by analysis of samples obtained from individuals suffering from cancer and whose tumor grade has been determined beforehand.
  • the classification model has reached a satisfactory level of learning on all the profiles of the test set if the classification reaches, for example, 85% accuracy; in other words, it is estimated that the classification model has reached a satisfactory level of learning on all the profiles of the test set if the classification reaches for example at most 15% error.
  • the classification model may consist of a computer program.
  • a classification model implemented in a method according to the invention consists of a computer program which potentially executes a technical function consisting of steps of the classification method.
  • the execution of said program by a computer produces a digital object, which is a technical object.
  • Said computer program can be written in any computer language such as for example in C, C++, JAVA, Python, etc.
  • the classification model may comprise a support vector machine, a random forest, a linear discriminant analysis; these methods are called in English respectively: "Support Vector Machines”, “Random Forests” and “Linear Discriminant Analysis” (LDA).
  • LDA Linear Discriminant Analysis
  • said learning algorithm is chosen in particular from:
  • the prediction of a grade of a glial tumor can comprise: the prediction of a grade II glial tumor, the prediction of a grade III glial tumor or prediction of a grade IV glial tumour.
  • the invention more particularly relates to an in vitro method for predicting a grade of a glial tumor of an individual, from a biological sample of said individual, and in particular a biopsy of said glial tumor, in which the predicting a grade of said glial tumor by a previously trained classification model, comprising: predicting a grade II glial tumor, predicting a grade III glial tumor and predicting a grade glial tumor IV.
  • a method for predicting a grade of a glial tumor of an individual comprises distinguishing between a grade II glial tumor and a grade III or IV glial tumor; the distinction between a grade III glial tumor and a grade II or IV glial tumour; the distinction between a grade IV glial tumor and a grade II or III glial tumour.
  • the invention even more particularly relates to an in vitro method for characterizing a glial tumor of an individual, from a biopsy of said tumor, comprising: a) the preparation, from said biopsy, of an extract of total cellular RNA and fragmentation of said RNA into nucleosides, b) isolation and quantitative determination of at least 3 nucleosides resulting from said fragmentation, chosen from: adenosine (A), cytidine (C), guanosine (G ), uridine (U), 2'-0-methyladenosine (Am), 1-methyladenosine (mA), N6,N6- dimethyladenosine (m66A), N6,N6,2'-0-trimethyladenosine (m66Am), N6- methyladenosine (m6A), N6,2'-0-dimethyladenosine (m6Am), N4-acetylcytidine (ac4C), 2'-0-methylcytidine (Cm), 5-
  • step c) establishing, for said tumor, a profile from the respective quantitative values of the nucleosides obtained during step b), said profile being characteristic of said tumor, and d) predicting a grade of said glial tumor by a previously trained classification model, from the profile established during step c), in which the prediction of a grade of a glial tumor is chosen from: the prediction of a grade II glial tumor , the prediction of a grade III glial tumor and the prediction of a grade IV glial tumor.
  • the subject of the invention is an in vitro method for characterizing a glial tumor of an individual, said method comprising the steps of: a) preparing, from said biological sample, an extract of total cellular RNA and fragmentation of said RNA into nucleosides, b) isolation and determination of a respective quantity of at least 3, preferably at least 5, preferably at least 10, preferably at least 20, different nucleosides from the step a), c) establishment, for said biological sample, of a nucleoside profile from the respective quantities of each of the nucleosides obtained during step b), said profile being characteristic of said tumor, and d) prediction of a state of survival of said individual, by a second classification model trained beforehand, from the profile established during step c).
  • said second classification model may comprise: an automatic learning algorithm, more particularly a supervised learning neural network, or a probabilistic classification algorithm, previously trained with a second set of learning data.
  • Said second training data set may comprise a multitude of data pairs, each of the data pairs comprising a first data item representing a nucleoside profile and a second data item representing the survival status for this profile.
  • This training dataset may include a training set and a model evaluation set.
  • the model can thus be tested on the training game and the game evaluation can be used to determine if the training of the model is satisfactory or not.
  • the training game and the evaluation game can be different.
  • the evaluation game may correspond to part of the training game.
  • the learning data set can be constituted beforehand from data obtained in the laboratory by analysis of samples obtained from individuals suffering from cancer and whose survival status has been determined beforehand.
  • the classification model has reached a satisfactory level of learning on all the profiles of the evaluation set if the classification reaches 85% accuracy; in other words, it is estimated that the classification model has reached a satisfactory level of learning on all the profiles of the evaluation set if the classification reaches at most 15% error.
  • the second classification model can consist of a computer program.
  • the computer program can be written in any computer language such as for example in C, C++, JAVA, Python, etc.
  • the second classification model may comprise a support vector machine, a random forest, a linear discriminant analysis; these methods are called in English respectively: "Support Vector Machines”, “Random Forests” and “Linear Discriminant Analysis”.
  • the subject of the invention is a classification model, previously trained on a learning data set, to predict a grade of a glial tumor of an individual suffering from a tumor, from a profile of nucleosides obtained by implementing a method according to the invention.
  • Said classification model for predicting the grade of a glial tumor comprises a machine learning algorithm previously trained and evaluated, in particular during supervised learning, with a set of training data relating to the prediction of a grade of a glial tumor, said learning game comprising a training game and an evaluation game, both relating to the prediction of a grade of a glial tumor.
  • the invention also relates to a method for constructing a classification model for predicting the grade of a glial tumor, comprising at least:
  • the subject of the invention is a second classification model, previously trained on a learning data set, to predict a survival status of an individual suffering from a tumor, from a profile of nucleosides obtained by implementing a method according to the invention.
  • Said classification model for predicting a survival status of an individual suffering from a tumor comprises an automatic learning algorithm previously trained and evaluated, in particular during supervised learning, with a set of learning data relating to prediction of a survival status of an individual, said learning game comprises a training game and a test game, both relating to the prediction of a survival status of an individual suffering from a tumor.
  • the invention also relates to a method for constructing a classification model to predict an individual's survival status, comprising at least:
  • a learning data set relating to the prediction of an individual's survival status comprising a training set and a test set
  • the present invention relates to the use of a classification model according to the invention for the prediction of a grade of a glial tumour.
  • the subject of the present invention is the use of a classification model according to the invention for the stratification of a patient suffering from a glial tumour, in combination with at least one other biological marker characteristic of said patient.
  • the present invention relates to the use of a classification model according to the invention for the prediction of a state of survival of an individual.
  • the subject of the invention is an in vitro method for detecting the presence of a tumor in an individual, from a biological sample isolated from this individual, comprising the steps of: a) isolation of nucleosides from said biological sample, by extracting: i) total cellular RNA and its fragmentation into nucleosides, ii) extracellular RNA and its fragmentation into nucleosides, and/or iii) nucleosides derived from monomeric catabolites , and preferably nucleosides derived from monomeric catabolites, b) isolation and determination of a respective quantity of at least 3, preferably at least 5, preferably at least 10 preferably at least 20, different nucleosides obtained during the step a), and c) establishment, for said biological sample, of a nucleoside profile from the respective quantities of each of the nucleosides
  • the subject of the invention is an in vitro method for detecting the presence of a tumor in an individual, from a blood sample isolated from this individual, comprising the steps of: a ) isolation of the nucleosides of said biological sample, by extracting the nucleosides from the monomeric catabolites, b) isolation and determination of a respective quantity of at least 3, preferably at least 5, preferably at least 10, preferably at least 20, different nucleosides from step a), c) establishment, for said biological sample, of a nucleoside profile from the respective amounts of each of the nucleosides obtained during step b), said profile being characteristic of said tumor, and d) prediction of the presence of said tumor by a previously trained classification model, from the profile established during step c).
  • the subject of the invention is an in vitro method for detecting the presence of a colorectal tumor in an individual, from a blood sample isolated from this individual, comprising the steps of: To. isolation of the nucleosides of said biological sample, by the extraction of the nucleosides resulting from the monomeric catabolites, b. isolation and determination of a respective quantity of at least 3, preferably at least 5, preferably at least 10 preferably at least 20, different nucleosides from step a), vs. establishment, for said biological sample, of a profile of nucleosides from the respective quantities of each of the nucleosides obtained during step b), said profile being characteristic of said tumour, and d. prediction of the presence of said colorectal tumor by a previously trained classification model, from the profile established during step c).
  • the invention also relates to the use of a method according to the invention for detecting the presence of a tumor, said tumor being a tumor located in one of the following organs: rectum, colon, breast, pancreas , kidney, lung, or hematologic tumor, including leukemia.
  • a subject of the invention is also the use of a method according to the invention for detecting the presence of a tumor of the digestive tract, in particular a colorectal tumor.
  • the subject of the invention is a classification model, previously trained on a learning data set, to detect the presence of a tumor in an individual, from a nucleoside profile obtained by implementation of a method according to the invention.
  • This classification model comprises an automatic learning algorithm previously trained and evaluated, in particular during supervised learning, with a set of learning data relating to the detection of the presence of a tumor in an individual, said set learning includes a training game and a test game, both relating to the detection of the presence of a tumor in an individual.
  • the subject of the invention is a classification model, trained beforehand on a learning data set, to detect the presence of a colorectal tumor in an individual, from a nucleoside profile obtained by placing implementation of a method according to the invention.
  • Said classification model comprises a machine learning algorithm previously trained and evaluated, in particular during supervised learning, with a set of learning data relating to the detection of the presence of a colorectal tumor in an individual.
  • the invention also relates to a method for constructing said classification model for detecting the presence of a tumor, comprising at least:
  • a machine learning algorithm for a classification task - the selection of a machine learning algorithm for a classification task, - the supply of a learning data set relating to the detection of the presence of a tumor in an individual, comprising a training set and a test set,
  • the invention also relates to a method for constructing a classification model for detecting the presence of a colorectal tumor, comprising at least: the selection of an automatic learning algorithm for a classification task, providing a set of training data relating to the detection of the presence of a colorectal tumor in an individual, comprising a training set and a test set, and a step of training the prediction of the presence of a colorectal tumor in an individual, by said algorithm, using said training data set.
  • the present invention relates to the use of a classification model according to the invention for the detection of a tumour, in particular a colorectal tumour.
  • the subject of the present invention is the use of a classification model according to the invention for the detection of a tumor, in particular a colorectal tumor, in combination with at least one other biological marker characteristic of said patient.
  • the present invention finally relates to a diagnostic method comprising the implementation of a method according to the invention for characterizing a tumour.
  • the present invention also relates to a diagnostic method comprising the implementation of a method according to the invention for predicting a grade of a glial tumour.
  • the present invention also relates to a diagnostic method comprising the implementation of a method according to the invention for predicting the state of survival of a patient.
  • Said diagnostic method may further comprise a histological analysis of the tissues.
  • the present invention finally relates to a diagnostic method comprising the implementation of a method according to the invention for detecting a tumour.
  • the present invention also relates to a diagnostic method comprising the implementation of a method according to the invention for detecting a colorectal tumour.
  • Said diagnostic method can comprise a histological analysis of the tissues.
  • FIG. 1 represents the overall scheme of the experiment, where LC-MS/MS denotes liquid chromatography associated with mass spectrometry and the raw data (data) are the epitranscriptomic profiles obtained by LC-MS/MS.
  • FIG. 2 represents the overall diagram of the bioinformatics process
  • the raw data are the epitranscriptomic profiles obtained by LC-MS/MS
  • the normalized data are the epitranscriptomic profiles after normalization
  • MS designates mass spectrometry (combined with liquid chromatography).
  • FIGS. 3A, 3B and 3C represent, in the form of a boxplot, six graphs representing respectively the relative quantity (in percentage) of six nucleosides modified according to the grade of glial tumor.
  • said grade is designated on the abscissa by: "Normal”, “Grade-II”, “Grade-III” or “Grade IV” respectively indicating a sample of non-tumorous glial tissue or a sample of grade glial tumor II, III or IV.
  • Figure 3A shows two examples of nucleosides whose quantity decreases with increasing glial tumor grade: (from left to right) oxo8G and mlG.
  • Figure 3B shows two examples of nucleosides whose quantity increases with increasing glial tumor grade: (from left to right) m6Am and Gm.
  • Figure 3C shows two examples of nucleosides whose quantity varies slightly with increasing glial tumor grade: (from left to right) mA and m7G. The scales are different depending on the graphs.
  • Figure 4 represents the percentage of explained variance of the first components of the Principal Component Analysis (PCA) of the epitranscriptomic profiles of the cohort. Along the abscissa, the components are numbered from 0 to 9. Along the ordinate, the percentages of variance explained by these components.
  • PCA Principal Component Analysis
  • PCA Principal Component Analysis
  • Each of the axes represents, respectively, principal component 0 (39.24%), principal component 1 (23.27%) and principal component 2 (8.58%).
  • the "star” symbols represent the guard "normal”, “triangle” grade II, "square” grade III and “cross” grade IV, respectively.
  • EXAMPLE 1 Analysis of transcriptomic data from glial cell samples
  • This section presents the cohort used, the sample preparation, the method for obtaining epitranscriptomic profiles and the computer analysis program. This section then presents the results of the exploratory analysis of the profiles of the cohort, the prediction of tumor grades and the prediction of survival.
  • the processing of the biological sample begins with the extraction of the RNA by phase separation in order to obtain an RNA sample of at least 100 ng.
  • the treatment continues with the enzymatic hydrolysis of the polymeric RNA and the dephosphorylation of the nucleosides.
  • RNA The enzymatic digestion of RNA is carried out as follows: a quantity of 400 ng of RNA is diluted in a total volume of 20 ⁇ L of milliQ water, to which 3 ⁇ l of ammonium acetate (0.1 M pH 5.3) and 0.001 enzymatic unit (U) of Nuclease PI (Sigma, N8630). Incubation at 42° C. is carried out for 2 hours. Then, 3 ⁇ l of 1 M ammonium acetate and 0.001 U of alkaline phosphatase (Sigma, P4252) are added. The mixture is then incubated at 37° C. for 2 hours.
  • nucleoside solution is diluted twice and filtered with 0.22 ⁇ m filters (Millex®-GV, Millipore, SLGVR04NL). Finally, 5 ⁇ L of each sample is injected and all samples are analyzed in triplicate by LC-MSMS.
  • LC Liquid chromatography
  • nucleosides are separated by Nexera LC-40 systems (Shimadzu) using a SynergiTM Fusion-RP C18 column (4 ⁇ m particle size, 250 mm x 2 mm, 80 ⁇ ) (Phenomenex, 00G-4424-B0).
  • the mobile phase consists of 5 mM ammonium acetate adjusted to pH 5.3 with acetic acid (solvent A) and pure acetonitrile (solvent B).
  • solvent A acetic acid
  • solvent B pure acetonitrile
  • the 30 minute gradient elution starts with 100% phase A followed by a linear gradient to 8% solvent B at 13 minutes.
  • Solvent B is further increased to 40% in 10 minutes. After 2 minutes, solvent B is reduced to 0% at 25.5 minutes.
  • the initial conditions are regenerated by rinsing with 100% solvent A for an additional 4.5 minutes.
  • the flow rate is 0.4 ml/min and the column temperature is 35°
  • Mass spectrometry in “Multiple Reaction Monitoring” (MRM) mode is carried out as follows: detection is carried out by Shimadzu TripleQuad 8060 in positive ion mode. The mass spectrometry operates in dynamic MRM mode with a retention time window of 3 min and a maximum cycle time set at 258 ms. Peak areas are determined using Skyline 4.1 software (Pino LK et al, “The Skyline ecosystem: Informatics for quantitative mass spectrometry proteomics.” Mass Spectrom Rev. 2020 May;39(3): 229-244. 2020 ).
  • the mass spectrometer was calibrated to accurately identify and quantify 25 modified nucleosides (Table 2) and 4 unmodified nucleosides (A, U, G, T) (Table 1).
  • the mass spectrometry device used is a Shimadzu TripleQuad 8060 in multiple reaction monitoring mode. Each sample was injected three times, providing three technical replicates. For each nucleoside, the homogeneity of the retention time given by the mass spectrometer is checked. Measurements showing a discrepancy of more than 6% were discarded. This results in a data table containing the quantity measurements of each nucleoside, in each replicate, for all samples. This table is then analyzed using our computer programs.
  • the necessary characteristics of the programs are as follows: a) they take as input mass spectrometry data in a file in tabular format (CSV format); b) the quantifications of area and retention time from the spectrometer must be given in the form of real values with a precision of at least 10-1; c) they implement a multi-class supervised machine learning algorithm among those mentioned above; d) they implement the learning phase, the evaluation phase, and the prediction mode; e) they use the classification model in prediction mode to classify the epitranscriptome profile of a patient sample in order to predict the tumor grade.
  • CSV format tabular format
  • Tables 3, 4 and 5 indicate, for each of the nucleosides analyzed, the normalized data value for each of grades II, III and IV of glioma, and for healthy (“normal”) tissue.
  • Fig. 1 The joint analysis of epitranscriptomic profiles and clinical variables of interest (Fig. 1) is carried out, in particular concerning the grade in the case of gliomas. This process can be adapted to any type of clinical variable. In this example, we are trying to distinguish the grades of cancer, which can be difficult to establish by pathological examination.
  • Pre-processing the cohort profiles resulted in a table of 77 rows, with one row per sample, and 29 columns, with one column per measurement. For each of the samples, the mention of the grades of the tumors or the mention “normal” for the healthy samples, was added. An exploratory statistical analysis of this table was carried out to assess the relevance of the signal contained in the profiles on the grade information.
  • nucleosides are studied in the samples of the same grade, and we compare these variations between the grades.
  • the experimental results suggest a grouping of nucleosides into four groups: i) those whose quantity increases with grade, i.e. between tissue non-tumor cerebral brain (designated for simplification as “normal” on the ordinate of the graphs) and the grades, II, III and IV, in particular the nucleosides oxo8G, mlG, queuosine and Ac4C (as shown for example in Fig. 3A); ii) those whose quantity decreases with grade (as shown for example in Fig. 3B), iii) those which vary weakly with grades (as shown for example in Fig. 3C) and iv) the remaining nucleosides, which do not satisfy not the conditions of membership of the first three groups.
  • a Principal Component Analysis (PCA) of these data was carried out, in order to carry out a reduction in dimension, not to be confused with a selection of the "characteristics", in other words of the nucleosides, to see if the variations in quantity could be combined into a small number of components.
  • PCA is an exploratory multivariate analysis method that reduces the dimensions of data while capturing their variability.
  • Components are new variables that combine data from initial observations to best capture their variability while reducing the number of variables to analyze.
  • the components result from the projection of the initial data on other axes of the multidimensional space.
  • the components are ordered in descending order of percentage of variance explained. This percentage associated with each component indicates its importance in describing the initial data.
  • Fig. 4 presents the graph of the percentage of variance explained for the first 10 components.
  • PCA is a classic data analysis technique.
  • Machine learning method enabling accurate grade prediction of tumors and healthy samples
  • the learning method must belong to the classification category.
  • SVM Support Vector Machine
  • the prediction accuracy of the SVM algorithm equipped with a linear kernel on the profiles of the subset tested is 0.90, out of a maximum of 1, which is remarkable.
  • the level of prediction accuracy is maintained when the learning is reiterated then the tests with new random partitionings of the dataset, which shows the robustness of the learning tool developed.
  • results of the evaluation allow us to compare our method of normalization (denoted by SUM, for sum) with the formulas used in the literature.
  • the classic standardization which consists in dividing the measurement of a modified nucleoside, for example mlA, by that of the corresponding unmodified nucleoside, here the measurement of A.
  • the precision according to the use of different formulas is between 0.8 and 0.9, and is therefore always less than or equal to (but never greater than) the precision of the normalization formula SUM.
  • the quality of grade prediction is not particularly related to the optimization of a learning method on a given cohort, since two very different learning methods obtain similar results.
  • the quality of the prediction is therefore linked to the power of the signal contained in the transcriptomic profiles.
  • RNAs Differences in the relative amounts of certain epigenetic modifications of RNAs have been demonstrated according to different samples, whether healthy or tumorous. These differences make it possible in particular to separate the different tumor grades.
  • a supervised machine learning algorithm applied to the nucleoside quantity vectors effectively distinguishes glioma grades, and in particular distinguishes grades II and III, with remarkable accuracy given the relatively small cohort size. Moreover, this method also makes it possible, from the same data, to estimate patient survival using a supervised automatic learning method.
  • Circulating RNA is extracted from plasma using a kit (miRNeasy Serum/Plasma). The RNAs are digested with PI nuclease and treated with alkaline phosphatase in order to obtain a mixture of nucleosides. Circulating free nucleosides are extracted from the same plasma samples using a methanol extraction procedure. They do not require enzymatic treatment before passing through mass spectrometry.
  • LC Liquid chromatography
  • mass spectrometry and bioinformatics analyzes are carried out as indicated in example 1.
  • each sample is analyzed three times independently, thus making it possible to obtain three technical replicas for each.
  • the raw data is processed in order to be normalized as in example 1.
  • these steps produce an epitranscriptomic profile per sample.
  • a machine learning method has been developed and tested to determine the presence or absence of a tumor from epitranscriptomic profiles alone, ie without using any information other than the quantities of nucleosides.
  • SVM Support Vector Machine
  • the algorithm was first trained and then tested in order to assess its ability to predict the presence or not of a tumor in the sample.
  • the machine learning method gives a prediction with 100% accuracy and 100% sensitivity.

Landscapes

  • Health & Medical Sciences (AREA)
  • Life Sciences & Earth Sciences (AREA)
  • Engineering & Computer Science (AREA)
  • Chemical & Material Sciences (AREA)
  • Molecular Biology (AREA)
  • Immunology (AREA)
  • Biomedical Technology (AREA)
  • Physics & Mathematics (AREA)
  • General Health & Medical Sciences (AREA)
  • Hematology (AREA)
  • Urology & Nephrology (AREA)
  • Analytical Chemistry (AREA)
  • Biochemistry (AREA)
  • General Physics & Mathematics (AREA)
  • Pathology (AREA)
  • Biotechnology (AREA)
  • Microbiology (AREA)
  • Bioinformatics & Cheminformatics (AREA)
  • Food Science & Technology (AREA)
  • Medicinal Chemistry (AREA)
  • Cell Biology (AREA)
  • Biophysics (AREA)
  • Bioinformatics & Computational Biology (AREA)
  • General Engineering & Computer Science (AREA)
  • Genetics & Genomics (AREA)
  • Public Health (AREA)
  • Medical Informatics (AREA)
  • Theoretical Computer Science (AREA)
  • Wood Science & Technology (AREA)
  • Zoology (AREA)
  • Organic Chemistry (AREA)
  • Data Mining & Analysis (AREA)
  • Primary Health Care (AREA)
  • Epidemiology (AREA)
  • Proteomics, Peptides & Aminoacids (AREA)
  • Spectroscopy & Molecular Physics (AREA)
  • Artificial Intelligence (AREA)
  • Software Systems (AREA)
  • Mathematical Physics (AREA)
  • Computing Systems (AREA)

Abstract

La présente invention a pour objet un procédé in vitro de caractérisation d'une tumeur, fondé sur l'analyse quantitative de nucléosides modifiés et non modifiés issus de l'ARN cellulaire total, de l'ARN extracellulaire et/ou des nucléosides isolés, extraits d'un échantillon biologique. Plus particulièrement, l'invention a pour objet un procédé de prédiction du grade d'une tumeur gliale. Plus particulièrement, l'invention a également pour objet un procédé de détection d'une tumeur. La présente invention se situe donc dans les domaines de la cancérologie et de la biologie moléculaire plus particulièrement appliquée au diagnostic médical.

Description

PROCEDE DE CARACTERISATION D'UNE TUMEUR
Domaine de l'invention
La présente invention a pour objet un procédé in vitro de caractérisation d'une tumeur, fondé sur l'analyse quantitative de nucléosides modifiés et non modifiés isolés d'un échantillon biologique. Plus particulièrement, l'invention a pour objet un procédé de prédiction du grade d'une tumeur gliale. Selon un autre aspect particulier, l'invention a pour objet un procédé de détection de la présence d'une tumeur.
La présente invention se situe donc dans les domaines de la cancérologie et de la biologie moléculaire plus particulièrement appliquée au diagnostic médical.
Etat de la technique
La caractérisation d'une tumeur est une condition préalable essentielle au choix du traitement le plus approprié pour le patient. Par « caractérisation d'une tumeur », on entend la caractérisation du statut ou degré d'évolution d'une tumeur donnée, il peut s'agir notamment par exemple de l'évaluation du degré d'évolution d'une tumeur d'un tissu connu, de l'attribution à une tumeur d'un grade préalablement défini, ou de tout autre caractérisation telle que notamment la détermination du caractère initial ou métastatique d'une tumeur.
Les gliomes, ou tumeurs gliales, sont les tumeurs les plus courantes du système nerveux central, elles sont caractérisées par une variabilité significative de l’âge d’apparition, du classement, des caractéristiques histologiques et de la capacité à progresser et éventuellement à métastaser.
Les gliomes sont classés en fonction de leur morphologie et de leur degré de malignité. La classification consensuelle de l’Organisation mondiale de la santé (OMS) attribue un degré de malignité de I à IV aux gliomes, les glioblastomes, ou tumeurs de grade IV, étant la forme la plus agressive et la plus mortelle.
L’une des principales limites de la prise en charge des gliomes et des glioblastomes est liée au manque actuel de stratégies de diagnostic efficaces. La sélection d’un traitement personnalisé nécessite une classification précise des tumeurs. Actuellement, les principales méthodes de diagnostic utilisées cliniquement pour la détection des gliomes reposent sur des tests neurologiques et des méthodes de neuro-imagerie, réalisés lorsque la maladie est déjà à un stade avancé. Le diagnostic de la tumeur nécessite une analyse des tissus du patient provenant d'une biopsie ou d'une résection chirurgicale. À partir de cet échantillon, plusieurs analyses moléculaires sont effectuées : test d'expression de gènes candidats, comptage du nombre de copies d'ADN, profil de méthylation, profilage de la voie phospho-protéique et séquençage génétique. Pourtant, les diagnostics basés sur la biopsie ont des limites concernant la détermination du grade des tumeurs et la stratification des patients. En effet, en ce qui concerne par exemple plus particulièrement les tumeurs gliales, les grades du gliome sont difficiles à distinguer, et plus particulièrement les grades II et III. L'établissement du grade requiert une analyse anatomo-pathologique délicate, souvent réalisée indépendamment par deux spécialistes. Le grade II désigne une tumeur bénigne tandis que le grade III représente une transition vers le glioblastome multiforme, qui est l’état le plus agressif.
Les classifications purement histologiques sont difficilement reproductibles, elles sont basées sur une expertise visuelle, et exigent l'intervention de deux spécialistes. Le couplage anatomo-pathologique avec analyse des images par imagerie par résonnance magnétique (IRM) est coûteux et long, il dépend notamment du délai d'accès à l'IRM. A l'heure actuelle, aucun biomarqueur n'est suffisant à lui seul pour orienter les décisions thérapeutiques anti-cancéreuses.
Il existe donc un besoin général d'un procédé in vitro de caractérisation d'une tumeur, ledit procédé étant objectif, précis, reproductible, aisé et réalisable à un stade si possible précoce de la maladie. Ledit procédé permettrait de renforcer le diagnostic et faciliter la stratification des patients.
La publication de Janzer (« Neuropathologie et pathologie moléculaire des gliomes." R-C Janzer, Rev. Med. Suisse, 5, 1501-4, 2009) décrit la classification des gliomes selon l'OMS, basée sur des critères histologiques et immuno-histochimiques, ainsi que sur des profils génétiques mettant en évidence l'altération de l'ADN des cellules : la détermination de l'hyperméthylation du promoteur du gène MGMT (pour les glioblastomes) et la détection de pertes des chromosomes lp et 19q (pour les tumeurs oligodendrogliales).
La publication de Relier et al (« FTO-mediated cytoplasmic m6Am déméthylation adjusts stem-like properties in colorectal cancer œil.", Nat. Commun 12, 1716, 2021) décrit la régulation dans le cytoplasme du niveau de la méthylation m6Am par la FTO (en anglais Fat mass and obesity associated protein ) dans des lignées de cellules souches cancéreuses. Les auteurs mettent en évidence la fonction biologique de la modification m6Am et ses effets secondaires potentiels pour le suivi du cancer colorectal. Ce document mentionne une étape d'analyse par spectrométrie de masse (LC-MS/MS) d'ARNm fragmenté. Seuls les nucléosides m6A, A, m6Am et Am sont détectés et quantifiés.
La demande internationale WO 2007/008647 « Diagnostic et classement de gliomes à l'aide d'une approche protéomique » a pour objet un procédé de diagnostic et de classification des gliomes utilisant une approche protéomique. Dans ce procédé, un tissu tumoral est analysé par spectrométrie de masse et un profil des protéines exprimées est obtenu.
Il existe donc un besoin particulier d'un procédé in vitro d'évaluation du degré de malignité d'une tumeur gliale, en particulier sa classification. Il existe en particulier un besoin d'un procédé objectif permettant distinguer entre le grade II et le grade III des tumeurs gliales, pour renforcer le diagnostic et faciliter la stratification des patients.
Par ailleurs, il existe un besoin particulier d'un procédé de détection de la présence d'une tumeur dès les stades les plus précoces. En effet, la prise en charge précoce de la plupart des cancers accroît considérablement la survie d'un patient ou permet même sa guérison. Il existe donc un besoin d'un procédé objectif permettant de caractériser précocement la présence d'une tumeur.
Exposé de l'invention
Les inventeurs ont maintenant mis au point un procédé de caractérisation d'une tumeur qui exploite les données quantitatives de l'épitranscriptome.
L'épitranscriptome englobe l'ensemble des modifications chimiques portées par les bases des acides ribonucléiques (ARN), ensemble que l'on dénomme aussi par les termes « épigénétique de l'ARN ». Un procédé selon l'invention comprend la fourniture d'un échantillon biologique d'un sujet atteint d'une tumeur et l'obtention des quantités de nucléosides modifiés et non modifiés issus dudit échantillon, lesdites quantités sont regroupées dans un vecteur (au sens mathématique du terme). Selon un aspect particulier, un procédé selon l'invention comporte l'analyse informatique subséquente dudit vecteur pour la caractérisation d'une tumeur. Ladite caractérisation d'une tumeur permet de prédire des informations cliniques et médicales sur la tumeur à partir de l'échantillon sujet à l'analyse. Plus particulièrement, un procédé selon l'invention comporte l'analyse informatique dudit vecteur pour la prédiction du grade de ladite tumeur. Par simplicité, pour un échantillon donné, on nommera « profil épitranscriptomique » ou tout simplement « profil », le vecteur qui regroupe les quantités de chaque nucléoside, modifié ou non modifié.
Les nucléosides modifiés et non modifiés sont issus : i) de l'ARN total extrait de cellules d'un échantillon biologique d'un patient, ii) de l'ARN extracellulaire provenant d'un échantillon biologique d'un patient, et/ou iii) d'un extrait de métabolites d'un échantillon biologique isolé d'un patient.
Les nucléosides issus de l'ARN total extrait de cellules d'un échantillon biologique d'un patient et/ou de l'ARN extracellulaire provenant d'un échantillon biologique d'un patient sont obtenus par la fragmentation de l'ARN en nucléotides puis leur déphosphorylation. Les nucléosides issus d'un extrait de métabolites d'un échantillon biologique isolé d'un patient sont obtenus par une extraction des métabolites d'un échantillon biologique puis la déphosphorylation desdits métabolites, selon des procédés appropriés bien connus de l'homme du métier. Lesdits métabolites sont notamment issus du catabolisme de l'ARN, les nucléosides présents sous forme monomérique peuvent également être désignés par l'expression de nucléosides dits « libres ».
Plus particulièrement, les nucléosides modifiés et non modifiés sont les nucléosides présents dans l'ARN total extrait de cellules d'une biopsie de ladite tumeur.
Par « nucléosides » on désigne les glycosamines constituées d'une base nucléique liée à l'atome de carbone anomérique d'un résidu de pentose par une liaison glycosidique depuis l'atome d'azote NI d'une pyrimidine ou l'atome N9 d'une purine. Selon un aspect particulier d'un procédé selon l'invention, lorsque ledit pentose est le ribose, le terme « nucléosides » désigne dans ce cas les ribonucléosides.
On désigne aussi les nucléosides modifiés des ARN par les termes de « marques épitranscriptomiques » ou de « modifications épitranscriptomiques ». Outre les nucléosides usuels des ARN (Tableau 1) utilisables pour la caractérisation des tumeurs, des nucléosides modifiés utilisables dans un procédé selon l'invention, en particulier dans l'analyse de gliomes, sont listés (Tableau 2). Tableau 1
Tableau 2 Selon les modes de réalisation d'un procédé selon l'invention, un profil épitranscriptomique peut inclure, selon les besoins de l'application, un nombre plus important de nucléosides modifiés, à déterminer parmi les nucléosides connus (Jonkhout et al, « The RNA modification landscape in human disease », RNA, Dec ;23 (12) : 1754-1769, 2017). Une liste complète de tous les nucléosides modifiés, qui pourront, selon les besoins de l'analyse, être inclus dans les profils transcriptomiques est accessible publiquement.
Le profil épitranscriptomique d'un échantillon caractérise ledit échantillon. Ledit profil épitranscriptomique peut être obtenu par toute technique connue de l'état de l'art, et notamment par spectrométrie de masse, notamment par spectrométrie de masse couplée à la chromatographie.
Pour désigner les informations médicales à prédire, on parlera aussi de « variables cliniques » ou « caractéristiques cliniques ».
Dans un procédé selon l'invention, l'étape d'analyse du profil épitranscriptomique à des fins de prédiction clinique est basé sur une méthode d'apprentissage automatique supervisé. L'apprentissage est effectué sur les profils issus d'une cohorte, c'est-à-dire des échantillons cellulaires pour lesquels on connaît au préalable la variable caractéristique clinique à prédire. Le « modèle informatique » ainsi créé par l'apprentissage peut être ensuite utilisé (en mode prédiction) afin de prédire la variable clinique pour tout nouvel échantillon.
Les inventeurs ont également développé un procédé de normalisation des données quantitatives brutes permettant d'obtenir un profil épitranscriptomique contenant des quantités relatives comparables.
Préalablement au procédé d'apprentissage, l'analyse exploratoire des profils des échantillons de la cohorte a révélé des variations des profils, lesdites variations étant corrélées au grade des tumeurs des sujets dont ont été extraits les échantillons. A partir des profils de la cohorte signature et au moyen d'un outil de prédiction par apprentissage automatique, un procédé selon l'invention permet de prédire le grade d'un gliome à partir d'un échantillon biologique d'un patient atteint de tumeur, en particulier à partir d'un échantillon comprenant des cellules tumorales. Plus particulièrement, un procédé selon l'invention permet de distinguer les grades II et III d'un gliome à partir d'un échantillon comprenant des cellules tumorales. Enfin, en combinant les profils épitranscriptomiques normalisés et les données de survie de patients, et au moyen d'un outil de prédiction par apprentissage automatique, un procédé selon l'invention permet de prédire la survie d'un patient à partir d'un échantillon biologique isolé dudit patient, en particulier à partir d'un échantillon tumoral.
Les inventeurs ont également développé un procédé de détection de la présence d'une tumeur chez un individu, à partir d'un échantillon biologique isolé de cet individu, comprenant les étapes de : a) isolement des nucléosides dudit échantillon biologique, par l'extraction : i) de l'ARN cellulaire total et sa fragmentation en nucléosides, ii) de l'ARN extracellulaire et sa fragmentation en nucléosides, et/ou iii) des nucléosides issus des catabolites monomériques, b) isolement et détermination d'une quantité respective d'au moins 3, de préférence au moins 5, de préférence au moins 10 de préférence au moins 20, nucléosides différents obtenus lors de l'étape a), et c) établissement, pour ledit échantillon biologique, d'un profil de nucléosides à partir des quantités respectives de chacun des nucléosides obtenues lors de l'étape b), ledit profil étant caractéristique de la présence de ladite tumeur.
Les étapes techniques d'un procédé de détection de la présence d'une tumeur chez un individu répondent aux mêmes caractéristiques que les étapes techniques d'un procédé de caractérisation d'une tumeur.
Les inventeurs ont donc maintenant mis au point un procédé qui exploite les données quantitatives de l'épitranscriptome pour la caractérisation d'une tumeur, d'une part, et pour la détection de la présence d'une tumeur, d'autre part. Selon un mode de réalisation, un procédé selon l'invention est donc avantageusement utilisé pour caractériser une tumeur. Selon un autre mode de réalisation, un procédé selon l'invention est avantageusement utilisé pour détecter la présence d'une tumeur.
Description détaillée de l'invention
Selon un premier aspect, l'invention a pour objet un procédé in vitro de caractérisation d'une tumeur d'un individu, à partir d'un échantillon biologique isolé de cet individu, comprenant les étapes de : a) isolement des nucléosides dudit échantillon biologique, par l'extraction : i) de l'ARN cellulaire total et sa fragmentation en nucléosides, ii) de l'ARN extracellulaire et sa fragmentation en nucléosides, et/ou iii) des nucléosides issus des catabolites monomériques, b) isolement et détermination d'une quantité respective d'au moins 3, de préférence au moins 5, de préférence au moins 10 de préférence au moins 20, nucléosides différents obtenus lors de l'étape a), et c) établissement, pour ledit échantillon biologique, d'un profil de nucléosides à partir des quantités respectives de chacun des nucléosides obtenues lors de l'étape b), ledit profil étant caractéristique de ladite tumeur.
Selon un premier mode de réalisation, un procédé selon l'invention est fondé sur l'analyse simultanée de la quantité de différents nucléosides issus de l'ARN cellulaire total d'un échantillon biologique, et/ou issus de l'ARN extracellulaire et sa fragmentation en nucléosides et/ou issus de nucléosides obtenus à partir des catabolites monomériques présents dans ledit échantillon, un procédé selon l'invention comprend donc l'analyse simultanée de multiples variables, et non sur la détection quantitative d'un marqueur unique.
Par « profil » ou « profil de nucléosides » on entend un vecteur de quantités de nucléosides.
Par « ARN cellulaire total » on entend la totalité de l'ARN cellulaire extrait selon les méthodes bien connues et accessibles. L'ARN cellulaire total inclut l'ARN de transfert (ARNt), l'ARN messager (ARNm), l'ARN ribosomique (ARNr) et d'autres ARN non codants. Ledit ARN cellulaire total est donc ici présent sous une forme polymérique.
Par « ARN extracellulaire » on entend la totalité de l'ARN extracellulaire présent sous forme polymérique, extrait selon les méthodes bien connues et accessibles. Cette forme polymérique de l'ARN extracellulaire est notamment également désignée par l'expression « ARN circulant ». Ledit ARN extracellulaire est issu de la dégradation enzymatique in vivo de l'ARN de transport (ARNt), l'ARN messager (ARNm) et/ou l'ARN ribosomal (ARNr) et des autres types d'ARN, notamment les ARN non codants.
Par « nucléosides issus des catabolites monomériques » on entend les nucléosides obtenus, selon les méthodes bien connues et accessibles, à partir des catabolites présents sous une forme monomérique dans l'échantillon. Ces catabolites monomériques sont issus de la dégradation enzymatique in vivo de l'ARN de transport (ARNt), l'ARN messager (ARNm) et/ou l'ARN ribosomal (ARNr) et des autres types d'ARN, notamment les ARN non codants. Par « isolement et détermination d'une quantité respective d'au moins 3 nucléosides différents » on entend l'isolement et la détermination d'une quantité de chacun des « au moins 3 » nucléosides pris individuellement.
Selon ce premier mode de réalisation, l'invention a donc pour objet un procédé in vitro de caractérisation d'une tumeur d'un individu, à partir d'un échantillon biologique isolé de cet individu, comprenant les étapes de : a) isolement des nucléosides dudit échantillon biologique par l'extraction de l'ARN cellulaire total et sa fragmentation en nucléosides, b) isolement et détermination d'une quantité respective d'au moins 3, de préférence au moins 5, de préférence au moins 10 de préférence au moins 20, nucléosides différents obtenus lors de l'étape a), et c) établissement, pour ledit échantillon biologique, d'un profil de nucléosides à partir des quantités respectives de chacun des nucléosides obtenues lors de l'étape b), ledit profil étant caractéristique de ladite tumeur.
Les nucléosides peuvent également être présents dans l'échantillon biologique sous une forme polymérique extracellulaire, notamment également désignée par l'expression « ARN circulant ». Les nucléosides peuvent également être présents sous une forme monomérique (métabolites) dans l'échantillon biologique. Lesdits ARN extracellulaires et nucléosides monomériques sont issus de la dégradation enzymatique in vivo de l'ARN de transport (ARNt), l'ARN messager (ARNm) et/ou l'ARN ribosomal (ARNr) et des autres types d'ARN, notamment les ARN non codants.
Selon un deuxième mode de réalisation, un procédé selon l'invention est fondé sur l'analyse simultanée de la quantité de différents nucléosides issus de l'ARN extracellulaire d'un échantillon biologique.
Selon ce deuxième mode de réalisation, l'invention a pour objet un procédé in vitro de caractérisation d'une tumeur d'un individu, à partir d'un échantillon biologique isolé de cet individu, comprenant les étapes de : a) isolement des nucléosides dudit échantillon biologique, par l'extraction de l'ARN extracellulaire et sa fragmentation en nucléosides, b) isolement et détermination d'une quantité respective d'au moins 3, de préférence au moins 5, de préférence au moins 10 de préférence au moins 20, nucléosides différents obtenus lors de l'étape a), et c) établissement, pour ledit échantillon biologique, d'un profil de nucléosides à partir des quantités respectives de chacun des nucléosides obtenues lors de l'étape b), ledit profil étant caractéristique de ladite tumeur.
Selon un troisième mode de réalisation, un procédé selon l'invention est fondé sur l'analyse simultanée de la quantité de différents nucléosides issus des catabolites monomériques présents dans un échantillon biologique.
Selon ce troisième mode de réalisation, l'invention a pour objet un procédé in vitro de caractérisation d'une tumeur d'un individu, à partir d'un échantillon biologique isolé de cet individu, comprenant les étapes de : a) isolement des nucléosides dudit échantillon biologique, par l'extraction des catabolites monomériques présents dans ledit échantillon, b) isolement et détermination d'une quantité respective d'au moins 3, de préférence au moins 5, de préférence au moins 10 de préférence au moins 20, nucléosides différents obtenus lors de l'étape a), et c) établissement, pour ledit échantillon biologique, d'un profil de nucléosides à partir des quantités respectives de chacun des nucléosides obtenues lors de l'étape b), ledit profil étant caractéristique de ladite tumeur.
Dans un procédé in vitro de caractérisation d'une tumeur d'un individu, à partir d'un échantillon biologique isolé dudit individu, ledit échantillon biologique est notamment être choisi parmi : un échantillon biologique solide, particulièrement une biopsie, et plus particulièrement une biopsie de ladite tumeur, et un échantillon biologique liquide, notamment un prélèvement d'un fluide corporel dudit individu, plus particulièrement un échantillon de sang, de plasma, de sérum ou d'urine.
Par « biopsie » on entend le prélèvement d'une très petite partie d'un organe ou d'un tissu. Lorsque l'échantillon biologique est une biopsie, le premier mode de réalisation du procédé selon l'invention, dans lequel l'ARN cellulaire total est extrait puis fragmenté, est préféré.
Lorsque l'échantillon biologique est un échantillon biologique liquide, le deuxième et le troisième mode de réalisation du procédé selon l'invention, dans lesquels respectivement l'ARN extracellulaire est extrait puis fragmenté, ou dans lequel l'ARN sous forme de nucléosides isolés est extrait, sont préférés. Dans un procédé selon l'invention, ledit échantillon biologique est en volume suffisant, ou comporte un nombre de cellules suffisant, pour permettre une détermination quantitative fiable d'au moins 3 nucléosides issus de la fragmentation d'un extrait de l'ARN cellulaire total dudit échantillon.
Dans le cas d'une biopsie, l'ARN cellulaire est total est extrait selon un procédé choisi parmi les procédés accessibles à l'homme du métier, notamment un procédé tel que décrit dans le présent exemple. Dans le cas d'un échantillon liquide, tel que le sang ou l'urine, ledit échantillon est préalablement traité si nécessaire, afin notamment d'éliminer d'éventuels composés interférents, de concentrer ledit échantillon et/ou de déterminer une valeur standard de concentration d'un élément de référence, tel que la créatinine dans l'urine, cette valeur standard servant à étalonner la concentration de l'échantillon à partir duquel le profil de nucléosides est établi.
Dans un procédé selon l'invention, l'ARN cellulaire total, l'ARN extracellulaire et les nucléosides isolés sont obtenus d'un échantillon biologique par tout procédé connu d'un homme du métier, ledit procédé comprend notamment une étape d'extraction, éventuellement une étape de fragmentation, et une étape de déphosphorylation.
Selon un aspect particulier, l'invention a donc pour objet un procédé in vitro de caractérisation d'une tumeur d'un individu à partir d'une biopsie de ladite tumeur, ledit procédé comprenant la préparation, à partir de ladite biopsie, d'un extrait de l'ARN cellulaire total et fragmentation dudit ARN en nucléosides.
Selon un mode de réalisation, dans un procédé in vitro de caractérisation d'une tumeur d'un individu selon l'invention, au moins 3 nucléosides isolés issus de l'échantillon biologique, obtenus par i) la préparation d'un extrait de l'ARN cellulaire total et de sa fragmentation en nucléosides, ii) par la préparation d'un extrait de l'ARN extracellulaire et de sa fragmentation en nucléosides, et/ou iii) par l'extraction des nucléosides isolés, sont isolés et leur quantité respective déterminée, lesdits au moins 3 nucléosides sont choisis parmi : les nucléosides non modifiés : adénosine (A), cytidine (C), guanosine (G), uridine
(U), et les nucléosides modifiés (voir Tableau 2).
Les nucléosides modifiés résultent de l'action d'un grand nombre d'enzymes hautement spécifiques, les nucléosides subissent notamment méthylation et réarrangement de liaisons carbone-azote. Lesdits nucléosides modifiés sont tous les nucléosides modifiés connus à la date de la présente demande, ces nucléosides sont notamment cités dans la publication de Jonkhout et al (« The RNA modification landscape in human disease », RNA, Dec ;23 (12) : 1754-1769, 2017), et dans le Tableau 2 de la présente demande.
Selon différents modes de réalisation d'un procédé objet de l'invention, lesdits au moins 3 nucléosides sont choisis dans les groupes constitués par : les nucléosides non modifiés : adénosine (A), cytidine (C), guanosine (G), uridine (U),
2'-0-méthyladénosine (Am), 1-méthyladénosine (mlA), N6,N6-diméthyladénosine (m66A), N6,N6,2'-0-triméthyladénosine (m66Am), N6-méthyladénosine (m6A), N6,2'-0-diméthyladénosine (m6Am), N4-acetylcytidine (ac4C), 2'-0- méthylcytidine (Cm), 5-hydroxyméthylcytidine (hm5C), 3-méthylcytidine (m3C), 5- méthylcytidine (m5C), 2'-0-méthylguanosine (Gm), 1-méthylguanosine (mlG), N2,N2,7-triméthylguanosine (m227G), N2,7-diméthylguanosine (m27G), 7- méthylguanosine (m7G), 8-hydroxyguanosine (oxo8G), inosine (I), pseudouridine (Psi), queuosine (Q), 3,2'-0-diméthyluridine (m3Um), 5-méthoxycarbonylméthyl-
2-thiouridine (mcm5s2U), 5- méthoxycarbonylméthyluridine (mcm5U), 5- carbamoylméthyluridine (ncm5U), 2'-0-méthyluridine (Um), et/ou
3-(3-amino-3-carboxypropyl)uridine (acp3U), 2’-0-ribosyladénosine (phosphat)
(Ar(p)), 5-carboxyméthylaminométhyl-2-thiouridine (cmnm5s2U), 5- carboxyméthylaminométhyluridine (cmnm5U), 5-carboxyméthylaminométhyl-2'- O-méthyluridine (cmnm5Um), dihydrouridine (D), 5-formylcytidin (f5C), galactosyl-queuosine (galQ), 2’-0-méthyl-5-hydroxyméthylcytidine (hm5Cm), 5- hydroxyuridine (ho5U), 5-hydroxyadénosine (ho8A), 8-hydroxyguanosine (ho8G), N6-isopentenyladénosine (i6A), N6-(cis-hydroxyisopentenyl)adénosine (io6A), 1- méthylinosine (mil), 1-méthylpseudouridine (mlpsi), N2,N2-diméthylguanosine (m22G), 2-méthyladénosine (m2A), N2-méthylguanosine (m2G), 5-méthyluridine (m5U), 5, 2'-0-diméthyluridine (m5Um), N6-méthyl-N6- threonylcarbamoyladénosine (m6t6A), mannosyl-queuosine (manQ), 5- (carboxyhydroxyméthyl)uridineméthyl ester (mchm5U), 5-méthylaminométhyl-2- thiouridine (mnm5s2U), 2-méthylthio-N6-isopentenyladénosine (ms2i6A), 2- méthylthio-N6-threonylcarbamoyladénosine (ms2t6A), peroxywybutosine (o2yW), 2'-0-méthylpseudouridine (psi m), 2-thiouridine (s2U), N6- threonylcarbamoyladénosine (t6A), wybutosine (yW).
Selon un mode de réalisation d'un procédé objet de l'invention, lesdits au moins 3 nucléosides sont choisis dans les groupes constitués par : les nucléosides non modifiés : adénosine (A), cytidine (C), guanosine (G), uridine (U), et
2'-0-méthyladénosine (Am), 1-méthyladénosine (mlA), N6,N6-diméthyladénosine (m66A), N6,N6,2'-0-triméthyladénosine (m66Am), N6-méthyladénosine (m6A), N6,2'-0-diméthyladénosine (m6Am), N4-acetylcytidine (ac4C), 2'-0- méthylcytidine (Cm), 5-hydroxyméthylcytidine (hm5C), 3-méthylcytidine (m3C), 5- méthylcytidine (m5C), 2'-0-méthylguanosine (Gm), 1-méthylguanosine (mlG), N2,N2,7-triméthylguanosine (m227G), N2,7-diméthylguanosine (m27G), 7- méthylguanosine (m7G), 8-hydroxyguanosine (oxo8G), inosine (I), pseudouridine (Psi), queuosine (Q), 3,2'-0-diméthyluridine (m3Um), 5-méthoxycarbonylméthyl- 2-thiouridine (mcm5s2U), 5- méthoxycarbonylméthyluridine (mcm5U), 5- carbamoylméthyluridine (ncm5U), 2'-0-méthyluridine (Um).
Selon un mode de réalisation plus particulier, un procédé objet de l'invention comprend l'isolement et la détermination quantitative d'au moins 3, 4, 5, 6, 7, 8, 9, 10, 11, 12, 13, 14, 15, 16, 17, 18, 19, 20, 21, 22, 23, 24, 25, 26, 27, 28 ou 29 nucléosides différents issus de la fragmentation de l'ARN total dudit échantillon biologique.
Selon un autre mode de réalisation plus particulier, un procédé objet de l'invention comprend l'isolement et la détermination quantitative d'au moins 3, 4, 5, 6, 7, 8, 9, 10, 11, 12, 13, 14, 15, 16, 17, 18, 19, 20, 21, 22, 23, 24, 25, 26, 27, 28 ou 29 nucléosides différents issus de la fragmentation de l'ARN extracellulaire dudit échantillon biologique.
Selon un autre mode de réalisation plus particulier, un procédé objet de l'invention comprend l'isolement et la détermination quantitative d'au moins 3, 4, 5, 6, 7, 8, 9, 10, 11, 12, 13, 14, 15, 16, 17, 18, 19, 20, 21, 22, 23, 24, 25, 26, 27, 28 ou 29 nucléosides différents issus de l'extraction de nucléosides dudit échantillon biologique.
Selon un mode de réalisation plus particulier, un procédé objet de l'invention comprend l'isolement et la détermination quantitative d'au moins 3 nucléosides différents issus de la fragmentation de l'ARN total dudit échantillon biologique et/ou de la fragmentation de l'ARN extracellulaire et/ou de l'extraction des nucléosides isolés, lesdits nucléosides étant choisis parmi les suivants : adénosine (A), cytidine (C), guanosine (G), uridine (U), 2'-0- méthyladénosine (Am), 1-méthyladénosine (mlA), N6,N6-diméthyladénosine (m66A), N6,N6,2'-0-triméthyladénosine (m66Am), N6-méthyladénosine (m6A), N6,2'-0- diméthyladénosine (m6Am), N4-acetylcytidine (ac4C), 2'-0-méthylcytidine (Cm), 5- hydroxyméthylcytidine (hm5C), 3-méthylcytidine (m3C), 5-méthylcytidine (m5C), 2'-0- méthylguanosine (Gm), 1-méthylguanosine (mlG), N2,N2,7-triméthylguanosine (m227G), N2,7-diméthylguanosine (m27G), 7-méthylguanosine (m7G), 8- hydroxyguanosine (oxo8G), inosine (I), pseudouridine (Psi), queuosine (Q), 3,2'-0- diméthyluridine (m3Um), 5-méthoxycarbonylméthyl-2-thiouridine (mcm5s2U), 5- méthoxycarbonylméthyluridine (mcm5U), 5-carbamoylméthyluridine (ncm5U), 2'-0- méthyluridine (Um).
Dans un procédé selon l'invention, l'isolement et la détermination d'une quantité respective d'au moins 3 nucléosides sont mis en oeuvre par tout moyen d'analyse connu de l'homme du métier. Ces moyens comprennent notamment la chromatographie, en particulier la chromatographie liquide en phase inverse de haute performance (RP-HPLC) ou l'électrophorèse capillaire (CE).
Ces moyens comprennent également des moyens de spectrométrie, en particulier la spectrométrie de masse. Plus particulièrement, ces moyens comprennent la spectrométrie de masse en tandem couplée à la Chromatographie en phase liquide (LC-MS/MS), une technique analytique qui associe le pouvoir de séparation de la chromatographie en phase liquide à la capacité d’analyse de masse hautement sensible et sélective de la spectrométrie de masse à triple quadripôles. Le point fort de cette technique réside dans le pouvoir de séparation de la chromatographie en phase liquide pour une large gamme de composés, combiné à la capacité de la spectrométrie de masse à quantifier les composés avec un degré élevé de sensibilité et de sélectivité, en fonction des transitions uniques masse / charge (m / z) de chaque composé d’intérêt.
Selon un aspect particulier, dans un procédé selon l'invention, le mélange de nucléosides obtenu par fragmentation est analysé en utilisant une chromatographie liquide haute performance couplée à une spectrométrie de masse en tandem (LC-MS / MS) de type triple quadripôles dans le mode Multiple Reaction Monitoring (MRM). Le mode MRM est une technique hautement sensible et spécifique qui permet la quantification de molécules par spectrométrie de masse. Ce mode de scan est dépendant de la spectrométrie de masse en tandem et plus particulièrement de triple quadripôles ou de systèmes spectrométrie de masse à trappes hybrides. Le MRM scan mode est basée sur la sélection d'ions de masse et charge spécifiques d'une molécule, ions appelés ions précurseurs ou ions parents, ainsi que sur les ions fragments correspondants après fragmentation dans la cellule de collision. Le premier quadripôle va permettre la sélection précise des ions précurseurs spécifiques des molécules d'intérêts qui vont alors être fragmentés dans le second quadripôle. Les ions fragments résultants sont alors sélectionnés dans le troisième quadripôle. Les deux ions (masse/charge) correspondent alors à une transition hautement spécifique de la molécule d'intérêt. Selon un mode de réalisation plus particulier, l'invention a pour objet un procédé in vitro de caractérisation d'une tumeur d'un individu, à partir d'une biopsie de cet individu, comprenant les étapes de : a) préparation, à partir dudit échantillon biologique, d'un extrait de l'ARN cellulaire total et fragmentation de l'ARN polymérique en nucléosides, b) isolement et détermination d'une quantité respective d'au moins 3, de préférence au moins 5, de préférence au moins 10 de préférence au moins 20, nucléosides différents issus l'étape a), c) établissement, pour ledit échantillon biologique, d'un profil de nucléosides à partir des quantités respectives de chacun des nucléosides obtenues lors de l'étape b), ledit profil étant caractéristique de ladite tumeur.
Selon un mode de réalisation encore plus particulier, l'invention a pour objet un procédé in vitro de caractérisation d'une tumeur d'un individu, ladite tumeur étant une tumeur située dans l'un des organes suivants : rectum, colon, sein, pancréas, rein, poumon, ou une tumeur hématologique, notamment une leucémie.
Selon un mode de réalisation plus particulier, l'invention a pour objet un procédé in vitro de caractérisation d'une tumeur gliale d'un individu, à partir d'un échantillon biologique isolé de cet individu, comprenant les étapes de : a) préparation, à partir dudit échantillon biologique, d'un extrait de l'ARN cellulaire total et fragmentation dudit ARN en nucléosides, b) isolement et détermination d'une quantité respective d'au moins 3, de préférence au moins 5, de préférence au moins 10 de préférence au moins 20, nucléosides différents issus l'étape a), c) établissement, pour ledit échantillon biologique, d'un profil de nucléosides à partir des quantités respectives de chacun des nucléosides obtenues lors de l'étape b), ledit profil étant caractéristique de ladite tumeur, et d) prédiction d'un grade de ladite tumeur gliale par un premier modèle de classification préalablement entraîné, à partir du profil établi lors de l'étape c).
Les termes de « tumeur gliale » ou « gliome » regroupent diverses tumeurs du cerveau qui se développent à partir des cellules gliales normales du cerveau. Le grade d'une tumeur gliale représente le plus important déterminant pour la survie d'un individu portant une telle tumeur. Le tissu cérébral non tumoral est caractérisée par de nombreuses cellules ayant des caractéristiques normales et quelques caractéristiques mitotiques, sans prolifération endothéliale. Les tumeurs de grade II, aussi appelées « astroblastomes » comprennent un nombre plus important de cellules comprenant des noyaux polymorphiques en mitose. Les tumeurs de grade III, sont aussi appelées « astroblastomes anaplastiques ». Les tumeurs de grade IV correspondent au glioblastome multiforme.
On entend par « modèle de classification » un algorithme d'apprentissage automatique préalablement entraîné, en particulier lors d'un apprentissage supervisé, ainsi qu'un jeu de données d'apprentissage permettant l'entraînement de l'algorithme susmentionné, et un jeu de données d'évaluation.
Suivant des modes de réalisation, ledit premier modèle de classification peut comprendre : un algorithme d'apprentissage automatique, plus particulièrement un réseau neuronal à apprentissage supervisé, ou un algorithme de classification probabiliste multi-classes, préalablement entraîné avec un jeu de données d'apprentissage.
Les données d’apprentissage, d’une part, sont spécifiques de la question posée et, d’autre part, spécifiques du type de cancer ciblé. Ainsi, la phase d’entrainement de l’algorithme d’apprentissage utilise les données d'apprentissage afin de produire un modèle de classification, qui est lui-même spécifique de la question posée et spécifique du type de cancer ciblé. La phase d’apprentissage infère les paramètres du modèle en fonction de ces données et de la question. Par exemple, pour une question de détermination du grade le modèle de classification renvoie une réponse parmi quatre réponses possibles si on distingue quatre grades. En revanche, pour la question de la détection de la présence d’une tumeur, le modèle de classification répond par "tumeur" ou "sain", soit un choix parmi deux réponses possibles.
Le modèle de classification produit par la phase d’apprentissage est un programme mis en oeuvre sur un ordinateur afin d’obtenir une prédiction sur la question considérée à partir de la donnée d’un profil épitranscriptomique issu d’un échantillon. Ce programme est téléchargeable et installable, permettant ainsi une installation sur un autre système que celui sur lequel il a été produit.
Le jeu de données d'apprentissage peut comprendre une multitude de couples de données, chacun des couples de données comprenant une première donnée représentant un profil de nucléosides et une deuxième donnée représentant le grade de tumeur pour ce profil.
Le jeu données d'apprentissage peut comprendre un jeu d'entraînement et un jeu de test, également désigné par « (jeu d'évaluation )[CFi]», du modèle. Le modèle peut ainsi être testé sur le jeu d'entraînement et le jeu de test peut être utilisé pour déterminer si l'apprentissage du modèle est satisfaisant ou non.
Le jeu d'entraînement et le jeu de test peuvent être différents. Alternativement, le jeu de test peut correspondre à une partie du jeu d'entraînement.
Le jeu de données d'apprentissage peut être préalablement constitué à partir de données obtenues en laboratoire par analyse d'échantillons obtenus à partir d'individus atteints de cancer et dont le grade de la tumeur a préalablement été déterminé.
On estime que le modèle de classification a atteint un niveau d'apprentissage satisfaisant sur l'ensemble des profils du jeu de test si la classification atteint par exemple 85 % de précision ; autrement dit on estime que le modèle de classification a atteint un niveau d'apprentissage satisfaisant sur l'ensemble des profils du jeu de test si la classification atteint par exemple au plus 15 % d'erreur.
Le modèle de classification peut consister en un programme d'ordinateur. Selon un mode de réalisation préféré de l'invention, un modèle de classification mis en oeuvre dans un procédé selon l'invention consiste en un programme d'ordinateur qui exécute en puissance une fonction technique consistant en des étapes du procédé de classification. L'exécution dudit programme par un ordinateur produit un objet numérique, qui est un objet technique.
Ledit programme d'ordinateur peut être écrit en tout langage informatique tel que par exemple en C, C+ + , JAVA, Python, etc.
Suivant des exemples de réalisation, le modèle de classification peut comprendre une machine à vecteur support, une forêt aléatoire, une analyse discriminante linéaire ; ces méthodes se nomment en anglais respectivement :"Support Vector Machines", "Random Forests" et "Linear Discriminant Analysis" (LDA).
Plus particulièrement, ledit algorithme d’apprentissage est notamment choisi parmi:
- une Machine à Vecteurs Supports munie soit d’un noyau linéaire, soit d’un noyau RBF (Radial Basis Function) avec une valeur faible de paramètre de coût,
- un algorithme de LDA utilisant les solutions de moindres carrés avec détermination automatique du paramètre de réduction de dimension selon la procédure de Ledoit-Wolf.
Ces trois familles d’algorithmes d’apprentissage automatique sont décrites conceptuellement dans la littérature (Cornuejols et Miclet, « Apprentissage Artificiel : Concepts et Algorithmes » Eyrolles, 2012 ; Hastie et al. "The Eléments of Statistical Learning: Data Mining , Inference, and Prédiction", 2nd Edition. Springer Sériés in Statistics, Springer 2009, ISBN 9780387848570) et sont parfaitement adaptées à la classification multi-classes.
Suivant des modes de réalisation d'un procédé selon l'invention, la prédiction d'un grade d'une tumeur gliale peut comprendre : la prédiction d'une tumeur gliale de grade II, la prédiction d'une tumeur gliale de grade III ou la prédiction d'une tumeur gliale de grade IV.
L'invention a plus particulièrement pour objet un procédé in vitro de prédiction d'un grade d'une tumeur gliale d'un individu, à partir d'un échantillon biologique dudit individu, et notamment une biopsie de ladite tumeur gliale, dans laquelle la prédiction d'un grade de ladite tumeur gliale par un modèle de classification préalablement entraîné, comprend : la prédiction d'une tumeur gliale de grade II, la prédiction d'une tumeur gliale de grade III et la prédiction d'une tumeur gliale de grade IV. Plus particulièrement, un procédé selon l'invention de prédiction d'un grade d'une tumeur gliale d'un individu comprend la distinction entre une tumeur gliale de grade II et une tumeur gliale de grade III ou IV ; la distinction entre une tumeur gliale de grade III et une tumeur gliale de grade II ou IV ; la distinction entre une tumeur gliale de grade IV et une tumeur gliale de grade II ou III.
L'invention a encore plus particulièrement pour objet un procédé in vitro de caractérisation d'une tumeur gliale d'un individu, à partir d'une biopsie de ladite tumeur, comprenant : a) la préparation, à partir de ladite biopsie, d'un extrait de l'ARN cellulaire total et fragmentation dudit ARN en nucléosides, b) l'isolement et détermination quantitative d'au moins 3 nucléosides issus de ladite fragmentation, choisis parmi : adénosine (A), cytidine (C), guanosine (G), uridine (U), 2'-0-méthyladénosine (Am), 1-méthyladénosine (mlA), N6,N6- diméthyladénosine (m66A), N6,N6,2'-0-triméthyladénosine (m66Am), N6- méthyladénosine (m6A), N6,2'-0-diméthyladénosine (m6Am), N4-acetylcytidine (ac4C), 2'-0-méthylcytidine (Cm), 5-hydroxyméthylcytidine (hm5C), 3- méthylcytidine (m3C), 5-méthylcytidine (m5C), 2'-0-méthylguanosine (Gm), 1- méthylguanosine (mlG), N2,N2,7-triméthylguanosine (m227G), N2,7- diméthylguanosine (m27G), 7-méthylguanosine (m7G), 8-hydroxyguanosine (oxo8G), inosine (I), pseudouridine (Psi), queuosine (Q), 3,2'-0-diméthyluridine (m3Um), 5-méthoxycarbonylméthyl-2-thiouridine (mcm5s2U), 5- méthoxycarbonylméthyluridine (mcm5U), 5-carbamoylméthyluridine (ncm5U), 2'- O-méthyluridine (Um). c) l'établissement, pour ladite tumeur, d'un profil à partir des valeurs quantitatives respectives des nucléosides obtenues lors de l'étape b), ledit profil étant caractéristique de ladite tumeur, et d) la prédiction d'un grade de ladite tumeur gliale par un modèle de classification préalablement entraîné, à partir du profil établi lors de l'étape c), dans lequel la prédiction d'un grade d'une tumeur gliale est choisie parmi : la prédiction d'une tumeur gliale de grade II, la prédiction d'une tumeur gliale de grade III et la prédiction d'une tumeur gliale de grade IV.
Selon un autre aspect, l'invention a pour objet un procédé in vitro de caractérisation d'une tumeur gliale d'un individu, ledit procédé comprenant les étapes de : a) préparation, à partir dudit échantillon biologique, d'un extrait de l'ARN cellulaire total et fragmentation dudit ARN en nucléosides, b) isolement et détermination d'une quantité respective d'au moins 3, de préférence au moins 5, de préférence au moins 10, de préférence au moins 20, nucléosides différents issus de l'étape a), c) établissement, pour ledit échantillon biologique, d'un profil de nucléosides à partir des quantités respectives de chacun des nucléosides obtenues lors de l'étape b), ledit profil étant caractéristique de ladite tumeur, et d) prédiction d'un état de survie dudit individu, par un deuxième modèle de classification préalablement entraîné, à partir du profil établi lors de l'étape c).
Suivant des modes de réalisation, ledit deuxième modèle de classification peut comprendre : un algorithme d'apprentissage automatique, plus particulièrement un réseau neuronal à apprentissage supervisé, ou un algorithme de classification probabiliste, préalablement entraîné avec un deuxième jeu de données d'apprentissage.
Ledit deuxième jeu de données d'apprentissage peut comprendre une multitude de couples de données, chacun des couples de données comprenant une première donnée représentant un profil de nucléosides et une deuxième donnée représentant l'état de survie pour ce profil.
Ce jeu de données d'apprentissage peut comprendre un jeu d'entraînement et un jeu d'évaluation du modèle. Le modèle peut ainsi être testé sur le jeu d'entraînement et le jeu d'évaluation peut être utilisé pour déterminer si l'apprentissage du modèle est satisfaisant ou non. Le jeu d'entraînement et le jeu d'évaluation peuvent être différents. Alternativement, le jeu d'évaluation peut correspondre à une partie du jeu d'entraînement. Le jeu de données d'apprentissage peut être préalablement constitué à partir de données obtenues en laboratoire par analyse d'échantillons obtenus à partir d'individus atteints de cancer et dont le statut de survie a préalablement été déterminé.
On estime que le modèle de classification a atteint un niveau d'apprentissage satisfaisant sur l'ensemble des profils du jeu d'évaluation si la classification atteint 85 % de précision ; autrement dit on estime que le modèle de classification a atteint un niveau d'apprentissage satisfaisant sur l'ensemble des profils du jeu d'évaluation si la classification atteint au plus 15 % d'erreur.
Tout comme le premier modèle de classification, le deuxième modèle de classification peut consister en un programme d'ordinateur. Le programme d'ordinateur peut être écrit en tout langage informatique tel que par exemple en C, C++, JAVA, Python, etc.
Suivant des exemples de réalisation, le deuxième modèle de classification peut comprendre une machine à vecteur support, une forêt aléatoire, une analyse discriminante linéaire ; ces méthodes se nomment en anglais respectivement : "Support Vector Machines", "Random Forests" et "Linear Discriminant Analysis".
Selon un autre aspect, l'invention a pour objet un modèle de classification, préalablement entraîné sur un jeu de données d'apprentissage, pour prédire un grade d'une tumeur gliale d'un individu atteint d'une tumeur, à partir d'un profil de nucléosides obtenu par la mise en oeuvre d'un procédé selon l'invention.
Ledit modèle de classification pour prédire le grade d'une tumeur gliale comprend un algorithme d'apprentissage automatique préalablement entraîné et évalué, en particulier lors d'un apprentissage supervisé, avec un jeu de données d'apprentissage relatives à la prédiction d'un grade d'une tumeur gliale, ledit jeu d'apprentissage comprenant un jeu d'entraînement et un jeu d'évaluation, tous deux relatifs à la prédiction d'un grade d'une tumeur gliale.
L'invention a également pour objet un procédé de construction d'un modèle de classification pour prédire le grade d'une tumeur gliale, comprenant au moins :
- la sélection d'un algorithme d'apprentissage automatique pour une tâche de classification, - la fourniture d'un jeu de données d'apprentissage relatives à la prédiction d'un grade d'une tumeur gliale, comprenant un jeu d'entraînement et un jeu de test,
- une étape d'apprentissage de la prédiction d'un grade d'une tumeur gliale par ledit algorithme, à l’aide dudit jeu de données d'apprentissage.
Selon un autre aspect particulier, l'invention a pour objet un deuxième modèle de classification, préalablement entraîné sur un jeu de données d'apprentissage, pour prédire un statut de survie d'un individu atteint d'une tumeur, à partir d'un profil de nucléosides obtenu par la mise en oeuvre d'un procédé selon l'invention.
Ledit modèle de classification pour prédire un statut de survie d'un individu atteint d'une tumeur comprend un algorithme d'apprentissage automatique préalablement entraîné et évalué, en particulier lors d'un apprentissage supervisé, avec un jeu de données d'apprentissage relatives à la prédiction d'un statut de survie d'un individu, ledit jeu d'apprentissage comprend un jeu d'entraînement et un jeu de test, tous deux relatifs à la prédiction d'un statut de survie d'un individu atteint d'une tumeur.
L'invention a également pour objet un procédé de construction d'un modèle de classification pour prédire un statut de survie d'un individu, comprenant au moins :
- la sélection d'un algorithme d'apprentissage automatique pour une tâche de classification,
- la fourniture d'un jeu de données d'apprentissage relatives à la prédiction d'un statut de survie d'un individu, comprenant un jeu d'entraînement et un jeu de test,
- une étape d'apprentissage de la prédiction d'un statut de survie d'un individu, par ledit algorithme, à l’aide dudit jeu de données d'apprentissage.
Selon un autre aspect, la présente invention a pour objet l'utilisation d'un modèle de classification selon l'invention pour la prédiction d'un grade d'une tumeur gliale.
Selon un aspect, la présente invention a pour objet l'utilisation d'un modèle de classification selon l'invention pour la stratification d'un patient atteint d'une tumeur gliale, en combinaison avec au moins un autre marqueur biologique caractéristique dudit patient.
Selon un autre aspect, la présente invention a pour objet l'utilisation d'un modèle de classification selon l'invention pour la prédiction d'un état de survie d'un individu. Selon un autre mode de réalisation particulier, l'invention a pour objet un procédé in vitro de détection de la présence d'une tumeur chez un individu, à partir d'un échantillon biologique isolé de cet individu, comprenant les étapes de : a) isolement des nucléosides dudit échantillon biologique, par l'extraction : i) de l'ARN cellulaire total et sa fragmentation en nucléosides, ii) de l'ARN extracellulaire et sa fragmentation en nucléosides, et/ou iii) des nucléosides issus des catabolites monomériques, et de préférence des nucléosides issus des catabolites monomériques, b) isolement et détermination d'une quantité respective d'au moins 3, de préférence au moins 5, de préférence au moins 10 de préférence au moins 20, nucléosides différents obtenus lors de l'étape a), et c) établissement, pour ledit échantillon biologique, d'un profil de nucléosides à partir des quantités respectives de chacun des nucléosides obtenues lors de l'étape b), ledit profil étant caractéristique de la présence de ladite tumeur.
Selon un mode de réalisation encore plus particulier, l'invention a pour objet un procédé in vitro de détection de la présence d'une tumeur chez un individu, à partir d'un échantillon sanguin isolé de cet individu, comprenant les étapes de : a) isolement des nucléosides dudit échantillon biologique, par l'extraction des nucléosides issus des catabolites monomériques, b) isolement et détermination d'une quantité respective d'au moins 3, de préférence au moins 5, de préférence au moins 10 de préférence au moins 20, nucléosides différents issus l'étape a), c) établissement, pour ledit échantillon biologique, d'un profil de nucléosides à partir des quantités respectives de chacun des nucléosides obtenues lors de l'étape b), ledit profil étant caractéristique de ladite tumeur, et d) prédiction de la présence de ladite tumeur par un modèle de classification préalablement entraîné, à partir du profil établi lors de l'étape c).
Selon un mode de réalisation encore plus particulier, l'invention a pour objet un procédé in vitro de détection de la présence d'une tumeur colorectale chez un individu, à partir d'un échantillon sanguin isolé de cet individu, comprenant les étapes de : a. isolement des nucléosides dudit échantillon biologique, par l'extraction des nucléosides issus des catabolites monomériques, b. isolement et détermination d'une quantité respective d'au moins 3, de préférence au moins 5, de préférence au moins 10 de préférence au moins 20, nucléosides différents issus l'étape a), c. établissement, pour ledit échantillon biologique, d'un profil de nucléosides à partir des quantités respectives de chacun des nucléosides obtenues lors de l'étape b), ledit profil étant caractéristique de ladite tumeur, et d. prédiction de la présence de ladite tumeur colorectale par un modèle de classification préalablement entraîné, à partir du profil établi lors de l'étape c).
L'invention a également pour objet l'utilisation d'un procédé selon l'invention pour la détection de la présence d'une tumeur, ladite tumeur étant une tumeur située dans l'un des organes suivants : rectum, colon, sein, pancréas, rein, poumon, ou une tumeur hématologique, notamment une leucémie.
L'invention a également pour objet l'utilisation d'un procédé selon l'invention pour la détection de la présence d'une tumeur du tube digestif, notamment une tumeur colorectale.
Selon un autre aspect, l'invention a pour objet un modèle de classification, préalablement entraîné sur un jeu de données d'apprentissage, pour détecter la présence d'une tumeur chez un individu, à partir d'un profil de nucléosides obtenu par la mise en oeuvre d'un procédé selon l'invention. Ce modèle de classification comprend un algorithme d'apprentissage automatique préalablement entraîné et évalué, en particulier lors d'un apprentissage supervisé, avec un jeu de données d'apprentissage relatives à la détection de la présence d'une tumeur chez un individu, ledit jeu d'apprentissage comprend un jeu d'entraînement et un jeu de test, tous deux relatifs à la détection de la présence d'une tumeur chez un individu.
Plus particulièrement, l'invention a pour objet un modèle de classification, préalablement entraîné sur un jeu de données d'apprentissage, pour détecter la présence d'une tumeur colorectale chez un individu, à partir d'un profil de nucléosides obtenu par la mise en oeuvre d'un procédé selon l'invention. Ledit modèle de classification comprend un algorithme d'apprentissage automatique préalablement entraîné et évalué, en particulier lors d'un apprentissage supervisé, avec un jeu de données d'apprentissage relatives à la détection de la présence d'une tumeur colorectale chez un individu.
L'invention a également pour objet un procédé de construction dudit modèle de classification pour la détection de la présence d'une tumeur, comprenant au moins :
- la sélection d'un algorithme d'apprentissage automatique pour une tâche de classification, - la fourniture d'un jeu de données d'apprentissage relatives à la détection de la présence d'une tumeur chez un individu, comprenant un jeu d'entraînement et un jeu de test,
- une étape d'apprentissage de la prédiction de la présence d'une tumeur chez un individu, par ledit algorithme, à l’aide dudit jeu de données d'apprentissage.
Selon un mode de réalisation particulier, l'invention a également pour objet un procédé de construction d'un modèle de classification pour la détection de la présence d'une tumeur colorectale, comprenant au moins : la sélection d'un algorithme d'apprentissage automatique pour une tâche de classification, la fourniture d'un jeu de données d'apprentissage relatives à la détection de la présence d'une tumeur colorectale chez un individu, comprenant un jeu d'entraînement et un jeu de test, et une étape d'apprentissage de la prédiction de la présence d'une tumeur colorectale chez un individu, par ledit algorithme, à l’aide dudit jeu de données d'apprentissage.
Selon un autre aspect, la présente invention a pour objet l'utilisation d'un modèle de classification selon l'invention pour la détection d'une tumeur, notamment une tumeur colorectale.
Selon un aspect, la présente invention a pour objet l'utilisation d'un modèle de classification selon l'invention pour la détection d'une tumeur, notamment une tumeur colorectale, en combinaison avec au moins un autre marqueur biologique caractéristique dudit patient.
Selon un autre aspect particulier, la présente invention a enfin pour objet une méthode de diagnostic comprenant la mise en oeuvre d'un procédé selon l'invention de caractérisation d'une tumeur. La présente invention a aussi pour objet une méthode de diagnostic comprenant la mise en oeuvre d'un procédé selon l'invention de prédiction d'un grade d'une tumeur gliale. La présente invention a aussi pour objet une méthode de diagnostic comprenant la mise en oeuvre d'un procédé selon l'invention de prédiction l'état de survie d'un patient. Ladite méthode de diagnostic peut en outre comprendre une analyse histologique des tissus.
Selon un autre aspect particulier, la présente invention a enfin pour objet une méthode de diagnostic comprenant la mise en oeuvre d'un procédé selon l'invention de détection d'une tumeur. La présente invention a aussi pour objet une méthode de diagnostic comprenant la mise en oeuvre d'un procédé selon l'invention de détection d'une tumeur colorectale. Ladite méthode de diagnostic peut comprendre une analyse histologique des tissus. Description des figures et modes de réalisation
D'autres avantages et caractéristiques apparaîtront à l'examen de la description détaillée d'un mode de réalisation nullement limitatif, et des dessins annexés, dans lesquels :
La figure 1 représente le schéma global de l'expérimentation, où LC-MS/MS désigne la chromatographie liquide associée à la spectrométrie de masse et les données brutes (data) sont les profils épitranscriptomiques obtenus par LC-MS/MS.
La figure 2 représente le schéma global du process bioinformatique, les données brutes sont les profils épitranscriptomiques obtenus par LC-MS/MS, les données normalisées sont les profils épitranscriptomiques après normalisation, MS désigne la spectrométrie de masse (combinée à la chromatographie liquide).
Les figures 3A, 3B et 3C représentent, sous forme de boîte à moustache, six graphiques représentant respectivement la quantité relative (en pourcentage) de six nucléosides modifiés selon le grade de tumeur gliale. Pour chacun des graphes, ledit grade est désigné en abscisses par : « Normal », « Grade-II », « Grade-III » ou « Grade IV » indiquant respectivement un échantillon de tissu glial non tumoral ou un échantillon de tumeur gliale de grade II, III ou IV. La figure 3A montre deux exemples de nucléosides dont la quantité diminue avec l'augmentation du grade de la tumeur gliale : (de gauche à droite) oxo8G et mlG. La figure 3B représente deux exemples de nucléosides dont la quantité augmente avec l'augmentation du grade de la tumeur gliale : (de gauche à droite) m6Am et Gm. La figure 3C représente deux exemples de nucléosides dont la quantité varie faiblement avec l'augmentation du grade de la tumeur gliale : (de gauche à droite) mlA et m7G. Les échelles sont différentes selon les graphiques.
La figure 4 représente le pourcentage de variance expliquée des premières composantes de l'Analyse en Composantes Principales (ACP) des profils épitranscriptomiques de la cohorte. En abscisse, les composantes sont numérotées à partir de 0 jusqu'à 9. En ordonnée, les pourcentages de variance expliquée par ces composantes.
La figure 5 représente la visualisation en trois dimensions des profils de la cohorte selon lesdites trois premières composantes de l'Analyse en Composantes Principales (ACP), c'est- à-dire les trois composantes qui détiennent 39,2 + 23,3 + 8,6 = 71,1% de la variance des profils épitranscriptomiques de la cohorte. Chacun des axes représente, respectivement, la composante principale 0 (39,24 %), la composante principale 1 (23,27 %) et la composante principale 2 (8,58%). Les symboles « étoile » représentent le garde « normal », « triangle » le grade II, « carré » le grade III et « croix » le grade IV, respectivement.
II est bien entendu que les modes de réalisation qui seront décrits par la suite ne sont nullement limitatifs. On pourra notamment imaginer des variantes de l'invention ne comprenant qu'une sélection de caractéristiques décrites par la suite isolées des autres caractéristiques décrites, si cette sélection de caractéristiques est suffisante pour conférer un avantage technique ou pour différencier l'invention par rapport à de l'état de la technique antérieur. La présente invention se comprendra mieux à la lecture de l'exemple suivant, qui est donné pour illustrer l'invention et non pour en limiter la portée.
EXEMPLE 1 : Analyse des données transcriptomiques d'échantillons de cellules gliales
Cette section présente la cohorte utilisée, la préparation des échantillons, la méthode d'obtention des profils épitranscriptomiques et le programme d'analyse informatique. Cette section présente ensuite les résultats d'analyse exploratoire des profils de la cohorte, de prédiction des grades des tumeurs et de prédiction de survie.
La préparation des échantillons et l'obtention des profils par spectrométrie de masse sont réalisés comme suit : Cinquante-huit échantillons issus de tumeurs réséquées chirurgicalement chez des patients adultes diagnostiqués avec un gliome, aucun des patients n'ayant reçu de traitement chimique ou de radiothérapie avant la chirurgie, ont été utilisés conformément aux lois françaises de bioéthique concernant l’information et le consentement des patients. Au moment de la résection, pour chaque tumeur, une aliquote a été immédiatement congelée et conservée à -80°C et le tissu restant a été fixé dans du formol à 4%, incorporé dans de la paraffine et des sections de 3 microns ont été coupées et colorées avec de l’hématoxyline éosine. Le type histopathologique de la tumeur a été déterminé, selon la classification révisée de l’Organisation mondiale de la santé (Wesseling & Capper, « WHO 2016 Classification ofgliomas ». Neuropathol Appl Neurobiol. 44, 139- 150, 2018). Le groupe des tumeurs est constitué de gliomes de grade II (n = 20), de grade
III (n = 20) et de glioblastomes de grade IV (n = 18). En outre, 19 échantillons « contrôle » de cellules gliales non tumorales (n = 19) ont été préparés selon le même protocole (décrit ci-après) que les échantillons tumoraux.
L’ARN total a été extrait d’échantillons de tumeurs en utilisant la méthode acide-phénol guanidium. La qualité des échantillons d’ARN a été déterminée par électrophorèse sur gels d’agarose et coloration au bromure d’éthidium, et les bandes d’ARN 18S et 28S ont été visualisées sous lumière UV. Le traitement de l'échantillon biologique débute par l'extraction de l'ARN par séparation de phase afin d'obtenir un échantillon d'ARN d'au moins 100 ng. Le traitement de poursuit par l'hydrolyse enzymatique de l'ARN polymérique et la déphosphorylation des nucléosides.
La digestion enzymatique de l'ARN est réalisée comme suit : une quantité de 400 ng d’ARN est diluée dans un volume total de 20 pL d’eau milliQ, auquel on ajoute 3 pi d’acétate d’ammonium (0,1 M pH 5,3) et 0,001 unité enzymatique (U) de Nuclease PI (Sigma, N8630). Une incubation à 42°C est réalisée pendant 2 heures. Puis, 3 pi d’acétate d’ammonium 1 M et 0,001 U de phosphatase alcaline (Sigma, P4252) sont ajoutés. Le mélange est ensuite incubé à 37°C pendant 2 heures. Enfin, la solution de nucléosides est diluée deux fois et filtrée avec des filtres de 0,22 pm (Millex®-GV, Millipore, SLGVR04NL). Finalement, 5 pL de chaque échantillon est injecté et tous les échantillons sont analysés en triplicats par LC-MSMS.
La chromatographie liquide (LC) est réalisée comme suit : les nucléosides sont séparés par des systèmes Nexera LC-40 (Shimadzu) en utilisant une colonne Synergi™ Fusion-RP C18 (taille de particule 4 pm, 250 mm x 2 mm, 80 Â) (Phenomenex, 00G-4424-B0). La phase mobile est constituée d’acétate d’ammonium 5 mM ajusté à pH 5,3 avec de l’acide acétique (solvant A) et de l’acétonitrile pur (solvant B). Le gradient d’élution de 30 minutes commence avec 100 % de phase A suivi d’un gradient linéaire jusqu'à 8 % de solvant B à 13 minutes. Le solvant B est encore augmenté à 40 % en 10 minutes. Après 2 minutes, le solvant B est ramené à 0 % à 25,5 minutes. Les conditions initiales sont régénérées par rinçage avec 100 % de solvant A pendant 4,5 minutes supplémentaires. Le débit est de 0,4 ml/min et la température de la colonne de 35 °C.
La spectrométrie de masse en mode « Multiple Reaction Monitoring » (MRM) est réalisée comme suit : la détection est réalisée par Shimadzu TripleQuad 8060 en mode ions positifs. La spectrométrie de masse fonctionne en mode MRM dynamique avec une fenêtre de temps de rétention de 3 min et un temps de cycle maximum fixé à 258 ms. Les aires des pics sont déterminées à l'aide du logiciel Skyline 4.1 (Pino LK et al, « The Skyline ecosystem: Informatics for quantitative mass spectrometry proteomics. » Mass Spectrom Rev. 2020 May;39(3): 229-244. 2020).
Le spectromètre de masse a été calibré pour identifier et quantifier avec précision 25 nucléosides modifiés (Tableau 2) et 4 nucléosides non modifiés (A, U, G, T) (Tableau 1). L'appareil de spectrométrie de masse utilisé est un Shimadzu TripleQuad 8060 en mode suivi de réaction multiple (« Multiple Reaction Monitoring »). Chaque échantillon a été injecté trois fois, fournissant ainsi trois répliques techniques. Pour chaque nucléoside, l'homogénéité du temps de rétention donné par le spectromètre de masse est vérifiée. Les mesures montrant une divergence de plus de 6% ont été écartées. Il en résulte un tableau de données contenant les mesures de quantité de chaque nucléoside, dans chaque réplicat, pour tous les échantillons. Ce tableau est ensuite analysé grâce à nos programmes informatiques.
Toutes les analyses bio-informatiques sont effectuées avec des programmes python développés en interne. Pour cela les auteurs ont utilisé des modules (open source) bien connus : « Pandas » pour la gestion des données tabulaires (Reback et al, Pandas- dev/pandas : Pandas 1.0.3 (Version vl.0.3). Zenodo March 18, 2020), « scikit-learn » pour les analyses statistiques exploratoires des données et pour l'apprentissage automatique (Pedregosa et al, Journal of Machine Learning Research, vol. 12, pp. 2825- 2830, 2011), « Matplotlib » pour la visualisation (JD Hunter, Computing in Science & Engineering, vol. 9, no. 3, pp. 90-95, 2007).
Les caractéristiques nécessaires des programmes sont les suivantes : a) ils prennent en entrée des données de spectrométrie de masse dans un fichier au format tabulaire (format CSV) ; b) les quantifications d'aire et de temps de rétention issues du spectromètre doivent être données sous forme de valeurs réelles avec une précision d'au moins 10-1 ; c) ils implantent un algorithme d'apprentissage automatique supervisé multi-classe parmi ceux susmentionnés ; d) ils implantent la phase d'apprentissage, la phase d'évaluation, et le mode de prédiction ; e) ils utilisent le modèle de classification en mode prédiction pour classifier le profil épitranscriptome d'un échantillon de patient afin de prédire le grade de la tumeur.
Pour le prétraitement informatique et la normalisation, le tableau de quantités brutes est chargé en mémoire et son format est vérifié. Ensuite, la quantité moyenne de chaque nucléoside est calculée, et le tableau est reformaté pour obtenir toutes les mesures sur une ligne pour chaque échantillon biologique. La spectroscopie de masse ne produit pas des décomptes absolus de molécules mais des mesures relatives. Les inventeurs proposent une formule nouvelle de normalisation, dans laquelle sont sommées les quantités des nucléosides non modifiés A, C, G et U. Cette somme sert de référence. Ensuite toutes les mesures de référence sont divisées par cette somme. Ainsi, on obtient des mesures relatives, toutes comprises dans l'intervalle [0, 1]. A titre d'exemple, un extrait d'un tel tableau de données est proposé dans les tableaux 3, 4 et 5. Tableau 3
Tableau 4
Tableau 5
Les tableaux 3, 4 et 5 indiquent, pour chacun des nucléosides analysés, la valeur de donnée normalisée pour chacun des grades II, III et IV de gliome, et pour les tissus sains (« normal »).
L'analyse conjointe des profils épitranscriptomiques et de variables cliniques d'intérêt (Fig. 1) est réalisée, en particulier concernant le grade dans le cas des gliomes. Ce processus peut être adapté à tout type de variable clinique. Dans cet exemple, nous cherchons à distinguer les grades de cancer, qui peuvent être difficiles à établir au moyen d'un examen anatomopathologique.
Le prétraitement des profils de la cohorte a abouti à un tableau de 77 lignes, avec une ligne par échantillon, et 29 colonnes, avec une colonne par mesure. Pour chacun des échantillons, la mention des grades des tumeurs ou la mention « normal » pour les échantillons sains, a été ajoutée. Une analyse statistique exploratoire de ce tableau a été réalisée pour évaluer la pertinence du signal contenu dans les profils sur l'information de grade.
Premièrement, les variations des quantités de chaque nucléoside sont étudiées dans les échantillons d’un même grade, et comparons ces variations entre les grades. Comme présenté dans les graphiques en boites à moustaches des Figures 3A, 3B et 3C, les résultats expérimentaux suggèrent un regroupement des nucléosides en quatre groupes : i) ceux dont la quantité augmente avec le grade, c'est-à-dire entre le tissu cérébral non tumoral (désigné par simplification comme « normal » en ordonnées des graphiques) et les grades, II, III et IV, notamment les nucléosides oxo8G, mlG, queuosine et Ac4C (comme montré par exemple dans Fig. 3A) ; ii) ceux dont la quantité diminue avec le grade (comme montré par exemple dans Fig. 3B), iii) ceux qui varient faiblement avec les grades (comme montré par exemple dans Fig. 3C) et iv) les nucléosides restants, qui ne satisfont pas les conditions d'appartenance aux trois premiers groupes.
À première vue, aucun de ces groupes n'est lié à une caractéristique spécifique connue de ses constituants (par exemple, bord modifié du nucléoside). Néanmoins, il convient de noter que les 2’-0-méthylations (Am, Um, Cm, Gm), principalement trouvées dans l’ARN ribosomal (ARNr) et le petit ARN nucléaire (snRNA), se comportent de manière similaire dans un cluster central contenant m6Am, une modification spécifique de l’ARNr.
Ensuite, une Analyse en Composante Principale (ACP) de ces données a été réalisée, afin d’effectuer une réduction de dimension, à ne pas confondre avec une sélection des "caractéristiques", autrement dit des nucléosides, pour voir si les variations de quantité pouvaient être combinées en un petit nombre de composantes. Fig. 4 montre le pourcentage de variance expliquée pour les 10 premières composantes de l’ACP : clairement les trois premières composantes regroupent une large majorité des variations des profils. On constate en effet que les trois premières composantes regroupent à elles seules : 39,2 + 23,3 + 8,6 = 71,1% de la variance des profils épitranscriptomiques de la cohorte.
Chaque profil épitranscriptomique comprenant les mesures pour x nucléosides est vu mathématiquement parlant comme un point dans un espace à x dimensions. L’ACPest une méthode d’analyse multivariée exploratoire qui permet de réduire les dimensions des données tout en capturant leur variabilité. Les composantes sont de nouvelles variables qui combinent les données des observations initiales afin de capturer au mieux leur variabilité tout en réduisant le nombre de variables à analyser. Les composantes résultent de la projection des données initiales sur d’autres axes de l’espace multidimensionnel. Les composantes sont ordonnées par ordre décroissant de pourcentage de variance expliquée. Ce pourcentage associé à chaque composante indique son importance pour décrire les données initiales. La Fig. 4 présente le graphique du pourcentage de variance expliquée pour les 10 premières composantes. L’ACP est une technique classique de l’analyse de données.
La visualisation en 3 dimensions des profils projetés sur les trois premières composantes est montrée en Fig. 5. Premièrement, les échantillons de tissu non tumoral et de grade II se séparent clairement de ceux de grades III et IV. Par ailleurs, les échantillons de grade III occupent un volume relativement séparé de ceux de grade IV. Ces résultats exploratoires suggèrent que des algorithmes d'apprentissage automatique supervisé devraient pouvoir apprendre une frontière entre les groupes d'échantillons de différents grades.
Méthode d'apprentissage automatique permettant la prédiction avec précision du grade des tumeurs et des échantillons sains
Une méthode d'apprentissage automatique a été testée pour déterminer si le grade des échantillons pouvait être prédit à partir des seuls profils épitranscriptomiques, c'est-à-dire sans l'aide d'aucune autre information que les quantités de nucléosides (Fig. 1). Pour ce faire, les profils ont été partitionnés en deux sous-ensembles distincts : le premier a été utilisé uniquement pour entraîner le modèle d'apprentissage automatique (n=60, soit 78%), le second a servi à évaluer le modèle (n=17, soit 22%).
Comme la variable à prédire (ici le grade) est une donnée catégorielle, la méthode d'apprentissage doit appartenir à la catégorie de classification. Parmi les grands types d'algorithmes d'apprentissage, un algorithme de classification de Machine à Vecteurs Support (SVM pour Support Vector Machine, en anglais) a été choisi pour la possibilité qu'il offre d'adapter les formules des frontières en changeant de type de noyau, comme c'est la norme en apprentissage. La précision de prédiction de l'algorithme SVM équipé d'u noyau linéaire sur les profils du sous ensemble de testé est de 0,90, sur un maximum de 1, ce qui est remarquable. Le niveau de précision de prédiction se maintient lorsque l'on réitère l'apprentissage puis les tests avec de nouveaux partitionnements aléatoires du jeu de données, ce qui montre la robustesse de l'outil d'apprentissage développé.
En outre, les résultats de l'évaluation permettent de comparer notre méthode de normalisation (désignée par SUM, pour somme) avec les formules utilisées dans la littérature. En effet, la normalisation classique qui consiste à diviser la mesure d'un nucléoside modifié, par exemple mlA, par celle du nucléoside correspondant non modifié, ici la mesure de A. Dans le tableau 6, la précision selon l'utilisation de différentes formules est comprise entre 0,8 et 0,9, et est donc toujours inférieure ou égale (mais jamais supérieure) à la précision de la formule de normalisation SUM.
Tableau 6 En outre, la prédiction des grades est robuste au changement d'algorithme de classification. Au lieu d'un algorithme SVM, si un algorithme basé sur une approche d'Analyse Discriminante Linéaire est utilisé, une précision de 92 % est obtenue, avec un rappel (ou sensibilité) de 90% et un Fl-score de 90%. Le détail des prédictions pour chaque grade est donné dans le tableau 7.
Tableau 7
En conclusion, la qualité de prédiction des grades n'est pas particulièrement liée à l'optimisation d'une méthode d'apprentissage sur une cohorte donnée, puisque deux méthodes d'apprentissage très différentes obtiennent des résultats similaires. La qualité de la prédiction est donc liée à la puissance du signal contenu dans les profils transcriptomiques.
En outre, les modèles d'apprentissage dont les résultats sont rapportés ici n'ont volontairement pas été optimisés vis-à-vis de leurs paramètres, afin d'éviter un risque de sur-apprentissage qui entacherait la capacité de généralisation des modèles.
Prédiction du statut de survie des patients
La même démarche par apprentissage supervisé a été utilisée pour prédire la variable clinique indiquant le statut de survie, c'est-à-dire le statut « vivant » ou « décédé » à la fin du suivi de la cohorte, c'est-à-dire en 2020. Ici, la classification est binaire : « vivant » ou « décédé ». L'algorithme d'apprentissage SVM donne une prédiction correcte à 80%, ce qui est convaincant au regard de la taille de la cohorte considérée (Tableau 8). Tableau 8
Conclusion
Des différences de quantités relatives de certaines modifications épigénétiques des ARN ont été mises en évidence selon différents échantillons, qu'ils soient sains ou tumoraux. Ces différences permettent notamment de séparer les différents grades tumoraux. Un algorithme d'apprentissage automatique supervisé appliqué aux vecteurs de quantités de nucléosides permet de distinguer efficacement les grades des gliomes, et permet en particulier de distinguer les grades II et III, avec une précision remarquable compte tenu de la taille relativement restreinte de la cohorte. Par ailleurs, ce procédé permet également, à partir des mêmes données, d'estimer la survie des patients à l'aide d'une méthode d'apprentissage automatique supervisé.
EXEMPLE 2 : Analyse des données transcriptomiques d'échantillons de sérum sanguin de sujets
Quarante-sept échantillons sanguins de patients adultes diagnostiqués avec un cancer colorectal ou de sujets contrôle (Etablissement Français du Sang, n=20) aucun des patients n'ayant reçu de traitement chimique ou de radiothérapie avant la chirurgie, ont été utilisés conformément aux lois françaises de bioéthique concernant l’information et le consentement des patients. Un comité d'éthique local (CORT) a évalué et autorisé l'utilisation de ces échantillons.
L’ARN circulant est extrait à partir de plasma en utilisant un kit (miRNeasy Serum/Plasma). Les ARNs sont digérés avec de la nucléase PI et traités avec de la phosphatase alcaline afin d'obtenir un mélange de nucléosides. Les nucléosides libres circulants sont extraits des mêmes échantillons de plasma en utilisant une procédure d'extraction par le méthanol. Ils ne nécessitent pas de traitement enzymatique avant passage en spectrométrie de masse.
La chromatographie liquide (LC) et la spectrométrie de masse et les analyses bio informatiques sont réalisées comme indiqué dans l'exemple 1. En particulier, chaque échantillon est analysé trois fois indépendamment, permettant ainsi d'obtenir trois répliques techniques pour chacun. Les données brutes sont traitées afin d'être normalisées comme dans l'exemple 1. Ainsi, ces étapes produisent un profil épitranscriptomique par échantillon. Une méthode d'apprentissage automatique a été développée et testée pour déterminer la présence ou non d'une tumeur à partir des seuls profils épitranscriptomiques, c'est-à-dire sans l'aide d'aucune autre information que les quantités de nucléosides. Comme dans l'exemple 1, un algorithme de classification de Machine à Vecteurs Support (SVM pour Support Vector Machine, en anglais) muni d'un noyau linéaire a été choisi pour cette tâche dite de « classification » binaire. L'algorithme a d'abord été entraîné et ensuite testé afin d'évaluer sa capacité de prédiction de la présence ou non d'une tumeur dans l'échantillon. Avec les profils épitranscriptomiques contenant les mesures des nucléosides libres, la méthode d'apprentissage automatique donne une prédiction avec une précision de 100 % et une sensibilité de 100 %.

Claims

REVENDICATIONS
1. Procédé in vitro de caractérisation d'une tumeur d'un individu, à partir d'un échantillon biologique isolé de cet individu, comprenant les étapes de : a) isolement des nucléosides dudit échantillon biologique, par l'extraction : i) de l'ARN cellulaire total et sa fragmentation en nucléosides, ii) de l'ARN extracellulaire et sa fragmentation en nucléosides et/ou iii) des nucléosides issus des catabolites monomériques, b) isolement par chromatographie et détermination d'une quantité respective d'au moins 3, de préférence au moins 5, de préférence au moins 10 de préférence au moins 20, nucléosides différents issus de l'étape a), et c) établissement, pour ledit échantillon biologique, d'un profil de nucléosides à partir des quantités respectives de chacun des nucléosides, obtenues lors de l'étape b), ledit profil étant caractéristique de ladite tumeur.
2. Procédé selon la revendication précédente, dans lequel ledit échantillon biologique est une biopsie ou un échantillon biologique liquide, ledit échantillon biologique liquide étant choisi parmi le sang, le sérum, le plasma et l'urine.
3. Procédé selon l'une quelconque des revendications 1 ou 2, dans lequel lesdits nucléosides sont choisis parmi les suivants : les nucléosides non modifiés : adénosine (A), cytidine (C), guanosine (G), uridine (U), et les nucléosides modifiés : 2'-0-méthyladénosine (Am), 1-méthyladénosine (mlA), N6,N6-diméthyladénosine (m66A), N6,N6,2'-0-triméthyladénosine (m66Am), N6-méthyladénosine (m6A), N6,2'-0-diméthyladénosine (m6Am), N4- acetylcytidine (ac4C), 2'-0-méthylcytidine (Cm), 5-hydroxyméthylcytidine (hm5C), 3-méthylcytidine (m3C), 5-méthylcytidine (m5C), 2'-0-méthylguanosine (Gm), 1- méthylguanosine (mlG), N2,N2,7-triméthylguanosine (m227G), N2,7- diméthylguanosine (m27G), 7-méthylguanosine (m7G), 8-hydroxyguanosine (oxo8G), inosine (I), pseudouridine (Psi), queuosine (Q), 3,2'-0-diméthyluridine (m3Um), 5-méthoxycarbonylméthyl-2-thiouridine (mcm5s2U), 5- méthoxycarbonylméthyluridine (mcm5U), 5-carbamoylméthyluridine (ncm5U), 2'- O-méthyluridine (Um).
4. Procédé selon l'une quelconque des revendications précédentes, caractérisé en ce que ladite tumeur est une tumeur gliale et en ce qu'il comprend une étape de prédiction d'un grade de ladite tumeur gliale par un premier modèle de classification préalablement entraîné, à partir du profil établi lors de l'étape c.
5. Procédé selon la revendication 4, caractérisé en ce que le premier modèle de classification comprend : un algorithme d'apprentissage automatique, un réseau neuronal à apprentissage supervisé, ou un algorithme de classification probabiliste multi-classes, préalablement entraîné avec un jeu de données d'apprentissage.
6. Procédé selon l'une quelconque des revendications 4 ou 5, dans lequel la prédiction d'un grade d'une tumeur gliale est choisie parmi : la prédiction d'une tumeur gliale de grade II, la prédiction d'une tumeur gliale de grade III et la prédiction d'une tumeur gliale de grade IV.
7. Procédé selon l'une quelconque des revendications précédentes, caractérisé en ce qu'il comprend une étape de prédiction d'un état de survie dudit individu, par un deuxième modèle de classification préalablement entraîné, à partir du profil établi lors de l'étape c).
8. Procédé selon la revendication 7, caractérisé en ce que le deuxième modèle de classification comprend : un algorithme d'apprentissage automatique, un réseau neuronal à apprentissage supervisé, ou un algorithme de classification probabiliste, préalablement entraîné avec un jeu de données d'apprentissage.
9. Procédé in vitro de détection de la présence d'une tumeur chez un individu, à partir d'un échantillon biologique isolé dudit individu, comprenant les étapes de : a) isolement des nucléosides dudit échantillon biologique, par l'extraction : i) de l'ARN cellulaire total et sa fragmentation en nucléosides, ii) de l'ARN extracellulaire et sa fragmentation en nucléosides et/ou iii) des nucléosides issus des catabolites monomériques, b) isolement par chromatographie et détermination d'une quantité respective d'au moins 3, de préférence au moins 5, de préférence au moins 10 de préférence au moins 20, nucléosides différents issus de l'étape a), et c) établissement, pour ledit échantillon biologique, d'un profil de nucléosides à partir des quantités respectives de chacun des nucléosides, obtenues lors de l'étape b), ledit profil étant caractéristique de la présence de ladite tumeur.
10. Modèle de classification, préalablement entraîné sur un jeu de données d'apprentissage, pour prédire, dans un procédé selon l'une quelconque des revendications 4 à 8
- un grade d'une tumeur, et/ou
- un état de survie d'un individu, à partir du profil établi lors de l'étape c).
11. Utilisation d'un modèle de classification selon la revendication 9, pour la prédiction d'un grade d'une tumeur et/ou pour la prédiction d'un état de survie d'un individu.
12. Utilisation d'un procédé selon l'une des revendications 1 à 3 pour la détection d'une tumeur.
13. Utilisation selon la revendication 12 pour la détection d'une tumeur colorectale.
EP22760870.0A 2021-07-29 2022-07-21 Procede de caracterisation d'une tumeur Pending EP4377699A1 (fr)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
FR2108279A FR3125882B1 (fr) 2021-07-29 2021-07-29 Procede de caracterisation d’une tumeur
PCT/EP2022/070551 WO2023006588A1 (fr) 2021-07-29 2022-07-21 Procede de caracterisation d'une tumeur

Publications (1)

Publication Number Publication Date
EP4377699A1 true EP4377699A1 (fr) 2024-06-05

Family

ID=80446963

Family Applications (1)

Application Number Title Priority Date Filing Date
EP22760870.0A Pending EP4377699A1 (fr) 2021-07-29 2022-07-21 Procede de caracterisation d'une tumeur

Country Status (10)

Country Link
US (1) US20240363254A1 (fr)
EP (1) EP4377699A1 (fr)
JP (1) JP2024529994A (fr)
KR (1) KR20240035609A (fr)
CN (1) CN118019981A (fr)
AU (1) AU2022320853A1 (fr)
CA (1) CA3226423A1 (fr)
FR (1) FR3125882B1 (fr)
MX (1) MX2024001349A (fr)
WO (1) WO2023006588A1 (fr)

Family Cites Families (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US7799519B2 (en) 2005-07-07 2010-09-21 Vanderbilt University Diagnosing and grading gliomas using a proteomics approach
PL214886B1 (pl) * 2008-10-03 2013-09-30 Akad Medyczna Sposób diagnozowania choroby nowotworowej układu moczowo-płciowego
PL409275A1 (pl) * 2014-08-26 2016-02-29 Gdański Uniwersytet Medyczny Sposób wykrywania nowotworów układu moczowo-płciowego, zastosowanie oraz zestaw do wykrywania choroby nowotworowej układu moczowo-płciowego

Also Published As

Publication number Publication date
KR20240035609A (ko) 2024-03-15
FR3125882B1 (fr) 2025-07-18
MX2024001349A (es) 2024-04-19
FR3125882A1 (fr) 2023-02-03
US20240363254A1 (en) 2024-10-31
CA3226423A1 (fr) 2023-02-02
JP2024529994A (ja) 2024-08-14
CN118019981A (zh) 2024-05-10
WO2023006588A1 (fr) 2023-02-02
AU2022320853A1 (en) 2024-02-08

Similar Documents

Publication Publication Date Title
He et al. Several miRNAs derived from serum extracellular vesicles are potential biomarkers for early diagnosis and progression of Parkinson’s disease
JP6659809B2 (ja) 口腔癌検出用唾液バイオマーカー
CN112005306A (zh) 选择、管理和分析高维数据的方法和系统
Herrero‐Lorenzo et al. Small RNAs in plasma extracellular vesicles define biomarkers of premanifest changes in Huntington's disease
AU2024250885A1 (en) Systems and methods for early-stage cancer detection and subtyping
Yan et al. Deep neural network based tissue deconvolution of circulating tumor cell RNA
CN113862351B (zh) 体液样本中鉴定胞外rna生物标志物的试剂盒及方法
EP4377699A1 (fr) Procede de caracterisation d'une tumeur
WO2024137664A1 (fr) Méthodes de détection de glioblastome dans des vésicules extracellulaires
JP2008532495A (ja) 神経精神障害に関するバイオマーカーの検出
WO2016027029A2 (fr) Procédé pour déterminer le pronostic de survie d'un patient atteint d'un cancer du pancréas
AU2024210217A1 (en) Methods and systems for detecting and assessing liver conditions
Mullins et al. Proof of concept: Detection of cell free RNA from EDTA plasma in patients with lung cancer and non-cancer patients
WO2023017543A1 (fr) Dosage de biomarqueurs à base de miarn salivaires pour le cancer buccal
Zhu et al. Identification of key genes and regulatory mechanisms in adult degenerative scoliosis
HK40108352A (zh) 用於表徵肿瘤的方法
Kim et al. Low-level brain somatic mutations in exonic regions are collectively implicated in autism with germline mutations in autism risk genes
Beaudin The nosology of hereditary cerebellar ataxias: development of a classification for recessive ataxias and phenotypical description of Spinocerebellar ataxia 34
Xiang et al. Transcriptomic Analysis of Circular RNA as Potential Biomarkers in Diagnosing Atopic Dermatitis
EP4590858A1 (fr) Procede de caracterisation de la degradation d'un organe
FR3150527A1 (fr) Procede pour determiner le pronostic de survie d’un patient atteint d’un cancer du pancreas
FR3158742A1 (fr) Biomarqueurs et outil pronostique pour les patients atteint de lymphomes b diffus a grandes cellules
Fu et al. Transcriptome Analysis Reveals Auto-Inflammatory Genes of Chronic Nonbacterial Osteomyelitis (CNO) Based on The Machine Learning
WO2026094720A1 (fr) Procédé de génération de modèle de détermination de propriété, modèle de détermination de propriété, procédé de détermination de propriété, dispositif de détermination de propriété, programme et support d'enregistrement
CN121506252A (zh) 一种无创预测乳腺癌分子分型的方法及其应用

Legal Events

Date Code Title Description
STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: UNKNOWN

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE INTERNATIONAL PUBLICATION HAS BEEN MADE

PUAI Public reference made under article 153(3) epc to a published international application that has entered the european phase

Free format text: ORIGINAL CODE: 0009012

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: REQUEST FOR EXAMINATION WAS MADE

17P Request for examination filed

Effective date: 20240222

AK Designated contracting states

Kind code of ref document: A1

Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC MK MT NL NO PL PT RO RS SE SI SK SM TR

DAV Request for validation of the european patent (deleted)
DAX Request for extension of the european patent (deleted)
RIN1 Information on inventor provided before grant (corrected)

Inventor name: BAUCHET, LUC

Inventor name: RELIER, SEBASTIEN

Inventor name: DAVID, ALEXANDRE

Inventor name: HIRTZ, CHRISTOPHE

Inventor name: RIVALS, ERIC