EP2318971A1 - Procede de prediction pour le depistage, le pronostic, le diagnostic ou la reponse therapeutique du cancer de la prostate et dispositif permettant la mise en oeuvre du procede - Google Patents

Procede de prediction pour le depistage, le pronostic, le diagnostic ou la reponse therapeutique du cancer de la prostate et dispositif permettant la mise en oeuvre du procede

Info

Publication number
EP2318971A1
EP2318971A1 EP09781338A EP09781338A EP2318971A1 EP 2318971 A1 EP2318971 A1 EP 2318971A1 EP 09781338 A EP09781338 A EP 09781338A EP 09781338 A EP09781338 A EP 09781338A EP 2318971 A1 EP2318971 A1 EP 2318971A1
Authority
EP
European Patent Office
Prior art keywords
snp
chromosome
neighbors
genotype
variable defining
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Withdrawn
Application number
EP09781338A
Other languages
German (de)
English (en)
Inventor
Karine Auribault
Jean-Denis Muller
Géraldine CANCEL-TASSIN
Olivier Cussenot
Stéphane GAZUT
Nicolas Gilardi
David Mercier
Jean-Philippe Poli
Emmanuel Ramasso
Frédéric SUARD
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Commissariat a lEnergie Atomique et aux Energies Alternatives CEA
Original Assignee
Commissariat a lEnergie Atomique CEA
Commissariat a lEnergie Atomique et aux Energies Alternatives CEA
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Commissariat a lEnergie Atomique CEA, Commissariat a lEnergie Atomique et aux Energies Alternatives CEA filed Critical Commissariat a lEnergie Atomique CEA
Publication of EP2318971A1 publication Critical patent/EP2318971A1/fr
Withdrawn legal-status Critical Current

Links

Classifications

    • CCHEMISTRY; METALLURGY
    • C12BIOCHEMISTRY; BEER; SPIRITS; WINE; VINEGAR; MICROBIOLOGY; ENZYMOLOGY; MUTATION OR GENETIC ENGINEERING
    • C12QMEASURING OR TESTING PROCESSES INVOLVING ENZYMES, NUCLEIC ACIDS OR MICROORGANISMS; COMPOSITIONS OR TEST PAPERS THEREFOR; PROCESSES OF PREPARING SUCH COMPOSITIONS; CONDITION-RESPONSIVE CONTROL IN MICROBIOLOGICAL OR ENZYMOLOGICAL PROCESSES
    • C12Q1/00Measuring or testing processes involving enzymes, nucleic acids or microorganisms; Compositions therefor; Processes of preparing such compositions
    • C12Q1/68Measuring or testing processes involving enzymes, nucleic acids or microorganisms; Compositions therefor; Processes of preparing such compositions involving nucleic acids
    • C12Q1/6876Nucleic acid products used in the analysis of nucleic acids, e.g. primers or probes
    • C12Q1/6883Nucleic acid products used in the analysis of nucleic acids, e.g. primers or probes for diseases caused by alterations of genetic material
    • C12Q1/6886Nucleic acid products used in the analysis of nucleic acids, e.g. primers or probes for diseases caused by alterations of genetic material for cancer
    • GPHYSICS
    • G16INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
    • G16BBIOINFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR GENETIC OR PROTEIN-RELATED DATA PROCESSING IN COMPUTATIONAL MOLECULAR BIOLOGY
    • G16B20/00ICT specially adapted for functional genomics or proteomics, e.g. genotype-phenotype associations
    • GPHYSICS
    • G16INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
    • G16BBIOINFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR GENETIC OR PROTEIN-RELATED DATA PROCESSING IN COMPUTATIONAL MOLECULAR BIOLOGY
    • G16B20/00ICT specially adapted for functional genomics or proteomics, e.g. genotype-phenotype associations
    • G16B20/20Allele or variant detection, e.g. single nucleotide polymorphism [SNP] detection
    • GPHYSICS
    • G16INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
    • G16BBIOINFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR GENETIC OR PROTEIN-RELATED DATA PROCESSING IN COMPUTATIONAL MOLECULAR BIOLOGY
    • G16B40/00ICT specially adapted for biostatistics; ICT specially adapted for bioinformatics-related machine learning or data mining, e.g. knowledge discovery or pattern finding
    • G16B40/20Supervised data analysis
    • CCHEMISTRY; METALLURGY
    • C12BIOCHEMISTRY; BEER; SPIRITS; WINE; VINEGAR; MICROBIOLOGY; ENZYMOLOGY; MUTATION OR GENETIC ENGINEERING
    • C12QMEASURING OR TESTING PROCESSES INVOLVING ENZYMES, NUCLEIC ACIDS OR MICROORGANISMS; COMPOSITIONS OR TEST PAPERS THEREFOR; PROCESSES OF PREPARING SUCH COMPOSITIONS; CONDITION-RESPONSIVE CONTROL IN MICROBIOLOGICAL OR ENZYMOLOGICAL PROCESSES
    • C12Q2600/00Oligonucleotides characterized by their use
    • C12Q2600/156Polymorphic or mutational markers
    • GPHYSICS
    • G16INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
    • G16BBIOINFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR GENETIC OR PROTEIN-RELATED DATA PROCESSING IN COMPUTATIONAL MOLECULAR BIOLOGY
    • G16B40/00ICT specially adapted for biostatistics; ICT specially adapted for bioinformatics-related machine learning or data mining, e.g. knowledge discovery or pattern finding

Definitions

  • the field of the invention is that of the individual prediction methods for screening, diagnosis, prognosis, the therapeutic response of diseases and the side effects of the drugs in the case of complex and multifactoal diseases such as cancers and in particular cancer. of the prostate.
  • the present invention provides a method and a tool for evaluating the individual susceptibility to the onset of cancer and more particularly of prostate cancer, for initiating screening or early diagnosis by combining a large number of clinical input data. and / or genetically associated in a complex manner.
  • the diagnosis and treatments proposed require the implementation of invasive and expensive procedures.
  • the current methods developed to determine at-risk populations or management strategies propose positive or negative predictive values (cancer / non-cancer) according to tests (tumor markers, molecular signatures, etc.) or results obtained from nomogram-type linear functions, but their reliability is less than 80% and the results are rarely reproducible at the individual level.
  • PSA prostate specific antigen
  • the specificity of the PSA test is of the order of 80%, which means that when the PSA threshold is less than 4 ng / ml, the absence of prostate cancer is real in 8 case in 10.
  • Nomogram-type risk assessment tools incorporating several parameters have been developed to answer individual questions and notably described in the journal [SF Shariat, PI Karakiewicz, CG Roehrborn and Kattan An updated catalog of prostate cancer predictive tools Cancer (113) p3075-992008].
  • Nomograms are statistical tools for decision-making that contain information from hundreds of concrete observations about proven cases of prostate cancer. These tools help patients and physicians to make decisions. They provide predictions calculated from a variety of clinical data from previously treated prostate cancers. These are calculation rules or charts based on multivariate logistic regressions. These nomograms have an average accuracy rate of 80% which remains insufficient. Patients, however, derive undeniable benefits from it because they lack the bias and subjectivity found in the various clinicians and caregivers. As an example 12 questions and associated predictive tools are offered by the Canadian Prostate Cancer Research Foundation. Existing solutions used in this type of predictive tools rely mostly on the collection of clinical and evaluation data using linear modeling methods against parameters. The methods developed are insufficient in terms of reliability and do not make it possible to make hierarchical predictions such as: risk of cancer, risk of rapidly evolving cancer, cancer risk resistant to a treatment, sufficiently reliable.
  • the search for relevant markers represents the first challenge of predictive medicine. It is a technological challenge in genomics but also in mathematics.
  • the etiology of the causes and evolution of prostate cancer is complex and results from multiple stochastic interactions between constitutional genetic factors, acquired tissue factors, and environmental factors.
  • the conviction of the importance of genetic factors in the etiology of prostate cancer arose from the observation of case aggregations in some families [Carter BS Mendelian inheritance of familial prostate cancer, PNAS (89) 3367-7 (1992)). )].
  • a second challenge for predictive medicine is to model the associations of variables [D. F. Easton Genome-wide association studies in cancer Hum Mol Genet (17) R109-15 (2008)], the complex analyzes of combinations of variables pertaining to a particular field of algorithmic research.
  • the present invention provides an individual prediction method for screening, or diagnosis or prognosis or response.
  • cancer therapy and more particularly adapted to prostate cancer, based on the collection of a large number of genetic data to which clinical data can be added and involving the development of an advanced model for delivering a risk value that can advantageously be subject to a validation procedure.
  • the subject of the present invention is an individual prediction method for screening or diagnosis or the therapeutic management or the prognosis of prostate cancer including the collection of individual data.
  • a prediction tool is produced by constructing at least one model by statistical learning, the input variables of this model being said representative information; the genetic input information comprising at least one variable or a combination of variables from the following (all the nucleotide locations cited correspond to those defined by "UCSC genome browser", March 2006 assembly):
  • variable defining the genotype linked to the SNP rs1499955 and / or to one or more of its neighbors in the chromosome 3 variable interval defining the genotype linked to the SNP rs4855539 and / or to one or more of his neighbors in the interval 69049525-69153397 of chromosome 3;
  • chromosome 1 a variable defining the genotype linked to the SNP rs6681102 and / or to one or more of its neighbors in the range 236815776-236998150 of chromosome 1;
  • the input data correspond to the combination of a variable defining the genotype linked to the SNP rs2174183 and / or to one or more of its neighbors in the chromosome 127602673-128447913 interval. 4 and / or a variable defining the genotype related to SNP rs7576160 and / or to one or more of its neighbors in the interval 37855761 -38126567 of chromosome 2 and / or a variable defining the genotype related to the SNP rs2012385 and / or to one or more of its neighbors in the range 241767109-2421 19399 of chromosome 2.
  • the input data correspond to the combination of a variable defining the genotype linked to the SNP rs2174183 and / or to one or more of its neighbors in the chromosome 127602673-128447913 interval. 4 and / or a variable defining the genotype related to SNP rs2190453 and / or to one or more of its neighbors in the interval 17464539-17757162 of chromosome 1 1 and / or of a variable defining the linked genotype SNP rs888298 and / or one or more of its neighbors in the range 6381561 1 -64165896 of chromosome 17.
  • the input data correspond to the combination of a variable defining the genotype linked to the SNP rs2174183 and / or to one or more of its neighbors in the chromosome 127602673-128447913 interval. 4 and / or a variable defining the genotype linked to the SNP rs2788140 and / or to one or more of its neighbors in the interval 210157195-210446272 of chromosome 1 and / or of a variable defining the genotype linked to the SNP rs7934514 and / or to one or more of its neighbors in the range 99092040-99333419 of chromosome 1 1.
  • the input data correspond to the combination of a variable defining the genotype linked to the SNP rs2174183 and / or to one or more of its neighbors in the chromosome 127602673-128447913 interval. 4 and / or a variable defining the genotype related to the SNP rs3828054 and / or to one or more of its neighbors in the range 149382371 -149874970 of the chromosome 1 and / or a variable defining the SNP-related genotype rs1499955 and / or one or more of its neighbors in the chromosome 3 1 16302446-1 1701 1700 range.
  • the input data correspond to the combination of a variable defining the genotype linked to the SNP rs2174183 and / or to one or more of its neighbors in the chromosome 127602673-128447913 interval. 4 and a variable defining the genotype related to SNP rs81 10935 and / or to one or more of its neighbors in the range 62026584-62294837 of chromosome 19.
  • the input data correspond to the combination of a variable defining the genotype linked to the SNP rs2174183 and / or to one or more of its neighbors in the chromosome 127602673-128447913 interval. 4 and a variable defining the genotype linked to the SNP rs4855539 and / or to one or more of its neighbors in the chromosome 3 interval 69049525-69153397 and / or a variable defining the genotype linked to the SNP rs4242382 and / or one or more of its neighbors in the range 128539973-128619555 of chromosome 8.
  • the input data correspond to the combination of a variable defining the genotype linked to the SNP rs6492998 or to one of its neighbors in the interval 38991207-39584443 of the chromosome 15 and a a variable defining the SNP-related genotype rs11526176 and / or one or more of its neighbors in the range 27414591 -27808301 of chromosome 7 and a variable defining the SNP-related genotype rs6681102 or one of its neighbors in the range 236815776-236998150 of chromosome 1.
  • the input data correspond to the combination of a variable defining the genotype linked to the SNP rs151 1695 and / or to one or more of its neighbors in the interval 218280585-218521047 of the chromosome 1 and a variable defining the SNP-related genotype rs4669835 and / or one or more of its neighbors in the chromosome 2 interval 121 1 1054-12324507 and a variable defining the SNP-related genotype rs12605415 or to one of its neighbors in the range 23907695-24187878 of chromosome 18
  • the input data correspond to the combination of the four cancer history variables, an age category variable, a variable defining the genotype linked to the SNP rs4242384 and / or to one or more of its neighbors in the range 128539973-128619555 of chromosome 8 and a variable defining the genotype related to SNP rs9364048 and / or
  • the input data correspond to the combination of a variable defining the genotype linked to the SNP rs749915 and / or to one or more of its neighbors in the interval 39097014-39163238 of the chromosome 4 and a variable defining the genotype related to SNP rs13226041 and / or to one or more of its neighbors in the interval 104002818-104863625 of chromosome 7 and a variable defining the genotype related to SNP rs721429 and / or to one or more of its neighbors in the interval 61335448-62195826 of chromosome 17
  • the input data correspond to the combination of a variable defining the genotype linked to the SNP rs2352946 and / or to one or more of its neighbors in the interval 84695541 -84776802 of the chromosome 16 and a variable defining the genotype related to the SNP rs6755695 and / or to one or more of its neighbors in the range 79446556-79664842 of chromosome 2 and a variable defining the genotype rs1 138253 linked to the SNP or to one or more of its neighbors in the range 4276183-4276683 of chromosome 19.
  • the input data correspond to the combination of a variable defining the genotype linked to the SNP rs13148138 and / or to one or more of its neighbors in the chromosome 127602673-128447913 interval. 4 and a variable defining the SNP-related genotype rs1773842 and / or one or more of its neighbors in the range of chromosome 10 and a variable defining the SNP-related genotype rs10148742 and / or to one or more of its neighbors in the interval rs10148742 of chromosome 14.
  • the input data correspond to the combination of a variable defining the genotype linked to the SNP rs2174183 and / or to one or more of its neighbors in the range 127602673-128447913 of the chromosome 4 and a variable defining the genotype related to SNP rs1 1526176 and / or to one or more of its neighbors in the range 27414591 -27808301 of chromosome 7.
  • the input data correspond to the combination of a variable defining the genotype linked to the SNP rs2048873 and / or to one of its neighbors in the chromosome 1 13062733-1 1341 1386 interval. 2 and / or a variable defining the SNP-related genotype rs6804627 and / or one or more of its neighbors in the 60928379-60979489 interval of chromosome 3 and a variable defining the SNP-related genotype rs10245886 and / or one of its neighbors in the range 47461234-47557773 of chromosome 7.
  • the individual prediction method relates to the screening, the diagnosis, the prognosis or the therapeutic response of a prostate cancer, the data being of clinical type such as individual data concerning the age of the prostate. patient, his weight, his height, the personal and family history of cancer, of biological type with for example the rate of PSA, and of genetic type such as the identification of markers of genetic polymorphisms considered as being linked to the development of the disease and selected from the lists cited above.
  • the method of the invention comprises a so-called learning process:
  • the method comprises the parallel construction of a set of optimal models, each model being developed from of a family (Fk) of functions, the predictive information of risk related to a disease resulting from the exploitation of the set of optimal models.
  • the method comprises:
  • BA learning base
  • BV validation basis
  • the method comprises, for a database comprising N data, the construction of the learning base carried out by the random drawing (without delivery) of M data belonging to the database of examples, NM data. remaining constituting the basis of validation.
  • the family of functions is of the type of
  • MLPs Multi Layer Perceptron
  • SVM Vector Support Machines
  • RVM Relevance Vector Machines
  • the comparison between said predictive result obtained with a model constructed with the set of input data belonging to the learning base, and the proven result obtained from a set of data d is carried out with a cost function similar to that used in the comparison between the estimate delivered by the model and the proven result y * .
  • the final result of the modeling can be obtained by merging optimal models that can be constructed from sets of different variables and obtained from families of different functions.
  • this merge phase it is useful to select the models to merge as well as the merge method to be implemented (average model responses, product, majority vote, integral of Choquet, integral of Sugeno [Ludmila I. Kuncheva, James C. Bezdek, and Robert PW Duin. Decision templates for multiple classify fusion: an experimental comparison. Pattern Recognition, 34: 299-314, 2001J).
  • a strategy of merging the set of optimal models constructed is generally unsatisfactory.
  • An optimal subset of models should be selected from the set of optimal models constructed using optimization methods, such as genetic algorithms.
  • the individual clinical data correspond to the combination of four cancer history variables and an age category variable, said history variables relating respectively to a family history of breast cancer, history of prostate cancer, personal history of cancer, family history of other cancers.
  • the invention also relates to an individual prediction device for the detection, diagnosis, prognosis or therapeutic response of a prostate cancer
  • an individual prediction device for the detection, diagnosis, prognosis or therapeutic response of a prostate cancer
  • first means for inputting individual information data by a user
  • at least a first software interface on which operates said first means characterized in that it further comprises a software implementing the method according to the invention and providing predictive information of risk related to prostate cancer.
  • said predictive risk information is returned to the user via said software interface.
  • the device further comprises means of communication between the first input means and the software, allowing the transmission of information data and that of the predictive information.
  • the device further comprises second means for inputting individual information data and a second software interface, the first input means for entering clinical type information, the second means for input of information from sampling on the individual.
  • FIG. 1 illustrates a diagram summarizing the interactions between the example database, the actual results and the predictive results
  • FIG. 2 illustrates a representation of a type of neural network
  • FIGS. 3a to 3e respectively illustrate the performance of Multi-Layer Perceptron type algorithms with respect to the discrimination of patients suffering from prostate cancers of controls with, in input variables, the age category and respectively the associated genotype.
  • FIG. 4 illustrates a first example of use in which the software tool is implanted at the practitioner's premises
  • FIG. 5 illustrates a second example of use in which the software tool is centralized in a professional provider of predictive results
  • FIG. 6 illustrates a comparison between the performances obtained with an NG1 model using the 3 best SNPs, including the SNP rs4242382, in the p-value sense of the aforementioned Nature Genetics article and those obtained with a model B1 using 3 SNPs, including SNP rs4242382, identified as synergistic by the Applicant's methods;
  • FIG. 7 illustrates a comparison between the performances obtained with an NEJM model constructed from the age and background variables of a base constituted in the present invention and SNPs described in [Zheng SL, Sun J, Wiklund F, et al. Cumulative association of five genetic variants with prostate cancer. NEngl JMed 2008; 358: 910-9], those obtained with a D2 model using SNPs disclosed in the present invention and those obtained with a fusion model according to the invention;
  • FIG. 8 illustrates a comparison between the performances obtained with an NEJM model constructed from the age and background variables of a base constituted in the present invention and SNPs described in Zheng SL et al, those obtained with a model D2 using SNPs disclosed in the present invention, said models not using antecedent variables;
  • FIG. 9 illustrates a comparison between the performances obtained with an NG1 model using the 3 best SNPs disclosed in G. Thomas et al, Multiple identified loci! in a genome-wide association study of prostate cancer, Nature Genetics, vol40, num3, market 2008, those obtained with the model D2 and those obtained with a fusion model;
  • FIG. 10 illustrates a comparison between the performances obtained with the NG1 model and those obtained with the D2 model, said models not using antecedent variables;
  • FIG. 11 illustrates a comparison between the performances obtained with a model B2 using 7 SNPs selected according to the invention and those obtained with an NG2 model using the best 7 SNPs in the p-value sense of the aforementioned Nature Genetics article and antecedents ;
  • FIG. 12 illustrates the "AUC" performances of the models described above.
  • the advantage of the present invention lies in the fact of providing doctors with a decision support tool for personalized care of their patients. Its originality lies in the combination of an exclusive database and multidimensional statistical analysis. The user can benefit from knowledge derived from multidisciplinary research in medicine, biology, genetics, mathematics and objective results. The medical impact of this expert system is also economical because it allows practitioners to better detect the early and curable stages of the disease, to reduce the costs and side effects associated with invasive diagnostic and therapeutic methods. Finally, for the patient, it is a question of obtaining an optimal management of his pathology, a reduction of the risk of overtreatment, an increase of his life expectancy and an improvement of his quality of life.
  • the prediction tool is realized thanks to the upstream construction of models by statistical learning.
  • a model built within the framework of statistical learning theory, is usually a parameterized mathematical function / that contains adjustable parameters ⁇ and belonging to a larger family of functions F.
  • the entries x are the genetic information and / or the coded results of clinical information which can in particular be derived from a questionnaire of the patient; when the x entries are qualitative (or categorical) variables, the encoding of these variables into numerical values is necessary in order to make them directly usable by the models as part of their construction and their use as an estimator.
  • the encoding may consist in coding the qualitative variable "my grandfather” with the value "1" which will group all the parents of the second degree.
  • the encoding must neither hide nor scramble the information, it must be relevant.
  • one can refine the coding if one wishes to distinguish or not the attack of the maternal grandfather of the attack of the paternal grandfather.
  • the encoding of data can be inventive, its quality (completeness, relevance) partly determines the possibilities of solving the problem of discrimination.
  • the encoding is not obligatorily binary, the number of categories
  • This estimate can be considered as a function / dependent on the inputs x and the parameters ⁇ .
  • the difficulty of creating the model lies in the adjustment of the parameters ⁇ . These parameters ⁇ are adjusted in a so-called learning phase that requires examples and the implementation of dedicated algorithms.
  • variable x is, as before, a value among a set of input values and y * is the actual output associated with these inputs considered as the truth that we wish to estimate (the cancer / not cancer diagnosis issued by a specialist for example).
  • This database is represented as an array of N lines, where each line represents an example (the input values for an individual and his associated class).
  • the purpose of learning is to build a model, from these N examples, to ultimately estimate the response that the specialist would have given on a new case never met. We speak in this case of generalization ability. In the model creation procedure, we choose the one that will deliver the best generalization capability.
  • the representativeness of the data is a very important notion since it conditions the quality of the constructed model and the information that the model can learn is contained in the database through the N examples.
  • Representativity means the exhaustive nature of the cases contained in the database. That is, one must ensure that the model has encountered a set of cases similar to those it will encounter in its future use as an estimator.
  • the formation phase of the learning base is therefore a key step and must be conducted with great rigor.
  • the following section describes how the learning algorithm adjusts the model parameters according to the elements constituting the learning base.
  • Figure 1 illustrates a diagram that summarizes the interactions between the Bex example database, the actual results, and the predictive results.
  • the algorithm modifies the adjustable parameters ⁇ of the model so that the estimate is as close as possible to that of the proven result still called "supervisor" /.
  • the criterion that we want to minimize by acting on the parameters ⁇ is the difference between the response of the model and the response of the supervisor on the cases available. This difference can be obtained in different ways depending on the problem and is called "cost function":
  • cost function for example one of the following functions:
  • the learning phase therefore consists of finding a set of parameters ⁇ for a function fi of the family F of functions that minimizes the cost function on all the examples, using optimization algorithms.
  • a model capable of predicting already known information is of little interest. It must be ensured that he is able to correctly predict cases not present but represented in the learning base, and who follow the same laws as those used for learning. This is why the example database is usually split into a BA learning base, to adjust the parameters of the model, and a BV validation database, also called the validation database, to test the chosen model and verify its robustness.
  • the two sets are constructed by randomly drawing the elements from the example database.
  • N the number of elements from the example database.
  • the procedure is repeated a number of times.
  • the problem encountered falls into the category of discrimination problems, that is to say that it seeks to classify new individuals into two groups: patients or witnesses.
  • a fifth step the parameters ⁇ of the function retained in the previous step are evaluated with all the examples of the training base. We thus obtain the optimal model fio P (x, ⁇ ) which from input individual data x will be able to provide the predictive result y.
  • Multi Layer Perceptrons a subset of the family of neural networks
  • SVM Support Vector Machines
  • RVM Relevance Vector Machines
  • a model is constituted capable, from the explanatory variables obtained, for example, from the variable selection methodologies described in the present invention, of predicting an interpreted response as a probability of being sick or control.
  • the present problem falls into the category of discrimination problems, that is to say, it seeks to classify new individuals into two groups: sick or witnesses.
  • a family that is simple to describe and generally effective is Perceptrons Multi-Layer or MLP (for Multi Layer Perceptron). It is a type of neural network that is generally represented according to the diagram illustrated in FIG.
  • Sigmoid (such as the "hyperbolic tangent” function)
  • n is the number of hidden neurons
  • p is the number of input variables
  • is the parameter vector consisting of 6> and ⁇ y components for l ⁇ i ⁇ n and 1 ⁇ j ⁇ p.
  • ⁇ l ⁇ denotes the element ij of the matrix ⁇ (parameter matrix between the inputs and the hidden neurons) and O 1 denotes the element i of the vector of parameters between the hidden neurons and the output.
  • the functions that make up the MLP family for the problem being treated differ only in their number of "hidden neurons", each of them actually representing a Sigmoid function.
  • the function representing the model obtained from a logistic regression, a modeling method well known in the medical field belongs to this family. This is indeed a special case of MLPs having no hidden neurons. In this case, the model is linear with respect to the parameters and the construction of the model then implements learning techniques different from those used in the context of MLPs.
  • the model number 2 is driven and its validation score number 2 is calculated. 6) The procedure is continued until each subset has been used for validation. So we have five validation scores. The final validation score is the average of these five scores.
  • This procedure uses all the data to calculate the validation score, which avoids focusing on particular cases.
  • a training cost function is selected:
  • the cost function used for training is partly dictated by the problem posed (discrimination) and the function family (MLP). In the present case, it is advantageous to use cross entropy.
  • the validation score corresponds to a measure of evaluation of the quality of the model.
  • This score can correspond to its classification rate, which is the sum of the number of patients and witnesses correctly identified, divided by the total number of individuals in the validation database.
  • This score is simple to calculate and easily interpretable and usable, although it obscures class-by-class performance (it can happen that one class is better identified than the other).
  • This score can also be the AUC (Area Under Curve), that is to say the area under the ROC curve (Receiver Operating Caracteristic) as illustrated in FIGS. 3a, 3b, 3c, 3d and 3e.
  • the final optimal model is constructed.
  • optimal model information is merged.
  • the objective of the information fusion is to improve the decision-making in terms of robustness and reliability from the combination, via a mathematical operator, of the decisions or scores provided by the family of functions [I. Bloch. Merging digital information: methodological panorama. In National Days of Research in Robotics, Guidel, Morbihan, October 2005]. These operators must at the same time take advantage of the complementarities between the different functions at the beginning of the merger but also take into account their redundancies.
  • the fusion operators are numerous [Ludmila I. Kuncheva, James C. Bezdek, and Robert PW Duin. Decision templates for multiple classify fusion: an experimental comparison. Pattern Recognition, 34.
  • the merge operators can take the form of a rule table, combination rules of "logical AND / OR" type, score product with or without a priori that can be conditional or not, as in the case of fusion based on generalized Bayes theorem or not [Ph. Smets. Beliefs functions: The Disjunctive RuIe of Combination and the Generalized Bayesian Theorem. Int. Day, of Approximate Reasoning, 9: 1-35, 1993], distances to predefined models by learning or expertise, weighted sum with or without taking into account the interactions between the inputs of the merger ...
  • the prediction method when the prediction method is constructed, it is possible to propose to the user, typically the doctor or any other laboratory type entity, the provision of a decision support tool to both impartial, reliable and allowing personalized use at different stages of the patient's journey, thereby making it possible, with a single tool, to make hierarchical predictions, including entries of the clinical data type and or genetic data, said tool providing an output a risk assessment type of information or degree of disease advance detected.
  • a decision support tool to both impartial, reliable and allowing personalized use at different stages of the patient's journey, thereby making it possible, with a single tool, to make hierarchical predictions, including entries of the clinical data type and or genetic data, said tool providing an output a risk assessment type of information or degree of disease advance detected.
  • a simple saliva sample makes it easy to work on invariant constitutional DNA.
  • the genetic material is informative because it is susceptible by the identification of the genetic profile to determine the risk of developing the disease but also the risk that it is aggressive.
  • the application is installed at the practitioner who captures the information available to him for his patient, such as the blood level of total PSA or free PSA, age, weight, height, the family and personal antecedents, the result of rectal examination and the genotypes of interest. He selects the relevant questions and the application queries the different statistical models at his disposal.
  • the tool gives personalized and hierarchical answers with for example for prostate cancer, the risk of developing aggressive cancer at a given age, the risk of developing metastases or a recurrence of the tumor after initial treatment (at an age given).
  • FIG. 4 illustrates such a configuration in which individual data x is inputted by a user U 0 by means of first means at an interface 1, said interface providing the link with the software 2 implementing the method of FIG. 'invention. The predictive information is restored at the interface to the user U 0 , in this case the practitioner.
  • the clinical type information is sent by a patient or a practitioner to the professional results provider via communication networks that can be of the internet type.
  • information from blood-type and / or salivary samples analyzed in the laboratory is also sent to the predictive outcome professional, all the information is processed by the model or models previously developed so as to provide a predictive result, said the result is sent back to a health professional who is thus able to inform the patient.
  • Figure 5 schematizes this type of configuration.
  • a first user U i enters a certain number of individual data Xi 1 that can be of clinical data type at a first interface 10 and sends them via an internet-type remote link, for example to a professional provider of results.
  • a second user can be an analysis laboratory sends another flow of information from X 2 saliva or blood samples, and entered at a second interface 1 1 and also sent to the supplier FRP via a link to distance. After processing all the data received via an interface 12 installed at the supplier FRP, the latter sends the result y to a third user U 3 authorized to inform the patient concerned.
  • a third user U 3 authorized to inform the patient concerned.
  • the user U is the practitioner, there may be two users Ui and U 2.
  • the provider of results can at any time come to enrich its databases of examples by the new cases treated in order to provide more powerful predictive results.
  • For remote case submissions it is provided a protection of the personal data of each patient, consistent with the rules of safety and ethics in use.
  • a first variable is called a "family history of prostate cancer".
  • the values of this variable are used to define the family context of the occurrence of a patient's prostate cancer.
  • the values assigned to each individual depend on the age and / or degree of kinship and / or the number of cases of prostate cancer occurring in their family.
  • a second variable is called "family history of breast cancer" values of this variable to define the family context of occurrence of breast cancer of a patient.
  • the values assigned to each individual depend on the age and / or the degree of relationship and / or the number of cases of breast cancer occurring in their family.
  • a third variable is called a "personal history of cancer" to distinguish patients who have ever had cancer, whatever it is.
  • a fourth variable is called a "family history of other cancers".
  • the values of this variable define the family context of cancer occurrence (other than breast or prostate cancer) and are dependent on age and / or degree of relatedness and / or the number of cases of occurrence of other forms of cancer for a given patient.
  • a fifth variable is the age encoded as age categories. These variables can be used in combination or alone as variables of relevant algorithm entries to obtain a calculation of the risk of occurrence of prostate cancer or to determine the susceptibility to prostate cancer.
  • SNPs Single Nucleotide Polymorphisms
  • An essential property of the genetic markers of which SNPs are part is their ability to be transmitted in linkage disequilibrium with markers of their defined neighborhood in the sense of chromosomal location. We speak of genetic distance between two markers or SNPs. It is considered that two markers are thus genetically linked when the frequency of the recombinations between them is rare. The existence of these genetic links makes that the SNPs in the vicinity of an SNP of interest are likely to bring the same information or a piece of information on a character of susceptibility.
  • each SNP we have the relevance of different SNPs present in its vicinity, we can obtain for each SNP of major interest, the list of neighboring SNPs that can provide information on the susceptibility to prostate cancer.
  • the definition of such an interval is of major interest from a practical point of view since it makes it possible to choose markers bringing relevant information from a list according to practical criteria of commercial availability of reagents and experimental for example.
  • each of the SNPs genetically linked to the SNP of interest is likely to bring all or part of the information provided by the SNP of interest.
  • the genetic linkage depends on the physical distance between two genetic elements (usually expressed in nucleotides) and the frequency of recombination between these two elements.
  • the SNP of interest can itself be the causative agent of the susceptibility that one seeks to predict, it can also simply be genetically linked to it.
  • a SNP genetically linked to the SNP of interest can also be genetically linked to the causal susceptibility factor. This possibility explains the need to introduce a first "or".
  • the "and” also comes from the property given by the genetic bonds. If the susceptibility factor is positioned between two genetically linked SNPs, knowing in an individual the alleles present for each SNP makes it possible to complete the information on the probability of presence of the causative agent of a susceptibility. All of these properties seemed to us best represented by the formulation used in the claims.
  • SNPs are currently the most widely used genetic markers, but it is obvious that each SNP can be replaced by a molecular biology marker of any kind provided that the physical or statistical link is obvious to those skilled in the art. , the interchangeability of the variables is mathematically very easy to verify provided that the new variable is filled in for enough individuals.
  • SNP rs2174183 located at 4q28.1 on chromosome 4 between positions 127907634-127908134 following the location determined by the UCSC genome browser, March 2006 assembly.
  • Genomic sequence in the vicinity of rs2174183 polymorphic fatty nucleotide.
  • SNPs neighboring the SNP rs2174183 that can provide information on susceptibility to prostate cancer are defined in a database according to the following table and are positioned in the interval 127602673-128447913 of chromosome 4 or between SNPs rs12651 126 and rs13122922 on chromosome 4:
  • ROC curves corresponding to a variable relating to sensitivity to a test also called "Receiver Operating Caracteristic ”
  • FIG. 5 show the performance of Multi-Layer Perceptron type algorithms with respect to the discrimination of patients suffering from cancers of the Prostate and controls using as input variables the age category and genotype associated with SNP rs2174183 or its neighbors. Intermediate SNPs not mentioned are therefore likely to carry information.
  • the corresponding AUCs (Area Under Curve) are likely to be enhanced by the use of input history variables.
  • SNP rs7576160 located in 2p22.2 on chromosome 2 between positions 37957978-37958478 following the location determined by the UCSC genome browser, March 2006 assembly. Genomic sequence in the vicinity of rs7576160: polymorphic nucleotide in bold.
  • SNPs neighboring the SNP rs7576160 that can provide information on susceptibility to prostate cancer are defined in our database according to the following table and are positioned in the interval 37855761 -38126567 of chromosome 2 or between SNPs rs7562836 and rs17021897 of chromosome 2.
  • SNP rs2012385 located in 2q38.1 on chromosome 2 between positions 242070828 and 242071328 following the location determined by the UCSC genome browser, March 2006 assembly. Genomic sequence in the neighborhood of rs2012385: polymorphic nucleotide in bold.
  • SNPs neighboring the SNP rs2012385 that can provide information on susceptibility to prostate cancer are defined in our database according to the following table and are positioned in the interval 241767109-2421 19399 of chromosome 2 or between SNPs rs1540528 and rs7567892 of chromosome 2.
  • SNP rs2190453 localized in 1 1 p15.1 on chromosome 1 1 between positions 17489723-17490223 following the location determined by the UCSC genome browser, March 2006 assembly. Genomic sequence in the vicinity of rs2190453: polymorphic nucleotide in bold.
  • SNPs neighboring the SNP rs2190453 that can provide information on susceptibility to prostate cancer are defined in our database according to the following table and are positioned in the interval 17464539-17757162 of chromosome 1 1 or between SNPs rs12278956 and rs1003921 of chromosome 1 1.
  • SNP rs888298 located in 17q24.2 on chromosome 17 between positions 63955680 to 63956180 following the location determined by the UCSC genome browser, March 2006 assembly.
  • Genomic sequence in the vicinity of rs888298 polymorphic nucleotide in bold.
  • SNPs neighboring the SNP rs888298 that can provide information on susceptibility to prostate cancer are defined in our database according to the following table and are positioned in the interval 6381561 1 -64165896 of chromosome 17:
  • SNP rs8110935 located in 19q13.43 on chromosome 19 between positions 62239851 -62240351 following the location determined by the UCSC genome browser, March 2006 assembly.
  • Genomic sequence near rs8110935 Polymorphic nucleotide in bold.
  • SNP rs2788140 localized in 1 q32.3 on chromosome 1 between positions 210171227-210171727 following the location determined by the UCSC genome browser, assembly of March 2006.
  • Genomic sequence in the vicinity of rs2788140 polymorphic nucleotide in bold.
  • SNPs neighboring the SNP rs2788140 that can provide information on susceptibility to prostate cancer are defined in our database according to the following table and are positioned in the 210157195-210446272 interval of chromosome 1 or between SNPs rs12135924 and rs7546833 of chromosome 1.
  • SNP rs7934514 located in 1 1 q22.1 on chromosome 1 1 between positions 992141 18-99214618 following the location determined by the UCSC genome browser, March 2006 assembly.
  • Genomic sequence in the vicinity of rs7934514 polymorphic nucleotide in bold.
  • SNPs neighboring the SNP rs7934514 that can provide information on susceptibility to prostate cancer are defined in our database according to the following table and are positioned in the interval 99092040-99333419 of chromosome 1 1 or between SNPs rs605559 and rs12574821 of chromosome 1 1.
  • SNP rs3828054 localized in 1 q21.3 on chromosome 1 between positions 149779269-149779769 following the location determined by the UCSC genome browser, assembly of March 2006. Genomic sequence in the vicinity of rs3828054: polymorphic nucleotide in bold.
  • SNPs neighboring the SNP rs3828054 that can provide information on susceptibility to prostate cancer are defined in our database according to the following table and are positioned in the interval 149382371 -149874970 of chromosome 1 or between SNPs rs11807526 and rs6702842 of chromosome 1.
  • SNP rs1499955 located in 3q13.31 on chromosome 3 between positions 116719413-1 16719913 following the location determined by the UCSC genome browser, March 2006 assembly.
  • Genomic sequence in the vicinity of rs1499955 polymorphic nucleotide in bold.
  • AGTCCCA GZT
  • SNPs neighboring the SNP rs1499955 that can provide information on susceptibility to prostate cancer are defined in our database according to the following table and are positioned in the interval 1 16302446-1 1701 1700 of chromosome 3 or between SNP rs9289008 and rs2289271 of chromosome 3
  • SNP rs4855539 located in 3p14.1 on chromosome 3 between positions 69108069-69108569 following the location determined by the UCSC genome browser, March 2006 assembly.
  • Genomic sequence in the vicinity of rs4855539 polymorphic nucleotide in bold.
  • SNPs neighboring the SNP rs4855539 that can provide information on susceptibility to prostate cancer are defined in our database according to the following table and are positioned in the interval 69049525-69153397 of chromosome 3:
  • SNP rs4242382 localized at 8q24.21 on chromosome 8 between positions 128586505-128587005 following the location determined by the UCSC genome browser, March 2006 assembly. Genomic sequence in the vicinity of rs4242382: polymorphic nucleotide in bold.
  • SNPs neighboring the SNP rs4242382 that can provide information on susceptibility to prostate cancer are defined in our database according to the following table and are positioned in the interval 128539973-128619555 of chromosome 8 or between SNPs rs7830412 and rs4407842 of chromosome 8.
  • SNP rs11526176 located in 7p15.2 on chromosome 7 between positions 27546048-27546548 following the location determined by the UCSC genome browser, March 2006 assembly.
  • Genomic sequence near rs11526176 polymorphic nucleotide in bold.
  • SNPs neighboring the SNP rs11526176 that can provide information on the risk of developing prostate cancer are defined in our database according to the following table and are positioned in the interval 27414591 - 27808301 of chromosome 7 or between SNPs rs1 1761572 and rs2237344.
  • SNP rs6492998 localized at 15q15.1 on chromosome 15 between positions 39,333,673-39,334,173 according to the location determined by the UCSC genome browser, March 2006 assembly.
  • Genomic sequence in the vicinity of rs6492998 polymorphic nucleotide in bold.
  • SNPs neighboring the SNP rs6492998 that can provide information on susceptibility to prostate cancer are defined in our database according to the following table and are positioned in the interval 38991207-39584443 of chromosome 15:
  • SNP rs6681102 localized at 1q43 on chromosome 1 between positions 236,853,987-236,854,487 according to the location determined by the UCSC genome browser, March 2006 assembly.
  • Genomic sequence in the vicinity of rs6681102 polymorphic nucleotide in bold.
  • SNP neighboring SNPs rs6492998 that can provide information on susceptibility to prostate cancer are defined in our database according to the following table and are positioned in the range 236815776-236998150 of chromosome 1:
  • SNPs neighboring the SNP rs2048873 that can provide information on susceptibility to prostate cancer or hormone-dependent cancers or cancer are defined in our database according to the following table and are positioned in the interval 113062733-1 13411386 of chromosome 2
  • SNP rs6804627 located in 3p14.2, on chromosome 3 between chr3 positions: 60963960-60964460 following the UCSC genome browser numbering, March 2006 assembly
  • AGAATTCTGATGATTCTAATATTCA (C / T) TTATAATGTCCATTTAGCTACCACATTGTGTTTATGCCCCTTAAA
  • SNPs neighboring the SNP rs6804627 that can provide information on susceptibility to prostate cancer or hormone-dependent cancers or cancer are defined in our database according to the following table and are positioned in the interval 60928379-60979489 of chromosome 3
  • the SNP PNS neighboring rs10245886 that can provide information on susceptibility to prostate cancer or hormone-dependent cancers or cancer are defined in our database according to the following table and are positioned in the interval 47461234-47557773 of chromosome 7
  • SNPs neighboring the SNP rs1511695 that can provide information on susceptibility to prostate cancer or hormone-dependent cancers or cancer are defined in our database according to the following table and are positioned in the interval 218280585-218521047 of chromosome 1.
  • SNP rs4669835 located in 2p25.1, on chromosome 2 between positions 12289824-12290324 following the UCSC genome browser, March 2006 assembly. Genomic sequence in the vicinity of rs4669835, polymorphic fatty nucleotide
  • TCCTCGACTTCCTGCTTCATCCTCC (A / G) TGGTCTTTGTTGAAACAAAACTTGAACCAACAGTTCAACAATAAA TATTTTGATGCCAATCCCACTGAAAGTTAAAGTCAAAGCATCTGTTAACCAGATC
  • SNPs neighboring the SNP rs4669835 that can provide information on susceptibility to prostate cancer or hormone-dependent cancers or cancer are defined in our database according to the following table and are positioned in the interval 121 1 1054 -12324507 of chromosome 2.
  • SNP rs12605415 located in 18q12.1 on chromosome 18 between positions 24135069-24135569 following UCSC genome browser numbering, March 2006 assembly.
  • SNPs neighboring the SNP rs12605415 that can provide information on susceptibility to prostate cancer or hormone-dependent cancers or cancer are defined in our database according to the following table and are positioned in the interval 23907695-24187878 of chromosome 18.
  • CZT CTGGTGGTAGAACTTAATGTGGAAAGTTAA
  • SNPs neighboring the SNP rs749915 that can provide information on susceptibility to prostate cancer or hormone-dependent cancers or cancer are defined in our database according to the following table and are positioned in the interval 39097014-39163238 of chromosome 4.
  • SNP rs13226041 located in 7q22.2 on chromosome 7 between positions 104851579-104852079 following the UCSC genome browser dialing, March 2006 assembly.
  • SNPs neighboring the SNP rs13226041 that can provide information on susceptibility to prostate cancer or hormone-dependent cancers or cancer are defined in our database according to the following table and are positioned in the interval 104002818-104863625 of chromosome 7.
  • SNP rs721429 located in 17q24.2 on chromosome 17 between positions 621221 17-62122617 following the UCSC genome browser numbering, March 2006 assembly.
  • SNPs neighboring the SNP rs721429 that can provide information on susceptibility to prostate cancer or hormone-dependent cancers or cancer are defined in our database according to the following table and are positioned in the interval 61335448-62195826 of chromosome 17.
  • SNP rs9364048 located in 6q13 on chromosome 6 between positions 70455536-70456036 following the UCSC genome browser numbering, March 2006 assembly. Genomic sequence in the vicinity of rs9364048 polymorphic nucleotide in bold
  • SNPs neighboring the SNP rs9364048 that can provide information on susceptibility to prostate cancer or hormone-dependent cancers or cancer are defined in our database according to the following table and are positioned in the range 70074721 -70679396 of chromosome 6.
  • SNP rs4242384 located in 8q24.21 on chromosome 8 between positions 128586505-128587005 following the UCSC genome browser numbering, March 2006 assembly.
  • SNPs neighboring the SNP rs4242384 that can provide information on susceptibility to prostate cancer or hormone-dependent cancers or cancer are defined in our database according to the following table and are positioned in the interval 128539973-128619555 of chromosome 8.
  • SNP rs2352946 localized in 16q24.1 on chromosome 16 between positions 84758022-84758522following UCSC genome browser dialing, March 2006 assembly.
  • Genomic sequence in the vicinity of rs2352946 polymorphic nucleotide in bold.
  • SNPs neighboring the SNP rs2352946 that can provide information on susceptibility to prostate cancer or hormone-dependent cancers or cancer are defined in our database according to the following table and are positioned in the interval 84695541 -84776802 of chromosome 16.
  • SNP rs6755695 localized in 2pl2 on chromosome 2 between positions 79511959-79512459 following UCSC numbering genome browser, March 2006 assembly. Genomic sequence in the vicinity of rs6755695 polymorphic nucleotide in bold.
  • SNPs neighboring the SNP rs6755695 that can provide information on susceptibility to prostate cancer or hormone-dependent cancers or cancer are defined in our database according to the following table and are positioned in the range 79446556-79664842 of chromosome 2.
  • SNPs neighboring the SNP rs1138253 that can provide information on susceptibility to prostate cancer or hormone-dependent cancers or cancer are defined in our database according to the following table and are positioned in the interval 4098195-4506560 of chromosome 19.
  • SNPs neighboring the SNP rs10148742 that can provide information on susceptibility to prostate cancer or hormone-dependent cancers or cancer are defined in our database according to the following table and are positioned in the interval 43257771 -43665346 of chromosome 14.
  • SNP rs1773842 localized at 10p11.23 on chromosome 10 between positions
  • SNPs neighboring the SNP rs1773842 that can provide information on the susceptibility to prostate cancer or hormone-dependent cancers or cancer are defined in our database according to the following table and are positioned in the interval 29356293-29651 117 of chromosome 10.
  • the so-called cancer history variables as well as the age category variable can be combined with the SNPs mentioned above as input variables of SVM RVM logistic regression algorithms or another type of algorithm. statistical learning.
  • the classifiers thus obtained can be used as such, but it is still possible to optimize the performance of the tool by performing meta-classifiers that were developed by merging the classifiers. This merge operation is similar to that of variable selection, a step during which the optimization, with respect to a certain criterion fusion, comes from the search for complementarity between classifiers: classifiers or meta-classifiers can then be used to perform a calculation of risk of prostate cancer.
  • the present invention has been developed in two steps, one aiming to select the relevant genetic markers that constitute the heart of the tool and a second step of performing the mathematical modeling that can take them into consideration for establish a risk calculation.
  • the method of the present invention was developed from the following steps: with data specific to the Research Center for Prostatic Pathologies "CeRePP", established by Professor Cussenot and his collaborators, 1315 individuals who gave their consent were referenced, they belong to two distinct categories: prostate cancer patients and controls. To limit the occurrence of statistical biases the two categories of individuals have been best matched, the most obvious example of a variable to be balanced is, for example, age.
  • Patient medical records include prostate cancer status, family history of prostate cancer, family history of breast cancer, family history of other cancers, and personal history of cancer.
  • the individuals considered were then genotypes sufficiently exhaustive to cover the entire genome.
  • the Applicant was able to have individual genotypes for 27188 SNPs distributed on the 24 chromosomes of the human genome.
  • the 27188 SNPs and the other variables were then subjected to variable selection work with the use, for example:
  • Genetic algorithms belong to the family of evolutionary algorithms. Their name does not come from the possible applications in the field of genetics but from an analogy between their functioning and theories of revolution of the living. They are usually used to solve optimization problems.
  • the principle is to generate a population of potential solutions in the solution search space. Each potential solution is evaluated by a function, named "fitness" function, adapted to the problem to be treated.
  • fit function
  • new potential solutions are generated in the search space by selecting the best solutions from the previous iteration and using two other functions, combinations and mutations. More precisely, we mean by:
  • selection a selection of the best solutions operated via, for example, the fitness function. This process is inspired by that of natural selection, only the best adapted individuals participate in reproduction which improves, from generation to generation, the overall adaptation of the population.
  • this operation consists in mixing the characteristics of two potential solutions retained in the selection phase. This operation corresponds to the reproduction phase which is to create a new potential solution from two existing retained solutions.
  • mutation this operation involves changing some of the characteristics of a potential solution randomly with a relatively low mutation rate so as not to fall into a random search.
  • the mutation allows the algorithm not to converge prematurely to a local extremum.
  • Mutual information is a measure of information theory that quantifies the mutual dependence of two random variables (or groups of random variables).
  • Mutual information quantifies the mutual dependence of two random variables X, Y or two groups of variables X, F ie, how much knowledge on X reduces the uncertainty on F. This mutual information calculation can therefore be used as part of a selection of variables using this measure to determine the mutual dependence between a variable, or a group of variables (here the SNPs), with the output (the status).
  • the first step of the work performed by the plaintiff therefore consisted of a selection of variables or dimension reduction.
  • SNP rs4242382 which has already been cited in the literature and in particular in the article by G. Thomas et al. Multiple loci identified!
  • the SNPs are selected from their p-value.
  • the authors thus identified the SNP rs4242382 as identified by the applicant also by its methods.
  • these methods made it possible to identify a synergy between this SNP and two other SNPs among the 27188 SNPs available in the database. This group of 3 SNPs is identified as group B1.
  • the Applicant then compared the performances obtained by the models constructed from the B1 group with the performances of the models constructed from the 3 best SNPs, in the sense of the p-value, of the Nature Genetics article.
  • the results are presented in FIG. 6 and more precisely the curves 6a and 6b which are the ROC curves relating to the B1 model and to the Nature Genetics model which respectively obtain AUCs of 0.601 and 0.556.
  • This result shows that the group B1, containing 3 SNPs in synergy, of which rs4242382, discovered by the implementation of the methods of the invention, is more efficient than the grouping of the 3 best SNPs available in the aforementioned Nature Genetics article.
  • SNPs selected in the present invention as rs2174183 are not directly located in a gene, the biological function to which it is attached is unknown and could be elucidated with the knowledge of complex regulations such as epigenetic or microRNA regulations, all at the same time. new, emerging in the field of carcinogenesis.
  • the resultant is a method of discrimination of individuals with or without prostate cancer, original by the methods of selection of variables implemented, the SNPs and the combinations that constitute it, the modeling then the meta-modeling, or fusion, implementation and also by the importance of the performances obtained.
  • the invention can thus be presented as follows: • a list of SNPs discovered by a variable selection process which, in addition to the selection for the intrinsic predictive value of the SNP, makes it possible to guarantee the synergy between the selected SNPs but can also allow to ensure synergy with cancer history variables and clinical variables. • One or more models built by statistical learning from all or some of the variables described in the previous point to estimate the status for unknown individuals.
  • the property of the invention is to discriminate between individuals suffering from prostate cancer and healthy subjects, that is to say that when the individuals are of unknown status, it can identify those with a healthy or affected subject profile, and their degree of susceptibility to prostate cancer.
  • the degree of susceptibility to prostate cancer can be given, for example, by a calculation of risk at a given age, by a curve of the variation of risk as a function of age.
  • the whole tool finally takes the form of a practical application.
  • each SNP it is not specified which alleles at risk, this knowledge which is interesting for the study of the biological mechanism involved, is not essential to the operation of the invention, because it is ultimately a very good combination.
  • complex of the value of each input variable that may be associated with a particular risk.
  • each can be represented by two different alleles, which represents 3 different genotypes per SNP and 27 different genetic profiles by combining the whole (3 SNP genotypes 1 x 3 SNP2x genotypes 3 SNP3 genotypes). The most powerful risk information is linked to each particular combination among 27.
  • NEJM Model constructed with: Age, Atcd, rs4430796, rs1859962, rs1 6901979, rs6983267 and rs1447295, described in Zheng SL, Sun J, Wiklund F, et al. Cumulative association of five genetic variants with prostate cancer. NEngl JMed 2008; 358: 910-9;
  • NG1 Model Constructed with Age, Atcd, rs4242382, rs10993994, rs6983267 described in G. Thomas et al, Multiple loci identified in a genome-wide association study of prostate cancer, Nature Genetics, vol40, num3, market 2008; NG2: Model Constructed with Age, Atcd, rs4242382, rs10993994, rs6983267, rs4430796, rs10896449, rs4962416, rs10486567 described in G.
  • PSA AUC PSA test as practiced today described in IM Thompson et al, Operating Characteristics of prostate-specific antigen in men with an initial PSA level of 3.0 ng / mL or lower, JAMA, vol294, num1 2005; D2: Model constructed with Age, Atcd and 3 SNPs selected by the methods of the present invention;
  • Fusion A fusion meta-model of the present invention.
  • each SNP has a moderate link but when the 5 SNPs are combined, the predictive power of the models is improved.
  • the authors use the age, the region, the family history identified in antecedents called "Atcd” and the five SNPs to build their models. (identified as model 3 in the article). They get an AUC for this model of 0.633 (the 95% confidence interval is 0.617 to 0.65).
  • the purpose of the comparison is to determine the contribution of information related to the addition of the SNPs described in the article and the contribution of information related to the addition of the SNPs obtained from the methods described in the present invention. .
  • model NEJM a model built from the SNPs of the article
  • the applicant created a model (named model NEJM) from the 5 SNPs of the article mentioned above and the variables of antecedents and age from his own base.
  • the applicant obtained with this model NEJM an AUC of 0.636, as illustrated in FIG. 7, which is within the confidence interval of model 3 of the aforementioned article.
  • Applicant has created a model from one of its SNP groups containing 3 SNPs and background variables and age of his own base (identified as model D2)
  • 7b and 7c are respectively the ROC curves for the so-called NEJM, D2 and Fusion models which respectively obtain AUCs of 0.636, 0.70 and 0.767.
  • the performance of the model of the present invention is better with less SNPs.
  • the NEJM model contains 5 SNP whereas the D2 model of the present invention only contains 3. This comparison makes it possible to conclude that the selection of SNPs described in the present invention makes it possible to create models that obtain better AUCs and therefore have a greater ability to discrimination.
  • Figure 12 illustrates the AUC Performance of the previously described models.

Landscapes

  • Health & Medical Sciences (AREA)
  • Life Sciences & Earth Sciences (AREA)
  • Engineering & Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • Chemical & Material Sciences (AREA)
  • Bioinformatics & Cheminformatics (AREA)
  • Proteomics, Peptides & Aminoacids (AREA)
  • Analytical Chemistry (AREA)
  • General Health & Medical Sciences (AREA)
  • Biophysics (AREA)
  • Genetics & Genomics (AREA)
  • Biotechnology (AREA)
  • Medical Informatics (AREA)
  • Evolutionary Biology (AREA)
  • Molecular Biology (AREA)
  • Bioinformatics & Computational Biology (AREA)
  • Organic Chemistry (AREA)
  • Spectroscopy & Molecular Physics (AREA)
  • Theoretical Computer Science (AREA)
  • Immunology (AREA)
  • Pathology (AREA)
  • Wood Science & Technology (AREA)
  • Zoology (AREA)
  • Data Mining & Analysis (AREA)
  • Databases & Information Systems (AREA)
  • Software Systems (AREA)
  • Public Health (AREA)
  • Hospice & Palliative Care (AREA)
  • Evolutionary Computation (AREA)
  • Oncology (AREA)
  • Epidemiology (AREA)
  • Microbiology (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • Bioethics (AREA)
  • Artificial Intelligence (AREA)
  • Biochemistry (AREA)
  • General Engineering & Computer Science (AREA)
  • Measuring Or Testing Involving Enzymes Or Micro-Organisms (AREA)

Abstract

L'invention a pour objet un procédé de prédiction individuelle pour le dépistage ou le diagnostic ou la prise en charge thérapeutique ou le pronostic du cancer de la prostate comportant le recueil de données individuelles (xi) d'entrée et la fourniture d'une information prédictive de risque (y) liée à un type de maladie, caractérisé en ce que les données d'entrée comportent au moins une variable ou une combinaison de variables type génétique telles que l'identification de marqueurs de polymorphismes génétiques considérés comme étant liés au développement de la maladie. L'invention a aussi pour objet un dispositif de prédiction individuelle pour le dépistage ou le diagnostic ou la prise en charge thérapeutique ou le pronostic du cancer de la prostate comportant des premiers moyens de saisie de données d'information individuelles par un utilisateur, au moins une première interface logicielle sur laquelle opère lesdits premiers moyens caractérisé en ce qu'il comporte en outre un logiciel mettant en œuvre le procédé de l'invention et fournissant une information prédictive de risque lié à une maladie.

Description

Procédé de prédiction pour le dépistage, le pronostic, le diagnostic ou la réponse thérapeutique du cancer de la prostate et dispositif permettant la mise en œuvre du procédé.
Le domaine de l'invention est celui des méthodes de prédiction individuelle pour le dépistage, le diagnostic, le pronostic, la réponse thérapeutique de maladies et les effets secondaires des médicaments dans le cas de maladies complexes et multifactohelles telles que des cancers et notamment le cancer de la prostate. La présente invention propose un procédé et un outil conduisant à évaluer la susceptibilité individuelle à l'apparition de cancer et plus particulièrement de cancer de la prostate, pour instaurer un dépistage ou un diagnostic précoce et ce, en associant de nombreuses données d'entrée cliniques et/ou génétiques associées de manière complexe. Aujourd'hui il existe des formes de cancers et notamment le cancer de la prostate fortement répandues chez l'homme dans les pays industrialisés et dont l'incidence a augmenté de manière importante ces dernières années.
Le diagnostic et les traitements proposés nécessitent la mise en œuvre de procédures invasives et coûteuses. Les méthodes actuelles développées pour déterminer les populations à risque ou les stratégies de prise en charge proposent des valeurs prédictives positives ou négatives (cancer/non cancer) en fonction de tests (marqueurs tumoraux, signatures moléculaires ...) ou de résultats obtenus à partir de fonctions linéaires de type nomogrammes, mais leur fiabilité est inférieure à 80% et les résultats sont rarement reproductibles à l'échelle individuelle. Actuellement, il est proposé d'évaluer un risque de cancer de la prostate par dosage sanguin de l'antigène prostatique spécifique (PSA) qui est le marqueur de référence pour décider d'une procédure invasive de type biopsie pour la confirmation histologique d'un cancer de la prostate, typiquement en cas de détection d'un taux mesuré supérieur à 4 ng/ml voire 2,5 ng/ml dans certains protocoles. Au-delà de 4 ng/ml de taux sanguin de PSA la sensibilité est de 30%, ce qui signifie que parmi les personnes qui ont un taux de PSA total supérieur à 4 ng/ml, de l'ordre de seulement 3 sur 10 ont un cancer de la prostate.
Au seuil de 4 ng/ml la spécificité du test PSA est de l'ordre de 80%, ce qui signifie que lorsque le seuil de PSA est inférieur à 4 ng/ml, l'absence de cancer de la prostate est réelle dans 8 cas sur 10.
Des outils d'évaluation du risque de type nomogrammes intégrant plusieurs paramètres ont été développés pour répondre aux questions individuelles et notamment décrit dans la revue [S. F. Shariat, P. I. Karakiewicz, C. G. Roehrborn and M. W. Kattan An updated catalog of prostate cancer prédictive tools Cancer (113) p3075-992008].
Les nomogrammes sont des outils statistiques destinés à la prise de décision, qui contiennent de l'information provenant de centaines d'observations concrètes sur des cas prouvés de cancer de la prostate. Ces outils aident les patients et les médecins à la prise de décision. Ils fournissent des prévisions calculées à partir de données cliniques variées issues de cancers de la prostate précédemment traités. Il s'agit de règles de calcul ou d'abaques construits sur la base de régressions logistiques multivariées. Ces nomogrammes ont un taux moyen d'exactitude de 80 % ce qui demeure insuffisant. Les patients en tirent cependant d'indéniables avantages parce qu'ils sont dépourvus de la partialité et de la subjectivité que l'on retrouve chez les divers cliniciens et soignants. A titre d'exemple 12 questions et des outils prédictifs associés sont proposés par la Fondation de Recherche Canadienne sur le Cancer de la Prostate. Les solutions existantes utilisées dans ce type d'outils prédictifs reposent la plupart du temps sur le recueil de données cliniques et d'évaluation utilisant des méthodes de modélisation linéaires par rapport aux paramètres. Les méthodes développées sont insuffisantes en terme de fiabilité et ne permettent pas de réaliser des prédictions hiérarchisées comme : risque de cancer, risque de cancer rapidement évolutif, risque de cancer résistant à un traitement, suffisamment fiables.
La prise de décision dans les nouveaux concepts de médecine personnalisée pourrait idéalement tenir compte de caractéristiques propres au patient comme par exemple des données génétiques constitutives ou des antécédents familiaux. Ces données informatives sur la susceptibilité au cancer, modélisées de manière appropriée, permettraient, dans le cas du cancer de la prostate, d'aider patients et spécialistes à décider de la pertinence de l'âge de l'entrée dans un processus de dépistage, du risque de biopsie positive et pourraient même être décisives pour la prise en charge du patient diagnostiqué. En effet, certains marqueurs génétiques sont corrélés avec l'agressivité du cancer de la prostate [O. Cussenot, et coll, Effect of genetic variability within 8q24 on aggressiveness patterns at diagnosis and familial status of prostate cancer, Clin Cancer Res (14) pp5635-9 ; 2008] et peuvent donc aider à décider de la pertinence d'un traitement, typiquement la prostatectomie radicale pour des formes de cancer localisées. La notion de susceptibilité au cancer à laquelle se réfère la présente invention est en fait utilisable dans différentes situations cliniques.
La recherche de marqueurs pertinents représente le premier défi de la médecine prédictive. C'est un défi technologique en génomique mais également en mathématiques. L'étiologie relative aux causes et à l'évolution des cancers de la prostate est complexe et résulte d'interactions stochastiques multiples entre les facteurs génétiques constitutionnels, des facteurs tissulaires acquis et des facteurs environnementaux. La conviction de l'importance des facteurs génétiques dans l'étiologie du cancer de la prostate est née de l'observation des agrégations de cas dans certaines familles [Carter BS Mendelian inheritance of familial prostate cancer, PNAS (89) 3367-7 (1992)]. Des mutations fortement pénétrantes, c'est-à-dire dont la présence signifie une probabilité forte de devenir malade, ont pu être mises en évidence comme celles du gène BRCA1 voir par exemple [J. A. Douglas et coll Common variation in the BRCA 1 gène and prostate cancer risk Cancer Epidemiol Biomarkers Prev (16) pp1510-6 (2007)].
Seulement 5% des cas de cancer de la prostate correspondraient au modèle d'hérédité mendélienne le plus simple [G. Cancel-Tassin and O. Cussenot Prostate cancer genetics Minerva Urol Nefrol (4) p289-300 (2005)] L'exploration d'interactions plus complexes, entre allèles de faible pénétrance, c'est-à-dire dans des modèles ou chaque allèle n'intervient que pour une petite part dans le processus de tumorigenèse a succédé à la recherche de mutation dans des gènes candidats. Ainsi, la recherche de marqueurs génétiques pour une identification exhaustive des points du génome pouvant être impliqués dans la susceptibilité au cancer de la prostate a conduit à la réalisation d'études d'association comme les « génome wide association studies» qui produisent des données de génotypage couvrant au mieux le génome humain pour des polymorphismes de séquence de l'ADN. Ces génotypages produits pour des sujets contrôles et des individus atteints de cancer de la prostate doivent permettre, par comparaison, d'identifier des polymorphismes statistiquement associés avec la pathologie d'intérêt. Pour le cancer de la prostate trois études GWAS font actuellement référence Gudmundsson, J. et coll Genome- wide association study identifies a second prostate cancer susceptibility variant at 8q24 Nat Genêt (39) p 631-7 (2007), Thomas, G. et coll Multiple loci identified in a genome-wide association study of prostate cancer Nat Genêt (40) p 310-5 (2008) et Eeles, R. A. Multiple newly identified loci associated with prostate cancer susceptibility Nat Genêt (40) 316-21 (2008).
Un deuxième défi pour la médecine prédictive consiste à modéliser les associations de variables [D. F. Easton Genome-wide association studies in cancer Hum Mol Genêt (17) R109-15 (2008)], les analyses complexes de combinaisons de variables relevant d'un champ particulier de la recherche en algorithmie.
Dans ce contexte, la présente invention propose un procédé de prédiction individuelle pour le dépistage, ou le diagnostic ou le pronostic ou la réponse thérapeutique de cancer et plus particulièrement bien adapté au cancer de la prostate, basé sur le recueil de très nombreuses données génétiques auxquelles ont peut adjoindre des données cliniques et comportant l'élaboration d'un modèle évolué permettant de délivrer une valeur de risque pouvant avantageusement être soumise de plus à une procédure de validation.
Plus précisément la présente invention a pour objet un procédé de prédiction individuelle pour le dépistage ou le diagnostic ou la prise en charge thérapeutique ou le pronostic du cancer de la prostate comportant le recueil de données individuelles
(X1) d'entrée et la fourniture d'une information prédictive de risque (y) liée à un type de maladie, caractérisé en ce que :
- on recueille des informations représentatives qui sont des informations génétiques et/ou des résultats d'informations cliniques d'un patient pour obtenir lesdites données individuelles ;
- on saisit les données individuelles (x,) à l'aide de moyens de saisie de données ;
- on réalise un outil de prédiction en construisant au moins un modèle par apprentissage statistique, les variables d'entrée de ce modèle étant lesdites informations représentatives ; les informations génétiques d'entrée comportant au moins une variable ou une combinaison de variables parmi les suivantes (toutes les localisations nucléotidiques citées correspondent à celles définies par « UCSC génome browser », assemblage de mars 2006) :
- variable définissant le génotype lié au SNP rs2174183 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 127602673-128447913 du chromosome 4 ; - variable définissant le génotype lié au SNP rs7576160 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 37855761 -38126567 du chromosome 2 ;
- variable définissant le génotype lié au SNP rs2012385 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 241767109- 2421 19399 du chromosome 2 ;
- variable définissant le génotype lié au SNP rs888298 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 6381561 1 -64165896 du chromosome 17 ;
- variable définissant le génotype lié au SNP rs8110935 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 62026584-62294837 du chromosome 19.
- variable définissant le génotype lié au SNP rs2190453 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 17464539-177571 62 du chromosome 1 1 ; - variable définissant le génotype lié au SNP rs2788140 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 210157195-210446272 du chromosome 1 ; - variable définissant le génotype lié au SNP rs3828054 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 149382371 -149874970 du chromosome 1 ;
- variable définissant le génotype lié au SNP rs1499955 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 1 1 6302446-1 1701 1700 du chromosome 3. - variable définissant le génotype lié au SNP rs4855539 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 69049525-69153397 du chromosome 3 ;
- variable définissant le génotype lié au SNP rs11526176 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 27414591 -27808301 du chromosome 7 ;
- variable définissant le génotype lié au SNP rs7934514 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 99092040-99333419 du chromosome 1 1 ;
- variable définissant le génotype lié au SNP rs6681102 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 236815776-236998150 du chromosome 1 ;
- variable définissant le génotype lié au SNP rs6492998 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 38991207-39584443 du chromosome 15. - variable définissant le génotype lié au SNP rs2048873 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 1 13062733-1 1341 1386 du chromosome 2 ;
- variable définissant le génotype lié au SNP rs4669835 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 121 1 1054-12324507 du chromosome 2 ;
- variable définissant le génotype lié au SNP rs12605415 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 23907695-24187878 du chromosome 18 ;
- variable définissant le génotype lié au SNP rs749915 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 39097014-39163238 du chromosome 4 ;
- variable définissant le génotype lié au SNP rs13226041 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 10400281 8-104863625 du chromosome 7 ; - variable définissant le génotype lié au SNP rs721429 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 61335448-62195826 du chromosome 17 ;
- variable définissant le génotype lié au SNP rs2352946 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 84725899-84776802 du chromosome 1 6 ;
- variable définissant le génotype lié au SNP rs9364048 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 70074721 -70679396 du chromosome 6 ;
- variable définissant le génotype lié au SNP rs6755695 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 79446556-79664842 du chromosome 2 ;
- variable définissant le génotype lié au SNP rs1138253 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 4098195-4506560 du chromosome 19 ; - variable définissant le génotype lié au SNP rs1773842 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 29356293-29651 1 17 du chromosome 10 ; - variable définissant le génotype lié au SNP rs10148742 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 43257771 -43665346 du chromosome 14 ;
- variable définissant le génotype lié au SNP rs10245886 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 47461234-47557773 du chromosome 7.
Selon une variante de l'invention, les données d'entrée correspondent à la combinaison d'une variable définissant le génotype lié au SNP rs2174183 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 127602673-128447913 du chromosome 4 et/ou d'une variable définissant le génotype lié au SNP rs7576160 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 37855761 -38126567 du chromosome 2 et/ou d'une variable définissant le génotype lié au SNP rs2012385 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 241767109-2421 19399 du chromosome 2.
Selon une variante de l'invention, les données d'entrée correspondent à la combinaison d'une variable définissant le génotype lié au SNP rs2174183 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 127602673-128447913 du chromosome 4 et/ou d'une variable définissant le génotype lié au SNP rs2190453 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 17464539-17757162 du chromosome 1 1 et/ou d'une variable définissant le génotype lié au SNP rs888298 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 6381561 1 -64165896 du chromosome 17.
Selon une variante de l'invention, les données d'entrée correspondent à la combinaison d'une variable définissant le génotype lié au SNP rs2174183 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 127602673-128447913 du chromosome 4 et/ou d'une variable définissant le génotype lié au SNP rs2788140 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 210157195-210446272 du chromosome 1 et/ou d'une variable définissant le génotype lié au SNP rs7934514 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 99092040-99333419 du chromosome 1 1.
Selon une variante de l'invention, les données d'entrée correspondent à la combinaison d'une variable définissant le génotype lié au SNP rs2174183 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 127602673-128447913 du chromosome 4 et/ou d'une variable définissant le génotype lié au SNP rs3828054 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 149382371 -149874970 du chromosome 1 et/ou d'une variable définissant le génotype lié au SNP rs1499955 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 1 16302446-1 1701 1700 du chromosome 3.
Selon une variante de l'invention, les données d'entrée correspondent à la combinaison d'une variable définissant le génotype lié au SNP rs2174183 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 127602673-128447913 du chromosome 4 et d'une variable définissant le génotype lié au SNP rs81 10935 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 62026584-62294837 du chromosome 19.
Selon une variante de l'invention, les données d'entrée correspondent à la combinaison d'une variable définissant le génotype lié au SNP rs2174183 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 127602673-128447913 du chromosome 4 et d'une variable définissant le génotype lié au SNP rs4855539 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 69049525-69153397 du chromosome 3 et/ou d'une variable définissant le génotype lié au SNP rs4242382 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 128539973-128619555 du chromosome 8.
Selon une variante de l'invention, les données d'entrée correspondent à la combinaison d'une variable définissant le génotype lié au SNP rs6492998 ou à l'un de ses voisins dans l'intervalle 38991207-39584443 du chromosome 15 et d'une variable définissant le génotype lié au SNP rs11526176 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 27414591 -27808301 du chromosome 7 et d'une variable définissant le génotype lié au SNP rs6681102 ou à l'un de ses voisins dans l'intervalle 236815776-236998150 du chromosome 1.
Selon une variante de l'invention, les données d'entrée correspondent à la combinaison d'une variable définissant le génotype lié au SNP rs151 1695 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 218280585-218521047 du chromosome 1 et d'une variable définissant le génotype lié au SNP rs4669835 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 121 1 1054-12324507 du chromosome 2 et d'une variable définissant le génotype lié au SNP rs12605415 ou à l'un de ses voisins dans l'intervalle 23907695-24187878 du chromosome 18 Selon une variante de l'invention, les données d'entrée correspondent à la combinaison des quatre variables d'antécédents de cancer, d'une variable de catégorie d'âge, d'une variable définissant le génotype lié au SNP rs4242384 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 128539973-128619555 du chromosome 8 et d'une variable définissant le génotype lié au SNP rs9364048 et/ou à l'un de ses voisins dans l'intervalle 70074721 -70679396 du chromosome 6.
Selon une variante de l'invention, les données d'entrée correspondent à la combinaison d'une variable définissant le génotype lié au SNP rs749915 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 39097014-39163238 du chromosome 4 et d'une variable définissant le génotype lié au SNP rs13226041 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 104002818-104863625 du chromosome 7 et d'une variable définissant le génotype lié au SNP rs721429 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 61335448-62195826 du chromosome 17
Selon une variante de l'invention, les données d'entrée correspondent à la combinaison d'une variable définissant le génotype lié au SNP rs2352946 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 84695541 -84776802 du chromosome 16 et d'une variable définissant le génotype lié au SNP rs6755695 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 79446556-79664842 du chromosome 2 et d'une variable définissant le génotype rs1 138253 lié au SNP ou à l'un ou à plusieurs de ses voisins dans l'intervalle 4276183-4276683 du chromosome 19.
Selon une variante de l'invention, les données d'entrée correspondent à la combinaison d'une variable définissant le génotype lié au SNP rs13148138 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 127602673-128447913 du chromosome 4 et d'une variable définissant le génotype lié au SNP rs1773842 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 29356293-29651 1 17du chromosome 10 et d'une variable définissant le génotype lié au SNP rs10148742 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle rs10148742 du chromosome 14.
Selon une variante de l'invention, les données d'entrée correspondent à la combinaison, d'une variable définissant le génotype lié au SNP rs2174183 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 127602673-128447913 du chromosome 4 et d'une variable définissant le génotype lié au SNP rs1 1526176 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 27414591 -27808301 du chromosome 7.
Selon une variante de l'invention, les données d'entrée correspondent à la combinaison d'une variable définissant le génotype lié au SNP rs2048873 et/ou à l'un de ses voisins dans l'intervalle 1 13062733-1 1341 1386 du chromosome 2 et/ou d'une variable définissant le génotype lié au SNP rs6804627 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 60928379-60979489 du chromosome 3 et d'une variable définissant le génotype lié au SNP rs10245886 et/ou à l'un de ses voisins dans l'intervalle 47461234-47557773 du chromosome 7.
Selon une variante de l'invention, le procédé de prédiction individuelle concerne le dépistage, le diagnostic, le pronostic ou la réponse thérapeutique d'un cancer de la prostate, les données étant de type clinique telles que des données individuelles concernant l'âge du patient, son poids, sa taille, les antécédents personnels et familiaux de cancer, de type biologique avec par exemple le taux de PSA, et de type génétique telles que l'identification de marqueurs de polymorphismes génétiques considérés comme étant liés au développement de la maladie et sélectionnés dans les listes citées précédemment. Selon une variante de l'invention le procédé de l'invention comprend un processus dit d'apprentissage :
- la constitution d'une base de données d'exemples (Bex) constitués de données d'entrées (xm,) et de résultats avérés (ym *) ;
- la construction d'au moins un modèle optimal par apprentissage statistique comportant les étapes suivantes :
• le choix d'une famille (F) de fonctions multivahables (f-i ,..., f,,...fN) ;
• pour une fonction donnée f,, l'élaboration d'un modèle défini par ajustement de paramètres θj tels que l'estimation délivrée par le modèle ym = fi (xmι, θj) soit la plus proche possible de celle du résultat avéré ym * ;
• la comparaison des différentes estimations de manière à définir une fonction f, optimisée flop permettant de définir un modèle optimal ;
- l'exploitation dudit modèle optimal à partir desdites données individuelles (x,) de manière à fournir ladite information prédictive (y) de risque liée à une maladie.
Selon une variante de l'invention, le procédé comprend la construction en parallèle d'un ensemble de modèles optimaux, chaque modèle étant élaboré à partir d'une famille (Fk) de fonctions, l'information prédictive de risque lié à une maladie résultant de l'exploitation de l'ensemble des modèles optimaux. Selon une variante de l'invention, le procédé comprend :
- la création d'une base d'apprentissage (BA) et d'une base de validation (BV) à partir de la base d'exemples ;
- un processus de validation du résultat prédictif (y*) par comparaison entre ledit résultat prédictif obtenu avec un modèle construit avec l'ensemble de données d'entrée appartenant à la base d'apprentissage, et le résultat avéré obtenu à partir d'un ensemble de données d'entrée similaires appartenant à la base de validation.
Selon une variante de l'invention, le procédé comprend pour une base de données comportant N données, la construction de la base d'apprentissage réalisée par le tirage aléatoire (sans remise) de M données appartenant à la base d'exemples, N-M données restantes constituant la base de validation. Selon une variante de l'invention, la famille de fonctions est de type des
MLP (Multi Layer Perceptron), sous-ensemble de la famille des réseaux de neurones ou de type des Support Vector Machines (SVM) ou de type des Relevance Vector Machines (RVM) ou de type des modèles fréquentistes s'apparentant à la méthode des plus proches voisins. Selon une variante de l'invention, l'estimation délivrée par le modèle ym = f,
(Xmi, θj) est comparée au résultat avéré ym * avec une fonction de coût de type score d'entropie croisée dans le cas de la discrimination : -[y *\og(f(x,θ) + (l- y*)\og(l- f(x,θ)] ou de type critère de log vraisemblance notée -log(P(y \ x,θ) ) et correspondant à la probabilité d'obtenir y à partir des paramètres x et θ ou de type écart quadratique dans le cas de la régression : ( f(x,θ) - y*f.
Selon une variante de l'invention, la comparaison entre ledit résultat prédictif obtenu avec un modèle construit avec l'ensemble de données d'entrée appartenant à la base d'apprentissage, et le résultat avéré obtenu à partir d'un ensemble de données d'entrée appartenant à la base de validation est effectuée avec une fonction de coût similaire à celle utilisée dans la comparaison entre l'estimation délivrée par le modèle et le résultat avéré y*.
Selon une variante de l'invention, le résultat final de la modélisation peut être obtenu par fusion de modèles optimaux pouvant être construits à partir de jeux de variables différents et obtenus à partir de familles de fonctions différentes. Dans cette phase de fusion, il est utile de sélectionner les modèles à fusionner ainsi que la méthode de fusion à mettre en œuvre (moyenne des réponses des modèles, produit, vote majoritaire, intégrale de Choquet, intégrale de Sugeno [Ludmila I. Kuncheva, James C. Bezdek, and Robert P. W. Duin. Décision templates for multiple classifier fusion : an expérimental comparison. Pattern Récognition, 34 :299-314, 2001J). En effet, une stratégie qui consisterait à fusionner l'ensemble des modèles optimaux construits n'est généralement pas satisfaisante. Il faut procéder à une sélection d'un sous ensemble optimal de modèles parmi l'ensemble des modèles optimaux construits en ayant recours à des méthodes d'optimisation, comme par exemple les algorithmes génétiques.
Selon une variante de l'invention les données cliniques individuelles correspondent à la combinaison de quatre variables d'antécédents de cancer et d'une variable de catégorie d'âge, lesdites variables d'antécédents concernant respectivement des antécédents familiaux de cancer du sein, des antécédents de cancer de la prostate, des antécédents personnels de cancer, des antécédents familiaux d'autres cancers.
L'invention a aussi pour objet un dispositif de prédiction individuelle pour le dépistage, le diagnostic, le pronostic ou la réponse thérapeutique d'un cancer de la prostate comportant des premiers moyens de saisie de données d'information individuelles par un utilisateur, au moins une première interface logicielle sur laquelle opère les dits premiers moyens caractérisés en ce qu'il comporte en outre un logiciel mettant en œuvre le procédé selon l'invention et fournissant une information prédictive de risque lié au cancer de la prostate.
Selon une variante de l'invention, ladite information prédictive de risque est restituée à l'utilisateur via ladite interface logicielle.
Selon une variante de l'invention, le dispositif comporte en outre des moyens de communication entre les premiers moyens de saisie et le logiciel, permettant la transmission des données d'information et celle de l'information prédictive. Selon une variante de l'invention, le dispositif comporte en outre des seconds moyens de saisie de données d'information individuelles et une seconde interface logicielle, les premiers moyens de saisie concernant la saisie d'informations de type clinique, les seconds moyens concernant la saisie d'informations issues de prélèvement sur l'individu. L'invention sera mieux comprise et d'autres avantages apparaîtront à la lecture de la description qui va suivre donnée à titre non limitatif et grâce aux figures annexées parmi lesquelles :
- la figure 1 illustre un schéma qui résume les interactions entre la base d'exemples, les résultats réels et les résultats prédictifs ;
- la figure 2 illustre une représentation d'un type de réseau de neurones ;
- les figures 3a à 3e illustrent respectivement les performances d'algorithmes de type Multi-Layer Perceptron vis à vis de la discrimination malades atteints de cancers de la prostate des témoins avec en variables d'entrée la catégorie d'âge et respectivement le génotype associé au SNP rs2969612, rs1 167190, rs1314813, rs2174183 et rs1604724;
- la figure 4 illustre un premier exemple d'utilisation dans laquelle l'outil logiciel est implanté chez le praticien ;
- la figure 5 illustre un second exemple d'utilisation dans laquelle l'outil logiciel est centralisé chez un professionnel fournisseur de résultats prédictifs ;
- la figure 6 illustre une comparaison entre les performances obtenues avec un modèle NG1 utilisant les 3 meilleurs SNP, dont le SNP rs4242382, au sens p- value de l'article de Nature Genetics précité et celles obtenues avec un modèle B1 utilisant 3 SNP, dont le SNP rs4242382, identifiés comme synergiques par les méthodes de la demanderesse ;
- la figure 7 illustre une comparaison entre les performances obtenues avec un modèle NEJM construit à partir des variables d'âge et d'antécédents d'une base constituée dans la présente invention et de 5 SNP décrits dans [Zheng SL, Sun J,Wiklund F, et al. Cumulative association of five genetic variants with prostate cancer. NEngl JMed 2008;358:910-9], celles obtenues avec un modèle D2 utilisant des SNP divulgués dans la présente invention et celles obtenues avec un modèle de fusion selon l'invention ;
- la figure 8 illustre une comparaison entre les performances obtenues avec un modèle NEJM construit à partir des variables d'âge et d'antécédents d'une base constituée dans la présente invention et de 5 SNP décrits dans Zheng SL et al, celles obtenues avec un modèle D2 utilisant des SNP divulgués dans la présente invention, lesdits modèles n'utilisant pas de variables d'antécédents ;
- la figure 9 illustre une comparaison entre les performances obtenues avec un modèle NG1 utilisant les 3 meilleurs SNP divulgués dans G. Thomas et al, Multiple loci identifiée! in a genome-wide association study of prostate cancer, Nature Genetics, vol40, num3, march 2008 , celles obtenues avec le modèle D2 et celles obtenues avec un modèle de fusion ; - la figure 10 illustre une comparaison entre les performances obtenues avec le modèle NG1 et celles obtenues avec le modèle D2, lesdits modèles n'utilisant pas de variables d'antécédents ;
- la figure 1 1 illustre une comparaison entre les performances obtenues avec un modèle B2 utilisant 7 SNP sélectionnés selon l'invention et celles obtenues avec un modèle NG2 utilisant les 7 meilleurs SNP au sens p-value de l'article de Nature Genetics précité et les antécédents ;
- la figure 12 illustre les performances en « AUC » des modèles décrits précédemment. L'intérêt de la présente invention réside notamment dans le fait de mettre à la disposition des médecins un outil d'aide à la décision pour une prise en charge personnalisée de leurs patients. Son originalité réside dans l'association d'une base de données exclusive et d'analyses statistiques multidimensionnelles. L'utilisateur peut ainsi bénéficier d'un savoir issu de recherches pluridisciplinaires en médecine, biologie, génétique, mathématiques et de résultats objectifs. L'impact médical de ce système expert est également économique car il permet aux praticiens de mieux détecter les stades précoces et curables de la maladie, de réduire les coûts et les effets secondaires liés aux méthodes diagnostiques et thérapeutiques invasives. Enfin pour le patient, il s'agit d'obtenir une prise en charge optimale de sa pathologie, une diminution du risque de surtraitement, une augmentation de son espérance de vie et une amélioration de sa qualité de vie.
Selon l'invention, l'outil de prédiction est réalisé grâce à la construction en amont de modèles par apprentissage statistique. Nous allons en décrire ci-après le principe de construction. Un modèle, construit dans le cadre de la théorie de l'apprentissage statistique, est généralement une fonction mathématique paramétrée / qui contient des paramètres ajustables θ et appartenant à une famille de fonctions plus large F.
Cette fonction permet de délivrer une estimation y en fonction d'un certain nombre d'entrées x qui sont les variables d'entrées du problème. Dans le cas de la présente invention :
• les entrées x sont les informations génétiques et/ou les résultats codés d'informations cliniques pouvant notamment être issues d'un questionnaire du patient ; lorsque les entrées x sont des variables qualitatives (ou catégorielles), l'encodage de ces variables en valeurs numériques est nécessaire afin de les rendre directement utilisables par les modèles dans le cadre de leur construction et de leur utilisation en tant qu'estimateur. À titre d'exemple, pour l'information sur les antécédents familiaux de cancer de la prostate, l'encodage peut consister à coder la variable qualitative « mon grand père » avec la valeur «1 » qui regroupera tous les parents du second degré. L'encodage ne doit ni masquer, ni brouiller l'information, il doit être pertinent. Dans l'exemple précédent, on peut affiner le codage si l'on souhaite distinguer ou non l'atteinte du grand-père maternel de l'atteinte du grand-père paternel. L'encodage des données peut être inventif, sa qualité (exhaustivité, pertinence) détermine pour partie les possibilités de résolution du problème de discrimination posé. L'encodage n'est pas obligatoirement binaire, le nombre de catégories
(donc de valeurs numériques possibles) dépend du nombre d'états de la variables qualitative. Pour un SNP donné, s'il y a deux allèles A et B dans la population, un individu peut être de génotype AA BB ou AB, l'encodage est ici ternaire. Rajoutons un allèle C dans la population, les combinaisons qui s'ajoutent sont CC CA CB donc un encodage à 6 catégories. • l'estimation y , délivrée par le modèle, est la classe du patient (cancer / pas cancer) ou le risque d'avoir le cancer.
Cette estimation y peut être considérée comme étant une fonction / dépendante des entrées x et des paramètres θ .
Toute la difficulté de la création du modèle réside dans l'ajustement des paramètres θ . Ces paramètres θ sont ajustés dans une phase dite d'apprentissage qui nécessite des exemples et la mise en œuvre d'algorithmes dédiés.
De manière générale, tous les modèles construits par apprentissage statistique nécessitent des exemples. En effet, en tant que système capable d'apprendre, ces modèles mettent en œuvre le principe de l'induction, c'est-à-dire l'apprentissage par l'expérience. La base d'exemples est constituée d'un ensemble de N couples { x , y*) représentatifs du processus étudié que l'on souhaite modéliser.
La variable x est, comme précédemment, une valeur parmi un ensemble de valeurs d'entrées et y* est la sortie réelle associée à ces entrées considérées comme la vérité que l'on souhaite estimer (le diagnostic cancer / pas cancer délivré par un spécialiste par exemple). On représente cette base de données sous la forme d'un tableau de N lignes, où chaque ligne représente un exemple (les valeurs d'entrée pour un individu et sa classe associée). Le but de l'apprentissage est de construire un modèle, à partir de ces N exemples, afin d'estimer in fine la réponse qu'aurait donné le spécialiste sur un nouveau cas jamais rencontré. On parle dans ce cas de capacité de généralisation. Dans la procédure de création de modèles, on choisira celui qui délivrera la meilleure capacité de généralisation.
La représentativité des données est une notion très importante puisqu'elle conditionne la qualité du modèle construit et que l'information que peut apprendre le modèle est contenue dans la base au travers des N exemples. On entend par représentativité le caractère exhaustif des cas contenus dans la base. C'est-à-dire que l'on doit s'assurer que le modèle a rencontré un ensemble de cas similaires à ceux qu'il rencontrera dans son utilisation future en tant qu'estimateur. La phase de constitution de la base d'apprentissage est donc une étape clé et doit être conduite avec beaucoup de rigueur.
Le paragraphe suivant décrit comment l'algorithme d'apprentissage ajuste les paramètres du modèle en fonction des éléments constituant la base d'apprentissage.
La figure 1 illustre un schéma qui résume les interactions entre la base d'exemples Bex, les résultats réels et les résultats prédictifs.
Durant la phase d'apprentissage, l'algorithme modifie les paramètres ajustables θ du modèle pour que l'estimation y soit la plus proche possible de celle du résultat avéré encore dénommé « superviseur » / . Le critère que l'on souhaite donc minimiser en agissant sur les paramètres θ est l'écart entre la réponse du modèle et la réponse du superviseur sur les cas dont on dispose. Cet écart peut s'obtenir de différentes façons suivant le problème traité et est appelé « fonction de coût »:
Typiquement la « fonction de coût » que l'on cherche à minimiser peut être par exemple une des fonctions suivantes :
• le score d'entropie croisée dans le cas de la discrimination (cela revient à estimer l'appartenance à une classe donnée) : - [y* log(/(x,0)) + (1 - /)log(l - f(x,θ))] ;
• le critère de log vraisemblance notée et correspondant à la probabilité d'obtenir y à partir des entrées x et des paramètres θ ;
• l'écart quadratique dans le cas de la régression \ { f{x,θ) - y*)2.
La phase d'apprentissage consiste donc à trouver un jeu de paramètres θ , pour une fonction fi de la famille F de fonctions qui minimise la fonction de coût sur l'ensemble des exemples, à l'aide d'algorithmes d'optimisation.
Cependant, un modèle capable de prédire des informations déjà connues n'a que peu d'intérêt. Il faut s'assurer qu'il est capable de prédire correctement des cas non présents mais représentés dans la base d'apprentissage, et qui suivent les mêmes lois que ceux ayant servi à l'apprentissage. C'est pourquoi la base d'exemple est généralement scindée en une base d'apprentissage BA, pour ajuster les paramètres du modèle, et une base de validation BV encore appelée base de validation, pour tester le modèle choisi et vérifier sa robustesse.
L'important pour les deux ensembles est d'être le plus représentatif possible de la base d'exemples totale d'une part et du problème traité d'autre part. Si la base d'apprentissage ne l'est pas, on risque de ne pas modéliser correctement le phénomène que l'on cherche à modéliser. Si la base de validation ne l'est pas, les scores de validation risquent de donner une fausse idée des performances des modèles, si la base d'exemple n'est pas représentative des cas réels aucune application pratique ne pourra en découler.
Lorsque l'on dispose de suffisamment de données, les deux ensembles (base d'apprentissage et base de validation) sont construits en tirant aléatoirement les éléments de la base d'exemples. Ainsi, sur une base de N éléments, on en sélectionne au hasard M qu'on utilisera pour l'entraînement, et les (N - M) qui restent serviront pour la validation.
Pour que le score de validation ne soit pas dépendant du tirage particulier d'une seule partition de la base totale en base d'apprentissage et base de validation, la procédure est répétée un certain nombre de fois.
Ainsi nous allons décrire plus en détails le processus proposé dans la présente invention.
Dans une première étape on choisit une famille F de fonctions, le choix dépendant du problème posé et de la connaissance a priori que l'on en a.
Typiquement dans le cadre de l'invention, le problème rencontré entre dans la catégorie des problèmes de discrimination, c'est-à-dire que l'on cherche à classer de nouveaux individus en deux groupes : malades ou témoins.
Dans une seconde étape on choisit un type de fonction fi appartenant à la famille F.
Dans une troisième étape, on construit un modèle optimal fi(x,θ) par la procédure d'apprentissage en ajustant les paramètres θ .
On réitère, cette construction de modèle avec n-1 fonctions de manière à tester suffisamment de type de fonctions fufi,...,/« , on compare les qualités respectives de leurs modèles optimaux. Dans une quatrième étape, on sélectionne la fonction fi conduisant au modèle optimal ayant le meilleur score de validation, déterminant ainsi la fonction fi dite qui « généralise le mieux ».
Dans une cinquième étape, on évalue, avec l'ensemble des exemples de la base d'apprentissage, les paramètres θ de la fonction retenue à l'étape précédente. On obtient ainsi le modèle optimal fioP(x,θ) qui à partir de données individuelles d'entrée x sera en mesure de fournir le résultat prédictif y .
Parmi les nombreuses familles de fonctions disponibles, on peut notamment citer les familles :
• des MLP (Multi Layer Perceptron), sous-ensemble de la famille des réseaux de neurones,
• la régression logistique (sous-ensemble de la famille des MLP) ;
• des Support Vector Machines (SVM) ; • des Relevance Vector Machines (RVM) ;
• des modèles fréquentistes s'apparentant à la méthode des plus proches voisins.
La plupart de ces types de fonctions sont notamment décrit dans l'ouvrage de référence "Réseaux de Neurones, Méthodologie et Applications" de G. Dreyfus et al., Editions Eyrolles ou dans "Pattern Récognition and Machine Learning" de CM. Bishop, Springer 2006. Les Relevance Vector Machines sont décrits dans "Sparse Bayesian learning and the relevance vector machine", Tipping, M. E. (2001 ), Journal of Machine Learning Research 1 , 21 1 -244.
Le principal apport des modèles décrits précédemment, par rapport aux modèles déjà utilisés pour évaluer les risques, réside dans la non-linéarité des modèles d'apprentissage statistique. En effet, les modèles généralement employés sont dits linéaires par rapport aux paramètres ce qui induit une plus grande facilité de mise en œuvre au prix généralement d'un plus faible pouvoir prédictif. Dans le cas de modèles précédemment décrits, non linéaires par rapport aux paramètres, la mise en œuvre est plus délicate mais permet :
- d'obtenir, en général, de meilleures performances du modèle ;
- de détecter les synergies entre variables d'entrées.
La possibilité d'exploiter les synergies entre les variables d'entrées est un aspect essentiel du caractère inventif de l'objet de la présente invention. Il constitue l'apport principal de la collaboration des mathématiciens aux découvertes biologiques et médicales dans ces travaux. En effet les outils mathématiques et statistiques à la disposition des médecins et des biologistes ne permettent pas en général de détecter ces synergies.
De plus, ces algorithmes ayant des capacités d'apprentissage élevées, il est très important de pouvoir mesurer leurs performances afin de vérifier qu'ils ne se sur- ajustent pas aux exemples d'entraînement (on parle alors d'apprentissage « par cœur » ou de « sur-apprentissage »). Les méthodologies de l'apprentissage statistique permettent, notamment grâce à l'usage des exemples de validation, de résoudre ce problème et de s'assurer que le modèle obtenu représente un phénomène général et non pas un cas particulier des exemples d'entraînement. Ceci permet de modéliser des phénomènes pour lesquels on a peu ou pas de connaissance a priori.
Selon la présente invention, un modèle est constitué, capable à partir des variables explicatives obtenues, par exemple, à partir des méthodologies de sélection de variables décrites dans la présente invention, de prédire une réponse interprétée comme une probabilité d'être malade ou témoin.
Il convient dans un premier temps de choisir une famille F de fonctions de modèle :
Le présent problème entre dans la catégorie des problèmes de discrimination, c'est-à-dire que l'on cherche à classer de nouveaux individus en deux groupes : malades ou témoins.
De nombreuses familles de fonctions sont adaptées à la résolution de ces problèmes. Certaines sont très simples à mettre en œuvre mais ne permettent pas de tenir compte des synergies entre les variables. Or, on ne sait pas a priori si de telles relations existent ou non. Il convient donc de choisir une famille de fonctions capable d'en tenir compte si elles existent.
Une famille simple à décrire et généralement efficace est celle des Perceptrons Multi-Couches ou MLP (pour Multi Layer Perceptron). Il s'agit d'un type de réseau de neurones que l'on représente généralement selon le schéma illustré en figure 2.
La formule mathématique est de la forme suivante : f (Xf) = L O0 +
Où L est la fonction « Logistique », les S1 sont des fonctions de type
« Sigmoïdes » (comme par exemple la fonction « tangente hyperbolique »), n est le nombre de neurones cachés, p le nombre de variables d'entrée et θ désigne le vecteur de paramètres constitué des composantes 6> et θy pour l ≤ i ≤ n et 1 < j ≤ p .
À noter que l'objet mathématique θ est différent s'il comporte un ou deux indices. θl} désigne l'élément ij de la matrice θ (matrice des paramètres entre les entrées et les neurones cachés) et O1 désigne l'élément i du vecteur de paramètres entre les neurones cachés et la sortie.
Etant donné que le nombre m de variables est dicté par le problème traité, seul le nombre n de neurones cachés peut être choisi dans la phase de modélisation. C'est pourquoi les fonctions composant la famille des MLP pour le problème traité se différencient uniquement par leur nombre de « neurones cachés », chacun d'eux représentant en réalité une fonction Sigmoïde. Par exemple, la fonction représentant le modèle obtenu à partir d'une régression logistique, méthode de modélisation bien connue dans le domaine médical, appartient à cette famille. C'est en effet un cas particulier de MLP n'ayant aucun neurone caché. Dans ce cas, le modèle est linéaire par rapport aux paramètres et la construction du modèle met alors en œuvre des techniques d'apprentissage différentes de celles utilisées dans le cadre des MLP.
Dans une seconde étape il convient de valider des fonctions : Plus un MLP a de neurones cachés, plus il est capable de modéliser des phénomènes complexes. Il a en effet été démontré que toute fonction continue pouvait être approximée par un MLP ayant suffisamment de neurones cachés.
Cependant, dans le cas présent, seule est prise en compte la modélisation de comportements « généraux », et non pas la particularité des individus présents dans la base de données. Il convient donc de trouver un MLP avec un nombre optimal de neurones cachés afin de construire le modèle le plus général possible. Pour cela, on peut décider a priori de tester 5 MLP, chacun ayant de 1 à 5 neurones cachés, construire pour chacun un modèle optimal qui sera évalué sur des données de validation. Le MLP ayant le meilleur pouvoir de généralisation est alors retenu. Dans une troisième étape, on détermine une méthode de validation : Compte tenu du nombre d'exemples à disposition, il est possible de procéder à une simple construction aléatoire des ensembles de validation et d'entraînement.
Cependant, les données contenant beaucoup d'informations inutiles, on ne peut se contenter d'un unique couple entrainement/validation car il y a risque de construire un modèle adapté à un sous-problème, et de le valider sur autre chose. Pour cela, on évalue les modèles par une procédure de validation croisée. Le principe est le suivant :
1 ) On sépare aléatoirement la base d'exemples en cinq sous-ensembles numérotés de 1 à 5.
2) On prend le sous-ensemble 1 comme ensemble de validation, et on construit l'ensemble d'entrainement avec le sous-ensemble composé de l'union des sous-ensembles 2 à 5.
3) On entraine le modèle numéro 1 et on calcul son score de validation numéro 1 .
4) On prend le sous-ensemble 2 comme ensemble de validation, et on construit l'ensemble d'entrainement avec les sous-ensembles 1 , 3, 4 et 5.
5) On entraine le modèle numéro 2 et on calcul son score de validation numéro 2. 6) On poursuit la procédure jusqu'à ce que chaque sous-ensemble ait été utilisé en validation. On a donc cinq scores de validation. Le score de validation final est la moyenne de ces cinq scores.
Grâce à cette procédure, on utilise toutes les données pour calculer le score de validation, ce qui permet d'éviter de se focaliser sur des cas particuliers.
Dans une quatrième étape on procède au choix d'une fonction de coût d'entrainement :
La fonction de coût utilisée pour l'entraînement est en partie dictée par le problème posé (discrimination) et la famille de fonction (MLP). Dans le cas présent on peut avantageusement utiliser l'entropie croisée.
Dans une cinquième étape on procède au choix de la fonction de calcul du score de validation : Le score de validation correspond à une mesure d'évaluation de la qualité du modèle. Ce score peut correspondre à son taux de bonne classification, soit la somme du nombre de malades et de témoins correctement identifiés, divisé par le nombre total d'individus dans la base de validation. Ce score est simple à calculer et facilement interprétable et utilisable, bien qu'il occulte les performances classe par classe (il peut en effet arriver que l'une des classes soit mieux identifiée que l'autre). Ce score peut également être l'AUC (Area Under Curve), c'est-à-dire l'aire sous la courbe ROC (Receiver Operating Caracteristic) comme illustré en figures 3a, 3b, 3c, 3d et 3e.
Ces figures montrent comment évolue la performance de discrimination au voisinage du SNP rs2174183, une courbe ROC a ainsi été établie en le remplaçant par les SNP rs2969612, rs1 167190, rs1314813 ou rs1604724.
L'ensemble des choix précédents étant effectué, la procédure de sélection de la fonction MLP « idéale » peut être lancée. Celle qui permet d'obtenir le meilleur score de validation est sélectionnée pour construire le modèle final.
Dans une sixième étape on procède à la construction du modèle final dit optimal.
Pour le modèle final dit optimal, c'est-à-dire celui qui est effectivement utilisé pour le calcul de risque, on lance une procédure d'entraînement sur la fonction « idéale » identifiée. L'ensemble d'entraînement utilisé est cette fois la totalité de la base d'exemple car aucune validation n'est plus nécessaire.
Selon une variante plus élaborée de l'invention, il est également possible pour différentes familles de fonctions F, d'élaborer un modèle optimal conduisant ainsi à la détermination d'un ensemble de modèles optimaux, destinés à gérer en cours d'utilisation, des données individuelles d'entrée pour fournir un résultat prédictif.
Selon une variante plus élaborée de l'invention, il est également possible pour différentes familles de fonctions F, d'élaborer un modèle optimal résultant d'une fusion de décision d'autres modèles optimaux construits à partir de tout ou partie des variables d'entrées. Cette étape conduisant à une variante plus élaborée de l'invention entre dans le cadre de la septième étape décrite ci-dessous.
Dans une septième étape on procède à la fusion d'informations de modèles optimaux.
La fusion d'informations a pour objectif d'améliorer la prise de décision en terme de robustesse et de fiabilité à partir de la combinaison, via un opérateur mathématique, des décisions ou des scores fournis par la famille de fonctions [I. Bloch. Fusion d'informations numériques : panorama méthodologique. In Journées Nationales de la Recherche en Robotique, Guidel, Morbihan, Octobre 2005]. Ces opérateurs doivent à la fois tirer parti des complémentarités entre les différentes fonctions en entrée de la fusion mais aussi prendre en considération leurs redondances. Les opérateurs de fusion sont nombreux [Ludmila I. Kuncheva, James C. Bezdek, and Robert P. W. Duin. Décision templates for multiple classifier fusion : an expérimental comparison. Pattern Récognition, 34 . -299-314, 2001] et peuvent être basés sur différents formalismes mathématiques tels que la théorie des probabilités, la théorie des fonctions de croyance ou les mesures floues [G.J. KHr and MJ. Wierman. Uncertainty-based information. Eléments of generalized information theory, 2nd édition. Studies in fuzzyness and soft Computing. Physica-Verlag, 1999].
Des algorithmes d'apprentissage statistiques ou automatiques peuvent par ailleurs être utilisés pour une fusion paramétrique mais ils requièrent généralement plus d'informations a priori pour l'estimation de l'opérateur de fusion. Quel que soit le formalisme utilisé, les opérateurs de fusion peuvent prendre la forme de table de règles, de règles de combinaison de type "ET/OU logiques", de produit de scores avec ou sans a priori pouvant être conditionnel ou non comme dans le cas de la fusion basée sur le théorème de Bayes généralisé ou non [Ph. Smets. Beliefs functions: The Disjunctive RuIe of Combination and the Generalized Bayesian Theorem. Int. Jour, of Approximate Reasoning, 9 :1-35, 1993], de distances à des modèles prédéfinis par apprentissage ou expertise, de somme pondérées avec ou sans prise en compte des interactions entre les entrées de la fusion...
Le pouvoir explicatif et l'interprétation des résultats, qui sont des critères importants pour les applications médicales et industrielles, sont généralement beaucoup plus aisés via l'utilisation d'opérateurs spécifiques de fusion au lieu des algorithmes d'apprentissage statistiques ou automatiques.
Ainsi et selon l'invention, lorsque le procédé de prédiction est construit, il est possible de proposer à l'utilisateur, typiquement le médecin ou tout autre entité type laboratoire, la mise à disposition d'un outil d'aide à la décision à la fois impartial, fiable et permettant une utilisation personnalisée à différents stades du parcours du patient, permettant par la même, avec un outil unique, de réaliser des prédictions hiérarchisées, comportant des entrées de type données cliniques et ou données génétiques ledit outil procurant en sortie une information de type évaluation d'un risque ou degré d'avancée de maladie détectée. Avec un tel outil, il devient possible de réaliser une identification précoce et non invasive de risque de développer un cancer de la prostate avec évaluation de la gravité (y compris de cancer en fonction d'exposition professionnelles à des carcinogènes, les variantes génétiques déterminant une plus ou moins grande sensibilité à ces agents).
Il est également possible d'évaluer le risque de récidive des cancers selon le traitement y compris la validation d'essais cliniques pour l'industrie pharmaceutique, sous la forme d'une activité de service de « fouille de données » ou de biostatistique.
Il est également possible d'évaluer les risques de complication de la radiothérapie ou curiethérapie (ou d'exposition aux radiations ionisantes en général), les risques pour d'autres pathologies urologiques (hypertrophie bénigne prostatique, incontinence urinaire).
Travailler sur le génotype de patients permet d'avoir accès à des éléments pouvant être très déterminants dans l'apparition d'une pathologie et facile à collecter. Un simple prélèvement de salive permet en effet de travailler facilement sur l'ADN constitutionnel invariant. Le matériel génétique est informatif car il est susceptible par l'identification du profil génétique de déterminer le risque de développer la maladie mais aussi le risque qu'elle soit agressive.
Exemple d'application installée chez le praticien :
Selon un exemple d'utilisation, l'application est installée chez le praticien qui saisit les informations dont il dispose pour son patient, comme par exemple le taux sanguin de PSA total ou de PSA libre, l'âge, le poids, la taille, les antécédents familiaux et personnels, le résultat d'examens de type toucher rectal et les génotypes d'intérêt. Il sélectionne les questions pertinentes et l'application interroge le ou les différents modèles statistiques à sa disposition. L'outil donne des réponses personnalisées et hiérarchisées avec par exemple pour le cancer de la prostate, le risque de développer un cancer agressif à un âge donné, le risque de développer des métastases ou une récidive de la tumeur après traitement initial (à un âge donné). La figure 4 illustre une telle configuration dans laquelle des données individuelles x, sont saisies par un utilisateur U0 grâce à des premiers moyens au niveau d'une interface 1 , ladite interface assurant la liaison avec le logiciel 2 mettant en œuvre le procédé de l'invention. L'information prédictive y est restituée au niveau de l'interface à l'utilisateur U0, en l'occurrence le praticien. Exemple d'application installée chez un professionnel fournisseur de résultats.
Dans ce cas, les informations de type cliniques sont expédiées par un patient ou par un praticien chez le professionnel fournisseur de résultats, via des réseaux de communication pouvant être de type internet.
En parallèle des informations issues de prélèvements de type sanguin et/ou salivaires analysés en laboratoire sont également expédiées chez le professionnel de résultat prédictif, l'ensemble des informations est traité par le ou les modèles préalablement élaborés de manière à fournir un résultat prédictif, ledit résultat étant réexpédié chez un professionnel de santé qui est ainsi en mesure d'en informer le patient.
La figure 5 schématise ce type de configuration. Un premier utilisateur Ui saisit un certain nombre de données individuelles Xi1 pouvant être de type données cliniques au niveau d'une première interface 10 et les envoie via une liaison à distance de type internet par exemple à un professionnel fournisseur de résultats
FRP, chez qui est installé le logiciel de prédiction 2.
En parallèle, un second utilisateur pouvant être un laboratoire d'analyses envoie un autre flux d'informations issues de prélèvements sanguins ou salivaires X2, et saisies au niveau d'une seconde interface 1 1 et également expédié au fournisseur FRP via une liaison à distance. Après traitement de l'ensemble des données reçues via une interface 12 installée chez le fournisseur FRP, ce dernier expédie le résultat y, à un troisième utilisateur U3 habilité à informer le patient concerné. Typiquement lorsque l'utilisateur Ui est le praticien, il peut n'y avoir que deux utilisateurs Ui et U2.
Par contre si un patient a la possibilité d'adresser directement des informations au professionnel FRP, le résultat y ne pourra pas lui être communiqué directement par
FRP.
Le professionnel fournisseur de résultat peut à tout moment venir enrichir ses bases de données d'exemples par les nouveaux cas traités de manière à fournir des résultats prédictifs plus performants. Pour les soumissions de cas à distance il est prévu une protection des données personnelles de chaque patient, compatible avec les règles de sécurité et d'éthique en usage.
Nous allons décrire ci-après des exemples de combinaisons de données d'entrée ou variables, particulièrement adaptées au calcul de risque de survenue de cancer de la prostate. Une première variable est dénommée «antécédents familiaux de cancer de la prostate» les valeurs de cette variable permettent de définir le contexte familial de survenue du cancer de la prostate d'un patient. Les valeurs affectées à chaque individu dépendent de l'âge et/ou du degré de parenté et/ou du nombre de cas de survenue de cancer de la prostate dans sa famille.
Une deuxième variable est dénommée «antécédents familiaux de cancer du sein» les valeurs de cette variable permettent de définir le contexte familial de survenue de cancer du sein d'un patient. Les valeurs affectées à chaque individu dépendent de l'âge et /ou du degré de parenté et/ou du nombre de cas de survenue de cancers du sein dans sa famille.
Une troisième variable est dénommée «antécédents personnels de cancer» elle permet de distinguer les patients ayant déjà eu un cancer, quel qu'il soit.
Une quatrième variable est dénommée «antécédents familiaux d'autres cancers» les valeurs de cette variable définissent le contexte familial de survenue de cancer (autres que le cancer du sein ou de la prostate) et dépendent de l'âge et/ou du degré de parenté et/ou du nombre de cas de survenue d'autres formes de cancer pour patient donné.
Une cinquième variable est l'âge encodé sous la forme de catégories d'âges. Ces variables sont utilisables en combinaison ou seules comme variables d'entrées d'algorithmes pertinents pour obtenir un calcul de risque de survenue de cancer de la prostate ou déterminer la susceptibilité au cancer de la prostate.
La valeur prédictive de ces variables est renforcée par leur utilisation en combinaison avec des marqueurs de la variabilité biologique individuelle comme par exemple des polymorphismes génétiques ponctuels aussi appelés SNP (Single Nucleotide Polymorphisms). Une propriété essentielle des marqueurs génétiques dont les SNP font partie est leur capacité à être transmis en déséquilibre de liaison avec des marqueurs de leur voisinage défini au sens de la localisation chromosomique. On parle de distance génétique entre deux marqueurs ou SNP. On considère que deux marqueurs sont ainsi génétiquement liés lorsque la fréquence des recombinaisons entre eux est rare. L'existence de ces liaisons génétiques fait que les SNP au voisinage d'un SNP d'intérêt sont susceptibles d'apporter la même information ou une part d'information sur un caractère de susceptibilité. Comme pour chaque SNP, on dispose de la pertinence de différents SNP présents dans son voisinage, on peut obtenir pour chaque SNP d'intérêt majeur, la liste des SNP voisins pouvant apporter de l'information sur la susceptibilité au cancer de la prostate. La définition d'un tel intervalle est d'un intérêt majeur d'un point de vue pratique puisqu'il permet de choisir des marqueurs apportant une information pertinente parmi une liste selon des critères pratiques de disponibilité commerciale des réactifs et expérimentaux par exemple.
La technique habituelle pour choisir comment délimiter des intervalles serait de calculer le déséquilibre de liaison entre un SNP et ses voisins, mais ce n'est pas cette notion qui a été retenue. Nous avons délimité ces intervalles par des calculs de corrélation reposant réellement sur l'observation d'un effet. La limite donnée est celle au-delà de laquelle il n'est plus observé d'effet.
Dans la présente demande, est mentionnée l'utilisation d'un SNP d'intérêt et/ou d'un ou plusieurs de ses voisins. En effet, chacun des SNP génétiquement liés au SNP d'intérêt est susceptible d'apporter tout ou partie de l'information apportée par le SNP d'intérêt. La liaison génétique dépendant de la distance physique entre deux éléments génétiques (en général exprimée en nucléotides) et de la fréquence des recombinaisons entre ces deux éléments. Le SNP d'intérêt peut être lui-même l'agent causal de la susceptibilité que l'on cherche à prédire, il peut également simplement lui être génétiquement lié. Par un effet de transitivité un SNP génétiquement lié au SNP d'intérêt pourra également être génétiquement lié au facteur de susceptibilité causal. Cette possibilité explique la nécessité d'introduire un premier « ou ». Le « et » provient lui aussi de la propriété donnée par les liaisons génétiques. Si le facteur de susceptibilité est positionné entre deux SNP génétiquement liés le fait de connaître chez un individu les allèles présents pour chaque SNP permet de compléter l'information sur la probabilité de présence de l'agent causal d'une susceptibilité. L'ensemble de ces propriétés nous a semblé représenté au mieux par la formulation utilisée dans les revendications.
Parce que les référentiels de positionnement nucléotidiques sont changeants nous avons apporté le plus de précision possible à la description des SNP d'intérêt dans la liste qui suit.
Les SNP sont actuellement les marqueurs génétiques les plus utilisés mais il est évident que chaque SNP peut être remplacé par un marqueur de biologie moléculaire de n'importe quelle nature pour peu que le lien physique ou statistique soit évident pour l'homme de l'art, l'interchangeabilité des variables est mathématiquement très simple à vérifier pourvu que la nouvelle variable soit renseignée pour suffisamment d'individus. Liste des SNP liés à une susceptibilité au cancer de la prostate et intervalles chromosomiques correspondants:
SNP rs2174183 localisé en 4q28.1 sur le chromosome 4 entre les positions 127907634-127908134 suivant la localisation déterminée par l'UCSC génome browser, assemblage de mars 2006.
Séquence génomique au voisinage de rs2174183 : nucléotide polymorphe en gras.
AATAATAGTATATATGAATGTTTGTTTTGGTGATGGGAGGTCAATCAGAT (G/T) GTTCCAGATAACCACTGCCT TCCTACCTTGCCTAAATAGGTATTTCACATATTCTTTCCCTTAAAAACTGACATAggtcaggcacggtggctgac gcctgtaatcccagcactttgggaggccgaggcaggtggatcacttgaggtcgggagtttgagaccagcccgacc aacatggagaaaccccgtctctactaaaaatacaaaattagccaggtgtggtggcacatgcctgtaatcccagct actggggaggctgagacaggagaattgcttgaactcaggaggcagaggttgcagtgagccaagatcaagccattg cactcaagcttgggcaacaagagcaaaactccatctcaagaaacaaaaaaaaaacaagacaaaaCCAAAAGAACC
AATGGTATATTTGCATTTTAATAACTGTATTGAAAAACT
Les SNP voisins du SNP rs2174183 pouvant apporter de l'information sur la susceptibilité au cancer de la prostate sont définis dans une base de données selon le tableau suivant et sont positionnés dans l'intervalle 127602673-128447913 du chromosome 4 ou encore entre les SNP rs12651 126 et rs13122922 sur le chromosome 4:
La pertinence des SNP associés et du SNP d'intérêt pour la discrimination de malades atteints de cancers de la prostate et de témoins peut être démontrée par rétablissement de courbes ROC (correspondant à une variable relative à la sensibilité à un test encore dénommée « Receiver Operating Caracteristic ») comme illustré en figure 5 qui montrent les performances d'algorithmes de type Multi-Layer Perceptron vis-à vis de la discrimination des malades atteints de cancers de la prostate et des témoins en utilisant comme variables d'entrée la catégorie d'âge et le génotype associé au SNP rs2174183 ou à ses voisins. Les SNP intermédiaires non mentionnés sont donc susceptibles d'être porteurs d'information. Les AUC correspondantes {Area Under Curve ou aires sous la courbe ici courbe ROC) sont susceptibles d'être renforcées par l'utilisation des variables d'antécédents en entrée.
SNP rs7576160 localisé en 2p22.2 sur le chromosome 2 entre les positions 37957978-37958478 suivant la localisation déterminée par l'UCSC génome browser, assemblage de mars 2006. Séquence génomique au voisinage de rs7576160 : nucléotide polymorphe en gras.
ATTTTTG(CZT)GTTTTTTTTCCACCAGCTCTTTGTTTTGTTTTTCAATGGCTCAGGAAAGGAGAGGGGTGTGGG TTTATGTAATTC
Les SNP voisins du SNP rs7576160 pouvant apporter de l'information sur la susceptibilité au cancer de la prostate sont définis dans notre base de données selon le tableau suivant et sont positionnés dans l'intervalle 37855761 -38126567 du chromosome 2 ou entre les SNP rs7562836 et rs17021897 du chromosome 2.
SNP rs2012385 localisé en 2q38.1 sur le chromosome 2 entre les positions 242070828 et 242071328 suivant la localisation déterminée par l'UCSC génome browser, assemblage de mars 2006. Séquence génomique au voisinage de rs2012385 : nucléotide polymorphe en gras.
CTGGCGGATGCACTAGCCGGGCTGAGGGTCAGGAATAGCCTTGTGGCCGCTTGTGCTCCTCTGGCTCCT
AAGTATTCAAATTAGCACCAGGAGCAGGTTCGAGAATGGGAGGAGGAAAGGAGGGTTCTCC(CZT)GAGTATTCA
GAAGAAGGTGGTCATATGGATG
Les SNP voisins du SNP rs2012385 pouvant apporter de l'information sur la susceptibilité au cancer de la prostate sont définis dans notre base de données selon le tableau suivant et sont positionnés dans l'intervalle 241767109-2421 19399 du chromosome 2 ou entre les SNP rs1540528 et rs7567892 du chromosome 2.
SNP rs2190453 localisé en 1 1 p15.1 sur le chromosome 1 1 entre les positions 17489723-17490223 suivant la localisation déterminée par l'UCSC génome browser, assemblage de mars 2006. Séquence génomique au voisinage de rs2190453 : nucléotide polymorphe en gras.
TCCAGCTGGTCCTCTGGGAGCACATGGAGAAC (A/G) ACCACATTGTGTCCCAGGGTTGCTTGCCTGGCCTGCAG
ACATCAGACCTCAGGTTTAGGACAGGAAGGCCACTGCTACCTACTGCAGAGTGGGAGACACA Les SNP voisins du SNP rs2190453 pouvant apporter de l'information sur la susceptibilité au cancer de la prostate sont définis dans notre base de données selon le tableau suivant et sont positionnés dans l'intervalle 17464539-17757162 du chromosome 1 1 ou entre les SNP rs12278956 et rs1003921 du chromosome 1 1.
SNP rs888298 localisé en 17q24.2 sur le chromosome 17 entre les positions 63955680 à 63956180 suivant la localisation déterminée par l'UCSC génome browser, assemblage de mars 2006.
Séquence génomique au voisinage de rs888298 : nucléotide polymorphe en gras.
CTTAGAAAAAAGGGATTTGGggccaggtgcggtggctcacacctgtaatccctgcactttgggaggcc gaggtgggtggatcacgaggtcaggagatcgagaacatcctggctaacatggtgaaaccccatctctactaaaaa tacaaaaacattagccgggcgtggtggcaggtgcttgtagtcccagctacttgggagggtgaggcaggagaattg cttgaacacgggaggtagaggttgtggtgagctgagactgcactccagcctgggcaacagagtgagactctatct caaaaaaaaaaaaaaaaaaaaaagataaaaGGGATTTTGGATCCTTATAACACCTTATCCAAATCTTTAACTTTT
AGGACACACTCCCCTTGGGCCTTTATCATTTCCCCAGAGTGGGCAGTCCTCCCGGACACC (A/G) CAGAATCCCT ACCTGGCAAGAGAGGCTGCAGCAGCTGAGTTGCTTAAACC; AGCAAACCCCCAATACTTCCCAGACCTGTTTCAAATCATTC CTTAGATATTGGTTCCAATGAACCGATGCTCATCTTGGTT
Les SNP voisins du SNP rs888298 pouvant apporter de l'information sur la susceptibilité au cancer de la prostate sont définis dans notre base de données selon le tableau suivant et sont positionné dans l'intervalle 6381561 1 -64165896 du chromosome 17:
SNP rs8110935 localisé en 19q13.43 sur le chromosome 19 entre les positions 62239851 -62240351 suivant la localisation déterminée par l'UCSC génome browser, assemblage de mars 2006.
Séquence génomique au voisinage de rs8110935 : nucléotide polymorphe en gras.
CAGAGATCcttctccaaattcatgttgaagtcctaaaccccagtacctcagaatgagattgtattttgagatggg cctttacagaggtaattaaggttaaatgatattatcagggtaggccctaatccaatatggctggtgtccttatag aagaggagattaggacacagacacacacagggggatgaccacgtgaggagaggagggaagacggccaaatacgag ccaagcagagacaccttagcagaaaccaaccctgcccacaccttgatgttgacctgcagcctccagaactgtgaa aattttctgttacatgagccacccagtctgtggtactttattatggctgccagagcagactaagacaGTCACCCA
AAACAAAGAATTATTTAGCATATTAGAAATGGAAAAAAAGTccgggcgcgatggctcatgcaggtaatcccagca cttcgggaggctgaggcaggcagatcacctgaggtcaggagttcgagaccagcctggccaatatggtg (A/C) at ccccgtctagaatatgaagcaggcagaagaacgtgaaaaactagactggcttagcctcccagcccacatctttct cccatgctggatgctccctgccattaaacatcagactccaagttcttcagttttgggactcggactggctctcct tgctcctcagcttgcagatggcctattgtgggaccttgtgatcatgtgagttaatatttaataaactccctaata tatcctatcagttctgtccctctagagaacactgactaatacaCCCAGACTTGCAGAATCACCCTCACCTTCAAC
GACggctccacttcctgaactccccaaatccaacttccacattccatcttcattgctaacaccctggaccagggc actgagatctctaccctacaagaccacggcaccctcctcatggggctccccacctccacaccaggccctgggtcc tccaccttcccaacaggagccagagggagagctttaagtcataaaacagatgatgttgcctctccttgccattcg gacttacaactttccagtggcctccaatgaacctacaatgaaatccaaaatccCCAGCATAAGAGTAT Les SNP voisins du SNP rs8110935 pouvant apporter de l'information sur la susceptibilité au cancer de la prostate sont définis dans notre base de données selon le tableau suivant et sont positionnés dans l'intervalle 62026584-62294837 du chromosome 19 ou entre les SNP rs1860565 et rs1565944 du chromosome 19.
SNP rs2788140 localisé en 1 q32.3 sur le chromosome 1 entre les positions 210171227-210171727 suivant la localisation déterminée par l'UCSC génome browser, assemblage de mars 2006.
Séquence génomique au voisinage de rs2788140 : nucléotide polymorphe en gras.
CCAATACAGTGCACATTCTTCAATATATCATTGAAGATCCTCCACAATTAGACACAGGCCTAGCAGCC AGACCTCTCttttctttttttttttttgagacggagtctcgctctgtcgcccaggctggagtgcagtggcgcagt ctcggctcaccgcaagctccgcctcccgggttcatgccattctcctgcctcagcctcccgagtagctgggactac aggcgcctgccaccacgcccggctaattttttgtatttttagtagagacggggtttcaccgtgttagccaggatg gtctcgatctcctgacctcgtgatctgcccgcctcggcctcccaaagtgctgggattacaggcgtgagccactgc acccggccCAGACCTCTCTTTTCTACGGCCCTCTGTGTGTATCCCAGCCCGCAGTAAAACTGGCACCCTGGGCAT TCCATGAGCTCAGTTTGCACTATCTTACCTTTGTGGCTTTGCTCATATTTTCCCTCT (A/G) TCTGAACACTCTT GGCTATT
Les SNP voisins du SNP rs2788140 pouvant apporter de l'information sur la susceptibilité au cancer de la prostate sont définis dans notre base de données selon le tableau suivant et sont positionnés dans l'intervalle 210157195-210446272 du chromosome 1 ou entre les SNP rs12135924 et rs7546833 du chromosome 1.
SNP rs7934514 localisé en 1 1 q22.1 sur le chromosome 1 1 entre les positions 992141 18-99214618 suivant la localisation déterminée par l'UCSC génome browser, assemblage de mars 2006.
Séquence génomique au voisinage de rs7934514 : nucléotide polymorphe en gras.
tCT (C/T) ACAATTAATATAGGGAGAGGAAAAATGGTTtattagttacctattcctatatttaaaaaatcctcaa aacttagcaatttaaaacaacaatcaagcattttctcttcaagtctgaaatctgagtaccttagctgggaggttc tggctctaggtctttcatgaggctgcagtcatgctgtcagttatagctccattctcatttgaaaactttacaaag ggaggatccacttaacaattcacctatgtgattgttgttaggcctcagtttcttgctgccttttggccaagccag gtatttcagttccttaccatgtcggcctctccacagcctgaaaaaatttcctttggatatgcaatggtcttcttc ttgagggagtgacccacgaggaaagtgtaccccagaaggaagttgcattacttagtattagaagtaatatagtat gccttttgcttttagctagaaataagtcattaagtcaagctgacactcacggggaaagaaattaagctcaactcc ttgaagggagggttatcaaaaaagttgtggacatatcttttaaactaACCCAAGTAGGTTTGGAAAAATTCTTCA
Les SNP voisins du SNP rs7934514 pouvant apporter de l'information sur la susceptibilité au cancer de la prostate sont définis dans notre base de données selon le tableau suivant et sont positionnés dans l'intervalle 99092040-99333419 du chromosome 1 1 ou entre les SNP rs605559 et rs12574821 du chromosome 1 1.
SNP rs3828054 localisé en 1 q21.3 sur le chromosome 1 entre les positions 149779269-149779769 suivant la localisation déterminée par l'UCSC génome browser, assemblage de mars 2006. Séquence génomique au voisinage de rs3828054 : nucléotide polymorphe en gras.
CGCCGCC (CZT ) GGTCCTCTGGGTGCACGTCCACCAGGGTACACCAGTTCCGCGTCCCGTTCATCTTCCCTCGGG
TGGGGCTTGGGA
Les SNP voisins du SNP rs3828054 pouvant apporter de l'information sur la susceptibilité au cancer de la prostate sont définis dans notre base de données selon le tableau suivant et sont positionnés dans l'intervalle 149382371 -149874970 du chromosome 1 ou entre les SNP rs11807526 et rs6702842 du chromosome 1.
SNP rs1499955 localisé en 3q13.31 sur le chromosome 3 entre les positions 116719413-1 16719913 suivant la localisation déterminée par l'UCSC génome browser, assemblage de mars 2006.
Séquence génomique au voisinage de rs1499955 : nucléotide polymorphe en gras. AGTCCCA(GZT)GCAGGCCATTTTTTAGCTGATATTTACTTATTGCAGATTCATACAAGGGTTAAATTAGATAAA
AGTCACTCATTT
Les SNP voisins du SNP rs1499955 pouvant apporter de l'information sur la susceptibilité au cancer de la prostate sont définis dans notre base de données selon le tableau suivant et sont positionnés dans l'intervalle 1 16302446-1 1701 1700 du chromosome 3 ou entre les SNP rs9289008 et rs2289271 du chromosome 3
SNP rs4855539 localisé en 3p14.1 sur le chromosome 3 entre les positions 69108069-69108569 suivant la localisation déterminée par l'UCSC génome browser, assemblage de mars 2006.
Séquence génomique au voisinage de rs4855539 : nucléotide polymorphe en gras.
TCACATG (C/T) AGTTGCTACATTTTAGGAAAACATGATTTAAATATGAAACATGTAATATAAATTAATATAGTG
ATATATCATAAA
Les SNP voisins du SNP rs4855539 pouvant apporter de l'information sur la susceptibilité au cancer de la prostate sont définis dans notre base de données selon le tableau suivant et sont positionnés dans l'intervalle 69049525-69153397 du chromosome 3:
SNP rs4242382 localisé en 8q24.21 sur le chromosome 8 entre les positions 128586505-128587005 suivant la localisation déterminée par l'UCSC génome browser, assemblage de mars 2006. Séquence génomique au voisinage de rs4242382 : nucléotide polymorphe en gras.
AGGGAACATTTTGTCCCTCTAGTTATCTTCCC (A/G) CAGGCCCATCAAGAATCAGGCAGTAGGTGAAAAAGAAA
ATCTTGGCATACATGCGTGGGAAATGGCCTCTCAAGGGGTCATTATCCATTCAATTACACAC
Les SNP voisins du SNP rs4242382 pouvant apporter de l'information sur la susceptibilité au cancer de la prostate sont définis dans notre base de données selon le tableau suivant et sont positionnés dans l'intervalle 128539973-128619555 du chromosome 8 ou entre les SNP rs7830412 et rs4407842 du chromosome 8.
SNP rs11526176 localisé en 7p15.2 sur le chromosome 7 entre les positions 27546048-27546548 suivant la localisation déterminée par l'UCSC génome browser, assemblage de mars 2006.
Séquence génomique au voisinage de rs11526176 : nucléotide polymorphe en gras.
GTACCAATC (C/T) GTCTTCCACTGTTTGCTTTATTTTCAGTGTCTGTATCAGAGAAGGGTCCATGTTGTAAAAG TATTTATAAACTAGTATCTATCTACATATATTTTATGCGTTCACGACATATCTAACTTTTTCTT
Les SNP voisins du SNP rs11526176 pouvant apporter de l'information sur le risque de survenue de cancer de la prostate sont définis dans notre base de données selon le tableau suivant et sont positionnés dans l'intervalle 27414591 - 27808301 du chromosome 7 ou entre les SNP rs1 1761572 et rs2237344.
SNP rs6492998 localisé en 15q15.1 sur le chromosome 15 entre les positions 39,333,673-39,334,173 suivant la localisation déterminée par l'UCSC génome browser, assemblage de mars 2006.
Séquence génomique au voisinage de rs6492998 : nucléotide polymorphe en gras.
AGTCTTAATTTAAAAGTGAGTAGTTATTGTTTCTTGACCTCTGTCAGACA(AZG)GAGGAGCTACATTTTGATGA GATATAAAATTATTACACTAAATGGTCAAG
Les SNP voisins du SNP rs6492998 pouvant apporter de l'information sur la susceptibilité au cancer de la prostate sont définis dans notre base de données selon le tableau suivant et sont positionnés dans l'intervalle 38991207-39584443 du chromosome 15 :
SNP rs6681102 localisé en 1q43 sur le chromosome 1 entre les positions 236,853,987-236,854,487 suivant la localisation déterminée par l'UCSC génome browser, assemblage de mars 2006.
Séquence génomique au voisinage de rs6681102 : nucléotide polymorphe en gras.
TTCAAAGTACATATTTCCTATGTAAAGTCACATGCTGTATAATGACATTTcagtggtcccataagattataatgg agctggaaaattcctattgcctcgtatttacaatactatatttttactgttattttagagtgtaccccgacttat taaaaaaaatcaaacaagttaactataatacagcctcaggctgtcttcacgaggcatccagaagaaggtattgtt atcataggagatgacacctctatgcttgttattgcccctgaataccttccagtgggacaagaggtggaggtggaa aacagtgatattgatgatcctgacttgtgcaggcctaggctaatgtatgtgtctgtgtcttaatttttaccaaag ttttaaaagttaaaaaattgggaaaaagcttattgaataaggatataaagaatatgttttgtacagctctgcgat atgttttaaactacgttattactaaagagtcaaaaagccttaaaaacttaaaaaattattaattaaaaaagttac agtatgctaaggttaatttattattgaagaaaaaattaacaagtttagtattgtctgatttgtaaatgctcataa agtctatagtagtgtatagtaatatcctaggccttcacatacactccccattcactctgactcacccagagcaac ttccagtcctgcaagctccattcatggtaagtgcactgtacaggtgtcccatggctggaaaccatcattctcagc aaactaacacaggaacagaaaaccaaacaccgcatgttctcactcataaatgggagttgcacaatgagaacgcat ggacacaaggaggggaatatcacacactggggcctgtcgtggggtggggggctaggggagggatagcattagaag aaatacctaatgtagatgacgggttaatgggtgcagcaaaccaccatggcacgtgtatacctatgtaacaaacct gcacgttctgcacatgtatcccagaacttaaagtataataaagaaagtaaaaaaaaaaatcttttatactttttt tactgcgccttttctatgtttagatagacacatacttactgttgtgttataactgcctacagtatatagtatagt aacatgctacacaggtttgtagcccaggagcaataggctatactatataggctaggtgtgtggtagactatgata tctaaatttgtacactctatgatgttcacacaatgatggaatcacctaacatttatcaggacgtatccc (c/t) g gtgttaagcaacacatgattTTGTTATACTAACAATTCTCTTAGAGATTATTGGGGAAAAATTTAATAAGATATT
GCGTGTTTTCTTTTGCTATTTAAGAGTGCTCTGTTTGGGAACCCTGACTTATAAACCGTGGTTCTGGCCA
Les SNP voisins du SNP rs6492998 pouvant apporter de l'information sur la susceptibilité au cancer de la prostate sont définis dans notre base de données selon le tableau suivant et sont positionnés dans l'intervalle 236815776-236998150 du chromosome 1 :
SNP rs2048873 localisé en 2q13, sur le chromosome 2 entre les positions chr2:113139055-1 13139555 suivant la numérotation UCSC génome browser, assemblage de mars 2006
Séquence génomique au voisinage de rs2048873 nucléotide polymorphe en gras
TAACGGGCACCCTCtgctaactgacaatactgggcaaatacagatgttetccacgccagtttcatcatgtacaaa atcaggataagatctaccacaaaaggcca(C/T)gaggattaaatgTAGTCTTCTGCAAGACCATTAAACTGACA TTGCTTTCCTTGTACTGAtgtcctttgaacactagtctgaactgcagaatccacttatacacagacttactttca cctctgccatccctgagacagcaagaccaactcctcctttcctcctcagtcaactcaagatgacaaggatgaaaa cctttatgatccatttccactta
Les SNP voisins du SNP rs2048873 pouvant apporter de l'information sur la susceptibilité au cancer de la prostate ou aux cancers hormono-dépendants ou au cancer sont définis dans notre base de données selon le tableau suivant et sont positionnés dans l'intervalle 113062733-1 13411386 du chromosome 2
SNP rs6804627 localisé en 3p14.2, sur le chromosome 3 entre les positions chr3:60963960-60964460 suivant la numérotation UCSC génome browser, assemblage de mars 2006
Séquence génomique au voisinage de rs6804627, nucléotide polymorphe en gras
AGAATTCTGATGATTCTAATATTCA (C/T) TTATAATGTCCATTTAGCTACCACATTGTGTTTATGCCCCTTAAA
ATAGGTAAAAAAGTCCAAAGAGAAGAAAAAATGTTCTTTATTATTTCAAATTAAA
Les SNP voisins du SNP rs6804627 pouvant apporter de l'information sur la susceptibilité au cancer de la prostate ou aux cancers hormono-dépendants ou au cancer sont définis dans notre base de données selon le tableau suivant et sont positionnés dans l'intervalle 60928379-60979489 du chromosome 3
SNP rs10245886 localisé en 7p12.3, sur le chromosome 7 entre les positions chr7:47546720-47547220 suivant la numérotation UCSC génome browser, assemblage de mars 2006
Séquence génomique au voisinage de, nucléotide polymorphe en gras
(GZT ) ACAGGGTGGTGAGCAGGATTGCACAAAGCAGTCACAAGGAAGGAGGCCCCAGTACCGAGCTGGGCTGGAC GTCAT
Les SNP voisins du SNP rs10245886 pouvant apporter de l'information sur la susceptibilité au cancer de la prostate ou aux cancers hormono-dépendants ou au cancer sont définis dans notre base de données selon le tableau suivant et sont positionnés dans l'intervalle 47461234-47557773 du chromosome 7
SNP rs1511695 localisé en 1q41 , sur le chromosome 1 entre les positions 218514703-218515203 suivant la numérotation UCSC génome browser, assemblage de mars 2006.
Séquence génomique au voisinage de rs1511695, nucléotide polymorphe en gras.
TGGAATCATGACTTTGGGGAATTCATGTCACTTTTTTGGGACTTAGTTTCTTGGTTTATAAAATGAA(AZG)AGG
CTAAGGGTCATCCTTGAATTGAAGATTGAGCAGAAGCAAGGGCTATTTACAGTTAttattcaacaaacatttatg gagtgctttttacattaaagatactgtagtaagcacAGTAAGGCAATAAGGACAAGTGATCCAGAGATTCACTAC TTAAAAGCAGACAAACACAAATGCTCTAAGAGCAGAGTGTGATGAGTACC
Les SNP voisins du SNP rs1511695 pouvant apporter de l'information sur la susceptibilité au cancer de la prostate ou aux cancers hormono-dépendants ou au cancer sont définis dans notre base de données selon le tableau suivant et sont positionnés dans l'intervalle 218280585-218521047 du chromosome 1.
SNP rs4669835 localisé en 2p25.1 , sur le chromosome 2 entre les positions 12289824-12290324 suivant la numérotation UCSC génome browser, assemblage de mars 2006. Séquence génomique au voisinage de rs4669835, nucléotide polymorphe en gras
TCCTCGACTTCCTGCTTCATCCTCC (A/G) TGGTCTTTGTTGAAACAAAACTTGAACCAACAGTTCAACAATAAA TATTTTGATGCCAATCCCACTGAAAGTTAAAGTCAAAGCATCTGTTAACCAGATC
Les SNP voisins du SNP rs4669835 pouvant apporter de l'information sur la susceptibilité au cancer de la prostate ou aux cancers hormono-dépendants ou au cancer sont définis dans notre base de données selon le tableau suivant et sont positionnés dans l'intervalle 121 1 1054-12324507 du chromosome 2.
SNP rs12605415 localisé en 18q12.1 sur le chromosome 18 entre les positions 24135069-24135569 suivant la numérotation UCSC génome browser, assemblage de mars 2006.
Séquence génomique au voisinage de rs12605415, nucléotide polymorphe en gras
CAAAATTCAAAACTATAAAACTCCTGGAAGATAACAGGAGAAAATCTGGATACTATTAGGTATAGTGATG(GZT)
ATACAAAATGGTACAGACAGTTTGGAAGACAGTTTGGCAATTTATTATAAGAACAACCACCTCACAAAAG
Les SNP voisins du SNP rs12605415 pouvant apporter de l'information sur la susceptibilité au cancer de la prostate ou aux cancers hormono-dépendants ou au cancer sont définis dans notre base de données selon le tableau suivant et sont positionnés dans l'intervalle 23907695-24187878 du chromosome 18.
SNP rs749915 localisé en 4p14 sur le chromosome 4 entre les positions 39151013- 39151513 suivant la numérotation UCSC génome browser, assemblage de mars 2006.
Séquence génomique au voisinage de rs749915 nucléotide polymorphe en gras
CTGGTGGTAGAACTTAATGTGGAAAGTTAA(CZT)GGCCTAAATGAAACCATGCCCCACAATCTAACTTACCTGC
Les SNP voisins du SNP rs749915 pouvant apporter de l'information sur la susceptibilité au cancer de la prostate ou aux cancers hormono-dépendants ou au cancer sont définis dans notre base de données selon le tableau suivant et sont positionnés dans l'intervalle 39097014-39163238 du chromosome 4.
SNP rs13226041 localisé en 7q22.2 sur le chromosome 7 entre les positions 104851579-104852079 suivant la numérotation UCSC génome browser, assemblage de mars 2006.
Séquence génomique au voisinage de rs13226041 nucléotide polymorphe en gras
AAAaaacagatttaaggtataattgacatacaataagtggtacatcttaagggtgtacaatttgagaactttgga catactattcacctgagaaattgttaacacaaccaagatgatgaacatatccatcacctccaaagttttctcata TTGAttgctttatggtagaatttgctttattgtggtggcctggaattggacctgcaatatetccgaggaatgcct gtatgctgggcaaaaaaagccagacaaaaaagggtatatattctattattctatgtttagaaaattttagaaaag taaactaatctatagtgacaaaaagtagTCagtagatcctatctcaagacaccactttctttgctcatccataag aaggaactcctcatctattcaagtttgatcatgagattgcagaaattcag (C/T) tacatcttatggctcacttT tccttccttcctttctgtctttctttctCTCTCTCTCTCTCTCTCCCCCCCACCCCCCAACtttctttttttcta ttttttttttttttgacagagtctcactctgttgcccaggctggagtgcaatggcgcgatcttggctcactgcaa cctctgcctcctgcgttcaagcaattctcctgcctcagcatctgaagtagctgggattaacaggcgagcaccact atgcctggctcattttttaatttttttttagtagagatggggttcaccatgttggccaggctggtctcgaactcc agacctcaggtgatctgcccgccttggcctcccaaagtgctgggattataggtgtgagccactacacccggccCA GGCTCTACTTCTAATCCTTGTTCTCTCACA
Les SNP voisins du SNP rs13226041 pouvant apporter de l'information sur la susceptibilité au cancer de la prostate ou aux cancers hormono-dépendants ou au cancer sont définis dans notre base de données selon le tableau suivant et sont positionnés dans l'intervalle 104002818-104863625 du chromosome 7.
SNP rs721429 localisé en 17q24.2 sur le chromosome 17 entre les positions 621221 17-62122617 suivant la numérotation UCSC génome browser, assemblage de mars 2006.
Séquence génomique au voisinage de rs721429 nucléotide polymorphe en gras
TGTTTCGTTTTGTGAAATCTGAAGCTT
Les SNP voisins du SNP rs721429 pouvant apporter de l'information sur la susceptibilité au cancer de la prostate ou aux cancers hormono-dépendants ou au cancer sont définis dans notre base de données selon le tableau suivant et sont positionnés dans l'intervalle 61335448-62195826 du chromosome 17.
SNP rs9364048 localisé en 6q13 sur le chromosome 6 entre les positions 70455536- 70456036 suivant la numérotation UCSC génome browser, assemblage de mars 2006. Séquence génomique au voisinage de rs9364048 nucléotide polymorphe en gras
GGTGGGGGTAGATGAGAAAAATAAATGGAGGCGAGAAGGAAAGAAGTTCA(AZG)TCTAAGAATGGAGATTTCAT
AGCTTGGTCAGACATGCATGTCCATACAGAT TGAATTCTTGATTTCTTCCCCATATATTATT AAAAACCTCACTCATCTAGCAAAGCTAAGT
Les SNP voisins du SNP rs9364048 pouvant apporter de l'information sur la susceptibilité au cancer de la prostate ou aux cancers hormono-dépendants ou au cancer sont définis dans notre base de données selon le tableau suivant et sont positionnés dans l'intervalle 70074721 -70679396 du chromosome 6.
SNP rs4242384 localisé en 8q24.21 sur le chromosome 8 entre les positions 128586505-128587005 suivant la numérotation UCSC génome browser, assemblage de mars 2006.
Séquence génomique au voisinage de rs4242384 nucléotide polymorphe en gras
AGTGAATTTTCAAAATCTCACACAGGTCTCCTTAGAGcagagtttctcatctccagcaatattgacatttggagt cagataattatttttgggttggggggtgggcactgatatgttcattgtaggatgtttagcaagatctctggactc tgcacactagataccagtagcacccccatagtggtgacaattaactgtgtccccagacattgccaaatgtatcct ggggagcaaaatcatctccTATTCTCACCTCCTGAGAAAGAAGTGCAGGATATCACAATAGCAGAGGGCAATGGA AGATGACAGTCCCATGCTAGAAGCTGCTTTAC(AZC)AACACAGTCAGCTGCTATCTCCACAACAGGCGGGTGAG GAAGGATTCATGACCCTCAATGAAATGAACAAATGCAAGCAAAGCCAAGTTGCCATTGAATGTGGCAGTTAttgt tttttttttagagagagattgggtctcactgtgttgcccaggctggtctcaaatgtctggcttcaagcaatcctc tcaccttagactcccaaagtgcACTCCGCCCTGCCAGAGTTACTATTTGAATCCAGACATTCTGACTCTGAGGCT GAGACAGTCAGCCTTG
Les SNP voisins du SNP rs4242384 pouvant apporter de l'information sur la susceptibilité au cancer de la prostate ou aux cancers hormono-dépendants ou au cancer sont définis dans notre base de données selon le tableau suivant et sont positionnés dans l'intervalle 128539973-128619555 du chromosome 8.
SNP rs2352946 localisé en 16q24.1 sur le chromosome 16 entre les positions 84758022-84758522suivant la numérotation UCSC génome browser, assemblage de mars 2006.
Séquence génomique au voisinage de rs2352946 nucléotide polymorphe en gras.
GCAGTGATGGGttaaatatggctagacattttcgtcacgtctcccattgagtggcagagttcatttccgctccca ttgaatctagaatagcctgagccttgctttgcccaacgggacatagtagaagtgatgctgtataatgtctgaggc tggggcttaggagagctcggcttcaggttgcagctccacaga (C/T) tccctctcttggagctcagatgcagtgt cgtgagaaccccagtacttgcggtgaggcaatggaaaggaactgaagtgcttctattgatgtctccagccgagct cccagccaacagccagcaccgagtgccagtgtgtgagcaagtcaccagggatgtccagtcaagatgaaccttcag atgaccacagaacccagctgacatctcagggagtaaaactgtccagctgaacctcatcaccccactcaatcatga gaactagttattttttacttaagccactttttttggggggcggtttgtcctgaagcaatagataattaaaacaAG GATTGGGGCCGTTTATGAGA
Les SNP voisins du SNP rs2352946 pouvant apporter de l'information sur la susceptibilité au cancer de la prostate ou aux cancers hormono-dépendants ou au cancer sont définis dans notre base de données selon le tableau suivant et sont positionnés dans l'intervalle 84695541 -84776802 du chromosome 16.
SNP rs6755695 localisé en 2pl2 sur le chromosome 2 entre les positions 79511959- 79512459 suivant la numérotation UCSC génome browser, assemblage de mars 2006. Séquence génomique au voisinage de rs6755695 nucléotide polymorphe en gras.
TTATTTGATATTCTTAAGAATTGCAACTACTTtatgagttagcctaatgcaggtaacactgaggcaggaaaagac cccagagttagtgacatacaacagcaaaggttgattgttgctcatgctgtagatctaatgcagatcagctgtggc tctgctgtgcattgcctttgtcctgaaatctagactaaaagggcaCTTTTGAATACAAAATTGCAAAGGAAAAAG AGACCCAGAAAACTATTCGCTCTTAAAACTTGTCAGACAtgacacgtgttactcctgcccacatttcactgacca aataagttag (A/G) tagtcacttctaagttcagtagggtggaaaaatataatcCTCCTGCAAGGAAGGACAGGG
CTTAAAAGTCAGGCTTTTCGGTGATGCAAATTTTTTTCACCATAGGCCTGTATGTT
Les SNP voisins du SNP rs6755695 pouvant apporter de l'information sur la susceptibilité au cancer de la prostate ou aux cancers hormono-dépendants ou au cancer sont définis dans notre base de données selon le tableau suivant et sont positionnés dans l'intervalle 79446556-79664842 du chromosome 2.
SNP rs1138253 localisé en 19p13.3 sur le chromosome 19 entre les positions
4276183-4276683 suivant la numérotation UCSC génome browser, assemblage de mars 2006
Séquence génomique au voisinage de rs1138253 nucléotide polymorphe en gras
ACCAGGAAGAGAACTACGTGACCCC (C/TJATTGGAGATGGCCCAGCTGTTGACTATGAGAACCAAGATGGTGGG
CTTGGCTCACTGCAAGCTCCGCCTCCTGGGTTCACGCCATTCTCCTGCCTCAGCC
Les SNP voisins du SNP rs1138253 pouvant apporter de l'information sur la susceptibilité au cancer de la prostate ou aux cancers hormono-dépendants ou au cancer sont définis dans notre base de données selon le tableau suivant et sont positionnés dans l'intervalle 4098195-4506560 du chromosome 19.
SNP rs10148742 localisé en 14q21.3 sur le chromosome 14 entre les positions 43356636-43357136 suivant la numérotation UCSC génome browser, assemblage de mars 2006 Séquence génomique au voisinage de rs10148742 nucléotide polymorphe en gras
AACCATCTTAAATTGTCCTCCAGAATTGTTGTATCCATTAATCCGAAATA(AZC)CCTGCATGGAAGGGCCTTTT
TACTATACTTTTTAGTTCATGAATTT
Les SNPs voisins du SNP rs10148742 pouvant apporter de l'information sur la susceptibilité au cancer de la prostate ou aux cancers hormono-dépendants ou au cancer sont définis dans notre base de données selon le tableau suivant et sont positionnés dans l'intervalle 43257771 -43665346 du chromosome 14.
SNP rs1773842 localisé en 10p11.23 sur le chromosome 10 entre les positions
29389042-29389542 suivant la numérotation UCSC génome browser, assemblage de mars 2006
Séquence génomique au voisinage de rs1773842 nucléotide polymorphe en gras
ACTTTTTAAAGCACCATGAAACATGCTCAGAGATGATAGATCATCAATAT(CZT)TCCCCCCCGTTTTAGGATCT
GAGGCAGGAGTATCGCTTGAGCCCGGAAGG
Les SNPs voisins du SNP rs1773842 pouvant apporter de l'information sur la susceptibilité au cancer de la prostate ou aux cancers hormono-dépendants ou au cancer sont définis dans notre base de données selon le tableau suivant et sont positionnés dans l'intervalle 29356293-29651 117 du chromosome 10.
Les variables dites d'antécédents de cancer ainsi que la variable de catégorie d'âge peuvent être combinées aux SNP mentionnés ci-dessus comme variables d'entrée d'algorithmes de type régression logistique MLP SVM RVM ou encore un autre type d'algorithme d'apprentissage statistique. Les classifieurs ainsi obtenus peuvent être utilisables tels quels mais il est encore possible d'optimiser la performance de l'outil en réalisant des méta-classifieurs qui ont été élaborés en fusionnant les classifieurs. Cette opération de fusion est similaire à celle de sélection de variables, étape au cours de laquelle l'optimisation, par rapport à un certain critère de fusion, provient de la recherche de complémentarité entre les classifieurs: Classifieurs ou méta-classifieurs sont ensuite utilisables pour réaliser un calcul de risque de cancer de la prostate.
Parmi toutes les combinaisons possibles de variables d'entrée en plus des données biologiques et cliniques courantes (comme le PSA), il serait possible de ne pas utiliser les antécédents familiaux ou l'âge directement combinés aux SNP et de constituer un méta-classifieur les utilisant dans une deuxième étape, mais elles ont été retenues comme particulièrement pertinentes (toutes les localisations nucléotidiques citées correspondent à celle définie par UCSC génome browser, assemblage de mars 2006) :
- la combinaison des quatre variables d'antécédents de cancer, c'est-à-dire antécédents familiaux de cancer de la prostate, antécédents familiaux de cancer du sein, antécédents personnels de cancer, antécédents familiaux d'autres cancers et d'une variable de catégorie d'âge ; - la combinaison des quatre variables d'antécédents de cancer, d'une variable de catégorie d'âge et d'une variable définissant le génotype lié au SNP rs2174183 ou à l'un de ses voisins dans l'intervalle 127602673-128447913 du chromosome 4;
- la combinaison des quatre variables d'antécédents de cancer, d'une variable de catégorie d'âge, d'une variable définissant le génotype lié au SNP rs2174183 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 127602673- 128447913 du chromosome 4 et/ou d'une variable définissant le génotype lié au SNP rs7576160 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 37855761 - 38126567 du chromosome 2 et/ou d'une variable définissant le génotype lié au SNP rs2012385 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 241767109- 242119399 du chromosome 2.
- la combinaison des quatre variables d'antécédents de cancer, d'une variable de catégorie d'âge, d'une variable définissant le génotype lié au SNP rs2174183 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 127602673- 128447913 du chromosome 4 et/ou d'une variable définissant le génotype lié au SNP rs2190453 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 17464539- 17757162 du chromosome 1 1 et/ou d'une variable définissant le génotype lié au SNP rs888298 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 6381561 1 - 64165896 du chromosome 17. - la combinaison des quatre variables d'antécédents de cancer, d'une variable de catégorie d'âge, d'une variable définissant le génotype lié au SNP rs2174183 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 127602673- 128447913 du chromosome 4 et/ou d'une variable définissant le génotype lié au SNP rs2788140 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 210157195-210446272 du chromosome 1 et/ou d'une variable définissant le génotype lié au SNP rs7934514 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 99092040-99333419 du chromosome 1 1.
- la combinaison des quatre variables d'antécédents de cancer, d'une variable de catégorie d'âge, d'une variable définissant le génotype lié au SNP rs2174183 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 127602673- 128447913 du chromosome 4 et/ou d'une variable définissant le génotype lié au SNP rs3828054 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 149382371 -149874970 du chromosome 1 et/ou d'une variable définissant le génotype lié au SNP rs1499955 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 116302446-117011700 du chromosome 3.
- la combinaison des quatre variables d'antécédents de cancer, d'une variable de catégorie d'âge, d'une variable définissant le génotype lié au SNP rs2352946 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 84695541 - 84776802 du chromosome 16 et d'une variable définissant le génotype lié au SNP rs6755695 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 79446556- 79664842 du chromosome 2 et d'une variable définissant le génotype lié au SNP rs1 138253 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 4098195- 4506560 du chromosome 19.
- la combinaison des quatre variables d'antécédents de cancer, d'une variable de catégorie d'âge, d'une variable définissant le génotype lié au SNP rs2174183 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 127602673- 128447913 du chromosome 4 et d'une variable définissant le génotype lié au SNP rs81 10935 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 62026584- 62294837 du chromosome 19.
- la combinaison des quatre variables d'antécédents de cancer, d'une variable de catégorie d'âge, d'une variable définissant le génotype lié au SNP rs2174183 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 127602673- 128447913 du chromosome 4 et d'une variable définissant le génotype lié au SNP rs4855539 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 69049525- 69153397 du chromosome 3 et d'une variable définissant le génotype lié au SNP rs4242382 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 128539973- 128619555 du chromosome 8.
- la combinaison des quatre variables d'antécédents de cancer, d'une variable de catégorie d'âge, d'une variable définissant le génotype lié au SNP rs2174183 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 127602673- 128447913 du chromosome 4 et d'une variable définissant le génotype lié au SNP rs1 1526176 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 27414591 - 27808301 du chromosome 7.
- la combinaison des quatre variables d'antécédents de cancer, d'une variable de catégorie d'âge, d'une variable définissant le génotype lié au SNP rs6492998 et/ou à l'un de ses voisins dans l'intervalle 38991207-39584443 du chromosome 15 et/ou d'une variable définissant le génotype lié au SNP rs1 1526176 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 27414591 -27808301 du chromosome 7 et/ou d'une variable définissant le génotype lié au SNP rs6681 102 et/ou à l'un de ses voisins dans l'intervalle 236815776-236998150 du chromosome 1 .
- la combinaison des quatre variables d'antécédents de cancer, d'une variable de catégorie d'âge, d'une variable définissant le génotype lié au SNP rs2048873 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 1 13062733- 11341 1386 du chromosome 2 et/ou d'une variable définissant le génotype lié au SNP rs6804627 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 60928379- 60979489 du chromosome 3 et d'une variable définissant le génotype lié au SNP rs10245886 et/ou à l'un de ses voisins dans l'intervalle 47461234-47557773 du chromosome 7.
- la combinaison des quatre variables d'antécédents de cancer, d'une variable de catégorie d'âge, d'une variable définissant le génotype lié au SNP rs1511695 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 218280585- 218521047 du chromosome 1 et d'une variable définissant le génotype lié au SNP rs4669835 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 121 1 1054- 12324507 du chromosome 2 et/ou d'une variable définissant le génotype lié au SNP rs12605415 et/ou à l'un de ses voisins dans l'intervalle 23907695-24187878 du chromosome 18.
- la combinaison des quatre variables d'antécédents de cancer, d'une variable de catégorie d'âge, d'une variable définissant le génotype lié au SNP rs749915 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 39097014- 391 63238 du chromosome 4 et/ou d'une variable définissant le génotype lié au SNP rs13226041 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 104002818- 104863625 du chromosome 7 et/ou d'une variable définissant le génotype lié au SNP rs721429 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 61335448- 62195826 du chromosome 17.
- la combinaison des quatre variables d'antécédents de cancer, d'une variable de catégorie d'âge, d'une variable définissant le génotype lié au SNP rs4242384 et/ou à l'un ou à plusieurs ou à plusieurs de ses voisins dans l'intervalle 128539973-128619555 du chromosome 8 et d'une variable définissant le génotype lié au SNP rs9364048 et/ou à l'un de ses voisins dans l'intervalle 70074721 - 70679396 du chromosome 6.
- la combinaison des quatre variables d'antécédents de cancer, d'une variable de catégorie d'âge, d'une variable définissant le génotype lié au SNP rs2352946 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 84695541 - 84776802 du chromosome 1 6 et d'une variable définissant le génotype lié au SNP rs6755695 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 79446556- 79664842 du chromosome 2 et d'une variable définissant le génotype lié au SNP rs1 138253 et/ou à l'un de ses voisins dans l'intervalle 4098195-4506560 du chromosome 19.
- la combinaison des quatre variables d'antécédents de cancer, d'une variable de catégorie d'âge, d'une variable définissant le génotype lié au SNP rs13148138 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 127602673- 128447913 du chromosome 4 et/ou d'une variable définissant le génotype lié au SNP rs1773842 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 29356293-29651 1 17 du chromosome 10 et d'une variable définissant le génotype lié au SNP rs10148742 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 43257771 -43665346 du chromosome 14. A partir de la liste de SNP présentée il est très possible qu'une information pertinente sur la susceptibilité au cancer du sein et à d'autres formes de cancer soit obtenue sur le principe de la même invention. Il faudrait pour le vérifier réunir une base de données d'exemples de patients et de témoins atteints de la forme de cancer d'intérêt, constituer leurs dossiers médicaux et soit reprendre les combinaisons de variables d'entrées que nous avons données soit relancer un petit processus de sélection de variables pour reformer des petites combinaisons plus spécifiques. Ensuite on pourrait relancer un processus d'apprentissage statistique et de méta-modélisation. Comme les différentes formes de cancer partagent des mécanismes de tumorigenèse il est probable que de l'information pertinente puisse être obtenue de cette manière.
Exemple de procédé selon l'invention mettant en œuyre certaines sélections de SNP et comparaison avec des procédés de prédiction de l'art connu :
Selon un exemple de procédé, la présente invention a été élaborée en deux étapes, l'une visant à choisir les marqueurs génétiques pertinents qui constituent le cœur de l'outil et une deuxième étape consistant à réaliser la modélisation mathématique pouvant les prendre en considération pour établir un calcul de risque. Le procédé de la présente invention a été élaboré à partir des étapes suivantes : avec des données propres au Centre de Recherche pour les Pathologies Prostatiques « CeRePP », établies par le Professeur Cussenot et ses collaborateurs, 1315 individus ayant donné leurs consentements ont été référencés, ils appartiennent à deux catégories distinctes : malades atteints de cancer de la prostate et témoins. Pour limiter l'apparition de biais statistiques les deux catégories d'individus ont été appariées au mieux, l'exemple le plus évident de variable à équilibrer est, par exemple, l'âge.
Comme la probabilité de développer un cancer de la prostate varie avec l'âge, malades et témoins doivent présenter des distributions d'âges les plus proches possibles, sinon l'artefact lié à ce biais statistique sur l'âge peut être indûment exploité par les algorithmes d'apprentissage statistique, en tant que variable discriminante, entraînant une modélisation erronée.
Les dossiers médicaux des patients contiennent le statut vis-à-vis du cancer de la prostate, les antécédents familiaux de cancer de la prostate, les antécédents familiaux de cancer du sein, les antécédents familiaux d'autres cancers et les antécédents personnels de cancer. Les individus considérés ont ensuite été génotypes de manière suffisamment exhaustive pour couvrir l'ensemble du génome. En ce qui concerne l'analyse, la demanderesse a pu disposer des génotypes individuels pour 27188 SNP répartis sur les 24 chromosomes du génome humain. Les 27188 SNP ainsi que les autres variables ont ensuite fait l'objet d'un travail de sélection de variables avec l'utilisation, par exemple :
• des algorithmes génétiques tels que décrits par Krause, Rϋdiger und Tutz, Gerhard (2004) : Variable sélection and discrimination in gène expression data by genetic algorithms. Sonderforschungsbereich 386, Discussion Paper 390 ;
• d'une sélection de variable mettant en œuvre le calcul de l'information mutuelle tel que décrit par A. Kraskov et al, Estimating mutual information, Physical Review, 2004, 66138] et B. V. Bonnlander et al, Selecting Input Variables Using Mutual Information and Nonparametric Density Estimation.
Les algorithmes génétiques appartiennent à la famille des algorithmes évolutionnaires. Leur nom ne vient pas des applications possibles dans le domaine de la génétique mais d'une analogie entre leur fonctionnement et les théories de révolution du vivant. Ils sont généralement utilisés pour résoudre des problèmes d'optimisation. Le principe est de générer une population de solutions potentielles dans l'espace de recherche de solutions. Chaque solution potentielle est évaluée par une fonction, nommée fonction de "fitness", adaptée au problème à traiter. À chaque itération de l'algorithme, de nouvelles solutions potentielles sont générées dans l'espace de recherche en sélectionnant les meilleures solutions de l'itération précédente et en ayant recours à deux autres fonctions que sont les combinaisons et les mutations. Plus précisément on entend par :
• la sélection : une sélection des meilleures solutions opérée via, par exemple, la fonction de fitness. Ce processus est inspiré de celui de la sélection naturelle, seuls les individus les mieux adaptés participent à la reproduction ce qui améliore, de génération en génération, l'adaptation globale de la population.
• la recombinaison : cette opération consiste à mélanger les caractéristiques de deux solutions potentielles retenues dans la phase de sélection. Cette opération correspond à la phase de reproduction qui consiste à créer une nouvelle solution potentielle à partir de deux solutions retenues existantes.
• la mutation : cette opération consiste à changer une partie des caractéristiques d'une solution potentielle de manière aléatoire avec un taux de mutation relativement faible pour ne pas tomber dans une recherche aléatoire. La mutation permet à l'algorithme de ne pas converger prématurément vers un extremum local.
Ces opérations sont inspirées de la théorie de l'évolution afin de faire évoluer la population de solution de manière progressive vers la solution optimale. Ces algorithmes génétiques peuvent donc être utilisés dans la phase de sélection de variables où chaque solution potentielle est un modèle construit à partir d'un jeu de variables. Seuls les jeux de variables permettant d'obtenir les meilleurs modèles sont retenus.
L'information mutuelle est une mesure issue de la théorie de l'information qui consiste à quantifier la dépendance mutuelle de deux variables aléatoires (ou groupes de variables aléatoires).
De manière plus formelle, l'information mutuelle de deux variables aléatoires X et F est définie de la manière suivante:
I(X,Y) = dxdy
où p(χ, y) est la probabilité conjointe de X et F , et où p(x) et p(y) sont respectivement les probabilités marginales de X et de Y . Dans le cadre de variables aléatoires discrètes, les intégrales sont remplacées par la somme de la manière suivante:
L'information mutuelle quantifie la dépendance mutuelle de deux variables aléatoires X , Y ou deux groupes de variables X , F c'est-à-dire, dans quelle mesure la connaissance sur X réduit l'incertitude surF . Ce calcul d'information mutuelle peut donc être utilisé dans le cadre d'une sélection de variables en utilisant cette mesure pour déterminer la dépendance mutuelle entre une variable, ou un groupe de variables (ici les SNP), avec la sortie (le statut).
La première étape du travail effectué par la demanderesse a donc consisté en une sélection de variables ou réduction de dimension.
Elle a ainsi pu isoler des SNP par petits groupes. L'originalité de ces groupes réside dans la complémentarité ou la synergie entre les SNP que les calculs d'algorithmie ont permis de mettre en évidence.
Au-delà des SNP découverts grâce à la mise en œuvre des méthodes décrites dans la présente invention, on peut citer l'exemple du SNP rs4242382 qui a déjà été cité dans la littérature et notamment dans l'article de G. Thomas et al. Multiple loci identifiée! in a genome-wide assocation study of prostate cancer, Nature Genetics, vol40, num3, march 2008. Dans cet article, les SNP sont sélectionnés à partir de leur p-value. Les auteurs ont ainsi identifiés le SNP rs4242382 comme l'a identifié la demanderesse également par ses méthodes. En revanche, lesdites méthodes ont permis d'identifier une synergie entre ce SNP et deux autres SNP parmi les 27188 SNP disponibles dans la base. Ce groupe de 3 SNP est identifié comme le groupe B1. La demanderesse a alors comparé les performances obtenues par les modèles construits à partir du groupe B1 avec les performances des modèles construits à partir des 3 meilleurs SNP, au sens des p-value, de l'article de Nature Genetics. Les résultats sont présentés en figure 6 et plus précisément les courbes 6a et 6b qui sont les courbes ROC relatives au modèle B1 et au modèle de Nature Genetics qui obtiennent respectivement des AUC de 0.601 et 0.556. Ce résultat montre que le groupe B1 , contenant 3 SNP en synergie, dont rs4242382, découverts par la mise en œuvre des méthodes de l'invention, est plus performant que le regroupement des 3 meilleurs SNP disponibles dans l'article de Nature Genetics précité.
Certains des SNP sélectionnés dans la présente invention comme le rs2174183 ne sont pas directement situés dans un gène, la fonction biologique à laquelle il est rattaché est inconnue et pourrait être élucidée avec la connaissance des régulations complexes comme les régulations épigénétiques ou de microRNA, tout à fait nouvelles, qui émergent dans le domaine de la cancérogenèse.
Ces groupes de SNP découverts (chaque groupe contient quelques SNP) en synergie ou non avec des variables dites d'antécédents et d'âge, ont ensuite servi de données d'entrée à la construction de modèles de discrimination malades/témoins par apprentissage statistique.
A ce stade il est possible d'établir la performance de la discrimination par une courbe ROC. À la fin de cette phase de modélisation et de validation, on dispose d'un modèle statistique construit à partir de données d'entrées de type SNP et/ou âge et/ou antécédents et utilisable sur de nouvelles données de mêmes types pour estimer le statut d'un individu lorsque celui-ci n'est pas connu. Les modèles permettent donc de reconnaître un individu à risque de cancer de la prostate suivant certaines performances illustrées par les courbes ROC. On a ainsi pu disposer d'une série de modèles qui ont eux même servi de données d'entrée pour établir un méta-modèle par des techniques dites de fusion.
La résultante est une méthode de discrimination des individus atteints ou non de cancer de la prostate, originale par les méthodes de sélection de variables mises en œuvre, les SNP et les combinaisons qui la constituent, la modélisation puis la méta-modélisation, ou fusion, mise en œuvre et également par l'importance des performances obtenues.
Dans les données d'entrées figurent l'âge des patients et les antécédents familiaux de cancer judicieusement encodés. Nous avons effectivement trouvé des interactions entre ces variables et les SNP que nous avons découverts. S'il était connu que les antécédents contiennent une information hautement prédictive vis-à- vis du risque de cancer de la prostate (et d'ailleurs du risque de cancer en général) c'est l'interaction avec les SNP que nous avons découverts qui constitue la valeur ajoutée de notre travail.
L'invention peut donc être présentée ainsi : • une liste de SNP découverts par un processus de sélection de variables qui, en plus de la sélection pour la valeur prédictive intrinsèque du SNP, permet de garantir la synergie entre les SNP sélectionnés mais peut également permettre de garantir une synergie avec les variables d'antécédents de cancer et des variables cliniques. • Un ou des modèles construits par apprentissage statistique à partir de tout ou partie des variables décrites au point précédent permettant d'estimer le statut pour des individus inconnus.
• Un ou des méta-modèles construits à partir des modèles décrits au point précédent.
La propriété de l'invention est de permettre de discriminer les individus atteints de cancer de la prostate et les sujets sains c'est-à-dire que lorsque les individus sont de statut inconnu, elle permet d'identifier ceux ayant un profil de sujet sain ou atteint, et leur degré de susceptibilité au cancer de la prostate. Pour une utilisation pratique le degré de susceptibilité au cancer de la prostate peut être donné, par exemple, par un calcul de risque à un âge donné, par une courbe de la variation du risque en fonction de l'âge. L'ensemble de l'outil prenant finalement la forme d'une application pratique.
Pour chaque SNP il n'est pas précisé quels sont les allèles à risque, cette connaissance qui est intéressante pour l'étude du mécanisme biologique impliqué, n'est pas indispensable au fonctionnement de l'invention, car c'est finalement une combinaison très complexe de la valeur de chaque variable d'entrée qui peut être associée à un risque particulier. Ainsi dans un groupe contenant trois SNP différents, choisis comme variables d'entrées, chacun peut être représenté par deux allèles différents ce qui représente 3 génotypes différents par SNP et 27 profils génétiques différents en combinant le tout (3 génotypes SNP1 x 3 génotypes SNP2x 3 génotypes SNP3). L'information de risque la plus performante est liée à chaque combinaison particulière parmi 27. Pour une dizaine de combinaisons de SNP répartis sur plusieurs groupes, il faudrait donc expliciter 270 génotypes ce qui n'est pas nécessaire au bon fonctionnement de l'invention et qui n'a pas été nécessaire à sa conception puisqu'il s'agit justement d'apprentissage automatique et que les algorithmes employés établissent et utilisent les règles d'association génotype-risque pertinentes.
Il faut pour utiliser l'invention connaître le profil génétique d'un individu et avoir collecté ses données biologiques. Cela peut être fait actuellement de manière simple par l'homme de l'art. Il faut pour cela effectuer un prélèvement de fluide ou de tissus corporels, en extraire l'ADN par un processus bien connu de l'homme de l'art en biologie moléculaire, établir le génotype de chaque individu pour les SNP d'intérêt par un procédé à choisir parmi les différentes solutions disponibles technologiquement ou commercialement, de manière simple des techniques de génotypage par PCR TaqMan® (Applied Biosystems) ou des techniques de séquençage de l'ADN classiques peuvent être utilisées.
Les résultats obtenus avec le procédé de l'invention sont comparés à ceux obtenus et publiés par Zheng SL, Sun J, Wiklund F, et al. Cumulative association of five genetic variants with prostate cancer. NEngl JMed 2008;358:910-9. L'efficacité de la sélection de SNP mise en oeuvre dans le cadre de l'invention est également comparée à l'efficacité de la sélection mise en œuvre et publiée dans l'article G. Thomas et al, Multiple loci identifiée! in a genome-wide association study of prostate cancer, Nature Genetics, vol40, num3, march 2008.
Dans la suite de la description il est convenu les appellations de modèles suivantes :
NEJM : Modèle construit avec: Age, Atcd, rs4430796, rs1859962, rs1 6901979, rs6983267 et rs1447295, décrit dans Zheng SL, Sun J, Wiklund F, et al. Cumulative association of five genetic variants with prostate cancer. NEngl JMed 2008;358:910-9;
NG1 : Modèle construit avec Age, Atcd, rs4242382, rs10993994, rs6983267 décrit dans G. Thomas ét al, Multiple loci identified in a genome-wide association study of prostate cancer, Nature Genetics, vol40, num3, march 2008 ; - NG2 : Modèle construit avec Age, Atcd, rs4242382, rs10993994, rs6983267, rs4430796, rs10896449, rs496241 6, rs10486567 décrits dans G. Thomas et al, Multiple loci identified in a genome-wide association study of prostate cancer, Nature Genetics, vol40, num3, march 2008 ; - PSA : AUC du test PSA tel qu'il est pratiqué de nos jours décrit dans I. M. Thompson et al, Operating Characteristics of prostate-specific antigen in men with an initial PSA level of 3.0 ng/mL or Lower, JAMA, vol294, num1, 2005 ; D2 : Modèle construit avec Age, Atcd et 3 des SNP sélectionnés par les méthodes de la présente invention ;
B2: Modèle construit avec Age, Atcd et 7 SNP sélectionnés par les méthodes de la présente invention ;
Fusion: Un méta-modèle de fusion de la présente invention.
Dans le premier article, il est question de 5 SNP ayant un lien avec le cancer de la prostate. D'après les auteurs, chaque SNP a un lien modéré mais lorsque les 5 SNP sont combinés, le pouvoir prédictif des modèles est amélioré.
Il s'agit des SNP suivants: rs4430796, rs1859962, rs16901979, rs6983267 et rs1447295.
Les auteurs utilisent l'âge, la région, l'historique familial identifié en antécédents dénommés « Atcd » et les cinq SNP pour construire leurs modèles (identifié comme modèle 3 dans l'article). Ils obtiennent une AUC pour ce modèle de 0.633 (l'intervalle de confiance à 95% étant 0.617 à 0.65).
Le but de la comparaison est de déterminer l'apport d'information lié à l'ajout des SNP décrits dans l'article et l'apport d'information lié à l'ajout des SNP obtenus à partir des méthodes décrites dans la présente invention.
La comparaison se réalise suivant plusieurs étapes :
• Création d'un modèle construit à partir des SNP de l'article: la demanderesse a créé un modèle (nommé modèle NEJM) à partir des 5 SNP de l'article ci-dessus mentionné et les variables d'antécédents et d'âge de sa propre base. La demanderesse a obtenu avec ce modèle NEJM une AUC de 0.636, comme illustré en figure 7, qui se trouve être dans l'intervalle de confiance du modèle 3 de l'article précité.
• Construction d'un modèle fondé sur des SNP obtenus à partir des méthodes de sélection de la présente invention: la demanderesse a créé un modèle à partir de l'un de ses groupes de SNP contenant 3 SNP et les variables d'antécédents et d'âge de sa propre base (identifié comme modèle D2)
• Comparaison des modèles: il est alors possible de comparer, à l'aide de courbes ROC (sensibilité en fonction de la spécificité), la performance du modèle obtenu à partir des SNP de l'article précité (modèle NEJM) avec des modèles fondés sur les propres SNP de la demanderesse (modèle D2 et modèle de fusion).
Les résultats sont présentés en figure 7 et plus précisément les courbes 7a,
7b et 7c sont respectivement les courbes ROC pour les modèles dits NEJM, D2 et Fusion qui obtiennent respectivement des AUC de 0.636, 0.70 et 0.767.
Enfin, la demanderesse a comparé des modèles construits avec les mêmes groupes de SNP (NEJM et D2) sans utiliser les variables d'antécédents afin de mesurer l'apport des seuls SNP.
Les résultats sont présentés en figure 8 et plus précisément, les courbes 8a et 8b étant respectivement les courbes ROC relatives aux modèles NEJM et D2 sans Atcd qui obtiennent respectivement des AUC de 0.568 et 0.614.
II est à noter également que les performances du modèle de la présente invention sont meilleures avec moins de SNP. En effet, le modèle NEJM contient 5 SNP alors que le modèle D2 de la présente invention n'en contient que 3. Cette comparaison permet de conclure que la sélection de SNP décrite dans la présente invention permet de créer des modèles qui obtiennent de meilleures AUC et ont donc une plus grande capacité de discrimination.
La demanderesse a également établie des comparaisons avec les résultats publiés dans l'article de G. Thomas et al, Multiple loci identifiée! in a genome-wide association study of prostate cancer, Nature Genetics, vol40, num3, march 2008.
L'équipe qui a publié cette étude fait partie du consortium CGEMS, c'est-à- dire qu'ils utilisent les mêmes 27188 SNP que ceux présentés dans la présente invention mais sur des populations différentes. Leur stratégie pour détecter les SNP d'intérêt est fondée sur le calcul des p-value (test statistique). Le but de la comparaison est de déterminer l'apport d'information lié à l'ajout des SNP décrits dans l'article et l'apport d'information lié à l'ajout des SNP obtenus à partir des méthodes décrites dans la présente invention.
La comparaison se réalise suivant plusieurs étapes :
• Création d'un modèle fondé sur des SNP de l'article: la demanderesse a créé un modèle (nommé modèle NG1 ) utilisant les variables antécédents et d'âge et les 3 meilleurs SNP, au sens des p-value (les 3 SNP pour lesquels les p-value sont les plus faibles) comme indiqué dans l'article de Nature Genetics précité. Il s'agit des SNP suivants rs4242382, rs10993994 et rs6983267.
• Création d'un modèle fondé sur des SNP obtenus à partir des méthodes de sélection de la présente invention: la demanderesse a créé un modèle à partir de l'un de ses groupes de SNP contenant 3 SNP et les variables d'antécédents et d'âge de sa propre base (identifié comme modèle D2).
• Comparaison des modèles: il est alors possible de comparer, à l'aide de courbes ROC, la performance du modèle obtenu à partir des SNP de l'article précité (modèle NG1 ) avec les modèles fondés sur les propres SNP de la demanderesse (modèle D2 et modèle de fusion).
Les résultats sont présentés en figure 9 et plus précisément les courbes 9a, 9b et 9c sont respectivement les courbes ROC relatives aux modèles NG1 , D2 et Fusion qui obtiennent respectivement des AUC de 0.656, 0.70 et 0.767. Une comparaison avec les mêmes groupes NG1 et D2 a été menée par la demanderesse sans utiliser les variables d'antécédents. Les résultats sont présentés en figure 10 et courbes 10a et 10b respectivement relatives aux modèles NG1 et D2 sans antécédents qui obtiennent respectivement des AUC de 0.556 et 0.614.
Enfin, la demanderesse a réalisé une comparaison du même type à partir des 7 meilleurs SNP de l'article de Nature Genetics. La procédure expérimentale est identique:
• Création d'un modèle fondé sur des SNP de l'article: la demanderesse a créé un modèle (nommé modèle NG2) utilisant les variables antécédents et d'âge et les 7 meilleurs SNP, au sens des p-value comme indiqué dans l'article de Nature Genetics précité. Il s'agit des SNP suivants rs4242382, rs10993994, rs6983267, rs4430796, rs10896449, rs4962416, rs10486567. • Création d'un modèle fondé sur des SNP obtenus à partir des méthodes de sélection de la présente invention: la demanderesse a créé un modèle à partir de 7 SNP obtenus à partir de ses méthodes et les variables d'antécédents et d'âge de sa propre base (identifié comme modèle B2).
• Comparaison des modèles: il est alors possible de comparer, à l'aide de courbes ROC, la performance du modèle obtenu à partir des SNP de l'article précité (modèle NG2) avec le modèle fondé sur les propres SNP de la demanderesse (modèle B2).
Les résultats sont présentés en figure 11 et courbes 11 a et 11 b respectivement relatives aux modèles NG2 et B2 qui obtiennent respectivement les AUC de 0.659 et 0.714.
En conclusion, il apparait que dans tous les cas de figure, les modèles de la présente invention ont de meilleures performances que ceux construits à partir des SNP de l'art connu.
La figure 12 illustre les Performances en AUC des modèles décrits précédemment.

Claims

REVENDICATIONS
1 . Procédé de prédiction individuelle pour le dépistage ou le diagnostic ou la prise en charge thérapeutique ou le pronostic du cancer de la prostate comportant le recueil de données individuelles (x,) d'entrée et la fourniture d'une information prédictive de risque (y) liée à un type de maladie, caractérisé en ce que :
- on recueille des informations représentatives qui sont des informations génétiques et/ou des résultats d'informations cliniques d'un patient pour obtenir lesdites données individuelles ; - on saisit les données individuelles (x,) à l'aide de moyens de saisie de données ;
- on réalise un outil de prédiction en construisant au moins un modèle par apprentissage statistique, les variables d'entrée de ce modèle étant lesdites informations représentatives ; les informations génétiques d'entrée comportant au moins une variable ou une combinaison de variables parmi les suivantes (toutes les localisations nucléotidiques citées correspondent à celles définies par « UCSC génome browser », assemblage de mars 2006) :
- variable définissant le génotype lié au SNP rs2174183 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 127602673-128447913 du chromosome 4 ;
- variable définissant le génotype lié au SNP rs7576160 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 37855761 -38126567 du chromosome 2 ; - variable définissant le génotype lié au SNP rs2012385 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 241767109- 2421 19399 du chromosome 2 ;
- variable définissant le génotype lié au SNP rs888298 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 6381561 1 -641 65896 du chromosome 17 ;
- variable définissant le génotype lié au SNP rs8110935 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 62026584-62294837 du chromosome 19. - variable définissant le génotype lié au SNP rs2190453 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 17464539-177571 62 du chromosome 1 1 ;
- variable définissant le génotype lié au SNP rs2788140 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 210157195-210446272 du chromosome 1 ;
- variable définissant le génotype lié au SNP rs3828054 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 149382371 -149874970 du chromosome 1 ; - variable définissant le génotype lié au SNP rs1499955 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 1 1 6302446-1 1701 1700 du chromosome 3.
- variable définissant le génotype lié au SNP rs4855539 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 69049525-69153397 du chromosome 3 ;
- variable définissant le génotype lié au SNP rs11526176 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 27414591 -27808301 du chromosome 7 ;
- variable définissant le génotype lié au SNP rs7934514 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 99092040-99333419 du chromosome 1 1 ;
- variable définissant le génotype lié au SNP rs6681102 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 236815776-236998150 du chromosome 1 ; - variable définissant le génotype lié au SNP rs6492998 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 38991207-39584443 du chromosome 15.
- variable définissant le génotype lié au SNP rs2048873 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 1 13062733-1 1341 1386 du chromosome 2 ;
- variable définissant le génotype lié au SNP rs4669835 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 121 1 1054-12324507 du chromosome 2 ; - variable définissant le génotype lié au SNP rs12605415 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 23907695-24187878 du chromosome 18 ;
- variable définissant le génotype lié au SNP rs749915 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 39097014-391 63238 du chromosome 4 ;
- variable définissant le génotype lié au SNP rs13226041 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 104002818-104863625 du chromosome 7 ; - variable définissant le génotype lié au SNP rs721429 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 61335448-62195826 du chromosome 17 ;
- variable définissant le génotype lié au SNP rs2352946 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 84725899-84776802 du chromosome 1 6 ;
- variable définissant le génotype lié au SNP rs9364048 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 70074721 -70679396 du chromosome 6 ;
- variable définissant le génotype lié au SNP rs6755695 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 79446556-79664842 du chromosome 2 ;
- variable définissant le génotype lié au SNP rs1138253 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 4098195-4506560 du chromosome 19 ; - variable définissant le génotype lié au SNP rs1773842 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 29356293-29651 1 17 du chromosome 10 ;
- variable définissant le génotype lié au SNP rs10148742 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 43257771 -43665346 du chromosome 14 ;
- variable définissant le génotype lié au SNP rs10245886 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 47461234-47557773 du chromosome 7
2. Procédé de prédiction individuelle pour le dépistage ou le diagnostic ou la prise en charge thérapeutique ou le pronostic du cancer de la prostate selon la revendication 1 , caractérisé en ce que les données d'entrée correspondent à la combinaison d'une variable définissant le génotype lié au SNP rs2174183 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 127602673-128447913 du chromosome 4 et/ou d'une variable définissant le génotype lié au SNP rs7576160 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 37855761 -38126567 du chromosome 2 et/ou d'une variable définissant le génotype lié au SNP rs2012385 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 241767109-2421 19399 du chromosome 2.
3. Procédé de prédiction individuelle pour le dépistage ou le diagnostic ou la prise en charge thérapeutique ou le pronostic du cancer de la prostate selon la revendication 1 , caractérisé en ce que les données d'entrée correspondent à la combinaison d'une variable définissant le génotype lié au SNP rs2174183 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 127602673-128447913 du chromosome 4 et/ou d'une variable définissant le génotype lié au SNP rs2190453 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 17464539-177571 62 du chromosome 1 1 et/ou d'une variable définissant le génotype lié au SNP rs888298 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 6381561 1 -641 65896 du chromosome 17.
4. Procédé de prédiction individuelle pour le dépistage ou le diagnostic ou la prise en charge thérapeutique ou le pronostic du cancer de la prostate selon la revendication 1 , caractérisé en ce que les données d'entrée correspondent à la combinaison d'une variable définissant le génotype lié au SNP rs2174183 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 127602673-128447913 du chromosome 4 et/ou d'une variable définissant le génotype lié au SNP rs2788140 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 210157195-210446272 du chromosome 1 et/ou d'une variable définissant le génotype lié au SNP rs7934514 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 99092040-99333419 du chromosome 1 1 .
5. Procédé de prédiction individuelle pour le dépistage ou le diagnostic ou la prise en charge thérapeutique ou le pronostic du cancer de la prostate selon la revendication 1 , caractérisé en ce que les données d'entrée correspondent à la combinaison d'une variable définissant le génotype lié au SNP rs2174183 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 127602673-128447913 du chromosome 4 et/ou d'une variable définissant le génotype lié au SNP rs3828054 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 149382371 -149874970 du chromosome 1 et/ou d'une variable définissant le génotype lié au SNP rs1499955 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 1 16302446-1 1701 1700 du chromosome 3.
6. Procédé de prédiction individuelle pour le dépistage ou le diagnostic ou la prise en charge thérapeutique ou le pronostic du cancer de la prostate selon la revendication 1 , caractérisé en ce que les données d'entrée correspondent à la combinaison d'une variable définissant le génotype lié au SNP rs2174183 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 127602673-128447913 du chromosome 4 et d'une variable définissant le génotype lié au SNP rs8110935 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 62026584-62294837 du chromosome 19.
7. Procédé de prédiction individuelle pour le dépistage ou le diagnostic ou la prise en charge thérapeutique ou le pronostic du cancer de la prostate selon la revendication 1 , caractérisé en ce que les données d'entrée correspondent à la combinaison d'une variable définissant le génotype lié au SNP rs2174183 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 127602673-128447913 du chromosome 4 et d'une variable définissant le génotype lié au SNP rs4855539 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 69049525-69153397 du chromosome 3 et d'une variable définissant le génotype lié au SNP rs4242382 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 128539973-128619555 du chromosome 8.
8. Procédé de prédiction individuelle pour le dépistage ou le diagnostic ou la prise en charge thérapeutique ou le pronostic du cancer de la prostate selon la revendication 1 , caractérisé en ce que les données d'entrée correspondent à la combinaison d'une variable définissant le génotype lié au SNP rs2174183 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 127602673-128447913 du chromosome 4 et d'une variable définissant le génotype lié au SNP rs11526176 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 27414591 -27808301 du chromosome 7.
9. Procédé de prédiction individuelle pour le dépistage ou le diagnostic ou la prise en charge thérapeutique ou le pronostic du cancer de la prostate selon la revendication 1 , caractérisé en ce que les données d'entrée correspondent à la combinaison d'une variable définissant le génotype lié au SNP rs6492998 et/ou à l'un de ses voisins dans l'intervalle 38991207-39584443 du chromosome 15 et/ou d'une variable définissant le génotype lié au SNP rs11526176 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 27414591 -27808301 du chromosome 7 et/ou d'une variable définissant le génotype lié au SNP rs6681102 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 236815776-236998150 du chromosome 1.
10. Procédé de prédiction individuelle pour le dépistage ou le diagnostic ou la prise en charge thérapeutique ou le pronostic du cancer de la prostate selon la revendication 1 , caractérisé en ce que les données d'entrée correspondent à la combinaison d'une variable définissant le génotype lié au SNP rs2048873 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 1 13062733-11341 1386 du chromosome 2 et/ou d'une variable définissant le génotype lié au SNP rs6804627 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 60928379-60979489 du chromosome 3 et d'une variable définissant le génotype lié au SNP rs10245886 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 47461234-47557773 du chromosome 7.
11. Procédé de prédiction individuelle pour le dépistage ou le diagnostic ou la prise en charge thérapeutique ou le pronostic du cancer de la prostate selon la revendication 1 , caractérisé en ce que les données d'entrée correspondent à la combinaison d'une variable définissant le génotype lié au SNP rs1511695 et à l'un ou à plusieurs de ses voisins dans l'intervalle 218280585-218521047 du chromosome 1 et d'une variable définissant le génotype lié au SNP rs4669835 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 121 1 1054-12324507 du chromosome 2 et/ou d'une variable définissant le génotype lié au SNP rs12605415 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 23907695-24187878 du chromosome 18.
12. Procédé de prédiction individuelle pour le dépistage ou le diagnostic ou la prise en charge thérapeutique ou le pronostic du cancer de la prostate selon la revendication 1 , caractérisé en ce que les données d'entrée correspondent à la combinaison d'une variable définissant le génotype lié au SNP rs749915 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 39097014-39163238 du chromosome 4 et/ou d'une variable définissant le génotype lié au SNP rs13226041 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 104002818-104863625 du chromosome 7 et/ou d'une variable définissant le génotype lié au SNP rs721429 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 61335448-62195826 du chromosome 17.
13. Procédé de prédiction individuelle pour le dépistage ou le diagnostic ou la prise en charge thérapeutique ou le pronostic du cancer de la prostate selon la revendication 1 , caractérisé en ce que les données d'entrée correspondent à la combinaison d'une variable définissant le génotype lié au SNP rs4242384 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 128539973-128619555 du chromosome 8 et d'une variable définissant le génotype lié au SNP rs9364048 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 70074721 -70679396 du chromosome 6.
14. Procédé de prédiction individuelle pour le dépistage ou le diagnostic ou la prise en charge thérapeutique ou le pronostic du cancer de la prostate selon la revendication 1 , caractérisé en ce que les données d'entrée correspondent à la combinaison d'une variable définissant le génotype lié au SNP rs2352946 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 84695541 -84776802 du chromosome 1 6 et d'une variable définissant le génotype lié au SNP rs6755695 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 79446556-79664842 du chromosome 2 et d'une variable définissant le génotype lié au SNP rs1138253 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 4098195-4506560 du chromosome 19.
15. Procédé de prédiction individuelle pour le dépistage ou le diagnostic ou la prise en charge thérapeutique ou le pronostic du cancer de la prostate selon la revendication 1 , caractérisé en ce que les données d'entrée correspondent à la combinaison d'une variable définissant le génotype lié au SNP rs13148138 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 127602673-128447913 du chromosome 4 et/ou d'une variable définissant le génotype lié au SNP rs1773842 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 29356293-29651 1 17 du chromosome 10 et d'une variable définissant le génotype lié au SNP rs10148742 et/ou à l'un ou à plusieurs de ses voisins dans l'intervalle 43257771 -43665346 du chromosome 14.
1 6. Procédé de prédiction individuelle pour le dépistage ou le diagnostic ou la prise en charge thérapeutique ou le pronostic du cancer de la prostate selon une ou plusieurs des revendications 1 à 15, caractérisé en ce que les données d'entrée contiennent également des variables liées à l'âge et à des données cliniques et/ou à des données d'anamnèse personnelles et familiales.
17. Procédé de prédiction individuelle pour le dépistage ou le diagnostic ou la prise en charge thérapeutique ou le pronostic du cancer de la prostate selon la revendication 1 6, caractérisé en ce que les données d'anamnèse incluent la combinaison de quatre variables d'antécédents de cancer et d'une variable de catégorie d'âge, lesdites variables d'antécédents concernant respectivement des antécédents familiaux d'un cancer du sein, des antécédents familiaux de cancer de la prostate, des antécédents personnels de cancer, des antécédents familiaux d'autres cancers.
18. Procédé de prédiction individuelle pour le dépistage ou le diagnostic ou la prise en charge thérapeutique ou le pronostic du cancer de la prostate selon l'une des revendications 1 à 17, caractérisé en ce qu'il comprend :
- la constitution d'une base de données d'exemples (Bex) constitués de données d'entrées (xm,) et de résultats avérés (ym *) ;
- la construction d'au moins un modèle optimal par apprentissage statistique comportant les étapes suivantes : • le choix d'une famille (F) de fonctions multivahables (f-i,..., f,,...fN);
• pour une fonction donnée f,, l'élaboration d'un modèle défini par ajustement de paramètres θj tels que l'estimation délivrée par le modèle ym = f, (x, θj) soit la plus proche possible de celle du résultat avéré ym * ;
• la comparaison des différentes estimations de manière à définir une fonction f, optimisée flop permettant de définir un modèle optimal ;
- l'exploitation dudit modèle optimal à partir desdites données individuelles (x,) de manière à fournir ladite information prédictive (y) de risque liée au cancer de la prostate.
19. Procédé de prédiction individuelle pour le dépistage ou le diagnostic ou la prise en charge thérapeutique ou le pronostic du cancer de la prostate selon la revendication 18, caractérisé en ce qu'il comprend la construction en parallèle d'un ensemble de modèles optimaux, chaque modèle étant élaboré à partir d'une famille (Fk) de fonctions, l'information prédictive de risque lié à une maladie résultant de la fusion de l'ensemble des modèles optimaux.
20. Procédé de prédiction individuelle pour le dépistage ou le diagnostic ou la prise en charge thérapeutique ou le pronostic du cancer de la prostate selon la revendication 19, caractérisé en qu'il comprend la sélection d'un sous-ensemble optimal de modèles optimaux par une méthode d'optimisation de type algorithmique génétique.
21. Procédé de prédiction individuelle pour le dépistage ou le diagnostic ou la prise en charge thérapeutique ou le pronostic du cancer de la prostate selon l'une des revendications 18 à 20, caractérisé en ce que la famille de fonctions est de type des MLP (Multi Layer Perceptron), sous- ensemble de la famille des réseaux de neurones ou de type des Support Vector Machines (SVM) ou de type des Relevence Vector Machines (RVM) ou de type des modèles fréquentistes s'apparentant à la méthode des plus proches voisins.
22. Dispositif de prédiction individuelle pour le dépistage ou le diagnostic ou la prise en charge thérapeutique ou le pronostic du cancer de la prostate comportant des premiers moyens de saisie de données d'information individuelles (1 -18) par un utilisateur, au moins une première interface logicielle sur laquelle opèrent lesdits premiers moyens, caractérisé en ce qu'il comporte en outre des moyens (2) exploitant un logiciel mettant en œuvre le procédé selon l'une des revendications 1 à 21 , et fournissant une information prédictive de risque lié au cancer de la prostate.
23. Dispositif de prédiction individuelle pour le dépistage ou le diagnostic ou la prise en charge thérapeutique ou le pronostic du cancer de la prostate selon la revendication 22, caractérisé en ce que ladite information prédictive de risque est restituée à l'utilisateur via ladite interface logicielle.
24. Dispositif de prédiction individuelle pour le dépistage ou le diagnostic ou la prise en charge thérapeutique ou le pronostic du cancer de la prostate selon la revendication 23, caractérisé en ce qu'il comporte en outre des moyens de communication entre les premiers moyens de saisie et le logiciel , permettant la transmission des données d'information et celle de l'information prédictive.
25. Dispositif de prédiction individuelle pour le dépistage ou le diagnostic ou la prise en charge thérapeutique ou le pronostic du cancer de la prostate selon la revendication 24, caractérisé en ce qu' il comporte en outre des seconds moyens de saisie de données d'information individuelles et une seconde interface logicielle, les premiers moyens de saisie concernant la saisie d'informations de type clinique, les seconds moyens concernant la saisie d'informations issues de prélèvement sur l'individu .
EP09781338A 2008-08-01 2009-07-31 Procede de prediction pour le depistage, le pronostic, le diagnostic ou la reponse therapeutique du cancer de la prostate et dispositif permettant la mise en oeuvre du procede Withdrawn EP2318971A1 (fr)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
FR0804414A FR2934698B1 (fr) 2008-08-01 2008-08-01 Procede de prediction pour le pronostic ou le diagnostic ou la reponse therapeutique d'une maladie et notamment du cancer de la prostate et dispositif permettant la mise en oeuvre du procede.
PCT/EP2009/059930 WO2010012823A1 (fr) 2008-08-01 2009-07-31 Procede de prediction pour le depistage, le pronostic, le diagnostic ou la reponse therapeutique du cancer de la prostate et dispositif permettant la mise en oeuvre du procede

Publications (1)

Publication Number Publication Date
EP2318971A1 true EP2318971A1 (fr) 2011-05-11

Family

ID=40394423

Family Applications (1)

Application Number Title Priority Date Filing Date
EP09781338A Withdrawn EP2318971A1 (fr) 2008-08-01 2009-07-31 Procede de prediction pour le depistage, le pronostic, le diagnostic ou la reponse therapeutique du cancer de la prostate et dispositif permettant la mise en oeuvre du procede

Country Status (6)

Country Link
US (1) US20110301863A1 (fr)
EP (1) EP2318971A1 (fr)
CN (1) CN102171698A (fr)
CA (1) CA2733385A1 (fr)
FR (1) FR2934698B1 (fr)
WO (1) WO2010012823A1 (fr)

Families Citing this family (23)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US9732389B2 (en) 2010-09-03 2017-08-15 Wake Forest University Health Sciences Methods and compositions for correlating genetic markers with prostate cancer risk
US9534256B2 (en) 2011-01-06 2017-01-03 Wake Forest University Health Sciences Methods and compositions for correlating genetic markers with risk of aggressive prostate cancer
US8924325B1 (en) * 2011-02-08 2014-12-30 Lockheed Martin Corporation Computerized target hostility determination and countermeasure
MY193914A (en) * 2012-03-05 2022-11-01 Oy Arctic Partners Ab Methods and apparatuses for predicting risk of prostate cancer and prostate gland volume
US9939533B2 (en) 2012-05-30 2018-04-10 Lucerno Dynamics, Llc System and method for the detection of gamma radiation from a radioactive analyte
US9002438B2 (en) 2012-05-30 2015-04-07 Lucerno Dynamics System for the detection of gamma radiation from a radioactive analyte
CN102994495A (zh) * 2012-11-02 2013-03-27 上海长海医院 一种与前列腺癌易感性相关的单核苷酸多态性位点及其应用
CN102899322A (zh) * 2012-11-02 2013-01-30 复旦大学 一种与前列腺癌易感性相关的单核苷酸多态性位点及其应用
KR20150110477A (ko) * 2012-11-20 2015-10-02 파디아 에이비 공격적인 전립선 암의 존재 또는 부존재를 나타내는 방법
EP2759605B1 (fr) * 2013-01-25 2018-11-14 Signature Diagnostics AG Procédé permettant de prédire une manifestation de mesure d'un résultat d'un patient atteint d'un cancer
WO2015008178A1 (fr) * 2013-07-15 2015-01-22 Koninklijke Philips N.V. Classification de la réponse d'un tissu d'intérêt à un traitement thérapeutique basée sur l'imagerie
AU2015230017B2 (en) 2014-03-11 2021-06-17 A3P Biomedical Ab Method for detecting a solid tumor cancer
US12326453B2 (en) 2014-03-28 2025-06-10 Opko Diagnostics, Llc Compositions and methods for active surveillance of prostate cancer
DK3123381T3 (da) 2014-03-28 2023-11-27 Opko Diagnostics Llc Sammensætninger og fremgangsmåder relateret til diagnose af prostatacancer
JP6312253B2 (ja) * 2014-11-25 2018-04-18 学校法人 岩手医科大学 形質予測モデル作成方法および形質予測方法
WO2016160545A1 (fr) 2015-03-27 2016-10-06 Opko Diagnostics, Llc Standards d'antigènes prostatiques et utilisations
KR20170061222A (ko) * 2015-11-25 2017-06-05 한국전자통신연구원 건강데이터 패턴의 일반화를 통한 건강수치 예측 방법 및 그 장치
US11416622B2 (en) * 2018-08-20 2022-08-16 Veracode, Inc. Open source vulnerability prediction with machine learning ensemble
US12357250B2 (en) 2019-04-02 2025-07-15 Lucerno Dynamics, Llc System and method of using temporal measurements of localized radiation to estimate the magnitude, location, and volume of radioactive material in the body
CN110604550B (zh) * 2019-09-24 2022-06-21 广州医科大学附属肿瘤医院 一种肿瘤放疗后正常组织器官并发症预测模型的建立方法
CN111582370B (zh) * 2020-05-08 2023-04-07 重庆工贸职业技术学院 一种基于粗糙集优化的脑转移瘤预后指标约简及分类方法
CA3250931A1 (fr) * 2022-04-27 2023-11-02 Rhy Genetype Pty Ltd Procédés d'évaluation du risque de développer un cancer de la prostate
CN119274816B (zh) * 2024-09-24 2025-12-26 合肥工业大学 一种针对传染病患者的特征模糊模型构建方法

Family Cites Families (4)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US20070092888A1 (en) * 2003-09-23 2007-04-26 Cornelius Diamond Diagnostic markers of hypertension and methods of use thereof
WO2007109571A2 (fr) * 2006-03-17 2007-09-27 Prometheus Laboratories, Inc. Procédés de prédiction et de suivi de la thérapie par l'inhibiteur de la tyrosine kinase
US7899625B2 (en) * 2006-07-27 2011-03-01 International Business Machines Corporation Method and system for robust classification strategy for cancer detection from mass spectrometry data
GB2444410B (en) * 2006-11-30 2011-08-24 Navigenics Inc Genetic analysis systems and methods

Non-Patent Citations (1)

* Cited by examiner, † Cited by third party
Title
See references of WO2010012823A1 *

Also Published As

Publication number Publication date
FR2934698B1 (fr) 2011-11-18
WO2010012823A1 (fr) 2010-02-04
CN102171698A (zh) 2011-08-31
CA2733385A1 (fr) 2010-02-04
FR2934698A1 (fr) 2010-02-05
US20110301863A1 (en) 2011-12-08

Similar Documents

Publication Publication Date Title
EP2318971A1 (fr) Procede de prediction pour le depistage, le pronostic, le diagnostic ou la reponse therapeutique du cancer de la prostate et dispositif permettant la mise en oeuvre du procede
US20240321389A1 (en) Models for Targeted Sequencing
US12367978B2 (en) Methods and systems for determining somatic mutation clonality
Bang et al. Establishment and evaluation of prediction model for multiple disease classification based on gut microbial data
US20210358626A1 (en) Systems and methods for cancer condition determination using autoencoders
US20240212848A1 (en) Systems and methods for determining whether a subject has a cancer condition using transfer learning
JP2024119880A (ja) 合成トレーニングサンプルによるがん分類
WO2020077232A1 (fr) Procédés et systèmes pour détection et analyse des variants d&#39;acides nucléiques
CN112289455A (zh) 一种人工智能神经网络学习模型构建系统、构建方法
CN116640847A (zh) 癌症进化检测和诊断
Milewski et al. Predicting molecular subtype and survival of rhabdomyosarcoma patients using deep learning of H&E images: a report from the Children's Oncology Group
US20230005569A1 (en) Chromosomal and Sub-Chromosomal Copy Number Variation Detection
US20210102262A1 (en) Systems and methods for diagnosing a disease condition using on-target and off-target sequencing data
Palmal et al. Integrative prognostic modeling for breast cancer: Unveiling optimal multimodal combinations using graph convolutional networks and calibrated random forest
KR20250047282A (ko) 암 분류를 위한 특징으로서의 메틸화-기반 연령 예측
Kobren et al. Joint, multifaceted genomic analysis enables diagnosis of diverse, ultra-rare monogenic presentations
US20200105374A1 (en) Mixture model for targeted sequencing
CN117854722A (zh) 癌症预后预测方法、装置、设备及存储介质
CN113159529A (zh) 一种肠道息肉的风险评估模型及相关系统
Jiya Hybrid Oblique Random Survival Forest for High-Dimensional Survival Data
JP2025524277A (ja) 対象のレビー小体型認知症を同定するための方法
HK40087494A (zh) 使用自动编码器确定癌症状态的系统和方法
FR3151603A1 (fr) Procédé de détection d’une pathologie
JP2025523429A (ja) 無細胞核酸の単一塩基変異を用いたがん診断及びがん種予測方法{Method for diagnosing and predicting cancer type based on single nucleotide variant in cell-free DNA}
WO2021222618A1 (fr) Méthodes et systèmes pour évaluer une maladie fibrotique au moyen d&#39;un apprentissage profond

Legal Events

Date Code Title Description
PUAI Public reference made under article 153(3) epc to a published international application that has entered the european phase

Free format text: ORIGINAL CODE: 0009012

17P Request for examination filed

Effective date: 20110207

AK Designated contracting states

Kind code of ref document: A1

Designated state(s): AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC MK MT NL NO PL PT RO SE SI SK SM TR

AX Request for extension of the european patent

Extension state: AL BA RS

RIN1 Information on inventor provided before grant (corrected)

Inventor name: SUARD, FREDERIC

Inventor name: RAMASSO, EMMANUEL

Inventor name: POLI, JEAN-PHILIPPE

Inventor name: MERCIER, DAVID

Inventor name: GILARDI, NICOLAS

Inventor name: GAZUT, STEPHANE

Inventor name: CUSSENOT, OLIVIER

Inventor name: CANCEL-TASSIN, GERALDINE

Inventor name: MULLER, JEAN-DENIS

Inventor name: AURIBAULT, KARINE

DAX Request for extension of the european patent (deleted)
17Q First examination report despatched

Effective date: 20150527

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE APPLICATION IS DEEMED TO BE WITHDRAWN

18D Application deemed to be withdrawn

Effective date: 20151007