EP1550069A1 - Methode d'analyse des variations de transcription d'un ensemble de genes - Google Patents

Methode d'analyse des variations de transcription d'un ensemble de genes

Info

Publication number
EP1550069A1
EP1550069A1 EP03756043A EP03756043A EP1550069A1 EP 1550069 A1 EP1550069 A1 EP 1550069A1 EP 03756043 A EP03756043 A EP 03756043A EP 03756043 A EP03756043 A EP 03756043A EP 1550069 A1 EP1550069 A1 EP 1550069A1
Authority
EP
European Patent Office
Prior art keywords
gene
genes
value
variation
calibration
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Withdrawn
Application number
EP03756043A
Other languages
German (de)
English (en)
Inventor
Michel Bellis
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Centre National de la Recherche Scientifique CNRS
Original Assignee
Centre National de la Recherche Scientifique CNRS
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Centre National de la Recherche Scientifique CNRS filed Critical Centre National de la Recherche Scientifique CNRS
Publication of EP1550069A1 publication Critical patent/EP1550069A1/fr
Withdrawn legal-status Critical Current

Links

Classifications

    • CCHEMISTRY; METALLURGY
    • C12BIOCHEMISTRY; BEER; SPIRITS; WINE; VINEGAR; MICROBIOLOGY; ENZYMOLOGY; MUTATION OR GENETIC ENGINEERING
    • C12QMEASURING OR TESTING PROCESSES INVOLVING ENZYMES, NUCLEIC ACIDS OR MICROORGANISMS; COMPOSITIONS OR TEST PAPERS THEREFOR; PROCESSES OF PREPARING SUCH COMPOSITIONS; CONDITION-RESPONSIVE CONTROL IN MICROBIOLOGICAL OR ENZYMOLOGICAL PROCESSES
    • C12Q1/00Measuring or testing processes involving enzymes, nucleic acids or microorganisms; Compositions therefor; Processes of preparing such compositions
    • C12Q1/68Measuring or testing processes involving enzymes, nucleic acids or microorganisms; Compositions therefor; Processes of preparing such compositions involving nucleic acids
    • C12Q1/6809Methods for determination or identification of nucleic acids involving differential detection
    • GPHYSICS
    • G16INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
    • G16BBIOINFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR GENETIC OR PROTEIN-RELATED DATA PROCESSING IN COMPUTATIONAL MOLECULAR BIOLOGY
    • G16B25/00ICT specially adapted for hybridisation; ICT specially adapted for gene or protein expression
    • GPHYSICS
    • G16INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
    • G16BBIOINFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR GENETIC OR PROTEIN-RELATED DATA PROCESSING IN COMPUTATIONAL MOLECULAR BIOLOGY
    • G16B25/00ICT specially adapted for hybridisation; ICT specially adapted for gene or protein expression
    • G16B25/10Gene or protein expression profiling; Expression-ratio estimation or normalisation

Definitions

  • the present invention relates to the analysis of variations in m-RNA concentrations of a set of genes carried out using DNA chips.
  • Each DNA molecule is made up of two complementary polynucleotide strands, an "antisense” strand (-) and a “sense” strand (+).
  • Each polynucleotide strand consists of a polymeric chain of nucleotides.
  • Each nucleotide consists of a phosphate, a sugar (deoxyribose) and a base, the bases possibly being a guanine (G), an adenine (A), a cytosine (C) and a thyine (T) .
  • each gene When a cell is active and living, each gene synthesizes RNA-messenger molecules, or mRNA, which are base-to-base copies of the sense (+) strand of the gene. This phenomenon is called transcription or expression of the gene. More precisely, the transcription of a gene is carried out only for certain groups of consecutive bases, or sequences, of the strand of the gene which is expressed, the sense strand (+). L 1 mRNA produced by a gene is in fact a grouping of copies of sequences. Depending on the cell, not all genes are expressed in the same proportions. Thus, • the concentration of mRNA relative to a given gene can be zero, or vary between 1 and 10,000 per cell.
  • a known method for measuring the concentration of mRNA is to use DNA chips.
  • Cells are taken from a culture or from a human body by biopsy. The transcription activity of these cells is then stopped, for example by freezing.
  • a sample is then prepared containing the mRNA extracted from a certain number of cells in solution.
  • a DNA chip is also prepared, an example of which is illustrated in FIG. 1 in order to analyze a set of genes.
  • each gene is analyzed by means of two sets of around twenty hybridization units.
  • a hybridization unit groups together a set of identical DNA strands called probes. These DNA strands are complementary strands of a gene sequence which is found in the mRNA of the cells analyzed. These DNA strands have sequences identical to those of the antisense (-) strand of the gene.
  • a first set of hybridization units, called perfect (UP) contains probes which correspond to different sequences of a gene.
  • a second set of hybridization units contains probes which differ from the probes of the first set for at least one of the bases, each perfect hybridization unit being associated with an imperfect hybridization unit.
  • a perfect hybridization unit 2 contains probes 3, 4, 5, 6 and 7.
  • the perfect hybridization unit 2 is associated with an imperfect hybridization unit 10 which contains probes 11, 12, 13, 14 and 15 which differ by a base (A, G) compared to probes 3 to 7.
  • the messenger RNAs of the previously prepared sample are "labeled", for example rendered fluorescent.
  • the fluorescence of the strands is represented by a cross in a circle attached to the fluorescent strand.
  • the tagged RNA-messengers are called targets.
  • a washing step possibly makes it possible to dissociate the strands which are not very complementary and thus limit the number of false appearances.
  • a photograph is then taken of each of the hybridization units of the DNA chip in order to determine for each hybridization unit a fluorescence intensity. After measuring the fluorescence intensities, two fluorescence intensity values iy and ⁇ J are obtained for each pair of perfect and imperfect hybridization units corresponding to a gene sequence. A fluorescence intensity is calculated for each gene sequence equal to the difference between the fluorescence intensity values i-gp and iui- This method of measuring the fluorescence intensity of each sequence makes it possible to obtain a better signal ratio on noise.
  • the reference cells could be, for example, healthy liver cells and the test cells, diseased liver cells.
  • the same DNA chip models are used, and in both cases the sequence of operations described above is carried out.
  • the study of variations in the concentration of m-RNA for each gene makes it possible to identify which genes have the concentration of m-RNA changed, following a modification of the transcription activity, or a change in the lifespan of mRNAs.
  • the lifespan of mRNA fluctuates among other things as a function of more or less significant protein synthesis activity.
  • the analysis of variations in mRNA concentrations for each of the genes is carried out by calculating the ratio of the mRNA concentrations of the same gene.
  • This method is known as the "fold change" method.
  • the change in m-RNA concentration is considered to be significant when the ratio of RN-m concentrations is above a predetermined threshold. This threshold is identical for all of the genes and this method therefore does not allow the specificity of each of them to be taken into account.
  • the processes of creation and destruction of m-RNA are interrupted randomly during the collection of cells and the concentration of m-RNA may fluctuate slightly from one cell to another. In the case where a gene produces on average 10 mRNA in each cell, a difference of only one
  • MRNA between two cells leads to a ratio of 1.1, or 10% difference, and the gene in question will be considered to have a significant difference in mRNA concentration.
  • a difference of 10 mRNA leads to a ratio of 1.01, or 1% difference, and this will go unnoticed when it can be completely abnormal.
  • the concentration of m-RNA relative to a gene can naturally vary in its own proportions. With a simple fold change analysis, it is impossible to know to what extent the variation in the concentration of m-RNA relative to a gene remains or not within acceptable proportions.
  • One way of knowing the range of natural variation of the mRNA concentration relative to a gene, or more precisely the cumulative distribution of frequencies, would be to carry out a large number of mRNA concentration measurements, for each gene. from identical reference cells. In the case where 100 measurements have been made for each gene, it is possible to define threshold values corresponding to probabilities in increments of 0.01 so that the same discomfort associated with identical cells has a higher concentration of mRNA at these threshold values.
  • Another object of the present invention is to provide such a method which makes it possible to define a threshold value very precisely.
  • the present invention provides a method for analyzing variations in concentrations of messenger RNAs obtained by transcription of a set of genes comprising the following steps: a) measuring the concentration of messenger RNAs for each of the genes in so-called reference cells and report the results on a reference list (L re f); b) measure the concentration of messenger RNA for each of the genes in so-called test cells and report the results on a test list (L ⁇ est) • 'c) calculate for each gene a variation value (Var j ) , k being an integer between 1 and n, which is a measure of the difference between the mRNA concentrations of said gene between the reference list (L re f) and the test list
  • the step of identifying the genes consists in selecting the genes whose normalized variation value is greater than a determined threshold value (Z se ⁇ j _] _).
  • the determination of the threshold value (Z seu j_) comprises the following steps: h) measuring the concentration of m-RNA for each of the genes of two identical groups of so-called calibration cells and report the respective results on first CL> etal l) and second (Iié al 2 ⁇ calibration lists; i) calculate for each gene a variation value (Vargtal k) according to the method of steps c ) to e) from the first (L e t a li) and second ⁇ I * stall 2) calibration lists; j) calculating for each gene a normalized calibration variation value (Z re fj according to the method of step f); k) construct the cumulative frequency distribution, called calibration, of the normalized calibration variation values associating with any calibration variation value normalized
  • n (number of genes for which Z> Z threshold) where n is the number of genes considered.
  • the step of identifying the genes consists in selecting the genes whose normalized variation value is greater than a first threshold value for the genes of the first group and greater than a second threshold value for the genes of the second group.
  • the determination of the first and second threshold values consists in choosing first and second probabilities of selection error desired respectively for the first and second groups and in defining the first and second corresponding threshold values using the cumulative distribution of calibration frequencies.
  • the choice of the first and second threshold values consists in carrying out the method of claim 4 successively for the first and the second group.
  • the variation value Var ⁇ of a gene is equal to the difference between the concentrations of m-RNA of said gene for different cells.
  • the value of variation Var ⁇ - of a gene is equal to the ratio of the concentrations of m-RNA of said gene for different cells.
  • the method comprises for each list the following steps:
  • the variation value of a gene is equal to the difference between the ranks of the gene for the two lists analyzed.
  • the normalized variation value Z of each gene is obtained according to the following formula: Var - ⁇ (g)
  • the normalized variation value is calculated according to the following steps: - assign a unique rank value r to each gene equal to the rank value of the reference list for the genes of the first group and equal to the rank value of the test list for genes of the second group.
  • the method aims to analyze the variations in m-RNA concentrations of a set of genes from m identical groups of so-called reference cells (GR ⁇ to G ⁇ and q groups identical to so-called test cells (GT ] _ to GTg), the method comprising the following steps:
  • the first and second calibration groups (GRétal i and Ggtal _X) are identical whatever the combination of groups considered.
  • the determination of the threshold grouping value (Rseuil) comprises the following steps:
  • the step of selecting a probability of selection of grouping error comprises the steps of: - defining the maximum acceptable rate of false positive for one identification genes;
  • the grouping method comprises the following steps:
  • the method aims to analyze the variations in mRNA concentrations of a set of genes from m identical groups of so-called reference cells (GR ⁇ _ to GR j ⁇ ) and q identical groups of so-called test cells (GT ] _ to GTg), the method comprising the following steps:
  • one or more reference, test or calibration lists are obtained according to a method of creating an artificial data set comprising the following steps:
  • FIG. 1 represents a chip DNA
  • FIG. 2 is a representation of variation values of m-RNA concentration relating to a set of genes used according to a first step of the invention
  • FIG. 3 is a representation of normalized mRNA concentration variation values relating to a set of genes used according to a second step of the invention
  • FIG. 1 represents a chip DNA
  • FIG. 2 is a representation of variation values of m-RNA concentration relating to a set of genes used according to a first step of the invention
  • FIG. 3 is a representation of normalized mRNA concentration variation values relating to a set of genes used according to a second step of the invention
  • FIG. 1 represents a chip DNA
  • FIG. 2 is a representation of variation values of m-RNA concentration relating to a set of genes used according to a first step of the invention
  • FIG. 3 is a representation of normalized mRNA concentration variation values relating to a set of genes used according to a second step of the invention
  • FIG. 1 represents a chip DNA
  • FIG. 4A represents a cumulative frequency distribution of RN-m concentration variation values for a first set of genes
  • Figure 4B shows a cumulative frequency distribution of mRNA concentration variation values for a second set of genes
  • FIG. 4C is a "quantile versus quantile" curve of the variation values of m-RNA concentrations of the first and second sets of genes
  • FIG. 5A represents a set of "quantile against quantile” curves of non-normalized variation values obtained according to a "fold change”method
  • FIG. 5B represents a set of "quantile against quantile” curves of non-normalized variation values obtained according to a row shift method
  • FIG. 6A represents a set of curves
  • FIG. 6B represents a set of "quantile against quantile” curves of normalized variation values obtained according to a row shift method.
  • the method of analysis of the present invention provides for using DNA chips to analyze a set of n genes and to study the variations in m-RNA concentrations between reference cells and test cells.
  • an analysis of the variations between a group of test cells and a group of reference cells will be described.
  • the method according to the invention will be generalized to the analysis of several groups of test and reference cells.
  • the method of analysis of the present invention provides for using DNA chips to analyze a set of n genes and to study the variations in m-RNA concentrations between a group of reference cells and a group of test cells.
  • concentration of mRNA Ck relative to each gk gene is measured beforehand and the values are reported on reference lists L re f and test £ eS .
  • the method of analysis begins with the calculation for each of the genes of a value of variation of mRNA concentration, or value of variation Var, which can be equal to the difference of the concentrations of mRNA of each gene between the reference and test groups ref or c k test and Ck ref respectively the mRNA concentrations of the gk gene on the test and reference lists) or also equal to the ratio of the mRNA concentrations (Va ⁇ ⁇ Ck test / c k ref) ⁇ • which corresponds to the method "fold change" described above.
  • the genes are classified in ascending order of their mRNA concentrations for each of the reference and test lists.
  • a value of zero rank is then assigned to all the genes whose mRNA concentration is equal to zero or more broadly to all the genes whose mRNA concentration is less than a threshold concentration value corresponding to a estimation of measurement noise.
  • Each of the ni other genes is then assigned a unique rank value, the rank value being between 1 and ni.
  • the set of rank values forms a continuous series of integers between 0 and ni. The higher the rank of a gene, the higher its mRNA concentration.
  • variations in the method of measuring the concentration of mRNA from DNA chips results in a greater or lesser variation in the values of RNA concentration.
  • Two identical groups of cells can have concentration values varying between 10 and 10,000 for the first group and between 50 and 11,000 for the second group.
  • Vark The variation value, Vark, of each gk gene is calculated as follows: Var k ⁇ r test , k - r re f, k ( D where r ⁇ st k and r ref k are respectively the ranks of the gk gene from the lists of test and reference.
  • FIG. 2 represents a set of positive Vrk variation values calculated according to the "row shift” method.
  • the rows are indicated on the abscissa.
  • the variations are indicated on the ordinate.
  • Each variation value of a gene is represented by a cross whose abscissa corresponds to the rank of this gene for the reference list. Although this is not visible in Figure 2 'because of the large number of genes considered, each value of x-axis (row) corresponds to a single gene, and thus to a single value of variation.
  • the present invention provides for defining a threshold variation value which is a function of the rank of the discomfort. More particularly, the analysis method of the present invention includes a normalization method. Genes are classified into two groups. The genes whose variation value indicates an increase in their mRNA concentrations between the reference list and the test list are placed in a first group. The others " are put in a second group and a new variation value is calculated for these genes by inverting the test and reference lists.
  • the genes of the second group are the n ne g genes whose variation is strictly negative ( ⁇ is k ⁇ r ref k For a g gene).
  • V ⁇ - the variation value V ⁇ - equal to the opposite of the initial value. All variation values are now positive.
  • the variation values of the genes exhibiting a decrease in their concentration (value less than 1) between the reference group and the test group are replaced by 1 inverse of the initial values.
  • variation values are therefore all greater than 1.
  • a set of neighboring rows, or else "window" of rows is selected for each gene gk of rank ⁇ .
  • a normalized variation value Zk is calculated for each of the gk genes according to the following formula: z Vark ⁇ ⁇ (9k) ⁇ ( g)
  • the normalization process is carried out separately for each of the first and second groups of genes.
  • the values ⁇ (gk) and ⁇ (g) are calculated for each group from the variation values of a set of genes from the same group.
  • FIG. 3 represents the set of normalized variation values Z obtained for each of the variation values Vark ⁇ e l in FIG. 2.
  • the abscissa designates the rows and a value of abscissa corresponds to a single value of normalized variation.
  • the curves 30 and 31 correspond respectively to the local means and to the local standard deviations, not smoothed, calculated from the Z values in the same way as that had been done previously from the Vark values, and described above. Curves 30 and 31 show that the local means and the local standard deviations are now substantially constant whatever the rank, which means that genes with different mean mRNA concentrations have normalized variation values that follow the same cumulative frequency distribution.
  • any normalization method can be used such that the cumulative frequency distribution of a subset of normalized variation values corresponding to genes in the same row window is substantially identical regardless of the subset. considered.
  • a threshold value seu j_ ⁇ possibly different for the first and the second group of genes, and selecting the genes whose standardized variation value exceeds the threshold value.
  • this threshold value is identical for all the genes and the selection criterion is homogeneous whatever the rank of the genes analyzed, that is to say regardless of their concentration of RNA- m average.
  • An advantage of the analysis method according to the present invention is that it makes it possible to identify genes exhibiting a significant variation in their mRNA concentrations from a limited number of measurements.
  • the present invention also proposes to define a threshold value according to the method below.
  • a calibration step is carried out which consists in determining the variations in the normal RN-m concentrations of each of the genes by studying two groups of identical cells called calibration, the concentration of m-RNA of each gene being plotted on two calibration lists Lg al 1 and L êtal 2 •
  • a calculation of normalized calibration variation values is carried out according to the row offset method and the normalization method previously described.
  • One of the two calibration lists Lg ⁇ al 1 and L étal 2 is considered as a test list and the other as a reference list.
  • local averages are smoothed used for the calculation of Zetal k- ® n obtains two calibration curves representing the mean ⁇ etal ( r ) and the standard deviation r ⁇ tal ⁇ ) of the variations in calibration as a function of rank, any reference to a given gene being deleted .
  • the normalized variation values Z are calculated from these calibration curves according to the formula:
  • the groups of calibration cells can be reference cells, test cells or other cells deemed suitable.
  • the choice of cells used is dictated by the effect of the ⁇ êt values (r) and ⁇ stall (r) are normalized on variation values Z - These are even smaller than the mean values and standard type are great.
  • the values ⁇ etal ( r ) and ⁇ etal ( r ) depend on the one hand on the reproducibility of the experimental conditions (DNA chips not perfectly identical) and on the other hand on the stability of the biological system of the chosen cells.
  • the experimental conditions are assumed reproducible biological system ⁇ étal present values (r) and ⁇ stall (r) all the greater that it is unstable.
  • the calibration curves are constructed independently for each of the pairs, which leads to two pairs of calibration curves ( ⁇ test ' ⁇ test) and ⁇ ref' ⁇ ref) • 0n then evaluates which of the two systems is more unstable ( ⁇ or / and ⁇ higher).
  • This assessment can be done in different ways.
  • the results of the analysis method of the present invention are better if the calibration curves constructed from the most unstable system are used.
  • a cumulative distribution of calibration frequencies is constructed from all the normalized variation values. Normalized variation values for all genes, regardless of their rank, follow this cumulative distribution of calibration frequencies. Indeed, as will be established more precisely in relation to FIG. 6B, any subset of normalized calibration variation values corresponding to genes of the same row window follows the same cumulative distribution of frequencies and it is therefore possible to construct a single cumulative distribution of frequencies from all the normalized calibration variation values. Given the large number of genes studied and therefore the large number of normalized calibration variation values obtained, the cumulative distribution of resulting calibration frequencies is very precise. From this cumulative distribution calibration frequencies, is associated with all normalized calibration variation value z Stall, k Probability, called p selection error probability is uil k 'for that there are values of normalized calibration variation naturally greater than the latter.
  • the probability of error can now be defined using the cumulative distribution of calibration frequencies.
  • p is uil selection corresponding to the probability that it exists naturally standard variation values greater than the threshold value seu ⁇ ; L chosen to select genes.
  • An advantage of the analysis method according to the present invention is that it makes it possible to associate a probability of selection error with any threshold value Z seu j_ ⁇ _ chosen.
  • Another advantage of the analysis method according to the present invention is that it allows to choose a threshold value seu j_. very precise with a limited number of measurements.
  • a first and a second false positive rate are defined.
  • n the number of genes of the first group np OS or of the second group n ne g, the threshold Pseuil / z values possibly being different for each group of genes.
  • the cumulative frequency distribution of the normalized variation values Zk obtained during the comparison between test and reference cells is constructed beforehand. From this distribution, it is possible to associate with any normalized variation value k a probability, called probability of observation Pobs k 'so that normalized variation values greater than the latter are observed.
  • the false positive rate can be defined as being equal to Pseuil k / Pobs k-
  • Pseuil / Z threshold 'l has sensitivity, equal to (Pobs k "Pseuil k) / F 'makes it possible to know if among the selected genes, the number of genes actually showing significant variations is representative of the number of genes whose variation values have increased (Vark> ariai) •
  • An advantage of the analysis method according to the present invention is that it allows to associate a false positive rate and a sensitivity value of any threshold value seu i] _ and therefore to any Pseuil selection error probability value chosen.
  • FIGS. 4A to 4C illustrate the construction of a "quantile against quantile" curve.
  • FIG. 4A represents a cumulative distribution of frequencies C ⁇ of a first subset of variation values taken from the set of variation values (Var) obtained during a comparative study. The variation values are plotted on the abscissa. We indicate on the ordinate the probability (proba) so that there are variation values lower than the variation value on the abscissa.
  • FIG. 4B is another cumulative distribution of frequencies C2 of a second set of variation values taken from the set of variation values of the comparative study.
  • FIG. 4C is a "quantile against quantile" curve C3 obtained from curves C1 and C2 in FIGS. 4A and 4B.
  • the variation values of the first studied set are represented on the ordinate, and the variation values of the second studied set are represented on the abscissa.
  • “quantile against quantile” is obtained by taking for each probability value (between 0 and 1) the corresponding variation values on the curves C1 and C2 and by defining a point having these two values respectively for ordinate and abscissa.
  • the point 40 of the curve C3 has the abscissa VI 'and the ordinate VI, VI and VI' being respectively the values of variation of the curves Cl and C2 corresponding to the probability 0.1.
  • the points 41 and 42 of the curve C3 have the respective abscissa V2 'and V3' and for the ordinate V2 and V3, the variation values V2, V3 of the curve C ⁇ _ and
  • V2 ', V3' of curve C2 having respective probabilities 0, 5 and 0.9.
  • a “quantile against quantile” curve is thus obtained for two subsets of variation values.
  • the curve C3 is relatively far from the diagonal drawn in dotted lines, which means that the first and second subsets of variation values have different distribution functions.
  • FIG. 5A represents a set of "quantile against quantile" curves obtained by studying different subsets of variation values calculated according to a Fold Change method. The most flattened curves are obtained by taking subsets of variation values whose respective ranks are very far apart. This demonstrates that genes with different ranks have variation values that follow different distribution functions.
  • FIG. 5B likewise represents a set of "quantile against quantile" curves obtained by studying different subsets of non-normalized variation values calculated according to a row shift function. We can also observe a difference between the distribution functions for genes with very distant ranks.
  • FIG. 6A represents a set of "quantile against quantile" curves obtained by studying different subsets of normalized variation values calculated according to the Fold Change function and the normalization method of the present invention.
  • the curves approach the diagonal which means that genes with different ranks have normalized variation values which follow relatively similar distribution functions. However, there are relatively large divergences for the values corresponding to high probabilities.
  • FIG. 6B represents a set of "quantile against quantile" curves obtained by studying different subsets of normalized variation values calculated according to the row shift method and the normalization method of the present invention.
  • the curves are all very close to the diagonal, which means that the set of normalized variation values follows the same cumulative frequency distribution. This demonstrates that, by combining a calculation of the variation values according to the row shift method of the invention and a normalization of these values according to the normalization method of the invention, a set of normalized variation values is obtained which follow the same cumulative distribution of reference frequencies.
  • a method of multiple analysis aims to identify more precisely which genes exhibit the most significant variations in mRNA concentrations.
  • the multiple analysis method includes multiple analyzes of variation between reference and test lists. For all or "part of the combinations C i j comprising a reference group GR ⁇ and a test group GT is calculated for each gene gk, an amount of change Var ⁇ j ⁇ according to the offset method of ranks and an amount of change normalized Zj_ jk according to the normalization process of the invention.
  • a calibration step identical to that described above is carried out. After selecting two GR ⁇ calibration groups have] _ and ⁇ al GR 2 among the m reference groups, is calculated for each gene g a normalized calibration variation value Zgtal k by means of the offset method of rows and of the standardization process of the invention. A cumulative distribution of calibration frequencies is constructed from all the variation values calibration standards. It is thus possible to associate with a normalized value of variation of calibration Zg ⁇ al k a probability, called probability of error of calibration Pétai k 'so that there exist values of normalized variation naturally higher than this last.
  • a cumulative distribution of grouping frequencies is constructed for each combination C- ⁇ j chosen from two reference groups one of which is the GRi group or two test groups whose one of them is the group GT-j of the combination Cj_ considered.
  • a probability is defined for each gene gk, called the probability of error Pi k / corresponding to the normalized variation value Z j k of said gene.
  • the error probabilities Pi j, k are all equal.
  • some of the probabilities Pi -1 k correspond to positive variations and other values Pk i correspond to negative variations.
  • the product Prodpp OS of the values Pi, j, k corresponding to positive variations is compared to the product Prodp n gg of the values Pi, j, k corresponding to negative values.
  • Prodp OS is less than Prod n £ g we consider that the variation of the gene is positive and all the probabilities Pi, k corresponding to negative variations take the value 1 (conversely if Prodp OS > Prod n gg, the variation of the discomfort is considered negative and all the probabilities Pi H k take the value 1).
  • the result is homogeneous, i.e. the variation of the k gene is considered to be positive (or negative) for all combinations. If for a minority of sets the assignment procedure has resulted in giving the gk gene a sense of opposite variation, this is explained by the presence of an abnormal variation called artefactual which is easily detectable. These values are eliminated, which leads to a correct reassignment of the direction of variation.
  • a grouping value Rk is calculated for each gene g from the gene error probabilities according to a grouping method.
  • a grouping value Rk is calculated for each gene gk worth RETAL calibration combination, k using the calibration petai error probabilities, i, j, k corresponding to the normalized variation values Zêtal, i, k each gene obtained from the cumulative frequency distributions previously calculated.
  • the combinations chosen are distributed in different sets. We could for example constitute sets of independent combinations, two combinations Ci ⁇ ji and C 2 r j2 being independent if the groups GR ⁇ and GR2 are different and if the groups GTji and
  • G j2 are different.
  • computed for each 'discomfort gk Rk a grouping value by taking the average of the intermediate values of each set.
  • a threshold grouping value R S euil is defined in order to select the genes having grouping values greater than the latter.
  • grouping frequencies a cumulative distribution of frequencies, called grouping frequencies, from all the calibration grouping values.
  • Pthéo k 'so a probability of group selection error
  • P2seuil any threshold grouping value Rgeuil chosen.
  • R S and Pthr euil be chosen according to the false positive rate and the desired sensitivity.
  • the method of multiple analysis by analysis of means consists in constructing for the groups G] _ to GR j n and GT ⁇ _ to GTg a single group GR and GT.
  • the concentration values of mRNA-m of the groups GR ⁇ to GR j n and GT X to GTq are expressed in the form of rank values, normalized on a scale of 0 to 100, as described in chapter 1.
  • the cumulative distribution of frequencies of the variations of transcription signal normalized for a biological system makes it possible to construct artificial data sets, in the form of an artificial list ar t associating with each gene a concentration value, the data set having the same statistical characteristics as the actual data used for the calibration. From two identical groups of Gl cells and
  • rj eUf k consists in successively calculating, starting from the value immediately below rk, the absolute value of ⁇ r for any value r game, k less than r and taking the rank r game for new rank.
  • the new set of values thus obtained can be easily transformed into mRNA concentration values by the reverse transformation of that which gives the rank.
  • concentration of mRNA of each gene being reported on the artificial list L ar t.
  • a multiple method according to the present invention plans to identify more precisely the genes exhibiting the most significant transcription variations.
  • the groups GC1 to GCn can represent measurements carried out on the same biological system but at different and increasing times (kinetics experiment), or subjected to a stimulus of strictly increasing or decreasing intensity (dose / response experiments).
  • the common characteristic of these two types of experiment is that it is sought for each gk gene whether there has been a significant variation in transcription signal over the entire interval of the independent variable VI (time in kinetics or dose of a product in the case of a dose / response).
  • one of the analyzes will relate to the GCO and GC1 groups, another to the GC1 and GC2 groups, and the last will relate to the GCn-1 and GCn groups.
  • the Pthéor k is determined (° u l es Pthr k s' ⁇ there is only one group) and p s k OD 0n selects genes that have undergone an RNA concentration variation -m significant using the selection parameters such as the probability of grouping selection error, the false positive rate or the sensitivity.
  • the list s sel k is completed as follows: if a significant variation has been detected between the values i and i + 2 of VI, and if the positions i and i + 1 were at zero in the previous step, then we changes positions i and i + 1 to one. If one of the positions were already at one, the new result is not considered significant with regard to the second position.
  • the new suite for k could be s Sel k ⁇ 1 '1' 0 '1' 1 '1 -' 0 '0 -
  • the present invention is susceptible of various variants and modifications which will appear to one skilled in the art.
  • the method of the present invention can be applied to the analysis of variations in the number of different proteins present in living cells.
  • the analysis method of the present invention can be implemented from the concentrations of m-RNA noted for each of the gene sequences studied corresponding to a hybridization unit of the DNA chip used. We will therefore not study the variations in the concentration of mRNA relating to a gene but that relating to a given sequence.
  • a different definition of variation values can be used.
  • other normalization methods can be provided which satisfy the requirement of uniformity of the cumulative frequency distributions of any subset of normalized variation values.
  • those skilled in the art will be able to define the optimal grouping process making it possible to identify the genes having the most significant values of variation in mRNA concentrations.

Landscapes

  • Health & Medical Sciences (AREA)
  • Life Sciences & Earth Sciences (AREA)
  • Physics & Mathematics (AREA)
  • Chemical & Material Sciences (AREA)
  • Genetics & Genomics (AREA)
  • Engineering & Computer Science (AREA)
  • Biophysics (AREA)
  • Molecular Biology (AREA)
  • Bioinformatics & Cheminformatics (AREA)
  • Organic Chemistry (AREA)
  • Biotechnology (AREA)
  • General Health & Medical Sciences (AREA)
  • Medical Informatics (AREA)
  • Zoology (AREA)
  • Theoretical Computer Science (AREA)
  • Evolutionary Biology (AREA)
  • Analytical Chemistry (AREA)
  • Proteomics, Peptides & Aminoacids (AREA)
  • Spectroscopy & Molecular Physics (AREA)
  • Wood Science & Technology (AREA)
  • Bioinformatics & Computational Biology (AREA)
  • Microbiology (AREA)
  • Immunology (AREA)
  • Biochemistry (AREA)
  • General Engineering & Computer Science (AREA)
  • Measuring Or Testing Involving Enzymes Or Micro-Organisms (AREA)

Abstract

L'invention concerne un procédé d'analyse des variations de concentrations d'ARN-messagers obtenus par transcription d'un ensemble de gènes comprenant les étapes suivantes : - mesurer la concentration d'ARN-messagers pour chacun des gènes dans des cellules dites de référence et des cellules de test et reporter les résultats sur une liste de référence et une liste de test; - calculer pour chaque gène une valeur de variation qui soit une mesure de l'écart entre les concentrations d'ARN-m dudit gène entre la liste de référence et la liste de test; - calculer pour chaque gène une valeur de variation normalisée telle que la distribution cumulée de fréquences d'un sous-ensemble de valeurs de variation normalisées correspondant à des gènes ayant des concentrations d'ARN-m proches soit identique quel que soit le sous-ensemble considéré; et - identifier les gènes présentant des variations de concentrations d'ARN-m significatives à partir des valeurs de variation normalisées.

Description

METHODE D'ANALYSE DES VARIATIONS DE TRANSCRIPTION D'UN ENSEMBLE
DE GENES
La présente invention concerne 1 ' analyse de variations de concentrations d'ARN-m d'un ensemble de gènes réalisée à 1 'aide de puces à ADN.
L'analyse porte sur tout type de cellules vivantes telles qu'une bactérie, une cellule de levure de bière ou une cellule d'une partie du corps humain. Une ou plusieurs molécules d'ADN sont présentes dans chaque cellule. Chaque molécule d'ADN est constituée de deux brins polynucléotidiques complémentaires, un brin "antisens" (-) et un brin "sens" (+) . Chaque brin polynuclêotidique est constitué d'une chaîne polymérique de nucléotides. Chaque nucléotide est constitué d'un phosphate, d'un sucre (le désoxyribose) et d'une base, les bases pouvant être une guanine (G) , une adénine (A) , une cytosine (C) et une thyine (T) . Les deux brins de la molécule d'ADN s'apparient par l'intermédiaire de liaisons hydrogêne entre des bases complémentaires, une guanine pouvant s ' apparier avec une cytosine (G ≡ C) et une adénine pouvant s'apparier avec une thymine (A = T) .
Quand une cellule est active, qu'elle vit, chaque gène synthétise des molécules d'ARN-messagers, ou ARN-m, qui sont des copies, base pour base, du brin sens (+) du gène. Ce phénomène s ' appelle la transcription ou encore 1 ' expression du gène . Plus exactement, la transcription d'un gène n'est réalisée que pour certains groupes de bases consécutives, ou séquences, du brin du gène qui s'exprime, le brin sens (+) . L1ARN-m produit par un gêne est en fait un regroupement de copies de séquences. Selon les cellules, les gènes ne s'expriment pas tous dans les mêmes proportions. Ainsi, • la concentration d'ARN-m relative à un gène donné peut être nulle, ou varier entre 1 et 10000 par cellule.
Une méthode connue pour mesurer la concentration d'ARN-m consiste à utiliser des puces à ADN. Des cellules sont prélevées dans une culture ou sur un corps humain par biopsie. On stoppe ensuite l'activité de transcription de ces cellules, par exemple par congélation. On prépare ensuite un échantillon contenant en solution les ARN-m extraits d'un certain nombre de cellules.
On prépare par ailleurs une puce à ADN dont un exemple est illustré en figure 1 afin d'analyser un ensemble de gènes. Sur chaque puce, chaque gène est analysé au moyen de deux ensembles d'une vingtaine d'unités d'hybridation. Une unité d'hybridation regroupe un ensemble de brins d'ADN identiques appelés des sondes. Ces brins d'ADN sont des brins complémentaires d'une séquence d'un gène qui se retrouve dans les ARN-m des cellules analysées. Ces brins d'ADN ont des séquences identiques à celles du brin antisens (-) du gène. Un premier ensemble d'unités d'hybridation, dites parfaites (UP) , contient des sondes qui correspondent à différentes séquences d'un gène. Un second ensemble d'unités d'hybridation, dites imparfaites (UI) , contient des sondes qui diffèrent des sondes du premier ensemble pour au moins une des bases, chaque unité d'hybridation parfaite étant associée à une unité d'hybridation imparfaite. Dans l'exemple de la figure 1, une unité d'hybridation parfaite 2 contient des sondes 3, 4, 5, 6 et 7. L'unité d'hybridation parfaite 2 est associée à une unité d'hybridation imparfaite 10 qui dontient des sondes 11, 12, 13, 14 et 15 qui diffèrent d'une base (A, G) par rapport aux sondes 3 à 7.
Les ARN-messagers de l'échantillon précédemment préparé sont "marqués", par exemple rendus fluorescents. La fluorescence des brins est représentée par une croix dans un cercle accolée au brin fluorescent. Les ARN-messagers marqués sont appelés des cibles.
On met ensuite la puce à ADN dans l'échantillon de cibles dans des conditions favorisant l'hybridation entre brins d'ADN complémentaires. Ainsi, on peut voir en figure 1 une hybridation totale des cibles 8 et 9 avec deux sondes respectivement 4 et 6 fixées sur l'unité d'hybridation parfaite 2. Il est possible qu'une hybridation partielle se produise entre une cible 10 et une sonde 5 non totalement complémentaires. Il est possible qu'une cible 16 qui est un ARN- messager parfaitement complémentaire d'une des séquences d'un gène représenté par les sondes 3 à 7 de l'unité d'hybridation parfaite 2, vienne s'hybrider partiellement avec une sonde 12 de l'unité d'hybridation imparfaite 10. De même il se peut qu'une autre cible 17 vienne s'hybrider partiellement avec une sonde 13 de l'unité d'hybridation imparfaite 10. Une étape de lavage permet éventuellement de désapparier les brins qui sont peu complémentaires et de limiter ainsi le nombre de faux apparienrtents . On réalise ensuite une photographie de chacune des unités d'hybridation de la puce à ADN afin de déterminer pour chaque unité d'hybridation une intensité de fluorescence. Après mesure des intensités de fluorescence, on obtient deux valeurs d'intensité de fluorescence iy et ± J pour chaque paire d'unités d'hybridation parfaite et imparfaite correspondant à une séquence d'un gène. On calcule pour chaque séquence de gène une intensité de fluorescence égale à la différence entre les valeurs d'intensité de fluorescence i-gp et iui- Cette méthode de mesure de l'intensité de fluorescence de chaque séquence permet d'obtenir un meilleur rapport signal sur bruit. On calcule ensuite une valeur d'intensité de fluorescence pour chaque gène en prenant la moyenne des intensités de fluorescence de chacune des séquences de ce gène. On obtient ainsi une liste reportant une valeur d'intensité de fluorescence pour chacun des gènes. L'intensité de fluorescence étant proportionnelle à la concentration d'ARN-m issus de la transcription d'un gène, on peut aisément obtenir une liste reportant la concentration d'ARN-m pour chaque gène. Dans le cas où un gène s'exprime très peu, il est possible que 1 ' intensité de fluorescence des unités d'hybridation imparfaites soit supérieure à celle des unités d'hybridation parfaites. L'intensité de fluorescence moyenne d'un tel gène peut être négative. Dans ce cas on considère généralement que le gêne ne s'exprime pas, et donc que la concentration d'ARN-m associée est nulle. De façon courante, on souhaite analyser les variations des concentrations d'ARN-m entre des cellules dites de référence et des cellules dites de test. C'est cette analyse des variations qui fera l'objet de la suite de la présente description et de l'invention. Les cellules de référence pourront être par exemple des cellules de foie sain et les cellules de test des cellules de foie malade. On utilise les mêmes modèles de puces à ADN, et on effectue dans les deux cas la suite d'opérations précédemment décrites. L'étude des variations de la concentration d'ARN-m pour chaque gène permet d'identifier quels sont les gènes pour lesquels la concentration d'ARN-m a changé, suite à une modification de l'activité de transcription, ou à un changement de la durée de vie des ARN-m. La durée de vie des ARN-m fluctue entre autre en fonction d'une activité de synthèse protidique plus ou moins importante. De façon classique, l'analyse des variations de concentrations d'ARN-m pour chacun des gènes est réalisée en calculant le rapport des concentrations d'ARN-m d'un même gène. Cette méthode est connue sous le nom de méthode "fold change". La variation de la concentration d'ARN-m est considérée comme étant significative quand le rapport des concentrations d' RN-m est supérieur à un seuil prédéterminé. Ce seuil est identique pour 1 'ensemble des gènes et cette méthode ne permet donc pas de prendre en compte la spécificité de chacun d'eux.
Les processus de création et de destruction d'ARN-m sont interrompus aléatoirement au moment du prélèvement de cellules et la concentration d'ARN-m peut fluctuer légèrement d'une cellule à une autre. Dans le cas où un gène produit en moyenne 10 ARN-m dans chaque cellule, une différence d'un seul
ARN-m entre deux cellules conduit à un rapport de 1.1, soit 10% d'écart, et le gène en question sera considéré comme présentant une différence de concentration d'ARN-m significative. Au contraire pour un gène ayant en moyenne 1000 ARN-m par cellule, une différence de 10 ARN-m conduit à un rapport de 1.01, soit 1% d'écart, et cela passera inaperçu alors que ce peut être tout à fait anormal.
L'analyse de type "fold change" est donc peu fiable car des gènes présentant une variation significative de leurs concentrations peuvent ne pas être identifiés.
De plus, la concentration d'ARN-m relative à un gène peut varier naturellement dans des proportions qui lui sont propres. Avec une simple analyse de type "fold change", il est impossible de savoir dans quelle mesure la variation de la concentration d'ARN-m relative à un gène reste ou non dans des proportions acceptables . Un moyen de connaître la plage de variation naturelle de la concentration d'ARN-m relative à un gène, ou plus précisément la distribution cumulée de fréquences, serait de réaliser un grand nombre de mesures de concentration d'ARN-m, pour chaque gène à partir de cellules de référence identiques. Dans le cas où on a réalisé 100 mesures pour chaque gène, on peut définir des valeurs de seuil correspondant à des probabilités par incréments de 0,01 pour qu'un même gêne associé à des cellules identiques ait une concentration d'ARN-m supérieure à ces valeurs de seuil. Lors d'une mesure de concentration d'ARN-m de cellules différentes, on peut savoir quelle est la probabilité d'obtenir une concentration d'ARN-m supérieure à la valeur de seuil choisie sans pour autant que cette concentration d'ARN-m soit anormale.
En pratique, il est impossible de réaliser autant de mesures et la valeur de seuil choisie est peu fiable.
Un objet de la présente invention est de prévoir un procédé d'analyse des variations de concentrations d'ARN-m relatives à un ensemble de gènes qui permette de prendre en compte la spécificité de chaque gène. Un autre objet de la présente invention est de prévoir un tel procédé qui permette d' identifier des gènes présentant une variation significative de leurs concentrations d'ARN-m avec un nombre restreint de mesures.
Un autre objet de la présente invention est de prévoir un tel procédé qui permette de définir une valeur de seuil de façon très précise.
Pour atteindre ces objets, la présente invention prévoit un procédé d'analyse des variations de concentrations d'ARN-messagers obtenus par transcription d'un ensemble de gènes comprenant les étapes suivantes : a) mesurer la concentration d 'ARN-messagers pour chacun des gènes dans des cellules dites de référence et reporter les résultats sur une liste de référence (Lref) ; b) mesurer la concentration d'ARN-messagers pour chacun des gènes dans des cellules dites de test et reporter les résultats sur une liste de test (L^est) ' c) calculer pour chaque gène une valeur de variation (Varj) , k étant un entier compris entre 1 et n, qui soit une mesure de l'écart entre les concentrations d'ARN-m dudit gène entre la liste de référence (Lref) et la liste de test
(Ltest) • ' d) classer les gènes dans des premier . et second groupes, selon que les gènes présentent des valeurs de variation correspondant respectivement à une hausse ou à une baisse de leurs concentrations d'ARN-m entre la liste de référence et la liste de test ; e) calculer pour chaque gène du second groupe une nouvelle valeur de variation (Var^) qui soit une mesure de l'écart entre les concentrations d'ARN-m dudit gène entre la liste de test et la liste de référence. f) calculer pour chaque gène une valeur de variation normalisée (Z^) telle que la distribution cumulée de fréquences d'un sous-ensemble de valeurs de variation normalisées correspondant à des gènes ayant des concentrations d'ARN-m proches soit identique quel que soit le sous-ensemble considéré ; et g) identifier les gènes présentant des variations de concentrations d'ARN-m significatives à partir des valeurs de variation normalisées.
Selon un mode de mise en oeuvre du procédé de la présente invention, l'étape d'identification des gènes consiste à sélectionner les gènes dont la valeur de variation normalisée est supérieure à une valeur de seuil déterminée (Zseυj_]_) . Selon un mode de mise en oeuvre du procédé de la présente invention, la détermination de la valeur de seuil (Zseuj_ ) comprend les étapes suivantes : h) mesurer la concentration d'ARN-m pour chacun des gènes de deux groupes identiques de cellules dites d'étalonnage et reporter les résultats respectifs sur des première CL>êtal l) et deuxième (Iié al 2^ listes d'étalonnage ; i) calculer pour chaque gène une valeur de variation (Vargtal k) selon le procédé des étapes c) à e) à partir des première (Letal i) et deuxième {I*étal 2) listes d'étalonnage ; j ) calculer pour chaque gène une valeur de variation d'étalonnage normalisée (Zref j selon le procédé de l'étape f) ; k) construire la distribution cumulée de fréquences, dite d'étalonnage, des valeurs de variation d'étalonnage normalisées associant à toute valeur de variation d'étalonnage normalisée (Zre r ]ς) une probabilité, dite probabilité d'erreur de sélection (Pseuil,k) ' pour qu' il existe des valeurs de variation d'étalonnage normalisées supérieures à la valeur de variation normalisée considérée ; 1) choisir la probabilité d'erreur de sélection souhaitée (pSeuil) * et m) définir la valeur de seuil (Zseu;j_ι) correspondant à la probabilité d'erreur de sélection souhaitée (Pseuil) ^ l'aide de la distribution cumulée de fréquences d'étalonnage. Selon un mode de mise en oeuvre du procédé de la présente invention, l'étape consistant à choisir la probabilité d'erreur de sélection (pSeuil) comprend les étapes suivantes :
- définir le taux de faux positif maximal acceptable pour l'identification de gènes ; et ' - identifier la probabilité d'erreur de sélection
Pseuil et la valeur de seuil Zseu- maximales permettant d'obtenir un taux de faux positif acceptable, le taux de faux positif TFP étant égal à :
pseuil * n TFP = - ^
(nombre de gènes pour lesquels Z > Zseuil) où n est le nombre de gènes considérés .
Selon un mode de mise en oeuvre du procédé de la présente invention, l'étape d'identification des gènes consiste à sélectionner les gènes dont la valeur de variation normalisée est supérieure à une première valeur de seuil pour les gènes du premier groupe et supérieure à une seconde valeur de seuil pour les gènes du second groupe.
Selon un mode de mise en oeuvre du procédé de la présente invention, la détermination des première et seconde valeurs de seuil consiste à choisir des première et seconde probabilités d'erreur de sélection souhaitées respectivement pour les premier et second groupes et à définir les première et seconde valeurs de seuil correspondantes à l'aide de la distribution cumulée de fréquences d'étalonnage. Selon un mode de mise en oeuvre du procédé de la présente invention, le choix des première et seconde valeurs de seuil consiste à effectuer le procédé de la revendication 4 successivement pour le premier et le second groupe. Selon un mode de mise en oeuvre du procédé de la présente invention, la valeur de variation Var^ d'un gène est égale à la différence entre les concentrations d'ARN-m dudit gène pour des cellules différentes.
Selon un mode de mise en oeuvre du procédé de la présente invention, la valeur de variation Var^- d'un gène est égale au rapport des concentrations d'ARN-m dudit gène pour des cellules différentes.
Selon un mode de mise en oeuvre du procédé de la présente invention, le procédé comprend pour chaque liste les étapes suivantes :
- classer les gènes par ordre croissant de leurs concentrations d'ARN-m ;
- attribuer une valeur de rang nulle à tous les gènes dont les concentrations d' RN-m sont inférieures ou égales à une valeur de concentration seuil ;
- attribuer une valeur de rang unique à chacun des ni autres gènes dont la concentration d'ARN-m est supérieure à la valeur de concentration seuil, la valeur de rang étant comprise entre 1 et ni, le rang R d'un gène étant d'autant plus élevé que la concentration d'ARN-m dudit gène est élevée ; et
- normaliser les valeurs de rangs sur une plage de 0 à w, w étant un entier positif, le rang r d'un gène étant désormais égal à (R*w) /n où n est le nombre de gènes étudiés .
Selon un mode de mise en oeuvre du procédé de la présente invention, la valeur de variation d'un gène est égale à la différence entre les rangs du gène pour les deux listes analysées .
Selon un mode de mise en oeuvré lu procédé de la présente invention, la valeur de variation normalisée Z de chaque gène est obtenue selon la formule suivante : Var - μ( g)
Z = σ(g) où Var est la valeur de variation dudit gène et μ (g) et σ (g) sont respectivement la moyenne et l'écart type d'un ensemble de valeurs de variation correspondant à un ensemble de gènes ayant des concentrations d'ARN-m proches de la concentration d'ARN-m dudit gène.
Selon un mode de mise en oeuvre du procédé de la présente invention, la valeur de variation normalisée est calculée selon les étapes suivantes : - attribuer une valeur de rang r unique à chaque gène égale à la valeur de rang de la liste de référence pour les gènes du premier groupe et égale à la valeur de rang de la liste de test pour les gênes du second groupe.
- calculer la valeur de variation normalisée Z^ du gène selon la formule suivante : z=Var -μ(r) σ(r) où Var est la variation dudit gène, μ (r) et σ (r) sont respectivement la moyenne et l'écart type d'un ensemble de valeurs de variation correspondant à un ensemble de gènes ayant des rangs proches du rang r dudit gène.
Selon une variante du procédé de la présente invention, le procédé vise à analyser les variations de concentrations d'ARN-m d'un ensemble de gènes à partir de m groupes identiques de cellules dites de référence (GR^ à G^ et q groupes identiques de cellules dites de test (GT]_ à GTg) , le procédé comprenant les étapes suivantes :
- pour tout ou partie des combinaisons de groupes (C_ j) comprenant un groupe de référence (GRj) et un groupe de test (GTj ) , réaliser les trois étapes suivantes : -- construire la distribution cumulée de fréquences dite d'étalonnage selon le procédé des étapes h) à k) à partir de premier et second groupes d'étalonnage (GR^tal 1 et GRétal,2) Pris tous deux parmi les m groupes de référence ou tous deux parmi les q groupes de test, l'un des groupes étant éventuellement le groupe de référence (GR^) ou le groupe de test (GTj ) de la combinaison de groupes considérée ; -- mettre en oeuvre les étapes a) à f) pour déterminer une valeur de variation normalisée (Zj_, 7]) pour chaque gène ; définir pour chaque gène une valeur de probabilité, dite probabilité d'erreur (pi,j,k)' correspondant à la valeur de variation normalisée de ce gène (Z^j^) à partir de la distribution cumulée de fréquences d'étalonnage ; calculer pour chaque gène, une valeur de regroupement (R^) selon un procédé de regroupement tenant compte de 1 ' ensemble des probabilités d' erreur (pj_ . j ,k) dudit gène obtenues pour chacune des combinaisons (Cj_fj) de groupes de référence et de test choisis ; et identifier comme présentant des variations de concentrations d'ARN-m significatives les gènes dont la valeur de regroupement est supérieure à une valeur de regroupement de seuil (RSeuil) déterminée.
Selon un mode de mise en oeuvre du procédé précédemment décrit, les premier et second groupes d'étalonnage (GRétal i et Ggtal _X) sont identiques quelque soit la combinaison de groupes considérée. Selon un mode de mise en oeuvre du procédé de la présente invention, les valeurs de variation d'étalonnage normalisées (Zref j sont calculées selon le procédé précédemment défini z=Var - μ(g) σ(g) et les valeurs de variation normalisées entre une liste de test et de référence sont calculées selon la formule suivante :
Var -μétai(r) σétai(r) où les fonctions μgtalW et σëtal(r) sont obtenues par lissage des moyennes μ (r) et des écarts types σ (r) calculés préalablement aux valeurs de variation d' étalonnage normalisées . Selon un mode de mise en oeuvre de la présente invention, la détermination de la valeur de regroupement de seuil (Rseuil) comprend les étapes suivantes :
- calculer pour chaque gène, une valeur de regroupement d'étalonnage (Rétal k) selon le procédé de regroupement à partir des probabilités d'erreur d'étalonnage (Pétai k) dudit gène obtenues à partir des distributions cumulées de fréquences d'étalonnage calculées pour chaque combinaison de groupes (Cj^j) choisies ;
- construire la distribution cumulée de fréquences, dite de regroupement, à partir des valeurs de regroupement d'étalonnage en associant à toute valeur de regroupement d'étalonnage une probabilité, dite probabilité d'erreur de regroupement d'étalonnage, pour qu'il existe des valeurs de regroupement d'étalonnage supérieures à la valeur de regroupement d'étalonnage considérée ; - choisir la probabilité d'erreur de regroupement de sélection souhaitée (p2seuiχ) ; et
- définir la valeur de regroupement de seuil (Rseuil) correspondant à la probabilité d'erreur de regroupement de sélection (p2seuj_]_) à l'aide de la distribution cumulée de fré- quences de regroupement.
Selon un mode de mise en oeuvre de la présente invention, l'étape consistant à choisir une probabilité d'erreur de regroupement de sélection (p2se il) comprend les étapes suivantes : - définir le taux de faux positif maximal acceptable pour 1 ' identification de gènes ; et
- identifier la probabilité d'erreur de regroupement de sélection P2seuil et 1& valeur de regroupement de seuil Σ-seuil maximales permettant d'obtenir un taux de faux positif acceptable, le taux de faux positif TFP étant égal à r™ O2seuil * n
TFP = -
(nombre de gènes pour lesquels Rk≥Rseuii) où n est le nombre de gènes considérés.
Selon un mode de mise en oeuvre de la présente invention, le procédé de regroupement comprend les étapes suivantes :
- répartir les combinaisons de groupes dans différents ensembles ; calculer pour chaque ensemble une valeur intermédiaire pour chaque gène égale au produit ou à la somme des probabilités d'erreur (Pi j ]ς) du gène obtenues pour chacune des combinaisons de groupes de 1 ' ensemble ;
- calculer pour chaque gêne une valeur de regroupement (Rk) égale à la moyenne des valeurs intermédiaires calculées pour chaque ensemble. Selon une variante du procédé de la présente invention, le procédé vise à analyser les variations de concentrations d'ARN-m d'un ensemble de gènes à partir de m groupes identiques de cellules dites de référence (GRη_ à GRj^) et q groupes identiques de cellules dites de test (GT]_ à GTg) , le procédé comprenant les étapes suivantes :
- réaliser les étapes a) et b) pour chacun des groupes de référence et de test donnant m listes de référence et q listes de test ;
- définir pour chacune des listes une valeur de rang pour chaque gène selon le procédé précédemment décrit ;
- définir une liste globale de référence associant à chaque gène un rang unique égal à la moyenne de ses rangs dans les listes de référence ;
- définir une liste globale de test associant à chaque gène un rang unique égal à la moyenne de ses rangs dans les listes de test ;
- réaliser les étapes c) à g) à partir des listes de référence et de test globales, les valeurs de variation étant égales à la différence des rangs et les valeurs de variation normalisées étant calculées selon 1 'un des procédés précédemment décrit .
Selon un mode de mise en oeuvre du procédé de la présente invention, une ou plusieurs listes de référence, de test ou d'étalonnage sont obtenues selon un procédé de création d'un jeu de données artificiel comprenant les étapes suivantes :
- mettre en oeuvre les étapes h) à k) permettant d'obtenir une distribution cumulée de fréquences d'étalonnage ;
- définir pour chaque gène une valeur de variation normalisée en faisant un tirage aléatoire à partir de la distribution cumulée de fréquences d'étalonnage, l'ensemble des valeurs de variation normalisées ainsi définies ayant une distribution cumulée de fréquences identique à celle d'étalonnage. Ces objets, caractéristiques et avantages, ainsi que d'autres de la présente invention seront exposés en détail dans la description suivante de modes de réalisation particuliers faite à titre non-limitatif en relation avec les figures jointes parmi lesquelles : la figure 1 représente une puce à ADN ; la figure 2 est une représentation de valeurs de variation de concentration d'ARN-m relatives à un ensemble de gènes utilisée selon une première étape de 1 ' invention ; la figure 3 est une représentation de valeurs de variation de concentration d'ARN-m normalisées relatives à un ensemble de gènes utilisée selon une deuxième étape de l'invention ; la figure 4A représente une distribution cumulée de fréquences de valeurs de variation de concentration d' RN-m pour un premier ensemble de gènes ; la figure 4B représente une distribution cumulée de fréquences de valeurs de variation de concentration d'ARN-m pour un second ensemble de gènes ; la figure 4C est une courbe "quantile versus quantile" des valeurs de variation de concentrations d'ARN-m des premier et second ensembles de gènes ; la figure 5A représente un ensemble de courbes "quantile contre quantile" de valeurs de variation non normalisées obtenues selon une méthode de "fold change" ; la figure 5B représente un ensemble de courbes "quantile contre quantile" de valeurs de variation non normalisées obtenues selon une méthode de décalage de rangs ; la figure 6A représente un ensemble de courbes
"quantile contre quantile" de valeurs de variation normalisées obtenues selon une méthode de fold change ; et la figure 6B représente un ensemble de courbes "quantile contre quantile" de valeurs de variation normalisées obtenues selon une méthode de décalage de rangs.
Le procédé d'analyse de la présente invention prévoit d'analyser à l'aide de puces à ADN un ensemble de n gènes et d'étudier les variations des concentrations d'ARN-m entre des cellules de référence et des cellules de test. Dans une première partie, on décrira une analyse des variations entre un groupe de cellules de test et un groupe de cellules de référence.
Dans une deuxième partie, on décrira un moyen de détermination d'une valeur de seuil qui permette de sélectionner des gènes ayant des variations significatives.
Dans une troisième partie, on fera la démonstration des avantages de 1 ' invention par rapport à 1 ' art antérieur.
Dans une quatrième partie, on généralisera le procédé selon 1 ' invention à 1 ' analyse de plusieurs groupes de cellules de test et de référence.
Dans une cinquième partie, on décrira un procédé de construction de jeux de données artificiel.
Dans une sixième partie, on décrira une application du procédé selon 1 ' invention consistant à analyser les variations de concentration d'ARN-m en fonction du temps (étude de cinétiques) ou en fonction de modifications successives des conditions de culture d'un ensemble de cellules (expérience du type dose/réponse) .
1. .Comparaison entre un groupe de test et un groupe de référence
Le procédé d'analyse de la présente invention prévoit d'analyser à l'aide de puces à ADN un ensemble de n gènes et d'étudier les variations de concentrations d'ARN-m entre un groupe de cellules de référence et un groupe de cellules de test. On mesure au préalable la concentration d'ARN-m Ck relative à chaque gène gk (k étant un nombre compris entre 1 et n) et on reporte les valeurs sur des listes de référence Lref et de test £eS .
Le procédé d'analyse commence par le calcul pour chacun des gènes d'une valeur de variation de concentration d'ARN-m, ou valeur de variation Var , qui peut être égale à la différence des concentrations d'ARN-m de chaque gêne entre les groupes de référence et de test ref ou ck test et Ck ref son respectivement les concentrations d'ARN-m du gène gk sur les listes de test et de référence) ou encore égale au rapport des concentrations d'ARN-m (Va^≈ Ck test/ck ref) <• ce qui correspond à la méthode "fold change" décrite précédemment.
Selon la présente invention et préalablement au calcul des valeurs de variation, les gènes sont classés par ordre croissant de leurs concentrations d'ARN-m pour chacune des listes de référence et de test. On attribue ensuite une valeur de rang nulle à tous les gènes dont la concentration d'ARN-m est égale à zéro ou plus largement à tous les gènes dont la concentration d'ARN-m est inférieure à une valeur de concentration seuil correspondant à une estimation du bruit de mesure. On attribue ensuite une valeur de rang unique à chacun des ni autres gènes, la valeur de rang étant comprise entre 1 et ni. L'ensemble des valeurs de rangs forme une suite d'entiers continue entre 0 et ni. Le rang d'un gène est d'autant plus élevé que sa concentration d'ARN-m est élevée. De plus, les variations du procédé de mesure de la concentration d'ARN-m à partir de puces à ADN entraîne une variation des valeurs de concentration d'ARN plus ou moins importante. Deux groupes de cellules identiques peuvent avoir des valeurs de concentration variant entre 10 et 10000 pour le premier groupe et entre 50 et 11000 pour le second groupe.
Afin de rëaligner les plages de valeurs des concentrations d'ARN-m et de s'affranchir des différences possibles entre les nombres n_ de gènes pour lesquels la concentration d' RN-m est supérieure à une valeur de concentration seuil donnée, on procède à une normalisation des valeurs de rangs sur une plage allant par exemple de 0 à 100. Le rang r d'un gène g est désormais égal à (Rkxl00)/n, où Rk est le rang non normalisé du gène gk- Selon la présente invention on exprime la valeur de variation de chaque gène comme étant égale à la différence entre le rang du gène dans la liste de référence et le rang du gène dans la liste de test. La valeur de variation, Vark, de chaque gène gk est calculée comme suit : Vark rtest,k - rref,k (D où r^ st k et rref k sont respectivement les rangs du gène gk des listes de test et de référence.
Cette façon d'exprimer les valeurs de variation selon l'invention est appelée ci-aprês méthode de "décalage de rangs". La figure 2 représente un ensemble de valeurs de variation Vrk positives calculées selon la méthode de "décalage de rangs". Les rangs sont indiqués en abscisses. Les variations sont indiquées en ordonnées. Chaque valeur de variation d'un gène est représentée par une croix dont l'abscisse correspond au rang de ce gène pour la liste de référence. Bien que cela soit peu visible en figure 2 en ' raison du grand nombre de gènes considéré, chaque valeur d'abscisse (rang) correspond à un seul gène et donc à une seule valeur de variation.
On notera que les gènes dont le rang est petit présentent une amplitude de variation moyenne plus importante que les gènes dont la valeur de rang est élevée. Ceci correspond, comme on l'a indiqué précédemment, au fait que, pour les gènes s 'exprimant peu, les variations sont susceptibles d' être plus importantes . Ainsi une méthode consistant comme dans 1 ' art antérieur à fixer une valeur de variation de seuil identique pour les gènes qui s'expriment peu et ceux qui s'expriment beaucoup conduirait à considérer que les gènes présentant une variation significative sont les seuls gènes ayant un petit rang et donc une faible concentration d'ARN-m. Pour pallier cet inconvénient, la présente invention prévoit de définir une valeur de variation de seuil qui soit fonction du rang du gêne. Plus particulièrement, le procédé d'analyse de la présente invention inclut un procédé de normalisation. On classe les gènes en deux groupes. Les gènes dont la valeur de variation indique une hausse de leurs concentrations d'ARN-m entre la liste de référence et la liste de test sont mis dans un premier groupe. Les autres "sont mis dans un second groupe et on calcule pour ces gènes une nouvelle valeur de variation en inversant les listes de test et de référence.
Ainsi dans le cas où la valeur de variation est exprimée selon la méthode de décalage de rangs, les gènes du premier groupe sont les pOS gènes dont la variation est positive ou nulle (r^est k => rref k pour un gène gk) , les gênes du second groupe sont les nneg gènes dont la variation est strictement négative ( ^est k < rref k P°ur un gène g ) . Pour chaque gène du second groupe on recalcule une valeur de variation V ^- égale à l'opposé de la valeur initiale. Toutes les valeurs de variation sont désormais positives. Dans le cas où la valeur de variation est exprimée selon la méthode de "fold change", les valeurs de variation des gènes présentant une baisse de leur concentration (valeur inférieure à 1) entre le groupe de référence et le groupe de test sont remplacées par 1 ' inverse des valeurs initiales . Les valeurs de variation sont ainsi toutes supérieures à 1. Selon un mode de mise en oeuvre du procédé de normalisation de la présente invention, on sélectionne pour chaque gène gk de rang ^ un ensemble de rangs voisins, ou encore "fenêtre" de rangs. On calcule ensuite la valeur moyenne des valeurs de variation correspondant à cette fenêtre de rangs qui constitue une moyenne locale μ (g ) •
On calcule également un écart type local σ (g ) des valeurs de variation pour chaque gêne gk en utilisant la même fenêtre que pour le calcul de la moyenne locale. Les courbes 20 et 21 de la figure 2 représentent respectivement l'allure générale des valeurs μ (g ) et σ (g ) après lissage.
A partir des valeurs μ (gk) et σ (g ) . prises de préférence après lissage, on calcule une valeur de variation normalisée Zk pour chacun des gènes gk selon la formule suivante : z Vark ~ μ(9k) σ(g ) Selon une variante de mise en oeuvre du procédé de la présente invention, le procédé de normalisation est effectué séparément pour chacun des premier et deuxième groupes de gènes. Les valeurs μ (gk) et σ (g ) sont calculées pour chaque groupe à partir des valeurs de variation d'un ensemble de gènes d'un même groupe.
La figure 3 représente l'ensemble des valeurs de variation normalisées Z obtenues pour chacune des valeurs de variation Vark ^e la figure 2. Comme en figure 2, les abscisses désignent les rangs et une valeur d'abscisse correspond à une seule valeur de variation normalisée. Les courbes 30 et 31 correspondent respectivement aux moyennes locales et aux écarts types locaux, non lissés, calculés à partir des valeurs Z de la même façon que cela avait été fait précédemment à partir des valeurs Vark, et décrit ci-dessus. Les courbes 30 et 31 montrent que les moyennes locales et les écarts types locaux sont maintenant sensiblement constants quel que soit le rang, ce qui signifie que les gènes dont les concentrations d'ARN-m moyennes diffèrent ont des valeurs de variation normalisées gui suivent la même distribution cumulée de fréquences.
De façon générale, on pourra utiliser tout procédé de normalisation tel que la distribution cumulée de fréquences d'un sous-ensemble de valeurs de variation normalisées correspondant à des gènes d'une même fenêtre de rangs soit sensiblement identique quel que soit le sous-ensemble considéré.
A 1 ' issue de 1 ' étape de normalisation, on détermine une valeur de seuil seuj_ι, éventuellement différente pour le premier et le second groupe de gènes, et on sélectionne les gènes dont la valeur de variation normalisée excède la valeur de seuil .
Selon un aspect fondamental de la présente invention, cette valeur de seuil est identique pour tous les gènes et le critère de sélection est homogène quel que soit le rang des gènes analysés, c'est-à-dire indépendamment de leur concentration d'ARN-m moyenne.
Un avantage du procédé d'analyse selon la présente invention est qu'il permet d'identifier des gènes présentant une variation significative de leurs concentrations d'ARN-m à partir d'un nombre restreint de mesures .
2. Détermination d'une valeur de seuil
La présente invention propose également de définir une valeur de seuil selon le procédé ci-après.
On procède à une étape d'étalonnage consistant à déterminer les variations des concentrations d' RN-m normales de chacun des gènes en étudiant deux groupes de cellules identiques dites d'étalonnage, la concentration d'ARN-m de chaque gêne étant reporté sur deux listes d' étalonnage Lg al 1 et Lêtal 2 •
On effectue un calcul de valeurs de variation d'étalonnage normalisées selon la méthode de décalage de rangs et le procédé de normalisation précédemment décrits. L'une des deux listes d'étalonnage Lg^al 1 et Létal 2 est considérée comme liste de test et l'autre comme liste de référence. On obtient ainsi une valeur de variation d'étalonnage Varetaτ_ k P°ur chaque gène gk et une valeur de variation d'étalonnage normalisée zétal k pour chacun des gènes.
On obtient là aussi un ensemble de valeurs de variation d'étalonnage normalisées dont les moyennes locales et les écarts types locaux sont sensiblement constants.
Dans un mode de mise en oeuvre du procédé de la présente invention, on effectue un lissage des moyennes locales servant au calcul des Zétal k- ®n obtient deux courbes d'étalonnage représentant la moyenne μétal(r) et l'écart type r^tal^) des variations d'étalonnage en fonction du rang, toute référence à un gène donné étant supprimé. Lors d'une comparaison entre un groupe de test et un groupe de référence, on calcule à partir de ces courbes d'étalonnage les valeurs de variation normalisées Z selon la formule :
= Vaq{: - μétalW σétal(^k)
Les groupes de cellules d'étalonnage peuvent être des cellules de référence, des cellules de test ou d'autres cellules jugées adaptées. Le choix des cellules utilisées est dicté par l'effet des valeurs μêt l(r) et σétal(r) sur les valeurs de variation normalisées Z - Ces dernières sont d'autant plus petites que les valeurs de moyenne et d'écart type sont grandes. Les valeurs μétal(r) et σétal(r) dépendent d'une part de la reproductibilité des conditions expérimentales (puces à ADN pas parfaitement identiques) et d'autre part de la stabilité du système biologique des cellules choisies. Les conditions expérimentales étant supposées reproductibles, un système biologique présentera des valeurs μétal(r) et σétal(r) d'autant plus grandes qu' il est instable . Ainsi 1 ' étalonnage à partir de deux cellules cancéreuses donnera des valeurs μétal(r) e^ σétal(r) plus élevées, comparées à celles obtenues à partir de deux cellules normales. En conséquence, l'étalonnage doit être effectué sur un système biologique qui a les mêmes caractéristiques de stabilité que le système constitué par le test et la référence.
Dans le cas où le test et la référence ont tous deux été dupliqués, on construit les courbes d'étalonnage indépendamment pour chacun des couples, ce qui conduit à deux couples de courbes de calibration (^test' σtest) et ^réf' σréf) • 0n évalue ensuite lequel des deux systèmes est le plus instable (μ ou/et σ plus élevés) . Cette évaluation peut être effectuée de différentes manières. On peut par exemple calculer deux jeux de valeurs de variation normalisées en utilisant respectivement (μtest' σtest) et (f^réf' σréf) • 0l1 Peut Par exemple construire pour chaque jeu une distribution cumulée de fréquences. On compare les deux valeurs de variation normalisées correspondant par ex;emple au 75™e percentile (probabilité égale à 0.75). Le système ayant la plus grande valeur est le plus instable. De façon générale, les résultats du procédé d'analyse de la présente invention sont meilleurs si l'on utilise les courbes d'étalonnage construites à partir du système le plus instable .
Selon un aspect de la présente invention, on construit à partir de toutes les valeurs de variation normalisées une distribution cumulée de fréquences d'étalonnage. Les valeurs de variation normalisées de tous les gènes, quel que soit leur rang, suivent cette distribution cumulée de fréquences d'étalonnage. En effet, comme cela sera établi plus précisément en relation à la figure 6B, n'importe quel sous-ensemble de valeurs de variation d'étalonnage normalisées correspondant à des gènes d'une même fenêtre de rangs suit la même distribution cumulée de fréquences et il est donc possible de construire une unique distribution cumulée de fréquences à partir de toutes les valeurs de variation d'étalonnage normalisées. Etant donné le grand nombre de gènes étudiés et donc le grand nombre de valeurs de variation d'étalonnage normalisées obtenues, la distribution cumulée de fréquences d'étalonnage résultante est très précise. A partir de cette distribution cumulée de fréquences d'étalonnage, on associe à toute valeur de variation d'étalonnage normalisée zêtal,k une probabilité, dite probabilité d'erreur de sélection pseuil k' pour qu'il existe des valeurs de variation d'étalonnage normalisées naturellement supérieures à cette dernière.
Lors d'une analyse comparative entre des cellules de test et de référence selon le procédé précédemment décrit en relation aux figures 2 et 3, on peut désormais définir à l'aide de la distribution cumulée de fréquences d'étalonnage la probabilité d'erreur de sélection pseuil correspondant à la probabilité pour qu'il existe naturellement des valeurs de variation normalisées supérieures à la valeur de seuil seu^;L choisie pour sélectionner les gènes. Un avantage du procédé d'analyse selon la présente invention est qu' il permet d' associer une probabilité d' erreur de sélection à toute valeur de seuil Zseuj_τ_ choisie.
Un autre avantage du procédé d'analyse selon la présente invention est qu'il permet de choisir une valeur de seuil seuj_. très précise avec un nombre restreint de mesures.
A partir de la distribution cumulée de fréquences d'étalonnage, il est possible de définir un ensemble de paramètres statistiques, leur connaissance permettant de choisir au mieux la probabilité d'erreur de sélection pseuil- Connaissant le nombre de gènes étudiés, on peut connaître la proportion de gènes "normaux" parmi l'ensemble des gènes identifiés comme ayant une valeur de variation normalisée k supérieure à Zseu- . Cette proportion de gênes normaux est appelée taux de faux positif TFP et est définie comme suit:
TFP = 7 ^^ ,
[nombre de gènes pour lesquels Z ZseuilJ
Dans le cas d'une analyse distincte des premier et second groupes de gênes, on définit un premier et un second taux de faux positif. On remplace n par le nombre de gènes du premier groupe npOS ou du second groupe nneg, les valeurs Pseuil/zseuil étant éventuellement différentes pour chaque groupe de gènes.
On peut choisir une probabilité d'erreur de sélection Pseuil très petite permettant d'obtenir un taux de faux positif très faible. Néanmoins, il peut être intéressant de choisir une probabilité pseuil plu grande et donc un Zseui]_ plus petit de façon à sélectionner et donc à étudier ultérieurement un plus grand nombre de gènes.
En plus du taux de faux positif, il est possible de connaître la sensibilité de la sélection. On construit au préalable la distribution cumulée de fréquences des valeurs de variation normalisées Zk obtenues lors de la comparaison entre des cellules de test et de référence. A partir de cette distribution, il est possible d'associer à toute valeur de variation normalisée k une probabilité, dite probabilité d'observation Pobs k' pour qu'on observe des valeurs de variation normalisées supérieures à cette dernière.
A partir des valeurs de probabilité d'erreur de sélection pseuii et de probabilité d'observation p0£,s k de chaque gène, il est possible de définir la fraction F de gènes pour lesquels la valeur de variation Vark a augmenté par rapport à la valeur de variation d'étalonnage Variai k- La fraction F est définie comme étant la valeur maximale de l'ensemble des valeurs Pobs k~Pseuil k calculées pour chaque gène gk . Si Pseuil,k est la probabilité d'erreur de sélection choisie, le taux de faux positif peut être défini comme étant égal à Pseuil k/Pobs k- Quand on choisit un couple de valeurs Pseuil/Zseuil' la sensibilité, égale à (Pobs k"Pseuil k) /F' permet de savoir si parmi les gènes sélectionnés, le nombre de gènes présentant réellement des variations significatives est représentatif du nombre de gènes dont les valeurs de variation ont augmenté (Vark > ariai ) •
Un avantage du procédé d'analyse selon la présente invention est qu'il permet d'associer un taux de faux positif et une valeur de sensibilité à toute valeur de seuil seui]_ et donc à toute valeur de probabilité d'erreur de sélection Pseuil choisies .
3. Démonstration des avantages de l'invention
Les figures 4A à 4C illustrent la construction d'une courbe "quantile contre quantile". La figure 4A représente une distribution cumulée de fréquences C^ d'un premier sous-ensemble de valeurs de variation pris parmi 1 'ensemble des valeurs de variation (Var) obtenues lors d'une étude comparative. Les valeurs de variation sont reportées en abscisses. On indique en ordonnées la probabilité (proba) pour qu'il y ait des valeurs de variation inférieures à la valeur de variation en abscisses.
La figure 4B est une autre distribution cumulée de fréquences C2 d'un second ensemble de valeurs de variation pris parmi 1 ' ensemble des valeurs de variation de 1 'étude comparative.
La figure 4C est une courbe "quantile contre quantile" C3 obtenue à partir des courbes Cl et C2 des figures 4A et 4B. Les valeurs de variation du premier ensemble étudié sont représentées en ordonnées, et les valeurs de variation du second ensemble étudié sont représentées en abscisses . La courbe
"quantile contre quantile" est obtenue en relevant pour chaque valeur de probabilité (entre 0 et 1) les valeurs de variation correspondantes sur les courbes Cl et C2 et en définissant un point ayant ces deux valeurs respectivement pour ordonnée et abscisse. Le point 40 de la courbe C3 a pour abscisse VI' et ordonnée VI, VI et VI ' étant respectivement les valeurs de variation des courbes Cl et C2 correspondant à la probabilité 0,1. De même, les points 41 et 42 de la courbe C3 ont pour abscisses respectives V2 ' et V3 ' et pour ordonnées respectives V2 et V3, les valeurs de variation V2, V3 de la courbe Cη_ et
V2 ' , V3 ' de la courbe C2 ayant pour probabilités respectives 0, 5 et 0,9. On obtient ainsi une courbe "quantile contre quantile" pour deux sous-ensembles de valeurs de variation. Dans l'exemple de la figure 4C, la courbe C3 est relativement éloignée de la diagonale tracée en pointillés ce qui signifie que les premier et second sous-ensembles de valeurs de variation ont des fonctions de répartition différentes.
La figure 5A représente un ensemble de courbes "quantile contre quantile" obtenues en étudiant différents sous- ensembles de valeurs de variation calculées selon une méthode de Fold Change. Les courbes les plus aplaties sont obtenues en prenant des sous-ensembles de valeurs de variation dont les rangs respectifs sont très éloignés. Ceci démontre que des gènes ayant des rangs différents ont des valeurs de variation qui suivent des fonctions de répartition différentes.
La figure 5B représente de même un ensemble de courbes "quantile contre quantile" obtenues en étudiant différents sous- ensembles de valeurs de variation non normalisées calculées selon une fonction de décalage de rangs . On peut là aussi observer une différence entre les fonctions de répartition pour des gènes ayant des rangs très éloignés .
La figure 6A représente un ensemble de courbes "quantile contre quantile" obtenues en étudiant différents sous- ensembles de valeurs de variation normalisées calculées selon la fonction de Fold Change et le procédé de normalisation de la présente invention. Les courbes se rapprochent de la diagonale ce qui signifie que des gènes ayant des rangs différents ont des valeurs de variation normalisées qui suivent des fonctions de répartition relativement semblables. Cependant on observe des divergences relativement importantes pour les valeurs correspondant à des probabilités élevées.
La figure 6B représente un ensemble de courbes "quantile contre quantile" obtenues en étudiant différents sous- ensembles de valeurs de variation normalisées calculées selon la méthode de décalage de rangs et le procédé de normalisation de la présente invention. Les courbes sont toutes très proches de la diagonale ce qui signifie que l'ensemble des valeurs de variation normalisées suit la même distribution cumulée de fréquences . Ceci démontre que, en combinant un calcul des valeurs de variation selon la méthode de décalage de rangs de 1 ' invention et une normalisation des ces valeurs selon le procédé de normalisation de l'invention, on obtient un ensemble de valeurs de variation normalisées qui suivent la même distribution cumulée de fréquences de référence.
Il en résulte que grâce au procédé d'analyse selon la présente invention, on peut étudier chaque gène individuellement à partir d'uniquement trois mesures de concentrations d'ARN-m avec des puces à ADN alors qu'un grand nombre de mesures était nécessaire auparavant. 4. Comparaison entre plusieurs groupes de test et de référence
Dans le cas où plusieurs mesures de concentrations d'ÂRN-m pour chaque gène sont disponibles et obtenues à partir de m groupes de référence GR_ à GR^ et q groupes de test GT^ à GTg, un procédé d'analyse multiple selon la présente invention prévoit d'identifier plus finement quels sont les gènes présentant les variations de concentrations d'ARN-m les plus significatives . Le procédé d'analyse multiple comprend de multiples analyses de variation entre des listes de référence et de test. Pour tout ou "partie des combinaisons Cj_ j comprenant un groupe de référence GR^ et un groupe de test GT , on calcule pour chaque gène gk, une valeur de variation Var^j^ selon la méthode de décalage de rangs et une valeur de variation normalisée Zj_ j k selon le procédé de normalisation de l'invention.
En parallèle, on effectue une étape d'étalonnage identique à celle décrite précédemment. Après sélection de deux groupes d'étalonnage GR^ai ]_ et GR^al 2 parmi les m groupes de référence, on calcule pour chaque gène g une valeur de variation d'étalonnage normalisée Zgtal k a l'aide de la méthode de décalage de rangs et du procédé de normalisation de l'invention. On construit une distribution cumulée de fréquences d'étalonnage à partir de toutes les valeurs de variation d'étalonnage normalisées. Il est ainsi possible d'associer à une valeur de variation normalisée d'étalonnage Zg^al k une probabilité, dite probabilité d'erreur d'étalonnage Pétai k' pour qu' il existe des valeurs de variation normalisées naturellement supérieures à cette dernière.
Selon une variante de réalisation, on construit pour chaque combinaison C-^j choisie une distribution cumulée de fréquences de regroupement à partir de deux groupes de référence dont l'un d'eux est le groupe GRi ou de deux groupes de test dont l'un d'eux est le groupe GT-j de la combinaison Cj_ considérée.
A partir des distributions cumulées de fréquences d'étalonnage, on définit pour chaque gène gk une probabilité, dite probabilité d'erreur Pi k/ correspondant à la valeur de variation normalisée Z j k dudit gène. Dans le cas où seule une distribution cumulée de fréquence d'étalonnage est disponible, les probabilités d' erreur Pi j ,k sont toutes égales .
Selon une variante de réalisation, on détermine si les valeurs de variation d'un gène obtenues pour chaque combinaison C-L H correspond à une hausse (variation positive) ou à une baisse (variation négative) des concentrations d'ARN-m entre le groupe de cellules de référence GRj_ et le groupe de cellules de test GTj . Pour un gène gk particulier, certaines des probabilités Pi -1 k correspondent à des variation positives et d'autres valeurs Pk i correspondent à des variations négatives. On compare le produit ProdppOS des valeurs Pi, j,k correspondant à des variations positives au produit Prodpngg des valeurs Pi,j,k correspondant à des valeurs négatives. Si ProdpOS est inférieur à Prodn£g on considère que la variation du gène est positive et toutes les probabilités Pi ,k correspondant à des variations négatives prennent la valeur 1 (inversement si ProdpOS > Prodngg, la variation du gêne est considérée comme négative et toutes les probabilités Pi H k prennent la valeur 1) . En général, le résultat est homogène, c'est-à-dire que la variation du gène k est considérée comme positive (ou négative) pour toutes les combinaisons. Si pour une minorité d'ensembles la procédure d'assignation a abouti à donner au gène gk un sens de variation contraire, cela s'explique par la présence d'une variation anormale dite artefactuelle qui est facilement repêrable. Ces valeurs sont éliminées, ce qui conduit à une réattribution correct du sens de variation.
On procède ensuite au calcul pour chaque gène g d'une valeur de regroupement Rk à partir des probabilités d'erreur du gène selon un procédé de regroupement. Selon le même procédé, on calcule pour chaque gène gk une valeur de regroupement d'étalonnage Rétal,k en utilisant les probabilités d'erreur d'étalonnage Pétai, i,j,k correspondant aux valeurs de variation normalisées Zêtal,i, k de chaque gène obtenues à partir des distributions cumulées de fréquences précédemment calculées. Selon un mode de mise en oeuvre du procédé de regroupement de la présente invention, les combinaisons choisies sont réparties dans différents ensembles. On pourra par exemple constituer des ensembles de combinaisons indépendantes, deux combinaisons Ci^ji et C 2rj2 étant indépendantes si les groupes GRϋ et GR2 sont différents et si les groupes GTji et
G j2 sont différents. Dans le cas où on a autant de groupes de référence que de groupes de test (m=q) , on pourra par exemple constituer m! ensembles de m combinaisons indépendantes (si m<q on pourra constituer q!/m! ensembles de m comparaisons indépendantes) . On effectue ensuite pour chaque ensemble le produit (ou la somme) de toutes les probabilités d'erreur Pi k d'un même gène gk dans chaque ensemble et on obtient une valeur intermédiaire pour chaque ensemble. On calcule ensuite pour chaque ' gêne gk une valeur de regroupement Rk en prenant la moyenne des valeurs intermédiaires de chaque ensemble.
De même que pour une analyse simple entre une liste de référence et une liste de test, on définit une valeur de regroupement de seuil RSeuil afin de sélectionner les gênes présentant des valeurs de regroupement supérieures à cette dernière. A cette fin, on construit une distribution cumulée de fréquences, dite de regroupement, à partir de toutes les valeurs de regroupement d'étalonnage. A toute valeur de regroupement Rk correspond une probabilité, dite probabilité théorique Pthéo k' pour qu' il existe des valeurs de regroupement supérieures à R . On peut alors associer une probabilité d'erreur de sélection de regroupement P2seuil toute valeur de regroupement de seuil Rgeuil choisie. On choisira RSeuil et Pseuil en fonction du taux de faux positif et de la sensibilité souhaitée.
Ce procédé d'analyse multiple permet d'augmenter la puissance de 1 ' analyse car il permet de sélectionner des gènes dont les variations de la concentration d'ARN-m sont faibles et non significatives dans toutes les comparaisons prises individuellement, mais deviennent significatives lorsque toutes les comparaisons possibles sont prises en compte. b. Analyse des moyennes
Le procédé d'analyse multiple par analyse de moyennes consiste à construire pour les groupes G ]_ à GRjn et GTτ_ à GTg un groupe unique GR et GT. Les valeurs de concentration d'ARN-m des groupes GR^ à GRjn et GTX à GTq sont exprimées sous forme de valeurs de rangs, normalisés sur une échelle de 0 à 100, comme décrit dans le chapitre 1. On construit deux nouvelles listes Ltest et Lréf indiquant pour chaque gène une unique valeur de rang égale à la moyenne des valeurs de rangs respectivement des groupes de test et des groupes de référence. On construit ensuite deux listes d'étalonnage ^étall k et Let- l2 k a partir de deux ensembles de N groupes de cellules identiques ( de référence, de test ou autre) , avec N≈m si m<=q, ou N=p si p<=m, selon le procédé décrit précédemment. On effectue ensuite le même procédé d'analyse que celui mis en oeuvre lors d'une comparaison entre un seul groupe de test et un seul groupe de référence, la distribution cumulée de fréquences d'étalonnage étant construite à partir des deux listes d'étalonnage Létall/k et Lêtal2, * 5. Construction d'un jeu de données artificiel
Selon un aspect de la présente invention, la distribution cumulée de fréquences des variations de signal de transcription normalisées pour un système biologique permet de cons- truire des jeux de données artificiels, sous la forme d'une liste artificielle art associant à chaque gène une valeur de concentration, le jeu de données ayant les mêmes caractéristiques statistiques que les données réelles ayant été utilisées pour l'étalonnage. A partir de deux groupes de cellules identiques Gl et
G2, on construit comme décrit ci dessus les courbes d'étalonnage lissées μétal (9k) et σ étal (9 )' ainsi que la distribution cumulée de fréquences des valeurs de variation d'étalonnage normalisées . On construit ensuite un jeu de données artificiel indifféremment à partir exclusivement de Gl ou de G2 ou à partir de Gl et de G2, utilisés tour à tour. Si l'on prend par exemple Gl comme base pour générer artificiellement un jeu de données, on considère le rang r du gène gk- On fait un tirage aléatoire d'un nombre à partir d'une distribution linéaire sur l'intervalle [0,1]. En interpolant ce noiribre sur la distribution cumulée de fréquences d'étalonnage, on tire une valeur de variation normalisée Z pour le gène gk- Si le gène augmente entre G]_ et G2, cette valeur de variation norma- lisée est transformée en valeur de variation selon la formule :
Van, = Z * σétal ( ) + μétal ( ) et on déduit le nouveau rang, rjeu?k du gène g par la formule rjeu,k=rk+Vark
Si jeU/ est supérieur à 100, on lui donne la valeur 100. Si le gène gk diminue entre G]_ et G2, il faut trouver le nouveau rang rjeU/k tel que :
Vark = zk *σétal(rje ,k)+μétal(rjeu,k) et rjeu,k = ~Va ±εr où εrest une constante à déterminer. Une des possibilités pour rechercher rjeUfk consiste à calculer successivement, en partant de la valeur immédiatement inférieure à rk, la valeur absolue de εr pour toute valeur rjeu,k inférieure à r et à prendre pour nouveau rang, le rang rjeu,k pour lequel la valeur absolue de εr atteint le premier minimum local (c'est à dire lorsque la valeur absolue de εr au rang immédiatement inférieur au r-jeU/ considéré redevient plus grande qu'au rang rjeU/k) •
Si on arrive au rang zéro sans avoir satisfait la deuxième condition, on choisit rjeu égal à zéro.
Le nouveau jeu de valeurs ainsi obtenu peut être transformé facilement en valeurs de concentration d'ARN-m par la transformation inverse de celle qui donne le rang. La concentration d'ARN-m de chaque gène étant reporté sur la liste artificielle Lart.
Il est possible de générer plusieurs listes artificielles selon le procédé décrit ci-dessus. Ces listes peuvent être utilisées lors d'une comparaison entre plusieurs groupes de cellules de test et de référence, notamment lorsque le nombre de groupes de test et le nombre de groupes de référence diffèrent. De façon générale, un jeu de données artificiel pourra remplacer n' importe quel groupe de cellules utilisées lors des analyses précédemment décrites. 6. Analyse de cinétiques ou d'expériences dose/réponse Dans le cas où plusieurs mesures de 1 ' activité de transcription sont disponibles et obtenues à partir de plusieurs n+1 ensembles de groupes, n étant un entier. Le premier groupe GCO contient ±Q groupes GCO^ à GC0 0, le deuxième groupe GC1 contient i]_ groupes GCl^ à GClϋ, le dernier groupe GCn contient in groupes GCn^ à GChin. Un procédé multiple selon la présente invention prévoit d'identifier plus finement les gènes présentant les variations de transcription les plus significatives. Les groupes GC1 à GCn peuvent représenter des mesures effectuées sur le même système biologique mais à des temps différents et croissants (expérimentation de cinétique) , ou soumis à un stimulus d'intensité strictement croissante ou décroissante (expérimentations de dose/réponse) . La caractéristique commune de ces deux types d'expérience est que l'on recherche pour chaque gène gk s'il s'est produit une variation de signal de transcription significative sur l'ensemble de l'intervalle de la variable indépendante VI (temps dans le cas d'une cinétique ou dose d'un produit dans le cas d'une dose/réponse) . Les valeurs de la variable indépendante sont prises arbitrairement égales à VI = 0,1, ...n. Dans une première phase de l'analyse on effectue indépendamment toutes les analyses concernant les groupes pour lesquels VI = i et VI = i+1, selon les procédés décrits plus hauts. Par exemple une des analyses portera sur les groupes GCO et GC1, une autre sur les groupes GC1 et GC2, et la dernière portera sur les groupes GCn-1 et GCn. Pour chaque analyse et pour chaque gène on détermine les Pthéor k (°u les Pseuil k s ' ϋ y a qu'un seul groupe) et les pODs k- 0n sélectionne les gènes ayant subi une variation de concentration d'ARN-m significative à l'aide des paramètres de sélection tels que la probabilité d'erreur de sélection de regroupement, le taux de faux positif ou encore la sensibilité. On obtient alors pour chaque gène une suite de résultats ordonnés, Ssens k Çui indique pour chaque intervalle de VI si le gène a été détecté comme non variant ou variant positivement ou négativement, et une autre suite de résultats ordonnés, Sseτ_ k Φ^- indique si la variation est significative. Ainsi pour le gène gk on pourrait avoir la suite ssens,k = +/ + 0, -, -,-7+,+ et la suite Ssg]_^k = 1/1,0,0,0,0,0,0. A noter qu'ici comme pour la suite, une position pour laquelle aucune variation n'a été détectée (0 dans Ssens,k) reste toujours à zéro dans Ssgχ *
Ensuite, s'il existe au moins un gène gi pour lequel il y a un zéro à deux positions consécutives de SS(§JL i, sans qu' il y ait un zéro à une des positions correspondantes dans ssens i on effectue indépendamment toutes les analyses concernant les groupes pour lesquels VI=i et VI = i+2, et pour lesquels il existe des gênes comme le gène g , selon les procédés décrits plus haut. Par exemple une des analyses portera sur les groupes GCO et GC2, une autre sur les groupes GC1 et GC3, et la dernière portera sur les groupes GCn-2 et GCn. De même, on sélectionne les gènes ayant subi une variation significative. La liste Ssens n'est pas modifiée. La liste ssél k est complétée de la façon suivante : si une variation significative a été détectée entre les valeurs i et i+2 de VI, et si les positions i et i+1 étaient à zéro à l'étape précédente, alors on change les positions i et i+1 à un. Si une des positions étaient déjà à un, le nouveau résultat n'est pas considéré comme significatif en ce qui concerne la deuxième position. Ainsi la nouvelle suite pour k pourrait être ssél k≈1'1'0'1'1'1-'0'0- Les positions 4,5 et 6 ont été mises à 1, car l'analyse portant sur les groupes correspondant à VI= 3 et VI=5 a abouti à la sélection du gène g , de même que
1 'analyse portant sur les groupes correspondant à VI= 4 et VI=6.
L'analyse se poursuit aux ordres de degrés supérieurs, tel que 1 'ordre de degré 3 (VI=i et VI=i+3) , etc . tant que c'est nécessaire (existence d'au moins un gène i, ayant une suite de zéro de même degré dans Ssg]_ et aucun zéro dans une des positions correspondantes dans Ssens ) .
A la fin du processus d'analyse, on sélectionne tous les gènes ayant au moins une position mise à un dans Ssêχ. Cette procédure permet de filtrer efficacement les gènes qui ont montré une variation significative dans un intervalle de valeurs de VI contiguës. Ces gènes peuvent ensuite être groupés plus finement par une méthode de regroupement.
On peut effectuer également une sélection supplémentaire et un premier regroupement qualitatif des courbes de variations en fonction de VI, en appliquant la suite Ssgτ_ k sur la suite ssens k de la façon suivante : pour toute position de Ssgι k égale à un, on conserve les valeurs aux positions correspondantes de SgéT^k' et pour toute position de Sg^i k égale à zéro, on met entre parenthèses les valeurs aux positions correspondantes de Ssgχ k* Ainsi Ssgi ]ς=LL, 1, 0, 1,1,1, 0, 0 et ssens,k = +,+,0 -/-'-'+/+ donneront SsenS/k=+.+, (0) ,-,-,-, (+) , (+) .
Cette représentation permet une sélection supplémentaire sur des critères simples. Par exemple dans une expérience de dose/réponse on peut imposer comme condition supplémentaire que la variation soit monotone. Dans ce cas le gène gk tel que ssens ~k. =+ > +r (0) ,-, -,-,(+), (+) ne serait pas retenu. En revanche le gène gj tel que SsenS/ j=+, +, (+) , (0) , (-) , +, (+) , (+) serait retenu car toutes les variations significatives sont positives. De même, si des arguments biologiques ou autres permettent de penser qu'à partir par exemple de la quatrième valeur de VI
(marquée par | dans la suite) on doit avoir un changement du sens de variation, l'on serait conduit à conserver le gène 1 tel que Ssens ]_=+,+, (+) , | (-),(-), -, (+) ,- .et à éliminer le gène m tel que Ssensm=-,-, (+) , | (+),(+),-,(-),- .
Cette représentation . permet aussi de faire un regroupement rapide des profils de signaux de concentration d'ARN-m qui sont comparables. Par exemple l'on regroupera les gènes tels que Sseng n=+, +,(+),(-),(-),-,(+), - et tel que ssens'°=+'+' (+) ' (+) ' (+) '"' (~) ' " SJ^- ont des variations positives significatives aux mêmes positions 1 et 2, et des variations négatives significatives aux même positions 6 et 8.
Bien entendu, la présente invention est susceptible de diverses variantes et modifications qui apparaîtront à 1 'homme de l'art. En particulier, le procédé de la présente invention peut s'appliquer à l'analyse des variations du nombre de différentes protéines présentes dans des cellules vivantes.
De plus, le procédé d'analyse de la présente invention peut être mis en oeuvre à partir des concentrations d'ARN-m relevées pour chacune des séquences de gène étudiées correspondant à une unité d'hybridation de la puce à ADN utilisée. On étudiera donc non pas les variations de la concentration d'ARN-m relative à un gène mais celle relative à une séquence donnée. En outre, on pourra utiliser une définition des valeurs de variation différente. De même, on pourra prévoir d'autres procédés de normalisation satisfaisants à l'exigence d'uniformité des distributions cumulées de fréquences de tout sous-ensemble de valeurs de variation normalisées. De plus 1 'homme de 1 ' art saura définir le procédé de regroupement optimal permettant d'identifier les gènes présentant les valeurs de variation de concentrations d'ARN-m les plus significatives.

Claims

REVENDICATIONS
1. Procédé d'analyse des variations de concentrations d'ARN-messagers obtenus par transcription d'un ensemble de gènes comprenant les étapes suivantes : a) mesurer la concentration d'ARN-messagers pour chacun des gènes dans des cellules dites de référence et reporter les résultats sur une liste de référence (Lref) ; b) mesurer la concentration d'ARN-messagers pour chacun des gènes dans des cellules dites de test et reporter les résultats sur une liste de test (L^est) < ' c) calculer pour chaque gène une valeur de variation
(Var ) ' k étant un entier compris entre 1 et n, qui soit une mesure de l'écart entre les concentrations d'ARN-m dudit gène entre la liste de référence (Lref) et la liste de test
(Ltest) ; d) classer les gènes dans des premier et second groupes, selon que les gênes présentent des valeurs de variation correspondant respectivement à une hausse ou à une baisse de leurs concentrations d'ARN-m entre la liste de référence et la liste de test ; e) calculer pour chaque gène du second groupe une nouvelle valeur de variation (Vark) Φ-1^ soit une mesure de 1 ' écart entre les concentrations d'ARN-m dudit gène entre la liste de test et la liste de référence. f) calculer pour chaque gène une valeur de variation normalisée (Zk) telle que la distribution cumulée de fréquences d'un sous-ensemble de valeurs de variation normalisées correspondant à des gènes ayant des concentrations d'ARN-m proches soit identique quel que soit le sous-ensemble considéré ; et g) identifier les gènes présentant des variations de concentrations d'ARN-m significatives à partir des valeurs de variation normalisées.
2. Procédé selon la revendication 1, dans lequel l'étape d' identification des gènes consiste à sélectionner les gènes dont la valeur de variation normalisée est supérieure à une valeur de seuil déterminée (Zseui_) .
3. Procédé selon la revendication 2, dans lequel la détermination de la valeur de seuil (Zseuiχ) comprend les étapes suivantes : h) mesurer la concentration d'ARN-m pour chacun des gênes de deux groupes identiques de cellules dites d'étalonnage et reporter les résultats respectifs sur des première (Lg^al l) et deuxième (Lgtal 2) listes d'étalonnage ; i) calculer pour chaque" gène une valeur de variation d'étalonnage ( aretai k) selon le procédé des étapes c) à e) à partir des première (Lgtal l) et deuxième (Lg al 2) listes d' étalonnage ; j ) calculer pour chaque gène une valeur de variation d'étalonnage normalisée (Zref k) selon le procédé de l'étape f) ; k) construire la distribution cumulée de fréquences, dite d'étalonnage, des valeurs de variation d'étalonnage normalisées associant à toute valeur de variation d'étalonnage normalisée (Zref k) une probabilité, dite probabilité d'erreur de sélection (Pseuil k) ' pour qu' il existe des valeurs de variation d'étalonnage normalisées supérieures à la valeur de variation normalisée considérée ;
1) choisir la probabilité d'erreur de sélection souhaitée (pSeuil) /" et m) définir la valeur de seuil ( seuϋ) correspondant à la probabilité d'erreur de sélection souhaitée (pSeuil) a l'aide de la distribution cumulée de fréquences d'étalonnage.
4. Procédé selon la revendication 3, dans lequel l'étape consistant à choisir la probabilité d'erreur de sélection (Pseuil) comprend les étapes suivantes :
- définir le taux de faux positif maximal acceptable pour l'identification de gènes ; et identifier la probabilité d'erreur de sélection Pseuil et l valeur de seuil Zseu _ maximales permettant d'obtenir un taux de faux positif acceptable, le taux de faux positif TFP étant égal à :
TFP = - pseuil * n
(nombre de gènes pour lesquels Zk > Zseml) où n est le nombre de gênes considérés.
5. Procédé selon la revendication 1, dans lequel l'étape d'identification des gènes consiste à sélectionner les gènes dont la valeur de variation normalisée est supérieure à une première valeur de seuil pour les gènes du premier groupe et supérieure à une seconde valeur de seuil pour les gènes du second groupe".
6. Procédé selon les revendications 3 et 5, dans lequel la détermination des première et seconde valeurs de seuil consiste à choisir des première et seconde probabilités d'erreur de sélection souhaitées respectivement pour les premier et second groupes et à définir les première et seconde valeurs de seuil correspondantes à l'aide de la distribution cumulée de fréquences d'étalonnage.
7. Procédé selon la revendication 6 pour lequel le choix des première et seconde valeurs de seuil consiste à effectuer le procédé de la revendication 4 successivement pour le premier et le second groupe.
8. Procédé d'analyse des variations de concentrations d'ARN-m d'un ensemble de gènes à partir de m groupes identiques de cellules dites de référence (GR.χ à GRm) et q groupes identiques de cellules dites de test (Glχ à GTg) , le procédé comprenant les étapes suivantes : a2) mesurer, pour chaque groupe de référence, la concentration d'ARN-messagers pour chacun des gènes et reporter les résultats sur m listes de référence (Lref à Lref2) ; b2) mesurer, pour chaque groupe de test, la concentration d'ARN-messagers pour chacun des gènes et reporter les résultats sur q listes de test (Ltestχ à Ltest2) '* - pour tout ou partie des combinaisons de groupes (C ^j) comprenant un groupe de référence (GR ) et un groupe de test (GTj ) , réaliser les étapes c2 à 12 suivantes :
-- c2) calculer pour chaque gène une valeur de variation (Vark) ' ^ étant un entier compris entre 1 et n, qui soit une mesure de l'écart entre les concentrations d' RN-m dudit gène entre la liste de référence (Lrefi) et la liste de test (Ltestj) ;
-- d2) classer les gènes dans des premier et second groupes, selon que les gènes présentent des valeurs de variation correspondant respectivement à une hausse ou à une baisse de leurs concentrations d'ARN-m entre la liste de référence (Lre i) et la liste de test (Ltestj) '
-- e2) calculer pour chaque gène du second groupe une nouvelle valeur de variation (Vax±f j k) Ç[u soit une mesure de l'écart entre les concentrations d'ARN-m dudit gène entre la liste de test (Ltest ) et la liste de référence (Lrefi) ;
-- f2) calculer pour chaque gène une ' valeur de variation normalisée (Z± k) telle que la distribution cumulée de fréquences d'un sous-ensemble de valeurs de variation normalisées correspondant à des gènes ayant des concentrations d'ARN-m proches soit identique quel que soit le sous-ensemble considéré ;
-- h.2) choisir des premier et second groupes d'étalonnage (Ggtal, i i j et GR^^al 2,i,j) p is tous deux parmi les m groupes de référence ou tous deux parmi les q groupes de test, l'un des groupes étant éventuellement le groupe de référence (GRi) ou le groupe de test (GTj ) de la combinaison de groupes considérée ; -- i2) calculer pour chaque gène une valeur de variation d'étalonnage (Variai, i, j ,k) selon le. procédé des étapes c2) à e2) à partir de première (T->êtal, l i,k) et deuxième
(Létal, 2, j ,k) listes d'étalonnage correspondant aux premiers et seconds groupes d'étalonnage ; -- j2) calculer pour chaque gène une valeur de variation d'étalonnage normalisée ( ref,i,j,k) selon le procédé de l'étape f2) ;
-- k2) .construire la distribution cumulée de fréquences, dite d'étalonnage, des valeurs de variation d'étalonnage normalisées associant à toute valeur de variation d'étalonnage normalisée (Zref i,j, ) uae probabilité, dite probabilité d'erreur de sélection (Pseuil,i,j k) P°ur qu'il existe des valeurs de variation d'étalonnage normalisées supérieures à la valeur de variation normalisée considérée ;
-- 12) définir pour chaque gène une valeur de probabilité, dite probabilité d'erreur (p j,k)' correspondant à la valeur de variation normalisée de ce gêne ( i ^ ) a partir de la distribution cumulée de fréquences d'étalonnage ; - m2) calculer pour chaque gène, une valeur de regroupement (Rk) selon un procédé de regroupement tenant compte de 1 ' ensemble des probabilités d' erreur (pi, j , k) dudit gène obtenues pour chacune des combinaisons (ci,j) de groupes de référence et de test choisis ; et - n2) identifier comme présentant des variations de concentrations d'ARN-m significatives les gènes dont la valeur de regroupement est supérieure à une valeur de regroupement de seuil (RSeuil) déterminée.
9. Procédé selon la revendication 8, dans lequel les premier et second groupes d'étalonnage (Ggta]_ i et GRg^a.1,2) sont identiques quelque soit la combinaison de groupes considérée .
10. Procédé selon la revendication 8 ou 9, dans lequel la détermination de la valeur de regroupement de seuil (Rseuil) comprend les étapes suivantes : calculer pour chaque gène, une valeur de regroupement d'étalonnage (Rêtal,k) selon le procédé de regroupement à partir des probabilités d'erreur d'étalonnage (Pétal,k) dudit gène obtenues à partir des distributions cumulées de fréquences d'étalonnage calculées pour chaque combinaison de groupes (Cifj) choisies ;
- construire la distribution cumulée de fréquences, dite de regroupement, à partir des valeurs de regroupement d'étalonnage en associant à toute valeur de regroupement d'étalonnage une probabilité, dite probabilité d'erreur de regroupement d'étalonnage, pour qu'il existe des valeurs de regroupement d'étalonnage supérieures à la valeur de regroupement d'étalonnage considérée ; - choisir la probabilité d'erreur de regroupement de sélection souhaitée (p2seuil) ; et
- définir la valeur de regroupement de seuil (RSeuil) correspondant à la probabilité d'erreur de regroupement de sélection (p2seuil) a l'aide de la distribution cumulée de fréquences de regroupement.
11. Procédé selon la revendication 10, dans lequel l'étape consistant à choisir une probabilité d'erreur de regroupement de sélection (P2seuil) comprend les étapes suivantes : - définir le taux de faux positif maximal acceptable pour l'identification de gènes ; et
- identifier la probabilité d'erreur de regroupement de sélection P2seuil et la valeur de regroupement de seuil zseuil maximales permettant d'obtenir un taux de faux positif acceptable, le taux de faux positif TFP étant égal à
mτ^ p2seuil * n
TFP
(nombre de gènes pour lesquels Rk≥Rsemi) où n est le nombre de gènes considérés.
12. Procédé selon la revendication 8, dans lequel le procédé de regroupement comprend les étapes suivantes : - répartir les combinaisons de groupes dans différents ensembles ; calculer pour chaque ensemble une valeur intermédiaire pour chaque gène égale au produit ou à la somme des probabilités d'erreur (Pi 4 ) du gène obtenues pour chacune des combinaisons de groupes de 1 ' ensemble ;
- calculer pour chaque gène une valeur de regroupement (Rk) égale à la moyenne des valeurs intermédiaires calculées pour chaque ensemble.
13. Procédé selon la revendication 1 ou 8, dans lequel la valeur de variation (Vark) d'un gène est égale à la différence entre les concentrations d'ARN-m dudit gène pour des cellules différentes.
14. Procédé selon la revendication 1 ou 8, dans lequel la valeur de variation (Vark) d'un gène est égale au rapport des concentrations d'ARN-m dudit gène pour des, cellules différentes.
15. Procédé selon la revendication 1 ou 8 comprenant pour chaque liste les étapes suivantes : - classer les gènes par ordre croissant de leurs concentrations d'ARN-m ;
- attribuer une valeur de rang nulle à tous les gènes dont les concentrations d'ARN-m sont inférieures ou égales à une valeur de concentration seuil ; - attribuer une valeur de rang unique à chacun des ni autres gènes dont la concentration d'ARN-m est supérieure à la valeur de concentration seuil, la valeur de rang étant comprise entre 1 et ni, le rang R d'un gène étant d'autant plus élevé que la concentration d'ARN-m dudit gène est élevée ; et - normaliser les valeurs de rangs sur une plage de 0 à w, w étant un entier positif, le rang r d'un gène étant désormais égal à (R* ) /n où n est le nombre de gènes étudiés.
16. Procédé selon la revendication 15, dans lequel la valeur de variation d'un gène est égale à la différence entre les rangs du gène pour les deux listes analysées.
17. Procédé selon la revendication 1 ou 8 dans lequel la valeur de variation normalisée Z de chaque gène est obtenue selon la formule suivante : _^Var - μ(g) σ(g) où Var est la valeur de variation dudit gène et μ (g) et σ (g) sont respectivement la moyenne et l'écart type d'un ensemble de valeurs de variation correspondant à un ensemble de gènes ayant des concentrations d'ARN-m proches de la concentration d'ARN-m dudit gène.
18. Procédé selon la revendication 1 ou 8, dans lequel la valeur de variation normalisée est calculée selon les étapes suivantes :
- attribuer une valeur de rang r unique à chaque gène égale à la valeur de rang de la liste de référence pour les gènes du premier groupe et égale à la valeur de rang de la liste de test pour les gènes du second groupe .
- calculer la valeur de variation normalisée Z du gène selon la formule suivante :
où Var est la variation dudit gène, μ (r) et σ (r) sont respectivement la moyenne et 1 ' écart type d 'un ensemble de valeurs de variation correspondant à un ensemble de gènes ayant des rangs proches du rang r dudit gène.
19. Procédé selon la revendication 3 ou 8, dans lequel les valeurs de variation d'étalonnage normalisées (Zref k) sont calculées selon le procédé suivant :
- attribuer une valeur de rang r unique à chaque gène égale à la valeur de rang de la liste de référence pour les gènes du premier groupe et égale à la valeur de rang de la liste de test pour les gènes du second groupe. calculer la valeur de variation d'étalonnage normalisée Z du gène selon la formule suivante :
où Var est la variation d'étalonnage dudit gène, μ (r) et σ (r) sont respectivement la moyenne et l'écart type d'un ensemble de valeurs de variation d'étalonnage correspondant à un ensemble de gènes ayant des rangs proches du rang r dudit gène et dans lequel les valeurs de variation normalisées entre une liste de test et une liste de référence sont calculées selon la formule suivante :
_ Var - μétai(r) σétai(r) où les fonctions étal(r) et σétal(r) sont obtenues par lissage des moyennes μ (r) et des écarts types σ (r) calculés préalablement à partir des valeurs de variation d'étalonnage.
20. Procédé d'analyse des variations de concentrations d'ARN-m d'un ensemble de gènes à partir de m groupes identiques de cellules dites de référence (GR^ à GRm) et q groupes identiques de cellules dites de test (GT^ à GTg) , le procédé comprenant . les étapes suivantes : - mesurer, pour chaque groupe de référence, la concentration d'ARN-messagers pour chacun des gènes et reporter les résultats sur m listes de référence (Lref à Lref2) ; mesurer, pour chaque groupe de test, la concentration d'ARN-messagers pour chacun des gènes et reporter les résultats sur q listes de test ( ^gg^i à Lj-est2) ;
- définir pour chacune des listes une valeur de rang pour chaque gène selon le procédé comprenant les quatre étapes suivantes :
-- classer les gènes par ordre croissant de leurs concentrations d'ARN-m ;
-- attribuer une valeur de rang nulle à tous les gènes dont les concentrations d'ARN-m sont inférieures ou égales à une valeur de concentration seuil ;
-- attribuer une valeur de rang unique à chacun des ni autres gènes dont la concentration d' RN-m est supérieure à la valeur de concentration seuil, la valeur de rang étant comprise entre 1 et ni, le rang R d'un gène étant d'autant plus élevé que la concentration d'ARN-m dudit gène est élevée ; et -- normaliser les valeurs de rangs sur une plage de 0 à w, w étant un entier positif, le rang r d'un gène étant désormais égal à (R* ) /n où n est le nombre de gènes étudiés
- définir une liste globale de référence associant à chaque gène un rang unique égal à la moyenne de ses rangs dans les listes de référence ;
- définir une liste globale de test associant à chaque gène un rang unique égal à la moyenne de ses rangs dans les listes de test ; - calculer pour chaque gène une valeur de variation
(Var ) égale à la différence entre le rang du gène pour la liste globale de référence et le rang du gène pour la liste globale de test ; classer les gênes dans des premier et second groupes, selon que les gènes présentent des valeurs de variation correspondant respectivement à une hausse ou à une baisse de leurs rangs entre la liste globale de référence et la liste globale de test ;
- calculer pour chaque gène du second groupe une nouvelle valeur de variation (Vark) égale à la différence entre le rang du gêne pour la liste globale de test et le rang du gène pour la liste globale de référence ;
- calculer pour chaque gène une valeur de variation normalisée (Zk) selon le procédé comprenant les deux étapes suivantes :
-- attribuer une valeur de rang r unique à chaque gène égale à la valeur de rang de la liste de référence pour les gènes du premier groupe et égale à la valeur de rang de la liste de test pour les gènes du second groupe. -- calculer la valeur de variation normalisée Zk du gène selon la formule suivante :
où Var est la variation dudit gène, μ (r) et σ (r) sont respectivement la moyenne et 1 ' écart type d'un ensemble de valeurs de variation correspondant à un ensemble de gènes ayant - des rangs proches du rang r dudit gène ; et - identifier les gènes présentant des variations de concentrations d'ARN-m significatives à partir des valeurs de variation normalisées.
21. Procédé selon n'importe laquelle des revendications précédentes dans lequel une ou plusieurs listes de référence, de test ou d'étalonnage sont obtenues selon un procédé de création d'un jeu de données artificiel comprenant les étapes suivantes : mettre en oeuvre les étapes h) à k) de la revendication 3 permettant d'obtenir une distribution cumulée de fréquences d'étalonnage ; - définir pour chaque gène une valeur de variation normalisée en faisant un tirage aléatoire à partir de la distribution cumulée de fréquences d'étalonnage, l'ensemble des valeurs de variation normalisées ainsi définies ayant une distribution cumulée de fréquences identique à celle d' étalonnage.
EP03756043A 2002-05-31 2003-06-02 Methode d'analyse des variations de transcription d'un ensemble de genes Withdrawn EP1550069A1 (fr)

Applications Claiming Priority (3)

Application Number Priority Date Filing Date Title
FR0206749 2002-05-31
FR0206749A FR2840323B1 (fr) 2002-05-31 2002-05-31 Methode d'analyse des variations de transcription d'un ensemble de genes
PCT/FR2003/001655 WO2003102849A1 (fr) 2002-05-31 2003-06-02 Methode d'analyse des variations de transcription d'un ensemble de genes

Publications (1)

Publication Number Publication Date
EP1550069A1 true EP1550069A1 (fr) 2005-07-06

Family

ID=29558893

Family Applications (1)

Application Number Title Priority Date Filing Date
EP03756043A Withdrawn EP1550069A1 (fr) 2002-05-31 2003-06-02 Methode d'analyse des variations de transcription d'un ensemble de genes

Country Status (5)

Country Link
US (1) US20050255471A1 (fr)
EP (1) EP1550069A1 (fr)
AU (1) AU2003255623A1 (fr)
FR (1) FR2840323B1 (fr)
WO (1) WO2003102849A1 (fr)

Family Cites Families (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
EP0880598A4 (fr) * 1996-01-23 2005-02-23 Affymetrix Inc Evaluation rapide de difference d'abondance d'acides nucleiques, avec un systeme d'oligonucleotides haute densite
KR20010052341A (ko) * 1998-05-12 2001-06-25 로제타 인파마틱스 인코포레이티드 유전자 발현 분석을 위한 정량 방법, 시스템, 장치

Non-Patent Citations (1)

* Cited by examiner, † Cited by third party
Title
See references of WO03102849A1 *

Also Published As

Publication number Publication date
FR2840323B1 (fr) 2006-07-07
FR2840323A1 (fr) 2003-12-05
WO2003102849A1 (fr) 2003-12-11
US20050255471A1 (en) 2005-11-17
WO2003102849A9 (fr) 2004-04-22
AU2003255623A1 (en) 2003-12-19

Similar Documents

Publication Publication Date Title
FR3116064A1 (fr) Procede de conception de sequences d’adn base sur l’algorithme d’optimisation chaotique des baleines
US20230259588A1 (en) Inter-cluster intensity variation correction and base calling
EP0552575B1 (fr) Procédé de segmentation polytomique
Garry et al. Bayesian counting of photobleaching steps with physical priors
Pigani et al. Classification of red wines by chemometric analysis of voltammetric signals from PEDOT-modified electrodes
WO2004001673A2 (fr) Procede d&#39;analyse d&#39;image pour la mesure du signal sur des biopuces
EP1550069A1 (fr) Methode d&#39;analyse des variations de transcription d&#39;un ensemble de genes
JP2010512777A (ja) 差分解析により取得されるトランスクリプトーム実験の結果を処理するための補正方法
EP4002223A1 (fr) Procédé de mise à jour d&#39;un réseau de neurones artificiel
EP3405899B1 (fr) Procédé de classification d&#39;un échantillon biologique
FR3143174A1 (fr) Procede d’identification de biomarqueurs d’arn extracellulaires dans des echantillons de fluide corporel en vue de detecter des cancers et d’autres pathologies telles que l’endometriose
EP2952888B1 (fr) Marqueur de taille et procede pour le contrôle de la resolution d&#39;un electrophoregramme
EP3227813B1 (fr) Procédé d&#39;estimation de l&#39;affinité sonde-cible d&#39;une puce a adn et procédé de fabrication d&#39;une puce a adn
FR2861406A1 (fr) Methode d&#39;analyse d&#39;un ensemble de genes
FR3155300A1 (fr) Procédé de calcul de paramètres physiques d’une chaussée à partir de mesures de déflexion
EP4300129B1 (fr) Procédé de regroupement de descriptions de formes d&#39;ondes
WO2020242603A1 (fr) Procédés et utilisation pour l&#39;évaluation quantitative de produits amplifiés clonaux et de qualités de séquençage
JP2006170670A (ja) 遺伝子発現量規格化方法、プログラム、並びにシステム
EP4721065A1 (fr) Procede et systeme de typage probabiliste de souches microbiennes
FR3152885A1 (fr) Procédé de génération de rapports d&#39;analyse protéomique comparatifs à partir de multiples échantillons biologiques mis en œuvre par ordinateur
EP4471785A1 (fr) Procede et systeme de typage probabiliste de souches microbiennes
EP4405666A1 (fr) Méthode pour déterminer une qualité d&#39;une mélasse utilisée dans la production d&#39;une levure
Lun et al. Package ‘scran’
HK40090027B (en) Systems and methods for per-cluster intensity correction and base calling
FR3149977A1 (fr) Procédé d’analyse métabolomique d’échantillons biologiques par intégration des paramètres dynamiques de la RMN

Legal Events

Date Code Title Description
PUAI Public reference made under article 153(3) epc to a published international application that has entered the european phase

Free format text: ORIGINAL CODE: 0009012

17P Request for examination filed

Effective date: 20041201

AK Designated contracting states

Kind code of ref document: A1

Designated state(s): AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HU IE IT LI LU MC NL PT RO SE SI SK TR

AX Request for extension of the european patent

Extension state: AL LT LV MK

DAX Request for extension of the european patent (deleted)
17Q First examination report despatched

Effective date: 20061019

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE APPLICATION IS DEEMED TO BE WITHDRAWN

18D Application deemed to be withdrawn

Effective date: 20100105