WO2018046766A1 - Polyweb d'analyse de données de séquençage haut debit - Google Patents

Polyweb d'analyse de données de séquençage haut debit Download PDF

Info

Publication number
WO2018046766A1
WO2018046766A1 PCT/EP2017/072924 EP2017072924W WO2018046766A1 WO 2018046766 A1 WO2018046766 A1 WO 2018046766A1 EP 2017072924 W EP2017072924 W EP 2017072924W WO 2018046766 A1 WO2018046766 A1 WO 2018046766A1
Authority
WO
WIPO (PCT)
Prior art keywords
variants
vectors
bit
categories
annotation
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Ceased
Application number
PCT/EP2017/072924
Other languages
English (en)
Inventor
Patrick Nitschke
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Universite Paris Descartes
Imagine Institut des Maladies Génétiques Necker Enfants Malades
Original Assignee
Universite Paris Descartes
Imagine Institut des Maladies Génétiques Necker Enfants Malades
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Universite Paris Descartes, Imagine Institut des Maladies Génétiques Necker Enfants Malades filed Critical Universite Paris Descartes
Publication of WO2018046766A1 publication Critical patent/WO2018046766A1/fr
Anticipated expiration legal-status Critical
Ceased legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G16INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
    • G16BBIOINFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR GENETIC OR PROTEIN-RELATED DATA PROCESSING IN COMPUTATIONAL MOLECULAR BIOLOGY
    • G16B30/00ICT specially adapted for sequence analysis involving nucleotides or amino acids

Definitions

  • NGS Next Generation Sequencing
  • NGS neuropeptide styssemblies
  • One of the applications of NGS in human health is the search for mutations of the genome in the context of diseases having a genetic component or susceptibility / or response to a drug, for example in the context of personalization of the treatment of tumor pathologies.
  • a human exome only the 3% of the human genome encoding proteins
  • the objective for the biologist and / or the doctor is to identify the mutation (s) associated with the phenotype of interest (for example a pathology). In practice, this implies comparing these lists of variants on a large number of samples that are close to or otherwise different from a phenotypic point of view.
  • WO 2013/070634 discloses filters for finding variants, these filters being associated with biological information.
  • the method described does not show how the data are processed for all the variants of the genome and does not allow to treat in real time or in a very fast time, for example during the continuous duration of a download connection in less two minutes.
  • Polyweb is a software suite intended to assist the biologist in carrying out these different operations interactively and in the biological interpretation of these variants from different knowledge bases.
  • Polyweb addresses the two main issues of NGS, organization and data management (PolyProject), as well as the analysis and interpretation of exome sequencing (Polyquery) and / or resequencing results. targeted (polyDiag).
  • Polyquery is a graphical interface that will allow the biologist to compose his own queries on his sequencing data.
  • the filters can relate to the nature and the annotations associated with the variant (consequence on the protein, frequencies in reference populations).
  • the biologist will also be able to easily and graphically compose filters between samples based on the crossing of phenotypes and variants (intersection, exclusion, genetic transmission model: recessive, denovo).
  • the biologist can, through the interface, save queries, export his results, and view the alignments.
  • Polyquery is also connected to other annotation tools (Alamut), visualization tools (IGV) and public annotation databases (Ensembl, DBsnp).
  • the invention is a method of processing data from high throughput sequencing to process / analyze the nucleic acid sequences corresponding to the exome or genome of several biological samples, in order to find, among said nucleic acid sequences , at least one gene possibly involved in a phenotype of interest, from the Vj variants in a given chromosome, taking the values from 1 to T, T being equal to the total number of variants detected in the chromosome.
  • bit vectors are computed, the bits being used to note the membership of these variants Vj in annotation categories so as to allow logical operations between the categories of annotation, the membership of these variants Vj being indexed by the genomic position of the variants Vj.
  • the method comprises a first step (a), prior to the creation of the bit vectors, in which:
  • a first reference table describing the different genomic R regions of all the chromosomes is calculated, each genomic region being described by an initial position and a final position on a chromosome
  • the method comprises a second step (b) in which:
  • annotation categories A are calculated which are represented by VA bit vectors of size T, where I is a natural integer greater than or equal to 1,
  • annotation categories B specific to the genomic regions R 1, are defined; sub-vectors of bits V B, which are smaller than the size T of the vectors VA, are calculated; the first position of the vector VB indicates by a bit the membership of the first variant present in the genomic region Ri; and the last position of the vector VB indicates one bit the membership of the last variant present in said genomic region R 1.
  • a subvector VB, k is associated with a second annotation category B, k specific to the genomic region R ,, and for each variant Vj present in this genomic region R 1, we denote the belonging of this variant Vj to this category B, k in the sub-vector VB, k by a bit in the j - OO position, where OJ is the position of the first variant of the genomic region R, in the table of reference.
  • a third step (c) the simple requests and / or complex requests for filters on the variants Vj are decomposed into one or more logical operations relating to the different vectors VAi and on the different sub-vectors of bits VB, and VBik.
  • a fourth step (d) the results are selected and displayed by counting the number of bits signaling the membership or not of the variants in the bit vectors VAi, VB, and VB, k of the first and second selected categories Ai, Bi, Bik.
  • FIG. 1 represents the steps of the method of the invention
  • FIG. 2 represents a table making it possible to label the variants
  • FIGS. 3a and 3b show the index realized in the invention and a large bit vector containing all the variants of a given project
  • FIGS. 5a to 6b show examples of small bit vectors used in the invention
  • FIGS. 7a to 8c show schematically the operation of the method and the logical operations between the different bit vectors
  • FIGS. 9 to 10 show screenshots of the software and show research on the variants and genes via the software interface.
  • the present invention relates to a method of processing data from high throughput sequencing to process / analyze / filter the nucleic acid sequences corresponding to the exome or genome of several biological samples, to find, among the said acid sequences nucleic acid, at least one gene possibly involved in a phenotype of interest, the gene of interest being linked to one or more several variants Vj, j taking the values from 1 to T, T being equal to the total number of variants detected per chromosome.
  • the objective of the invention is to find among millions of variants, one or more genes possibly involved in a phenotype of interest in a time compatible with an http request.
  • the invention is particularly suited to the study of rare diseases.
  • T is a natural number greater than 1.
  • the method thus applies to each chromosome, which each has a specific total number of different Vj variants.
  • the variants are variations of the nucleic acid sequences relative to reference nucleic sequences.
  • the phenotype of interest is a rare disease.
  • a sample may be a healthy / sick person.
  • the phenotype of interest is cancer
  • the samples are healthy cells and diseased cells of one or more individuals.
  • the reference table comprises at least, for the set of variants Vj: several tens of thousands of variants Vj per individual for the exome;
  • the number of samples n is greater than or equal to 50 genomes, or 150 exomes.
  • the method is specific because, in order to carry out queries on the variants Vj, it is computed in advance of the bit vectors, the bits being used to note the membership of these variants Vj in categories of annotation of characterization of the variants of the variants. to allow very fast logical operations between the categories of annotation, the membership of these variants Vj being indexed by the genomic position of the variants Vj.
  • variant characterization annotation category is exon and that:
  • the variant is exon, it will be indicated in the bit vector a 1 in the bit vector at the location of the variant (known by the variant index)
  • the variant is not exon it will be indicated in the bit vector a 0 in the bit vector at the location of the variant (known by the index of the variant).
  • the word 'bit vector' here means that the vectors comprise in their columns binary values, for example the value 0 or the value 1. It is taken here in the examples the value 1 to note that the variants are present in the bit vectors associated with given annotation categories.
  • bit vectors are here said vectors 'lines' have a line and P columns, and in each column, the presence / absence of variants Vj in the annotation category is indicated by the presence of a bit equal to 1 to indicate the presence of the variant Vj in the category and a bit equal to 0 to signal the absence of variants Vj in the category.
  • a step (a) of indexing prior to the creation of the bit vectors : for each chromosome, an indexing table is computed containing all the Vj variants ranked according to their position on the chromosome genome, the Vj variants being indexed by their location on the chromosome and having a single wording of the Vj variants; thus an index is created; this index (or position of the variants with respect to each other) serves as a 'backbone' for the whole process in which it will be categorized all the variants into as many annotation categories as possible which will allow an exhaustive list of the queries. the user, while keeping in mind which variant it is and for which category of annotation associated with this variant it is, in view of its position in the index.
  • the index makes it possible to number the variants and therefore to know which variant it is, in which genomic regions it is located and what are its characteristics, as represented in FIGS. 8a to 8c.
  • a genomic region R is a region defined by a start and an end on the chromosome. It may correspond, for example by way of illustration and not limitation, to a gene, an intergenic region, a regulatory region, or the like.
  • variants can be co-located on several genomic regions at a time.
  • a reference table describing the different genomic regions Ri is calculated, each genomic region R being described by an initial position and a final position on a chromosome, these two positions making it possible to find the index of the first variant and the index of the last variant of this genomic region R ,.
  • the process is performed on each chromosome, and can be run in parallel with calculators on each chromosome, to optimize the computation time.
  • the wording of the variants Vj is composed of their location on the chromosome, and the sequence of said variant Vj (the allele, the nucleic acid of said variant) and can be defined as shown in FIG. 2.
  • the individual P1 presents:
  • the mutated allele T that has substituted for the reference allele A on the second strand of chromosome 1 at position 1500, which is indicated by 0/1.
  • the P2 individual has no mutated allele on chromosome 1 at position 1500, which is indicated by 0/0.
  • the individual P1 has the mutated allele T by insertion of CG on the second strand of chromosome 1 at position 1516, which is indicated by 0/1,
  • the individual P 2 has the mutated allele T by substitution of AT by AG on the two strands of chromosome 1 at position 1516, which is indicated by 2/2.
  • a variant characterization annotation step is performed. For example, it is:
  • VA bit vectors are described by the membership of a variant Vj to the following first annotation categories A:
  • the frequency of Vj variants in databases can be defined as follows
  • Categories A are not all defined here and can be added as many A categories as desired.
  • a small vector VB representing all the variants on the genomic regions will be calculated.
  • the correspondence between the large VA vectors and the small VB vectors will be obtained thanks to the position of the first and last variant of the small vector on the large vector.
  • a simple translation is performed on the index or indexing table. More precisely, in the second step (b) for optimizing queries and memory, for each genomic region Ri:
  • annotation categories B corresponding to the genomic regions, are defined; sub-vectors of bits VB, of size P 1, are calculated at the size T of the vectors V 1,
  • the first position of the vector VB indicates the membership of the first variant present in the genomic region R 1; and the last position of the vector VB indicates the membership of the last variant present in said genomic region R 1.
  • a sub-vector VB is calculated, k representing a second annotation category B, k specific to the genomic region Ri, and for each variant Vj present in this genomic region Ri, we write the belonging of this variant Vj to this category B, k in the sub-vector VB, k by a bit (for example equal to 1), to the j - J0 position, J0 being the position of the first variant of the genomic region in the index of the reference table.
  • the second annotation categories B, and B, k of the bit subvectors VB, and VB, k make it possible to determine the membership of a variant Vj to the following annotation categories B, and B1:
  • the variant modifies or not the translated amino acid
  • Non-coding RNA Non-coding RNA, pseudogenous ("pseudogene" in English),
  • UTR Untranslated Region
  • bit vectors are decomposed as follows, by:
  • VAi bit vectors called 'large vectors'
  • the method according to the invention realizes vectors of bits to indicate the presence or absence of variants in categories associated with each of these bit vectors.
  • VAi bit vectors are described by the membership of a variant Vj to the following annotation categories A:
  • sample can:
  • FIG. 4a For example, it is represented in FIG. 4a:
  • a first vector of bitsVAi associated with a category Ai makes it possible to determine which variants possesses the individual P1 associated with a category Ai;
  • a second vector of bits VA2 associated with a category A2 makes it possible to determine which variants possesses the individual P2;
  • a third VA3 bit vector associated with a category A3 makes it possible to determine which variants possesses the individual P3;
  • VA5 bit vector associated with a category A5 to determine the frequent variants at less than 1%, ect .. for all the frequencies
  • the process makes it possible to work upstream on the data and preparing a priori the requests expected by the user (knowing his requests and knowledge needs of his research) to output results very quickly for the user, in real time or very quickly (less than two minutes), while processing hundreds of thousands or millions of different variants.
  • a server composed of two 8-core Intel (R) Xeon (R) X5550 @ 2.67GHz processors
  • R 8-core Intel
  • R Xeon
  • a complete genome sequencing project composed of 48 samples 240 000 000 variants (15 families trio)
  • a query displaying the variants with a frequency less than 1% non-synonymous and following a recessive model is performed in 1 min for a use of less than 1 GB of memory.
  • the method can be described as real time.
  • an index which makes it possible to construct a large bit vector V that includes all the variants and here, in the illustrated examples, shows the bit 1 to signal it, the bit 1 to the jem position corresponding to the presence of the variant Vj in the bit vector V.
  • Small vectors VB corresponding to the genomic regions R 1, and vectors V B, k specific for the genomic regions are then calculated, as illustrated in FIGS. 5a, 5b, 6a and 6b. For example, it is shown in Figure 5a:
  • a small vector of bits VBi associated with a category Bi makes it possible to determine all the variants present on the gene A located on chromosome 1, in the positions of the following nucleic acid sequences: 1510-1615 (in the large vectors this corresponds to the position of 2 to 18 for example VA1 and V);
  • a second small vector of bits VBi, i associated with a category ⁇ , ⁇ makes it possible to determine all the variants present on the gene A located on chromosome 1, in the positions of the following nucleic acid sequences: 1510-1615 ( in large vectors this corresponds to the position of 2 to 18, for example VAi and V) and which are exons;
  • a third small bit vector VBi, 2 associated with a category Bi, 2 makes it possible to determine all the variants present on the gene A located on chromosome 1, in the positions of the following nucleic acid sequences: 1510-1615 (in the large vectors this corresponds to the position of 2 to 18 for example of VA1 and V) and which are coding;
  • a fourth small vector of bits VBi, 3 associated with a category Bi, 3 makes it possible to determine all the variants present on the gene A located on chromosome 1, in the positions of the following nucleic acid sequences: 1510-1615 (in the large vectors that corresponds to the position of 2 to 18 for example of VA1 and V) and which are non-coding RNA;
  • the method makes it possible to count and display the number of variants and to make: first logical operations on the large vectors and then, once the variants that seem of interest are retained, to refine by making second logical operations on the small vectors in order to present only a number of acceptable variants / genes of interest to be examined more closely.
  • the method advantageously comprises:
  • a third step (c) to make simple queries and / or complex queries of filters on the variants Vj, which are decomposed into one or more logical operations relating to the various vectors VA and sub-vectors of bits VB, and VBik, and which are performed very quickly because of the second step (b) prior to producing the bit vectors;
  • a fourth step (d) the results are selected and displayed by counting the number of bits still at 1 in the bit vectors VA, VB, and VB, k.
  • the VA bit vectors either by membership of the Vj variants in the samples, or by membership of the Vj variants in groups, or by membership of the Vj variants in a chromosome;
  • a fifth step (e) the correspondence (s) between the variant (s) of interest is carried out, by using the position of the bit and the first and second reference tables, and the gene (s) of interest which present the variant (s). remaining after the logical operations.
  • a sixth (f) the annotations specific to the variants of interest (remaining variants) or the genes of interest associated with these variants of interest are displayed.
  • the queries can be performed on several millions of variants (with optimization of memory and computation time.)
  • a logical operation can be carried out between the vectors of the same size, for example:
  • the logical operations are for example an intersection or a difference. They make it possible to bring out the common or different variants Vj between the bit vectors of the same size or not, the common variants being represented by a bit, here equal to 1, at the same position:
  • FIG. 7a After the creation of the index (FIG. 7a), it is determined in FIG. 7b which variants to which individual P1, P2 (their membership being indicated by a bit equal to 1), and in FIG. 7c which variants have in common both individuals.
  • the genomic region ACKA and the genomic region ATG which are of different sizes, the first having two variants, the second having 9 variants of which 1 variant is common with the ACLA genomic region.
  • R1 here ACKA and ATG
  • Figure 8b the subclasses here exonic and splice
  • FIG. 8c it is thus calculated the bit vectors that note the variants belonging to: - P1 and P2, and Exonic and Splice for ACKA; there is only one, it is the variant located at the second position on the index, which is represented by the two-column bit vector;

Landscapes

  • Physics & Mathematics (AREA)
  • Life Sciences & Earth Sciences (AREA)
  • Chemical & Material Sciences (AREA)
  • Analytical Chemistry (AREA)
  • Biophysics (AREA)
  • Proteomics, Peptides & Aminoacids (AREA)
  • Health & Medical Sciences (AREA)
  • Engineering & Computer Science (AREA)
  • Bioinformatics & Cheminformatics (AREA)
  • Bioinformatics & Computational Biology (AREA)
  • Biotechnology (AREA)
  • Evolutionary Biology (AREA)
  • General Health & Medical Sciences (AREA)
  • Medical Informatics (AREA)
  • Spectroscopy & Molecular Physics (AREA)
  • Theoretical Computer Science (AREA)
  • Measuring Or Testing Involving Enzymes Or Micro-Organisms (AREA)

Abstract

Procédé de traitement de données issues d'un séquençage haut débit pour traiter/analyser les séquences d'acides nucléiques correspondant à l'exome ou au génome de plusieurs échantillons biologiques, afin de trouver, parmi les dites séquences d'acides nucléiques, au moins un gène possiblement impliqué dans un phénotype d'intérêt, à partir des variants Vj dans un chromosome donné, j prenant les valeurs de 1 à T, T étant égal au nombre total de variants détectés dans le chromosome, dans lequel pour réaliser des requêtes sur les variants Vj, on calcule des vecteurs de bits, les bits étant utilisés pour noter l'appartenance de ces variants Vj à des catégories d'annotation de façon à permettre des opérations logiques entre les catégories, l'appartenance de ces variants Vj étant indexée par la position génomique des variants Vj.

Description

Polyweb d'analyse de données de séquençage haut débit
Le séquençage de nouvelle génération (NGS) a profondément bouleversé les approches et les applications de l'étude du génome, du fait de l'augmentation massive des capacités de séquençage conjointement à une réduction des temps de production et des coûts. En contrepartie, cela s'est accompagné d'un accroissement considérable des données à traiter rendant indispensable le recours à des outils informatiques puissants et innovants. En ce sens les problématiques rencontrées sont proches de celles communément regroupées sous le terme « big-data ».
Une des applications du NGS en santé humaine est la recherche de mutations du génome dans le cadre de maladies ayant une composante génétique ou de susceptibilité/ou réponse à un médicament, par exemple dans le contexte de personnalisation du traitement des pathologies tumorales. Typiquement l'analyse d'un exome humain (uniquement les 3% du génome humain codant pour des protéines), produit approximativement 50 000 variants par individu séquencé.
A partir de ces listes de variants l'objectif pour le biologiste et/ou le médecin est d'identifier la/les mutations associées au phénotype d'intérêt (par exemple une pathologie). En pratique cela implique de pouvoir comparer ces listes de variants sur un grand nombre d'échantillons proches ou au contraire différents d'un point de vue phénotypique.
Le document WO 2013/070634 décrit des filtres pour trouver des variants, ces filtres étant associés à des informations biologiques.
Mais le procédé décrit ne présente pas comment les données sont traités pour l'ensemble des variants du génome et ne permet pas de traiter en temps réel ou dans un temps très rapide, par exemple durant la durée continue d'une connexion de téléchargement en moins de deux minutes.
FEUILLE DE REMPLACEMENT (RÈGLE 26) EXPOSE DE L'INVENTION
Polyweb est une suite logicielle destinée à aider le biologiste dans la réalisation de ces différentes opérations de manière interactive et dans l'interprétation biologique de ces variants à partir de différentes bases de connaissance.
Polyweb permet de répondre à la fois aux deux principales problématiques du NGS, l'organisation et la gestion des données (PolyProject), ainsi que l'analyse et l'interprétation des résultats de séquençage d'exome (Polyquery) et/ou de reséquençage ciblé (polyDiag).
Polyquery est une interface graphique qui va permettre au biologiste de composer lui-même ses requêtes sur ses données de séquençages. Les filtres peuvent porter sur la nature et les annotations associées au variant (conséquence sur la protéine, fréquences dans des populations de référence). En utilisant Polyquery le biologiste pourra également composer facilement et graphiquement des filtres entre les échantillons basés sur le croisement des phénotypes et des variants (intersection, exclusion, modèle de transmission génétique : récessif, denovo). Le biologiste peut, au travers de l'interface, sauvegarder des requêtes, exporter ses résultats, et visualiser les alignements. Polyquery est également connecté à d'autres outils d'annotation (Alamut), de visualisation (IGV) et de base d'annotation publiques (Ensembl, DBsnp).
L'invention est un procédé de traitement de données issues du séquençage haut débit pour traiter/analyser les séquences d'acides nucléiques correspondant à l'exome ou au génome de plusieurs échantillons biologiques, afin de trouver, parmi les dites séquences d'acides nucléiques, au moins un gène possiblement impliqué dans un phénotype d'intérêt, à partir des variants Vj dans un chromosome donné, j prenant les valeurs de 1 à T, T étant égal au nombre total de variants détectés dans le chromosome.
De façon remarquable, pour réaliser des requêtes sur les variants Vj, dans le procédé on calcule des vecteurs de bits, les bits étant utilisés pour noter l'appartenance de ces variants Vj à des catégories d'annotation de façon à permettre des opérations logiques entre les catégories d'annotation, l'appartenance de ces variants Vj étant indexée par la position génomique des variants Vj.
Avantageusement, il est calculé plusieurs tailles de vecteurs de bits.
Avantageusement, le procédé comprend une première étape (a), préalable à la création des vecteurs de bits, dans laquelle :
- on calcule une première table de référence décrivant les différentes régions génomiques R, de tous les chromosomes, chaque région génomique étant décrite par une position initiale et une position finale sur un chromosome,
- pour chaque chromosome, on calcule une seconde table de référence contenant l'ensemble des variants Vj classés suivant leur position sur le génome du chromosome, les variants Vj étant définis suivant un libellé unique des variants Vj. Avantageusement, le procédé comporte une deuxième étape (b) dans laquelle:
-on calcule des catégories d'annotation A qui sont représentées par des vecteurs de bits VA de taille T, I étant un entier naturel supérieur ou égal à 1 ,
- on note dans les vecteurs VA, par un bit et à la position j du vecteur VA l'appartenance ou non de ce variant Vj à ces catégories A.
Avantageusement, dans la deuxième étape (b) pour optimiser les requêtes et la mémoire pour chaque région génomique R,:
- on définit des catégories d'annotation B, spécifiques des régions génomiques Ri, -on calcule des sous- vecteurs de bits VB, de taille inférieure à la taille T des vecteurs VA, la première position du vecteur VB, indique par un bit l'appartenance du premier variant présent dans la région génomique Ri ; et la dernière position du vecteur VB, indique par un bit l'appartenance du dernier variant présent dans la dite région génomique R,. Pour chacun de ces sous-vecteurs VB,, on calcule un sous- vecteur VB,k associé à une seconde catégorie d'annotation B,k spécifique à la région génomique R,, et pour chaque variant Vj présent dans cette région génomique Ri, on note l'appartenance de ce variant Vj à cette catégorie B,k dans le sous-vecteur VB,k par un bit à la j - JO position, JO étant la position du premier variant de la région génomique R, dans la table de référence.
Dans une troisième étape (c), les requêtes simples et/ou des requêtes complexes de filtres sur les variants Vj, sont décomposées en une ou plusieurs opérations logiques portant sur les différents vecteurs VAi et sur les différents sous-vecteurs de bits VB, et VBik.
Dans une quatrième étape (d) les résultats sont sélectionnés et affichés en comptant le nombre de bit signalant l'appartenance ou non des variants dans les vecteurs de bits VAi, VB, et VB,k des premières et secondes catégories sélectionnés Ai, Bi, Bik.
Avantageusement, on réalise une opération logique entre des vecteurs de même taille:
- entre les vecteurs de bits VA ; ou
-entre les sous-vecteurs de bits VB, et/ou VB,k .
Avantageusement, on réalise une opération logique entre des vecteurs de différentes tailles:
- entre les vecteurs de bits VA et les sous-vecteurs de bits VB, et/ou VB,k, les sous-vecteurs VB, et/ou VB,k étant complétés par des bits supplémentaires signalant la non appartenance aux catégories B, et /ou B,k des variants supplémentaires Vj associés aux bits supplémentaires, pour avoir une taille égale à T afin de permettre l'opération logique.
DESCRIPTION DES FIGURES
D'autres objectifs, caractéristiques et avantages sortiront de la description détaillée qui suit en référence aux dessins donnés à titre illustratif et non limitatif parmi lesquels :
- la figure 1 représente les étapes du procédé de l'invention ;
- la figure 2 représente un tableau permettant d'étiqueter les variants ;
- les figures 3a et 3b représentent l'index réalisé dans l'invention et un grand vecteur de bits contenant tous les variants d'un projet donné ;
- les figures 4a et 4b représentent les grands vecteurs;
- les figures 5a à 6b représentent des exemples de petits vecteurs de bits utilisés dans l'invention ;
- les figures 7a à 8c représentent schématiquement le fonctionnement du procédé et les opérations logiques entre les différents vecteurs de bits ;
- les figures 9 à 10 représentent des copies d'écran du logiciel et montre des recherches sur les variants et de gènes via l'interface du logiciel.
DESCRIPTION DETAILLEE DE L'INVENTION
La présente invention concerne un procédé de traitement de données issues du séquençage haut débit pour traiter/analyser/filtrer les séquences d'acides nucléiques correspondant à l'exome ou au génome de plusieurs échantillons biologiques, pour trouver, parmi les dites séquences d'acides nucléiques, au moins un gène possiblement impliqué dans un phénotype d'intérêt, le gène d'intérêt étant lié à un ou plusieurs variants Vj, j prenant les valeurs de 1 à T, T étant égal au nombre total de variants détectés par chromosome.
L'objectif de l'invention est de trouver parmi des millions de variants, un ou plusieurs gènes possiblement impliqués dans un phénotype d'intérêt dans un temps compatible avec une requête http.
L'invention est particulièrement adaptée à l'étude des maladies rares.
Elle est aussi bien adaptée à l'étude de l'exome que l'étude du génome, de par la rapidité de l'exécution des requêtes permise par une étape préalable de traitement des données sur les variants, non connue de l'état de l'art, comme il sera présenté ci-après.
T est un nombre entier naturel supérieur à 1 .
Le procédé s'applique ainsi sur chaque chromosome, qui présente chacun un nombre total spécifique de variants Vj différents.
Les variants sont des variations des séquences d'acides nucléiques par rapport à des séquences nucléiques de référence.
Dans une réalisation, le phénotype d'intérêt est une maladie rare. Dans ce cas, un échantillon peut être une personne saine/malade.
Dans une autre réalisation, le phénotype d'intérêt est un cancer, et les échantillons sont des cellules saines et des cellules malades d'un ou de plusieurs individus. Par exemple, la table de référence comporte au moins, pour l'ensemble de variants Vj: - plusieurs dizaines de milliers variants Vj par individu pour l'exome ;
-plusieurs millions de variants Vj par projet pour le génome
Par exemple, le nombre d'échantillons n est supérieur ou égal à 50 génomes, ou 150 exomes. Le procédé est spécifique, car pour réaliser des requêtes sur les variants Vj, il est calculé au préalable des vecteurs de bits, les bits étant utilisés pour noter l'appartenance de ces variants Vj à des catégories d'annotation de caractérisation des variants de façon à permettre des opérations logiques très rapides entre les catégories d'annotation, l'appartenance de ces variants Vj étant indexée par la position génomique des variants Vj.
L'expression 'annotation des variants' signifie que la caractérisation des variants est notée dans ces vecteurs de bits.
Par exemple si la catégorie d'annotation de caractérisation des variants est exon et que :
- le variant est exon, il sera indiqué dans le vecteur de bits un 1 dans le vecteur de bits à l'emplacement du variant (connu par l'index du variant)
-le variant n'est pas exon il sera indiqué dans le vecteur de bits un 0 dans le vecteur de bits à l'emplacement du variant (connu par l'index du variant).
Le mot 'vecteur de bits' signifie ici que les vecteurs comprennent dans leurs colonnes des valeurs binaires, par exemple la valeur 0 ou la valeur 1 . II est pris ici dans les exemples la valeur 1 pour noter que les variants sont présents dans les vecteurs de bits associés à des catégories d'annotation données.
Avantageusement, il est calculé plusieurs tailles différentes de vecteurs de bits. Les vecteurs de bits sont ici des vecteurs dit 'lignes' ont une ligne et P colonnes, et dans chaque colonne, la présence/l'absence des variants Vj dans la catégorie d'annotation est signalée par la présence d'un bit égal à 1 pour signaler la présence du variant Vj dans la catégorie et un bit égal à 0 pour signaler l'absence des variants Vj dans la catégorie.
Dans une étape (a) d'indexation préalable à la création des vecteurs de bits, : - pour chaque chromosome, on calcule une table d'indexation contenant l'ensemble des variants Vj classés suivant leur position sur le génome du chromosome, les variants Vj étant indexés par leur emplacement sur le chromosome et présentant un libellé unique des variants Vj ; ainsi un index est créé ; cet index (ou position des variants les uns par rapport aux autres) sert de 'colonne vertébrale' à tout le procédé dans lequel il va être catégorisé tous les variants en autant de catégories d'annotation que possible qui permettront une liste exhaustive des requêtes de l'utilisateur, tout en gardant en mémoire de quel variant il s'agit et pour quelle catégorie d'annotation associée à ce variant il s'agit, au vu de sa position dans l'index. L'index permet de numéroter les variants et donc de savoir de quel variant il s'agit, dans quel(les) régions génomiques il se situe et quelles sont ses caractéristiques, comme représenté sur les figures 8a à 8c.
Une région génomique R, est une région définie par un début et une fin sur le chromosome. Elle peut correspondre, par exemple à titre illustratif et non limitatif, à un gène, une région intergénique, une région régulatrice, ou autres.
Ces régions peuvent se chevaucher ou non, comme il est connu de l'état de l'art et de la littérature scientifique. Ainsi, par exemple, des variants peuvent être co-localisés sur plusieurs régions génomiques à la fois.
On calcule une table de référence décrivant les différentes régions génomiques Ri, chaque région génomique R, étant décrite par une position initiale et une position finale sur un chromosome, ces deux positions permettant de trouver l'index du premier variant et l'index du dernier variant de cette région génomique R,.
Le procédé est réalisé sur chaque chromosome, et peut être lancé en parallèle avec des calculateurs sur chaque chromosome, pour optimiser le temps de calcul . Le libellé des variants Vj est composé de leur emplacement sur le chromosome, et la séquence du dit variant Vj (l'allèle, l'acide nucléique du dit variant) et peut être défini comme représenté sur la figure 2. Par exemple, l'individu P1 présente :
-l'allèle de référence A sur le premier brin du chromosome 1 à la position 1500 ;
-l'allèle muté T qui s'est substitué à l'allèle de référence A sur le deuxième brin du chromosome 1 à la position 1500, ce qui est indiqué par 0/1 . Par exemple, l'individu P2 ne présente aucun allèle muté sur le chromosome 1 à la position 1500, ce qui est indiqué par 0/0.
Par exemple, l'individu P3 présente sur la figure 2 :
-l'allèle muté T sur le premier brin du chromosome 1 à la position 1500,
-l'allèle muté T sur le deuxième brin du chromosome 1 à la position 1500, ce qui est indiqué par 1 /1 .
Il arrive qu'il y ait une insertion pour au moins un premier individu en même temps qu'une substitution pour au moins un autre individu, voire plus de deux variations différentes au même endroit chez des individus différents.
Dans ce cas-là, par exemple, comme représenté sur la figure 2 :
- l'individu P1 présente l'allèle muté T par insertion de CG sur le deuxième brin du chromosome 1 à la position 1516, ce qui est indiqué par 0/1 ,
-l'individu P 2 présente lui l'allèle muté T par substitution d'AT par AG sur les deux brins du chromosome 1 à la position 1516, ce qui est indiqué par 2/2.
Dans la deuxième étape (b) de la création des vecteurs de bits préalable au calcul des requêtes réalisé dans une troisième étape (c), on réalise une étape d'annotation de caractéristation des variants. Par exemple, il est :
-défini des premières catégories d'annotation Ai et calculé (déterminé, réalisé) des vecteurs de bits VAi de taille T, avec I entier naturel supérieur à 1 , représentants et associés à ces premières catégories d'annotation A ;
- noté dans les vecteurs VA, par un bit égal à 1 ou 0 (ou égal à 0 ou 1 ) et à la position j du vecteur VA , l'appartenance ou non de ce variant Vj à ces catégories A.
Avantageusement, les vecteurs de bits VA sont décrits par l'appartenance d'un variant Vj aux premières catégories d'annotation A suivantes :
- hétérozygote pour un échantillon donné ;
- homozygote pour un échantillon donné ;
- appartenance à un échantillon ;
- appartenance à un groupe d'échantillons, tel qu'une famille ;
- fréquence des variants Vj dans des bases de données.
La fréquence des variants Vj dans des bases de données peut être définie comme suit
< 1 pour 10 000
< 1 pour 1000
- < 1 pour 100
< 5 pour 100
présence dans la base de données clinvar ® ;
pas d'information de fréquence. Les catégories A ne sont pas ici toutes définies et il peut être ajouté autant de catégories A que souhaité. Exemple, une catégorie sur la pathogénéicité des variants.
Pour toute catégorie spécifique B sur les gènes ou régions, un petit vecteur VB représentant l'ensemble des variants sur les régions génomiques sera calculé. La correspondance entre les grands vecteurs VA et les petits vecteurs VB sera obtenue grâce à la position du premier et dernier variant du petit vecteur sur le grand vecteur. Une simple translation est réalisée sur l'index ou table d'indexation. Plus précisément, dans la deuxième étape (b) pour optimiser les requêtes et la mémoire, pour chaque région génomique Ri:
-on définit des catégories d'annotation B, correspondant aux régions génomiques, -on calcule des sous-vecteurs de bits VB, de taille inférieure Pi à la taille T des vecteurs VA,,
la première position du vecteur VB, indique l'appartenance du premier variant présent dans la région génomique R,; et la dernière position du vecteur VB, indique l'appartenance du dernier variant présent dans la dite région génomique R,.
Pour chacun de ces sous-vecteurs VB,, on calcule un sous-vecteur VB,k représentant une seconde catégorie d'annotation B,k spécifique à la région génomique Ri, et pour chaque variant Vj présent dans cette région génomique Ri, on note l'appartenance de ce variant Vj à cette catégorie B,k dans le sous-vecteur VB,k par un bit (par exemple égal à 1 ), à la j - J0 position, J0 étant la position du premier variant de la région génomique dans l'index de la table de référence.
Les secondes catégories d'annotation B, et B,k des sous vecteurs de bits VB, et VB,k permettent de déterminer l'appartenance d'un variant Vj aux catégories d'annotation B, et Bik suivantes :
- non synonyme et synonyme, le variant modifie ou non l'acide aminé traduit,
-mutation génétique causée par insertion/délétion changement ou non du cadre de lecture
- région intronique,
- région d'épissage (« splicing » en anglais) accepteur donneur,
- MicroARN ,
-gain ou perte de stop,
-ARN non codant, -pseudogène (« pseudogene » en anglais),
-région non traduite (« UTR (UnTranslated Région) » en anglais),
-outil de prédiction de pathogénicité (« sift » et « polyphen » en anglais).
- décalage ou non du cadre de lecture (« frameshift/non frameshift » en anglais).
En termes plus simples, les vecteurs de bits sont décomposés comme suit, en:
- vecteurs de bits VAi dits 'grands vecteurs' ;
-sous- vecteurs de bits VB, et VB,k dits 'petits vecteurs' . II va de soi que l'on pourrait multiplier la catégorisation des vecteurs et des sous- vecteurs.
Une fois que tous les variants sont détectés et étiquetés, à partir d'un grand vecteur de bits V qui contient tous les variants indiqués par des 1 , comme illustré sur les figures 3b et 7b, le procédé selon l'invention réalise des vecteurs de bits afin d'indiquer la présence ou non des variants dans des catégories associées à chacun de ces vecteurs de bits.
Ici, sur la figure 4a, sont représentés les grands vecteurs de bits VAi.
Comme déjà mentionné ci-avant, les grands vecteurs de bits VAi sont décrits par l'appartenance d'un variant Vj aux catégories d'annotation A suivantes :
hétérozygote pour un échantillon donné ;
homozygote pour un échantillon donné ;
- appartenance à un échantillon ;
appartenance à un groupe d'échantillons, tel qu'une famille ;
fréquence des variants Vj dans des bases de données.
Le terme échantillon peut :
- Soit correspondre à un individu, malade ou sain Soit correspondre pour un même individu à un tissu sain ou à un tissu malade ; notamment dans le cas du cancer.
Par exemple, il est représenté sur la figure 4a :
-un premier vecteur de bitsVAi associé à une catégorie Ai permet de déterminer quels variants possède l'individu P1 associée à une catégorie Ai ;
-un deuxième vecteur de bits VA2 associé à une catégorie A2 permet de déterminer quels variants possède l'individu P2 ;
-un troisième vecteur de bits VA3 associé à une catégorie A3 permet de déterminer quels variants possède l'individu P3 ;
-un quatrième vecteur de bits VA* associé à une catégorie A* pour déterminer les variants homozygotes chez l'individu P3 ;
-un cinquième vecteur de bits VA5 associé à une catégorie A5 pour déterminer les variants fréquents à moins d'1 %, ect.. pour toutes les fréquences ;
- un ième vecteur VA de bits associé à une catégorie A pour déterminer les variants hétérozygotes chez l'individu P4.
On peut multiplier le nombre de catégories A afin de créer le plus de possibilités de catégories sur les variants, et de pouvoir les retrouver avec un grand nombre de requêtes ayant des syntaxes différentes dans un temps très court (par exemple moins de deux minutes), et faire par exemple :
- un vecteur qui présente tous les variants homozygotes de tous les individus, ou d'un seul,
- un vecteur pour toutes les fréquences,
-d'autres vecteurs pour d'autres catégories.
Le procédé permet en travaillant en amont sur les données et en préparant a priori les requêtes attendues par l'utilisateur (connaissant ses demandes et besoins de connaissance de ses recherches) de sortir des résultats très rapidement pour l'utilisateur, en temps réel ou très rapidement (moins de deux minutes), tout en traitant des centaines de milliers ou des millions de variants différents. Par exemple sur la vitesse du procédé , sur un serveur composé de deux processeurs 8 core Intel(R) Xeon(R) X5550 @ 2.67GHz, sur un projet de séquençage de génome complet composé de 48 échantillons 240 000 000 de variants ( 15 familles trio ), une requête affichant les variants avec une fréquence inférieur a 1 % non synonyme et suivant un modèle récessif est effectué en 1 mn pour une utilisation de moins de 1 Go de mémoire. En ce sens, le procédé peut être qualifié de temps réel.
Le procédé est représenté sur les figures et décrit comme suit.
Il est d'abord listé l'ensemble des variants comme représenté sur la figure 2.
Comme représenté figure 3a, il est ensuite défini et créé un index, ce qui permet de construire un grand vecteur de bits V qui comprend tous les variants et présente ici dans les exemples illustrés le bit 1 pour le signaler, le bit 1 à la jème position correspondant à la présence du variant Vj dans le vecteur de bits V.
Il est alors transformé les données par verticalisation des lignes comme représenté sur les figures 4a et 4b pour créer des grands vecteurs de bits VAi.
Il est ensuite calculé des petits vecteurs VB, correspondant aux régions génomiques Ri, et des vecteurs VB,,k spécifique des régions génomiques, comme illustré sur les figures 5a, 5b, 6a et 6b. Par exemple, il est représenté sur la figure 5a :
-un petit vecteur de bits VBi associé à une catégorie Bi permet de déterminer tous les variants présents sur le gène A situé le chromosome 1 , dans les positions des séquences d'acides nucléiques suivantes : 1510-1615 (dans les grands vecteurs cela correspond à la position de 2 à 18 par exemple de VA1 et de V) ; -un deuxième petit vecteur de bits VBi,i associé à une catégorie Βι,ι , permet de déterminer tous les variants présents sur le gène A situé sur le chromosome 1 , dans les positions des séquences d'acides nucléiques suivantes : 1510-1615 (dans grands vecteurs cela correspond à la position de 2 à 18 par exemple de VAi et V) et qui sont exons;
-un troisième petit vecteur de bits VBi,2 associé à une catégorie Bi, 2 permet de déterminer tous les variants présents sur le gène A situé sur le chromosome 1 , dans les positions des séquences d'acides nucléiques suivantes : 1510-1615 (dans les grands vecteurs cela correspond à la position de 2 à 18 par exemple de VA1 et V) et qui sont codants;
-un quatrième petit vecteur de bits VBi,3 associé à une catégorie Bi,3 permet de déterminer tous les variants présents sur le gène A situé sur le chromosome 1 , dans les positions des séquences d'acides nucléiques suivantes : 1510-1615 (dans les grands vecteurs cela correspond à la position de 2 à 18 par exemple de VA1 et V) et qui sont ARN non codants;
Et ainsi de suite avec pour toutes les catégories de caractérisation des variants associées aux grands vecteurs et toutes les catégories associées aux petits vecteurs, décrites par exemple sur l'ensemble des figures 4a à 6b.
Le procédé permet de compter et d'afficher le nombre de variants et de faire : des premières opérations logiques sur les grands vecteurs et ensuite, une fois garder les variants qui semblent d'intérêt, d'affiner en faisant des deuxièmes opérations logiques sur les petits vecteurs afin de ne présenter plus qu'un nombre d'acceptable de variants/gènes d'intérêt à examiner de plus près.
Dans ce cas, cette séparation des calculs entre d'une part les grands vecteurs et ensuite les petits vecteurs, permet de diminuer notablement les temps de calcul, les opérations logiques sur les petits vecteurs plus coûteuses que celles sur les grands vecteurs ne sont réalisées dans un second temps que sur les variants issus des opérations logiques sur les grands vecteurs.
En alternative, il est aussi possible de travailler et de faire des opérations logiques sur les petits vecteurs puis une fois certains variants Vj retenus de faire des opérations logiques sur ces variants que l'on redispose dans les grands vecteurs (en ajoutant des valeurs nulles afin d'agrandir la taille des petits vecteurs pour obtenir une taille amendée égale à celle des grands vecteurs) pour éliminer les variants qui ne présentent pas d'intérêt et croiser les petites vecteurs avec des grands vecteurs.
Après avoir réalisé les étapes (a), (b), de catégorisation des variants Vj, le procédé comprend avantageusement :
-dans une troisième étape (c), de faire des requêtes simples et/ou des requêtes complexes de filtres sur les variants Vj, qui sont décomposées en un ou plusieurs opérations logiques portant sur les différents vecteurs VA et sous-vecteurs de bits VB, et VBik, et qui sont réalisées très rapidement en raison de la deuxième étape (b) préalable de production des vecteurs de bits ;
-dans une quatrième étape (d), les résultats sont sélectionnés et affichés en comptant le nombre de bit encore à 1 dans les vecteurs de bits VA ,VB, et VB,k.
Plus précisément, les résultats seront sélectionnés en comptant le nombre de bits, ici encore égal à 1 , dans:
- les vecteurs de bits VA: soit par appartenance des variants Vj aux échantillons, soit par appartenance des variants Vj à des groupes, soit par appartenance des variants Vj à un chromosome ;
- les sous-vecteurs de bits VB, par appartenance des variants Vj à des gènes donnés ;
- les sous-vecteurs de bits catégorisés VB,k par appartenance des variants Vj à des catégories de variants des gènes donnés. Dans une cinquième étape (e), on réalise la correspondance entre le ou les variants d'intérêt, en utilisant la position du bit et les premières et secondes tables de référence, et le ou les gènes d'intérêt qui présentent le ou les variants restants après les opérations logiques.
Grâce au procédé et à la catégorisation préalable réalisée dans les étapes de (a) à (c), on élimine beaucoup de variants juste en comptant les 1 (ou les 0 en fonction de la signification donnée au bit égal à 1 et au bit égal à 0), et ensuite quand il reste les variants intéressants on détermine ceux qui appartient (ou pas) à des gènes et qui ont des fonctions d'intérêt (ou pas).
Dans une sixième (f), on affiche les annotations spécifiques aux variants d'intérêt (variants restants) ou aux gènes d'intérêt associés à ces variants d'intérêt. Les requêtes peuvent être réalisées sur plusieurs millions de variants (avec une optimisation de la mémoire et du temps de calcul.)
Pour les opérations logiques portant sur les différents vecteurs de bits on peut réaliser une opération logique entre les vecteurs de même taille, par exemple :
- entre les vecteurs de bits VAi ; ou
-entre les sous-vecteurs de bits VB, et/ou VB,k
On peut aussi réaliser une opération logique entre des vecteurs de différentes tailles: - entre les vecteurs de bits VAi et les sous-vecteurs de bits VB, et/ou VB,k, les sous- vecteurs VB, et/ou VB,k étant complétés de façon artificelle par des bits (égaux à zéro) pour avoir une taille égale à la taille T des grands vecteurs de bits VAi .
Les opérations logiques sont par exemple une intersection ou une différence. Elles permettant de faire ressortir les variants Vj communs ou différents, entre les vecteurs de bits, de même taille ou pas, les variants communs étant représentés par un bit, égal ici à 1 , à la même position :
- entre les vecteurs de bits VAi, ou
-entre les vecteurs de bits VB, et/ou VB,k
On peut par exemple croiser les variants Vj sélectionnés d'échantillons différents appartenant à au moins deux familles différentes. II est illustré schématiquement le fonctionnement du procédé et les opérations logiques entre les différents vecteurs de bits sur les figures 7a à 8c.
Après la création de l'index (figure 7a), il est déterminé sur la figure 7b quels variants à quel individu P1 , P2 (leur appartenance étant signalée par un bit égal à 1 ), et sur la figure 7c quels variants ont en commun les deux individus.
Il est ensuite ou en parallèle déterminé les régions génomiques R, et le nombre et le numéro (index ou position) des variants Vj dans ces régions génomiques Ri, comme illustré sur la figure 8a qui représente la première table de référence.
Ici, il y a, par exemple, la région génomique ACKA et la région génomique ATG qui sont de tailles différentes, la première ayant deux variants, la seconde ayant 9 variants dont 1 variant commun avec la région génomique ACLA. Pour chaque région génomique Ri, ici ACKA et ATG, il est déterminé figure 8b des sous-catégories ici exonic et splice, et calculé des vecteurs de bits associés pour déterminer si les variants Vj sont présents dans ces catégories (présentent ces fonctions). Comme résumé sur la figure 8c, il est, ainsi, calculé les vecteurs de bits qui notent les variants appartenant à : - P1 et P2, et Exonic et Splice pour ACKA ; il y en a un seul, il s'agit du variant situé à la deuxième position sur l'index, ce qui est représenté par le vecteur de bits à deux colonnes ;
-à P1 et P2, et Exonic et Splice pour ATG, il n'y en a pas ce qui est représenté par le vecteur de bits à neuf colonnes.

Claims

REVENDICATIONS
1 . Procédé de traitement de données issues d'un séquençage haut débit pour traiter/analyser les séquences d'acides nucléiques correspondant à l'exome ou au génome de plusieurs échantillons biologiques,
afin de trouver, parmi les dites séquences d'acides nucléiques, au moins un gène possiblement impliqué dans un phénotype d'intérêt, à partir des variants Vj détectés dans un chromosome donné, j prenant les valeurs de 1 à T, T étant égal au nombre total de variants détectés dans le chromosome,
comprenant une première étape (a) d'indexation dans laquelle :
- pour chaque chromosome, on définit une table d'indexation contenant l'ensemble des variants Vj indexés suivant leur position génomique, les variants Vj étant définis suivant un libellé unique composé de leur emplacement sur le chromosome et de la séquence du dit variant Vj, caractérisé en ce que le procédé présente :
- une deuxième étape (b) d'annotation de caractérisation des variants indexés de la première étape (a),
dans laquelle on définit des catégories d'annotation et on calcule des vecteurs de bits associés aux catégories d'annotation, les bits indiquant l'appartenance de ces variants Vj aux catégories d'annotation de façon à permettre des opérations logiques entre les catégories d'annotation, l'appartenance de ces variants Vj étant indexée dans les vecteurs de bits par la position génomique des variants Vj lors de l'étape (a), en notant dans les vecteurs de bits, par un bit à la position j du vecteur de bits l'appartenance ou non de ce variant Vj à ces catégories d'annotation,
-une troisième étape (c) de requêtes de filtre sur les variants Vj, les requêtes étant décomposées en une ou plusieurs opérations logiques portant sur les différents vecteurs.
2. Procédé selon la revendication 1 , dans lequel il est calculé plusieurs tailles de vecteurs de bits.
3. Procédé selon l'une des revendications 1 à 2, dans lequel : des premiers vecteurs de bits VAi de taille T sont calculés et associés à des premières catégories d'annotation Ai, I étant un entier naturel supérieur ou égal à 1 , les premières catégories d'annotation A comprenant les catégories suivantes :
appartenance à un échantillon ;
- hétérozygote pour un échantillon donné ;
- homozygote pour un échantillon donné ;
appartenance à un groupe d'échantillons, tel qu'une famille ;
fréquence des variants Vj dans des bases de données.
4. Procédé selon l'une des revendications 1 à 3, dans lequel, dans la deuxième étape (b), pour optimiser les requêtes et la mémoire pour chaque région génomique R,:
- on définit une table de référence décrivant les différentes régions génomiques Ri de tous les chromosomes,
chaque région génomique étant décrite par une position initiale et une position finale sur un chromosome,
ces deux positions permettant de trouver l'index du premier variant et l'index du dernier variant de cette région génomique Ri,
- on définit des catégories d'annotation B, correspondant aux régions génomiques Ri, -on calcule des sous- vecteurs de bits VBi de taille inférieure à la taille T des vecteurs
VA,
la première position du vecteur VB, indique par un bit l'appartenance du premier variant présent dans la région génomique Ri ; et la dernière position du vecteur VB, indique par un bit l'appartenance du dernier variant présent dans la dite région génomique Ri.
5. Procédé selon la revendication 4, dans lequel pour chacun de ces sous-vecteurs VBi, on calcule un sous- vecteur VB,k associé à une seconde catégorie d'annotation B,k spécifique à la région génomique R,, et pour chaque variant Vj présent dans cette région génomique Ri, on note l'appartenance de ce variant Vj à cette catégorie B,k dans le sous-vecteur VB,k par un bit , à la j - J0 position, J0 étant la position du premier variant de la région génomique R, dans la table de référence.
6. Procédé selon la revendication 5, dans lequel les secondes catégories d'annotation Bik spécifiques à la région génomique Ri comprennent les catégories suivantes:
- non synonyme et synonyme,
-mutation génétique causée par insertion/délétion changement ou non du cadre de lecture,
- région intronique,
- région d'épissage accepteur donneur,
- Micro ARN,
-gain ou perte de stop,
-RNA non codant,
-pseudogène,
-région non traduite,
-outil de prédiction de pathogénicité ;
- décalage ou non du cadre de lecture.
7. Procédé selon l'une des revendications 3 à 6, dans lequel les requêtes de filtres sur les variants Vj, sont décomposées en une ou plusieurs opérations logiques portant sur les différents vecteurs VAi et/ou sur les différents sous-vecteurs de bits VB, et VB,k.
8. Procédé selon l'une des revendications 1 à 7, dans lequel la troisième étape (c) d'exécution de requête est réalisée dans un temps inférieur ou égal à la durée d'une connexion http.
9. Procédé selon l'une des revendications 7 à 8, dans lequel on affiche des résultats dans une quatrième étape (d), les résultats étant sélectionnés et affichés en comptant le nombre de bit signalant l'appartenance ou non des variants dans les vecteurs de bits VAi, VBi et VBik des premières et secondes catégories sélectionnés Ai, B,, B,k.
10. Procédé selon l'une des revendications 1 à 9, dans lequel les requêtes sont réalisées sur plusieurs millions de variants.
1 1 . Procédé selon l'une des revendications 7 à 10, dans lequel on réalise une opération logique entre des vecteurs de même taille:
- entre les vecteurs de bits VA ; ou
-entre les sous-vecteurs de bits VB, et/ou VB,k .
12. Procédé selon l'une des revendications 7 à 10, dans lequel on réalise une opération logique entre des vecteurs de différentes tailles:
- entre les vecteurs de bits VA et les sous-vecteurs de bits VB, et/ou VBik,
les sous-vecteurs VB, et/ou VB,k étant complétés par des bits supplémentaires signalant la non appartenance aux catégories B, et /ou B,k des variants supplémentaires Vj associés aux bits supplémentaires, pour avoir une taille égale à T afin de permettre l'opération logique.
13. Procédé selon l'une des revendications 1 1 à 12, dans lequel l'opération logique est une intersection ou une différence.
14. Procédé selon l'une des revendications 1 à 13, dans lequel le phénotype d'intérêt est une maladie rare.
15. Procédé selon l'une des revendications 1 à 14, dans lequel le phénotype d'intérêt est un cancer, et les échantillons sont une cellule saine et une cellule malade d'un individu ou plusieurs individus.
PCT/EP2017/072924 2016-09-12 2017-09-12 Polyweb d'analyse de données de séquençage haut debit Ceased WO2018046766A1 (fr)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
FRFR1670506 2016-09-12
FR1670506A FR3055994B1 (fr) 2016-09-12 2016-09-12 Procede de traitement de donnees issues d'un sequencage haut debit pour traiter/analyser les sequences d'acides nucleiques correspondant a l'exome ou au genome de plusieurs echantillons biologiques

Publications (1)

Publication Number Publication Date
WO2018046766A1 true WO2018046766A1 (fr) 2018-03-15

Family

ID=57861170

Family Applications (1)

Application Number Title Priority Date Filing Date
PCT/EP2017/072924 Ceased WO2018046766A1 (fr) 2016-09-12 2017-09-12 Polyweb d'analyse de données de séquençage haut debit

Country Status (2)

Country Link
FR (1) FR3055994B1 (fr)
WO (1) WO2018046766A1 (fr)

Citations (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
WO2013070634A1 (fr) 2011-11-07 2013-05-16 Ingenuity Systems, Inc. Procédés et systèmes pour l'identification de variants génomiques causals

Patent Citations (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
WO2013070634A1 (fr) 2011-11-07 2013-05-16 Ingenuity Systems, Inc. Procédés et systèmes pour l'identification de variants génomiques causals

Non-Patent Citations (3)

* Cited by examiner, † Cited by third party
Title
BRENT S. PEDERSEN ET AL: "Vcfanno: fast, flexible annotation of genetic variants", GENOME BIOLOGY, vol. 17, no. 1, 1 June 2016 (2016-06-01), XP055374338, DOI: 10.1186/s13059-016-0973-5 *
JAREDC ROACH ET AL: "Chromosomal Haplotypes by Genetic Phasing of Human Families", AMERICAN JOURNAL OF HUMAN GENETICS, AMERICAN SOCIETY OF HUMAN GENETICS, CHICAGO, IL, US, vol. 89, no. 3, 30 July 2011 (2011-07-30), pages 382 - 397, XP028389382, ISSN: 0002-9297, [retrieved on 20110803], DOI: 10.1016/J.AJHG.2011.07.023 *
MIAOXIN LI ET AL: "Robust and rapid algorithms facilitate large-scale whole genome sequencing downstream analysis in an integrative framework", NUCLEIC ACIDS RESEARCH, 23 January 2017 (2017-01-23), pages gkx019, XP055374344, ISSN: 0305-1048, DOI: 10.1093/nar/gkx019 *

Also Published As

Publication number Publication date
FR3055994A1 (fr) 2018-03-16
FR3055994B1 (fr) 2019-10-11

Similar Documents

Publication Publication Date Title
Haas et al. Improving the Arabidopsis genome annotation using maximal transcript alignment assemblies
Pflug et al. Measuring genome sizes using read-depth, k-mers, and flow cytometry: methodological comparisons in beetles (Coleoptera)
Moyer et al. Comprehensive database and evolutionary dynamics of U12-type introns
Lander The new genomics: global views of biology
Doncheva et al. Cytoscape StringApp: network analysis and visualization of proteomics data
Reinert et al. Alignment of next-generation sequencing reads
Sorek et al. A novel algorithm for computational identification of contaminated EST libraries
Yang et al. Orthology inference in nonmodel organisms using transcriptomes and low-coverage genomes: improving accuracy and matrix occupancy for phylogenomics
Yi et al. Stochastic search variable selection for identifying multiple quantitative trait loci
Pisani Identifying and removing fast-evolving sites using compatibility analysis: an example from the Arthropoda
Guenay-Greunke et al. Handling of targeted amplicon sequencing data focusing on index hopping and demultiplexing using a nested metabarcoding approach in ecology
CA3019336A1 (fr) Procedes d&#39;analyse de donnees numeriques
Zhou et al. The sequence and de novo assembly of Takifugu bimaculatus genome using PacBio and Hi-C technologies
Money et al. Characterizing the phylogenetic tree-search problem
Chu et al. The landscape of human SVA retrotransposons
Li et al. Chromosome-level assembly of the mustache toad genome using third-generation DNA sequencing and Hi-C analysis
Comte et al. PhylteR: efficient identification of outlier sequences in phylogenomic datasets
Schneider et al. voyAGEr, a free web interface for the analysis of age-related gene expression alterations in human tissues
Moles et al. Tightening the girdle: phylotranscriptomics of Polyplacophora
Steenwyk et al. Integrative phylogenomics positions sponges at the root of the animal tree
Schon et al. Bookend: precise transcript reconstruction with end-guided assembly
Lum et al. Consistency of SINE insertion topology and flanking sequence tree: quantifying relationships among cetartiodactyls
You et al. LanceletDB: an integrated genome database for lancelet, comparing domain types and combination in orthologues among lancelet and other species
Bhattarai et al. Genome assembly and annotation of the mermithid nematode Mermis nigrescens
Nickel et al. Human PAML browser: a database of positive selection on human genes using phylogenetic methods

Legal Events

Date Code Title Description
121 Ep: the epo has been informed by wipo that ep was designated in this application

Ref document number: 17765431

Country of ref document: EP

Kind code of ref document: A1

NENP Non-entry into the national phase

Ref country code: DE

122 Ep: pct application non-entry in european phase

Ref document number: 17765431

Country of ref document: EP

Kind code of ref document: A1