EP4591308A1 - Procede bio-informatique de determination de regions cibles therapeutiques - Google Patents

Procede bio-informatique de determination de regions cibles therapeutiques

Info

Publication number
EP4591308A1
EP4591308A1 EP23790046.9A EP23790046A EP4591308A1 EP 4591308 A1 EP4591308 A1 EP 4591308A1 EP 23790046 A EP23790046 A EP 23790046A EP 4591308 A1 EP4591308 A1 EP 4591308A1
Authority
EP
European Patent Office
Prior art keywords
residues
sequences
protein
target
bonds
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
EP23790046.9A
Other languages
German (de)
English (en)
Inventor
Anne Vanet
Michel Petitjean
Aurélie PERRIER PINEAU
Valentin OZEEL
Julie LAO
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Centre National de la Recherche Scientifique CNRS
Ecole Nationale Superieure de Chimie de Paris ENSCP
Universite Paris Cite
Original Assignee
Centre National de la Recherche Scientifique CNRS
Ecole Nationale Superieure de Chimie de Paris ENSCP
Universite Paris Cite
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Centre National de la Recherche Scientifique CNRS, Ecole Nationale Superieure de Chimie de Paris ENSCP, Universite Paris Cite filed Critical Centre National de la Recherche Scientifique CNRS
Publication of EP4591308A1 publication Critical patent/EP4591308A1/fr
Pending legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G16INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
    • G16BBIOINFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR GENETIC OR PROTEIN-RELATED DATA PROCESSING IN COMPUTATIONAL MOLECULAR BIOLOGY
    • G16B15/00ICT specially adapted for analysing two-dimensional [2D] or three-dimensional [3D] molecular structures, e.g. structural or functional relations or structure alignment
    • G16B15/30Drug targeting using structural data; Docking or binding prediction

Definitions

  • TITLE BIOINFORMATICAL METHOD FOR DETERMINING THERAPEUTIC TARGET REGIONS TECHNICAL FIELD
  • the present application concerns a bioinformatics method for identifying reliable and durable therapeutic target regions, in order to optimize the search for new drugs, particularly antivirals.
  • STATE OF THE ART RNA viruses still represent a serious public health problem. Indeed, their high mutation rate allows them to quickly acquire resistance to these treatments. To prevent the emergence of resistance, it is recommended to prioritize invariant amino acids. Indeed, mutations in highly conserved positions lead to deterioration or alteration of biological functions and could thus render the virus non-viable. However, due to their very small number, the invariant positions alone cannot constitute binding sites for a drug.
  • Lao J. et al. also propose to identify pairs of covariant mutations called “lethal synthetics” (SL) [Brouillet et al., Petitjean et al.]. SLs represent mutations that are not lethal but, when combined, render the virus nonviable. These SLs have already been studied in the search for anticancer drugs [Kuiken HJ, and Beijersbergen RL] and anti-HIV agents. Lao et al. proposes a series of computational steps to identify the best target residues that, once mutated or blocked by a drug, could substantially affect the biological function of the targeted pathogen. The method proposed in Lao et al. however, has disadvantages.
  • the targets identified by this method are not described in a manner sufficiently precise, which penalizes the user in his development program. For example, this method does not reveal whether the target proposed by the software has a large number of invariant residues, a determined volume or is unlikely to mutate in the future. Furthermore, it does not take into account the fact that the batch of initial sequences may not be very usable or, on the contrary, very reliable and therefore highly predictive. Finally, this method lacks crucial information to establish the relevance of the identified targets: the nature of the chemical bonds that may exist between the residues of the candidate protein and more particularly in the target region. This biochemical information would make it possible to strengthen the validity of the targets identified by the genetic approach of Lao et al. and select the most relevant ones.
  • the invention aims to improve the method of Lao et al. For this, the present inventors propose to integrate into this method steps based on the 3D structure and the intramolecular chemical interactions of the target protein.
  • a method of this type must be able to generate results quickly, whether on proteins from different microorganisms, or on proteins from different variants of the same microorganism. It is therefore important to be able to have a rapid and safe method for processing several proteins in parallel, making it possible in particular to take into account the 3D structures of proteins from known variants. All of these improvements make it possible to improve the reliability and interest of the method described in Lao et al., which was theoretical but difficult to use (because it was insufficiently described and poorly documented).
  • the method of the present invention is more effective and more reliable than that described in Lao et al., to the extent that it has been scientifically enriched and supplemented by new criteria making it possible to describe finely, both statistically and biochemically, the targets detected. Thanks to these improvements, the method of the invention becomes essential for identifying important target regions on pathogenic organisms, with a view to allowing researchers to design the drugs of tomorrow.
  • a computer-implemented method for determining at least one therapeutic target region on a candidate protein of a target pathogenic organism, said method comprising the following steps: a) Identification, in a set of sequences nucleotides and polypeptides characteristic of said candidate protein, previously aligned, with invariant residues and/or pairs of lethal synthetic residues called target residues; b) Identification of at least one candidate region consisting of at least one pair of target residues identified in step a), said at least one pair comprising target residues located at a determined distance in space and being exposed to the surface of the candidate protein, preferably in a pocket; c) Determination of the advantageous chemical interactions between each residue and/or between each pair of residues within the candidate protein, from the 2D and/or 3D structure of the candidate protein; said chemical interactions advantageous being hydrophobic bonds and/or hydrogen bonds and/or salt bridges and/or bonds with negative repulsions and/or positive repulsions; d) Selection of residues linked by said advantageous chemical interactions
  • the step of identifying the advantageous chemical interactions consists of a determination of the chemical interactivity of each residue within the protein and/or a determination of the chemical interactivity of each pair of residues spaced a determined distance; - the distance determined in step b) is between 2 and 8 Angstroms, preferably 5 Angstroms; - the method comprises an evaluation of the chemical interactivity of the determined bonds comprising a calculation of at least one score among: a percentage of hydrophobic bonds and/or a percentage of hydrogen bonds and/or, a percentage of salt bridges and/or a percentage of bonds with negative repulsions and/or a percentage of bonds with positive repulsions and/or a percentage of chemical bonds; - the target region is a pocket identified from a set of aligned 3D structures of the candidate protein and in which the chemical interactions are determined on a set of aligned 3D structures of the candidate protein; - the
  • the invention aims to identify a therapeutic target region on the sole basis of the chemical interactions which exist between the residues of the region.
  • a computer-implemented method for determining at least one therapeutic target region on a candidate protein of a target pathogenic organism, said method comprising the following steps: a) Determination of the advantageous chemical interactions between each residue and/or between each pair of residues within the candidate protein, from the 2D and/or 3D structure of the candidate protein; said advantageous chemical interactions are hydrophobic bonds and/or hydrogen bonds and/or salt bridges and/or with negative repulsions and/or positive repulsions; b) Selection of residues linked by said advantageous chemical interactions, said residues being at a distance of at most 10 Angstroms, said residues forming a therapeutic target region.
  • FIG. 1 illustrates a diagram of the stages of a A computer-implemented method of determining at least one therapeutic target region on the surface of a candidate protein of a pathogenic organism.
  • the highlighted bonds are those corresponding to couples already defined by the technique described in Lao et al and therefore confirmed by the chemical method of the invention, connecting pairs or groups of amino acids at a suitable distance (highlighted in gray); these couples will therefore be selected within the framework of the method of the invention.
  • Figure 3 highlights the amino acids of interest selected in Figure 2 within the amino acids identified after implementation of steps E1 and E2 of the method of the invention (for more details, see Figure 3 de Lao et al.) DETAILED DESCRIPTION OF THE INVENTION
  • the present invention relates to a computer-implemented method for determining at least one therapeutic target region on the surface of a candidate protein of a pathogenic organism.
  • target pathogenic organism we mean here any type of organism that can cause disease in a “host” (such as a human being, a plant or an animal). This organism is preferably a microorganism such as a virus, a bacteria, a parasite, a fungus, a protozoa (amoeba, sporozoa or flagellates), etc.
  • a harmful macro-organism such as a worm (belonging for example to the group of helminths, platyhelminths such as trematodes or cestodes, or nemathelminthes such as Ascaris, Toxocara, or Trichuris nematodes) or a insect.
  • helminths such as trematodes or cestodes
  • nemathelminthes such as Ascaris, Toxocara, or Trichuris nematodes
  • target pathogenic organism of tumor cells or cells infected by a pathogenic microorganism such as a virus, a bacteria, etc.
  • these cells often express on their surface or in their cytoplasm (or even in their nuclei) proteins involved in maintaining the proliferation signals of these cells, resistance to cell death, escape from the immune system, angiogenesis, activating invasion and metastasis, replicative immortality, escape from growth factor suppressors, reprogramming of energy metabolism, which amplifies the disease (cancer or infection). It is therefore entirely logical to use the method of the invention to identify target regions suitable for therapeutic research, on proteins which are also involved in these disorders.
  • Pathogenic organisms are essentially made up of proteins, some of which are necessary for their development, their infectivity and/or their pathogenicity. For each known pathogen, numerous proteins of this type have been identified and constitute a preferred target for researchers in the pharmaceutical industry.
  • these proteins will be called “candidate proteins”, in that they have been previously identified as candidates potentially having an impact on the development, infectivity and/or pathogenicity of an organism. pathogen of interest.
  • a molecule to be selected as a “drug” it must have a substantial influence, in the short, medium or long term, on the function of at least one of these candidate proteins. To do this, it must first be able to come into contact with the candidate protein (if possible, thanks to several contact zones).
  • a “therapeutic target region” is therefore called a privileged contact zone between a drug and a candidate protein, said zone having been selected in such a way that the interaction between these two elements (the drug of on the one hand and the protein on the other hand) can chemically be strong, stable and significantly influence the biological function of the protein.
  • a candidate protein which is known to act on the development, infectivity and/or pathogenicity of the pathogenic organism that is being studied , has been identified.
  • this candidate protein must be known and well described in the literature.
  • polypeptide sequences and 3D sequences must have already been characterized in the art, and be easily accessible.
  • Nucleotide sequences encoding these polypeptide sequences must also be known. All these sequences are generally provided in official and openly accessible databases. The sequences of these bases, hereinafter called “BDD1”, are generally anonymized, freely accessible and uploaded by various international research units. These are for example the bases Genbank, NCBI, INSDC, EMBL, HIVDB, LANL, FLUDB, GISAID, etc., well known to those skilled in the art. In a step prior to the process of the invention, a polypeptide sequence and a reference nucleotide sequence must be selected (step E0).
  • reference sequences can be chosen from a phylogenetic tree (in this case, the reference sequence is at the root of the tree representing the sequences studied) or, if the tree does not exist, by recalculating a ancestral sequence, reconstructed by one of the following three methods: parsimony, maximum likelihood or Bayesian method.
  • This reference sequence can also be a consensus sequence from the batch of sequences studied, but in this case it only serves to be compared to other sequences, because a sequence Computed consensus may be a sequence that never existed, so it is not necessarily functional. Subsequently, the other known/listed nucleotide and polypeptide sequences for this candidate protein are identified in the “BDD1” databases. These additional sequences will hereinafter be called “initial sequences”.
  • a protein must perform a certain number of functions which are only achievable if it adopts a certain structure in space and has the chemical radicals in the appropriate location. This is called the structure-function link.
  • certain mutations change the structure of the protein and thus cause it to lose one or more functions. If these functions are essential, it follows that the virus becomes non-replicative and can therefore no longer develop.
  • These mutations are mainly of three kinds: invariant positions, pairs of lethal synthetics and pairs of compensatory mutations.
  • a single mutated invariant position renders the protein non-functional, when to achieve the same goal, two positions must be mutated in the case of pairs of lethal synthetics.
  • a compensatory mutation pair is defined as follows: a first mutation renders the protein non-functional but a second could appear and restore the function of the protein studied. In these three cases, a strong constraint is imposed on the protein.
  • these initial sequences are first processed to select invariant residues and/or pairs of lethal synthetic residues (step E1). Once these invariant residues and/or pairs of synthetic lethal residues are known, at least one candidate region is identified, based on other structural criteria (step E2). Steps E1 and E2 were described by Lao et al.
  • a region containing at least two or three amino acids of interest which have been selected to be invariant residues and/or lethal synthetic covariant residues (SL) is called “candidate region from E2”. not deriving from a common ancestor, close to each other, exposed on the surface of the candidate protein and possibly in a pocket, thanks to the steps E1 and E2 of the present application, that is to say according to the method described in Lao et al.
  • the method of the invention provides for determining the chemical bonds involved globally between the residues of the protein, and in particular between the residues located in the candidate region (steps E3, E4, E5 in Figure 1).
  • At least one candidate region most likely to be an effective therapeutic target is identified.
  • the method of the invention thus makes it possible to select, among the candidate regions obtained by following the indications of Lao et al., the therapeutic target region(s) most likely to allow the identification of effective drugs.
  • one or more scores can advantageously be calculated to verify that the information resulting from each step of the method of the invention is relevant for the rest of the process and in relation to the expected results. These scores provide researchers with information on the quality and therefore reliability of the results obtained. For the sake of readability of the description, the detailed expressions of the scores are given at the end of the description.
  • Step E1 consists of identifying, in a set of nucleotide and polypeptide sequences, characteristic of said candidate protein, and previously cleaned and aligned, the invariant residues and/or pairs of synthetic covariant residues lethal, which will be called, in the context of the invention, “target residues”.
  • the databases used to store the sequences of pathogenic organisms may contain erroneous sequences, which, if not eliminated, could generate false results. This is why, in the method of the invention, the initial sequences must first be “cleaned” (step E11).
  • This “cleaning” consists of filtering the initial sequences, for example in the following way: ⁇ Initial sequences having a length different from the sequence chosen as reference can be excluded (if the batch of initial sequences contains sufficient sequences); ⁇ If the batch of initial sequences does not contain many sequences and if the alignment seems possible (because the sequences do not contain hyper variable regions, and few poorly described regions), an alignment can be carried out to homogenize the lengths. In practice, from sequences of variable lengths, we obtain an alignment of a single length, which is greater than the length of the sequence having the greatest length. ⁇ Initial sequences with a number of mutations greater than three standard deviations from the average number of mutations per sequence are excluded.
  • N-terminal and C-terminal ends of the initial sequences are identified and the sequences are oriented in the same direction, so that their ends can be superposed (for example all the sequences can be oriented from the N-end terminal towards the C-terminus).
  • This cleaning step E11 also makes it possible to identify, among all the initial sequences, those which have heterogeneous lengths and/or makes it possible to exclude sequences which present unacceptable anomalies.
  • anomalies are, for example, an aberrant number of mutations, an aberrant number of poorly defined amino acids, an aberrant number of missing amino acids, etc.
  • This function of score f(S1QS) reflects the impact of the sequenced data on the quality of the result obtained at the end of the process. It is also recommended to interrupt the process when the number of mutations belonging to the batches of initial sequences retained after “cleaning” is too low (typically, a number of mutations not allowing statistically correct results, for example which does not allow the calculation of ⁇ ⁇ (covariants having less than 5 representatives)). In this case, it is preferable to select a new set of sequences from the BDD1 database, enrich it by downloading new sequences, or change the candidate protein. Conversely, we consider that we have a good set of initial sequences when at least 1000 sequences of acceptable quality have been identified, these sequences carrying sufficient mutations.
  • acceptable quality we mean here initial sequences presenting a number of anomalies less than three standard deviations from the average number of these anomalies per sequence.
  • the S7 score can be calculated, to measure the total number of initial sequences not containing an aberrant number of mutations. Such an S7 score depends on the S2, S3 and S4 scores presented above. Then, an alignment of the sequences obtained after cleaning is advantageously carried out (step E12).
  • the alignment of the sequences can be implemented according to two possibilities: i) either the sequences all have the same length: in this case the alignment is generated by aligning all the sequences on their N-terminal end, ii) or they n do not all have the same length: in this case it is difficult to use multiple alignment methods, which are generally used for a smaller number of sequences. In this case, it is possible to select a sample representative of the population of sequences studied and to use the HMMER suite (http://hmmer.org) which makes it possible to generate a profile on which all the sequences can then align. one by one (using the hmmbuild and hmmcalibrate functions). This method makes it possible to align hundreds of thousands of sequences in a time of the order of a minute.
  • the quality of the alignment of the sequences can be evaluated (step E12') via the calculation of one or more scores (detailed later) relating to the impact of gaps in the alignment (score S8), the redundancy of the batch of sequence (score S10), the impact of hypervariable regions (score S11), the impact of deletions and insertions (score S12), the impact of post-translational modifications (score S13), and/or the impact of the existence of different subtypes (score S14).
  • the S11, S12, and S13 scores are defined based on data found in the literature.
  • One or more score functions can be calculated at this stage to assess whether the set of aligned sequences after cleaning is sufficiently complete and robust to effectively predict the existence of a therapeutic target region within the selected candidate protein.
  • the score function f(S3) detailed below reflects the quality of the alignment and the possible prediction. Some terms of this function describe the precision with which the initial sequences are described and have an impact on the statistical results (f(S3QS) and other terms of this function show the heterogeneity of the batch of sequences studied and have an impact on the description of the target itself f(S3SC). More precisely, the score function f(S3QS) translates the impact of the alignment on the statistical prediction of the target region and the score function f(S3SC) translates the impact of the alignment on the prediction of the target.
  • the process can be interrupted to be started again from new initial sequences.
  • sequences to test the user has a set of cleaned and aligned sequences called “sequences to test”.
  • sequences to test the invariant residues are then identified (step E13).
  • the “invariant residues” are by definition amino acids which do not change (or almost not) position within the protein, in all the test sequences studied. As sequencing methods are not 100% reliable, an average error rate of 0.3% can be applied (Cheng C. et al, 2022). Thus, in the context of the present invention, a residue is defined as “invariant” if it is present at the same position on at least 99.7% of the sequences to be tested.
  • the quality of the selection of invariant residues can advantageously be evaluated by calculating the mutational richness of the sequences (step E13').
  • the S18 score can be calculated (see below). Thanks to this score, it is possible to verify that the sequences on which the invariant residues have been detected are sufficiently heterogeneous. Indeed, to be able to affirm that a residue is invariant for functional reasons (mutations appeared at this position, but were not selected because they were lethal) it is necessary to be able to show that mutations appeared elsewhere on the sequence. Once the number of invariant residues is known, it is advantageous to determine the percentage of these residues by calculating the S19 score. This score makes it possible to evaluate the impact of invariant positions on the final result.
  • the targets most likely to be stable in the long term are those which are the most invariant, therefore made up of the greatest number of invariant residues. It is also possible to calculate the score function ⁇ ( ⁇ ⁇ ) which makes it possible to evaluate the degree of invariance of the batch of sequences studied, and gives an idea of its long-term mutational incapacity term.
  • noisy's ⁇ ⁇ defined rather in the form (where A and B are the specific amino acids found at positions i and j), which allows to take into account each residue among 20 and not only the mutated or non-mutated state of the original residue.
  • a and B are the specific amino acids found at positions i and j
  • the p-values can be readjusted using a method known by its English name (“false discovery rate”). The residuals are considered “dependent” or “covariant” if their p-value is below 0.05 (Noivirt O. et al.).
  • step E16 it is preferable to eliminate the pairs of covariant residues which share common ancestors. This can be achieved in particular by studying the DNA sequences coding the initial sequences: after alignment of these DNA sequences, the mutated codons causing non-synonymous mutations are identified and selected. Indeed, non-synonymous mutations induce the appearance of different amino acids on a physicochemical level; while, on the contrary, synonymous mutations code for the same residue.
  • a linkage disequilibrium coefficient D' known as Lewontin coefficient
  • Lewontin coefficient can then be calculated with all of the recoded DNA sequence data (differentiating between synonymous and non-synonymous positions).
  • this coefficient couples sharing the same ancestor, whose covariation is therefore not the consequence of functional interdependencies, can be identified. Thanks to these steps, it is possible to determine whether the covariation of the two residues identified as “covariants” in step E14 arises from the coevolution of these two residues or if it is due to the fact that they are phylogenetically linked to an ancestor. common.
  • CM compensatory mutations
  • SL synthetic lethals
  • the S23 score can also be calculated, because it reflects the impact of the number of CMs and their strength on the result.
  • the strength of a pair of covariants is defined by its ⁇ ⁇ ( ⁇ , ⁇ ). Indeed, the higher the ⁇ ⁇ ( ⁇ , ⁇ ), the higher the number of couples observed compared to the number of couples expected if there was no covariation. S22 and S23 therefore define the strength of the covariation for this precise couple.
  • invariant residues and pairs of lethal synthetics are selected as part of at least one “candidate region” of the candidate protein studied. It is here possible to calculate the S9 score which reflects the impact of the variance at the 5' and 3' ends of the sequences.
  • the step which consists of aligning the DNA sequences to identify the covariant residues which share a common ancestor one of the two techniques used consists of aligning all the sequences on their 5' end.
  • the variance of this end reduces the chance of correctly aligning the sequences.
  • the candidate region which will be selected as the best therapeutic target must also satisfy a number of other advantageous conditions.
  • the amino acids that compose it may be subject to constraints due to the 3D structure of the candidate protein.
  • the method of the invention contains a step E2 which evaluates the quality of the candidate regions obtained in step E1 with respect to the position of the amino acids which compose it, in relation to the 3D structure of the candidate protein.
  • Step E2 therefore consists of identifying, among the regions and residues identified in step E1, at least one pair of target residues located at a close distance in space, and being exposed to the surface of the candidate protein, preferably in a pocket.
  • a therapeutic target must be composed of residues that are close to each other in space.
  • the target residues of the candidate region will preferably be separated by a maximum of 10 Angstroms, preferably a maximum of 5 Angstroms.
  • the method of the invention advantageously requires access to the three-dimensional structures known and identified for the candidate protein. These structures are known and described in dedicated 3D structure databases, which we will call here “BDD2”. As for nucleotide and polypeptide sequences, these 3D sequences must often, prior to the method of the invention, have been processed (cleaning step E6, alignment step E7).
  • 3D structures are often in pdb format. However, this format is not applied in the same way by the entire scientific community (format of the file itself, names of subunits or numbering of residues, etc.).
  • a cleaning (step E6) of the structures is preferably implemented, making it possible to define a single and generalized format for all the pdb files used (standardization of the file format, the numbering of residues and atoms, the names of the substructures). units and their respective positions among others).
  • dozens or even hundreds of structures of the same protein are available.
  • the 3D structures identified for the same protein are preferably aligned. These are structural alignments which allow us to know to what extent the structures identified for this protein are different.
  • the alignment is implemented from a reference model. We can then calculate the average difference between all these structures, which we call “RMSD”.
  • RMSD average difference between all these structures
  • a three-dimensional structure is defined by the position in space of each of the atoms that constitute it. If many of these positions are missing (missing data) the 3D structure is shaky in the sense that only part of these atoms have a specific place in the structure. If a lot of data is missing for each of the structures studied (knowing that the missing data is not at the same position in the protein space), it becomes difficult to make a structural alignment and even to compare the residues. found in the same position. The fact that a protein has several subunits further complicates its structure.
  • S15 is, for structures, the equivalent of Sseq for sequences. We look at whether the number of 3D structures known for the candidate protein is high or not. If there are fewer than 200 known 3D structures, this number is insufficient to have a consistent average (this figure may be decreased, however, as 3D structures are increasingly reliable).
  • S16 gives an idea of the variation in the resolutions of the structures. Indeed, 3D structures are determined using different techniques. The two most commonly used are X-ray diffraction and electron microscopy. A resolution threshold is defined for each of these structures, depending on the technique used. S16 evaluates this variation in resolution.
  • S17 shows the structural heterogeneity of the batch of structures studied. Each of the atoms of the structure is aligned with the corresponding atom of the following structure.
  • this function describes the precision with which 3D structures are described and have an impact on the statistical results ⁇ ⁇ ⁇ ⁇ ⁇ and other terms of this function show the heterogeneity of the batch of sequences studied and have a impact on the description of the target itself More precisely, the score function ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ reflects the impact of the alignment on the statistical prediction of the target region and the score function reflects the impact of alignment on target prediction. From the 3D coordinates of all the atoms of the residues in space, the pairs of residues close in space, that is to say separated by less than 5 or 10 Angstroms, are selected (step E21). Furthermore, the accessibility of target residues and/or their exposure to the protein surface must be taken into account.
  • an effective therapeutic target must not be buried in the 3D structure of the protein, otherwise the drug will not be able to reach it.
  • the residues which are buried in the protein are distinguished from those which are exposed on its surface and therefore accessible (to do this, it is possible to use the ASA program for example ).
  • the ASA program for example.
  • candidate regions containing at least two, preferably at least three accessible residues are selected (step E22).
  • scores reflecting accessibility to evaluate the possibility of obtaining sufficient candidate region(s) (step E22').
  • the S32 score evaluates the percentage of accessible positions and the S33 score evaluates the percentage of accessible residues.
  • step E23 it may be advantageous to evaluate whether the candidate region selected previously has a 3D structure comparable to a “pocket” (step E23).
  • structure prediction software for example the Fpocket software (Le Guilloux et al.), in which, to take into account the existence of small and large pockets, it is preferable to reduce the minimum and maximum radii of the alpha spheres to 2.5 ⁇ and 4 ⁇ respectively.
  • the Fpocket software (Le Guilloux et al., 2009) makes it possible to determine all the pockets, whose cardinality is ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ h ⁇ ⁇ ⁇ on the surface of a protein (by providing a three-dimensional structure in entrance).
  • the volume of a pocket capable of housing a small drug molecule preferably meets the following constraints: 60 ⁇ ⁇ ⁇ ⁇ h ⁇ ⁇ 500 ⁇ ⁇ ( ⁇ h ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ )
  • We can calculate the percentage of pocket meeting this criterion for the protein studied ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ h ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ h ⁇ ⁇ ⁇ .
  • the networks of invariant or covariant SL residues close in space, which are exposed on the surface of the candidate protein and preferably in a pocket having a volume between 60 ⁇ 3 and 500 ⁇ 3, will finally be retained .
  • Networks of at least five target residues will preferably be retained.
  • the invariant or covariant residues SL can be represented in the form of graphs (step E8). Indeed, from the detected networks, groups of interdependent residues are formed using mathematical graphs. In these graphs are integrated the invariant residues and the pairs of lethal synthetic residues which form invariance groups.
  • the nodes of the graph are the residues, the edges define the link between the residues (lethal or invariant synthetics, in this case they are linked to all) and only exists if the two residues are positioned less than 10 Angstroms and on the surface of the candidate protein.
  • this type of graph can be visualized using the free Graphviz software. These graphs are a way to evaluate the quality of the identified regions.
  • Step E3 consists of determining whether there are advantageous chemical interactions between the residues and/or between the pairs of residues within the candidate protein, from the 3D structure of the candidate protein.
  • This step E3 can alternatively be limited to the analysis of the advantageous chemical interactions existing between the residues and/or between the pairs of residues selected within the candidate region obtained in step E2, from the 3D structure of this region. candidate. Genetics makes it possible to functionally detect the impact of microscopic physicochemical changes occurring at the residue level. Thus the fact of being invariant (or of being part of an invariance group) is the consequence of the physico-chemical quality of one or more residues (the selection pressure imposes the maintenance of this (s) residue ( s) at this position). Conversely, if the physico-chemistry of a residue is changed (for example by a mutation or by the external environment), the function and/or structure of the region may be affected.
  • the additional steps E3 and E4 therefore make it possible to highlight pairs of amino acids having a chemical interaction influencing their function, or likely to evolve during modifications in the environment of the protein (pH, temperature, ionic strength, etc.).
  • Protein stability is in fact often dependent on pH, and varies depending on the subtype and/or origin of the host organism. For example, human influenza virus hemagglutinin (HA) is more stable than avian virus hemagglutinin (Galloway SE et al.).
  • mutations can lead to changes in the chemical interaction network, and stabilize or destabilize this protein (Byrd-Leotis L. et al.).
  • the intraprotein physicochemical network consists of several types of interactions, such as hydrophobic, hydrogen interactions, as well as salt bridges, negative repulsive and positive repulsive interactions, among others (Dyson HJ et al.; Hubbard RE & Kamran Haider M.; Sticke DF et al.; Barlow DJ & Thornton J. M; Harrison JS et al.). These interactions allow the protein to have a very particular shape: this is why they are important. If they were not there, the structure of the protein and surely its function would be modified. This is why these regions rich in these chemical bonds are important to determine, in the context of the method of the invention.
  • the process described here therefore contains a step of characterizing the chemical interactions existing between all the atoms of the protein, or at least those present in the candidate region selected previously. This step aims in particular to identify the following interactions (Hubbard RE & Kamran Haider M.; Barlow DJ & Thornton J. M; Harrison JS et al.; Donald JE et al.; Freitas RF de & Schapira M.; Onofrio A. et al.
  • - Hydrogen bonds consisting of a proton donor atom (OG, OG1, NE2, ND2, ND1, NE2, NZ, NE, NH1, NH2, OH, NE1) belonging to a proton donor amino acid (SER, THR, GLN, ASN, HIS, LYS, ARG, TYR, TRP) and a proton acceptor atom (OG, OG1, OE1, OE2, OD1, OD2, ND1, NE2, OH) belonging to a proton acceptor amino acid ( SER, THR, GLU, ASP, GLN, ASN, HIS, TYR).
  • the atoms presenting this type of bond will be selected, when their distance is less than 3.5 ⁇ (Hubbard RE & Kamran Haider M.; Sticke DF et al.).
  • These hydrogen bonds can consist of interaction between two side chains or between a side chain and the main chain of the protein.
  • the proton donors (N) of the main chain or the proton acceptors of this same chain can belong to any amino acid of the main chain.
  • Electrostatic bonds of two kinds: o Attractive bonds (salt bridges or ionic interaction) when a cation (NE, NH1, NH2, NZ, NE2, ND1) of a positively charged residue (ARG, LYS, HIS) , especially when it is at a distance less than 4 ⁇ from an anion (OD1, OD2, OE1, OE2) carried by a negatively charged residue (ASP, GLU).
  • o Repulsive bonds made up of two atoms with identical charges (-/-) or (+/+), especially when they are separated by a distance of less than 5 ⁇ (Barlow DJ & Thornton JM; Harrison JS et al.) .
  • the method of the invention therefore advantageously contains a step of calculating the distance between each atom of the protein, for example from a pdb, SwissProt, uniprot or Modbase file.
  • the distances between atoms belonging to the same position are not calculated unless they belong to different protomers.
  • atoms separated by a distance of at most 5 ⁇ are selected.
  • This step is preferably carried out before listing the chemical interactions between the atoms.
  • only chemical interactions linking nearby atoms need to be taken into consideration.
  • step E3' It is in particular possible to calculate the percentage of hydrophobic bonds and/or the percentage of hydrogen bonds and/or the percentage of salt bridges and/or the percentage of negative repulsions and/or the percentage of positive repulsions and/or the percentage of bonds chemicals (step E3'). It is possible to also calculate a score function ⁇ ( ⁇ ⁇ ) which gives an image of the overall chemical interactions of the protein studied and is calculated (step E3'). Through all these steps, the residues linked by said advantageous chemical interactions, and being at a distance such that these bonds influence the function of these residues, are selected. This is step E4 in Figure 1. At this stage, it is possible to represent the different chemical bonds in the form of graphs (step E8'). Indeed, from the previously detected connections, mathematical graphs are formed.
  • Step E5 makes it possible to identify the best therapeutic target region(s) making it possible to generate a potential drug by crossing the results obtained at the end of step E2 with those obtained at the end of step E4 .
  • the quality of the selected targets can advantageously be evaluated by calculating several scoring functions. For example, it is possible to calculate the invariance of each target region by the function ⁇ ( ⁇ ⁇ ) . The invariance of each target region ensures that it will be stable over time.
  • the function ⁇ ( ⁇ ⁇ ) makes it possible to obtain a score between 0 and 1 for each target S
  • these two score functions make it possible to evaluate the effectiveness of the target region.
  • the target regions can advantageously be represented in the form of graphs (step E8''). Indeed, from the previously detected pairs, groups of interdependent residues by means of mathematical graphs are formed. In these graphs are integrated the invariant residues and the pairs of lethal synthetic residues which form invariance groups, and which are linked by advantageous chemical bonds.
  • the nodes of the graph are the selected positions/residues, the edges define the link between the positions (lethal, invariant synthetics, or advantageous chemical interaction) and only exists if the two residues at this position are positioned at less than 10 Angstroms and on the surface of the candidate protein. Additionally, this type of graph can be visualized using the free Graphviz software. These graphs are an additional way to evaluate the quality of the identified regions.
  • the complexity of the graphs can be calculated (step E8''') by the score S26 as well as the number of connected graphs by the score S27. Such complexity is useful: if the graph is complex, this reflects a significant number of targets. If it is very complex, there may be intersections between non-empty targets.
  • ⁇ ⁇ Sequence length heterogeneity.
  • the mean and ⁇ the standard deviation of the amino acid lengths of the sequences of the sample studied.
  • ⁇ ⁇ > ⁇ ⁇ ⁇ ⁇ 0
  • ⁇ ⁇ 1 ⁇ ( ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ )
  • S4: ⁇ ⁇ Sequences with an aberrant number of gaps.
  • ⁇ ⁇ 1 ⁇ ( ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ) The closer the S4 score is to 1, the more aberrant the number of gaps.
  • ⁇ ⁇ ⁇ allows you to evaluate whether the input data is sufficient and robust for the prediction to be made:
  • ⁇ ⁇ ⁇ ⁇ ⁇ as the total number of files studied and ⁇ the mean and ⁇ the standard deviation of the number of amino acids per file of the sample studied, in comparison to a reference file. This reference file can be chosen in two ways.
  • ⁇ ⁇ is the total number of sequences in the sample excluding sequences with an aberrant number of mutations ⁇ ⁇ ⁇ ⁇ N, ⁇ ( ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ) > 1000, ⁇ ( ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ) ⁇ 1000, S8: ⁇ ⁇ : evaluates the impact of gaps in the alignment. Let us consider ⁇ the mean and ⁇ the standard deviation of the number of gaps calculated by sequences of the sample studied after alignment, in comparison to the same sequence before the alignment.
  • ⁇ ⁇ and ⁇ ⁇ impact of the variance of the 5' and 3' ends.
  • 5 amino acids (AA) from the 5' end and 5 AA from the 3' end are studied.
  • the polypeptide sequences corresponding to the candidate protein can be very heterogeneous or not very heterogeneous in terms of the mutations they carry. An extreme situation may be that out of X sequences, they would all have the same AA sequence. We would then admit that this batch is very homogeneous, that the redundancy is absolute, and therefore would have a score equal to 0. Conversely, when the polypeptide sequences are very different taken two by two, then there is very little redundancy , and the score tends towards 1.
  • ⁇ ⁇ 1 ⁇ ⁇ ⁇ ⁇ ( ⁇ ⁇ ): quality of the alignment of the primary sequences + ⁇ ⁇ + ( ⁇ ⁇ + ⁇ ⁇ + ⁇ ⁇ ) ⁇ 3 ⁇ 2) ⁇ 17 ⁇ ⁇ ⁇ : quality of the statistical prediction of alignment ⁇ ⁇ ⁇ : Impact of alignment on target prediction S18: ⁇ ⁇ : Mutational richness of sequences. Let us consider ⁇ the mean and ⁇ the standard deviation of the number of mutations calculated by sequences of the sample of sequences having a number of mutations ⁇ ⁇ ⁇ , in comparison to a reference sequence.
  • a graph G is defined by a couple (S,A) with S a finite set of vertices, and A a finite set of pairs of vertices (si, sj) in S2.
  • a couple is therefore a pair of vertices connected by an edge. This involves studying the invariant and SL residues involved in several pair relationships (close in space and located on the surface of the protein, being either invariant or involved in a relationship of lethal synthetics). From the link graph, we define this score as the average of the number of edges (a) per node ( ⁇ ) ⁇ S28: ⁇ ⁇ : Number of connected graphs.
  • a graph is connected if each pair of vertices is connected by an edge.
  • S28 ⁇ ⁇ : residues close in space (5 angstroms). This score corresponds to the proportion of pairs of residues located less than 5 angstroms from each other ( ⁇ ). From a reference pdb file, the calculation of the distance between the 2 ⁇ of a pair of residues is carried out for all pairs of residues. The number of pairs being less than 5 angstroms apart is evaluated and noted as ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ .
  • S29 ⁇ ⁇ : residues close in space (10 angstroms). This score corresponds to the proportion of pairs of residues located less than 10 angstroms from each other ( ⁇ ).
  • the number of pairs being separated by less than 5 angstroms is evaluated and noted as ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ .
  • ⁇ ⁇ ⁇ : invariant and close SL in space (10 angstroms) From a reference pdb file, the calculation of the distance between the 2 ⁇ of a residue pair is performed for all residue pairs.
  • the number of pairs separated by less than 10 angstroms is denoted ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ .
  • ⁇ ( ⁇ ⁇ ) score between 0 and 1, for each target ⁇ ( ⁇ ⁇ ⁇ ( ⁇ ⁇ ⁇ 1 ) ) ⁇ 2))) ⁇ 4
  • This scoring function allows us to give a score to each of the targets determined by our software and defines the “druggability” (in English “druggability”) of this target.
  • “Druggability” means being able to effectively bind a small molecule which would have therapeutic capabilities and therefore represent a future drug. To this definition is added that this target would leave little or no possibility of therapeutic escape.
  • the method of the invention was implemented on the hemagglutinin (HA) protein of the influenza virus.
  • Galloway, SE, Reed, ML, Russell, CJ & Steinhauer, DA Influenza HA subtypes demonstrate divergent phenotypes for cleavage activation and pH of fusion: implications for host range and adaptation.
  • PKAD a database of experimentally measured pKa values of ionizable groups in proteins. Database 2019, apel024 (2019). Petitjean M., Badel A., Veitia RA, Vanet A., Synthetic lethals in HIV: ways to avoid drug resistance: Running title: Preventing HIV resistance. Biol Direct. 2015 Apr 17;10:17 Sticke, DF, Presta, LG, Dill, KA & Rose, GD Hydrogen bonding in globular proteins. Journal of Molecular Biology 226, 1143–1159 (1992).

Landscapes

  • Life Sciences & Earth Sciences (AREA)
  • Chemical & Material Sciences (AREA)
  • Engineering & Computer Science (AREA)
  • Bioinformatics & Cheminformatics (AREA)
  • Spectroscopy & Molecular Physics (AREA)
  • Health & Medical Sciences (AREA)
  • Physics & Mathematics (AREA)
  • Biophysics (AREA)
  • Pharmacology & Pharmacy (AREA)
  • Crystallography & Structural Chemistry (AREA)
  • Medicinal Chemistry (AREA)
  • Bioinformatics & Computational Biology (AREA)
  • Biotechnology (AREA)
  • Evolutionary Biology (AREA)
  • General Health & Medical Sciences (AREA)
  • Medical Informatics (AREA)
  • Theoretical Computer Science (AREA)
  • Investigating Or Analysing Biological Materials (AREA)

Abstract

La présente invention concerne un procédé mis en œuvre par ordinateur de détermination d'au moins une région cible thérapeutique sur une protéine candidate d'un organisme pathogène cible, ledit procédé comprenant les étapes suivantes : a) Identification (E1), dans un ensemble de séquences nucléotidiques et polypeptidiques caractéristiques de ladite protéine candidate, au préalable alignées, de résidus invariants et/ou de paires de résidus synthétiques létaux dits résidus cibles; b) Identification (E2) d'au moins une région candidate constituée d'au moins une paire de résidus cibles identifiés à l'étape a), ladite au moins une paire comprenant des résidus cibles situés à une distance déterminée dans l'espace et étant exposée à la surface de la protéine candidate, de préférence dans une poche; c) Détermination (E3) des interactions chimiques avantageuses entre chaque résidu et/ou entre chaque couple de résidus au sein de la protéine candidate, à partir de la structure 2D et/ou 3D de la protéine candidate; lesdites interactions chimiques avantageuses étant des liaisons hydrophobes et/ou des liaisons hydrogènes et/ou des ponts salins et/ou des liaisons à répulsions négatives et/ou à répulsions positives; d) Sélection (E4) des résidus liés par lesdites interactions chimiques avantageuses, lesdits résidus étant à une distance d'au plus 10 Angströms; e) Sélection (E5) d'au moins une région cible thérapeutique parmi les régions candidates identifiées à l'étape b), comprenant les résidus sélectionnés à l'étape d).

Description

TITRE : PROCEDE BIO-INFORMATIQUE DE DETERMINATION DE REGIONS CIBLES THERAPEUTIQUES DOMAINE TECHNIQUE La présente demande concerne un procédé bio-informatique d’identification de régions cibles thérapeutiques fiables et durables, afin d’optimiser la recherche de nouveaux médicaments, notamment antiviraux. ETAT DE LA TECHNIQUE Malgré l'existence de traitements, les virus à ARN représentent toujours un grave problème de santé publique. En effet, leur taux de mutation élevé leur permet d'acquérir rapidement des résistances à ces traitements. Pour prévenir l'émergence de résistances, il est recommandé de cibler en priorité les acides aminés invariants. En effet, des mutations dans des positions hautement conservées conduisent à une détérioration ou à une altération des fonctions biologiques et pourrait ainsi rendre le virus non viable. Cependant, en raison de leur très petit nombre, les positions invariantes ne peuvent constituer à elles seules des sites de liaison pour un médicament. Pour trouver d’autres sites de liaison optimaux accessibles à un médicament, Lao J. et al. proposent d’identifier également des couples de mutations covariantes appelées « synthétiques létaux » (SL) [Brouillet et al., Petitjean et al.]. Les SL représentent des mutations qui ne sont pas létales mais qui, lorsqu'elles sont combinées, rendent le virus non viable. Ces SL ont déjà été étudiées dans le cadre de la recherche de médicaments anticancéreux [Kuiken H.J., et Beijersbergen R.L] et d'agents anti-VIH. Lao et al. propose une série d’étapes calculatoires afin d’identifier les meilleures résidus cibles qui, une fois mutés ou bloqués par un médicament, pourraient affecter de manière substantielle la fonction biologique de l’agent pathogène visé. La méthode proposée dans Lao et al. présente cependant des désavantages. En premier lieu, les cibles identifiées par cette méthode ne sont pas décrites de manière suffisamment précise, ce qui pénalise l’utilisateur dans son programme de développement. Par exemple, cette méthode ne révèle pas si la cible proposée par le logiciel possède un grand nombre de résidus invariants, un volume déterminé ou présente peu de chances de muter à l’avenir. De plus, elle ne prend pas en compte le fait que le lot de séquences initiales puisse être peu exploitable ou, au contraire, très fiable donc hautement prédictif. Enfin, il manque à cette méthode une information cruciale pour établir la pertinence des cibles identifiées : la nature des liaisons chimiques qui peuvent exister entre les résidus de la protéine candidate et plus particulièrement dans la région cible. Cette information biochimique permettrait de renforcer la validité des cibles identifiées par l’approche génétique de Lao et al. et d’en sélectionner les plus pertinentes. De manière générale, le nombre de régions cibles thérapeutiques identifiées grâce à un crible génétique par Lao et al. est trop élevé. Dans la mesure où les organismes de recherche doivent ensuite mettre en place des programmes de criblage de banques de molécules (anticorps, petites molécules, etc.) longs et couteux, il est préférable de réduire au maximum le nombre de régions cibles d’intérêt, en sélectionnant uniquement celles qui sont susceptibles d’être pérennes et stables, notamment en tenant compte des liens biochimiques existants au sein de la protéine d’intérêt. EXPOSE DE L'INVENTION Selon un premier aspect, l’invention vise à améliorer la méthode de Lao et al. Pour cela, les présents inventeurs proposent d’intégrer dans cette méthode des étapes basées sur la structure 3D et les interactions chimiques intramoléculaires de la protéine cible. Ces étapes permettent de confirmer ou de valider les résidus identifiés par la méthode de Lao et al., selon la qualité physico-chimique de leurs interactions et leur sensibilité aux paramètres environnementaux (pH, température, etc.). Grâce à ces étapes, seules les paires de résidus possédant des caractéristiques physico- chimiques avantageuses et se trouvant à une distance telle que les liens chimiques entre résidus ont potentiellement une influence, seront sélectionnées. En outre, les présents inventeurs proposent d’appliquer sur la méthode de Lao et al. des filtres afin d’exclure de l’analyse, des séquences nucléotidiques ou peptidiques de qualité insuffisante et éviter ainsi d’alourdir le système en travaillant sur des séquences inexploitables ou mal indexées. Ainsi, les présents inventeurs ont élaboré des étapes additionnelles permettant de sélectionner plus précisément les séquences à tester et/ou à utiliser en priorité. Enfin, une méthode de ce type doit pouvoir générer des résultats rapidement, que ce soit sur des protéines issues de différents microorganismes, ou sur des protéines issues de différents variants d’un même microorganisme. Il est donc important de pouvoir disposer d’une méthode rapide et sûre pour traiter plusieurs protéines en parallèle, permettant notamment de prendre en compte les structures 3D des protéines issues de variants connus. L’ensemble de ces perfectionnements permet d’améliorer la fiabilité et l’intérêt de la méthode décrite dans Lao et al., qui était théorique mais difficilement utilisable (car insuffisamment décrite et peu documentée). La méthode de la présente invention est plus efficace et plus fiable que celle décrite dans Lao et al., dans la mesure où elle a été enrichie scientifiquement et complétée par de nouveaux critères permettant de décrire finement, tant statistiquement que biochimiquement, les cibles détectées. Grâce à ces améliorations, la méthode de l’invention devient incontournable pour identifier des régions cibles d’importance sur les organismes pathogènes, en vue de permettre aux chercheurs de concevoir les médicaments de demain. A ce titre il est proposé un procédé mis en œuvre par ordinateur de détermination d’au moins une région cible thérapeutique sur une protéine candidate d’un organisme pathogène cible, ledit procédé comprenant les étapes suivantes : a) Identification, dans un ensemble de séquences nucléotidiques et polypeptidiques caractéristiques de ladite protéine candidate, au préalable alignées, de résidus invariants et/ou de paires de résidus synthétiques létaux dits résidus cibles ; b) Identification d’au moins une région candidate constituée d’au moins une paire de résidus cibles identifiés à l’étape a), ladite au moins une paire comprenant des résidus cibles situés à une distance déterminée dans l’espace et étant exposée à la surface de la protéine candidate, de préférence dans une poche ; c) Détermination des interactions chimiques avantageuses entre chaque résidu et/ou entre chaque couple de résidus au sein de la protéine candidate, à partir de la structure 2D et/ou 3D de la protéine candidate ; lesdites interactions chimiques avantageuses étant des liaisons hydrophobes et/ou des liaisons hydrogènes et/ou des ponts salins et/ou des liaisons à répulsions négatives et/ou à répulsions positives ; d) Sélection des résidus liés par lesdites interactions chimiques avantageuses, lesdits résidus étant à une distance d'au plus 10 Angströms ; e) Sélection d’au moins une région cible thérapeutique parmi les régions candidates identifiées à l’étape b), comprenant les résidus sélectionnés à l’étape d). L’invention, selon le premier aspect, est avantageusement complétée par les caractéristiques suivantes, prises seules ou en une quelconque de leur combinaison techniquement possible : - l’étape d’identification des interactions chimiques avantageuses consiste en une détermination de l’interactivité chimique de chaque résidu au sein de la protéine et/ou une détermination de l’interactivité chimique de chaque couple de résidus espacés d’une distance déterminée ; - la distance déterminée à l’étape b) est comprise entre 2 et 8 Angströms, de préférence 5 Angströms ; - le procédé comprend une évaluation de l’interactivité chimique des liaisons déterminées comprenant un calcul d’au moins un score parmi : un pourcentage de liaisons hydrophobes et/ou un pourcentage de liaisons hydrogènes et/ou, un pourcentage de ponts salins et/ou un pourcentage de liaisons à répulsions négatives et/ou un pourcentage de liaisons à répulsions positives et/ou un pourcentage de liaisons chimiques ; - la région cible est une poche identifiée à partir d’un ensemble de structures 3D alignées de la protéine candidate et dans lequel les interactions chimiques sont déterminées sur un ensemble de structures 3D alignées de la protéine candidate ; - la poche cible comprend au moins cinq résidus cibles choisis parmi les résidus invariants ou les résidus covariants synthétiques létaux, et dans lequel ladite poche présente un volume entre 60 ^̇^ et 500 ^̇^ ; - le procédé comprend une évaluation de la qualité de l’emplacement spatial des résidus cibles, ladite évaluation étant caractérisée par le calcul de la proportion de paires de résidus situés à moins de 5 Angströms l’un de l’autre et/ou de la proportion de paires de résidus situés à moins de 10 Angströms l’un de l’autre ; - le procédé comprend une étape de sélection de la séquence polypeptidique de référence de la protéine candidate, puis une étape de sélection des séquences polypeptidiques à tester présentant des longueurs identiques à la séquence de référence, et/ou possédant un nombre de mutations inférieur ou égal à trois écarts- types du nombre moyen de mutations par séquence, et/ou possédant un résidu invariant à son extrémité N ou C ; - le procédé comprend une évaluation de la qualité des séquences initiales sélectionnées, ladite évaluation comprenant le calcul d’au moins un score mesurant l’hétérogénéité de la longueur des séquences initiales et/ou le nombre de séquences ayant un nombre aberrant d’acides aminés mal définis et/ou le nombre de séquences ayant un nombre aberrant de résidus manquants. Selon un deuxième aspect, l’invention vise à identifier une région cible thérapeutique sur la seule base des interactions chimiques qui existent entre les résidus de la région. A ce titre, il est proposé un procédé mis en œuvre par ordinateur de détermination d’au moins une région cible thérapeutique sur une protéine candidate d’un organisme pathogène cible, ledit procédé comprenant les étapes suivantes : a) Détermination des interactions chimiques avantageuses entre chaque résidu et/ou entre chaque couple de résidus au sein de la protéine candidate, à partir de la structure 2D et/ou 3D de la protéine candidate ; lesdites interactions chimiques avantageuses sont des liaisons hydrophobes et/ou liaisons hydrogènes et/ou ponts salins et/ou à répulsions négatives et/ou répulsions positives ; b) Sélection des résidus liés par lesdites interactions chimiques avantageuses, lesdits résidus étant à une distance d'au plus 10 Angströms, lesdits résidus formant une région cible thérapeutique. DESCRIPTION DES FIGURES D’autres caractéristiques, buts et avantages de l’invention ressortiront de la description qui suit, qui est purement illustrative et non limitative, et qui doit être lue en regard de la figure 1 qui illustre un schéma des étapes d’un procédé mis en œuvre par ordinateur de détermination d’au moins une région cible thérapeutique à la surface d’une protéine candidate d’un organisme pathogène. La Figure 2 présente un schéma des interactions chimiques existant entre les couples d’acides aminés au sein de la protéine HA du virus de la grippe (HB = liaison hydrogène, SB= pont salin, PR = répulsion positive, HI = interaction hydrophobe). Les liaisons surlignées sont celles correspondant à des couples déjà définis par la technique décrite dans Lao et al et donc confirmés par la méthode chimique de l’invention, reliant des couples ou des groupes d’acides aminés dont la distance est convenable (mis en évidence en gris) ; ces couples seront donc sélectionnés dans le cadre de la méthode de l’invention. La Figure 3 met en évidence les acides aminés d’intérêt sélectionnés sur la Figure 2 au sein des acides aminés identifiés après mise en œuvre des étapes E1 et E2 de la méthode de l’invention (pour plus de détails, cf. la figure 3 de Lao et al.) DESCRIPTION DETAILLEE DE L'INVENTION La présente invention vise un procédé mis en œuvre par ordinateur, pour déterminer au moins une région cible thérapeutique à la surface d’une protéine candidate d’un organisme pathogène. Un tel procédé peut par exemple être mis en œuvre par une unité de traitement telle qu’un ou plusieurs processeurs ou tout autre moyen équivalent. Par « organisme pathogène cible », on entend ici désigner tout type d’organisme pouvant causer des maladies chez un « hôte » (tel qu'un être humain, une plante ou un animal). Cet organisme est de préférence un microorganisme tel qu’un virus, une bactérie, un parasite, un champignon, un protozoaire (amibe, sporozoaire ou flagellés), etc. Certains de ces organismes n’ont été séquencés qu’au cours des dernières décennies, comme : ^ les Rotavirus, les Calicivirus (Norwalk et hépatite E), Ebola, le chikungunya, le Coronavirus du SRAS ; ^ les bactéries Legionella, Campylobacter, Helicobacter, Mycobacterium et Escherichia coli souche O157 : H7 ; ^ les Sporozoaires (protozoaires parasites) des ordres des Coccidies (Cryptosporidium, Cyclospora, Toxo­plasma) ou des Microsporidies (Enterocytozoon, Encephalitozoon, Nosema). Il peut également s’agir d’un macro-organisme nuisible, tel qu’un ver (appartenant par exemple au groupe des helminthes, plathelminthes comme les trématodes ou cestodes, ou nemathelminthes tels que les nématodes Ascaris, Toxocara, ou Trichuris) ou un insecte. Par extension, il est également inclus sous la dénomination « organisme pathogène cible » des cellules tumorales ou des cellules infectées par un microorganisme pathogène tel qu’un virus, une bactérie, etc. En effet, ces cellules expriment souvent à leur surface ou dans leur cytoplasme (voire dans leurs noyaux) des protéines impliquées dans le maintien des signaux de prolifération de ces cellules, la résistance à la mort cellulaire, l’échappement au système immunitaire, l’angiogénèse, activant l’invasion et les métastases, l’immortalité réplicative, l’échappement aux suppresseurs de facteurs de croissance, la reprogrammation du métabolisme énergétique, ce qui amplifie le mal (cancer ou infection). Il est donc tout à fait logique d’utiliser le procédé de l’invention pour identifier des régions cibles propices à la recherche thérapeutique, sur des protéines qui sont impliquées dans ces dérèglements également. Les organismes pathogènes sont essentiellement constitués de protéines, dont certaines sont nécessaires à leur développement, à leur infectiosité et/ou à leur pathogénicité. Pour chaque pathogène connu, de nombreuses protéines de ce type ont été identifiées et constituent une cible privilégiée pour les chercheurs de l’industrie pharmaceutique. En effet, invalider la fonction et/ou masquer de telles protéines permet souvent d’enrayer le développement, la propagation et/ou les effets délétères des pathogènes sur la santé humaine, végétale ou animale. Dans le cadre de la présente demande, ces protéines seront appelées « protéines candidates », en ce qu’elles ont été identifiées au préalable comme des candidates ayant potentiellement un impact sur le développement, l’infectiosité et/ou la pathogénicité d’un organisme pathogène d’intérêt. Pour qu’une molécule soit sélectionnée en tant que « médicament », il est nécessaire qu’elle influe substantiellement, à court, moyen ou long terme, sur la fonction d’au moins une de ces protéines candidates. Pour ce faire, elle doit tout d’abord être capable d’entrer en contact avec la protéine candidate (si possible, grâce à plusieurs zones de contact). Grâce aux structures 3D, il est désormais possible de déterminer quelles zones sont localisées à la surface de la protéine, et donc quelles zones peuvent être de possibles “zones de contact” entre une molécule médicamenteuse et une protéine d’intérêt. Pour chaque protéine, ces zones de contact sont cependant trop nombreuses pour être toutes criblées dans des programmes de recherche. Pour faciliter leurs travaux et accélérer l’identification de médicaments efficaces, les chercheurs ont besoin de connaitre plus précisément quelles sont les « régions cibles » qui, à la surface des protéines candidates, ont les propriétés chimiques et biologiques les plus prometteuses pour être ciblées par un médicament. Dans le cadre de la présente demande, on appelle donc « région cible thérapeutique » une zone de contact privilégiée entre un médicament et une protéine candidate, ladite zone ayant été sélectionnée de manière telle que l’interaction entre ces deux éléments (le médicament d’une part et la protéine d’autre part) puisse chimiquement être forte, stable et influer significativement sur la fonction biologique de la protéine. Brève description des étapes du procédé de l’invention On considère au préalable qu’une protéine candidate, dont on sait qu’elle agit sur le développement, l’infectiosité et/ou à la pathogénicité de l’organisme pathogène que l’on étudie, a été identifiée. Pour mettre en œuvre le procédé de l’invention, cette protéine candidate doit être connue et bien décrite dans la littérature. Notamment, des séquences polypeptidiques et des séquences 3D doivent avoir déjà été caractérisées dans l’art, et être facilement accessibles. Des séquences nucléotidiques codant pour ces séquences polypeptidiques doivent également être connues. Toutes ces séquences sont en général fournies dans des bases de données officielles et accessibles ouvertement. Les séquences de ces bases, ci-après appelées “BDD1”, sont en général anonymisées, en libre d’accès et téléversées par différentes unités de recherche internationales. Il s'agit par exemple des bases Genbank, NCBI, INSDC, EMBL, HIVDB, LANL, FLUDB, GISAID, etc., bien connues de l’homme du métier. Dans une étape préalable au procédé de l’invention, une séquence polypeptidique et une séquence nucléotidique de référence doivent être sélectionnées (étape E0). Ces séquences de référence peuvent être choisies à partir d’un arbre phylogénétique (dans ce cas, la séquence de référence est à la racine de l’arbre représentant les séquences étudiées) ou, si l’arbre n’existe pas, en recalculant une séquence ancestrale, reconstruite par une des trois méthodes suivantes : parcimonie, maximum de vraisemblance ou méthode bayésienne. Cette séquence de référence peut en outre être une séquence consensus du lot de séquences étudiées, mais dans ce cas elle ne sert qu’à être comparée aux autres séquences, car une séquence consensus calculée peut être une séquence qui n’a jamais existé, donc elle n’est pas nécessairement fonctionnelle. Par suite, les autres séquences nucléotidiques et polypeptidiques connues / recensées pour cette protéine candidate sont identifiées dans les bases de données “BDD1”. Ces séquences additionnelles seront ci-après nommées “séquences initiales”. Une protéine doit accomplir un certain nombre de fonctions qui ne sont réalisables que si elle adopte une certaine structure dans l’espace et qu’elle possède les radicaux chimiques à la localisation adéquate. Ceci est appelé le lien structure- fonction. Ainsi certaines mutations changent la structure de la protéine et lui font ainsi perdre une ou plusieurs fonctions. Si ces fonctions sont essentielles, il en découle que le virus devient non replicatif et ne peut donc plus se développer. Ces mutations sont principalement de trois sortes : les positions invariantes, les couples de synthétiques létaux et les couples de mutations compensatoires. Une seule position invariante mutée rend non fonctionnelle la protéine, quand pour arriver au même but, deux positions doivent être mutées dans le cas des couples de synthétiques létaux. Enfin, un couple de mutation compensatoire est défini comme suit : une première mutation rend la protéine non fonctionnelle mais une second pourrait apparaître et rétablir la fonction de la protéine étudiée. Dans ces trois cas, une forte contrainte est imposée à la protéine. Dans le cadre de la présente invention, ces séquences initiales sont tout d’abord traitées pour y sélectionner les résidus invariants et/ou les paires de résidus synthétiques létaux (étape E1). Une fois que ces résidus invariants et/ou paires de résidus synthétiques létaux sont connus, au moins une région candidate est identifiée, sur la base d'autres critères structuraux (étape E2). Les étapes E1 et E2 ont été décrites par Lao et al. Dans le cadre de la présente demande, on appelle « région candidate issue de E2 » une région contenant au moins deux ou trois acides aminés d’intérêt qui ont été sélectionnés pour être des résidus invariants et/ou des résidus covariants synthétiques létaux (SL) ne dérivant pas d’un ancêtre commun, proches l’un de l’autre, exposés à la surface de la protéine candidate et possiblement dans une poche, grâce aux étapes E1 et E2 de la présente demande, c’est-à-dire selon la méthode décrite dans Lao et al. Dans un second temps, la méthode de l’invention prévoit de déterminer les liaisons chimiques impliquées globalement entre les résidus de la protéine, et notamment entre les résidus localisés dans la région candidate (étapes E3, E4, E5 sur la figure 1). Grâce à ces informations d’interactivité chimique, au moins une région candidate présentant le plus de chances d’être une cible thérapeutique efficace est identifiée. La méthode de l’invention permet ainsi de sélectionner, parmi les régions candidates obtenues en suivant les indications de Lao et al., la ou les région(s) cible(s) thérapeutique(s) les plus susceptible(s) de permettre l’identification de médicaments efficaces. Comme il sera détaillé ci-dessous, un ou plusieurs scores peuvent être avantageusement calculés pour vérifier que les informations issues de chaque étape de la méthode de l’invention sont pertinentes pour la suite du procédé et par rapport aux résultats attendus. Ces scores permettent de renseigner les chercheurs sur la qualité et donc la fiabilité des résultats obtenus. Par souci de lisibilité de la description, les expressions détaillées des scores sont données en fin de description. Description détaillée des étapes de l’invention L’étape E1 consiste à identifier, dans un ensemble de séquences nucléotidiques et polypeptidiques, caractéristiques de ladite protéine candidate, et au préalable nettoyées et alignées, les résidus invariants et/ou les paires de résidus covariants synthétiques létaux, qui seront appelés, dans le cadre de l’invention, des “résidus cibles”. Les banques de données permettant de stocker les séquences des organismes pathogènes peuvent contenir des séquences erronées, qui, non éliminées pourraient générer de faux résultats. C’est pourquoi, dans la méthode de l’invention, les séquences initiales doivent d’abord être “nettoyées” (étape E11). Ce “nettoyage” consiste à filtrer les séquences initiales, par exemple de la manière suivante : ^ Les séquences initiales ayant une longueur différente de la séquence choisie comme référence peuvent être exclues (si le lot de séquences initiales contient suffisamment de séquences) ; ^ Si le lot de séquences initiales ne contient pas beaucoup de séquences et si l’alignement semble possible (car les séquences ne contiennent pas de région hyper variables, et peu de régions mal décrites), un alignement peut être réalisé pour homogénéiser les longueurs. En pratique, à partir de séquences de longueurs variables, on obtient un alignement d’une seule longueur, qui est supérieure à la longueur de la séquence ayant la plus grande longueur. ^ Les séquences initiales possédant un nombre de mutations supérieur à trois écarts-types du nombre moyen de mutations par séquence sont exclues. Par ailleurs, les extrémités N-terminale et C-terminale des séquences initiales sont repérées et les séquences sont orientées dans le même sens, de sorte que leurs extrémités puissent être superposables (par exemple toutes les séquences peuvent être orientées de l'extrémité N-terminale vers l’extrémité C-terminale). Cette étape E11 de nettoyage permet également d'identifier, parmi l’ensemble des séquences initiales, celles présentent des longueurs hétérogènes et/ou permet d’écarter les séquences qui présentent des anomalies inacceptables. De telles anomalies sont, par exemple, un nombre aberrant de mutation, un nombre aberrant d’acides aminés mal définis, un nombre aberrant d’acide aminé manquants, etc. A ce sujet, un ou plusieurs scores ou fonction de scores peuvent être avantageusement calculés (étape E11’) pour évaluer si les séquences initiales (avant nettoyage) ne présentent pas trop d’anomalies et/ou si leur longueur est suffisamment homogène (scores S1, S2, S3, S4 détaillés plus loin). Si un ou plusieurs de ces scores n’est pas acceptable (valeur proche de 0 et non de 1), le procédé de l’invention peut être interrompu, car cela signifie que l’ensemble des séquences initiales avant nettoyage n’est pas suffisamment robuste pour être exploitable. Une fonction de score notée f(S1QS) peut également être calculée à ce stade, afin d’évaluer si l’ensemble des séquences initiales avant nettoyage est suffisamment complet et robuste pour permettre de prédire efficacement l’existence d’une région cible thérapeutique au sein de la protéine candidate sélectionnée. Cette fonction de score f(S1QS) traduit l’impact des données séquences sur la qualité du résultat obtenu à l’issue du procédé. Il est par ailleurs recommandé d’interrompre le procédé lorsque le nombre de mutations appartenant aux lots de séquences initiales retenues après le “nettoyage” est trop faible (typiquement, un nombre de mutations ne permettant pas d’avoir des résultats statistiquement corrects, par exemple qui ne permet pas de calculer des ^^ (covariants ayant moins de 5 représentants)). Dans ce cas, il est préférable de sélectionner un nouvel ensemble de séquences depuis la base de données BDD1, de l’enrichir en téléchargeant de nouvelles séquences, ou de changer de protéine candidate. A l’inverse, on considère que l’on dispose d’un bon ensemble de séquences initiales lorsqu’au moins 1000 séquences de qualité acceptable ont été identifiées, ces séquences portant suffisamment de mutations. Par “qualité acceptable”, on entend ici des séquences initiales présentant un nombre d’anomalies inférieur à trois écarts-types du nombre moyen de ces anomalies par séquences. A ce sujet, le score S7 peut être calculé, pour mesurer le nombre total de séquences initiales ne contenant pas un nombre aberrant de mutations. Un tel score S7 dépend des scores S2, S3 et S4 présentés ci-dessus. Ensuite, il est avantageusement procédé à un alignement des séquences obtenues après le nettoyage (étape E12). L’alignement des séquences peut être mis en œuvre selon deux possibilités : i) soit les séquences ont toutes la même longueur : dans ce cas l’alignement est généré en alignant toutes les séquences sur leur extrémité N-terminale, ii) soit elles n’ont pas toutes la même longueur : dans ce cas il est difficile d’utiliser les méthodes d’alignements multiples, qui sont généralement utilisées pour un nombre de séquences moins conséquent. Dans ce cas, il est possible de sélectionner un échantillon représentatif de la population de séquences étudiées et d’utiliser la suite HMMER (http://hmmer.org) qui permet de générer un profil sur lequel toutes les séquences peuvent ensuite s’aligner une à une (en utilisant les fonctions hmmbuild et hmmcalibrate). Cette méthode permet d’aligner des centaines de milliers de séquences dans un temps de l’ordre de la minute. La qualité de l’alignement des séquences peut être évaluée (étape E12’) via le calcul d’un ou plusieurs scores (détaillés plus loin) relatifs à l’impact des gaps dans l’alignement (score S8), la redondance du lot de séquence (score S10), l’impact des régions hypervariables (score S11), l’impact des délétions et insertions (score S12), l’impact des modifications post-traductionnelles (score S13), et/ou à l’impact de l’existence de différents sous-types (score S14). Les scores S11, S12, et S13 sont définis à partir de données présentes dans la littérature. Une ou plusieurs fonctions de score peuvent être calculées à ce stade pour évaluer si l’ensemble des séquences alignées après nettoyage est suffisamment complet et robuste pour permettre de prédire efficacement l’existence d’une région cible thérapeutique au sein de la protéine candidate sélectionnée. La fonction de score f(S3) détaillée plus loin traduit la qualité de l’alignement et de la prédiction possible. Certains termes de cette fonction décrivent la précision avec laquelle les séquences initiales sont décrites et ont un impact sur les résultats statistiques (f(S3QS) et d’autres termes de cette fonction montrent l’hétérogénéité du lot de séquences étudié et ont un impact sur la description de la cible elle-même f(S3SC). Plus précisément, la fonction de score f(S3QS) traduit l’impact de l’alignement sur la prédiction statistique de la région cible et la fonction de score f(S3SC) traduit l’impact de l’alignement sur la prédiction de la cible. Si la qualité prédite de l’alignement est faible, le procédé peut être interrompu pour être recommencé à partir de nouvelles séquences initiales. A l’issue de cette étape d’alignement, l’utilisateur dispose d’un ensemble de séquences nettoyées et alignées dites “séquences à tester”. Dans ces séquences à tester, les résidus invariants sont ensuite identifiés (étape E13). Les “résidus invariants” sont par définition des acides aminés qui ne changent pas (ou quasiment pas) de position au sein de la protéine, dans toutes les séquences à tester étudiées. Dans la mesure où les méthodes de séquençage ne sont pas fiables à 100%, un taux moyen d’erreur de 0,3% peut être appliqué (Cheng C. et al, 2022). Ainsi, dans le cadre de la présente invention, un résidu est défini comme “invariant” s'il est présent à une même position sur au moins 99,7% des séquences à tester. La qualité de la sélection des résidus invariants peut avantageusement être évaluée en calculant la richesse mutationnelle des séquences (étape E13’). Notamment, le score S18 peut être calculé (voir plus loin). Grâce à ce score, il est possible de vérifier que les séquences sur lesquelles les résidus invariants ont été détectés sont suffisamment hétérogènes. En effet, pour pouvoir affirmer qu’un résidu est invariant et ce pour des raisons fonctionnelles (des mutations sont apparues à cette position, mais n’ont pas été sélectionnées car elles étaient léthales) il faut pouvoir montrer que des mutations sont apparues ailleurs sur la séquence. Une fois que le nombre de résidus invariants est connu, il est avantageux de déterminer le pourcentage de ces résidus en calculant le score S19. Ce score permet d’évaluer l’impact des positions invariantes sur le résultat final. Les cibles ayant le plus de chance d’être stables au long terme (donc d’être dans l’incapacité de muter sans modifier l’activité réplicative du virus, donc empêchant l’apparition de mutations qui pourraient rendre les mutants résistants au traitement) sont celles qui sont les plus invariantes, donc constituées du plus grand nombre de résidus invariants. Il est également possible de calculer la fonction de score ^(^^^^^^^^^^^ ) qui permet d’évaluer le degré d’invariance du lot de séquences étudiées, et donne une idée de son incapacité mutationnelle à long terme. Ce degré d’invariance dépend de plusieurs variables telles que : la qualité de l’alignement, le nombre total de mutations, le nombre d’invariants, le nombre de synthétiques létaux (qui représentent une invariance à deux résidus) et le nombre de mutations apparues pour des raisons fonctionnelles et non dues à la présence d’un ancêtre commun. Comme spécifié sur la figure 1, d’autres résidus d’intérêt peuvent également être sélectionnés dans la méthode de l’invention. Il s’agit de résidus qui ne sont pas invariants, mais qui appartiennent à des couples de covariants d’intérêt (étape E14). Plusieurs tests statistiques permettent de définir la covariation d’un couple de variables dans une liste de variables. Le test statistique du ^^ est l’un d’entre eux. Il permet de déterminer, selon un seuil, si les variables prises deux à deux sont indépendantes les unes des autres. Dans le cadre de la présente invention, il est notamment possible d’utiliser le ^^ de Noivirt défini plutôt sous la forme (où A et B sont les acides aminés spécifiques trouvés aux positions i et j), qui permet de prendre en compte chaque résidu parmi 20 et pas seulement l’état muté ou non muté du résidu d’origine. Une fois ce défini, il est préférable de réajuster les résultats pour rejeter les faux positifs dus à la multiplicité des tests effectués. Ainsi les p-values peuvent être réajustées en utilisant une méthode connue sous sa dénomination anglaise (“false discovery rate”). Les résidus sont considérés comme “dépendants” ou “covariants” si leur p-value est en dessous de 0,05 (Noivirt O. et al.). L’impact du nombre de positions covariantes ainsi que l’impact du nombre de couple de positions covariantes sur le résultat final peut être évaluée par le calcul des scores S20 et S21 respectivement. Les couples de résidus covariants identifiés par ce calcul doivent ensuite être filtrés (étapes E15 et E16). Dans un premier temps, il est préférable d’éliminer les couples de résidus covariants qui partagent des ancêtres communs (étape E16). Ceci peut être notamment réalisé en étudiant les séquences d'ADN codant les séquences initiales : après alignement de ces séquences d’ADN, sont identifiés et sélectionnés les codons mutés provoquant des mutations non synonymes. En effet, les mutations non synonymes induisent l’apparition d’acides aminés différents sur plan physico-chimique ; tandis que, au contraire, les mutations synonymes codent pour un même résidu. Un coefficient de déséquilibre de liaison D', dit de Lewontin peut ensuite être calculé avec l'ensemble des données de séquences d’ADN recodées (différenciant les positions synonymes des non synonymes). En utilisant ce coefficient, les couples partageant un même ancêtre, dont la covariation n'est donc pas la conséquence d'interdépendances fonctionnelles, peuvent être identifiés. Grâce à ces étapes, il est possible de déterminer si la covariation des deux résidus identifiés comme “covariants” à l’étape E14 découle de la coévolution de ces deux résidus ou si elle est due au fait qu’ils sont phylogénétiquement liés à un ancêtre commun. Dans ce dernier cas, les couples de résidus ne sont pas conservés dans la méthode de l’invention, il s’agit alors d’un “faux positif” appelé « déséquilibre de liaison ancestrale » (Lao et al.; Petitjean et al.). A ce stade, il est possible de calculer des scores S24 et S25 qui traduisent justement l’impact de la mutabilité non synonyme globale et l’impact de la mutabilité synonyme. Enfin, il est avantageux d’identifier si, parmi les couples de covariants sélectionnés à l’issue de l’étape E14, certains sont capables d'induire l’impossibilité pour le virus de se répliquer (étape E16). Ces couples de covariants particuliers sont connus sous le nom de “synthétiques létaux”. De fait, il est important de distinguer les deux types de mutations covariantes qui existent, et qui ont des conséquences tout à fait inverses : les mutations compensatoires (CM) et les synthétiques létaux (SL) (Lao et al.; Petitjean et al.). Pour cela, il est possible par exemple de calculer un coefficient dit de dissimilarité ξ, qui permet de signer le test de ^^(^^, ^^). Ce signe permet de faire la différence entre CM et SL. Les CM possède un ξ qui est positif lorsque NobsA,i,B,j ≥ NexA,i,B,j avec A et B deux résidus situés respectivement aux positions i et j. Ainsi ξA,i,B,j = + tandis que les SLs possèdent un ξ qui est négatif lorsque NobsA,i,B,j ≥ NexA,i,B,j . Ainsi ξA,i,B,j = -^^(^^, ^^) avec Nobs le nombre de couples de résidus A et B observés aux positions i et j, Nex le nombre de couples de résidus A et B attendus aux positions i et j (Petitjean et al.). A ce stade, il est possible de calculer le score S22 qui traduit l’impact du nombre de SL et leur force sur le résultat obtenu à l’issue du procédé. De même, le score S23 peut aussi être calculé, car il traduit l’impact du nombre de CM et leur force sur le résultat. La force d’un couple de covariants est définie par son ^^(^^, ^^). En effet plus le ^^(^^, ^^) est élevé plus le nombre de couples observés est élevé par rapport au nombre de couples attendus s’il n’y avait pas de covariation. S22 et S23 définissent donc la force de la covariation pour ce couple précis. A l’issue de ces différentes étapes, des résidus invariants et des paires de synthétiques létaux sont sélectionnés comme faisant partie d’au moins une “région candidate” de la protéine candidate étudiée. Il est ici possible de calculer le score S9 qui traduit l’impact de la variance aux extrémités 5’ et 3’ des séquences. En effet, dans l’étape qui consiste à aligner les séquences d’ADN pour identifier les résidus covariants qui partagent un ancêtre commun, une des deux techniques utilisées consiste à aligner toutes les séquences sur leur extrémité 5’. Or la variance de cette extrémité diminue la chance d’aligner correctement les séquences. On peut alors préférer aligner sur l’extrémité 3’, qui doit à son tour être peu variante. La région candidate qui sera sélectionnée comme meilleure cible thérapeutique doit en outre satisfaire un certain nombre d’autres conditions avantageuses. Notamment, les acides aminés qui la composent peuvent subir des contraintes de par la structure 3D de la protéine candidate. A l’inverse, il peut être avantageux de déterminer si la région candidate contient une “poche” qui permettrait à un médicament de se loger de manière stable et forte. Pour évaluer ces aspects, la méthode de l’invention contient une étape E2 qui évalue la qualité des régions candidates obtenues à l’étape E1 vis-à-vis de la position des acides aminés qui la composent, par rapport à la structure 3D de la protéine candidate. L’étape E2 consiste donc à identifier, parmi les régions et les résidus identifiés à l’étape E1, au moins une paire de résidus cibles situés à une distance proche dans l’espace, et étant exposée à la surface de la protéine candidate, de préférence dans une poche. Pour pouvoir lier une petite molécule, une cible thérapeutique doit être composée de résidus qui sont proches les uns des autres dans l’espace. Aussi, dans le cadre de la présente invention, les résidus cibles de la région candidate seront de préférence distants d’au maximum 10 Angströms, de préférence au maximum 5 Angströms. Il est ici avantageux de quantifier par le calcul de différents scores les résidus cibles qui sont distants de moins de 5 Angströms et/ou de 10 Angströms, afin d’évaluer s’ils sont en nombre suffisant pour constituer une future cible capable de lier une petite molécule potentielle (médicament). Les scores S28, S29, S30, S31 peuvent notamment être calculés (étape E21’). Pour permettre d’obtenir ces informations, le procédé de l’invention requiert avantageusement l'accès aux structures tridimensionnelles connues et recensées pour la protéine candidate. Ces structures sont connues et décrites dans les bases de données de structure 3D dédiées, que l’on appellera ici “BDD2”. Comme pour les séquences nucléotidiques et polypeptidiques, ces séquences 3D devront souvent, au préalable de la méthode de l’invention, avoir été traitées (étape E6 de nettoyage, étape E7 d’alignement). Les structures 3D sont en effet souvent au format pdb. Or ce format n'est pas appliqué de la même façon par toute la communauté scientifique (format du fichier lui-même, noms des sous-unités ou numérotation des résidus, ...). Ainsi un nettoyage (étape E6) des structures est de préférence mis en œuvre, permettant de définir un format unique et généralisé pour tous les fichiers pdb utilisés (uniformisation du format du fichier, de la numérotation des résidus et des atomes, des noms des sous unités et leur positions respectives entre autres). De plus, des dizaines voire des centaines de structures d’une même protéine sont disponibles. Au même titre que pour les séquences, les structures 3D recensées pour une même protéine sont de préférence alignées. Il s’agit d’alignements structurels qui permettent de connaître à quel point les structures recensées pour cette protéine sont différentes. L’alignement est mis en œuvre à partir d’un modèle de référence. On peut ensuite calculer l’écart moyen entre toutes ces structures, que l’on appelle « RMSD ». Une structure tridimensionnelle est définie par la position dans l’espace de chacun des atomes qui la constituent. Si beaucoup de ces positions sont manquantes (données manquantes) la structure 3D est bancale en ce sens que seulement une partie de ces atomes ont une place déterminée dans la structure. S’il manque beaucoup de données pour chacune des structures étudiées (sachant que les données manquantes ne se trouvent pas à la même position dans l’espace de la protéine), il devient difficile de faire un alignement structurel et même de comparer les résidus se trouvant à la même position. Le fait qu’une protéine possède plusieurs sous-unités complexifie en outre sa structure. D’ailleurs, dans ce cas, on parle de structure quaternaire et non plus seulement tertiaire. Dans ce cas il faut non seulement définir la position de chaque atome de chaque sous-unité, mais aussi la position de chaque sous unité les unes par rapport aux autres. Dans ces conditions, la qualité des structures 3D peut donc être évaluée pour vérifier qu’elles permettront de prédire efficacement l’existence d’une région cible. Plusieurs scores sont ainsi calculés (étape E7’). A ce titre, on peut calculer le score S5 qui quantifie le nombre de structures 3D ayant un nombre aberrant de données manquantes ainsi que le score S6 qui évalue l’impact de l’existence (le cas échéant) de différentes sous-unités sur le résultat final. Les scores S15, S16 et S17 permettent de plus d’évaluer l’alignement des structures 3D. S15 est, pour les structures, l’équivalent de Sseq pour les séquences. On regarde si le nombre de structures 3D connues pour la protéine candidate est élevé ou non. S’il y a moins de 200 structures 3D connues, ce nombre est insuffisant pour avoir une moyenne cohérente (ce chiffre peut être diminué, cependant, car les structures 3D sont de plus en plus fiables). S16 donne une idée de la variation des résolutions des structures. En effet, les structures 3D sont déterminées au moyen de différentes techniques. Les deux plus utilisées sont la diffraction par rayon X et la microscopie électronique. Un seuil de résolution est défini pour chacune de ces structures, en fonction de la technique utilisée. S16 évalue cette variation de résolution. S17 montre l’hétérogénéité structurale du lot de structures étudié. Chacun des atomes de la structure est aligné sur l’atome lui correspondant de la structure suivante. Ainsi pour chaque atome on peut associer un nombre de position égal au nombre de structure étudié. Une valeur moyenne de cette position dans l’espace est calculée ainsi que l’écart à la moyenne. Si l’on effectue ce calcul pour tous les atomes de la structure, il devient possible de calculer un écart moyen qui donne une idée de l’hétérogénéité des structures, spatialement parlant. Le TM décrit dans ce score est une variante du RMSD qui permet de le normaliser pour qu’il ne soit pas dépendant du nombre total de position de la structure. On peut calculer également des fonctions de score évaluant la qualité de l’alignement structurel via les fonctions ^^^^^^^, ^^^^^^^. La fonction ^(^^ ) traduit la qualité de l’alignement et de la prédiction possible. Certains termes de cette fonction décrivent la précision avec laquelle les structures 3D sont décrites et ont un impact sur les résultats statistiques ^^^^^^ ^ et d’autres termes de cette fonction montrent l’hétérogénéité du lot de séquences étudié et ont un impact sur la description de la cible elle-même Plus précisément, la fonction de score ^^^^^^ ^ traduit l’impact de l’alignement sur la prédiction statistique de la région cible et la fonction de score traduit l’impact de l’alignement sur la prédiction de la cible. A partir des coordonnées 3D de tous les atomes des résidus dans l’espace, les paires de résidus proches dans l’espace, c‘est à dire éloignés de moins de 5 ou 10 Angströms, sont sélectionnés (étape E21). Par ailleurs, l’accessibilité des résidus cibles et/ou leur exposition à la surface des protéines, doit être prise en compte. En effet, une cible thérapeutique efficace ne doit pas être enfouie dans la structure 3D de la protéine, faute de quoi le médicament ne pourra pas l’atteindre. Ainsi, à partir de la structure tridimensionnelle de la protéine candidate, les résidus qui sont enfouis dans la protéine sont distingués de ceux qui sont exposés à sa surface et donc accessibles (pour ce faire, il est possible d’utiliser le programme ASA par exemple). Dans le cadre de la présente méthode, seules les régions candidates contenant au moins deux, de manière préférée au moins trois résidus accessibles, sont sélectionnées (étape E22). On peut ici encore calculer des scores traduisant l’accessibilité pour évaluer la possibilité d’obtenir suffisamment de région(s) candidates (étape E22’). Le score S32 évalue le pourcentage de positions accessibles et le score S33 évalue le pourcentage de résidus accessibles. Enfin, il peut être avantageux d’évaluer si la région candidate sélectionnée précédemment a une structure 3D assimilable à une “poche” (étape E23). Pour ce faire, il est possible par exemple d’utiliser un logiciel de prédiction de structure, par exemple le logiciel Fpocket (Le Guilloux et al.), dans lequel, pour tenir compte de l’existence de petites et grandes poches, il est préférable de réduire les rayons minimum et maximum des sphères alpha à 2,5 Å et 4 Å respectivement. Le logiciel Fpocket (Le Guilloux et al., 2009) permet de déterminer toutes les poches, dont le cardinal est ^^^^^^^^^^^^ à la surface d’une protéine (en fournissant une structure tridimensionnelle en entrée). Le volume d’une poche pouvant abriter une petite molécule médicament répond de préférence aux contraintes suivantes : 60 Å^ < ^^^ℎ^ < 500 Å^ ( ^^^^^^^^ℎ^^^^^^^^^^^^^^^^^^) On peut calculer le pourcentage de poche répondant à ce critère pour la protéine étudiée ^^^^^^ = ^ ^^^^^^^^^^^^ ^ ^ ^ ^ ^ ^^ ^ ^ ^ ^ ^ ^ ÷ ^ ^^ ^ ^^ ^ ^ ^^ ^ ^ . On peut également, déterminer la somme des volumes cumulées des poches60-500 : qui est ^^^^^^^^^^^^^^ (étape E21’). A la fin de cette étape, les réseaux de résidus invariants ou covariants SL proches dans l'espace, qui sont exposés à la surface de la protéine candidate et de préférence dans une poche ayant un volume entre 60 Å3 et 500 Å3, seront finalement retenus. On retiendra, de préférence, les réseaux d’au moins cinq résidus cibles. De manière complémentaire, les résidus invariants ou covariants SL peuvent être représentés sous la forme de graphes (étape E8). En effet, à partir des réseaux détectés, des groupes de résidus interdépendants sont formés au moyen de graphes mathématiques. Dans ces graphes sont intégrés les résidus invariants et les couples de résidus synthétiques létaux qui forment des groupes d’invariance. Les nœuds du graphe sont les résidus, les arêtes définissent le lien qu’il y a entre les résidus (synthétiques létaux ou invariants, dans ce cas ils sont liés à tous) et n’existe que si les deux résidus sont positionnés à moins de 10 Angströms et à la surface de la protéine candidate. De manière avantageuse, ce type de graphe peut être visualisé grâce au logiciel libre Graphviz. Ces graphes sont un moyen d’évaluer la qualité des régions identifiées. L’étape E3 consiste à déterminer s’il existe des interactions chimiques avantageuses entre les résidus et/ou entre les couples de résidus au sein de la protéine candidate, à partir de la structure 3D de la protéine candidate. Cette étape E3 peut alternativement être limitée à l’analyse des interactions chimiques avantageuses existant entre les résidus et/ou entre les couples de résidus sélectionnés au sein de la région candidate obtenue à l’étape E2, à partir de la structure 3D de cette région candidate. La génétique permet de détecter fonctionnellement l’impact des changements physico-chimiques microscopiques se produisant au niveau des résidus. Ainsi le fait d’être invariant (ou de faire partie d’un groupe d’invariance) est la conséquence de la qualité physico-chimique d’un ou des résidus (la pression de sélection impose le maintien de ce(s) résidu(s) à cette position). A l’inverse, si la physico-chimie d’un résidu est changée (par exemple par une mutation ou par l’environnement extérieur), la fonction et/ou la structure de la région peuvent en être affectées. Partant de ce constat, il est recommandé de tenir compte des liens physico-chimiques existant entre les résidus des protéines étudiées, pour renforcer ou invalider les résultats obtenus précédemment, dans le but d’identifier les régions cibles les plus pertinentes. Ainsi, il convient de déterminer, pour chaque acide aminé de la protéine candidate, les liaisons chimiques (par exemple hydrogènes, hydrophobiques, ioniques et répulsives) auxquelles cet acide aminé pourrait potentiellement participer (étape E3 de la figure 1). En particulier, il convient d’identifier, à partir de la structure tridimensionnelle de la protéine, les paires de résidus dont les acides aminés sont suffisamment proches pour que les liaisons chimiques identifiées puissent effectivement influer sur la fonction et/ou la stabilité de ces résidus (voir étape E4 de la figure 1). Les étapes additionnelles E3 et E4 permettent donc de mettre en évidence des couples d’acides aminés ayant une interaction chimique influant sur leur fonction, ou susceptible d’évoluer lors des modifications de l’environnement de la protéine (pH, température, force ionique, etc.). La stabilité des protéines est en effet souvent dépendante du pH, et varie en fonction du sous-type et/ou de l'origine de l’organismes hôte. Par exemple, l’hémagglutinine (HA) du virus de la grippe humaine est plus stable que l’hémagglutinine du virus aviaire (Galloway S. E. et al.). De plus, des mutations peuvent entraîner des modifications du réseau d'interaction chimique, et stabiliser ou déstabiliser cette protéine (Byrd-Leotis L. et al.). Le réseau physico-chimique intraprotéique est constitué de plusieurs types d'interactions, telles que les interactions hydrophobes, hydrogènes, ainsi que les ponts salins, les interactions répulsives négatives et répulsives positives, entre autres (Dyson H. J. et al. ; Hubbard R. E. & Kamran Haider M. ; Sticke D. F. et al. ; Barlow D. J. & Thornton J. M ; Harrison J. S. et al.). Ces interactions permettent que la protéine possède une forme bien particulière : c’est pour cela qu’elles sont importantes. Si elles n’étaient pas là, la structure de la protéine et sûrement sa fonction seraient modifiées. C’est pourquoi ces régions riches de ces liaisons chimiques sont importantes à déterminer, dans le contexte de la méthode de l’invention. Contrairement aux interactions hydrophobes et hydrogènes pour lesquelles la sensibilité au pH est négligeable (ou insuffisamment documentée), les interactions électrostatiques sont fortement affectées par les variations de pH (Harrison, J. S. et al. ; Pahari S. et al.). Les résidus d'histidine (pKa ≈ 6,4) sont des capteurs de pH biologiques car ils sont partiellement chargés à pH neutre et chargés positivement à pH acide (Pahari S. et al ; Kampmann T. et al.). L'arginine et la lysine (pKa ≈ 13,8 et 10,7) sont plus basiques et invariablement protonées dans des conditions physiologiques (Pahari S. et al ; Fitch, C. A et al.). Cependant, de grandes fluctuations de pKa peuvent se produire en fonction du micro-environnement (Pahari S. et al. ; Harris T. K. & Turner G. J. ; Harms M. J. et al. ; Di Russo N. V. et al. ; Baumgart M. et al.). Par conséquent, le pKa du groupe carboxyle chargé négativement de l'aspartate et du glutamate (pKa ≈ 3,4 et 4,1) se rapproche des valeurs de pH atteintes lors de la maturation endosomale (Pahari S. et al. ; Mellman I.,et al.). Par conséquent, la rupture des ponts salins (ou du moins leur affaiblissement dans le cas où la liaison hydrogène demeure), peut se produire si pH < pKagroupe carboxyl (Meuzelaar H. et al.). Enfin, les répulsions cation-cation et anion-anion induisent des déstabilisations importantes (Harrison J. S. et al.). Lorsque le pH baisse, les répulsions négatives peuvent également être perturbées et former potentiellement des liaisons hydrogène. Le procédé ici décrit contient donc une étape de caractérisation des interactions chimiques existant entre tous les atomes de la protéine, ou à tout le moins ceux présents dans la région candidate sélectionnée précédemment. Cette étape vise notamment à identifier les interactions suivantes (Hubbard R. E. & Kamran Haider M. ; Barlow D. J. & Thornton J. M ; Harrison J. S. et al. ; Donald J. E. et al. ; Freitas R. F. de & Schapira M. ; Onofrio A. et al.) : - Les liaisons hydrophobes entre atomes non polaires du type (CB, CG, CE, CD1, CD2, CE2, CE3, CZ2, CZ3, CH2, CE1, CZ, CG1, CG2, CD, CH2) appartenant aux acides aminés hydrophobes suivants (ALA, MET, TRP, PHE, TYR, VAL, LEU, ILE, PRO). Seront sélectionnés les atomes présentant ce type de liaisons, lorsque leur distance est inférieure à 4.2 Å. - Les liaisons hydrogènes constituées d’un atome donneur de proton (OG, OG1, NE2, ND2, ND1, NE2, NZ, NE, NH1, NH2, OH, NE1) appartenant à un acide aminé donneur de proton (SER, THR, GLN, ASN, HIS, LYS, ARG, TYR, TRP) et d’un atome accepteur de proton (OG, OG1, OE1, OE2, OD1, OD2, ND1, NE2, OH) appartenant à un acide aminé accepteur de proton (SER, THR, GLU, ASP, GLN, ASN, HIS, TYR). Seront sélectionnés les atomes présentant ce type de liaisons, lorsque leur distance est inférieure à 3,5 Å (Hubbard R. E. & Kamran Haider M. ; Sticke D. F. et al.). Ces liaisons hydrogènes peuvent être constituées d’interaction entre deux chaines latérales ou entre une chaine latérale et la chaine principale de la protéine. Les donneurs de proton (N) de la chaine principale ou les accepteurs de proton de cette même chaine peuvent appartenir à n’importe quel acide aminé de la chaine principale. - Les liaisons électrostatiques, de deux sortes : o Les liaisons attractives (ponts salin ou interaction ionique) lorsqu’un cation (NE, NH1, NH2, NZ, NE2, ND1) d’un résidu chargé positivement (ARG, LYS, HIS), notamment lorsqu’il est à une distance inférieure à 4 Å d’un anion (OD1, OD2, OE1, OE2) porté par un résidu chargé négativement (ASP, GLU). o Les liaisons répulsives constituées de deux atomes de charges identiques (-/-) ou (+/+), notamment lorsqu’ils sont séparés d’une distance inférieures à 5 Å (Barlow D. J. & Thornton J. M. ; Harrison J. S. et al.). Tous les atomes chargés positivement et négativement peuvent être pris en considération dans le calcul, dans la mesure où les charges sont équitablement distribuées entre les groupes ionisables, par stabilisation de la résonance entre les charges. Différents scores peuvent être calculés pour évaluer l’interactivité chimique de chaque acide aminé au sein de la région candidate ou au sein de la protéine. Il est notamment possible de déterminer le pourcentage de liaisons hydrophobes et/ou le pourcentage de liaisons hydrogène et/ou le pourcentage de ponts salins et/ou le pourcentage de répulsions négatives et/ou le pourcentage de répulsions positives et/ou le pourcentage de liaisons chimiques (étape E3’). En pratique, le procédé de l’invention contient donc avantageusement une étape de calcul de la distance entre chaque atome de la protéine, par exemple à partir d’un fichier pdb, SwissProt, uniprot ou Modbase. De préférence, les distances entre atomes appartenant à une même position ne sont pas calculées à moins qu’ils n’appartiennent à des protomères différents. Suite à ce calcul, les atomes séparés d’une distance d’au maximum 5 Å sont sélectionnés. Cette étape est de préférence réalisée avant de recenser les interactions chimiques entre les atomes. Ainsi, seules les interactions chimiques liant des atomes proches sont à prendre en considération. Il est possible cependant de réaliser les deux étapes dans l’ordre inverse. A partir du nombre ^ ^^^ ^ ^ ^ ^^ ^ ^ ^ ^ ^ ^ représentant le nombre total de couples d’atomes se situant à moins de 5 angströms, plusieurs scores peuvent être calculés. Il est notamment possible de calculer le pourcentage de liaisons hydrophobes et/ou le pourcentage de liaisons hydrogène et/ou le pourcentage de ponts salins et/ou le pourcentage de répulsions négatives et/ou le pourcentage de répulsions positives et/ou le pourcentage de liaisons chimiques (étape E3’). Il est possible de calculer également une fonction de score ^(^^^^^^^ ) qui donne une image des interactions chimiques globales de la protéine étudiée est calculé (étape E3’). Grâce à toutes ces étapes, les résidus liés par lesdites interactions chimiques avantageuses, et étant à une distance telle que ces liaisons influent sur la fonction de ces résidus, sont sélectionnés. Il s’agit de l’étape E4 sur la figure 1. A ce stade, il est possible de représenter les différentes liaisons chimiques sous forme de graphes (étape E8’). En effet, à partir des liaisons précédemment détectées, des graphes mathématiques sont formés. Les nœuds du graphe sont les positions / résidus, les arêtes définissent le lien chimique qu’il y a entre les positions. De manière complémentaire ce type de graphe peut être visualisé grâce au logiciel libre Graphviz. Ces graphes sont un moyen supplémentaire d’évaluer les liaisons identifiées. L’étape E5 permet d’identifier la ou les meilleure(s) régions cibles thérapeutiques permettant de générer un médicament potentiel en croisant les résultats obtenus à l’issue de l’étape E2 avec ceux obtenus à l’issue de l’étape E4. La qualité des cibles sélectionnées peut avantageusement être évaluée par le calcul de plusieurs fonctions de score. Par exemple, il est possible de calculer l’invariance de chaque région cible par la fonction ^(^^^^^ ). L’invariance de chaque région cible permet de s’assurer qu’elle sera stable dans le temps. De plus, la fonction ^(^^) permet d’obtenir un score entre 0 et 1 pour chaque cible SX. Ce score permet d’évaluer à quel point la cible identifiée est efficace pour conserver le médicament. En d’autres termes ces deux fonctions de score permettent d’évaluer l’efficacité de la région cible. Les régions cibles peuvent avantageusement être représentées sous la forme de graphes (étape E8’’). En effet, à partir des couples précédemment détectés, des groupes de résidus interdépendant au moyen de graphes mathématiques sont formés. Dans ces graphes sont intégrés les résidus invariants et les couples de résidus synthétiques létaux qui forment des groupes d’invariance, et qui sont liés par les liaisons chimiques avantageuses. Les nœuds du graphe sont les positions / résidus sélectionnés, les arêtes définissent le lien qu’il y a entre les positions (synthétiques létaux, invariant, ou interaction chimique avantageuse) et n’existe que si les deux résidus à cette position sont positionnés à moins de 10 Angströms et à la surface de la protéine candidate. De manière complémentaire ce type de graphe peut être visualisé grâce au logiciel libre Graphviz. Ces graphes sont un moyen supplémentaire d’évaluer la qualité des régions identifiées. La complexité des graphes peut être calculée (étape E8’’’) par le score S26 ainsi que le nombre de graphes connexes par le score S27. Une telle complexité est utile : si le graphe est complexe, cela traduit un nombre conséquent de cible. S’il est très complexe, il peut y avoir des intersections entre cibles non vides. S’il y a beaucoup de sous-graphes en soleil, cela signifie qu’un résidu est en lien avec beaucoup d’autres et que la majorité de la fonction lui incombe. Définitions des scores S1 : ^^ : Hétérogénéité de la longueur des séquences. Considérons ^ la moyenne et ^ l’écart-type des longueurs en acides aminés des séquences de l’échantillon étudié. ^^ ^ > ^ ^^^^^ ^^ = 0 Un score ^^ = 1 indique une hétérogénéité absolue tandis que ^^ = 0 indique aucune hétérogénéité. S2 : ^^^^^^ : Séquences ayant un nombre aberrant de mutation. Considérons ^ la moyenne et ^ l’écart-type du nombre de mutations calculés par séquences de l’échantillon étudié, en comparaison à une séquence de référence. L’échantillon étudié est constitué des séquences polypeptidiques téléchargées avant les étapes de nettoyage et la séquence de référence introduite à l’étape E0 précédemment décrite. Sachant que le nombre de mutations aberrant est défini tel que ^^^^^ >= ^ + 3 × ^ et que ^^^ ^^ ^^^^^ correspond au nombre de séquences possédant un nombre de mutation supérieur ou égal à ^^^^^. On peut alors calculer : ^^^^^^ = 1 − (^^^ ^^ ^^^^^ ÷ ^^^ ^^ ) avec ^^^ ^^ le nombre de séquences total. Plus S2 est proche de 1, plus le nombre de mutations aberrantes est important. S3 : ^^^^^^ : Séquences ayant un nombre aberrant d’acides aminé (AA) mal définis (noté NYP). A ce titre, on note qu’au cours de l’étape de séquençage des séquences nucléotidiques, il est parfois impossible de définir exactement la base azotée exacte (A, T, G, C) se trouvant à cet emplacement bien qu’il soit possible d’affirmer qu’un nucléotide existe bien à cette position. Cette position est notée N. Lorsque le séquençage ne peut pas définir le nucléotide exact, mais qu’il est possible d’affirmer qu’il s’agit d’une purine, alors un P est ajouté, et si c’est une pyrimidine, alors un Y est ajouté. Il en découle, dans la majorité des cas, une impossibilité à définir l’acide aminé qui se trouvera à cette position, qui sur l’alignement protéique sera noté comme un « gap ». Il ne sera donc plus possible de faire la différence entre une difficulté à déterminer la base azotée durant le séquençage et le fait que le séquençage n’a pas été fait. Ainsi, à partir des séquences nucléotidiques, nous pouvons calculer le nombre d’acide aminés mal définis. Considérons ^ la moyenne et ^ l’écart-type du nombre de mutations calculés par séquences de l’échantillon étudié, en comparaison à une séquence de référence. Sachant que le nombre de NYP aberrant est défini tel que ^^^^^ >= ^ + 3 × ^ et que ^^^ ^^ ^^^^^ correspond au nombre de séquences possédant un nombre de NYP supérieur ou égal à ^^^^^. On peut alors calculer : ^^^^^^ = 1 − (^^^ ^^ ^^^^^ ÷ ^^^ ^^ ) Plus S3 est proche de 1, plus le nombre d’acides aminés aberrant est grand. S4 : ^^^^^^ : Séquences ayant un nombre aberrant de gap. Considérons ^ la moyenne et ^ l’écart-type du nombre de mutations calculés par séquences de l’échantillon étudié, en comparaison à une séquence de référence. Sachant que le nombre de gap aberrant est défini tel que ^^^^^ >= ^ + 3 × ^ et que ^^^ ^^ ^^^^^ correspond au nombre de séquence possédant un nombre de gap supérieur ou égal à ^^^^^. On peut alors calculer : ^^^^^^ = 1 − (^^^ ^^ ^^^^^ ÷ ^^^ ^^ ) Plus le score S4 est proche de 1, plus le nombre de gap est aberrant. F(S1QS) : Impact des données séquences sur la qualité de la Prédiction statistique. Cette fonction varie de 0 à 1. ^^^^^^^ permet d’évaluer si les données en entrée sont suffisantes et robustes face à la prédiction à réaliser : S5 : ^^^^^^ : Structure 3D ayant un nombre aberrant de données manquantes. Considérons, ^^^^^^^^ comme le nombre total de fichiers étudiés et ^ la moyenne et ^ l’écart-type du nombre d’acides aminées par fichier de l’échantillon étudié, en comparaison à un fichier de référence. Ce fichier de référence peut être choisi de deux manières. Soit ce fichier est défini comme par la communauté scientifique, soit parce qu’il représente la racine d’un arbre phylogénétique contenant toutes ou la majorité des protéines étudiées Sachant que le nombre d’acides aminés (AA) manquant aberrant est défini tel que : ^^^^ = ^ + 3 × ^ Et que ^^^^^^^^ ^^^^ correspond au nombre de fichier possédant un nombre de AA manquant supérieur ou égal à ^^^^^. On peut alors calculer : On note que le choix d’une structure de référence en particulier impacte peu puisque son nombre total de résidus sera très proche d’une autre structure décrite ne possédant pas un nombre aberrant de positions non renseignées. S6 : ^^^^^^^^^ : impact de l’existence de différentes sous-unités sur le résultat final. Si la protéine étudiée possède plusieurs sous-unités (chacune notée subunit), elles seront alors répertoriées, quels que soient le nombre de séquences dans l’alignement. Si elle ne possède qu’une seule sous-unité, alors ce score sera égal à 1. S7 : ^^^^^ ^ : Importance du nombre de séquences (seuil théorique à 1000). ^^^ ^^ est le nombre total de séquences de l’échantillon à l’exception des séquences possédant un nombre aberrant de mutations ∀ ^^^ ^^ ∈ ℕ, ^^ (^^^ ^^ − ^^^^ ^^ ^^^^^ ∪ ^^^ ^^ ^^^^^ ∪ ^^^ ^^ ^^^^^^) > 1000, ^^ (^^^ ^^ − ^^^^ ^^ ^^^^^ ∪ ^^^ ^^ ^^^^^ ∪ ^^^ ^^ ^^^^^^) < 1000, S8 : ^^^^^^^ : évalue l’impact des gaps dans l’alignement. Considérons ^ la moyenne et ^ l’écart-type du nombre de gap calculés par séquences de l’échantillon étudié après alignement, en comparaison à la même séquence avant l’alignement. ^ ^^ ^ < ^ ^^^^^ ^^^^^^^ = 1 − ^ ^^ ^ > ^ ^^^^^ ^^^^^^^ = 0 S9 : ^^^^^ et ^^^^^: impact de la variance des extrémité 5’ et 3’. 5 acides aminés (AA) de l’extrémité 5’ et 5 AA de l’extrémité 3’ sont étudiés. Les résidus invariants (inv) les couples de synthétiques létaux (SL) et de mutations compensatoires (CM) sont répertoriés aux extrémités. à ^^^^^ ^^^ ^^^^^ ^^^^ > 1 ^^^^ ^^ ^^^ ^^^^^ = 1 S10 : ^^^^ : Redondance du lot de séquence. Considérons ^ la moyenne et ^ l’écart-type de l’histogramme de la redondance des séquences. Les séquences polypeptidiques correspondant à la protéine candidate, peuvent être très hétérogènes ou peu hétérogène quant aux mutations qu’elles portent. Une situation extrême peut être que sur X séquences, elles possèderaient toutes la même séquence d’AA. On admettrait alors que ce lot est très homogène, que la redondance est absolue, et donc aurait un score égal à 0. A l’inverse, lorsque les séquences polypeptidiques sont très différentes prises deux à deux, alors il y a très peu de redondance, et le score tend vers 1. ^ ^^ ^ < ^ ^^^^^ ^^^^ = ^ ^^ ^ > ^ ^^^^^ ^^^^ = 1 Si S10 = 1 hétérogénéité absolue, si S10= 0 aucune hétérogénéité S11 : ^^^^ : impact des régions hypervariable. Les régions hypervariables (hyp) sont répertoriées à partir de la bibliographie et comptées, quel que soit le nombre de séquences dans l’alignement. ^^^^ = 1 ÷ ^ ℎ^^^^^^ S12 : ^^^^^^ : impact des délétions et insertions. Les insertions-délétions (indel) sont répertoriées à partir de la bibliographie et comptées, quelques soient le nombre de séquences dans l’alignement. S13 : ^^^^^^^^ : impact des modifications post-traductionnelles. Les différents types de modifications post-traductionnelles (postrad) sont répertoriées à partir de la bibliographie et comptées, quelques soient le nombre de séquences dans l’alignement. S14 : ^^^^^^^^ : impact de l’existence de différents sous-types. Les différents sous-types (chacun noté « subtype ») appartenant au lot de séquences étudiées sont répertoriés, quelques soient le nombre de séquences dans l’alignement. En effet, certains microorganismes mutent tellement rapidement que l’évolutions dans le temps de ces différents variants permet l’apparition de sous-types de variant. ^^^^^^^^ = 1 ÷ ^ ^^^^^^^^^^^^^^^^^ ^(^^) : qualité de l’alignement des séquences primaires + ^^^^ + (^^^^ + ^^^^^^^^ + ^^^^^^^^) ÷ 3 × 2) ÷ 17 ^^^^^^^ : qualité de la prédiction statistique de l’alignement ^^^^^^^ : Impact de l’alignement sur la prédiction de la cible S18 : ^^^^ : Richesse mutationnelle des séquences. Considérons ^ la moyenne et ^ l’écart-type du nombre de mutations calculés par séquences de l’échantillon des séquences possédant un nombre de mutation < ^^^^^, en comparaison à une séquence de référence. ^^ ^ > ^ ^^^^^ ^^^^ = 1 Si S18 = 1, grande hétérogénéité, si S18= 0 aucune hétérogénéité. S19 : ^^^^ : impact des positions invariantes. On définit le pourcentage de résidus invariants (Qualité de la Cible QC). Les résidus invariants sont identifiés de la manière suivante : un même acide aminé se trouve à une position donnée dans aux moins 99.7% des séquences. Le somme de ces positions donne ^^^^ ^^^^ = ^^^^ ÷ ^^^^ ^^ ^^^^ ^^^ ^^ ^^^^^^^^ ^^ ^′^^^^^^^^^^ ^(^^^^^^^^^^^ ) : degré d’invariance Cette fonction de score permet d’évaluer le degré d’invariance vrai du lot de séquences étudiées, donne ainsi une image de son essentialité. En effet, les positions invariantes, sont telles qu’elles ne pourront pas être sélectionnées en cas de mutation puisqu’elles sont essentielles à la réplicabilité de l’organisme dont la protéine candidate est issue. S20 : ^^^^^^ : impact du nombre de positions covariantes. On définit le pourcentage de résidus covariants de la manière suivante : somme des positions retrouvées dans un couple de covariants (^^^^^ ^^ ^^ ) ayant un ^^ définit selon le protocole Noirvit (Noivirt, et al., 2005). ^^^^^^ = ^^^^^ ^^ ^^ ÷ ^^^^ ^^ ^^^^ ^^^ ^^ ^^^^^^^^ ^^ ^^^^^^^^^^^^ S21 : ^^^^^^^^^ : impact du nombre de couple de positions covariantes. On définit le pourcentage de couple de résidus covariants de la manière suivante : somme des couples des résidus ayant un ^^ définit selon le protocole de Noirvit ^^^^^ ^^ ^^^ ^^ ^^ S24 : ^^^^^ : impact de la mutabilité non synonyme globale. Elle se calcule comme suit : ^^ ^^^^ ^^ ^^ ^^^^ é^^^^ ^^^^^^é ^^^^ Lao et al. où A désigne un résidu de la séquence étudiée qui est non synonyme à la séquence de référence choisie et où S désigne un résidu de la séquence étudiée qui est synonyme à la séquence de référence choisie. S25 : ^^^^^ : impact de la mutabilité synonyme. Elle se calcule comme suit : ^^ ^^^^ ^^ ^^ ^^^^ é^^^^ ^^^^^^é ^^^^ Lao et al. S22 : ^^^ : impact du nombre des SL et de leur force dans le résultat global. Ce score est la somme des coefficients de dissimilarité ^ négatif donc des couples de résidus SL rapporté à la somme de tous les ^^ (SL plus CM) S23 : ^^^ : impact du nombre des CM et de leur force dans le résultat global. Ce score est la somme des coefficients de dissimilarité ^ positif donc des couples de résidus CM rapporté à la somme de tous les ^^ (SL plus CM) S27 : ^^^^^^^^^^ : Complexité du graphe. On précisé qu’un graphe G est défini par un couple (S,A) avec S un ensemble fini de sommets, et A un ensemble fini de couple de sommets (si, sj) dans S². Un couple est donc un couple de sommets relié par une arête Il s’agit d’étudier les résidus invariants et SL impliqués dans plusieurs relations de couples (proches dans l’espace et se situant à la surface de la protéine, étant soient invariants soient impliqués dans une relation de synthétiques létaux). A partir du graphe des liens, on définit ce score comme étant la moyenne du nombre d’arrêtes (a) par nœud (^)̿ S28 : ^^^^^^^ : Nombre de graphes connexes. On précise qu’un graphe est connexe si chaque couple de sommets est relié par une arête. S28 : ^^^^^^ : résidus proches dans l’espace (5 angströms). Ce score correspond à la proportion de paires de résidus situés à moins de 5 angströms l’un de l’autre (^^). A partir d’un fichier pdb de référence, le calcul de la distance entre les 2 ^^ d’une paire de résidus est effectué pour toutes les paires de résidus. Le nombre de paires étant séparé de moins de 5 angströms est évalué et noté ^ ^^^ ^ ^ ^ ^^ ^ ^ ^ ^ ^ ^ . S29 : ^^^^^^^ : résidus proches dans l’espace (10 angströms). Ce score correspond à la proportion de paires de résidus situés à moins de 10 angströms l’un de l’autre (^^). A partir d’un fichier pdb de référence, le calcul de la distance entre les 2 ^^ d’une paire de résidus est effectué pour toutes les paires de résidus. Le nombre de paires séparées de moins de 10 angströms est notée ^ ^^^^^^^^^^^^^^^^. S30 : ^^^^^^^^^^^ : invariants et SL proche dans l’espace (5 angströms) A partir d’un fichier pdb de référence, le calcul de la distance entre les 2 ^^ d’une paire de résidus est effectué pour toutes les paires de résidus. Le nombre de paires étant séparé de moins de 5 angströms est évalué et noté ^ ^^ ^ ^^ ^ ^ ^ ^^ ^ ^ ^ ^ ^ ^^ ^ ^ ^ ^ ^ ^ ^ ^ . S31 : ^^^^^^^^^^^^ : invariant et SL proche dans l’espace (10 angströms) A partir d’un fichier pdb de référence, le calcul de la distance entre les 2 ^^ d’une paire de résidus est effectué pour toutes les paires de résidus. Le nombre de paires séparées de moins de 10 angströms est notée ^ ^^^^^^^^^^^^^^^^^^^^^^^^^^^. S32 : ^^^^ : Pourcentage de résidus accessibles. Ou ^^^^^ représente le nombre de résidus accessibles et ^ ^^^^^^^ le nombre de résidus enfouis, peuvent être déterminé par le logiciel ASA (Alland et al., 2005) S33 : ^^^^^^^^^ : Pourcentage de résidus invariants et SL accessibles. Ou ^^^^ ^^^^^^^^^^^^ représente le nombre de résidus accessible et ^ ^^^^^^^ ^ ^ ^ ^^ ^ ^ ^ ^ ^ ^ le nombre de résidus enfouis. Ils sont déterminés par le logiciel ASA (Alland et al., 2005) ^(^^^^^^^ ) : réactivité chimique Avec ^^^^^^^^^^ le pourcentage de liaisons chimiques, ^(^^^^^ ) : Score d’invariance pour chaque cible On définit deux ensembles A et B : - L’ensemble A regroupe les graphes connexes ou très peu connectés (chaque de ces sous-graphes représentent un sous-ensemble de l’ensemble A). Rappelons la définition d’une arête reliant deux résidus : les deux résidus sont à moins de 10 angströms, ils sont présents à la surface de la molécule et sont soit invariants soit font partie d’un couple de SL. - L’ensemble B regroupe les cibles définies par le logiciel F-pocket (chaque cible définie un sous-ensemble de l’ensemble B). Il s’agit ensuite de lier un sous-ensemble de l’ensemble A à un sous-ensemble de l’ensemble B. Une fois ces sous-ensembles liés deux à deux (un de l’ensemble A à un de l’ensemble B), on définit l’intersection de leur élément (^^^^^^) ainsi que leur union (^^^^^^). plus ^^^^^^ ^^^ ^ ^ ÷ (^^^ ^^^^^^ ^^^ ) est proche de 1, plus l’invariance de la cible x est totale et donc moins elle sera sujette à variabilité dans l’avenir. Ainsi une telle cible permettra de réduire drastiquement l’apparition de nouveau variants résistants aux médicaments. En effet, pour que ces variants existent, il faudrait que des positions de la cible puissent muter. Or une telle cible mutée ne permettrait plus la réplicabilité du variant et remettrait donc en cause son existence. ^(^^) : score entre 0 et 1, pour chaque cible ÷ (^^^^^^ × (^^^^^^ − 1)) ÷ 2))) ÷ 4 Cette fonction de score permet de donner un score à chacune des cibles déterminées par notre logiciel et définit la « druggabilité » (en anglais « druggability ») de cette cible. La « druggability » signifie pouvoir lier efficacement une petite molécule qui aurait des capacités thérapeutiques donc représenter un futur médicament. A cette définition est ajouté que cette cible laisserait peu ou pas de possibilité d’échappement thérapeutique. Ainsi une petite molécule, futur médicament, doit pouvoir se lier chimiquement à un groupe de résidus (^^^^^^^^^^) se trouvant dans un espace concave (appelé poche), dont on peut déterminer le volume (^^^^), et ayant la plus grande invariance possible (^(^^^^^ ). ^(^^) : qualité de l’alignement tridimensionnel : ^(^^) = ^^^^^^^ × 8 + ^^^^^^^^^^ × 5 + ^^^^^^^ : qualité de la prédiction statistique de l’alignement structurel : ^^^^^^^ = sur la prédiction de la cible : EXEMPLE La méthode de l’invention a été mise en œuvre sur la protéine hémagglutinine (HA) du virus de la grippe. Cette mise en œuvre a mis en évidence plusieurs liaisons chimiques avantageuses qui permettent de sélectionner 7 couples / groupes d’acides aminés reliés par des liaisons importantes chimiques et génétiques, dont la distance est acceptable (Figure 2, voir les acides aminés grisés). Ces couples / groupes particulièrement avantageux ont ensuite été pris en compte dans l’analyse des régions cibles thérapeutiques de la protéine HA identifiées lors de la mise en œuvre des étapes (E1) et (E2) de la méthode de l’invention. Comme le montre la Figure 3 (reprenant les informations de la figure 3 de Lao et al.), la prise en compte de ces 7 groupes d’acides aminés préférentiels restreint le nombre de régions cibles thérapeutiques au sein de HA de 6 à 3. Ces 3 cibles thérapeutiques feront donc l’objet de criblage de médicaments pharmaceutiques avec une probabilité accrue d’identifier des actifs fiables et efficients. La méthode de l’invention permet donc d’affiner la méthode précédemment proposée dans Lao et al. en ajoutant une étape (E3) qui nécessite de déterminer toutes les interactions chimiques présentes entre chaque résidu et/ou entre chaque couple de résidus au sein de la protéine candidate séparés par une distance d’au plus 5 Angström (cf. Figure 2). Grâce à cette étape additionnelle, seules les paires / groupes de résidus possédant des caractéristiques physico-chimiques avantageuses et se trouvant à une distance telle que les liens chimiques entre résidus ont potentiellement une influence (E4), seront sélectionné(e)s. Ainsi, l’information « d’interactivité chimique » proposée dans la présente invention renforce la validité des cibles identifiées par l’approche génétique de Lao et al. en sélectionnant les plus pertinentes, de sorte à réduire significativement le nombre de cibles thérapeutiques à utiliser dans les programmes de criblage de banques de molécules et à renforcer la probabilité d’identifier plus vite des médicaments plus efficaces. REFERENCES BIBLIOGRAPHIQUES Alland et al., 2005 Alland et al. : Alland C, Moreews F, Boens D, Carpentier M, Chiusa S, Lonquety M, Renault N, Wong Y, Cantalloube H, Chomilier J, et al. 2005. RPBS: a web resource for structural bioinformatics. Nucleic Acids Res 33:W44-49 Barlow, D. J. & Thornton, J. M. Ion-pairs in proteins. Journal of Molecular Biology 168, 867–885 (1983) Baumgart, M. et al. Design of buried charged networks in artificial proteins. Nat Commun 12, 1895 (2021). Brouillet S., Valere T., Ollivier E. , Marsan L., Vanet A., Co-lethality studied as an asset against viral drug escape: the HIV protease case. Biol Direct. 2010 Jun 17;5:40. Byrd-Leotis, L., Galloway, S. E., Agbogu, E. & Steinhauer, D. A. Influenza hemagglutinin (HA) stem region mutations that stabilize or destabilize the structure of multiple HA subtypes. J Virol 89, 4504–4516 (2015). Cheng C, Xiao P. Evaluation of the correctable decoding sequencing as a new powerful strategy for DNA sequencing. Life Sci Alliance. 2022 Apr 14;5(8):e202101294. Childers, M. C., Towse, C.-L. & Daggett, V. The effect of chirality and steric hindrance on intrinsic backbone conformational propensities: tools for protein design. Protein Eng Des Sel 29, 271–280 (2016). Di Russo, N. V., Estrin, D. A., Martí, M. A. & Roitberg, A. E. pH-Dependent conformational changes in proteins and their effect on experimental pK(a)s: the case of Nitrophorin 4. PLoS Comput Biol 8, e1002761 (2012). Donald, J. E., Kulp, D. W. & DeGrado, W. F. Salt bridges: geometrically specific, designable interactions. Proteins 79, 898–915 (2011). Dyson, H. J., Wright, P. E. & Scheraga, H. A. The role of hydrophobic interactions in initiation and propagation of protein folding. Proceedings of the National Academy of Sciences 103, 13057–13061 (2006). Fitch, C. A., Platzer, G., Okon, M., Garcia-Moreno E, B. & McIntosh, L. P. Arginine: Its pKa value revisited. Protein Sci 24, 752–761 (2015). Freitas, R. F. de & Schapira, M. A systematic analysis of atomic protein–ligand interactions in the PDB. Med. Chem. Commun. 8, 1970–1981 (2017). Galloway, S. E., Reed, M. L., Russell, C. J. & Steinhauer, D. A. Influenza HA subtypes demonstrate divergent phenotypes for cleavage activation and pH of fusion: implications for host range and adaptation. PLoS Pathog 9, e1003151 (2013). Harms, M. J. et al. The pKa Values of Acidic and Basic Residues Buried at the Same Internal Location in a Protein Are Governed by Different Factors. Journal of Molecular Biology 389, 34–47 (2009). Harris, T. K. & Turner, G. J. Structural Basis of Perturbed pKa Values of Catalytic Groups in Enzyme Active Sites. IUBMB Life 53, 85–98 (2002). Harrison, J. S. et al. Role of Electrostatic Repulsion in Controlling pH-Dependent Conformational Changes of Viral Fusion Proteins. Structure 21, 1085–1096 (2013). Hubbard, R. E. & Kamran Haider, M. Hydrogen Bonds in Proteins: Role and Strength. in eLS (John Wiley & Sons, Ltd, 2010). Kampmann, T., Mueller, D. S., Mark, A. E., Young, P. R. & Kobe, B. The Role of Histidine Residues in Low-pH-Mediated Viral Membrane Fusion. Structure 14, 1481– 1487 (2006). Kuiken H.J.,, Beijersbergen R.L., Exploration of synthetic lethal interactions as cancer drug targets. Future Oncol. 2010 Nov;6(11):1789-802 Lao J. and Vanet A. A New Strategy to Reduce Influenza Escape: Detecting Therapeutic Targets Constituted of Invariance Groups. Viruses. 2017 Mar 2;9(3):38. Mellman, I., Fuchs, R. & Helenius, A. Acidification of the endocytic and exocytic pathways. Annu. Rev. Biochem. 55, 663–700 (1986). Meuzelaar, H., Vreede, J. & Woutersen, S. Influence of Glu/Arg, Asp/Arg, and Glu/Lys Salt Bridges on α -Helical Stability and Folding Kinetics. Biophysical Journal 110, 2328– 2341 (2016). Le Guilloux, V.; Schmidtke, P.; Tuffery, P. Fpocket: An open source platform for ligand pocket detection. BMC Bioinform. 2009, 10, 168 Noivirt, O.; Eisenstein,M.; Horovitz, A. Detection and reduction of evolutionary noise in correlated mutation analysis. Protein Eng. Des. Sel. 2005, 18, 247–253 Onofrio, A. et al. Distance-dependent hydrophobic–hydrophobic contacts in protein folding simulations. Phys. Chem. Chem. Phys. 16, 18907–18917 (2014). Pahari, S., Sun, L. & Alexov, E. PKAD: a database of experimentally measured pKa values of ionizable groups in proteins. Database 2019, baz024 (2019). Petitjean M., Badel A., Veitia R.A., Vanet A., Synthetic lethals in HIV: ways to avoid drug resistance : Running title: Preventing HIV resistance. Biol Direct. 2015 Apr 17;10:17 Sticke, D. F., Presta, L. G., Dill, K. A. & Rose, G. D. Hydrogen bonding in globular proteins. Journal of Molecular Biology 226, 1143–1159 (1992).

Claims

REVENDICATIONS 1. Procédé mis en œuvre par ordinateur de détermination d’au moins une région cible thérapeutique sur une protéine candidate d’un organisme pathogène cible, ledit procédé comprenant les étapes suivantes : a) Identification (E1), dans un ensemble de séquences nucléotidiques et polypeptidiques caractéristiques de ladite protéine candidate, au préalable alignées, de résidus invariants et/ou de paires de résidus synthétiques létaux dits résidus cibles ; b) Identification (E2) d’au moins une région candidate constituée d’au moins une paire de résidus cibles identifiés à l’étape a), ladite au moins une paire comprenant des résidus cibles situés à une distance déterminée dans l’espace et étant exposée à la surface de la protéine candidate, de préférence dans une poche ; c) Détermination (E3) des interactions chimiques avantageuses entre chaque résidu et/ou entre chaque couple de résidus au sein de la protéine candidate, à partir de la structure 2D et/ou 3D de la protéine candidate ; lesdites interactions chimiques avantageuses étant des liaisons hydrophobes et/ou des liaisons hydrogènes et/ou des ponts salins et/ou des liaisons à répulsions négatives et/ou à répulsions positives ; d) Sélection (E4) des résidus liés par lesdites interactions chimiques avantageuses, lesdits résidus étant à une distance d'au plus 10 Angströms ; e) Sélection (E5) d’au moins une région cible thérapeutique parmi les régions candidates identifiées à l’étape b), comprenant les résidus sélectionnés à l’étape d). 2. Procédé selon la revendication 1, dans lequel l’étape d’identification (E3) des interactions chimiques avantageuses consiste en une détermination de l’interactivité chimique de tous les résidus au sein de la protéine et/ou en une détermination de l’interactivité chimique de tous les couples de résidus au sein de la protéine, lesdits résidus ou couples de résidus étant espacés d’une distance déterminée d'au plus 10 Angströms. 3. Procédé selon l’une quelconque des revendications 1 à 2, dans lequel la distance entre les résidus invariants ou entre les paires de synthétiques létaux déterminée à l’étape b) est comprise entre 2 et 8 Angströms, de préférence 5 Angströms. 4. Procédé selon l’une quelconque des revendications 1 à 3, comprenant une évaluation (E3’) de l’interactivité chimique des liaisons déterminées (E3) comprenant un calcul d’au moins un score parmi : un pourcentage de liaisons hydrophobes et/ou un pourcentage de liaisons hydrogènes et/ou, un pourcentage de ponts salins et/ou un pourcentage de liaisons à répulsions négatives et/ou un pourcentage de liaisons à répulsions positives et/ou un pourcentage de liaisons chimiques. 5. Procédé selon l’une quelconque des revendications précédentes, dans lequel la région cible est une poche identifiée à partir d’un ensemble de structures 3D alignées de la protéine candidate et dans lequel les interactions chimiques sont déterminées sur un ensemble de structures 3D alignées de la protéine candidate. 6. Procédé selon la revendication 5, dans lequel la poche cible comprend au moins cinq résidus cibles choisis parmi les résidus invariants ou les résidus covariants synthétiques létaux, et dans lequel ladite poche présente un volume entre 60 ^̇^ et 500 ^̇^. 7. Procédé selon l’une quelconque des revendications précédentes comprenant une évaluation de la qualité de l’emplacement spatial des résidus cibles, ladite évaluation étant caractérisée par le calcul de la proportion de paires de résidus situés à moins de 5 Angströms l’un de l’autre et/ou de la proportion de paires de résidus situés à moins de 10 Angströms l’un de l’autre. 8. Procédé selon l’une quelconque des revendications précédentes, comportant une étape de sélection (E0) de la séquence polypeptidique de référence de la protéine candidate, puis une étape de sélection des séquences polypeptidiques à tester présentant des longueurs identiques à la séquence de référence, et/ou possédant un nombre de mutations inférieur ou égal à trois écarts-types du nombre moyen de mutations par séquence, et/ou possédant un résidu invariant à son extrémité N ou C. 9. Procédé selon la revendication 8, comprenant une évaluation (E11’) de la qualité des séquences polypeptidiques sélectionnées, ladite évaluation comprenant le calcul d’au moins un score mesurant l’hétérogénéité de la longueur des séquences polypeptidiques sélectionnées et/ou le nombre de séquences polypeptidiques sélectionnées ayant un nombre aberrant d’acides aminés mal définis et/ou le nombre de séquences ayant un nombre aberrant de résidus manquants par rapport à la séquence polypeptidique de référence de la protéine candidate. 10. Procédé mis en œuvre par ordinateur de détermination d’au moins une région cible thérapeutique sur une protéine candidate d’un organisme pathogène cible, ledit procédé comprenant les étapes suivantes : a) Détermination (E3) des interactions chimiques avantageuses entre chaque résidu et/ou entre chaque couple de résidus au sein de la protéine candidate, à partir de la structure 2D et/ou 3D de la protéine candidate ; lesdites interactions chimiques avantageuses étant des liaisons hydrophobes et/ou des liaisons hydrogènes et/ou des ponts salins et/ou des liaisons à répulsions négatives et/ou répulsions positives ; et b) Sélection des résidus (E4) liés par lesdites interactions chimiques avantageuses, lesdits résidus étant à une distance d'au plus 10 Angströms, lesdits résidus formant une région cible thérapeutique.
EP23790046.9A 2022-09-20 2023-09-19 Procede bio-informatique de determination de regions cibles therapeutiques Pending EP4591308A1 (fr)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
FR2209473A FR3139935A1 (fr) 2022-09-20 2022-09-20 Procédé bio-informatique de détermination de régions cibles thérapeutiques
PCT/FR2023/051429 WO2024062188A1 (fr) 2022-09-20 2023-09-19 Procede bio-informatique de determination de regions cibles therapeutiques

Publications (1)

Publication Number Publication Date
EP4591308A1 true EP4591308A1 (fr) 2025-07-30

Family

ID=84887621

Family Applications (1)

Application Number Title Priority Date Filing Date
EP23790046.9A Pending EP4591308A1 (fr) 2022-09-20 2023-09-19 Procede bio-informatique de determination de regions cibles therapeutiques

Country Status (4)

Country Link
EP (1) EP4591308A1 (fr)
JP (1) JP2025536116A (fr)
FR (1) FR3139935A1 (fr)
WO (1) WO2024062188A1 (fr)

Also Published As

Publication number Publication date
FR3139935A1 (fr) 2024-03-22
JP2025536116A (ja) 2025-10-31
WO2024062188A1 (fr) 2024-03-28

Similar Documents

Publication Publication Date Title
Da et al. Structural protein–ligand interaction fingerprints (SPLIF) for structure-based virtual screening: method and benchmark study
Mongan et al. Generalized Born model with a simple, robust molecular volume correction
Verdonk et al. Virtual screening using protein− ligand docking: avoiding artificial enrichment
Nguyen et al. ATG4 family proteins drive phagophore growth independently of the LC3/GABARAP lipidation system
Sun et al. A proactive genotype-to-patient-phenotype map for cystathionine beta-synthase
McGaughey et al. Comparison of topological, shape, and docking methods in virtual screening
Bissantz et al. Protein-based virtual screening of chemical databases. 1. Evaluation of different docking/scoring combinations
Hannenhalli et al. Analysis and prediction of functional sub-types from protein sequence alignments
Lin et al. Short carboxylic acid–carboxylate hydrogen bonds can have fully localized protons
Çınaroğlu et al. Comparative assessment of seven docking programs on a nonredundant metalloprotein subset of the PDBbind refined
Greenidge et al. Improving docking results via reranking of ensembles of ligand poses in multiple X-ray protein conformations with MM-GBSA
Horvatovich et al. Quest for missing proteins: update 2015 on chromosome-centric human proteome project
Rosta et al. Artificial reaction coordinate “tunneling” in free‐energy calculations: The catalytic reaction of RNase H
Cascella et al. Evolutionarily conserved functional mechanics across pepsin-like and retroviral aspartic proteases
Rivas et al. Population genomics of parallel evolution in gene expression and gene sequence during ecological adaptation
Huang et al. Efficient estimation of binding free energies between peptides and an MHC class II molecule using coarse‐grained molecular dynamics simulations with a weighted histogram analysis method
Du et al. The effect of alignment uncertainty, substitution models and priors in building and dating the mammal tree of life
Jacobsen et al. Inhibition mechanism of antimalarial drugs targeting the cytochrome bc1 complex
Díez et al. Integration of proteomics and transcriptomics data sets for the analysis of a lymphoma B-cell line in the context of the chromosome-centric human proteome project
Rahimian et al. SARS2Mutant: SARS-CoV-2 amino-acid mutation atlas database
Schwans et al. Experimental and computational mutagenesis to investigate the positioning of a general base within an enzyme active site
Coimbra et al. Different Enzyme Conformations Induce Different Mechanistic Traits in HIV‐1 Protease
Akgüller et al. Network-Medicine-Guided Drug Repurposing for Alzheimer’s Disease: A Multi-Dimensional Systems Pharmacology Approach
Liebermann et al. From microstates to macrostates in the conformational dynamics of GroEL: a single-molecule Förster resonance energy transfer study
Gurumoorthy et al. Disordered domain shifts the conformational ensemble of the folded regulatory domain of the multidomain oncoprotein c-Src

Legal Events

Date Code Title Description
STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: UNKNOWN

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE INTERNATIONAL PUBLICATION HAS BEEN MADE

PUAI Public reference made under article 153(3) epc to a published international application that has entered the european phase

Free format text: ORIGINAL CODE: 0009012

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: REQUEST FOR EXAMINATION WAS MADE

17P Request for examination filed

Effective date: 20250410

AK Designated contracting states

Kind code of ref document: A1

Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC ME MK MT NL NO PL PT RO RS SE SI SK SM TR

DAV Request for validation of the european patent (deleted)
DAX Request for extension of the european patent (deleted)