EP2137658A2 - Verfahren für das erzeugen von peptidbibliotheken und deren verwendung - Google Patents

Verfahren für das erzeugen von peptidbibliotheken und deren verwendung

Info

Publication number
EP2137658A2
EP2137658A2 EP08716206A EP08716206A EP2137658A2 EP 2137658 A2 EP2137658 A2 EP 2137658A2 EP 08716206 A EP08716206 A EP 08716206A EP 08716206 A EP08716206 A EP 08716206A EP 2137658 A2 EP2137658 A2 EP 2137658A2
Authority
EP
European Patent Office
Prior art keywords
dimension
bioactive
peptide
percentage
polypeptide
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Withdrawn
Application number
EP08716206A
Other languages
English (en)
French (fr)
Inventor
Eva Jung
Manfred Hendlich
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Sanofi SA
Original Assignee
Sanofi Aventis France
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Sanofi Aventis France filed Critical Sanofi Aventis France
Publication of EP2137658A2 publication Critical patent/EP2137658A2/de
Withdrawn legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G16INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
    • G16BBIOINFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR GENETIC OR PROTEIN-RELATED DATA PROCESSING IN COMPUTATIONAL MOLECULAR BIOLOGY
    • G16B40/00ICT specially adapted for biostatistics; ICT specially adapted for bioinformatics-related machine learning or data mining, e.g. knowledge discovery or pattern finding
    • AHUMAN NECESSITIES
    • A61MEDICAL OR VETERINARY SCIENCE; HYGIENE
    • A61PSPECIFIC THERAPEUTIC ACTIVITY OF CHEMICAL COMPOUNDS OR MEDICINAL PREPARATIONS
    • A61P43/00Drugs for specific purposes, not provided for in groups A61P1/00-A61P41/00
    • GPHYSICS
    • G16INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
    • G16BBIOINFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR GENETIC OR PROTEIN-RELATED DATA PROCESSING IN COMPUTATIONAL MOLECULAR BIOLOGY
    • G16B35/00ICT specially adapted for in silico combinatorial libraries of nucleic acids, proteins or peptides
    • GPHYSICS
    • G16INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
    • G16BBIOINFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR GENETIC OR PROTEIN-RELATED DATA PROCESSING IN COMPUTATIONAL MOLECULAR BIOLOGY
    • G16B50/00ICT programming tools or database systems specially adapted for bioinformatics
    • GPHYSICS
    • G16INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
    • G16CCOMPUTATIONAL CHEMISTRY; CHEMOINFORMATICS; COMPUTATIONAL MATERIALS SCIENCE
    • G16C20/00Chemoinformatics, i.e. ICT specially adapted for the handling of physicochemical or structural data of chemical particles, elements, compounds or mixtures
    • G16C20/60In silico combinatorial chemistry
    • GPHYSICS
    • G16INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
    • G16BBIOINFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR GENETIC OR PROTEIN-RELATED DATA PROCESSING IN COMPUTATIONAL MOLECULAR BIOLOGY
    • G16B15/00ICT specially adapted for analysing two-dimensional [2D] or three-dimensional [3D] molecular structures, e.g. structural or functional relations or structure alignment

Definitions

  • the present invention relates to the field of computational biochemistry and computational design of bioactive peptides. It combines methods used in biological sequence analysis, bioinformatics database evaluation, information presentation and classification algorithms using supervised learning. In addition, it relates to the design of peptide libraries and the use of bioactive peptides for biomedical research.
  • a primary goal of drug discovery today is to identify biologically active molecules that have practical clinical benefits. Many, if not all, biologically active peptides (e.g., peptide hormones) have profound effects on both health and disease, either in growth-stimulating roles, growth-inhibiting roles, or in the regulation of critical metabolic pathways.
  • biologically active peptides e.g., peptide hormones
  • Peptide hormones are produced as precursors in different cell types and organs such as glands, neurons, intestine, brain, etc. Peptide hormones are initially synthesized as larger precursors or prohormones, or they may undergo a series of post-translational modifications during transport through the ER and Golgi stacks. They are processed and transported to their final destination to act as active substances (first messengers) to elicit a cell response by binding to a cell surface receptor. Peptide hormones are the major messengers in many physiological processes, including regulation of production, growth, water and salt metabolism, temperature control, cardiovascular, gastrointestinal and respiratory control, behavior, memory, and affective states.
  • Peptide hormones play a key role in physiological processes relevant to many areas of biomedical research such as diabetes (insulin), blood pressure regulation (angiotensin), anemia (erythropoietin- ⁇ r), multiple sclerosis (interferon-?), Obesity (leptin) and others .
  • novel bioactive peptides have the potential to be used as therapeutic polypeptides, drug intervention targets, ligands for discovering relevant targets (eg, GPCR dephosphaning), or biomarkers for disease monitoring.
  • Peptide libraries have been successfully used to identify bioactive peptides, including antimicrobial peptides, receptor agonists and antagonists, cell surface receptor ligands, protein kinase inhibitors and substrates, T cell epitopes, peptides that bind to MHC molecules, and peptide mimotopes of receptor binding sites.
  • Peptide libraries can be categorized according to their origin into gene- and synthetic-based libraries (Falciani et al., 2005).
  • gene-based libraries the combinatorial positions within polypeptides are introduced at the DNA level, which encodes the sequence of the target polypeptide to introduce diversity.
  • synthetic libraries reach their diversity at the level of chemical synthesis.
  • peptide libraries are scaffold-based or use a random combinatorial approach to generate different polypeptide primary structures.
  • the object of the present invention solves the problem of the prior art.
  • the present invention relates to a method of constructing novel bioactive ones
  • Support Vector Machines is used to bioactive peptides to identify. This method allows for the discovery of potentially bioactive peptide hormones in silicium by screening the human proteome, exploiting the conserved protein traits and short motifs present in peptide hormone precursors. While peptide hormones share these characteristics and are responsible for their maturation, surprisingly there is very little sequence similarity between peptide hormone precursors that would allow database search only at the protein sequence level (eg, BLAST, FASTA).
  • SVM Support Vector Machines
  • peptide hormone precursors eg, short protein sequence length of the precursor, signal peptide, disulfide bonds, amidation sites, sulfation sites, glycosylation sites
  • peptide hormone precursors eg, short protein sequence length of the precursor, signal peptide, disulfide bonds, amidation sites, sulfation sites, glycosylation sites
  • An object of the present invention is a method for identifying bioactive peptides using a binary support vector machine (SVM) based algorithm in a computer based system, wherein:
  • a-i generating vectors of 49 dimensions, each dimension resulting from the calculation of a molecular descriptor value for a set of labeled known bioactive and labeled known non-bioactive peptides, which labels indicate whether the peptide is bioactive or non-bioactive, respectively;
  • step ai) transferring the vector data generated in step ai) to the SVM-based algorithm, the algorithm calculating the optimal hyperplane separating the vectors corresponding to the bioactive peptides and the non-bioactive peptides, respectively;
  • protein sequences are provided from a publicly available human protein database; c) the secondary structure and cleavage sites within a protein sequence provided in step b) are predicted using computational techniques; a set of 7 molecular descriptors is calculated based on the prediction step, resulting in the generation of peptide fragments;
  • step e) the calculated values from step c) are converted to scaled values between 0 and 1, to generate the dimensions 1 to 7 of a 49-dimension vector for each peptide fragment, and the calculated values from step d) are converted to scaled values between 0 and 1 for generating dimensions 8 to 49 of the vector for each peptide fragment;
  • step f) the vectors generated in step e) are presented to the trained SVM algorithm of step a) for measuring the distance of each vector to the hyperplane computed in step a 2 );
  • step f classifying each peptide fragment as bioactive peptide or non-bioactive peptide according to the distance measured in step f).
  • dimensions 1 through 7 generated in step e) are the following: Dimension 1: N-terminus ProP value; Dimension 2: N-terminus Hmcut value; Dimension 3: N-terminus fragment; Dimension 4: C-terminal ProP value; Dimension 5: C-terminus hmcut value; Dimension 6: C-terminal Hamid value; Dimension 7: C-terminus fragment; and dimensions 8 to 49 generated in step e) are the following: Dimension 8: percentage of acidic amino acids (E, N, Q) per polypeptide; Dimension 9: percentage of positively charged amino acids (R, H) per polypeptide; Dimension 10: percentage of aromatic amino acids (F, Y, W) per polypeptide; Dimension 11: percentage of aliphatic amino acids (G, V, A, I) per polypeptide; Dimension 12: percentage of proline per polypeptide; Dimension 13: Percentage of reactive amino acids (S, T) per polypeptide; Dimension 14: percentage of alanine per polypeptide; Dimension 15: percentage of cysteine per polypeptide; Dimension 16
  • the protein sequences of step b) are only naturally occurring protein sequences found in the human secretome.
  • bioactive peptides are bioactive peptide hormones derived from precursor hormones.
  • Another object of the present invention relates to a bioactive peptide selected from the human secretome by use of the method of the present invention.
  • the bioactive peptide is a bioactive peptide hormone.
  • the bioactive peptide hormone is derived from a precursor protein.
  • the bioactive peptide has a sequence selected from the group consisting of the amino acid sequences of SEQ. ID. NO.
  • the invention further relates to a peptide library comprising bioactive peptides identified by the method of the present invention.
  • the peptide library comprises bioactive peptides which comprise a sequence selected from the group consisting of the amino acid sequences of SEQ. ID. NO. 1 to 185.
  • the peptide library comprises bioactive peptide hormones.
  • the peptide library comprises bioactive peptide hormones derived from precursor proteins.
  • a further subject matter of the present invention relates to a computational device configured to identify bioactive peptides by using a method based on a binary support vector machine (SVM), wherein:
  • step ai) transferring the vector data generated in step ai) to the SVM-based algorithm, the algorithm calculating the optimal hyperplane separating the vectors corresponding to the bioactive peptides and the non-bioactive peptides, respectively;
  • step b) the secondary structure and cleavage sites within a protein sequence provided in step b) are predicted using computational techniques; a set of 7 molecular descriptors is calculated based on the prediction step, resulting in the generation of peptide fragments;
  • step c) a set of 42 molecular descriptors corresponding to the physico-chemical properties of the peptide fragments generated in step c) is calculated;
  • step e) the calculated values from step c) are converted to scaled values between 0 and 1, to generate the dimensions 1 to 7 of a 49-dimension vector for each peptide fragment, and the calculated values from step d) are converted to scaled values between 0 and 1 for generating dimensions 8 to 49 of the vector for each peptide fragment;
  • step f) the vectors generated in step e) are presented to the trained SVM algorithm of step a) for measuring the distance of each vector to the hyperplane computed in step a 2 );
  • step f classifying each peptide fragment as bioactive peptide or non-bioactive peptide according to the distance measured in step f).
  • the invention further relates to the use of the method of the present invention for identifying therapeutic polypeptides, targets for drug intervention, ligands for discovering relevant targets or biomarkers for monitoring diseases.
  • the invention further relates to the use of the peptide library of the present invention in a screening approach for studying intracellular signaling pathways, generating reagents to aid in understanding a pathway, generating novel forms of therapy and identifying pharmaceutically active compounds, targets for drug intervention, ligands to discover relevant targets or biomarkers for disease monitoring.
  • the invention also relates to a pharmaceutical composition
  • a pharmaceutical composition comprising a bioactive peptide having a sequence selected from the group consisting of the amino acid sequences of SEQ. ID. NO. 1 to 185 as a bioactive agent.
  • the present invention relates to novel bioactive polypeptides and to a silicio method for identifying such bioactive polypeptides.
  • a polypeptide is considered to be bioactive if it interacts with or has an effect on a cell tissue in the human body.
  • Bioactive peptides have the potential to be used as therapeutic polypeptides, drug intervention targets, ligands for discovering relevant targets (e.g., GPCR dephosphaning), or biomarkers for disease monitoring.
  • Bioactive peptides include, among others, bioactive peptide hormones.
  • Peptide hormones are characterized by their high specificity and their efficacy in very low concentrations. Peptide hormones are initially synthesized as larger precursors or prohormones.
  • a precursor is a substance from which another, usually more active or mature, substance is formed.
  • a protein precursor is an inactive protein (or peptide) that can be converted to an active form by post-translational modification. Multiple cleavage sites are involved in the modification of the precursor to produce the mature protein: signal sequence cleavage sites, protease cleavage sites, amidation sites, etc.
  • progenitor for a protein often has the prefix pro or pre-.
  • Precursors are often used by an organism when the subsequent protein is potentially harmful but must be available at short notice and / or in large quantities.
  • polypeptide refers to a polymer consisting of amino acid residues linked by covalent bonds
  • proteins include portions or fragments of full length proteins, such as peptides , Oligopeptide and shorter peptide sequences, which consist of at least 2 amino acids, in particular peptide sequences consisting of 4 to 45 amino acids.
  • polypeptides include polymers of modified amino acids, including amino acids that have been post-translationally modified, for example, by chemical modification, including, but not limited to, amidation, glycosylation, phosphorylation, acetylation, and / or sulfation reactions that act on the parent peptide backbone change.
  • a polypeptide may be derived from a naturally occurring protein and, in particular, may be derived by chemical or enzymatic cleavage from a full-length protein using reagents such as CNBr or proteases such as trypsin or chymtrypsin, among others.
  • such polypeptides may be derived by chemical synthesis using well-known peptide synthesis methods.
  • amino acid is a molecule that contains both amine and carboxylic acid functional groups.
  • An amino acid residue is what remains of an amino acid after a water molecule has been released (a H + from the nitrogen side and an OH from the carboxyl side) in the formation of a peptide bond, the chemical bond linking the amino acid monomers in a protein chain.
  • Each protein has its own unique amino acid sequence, which is known as its primary structure.
  • the primary structure is pretty simple and concerns the number and
  • Peptide binding is the only type of binding involved at this level of protein structure.
  • the sequence of amino acids in a protein is determined by the genetic
  • the next level of protein structure generally relates to the amount of structural regularity or the form that the polypeptide chain adopts.
  • a natural polypeptide chain spontaneously folds into a regular and defined form.
  • Two major types of secondary structure have been found in proteins, namely a-helix and b-sheet.
  • the tertiary structure of a polypeptide chain is the next level of conformation or shape adopted by the alpha helixes or beta sheets of the chain.
  • Most proteins tend to fold into shapes that are widely classified as a spherical annotation, and some, particularly
  • Structural proteins form long fibers. These are the main forms of gross
  • domain refers to a compact unit of the spherical structure in a polypeptide chain.
  • each protein determines its function in the body.
  • polypeptide amino acid sequence variants, which may contain one or more, preferably conservative, amino acid substitutions, deletions or inserts in a naturally occurring amino acid sequence that does not alter at least one essential property of the polypeptide, such as its biological Activity
  • polypeptides may be synthesized by chemical polypeptide synthesis
  • Conservative amino acid substitutions are well known in the art For example, one or more amino acid residues of a native protein may be conservatively substituted with an amino acid residue of similar charge, size or polarity, the resulting polypeptide having the functional ability
  • the rules for the performance of such substitutions are well known More specifically, conservative amino acid substitutions are those generally used internally lb a family of amino acids, which are related in their side chains take place.
  • substitutions within a particular group such as the substitution of leucine for isoleucine or valine, are alternative, the substitution of aspartate for glutamate or threonine for serine or of another amino acid residue with a structurally related amino acid residue generally have a minor effect on function of the resulting polypeptide.
  • polypeptide is a peptide whose biological activity is predictable as a result of its amino acid sequence corresponding to a functional domain, and also encompassed by the term “polypeptide” is a peptide whose biological activity is analyzed its amino acid sequence could not be predicted.
  • a Support Vector Machine (SVM) algorithm is used to distinguish between polypeptides that have activity in vivo and polypeptides that do not have activity in vivo.
  • SVM Support Vector Machine
  • SVM Support Vector Machine
  • a support vector machine is a universal learning machine that establishes a decision surface or "hyperplane" during a training phase
  • the decision level is determined by a set of support vectors selected from a training population of vectors and a set of corresponding multipliers is also characterized by a kernel function.
  • an SVM operates in a test phase during which it is used to classify test vectors based on the decision hyperplane previously determined during the training phase (Noble, 2006).
  • Support vector machines are used in many and varied fields. For example, in an article by H. Kim and H. Park entitled “Prediction of protein relative solvent accessibility with support vector machines and long-range interaction 3d local descriptor”, SVM is applied to the problem of predicting a high-resolution 3D structure to the docking of macromolecules too to study.
  • SVM Support Vector Machine
  • an SVM is implemented by means of a computational device such as a personal computer.
  • the computational device includes one or more processors executing a sequence of different software as described in example section (1.1.), which includes instructions for implementing a method according to the present invention.
  • bioactive peptides For the SVM training set, information on known bioactive peptides can be extracted from a publicly available human protein database such as Swissprot. Preferably, bioactive peptides with a length between 4 and 55 amino acids were extracted from their precursor according to their annotation in Swissprot and marked as positive examples used for training the SVM algorithm. All other generated fragments between 4 and 55 amino acids in length from the same known peptide hormone precursors that do not have an assigned function were used as negative training sets for SVM training. Since the SVM is a binary system, bioactive peptides were labeled as +1 and non-bioactive peptides as -1.
  • bioactive and non-bioactive peptides between 56 and 300 amino acids in length were used to train a second model for predicting longer peptides.
  • the final SVM training sets for short (4 to 55 amino acids) and long (56 to 300 amino acids) peptides, respectively were adjusted for an equal number of positive and negative training data by random selection of the same number of negative examples all negative peptides.
  • a set of 49 descriptors was defined and used for training an SVM. The performance of an SVM model is highly dependent on the quality of the selected descriptors used to describe the peptides.
  • the first 7 descriptors reflect the likelihood that a polypeptide will be produced by a human body. These 7 dimensions were calculated by applying a set of protease cleavage site prediction tools to the peptide hormone precursor sequence ( Figure 1). The resulting values of each program output were used directly as descriptors. The remaining 42 dimensions reflect important physicochemical properties of each fragment produced (ie, a bioactive or a non-bioactive peptide). The 49 dimensions used in the present invention are listed under point 3 of the example section.
  • Each peptide corresponds to a unique combination of 49 descriptors.
  • the different peptides can be represented as points in a multidimensional space, each dimension corresponding to one of the descriptors.
  • the SVM attempts to find a boundary that best separates the two sets of points that correspond to the bioactive and non-bioactive peptides. This limit is called the optimal hyperplane, which best separates the two classes of objects in an n-dimensional space, viz., The vectors corresponding to the bioactive peptides or non-bioactive peptides, respectively.
  • the emerging SVM models learn to distinguish between bioactive and non-bioactive peptides.
  • the best model is selected, which has the highest performance based on the ranking of an independent set of bioactive and non-bioactive peptides.
  • the performance of all generated models was tested, and the two best models for short peptides (4 to 55 amino acids) and longer peptides (56 to 300 amino acids) were selected.
  • the resulting trained SVM model is able to identify bioactive peptides for which no bioactivity has been characterized.
  • FIG. 1 A schematic overview of the method disclosed in the invention is given in Figure 1 to illustrate the steps involved in peptide library generation are.
  • the input value used is a protein sequence provided by a publicly available human protein database such as Swissprot.
  • step 1 all potential protease cleavage sites are predicted using a set of tools to predict these events.
  • the corresponding cleavage site positions are stored for each precursor sequence.
  • the secondary structure for the entire protein precursor sequence is derived.
  • step 2 Based on the predicted cleavage sites within the precursor sequence, all potential fragments are generated (step 2) and used as input to step 3.
  • Step 3 involves the calculation of physico-chemical properties for each peptide fragment (list under point 3 of the example section).
  • human secretome is all the information encoded in the DNA that corresponds to all the human proteins secreted by the cells. Potentially secreted human proteins used as precursor sequences to find novel bioactive peptides were listed from the publicly available sequence databases under item 1.1. of the example section extracted.
  • Protein precursors have been used as templates to derive novel bioactive peptides.
  • the peptide length was limited to 4 to 45 amino acids to produce peptides suitable for chemical synthesis.
  • antimicrobial assays were performed to test the bioactivity of the latter peptides. These assays are detailed in point 6 of the example section.
  • the present invention further relates to a peptide library comprising bioactive peptides identified by the previously described SVM model method.
  • the amino acid sequences of the 185 bioactive peptides identified by the method of the present invention and contained in the peptide library of the present invention are listed in FIG.
  • a peptide library is a newly developed technique for protein-related studies.
  • a peptide library contains a large number of peptides that have a systematic combination of amino acids.
  • peptide libraries are synthesized on a solid phase, mostly on resin, which may be made as a flat surface or beads.
  • a peptide library provides a powerful tool for drug design, protein-protein interactions, and other biochemical and pharmaceutical applications.
  • the peptide library of the present invention may be used in a screening approach to study intracellular signaling pathways, generate reagents to aid in understanding a pathway, generate novel therapies, and identify pharmaceutically active compounds, targets for drug intervention, ligands to discover relevant targets, or Biomarkers are used to monitor diseases.
  • polypeptides of the present invention have hormonal activity.
  • the polypeptides of the invention are useful as drugs, for example therapeutic polypeptides, ligands for discovering relevant targets (eg GPCRs), targets for drug intervention (eg targets for monoclonal antibodies, receptor fragments), biomarkers for disease monitoring (in combination with tool antibodies to Detection of peptide fragments in body fluids), Protein kinase inhibitors and substrates, T-cell epitopes, peptide mimotopes of receptor binding sites, etc.
  • DNAs encoding the peptide or precursor of the invention are useful, for example, as agents for gene therapy, treatment or
  • DNAs of the invention are useful as agents for the genetic diagnosis of diseases such as cardiovascular disease, hormone-producing tumors, diabetes, gastric ulcers, and the like.
  • Signal P Version 2.0 (Nielsen et al., 1997) Task: This program was used to detect potential signal sequences and to determine the potential human secretome. It was used with a limit of 0.98.
  • Signal P, version 2.0 predicts the presence and location of signal peptide cleavage sites in amino acid sequences for different organisms. The method involves prediction of cleavage sites and signal peptide / non-signal peptide prediction based on a combination of multiple artificial neural networks and hidden Markov models.
  • the Hamid program predicts amidation sites in protein sequences.
  • the program Hmcut predicts protease cleavage sites in protein sequences that take place before a basic amino acid residue (Lys, Arg). Both programs are based on hidden Markov models and use the software version Hmmer 2.3.2 (Durbin et al., 1998).
  • LIBVSM is an integrated software for the support vector classification, (C-SVC, nu-SVC), regression (Epsilon-SVR, nu-SVR) and distribution estimation (single-class
  • SVM type nu SVC
  • Kernel type radius base function
  • Perl is a dynamic programming language developed by Larry Wall and first published in 1987.
  • This query yields a set of known peptide hormone precursors in which their bioactive peptides are readily available by annotating the Swissprot database. Therefore, these sequences can be used to derive a set of bioactive and non-bioactive peptides for training an SVM-based model.
  • the performance of an SVM model is highly dependent on the quality of the selected descriptors used to describe the peptides.
  • Dimensions 1-7 represent the likelihood of a polypeptide being produced in the human body and they were calculated by a combination of different protease cleavage site prediction tools. The results of these tools represent the first 7 dimensions of the vector.
  • Dimension 1 N-terminus ProP value
  • Dimension 2 N-terminus Hmcut value
  • Dimension 3 N-terminus fragment (fixed value of 0.2);
  • Dimension 4 C-terminal ProP value;
  • Dimension 5 C-terminus hmcut value;
  • Dimension 6 C-terminal Hamid value;
  • Dimension 7 C-terminus fragment (fixed value of 0.2);
  • the physicochemical properties of the polypeptides were calculated and represent the following 42 dimensions of the vector.
  • Dimension 34 Value for the structure around the N-terminus cleavage site
  • Dimension 35 value for the structure around the C-terminus cleavage site
  • Dimension 41-48 Mean values calculated based on the fundamental component value vectors of hydrophobic, steric and electronic
  • the input vectors for training and prediction contain 49 dimensions, but only 48 are used in the current format because dimension 26 (percentage of noncancanic amino acids per fragment) for all fragments is set to NuH.
  • Polypeptides (56 to 300 amino acids) were selected. This became one
  • step 6 Figure 1 the most significant peptides are selected per precursor, which are shorter than 46 amino acids in length exhibit.
  • the microdilution test represents a homogeneous method of determining the number of viable bacterial or yeast cells in culture. It is based on the facts that living bacteria or yeast are cloudy in culture. Turbidity can be measured as light absorbance with a photometer and is correlated with the number of cells in the sample.
  • the strains used in the course of the experiments are Escherichia coli (E. coli ATCC 25922), Staphylococcus aureus (S.aureus ATCC 29213) and Candida albicans (C. albicans FH 2173).
  • Cultivation of the strain begins with the application of a cryostock solution, which can be used for several inoculations of precultures.
  • MH MH agar plate using an inoculation loop and incubate the agar plate for 3 days at 37 ° C.
  • yeast use the same procedure but with Sabouraud Dextrose (SD) agar.
  • a bead is used for inoculating a preculture (30 ml MH / SD broth in a 100 ml shake flask).
  • test stock vial is removed from the Cryobank.
  • a bead is removed with a sterile pipette and inoculated in a 100 ml Erlenmeyer flask with 30 ml of MH or SD nutrient broth for bacteria and yeast. Grow the culture for 18 hours at 37 ° C. and 180 rpm.
  • the optical density is adjusted with MH broth to a cell density corresponding to 10 8 cells / ml for all test strains.
  • the standard inoculum culture for the assay is diluted 1: 100 to the final concentration of 10 6 CFU / ml (colony forming units / ml).
  • Peptidver Plantnunqen The compounds are serially diluted (10 dilution steps) from the standard initial concentration of 125 ⁇ M to a final concentration of 0.24 ⁇ M.
  • the initial DMSO concentration is 1.4% in all samples and controls.
  • FIG. 1 is a diagrammatic representation of FIG. 1:
  • FIG. 1 A schematic overview of the method disclosed in the invention is shown in Figure 1 to explain the steps involved in the generation of the peptide library.
  • FIG. 2 is a diagrammatic representation of FIG. 1
  • Figure 2 shows the amino acid sequences of the 185 bioactive peptides selected based on common physicochemical properties.
  • FIG. 3 is a diagrammatic representation of FIG. 3
  • FIG. 3 shows the input vectors of the 185 peptides generated by the trained SVM
  • FIG. 4 shows the calculated IC 50 values for antibiotics in ⁇ g / ml.

Landscapes

  • Health & Medical Sciences (AREA)
  • Life Sciences & Earth Sciences (AREA)
  • Engineering & Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • Bioinformatics & Cheminformatics (AREA)
  • General Health & Medical Sciences (AREA)
  • Medical Informatics (AREA)
  • Chemical & Material Sciences (AREA)
  • Theoretical Computer Science (AREA)
  • Bioinformatics & Computational Biology (AREA)
  • Spectroscopy & Molecular Physics (AREA)
  • Biophysics (AREA)
  • Biotechnology (AREA)
  • Evolutionary Biology (AREA)
  • Crystallography & Structural Chemistry (AREA)
  • Databases & Information Systems (AREA)
  • Bioethics (AREA)
  • Public Health (AREA)
  • Medicinal Chemistry (AREA)
  • Epidemiology (AREA)
  • Software Systems (AREA)
  • Evolutionary Computation (AREA)
  • Data Mining & Analysis (AREA)
  • Biochemistry (AREA)
  • Library & Information Science (AREA)
  • Molecular Biology (AREA)
  • Computer Vision & Pattern Recognition (AREA)
  • Artificial Intelligence (AREA)
  • Computing Systems (AREA)
  • General Chemical & Material Sciences (AREA)
  • Nuclear Medicine, Radiotherapy & Molecular Imaging (AREA)
  • Organic Chemistry (AREA)
  • Pharmacology & Pharmacy (AREA)
  • Animal Behavior & Ethology (AREA)
  • Veterinary Medicine (AREA)
  • Chemical Kinetics & Catalysis (AREA)
  • Peptides Or Proteins (AREA)
  • Investigating Or Analysing Biological Materials (AREA)
  • Medicines That Contain Protein Lipid Enzymes And Other Medicines (AREA)
  • Measuring Or Testing Involving Enzymes Or Micro-Organisms (AREA)

Abstract

Das Screening von Peptidbibliotheken bei unterschiedlichen Assays bietet eine Möglichkeit zum gleichzeitigen Untersuchen intrazellulärer Signalgebungswege, Erzeugen von Reagenzien zum Unterstützen des Verständnisses des Weges und zum Erzeugen neuartiger Therapieformen. Viele, wenn nicht alle, biologisch aktiven Peptide (z.B. Peptidhormone) haben tiefgreifende Auswirkungen sowohl auf Gesundheit als auch Krankheit, entweder in wachstumsstimulierenden Rollen, wachstumshemmenden Rollen oder durch die Regulierung kritischer Stoffwechselwege. Die vorliegende Erfindung betrifft neuartige bioaktive Peptide, ein in silicio Verfahren zum Identifizieren dieser Peptide und eine Peptidbibliothek, welche diese Peptide enthält.

Description

Verfahren für das Erzeugen von Peptidbibliotheken und deren Verwendung
GEBIET DER ERFINDUNG
Die vorliegende Erfindung betrifft das Gebiet der rechentechnischen Biochemie und des computergestützten Designs bioaktiver Peptide. Sie kombiniert Verfahren verwendet bei der biologischen Sequenzanalyse, Bioinformatik-Datenbankauswertung, Informationsdarstellung und Klassifizierungsalgorithmen unter Verwendung von überwachtem Lernen. Außerdem betrifft sie das Design von Peptidbibliotheken und die Verwendung bioaktiver Peptide für die biomedizinische Forschung.
STAND DER TECHNIK
Ein primäres Ziel der Arzneimittelentdeckung heute ist das Identifizieren biologisch aktiver Moleküle, die praktischen klinischen Nutzen aufweisen. Viele, wenn nicht alle, biologisch aktiven Peptide (z.B. Peptidhormone) weisen tiefgreifende Wirkungen sowohl bei Gesundheit als auch Krankheit auf, entweder in wachstumsstimulierenden Rollen, wachstumshemmenden Rollen oder durch die Regulierung kritischer Stoffwechselwege.
Peptidhormone werden als Vorläufer in unterschiedlichen Zelltypen und Organen wie Drüsen, Neuronen, Darm, Gehirn usw. erzeugt. Peptidhormone werden anfänglich als größere Vorläufer oder Prohormone synthetisiert, oder sie können während des Transportes durch das ER und die Golgi-Stapel eine Reihe posttranslationaler Modifikationen annehmen. Sie werden verarbeitet und zu ihrem Endziel transportiert, um als aktive Substanzen (erste Boten) zum Auslösen einer Zellreaktion durch die Bindung an einen Zelloberflächenrezeptor zu agieren. Peptidhormone sind die Hauptboten bei vielen physiologischen Prozessen, einschließlich der Regulierung der Produktion, Wachstum, Wasser- und Salzstoffwechsel, Temperatursteuerung, der kardiovaskulären, gastrointestinalen und respiratorischen Steuerung, Verhalten, Gedächtnis und affektiver Zustände. Peptidhormone spielen eine Schlüsselrolle bei physiologischen Prozessen, welche relevant sind für viele Bereiche der biomedizinischen Forschung wie Diabetes (Insulin), Blutdruckregulierung (Angiotensin), Anämie (Erythropoietin-αr), Multiple Sklerose (Interferon-/?), Obesität (Leptin) und andere. Daher besitzen neuartige bioaktive Peptide das Potential, als therapeutische Polypeptide, Ziele für die Arzneimittelintervention, Liganden zum Entdecken relevanter Ziele (z.B. GPCR-Deorphaning) oder Biomarker zum Überwachen von Krankheiten verwendet zu werden.
Peptidbibliotheken wurden erfolgreich verwendet, um bioaktive Peptide zu identifizieren, einschließlich antimikrobieller Peptide, Rezeptoragonisten und - antagonisten, Liganden für Zelloberflächenrezeptoren, Proteinkinasehemmer und - Substrate, T-Zell-Epitope, Peptide, welche an MHC-Moleküle binden, und Peptidmimotope von Rezeptorbindungsstellen. Peptidbibliotheken können gemäß ihres Ursprungs in gen- und synthetikbasierte Bibliotheken kategorisiert werden (Falciani et al., 2005).
Bei genbasierten Bibliotheken werden die kombinatorischen Positionen innerhalb der Polypeptide auf dem DNA-Level eingeführt, welches die Sequenz des Zielpolypeptids codiert, um Diversität einzuführen. Im Gegensatz zu genbasierten Bibliotheken erreichen synthetische Bibliotheken ihre Diversität auf dem Level chemischer Synthese.
Viele Peptidbibliotheken basieren auf einem Gerüst oder verwenden einen zufälligen kombinatorischen Ansatz zum Erzeugen unterschiedlicher Polypeptidprimärstrukturen.
Der Nachteil beider Ansätze ist, dass die Kombination der 20 natürlich vorkommenden Aminosäuren die Konstruktion von Polypeptiden zulässt, welche extrem variabel sind und eine sehr große Zahl unterschiedlicher Strukturen ausmachen. Um ein Beispiel zu geben, wie viele unterschiedliche Strukturen erhalten werden können, sei auf die 160.000 unterschiedlichen Primärstrukturmöglichkeiten für ein Peptid, welches nur 4 Aminosäuren enthält, verwiesen.
Es bestand Bedarf an der Bereitstellung eines genauen Verfahrens mit hohem Durchsatz zum signifikanten Reduzieren der potentiellen Zahl von Strukturen in einer Peptidbibliothek, um das Verarbeiten großer Mengen von Daten zu ermöglichen und zwischen Peptiden, die eine Aktivität in vivo aufweisen, und Peptiden, die keine Aktivität in vivo aufweisen zu unterscheiden.
Die Aufgabe der vorliegenden Erfindung löst das Problem des Standes der Technik. Die vorliegende Erfindung betrifft ein Verfahren zum Konstruieren neuartiger bioaktiver
Peptidhormonbibliotheken unter Verwendung einer Bioinformatikstrategie. Ein
Support-Vektor-Maschinen (SVM) -Algorithmus wird verwendet, um bioaktive Peptide zu identifizieren. Dieses Verfahren ermöglicht das Entdecken potentiell bioaktiver Peptidhormone in silicio beim Durchsuchen des humanen Proteoms, indem die konservierten Proteinmerkmale und kurzen Motive ausgenutzt wurden, die in Peptidhormonvorläufem vorliegen. Während Peptidhormone diese Merkmale gemeinsam haben und diese für deren Reifung verantwortlich sind, gibt es überraschenderweise sehr wenig Sequenzähnlichkeit zwischen Peptidhormonvorläufem, welche eine Datenbanksuche nur auf dem Proteinsequenzlevel (z.B. BLAST, FASTA) zulassen würde. Jedoch können Kombinationen von gleichzeitig vorkommenden Proteinmerkmalen und Motiven für posttranslationale Modifikationen bei Peptidhormonvorläufem (z.B. kurze Proteinsequenzlänge des Vorläufers, Signalpeptid, Disulfidbindungen, Amidierungsstellen, Sulfatierungsstellen, Glycosylierungsstellen) verwendet werden, um neuartige Peptidhormone mit einer hohen Spezifität zu entdecken.
KURZDARSTELLUNG DER ERFINDUNG
Ein Gegenstand der vorliegenden Erfindung betrifft ein Verfahren zum Identifizieren bioaktiver Peptide unter Verwendung eines Algorithmus basierend auf einer binären Support-Vektor-Maschine (SVM) in einem computerbasierten System, wobei:
a) ein SVM-Algorithmus trainiert wird zu lernen, zwischen bioaktiven und nichtbioaktiven Peptiden zu unterscheiden, wobei das Trainieren folgende Schritte umfasst:
a-i) das Erzeugen von Vektoren mit 49 Dimensionen, wobei jede Dimension aus der Berechnung eines Molekulardeskriptorwertes für einen Satz markierter bekannter bioaktiver und markierter bekannter nicht-bioaktiver Peptide resultiert, wobei die Markierungen anzeigen, ob das Peptid bioaktiv bzw. nichtbioaktiv ist;
a2) das Übertragen der Vektordaten erzeugt in Schritt ai) an den SVM-basierten Algorithmus, wobei der Algorithmus die optimale Hyperebene berechnet, welche die Vektoren trennt, die den bioaktiven Peptiden bzw. den nichtbioaktiven Peptiden entsprechen;
b) Proteinsequenzen aus einer öffentlich erhältlichen humanen Proteindatenbank bereitgestellt werden; c) die sekundäre Struktur und Spaltstellen innerhalb einer Proteinsequenz bereitgestellt in Schritt b) unter Verwendung rechentechnischer Verfahren vorhergesagt werden; ein Satz von 7 Molekulardeskriptoren wird basierend auf dem Vorhersageschritt berechnet, was in der Erzeugung von Peptidfragmenten resultiert;
d) ein Satz von 42 Molekulardeskriptoren, welche den physikalisch-chemischen Eigenschaften der Peptidfragmente hergestellt in Schritt c) entsprechen, berechnet wird;
e) die berechneten Werte aus Schritt c) in skalierte Werte zwischen 0 und 1 umgewandelt werden, zum Erzeugen der Dimensionen 1 bis 7 eines 49- Dimensionen-Vektors für jedes Peptidfragment, und die berechneten Werte aus Schritt d) werden umgewandelt in skalierte Werte zwischen 0 und 1 zum Erzeugen der Dimensionen 8 bis 49 des Vektors für jedes Peptidfragment;
f) die in Schritt e) erzeugten Vektoren an den trainierten SVM-Algorithmus aus Schritt a) präsentiert werden, zum Messen der Distanz jeden Vektors zu der Hyperebene berechnet in Schritt a2); und
g) jedes Peptidfragment gemäß der in Schritt f) gemessenen Distanz als bioaktives Peptid oder nicht-bioaktives Peptid klassifiziert wird.
Im Allgemeinen sind die Dimensionen 1 bis 7 erzeugt in Schritt e) Folgende: Dimension 1 : N-Terminus-ProP-Wert; Dimension 2: N-Terminus-Hmcut-Wert; Dimension 3: N-Terminus-Fragment; Dimension 4: C-Terminus-ProP-Wert; Dimension 5: C-Terminus-Hmcut-Wert; Dimension 6: C-Terminus-Hamid-Wert; Dimension 7: C- Terminus-Fragment; und die Dimensionen 8 bis 49 erzeugt in Schritt e) sind Folgende: Dimension 8: Prozentsatz der sauren Aminosäuren (E, N, Q) pro Polypeptid; Dimension 9: Prozentsatz der positiv geladenen Aminosäuren (R, H) pro Polypeptid; Dimension 10: Prozentsatz der aromatischen Aminosäuren (F, Y, W) pro Polypeptid; Dimension 11 : Prozentsatz der aliphatischen Aminosäuren (G, V, A, I) pro Polypeptid; Dimension 12: Prozentsatz von Prolin pro Polypeptid; Dimension 13: Prozentsatz der reaktiven Aminosäuren (S, T) pro Polypeptid; Dimension 14: Prozentsatz von Alanin pro Polypeptid; Dimension 15: Prozentsatz von Cystein pro Polypeptid; Dimension 16: Prozentsatz von Glutaminsäure pro Polypeptid; Dimension 17: Prozentsatz von Phenylalanin pro Polypeptid; Dimension 18: Prozentsatz von Glycin pro Polypeptid; Dimension 19: Prozentsatz von Histidin pro Polypeptid; Dimension 20: Prozentsatz von Isoleucin pro Polypeptid; Dimension 21 : Prozentsatz von Asparagin pro Polypeptid; Dimension 22: Prozentsatz von Glutamin pro Polypeptid; Dimension 23: Prozentsatz von Arginin pro Polypeptid; Dimension 24: Prozentsatz von Serin pro Polypeptid; Dimension 25: Prozentsatz von Threonin pro Polypeptid; Dimension 26: Prozentsatz von nichtkanonischer Aminosäure pro Polypeptid; Dimension 27: Prozentsatz von Valin pro Polypeptid; Dimension 28: Prozentsatz von Tryptophan pro Polypeptid; Dimension 29: Prozentsatz von Tyrosin pro Polypeptid; Dimension 30: Cysteingehalt; Dimension 31 : Prozentsatz geknäuelter Sekundärstruktur pro Polypeptid; Dimension 32: Prozentsatz helikaler Sekundärstruktur pro Polypeptid; Dimension 33: Prozentsatz zufälliger Sekundärstruktur pro Polypeptid; Dimension 34: Wert für die Struktur um die N-Terminus-Spaltstelle; Dimension 35: Wert für die Struktur um die C-Terminus- Spaltstelle; Dimension 36: Anzahl der helikalen Blöcke pro Polypeptid; Dimension 37: Isoelektrischer Punkt des Polypeptids; Dimension 38: Durchschnittliche Molekülmasse des Polypeptids; Dimension 39: Summe der Van-der-Waals-Kräfte jeder Aminosäure innerhalb des Polypeptids; Dimension 40: Summe der Hydrophobiewerte jeder Aminosäure innerhalb des Polypeptids; Dimension 41-48: Mittlere Werte berechnet basierend auf den grundlegenden Komponentenwertvektoren der hydrophoben, sterischen und elektronischen Eigenschaften pro Polypeptid; Dimension 49: Länge des Polypeptids.
Bei einer bevorzugten Ausführungsform des Verfahrens der vorliegenden Erfindung sind die Proteinsequenzen aus Schritt b) nur natürlich vorkommende Proteinsequenzen, die sich im humanen Sekretom finden.
Bei einer weiteren bevorzugten Ausführungsform sind bioaktive Peptide bioaktive Peptidhormone abgeleitet aus Vorläuferhormonen.
Ein weiterer Gegenstand der vorliegenden Erfindung betrifft ein bioaktives Peptid ausgewählt aus dem humanen Sekretom durch Verwendung des Verfahrens der vorliegenden Erfindung.
Bei einer bevorzugten Ausführungsform ist das bioaktive Peptid ein bioaktives Peptidhormon. Bei einer bevorzugteren Ausführungsform ist das bioaktive Peptidhormon abgeleitet von einem Vorläuferprotein. Bei einer weiteren bevorzugten Ausführungsform weist das bioaktive Peptid eine Sequenz ausgewählt aus der Gruppe bestehend aus den Aminosäuresequenzen der SEQ. ID. NR. 1 , 2, 3, 4, 5, 6, 7, 8, 9, 10, 11 , 12, 13, 14, 15, 16, 17, 18, 19, 20, 21 , 22, 23, 24, 25, 26, 27, 28, 29, 30, 31 , 32, 33, 34, 35, 36, 37, 38, 39, 40, 41 , 42, 43, 44, 45, 46, 47, 48, 49, 50, 51 , 52, 53, 54, 55, 56, 57, 58, 59, 60, 61 , 62, 63, 64, 65, 66, 67, 68, 69, 70, 71 , 72, 73, 74, 75, 76, 77, 78, 79, 80, 81 , 82, 83, 84, 85, 86, 87, 88, 89, 90, 91 , 92, 93, 94, 95, 96, 97, 98, 99, 100, 101 , 102, 103, 104, 105, 106, 107, 108, 109, 110, 111 , 112, 113, 114, 115, 116, 117, 118, 119, 120, 121 , 122, 123, 124, 125, 126, 127, 128, 129, 130, 131 , 132, 133, 134, 135, 136, 137, 138, 139, 140, 141 , 142, 143, 144, 145, 146, 147, 148, 149, 150, 151 , 152, 153, 154, 155, 156, 157, 158, 159, 160, 161 , 162, 163, 164, 165, 166, 167, 168, 169, 170, 171 , 172, 173, 174, 175, 176, 177, 178, 179, 180, 181 , 182, 183, 184, 185 auf.
Die Erfindung betrifft ferner eine Peptidbibliothek, welche bioaktive Peptide identifiziert durch das Verfahren der vorliegenden Erfindung umfasst.
Bei einer bevorzugten Ausführungsform umfasst die Peptidbibliothek bioaktive Peptide, welche eine Sequenz ausgewählt aus der Gruppe bestehend aus den Aminosäuresequenzen der oben aufgeführten SEQ. ID. NR. 1 bis 185 aufweisen.
Bei einer bevorzugteren Ausführungsform umfasst die Peptidbibliothek bioaktive Peptidhormone.
Bei einer weiteren bevorzugteren Ausführungsform umfasst die Peptidbibliothek bioaktive Peptidhormone abgeleitet von Vorläuferproteinen.
Ein weiterer Gegenstand der vorliegenden Erfindung betrifft ein rechentechnisches Gerät konfiguriert zum Identifizieren bioaktiver Peptide durch Verwendung eines Verfahrens basierend auf einer binären Support-Vektor-Maschine (SVM), wobei:
a) ein SVM-Algorithmus trainiert wird zu lernen, zwischen bioaktiven und nichtbioaktiven Peptiden zu unterscheiden, wobei das Trainieren folgende Schritte umfasst:
ai) das Erzeugen von Vektoren mit 49 Dimensionen, wobei jede Dimension aus der Berechnung eines Molekulardeskriptorwertes für einen Satz markierter bekannter bioaktiver und markierter bekannter nicht-bioaktiver Peptide resultiert, wobei die Markierungen anzeigen, ob das Peptid bioaktiv bzw. nichtbioaktiv ist;
a2) das Übertragen der Vektordaten erzeugt in Schritt a-i) an den SVM-basierten Algorithmus, wobei der Algorithmus die optimale Hyperebene berechnet, welche die Vektoren trennt, die den bioaktiven Peptiden bzw. den nichtbioaktiven Peptiden entsprechen;
b) Proteinsequenzen aus einer öffentlich erhältlichen humanen Proteindatenbank bereitgestellt werden;
c) die sekundäre Struktur und Spaltstellen innerhalb einer Proteinsequenz bereitgestellt in Schritt b) unter Verwendung rechentechnischer Verfahren vorhergesagt werden; ein Satz von 7 Molekulardeskriptoren wird basierend auf dem Vorhersageschritt berechnet, was in der Erzeugung von Peptidfragmenten resultiert;
d) ein Satz von 42 Molekulardeskriptoren, welche den physikalisch-chemischen Eigenschaften der Peptidfragmente erzeugt in Schritt c) entsprechen, berechnet wird;
e) die berechneten Werte aus Schritt c) in skalierte Werte zwischen 0 und 1 umgewandelt werden, zum Erzeugen der Dimensionen 1 bis 7 eines 49- Dimensionen-Vektors für jedes Peptidfragment, und die berechneten Werte aus Schritt d) werden umgewandelt in skalierte Werte zwischen 0 und 1 zum Erzeugen der Dimensionen 8 bis 49 des Vektors für jedes Peptidfragment;
f) die in Schritt e) erzeugten Vektoren an den trainierten SVM-Algorithmus aus Schritt a) präsentiert werden, zum Messen der Distanz jeden Vektors zu der Hyperebene berechnet in Schritt a2); und
g) jedes Peptidfragment gemäß der in Schritt f) gemessenen Distanz als bioaktives Peptid oder nicht-bioaktives Peptid klassifiziert wird.
Die Erfindung betrifft ferner die Verwendung des Verfahrens der vorliegenden Erfindung zum Identifizieren von therapeutischen Polypeptiden, Zielen für die Arzneimittelintervention, Liganden zum Entdecken relevanter Ziele oder Biomarkern zum Überwachen von Krankheiten.
Die Erfindung betrifft ferner die Verwendung der Peptidbibliothek der vorliegenden Erfindung bei einem Screening-Ansatz zum Untersuchen intrazellulärer Signalgebungswege, zum Erzeugen von Reagenzien zum Unterstützen des Verständnisses eines Weges, zum Erzeugen neuartiger Therapieformen und zum Identifizieren von pharmazeutisch aktiven Verbindungen, Zielen für die Arzneimittelintervention, Liganden zum Entdecken relevanter Ziele oder Biomarkem zum Überwachen von Krankheiten.
Die Erfindung betrifft auch eine pharmazeutische Zusammensetzung, welche ein bioaktives Peptid umfasst, welches eine Sequenz ausgewählt aus der Gruppe bestehend aus den Aminosäuresequenzen der SEQ. ID. NR. 1 bis 185 als bioaktives Agens aufweist.
DETAILLIERTE BESCHREIBUNG DER ERFINDUNG
Die vorliegende Erfindung betrifft neuartige bioaktive Polypeptide und ein in silicio Verfahren zum Identifizieren solcher bioaktiver Polypeptide. Bei der vorliegenden Erfindung gilt ein Polypeptid als bioaktiv, wenn es eine Wechselwirkung mit einem oder eine Wirkung auf ein Zellgewebe im menschlichen Körper aufweist. Bioaktive Peptide weisen das Potential auf, als therapeutische Polypeptide, Ziele für die Arzneimittelintervention, Liganden zum Entdecken relevanter Ziele (z.B. GPCR-Deorphaning) oder Biomarker zum Überwachen von Krankheiten verwendet zu werden. Zu bioaktiven Peptiden zählen, unter anderem, bioaktive Peptidhormone. Peptidhormone sind gekennzeichnet durch ihre hohe Spezifität sowie ihre Wirksamkeit in sehr niedrigen Konzentrationen. Peptidhormone werden anfangs als größere Vorläufer oder Prohormone synthetisiert.
Ein Vorläufer ist eine Substanz, aus der eine andere, üblicherweise aktivere oder reifere Substanz gebildet wird. Ein Proteinvorläufer ist ein inaktives Protein (oder Peptid), welches durch posttranslationale Modifikation in eine aktive Form gewandelt werden kann. Mehrere Spaltstellen sind an der Modifikation des Vorläufers beteiligt, um das reife Protein herzustellen: Signalsequenzspaltstellen, Proteasespaltstellen, Amidierungsstellen usw.
Der Name des Vorläufers für ein Protein weist häufig das Präfix Pro- oder Prä- auf. Vorläufer werden häufig dann durch einen Organismus verwendet, wenn das anschließende Protein potentiell schädlich ist, jedoch kurzfristig und/oder in großen Mengen verfügbar sein muss.
Die Begriffe „Polypeptid", „Peptid" und „Protein" werden hierin austauschbar verwendet, um auf ein Polymer Bezug zu nehmen, welches aus Aminosäureresten verbunden durch kovalente Bindungen besteht. Diese Begriffe beinhalten Teile oder Fragmente von Proteinen voller Länge, wie zum Beispiel Peptide, Oligopeptide und kürzere Peptidsequenzen, welche aus mindestens 2 Aminosäuren bestehen, insbesondere Peptidsequenzen, welche aus 4 bis 45 Aminosäuren bestehen.
Außerdem beinhalten diese Begriffe Polymere von modifizierten Aminosäuren, einschließlich Aminosäuren, welche posttranslational modifiziert wurden, zum Beispiel durch chemische Modifikation, einschließlich, jedoch nicht darauf beschränkt, Amidierungs-, Glycosylierungs-, Phosphorylierungs-, Acetylierungs- und/oder Sulfatierungsreaktionen, welche die Grundpeptidhauptkette wirksam verändern. Dementsprechend kann ein Polypeptid von einem natürlich vorkommenden Protein abgeleitet sein, und insbesondere kann es durch chemische oder enzymatische Spaltung von einem Protein voller Länge abgeleitet sein, unter Verwendung von Reagenzien wie CNBr oder Proteasen wie Trypsin oder Chymtrypsin u.a. Alternativ können solche Polypeptide unter Verwendung gut bekannter Peptidsyntheseverfahren durch chemische Synthese abgeleitet sein.
Eine Aminosäure ist ein Molekül, welches sowohl Amin- als auch Carbonsäure- Funktionsgruppen enthält. Ein Aminosäurerest ist das, was von einer Aminosäure übrig bleibt, nachdem bei der Bildung einer Peptidbindung, der chemischen Bindung, welche die Aminosäuremonomere in einer Proteinkette verbindet, ein Wassermolekül abgegeben wurde (ein H+ von der Stickstoffseite und ein OH- von der Carboxylseite).
Jedes Protein weist seine eigene einmalige Aminosäuresequenz auf, welche als seine Primärstruktur bekannt ist. Die Primärstruktur ist recht einfach und betrifft die Zahl und
Sequenz von Aminosäuren in der Protein- oder Polypeptidkette. Die kovalente
Peptidbindung ist die einzige Bindungsart, die auf diesem Level der Proteinstruktur beteiligt ist. Die Sequenz der Aminosäuren in einem Protein wird durch die genetische
Information in der DNA diktiert, welche in RNA transkribiert wird, welche dann in das Protein translatiert wird. So wird die Proteinstruktur genetisch bestimmt.
Das nächste Level der Proteinstruktur betrifft im Allgemeinen die Menge der strukturellen Regelmäßigkeit oder die Form, welche die Polypeptidkette annimmt. Eine natürliche Polypeptidkette faltet sich spontan in eine regelmäßige und definierte Form. Zwei Hauptarten von Sekundärstruktur wurden bei Proteinen gefunden, nämlich a- Helix und b-Faltblatt.
Die Tertiärstruktur einer Polypeptidkette ist das nächste Level der Konformation oder Form angenommen durch die Alpha-Helixen oder Beta-Faltblätter der Kette. Die meisten Proteine neigen dazu, sich in Formen zu falten, welche weithin als eine kugelförmige Annordnung klassifiziert werden, und einige, insbesondere
Strukturproteine, bilden lange Fasern. Dies sind die Hauptformen der groben
Tertiärstruktur. Ein häufig verwendeter Begriff ist Domäne, welcher eine kompakte Einheit der kugelförmigen Struktur in einer Polypeptidkette betrifft.
Die einmalige Form jeden Proteins bestimmt seine Funktion im Körper.
Außerdem enthalten im Umfang der Definition eines „Polypeptids" sind Aminosäuresequenzvarianten. Diese können eine oder mehrere, bevorzugt konservative Aminosäuresubstitutionen, -deletionen oder -einschübe in einer natürlich vorkommenden Aminosäuresequenz enthalten, welche mindestens eine essentielle Eigenschaft des Polypeptids nicht verändern, wie zum Beispiel seine biologische Aktivität. Solche Polypeptide können durch chemische Polypeptidsynthese synthetisiert werden. Konservative Aminosäuresubstitutionen sind in der Technik gut bekannt. Zum Beispiel können ein oder mehrere Aminosäurereste eines nativen Proteins konservativ mit einem Aminosäurerest ähnlicher Ladung, Größe oder Polarität substituiert sein, wobei das entstehende Polypeptid die funktionale Fähigkeit wie hierin beschrieben behält. Die Regeln für die Durchführung solcher Substitutionen sind gut bekannt. Spezifischer sind konservative Aminosäuresubstitutionen diejenigen, die im Allgemeinen innerhalb einer Familie von Aminosäuren, die in ihren Seitenketten verwandt sind, stattfinden.
Genetisch codierte Aminosäuren sind im Allgemeinen unterteilt in vier Gruppen: (1 ) sauer = Aspartat, Glutamat; (2) basisch = Lysin, Arginin und Histidin; (3) nichtpolar = Alanin, VaNn, Leucin, Isoleucin, Prolin, Phenylalanin, Methionin und Tryptophan und (4) ungeladen polar = Glycin, Asparagin, Glutamin, Cystein, Serin, Threonin und Tyrosin. Phenylalanin, Tyrosin und Tryptophan werden auch gemeinsam klassifiziert als aromatische Aminosäuren. Eine oder mehrere Ersetzungen innerhalb einer bestimmten Gruppe wie zum Beispiel die Substitution von Leucin für Isoleucin oder Valin sind alternativ, die Substitution von Aspartat für Glutamat oder Threonin für Serin oder von einem anderen Aminosäurenrest mit einem strukturverwandten Aminosäurerest weisen im Allgemeinen eine geringfügige Wirkung auf die Funktion des entstehenden Polypeptids auf.
Enthalten im Umfang der Definition des Begriffs „Polypeptid" ist ein Peptid, dessen biologische Aktivität als ein Ergebnis seiner Aminosäuresequenz, die einer funktionalen Domäne entspricht, vorhersagbar ist. Außerdem eingeschlossen durch den Begriff „Polypeptid" ist ein Peptid, dessen biologische Aktivität durch die Analyse seiner Aminosäuresequenz nicht vorhergesagt werden konnte.
Bei der vorliegenden Erfindung wird ein Support-Vektor-Maschinen-Algorithmus (SVM) verwendet, um zwischen Polypeptiden, welche eine Aktivität in vivo aufweisen, und Polypeptiden, welche keine Aktivität in vivo aufweisen zu unterscheiden.
Support-Vektor-Maschine (SVM)
Eine Support-Vektor-Maschine (SVM) ist eine universelle Lernmaschine, welche während einer Trainingsphase eine Entscheidungsoberfläche oder „Hyperebene" festlegt. Die Entscheidungshyperebene wird festgelegt durch einen Satz von Supportvektoren ausgewählt aus einer Trainingspopulation von Vektoren und durch einen Satz entsprechender Multiplikatoren. Die Entscheidungshyperebene ist auch gekennzeichnet durch eine Kernelfunktion.
Die mathematische Basis einer SVM wird erläutert in dem Buch von John Shawe Taylor & NeIIo Cristianini - Cambridge University Press, 2000 mit dem Titel „Support Vector Machines and other kemel-based leaming methods" und in einem Artikel von Chih-Chung Chang und Chih-Jen Lin mit dem Titel „LIBVSM - A Library for Support Vector Machines", 2001.
Im Anschluss an die Trainingsphase arbeitet eine SVM in einer Testphase, während der sie verwendet wird, um Testvektoren auf Grundlage der Entscheidungshyperebene zu klassifizieren, die zuvor während der Trainingsphase festgelegt wurde (Noble, 2006).
Support-Vektor-Maschinen finden Anwendung auf vielen und verschiedenartigen Gebieten. Zum Beispiel werden in einem Aufsatz von H. Kim und H. Park mit dem Titel „Prediction of protein relative solvent accessibility with support vector machines and long-range interaction 3d local descriptor", SVM für das Problem der Vorhersage einer hochaufgelösten 3D-Struktur angewandt, um das Andocken von Makromolekülen zu studieren.
Bei der vorliegenden Erfindung wird ein Support-Vektor-Maschinen-Algorithmus (SVM) verwendet, um zwischen Polypeptiden, die eine Aktivität in vivo aufweisen, und Polypeptiden, die keine Aktivität in vivo aufweisen zu unterscheiden.
Von einem praktischen Standpunkt aus, wird in der vorliegenden Erfindung eine SVM mit Hilfe eines rechentechnischen Gerätes wie einem PC implementiert. Das rechentechnische Gerät beinhaltet einen oder mehrere Prozessoren, welche eine Abfolge von unterschiedlicher Software ausführen, wie im Beispielabschnitt (1.1.) beschrieben, welche Anweisungen für das Implementieren eines Verfahrens gemäß der vorliegenden Erfindung enthält.
Training der SVM und Modelerzeuqunq
Um das SVM-Modell zu trainieren, wurden Vektoren mit 49 Dimensionen erzeugt, unter Verwendung der Programm-Routine beschrieben im Experimentabschnitt (1.1.) und schematisch gezeigt in Fig. 1.
Für den SVM-Trainingssatz können Informationen zu bekannten bioaktiven Peptiden aus einer öffentlich erhältlichen humanen Proteindatenbank wie Swissprot extrahiert werden. Bevorzugt wurden bioaktive Peptide mit einer Länge zwischen 4 und 55 Aminosäuren gemäß ihrer Annotation in Swissprot aus ihrem Vorläufer extrahiert und als positive Beispiele markiert für das Training des SVM-Algorithmus verwendet. Alle anderen erzeugten Fragmente mit einer Länge zwischen 4 und 55 Aminosäuren aus den gleichen bekannten Peptidhormonvorläufern, die keine zugewiesene Funktion haben, wurden als negative Trainingssätze für das SVM-Training verwendet. Da die SVM ein binäres System ist, wurden bioaktive Peptide als +1 und nicht-bioaktive Peptide als -1 markiert. Ähnlich wurden bioaktive und nicht-bioaktive Peptide mit einer Länge zwischen 56 und 300 Aminosäuren verwendet, um ein zweites Modell zum Vorhersagen längerer Peptide zu trainieren. Um negative Beispiele nicht zu überrepräsentieren, wurden die abschließenden SVM-Trainingssätze für kurze (4 bis 55 Aminosäuren) bzw. lange (56 bis 300 Aminosäuren) Peptide angeglichen auf eine gleiche Anzahl positiver und negativer Trainingsdaten durch zufällige Auswahl der gleichen Anzahl von negativen Beispielen aus allen negativen Peptiden. Zum Umwandeln der Informationen verborgen in den bioaktiven und nicht-bioaktiven Peptiden wurde ein Satz von 49 Deskriptoren definiert und für das Training einer SVM verwendet. Die Leistung eines SVM-Modells ist stark abhängig von der Qualität der ausgewählten Deskriptoren, die zum Beschreiben der Peptide verwendet werden. Bei der vorliegenden Erfindung reflektieren die ersten 7 Deskriptoren die Wahrscheinlichkeit, dass ein Polypeptid durch einen menschlichen Körper hergestellt wird. Diese 7 Dimensionen wurden durch Anwendung eines Satzes von Protea- sespaltstellen-Vorhersagewerkzeugen auf die Peptidhormonvorläufersequenz (Fig. 1 ) berechnet. Die entstehenden Werte jeder Programmausgabe wurden direkt als Deskriptoren verwendet. Die übrigen 42 Dimensionen reflektieren wichtige physikalisch-chemische Eigenschaften jedes erzeugten Fragments (d.h. ein bioaktives oder ein nicht-bioaktives Peptid). Die bei der vorliegenden Erfindung verwendeten 49 Dimensionen sind unter Punkt 3 des Beispielabschnitts aufgelistet.
Jedem Peptid entspricht eine einmalige Kombination von 49 Deskriptoren. Die unterschiedlichen Peptide können als Punkte in einem multidimensionalen Raum dargestellt sein, wobei jede Dimension einem der Deskriptoren entspricht. Die SVM versucht, eine Grenze zu finden, welche die beiden Punktsätze, welche den bioaktiven und den nicht-bioaktiven Peptiden entsprechen, am besten trennt. Diese Grenze nennt man die optimale Hyperebene, welche die beiden Klassen von Objekten in einem n- dimensionalen Raum, nämlich die Vektoren, welche den bioaktiven Peptiden bzw. den nicht-bioaktiven Peptiden entsprechen, am besten trennt.
Die entstehenden SVM-Modelle lernen, zwischen bioaktiven und nicht-bioaktiven Peptiden zu unterscheiden. Das beste Modell wird ausgewählt, welches die höchste Leistung basierend auf der Rangfolge eines unabhängigen Testsatzes bioaktiver und nicht-bioaktiver Peptide aufweist. Zum Testen der Modelle wurde die Leistung aller erzeugten Modelle getestet, und die beiden besten Modelle für kurze Peptide (4 bis 55 Aminosäuren) bzw. längere Peptide (56 bis 300 Aminosäuren) wurden ausgewählt.
Identifizierung bioaktiver Peptide
Nach dem Training ist das entstehende trainierte SVM-Modell in der Lage, bioaktive Peptide zu identifizieren, für welche keine Bioaktivität charakterisiert gewesen war.
Ein schematischer Überblick über das Verfahren offenbart in der Erfindung, ist in Fig. 1 gegeben, zur Erläuterung der Schritte, die an der Peptidbibliothekserzeugung beteiligt sind. Als Eingabewert wird eine Proteinsequenz bereitgestellt aus einer öffentlich erhältlichen humanen Proteindatenbank wie Swissprot verwendet. In Schritt 1 werden alle potentiellen Proteasespaltstellen unter Verwendung eines Satzes von Werkzeugen zum Vorhersagen dieser Ereignisse vorhergesagt. Die entsprechenden Spaltstellenpo- sitionen werden für jede Vorläufersequenz gespeichert. Außerdem wird die Sekundärstruktur für die gesamte Proteinvorläufersequenz hergeleitet. Basierend auf den vorhergesagten Spaltstellen innerhalb der Vorläufersequenz werden alle potentiellen Fragmente erzeugt (Schritt 2) und werden als Eingabe für Schritt 3 verwendet. Schritt 3 umfasst die Berechnung von physikalisch-chemischen Eigenschaften für jedes Peptidfragment (Liste unter Punkt 3 des Beispielabschnitts). Im Allgemeinen werden Informationen zur Aminosäurenhäufigkeit innerhalb jeden Fragments, zur Sekundärstruktur jeden Fragments, zum isoelektrischen Punkt jeden Fragments, zur durchschnittlichen Molekülmasse jeden Fragments, zur Hydrophobie jeden Fragments, zur Summe aller Van-der-Waals-Kräfte für jede Aminosäure innerhalb des Fragments, zur Summe aller üblicherweise verwendeten Aminosäuredeskriptoren (d.h. der VHSE- Wert für jede Aminosäure basierend auf Mei et a\., 2005) für jede Aminosäure innerhalb des Fragments und zur Fragmentlänge berücksichtigt, um die biologische Information in numerische Werte umzuwandeln. Die berechneten Werte aus Schritt 1 und 3 werden in Schritt 4a und 4b zu skalierten Werten zwischen 0 bzw. 1 umgewandelt, um einen 49-dimensionalen Vektor für jedes Fragment zu erzeugen. In Schritt 5 werden die Vektoren an das trainierte SVM-Modell präsentiert, um die Distanz jeden Vektors zur Hyperebene zu messen. Die SVM- Ausgabe wird dann in Schritt 6 verwendet, um zu entscheiden, ob das Peptid wahrscheinlich bioaktiv ist oder nicht. 49-dimensionale Vektoren, welche den bioaktiven Peptiden identifiziert durch das Verfahren der vorliegenden Erfindung entsprechen, sind in Figur 3 aufgelistet.
Um die potentielle Anzahl von Strukturen in einer Peptidbibliothek signifikant zu verringern, wurden bei der vorliegenden Erfindung nur natürlich vorkommende Proteinsequenzen gefunden im humanen Sekretom als Primärstrukturen zum Erzeugen von Peptidbibliotheken verwendet. Das humane Sekretom ist die gesamte Information codiert in der DNA, welche allen humanen Proteinen entspricht, die durch die Zellen sekretiert werden. Potentiell sekretierte humane Proteine, welche als Vorläufersequenzen verwendet wurden, um neuartige bioaktive Peptide zu finden, wurden aus den öffentlich erhältlichen Sequenzdatenbanken aufgelistet unter Punkt 1.1. des Beispielabschnitts extrahiert.
Bestimmte Teile der Primärsequenzen von sekretierten Proteinen, d.h. Proteinvorläufer, wurden als Schablonen zum Herleiten neuartiger bioaktiver Peptide verwendet. Die Peptidlänge war beschränkt auf 4 bis 45 Aminosäuren, um Peptide zu erzeugen, die für die chemische Synthese geeignet sind.
Im Anschluss an die Identifikation neuartiger bioaktiver Peptide durch das Verfahren der vorliegenden Erfindung, wurden antimikrobielle Assays durchgeführt, um die Bioaktivität der letztgenannten Peptide zu testen. Diese Assays sind unter Punkt 6 des Beispielabschnitts detailliert.
Die vorliegende Erfindung betrifft ferner eine Peptidbibliothek, welche bioaktive Peptide identifiziert durch das zuvor beschriebene SVM-Modell-Verfahren umfasst. Die Aminosäuresequenzen der 185 bioaktiven Peptide identifiziert durch das Verfahren der vorliegenden Erfindung und enthalten in der Peptidbibliothek der vorliegenden Erfindung sind in Figur 2 aufgelistet.
Eine Peptidbibliothek ist eine neu entwickelte Technik für proteinbezogene Studien. Eine Peptidbibliothek enthält eine große Zahl von Peptiden, welche eine systematische Kombination von Aminosäuren aufweisen. Üblicherweise werden Peptidbibliotheken auf eine Festphase, meist auf Harz, synthetisiert, welche als flache Oberfläche oder Kügelchen hergestellt sein kann. Eine Peptidbibliothek stellt ein leistungsstarkes Werkzeug für das Arzneimitteldesign, Protein-Protein-Wechselwirkungen und andere biochemische sowie pharmazeutische Anwendungen bereit. Die Peptidbibliothek der vorliegenden Erfindung kann in einem Screening-Ansatz zum Untersuchen intrazellulärer Signalgebungswege, zum Erzeugen von Reagenzien zum Unterstützen des Verständnisses eines Weges, zum Erzeugen neuartiger Therapieformen und zum Identifizieren von pharmazeutisch aktiven Verbindungen, Zielen für die Arzneimittelintervention, Liganden zum Entdecken relevanter Ziele oder Biomarkern zum Überwachen von Krankheiten verwendet werden.
Die Polypeptide der vorliegenden Erfindung weisen eine hormonale Aktivität auf. Daher sind die Polypeptide der Erfindung geeignet als Arzneimittel, zum Bespiel therapeutische Polypeptide, Liganden zum Entdecken relevanter Ziele (z.B. GPCRs), Ziele für die Arzneimittelintervention (z.B. Ziele für monoklonale Antikörper, Rezeptorfragmente), Biomarker zum Überwachen von Krankheiten (in Kombination mit Werkzeugantikörpern zum Erkennen von Peptidfragmenten in Körperfluiden), Proteinkinasehemmer und -Substrate, T-Zell-Epitope, Peptidmimotope von Rezeptorbindungsstellen usw.
Die DNAs, welche das Peptid oder den Vorläufer der Erfindung codieren, sind zum Beispiel geeignet als Agenzien für die Gentherapie, die Behandlung oder
Verhinderung von kardiovaskulären Krankheiten, hormonerzeugenden Tumoren,
Diabetes, Magengeschwüren und ähnlichen, Hormonsekretionshemmer,
Tumorwachstumshemmer, Nervenaktivität usw. Ferner sind die DNAs der Erfindung geeignet als Agenzien für die Gendiagnose von Krankheiten wie kardiovaskulärer Krankheit, hormonerzeugenden Tumoren, Diabetes, Magengeschwüren und ähnlichen.
BEISPIELE
Die nun allgemein beschriebene Erfindung wird leichter verständlich unter Bezugnahme auf die folgenden Beispiele, welche lediglich zu Zwecken der Veranschaulichung bestimmter Aspekte und Ausführungsformen der vorliegenden Erfindung eingeschlossen sind und nicht der Einschränkung der Erfindung dienen sollen.
1. Datenbanken und Computerprogramme
1.1 Datenbanken
Die folgenden öffentlich verfügbaren Sequenzdatenbanken wurden verwendet, um potentiell sekretierte humane Proteine zu extrahieren, welche als Vorläufersequenzen verwendet wurden, um neuartige bioaktive Peptide zu finden:
Humanes Genom (NCBI 33 Anordnung, 1. Juli 2003) translatiert in Protein, Untersatz;
International Protein Index, Swissprot (Ausgabe 50.3 vom 11. Juli 2006) und TrEMBL (Ausgaben: August 2003 - März 2006);
Für das Training von SVM-basierten Algorithmen wurden Informationen zu bekannten bioaktiven Peptiden aus Swissprot extrahiert.
1.2 Computerprogramme
1.1 Signal P, Version 2.0 (Nielsen et al., 1997) Aufgabe: Dieses Programm wurde verwendet, um potentielle Signalsequenzen zu erkennen und das potentielle humane Sekretom zu bestimmen. Es wurde mit einem Grenzwert von 0,98 verwendet. Signal P, Version 2.0 sagt die Gegenwart und die Position von Signalpeptidspaltstellen in Aminosäuresequenzen für unterschiedliche Organismen voraus. Das Verfahren beinhaltet eine Vorhersage von Spaltstellen und eine Signalpeptid/Nicht-Signalpeptid-Vorhersage basierend auf einer Kombination mehrerer künstlicher Nervennetze und verborgener Markov-Modelle.
1.2 ProP, Version 1.0 (Duckert et al., 2004) Aufgabe: Dieses Programm wurde verwendet, um potentielle Spaltstellen in Proteinsequenzen vorherzusagen. Der verwendete Grenzwert war auf 0,11 eingestellt. Dieses Programm sagt Arginin- und Lysin-Propeptidspaltstellen in eukaryotischen Proteinsequenzen unter Verwendung eines Ensembles von Nervennetzen voraus. Die Furin-spezifische Vorhersage ist die Voreinstellung. Es ist auch möglich, eine allgemeine Proproteinkonvertase (PC) -Vorhersage durchzuführen.
1.3 AmidierungssteNenvorhersage und Vorhersage von Proteasespaltstellen (Rohrer, 2004)
Das Programm Hamid sagt Amidierungsstellen in Proteinsequenzen vorher. Das Programm Hmcut sagt Proteasespaltstellen in Proteinsequenzen vorher, welche vor einem basischen Aminosäurerest (Lys, Arg) stattfinden. Beide Programme basieren auf verborgenen Markov-Modellen und verwenden die Software-Version Hmmer 2.3.2 (Durbin et al., 1998).
1.4 Support-Vektor-Maschine (Chang und Lin, 2001 )
LIBVSM ist eine integrierte Software für die Support-Vektor-Klassifizierung, (C-SVC, nu-SVC), Regression (Epsilon-SVR, nu-SVR) und Verteilungsschätzung (Einklassen-
SVM).
Die folgenden SVM-Spezifizierungen wurden verwendet: SVM-Typ: nu-SVC; Kernel- Typ: Radiusbasisfunktion.
1.5 PsiPred, Version 2.45 (Jones, 1999)
Verfahren für die Vorhersage der Proteinsekundärstruktur. Das Verfahren wurde verwendet wie in Jones, 1999 beschrieben.
1.6 Berechnung isoelektrischer Punkte
Aufgabe: Berechnung isoelektrischer Punkte von Polypeptiden. Diese erfolgte gemäß Gasteiger et al., 2005.
1.7 Perl - Praktische Sprache für Datenextraktion und Datenausgabe Aufgabe: Perl ist eine dynamische Programmiersprache entwickelt durch Larry Wall und erstmals veröffentlicht 1987.
2. Training der SVM
Für den überwachten Lernprozess wurden bekannte bioaktive Polypeptidvorläufer aus üblicherweise verwendeten öffentlichen Datenbanken wie Swissprot unter
Verwendung der folgenden SRS (Sequence Retrieval System unter www.expasy.org) -
Abfrage extrahiert: Organismus = Wirbeltiere; Sequenzlänge = 30:300;
Merkmalsschlüssel = Signal; Schlüsselwörter = Zytokin oder Hormon oder Bombesin oder Bradykinin oder Glucagon oder Wachstumsfaktor oder Insulin oder Neuropeptid oder Opioidpeptid oder Tachykinin oder Schilddrüsenhormon oder Vasokonstriktor oder Vasodilatator. Diese Abfrage ergibt einen Satz bekannter Peptidhormonvorläufer, bei denen ihre bioaktiven Peptide durch die Annotation der Swissprot-Datenbank leicht verfügbar sind. Daher können diese Sequenzen verwendet werden, um einen Satz bioaktiver und nicht-bioaktiver Peptide für das Training eines SVM-basierten Modells herzuleiten.
3. Molekulardeskriptoren verwendet zum Aufbau der Vektoren
Die Leistung eines SVM-Modells ist stark abhängig von der Qualität der ausgewählten Deskriptoren, welche zum Beschreiben der Peptide verwendet werden.
Bei der vorliegenden Erfindung wurden die folgenden Deskriptoren ausgewählt:
Die Dimensionen 1 bis 7 repräsentieren die Wahrscheinlichkeit eines Polypeptids, im menschlichen Körper hergestellt zu werden, und sie wurden durch eine Kombination unterschiedlicher Proteasespaltstellen-Vorhersagewerkzeuge berechnet. Die Ergebnisse dieser Werkzeuge stehen für die ersten 7 Dimensionen des Vektors.
Dimension 1 : N-Terminus-ProP-Wert; Dimension 2: N-Terminus-Hmcut-Wert;
Dimension 3: N-Terminus-Fragment (fester Wert von 0,2); Dimension 4: C-Terminus-ProP-Wert; Dimension 5: C-Terminus-Hmcut-Wert; Dimension 6: C-Terminus-Hamid-Wert; Dimension 7: C-Terminus-Fragment (fester Wert von 0,2);
Die physikalisch-chemischen Eigenschaften der Polypeptide wurde berechnet und repräsentieren die folgenden 42 Dimensionen des Vektors.
Dimension 8: Prozentsatz der sauren Aminosäuren (E, N, Q) pro Polypeptid
Dimension 9: Prozentsatz der positiv geladenen Aminosäuren (R, H) pro Polypeptid Dimension 10: Prozentsatz der aromatischen Aminosäuren (F, Y, W) pro Polypeptid
Dimension 11 : Prozentsatz der aliphatischen Aminosäuren (G, V, A, I) pro Polypeptid
Dimension 12: Prozentsatz von Prolin pro Polypeptid
Dimension 13: Prozentsatz der reaktiven Aminosäuren (S, T) pro Polypeptid
Dimension 14: Prozentsatz von Alanin pro Polypeptid Dimension 15: Prozentsatz von Cystein pro Polypeptid
Dimension 16: Prozentsatz von Glutaminsäure pro Polypeptid
Dimension 17: Prozentsatz von Phenylalanin pro Polypeptid
Dimension 18: Prozentsatz von Glycin pro Polypeptid
Dimension 19: Prozentsatz von Histidin pro Polypeptid Dimension 20: Prozentsatz von Isoleucin pro Polypeptid
Dimension 21 : Prozentsatz von Asparagin pro Polypeptid
Dimension 22: Prozentsatz von Glutamin pro Polypeptid
Dimension 23: Prozentsatz von Arginin pro Polypeptid
Dimension 24: Prozentsatz von Serin pro Polypeptid Dimension 25: Prozentsatz von Threonin pro Polypeptid
Dimension 26: Prozentsatz von nichtkanonischer Aminosäure (Undefiniert) pro
Polypeptid (es sei darauf hingewiesen, dass diese Dimension keinen Wert außer 0 als
Eingabe enthält)
Dimension 27: Prozentsatz von Valin pro Polypeptid Dimension 28: Prozentsatz von Tryptophan pro Polypeptid
Dimension 29: Prozentsatz von Tyrosin pro Polypeptid
Dimension 30: Cysteingehalt (Null, gerade oder ungerade Zahl eingestellt auf 0,5, 1 bzw. 0)
Dimension 31 : Prozentsatz geknäuelter Sekundärstruktur pro Polypeptid Dimension 32: Prozentsatz helikaler Sekundärstruktur pro Polypeptid
Dimension 33: Prozentsatz zufälliger Sekundärstruktur pro Polypeptid
Dimension 34: Wert für die Struktur um die N-Terminus-Spaltstelle Dimension 35: Wert für die Struktur um die C-Terminus-Spaltstelle
Dimension 36: Anzahl der helikalen Blöcke pro Polypeptid
Dimension 37: Isoelektrischer Punkt des Polypeptids
Dimension 38: Durchschnittliche Molekülmasse des Polypeptids Dimension 39: Summe der Van-der-Waals-Kräfte jeder Aminosäure innerhalb des
Polypeptids
Dimension 40: Summe der Hydrophobiewerte jeder Aminosäure innerhalb des
Polypeptids
Dimension 41-48: Mittlere Werte berechnet basierend auf den grundlegenden Komponentenwertvektoren der hydrophoben, sterischen und elektronischen
Eigenschaften pro Polypeptid (Mei et al., 2005)
Dimension 49: Länge des Polypeptids
Wo immer zutreffend, wurden die Werte für Dimension 1 bis 49 skaliert, damit sie im
Bereich zwischen 0 und 1 liegen. Die Eingabevektoren für Training und Vorhersage enthalten 49 Dimensionen, jedoch werden im gegenwärtigen Format nur 48 genutzt, da Dimension 26 (Prozentsatz der πichtkanonischen Aminosäuren pro Fragment) für alle Fragmente auf NuH gesetzt ist.
Dies geschieht aufgrund des Mangels an geeigneten Trainingsdaten, welche nichtkanonische Aminosäuren enthalten; die Dimension kann jedoch in zukünftigen Modellen eingeschlossen werden.
4. Testen der Modelle
Es wird das beste Modell ausgewählt, welches die höchste Leistung basierend auf der Rangfolge eines unabhängigen Testsatzes bioaktiver und nicht-bioaktiver Peptide aufweist. Zum Testen der Modelle wurde die Leistung aller erzeugten Modelle getestet und die beiden besten Modelle für kurze Peptide (4 bis 55 Aminosäuren) bzw. längere
Polypeptide (56 bis 300 Aminosäuren) wurden ausgewählt. Dadurch wurde eine
Gesamtvorhersagegenauigkeit von 90,7 % für kurze Peptide und 94 % für längere Peptide erreicht. Unter Verwendung eines unabhängigen Testsatzes identifiziert das offenbarte Verfahren korrekt rund 93 % der bioaktiven Peptide und rund 91 % der nicht-bioaktiven Peptide.
5. Identifizierung bioaktiver Peptide
Während des Rangfolgeschrittes (Schritt 6, Figur 1) werden die höchstwertigen Peptide pro Vorläufer ausgewählt, welche eine Länge kürzer als 46 Aminosäuren aufweisen. Bei diesem Rangfolgeverfahren werden alle Fragmente, welche nach der SVM-Klassifizierung eine Distanz größer als |0,65| aufweisen und mit dem negativen Trainingsdatensatz (d.h. einem Wert von -0,65 oder niedriger) lokalisiert werden, verworfen, selbst wenn sie die höchstwertigen Peptide pro Proteinvorläufer darstellen.
6. Antimikrobielle Assays zum Testen der Bioaktivität der Peptide identifiziert durch das Verfahren der vorliegenden Erfindung
6.1 Assay-Technoiogie
Der Mikroverdünnungstest repräsentiert ein homogenes Verfahren zum Bestimmen der Zahl der lebensfähigen Bakterien- oder Hefezellen in Kultur. Er beruht auf den Tatsachen, dass lebende Bakterien oder Hefe in Kultur trüb sind. Trübheit kann als Lichtabsorbanz mit einem Photometer gemessen werden und wird mit der Zahl der Zellen in der Probe korreliert.
6.2 Materialien und Verfahren
Bakterien- und Hefestämme
Die im Verlauf der Experimente verwendeten Stämme sind Escherichia coli (E. coli ATCC 25922), Staphylococcus aureus (S. aureus ATCC 29213) und Candida albicans (C. albicans FH 2173).
Vorkultivierunq aller Teststämme
Die Kultivierung des Stammes beginnt mit dem Anlegen einer Cryostock-Lösung, welche für mehrere Inokulationen von Vorkulturen verwendet werden kann.
1. Strichförmiges Auftragen der Bakterien auf die Oberfläche einer Mueller Hinton
(MH)-Agarplatte unter Verwendung einer Inokulationsschleife und Inkubation der Agarplatte für 3 Tage bei 37 °C. Bei Hefe Verwendung des gleichen Verfahrens, jedoch mit Sabouraud Dextrose (SD)-Agar.
2. Inokulieren eines 100 ml Schüttelkolbens, welcher 30 ml MH-Nährbouillon enthält, mit einer Schleife Bakterien und Inkubation des Kolbens für 1 Tag bei 37 0C und 180 U/min. Bei Hefe Anwendung der gleichen Bedingungen in SD- Nährbouillon.
3. Entfernen der hypertonischen Cryo-Präservativ-Lösung aus den Cryobank (CRYO/G) -Kunststoffphiolen, welche je 25 grüne Glasperlen enthalten, unter Verwendung einer sterilen Pipette.
4. Füllen jeder Phiole mit 2 ml der Bakterien-/Hefe-Suspension, Verschließen der Phiole und vorsichtiges Mischen.
5. Entfernen von soviel des Bakterien-/Hefe-Kulturüberstandes aus der Phiole wie möglich. Die Oberfläche der Perlen ist nun bedeckt mit Bakterien/Hefe. Die Menge der in der Phiole verbleibenden Flüssigkeit sollte so gering wie möglich sein, um ein Verklumpen der Perlen zu vermeiden. Eine Perle wird für die Inokulation einer Vorkultur (30 ml MH/SD-Nährbouillon in einem 100 ml Schüttelkolben) verwendet.
6. Lagern der Cryobank (CRYO/G) -Phiolen bei -80 0C.
7. Qualitäts-/Sterilitätsprüfung: Entnehmen einer Cryobank (CRYO/G) -Phiole aus dem Gefrierschrank und Abstellen in einem Cryoblock (CRYO/Z). Öffnen der
Phiole, Entfernen einer Perle und unverzügliches strichförmiges Aufstreichen der Perle auf der Oberfläche einer MH/SBD-Agarplatte. Inkubieren der Platte für 3 Tage bei 37 0C. Verifizieren, dass nur der Teststamm gewachsen ist durch Untersuchung der Koloniemorphologie.
Vorbereitung der Testkultur unter Verwendung von MH-Nährbouillon
Die Teststammphiole wird aus der Cryobank entfernt. Eine Perle wird mit einer sterilen Pipette entnommen und in einem 100 ml Erlenmeyer-Kolben mit 30 ml MH- bzw. SD- Nährbouillon für Bakterien und Hefe inokuliert. Züchten der Kultur für 18 Stunden bei 37 0C und 180 U/min. Die optische Dichte wird mit MH-Nährbouillon auf eine Zelldichte entsprechend 108 Zellen/ml für alle Teststämme angepasst. Die Standardimpfgutkultur für das Assay wird 1 :100 auf die abschließende Konzentration von 106 CFU/ml (koloniebildende Einheiten/ml) verdünnt.
Peptidverdünnunqen Die Verbindungen werden seriell (10 Verdünnungsschritte) von der Standardanfangskonzentration von 125 μM auf eine abschließende Konzentration von 0,24 μM verdünnt. Die anfängliche DMSO-Konzentration beträgt 1 ,4 % in allen Proben und Kontrollen.
Standardantibiotikaverdünnunqen für Dosisreaktionskurven
Für Dosisreaktionsexperimente, Verdünnung der Verbindungen seriell (16 Verdünnungsschritte) mit MH-Nährbouillon. Abschließender Verbindungs- konzentrationsbereich zwischen 64 μg/ml und 0,002 μg/ml. Die anfängliche DMSO- Konzentration beträgt 1 ,4 % in allen Proben und Kontrollen.
Assay-Protokoll
* Vorkultivierung der Bakterien in 30 ml MH-Nährbouillon bei 37 0C für 18 Stunden (100 ml Erlenmeyer-Kolben)
* Vorkultivierung der Hefe in 30 ml SD-Nährbouillon bei 37 0C für 18 Stunden (100 ml Erlenmeyer-Kolben)
* Anpassen der Zellsuspension mit MH-Nährbouillon auf 106 CFU/ml (Testkultur)
Assa\
* Zugeben von 10 μl Verbindung in DMSO und 30 μl MH-Nährbouillon zur ersten Phiole
* Übertragen von 20 μl aus der ersten Phiole in die zweite, die 20 μl MH-Nährbouillon enthält * Der letzte Schritt wird 8 Mal (Peptide, 10 Verdünnungsschritte) oder 14 Mal (Antibiotika, 16 Verdünnungsschritte) wiederholt
* Zugeben von 10 μl Testkultursuspension zu jeder Phiole (10 Phiolen für die Peptide und 16 Phiolen für die Antibiotika) => Startzellimpfgut : 5 x 105 CFU
=> Start-DMSO-Konzentration : 12,5 %
=> Start/Abschluss-Verbindungskonzentration : 125 μM - 0,24 μM => Start/Abschluss-Antibiotikakonzentration : 64 μg/ml - 0,002 μg/ml
* Inkubieren bei 37 0C für 18 Stunden durch 5 % relative Feuchtigkeit und 5 % CO2 * Ablesen der Absorbanz bei 590 nm mit 5 Blitzen
Kontrollen
* Hohe Kontrollen: MH-Nährbouillon mit Bakterien (Wachstumskontrolle, hohes Signal)
* Niedrige Kontrollen: MH-Nährbouillon ohne Bakterien (sterile Kontrolle, niedriges Signal)
6.3 Empfindlichkeitstests mit Antibiotika
Für die Bewertung der Eignung des Assays für die Identifikation potentieller Arzneimittel wurden die dosisabhängigen Auswirkungen einer Reihe von Antibiotika unter Verwendung der unter .Materialien und Verfahren' beschriebenen Bedingungen getestet. Es wurde erwartet, dass Cyprofloxacin aktiv gegen E. coli und S. aureυs, und dass Nystatin aktiv gegen C. albicans ist. Die berechneten IC50-Werte für diese Antibiotika sind in Figur 4 in μg/ml angegeben.
6.4 Assay-Ergebnisse
Die Peptide wurden gegen die Teststämme E. coli (ATCC 25922), S. aureus (ATCC 29213) und C. albicans (FH 2173) getestet. Die Peptide A003500589 und A003500548 zeigten IC50-Werte von 7,25 μg/ml bzw. 6,79 μg/ml gegen E. coli. Es wurden keine Aktivitäten gegen S. aureus und C. albicans gefunden. REFERENZEN
Chih-Chung Chang and Chih-Jen Lin; „LIBSVM: a library for support vector machines"; 2001
Peter Duckert, Soren Brunak and Nikolaj Blom; „Prediction of proprotein convertase cleavage sites"; Protein Engineering, Design and Selection, 17:107-112, 2004
Durbin R, Eddy S, Krogh A and Mitchison G; „The theory behind profile HMMs: Biological sequence analysis: probabilistic modeis of proteins and nucleic acids"; Cambridge University Press, 1998
C. Falciani, L. Lozzi, A. Pini, L. Bracci; „Bioactive Peptides from Libraries"; Chemistry & Biology, Band 12, Ausgabe 4, Seite 417-426, 2005
Gasteiger E., Hoogland C, Gattiker A., Duvaud S., Wilkins M. R., Appel R. D., Bairoch A.; „Protein Identification and Analysis Tools on the ExPASy Server"; (in) John M. Walker (Ed.): The Proteomics Protocols Handbook, Humana Press, 2005
Jones, D.T.; „Protein secondary structure prediction based on position-specific scoring matrices"; J. Mol. Biol. 292:195-202, 1999
H. Kim and H. Park; „Prediction of protein relative solvent accessibility with support vector machines and long-range interaction 3d local descriptor"; Proteins, 54 (3): 557- 62, 2004
Mei, H., Liao, T. H., Zhou, Y. and Li, S.Z.; „A new set of amino acid descriptors and its application in peptide QSARs"; Biopolymers, Band 80, 775-786, 2005
Henrik Nielsen, Jacob Engelbrecht, S0ren Brunak and Gunnar von Heijne; „Identification of prokaryotic and eukaryotic signal peptides and prediction of their cleavage sites"; Protein Engineering, 10:1-6, 1997
Noble WS.; „What is a support vector machine?"; Nat. Biotechnol. 24(12):1565-7, 2006
Rohrer, S.; „Prediction of post-translational processing sites in peptide hormone precursors"; Diplomarbeit, Universität Würzburg, 2004 John Shawe Taylor & NeIIo Cristianini; „Support Vector Machines and other kernel- based learning methods"; Cambridge University Press, 2000
BESCHREIBUNG DER FIGUREN
Figur 1:
Ein schematischer Überblick über das Verfahren offenbart in der Erfindung ist in Fig. 1 gezeigt, um die Schritte zu erläutern, die an der Erzeugung der Peptidbibliothek beteiligt sind.
Figur 2:
Figur 2 zeigt die Aminosäuresequenzen der 185 bioaktiven Peptide ausgewählt basierend auf gemeinsamen physikalisch-chemischen Eigenschaften.
Figur 3:
Figur 3 zeigt die Eingabevektoren der 185 Peptide, die durch den trainierten SVM-
Algorithmus als bioaktiv identifiziert wurden.
Figur 4
Figur 4 zeigt die berechneten IC50-Werte für Antibiotika in μg/ml.

Claims

ANSPRÜCHE
1. In einem computerbasierten System, Verfahren zum Identifizieren bioaktiver Peptide unter Verwendung eines Algorithmus basierend auf einer binären Support-Vektor-Maschine (SVM), wobei das Verfahren folgende Schritte umfasst:
a) das Trainieren eines SVM-Algorithmus zu lernen, zwischen bioaktiven und nicht-bioaktiven Peptiden zu unterscheiden, wobei das Trainieren folgende Schritte umfasst:
ai) das Erzeugen von Vektoren mit 49 Dimensionen, wobei jede Dimension aus der Berechnung eines Molekulardeskriptorwertes für einen Satz markierter bekannter bioaktiver und markierter bekannter nichtbioaktiver Peptide resultiert, wobei die Markierungen anzeigen, ob das Peptid bioaktiv bzw. nicht-bioaktiv ist;
a2) das Übertragen der Vektordaten erzeugt in Schritt a-i) an den SVM- basierten Algorithmus, wobei der Algorithmus die optimale Hyperebene berechnet, welche die Vektoren trennt, die den bioaktiven Peptiden bzw. den nicht-bioaktiven Peptiden entsprechen;
b) das Bereitstellen von Proteinsequenzen aus einer öffentlich erhältlichen humanen Proteindatenbank;
c) das Vorhersagen der sekundären Struktur und Spaltstellen innerhalb einer Proteinsequenz bereitgestellt in Schritt b) unter Verwendung rechentechnischer Verfahren; ein Satz von 7 Molekulardeskriptoren wird basierend auf dem Vorhersageschritt berechnet, was in der Erzeugung von Peptidfragmenten resultiert;
d) das Berechnen eines Satzes von 42 Molekulardeskriptoren, welche den physikalisch-chemischen Eigenschaften der Peptidfragmente erzeugt in Schritt c) entsprechen;
e) das Umwandeln der berechneten Werte aus Schritt c) in skalierte Werte zwischen 0 und 1 zum Erzeugen der Dimensionen 1 bis 7 eines 49- Dimensionen-Vektors für jedes Peptidfragment und das Umwandeln der berechneten Werte aus Schritt d) in skalierte Werte zwischen 0 und 1 zum Erzeugen der Dimensionen 8 bis 49 des Vektors für jedes Peptidfragment;
f) das Präsentieren der in Schritt e) erzeugten Vektoren an den trainierten
SVM-Algorithmus aus Schritt a) zum Messen der Distanz jeden Vektors zu der Hyperebene berechnet in Schritt a2); und
g) das Klassifizieren jedes Peptidfragmentes als bioaktives Peptid oder nicht- bioaktives Peptid gemäß der in Schritt f) gemessenen Distanz.
2. Verfahren nach Anspruch 1 , wobei die Dimensionen 1 bis 7 erzeugt in Schritt e) Folgende sind: Dimension 1 : N-Terminus-ProP-Wert; Dimension 2: N-Terminus- Hmcut-Wert; Dimension 3: N-Terminus-Fragment; Dimension 4: C-Terminus- ProP-Wert; Dimension 5: C-Terminus-Hmcut-Wert; Dimension 6: C-Terminus-
Hamid-Wert; Dimension 7: C-Terminus-Fragment; und die Dimensionen 8 bis 49 erzeugt in Schritt e) sind Folgende: Dimension 8: Prozentsatz der sauren Aminosäuren (E, N, Q) pro Polypeptid; Dimension 9: Prozentsatz der positiv geladenen Aminosäuren (R, H) pro Polypeptid; Dimension 10: Prozentsatz der aromatischen Aminosäuren (F, Y, W) pro Polypeptid; Dimension 11 :
Prozentsatz der aliphatischen Aminosäuren (G, V, A, I) pro Polypeptid; Dimension 12: Prozentsatz von Prolin pro Polypeptid; Dimension 13: Prozentsatz der reaktiven Aminosäuren (S, T) pro Polypeptid; Dimension 14: Prozentsatz von Alanin pro Polypeptid; Dimension 15: Prozentsatz von Cystein pro Polypeptid; Dimension 16: Prozentsatz von Glutaminsäure pro Polypeptid;
Dimension 17: Prozentsatz von Phenylalanin pro Polypeptid; Dimension 18: Prozentsatz von Glycin pro Polypeptid; Dimension 19: Prozentsatz von Histidin pro Polypeptid; Dimension 20: Prozentsatz von Isoleucin pro Polypeptid; Dimension 21 : Prozentsatz von Asparagin pro Polypeptid; Dimension 22: Prozentsatz von Glutamin pro Polypeptid; Dimension 23: Prozentsatz von
Arginin pro Polypeptid; Dimension 24: Prozentsatz von Serin pro Polypeptid; Dimension 25: Prozentsatz von Threonin pro Polypeptid; Dimension 26: Prozentsatz von nichtkanonischer Aminosäure pro Polypeptid; Dimension 27: Prozentsatz von Valin pro Polypeptid; Dimension 28: Prozentsatz von Tryptophan pro Polypeptid; Dimension 29: Prozentsatz von Tyrosin pro
Polypeptid; Dimension 30: Cysteingehalt; Dimension 31 : Prozentsatz geknäuelter Sekundärstruktur pro Polypeptid; Dimension 32: Prozentsatz helikaler Sekundärstruktur pro Polypeptid; Dimension 33: Prozentsatz zufälliger Sekundärstruktur pro Polypeptid; Dimension 34: Wert für die Struktur um die N- Terminus-Spaltstelle; Dimension 35: Wert für die Struktur um die C-Terminus- Spaltstelle; Dimension 36: Anzahl der helikalen Blöcke pro Polypeptid; Dimension 37: Isoelektrischer Punkt des Polypeptids; Dimension 38:
Durchschnittliche Molekülmasse des Polypeptids; Dimension 39: Summe der Van-der-Waals-Kräfte jeder Aminosäure innerhalb des Polypeptids; Dimension 40: Summe der Hydrophobiewerte jeder Aminosäure innerhalb des Polypeptids; Dimension 41-48: Mittlere Werte berechnet basierend auf den grundlegenden Komponentenwertvektoren der hydrophoben, sterischen und elektronischen
Eigenschaften pro Polypeptid; Dimension 49: Länge des Polypeptids.
3. Verfahren nach Anspruch 1 und 2, wobei die Proteinsequenzen aus Schritt b) nur natürlich vorkommende Proteinsequenzen sind, die sich im humanen Sekretom finden.
4. Verfahren nach Anspruch 1 bis 3, wobei die bioaktiven Peptide bioaktive Peptidhormone abgeleitet aus Vorläuferhormonen sind.
5. Bioaktives Peptid ausgewählt aus dem humanen Sekretom durch Verwendung der Verfahren nach Anspruch 1 und 2.
6. Bioaktives Peptid nach Anspruch 5, wobei das bioaktive Peptid ein bioaktives Peptidhormon ist.
7. Bioaktives Peptid nach Anspruch 6, wobei das bioaktive Peptidhormon von einem Vorläuferprotein abgeleitet ist.
8. Bioaktives Peptid nach Anspruch 5 bis 7, welches eine Sequenz ausgewählt aus der Gruppe bestehend aus den Aminosäuresequenzen der SEQ. ID. NR. 1 ,
2, 3, 4, 5, 6, 7, 8, 9, 10, 11 , 12, 13, 14, 15, 16, 17, 18, 19, 20, 21 , 22, 23, 24, 25, 26, 27, 28, 29, 30, 31 , 32, 33, 34, 35, 36, 37, 38, 39, 40, 41 , 42, 43, 44, 45, 46, 47, 48, 49, 50, 51 , 52, 53, 54, 55, 56, 57, 58, 59, 60, 61 , 62, 63, 64, 65, 66, 67, 68, 69, 70, 71 , 72, 73, 74, 75, 76, 77, 78, 79, 80, 81 , 82, 83, 84, 85, 86, 87, 88, 89, 90, 91 , 92, 93, 94, 95, 96, 97, 98, 99, 100, 101 , 102, 103, 104, 105, 106,
107, 108, 109, 110, 111 , 112, 113, 114, 115, 116, 117, 118, 119, 120, 121 , 122, 123, 124, 125, 126, 127, 128, 129, 130, 131 , 132, 133, 134, 135, 136, 137, 138, 139, 140, 141 , 142, 143, 144, 145, 146, 147, 148, 149, 150, 151 , 152, 153, 154, 155, 156, 157, 158, 159, 160, 161 , 162, 163, 164, 165, 166, 167, 168, 169, 170, 171 , 172, 173, 174, 175, 176, 177, 178, 179, 180, 181 , 182, 183, 184, 185 aufweist.
9. Peptidbibliothek, welche bioaktive Peptide identifiziert durch die Verfahren nach Anspruch 1 bis 3 umfasst.
10. Peptidbibliothek nach Anspruch 9, wobei die Peptidbibliothek bioaktive Peptide nach Anspruch 8 umfasst.
11. Peptidbibliothek nach Anspruch 9, wobei die bioaktiven Peptide bioaktive Peptidhormone sind.
12. Peptidbibliothek nach Anspruch 11 , wobei die bioaktiven Peptidhormone von Vorläuferproteinen abgeleitet sind.
13. Rechentechnisches Gerät konfiguriert zum Identifizieren bioaktiver Peptide durch Verwendung eines Verfahrens basierend auf einer binären Support- Vektor-Maschine (SVM), wobei das Verfahren folgende Schritte umfasst:
a) das Trainieren eines SVM-Algorithmus zu lernen, zwischen bioaktiven und nicht-bioaktiven Peptiden zu unterscheiden, wobei das Trainieren folgende Schritte umfasst:
a-i) das Erzeugen von Vektoren mit 49 Dimensionen, wobei jede Dimension aus der Berechnung eines Molekulardeskriptorwertes für einen Satz markierter bekannter bioaktiver und markierter bekannter nichtbioaktiver Peptide resultiert, wobei die Markierungen anzeigen, ob das Peptid bioaktiv bzw. nicht-bioaktiv ist;
a2) das Übertragen der Vektordaten erzeugt in Schritt a-i) an den SVM- basierten Algorithmus, wobei der Algorithmus die optimale Hyperebene berechnet, welche die Vektoren trennt, die den bioaktiven Peptiden bzw. den nicht-bioaktiven Peptiden entsprechen;
b) das Bereitstellen von Proteinsequenzen aus einer öffentlich erhältlichen humanen Proteindatenbank;
c) das Vorhersagen der sekundären Struktur und Spaltstellen innerhalb einer Proteinsequenz bereitgestellt in Schritt b) unter Verwendung rechentechnischer Verfahren; ein Satz von 7 Molekulardeskriptoren wird basierend auf dem Vorhersageschritt berechnet, was in der Erzeugung von Peptidfragmenten resultiert;
d) das Berechnen eines Satzes von 42 Molekulardeskriptoren, welche den physikalisch-chemischen Eigenschaften der Peptidfragmente erzeugt in
Schritt c) entsprechen;
e) das Umwandeln der berechneten Werte aus Schritt c) in skalierte Werte zwischen 0 und 1 zum Erzeugen der Dimensionen 1 bis 7 eines 49- Dimensionen-Vektors für jedes Peptidfragment und das Umwandeln der berechneten Werte aus Schritt d) in skalierte Werte zwischen 0 und 1 zum Erzeugen der Dimensionen 8 bis 49 des Vektors für jedes Peptidfragment;
f) das Präsentieren der in Schritt e) erzeugten Vektoren an den trainierten SVM-Algorithmus aus Schritt a) zum Messen der Distanz jedes Vektors zu der Hyperebene berechnet in Schritt 82); und
g) das Klassifizieren jedes Peptidfragmentes als bioaktives Peptid oder nichtbioaktives Peptid gemäß der in Schritt f) gemessenen Distanz.
14. Verwendung des Verfahrens nach Anspruch 1 bis 4 zum Identifizieren von therapeutischen Polypeptiden, Zielen für die Arzneimittelintervention, Liganden zum Entdecken relevanter Ziele oder Biomarkem zum Überwachen von Krankheiten.
15. Verwendung der Peptidbibliothek nach Anspruch 9 bis 12 bei einem Screening- Ansatz zum Untersuchen intrazellulärer Signalgebungswege, zum Erzeugen von Reagenzien zum Unterstützen des Verständnisses eines Weges, zum Erzeugen neuartiger Therapieformen und zum Identifizieren von pharmazeutisch aktiven Verbindungen, Zielen für die Arzneimittelintervention,
Liganden zum Entdecken relevanter Ziele oder Biomarkem zum Überwachen von Krankheiten.
16. Pharmazeutische Zusammensetzung, welche ein bioaktives Peptid umfasst, welches eine Sequenz ausgewählt aus der Gruppe bestehend aus den Aminosäuresequenzen der SEQ. ID. NR. 1 bis 185 als bioaktives Agens aufweist.
EP08716206A 2007-03-13 2008-03-04 Verfahren für das erzeugen von peptidbibliotheken und deren verwendung Withdrawn EP2137658A2 (de)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
DE102007011912A DE102007011912A1 (de) 2007-03-13 2007-03-13 Verfahren für das Erzeugen von Peptidbibliotheken und deren Verwendung
PCT/EP2008/001687 WO2008110282A2 (de) 2007-03-13 2008-03-04 Verfahren für das erzeugen von peptidbibliotheken und deren verwendung

Publications (1)

Publication Number Publication Date
EP2137658A2 true EP2137658A2 (de) 2009-12-30

Family

ID=39651234

Family Applications (1)

Application Number Title Priority Date Filing Date
EP08716206A Withdrawn EP2137658A2 (de) 2007-03-13 2008-03-04 Verfahren für das erzeugen von peptidbibliotheken und deren verwendung

Country Status (16)

Country Link
US (1) US20100234246A1 (de)
EP (1) EP2137658A2 (de)
JP (1) JP5371786B2 (de)
KR (1) KR20090127922A (de)
CN (1) CN101663668B (de)
AR (1) AR065684A1 (de)
AU (1) AU2008226098B2 (de)
BR (1) BRPI0808855A2 (de)
CA (1) CA2680766A1 (de)
DE (1) DE102007011912A1 (de)
IL (1) IL200788A0 (de)
MX (1) MX2009009566A (de)
MY (1) MY151453A (de)
SG (1) SG173343A1 (de)
TW (1) TW200903292A (de)
WO (1) WO2008110282A2 (de)

Families Citing this family (15)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
WO2013143026A1 (en) * 2012-03-31 2013-10-03 Abmart (Shanghai) Co., Ltd Peptide and antibody libraries and uses thereof
EP3246434A1 (de) * 2015-01-13 2017-11-22 Ewha University-Industry Collaboration Foundation Verfahren zur erstellung einer neuartigen antikörperbibliothek und damit erstellte bibliothek
CN106155298B (zh) * 2015-04-21 2019-11-08 阿里巴巴集团控股有限公司 人机识别方法及装置、行为特征数据的采集方法及装置
US9595002B2 (en) 2015-05-29 2017-03-14 Sas Institute Inc. Normalizing electronic communications using a vector having a repeating substring as input for a neural network
US9704097B2 (en) 2015-05-29 2017-07-11 Sas Institute Inc. Automatically constructing training sets for electronic sentiment analysis
US20160350652A1 (en) * 2015-05-29 2016-12-01 North Carolina State University Determining edit operations for normalizing electronic communications using a neural network
US9552547B2 (en) 2015-05-29 2017-01-24 Sas Institute Inc. Normalizing electronic communications using a neural-network normalizer and a neural-network flagger
CN106529204B (zh) * 2016-10-18 2019-05-07 中国科学院计算技术研究所 一种基于半监督学习的交联质谱多谱排序方法
US10515715B1 (en) 2019-06-25 2019-12-24 Colgate-Palmolive Company Systems and methods for evaluating compositions
EP3855183A1 (de) * 2020-01-24 2021-07-28 Enterome S.A. Identifizierung und synthese von arzneimittelkandidaten, die von menschlichen mikrobiom-metasekretom-proteinen abgeleitet sind
JP7422591B2 (ja) * 2020-03-31 2024-01-26 株式会社カネカ 対象分子中のアルギニン残基のプロテアーゼ耐性予測方法、及びこれを用いたプロテアーゼ耐性分子の合成方法、並びに、対象分子中のアルギニン残基の、プロテアーゼ耐性予測装置及びプロテアーゼ耐性予測プログラム
US20230245722A1 (en) * 2020-06-04 2023-08-03 California Institute Of Technology Systems and methods for generating a signal peptide amino acid sequence using deep learning
CN112951341B (zh) * 2021-03-15 2024-04-30 江南大学 一种基于复杂网络的多肽分类方法
CN113782114B (zh) * 2021-09-17 2024-02-09 北京航空航天大学 一种基于机器学习的寡肽药先导物的自动挖掘方法
US20240143969A1 (en) * 2022-10-31 2024-05-02 International Business Machines Corporation Formulation graph convolution networks (f-gcn) for predicting performance of formulated products

Family Cites Families (9)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US6587845B1 (en) * 2000-02-15 2003-07-01 Benjamin B. Braunheim Method and apparatus for identification and optimization of bioactive compounds using a neural network
US6759510B1 (en) * 2000-06-30 2004-07-06 Becton, Dickinson And Company Peptides for use in culture media
EP1444235B1 (de) * 2001-10-12 2008-06-11 Choongwae Pharma Corporation Reverse-turn-mimetika und diese betreffendes verfahren
CA2491737A1 (en) * 2002-07-10 2004-01-22 Cryptome Pharmaceuticals Ltd Method for detection of bioactive peptides
JP3566277B1 (ja) * 2003-06-23 2004-09-15 株式会社日立製作所 血糖値測定装置
EP2434420A3 (de) * 2003-08-01 2012-07-25 Dna Twopointo Inc. Systeme und Verfahren zur Herstellung von Biopolymeren
DE10343690A1 (de) * 2003-09-18 2005-04-21 Caesar Stiftung Verfahren zur Bestimmung optimierter Oligomere
EP1687627A4 (de) * 2003-10-14 2010-01-27 Verseon System zur vorhersage und optimierung der kreuzreaktion von leitmolekülen
JP4845080B2 (ja) * 2004-10-29 2011-12-28 独立行政法人産業技術総合研究所 活性化g蛋白質予測装置、プログラムおよび方法

Non-Patent Citations (1)

* Cited by examiner, † Cited by third party
Title
See references of WO2008110282A2 *

Also Published As

Publication number Publication date
CA2680766A1 (en) 2008-09-18
AR065684A1 (es) 2009-06-24
JP2010522368A (ja) 2010-07-01
WO2008110282A3 (de) 2009-08-27
WO2008110282A2 (de) 2008-09-18
US20100234246A1 (en) 2010-09-16
KR20090127922A (ko) 2009-12-14
CN101663668B (zh) 2014-04-02
DE102007011912A1 (de) 2008-09-18
CN101663668A (zh) 2010-03-03
IL200788A0 (en) 2010-05-17
MY151453A (en) 2014-05-30
AU2008226098B2 (en) 2012-08-16
AU2008226098A1 (en) 2008-09-18
JP5371786B2 (ja) 2013-12-18
SG173343A1 (en) 2011-08-29
TW200903292A (en) 2009-01-16
MX2009009566A (es) 2009-09-16
BRPI0808855A2 (pt) 2014-09-09

Similar Documents

Publication Publication Date Title
EP2137658A2 (de) Verfahren für das erzeugen von peptidbibliotheken und deren verwendung
Robles-Loaiza et al. Traditional and computational screening of non-toxic peptides and approaches to improving selectivity
Himaya et al. Venomics-accelerated cone snail venom peptide discovery
US20220009966A1 (en) Artificial intelligence designed antimicrobial peptides
Ruan et al. Structural titration of receptor ion channel GLIC gating by HS-AFM
Mititelu et al. Development of immediate release tablets containing calcium lactate synthetized from Black Sea mussel shells
Cumming et al. Isolation and characterisation of major and minor collagens from hyaline cartilage of hoki (Macruronus novaezelandiae)
DE602005004902T2 (de) Künstliches Protein, Verfahren für absolute Quantifizierung der Proteine und seine Benutzung
DE69932712T2 (de) Vorhersage über die rezeptor-modulierende wirkung von verbindungen
Horvath et al. Amyloids of α-synuclein promote chemical transformations of neuronal cell metabolites
Browne et al. Modelling quantitative structure–activity relationships between animal behaviour and environmental signal molecules
Zuev et al. Underused marine resources: sudden properties of cod skin gelatin gel
Rogozhin et al. Characterization of hydroxyproline-containing hairpin-like antimicrobial peptide EcAMP1-Hyp from barnyard grass (Echinochloa crusgalli L.) seeds: Structural identification and comparative analysis of antifungal activity
Biskupek et al. Prediction of aggregation of biologically-active peptides with the UNRES coarse-grained model
Darie-Ion et al. A proteomic approach to identify zein proteins upon eco-friendly ultrasound-based extraction
Qin et al. Sequence–Activity Relationship of Angiotensin-Converting Enzyme Inhibitory Peptides Derived from Food Proteins, Based on a New Deep Learning Model
Mao et al. Structural identification and antioxidant activity of loach protein enzymatic hydrolysates
Tyagi et al. Tripleurin XIIc: Peptide folding dynamics in aqueous and hydrophobic environment mimic using accelerated molecular dynamics
Bak et al. Towards intelligent drug design system: Application of artificial dipeptide receptor library in QSAR-oriented studies
Sivakova et al. Label-free quantitative phosphoproteomics of the fission yeast Schizosaccharomyces pombe using strong anion exchange-and porous graphitic carbon-based fractionation strategies
Jitaru et al. A diphenylalanine based pentapeptide with fibrillating self-assembling properties
Wang et al. Proteomic Identification and Characterization of Collagen from Bactrian Camel (Camelus bactrianus) Hoof
Al Musaimi et al. Bypassing osmotic shock dilemma in a polystyrene resin using the green solvent cyclopentyl methyl ether (cpme): A morphological perspective
Liao et al. Molecular diversity of peptide toxins in the venom of spider Heteropoda pingtungensis as revealed by cDNA library and transcriptome sequencing analysis
Kumarevel et al. Analysis of hydrophobic and charged patches and influence of medium-and long-range interactions in molecular chaperones

Legal Events

Date Code Title Description
PUAI Public reference made under article 153(3) epc to a published international application that has entered the european phase

Free format text: ORIGINAL CODE: 0009012

17P Request for examination filed

Effective date: 20090904

AK Designated contracting states

Kind code of ref document: A2

Designated state(s): AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC MT NL NO PL PT RO SE SI SK TR

17Q First examination report despatched

Effective date: 20100122

RBV Designated contracting states (corrected)

Designated state(s): AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC MT NL NO PL PT RO SE SI SK TR

DAX Request for extension of the european patent (deleted)
RAP1 Party data changed (applicant data changed or rights of an application transferred)

Owner name: SANOFI

RAP1 Party data changed (applicant data changed or rights of an application transferred)

Owner name: SANOFI

RAP1 Party data changed (applicant data changed or rights of an application transferred)

Owner name: SANOFI

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE APPLICATION HAS BEEN WITHDRAWN

18W Application withdrawn

Effective date: 20140311