EP1259817A2 - Computerbasierte analyse der dreidimensionalen strukturen von glykoanteilen - Google Patents
Computerbasierte analyse der dreidimensionalen strukturen von glykoanteilenInfo
- Publication number
- EP1259817A2 EP1259817A2 EP00983063A EP00983063A EP1259817A2 EP 1259817 A2 EP1259817 A2 EP 1259817A2 EP 00983063 A EP00983063 A EP 00983063A EP 00983063 A EP00983063 A EP 00983063A EP 1259817 A2 EP1259817 A2 EP 1259817A2
- Authority
- EP
- European Patent Office
- Prior art keywords
- protein
- database
- glycolysis
- partial sequences
- glycan
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Withdrawn
Links
Classifications
-
- G—PHYSICS
- G16—INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
- G16B—BIOINFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR GENETIC OR PROTEIN-RELATED DATA PROCESSING IN COMPUTATIONAL MOLECULAR BIOLOGY
- G16B15/00—ICT specially adapted for analysing two-dimensional [2D] or three-dimensional [3D] molecular structures, e.g. structural or functional relations or structure alignment
Definitions
- the invention relates to a computer-based method for automatic virtual analysis of the three-dimensional structure of the glyco portion of glycoproteins and glycolipids and for generating an ensemble of realistic conformations of specific N- and O-glycans on proteins and lipids with the aid of a computer system.
- glycosylation - the covalent linkage of glycan structures (sugars) at certain points on the protein - are the most common changes.
- About 70% of all known proteins have a potential glycosylation site due to their amino acid sequence.
- the glycosylation pattern of a protein which can vary from cell type to cell type, gives the proteins different physicochemical properties on their surface, which in turn can have a decisive influence on their transport properties and their biological function.
- the building blocks of glycans are saccharides (sugar), which have completely different chemical and structural properties than amino acids.
- saccharides sucgar
- the formation of certain folding patterns, which can be classified in the form of secondary or tertiary structures has hitherto been unknown.
- the small amount of experimentally available glycans does not allow a comparable procedure as with the knowledge-based approach outlined above for the proteins.
- the creation of appropriate databases of glycan structures, which are derived using various computational methods is a crucial prerequisite for the implementation of the algorithms.
- the algorithms for deriving the spatial structure of "pure" proteins can therefore not be applied to the calculation of the glyco content.
- X-ray analysis has proven itself in practice.
- the problem is that a large part of the proteins, such as enzymes, antibodies, hormones, cytokines and receptor proteins, are glycolized, which means that single crystals, which are necessary for the experimental determination of the three-dimensional structure of the proteins and lipids by means of X-ray structure analysis, can be obtained due to the high mobility of the sugar content is difficult and often even impossible. Even if the crystallization was successful, the glyco content can often not be fully determined due to the lack of electron density. For this reason, proteins and lipids of this type are usually produced recombinantly without any sugar content, since they crystallize much better in the non-glycosylated form.
- the sugar content can also be important for the effects of proteins and lipids.
- the pancreatic enzyme ribonuclease B from calves which has a glycosylation site, is at least three times as active as the unglycolized variant ribonuclease A.
- the invention is based on the one hand the task of a computer-based process for virtual analysis of the three-dimensional Structure of the glycosylation of glycoproteins and glycolipids, which allows to get information about possible glycosylation sites and - in advanced training - information about the glycosylated saccharide fragments at the glycosylation sites without the time-consuming or even impossible growth of single crystals of the glycosylated proteins and lipids.
- the object is achieved by a computer-based procedure for the automatic virtual analysis of the glyco portion of glycoproteins and glycolipids, in which, after reading in the amino acid sequence and the three-dimensional structure of the non-glycolized protein or lipid to be examined, partial sequences of the amino acid sequences representing the possible glycolysis sites are selected and taken into account their spatial position in the protein / lipid are analyzed, whereupon those selected partial sequences are marked on which, for geological reasons, glycolization is possible. If this procedure usually leads to success for N-glycolysis sites, additional criteria must be used for potential O-glycolysis sites.
- the Ser and Thr residues exposed on the surface of the protein are selected and a number of physicochemical parameters (hydrophobicity, charge distribution, volume of the neighboring amino acids, secondary structure) are used as further criteria for evaluation.
- the amino acids representing potential glycosylation sites are marked, whereupon all partial sequences and residues representing potential glycosylation sites are finally output.
- the invention even allows the precise spatial arrangement of the glycans on the glycolized protein / lipid to be determined, for which purpose a computer system is used which is based on a confirmation database with configurations of saccharide components which occur in N- and O-glycans and in glycolipids , can be accessed, and whereby three-dimensional structures of possible glycose components are retrieved from the conformation database and in each case a retrieved technique is linked to a marked potential glycosylation site, whereupon the result is output.
- the invention therefore goes a completely new way in which it does not attempt to analyze existing structures, but rather checks which structures may be present at all. In other words, it solves the problem inverse to analysis.
- the process can run fully automatically.
- the procedure is such that after all partial sequences and residues representing potential potential glycolization sites have been output, the user is asked which of several possible types of glycolysis agent is to be used at which potential glycolysis site, and then the three-dimensional structure corresponding to the selected glycolization site type retrieved from the conformation database and linked to the respective glycolysis center and output.
- This has the advantage that the user does not have to look at a large number of possible glycolized proteins / lipids, but can influence at an early stage which form of glycolization should be chosen.
- the user can e.g. a selection of different N-glycans, O-glycans or a mixture of different clearly defined N- or O-glycans are displayed, after which he determines the type of glycolysis agent to be used for each glycolysis site. It can also be provided that the user has general information about the type of N-glycan - such as manna rich, niantennary, containing tenninal sialic acid - can enter.
- the method can be carried out in such a way that the bond lengths and bond angles to be used in the automatic linking of the three-dimensional structure of the glyco portion and the glycolysis site are individually entered.
- it has proven to be particularly expedient and quick if standardized bond lengths and bond angles are used without this leading to disadvantageous results.
- the confomiation space of each linking site is automatically scanned by calculating the Van der Waals interaction between protein / lipid and glycosylation.
- the glycolized protein / lipid can then additionally be '' minimized '' and 'output' using a complete force field, whereby under the term 'minimize' the forces acting between the individual atoms are minimized, i.e.
- output is understood to mean any type of output, for example displaying the generated three-dimensional structure on an image screen, outputting the technique using a printer or reading out the generated one Drawing in the form of a file describing the drawing.
- output in addition to the structure, further geometric and energetic parameters can also be output, in particular displayed or saved in a common file.
- the force field calculations mentioned serve to optimize certain or preferably all degrees of freedom (bond lengths, bond angle, torsion angle, non-binding interactions) of the consumed molecules, for which purpose a force field is used which has been parameterized for the respective degrees of freedom.
- a criterion for achieving an optimized structure e.g. B. the calculated energy contents of the current iteration step are compared with the energy values of the previous steps. It can e.g. For example, it can be provided that the optimization is ended when the difference between the energy inputs and the previous steps falls below a predetermined threshold (convergence criteria).
- the result of the linkages that is to say the generated technology of the glycoprotein / glycolipid, can be automatically subjected to a surgical refinement operation, in particular a molecular dynamic or Monte Carlo simulation, as a three-dimensional starting structure.
- the invention is also based on the object of developing a method for generating an ensemble of realistic conformations of specific N- and / or O-glycans on proteins and lipids with the aid of a computer system, which is based on a conformational database with configurations of saccharides which are in N- or O- Glycans occur, can access, specify.
- step h check whether geometric overlaps occur either with the protein / lipid or other parts of the N-glycan during the linking according to step h), and storage of the structures without overlap
- the task is solved by a procedure with the following steps: a) reading in the amino acid sequence and the three-dimensional structure of a non-glycolized protein,
- the ensemble obtained in both cases can expediently be sorted, e.g. by calculating the energy content of all glycoproteins / glycolipids obtained and using them as a criterion for sorting. Once the energy intial has been calculated, structures that are unlikely to occur due to the particularly high energy content can be automatically rejected.
- information about the amino acid sequence is first given entered the 3D coordinates of the protein to be glycolized as well as information about the type of glycolization per potential glycosylation site.
- the latter information can be: specification of a specific N- or O-glycan, specification of a mixture consisting of various clearly defined N- or O-glycans, general information about the type of N-glycan, such as mannose rich, triantenary, with terminal sialic acid.
- the method finds all potential N-glycosylation sites on the amino acid sequence (clear motif Asn-X-Ser / Thr where X can be any amino acid except Pro, more rarely Asn-X-Cys), and then checks whether due to the spatial location the sequence within the protein (on the surface or inside the protein) a glycolysis is possible for geometric reasons.
- every single amino acid threonine and serine represents a potential O-glycolysis site.
- O-glycolysis is carried out in a post-translational process after N-glycolysis, an exposed position of the amino acids on the protein surface is an essential condition for an actual one O-glycolysis took place. All Ser and Thr residues not exposed on the surface are therefore ruled out.
- the surface accessibility can be determined, for example, using a fast algorithm that is based on the Conolly algorithm for calculating molecular surfaces.
- the hydrophobic and hydrophilic properties of the spatially adjacent amino acids are considered as a further criterion for the decision. If, due to the sequence, the geometric condition and certain surface properties, glycolysis sites were found, these will be reported.
- the process now asks whether the respective positions are to be glycosylated and, if glycosylating is to be carried out, calls up the information which has already been entered about the structure of the glyco portion.
- the information about the type of glycolysis rank can only be entered now (N- or O-glycan, mixture or general information about N-glycan - see above).
- the 3D structures of the glycose components are extracted in accordance with the specifications from a database which contains the 3D structures of a multiplicity of N- and O-glycans which are optimized in a force field and then sorted according to the criteria according to the criteria and with the previously determined glycosylation sites of the protein linked. Standardized tie lengths and angles are assumed for the new tie to be tied. Subsequently, the connonnational space at the linkage point is systematically scanned by calculating the van der Waals interactions between the protein and the glycose fraction. The entire glycoprotein is then minimized by geometrical and energetic optimization using a complete force field calculation and taking into account all possible degrees of freedom.
- the process creates a realistic 3D stem from the set of all possible configurations. This can be used as a starting structure for subsequent refinement (such as molecular Dynaticiank, Monte Carlo or other simulations).
- the database used in the process was compiled as follows: Since the protein-containing scaffold of all N-glycans shows only a small variability, an intensive search for literature was carried out for this partial atmosphere with the aim of capturing all described configurations and then evaluating them energetically. In addition, a systematic search for conformation for this part of the structure was carried out as described below.
- the N- and O-glycans contained in the database were first broken down into disaccharides.
- the conformational space around the glycosidic bonds was systematically scanned for each disaccharide.
- the global mirum and all found conformations, which represent a local minimum below a certain energetic threshold value on the energy hypersurface, were stored in a database.
- the tetrasaccharides were then obtained by completely combining the configuration of the trisaccharides with the respective disaccharides.
- the tetrasaccharides were again stored in a database.
- Conformations that cannot be overlapped are rejected.
- the techniques generated in this way are initialised and used for further consumption via a complete force field calculation.
- O-glycans are usually no larger than T ⁇ or tetrasaccharides. They can therefore be constructed directly from the conformations stored in the corresponding database. The further processing is then identical to the procedure for N-glycans.
- the generated structure together with its functional, geometric and energetic parameters are stored in the format of an ASCII file, so that the data can be easily imported into a database system.
- the invention is therefore based on the principle that the spatial structure of glycoproteins as well as glycolipids can be constructed very simply with the same principle.
- One aspect of the invention is the virtual analysis of the linkages of a specific protein with its glyco portion, another aspect is the rapid generation of the three-dimensional structure and the analysis of the spatial diversity of the glycan-stinkirs, whereby in the case of glycolipids the analysis of the linkage site can be dispensed with, since this is clear. Otherwise, the conformative diversity of the glyco portion of glycolipids is analyzed in the same way as for N- and O-glycans of glycoproteins.
- N-glycolized proteins In general, a distinction is made between glycoproteins between N- and O-linked glycans.
- the detection of N-glycolized proteins takes place via an asparagine residue (Asn) and is characterized on the sequence level by the sequence pattern Asn-X-Ser / Thr. This information, together with the condition that the Asn residue must be exposed on the surface, are sufficient criteria to recognize N-glycolysis sites.
- the spatial structures of the prototype are assumed to be known.
- a further criterion for potential O-glycolysis sites is that only those Ser / Thr residues are accepted that are easily accessible on the protein surface, so that the sugar to be linked also has enough space to be bonded.
- These two criteria have their counterpart in the observation, derived from pure sequence data, that, as a rule, the hydrophobicity for O-glycol sighting sites of the directly adjacent residues is lower than for non-glycolized Ser / Thr residues.
- glycolized sequences show a high preference for turn areas over alpha-helical and beta-sheet areas.
- the purely geometrical properties of the protein surface are first evaluated (accessibility of the Ser / Thr residues and the possibility of being able to fit the sugar to be linked without steric hindrances). Hydrophobicity, charge distributions and the secondary structures taken up by proteins in close proximity to the Ser / Thr residues under consideration are then to be mentioned as further criteria for the decision.
- the dermal structure of the protein / lipid and the dermal position of the selected binding site are assumed to be known.
- the analysis on the protein side relates - as already explained in more detail above - to the surface exposure on the corresponding amino acids and the physicochemical properties of the surface in the vicinity of the glycolysis site.
- N and O glycans When setting a realistic configuration at the point of connection between the protein and the glyco portion, a distinction must be made between N and O glycans.
- Four torsion angles (ci, C 2 , F N , Y N ) have to be considered for N-glycans, which can populate a limited confonnational space.
- the linking algorithm sets the torsion angles one after the other with decreasing priority (according to the experimentally found frequencies). For each possible linkage, it is checked whether there is a spatial overlap of the volumes of individual atoms of the glyco portion with the protein. If this is the case, this orientation is rejected. All geometrically meaningful links are geometrically optimized with a complete force field calculation and the most favorable connotations of their energy are saved for further consumption.
- This procedure of systematically scanning the confnational space corresponds to the method used for the generation of a complete set of all possible conformations of di-, tri-, tetra- and penta-saccharides, which is described in the flow diagram in purple.
- the first step is to call up the information stored for sequence A - B (module 1) from the database for disaccharides.
- This will generally be the core region to be linked to the protein / lipid, the method for linking the core region to the protein / lipid having already been described.
- an overall frequency of the glycans to be analyzed is thus built up from smaller building blocks, the connective diversity of which is stored in the form of di-, tri-, tetra- or pentasaccharides in the corresponding databases.
- the methods for generating a complete set of all possible conformations of di-, tri-, teua- or pentasaccharides are shown in the flowcharts DJa and Illb.
- the analysis of the total frequency is carried out in such a way that the last residual of the part of the total sequence already consulted is identical to the first residual of the part to be linked.
- the choice of the size of the blocks used depends on the topology of the region in question in the area.
- the test is carried out to determine whether there are geometric overlaps with the protein / lipid or other parts of the N-glycan by measuring the distances. If an atom of the glycan to be linked is within the van der Waals radius of another atom, a geometric overlap occurs.
- a complete topological molecular description (amino acid sequence, glycolysis sites, sequence and linkage of the monosaccharides, relevant torsion angles of the linkage point and the glycans, linkage table of the atoms, type of atoms, Cartesian atomic type, atomic charge, and partial charges) is made for each consulted configuration. output.
- the total energy content of the generated configurations serves as a criterion for the order of the output.
- a protocol can be output about the individual steps of the consecration and the geometric optimization, which allows the user to carry out the procedure throughout the entire process.
- the molecular dynamics method in which the movements of the atoms within a molecular ensemble are simulated by integrating Newtonian equations of motion for each individual atom, is also suitable for scanning the confonnational space of larger molecules. Force fields are used to describe the forces acting between the atoms. Since the integration steps have to be very short (in the range of 10 "15 seconds) due to the speed of individual movements within the molecule, it can be expedient to expand simulations at room temperatures so that actually all conformations popular in reality also during the simulation For this purpose, the temperature can be increased during the simulation to such an extent that energy batteries which the individual configurations are in contact with each other can be exceeded more quickly. However, by selecting the simulation conditions, it must be ensured that all relevant areas of the configuration space are actually used The method is particularly suitable for the generation of databases for tetra- and pentasaccharides.
- so-called “genetic algorithms” can also be used to generate the databases, typically a certain number of configurations of the glycans to be investigated being generated and together with possible variable variables such as torsi angles, binding angles etc. can be saved. The configurations are then changed by applying certain functions with specific parameters to them and thus finding a new set of solutions which is then used as the starting point for the next iteration step.
- Concepts from genetics (mutation, cross over, fitness) are usually used to describe the conformational variety that is generated.
- a ranking of the structures found is carried out by calculating their van der Waals interactions (the EVDW routine of the MM2_85 program is used).
- the following table lists the torsion angles of the ten best structures with increasing energy contents that were found for the Glykan Man 9 .
- step g) The conformations of the Man 9 are linked to the ASN residues of the indicated glycosylation sites in accordance with the order found in step g) (see also flow chart V).
- the values for the torsion angles ⁇ i, ⁇ 2 , ⁇ . ⁇ known from the literature are used for the orientation of the respective conformation at the protein-glycan junction. If no meaningful link (not overlapping with the protein) can be achieved in this way, the conformational space is systematically scanned for all possible settings of the toss angle ⁇ i, ⁇ 2 , ⁇ N. ⁇ N. If no orientation is sensibly achieved with this method either, the respective conformation is rejected.
- FIG. VI shows the framework of the neuraminidase (left) and the glycan part (right) of the ten best conformations that were found for the Man 9 on the basis of the described procedure.
- Step 2 As already demonstrated in the application example, the N-glycan structures were broken down into meaningful tri-, tetra- and pentasaccharides. About 400 fragments are necessary to generate all known N-glycans.
- Step 3 The SWEET-II program was used to generate three-dimensional structures from the topology of the fragments.
- Step 5 The conformational space populated during the simulation is determined automatically for each glycosidic bond of each fragment. This is an example of the fragment aD-Manp- (l-6) +
- a population map is shown as an example for the a-D-Manp- (l-3) -a-D-Manp linkage in FIG. VII.
- the positions of the maxima and their relative population are determined from this and stored in a table.
- Step 6 For each fragment, the torsion angles found and their relative population are stored in the knowledge base. This information is the basis for the rapid generation of the conformative diversity of the N-glycans. The following table lists the values for the fragment mentioned in step 5.
Landscapes
- Spectroscopy & Molecular Physics (AREA)
- Life Sciences & Earth Sciences (AREA)
- Physics & Mathematics (AREA)
- Bioinformatics & Cheminformatics (AREA)
- Biotechnology (AREA)
- Biophysics (AREA)
- Health & Medical Sciences (AREA)
- Engineering & Computer Science (AREA)
- Chemical & Material Sciences (AREA)
- Bioinformatics & Computational Biology (AREA)
- Crystallography & Structural Chemistry (AREA)
- Evolutionary Biology (AREA)
- General Health & Medical Sciences (AREA)
- Medical Informatics (AREA)
- Theoretical Computer Science (AREA)
- Investigating Or Analysing Biological Materials (AREA)
- Information Retrieval, Db Structures And Fs Structures Therefor (AREA)
Abstract
Bei einem computerbasierten Verfahren zur automatischen virtuellen Analyse der dreidimensionalen Struktur des Glykoanteils von Glykoproteinen und Glykolipiden werden folgende Schritte angewendet: Zuerst wird die Aminosäuresequenz und die dreidimensionale Struktur des zu Untersuchenden nicht glykolisierten Proteins bzw. Lipds eingelesen, dann werden die mögliche Glykolisierungsstellen repräsentierenden Teilsequenzen der Aminosäuren ausgewählt und schliesslich eine Analyse der räumlichen Lage der ausgewählten Teilsequenzen im Protein/Lipid durchgeführt. Letzlich werden diejenigen ausgewählten Teilsequenzen markiert, an denen aus geometrischen Gründen eine Glykolisierung möglich ist und diese markierten potentiellen Glykolisierungsstellen werden ausgegeben.
Description
Computerbasierte Verfahren zur automatischen virtuellen Analyse der dreidimensionalen Struktur des Glykoanteils von Glykoproteinen und Glykolipi- den und zur Erzeugung eines Ensembles realistischer Konformationen spezifischer N- und O-Glykane an Proteinen und Lipiden
Die Erfindung betrifft ein computerbasiertes Verfahren zur automatischen virtuellen Analyse der dreidimensionalen Struktur des Glykoanteils von Glykoproteinen und Glykolipiden und zur Erzeugung eines Ensembles realistischer Konformationen spezifischer N- und O-Glykane an Proteinen und Lipiden mit Hilfe eines Computersystems.
Zur Berechnung der dreidimensionalen Strukturen von Proteinen sind verschiedene algorithmische, auf dem Computer ablaufende Verfaliren bekannt. Keines der bekannten Verfahren befasst sich jedoch mit der Generiemng des Glykoanteils von Glykoproteinen. Als Basis bekannter Verfaliren dient die Aminosäuresequenz des jeweiligen Proteins, seine Zugehörigkeit zu einer bekannten Prote- inklasse zu der mindestens eine experimentelle 3D-Strucktur existiert, sowie Algorithmen und Datenbasen, mittels derer sich innerhalb eines vorgegebenen Faltungsmusters Unterschiede in nicht strukturell konservierten Regionen abschätzen lassen. Diese Methoden kann man als wissensbasiertes Vorgehen charakterisieren, wobei das Wissen auf der Grundlage einer großen Menge an ex- perimentell gelösten Strukturen abgeleitet wird. Diese Verfaliren eignen sich jedoch nicht dazu, den Glykoanteil von Glykoproteinen und Lipiden zu berechnen.
Proteine werden aufgrund der genetischen Information an den Ribosomen erzeugt und setzen sich aus den bekannten zwanzig natürlichen Aminosäuren zusammen. In posttranslationen Schritten erfolgen durch bestimmte Enzyme verschiedene Modifikationen den Proteine, von denen die Glykosilierungen - also die kovalente Verknüpfung von Glykan-Strukturen (Zuckern) an bestimmten Stellen des Proteins - die häufigsten Veränderungen sind. Etwa 70 % aller bekannten Proteine besitzen aufgrund ihrer Aminosäuresequenz eine potentielle Glykosilierungsstelle. Durch das Glykosilienmgsmuster eines Proteins, das von Zelltyp zu Zelltyp variieren kann, erhalten die Proteine unterschiedliche physi- kochemische Eigenschaften auf ihrer Oberfläche, die sowolil ihre Transportei- genschaften also auch ihre biologische Funktion entscheidend beeinflussen können.
Die Bausteine der Glykane sind Saccharide (Zucker), die komplett andere chemische und strukturelle Eigenschaften zeigen als Aminosäuren. Insbesondere ist bisher - im Gegensatz zu den Proteinen - die Ausbildung bestimmter Faltungsmuster, die sich in Fonn von Sekundär- oder Tertiärstrukturen klassifizieren lässt, unbekannt. Darüber hinaus erlaubt die geringe Menge an experimentell verfügbaren Glykanen kein vergleichbares Vorgehen wie bei dem weiter oben skizzierten wissensbasierten Ansatz bei den Proteinen. Aus diesem Grunde stellt die Schaffung von entsprechenden Datenbanken von Glykanstnikturen, die mittels verschiedener rechnerischer Verfaliren abgeleitet werden, eine entscheidende Voraussetzung für die Realisierung der Algorithmen dar. Die Algorithmen, die für die Ableitung der räumlichen Struktur von „reinen" Proteinen
verwendet werden, können daher nicht auf die Berechnung des Glykoanteils übertragen werden.
Weiterhin bekannt ist die Analyse der dreidimensionalen Struktur von Proteinen und Lipiden mittels Röntgenstrukturanalyse und hochauflösender kernmagneti- scher Resonanzspektroskopie (NMR).
Die Röntgenstnikturanalyse hat sich in der Praxis durchaus bewährt. Allerdings bestellt das Problem, dass ein Großteil der Proteine, wie Enzyme, Antikörper, Hormone, Cytokine und Rezeptorproteine glykolisiert sind, was die Gewinnung von Einkristallen, die zur experimentellen Bestimmung der dreidimensionalen StiTiktur der Proteine und Lipide mittels Röntgenstrukturanalyse notwendig sind, aufgrund der hohen Beweglichkeit des Zuckeranteils schwierig und häufig sogar unmöglich macht. Selbst wenn die Kristallisation erfolgreich war, kann der Glykoanteil aufgrund fehlender Elektronendichte oft nicht vollständig bestimmt werden. Deshalb werden derartige Proteine und Lipide meist rekombi- nant ohne Zuckeranteil hergestellt, da sie in nicht glykolisierter Form wesentlich besser kristallisieren.
Nun hat sich aber gezeigt, dass auch der Zuckeranteil für die Wirkung von Proteinen und Lipiden von Bedeutung sein kann. Beispielsweise ist das pankreati- sche Enzym Ribonuklease B aus Kälbern, das eine Glykolisierungsstelle besitzt, wenigstens dreimal so aktiv wie die unglykolisierte Variante Ribonuklease A.
Davon ausgehend liegt der Erfindung zum einen die Aufgabe zugrunde, ein computerbasiertes Verfaliren zur virtuellen Analyse der dreidimensionalen
Struktur des Glykoanteils von Glykoproteinen und Glykolipiden anzugeben, welches es erlaubt, ohne das aufwendige oder gar unmögliche Züchten von Einkristallen der glykolisierten Proteine und Lipide Lifonriationen über mögliche Glykolisierungsstellen und - in Fortbildung - auch Informationen über die an den Glykolisierungsstellen glykolisierten Saccharid-Fragmente zu erhalten.
Die Aufgabe wird gelöst von einem computerbasierten Verfaliren zur automatischen virtuellen Analyse des Glykoanteils von Glykoproteinen und Glykolipiden, bei welchem nach dem Einlesen der Aminosäuresequenz und der dreidimensionalen Struktur des zu untersuchenden nicht-glykolisierten Proteins bzw. Lipids die mögliche Glykolisienmgsstellen repräsentierenden Teilsequenzen der Aminosäuresequenzen ausgewählt und hinsichtlich ihrer räumlichen Lage im Protein/Lipid analysiert werden, worauf diejenigen ausgewählten Teilsequenzen markiert werden, an denen aus geomeüischen Gründen eine Glykoli- sierung möglich ist. Führt dieses Verfaliren für N-Glykolisienmgsstellen in der Regel schon zum Erfolg, so müssen für potentielle O-Glykolisieningsstellen zusätzliche Kriterien herangezogen werden. Aus diesem G nde werden die exponiert auf der Oberfläche des Proteins gelegenen Ser- und Thr-Residuen ausgewählt und eine Reihe von physikochemischen Kenngrößen (Hydrophobi- zität, Ladungsverteilung, Volumen der benachbarten Aminosäuren, Sekundär- Struktur) als weitere Kriterien zur Bewertung herangezogen. Die potentielle Glykolisienmgsstellen repräsentierenden Aminosäuren werden markiert, worauf schließlich alle markierten potentielle Glykolisienmgsstellen repräsentierenden Teilsequenzen und Residuen ausgegeben werden.
Die Erfindung erlaubt also vorteilhaft die Analyse von Proteinen und Lipiden hinsichtlich möglicher Glykolisierungsstellen ohne das aufwendige Züchten von Einkristallen und deren anschließender experimenteller Untersuchung.
In vorteilhafter Weiterbildung erlaubt die Erfindimg sogar, die genaue räumliche Anordnung der Glykane am glykolisierten Protein/Lipid festzustellen, wozu ein Computersystem verwendet wird, das auf eine Konfirmationsdatenbank mit Konfomiationen von Saccharid-Bausteinen, die in N- und O-Glykanen und in Glykolipiden vorkommen, zugreifen kann, und wobei aus der Konformationsdatenbank dreidimensionale Strukturen von möglichen Glykoanteilen abge fen werden und jeweils eine abgerufene Stniküir mit jeweils einer markierten potentiellen Glykolisienmgsstelle verknüpft wird, worauf das Ergebnis ausgegeben wird.
Die Erfindung geht also zur Lösimg des Problems der Analyse der dreidimensionalen Stniküir von Glykoproteinen und Glykolipiden einen gänzlich neuen Weg, in dem sie nicht versucht, vorhandene Strukturen zu analysieren, sondern prüft, welche Struküiren überhaupt vorhanden sein können. Sie löst also quasi das zur Analyse inverse Problem.
Das Verfaliren kann vollautomatisch ablaufen. Bevorzugt wird aber so vorgegangen, dass nach dem Ausgeben aller markierten potentielle Glykoli- sierungsstellen repräsentierenden Teilsequenzen und Residuen eine Abfrage beim Anwender erfolgt, welche von mehreren möglichen Glykolisienmgsarten an welcher potentiellen Glykolisienmgsstelle angewandt werden soll, worauf die der gewählten Glykolisierungsart entsprechende dreidimensionale Struktur
aus der Konformationsdatenbank abgerufen und mit der jeweiligen Glykolisienmgsstelle verknüpft und ausgegeben wird. Dies hat den Vorteil, dass der Anwender nicht eine Vielzahl von möglichen glykolisierten Proteinen/Lipiden betrachten muss, sondern frühzeitig Einfluss darauf nehmen kann, welche Form der Glykolisierung gewählt werden soll.
Bei der Abfrage der anzuwendenden Glykolisienmgsart kann dem Anwender z.B. eine Auswahl verschiedener N-Glykane, O-Glykane oder ein Gemisch aus verschiedenen eindeutig definierten N- oder O-Glykanen angezeigt werden, worauf er für jede Glykolisienmgsstelle die anzuwendende Glykolisienmgsart bestimmt. Auch kann vorgesehen sem, dass der Anwender allgemeine Angaben über die Art des N-Glykans - wie z.B. mannoasereich, niantennär, tenninale Sialinsäure enthaltend - eingeben kann.
Das Verfahren kann so durchgeführt werden, dass die bei der automatischen Verknüpfimg von dreidimensionaler Stniktur des Glykoanteils und Glykoli- sienmgsstelle zu verwendenden Bindungslängen und Bindimgswinkel individuell eingegeben werden. Als besonders zweckmäßig und schnell hat es sich jedoch erwiesen, wenn standardisierte Bindungslängen und Bindungswinkel verwendet werden, ohne dass dies zu nachteiligen Ergebnissen geführt hätte.
Zur Überprüfung der synthetisierten Glykoproteine und -lipide kann vorteilhaft vorgesehen werden, dass nach dem Verknüpfen der Glykoanteile mit den Glykolisienmgsstellen der konfomiationelle Raum jeder Verknüpfiingsstelle durch Berechnung der Van-der-Waals-Wechselwirkung zwischen Protein/Lipid imd Glykoanteil automatisch abgetastet wird. Unter Berücksichtigung der berechne-
ten Wechselwirkung und aller möglichen Freiheitsgrade kann dann zusätzlich noch das glykolisierte Protein/Lipid imter Verwendung eines kompletten Kraftfeldes ''minimiert" und "ausgegeben" werden, wobei liier unter dem Begriff ''Minimieren" das Minimieren der zwischen den einzelnen Atomen wirkenden Kräfte, also eine energetische imd geometrische Optimienmg des glykolisierten Proteins/Lipids mittels Kraftfeldrechnungen und unter dem Begriff "Ausgeben" jedwede Art von Ausgabe verstanden wird, also beispielsweise das Anzeigen der generierten dreidimensionalen Struktur auf einem Bildscliirm, das Ausgeben der Stniküir mittels eines Dmckers oder das Auslesen der generierten Stniktur in Form einer die Stniktur beschreibenden Datei. Vorteilliaft können neben der Struktur auch weitere geometrische imd energetische Kenngrößen ausgegeben, insbesondere angezeigt oder in einer gemeinsamen Datei abgespeichert werden.
Die genannten Kraftfeldrechnungen dienen dabei zur Optimienmg bestimmter oder vorzugsweise aller Freilieitsgrade (Bindungslängen, Bindimgswinkel, Tor- sionswinkel, nicht-bindende Wechselwirkimgen) der konsüiiierten Moleküle, wozu ein Kraftfeld verwendet wird, das für die jeweiligen Freilieitsgrade para- metrisiert wurde. Als Kriterium für das Eneichen einer optimierten Struktur können z. B. die berechneten Energieinhalte des aküiellen Iterationsschritts mit den Energiewerten der vorangehenden Schritte verglichen werden. Es kann z. B. vorgesehen sein, dass die Optimienmg dann beendet wird, wenn die Differenz der Energieinlialte zu den vorangehenden Schritten einen vorbestimmten Schwell wert (Konvergenzkriterimii) unterschreitet.
Das Ergebnis der Verknüpfungen, also die generierte Stniküir des Glyko- proteins/Glykolipids kann als dreidimensionale Ausgangsstraküir automatisch einer Stirikturverfeinerungsoperation, insbesondere einer Molekular-Dynamik- oder Monte-Carlo-Simulation unterzogen werden.
Der Erfindung liegt ferner die Aufgabe zugrunde, ein Verfahren zur Erzeugung eines Ensembles realistischer Konformationen spezifischer N- und/oder O-Glykane an Proteinen imd Lipiden mit Hilfe eines Computersystems, das auf eine Konformationsdatenbank mit Konfonnationen von Sachariden, die in N- oder O-Glykanen vorkommen, zugreifen kann, anzugeben.
Hinsichtlich eines solchen Verfalirens für N-Glykane wird die Aufgabe gelöst von einem Verfaliren mit den folgenden Schritten:
a) Einlesen der Aminosäuresequenz imd der dreidimensionalen Stniküir eines nicht-glykolisierten Proteins,
b) Auswählen der mögliche N-Glykolisienmgsstellen repräsentierenden Teilsequenzen der Aminosäuresequenzen,
c) Analyse der räumlichen Lage der ausgewählten Teilsequenzen im Protein und Markieren derjenigen ausgewählten Teilsequenzen, an denen aus geometrischen Gründen eine Glykolisienmg möglich ist,
d) Abmfen einer in der Datenbank gespeicherten Konformation des Co- re-Bereichs des jeweiligen Glykans und Verknüpfen der Konfonnationen mit den markierten Teilsequenzen,
e) Einstellen einer realistischen Orientienmg an jeder Verknüpfüngsstelle mittels systematischer Rotation um die jeweilige Verknüpfungsstelle,
f) Minimieren jeder Konfonnation, die überlappungsfrei emgepasst werden kann, mittels einer kompletten Kraftfeldrechnung und Abspeichern der mini- mierten Struktur,
g) Wiederholen der Schritte d) bis f) ftir alle weiteren in der Datenbank gespeicherten Konfoniiationen des betrachteten Glykans,
h) Verknüpfen aller entsprechenden in der Datenbank für Di-, Tri-, Tetra und/oder Pentasaccharide abgelegten Koiiformationen mit dem Proteingerüst in der Art, dass immer das letzte Residuum des bereits konsüiiierten Teils der Gesamtsequenz identisch ist mit dem ersten Residuum der zu verknüpfenden Teilstruktur,
i) Prüfen, ob bei der Verknüpfung gemäß Schritt h) geometrische Überschneidungen entweder mit dem Protein/Lipid oder anderen Teilen des N-Glykans auftreten, und Abspeichern der Stniküiren ohne Uberschneidimgen,
j) geometrische Optimienmg der gespeicherten Stniküiren mittels einer kompletten Kraftfeldreclinung und
k) Wiederholen der Schritte h) bis j) bis alle Antennen des vorgegebenen N-Glykans erschöpfend konstruiert sind.
Hinsichtlich eines solchen Verfahrens für O-Glykane wird die Aufgabe gelöst von einem Verfaliren mit den folgenden Schritten:
a) Einlesen der Aminosäuresequenz und der dreidimensionalen Struktur eines nicht-glykolisierten Proteins,
b) Auswählen der exponiert auf der Oberfläche des Proteins gelegenen, mögliche O-Glykolisierungsstellen repräsentierenden Ser- und Thr-Residuen,
c) Analyse der Hydropliilität der zu den ausgewälilten Ser- und Thr-Residuen räumlich benachbarten Aminosäuren des Proteins/Lipids imd Markieren der potentielle O-Glykolisienmgsstellen repräsentierenden Residuen,
d) Abrufen einer in der Datenbank gespeicherten Konfonriation des O-Glykans und Verknüpfen der Konfoimation mit den markierten Teilsequen- zen,
e) Einstellen einer realistischen Orientiemng an jeder Verkriüpfüngsstelle mittels systematischer Rotation um die jeweilige Verknüpfüngsstelle,
f) Minimieren jeder Konfomiation, die überlappimgsfrei eingepasst werden kann, mittels einer kompletten Kraftfeldreclinimg imd Abspeichern der mini- mierten Struktur,
g) Wiederholen der Schritte d) bis f) ftir alle weiteren in der Datenbank gespeicherten Konforaiationen des betrachteten Glykans,
h) Verknüpfen aller entsprechenden in der Datenbank ftir Di-, Tri-, Tefra und/oder Pentasaccharide abgelegten Konfonriationen mit dem Proteingerüst in der Art, dass immer das letzte Residuiun des bereits konsüiiierten Teils der Ge-
samtsequenz identisch ist mit dem ersten Residuum der zu verknüpfenden Teilstruktur,
i) Prüfen, ob bei der Verknüpfung gemäß Schritt h) geometrische Überschneidungen entweder mit dem Protein/Lipid oder anderen Teilen des O-Glykans auftreten, und Abspeichern der Stniküiren ohne Ubersclmeidimgen,
j) geometrische Optimienmg der gespeicherten Strukturen mittels einer kompletten Kraftfeldreclinung imd
k) Wiederholen der Schritte h) bis j) bis alle Antennen des vorgegebenen O-Glykans erschöpfend konstruiert sind.
Die bei beiden Verfaliren erhaltenen Ensemble können zweckmäßigerweise in sich sortiert werden, z.B. dadurch, dass der Energi einhält aller erhaltenen Gly- koproteine/Glykolipide berechnet und als ein Kriterium für eine Sortienmg verwendet wird. Ist der Energieinlialt berechnet worden, so können Stniküiren, deren Vorkommen aufgnmd besonders hoher Energieinhalte unwahrscheinlich ist, automatisch verworfen werden.
Weitere Einzelheiten und Vorteile der Erfindung ergeben sich aus den beigefügten sieben selbsterklärenden Ablaufschemata I, II, III, lila, Illb, IV imd V sowie aus nachfolgender Beschreibung vorteilhafter Durchfühnmgsvarianten erfin- dungsgemäßer Verfaliren.
Zur Generienmg und damit zur Analyse durch viituelle Synthese eines Gly- koproteins werden zunächst Informationen über die Aminosäuresequenz imd
die 3D-Koordinaten des zu glykolisierenden Proteins sowie Angaben über die Art der Glykolisierung pro potentieller Glykosilienmgsstelle eingegeben. Letztere Angaben können sein: Angabe eines spezifischen N- oder O-Glykans, Angabe eines Gemisches bestehend aus verschiedenen eindeutig definierten N- oder O-Glykanen, allgemeine Angaben über die Art des N-Glycans wie etwa mannosereich, triantennär, mit terminaler Sialinsäre.
Das Verfahren findet dann alle potentiellen N-Glykolisierungsstellen aufgnmd der Aminosäuresequenz (eindeutiges Motiv Asn-X-Ser/Thr wobei X jede Aminosäure außer Pro sein kann, seltener Asn-X-Cys), imd prüft sodann, ob auf- grund der räumlichen Lage der Sequenz innerhalb des Proteins (auf der Oberfläche oder im Inneren des Proteins) überhaupt eine Glykolisienmg aus geometrischen Gründen möglich ist.
Jede einzelne Aminosäure Threonin und Serin stellen im Prinzip eine potentielle O-Glykolisienmgsstelle dar. Da jedoch die O-Glykolisiening in einem post-translationalen Prozess nach der N-Glykolisienmg erfolgt, ist eine exponierte Stellung der Aminosäuren auf der Proteinoberfläche eine wesentliche Bedingung für eine tatsächlich erfolgte O-Glykolisienmg. Alle nicht auf der Oberfläche exponierten Ser- und Thr-Residuen werden deshalb durch das Verfaliren ausgeschlossen. Die Oberflächenzugängliclikeit kann z.B. mit einem schnellen Algorithmus ennittelt werden, der sich an dem Algorithmus von Conolly zur Berechnung von Moleküloberflächen anleimt. Als weiteres Kriterium zur Entscheidung werden die hydrophoben imd hydrophilen Eigenschaften der räumlich benachbarten Aminosäuren betrachtet.
Wurden aufgrund der Sequenz, der geometrischen Gegebenheit sowie aufgrund bestimmter Oberflächeneigenschaften Glykolisienmgsstellen gefunden, werden diese mitgeteilt. Das Verfaliren fragt jetzt ab, ob die jeweiligen Stellen glykoli- siert werden sollen und ruft, wenn glykolisiert werden soll, die bereits eingege- ben Informationen über die Struktur des Glykoanteils ab. Alternativ können die Informationen über die Art der Glykolisierang auch erst jetzt eingeben werden (N- oder O-Glykan, Gemisch oder allgemeine Angaben über N-Glykan - s.o.).
Nun werden aus einer Datenbank, die die in einem Kraftfeld optimierten und anschließend nach süiiktnrellen Kriterien geordneten 3D-Süιιkturen einer Viel- zalil von N- und O-Glykanen enthält, entsprechend den Vorgaben die 3D-Strukturen der Glykoanteile entnommen und mit den zuvor bestimmten Glykolisierungsstellen des Proteins verknüpft. Dabei werden standardisierte Bindungslängen und Winkel für die neu zu knüpfende Bindung angenommen. Anschließend wird zunächst der konfonnationelle Raum an der Verknüpfiings- stelle systematisch abgetastet, indem die Van-der-Waals-Wechselwirkimgen zwischen dem Protein imd dem Glykoanteil berechnet werden. Nachfolgend erfolgt dann eine Mmimierung des gesamten Glykoproteins durch geometrische und energetische Optimierung mittels einer kompletten Kraftfeldrechnung und unter Berücksichtigimg aller möglichen Freilieitsgrade.
Bei der Erzeugung von Gemischen mit imterschiedlichen Glykostniküiren an der jeweiligen Glykolisierungsstelle wird ein komplettes Glykoprotein für jeden einzelnen Bestandteil des Gemisches konsumiert.
Bei der Verwendung von allgemeinen Angaben über den Glykoanteil wird automatisch eine für diese Beschreibung repräsentative Stniktur aus der Datenbank ausgewählt und konstruiert.
Das Verfahren erzeugt eine realistische 3D-Stmküιr aus der Menge aller mögli- chen Konfomiationen. Diese kann als Startstmktur einer nachfräglichen Verfeinerung (wie etwa Molekular-Dynairiik-, Monte-Carlo- oder sonstige Simulationen) zugeführt werden.
Die bei dem Verfaliren verwendete Datenbank wurde wie folgt zusammengestellt: Da das proteinständige Gerüst aller N-Glykane nur eine geringe Variabili- tat aufweist, wurde eme intensive Literaüirsuche für diese Teilstmküir mit dem Ziel durchgeführt, alle beschriebenen Konfoπnationen zu erfassen und anschließend energetisch zu bewerten. Zusätzlich wurde eine systematische Konformationssuche für diese Teilstmküir wie nachfolgend beschrieben durchgeführt.
Die in der Datenbank enthaltenen N- und O-Glykane wurden zunächst in Di- saccharide zerlegt. Für jedes vorkommende Disaccharid wurde der Konforma- tionsraum um die glykosidischen Bindungen systematisch abgetastet. Das globale Mirύmum sowie alle gefundenen Konformationen, die ein lokales Minimum unterhalb eines bestimmten energetischen Schwellwertes auf der Energie- hyperfläche darstellen, wurden in einer Datenbank abgelegt.
Im nächsten Schritt wurden alle möglichen Konfoπnationen von Trisacchariden durch die Kombination der konforniativen Möglichkeiten der beiden Disaccha- ride, aus der sich das Trisaccharid konstituiert, zunächst rein geometrisch kon-
struiert. Sich überlappende Stniküiren wurden nicht weiter berücksichtigt. Alle anderen Konformationen wurden mit einem kompletten Kraftfeld minimiert und in einer Datenbank abgelegt.
In einem nachfolgenden Schritt wurden dann die Tetrasaccharide durch die vollständige Kombination der Konfoπriation der Trisaccharide mit den jeweiligen Disacchariden erhalten. Die Tetrasaccaride wurden wiedemm in einer Datenbank abgelegt.
Die Erzeugung eines Ensembles von realistischen Konfonnationen für ein spezifisches N-Glykan wird wie folgt realisiert:
Bei den N-Glykanen, bei denen nur eine geringe Variabilität des proteinständigen Gerüstbereichs existiert, werden zunächst alle abgespeicherten Kon- formationen des Gerüsts mit dem Protein verknüpft und eine realistische Orientierung mittels einer systematischen Rotation mn die neu entstandene Bindimg eingestellt.
Konformationen, die nicht überlappimgsfiei eingepasst werden können, werden verworfen. Die derart generierten Stniküiren werden über eine komplette Kraft- feldrechnung lniniiriiert imd ftir die weitere Konsünktion verwendet.
Nachfolgend werden alle entsprechenden in der Datenbank für Di-, Tri- und/oder Tetrasaccharide abgelegten Konfoπnationen mit dem Gerüst in der Art verknüpft, dass immer das erste Residuum als Basis beiden Teilstnikturen gemeinsam ist. Treten dabei geometrische Ubersclmeidimgen entweder mit dem Protein oder anderen Teilen des N-Glykans auf, so werden diese Stniküiren
verworfen. Nach jedem Schritt der geometrischen Konstruktion erfolgt eine Mi- nimierung mittels einer kompletten Kraftfeldrechnung. Dieses Prozedere wird solange wiederholt bis alle Antennen des vorgegebenen N-Glykans erschöpfend konstruiert werden. Der Energieinlialt aller so erhaltenen Glykoproteine wird berechnet und als ein Kriterium für eine Sortierung verwendet. Strukturen oberhalb einer zu bestimmenden energetischen Schwelle können verworfen werden. Die Ausgabe von geometrischen Kenngrößen imd Energieinhalten erlaubt eine Bewertung der erzeugten Stniküiren.
O-Glykane sind in der Regel nicht größer als Tπ- oder Tetrasaccharide. Sie können deshalb direkt aus den in der entsprechenden Datenbank abgelegten Konformationen konstruiert werden. Die weitere Bearbeitung ist dann identisch mit der Vorgehensweise für N-Glykane.
Zur Vereύrfachung der weiteren Bearbeitung, werden die generierten Sttukturen zusammen mit ihren süiikturellen, geometrischen und energetischen Kenngrö- ßen in der Fonri eines ASCII-Files abgelegt, so dass die Daten einfach in ein Datenbanksystem eingespielt werden können.
Die Erfindung beruht also auf dem Gnmdgedanken, dass man mit ein imd dem selben Prinzipansatz sowolil die räumliche Stniküir von Glykoproteinen als auch von Glykolipiden sehr einfach konstruieren kann. Ein Aspekt der Erfin- düng ist die virtuelle Analyse von Verknüpftmgsstellen eines konkreten Proteins mit seinem Glykoanteil, ein anderer Aspekt die schnelle Generienmg der dreidimensionalen Stniküir und die Analyse der räumlichen Vielfalt der Gly- kan-Stinktiiren, wobei bei Glykolipiden auf die Analyse der Verknüpftmgsstelle
verzichtet werden kann, da diese eindeutig ist. Ansonsten erfolgt die Analyse der konformativen Vielfalt des Glykoanteils von Glykolipiden identisch wie bei N- und O-Glykanen von Glykoproteinen.
Generell wird bei den Glykoproteinen zwischen N- imd O-verknüpften Glyka- nen unterschieden. Die Erkennung von N-glykolisierten Proteinen erfolgt über ein Asparagine-Residuum (Asn) imd ist auf der Sequenzebene charakterisiert durch das Sequenzmuster Asn-X-Ser/Thr. Diese Infoπriation zusammen mit der Bedingung, dass das Asn-Residum auf der Oberfläche exponiert sein muss, sind hinreichende Kriterien, um N-Glykolisienmgsstellen zu erkennen.
Bei der Verknüpfung des Glykoanteils über ein Sauerstoff- Atom (O-Glyko- lisierung) an ein Ser- bzw. Thr-Residuum, ist - im Gegensatz zu den N-Glykolisienmgsstellen - keine einfache Konsensussequenz bekannt, die eine O-Glykolisierangsstelle eindeutig kennzeichnet. Generell gilt, dass 0-Gfykolisierungen weniger gut untersucht sind, als N-Glykolisierungen. Die Komplexität der Zuckerstmküiren selbst ist jedoch wesentlich geringer als bei N-Glykanen.
Erfindungsgemäß werden die räumlichen Strukturen des Protems als bekannt vorausgesetzt. Als weiteres Kriterium ftir potentielle O-Glykolisienmgsstellen wird hinzugezogen, dass nur solche Ser/Thr-Residuen akzeptiert werden, die an der Proteinoberfläche gut zugänglich sind, so dass der zu verknüpfende Zucker auch räumlich genügend Platz hat, um gebimden zu werden. Diese beiden Kriterien finden ihre Entsprechung bei der aus reinen Sequenzdaten abgeleiteten Be- obachüing, dass für O-Glykolvisierungsstellen in der Regel die Hydrophobizität
der direkt benachbarten Residuen geringer ist als bei nicht glykolisierten Ser/Thr-Residuen. Auch befinden sich zumeist keine voluminösen Aminosäuren (Tip, Phe, His) in räumlicher Nähe, die aus sterischen Gründen eine Verknüpfung erschweren oder verhindern würden. Ebenso ist die Zalil der positiv gela- denen Residuen (Arg, His, Lys) ftir Glykolisienmgsstellen geringer als in der Umgebung von nicht glykolisierten Ser/Thr-Residuen. Beüachtet man die Se- kimdärstrukturen der Proteine, so zeigen glykolisierte Sequenzen eine hohe Präferenz für Turn-Bereiche gegenüber alpha-helikalen und beta-Falt- blatt-Bereichen.
Erfindungsgemäß werden zimächst die rein geometrischen Eigenschaften der Proteinoberfläche (Zugänglichkeit der Ser/Thr-Residuen imd die Möglichkeit, den zu verknüpfenden Zucker ohne sterische Hindenmgen einpassen zu können) ausgewertet. Als weitere Kriterien zur Entscheidimg sind dann zu nennen die Hydrophobizität, Ladungsverteilungen sowie die von Proteinen eingenom- menen Sekimdärstrukturen in unmittelbarer räumlicher Nähe zu den betrachteten Ser/Thr-Residuen.
Das unterschiedliche Vorgehen bei der Auffindung von Bindungsstellen für N- und O-Glykane ergibt sich aus den entsprechenden Ablaufschemata.
Bei der Diirchfühmng der erfindimgsgemäßen Verfahren werden die rämnliche Struktur des Proteins/Lipids und die rämnliche Lage der ausgewälilten Bindungsstelle als bekannt angenommen. Die Analyse auf der Seite des Proteins bezieht sich - wie oben schon genauer ausgeführt - auf die Oberflächenexpositi-
on der entsprechenden Aminosäuren sowie die physikochemischen Eigenschaften der Oberfläche in Nachbarschaft der Glykolisienmgsstelle.
Bei der Einstellung einer realistischen Konfoπnation an der Verknüfpungsstelle zwischen Protein und Glykoanteil muss zwischen N- und O- Glykanen unter- schieden werden. Für N-Glykane sind vier Torsionswinkel (ci, C2, FN, YN) ZU betrachten, die einen begrenzten konfoπnationellen Raum populieren können. Der Verknüpfüngsalgoritiimus stellt nacheinander die Torsionswinkel mit absteigender Priorität (entsprechend den experimentell gefundenen Häufigkeiten) ein. Dabei wird für jede mögliche Verknüpfung geprüft, ob es zu einer räumli- chen Überlappung der Volumina einzelner Atome des Glykoanteils mit dem Protein kommt. Ist dies der Fall, so wird diese Orientiemng verworfen. Alle geometrisch sinnvollen Verknüpfungen werden mit einer kompletten Kraftfeldrechnung geometrisch optimiert imd die von ihrem Energi einhält günstigsten Konfonnationen zur weiteren Konsünktion gespeichert.
Führt die Verwendung der aus Literaturdaten exzerpierten Werte ftir die Torsionswinkel der Verknüpfüngsstelle zu keiner überlappungsfreien Konfoπnation, so wird zunächst eine systematische Rotation, z.B. in 10°-Sclιritten (ergibt 36X36=1296 Bereclmungsscliritte), mn die Winkel χi, χ? durchgefülirt. Dabei wird für jeden Bereclmungsscliritt die Van-der-Waals-Energie zwischen dem Protein und dem zu verknüpfenden Glykoanteil bereclmet. Ausgewälilt werden sodann alle lokalen Minima mit geringem Energieinlialt. Ist nach diesem Abtasten des konfoπnationellen Raumes immer noch keine überlappimgsfreie Konfoπnation gefunden, so wird die soeben beschriebene systematische Rotation
auch für die Torsionswinkel Φ , Ψ N wiederholt. Erhält man auch nach dieser Prozedur keine überlappungsfreie Konformation, so wird angenommen, dass es sich um keine für eine Glykolisierung geeignete Position in der Sequenz handelt.
Dieses Vorgehen des systematischen Abtastens des konfoπnationellen Raums entspricht dem für die Generienmg eines kompletten Satzes aller möglichen Konformationen von Di-, Tri-, Tetra- imd Penta-Saccharide verwendeten Verfahren, das in dem Flussdiagramm lila beschrieben ist.
Die Geometrie der Verknüpftmg von O-Glykolisieπmgsstellen ist bislang nur bmchsüickhaft bekannt. Aus diesem Gnmde wird erfindungsgemäß für O-Glykolisierungsstellen generell das oben beschriebene Verfaliren zum systematischen Abtasten des konfoπnationellen Raums verwendet. Zu untersuchen sind in diesem Fall die Winkel χ i, Φ , Ψ N- Das Abtasten kann in der Regel auf die Winkel Φ , Ψ N begrenzt werden, da ftir den Winkel χ ι die Beweglichkeit stark eingeschränkt ist und deshalb ein Standardwert angenommen werden kann.
Es sei an dieser Stelle betont, dass es sich bei den genannten "Verknüpfungen aller entsprechenden in der Datenbank ftir Di-, Tri-, Tefra- und Pentasaccharide abgelegten Konfonnationen mit dem Proteingerüst" nicht um die Verknüpfung der Glykane mit dem Proteingerüst, sondern um die Generienmg aller möglichen Konfonnationen der Glykane handelt. Ist z. B. die folgende Sequenz (wobei jeder Buchstabe ein Monosaccharid symbolisiert) gegeben:
. D - E - F
/
Protein Lipid - A — B - C Gesamtsequenz
\ - G - H -- I so werden im ersten Schritt aus der Datenbank für Disaccharide die ftir die Sequenz A--B (Baustein 1) abgelegten Konfoπnationen abgerufen. Dies wird in der Regel die mit dem Protein/Lipid zu verknüpfende Core-Region sein, wobei das Verfahren zur Verknüpfimg der Core-Region mit dem Protein/Lipid bereits beschrieben wurde.
Der Zucker C ist eine Verzweigungsstelle. Aus diesem Grund werden aus der Datenbank für Tetrasaccharide alle abgelegten Konfonnationen für den Baustein
- D /
B - C (Baustein 2)
\
- G entnommen. Geometrisch überlagert wird der in beiden Bausteinen enthaltenen Zucker B. Eine der Stniküiren des Zuckers B wird sodann gelöscht, und die konekte chemische Verknüpfung der beiden Bausteine 1 und 2 wird realisiert.
Dieser Vorgang wird nun wiederholt für alle möglichen Konfonnationen, die ftir
die Bausteine 1 und 2 abgelegt sind. Sollten sich geometrische Überlappungen bei der Konstruktion ergeben, so wird die generierte Sünktur verworfen. Ist dies nicht der Fall, so erfolgt eine geometrische Optimienmg aller generierten Konformationen mittels einer kompletten Kraftfeldrechnimg. Anschließend werden Konfoπnationen verworfen, deren Energieinhalte deutlich oberhalb der Energieinhalte der günstigsten Konfoπnationen liegen.
Im nächsten Schritt werden sodann alle abgespeicherten Konfoπnationen für die Trisaccharide D-E-F abgenifen, der beiden Bausteinen gemeinsame Zucker D wird geometrisch überlagert, alle möglichen Konfoπnationen werden kon- struiert, überlappende Strukturen werden verworfen, die geometrische Optimierung mittels Kraftfeldrechnungen wird vorgenommen und Konfoπnationen mit hohen Energieinlialten werden ausgesondert. Das gleiche Verfahren wird sodann ftir den zweiten Ast mit den Residuen G-H-I durchgeführt.
Erfindungsgemäß wird also eme zu analysierende Gesamtfrequenz der Glykane aus kleineren Bausteinen aufgebaut, deren konfonnative Vielfalt in der Fonn von Di-, Tri-, Tetra- oder Pentasacchariden in den entsprechenden Datenbanken abgelegt ist. Die Methoden zur Erzeugimg eines kompletten Satzes aller möglichen Konformationen von Di-, Tri-, Teüa- oder Pentasacchariden sind in den Ablaufplänen DJa und Illb dargestellt. Die Analyse der Gesamtfrequenz wird in der Fonn durchgefiilirt, dass immer das letzte Residuum des bereits konsultierten Teils der Gesamtsequenz identisch ist mit dem ersten Residuiun der zu verknüpfenden Teilsünküir. Dabei ist die Wahl der Größe der verwendeten Bausteine abhängig von der Topologie der jeweils betrachteten Region in der Ge-
samtsequenz (endständig: Disaccharide; lineare Kette: Trisaccharide; Verzweigungen: Tetra- oder Pentasaccharide). Die beiden identischen Residuen werden geometrisch überlagert. Eine der identischen Stniküiren wird gelöscht und die konekte chemische Verknüpfung der beiden Bausteine realisiert. Dieses Vor- gehen wird nun wiederholt, bis alle Konfonnationen, die für den jeweils betrachteten Baustein abgelegt sind, abgearbeitet wurden. Die Prozedur wird solange wiederholt, bis die Gesamtsequenz des Glykans vollständig abgearbeitet ist.
Dabei erfolgt die Prüftmg, ob es geometrische Überschneidungen mit dem Pro- tein/Lipid oder anderen Teilen des N-Glykans gibt, durch die Messung von Abständen. Befindet sich ein Atom des zu verknüpfenden Glykans innerhalb des Van-der-Waals-Radius eines anderen Atoms, so tritt eine geometrische Überschneidung auf.
Schließlich wird für jede konsultierte Konfoπnation eine komplette topologi- sehe Molekülbesclireibimg (Aminosäuresequenz, Glykolisienmgsstellen, Sequenz und Verknüpfung der Monosaccharide, relevante Torsionswinkel der Verknüpfüngsstelle imd der Glykane, Verknüpfüngstabelle der Atome, Art der Atome, kartesische Koordinaten, Partialladungen der Atome sowie MM3-Atomtypen) ausgegeben. Der Gesamt-Energieinhalt der erzeugten Kon- foπnationen dient als Kriterium für die Reihenfolge der Ausgabe. Daneben kann ein Protokoll über die einzelnen Schritte der Konsünktion und der geometrischen Optimierung ausgegeben werden, das es dem Benutzer erlaubt, das Vorgehen während des gesamten Prozesses nac zuvollziehen.
Da in der Regel keine experimentell ennittelten räumlichen Strukturen von Lipiden vorliegen und die Art ihrer Verknüpfung mit dem Glykoanteil eindeutig ist, wurde erfindungsgemäß eine Datenbasis von theoretisch bereclmeten Lipiden generiert, aus der der Benutzer die ftir seine Anwendung relevanten Struk- turen abmfen kann. Die Verknüpftmg und das Einstellen realistischer Konformationen an der Verknüpfimgsstelle erfolgt analog zu dem für die Glykoprotei- ne beschriebenen Vorgehen: Verknüpftmg der Bausteine unter Verwendimg von Standardwerten für die inneren Koordinaten (Bindungslängen, Bindungswinkel und Torsions winkel). Anschließend erfolgt ein systematisches Abtasten des konfoπnationellen Ramnes wie im Ablaufplan lila beschrieben. Die eigentliche Analyse des Glykoanteils erfolgt sodann völlig identisch mit dem ftir N- und O-Glykane beschriebenen Verfaliren.
Im Schema HI sind verschiedene Methoden zur Generienmg der Datenbanken für Di-, Tri-, Tetra- imd Pentasaccharid-Fragmente genannt. Eine Möglichkeit ist das systematische Abtasten des Konfoπnationellen Raumes (Ablaufschema Hla). Für die größeren Saccharide hat sich besonders die Methode der Hoch- temperatur-Molel lar-Dynamik-Sünulationen bewährt. In gleichem Maße für diesen Zweck geeignet sind aber auch Mettopolis-Monte-Carlo-Rechnungen. Das Vorgehen bei diesen Verfaliren ist im Ablaufschema Illb dargestellt.
Dabei ist den genannten Methoden zur Generienmg der Datenbanken gemein, dass jeweils sehr viele Konfoπnationen (lO3 bis 106) generiert werden, die bewertet, grappiert und sortiert werden müssen. Ziel dieser Auswertungen ist es, diejenigen Bereiche des konfoπnationellen Raums automatisch
aufzufinden und zu beschreiben, die bevorzugt populiert werden. In der Datenbank abgelegt werden dann alle so gefundenen konfonnationellen Bereiche in Form von räumlichen Templaten, inneren Koordinaten, Energieinhalten und Populationswahrscheinliclikeiten.
Zur Generierung der Datenbanken von Di- und Trisacchariden hat sich besonders die Methode der systematischen Verändenmgen aller wichtigen Freilieitsgrade, die die Flexibilität eines Moleküls bestimmen, bewährt, da es sich bei Di- und Trisacchariden um vergleichsweise kleine Moleküle handelt. Die Methode ennöglicht die Berechnung des kompletten konfoπnatio- neuen Raums, ist jedoch für größere Moleküle mit vielen Freiheitsgraden auf Gmnd der kombinatorischen Explosion der zu berechnenden Einzelpunkte zu aufwendig.
Bei größeren Molekülen eignet sich die Methode der Generienmg von Datenbanken mittels Metropolis-Monte-Carlo-Rechnungen, die zufällige Ver- ändenmgen aller wichtigen Freiheitsgrade eines Moleküls erlauben. Die erzeugten Strukturen werden energetisch gewertet und neu zu generierende Strukturen so dirigiert, dass Familien von Stniküiren entstehen, die eine repräsentative Beschreibung aller populierten Konfonnationen darstellen. Es entstellt somit keine vollständige Beschreibung des gesamten konfonnatio- neuen Raums, wohl aber eine detaillierte Charakterisierung der für die Fragestellung relevanten Bereiche niedriger Energieinhalte. Durch die Konzentration auf die für die Fragestellung relevanten Teile des konfonnationellen
Raums müssen weniger Berechnungen pro Freiheitsgrad als bei den systematischen Abtastmethoden ausgeführt werden.
Zum Abtasten des konfonnationellen Raums von größeren Molekülen eignet sich auch die Methode der Molekulardynamik, bei welcher die Bewegungen der Atome innerhalb eines molekularen Ensembles durch die Integration Newtonscher Bewegungsgleichungen für jedes einzelne Atom simuliert werden. Zur Beschreibung der zwischen den Atomen wirkenden Kräfte werden Kraftfelder verwendet. Da die Integrationsschritte auf Grand der Schnelligkeit einzelner Bewegungen innerhalb des Moleküls sehr kurz sein müssen (im Bereich von 10"15 Sekunden), kann es dabei zweckmäßig sein, Simulationen bei Raumtemperaturen so auszudehnen, dass tatsächlich alle in der Realität populierten Konformationen auch während der Simulation eingenommen werden. Dazu kann die Temperatur während der Simulation so weit erhöht werden, dass Energiebameren, die die einzelnen Konfonnatio- nen voneinander tremien, sclmeller überschritten werden können. Durch die Wahl der Simulationsbedingungen muss allerdings sichergestellt werden, dass tatsächlich alle relevanten Bereiche des konfonnationellen Raumes po- puliert sind. Die Methode eignet sich insbesondere zur Generienmg der Datenbanken für Tetra- und Pentasaccharide.
Schließlich können auch sogenannte "genetische Algorithmen" zur Generierung der Datenbanken verwendet werden, wobei typischerweise eine bestimmte Anzahl von Konfoπnationen der zu untersuchenden Glykane generiert und zusammen mit möglichen veränderbaren Größen wie z.B. Torsi-
onswinkeln, Bindungswinkeln etc. gespeichert werden. Die Konfonnationen werden dann dadurch verändert, dass bestimmte Funktionen mit spezifischen Parametern auf sie angewendet werden und so ein neuer Satz von Lösungen gefunden wird, der dann als Ausgangspunkt für den nächsten Iterations- schritt verwendet wird. Üblicherweise werden dabei Begiiffe aus der Genetik (Mutation, Cross over, Fitness) zur Beschreibung der erzeugten konfor- mativen Vielfalt verwendet.
Das folgende Ausführungsbeispiel erklärt die Erfindung im einzelnen. In diesem Beispiel werden zunächst alle Glykoanteile separat generiert, dann bewertet und schließlich werden nur die n besten mit dem Protein verknüpft. Alternativ kann gleich bei der Konstruktion der Glykane schon die Verknüpfung mit dem Protein vorgenommen werden.
Beide Wege sollten sehr ähnliche Ergebnisse liefern. Der Grund, zunächst nur den Glykananteil zu generieren, ist ganz einfach: der Algo- rithmus wird insgesamt schneller dadurch und man konzentriert sich auf die wesentlichen Strukturen.
Beispielhafte Anwendung:
Aufgabenstellung: Erzeugung der 3D Struktur des Glykoanteils der Influenza Neuraminidase
1.) Eingabe von Daten
Folgende Schritte werden durchlaufen
a) Eingabe der 3D-Proteinstruktur durch den Benutzer ( hier PDB- Eintrag HNY.pdb)
1INY:_ INFLUENZA A SUBTYPE N9 NEURAMINIDASE (SIALIDASE) (E.C.3.2.1.18)
b) Potentielle N-Glykosilierungsstellen der Influenza Neuraminidase werden entsprechend dem im Ablaufschema II dargestelltem Vorgehen automatisch gefunden.
SEQUENCE
10 20 30 40 50 60
.... + .... I .... + .... I .... + .... I .... + .... ] .... + .... ! .... + .... I
RDFNNLTKGLCTINSWHIYGKDNAVRIGEDSDVLVTREP 120
YVSCDPDECRFYALSQGTTIRGKHSNGTIHDRSQYRALISWPLSSPPTVYNSRVECIGWS 180
STSCHDGKTRMSICISGPNNNASAVIWYNRRPVTEINTWARNILRTOESECVCHNGVCPV 240 VFTDGSATGPAETRIYYFKEGKILKWEPLAGTAKHIEECSCYGERAEITCTCRDNWQGSN 300
RPVIRJDPVAMTHTSQYICSPVLTDNPRPNDPTVGKCNDPYPGNNNNGVKGFSYLDGVNT 360 WLGRTISIALRSGYEMLKVPNALTDDKSKPTQGQTIVLNTDWSGYSGSFMDYWAEGECYR 420 ACFYVELIRGRPKEDKVWWTSNSIVSMCSSTEFLGQWDWPDGAKIEYFL
Identified potential N-Glcosylation sites: Residue: 86 NLT N-LINKED (GLCNAC...).
Residue: 146 NGT N-LINKED (GLCNAC...).
Residue: 201 NAS N-LINKED (GLCNAC .) c) Benutzer wählt Positionen aus, die glykosiliert werden sollen.
Please choose residue-number: 200
d) Benutzer gibt die Sequenz (Topologie) des Glykoanteils entsprechend den IUPAC- Definitionen ein. Als konkretes Beispiel wurde das sogenannte Man9 -N-Glykan gewählt.
a-D-Manp- (1-2) -a-D-Manp-(l-6) +
[1] [21 | [3] a-D-Manp-(1-6)4- [5] [4] | | [6] [10] [11] a-D-Manp- (l-2)-a-D-Manp-(l-3) + a-D-Manp- (1-4) -b-D-GlcpNAc- (1-4) -b-D-GlcpNAc a-D-Manp- (1-2) -a-D-Manp- (1-2) -a-D-Manp- (1-3) + [9] [8] [7]
Damit ist die Dateneingabe abgeschlossen.
2.) Verarbeitungsschritte:
Folgende Schritte werden sodann automatisch unter Verwendung der in der Anmeldung beschriebenen Algorithmen ausgeführt:
a) Zerlegung in strukturelle Fragmente. Für das Anwendungsbeispiel wird das Man9 Glykan in folgende Bruchstücke zerlegt:
1) einfache Verzweigungsstellen (Tetrasaccharide) a-D-Manp-(l-6)+ [2]
I 1 a-D-Manp-(l-6)-a-D-Manp [3|—16]
• I ! a-D-Manp-(l-3)+ |4|
a-D-Manp-(l-6)+ [2|
I I a-D-Manp-(l-4)-a-D-GlcpNAc [6|—[10]
I I a-D-Manp-(l-3) + [7]
2) Lineare Fragmente (Trisaccharide) a-D-Manp-(l-2)-a-D-Manp-(l-6)-a-D-Manp [ 1 ,2,3] a-D-Manp-(l-2)-a-D-Manp-(l-3)-a-D-Manp [5,4,3], [8,7,6] a-D-Manp-( 1 -2)-a-D-Manp-( 1 -2)-a-D-Manp [9,8,7] a-D-Manp-(l-4)-b-D-GlcNAc-(l-4)-b-D-GlcpNAc [6, 10, 1 1] b-D-GlcNAc-(l-4)-b-D-GlcpNAc-(l-4)-Asn [ 10, 11, 12]
3) Doppelte Verzweigung (Pentasaccharide) (nicht vorhanden im Beispiel)
b-D-GlcpNAc-(l-6) +
I b-D-GlcpN Ac-( 1 -4)-a-D-Manp-( 1 -6)-a-D-Manp
I a-GlcpNAc-(l-3) +
b) Erzeugung einer (beliebigen) Konformation (3D-Struktur) des Man9 mittels des Programms SWEET-II.
c) Abrufen der Winkelwerte für die glykosidischen Bindungen aus der Wissenbasis. Für jedes Fragment wurde mittels des beschriebenen Verfahrens (siehe auch Ablaufschema Illb und 3. Generierung der Wissensbasis) wahrscheinliche Winkelwerte und deren Gewichtung (in diesem Fall Populationen) berechnet. Beispielhaft werden hier die abgeleiteten Winkelwerte für das Fragment a-D-Manp-(l -2)-a-D-Manp-(l-6)-a-D- Manp tabellarisch aufgelistet.
d) Einstellung der jeweiligen glykosidischen Bindungen entsprechend der aus der Wissensbasis abgerufenen Werte für die Torsionswinkel (Siehe auch Ablaufplan IV). Hierbei werden zunächst die Werte der doppelt verzweigten Fragmente, dann die der einfach verzweigten Fragmente und zum Schluss die Werte der linear verzweigten Fragmente eingestellt. Einmal gesetzte Torsionswinkel werden nicht mehr verändert. Das Beispiel-Glykan Man9 hat 10 glykosidische Verknüpfungen. Bei zwei möglichen Einstellungen pro glykosidischer Bindung ergeben sich für
Man9 1024 (210) mögliche 3D-Strukturen. Konformationen, die aus sterischen Gründen (z. B. räumliche Überlappung von Molekülteilen) nicht sinnvoll sind, werden ausgeschlossen.
e) Die Erstellung einer Rangordnung der gefundenen Strukturen wird durch die Berechnung ihrer van der Waals-Interaktionen (verwendet wird die EVDW-Routine des Programm MM2_85) vorgenommen. Die folgende Tabelle listet die Torsionswinkel der zehn besten Strukturen mit steigenden Energieinhalten auf, die für das Glykan Man9 gefunden wurden.
f) Die Konformationen des Man9 werden entsprechend ihrer in Schritt g) gefundenen Reihenfolge mit den ASN-Residuen der indizierten Glykosylierungsstellen verknüpft (Siehe auch Ablaufplan V). Hierfür
werden zunächst die aus der Literatur bekannten Werte für die Torsionswinkel χi, χ2, Φ .Ψ für die Orientierung der jeweiligen Konformation an der Protein-Glykan Verknüpfungsstelle verwendet. Kann so keine sinnvolle (nicht mit dem Protein überlappende) Verknüpfung erreicht werden , erfolgt ein systematisches Abtasten des konformationellen Raumes aller möglichen Einstellungen der Tosionswinkelχi, χ2, ΦN.ΨN. Wird auch mit diesem Verfahren keine sinnvoll Orientierung erreicht, so wird die jeweilige Konformation verworfen.
h) Nach erfolgreicher Verknüpfung der Glykan-Konformationen mit dem Protein erfolgt eine geometrische Optimierung des neu konstruierten Moleküls mit dem MM3 Kraftfeld unter Anwendung aller in MM3 enthaltenen Terme. Dabei wird das Protein fixiert. Figur VI zeigt des Gerüst der Neuraminidase (links) sowie den Glykanteil (rechts) der zehn besten Konformationen, die aufgrund der beschriebenen Prozedur für das Man9 gefunden wurden.
3.) Generierung der Wissensbasis
Die Ableitung der verwendeten Wissensbasis (siehe auch Ablaufschema III), die die Grundlage für das oben beschriebene Vorgehen bei der schnellen Generierung des Glykoanteils der Neuraminidase bildet, wurde in sechs Schritten erreicht. Hierbei wird im Ablaufschema Illb beschriebene Option verwendet: Langzeitsimulationen mittels Molekular Dynamik.
1. Schritt: Aus der CarbBank Literatur-Datenbank wurden alle etwa 2000 N-Glykanstrukturen extrahiert. Somit erhalten wir eine umfassende Beschreibung der Struktur aller bekannten N- Glykane.
2. Schritt: Wie schon im Anwendungsbeispiel demonstriert, wurden die N-Glykanstrukturen in sinnvolle Tri-, Tetra- und Pentasaccharide zerlegt. Etwa 400 Fragmenten sind notwendig um alle bekannten N-Glykan erzeugen zu können.
3. Schritt: Mit dem Programm SWEET-II wurden aus der Topologie der Fragmente dreidimensionale Strukturen generiert.
4. Schritt: Hochtemperatur Molekular Dynamik Simulationen (1000 K)
(Verwendete Software TINKER: Kraftfeld MM3, Wasser- modell: GB/SA) wurden für alle gefundenen Fragment durchgeführt. Dabei wurde die Simulationszeit so lange aus- gedehnt, bis sicher war, dass tatsächlich ein konformationel- les Gleichgewicht erreicht war.
5. Schritt: Die Ermittlung des während der Simulation populierten konformationellen Raumes erfolgt automatisch für jede glycosidi- sche Bindung eines jeden Fragmentes. Dies sei beispielhaft für das Fragment
a-D-Manp-(l-6) +
I a-D-Manp-( 1 -6)-a-D-Manp
I a-D-Manp-(l-3) +
dargestellt. Für jede glykosidische Verknüpfung erhält man eine Populationskarte beispielhaft dargestellt für die a-D- Manp-(l-3)-a-D-Manp Verknüpfung in Figur VII.
Daraus werden die Positionen der Maxima und ihre relative Population bestimmt und in einer Tabelle abgelegt.
6. Schritt: Für jedes Fragment werden die gefundenen Torsionswinkel und ihre relative Population in der Wissensbasis abgelegt. Diese Information ist die Grundlage für die schnelle Generierung der konformativen Vielfalt der N-Glykane. In der nach- folgenden Tabelle sind die Werte für das unter Schritt 5 genannte Fragment aufgelistet.
Für das Verständnis der Arbeitsschritte wird auf folgende Literatur ver- wiesen:
SWEET:
A. Bohne, E. Lang and C.-W. von der Lieth SWEET - WWW-based rapid 3D construction of oligo- and polysaccharides Bioinformatics, 15 (1999) 767-768 A. Bohne, E. Lang, C.-W. von der Lieth W3-SWEET: Carbohhydrate Modeling by Internet J. Mol. Model. 4 (1998) 33-43
Kristalldaten N-Glykane:
Petrescu AJ, Petrescu SM, Dwek RA, Wormald MR A statistical analysis of N- and O-glycan linkage conformations from crystallographic data. Glycobiology 9 (1999) 343-52
Imberty A, Perez S. Stereochemistry of the N-glycosylation sites in gly- coproteins.
Protein Eng. 8 (1995):699-709.
TINKER-Software R. V. Pappu, R. K. Hart and J. W. Ponder, J. Phys. Chem. B, 102, (1998) 9725-9742
M. J. Dudek, K. Ramnarayan and J. W. Ponder, J. Comput. Chem. , 19, (1998) 548-573
MM3-Kraftfeld Allinger NL, Li F, Yan, L Molecular Mechanics: the MM3 Force Field for Hydrocarbons I,II,II. J. Amer.Chem.Soc. 1 1 1 (1989) 8551 , 8566, 8576
Claims
1. Computerbasiertes Verfaliren zur automatischen virtuellen Analyse der dreidimensionalen Struktur des Glykoanteils von Glykoproteinen und Glykolipiden mit Hilfe eines Computersystems mit den folgenden Schritten:
- Einlesen der Aminosäuresequenz und der dreidimensionalen
Struktur des zu untersuchenden nicht-glykolisierten Proteins bzw. Lipids,
Auswählen der mögliche Glykolisienmgsstellen repräsentierenden Teilsequenzen der Aminosäuren,
Analyse der räumlichen Lage der ausgewählten Teilsequenzen im Protein/Lipid imd Markieren derjenigen ausgewählten Teilsequenzen, an denen aus geometrischen Gründen eine Glykolisienmg möglich ist,
Ausgeben aller markierten potentielle Glykolisierungsstellen repräsentierenden Teilsequenzen.
2, Computerbasiertes Verfaliren zur automatischen virtuellen Analyse der dreidimensionalen Stniktur des Glykoanteils von Glykoproteinen und Glykolipiden mit Hilfe eines Computersystems mit den folgenden Schritten:
Einlesen der Aminosäuresequenz imd der dreidimensionalen Stniküir des zu untersuchenden nicht-glykolisierten Proteins,
Auswählen der mögliche Glykolisienmgsstellen repräsentierenden Teilsequenzen der Aminosäuren, Analyse der rämnlichen Lage der ausgewählten Teilsequenzen im Protein und Markieren derjenigen ausgewälilten Teilsequenzen, an denen aus geometrischen Gründen eine Glykolisienmg möglich ist,
Auswählen der exponiert auf der Oberfläche des Proteins gelege- nen Ser- und Tlir-Residuen,
Berechnen wenigstens einer ausgewälilten physikochemischen Kenngröße, insbesondere der Hydrophilität, der Ladungsverteilung, des Volumens benachbarter Aminosäuren und der Sekundärstrakttir der Oberfläche des Proteins in der Nachbarschaft potentieller Glykolisienmgsstellen imd Analyse der Wahrscheinliclikeit, dass es an der beüachteten Stelle zu einer Glykolisienmg kommt, und
Ausgeben aller markierten potentielle Glykolisierungsstellen repräsentierenden Teilsequenzen imd Residuen.
3. Verfaliren nach Ansprach 1 oder 2, wobei das Computersystem auf eine Konfonnationsdatenbank mit Konfoπnationen von Sacchariden, die in N- und/oder O-Glykanen und/oder Glykolipiden vorkommen, zugreifen kann, dadurch gekennzeichnet,
dass aus der Konfonnationsdatenbank dreidimensionale Stniküiren von möglichen Glykolanteilen abgerafen werden und dass jeweils eine abgerufene Stniktur mit jeweils einer markierten potentiellen Glykolisierungsstelle verknüpft wird, worauf das Ergebnis ausgegeben wird.
4. Verfahren nach Anspruch 3, dadurch gekennzeichnet, dass nach dem Ausgeben aller markierten potentielle Glykolisienmgsstellen repräsentierenden
Teilsequenzen und Residuen eine Abfrage erfolgt, welche von mehreren möglichen Glykolisierungsarten an welcher potentiellen Glykolisierungsstelle angewandt werden soll, worauf die der gewählten Glykolisierangsait entsprechende dreidimensionale Stniktur aus der Konfonnationsdatenbank abgerafen und mit der jeweiligen Glykolisienmgsstelle verknüpft imd ausgegeben wird.
5. Verfahren nach Ansprach 3 oder 4, dadurch gekennzeichnet, dass bei der automatischen Verknüpfung von dreidimensionaler Stniküir des Glykoanteils und Glykolisienmgsstelle standardisierte Bindungslängen, Bindungswinkel und Torsionswinkel angenommen werden.
6. Verfaliren nach einem der Ansprüche 3 bis 5 , dadurch gekennzeichnet, dass nach dem Verknüpfen der Glykoanteile mit den Glykolisierungsstellen der konformationelle Ramn jeder Verknüpftmgsstelle durch Berechnimg der Van-der-Waals- Wechselwirkung zwischen Protein/Lipid und Glykoanteil automatisch abgetastet wird.
7. Verfaliren nach Anspruch 6, dadurch gekennzeichnet, dass imter Berücksichtigung der berechneten Wechselwirkung und aller möglichen Freilieits- grade das glykolisierte Protein Lipid über eine komplette Kraftfeldrechnung optimiert und ausgegeben wird.
8. Verfaliren nach Anspruch 4, dadurch gekennzeichnet, dass bei der Abfrage der anzuwendenden Glykolisienmgsart eine Auswahl verschiedener N-Glykane, O-Glykane, Glykoanteile von Glykolipiden oder einem Gemisch aus verschiedenen eindeutig definierten N- oder O-Glykanen getroffen werden kann.
9. Verfaliren nach Ansprach 8, dadurch gekennzeichnet, dass dann, wenn als Glykolisierungsart ein Gemisch mit unterschiedlichen Glykostraküiren an einer Glykolisierungsstelle gewälilt wurde, ein komplettes Glykoprotein ftir jeden einzelnen Bestandteil des Gemisches eneclinet und den Schritten nach Anspruch 5 und/oder 6 unterzogen wird.
10. Verfaliren nach Anspruch 4 und/oder Anspruch 8, dadurch gekennzeichnet, dass bei der Abfrage der anzuwendenden Glykoli sierangsart allge- meine Angaben über die Art des N-Glykans - wie z.B. mannosereich, trianten- när, terminale Sialinsäure enthaltend - eingegeben werden können.
11. Verfaliren nach Ansprach 10, dadurch gekennzeichnet, dass dann, wenn bei der Abfrage allgemeine Angaben über das N-Glykan gemacht wurden, automatisch eine für die gemachten Angaben repräsentative Stniktur aus der Konformationsdatenbank ausgewälilt imd zur Verknüpftmg verwendet wird.
12. Verfaliren nach einem der Ansprüche 3 bis 11 , dadurch gekennzeichnet, dass das Ergebnis der Verknüpfungen als dreidimensionale Ausgangsstraktiir einer Srrukturverfeinerungsoperation, insbesondere einer Molekular-Dynamik- oder Monte-Carlo-Simulation unterzogen wird.
13. Verfahren nach einem der Ansprüche 3 bis 12, dadurch gekennzeichnet, dass das Ergebnis der Verknüpfungen zusammen mit ihren straktiirellen, geo- metrischen und energetischen Kenngrößen in einer gemeinsamen Datei abgespeichert werden.
14. Verfaliren zur Erzeugung eines Ensembles realistischer Konfonnationen spezifischer N-Glykane an Proteinen mit Hilfe eines Computersystems, das auf eine Konformationsdatenbank mit Konfonnationen von Sacchariden, die in N-Glykanen vorkommen, zugreifen kann, mit den folgenden Schritten:
a) Einlesen der Aminosäuresequenz und der dreidimensionalen Struktur eines nicht-glykolisierten Proteins,
b) Auswählen der mögliche N-Glykolisierangsstellen repräsentierenden Teilsequenzen der Aminosäuresequenzen,
c) Analyse der räumlichen Lage der ausgewählten Teilsequenzen im
Protein und Markieren derjenigen ausgewälilten Teilsequenzen, an denen aus geometrischen Gründen eine Glykolisienmg möglich ist,
d) Abrufen einer in der Datenbank gespeicherten Konfoπnation des Core-Bereichs des jeweiligen Glykans und Verknüpfen der Konfonnation mit den markierten Teilsequenzen, e) Einstellen einer realistischen Orientierang an jeder Verknüpfüngs- stelle mittels systematischer Rotation um die jeweilige Verknüpftmgsstelle,
f) Miniinieren jeder Konfonnation, die überlappungsfrei eingepasst werden kann, mittels einer Kraftfeldrechnung imd Abspeichern der lninimierten Struktur,
g) Wiederholen der Schritte d) bis f) für alle weiteren in der Datenbank gespeicherten Konfonnationen des befrachteten Glykans,
h) Verknüpfen aller entsprechenden in der Datenbank für Di-, Tri-, Tetra- und/oder Pentasaccharide abgelegten Konfonnationen mit dem Protein- gerüst in der Art, dass immer das letzte Residuum des bereits konsultierten Teils der Gesamtsequenz identisch ist mit dem ersten Residuum der zu verknüpfenden Teilstraktiir,
i) Prüfen, ob bei der Verknüpfung gemäß Schritt h) geometrische Ubersclmeidimgen entweder mit dem Protein oder anderen Teilen des N-Glykans auftreten, und Abspeichern der Strukturen ohne Ubersclmeidimgen,
j) geomeüische Optimienmg der gespeicherten Strukturen mittels einer Kraftfeldrechnung und
k) Wiederholen der Schritte h) bis j) bis alle Antennen des vorge- gebenen N-Glykans erschöpfend konsultiert sind.
15. Verfaliren zur Erzeugung eines Ensembles realistischer Konformationen spezifischer O-Glykane an Proteinen mit Hilfe eines Computersystems, das auf eine Konformationsdatenbank mit Konformationen von Sacchariden, die in O-Glykanen vorkommen, zugreifen kann, mit den folgenden Schritten:
a) Einlesen der Aminosäuresequenz imd der dreidimensionalen
Struktur eines nicht-glykolisierten Proteins,
b) Auswählen der exponiert auf der Oberfläche des Proteins/Lipids gelegenen, mögliche O-Glykolisienmgsstellen repräsentierenden Ser- imd Thr-Residuen,
c) Analyse der Hydropliilität der zu den ausgewählten Ser- und
Thr-Residuen rämnlich benachbarten Aminosäuren des Proteins und Markieren der potentielle O-Glykolisienmgsstellen repräsentierenden Residuen,
d) Abrufen einer in der Datenbank gespeicherten Konfoπnation des O-Glykans und Verknüpfen der Konfonnation mit den markierten Teilsequen- zen,
e) Einstellen einer realistischen Orientierang an jeder Ver- l üfüngsstelle mittels systematischer Rotation um die jeweilige Verknüpftmgsstelle,
f) Minimieren jeder Konformation, die überlappungsfrei eingepasst werden kann, mittels einer Kraftfeldreclmimg imd Abspeichern der minimierten
Stniküir, g) Wiederholen der Schritte d) bis f) für alle weiteren in der Datenbank gespeicherten Konfoπnationen des befrachteten Glykans,
h) Verknüpfen aller entsprechenden in der Datenbank für Di-, Tri-, Tetra- und oder Pentasaccharide abgelegten Konfonnationen mit dem Protein- gerüst in der Art, dass immer das letzte Residuiun des bereits konsultierten Teils der Gesamtsequenz identisch ist mit dem ersten Residuiun der zu verknüpfenden Teüstruk ur,
i) Prüfen, ob bei der Verknüpftmg gemäß Schritt h) geometrische Überschneidungen entweder mit dem Protein oder anderen Teilen des O-Glykans auftreten, und Abspeichern der Stniküiren ohne Uberschneidimgen,
j) geometrische Optimierung der gespeicherten Stniküiren mittels einer Kraftfeldreclmimg und
k) Wiederholen der Schritte h) bis j) bis alle Antennen des vorgegebenen O-Glykans erschöpfend konsultiert sind.
16. Verfaliren zur Erzeugung eines Ensembles realistischer Konfonnationen spezifischer Glykoanteile von Glykolipiden mit Hilfe eines Computersystems, das auf eine Konfonnationsdatenbank mit Konfonnationen von Sacchariden, die in Glykolipiden vorkommen, zugreifen kann, mit den folgenden Schritten:
a) Einlesen der Aminosäuresequenz und der dreidimensionalen Stniktur eines nicht-glykolisierten Lipids, b) Auswählen der mögliche Glykolisienmgsstellen repräsentierenden Teilsequenzen der Aminosäuresequenzen,
c) Abrufen einer in der Datenbank gespeicherten Konfonnation des Core-Bereichs des jeweiligen Glykoanteils und Verknüpfen der Konfonnation mit den markierten Teilsequenzen,
d) Einstellen einer realistischen Orientienmg an jeder Ver- knüpfüngsstelle mittels systematischer Rotation n die jeweilige Verknüpftmgsstelle,
e) Minimieren jeder Konfoπnation, die überlappungsfrei eingepasst werden kann, mittels einer Kraftfeldreclmimg imd Abspeichern der minimierten
Struktur,
f) Wiederholen der Schritte c) bis e) ftir alle weiteren in der Datenbank gespeicherten Konfonnationen des befrachteten Glykoanteils,
g) Verknüpfen aller entsprechenden in der Datenbank für Di-, Tri-, Tefra- und/oder Pentasaccharide abgelegten Konfonnationen mit dem Lipidge- rüst in der Art, dass immer das letzte Residuiun des bereits konsultierten Teils der Gesamtsequenz identisch ist mit dem ersten Residuum der zu verknüpfenden Teüstruktur,
h) Prüfen, ob bei der Verknüpfung gemäß Schritt g) geometrische Ubersclmeidimgen entweder mit dem Lipid oder anderen Teilen des Glykolipids auftreten, und Abspeichern der Strukturen olme Überschneidungen, i) geometrische Optimierung der gespeicherten Sfrukturen mittels einer Kraftfeldrechnung und
j) Wiederholen der Schritte g) bis i) bis alle Antennen des vorgegebenen Glykolipids erschöpfend konstruiert sind.
17. Verfaliren nach einem der Ansprüche 14 bis 16, dadurch gekennzeichnet, dass der Energieinlialt aller erhaltenen Glykoproteine/Glykolipide berechnet und als ein Kriterium für eine Sortierang verwendet wird.
18. Verfahren nach Anspruch 17, dadurch gekennzeichnet, dass Strakttiren oberhalb einer vorgebbaren energetischen Schwelle automatisch verworfen werden.
19. Verfahren nach Ansprach 18, dadurch gekennzeichnet, dass bestimmte geometrische Kenngrößen und Energieinhalte der berechneten Strukturen ausgegeben werden.
Applications Claiming Priority (5)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| DE19951923 | 1999-10-28 | ||
| DE19951923 | 1999-10-28 | ||
| DE10032652A DE10032652A1 (de) | 1999-10-28 | 2000-05-04 | Computerbasierte Verfahren zur automatischen virtuellen Analyse der dreidimensionalen Struktur von Glykoproteinen und-lipiden |
| DE10032652 | 2000-05-04 | ||
| PCT/DE2000/003783 WO2001031345A2 (de) | 1999-10-28 | 2000-10-26 | Computerbasierte analyse der dreidimensionalen strukturen von glykoanteilen |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| EP1259817A2 true EP1259817A2 (de) | 2002-11-27 |
Family
ID=26006296
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| EP00983063A Withdrawn EP1259817A2 (de) | 1999-10-28 | 2000-10-26 | Computerbasierte analyse der dreidimensionalen strukturen von glykoanteilen |
Country Status (2)
| Country | Link |
|---|---|
| EP (1) | EP1259817A2 (de) |
| WO (1) | WO2001031345A2 (de) |
-
2000
- 2000-10-26 WO PCT/DE2000/003783 patent/WO2001031345A2/de not_active Ceased
- 2000-10-26 EP EP00983063A patent/EP1259817A2/de not_active Withdrawn
Non-Patent Citations (1)
| Title |
|---|
| See references of WO0131345A2 * |
Also Published As
| Publication number | Publication date |
|---|---|
| WO2001031345A2 (de) | 2001-05-03 |
| WO2001031345A3 (de) | 2002-04-04 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| DE69704438T2 (de) | Verfahren,vorrichtung und programm zur synthesebasierten simulation von chemikalien mit biologischen funktionen | |
| McCormick | Visualization in scientific computing | |
| DE69937292T2 (de) | Screening nach bindepartnern und deren design nach röntgenkristallographie | |
| DE60113381T2 (de) | Automatisierung im proteinentwurf durch proteinbibliotheken | |
| DE69329920T2 (de) | Verfahren zur analyse der struktur von stabilen zusammengesetzten biopolymerligandmolekuelen | |
| CN110044997B (zh) | 一种体内药物的离子强度虚拟校正和定量质谱成像分析方法 | |
| DE102022210046A1 (de) | Rechnergestützte neuronales-netz-kraftfeld-trainingsroutinen für molekulardynamik-computersimulationen | |
| Reznikov et al. | Altered topological blueprint of trabecular bone associates with skeletal pathology in humans | |
| WO2001031345A2 (de) | Computerbasierte analyse der dreidimensionalen strukturen von glykoanteilen | |
| DE112017004738T5 (de) | Bestimmung von molekularen Strukturen und molekularen Anordnungsstrukturen aus Impulsübertrag-Querschnittsverteilungen | |
| EP1513092B1 (de) | Verfahren zur Konformationsanalyse von Aminosäuresequenzen | |
| DE10032652A1 (de) | Computerbasierte Verfahren zur automatischen virtuellen Analyse der dreidimensionalen Struktur von Glykoproteinen und-lipiden | |
| WO2004006189A1 (en) | Imaging apparatus and method | |
| DE69815718T2 (de) | Verfahren zur vorhersage, identifizierung und beschreibung von molekülen die ein gewünschtes verhalten aufweisen, inbesondere im pharmazeutischen sektor und derart hergestellte moleküle | |
| DE102004046154A1 (de) | Verfahren zur Massenspektrometrie | |
| Besancon et al. | New visualization of dynamical flexibility of N-Glycans: Umbrella Visualization in UnityMol | |
| Grootenhuis et al. | Carbohydrates and drug discovery—the role of computer simulation | |
| DE60212830T2 (de) | Surf2lead | |
| EP1094415A2 (de) | Verfahren zur Identifizierung von Kandidatenmolekülen | |
| EP1451750B1 (de) | Verfahren zur identifikation von pharmakophoren | |
| Li et al. | COCOA: A Framework for Fine-scale Mapping Cell-type-specific Chromatin Compartmentalization Using Epigenomic Information | |
| EP1682917B1 (de) | Verfahren zur verifikation der korrekten räumlichen struktur von molekülen mittels nmr-spektroskopie | |
| Lengauer | Molekulare Bioinformatik: Eine interdisziplinäre Herausforderung | |
| Poole et al. | A computer program for the morphometric analysis of cell profiles | |
| Ascoli | Computing the brain and the computing brain |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| PUAI | Public reference made under article 153(3) epc to a published international application that has entered the european phase |
Free format text: ORIGINAL CODE: 0009012 |
|
| 17P | Request for examination filed |
Effective date: 20020528 |
|
| AK | Designated contracting states |
Kind code of ref document: A2 Designated state(s): AT BE CH CY DE DK ES FI FR GB GR IE IT LI LU MC NL PT SE |
|
| STAA | Information on the status of an ep patent application or granted ep patent |
Free format text: STATUS: THE APPLICATION IS DEEMED TO BE WITHDRAWN |
|
| 18D | Application deemed to be withdrawn |
Effective date: 20040502 |