EP3589753A1 - Verfahren zur detektion von bekannten nukleotid-modifikationen in einer rna - Google Patents

Verfahren zur detektion von bekannten nukleotid-modifikationen in einer rna

Info

Publication number
EP3589753A1
EP3589753A1 EP18710996.2A EP18710996A EP3589753A1 EP 3589753 A1 EP3589753 A1 EP 3589753A1 EP 18710996 A EP18710996 A EP 18710996A EP 3589753 A1 EP3589753 A1 EP 3589753A1
Authority
EP
European Patent Office
Prior art keywords
signature
phase
nucleotide
different
rna
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Withdrawn
Application number
EP18710996.2A
Other languages
English (en)
French (fr)
Inventor
Mark Helm
Ralf Hauenschild
Lyudmil Tserovski
Stephan Werner
Andreas Hildebrandt
Jennifer Leclaire
Thomas Kemmer
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Johannes Gutenberg Universitaet Mainz
Original Assignee
Johannes Gutenberg Universitaet Mainz
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Johannes Gutenberg Universitaet Mainz filed Critical Johannes Gutenberg Universitaet Mainz
Publication of EP3589753A1 publication Critical patent/EP3589753A1/de
Withdrawn legal-status Critical Current

Links

Classifications

    • CCHEMISTRY; METALLURGY
    • C12BIOCHEMISTRY; BEER; SPIRITS; WINE; VINEGAR; MICROBIOLOGY; ENZYMOLOGY; MUTATION OR GENETIC ENGINEERING
    • C12QMEASURING OR TESTING PROCESSES INVOLVING ENZYMES, NUCLEIC ACIDS OR MICROORGANISMS; COMPOSITIONS OR TEST PAPERS THEREFOR; PROCESSES OF PREPARING SUCH COMPOSITIONS; CONDITION-RESPONSIVE CONTROL IN MICROBIOLOGICAL OR ENZYMOLOGICAL PROCESSES
    • C12Q1/00Measuring or testing processes involving enzymes, nucleic acids or microorganisms; Compositions therefor; Processes of preparing such compositions
    • C12Q1/68Measuring or testing processes involving enzymes, nucleic acids or microorganisms; Compositions therefor; Processes of preparing such compositions involving nucleic acids
    • C12Q1/6869Methods for sequencing
    • GPHYSICS
    • G16INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
    • G16BBIOINFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR GENETIC OR PROTEIN-RELATED DATA PROCESSING IN COMPUTATIONAL MOLECULAR BIOLOGY
    • G16B30/00ICT specially adapted for sequence analysis involving nucleotides or amino acids
    • GPHYSICS
    • G16INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
    • G16BBIOINFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR GENETIC OR PROTEIN-RELATED DATA PROCESSING IN COMPUTATIONAL MOLECULAR BIOLOGY
    • G16B35/00ICT specially adapted for in silico combinatorial libraries of nucleic acids, proteins or peptides
    • GPHYSICS
    • G16INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
    • G16BBIOINFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR GENETIC OR PROTEIN-RELATED DATA PROCESSING IN COMPUTATIONAL MOLECULAR BIOLOGY
    • G16B35/00ICT specially adapted for in silico combinatorial libraries of nucleic acids, proteins or peptides
    • G16B35/10Design of libraries
    • GPHYSICS
    • G16INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
    • G16BBIOINFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR GENETIC OR PROTEIN-RELATED DATA PROCESSING IN COMPUTATIONAL MOLECULAR BIOLOGY
    • G16B35/00ICT specially adapted for in silico combinatorial libraries of nucleic acids, proteins or peptides
    • G16B35/20Screening of libraries
    • CCHEMISTRY; METALLURGY
    • C12BIOCHEMISTRY; BEER; SPIRITS; WINE; VINEGAR; MICROBIOLOGY; ENZYMOLOGY; MUTATION OR GENETIC ENGINEERING
    • C12QMEASURING OR TESTING PROCESSES INVOLVING ENZYMES, NUCLEIC ACIDS OR MICROORGANISMS; COMPOSITIONS OR TEST PAPERS THEREFOR; PROCESSES OF PREPARING SUCH COMPOSITIONS; CONDITION-RESPONSIVE CONTROL IN MICROBIOLOGICAL OR ENZYMOLOGICAL PROCESSES
    • C12Q2521/00Reaction characterised by the enzymatic activity
    • C12Q2521/10Nucleotidyl transfering
    • C12Q2521/107RNA dependent DNA polymerase,(i.e. reverse transcriptase)
    • CCHEMISTRY; METALLURGY
    • C12BIOCHEMISTRY; BEER; SPIRITS; WINE; VINEGAR; MICROBIOLOGY; ENZYMOLOGY; MUTATION OR GENETIC ENGINEERING
    • C12QMEASURING OR TESTING PROCESSES INVOLVING ENZYMES, NUCLEIC ACIDS OR MICROORGANISMS; COMPOSITIONS OR TEST PAPERS THEREFOR; PROCESSES OF PREPARING SUCH COMPOSITIONS; CONDITION-RESPONSIVE CONTROL IN MICROBIOLOGICAL OR ENZYMOLOGICAL PROCESSES
    • C12Q2525/00Reactions involving modified oligonucleotides, nucleic acids, or nucleotides
    • C12Q2525/10Modifications characterised by
    • C12Q2525/117Modifications characterised by incorporating modified base
    • CCHEMISTRY; METALLURGY
    • C12BIOCHEMISTRY; BEER; SPIRITS; WINE; VINEGAR; MICROBIOLOGY; ENZYMOLOGY; MUTATION OR GENETIC ENGINEERING
    • C12YENZYMES
    • C12Y207/00Transferases transferring phosphorus-containing groups (2.7)
    • C12Y207/07Nucleotidyltransferases (2.7.7)
    • C12Y207/07049RNA-directed DNA polymerase (2.7.7.49), i.e. telomerase or reverse-transcriptase

Definitions

  • the present invention relates to a method of detection, i. Determination of number and position (locus) of a selected known nucleotide modification in one or more RNAs (including transcriptome).
  • RNA ribonucleic acid (ribonucleic acid)
  • mRNA messenger RNA (messenger RNA)
  • tRNA transfer RNA
  • rRNA ribosomal RNA
  • ml A Nl-methyladenosine (m'A)
  • mlG Nl-methylguanosine (m'G)
  • dNTP deoxynucleotide triphosphate
  • the transcriptome that is to say the entirety of the RNA transcripts (ie the RNA polymerase read or transcribed genes) of a genome of a cell or of a cell type or of an organism, in particular mRNAs, tRNAs and rRNAs, but also others encoding RNAs plays a crucial role in various aspects of gene expression, cell development and cell function. Errors in the transcriptome, for example due to modified nucleotides in an mRNA or tRNA or rRNA, can lead to diseases. The identification and characterization of various types of RNA base modifications in different types of RNA have become increasingly important in recent years. Interest in current research is growing, and this field continues to grow in importance.
  • RNAs reverse transcriptases
  • RTases reverse transcriptases
  • RNA selected as template which are obtained in a reverse transcription (RT) for short with a specific RTase, are first amplified and then sequenced.
  • RT reverse transcription
  • the resulting sequencing data of the cDNAs are compared with the genomic reference sequence, and in the course of the so-called “mapping" the sequenced cDNAs / reads are assigned to the reference genome or reference transcriptome.
  • RTase reverse transcriptase
  • RT signature The type and number of different RT events form a characteristic event pattern, the so-called reverse transcription signature (in the following: RT signature) at each individual nucleotide position.
  • the RT signature for the nucleotide positions of an RNA under study is in principle based on the characteristic features abort events and mismatch read-through events (ie read-through events with missinkorpor convinced or mismatched cDNA building blocks).
  • mapping results obtained after reverse transcription, amplification, sequencing and mapping for this template RNA are examined and evaluated as to whether and, if so, at which nucleotide position which RT Events occur at what frequency and hence what the RT signatures look like for each nucleotide position.
  • RT signature for the relevant template RNA can be closed to existing nucleotide modifications. If a particular characteristic RT signature could be determined for a specific nucleotide modification, as has been done in the prior art for mlA, the presence of the relevant nucleotide modification in the template can be determined by comparison with this known and modification-specific RT signature Be closed.
  • the template RNA may be a particular RNA species, as well as a group of different RNA species.
  • Amplification and sequencing of the cDNAs are usually carried out in the prior art with sequencing methods based on high throughput methods in the form of massive parallel sequencing, the so-called “Next-Generation Sequencing” (NGS), and in which the acquired sequence data are output in digital form ,
  • NGS Next-Generation Sequencing
  • next-generation sequencing is so-called "bridge amplification sequencing”.
  • a different adapter DNA sequence is introduced at each end of the (double-stranded) DNA to be sequenced.
  • the DNA is denatured, after dilution (single-stranded) hybridized to a support plate and amplified by bridge amplification.
  • the carrier plate On the carrier plate, individual regions (clusters) of amplified DNA are formed which have the same sequence within a cluster.
  • a sequencing-by-synthesis-related PCR reaction ie, a PCR reaction in which synthesis is sequenced
  • modified nucleotides coupled to a reversible 3 'blocker and a fluorescent label each of the four nucleotides with a different colored fluorescent label coupled
  • the built-in nucleotide per cycle in a cluster is detected.
  • mapping is preferably carried out by means of computer-aided alignment methods known in the art, and the evaluation (analysis) of the mapping results with regard to the reverse transcription event pattern (the RT signature) is usually computer-assisted.
  • the characteristic RT signature described in the prior art for mlA was determined using computer-aided, automatic and supervised machine learning-based classification techniques known and well known in the art.
  • the determined RT signature for mlA (ie, at mlA sites) was used for the review and confirmation of suspect objects. Suspected positions of mlA in the Sequences of several human R As could be confirmed, and in trypanosoma brucei tRNA previously unknown m lA positions were determined by signature matching and sequence homology.
  • RTase reverse transcriptase
  • a solution to this problem is to provide a method for determining the number and position (locus) of a selected (predetermined), known Nucleotide modification in one or more RNAs (including transcriptome) of the so-called template RNA (s), comprising the following steps in the order named:
  • a first phase (I) of the method the calibration phase, steps (1) to (5) with one or more different, known and with respect to nucleotide sequence and optionally present nucleotide modification (s) identified and annotated RNAs as template RNAs and in step (5) determined RT signatures of nucleotide positions with the known nucleotide modification and detected RT signatures of nucleotide positions of the same nucleoside without nucleotide modification are fed into the classification system, and the classification system during training - and self-test (classification) run implicitly (“learns") the (characteristic) profile of the RT signature (ie the characteristic quantitative expression of the RT signature features) at the nucleotide modification having nucleotide position, and (as a result) as a classification result those positions on the (each ) Detects and reports TempIate RNA (s) that have an RT signature that approximately or completely coincides with, ie, is similar to, or with, this (
  • steps (1) to (5) are carried out with one or more unknown test RNA (s) to be examined as template RNA (s) , and steps (1) to (4) are performed under the same conditions as in phase (I), and RT signatures of (preferably all or nearly all) nucleotide positions of the test template RNA determined in step (5) (s) are fed into the classification system, and the classification system classifies the (and preferably each of) the entered RT signatures based on the (implicitly) profile implicitly learned in step (I) step (5) (ie, criterion) to what extent (ie to what degree or degree) they are similar or coincident to this profile, and where classification results have the meaning of "similar” or “approximately coincidental” or “consistent” (ie classification results, which correspond to the statement "similar” or “approximately coincident” or “consistent”) indicate the presence of the relevant nucleotide
  • step (1) of phase (I) and phase (II) of the method the reverse transcription of the template RNAs in two or more reaction mixtures and run through with different RTases under the same reaction conditions and / or with the same RTase (s) is carried out under different reaction conditions per batch, with / from each batch a cDNA library is obtained,
  • phase (I) and phase (II) of the method for evaluating the mapping results with respect to the RT signature the event (s) 'abort' and / or 'read-through' Mismatch 'and / or the additional event' read-through with sequence gap (s) (jump / jumps) 'determined and evaluated as RT signature feature (s),
  • phase (I) and phase (II) of the method data sets of RT signatures of (all or almost all or at least nucleotide positions with the base type of the respective nucleotide modification determined) the cDNA libraries obtained in step (1) which interact with the different RTases under the same reaction conditions and / or with the same RTase (s) were received into the classification system.
  • RNAs to be investigated including transcriptome, the template RNA (s), consists of two phases ( I) and (II):
  • RNAs identified and annotated with regard to their nucleotide sequence and optionally the selected selected nucleotide modifications as template RNA (s)
  • RNAs preferred are synthetic RNAs or RNAs isolated from natural sources according to database Information from eg MODOMICS according to Machnicka et al., 2013
  • RTases including or modified by mutations specifically for this purpose
  • RTases including or modified by mutations specifically for this purpose
  • the same reaction conditions and / or with (the) same RTase (s) under different reaction conditions per batch and creating cDNA libraries, one each per reaction run, wherein each created cDNA library, the reverse transcription products (cDNAs) of the RTase used in the relevant reaction run from the one or the ver used template RNA (s).
  • step 2 For each cDNA library (obtained in step 1), amplification of the cDNAs and sequencing of the amplified cDNAs are carried out by a high-throughput sequencing method, whereby the obtained sequence data, i. the sequence information of the individual cDNAs (synonym: reads), are output in digital form. Preference is given here to "sequencing with bridge amplification", e.g. the Illumina sequencing method.
  • adapter trimming removal of the adapter sequences
  • Preferred here is the use of a computer-based method for sequence alignment and sequence analysis, for example the Bowtie 2 software.
  • step (4) feeding the (digitized) data (data sets) of the RT-signatures of all or almost all or at least those RT-signatures determined at the nucleotide positions with the base type of the respective nucleotide position into a computer-based, automatic one , machine-based and supervised learning-based classification system (synonyms: classification method, classifier), eg into a Random Forest classifier, and train this (learning) classification system on the particular (characteristic, typical) profile of the RT signatures obtained in step (4) (ie on the characteristic quantitative expression of the RT signature features) for the resp at the nucleotide position (s) with the relevant nucleotide modification (ie having the relevant nucleotide modification), such that it determines as a classification result those positions on the template RNA (s) and indicating having an RT signature that approximately or completely matches that profile, ie which are similar or in agreement with it, and thus indicate the presence of the relevant nucleotide modification at these positions.
  • phase II the analysis or investigation phase with at least one test RNA, the following steps are carried out in the order named:
  • phase I step (1) reverse transcription of the test RNA (s) to be tested as template RNA (s) under the same conditions as in phase I step (1), i. with the RTase (s) and reaction conditions used in phase I step (1) and preparation of cDNA libraries (one per batch) comprising the reverse transcription products of the particular RTase (s) used for this test template RNA (s) included.
  • step (2) Amplifying the cDNAs recovered in step (1) and sequencing the amplified cDNAs using the method used in step I step (2), wherein the obtained sequence data (reads) are output in digital form.
  • each entered RT signature is classified according to how similar it is to this profile. (That is, each entered RT signature is classified in terms of the criterion of how much, or to what degree or degree, that it resembles or conforms to that profile.) Classification results corresponding to the statement “similar” or “approximately consistent” or “consistent "indicate the presence of the subject nucleotide modification in the test template RNA (s) at the nucleotide position with this RT signature.
  • the core result of the classification is the indication of the determined positions on the test template RNA (s) that have an RT signature that approximately or fully matches this (particular) profile, i. which is similar or in agreement with it, and thus indicates the presence of the subject nucleotide modification at these positions.
  • a numerical score is given on a one-dimensional numeric rating scale as a measure of the quality of the match.
  • the method according to the invention is based on the surprising findings:
  • the RT signature at a nucleotide modification site depends not only on the type of nucleotide modification, but also on the RTase type (the RTase species). Because of their very specific and characteristic behavior at the site of a nucleotide modification, an RTase type-specific RT signature is obtained at this nucleotide position. (ii) By combining at least two RTases of different types in reverse transcription, surprisingly large improvements in predictive performance are obtained by means of classifiers.
  • the RT signature is characterized not only by the special features (special RT events) abort and mismatch read-through (broken down into overall rate and single rates of the various mismatches), but also by the feature "read-through events with sequence gap (s) (Synonyms: jump / jumps; Jump (s)) "short” Jump-Read-Through ", ie by events in which the RTase skips the site of nucleotide modification.
  • This feature "jump-read-through” can also be further broken down into: total jump rate, rate of direct single jumps, rate of delayed single jumps and rate of double jumps.
  • the reverse transcription event of RTases at a nucleotide modification site can not only consist of transcription termination or read-through with mismatch / mismatch, but also in jumps of the RTase in question across the position of the modified nucleotide, resulting in characteristic gaps in the sequence reading.
  • Such jumps were found especially in RTases with a high coverage / coverage rate, ie with a strong read-through capability.
  • Single and double jumps can be distinguished, and the single jumps can be either direct or delayed single jumps, that is, the (skipped) gap is either directly at the mlA site or at the location of its 5 'adjacent neighbor when - 1 position. Double jumps lead to appear as gaps at the two positions mlA- and-1.
  • step (4) of phase (I) and phase (II) of the method for the evaluation of the mapping results with respect to the RT signature all three events' abort 'and' read-through with mismatch 1 and 'read-through with sequence gap (s) (jump (s), jump / jumps)' qualitatively and quantitatively determined and evaluated as forming characteristics. This enhances the conciseness and uniqueness of each RT signature.
  • the analogous reaction mixtures and runs are carried out with at least two reverse transcriptases ("RTases") whose RT signatures at or for the nucleotide modification site in question the weighting (synonyms: importance, importance) of their RT signature features have a different pattern.
  • the patterns differ in the weighting of at least one of the features such that this feature is pronounced in the RT signature of one RTase and weak in the RT signature of the other RTase or at least significantly less pronounced.
  • Particularly preferred different patterns are those having a mutually opposite pattern in at least two RT signature features (M1 and M2, e.g., the arrest rate and the Mismach rate). That is, of the characteristics involved, e.g. Ml and M2 are strong in one RTase (A) feature Ml, and feature M2 is weak, while in the other RTase (B) the ratios are reversed, namely, Ml is weak and M2 is strong.
  • M1 and M2 e.g., the arrest rate and the Mismach rate
  • RTases used in step (1) of the calibration phase (phase I) and the application or examination phase (phase II) may also be well according to the invention which have been generated for this purpose by mutations.
  • step (1) of phase I and phase II it is possible, in particular, for (a) different concentrations of dNTPs, and / or (b) different divalent cations, in particular Mg 2+ and Mn 2+, and / or (c) different concentrations of divalent cations and / or (d) different pH values and / or (e) different temperatures and / or (f) different concentrations of polyethylene glycol (PEG).
  • dNTPs different concentrations of dNTPs
  • divalent cations in particular Mg 2+ and Mn 2+
  • PEG polyethylene glycol
  • RNA modification mlA For detection of other RNA modifications, especially those for which sequencing data analysis provides a typical profile of the RT signature, e.g. Guanosine derivatives Nl -Methyl guanosine (mlG) and N2, N2-dimethylguanosine (m2.2G), it is also suitable and intended.
  • An embodiment of the method according to the invention is therefore in particular that the nucleotide modification is a nucleoside methylation, in particular a Nl methylation of adenosine or guanosine.
  • step (2) of phase I and phase II of the method according to the invention has a sequencing with bridge amplification, in particular an illumina sequencing method, proved to be well suited.
  • mapping i. the assignment of the sequenced cDNAs / reads to the reference genome or reference transcriptome by computer-aided AI ignment- method in step (3) of Phase I and Phase II of the method has in practice a computer-based method for sequence AI ignment and sequence analysis, such as eg the Bowtie 2 software proved to be well suited.
  • a Random Forest classifier As a computer-based automatic machine learning-based classification system in step (5) of phase I and phase II of the method of the invention, a Random Forest classifier has been found to work well.
  • the sequence data obtained in step (2) for the implementation of steps (3) to (5) are fed into a bioinformatics pipeline which controls the combination of steps (3) to (5) .
  • a bioinformatics pipeline ie the software program that completes steps (3) to (3) (5) combined in the prescribed order or coupled to each other, can be created according to the invention with the programming language Python (Version v2.7.6).
  • the known RNAs used in the calibration phase (phase I) step (1) according to the invention are preferably synthetic RNAs of known sequence including known positions of the relevant (selected) nucleotide modification or natural RNAs isolated on the basis of database information, the sequence of which, including the positions of the relevant (selected) nucleotide modification according to the relevant database entries, is well understood.
  • step (5) of phase II and optionally also of phase I for each classification result a numerical score is given on a one-dimensional numerical rating scale as a measure of the quality of the match.
  • the present invention also provides a kit for carrying out the method according to the invention, which comprises at least two RTases whose RT signatures at the relevant nucleotide modification point have an effect on the weighting of the RT signature features (termination rate, overall mismatch rate, Single mismatch rates of the respective mismatched nucleotides, total hopping rate, rate of direct hops, rate of delayed hops, double hopping rate) have a different, preferably opposite, pattern in at least one of the RT signature features.
  • Opposite pattern in at least one RT signature feature means here that, for example, the feature Ml is pronounced in RTase A and only weakly in RTase B.
  • the kit comprises at least two different premixed reaction mixtures (synonyms: reaction mixtures, buffer mixtures) which are preferably in the concentration of dNTPs and / or divalent cations and / or polyethylene glycol (PEG) and / or in the nature of the divalent compounds present Cations (especially Mg2 + and Mn2 +) and / or in the pH, differ.
  • reaction mixtures buffer mixtures
  • PEG polyethylene glycol
  • the template RNA (s) is required for carrying out the method according to the invention with such a kit.
  • the method according to the invention is a powerful tool for the detection of modified nucleotides in RNA on the basis of the RT signature at the odhuisstelle, ie based on the analysis of the modification-specific behavior of RTase during the reverse transcription of the RNA to cDNA. It allows for accurate localization of RNA modifications in a single nucleotide resolution, and thus, for example, a much more accurate identification and prediction of mlA sites than conventional methods, and it may in principle be just as useful for analyzing other modifications such as m lG or m2.2G are used.
  • step (1) of phase (I) and phase (II) of the method Carrying out the reverse transcription of the template RNA (s) in step (1) of phase (I) and phase (II) of the method in two or more parallel (analogous) reaction batches and reaction runs with RTases different from one another and / or with under different reaction conditions per batch, and the comparison of the thus obtained and usually not quite identical RT signatures for the same nucleotide modification site makes it possible to clarify the characteristics of the RT signature for the relevant nucleotide modification site in more detail and further specify.
  • the more succinctly and more specifically the characteristic features for the RT signature can be given at a particular nucleotide modification site the more accurate can be found for the RT signature of the reverse transcription of a test template RNA (eg from a patient sample), whether or not it represents an embodiment of this known RT signature, ie whether or not the nucleotide modification in question is present in the test template RNA (s).
  • a test template RNA eg from a patient sample
  • the method according to the invention is a universal method for the transcriptome-wide detection of RNA modifications involving very specific properties of the reverse transcription or the RTase, which allows detection of individual, modified nucleotides within the sequence solely on the basis of their characteristic RT signature.
  • An accumulation of sequence regions obtained by immunoprecipitation, which contain (presumably) the nucleotide modification, can be completely dispensed with here.
  • the method according to the invention can be used in the field of clinical diagnostics by analytical service providers or medical-diagnostic laboratories and can be used to customize the personalized medicine with regard to patient-specific Further develop diagnostics.
  • analytical service providers or medical-diagnostic laboratories can be used to customize the personalized medicine with regard to patient-specific Further develop diagnostics.
  • many new insights can be expected in the field in the coming years, which makes the precise determination of modified sequence positions or nucleotide positions all the more important.
  • the method of the invention makes it possible to make serious statements about their effect and function and a routine application in an economical manner.
  • Analytical service providers or clinical diagnostic laboratories can analyze patient-derived RNA samples and generate a report of classified modification candidates, providing additional information for the patient's diagnostic workup.
  • Figure 1 The inventive principle of generation (generation) and analysis (evaluation) of RNA sequencing data for the detection of m lA residues
  • Figure 2 A) The RT-signature of a MIA point obtained by a conventional method using a single RTase ( "single RT-signature"), here the RTase 5 (SuperScript ® III), that is, with use of the RT-signature an RT approach using only the RTase 5 (SuperScript ® III.) According to Table 1.
  • RT signature of an IA site obtained by the method according to the invention in which the information of the RT signature is combined from two different RT approaches which differ in the RTase used.
  • the ienexen RTases were (i) 12 RTase (SuperScript ® IV) and (ii) RTase 4 (GoScript TM) according to Table 1 below.
  • FIG. 3 mlA signatures of 13 RTases at 26 mlA sites in the cytosolic tRNA from yeast.
  • the size of the pie charts represents the overall hop rate, i. the
  • Single jump direct 1 nucleotide was omitted and skipped at m lA itself.
  • Single-bound delay 1 nucleotide was omitted at the 5 'adjacent position of mlA and skipped.
  • Double jump 2 nucleotides were skipped and skipped, at the mlA site and at the -1 position.
  • the percentages of the abort rate refer to the reads comprising the 3 'adjacent position of m lA (+1).
  • the percentages of mismatch rate and hopping rate refer to the reads comprising the m l A position.
  • Figure 4 Random Forest Execution and weighting of RT signature features for 13 different RTases.
  • Classification power is represented as the Area Under Curve (AUC) of the Receiver Operating Characteristic (ROC).
  • AUC Area Under Curve
  • ROC Receiver Operating Characteristic
  • Weighting average loss of classification accuracy as the values of the respective features between the training instances (m lA instances and non m lA instances) permute, i. E. be replaced.
  • Figure 5 Random Forest implementation for determining the prediction performance under
  • FIG. 6 Box plot (box whisker plot, box graphic) for the m lA prediction performance of the Random Forest classification, which is combined with the information or data of the RT signature features of an RT signature (from one of the 13 different RTases ), two RT signatures (from one of the 156 RTase pairs), and three RT signatures (from one of the 1716 RTase triplets).
  • AUC Area Under Curve
  • the boxes indicate the area in which the middle 50% of each data population is located.
  • the whiskers mark the percentile values 5% and 95%, i. the values that form the boundary to the lower 5% and the upper 5% of the data, respectively.
  • Figure 7 An example of a profile file.
  • Mismatch type 1, type 2 and type 3 are synonymous with the three concrete mismatches with the three bases that naturally occur next to the reference base (and its modification) in the genome; ie in the case of a modification of A, the mismatch types G, T and C.
  • Example 1 Recovery of Template RNAs for the Calibration Phase (Phase I)
  • RNA (s) used in the calibration phase and identified with respect to their nucleotide sequence and optionally the selected selected nucleotide modifications were either synthetic RNAs (commercially available eg from IBA, Göttingen, Germany) or RNAs derived from natural sources For example, yeast RNAs whose sequence information from databases such as MODOMICS are known.
  • yeast rRNA and yeast tRNA were recovered by known and well known methods, e.g. as in Tserovski et al. (2016).
  • RNA 0.5 ⁇ g was used per sample / batch for a reverse transcription (reaction).
  • the protocol corresponds in principle to that in Tserovski et al. (2016).
  • EDTA ethylenediaminetetraacetic acid
  • the template RNA (s) (about 0.5 ⁇ g per sample / batch) was dephosphorylated at both endpoints.
  • the dephosphorylation mixture (total 10 ⁇ ) consisted of 100 mM Tris-HCl, pH 7.4, 20 mM MgCl 2 , 0.1 mg / ml BSA, 100 mM 2-mercaptoethanol and 0.5 U FastAP Alkaline Phosphatase (Thermo Scientific, # EF0651) at 37 ° C for 30 min. Before the addition of the enzyme, the RNA was denatured at 90 ° C for 30 sec and then cooled on ice (hereinafter, this treatment is called "heat denaturation").
  • the RNA was heat denatured again for 30 sec and then the described dephosphorylation step was performed a second time.
  • an adapter was ligated (ligated) to the 3 'end of the dephosphorylated RNA.
  • the ligation (attachment) of the preadeylated 3 'RNA adapter (whose 5' end was blocked by a C6 body) to the 3 'end of the RNA was as described in Tserovski et al.
  • ligases in this case T4 RNA Ligase 2 truncated, New England Biolabs, # M0242L, and T4 RNA Ligase, Thermo Scientific, # EL0021
  • T4 RNA Ligase 2 truncated New England Biolabs, # M0242L
  • T4 RNA Ligase Thermo Scientific, # EL0021
  • the ligation reaction was carried out at 4 ° C overnight. Subsequently, the enzymes were inactivated at 75 ° C for 15 min.
  • RNA adapter Prior to the step of reverse transcription, the excess of RNA adapter was removed using the enzymes deadenylases and exonucleases (here 5'-deadenylase, New England Biolabs, # M0331S and Lambda Exonuclease, Thermo Scientific, # EN0561).
  • deadenylases and exonucleases here 5'-deadenylase, New England Biolabs, # M0331S and Lambda Exonuclease, Thermo Scientific, # EN0561.
  • an amount of 20 U of 5'-deadenylase e.g., from New England Biolabs, Frankfurt, Germany
  • RNA was precipitated, here with the addition of initially 1 ⁇ glycogen (Thermo Scientific, Dreieich, Germany, # R0561) and NH4AC ammonium acetate (final concentration: 0.5 M) to a total volume of 50.0 ⁇ and subsequent Add 150 ⁇ ethanol per sample.
  • the composition of the reverse transcription mixture was as described in Tserovski et al. (2016).
  • FS First beach
  • the degradation of the RNA was then carried out by addition of NaOH (final concentration: 0.15 M), heating to 55 ° C. for 25 minutes and subsequent cooling on ice for 2 minutes.
  • the reaction was carried out by neutralization with an equal amount of acetic acid ( Final concentration: 0.15 M) stopped.
  • the cDNA pellet obtained in (F) in the reaction mixture was extracted from 1x TdT buffer, 1.25mM rCTP and 1 U / ⁇ TdT taken and resuspended.
  • the mixture was incubated at 37 ° C for 30 min. This is followed by a heat treatment at 70 ° C for 10 min. To inactivate the enzyme. - total volume: 10.0 ⁇ . Subsequently, the ligation reaction was carried out with the mixture obtained, here for example with the aid of T4 DNA ligase (Thermo Scientific, # EL0013).
  • the extraction of the cDNA ligation products from the mixture obtained was carried out by ethanol precipitation with the addition of initially 1 ⁇ glycogen (Thermo Scientific, # R0561) and NH4AC (final concentration: 0.5 M) to this mixture (total volume: 50.0 ⁇ ) and final addition of 150 ⁇ ethanol.
  • Polyacrylamide gel electrophoresis was performed to remove excess DNA adapter. For this purpose, the last pellet obtained with the ligation products in ⁇ H 2 0 were added and resuspended. This resuspended ligation product mixture was applied to a denaturing 10% polyacrylamide gel. After electrophoresis, the areas of the size range between 40 nt and 150 nt were excised from the gel and eluted overnight with 300 ⁇ M 0.5 M NH4AC.
  • the recovery of the cDNA ligation products from the recovered eluate was carried out by ethanol precipitation with the addition of initially 1 ⁇ glycogen (Thermo Scientific, # R0561) (total volume: 301.0 ⁇ ) and final addition of 750 ⁇ ethanol.
  • the cDNAs obtained from (G) were analyzed by means of the polymerase chain reaction (PCR) using a Taq polymerase, here for example the Taq polymerase from Rapidozym (# Gen-003-1000), and corresponding barcoded P5 and P7 primers, here eg each with 8 nt barcodes, amplified.
  • PCR polymerase chain reaction
  • the last pellet obtained in (G) with the ligation products of size 40 nt to 150 nt was taken up in 20 ⁇ l PCR reaction mixture and resuspended.
  • the PCR reaction mixture consisted per 20 ⁇ of lx Taq polymerase buffer, 3 mM MgCl 2> 5 ⁇ P5 primer, 5 ⁇ P7 primer, 0.5 mM dNTP mix and 0.25 U / ⁇ Taq polymerase.
  • the recovered resuspension with the adapter ligated cDNAs contained therein, the P5 and P7 primers, the Taq polymerase and the dNTPs was subjected to 12 PCR cycles.
  • the PCR started with a denaturation step (of DNA double strands in single strands) at 95 ° C for 5 min. Subsequently, 12 cycles consisting of denaturation at 95 ° C for 1 min, annealing (hybridization) at 65 ° C for 1 min and elongation at 72 ° C for 1 min.
  • the PCR was terminated with a final elongation step at 72 ° C for 5 min.
  • the recovery of the PCR products, i. of the amplified cDNAs was carried out by means of ethanol precipitation with the addition of initially 1 ⁇ glycogen (Thermo Scientific, # R0561) and NH4Ac (final concentration: 0.5 M) to this mixture (total volume: 50.0 ⁇ ) and final addition of 150 ⁇ ethanol ,
  • PCR products (amplified cDNAs) were size separated by 10% denaturing polyacrylamide gel electrophoresis (PAGE).
  • the last pellet obtained with the amplified cDNAs in 10 ⁇ 1 ⁇ 2 ⁇ was added and resuspended. This resuspension was applied to a denaturing 10% polyacrylamide gel. After electrophoresis, the gel sized areas were cut out between 150 nt (the size of adapter dimers) and 300 nt (the maximum size of PCR amplification products) and eluted overnight with 300 ⁇ M 0.5 M NR, Ac.
  • the recovery of the amplified cDNAs from the eluate was carried out by ethanol precipitation with the addition of initially 1 ⁇ glycogen (Thermo Scientific, # R0561) (total volume: 301.0 ⁇ ) and finally adding 750 ⁇ ethanol.
  • the recovered pellet containing the amplified cDNAs of size 150-300 nt was taken up in 10 ⁇ H 2 O and resuspended.
  • the cDNAs contained in this suspension were ready for sequencing, in particular also for high-throughput sequencing with NGS methods, eg "sequencing with bridge amplification".
  • the aliquots were diluted (5-500 pg / ⁇ ) and loaded on an Agilent High Sensitivity DNA chip.
  • the thus loaded chip was introduced into the analyzer.
  • the sample components DNA molecules
  • the sample components were electrophoretically separated, detected and translated into gel-like images (bands) and / or electropherograms (peaks).
  • the data was generated in digital form and automatically analyzed in real time. If the quality of the aliquot examined was satisfactory, the corresponding sample was used further.
  • Example 2 cDNA library For this purpose, the examined in terms of quality and quantity and found suitable samples of (possibly several parallel) prepared according to Example 2 cDNA library (s) were combined, denatured with 2 N NaOH and diluted (10 pM), and on the support plate, the so-called "Flow Cell", applied.
  • the determined sequence information per cDNA molecule, the "Reads”, were generated and output in digital form and were ready for injection and further processing in a bioinformatics pipeline.
  • the obtained sequencing data were checked for quality and adapter contamination. For this they were (here and preferably) examined via a bioinformatics or high-throughput sequencing pipeline with the well-known in the art software program FastQC.
  • the FastQC program created a quality control (QC) report of the detected issues that had arisen either in the sequencer or in the source library material.
  • QC quality control
  • FastQC could be run in one of two modes. It could either run as a stand-alone interactive application for instant analysis of small numbers of FastQ files, or it could run in a non-interactive mode suitable for systematically processing a large number of FastQ files. In this non-interactive mode, it was well integrated into a larger analysis pipeline.
  • the examination was carried out by means of FastQC within the MiSeq RTA software.
  • the barcode sequences from the barcoding PCR step were first identified (no fault tolerance - 0 mismatch) and then the reads (sequencing data) into individual FastQ files (one FastQ file per sample or per original cDNA). Library).
  • Adapter sequences in particular the sequences of the adapters P5 and P7 from the PCR reaction (see Example 3 (H)) and also random 10 nt sequences of the 3'-RNA adapter at the 3'-end of the RNA (see Example 2 (cf. C)) and variable number of 5'-G RNA nucleotides from the CTP cDNA tailing step (see Example 3 (G)) were removed.
  • Trimming was computer-based (here and preferably) with bioinformatics software for adapter trimming commonly used in the art, in this example the Cutadapt vi .8.1 software.
  • the mapping ie the assignment to the reference genome, was performed using the Bowtie 2 software.
  • RT signature diagnostics i. the identification and quantitative measurement of the reverse transcription event pattern for the template RNA (s) tested was done at each individual nucleotide position of the RNA of interest using software programs well known and well known in the art, e.g. the SAMtools software (version 1.2).
  • the SAM files from the mapping step were first converted into BAM files. Then the steps followed: (i) sorting and indexing the BAM files, (ii) converting the BAM files to the Pileup format, and (iii) converting the Pileup format into a custom tab-delimited text file (so-called " Profile File ").
  • Pileup format Every line of the Pileup format accurately reflects the coverage of a reference position.
  • Bases that differ from the reference base (in the template RNA) appear in Pileup format in the form of the usual letters A, G, T or C (if the respective Read in "sense" direction, ie as it is has been aligned) or a, g, t, or c (if the respective read has been aligned in anti-sense direction, ie as its reverse complement).
  • a jump over the corresponding position is displayed as an asterisk.
  • CSA context-sensitive termination rate
  • CSA is defined as the ratio of position-specific RT termination (arrest) a t at a position i to the RT abort observed in the local environment, ie in the adjacent sequences
  • the pileup Format the 5 digits before and 5 digits after the respective nucleotide position i (ie, the neighboring sequences five bases upstream (+ 5 bp) and five bases downstream (- 5 bp)) and the arrest rate at position i by the median of the Divided arrest rates of all eleven positions in this window.
  • the window size may be increased or decreased depending on knowledge of the nature of the RNA present, to improve, if appropriate, the predictive power in the cross-validation.
  • the data thus obtained were taken from the pileup format e.g. (as here and preferably) transformed into the profile format and stored there and displayed as needed.
  • FIG. 7 shows an example of such a profile file.
  • reduced-data profile files can be created, e.g. only with the data of positions corresponding to reference base A of the considered modification mlA.
  • Example 6 Computer-based and machine-learning-based supervised prediction of mlA sites
  • a computer-based, machine-based classification method e.g. B. (here and preferably) in the known and used in the art, based on decision trees Random Forest classification system (R Version v3.3.1) fed.
  • the classifier was given at least the attributes: termination rate a, total mismatch (mismatch) rate m, m / a ratio, relative mismatch composition (fraction content of G, T and C), and the context-sensitive abort rate CSA entered, and preferably also the jump rate.
  • RT mappings from known m lA sites (identified from known template RNAs) mlA sites) and to RT signatures of known unmodified (or not identifiable modified) A sites (from known template RNAs without mA sites).
  • profile files with a reduced data record created in accordance with example 5 were preferably used, ie profile files which contain only the RT signature data of the positions indicated for the relevant reference base (in this example for A) (in this example, mA or non-MLA positions).
  • mA or non-MLA positions Preferably, as described in Hauenschild et al., 2015, mlA-like non-ml A sites were included in the training to prepare the classifier for recognition of difficult cases in unknown template RNAs as well.
  • the classifiers Based on the RT signatures of the known positive ml A sites ("learned") and adapted (corrected and optimized) of the classifiers (here, for example, and preferably the Random Forest classifier, R version v3.3.1) created the special and typical (characteristic) profile for the mlA site (see Fig. 2A). In other words, the classifier implicitly learned the typical m lA-RT signature profile during the training and (self-) testing / verification runs.
  • the classifier implicitly learned the typical m lA-RT signature profile during the training and (self-) testing / verification runs.
  • the classification result consisted of a listing of all tested positions ("instances") on the template RNA (s) with a rating per position ("instance”) with respect to the decision or question as to whether the respective RT Signature with the learned typical mlA RT signature profile (see Fig. 2A) approximately or completely agree, ie that was similar to him or agreed with him.
  • the evaluation was carried out by specifying a numerical value between 0 and 1, where the value "0" corresponds to a clear “no” and the value "1" to a clear “yes".
  • Intermediate values represent a corresponding probability for a "yes” or a "no” (for example, the value 0.99 stands for a relatively very certain "yes” and the value 0.4 stands for a weak "no”).
  • the mean predictive power (sensitivity, specificity) was calculated on the basis of training and testing / verification using cross-validation.
  • the unknown template RNA (s) to be examined was prepared according to Examples 2 and 3.
  • the retrieved sequence information in the form of reads was trimmed according to Example 4 and mapped to a reference genome and examined for RT signatures according to Example 5, ie the RT signature features coverage, arrest rate ), Total mismatch rate, single mismatch rates (of the corresponding mismatched nucleotides) rate of direct single jumps (single jump Rate Direct), Single Jump Rate Delayed, Double Jump Rate were checked for presence at each nucleotide position and quantified if necessary.
  • nucleoside in question For the purpose of minimizing the expenditure, only those nucleotide positions in the profile format were stored according to example 5 and fed into the classifier having the reference base in question (the nucleoside in question).
  • a shortened runtime of the prediction procedure could be achieved by using in the profile file apparently unnatural lines (ie nucleotide positions that had been correctly transcribed by the RTase and thus where none of the characteristic RT signature features are present) by means of a simple Filters (requesting user-selected minimum values for signature characteristics) were removed in a controlled manner.
  • the classifier eg the Random Forest model
  • the classifier provided an estimate between "yes” and “no” for each nucleotide position in the transcriptome being examined and thus a listing of those positions on the unknown template RNA (s), which had an RT signature which corresponded to the particular and typical (characteristic) profile (implicitly learned by the classifier) for the relevant nucleotide modification site, here in the example for the m lA site, approximately or completely.
  • the so-called “score” a numerical score on a one-dimensional rating scale, was also indicated here (for example and preferably).
  • the creation of the score is a (possible) component of the Random Forest classifier.
  • RTases reverse transcriptases
  • RNA used for each of the RTases was the well-analyzed (annealed) total tRNA of Saccharomyces cerevisiae (available, for example, from Roche Diagnostics: Ref 10109525001 / lot 13407921), which contains sufficiently many known m lA sites.
  • the reference sequences used were a set of 43 tRNAs, compiled from the databases MODOMICS (Machnicka et al., 2013) and SRocl (Jühling et al., 2009). Among these 43 tRNAs were 26 tRNAs carrying one ml A in their sequence.
  • RTase showed large variations in their termination and mismatch rates, ie the termination and mismatch rates of the individual RTases were very different in comparison with one another (see FIG. 3).
  • RTase showed 10 (Monster Script TM) and RTase 4 (GoScript TM) demolition high and low mismatch (mismatch) -Raten during 12 RTase (SuperScript ® IV) compared to the opposite behavior exhibited.
  • a hitherto unknown phenomenon was surprisingly found to be of varying severity in the individual RTases: in the sequencing data sets of some RTases, characteristic sequence gaps were recognizable at mlA sites, which indicate jumps in the depreciation of the RNA in cDNA. In other words, in addition to mismatch / mismatching and termination, the RTases in question also showed characteristic gaps in the sequence reading resulting from jumps in the RTase in question over the mlA position as hitherto unknown phenomenon (see FIGS. 1 and Fig. 2).
  • the single jumps may be direct or delayed single jumps, that is, the (skipped) gap lies either directly at the mlA site or at the location of its 5 'adjacent neighbor, known as the -1 position. Double jumps lead to appear as gaps at the two positions ml A- and -1.
  • the scatter plot in Figure 3 shows for the 13 different RTases examined the great variety of RT signatures at m lA sites, taking into account this newly discovered third core feature "jumps".
  • the abort rate, mismatch rate, and total hopping rate values shown represent the average of the three individual values of each technical triplicate; the error bars show the standard deviations of the truncation and misincorporation rates of these triplicates.
  • Example 7 To evaluate the predictive power of the RT signature of an individual RTase, in each case the characteristic features of the RT signature with which weighting were determined in accordance with Example 6 (A) for the RT signatures of 13 RTases obtained in Example (7) characterizes or co-imprints the relevant RTase-specific RT signature.
  • the six RT signature features were examined (here, for example and preferably): abort rate, overall hopping rate and mismatch rate and, with regard to the mismatch events, also the relative contents of the mismatch components G, T and C.
  • the RT signatures of 26 mlA cases were mated with an equal number of non-m lA signatures randomly drawn from the surrounding sequence pool. These pairs were mixed and divided into three groups of equal frequency (so-called "folds").
  • Each signature data point contained the RT signature characteristics abort rate, relative mismatch rate, relative mismatch components (G, T and C), and the overall hopping rate.
  • a cross validation a random forest model (as described in Liaw and Wiener, 2002) was trained (trained) on two of these groups ("folds") and tested on (the third). Shuffling (i.e., group composition blending) and cross-validation were repeated 100 times to account for statistical variance.
  • each RTase provided the results shown in Figure 4: for each of the 13 RTases (# 1 to # 13), for each of the six RT signature features, the averaged ranking of their performance for a m 1 A prediction and thus their ""Classificationpower" as specified in the "Area Under Curve (AUC)" of the "Receiver Operating Characteristic (ROC)".
  • the data of the RT signature triplicates were averaged; the black vertical lines show standard deviations over 3 sequence runs). For each RTase, 100 repetitions of a 3-fold cross-validation were performed in each classification run.
  • RT-signatures of some RTases lead to better predictive power results than those of others.
  • the predictive power results differed by several percentage points.
  • Targeted selection of the presumptive most appropriate RTase (s) for a planned sequencing of a test template RNA for a given nucleotide modification can improve workflow and significantly reduce residual errors.
  • a comparison of the weighting values obtained for the RT signature characteristics of different RTases (at mlA sites) with machine learning models designed for them indicates an individual weighting pattern of the features in the RTS signature of each RTase that contributes to the decision making.
  • the weighting (synonyms: significance, importance) of an RT signature feature was determined by permuting the (all) values obtained for this feature with all 13 RTases examined (ie, commutation of values, also of Negative instances, namely nucleotide positions with potentially weak expression of this feature, with corresponding values of positive instances, namely nucleotide positions with mostly stronger expression of this feature), and measurement of the corresponding decrease in the classification accuracy. This decrease in classification accuracy is tends to be higher, the more important (defining) this feature is for the RT signature.
  • RTase 3 (ProtoScript ® II) for the RT-signature of RTase has the permutation of the pronounced drop-out rate large impact, while this feature for RTase 12 (superscript ® IV), where it is only slightly pronounced only of secondary importance. Although they are different in the patterns of feature weighting, RTase are 3 (ProtoScript® II) and RTase 12 (superscript ® IV) to the highest AUC ranks, ie their RT-signatures have the strongest classification capability and allow the best machine learning services ,
  • RTase pairs a significantly optimized prediction performance for the obtained RT signatures (the RTase pairs) can consequently be achieved.
  • two (or correspondingly more) RT signatures are obtained, the combined application of which in the supervised machine learning experiment according to Example 8 has a significantly improved classification performance, ie Performance for m 1 A prediction causes (results). Residual errors are significantly reduced.
  • Example 9 The studies described in Example 9 were carried out analogously with RTase triplets, i. with triple combinations of different RTases, performed.
  • results obtained were expected to improve that the predictive performance (detection performance) for a m lA site can be improved by combining the RT signature data from three different RTases.
  • Numerous RTase triplets delivered AUC values of 1.000, demonstrating ideal classification (classification) performance and m / L predictive performance.
  • a detailed comparison between RT signature pairs and RT signature triplets shows however, the RT signatures of some RTase pairs already provide a quasi-best m lA predictive power, ie, their AUC values are in a range that overlaps with that of the RT signature triplets.
  • Fig. 6 is a comparison of the m lA predictive powers in a Random Forest classification for the three alternative training and application modes (states) of the classification method, namely training (according to Example 6 A) and application according to Example 6 B) with the Information or data of the RT signature characteristics of (i) an RT signature (of the 13 different RTases), (ii) two RT signatures (of one of the 156 RTase pairs) and (iii) three RT signatures ( from one of the 1716 RTase triplets) using a box plot.
  • the method for detecting nucleotide modifications other than m lA, eg of mlG or m2.2G, is carried out as in Examples 1 to 9 or 1 to 10, with the modification that as template RNAs in Step 1 of Phase I, and thus as training RNA set for the classifier such RNA sequences are used, which are known and proven to contain the desired Nuleotid modification, eg mlG or m2.2G.
  • Example 12 Kit for carrying out the process according to the invention
  • the kit comprises (a) at least two reverse transcriptases RTase X and RTase Y, whose RT signatures at the respective nucleotide modification site have respect to the weighting of the RT signature characteristics (termination rate, total mismatch rate, single mismatch rates of the respective mismatched nucleotides, total hopping rate, direct single hopping rate, delayed single hopping rate, double hopping rate) have a different pattern in at least one of the RT signature features, and or (b) at least two different premixed reaction batches (synonyms: reaction mixtures; Buffer mixtures) A and B, which embody different (ie divergent) reaction conditions, for example by different concentrations of dNTPs, and / or different divalent cations, especially Mg2 + and Mn2 +, and / or different concentrations of divalent cations and / or different pHs, and / or different concentrations of polyethylene glycol (PEG).
  • step (1) in phase (I) and in phase (II) of the process, it is only necessary to mix the RTase (s) with the reaction mixture or the reaction mixtures and the relevant template RNA (s) and to incubate.
  • MODOMICS a database of RNA modification pathways-2013 update. Nucleic Acids Res., 41, D262-D267.

Landscapes

  • Life Sciences & Earth Sciences (AREA)
  • Engineering & Computer Science (AREA)
  • Chemical & Material Sciences (AREA)
  • Health & Medical Sciences (AREA)
  • Physics & Mathematics (AREA)
  • Proteomics, Peptides & Aminoacids (AREA)
  • Organic Chemistry (AREA)
  • Biotechnology (AREA)
  • General Health & Medical Sciences (AREA)
  • Biophysics (AREA)
  • Bioinformatics & Cheminformatics (AREA)
  • Biochemistry (AREA)
  • Molecular Biology (AREA)
  • Library & Information Science (AREA)
  • Wood Science & Technology (AREA)
  • Zoology (AREA)
  • Evolutionary Biology (AREA)
  • Spectroscopy & Molecular Physics (AREA)
  • Theoretical Computer Science (AREA)
  • Medical Informatics (AREA)
  • Bioinformatics & Computational Biology (AREA)
  • Analytical Chemistry (AREA)
  • Genetics & Genomics (AREA)
  • General Engineering & Computer Science (AREA)
  • Microbiology (AREA)
  • Immunology (AREA)
  • Measuring Or Testing Involving Enzymes Or Micro-Organisms (AREA)

Abstract

Das Verfahren umfasst die Reverse Transkription der Template-RNA, die Amplifizierung und Hochdurchsatz-Sequenzierung der dabei gewonnenen cDNAs, das Mapping der sequenzierten cDNAs/Reads zum Referenzgenom mit computergestützten Alignment-Verfahren, eine computergestützte Auswertung der Mappingergebnisse hinsichtlich des Reverse-Transkriptions-Ereignismusters (der RT-Signatur) an den Nukleotid-Positionen und Einspeisung der digitalisierten Daten der RT-Signaturen in ein computer-basiertes, auf überwachtem maschinellem Lernen beruhendes Klassifizierungssystem. Die Reverse Transkription wird in parallelen Reaktionsansätzen mit verschiedenen Reversen Transkriptasen und/oder veschiedenen Reaktionsbedingungen durchgeführt. Die Auswertung der Mapping-Ergebnisse hinsichtlich der RT-Signatur erfolgt unter Verwendung der Ereignisse 'Abbruch' und/oder 'Read-Through mit Mismatch' und/oder 'Read-Through mit Sequenzlücke(n)'. Mit den parallelen Reaktionsansätzen gewonnene Daten von RT-Signaturen werden in das Klassifizierungssystem eingespeist.

Description

Verfahren zur Detektion von bekannten Nukleotid -Modifikationen in einer RNA
Beschreibung
Die vorliegende Erfindung betrifft ein Verfahren zur Detektion, d.h. Ermittlung von Anzahl und Position (Lokus) einer ausgewählten bekannten Nukleotid-Modifikation in einer RNA oder mehreren RNAs (inkl. Transkriptom).
Die im Kontext dieser Erfindungsbeschreibung verwendeten Abkürzungen sind wie folgt definiert:
RT = Reverse Transkription
RTase = Reverse Transkriptase
RT-Signatur = Reverse-Transkriptions-Signatur
RNA = Ribonukleinsäure (Ribonucleic Acid)
mRNA = Messanger RNA (Boten-RNA)
tRNA = Transfer-RNA
rRNA = Ribosomale RNA
NGS = Next-Generation-Sequencing = Hochdurchsatz-Sequenzierung
ml A = Nl-Methyladenosin (m'A)
mlG = Nl-Methylguanosin (m'G)
m2,2G = N2,N2-Dimethylguanosin (m2 2G)
PCR = Polymerase Chain reaction (Polymerase-Ketten-Reaktion)
dNTP = Desoxynukleotidtriphosphat
Das Transkriptom,— das heißt die Gesamtheit der RNA-Transkripte (also der durch die RNA Polymerase abgelesenen bzw. transkribierten Gene) eines Genoms von einer Zelle oder von einem Zelltyp oder von einem Organismus, insbesondere mRNAs, tRNAs und rRNAs, aber auch andere nicht codierende RNAs— , spielt eine entscheidende Rolle in verschiedenen Aspekten der Genexpression, Zellentwicklung und Zellfunktion. Fehler im Transkriptom, beispielsweise aufgrund modifizierter Nukleotide in einer mRNA oder tRNA oder rRNA, können zu Erkrankungen führen. Die Identifizierung und Charakterisierung verschiedener Arten von RNA-Basenmodifikationen in verschiedenen RNA-Typen haben in den letzten Jahren stark an Bedeutung gewonnen. Das Interesse an aktueller Forschung wächst, und dieses Feld gewinnt weiter an Bedeutung. Die im Stand der Technik bekannten Verfahren zur Detektion modifizierter (veränderter) Nukleotide in RNAs basieren auf deren reverser Transkription ( = Übersetzung/Abschrift) in cDNA mittels Reverser Transkriptasen (kurz: RTasen) und die anschließende Sequenzanalyse dieser cDNAs, d.h. Sequenzierung und Mapping ( = Zuordnung) zu einem bekannten Referenzgenom bzw. Referenztranskriptom.
Hierbei werden die bei einer Reversen Transkription (kurz: RT) mit einer bestimmten RTase erhaltenen cDNAs einer als Template (Synonyme: Matrize, Vorlage) gewählten RNA zunächst amplifiziert und danach sequenziert.
Die dabei erhaltenen Sequenzierdaten der cDNAs, die sogenannten "Reads", werden mit der genomischen Referenzsequenz verglichen, und im Zuge des sogenannten "Mappings" werden die sequenzierten cDNAs/Reads dem Referenzgenom oder Referenztranskriptom zugeordnet.
Ein besonderes und spezifisches Transkriptionsverhalten der Reversen Transkriptase (RTase) bei der Abschrift von RNA in cDNA an den Stellen einer Nukleotid-Modifikation dient als Ansatzpunkt für die Detektion von modifizierten Nukleotiden.
Dieses besondere und spezifische Reverse Transkriptionsverhalten äußert sich darin, dass an der Stelle der Nukleotid-Modifikation mehrere Verhaltensvarianten und infolgedessen verschiedene besondere (d.h. von der korrekten Reversen Transkription abweichende) Reverse Transkriptions-Ereignisse vorkommen bzw. vorkommen können.
Zu diesen gehören nach dem Stand der Technik insbesondere (1.) die Blockade (Abbruch) der Reversen Transkription mit dem Ergebnis eines korrekten aber unvollständigen sogenannten Abbruch-Produkts und (2.) der Einbau eines falschen (natürlicherweise nicht korrespondierenden) dNTPs an der Positionen des modifizierten RNA-Nukleotids in die cDNA mit dem Ergebnis eines vollständigen aber unkorrekten Übersetzungsprodukts, eines sogenannten 'Read-Through-Produkts mit Mismatch' (=Fehlpaarungen)' oder 'Mismatch-Read-Through-Produkts'.
Art und Anzahl der verschiedenen RT-Ereignisse bilden ein charakteristisches Ereignismuster, die sogenannte Reverse-Transkriptions-Signatur (im folgenden kurz: RT-Signatur) an jeder einzelnen Nukleotid-Position. Im Stand der Technik wird die RT-Signatur für die Nukleotid-Positionen einer untersuchten RNA (der Template-RNA) prinzipiell anhand der charakteristischen Merkmale Abbruch-Ereignisse und Mismatch-Read-Through-Ereignisse (d.h. Read- Through-Ereignisse mit missinkorporierten bzw. fehlgepaarten cDNA-Bausteinen) charakterisiert.
Für die Detektion einer bestimmten (mutmaßlich) vorhandenen Nukleotid-Modifikation in einer Template-RNA, z.B. der Nl-Methylierung von Adenosin zu N l-Methyladenosin (mlA), werden die nach Reverser Transkription, Amplifizierung, Sequenzierung und Mapping erhaltenen Mappingergebnisse für diese Template-RNA dahingehend untersucht und ausgewertet, ob und falls ja an welcher Nukleotid-Position welche RT-Ereignisse in welcher Häufigkeit auftreten und wie folglich die RT-Signaturen für die einzelnen Nukleotid-Positionen aussehen.
Aus der erhaltenen RT-Signatur für die betreffende Template-RNA kann auf vorhandene Nukleotid-Modifikationen geschlossenen werden. Falls für eine bestimmte Nukleotid- Modifikation eine besondere charakteristische RT-Signatur ermittelt werden konnte, wie im Stand der Technik für mlA geschehen, kann durch Vergleich mit dieser bekannten und Modifikations-spezifischen RT-Signatur auf das Vorliegen der betreffenden Nukleotid- Modifikation in der Template-RNA geschlossen werden.
Bei der Template-RNA kann es sich um eine bestimmte RNA-Spezies handeln, ebensogut aber auch um eine Gruppe verschiedener RNA-Spezies.
Amplifizierung und Sequenzierung der cDNAs erfolgen im Stand der Technik üblicherweise mit Sequenzierungsmethoden, die auf Hochdurchsatzmethoden in Form von massivem parallelem Sequenzieren, dem sogenannten "Next-Generation Sequencing" (NGS) basieren, und bei denen die gewonnenen Sequenz-Daten in digitaler Form ausgegeben werden.
Eine bekannte Next-Generation-Sequenzierungs (NGS)-Methode ist die sogenannte "Sequenzierung mit Brückenamplifikation". Hierbei wird an beiden Enden der zu sequenzierenden (doppelsträngigen) DNA je eine unterschiedliche Adapter-DNA-Sequenz eingeführt. Anschließend wird die DNA denaturiert, nach Verdünnung (einzelsträngig) auf eine Trägerplatte hybridisiert und per Brückenamplifikation vervielfältigt. Dadurch entstehen auf der Trägerplatte einzelne Bereiche (Cluster) mit vervielfältigter DNA, die innerhalb eines Clusters die gleiche Sequenz aufweisen. In einer Sequencing-by-Synthesis- verwandten PCR-Reaktion (d.h. einer PCR-Reaktion, bei der während der Synthese sequenziert wird) werden modifizierte, nämlich mit einem reversiblen 3'-Blocker und einer fluoreszierenden Markierung gekoppelte Nukleotide (jedes der vier Nukleotide mit einer andersfarbigen Fluoreszenzmarkierung gekoppelt) eingesetzt, die die Polymerase dazu zwingen, nur ein Nukleotid pro Zyklus einzubauen. Das jeweils eingebaute Nukleotid pro Zyklus in einem Cluster wird detektiert.
Das Mapping erfolgt vorzugsweise mittels im Stand der Technik geläufiger computergestützter Alignment- Verfahren, und auch die Auswertung (Analyse) der Mappingergebnisse hinsichtlich des Reverse-Transkriptions-Ereignismusters (der RT-Signatur) erfolgt üblicherweise computergestützt.
Die im Stand der Technik für mlA beschriebene charakteristische RT-Signatur wurde unter Einsatz von im Stand der Technik bekannten und geläufigen computergestützten, automatischen und auf überwachtem maschinellem Lernen beruhenden Klassifizierungsverfahren ermittelt.
Hauenschild et al. (Nucleid Acid Research, 2015) beschreiben für die Nukleotidmodifikation m lA in tRNA und rRNA als Template-RNAs die gleichzeitige Analyse der RT-Signatur-Merkmale Abbruch und Mismatch-Read-Through unter Anwendung der NGS-Sequenzierungsmethode RNA-Seq.
Durch Anwendung dieser NGS-Methode auf eine Vielzahl von nativen und synthetischen RNA-Präparaten als Template-RNAs und durch die bioinformatische Weiterverarbeitung der generierten Daten einschließlich Klassifizierung mit auf computergestützten und auf maschinellem Lernen beruhenden Klassifizierungsverfahren fanden die Autoren für mlA- Modifikationen (d.h. an m lA-Modifikationsstellen bzw. an Nukleotid-Positionen mit mlA-Modifikation) ein charakteristisches Reverse-Transkriptions-Ereignismuster, d.h. eine für diese Nukleotid-Modifikationsstelle charakteristische RT-Signatur, die Transkriptions-Abbruchprodukte und Transkriptions-Read-Through-Produkte als signifikante Merkmalskomponenten aufweist.
Die ermittelte RT-Signatur für mlA (d.h. an mlA-Stellen) wurde für die Überprüfung und Bestätigung von Verdachtsobjekten verwendet. Mutmaßliche Positionen von mlA in den Sequenzen von mehreren humanen R As konnten bestätigt werden, und in tRNA von Trypanosoma brucei wurden durch Signaturabgleich und Sequenzhomologie bisher unbekannte m lA Positionen ermittelt.
Damit haben Hauenschild et al. (2015) gezeigt, dass die RT-Signatur einer Reversen Transkriptase (RTase) an einer mlA-Stelle aus Abbruch- und Mismatch ( = Fehlpaarungs)- Raten besteht, die zur Identifizierung, Charakterisierung und Lokalisierung von mlA-Stellen in tRNA und rRNA, verwendet werden können.
Andere Publikationen zeigten bereits Ansätze zur Erkennung von Modifikationsstellen auf transkriptomweiter Ebene. Dominissini et al. (2016) beschreiben für die Erkennung der Modifikation mlA die Strategien der antikörperbasierten, methylierten RNA- Immunopräzipitations-Sequenzierung (MeRIP-Seq). Nl-Methyladenosin-haltige RNA- Fragmente wurden unter Verwendung von anti-m lA-Antikörpern angereichert, und durch Kopplung mit einer chemischen Methode wurde versucht, die m lA-Modifikationen zu lokalisieren. Dieses Verfahren erlaubt nur in Ausnahmefällen und mit eingeschränkter Zuverlässigkeit eine Identifizierung bzw. Vorhersage von mlA-Stellen/Positionen in einer Single-Nucleotid-Resolution (Einzel-Nukleotid-Auflösung). Linder et al. (2015) beschreiben eine Kartierung der Modifikation N-6-Methyladenosin (m6A) in menschlicher und Maus-mRNA mit der miCLIP -Methode (miCLIP = Methylation individual-nucleotide- resolution crosslinking and immunoprecipitation) unter Einsatz von Ultraviolettlicht- induzierter Antikörper-RNA-Vernetzung und R everser Transkription. Hierbei werden jedoch erhebliche Mengen an falsch-negativen und falsch- positiven Ergebnissen erhalten, und infolgedessen ist die Prognoseleistung für tatsächliche Modifikationsstellen eng begrenzt.
Der vorliegenden Erfindung liegt die Aufgabe zugrunde, diese Nachteile des Stands der Technik zu beheben oder wenigstens zu mindern, insbesondere die bekannte Methodik zur Ermittlung von Positionen modifizierter Nukleotide in RNAs hinsichtlich Detektionsgenauigkeit und Vorhersagequalität zu erhöhen und sie weiter zu entwickeln für Anwendungen zur Analyse anderer RNA-Modifikationen als der m lA-Modifikation, im Hinblick auf das Ziel einer Transkriptom-weiten Kartierung von RNA -Modifikationen.
Eine Lösung dieser Aufgabe besteht in der Bereitstellung eines Verfahrens zur Ermittlung von Anzahl und Position (Lokus) einer ausgewählten (vorbestimmten), bekannten Nukleotid-Modifikation in einer RNA oder mehreren RNAs (inkl. Transkriptom), der (den) sogenannten Template-RNA(s), umfassend die folgenden Schritte in der genannten Reihenfolge:
(1) Reverse Transkription der Template-RNA(s) unter Einsatz des Enzyms Reverse Transkriptase ("RTase") und Erstellen einer cDNA-Bibliothek enthaltend die Reverse Transkriptions-Produkte (= cDNAs) der eingesetzten Reversen Transkriptase mit dieser/diesen Template-RNA(s),
(2) Amplifizierung der cDNAs und Sequenzierung der amplifizierten cDNAs mittels einer Hochdurchsatz-Sequenzierungsmethode (Next-Generation-Sequencing (NGS)-Methode), wobei die gewonnenen Sequenz-Daten in digitaler Form, den Reads, ausgegeben werden,
(3) Adapter-Trimming (= Entfernung der Adaptersequenzen) und Mapping (=Zuordnung) der sequenzierten cDNAs Reads zum Referenzgenom oder Referenztranskriptom mittels computergestützter Alignment- Verfahren,
(4) computergestützte Auswertung (Analyse) des Mappingergebnisses hinsichtlich des Reverse-Transkrjptions-Ereignismusters, der RT-Signatur, unter Verwendung der Ereignisse 'Abbruch' und/oder 'Read-Through mit Mismatch' als RT-Signatur-Merkmal(e), und Diagnostizierung der RT-Signatur an jeder Nukleotid-Position der Template-RNA(s),
(5) Einspeisung der (digitalisierten) Daten(sätze) der RT-Ereignismuster/RT-Signaturen in ein computerbasiertes, automatisches, auf überwachtem maschinellem Lernen ("Machine- Learning") beruhendes Klassifizierungssystem,
wobei in einer ersten Phase (I) des Verfahrens, der Kalibrierungsphase, die Schritte (1) bis (5) mit einer oder mehreren verschiedenen, bekannten und hinsichtlich Nukleotidsequenz und gegebenenfalls vorhandener Nukleotid-Modifikation(en) identifizierten und annotierten RNAs als Template-RNAs ausgeführt werden, und in Schritt (5) ermittelte RT-Signaturen von Nukleotid-Positionen mit der bekannten Nukleotid-Modifikation und ermittelte RT-Signaturen von Nukleotid-Positionen des gleichen Nukleosids ohne Nukleotid- Modifikation in das Klassifizierungssystem eingespeist werden, und das Klassifizierungssystem während Trainings- und Selbsttestungs-(Klassifizierungs)läufen implizit das (charakteristische) Profil der RT-Signatur (d.h. die charakteristische quantitative Ausprägung der RT-Signatur-Merkmale) an der die Nukleotid-Modifikation aufweisenden Nukleotid-Position erstellt und optimiert ("erlernt"), und (infolgedessen) als Klassifizierungsergebnis diejenigen Positionen auf der/den (jeder) TempIate-RNA(s) ermittelt und angibt, die eine RT-Signatur aufweisen, die mit diesem (charakteristische) Profil annähernd oder vollständig übereinstimmt, d.h. die ihm ähnlich ist oder mit ihm übereinstimmt, und die somit auf das Vorliegen der betreffenden Nukleotid-Modifikation an diesen Positionen hinweist,
und wobei in einer zweiten Phase (II) des Verfahrens, der Anwendungs- bzw. Untersuchungsphase, die Schritte (1) bis (5) mit einer oder mehreren zu untersuchenden unbekannten Test-RNA(s) als Template-RNA(s) durchgeführt werden, und die Schritte (1) bis (4) unter den gleichen Bedingungen wie in Phase (I) erfolgen, und in Schritt (5) ermittelte RT-Signaturen von (vorzugsweise allen oder nahezu allen) Nukleotid-Positionen der Test-Template-RNA(s) in das Klassifizierungssystem eingespeist werden, und das Klassifizierungssystem auf der Basis des in Phase (I) Schritt (5) implizit erlernten (charakteristischen) Profils die (und vorzugsweise jede der) eingegebenen RT-Signaturen dahingehend (d.h. hinsichtlich des Kriteriums) klassifiziert, inwieweit (d.h. in welchem Maß bzw. Grad) sie diesem Profil ähnlich sind bzw. damit übereinstimmen, und wobei Klassifizierungsergebnisse mit der Aussage "ähnlich" oder "annähernd übereinstimmend" oder "übereinstimmend" (d.h. Klassifizierungsergebnisse, die der Aussage "ähnlich" oder "annähernd übereinstimmend" oder "übereinstimmend" entsprechen) auf das Vorliegen der betreffenden Nukleotid-Modifikation in der/den Test-Template-RNA(s) an der Nukleotid- Position mit dieser RT-Signatur hinweisen.
Dieses Verfahren ist erfindungsgemäß dadurch gekennzeichnet,
- dass in Schritt (1) von Phase (I) und Phase (II) des Verfahrens die Reverse Transkription der Template-RNAs in zwei oder mehr Reaktionsansätzen und -durchlaufen mit voneinander verschiedenen RTasen unter den gleichen Reaktionsbedingungen und/oder mit (der) gleichen RTase(n) unter voneinander abweichenden Reaktionsbedingungen je Ansatz durchgeführt wird, wobei mit/von jedem Ansatz eine cDNA-Bibliothek erhalten wird,
- und dass in Schritt (4) von Phase (I) und Phase (II) des Verfahrens für die Auswertung der Mapping-Ergebnisse hinsichtlich der RT-Signatur das/die Ereignis(se) 'Abbruch' und/oder 'Read-Through mit Mismatch' und/oder das zusätzliche Ereignis 'Read-Through mit Sequenzlücke(n) (Sprung/Sprüngen)' ermittelt und als RT-Signatur-Merkmal(e) gewertet wird/werden,
- und dass in Schritt (5) von Phase (I) und Phase (II) des Verfahrens Daten(sätze) von (allen oder nahezu allen oder zumindest an Nukleotid-Positionen mit dem Basentyp der betreffenden Nukleotid-Modifikation ermittelten) RT-Signaturen aus den in Schritt (1) erhaltenen cDNA-Bibliotheken, die mit den verschiedenen RTasen unter gleichen Reaktionsbedingungen und/oder mit der/den gleichen RTase(n) unter voneinander abweichenden Reaktionsbedingungen erhalten wurden, in das Klassifizierungssystem eingespeist werden.
Mit anderen Worten:
Das erfindungsgemäße Verfahren zur Ermittlung von Anzahl und Position (Lokus) einer ausgewählten (vorbestimmten), bekannten Nukleotid-Modifikation in einer oder mehreren zu untersuchenden RNAs (inkl. Transkriptom), der/den Template-RNA(s), besteht aus zwei Phasen (I) und (II):
In Phase I, der Kalibrierungsphase, werden die folgenden Schritte in der genannten Reihenfolge durchgeführt:
(1) Reverse Transkription von einer oder mehreren verschiedenen bekannten und hinsichtlich ihrer Nukleotidsequenz und gegebenenfalls der vorhandenen ausgewählten Nukleotid-Modifikationen identifizierten und annotierten RNA(s) als Template-RNA(s) (bevorzugt sind synthetische RNAs oder aus natürlichen Quellen isolierte RNAs gemäß Datenbank-Informationen z.B. aus MODOMICS gemäß Machnicka et al., 2013), in zwei oder mehr parallelen Reaktionsansätzen und - durchlaufen mit voneinander verschiedenen RTasen (einschließlich bzw. solcher, die speziell zu diesem Zweck durch Mutationen verändert wurden) unter den gleichen Reaktionsbedingungen und/oder mit (der) gleichen RTase(n) unter voneinander abweichenden Reaktionsbedingungen je Ansatz, und Erstellen von cDNA-Bibliotheken, jeweils einer pro Reaktionsdurchlauf, wobei eine jeweils erstellte cDNA-Bibliothek die Reverse Transkriptions-Produkte (cDNAs) der in dem betreffenden Reaktionsdurchlauf eingesetzten RTase von der oder den darin verwendeten Template- RNA(s) enthält.
(2) Für jede (in Schritt 1 gewonnene) cDNA-Bibliothek wird eine Amplifizierung der cDNAs und Sequenzierung der amplifizierten cDNAs mit einer Hochdurchsatz- Sequenzierungsmethode durchgeführt, wobei die gewonnenen Sequenz-Daten, d.h. die Sequenzinformationen der einzelnen cDNAs (Synonym: Reads), in digitaler Form ausgegeben werden. Bevorzugt ist hier eine "Sequenzierung mit Brückenamplifikation" z.B. das Illumina-Sequenzierungs- Verfahren.
(3) Adapter-Trimming (= Entfernung der Adaptersequenzen) und Mapping ( = Zuordnung) der sequenzierten cDNAs bzw. Reads zum Referenzgenom oder Referenztranskriptom mittels computergestützter Alignment- Verfahren. Bevorzugt ist hier der Einsatz eines computerbasierten Verfahrens für Sequenz-Alignment und Sequenz- Analyse, z.B. die Bowtie 2-Software. (4) Computergestützte Auswertung (Analyse) des/der Mappingergebnisse(s) hinsichtlich des Reverse-Transkriptions-Ereignismusters, der sogenannten RT-Signatur, unter Verwendung der Ereignisse 'Abbruch' und/oder 'Read-Through mit Mismatch' und/oder 'Read-Through mit Sequenzlücke(n) (Synonyme: Sprung/Sprünge; Jump(s))' als prägende(s) Merkmal(e), und Diagnostizierung der RT-Signatur (d.h. des Transkriptions- Ereignismusters) an vorzugsweise jeder Nukleotid-Position der Template-RNA(s).
(5) Einspeisung der (digitalisierten) Daten (Datensätze) der RT-Signaturen— aller oder nahezu aller oder zumindest derjenigen RT-Signaturen, die an den Nukleotid-Positionen mit dem Basentyp der betreffenden Nukleotid-Position ermittelt werden— in ein computerbasiertes, automatisches, auf maschinellem und überwachtem Lernen beruhendes Klassifizierungssystem (Synonyme: Klassifizierungsverfahren, Klassifizierer), z.B. in einen Random Forest-Klassifizierer, und Trainieren dieses (lernenden) Klassifizierungssystems auf das besondere (charakteristische, typische) Profil der in Schritt (4) erhaltenen RT-Signaturen (d.h. auf die charakteristische quantitative Ausprägung der RT-Signatur-Merkmale) für die bzw. an der/den Nukleotid-Position(en) mit der betreffenden Nukleotid-Modifikation (d.h. die die betreffende Nukleotid-Modifikation aufweisen), derart, dass es als Klassifizierungsergebnis diejenigen Positionen auf der/den (jeder) Template-RNA(s) ermittelt und angibt, die eine RT-Signatur aufweisen, die mit diesem Profil annähernd oder vollständig übereinstimmen, d.h. die ihm ähnlich sind oder mit ihm übereinstimmen, und die somit auf das Vorliegen der betreffenden Nukleotid- Modifikation an diesen Positionen hinweisen.
In Phase II, der Analyse- bzw. Untersuchungsphase mit wenigstens einer Test-RNA, werden die folgenden Schritte in der genannten Reihenfolge durchgeführt:
(1) Reverse Transkription der zu untersuchenden Test-RNA(s) als Template-RNA(s) unter den gleichen Bedingungen wie in Phase I Schritt (1), d.h. mit der oder den in Phase I Schritt (1) eingesetzten RTase(n) und Reaktionsbedingungen und Erstellen von cDNA- Bibliotheken (eine pro Ansatz), die die Reverse Transkriptions-Produkte der jeweils eingesetzten RTase(n) für diese Test-Template-RNA(s) enthalten.
(2) Amplifizierung der in Schritt (1) gewonnenen cDNAs und Sequenzierung der amplifizierten cDNAs mittels der in Phase I Schritt (2) angewendeten Methode, wobei die gewonnenen Sequenz-Daten (Reads) in digitaler Form ausgegeben werden.
(3) Zuordnung (= Mapping) der sequenzierten cDNAs/Reads zum Referenzgenom oder Referenztranskriptom mittels der in Phase I Schritt (3) angewendeten computergestützten AI ignment- Verfahren. (4) computergestützte Auswertung (Analyse) des Mappingergebnisses analog Phase I Schritt (4) hinsichtlich der T-Signaturen (d.h. der Reverse-Transkriptions-Ereignismuster) unter Verwendung der Ereignisse 'Abbruch' und/oder 'Read-Through mit Mismatch' (und hierbei Absolut-Rate und/oder Einzelraten der verschiedenen Mismatch- Zusammensetzungen (Fehlpaarungen)) und/oder "Read-Through mit Sequenzlücke(n) bzw. Sprung/Sprüngen bzw. Jump(s)' (und hierbei Absolut-Rate=Gesamtsprungrate und/oder Einzelraten der verschiedenen Lücken- bzw. Sprungvarianten) als prägende(s) Merkmal(e).
(5) Einspeisung der (digitalisierten) Daten bzw. Datensätze der ermittelten RT-Signaturen in das computerbasierte, auf überwachtem maschinellem Lernen beruhende und auf das besondere Profil für die betreffende Nukleotid-Modifikation trainierte Klassifizierungssystem aus Phase I Schritt (5) derart, dass für jede eingegebene RT-Signatur eine Klassifizierung erfolgt, und zwar dahingehend, inwieweit sie diesem Profil ähnlich ist bzw. damit übereinstimmt. (Das heißt, jede eingegebene RT-Signatur wird klassifiziert bezüglich des Kriteriums, wie sehr bzw. in welchem Maß oder Grad sie diesem Profil ähnelt bzw. damit übereinstimmt.) Klassifizierungsergebnisse, die der Aussage "ähnlich" oder "annähernd übereinstimmend" oder "übereinstimmend" entsprechen, weisen auf das Vorliegen der betreffenden Nukleotid-Modifikation in der/den Test-Template-RNA(s) an der Nukleotid-Position mit dieser RT-Signatur hin.
Das Kern-Ergebnis der Klassifizierung besteht in der Angabe der ermittelten Positionen auf der/den Test-Template-RNA(s), die eine RT-Signatur aufweisen, die mit diesem (besonderen) Profil annähernd oder vollständig übereinstimmt, d.h. die ihm ähnlich ist oder mit ihm übereinstimmt, und die somit auf das Vorliegen der betreffenden Nukleotid- Modifikation an diesen Positionen hinweist.
Vorzugsweise wird zu jeder dieser ermittelten und angezeigten Positionen ein numerischer Punktewert (Score) auf einer eindimensionalen numerischen Bewertungsskala als Maß für die Qualität der Übereinstimmung mit angegeben.
Das erfindungsgemäße Verfahren basiert auf den überraschenden Erkenntnissen:
(i) Die RT-Signatur an einer Nukleotid-Modifikationsstelle hängt nicht nur von der Art der Nukleotid-Modifikation ab, sondern auch vom RTase-Typ (der RTase-Spezies). Aufgrund ihres ganz bestimmten typischen und charakteristischen Verhaltens an der Stelle einer Nukleotid-Modifikation wird an dieser Nukleotid-Position eine RTase- typenspezifische RT-Signatur erhalten. (ii) Durch Kombination von mindestens zwei RTasen unterschiedlichen Typs bei der Reversen Transkription werden überraschend starke Verbesserungen der Vorhersageleistung mittels Klassifizierer erhalten. Zwei oder mehr (parallele) Reaktionsansätze und -durchläufe mit voneinander verschiedenen RTasen unter den gleichen Reaktionsbedingungen und/oder mit (der) gleichen RTase(n) unter voneinander abweichenden Reaktionsbedingungen je Ansatz führen zu einer wesentlich verbesserten Genauigkeit der Vorhersage (Klassifizierung), ob an einer bestimmten Nukleotid-Position die betreffende (gesuchte) Nukleotid-Modifikation vorliegt oder nicht. Vergleichversuche mit einerseits (a) zwei parallelen RT-Ansätzen unter Einsatz zweier verschiedener RTasen und andererseits (b) Ansätzen unter Einsatz jeweils nur einer einzigen RTase-Spezies haben gezeigt, dass die Genauigkeit der Vorhersage (Klassifizierung) im Fall (a) wesentlich größer war als im Fall (b), was darauf hinweist, dass im Fall (a) ein synergistischer Effekt vorliegt.
(iii) Die RT-Signatur wird nicht nur durch die besonderen Merkmale (besonderen RT-Ereignisse) Abbruch und Mismatch-Read-Through (aufgeschlüsselt hinsichtlich Gesamtrate und Einzelraten der verschiedenen Fehlpaarungen) charakterisiert, sondern zudem durch das Merkmal "Read-Through-Ereignisse mit Sequenzlücke(n) (Synonyme: Sprung/Sprünge; Jump(s))" kurz "Jump-Read-Through", d.h. durch Ereignisse, bei denen die RTase die Stelle der Nukleotid-Modifikation überspringt. Dieses Merkmal "Jump- Read-Through" kann (ebenfalls) noch weiter aufgeschlüsselt werden, nämlich in Gesamtsprungrate, Rate der direkten Einzelsprünge, Rate der verzögerten Einzelsprünge und Rate der Doppelsprünge.
Im Rahmen der Untersuchungen, die der vorliegenden Erfindung zugrunde liegen, wurde überraschenderweise festgestellt, dass das Reverse-Transkriptionsereignis von RTasen an einer Nukleotid-Modifikationsstelle nicht nur in Transkriptionsabbruch oder Read- Through mit Mismatch/Fehlpaarung bestehen kann, sondern auch in Sprüngen der betreffenden RTase über die Position des modifizierten Nukleotids hinweg, wodurch sich charakteristische Lücken in der Sequenzablesung ergeben. Solche Sprünge wurden vor allem bei RTasen mit einer hohen Abdeckung/Erfassungsrate ("coverage") d.h. mit einem starken Read-Through- Vermögen festgestellt. Es können Einzel- und Doppelsprünge unterschieden werden, und bei den Einzelsprüngen kann es sich um direkte oder um verzögerten Einzelsprünge handeln, das heißt die (übersprungene) Lücke liegt entweder direkt an der mlA-Stelle oder an der Stelle ihres 5' angrenzenden Nachbarn, bekannt als — 1 -Position. Doppelsprünge führen zu und erscheinen als Lücken an den beiden Positionen mlA- und— 1.
In einer bevorzugten Ausführungsform des erfindungsgemäßen Verfahrens werden in Schritt (4) von Phase (I) und Phase (II) des Verfahrens für die Auswertung der Mapping-Ergebnisse hinsichtlich der RT-Signatur alle drei Ereignisse 'Abbruch' und 'Read-Through mit Mismatch1 und 'Read-Through mit Sequenzlücke(n) (Jump(s), Sprung/Sprüngen)' qualitativ und quantitativ ermittelt und als prägende Merkmale gewertet. Dadurch kann die Prägnanz und Einzigartigkeit jeder RT-Signatur verstärkt werden.
In einer ebenfalls bevorzugten Ausführungsform werden in Phase (I) Schritt (1) des Verfahrens die analogen Reaktionsansätze und - durchläufe mit wenigstens zwei Reversen Transkriptasen ("RTasen") durchgeführt, deren RT-Signaturen an der bzw. für die betreffende Nukleotid-Modifikationsstelle hinsichtlich der Gewichtung (Synonyme: Bedeutsamkeit; Wichtigkeit) ihrer RT-Signatur-Merkmale ein unterschiedliches Muster aufweisen. Vorzugsweise unterschieden sich die Muster in der Gewichtung wenigstens eines der Merkmale derart, dass dieses Merkmal in der RT-Signatur der einen RTase stark ausgeprägt ist und in der RT-Signatur der anderen RTase schwach oder jedenfalls deutlich schwächer ausgeprägt ist.
Besonders bevorzugte unterschiedliche Muster sind solche, die in wenigstens zwei RT-Signatur-Merkmalen (Ml und M2, z.B. der Arrest-Rate und der Mismach-Rate) ein wechselseitig gegenläufiges Muster aufweisen. Das heißt, von den betreffenden Merkmalen, z.B. Ml und M2, ist bei der einen RTase (A) Merkmal Ml stark ausgeprägt und Merkmal M2 nur schwach, während bei der anderen RTase (B) die Verhältnis umgekehrt vorliegen, nämlich Ml nur schwach und M2 stark ausgeprägt ist.
Bei den in Schritt (1) von Kalibrierungsphase (Phase I) und Anwendungs- bzw. Untersuchungsphase (Phase II) eingesetzten RTasen kann es sich erfindungsgemäß auch gut um solche handeln, die zu diesem Zweck durch Mutationen generiert wurden.
Als voneinander abweichende Reaktionsbedingungen in Schritt (1) von Phase I und Phase II kann es sich erfindungsgemäß insbesondere um (a) unterschiedliche Konzentrationen an dNTPs, und/oder (b) unterschiedliche divalente Kationen, insbesondere Mg2+ und Mn2+, und/oder (c) unterschiedliche Konzentrationen an divalenten Kationen und/oder (d) unterschiedliche pH-Werte und/oder (e) unterschiedliche Temperaturen und/oder (f) unterschiedliche Konzentrationen an Polyethylenglykol (PEG) handeln.
Das erfindungsgemäße Verfahren hat sich in der Praxis bei der Analyse der RNA- Modifikation mlA bereits gut bewährt. Zur Detektion von anderen RNA-Modifikationen, insbesondere solchen, für die die Sequenzierdaten-Analyse ein typisches Profil der RT-Signatur liefert, wie z.B. Guanosinderivate Nl -Methyl guanosin (mlG) und N2,N2- Dimethylguanosin (m2,2G), ist es ebenfalls geeignet und vorgesehen. Eine Ausführungform des erfindungsgemäßen Verfahrens besteht deshalb insbesondere darin, dass die Nukleotid-Modifikation eine Nukleosid-Methylierung ist, insbesondere eine Nl- Methylierung von Adenosin oder Guanosin.
Als Hochdurchsatz-Sequenzierungsmethode (NGS-Verfahren) in Schritt (2) von Phase I und Phase II des erfindungsgemäßen Verfahrens hat sich in der Praxis eine Sequenzierung mit Brückenamplifikation, insbesondere ein Illumina-Sequenzierungs-Verfahren, als gut geeignet erwiesen.
Für das Mapping, d.h. die Zuordnung der sequenzierten cDNAs/Reads zum Referenzgenom oder Referenztranskriptom mittels computergestützter AI ignment- Verfahren in Schritt (3) von Phase I und Phase II des erfindungsgemäßen Verfahrens hat sich in der Praxis ein computerbasiertes Verfahren für Sequenz-AI ignment und Sequenz-Analyse, wie z.B. die Bowtie 2-Software, als gut geeignet erwiesen.
Als computerbasiertes, automatisches, auf überwachtem maschinellem Lernen ("Machine- Learning") beruhendes Klassifizierungssystem in Schritt (5) von Phase I und Phase II des erfindungsgemäßen Verfahrens hat sich in der Praxis ein Random Forest-Klassifizierer als gut geeignet erwiesen.
In einer bevorzugten Ausführungsform des erfindungsgemäßen Verfahrens werden die in Schritt (2) gewonnenen Sequenz-Daten für die Durchführung der Schritte (3) bis (5) in eine Bioinformatik-Pipeline eingespeist, die die Kombination der Schritte (3) bis (5) steuert. Eine solche Bioinformatik-Pipeline, d.h. das Softwareprogramm, das die Arbeitsschritte (3) bis (5) in der vorgeschriebenen Reihenfolge kombiniert bzw. aneinander koppelt, kann erfindungsgemäß mit der Programmiersprache Python (Version v2.7.6) erstellt werden.
Bei den in der Kalibrierungsphase (Phase I) Schritt (1) verwendeten bekannten RNAs handelt es sich erfindungsgemäß vorzugsweise um synthetische RNAs bekannter Sequenz einschließlich bekannter Positionen der betreffenden (ausgewählten) Nukleotid- Modifikation oder um auf der Basis von Datenbank-Informationen isolierte natürliche RNAs, deren Sequenz einschließlich der Positionen der betreffenden (ausgewählten) Nukleotid-Modifikation gemäß der betreffenden Datenbankeinträge gut aufgeklärt ist.
In einer bevorzugten Ausführungsform des erfindungsgemäßen Verfahrens wird in Schritt (5) von Phase II und fakultativ auch von Phase I zu jedem Klassifizierungsergebnis ein numerischer Punktewert (Score) auf einer eindimensionalen numerischen Bewertungsskala als Maß für die Qualität der Übereinstimmung angegeben.
Gegenstand der vorliegenden Erfindung ist auch ein Kit zur Durchführung des erfindungsgemäßen Verfahrens, der wenigstens zwei RTasen umfasst, deren RT-Signaturen an der betreffenden Nukleotid-Modifikationsstelle bezüglich der Gewichtung der RT-Signatur-Merkmale (Abbruch-Rate, Gesamt-Mismatch-Rate, Einzelmismatch-Raten der betreffenden falsch gepaarten Nukleotide, Gesamtsprungrate, Rate der direkten Einzelsprünge, Rate der verzögerten Einzelsprünge, Doppelsprung-Rate) wenigstens in einem der RT-Signatur-Merkmale ein unterschiedliches, vorzugsweise gegenläufiges Muster aufweisen. Gegenläufiges Muster in wenigstens einem RT-Signatur- Merkmal heißt hier, dass z.B. das Merkmal Ml bei RTase A stark ausgeprägt ist und bei RTase B nur schwach. Alternativ oder Zusätzlich umfasst der Kit wenigstens zwei verschieden vorgemischte Reaktionsansätze (Synonyme: Reaktionsmischungen; Puffermischungen), die sich vorzugsweise in der Konzentration an dNTPs und/oder an divalenten Kationen und/oder an Polyethylenglykol (PEG) und/oder in der Art der enthaltenen divalenten Kationen (insbesondere Mg2+ und Mn2+) und/oder im pH- Wert, unterscheiden. Für die Durchführung des erfindungsgemäßen Verfahrens mit einem solchen Kit wird(werden) zusätzlich nur noch die Template-RNA(s) benötigt. Das erfindungsgemäße Verfahren ist ein leistungsfähiges Werkzeug für den Nachweis von modifizierten Nukleotiden in RNA anhand der RT-Signatur an der odifikationsstelle, d.h. anhand der Analyse des Modifikations-spezifischen Verhaltens der RTase während der Reversen Transkription der RNA zu cDNA. Es ermöglicht eine genaue Lokalisierung von RNA-Modifikationen in einer Einzel-Nukleotid-Auflösung und damit beispielsweise eine gegenüber den herkömmlichen Verfahren wesentlich genauere Identifikation und Vorhersage von mlA-Standorten, und es kann prinzipiell ebenso gut zur Analyse anderer Modifikationen, wie z.B. m lG oder m2,2G eingesetzt werden.
Die Durchführung der Reversen Transkription der Template-RNA(s) in Schritt (1) von Phase (I) und Phase (II) des Verfahrens in zwei oder mehr parallelen (analogen) Reaktionsansätzen und Reaktionsdurchläufen mit voneinander verschiedenen RTasen und/oder mit bzw. unter voneinander abweichenden Reaktionsbedingungen je Ansatz, und der Vergleich der so erhaltenen und in der Regel nicht ganz identischen RT-Signaturen für die gleiche Nukleotid-Modifikationsstelle ermöglich es, die charakteristischen Merkmale der RT-Signatur für die betreffende Nukleotid-Modifikationsstelle genauer aufzuklären und weiter zu spezifizieren. Je prägnanter und spezifischer die charakteristischen Merkmale für die RT-Signatur an einer bestimmten Nukleotid-Modifikationsstelle angegeben werden können, desto zutreffender kann für die RT-Signatur der Reversen Transkription einer Test-Template-RNA (z.B. aus einer Patienten-Probe) festgestellt werden, ob sie eine Ausführungsform dieser bekannten RT-Signatur darstellt oder nicht, d.h. ob die fragliche Nukleotid-Modifikation in der(den) Test-Template-RNA(s) vorhanden ist oder nicht.
Das erfindungsgemäße Verfahren ist eine universelle Methode zur Transkriptom-weiten Detektion von RNA Modifikationen unter Einbeziehung ganz bestimmter Eigenschaften der Reversen Transkription bzw. der RTase, die eine Detektion von einzelnen, modifizierten Nukleotiden innerhalb der Sequenz allein anhand ihrer charakteristischen RT-Signatur ermöglicht. Auf eine durch Immunopräzipitation erwirkte Anreicherung von Sequenzbereichen, die die Nukleotid-Modifikation (mutmaßlich) enthalten, kann dabei vollständig verzichtet werden.
Das erfindungsgemäße Verfahren kann im Bereich der klinischen Diagnostik von analytischen Dienstleistern oder medizinisch-diagnostischen Laboren angewendet und genutzt werden, um die personalisierte Medizin im Hinblick auf patientenspezifische Diagnostik weiterzuentwickeln. Gerade im Hinblick auf das stark wachsende Interesse an den Auswirkungen und Funktionen von RNA Modifikationen kann man in diesem Betätigungsfeld in den kommenden Jahren viele neue Erkenntnisse erwarten, was die präzise Ermittlung von modifizierten Sequenzpositionen bzw. Nukleotid-Positionen umso wichtiger macht.
Aufgrund seiner Leistung, die genaue Position der Modifikationen zu lokalisieren und falsche Ergebnisse zu minimieren, ermöglicht das erfindungsgemäße Verfahren ernsthafte Aussagen über ihre Wirkung und ihre Funktion zu machen und eine routinemäßige Anwendung in ökonomischer Weise. Analytische Dienstleister oder klinische Diagnostiklaboratorien können von Patienten gewonnene RNA-Proben analysieren und einen Bericht mit klassifizierten Modifikationskandidaten erstellen, womit zusätzliche Informationen für die diagnostische Aufarbeitung des Patienten geliefert werden.
Die Erfindung wird im folgenden anhand von Ausführungsbeispielen und den darin genannten Figuren und Tabellen näher erläutert.
Es zeigen:
Figur 1 : Das erfindungsgemäße Prinzip der Erzeugung (Generierung) und Analyse (Auswertung) von RNA-Sequenzierungs-Daten für den Nachweis von m lA- Resten
Figur 2: A) Die RT-Signatur einer mIA-Stelle, gewonnen mit einem herkömmlichen Verfahren unter Einsatz einer einzigen RTase ("single RT-Signatur"), hier der RTase 5 (SuperScript® III), d.h. mit Nutzung der RT-Signatur eines RT-Ansatzes unter Einsatz allein der RTase 5 (SuperScript® III.) gemäß Tabelle 1.
B) Die RT-Signatur einer m IA-Stelle, gewonnen mit dem erfindungsgemäßen Verfahren, bei dem die Informationen der RT-Signatur aus zwei unterschiedlichen RT-Ansätzen, die sich in der eingesetzten RTase unterscheiden, kombiniert sind. Die iengesetzten RTasen waren (i) RTase 12 (SuperScript® IV) und (ii) RTase 4 (GoScript™) gemäß Tabelle 1 .
Figur 3: mlA-Signaturen von 13 RTasen an 26 mlA-Stellen in der cytosolischen tRNA von Hefe.
Fehlerbalken zeigen Standardabweichungen von Abbruch- und Fehleinbauraten über 3 Sequenzierungsdurchläufe, d.h. technische Triplikate.
Die Größe der Kreisdiagramme repräsentiert die Gesamt-Sprungrate, d.h. die
Summe von 3 Typen von Nukleotidauslassungsraten aufgrund von mlA-Stellen.
Einzelsprung direkt = 1 Nukleotid wurde bei m lA selbst ausgelassen und übersprungen.
Einzelsprung verzögert = 1 Nukleotid wurde an der 5' benachbarten Position von mlA ausgelassen und übersprungen.
Doppelsprung = 2 Nukleotide wurden ausgelassen und übersprungen, an der mlA-Stelle und an der -1 -Position.
Die Prozentsätze der Abbruchrate beziehen sich auf die Reads, die die 3' benachbarte Position von m lA (+1) umfassen. Die Prozentsätze der Mismatchrate und Sprungrate beziehen sich auf die Reads, die die m l A Position umfassen.
Figur 4: Random Forest Durchführung und Gewichtung der RT-Signatur-Merkmale für 13 verschiedene RTasen.
Die Leistungsfähigkeit der Klassifizierung ("Classification power") ist dargestellt als Area Under Curve (AUC) der "Receiver Operating Characteristic (ROC)". Für jede der 13 RTasen wurden die Daten der drei parallel ermittelten RT- Signaturen gemittelt, der schwarze vertikale Strich zeigt jeweils die Standardabweichung der AUC.
Gesamtsprung = Gesamtsprung-Rate.
G, T, C = Mismatch (Fehlpaarungs-) Komponenten, die sich bis auf 100 % addieren.
Gewichtung = durchschnittlicher Verlust der Klassifizierungsgenauigkeit, wenn die Werte der jeweiligen Merkmale zwischen den Trainingsinstanzen (m lA- Instanzen und nicht-m lA-Instanzen) permutiert, d.h. ausgetauscht werden.
Figur 5: Random Forest Durchführung zur Ermittlung der Vorhersageleistung unter
Einsatz der paarweise permutierend miteinander kombinierten RT-Signaturen von 13 verschiedenen RTasen (gemäß Tabelle 1), d.h. unter Einsatz von 13x12=156 verschiedenen heterogenen RTase-Paaren sowie der 13 einzelnen RTasen (in der Diagonalen). Die AUC (Area Under Curve)-Werte (hell bedeutet höhere Vorhersageleistung, dunkel bedeutet entsprechend niedrigere Vorhersageleistung) einer Receiver Operating Charakteristik (ROC) für die aus drei technischen Replikaten (d.h. aus einem technischen Triplikaten) ermittelten RT-Signaturen wurden gemittelt in einer 100 mal wiederholten 3-fachen Kreuzvalidierung einer binären Klassifizierungsauswahl mit 26 positiven (m lA) und 26 zufällig ausgewählten negativen (nicht mlA) Fällen.
Anzahl der Random Forest-Modelle:
3x13x12x100x3 (kombiniert) + 3x13x100x3 (nicht kombiniert) = 152.100
Figur 6: Boxplot (Box-Whisker-Plot, Kastengrafik) für die m lA-Vorhersageleistungen der Random Forest-Klassifizierung, die mit den Informationen bzw. Daten der RT- Signatur-Merkmale von einer RT-Signatur (von einer der 13 verschiedenen RTasen), von zwei RT-Signaturen (von einem der 156 RTase-Paare) und von drei RT-Signaturen (von einem der 1716 RTase-Tripletts) trainiert wurden. Die AUC (Area Under Curve)-Werte der Receiver Operating Charakteristik (ROC) aus 100 Wiederholungen einer 3-fachen Kreuzvalidierung, die auf jede der drei Sequenzierungsläufe angewendet wurde, wurden gemittelt.
Die Kästchen (Boxen) zeigen den Bereich, in dem die mittleren 50% jeder Datenpopulation liegen.
Die Whiskers (Antennen) markieren die Perzentilwerte 5% und 95%, d.h. die Werte, die die Grenze zu den unteren 5% bzw. den oberen 5% der Daten bilden.
Figur 7: Ein Beispiel für eine Profile-Datei.
Mismatch-Typ 1, -Typ 2 und -Typ 3 steht synonym für die drei konkreten Fehlpaarungen mit den drei Basen, die natürlicherweise neben der Referenzbase (und ihrer Modifikation) im Genom auftreten; d.h. im Falle einer Modifikation von A, sind die Mismatch-Typen G, T und C. Beispiel 1: Gewinnung der Template-RNAs für die Kalibrierungsphase (Phase I)
Bei den in der Kalibrierungsphase verwendeten bekannten und hinsichtlich ihrer Nukleotidsequenz und gegebenenfalls der vorhandenen ausgewählten Nukleotid- Modifikationen identifizierten RNA(s) handelte es sich entweder um synthetische RNAs (im Handel erhältlich z.B. bei IBA, Göttingen, Deutschland) oder um aus natürlichen Quellen gewonnene RNAs, beispielsweise Hefe RNAs, deren Sequenzinformationen aus Datenbanken wie z.B. MODOMICS bekannt sind.
Gewinnung von RNAs aus Hefe (Saccharomvces cerevisiae)
Hefe-rRNA und Hefe-tRNA wurden mit bekannten und geläufigen Methoden gewonnen, z.B. wie in Tserovski et al. (2016) beschrieben.
Pro Probe/Ansatz für eine Reverse-Transkription(-sreaktion) wurden 0,5 μg RNA eingesetzt.
Beispiel 2: Protokoll für die Herstellung der cDNA-Bibliothek(en)
Das Protokoll entspricht prinzipiell dem in Tserovski et al. (2016) beschriebenen Protokoll.
(A) Fragmentierung der Template-RNA im Fall von rRNA als Template
Gesamte oder ribosomale RNA wurde in einem Volumen von 10 μΐ, enthaltend 10 mM ZnCl2 und 100 mM Tris-HCI, pH 7,4, bei 90 °C für 5 Min fragmentiert. Die Reaktion wurde gestoppt durch Zugabe von Ethylendiamintetraessigsäure (EDTA) bis zu einer Endkonzentration von 50 mM. Danach wurden die RNA-Fragmente mittels 10 % denaturierender Polyacrylamidgel-Elektrophorese (PAGE) nach Größe getrennt. Banden der Größe 50-150 nt wurden aus dem Gel herausgeschnitten, in 0,3 M Ammoniumazetat (NH4AC) eluiert und mit Ethanol präzipitiert.
(B) Dephosphorylierung
Die Template-RNA(s) (etwa 0,5 μg pro Probe/Ansatz) wurde(n) an beiden Endpunkten dephosphoryliert. Das Dephosphorylierungsgemisch (insgesamt 10 μΐ) bestand aus 100 mM Tris-HCI, pH 7,4, 20 mM MgCl2, 0, 1 mg/ml BSA, 100 mM 2-Mercaptoethanol und 0,5 U FastAP Alkaline Phosphatase (Thermo Scientific, #EF0651) bei 37°C für 30 Min. Vor der Zugabe des Enzyms wurde die RNA bei 90 °C für 30 Sek. denaturiert und dann auf Eis gekühlt (im folgenden wird diese Behandlung als "Hitzedenaturierung" bezeichnet).
Nach 30 Min. Dephosphorylierung wurde die RNA erneut für 30 Sek. hitzedenaturiert und anschließend der beschriebene Dephosphorylierungsschritt ein zweites Mal durchgeführt.
— Gesamtvolumen: 10,5 μΐ
(C) 3'-Adapter-Ligation
Als nächstes wurde ein Adapter mit dem 3'-Ende der dephosphorylierten RNA verbunden (ligiert). Die Ligation (Anbindung) des preadenylierten 3'-RNA Adapters (dessen 5 -Ende diurch einen C6-Körper blockiert war) an das 3 '-Ende der RNA erfolgte wie in Tserovski et al. (2016) beschrieben mittels einer oder mehreren Ligasen (hier der T4 RNA Ligase 2 truncated, New England Biolabs, #M0242L, und der T4 RNA Ligase, Thermo Scientific, #EL0021) und ohne Zwischenschaltung eines Aufreinigungsschritts im Reaktionsgemisch der Dephosphorylierungsreaktion mit 5 μΜ adenyliertem 3'-RNA Adapter, 15 % DMSO, 1 U T4 RNA Ligase 2 truncated und 0,5 U T4 RNA Ligase. Die Ligationsreaktion erfolgte bei 4 °C über Nacht. Anschließend wurden die Enzyme bei 75 °C über 15 Min. inaktiviert.
— Gesamtvolumen: 20,0 μΐ.
(D) Entfernung von überschüssigem Adapter
Vor dem Schritt der Reversen Transkription wurde der Überschuss an RNA-Adapter mit Hilfe der Enzyme Deadenylasen und Exonukleasen (hier 5'-Deadenylase, New England Biolabs, #M0331S und Lambda Exonuclease, Thermo Scientific, #EN0561) entfernt. Zu diesem Zweck wurde dem Ligationsgemisch aus (C) eine Menge von 20 U an 5'-Deadenylase (z.B. von New England Biolabs, Frankfurt, Deutschland) zugesetzt und anschließend bei 30 °C für 30 Min inkubiert. Nach einer Hitzedenaturierung (90 °C für 30 Sek., 2 Min. abkühlen auf Eis) wurde der Deadenylierungsschritt unter Zugabe der gleichen Menge an Enzym wie im ersten Durchgang wiederholt.
— Gesamtvolumen nun: 22.0 μΐ.
Als nächstes erfolgte der Verdau/Abbau des einzelsträngigen RNA-Adapters (jetzt vollständig monophosphoryliert) durch Zugabe von 10 U Lambda-Exonuklease (Thermo Scientific, Dreieich, Deutschland) zur Reaktionsmischung und Inkubation bei 37 °C für 30 Min. Nach Hitzedenaturierung des Enzyms (90 °C für 30 Sek., 2 Min. abkühlen auf Eis) wurde diese Verdau-Reaktion unter Zugabe der gleichen Menge an Enzym wie im ersten Durchgang wiederholt. Anschließend wurde das Enzym bei 80 °C über 15 Min. hitzeinaktiviert.
- Gesamtvolumen nun: 24,0 μΐ.
Aus der erhaltenen Mischung wurde die RNA ausgefällt, hier unter Zusgabe von zunächst 1 μΐ Glykogen (Thermo Scientific, Dreieich, Deutschland, #R0561) und Ammoniumazetat NH4AC (Endkonzentration: 0,5 M) bis zu einem Gesamtvolumen von 50,0 μΐ und nachfolgender Zugabe von 150 μΐ Ethanol pro Probe.
(E) Reverse Transkription
Die Zusammensetzung des Reverse-Transkriptions-Gemisch war wie in Tserovski et al. (2016) beschrieben. Das in (D) gewonnene Pellet wurde zunächst wieder gelöst, und zwar im jeweiligen RTase-spezifischen Reaktionsgemisch (gemäß Herstellerprotokoll), bestehend aus dem Reaktionspuffer (Soll-Endkonzentration lx) und RT Primer (Soll- Endkonzentration 5 μΜ), z.B. für die RTase SuperScript® III = RTase 5 aus Tabelle 1 bestehend aus I μΙ RT Primer von IBA, Göttingen, Deutschland, in einer Endkonzentration von 5μΜ, in4 μΐ First Strand (FS) Puffer (z.B. von Life Technologies, Darmstadt, Deutschland) ergänzt mit Wasser auf 16 μΐ.
Darauf folgte eine Hitzedenaturierung bei 80 °C für 10 Min. mit anschließender Abkühlung auf Eis.
Danach wurden 0,5 mM dNTP-Mix (= Mischung enthaltend alle vier Deoxyribonukleotid- Triphosphate dATP, dGTP, dCTP und dTTP) und je nach RTase-Typ zudem DTT, BSA und oder MgCl2 zugegeben (z.B. im Fall von RTase SuperScript® III = RTase 5 gemäß Tabelle 1 : BSA, Dithiothreitol) und schließlich 200 U der gewählten RTase hinzugefügt (z.B. 10 U/μΙ, SuperScript® III, Life Technologies = RTase 5 aus Tabelle 1).
Die Transkriptionsreaktionen wurden bei 45 °C für die Dauer von 1 Stunde durchgeführt, mit Ausnahme des Falls der Anwendung der RTase Volcano® = RTase 13 gemäß Tabelle 1, wo die Reaktionstemperatur 60 °C betrug.
— Gesamtvolumen: 20,0 μΐ
(F) Entfernung von überschüssigen Primern und dNTPs
Zum Zweck des Primer- Verdaus/Abbaus wurden der Reverse-Transkriptionsmischung aus (E) 10 U Exonuklease (hier: Lambda Exonuclease, Thermo Scientific, #EN0561) zugegeben und alles bei 37 °C für 30 Min inkubiert. Die Reaktion wurde durch Zugabe einer gleichen Menge an Enzym einmal wiederholt. Eine Hitzedenaturierung zwischen erstem und zweitem Durchlauf unterblieb, um die Denaturierung von RNA:DNA-Hybriden zu vermeiden.
— Gesamtvolumen: 22,0 μΐ.
Im Anschluß an den zweiten Exonukleasereaktionsdurchlauf wurden der Mischung 40 U der einzelsträngigen spezifischen Exonuklease I (Thermo Scientific, #EN0582) zugegeben und bei 37 °C für 30 Min inkubiert. Wiederum wurde die Reaktion ohne zwischengeschaltete Hitzedenaturierung durch Zugabe einer gleichen Menge an Enzym wiederholt.
Schließlich wurden alle Enzyme bei 80 °C für 15 Min. hitzeinaktiviert.
— Gesamtvolumen: 26,0 μΐ
Danach wurden die dNTP-Reste dephosphoryliert. Dazu wurden der Mischung 2 U der wärmeempfindlichen alkalischen Phosphatase FastAP Thermo Scientific, #EF0651) zugesetzt und bei 37 °C für 30 Min. inkubiert. Es folgte eine Hitzedenaturierung (90 °C für 30 Sek., 2 Min. Abkühlen auf Eis) und eine Wiederholung des Dephosphorylierungsschritts. Am Ende dieser wiederholten Dephosphorylierungsreaktion wurde das Enzym bei 75 °C für 5 Min. inaktiviert.— Gesamtvolumen: 30,0 μΐ
Anschließend erfolgte die Degradierung der RNA durch Zusatz von NaOH (Endkonzentration: 0,15 M), Erhitzen auf 55 °C für 25 Min. und nachfolgendem Abkühlen auf Eis für 2 Min.. Die Reaktion wurde durch Neutralisieren mit einer gleichen Menge an Essigsäure (Endkonzentration: 0, 15 M) gestoppt.
Für die nun anstehende Gewinnung der cDNAs (cDNA-Moleküle) mittels Ethanoifällung wurde dem Reaktionsgemisch 1 μΐ Glykogen (Thermo Scientific, #R0561) und NH4Ac (Endkonzentration: 0,5 M) zugegeben.— Gesamtvolumen: 100,0 μΐ
Anschließend wurden die cDNAs mit 250 μΐ Ethanol ausgefällt.
(G) 3'-tailing and Ligation der cDNA
Für die anstehende "3'-tailing"-Reaktion mit der Terminalen Desoxyribonukleotidyl- Transferase TdT (Thermo Scientific, #10533-065) wurde das in (F) erhaltene cDNA-Pellet in dem Reaktionsgemisch aus lx TdT Puffer, l,25 mM rCTP und 1 U/μΙ TdT aufgenommen und resuspendiert.
Die Mischung wurde bei 37°C für 30 Min. inkubiert. Danach folgt eine Wärmehandlung bei 70°C für 10 Min., um das Enzym zu inaktivieren. - Gesamtvolumen: 10,0 μΐ. Mit der erhaltenen Mischung wurde anschließend die Ligationsreaktion durchgeführt, hier z.B. mit Hilfe der T4 DNA Ligase (Thermo Scientific, #EL0013). Für die Ligation des doppelsträngigen DNA-Adapters wurden der Mischung 1,5 U/μΙ T4 DNA Ligase und 10 μΜ ATP in 50 mM Tris-HCl bei pH 7,4 und 20 mM MgC12 zugegeben (Endkonzentration des DNA-Adapters: 1 ,25 μΜ), und dieser Ligationsansatz wurde über Nacht bei 4 °C inkubiert. Danach folgt eine Wärmehandlung bei 75 °C für 15 Min., um das Enzym zu inaktivieren.— Gesamtvolumen: 40,0 μΐ
Die Gewinnung der cDNA-Ligationsprodukte aus der gewonnen Mischung erfolgte mittels Ethanolfällung unter Zugabe von zunächst 1 μΐ Glykogen (Thermo Scientific, #R0561) und NH4AC (Endkonzentration: 0,5 M) zu dieser Mischung (— Gesamtvolumen: 50,0 μΐ) und abschließender Zugabe von 150 μΐ Ethanol.
Zwecks Entfernung von überschüssigem DNA-Adapter wurde eine Polyacrylamidgel- Elektrophorese (PAGE) durchgeführt. Hierfür wurden das zuletzt erhaltene Pellet mit den Ligationsprodukten in ΙΟμΙ H20 aufgenommen und resuspendiert. Diese resuspendierte Ligationsprodukte-Mischung wurde auf ein denaturierendes 10 % Polyacrylamid-Gel aufgetragen. Nach erfolgter Elektrophorese wurden aus dem Gel die Areale des Größenbereichs zwischen 40 nt und 150 nt ausgeschnitten und über Nacht mit 300 μΐ 0,5 M NH4AC eluiert.
Die Gewinnung der cDNA-Ligationsprodukte aus dem gewonnenen Eluat erfolgte mittels Ethanolfällung unter Zugabe von zunächst 1 μΙ Glykogen (Thermo Scientific, #R0561) (— Gesamtvolumen: 301,0 μΐ) und abschließender Zugabe von 750 μΐ Ethanol.
(H) PCR-Amplifikation und Strichkodierung (Barcoding)
Die aus (G) erhaltenen cDNAs wurden mittels der Polymerase - Kettenreaktion (PCR) unter Verwendung einer Taq-Polymerase, hier z.B. der Taq-Polymerase von Rapidozym (#Gen-003-1000), und entsprechend barcodierten P5- und P7-Primern, hier z.B jeweils mit 8 nt Barcodes, amplifiziert. Dafür wurde das in (G) zuletzt erhaltene Pellet mit den Ligationsprodukten der Größe 40 nt bis 150 nt in 20 μΐ PCR-Reaktionsgemisch aufgenommen und resuspendiert. Das PCR-Reaktionsgemisch bestand pro 20 μΐ aus lx Taq-Polymerase-Puffer, 3 mM MgCl2> 5 μΜ P5 Primer, 5 μΜ P7 Primer, 0,5 mM dNTP Mix und 0,25 U/μΙ Taq-Polymerase.
Die gewonnene Resuspension mit den darin enthaltenen Adapter-ligierten cDNAs, den P5- und P7-Primern, der Taq-Polymerase und den dNTPs wurde 12 PCR-Zyklen unterworfen. Die PCR startete mit einem Denaturierungsschritt (von DNA-Doppelsträngen in Einzelstränge) bei 95 °C für 5 Min.. Anschließend wurden 12 Zyklen bestehend aus Denaturierung bei 95 °C für 1 Min., Annealing (Hybridisierung) bei 65 °C für 1 Min. und Elongation bei 72 °C für 1 Min. durchgeführt. Beendet wurde die PCR mit einem abschließenden Elongationschritt bei 72 °C für 5 Min.
— Gesamtvolumen: 20,0 μΐ.
Die Gewinnung der PCR-Produkte, d.h. der amplifizierten cDNAs, erfolgte mittels Ethanolfällung unter Zugabe von zunächst 1 μΐ Glykogen (Thermo Scientific, #R0561) und NH4Ac (Endkonzentration: 0,5 M) zu dieser Mischung ( - Gesamtvolumen: 50,0 μΐ) und abschließender Zugabe von 150 μΐ Ethanol.
Die PCR-Produkte (amplifizierten cDNAs) wurden mittels 10 % denaturierender Polyacrylamidgel-Elektrophores (PAGE) nach Größe getrennt.
Hierfür wurde das zuletzt erhaltene Pellet mit den amplifizierten cDNAs in 10 μ1 Η2Ο aufgenommen und resuspendiert. Diese Resuspension wurde auf ein denaturierendes 10 % Polyacrylamid-Gel aufgetragen. Nach erfolgter Elektrophorese wurden aus dem Gel die Areale des Größenbereichs zwischen 150 nt, (der Größe der Adapter Dimere) und 300 nt (der maximalen Größe von PCR-Amplifikationsprodukten) ausgeschnitten und über Nacht mit 300 μΐ 0,5 M NR,Ac eluiert.
Die Gewinnung der amplifizierten cDNAs aus dem Eluat erfolgte mittels Ethanolfällung unter Zugabe von zunächst 1 μΐ Glykogen (Thermo Scientific, #R0561) (— Gesamtvolumen: 301,0 μΐ) und abschließender Zugabe von 750 μΐ Ethanol.
Das gewonnene Pellet, das die amplifizierten cDNAs einer Größe von 150-300 nt enthält, wurde in 10 μΐ H20 aufgenommen und resuspendiert. Die in dieser Suspension enthaltenen cDNAs waren bereit für eine Sequenzierung, insbesondere auch für eine Hochdurchsatz- Sequenzierung mit NGS-Methoden, z.B. "Sequenzierung mit Brückenamplifikation".
Beispiel 3: Hochdurchsatz-Sequenzierung (-Screening) (A) Qualitätskontrolle und Quantifizierung
Ein Aliquot der (jeder) gemäß Beispiel 2 gewonnenen cDNA-Proben wurde einer elektrophoretischen Auftrennung mit anschließender Qualitätskontrolle und Quantifizierung unterworfen. Dies erfolgte vorzugsweise maschinell, hier z.B. unter Einsatz des Agilent Bioanalyzer 2100, eines im Stand der Technik bekannten und gebräuchlichen Apparates zur Durchführung von hochempfindlichen elektrophoretischen Auftrennungen.
Dafür wurden die Aliquots verdünnt (5-500 pg/μΙ) und auf einen Agilent High Sensitivity DNA-Chip geladen. Der so beladene Chip wurde in den Analyzer eingebracht. Während der maschinellen Analyse wurden die Probenkomponenten (DNA-Moleküle) elektrophoretisch getrennt, detektiert und in gelartige Bilder (Banden) und/oder Elektropherogramme (Peaks) übersetzt. Die ermittelten Daten wurden in digitaler Form erstellt und in Echtzeit automatisch analysiert. War die Qualität des jeweils untersuchten Aliquots zufrieden stellend, wurde die dazugehörige Probe weiter verwendet.
(B) Sequenzierung (mit NGS-Methoden)
Die gemäß vorstehendem Schritt (A) überprüften und für qualitativ zufrieden stellend befundenen Proben wurden sequenziert. Diese Sequenzierung erfolgte mit der NGS- Methode "Sequenzierung mit Brückenamplifikation", z.B. unter Einsatz der bekannten und geläufigen Illumina-Sequenzierung, hier der MiSeq-Methode ("MiSeq-Sequenzierung") unter Verwendung des Sequenzierapparates MiSeq auf der MiSeq-Plattform.
Hierfür wurden die hinsichtlich Qualität und Quantität überprüften und für geeignet befundenen Proben der (gegebenenfalls mehreren parallel) gemäß Beispiel 2 erstellten cDNA-Bibliothek(en) vereinigt, mit 2 N NaOH denaturiert und verdünnt (10 pM), und auf die Trägerplatte, die sogenannten "Flow Cell", aufgetragen.
Diese Trägerplatte/Flow-Cell mit den cDNA-Molekülen der Proben wurde in den Sequenzier-Apparat (Sequenzer) eingebracht, und anschließend wurde maschinell sequenziert (gemäß Herstellerangaben, siehe: MiSeq®-Systemhandbuch, Katalog-Nr. SY-41 1-9001 DOC, Material-Nr. 20000262, Dokument-Nr. 15027617 vOl DEU, September 2015).
Die ermittelten Sequenzinformationen pro cDNA-Molekül, die "Reads", wurden in digitaler Form erstellt und ausgegeben und waren bereit für die Einspeisung und Weiterverarbeitung in eine Bioinformatik-Pipeline.
Die gewonnenen Sequenzierungsdaten wurden auf Qualität und Adapter-Kontamination überprüft. Dafür wurden sie (hier und vorzugsweise) über eine (die) Bioinformatik- bzw. High-Throughput-Sequenzierungs-Pipeline mit dem im Stand der Technik bekannten Software-Programm FastQC untersucht. Das FastQC-Programm erstellte einen Qualitäts-Kontroll (QC)-Bericht der erkannten Probleme, die entweder im Sequenzer oder im Ausgangsbibliotheksmaterial entstanden waren. FastQC konnte in einem von zwei Modi ausgeführt werden. Es konnte entweder als eigenständige interaktive Anwendung für die sofortige Analyse von kleinen Zahlen von FastQ-Dateien laufen, oder es konnte in einem nicht-interaktiven Modus ausgeführt werden, der für die systematische Verarbeitung einer großen Anzahlen von FastQ-Dateien geeignet ist. In diesem nicht-interaktiven Modus war es gut in eine größere Analyse- Pipeline integrierbar.
Hier im Beispiel erfolgte die Untersuchung mittels FastQC im Rahmen der MiSeq RTA Software. Im Verfahrensschritt des sogenannten Demultiplexings wurden zunächst die Barcode-Sequenzen aus dem Barcoding-PCR Schritt identifiziert (keine Fehlertoleranz - 0 Mismatch) und anschließend die Reads (Sequenzierdaten) in individuelle FastQ-Dateien (eine FastQ-Datei je Probe bzw. pro ursprüngliche cDNA-Bibliothek) auftrennt.
Diese FastQ Dateien wurden auf Qualität, Adapter Dimere und überrepräsentierte Sequenzen geprüft.
Beispiel 4: Trimming und Mapping der gewonnenen Reads (Sequenzierdaten)
(A) Trimming
Die gemäß Beispiel 3 erhaltenen Reads wurden getrimmt, d.h. Adaptersequenzen, insbesondere die Sequenzen der Adapter P5 und P7 aus der PCR-Reaktion (vgl. Beispiel 3 (H) ) und zudem zufällige 10 nt Sequenzen des 3'-RNA-Adapters am 3'-Ende der RNA (vgl. Beispiel 2 (C)) und variable Anzahl an 5'-G RNA-Nukleotiden aus dem CTP cDNA Tailing Schritt (vgl. Beispiel 3 (G)) wurden entfernt.
Das Trimming erfolgte (hier und vorzugsweise) computerbasiert mit einer im Stand der Technik gebräuchlichen Bioinformatik-Software für Adapter-Trimming, hier im Beispiel mit der Cutadapt vi .8.1 Software.
(B) Mapping
Das Mapping, d.h. die Zuordnung zum Referenzgenom, wurde unter Verwendung der Software Bowtie 2 durchgeführt. Die Einstellungen dieses Bowtie2-Aligners waren: Alignment-Modus = end-to-end-Alignment ("global"); seed length (= Länge des initialen Alignmentversuchs) = 6 nt - L 6; k = 1 (d.h. beim gleichzeitigen Mapping aller Referenzen wurde nur ein von Bowtie2 als gültig erklärtes Alignment für jeden Ablesevorgang berichtet) und Mismatch = - Nl (d.h. Tolerierung von einer Fehlpaarung in der "seed", d.h. im Bereich des initialen Alignmentversuchs).
Beispiel 5: Diagnostizierung der RT-Signatur
Die RT-Signaturdiagnostizierung, d.h. die Identifizierung und quantitative Messung des Reverse-Transkriptions-Ereignismusters für die untersuchte(n) Template-RNA(s), erfolgte an jeder einzelnen Nukleotid-Position der betreffenden RNA mit Hilfe von im Stand der Technik bekannten und geläufigen Softwareprogrammen, z.B. der SAMtools Software (Version 1.2).
Hierfür wurden zunächst die SAM-Dateien aus dem Mapping-Schritt in BAM-Dateien konvertiert. Dann folgten die Schritte: (i) Sortierung und Indizierung der BAM-Dateien, (ii) Umwandlung der BAM-Dateien in das Pileup-Format und (iii) Umwandlung des Pileup-Formats in eine benutzerdefinierte Tab-separierte Text-Datei (sogenannte "Profile Datei").
In den Dateien waren für jede einzelne Nukleotidposition (Referenzposition) der Template- RNA(s) alle relevanten RT-Signatur-Merkmale wie Coverage (Abdeckung, Überdeckung), Abbruch-Rate (arrest rate), Gesamt-Mismatch-Rate, Einzelmismatch-Raten (der betreffenden falsch gepaarten Nukleotide), Gesamtsprungrate, Rate der direkten Einzelsprünge (Single Jump Rate Direct), Rate der verzögerten Einzelsprünge (Single Jump Rate Delayed), Doppelsprung-Rate (Double Jump Rate) angegeben.
Die Merkmale wurden basierend auf dem Pileup-Format erfasst und im Profile-Format gemäß folgender Regeln berechnet:
Die Arrest-Rate ai einer Position i ist definiert als der relative Anteil an Reads (cDNAs), die an der Stelle i+l starten, d.h. i+l abdecken, nicht jedoch i, unter allen Reads, die i+l abdecken und deren Anzahl als Coverage (Überdeckung) Cj+ ι bezeichnet wird. Wenn Si+i die Anzahl der an i+l startenden Reads ist, dann ist die Arrest-Rate der Position i definiert als a; = Sj+ i / Cj+] . Sei di die Anzahl von gemappten Reads, die i mit einer Base überdecken, welche sich von der Referenzbase an i unterscheidet. Dann ist die Mismatch-Rate definiert als mj = d; / cj. Die Einzel-Mismatch-Raten für G, T und C an einer mlA-Stelle werden als Anteile an mi gezählt. Die genannten Anzahlen von Coverages, Abbrüchen, Starts, Mismatches und Sprüngen sind direkt aus dem Pileup-Format ermittelbar. Jede Zeile des Pileup-Formats spiegelt basengenau die Überdeckung einer Referenzposition wieder. Dabei stehen Punkte und Kommas für überdeckende Basen, die der Referenzbase gleichen. Basen, die sich von der Referenzbase (in der Template-RNA) unterscheiden, erscheinen im Pileup-Format in Form der gewohnten Buchstaben A, G, T oder C (sofern der jeweilige Read in "sense"-Richtung, d.h. so wie er ist aligniert wurde) bzw. a, g, t, oder c (falls der jeweilige Read in "anti-sense"-Richtung, d.h. als sein reverses Komplement aligniert wurde). Ein Sprung über die entsprechende Position wird als Sternchen dargestellt. Bei Sprüngen über mehrere Positionen steht an der ersten Position statt dem Sternchen ein Minuszeichen, gefolgt von einer Zahl, die die Anzahl der übersprungenen Positionen wiedergibt. Zur Berechnung der sogenannten kontext-sensitiven Abbruchrate CSA (CSA ist definiert als das Verhältnis von positionsspezifischem RT-Abbruch (Arrest) at an einer Stelle i zu dem in der lokalen Umgebung, d.h in den Nachbarsequenzen beobachteten RT- Abbruch) werden im Pileup-Format die 5 Stellen vor und 5 Stellen nach der betreffenden Nukleotid-Position i (d.h. die Nachbarsequenzen fünf Basen upstream (+ 5 bp) und fünf Basen downstream (- 5 bp)) herangezogen und die Arrest-Rate an Position i durch den Median der Arrest-Raten aller elf in diesem Fenster liegenden Positionen dividiert. Die Fenstergröße kann je nach Kenntnis über die Beschaffenheit der vorliegenden RNA vergrößert oder verringert werden, um gegebenenfalls die Vorhersageleistung in der Kreuzvalidierung zu verbessern.
Die so erhaltenen Daten wurden aus dem Pileup-Format z.B. (wie hier und vorzugsweise) in das Profile-Format transformiert und dort abgespeichert und bei Bedarf angezeigt. In Fig. 7 ist ein Beispiel für eine solche Profile-Datei dargestellt.
Für eine Weiterverarbeitung der Daten z.B. in einem Klassifizierverfahren, das nur Nukleotidpositionen einer bestimmten Referenzbase (A, C, G oder T) klassifizieren soll, z.B. von Adenin (A) in entweder "modifiziert" (m lA) oder "nicht-modifiziert" (A) , können Profile-Dateien mit reduziertem Datensatz erstellt werden, z.B. nur mit den Daten von Positionen, die der Referenzbase A der betrachteten Modifikation mlA entsprechen.
Beispiel 6: Computerbasierte und auf Machine-Learning (maschinellem Lernen) beruhende überwachte Vorhersage (supervised prediction) von mlA- Stellen Die gemäß Beispiel 5 gewonnenen digitalen Daten des RT-Ereignismusters (der RT-Signatur), die vorzugsweise in Form von Profile-Dateien vorlagen, wurden in ein computerbasiertes, auf maschinellem Lernen beruhendes Klassifizierungsverfahren, z. B. (hier und vorzugsweise) in das im Stand der Technik bekannte und gebräuchliche, auf Entscheidungsbäumen basierende Random Forest-Klassifizierungssystem (R Version v3.3.1) eingespeist.
Für die Klassifizierung der RT-Signaturen wurden dem Klassifizierer mindestens die Attribute: Abbruch-Rate a, Gesamt-Mismatch-(Fehlpaarungs-)-Rate m, das m/a- Verhältnis, relative Fehlpaarungszusammensetzung (Fraktionsgehalt von G, T und C) und die kontext-sensitive Abbruchrate CSA eingegeben, und vorzugsweise zudem die Sprungrate.
(A) Training und Testung (Überprüfung) des Klassifizierers (Phase I des Verfahrens)
Für das Training und Testen/Überprüfen des Klassifizierers auf die Detektion einer bestimmten charakteristischen RT-Signatur, hier z.B. auf die Detektion der RT-Signatur an mlA-Stellen, wurden dem Algorithmus zunächst gleiche Anzahlen (beispielsweise jeweils 45 wie in Hauenschild et al. (2015) beschrieben) an RT-Signaturen von bekannten m lA Stellen (aus bekannten Template-RNAs mit identifizierten mlA-Stellen) und an RT-Signaturen von bekanntermaßen nicht-modifizierten (bzw. nicht erkennbar modifizierten) A-Stellen (aus bekannten Template-RNAs ohne m lA-Stellen) zugeführt. Zu diesem Zweck wurden vorzugsweise gemäß Beispiel 5 erstellte Profile-Dateien mit reduziertem Datensatz verwendet, d.h Profile-Dateien, die nur die RT-Signaturdaten der für die betreffende Referenzbase (hier z.B. für A) angezeigten Positionen enthalten (hier im Beispiel m lA- oder nicht-mlA-Positionen). Bevorzugterweise wurden (wie in Hauenschild et al. 2015 beschrieben) mlA-ähnliche nicht-ml A-Stellen in das Training mit einbezogen, um den Klassifiziere auch auf die Erkennung bzw. Vorhersage von schwierigen Fällen in unbekannten Template-RNAs vorzubereiten.
Anhand der RT-Signaturen von den bekannten positiven ml A-Stellen erstellte ("erlernte") und adaptierte (korrigierte und optimierte) der Klassifizierer (hier beispielsweise und vorzugsweise der Random Forest-Klassifizierer, R Version v3.3.1) das besondere und typische (charakteristische) Profil für die mlA-Stelle (vgl. Fig. 2 A). Mit anderen Worten: Der Klassifizierer erlernte das typische m lA-RT-Signatur-Profil implizit während der Trainings- und (Selbst-)Testungs-/Überprüfungsläufe.
Als optionale Qualitätsüberprüfung wurde mit den eingegebenen Daten eine wiederholte, mehrfache (hier z.B. dreifache) Kreuzvalidierung durchgeführt. Auf diese Maßnahme kann aber auch verzichtet werden.
Das Klassifizierungsergebnis bestand in einer Auflistung aller geprüften Positionen ("Instanzen") auf der/den (jeder) Template-RNA(s) mit einer Bewertung pro Position ("Instanz") bezüglich der Entscheidung bzw. Frage, ob die jeweils vorliegende RT-Signatur mit dem erlernten typischen mlA-RT-Signatur-Profil (vgl. Fig. 2A) annähernd oder vollständig übereinstimmte, d.h. die ihm ähnlich war oder mit ihm übereinstimmte.
Die Bewertung erfolgte in der Angabe eines Zahlenwertes zwischen 0 und 1 , wobei der Wert "0" einem eindeutigen "nein" und der Wert " 1 " einem eindeutigen "ja" entspricht. Zwischenwerte stehen für eine entsprechende Wahrscheinlichkeit für ein "ja" bzw. ein "nein" (z.B. steht der Wert 0,99 für ein relativ sehr sicheres "ja" und der Wert 0,4 steht für ein schwaches "nein"). Je näher eine Bewertung beim Wert 1 liegt, d.h. je sicherer die "ja"-Bewertung ausfällt, desto stärker wiegt sie als Indiz für das Vorliegen der mlA- Nukeotid-Modifikation an der betreffenden Position der Template-RNA.
Die Berechnung der mittleren Vorhersageleistung (Sensitivität, Spezifität) erfolgte auf der Basis von Training und Testung/Überprüfung mit Hilfe der Kreuzvalidierungen.
(B) Einsatz (Anwendung) des Klassifizierers zur Untersuchung einer unbekannten Template-RNA
Die zu untersuchende unbekannte(n) Template-RNA(s) (beispielsweise aus einer Patienten-Probe) wurde gemäß der Beispiele 2 und 3 aufbereitet. Die gewonnenen Sequenzinformationen in Form der Reads wurden gemäß Beispiel 4 getrimmt und einem Referenzgenom zugeordnet ("gemapped") und gemäß Beispiel 5 bezüglich der RT-Signaturen untersucht, d.h. die RT-Signatur-Merkmale Coverage (Abdeckung), Abbruch-Rate (arrest rate), Gesamt-Mismatch-Rate, Einzelmismatch-Raten (der betreffenden falsch gepaarten Nukleotide) Rate der direkten Einzelsprünge (Single Jump Rate Direct), Rate der verzögerten Einzelsprünge (Single Jump Rate Delayed), Doppelsprung-Rate (Double Jump Rate) wurden an jeder Nukleotidposition auf Vorhandensein geprüft und gegebenenfalls quantitativ gemessen.
Bevorzugterweise und zwecks Aufwandsminimierung wurden gemäß Beispiel 5 nur diejenigen Nukleotidpositionen im Profile-Format abgespeichert und in den Klassifizierer eingespeist, die die fragliche Referenzbase (das fragliche Nukleosid) aufweisen.
Im Anwendungsfall zur Untersuchung hinsichtlich eventuell vorhandener m lA-Stellen wurden folglich alle potentiellen Positionen mit der Referenzbase A (Adenin) im Profile- Format abgespeichert und in den Klassifizierer, hier den Random Forest, eingespeist.
Eine verkürzte Laufzeit der Vorhersageprozedur konnte dadurch erreicht werden, dass in der Profile-Datei offensichtlich signaturlose Zeilen (d.h. Nukleotid-Positionen, die von der RTase korrekt transkribiert worden waren und wo folglich keines der charakteristischen RT-Signatur-Merkmale vorliegt) mit Hilfe eines einfachen Filters (Verlangen von benutzergewählten Mindestwerten für Signaturmerkmale) kontrolliert entfernt wurden.
Als Ergebnis der Untersuchung lieferte der Klassifizierer (z.B. das Random Forest Modell) eine Einschätzung zwischen "ja" und "nein" für jede Nukleotid-Position im untersuchten Transkriptom und damit eine Aufstellung derjenigen Positionen auf der/den unbekannten Template-RNA(s), die eine RT-Signatur aufwiesen, die mit dem (vom Klassifizierer implizit gelernten) besonderen und typischen (charakteristischen) Profil für die betreffende Nukleotid-Modifikationsstelle, hier im Beispiel für die m lA-Stelle, annähernd oder vollständig übereinstimmten.
Als Maß für die Qualität der Bewertung wurde hier (beispielsweise und vorzugsweise) noch der sogenannte "Score", ein numerischer Punktewert auf einer eindimensionalen Bewertungsskala, jeweils mit angegeben. Die Erstellung des Scores ist eine (mögliche) Komponente des Random Forest Klassifizierers.
Beispiel 7: Analyse und Vergleich der RT-Signaturen von 13 verschiedenen RTasen für die (bzw. an der) R A-Nukleotidmodifikation mlA
Analog der in den Beispielen 2 bis 5 beschriebenen Verfahren wurden die in Tabelle 1 aufgelisteten 13 verschiedenen, im Stand der Technik bekannten und im Handel erhältlichen Reversen Transkriptasen (RTasen) parallel und analog hinsichtlich ihrer jeweiligen RT-Signatur an m lA-Stellen untersucht.
Die Erstellung der cDNA-Bibliotheken und die Hochdurchsatz-Sequenzierung (gemäß den Beispielen 2 und 3) und ebenso das Trimming und Mapping und die Diagnostizierung der RT-Signaturen (gemäß den Beispielen 4 und 5) wurde für alle 13 RTasen dreimal wiederholt (d.h. technische Triplikate je RTase wurden erstellt). Als Template-RNA diente für jeder der RTasen die gut analysierte (annotierte) Gesamt-tRNA von Saccharomyces cerevisiae (erhältlich z.B. bei Roche Diagnostics: Ref 10109525001 / lot 13407921), die ausreichend viele bekannte m lA-Stellen enthält. Als Referenzsequenzen diente ein Satz aus 43 tRNAs, zusammengestellt aus den Datenbanken MODOMICS (Machnicka et al., 2013) und Sprinzl (Jühling et al., 2009). Unter diesen 43 tRNAs befanden sich 26 tRNAs, die in ihrer Sequenz ein ml A tragen.
Die ermittelten RT-Signaturen der 13 verschiedenen RTasen zeigten große Variationen in ihren Abbruch- und Mismatchraten, d.h. die Abbruch- und Fehlpaarungsraten der einzelnen RTasen waren im Vergleich untereinander stark unterschiedlich (siehe Fig. 3). Zum Beispiel zeigten RTase 10 (MonsterScript™) und RTase 4 (GoScript™) hohe Abbruch- und niedrige Mismatch (Fehlpaarungs)-Raten während RTase 12 (SuperScript®IV) im Vergleich dazu ein umgekehrtes Verhalten zeigte.
Diese Unterschiede weisen darauf hin, dass das Detektionsvermögen der einzelnen RTasen bezogen auf mlA Positionen in der Sequenz der Template-RNA stark variiert.
Im Verlauf dieser Vergleichsuntersuchungen wurde zudem überraschenderweise ein bisher unbekanntes Phänomen festgestellt, dass bei den einzelnen RTasen unterschiedlich stark ausgeprägt war: In den Sequenzierdatensätzen einiger RTasen waren an mlA Stellen charakteristische Sequenzlücken zu erkennen, die auf Sprünge bei der Abschreibung der RNA in cDNA hinweisen. Mit anderen Worten: Die betreffenden RTasen zeigten in ihrer RT-Signatur neben Mismatch/Fehlpaarung und Abbruch außerdem als bisher unbekanntes Phänomen charakteristische Lücken in der Sequenzablesung, die sich aus Sprüngen der betreffenden RTase über die mlA-Position hinweg ergeben (siehe Fig. 1 und Fig. 2).
Diese Sprünge traten auffallend häufig an m lA-Stellen auf und insbesondere an solchen mit einer hohen Abdeckung/Erfassungsrate ("coverage") aufgrund des starken Read- Through-Vermögens der jeweiligen RTase. Es können Einzel- und Doppelsprünge unterschieden werden. Bei den Einzelsprüngen kann es sich um direkte oder um verzögerten Einzelsprünge handeln, das heißt die (übersprungene) Lücke Hegt entweder direkt an der mlA-Stelle oder an der Stelle ihres 5' angrenzenden Nachbarn, bekannt als -1 -Position. Doppelsprünge führen zu und erscheinen als Lücken an den beiden Positionen m l A- und -1.
Die Variabilität der Sprungfähigkeiten, die von einer Gesamtsprungrate von ca. 10 % für SuperScript® IV bis zu vernachlässigbaren Werten für RTasen mit höchsten Abbruchraten reicht, stellt eine weitere Ebene der individuellen Read-Through-Fähigkeit von RTasen dar. Generell sind die meisten der vorkommenden Sprünge Doppel-Sprünge über zwei Nukleotide. Einzel-Sprünge treten annähernd gleich häufig auf, mit einer leichten Präferenz für verzögerte Einzel-Sprünge.
Das Streudiagramm in Fig. 3 zeigt für die 13 untersuchten, verschiedenen RTasen die große Vielfalt der RT-Signaturen an m lA-Stellen unter Berücksichtigung dieses neu entdeckten dritten Kern-Merkmals "Jumps/Sprünge". (Die dargestellten Werte für Abbruchrate, Mismatch-Rate und Gesamtsprung-Rate repräsentieren jeweils den Mittelwert aus den betreffenden drei Einzelwerten des jeweiligen technischen Triplikats; die Fehlerbalken zeigen die Standardabweichungen von Abbruch- und Fehleinbauraten dieser Triplikate.)
Die Nutzung der festgestellten großen Varianz in der RT-Signatur der 13 verschiedenen RTasen (siehe Fig. 3) - unter Berücksichtigung allein der charakteristischen Merkmale Abbruch-Rate und Mismatch-Rate oder aller drei als prägend erkannten Merkmale Abbruch-Rate, Mismatch-Rate und Gesamtsprung-Rate - bietet stark verbesserte und erweiterte Möglichkeiten für die Detektion von m lA-Stellen - oder auch von anderen Nukleotid-Modifikationsstellen mit typischer RT-Signatur - in einer beliebigen Test- Template-RNA. Beispiel 8: Bewertung der Vorhersageleistung der RT-Signatur einer RTase und Gewichtung (Bedeutsamkeit) der RT-Signatur-Merkmale
Zur Bewertung der Vorhersageleistung der RT-Signatur einer individuellen RTase wurden gemäß Beispiel 6 (A) für die in Beispiel (7) gewonnenen RT-Signaturen der 13 RTasen an mlA-Stellen jeweils ermittelt, welches der charakteristischen Merkmale der RT-Signatur mit welcher Gewichtung die betreffende RTase-spezifische RT-Signatur prägt bzw. mitprägt.
Untersucht wurden (hier z.B. und vorzugsweise) die sechs RT-Signatur-Merkmale: Abbruchrate, Gesamtsprungrate und Mismatch-Rate und hinsichtlich der Mismatch- Ereignisse zudem die relativen Gehalte der Mismatch-Komponenten G, T und C.
Auch bei dieser Untersuchung wurden große Unterschiede zwischen einzelnen RTasen gefunden (vgl. Fig. 4). Bei einigen RTasen dominierten Abbruchrate und Mismatchraten ihre RT-Signatur, weshalb deren Vorhersagekraft vor allem auf Abbruchrate und Mismatchrate basiert, während bei anderen RTasen die Sprungrate die RT-Signatur entscheidend mitprägte und deshalb in die Bewertung der Vorhersageleistung der RT-Signatur miteinbezogen werden sollte.
Um zu ermitteln, wie die RTase-Typ-spezifischen Unterschiede in den RT-Signaturen die Diskriminierung (Unterscheidung/Abgrenzung) zwischen m lA und nicht-m lA Fällen beeinflussen, wurde ein überwachtes maschinelles Lernexperiment durchgeführt:
Für jede der in Tabelle 1 gelisteten 13 RTasen wurden die RT-Signaturen von 26 mlA- Fällen (gewonnen mit m lA-haltigen Hefe-tRNAs als Template-RNAs) mit einer gleichen Anzahl von nicht-m lA-Signaturen gepaart, die zuvor nach dem Zufallsprinzip aus dem umgebenden Sequenzpool gezogen wurden. Diese Paare wurden gemischt und in drei Gruppen gleicher Klassenhäufigkeit (sogenannte "folds") aufgeteilt.
Jeder Signaturdatenpunkt enthielt die RT-Signatur-Merkmale Abbruchrate, relative Mismatch-Rate, relative Mismatch-Komponenten (G, T und C) und die Gesamtsprungrate. In einer Kreuz-Validierung wurde ein Random-Forest-Modell (wie in Liaw und Wiener, 2002, beschrieben) auf (an) zwei dieser Gruppen ("folds") trainiert (geschult) und auf (an) der dritten getestet. Shuffling (d.h. Durchmischung der Gruppenzusammensetzung) und Kreuz- Validierung wurden 100 mal wiederholt, um der statistischen Varianz Rechnung zu tragen.
Die Anwendung dieser Prozedur für die in Beispiel 7 gewonnenen RT-Signaturen jeder RTase lieferte die in Fig.4 dargestellten Ergebnisse: Für jede der 13 RTasen (Nr. 1 bis Nr. 13) ist für jedes der sechs RT-Signatur-Merkmale die gemittelte Rangfolge ihrer Leistungsfähigkeit für eine m 1 A-Vorhersage und damit ihre "Leistungsfähigkeit der Klassifizierung" ("Classification power") als (in Form der) "Area Under Curve (AUC)" der "Receiver Operating Characteristic (ROC)" angegeben. Die Daten der RT-Signatur- Triplikate wurden gemittelt; die schwarzen vertikalen Striche zeigen Standardabweichungen über 3 Sequenzläufe). Für jede RTase wurden in jedem Klassifizierungslauf 100 Wiederholungen einer 3-fachen Kreuzvalidierung durchgeführt. Jedes binäre Klassifizierungs-Setup enthielt 26 positive (m lA) und 26 zufällig ausgewählte negative Fälle (non-mlA, d.h. ohne Nukleotidaustausch) aus dem tRNA-Sequenzraum und wurde unter Schichtung in zwei Trainings- und eine Test-Datengruppe aufgeteilt. Das führte zu 3 13x100x3 = 1 1,700 Random Forest Modellen.
Es ist deutlich erkennbar, dass RT-Signaturen einiger RTasen zu besseren Vorhersageleistungsergebnissen führten als die von anderen. Bei einigen RTasen unterschieden sich die Vorhersageleistungsergebnisse um mehrere Prozentpunkte. Die RTase 5 (SuperScript® III), die in den von Hauenschild et al. (2015) beschriebenen Untersuchungen verwendet wurde, rangiert in der Mitte dieser Klassifizierung.
Durch eine gezielte Auswahl der mutmaßlich am besten geeigneten RTase(n) für eine geplante Sequenzuntersuchung einer Test-Template-RNA bezüglich einer bestimmten Nukleotid-Modifikation können so der Arbeitsablauf verbessert und Restfehler entscheidend reduziert werden.
Ein Vergleich der Gewichtungswerte, die für die RT-Signatur-Merkmale von verschiedenen RTasen (an mlA-Stellen) mit dafür konstruierten maschinellen Lernmodellen erhalten wurden, weist auf ein individuelles Gewichtungsmuster der Merkmale in der RTSignatur einer jeden RTase hin, das zur Entscheidungsfindung beiträgt.
Die Bestimmung der Gewichtung (Synonyme: Bedeutsamkeit; Wichtigkeit) eines RT-Signatur-Merkmals (z.B. der Abbruchrate) erfolgte durch Permutation der (aller) Werte, die für dieses Merkmal mit allen 13 untersuchten RTasen gewonnenen wurden (d.h. Vertauschung von Werten, auch von Negativinstanzen, nämlich Nukleotid-Positionen mit potenziell schwacher Ausprägung dieses Merkmals, mit entsprechenden Werte von Positivinstanzen, nämlich von Nukleotid-Positionen mit zumeist stärkerer Ausprägung dieses Merkmals), und Messung der korrespondierenden Abnahme der Klassifizierungsgenauigkeit. Diese Abnahme der Klassifizierungsgenauigkeit ist tendenziell umso höher, je wichtiger (prägender) dieses Merkmal für die RT-Signatur ist. Zum Beispiel hat für die RT-Signatur von RTase 3 (ProtoScript® II) die Permutation der ausgeprägten Abbruchrate große Auswirkungen, während dieses Merkmal für RTase 12 (SuperScript® IV), wo es nur geringfügig ausgeprägt ist, nur von untergeordneter Bedeutung ist. Obwohl sie in den Mustern der Merkmals-Gewichtung unterschiedlich sind, liegen RTase 3 (ProtoScript® II) und RTase 12 (SuperScript® IV) auf den höchsten AUC-Rängen, d.h. ihre RT-Signaturen besitzen die stärkste Klassifizierungsfähigkeit und erlauben die besten maschinellen Lernleistungen.
Beispiel 9: Vergleich der mlA Erkennungsleistungen - Paarweise Kombination der
RT-Signaturen von verschiedenen RTase-Typen (a) nach
Einzelleistungen und (b) mit unterschiedlichen Mustern in der Gewichtung (Bedeutsamkeit; Wichtigkeit) ihrer RT-Signatur-Merkmale
Um zu prüfen, ob diese gemäß Beispiel 8 festgestellten Unterschiede in den RT-Signaturen verschiedener RTasen für eine verbesserte Detektion von Nukleotid-Modifikationsstellen in Template-RNAs genutzt werden können, wurde das in Beispiel 8 beschriebene überwachte maschinelle Lernexperiment, nämlich Random-Forest-Training und -Testung/Überprüfung (basierend auf 100 Wiederholungen einer 3-fachen Kreuzvalidierung) für RTase-Paare durchgeführt, d.h. unter Verwendung der RT-Signaturdaten (vgl. Fig. 3) von jeweils zwei RT-Signaturen zweier verschiedener RTasen. Für die insgesamt 13 verschiedenen RTasen (gemäß Tabelle 1) ergaben sich somit 13 x 12 = 156 heterogene RTase-Kombinationen, d.h. Paare aus zwei verschiedenen RTasen. Zum Vergleich wurde dieses Lernexperiment außerdem mit den ungepaarten RT-Signaturen der 13 einzelnen RTasen analog durchgeführt. Anstelle von sechs Lernmerkmalen gemäß Beispiel 8 (Abbruchrate, Gesamtsprungrate, Mismatch-Rate und relativer Gehalt der Mismatch-Komponenten G, T und C) wurden nun für jede Trainingseinheit zwölf Lernmerkmale (nämlich zweimal diese sechs) vorgegeben. Die Auswertung der 156 RT-Signaturdatenkombinationen zeigte eine messbare Verbesserung der (mlA-) Vorhersageleistung (AUC- Werte) für jede der Paar-Kombinationen aus zwei verschiedenen RTasen und eine besonders deutliche bei RTasen mit ausgeprägten Unterschieden in der Gewichtung ihrer RT-Signatur-Merkmale (siehe Heatmap in Fig. 5). Beispielsweise lieferte die Kombination von zwei leistungsstarken RTasen wie RTase 12 (SuperScripr IV) und RTase 3 (ProtoScript® II) höchste AUC-Werte und damit die besten Vorhersageleistung. Die einzelnen (ungepaarten) RTasen (vgl. Fig. 5: diagonale Felderreihe) lieferten demgegenüber deutlich niedrigerer AUC-Werte und damit schlechtere Vorhersageleistungen. Diese Ergebnisse zeigen deutlich, dass die kombinierte Verwendung von zwei RT-Signaturen, die von zwei verschiedenen RTasen stammen, wesentlich bessere bzw. genauere Vorhersage liefert, als die Verwendung von einfachen RT-Signaturen einer bestimmten RTase. Diese signifikante Verbesserung bzw. Leistungssteigerung deutet darauf hin, dass sie auf einem synergistischen Effekt der Kombination von RT-Signaturen verschiedener RTasen beruht.
Mit Hilfe der richtigen RTase-Kombination kann folglich eine deutlich optimierte Vorhersageleistung für die erhaltenen RT-Signaturen (der RTase-Paare) erreicht werden. Durch eine gezielte Auswahl von zwei (oder mehr) RTasen mit bekannten RT-Signaturen an der betreffenden Nukleotid-Modifikationsstelle, deren Kombination unter Berücksichtigung der Gewichtung ihrer RT-Signatur-Merkmale für ein geplantes Vorhaben mutmaßlich am besten geeignet ist, und den Einsatz dieser RTasen in parallelen Reversen Transkriptions-Reaktionen mit der gleichen Template-RNA werden zwei (oder entsprechend mehr) RT-Signaturen erhalten, deren kombinierte Anwendung im überwachten maschinellen Lernexperiment gemäß Beispiel 8 eine signifikant verbesserten Klassifizierungsleistung, d.h. Leistungsfähigkeit für eine m 1 A-Vorhersage bewirkt (zur Folge hat). Restfehler sind wesentlich reduziert.
Beispiel 10: Vergleich der mlA Erkennungsleistungen - Verwendung von
RT-Signatur-Tripletts zwecks Leistungssteigerung
Die in Beispiel 9 beschriebenen Untersuchungen wurden analog mit RTase-Tripletts, d.h. mit Dreierkombinationen aus verschiedenen RTasen, durchgeführt.
Die erhaltenen Ergebnisse zeigten erwartungsgemäß, dass die Vorhersageleistung (Detektionsleistung) für eine m lA-Stelle verbessert werden kann, wenn die RT Signaturdaten von drei verschiedenen RTasen kombiniert werden. Zahlreiche RTase- Tripletts lieferten AUC-Werten von 1,000 und zeigten damit eine ideale Leistungsfähigkeit der Klassifizierung ("Classification power") bzw. m lA- Vorhersageleistung. Ein detaillierter Vergleich zwischen RT-Signatur-Paaren und RT-Signatur-Tripletts zeigt allerdings, dass die RT-Signaturen einiger RTase-Paare bereits eine quasi-beste m lA- Vorhersageleistung bieten, d.h. ihre AUC-Werte liegen in einem Bereich, der mit dem der RT-Signatur-Tripletts überlappt.
In Fig. 6 ist ein Vergleich der m lA- Vorhersageleistungen in einer Random Forest- Klassifizierung für die drei alternativen Trainings- und Anwendungsmodi (-zustände) des Klassifizierungsverfahrens, nämlich Training (gemäß Beispiel 6 A) und Anwendung gemäß Beispiel 6 B) mit den Informationen bzw. Daten der RT-Signatur-Merkmale von (i) einer RT-Signatur (der 13 verschiedenen RTasen), (ii) zwei RT-Signaturen (von einem der 156 RTase-Paare) und (iii) drei RT-Signaturen (von einem der 1716 RTase-Tripletts) anhand eines Boxplots graphisch dargestellt.
Diese Ergebnisse, wonach die Vorhersage einer Nukleotid-Modifikationsstelle mlA mit größtmöglicher Trefferwahrscheinlichkeit (AUC gleich oder annähernd gleich 1,000) durch Verwendung von nur zwei verschiedenen RTasen bzw. deren RT-Signaturen ausreichend ist, weisen darauf hin, dass auch die Verwendung von zwei (oder mehr) verschiedenen RT-Signaturen aus parallelen RT-Reaktionen (Reaktionsdurchläufen) mit der gleichen RTase aber mit voneinander abweichenden Reaktionsbedingungen je Ansatz (z.B. unterschiedliche Konzentrationen an dNTPs, unterschiedliche divalente Kationen wie Mg2+ oder Mn2+, unterschiedliche Konzentrationen an divalenten Kationen, unterschiedliche pH-Wert, unterschiedliche Temperaturen, unterschiedliche Konzentrationen an Polyethylenglykol), eine nahezu optimale m lA-Vorhersageleistung (und damit eine Nahezu-Detektionsleistung) ermöglicht.
Beispiel 11: Detektion einer anderen Nukleotid-Modifikationen (als mlA)
z.B. mlG oder m2.2G
Das Verfahren zur Detektion einer anderen Nukleotid-Modifikationen als m lA, z.B. von mlG oder m2,2G wird wie in den Beispielen 1 bis 9 oder 1 bis 10 durchgeführt, mit der Abwandlung, dass als Template-RNAs in Schritt 1 von Phase I, und damit als Trainings- RNA-Satz für den Klassifizierer solche RNA-Sequenzen eingesetzt werden, die bekannterund nachgewiesenermaßen die gesuchte Nuleotid-Modifikation, also z.B. mlG oder m2,2G enthalten. Beispiel 12: Kit zur Durchführung des erfindungsgemäßen Verfahrens
Der Kit umfasst (a) wenigstens zwei Reverse Transkriptasen RTase X und RTase Y, deren RT-Signaturen an der betreffenden Nukleotid-Modifikationsstelle bezüglich der Gewichtung der RT-Signatur-Merkmale (Abbruch-Rate, Gesamt-Mismatch-Rate, Einzelmismatch-Raten der betreffenden falsch gepaarten Nukleotide, Gesamtsprungrate, Rate der direkten Einzelsprünge, Rate der verzögerten Einzelsprünge, Doppelsprung-Rate) wenigstens in einem der RT-Signatur-Merkmale ein unterschiedliches Muster aufweisen, und oder (b) wenigstens zwei verschiedene vorgemischte Reaktionsansätze (Synonyme: Reaktionsmischungen; Puffermischungen) A und B, die verschiedene (d.h. voneinander abweichende) Reaktionsbedingungen verkörpern, indem sie z.B. unterschiedliche Konzentrationen an dNTPs, und/oder unterschiedliche divalente Kationen, insbesondere Mg2+ und Mn2+, und/oder unterschiedliche Konzentrationen an divalenten Kationen und/oder unterschiedliche pH-Werte, und/oder unterschiedliche Konzentrationen an Polyethylenglykol (PEG) enthalten.
Zur Durchführung von Schritt (1) in Phase (I) und in Phase (II) des Verfahrens ist es nur noch erforderlich, die RTase(n) mit dem Reaktionsansatz oder den Reaktionsätzen und der/den betreffenden Template-RNA(s) zu mischen und zu inkubieren.
Beispiele für parallele Reaktionsansätze zur Durchfuhrung des erfindungsgemäßen Verfahrens sind:
(i) Ansatz a: Template RNA (s) + RTase X + Reaktionsgemisch A
Ansatz b: Template RNA (s) + RTase Y + Reaktionsgemisch A
(ii) Ansatz a: Template RNA (s) + RTase X + Reaktionsgemisch A
Ansatz b: Template RNA (s) + RTase Y + Reaktionsgemisch A
Ansatz c: Template RNA (s) + RTase X + Reaktionsgemisch B
Ansatz d: Template RNA (s) + RTase Y + Reaktionsgemisch B
(iii) Ansatz a: Template RNA (s) + RTase X + Reaktionsgemisch A
Ansatz b: Template RNA (s) + RTase X + Reaktionsgemisch B
Ansatz c: Template RNA (s) + RTase X + Reaktionsgemisch C Zitierte Literatur:
Hauenschild, R., Tserovski, L., Schmid, K., Thüring, K., Winz, M.L., Sharma, S., Entian, K.D., Wacheul, L., Lafontaine, D. L. J., Anderson, J., Alfonzo, J., Hildebrandt, A., Jäschke, A., Motorin Y., Helm, M., "The reverse transcription signature of N-l- methyladenosine in RNA-Seq is sequence dependent", Nucleic Acids Research, vol. 43, no. 20, pp. 9950-9964, 2015
Dominissini, D., Nachtergaele, S., Moshitch-Moshkovitz, S., Peer, E., Kol, N., Ben-Haim, M.S., Dai, Q., Di Segni, A. et al., "The dynamic Nl-methyladenosine methylome in eukaryotic messenger RNA", Na ire, vol. 530, no. 7591, pp. 441—446, 2016
Linder, B., Grozhik, A.V., Olarerin-George, A.O., Meydan, C, Mason, C.E., Jaffrey, S.R., "Single-nucleotide-resolution mapping of m6A and m6Am throughout the transcriptome", Nature Methods, vol. 12, no. 8, pp. 767-774, 2015
Liaw, A., Wiener, M. "Classification and regression "Classification and regression by randomForest", R News, vol. 2, pp. 18-22, 2002
Tserovski, L., Marchand V., Hauenschild R., Blanloeil-Oillo F., Helm M. and Motorin Y., "High-throughput sequencing for 1-methyladenosine (m'A) mapping in RNA", Methods, 107, 1 10-121, 2016
Machnicka,M.A., Milanowska,K., Osman Oglou,0., Purta,E., Kurkowska,M.,
Olchowik.A., Januszewski,W., Kalinowski,S., Dunin-Horkawicz,S., Rother,K.M. et al. (2013) MODOMICS: a database of RNA modification pathways-2013 update. Nucleic Acids Res., 41, D262-D267.
Jühling,F., Mörl,M., Hartmann,R.K., Sprinzl,M., Stadler,P.F. and Pütz,J. (2009) tRNAdb 2009: compilation of tRNA sequences and tRNA genes. Nucleic Acids Res., 37, Dl 59- D162. Tabelle 1 : Reverse Transkriptasen
Reverse Transkriptase Anbieter
M-MuLV New England Biolabs®
AMV New England Biolabs®
ProtoScript® II New England Biolabs®
GoScript™ Promega
SuperScript® III ThermoFisher®
RevertAid® ThermoFisher®
AccuScript® Agilent Technologies
AffinityScript® Agilent Technologies
M-MuLV Promega
MonsterScript™ Epicentre®
1 EpiScript™ Epicentre®
SuperScript® IV ThermoFisher®
Volcano® myPOLS Biotec GmbH

Claims

Ansprüche
1. Verfahren zur Ermittlung von Anzahl und Position (Lokus) einer ausgewählten (vorbestimmten), bekannten Nukleotid-Modifikation in einer RNA oder mehreren RNAs (inkl. Transkriptom), der (den) Template-RNA(s), umfassend die folgenden Schritte in der genannten Reihenfolge:
(1) Reverse Transkription der Template-RNA(s) unter Einsatz des Enzyms Reverse Transkriptase und Erstellen einer cDNA-Bibliothek enthaltend die Reverse Transkriptions-Produkte (= cDNAs) der eingesetzten Reversen Transkriptase mit dieser/diesen Template-RNA(s),
(2) Amplifizierung der cDNAs und Sequenzierung der amplifizierten cDNAs mittels einer Hochdurchsatz-Sequenzierungsmethode (Next-Generation-Sequencing (NGS)-Methode), wobei die gewonnenen Sequenz-Daten in digitaler Form, den Reads, ausgegeben werden,
(3) Adapter-Trimming (= Entfernung der Adapterseq Uenzen) und Mapping (=Zuordnung) der sequenzierten cDNAs/Reads zum Referenzgenom oder Referenztranskriptom mittels computergestützter Alignment- Verfahren,
(4) computergestützte Auswertung (Analyse) des Mappingergebnisses hinsichtlich des Reverse-Transkriptions-Ereignismusters, der RT-Signatur, unter Verwendung der Ereignisse 'Abbruch' und/oder 'Read-Through mit Mismatch' als RT-Signatur-Merkmal(e), und Diagnostizierung der RT-Signatur an jeder Nukleotid-Position der Template-RNA(s),
(5) Einspeisung der digitalisierten Daten der RT-Signaturen in ein computer-basiertes, automatisches, auf überwachtem maschinellem Lernen ("Machine-Learning") beruhendes Klassifizierungssystem,
wobei in einer ersten Phase (I) des Verfahrens, der Kalibrierungsphase, die Schritte (1) bis (5) mit einer oder mehreren verschiedenen, bekannten und hinsichtlich Nukleotidsequenz und gegebenenfalls vorhandener Nukleotid-Modifikation(en) identifizierten und annotierten RNAs als Template-RNAs ausgeführt werden,
und in Schritt (5) ermittelte RT-Signaturen von Nukleotid-Positionen mit der bekannten Nukleotid-Modifikation und ermittelte RT-Signaturen von Nukleotid-Positionen des gleichen Nukleosids ohne Nukleotid-Modifikation in das Klassifizierungssystem eingespeist werden,
und das Klassifizierungssystem während Trainings- und Selbsttestungsläufen implizit das (charakteristische) Profil der RT-Signatur (d.h. die charakteristische quantitative Ausprägung der RT-Signatur-Merkmale) an der die Nukleotid-Modifikation aufweisenden Nukleotid-Position erstellt und optimiert ("erlernt"), und (infolgedessen) als Klassifizierungsergebnis diejenigen Positionen auf der/den (jeder) Template-RNA(s) ermittelt und angibt, die eine RT-Signatur aufweisen, die mit diesem (charakteristischen) Profil annähernd oder vollständig übereinstimmt, und die somit auf das Vorliegen der betreffenden Nukleotid-Modifikation an diesen Positionen hinweist,
und wobei in einer zweiten Phase (II) des Verfahrens, der Anwendungs- bzw. Untersuchungsphase, die Schritte (1) bis (5) mit einer oder mehreren zu untersuchenden unbekannten Test-RNA(s) als Tempiate-RNA(s) durchgeführt werden,
- und die Schritte (1) bis (4) unter den gleichen Bedingungen wie in Phase (I) erfolgen,
- und in Schritt (5) ermittelte RT-Signaturen von Nukleotid-Positionen der Test-Template- RNA(s) in das Klassifizierungssystem eingespeist werden,
- und das Klassifizierungssystem auf der Basis des in Phase (I) Schritt (5) implizit erlernten (charakteristischen) Profils die eingegebenen RT-Signaturen dahingehend klassifiziert, inwieweit sie diesem Profil ähnlich sind oder damit übereinstimmen, und wobei Klassifizierungsergebnisse mit der Aussage "ähnlich" oder "annähernd übereinstimmend" oder "übereinstimmend" auf das Vorliegen der betreffenden Nukleotid-Modifikation in der/den Test-Template-RNA(s) an der Nukleotid-Position mit dieser RT-Signatur hinweisen,
dadurch gekennzeichnet,
dass in Schritt (1) von Phase (I) und Phase (II) des Verfahrens die Reverse Transkription der Template-RNAs in zwei oder mehr Reaktionsansätzen und - durchlaufen mit voneinander verschiedenen Reversen Transkriptasen unter den gleichen Reaktionsbedingungen und/oder mit (der) gleichen Reversen Transkriptase(n) unter voneinander abweichenden Reaktionsbedingungen je Ansatz durchgeführt wird, wobei mit/von jedem Ansatz eine cDNA -Bibliothek erhalten wird,
dass in Schritt (4) von Phase (I) und Phase (II) des Verfahrens die Auswertung der Mapping-Ergebnisse hinsichtlich der RT-Signatur unter Verwendung der Ereignisse 'Abbruch' und/oder 'Read-Through mit Mismatch' und/oder des zusätzlichen Ereignisses 'Read-Through mit Sequenzlücke(n)' als RT-Signatur-Merkmal(e) erfolgt,
und dass in Schritt (5) von Phase (I) und Phase (II) des Verfahrens Daten von RT-Signaturen aus den in Schritt (1) mit den verschiedenen Reversen Transkriptasen unter gleichen Reaktionsbedingungen und/oder mit der/den gleichen Reversen Transkriptase(n) unter voneinander abweichenden Reaktionsbedingungen erhaltenen cDNA-Bibliotheken in das Klassifizierungssystem eingespeist werden.
2. Verfahren nach Anspruch 1 , dadurch gekennzeichnet, dass in Schritt ( 1) von Phase (I) und Phase (II) des Verfahrens die analogen Reaktionsansätze und -durchläufe mit wenigstens zwei Reversen Transkriptasen durchgeführt werden, deren RT-Signaturen an der bzw. für die betreffende Nukleotid-Modifikationsstelle hinsichtlich der Gewichtung ihrer RT-Signatur-Merkmale ein unterschiedliches Muster aufweisen.
3. Verfahren nach einem der Ansprüche 1 bis 2, dadurch gekennzeichnet, dass die in Schritt (1) von Phase (I) und Phase (II) eingesetzten verschiedenen Reverse Transkriptasen solche Reverse Transkriptasen umfassen, die zu diesem Zweck durch Mutationen verändert wurden.
4. Verfahren nach einem der Ansprüche 1 bis 3, dadurch gekennzeichnet, dass als voneinander abweichende Reaktionsbedingung unterschiedliche Konzentrationen an dNTPs, und/oder unterschiedliche divalente Kationen, insbesondere Mg2+ und Mn2+, und/oder unterschiedliche Konzentrationen an divalenten Kationen und/oder unterschiedliche pH-Werte, und/oder unterschiedliche Temperaturen und/oder unterschiedliche Konzentrationen an Polyethylenglykol (PEG) eingesetzt werden.
5. Verfahren nach einem der Ansprüche 1 bis 4, dadurch gekennzeichnet, dass die Nukleotid-Modifikation eine Nukleosid-Methylierung, insbesondere eine Nl -Methyl ierung von Adenosin oder Guanosin ist.
6. Verfahren nach einem der Ansprüche 1 bis 5, dadurch gekennzeichnet, dass in Schritt (2) der Phasen (I) und (II) die Sequenzierung eine Sequenzierung mit Brückenamplifikation ist, insbesondere ein Illumina-Sequenzierungs-Verfahren.
7. Verfahren nach einem der Ansprüche 1 bis 6, dadurch gekennzeichnet, dass in Schritt (3) der Phasen (I) und (Π) das Alignment-Verfahren ein Verfahren für Sequenz-Alignment und Sequenz-Analyse ist, insbesondere ein Verfahren gemäß Bowtie 2-Software.
8. Verfahren nach einem der Ansprüche 1 bis 7, dadurch gekennzeichnet, dass in Schritt (5) der Phase (I) und (II) das Klassifizierungssystem ein Random Forest-Klassifizierer ist.
9. Verfahren nach einem der Ansprüche 1 bis 8, dadurch gekennzeichnet, dass die in Schritt
(2) der Phasen (I) und (II) gewonnenen Sequenz-Daten für die Durchführung der Schritte
(3) bis (5) von Phase (I) und Phase (II) in eine Bioinformatik-Pipeline eingespeist werden, die die Kombination der Schritte (3) bis (5) steuert.
10. Verfahren nach einem der Ansprüche 1 bis 9, dadurch gekennzeichnet, dass in Phase (I) Schritt (1) die bekannten RNAs synthetische RNAs oder isolierte natürliche RNAs gemäß Datenbank-Informationen sind.
1 1. Verfahren nach einem der Ansprüche 1 bis 10, dadurch gekennzeichnet, dass zu jedem Klassifizierungsergebnis in Phase (II) Schritt (5) ein numerischer Punktewert (Score) auf einer eindimensionalen numerischen Bewertungsskala als Maß für die Qualität der Übereinstimmung angegeben wird.
12. Verfahren nach einem der Ansprüche 1 bis 1 1, dadurch gekennzeichnet, dass in Schritt
(4) von Phase (I) und Phase (II) des Verfahrens für die Auswertung der Mapping- Ergebnisse hinsichtlich der RT-Signatur die Ereignisse 'Abbruch' und 'Read-Through mit Mismatch' und 'Read-Through mit Sequenzlücke(n) (Jump)' ermittelt und als RT- Signatur-Merkmale gewertet werden.
13. Kit zur Durchführung eines Verfahrens nach einem der Ansprüche 1 bis 12, dadurch gekennzeichnet, dass er wenigstens zwei Reverse Transkriptasen ("RTasen") umfasst, deren RT-Signaturen an der betreffenden Nukleotid-Modifikationsstelle bezüglich der Gewichtung der RT-Signatur-Merkmale wenigstens in einem der RT-Signatur-Merkmale ein unterschiedliches Muster aufweisen, und/oder dass er wenigstens zwei verschiedene vorgemischte Reaktionsansätze umfasst, die vorzugsweise unterschiedliche Konzentrationen an dNTPs, und/oder unterschiedliche divalente Kationen, insbesondere Mg2+ und Mn2+, und/oder unterschiedliche Konzentrationen an divalenten Kationen und/oder unterschiedliche pH-Werte, und/oder unterschiedliche Konzentrationen an Polyethylenglykol (PEG) enthalten.
EP18710996.2A 2017-03-04 2018-02-21 Verfahren zur detektion von bekannten nukleotid-modifikationen in einer rna Withdrawn EP3589753A1 (de)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
DE102017002092.2A DE102017002092B4 (de) 2017-03-04 2017-03-04 Verfahren zur Detektion von bekannten Nukleotid-Modifikationen in einer RNA
PCT/DE2018/000044 WO2018161981A1 (de) 2017-03-04 2018-02-21 Verfahren zur detektion von bekannten nukleotid-modifikationen in einer rna

Publications (1)

Publication Number Publication Date
EP3589753A1 true EP3589753A1 (de) 2020-01-08

Family

ID=61628084

Family Applications (1)

Application Number Title Priority Date Filing Date
EP18710996.2A Withdrawn EP3589753A1 (de) 2017-03-04 2018-02-21 Verfahren zur detektion von bekannten nukleotid-modifikationen in einer rna

Country Status (4)

Country Link
US (1) US20190390269A1 (de)
EP (1) EP3589753A1 (de)
DE (1) DE102017002092B4 (de)
WO (1) WO2018161981A1 (de)

Families Citing this family (5)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN110379464B (zh) * 2019-07-29 2023-05-12 桂林电子科技大学 一种细菌中dna转录终止子的预测方法
CN111951889B (zh) * 2020-08-18 2023-12-22 安徽农业大学 一种rna序列中m5c位点的识别预测方法及系统
CN113257354B (zh) * 2021-05-12 2022-03-11 广州万德基因医学科技有限公司 基于高通量实验数据挖掘进行关键rna功能挖掘的方法
WO2024073730A2 (en) * 2022-09-29 2024-04-04 The University Of Chicago Methods and systems for rna sequencing and analysis
CN116926039A (zh) * 2023-09-19 2023-10-24 魔因生物科技(北京)有限公司 反转录酶HIV p66突变体及其应用

Family Cites Families (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
WO2013123481A1 (en) * 2012-02-16 2013-08-22 Cornell University Methods and kit for characterizing the modified base status of a transcriptome

Non-Patent Citations (3)

* Cited by examiner, † Cited by third party
Title
MOTORIN YURI ET AL: "Identification of modified residues in RNAs by reverse transcription-based methods", RNA MODIFICATION ELSEVIER ACADEMIC PRESS INC, 525 B STREET, SUITE 1900, SAN DIEGO, CA 92101-4495 USA SERIES : METHODS IN ENZYMOLOGY (0076-6879(PRINT)), 2007, pages 21 - 53, XP009523854 *
SCHRAGA SCHWARTZ ET AL: "Next-generation sequencing technologies for detection of modified nucleotides in RNAs", RNA BIOLOGY, vol. 14, no. 9, 5 December 2016 (2016-12-05), pages 1124 - 1137, XP055745529, ISSN: 1547-6286, DOI: 10.1080/15476286.2016.1251543 *
See also references of WO2018161981A1 *

Also Published As

Publication number Publication date
US20190390269A1 (en) 2019-12-26
WO2018161981A1 (de) 2018-09-13
DE102017002092A1 (de) 2018-09-06
DE102017002092B4 (de) 2018-11-08

Similar Documents

Publication Publication Date Title
DE102017002092B4 (de) Verfahren zur Detektion von bekannten Nukleotid-Modifikationen in einer RNA
DE69225333T2 (de) Verfahren für den Nachweis von Mikroorganismen unter verwendung von direkter undwillkürlicher DNA Amplifikation.
Ding et al. In vivo genome-wide profiling of RNA secondary structure reveals novel regulatory features
DE69230873T3 (de) Selektive Restriktionsfragmentenamplifikation: generelles Verfahren für DNS-Fingerprinting
DE3855064T2 (de) Selektive Amplifikation von Oligonukleotiden-Zielsequenzen
DE69713599T2 (de) Verfahren zur bestimmung von nukleinsäure-sequenzen und diagnostische anwendungen derselben
EP0438512B1 (de) Verfahren zur analyse von längenpolymorphismen in dna-bereichen
WO2001007648A1 (de) Verfahren zum speziesspezifischen nachweis von organismen
DE102008025656A1 (de) Verfahren zur quantitativen Analyse von Nikleinsäuren, Marker dafür und deren Verwendung
DE60030811T2 (de) Verfahren zur Ampifizierung von RNA
Holland et al. MPS analysis of the mtDNA hypervariable regions on the MiSeq with improved enrichment
CN109559780A (zh) 一种高通量测序的rna数据处理方法
DE60133321T2 (de) Methoden zur Detektion des mecA Gens beim methicillin-resistenten Staphylococcus Aureus
WO2018019610A1 (de) Dna-sonden für eine in-situ hybridisierung an chromosomen
DE60311263T2 (de) Verfahren zur bestimmung der kopienzahl einer nukleotidsequenz
DE102023105888A1 (de) Verfahren zur Identifizierung eines Kandidaten, nämlich eines Genlocus und/oder einer Sequenzvariante, der für mindestens ein (phänotypisches) Merkmal indikativ ist
DE69834422T2 (de) Klonierungsverfahren durch multiple verdauung
EP0698122A1 (de) Mittel zur komplexen diagnostik der genexpression und verfahren zur anwendung für die medizinische diagnostik und die genisolierung
DE102007010311A1 (de) Organismusspezifisches hybridisierbares Nucleinsäuremolekül
WO2007068305A1 (de) Verfahren zur bestimmung des genotyps aus einer biologischen probe enthaltend nukleinsäuren unterschiedlicher individuen
DE60109002T2 (de) Methode zum Nachweis von transkribierten genomischen DNA-Sequenzen
Liao et al. Nanopore sequencing and haplotyping of mitochondrial DNA hypervariable regions and its application on mixed stain
Lee et al. Unlocking the Potential of Low Quality Total RNA-seq Data: A Stepwise Mapping Approach for Improved Quantitative Analyses
Calhoun INVESTIGATION INTO THE GENETIC BASIS OF CAPSAICIN PRODUCTION IN PEPPERS USING NEXT GENERATION RNA SEQUENCING AND SYNTHETIC BIOLOGY APPROACHES
Calhoun Investigation in to the Genetic Basis of Capsaicin Production in Peppers Using Next Generation RNA Sequencing and Synthetic Biology Approaches

Legal Events

Date Code Title Description
STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: UNKNOWN

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE INTERNATIONAL PUBLICATION HAS BEEN MADE

PUAI Public reference made under article 153(3) epc to a published international application that has entered the european phase

Free format text: ORIGINAL CODE: 0009012

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: REQUEST FOR EXAMINATION WAS MADE

17P Request for examination filed

Effective date: 20190831

AK Designated contracting states

Kind code of ref document: A1

Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC MK MT NL NO PL PT RO RS SE SI SK SM TR

AX Request for extension of the european patent

Extension state: BA ME

RIN1 Information on inventor provided before grant (corrected)

Inventor name: KEMMER, THOMAS

Inventor name: TSEROVSKI, LYUDMIL

Inventor name: HAUENSCHILD, RALF

Inventor name: HELM, MARK

Inventor name: HILDEBRANDT, ANDREAS

Inventor name: WERNER, STEPHAN

Inventor name: LECLAIRE, JENNIFER

DAV Request for validation of the european patent (deleted)
DAX Request for extension of the european patent (deleted)
STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: EXAMINATION IS IN PROGRESS

17Q First examination report despatched

Effective date: 20201105

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE APPLICATION IS DEEMED TO BE WITHDRAWN

18D Application deemed to be withdrawn

Effective date: 20210518