EP4078595A1 - Verfahren und datenverarbeitungsvorrichtung zur bearbeitung von genetischen daten - Google Patents

Verfahren und datenverarbeitungsvorrichtung zur bearbeitung von genetischen daten

Info

Publication number
EP4078595A1
EP4078595A1 EP20842560.3A EP20842560A EP4078595A1 EP 4078595 A1 EP4078595 A1 EP 4078595A1 EP 20842560 A EP20842560 A EP 20842560A EP 4078595 A1 EP4078595 A1 EP 4078595A1
Authority
EP
European Patent Office
Prior art keywords
sequence
data
fragments
fragment
encrypted
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
EP20842560.3A
Other languages
English (en)
French (fr)
Inventor
Heiko Zimmermann
Sabine MÜLLER
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Fraunhofer Gesellschaft zur Foerderung der Angewandten Forschung eV
Original Assignee
Fraunhofer Gesellschaft zur Foerderung der Angewandten Forschung eV
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Fraunhofer Gesellschaft zur Foerderung der Angewandten Forschung eV filed Critical Fraunhofer Gesellschaft zur Foerderung der Angewandten Forschung eV
Publication of EP4078595A1 publication Critical patent/EP4078595A1/de
Pending legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G16INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
    • G16BBIOINFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR GENETIC OR PROTEIN-RELATED DATA PROCESSING IN COMPUTATIONAL MOLECULAR BIOLOGY
    • G16B50/00ICT programming tools or database systems specially adapted for bioinformatics
    • G16B50/40Encryption of genetic data
    • GPHYSICS
    • G06COMPUTING OR CALCULATING; COUNTING
    • G06NCOMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
    • G06N3/00Computing arrangements based on biological models
    • G06N3/12Computing arrangements based on biological models using genetic models
    • G06N3/123DNA computing
    • GPHYSICS
    • G16INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
    • G16BBIOINFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR GENETIC OR PROTEIN-RELATED DATA PROCESSING IN COMPUTATIONAL MOLECULAR BIOLOGY
    • G16B30/00ICT specially adapted for sequence analysis involving nucleotides or amino acids
    • GPHYSICS
    • G16INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
    • G16BBIOINFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR GENETIC OR PROTEIN-RELATED DATA PROCESSING IN COMPUTATIONAL MOLECULAR BIOLOGY
    • G16B50/00ICT programming tools or database systems specially adapted for bioinformatics
    • G16B50/30Data warehousing; Computing architectures
    • HELECTRICITY
    • H04ELECTRIC COMMUNICATION TECHNIQUE
    • H04LTRANSMISSION OF DIGITAL INFORMATION, e.g. TELEGRAPHIC COMMUNICATION
    • H04L9/00Cryptographic mechanisms or cryptographic arrangements for secret or secure communications; Network security protocols
    • H04L9/32Cryptographic mechanisms or cryptographic arrangements for secret or secure communications; Network security protocols including means for verifying the identity or authority of a user of the system or for message authentication, e.g. authorization, entity authentication, data integrity or data verification, non-repudiation, key authentication or verification of credentials
    • H04L9/3236Cryptographic mechanisms or cryptographic arrangements for secret or secure communications; Network security protocols including means for verifying the identity or authority of a user of the system or for message authentication, e.g. authorization, entity authentication, data integrity or data verification, non-repudiation, key authentication or verification of credentials using cryptographic hash functions
    • H04L9/3239Cryptographic mechanisms or cryptographic arrangements for secret or secure communications; Network security protocols including means for verifying the identity or authority of a user of the system or for message authentication, e.g. authorization, entity authentication, data integrity or data verification, non-repudiation, key authentication or verification of credentials using cryptographic hash functions involving non-keyed hash functions, e.g. modification detection codes [MDCs], MD5, SHA or RIPEMD
    • YGENERAL TAGGING OF NEW TECHNOLOGICAL DEVELOPMENTS; GENERAL TAGGING OF CROSS-SECTIONAL TECHNOLOGIES SPANNING OVER SEVERAL SECTIONS OF THE IPC; TECHNICAL SUBJECTS COVERED BY FORMER USPC CROSS-REFERENCE ART COLLECTIONS [XRACs] AND DIGESTS
    • Y02TECHNOLOGIES OR APPLICATIONS FOR MITIGATION OR ADAPTATION AGAINST CLIMATE CHANGE
    • Y02ATECHNOLOGIES FOR ADAPTATION TO CLIMATE CHANGE
    • Y02A90/00Technologies having an indirect contribution to adaptation to climate change
    • Y02A90/10Information and communication technologies [ICT] supporting adaptation to climate change, e.g. for weather forecasting or climate simulation

Definitions

  • the invention relates to a method and a data processing device for processing, in particular for encryption, of genetic data that present a number of biomolecules re, such as. B. of data from nucleotide, amino acid and / or protein sequences.
  • the invention also relates to a method for querying a database which contains encrypted genetic data that have been generated and stored using the method mentioned.
  • the invention can be used in bioinformatics, medicine, cell biology, stem cell technology, pharmacology and / or biotechnology, in particular in the processing of genetic data.
  • genetic data are obtained from a large number of examined persons and stored in connection with other data of the persons, such as identification data and data on living conditions and / or the health status of the persons.
  • Genetic data can provide information about the causes or mechanisms of disease. Furthermore, genetic data make it possible to develop personalized therapies or behavioral or nutritional recommendations and apply them to patients in an individually tailored manner. In addition, there is an interest in research in access to the genetic data, for example to specific individuals with a predetermined genetic disposition (and possibly certain disease and living conditions) or cell samples of these individuals for targeted investigations, for example pharmacological approaches to be identified, for example as a disease model, or for analysis of the causes of disease.
  • the human genome is approximately 3 billion base pairs.
  • the search for specific search sequences or combinations of search sequences is extremely time-consuming. There is therefore an interest in improving the effectiveness (e.g. energy consumption and / or duration) of the search of genetic data.
  • genetic data Another limitation in the search of genetic data arises from the interest of the individual individuals in the protection of their data. Since genetic data defines the inherited and / or acquired genetic traits of a person, it represents unique and sensitive information. Today it is assumed that even after the genetic data has been separated from the identification data of the associated person, it is still possible to obtain the data to be assigned to a specific person. Consistent anonymization of genetic data would require falsification, after which, however, no further reliable examination of the data would be possible. Genetic data can therefore at most be pseudonymized and not consistently anonymized.
  • the flash table were saved separately, there would even be advantages for data protection.
  • the encrypted (e.g. hashed) DNA sequence cannot be searched.
  • the complete DNA sequence must first be decompressed. Only then can a partial sequence be searched for, which is again associated with the aforementioned high effort and weakens the data security.
  • flash functions are known from other areas of data processing.
  • the password is encoded by means of a cryptological flash function.
  • a randomly selected character string (“salt") can be appended to the password, which means that Passwords is difficult.
  • the hash value determined by the coding is stored in a database.
  • the password is encoded with the hash function, the hash value determined is compared with the hash value in the database and the entered username is compared with the stored username for this password.
  • the user name (such as a mail address) is available in plain text as a stored value in addition to the table entry of the hash value.
  • the passwords are still encoded.
  • there are numerous methods for resolving passwords so it is assumed that if access data is stolen from simple or frequently chosen passwords, decoding is relatively easy. Data security is restricted by the common storage of the user name in clear text with the hash value.
  • the object of the invention is to provide an improved method and an improved data processing device for processing, in particular for encryption and storage, of series of physiological and / or biological data, in particular genetic data, with which disadvantages of conventional techniques are avoided.
  • the method and the data processing device should in particular make it possible to search the data more effectively and / or to make it accessible to a search in the event of access restrictions without the original data being made known to third parties during a search.
  • the above object is achieved by a method for processing genetic data which comprise a series of sequence elements which each represent a biomolecule.
  • the predetermined set of sequence elements comprises at least a portion of genetic material, e.g. B. exclusively Lich coding sections, exclusively non-coding sections or both coding and non-coding sections.
  • the biomolecules include e.g. B. nucleotides and / or amino acids.
  • the genetic data can e.g. B. comprise at least one gene sequence.
  • the genetic data can comprise short tandem repeat (STR) or single nucleotide polymorphism (SNP) profiles in sequence form.
  • Each series of sequence elements can be assigned to an individual, e.g. B. be assigned to a human or animal's subject.
  • the term "genetic data" refers to at least a number of sequence elements. There can be a single set of sequence elements, i. H. the genetic data of a single individual, or preferably a plurality of series of sequence elements, d. H. the genetic data of a large number of individuals, can be processed. In other words, genetic data from a large number of individuals are preferably processed, the genetic data of each individual comprising a series of sequence elements which each represent a biomolecule.
  • Sequence fragments are formed from the genetic data of each row of sequence elements.
  • a sequence fragment comprises a portion of the series of sequence elements with a fragment length of at least two sequence elements.
  • a coding function is applied to each of the sequence fragments in order to generate a multiplicity of encrypted fragment data which are each assigned to one of the sequence fragments.
  • the coding function is a mathematical function that presents exactly one encrypted value to each sequence fragment, e.g. B. by a sequence of characters.
  • the coding function is preferably irreversible. The irreversibility of the coding function means that there is no mathematical inverse function of the coding function. In this embodiment of the invention, the sequence fragments cannot be determined from the encrypted fragment data.
  • the coding function is collision-resistant, i. H. two different sequence fragment inputs lead to different encrypted fragment data.
  • a reversible coding function can be used, in particular in a specific application of the invention in which data security is not critical.
  • the encrypted fragment data are transmitted to and stored in a storage device
  • the formation of the sequence fragments takes place in such a way that the sections of the series of sequence elements overlap and each sequence element is contained in at least two sequence fragments.
  • the sequence fragments are overlapping.
  • each sequence element is thus together with at least one sequence element immediately adjacent in the row of sequence elements in at least contain at least two sequence fragments of the sequence fragments.
  • Each sequence fragment is encrypted.
  • the storage in the storage device can advantageously take place without specifying an order.
  • the encrypted fragment data can be stored in a random order if the order is of no importance for the subsequent query of the storage device.
  • the sequence of the encrypted fragment data is retained during storage, however, if the position of a specific search sequence within the entire genetic data is to be queried during the subsequent search in the stored data.
  • the encrypted fragment data are preferably stored in such a way that their assignment to the genetic data, i. H. the series of sequence elements of an individual is preserved.
  • the encrypted fragment data can be stored in connection with location information.
  • the location information includes, for example, the location of the cell material within a cell bank from which the genetic data was obtained, or a database in which further information relating to the cell material from which the genetic data was obtained is stored.
  • the invention provides a method for encrypting genetic data.
  • the encrypted fragment data advantageously not only represent the entirety of the genetic data, but also all partial sequences with the lengths of the sequence fragments formed. This enables a more effective search for sequences of sequence elements in the stored encrypted fragment data. As a result, it is possible as a technical effect that it can be determined with reduced expenditure of time and / or energy whether the genetic data contain a desired sequence of sequence elements. It is particularly advantageous that the search can be carried out without having to cancel the encryption. As a further technical effect, the invention enables access restrictions to a database which contains the stored encrypted fragment data to be lifted without impairing the security of the data. The information about the discovery of the searched data and / or the data found can be transmitted unencrypted.
  • the above object is achieved by a data processing device for processing genetic data which is configured to generate and store encrypted fragment data with the method according to the first general aspect of the invention or according to its various embodiments.
  • the data processing device comprises a fragmentation device which is set up to form the sequence fragments in such a way that the sections of the row of sequence elements overlap and each sequence element is contained in at least two sequence fragments, a coding device which is set up to generate the plurality of encrypted fragment data, and a storage device which is set up to store the encrypted fragment data.
  • the data processing device is preferably implemented by a computer.
  • the storage device can be part of the computer or a separate database.
  • the above object is achieved by a method for querying a database which contains encrypted fragment data which have been generated and stored with the method according to the first general aspect of the invention or according to its various refinements.
  • the query method comprises a specification of at least one search sequence, comprising a predetermined series of sequence elements, each representing a biomolecule that is to be searched, an application of the coding function with which the encrypted fragment data have been generated, to the at least one search sequence for generating at least an encrypted search sequence, and a search for the at least one encrypted search sequence in the stored encrypted fragment data. If the search result is positive, the answer that the search sequence was found can be returned to the user in connection with information about the genetic data or sample in which the search sequence was found, without it being possible to draw any conclusions about a specific person become.
  • the search can be based on at least one of the following search queries, for example to determine data that is typical for a certain clinical picture:
  • the invention has the significant advantage that the complete genetic data, such as z. B. a complete DNA sequence does not have to be available again after coding in order to still be able to answer biologically or medically interesting questions. It can e.g. For example, it can be determined whether a certain disease-associated mutation is contained in a DNA sequence without explicitly knowing this DNA sequence.
  • the fragment length of each sequence fragment is at least 3.
  • most search queries in particular most biologically or medically interesting questions after the occurrence of sequences of biomolecules, can be covered without the coding and memory effort increases excessively.
  • the formation of the sequence fragments is carried out by a step-by-step reading of sections of consecutive sequence elements from the genetic data, with the reading progressing by one step for each new section (formation of the sequence fragments with a window sliding with step width 1 ).
  • the sequence fragments are each provided by the sections of the series of sequence elements beginning at the start element and on all subsequent sequence elements with the specified fragment length. In this way, an associated sequence fragment is advantageously generated from the genetic data for each partial sequence of sequence elements of the respective length, regardless of the position within the sequence.
  • an initial search sequence when specifying the search sequence, can be shortened to one Search sequence length can be provided which is equal to the fragment length of the sequence fragments from which the encrypted fragment data have been generated.
  • the length of the search sequence is advantageously adapted to the length of the segment fragments mapped onto the encrypted fragment data.
  • All sequence fragments preferably have the same length (number of sequence elements). This ensures a systematic, uniform coverage of the genetic data.
  • sequence fragments can have different lengths.
  • the sequence fragments can form several fragment groups from sequence fragments, the sequence fragments in each fragment group each having the same length, the sequence fragments of different fragment groups having different lengths, and the formation of the sequence fragments takes place in this way that within each fragment group the sections of the series of sequence elements overlap and each sequence element is contained in at least two sequence fragments.
  • each fragment group provides a hash value table.
  • the appearance of a search sequence of freely selectable length (within the lengths of the sequence fragments of the fragment groups) can be found in the genetic data without knowing the genetic data.
  • the fragment length can be greater than 3, e.g. B. up to 20 or more.
  • the fragment groups from sequence fragments can be selected, for example, for a hierarchically structured structure of the stored data. With a hierarchically structured structure of the genetic data, z. B. nested arrays of data and / or clusters can be generated based on fragment sizes or so-called B-trees.
  • the coding function is a hash function and the encrypted fragment data are hash values.
  • the hash function maps sequence fragments, ie sequences of sequence elements of a freely selectable length, specifically irreversibly to a hash value.
  • the use of the hash function for encryption has particular advantages, since hash functions are available and well investigated and are irreversible, so that the genetic data can be decrypted from the encrypted fragment data is excluded or extremely time-consuming.
  • the coding of the genetic data of an individual delivers the encrypted fragment data in the form of flash values.
  • An individual's flash values are e.g. B. stored in the form of a Flash value table in a database.
  • the database accordingly preferably comprises a plurality of flash value tables.
  • the flash function preferably has at least one of the following properties:
  • the flash function is a cryptographic flash function (this is advantageously collision-resistant, so that it is practically impossible to obtain an identical flash value for two different inputs),
  • the flash function generates flash values with a length of at least 128 bits
  • the flash function fulfills at least the SFIA2 (Secure Flash Algorithms) standard, and
  • the flash function is designed for an avalanche effect in such a way that even small changes to the input generate a completely different flash value.
  • a stochastically selected character sequence is added to each of the sequence fragments before the coding function is applied.
  • the randomly selected character string (“salt") the input entropy before the further processing of the input are increased.
  • the flash function can be used several times on the sequence fragments or the encrypted fragment data. This advantageously makes it difficult to draw conclusions from the flash value on the input using brute force methods.
  • the encrypted fragment data are stored in a database.
  • the database is a storage device, in the preferably inventive fragment data encrypted according to the invention from a large number of individuals from one or more facilities at which genetic data are obtained, e.g. B. clinics and / or laboratories.
  • the database is designed for user access. Free access, e.g. B. over a network, or with user data restricted access to certain users.
  • a computer program product which is stored on a computer-readable storage medium and is directed to the formation of the sequence fragments and to the generation of the plurality of encrypted fragment data in the method according to the first general aspect of the invention
  • a computer-readable storage medium on which a computer program product is stored which is set up for the formation of the sequence fragments and for the generation of the plurality of encrypted fragment data in the method according to the first general aspect of the invention
  • a database with a plurality of searchable, encrypted fragment data which are generated with the method according to the first general aspect Facial point of the invention have been generated, represent further independent subjects of the invention.
  • a system comprising at least one device for providing anonymized genetic data, such as. B. clinics and / or laboratories, and at least one facility for the use of the data by at least one user, such as. B. a university or industrial research facility created.
  • Figure 1 a schematic illustration of the processing of genetic data according to preferred embodiments of the invention
  • FIG. 2 further details of the encryption and storage of genetic data and the query of a database according to further embodiments of the invention.
  • FIG. 3 a schematic overview representation of a preferred application of the invention in the processing of clinically obtained genetic data and their search by users.
  • FIG. 1 shows schematically the main steps of the method for processing genetic data according to preferred embodiments of the invention, further details being shown by way of example in FIG.
  • FIG. 2 also shows schematically the components of a data processing device 100 with a fragmentation device 10, a coding device 20 and a storage device 30 / database 30A.
  • the provision of the genetic data 1 is initially shown with step S1.
  • the provision of the genetic data 1 includes, for example, the sequencing of genetic material from at least one individual. The sequencing is carried out using sequencing techniques known per se. Alternatively, the provision of the genetic data 1 includes the retrieval of genetic data 1 from existing data sources, such as freely accessible databases.
  • the genetic data 1 typically include parts of a genome of the individual, but can also represent the complete genome.
  • the genetic data 1 of an individual relates to genetic data of iPS cells (induced pluripotent stem cells) of the individual.
  • Step S1 is a preparation step of the method according to the invention.
  • the provision of the genetic data 1 in step S1 can be provided immediately before the subsequent processing with steps S2 to S4 or at a separate time from these.
  • step S2 the sequence fragments 3 are formed from the genetic data 1.
  • FIG. 2 shows, by way of example, genetic data 1 from sequence elements in the form of a nucleotide sequence.
  • the nucleotide sequence consists of the nucleobases adenine, thymine, guanine and cytosine, which are abbreviated as A, T, G and C in the usual way.
  • sequence fragments 3 with the length 3 are read off step-by-step.
  • the sequence fragments 3 are made available by reading with a sliding window. As a result, the sequence 4 of sequence fragments 3 is generated.
  • Step S2 can be implemented with a "sliding window" algorithm known per se.
  • the sequence fragments 3 are then coded with a coding device 20 in step S3.
  • the coding device 20 is set up to apply a flash function / H to the sequence fragments 3.
  • a flash value table is obtained as a result of the application of the hash function.
  • the elements of the flash value table are encrypted fragment data 5 which represent the sequence fragments 3.
  • This flash value table thus contains the genome sequence of a person in a form that does not allow any conclusions to be drawn about the person's identity or the like.
  • the coding of the sequence fragments 3 supplies the encrypted fragment data 5 in the flash value table.
  • the encrypted fragment data 5 (encoded sequence fragments) are then stored in the storage device 30, for example the database 30A, in step S4.
  • the database 30A is part of the data processing device 100 or is provided separately from it.
  • the encrypted fragment data 5 each to a flash value table, d. H. of an individual, are each stored in predetermined memory sections and / or together with a sequence identification (sample ID) representing the association with a certain flash value table, so that the assignment of the encrypted fragment data 5 to an anonymized sample of an individual is obtained remains.
  • a search sequence 6 of nucleic acids such as ATG
  • step S6 a search sequence 6 of nucleic acids, such as ATG
  • step S6 an encrypted search sequence 7 is provided in the form of a flash value.
  • the database is then searched with regard to the occurrence of this flash value using search techniques known per se (step S7).
  • step S7 search techniques known per se.
  • the encrypted search sequence 7 is found, the flash value table is recorded to which the search sequence found belongs. Due to the data structure of the database 30A with a large number of Flash value tables, this search requires a constant running time and is therefore efficient.
  • FIG. 3 Further details of a preferred application of the invention are shown in FIG. With this application, a system 200 for providing anonymized genetic data is implemented Clinics and / or laboratories and for the use of the data by a user, such as B. a university or industrial research institution created.
  • a system 200 for providing anonymized genetic data is implemented Clinics and / or laboratories and for the use of the data by a user, such as B. a university or industrial research institution created.
  • the system 200 may include a plurality of users and a plurality of users who jointly access the database or multiple databases.
  • the genetic data 1 are then subjected to the method according to the invention with steps S2 and S3 in order to provide the coded sequence fragments 5 and to store them in the database 30A (step S4).
  • a research facility 50 is interested in evaluating the genetic data 1. For example, when searching for a specific disease, the question arises as to whether a search sequence 6 (step S5) provided is contained in the genetic data 1 (see upper double arrow). However, this direct query is made more difficult or even impossible due to the excessive search effort in the genetic data 1 and data protection.
  • the search sequence 6 is subjected to the coding to generate a flash value (step S6), which can then be searched for in the database 30A (step S7). If the search reveals that the stored encrypted fragment data 5 contain the encrypted search sequence 7 searched for, the associated genetic data 1, i. H. identifies the data set of a particular individual.
  • the research facility 50 can then send a query to the clinic 40 relating to this specific data record in order to obtain further information about the individual with the relevant search sequence and / or cell material of the individual with the relevant search sequence, e.g. B. from a cell bank.
  • Another example of the application of the invention is given when a research facility wants to examine a specific disease and needs cell material with certain genetic characteristics from a cell bank for this purpose. If the genetic data of the material stored in the cell bank are processed according to the invention, the invention can be used to search for suitable cell lines from the cell bank without accessing the genetic data.
  • the research facility receives information about which cell line is required in order to be able to carry out the planned examinations without having to sequence the cell material itself, at a considerably reduced cost and time.

Landscapes

  • Engineering & Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • Health & Medical Sciences (AREA)
  • Life Sciences & Earth Sciences (AREA)
  • Theoretical Computer Science (AREA)
  • Biophysics (AREA)
  • Evolutionary Biology (AREA)
  • Bioinformatics & Computational Biology (AREA)
  • Bioinformatics & Cheminformatics (AREA)
  • General Health & Medical Sciences (AREA)
  • Bioethics (AREA)
  • Spectroscopy & Molecular Physics (AREA)
  • Medical Informatics (AREA)
  • Biotechnology (AREA)
  • Genetics & Genomics (AREA)
  • Databases & Information Systems (AREA)
  • Computer Security & Cryptography (AREA)
  • Proteomics, Peptides & Aminoacids (AREA)
  • Analytical Chemistry (AREA)
  • Chemical & Material Sciences (AREA)
  • Software Systems (AREA)
  • Mathematical Physics (AREA)
  • Data Mining & Analysis (AREA)
  • Molecular Biology (AREA)
  • Computational Linguistics (AREA)
  • Biomedical Technology (AREA)
  • Artificial Intelligence (AREA)
  • Evolutionary Computation (AREA)
  • Computer Networks & Wireless Communication (AREA)
  • Signal Processing (AREA)
  • General Physics & Mathematics (AREA)
  • General Engineering & Computer Science (AREA)
  • Computing Systems (AREA)
  • Information Retrieval, Db Structures And Fs Structures Therefor (AREA)
  • Measuring Or Testing Involving Enzymes Or Micro-Organisms (AREA)

Abstract

Ein Verfahren zur Verarbeitung von genetischen Daten, die eine Reihe von Sequenzelementen umfassen, die jeweils ein Biomolekül repräsentieren, umfasst die Schritte Bildung von Sequenzfragmenten (S2), wobei jedes Sequenzfragment einen Abschnitt der Reihe von Sequenzelementen mit einer Fragmentlänge von mindestens zwei Sequenzelementen umfasst, Anwendung einer Kodierungsfunktion auf jedes der Sequenzfragmente zur Erzeugung einer Vielzahl von verschlüsselten Fragmentdaten (S3), die jeweils einem der Sequenzfragmente zugeordnet sind, und Speicherung der verschlüsselten Fragmentdaten (S4), wobei die Bildung der Sequenzfragmente derart erfolgt, dass sich die Abschnitte der Reihe von Sequenzelementen überlappen und jedes Sequenzelement in mindestens zwei Sequenzfragmenten enthalten ist. Es werden auch eine Datenverarbeitungsvorrichtung zur Verarbeitung von genetischen Daten und ein Verfahren zur Abfrage einer Datenbank beschrieben, die verschlüsselte Fragmentdaten enthält, die mit dem Verfahren zur Verarbeitung von genetischen Daten erzeugt und gespeichert wurden.

Description

Verfahren und Datenverarbeitungsvorrichtung zur Bearbeitung von genetischen Daten
Die Erfindung betrifft ein Verfahren und eine Datenverarbeitungsvorrichtung zur Verarbeitung, insbesondere zur Verschlüsselung, von genetischen Daten, die eine Reihe von Biomolekülen re präsentieren, wie z. B. von Daten von Nukleotid-, Aminosäure- und/oder Proteinsequenzen. Die Erfindung betrifft auch Verfahren zur Abfrage einer Datenbank, die verschlüsselte genetische Da ten enthält, die mit dem genannten Verfahren erzeugt und gespeichert wurden. Anwendungen der Erfindung sind in der Bioinformatik, Medizin, Zellbiologie, Stammzelltechnik, Pharmakologie und/oder Biotechnologie, insbesondere bei der Verarbeitung von genetischen Daten, gegeben.
Es ist allgemein bekannt, dass in den letzten Jahren durch effektive Sequenzierungstechniken die Möglichkeiten, genetische Daten aufzunehmen und zu speichern und der Umfang der zum Bei spiel in Datenbanken von Kliniken gespeicherten genetischen Daten erheblich zugenommen ha ben. Beispielsweise werden in einer Klinik von einer Vielzahl von untersuchten Person genetische Daten gewonnen und in Verbindung mit weiteren Daten der Personen, wie zum Beispiel Identifi zierungsdaten und Daten über Lebensbedingungen und/oder den Gesundheitszustand der Perso nen, gespeichert.
Diese Daten sind nicht nur für diagnostische und therapeutische Zwecke bei der Untersuchung und/oder Behandlung der betreffenden Personen von Interesse. Vielmehr stellen die Daten für die Forschung und Entwicklung, zum Beispiel in der Pharmakologie, ein wertvolles Informationsre servoir dar. Genetische Daten können Informationen über Krankheitsursachen oder Krankheits mechanismen geben. Des Weiteren ermöglichen genetische Daten, personalisierte Therapien oder Verhaltens- oder Ernährungsempfehlungen zu entwickeln und bei Patienten individuell ange passt anzuwenden. Darüber hinaus besteht in der Forschung ein Interesse an einem Zugriff auf die genetischen Daten, beispielsweise um spezifische Individuen mit einer vorbestimmten geneti schen Disposition (und gegebenenfalls bestimmten Krankheit- und Lebensbedingungen) oder Zell proben dieser Individuen für gezielte Untersuchungen, zum Beispiel von pharmakologischen An sätzen, zum Beispiel als Krankheitsmodell, oder für Analysen von Krankheitsursachen zu identifi zieren.
Es besteht daher ein Interesse, gespeicherte genetische Daten einer Vielzahl von Individuen auf das Auftreten vorgegebener Merkmale, wie zum Beispiel vorgegebener Aminosäuresequenzen, zu durchsuchen und die genetischen Daten der dabei identifizierten Individuen abzurufen und für weitere Untersuchungen weiter zu verwenden.
Bei der Durchsuchung und Verarbeitung klinisch oder anderweitig gewonnener, individueller ge netischer Daten und auch bei der gemeinschaftlichen Nutzung der Daten (data sharing), insbeson dere bei internationalen Kooperationen, treten jedoch die folgenden Probleme auf.
Das menschliche Genom besitzt ungefähr 3 Milliarden Basenpaare. Bei der Untersuchung der Da ten einer Vielzahl von Individuen, wie zum Beispiel von zehntausenden Patienten, ergeben sich extrem große Datenmengen, deren Durchsuchung auf bestimmte Suchsequenzen oder Kombina tionen von Suchsequenzen außerordentlich aufwendig ist. Es besteht daher ein Interesse, die Ef fektivität (z. B. Energieverbrauch und/oder Dauer) der Durchsuchung genetischer Daten zu ver bessern.
Eine weitere Beschränkung bei der Durchsuchung genetischer Daten ergibt sich aus dem Interesse der einzelnen Individuen an einem Schutz ihrer Daten. Da genetische Daten die ererbten und/ oder erworbenen genetischen Eigenschaften einer Person definieren, stellen sie einzigartige und sensible Informationen dar. Heute geht man davon aus, dass es selbst nach einer Abtrennung der genetischen Daten von Identifizierungsdaten der zugehörigen Person immer noch möglich ist, die Daten einer bestimmten Person zuzuordnen. Eine konsequente Anonymisierung genetischer Da ten würde deren Verfälschung erfordern, woraufhin jedoch keine weitere zuverlässige Untersu chung der Daten möglich wäre. Genetische Daten können daher höchstens pseudonymisiert und nicht konsequent anonymisiert werden.
Daher stellt beim Betrieb einer Datenbank mit genetischen Daten die Datensicherheit (Schutz ge gen Verlust, Missbrauch, Manipulation und/oder andere Bedrohungen) eine wesentliche Anforde rung dar. Personenbezogene Daten unterliegen dabei einem gesetzlich geregelten Schutz vor Missbrauch, der beispielsweise in Deutschland in der Datenschutzgrundverordnung (DSGVO) for muliert ist.
Aufgrund der gesetzlichen Regeln zum Datenschutz ist typischerweise ein Zugriff auf Datenbanken mit klinisch gewonnenen, genetischen Daten durch Dritte ausgeschlossen, insbesondere physisch unterbrochen. Wegen der inhärent ausgeschlossenen oder erschwerten Anonymisierung geneti scher Daten ist weder ein offener Zugang über ein Datennetz noch ein bedingter Zugang für auto- risierte Anfragen möglich. Um das Potenzial personenbezogener genetischer Daten in der For schung und Entwicklung oder auch für andere Untersuchungszwecke unter Gewährleistung des Datenschutzes dennoch nutzen zu können, besteht ein Interesse an einem neuen Ansatz im Um gang mit genetischen Daten.
Es ist bekannt, genetische Daten für Komprimierungszwecke verschlüsselt zu speichern. Die Ver schlüsselung kann z. B. durch Anwendung von Hash-Funktionen erfolgen. So wird von A. Mehta et al. in der Publikation "DNA compression using hash based data structure" in "International Journal of Information and Knowledge Management", 2010, Bd. 2, Nr. 2, S. 383-386, vorgeschlagen, durch eine binäre Kodierung einer DNA-Sequenz Speicherplatz zu sparen. Die DNA-Sequenz wird in auf einander folgende, einander nicht überlappende Teile fragmentiert und mittels Flash-Funktion in Bits kodiert. Es ergibt sich eine kürzere Sequenz von Bits, die gemeinsam mit einer Flash-Tabelle als Alphabet ("Look-up"-Tabelle) gespeichert wird. In der Flash-Tabelle ist jedes DNA-Fragment auf ein Zeichen abgebildet. Mit dem Verfahren von A. Mehta et al. wird zwar eine Komprimierung der genetischen Daten erreicht. Bei getrennter Speicherung der Flashtabelle wären sogar Vorteile für den Datenschutz erreichbar. Nachteilig ist jedoch, dass die verschlüsselte (z. B. gehashte) DNA- Sequenz nicht durchsuchbar ist. Um zu überprüfen, ob eine gewisse Teilsequenz enthalten ist, muss zuerst die komplette DNA-Sequenz dekomprimiert werden. Erst dann kann eine Teilsequenz darin gesucht werden, was wieder mit dem genannten hohen Aufwand verbunden ist und die Da tensicherheit schwächt.
Es ist des Weiteren bekannt, für eine schnellere Durchsuchung genetische Daten mittels Flashing zu indizieren (siehe Publikation "Bitpacking techniques for indexing genomes: I. Flash Tables" von T. D. Wu in "Algorithms for Molecular Biology" (2016) 11:5). So genannte "Reads" werden auf eine DNA-Sequenz abgebildet, wobei eine Flash-Tabelle als "Look-up"-Tabelle verwendet wird, in der Positionsangaben entsprechender Teilstücke in der Sequenz stehen. In diesem Fall erlaubt das Flashing zwar ein effizientes Durchsuchen einer DNA-Sequenz. Diese liegt aber in unverschlüssel ter, durch den Nutzer direkt lesbarer Form vor.
Aus anderen Gebieten der Datenverarbeitung sind weitere Anwendungen von Flash-Funktionen bekannt. Beispielsweise wird bei der Verschlüsselung von Passwörtern nach einer Nutzer-Regist rierung bei einer Applikation in einem Datennetz mit einem Nutzernamen und einem Passwort das Passwort mittels einer kryptologischen Flash-Funktion kodiert. Dabei kann zunächst an das Passwort eine zufällig gewählte Zeichenfolge ("salt") angehängt werden, wodurch ein Hacken von Passwörtern erschwert wird. Der durch die Kodierung ermittelte Hash-Wert wird in einer Daten bank gespeichert. Bei Anmeldung des Nutzers bei der Applikation mit seinem Nutzernamen und seinem Passwort werden das Passwort mit der Hash-Funktion kodiert, der ermittelte Hash-Wert mit dem Hash-Wert in der Datenbank verglichen und der eingegebene mit dem gespeicherten Nutzernamen für dieses Passwort verglichen. Bei dieser Anwendung von Hash-Funktionen ist zur Nutzeridentifizierung nicht nur das korrekte Passwort nötig, sondern auch die korrekte Zuordnung von Nutzernamen und Passwort. Hierzu liegt der Nutzername (wie z. B. eine Mail-Adresse) im Klartext als gespeicherter Wert ergänzend zum Tabelleneintrag des Hash-Wertes vor. Bei Hacker- Angriffen werden die Nutzernamen zwar direkt bekannt, wobei die Passwörter hingegen noch ko diert vorliegen. Es gibt jedoch zahlreiche Verfahren zum Auflösen von Passwörtern, so dass man davon ausgeht, dass beim Erbeuten von Zugangsdaten bei einfachen oder häufig gewählten Pass wörtern das Dekodieren relativ einfach ist. Die Datensicherheit ist durch die gemeinsame Ablage des Nutzernamens in Klartext mit dem Hash-Wert eingeschränkt.
Die Aufgabe der Erfindung ist es, ein verbessertes Verfahren und eine verbesserte Datenverarbei tungsvorrichtung zur Verarbeitung, insbesondere zur Verschlüsselung und Speicherung, von Rei hen physiologischer und/oder biologischer Daten, insbesondere genetischen Daten bereitzustel len, mit denen Nachteile herkömmlicher Techniken vermieden werden. Das Verfahren und die Da tenverarbeitungsvorrichtung sollen insbesondere ermöglichen, die Daten effektiver zu durchsu chen und/oder bei Zugriffsbeschränkungen einer Durchsuchung zugänglich zu machen, ohne dass bei einer Durchsuchung die ursprünglichen Daten Dritten bekannt gemacht werden.
Diese Aufgabe wird durch ein Verfahren bzw. eine Datenverarbeitungsvorrichtung zur Verarbei tung von genetischen Daten, ein Verfahren zur Abfrage einer Datenbank, ein Computerpro grammprodukt und ein Computer-lesbares Speichermedium mit den Merkmalen der unabhängi gen Ansprüche gelöst. Vorteilhafte Ausführungsformen und Anwendungen der Erfindung ergeben sich aus den abhängigen Ansprüchen.
Gemäß einem ersten allgemeinen Gesichtspunkt der Erfindung wird die obige Aufgabe durch ein Verfahren zur Verarbeitung von genetischen Daten gelöst, die eine Reihe von Sequenzelementen umfassen, die jeweils ein Biomolekül repräsentieren. Vorzugsweise umfasst die vorbestimmte Reihe von Sequenzelementen mindestens einen Abschnitt genetischen Materials, z. B. ausschließ lich kodierende Abschnitte, ausschließlich nicht-kodierende Abschnitte oder sowohl kodierende als auch nicht-kodierende Abschnitte. Die Biomoleküle umfassen z. B. Nukleotide und/oder Ami nosäuren. Die genetischen Daten können z. B. mindestens eine Gensequenz umfassen. Alternativ können die genetischen Daten Short Tandem Repeat-(STR)- oder Single Nucleotide Polymor- phism-(SNP)-Profile in Sequenzform umfassen.
Jede Reihe von Sequenzelementen kann einem Individuum, z. B. einem menschlichen oder tieri schen Probanden, zugeordnet sein. Der Begriff "genetischen Daten" bezieht sich auf mindestens eine Reihe von Sequenzelementen. Es kann eine einzige Reihe von Sequenzelementen, d. h. die genetischen Daten eines einzigen Individuums, oder bevorzugt eine Vielzahl von Reihen von Se quenzelementen, d. h. die genetischen Daten einer Vielzahl von Individuen, verarbeitet werden. Mit anderen Worten, vorzugsweise werden genetische Daten von einer Vielzahl von Individuen verarbeitet, wobei die genetischen Daten jedes Individuums eine Reihe von Sequenzelementen umfasst, die jeweils ein Biomolekül repräsentieren.
Aus den genetischen Daten jeder Reihe von Sequenzelementen werden Sequenzfragmente gebil det. Ein Sequenzfragment umfasst einen Abschnitt der Reihe von Sequenzelementen mit einer Fragmentlänge von mindestens zwei Sequenzelementen. Auf jedes der Sequenzfragmente wird zur Erzeugung einer Vielzahl von verschlüsselten Fragmentdaten, die jeweils einem der Sequenz fragmente zugeordnet sind, eine Kodierungsfunktion angewendet. Die Kodierungsfunktion ist eine mathematische Funktion, die jedem Sequenzfragment genau einen verschlüsselten Wert, re präsentiert z. B. durch eine Folge von Zeichen, zuordnet. Die Kodierungsfunktion ist vorzugsweise unumkehrbar. Die Unumkehrbarkeit der Kodierungsfunktion bedeutet, dass keine mathematische Umkehrfunktion der Kodierungsfunktion existiert. Aus den verschlüsselten Fragmentdaten sind bei dieser Ausführungsform der Erfindung die Sequenzfragmente nicht ermittelbar. Des Weiteren ist die Kodierungsfunktion kollisionsresistent, d. h. zwei unterschiedliche Sequenzfragment-Einga ben führen zu unterschiedlichen verschlüsselten Fragmentdaten. Alternativ kann eine umkehr bare Kodierungsfunktion verwendet werden, insbesondere bei einer konkreten Anwendung der Erfindung, bei der die Datensicherheit unkritisch ist. Die verschlüsselten Fragmentdaten werden zu einer Speichereinrichtung übertragen und in dieser gespeichert.
Gemäß der Erfindung erfolgt die Bildung der Sequenzfragmente derart, dass sich die Abschnitte der Reihe von Sequenzelementen überlappen und jedes Sequenzelement in mindestens zwei Se quenzfragmenten enthalten ist. In Bezug auf die genetischen Daten sind die Sequenzfragmente überlappend. Vorteilhafterweise ist damit jedes Sequenzelement gemeinsam mit mindestens ei nem in der Reihe von Sequenzelementen unmittelbar benachbarten Sequenzelement in mindes- tens zwei Sequenzfragmenten der Sequenzfragmente enthalten. Jedes Sequenzfragment wird ver schlüsselt. Die Speicherung in der Speichereinrichtung kann vorteilhafterweise ohne Vorgabe ei ner Reihenfolge erfolgen.
Die verschlüsselten Fragmentdaten können mit einer zufälligen Reihenfolge gespeichert werden, wenn für die spätere Abfrage der Speichereinrichtung die Reihenfolge keine Bedeutung hat. Die Reihenfolge der verschlüsselten Fragmentdaten wird bei der Speicherung jedoch beibehalten, wenn bei der späteren Suche in den gespeicherten Daten auch die Position einer bestimmten Suchsequenz innerhalb der gesamten genetischen Daten abgefragt werden soll. Vorzugsweise werden die verschlüsselten Fragmentdaten so gespeichert, dass ihre Zuordnung zu den geneti schen Daten, d. h. der Reihe von Sequenzelementen eines Individuums erhalten bleibt. Des Wei teren können die verschlüsselten Fragmentdaten in Verbindung mit einer Ortsinformation gespei chert werden. Die Ortsinformation beinhaltet zum Beispiel den Ort des Zellmaterials innerhalb ei ner Zellbank, aus dem die genetischen Daten gewonnen wurden, oder einer Datenbank, in der weitere Informationen bezüglich des Zellmaterials, aus dem die genetischen Daten gewonnen wurden, abgelegt sind.
Mit der Erfindung wird ein Verfahren zur Verschlüsselung von genetischen Daten bereitgestellt. Die verschlüsselten Fragmentdaten repräsentieren vorteilhafterweise nicht nur die Gesamtheit der genetischen Daten, sondern auch alle Teilfolgen mit den Längen der gebildeten Sequenzfrag mente. Dies ermöglicht eine effektivere Suche nach Folgen von Sequenzelementen in den gespei cherten verschlüsselten Fragmentdaten. Im Ergebnis wird als technische Wirkung ermöglicht, dass mit verringertem Zeit- und/oder Energieaufwand festgestellt werden kann, ob die genetischen Daten eine gesuchte Folge von Sequenzelementen enthalten. Von besonderem Vorteil ist, dass die Suche durchgeführt werden kann, ohne dass die Verschlüsselung aufgehoben werden muss. Die Erfindung ermöglicht als weitere technische Wirkung, Zugriffsbeschränkungen zu einer Daten bank, welche die gespeicherten verschlüsselten Fragmentdaten enthält, aufzuheben, ohne die Da tensicherheit zu beeinträchtigen. Die Information über den Fund von gesuchten Daten und/oder die gefundenen Daten können unverschlüsselt übertragen werden.
Obwohl die verschlüsselten Fragmentdaten die Gesamtheit der genetischen Daten repräsentie ren, können die genetischen Daten wegen der Unumkehrbarkeit der Kodierungsfunktion aus den verschlüsselten Fragmentdaten nicht rückgewonnen werden. Aufgrund der Überlappung der Se quenzfragmente und der optional unterschiedlichen Fragmentlängen wird dies auch zukünftig durch effizientere Flacker-Techniken voraussichtlich nicht möglich sein. Gemäß einem zweiten allgemeinen Gesichtspunkt der Erfindung wird die obige Aufgabe durch eine Datenverarbeitungsvorrichtung zur Verarbeitung genetischer Daten gelöst, die zur Erzeugung und Speicherung von verschlüsselten Fragmentdaten mit dem Verfahren gemäß dem ersten allge meinen Gesichtspunkt der Erfindung oder gemäß seinen verschiedenen Ausgestaltungen konfigu riert ist. Die Datenverarbeitungsvorrichtung umfasst eine Fragmentierungseinrichtung, die zur Bil dung der Sequenzfragmente derart eingerichtet ist, dass sich die Abschnitte der Reihe der Se quenzelemente überlappen und jedes Sequenzelement in mindestens zwei Sequenzfragmenten enthalten ist, eine Kodierungseinrichtung, die zur Erzeugung der Vielzahl von verschlüsselten Fragmentdaten eingerichtet ist, und eine Speichereinrichtung, die zur Speicherung der verschlüs selten Fragmentdaten eingerichtet ist. Die Datenverarbeitungsvorrichtung wird vorzugsweise durch einen Computer realisiert. Die Speichereinrichtung kann Teil des Computers oder eine ge sonderte Datenbank sein.
Gemäß einem dritten allgemeinen Gesichtspunkt der Erfindung wird die obige Aufgabe durch ein Verfahren zur Abfrage einer Datenbank gelöst, die verschlüsselte Fragmentdaten enthält, die mit dem Verfahren gemäß dem ersten allgemeinen Gesichtspunkt der Erfindung oder gemäß seinen verschiedenen Ausgestaltungen erzeugt und gespeichert wurden. Das Abfrageverfahren umfasst eine Vorgabe mindestens einer Suchsequenz, umfassend eine vorbestimmte Reihe von Sequenzelementen, die jeweils ein Biomolekül repräsentieren, die gesucht werden soll, eine An wendung der Kodierungsfunktion, mit der die verschlüsselten Fragmentdaten erzeugt worden sind, auf die mindestens eine Suchsequenz zur Erzeugung mindestens einer verschlüsselten Suchsequenz, und eine Suche nach der mindestens einen verschlüsselten Suchsequenz in den ge speicherten verschlüsselten Fragmentdaten. Bei positivem Suchergebnis kann an den Nutzer die die Antwort, dass die Suchsequenz gefunden wurde, in Verbindung mit einer Information, in wel chen genetischen Daten oder in welcher Probe die Suchsequenz gefunden wurde, ohne dass da bei Rückschlüsse auf eine bestimmte Person möglich sind, zurückgegeben werden.
Die Suche kann sich auf mindestens eine der folgenden Suchabfragen richten, beispielsweise um Daten zu ermitteln, die für ein bestimmtes Krankheitsbild typisch sind:
- Ist die Suchsequenz in den verschlüsselten Fragmentdaten enthalten?
- Ist die Suchsequenz in einem bestimmten Genabschnitt, den die verschlüsselten Fragmentdaten repräsentieren, enthalten?
- Ist eine Kombination und/oder eine logische Verknüpfung (z.B. Seq 1 UND Seq 2 N ICHT Seq 3) von mehreren Suchsequenzen vorhanden? - Wo befindet sich biologisches Zellmaterial, aus dem die genetischen Daten gewonnen wurden (Lokalisierungsfunktion)?
Die Erfindung hat den wesentlichen Vorteil, dass die kompletten genetischen Daten, wie z. B. eine komplette DNA-Sequenz nach dem Kodieren nicht wieder vorliegen muss, um dennoch biologisch oder medizinisch interessante Fragestellungen beantworten zu können. Es kann z. B. festgestellt werden, ob eine bestimmte krankheits-assoziierte Mutation in einer DNA-Sequenz enthalten ist, ohne diese DNA-Sequenz explizit zu kennen.
Abweichend von der Komprimierung z. B. gemäß A. Mheta et al. werden gemäß der Erfindung nicht aneinandergrenzende, sondern überlappende Sequenzfragmente erzeugt. Die Erfinder ha ben festgestellt, dass, obwohl damit der Umfang der Daten vergrößert wird, die Suche nach einer bestimmten Folge von Sequenzelementen effektiver wird. Abweichend von der Indexierung von genetischen Daten gemäß T. D. Wu werden gemäß der Erfindung ausschließlich verschlüsselte Da ten gespeichert.
Gemäß einer bevorzugten Ausführungsform der Erfindung beträgt die Fragmentlänge jedes Se quenzfragments mindestens 3. Vorteilhafterweise können damit die meisten Suchanfragen, insbe sondere die meisten biologisch oder medizinisch interessanten Fragestellungen nach dem Auftre ten von Folgen von Biomolekülen, abgedeckt werden, ohne dass der Kodierungs- und Speicher aufwand übermäßig anwächst.
Gemäß einer besonders bevorzugten Ausführungsform der Erfindung erfolgt die Bildung der Se quenzfragmente durch ein schrittweises Ablesen von Abschnitten aufeinanderfolgender Sequenzelementen aus den genetischen Daten mit einem Voranschreiten des Ablesens um jeweils einen Schritt für jeden neuen Abschnitt (Bildung der Sequenzfragmente mit einem mit Schritt weite 1 gleitenden Fenster). Nach Vorgabe einer Fragmentlänge und eines Startelements in den genetischen Daten werden die Sequenzfragmente jeweils durch die am Startelement und an allen nachfolgenden Sequenzelementen beginnenden Abschnitte der Reihe von Sequenzelementen mit der vorgegebenen Fragmentlänge bereitgestellt. Vorteilhafterweise wird damit für jede Teil-Folge von Sequenzelementen der jeweiligen Länge aus den genetischen Daten unabhängig von der Lage innerhalb der Sequenz ein zugehöriges Sequenzfragment erzeugt.
Bei der Abfrage einer Datenbank gemäß dem dritten allgemeinen Gesichtspunkt der Erfindung kann bei der Vorgabe der Suchsequenz eine Verkürzung einer initialen Suchsequenz auf eine Suchsequenzlänge vorgesehen sein, die gleich der Fragmentlänge der Sequenzfragmente ist, aus denen die verschlüsselten Fragmentdaten erzeugt worden sind. Damit wird vorteilhafterweise die Länge der Suchsequenz an die Länge der auf die verschlüsselten Fragmentdaten abgebildeten Segmentfragmente angepasst.
Vorzugsweise haben alle Sequenzfragmente die gleiche Länge (Zahl der Sequenzelemente). Damit wird eine systematische, gleichmäßige Abdeckung der genetischen Daten sichergestellt.
Alternativ können die Sequenzfragmente verschiedene Längen aufweisen. Gemäß dieser alterna tiven Ausführungsform der Erfindung mit verschiedenen Fragmentlängen können die Sequenz fragmente mehrere Fragmentgruppen aus Sequenzfragmenten bilden, wobei die Sequenzfrag mente in jeder Fragmentgruppe jeweils die gleiche Länge aufweisen, die Sequenzfragmente ver schiedener Fragmentgruppen verschiedene Längen aufweisen, und die Bildung der Sequenzfrag mente derart erfolgt, dass innerhalb jeder Fragmentgruppe sich die Abschnitte der Reihe von Se quenzelementen überlappen und jedes Sequenzelement in mindestens zwei Sequenzfragmenten enthalten ist. Bei Anwendung der Hash-Funktion als Kodierungsfunktion liefert jede Fragment gruppe eine Hash-Wert-Tabelle. Diese Ausführungsform hat den besonderen Vorteil, dass die Da tenbank mit den gespeicherten verschlüsselten Fragmentdaten auf das Auftreten von Suchse quenzen mit verschiedenen Längen durchsucht werden kann, so dass die Abfrage der Datenbank einen erhöhten Informationsgewinn bieten kann. Es kann das Auftreten einer Suchsequenz frei wählbarer Länge (innerhalb der Längen der Sequenzfragmente der Fragmentgruppen) in den ge netischen Daten gefunden werden, ohne die genetischen Daten zu kennen. Die Fragmentlänge kann größer als 3 sein, z. B. bis zu 20 oder mehr. Die Fragmentgruppen aus Sequenzfragmenten können beispielsweise für eine hierarchisch gegliederte Struktur der gespeicherten Daten gewählt werden. Mit einer hierarchisch gegliederten Struktur der genetischen Daten können z. B. ver schachtelte Arrays von Daten und/oder Cluster erzeugt werden, die auf Fragmentgrößen oder so genannten B-Bäumen basieren.
Gemäß einer weiteren, besonders vorteilhaften Ausführungsform der Erfindung sind die Kodie rungsfunktion eine Hash-Funktion und die verschlüsselten Fragmentdaten Hash-Werte. Die Hash- Funktion bildet Sequenzfragmente, d. h. Folgen von Sequenzelementen einer frei wählbaren Länge, spezifisch unumkehrbar jeweils auf einen Hash-Wert ab. Die Anwendung der Hash-Funk tion zur Verschlüsselung hat besondere Vorteile, da Hash-Funktionen verfügbar und gut unter sucht sind und unumkehrbar sind, so dass eine Entschlüsselung der genetischen Daten aus den verschlüsselten Fragmentdaten ausgeschlossen oder extrem aufwendig ist. Die Kodierung der ge netischen Daten eines Individuums liefert die verschlüsselten Fragmentdaten in Form von Flash- Werten. Die Flash-Werte eines Individuums werden, z. B. in Gestalt einer Flash-Wert-Tabelle in ei ner Datenbank abgelegt. Die Datenbank umfasst entsprechend vorzugsweise eine Vielzahl von Flash-Wert-Tabellen.
Zur Erhöhung von der Datensicherheit, hat die Flash-Funktion vorzugsweise mindestens eine der folgenden Eigenschaften:
- die Flash-Funktion ist eine kryptografische Flashfunktion (diese ist vorteilhafterweise kollisionsre sistent, so dass es praktisch ausgeschlossen ist, einen identischen Flash-Wert für zwei unter schiedliche Eingaben zu erhalten),
- die Flash-Funktion erzeugt Flash-Werte mit einer Länge, die mindestens 128 Bits beträgt,
- die Flash-Funktion erfüllt mindestens den SFIA2 (Secure Flash Algorithms) Standard, und
- die Flash-Funktion ist für einen Lawineneffekt derart ausgelegt, dass selbst kleine Änderungen an der Eingabe einen komplett anderen Flash-Wert erzeugen.
Von Vorteil kann gemäß einer weiteren Ausführungsform der Erfindung sein, wenn vor der An wendung der Kodierungsfunktion zu jedem der Sequenzfragmente jeweils eine stochastisch ge wählte Zeichenfolge zugesetzt wird. Vorteilhafterweise kann durch den Zusatz, z. B. ein Anhän gen, der zufällig gewählten Zeichenfolge ("salt") die Eingabe-Entropie vor der weiteren Verarbei tung der Eingabe erhöht werden. Alternativ oder zusätzlich kann die Flash-Funktion mehrmals auf die Sequenzfragmente bzw. die verschlüsselten Fragmentdaten angewendet werden. Vorteilhaf terweise werden damit Rückschlüsse vom Flash-Wert auf die Eingabe durch Brute-Force Metho den erschwert.
Gemäß einer weiteren vorteilhaften Variante der Erfindung werden die verschlüsselten Fragment daten in einer Datenbank gespeichert. Die Datenbank ist eine Speichervorrichtung, in die vorzugs weise erfindungsgemäß verschlüsselte Fragmentdaten einer Vielzahl von Individuen aus einer oder mehreren Einrichtungen, an denen genetischen Daten gewonnen werden, z. B. Kliniken und/oder Labore, gespeichert werden. Die Datenbank ist für einen Zugriff durch Nutzer ausgelegt. Es kann ein freier Zugriff, z. B. über ein Netzwerk, oder ein mit Nutzerdaten auf bestimmte Nutzer beschränkter Zugriff ermöglicht werden. Ein Computerprogrammprodukt, das auf einem Computer-lesbaren Speichermedium gespeichert und zur Bildung der Sequenzfragmente und zur Erzeugung der Vielzahl von verschlüsselten Frag mentdaten bei dem Verfahren gemäß dem ersten allgemeinen Gesichtspunkt der Erfindung ein gerichtet ist, ein computer-lesbares Speichermedium, auf dem ein Computerprogrammprodukt gespeichert ist, das zur Bildung der Sequenzfragmente und zur Erzeugung der Vielzahl von ver schlüsselten Fragmentdaten bei dem Verfahren gemäß dem ersten allgemeinen Gesichtspunkt der Erfindung eingerichtet ist, und eine Datenbank mit einer Vielzahl von durchsuchbaren, ver schlüsselten Fragmentdaten, die mit dem Verfahren gemäß dem ersten allgemeinen Gesichts punkt der Erfindung erzeugt worden sind, stellen weitere unabhängige Gegenstände der Erfin dung dar.
Als weiterer unabhängiger Gegenstand der Erfindung wird ein System umfassend mindestens eine Einrichtung zur Bereitstellung anonymisierter genetischer Daten, wie z. B. Kliniken und/oder La bore, und mindestens eine Einrichtung zur Nutzung der Daten durch mindestens einen Anwender, wie z. B. eine universitäre oder industrielle Forschungseinrichtung, geschaffen.
Weitere Einzelheiten und Vorteile der Erfindung werden im Folgenden unter Bezug auf die beige fügten Zeichnungen beschrieben. Es zeigen:
Figur 1: eine schematische Illustration der Verarbeitung von genetischen Daten gemäß be vorzugten Ausführungsformen der Erfindung,
Figur 2: weitere Einzelheiten der Verschlüsselung und Speicherung von genetischen Daten und der Abfrage einer Datenbank gemäß weiteren Ausführungsformen der Erfin dung, und
Figur 3: eine schematische Übersichtsdarstellung einer bevorzugten Anwendung der Erfin dung bei der Verarbeitung klinisch gewonnener genetischer Daten und deren Durchsuchung durch Nutzer.
Einzelheiten bevorzugter Ausführungsformen der Erfindung werden im Folgenden insbesondere in Bezug auf die Bildung der Sequenzfragmente, deren Kodierung und Speicherung in einer Daten bank und die Abfrage der Datenbank beschrieben. Einzelheiten der Auswahl einer Kodierungs funktion, insbesondere einer Flash-Funktion werden nicht erläutert, da diese an sich von her kömmlichen Kodierungstechniken in der Bioinformatik oder aus anderen technischen Gebieten bekannt sind. Es wird beispielhaft auf die Anwendung der Erfindung bei der Verarbeitung von ge netischen Daten Bezug genommen, die eine Nukleotidsequenz umfassen. Die Anwendung der Er findung ist nicht auf diese Daten beschränkt, sondern auch mit anderen genetischen Daten, wie zum Beispiel Aminosäuresequenzen (Proteinsequenzen) möglich.
Figur 1 zeigt schematisch die Hauptschritte des Verfahrens zur Verarbeitung von genetischen Da ten gemäß bevorzugten Ausführungsformen der Erfindung, wobei weitere Einzelheiten beispiel haft in Figur 2 dargestellt sind. Figur 2 zeigt schematisch auch die Komponenten einer Datenverar beitungsvorrichtung 100 mit einer Fragmentierungseinrichtung 10, einer Kodierungseinrichtung 20 und einer Speichereinrichtung 30/Datenbank 30A.
Im Verfahrensablauf gemäß Figur 1 ist mit Schritt S1 zunächst die Bereitstellung der genetischen Daten 1 gezeigt. Die Bereitstellung der genetischen Daten 1 umfasst zum Beispiel die Sequenzie rung genetischen Materials mindestens eines Individuums. Die Sequenzierung erfolgt mit an sich bekannten Sequenzierungstechniken. Alternativ umfasst die Bereitstellung der genetischen Daten 1 den Abruf von genetischen Daten 1 aus vorhandenen Datenquellen, wie zum Beispiel frei zu gänglichen Datenbanken. Die genetischen Daten 1 umfassen typischerweise Teile eines Genoms des Individuums, können aber auch das komplette Genom repräsentieren. Beispielsweise bezie hen sich die genetischen Daten 1 jeweils eines Individuums auf genetische Daten von iPS-Zellen (induziert pluripotente Stammzellen) des Individuums.
Schritt S1 ist ein Vorbereitungsschritt des erfindungsgemäßen Verfahrens. Die Bereitstellung der genetischen Daten 1 bei Schritt S1 kann unmittelbar vor der nachfolgenden Verarbeitung mit den Schritten S2 bis S4 oder zeitlich getrennt von diesen vorgesehen sein.
Bei Schritt S2 folgt die Bildung der Sequenzfragmente 3 aus den genetischen Daten 1. Figur 2 zeigt beispielhaft genetischen Daten 1 aus Sequenzelementen in Gestalt einer Nukleotidsequenz. Die Nukleotidsequenz besteht aus den Nukleinbasen Adenin, Thymin, Guanin und Cytosin, die in übli cher Weise mit A, T, G und C abgekürzt sind. Als Sequenzfragmente 3 werden -mere (hier z. B. mit k = 3) gebildet. Beginnend bei einem Startelement 2 (zum Beispiel T) erfolgt das schrittweise Ablesen von Sequenzfragmenten 3 mit der Länge 3. Die Bereitstellung der Sequenzfragmente 3 erfolgt durch ein Ablesen mit gleitendem Fenster. Im Ergebnis wird die Folge 4 von Sequenzfrag menten 3 erzeugt. Schritt S2 kann mit einem an sich bekannten "sliding window"-Algorithmus im plementiert werden. Anschließend erfolgt bei Schritt S3 die Kodierung der Sequenzfragmente 3 mit einer Kodierungs einrichtung 20. Die Kodierungseinrichtung 20 ist zur Anwendung einer Flash-Funktion /H auf die Sequenzfragmente 3 eingerichtet. Im Ergebnis der Anwendung der Hash-Funktion wird eine Flash- Wert-Tabelle gewonnen. Die Elemente der Flash-Wert-Tabelle sind verschlüsselte Fragmentdaten 5, welche die Sequenzfragmente 3 repräsentieren. Diese Flash-Wert-Tabelle beinhaltet somit die Genomsequenz einer Person in einer Form, die keine Rückschlüsse auf die Identität der Person oder ähnliches zulässt.
Abweichend von der Darstellung in Figur 2 kann die einmalige Anwendung der Flash-Funktion fH durch die wiederholte (mindestens 2-fache) Anwendung der Flash-Funktion fH in einer ersten An wendung auf die Sequenzfragmente 3 und in mindestens einer weiteren Anwendung auf die ver schlüsselten Fragmentdaten 5 ersetzt werden.
Die Kodierung der Sequenzfragmente 3 liefert die verschlüsselten Fragmentdaten 5 in der Flash- Wert-Tabelle. Die verschlüsselten Fragmentdaten 5 (kodierte Sequenzfragmente) werden an schließend bei Schritt S4 in der Speichereinrichtung 30, zum Beispiel der Datenbank 30A gespei chert. Die Datenbank 30A ist Teil der Datenverarbeitungsvorrichtung 100 oder getrennt von die ser vorgesehen. Die verschlüsselten Fragmentdaten 5 jeweils einer Flash-Wert-Tabelle, d. h. eines Individuums, werden jeweils in vorbestimmten Speicherabschnitten und/oder gemeinsam mit ei ner die Zugehörigkeit zu einer bestimmten Flash-Wert-Tabelle repräsentierenden Sequenzidentifi zierung (Proben-Id) gespeichert, so dass die Zuordnung der verschlüsselten Fragmentdaten 5 zu einer anonymisierten Probe eines Individuums erhalten bleibt.
Zur Abfrage der Datenbank 30A wird, wie im rechten Teil von Figur 2 dargestellt ist, zunächst eine Suchsequenz 6 aus Nukleinsäuren, wie zum Beispiel ATG, bereitgestellt (Schritt S5) und durch An wendung der Flash-Funktion verschlüsselt (Schritt S6). Im Ergebnis wird eine verschlüsselte Such sequenz 7 in Gestalt eines Flash-Werts bereitgestellt. Anschließend wird die Datenbank in Bezug auf das Auftreten dieses Flash-Werts mit an sich bekannten Suchtechniken durchsucht (Schritt S7). Beim Auffinden der verschlüsselten Suchsequenz 7 wird die Flash-Wert-Tabelle erfasst, zu der die gefundene Suchsequenz gehört. Durch die Datenstruktur der Datenbank 30A mit einer Viel zahl von Flash-Wert-Tabellen benötigt diese Suche eine konstante Laufzeit und ist somit effizient.
Weitere Einzelheiten einer bevorzugten Anwendung der Erfindung sind in Figur 3 gezeigt. Mit die ser Anwendung wird ein System 200 zur Bereitstellung anonymisierter genetischer Daten durch Kliniken und/oder Labore und zur Nutzung der Daten durch einen Anwender, wie z. B. eine uni versitäre oder industrielle Forschungseinrichtung, geschaffen. Im linken Teil von Figur 3 ist sche matisch gezeigt, wie genetischen Daten 1 zum Beispiel an einer Klinik 40 bereitgestellt werden (Schritt Sl). In einem praktischen Beispiel kann das System 200 eine Vielzahl von Anwendern und eine Vielzahl von Nutzern umfassen, die gemeinsam auf die Datenbank oder mehrere Datenban ken zugreifen. Anschließend werden die genetischen Daten 1 dem erfindungsgemäßen Verfahren mit den Schritten S2 und S3 unterzogen, um die kodierten Sequenzfragmente 5 bereitzustellen und in der Datenbank 30A zu speichern (Schritt S4).
Eine Forschungseinrichtung 50 ist an einer Auswertung der genetischen Daten 1 interessiert. Bei spielsweise ergibt sich bei der Suche nach einer bestimmten Krankheit die Frage, ob eine bereit gestellte Suchsequenz 6 (Schritt S5) in den genetischen Daten 1 enthalten ist (siehe oberer Dop pelpfeil). Diese direkte Abfrage ist jedoch durch den übermäßigen Suchaufwand in den geneti schen Daten 1 und den Datenschutz erschwert oder sogar ausgeschlossen. Um dennoch die gene tischen Daten 1 durchsuchen zu können, wird, wie oben beschrieben, die Suchsequenz 6 der Ko dierung zur Erzeugung eines Flash-Werts unterzogen (Schritt S6), nach dem anschließend in der Datenbank 30A gesucht werden kann (Schritt S7). Wenn die Suche ergibt, dass die gespeicherten verschlüsselten Fragmentdaten 5 die gesuchte verschlüsselte Suchsequenz 7 enthalten, werden die zugehörigen genetischen Daten 1, d. h. der Datensatz eines bestimmten Individuums identifi ziert. Anschließend kann von der Forschungseinrichtung 50 eine auf diesen speziellen Datensatz bezogene Rückfrage an die Klinik 40 gestellt werden, um unter Beachtung der Vorschriften der Datensicherheit weitere Informationen über das Individuum mit der betreffenden Suchsequenz und/oder Zellmaterial des Individuums mit der betreffenden Suchsequenz, z. B. aus einer Zell bank, zu erhalten.
Es wird betont, dass das gezeigte Beispiel nur eine mögliche Anwendung der Erfindung darstellt, bei der ermöglicht wird, ohne genaue Kenntnis der genetischen Daten bestimmte Fragestellungen aus dem Bereich der personalisierten Medizin bearbeiten zu können. Abhängig von den zur Verfü gung stehenden Daten bzw. dem Datenformat werden lediglich das benötigte Format des Such- Sequenzen bzw. der Suchabfrage definiert, um ein Flash-Wert-Matching gleicher Datenpunkte in der Datenbank bereitzustellen.
Ein weiteres Beispiel für die Anwendung der Erfindung ist gegeben, wenn eine Forschungseinrich tung eine bestimmte Erkrankung untersuchen möchte und für diesen Zweck Zellmaterial mit be stimmten genetischen Merkmalen aus einer Zellbank benötigt. Wenn die genetischen Daten des in der Zellbank gespeicherten Materials erfindungsgemäß verarbeitet vorliegen, kann die Erfin dung angewendet werden, um aus der Zellbank geeignete Zelllinien herauszusuchen, ohne auf die genetischen Daten zuzugreifen. Die Forschungseinrichtung erhält mit einem erheblich verringer ten Kosten- und Zeitaufwand eine Information darüber, welche Zelllinie benötigt wird, um die ge- planten Untersuchungen durchführen zu können, ohne das Zellmaterial selbst sequenzieren zu müssen.
Die in der vorstehenden Beschreibung, den Zeichnungen und den Ansprüchen offenbarten Merk male der Erfindung können sowohl einzeln als auch in Kombination oder Unterkombination für die Verwirklichung der Erfindung in ihren verschiedenen Ausgestaltungen von Bedeutung sein.

Claims

Ansprüche
1. Verfahren zur Verarbeitung von genetischen Daten (1), die eine Reihe von Sequenzele menten umfassen, die jeweils ein Biomolekül repräsentieren, mit den Schritten
- Bildung (S2) von Sequenzfragmenten (3), wobei jedes Sequenzfragment (3) einen Abschnitt der Reihe von Sequenzelementen mit einer Fragmentlänge von mindestens zwei Sequenzelementen umfasst,
- Anwendung (S3) einer Kodierungsfunktion auf jedes der Sequenzfragmente (3) zur Erzeugung ei ner Vielzahl von verschlüsselten Fragmentdaten (5), die jeweils einem der Sequenzfragmente (3) zugeordnet sind, und
- Speicherung (S4) der verschlüsselten Fragmentdaten (5), dadurch gekennzeichnet, dass
- die Bildung der Sequenzfragmente (3) derart erfolgt, dass sich die Abschnitte der Reihe von Se quenzelementen überlappen und jedes Sequenzelement in mindestens zwei Sequenzfragmenten (3) enthalten ist.
2. Verfahren gemäß Anspruch 1, bei dem
- die Fragmentlänge jedes Sequenzfragments (3) mindestens 3 beträgt.
3. Verfahren gemäß einem der vorhergehenden Ansprüche, bei dem die Bildung der Sequenz fragmente (3) umfasst
- Vorgabe der Fragmentlänge und eines Startelements (2) in den genetischen Daten (1), und
- Bereitstellung der Sequenzfragmente (3) jeweils durch die am Startelement (2) und an allen nach folgenden Sequenzelementen beginnenden Abschnitte der Reihe von Sequenzelementen mit der vorgegebenen Fragmentlänge.
4. Verfahren gemäß einem der vorhergehenden Ansprüche, bei dem
- alle Sequenzfragmente (3) die gleiche Länge aufweisen.
5. Verfahren gemäß einem der Ansprüche 1 bis 3, bei dem
- die Sequenzfragmente (3) mehrere Fragmentgruppen aus Sequenzfragmenten (3) bilden, wobei
- die Sequenzfragmente (3) in jeder Fragmentgruppe jeweils die gleiche Länge aufweisen,
- die Sequenzfragmente (3) verschiedener Fragmentgruppen verschiedene Längen aufweisen, und - die Bildung der Sequenzfragmente (3) derart erfolgt, dass in jeder Fragmentgruppe sich die Ab schnitte der Reihe von Sequenzelementen überlappen und jedes Sequenzelement in mindestens zwei Sequenzfragmenten (3) enthalten ist.
6. Verfahren gemäß einem der vorhergehenden Ansprüche, bei dem
- die Kodierungsfunktion eine Hash-Funktion (fH) ist und die verschlüsselten Fragmentdaten (5) Flash-Werte umfassen.
7. Verfahren gemäß einem der vorhergehenden Ansprüche, bei dem die Bildung der Sequenz fragmente (3) vor der Anwendung der Kodierungsfunktion umfasst
- Zusatz jeweils einer stochastisch gewählten Zeichenfolge zu jedem der Sequenzfragmente.
8. Verfahren gemäß einem der vorhergehenden Ansprüche, mit mindestens einem der Merk male
- es werden genetische Daten (1) von einer Vielzahl von Individuen verarbeitet, wobei die geneti schen Daten (1) jedes Individuums eine Reihe von Sequenzelementen umfasst, die jeweils ein Bio molekül repräsentieren,
- die verschlüsselten Fragmentdaten (5) werden in einer Datenbank (30A) gespeichert,
- die vorbestimmte Reihe von Sequenzelementen umfasst einen Abschnitt genetischen Materials, und
- die genetischen Daten (1) repräsentieren eine Nukleotid- oder Aminosäuresequenz.
9. Datenverarbeitungsvorrichtung (100), die zur Erzeugung und Speicherung von verschlüssel ten Fragmentdaten (5) mit dem Verfahren gemäß einem der vorhergehenden Ansprüche konfigu riert ist, umfassend
- eine Fragmentierungseinrichtung (10), die zur Bildung der Sequenzfragmente (3) derart eingerich tet ist, dass sich die Abschnitte der Reihe der Sequenzelemente überlappen und jedes Sequenzele ment in mindestens zwei Sequenzfragmenten (3) enthalten ist,
- eine Kodierungseinrichtung (20), die zur Erzeugung der Vielzahl von verschlüsselten Fragmentda ten (5) eingerichtet ist, und
- eine Speichereinrichtung (30), die zur Speicherung der verschlüsselten Fragmentdaten (5) einge richtet ist.
10. Computerprogrammprodukt, das auf einem Computer-lesbaren Speichermedium gespei chert und zur Bildung der Sequenzfragmente (3) und zur Erzeugung der Vielzahl von verschlüsselten Fragmentdaten (5) bei einem Verfahren gemäß einem der Ansprüche 1 bis 8 eingerichtet ist.
11. Computer-lesbares Speichermedium, auf dem ein Computerprogrammprodukt gespeichert ist, das zur Bildung der Sequenzfragmente (3) und zur Erzeugung der Vielzahl von verschlüsselten Fragmentdaten (5) bei einem Verfahren gemäß einem der Ansprüche 1 bis 8 eingerichtet ist.
12. Datenbank (30A) mit einer Vielzahl von durchsuchbaren, verschlüsselten Fragmentdaten (5), die mit einem Verfahren gemäß einem der Ansprüche 1 bis 8 erzeugt worden sind.
13. Verfahren zur Abfrage einer Datenbank (30A), die verschlüsselte Fragmentdaten (5) ent hält, die mit dem Verfahren gemäß einem der Ansprüche 1 bis 8 erzeugt und gespeichert wurden, mit den Schritten
- Vorgabe einer Suchsequenz (6), umfassend eine vorbestimmte Reihe von Sequenzelementen, die jeweils ein Biomolekül repräsentieren,
- Anwendung der Kodierungsfunktion, mit der die verschlüsselten Fragmentdaten (5) erzeugt wor den sind, auf die Suchsequenz zur Erzeugung einer verschlüsselten Suchsequenz (7), und
- Suche nach der verschlüsselten Suchsequenz in den gespeicherten verschlüsselten Fragmentdaten
(5).
14. Verfahren gemäß Anspruch 13, bei dem
- die Vorgabe der Suchsequenz (6) eine Verkürzung einer initialen Suchsequenz auf eine Suchse quenzlänge umfasst, die gleich der Fragmentlänge der Sequenzfragmente (3) ist, aus denen die ver schlüsselten Fragmentdaten (5) erzeugt worden sind.
EP20842560.3A 2019-12-20 2020-12-16 Verfahren und datenverarbeitungsvorrichtung zur bearbeitung von genetischen daten Pending EP4078595A1 (de)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
DE102019135380.7A DE102019135380A1 (de) 2019-12-20 2019-12-20 Verfahren und Datenverarbeitungsvorrichtung zur Bearbeitung von genetischen Daten
PCT/EP2020/086414 WO2021122742A1 (de) 2019-12-20 2020-12-16 Verfahren und datenverarbeitungsvorrichtung zur bearbeitung von genetischen daten

Publications (1)

Publication Number Publication Date
EP4078595A1 true EP4078595A1 (de) 2022-10-26

Family

ID=74187231

Family Applications (1)

Application Number Title Priority Date Filing Date
EP20842560.3A Pending EP4078595A1 (de) 2019-12-20 2020-12-16 Verfahren und datenverarbeitungsvorrichtung zur bearbeitung von genetischen daten

Country Status (7)

Country Link
US (1) US20230021229A1 (de)
EP (1) EP4078595A1 (de)
JP (1) JP7579343B2 (de)
KR (1) KR20220116536A (de)
CN (1) CN114902343A (de)
DE (1) DE102019135380A1 (de)
WO (1) WO2021122742A1 (de)

Families Citing this family (4)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
KR20230156302A (ko) 2020-12-11 2023-11-14 프라운호퍼-게젤샤프트 추르 푀르데룽 데어 안제반텐 포르슝 에 파우 의료 샘플 데이터 및/또는 샘플을 포함하는 데이터베이스를 대상으로 하는 검색 쿼리를 처리하기 위한 방법 및 검색 플랫폼 장치
US12373579B2 (en) * 2022-11-09 2025-07-29 Bank Of America Corporation Data processing and storage using quantum and DNA computing
US12361172B2 (en) * 2023-06-08 2025-07-15 Verizon Patent And Licensing Inc. Systems and methods for utilizing hash-derived indexing substitution models for data deidentification
WO2025170271A1 (ko) * 2024-02-05 2025-08-14 주식회사 씨젠 후속 핵산서열 저장 장치 및 이를 이용한 후속 핵산서열을 저장하는 방법

Citations (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
WO2001013268A2 (en) * 1999-08-11 2001-02-22 Institute Of Medicinal Molecular Design. Inc. Specific identifiers of amino-acid and base sequences

Family Cites Families (10)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US5787169A (en) * 1995-12-28 1998-07-28 International Business Machines Corp. Method and apparatus for controlling access to encrypted data files in a computer system
US6537747B1 (en) * 1998-02-03 2003-03-25 Lucent Technologies Inc. Data transmission using DNA oligomers
US7809510B2 (en) * 2002-02-27 2010-10-05 Ip Genesis, Inc. Positional hashing method for performing DNA sequence similarity search
US8116988B2 (en) * 2006-05-19 2012-02-14 The University Of Chicago Method for indexing nucleic acid sequences for computer based searching
US20110125411A1 (en) * 2008-03-19 2011-05-26 Lawrence Livermore National Security, Llc Uniquemer Algorithm for Identification of Conserved and Unique Subsequences
WO2012158621A1 (en) * 2011-05-13 2012-11-22 Indiana University Reaserch And Technology Coporation Secure and scalable mapping of human sequencing reads on hybrid clouds
US9449191B2 (en) * 2011-11-03 2016-09-20 Genformatic, Llc. Device, system and method for securing and comparing genomic data
JP2017526046A (ja) * 2014-06-26 2017-09-07 10エックス ゲノミクス,インコーポレイテッド 核酸配列アセンブルのプロセス及びシステム
CN109416932A (zh) * 2016-06-29 2019-03-01 皇家飞利浦有限公司 面向疾病的基因组匿名化
US12046329B2 (en) * 2018-06-07 2024-07-23 Microsoft Technology Licensing, Llc Efficient payload extraction from polynucleotide sequence reads

Patent Citations (1)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
WO2001013268A2 (en) * 1999-08-11 2001-02-22 Institute Of Medicinal Molecular Design. Inc. Specific identifiers of amino-acid and base sequences

Non-Patent Citations (2)

* Cited by examiner, † Cited by third party
Title
BERMAN JULES J: "Threshold protocol for the exchange of confidential medical data", BMC MEDICAL RESEARCH METHODOLOGY, BIOMED CENTRAL, LONDON, GB, vol. 2, no. 1, 11 November 2002 (2002-11-11), pages 12, XP021003445, ISSN: 1471-2288, DOI: 10.1186/1471-2288-2-12 *
See also references of WO2021122742A1 *

Also Published As

Publication number Publication date
US20230021229A1 (en) 2023-01-19
DE102019135380A1 (de) 2021-06-24
JP2023506271A (ja) 2023-02-15
WO2021122742A1 (de) 2021-06-24
KR20220116536A (ko) 2022-08-23
CN114902343A (zh) 2022-08-12
JP7579343B2 (ja) 2024-11-07

Similar Documents

Publication Publication Date Title
WO2021122742A1 (de) Verfahren und datenverarbeitungsvorrichtung zur bearbeitung von genetischen daten
DE69901544T2 (de) Verfahren und vorrichtung zum erstellen eines musterwörterbuches zur anwendung in der erkennung von homologen sequenzen
DE112018004946B4 (de) Kognitive datenanonymisierung
Geschwind Mice, microarrays, and the genetic diversity of the brain
Howe et al. Tackling soil diversity with the assembly of large, complex metagenomes
DE102019205130B4 (de) Datenanalyse-Server, Datenanalysesystem und Datenanalyseverfahren
EP2147388B1 (de) Computersystem und verfahren zur speicherung von daten
DE112013001650T5 (de) Parallelisierung von Informationsgehaltsdaten-Verringerung und Genomkonstruktion aus genetischen Daten für Übertragung, Speicherung und Analyse
US20200364371A1 (en) Methods and systems for anonymizing genome segments and sequences and associated information
EP3889806B1 (de) Bitsequenzbasiertes datenklassifikationssystem
Zeng et al. OrthoCluster: a new tool for mining synteny blocks and applications in comparative genomics
EP1423806A2 (de) Verfahren und anordnung zur datenauswertung sowie ein entsprechendes computerprogramm-erzeugnis und ein entsprechendes computerlesbares speichermedium
DE112020001314T5 (de) System und Verfahren für eine Datenkuration
WO2022069162A1 (de) Bestimmen von vergleichspatienten basierend auf ontologien
Morse Article Commentary: Neuroinformatics: From Bioinformatics to Databasing the Brain
DE112013002565T5 (de) Minimierung von Informationsgehaltsdaten durch Anwendung einer Hierarchie von Referenzgenomen
CH712619B1 (de) Verfahren für einen bio-molekularen Retrieval-Engine.
Khatri et al. Privacy-Preserving Genomic Data Publishing via Differentially-Private Suffix Tree
DE60116772T2 (de) Verfahren zum anonymen registrieren, speichern und verwenden von körpermaterial und/oder davon abgeleiteter information
Doronina et al. Bioinformatics and Issues of Conclusion a Contract for Provision of Medical Services
Karky Bioinformatics innovations and patent eligibility
DE202022106108U1 (de) Blockchain-gestütztes durchsuchbares Verschlüsselungssystem für die Verschlüsselung und Speicherung elektronischer Gesundheitsdaten (EHRs)
DE102024002678A1 (de) Empfehlungsmaschine und Verfahren auf Basis von kollaborativem Filtern
DE102015002820A1 (de) Verfahren zur Speicherung genetischer Daten der personalisierten Medizin
Themido Metabolomics and Artificial Intelligence: emergent applications in Pharmaceutical Sciences

Legal Events

Date Code Title Description
STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: UNKNOWN

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: THE INTERNATIONAL PUBLICATION HAS BEEN MADE

PUAI Public reference made under article 153(3) epc to a published international application that has entered the european phase

Free format text: ORIGINAL CODE: 0009012

STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: REQUEST FOR EXAMINATION WAS MADE

17P Request for examination filed

Effective date: 20220613

AK Designated contracting states

Kind code of ref document: A1

Designated state(s): AL AT BE BG CH CY CZ DE DK EE ES FI FR GB GR HR HU IE IS IT LI LT LU LV MC MK MT NL NO PL PT RO RS SE SI SK SM TR

DAV Request for validation of the european patent (deleted)
DAX Request for extension of the european patent (deleted)
STAA Information on the status of an ep patent application or granted ep patent

Free format text: STATUS: EXAMINATION IS IN PROGRESS

17Q First examination report despatched

Effective date: 20250807