WO2016203092A1 - Procedimiento para diseñar polipéptidos pseudoancestrales con características mejoradas - Google Patents

Procedimiento para diseñar polipéptidos pseudoancestrales con características mejoradas Download PDF

Info

Publication number
WO2016203092A1
WO2016203092A1 PCT/ES2016/070465 ES2016070465W WO2016203092A1 WO 2016203092 A1 WO2016203092 A1 WO 2016203092A1 ES 2016070465 W ES2016070465 W ES 2016070465W WO 2016203092 A1 WO2016203092 A1 WO 2016203092A1
Authority
WO
WIPO (PCT)
Prior art keywords
sequence
polypeptide
sequences
polypeptides
ancestral
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Ceased
Application number
PCT/ES2016/070465
Other languages
English (en)
French (fr)
Inventor
José Manuel Sánchez Ruiz
Sergio Martínez Rodríguez
Valeria Alejandra Risso
Beatriz Ibarra Molero
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Universidad de Granada
Original Assignee
Universidad de Granada
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Universidad de Granada filed Critical Universidad de Granada
Publication of WO2016203092A1 publication Critical patent/WO2016203092A1/es
Anticipated expiration legal-status Critical
Ceased legal-status Critical Current

Links

Classifications

    • CCHEMISTRY; METALLURGY
    • C12BIOCHEMISTRY; BEER; SPIRITS; WINE; VINEGAR; MICROBIOLOGY; ENZYMOLOGY; MUTATION OR GENETIC ENGINEERING
    • C12NMICROORGANISMS OR ENZYMES; COMPOSITIONS THEREOF; PROPAGATING, PRESERVING, OR MAINTAINING MICROORGANISMS; MUTATION OR GENETIC ENGINEERING; CULTURE MEDIA
    • C12N15/00Mutation or genetic engineering; DNA or RNA concerning genetic engineering, vectors, e.g. plasmids, or their isolation, preparation or purification; Use of hosts therefor
    • C12N15/09Recombinant DNA-technology
    • C12N15/10Processes for the isolation, preparation or purification of DNA or RNA
    • CCHEMISTRY; METALLURGY
    • C12BIOCHEMISTRY; BEER; SPIRITS; WINE; VINEGAR; MICROBIOLOGY; ENZYMOLOGY; MUTATION OR GENETIC ENGINEERING
    • C12NMICROORGANISMS OR ENZYMES; COMPOSITIONS THEREOF; PROPAGATING, PRESERVING, OR MAINTAINING MICROORGANISMS; MUTATION OR GENETIC ENGINEERING; CULTURE MEDIA
    • C12N15/00Mutation or genetic engineering; DNA or RNA concerning genetic engineering, vectors, e.g. plasmids, or their isolation, preparation or purification; Use of hosts therefor
    • C12N15/09Recombinant DNA-technology
    • C12N15/10Processes for the isolation, preparation or purification of DNA or RNA
    • C12N15/1034Isolating an individual clone by screening libraries
    • C12N15/1089Design, preparation, screening or analysis of libraries using computer algorithms
    • GPHYSICS
    • G16INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
    • G16BBIOINFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR GENETIC OR PROTEIN-RELATED DATA PROCESSING IN COMPUTATIONAL MOLECULAR BIOLOGY
    • G16B10/00ICT specially adapted for evolutionary bioinformatics, e.g. phylogenetic tree construction or analysis
    • GPHYSICS
    • G16INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
    • G16ZINFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS, NOT OTHERWISE PROVIDED FOR
    • G16Z99/00Subject matter not provided for in other main groups of this subclass

Definitions

  • the present invention is framed in the field of protein engineering.
  • it is useful for obtaining modified polypeptides with improved characteristics (in terms of stability and function) with a view to their biotechnological applications, directly or as a starting point for rational design or laboratory-directed evolution. Since the vast majority of biomedical and industrial applications of proteins require variants with improved characteristics, the invention can find application in various sectors (detergents, textile industry, pharmaceutical industry, food industry, etc.).
  • Stage 1 A certain number of sequences corresponding to a protein in different current organisms is obtained from a search in a sequence database.
  • Stage 3 A simple evolutionary model is used to obtain reasonable approximations to the sequences in the internal nodes of the tree, that is, the ancestral sequences are reconstructed. • Stage 4. Finally, the usual molecular biology techniques are used to prepare in the laboratory the proteins encoded by the reconstructed ancestral sequences, which is commonly known in the field as "resuscitating" the ancestral proteins.
  • Enzymes are polypeptides that have numerous biotechnological applications (textile industry, food industry, pharmaceutical industry, detergents, animal feed, paper processing, etc.) and biomedical (monoclonal antibodies, hormones, etc.).
  • Proteins 82: 887-896 that the consensus method captures ancestral extreme properties (particularly enzymatic promiscuity and thermostability) in a very limited way, limiting or decreasing the interest of using such consensus variants before a possible industrial application when compared with the respective ancestral variants.
  • a subject of the present invention is a method for obtaining sequences encoding pseudoancestral polypeptides, hereinafter "method of the invention” that does not use a phylogenetic analysis, where "pseudoancestral polypeptide” (from English “ancestral-like”) is understood to those polypeptides obtained by the process of the invention without the need to perform a phylogenetic analysis, and which generally capture ancestral extreme properties such as hyperstability and promiscuity of substrate.
  • a second object of the invention is a polypeptide synthesis / production process comprising obtaining the polypeptide sequence by the first method of the invention, hereinafter "polypeptide production process of the invention” or “production method of the invention”.
  • a third object of the invention relates to the pseudoancestral polypeptides obtained with the production process of the invention, which are not described in the state of the art and have improved ancestral properties that make them interesting for industrial application.
  • a fourth object of the invention is a computer program comprising instructions for making a computer carry out the process of the invention.
  • Another object of the invention is a computer-readable storage medium comprising program instructions capable of causing a computer to carry out the process of the invention.
  • Another object of the invention relates to a transmissible signal comprising program instructions capable of causing a computer to carry out the process of the invention.
  • Figure 1 Representation of the evolutionary / phylogenetic tree of the S 0 'sequence, corresponding to the ancestral protein from which the set of proteins with S 1 sequences has evolved ; S 2 , S N.
  • the intermediate nodes correspond to proteins with sequences S, S ' 2 , ..., S' T.
  • Figure 2. Representation of the star tree of the pseudoancestral or central sequence, S 0 , corresponding to the pseudoancestral polypeptide from which the set of polypeptides with S 1 sequences has evolved ; S 2 , S N.
  • ancestral polypeptide sequence of that set will be understood as any polypeptide sequence from which all elements of said set have evolved.
  • Polypeptide sequence pseudoancestral to those sequences obtained by the methodology described in this patent from current polypeptide sequences.
  • Current polypeptide sequences means the polypeptide sequences used to calculate the pseudoancestral sequences. By way of example, sequences belonging to modern organisms that still exist in nature, or having been extinguished, their sequences are currently available.
  • “Phylogenetic tree” ( Figure 1) means a tree-shaped diagram showing the evolutionary relationships between various species or other entities that are believed to have a common ancestry.
  • “Star tree” ( Figure 2) means a tree-shaped diagram that has a single origin (called “central sequence ') to which the rest of the elements of the diagram are connected.
  • central sequence ' a single origin to which the rest of the elements of the diagram are connected.
  • this representation dispenses with all the intermediate sequences that would form the tree, that is, each current sequence will be directly connected to a hypothetical common pseudo-ancestor, thus avoiding the need for include the intermediate nodes in each path, which complicate the analysis.
  • Sequence alignment shall be understood as the way to represent and compare two or more primary polypeptide sequences to highlight their areas of similarity, which could indicate functional or evolutionary relationships between the genes or polypeptides consulted.
  • the aligned sequences are written with the letters (representing amino acids or nucleotides) in rows of a matrix in which, if necessary, spaces (in English, "gaps") are inserted so that the areas with the same or similar structure align.
  • Global alignments which attempt to align each residue of each sequence, are most useful when the initial problem sequences are similar and approximately the same size (it does not mean that the global alignments cannot end in gaps).
  • a general global alignment strategy is the Needleman-Wunsch algorithm based on dynamic programming.
  • Local alignments are more useful for differentiated sequences in which it is suspected that there are very similar regions or motifs of similar sequences within a larger context.
  • the Smith-Waterman algorithm is a general method of local alignment based on dynamic programming. With sufficiently similar sequences, there is no difference between global and local alignments.
  • Hybrid methods known as “semiglobales” or “glocal” methods try to find the best possible alignment that includes the beginning and end of one or another sequence. It can be especially useful when the "upstream” part of a sequence overlaps the "downstream” part of the other. In this case, neither the global nor the local alignment is completely adequate: a global alignment will attempt to force the alignment to extend beyond the overlapping region, while the local alignment will not completely cover the overlapping region.
  • the method of the invention is based on an alignment of the sequences of the polypeptides for which a pseudo-ancestral polypeptide is to be calculated.
  • the process of the invention will use as a starting point a global sequence alignment.
  • an alignment, preferably globally, of the current N polypeptide sequences is performed: S 1; S 2 , S N , using freely available bioinformatics tools, such as Clustal W [Thompson JD, Higgins DG, Gibson TJ (1994) CLUSTAL W: improving the sensitivity of progressive multiple sequence alignment through sequence weighting, position-specific gap penalties and weight matrix choice Nucleic Acids Research 22 (22): 4673-4680]. All sequences after alignment have the same length, L, which corresponds to the number of amino acids plus gaps or gaps generated in the alignment.
  • amino acid found in position j of a sequence will be called A ⁇ , so an aligned sequence can be represented as
  • the amino acid present in the position and the sequence S ⁇ will be identified as A ⁇ 7 .
  • the amino acid present at position j of the pseudoancestral sequence, S 0 is identified as A 0y .
  • the known ancestral protein calculation procedures need a complex edition of the initial alignment.
  • the process of the invention avoids having to make modifications to the alignment.
  • the first object of the invention is to obtain pseudoancestral polypeptides that have the extreme and biotechnological properties of ancestral polypeptides, such as substrate promiscuity and thermostability, but avoiding the derivation stage of the phylogenetic tree that includes the methods of reconstruction of ancestral sequences since said stage constitutes a very serious limitation to the biotechnological application of the reconstruction / resurrection of ancestral polypeptides.
  • the method of the invention calculates the sequence of the pseudoancestral polypeptide, S 0 , or "center sequence, from a maximum likelihood estimate based on the following hypothesis:
  • ⁇ ti ⁇ ⁇ Si
  • t (5 w ) ⁇ is the set of the branch lengths that connect S 0 with each of the aligned sequences of departure;
  • P Ai j ⁇ A 0j , ts is the probability of observing the amino acid present in position j of the sequence S ⁇ , fixed the amino acid present in that position in the central sequence, S 0 , and the length of the connecting branch S 0 with S ⁇ , t (S ⁇ ); and w (S 1 ), w (S 2 ), w (S N ) are a set of statistical weights for the current sequences that can be used to correct the fact that groups of similar sequences can distort the analysis.
  • the procedure not only calculates the hypothetical pseudoancestral sequence for given starting sequences and branch lengths, but explores the space of the branch lengths and finds the optimum branch length (i.e., the one that maximizes the likelihood) for each sequence current given.
  • the probabilities are calculated from amino acid substitution matrices and average frequencies thereof using a continuous time Markov chain, as described in the literature [Whelan, S., and N. Goldman. 2001. A general empirical model of protein evolution derived from multiple protein families using a maximum-likelihood approach. Mol. Biol. Evol. 18: 691-699; Huelsenbeck, Ronquist, Bayesian analysis of molecular evolution using MrBayes. In: Nielsen, R. (ed.), Statistical Methods in Molecular Evolution. Springer, New York, 2005].
  • a continuous-time Markov model is used [Felsenstein J (1981) Evolutionary trees from DNA sequences: a maximum likelihood approach. Journal of Molecular Evolution 17: 368-376] with an amino acid substitution matrix that allows obtaining the probability of the modern amino acid at each position of each current sequence given the ancestral amino acid and the length of the branch that connects the current and the hypothetical ancestral sequence .
  • the weights w (S 1 ), w (S 2 ), w (S N ) are calculated so that the weight of a sequence that is part of one of those groups contributes differently to the final sequence.
  • the weights of all sequences are equal to 1.
  • the optimal central sequence, S 0 is that which maximizes the likelihood defined in equation 1.
  • a fourth object of the invention is a computer program comprising instructions for making a computer carry out the process of the invention.
  • the invention encompasses computer programs that may be in the form of source code, object code or intermediate code between source code and object code, such as partially compiled form, or in any other form suitable for use in the implementation of the processes according to the invention.
  • Computer programs also encompass cloud applications that implement the method of the invention.
  • carrier medium can be any entity or device capable of carrying the program.
  • the carrier means may be constituted by said cable or other device or medium.
  • the carrier means could be an integrated circuit in which the program is included, the integrated circuit being adapted to execute, or to be used in the execution of, the corresponding processes.
  • the programs could be incorporated into a storage medium, such as a ROM, a CD ROM or a semiconductor ROM, a USB memory, or a magnetic recording medium, for example, a floppy disk or a hard drive
  • a storage medium such as a ROM, a CD ROM or a semiconductor ROM, a USB memory, or a magnetic recording medium, for example, a floppy disk or a hard drive
  • the programs could be supported on a transmissible carrier signal.
  • it could be an electrical or optical signal that could be transported through an electrical or optical cable, by radio or by any other means.
  • another object of the invention is a storage medium readable by a computer comprising program instructions capable of causing a computer to carry out the process of the invention.
  • a last object of the invention relates to a transmissible signal comprising program instructions capable of causing a computer to carry out the process of the invention.
  • Another object of the invention is a process, hereinafter "method of production of the invention", of synthesis or production of a polypeptide, pseudoancestral polypeptide, from which a set of determined N polypeptides have evolved, which comprises the prior obtaining of the sequence of said pseudoancestral polypeptide by the method of the invention.
  • the method for synthesizing a pseudoancestral polypeptide from which the foregoing would have evolved comprises the following steps:
  • Another object of the invention relates to the pseudoancestral polypeptides obtained by the method of synthesis of the invention, hereinafter "polypeptides of the invention".
  • polypeptides of the invention obtained by the method of synthesis of the invention.
  • the pseudoancestral ⁇ -lactamases SecletOOO, SecletOOl, Seclet006 and Seclet012 are object of the invention. not described in the state of the art, and that have a high promiscuity of substrate and hyperstability:
  • MAAEALEALAELERQSGGRLGVAVLDTASGRRIGYRADERFPMCS FKVMLAAAVLARVDQGKE QLDRRI YSKSDLVSYSPVTEKHVGNGMTVAELCAAAIQYSDNTAANLLLKQIGGPAAVTAFLR SIGDDT RLDRWEPELNTAAPGDPRDTT PAAMAATLRRLLLGDALSPASRAQLVEWMMGNKTG DNRIRAGLPAGWRVGDKTGTGDYGTTNDIAVIWPPNRAPIVLAVYFTQSQADAKARDDVIAAVA RIVVAAFLEHHHHHHHH
  • polypeptides with an identity of at least 80%, 85%, 90%, 95%, 98% or 99% with any of sequences 1 to 4 and in which said Polypeptides possess similar activity and structural characteristics as ⁇ -lactamases, in particular, polypeptides with similar substrate promiscuity and hyperstability.
  • a fourth object of the invention relates to polynucleotides (hereinafter “polynucleotides of the invention") encoding the polypeptides of the invention.
  • polynucleotides of the invention encoding polypeptides with an identity of at least 80%, 85%, 90%, 95%, 98% or 99% with any of the sequences are subject to the invention 1 to 4 and in which the polypeptide encoded by said polynucleotides possesses similar activity and structural characteristics as ⁇ -lactamases, in particular, similar substrate promiscuity and hyperstability.
  • said polypeptide has enzymatic activity.
  • a fifth object of the invention relates to antibodies or fragments thereof that can bind polypeptides with any one of the aforementioned peptide sequences.
  • the invention also relates to a recombinant vector, such as an expression vector, comprising a polynucleotide of the invention operably linked to a regulatory sequence, for example a promoter; a host cell that is transformed with a polynucleotide of the invention; and a method of producing a polypeptide with enzymatic activity, comprising maintaining a host cell transformed with a polynucleotide of the invention under conditions to provide peptide expression.
  • a recombinant vector such as an expression vector, comprising a polynucleotide of the invention operably linked to a regulatory sequence, for example a promoter; a host cell that is transformed with a polynucleotide of the invention; and a method of producing a polypeptide with enzymatic activity, comprising maintaining a host cell transformed with a
  • a particular embodiment of the invention has been carried out by implementing the method of the invention in a computer program compiled in QB64 (Quick Basic 64, a BASIC language compiler that is a C ++ transmitter).
  • the program not only calculates the hypothetical ancestral sequence for given starting sequences and branch lengths, but explores the space of the branch lengths and finds the optimal branch length (that is, the one that maximizes the likelihood) for each sequence current given.
  • pseudo-ancestral sequences have been calculated using different statistical weights (values between 0 and 1).
  • the pseudo-ancestral variants SecletOOO (SEQ ID NO: 1), SecletOOl (SEQ ID NO: 2), Seclet006 (SEQ ID NO: 3), and Seclet012 (SEQ ID NO: 4) stand out.
  • the corresponding proteins have been prepared in the laboratory, acquiring the expression plasmids in private companies encoding the corresponding gene sequences optimized for expression in Escherichia coli (TopGene Technologies).
  • the enzymes were produced by a heterologous expression system and purified by one-step affinity chromatography thanks to the inclusion of a polyhistidine tail at the carboxyl end.
  • Tm indicates the average denaturation temperature

Landscapes

  • Life Sciences & Earth Sciences (AREA)
  • Health & Medical Sciences (AREA)
  • Engineering & Computer Science (AREA)
  • Chemical & Material Sciences (AREA)
  • Genetics & Genomics (AREA)
  • Biotechnology (AREA)
  • Bioinformatics & Cheminformatics (AREA)
  • General Engineering & Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • Organic Chemistry (AREA)
  • Biomedical Technology (AREA)
  • Zoology (AREA)
  • Wood Science & Technology (AREA)
  • Biophysics (AREA)
  • General Health & Medical Sciences (AREA)
  • Bioinformatics & Computational Biology (AREA)
  • Microbiology (AREA)
  • Plant Pathology (AREA)
  • Molecular Biology (AREA)
  • Biochemistry (AREA)
  • Crystallography & Structural Chemistry (AREA)
  • Animal Behavior & Ethology (AREA)
  • Physiology (AREA)
  • Evolutionary Biology (AREA)
  • Medical Informatics (AREA)
  • Spectroscopy & Molecular Physics (AREA)
  • Theoretical Computer Science (AREA)
  • Peptides Or Proteins (AREA)
  • Analytical Chemistry (AREA)
  • Preparation Of Compounds By Using Micro-Organisms (AREA)

Abstract

La presente invención tiene por objeto un procedimiento para la obtención de secuencias que codifican polipéptidos capaces de capturar propiedades extremas ancestrales tales como hiperestabilidad y promiscuidad de sustrato. Asimismo, la invención se refiere a un procedimiento de producción de tales polipéptidos y a los polipéptidos obtenidos.

Description

PROCEDIMIENTO PARA DISEÑAR POLIPÉPTIDOS PSEUDOANCESTRALES CON CARACTERÍSTICAS MEJORADAS
CAMPO DE LA INVENCIÓN
La presente invención se enmarca en el campo de la ingeniería de proteínas. En particular es útil para la obtención de polipéptidos modificados con características mejoradas (en términos de estabilidad y función) con vistas a sus aplicaciones biotecnológicas, directamente o como punto de partida de diseño racional o de evolución dirigida en laboratorio. Dado que la gran mayoría de las aplicaciones biomédicas e industriales de las proteínas requieren variantes con características mejoradas, la invención puede encontrar aplicación en sectores diversos (detergentes, industria textil, industria farmacéutica, industria de alimentación, etc.).
ESTADO DE LA TÉCNICA
Diseño de proteínas ancestrales
El gran número de secuencias de proteínas disponibles a partir de la era genómica ha provocado un gran interés en el uso de la diversidad natural de secuencias en ingeniería de proteínas [Colé MF, Cox VE, Gratton KL, Gaucher EA (2013) Reconstructing evolutionary adaptive paths for protein engineering. Methods in Molecular Biology 978: 1 15-125.]. Uno de los enfoques más prometedores en este sentido es la reconstrucción de proteínas ancestrales, una metodología que, con carácter general, consta de las siguientes etapas [Fernandez JM, Gaucher E, Kosuri P, Perez-Jimenez R (2012) Ancestral proteins WO 2012009693 A1]:
• Etapa 1. Se obtiene un cierto número de secuencias correspondientes a una proteína en diferentes organismos actuales a partir de una búsqueda en una base de datos de secuencias.
· Etapa 2. Se lleva a cabo un análisis filogenético a partir de esas secuencias (análisis de las relaciones evolutivas de un grupo determinado de secuencias aminoacídicas) para obtener el correspondiente árbol filogenético y/o evolutivo.
• Etapa 3. Se utiliza un modelo evolutivo simple para obtener aproximaciones razonables a las secuencias en los nodos internos del árbol, es decir se reconstruyen las secuencias ancestrales. • Etapa 4. Finalmente, se usan las técnicas habituales de biología molecular para preparar en el laboratorio las proteínas codificadas por las secuencias ancestrales reconstruidas, lo que se conoce habitualmente en el campo como "resucitar" las proteínas ancestrales.
Enzimas y sus aplicaciones
Las enzimas son polipéptidos que presentan numerosas aplicaciones biotecnológicas (industria textil, industria de alimentos, industria farmacéutica, detergentes, piensos para animales, procesamiento de papel, etc.) y biomédicas (anticuerpos monoclonales, hormonas, etc.).
La inmensa mayoría de estas aplicaciones usan enzimas modificadas ya que las enzimas naturales no suelen presentar las características adecuadas, en términos por ejemplo de estabilidad y propiedades catalíticas, para su aplicación práctica [Kirk O, Borchert TV, Fuglsang CC (2002) Industrial enzyme applications. Current Opinión in Biotechnology 13:345-351 ; Lazar GA, Marshall SA, Plecs JJ, Mayo SL, Dejaríais JR (2003) Designing proteins for therapeutic applications. Current Opinión in Structural Biology 13:513-518; Maynard J, Georgiu G (2000) Antibody Engineering Annual Review of Biomedical Engineering 2:339-376]. Las modificaciones introducidas son en muchos casos mutaciones y el campo en general se conoce como "Ingeniería de proteínas".
Enzimas "ancestrales"
Varios estudios recientes en los que se han resucitado proteínas ancestrales correspondientes a nodos muy antiguos (nodos precámbricos del orden de miles de millones de años de antigüedad) han producido enzimas con muy alta estabilidad e incluso con promiscuidad catalítica (capacidad de degradar una variedad de sustratos, por ejemplo) [Gaucher EA, Govindarajan S, Ganesh OK (2008) Palaeotemperature trend for Precambrian Ufe inferred from resurrected proteins. Nature 451 :704-707; Perez-Jimenez R, Ingles-Prieto A, Zhao ZM, Sánchez-Romero I, Alegre-Cebollada J. Kosuri P, Garcia-Manyes S, Kappock TJ, Tanokura M, Holmgren A, Sanchez-Ruiz JM, Gaucher EA, Fernandez JM (201 1) Single-molecule paleoenzymology probes the chemistry of resurrected enzymes; Risso VA, Gavira JA, Mejia-Carmona D, Gaucher EA, Sanchez-Ruiz JM (2013) Hyperstability and substrate promiscuity in laboratory resurrections of Precambrian β-lactamases. Journal of the American Chemical Society 35:2899-2902; Fernandez JM, Gaucher E, Kosuri P, Perez-Jimenez R (2012) Ancestral proteins WO 2012009693 A1] Hay que resaltar que tanto la estabilidad como la promiscuidad contribuyen a la "evolvabilidad" (en inglés "evolvability") de la enzima [Bloom JD, Labthavikul ST, Otey CR, Arnold FH (2006) Protein stability promotes evolvability. Proceedings of the National Academy of Sciences of the U.S.A. 103:5869-5874; Risso VA, Gavira JA, Sanchez-Ruiz JM (2014) Thermostable and promiscuous Precambrian proteins. Environmental Microbiology 16: 1485-1489], entendiendo por "evolvabilidad' la capacidad de desarrollar una función nueva mediante evolución dirigida en el laboratorio o mediante diseño racional [Nobeli I, Favia AD, Thornton JM (2009) Protein promiscuity and its implications for biotechnology. Nature Biotechnology 27:157-167]. La alta evolvabilidad es, de hecho, una característica altamente deseable en enzimas a utilizar como punto de partida en proyectos de ingeniería de proteínas. En este sentido, el potencial biotecnológico de la resurrección de proteínas ancestrales precámbricas es reconocido [ver, por ejemplo, los comentarios del Faculty 1000 al artículo de J AM Chem Soc. "Hyperstability and substrate promiscuity in laboratory resurrections of Precambrian β-lactamases": ttp;/yf 1.000,^ Último acceso 16/06/2015]. Sin embargo, tal y como se detalla debajo, el enfoque presenta un serio inconveniente metodológico que limita su aplicación práctica en un contexto biotecnológico.
Problemas metodológicos de la reconstrucción de secuencias ancestrales
El procedimiento de reconstrucción de secuencias ancestrales comentado anteriormente comprende una etapa que consiste en la derivación de un árbol filogenético creíble a partir de las secuencias modernas de partida. Esto, sin embargo, presenta varios problemas:
1. Las transferencias genéticas horizontales ocurren con mucha frecuencia y pueden distorsionar fuertemente el análisis filogenético [Koonin EV, Makarova KS, Aravind L (2001) Horizontal gene transferin prokaryotes: quantification and classification. Annual Review of Microbiology 55:709-742.].
2. Igualmente, para muchas proteínas, aparecen procesos de duplicación genética durante la evolución [Voordeckers K, Brown CA, Vanneste K, van der Zande E, Voet A, Maere S, Verstrepen KJ (2012) Reconstruction of ancestral metabolic enzymes reveáis molecular mechanisms underlying evolutionary innovation trough gene duplication. PLoS Biology 10:e1001446.] y pueden resultar difíciles de modelar adecuadamente. Nótese que las duplicaciones genéticas hacen que el árbol derivado a partir de las secuencias de una proteína concreta no tenga porqué parecerse a la filogenia de los organismos, con lo que el test más directo de la plausibilidad del árbol filogenético de la proteína no puede aplicarse.
3. Los programas que se consideran en el campo como más fiables para la obtención del árbol filogenético de una proteína, en particular los análisis bayesianos [Yang Z, Rannala B (1997) Bayesian phylogenetic inference using DNA sequences: a Markov chain Monte Cario method. Molecular Biology and Evolution 14:717-724; Huelsenbeck JP, Ronquist F, Nielsen R, Bollback JP (2001) Bayesian inference phylogeny and its impact on evolutionary biology. Science 294:2310-2314; Kolaczkowski B, Thornton JW (2007) Effects of branch length uncertainty on Bayesian posterior probabilities for phylogenetic hypotheses. Molecular Biology and Evolution 249:2108-2118], son típicamente lentos y sólo son eficaces con un número limitado de secuencias (del orden de 100) y con un número limitado de residuos (del orden de unos cientos). Ese número de secuencias debe seleccionarse a partir de las depositadas en las bases de datos habituales de acuerdo con criterios que no se encuentran sistematizados en la literatura y que, en algunos casos, pueden ser arbitrarios o subjetivos hasta cierto punto. Por otra parte, el basar el análisis filogenético en un número limitado de secuencias implica que no se usa toda la información disponible en las bases de datos, lo que es claramente indeseable, sobre todo cuando las bases de datos de secuencias están creciendo exponencialmente.
Resulta claro de lo arriba expuesto que la construcción de un árbol filogenético para una proteína a partir de un conjunto de secuencias actuales puede llegar a ser un proceso extremadamente tedioso, incierto y poco flexible. Algunos programas comprendidos en el estado de la técnica que se basan en análisis bayesianos que emplean la metodología MCMC, (del inglés "Markov Chain Monte Cario") o Métodos de Monte Cario basados en Cadenas de Markov, pueden requerir tiempos de ejecución de incluso varios días en clusters de 8 procesadores de última generación (proporcionando un aumento sustancial de la capacidad de cálculo), incluso para números relativamente bajos de secuencias de longitud moderada. Hay que tener en cuenta, además, que, el árbol resultado de la ejecución puede no ser satisfactorio, debiendo examinarse para identificar inconsistencias con las relaciones evolutivas aceptadas [Colé MF, Cox VE, Gratton KL, Gaucher EA (2013) Reconstructing evolutionary adaptive paths for protein engineering. Methods in Molecular Biology 978: 115-125] y decidir si tales inconsistencias son reales (debidas a eventos de transferencia horizontal o duplicación genética) o son debidas a errores (insuficiente representación de algunos grupos taxonómicos en las secuencias de partida). En este último caso, debe repetirse la ejecución [Colé MF, Cox VE, Gratton KL, Gaucher EA (2013) Reconstructing evolutionary adaptive paths for protein engineering. Methods in Molecular Biology 978: 115-125] con parámetros modificados o incluso con un conjunto diferente de secuencias de partida para minimizar distorsiones debidas a transferencias horizontales, duplicaciones, etc. Todos estos ajustes, además, deben realizarse sin criterios claros que los dirijan. El resultado es que el análisis filogenético puede requerir muchas semanas, incluso para un número limitado de secuencias de una proteína de pequeño tamaño. El análisis para proteínas de tamaño medio o grande (la situación habitual en el contexto de una aplicación biotecnológica) y/o usando todas las secuencias depositadas en las bases de datos, puede simplemente no ser posible en un tiempo razonable. Los inventores de la presente invención desconocen otros procedimientos que permitan obtener variantes de polipéptidos con propiedades ancestrales extremas y que no incluyan la etapa de construcción del árbol filogenético salvo el llamado "enfoque de consenso" que se basa en la introducción en cada posición del aminoácido que aparece con más frecuencia en el alineamiento de las secuencias actuales. Sin embargo, se ha demostrado recientemente [Risso VA, Gavira JA, Gaucher EA, Sanchez-Ruiz JM (2014) Phenotypic comparisons of consensus varíants versus laboratory resurrections of Precambrían proteins. Proteins 82:887-896] que el método de consenso captura las propiedades extremas ancestrales (particularmente la promiscuidad enzimática y la termoestabilidad) de forma muy limitada, limitando o disminuyendo el interés del uso de dichas variantes consenso ante una posible aplicación industrial al ser comparadas con las respectivas variantes ancestrales.
En resumen, resulta altamente deseable disponer de un procedimiento que permita acceder a las propiedades ancestrales de las proteínas (típicamente extremas y de claro interés biotecnológico) pero que evite todos los inconvenientes asociados a la derivación de un árbol filogenético de la proteína.
BREVE DESCRIPCIÓN DE LA INVENCIÓN La presente invención tiene por objeto un procedimiento para la obtención de secuencias que codifican polipéptidos pseudoancestrales, en adelante "procedimiento de la invención" que no utiliza un análisis filogenético, donde por "polipéptido pseudoancestral" (del inglés "ancestral-like") se entenderá a aquellos polipéptidos obtenidos mediante el procedimiento de la invención sin necesidad de realizar un análisis filogenético, y que con carácter general, capturan propiedades extremas ancestrales tales como hiperestabilidad y promiscuidad de sustrato.
Un segundo objeto de la invención es un procedimiento de síntesis/producción de polipéptidos que comprende la obtención de la secuencia polipeptídica mediante el primer procedimiento de la invención, en adelante "procedimiento de producción de polipéptidos de la invención" o "procedimiento de producción de la invención".
Un tercer objeto de la invención se refiere a los polipéptidos pseudoancestrales obtenidos con el procedimiento de producción de la invención, que no se encuentran descritos en el estado de la técnica y presentan propiedades ancestrales mejoradas que los hacen interesantes para su aplicación industrial.
Un cuarto objeto de la invención es un programa de ordenador que comprende instrucciones para hacer que un ordenador lleve a cabo el procedimiento de la invención.
Otro objeto de la invención es un medio de almacenamiento legible por un ordenador que comprende instrucciones de programa capaces de hacer que un ordenador lleve a cabo el procedimiento de la invención.
Otro objeto de la invención se refiere a una señal transmisible que comprende instrucciones de programa capaces de hacer que un ordenador lleve a cabo el procedimiento de la invención.
DESCRIPCIÓN DE LAS FIGURAS
Figura 1.- Representación del árbol evolutivo / filogenético de la secuencia S0', correspondiente a la proteína ancestral de la que ha evolucionado el conjunto de proteínas con secuencias S1; S2, SN. Los nodos intermedios corresponden a proteínas con secuencias S , S'2, ... , S'T.
Figura 2.- Representación del árbol en estrella de la secuencia pseudoancestral o central, S0, correspondiente al polipéptido pseudoancestral del que ha evolucionado el conjunto de polipéptidos con secuencias S1; S2, SN.
DESCRIPCIÓN DETALLADA DE LA INVENCIÓN Definiciones
En la presente descripción, dado un conjunto de secuencias de polipéptidos actuales, se entenderá por "secuencia de polipéptido ancestral' de ese conjunto a cualquier secuencia polipeptídica a partir de la que han evolucionado todos los elementos de dicho conjunto. Se entenderá por secuencia de polipéptido pseudoancestral a aquellas secuencias obtenidas mediante la metodología descrita en esta patente a partir de secuencias de polipéptidos actuales. Se entenderá por "secuencias de polipéptido actuales" a las secuencias polipeptídicas utilizadas para el cálculo de las secuencias pseudoancestrales. A modo de ejemplo, secuencias que pertenecen a organismos modernos que existen aún en la naturaleza, o habiendo sido extinguidos, sus secuencias se encuentran disponibles en la actualidad.
A lo largo de la presente invención se entenderá como "reconstrucción de secuencias de polipéptidos ancestrales o pseudoancestrales" a los diferentes cálculos matemáticos mediante los cuales se determinan dichas secuencias. Se entenderá como "resurrección de polipéptidos ancestrales o pseudoancestrales" a la producción o síntesis artificial en el laboratorio de las secuencias polipeptídicas reconstruidas mediante diferentes cálculos matemáticos, en términos similares a los descritos en WO 2012009693 A1. En ese sentido, el término "polipéptido resucitado" se refiere a un polipéptido obtenido por dicho método.
Se entenderá por "árbol filogenético" (Figura 1) a un diagrama en forma de árbol que muestra las relaciones evolutivas entre varias especies u otras entidades que se cree que tienen una ascendencia común. Se entenderá por "árbol en estrella" (Figura 2) a un diagrama en forma de árbol que tiene un único origen (denominada "secuencia central') al que están conectados el resto de elementos del diagrama. A diferencia del árbol filogenético, a la hora de representar un polipéptido pseudoancestral del que han evolucionado un conjunto de polipéptidos, en esta representación se prescinde de todas las secuencias intermedias que formarían el árbol. Esto es, cada secuencia actual estará conectada directamente con un hipotético pseudoancestro común, evitándose así la necesidad de incluir los nodos intermedios en cada trayectoria, que complican el análisis.
Alineamientos de secuencias: Pasos previos al procedimiento de la invención
Se entenderá por "alineamiento de secuencias" a la forma de representar y comparar dos o más secuencias primarias de polipéptidos para resaltar sus zonas de similitud, que podrían indicar relaciones funcionales o evolutivas entre los genes o polipéptidos consultados. Las secuencias alineadas se escriben con las letras (representando aminoácidos o nucleótidos) en filas de una matriz en las que, si es necesario, se insertan espacios (en inglés, "gaps") para que las zonas con idéntica o similar estructura se alineen.
Los alineamientos globales, que intentan alinear cada residuo de cada secuencia, son más útiles cuando las secuencias problema iniciales son similares y aproximadamente del mismo tamaño (no quiere decir que los alineamientos globales no puedan terminar en huecos). A modo de ejemplo, una estrategia general de alineamiento global es el algoritmo Needleman-Wunsch basado en programación dinámica.
Los alineamientos locales son más útiles para secuencias diferenciadas en las que se sospecha que existen regiones muy similares o motivos de secuencias similares dentro de un contexto mayor. A modo de ejemplo, el algoritmo Smith-Waterman es un método general de alineamiento local basado en programación dinámica. Con secuencias suficientemente similares, no existe diferencia entre alineamientos globales y locales.
Los métodos híbridos, conocidos como "semiglobales" o métodos "glocales" intentan encontrar el mejor alineamiento posible que incluya el inicio y el final de una u otra secuencia. Puede ser especialmente útil cuando la parte "corriente arriba" de una secuencia se solapa con la parte "corriente abajo" de la otra. En este caso, ni el alineamiento global ni el local son completamente adecuados: un alineamiento global intentará forzar a la alineación a extenderse más allá de la región de solapamiento, mientras que el alineamiento local no cubrirá totalmente la región solapada.
El procedimiento de la invención parte de un alineamiento de las secuencias de los polipéptidos para los que se quiere calcular un polipéptido pseudoancestral.
De forma preferente, el procedimiento de la invención utilizará como punto de partida un alineamiento global de secuencias.
Pueden utilizarse como alineamientos de partida aquellos libremente disponibles en bases de datos públicas, tales como los descritos en [Lombard V, Camón EB, Parkinson HE, Hingamp P, Stoesser G, Redaschi N. (2002) EM BL-Align: a new public nucleotide and amino acid múltiple sequence alignment datábase. Bioinformatics.18(5): 763-764].
Alternativamente, se realiza un alineamiento, de forma preferente global, de las N secuencias de polipéptidos actuales: S1; S2, SN , utilizando herramientas bioinformáticas libremente disponibles, tales como Clustal W [Thompson JD, Higgins DG, Gibson TJ (1994) CLUSTAL W: improving the sensitivity of progressive múltiple sequence alignment through sequence weighting, position-specific gap penalties and weight matrix choice. Nucleic Acids Research 22(22):4673-4680]. Todas las secuencias tras el alineamiento tienen la misma longitud, L, que se corresponden con el número de aminoácidos más los huecos o gaps generados en el alineamiento.
El aminoácido que se encuentran en la posición j de una secuencia se denominará A¡ , por lo que una secuencia alineada se puede representar representará como
Así, si llamamos "A" a la matriz que contiene el alineamiento, el aminoácido presente en la posición y de la secuencia S¡ se identificará como A¿7. En particular, el aminoácido presente en la posición j de la secuencia pseudoancestral, S0, se identifica como A0y .
Los procedimientos de cálculo de proteínas ancestrales conocidos necesitan una compleja edición del alineamiento inicial. El procedimiento de la invención evita tener que realizar modificaciones en el alineamiento.
Procedimiento para la obtención de secuencias que codifican polipéptidos pseudoancestrales
El primer objeto de la invención es la obtención de polipéptidos pseudoancestrales que presenten las propiedades extremas y de interés biotecnológico de los polipéptidos ancestrales, como por ejemplo la promiscuidad de sustrato y la termoestabilidad, pero evitando la etapa de derivación del árbol filogenético que incluyen los métodos de reconstrucción de secuencias ancestrales ya que dicha etapa constituye una limitación muy seria a la aplicación biotecnológica de la reconstrucción/resurrección de polipéptidos ancestrales. Así, el procedimiento de la invención calcula la secuencia del polipéptido pseudoancestral, S0, o "secuencia centrar, a partir de una estimación máximo verosímil que parte de la siguiente hipótesis:
Se considera que la secuencia central, desconocida en principio, está unida directamente a las secuencias de partida actuales mediante ramas de longitudes t^), t( 52), t( Sjv), siendo t( 5¿), la "longitud de la rama" que une Sñ y S, ", o la "distancia entre 5n y 5,", el número de sustituciones de aminoácidos existentes entre
A modo de ejemplo, la distancia entre las siguientes secuencias S0 y St es t^) = 4:
FAGGTDAVVLL
F-GGAD-VVLT
t( Si) = 4 Gráficamente esta hipótesis se puede representar mediante un árbol en estrella (Figura 2) en el que todos los polipéptidos de partida comparten un pseudoancestro común del que parten todas las ramas del árbol. Evidentemente, las longitudes de cada rama son desconocidas en principio.
En este contexto, el procedimiento de la invención es un procedimiento que permite obtener la secuencia de un polipéptido pseudoancestral, S0, a partir del alineamiento, A = [Aij], i = 1, ... , N; ] = 1, ... , L ; de N polipéptidos (polipéptidos actuales) con secuencias alineadas St, S2, SN, que comprende la maximización de la función de verosimilitud V'(S0, {ti})
V'(So, {ti}) =
Figure imgf000013_0001
Π] = 1 L ÍP (¿¿7 l4>7, t(Si))J (Ec. 1) donde {ti} = ^ Si), t( 52), t( 5w)}, es el conjunto de las longitudes de rama que conectan S0 con cada una de las secuencias alineadas de partida;
P Aij \A0j, t s es la probabilidad de observar el aminoácido presente en la posición j de la secuencia S¡, fijados el amino ácido presente en esa posición en la secuencia central, S0, y la longitud de la rama que conecta S0 con S¡ , t(S¡); y w(S1), w(S2), w(SN) son un conjunto de pesos estadísticos para las secuencias actuales que pueden usarse para corregir el hecho de que grupos de secuencias similares puede distorsionar el análisis.
El procedimiento no sólo calcula la secuencia pseudoancestral hipotética para unas secuencias de partida y longitudes de rama dadas, sino que explora el espacio de las longitudes de rama y encuentra la longitud de rama óptima (o sea, la que maximiza la verosimilitud) para cada secuencia actual dada.
En una realización preferente, las probabilidades se calculan a partir de matrices de sustitución de aminoácidos y frecuencias medias de éstos usando una cadena de Markov de tiempo continuo, tal y como se describe en la literatura [Whelan, S., and N. Goldman. 2001. A general empirical model of protein evolution derived from múltiple protein families using a maximum-likelihood approach. Mol. Biol. Evol. 18:691-699; Huelsenbeck, Ronquist, Bayesian analysis of molecular evolution using MrBayes. In: Nielsen, R. (ed.), Statistical Methods in Molecular Evolution. Springer, New York, 2005]. Para ello se utiliza un modelo de Markov de tiempo continuo [Felsenstein J (1981) Evolutionary trees from DNA sequences: a máximum likelihood approach. Journal of Molecular Evolution 17:368-376] con una matriz de sustitución aminoacídica que permite obtener la probabilidad del aminoácido moderno en cada posición de cada secuencia actual dado el aminoácido ancestral y la longitud de la rama que conecta la secuencia actual y la ancestral hipotética.
Empleo de pesos En la práctica, este planteamiento basado en un árbol de estrella podría sobrestimar la contribución de secuencias actuales similares que divergieron recientemente y cuyas ramas desde el ancestro no pueden considerarse independientes (como las trayectorias marcadas con líneas discontinuas en las Figuras 1 y 2). Para compensar esta distorsión se utiliza una función de verosimilitud modificada en que se introduce un peso estadístico para la probabilidad de cada secuencia actual que depende del número de secuencias parecidas a la secuencia que se considera.
Los pesos w(S1), w(S2), w(SN) se calculan de manera que el peso de una secuencia que forma parte de uno de esos grupos contribuya de forma distinta a la secuencia final. En una realización particular, los pesos de todas las secuencias son iguales a 1.
La secuencia central óptima, S0, es aquella que maximiza la verosimilitud definida en la ecuación 1. Programa de ordenador, señal y dispositivo que implementa el procedimiento de la invención
Un cuarto objeto de la invención es un programa de ordenador que comprende instrucciones para hacer que un ordenador lleve a cabo el procedimiento de la invención.
La invención abarca programas de ordenador que pueden estar en forma de código fuente, de código objeto o en un código intermedio entre código fuente y código objeto, tal como en forma parcialmente compilada, o en cualquier otra forma adecuada para usar en la implementación de los procesos de acuerdo con la invención. En particular, los programas de ordenador también abarcan aplicaciones en la nube que implementen el procedimiento de la invención.
Estos programas pueden estar dispuestos sobre o dentro de un soporte apto para su lectura, en adelante, "medio portador" o "portador". El medio portador puede ser cualquier entidad o dispositivo capaz de portar el programa. Cuando el programa va incorporado en una señal que puede ser transportada directamente por un cable u otro dispositivo o medio, el medio portador puede estar constituido por dicho cable u otro dispositivo o medio. Como variante, el medio portador podría ser un circuito integrado en el que va incluido el programa, estando el circuito integrado adaptado para ejecutar, o para ser utilizado en la ejecución de, los procesos correspondientes.
A modo de ejemplo, los programas podrían estar incorporados en un medio de almacenamiento, como una memoria ROM, una memoria CD ROM o una memoria ROM de semiconductor, una memoria USB, o un soporte de grabación magnética, por ejemplo, un disco flexible o un disco duro. Alternativamente, los programas podrían estar soportados en una señal portadora transmisible. Por ejemplo, podría tratarse de una señal eléctrica u óptica que podría transportarse a través de cable eléctrico u óptico, por radio o por cualesquiera otros medios.
En este sentido, otro objeto de la invención es un medio de almacenamiento legible por un ordenador que comprende instrucciones de programa capaces de hacer que un ordenador lleve a cabo el procedimiento de la invención. Finalmente, un último objeto de la invención se refiere a una señal transmisible que comprende instrucciones de programa capaces de hacer que un ordenador lleve a cabo el procedimiento de la invención.
Procedimiento de producción de polipéptidos
Otro objeto de la invención es un procedimiento, en adelante "procedimiento de producción de la invención", de síntesis o producción de un polipéptido, polipéptido pseudoancestral, del que han ha evolucionado un conjunto de N polipéptidos determinados, que comprende la obtención previa de la secuencia de dicho polipéptido pseudoancestral mediante el procedimiento de la invención. En una realización particular, dado un conjunto de N polipéptidos actuales, el procedimiento para sintetizar un polipéptido pseudoancestral de los que habrían evolucionado las anteriores, comprende los siguientes pasos:
a) Obtener la secuencia óptima del polipéptido pseudoancestral, S0, obtenida a partir del alineamiento de secuencias de los N polipéptidos.
b) Sintetizar el gen que codifica la secuencia óptima del polipéptido obtenido en el paso anterior
c) Obtener el polipéptido pseudoancestral mediante sobreexpresión heteróloga. Polipéptidos obtenidos por el procedimiento de síntesis de la invención
Otro objeto de la invención se refiere a los polipéptidos pseudoancestrales obtenidos por el procedimiento de síntesis de la invención, en adelante "polipéptidos de la invención". En particular, son objeto de la invención las β-lactamasas pseudoancestrales SecletOOO, SecletOOl , Seclet006 y Seclet012 (con secuencias SEQ ID NO: 1 , SEQ ID NO: 2, SEQ ID NO: 3 y SEQ ID NO: 4, respectivamente), no descritas en el estado de la técnica, y que presentan una alta promiscuidad de sustrato e hiperestabilidad:
SEQ ID NO: 1 (SecletOOO):
MQAEALEALAELERQSGGRLGVAVLDTASGRRIAYRADERFPMCSTFKVMLAAAVLARVDQGQE QLDRRITYSKSDLVNYSPVTEKHVGEGMTVAELCAAAIQYSDNTAA LLLKQIGGPAAVTAFLR SIGDNTTRLDRWEPELNTAIPGDPRDTTTPAAMAASLRRLLLGDALSPASRAQLVAWMMGNKTG DNRIRAGLPAGWRVGDKTGTGDYGTTNDIAVIWPPNRAPIVLAVYFTQSQADAKARDDVIAAVA RIVVAAFLEHHHHHH
SEQ ID NO: 2 (SecletOOl):
MAAEALEALAELERQSGGRLGVAVLDTASGRRIGYRADERFPMCS FKVMLAAAVLARVDQGKE QLDRRI YSKSDLVSYSPVTEKHVGNGMTVAELCAAAIQYSDNTAANLLLKQIGGPAAVTAFLR SIGDDT RLDRWEPELNTAAPGDPRDTT PAAMAATLRRLLLGDALSPASRAQLVEWMMGNKTG DNRIRAGLPAGWRVGDKTGTGDYGTTNDIAVIWPPNRAPIVLAVYFTQSQADAKARDDVIAAVA RIVVAAFLEHHHHHH
SEQ ID NO: 3 (Seclet006):
MAAEALEQLAELEKRSGGRLGVAVLDTATGRRIGYRADERFPMCS FKVLLAAAVLARVDQGKE QLDRRISYSKSDLVSYSPVTEKHVGNGMTVAELCAAAITMSDNTAANLLLKQIGGPAAVTAFLR SIGDDT RLDRREPELNNAAPGDPRDTT PAAMAATLRRLLLGDALSPASRAQLMEWMMGNKTG DNRIRAGLPAGWRVGDKTGSGGYGTTNDIAVIWPPNRAPII IAVYFTQSQADAEARDDVIAAVA RIVVAAFLEHHHHHH
SEQ ID NO: 4 (Seclet012):
MAAEALEQLAELEKQSGGRLGVAVLDTATGRRIGYRGDERFPMCSTFKVLLAAAVLARVDQGKE QLDRRISYSKSDLVSYSPVTEKHVGKGMTVAELCAAAITMSDNTAANLLLKQIGGPAAVTAFLR SIGDNTTRLDRREPELNNAAPGDPRDTTTPAAMAATLRRLLLGDALSPASRAQLMEWMMA KTG DNRLRAGLPAGWRIGDKTGTGGHGTTNDIAVIWPPNRAPI IIAVYFTQSQADAAERDEVIAEVA RAVVEAFLEHHHHHH
También son objeto de la presente invención polipéptidos con una identidad de al menos un 80%, un 85%, un 90%, un 95%, un 98% o un 99% con cualquiera de las secuencias 1 a 4 y en las que dichos polipéptidos poseen similar actividad y características estructurales que las β-lactamasas, en particular, polipéptidos con similar promiscuidad de sustrato e hiperestabilidad.
Estas β-lactamasas pseudoancestrales presentan aplicación en la descontaminación de antibióticos presentes en diferentes medios líquidos relacionados con el consumo humano (por ejemplo, en la leche de vaca [Lee MZ, Richardson T. (1987) Preparation and characterization of immobilized beta-lactamase for destruction of penicillin in milk. J Dairy Sci. 70(10):2032-2039]).
Un cuarto objeto de la invención se refiere a polinucleótidos (de aquí en adelante "polinucleótidos de la invención") que codifican los polipéptidos de la invención. En una realización particular, son objeto de la invención los polinucleótidos que codifican los polipéptidos con una identidad de al menos un 80%, un 85%, un 90%, un 95%, un 98% o un 99% con cualquiera de las secuencias 1 a 4 y en las que el polipéptido codificado por dichos polinucleótidos posee similar actividad y características estructurales que las β-lactamasas, en particular, similar promiscuidad de sustrato e hiperestabilidad.
En una realización más particular, dicho polipéptido tiene actividad enzimática.
Un quinto objeto de la invención se refiere a anticuerpos o fragmentos de los mismos que pueden unirse a polipéptidos con una cualquiera de las secuencias peptídicas mencionadas anteriormente. La invención también se refiere a un vector recombinante, tal como un vector de expresión, que comprende un polinucleótido de la invención operativamente unido a una secuencia reguladora, por ejemplo un promotor; una célula huésped que se transforma con un polinucleótido de la invención; y un procedimiento de producción de un polipéptido con actividad enzimática, que comprende mantener una célula huésped transformada con un polinucleótido de la invención en condiciones para proporcionar la expresión del péptido.
MODO DE REALIZACIÓN DE LA INVENCIÓN
Implementación del procedimiento
Una realización particular de la invención se ha llevado a cabo implementando el procedimiento de la invención en un programa de ordenador compilado en QB64 (Quick Basic 64, un compilador de lenguaje BASIC que es un emisor C++). El programa no sólo calcula la secuencia ancestral hipotética para unas secuencias de partida y longitudes de rama dadas, sino que explora el espacio de las longitudes de rama y encuentra la longitud de rama óptima (o sea, la que maximiza la verosimilitud) para cada secuencia actual dada. Procedimiento para calcular las secuencias de β-lactamasas pseudoancestrales
Para validar el programa, así como la noción en la que se basa, se ha aplicado el procedimiento a un conjunto de 302 secuencias correspondientes a β-lactamasas de diversas proteobacterias (N = 302). Estas secuencias fueron localizadas utilizando el algoritmo BLAST, usando la secuencia de la β-lactamasa de Escherichia coli como molde (Número de Acceso en Genbank 1 BTL). Se genera un alineamiento de las 302 secuencias utilizando Clustal W, y tras el curado del alineamiento se obtiene una longitud L=262.
Utilizando el procedimiento de la invención, se han calculado varias secuencias pseudoancestrales usando diferentes pesos estadísticos (valores comprendidos entre 0 y 1). Entre las variantes calculadas destacan las variantes pseudoancestrales SecletOOO (SEQ ID NO: 1), SecletOOl (SEQ ID NO: 2), Seclet006 (SEQ ID NO: 3), y Seclet012 (SEQ ID NO: 4). Posteriormente, se han preparado en el laboratorio las correspondientes proteínas, adquiriendo en compañías privadas los plásmidos de expresión codificando las correspondientes secuencias génicas optimizadas para su expresión en Escherichia coli (TopGene Technologies). Las enzimas fueron producidas mediante un sistema de expresión heterólogo y purificadas mediante cromatografía de afinidad en un solo paso gracias a la inclusión de una cola de polihistidinas en el extremo carboxilo terminal.
Finalmente, se han comparado sus propiedades con la de la resurrección de laboratorio de la lactamasa correspondiente al ancestro común de las proteobacterias (GNCA, con secuencia SEQ ID NO: 5) que se obtuvo previamente mediante el análisis habitual que implica la construcción de un árbol fiologenético:
SEQ ID NO: 5 (GNCA):
MAAQLSEQLAELEKRSGGRLGVAVLDTATGRRIAYRGDERFPMCSTFKALLAAAVLARVDQGKE RLDRRITYGKEDLVDYSPVTEKHVGDGMTVAELCEAAITLSDNTAANLLLEALGGPAALTAFLR SIGDEV RLDRWEPELNEAAPGDPRDTT PAAMAATLRTLLLGDALSPASRQQLVDWLVA KTG DKRLRAGLPADWRVGDKTGTGGHGTTNDIAVIWPPGRAPIVVTVYLTESQVDADARDAVIAEVG RLVVEAF Esta proteína ancestral resucitada tras construir su árbol filogenético (Número de Acceso en Genbank 4B88) presenta una estabilidad enormemente incrementada y capacidad de catalizar eficazmente la degradación de varios antibióticos (Risso et al., JACS 2013). Es decir, presentó hiperstabilidad y promiscuidad de sustrato, cualidades altamente deseables desde un punto de vista biotecnológico.
Tal y como se recoge en la Tabla 1 , las proteínas preparadas con la metodología propuesta aquí presentan unas propiedades similares, tanto en términos de estabilidad como de catálisis, a la de la proteína ancestral resucitada. Sus secuencias se han obtenido sin embargo, utilizando un procedimiento que no implica la construcción de un árbol filogenético y que no requiere selección arbitraria de un subconjunto de secuencias. Enzima Eficiencia catalítica Eficiencia catalítica Tm (°C)
Bencilpenicilina (s~ μΜ"1) Cefotaxina (s~ μΜ"1)
Tem-1 26±4.7 2.6x10-3±1x10-3 51 .8
GNCA 0.3±0.1 1 .2±0.3 90.3
SecletOOO 1 .2±0.4 0.6±0.1 84.4
SecletOOl 5.4±1 .9 1 .0±0.0 85.0
Seclet006 2.0±0.9 1 .6±0.1 83.9
Tabla
Seclet012 0.8±0.3 1 .1 ±0.3 75.5
Eficiencia catalítica de Las diferentes proteínas analizadas. Tm indica la temperatura media de desnaturalización.

Claims

REIVINDICACIONES
1 . Procedimiento para obtener la secuencia, S0, de un polipéptido pseudoancestral a partir de un alineamiento A = [Α^], i = 1, ... , N; j = \, ... , L de N polipéptidos conocidos, St, S2, ... , SN, que comprende calcular el vector, S0, que maximiza la función de verosimilitud:
V'(So, {ti}) =
Figure imgf000021_0001
t(Si))J (Ec. 1 )
Donde:
· {ti} = {I^ S-L), t( 52), ■■■> t( Sjv)}, siendo t( 5¿) el número de sustituciones de aminoácidos existentes entre S0 y 5¿ .
• P (/ ¿7- |/ o,-, t(Si)) es la probabilidad de observar el aminoácido presente en la posición j de la secuencia S¡, fijados el amino ácido presente en esa posición en la secuencia central, 50 ;
· y w(S1), w(S2), ... , w(SN) son un conjunto de pesos estadísticos.
2. Procedimiento según reivindicación anterior, caracterizado porque las probabilidades, P / ¿7- |/ o,-, t(Si)), se calculan a partir de matrices de sustitución de aminoácidos y frecuencias medias de éstos usando una cadena de Markov de tiempo continuo.
3. Procedimiento según cualquiera de las reivindicaciones anteriores en el que los pesos son iguales a 1 .
4. Programa de ordenador que comprende instrucciones de programa para hacer que un ordenador lleve a la práctica el procedimiento según cualquiera de las reivindicaciones 1 a 3.
5. Programa de ordenador de acuerdo con la reivindicación anterior, que está incorporado en unos medios de almacenamiento.
6. Señal transmisible que comprende instrucciones de programa capaces de hacer que un ordenador según reivindicación 4.
7. Procedimiento de síntesis de un polipéptido a partir del cual ha evolucionado un conjunto de N polipéptidos determinados que comprende la obtención previa de la secuencia de dicho polipéptido mediante el procedimiento de la invención.
8. Procedimiento de producción de un polipéptido a partir del cual ha evolucionado un conjunto de N polipéptidos determinados que comprende los siguientes pasos: a) Obtener la secuencia óptima del polipéptido pseudoancestral, S0, obtenida a partir del alineamiento de secuencias de los N polipéptidos utilizando el procedimiento según reivindicaciones 1 a 3.
b) Sintetizar el gen que codifica la secuencia óptima del polipéptido obtenido en el paso anterior
c) Obtener el polipéptido pseudoancestral mediante sobreexpresion heterologa.
PCT/ES2016/070465 2015-06-19 2016-06-19 Procedimiento para diseñar polipéptidos pseudoancestrales con características mejoradas Ceased WO2016203092A1 (es)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
ESP201530877 2015-06-19
ES201530877A ES2585054B1 (es) 2015-06-19 2015-06-19 Procedimiento para diseñar polipéptidos pseudoancestrales con características mejoradas

Publications (1)

Publication Number Publication Date
WO2016203092A1 true WO2016203092A1 (es) 2016-12-22

Family

ID=56994974

Family Applications (1)

Application Number Title Priority Date Filing Date
PCT/ES2016/070465 Ceased WO2016203092A1 (es) 2015-06-19 2016-06-19 Procedimiento para diseñar polipéptidos pseudoancestrales con características mejoradas

Country Status (2)

Country Link
ES (1) ES2585054B1 (es)
WO (1) WO2016203092A1 (es)

Non-Patent Citations (7)

* Cited by examiner, † Cited by third party
Title
KLEINMAN, C.L. ET AL.: "A maximum likelihood Framework for protein design", BMC BIOINFORMATICS, vol. 7, no. 1, 2006, pages 326, XP021013840 *
MEIER, A ET AL.: "Automatic Prediction of Protein 3D Structures by Probabilistic Multi-template Homology Modeling.", PLOS COMPUT BIOL, vol. 11, no. 10, 23 October 2015 (2015-10-23), pages e1004343, XP055338073 *
MERKI, R. ET AL.: "Ancestral protein reconstruction: techniques and applications", BIOL. CHEM, IN LINE 07/08/2015, vol. 397, pages 1 - 21 *
RISSO, V.A. ET AL.: "Phenotypic comparisons Of consensus variants versus laboratory resurrections of Precambrian proteins", PROTEINS, vol. 82, no. 6, 2014, pages 887 - 896, XP055338068 *
SEMBA, Y. ET AL.: "Ancestral amino acid substitution improves the thermal stability of recombinant lignin peroxidase from white-rot fungi, Phanerochaete chrysosporium strain UAMH 3641", PROTEIN ENGINEERING, DESIGN &SELECTION, vol. 28, no. 7, 2015, pages 221 - 230, XP055338063 *
TOPFER, A. ET AL.: "Probabilistic Inference of Viral Quasispecies Subject to Recombination", JOURNAL OF COMPUTATIONAL BIOLOGY, vol. 20, no. 2, 2013, pages 113 - 123, XP055338069 *
WHELAN, S. ET AL.: "A General Empirical Model Of Protein Evolution Derived from Multiple Protein Families Using a Maximum-Likelihood Approach", MOL. BIOL. EVOL., vol. 18, no. 5, 2001, pages 691 - 699, XP002966700 *

Also Published As

Publication number Publication date
ES2585054B1 (es) 2017-07-11
ES2585054A1 (es) 2016-10-03

Similar Documents

Publication Publication Date Title
Tomaszewski et al. New pathways of mutational change in SARS-CoV-2 proteomes involve regions of intrinsic disorder important for virus replication and release
Frazao et al. Ab initio determination of the crystal structure of cytochrome c6 and comparison with plastocyanin
Lupas et al. On the evolution of protein folds: are similar motifs in different protein folds the result of convergence, insertion, or relics of an ancient peptide world?
Burroughs et al. Anatomy of the E2 ligase fold: implications for enzymology and evolution of ubiquitin/Ub-like protein conjugation
Taylor et al. Filoviruses are ancient and integrated into mammalian genomes
Davies et al. Improved structures of full-length p97, an AAA ATPase: implications for mechanisms of nucleotide-dependent conformational change
Zeke et al. Systematic discovery of linear binding motifs targeting an ancient protein interaction surface on MAP kinases
Carabias et al. Retron-Eco1 assembles NAD+-hydrolyzing filaments that provide immunity against bacteriophages
EP3089989B1 (en) Cas9 crystals and methods of use thereof
Shi et al. The structure of L-aspartate ammonia-lyase from Escherichia coli
Moser et al. Structure of ADP-aluminium fluoride-stabilized protochlorophyllide oxidoreductase complex
Persson et al. Crystal structure analysis of a pentameric fungal and an icosahedral plant lumazine synthase reveals the structural basis for differences in assembly
Tsai et al. Insights into the mechanism and regulation of the CbbQO-type Rubisco activase, a MoxR AAA+ ATPase
Burgess et al. The structure of dynein-c by negative stain electron microscopy
Squeglia et al. Carbohydrate recognition by RpfB from Mycobacterium tuberculosis unveiled by crystallographic and molecular dynamics analyses
Cissé et al. Genomic insights into the host specific adaptation of the Pneumocystis genus
Lynn et al. Molecules illuminate morphology: phylogenomics confirms convergent evolution among ‘oligotrichous’ ciliates
Gelin et al. Screening and in situ synthesis using crystals of a NAD kinase lead to a potent antistaphylococcal compound
Blanquart et al. Resurrection of ancestral malate dehydrogenases reveals the evolutionary history of halobacterial proteins: deciphering gene trajectories and changes in biochemical properties
Zielezinski et al. Massive annotation of bacterial L-asparaginases reveals their puzzling distribution and frequent gene transfer events
Mwinyi et al. The phylogenetic position of Acoela as revealed by the complete mitochondrial genome of Symsagittifera roscoffensis
Kopecky Jr et al. Raman spectroscopy adds complementary detail to the high-resolution X-ray crystal structure of photosynthetic PsbP from Spinacia oleracea
Nordquist et al. Structural and functional characterization of the monomeric U-box domain from E4B
Moreira et al. Evolutionary history of TOPIIA topoisomerases in animals
Kalra et al. Structural, functional and phylogenetic analysis of sperm lysozyme-like proteins

Legal Events

Date Code Title Description
121 Ep: the epo has been informed by wipo that ep was designated in this application

Ref document number: 16811077

Country of ref document: EP

Kind code of ref document: A1

NENP Non-entry into the national phase

Ref country code: DE

WPC Withdrawal of priority claims after completion of the technical preparations for international publication

Ref document number: P201530877

Country of ref document: ES

Date of ref document: 20171215

Free format text: WITHDRAWN AFTER TECHNICAL PREPARATION FINISHED

122 Ep: pct application non-entry in european phase

Ref document number: 16811077

Country of ref document: EP

Kind code of ref document: A1