WO2020161378A2 - Método para diagnosticar o pronosticar el desarrollo de cáncer de próstata en un individuo - Google Patents

Método para diagnosticar o pronosticar el desarrollo de cáncer de próstata en un individuo Download PDF

Info

Publication number
WO2020161378A2
WO2020161378A2 PCT/ES2020/070086 ES2020070086W WO2020161378A2 WO 2020161378 A2 WO2020161378 A2 WO 2020161378A2 ES 2020070086 W ES2020070086 W ES 2020070086W WO 2020161378 A2 WO2020161378 A2 WO 2020161378A2
Authority
WO
WIPO (PCT)
Prior art keywords
seq
att
expression
srsf3
snrnp200
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Ceased
Application number
PCT/ES2020/070086
Other languages
English (en)
French (fr)
Other versions
WO2020161378A3 (es
Inventor
Raúl Miguel LUQUE HUERTAS
Manuel David Gahete Ortiz
Justo P. CASTAÑO FUENTES
Juan Manuel JIMÉNEZ VACAS
André MORÁIS SARMENTO BORGES
Fernando LÓPEZ LÓPEZ
María José REQUENA TAPIA
Enrique GÓMEZ GÓMEZ
Julia CARRASCO VALIENTE
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Universidad de Cordoba
Servicio Andaluz de Salud
Original Assignee
Universidad de Cordoba
Servicio Andaluz de Salud
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Universidad de Cordoba, Servicio Andaluz de Salud filed Critical Universidad de Cordoba
Publication of WO2020161378A2 publication Critical patent/WO2020161378A2/es
Publication of WO2020161378A3 publication Critical patent/WO2020161378A3/es
Anticipated expiration legal-status Critical
Ceased legal-status Critical Current

Links

Classifications

    • CCHEMISTRY; METALLURGY
    • C12BIOCHEMISTRY; BEER; SPIRITS; WINE; VINEGAR; MICROBIOLOGY; ENZYMOLOGY; MUTATION OR GENETIC ENGINEERING
    • C12QMEASURING OR TESTING PROCESSES INVOLVING ENZYMES, NUCLEIC ACIDS OR MICROORGANISMS; COMPOSITIONS OR TEST PAPERS THEREFOR; PROCESSES OF PREPARING SUCH COMPOSITIONS; CONDITION-RESPONSIVE CONTROL IN MICROBIOLOGICAL OR ENZYMOLOGICAL PROCESSES
    • C12Q1/00Measuring or testing processes involving enzymes, nucleic acids or microorganisms; Compositions therefor; Processes of preparing such compositions
    • C12Q1/68Measuring or testing processes involving enzymes, nucleic acids or microorganisms; Compositions therefor; Processes of preparing such compositions involving nucleic acids

Definitions

  • the present invention is within the field of medicine and specifically of oncology, and is directed to a method for early diagnosis and to predict or predict the development of prostatic adenocarcinomas in an individual, to a diagnostic kit or device or forecast.
  • PCa Prostate cancer
  • the methods of diagnosis of this pathology have improved notably in recent years, mainly due to the development of non-invasive techniques (eg analysis of blood levels of prostate specific antigen [PSA] and / or free PSA, as well as urine levels of prostate cancer antigen 3 [PCA3]), the only tool with prognostic capacity, although limited, is still the Gleason scale, which is a system used to measure the degree of aggressiveness of a PCa, calculated from the histological analysis of tumor samples.
  • PSA prostate specific antigen
  • PCA3 prostate cancer antigen 3
  • PSA prostate specific antigen
  • the first therapeutic approach for treating PCa when it is still confined to the prostate, consists of radical prostatectomy, that is, removal of the prosthetic gland and seminal vesicles, eliminating the tumor.
  • hormonal therapy also called androgen deprivation therapy (ADT), which consists of the use of LHRH agonists and antagonists such as leuprolide (Lupron®) and degarelix (Firmagon®), respectively, capable of reducing systemic levels of androgens, key in the development of the prosthetic gland as well as in the pathophysiology of PCa, through the blockade of the hypothalamic-pituitary axis- gonadal.
  • ADT androgen deprivation therapy
  • CaP is extremely heterogeneous and can present as an indolent or aggressive disease. Unfortunately, we do not have biomarkers that predict disease progression at the time of diagnosis. The use of PSA has led the diagnosis of many potentially indolent cancers, and aggressive treatments of these have caused significant morbidity with no clinical benefit in many cases. In contrast, approximately 30% of patients treated with curative intent will experience relapse 5 years after starting treatment, hence the importance of better defining risk groups.
  • the dysregulation of the splicing mechanism could represent one of the bases of the appearance of various tumor pathologies, because the alteration of the expression of numerous alternative splicing variants is associated with the development and increased aggressiveness of these pathologies.
  • AR-v7 an androgen receptor variant characterized by not having a testosterone-binding domain, remaining constitutively active; is one of the main causes of the development of CRPC), as well as SST5TMD4 (variant of the somatostatin receptor SST5, which has only 4 transmembrane domains and is related to greater tumor aggressiveness and the presence of metastasis; it is one of the possible causes of the lack of response of some prostate tumors to treatment with somatostatin analogues), Is In1-ghrelin [ghrelin variant, associated with the regulation of key tumor processes in PCa, such as cell proliferation and migration (Hormaechea-Agulla et al.
  • the splicing process is catalyzed by the minor and major spliceosomes, which act on different types of introns.
  • the spliceosome is a macromolecular complex, whose functional nucleus is composed of several subunits of small nuclear ribonucleoproteins (snRNPs), which interact dynamically to regulate the splicing process.
  • snRNPs small nuclear ribonucleoproteins
  • spliceosome activity is modulated by more than 300 splicing factors (SFs) that specifically recognize certain sequences in exons and introns. Therefore, dysregulation of the expression and / or function of certain components of the spliceosome can lead to aberrant alteration of the normal splicing process.
  • SFs splicing factors
  • the correct function of the splicing machinery that is, the components of the spliceosome and the SFs, is an essential mechanism to maintain homeostasis throughout the body. Therefore, the dysregulations of the splicing process may play an important role as a pathogenic factor and could serve as a predictive marker for the development of CaP.
  • Alternative splicing is emerging as a hallmark in cancer and other pathologies.
  • intron retention could be especially relevant, since the genes that encode key factors associated with its development and progression (for example, androgen receptor, prosthetic-specific antigen, or ghreiin) can undergo this process, resulting in that generates oncogenic variants involved in the development, aggressiveness and response to treatment of CaP.
  • the mRNA levels were determined by quantitative PCR and adjusted with a normalization factor calculated from the constitutive genes B-T ubulin and GAPDH. Results are expressed as Z-Score.
  • the asterisks (*, p ⁇ 0.05; **, p ⁇ 0.01; ***, p ⁇ 0.001) indicate statistically significant differences.
  • SnRNP200, SRSF3 and SRRM1 modulate the proliferation of CaP-derived cells.
  • the results are represented as a percentage of proliferation with respect to cells transfected with control siRNA or Scramble.
  • the asterisks (*, p ⁇ 0.05; ***, p ⁇ 0.001) indicate the values that differ significantly from the control (Scramble).
  • Figure 5 Effects of the silencing of snRNP200, SRSF3 and SRRM1 on the expression levels of the Androgen Receptor (AR), the variant of splicing 7 of the AR (AR-v7) and the ratio between them (AR-v7 / AR ) in the 22Rv1 cell line.
  • AR Androgen Receptor
  • AR-v7 the variant of splicing 7 of the AR
  • AR-v7 / AR the ratio between them
  • the present invention is a tool for the identification of patients with PCa.
  • the creation of the biomarker evaluation models proposed here allows: 1) to discriminate between healthy individuals and individuals with PCa, with high sensitivity and specificity, 2) to clinically stratify individuals based on clinical parameters and the expression of components of the machinery of splicing in cells of prostate tissue; and 3) facilitate the clinical follow-up of these individuals, contributing to the development of personalized medicine.
  • the present invention proposes the standardized evaluation of a panel of biomarkers, in this case related to the splicing machinery, in tissue from individuals.
  • This information would allow, for example, the development of a chip or array for the stratification of patients in various risk groups and the definition of their specific needs for clinical follow-up and therapeutic management.
  • Dysregulation of the process of cutting and splicing mRNA molecules, or splicing is emerging as a hallmark in various pathologies. Specifically in CaP, significant alteration of some components of the spliceosome and splicing factors has been observed.
  • the objective of the present invention has been the identification of certain components of the dysregulated splicing machinery in cells of patients with PCa.
  • the authors of the present invention have identified that the alteration in the expression of certain components of the spliceosome and splicing factors are related to the development of CaP, and may be associated with the increased expression of different protein isoforms of oncogenic character, which contribute to the development and the progression of prostate cancer.
  • snRNP200, SRSF3 and SRRM1 have determined that the overexpression of RNU6, SF3B1, snRNP200, RNU12, ESRP1, ESRP2, MAGOH; SND1, SRSF2, SRSF3 and SRRM1 are associated with tumor aggressiveness.
  • spliceosome components and splicing factors snRNP20Q, ESRP1, ESRP2, RBM45, SND1, SRSF3, SRSF4, SRSF5, SRSF10, SRRM1, and TIA 1 have also been associated with recurrences.
  • snRNP200, SRSF3 and SRRM1 have great potential for their use as a therapeutic target, since they are the only altered factors in all comparisons and their in vitro modulation is associated with tumor aggressiveness.
  • a first aspect of the invention refers to the use of the expression product of the RNU6, SF3B1, snRNP200, RNU12, ESRP1, ESRP2, MAGOH, SND1, SRSF2, SRSF3, SRRM1, RBM45, SRSF4, SRSF5, SRSF10 genes , and / or TIA 1 or any of its combinations, to predict or predict the development of CaP in an individual. Therefore, the expression product of one or more genes can be used for diagnosis, predicting tumor aggressiveness, invasiveness, relapses.
  • RNU6 refers to the gene, factor of the splicing machinery.
  • RNU6 is also defined by a sequence of nucleotides or polynucleotides, which constitutes the sequence of the snRNP "RNU6”, and which would comprise various variants from: a) nucleic acid molecules comprising SEQ ID NO: 1, b) nucleic acid molecules whose complementary strand hybridizes with the polynucleotide sequence of a), c) nucleic acid molecules whose sequence differs from a) and / or b) due to to the degeneration of the genetic code,
  • SF3B1 refers to the gene, which encodes subunit 1 of the complex protein of splicing factor 3b.
  • Splicing factor 3b together with splicing factor 3a and a 12S RNA unit, forms the complex of small nuclear ribonucleoproteins U2 (snRNP U2).
  • the splicing factor 3b / 3a complex binds to the pre-mRNA upstream of the intron branch site in a sequence-independent manner and can anchor the U2 snRNP to the pre-mRNA.
  • the splicing factor 3b is also a component of the minor spliceosome type U12. Alternative splicing results in multiple transcription variants encoding different isoforms.
  • SF3B1 is also defined by a sequence of nucleotides or polynucleotides, which constitutes the sequence of the snRNP "SF3B1", and which would comprise various variants from: a) Nucleic acid molecules that encode a polypeptide comprising the amino acid sequence of SEQ ID NO: 3, b) Nucleic acid molecules whose complementary strand hybridizes with the polynucleotide sequence of a), c) Nucleic acid molecules whose sequence differs from a) and / or b) due to the degeneration of the genetic code, d) nucleic acid molecules that encode a polypeptide comprising the amino acid sequence with an identity of at least 80%, 90%, 95%, 98% or 99% with SEQ ID NO: 3 in the that the polypeptide encoded by said nucleic acids possesses the activity and structural characteristics of the SF3B1 protein.
  • Other possible nucleotide sequences encoding SF3B1 include, but are not
  • SNRNP200 refers to both the human gene and protein, subunit 200 of the small nuclear ribonucleoprotein U5.
  • Pre-mRNA splicing is catalyzed by the spliceosome, a complex of specialized RNA and protein subunits that removes introns from a previously transcribed mRNA segment.
  • the spliceosome consists of small nuclear RNA proteins (snRNPs) U1, U2, U4, U5, and U6, along with approximately 80 conserved proteins.
  • U5 snRNP contains nine specific proteins. This gene encodes one of the snRNP U5 specific proteins.
  • This protein belongs to the DEXH-box family of putative RNA helicases. It is a central component of the U4 / U6-U5 snRNPs and appears to catalyze ATP-dependent unwinding of U4 / U6 RNA duplicates. Mutations in this gene cause autosomal dominant retinitis pigmentosa. Alternatively, spliced transcriptional variants encoding different isoforms have been found, but the full nature of these variants has not been determined.
  • SNRNP200 is also defined by a sequence of nucleotides or polynucleotide, which constitutes the coding sequence of the protein "SNRNP200", and which would comprise various variants from: a) Nucleic acid molecules that encode a polypeptide comprising the amino acid sequence of SEQ ID NO: 5, b) Nucleic acid molecules whose complementary hybrid strand with the polynucleotide sequence of a), c) Nucleic acid molecules whose sequence differs from a) and / or b) due to to the degeneracy of the genetic code, d) nucleic acid molecules that encode a polypeptide comprising the amino acid sequence with an identity of at least 80%, 90%, 95%, 98% or 99% with SEQ ID NO: 5.
  • polypeptide encoded by said nucleic acids possesses the activity and structural characteristics of the SNRNP200 protein.
  • Other possible nucleotide sequences encoding SNRNP200 include, but are not limited to, SEQ ID NO: 4. Gene ID: 23020
  • AGCGTTTCCAGAT CAT G AAT G AAAT CGTCT AT G AAAAAATC ATGG AACAT GCT GG AAAAAAT
  • TCCCTCCT CAAT CAACAACTT CCTATT G AAAGCCAG ATGGTTTC AAAGCTTCCT GACAT GCT
  • RNU12 refers to the small nuclear RNA (snRNP) encoded by this gene that is part of the U12-dependent minor spliceosome complex.
  • this ribonucleoprotein complex consists of snRNPs U11, U12, U5, and U6atac.
  • RNU12 is also defined by a sequence of nucleotides or polynucleotides, which constitutes the sequence of the snRNP “RNU12”, and which would comprise various variants from: a) Nucleic acid molecules comprising SEQ ID NO: 6, b) Nucleic acid molecules whose complementary strand hybrid with the polynucleotide sequence of a), c) Nucleic acid molecules whose sequence differs from a) and / or b) due to the degeneracy of the genetic code,
  • ERPT also called in the literature RBM35A; RMB35A; DFNB109
  • ESPR1 is an epithelial splicing regulator.
  • ESRP1 is also defined by a sequence of nucleotides or polynucleotides, which constitutes the sequence "ESRP1", and which would comprise various variants originating from: a) nucleic acid molecules that encode a polypeptide comprising SEQ ID NO: 7, b) nucleic acid molecules whose Hybrid complementary strand with the polynucleotide sequence of a), c) Nucleic acid molecules whose sequence differs from a) and / or b) due to the degeneracy of the genetic code,
  • ESRP2 refers to both the human gene and protein.
  • ESPR2 is a regulator of epithelial splicing.
  • "ESRP2" is also defined by a sequence of nucleotides or polynucleotides, which constitutes the sequence "ESRP2”, and which would comprise various variants derived from: a) nucleic acid molecules that encode a polypeptide that comprises the amino acid sequence of SEQ ID NO: 9, b) nucleic acid molecules whose complementary strand hybridizes with the polynucleotide sequence of a), c) nucleic acid molecules whose sequence differs from a) and / or b) due to the degeneracy of the genetic code, d) Nucleic acid molecules that encode a polypeptide comprising the amino acid sequence with an identity of at least 80%, 90%, 95%, 98% or 99% with SEQ ID NO: 9 wherein the polypeptide encoded by said nucle
  • AGGGG AG AAAT CT AAAAT AT ATTTT GTTTTTTTTTTTT AAAGACCAT ACTTCCTCATCCT G AGT CAA
  • MAGOH refers to both the human gene and protein. MAGOH subunit of the exon junction complex.
  • MAGOH is also defined by a sequence of nucleotides or polynucleotides, which constitutes the sequence "MAGOH”, and which would comprise various variants derived from: a) Nucleic acid molecules that encode a polypeptide that comprises the amino acid sequence of SEQ ID NO: 1 1, b) Nucleic acid molecules whose complementary strand hybridizes with the polynucleotide sequence of a), c) Nucleic acid molecules whose sequence differs from a) and / or b) due to degeneracy of the genetic code, d) nucleic acid molecules that encode a polypeptide comprising the amino acid sequence with an identity of at least 80%, 90%, 95%, 98% or 99% with SEQ ID NO: 1 1 in which the polypeptide encoded by said nucleic acids possesses
  • SND also called in the literature p100; TDRD11; Vietnamese-SN refers to both the human gene and protein.
  • the SND1 gene encodes a transcriptional coactivator that interacts with the acid domain of Epstein virus nuclear antigen 2 -Barr (EBNA 2), a transcriptional activator that is required for the transformation of B lymphocytes. This protein is also believed to be essential for normal cell growth.
  • EBNA 2 Epstein virus nuclear antigen 2 -Barr
  • SND1 is also defined by a sequence of nucleotides or polynucleotides, which constitutes the sequence "SND1", and which would comprise various variants originating from: a) Nucleic acid molecules that encode a polypeptide comprising the amino acid sequence of SEQ ID NO: 13, b) Molecules of nucleic acid whose complementary strand hybrid with the polynucleotide sequence of a), c) nucleic acid molecules whose sequence differs from a) and / or b) due to the degeneracy of the genetic code, d) molecule nucleic acid lines that encode a polypeptide comprising the amino acid sequence with an identity of at least 80%, 90%, 95%, 98% or 99% with SEQ ID NO: 13 in which the polypeptide encoded by said nucleic acids possesses the activity and the structural characteristics of the SND1 protein.
  • Other possible nucleotide sequences encoding SND1 include, but are not limited to, SEQ ID NO: 13 in which
  • S SF2 refers to both the human gene and protein.
  • the protein encoded by the SRSF2 gene is a member of the serine / arginine (SR) rich family of pre-mRNA splicing factors, which constitute part of the spliceosome. Each of these factors contains an RNA recognition motif (RRM) to bind to RNA and an RS domain to bind to others. proteins.
  • RRM RNA recognition motif
  • the RS domain is rich in serine and arginine residues and facilitates the interaction between different SR splicing factors.
  • SR proteins In addition to being critical for mRNA splicing, SR proteins have also been shown to be involved in mRNA export from the nucleus and in translation. Two transcriptional variants encoding the same protein and a non-coding transcriptional variant for this gene have been found.
  • SRSF2 is also defined by a sequence of nucleotides or polynucleotides, which constitutes the sequence "SRSF2", and which would comprise various variants derived from: a) nucleic acid molecules that encode a polypeptide that comprises the amino acid sequence of SEQ ID NO: 15, b) Nucleic acid molecules whose complementary strand hybridizes with the polynucleotide sequence of a), c) Nucleic acid molecules whose sequence differs from a) and / or b) due to the degeneracy of the genetic code, d) Nucleic acid molecules that encode a polypeptide comprising the amino acid sequence with an identity of at least 80%, 90%, 95%, 98% or 99% with SEQ ID NO: 15 wherein the polypeptide encoded by said nucleic acids possesses the activity and structural characteristics of the SRSF2 protein.
  • Other possible nucleotide sequences encoding SRSF2 include, but are not limited to, SEQ ID NO:
  • SRSF3 also called SFRS3 in the literature; SRp20 refers to both the human gene and protein.
  • the protein encoded by the SRSF2 gene is a member of the serine / arginine (SR) rich family of pre-mRNA splicing factors, which make up part of the spliceosome. Each of these factors contains an RNA recognition motif (RRM) to bind to RNA and an RS domain to bind to other proteins.
  • RRM RNA recognition motif
  • the RS domain is rich in serine and arginine residues and facilitates the interaction between different SR splicing factors.
  • SR proteins In addition to being critical for mRNA splicing, SR proteins have also been shown to be involved in mRNA export from the nucleus and in translation.
  • SRSF3 is also defined by a sequence of nucleotides or polynucleotides, which constitutes the sequence "SRSF3", and which would comprise various variants derived from: a) Nucleic acid molecules that encode a polypeptide that comprises the amino acid sequence of SEQ ID NO: 17, b) Nucleic acid molecules whose hybrid complementary chain with the polynucleotide sequence of a), c) Nucleic acid molecules whose sequence differs from a) and / or b) due to the degeneracy of the genetic code, d) Nucleic acid molecules that they encode a polypeptide comprising the amino acid sequence with an identity of at least 80%, 90%, 95%, 98% or 99% with SEQ ID NO: 17 in which the polypeptide encoded by said nucleic acids possesses the activity and structural characteristics of the SRSF3 protein.
  • SRRM also called in the literature 160-KD; POP101; SRM160 refers to both the human gene and protein.
  • SRRM1 is also defined by a sequence of nucleotides or polynucleotides.
  • SRRM1 which constitutes the sequence "SRRM1"
  • Nucleic acid molecules that encode a polypeptide that comprises the amino acid sequence of SEQ ID NO: 19 b) Nucleic acid molecules whose hybrid complementary chain with the polynucleotide sequence of a), c) Nucleic acid molecules whose sequence differs from a) and / or b) due to the degeneracy of the genetic code, d) Nucleic acid molecules that encode a polypeptide comprising the amino acid sequence with an identity of at least 80%, 90%, 95%, 98% or 99% with the SEQ ID NO: 19 in which the polypeptide encoded by said nucleic acids possesses the activity and structural characteristics of the SRRM1 protein.
  • Other possible nucleotide sequences encoding SRRM1 include, but are not limited to, SEQ ID NO: 18.
  • RNU4 refers to the gene, factor of the splicing machinery.
  • RNU4 is also defined by a sequence of nucleotides or polynucleotides, which constitutes the sequence of the snRNP "RNU4", and which would comprise various variants from: a) Nucleic acid molecules that comprise the SEQ ID NO: 20, b) Nucleic acid molecules whose hybrid complementary chain with the polynucleotide sequence of a), c) Nucleic acid molecules whose sequence differs from a) and / or b) due to the degeneracy of the genetic code,
  • RBM45 (also called in the literature DRB1; RB-1) refers to both the human gene and protein.
  • the RBM45 gene encodes a member of the RNA recognition-type RNA-binding protein family ( RRM). This protein exhibits preferential binding to poly (C) RNA.
  • RBM45 is also defined by a sequence of nucleotides or polynucleotides, which constitutes the sequence "RBM45", and which would comprise various variants from: a) Nucleic acid molecules that encode a polypeptide that comprises the amino acid sequence of SEQ ID NO: 22, b) Nucleic acid molecules whose complementary hybrid strand with the polynucleotide sequence of a), c) Nucleic acid molecules whose sequence differs from a) and / or b) due to the degeneracy of the genetic code, d) Nucleic acid molecules that encode a polypeptide comprising the amino acid sequence with an identity of at least 80%, 90%, 95% , 98% or 99% with SEQ ID NO: 22 in which the polypeptide encoded by said nucleic acids possesses the activity and the structural characteristics of the RBM45 protein.
  • Other possible nucleotide sequences encoding RBM45 include, but are not limited to, SEQ ID NO: 21.
  • SRSF4 also called SFRS4 in the literature; SRP75 refers to both the human gene and protein.
  • the SRSF4 gene encodes a member of the arginine / serine rich splicing factor family.
  • "SRSF4" is also defined by a sequence of nucleotides or polynucleotides, which constitutes the sequence "SRSF4", and which would comprise various variants derived from: a) Nucleic acid molecules that encode a polypeptide that comprises the amino acid sequence of SEQ ID NO: 24, b) Nucleic acid molecules whose complementary strand hybridizes with the polynucleotide sequence of a), c) Nucleic acid molecules whose sequence differs from a) and / or b) due to the degeneracy of the genetic code, d) Nucleic acid molecules that encode a polypeptide comprising the amino acid sequence with an identity of at least 80%, 90%, 95%, 98% or 99% with SEQ ID NO:
  • SRSF5' also called in the literature HRS; SFRS5; SRP40 refers to both the human gene and protein.
  • the protein encoded by the SRSF4 gene is a member of the serine / arginine (SR) rich family of pre-mRNA splicing factors, which make up part of the spliceosome. Each of these factors contains an RNA recognition motif (RRM) to bind to RNA and an RS domain to bind to other proteins.
  • RRM RNA recognition motif
  • the RS domain is rich in residues of serine and arginine and facilitates the interaction between different SR splicing factors.
  • SRSF5 is also defined by a sequence of nucleotides or polynucleotides, which constitutes the sequence "SRSF5", and which would comprise various variants from: a) Nucleic acid molecules that encode a polypeptide comprising the amino acid sequence of SEQ ID NO: 26, b) Nucleic acid molecules whose complementary hybrid strand with the polynucleotide sequence of a ), c) Nucleic acid molecules whose sequence differs from a) and / or b) due to the degeneracy of the genetic code, d) Nucleic acid molecules that encode a polypeptide comprising the amino acid sequence with an identity of at least 80% , 90%, 95%, 98% or 99% with SEQ ID NO: 26 in which the polypeptide encoded by said nucleic acids possesses the activity and structural characteristics of the SRSF5 protein.
  • Other possible nucleotide sequences encoding SRSF5 include, but are not limited to, SEQ ID NO: 25.
  • SRSF10 refers to both the gene and the human protein.
  • the SRSF10 gene is a member of the serine / arginine (SR) rich family that are involved in constitutive and regulated RNA splicing. Members of this family are characterized by the N-terminal RNP1 and RNP2 motifs, which are necessary for RNA binding, and multiple C-terminal SR / RS repeats, which are important in mediating association with other cellular proteins.
  • SRSF10 is also defined by a sequence of nucleotides or polynucleotides, which constitutes the sequence "SRSF10", and which would comprise various variants derived from: a) Nucleic acid molecules that encode a polypeptide that comprises the amino acid sequence of SEQ ID NO: 28, b) Nucleic acid molecules whose hybrid complementary chain with the polynucleotide sequence of a), c) Nucleic acid molecules whose sequence differs from a) and / or b) due to the degeneracy of the genetic code, d) Nucleic acid molecules that they encode a polypeptide comprising the amino acid sequence with an identity of at least 80%, 90%, 95%, 98% or 99% with SEQ ID NO: 28 wherein the polypeptide encoded by said nucleic acids possesses the activity and structural characteristics of the SRSF10 protein.
  • Other possible nucleotide sequences encoding SRSF10 include, but are not limited to, SEQ ID NO: 27.
  • TIA T also called in the literature TIA-1, WDM refers to both the human gene and protein.
  • the product encoded by the TIA 1 gene is a member of a family of RNA-binding proteins and possesses nucleolytic activity against target cells of cytotoxic lymphocytes (CTL) It has been suggested that this protein may be involved in the induction of apoptosis, since it preferentially recognizes poly (A) homopolymers and induces DNA fragmentation in CTL targets.
  • CTL cytotoxic lymphocytes
  • TIA 1 is also defined by a sequence of nucleotides or polynucleotides, which constitutes the sequence "TIA 1", and which would comprise various variants derived from: a) Nucleic acid molecules that encode a polypeptide comprising the amino acid sequence of SEQ ID NO: 30, b) Nucleic acid molecules whose complementary hybrid strand with the polynucleotide sequence of a), c) Nucleic acid molecules whose sequence differs from a) and / or b) due to the degeneracy of the genetic code, d) Nucleic acid molecules that encode a polypeptide comprising the amino acid sequence with an identity of at least 80%, 90%, 95%, 98% or a 99% with SEQ ID NO: 30 in which the polypeptide encoded by said nucleic acids possesses the activity and structural characteristics of the TIA 1 protein.
  • SEQ ID NO: 30 is, but is not limited to, SEQ ID NO:
  • CAAAAGAAAG ATACAAGC AAT CATTTCCATGTCTTT GTT GGTG AT CT CAGCCC AG AAATT AC
  • another aspect of the invention refers to a method for obtaining useful data to diagnose, predict or predict the development of CaP in an individual, hereinafter the first method of the invention, which comprises the following steps: a) Determine the levels of the expression product of the RNU6, SF3B1, snRNP200, RNU12, ESRP1, ESRP2, MAGOH, SND1, SRSF2, SRSF3, SRRM1, RNU4, RBM45, SRSF4, SRSF5, SRSF10 genes, and / or any of their TIA1 or TIA1 combinations, in an ex vivo biological sample of said individual, b) Compare the levels obtained in the previous step with the standards.
  • the expression product levels of all genes are determined simultaneously.
  • biological sample refers to, but is not limited to, cells, tissues and / or biological fluids of an organism, obtained by any method known to a person skilled in the art; that is, any one selected from the group of body fluids or cells, or from a cell extract or the cell culture supernatant of said cells, and / or liquid biopsy (blood, serum, plasma, urine, ).
  • sample is a fabric.
  • the term “individual” in this specification is synonymous with “patient”, and is not intended to be limiting in any respect, and it may be of any age, sex and physical condition.
  • the expression levels of the genes will give a certain profile of gene expression.
  • level “expression level”, also called “gene product quantity” refers to the biochemical material, be it RNA or protein, resulting from the expression of a gene. Sometimes a measure of the amount of gene product is used to infer how active a gene is.
  • gene expression profile is understood the gene profile obtained after quantifying the mRNA and / or protein produced by the genes of interest or biomarkers, that is, by the genes used as biological markers in the present invention, in a sample isolated biological.
  • the gene expression profile is preferably carried out by determining the level of mRNA derived from their transcription, after extracting the total RNA present in the isolated biological sample, which can be carried out using protocols known in the state of the art.
  • the determination of the level of mRNA derived from the transcription of the genes used as biological markers in the present invention can be carried out, for example, but not limited to, by amplification by polymerase chain reaction (PCR), reverse transcription in combination with the polymerase chain reaction (RT-PCR), quantitative RT-PCR (qPCR), reverse transcription in combination with ligase chain reaction (RT-LCR), or any other nucleic acid amplification method; serial analysis of gene expression (SAGE, SuperSAGE); DNA chips made from oligonucleotides deposited by any mechanism; DNA microarrays made with oligonucleotides synthesized in situ by photolithography or any other mechanism; in situ hybridization using specific probes labeled with any labeling method; using electrophoresis gels; by membrane blotting and hybridization with a specific probe; by nuclear magnetic resonance or any other diagnostic imaging technique using paramagnetic nanoparticles or any other type of detectable nanoparticles functionalized with antibodies or by any other means.
  • PCR polymerase chain reaction
  • the gene expression profile could also be obtained through the detection and / or quantification of the proteins produced by the translation of the mRNA derived from the transcription of the genes used as biological markers in the present invention, for example, but not limited to, immunodetection by western blot.
  • the quantitative detection of the expression of the genes used as biological markers in the present invention can more preferably be carried out by means of real-time PCR (RT-PCR or RTqPCR).
  • the real-time detection of the amplified products can be carried out by using fluorescent molecules that are intercalated in the double-stranded DNA or by hybridization with different types of probes.
  • the detection of the protein levels or the expression level of the genes can be made by any of the techniques known to the person skilled in the art.
  • Steps (b) and / or (c), of the method described above can be fully or partially automated, for example, by means of a robotic sensor equipment for detecting the presence in step (b) or computerized classification in step (c).
  • step (b) is carried out by PCR, preferably RT-PCR.
  • the protein level or levels are detected, it can be done, as in the case of genes, by any of the techniques known to those skilled in the art.
  • the detection of the expression levels is carried out by an immunological technique.
  • the immunological techniques are based on precipitation reactions, agglutination, immunostaining, radioimmunoassay and radioimmunometric techniques, preferably ELISA (Enzyme Linked ImmunoadSorbent Assay), or Western blot or in any of their combinations.
  • ELISA Enzyme Linked ImmunoadSorbent Assay
  • another aspect of the invention refers to a method for diagnosing, predicting or predicting the development of CaP in an individual, hereinafter the second method of the invention, comprising steps (a) and (b) of the first method of the invention, and further comprises:
  • (c) include individuals with higher expression of the factors RNU6, SF3B1, snRNP200, RNU12, ESRP1, ESRP2, MAGOH; SND1, SRSF2, SRSF3, SRRM1, RNU4, RBM45, SRSF4, SRSF5, SRSF10, and / or TIA1, or any of their combinations, with respect to a reference sample, in the group of individuals with the highest probability of developing PCa.
  • a “reference sample”, as used herein, means a sample obtained from a group of healthy subjects who do not have a particular disease state or phenotype.
  • Appropriate reference levels of gene expression can be determined by measuring the expression levels of such genes in various suitable subjects, and those reference levels can be adjusted to specific populations (for example, a reference level can be age-related, so that comparisons can be made between expression levels in samples of subjects of a certain age and reference levels for a particular disease, phenotype, or lack thereof in a given age group ).
  • the reference sample is obtained from adjacent prostate tissue not tumor.
  • the type of reference sample may vary depending on the specific method to be performed.
  • the expression profile of the genes in the reference sample can preferably be generated from a population of two or more people.
  • the population for example, can contain 3, 4, 5, 10, 15, 20, 30, 40, 50 or more people.
  • the expression profile of the genes in the reference sample and in the sample of the person to be diagnosed according to the methods of the present invention can be generated from the same person, provided that the profiles are analyzed and the reference profile are generated from biological samples taken at different times and compared with each other. For example, a sample from an individual can be obtained at the beginning of a study period. A reference biomarker profile from this sample can be compared to biomarker profiles generated from subsequent samples from the same person.
  • the reference sample is a set of samples from various individuals.
  • the expression of a gene is considered increased in a sample of the subject under study when the levels of increase with respect to the reference sample are at least 5%, at least 10%, at least 15%, by at least 20%, at least 25%, at least 30%, at least 35%, at least 40%, at least 45%, at least 50%, at least 55 %, at least 60%, at least at least 65%, at least 70%, at least 75%, at least 80%, at least 85%, at least 90 %, at least 95%, at least 100%, at least 10%, at least 120%, at least 130%, at least 140%, at least 150%, or more.
  • the expression of a gene is considered decreased when its levels decrease with respect to the reference sample by at least 5%, at least 10%, at least 15%, at least 20%, by at least 25%, at least 30%, at least 35%, at least 40%, at least 45%, at least 50%, at least 55%, at least the 60%), at least 65%, at least 70%, at least 75%, at least 80%, at least 85%, at least 90%, at least 95 %, at least 100% (that is, absent).
  • kit or device comprising the elements necessary to detect the expression levels of snRNP200, SRSF3 and / or SRRM1, or any of their combinations, and where: -
  • the primers or primers are polynucleotide sequences of between 10 and 30 base pairs, more preferably between 15 and 25 base pairs, even more preferably between 18 and 22 base pairs, and still much more preferably around 20 base pairs, having an identity of at least 80%, more preferably at least 90%, still more preferably at least 95%, still much more preferably at least 98%, and particularly 100 %, with a fragment of the sequences complementary to SEQ ID N ° 1 (RNU6), SEQ ID N °: 2 (SFR3B1), SEQ ID N ° 4 (SNRNP200), SEQ ID N ° 6 (RNU12), SEQ ID 7 (ESRP1), SEQ ID No.
  • the probes are polynucleotide sequences of between 80 and 1100 base pairs, more preferably between 100 and 1000 base pairs, and even more preferably between 200 and 500 base pairs, exhibiting an identity of at least 80% , more preferably at least 90%, even more preferably at least 95%, still much more preferably at least 98%, and particularly 100%, with a fragment of the sequences complementary to SEQ ID N 1 (RNU6), SEQ ID N °: 2 (SFR3B1), SEQ ID N ° 4 (SNRNP200), SEQ ID N ° 6 (RNU12), SEQ ID N ° 7 (ESRP1), SEQ ID N ° 8 (ESRP2 ), SEQ ID No. 10 (MAGOH), SEQ ID No.
  • SND1 SEQ ID No. 14
  • SEQ ID No. 16 SEQ ID No. 16
  • SEQ ID No. 18 SEQ ID No. 18
  • SEQ ID No. 20 RNU4
  • SEQ ID No. 21 RNU4
  • SEQ ID No. 21 RNU4
  • SEQ ID No. 21 RNU4
  • SEQ ID No. 21 RNU4
  • SEQ ID No. 21 RNU4
  • SEQ ID No. 21 RNU4
  • SEQ ID No. 21 RNU4
  • SEQ ID No. 21 RNU4
  • SEQ ID No. 21 RNU4
  • SEQ ID No. 21 RNU4
  • SEQ ID No. 21 RNU4
  • SEQ ID No. 21 RNU4
  • SEQ ID No. 21 RNU4
  • SEQ ID No. 21 RNU4
  • SEQ ID No. 21 RNU4
  • SEQ ID No. 21 RNU4
  • SEQ ID No. 21 RNU4
  • SEQ ID No. 21 RNU4
  • SEQ ID No. 21
  • Antibodies are capable of specifically binding to a region formed by any of the amino acid sequences SEQ ID N °: 3 (SFR3B1), SEQ ID N ° 5 (SNRNP200), SEQ ID N ° 9 (ESRP2), SEQ ID N ° 1 1 (MAGOH), SEQ ID No. 13 (SND1), SEQ ID No. 15 (SRSF2), SEQ ID No. 17 (SRSF3), SEQ ID No. 19 (SRRM1), SEQ ID No. 22 (RBM45) , SEQ ID No. 24 (S RSF4), SEQ ID No. 26 (S RSF5), SEQ ID No. 28 (S RSF10), SEQ ID No. 30 (TIA 1),
  • the primers, probes or antibodies are modified or labeled, for example, but not limited to, by radioactive or immunological labeling.
  • the oligonucleotides present modifications in some of their nucleotides, such as, for example, but not limited to, nucleotides that have some of their atoms with a radioactive isotope, usually or immunologically labeled nucleotides, such as with a digoxigenin molecule, and / or immobilized on a membrane.
  • modifications in some of their nucleotides, such as, for example, but not limited to, nucleotides that have some of their atoms with a radioactive isotope, usually or immunologically labeled nucleotides, such as with a digoxigenin molecule, and / or immobilized on a membrane.
  • a radioactive isotope usually or immunologically labeled nucleotides, such as with a digoxigenin molecule, and / or immobil
  • Another aspect of the invention relates to a computer program comprising instructions for carrying out the procedure according to any of the methods of the invention.
  • the invention encompasses computer programs arranged on or within a carrier.
  • the carrier can be any entity or device capable of supporting the program.
  • the carrier could be an integrated circuit in which the program is included and which has been adapted to execute, or to be used in the execution of the corresponding processes.
  • the programs could be embedded in a storage medium, such as a ROM memory, a CD ROM memory or a semiconductor ROM memory, a USB memory stick, or a magnetic recording medium, for example a floppy disk or a disk. Lasted.
  • the programs could be supported on a transmittable carrier signal; for example, it could be an electrical or optical signal that could be transported via electrical or optical cable, by radio or by any other means.
  • the invention also extends to computer programs adapted so that any processing means can carry out the methods of the invention.
  • Computer programs also encompass cloud applications based on this procedure.
  • FFPE formalin-fixed and paraffin-embedded
  • the high expression of a series of factors was associated with the presence of perineural invasion and / or lymphovascular, as well as clinically significant CaP, that is, CaP with a Gleason score greater than or equal to 7 (Table 1).
  • the high expression of 1 1 spliceosome components and splicing factors was associated with the subsequent development of CaP recurrences. (Fig 2A), suggesting a possible role for these factors (individually or together) as tumor prognostic markers for PCa.
  • the combined expression levels of these 1 1 genes drew a ROC curve with an area under the curve of 0.806 to differentiate between samples of patients who will relapse and patients who will not (Fig 2B).
  • snRNP200, SRSF3 and SRRM1 were the only factors that were significantly and consistently altered in all the comparisons carried out in this study (Fig 1A, Fig 2B, Table 1), indicating the high importance of these three factors in pathophysiology. of CaP and thus defining a possible utility as novel therapeutic targets for this pathology. Therefore, these three factors were selected for further study.

Landscapes

  • Chemical & Material Sciences (AREA)
  • Organic Chemistry (AREA)
  • Life Sciences & Earth Sciences (AREA)
  • Zoology (AREA)
  • Wood Science & Technology (AREA)
  • Proteomics, Peptides & Aminoacids (AREA)
  • Health & Medical Sciences (AREA)
  • Engineering & Computer Science (AREA)
  • Microbiology (AREA)
  • Immunology (AREA)
  • Physics & Mathematics (AREA)
  • Molecular Biology (AREA)
  • Biotechnology (AREA)
  • Biophysics (AREA)
  • Analytical Chemistry (AREA)
  • Biochemistry (AREA)
  • Bioinformatics & Cheminformatics (AREA)
  • General Engineering & Computer Science (AREA)
  • General Health & Medical Sciences (AREA)
  • Genetics & Genomics (AREA)
  • Measuring Or Testing Involving Enzymes Or Micro-Organisms (AREA)

Abstract

Biomarcadores, método, kit de diagnóstico y usos para diagnosticar, predecir o pronosticar el desarrollo de cáncer de próstata (CaP) en un individuo.

Description

Método para diagnosticar o pronosticar el desarrollo de cáncer de próstata en un individuo
CAMPO DE LA INVENCIÓN
La presente invención se encuentra dentro del campo de la medicina y en concreto de la oncología, y está dirigida a un método para el diagnóstico temprano y para predecir o pronosticar el desarrollo de adenocarcinomas prostáticos en un individuo, a un kit o dispositivo de diagnóstico o pronóstico.
ANTECEDENTES DE LA INVENCIÓN
El cáncer de próstata (CaP) se considera uno de los problemas médicos más importantes a los que se enfrenta la población masculina. De hecho, en algunos países occidentales es la neoplasia sólida más frecuente, superando en número al cáncer de pulmón y colorrectal. Además, representa la quinta causa de muerte por cáncer en este colectivo en todo el mundo.
En general se estima que en 2018 hubo 3,91 millones de casos nuevos de cáncer (excluyendo el cáncer de piel no melanoma) y 1 ,93 millones de muertes por cáncer en Europa. Los tumores más comunes fueron los cánceres de mama (523,000 casos), seguidos de colorrectal (500,000), cáncer de pulmón (470,000) y próstata (450,000). Estos cuatro cánceres representan la mitad de la carga total de cáncer en Europa. Las tasas de incidencia del cáncer de próstata varían cinco veces (37-189 por 100,000), con las tasas más altas estimadas en el norte y el oeste de Europa, incluyendo Irlanda (189.3), Estonia (162.4), Noruega (157.3) y Francia (144.9). (Ferlay et al. Cáncer incidence and mortality patterns in Europe: Estimates for 40 countríes and 25 major cancers in 2018. European Journal of Cáncer, 2018-1 1-01).
Aunque los métodos de diagnóstico de esta patología han mejorado notablemente en los últimos años, debido principalmente al desarrollo de técnicas no invasivas (p.ej. análisis de los niveles sanguíneos del antígeno prostático específico [PSA] y/o PSA libre, así como de los niveles en orina del antígeno 3 del cáncer de próstata [PCA3]), la única herramienta con capacidad pronostica, aunque limitada, sigue siendo la escala de Gleason, que es un sistema que se emplea para medir el grado de agresividad de un CaP, calculado a partir del análisis histológico de muestras tumorales. La escala de Gleason clasifica los tumores de próstata en 5 grupos: Grado 1 o puntuación de Gleason de 6 o menos (cáncer de bajo grado); Grado 2 o puntuación de l Gleason de 3 + 4 = 7 (cáncer de mediano grado); Grado 3 o puntuación de Gleason de 4 + 3 = 7 (cáncer de mediano grado); Grado 4 o puntuación de Gleason de 8 (cáncer de grado alto); grado 5 o puntuación de Gleason de 9 a 10 (cáncer de grado alto).
El marcador más usado en el diagnóstico del CaP y en la monitorización del tratamiento es el antígeno prostático específico (PSA), pero tiene sus limitaciones. En términos de marcador diagnóstico, el PSA presenta una especificidad baja (33%). Una mejora en el diagnóstico con marcadores de cribado más específicos, evitaría un gran número de biopsias de próstata innecesarias y constituiría, a su vez, una prueba diagnóstica menos invasiva. El PSA tiene, además, poco valor como biomarcador de pronóstico.
Por otra parte, la primera aproximación terapéutica para el tratamiento del CaP, cuando este se encuentra aún confinado en la próstata, consiste en la prostatectomía radical, es decir, extirpación de la glándula prostética y las vesículas seminales, eliminando el tumor. Sin embargo, para el tratamiento de recidivas o de tumores con elevada agresividad en el momento del diagnóstico se procede a la terapia hormonal, también llamada terapia de deprivación androgénica (ADT), la cual consiste en el uso de agonistas y antagonistas de LHRH como la leuprolida (Lupron®) y el degarelix (Firmagon®), respectivamente, capaces de reducir los niveles sistémicos de andrógenos, claves en el desarrollo de la glándula prostética así como en la fisiopatología del CaP, a través del bloqueo del eje hipotalámico-hipofisario-gonadal. Por último, los pacientes que desarrollan tumores que se vuelven resistentes a la ADT y que, por tanto, sufren el fenotipo más agresivo de esta enfermedad o CaP resistente a la castración (CPRC), se tratan con novedosos fármacos como son la abiraterona (Zytiga®), capaz de reducir la producción exotesticular e intratumoral de testosterona, y el anti-andrógeno enzalutamida (Xtandi®), el cual antagoniza el receptor de andrógenos (AR), evitando así su señalización. Sin embargo, estos fármacos no son todo lo efectivos que se desearía, ya que un importante porcentaje de los casos se vuelven resistentes a las mismos, adquiriendo los pacientes, por tanto, un pronóstico devastador. Por tanto, es evidente que es necesario el desarrollo de estrategias terapéuticas para combatir el CaP de forma global y más efectiva, algo que pasa por el descubrimiento de nuevas dianas terapéuticas.
El CaP es extremadamente heterogéneo y puede presentarse como una enfermedad indolente o agresiva. Desafortunadamente, no disponemos de biomarcadores que predigan la progresión de la enfermedad en el momento del diagnóstico. El uso del PSA ha liderado el diagnóstico de muchos cánceres potencialmente indolentes, y los tratamientos agresivos de estos han causado una significativa morbilidad sin beneficio clínico en muchos casos. Por el contrario, aproximadamente un 30% de los pacientes tratados con intención curativa van a experimentar recaída a los 5 años de iniciado el tratamiento, de ahí la importancia de definir mejor los grupos de riesgo.
En este sentido, se ha propuesto recientemente que la desregulación del mecanismo de splicing podría representar una de las bases de la aparición de diversas patologías tumorales, debido a que la alteración de la expresión de numerosas variantes de splicing alternativo se asocia con el desarrollo y el aumento de la agresividad de estas patologías. En concreto, diversos estudios han demostrado el papel determinante que juegan ciertas variantes de splicing en CaP, entre las cuales destacan AR-v7 (variante del receptor de andrógenos caracterizada por no poseer dominio de unión a la testosterona, permaneciendo activo de forma constitutiva; es una de las principales causas del desarrollo del CPRC), así como SST5TMD4 (variante del receptor de somatostatina SST5, que posee solo 4 dominios transmembrana y se relaciona con una mayor agresividad tumoral y con presencia de metástasis; es una de las posibles causas de la falta de respuesta de algunos tumores de próstata al tratamiento con análogos de somatostatina), Is In1- ghrelina [variante de la ghrelina, asociada con la regulación de procesos tumorales claves en el CaP, tales como la proliferación y migración celular (Hormaechea-Agulla et al. The oncogenic role of the In1-ghrelin splicing variant in prostate cáncer aggressiveness. Molecular Cáncer, 2017)], el KLF6-SV1 [variante del gen KLF6 que presenta efectos antagónicos con respecto a la variante canónica, incrementando la agresividad tumoral y disminuyendo la apoptosis (DiFeo et al. The role of KLF6 and its splice variants in cáncer therapy. Drug Resistance Updates, 2009)] y OPNb y OPNc [variantes del gen SPP1/OPN que actúan promoviendo la progresión tumoral del CaP a través de la activación de la vía PI3K (Tilli et al. Both osteopontin-c and osteopontin-b splicing isoforms exert pro-tumorigenic roles in prostate cáncer cells. The Prostate, 2012)].
El proceso de splicing es catalizado por los spliceosomas menor y mayor, que actúan sobre diferentes tipos de intrones. El spliceosoma es un complejo macromolecular, cuyo núcleo funcional está compuesto por varias subunidades de pequeñas ribonucleoproteínas nucleares (snRNPs), que interactúan dinámicamente para regular el proceso de splicing. Además, la actividad del spliceosoma está modulada por más de 300 factores de splicing (SFs) que reconocen específicamente ciertas secuencias en exones e intrones. Por lo tanto, la desregulación de la expresión y/o función de ciertos componentes del spliceosoma puede conducir a la alteración aberrante del proceso normal de splicing. De hecho, la función correcta de la maquinaria de splicing, es decir, ios componentes del spliceosoma y ios SFs, es un mecanismo esencial para mantener la homeostasis de todo el cuerpo. Por lo tanto, las desregulaciones del proceso de splicing pueden jugar un papel importante como factor patógeno y podrían servir como un marcador predictivo del desarrollo de CaP. El splicing alternativo está emergiendo como un sello distintivo en el cáncer y otras patologías. En particular, en el CaP, la retención de intrones podría ser especialmente relevante, ya que ios genes que codifican factores clave asociados con su desarrollo y progresión (por ejemplo, receptor de andrógenos, antígeno prostético específico o ghreiina) pueden experimentar este proceso, lo que genera variantes oncogénicas involucradas en el desarrollo, la agresividad y respuesta al tratamiento de CaP.
Por todo esto, podría ser de utilidad la caracterización del perfil molecular de la maquinaria de splicing en pacientes con sospecha de CaP, de forma que pudiera servir también como herramienta para predecir el desarrollo futuro de CaP en dichos pacientes.
DESCRIPCIÓN DE LAS FIGURAS
Figura 1. Niveles de expresión de 26 genes que codifican componentes de la maquinaria de splicing y que se encuentran desregulados en CaP (n=84) con respecto a la zona no tumoral adyacente (n=84). Los niveles de ARNm se determinaron por PCR cuantitativa y se ajustaron con un factor de normalización calculado a partir de los genes constitutivos B-T ubulina y GAPDH . Los resultados se expresan como Z-Score. Los asteriscos (*, p<0.05; **, p<0.01 ; ***, p<0.001) indican diferencias estadísticamente significativas. B) Curvas ROC que muestran la sensibilidad, especificidad y el área bajo la curva de distintas combinaciones de la expresión de hasta 26 componentes de la maquinaria de splicing y factores asociados para diferenciar entre muestras de CaP y sus respectivas regiones adyacentes no tumorales.
Figura 2. Relación de la expresión de 11 componentes de la maquinaria de splicing y factores asociados en la zona tumoral de muestras fijadas en parafina (n=84) con el desarrollo de recidivas de CaP. A) Comparación entre los niveles de expresión de componentes de la maquinaría de splicing en muestras de CaP derivadas de pacientes que desarrollan recidivas de CaP (n=23) y pacientes que no las desarrollan (n=57). Los niveles de ARNm se determinaron por PCR cuantitativa y se ajustaron con un factor de normalización calculado a partir de los genes constitutivo B-Tubulina y GAPDH. Los asteriscos (*, p<0.05; **, p<0.01 ; ***, p<0.001) indican diferencias estadísticamente significativas. B) Curvas ROC que muestran la sensibilidad, especificidad y el área bajo la curva de distintas combinaciones de la expresión de 1 1 componentes de la maquinaria de splicing y factores asociados para diferenciar entre pacientes que desarrollarán recidivas de CaP y pacientes que no las desarrollarán.
Figura 3. Relación de la expresión de snRNP200, SRSF3 y SRRM1 con parámetros clínicos y moleculares de agresividad del CaP. Asociación entre los niveles de expresión de snRNP200, SRSF3 y SRRM1 en muestras frescas de CaP (n=42) y la presencia y tipo de metástasis (A), así como una puntuación de Gleason mayor o igual a 8 (B). El asterisco (*, p<0.05) indica diferencias estadísticamente significativas. Correlación entre los niveles de expresión de snRNP200, SRSF3 y SRRM 1 y el grado de Gleason (C), expresión de PSA (D), AR (E) y AR-v7 (F) y el ratio de la expresión de AR-v7 y AR (G). Se indica el p-valor (p) y el coeficiente de la correlación de Pearson y Spearman (R; dependiendo si los datos siguen o no una distribución normal).
Figura 4. SnRNP200, SRSF3 y SRRM1 modulan la proliferación de células derivadas de CaP. Tasa de proliferación de las células 22Rv1 (A) y DU145 (B) a 24, 48 y 72 h, en respuesta al silenciamiento de snRNP200, SRSF3 y SRRM1 mediante siRNAs específicos. Los resultados se representan como porcentaje de proliferación con respecto a las células transfectadas con siRNA control o Scramble. Los asteriscos (*, p<0.05; ***, p<0.001) indican los valores que difieren significativamente del control (Scramble).
Figura 5. Efectos del silenciamiento de snRNP200, SRSF3 y SRRM1 sobre los niveles de expresión del Receptor de Andrógenos (AR), de la variante de splicing 7 del AR (AR-v7) y del ratio entre los mismos (AR-v7/AR) en la línea celular 22Rv1. Los asteriscos (*, p<0.05; **, p<0.01 ; ***, p<0.001) indican que los valores difieren
DESCRIPCIÓN DE LA INVENCIÓN
La presente invención supone una herramienta para la identificación de pacientes con CaP. La creación de los modelos de evaluación de los biomarcadores aquí propuestos permite: 1) discriminar entre individuos sanos e individuos con CaP, con elevada sensibilidad y especificidad, 2) estratificar clínicamente los individuos en base a parámetros clínicos y la expresión de componentes de la maquinaria de splicing en células de tejido prostático; y 3) facilitar el seguimiento clínico de estos individuos, contribuyendo al desarrollo de una medicina personalizada.
La presente invención propone la evaluación estandarizada de un panel de biomarcadores, en este caso relacionados con la maquinaria de splicing, en tejido de individuos. Esta información permitiría, por ejemplo, el desarrollo de un chip o array para la estratificación de pacientes en diversos grupos de riesgo y la definición de sus necesidades específicas de seguimiento clínico y manejo terapéutico. La desregulación del proceso de corte y splicing de moléculas de ARNm, o splicing, está emergiendo como un sello distintivo en diversas patologías. Específicamente en el CaP se ha observado la alteración significativa de algunos componentes del spliceosoma y factores de splicing.
El objetivo de la presente invención ha sido la identificación de ciertos componentes de la maquinaria de splicing desregulados en células de pacientes con CaP.
Los autores de la presente invención han identificado que la alteración en la expresión de ciertos componentes del spliceosoma y factores de splicing están relacionados con el desarrollo de CaP, pudiendo asociarse al aumento de expresión de diferentes isoformas proteicas de carácter oncogénico, que contribuyen en el desarrollo y la progresión de cáncer de próstata.
Concretamente, los autores han determinado que la sobreexpresión de RNU6, SF3B1, snRNP200, RNU12, ESRP1, ESRP2, MAGOH; SND1, SRSF2, SRSF3 y SRRM1 se asocia a agresividad tumoral. Adicionalmente se han asociado a recidivas 1 1 componentes del spliceosoma y factores de splicing snRNP20Q, ESRP1, ESRP2, RBM45, SND1, SRSF3, SRSF4, SRSF5, SRSF10, SRRM1 y TIA 1. Además, snRNP200, SRSF3 y SRRM1 tienen gran potencial para su uso como diana terapéutica, ya que son los únicos factores alterados en todas las comparativas y su modulación in vitro está asociada a la agresividad tumoral.
Por tanto, un primer aspecto de la invención se refiere al uso del producto de la expresión de los genes RNU6, SF3B1, snRNP200, RNU12, ESRP1 , ESRP2, MAGOH , SND1, SRSF2 , SRSF3, SRRM1, RBM45, SRSF4, SRSF5, SRSF10, y/o TIA 1 o cualquiera de sus combinaciones, para predecir o pronosticar el desarrollo de CaP en un individuo. Por tanto, se puede emplear el producto de expresión de uno o más genes para el diagnóstico, predecir la agresividad tumoral, capacidad de invasión, recidivas.
En una realización preferida de este primer aspecto, se emplea el uso del producto de expresión de todos los genes simultáneamente.
A no ser que se indique lo contrario, cuando se utiliza en el presente documento el término “RNU6”, (también llamado en literatura U6; RNU6, RNU6A, U6-1) se refiere al gen, factor de la maquinaria de splicing. En el contexto de la presente invención,“RNU6" se define también por una secuencia de nucleótidos o polinucleótidos, que constituye la secuencia del snRNP“RNU6”, y que comprendería diversas variantes procedentes de: a) moléculas de ácido nucleico que comprende la SEQ ID NO: 1 , b) moléculas de ácido nucleico cuya cadena complementaria híbrida con la secuencia polinucleotídica de a), c) Moléculas de ácido nucleico cuya secuencia difiere de a) y/o b) debido a la degeneración del código genético,
Gene ID: 26827
Localización del gen: 15q23
SEQ ID N° 1 :
GTGCTCGCTTCGGCAGCACAT AT ACT AAAATT GGAACGAT ACAGAGAAGATT AGCAT GGCC CCTGCGCAAGGATGACACGCAAATTCGTGAAGCGTTCCATATTTT
A no ser que se indique lo contrario, cuando se utiliza en el presente documento el término “ SF3B1 (también llamado en literatura MDS; PRP10; Hsh155; PRPF10; SAP155; SF3 155) se refiere al gen, que codifica la subunidad 1 del complejo de proteína del factor splicing 3b. El factor de empalme 3b, junto con el factor de empalme 3a y una unidad de ARN 12S, forma el complejo de ribonucleoproteínas nucleares pequeñas U2 (snRNP U2). El complejo de factor de empalme 3b/3a se une al pre-ARNm corriente arriba del sitio de la rama del intrón de manera independiente de la secuencia y puede anclar el snRNP U2 al pre-ARNm. El factor de empalme 3b también es un componente del spliceosoma menor tipo U12. El splicing alternativo resulta en múltiples variantes de transcripción que codifican diferentes isoformas.
En el contexto de la presente invención, “ SF3B1” se define también por una secuencia de nucleótidos o polinucleótidos, que constituye la secuencia del snRNP “SF3B1", y que comprendería diversas variantes procedentes de: a) Moléculas de ácido nucleico que codifican un polipéptido que comprende la secuencia aminoacídica de la SEQ ID NO: 3, b) Moléculas de ácido nucleico cuya cadena complementaria híbrida con la secuencia polinucleotídica de a), c) Moléculas de ácido nucleico cuya secuencia difiere de a) y/o b) debido a la degeneración del código genético, d) moléculas de ácido nucleico que codifican un polipéptido que comprende la secuencia aminoacídica con una identidad de al menos un 80%, un 90%, un 95%, un 98% o un 99% con la SEQ ID NO: 3. en las que el polipéptido codificado por dichos ácidos nucleicos posee la actividad y las características estructurales de la proteína SF3B1. Entre otras posibles secuencias nucleotídicas que codifican SF3B1 se encuentra, pero sin limitarse, la SEQ ID NO: 2.
Gene ID: 23451
Localización del gen: 2q33.1
SEQ ID N° 2:
AGAGTGCAGCCCCCAGCTATTTTTCTCCGTGGCGGCGGCGACGAGCGGAAGTTCTTGGGA GCGCCAGTTCCGTCTGTGTGTTCGAGTGGACAAAATGGCGAAGATCGCCAAGACTCACGA AGATATTGAAGCACAGATTCGAGAAATTCAAGGCAAGAAGGCAGCTCTTGATGAAGCTCAA GG AGTGGGCCT CGATT CT ACAGGTT ATT AT GACCAGGAAATTT ATGGTGGAAGT GACAGCA GATTTGCTGG AT ACGTG ACAT CAATT GCTGCAACT G AACTT G AAG AT GAT G ACG AT G ACT A TTCATCATCTACGAGTTTGCTTGGTCAGAAGAAGCCAGGATATCATGCCCCTGTGGCATTG CTT AAT GAT AT ACCACAGTCAACAGAACAGT AT GATCCATTTGCT GAGCACAGACCTCCAAA GATTGCAGACCGGGAAGATGAATACAAAAAGCATAGGCGGACCATGATAATTTCCCCAGA GCGTCTTGATCCTTTTGCAGATGGAGGGAAAACCCCTGATCCTAAAATGAATGCTAGGACT T ACAT GGAT GT AATGCGAGAACAACACTT GACT AAAGAAGAACGAGAAATT AGGCAACAGC TAGCAGAAAAAGCTAAAGCTGGAGAACTAAAAGTCGTCAATGGAGCAGCAGCGTCCCAGC CTCCAT CAAAACG AAAACGGCGTTGGG AT CAAACAGCT GAT CAGACTCCTGGT GCC ACT C CCAAAAAACTATCAAGTTGGGATCAGGCAGAGACCCCTGGGCATACTCCTTCCTTAAGATG GGAT GAGACACCAGGT CGTGCAAAGGGAAGCGAGACT CCTGGAGCAACCCCAGGCT CAA AAATATGGGATCCTACACCTAGCCACACACCAGCGGGAGCTGCTACTCCTGGACGAGGTG AT ACACCAGGCCATGCGACACCAGGCCAT GGAGGCGCAACTTCCAGTGCTCGT AAAAACA GATGGGATGAAACCCCCAAAACAGAGAGAGATACTCCTGGGCATGGAAGTGGATGGGCTG AGACTCCTCGAACAGATCGAGGTGGAGATTCTATTGGTGAAACACCGACTCCTGGAGCCA GTAAAAGAAAATCACGGTGGGATGAAACACCAGCTAGTCAGATGGGTGGAAGCACTCCAG TTCTGACCCCTGGAAAGACACCAATTGGCACACCAGCCATGAACATGGCTACCCCTACTCC AGGTCACATAATGAGTATGACTCCTGAACAGCTTCAGGCTTGGCGGTGGGAAAGAGAAATT GAT G AG AG AAATCGCCCACTTT CT GAT GAGG AATT AG ATGCT AT GTTCCCAG AAGG AT AT A AGGTACTTCCTCCTCCAGCTGGTTATGTTCCTATTCGAACTCCAGCTCGAAAGCTGACAGC TACTCCAACACCTTTGGGTGGTATGACTGGTTTCCACATGCAAACTGAAGATCGAACTATG AAAAGT GTT AAT G ACCAGCCATCTGG AAAT CTT CC ATTTTT AAAACCT GAT GAT ATT CAAT AC TTT GAT AAACTATTGGTT GAT GTT GAT G AAT CAAC ACTT AGTCCAG AAG AGCAAAAAG AG AG AAAAAT AAT G AAGTT GCTTTT AAAAATT AAG AATGG AAC ACCACC AAT G AGAAAGGCTGCAT TGCGT C AG ATT ACTG AT AAAGCTCGT G AATTTGG AGCT GGTCCTTT GTTT AAT CAG ATT CTT CCTCTGCT GAT GTCTCCT ACACTT G AGG AT CAAG AGCGTCATTTACTT GT G AAAGTT ATT GA TAGGATACTGTACAAACTTGATGACTTAGTTCGTCCATATGTGCATAAGATCCTCGTGGTCA TT GAACCGCT ATT GATT GAT GAAGATT ACT ATGCT AGAGTGGAAGGCCGAGAGAT CATTTC TAATTTGGCAAAGGCTGCTGGTCTGGCTACTATGATCTCTACCATGAGACCTGATATAGATA ACAT GGAT GAGT ATGTCCGT AACACAACAGCT AGAGCTTTT GCT GTT GT AGCCTCTGCCCT GGGCATTCCTTCTTTATTGCCCTTCTTAAAAGCTGTGTGCAAAAGCAAGAAGTCCTGGCAA GCGAGACACACTGGTATT AAGATT GT ACAACAGAT AGCT ATTCTT AT GGGCTGTGCCATCTT GCCACAT CTT AGAAGTTT AGTT GAAAT CATT GAACATGGTCTT GTGGAT GAGCAGCAGAAA GTTCGGACCATCAGTGCTTTGGCCATTGCTGCCTTGGCTGAAGCAGCAACTCCTTATGGTA TCGAATCTTTTGATTCTGTGTTAAAGCCTTTATGGAAGGGTATCCGCCAACACAGAGGAAA GGGTTTGGCTGCTTTCTTGAAGGCTATTGGGTATCTTATTCCTCTTATGGATGCAGAATATG CCAACT ACT AT ACT AG AG AAGT G AT GTT AATCCTT ATT CG AG AATTCCAGT CT CCTG AT G AG GAAAT GAAAAAAATT GTGCT GAAGGT GGT AAAACAGT GTT GT GGGACAGATGGTGTAGAAG CAAACTACATTAAAACAGAGATTCTTCCTCCCTTTTTTAAACACTTCTGGCAGCACAGGATG GCTTT GGAT AGAAGAAATT ACCGACAGTT AGTT GAT ACTACT GT GGAGTT GGCAAACAAAG T AGGT GCAGCAGAAATT AT AT CCAGGATT GTGGATGAT CT GAAAGAT GAAGCCGAACAGT A CAGAAAAAT GGT GAT GGAGACAATT GAGAAAATT AT GGGT AATTT GGGAGCAGCAGAT ATT GAT CAT AAACTT G AAGAAC AACT GATT G AT GGT ATT CTTT ATGCTTTCCAAG AACAGACT AC AGAGGACTCAGTAATGTTGAACGGCTTTGGCACAGTGGTTAATGCTCTTGGCAAACGAGTC AAACCATACTTGCCTCAGATCTGTGGTACAGTTTTGTGGCGTTTAAATAACAAATCTGCTAA AGTT AGGCAACAGGCAGCTG ACTT G ATTT CTCG AACTGCT GTTGTC AT GAAG ACTT GTCAA GAGGAAAAATT GAT GGGACACTT GGGT GTTGT ATT GT ATGAGT ATTT GGGTGAAGAGT ACC CT GAAGT ATT GGGCAGCATTCTT GGAGCACT GAAGGCCATT GT AAAT GTCAT AGGT AT GCA TAAGATGACTCCACCAATTAAAGATCTGCTGCCTAGACTCACCCCCATCTTAAAGAACAGA CAT G AAAAAGT ACAAG AGAATT GT ATT G AT CTT GTTGGTCGT ATTGCT G AC AGGGG AGCT G AATATGTATCTGCAAGAGAGTGGATGAGGATTTGCTTTGAGCTTTTAGAGCTCTTAAAAGCC CACAAAAAGGCTATTCGTAGAGCCACAGTCAACACATTTGGTTATATTGCAAAGGCCATTG GCCCTCATGATGTATTGGCTACACTTCTGAACAACCTCAAAGTTCAAGAAAGGCAGAACAG AGTTT GT ACCACT GT AGCAAT AGCT ATT GTTGCAGAAACAT GTT CACCCTTT ACAGT ACTCC CT GCCTT AAT G AAT G AAT ACAG AGTT CCT GAACT G AAT GTT CAAAAT GG AGTGTT AAAAT CG CTTTCCTTCTT GTTT GAAT AT ATTGGTGAAATGGGAAAAGACT ACATTT AT GCCGT AACACC GTT ACTT GAAGATGCTTT AATGGAT AGAGACCTT GT ACACAGACAGACGGCT AGTGCAGT G GT ACAGCACAT GTCACTTGGGGTTT AT GGATTTGGTTGT GAAGATTCGCTGAATCACTT GTT GAACTATGTATGGCCCAATGTATTTGAGACATCTCCTCATGTAATTCAGGCAGTTATGGGA GCCCT AGAGGGCCTGAGAGTTGCT ATT GGACCATGT AGAAT GTTGCAAT ATT GTTT ACAGG GTCT GTTT CACCCAGCCCGG AAAGT CAG AG AT GTAT ATT GG AAAATTT ACAACTCCAT CTAC ATTGGTTCCCAGGACGCTCTCATAGCACATTACCCAAGAATCTACAACGATGATAAGAACA CCT AT ATTCGTT AT G AACTT G ACT AT AT CTT AT AATTTT ATT GTTT ATTTT GTGTTT AATGCAC AGCT ACTT CACACCTT AAACTT GCTTT GATTTGGTG ATGT AAACTTTT AAAC ATTGCAG AT CA GTGTAGAACT GGTCAT AGAGGAAGAGCT AGAAAT CCAGT AGCAT GATTTTT AAAT AACCTGT CTTT GTTTTT GATGTT AAAC AGT AAATGCC AGT AGT G ACCAAG AACACAGT G ATT AT ATACA CT AT ACT GG AGGG ATTTC ATTTTT AATT CATCTTT AT G AAGATTT AG AACT CATTCCTT GT GT TT AAAGGGAATGTTT AATT GAGAAAT AAACATTT GT GT ACAAAATGCT AA
SEQ ID N° 3:
MAKIAKTHEDIEAQIREIQGKKAALDEAQGVGLDSTGYYDQEIYGGSDSRFAGYVTSIAATELED
DDDDYSSSTSLLGQKKPGYHAPVALLNDIPQSTEQYDPFAEHRPPKIADREDEYKKHRRTMIIS
PERLDPFADGGKTPDPKMNARTYMDVMREQHLTKEEREIRQQLAEKAKAGELKWNGAAASQ
PPSKRKRRWDQTADQTPGATPKKLSSWDQAETPGHTPSLRWDETPGRAKGSETPGATPGSK
IWDPTPSHTPAGAATPGRGDTPGHATPGHGGATSSARKNRWDETPKTERDTPGHGSGWAET
PRTDRGGDSIGETPTPGASKRKSRWDETPASQMGGSTPVLTPGKTPIGTPAMNMATPTPGHI
MSMTPEQLQAWRWEREIDERNRPLSDEELDAMFPEGYKVLPPPAGYVPIRTPARKLTATPTPL
GGMTGFHMQTEDRTMKSVNDQPSGNLPFLKPDDIQYFDKLLVDVDESTLSPEEQKERKIMKLL
LKIKNGTPPMRKAALRQITDKAREFGAGPLFNQILPLLMSPTLEDQERHLLVKVIDRILYKLDDLV
RPYVHKILVVIEPLLIDEDYYARVEGREIISNLAKAAGLATMISTMRPDIDNMDEYVRNTTARAFA WASALGIPSLLPFLKAVCKSKKSWQARHTGIKIVQQIAILMGCAILPHLRSLVEII EHGLVDEQQK
VRTISALAIAALAEAATPYGIESFDSVLKPLWKGIRQHRGKGLAAFLKAIGYLIPLM DAEYANYYT
REVMLILIREFQSPDEEMKKIVLKVVKQCCGTDGVEANYIKTEILPPFFKHFWQHRMALDRRNY
RQLVDTTVELANKVGAAEIISRIVDDLKDEAEQYRKMVM ETIEKIMGNLGAADIDHKLEEQLIDGI
LYAFQEQTTEDSVMLNGFGTWNALGKRVKPYLPQICGTVLWRLNNKSAKVRQQAADLISRTA
WMKTCQEEKLMGHLGVVLYEYLGEEYPEVLGSILGALKAIVNVIGMHKMTPPIKDLLPRLTPILK
NRHEKVQENCIDLVGRIADRGAEYVSAREWMRICFELLELLKAHKKAIRRATVNTFGYIAKAIGP
HDVLATLLNNLKVQERQNRVCTTVAIAIVAETCSPFTVLPALMNEYRVPELNVQNGVLKSLSFLF
EYIGEMGKDYIYAVTPLLEDALMDRDLVHRQTASAVVQHMSLGVYGFGCEDSLNHLLNYVWPN
VFETSPHVIQAVMGALEGLRVAIGPCRMLQYCLQGLFHPARKVRDVYWKIYNSIYIGSQDALIAH
YPRIYN DDKNTYI RYELDYI L
El término "SNRNP200" (también llamado en la literatura BRR2; RP33; HELIC2; ASCC3L1 ; U5- 200KD) se refiere tanto al gen como a la proteína humana, subunidad 200 de la ribonucleoproteína nuclear pequeña U5. El splicing de pre-ARNm es catalizado por el spliceosoma, un complejo de subunidades de proteínas y ARN especializadas que elimina los intrones de un segmento de ARNm previo transcrito. El spliceosoma consiste en pequeñas proteínas de ARN nuclear (snRNPs) U 1 , U2, U4, U5 y U6, junto con aproximadamente 80 proteínas conservadas. U5 snRNP contiene nueve proteínas específicas. Este gen codifica una de las proteínas específicas de snRNP U5. Esta proteína pertenece a la familia DEXH-box de ARN helicasas putativas. Es un componente central de los snRNPs U4 / U6-U5 y parece catalizar un desenrollado dependiente de ATP de los duplicados de ARN U4 / U6. Las mutaciones en este gen causan retinitis pigmentosa autosómica dominante. Alternativamente, se han encontrado variantes de transcripción empalmadas que codifican diferentes isoformas, pero no se ha determinado la naturaleza completa de estas variantes. En el contexto de la presente invención, “SNRNP200” se define también por una secuencia de nucleótidos o polinucleótido, que constituye la secuencia codificante de la proteína“SNRNP200”, y que comprendería diversas variantes procedentes de: a) Moléculas de ácido nucleico que codifican un polipéptido que comprende la secuencia aminoacídica de la SEQ ID NO: 5, b) Moléculas de ácido nucleico cuya cadena complementaria híbrida con la secuencia polinucleotídica de a), c) Moléculas de ácido nucleico cuya secuencia difiere de a) y/o b) debido a la degeneración del código genético, d) moléculas de ácido nucleico que codifican un polipéptido que comprende la secuencia aminoacídica con una identidad de al menos un 80%, un 90%, un 95%, un 98% o un 99% con la SEQ ID NO: 5. en las que el polipéptido codificado por dichos ácidos nucleicos posee la actividad y las características estructurales de la proteína SNRNP200. Entre otras posibles secuencias nucleotídicas que codifican SNRNP200 se encuentra, pero sin limitarse, la SEQ ID NO: 4. Gene ID: 23020
Localización del gen: 2q11.2 SEQ ID N° 4:
GAACCCGTTTCTTTTCCTTCCCCAGTGCGTCTTTCCTGCGTCGTTCCGGCGCGGCGGGAG
CAGAGATCTGCGGCCGTTTGCAGCTTGCGGTAGGGAGGCGTGGTGGTCTGAAGCCTCCG
AGCAGCCGCGGCCATGGCGGATGTAACCGCCCGTAGTCTGCAATACGAGTACAAGGCGA
ACTCGAATCTTGTGCTCCAAGCTGACCGTTCTCTCATTGACCGGACCCGCCGGGATGAAC
CCACAGGAGAGGTGCTGTCCCTTGTTGGGAAGCTGGAGGGCACCCGTATGGGAGACAAG
GCTCAACGGACCAAACCGCAGATGCAGGAGGAAAGAAGAGCCAAGCGAAGAAAGCGTGA
T GAGGACCGGCAT GACAT CAACAAGAT GAAGGGTT ATACTCTGCTGTCGGAGGGCATT GA
TGAGATGGTGGGCATCATCTACAAGCCCAAAACTAAAGAGACTCGGGAGACCTATGAGGT
GCTACTCAGCTTCATCCAGGCTGCTCTTGGGGACCAGCCACGTGATATCCTTTGTGGGGC
AGCTGATGAAGTTCTAGCTGTTCTAAAGAATGAAAAGCTGCGGGACAAGGAAAGGCGAAA
GG AGATT GACCTGCTGCT GGGTCAAACAGAT GAT ACCAGATACCAT GTGCT AGT GAACCT G
GG CAAAAAG AT CACAGACT AT GGTGGAG AT AAGG AAAT CC AAAAT ATGG AT G AC AACATT G
AT G AG ACAT ACGGT GT G AAT GTGCAGTTT G AGT CT GAT G AGG AGG AAGGT GAT G AAG ACG
TATACGGGGAGGTTCGAGAAGAGGCATCTGATGATGACATGGAAGGGGACGAGGCTGTC
GTGCGCTGCACCCTCTCGGCTAATCTCGTAGCCTCAGGTGAACTGATGAGTTCCAAGAAG
AAGGATTTGCACCCTCGGGATATTGATGCATTTTGGCTGCAGCGGCAGCTCAGTCGTTTCT
AT GAT GATGCC ATCGTGTCGC AG AAGAAGGCAG AT G AAGT ATT GG AG ATTTT G AAGACGG
CCAGTGATGATCGGGAATGTGAAAATCAGCTGGTTCTGCTGCTTGGTTTCAACACCTTTGA
TTTCATTAAAGTGTTGCGGCAGCACAGGATGATGATTTTATACTGTACCTTGCTGGCCAGT
GCACAAAGTGAAGCTGAAAAGGAAAGGATTATGGGAAAGATGGAAGCTGACCCAGAGCTA
TCCAAGTTCCTCTACCAGCTTCATGAAACCGAGAAGGAGGATCTGATCCGAGAGGAAAGG
TCCCGGAGAGAGCGAGTGCGTCAGTCTCGAATGGACACAGATCTGGAAACCATGGATCTC
GACCAGGGTGGAGAGGCACTGGCTCCACGGCAGGTTCTGGACTTGGAGGACCTGGTTTTT
ACCCAAGGGAGCCACTTTATGGCCAATAAACGCTGTCAGCTTCCTGATGGATCCTTCCGTC
GCCAGCGTAAGGGCTATGAAGAGGTGCATGTGCCTGCTCTGAAGCCCAAGCCCTTTGGCT
CAGAAGAACAACTGCTTCCAGTGGAAAAGCTGCCAAAGTATGCCCAGGCTGGGTTTGAGG
GCTTCAAAACACT GAATCGGAT CCAGAGT AAGCTCT ACCGTGCTGCCCTT GAGACGGAT GA
GAATCTGCTGCTGTGTGCTCCTACTGGTGCTGGGAAGACCAACGTGGCCCTGATGTGCAT
GCTCCGAG AGATT GGG AAACAC AT AAAC ATGG ACGGCACCAT CAAT GTGGAT G ACTT CAA
GATT ATCT ACATT GCCCCCATGCGCTCCTT GGTGCAGGAGATGGT GGGCAGCTTT GGAAA
GCGCCTGGCCACTTATGGCATCACTGTTGCTGAACTGACTGGGGACCACCAGCTGTGCAA
AGAAGAGATCAGTGCCACTCAGATCATCGTCTGCACCCCCGAGAAGTGGGACATCATCAC
CCGCAAGGGTGGTGAGCGCACCTACACCCAGCTGGTGCGGCTCATCATTCTGGATGAGAT
TCATCTTCTCCACGATGACAGAGGTCCTGTCTTAGAAGCTTTAGTGGCCAGGGCCATCCGA
AACATTGAGATGACCCAAGAGGATGTCCGACTCATTGGTCTCAGTGCCACCCTACCCAACT
ATGAAGATGTAGCCACCTTTCTACGTGTTGACCCTGCCAAGGGTCTCTTTTACTTTGACAAC
AGCTTCCGTCCAGTGCCTCTGGAACAGACAT AT GT GGGT ATCACAGAGAAAAAAGCT AT CA
AGCGTTTCCAGAT CAT G AAT G AAAT CGTCT AT G AAAAAATC ATGG AACAT GCT GG AAAAAAT
CAGGTGCTGGTGTTTGTCCACTCCCGGAAGGAGACTGGAAAGACAGCCAGGGCCATCCG
GGACATGTGCCTAGAAAAGGACACTCTGGGTCTGTTTCTGAGGGAGGGCTCAGCCTCCAC
AGAAGTCCTGCGAACAGAAGCT GAGCAGT GCAA GAACCT AGAGCT GAAGGAT CTTCT GCC
TTATGGCTTTGCTATTCATCACGCAGGCATGACCAGGGTTGACCGAACACTCGTGGAGGAT CTTTTTGCTGATAAACATATTCAGGTTTTAGTTTCCACAGCAACTCTAGCTTGGGGTGTGAA
TCTCCCTGCACATACAGTCATCATCAAAGGCACCCAGGTGTACAGTCCAGAGAAGGGGCG
TTGGACAGAACTGGGAGCACTGGACATTCT GCAGAT GCT GGGACGTGCCGGAAGACCCCA
GTATGACACCAAGGGTGAAGGCATACTCATCACATCTCATGGGGAGCTACAGTACTACCTG
TCCCTCCT CAAT CAACAACTT CCTATT G AAAGCCAG ATGGTTTC AAAGCTTCCT GACAT GCT
CAAT GCAGAAATCGT GCT AGGAAAT GTCCAGAATGCCAAGGATGCGGT GAACT GGCT GGG
CTATGCCTACCTCTATATCCGAATGCTGCGATCCCCAACCCTCTATGGCATCTCTCATGAT
GACCTCAAGGGAGATCCCCTGCTGGACCAGCGCCGACT AGATCT GGTTCAT ACAGCTGCC
CT GATGCTGGACAAGAACAATCTGGT CAAGT ACGACAAGAAGACGGGCAACTT CCAGGT G
ACAGAACTGGGCCGTAT AGCCAGCCACT ACT ACAT CACCAAT GAT ACAGTGCAGACTT ACA
ACCAGCTGCTGAAGCCCACCCTGAGTGAGATTGAGCTTTTCAGGGTCTTCTCATTGTCCTC
TGAGTTCAAGAACATCACAGTGAGAGAGGAGGAGAAGCTGGAGCTGCAGAAGTTGCTGGA
GAGGGTGCCT AT CCCT GT AAAGGAGAGCATT GAGGAACCCAGTGCTAAGATCAACGTTCTT
CTGCAAGCCTTCATCTCACAGCTGAAATTGGAGGGCTTTGCACTGATGGCTGACATGGTGT
AT GTCACACAGTCGGCTGGCCGGTT GAT GCGAGCGAT ATTT GAAATT GTCCT GAACCGAG
GTT GGGCACAGCTT ACAGACAAGACCCT GAACCT CT GCAAGAT GATCGACAAACGCATGT
GGCAGTCCATGTGTCCTCTGCGCCAGTTCCGGAAACTCCCTGAGGAAGTAGTGAAGAAGA
TT G AG AAG AAGAATTTCCCCTTT G AGCGTCTGT ACGACCT G AAT CAT AAT G AGATTGGGG A
GCTTATCCGCATGCCAAAGATGGGGAAGACCATCCACAAATATGTCCATCTGTTTCCCAAG
TTGGAGTTGTCAGTGCACCTGCAGCCTATCACACGCTCCACCCTGAAGGTGGAGCTGACC
ATCACGCCAGACTTCCAGTGGGATGAAAAGGTGCATGGTTCATCCGAGGCTTTTTGGATTC
TGGTGGAGGATGTGGACAGCGAGGTGATTCTGCACCATGAGTATTTTCTCCTCAAGGCCA
AGT ACGCCCAGGACGAGCACCT CATT ACATTCTT CGTGCCT GTCTTTGAACCGCTGCCCCC
TCAGTACTTCATCCGAGTGGTGTCTGACCGCTGGCTCTCTTGTGAGACCCAGCTGCCTGTC
TCCTTCCGGCACCTGATCTTGCCGGAGAAGTACCCCCCTCCAACCGAACTTTTGGACCTG
CAGCCCTTGCCCGT GT CT GCTCT GAGAAACAGTGCCTTTGAGAGTCTTT ACCAAGAT AAAT
TTCCTTT CTT CAATCCCAT CC AG ACCC AGGT GTTT AACACT GT AT ACAAC AGT G ACG ACAAC
GTGTTTGTGGGGGCCCCCACGGGCAGCGGGAAGACTATTTGTGCAGAGTTTGCCATCCTG
CGAATGCTGCTGCAGAGCTCGGAGGGGCGCTGTGTGTACATCACCCCCATGGAGGCCCT
GGCAGAGCAGGTATACATGGACTGGTACGAGAAGTTCCAGGACAGGCTCAACAAGAAGGT
GGTACTCCTGACAGGCGAGACCAGCACAGACCTGAAGCTGCTGGGCAAAGGGAACATTAT
CATCAGCACCCCTGAGAAGTGGGACATACTTTCCCGGCGATGGAAGCAGCGCAAGAACGT
GCAGAACATCAACCTCTTCGTGGTGGATGAGGTCCACCTTATCGGGGGCGAGAATGGGCC
TGTCTTAGAAGTGATCTGCTCCCGAATGCGCTACATCTCCTCCCAGATTGAGCGGCCCATT
CGCATTGTGGCACTCAGCTCTTCGCTCTCCAATGCCAAGGATGTGGCCCACTGGCTGGGC
TGCAGTGCCACCTCCACCTTCAACTTCCATCCCAATGTGCGTCCCGTCCCCTTGGAGCTGC
ACATCCAGGGCTTCAACATCAGCCATACACAAACCCGCCTGCTCTCCATGGCCAAGCCTGT
GTACCATGCTATCACCAAGCACTCGCCCAAGAAGCCTGTCATTGTCTTTGTGCCGTCTCGC
AAGCAGACCCGCCTCACTGCCATT GACATCCT CACCACCT GTGCAGCAGACATCCAACGG
CAGAGGTTCTTGCACTGCACCGAGAAGGATCTGATTCCGTACCTGGAGAAGCTAAGTGAC
AGCACGCTCAAGGAAACGCTGCTAAATGGGGTGGGCTACCTGCATGAGGGGCTCAGCCC
CATGGAGCGACGCCTGGTGGAGCAGCTCTTCAGCTCAGGGGCTATCCAGGTGGTGGTGG
CTTCTCGGAGTCTCTGCTGGGGCATGAACGTGGCTGCCCACCTGGTAATCATCATGGATA
CCCAGT ACT ACAATGGCAAGATCCACGCCT AT GT GGATT ACCCCATCT ATGACGTGCTTCA
GATGGTGGGCCACGCCAACCGCCCTTTGCAGGACGATGAGGGGCGCTGTGTCATCATGT
GTCAGGGCTCCAAGAAGGATTTCTTCAAGAAGTTCTTATATGAGCCATTGCCAGTAGAATC
T CACCTGG ACC ACT GTAT GC AT G ACC ACTT CAATGCT G AG AT CGTC ACCAAG ACCATT G AG
AACAAGCAGGATGCT GTGGACT ACCT CACCTGGACCTTTCT GT ACCGCCGCATGACACAG
AACCCCAATTACTACAACCTGCAGGGCATCTCCCATCGTCACTTGTCGGACCACTTGTCAG AGCTGGTGGAGCAGACCCTGAGTGACCTGGAGCAGTCCAAGTGCATCAGCATCGAGGAC
GAGATGGACGTGGCGCCTCTGAACCTAGGCATGATCGCCGCCTACTATTACATCAACTACA
CCACCATTGAGCTCTTCAGCATGTCCCTCAATGCCAAGACCAAGGTGCGAGGGCTTATCG
AGATCATCTCCAATGCAGCAGAGTATGAGAACATTCCCATCCGGCACCATGAAGACAATCT
CCTGAGGCAGTTGGCTCAGAAGGTCCCCCACAAGCTGAATAACCCTAAGTTCAATGATCC
GCACGTCAAGACCAACCTGCTCCTGCAGGCTCACTTGTCTCGCATGCAGCTGAGTGCTGA
GTTGCAGTCAGATACGGAGGAAATCCTTAGTAAGGCAATCCGGCTCATCCAGGCCTGCGT
GGATGTCCTTTCCAGCAATGGGTGGCTCAGCCCTGCTCTGGCAGCTATGGAACTGGCCCA
GATGGTCACCCAAGCCATGTGGTCCAAGGACTCATACCTGAAGCAGCTGCCACACTTCAC
CTCT GAGCATATCAAACGTT GCACAGACAAGGGAGTGGAGAGT GTTTTCGACAT CATGGAG
ATGGAGGATGAAGAACGGAACGCGTTGCTTCAGCTGACTGACAGCCAGATTGCAGATGTG
GCTCGCTTTT GT AACCGCT ACCCTAAT ATCGAACT AT CTT AT GAGGT GGT AGAT AAGGACA
GCATCCGCAGTGGCGGGCCAGTTGTGGTGCTGGTGCAGCTGGAGCGAGAGGAGGAAGTC
ACAGGCCCTGTCATTGCGCCTCTCTTCCCGCAGAAACGTGAAGAGGGCTGGTGGGTGGTG
ATTGGAGATGCCAAGTCCAATAGCCTCATCTCCATCAAGAGGCTGACCTTGCAGCAGAAG
GCCAAGGTGAAGTTGGACTTTGTGGCCCCAGCCACTGGTGCCCACAACTACACTCTGTAC
TTCAT GAGT GACGCTT ACATGGGAT GTGACCAGGAGT ACAAATT CAGCGT GGAT GTGAAAG
AAGCT GAGACAGACAGT GATTCAGATT GAGTCCT GAGGCATTT ACTTTTGGGT AAAGGAGA
GTT GAGCCTG AATT AGG AATGT GT ACATT GT AGG AATCCT GGTT GTGGGG ACCAGGTCT GT
GGGCCTCAGGTCTGGCCAGCCAGGGCTGGTGCTGTCCCCGCCTACCTCCACTTCCTTTCC
CTT GCTCACTCTGGATCCAGT GACAGCAGGT GTCAT GGGTCAAGCAT AAATCAT AT AT AGC
ATTTT CAGGC AT GTT CCTGGT AGTTCTTTT G AGTCT GACATT CT AAT AAAAT AATTT GT AG AA
ACCATTTGTCTTTGTAGTGATTCCAAATTAAAAGTTTTCTTTCTCCAACCTGAGGGCACGGC
CAAAAAG AT CTGGTT ATTTTTTAGCCAGG AACGTGCTT GTT AAT GAGT ATGTCT GG AGG AC A
GACCTGCTCATTAGGTGTGCTGTCCCCTGTAGCCTCGTGAGTCAGCCCAGAGGAGGGTAC
ATGCGACTGTGGCCTGGCCTCAGTGGTACCCACACATCAGCACTACCACAAGAACCAACA
CTGAGCCTCGGAAGCTAGATCACAGGTTAGGGGTTTCTCTAGATGGGGGTTCTGAAATTTG
CAGTGTCTGCTCCTGGGAGGCAGCACCAGAAAGGGCACTGAAATGTACTAGCTGGATGTG
ACCCAGT CTT AAT AAAC AGGTTTT CT AATCCAGAAAAAAAAAAAA
SEQ ID N° 5:
MADVTARSLQYEYKANSNLVLQADRSLIDRTRRDEPTGEVLSLVGKLEGTRMGDKAQRTKPQ
MQEERRAKRRKRDEDRHDINKMKGYTLLSEGIDEMVGIIYKPKTKETRETYEVLLSFIQAALGD
QPRDILCGAADEVLAVLKNEKLRDKERRKEIDLLLGQTDDTRYHVLVNLGKKITDYGGDKEIQN
MDDNIDETYGVNVQFESDEEEGDEDVYGEVREEASDDDMEGDEAVVRCTLSANLVASGELMS
SKKKDLHPRDIDAFWLQRQLSRFYDDAIVSQKKADEVLEILKTASDDRECENQLVLLLGFNTFD
FIKVLRQHRMMILYCTLLASAQSEAEKERIMGKMEADPELSKFLYQLHETEKEDLIREERSRRER
VRQSRMDTDLETMDLDQGGEALAPRQVLDLEDLVFTQGSHFMANKRCQLPDGSFRRQRKGY
EEVHVPALKPKPFGSEEQLLPVEKLPKYAQAGFEGFKTLNRIQSKLYRAALETDENLLLCAPTG
AGKTNVALMCMLREIGKHINMDGTINVDDFKIIYIAPMRSLVQEMVGSFGKRLATYGITVAELTG
DHQLCKEEISATQIIVCTPEKWDIITRKGGERTYTQLVRLIILDEIHLLHDDRGPVLEALVARAIRNI
EMTQEDVRLIGLSATLPNYEDVATFLRVDPAKGLFYFDNSFRPVPLEQTYVGITEKKAIKRFQIM
NEIVYEKIMEHAGKNQVLVFVHSRKETGKTARAI RDMCLEKDTLGLFLREGSASTEVLRTEAEQ
CKNLELKDLLPYGFAIHHAGMTRVDRTLVEDLFADKHIQVLVSTATLAWGVNLPAHTVIIKGTQV
YSPEKGRWTELGALDILQMLGRAGRPQYDTKGEGILITSHGELQYYLSLLNQQLPIESQMVSKL
PDMLNAEIVLGNVQNAKDAVNWLGYAYLYIRMLRSPTLYGISHDDLKGDPLLDQRRLDLVHTAA
LMLDKNNLVKYDKKTGNFQVTELGRIASHYYITNDTVQTYNQLLKPTLSEIELFRVFSLSSEFKNI TVREEEKLELQKLLERVPIPVKESIEEPSAKINVLLQAFISQLKLEGFALMADMVYVTQSAGRLM
RAIFEIVLNRGWAQLTDKTLNLCKMIDKRMWQSMCPLRQFRKLPEEWKKIEKKNFPFERLYDL
NHNEIGELIRMPKMGKTIHKYVHLFPKLELSVHLQPITRSTLKVELTITPDFQWDEKVHGSSEAF
WILVEDVDSEVILHHEYFLLKAKYAQDEHLITFFVPVFEPLPPQYFIRWSDRWLSCETQLPVSF
RHLILPEKYPPPTELLDLQPLPVSALRNSAFESLYQDKFPFFNPIQTQVFNTVYNSDDNVFVGAP
TGSGKTICAEFAILRMLLQSSEGRCVYITPMEALAEQVYM DWYEKFQDRLNKKWLLTGETSTD
LKLLGKGNIIISTPEKWDILSRRWKQRKNVQNINLFWDEVHLIGGENGPVLEVICSRMRYISSQI
ERPIRIVALSSSLSNAKDVAHWLGCSATSTFNFHPNVRPVPLELHIQGFNISHTQTRLLSMAKPV
YHAITKHSPKKPVIVFVPSRKQTRLTAIDILTTCAADIQRQRFLHCTEKDLIPYLEKLSDSTLKETLL
NGVGYLHEGLSPMERRLVEQLFSSGAIQVVVASRSLCWGMNVAAHLVIIMDTQYYNGKIHAYV
DYPIYDVLQMVGHANRPLQDDEGRCVIMCQGSKKDFFKKFLYEPLPVESHLDHCMHDHFNAEI
VTKTIENKQDAVDYLTWTFLYRRMTQNPNYYNLQGISHRHLSDHLSELVEQTLSDLEQSKCISIE
DEMDVAPLNLGMIAAYYYINYTTIELFSMSLNAKTKVRGLIEIISNAAEYENIPIRHHEDNLLRQLA
QKVPHKLNNPKFNDPHVKTNLLLQAHLSRMQLSAELQSDTEEILSKAIRLIQACVDVLSSNGWL
SPALAAMELAQMVTQAMWSKDSYLKQLPHFTSEHIKRCTDKGVESVFDIMEMEDEERNALLQL
TDSQIADVARFCNRYPNIELSYEVVDKDSIRSGGPVWLVQLEREEEVTGPVIAPLFPQKREEG
WWVVIGDAKSNSLISIKRLTLQQKAKVKLDFVAPATGAHNYTLYFMSDAYMGCDQEYKFSVDV
KEAETDSDSD
El término "RNU12" (también llamado en la literatura RNU12L; RNU12P; RNU12-1; dJ222E13.7) se refiere al pequeño ARN nuclear (snRNP) codificado por este gen es parte del complejo de spliceosoma menor dependiente de U12. Además del ARN codificado, este complejo de ribonucleoproteínas consiste en snRNPs U 11 , U12, U5 y U6atac. En el contexto de la presente invención,“RNU12”se define también por una secuencia de nucleótidos o polinucleótidos, que constituye la secuencia del snRNP“RNU12", y que comprendería diversas variantes procedentes de: a) Moléculas de ácido nucleico que comprende la SEQ ID NO: 6, b) Moléculas de ácido nucleico cuya cadena complementaria híbrida con la secuencia polinucleotídica de a), c) Moléculas de ácido nucleico cuya secuencia difiere de a) y/o b) debido a la degeneración del código genético,
Gene ID: 267010
Localización del gen: 22q13.2
SEQ ID N° 6:
TGCCTTAAACTTATGAGTAAGGAAAATAACGATTCGGGGTGACGCCCGAATCCTCACTGCT
AATGTGAGACGAATTTTTGAGCGGGTAAAGGTCGCCCTCAAGGTGACCCGCCTACTTTGC
GGGATGCCTGGGAGTTGCGATCTGCCCG El término "ESRPT' (también llamado en la literatura RBM35A; RMB35A; DFNB109) se refiere tanto al gen como a la proteína humana. ESPR1 es un regulador de splicing epitelial. En el contexto de la presente invención,“ESRP1” se define también por una secuencia de nucleótidos o polinucleótidos, que constituye la secuencia“ESRP1”, y que comprendería diversas variantes procedentes de: a) moléculas de ácido nucleico que codifican un polipéptido que comprende la SEQ ID NO: 7, b) moléculas de ácido nucleico cuya cadena complementaria híbrida con la secuencia polinucleotídica de a), c) Moléculas de ácido nucleico cuya secuencia difiere de a) y/o b) debido a la degeneración del código genético,
Gene ID: 54845
Localización del gen: 8q22.1 SEQ ID N° 7:
ACAGGTGGCAGCTCTCGTCCCCTGAGAGCGGGCGAAGGCCAGGGTCCCACACTCGCAGC
GCTGCGACGGCGCTCGGGACCTCCCTCGTCCACTGCTTGAGTTCCAGAGGTGGGTGCTT
CCCTGTCCTGAACTTCAGAGTGCGGAGTCATAAATGGGTTCCGGCTGGCTTACTGCAGTA
GCCTCGCTCCTCCCCAGCCCCGGTAACTCCGAGCTACCCGTCCAGGCCCTCGGGCGTCG
CGGGGGCAGGGACT GGGCGCGGAACGAGGCAGGGAGGGACCT GGAAAAACCACCCAGA
TTGCATTGCAGTGGGCGAGGCCGCCTGGAGGAGCCGGTTCCCCCTAACCACCTCCCCGT
GGGGCTCTCGGTGCGCGGTTCCCAGGTGCTCAGCTCTGCTGGGCCCAGGAGGTGCCGCC
TCACAGGGACGCGGAACCCCGTGCGTGGCCCCCGCCGGGTGGAACAGATAGCGCGGGG
CGGTCCGGAGGCTCGTCGCCAAGCAGGTGACTCTTGCTGAAAAAGTGGTTGGAACACTTG
AGGAAACCCGGCCCCGCCTGTTCTTTCTAGGTCTTTGGAGTTTGGATTAATCATTTGTGTA
GCCCGTTTGGATAAACCGAAGACTTTATTAAATCAGCGCGTTTAACAGGAATTCCGCAGTA
GT ATCCAC ATT AG AATCTT GAGTCTTGG AGTT G AACAT ATT CACACAGACTTGCCTT CTTCC
T GTTT AGTTT ATGCCTT GT GTTCCGTT ATT GGAACGCT AAGCTT GTGGGAGTTGTTT ACAT C
CTACTGCTCAAGGTCATCGCTAAGGTGTGATTTTTCACAAAAAGAATTTGCAACCTCCGGC
AT G AAT G ACTT AAGGG AAGT CT AATCCCGGTTT CT G ATTTTTTTTTTTTTTTT AATTT AAAAGT
TAATCTTTCTGGGCCGGGCGCGGTGGCTCACGCCTGTAATCCCAGCACTTTGGGAGGCCG
AGGCGGATCACGAGGTCAGGAGTTCGAGACCAGCCTGACCAACATGGTGAAACCCCGTCT
CTACTAAAAACACAAAAATTAGCCGGGCGGGGTGGCGCGCACCTGTAATCCCAGCTGCTC
GGGAGGCTGAGGCAGGAGAATCGCTTGAACCTGGGAGGCGGGGGGTTGCAGTGAGCCG
AGATCTGGCCATTGCACTCCAGCGTGGGCAACAGAGTGAGACTCCATCTCAAAAAAAAAG
GTT AAT CTTTCCAACT AG ATTTT CAAGG AT G AGG ATTTTGTTGTT GTTGTTGTTGTTGTTCTC
AAAT GT ATTCCCAGGGCTT GGAACAGAGCCT GACAT AT ACT AGGCACTCAACAAAT ATTT GT
T GAAT GATTGT AAT GAGT AAC ACCCATTTTT GC AG AT CTTT GTCTT CT GAGCCT AGGGC AT A
GGTCATCACTGCAGGGGTGAGATTGTCAAAATGGGAGTCTACAGGTAATTTAAGACTTAAA
T GTTT AAAG AGT AT GTGCT CATT CTT CAAC AAACTT ACTTTT GTT AAATT AAAATGGT AAAAT
GTGGTGGAGGGGTTGGAATATATGTAATTCAAGACAGTTCTGAATACAAAAATGTTTTACTG
T CT AT CACCACC AT CT AT AAATCTAATT CACT AAGG AT AAT CTGTGTAAGGTGGCT GG AAAG
AACCTTGAGGAGAGAGGCTTATTTAAGTATTGGCTCAGGACCACACCTAAAATTCTCAAAA CGTT GAGATTCT GTTGTTTT GTTTTT AAGCGCCAGAGACCCAAGTT GAGGAACAGCCT AT AA AAT AACTGGCCT GT ACT CTT ACAT ACAT GAAAGCC AT CAAAGACAAAG ACTG AAGAAG AACT TTT GC AG ATT AAAGG ACTTT AAGAG ACAT G ATCCT G AACCAGAAAAAGT AAAAAAT AAAAAA AT AAAAAGAT CTGT AGATT AG AT AATAGTTTT AT ATCCAT GTT AATTT CCCATTT GTTGT AAT A TT ACT GTGGTT GGGCAAGAGAGT GTCTTTGTTGGTGGAAGT ATCTACT GAAGT ATTT AGGG GT AAAG AGG AAT CAT GTCTGT AACTT AT GCTCAAAAGGTT CAG ACAAAAT AT AT GT AAAGGG AATGATAAAGCAAACGCAATAAAATGTTAACATTGGGGAATCTGTATAAGGGAATTATTAAC TTTT CT GT AAGTCT AAAATT ATTT CAAATT AAAAAT AATTTTTTT AAGCCT C
El término "ESRP2" (también llamado en la literatura RBM35B) se refiere tanto al gen como a la proteína humana. ESPR2 es un regulador de splicing epitelial. En el contexto de la presente invención,“ESRP2” se define también por una secuencia de nucleótidos o polinucleótidos, que constituye la secuencia“ESRP2”, y que comprendería diversas variantes procedentes de: a) moléculas de ácido nucleico que codifican un polipéptido que comprende la secuencia aminoacídica de la SEQ ID NO: 9, b) moléculas de ácido nucleico cuya cadena complementaria híbrida con la secuencia polinucleotídica de a), c) Moléculas de ácido nucleico cuya secuencia difiere de a) y/o b) debido a la degeneración del código genético, d) Moléculas de ácido nucleico que codifican un polipéptido que comprende la secuencia aminoacídica con una identidad de al menos un 80%, un 90%, un 95%, un 98% o un 99% con la SEQ ID NO: 9. en las que el polipéptido codificado por dichos ácidos nucleicos posee la actividad y las características estructurales de la proteína ESRP2. Entre otras posibles secuencias nucleotídicas que codifican ESRP2 se encuentra, pero sin limitarse, la SEQ ID NO: 8.
Gene ID: 80004
Localización del gen: 16q22.1
SEQ ID N° 8:
AGCCGGGCCGCAGGTGCCGCCCCCGATACACGGTGTCCCGCCCAAGCTGATCCGCGTCT
GCGGTCGGTCGGTGCGTGCGTGCGCCTCGTCGGTCCGCGTGTCTGGCCGAGAGCCCCCT
TCCTCTGCGGCCATGACTCCGCCGCCGCCGCCGCCCCCTCCCCCGGGCCCTGACCCCGC
GGCCGACCCCGCCGCGGACCCCTGCCCCTGGCCCGGATCACTGGTCGTCCTCTTCGGGG
CTACGGCGGGTGCGCTGGGACGGGACCTGGGCTCGGACGAGACCGACTTAATCCTCCTA
GTTTGGCAAGTGGTTGAGCCGCGGAGCCGCCAGGTGGGGACGCTGCACAAATCGCTGGT
TCGTGCCGAGGCGGCCGCACTGAGTACGCAGTGCCGCGAGGCGAGCGGCCTGAGCGCC
GACAGCCTGGCGCGGGCAGAGCCGCTGGACAAGGTGCTGCAGCAGTTCTCACAGCTGGT GAACGGGGATGTGGCTTTGCTGGGCGGGGGCCCCTACATGCTCTGCACTGATGGGCAGC
AGCTATTGCGACAGGTCCTGCACCCCGAGGCCTCCAGGAAGAACCTGGTGCTCCCCGACA
TGTTCTTCTCCTTCTATGACCTCCGAAGAGAATTCCATATGCAGCATCCAAGCACCTGCCCT
GCCAGGGACCTCACTGTGGCCACCATGGCACAGGGTTTAGGACTGGAGACAGATGCCAC
AGAGGATGACTTTGGGGTCTGGGAAGTCAAGACAATGGTAGCTGTTATCCTCCATCTACTC
AAAGAGCCCAGCAGTCAATT GTTTTCGAAGCCCGAGGT GAT AAAGCAGAAAT ACGAGACG
GGGCCTTGCAAGGCTGATGTGGTGGACAGTGAGACTGTGGTACGGGCTCGTGGGTTGCC
GTGGCAGTCATCAGACCAGGACGTGGCTCGCTTCTTCAAAGGGCTCAACGTGGCCAGGG
GTGGTGTAGCACTCTGCCTCAACGCCCAGGGCCGCAGAAATGGCGAGGCCCTCATCCGC
TTTGTGGACAGCGAGCAGCGGGACCTAGCGCTGCAGAGACACAAGCACCACATGGGCGT
CCGCTATATTGAGGTGTATAAAGCGACAGGGGAGGAGTTTGTAAAGATTGCAGGGGGCAC
ATCACTAGAGGTGGCTCGTTTCTTGTCACGGGAAGACCAAGTGATCCTGCGGCTGCGGGG
ACTGCCCTTCTCGGCTGGGCCAACGGACGTGCTTGGCTTCCTGGGGCCAGAGTGCCCAG
TGACTGGGGGTACCGAGGGGCTGCTCTTTGTGCGCCATCCTGATGGCCGGCCGACTGGT
GATGCCTTCGCCCTCTTTGCTTGTGAGGAGCTGGCACAGGCTGCACTGCGCAGGCACAAG
GGCATGCTGGGTAAGCGATACATTGAACTCTTCCGGAGCACTGCAGCCGAAGTGCAGCAG
GTCTTGAACCGCTATGCATCCGGCCCACTCCTTCCTACACTGACTGCCCCACTGCTGCCCA
TCCCCTTCCCACTGGCACCTGGGACTGGGAGGGACTGTGTACGCCTCCGAGGCCTGCCC
TACACGGCCACCATTGAAGACATCCTGAGCTTTCTGGGGGAGGCAGCAGCTGACATTCGG
CCCCACGGTGTACACATGGTGCTCAACCAGCAGGGCCGGCCATCGGGCGATGCCTTCATT
CAGAT GACATCAGCAGAGCGAGCCCT AGCTGCTGCTCAGCGTTGCCAT AAGAAGGTGAT G
AAGGAGCGCTACGTGGAGGTGGTCCCCTGTTCCACAGAGGAGATGAGCCGAGTGCTGAT
GGGGGGCACCTTGGGCCGCAGTGGCATGTCCCCTCCACCCTGCAAGCTGCCCTGCCTCT
CACCACCTACCTACACCACCTTCCAAGCCACCCCAACGCTCATTCCCACGGAGACGGCAG
CTCTATACCCCTCTTCAGCACTGCTCCCAGCTGCCAGGGTGCCTGCTGCCCCCACCCCTG
TTGCCT ACT ATCCAGGGCCAGCCACTCAACT CT ACCTGAACT ACACAGCCT ACT ACCCAAG
CCCCCCAGTCTCCCCCACCACTGTGGGCTACCTCACTACACCCACTGCTGCCCTGGCCTC
TGCTCCCACCTCAGTGTTGTCCCAGTCAGGAGCCTTGGTCCGCATGCAGGGTGTCCCATA
CACGGCTGGTATGAAGGATCTGCTCAGCGTCTTCCAGGCCTACCAGCTACCCGCTGATGA
CTACACCAGTCTGATGCCTGTTGGTGACCCACCTCGCACTGTGTTACAAGCCCCCAAGGA
ATGGGTGTGTTTGTAGGAGAGAAAGCCAGGAGGTAAGAGCCAGCTGATATCCTCGGCGAA
CATGTCTCTCCTGAGTCCAGAAGACCAGCACCCTCAACCTGGTAGCTTCTTTCTGGCTTGT
CAAAGCTCTCAGAAGGTACCTAGAGGAGCCCAAGCCCCAGCTCCATCCTCCACTTATTCTG
CCTGTTTCCCCCAAAGACAATGGCTGGACCCTGCATGCAGGGCTGGGGGTGGAATGGGG
CT AACCAGCTCCT GAT GGCCTGAGCCAGGCAT CTT GACT GGCACCTGGAGAGCCCTT AAG
TCTGTCCTGGCTGTGGCCCATGCCGACAGATATCGTGGGGCTGACAGGTCCACGGCAGG
CTT GCTTTCTTTT AT AAAATGGAAGCTCTGGT ACCTTCAAT GT AT GACTCCT GGGAGAAT CA
AGGGTCCATCTGAGCCTCTGAGTAAAGATCCCAATGTTCTACCTCTCCCTGTCCCTCTTGT
AGGGGATAGGGAGGCAGAGAGAGCCAGCCCCTACCCTCAGAGTATCTGGACCTCAGAGA
CCATGTTGTGCCAGGGGTGGTCCCACCTAAAGATGCTAGCCCCTCTCCAGGTGGGCATAA
GG AGT AACAGATGGCAAAACCACAAACT ATTTT GATGGACTGTGCT GCAGT ATCACCAGAA
GACATTAGGGGGCAGTAGGCCCCCACACAAAACCTTCAGGCTTGAATTTTAAAGGGGAGG
ACTTTCTGCCAACTTTTCTTGTATGCCTTGGGAAAGCCAGTTGCCCTGAACCCAGCAGACA
CCATGGAATGTCCTTTGCACGCATTAAATGGTACAGAACTGAAGCCTCGGAAGCAATTTGG
AACTCGATCTTCTCTTCCTTAAATGAAAAGTTATTGACCAAATGGACTTTTTAAAAGACACAG
GACCCTTAACTTTGCCCCAAAGTGAGGGGCTCCACACCAACCCCAGGCGGAGGAACACTC
AGACAGATT AAGGAT ACT GTT GACCT GTCACTGTTT ATT ATTTCAGCACT AAAACT GAGGAG
CCT CAACT GCT GGCTCTT CTTCCCTTT GT ATTT GTGT AAGG AGCACT GC ACTCCCAT AAAAG
GTTTT AAAATACAAAAT GT ACAAG AACACACAATT CC AAGT GCTGT AAACAT AACT G AG AAC CAGTTCCTTTACTAAACATCCATTTTATAAAACACAAGGTTTCAATTTGAGCCCATCTGAGC
CTTAAAGATCCATTCTGAATACCAAAAACAGGGCTTCACAGCCAGGCCCAGAAGAGGTCTG
GTGATAATGGCTGGCCCTGGGTGGGGATAGTTTACACCCGGGCAGCAGCACCACACATGA
ACCCAAAGACATGTTCTTTTT AAAGCT GTTTTCAGCCAT GTTT CT CT GTGCAT CTCCAGT AA
GCAGAAGGCTACCCATTCCATTCCTCAACCCAAGAGCTAGCACAGTTAGAGTAGGAGGGG
GTGCGT ACT AGCACGTGCCCAGTTGCT CAGTGCT GCT AGT AGAAATTGATTTGCAT AGT CC
AAT GG ATGT GTGCTTT AAC ACCACT ATGTTGCACAAAAATTT AAGTCTTT AT CT ACAAAGCC
AAAAAAT ATT G ACT CTT AACACC AAAGCTTTT ACAAAGCTG AT AT AAAACT GCTTACATAGT A
T ACAAAGCT CT ATTTT AAAATTTAAT GTTT ATTTT AAAT AGGAAAGCATTTCT AGTGCT ACAG
GCATCAAGGTATTTAGAAGGCATCAAAATTTGGTGCATAGCAACTCTGGATCATAGAGGCT
TTTAATTCTTGAGGGCACAAAGGGTATTGCAAGGGGAACTCTTGCAATAACCTCATGTGAG
GCAGCTACACCAGGGGCAAAAGGGTAGGGGCAAGTCTGGCCATTTCTCTGGAATGTCAAC
CGAGAGGCCAACTTCTTGCCCCTCCAAAGGAAGCTGTGGGCGTCCAACCACAGGCCCAGA
AGCAAAT CT CACT AT CCACATT CTGT G AC ACAACT CACTTTT CAAG AAAATTT G AAAACACC
CAGCTCCAAGAGGGGCCACAGTGATCTGCTGAAGAATAGACCTTTTTCTCTAACTAACTTT
AGGGG AG AAAT CT AAAAT AT ATTTT GTTTTTTTT AAAGACCAT ACTTCCTCATCCT G AGT CAA
CAGCTCCTAACCTACTGACAACAGGTGGTGGGCAATAGGCCAGCTCCCTTTCCCAGACCT
GAACTGGCCTTAGTAGAGAGAGTCCTGGCATCAAGGGCCTGCAGTCTCCTGGAATAACAG
CATCAGGCCTTCAACCAGCACACTGTCTCACATATAGGCACTCAAAAAATCTGCTTCCTGA
ATCAATGGAAGT AT ATT ATTTCATTT GAAAGCAT ACTGCAAACTTCAGAGGCTCTGT AAT GG
GCCCAGGAACAGGTAAAAAAAATCCCATTAGGGAGAGGGGTAAGGGCAGGTTTTTTTTTTT
TTT AAAGT ACCCAACT CGGGT ACCTCCTTT GGT AGACAGCAGGCTGCAGTTT CT GCT GGGC
CCTGCCTTGGACACCAGTCTCACCAGCAGCAGCACCAGGGTGTCTTTGGTGTGGAGGGTC
AGGTT ATCACTTCT GGATGTGCTCAGAGCCTTCT GGGGAAAAGGCTGGTTTTT AGATCAT A
CAGACAGGACAGGGTAGGCCAGAATCATTTCAGGCTATAAATAGAATGGCAGATAAGCCTT
CCATGCCAGT GT G ACTCTT AAAACCTT CCCAT CTGG AGTCCT GT ATTTT CT CTGCCCAT GCT
GAT GT ACTGCTCATTT GT GCTTT AGCT CT GCACACAGCCTGGCCT CT AGCT AGAGTT AGAA
CTGCAAAGCTGCCTAAACCACTGAGACTGGCTTCAAAGGTCACAGAACAGCCAAAGGCAG
ATGCTTCTGTTTGGAAAAGGTTCTACGACCAGATGACACAAACAGGAAGCGCACTCCACAG
CCT ACT AGTTTTT AT G AT GGCAAG AAAT G AAAGT G ACC AAGCTAG AACCCC ACCATT CAGA
GTCACCTTAAATGTAGCCATCTTACCCAGGGTCCTGAGGGAAAAAGCAATTTCAACATGGA
GCCAGT AT GGAGAGATT GCAAGATT ACCT AGAAAGTT ACCAAAAGGCTATGCTCTGGAAT G
T CTTTTT AT ATTCCAACACTT CAAT GATGG AATGGT CT CTT CT CATTTT ATCTAAC AACAGTTT
AGTTTT AT AAAG AGGTAT G AGCT ACATTTGGCTTT ATTTCCT AT AAAT CT AT G AACGTCTT CA
GGACACATGCTGACTTTCTGAGGCATAGGTGTGGGCTTGGGATATTTTTTTCTTTTTCTTTT
TTT CTTTT CTTTTTTTTT CTTTTTTTTTTTTTTTTTTTTTTTTTTGCTT CT AG AAGGTCTT AT CAA
AAGTTCCT ATTTT AAAAATT AT CAT AAAAACT AAAGGGCCCTTCAAAT GACCAT AAAGCAGT A
CAAATCACCAATCCTAGCTAAGTAACCAGGTCACCTGCAAAAGCAGCACCTCGGAAACAAG
AGAGCCTGCTGCATTCACACTCAAAGCACCCATCATATAAAAGTATCCTAGTTAAATATAAA
AAGCAAAGTTCATTTCCCCAAAGCTCAAACAGCCTATGCTGCTCCTGTTCTTTTGCCAAATC
TACCCAAGGCCTGAGGTGGAGGAATGCTACTTTCCCCACAAATGGTGGGTCCCACTCCTG
GCCCCAGACCTGAAGGCTGCAGAGTTGGAAACCCAAGGTCCAAGGAGAGAAACATGCTGA
GAAGTTGGTGGTGGACACAAGGCTGCAGTAAGCACTGTTAGAGCCCATCAGATCTTCCTAA
ATCCAGGGACTCAGGACTCGGGAGGGGAGCCTGCCTGCTCACCCCTGCTCCTTGGGAAA
CAG AAAT CT GGG ACAT GTCT CTCCCAATT AT CTCGTT CACT GAAAAACAAG AAAAGGG AG A
GT G ATT AGT GACCTCTGAGT GATT AGCCAT ATGATGCCCAACGCT GAGCTCT ACCT CAGAC
ATTTCCCTTCCCATGGCTTTCTGTAAAGATAAAGGCAGTGTCTGAAGCCTGCTCCTGAGCT
GAGTGGCATTAGAGATGGAAACATCGCTCCACAAACTACTCTGGACCTCTTTTTCTCTCTCA
TTCAGTTCATTTTGGGTTGGGAAGGGGGCTTACCCTCACTCTAAAGGTATGTTTAAATAAGT ATT CACCTT ACT CT AACTTTT CTTT AATT CAT AT CT CTTT G AG AAAGTTTTT ATTTTCTACAAT GCCACCTCCT ATGT AAATGG AAT G AAAAT AAATGCTTT GGTC AG AAT AAA
SEQ ID NO: 9
MTPPPPPPPPPGPDPAADPAADPCPWPGSLWLFGATAGALGRDLGSDETDLILLVWQVVEP
RSRQVGTLHKSLVRAEAAALSTQCREASGLSADSLARAEPLDKVLQQFSQLVNGDVALLGGG
PYMLCTDGQQLLRQVLHPEASRKNLVLPDMFFSFYDLRREFHMQHPSTCPARDLTVATMAQG
LGLETDATEDDFGVWEVKTMVAVILHLLKEPSSQLFSKPEVIKQKYETGPCKADVVDSETVVRA
RGLPWQSSDQDVARFFKGLNVARGGVALCLNAQGRRNGEALIRFVDSEQRDLALQRHKHHM
GVRYIEVYKATGEEFVKIAGGTSLEVARFLSREDQVILRLRGLPFSAGPTDVLGFLGPECPVTG
GTEGLLFVRHPDGRPTGDAFALFACEELAQAALRRHKGMLGKRYIELFRSTAAEVQQVLNRYA
SGPLLPTLTAPLLPIPFPLAPGTGRDCVRLRGLPYTATIEDILSFLGEAAADIRPHGVHMVLNQQ
GRPSGDAFIQMTSAERALAAAQRCHKKVMKERYVEWPCSTEEMSRVLMGGTLGRSGMSPP
PCKLPCLSPPTYTTFQATPTLIPTETAALYPSSALLPAARVPAAPTPVAYYPGPATQLYLNYTAY
YPSPPVSPTTVGYLTTPTAALASAPTSVLSQSGALVRMQGVPYTAGMKDLLSVFQAYQLPADD
YTSLMPVGDPPRTVLQAPKEWVCL
El término "MAGOH" (también llamado en la literatura MAGOH1; MAGOHA) se refiere tanto al gen como a la proteína humana. MAGOH subunidad del complejo de unión exón. En el contexto de la presente invención, “MAGOH" se define también por una secuencia de nucleótidos o polinucleótidos, que constituye la secuencia“MAGOH", y que comprendería diversas variantes procedentes de: a) Moléculas de ácido nucleico que codifican un polipéptido que comprende la secuencia aminoacídica de la SEQ ID NO: 1 1 , b) Moléculas de ácido nucleico cuya cadena complementaria híbrida con la secuencia polinucleotídica de a), c) Moléculas de ácido nucleico cuya secuencia difiere de a) y/o b) debido a la degeneración del código genético, d) moléculas de ácido nucleico que codifican un polipéptido que comprende la secuencia aminoacídica con una identidad de al menos un 80%, un 90%, un 95%, un 98% o un 99% con la SEQ ID NO: 1 1 en las que el polipéptido codificado por dichos ácidos nucleicos posee la actividad y las características estructurales de la proteína MAGOH. Entre otras posibles secuencias nucleotídicas que codifican MAGOH se encuentra, pero sin limitarse, la SEQ ID NO: 10.
Gene ID: 4116 Localización del gen: 1 p32.3 SEQ ID N° 10
AGCCACTTCCGGGCGAAGAGGTTAGCGAGAAGGAACCCCTCCACGCAGCGACGACGGGA CCTGACGTCACTTCCGCGCGCCGCCGCAAACGTCAGTGTCGGGCGCAGACGGCGGCAGT GCGGCTTGCTCTTGGAAGTTCAGGCTCGGTTGTCTTTTGGGAGCCATGGAGAGTGACTTTT ATCTGCGTTACTACGTGGGGCACAAGGGCAAGTTCGGCCACGAGTTCCTGGAGTTTGAGT TTCGACCGGACGGGAAGTT AAGATATGCCAACAACAGCAATT ACAAGAAT GAT GT CAT GAT CAGAAAAGAGGCTT AT GT ACATAAAAGCGT GAT GGAGGAACT GAAGAGAAT AATT GACGAC AGT GAAATT ACCAAAGAGGATGATGCATTGTGGCCT CCTCCT GACCGAGT GGGCCGGCAG GAGCTT G AAATCGTCATT GG AG AT G AACACATTT CTTTT AC AACAT CAAAAATT GGTTCCCT TATTGATGTCAATCAATCCAAGGATCCAGAAGGCTTACGAGTATTTTATTATCTTGTCCAGG ACCT G AAGT GTTTGGTCTT CAGTCTT ATT GG ATT ACACTT CAAG ATT AAACCAAT CT AGACT GAATATTGGTGTGGACATGGGGGGTGGGTGGGAGTAGAAAATTTTGTGTATATCAGGGCA GT ATTTTTTT AT GAACTAT AAAT G ATT GT CTTT AAT AAAT AT GT G AT AAAATCCAATTTTT ATT A TTTT AT AAAG ACCT G AACAT GT G AAAAAAAAAAAAAAAAAA
SEQ ID N° 1 1
M ESDFYLRYYVGH KGKFGH EFLEFEFRPDGKLRYAN NSNYKN DVM I RKEAYVH KSVM EELKRI IDDSEITKEDDALWPPPDRVGRQELEIVIGDEHISFTTSKIGSLIDVNQSKDPEGLRVFYYLVQDL KCLVFSLIGLHFKI KPI
El término "SND (también llamado en la literatura p100; TDRD11; Tudor-SN) se refiere tanto al gen como a la proteína humana. El gen SND1 codifica un coactivador transcripcional que interactúa con el dominio ácido del antígeno nuclear 2 del virus de Epstein-Barr (EBNA 2), un activador transcripcional que se requiere para la transformación de los linfocitos B. También se cree que esta proteína es esencial para el crecimiento celular normal. En el contexto de la presente invención, “SND1" se define también por una secuencia de nucleótidos o polinucleótidos, que constituye la secuencia“SND1", y que comprendería diversas variantes procedentes de: a) Moléculas de ácido nucleico que codifican un polipéptido que comprende la secuencia aminoacídica de la SEQ ID NO: 13, b) Moléculas de ácido nucleico cuya cadena complementaria híbrida con la secuencia polinucleotídica de a), c) Moléculas de ácido nucleico cuya secuencia difiere de a) y/o b) debido a la degeneración del código genético, d) moléculas de ácido nucleico que codifican un polipéptido que comprende la secuencia aminoacídica con una identidad de al menos un 80%, un 90%, un 95%, un 98% o un 99% con la SEQ ID NO: 13 en las que el polipéptido codificado por dichos ácidos nucleicos posee la actividad y las características estructurales de la proteína SND1. Entre otras posibles secuencias nucleotídicas que codifican SND1 se encuentra, pero sin limitarse, la SEQ ID NO: 12.
Gene ID: 27044
Localización del gen: 7q32.1
SEQ ID N° 12
ATATTTAGCCCATCCTTGCAAATCAACTCTTTCAGCGCTTCCTGGAACTCACCACCGTTTTG
GGGACCAAGAGGCGGGGCTCCGCGAGCAGGGTGCCTATTGGCCTGAGGGCCGGCGGGC
TCTGGGCGCTAATTGGGCGGAGGGCGGTGGCGCTCTGGCACGCTTGCGCGGCGAGTAGA
ACGTGTGGCGGCGGCGGAGATCGCGTCTCTTTCGCTCCGTGTCCCGCTGCTGCTCCTGT
GAGCGCCCGGCGAGTCCGTCCCGTCCACCGTCCGCAGCTGGTAGCCAGCCTGCCCCTCG
CCTCGACTCCCTTTCACCAACACCGACACCCACATTGACACCTCCAGTCCGGCCAGCCGC
TCCACTCGTTGCCTTTGCATCTCCACACATGGCGTCCTCCGCGCAGAGCGGCGGCTCCTC
CGGGGGACCCGCGGTCCCCACCGTGCAGCGGGGCATCATCAAGATGGTCCTCTCAGGGT
GCGCCATCATTGTCCGAGGTCAGCCTCGTGGTGGGCCTCCTCCTGAGCGGCAGATCAACC
TCAGCAACATTCGTGCTGGAAATCTTGCTCGCCGGGCAGCCGCCACACAACCTGATGCAA
AGGATACCCCTGATGAGCCCTGGGCATTTCCAGCTCGAGAGTTCCTTCGAAAGAAGCTGA
TTGGGAAGGAAGTCT GTTTCACGAT AGAAAACAAGACT CCCCAGGGGCGAGAGT AT GGCA
TGATCTACCTTGGAAAAGATACCAATGGGGAAAACATTGCAGAATCACTGGTTGCAGAGGG
CTT AGCCACCCGGAGAGAAGGCAT GAGAGCT AAT AATCCT GAGCAGAACCGGCTTTCAGA
ATGTGAAGAACAAGCAAAGGCAGCCAAGAAAGGGATGTGGAGTGAGGGGAACGGTTCACA
TACTATCCGGGATCTCAAGTATACCATTGAAAACCCAAGGCACTTTGTGGACTCACACCAC
CAGAAGCCTGTTAATGCTATCATCGAGCATGTGCGGGACGGCAGTGTGGTCAGGGCCCTG
CTCCTCCCAGATTACTACCTGGTTACAGTCATGCTGTCAGGCATCAAGTGCCCAACTTTTC
GACGGGAAGCAGATGGCAGTGAAACTCCAGAGCCTTTTGCTGCAGAAGCCAAATTTTTCAC
TGAGTCGCGACTGCTTCAGAGAGATGTTCAGATCATTCTGGAGAGCTGCCACAACCAGAA
CATTCTGGGTACCATCCTTCATCCAAATGGCAACATCACAGAGCTCCTCCTGAAGGAAGGT
TTCGCACGCT GTGT GGACT GGTCGATT GCAGTTT ACACCCGGGGCGCAGAAAAGCT GAGG
GCGGCAGAGAGGTTTGCCAAAGAGCGCAGGCTGAGAATATGGAGAGACTATGTGGCTCC
CACAGCT AATTT GG ACC AAAAGG ACAAGCAGTTT GTTGCCAAGGT G ATGCAGGTT CT G AAT
GCT GATGCC ATT GTTGT G AAGCT G AACT CAGGCG ATT ACAAG ACG ATT CACCT GTCCAGC A
TCCGACCACCGAGGCTGGAGGGGGAGAACACCCAGGATAAGAACAAGAAACTGCGTCCC
CT GT AT GACATTCCTT ACAT GTTT GAGGCCCGGGAATTTCTTCGAAAAAAGCTT ATTGGGAA
GAAGGTCAATGTGACGGTGGACTACATTAGACCAGCCAGCCCAGCCACAGAGACAGTGCC
TGCCTTTTCAGAGCGTACCTGTGCCACTGTCACCATTGGAGGAATAAACATTGCTGAGGCT
CTTGTCAGCAAAGGTCTAGCCACAGTGATCAGATACCGGCAGGATGATGACCAGAGATCA
TCACACTACGATGAACTGCTTGCTGCAGAGGCCAGAGCTATTAAGAATGGCAAAGGATTGC
AT AGCAAGAAGGAAGT GCCT ATCCACCGT GTTGCAGAT AT ATCT GGGGAT ACCCAAAAAGC
AAAGCAGTTCCTGCCTTTTCTTCAGCGGGCAGGTCGTTCTGAAGCTGTGGTGGAATACGTC
TTCAGTGGTTCTCGTCTCAAACTCTATTTGCCAAAGGAAACTTGCCTTATCACCTTCTTGCT
TGCAGGCATTGAATGCCCCAGAGGAGCCCGAAACCTCCCAGGCTTGGTGCAGGAAGGAG
AGCCCTTCAGCGAGGAAGCTACACTTTTCACCAAGGAACTGGTGCTGCAGCGAGAGGTGG
AGGTGGAGGTGGAGAGCATGGACAAGGCCGGCAACTTTATCGGCTGGCTGCACATCGAC
GGTGCCAACCTGTCCGTCCTGCTGGTGGAGCACGCGCTCTCCAAGGTCCACTTCACCGCC
GAACGCAGCTCCTACTACAAGTCCCTGCTGTCTGCCGAGGAGGCCGCAAAGCAGAAGAAA GAGAAGGTCTGGGCCCACTATGAGGAGCAGCCCGTGGAGGAGGTGATGCCAGTGCTGGA
GG AGAAGG AGCG AT CTGCT AGCT ACAAGCCCGT GTTTGT G ACTG AGAT CACTG AT G ACCT
GCACTTCTACGTGCAGGATGTGGAGACCGGCACCCAGTTGGAGAAGCTGATGGAGAACAT
GCGCAATGACATTGCCAGTCACCCCCCTGTAGAGGGCTCCTATGCCCCCCGCAGGGGAG
AGTTCTGCATT GCCAAATTT GT AGATGGAGAAT GGT ACCGTGCCCGAGT AGAGAAAGTCGA
GTCTCCTGCCAAAATACATGTCTTCTACATTGACTACGGCAACAGAGAGGTCCTGCCATCC
ACCCGCCTGGGTACCCTATCACCTGCCTTCAGCACTCGGGTGCTGCCAGCTCAAGCCACG
GAGTATGCCTTCGCCTTCATCCAGGTGCCCCAAGATGATGATGCCCGCACGGACGCCGTG
GACAGCGT AGTTCGGGAT AT CCAGAACACT CAGTGCCTGCTCAACGTGGAACACCT GAGT
GCCGGCTGCCCCCATGTCACCCTGCAGTTTGCAGATTCCAAGGGCGATGTGGGGCTGGG
CTTGGTGAAGGAAGGGCTGGTCATGGTGGAGGTGCGCAAGGAGAAACAGTTCCAGAAAGT
GATCACAGAATACCTGAATGCCCAAGAGTCAGCCAAGAGCGCCAGGCTGAACCTGTGGCG
CT ATGGAGACTTTCGAGCT GATGATGCAGACGAATTTGGCT ACAGCCGCT AAGGAGGGGA
TCGGGTTTGGCCCCCAGCCCCGCTCACGCCAGTCCCTCTTCCTCTGCCGGGAGGGTGTTT
TCAACTCCAAACCCCAGAGAGGGGTTGTAGATTGGGTCCAGCTTTGCTTCAGTGTGTGGAA
ATGTCTCGTGGGGTGGCATCGGGGCTGCGGGGTGGGGACCCCAAGGCTTTCTGGGGCAG
ACCCTTGTCCTCTGGGATGATGGGCACTGCTATCCACAGTCTCTGCCAGTTGGTTTTATTT
GGAGGTTTGTGGGCTTTTTTTAAAAAAAAAAAGTCCTCAAATCAGGAAGAAACATCAAAGAC
TATGTCCTAGTGGAGGGAGTAATCCTAACACCCAGGCTGGCCGCCAGCTGGCACCTGCCT
CT ATCCCAGACTGCCCTCGTCCCAGCT CT CT GTCCAACTGTT G ATT ATGT G ATTTTT CT G AT
ACGTCCATTCTCAAATGCCAGTGTGTTCACATCTTCGCTCTGGCCAGCCCATTCTGTATTTA
AAGCTTTTGAGGCCCAATAAAATAGTACGTGCTGTCTGCAGCCCTTATTGATCACAAAAAAA
AAA
SEQ ID N° 13
MASSAQSGGSSGGPAVPTVQRGIIKMVLSGCAIIVRGQPRGGPPPERQINLSNIRAGNLARRAA
ATQPDAKDTPDEPWAFPAREFLRKKLIGKEVCFTIENKTPQGREYGMIYLGKDTNGENIAESLV
AEGLATRREGMRANNPEQNRLSECEEQAKAAKKGMWSEGNGSHTIRDLKYTIENPRHFVDSH
HQKPVNAIIEHVRDGSVVRALLLPDYYLVTVMLSGIKCPTFRREADGSETPEPFAAEAKFFTESR
LLQRDVQIILESCHNQNILGTILHPNGNITELLLKEGFARCVDWSIAVYTRGAEKLRAAERFAKER
RLRIWRDYVAPTANLDQKDKQFVAKVMQVLNADAIVVKLNSGDYKTIHLSSIRPPRLEGENTQD
KNKKLRPLYDIPYMFEAREFLRKKLIGKKVNVTVDYIRPASPATETVPAFSERTCATVTIGGINIAE
ALVSKGLATVIRYRQDDDQRSSHYDELLAAEARAIKNGKGLHSKKEVPIHRVADISGDTQKAKQ
FLPFLQRAGRSEAWEYVFSGSRLKLYLPKETCLITFLLAGIECPRGARNLPGLVQEGEPFSEEA
TLFTKELVLQREVEVEVESMDKAGNFIGWLHIDGANLSVLLVEHALSKVHFTAERSSYYKSLLSA
EEAAKQKKEKVWAHYEEQPVEEVMPVLEEKERSASYKPVFVTEITDDLHFYVQDVETGTQLEK
LMENMRNDIASHPPVEGSYAPRRGEFCIAKFVDGEWYRARVEKVESPAKIHVFYIDYGNREVL
PSTRLGTLSPAFSTRVLPAQATEYAFAFIQVPQDDDARTDAVDSVVRDIQNTQCLLNVEHLSAG
CPHVTLQFADSKGDVGLGLVKEGLVMVEVRKEKQFQKVITEYLNAQESAKSARLNLWRYGDF
RADDADEFGYSR
El término "S SF2" (también llamado en la literatura SC35; PR264; SC-35; SFRS2; SFRS2A; SRp30b) se refiere tanto al gen como a la proteína humana. La proteína codificada por el gen SRSF2 es un miembro de la familia rica en serina / arginina (SR) de factores de empalme de pre- ARNm, que constituyen parte del espliceosoma. Cada uno de estos factores contiene un motivo de reconocimiento de ARN (RRM) para unirse al ARN y un dominio RS para unirse a otras proteínas. El dominio RS es rico en residuos de serina y arginina y facilita la interacción entre diferentes factores de splicing de SR. Además de ser crítico para el splicing del ARNm, también se ha demostrado que las proteínas SR están involucradas en la exportación del ARNm desde el núcleo y en la traducción. Se han encontrado dos variantes de transcripción que codifican la misma proteína y una variante de transcripción no codificante para este gen. En el contexto de la presente invención, “SRSF2" se define también por una secuencia de nucleótidos o polinucleótidos, que constituye la secuencia“SRSF2", y que comprendería diversas variantes procedentes de: a) moléculas de ácido nucleico que codifican un polipéptido que comprende la secuencia aminoacídica de la SEQ ID NO: 15, b) Moléculas de ácido nucleico cuya cadena complementaria híbrida con la secuencia polinucleotídica de a), c) Moléculas de ácido nucleico cuya secuencia difiere de a) y/o b) debido a la degeneración del código genético, d) Moléculas de ácido nucleico que codifican un polipéptido que comprende la secuencia aminoacídica con una identidad de al menos un 80%, un 90%, un 95%, un 98% o un 99% con la SEQ ID NO: 15 en las que el polipéptido codificado por dichos ácidos nucleicos posee la actividad y las características estructurales de la proteína SRSF2. Entre otras posibles secuencias nucleotídicas que codifican SRSF2 se encuentra, pero sin limitarse, la SEQ ID NO: 14.
Gene ID: 6427
Localización del gen: 17q25.1
SEQ ID N° 14
AGAAGGTTTCATTTCCGGGTGGCGCGGGCGCCATTTTGTGAGGAGCGATATAAACGGGCG
CAGAGGCCGGCTGCCCGCCCAGTTGTTACTCAGGTGCGCTAGCCTGCGGAGCCCGTCCG
TGCTGTTCTGCGGCAAGGCCTTTCCCAGTGTCCCCACGCGGAAGGCAACTGCCTGAGAGG
CGCGGCGTCGCACCGCCCAGAGCTGAGGAAGCCGGCGCCAGTTCGCGGGGCTCCGGGC
CGCCACTCAGAGCTATGAGCTACGGCCGCCCCCCTCCCGATGTGGAGGGTATGACCTCC
CTCAAGGTGGACAACCTGACCTACCGCACCTCGCCCGACACGCTGAGGCGCGTCTTCGA
GAAGTACGGGCGCGTCGGCGACGTGTACATCCCGCGGGACCGCTACACCAAGGAGTCCC
GCGGCTTCGCCTTCGTTCGCTTTCACGACAAGCGCGACGCTGAGGACGCTATGGATGCCA
TGGACGGGGCCGTGCTGGACGGCCGCGAGCTGCGGGTGCAAATGGCGCGCTACGGCCG
CCCCCCGGACTCACACCACAGCCGCCGGGGACCGCCACCCCGCAGGTACGGGGGCGGT
GGCTACGGACGCCGGAGCCGCAGCCCTAGGCGGCGTCGCCGCAGCCGATCCCGGAGTC
GGAGCCGTTCCAGGTCTCGCAGCCGATCTCGCTACAGCCGCTCGAAGTCTCGGTCCCGC
ACTCGTTCTCGATCTCGGTCGACCTCCAAGTCCAGATCCGCACGAAGGTCCAAGTCCAAG
TCCTCGTCGGTCTCCAGATCTCGTTCGCGGTCCAGGTCCCGGTCTCGGTCCAGGAGTCCT CCCCCAGTGTCCAAGAGGGAATCCAAATCCAGGTCGCGATCGAAGAGTCCCCCCAAGTCT CCT GAAGAGGAAGGAGCGGT GTCCTCTT AAGAAAAT GAT GT ATCGGCAAGCAGT GT AAAC GGAGGACTTGGGGAAAAAGGACCACATAGTCCATCGAAGAAGAGTCCTTGGAACAAGCAA CTGG CT ATT G AAAAGGTT ATTTT GT AAC ATTT GT CT AACTTTTT ACTT GTTT AAGCTTTGCCT CAGTT GGCAAACTT CATTTT AT GTGCCATTTTGTTGCTGTT ATT CAAATTT CTT GT AATTT AG T GAGGT G AACG ACTT CAG ATTT CATT ATT GG ATTT GG AT ATTT G AGGT AAAATTT CATTTT GT T AT AT AGTGCT G ACTTTTTTT GTTT G AAATT AAACAG ATT GGT AACCTAATTT GTGGCCTCCT GACTTTT AAGGAAAACGT GTGCAGCCATT ACACACAGCCT AAAGCTGTCAAGAGATTGACT CGGCATTGCCTT CATTCCTT AAAATT AAAAACCTACAAAAGTTGGT GT AAATTT GTATAT GTT ATTT ACCTT CAG ATCT AAAT GGT AATCTG AACCCAAATTT GT AT AAAG ACTTTT CAGGT GAAA AG ACTT GATTTTTT G AAAGG ATT GTTT AT CAAACACAATT CT AAT CT CTTCTCTT ATGT ATTTT TGTGCACTAGGCGCAGTTGTGTAGCAGTTGAGTAATGCTGGTTAGCTGTTAAGGTGGCGT GTTGCAGTGCAGAGTGCTTGGCTGTTTCCTGTTTTCTCCCGATTGCTCCTGTGTAAAGATG CCTT GTCGTGC AG AAACAAAT GGCTGTCCAGTTT ATT AAAATGCCT G AC AACT GC ACTTCCA GTCACCCGGGCCTT GCAT AT AAAT AACGGAGCAT ACAGT GAGCACAT CT AGCT GAT GAT AA AT ACACCTTTTTTTCCCTCTT CCCCCT AAAAATGGT AAAT CT GAT CAT ATCTACATGT AT G AA CTT AACATGG AAAAT GTT AAGG AAGCAAATGGTT GT AACTTT GT AAGTACTT AT AACATGGT GT AT CTTTTTGCTT AT G AAT ATT CT GT ATT AT AACC ATT GTTT CTGT AGTTT AATT AAAACATT TT CTTGGT GTT AGCTTTT CT CAGAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAA AA
SEQ ID N° 15
MSYGRPPPDVEGMTSLKVDNLTYRTSPDTLRRVFEKYGRVGDVYIPRDRYTKESRGFAFVRF
HDKRDAEDAMDAMDGAVLDGRELRVQMARYGRPPDSHHSRRGPPPRRYGGGGYGRRSRS
PRRRRRSRSRSRSRSRSRSRSRYSRSKSRSRTRSRSRSTSKSRSARRSKSKSSSVSRSRSR
SRSRSRSRSPPPVSKRESKSRSRSKSPPKSPEEEGAVSS
El término "SRSF3" (también llamado en la literatura SFRS3; SRp20) se refiere tanto al gen como a la proteína humana. La proteína codificada por el gen SRSF2 es un miembro de la familia rica en serina / arginina (SR) de factores de empalme de pre-ARNm, que constituyen parte del espliceosoma. Cada uno de estos factores contiene un motivo de reconocimiento de ARN (RRM) para unirse al ARN y un dominio RS para unirse a otras proteínas. El dominio RS es rico en residuos de serina y arginina y facilita la interacción entre diferentes factores de splicing de SR. Además de ser crítico para el splicing del ARNm, también se ha demostrado que las proteínas SR están involucradas en la exportación del ARNm desde el núcleo y en la traducción. Se han encontrado dos variantes de transcripción que codifican la misma proteína y una variante de transcripción no codificante para este gen. En el contexto de la presente invención,“SRSF3" se define también por una secuencia de nucleótidos o polinucleótidos, que constituye la secuencia “SRSF3", y que comprendería diversas variantes procedentes de: a) Moléculas de ácido nucleico que codifican un polipéptido que comprende la secuencia aminoacídica de la SEQ ID NO: 17, b) Moléculas de ácido nucleico cuya cadena complementaria híbrida con la secuencia polinucleotídica de a), c) Moléculas de ácido nucleico cuya secuencia difiere de a) y/o b) debido a la degeneración del código genético, d) Moléculas de ácido nucleico que codifican un polipéptido que comprende la secuencia aminoacídica con una identidad de al menos un 80%, un 90%, un 95%, un 98% o un 99% con la SEQ ID NO: 17 en las que el polipéptido codificado por dichos ácidos nucleicos posee la actividad y las características estructurales de la proteína SRSF3. Entre otras posibles secuencias nucleotídicas que codifican SRSF3 se encuentra, pero sin limitarse, la SEQ ID NO: 16.
Gene ID: 6428
Localización del gen: 6p21.31-p21.2
SEQ ID N°16
AT GT GATT CCAGT ATGGCGT AT AAAT AAAGGCGAGGAGAAGGCGGTGGTCCGCCATTTCG TGGACGCCGGGTGAGTGAGAGAGTTGGTTGGTGTTGGGCCGGAGGAAAGCGGGAAGACT CATCGGAGCGTGTGGATTT GAGCCGCCGCATTTTTT AACCCT AGAT CT CGAAATGCAT CGT GATTCCTGTCCATTGGACTGTAAGGTTTATGTAGGCAATCTTGGAAACAATGGCAACAAGA CGGAATTGGAACGGGCTTTTGGCTACT AT GGACCACTCCGAAGT GT GT GGGTTGCT AGAA ACCCACCCGGCTTTGCTTTTGTTGAATTTGAAGATCCCCGAGATGCAGCTGATGCAGTCCG AGAGCTAGATGGAAGAACACTATGTGGCTGCCGTGTAAGAGTGGAACTGTCGAATGGTGA AAAAAGAAGTAGAAATCGTGGCCCACCTCCCTCTTGGGGTCGTCGCCCTCGAGATGATTAT CGTAGGAGGAGTCCTCCACCTCGTCGCAGATCTCCAAGAAGGAGAAGCTTCTCTCGCAGC CGGAGCAGGTCCCTTTCTAGAGATAGGAGAAGAGAGAGATCGCTGTCTCGGGAGAGAAAT CACAAGCCGTCCCGATCCTTCTCTAGGTCTCGTAGTCGATCTAGGTCAAATGAAAGGAAAT AG AAG AC AGTTTGCAAG AG AAGTGGTGT ACAGG AAATT ACTT CATTT G ACAGG AGT ATGTA CAG AAAATT CAAGTTTT GTTT G AG ACTT CAT AAGCTTGGT G CATTTTT AAGAT GTTTT AGCT G TT CAAAT CT GTTT GTCT CTT G AAACAGT G ACAC AAAGGT GT AATT CT CT ATGGTTT G AAAT G GAT CAT ACG AGGCATGT AAT ACCAAG AATT GTT ACTTT AC AATGTTCCCTT AAGC AAAATT G AATTTGCTTTGAACTTTTAGTTATGCACAGACTGATAATAAACCTCTAAACCTGCCCAGCGG AAGTGT GTTTTTTTTT AAATTT AAATACAGAAAC AACT GGC AAAAATT G AACT AAG ATTTACT TTTTTTTCCAT AGCT GGG AT AT AGGCTGCAGCTAT AGTT GAAC AAGCAGT CTTT AAAAACT G CTGTGAAACACAGGCCATCAGGGAAAACGAAATGCTGCACTATTAAATTAGAGGTTTTTGA AAAAT CCAACT CTCAT CCTGGGCAGAGGTTGCCT AGTTGGT AT AGAAT GTT AAGTTTCAAGA AAGTTT ACCTTTGCTTT AGGTCAT AAGTTCCTT ATTT GATTGCTGT AT ATGGAT ACAT GGCT G TTCGTGACATTCTTTATGTGCAAATTTGTGATTTCAAAAATGTCCTGCCAGTTTAAGGGTAC ATT GT AGAGCCGAACTTT GAGTT ACTGTGCAAG ATTTTTTTTT CAT GCTGTCATTTGT AAT AT GTTTT GT G AG AATCCTTGGG ATT AAAGTTTTGGTT ACAAATT GTT CTTT AACTT GAAAGCCT G TTTTTCCTTGCAAACTCAAATCTGTGAGCTTGGTACCAAGTCCAGGTATAACATTCCTATTG GAAGCCAT ACTT AT ATTTT CTT GT AAAGTGCTTTTGAATT AATAAAAT ATT AGCAT AATT GT GT AT AGT CAGTT GAACCCACT GTT ACCATT GTTCTT AT CCCATGGGAAGCAGTT GGTT ACACGA TT CTT ATTTT AT AAGAAACAGCTG AG AGGCACT AT GG ATT AGTCTT CT G AAGTG AAGG AAAT AT AGAT GTCACCT AAGT GAT AGTT AACCCATTTTTTTTTTTTTT AGGCAT AGAAGCCAGTTCA GGGTCCAT AAT ATTT AGT GACCAACATTTT AAAGT AT AGCAGC AACCTGGTT CTT AAACAC A AAGTAAGTTGCCCATTAACAAATGGCTTTTATCTTTAGCATGAAAACTTTCCACAGGTCTAA AAATTGCTTCCATTTTATAATTTGAGGTGTTGCATGGGAATTCTAAGCTGATCCATCATGAT GT AAAAGTTCACAAT ATGGTTCAAAT GT AACAGTGCAGAATT GAAT ATGGAGGCATGCAT AA CCTTCCT CTT AG AAAAT GGC AGGT GTTGT AATTT CAAATTTTT GTGCAATT AG ATT AAAT CAT AAT GC AACAGTCTT GTGGCTT AGTTT CCTT AAAT AT GCTCTT AAGAT AGTTTT GG ATT ATGC GGTATT GACT GTCTT AAAT AT GAAAG AT AAGTCATT GC ATT AAG AGTT CAAGCT AAATGG AT ACATT AAGAT ACAGTTCCT AAACAAATT ATTT ATTTCCACCTTTT ACAC AAAT CTTGGG AG AA TTGGTGTCAGGAAGGTTCAGCCTTAAAGTTAAGCATGTTCAAGAAAGACACTTTTCAGACA GCCTGTTTATTTACTGAGAGCTCTGGCATTGGGCATTTTGTCTTTAGTATTCTCACATAGCC T ACAACCT GTTCCT GTT AGGAACAAGCCAAGATAGCT AAGAAGTT ACGGAAGCCATGCAAT AT GTCAATT ACATTGCTTTTT AT AAATGGACAACTT AT GT GGGCATTTTT GGGCAGT AT AT GA CTTCCTT GCAGGCTCTT AAGTT GGAAGGGTTTCTGT AAAAAGGACAGTT ACGGGT AT AAT AT GG CT AAG AG AAAT AAT ACAG AACCT G AAAT AAAAGT AACTT CACC AGGG AGTT ATCCT G AC TTAGGTGACATACAGTCCCAGTTGGCAGTTACTTTAACCAGGAGCCCTAGCATAACCTCAA GACT CTT AG AAACTTT AG AACATGG AAATT GTT AAAAGCTTT GAATT GCAC ATTT AGATT GTG GCT ATT AGG AATTTTT AAAGTT GT AATTCCT AAAAT AACAGGTCACACT AACCGGTCTTGTC CAT ATTCAGGGTTGAGT GT AAAAAT GAAAGGAATCACAAAACT GAACTT AGACCT GTGGTTT AAGG AT CAAGGT GTT CACTAG AAGTCACTGTT ACT AATACTT G AT G ACAAT GT AAAGAAACA TTAAGGATTATATTTGATTGTTTTCAAAGACACTGGCTGGATGTGGTGGCTCACACTTGTAA TTCCTAGCACTTTGGGAGGCTAGGGCGGGTGGGAGGATCTCTTGAAGCCAGGAGTTGGA GACCAGT CT GCCC AACATGGCAAG ATT CACATTT CT ATT AAAAGG AAT ATTTAGTTT G A
SEQ ID N°17
MHRDSCPLDCKVYVGNLGNNGNKTELERAFGYYGPLRSVWVARNPPGFAFVEFEDPRDAAD
AVRELDGRTLCGCRVRVELSNGEKRSRNRGPPPSWGRRPRDDYRRRSPPPRRRSPRRRSFS
RSRSRSLSRDRRRERSLSRERNHKPSRSFSRSRSRSRSNERK
El término "SRRM (también llamado en la literatura 160-KD; POP101; SRM160) se refiere tanto al gen como a la proteína humana. En el contexto de la presente invención,“SRRM1" se define también por una secuencia de nucleótidos o polinucleótidos, que constituye la secuencia “SRRM1", y que comprendería diversas variantes procedentes de: a) Moléculas de ácido nucleico que codifican un polipéptido que comprende la secuencia aminoacídica de la SEQ ID NO: 19, b) Moléculas de ácido nucleico cuya cadena complementaria híbrida con la secuencia polinucleotídica de a), c) Moléculas de ácido nucleico cuya secuencia difiere de a) y/o b) debido a la degeneración del código genético, d) Moléculas de ácido nucleico que codifican un polipéptido que comprende la secuencia aminoacídica con una identidad de al menos un 80%, un 90%, un 95%, un 98% o un 99% con la SEQ ID NO: 19 en las que el polipéptido codificado por dichos ácidos nucleicos posee la actividad y las características estructurales de la proteína SRRM1. Entre otras posibles secuencias nucleotídicas que codifican SRRM1 se encuentra, pero sin limitarse, la SEQ ID NO: 18.
Gene ID: 10250
Localización del gen: 1 p36.1 1
SEQ ID N° 18
GGAGTTTAGGGCCTGACAGAAGCCCGCCCCCGCTGGCGCTCGTGCGCACGCGTGGCGG
GCTCTCGGCGCACTGAGCAGGCGCGGCCTCGTGTCGGCCGGAGGGGGCGGGCGCAACG
ACGCGCGCTGCGTCCCGGCGCTCGGCTTTCCCTCCGCCGGTCCCGCCCTCCGTCGCGGC
GGCGCGGTGTACCCTGGGATAGGGAGCGATCTCCGAGCGAGGCGGCAAGATGGACGCG
GGATTTTTCCGCGGAACAAGTGCAGAACAGGATAATCGGTTCAGCAACAAACAGAAGAAAC
TACTGAAGCAGCTGAAATTTGCAGAATGCCTAGAAAAAAAGGTGGACATGAGCAAAGTAAA
TTT GG AGGTT AT AAAGCCTT GG AT AACAAAAAGAGT AACGG AAATCCTTGGGTTT G AAG AT
GAT GTT GT G ATT GAGTTT AT ATT CAACCAGCTGG AAGT G AAG AATCCAGACTCCAAAAT G AT
GC AAAT CAACCT G ACTGG ATTTTT G AAT GG AAAAAATGCTCG AG AATTT AT GGG AGAACTGT
GGCCCCTGCTGCTAAGTGCACAAGAAAACATCGCGGGAATCCCTTCTGCTTTCCTAGAACT
GAAGAAAG AAG AAAT AAAACAAAGACAGATT G AACAAG AAAAACT GGC AT CT AT GAAAAAG
CAAGATGAAGACAAAGATAAAAGAGATAAGGAAGAAAAAGAAAGCAGCAGAGAAAAAAGG
GAGCGGTCTCGTAGCCCAAGAAGACGCAAATCCAGATCTCCTTCCCCTAGAAGACGATCTT
CCCCTGT CAGG AGAG AGAG AAAGCGCAGT CATT CT CG AT CTCCCCGTCACAG AACCAAG A
GCCGGAGTCCTTCCCCTGCTCCAGAAAAGAAGGAAAAAACTCCAGAGCTCCCAGAACCTT
CAGTGAAAGTAAAAGAACCTTCAGTACAAGAGGCTACTTCTACTAGTGACATTCTGAAAGTT
CCCAAACCT G AACCT AT ACCAGAGCCT AAAG AACCTT CT CCGG AAAAAAATT CC AAAAAAG
AAAAGGAGAAGGAGAAGACCCGACCACGATCTCGGTCACGCTCCAAATCAAGATCCCGGA
CGCGGTCCCGCTCTCCTTCTCACACTCGACCTAGACGGCGCCATAGATCCCGATCAAGAT
CGTATTCACCTAGAAGGCGGCCAAGCCCAAGAAGGCGGCCATCTCCTCGAAGAAGAACTC
CGCCAAGAAGAATGCCTCCTCCACCAAGGCATAGAAGGAGTAGATCTCCAGTAAGACGAA
GAAGACGTTCGTCAGCATCCTTGTCTGGGAGTAGCTCATCATCCTCTTCATCTCGTTCACG
GTCACCACCAAAGAAGCCTCCCAAGAGGACATCCAGCCCCCCTCGGAAAACTCGTAGGTT
ATCTCCTTCAGCAAGTCCTCCAAGGCGAAGGCACAGGCCATCACCTCCTGCAACTCCACC
ACCCAAAACTCGGCATTCCCCTACACCCCAGCAGTCAAACCGTACAAGAAAAAGTCGTGTT
T CT GT GTCTCCAGGGAG AACTT CAGGT AAAGT GACAAAACAT AAAGGT ACTG AG AAAAG AG
AATCCCCTTCACCAGCACCGAAGCCT AGAAAAGT AGAGTT ATCT GAATCGGAAGAAGAT AA
AGGTGGCAAAATGGCTGCAGCAGATTCTGTGCAGCAGAGACGCCAATACAGACGACAAAA
CCAGCAGTCTTCATCTGACTCTGGCTCCTCCTCCTCCTCAGAAGATGAACGACCCAAGAGA
TCCCATGTGAAGAATGGTGAGGTTGGCAGGCGGCGGAGACATTCCCCTTCCCGGAGTGCT
TCTCCATCACCACGAAAGCGCCAAAAAGAGACTTCCCCTCGTGGTAGACGGAGGAGAAGT
CCATCCCCACCACCCACCAGAAGGCGACGGTCTCCTTCTCCCGCCCCTCCTCCTCGACGG
CGCAGGACTCCCACACCACCACCACGACGAAGGACTCCTTCTCCTCCCCCACGTCGGCGC
TCACCTTCTCCTAGAAGATACTCTCCTCCAATACAGAGGAGATACTCTCCTTCTCCACCTCC
AAAGAGAAGAACGGCTTCACCTCCTCCCCCTCCTAAACGAAGAGCATCACCATCTCCACCA
CCAAAGCGGCGGGTCTCCCATTCTCCACCTCCCAAACAAAGAAGCTCCCCAGTCACCAAG
AGACGTTCACCTTCATTATCATCCAAGCATAGGAAAGGGTCTTCCCCAAGCCGCTCTACCC
TI GGGAGGCCCGATCACCACAACCAAACAAACGGCATTCGCCCTCACCACGGCCTCGAGCTC CTCAGACCTCCTCAAGTCCTCCACCCGTTCGAAGAGGAGCGTCGTCATCACCCCAAAGAA GGCAGTCCCCGTCTCCAAGTACTAGGCCCATTAGGAGAGTCTCCAGGACTCCGGAACCTA AAAAGATAAAAAAGGCTGCTTCCCCAAGCCCACAGTCTGTAAGAAGGGTCTCATCCTCCCG ATCTGTCTCCGGGTCTCCTGAGCCAGCAGCTAAAAAGCCCCCAGCACCTCCATCCCCCGT CCAGTCTCAGTCACCGTCTACAAACTGGTCACCAGCTGTACCGGTCAAAAAGGCCAAAAG CCCAACACCGAGCCCATCACCGCCAAGAAATTCAGATCAGGAAGGAGGTGGAAAGAAAAA GAAGAAAAAGAAGGACAAGAAACACAAAAAGGATAAGAAGCACAAGAAGCACAAAAAACAC AAGAAGGAAAAGGCTGTGGCTGCAGCTGCTGCAGCTGCTGTGACCCCTGCAGCCATTGCA GCTGCCACAACCACATTAGCACAGGAAGAGCCAGTGGCAGCGCCAGAGCCGAAGAAGGA GACTGAAAGTGAAGCTGAAGATAACCTTGATGATTTAGAAAAGCACCTGCGTGAAAAGGCC CTGAGATCAATGAGGAAGGCCCAAGTGTCCCCACAGTCTTAGGGGGAAATGTTTGTTATGA T GT AAATTTT ATTT GGTTT GT ACGCAGTT C AATTT CAAAATTGCT AAAAT GT GTTT G AGCTTT AG ACT AT AACATTT GTT GT AAT AATT GCTAGGTT G AAGTT CAACATGT AAAAAAAGGGGGCA T GG ATTT ACATTGCAAAAGGT GTCCACAGT GT ATT AGT GACATT CTTTCATT GACAGCT GAC AT AATTCATT GAGT GAAAT ATTTT AAGCCAAAAAAAAATTCCCTTTTT AAAAAAGGGGGTTT A AAT ACT GTTGGCATTTTT AT GGTTCCTTT AAATGCCCT AGCTATTCCCAGAGGGGTTTTTTT GTTT GTTTTTTTGGTTTT G ATTTT CTTTTT GTTTTT CTTT CTT CTT CTT ATTTTTTT CATTT G AG T CTT AGCTCCCATTT AAGTT AT GCTTCTG ACCTT GTATGGTCTGT AAGCTT GCCC AG AAAT A AG ACCACT GTTTT G AACT ACCACAAAAGT AT AAAT G AAT ATTTT AATGCC ACAAT CTTTCCT G TTGCCT GTGGAGTCTCT GCT GAAAT GAATCAGGATTCGAGCT CT AGGAT GAGACAGAAAAT GAAAGCATGTT GTTTGCCAGG ACACTGTGGGTTT AT ATT G AT GTGT AACAAGTT G ATTT GG A ACACT GG ACT CT CATT CT GTT ATT CT GGTTTTGTTTTTTTT GTTTTGTTTTTTTT CTTTT GTAA AGGCAAT GAGCT AGTCCCAGAAAGGATCCTTCAGTT ACAT ACAATTT GTTT AAT GAAAT GTC ATGGCTCTGTTCATATTTTTGTCTTGTTCTTCCAATTGGTATATACAACTTTCAGAGCCTCTT GTATTTGGAAGGCTGGAAGGGCCCAGACTTTGGAATAGTGTCTTGGTTTCACTGTTTTTGT TTT GATTTTTTTTTT GTTTT GATTTTTTTT AAACTAAAGCT AT AT AAAGCTT GTGG ATT AAACA GAAT AAATTT CT AAATTT AAAAATTTT GCCACTCTT AAAAAAAAAAAAAAAAAAA
SEQ ID N° 19
MDAGFFRGTSAEQDNRFSNKQKKLLKQLKFAECLEKKVDMSKVNLEVIKPWITKRVTEILGFED
DWIEFIFNQLEVKNPDSKMMQINLTGFLNGKNAREFMGELWPLLLSAQENIAGIPSAFLELKKE
EIKQRQIEQEKLASMKKQDEDKDKRDKEEKESSREKRERSRSPRRRKSRSPSPRRRSSPVRR
ERKRSHSRSPRHRTKSRSPSPAPEKKEKTPELPEPSVKVKEPSVQEATSTSDILKVPKPEPIPE
PKEPSPEKNSKKEKEKEKTRPRSRSRSKSRSRTRSRSPSHTRPRRRHRSRSRSYSPRRRPSP
RRRPSPRRRTPPRRMPPPPRHRRSRSPVRRRRRSSASLSGSSSSSSSSRSRSPPKKPPKRT
SSPPRKTRRLSPSASPPRRRHRPSPPATPPPKTRHSPTPQQSNRTRKSRVSVSPGRTSGKVT
KHKGTEKRESPSPAPKPRKVELSESEEDKGGKMAAADSVQQRRQYRRQNQQSSSDSGSSSS
SEDERPKRSHVKNGEVGRRRRHSPSRSASPSPRKRQKETSPRGRRRRSPSPPPTRRRRSPS
PAPPPRRRRTPTPPPRRRTPSPPPRRRSPSPRRYSPPIQRRYSPSPPPKRRTASPPPPPKRRA
SPSPPPKRRVSHSPPPKQRSSPVTKRRSPSLSSKHRKGSSPSRSTREARSPQPNKRHSPSPR
PRAPQTSSSPPPVRRGASSSPQRRQSPSPSTRPIRRVSRTPEPKKIKKAASPSPQSVRRVSSS
RSVSGSPEPAAKKPPAPPSPVQSQSPSTNWSPAVPVKKAKSPTPSPSPPRNSDQEGGGKKK
KKKKDKKHKKDKKHKKHKKHKKEKAVAAAAAAAVTPAAIAAATTTLAQEEPVAAPEPKKETESE
AEDNLDDLEKHLREKALRSMRKAQVSPQS A no ser que se indique lo contrario, cuando se utiliza en el presente documento el término “RNU4”, (también llamado en literatura U4; U4BL; RNU4A; RNU4B2) se refiere al gen, factor de la maquinaria de splicing. En el contexto de la presente invención,“RNU4’’se define también por una secuencia de nucleótidos o polinucleótidos, que constituye la secuencia del snRNP“RNU4”, y que comprendería diversas variantes procedentes de: a) Moléculas de ácido nucleico que comprende la SEQ ID NO:20, b) Moléculas de ácido nucleico cuya cadena complementaria híbrida con la secuencia polinucleotídica de a), c) Moléculas de ácido nucleico cuya secuencia difiere de a) y/o b) debido a la degeneración del código genético,
Gene ID: 26835
Localización del gen: 12q24.23
SEQ ID N° 20:
AGCTTTGCGCAGTGGCAGTATCGTAGCCAATGAGGTCTATCCGAGGCGCGATTATTGCTAA TTGAAAACTTTTCCCAATACCCCGCCGTGACGACTTGCAATATAGTCGGCACTGGCAATTTT T GACAGT CT CT ACGG AG ACTG
El término "RBM45' (también llamado en la literatura DRB1; RB-1) se refiere tanto al gen como a la proteína humana. El gen RBM45 codifica un miembro de la familia de proteínas de unión al ARN del tipo de reconocimiento de ARN (RRM). Esta proteína exhibe unión preferencial al ARN poli (C). En el contexto de la presente invención,“RBM45” se define también por una secuencia de nucleótidos o polinucleótidos, que constituye la secuencia“RBM45”, y que comprendería diversas variantes procedentes de: a) Moléculas de ácido nucleico que codifican un polipéptido que comprende la secuencia aminoacídica de la SEQ ID NO: 22, b) Moléculas de ácido nucleico cuya cadena complementaria híbrida con la secuencia polinucleotídica de a), c) Moléculas de ácido nucleico cuya secuencia difiere de a) y/o b) debido a la degeneración del código genético, d) Moléculas de ácido nucleico que codifican un polipéptido que comprende la secuencia aminoacídica con una identidad de al menos un 80%, un 90%, un 95%, un 98% o un 99% con la SEQ ID NO: 22 en las que el polipéptido codificado por dichos ácidos nucleicos posee la actividad y las características estructurales de la proteína RBM45. Entre otras posibles secuencias nucleotídicas que codifican RBM45 se encuentra, pero sin limitarse, la SEQ ID NO: 21.
Gene ID: 129831
Localización del gen: 2q31.2
SEQ ID N° 21
GACAGCGCCTGGCGCCGGACTCCTCTTTCTCCCGGAAGCGGAGCACCGAGCCGGCAAAG GCTT GGGT GT GAGACAGCAGCGGTGGCAGACACCGCAGAAGCAAAGAGCAGT GAGGCTC CTGCATTCGGGTGGAGCACCATGGACGAAGCTGGCAGCTCTGCGAGCGGCGGGGGCTTC CGCCCGGGCGTGGACAGCCTGGACGAACCGCCCAACAGCCGCATCTTCCTTGTGATCAG CAAGTACACACCTGAGTCGGTGCTGAGGGAGCGCTTCTCGCCTTTTGGCGACATCCAGGA CATCTGGGTGGTGCGGGACAAGCACACCAAGGAGTCCAAGGGCATTGCTTTCGTCAAGTT CGCCCGCAGCTCACAGGCCTGCAGGGCCATGGAGGAGATGCATGGCCAGTGCCTCGGCC CCAACGACACCAAGCCCATCAAGGTGCGGGTGCCCGGGTCGGGGTGCCCTCGGGGGAA GGAGTGGGCCTCTTGGACCTCCCTTCACCTGCTGCTCTGCCGGGGTGAGGGAGGAGTGG AACATCCGTTCCCGGCAGCTGACCAGACAGCACCTGGCTTGGGGACAGGGGCTGCTTTGA GGAGAGGCTCCCCTCCCACGAAGCTGCGCCGGGTTGCAGGGAAGGGGACGGGATGCGG AGTGTTTGCCCCACGAGAGCGGACCCGGCAGCCGCGGCCACCGGGTGACAGAACAGCAG TGGCTGGGCTTCCCCTCTCCCTCGCCCTCACTAATCCACCAGCTCTTGAGTTCACTGCCAA ACTCGTCCTAGCCTACTTTGAGTACTTTTCTGACCTTCCTCTCTCAGATGCCCAGATTTCCA TATATAAAAAACGGAAAAACTCTACTTTTCCTCAGGTTTTCATTGCTCAGTCCCGATCATCT GG AAGTCACCG AG AT GTT G AAG AT G AAG AACTT ACAAG AAT CTTT GTT AT G AT ACCAAAGTC CT ACACAGAAGAAGATCT GCGGGAAAAATTT AAGGT GT AT GGAGAT ATCGAGT ATTGCAGC ATT ATT AAGAAT AAAGT GACT GGAGAAAGT AAAGGTTT GGGCT ACGT ACGAT ACTT AAAACC ATCACAAGCTGCCCAAGCAATAGAAAACTGTGATCGAAGTTTTAGAGCAATCTTGGCTGAA CCT AAAAAT AAAGCAT CT GAAT CCTCTGAACAAGATT ATT AT AGT AAT AT GAGGCAAGAAGC TTT GGG ACAT G AACCTAG AGT AAAT ATGTTT CCATTT G AACAAC AATCT G AATTTT CAAGTTT T GACAAG AAT G AT AGCCGAGGCC AGG AAGC AAT CTCCAAACGCTT GTCAGTT GTAT CAAGA GTT CCTTT CACT G AAGAAC AGCTTTT CAGC ATTTTT G AT AT AGT ACCAGG ATTGG AAT ATT G T GAAGTT C AACG AG ATCCTT ATT CAAATT AT GGTCAT GG AGT GGTT C AGT ATTTT AATGT AG CAT CAGCTATTT AT GC AAAATACAAATT ACATGG ATTT CAGT ACCCT CCTGGG AACCG AAT A GGTGTTTCCTT CATT GAT G AT GG AAGT AATGCAACAGAT CTCCTT AGAAAAATGGCAACACA GATGGT AGCTGCACAGCTT GCATCAAT GGT GTGGAAT AACCCAAGTCAGCAACAATTT AT G CAATTTGGAGGAAGCTCTGGATCACAGTTGCCTCAAATCCAGACAGATGTTGTACTTCCAT CATGCAAAAAAAAAGCTCCTGCT GAAACT CCTGT GAAAGAAAGACTTTTT ATT GT GTTT AAT CCT CATCCTTT ACCTTT AG ACGT ATT AG AAG AT AT ATT CT GTCGTTTT GGTAACCT GATCGAA GTTT ACCTT GTGTC AGG AAAAAATGTGGGGT ATGCC AAGT ATGCCGAT AGAAT AAGTGCTA AT GAT GCCATTGCCACT CT ACAT GGAAAGATTCT GAAT GGGGTGAGACTT AAAGTT ATGCT GG CAG ATTCGCCAAGAG AAG AAT CT AACAAACGGCAAAG AACTT ACTG ATT CTT G AGGTG A T GATTTT CAT ACTT GTGTTGTGTT CTTT CT AC AG AACAAAGACT AAAT AAT G ACAT AATCCT C AGCTGACTGACTGAAAATGTGACTGGACGCATTCCCTGTGGACAGTTGACAGCTTTTTTTTT TTCCATATACCTGATAGTCTGTGTACAGCATTGTTTTGTCTGGGAAGCAGGGATTGCTGAC AT GT ATTTTT GAATCCAT ACATT AATGCT AAAACGAATAT AGT AGTTGTTCCTT AGAGCAAT A T GTT GTT ACGT GT AGCAGAAAT AAAGTTTT CTTTGCTT AACT AAA SEQ ID N° 22
MDEAGSSASGGGFRPGVDSLDEPPNSRIFLVISKYTPESVLRERFSPFGDIQDIWVVRDKHTKE
SKGIAFVKFARSSQACRAMEEMHGQCLGPNDTKPIKVRVPGSGCPRGKEWASWTSLHLLLCR
GEGGVEHPFPAADQTAPGLGTGAALRRGSPPTKLRRVAGKGTGCGVFAPRERTRQPRPPGD
RTAVAGLPLSLALTNPPALEFTAKLVLAYFEYFSDLPLSDAQISIYKKRKNSTFPQVFIAQSRSSG
SH RDVEDEELTRI FVM I PKSYTEEDLREKFKVYGDI EYCSI I KNKVTGESKGLGYVRYLKPSQAA
QAIENCDRSFRAILAEPKNKASESSEQDYYSNMRQEALGHEPRVNMFPFEQQSEFSSFDKND
SRGQEAISKRLSVVSRVPFTEEQLFSIFDIVPGLEYCEVQRDPYSNYGHGWQYFNVASAIYAK
YKLHGFQYPPGNRIGVSFIDDGSNATDLLRKMATQMVAAQLASMVWNNPSQQQFMQFGGSS
GSQLPQIQTDVVLPSCKKKAPAETPVKERLFIVFNPHPLPLDVLEDIFCRFGNLIEVYLVSGKNV
GYAKYADRISANDAIATLHGKILNGVRLKVMLADSPREESNKRQRTY
El término "SRSF4" (también llamado en la literatura SFRS4; SRP75) se refiere tanto al gen como a la proteína humana. El gen SRSF4 codifica un miembro de la familia del factor de splicing rico en arginina /serina. En el contexto de la presente invención,“SRSF4" se define también por una secuencia de nucleótidos o polinucleótidos, que constituye la secuencia“SRSF4", y que comprendería diversas variantes procedentes de: a) Moléculas de ácido nucleico que codifican un polipéptido que comprende la secuencia aminoacídica de la SEQ ID NO: 24, b) Moléculas de ácido nucleico cuya cadena complementaria híbrida con la secuencia polinucleotídica de a), c) Moléculas de ácido nucleico cuya secuencia difiere de a) y/o b) debido a la degeneración del código genético, d) Moléculas de ácido nucleico que codifican un polipéptido que comprende la secuencia aminoacídica con una identidad de al menos un 80%, un 90%, un 95%, un 98% o un 99% con la SEQ ID NO: 24 en las que el polipéptido codificado por dichos ácidos nucleicos posee la actividad y las características estructurales de la proteína SRSF4. Entre otras posibles secuencias nucleotídicas que codifican SRSF4 se encuentra, pero sin limitarse, la SEQ ID NO: 23.
Gene ID: 6429
Localización del gen: 1 p35.3
SEQ ID N° 23 GAAGCCAGCTGGCTGCGGAAGGCGGTGCAGGAACCCCTTTGGCGAGCTCGCGCGAGGA
CGTGCCGCAGCGCCGCCTGTCGATCACCTTGCCCCGCCGCACGTCGGCGCGCCCCCGG
GCAAGCTCCTCCCCCAGTCCTGGCCGAGCGGGAAGCGAACGCGCGCTCTCTCCGGTTAC
CTTCCGCCTCGGGGAAGGGCGGGGGAAGTGGAAGCGCGCGCTCGCGAGCTGCGTGCTC
GCGTACGTCGCCGGGGTTCGGCTGCGTCCGTCCCGCCGCCCGCCCGTTGCCGCCGCCG
CCGCTGCCGCCGTGCTCTCGCTTTGCCCGCCGCCGCCTAAGGGGGGCTGGGGCCGGGG
CCAGCCATCACTGCCGTTGCCGGGATGCCGCGGGTGTACATCGGCCGCCTGAGCTACCA
GGCCCGGGAGCGCGATGTGGAGCGCTTCTTTAAGGGCTACGGGAAGATCCTGGAGGTGG
AT CT G AAG AACGG AT AT GGTTTT GTGG AGTTT G AT GAT CTGCGT G ATGCAG AT GATGCT GT
TT AT GAACT GAAT GGCAAAGACCTTT GT GGT GAGCGAGT AATT GTTGAGCATGCCCGCGGC
CCACGGCGAGATGGCAGTTACGGTTCTGGACGCAGTGGATATGGTTATAGAAGAAGTGGC
CGAGATAAATATGGCCCTCCTACTCGCACAGAGTACAGACTTATTGTGGAGAATTTGTCAA
GTCGGTGCAGCTGGCAAGACCTAAAGGATTATATGCGTCAGGCAGGAGAAGTGACTTATG
CAGATGCTCACAAGGGACGCAAAAATGAAGGGGTGATTGAATTTGTATCTTATTCTGATAT
GAAAAGAGCTTTGG AAAAGTT GG AT GG AACT G AAGTCAAT GGG AG AAAAAT CAG ATT AGTT
GAAGACAAGCCAGGTTCCAGACGACGCCGGTCCTACTCCAGAAGCCGGAGTCATTCAAGG
TCTCGCTCTCGAAGCAGACATTCCCGTAAGAGCAGAAGCCGAAGTGGCAGCAGCAAAAGC
AGTCATTCTAAGAGTAGATCTCGGTCCAGGTCGGGCTCCCGCTCCCGGAGCAAGAGCCGG
AGCCGGAGCCAGAGTCGGAGCCGGAGCAAGAAAGAGAAAAGCAGGAGCCCCAGCAAGGA
AAAGAGCCGCAGCCGCAGCCATAGCGCTGGCAAGAGCCGCAGCAAGAGCAAAGACCAAG
CTGAAGAGAAGATCCAAAACAATGACAATGTCGGGAAACCCAAGAGCCGGAGTCCTAGCA
GGCATAAAAGTAAGAGCAAAAGTCGGAGCAGGAGTCAGGAGAGGAGAGTGGAGGAGGAG
AAGCGAGGGAGTGTGAGCAGGGGCAGGAGCCAGGAGAAGAGCCTCCGCCAGAGTCGGA
GCCGGAGCAGGAGCAAAGGGGGCAGCAGGAGCCGGAGCAGGAGCCGCAGCAAGAGCAA
GGACAAGAGGAAGGGCAGGAAGAGAAGCAGAGAGGAGAGCCGCAGTCGCAGTCGCAGC
CGCAGCAAGAGTGAGAGGAGCAGAAAGCGAGGCAGCAAGCGAGACAGCAAGGCGGGCA
GCAGCAAGAAGAAGAAGAAGGAAGACACTGACCGCTCCCAGTCCAGATCTCCATCCCGCT
CCGTGTCAAAGGAGCGGGAACATGCCAAGTCTGAATCCAGCCAGAGGGAAGGTCGAGGA
GAGAGTGAGAATGCTGGCACCAATCAGGAGACCCGGTCCAGGTCGAGATCCAATTCCAAA
TCGAAACCAAACCTTCCATCAGAATCACGCTCCAGATCAAAGTCAGCTTCAAAAACCCGAT
CTCGGTCCAAGTCTAGATCCAGGTCTGCTTCCAGATCGCCCTCCCGATCTAGATCTAGGTC
CCACTCAAGGTCCTAACTGGCTATGGCCACAGCTGGAACTACCCGAGAAGTCTTTTGTACA
T GTTT GGT AGCCGT AGCAC AAGT GATT GG AGTAG AACAT GT C ACTGCTGT ACATTTTT AACT
CCCCTAATGGTGTGTCTATAATTGTTAAATCTAAGTGCTTCCTCTCAGTAAAGCCTCCTGGC
ACCAGGCCTTCCTGCTCGACTGAAAAAAATTTTCTCTTTGAAAATCCCCTTTTACTCATGGC
CCACAGTAGAATATCCAAAACGCCTTGGCTTTCAGGCCTGGCCTTTCCTACAGGGAGCTCA
GT AACCT GGACGGCTCT AAGGCT GGAATGACCACATAGGT AGGT AT GGT GAGTTCAACCA
TTTTTGCT CTT GAATT G AT GCCCTT CG ATGT AT GCCATTT AGT G AAAGTGCT AAGTCTT AAG
TTTCCT ACCACTTT GGTTTCAT ATTTTT GGACTT AACAAAGTT GT GAAT AGCACAGTCGAGG
AAAATT GAT ACCTGCAGT AACCCATAGG AAAT AAACT GT AGAGTTCCAT ATT CTGGT ATTGT
GATT AT ATT GTTTT AT ATT AAAAAAGAAAAG AAAAGAATTTTTTTT AATTTT ATTTTTCCCCGT
CTT GC AAAGT AT AGTG ACCCCTGTTT CC ATT AAATTT G AAT AAAGACT ATTTTT GCTT GACAA
AATTTCAAAAAA
SEQ ID N° 24
MPRVYIGRLSYQARERDVERFFKGYGKILEVDLKNGYGFVEFDDLRDADDAVYELNGKDLCGE RVIVEHARGPRRDGSYGSGRSGYGYRRSGRDKYGPPTRTEYRLIVENLSSRCSWQDLKDYM RQAGEVTYADAHKGRKN EGVIEFVSYSDMKRALEKLDGTEVNGRKIRLVEDKPGSRRRRSYS RSRSHSRSRSRSRHSRKSRSRSGSSKSSHSKSRSRSRSGSRSRSKSRSRSQSRSRSKKEKS RSPSKEKSRSRSHSAGKSRSKSKDQAEEKIQNNDNVGKPKSRSPSRHKSKSKSRSRSQERRV
EEEKRGSVSRGRSQEKSLRQSRSRSRSKGGSRSRSRSRSKSKDKRKGRKRSREESRSRSRS
RSKSERSRKRGSKRDSKAGSSKKKKKEDTDRSQSRSPSRSVSKEREHAKSESSQREGRGES
ENAGTNQETRSRSRSNSKSKPNLPSESRSRSKSASKTRSRSKSRSRSASRSPSRSRSRSHSR
S
El término "SRSF5' (también llamado en la literatura HRS; SFRS5; SRP40) se refiere tanto al gen como a la proteína humana. La proteína codificada por el gen SRSF4 es un miembro de la familia rica en serina / arginina (SR) de factores de splicing de pre-ARNm, que constituyen parte del espliceosoma. Cada uno de estos factores contiene un motivo de reconocimiento de ARN (RRM) para unirse al ARN y un dominio RS para unirse a otras proteínas. El dominio RS es rico en residuos de serina y arginina y facilita la interacción entre diferentes factores de empalme de SR. En el contexto de la presente invención,“SRSF5" se define también por una secuencia de nucleótidos o polinucleótidos, que constituye la secuencia“SRSF5", y que comprendería diversas variantes procedentes de: a) Moléculas de ácido nucleico que codifican un polipéptido que comprende la secuencia aminoacídica de la SEQ ID NO: 26, b) Moléculas de ácido nucleico cuya cadena complementaria híbrida con la secuencia polinucleotídica de a), c) Moléculas de ácido nucleico cuya secuencia difiere de a) y/o b) debido a la degeneración del código genético, d) Moléculas de ácido nucleico que codifican un polipéptido que comprende la secuencia aminoacídica con una identidad de al menos un 80%, un 90%, un 95%, un 98% o un 99% con la SEQ ID NO: 26 en las que el polipéptido codificado por dichos ácidos nucleicos posee la actividad y las características estructurales de la proteína SRSF5. Entre otras posibles secuencias nucleotídicas que codifican SRSF5 se encuentra, pero sin limitarse, la SEQ ID NO: 25.
Gene ID: 6430
Localización del gen: 14q24.1
SEQ ID N° 25
GGAAGTGACGTAGGACGCGCCCTCCATTTTGTGGAGCGCCAGAGCTGCTAAGTGCGTCAG
TTGTGGAGTGGCGTAGACGAGTTAAGTCCTGGTCTGCGTGGAGGTCGACGACTCCGTCGC
AGACTACGGACCTGTCTGGGTCTCAGCCGCCAAAGACCCCGTCCGGTAGGAAGTACTAGC
CGGACATCATGAGTGGCTGTCGGGTATTCATCGGGAGACTAAATCCAGCGGCCAGGGAGA
AGGACGTGGAAAGATTCTTCAAGGGATATGGACGGATAAGAGATATTGATCTGAAAAGAGG CTTTGGTTTTGTGGAATTTGAGGATCCAAGGGATGCAGATGATGCTGTGTATGAGCTTGAT GGAAAAGAACTCTGTAGTGAAAGGGTTACTATTGAACATGCTAGGGCTCGGTCACGAGGT GGAAGAGGTAGAGGACGATACTCTGACCGTTTTAGTAGTCGCAGACCTCGAAATGATAGA CG AAATGCTCCACCT GT AAG AACAG AAAATCGTCTT ATAGTT G AG AATTT ATCCT CAAG AGT CAGCTGGCAGGATCTCAAAGATTTCATGAGACAAGCTGGGGAAGTAACGTTTGCGGATGC ACACCGACCTAAATTAAATGAAGGGGTGGTTGAGTTTGCCTCTTATGGTGACTTAAAGAAT GCT ATT GAAAAACTTTCTGGAAAGGAAAT AAAT GGGAGAAAAAT AAAATT AATT GAAGGCAG CAAAAGGCACAGTAGGTCAAGAAGCAGGTCTCGATCCCGGACCAGAAGTTCCTCTAGGTC TCGTAGCCGATCCCGTTCCCGTAGTCGCAAATCTTACAGCCGGTCAAGAAGCAGGAGCAG GAGCCGGAGCCGGAGCAAGTCCCGTTCTGTTAGTAGGTCTCCCGTGCCTGAGAAGAGCC AGAAACGTGGTTCTTCAAGTAGATCTAAGTCTCCAGCATCTGTGGATCGCCAGAGGTCCCG GTCCCGATCAAGGTCCAGATCAGTT GACAGTGGCAATT AAACT GT AAAT AACTTGCCCTGG GGGCCTTTTTTTAAAAAACAAAAACCACAAAAATTCCCAAACCATACTTGCTAAAAATTCTG GTAAGTATGTGCTTTTCTGTGGGGGTGGGATTTGGAAGGGGGGTTGGGTTGGGCTGGATA TCTTT GT AGATGTGGACCACCAAGGGGTT GTT GAAAACT AATT GT ATT AAAT GTCTTTT GAT AAGCCTT CT GCTCACATTTTT GT G AATGTCT GAAGT AT AT AGTTT GTGTAT ATT G ACAG AGC T CTTTT AT AACT AAAG CAAATTT AATTTTTTT GT ACT AG AAAAAAATTT G AAC ATTTT AGTTCT TGGTTAT AAAAAT GTT AATT CAGAATT AGTTT AATGCCTT AATT AAACT AATT AAT AGCTTT GG ACACTTAAAAGAGCTCTAAATTTGCTTGTACATAAAGGCTTAATTTGTTTTCCTTGTTAGGGT CAAGGGT GTCCTCCACTCTTT AACAGCTGCTGGACAGACACATT AGAGCAGCTGTTT GTT A TT G AT AAT AAAAT ATT AT AAAACTA
SEQ ID N° 26
MSGCRVFIGRLNPAAREKDVERFFKGYGRIRDIDLKRGFGFVEFEDPRDADDAVYELDGKELC SERVTIEHARARSRGGRGRGRYSDRFSSRRPRNDRRNAPPVRTENRLIVENLSSRVSWQDLK DFMRQAGEVTFADAHRPKLNEGVVEFASYGDLKNAIEKLSGKEINGRKI KLIEGSKRHSRSRSR SRSRTRSSSRSRSRSRSRSRKSYSRSRSRSRSRSRSKSRSVSRSPVPEKSQKRGSSSRSKS PASVDRQRSRSRSRSRSVDSGN
El término "SRSF10" (también llamado en la literatura NSSR; TASR; SRp38; TASR1; TASR2; FUSIP1; FUSIP2; SFRS13; SRrp40; SFRS13A; PPP1R149) se refiere tanto al gen como a la proteína humana. El gen SRSF10 es un miembro de la familia rica en serina / arginina (SR) que están involucradas en el empalme de ARN constitutivo y regulado. Los miembros de esta familia se caracterizan por los motivos N-terminal RNP1 y RNP2, que son necesarios para la unión al ARN, y múltiples repeticiones C-terminal SR / RS, que son importantes en la asociación mediadora con otras proteínas celulares. En el contexto de la presente invención,“SRSF10" se define también por una secuencia de nucleótidos o polinucleótidos, que constituye la secuencia “SRSF10", y que comprendería diversas variantes procedentes de: a) Moléculas de ácido nucleico que codifican un polipéptido que comprende la secuencia aminoacídica de la SEQ ID NO: 28, b) Moléculas de ácido nucleico cuya cadena complementaria híbrida con la secuencia polinucleotídica de a), c) Moléculas de ácido nucleico cuya secuencia difiere de a) y/o b) debido a la degeneración del código genético, d) Moléculas de ácido nucleico que codifican un polipéptido que comprende la secuencia aminoacídica con una identidad de al menos un 80%, un 90%, un 95%, un 98% o un 99% con la SEQ ID NO: 28 en las que el polipéptido codificado por dichos ácidos nucleicos posee la actividad y las características estructurales de la proteína SRSF10. Entre otras posibles secuencias nucleotídicas que codifican SRSF10 se encuentra, pero sin limitarse, la SEQ ID NO: 27.
Gene ID: 10772
Localización del gen: 14p36.1 1
SEQ ID N° 27
GGACGCCTGGTGTTCTCGCGGGAAAGAACCGTTGCGCCCGACTTTGCGCGGAGGTAGGA GGGGGAAGTGGAGGCGGGAGTGAAGTCTCGCGAGAAGAGTCGGTTGCCGTAGCAGAGC CCTCTAGCTGTGTGTGTCTGAGGCTCGGCCGCCTGAGCCGCGGACGGTTTGCTGAGCCC GTTAGTGCGCCCGGCCGAGACACGCCGCCGCCATGTCCCGCTACCTGCGTCCCCCCAAC ACGTCTCTGTTCGTCAGGAACGTGGCCGACGACACCAGGTCTGAAGACTTGCGGCGTGAA TTTGGTCGTTATGGTCCTATAGTTGATGTGTATGTTCCACTTGATTTCTACACTCGCCGTCC AAGAGG ATTTGCTT AT GTT CAATTT G AGG AT GTT CGT G ATGCT GAAG ACGCTTT ACAT AATT TGGACAGAAAGTGGATTTGTGGACGGCAGATTGAAATACAGTTTGCCCAGGGGGATCGAA AGACACCAAAT CAGAT GAAAGCCAAGGAAGGGAGGAAT GT GT ACAGTTCTTCACGCT AT GA T GATT AT GACAG AT ACAGACGTT CT AGAAGCCG AAGTT AT G AAAGG AGG AG AT CAAG AAGT CGGTCTTTT G ATT ACAACT AT AG AAG AT CGT AT AGTCCT AG AAAACC AAACTGCAGCTGG AA TACCCAGTACAGTTCTGCTTACTACACTTCAAGAAAGATCTGAAAGCGGAAAAAGAACCAA AGAAGGGCAGTTCAAGCGACCAAAGGGTGGGTGGAAGGTGCTGCAGTATGAATACTGTAC GAAT ATTTT GACTCTGGTCT GAAAAGAT AAAAGAAT GTT ATCGAAAACT ACATGGAAT AATT GAAGT CCCTT CAAGTTT G AAAGT AAGC ATTTTAGG AC AAAT AAAAGG AAATT CAACTTT GTA CTT GT GG AAACTAAT CCCT AAAT AT GAAT AGGTTT AT ATT GATT CATGGGT AACAGGTCCAT AAT AAATT ATT GG AAACT AGG ATGTCT GAAT AT CAAGG AAG ACAGCCATAGTCT CTT ACAGT GCCTCTGTTGGTCTGTCTCAAACTGAATTGGGTGGGAAAAGGTATGGTCCAATATAAAAGT TCCATTTTTGCCATT ATTGGCAAATCTTGCCTTT GTTTATTTT GGTGCCAGT GTTTT CTGCTT AAT CATTTGCTTT GTTGGC AT CTGT GTTT ATTT ACTT GT ACACCAC ATGCAGTTT ACAT CTGT CTTAACTACTCCTTCCCAGGTAAATTCCAATTATATTTGACATCCAGCTAAGAGGGCCCATC T CTT CT CACCT CTTT CCTAGTCAGTAT ATT CAGC AAAT ATTT ATT G AGCCCTT ACTGTGGGC AAAT CATT GT ACTGG AT AATT G AGAAAAAT AG AT AATT CCCTT ATT CAGT AAAT GTCT ACTG A GC ACAAT CT AGT GAAT CATT ACAGT ATGGCCTC ATT GTTTT GTTT G AGGT GTGTT ATT CAT A ACAAT ATTTT ACACCATTCGT AT CAAT GT AATT AT AG AACACAAT AT ACG AT CAAGG AT AAGT AATT GTGTGGTTAT CTGCCATTT AAAAGT ATCCAGT ATTT G AT CACATT ATT AT AAAT AAT G A AAAAAT G ATTT AAT CTGT AAT AAACTGGTTT ATT GT GC AGT G ACTGT AAT ATACT AG AGTT AT AAT AAATT GTTT ACTCTGCCT CACCAAACACATGCT AGG AT AT AACCCCC AAAAT AAGT ATTT AACTTTGCATTAGGTATAAAGGAGACTGGGTGCTATAATTAGATTATTTTGAGGCAGACAGA GAGCTGTT ATCCT AACT G ATTT AGT ATGTTCTGT AATT G AG AAAAT GTT CACCAAATT AT ACT TTTT AGT G ATTT ACAT GT ACATTTT ATAGGGGACATGTTCTGT GTAT AGCG AAT AAAT AACTT TT AT AGT AT CACAAAAT GTTTT GG ATTCCTT AGTTT CTT ATT AGG AT AT G AT GTTTCTTT ACCT AT ACATT G ATTT CAT CACATTT GATTTTT GTCAT CTTTTTTGCCACAT ACTT AAAATTTTCCAT AT AAAATT AACT AAAAAT CT GG AAGTGGAATTT AAGCTTTT AATTT GT AGC AATTTT G AAAAT AT AGC AG AGGT AT ATTTT CAAGGG AGGTGT G AAAT GG AGGT ATT ATT GTTT GT ATTTT ATTTT AGAAATTTTGTTT GAACTTGCCCAAGATCACACAGCAAGT GT CAGATCCT AGGTT ACAGCC CAT AATTTTTCACTT GTTTCATCTTTT GTT ACCAT GTTT GTTGTTT AATCCAATGGGGAAGT G TTTTT AT AGCTTT ATTTT CAT GG AG AT AGT AAC ATT G AT AT AATGGGATCTAG AATTT ACTT A GAGTCAAAGT G ACTAG ATTT AATT ACAAAAAGT ATTTT GTT GTAT ACCGTT ATACACT CATT A ACATAGGGGTTCTTATGGACAGAGGTTCTATGTATTTTTAAAAGAATATGTAGAGGCTATAG ACTTTTTTGCCCTCTACCTCCCTTCTCCATTTCCTTTTGAAGTTAAGACATTTAAGGGGGAG AATT AAGGTGCAT ATT G AGTT GGGGTTTT GTTT AAAAAAAATT AGGT AAAT AC AT AT ATAACT ACAAT AACAAC AGTT GGTAGTTCTCT AAAAT ATTT AATT ATGGT AAAT CAG AAAAGGCCCTTT AATTTTT GC AT CT GTT G AAT G AATTGCTTT AGG AT CT CTT CT GTGGTTGTTT CT CT CT AT ACT GAAT GCT GTCAAT ATT ATT G AGC ACTT ACTGTGCCG AACCATGTGCTTTT CAAAT ATTT CT AT TT AATCCT AAAAAC ACT CCTGGG AAAT GGGT ATT ATTCCCATTTT ACAG AT GAGAAAATT GT CCTTT GT AG AAT ACCCAT CAT GT G AT AGCTT CTTGCAT ATT ATGCT ATT CATTT CT CACAACC TT ACAAGGT AAAT GG AT AAT GTTCCTGG AT G AG AG ATT AAACGT ACT CG AAGAT CTT ATGGT TGTGTGGCTCAGAGACTCTAAGCATGGCTTTCCAAATCTCATTCTCTTGTAGAGATTTTCCA TTGT ATTGCATTTT G ACCAT GTTCCT GTTT AC AAAACCT AAGATT AT ATT CT GAAGT ATCTGT GACTTGAGTGATAGCTCAGGAATAATCTGAGGGCATTCTATTAGGAAGGAGGACTAGCAAA GCCTAT AGTT AGCCT ATCCT AGGCAT G AACT ATT CT CATTTTAG ATAGG AT GACTT G AT AAA T AGG AT G AAGTG AGCAACCT GTTT GT CTT CGGTT ATT GCTATCT AC AAGACATT CTGCT AGT CACTGTGGAAAAGTTTCCTTCTCTTGGGTTTTTTCCTCTTCCCCTTCCTCTTAACAGTGTTG GTT ATCTTT ATT AT GTTT CT GT GT ATTTGT AACAGCT GTTTCACCCTT GT ATT GCAT AATGGG GATTTTT CTT GG AAT AAAAAGT G AGGCATGT AAATT CATT G AGAACT AACCGT AGTTT GTAA AG AAGT AAAAGGCCTTT GT AT CT AGTTTTTT GC AG AT CACATTT CTTT G AATGCTGG AAAGT GAAAT AAACTGGT CT AGGAGCCAAAAAT AAAT CTTGGGTTTTTTT AAGATTTT GCTCTT AGAT TT GT AACCACCTGGGT ACAACTTTTT CCTAATTT GT GT AAGAGGTTTT AGAGATGCACTCT G TCCCT CTTGCTTT ACAAATTGCCT AC AAGAAT GC AACC AAAATACT AG AAACT GAAACTT AC ACAAAACCTTT C AGGTTTTTT CCTGT GTTGT AGTT CT AGGG AAG AGG ATAGTTT ATT AGT ATT T ATTTT AAGCTT AAGGAT AGGTTTTGG ACCTGG ATTCCAT CAT AGT AT AACTGCCATCGAAA AGAAGACAAATTGAAATTACAGCATTTACCTAAGGTTCACAGTATGGCTGACTTCAGCAGC CTT ACAT GGT AAGTT CTCTGT ACC AGCT ATTTTT GGTTCTCGCAATT GC ATCG ACTT GGG AA ATTCCT AT CACCATT CT CT AT AT AGGCT AACCAAAACTTTT ATC AGT ACCTTT
SEQ ID N° 28
MSRYLRPPNTSLFVRNVADDTRSEDLRREFGRYGPIVDVYVPLDFYTRRPRGFAYVQFEDVRD
AEDALHNLDRKWICGRQIEIQFAQGDRKTPNQMKAKEGRNVYSSSRYDDYDRYRRSRSRSYE
RRRSRSRSFDYNYRRSYSPRKPNCSWNTQYSSAYYTSRKI El término "TIA T (también llamado en la literatura TIA-1, WDM) se refiere tanto al gen como a la proteína humana. El producto codificado por el gen TIA 1 es un miembro de una familia de proteínas de unión a ARN y posee actividad nucleolítica contra células diana de linfocitos citotóxicos (CTL). Se ha sugerido que esta proteína puede estar involucrada en la inducción de la apoptosis, ya que reconoce de manera preferente los homopolímeros poli (A) e induce la fragmentación del ADN en objetivos CTL. En el contexto de la presente invención,“TIA 1” se define también por una secuencia de nucleótidos o polinucleótidos, que constituye la secuencia “TIA 1”, y que comprendería diversas variantes procedentes de: a) Moléculas de ácido nucleico que codifican un polipéptido que comprende la secuencia aminoacídica de la SEQ ID NO: 30, b) Moléculas de ácido nucleico cuya cadena complementaria híbrida con la secuencia polinucleotídica de a), c) Moléculas de ácido nucleico cuya secuencia difiere de a) y/o b) debido a la degeneración del código genético, d) Moléculas de ácido nucleico que codifican un polipéptido que comprende la secuencia aminoacídica con una identidad de al menos un 80%, un 90%, un 95%, un 98% o un 99% con la SEQ ID NO: 30 en las que el polipéptido codificado por dichos ácidos nucleicos posee la actividad y las características estructurales de la proteína TIA 1. Entre otras posibles secuencias nucleotídicas que codifican TIA 1 se encuentra, pero sin limitarse, la SEQ ID NO: 29.
Gene ID: 7072
Localización del gen: 2p13.3
SEQ ID N° 29
CTGCGCAGTCTGAGGCGTCCCTCGCGTCGGGTGGAAGAGCGGCTGCGCAACAAGTGAAC
CTATGGATTAAGGTGTAGCCGGGCGGCCCGGAGGTTGAGAGTGCAAGATTATTCTGCGCC
TGCGCGGCCCGGATACGTCGGTAACCTTTCCAGAGATGTGACAGAAGCTCTAATTCTGCA
ACT CTTT AGCCAG ATT GG ACCTTGT AAAAACTGCAAAAT G ATT AT GG AT ACAGCT GG AAAT G
ATCCCTATTGTTTTGTGGAGTTTCATGAGCATCGTCATGCAGCTGCAGCATTAGCTGCTATG
AATGGACGGAAGATAATGGGTAAGGAAGTCAAAGTGAATTGGGCAACAACCCCTAGCAGT
CAAAAGAAAG ATACAAGC AAT CATTTCCATGTCTTT GTT GGTG AT CT CAGCCC AG AAATT AC
AACT GAAGAT AT AAAAGCTGCTTTTGCACCATTTGGAAGAATATCAGAT GCCCGAGTGGT A
AAAGACATGGCAACAGGAAAGTCTAAGGGATATGGCTTTGTCTCCTTTTTCAACAAATGGG
ATGCTGAAAACGCCATTCAACAGATGGGTGGCCAGTGGCTTGGTGGAAGACAAATCAGAA
CTAACTGGGCAACCCGAAAGCCTCCCGCTCCAAAGAGTACATATGAGTCAAATACCAAACA
GCTAT CAT AT G AT GAGGTT GT AAATC AGTCT AGTCCAAGCAACT GTACTGTATACT GTGG AG
GTGTTACTTCTGGGCTAACAGAACAACTAATGCGTCAGACTTTTTCACCATTTGGACAAATA
ATGG AAATT CG AGTCTTTCCAG AT AAAGG AT ATT CATTT GTT CGGTT CAATTCCCAT G AAAG T GCAGCACATGCAATTGTTT CT GTT AATGGT ACT ACCATT GAAGGTCAT GTT GT GAAATGCT ATTGGGGCAAAGAAACT CTT G AT AT G AT AAATCCCGTGCAACAGC AG AAT CAAATT GG AT AT CCCCAACCTTATGGCCAGTGGGGCCAGTGGTATGGAAATGCACAACAAATTGGCCAGTAT ATGCCTAATGGTTGGCAAGTTCCTGCATATGGAATGTATGGCCAGGCATGGAACCAGCAA GGATTTAATCAGACACAGTCTTCTGCACCATGGATGGGACCAAATTATGGAGTGCAACCGC CTCAAGGGCAAAATGGCAGCATGTTGCCCAATCAGCCTTCTGGGTATCGAGTGGCAGGGT ATGAAACCCAGTGAATAAGGACTCCAGAATCTAAAGCCAGTGGCTTGAGGCTACAGGGAG T GT AGT AAAGCCGTT GTTTACTT AAAG ATTT ATC AAAT CAGT CAGTGCAAAT GT C AG AT ACA ATGT ATTT ATTT AAAAG ATT CATTTTT AAT CAT GAAATT ACTT AT CATCCACATT GTTTT AAAA AG AAAC AAGATGCT GG AT GTCTGCC AATTTTT GCCTT CATT ACCTTTTTT G AT AAAGTTT CT C AGATCCTTGTTTCAAACACAAATGCAGGGATTGCTGCCACTTTTTAACTATTAAGAGGCAGA AAATTGCAC AAT ATT G AACTTTTTTCCACTG AAGT AGT GTGCAGTT CTAGTTTGCATT CCTG A T AT GATTT AAAACAT GT AAT AT AAAGAT GTT AAAAAAAAAAACCAAAACT GTGCAGAGTCT AG AAGTTGTTTGTCAT CTT CAGCTT GT GC ACAATT CT GTTTT AGGTT AAAAAAAGGCATT GTTT G AGCT GTCCCAT CT CCACT GTT ATCCCTTT GGGGTTTTTT AATAT AAATT ATT AGTTT ACAT CA TTTTT GTATCT ACAT CTTTTTT CAC AAATTT GTCTTGCCTT ATT AAAGTT CTGT AAAAT AT ACT T AA AT G G A AA AA AT G ATGTTC ATTTAG ATT G AA AACTTTT CT C AG AT G G ATT G AT AATT G C AT T CAT CTT GT GTTTT AT AT GAG AAGGTGCCT CAAG AATTTCCT GTT GG ATTTGTTT AAAAGG AT TTTT AT CTTTCGT G AT AAACTTT GCTGTGT ACCAGG AACT AT AAAAACAAAAACTT GTT ACT A AAGAAAAT AT CT G AAAT GT G AT AAGTTCTT ATGCCATGTT AATTTC AT GT GTCAACTT CAACA TTT ACAT GT ATT ATTT CATT AT GT AAAAT GTTTTAGC AATTT AAT ATTTTGCACAGTT AGCAAA CTTT GT AT GTCATTTCCTTCAAGGCAT CATGCAGAGTTGACAT GAGATTT ATAAGGTTTT AA GTT GTTTGCATGT G AAAAT CAAAT ACAT ACTTT GGT AGTCTTT GAAT AC AAAGTCAT CTGCTC TT GTTTTT CAAGAATTTT G AGACACAAAGTT GTATGT AAAGG AAT AT ATT AATTTGCCGTTTT CT AGGT AG ATTTGCT CAAAAAGAGT GAAT CAACTT AAT ATGT ACAAAT G ATAGCTGT G AAAC T GT AG AAT AT CTTTGT GTCAGGCTTGGAGTT CATT GT G ACCTCCAAATTTTGCCT G AAGG AC CAGCTGGGCAAAGCATCTTTTAAATGTTCAGAGGCCAAAAGATAAACAAAAAAAAAACCTTA AAATCCT ACCT CTTT AAACAGCCTT CAG AT AAG AG AATCCT CAGTGCAAT CATT ATTTT G ATT CGTTTGGTACCTGTTTTCCTGGAGTTCCCGATTTTATTATTTTGGGGTGGCTCCAAGCATTA AG AGGTTT AAT CTTT GATGGCATTGTT CT AGTTTT G AAATTT CT AGT AT ATTT CAGAGTCT CT T AG AAG ACTT GT GTGGG AAGTTT CACTTT GTTTT CAGT GAAGAT CAC AAACCT CCTT CTTCC TTTACTCAAGAGGAAAGGTCCCAGTATACATATTTGAATGGTTGATGGTTTTCAAGACCTTC AGGGAGCTCCCTGCATTTTACCTAGAAACAGAAAAGGCCCGCAAAATCTTAAGTTTCCTGG CCTGCATTTCCCGGGTAGGGGCAAATGACTCCAAGCTGGTCTCTAAGCCAATACCCTTATA AACCAGAGCCCAGGAAAGACAGCTCGAGTGTATAATTCTCTGGAGCTCAATTCTATGCAGT TGTGCT G AT ATTT CATT AAGTCACTGTGT ATTTTT AAGT GTT G AT AC ATT AAAAGTCGCTTT A T GG AAG AT GAGT AAATTTTTT AAAT ACTTGG AAATTTT ATTTCCTT GTT AACTT CT AC AG AT C AGGGCATGCAACCAAAAGCAGCTT AAAT GAAAT ATTTT AAAAT AAAAT ATCAGGAAGCT ATT TTT AG ATTT CTT CT GGCTT AT GTTT CT ACTTT AGG ACCCT CATT GTT CT CTT ATT AAAAAAAAT T ATTTCCTGTGCATCTCATGGACTGCAGGGTAAATTATTTGGGCAT AAAT AATTT AAATAGTT TT CTTT CATTTT G ACT AT CTCCAGT AAT AACAGTTTTT ATT ATCCAGCAT ATT GGCTT ATTGCA CAAAT CTT AAAAT GT ACATT GACT ACTTT CT GAG AAG AAAGT GGTATCAGT ACT CAT GAT G A AAAGGTTACTACTGAACAAATTCACATTTCAGGAACACCTCTATCTTTGGTTTAAATCTTACT CTT AGTTTTTCCGTCT AAAAAT CAT ACTGGT ATT AGT ATCAGGT AAGG AAATT AAAGTTTTT A AAATGGTTT CATT CT CT GC AAT ATGCAAAATTT AGATTTT ACTTTCTGGT ACT GT AAAG AACC T GAAGT GATTTACACTT AATGGGT GATT AATCCAGT ATTCTTT ACCCT GAAT GTTT GG AT ATT AAAGTTCCTTT AT GTTTTCTAT AACCT GTGGGATCTT CTT GCAGT GATT ATT GT GT GTGAGAT TTTTTTT CTTTTTGGT CT AT CC AT ATT GTT AT ATT CACTCAGGT ATTTTTTTTTT AAT CTT ATT C CAGAATCAGTGGTTT AT ATT GGGTT ACT GTTTAACACCAAATGGAATTGGCATT CTGCAGAT TT AATT AATT AT G AAACCAGGGTCT CATTTT CCTT GCT GAT ACTT GTT GAAAAT GAG ATT CAC ATT CT AGTCTTT ATTTTCCTCCT GTTTT GTCCCT GTGCTTGT ACATCTT CCTTTT ATTT GTGTG TT AT AGTTCT ATTCCATTT G AG AAGGC AGTTGGT AAG AACT AG ATTGCAT GT ACAAAG ACAG GTTT ACT AAGTGCTGT ACAGT GGTCCT GAGGTT ACAGTT GAATT AGAAAAACGAAAT GT ACT T ACAGG AAAT AAG AAAGCAAACCTTT CAAAT G AG AGT GAT GATTT CTTT AAAAAAAAT CAGT TTTTTT CTCT C AA AT AATGTT CTTT ATTT C ACG A AAT C GT CA AT CTTAAGCATGAGCAGGGAT AAACAACTCCTAG AAGG AACT CAATT CATT CTTCCTGG ATTTTCTCTGTT GTT AAAT CACAAA AAT GAT AGTCCCCAAT CGTTT CTTTAT AGGAGGTT ATT ACATTTCATT ACAGTCACTGCATTT T GACT GTTGT GTTT AG AATTT G AAT GT ACATCCAAAAT GAT GAGTTT CAATTT AAG AGCCTT A AT AAAAT GTGT G AGTGT GTCT CAATT G AA
SEQ ID N° 30
MIMDTAGNDPYCFVEFHEHRHAAAALAAMNGRKIMGKEVKVNWATTPSSQKKDTSNHFHVFV GDLSPEITTEDIKAAFAPFGRISDARWKDMATGKSKGYGFVSFFNKWDAENAIQQMGGQWLG GRQIRTNWATRKPPAPKSTYESNTKQLSYDEWNQSSPSNCTVYCGGVTSGLTEQLMRQTFS PFGQIMEI RVFPDKGYSFVRFNSH ESAAHAIVSVNGTTI EGH WKCYWGKETLDM I N PVQQQN QIGYPQPYGQWGQWYGNAQQIGQYMPNGWQVPAYGMYGQAWNQQGFNQTQSSAPWMGP NYGVQPPQGQNGSM LPNQPSGYRVAGYETQ
Métodos de la invención
Por tanto, otro aspecto de la invención se refiere a un método de obtención de datos útiles para diagnosticar, predecir o pronosticar el desarrollo de CaP en un individuo, de ahora en adelante primer método de la invención, que comprende los siguientes pasos: a) Determinar los niveles del producto de expresión de los genes RNU6, SF3B1, snRNP200, RNU12, ESRP1, ESRP2, MAGOH, SND1, SRSF2, SRSF3, SRRM1, RNU4, RBM45, SRSF4, SRSF5, SRSF10, y/o TIA1 o cualquiera de sus combinaciones, en una muestra biológica ex vivo de dicho individuo, b) Comparar los niveles obtenidos en el paso anterior con los estándares.
En una realización preferida de este aspecto de la invención se determinan los niveles del producto de expresión de todos los genes simultáneamente.
En la presente invención "muestra biológica", tal como aquí se utiliza, se refiere, pero no se limita, a células, tejidos y/o fluidos biológicos de un organismo, obtenidos mediante cualquier método conocido por un experto en la materia; es decir, cualquiera seleccionada del grupo de fluidos corporales o células, o de un extracto celular o el sobrenadante del cultivo celular de dichas células, y/o biopsia líquida (sangre, suero, plasma, orina,... ). Preferiblemente la muestra es un tejido. El término “individuo”, tal y como se utiliza en la descripción, se refiere a animales, preferiblemente mamíferos, y más preferiblemente, humanos. El término“individuo” en esta memoria, es sinónimo de“paciente”, y no pretende ser limitativo en ningún aspecto, pudiendo ser éste de cualquier edad, sexo y condición física.
Los niveles de expresión de los genes van a dar un determinado perfil de expresión génica. El término "nivel", "nivel de expresión", también denominado "cantidad producto génico" se refiere al material bioquímico, ya sea ARN o proteína, resultado de la expresión de un gen. Algunas veces se usa una medida de la cantidad de producto génico para inferir qué tan activo es un gen. Se entiende por "perfil de expresión génica" el perfil génico obtenido tras la cuantificación del ARNm y/o de proteína producida por los genes de interés o biomarcadores, es decir, por los genes empleados como marcadores biológicos en la presente invención, en una muestra biológica aislada. El perfil de expresión de los genes se realiza, preferiblemente, determinando el nivel de ARNm derivado de su transcripción, previa extracción del ARN total presente en la muestra biológica aislada, lo cual puede realizarse mediante protocolos conocidos en el estado de la técnica. La determinación del nivel de ARNm derivado de la transcripción de los genes empleados como marcadores biológicos en la presente invención, puede realizarse, por ejemplo, aunque sin limitarnos, mediante amplificación por reacción en cadena de la polimerasa (PCR), retrotranscripción en combinación con la reacción en cadena de la polimerasa (RT-PCR), RT- PCR cuantitativa (qPCR), retrotranscripción en combinación con la reacción en cadena de la ligasa (RT-LCR), o cualquier otro método de amplificación de ácidos nucleicos; análisis en serie de la expresión génica (SAGE, SuperSAGE); chips de ADN elaborados con oligonucleótidos depositados por cualquier mecanismo; microarrays de ADN elaborados con oligonucleótidos sintetizados in situ mediante fotolitografía o por cualquier otro mecanismo; hibridación in situ utilizando sondas específicas marcadas con cualquier método de mareaje; mediante geles de electroforesis; mediante transferencia a membrana e hibridación con una sonda específica; mediante resonancia magnética nuclear o cualquier otra técnica de diagnóstico por imagen utilizando nanopartículas paramagnéticas o cualquier otro tipo de nanopartículas detectables funcionalizadas con anticuerpos o por cualquier otro medio. El perfil de expresión génica también podría obtenerse mediante la detección y/o cuantificación de las proteínas producto de la traducción del ARNm derivado de la transcripción de los genes empleados como marcadores biológicos en la presente invención, mediante por ejemplo, pero sin limitarnos, inmunodetección por western blot. La detección cuantitativa de la expresión de los genes empleados como marcadores biológicos en la presente invención puede realizarse más preferiblemente mediante PCR en tiempo real (RT-PCR ó RTqPCR). La detección en tiempo real de los productos amplificados puede llevarse a cabo mediante la utilización de moléculas fluorescentes que se intercalan en el ADN de cadena doble o mediante hibridación con diferentes tipos de sondas. Así pues, la detección de los niveles de proteínas o del nivel de expresión de los genes puede hacerse por cualquiera de las técnicas conocidas por el experto en la materia.
Los pasos (b) y/o (c), del método descrito anteriormente pueden ser total o parcialmente automatizados, por ejemplo, por medio de un equipo robótico sensor para la detección de la presencia en el paso (b) o la clasificación computarizada en el paso (c).
En una realización preferida de este aspecto de la invención, la detección del paso (b) se realiza mediante PCR, preferiblemente RT-PCR.
En el caso de que se detecte el nivel o los niveles de proteínas puede hacerse, al igual que en el caso de los genes, por cualquiera de las técnicas conocidas por el experto en la materia. Así, en otra realización preferida de este aspecto de la invención, la detección de los niveles de expresión se realiza por una técnica inmunológica.
En una realización más preferida, las técnicas inmunológicas están basadas en reacciones de precipitación, de aglutinación, inmunomarcación, radioinmunoanálisis y técnicas radioinmunométricas, preferentemente ELISA ( Enzime Linked ImmunoadSorbent Assay), o Western blot o en cualquiera de sus combinaciones.
Por tanto, otro aspecto de la invención se refiere a un método para diagnosticar, predecir o pronosticar el desarrollo de CaP en un individuo, de ahora en adelante segundo método de la invención, que comprende los pasos (a) y (b) del primer método de la invención, y además comprende:
(c) incluir a los individuos que presentan una mayor expresión de los factores RNU6, SF3B1, snRNP200, RNU12, ESRP1, ESRP2, MAGOH; SND1, SRSF2, SRSF3, SRRM1, RNU4, RBM45, SRSF4, SRSF5, SRSF10, y/o TIA1, o cualquiera de sus combinaciones, respecto a una muestra de referencia, en el grupo de individuos con mayor probabilidad de desarrollar CaP.
Una "muestra de referencia", como se usa aquí, significa una muestra obtenida de un grupo de sujetos sanos que no tiene un estado de enfermedad o fenotipo particular
Los niveles de referencia adecuada expresión de los genes puede ser determinada mediante la medición de los niveles de expresión de dichos genes en varios temas adecuados, y esos niveles de referencia se puede ajustar a las poblaciones específicas (por ejemplo, un nivel de referencia puede estar relacionada con la edad, por lo que las comparaciones se puede hacer entre los niveles de expresión en las muestras de los sujetos de una cierta edad y niveles de referencia para una enfermedad particular, el fenotipo, o falta de ella en un determinado grupo de edad). En una realización preferida, la muestra de referencia se obtiene de tejido prostático adyacente no tumoral. El experto en la técnica apreciará que el tipo de muestra de referencia puede variar dependiendo del método específico a realizar.
El perfil de expresión de los genes en la muestra de referencia de preferencia puede ser generado a partir de una población de dos o más personas. La población, por ejemplo, pueden contener 3, 4, 5, 10, 15, 20, 30, 40, 50 o más personas. Además, el perfil de expresión de los genes en la muestra de referencia y en la muestra de la persona que va a ser diagnosticada de acuerdo con los métodos de la presente invención pueden ser generados a partir de la misma persona, siempre que los perfiles sean analizados y el perfil de referencia son generados a partir de las muestras biológicas tomadas en diferentes momentos y se comparan entre sí. Por ejemplo, una muestra de un individuo puede obtener en el inicio de un período de estudio. Un perfil de marcador biológico de referencia de esta muestra se puede comparar con los perfiles de biomarcadores generados a partir de las muestras posteriores de la misma persona. En una realización preferida, la muestra de referencia es un conjunto de muestras de varios individuos.
Una vez que los niveles de expresión de los genes marcadores en relación con los valores de referencia para dichos genes se han determinado, es necesario identificar si existen alteraciones en la expresión de dichos genes (aumento o disminución de la expresión). La expresión de un gen se considera aumentada en una muestra de la materia objeto de estudio cuando los niveles de incremento con respecto a la muestra de referencia son al menos de un 5%, por lo menos 10%, por lo menos 15%, por lo menos el 20%, al menos un 25%, por lo menos 30%, por lo menos el 35%, por lo menos el 40%, por lo menos 45%, por lo menos el 50%, por lo menos el 55%, por lo menos el 60%, por menos por lo menos 65%, por lo menos el 70%, por lo menos el 75%, por lo menos el 80%, por lo menos el 85%, por lo menos el 90%, por lo menos el 95%, por lo menos 100%, por lo menos 1 10 %, por lo menos 120%, por lo menos 130%, por lo menos 140%, por lo menos 150%, o más. Del mismo modo, la expresión de un gen se considerada disminuida cuando sus niveles disminuyen con respecto a la muestra de referencia en al menos un 5%, por lo menos 10%, por lo menos 15%, por lo menos el 20%, por lo menos el 25%, al menos un 30%, por lo menos el 35%, por lo menos el 40%, por lo menos 45%, por lo menos el 50%, por lo menos el 55%, por lo menos el 60%), por lo menos el 65%, por lo menos 70%, por lo menos el 75%, por lo menos el 80%, por lo menos el 85%, por lo menos el 90%, por lo menos el 95%, por lo menos 100% (es decir, ausente).
KIT O DISPOSITIVO DE LA INVENCIÓN
Otro aspecto de la invención se refiere a un kit o dispositivo, de ahora en adelante kit o dispositivo de la invención, que comprende los elementos necesarios para detectar los niveles de expresión de snRNP200, SRSF3 y/o SRRM1 , o cualquiera de sus combinaciones, y donde: - Los cebadores o primers son secuencias de polinucleótidos de entre 10 y 30 pares de bases, más preferiblemente de entre 15 y 25 pares de bases, aún más preferiblemente de entre 18 y 22 pares de bases, y aún mucho más preferiblemente de alrededor de 20 pares de bases, que presentan una identidad de al menos un 80%, más preferiblemente de al menos un 90%, aún más preferiblemente de al menos un 95%, aún mucho más preferiblemente de al menos un 98%, y particularmente de un 100%, con un fragmento de las secuencias complementarias a la SEQ ID N° 1 (RNU6), SEQ ID N°: 2 ( SFR3B1 ), SEQ ID N° 4 ( SNRNP200 ), SEQ ID N° 6 ( RNU12 ), SEQ ID N° 7 ( ESRP1 ), SEQ ID N° 8 ( ESRP2 ), SEQ ID N° 10 ( MAGOH ), SEQ ID N° 12 (SND1), SEQ ID N° 14 ( SRSF2 ), SEQ ID N° 16 ( SRSF3 ), SEQ ID N° 18 ( SRRM1 ), SEQ ID N° 20 (RNU4), SEQ ID N° 21 ( RBM45 ), SEQ ID N° 23 (S RSF4), SEQ ID N° 25 (S RSF5), SEQ ID N° 27 (S RSF10), SEQ ID N° 29 ( TIA 1 ),
- Las sondas son secuencias de polinucleótidos de entre 80 y 1100 pares de bases, más preferiblemente de entre 100 y 1000 pares de bases, y aún más preferiblemente de entre 200 y 500 pares de bases, que presentan una identidad de al menos un 80%, más preferiblemente de al menos un 90%, aún más preferiblemente de al menos un 95%, aún mucho más preferiblemente de al menos un 98%, y particularmente de un 100%, con un fragmento de las secuencias complementarias a la SEQ ID N° 1 (RNU6), SEQ ID N°: 2 ( SFR3B1 ), SEQ ID N° 4 (SNRNP200), SEQ ID N° 6 ( RNU12 ), SEQ ID N° 7 ( ESRP1 ), SEQ ID N° 8 ( ESRP2 ), SEQ ID N° 10 (MAGOH), SEQ ID N° 12 (SND1), SEQ ID N° 14 ( SRSF2 ), SEQ ID N° 16 ( SRSF3 ), SEQ ID N° 18 ( SRRM1 ), SEQ ID N° 20 (RNU4), SEQ ID N° 21 ( RBM45 ), SEQ ID N° 23 (S RSF4), SEQ ID N° 25 (S RSF5), SEQ ID N° 27 (S RSF10), SEQ ID N° 29 ( TIA 1 ),
- Los anticuerpos son capaces de unirse específicamente a una región formada por cualquiera de las secuencias aminoacídicas SEQ ID N°: 3 ( SFR3B1 ), SEQ ID N° 5 (SNRNP200), SEQ ID N° 9 ( ESRP2 ), SEQ ID N° 1 1 (MAGOH), SEQ ID N° 13 (SND1), SEQ ID N° 15 (SRSF2), SEQ ID N° 17 (SRSF3), SEQ ID N° 19 (SRRM1), SEQ ID N° 22 ( RBM45 ), SEQ ID N° 24 (S RSF4), SEQ ID N° 26 (S RSF5), SEQ ID N° 28 (S RSF10), SEQ ID N° 30 (TIA 1),
En otra realización preferida de este aspecto de la invención, los cebadores, sondas o anticuerpos están modificados o marcados, por ejemplo, pero sin limitarnos, mediante un mareaje radiactivo o inmunológico. Así, preferiblemente, los oligonucleótidos presentan modificaciones en alguno de sus nucleótidos, como por ejemplo, pero sin limitarnos a, nucleótidos que tengan alguno de sus átomos con un isótopo radiactivo, normalmente o nucleótidos marcados inmunológicamente, como por ejemplo con una molécula de digoxigenina, y/o inmovilizadas en una membrana. Varias posibilidades son conocidas en el estado de la técnica. AUTOMATIZACIÓN DEL MÉTODO DE LA INVENCIÓN IMPLEMENTÁNDOLO EN UN PROGRAMA DE ORDENADOR
Otro aspecto de la invención se refiere a un programa de ordenador que comprende instrucciones para realizar el procedimiento de acuerdo con cualquiera de los métodos de la invención.
En particular, la invención abarca programas de ordenador dispuestos sobre o dentro de una portadora. La portadora puede ser cualquier entidad o dispositivo capaz de soportar el programa. Como variante, la portadora podría ser un circuito integrado en el que va incluido el programa y que se haya adaptado para ejecutar, o para ser utilizado en la ejecución de los procesos correspondientes.
Por ejemplo, los programas podrían estar incorporados en un medio de almacenamiento, como una memoria ROM, una memoria CD ROM o una memoria ROM de semiconductor, una memoria USB, o un soporte de grabación magnética, por ejemplo, un disco flexible o un disco duro. Alternativamente, los programas podrían estar soportados en una señal portadora transmisible; por ejemplo, podría tratarse de una señal eléctrica u óptica que podría transportarse a través de cable eléctrico u óptico, por radio o por cualesquiera otros medios.
La invención se extiende también a programas de ordenador adaptados para que cualquier medio de procesamiento pueda llevar a la práctica los métodos de la invención. Los programas de ordenador también abarcan aplicaciones en la nube basadas en dicho procedimiento.
Otros aspectos de la invención se refieren al medio de almacenamiento legible y a la señal transmisible que comprende instrucciones de programa necesarias para la ejecución del método de invención por un ordenador.
EJEMPLOS DE LA INVENCIÓN.
Para los estudios de los niveles de expresión de varios componentes de la maquinaria de splicing, se analizaron 2 cohortes independientes: 1 ) Cohorte de 84 muestras de tejido prostático fijadas con formalina y embebidas en parafina (FFPE) de pacientes con CaP. Cada muestra presento tejido tumoral y tejido adyacente no tumoral, usado como control en el estudio. Los tejidos tumorales y no tumorales fueron separados por patólogos expertos. 2) Cohorte de 42 muestras de tejido prostático obtenidas a partir de pacientes con alto riesgo de padecer CaP (PSA > 20,0 y/o resultado de tacto rectal positivo) mediante una biopsia prostática por punción con aguja gruesa. RESULTADOS
Se ha demostrado que la expresión de 26 componentes de la maquinaría de splicing y factores asociados a la misma se encuentran desregulada en CaP. En concreto 25 de ellos se encuentran sobreexpresados, mientras que solo la expresión de SRRM4 disminuye en muestras de tejido tumoral prostático con respecto a la zona adyacente no tumoral (Fig 1 A). De hecho, la expresión de estos 26 genes es capaz de diferenciar entre muestras tumorales y sus respectivas regiones adyacentes no tumorales con un área bajo la curva de 0,877 (Fig 1 B).
Además, algunos de estos factores se encontraron relacionados con parámetros clínicos de agresividad tumoral. Concretamente, la expresión de RNU6, SF3B1, snRNP200, RNU12, ESRP1, ESRP2, MAGOH, SND1, SRSF2, SRSF3 y SRRM1 se encontró correlacionada positivamente con el grado de Gleason de las muestras (Tabla 1). Por otra parte, la expresión de RNU4, snRNP200, ESRP2, SRSF3, SRRM1, y TIA 1 se encontró correlacionada positivamente con el estadio T. Asimismo, la elevada expresión de una serie de factores se asoció con la presencia de invasión perineural y/o linfovascular, así como con CaP significativo desde un punto de vista clínico, es decir, CaP con un grado de Gleason mayor o igual a 7 (Tabla 1). Adicionalmente, la elevada expresión de 1 1 componentes del spliceosoma y factores de splicing (. snRNP200 , ESRP1, ESRP2, RBM45, SND1, SRSF3, SRSF4, SRSF5, SRSF10, SRRM1, TI A ) se asoció con el desarrollo posterior de recidivas de CaP (Fig 2A), sugiriendo un posible papel de estos factores (individuales o en conjunto) como marcadores de pronóstico tumoral del CaP. De hecho, los niveles de expresión combinados de estos 1 1 genes dibujaron una curva ROC con un área bajo la curva de 0.806 para diferenciar entre muestras de pacientes que recidivarán de la enfermedad y pacientes que no lo harán (Fig 2B).
Cabe destacar que snRNP200, SRSF3 y SRRM1, fueron los únicos factores que se encontraron alterados significativa y consistentemente en todas las comparativas realizadas en este estudio (Fig 1A, Fig 2B, Tabla 1), indicando la elevada importancia de estos tres factores en la fisiopatología del CaP y definiendo, por tanto, una posible utilidad como novedosas dianas terapéuticas para esta patología. Por tanto, estos tres factores fueron los seleccionados para estudios más profundos.
En una cohorte independiente de biopsias de CaP significativo (n=42), se observó que un elevado nivel de snRNP200, SRSF3 y SRRM1 se asoció con la presencia de metástasis en el momento del diagnóstico, y en concreto, con metástasis de alta carga (Fig 3A), es decir, aquellas más agresivas. Además, mayores niveles de expresión de snRNP200 (pero no de SRRM1, ni SRSF3) se asociaron significativamente con un nivel de Gleason mayor o igual que 8 (Fig 3B), aunque estos niveles de expresión no llegaron a correlacionar significativamente con el Grado Gleason (tendencia con p=0.074 y R=0.272 en el caso de snRNP200) (Fig 3C). Pese a esto, y aunque los niveles de expresión de SRRM1 y SRSF3 correlacionaron positivamente con los niveles de expresión del marcador de diagnóstico“PSA”, no se observó esta correlación con el factor snRNP200, poniendo de manifiesto la ya conocida limitada capacidad del PSA como marcador de agresividad y pronóstico del CaP (Fig 3D). Por último, se observó que tanto los niveles de expresión de snRNP200, como SRSF3 y SRRM1 correlacionaron positivamente con los niveles de expresión de la variante de splicing AR-v7 (Fig 3E) pero no con los niveles de la variante canónica AR (Fig 3F). De hecho, esto se reafirmó con las evidentes, significativas y pronunciadas correlaciones positivas observadas entre los niveles de expresión de estos tres factores de splicing y el ratio de expresión AR-v7/AR (Fig 3G). Estos resultados sugieren de nuevo el elevado potencial de estos tres factores (snRNP200, SRRM1 y SRSF3) como dianas terapéuticas para el tratamiento del CaP y el CaP resistente a la castración (CPRC).
Figure imgf000048_0002
Leyenda del grado de correlación (Coeficiente R)
Figure imgf000048_0001
- J -()/> -0,5 -0.4 -(U -0.2 -0. 1 O 0. 1 0.2 (U 0.4 0.5 0.6 <1,7 0.8 0.0
Tabla 1. Numerosos componentes de la maquinaria de splicing y factores asociados correlacionan positivamente o se asocian con parámetros clínicos de agresividad tumoral característicos del CaP en la zona tumoral de muestras fijadas en parafina (n=84). El color dentro de cada cuadro de correlaciones indica el grado de correlación (R de Spearman), que también se encuentra detallado numéricamente en el interior de cada cuadro. En el interior de los cuadros de las asociaciones clínicas se indica la diferencia entre las medias de los grupos ± error. Los asteriscos (*, p<0.05; **, p<0.01 ; ***, p<0.001) indican diferencias estadísticamente significativas.

Claims

REIVINDICACIONES
1.- Uso del producto de expresión de los genes snRNP200. SRSF3 y SRRM1 para diagnosticar, predecir o pronosticar el desarrollo de Cáncer de Próstata (CaP) en un individuo.
2.- El uso simultáneo del producto de expresión de los genes snRNP200, SRSF3 y SRRM1 según la reivindicación anterior, y además de los genes RNU6, SF3B1, RNU12, ESRP1 , ESRP2, MAGOH, SND1, SRSF2, RNU4, RBM45, SRSF4, SRSF5, SRSF10, y/o TIA1
3.- Un método in vitro de obtención de obtención de datos útiles para diagnosticar, predecir o pronosticar el desarrollo de Cáncer de Próstata (CaP) en un individuo, que comprende: a) Determinar en una muestra biológica aislada de dicho individuo los niveles del producto de expresión de los genes snRNP200, SRSF3 y/o SRRM1, y más preferiblemente también de los genes RNU6, SF3B1, RNU12, ESRP1 , ESRP2, MAGOH ; SND1, SRSF2 , RNU4, RBM45, SRSF4, SRSF5, SRSF10, y/o TIA1, según se define en las reivindicaciones 1-2, y
b) Comparar los niveles obtenidos en el paso anterior en relación a la cantidad de expresión detectada para dichos genes en una muestra referencia de respuesta conocida.
4 - Un método in vitro para predecir o pronosticar el desarrollo de Cáncer de Próstata (CaP) en un individuo, que comprende los pasos (a) y (b) según la reivindicación 2, y además comprende incluir en el grupo de individuos con mayor riesgo de desarrollo de CaP aquellos pacientes con elevados niveles de expresión de los factores de splicing RNU6, SF3B1, RNU12, ESRP1 , ESRP2, MAGOH ; SND1, SRSF2: RNU4, RBM45, SRSF4, SRSF5, SRSF10, y/o TIA1, en comparación con una muestra de referencia.
5.- El método según cualquiera de las reivindicaciones 2-3 donde la muestra biológica aislada es un tejido fresco, tejido embebido en parafina o ARN extraído de un tejido de un individuo.
6.- El método según cualquiera de las reivindicaciones 2-4 donde la detección del producto de expresión de los genes se realiza mediante cualquier técnica de expresión génica como RT-PCR y preferiblemente por PCR cuantitativa (qPCR).
7.- El método según cualquiera de las reivindicaciones 2-4 donde el producto de expresión son proteínas, preferiblemente SF3B1 , SNRNP200, ESRP2, MAGOH, SND1 , SRSF2, SRSF3, SRRM1, RBM45, SRSF4, SRSF5, SRSF10 y/o TIA1 , o cualquiera de sus combinaciones.
8.- El método según la reivindicación anterior donde las proteínas se identifican por un método inmunohistoquímico, preferiblemente seleccionado de entre Western Blot, espectrometría de masa, fluorescencia, absorción y/o luminiscencia, y más preferiblemente se utiliza Western Blot.
9.- El método según la reivindicación anterior donde al individuo se le incluye en el grupo de individuos con mayor probabilidad de desarrollar CaP, cuando estos componentes de maquinaria de splicing específicos, incluyendo RNU6, SF3B1, snRNP200, RNU12, ESRP1 , ESRP2, MAGOH: SND1 , SRSF2, SRSF3, SRRM1, RNU4, RBM45, SRSF4, SRSF5, SRSF10, y/o TIA1, o cualquiera de sus combinaciones, presentan altos niveles de expresión por debajo del tercil inferior de expresión, con un AUC de 0.902 (sensibilidad del 85% y especificidad del 82%).
10. -Un kit o dispositivo que comprende los elementos necesarios para cuantificar los niveles de expresión de los genes según se definen en las reivindicaciones 1-9, y donde:
- los cebadores o primers son secuencias de polinucleótidos de entre 10 y 30 pares de bases, más preferiblemente de entre 15 y 25 pares de bases, aún más preferiblemente de entre 18 y 22 pares de bases, y aún mucho más preferiblemente de alrededor de 20 pares de bases, que presentan una identidad de al menos un 80%, más preferiblemente de al menos un 90%, aún más preferiblemente de al menos un 95%, aún mucho más preferiblemente de al menos un 98%, y particularmente de un 100%, con un fragmento de las secuencias complementarias a la SEQ ID N° 1 (RNU6), SEQ ID N°: 2 ( SFR3B1 ), SEQ ID N° 4 (SNRNP200), SEQ ID N° 6 ( RNU12 ), SEQ ID N° 7 ( ESRP1 ), SEQ ID N° 8 ( ESRP2 ), SEQ ID N° 10 (MAGOH), SEQ ID N° 12 (SND1), SEQ ID N° 14 ( SRSF2 ), SEQ ID N° 16 ( SRSF3 ), SEQ ID N° 18 ( SRRM1 ), SEQ ID N° 20 (RNU4), SEQ ID N° 21 ( RBM45 ), SEQ ID N° 23 (S RSF4), SEQ ID N° 25 (S RSF5), SEQ ID N° 27 (S RSF10), SEQ ID N° 29 ( TIA1 ),
- Las sondas son secuencias de polinucleótidos de entre 80 y 1100 pares de bases, más preferiblemente de entre 100 y 1000 pares de bases, y aún más preferiblemente de entre 200 y 500 pares de bases, que presentan una identidad de al menos un 80%, más preferiblemente de al menos un 90%, aún más preferiblemente de al menos un 95%, aún mucho más preferiblemente de al menos un 98%, y particularmente de un 100%, con un fragmento de las secuencias complementarias a la SEQ ID N° 1 (RNU6), SEQ ID N°: 2 ( SFR3B1 ), SEQ ID N° 4 ( SNRNP200 ), SEQ ID N° 6 ( RNU12 ), SEQ ID N° 7 ( ESRP1 ), SEQ ID N° 8 ( ESRP2 ), SEQ ID N° 10 (MAGOH), SEQ ID N° 12 (SND1), SEQ ID N° 14 ( SRSF2 ), SEQ ID N° 16 ( SRSF3 ), SEQ ID N° 18 ( SRRM1 ), SEQ ID N° 20 (RNU4), SEQ ID N° 21 ( RBM45 ), SEQ ID N° 23 (S RSF4), SEQ ID N° 25 (S RSF5), SEQ ID N° 27 (S RSF10), SEQ ID N° 29 ( TIA 1 ),
- Los anticuerpos son capaces de unirse específicamente a una región formada por cualquiera de las secuencias aminoacídicas SEQ ID N°: 3 ( SFR3B1 ), SEQ ID N° 5 (SNRNP200), SEQ ID N° 9 ( ESRP2 ), SEQ ID N° 11 (MAGOH), SEQ ID N° 13 (SND1), SEQ ID N° 15 ( SRSF2 ), SEQ ID N° 17 ( SRSF3 ), SEQ ID N° 19 ( SRRM1 ), SEQ ID N° 22 ( RBM45 ), SEQ ID N° 24 (S RSF4), SEQ ID N° 26 (S RSF5), SEQ ID N° 28
(S RSF10), SEQ ID N° 30 (TÍA 1).
11.- El uso del kit o dispositivo según la reivindicación anterior para diagnosticar, predecir o pronosticar el desarrollo de Cáncer de Próstata (CaP) en un individuo.
12.- Un programa de ordenador que comprende instrucciones de programa para hacer que un ordenador lleve a la práctica el procedimiento de acuerdo con el método según cualquiera de las reivindicaciones 3 a 5.
13.- Un medio de almacenamiento legible por un ordenador que comprende instrucciones de programa capaces de hacer que un ordenador lleve a cabo los pasos del método según cualquiera de las reivindicaciones 3 a 9.
14.- Una señal transmisible que comprende instrucciones de programa capaces de hacer que un ordenador lleve a cabo los pasos del método según cualquiera de las reivindicaciones 3 a 9
PCT/ES2020/070086 2019-02-08 2020-02-08 Método para diagnosticar o pronosticar el desarrollo de cáncer de próstata en un individuo Ceased WO2020161378A2 (es)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
ESP201930104 2019-02-08
ES201930104 2019-02-08

Publications (2)

Publication Number Publication Date
WO2020161378A2 true WO2020161378A2 (es) 2020-08-13
WO2020161378A3 WO2020161378A3 (es) 2020-12-10

Family

ID=71947058

Family Applications (1)

Application Number Title Priority Date Filing Date
PCT/ES2020/070086 Ceased WO2020161378A2 (es) 2019-02-08 2020-02-08 Método para diagnosticar o pronosticar el desarrollo de cáncer de próstata en un individuo

Country Status (1)

Country Link
WO (1) WO2020161378A2 (es)

Also Published As

Publication number Publication date
WO2020161378A3 (es) 2020-12-10

Similar Documents

Publication Publication Date Title
US20220213553A1 (en) Prkc fusions
CN108265106B (zh) 用于在癌症患者中预测药物反应性的方法
EP3155131B1 (en) Raf1 fusions
ES2861316T3 (es) Métodos para pronosticar cáncer de próstata
US20190389969A1 (en) Ntrk2 fusions
CN110546263B (zh) 用于检测卵巢肿瘤的试剂盒、装置和方法
CN111961725B (zh) 胰腺癌的检测试剂盒或装置以及检测方法
KR20170015509A (ko) 담도암 검출 키트 또는 디바이스 및 검출 방법
US20100216131A1 (en) Gene expression profiling of esophageal carcinomas
JP2010200753A (ja) 癌における新規治療標的
US6974672B2 (en) Gene amplification in cancer
WO2019050478A1 (en) BIOMARKERS OF RENAL CELL CARCINOMA WITH CLEAR CELLS
KR20130094342A (ko) 인간 표피 성장 인자 수용체 유전자 내의 돌연변이를 탐지하기 위한 방법 및 조성물
WO2003045230A2 (en) Novel compositions and methods for cancer
EP3390661B1 (en) Use of antisense long non-coding rnas for the diagnosis of prostate cancer
EP3870720A1 (en) Use of long non-coding rna for the diagnosis of prostate cancer
US8741575B2 (en) Methods of predicting high grade gliomas using senescence associated genes
WO2020161378A2 (es) Método para diagnosticar o pronosticar el desarrollo de cáncer de próstata en un individuo
ES2631193T3 (es) Marcadores tumorales
JP2010501162A5 (es)
JP2020080773A (ja) ニボルマブ薬効予測のためのキット及び方法
ES2646826B1 (es) MicroARNs como biomarcadores para el diagnóstico del cáncer de pulmón
WO2020099708A2 (es) Método para predecir o pronosticar el desarrollo de diabetes mellitus tipo 2 en un individuo
KR101507656B1 (ko) 폐암 환자의 생존 예측용 gnb2l1 다형성 마커 및 이를 이용한 폐암 생존 예후의 예측 방법
HK1257884B (en) Methods for predicting drug responsiveness in cancer patients

Legal Events

Date Code Title Description
121 Ep: the epo has been informed by wipo that ep was designated in this application

Ref document number: 20751915

Country of ref document: EP

Kind code of ref document: A2

NENP Non-entry into the national phase

Ref country code: DE

122 Ep: pct application non-entry in european phase

Ref document number: 20751915

Country of ref document: EP

Kind code of ref document: A2