ES3040741T3 - Methods of analyzing cell free nucleic acids and applications thereof - Google Patents
Methods of analyzing cell free nucleic acids and applications thereofInfo
- Publication number
- ES3040741T3 ES3040741T3 ES21759938T ES21759938T ES3040741T3 ES 3040741 T3 ES3040741 T3 ES 3040741T3 ES 21759938 T ES21759938 T ES 21759938T ES 21759938 T ES21759938 T ES 21759938T ES 3040741 T3 ES3040741 T3 ES 3040741T3
- Authority
- ES
- Spain
- Prior art keywords
- nucleic acid
- cell
- sequencing
- dna
- cancer
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Active
Links
Classifications
-
- C—CHEMISTRY; METALLURGY
- C12—BIOCHEMISTRY; BEER; SPIRITS; WINE; VINEGAR; MICROBIOLOGY; ENZYMOLOGY; MUTATION OR GENETIC ENGINEERING
- C12N—MICROORGANISMS OR ENZYMES; COMPOSITIONS THEREOF; PROPAGATING, PRESERVING, OR MAINTAINING MICROORGANISMS; MUTATION OR GENETIC ENGINEERING; CULTURE MEDIA
- C12N15/00—Mutation or genetic engineering; DNA or RNA concerning genetic engineering, vectors, e.g. plasmids, or their isolation, preparation or purification; Use of hosts therefor
-
- C—CHEMISTRY; METALLURGY
- C40—COMBINATORIAL TECHNOLOGY
- C40B—COMBINATORIAL CHEMISTRY; LIBRARIES, e.g. CHEMICAL LIBRARIES
- C40B50/00—Methods of creating libraries, e.g. combinatorial synthesis
- C40B50/06—Biochemical methods, e.g. using enzymes or whole viable microorganisms
-
- C—CHEMISTRY; METALLURGY
- C12—BIOCHEMISTRY; BEER; SPIRITS; WINE; VINEGAR; MICROBIOLOGY; ENZYMOLOGY; MUTATION OR GENETIC ENGINEERING
- C12N—MICROORGANISMS OR ENZYMES; COMPOSITIONS THEREOF; PROPAGATING, PRESERVING, OR MAINTAINING MICROORGANISMS; MUTATION OR GENETIC ENGINEERING; CULTURE MEDIA
- C12N15/00—Mutation or genetic engineering; DNA or RNA concerning genetic engineering, vectors, e.g. plasmids, or their isolation, preparation or purification; Use of hosts therefor
- C12N15/09—Recombinant DNA-technology
- C12N15/10—Processes for the isolation, preparation or purification of DNA or RNA
- C12N15/1034—Isolating an individual clone by screening libraries
- C12N15/1082—Preparation or screening gene libraries by chromosomal integration of polynucleotide sequences, HR-, site-specific-recombination, transposons, viral vectors
-
- C—CHEMISTRY; METALLURGY
- C12—BIOCHEMISTRY; BEER; SPIRITS; WINE; VINEGAR; MICROBIOLOGY; ENZYMOLOGY; MUTATION OR GENETIC ENGINEERING
- C12Q—MEASURING OR TESTING PROCESSES INVOLVING ENZYMES, NUCLEIC ACIDS OR MICROORGANISMS; COMPOSITIONS OR TEST PAPERS THEREFOR; PROCESSES OF PREPARING SUCH COMPOSITIONS; CONDITION-RESPONSIVE CONTROL IN MICROBIOLOGICAL OR ENZYMOLOGICAL PROCESSES
- C12Q1/00—Measuring or testing processes involving enzymes, nucleic acids or microorganisms; Compositions therefor; Processes of preparing such compositions
- C12Q1/68—Measuring or testing processes involving enzymes, nucleic acids or microorganisms; Compositions therefor; Processes of preparing such compositions involving nucleic acids
- C12Q1/6806—Preparing nucleic acids for analysis, e.g. for polymerase chain reaction [PCR] assay
-
- C—CHEMISTRY; METALLURGY
- C12—BIOCHEMISTRY; BEER; SPIRITS; WINE; VINEGAR; MICROBIOLOGY; ENZYMOLOGY; MUTATION OR GENETIC ENGINEERING
- C12Q—MEASURING OR TESTING PROCESSES INVOLVING ENZYMES, NUCLEIC ACIDS OR MICROORGANISMS; COMPOSITIONS OR TEST PAPERS THEREFOR; PROCESSES OF PREPARING SUCH COMPOSITIONS; CONDITION-RESPONSIVE CONTROL IN MICROBIOLOGICAL OR ENZYMOLOGICAL PROCESSES
- C12Q1/00—Measuring or testing processes involving enzymes, nucleic acids or microorganisms; Compositions therefor; Processes of preparing such compositions
- C12Q1/68—Measuring or testing processes involving enzymes, nucleic acids or microorganisms; Compositions therefor; Processes of preparing such compositions involving nucleic acids
- C12Q1/6844—Nucleic acid amplification reactions
- C12Q1/6853—Nucleic acid amplification reactions using modified primers or templates
- C12Q1/6855—Ligating adaptors
-
- C—CHEMISTRY; METALLURGY
- C12—BIOCHEMISTRY; BEER; SPIRITS; WINE; VINEGAR; MICROBIOLOGY; ENZYMOLOGY; MUTATION OR GENETIC ENGINEERING
- C12Q—MEASURING OR TESTING PROCESSES INVOLVING ENZYMES, NUCLEIC ACIDS OR MICROORGANISMS; COMPOSITIONS OR TEST PAPERS THEREFOR; PROCESSES OF PREPARING SUCH COMPOSITIONS; CONDITION-RESPONSIVE CONTROL IN MICROBIOLOGICAL OR ENZYMOLOGICAL PROCESSES
- C12Q1/00—Measuring or testing processes involving enzymes, nucleic acids or microorganisms; Compositions therefor; Processes of preparing such compositions
- C12Q1/68—Measuring or testing processes involving enzymes, nucleic acids or microorganisms; Compositions therefor; Processes of preparing such compositions involving nucleic acids
- C12Q1/6869—Methods for sequencing
-
- C—CHEMISTRY; METALLURGY
- C12—BIOCHEMISTRY; BEER; SPIRITS; WINE; VINEGAR; MICROBIOLOGY; ENZYMOLOGY; MUTATION OR GENETIC ENGINEERING
- C12Q—MEASURING OR TESTING PROCESSES INVOLVING ENZYMES, NUCLEIC ACIDS OR MICROORGANISMS; COMPOSITIONS OR TEST PAPERS THEREFOR; PROCESSES OF PREPARING SUCH COMPOSITIONS; CONDITION-RESPONSIVE CONTROL IN MICROBIOLOGICAL OR ENZYMOLOGICAL PROCESSES
- C12Q1/00—Measuring or testing processes involving enzymes, nucleic acids or microorganisms; Compositions therefor; Processes of preparing such compositions
- C12Q1/68—Measuring or testing processes involving enzymes, nucleic acids or microorganisms; Compositions therefor; Processes of preparing such compositions involving nucleic acids
- C12Q1/6876—Nucleic acid products used in the analysis of nucleic acids, e.g. primers or probes
- C12Q1/6883—Nucleic acid products used in the analysis of nucleic acids, e.g. primers or probes for diseases caused by alterations of genetic material
- C12Q1/6886—Nucleic acid products used in the analysis of nucleic acids, e.g. primers or probes for diseases caused by alterations of genetic material for cancer
-
- G—PHYSICS
- G16—INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
- G16B—BIOINFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR GENETIC OR PROTEIN-RELATED DATA PROCESSING IN COMPUTATIONAL MOLECULAR BIOLOGY
- G16B20/00—ICT specially adapted for functional genomics or proteomics, e.g. genotype-phenotype associations
-
- G—PHYSICS
- G16—INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
- G16B—BIOINFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR GENETIC OR PROTEIN-RELATED DATA PROCESSING IN COMPUTATIONAL MOLECULAR BIOLOGY
- G16B40/00—ICT specially adapted for biostatistics; ICT specially adapted for bioinformatics-related machine learning or data mining, e.g. knowledge discovery or pattern finding
- G16B40/20—Supervised data analysis
-
- G—PHYSICS
- G16—INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
- G16H—HEALTHCARE INFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR THE HANDLING OR PROCESSING OF MEDICAL OR HEALTHCARE DATA
- G16H50/00—ICT specially adapted for medical diagnosis, medical simulation or medical data mining; ICT specially adapted for detecting, monitoring or modelling epidemics or pandemics
- G16H50/20—ICT specially adapted for medical diagnosis, medical simulation or medical data mining; ICT specially adapted for detecting, monitoring or modelling epidemics or pandemics for computer-aided diagnosis, e.g. based on medical expert systems
-
- G—PHYSICS
- G16—INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
- G16H—HEALTHCARE INFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR THE HANDLING OR PROCESSING OF MEDICAL OR HEALTHCARE DATA
- G16H50/00—ICT specially adapted for medical diagnosis, medical simulation or medical data mining; ICT specially adapted for detecting, monitoring or modelling epidemics or pandemics
- G16H50/30—ICT specially adapted for medical diagnosis, medical simulation or medical data mining; ICT specially adapted for detecting, monitoring or modelling epidemics or pandemics for calculating health indices; for individual health risk assessment
-
- C—CHEMISTRY; METALLURGY
- C12—BIOCHEMISTRY; BEER; SPIRITS; WINE; VINEGAR; MICROBIOLOGY; ENZYMOLOGY; MUTATION OR GENETIC ENGINEERING
- C12Q—MEASURING OR TESTING PROCESSES INVOLVING ENZYMES, NUCLEIC ACIDS OR MICROORGANISMS; COMPOSITIONS OR TEST PAPERS THEREFOR; PROCESSES OF PREPARING SUCH COMPOSITIONS; CONDITION-RESPONSIVE CONTROL IN MICROBIOLOGICAL OR ENZYMOLOGICAL PROCESSES
- C12Q2600/00—Oligonucleotides characterized by their use
- C12Q2600/156—Polymorphic or mutational markers
Landscapes
- Chemical & Material Sciences (AREA)
- Life Sciences & Earth Sciences (AREA)
- Health & Medical Sciences (AREA)
- Engineering & Computer Science (AREA)
- Organic Chemistry (AREA)
- Proteomics, Peptides & Aminoacids (AREA)
- Wood Science & Technology (AREA)
- Zoology (AREA)
- Genetics & Genomics (AREA)
- Physics & Mathematics (AREA)
- Bioinformatics & Cheminformatics (AREA)
- General Health & Medical Sciences (AREA)
- Biotechnology (AREA)
- Analytical Chemistry (AREA)
- Biophysics (AREA)
- Molecular Biology (AREA)
- General Engineering & Computer Science (AREA)
- Biochemistry (AREA)
- Microbiology (AREA)
- Medical Informatics (AREA)
- Immunology (AREA)
- Biomedical Technology (AREA)
- Pathology (AREA)
- Public Health (AREA)
- Data Mining & Analysis (AREA)
- Bioinformatics & Computational Biology (AREA)
- Spectroscopy & Molecular Physics (AREA)
- Theoretical Computer Science (AREA)
- Databases & Information Systems (AREA)
- Evolutionary Biology (AREA)
- Chemical Kinetics & Catalysis (AREA)
- Epidemiology (AREA)
- Oncology (AREA)
- Hospice & Palliative Care (AREA)
- Software Systems (AREA)
- Computer Vision & Pattern Recognition (AREA)
- Evolutionary Computation (AREA)
- Bioethics (AREA)
- Artificial Intelligence (AREA)
- Primary Health Care (AREA)
Abstract
Se describen los procesos y materiales para la detección de neoplasias mediante biopsia. Se describen los procesos y materiales para la creación de una biblioteca de secuenciación. Se describen los procesos y materiales para la secuenciación dirigida. Se describen los procesos y materiales para mitigar las fuentes de confusión. Los ácidos nucleicos libres de células pueden secuenciarse y el resultado de la secuenciación puede utilizarse para detectar secuencias derivadas de una neoplasia. (Traducción automática con Google Translate, sin valor legal)
Description
DESCRIPCIÓN
Métodos de análisis de ácidos nucleicos libres de células y aplicaciones de los mismos
Referencia cruzada a solicitudes relacionadas
Esta solicitud reivindica el beneficio de la Solicitud de Patente Provisional de los EE. UU. N.° 62/980.972 titulada "Métodos de análisis de ácidos nucleicos libres de células y aplicaciones de los mismos" presentada el 24 de febrero de 2020.
DECLARACIÓN CON RESPECTO A LA INVESTIGACIÓN CON FONDOS FEDERALES
La presente invención se realizó con el respaldo del gobierno a tenor de los contratos CA186569 y CA188298 otorgados por los Institutos Nacionales de Salud de los EE. UU. El gobierno posee determinados derechos sobre la invención.
Campo de la invención
La presente divulgación se refiere en general a métodos de análisis de ácidos nucleicos libres de células y, más específicamente, se refiere a métodos de eliminación de variables de confusión.
Antecedentes
Los análisis de sangre no invasivos que pueden detectar alteraciones somáticas (por ejemplo, ácidos nucleicos mutados) basándose en el análisis de ácidos nucleicos libres de células (por ejemplo, ADNlc y ARNlc) pueden ser candidatos atractivos para aplicaciones de cribado de cáncer debido a la relativa facilidad de obtención de muestras de ensayo biológicas (por ejemplo, fluidos biológicos).
El documento WO2019/055715 A1 describe métodos, sistemas y productos de programas informáticos para determinar secuencias de interés usando índices moleculares únicos (UMI, por sus siglas en inglés).
MacConaillet al. BMC Genomics(2018) 19:30; DOI 10.1186/s12864-017-4428-5 han descrito adaptadores de secuenciación de índice doble únicos con UMI para su uso en secuenciación
Sumario
La presente invención se refiere a métodos para preparar una biblioteca de ADN para secuenciación de acuerdo con las reivindicaciones anexas 1 a 6, y al uso de una colección de moléculas de ADN como biblioteca de ADN para secuenciación, de acuerdo con las reivindicaciones anexas 7 a 12.
Cualquier pasaje o referencia en la presente divulgación que se refiera a métodos de tratamiento mediante terapia o cirugía es sólo con fines ilustrativos y para una mejor comprensión de la invención reivindicada, pero estos métodos de tratamiento mediante terapia o cirugía no forman parte de la invención reivindicada.
Los ensayos de ácidos nucleicos libres de células actualmente en uso clínico pueden estar destinados al genotipado no invasivo de pacientes con enfermedad avanzada en los que los niveles de ADN tumoral circulante (ADNtc) son significativamente más altos que en los pacientes con tumores en estadio temprano. Además, las muestras de ácidos nucleicos libres de células pueden contener fragmentos de ácido nucleico libre de células con alteraciones somáticas y/o características epigenéticas únicas que derivan de tejidos distintos de los tumores. Estos fragmentos de ácidos nucleicos libres de células no tumorales pueden confundir el uso de ácidos nucleicos tumorales circulantes para la detección del cáncer.
En un aspecto, la presente divulgación proporciona una molécula de ADN, que comprende: un segmento de ácido nucleico obtenido o derivado de una muestra biológica, en donde la molécula de ácido nucleico es ADN; un par de identificadores únicos con corrección de errores ligados al segmento de ácido nucleico para producir un producto de ligadura, en donde el par de identificadores únicos con corrección de errores flanquea el segmento de ácido nucleico, en donde cada uno del par de identificadores únicos con corrección de errores es un segmento de ADN, en donde el par de identificadores únicos con corrección de errores proporciona colectivamente una identificación única del segmento de ácido nucleico frente a otros segmentos de ácido nucleico representados en un conjunto de lecturas de secuenciación; y un par de códigos de barras de muestra de índice doble con corrección de errores unidos al producto de ligadura, en donde cada uno del par de códigos de barras de muestra de índice doble con corrección de errores es un segmento de ADN, y en donde el par de códigos de barras de muestra de índice doble con corrección de errores proporciona colectivamente una identificación única de la muestra biológica frente a otras muestras biológicas representadas en un conjunto de lecturas de secuenciación.
En algunas realizaciones, el segmento de ácido nucleico es ADN complementario (ADNc). En algunas realizaciones, el segmento de ácido nucleico se obtiene o deriva de una muestra de ADN libre de células. En algunas realizaciones, el par de códigos de barras de muestra de índice doble con corrección de errores flanquea el producto de ligadura.
En otro aspecto, la presente divulgación proporciona una colección que comprende una pluralidad de las moléculas de ADN.
En otro aspecto, la presente divulgación proporciona un método para preparar una biblioteca de ADN para secuenciación, comprendiendo el método: ligar en una pluralidad de segmentos de ácido nucleico pares de adaptadores en Y parciales para flanquear cada uno de la pluralidad de segmentos de ácido nucleico por un par de adaptadores en Y parciales, produciendo de este modo una pluralidad de productos de ligadura, en donde cada uno de la pluralidad de segmentos de ácido nucleico es ADN, y en donde la pluralidad de segmentos de ácido nucleico se obtiene o deriva de una muestra biológica, en donde cada uno del par de adaptadores en Y parciales comprende un identificador único con corrección de errores y secuencias para que un cebador se hibride en una reacción en cadena de la polimerasa de injerto, y en donde el par de identificadores únicos con corrección de errores en cada uno de la pluralidad de segmentos de ácido nucleico proporciona colectivamente una identificación única de los segmentos de ácido nucleico frente a otros segmentos de ácido nucleico en la pluralidad de segmentos de ácido nucleico; e injertar en cada uno de la pluralidad de productos de ligadura un par de códigos de barras de muestra de índice doble con corrección de errores para flanquear el producto de ligadura por los códigos de barras de muestra de índice doble con corrección de errores, en donde los códigos de barras de muestra de índice doble con corrección de errores proporcionan colectivamente una identificación única de la muestra biológica.
En algunas realizaciones, el segmento de ácido nucleico es ADN complementario (ADNc). En algunas realizaciones, la muestra biológica comprende una muestra de ADN libre de células. En algunas realizaciones, los códigos de barras de muestra de índice doble con corrección de errores proporcionan colectivamente la identificación única de la muestra biológica frente a otras muestras biológicas representadas en la biblioteca de ADN.
En otro aspecto, la presente divulgación proporciona un método para detectar una neoplasia en un individuo, comprendiendo el método: obtener o haber obtenido lecturas de secuenciación de ácidos nucleicos libres de células de una pluralidad de moléculas de ácido nucleico libre de células, en donde la pluralidad de moléculas de ácido nucleico libre de células se obtiene o deriva de una primera muestra corporal del individuo; obtener o haber obtenido lecturas de secuenciación de ácidos nucleicos derivados de células de una pluralidad de moléculas de ácido nucleico derivado de células, en donde la pluralidad de moléculas de ácido nucleico derivado de células se obtiene o deriva de una segunda muestra corporal del individuo; identificar o haber identificado variantes de nucleótido único presentes tanto en las lecturas de secuenciación de ácidos nucleicos libres de células como en las lecturas de secuenciación de ácidos nucleicos derivados de células; determinar o haber determinado, basándose, al menos en parte, en la aplicación de un primer modelo computacional a las variantes de nucleótido único identificadas, si las lecturas de secuenciación de ácidos nucleicos libres de células contienen nucleótidos indicativos de moléculas de ácido nucleico libre de células derivadas de una neoplasia, en donde el primer modelo computacional se construye utilizando datos de secuenciación de ácidos nucleicos libres de células y datos de secuenciación de ácidos nucleicos derivados de células de un primer conjunto de individuos que tienen una neoplasia y un segundo conjunto de individuos de control que no tienen una neoplasia, y en donde el primer modelo computacional integra una o más de las siguientes características: fondo bayesiano de ADN derivado de células, fondo bayesiano de ADN libre de células, profundidad de estirpe germinal, puntuación de fragmento corto 1, puntuación de fragmento corto 2, posición genómica inicial y posición final de la molécula de ADN libre de células, y cualquier combinación de las mismas; y detectar la neoplasia en el individuo basándose, al menos en parte, en la determinación de que las lecturas de secuenciación de ácidos nucleicos libres de células contienen los nucleótidos indicativos de moléculas de ácido nucleico libre de células derivadas de una neoplasia.
En algunas realizaciones, el primer modelo computacional integra además una o más de las siguientes características: transición/transversión, respaldo de dúplex, superación de valores atípicos, calidad de mapeo, punto crítico de cáncer, error de UMI corregido, puntuación de calidad Phred, frecuencia alélica de la variante (% de VAF), tamaño medio de la familia de códigos de barras, posición de la variante en una molécula de ADN libre de células, puntuación de riesgo poligénico, motivo nucleasa y cualquier combinación de las mismas. En algunas realizaciones, la primera muestra corporal y la segunda muestra corporal se obtienen o derivan de una misma muestra de sangre, en donde la biopsia de sangre se separa en una fracción libre de células y una fracción celular, en donde las moléculas de ácido nucleico libre de células se obtienen o derivan de la fracción libre de células, y en donde las moléculas de ácido nucleico derivado de células se obtienen o derivan de la fracción celular. En algunas realizaciones, una o más de las variantes de nucleótido único identificadas se eliminan del análisis, y en donde las variantes de nucleótido único eliminadas incluyen variantes de genes de hematopoyesis clonal. En algunas realizaciones, una o más de las variantes de nucleótido único identificadas se eliminan del análisis, y en donde las variantes de nucleótido único eliminadas incluyen variantes presentes en las lecturas de secuenciación de ácidos nucleicos derivados de células.
En algunas realizaciones, el método comprende además: identificar o haber identificado variaciones del número de copias presentes tanto en las lecturas de secuenciación de ácidos nucleicos libres de células como en las lecturas de secuenciación de ácidos nucleicos derivados de células; y determinar o haber determinado, basándose, al menos en parte, en la aplicación de un segundo modelo computacional a las variaciones del número de copias identificadas, si las lecturas de secuenciación de ácidos nucleicos libres de células contienen nucleótidos indicativos de moléculas de ácido nucleico libre de células derivadas de una neoplasia, en donde el segundo modelo computacional se construye utilizando datos de secuenciación de ácidos nucleicos libres de células y datos de secuenciación de ácidos nucleicos derivados de células de un tercer conjunto de individuos que tienen una neoplasia y un cuarto conjunto de individuos de control que no tienen una neoplasia, y en donde el segundo modelo computacional integra una o más de las siguientes características: un número de regiones de ventana genómica distribuidas uniformemente, un número de regiones de "punto crítico" de GISTIC, el enriquecimiento de regiones de "punto crítico" de GISTIC en comparación con las ventanas uniformes, y cualquier combinación de las mismas.
En algunas realizaciones, el método comprende además: identificar o haber identificado las posiciones genómicas de un primer nucleótido y un último nucleótido de cada una de una pluralidad de moléculas de ácido nucleico libre de células secuenciado único dentro de las lecturas de secuenciación de ácidos nucleicos libres de células; determinar o haber determinado una frecuencia de las posiciones genómicas identificadas del primer nucleótido y el último nucleótido de cada una de la pluralidad de moléculas de ácido nucleico libre de células secuenciado único; y determinar o haber determinado, basándose, al menos en parte, en la aplicación de un tercer modelo computacional a las frecuencias de las posiciones genómicas identificadas del primer nucleótido y el último nucleótido de cada una de la pluralidad de moléculas de ácido nucleico libre de células secuenciado único, que las lecturas de secuenciación de ácidos nucleicos libres de células contienen nucleótidos indicativos de moléculas de ácido nucleico libre de células derivadas de una neoplasia, en donde el tercer modelo computacional se construye utilizando datos de secuenciación de ácidos nucleicos libres de células y datos de secuenciación de ácidos nucleicos derivados de células de un quinto conjunto de individuos que tienen una neoplasia y un sexto conjunto de individuos de control que no tienen una neoplasia.
En algunas realizaciones, el método comprende además: generar una puntuación de confianza a partir de cada uno del primer modelo computacional, el segundo modelo computacional y el tercer modelo computacional; e integrar las puntuaciones de confianza para generar una puntuación resumida indicativa de si el individuo tiene una neoplasia. En algunas realizaciones, el método comprende además realizar un procedimiento clínico en el individuo basado, al menos en parte, en la neoplasia detectada. En algunas realizaciones, el método comprende además tratar al individuo basándose, al menos en parte, en la neoplasia detectada.
En otro aspecto, la presente divulgación proporciona un método para detectar una neoplasia en un individuo, comprendiendo el método: obtener o haber obtenido lecturas de secuenciación de ácidos nucleicos libres de células de una pluralidad de moléculas de ácido nucleico libre de células, en donde la pluralidad de moléculas de ácido nucleico libre de células se obtiene o deriva de una primera muestra corporal del individuo; obtener o haber obtenido lecturas de secuenciación de ácidos nucleicos derivados de células de una pluralidad de moléculas de ácido nucleico derivado de células, en donde la pluralidad de moléculas de ácido nucleico derivado de células se obtiene o deriva de una segunda muestra corporal del individuo; identificar o haber identificado variaciones del número de copias presentes tanto en las lecturas de secuenciación de ácidos nucleicos libres de células como en las lecturas de secuenciación de ácidos nucleicos derivados de células; y determinar o haber determinado, basándose, al menos en parte, en la aplicación de un modelo computacional a las variaciones del número de copias identificadas, si las lecturas de secuenciación de ácidos nucleicos libres de células contienen nucleótidos indicativos de moléculas de ácido nucleico libre de células derivadas de una neoplasia, en donde el modelo computacional se construye utilizando datos de secuenciación de ácidos nucleicos libres de células y datos de secuenciación de ácidos nucleicos derivados de células de un primer conjunto de individuos que tienen una neoplasia y un segundo conjunto de individuos de control que no tienen una neoplasia, y en donde el modelo computacional integra una o más de las siguientes características: un número de regiones de ventana genómica distribuidas uniformemente, un número de regiones de "punto crítico" de GISTIC, el enriquecimiento de regiones de "punto crítico" de GISTIC en comparación con las ventanas uniformes, y cualquier combinación de las mismas; y detectar la neoplasia en el individuo basándose, al menos en parte, en la determinación de que los datos de secuenciación de ácidos nucleicos libres de células contienen los nucleótidos indicativos de moléculas de ácido nucleico libre de células derivadas de una neoplasia.
En otro aspecto, la presente divulgación proporciona un método para detectar una neoplasia en un individuo, comprendiendo el método: obtener o haber obtenido lecturas de secuenciación de ácidos nucleicos libres de células de una pluralidad de moléculas de ácido nucleico libre de células, en donde la pluralidad de moléculas de ácido nucleico libre de células se obtiene o deriva de una muestra corporal del individuo; identificar o haber identificado las posiciones genómicas de un primer nucleótido y un último nucleótido de cada una de una pluralidad de moléculas de ácido nucleico libre de células secuenciado único dentro de las lecturas de secuenciación; determinar o haber determinado una frecuencia de las posiciones genómicas identificadas del primer nucleótido y el último nucleótido de cada una de la pluralidad de moléculas de ácido nucleico libre de células secuenciado único; y determinar o haber determinado, basándose, al menos en parte, en la aplicación de un modelo computacional a las frecuencias de las posiciones genómicas identificadas del primer nucleótido y el último nucleótido de cada una de la pluralidad de moléculas de ácido nucleico libre de células secuenciado único, si las lecturas de secuenciación de ácidos nucleicos libres de células contienen nucleótidos indicativos de moléculas de ácido nucleico libre de células derivadas de una neoplasia, en donde el modelo computacional se construye utilizando datos de secuenciación de ácidos nucleicos libres de células y datos de secuenciación de ácidos nucleicos derivados de células de un primer conjunto de individuos que tienen una neoplasia y un segundo conjunto de individuos de control que no tienen una neoplasia; y detectar la neoplasia en el individuo basándose, al menos en parte, en la determinación de que los datos de secuenciación de ácidos nucleicos libres de células contienen los nucleótidos indicativos de moléculas de ácido nucleico libre de células derivadas de una neoplasia.
En algunas realizaciones, el método comprende además determinar al menos una de entre un primer conjunto de medidas cuantitativas de moléculas de ADNlc que comienzan en cada una de una pluralidad de posiciones genómicas y un segundo conjunto de medidas cuantitativas de moléculas de ADNlc que terminan en cada una de una pluralidad de posiciones genómicas; y analizar la al menos una de entre el primer conjunto de medidas cuantitativas o el segundo conjunto de medidas cuantitativas para detectar la neoplasia. En algunas realizaciones, el método comprende además analizar la al menos una de entre el primer conjunto de medidas cuantitativas y el segundo conjunto de medidas cuantitativas usando un clasificador de aprendizaje automático entrenado para detectar la neoplasia. En algunas realizaciones, el método comprende además analizar la al menos una de entre el primer conjunto de medidas cuantitativas y el segundo conjunto de medidas cuantitativas para determinar una frecuencia alélica de la variante tumoral de la neoplasia. En algunas realizaciones, el método comprende además analizar la al menos una de entre el primer conjunto de medidas cuantitativas y el segundo conjunto de medidas cuantitativas para determinar un volumen tumoral metabólico de la neoplasia. En algunas realizaciones, el método comprende además detectar la neoplasia con un AUC de al menos aproximadamente 0,80.
En otro aspecto, la presente divulgación proporciona un método para detectar una neoplasia en un individuo, comprendiendo el método: obtener o haber obtenido lecturas de secuenciación de ácidos nucleicos libres de células de una pluralidad de moléculas de ácido nucleico libre de células, en donde la pluralidad de moléculas de ácido nucleico libre de células se obtiene o deriva de una muestra corporal del individuo; identificar o haber identificado una longitud de fragmento de cada una de una pluralidad de moléculas de ácido nucleico libre de células secuenciado único dentro de las lecturas de secuenciación; seleccionar un subconjunto de las lecturas de secuenciación correspondientes a moléculas de ácido nucleico libre de células de la pluralidad de moléculas de ácido nucleico libre de células secuenciado único que tengan una longitud de fragmento indicativa de un fragmento submononucleosómico o un fragmento subdisómico; analizar el subconjunto de las lecturas de secuenciación para determinar una frecuencia de las longitudes de fragmento identificadas indicativas de los fragmentos submononucleosómicos o los fragmentos subdisómicos; y determinar o haber determinado, basándose, al menos en parte, en la aplicación de un modelo computacional a las longitudes de fragmento identificadas indicativas de los fragmentos submononucleosómicos o los fragmentos subdisómicos, si las lecturas de secuenciación de ácidos nucleicos libres de células contienen nucleótidos indicativos de moléculas de ácido nucleico libre de células derivadas de una neoplasia, en donde el modelo computacional se construye utilizando datos de secuenciación de ácidos nucleicos libres de células y datos de secuenciación de ácidos nucleicos derivados de células de un primer conjunto de individuos que tienen una neoplasia y un segundo conjunto de individuos de control que no tienen una neoplasia; y detectar la neoplasia en el individuo basándose, al menos en parte, en la determinación de que los datos de secuenciación de ácidos nucleicos libres de células contienen los nucleótidos indicativos de moléculas de ácido nucleico libre de células derivadas de una neoplasia.
En algunas realizaciones, una longitud de fragmento inferior a 160 pares de bases (pb) es indicativa de los fragmentos submononucleosómicos. En algunas realizaciones, una longitud de fragmento de entre 230 pb y 310 pb es indicativa de los fragmentos subdisómicos. En algunas realizaciones, la pluralidad de moléculas de ácido nucleico libre de células se obtienen, al menos en parte, realizando una selección por tamaño de las moléculas de ácido nucleico de la muestra corporal del individuo para enriquecer en al menos uno de los fragmentos submononucleosómicos y los fragmentos subdisómicos.
En otro aspecto, la presente divulgación proporciona un método para detectar una neoplasia en un individuo, comprendiendo el método: obtener o haber obtenido lecturas de secuenciación de ácidos nucleicos libres de células de una pluralidad de moléculas de ácido nucleico libre de células, en donde la pluralidad de moléculas de ácido nucleico libre de células se obtiene o deriva de una muestra corporal del individuo; analizar las lecturas de secuenciación para determinar una frecuencia alélica de la variante (VAF, por sus siglas en inglés) de una pluralidad de variantes de nucleótido único (SNV, por sus siglas en inglés); y determinar o haber determinado, basándose, al menos en parte, en la aplicación de un modelo computacional a las VAF determinadas de la pluralidad de SNV, si las lecturas de secuenciación de ácidos nucleicos libres de células contienen nucleótidos indicativos de moléculas de ácido nucleico libre de células derivadas de una neoplasia, en donde el modelo computacional se construye utilizando datos de secuenciación de ácidos nucleicos libres de células y datos de secuenciación de ácidos nucleicos derivados de células de un primer conjunto de individuos que tienen una neoplasia y un segundo conjunto de individuos de control que no tienen una neoplasia; y detectar la neoplasia en el individuo basándose, al menos en parte, en la determinación de que los datos de secuenciación de ácidos nucleicos libres de células contienen los nucleótidos indicativos de moléculas de ácido nucleico libre de células derivadas de una neoplasia.
En algunas realizaciones, el método comprende además determinar un valor medio de las VAF determinadas a través de la pluralidad de SNV; y determinar o haber determinado, basándose, al menos en parte, en la aplicación del modelo computacional al valor medio determinado, si las lecturas de secuenciación de ácidos nucleicos libres de células contienen nucleótidos indicativos de moléculas de ácido nucleico libre de células derivadas de una neoplasia. En algunas realizaciones, el método comprende además comparar el valor medio determinado de las VAF determinadas a través de la pluralidad de SNV con un valor de referencia, para determinar si las lecturas de secuenciación de ácidos nucleicos libres de células contienen nucleótidos indicativos de moléculas de ácido nucleico libre de células derivadas de una neoplasia. En algunas realizaciones, el método comprende además determinar un volumen tumoral metabólico de la neoplasia detectada. En algunas realizaciones, el método comprende además determinar un estadio de la neoplasia detectada. En algunas realizaciones, el método comprende además determinar una probabilidad de recidiva de la neoplasia detectada. En algunas realizaciones, la pluralidad de moléculas de ácido nucleico libre de células se enriquece a partir de la muestra corporal del individuo usando un conjunto de moléculas de cebo de captura, en donde el conjunto de moléculas de cebo de captura está configurado para hibridarse selectivamente con secuencias que son al menos parcialmente complementarias a al menos una secuencia del conjunto de moléculas de cebo de captura, en donde el conjunto de moléculas de cebo de captura está configurado para hibridarse selectivamente con secuencias que son al menos parcialmente complementarias a al menos un locus genómico seleccionado del grupo de locus genómicos de la Tabla 1. En algunas realizaciones, la neoplasia comprende cáncer de pulmón.
En otro aspecto, la presente divulgación proporciona un conjunto de cebos para la captura de hibridación, comprendiendo el conjunto de cebos al menos 1,2, 3, 4, 5, 6, 7, 8, 9, 10, 20, 30, 40, 50, 60, 70, 80, 90, 100, 200, 300, 400, 500, 600, 700, 800, 900, 1000, 1200, 1400, 1600, 1800, 2000, 2200, 2400, 2600, 2800, 3000, 3200, 3400, 3600, 3800, 4000, 4200, 4400, 4600, 4800 o 5000 sondas que contienen polinucleótidos diferentes, en donde las sondas que contienen polinucleótidos, colectivamente, están configuradas para hibridarse con ADNlc derivado de al menos el 5 % de las regiones genómicas expuestas en la Tabla 1.
En algunas realizaciones, cada una de las sondas que contienen polinucleótidos tiene una secuencia de ácido nucleico que tiene al menos 1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 20, 30, 40, 50, 60, 70, 80, 90, 100, 120, 140, 160, 180, 200, 220, 240, 260, 280 o 300 nucleótidos de longitud. En algunas realizaciones, cada una de las sondas que contienen polinucleótidos tiene una secuencia de ácido nucleico de no más de 300, 280, 260, 240, 220, 200, 180, 160, 140, 120, 100, 90, 80, 70, 60, 50, 40, 30, 20, 10, 9, 8, 7, 6, 5, 4, 3 o 2 nucleótidos de longitud. En algunas realizaciones, cada una de las sondas que contienen polinucleótidos está conjugada con un resto de afinidad. En algunas realizaciones, el resto de afinidad comprende biotina. En algunas realizaciones, las sondas de polinucleótidos, colectivamente, están configuradas para hibridarse con ADNlc derivado de al menos el 10 %, al menos el 20 %, al menos el 30 %, al menos el 40 %, al menos el 50 %, al menos el 60 %, al menos el 70 %, al menos el 80 %, al menos el 90 %, al menos el 95 %, al menos el 98 %, al menos el 99 % o el 100 % de las regiones genómicas expuestas en la Tabla 1. En algunas realizaciones, la totalidad de las sondas polinucleotídicas del conjunto de cebos están configuradas para hibridarse con moléculas de ADNlc derivadas de al menos el 10 %, al menos el 20 %, al menos el 30 %, al menos el 40 %, al menos el 50 %, al menos el 60 %, al menos el 70 %, al menos el 80 %, al menos el 90 %, al menos el 95 %, al menos el 98 %, al menos el 99 % o el 100 % de las regiones genómicas expuestas en la Tabla 1.
En otro aspecto, la presente divulgación proporciona una mezcla que comprende: ADN de una muestra biológica; y un conjunto de cebos de la presente divulgación.
En otro aspecto, la presente divulgación proporciona un método para realizar hibridación de captura, comprendiendo el método: obtener una pluralidad de moléculas de ADN derivadas de una fuente de ADN libre de células; y mezclar una fracción de la pluralidad de moléculas de ADN con un conjunto de moléculas de cebo de captura, en donde el conjunto de moléculas de cebo de captura está configurado para hibridarse selectivamente con moléculas de ADN que son al menos parcialmente complementarias a al menos una secuencia del conjunto de moléculas de cebo de captura, en donde el conjunto de moléculas de cebo de captura está configurado para hibridarse selectivamente con moléculas de ADN que comprenden secuencias que comprenden al menos una porción de un locus genómico seleccionado del grupo de locus genómicos de la Tabla 1.
En algunas realizaciones, la porción del locus genómico comprende al menos 1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 20, 30, 40, 50, 60, 70, 80, 90, 100, 120, 140, 160, 180, 200, 220, 240, 260, 280 o 300 nucleótidos consecutivos del locus genómico. En algunas realizaciones, la fracción es de al menos aproximadamente el 5 %, 10 %, 15 %, 20 %, 25 %, 30 %, 35 %, 40 %, 45 %, 50 %, 55 %, 60 %, 65 %, 70 %, 75 %, 80 %, 85 %, 90 %, 95 % o 100 % de la pluralidad de moléculas de ADN. En algunas realizaciones, el método comprende además optimizar una relación molar de la fracción de la pluralidad de moléculas de ADN y el conjunto de moléculas de cebo de captura para obtener una recuperación óptima de un número total de moléculas únicas o para obtener una recuperación óptima de un número total de moléculas de ADN libre de células dúplex en las que se secuencian ambas cadenas del dúplex de ADN libre de células obtenido, en donde la relación molar es al menos aproximadamente el 5 %, 10 %, 15 %, 20 %, 25 %, 30 %, 35 %, 40 %, 45 %, 50 %, 55 %, 60 %, 65 %, 70 %, 75 %, 80 %, 85 %, 90 %, 95 % o 100 %. En algunas realizaciones, el método comprende además usar una simulación informática de la hibridación de captura para determinar la fracción de la pluralidad de moléculas de ADN que se mezcla con el conjunto de moléculas de cebo de captura, en donde la fracción no es superior a aproximadamente el 100 %, 95 %, 90 %, 85 %, 80 %, 75 %, 70 %, 65 %, 60 %, 55 %, 50 %, 45 %, 40 %, 35 %, 30 %, 25 %, 20 %, 15 %, 10 % o 5 %. En algunas realizaciones, el conjunto de moléculas de cebo de captura comprende un conjunto de cebo de la presente divulgación.
En otro aspecto, la presente divulgación proporciona una molécula de ADN, que comprende: una molécula de ácido nucleico obtenida de una muestra biológica, en donde la molécula de ácido nucleico es ADN o ADNc; un par de identificadores únicos con corrección de errores que flanquean la molécula de ácido nucleico, en donde los identificadores únicos con corrección de errores son cada uno moléculas de ADN y la combinación de los identificadores únicos con corrección de errores proporciona una identificación de la molécula de ácido nucleico en un resultado de secuenciación; y un par de códigos de barras de muestra de índice doble con corrección de errores, en donde los identificadores únicos con corrección de errores son cada uno moléculas de ADN y la combinación de los identificadores únicos con corrección de errores proporciona una identificación de la muestra biológica en un resultado de secuenciación.
En otro aspecto, la presente divulgación proporciona un método para preparar una biblioteca de ADN para secuenciación, que comprende: ligar en una colección de moléculas de ácido nucleico pares de adaptadores en Y parciales, de manera que cada molécula de ácido nucleico esté flanqueada por un par de adaptadores en Y parciales, en donde cada molécula de ácido nucleico es ADN o ADNc y la colección de moléculas de ácido nucleico se obtiene de una muestra biológica, en donde cada adaptador en Y parcial incluye un identificador único con corrección de errores y secuencias para que un cebador se hibride en una reacción en cadena de la polimerasa de injerto, y en donde cada combinación flanqueante de los dos identificadores únicos con corrección de errores en cada molécula de ácido nucleico identifica la ligadura del par de adaptadores en Y parciales con esa molécula de ácido nucleico; e injertar en cada producto de ligadura un par de códigos de barras de muestra de índice doble con corrección de errores y la secuencia de un cebador universal de manera que el producto de ligadura esté flanqueado por los códigos de barras de muestra de índice doble con corrección de errores y la secuencia del cebador universal, en donde la combinación de códigos de barras de muestra de índice doble con corrección de errores identifica la colección de moléculas de ácido nucleico.
En otro aspecto, la presente divulgación proporciona un método para mitigar las transversiones de nucleótidos que surgen durante la preparación de bibliotecas de secuenciación, que comprende: realizar la preparación de bibliotecas de secuencias con un eliminador de especies reactivas de oxígeno o una enzima en la mezcla de reacción.
En algunas realizaciones, la reacción de captura de secuencia se realiza con el eliminador de especies reactivas de oxígeno hipotaurina en la mezcla de reacción. En algunas realizaciones, el eliminador de especies reactivas de oxígeno es el glutatión, hipotaurina o sulfito de sodio; y en donde la enzima es uracil-ADN glicosilasa (UDG), Formamidopirimidina [fapy]-ADN glicosilasa (FPG) o enzima catalasa.
En otro aspecto, la presente divulgación proporciona un método para realizar un procedimiento clínico en un individuo, comprendiendo el método: obtener o haber obtenido un resultado de secuenciación de una colección de moléculas de ácido nucleico libre de células, en donde la colección de moléculas de ácido nucleico libre de células se obtiene de una primera biopsia de un individuo; obtener o haber obtenido un resultado de secuenciación de una colección de moléculas de ácido nucleico derivado de células, en donde la colección de moléculas de ácido nucleico derivado de células se obtiene de una segunda biopsia del individuo; identificar o haber identificado variantes de nucleótido único tanto en el resultado de secuenciación de ácidos nucleicos libres de células como en el resultado de secuenciación de ácidos nucleicos derivados de células; determinar o haber determinado, utilizando un primer modelo computacional y las variantes de nucleótido único identificadas, que el resultado de secuenciación de ácidos nucleicos libres de células contiene nucleótidos derivados de una neoplasia, en donde el primer modelo computacional se construye utilizando datos de secuenciación de ácidos nucleicos libres de células y datos de secuenciación de ácidos nucleicos derivados de células de una cohorte de individuos que tienen una neoplasia y una cohorte de individuos de control que no tienen una neoplasia, y en donde el primer modelo computacional integra una o más de las siguientes características: fondo bayesiano de ADN derivado de células, fondo bayesiano de ADNlc, profundidad de estirpe germinal, puntuación de fragmento corto 1, puntuación de fragmento corto 2 o posición genómica inicial y final de la molécula de ADNlc; y realizar un procedimiento clínico en el individuo basándose en la determinación de que el resultado de secuenciación de ácidos nucleicos libres de células contiene secuencias de ácidos nucleicos derivadas de una neoplasia.
En algunas realizaciones, el primer modelo computacional integra además una o más de las siguientes características: transición/transversión, respaldo de dúplex, superación de valores atípicos, calidad de mapeo, punto crítico de cáncer, error de UMI corregido, puntuación de calidad Phred, frecuencia alélica de la variante (% de VAF), tamaño medio de la familia de códigos de barras, posición de la variante en una molécula de ADNlc, puntuación de riesgo poligénico o motivo nucleasa. En algunas realizaciones, la primera biopsia y la segunda biopsia son la misma biopsia de sangre y la biopsia de sangre se separa en una fracción libre de células y una fracción celular, y en donde la fracción libre de células se usa para obtener moléculas de ácido nucleico libre de células y la fracción celular se usa para obtener moléculas de ácido nucleico derivado de células. En algunas realizaciones, un número de variantes identificadas se eliminan del análisis, y en donde las variantes eliminadas incluyen variantes de genes de hematopoyesis clonal o mutaciones somáticas en otros tipos de tejidos no malignos. En algunas realizaciones, un número de variantes identificadas se eliminan del análisis, y en donde las variantes eliminadas incluyen variantes presentes en el resultado de secuenciación de ácidos nucleicos derivados de células.
En algunas realizaciones, el método comprende además: identificar o haber identificado variaciones en el número de copias tanto en el resultado de secuenciación de ácidos nucleicos libres de células como en el resultado de secuenciación de ácidos nucleicos derivados de células; y determinar o haber determinado, utilizando un segundo modelo computacional y las variaciones del número de copias identificadas, que el resultado de secuenciación de ácidos nucleicos libres de células contiene nucleótidos derivados de una neoplasia, en donde el segundo modelo computacional se construye utilizando datos de secuenciación de ácidos nucleicos libres de células y datos de secuenciación de ácidos nucleicos derivados de células de una cohorte de individuos que tienen una neoplasia y una cohorte de individuos de control que no tienen una neoplasia, y en donde el segundo modelo computacional integra una o más de las siguientes características: el número de regiones de ventana genómica distribuidas uniformemente, el número de regiones de "punto crítico" de GISTIC y el enriquecimiento de las regiones de "punto crítico" de GISTIC en comparación con las ventanas uniformes; en donde la realización del procedimiento clínico en el individuo se basa en la determinación de que el resultado de secuenciación de ácidos nucleicos libres de células contiene secuencias de ácidos nucleicos derivadas de una neoplasia.
En algunas realizaciones, el método comprende además: identificar o haber identificado la posición genómica del primer y último nucleótido de cada molécula de ácido nucleico libre de células secuenciado único dentro del resultado de secuenciación de ácidos nucleicos libres de células; determinar o haber determinado, la frecuencia de posiciones genómicas identificadas del primer y último nucleótido de cada ácido nucleico libre de células secuenciado único; y determinar o haber determinado, utilizando un tercer modelo computacional y la frecuencia de las posiciones genómicas identificadas del primer y último nucleótido de cada molécula de ácido nucleico libre de células secuenciado único, que el resultado de secuenciación de ácidos nucleicos libres de células contiene nucleótidos derivados de una neoplasia, en donde el tercer modelo computacional se construye utilizando datos de secuenciación de ácidos nucleicos libres de células y datos de secuenciación de ácidos nucleicos derivados de células de una cohorte de individuos que tienen una neoplasia y una cohorte de individuos de control que no tienen una neoplasia; en donde la realización del procedimiento clínico en el individuo se basa en la determinación de que el resultado de secuenciación de ácidos nucleicos libres de células contiene secuencias de ácidos nucleicos derivadas de una neoplasia. En algunas realizaciones, el método comprende además: generar una puntuación de confianza a partir de cada uno del primer modelo computacional, el segundo modelo computacional y el tercer modelo computacional; e integrar las puntuaciones de confianza para generar una puntuación resumida que indica que el individuo tiene una neoplasia; en donde la realización del procedimiento clínico en el individuo se basa en la puntuación resumida que indica que el individuo tiene una neoplasia.
En otro aspecto, la presente divulgación proporciona un método para tratar a un individuo de una neoplasia, comprendiendo el método: obtener o haber obtenido un resultado de secuenciación de una colección de moléculas de ácido nucleico libre de células, en donde la colección de moléculas de ácido nucleico libre de células se obtiene de una primera biopsia de un individuo; obtener o haber obtenido un resultado de secuenciación de una colección de moléculas de ácido nucleico derivado de células, en donde la colección de moléculas de ácido nucleico derivado de células se obtiene de una segunda biopsia del individuo; identificar o haber identificado variantes de nucleótido único tanto en el resultado de secuenciación de ácidos nucleicos libres de células como en el resultado de secuenciación de ácidos nucleicos derivados de células; determinar o haber determinado, utilizando un primer modelo computacional y las variantes de nucleótido único identificadas, que el resultado de secuenciación de ácidos nucleicos libres de células contiene nucleótidos derivados de una neoplasia, en donde el primer modelo computacional se construye utilizando datos de secuenciación de ácidos nucleicos libres de células y datos de secuenciación de ácidos nucleicos derivados de células de una cohorte de individuos que tienen una neoplasia y una cohorte de individuos de control que no tienen una neoplasia, y en donde el primer modelo computacional integra una o más de las siguientes características: fondo bayesiano de ADN derivado de células, fondo bayesiano de ADNlc, profundidad de estirpe germinal, puntuación de fragmento corto 1, puntuación de fragmento corto 2 o posición genómica inicial y final de la molécula de ADNlc; y tratar al individuo basándose en la determinación de que el resultado de secuenciación de ácidos nucleicos libres de células contiene secuencias de ácidos nucleicos derivadas de una neoplasia.
En algunas realizaciones, el primer modelo computacional integra además una o más de las siguientes características: transición/transversión, respaldo de dúplex, superación de valores atípicos, calidad de mapeo, punto crítico de cáncer, error de UMI corregido, puntuación de calidad Phred, frecuencia alélica de la variante (% de VAF), tamaño medio de la familia de códigos de barras, posición de la variante en una molécula de ADNlc, puntuación de riesgo poligénico o motivo nucleasa. En algunas realizaciones, la primera biopsia y la segunda biopsia son la misma biopsia de sangre y la biopsia de sangre se separa en una fracción libre de células y una fracción celular, y en donde la fracción libre de células se usa para obtener moléculas de ácido nucleico libre de células y la fracción celular se usa para obtener moléculas de ácido nucleico derivado de células. En algunas realizaciones, un número de variantes identificadas se eliminan del análisis, y en donde las variantes eliminadas incluyen variantes de genes de hematopoyesis clonal. En algunas realizaciones, un número de variantes identificadas se eliminan del análisis, y en donde las variantes eliminadas incluyen variantes presentes en el resultado de secuenciación de ácidos nucleicos derivados de células.
En algunas realizaciones, el método comprende además: identificar o haber identificado variaciones en el número de copias tanto en el resultado de secuenciación de ácidos nucleicos libres de células como en el resultado de secuenciación de ácidos nucleicos derivados de células; determinar o haber determinado, utilizando un segundo modelo computacional y las variaciones del número de copias identificadas, que el resultado de secuenciación de ácidos nucleicos libres de células contiene nucleótidos derivados de una neoplasia, en donde el segundo modelo computacional se construye utilizando datos de secuenciación de ácidos nucleicos libres de células y datos de secuenciación de ácidos nucleicos derivados de células de una cohorte de individuos que tienen una neoplasia y una cohorte de individuos de control que no tienen una neoplasia, y en donde el segundo modelo computacional integra una o más de las siguientes características: el número de regiones de ventana genómica distribuidas uniformemente, el número de regiones de "punto crítico" de GISTIC y el enriquecimiento de las regiones de "punto crítico" de GISTIC en comparación con las ventanas uniformes; en donde el tratamiento del individuo se basa en la determinación de que el resultado de secuenciación de ácidos nucleicos libres de células contiene secuencias de ácidos nucleicos derivadas de una neoplasia.
En algunas realizaciones, el método comprende además: identificar o haber identificado la posición genómica del primer y último nucleótido de cada molécula de ácido nucleico libre de células secuenciado único dentro del resultado de secuenciación de ácidos nucleicos libres de células; determinar o haber determinado, la frecuencia de posiciones genómicas identificadas del primer y último nucleótido de cada ácido nucleico libre de células secuenciado único; y determinar o haber determinado, utilizando un tercer modelo computacional y la frecuencia de las posiciones genómicas identificadas del primer y último nucleótido de cada molécula de ácido nucleico libre de células secuenciado único, que el resultado de secuenciación de ácidos nucleicos libres de células contiene nucleótidos derivados de una neoplasia, en donde el tercer modelo computacional se construye utilizando datos de secuenciación de ácidos nucleicos libres de células y datos de secuenciación de ácidos nucleicos derivados de células de una cohorte de individuos que tienen una neoplasia y una cohorte de individuos de control que no tienen una neoplasia; en donde el tratamiento del individuo se basa en la determinación de que el resultado de secuenciación de ácidos nucleicos libres de células contiene secuencias de ácidos nucleicos derivadas de una neoplasia.
En algunas realizaciones, el método comprende además: generar una puntuación de confianza a partir de cada uno del primer modelo computacional, el segundo modelo computacional y el tercer modelo computacional; e integrar las puntuaciones de confianza para generar una puntuación resumida que indica que el individuo tiene una neoplasia; en donde el tratamiento del individuo se basa en la puntuación resumida que indica que el individuo tiene una neoplasia.
En otro aspecto, la presente divulgación proporciona un método para realizar hibridación de captura en una biblioteca de secuenciación, comprendiendo el método: obtener una biblioteca de secuenciación que comprende una pluralidad de moléculas de secuenciación únicas derivadas de una fuente de ADN libre de células; mezclar una fracción de la biblioteca de secuenciación con moléculas de cebos de captura para hibridar y extraer secuencias particulares reconocidas por los cebos de captura, en donde la fracción de la biblioteca de secuenciación es de al menos el 10 %, 25 % o 50 %.
En algunas realizaciones, la relación molar de la fracción de la biblioteca de secuenciación y los cebos de captura se optimiza para obtener una recuperación óptima del total de moléculas únicas o para obtener una recuperación óptima del total de moléculas de ADN libre de células dúplex en las que se secuencian ambas cadenas del dúplex de ADN libre de células obtenido. En algunas realizaciones, se utiliza una simulación informática de la hibridación de captura para determinar la fracción de la biblioteca de secuenciación que se mezcla con los cebos de captura.
En otro aspecto, la presente divulgación proporciona un método para tratar a un individuo de una neoplasia, comprendiendo el método: obtener o haber obtenido un resultado de secuenciación de una colección de moléculas de ácido nucleico libre de células, en donde la colección de moléculas de ácido nucleico libre de células se obtiene de una primera biopsia de un individuo; obtener o haber obtenido un resultado de secuenciación de una colección de moléculas de ácido nucleico derivado de células, en donde la colección de moléculas de ácido nucleico derivado de células se obtiene de una segunda biopsia del individuo; identificar o haber identificado variaciones en el número de copias tanto en el resultado de secuenciación de ácidos nucleicos libres de células como en el resultado de secuenciación de ácidos nucleicos derivados de células; determinar o haber determinado, utilizando un modelo computacional y las variaciones del número de copias identificadas, que el resultado de secuenciación de ácidos nucleicos libres de células contiene nucleótidos derivados de una neoplasia, en donde el segundo modelo computacional se construye utilizando datos de secuenciación de ácidos nucleicos libres de células y datos de secuenciación de ácidos nucleicos derivados de células de una cohorte de individuos que tienen una neoplasia y una cohorte de individuos de control que no tienen una neoplasia, y en donde el segundo modelo computacional integra una o más de las siguientes características: el número de regiones de ventana genómica distribuidas uniformemente, el número de regiones de "punto crítico" de GISTIC y el enriquecimiento de las regiones de "punto crítico" de GISTIC en comparación con las ventanas uniformes; y tratar al individuo basándose en la determinación de que el resultado de secuenciación de ácidos nucleicos libres de células contiene secuencias de ácidos nucleicos derivadas de una neoplasia.
En otro aspecto, la presente divulgación proporciona un método para tratar a un individuo de una neoplasia, comprendiendo el método: obtener o haber obtenido un resultado de secuenciación de una colección de moléculas de ácido nucleico libre de células, en donde la colección de moléculas de ácido nucleico libre de células se obtiene de una biopsia de un individuo; identificar o haber identificado la posición genómica del primer y último nucleótido de cada molécula de ácido nucleico libre de células secuenciado único dentro del resultado de secuenciación de ácidos nucleicos libres de células; determinar o haber determinado, la frecuencia de posiciones genómicas identificadas del primer y último nucleótido de cada ácido nucleico libre de células secuenciado único; y determinar o haber determinado, utilizando un modelo computacional y la frecuencia de las posiciones genómicas identificadas del primer y último nucleótido de cada molécula de ácido nucleico libre de células secuenciado único, que el resultado de secuenciación de ácidos nucleicos libres de células contiene nucleótidos derivados de una neoplasia, en donde el tercer modelo computacional se construye utilizando datos de secuenciación de ácidos nucleicos libres de células y datos de secuenciación de ácidos nucleicos derivados de células de una cohorte de individuos que tienen una neoplasia y una cohorte de individuos de control que no tienen una neoplasia; y tratar al individuo basándose en la determinación de que el resultado de secuenciación de ácidos nucleicos libres de células contiene secuencias de ácidos nucleicos derivadas de una neoplasia.
Breve descripción de los dibujos
La descripción y las reivindicaciones se entenderán de forma más completa con referencia a las siguientes figuras y gráficos de datos, que se presentan como realizaciones ilustrativas de la invención y no deben considerarse como una cita completa del alcance de la invención.
LaFig. 1proporciona un diagrama de flujo de un proceso para realizar una intervención clínica en un individuo basándose en la detección de secuencias de ácidos nucleicos tumorales circulantes en un resultado de secuenciación.
LaFig. 2Amuestra que un exceso de códigos de barras moleculares (es decir, identificadores únicos o UID) que difieren en 1 pb en moléculas de ADNlc con las mismas posiciones inicial y final indica que los errores de secuenciación en los UID pueden crear familias de UID erróneas. Se representan las distribuciones esperadas y observadas de las distancias de edición de Hamming del código de barras (distancia de edición de UID) al comparar los UID de diferentes grupos de moléculas de ADNlc desduplicadas por código de barras (es decir, únicas) usando un conjunto de adaptadores en tándem. Los adaptadores en tándem utilizan UID aleatorios de 4 monómeros, dando como resultado 256 UID distintos cuyos errores no pueden corregirse. La distribución teórica de las distancias de edición de UID en todos los 256 UID (es decir, la fracción de UID que difieren entre sí en 1, 2, 3 y 4 pb) se muestra en las barras 1.a, 5.a, 9.a y 13.a (por ejemplo, la 1.a barra de cada grupo de cuatro barras). Las otras barras representan la distribución de las distancias de edición UID observadas en muestras de ADNlc de controles sanos secuenciadas con adaptadores en tándem (n = 24 individuos). Los UID muestreados aleatoriamente se muestran en las barras 2.a, 6.a, 10.a y 14.a (por ejemplo, la 2.a barra dentro de cada grupo de cuatro barras). Las UID de moléculas de ADNlc con diferentes posiciones genómicas iniciales y finales se muestran en las barras 3.a, 7.a, 11.a y 15.a (por ejemplo, la 3.a barra dentro de cada grupo de cuatro barras). Las moléculas de ADNlc que comparten las mismas posiciones iniciales y finales se muestran en las barras 4.a, 8.a, 12.a y 16.a (por ejemplo, la 4.a barra dentro de cada grupo de cuatro barras). Las UID que difieren sólo en una base están significativamente sobrerrepresentadas cuando se comparan moléculas de ADNlc con la misma posición inicial y final (la 4.a barra dentro de cada grupo de cuatro barras) con cada una de las otras distribuciones de UID, lo que sugiere que los errores de 1 pb están creando erróneamente nuevas familias de UID. Las comparaciones de grupos se realizaron con una pruebatbilateral pareada, excepto cuando se compararon con la distribución teórica, para lo que se usó una pruebatbilateral no pareada (P<1 * 10-8). Las barras indican la media y las barras de error indican el error típico de la media.
LaFig. 2Bproporciona un diagrama esquemático de un proceso para construir una biblioteca de secuenciación. LaFig. 3proporciona un diagrama esquemático de un adaptador de secuenciación.
LaFig. 4Aproporciona un gráfico que identifica las tasas de error (y los correspondientes tipos de errores que surgen) en muestras que se tratan con diversos productos químicos o enzimáticos.
LaFig. 4Bproporciona un diagrama esquemático que muestra cómo una especie reactiva de oxígeno puede dar como resultado una transversión, y cómo un eliminador de especies reactivas de oxígeno puede evitar dicha transversión.
LaFig. 5proporciona un diagrama de flujo esquemático para detectar secuencias de ácidos nucleicos tumorales circulantes en un resultado de secuenciación.
LaFig. 6proporciona un gráfico que representa las características y su importancia que se utilizan en un modelo para detectar secuencias de ácidos nucleicos tumorales circulantes en un resultado de secuenciación.
LaFig. 7muestra que para mejorar la sensibilidad para la detección de niveles alélicos, se desarrollaron y sometieron a ensayo algunas metodologías para maximizar el rendimiento de las moléculas de ADNlc secuenciado satisfactoriamente único minimizando simultáneamente su perfil de error de secuenciación asociado.
LaFig. 8muestra una simulación de biología molecular de un método de CAPP-Seq, que incluye las etapas de flujo de trabajo de entrada de ADNlc, precaptura, captura y postcaptura para producir datos de secuenciación y un porcentaje (%) de moléculas únicas en cada una de las etapas de flujo de trabajo.
LaFig. 9muestra que la fracción de moléculas originales de ADNlc único (línea continua superior con círculos) y dúplex (línea continua inferior con círculos) (profundidad única; eje derecho) y las moléculas totales, incluyendo los duplicados de PCR (profundidad no desduplicada; eje izquierdo) en cada etapa de flujo de trabajo de biología molecular de CAPP-Seq se rastrearon usando un modelo informático basado en un muestreo binomial aleatorio. En este modelo sólo se contemplan las moléculas en la diana, con las dos cadenas de ADN individuales de los dúplex de ADN originales rastreados. Se muestran dos simulaciones, con el 8,3 % (arriba) y el 100 % (abajo) de la biblioteca de secuenciación amplificada introducida en la reacción de hibridación para el enriquecimiento diana. LaFig. 10muestra una validación empírica de modelos de simulación; incluyendo una comparación de la mediana de las profundidades única desduplicada (es decir, "desduplicada") (izquierda) y dúplex (derecha) recuperadas por secuenciación después de la entrada de diferentes fracciones de la biblioteca de secuenciación en la reacción de captura de híbridos. Se usó un total de 32 ng de ADNlc de cada uno de los cuatro adultos sanos como entrada en cada condición y cada muestra se redujo a 100 millones de lecturas de secuenciación antes de la desduplicación por código de barras para facilitar la comparación. Las comparaciones se realizaron con una pruebatbilateral pareada.
LaFig.11muestra una comparación de las profundidades de secuenciación desduplicada (arriba) y dúplex (abajo) predichas por el modelo con la observada experimentalmente cuando se introduce el 8,3 % o el 100 % de una biblioteca de secuenciación en la reacción de captura de híbridos. En la simulación se contempló un intervalo de eficiencias de captura (eficiencia de captura de híbridos del 7,5-75 %), en la que la envolvente de confianza indica el intervalo resultante de las predicciones del modelo. Los datos experimentales representados en la Fig. 10 (n = 4 muestras de ADNlc por condición de captura) se redimensionaron antes de la desduplicación por código de barras para permitir comparaciones entre diferentes rendimientos de lectura de secuenciación (eje x). Los puntos indican la mediana y las barras de error indican el mínimo y el máximo.
LaFig. 12muestra una comparación de las profundidades de secuenciación desduplicada (izquierda) y dúplex (derecha) logradas después de la entrada del 8,3 % (n = 138 muestras de ADNlc) en comparación con >25 % (n = 145 muestras de ADNlc) de cada biblioteca de secuenciación en la reacción de captura de híbridos. Todas las muestras tenían 32 ng de ADNlc como entrada para la preparación de bibliotecas y se redujeron a 25 millones de lecturas antes de la duplicación por código de barras para facilitar la comparación. En los gráficos de caja, la línea central indica la mediana, la caja contiene el intervalo intercuartílico y los bigotes indican los extremos que no están a más de 1,5 x IIC del borde de la caja (estilo Tukey).
LaFig. 13muestra que cuando se compararon los perfiles de error de las muestras de ADNlc de 12 adultos sanos capturadas con y sin hipotaurina, se observó que las muestras capturadas con el eliminador de ROS tenían tasas de error de fondo significativamente más bajas y menos errores G>T.
LaFig. 14muestra que se observó una reducción relativa de los errores G>T (16 % frente a 57 % de todos los errores, prueba de suma de rangos de Wilcoxon,P< 1x10-8) y la tasa de error de fondo (una reducción de aproximadamente el 50 %, prueba de suma de rangos de Wilcoxon,P< 0,0001) en 104 muestras de ADNlc de controles sanos capturadas con el eliminador de ROS en comparación con 69 muestras de ADNlc de control capturadas sin hipotaurina.
LaFig. 15muestra que se determinaron tasas de detección de ADNtc en pacientes con tumores en estadios tempranos usando un enfoque con información del tumor. Esta estrategia establece la máxima sensibilidad para un enfoque de cribado sin exposición a tumor basado en CAPP-Seq.
LaFig. 16muestra que se genotiparon tejido tumoral, ADNlc en plasma previo al tratamiento y ADN leucocitario de 85 pacientes con CPNM en estadio I-III a través de secuenciación profunda dirigida de 255 genes con mutaciones recurrentes en cáncer de pulmón usando un panel de CAPP-Seq de 355 kilobases (kb).
LaFig. 17muestra que usando el panel de la Fig. 16, que es un enfoque "basado en la población" (por ejemplo, no requiere la personalización de la biología molecular específica del paciente), se identificó una mediana de 4 mutaciones por paciente en las muestras de ensayo de tumoral (intervalo 0-35), y se detectó ADNtc en el 49 % (42/85) de los pacientes con CPNM con una especificidad del 95 %. La sensibilidad de detección fue significativamente mayor a medida que aumentaba el número de mutaciones tumorales controladas.
LaFig. 18muestra que para someter a ensayo empíricamente la observación de que rastrear más mutaciones mejora las tasas globales de detección de ADNtc, se diseñaron paneles de captura personalizados basándose en datos de secuenciación del exoma tumoral para 17 pacientes en los que el ADNtc no fue detectable inicialmente usando el panel de cáncer de pulmón basado en la población. Este enfoque personalizado aumentó el número de mutaciones disponibles para el control a partir de una mediana de 4 a 68 (prueba t bilateral pareada,P< 0,01). Usando estos ensayos personalizados, se detectó ADNtc en 11/17 (65 %) pacientes con una mediana de VAF del 0,0019 % y a niveles tan bajos como 1,5 en 106 moléculas.
LaFig. 19muestra que combinando los resultados de las estrategias con información del tumor basadas en la población (n = 68) y personalizadas (n = 17), se detectó ADNtc en la mayoría de los pacientes con CPNM en estadio temprano (53/85 o 62 %), incluyendo el 52 %, 67 % y 88 % de los pacientes con enfermedad I, II y III, respectivamente.
LaFig. 20muestra que se identificaron propiedades de las moléculas de ADNtc que pueden informar el cribado sin exposición a tumor. Las mutaciones tumorales clonales, definidas como aquellas variantes que se estima que están uniformemente presentes en todas las células tumorales se detectaron con mayor frecuencia en plasma y se observaron con frecuencias alélicas más altas que sus homólogas subclonales (Prueba exacta de FisherP< 0,05, prueba de suma de rangos de WilcoxonP< 0,001).
LaFig.21muestra que la distribución de tamaño de los fragmentos de ADNlc también se consideró como un medio potencial de enriquecimiento en moléculas de ADNlc derivadas de tumores (por ejemplo, ADNtc). Se descubrió que las moléculas de ADNlc que albergaban mutaciones presentes en muestras tumorales emparejadas eran significativamente más cortas que sus homólogas no mutantes (prueba de suma de rangos de WilcoxonP< 1x10' 8).
LaFig. 22muestra que las moléculas de ADNlc mutantes estaban enriquecidas entre los fragmentos submononucleosómicos (< 160 pb) y en los fragmentos subdisómicos (230-310 pb, Fig. 21). Cuando sólo se contemplaron moléculas < 160 pb y entre 230-310 pb, se observó una mediana de enriquecimiento de 2,17 veces en las VAF de las mutaciones derivadas de tumores (intervalo 0-9,2, Fig. 21). Se observó que el 53,6 % de las moléculas mutantes caían en estas regiones, en comparación con el 24,7 % de las moléculas no mutantes (Fig. 21), lo que indica que la selección de tamaño de las moléculas en estas ventanas puede resultar útil. Sin embargo, aunque la mayoría de las mutaciones (74 %, 271/366) estaban enriquecidas en estas ventanas de tamaño, las VAF disminuyeron después de la selección de tamaño para el 26 % de las mutaciones (95/366), volviéndose indetectables el 78 % de dichas mutaciones (75/95).
LaFig. 23muestra que aunque la selección de tamaño mejoró la sensibilidad global de la detección de ADNtc en pacientes con muchas mutaciones rastreadas a través de paneles personalizados, la sensibilidad se degradó en pacientes controlados con el panel de cáncer de pulmón de los presentes inventores basado en la población debido a la pérdida de mutaciones tumorales no representadas en ninguna molécula de ADNlc corto.
LaFig. 24muestra que habiendo observado ADNtc detectable en la mayoría de los pacientes con CPNM en estadio temprano, a continuación se trató de identificar las correlaciones clínicas y patológicas de los niveles de ADNtc en estos pacientes. Se observó que los niveles de ADNtc estaban estrechamente asociados al avance del estadio, con una mediana de VAF del 0,015 % en el estadio I, del 0,14 % en el estadio II y del 0,52 % en el estadio III (prueba de suma de rangos de Wilcoxon,P< 0,0001).
LasFig. 25-26muestran que se descubrieron asociaciones significativas entre los niveles de ADNtc y el volumen tumoral metabólico (MTV, por sus siglas en inglés), según se midió mediante [18F] FDG p Et /CT (r de Spearman = 0,40,P= 0,004).
LaFig.27muestra que se descubrieron asociaciones significativas entre los niveles de ADNtc y el volumen tumoral metabólico (MTV), según se midió con la histología no adenocarcinoma (Prueba de suma de rangos de Wilcoxon,P< 0,01). El estadio, el MTV y la histología no adenocarcinoma se asociaron cada uno independientemente a la carga de ADNtc en el análisis multivariable, lo que indica que los niveles de ADNtc son una función de múltiples parámetros biológicos.
LaFig.28muestra que entre los pacientes con un componente de vidrio deslustrado importante (GGO > 25 %, por sus siglas en inglés), se detectó ADNtc con menor frecuencia y a una concentración menor que en los pacientes con GGO < 25 % (prueba exacta de FisherP< 0,05, prueba de suma de rangos de WilcoxonP< 0,05).
LaFig. 29muestra que cuando se compararon los niveles de ADNtc entre los subtipos histológicos de adenocarcinoma, los pacientes con tumores sólidos y papilares presentaban niveles de ADNtc más altos que aquellos con tumores acinares o lepídicos, aunque esta relación no alcanzó significación estadística.
LaFig. 30muestra que el ADNtc era detectable con mayor frecuencia en pacientes cuyos tumores tenían indicios de necrosis o contactaban con una vía aérea central o una arteria.
LaFig. 31muestra que dadas las correlaciones entre la excreción de ADNtc y los parámetros de formación de imágenes que se sabe que se asocian a la agresividad de la enfermedad, se examinó la asociación entre los niveles de ADNtc pretratamiento y los resultados clínicos. Los pacientes con niveles de ADNtc superiores a la mediana tenían tasas significativamente inferiores de ausencia de recidiva (relación de riesgos = 3,88,P= 0,0009). LaFig. 32muestra que dadas las correlaciones entre la excreción de ADNtc y los parámetros de formación de imágenes que se sabe que se asocian a la agresividad de la enfermedad, se examinó la asociación entre los niveles de ADNtc pretratamiento y los resultados clínicos. Los pacientes con niveles de ADNtc superiores a la mediana tenían tasas significativamente inferiores de supervivencia sin recidivas (relación de riesgos = 3,51,P= 0,001).
LasFig. 33-34muestran que los niveles de ADNtc pretratamiento fueron de pronóstico similar cuando sólo se contemplaron los pacientes con enfermedad en estadio I (n = 48).
LaFig. 35muestra que en un análisis multivariable que incluye tanto el MTV como el estadio, sólo el ADNtc se asoció significativamente al resultado.
LasFig. 36-37muestran que puesto que la metástasis a distancia es la principal causa de mortalidad asociada al cáncer después del tratamiento del CPNM localizado, también se examinó la asociación entre los niveles de ADNtc pretratamiento y futuras metástasis. Las concentraciones más altas de ADNtc se asociaron significativamente a una menor ausencia de metástasis a distancia tanto en el análisis univariable como en el multivariable.
LaFig. 38muestra que la concentración de ADNtc pretratamiento es un factor pronóstico en el CPNM localizado que puede identificar a los pacientes que albergan enfermedad micrometastásica.
LaFig. 39muestra que, en promedio, los pacientes con CPNM albergaban un número significativamente mayor de mutaciones no sinónimas en el ADNlc que los controles emparejados por riesgo y de riesgo bajo (prueba de suma de rangos de Wilcoxon,P <0,01 yP <0,0001).
LaFig.40muestra que la mutación observada en la VAF más alta en el ADNlc también estaba presente en los GB emparejados en el 76 % de los pacientes y en el 91 % de los controles.
LaFig. 41muestra que el 48 % de las mutaciones de ADNlc GB+ se encontraban en otros genes además de los 12 de los genes mutados más recurrentes canónicamente asociados a CH. Además, el 94,8 % de las mutaciones de ADNlc GB+ eran privadas, destacando la importancia del genotipado de leucocitos emparejados para determinar con fiabilidad si las mutaciones de ADNlc son derivadas del CH.
LaFig.42muestra que se observó una tasa similar de variantes CH en los pacientes con CPNM y en los controles, ya sea identificando mutaciones directamente a partir de los GB o a partir del ADNlc. Las fracciones alélicas de las mutaciones observadas en los compartimentos celular y libre de células estaban significativamente correlacionadas (r de Pearson = 0,83,P< 1x10-8).
LaFig. 43muestra que a diferencia de la tendencia de la mayoría de las variantes CH a ser privadas y a tener fracciones alélicas bajas en todas las cohortes de los presentes inventores, el 77 % (20/26) de las variantes en los GB que ocurrían a una VAF > 2 % afectaban a genes CH canónicos, conDNMT3A, TET2yTP53afectados con mayor frecuencia.
LasFig. 44-45muestran que, puesto que se sabe que la incidencia de CHIP aumenta con la edad, se examinó el número de mutaciones de ADNlc GB+ asociadas a la edad. El número de mutaciones de ADNlc GB+, pero no de las mutaciones de ADNlc GB-, se correlacionó significativamente con la edad (r de Pearson = 0,43,P <1 x 10-8). LaFig.46muestra que, coherentemente con el concepto de que estas mutaciones constituyen eventos de CH, los genes que contenían con mayor frecuencia mutaciones GB+ eran genes CH canónicos, incluyendoDNMT3A, TET2, TP53, SF3B1yPPM1D.
LaFig. 47muestra que para examinar los cambios temporales en las mutaciones de ADNlc GB+, se contempló el subconjunto de la cohorte al que se le extrajo muestras de plasma en dos puntos temporales (8 pacientes con CPNM, mediana del intervalo entre extracciones de sangre = 12 días; 5 controles emparejados por riesgo, mediana del intervalo = 19 meses). Entre las mutaciones de ADNlc GB+ detectadas en el primer punto temporal de recogida de sangre, el 73 % (41/56) también se detectaron en el segundo punto temporal y presentaron VAF altamente correlacionadas (r de Pearson = 0,99,P <0,0001 para los pacientes;rde Pearson = 0,74,P= 0,02 para los controles).
LasFig. 48-49muestran que para identificar propiedades de las mutaciones de CH que pueden ser útiles para distinguirlas de mutaciones derivadas de tumores, se compararon y contrastaron los distintivos mutacionales de las mutaciones de ADNlc GB+ y GB-, así como con conjuntos de datos de mutaciones publicados anteriormente en la literatura sobre CH y cáncer de pulmón. Las mutaciones GB+ detectadas en ADNlc de casos y controles estaban dominadas por el distintivo mutacional asociado al envejecimiento (Distintivo 1).
LaFig.50muestra que la distribución de las mutaciones de ADNlc GB+ y GB- fue similar en toda la proteína TP53, afectando ambas clases de mutaciones principalmente a su dominio de unión a ADN.
LaFig. 51muestra que coherentemente con los resultados del análisis del distintivo global, las mutaciones de ADNlc deTP53GB- mostraron un indicio significativamente mayor del distintivo del tabaquismo que sus homólogos GB+ (prueba de suma de rangos de Wilcoxon,P< 0,01).
LaFig.52muestra que el modelo de SNV aprovecha las características biológicas y técnicas clave específicas de cada variante individual, incluyendo las frecuencias de fondo, el tamaño del fragmento de ADNlc, la contribución del distintivo de tabaquismo, la presencia en un gen frecuentemente mutado en CPNM y la probabilidad de CH. LaFig. 53muestra que las formas de las curvas características de receptor-operador revelaron que Lung-CLiP puede ajustarse fácilmente a las especificidades deseables dependiendo de la aplicación clínica diana.
LaFig. 54muestra que a una especificidad del 80 %, se observaron sensibilidades del 63 % en pacientes en estadio I, del 69 % en pacientes en estadio II y del 75 % en pacientes en estadio III; además, a una especificidad del 98 %, se observaron sensibilidades del 41 % en pacientes en estadio I, del 54 % en pacientes en estadio II y del 67 % en pacientes en estadio III.
LaFig. 55muestra que los genes en los que se identificaron mutaciones de forma recurrente en el ADNlc de los pacientes incluían impulsores de CPNM esperados tales comoTP53, KRASyEGFR.Las características del clasificador con mayor impacto en la clasificación de pacientes incluyeron los niveles de VAF de SNV, el tamaño del fragmento de ADNlc, el número de SNV detectados, el número de CNV detectadas y si las alteraciones se habían observado anteriormente en el cáncer de pulmón.
LaFig.56muestra que las puntuaciones de Lung-CLiP se compararon con los niveles de ADNtc con información del tumor y las características clinicopatológicas. De manera destacada, las sensibilidades a una especificidad del 98 % no fueron significativamente diferentes de aquellas observadas usando análisis de ADNtc con información del tumor, lo que indica que Lung-CLiP alcanza sensibilidades similares a la detección de ADNtc con información del tumor. Además, se observó que las puntuaciones de Lung-CLiP sin exposición a tumor estaban significativamente correlacionadas con los niveles de ADNtc con información del tumor (r de Spearman = 0,59,P< 0,0001).
LaFig. 57muestra que los tumores de pacientes con CPNM clasificados como positivos por Lung-CLiP eran significativamente más grandes que aquellos clasificados como negativos (prueba de suma de rangos de Wilcoxon,P< 0,01) y, de forma similar, los pacientes con histología no adenocarcinoma se detectaron con mayor frecuencia (Prueba exacta de Fisher,P< 0,01).
LaFig. 58muestra que el rendimiento del ensayo Lung-CLiP se validó en una cohorte independiente de 46 pacientes con CPNM (n = 32 estadio I; n = 9 estadio II; n = 5 estadio III) y 48 controles emparejados por riesgo con exploraciones de LDCT negativas que se inscribieron prospectivamente en una institución diferente.
LaFig. 59muestra que el rendimiento emparejado por estadio del modelo en la cohorte de validación fue estadísticamente similar al observado en el entrenamiento mediante las métricas de sensibilidad y AUC, con diferencias numéricas en el rendimiento del estadio I atribuibles a una fracción mayor de casos en estadio IA frente a IB en la cohorte de validación.
LaFig. 60muestra que los umbrales de especificidad establecidos en la cohorte de entrenamiento tuvieron un comportamiento similar cuando se aplicaron a los controles de la cohorte de validación, lo que indica que las puntuaciones de Lung-CLiP están bien calibradas.
LaFig. 61muestra que se realizaron varios análisis exploratorios en las cohortes combinadas de entrenamiento y validación. Se examinó la influencia de la profundidad de secuenciación o métricas relacionadas sobre la sensibilidad. Se descubrió que la entrada de ADNlc, la entrada de volumen plasmático y la profundidad de secuenciación única no se asociaron significativamente a la sensibilidad de Lung-CLiP.
LaFig.62muestra que, contemplando todos los pacientes con CPNM con datos de MTV disponibles (n = 103), se observó una fuerte correlación entre el MTV y la sensibilidad de Lung-CLiP, con sensibilidades aproximadas del 16 % (IC del 95 %: 4 %-24 %), 52 % (IC del 95 %: 32 %-72 %) y 80 % (IC del 95 %: 60 %-96 %) para tumores de 1 ml, tumores de 10 ml y tumores de > 100 ml, respectivamente.
LasFig. 63-65muestran que se extrajo sangre de cada uno de tres donantes sanos en dos tubos Streck y dos tubos K2EDTA y se procesó usando los protocolos utilizados en el estudio de los presentes inventores. La extracción de ADNlc y la preparación de bibliotecas se realizaron como se describe en el presente documento con 25 ng de entrada de ADNlc para cada muestra. La secuenciación y el procesamiento de los datos se realizaron como se describe en el presente documento, y cada muestra se redujo a 80 millones de lecturas antes de la desduplicación por código de barras para facilitar la comparación.
LaFig. 63muestra que el modelo Lung-CLiP se entrenó en los 104 pacientes con CPNM y 56 controles emparejados por riesgo de la cohorte de entrenamiento y se aplicó a las muestras de ADNIc extraídas de plasma extraído en tubos Streck y K2EDTA. Se representa la fracción de donantes clasificados como negativos por Lung-CLiP en los umbrales de especificidad del 98 % (barras 1.a y 3.a) y del 80 % (barras 2.a y 4.a) definidos en los datos de entrenamiento. Comparación de la mediana del tamaño del fragmento de ADNlc, la concentración de ADNlc en ng ml-1, la profundidad desduplicada, la profundidad dúplex y las métricas de error en muestras de ADNlc extraídas de plasma extraído en los dos tipos de tubo. Las muestras de ADNlc del mismo donante están conectadas con líneas discontinuas, las comparaciones se realizaron usando una pruebatbilateral pareada.
La Fig. 64 muestra una comparación de la distribución de tamaño de fragmentos de las muestras de ADNlc extraídas en los dos tipos de tubos.
La Fig. 65 muestra que el genotipado se realizó como se describe en el presente documento en muestras de ADNlc extraídas de plasma extraído en los dos tipos de tubos de los tres donantes. El donante 1 y el donante 3 tenían cada uno una mutación identificada en el ADNlc que estaba presente en las muestras extraídas del plasma extraído en ambos tipos de tubo y también estaba presente en los GB emparejados (GB+). En el donante 2 no se identificaron mutaciones en las muestras de ADNlc extraídas de plasma extraído en ninguno de los dos tipos de tubo.
La Fig. 66A muestra que se realizó una validación ortogonal de 15 mutaciones de ADNlc GB+ observadas en un subconjunto de pacientes y controles usando PCR digital en gotitas (ddPCR, por sus siglas en inglés). La ddPCR se realizó en un instrumento Bio-Rad QX200 usando reactivos, cebadores y sondas obtenidos en Bio-Rad. Se validaron cuatro mutaciones privadas, así como dos mutaciones de punto crítico recurrentes enDNMT3AyJAK2que se observaron en 11 muestras de ADNlc. Se observó que el 100 % (15/15) de las mutaciones sometidas a ensayo se validaron mediante ddPCR tanto en el ADNlc como en los compartimentos de ADNg de GB y que las VAF cuantificadas mediante CAPP-Seq y ddPCR estaban significativamente correlacionadas.
La Fig.66B muestra (izquierda) las VAF de mutaciones individuales (n = 323) observadas en ADNlc con diferentes estrategias de ajuste de VAF de SNV. Las comparaciones se realizaron usando una prueba t bilateral pareada; (centro) La VAF media del ADNlc en todas las mutaciones rastreadas, rastreada en pacientes con ADNtc detectable (n = 48) con las diferentes estrategias de ajuste. Las comparaciones se realizaron usando una prueba t bilateral pareada; y (derecha) Los mismos datos que en m separados por estadios. En los gráficos de caja, la línea central indica la mediana, la caja contiene el intervalo intercuartílico y los bigotes indican los extremos que no están a más de 1,5 x IIC del borde de la caja (estilo Tukey). El ajuste del número de copias y la clonalidad se realizó como se describe en el presente documento.
La Fig. 67 muestra que en todo el panel de secuenciación se observó una naturaleza sorprendentemente estereotipada de las posiciones iniciales de los fragmentos.
La Fig. 68 muestra que se sumaron los RPM iniciales de las 8.192 posiciones informativas para crear una "Puntuación de Inicio", destinada a usarse para clasificar a los pacientes con cáncer de pulmón con respecto a los controles sin cáncer. De manera destacada, la Puntuación de Inicio se correlacionó con mediciones biológicas de carga de enfermedad, incluyendo la fracción alélica tumoral de ADNtc y el volumen tumoral metabólico.
La Fig. 69 muestra que también se evaluó la correlación entre la Puntuación de Inicio y Lung-CLiP. De manera interesante, mientras que la Puntuación de Inicio se correlacionó significativamente con las puntuaciones de Lung-CLiP en la cohorte de entrenamiento, la correlación disminuyó en el conjunto de validación, lo que indica que el posicionamiento del inicio del fragmento representa una característica biológicamente ortogonal para los SNV y SCNA con una utilidad de clasificación independiente.
La Fig. 70 muestra que se evaluó la utilidad de la Puntuación de Inicio para distinguir pacientes con cáncer de pulmón de controles sin cáncer en tres cohortes separadas, incluyendo la cohorte de entrenamiento y dos cohortes de validación independientes. Las Puntuaciones de Inicio fueron más altas en los pacientes con cáncer de pulmón que en los controles de cada cohorte sometida a ensayo.
Las Fig. 71-72 muestran que el rendimiento de la Puntuación de Inicio para distinguir a los pacientes con cáncer de pulmón de los controles fue similar en las cohortes de entrenamiento y de validación (AUC = 0,82 en el entrenamiento, AUC = 0,86 en el conjunto de validación 1, 0,80 en el conjunto de validación 2).
La Fig.73 muestra un diagrama de flujo que representa la fracción de mutaciones de ADNlc GB+ y GB' que afectan a genes de hematopoyesis clonal canónicos en pacientes con CPNM y controles. Las mutaciones de ADNlc GB+ presentes en VAF >1 % en leucocitos emparejados afectan con más frecuencia a genes de hematopoyesis clonal canónicos que aquellas presentes en niveles inferiores al 1 % (51/64 frente a 223/460 mutaciones de ADNlc GB+ presentes a VAF > 1 % frente a < 1 % en leucocitos emparejados afectan a genes CH canónicos, respectivamente;P =1,9 x 10-6, prueba exacta de Fisher). Sólo se contemplan las mutaciones identificadasde novoen el ADNlc cuya presencia en los GB emparejados pueda evaluarse con seguridad.
La Fig. 74 muestra el porcentaje de mutaciones genotipadasde novoa partir de ADN de GB a VAF de < 2 % y > 2 % que afectan a genes canónicos de hematopoyesis clonal en pacientes y controles (se contemplan todos los pacientes y controles). La comparación se realizó mediante la prueba exacta de Fisher.
La Fig. 75 muestra el porcentaje de controles (izquierda) y pacientes con CPNM (derecha) con una o más mutaciones en los diez genes que contenían con mayor frecuencia mutaciones de ADNlc GB+. Los pacientes con CPNM y controles con mutaciones GB+ solamente, mutaciones GB- solamente o ambas mutaciones GB+ y GB- en un gen se representan en rojo, gris y rosa, respectivamente. Los números junto a cada barra representan el porcentaje de todas las mutaciones de ADNlc en ese gen que son GB+ en pacientes con CPNM (derecha) o controles (izquierda). Los pacientes con CPNM tenían significativamente más mutaciones de ADNlc GB- enTP53que los controles (19/32 y 0/4 en pacientes y controles, respectivamente.*P= 0,04, prueba exacta de Fisher). La Fig. 76 muestra la frecuencia de mutación por gen para mutaciones de ADNlc Gb observadas en todos los pacientes con CPNM (n = 104) y controles (n = 98). El ejeyrepresenta el porcentaje de la cohorte combinada con mutaciones de ADNlc GB+ que afectan a un gen dado. Se representan todos los genes con mutaciones en cuatro o más individuos en la cohorte combinada.
LaFig. 77muestra un gráfico de dispersión en el que se comparan las VAF de las mutaciones de ADNlc GB+ a lo largo de múltiples puntos temporales en pacientes con CPNM (panel izquierdo,n= 54 mutaciones,n= 8 individuos) y controles (panel derecho,n= 12 mutaciones,n= 6 individuos). La comparación estadística se realizó mediante correlación de Pearson en mutaciones detectadas en ambos puntos temporales.
LaFig.78muestra que el análisis de selección positiva se realizó en todas las mutaciones de ADNlc GB+ (n = 693 mutaciones, rojo) y Gb - (n = 526 mutaciones, gris) sinónimas y no sinónimas observadas en pacientes con CPNM y controles usando el paquete dNdScv R con una modificación para tener en cuenta la fracción de un gen dado cubierto por el panel de secuenciación de los presentes inventores. El eje x indica el valor P ajustado a dNdScv (valor Q) para todos los tipos de sustitución. Los genes se consideraron bajo selección positiva si el valor Q era inferior a 0,05. Se muestran todos los genes que cumplen este umbral.
LaFig. 79muestra una distribución de mutaciones de ADNlc GB+ y GB- en toda la proteína p53 en pacientes con CPNM y controles.
LaFig. 80muestra el enriquecimiento en fragmentos cortos de las mutaciones de ADNlc GB+ y GB- en pacientes con CPNM y controles, definido como el factor de cambio en la VAF para una mutación dada después de la selección de tamaño informática para los tamaños de fragmentos de ADNlc que se encontró que estaban enriquecidos en ADNtc en laFig. 21.La línea central indica la mediana, el recuadro contiene el intervalo intercuartílico y los bigotes indican los valores de los percentiles 10 y 90.
LaFig. 81muestra parámetros biológicos y técnicos específicos de cada variante individual utilizados como características en un "modelo de SNV" de regresión logística dedicada. Los nombres de las características se representan en el eje y, y el log10 negativo del valorPderivado de comparar todas las SNV posfiltradas en pacientes con CPNM (n = 574 mutaciones den= 104 individuos) con aquellas de los controles emparejados por riesgo(n= 64 mutaciones den= 56 individuos) en un modelo lineal univariable en el conjunto de entrenamiento se muestra en el eje x. Se muestran todas las características con un valorPinferior a 0,01, los valoresPse calcularon usando una pruebatbilateral no pareada. En el presente documento se proporciona información adicional sobre cada característica.
LaFig.82muestra curvas de características operativas del receptor (ROC, por sus siglas en inglés) para el modelo Lung-CLiP que representan el rendimiento estratificado por estadio tumoral en el conjunto de entrenamiento (n = 104 pacientes con CPNM yn= 56 controles emparejados por riesgo).
LaFig. 83muestra el espectro de correlaciones clinicopatológicas y características seleccionadas observadas en los 46 pacientes con CPN<m>en estadio temprano y 48 controles emparejados por riesgo sometidos a cribado anual de cáncer de pulmón en una cohorte de validación independiente inscrita prospectiva.
LaFig.84muestra curvas de características operativas del receptor para el modelo Lung-CLiP que representan el rendimiento estratificado por estadio tumoral en el conjunto de validación (n = 46 pacientes con CPNM yn= 48 controles emparejados por riesgo).
LaFig. 85muestra una comparación de la especificidad observada en la cohorte de validación a diferentes umbrales definidos en la cohorte de entrenamiento. Los puntos indican la mediana de especificidad en 1.000 remuestreosbootstrap(con reemplazo) y las barras de error representan el intervalo intercuartílico. La comparación estadística se realizó mediante la correlación de Pearson en los datos no sometidos abootstrap.
LasFig. 86A-86Dmuestran una comparación del volumen tumoral metabólico (Fig. 86A), la entrada de ADNlc para la preparación de bibliotecas (Fig. 86B), el volumen plasmático utilizado (Fig. 86C) y la profundidad de secuenciación única (Fig. 86D) en pacientes con CPNM clasificados correctamente a una especificidad del 98 % (positivos) frente a los de pacientes clasificados incorrectamente (negativos). Se consideraron todos los pacientes con CPNM de las cohortes de entrenamiento y validación (n = 103 pacientes con mediciones metabólicas del volumen tumoral en laFig. 86Ayn= 150 pacientes en lasFig. 86B-86D). En los gráficos de caja, la línea central indica la mediana, la caja contiene el intervalo intercuartílico y los bigotes indican los extremos que no están a más de 1,5 x<iic>del borde de la caja (estilo Tukey).
Descripción detallada
Pasando ahora a los dibujos y los datos, se proporcionan realizaciones relacionadas con la secuenciación de ácidos nucleicos libres de células y la detección del cáncer. En algunas realizaciones, se extraen ácidos nucleicos libres de células (ADNlc o ARNlc) de una biopsia líquida y se preparan para su secuenciación. En muchas realizaciones, los resultados de secuenciación de los ácidos nucleicos libres de células se analizan mediante modelos computacionales para detectar secuencias de ácidos nucleicos tumorales circulantes (ADNtc o ARNtc) (por ejemplo, secuencias de ácidos nucleicos que derivan de una neoplasia). En consecuencia, en diversas realizaciones, pueden detectarse neoplasias (incluyendo el cáncer) en un individuo extrayendo una biopsia líquida del individuo y secuenciando los ácidos nucleicos libres de células derivados de esa biopsia líquida para detectar secuencias de ácidos nucleicos tumorales circulantes y la presencia de secuencias de ácidos nucleicos tumorales circulantes indica que el individuo tiene una neoplasia. En algunas realizaciones, se realiza una intervención clínica en el individuo basada en la detección de una neoplasia.
En la Fig. 1 se proporciona un proceso para realizar una intervención clínica basada en la detección de ácidos nucleicos tumorales circulantes en la muestra biológica de un individuo. En algunas realizaciones, la detección de ácidos nucleicos tumorales circulantes indica que hay presente una neoplasia (por ejemplo, cáncer) y, por lo tanto, puede realizarse una intervención clínica adecuada.
El proceso 100 puede comprender obtener, preparar y secuenciar (101) ácidos nucleicos libres de células obtenidos a partir de una biopsia no invasiva (por ejemplo, biopsia líquida o de residuos). En algunas realizaciones, se extrae ADNlc y/o ARNlc de plasma, sangre, linfa, saliva, orina, heces y/o cualquier otro fluido corporal adecuado. En algunas realizaciones, se extrae una biopsia antes de cualquier indicio de cáncer. En algunas realizaciones, se extrae una biopsia para proporcionar un cribado precoz con el fin de detectar una neoplasia (por ejemplo, cáncer). En algunas realizaciones, se extrae una biopsia para detectar si existe neoplasia residual (por ejemplo, cáncer) después de un tratamiento. Puede realizarse el cribado de cualquier cáncer particular. Para obtener más información sobre ejemplos de cánceres que pueden detectarse para su intervención, véase la sección titulada "Intervenciones clínicas".
En algunas realizaciones, se extrae una biopsia de un individuo con un riesgo conocido de desarrollar cáncer, tal como aquellos con antecedentes familiares del trastorno o que tienen factores de riesgo conocidos (por ejemplo, fumador de cigarrillos). En muchas realizaciones, se extrae una biopsia de cualquier individuo de la población general. En algunas realizaciones, se extrae una biopsia de individuos pertenecientes a un grupo de edad particular con mayor riesgo de cáncer, tal como los individuos mayores de 50 años.
En muchas realizaciones, los ácidos nucleicos libres de células extraídos se preparan para la secuenciación. En consecuencia, los ácidos nucleicos libres de células se convierten en una biblioteca molecular para su secuenciación. En algunas realizaciones, se unen adaptadores y cebadores a ácidos nucleicos libres de células para facilitar la secuenciación. En algunas realizaciones, se ha de realizar la secuenciación dirigida de locus genómicos particulares, y por lo tanto se capturan secuencias particulares correspondientes a los locus particulares mediante hibridación antes de la secuenciación. En algunas realizaciones, se incluyen diversos reactivos durante las operaciones de biblioteca y/o captura para mitigar los factores de confusión. En algunas realizaciones, se incluye un antioxidante durante una o más operaciones de preparación de la secuenciación para evitar la oxidación de diversos nucleótidos que dan con resultado transversiones de nucleótidos. En algunas realizaciones, se utiliza el antioxidante hipotaurina en diversas operaciones de preparación de la secuenciación.
En algunas realizaciones, puede utilizarse cualquier técnica de secuenciación adecuada que pueda detectar variaciones de secuencia indicativas de ácidos nucleicos tumorales circulantes. Las técnicas de secuenciación incluyen (pero sin limitación) la secuenciación 454, la secuenciación Illumina, la secuenciación SOLiD, la secuenciador Ion Torrent, la secuenciación de lectura única, la secuenciación de extremos emparejados, etc.
El proceso 100 analiza (103) el resultado de secuenciación de ácidos nucleicos libres de células para detectar secuencias de ácidos nucleicos tumorales circulantes. Debido a que las neoplasias (especialmente los tumores metastásicos) crecen y se expanden activamente, las células neoplásicas con frecuencia liberan biomoléculas (especialmente ácidos nucleicos) en la vasculatura, la linfa y/o los sistemas de residuos. Además, debido a las limitaciones biofísicas de su entorno local, las células neoplásicas con frecuencia se rompen, liberando su contenido celular interno en la vasculatura, la linfa y/o los sistemas de residuos. En consecuencia, es posible detectar tumores primarios distales y/o metástasis a partir de una biopsia líquida o de residuos.
En una serie de realizaciones, se analiza un resultado de secuenciación de ácidos nucleicos libres de células para detectar si existen variantes de nucleótido único (SNV) somáticas, variaciones del número de copias (CNV, por sus siglas en inglés), características de posición genómica y/o SNV de estirpe germinal dentro de la muestra de ácido nucleico libre de células. En algunas realizaciones, la presencia de SNV somáticas, CNV, características de posición genómica y/o SNV de estirpe germinal particulares es indicativa de secuencias de ácidos nucleicos tumorales circulantes (y por lo tanto indicativa de un tumor presente). En diversas realizaciones, se utiliza un modelo computacional para analizar las SNV somáticas, las CNV, las características de posición genómica y/o las SNV de estirpe germinal detectadas para determinar si estos elementos moleculares detectados son indicativos de ácidos nucleicos tumorales circulantes. En algunas realizaciones, un modelo computacional proporciona una indicación relativa (por ejemplo, puntuación de confianza numérica) sobre si una muestra particular contiene ácidos nucleicos tumorales circulantes. En algunas realizaciones, un modelo computacional se entrena en SNV somáticas, CNV, características de posición genómica y/o SNV de estirpe germinal detectadas en pacientes y controles emparejados.
En algunas realizaciones, se eliminan los factores de confusión de un resultado de secuenciación de ácidos nucleicos libres de células. Actualmente se entiende que la hematopoyesis clonal (CH, por sus siglas en inglés) es una fuente de confusión de CNV y SNV somáticas en una muestra de ácido nucleico libre de células. En consecuencia, en diversas realizaciones, las CNV y SNV somáticas asociadas a CH se eliminan de los análisis posteriores. En algunas realizaciones, las CNV y SNV somáticas derivadas de CH se determinan para cada individuo particular analizado. Para detectar las CNV y SNV somáticas particulares de un individuo derivadas de CH, se recogen leucocitos o glóbulos blancos (GB, por sus siglas en inglés) o células hematopoyéticas del individuo y sus ácidos nucleicos se extraen y secuencian para detectar CNV y SNV somáticas derivadas de dichas células. En algunas realizaciones, las CNV y SNV somáticas detectadas en los GB se eliminan durante el análisis del resultado de secuenciación de ácidos nucleicos libres de células.
La detección de secuencias de ácidos nucleicos tumorales circulantes indica que hay presente una neoplasia en el individuo examinado. En consecuencia, basándose en la detección de ácidos nucleicos tumorales circulantes, puede realizarse una intervención clínica (105). En algunas realizaciones, se realiza un procedimiento clínico, tal como (por ejemplo) un análisis de sangre, formación de imágenes médicas, examen físico, una biopsia tumoral o cualquier combinación de los mismos. En algunas realizaciones, se realizan diagnósticos para determinar el estadio particular del cáncer. En algunas realizaciones, se realiza un tratamiento, tal como (por ejemplo) quimioterapia, radioterapia, inmunoterapia, terapia hormonal, terapia farmacológica dirigida, vigilancia médica o cualquier combinación de las mismas. En algunas realizaciones, una persona es evaluada y/o tratada por un profesional médico, tal como un/a médico/a, enfermero/a, dietista o similar.
Aunque anteriormente se han descrito ejemplos específicos de procesos para analizar molecularmente ácidos nucleicos libres de células y realizar una intervención clínica, algunas operaciones del proceso pueden realizarse en distintos órdenes y determinadas operaciones pueden ser opcionales. Por ello, algunas operaciones del proceso pueden usarse según sea adecuado para los requisitos de aplicaciones específicas. Además, puede utilizarse cualquiera de una diversidad de procesos para analizar molecularmente ácidos nucleicos libres de células adecuados para los requisitos de una aplicación dada.
Preparación de bibliotecas de secuenciación
Algunas realizaciones se refieren a la preparación de una muestra libre de células de ácidos nucleicos, incluyendo ADN libre de células (ADNlc) y/o<a>R<n>libre de células (ARNlc), para la secuenciación. En consecuencia, las realizaciones incluyen extraer ácidos nucleicos de una muestra biológica que tiene ácidos nucleicos extracelulares. Las muestras biológicas incluyen (pero sin limitación) sangre, plasma, líquido linfático, líquido cefalorraquídeo, saliva, orina, heces, etc. Los ácidos nucleicos libres de células pueden aislarse y purificarse por cualquier medio adecuado, como se conoce en la técnica. En algunas realizaciones, se utiliza la purificación en columna (por ejemplo, kit de ácido nucleico circulante QIAamp de Qiagen, Hilden, Alemania). En algunas realizaciones, los fragmentos de ARN aislados pueden convertirse en ADN complementario para su análisis posterior adicional.
Algunas realizaciones se refieren a preparar muestras de ácidos nucleicos derivados de células para su secuenciación. En consecuencia, algunas realizaciones aislar células y o tejidos que han de analizarse (por ejemplo, células tumorales, células neoplásicas, células sanguíneas). Las células y los tejidos pueden extraerse y aislarse como se entiende en la técnica. En algunas realizaciones, se aíslan células sanguíneas (por ejemplo, leucocitos) del plasma mediante centrifugación. Además, los ácidos nucleicos de las células y tejidos pueden aislarse y purificarse por cualquier medio adecuado, como se conoce en la técnica. En algunas realizaciones, se utiliza la purificación en columna (por ejemplo, kit de sangre y tejido DNeasy de Qiagen, Hilden, Alemania). Los ácidos nucleicos pueden descomponerse en fragmentos más pequeños (por ejemplo, 50-450 pb) para la preparación de bibliotecas por cualquier medio adecuado (por ejemplo, ultrasonidos).
En algunas realizaciones, los fragmentos de ácido nucleico aislados pueden prepararse en una biblioteca de secuenciación. En muchas realizaciones, para construir una biblioteca se utilizan adaptadores que tienen identificadores únicos (UID) y códigos de barras de muestra de índice doble, cada uno con un contenido de GC y una diversidad de secuencias optimizados. En muchas de estas realizaciones, los UID y los códigos de barras de índice doble están desacoplados (por ejemplo, cada uno es un código de barras distinto). En algunas realizaciones, los UID son secuencias predefinidas (por ejemplo, no aleatorias) para proporcionar un beneficio de corrección de errores. Los errores en los UID o los códigos de barras de muestra se introducen con frecuencia durante la preparación de bibliotecas, lo que puede conducir a una enumeración inexacta de moléculas únicas observadas mediante secuenciación. Para corregir estos errores, algunas realizaciones utilizan secuencias predefinidas con distancias de edición de Hamming por pares, que pueden utilizarse para la corrección de errores. Por ejemplo, cuando se utilizan secuencias UID de 6 pb, las secuencias pueden diseñarse con distancias de edición Hamming por pares > 3, permitiendo la corrección de errores de 1 pb y la detección de errores de 2 pb. Análogamente, cuando se utilizan secuencias de códigos de barras de muestra de 8 pb, las secuencias pueden diseñarse con distancias de edición Hamming por pares > 5, lo que permite la corrección de errores de 1 o 2 pb y la detección de errores de 3 pb.
En una serie de realizaciones, el contenido de GC de los UID y los códigos de barras de muestra se optimiza a un contenido de GC de aproximadamente el 50 %, lo que puede ser beneficioso para la hibridación y mejora la diversidad de secuencias. Algunas realizaciones también se refieren al desarrollo de UID y códigos de barras con diversidad de secuencias. En estas realizaciones, se diseñan secuencias de UID y códigos de barras de muestra, así como secuencias adicionales en los adaptadores, para tener una selección de nucleótidos casi igual en cada posición de base. Por ejemplo, una colección de adaptadores puede tener aproximadamente el 25 % de nucleótidos A, el 25 % de nucleótidos C, el 25 % de nucleótidos T y el 25 % de nucleótidos G en cada posición de base dentro del UID, el código de barras de muestra y las secuencias adaptadoras circundantes. La diversidad de secuencias puede mejorar la función óptica de los secuenciadores para la calibración adecuada. Mediante la modificación por ingeniería de una mayor diversidad de secuencias en los adaptadores, se elimina la necesidad de secuenciar PhiX, aumentando los rendimientos de lecturas de secuenciación. En muchas realizaciones, el índice doble se refiere a los adaptadores que utilizan dos códigos de barras de muestra, normalmente añadidos a ambos lados de una lectura de secuencia.
Algunas realizaciones se refieren a moléculas de biblioteca que han de usarse en una reacción de secuenciación. En algunas realizaciones, los ácidos nucleicos son ADN, por lo tanto pueden usarse directamente para la preparación de bibliotecas. En algunas realizaciones, los ácidos nucleicos son ARN, por lo tanto es necesaria su conversión en ADNc antes de la preparación de bibliotecas. En muchas realizaciones, un par de UID con corrección de errores se une al fragmento de ADN (o ADNc) de manera que el ADN (o ADNc) está flanqueado a cada lado por el UID. Un par de UID flanqueantes proporciona una indicación de una molécula de ácido nucleico particular derivada de una fuente biológica, lo que puede permitir una enumeración más precisa de las moléculas únicas originales (por ejemplo, cada par de UID indica un evento de ligadura de esa molécula de ácido nucleico que se produce antes de las operaciones de amplificación, permitiendo la identificación de moléculas duplicadas que surgen debido a las operaciones de amplificación). En algunas realizaciones, un par de códigos de barras de muestra de índice se une al fragmento de ADN (o ADNc) de manera que el ADN (o ADNc) está flanqueado a cada lado por los códigos de barras de muestra de índice, que indican la fuente de la muestra (por ejemplo, todas las moléculas derivadas de una muestra están flanqueadas por el par de códigos de barras de muestra de índice). En algunas realizaciones, el uso de códigos de barras de muestra de índice doble garantiza mejor que un producto de secuenciación sea de hecho un producto auténtico de la fuente de la muestra, según se determina por tener ambos códigos de barras índice adecuadamente flanqueados. En algunas realizaciones, un fragmento de ADN (o ADNc) de muestra aislado que incorpora UID flanqueantes y códigos de barras de muestra flanqueantes incorpora además un sitio de hibridación para un cebador universal para PCR y/o secuenciación.
LaFig. 2Amuestra que un exceso de códigos de barras moleculares (es decir, identificadores únicos o UID) que difieren en 1 pb en moléculas de ADNlc con las mismas posiciones inicial y final indica que los errores de secuenciación en los UID pueden crear familias de UID erróneas. Se representan las distribuciones esperadas y observadas de las distancias de edición de Hamming del código de barras (distancia de edición de UID) al comparar los UID de diferentes grupos de moléculas de ADNlc desduplicadas por código de barras (es decir, únicas) usando adaptadores en tándem.
El uso de adaptadores de índice puede dar como resultado una supresión de errores significativa; sin embargo, sólo puede contemplarse la información de moléculas monocatenarias, puesto que las moléculas "dúplex" bicatenarias parentales no pueden reconstituirse. Ser capaz de identificar qué cadenas individuales se aparearon originalmente en los dúplex puede permitir la supresión de errores adicionales. Por lo tanto, se diseñaron "adaptadores en tándem", que pueden incluir dos códigos de barras exógenos: códigos de barras de índice para la supresión de errores monocatenarios junto con códigos de barras dedicados para la supresión de errores bicatenarios. Estos últimos se incorporaron como códigos de barras de 2 bases en la porción bicatenaria de los adaptadores, y se leyeron al principio de cada lectura de secuenciación principal (que pueden denominarse códigos de barras "de inserto"). Debido a que los códigos de barras de inserto se secuenciaron con las lecturas principales, se obtuvo un código de barras de inserto dinucleotídico de cada extremo de cada fragmento de ADN, produciendo un código de barras de inserto de 4 bases y una diversidad máxima de 256 moléculas por posición genómica inicial/final. En algunas realizaciones, los códigos de barras de índice y/o inserto pueden colocarse en otras ubicaciones del adaptador o sintetizarse con longitudes diferentes para adaptarse a una mayor o menor diversidad de moléculas.
Los adaptadores en tándem pueden utilizar UID aleatorios de 4 monómeros, dando como resultado 256 UID distintos cuyos errores no pueden corregirse. La distribución teórica de las distancias de edición de UID en todos los 256 UID (es decir, la fracción de UID que difieren entre sí en 1, 2, 3 y 4 pb) se muestra en las barras 1.a, 5.a, 9.a y 13.a (por ejemplo, la 1.a barra de cada grupo de cuatro barras). Las otras barras representan la distribución de las distancias de edición UID observadas en muestras de ADNlc de controles sanos secuenciadas con adaptadores en tándem (n = 24 individuos). Los UID muestreados aleatoriamente se muestran en las barras 2.a, 6.a, 10.a y 14.a (por ejemplo, la 2.a barra dentro de cada grupo de cuatro barras). Las UID de moléculas de ADNlc con diferentes posiciones genómicas iniciales y finales se muestran en las barras 3.a, 7.a, 11.a y 15.a (por ejemplo, la 3.a barra dentro de cada grupo de cuatro barras). Las moléculas de ADNlc que comparten las mismas posiciones iniciales y finales se muestran en las barras 4.a, 8.a, 12.a y 16.a (por ejemplo, la 4.a barra dentro de cada grupo de cuatro barras). Las UID que difieren sólo en una base están significativamente sobrerrepresentadas cuando se comparan moléculas de ADNlc con la misma posición inicial y final (la 4.a barra dentro de cada grupo de cuatro barras) con cada una de las otras distribuciones de UID, lo que sugiere que los errores de 1 pb están creando erróneamente nuevas familias de UID. Las comparaciones de grupos se realizaron con una prueba t bilateral pareada, excepto cuando se compararon con la distribución teórica, para lo que se usó una prueba t bilateral no pareada(P <1 * 10'8). Las barras indican la media y las barras de error indican el error típico de la media.
En la Fig. 2B se proporciona una realización de un proceso para preparar bibliotecas usando moléculas de ADN bicatenario (o ADNc) como entrada. Como se muestra, los adaptadores parciales en forma de Y se ligan en moléculas de ADN (o ADNc). Cada adaptador parcial en forma de Y contiene un identificador único (UID) con corrección de errores que delinea un código de barras molecular para identificar una molécula de ADN (o ADNc) particular antes de la amplificación. Puede usarse cualquier código de barras molecular UID con corrección de errores adecuado, normalmente que tiene una longitud de al menos 3 pb. En algunas realizaciones, un código de barras molecular UID con corrección de errores es de 3 pb, 4 pb, 5 pb, 6 pb, 7 pb u 8 pb. En algunas realizaciones, el desacoplamiento de los UID y los códigos de barras de muestra permite adaptar independientemente la diversidad de UID y la capacidad de multiplexación de muestras.
En la Fig. 3 se proporciona un ejemplo de adaptador parcial en forma de Y. Como puede observarse, el adaptador tiene un UID de 6 pb flanqueado por una secuencia de desplazamiento de 1 pb y una secuencia de escalonamiento de 0-3 pb. En muchas realizaciones, la secuencia de desplazamiento de 1 pb y/o un escalonamiento de 0-3 pb tienen una diversidad de secuencia de manera que hay igual selección de nucleótidos en cada posición de base. Tener un escalonamiento previo a la base de hibridación T ayuda a aumentar la diversidad de secuencias, beneficiando potencialmente a la función óptica en el secuenciador. El 1 bp puede ayudar a garantizar una lectura precisa del UID, ya que los errores con frecuencia se producen en la primera base secuenciada. Además, un adaptador parcial en forma de Y tiene secuencias de hibridación para promotores para la PCR de injerto (véanse P5 y P7).
Después de ligar los adaptadores parciales en forma de Y, los productos de ligadura se usan para injertar códigos de barras de índice doble con corrección de errores que significan una muestra (por ejemplo, la fuente biológica) que ha de secuenciarse. En consecuencia, en muchas realizaciones, se realiza una PCR de injerto con un conjunto particular de cebadores de injerto para cada muestra. Para realizar la PCR de injerto, en algunas realizaciones, se utilizan cebadores PCR de injerto para injertar el código de barras con corrección de errores específico de muestra en el producto de ligadura (véanse las operaciones 3 y 4). En muchas realizaciones, una PCR de injerto incluye uno o más de los siguientes: un código de barras con corrección de errores específico de muestra, una secuencia de cebador de injerto y una secuencia de hibridación para un cebador universal. En consecuencia, en algunas realizaciones, una PCR de injerto da como resultado una biblioteca de moléculas de ADN. En algunas realizaciones, cada molécula de ADN de la biblioteca tiene la secuencia de los fragmentos de ADN de muestra aislados y uno o más de las siguientes: un par flanqueante de UID con corrección de errores, un par flanqueante de códigos de barras de muestra de índice doble con corrección de errores y una secuencia para hibridar un cebador universal para realizar una PCR universal antes de la secuenciación.
En algunas realizaciones, se preparan bibliotecas para un número de muestras que pueden combinarse para realizar la secuenciación. En consecuencia, en muchas de estas realizaciones, cada muestra tiene su propio código de barras con corrección de errores específico de muestra, que puede derivar de una PCR de injerto. Además, en algunas realizaciones, cada biblioteca de muestras comparte la misma secuencia o secuencias universales de hibridación de cebador de PCR, lo que permite amplificar las muestras combinadas en la misma reacción antes de la secuenciación. Y en algunas realizaciones, las muestras combinadas se secuencian en la misma reacción.
En algunas realizaciones, se potencian las bibliotecas para ayudar a detectar determinados elementos moleculares, tales como (por ejemplo), variantes de nucleótido único (SNV) en locus particulares del genoma. La potenciación puede ser necesaria con el fin de poder detectar elementos moleculares por encima del límite de detección, especialmente cuando los elementos moleculares son SNV raras y/o somáticas. En consecuencia, en algunas realizaciones, la secuenciación dirigida se realiza en bibliotecas preparadas. En muchas realizaciones, se utiliza hibridación de captura para extraer selectivamente moléculas de la biblioteca que tienen una secuencia particular (por ejemplo, una secuencia de locus genómicos de interés). En algunas realizaciones, se realiza hibridación de captura en una biblioteca para extraer moléculas de ADN con locus genómicos específicos con el fin de detectar características moleculares en aquellos locus mediante secuenciación. En algunas realizaciones, se realiza hibridación capturada en una biblioteca con el fin de detectar SNV raras y/o somáticas en locus genómicos conocidos por albergar SNV implicadas en cáncer y/o patología oncogénica. En algunas realizaciones, se realiza hibridación capturada en una biblioteca con el fin de detectar SNV raras y/o somáticas en locus genómicos conocidos por albergar SNV, detectadas en un resultado de secuenciación previo de una muestra tumoral.
Hibridación de captura
Algunas realizaciones utilizan técnicas de hibridación de captura para realizar la secuenciación dirigida. Cuando se realiza la secuenciación en ácidos nucleicos libres de células, con el fin de potenciar la resolución en locus genómicos particulares, los productos de bibliotecas pueden capturarse mediante hibridación antes de la secuenciación. La hibridación de captura puede ser particularmente útil cuando se trata de detectar variantes somáticas y/o variantes de estirpe germinal de una muestra en locus genómicos particulares. En algunas situaciones, la detección de variantes somáticas es indicativa de que la fuente de ácidos nucleicos, incluyendo los ácidos nucleicos derivados de un tumor u otra fuente neoplásica. En algunas situaciones, la identificación de variantes de estirpe germinal particulares que se asocian a la patogenia de la neoplasia puede respaldar la presencia de una neoplasia. En consecuencia, la hibridación de captura es una herramienta que puede potenciar la detección de ácidos nucleicos tumorales circulantes dentro de ácidos nucleicos libres de células.
En un aspecto, la presente divulgación proporciona un conjunto de cebos para la captura de hibridación, comprendiendo el conjunto de cebos al menos 1,2, 3, 4, 5, 6, 7, 8, 9, 10, 20, 30, 40, 50, 60, 70, 80, 90, 100, 200, 300, 400, 500, 600, 700, 800, 900, 1000, 1200, 1400, 1600, 1800, 2000, 2200, 2400, 2600, 2800, 3000, 3200, 3400, 3600, 3800, 4000, 4200, 4400, 4600, 4800 o 5000 sondas que contienen polinucleótidos diferentes, en donde las sondas que contienen polinucleótidos, colectivamente, están configuradas para hibridarse con ADNlc derivado de al menos el 5 % de las regiones genómicas expuestas en la Tabla 1.
Tabla 1. Locus genómicos de Lung-CliP (Genoma Humano, Construcción hg19 (GRCh37)).
(continuación)
(continuación)
(continuación)
(continuación)
(continuación)
(continuación)
(continuación)
(continuación)
(continuación)
(continuación)
(continuación)
En algunas realizaciones, una sonda que contiene polinucleótidos está configurada para hibridarse selectivamente con moléculas de ADN que son al menos parcialmente complementarias a al menos una porción de la sonda que contiene polinucleótidos. En algunas realizaciones, la porción es al menos el 10 %, al menos el 20 %, al menos el 30 %, al menos el 40 %, al menos el 50 %, al menos el 60 %, al menos el 70 %, al menos el 80 %, al menos el 90 %, al menos el 95 %, al menos el 98 % o al menos el 99 % de la sonda que contiene polinucleótidos. En algunas realizaciones, la porción es al menos 2, 3, 4, 5, 6, 7, 8, 9, 10, 15, 20, 25, 30, 35, 40, 45, 50, 55, 60, 65, 70, 75, 80, 85, 90, 95 o 100 nucleótidos consecutivos de la sonda que contiene polinucleótidos.
En algunas realizaciones, una sonda que contiene polinucleótidos está configurada para hibridarse con al menos el 10 %, al menos el 20 %, al menos el 30 %, al menos el 40 %, al menos el 50 %, al menos el 60 %, al menos el 70 %, al menos el 80 %, al menos el 90 %, al menos el 95 %, al menos el 98 % o al menos el 99 % de una secuencia diana dada (por ejemplo, una región genómica). En algunas realizaciones, una sonda que contiene polinucleótidos está configurada para hibridarse con toda la secuencia diana (por ejemplo, la región genómica).
En algunas realizaciones, cada una de las sondas que contienen polinucleótidos tiene una secuencia de ácido nucleico que tiene al menos 1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 20, 30, 40, 50, 60, 70, 80, 90, 100, 120, 140, 160, 180, 200, 220, 240, 260, 280 o 300 nucleótidos de longitud. En algunas realizaciones, cada una de las sondas que contienen polinucleótidos tiene una secuencia de ácido nucleico de no más de 300, 280, 260, 240, 220, 200, 180, 160, 140, 120, 100, 90, 80, 70, 60, 50, 40, 30, 20, 10, 9, 8, 7, 6, 5, 4, 3 o 2 nucleótidos de longitud. En algunas realizaciones, cada una de las sondas que contienen polinucleótidos está conjugada con un resto de afinidad. En algunas realizaciones, el resto de afinidad comprende biotina.
En algunas realizaciones, las sondas de polinucleótidos, colectivamente, están configuradas para hibridarse con ADNlc derivado de al menos el 10 %, al menos el 20 %, al menos el 30 %, al menos el 40 %, al menos el 50 %, al menos el 60 %, al menos el 70 %, al menos el 80 %, al menos el 90 %, al menos el 95 %, al menos el 98 %, al menos el 99 % o el 100 % de las regiones genómicas expuestas en la Tabla 1. En algunas realizaciones, la totalidad de las sondas polinucleotídicas del conjunto de cebos están configuradas para hibridarse con moléculas de ADNlc derivadas de al menos el 30 %, al menos el 40 %, al menos el 50 %, al menos el 60 %, al menos el 70 %, al menos el 80 %, al menos el 90 %, al menos el 95 % o el 100 % de las regiones genómicas expuestas en la Tabla 1.
En un aspecto, un método para realizar hibridación de captura puede comprender obtener una pluralidad de moléculas de ADN derivadas de una fuente de ADN libre de células; y mezclar una fracción de la pluralidad de moléculas de ADN con un conjunto de moléculas de cebo de captura. En algunas realizaciones, el conjunto de moléculas de cebo de captura está configurado para hibridarse selectivamente con moléculas de ADN que comprenden secuencias que comprenden al menos una porción de un locus genómico seleccionado del grupo de locus genómicos de la Tabla 1.
En algunas realizaciones, la porción del locus genómico comprende al menos 1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 20, 30, 40, 50, 60, 70, 80, 90, 100, 120, 140, 160, 180, 200, 220, 240, 260, 280 o 300 nucleótidos consecutivos del locus genómico. En algunas realizaciones, la fracción es de al menos aproximadamente el 5 %, 10 %, 15 %, 20 %, 25 %, 30 %, 35 %, 40 %, 45 %, 50 %, 55 %, 60 %, 65 %, 70 %, 75 %, 80 %, 85 %, 90 %, 95 % o 100 % de la pluralidad de moléculas de ADN.
En algunas realizaciones, el método comprende además optimizar una relación molar de la fracción de la pluralidad de moléculas de ADN y el conjunto de moléculas de cebo de captura para obtener una recuperación óptima de un número total de moléculas únicas o para obtener una recuperación óptima de un número total de moléculas de ADN libre de células dúplex en las que se secuencian ambas cadenas del dúplex de ADN libre de células obtenido, en donde la relación molar es al menos aproximadamente el 5 %, 10 %, 15 %, 20 %, 25 %, 30 %, 35 %, 40 %, 45 %, 50 %, 55 %, 60 %, 65 %, 70 %, 75 %, 80 %, 85 %, 90 %, 95 % o 100 %.
En algunas realizaciones, el método comprende además usar una simulación informática de la hibridación de captura para determinar la fracción de la pluralidad de moléculas de ADN que se mezcla con el conjunto de moléculas de cebo de captura, en donde la fracción no es superior a aproximadamente el 100 %, 95 %, 90 %, 85 %, 80 %, 75 %, 70 %, 65 %, 60 %, 55 %, 50 %, 45 %, 40 %, 35 %, 30 %, 25 %, 20 %, 15 %, 10 % o 5 %.
A través de análisis informático, se descubrió que el artefacto de secuenciación más común observado en los métodos de secuenciación basados en captura es la oxidación de la guanina (G) que se produce durante la etapa de captura de híbridos, que dio como resultado la transformación de guanina en 8-oxoguanina. Esta oxidaciónin vitrono intencionada puede dar como resultado una transversión G>T, que puede confundir los resultados de la secuenciación, especialmente cuando se buscan variantes polimórficas en una muestra. Se observa además que las transversiones G>T son un evento de mutagénesis común que se producein vivo,especialmente en una neoplasia o cáncer. Algunos agentes medioambientales (por ejemplo, la radiación UV, el humo del tabaco, los radicales libres) oxidan la guanina (G) provocando transversiones G>T y, por lo tanto, es posible que ya se haya producido una transversión G>T en la fuente biológica antes de la extracción (Fig. 4A-4B). En consecuencia, para mitigar la mutagénesisin vitrode confusión, se planteó la hipótesis de que una enzima y/o un antioxidante podrían prevenir la oxidación que se produce durante la captura de híbridos. Para someter a ensayo esta hipótesis, se utilizaron enzimas y/o eliminadores de especies reactivas de oxígeno (ROS) para ver qué eliminadores pueden evitar la formaciónin vitrode 8-oxoguanina durante la hibridación de captura. Las enzimas sometidas a ensayo incluían uracil-ADN glicosilasa (UDG), formamidopirimidina [fapy]-ADN glicosilasa (FPG) y enzima catalasa. Los antioxidantes analizados incluían glutatión, hipotaurina y sulfito de sodio. Se descubrió que estas enzimas y compuestos, especialmente la hipotaurina, mitigaron la formación de 8-oxoguanina durante la hibridación de captura (Fig. 4A-4B).
En algunas realizaciones, se incluye un antioxidante y/o una enzima durante un ensayo de captura de híbridos. En algunas de estas realizaciones, el antioxidante es la hipotaurina. Diversas realizaciones se refieren a métodos de hibridación de captura en los que se añade hipotaurina a la mezcla de reacción de hibridación. En muchas de estas realizaciones, se utiliza hipotaurina dentro de un protocolo de secuenciación para mitigar la detección de transversiones G>Tin vitroen el resultado de secuenciación que se producen durante la preparación de la secuenciación. En consecuencia, en algunas realizaciones, se utiliza hipotaurina para capturar moléculas de ADN particulares que después se usan para una reacción de secuenciación.
Detección de ácidos nucleicos tumorales circulantes de ácidos nucleicos libres de células
Algunas realizaciones se refieren a la utilización de modelos computacionales para determinar si una muestra de ácido nucleico libre de células incluye ácidos nucleicos tumorales circulantes. En algunas realizaciones, se analizan SNV y/o CNV dentro de un resultado de secuenciación de una muestra de ácido nucleico libre de células mediante modelos computacionales para determinar si las SNV y/o CNV derivan de ácidos nucleicos tumorales circulantes. En algunas realizaciones, se entrenan modelos computacionales con muestras de ácidos nucleicos derivadas de pacientes con cáncer y de individuos no afectados.
En algunas realizaciones, se utiliza un modelo computacional para detectar ácidos nucleicos tumorales circulantes basándose en las SNV dentro de lecturas de secuenciación derivadas del resultado de secuenciación de ácidos nucleicos libres de células. En muchas realizaciones, se utiliza un modelo computacional para detectar ácidos nucleicos tumorales circulantes basándose en las CNV basadas en las lecturas de secuenciación derivadas del resultado de secuenciación de ácidos nucleicos libres de células. En algunas realizaciones, un modelo computacional considera la posición genómica de una lectura de secuenciación. En algunas realizaciones, un modelo computacional contempla una puntuación de riesgo poligénico (PRS, por sus siglas en inglés) derivada de un resultado de secuenciación. En diversas realizaciones, un modelo computacional produce una puntuación de confianza indicativa de la probabilidad de que el resultado de secuenciación de ácidos nucleicos libres de células incluya secuencias de ácidos nucleicos tumorales circulantes. En algunas realizaciones, se utiliza un clasificador que combina las puntuaciones de confianza de diversos módulos computacionales para clasificar resultados de secuenciación de ácidos nucleicos libres de células basándose en su probabilidad de contener ácidos nucleicos tumorales circulantes. En algunas realizaciones, los módulos computacionales se combinan, se organizan en niveles, se anidan, se utilizan secuencialmente, se utilizan en tándem o cualquier combinación de los mismos.
En diversas realizaciones, un modelo computacional se entrena utilizando resultados de secuenciación de ácidos nucleicos extraídos directamente de células cancerosas (por ejemplo, del tumor del paciente), que pueden utilizarse para identificar los resultados positivos verdaderos. En algunas realizaciones, un modelo computacional se entrena utilizando resultados de secuenciación de ácidos nucleicos extraídos de otra fuente hospedadora (por ejemplo, células hematopoyéticas), que puede utilizarse para identificar resultados positivos falsos. En algunas realizaciones, los resultados de secuenciación de ácidos nucleicos extraídos de células hematopoyéticas se utilizan para eliminar las variantes de confusión que con frecuencia están presentes en los ácidos nucleicos libres de células, tales como las variantes que surgen de la hematopoyesis clonal (CH, por sus siglas en inglés). En algunas realizaciones, la longitud del fragmento de ácido nucleico libre de células se utiliza como característica, ya que se ha descubierto que las moléculas de ADNlc que albergan mutaciones derivadas de tumores tienen distribuciones de tamaños de fragmentos distintas en comparación con las moléculas que albergan mutaciones no derivadas de tumores.
En muchas realizaciones, se utiliza un modelo computacional para detectar ácidos nucleicos tumorales circulantes específicamente para la detección de un tipo de cáncer particular. En algunos casos, un modelo de detección específico de cáncer puede utilizar características específicas de ese cáncer particular, que pueden proporcionar una mejor predicción. Por ejemplo, dentro de un modelo pueden utilizarse SNV y/o CNV que se producen dentro de "puntos críticos" de locus genómicos que se sabe que se producen en un cáncer particular. En algunos casos, los "puntos críticos" son genes impulsores oncogénicos. En otro ejemplo, para la detección del cáncer de pulmón pueden utilizarse SNV y/o CNV que son coherentes con un distintivo mutacional de tabaquismo. Pueden construirse modelos para algunos cánceres, incluyendo (pero sin limitación) la leucemia linfoblástica aguda (LLA), leucemia mieloide aguda (LMA), cáncer de ano, astrocitomas, carcinoma basocelular, cáncer del conducto biliar, cáncer de vejiga, cáncer de mama, cáncer de cuello del útero, leucemia linfocítica crónica (LLC) y leucemia mielógena crónica (LMC), neoplasias mieloproliferativas crónicas, cáncer colorrectal, cáncer de endometrio, ependimoma, cáncer de esófago, estesioneuroblastoma, sarcoma de Ewing, cáncer de las trompas de Falopio, cáncer de vesícula biliar, cáncer gástrico, tumor carcinoide gastrointestinal, tricoleucemia, cáncer hepatocelular, linfoma de Hodgkin, cáncer hipofaríngeo, sarcoma de Kaposi, cáncer de riñón, histiocitosis de células de Langerhans, cáncer de laringe, leucemia, cáncer de hígado, cáncer de pulmón, linfoma, melanoma, cáncer de células de Merkel, mesotelioma, cáncer de boca, neuroblastoma, linfoma no Hodgkin, cáncer de pulmón no microcítico, osteosarcoma, cáncer de ovario, cáncer de páncreas, tumores neuroendocrinos pancreáticos, cáncer faríngeo, tumor de la pituitaria, cáncer de próstata, cáncer de recto, cáncer de células renales, retinoblastoma, cáncer de piel, cáncer de pulmón microcítico, cáncer de intestino delgado, cáncer de cuello escamoso, linfoma de linfocitos T, cáncer de testículo, timoma, cáncer de tiroides, cáncer de útero, cáncer de vagina y tumores vasculares. Debe observarse, sin embargo, que pueden construirse modelos computacionales para detectar ácidos nucleicos tumorales circulantes para el análisis pancanceroso (por ejemplo, detectar el cáncer en general, no el subtipo específico).
En la Fig. 5 se proporciona un proceso para construir y utilizar modelos computacionales para detectar moléculas de ácidos nucleicos tumorales circulantes dentro de ácidos nucleicos libres de células utilizando resultados de secuenciación. El proceso 500 puede comenzar obteniendo (501) resultados de secuenciación de ácidos nucleicos libres de células. Puede utilizarse cualquier resultado de secuenciación adecuado. En algunas realizaciones, se extrae una biopsia líquida o de residuos de un individuo, se procesan los ácidos nucleicos libres de células de esa biopsia y después se secuencian. En algunas realizaciones, también se utilizan resultados de secuenciación derivados de células cancerosas (por ejemplo, tumores) y/o fuentes de confusión (por ejemplo, células hematopoyéticas), especialmente para el entrenamiento de modelos.
El proceso 500 utiliza opcionalmente (503) un módulo de variante de nucleótido único somática para determinar si una variante dentro de un resultado de secuenciación de ácidos nucleicos libres de células deriva de ácidos nucleicos tumorales circulantes. Las SNV somáticas son muy frecuentes en los ácidos nucleicos derivados de células neoplásicas y, por lo tanto, son comunes en los ácidos nucleicos tumorales circulantes. En consecuencia, la detección de SNV somáticas en un resultado de secuenciación de ácidos nucleicos libres de células proporciona una indicación de que la fuente de la SNV procede de tejido neoplásico.
Aunque las SNV somáticas con frecuencia derivan de tejido neoplásico, las SNV somáticas detectadas con frecuencia pueden surgir debido a razones distintas del crecimiento neoplásico, incluyendo (pero sin limitación) el envejecimiento natural, la hematopoyesis clonal y otras fuentes inocuas. Por lo tanto, es beneficioso utilizar un sistema capaz de predecir con precisión si una SNV detectada deriva de una fuente neoplásica. En algunas realizaciones, se utiliza un modelo computacional para proporcionar una indicación de si una SNV detectada en un resultado de secuenciación de ácidos nucleicos libres de células deriva realmente de moléculas de ácidos nucleicos tumorales circulantes.
Algunas realizaciones se refieren a la llamada de variantes y al filtrado de variantes llamadas derivadas de moléculas de ácidos nucleicos tumorales circulantes, que pueden realizarse antes del análisis computacional de las variantes. En algunas realizaciones, se eliminan las variantes de la estirpe germinal, que pueden identificarse utilizando un resultado de secuenciación de otra fuente hospedadora (por ejemplo, células hematopoyéticas). En algunas realizaciones, se eliminan las variantes en posiciones de profundidad baja (por ejemplo, < 50 % de la mediana de profundidad) y las que están en regiones de repetición, intrónicas, intergénicas o pseudogénicas. En algunas realizaciones, se eliminan las variantes que caen en regiones con poca unicidad o mapeabilidad. En algunas realizaciones, se eliminan las variantes con una frecuencia alélica poblacional > 0,1 % identificadas por una base de datos adecuada (por ejemplo, la base de datos gnomAD). En algunas realizaciones, se eliminan los artefactos de fondo recurrentes. En algunas realizaciones, se eliminan las variantes auténticas (por ejemplo, variante con un valorPde índice de detección < 0,10) presentes en una fuente hospedadora emparejada (por ejemplo, células hematopoyéticas). En algunas realizaciones, se eliminan las variantes en genes canónicamente asociados a la hematopoyesis clonal (CH). Los genes CH incluyen (pero sin limitación)DNMT3A, TET2, ASXL1, PPM1D, GNB1, CBL, JAK2, STAT3, GNAS, MYD88ySF3B1.En algunas realizaciones, las variantes eliminadas se rescatan si se ha observado que están implicadas en el cáncer. En algunas realizaciones, las variantes eliminadas se rescatan si existen dentro de un gen que se ha observado que está implicado en el cáncer.
En algunas realizaciones, se utiliza un modelo computacional para distinguir las variantes con adjudicación tumoral de las variantes sin adjudicación (por ejemplo, detectar si las variantes derivan de tejido canceroso). En diversas realizaciones, un modelo computacional utiliza entrenamiento supervisado, semisupervisado o no supervisado, que puede incluir el uso de datos del paciente que incluyan el resultado de secuenciación de ácidos nucleicos libres de células y el resultado de secuenciación del tumor emparejado. En muchas realizaciones, se utiliza un modelo de regresión para distinguir las variantes con adjudicación tumoral de las variantes sin adjudicación. Puede utilizarse cualquier modelo de regresión adecuado, incluyendo (pero sin limitación) regresión lineal, regresión de red elástica, regresión logística, regresión polinómica, regresión por etapas, regresiónridge(con regularización), regresión LASSO y cualquier modelo de regresión combinado. En algunas realizaciones, se entrena un modelo de regresión logística de red elástica semisupervisada para distinguir las variantes con adjudicación tumoral de las variantes sin adjudicación en muestras sin muestras tumorales emparejadas. En algunas realizaciones, se asigna una puntuación a cada SNV detectada, lo que indica una confianza en que la SNV deriva de una fuente neoplásica. En algunas realizaciones, las características para un modelo de entrenamiento pueden identificarse y definirse utilizando un análisis con información del tumor en el que a los pacientes se les analizan tanto sus ácidos nucleicos libres de células como sus ácidos nucleicos derivados de tumor (por ejemplo, derivados directamente de la biopsia tumoral). En algunas de estas realizaciones, se usa un modelo de aprendizaje para aprender características de la variante que derivan de células neoplásicas y usar estas características para asignar un marcador y una puntuación de confianza de que la variante deriva de células neoplásicas. En algunas realizaciones, las puntuaciones de confianza dentro de una muestra se combinan, se suman, se promedian, se ponderan o se resumen de otro modo para proporcionar una puntuación resumida de la muestra, indicando la probabilidad de que la muestra contenga moléculas de ácido nucleico tumoral circulante.
En algunas realizaciones, un modelo para identificar SNV derivadas de moléculas de ácidos nucleicos tumorales circulantes integra características biológicas y técnicas que son específicas de cada variante individual, incluyendo (pero sin limitación) la frecuencia de fondo de la variante, el tamaño del fragmento de la molécula de ácido nucleico libre de células, los distintivos de variantes comunes a una fuente particular, la presencia en locus genómicos (por ejemplo, genes oncogénicos) frecuentemente mutados en el cáncer (o en un tipo de cáncer particular), la probabilidad de que la variante derive de CH y si la presencia de la mutación puede o no evaluarse con confianza en las células hematopoyéticas del hospedador con respecto a la VAF de la variante en el ADNlc y la profundidad posicional en las células hematopoyéticas. En la Fig. 6 se proporciona un conjunto de ejemplo de características del modelo utilizadas para determinar si una SNV particular deriva de moléculas de ácidos nucleicos tumorales circulantes y su contribución al modelo. Este conjunto de ejemplo de características incluye el fondo bayesiano de GB, el fondo bayesiano de ADNlc, la frecuencia alélica de la variante (% de VAF), la profundidad de estirpe germinal, el tamaño medio de la familia de códigos de barras, la puntuación de fragmento corto 1, la puntuación de fragmento corto 2, la transición/transversión, el respaldo de dúplex, la superación de valores atípicos, la calidad de mapeo, el punto crítico de cáncer, el error de UMI corregido, la calidad Phred y la posición de la variante en la lectura. Para consultar más detalles sobre estas funciones, véase la sección Realizaciones de ejemplo. Aunque este conjunto de ejemplo de características se desarrolló específicamente para identificar ADNtc en el cáncer de pulmón no microcítico (CPNM), también puede usarse el mismo conjunto de características, y/o uno similar, en modelos para el cáncer generalizado u otros cánceres específicos. En consecuencia, diversas realizaciones utilizan un modelo para detectar ácidos nucleicos tumorales circulantes basado en la identificación de SNV que integran una o más de las siguientes características: fondo bayesiano de ADN derivado de células, fondo bayesiano de ADNlc, frecuencia alélica de la variante (% de VAF), profundidad de estirpe germinal, tamaño medio de la familia de códigos de barras, puntuación de fragmento corto 1, puntuación de fragmento corto 2, transición/transversión, respaldo de dúplex, superación de valores atípicos, calidad de mapeo, punto crítico de cáncer, error de UMI corregido, calidad Phred y posición de la variante en la lectura. En algunas realizaciones, un modelo incorpora dos o más de estas características. En algunas realizaciones, un modelo incorpora tres o más de estas características. En algunas realizaciones, un modelo incorpora cuatro o más de estas características. En algunas realizaciones, un modelo incorpora cinco o más de estas características. En algunas realizaciones, un modelo incorpora seis o más de estas características. En algunas realizaciones, un modelo incorpora siete o más de estas características. En algunas realizaciones, un modelo incorpora ocho o más de estas características. En algunas realizaciones, un modelo incorpora nueve o más de estas características. En algunas realizaciones, un modelo incorpora diez o más de estas características. En algunas realizaciones, un modelo incorpora once o más de estas características. En algunas realizaciones, un modelo incorpora doce o más de estas características. En algunas realizaciones, un modelo incorpora trece o más de estas características. En algunas realizaciones, un modelo incorpora catorce o más de estas características. En algunas realizaciones, un modelo incorpora estas quince características.
Volviendo a la Fig. 5, el proceso 500 utiliza opcionalmente (505) un módulo de variación de copias para determinar si las variaciones del número de copias (CNV) dentro de un resultado de secuenciación de ácidos nucleicos libres de células deriva de moléculas de ácidos nucleicos tumorales circulantes. Las CNV somáticas son muy comunes en las células neoplásicas, y por lo tanto pueden utilizarse para detectar ácidos nucleicos tumorales circulantes. En consecuencia, la detección de CNV somáticas en un resultado de secuenciación de ácidos nucleicos libres de células proporciona una indicación de que la fuente de la CNV procede de tejido neoplásico. Aunque las CNV somáticas con frecuencia derivan de tejido neoplásico, las CNV somáticas detectadas con frecuencia pueden surgir debido a razones distintas del crecimiento neoplásico, incluyendo (pero sin limitación) el envejecimiento natural, la hematopoyesis clonal y otras fuentes inocuas. Por lo tanto, es beneficioso utilizar un sistema capaz de predecir con precisión si una CNV detectada deriva de una fuente neoplásica. En algunas realizaciones, se utiliza un modelo computacional para proporcionar una indicación de si una CNV detectada en un resultado de secuenciación de ácidos nucleicos libres de células deriva realmente de moléculas de ácidos nucleicos tumorales circulantes.
En algunas realizaciones, las CNV son susceptibles de ser detectadas a partir de resultados de secuenciación dirigida (por ejemplo, resultados de secuenciación sin cobertura completa del genoma o del exoma). En muchas realizaciones, el número de copias se examina en un conjunto de ventanas distribuidas uniformemente (por ejemplo, ventanas de 5 MB) por todo el genoma. En muchas realizaciones, el número de copias se examina en un conjunto de "puntos críticos" de locus genómicos que se sabe que presentan alteraciones del número de copias en el cáncer. En algunas realizaciones, se utiliza GISTIC2.0 para identificar "puntos críticos" de locus genómicos (para más información sobre GISTIC2.0, véase C. H. Mermel,et al., Genome Biol.12, 1-14 (2011)). En algunas realizaciones, se aplican filtros para eliminar el ruido de fondo. En algunas realizaciones, se aplican filtros para eliminar eventos de número de copias constitutivas o derivados de CH.
En diversas realizaciones, el número de regiones de ventana distribuidas uniformemente y las regiones de "punto crítico" de GISTIC se usan como características en un modelo de número de copias junto con una tercera característica que capta si hay enriquecimiento para regiones que se sabe que están alteradas de forma recurrente en el número de copias en el cáncer (por ejemplo, GISTIC) en comparación con las ventanas uniformes. En algunas realizaciones, el modelo computacional produce una puntuación de confianza de que un resultado de secuenciación de ácidos nucleicos libres de células incluya secuencias de ácidos nucleicos tumorales circulantes, basado en la detección de CNV somáticas.
El proceso 500 opcionalmente también utiliza (507) un módulo de lectura de posición genómica para determinar si las lecturas de secuenciación que tienen posiciones genómicas particulares de un resultado de secuenciación de ácidos nucleicos libres de células derivan de moléculas de ácidos nucleicos tumorales circulantes. Ahora se entiende que las posiciones genómicas de los dos primeros y los dos últimos nucleótidos del ADN tumoral circulante son diferentes de las posiciones genómicas del ADN libre de células no tumoral. En diversas realizaciones, la posición genómica de una molécula de ADN libre de células puede utilizarse para distinguir los ácidos nucleicos tumorales circulantes del ADN libre de células no tumoral. En algunas realizaciones, la posición genómica de los nucleótidos primero y último de una molécula de ADN libre de células puede utilizarse para distinguir los ácidos nucleicos tumorales circulantes del ADN libre de células no tumoral. En algunas realizaciones, las posiciones genómicas del ADN tumoral circulante se diferencian de las posiciones genómicas del ADN libre de células no tumoral con una resolución de un único par de bases. En algunas realizaciones, la posición genómica de la primera y/o última base de una lectura de secuenciación se determina y cuantifica, revelando un recuento de lecturas que tienen una localización genómica particular. En algunas realizaciones, el recuento de lecturas se normaliza (por ejemplo, recuentos por millón de lecturas).
En algunas realizaciones, la posición genómica de las lecturas de secuenciación se utilizan dentro de un clasificador u otro modelo computacional para determinar si un resultado de secuenciación contiene lecturas derivadas de ADN tumoral circulante. En muchas de estas realizaciones, se entrena un clasificador u otro modelo computacional usando resultados de secuenciación de ácidos nucleicos libres de células de pacientes con cáncer y controles. Para más información sobre la utilización de una posición genómica de molécula libre de células para identificar ácidos nucleicos tumorales circulantes, véase el Ejemplo 2 en la sección "Realizaciones de ejemplo".
El proceso 500 opcionalmente también utiliza (509) un módulo de puntuación de riesgo poligénico (PRS, por sus siglas en inglés) para determinar si las variantes de estirpe germinal dentro de un resultado de secuenciación significan un riesgo de cáncer en un individuo. Diversos estudios han determinado que algunas variantes de estirpe germinal son más comunes en diversos cánceres (véase J. Dai,et al., Lancet Respir. Med.7, 881-891 (2019); J. L. Weissfeld,et al., J Thorac. Oncol.10, 1538-1545 (2015); y D. C. Qian,et al., Cáncer Epidemiol. Biomarkers Prev.25, 1208-1215 (2016)). La identificación de variantes particulares en un resultado de secuenciación puede utilizarse para calcular una PRS, proporcionando una probabilidad de que un individuo desarrolle cáncer. En consecuencia, puede utilizarse una PRS junto con el análisis de secuenciación de ácidos nucleicos libres de células para respaldar adicionalmente la identificación de ácidos nucleicos tumorales circulantes. Dicho de otro modo, la PRS puede utilizarse junto con, al mismo tiempo que o dentro de un modelo computacional para detectar ácidos nucleicos tumorales circulantes. Para más información sobre cómo calcular una PRS, véase J. Dai,et al.(2019), J. L. Weissfeld,et al.(2015) y D. C. Qian,et al.(2016), citado anteriormente.
Puede utilizarse cualquier resultado de secuenciación adecuado para determinar una PRS, incluyendo (pero sin limitación) la secuenciación de ácidos nucleicos libres de células, la secuenciación de todo el genoma, la secuenciación del exoma, la secuenciación dirigida y la secuenciación de ARN. Para realizar la secuenciación dirigida, pueden utilizarse sondas que se dirijan específicamente a locus que abarquen la ubicación de variantes que se utilizan para calcular una PRS. En algunas realizaciones, la secuenciación dirigida se realiza en moléculas de ácido nucleico libre de células para determinar una PRS.
El Proceso 500 también utiliza opcionalmente (511) un módulo para identificar motivos nucleasa al inicio y/o al final de moléculas de ácido nucleico libre de células. Ahora se entiende que las secuencias al inicio y/o al final de las moléculas de ADNlc, normalmente (pero no necesariamente) las secuencias de 1-4 pb primera y/o última de las moléculas de ADNlc, pueden usarse para saber qué nucleasas particulares digirieron el fragmento de ADNlc. Ha de entenderse que las secuencias identificadas pueden utilizarse para deducir el sitio de reconocimiento completo de nucleasas, incluyendo cualquier secuencia que se haya escindido de la molécula de ADNlc. En algunas realizaciones, la porción escindida de un motivo (por ejemplo, una secuencia de 1 -4 pb genómicamente adyacente) que puede inferirse a partir de la posición genómica inicial y/o final de la molécula de ADNlc puede usarse para informar qué nucleasas particulares digirieron el fragmento de ADNlc. Además, en muchos casos, diversas nucleasas se asocian estereotipadamente a células y/o tejidos particulares. (L. Serpas,et al., Proc. Natl. Acad. Sci. U.S.A.116, 641-649 (2019); y D. S. C. Han,et al., Am. J. Hum. Genet.106, 202-214 (2020)). En consecuencia, en algunas realizaciones, se usa un sitio de reconocimiento de nucleasas (por ejemplo, un motivo) para proporcionar una indicación del origen celular y/o tisular de una molécula de ADNlc (por ejemplo, un motivo que indica el origen celular pulmonar o el origen tumoral). En muchas realizaciones, las frecuencias de motivos de ADNlc pueden determinarse a partir de un resultado de secuenciación, que, a su vez, puede utilizarse para calcular la probabilidad de que un individuo padezca cáncer. En consecuencia, pueden utilizarse frecuencias de motivo junto con el análisis de secuenciación de ácidos nucleicos libres de células para respaldar adicionalmente la identificación de ácidos nucleicos tumorales circulantes. Debe entenderse que las frecuencias de motivos de nucleasas pueden utilizarse junto con, al mismo tiempo que o dentro de un modelo computacional para detectar ácidos nucleicos tumorales circulantes.
El proceso 500 integra (513) los resultados de uno o más módulos dentro de un clasificador que clasifica un resultado de secuenciación de ácidos nucleicos libres de células. En consecuencia, en algunas realizaciones, un clasificador que incorpora puntuaciones de confianza derivadas de los diversos módulos para producir una puntuación de confianza global de que un resultado de secuenciación de ácidos nucleicos libres de células incluye secuencias de ácidos nucleicos tumorales circulantes. En muchas realizaciones, el clasificador utilizado es uno de los siguientes: 5 vecinos más cercanos (5NN), 3NN, Bayes sin exposición, regresión logística, árbol de decisión o cualquier combinación de los mismos. En algunas realizaciones, se utiliza un clasificador conjunto en el que se utilizan dos o más clasificadores. En algunas realizaciones, se utiliza un clasificador conjunto en el que se utilizan tres o más clasificadores. En algunas realizaciones, se utiliza un clasificador conjunto en el que se utilizan cuatro o más clasificadores. En algunas realizaciones, se utiliza un clasificador conjunto en el que se utilizan cinco o más clasificadores. En muchas realizaciones, elbagging(agregación por remuestreo) de muestras se realiza m remuestreobootstrapde las muestras. En algunas realizaciones, cada clasificación utilizada se penaliza de acuerdo con su variación en la etapa debagging.Y en algunas realizaciones, se produce una puntuación resumida de los clasificadores. Las puntuaciones pueden sumarse, promediarse o combinarse de cualquier manera adecuada.
Basándose en una puntuación final, una muestra de ácido nucleico libre de células puede clasificarse como positiva por contener secuencias de ácidos nucleicos tumorales circulantes.
En diversas realizaciones, los modelos computacionales pueden validarse utilizando una validación por partición simple, cruzada en K particiones o cruzada por exclusión de un caso. En algunas realizaciones, se utiliza una cohorte de validación para validar los modelos computacionales.
En algunas realizaciones, la sensibilidad, la especificidad y el área bajo la curva (AUC, por sus siglas en inglés) pueden modificarse para conseguir el rendimiento deseado. En algunos casos, puede desearse una mayor especificidad para garantizar una detección robusta de los ácidos nucleicos tumorales circulantes. En algunos casos, se desea una mayor sensibilidad para que el límite de detección sea más bajo, disminuyendo el número de resultados positivos verdaderos no obtenidos. En consecuencia, en diversas realizaciones, la especificidad se fija en uno de: 70 %, 75 %, 80 %, 85 %,
90 %, 95 %, 98 %, 100 % o un porcentaje intermedio.
Aunque se han descrito anteriormente ejemplos específicos de procesos para la construcción de modelos de variantes de nucleótido único, modelos de variación del número de copias, modelos de lectura de posición genómica, PRS y clasificadores integrados, diversas operaciones del proceso pueden realizarse en distintos órdenes y determinadas operaciones pueden ser opcionales. Por ejemplo, los distintos SNV, CNV o módulos de lectura de posición genómica pueden utilizarse por sí solos para determinar si una muestra de ácido nucleico libre de células contiene secuencias de ácidos nucleicos tumorales circulantes. Por ello, diversas operaciones del proceso pueden usarse según sea adecuado para los requisitos de aplicaciones específicas. Además, puede utilizarse cualquiera de una diversidad de procesos para construir modelos de variantes de nucleótido único, modelos de variación del número de copias, modelos de lectura de posición genómica, PRS y clasificadores integrados adecuados a los requisitos de una aplicación dada. Pueden combinarse o utilizarse otros sistemas de clasificación para detectar el cáncer en un individuo además de cualquiera de los modelos descritos en el presente documento.
Algunas realizaciones se refieren a la utilización de modelos computacionales para determinar si un individuo tiene cáncer. En muchas realizaciones, un método para determinar si un individuo tiene cáncer es el siguiente:
(a) extraer biopsia líquida o de residuos de un individuo
(b) secuenciar ácidos nucleicos libres de células y otras fuentes hospedadoras (por ejemplo, GB)
(c) utilizar los resultados de secuenciación en uno o más modelos computacionales para detectar secuencias de ácidos nucleicos tumorales circulantes en el resultado de secuenciación de ácidos nucleicos libres de células
Ha de entenderse que cualquiera de los modelos computacionales descritos en el presente documento puede utilizarse solo o en combinación. En consecuencia, en algunas realizaciones, se utilizan modelos de SNV para proporcionar una indicación de si un individuo tiene cáncer. En algunas realizaciones, se utilizan modelos de CNV para proporcionar una indicación de si un individuo tiene cáncer. En algunas realizaciones, se utilizan modelos de lectura de posición genómica para proporcionar una indicación de si un individuo tiene cáncer. En algunas realizaciones, se integran diversas SNV, CNV y/o modelos de lectura de posición genómica en un clasificador para clasificar a un individuo como que tiene cáncer.
En diversas realizaciones, se utilizan modelos computacionales para proporcionar la detección precoz del cáncer. En algunas realizaciones, un modelo computacional puede detectar el cáncer en individuos que tienen cáncer en estadio I, II o III. En algunas realizaciones, se utilizan modelos computacionales para detectar el cáncer residual en individuos después del tratamiento del cáncer.
Intervenciones clínicas
Diversas realizaciones se refieren a utilizar la detección del cáncer para realizar intervenciones clínicas. En algunas realizaciones, un individuo tiene una biopsia líquida o de residuos examinada y procesada mediante los métodos descritos en el presente documento para indicar que el individuo tiene cáncer y, por lo tanto, ha de realizarse una intervención. Las intervenciones clínicas incluyen procedimientos y tratamientos clínicos. Los procedimientos clínicos incluyen (pero sin limitación) análisis de sangre, formación de imágenes médicas, exámenes físicos y biopsias tumorales. Los tratamientos incluyen (pero sin limitación) quimioterapia, radioterapia, inmunoterapia, terapia hormonal, terapia farmacológica dirigida y vigilancia médica. En algunas realizaciones, se realizan diagnósticos para determinar el estadio particular del cáncer. En algunas realizaciones, una persona es evaluada y/o tratada por un profesional médico, tal como un/a médico/a, enfermero/a, dietista o similar.
Detección del cáncer para la intervención clínica
En algunas realizaciones como se describen en el presente documento puede detectarse un cáncer utilizando un resultado de secuenciación de ácidos nucleicos libres de células derivados de sangre, suero, líquido cefalorraquídeo, líquido linfático, orina o heces. En algunas realizaciones, se secuencia otra fuente hospedadora (por ejemplo, células hematopoyéticas) para proporcionar una determinación más sólida de si el resultado de secuenciación de los ácidos nucleicos libres de células incluye secuencias de ácidos nucleicos tumorales circulantes. El uso de células hematopoyéticas para la secuenciación puede ayudar a identificar y eliminar señales de confusión, tales como CNV y SNV somáticas derivadas del envejecimiento natural, la hematopoyesis clonal y otras fuentes inocuas. Diversas realizaciones utilizan un antioxidante (por ejemplo, hipotaurina) durante la captura de híbridos en realizaciones que realizan secuenciación dirigida. Además, algunas realizaciones utilizan modelos computacionales, incluyendo las descritas en el presente documento, para determinar si un resultado de secuenciación de ácidos nucleicos libres de células incluye secuencias de ácidos nucleicos tumorales circulantes basándose en una puntuación de confianza proporcionada por el modelo computacional. En consecuencia, en algunas realizaciones, se extraen, se procesan y se secuencian ácidos nucleicos libres de células, y el resultado de secuenciación se analiza para detectar el cáncer. Este proceso es especialmente útil en un entorno clínico para proporcionar una exploración diagnóstica.
Un procedimiento de ejemplo para una exploración diagnóstica de un individuo es de la siguiente manera:
(a) extraer biopsia líquida o de residuos de un individuo
(b) preparar y secuenciar ácidos nucleicos libres de células y una fuente hospedadora (por ejemplo, GB) (c) utilizar los resultados de secuenciación en uno o más modelos computacionales para detectar secuencias de ácidos nucleicos tumorales circulantes en el resultado de secuenciación de ácidos nucleicos libres de células (d) realizar una intervención clínica basándose en la detección de secuencias de ácidos nucleicos tumorales circulantes
En diversas realizaciones, pueden realizarse exploraciones diagnósticas para cualquier tipo de neoplasia, incluyendo (pero sin limitación) la leucemia linfoblástica aguda (LLA), leucemia mieloide aguda (LMA), cáncer de ano, astrocitomas, carcinoma basocelular, cáncer del conducto biliar, cáncer de vejiga, cáncer de mama, cáncer de cuello del útero, leucemia linfocítica crónica (LLC) y leucemia mielógena crónica (LMC), neoplasias mieloproliferativas crónicas, cáncer colorrectal, cáncer de endometrio, ependimoma, cáncer de esófago, estesioneuroblastoma, sarcoma de Ewing, cáncer de las trompas de Falopio, cáncer de vesícula biliar, cáncer gástrico, tumor carcinoide gastrointestinal, tricoleucemia, cáncer hepatocelular, linfoma de Hodgkin, cáncer hipofaríngeo, sarcoma de Kaposi, cáncer de riñón, histiocitosis de células de Langerhans, cáncer de laringe, leucemia, cáncer de hígado, cáncer de pulmón, linfoma, melanoma, cáncer de células de Merkel, mesotelioma, cáncer de boca, neuroblastoma, linfoma no Hodgkin, cáncer de pulmón no microcítico, osteosarcoma, cáncer de ovario, cáncer de páncreas, tumores neuroendocrinos pancreáticos, cáncer faríngeo, tumor de la pituitaria, cáncer de próstata, cáncer de recto, cáncer de células renales, retinoblastoma, cáncer de piel, cáncer de pulmón microcítico, cáncer de intestino delgado, cáncer de cuello escamoso, linfoma de linfocitos T, cáncer de testículo, timoma, cáncer de tiroides, cáncer de útero, cáncer de vagina y tumores vasculares.
En algunas realizaciones, se utilizan exploraciones diagnósticas para proporcionar la detección precoz del cáncer. En algunas realizaciones, las exploraciones diagnósticas pueden detectar el cáncer en individuos que tienen cáncer en estadio I, II o III. En algunas realizaciones, se utilizan exploraciones diagnósticas para detectar el cáncer residual en las personas después del tratamiento del cáncer.
Diagnósticos y tratamientos del cáncer
Algunas realizaciones se refieren a realizar una exploración diagnóstica en ácidos nucleicos libres de células de un individuo y, después, basándose en los resultados de la exploración, indicar la presencia de cáncer, realizar otros procedimientos clínicos y/o tratar al individuo.
En algunas realizaciones, pueden detectarse numerosos tipos de neoplasias, incluyendo (pero sin limitación) la leucemia linfoblástica aguda (LLA), leucemia mieloide aguda (LMA), cáncer de ano, astrocitomas, carcinoma basocelular, cáncer del conducto biliar, cáncer de vejiga, cáncer de mama, cáncer de cuello del útero, leucemia linfocítica crónica (LLC) y leucemia mielógena crónica (LMC), neoplasias mieloproliferativas crónicas, cáncer colorrectal, cáncer de endometrio, ependimoma, cáncer de esófago, estesioneuroblastoma, sarcoma de Ewing, cáncer de las trompas de Falopio, cáncer de vesícula biliar, cáncer gástrico, tumor carcinoide gastrointestinal, tricoleucemia, cáncer hepatocelular, linfoma de Hodgkin, cáncer hipofaríngeo, sarcoma de Kaposi, cáncer de riñón, histiocitosis de células de Langerhans, cáncer de laringe, leucemia, cáncer de hígado, cáncer de pulmón, linfoma, melanoma, cáncer de células de Merkel, mesotelioma, cáncer de boca, neuroblastoma, linfoma no Hodgkin, cáncer de pulmón no microcítico, osteosarcoma, cáncer de ovario, cáncer de páncreas, tumores neuroendocrinos pancreáticos, cáncer faríngeo, tumor de la pituitaria, cáncer de próstata, cáncer de recto, cáncer de células renales, retinoblastoma, cáncer de piel, cáncer de pulmón microcítico, cáncer de intestino delgado, cáncer de cuello escamoso, linfoma de linfocitos T, cáncer de testículo, timoma, cáncer de tiroides, cáncer de útero, cáncer de vagina y tumores vasculares.
En algunas realizaciones, una vez indicado el diagnóstico de crecimiento neoplásico, pueden realizarse algunos procedimientos diagnósticos de seguimiento, incluyendo (pero sin limitación) examen físico, formación de imágenes médicas, mamografía, endoscopia, muestreo de heces, prueba de Papanicolaou, análisis de sangre de alfafetoproteína, prueba de CA-125, prueba de antígeno específico de la próstata (PSA, por sus siglas en inglés), extracción de biopsia, aspiración de médula ósea y pruebas de detección de marcadores tumorales. La formación de imágenes médicas incluye (pero sin limitación) rayos X, la formación de imágenes de resonancia magnética (MRI, por sus siglas en inglés), tomografía computarizada (CT, por sus siglas en inglés), ecografía y tomografía por emisión de positrones (PET, por sus siglas en inglés). La endoscopia incluye (pero sin limitación) broncoscopia, colonoscopia, colposcopia, cistoscopia, esofagoscopia, gastroscopia, laparoscopia, neuroendoscopia, proctoscopia y sigmoidoscopia.
En algunas realizaciones, una vez indicado el diagnóstico de crecimiento neoplásico, pueden realizarse algunos tratamientos, incluyendo (pero sin limitación a) cirugía, quimioterapia, radioterapia, inmunoterapia, terapia dirigida, terapia hormonal, trasplante de células madre y transfusión de sangre. En algunas realizaciones, se administra un agente antineoplásico y/o quimioterápico, incluyendo (pero sin limitación) agentes alquilantes, agentes de platino, taxanos, agentes de la vinca, fármacos antiestrogénicos, inhibidores de la aromatasa, agentes supresores ováricos, agentes endocrinos/hormonales, agentes de terapia con bifosfonatos y agentes de terapia biológica dirigida. Los medicamentos incluyen (pero sin limitación) ciclofosfamida, fluorouracilo (5-fluorouracilo o 5-FU), metotrexato, tiotepa, carboplatino, cisplatino, taxanos, paclitaxel, paclitaxel unido a proteína, docetaxel, vinorelbina, tamoxifeno, raloxifeno, toremifeno, fulvestrant, gemcitabina, irinotecán, ixabepilona, temozolmida, topotecán, vincristina, vinblastina, eribulina, mutamicina, capecitabina, capecitabina, anastrozol, exemestano, letrozol, leuprolida, abarelix, buserlina, goserelina, acetato de megestrol, risedronato, pamidronato, ibandronato, alendronato, zoledronato, tykerb, daunorrubicina, doxorrubicina, epirrubicina, idarrubicina, valrrubicina, mitoxantrona, bevacizumab, cetuximab, ipilimumab, adotrastuzumab emtansina, afatinib, aldesleucina, alectinib, alemtuzumab, atezolizumab, avelumab, axtinib, belimumab, belinostat, bevacizumab, blinatumomab, bortezomib, bosutinib, brentuximab vedotina, briatinib, cabozantinib, canakinumab, carfilzomib, certinib, cetuximab, cobimetnib, crizotinib, dabrafenib, daratumumab, dasatinib, denosumab, dinutuximab, durvalumab, elotuzumab, enasidenib, erlotinib, everolimus, gefitinib, ibritumomab tiuxetán, ibrutinib, idelalisib, imatinib, ipilimumab, ixazomib, lapatinib, lenvatinib, midostaurina, nectiumumab, neratinib, nilotinib, niraparib, nivolumab, obinutuzumab, ofatumumab, olaparib, loaratumab, osimertinib, palbocicilib, panitumumab, panobinostat, pembrolizumab, pertuzumab, ponatinib, ramucirumab, reorafenib, ribociclib, rituximab, romidepsina, rucaparib, ruxolitinib, siltuximab, sipuleucel-T, sonidebib, sorafenib, temsirolimus, tocilizumab, tofacitinib, tositumomab, trametinib, trastuzumab, vandetanib, vemurafenib, venetoclax, vismodegib, vorinostat y ziv-aflibercept. En algunas realizaciones, un individuo puede ser tratado con un único medicamento o con una combinación de los medicamentos descritos en el presente documento. Una combinación de tratamiento común es ciclofosfamida, metotrexato y 5-fluorouracilo (CMF).
Muchas realizaciones se refieren a exploraciones diagnósticas o diagnósticas complementarias realizadas durante el tratamiento del cáncer de un individuo. Al realizar exploraciones diagnósticas durante el tratamiento, puede controlarse la capacidad del agente para tratar el crecimiento neoplásico. La mayoría de los agentes terapéuticos antineoplásicos provocan la muerte y necrosis de las células neoplásicas, que pueden liberar mayores cantidades de ácidos nucleicos de estas células en las muestras que se están sometiendo a ensayo. En consecuencia, el nivel de ácidos nucleicos tumorales circulantes puede controlarse a lo largo del tiempo, ya que el nivel puede aumentar durante los tratamientos y comenzar a disminuir a medida que se reduce el número de células neoplásicas. En algunas realizaciones, los tratamientos se ajustan basándose en el efecto del tratamiento sobre las células neoplásicas. Por ejemplo, si el tratamiento no es citotóxico para las células neoplásicas, puede aumentarse la dosificación o puede administrarse un agente con mayor citotoxicidad. Como alternativa, si la citotoxicidad de las células neoplásicas es buena pero los efectos secundarios no deseados son altos, puede disminuirse la dosificación o puede administrarse un agente con menos efectos secundarios.
Diversas realizaciones también se refieren a exploraciones diagnósticas realizadas después del tratamiento de un individuo para detectar la enfermedad residual y/o la recidiva del crecimiento neoplásico. Si una exploración diagnóstica indica un crecimiento neoplásico residual y/o recurrente, pueden realizarse otras pruebas diagnósticas y/o tratamientos como se describen en el presente documento. Si el crecimiento neoplásico y/o el individuo son susceptibles de recidiva, pueden realizarse exploraciones diagnósticas con frecuencia para controlar cualquier posible recaída.
Ejemplos
Las realizaciones de la presente divulgación pueden comprenderse mejor con los varios ejemplos que se ofrecen a continuación. Se describen muchos resultados de ejemplo de herramientas y métodos de secuenciación de ácidos nucleicos libres de células. También se proporciona la descripción de diagnósticos, especialmente para el cáncer de pulmón no microcítico (CPNM).
Ejemplo 1: Integración de características genómicas para la detección precoz no invasiva del cáncer de pulmón
El cáncer de pulmón es la principal causa de muerte por cáncer y a la mayoría de los pacientes se les diagnostica una enfermedad metastásica que generalmente es incurable. No obstante, una fracción significativa de pacientes con enfermedad localizada (estadios I-III) puede curarse, ilustrando la utilidad de la detección precoz. De hecho, el cribado de adultos de riesgo alto mediante tomografía computarizada de dosis baja (LDCT, por sus siglas en inglés) reduce la mortalidad relacionada con el cáncer de pulmón y, como resultado, puede recomendarse un cribado radiológico anual para las poblaciones de riesgo alto. A pesar de su eficacia, la utilidad clínica del cribado por LDCT se ve complicada por una tasa alta de descubrimientos falsos (>90 %) y un cumplimiento bajo, con < 5 % de individuos elegibles en los EE. UU. sometidos actualmente a cribado. Múltiples factores contribuyen a esta tasa baja de adopción, incluyendo el acceso limitado a centros radiológicos cualificados y los inconvenientes para los pacientes. Por lo tanto, existe una necesidad insatisfecha de nuevos enfoques para mejorar la detección precoz de los cánceres de pulmón resecables en estadio temprano en individuos de riesgo alto.
Los análisis de sangre no invasivos que pueden detectar alteraciones somáticas derivadas de tumores basándose en el análisis de ADNlc son candidatos atractivos para aplicaciones de cribado de cáncer debido a la relativa facilidad de obtención de muestras de ensayo de sangre. Sin embargo, los ensayos de ADNlc actualmente en uso clínico están destinados al genotipado no invasivo de pacientes con enfermedad avanzada en los que los niveles de ADNtc son significativamente más altos que en los pacientes con tumores en estadios tempranos. Por separado, algunos estudios que examinan el ADNtc en pacientes con cánceres de pulmón no microcíticos (CPNM) localizados pueden usar enfoques con información del tumor en los que el tejido tumoral debe genotiparse en primer lugar. Aunque este enfoque maximiza la sensibilidad, puede no ser útil para el cribado. Por último, la hematopoyesis clonal (CH), que implica la adquisición de alteraciones somáticas en progenitores hematopoyéticos no malignos y produce fragmentos mutantes de ADN libre de células, complica el uso del ADNtc para la detección precoz del cáncer.
En este ejemplo se describen potenciaciones metodológicas del Perfilado personalizado del cáncer mediante secuenciación profunda (CAPP-Seq, por sus siglas en inglés) que facilitan la detección de ADNtc en cánceres en estadios tempranos o la detección de cáncer residual después del tratamiento (para más información sobre CAPP-Seq, véase A. M. NewmanNat. Biotechnol.34, 547-555 (2016)). El método mejorado se aplicó a muestras de plasma y tumor de pacientes con CPNM en estadio temprano, empleando inicialmente una estrategia con información del tumor para determinar la fracción de pacientes cuyos tumores excretan ADNtc detectable. El método se amplió a la detección precoz usando un enfoque sin exposición a tumor para cribar muestras de plasma de pacientes con cáncer de pulmón y controles con riesgo alto de cáncer de pulmón. Se descubrió que el ADNlc tanto de los casos como de los controles albergaba variantes somáticas circulantes, la mayoría de las cuales puede atribuirse a la CH. De manera destacada, se identificaron características moleculares clave, incluyendo distintivos mutacionales y perfiles de longitud de fragmentos que distinguen las variantes de CH de las mutaciones derivadas de tumores. Por último, estos hallazgos se aprovecharon para desarrollar y validar independientemente un ensayo de probabilidad de cáncer de pulmón en plasma (Lung-CLiP, por sus siglas en inglés) para la detección precoz no invasiva del cáncer de pulmón.
Mejora de la detección de variantes circulantes ultrarraras
Se ha demostrado que los niveles de ADNtc en los cánceres de pulmón localizados son bajos, teniendo la mayoría de los pacientes con enfermedad en estadio I niveles de frecuencia alélica de la variante (VAF) circulante por debajo de aproximadamente el 0,1 %. Para mejorar la sensibilidad en la detección de niveles alélicos tan bajos, se desarrollaron y sometieron a ensayo algunas metodologías para maximizar el rendimiento de las moléculas de ADNlc secuenciado satisfactoriamente único minimizando simultáneamente su perfil de error de secuenciación asociado (Fig. 7).
Se desarrolló un nuevo esquema de adaptador para la preparación de bibliotecas mediante la combinación de códigos de barras de muestra con corrección de errores de índice doble, que evitan la contaminación cruzada de las muestras, con códigos de barras moleculares dúplex con corrección de errores (por ejemplo, identificadores únicos o "UID") que permiten una enumeración más precisa de moléculas de ADNlc únicas. Además, el desacoplamiento de los UID y los códigos de barras de muestra permite adaptar independientemente la diversidad de UID y la capacidad de multiplexación basándose en la aplicación (Fig. 2 y 3).
Usando estos adaptadores personalizados, a continuación se trató de identificar operaciones clave asociadas a la mayor pérdida de moléculas de ADNlc únicas. Para ello, se rastrearon cadenas individuales de fragmentos de ADNlc desde el inicio de la preparación de bibliotecas hasta su secuenciación final dentro de una simulación informática del flujo de trabajo de biología molecular de CAPP-Seq (Fig. 8 y 9). La simulación predijo que las mayores pérdidas se producían en la operación de captura de híbridos y se debían a la entrada típica de sólo una pequeña fracción de cada biblioteca de secuenciación amplificada en la reacción de hibridación para el enriquecimiento diana. Este efecto surge debido a la representación desigual de las moléculas originales después de la PCR. Muchos métodos de secuenciación de captura de híbridos multiplexan las muestras en la operación de captura (por ejemplo, capturan muchas muestras juntas en una sola reacción), y esto puede dar como resultado que se capture una pequeña fracción de la cantidad total de cada biblioteca. Por ejemplo, si se dispusiera de 2.000 ng de cada biblioteca de secuenciación y se multiplexaran 20 muestras en una sola reacción de captura de 1.000 ng, sólo se introduce en la reacción de captura el 2,5 % (50 ng) de cada biblioteca de secuenciación individual. Aumentar la fracción de entrada de biblioteca en la reacción mejora la recuperación molecular. Por ejemplo, aumentar la fracción de entrada de biblioteca del 8,3 % al 100 % mejoró significativamente la recuperación tanto del total de moléculas únicas como de la fracción de dúplex de ADNlc de origen para los que se secuenciaron ambas cadenas (Fig. 10 a 12). De manera notable, el aumento del porcentaje de entrada de la biblioteca de secuenciación del 8,3 % al 25 % consiguió la mayoría de las ganancias posibles en la recuperación de moléculas únicas y la entrada del 50 % o más mejoró la fracción de dúplex de ADNlc originales para los que se secuenciaron ambas cadenas. Además, la relación entre la entrada de biblioteca de secuenciación y los cebos de captura (por ejemplo, oligonucleótidos biotinilados utilizados para enriquecer en regiones genómicas de interés) también influye en la recuperación molecular después de la reacción de captura.
Además, se buscó mejorar adicionalmente el perfil de errores técnicos de CAPP-Seq. El artefacto de secuenciación más común observado en CAPP-Seq y otros métodos de secuenciación basados en captura de híbridos son las transversiones G>T que surgen debido al daño oxidativo que se produce durante la reacción de captura de híbridos y que conduce a la generación de 8-oxoguanina (véase A. M. Newman,et al., Nat. Biotechnol.(2016), citado anteriormente; y M. Costelleo,et al., Nucleic Acids Res.41, 1-12 (2013)). De manera interesante, las transversiones G>T son también la sustitución de base más común en los cánceres de pulmón, que surgenin vivocomo resultado de la exposición a los carcinógenos del humo del cigarrillo (Fig. 4A-4B). Por lo tanto, las transversiones G>T derivadas de la oxidaciónin vitrodurante la captura de híbridos pueden imitar y confundir la detección de mutaciones derivadas del cáncer de pulmón genuinas. Se planteó la hipótesis de que la adición de un eliminador de especies reactivas de oxígeno (ROS) reduciría los artefactos G>T derivados del daño oxidativo (Fig. 4A-4B). Después de someter a ensayo varios antioxidantes y eliminadores de radicales libres, la hipotaurina, un ácido sulfínico, se identificó como candidato favorable. La hipotaurina es un intermedio natural de la vía cisteína-taurina y tiene un efecto protector no enzimático contra las ROS. Cuando se compararon los perfiles de error de las muestras de ADNlc de 12 adultos sanos capturadas con y sin hipotaurina, se observó que las muestras capturadas con el eliminador de ROS tenían tasas de error de fondo significativamente más bajas y menos errores G>T (prueba de suma de rangos de WilcoxonP< 0,001), Fig. 13). Se observó una reducción relativa similar de los errores G>T (16 % frente a 57 % de todos los errores, prueba de suma de rangos de Wilcoxon,P< 1x10'8) y la tasa de error de fondo (una reducción de aproximadamente el 50 %, prueba de suma de rangos de Wilcoxon,P< 0,0001) en 104 muestras de ADNlc de controles sanos capturadas con el eliminador de ROS en comparación con 69 muestras de ADNlc de control capturadas sin hipotaurina (Fig. 14).
Detección de ADNtc con información del tumor
Como etapa hacia el desarrollo de un ensayo no invasivo para el cribado de CPNM, se determinaron tasas de detección de ADNtc en pacientes con tumores en estadios tempranos usando un enfoque con información del tumor. Esta estrategia establece la máxima sensibilidad para un enfoque de cribado sin exposición a tumor basado en CAPP-Seq (Fig. 15). Se genotiparon tejido tumoral, ADNlc en plasma previo al tratamiento y ADN leucocitario de 85 pacientes con CPNM en estadio I-III a través de secuenciación profunda dirigida de 255 genes con mutaciones recurrentes en cáncer de pulmón usando un panel de CAPP-Seq de 355 kilobases (kb) (Fig. 16, Tabla 1). Usando este panel, que es un enfoque "basado en la población" (por ejemplo, no requiere la personalización de la biología molecular específica del paciente), se identificó una mediana de 4 mutaciones por paciente en las muestras de ensayo de tumoral (intervalo 0-35), y se detectó ADNtc en el 49 % (42/85) de los pacientes con CPNM con una especificidad del 95 %. La sensibilidad de detección fue significativamente mayor a medida que aumentaba el número de mutaciones tumorales controladas (Fig. 17). Para someter a ensayo empíricamente la observación de que rastrear más mutaciones mejora las tasas globales de detección de ADNtc, se diseñaron paneles de captura personalizados basándose en datos de secuenciación del exoma tumoral para 17 pacientes en los que el ADNtc no fue detectable inicialmente usando el panel de cáncer de pulmón basado en la población. Este enfoque personalizado aumentó el número de mutaciones disponibles para el control a partir de una mediana de 4 a 68 (prueba t bilateral pareada, P < 0,01). Usando estos ensayos personalizados, se detectó ADNtc en 11/17 (65 %) pacientes con una mediana de VAF del 0,0019 % y a niveles tan bajos como 1,5 en 106 moléculas (Fig. 18).
Combinando los resultados de las estrategias con información del tumor basadas en la población (n = 68) y personalizadas (n = 17), se detectó ADNtc en la mayoría de los pacientes con CPNM en estadio temprano (53/85 o 62 %), incluyendo el 52 %, 67 % y 88 % de los pacientes con enfermedad I, II y III, respectivamente (Fig. 19). En el enfoque con información del tumor, el límite de detección (LOD, por sus siglas en inglés) analítico específico del paciente puede determinarse a partir del número de mutaciones rastreadas y del número de moléculas de ADNlc secuenciadas. El LOD fue significativamente inferior en los pacientes en los que el ADNtc era indetectable (prueba de suma de rangos de Wilcoxon,P< 0,001, Fig. 19), lo que indica que la tasa global de ADNtc detectable puede mejorar aumentando el número de mutaciones o la profundidad molecular única. De hecho, al contemplar solamente a los pacientes para los que se podía alcanzar un LOD de al menos el 0,01 % (n = 43), la sensibilidad aumentó al 73 %, 82 % y 100 % para tumores en estadio I, II y III, respectivamente (Fig. 19). Sorprendentemente, el 48 %, 38 % y 7 % de los pacientes en estadio I, II y III tenían niveles de ADNtc inferiores al 0,01 %, respectivamente (Fig. 19). Por lo tanto, la mayoría de los CPNM localizados excretan ADNtc, pero los niveles de ADNtc de muchos casos en estadio I-III son relativamente bajos.
Se identificaron propiedades de las moléculas de ADNtc que pueden informar el cribado sin exposición a tumor. Las mutaciones tumorales clonales, definidas como aquellas variantes que se estima que están uniformemente presentes en todas las células tumorales se detectaron con mayor frecuencia en plasma y se observaron con frecuencias alélicas más altas que sus homólogas subclonales (Prueba exacta de FisherP <0,05, prueba de suma de rangos de WilcoxonP< 0,001, Fig. 20).
La distribución de tamaño de los fragmentos de ADNlc también se consideró como un medio potencial de enriquecimiento en moléculas de ADNlc derivadas de tumores (por ejemplo, ADNtc). Se descubrió que las moléculas de ADNlc que albergaban mutaciones presentes en muestras tumorales emparejadas eran significativamente más cortas que sus homólogas no mutantes (prueba de suma de rangos de WilcoxonP< 1x10-8, Fig. 21). Las moléculas de ADNlc mutantes estaban enriquecidas entre los fragmentos submononucleosómicos (< 160 pb) y en los fragmentos subdisómicos (230-310 pb, Fig. 21). Cuando sólo se contemplaron moléculas < 160 pb y entre 230-310 pb, se observó una mediana de enriquecimiento de 2,17 veces en las VAF de las mutaciones derivadas de tumores (intervalo 0-9,2, Fig. 21). Se observó que el 53,6 % de las moléculas mutantes caían en estas regiones, en comparación con el 24,7 % de las moléculas no mutantes (Fig. 21), lo que indica que la selección de tamaño de las moléculas en estas ventanas puede resultar útil. Sin embargo, aunque la mayoría de las mutaciones (74 %, 271/366) estaban enriquecidas en estas ventanas de tamaño, las VAF disminuyeron después de la selección de tamaño para el 26 % de las mutaciones (95/366), volviéndose indetectables el 78 % de dichas mutaciones (75/95) indetectables (Fig. 22). Además, el enriquecimiento de ADNtc por selección de tamaño favoreció desproporcionadamente a las variantes con VAF de preenriquecimiento más altos (Fig. 22). De manera interesante, aunque la selección de tamaño mejoró la sensibilidad global de la detección de ADNtc en pacientes con muchas mutaciones rastreadas a través de paneles personalizados, la sensibilidad se degradó en pacientes controlados con el panel de cáncer de pulmón de los presentes inventores basado en la población debido a la pérdida de mutaciones tumorales no representadas en ninguna molécula de ADNlc corto (Fig. 23). Esto indica que, aunque las moléculas de ADNlc derivadas de CPNM tienden a ser más cortas que las moléculas de ADNlc no mutantes, la selección de tamaño puede dificultar la detección de ADNtc en VAF bajas a menos que se contemplen muchas mutaciones.
Cabe señalar que el tamaño del fragmento de ADNtc medido real puede depender del método de preparación de la secuenciación y/o de los datos del análisis. Usando los métodos descritos en el presente documento (por ejemplo, dentro de este Ejemplo), los fragmentos submononucleosómicos de ADNtc resultaron ser inferiores a 160 pb y los fragmentos subdisómicos de ADNtc resultaron ser de 230 pb a 310 pb (véase la Fig. 21). Generalmente, los fragmentos de ADNtc están enriquecidos en tamaños relativamente más cortos que los fragmentos de ADNlc no neoplásicos, y las regiones especificadas en este caso no deben interpretarse como la única ventana de tamaño que está enriquecida en ADNtc. Por ejemplo, las moléculas de menos de 150 pb también están enriquecidas en ADNtc. Adicionalmente, la variabilidad en los métodos de análisis puede afectar a las regiones específicas que se encuentra que están enriquecidas en ADNtc. Los factores que pueden afectar a los tamaños específicos de las moléculas de ADNlc que se encuentra que están enriquecidas con ADNtc incluyen (pero sin limitación): 1) el algoritmo de mapeo utilizado, 2) la manera en que se eliminaron de los datos los duplicados de PCR, 3) la manera en que se recortaron las lecturas de adaptador desde el extremo 3' de las lecturas de secuenciación, 4) la cantidad de datos de secuenciación que se contemplan (por ejemplo, sólo se contemplan las moléculas de ADNlc para las que ambas lecturas de secuenciación se mapean en el par adecuado), 5) la calidad del mapeo u otras métricas de calidad relacionadas con los datos de secuenciación pueden usarse para determinar qué moléculas de ADNlc se contemplan.
Correlaciones clínicas de la detección de ADNtc
Habiendo observado ADNtc detectable en la mayoría de los pacientes con CPNM en estadio temprano, a continuación se trató de identificar las correlaciones clínicas y patológicas de los niveles de ADNtc en estos pacientes. Se observó que los niveles de ADNtc estaban estrechamente asociados al avance del estadio, con una mediana de VAF del 0,015 % en el estadio I, del 0,14 % en el estadio II y del 0,52 % en el estadio III (prueba de suma de rangos de Wilcoxon,P< 0,0001, Fig. 24). Se encontraron asociaciones significativas entre los niveles de ADNtc y el volumen tumoral metabólico (MTV), según se midió mediante [18F] FDG PET/CT (r de Spearman = 0,40,P= 0,004, Fig. 25 y 26) y con histología no adenocarcinoma (Prueba de suma de rangos de Wilcoxon,P< 0,01, Fig. 27). El estadio, el MTV y la histología no adenocarcinoma se asociaron cada uno independientemente a la carga de ADNtc en el análisis multivariable (Fig. 27), lo que indica que los niveles de ADNtc son una función de múltiples parámetros biológicos.
Los adenocarcinomas de pulmón existen en un espectro que va desde las proliferaciones epiteliales preinvasivas hasta las francamente invasivas, que se asocian a diferencias en el aspecto radiológico que varían desde las opacidades en vidrio deslustrado (G<g>O) puras hasta las lesiones sólidas. Puesto que los cánceres de pulmón con predominio de GGO son de crecimiento lento y con frecuencia clínicamente indolentes, se planteó la hipótesis de que excretaban menos ADNtc que los tumores sólidos. Entre los pacientes con un componente de vidrio deslustrado importante (GGO > 25 %), se detectó ADNtc con menor frecuencia y a una concentración menor que en los pacientes con GGO < 25 % (prueba exacta de FisherP< 0,05, prueba de suma de rangos de WilcoxonP< 0,05, Fig. 28). De manera similar, cuando se compararon los niveles de ADNtc entre los subtipos histológicos de adenocarcinoma, los pacientes con tumores sólidos y papilares presentaban niveles de ADNtc más altos que aquellos con tumores acinares o lepídicos, aunque esta relación no alcanzó significación estadística (Fig. 29). Por separado, el ADNtc era detectable con mayor frecuencia en pacientes cuyos tumores tenían indicios de necrosis o contactaban con una vía aérea central o una arteria (Fig. 30). Por lo tanto, las características anatómicas y radiológicas de los CPNM se asocian a la excreción de ADNtc y pueden ayudar a identificar los pacientes más adecuados para un análisis no invasivo.
Dadas estas correlaciones entre la excreción de ADNtc y los parámetros de formación de imágenes que se sabe que se asocian a la agresividad de la enfermedad, se examinó la asociación entre los niveles de ADNtc pretratamiento y los resultados clínicos. Los pacientes con niveles de ADNtc superiores a la mediana tenían tasas significativamente inferiores tanto de ausencia de recidiva (relación de riesgos = 3,88,P= 0,0009, Fig. 31) como de supervivencia sin recidivas (relación de riesgos = 3,51,P= 0,001, Fig. 32). Los niveles de ADNtc pretratamiento fueron de pronóstico similar cuando sólo se contemplaron los pacientes con enfermedad en estadio I (n = 48, Fig. 33 y 34). De manera destacada, en un análisis multivariable que incluye tanto el MTV como el estadio, sólo el ADNtc se asoció significativamente al resultado (Fig. 35). Puesto que la metástasis a distancia es la principal causa de mortalidad asociada al cáncer después del tratamiento del CPNM localizado, también se examinó la asociación entre los niveles de ADNtc pretratamiento y futuras metástasis. Las concentraciones más altas de ADNtc se asociaron significativamente a una menor ausencia de metástasis a distancia tanto en el análisis univariable como en el multivariable (Fig. 35 a 37). Por lo tanto, la concentración de ADNtc pretratamiento es un factor pronóstico en el CPNM localizado que puede identificar a los pacientes que albergan enfermedad micrometastásica (Fig. 38).
Fuentes de variantes somáticas de ADNIc
La hematopoyesis clonal (CH) surge de alteraciones somáticas en progenitores hematopoyéticos no malignos y es un fenómeno biológico común asociado al envejecimiento. Las células hematopoyéticas son la principal fuente de ADNlc y aportan variantes somáticas de CH al grupo de ADNlc, la CH se caracterizó en pacientes con CPNM localizado y en controles sin cáncer con el fin de identificar posibles enfoques para distinguir las mutaciones derivadas de CH de sus homólogas derivadas de tumores.
Las variantes halladas originalmente en ADNlc se examinaron para determinar si también se detectaban en el ADN de glóbulos blancos (GB) emparejados en pacientes con CPNM (n = 104) y en sujetos de control (n = 98). Se utilizaron dos grupos de control separados: (1) adultos emparejados por edad, sexo y tabaquismo sometidos a un cribado anual por LDCT ("controles emparejados por riesgo") y (2) donantes de sangre adultos no emparejados ("controles de riesgo bajo", Fig. 16). En promedio, los pacientes con CPNM albergaban un número significativamente mayor de mutaciones no sinónimas en el ADNlc que los controles emparejados por riesgo y de riesgo bajo (prueba de suma de rangos de Wilcoxon,P <0,01 yP< 0,0001, Fig. 39). De manera similar, el ADNlc de los pacientes con cáncer de pulmón albergaba más variantes ausentes en los leucocitos emparejados (por ejemplo, "GB-") que ambos grupos de control. De manera interesante, similares a los pacientes con CPNM, los controles emparejados por riesgo tienen tanto más mutaciones de ADNlc totales como más variantes de CH (por ejemplo, "GB+") que los controles de riesgo bajo (prueba de suma de rangos de Wilcoxon,P< 0,0001). Esta observación pone de relieve la importancia de emparejar por riesgo los casos y los controles en estudios de detección precoz basados en ADNlc. Cabe destacar que, la mayoría de las variantes detectadas en el ADNlc eran atribuibles a CH en pacientes con cáncer de pulmón (58 %), controles emparejados por riesgo (93 %) y controles de riesgo bajo (77 %). Además, la mutación observada en la VAF más alta en el ADNlc también estaba presente en los GB emparejados en el 76 % de los pacientes y el 91 % de los controles (Fig. 40). El 48 % de las mutaciones de ADNlc GB+ se encontraban en otros genes además de los 12 de los genes mutados más recurrentes canónicamente asociados a CH (Fig. 41). Además, el 94,8 % de las mutaciones de ADNlc GB+ eran privadas (Fig. 41), destacando la importancia del genotipado de leucocitos emparejados para determinar con fiabilidad si las mutaciones de ADNlc son derivadas del CH.
Se observó una tasa similar de variantes CH en los pacientes con CPNM y en los controles, ya sea identificando mutaciones directamente a partir de los GB o a partir del ADNlc (Fig. 42). Las fracciones alélicas de las mutaciones observadas en los compartimentos celular y libre de células estaban significativamente correlacionadas(rde Pearson = 0,83,P< 1x10-8, Fig. 42). De las 1.017 mutaciones identificadas originalmente en el ADNlc o en los GB, el 57 % se encontraron en ambos compartimentos, mientras que el 25 % sólo se observaron en ADNlc y el 18 % sólo se observaron en GB. De manera destacada, el 73 % de las variantes de ADNlc GB+ tenían VAF inferiores al 1 % en leucocitos, destacando la importancia de secuenciar ADN leucocitario y ADNlc a profundidades equivalentes para determinar si las mutaciones de ADNlc derivan de CH.
La detección de mutaciones CH en genes asociados a leucemias en individuos sin una neoplasia hematológica y que se producen a una VAF > 2 % en ADN de GB se denomina habitualmente hematopoyesis clonal de potencial indeterminado (CHIP). Se observaron una o más mutaciones de este tipo en los GB del 13,5 % (14/104) de los casos de cáncer de pulmón, el 7,1 % (4/56) de los controles emparejados por riesgo, pero ninguno de los (0/42) controles de riesgo bajo. Como se esperaba, los individuos con CHIP eran significativamente mayores que los que no presentaban indicios de CHIP (prueba de suma de rangos de Wilcoxon,P= 0,011). De manera interesante, a diferencia de la tendencia de la mayoría de las variantes CH a ser privadas y a tener fracciones alélicas bajas en todas las cohortes de los presentes inventores, el 77 % (20/26) de las variantes en los GB que ocurrían a una VAF > 2 % afectaban a genes CH canónicos, conDNMT3A, TET2yTP53afectados con mayor frecuencia (Fig. 43).
Puesto que se sabe que la incidencia de CHIP aumenta con la edad, se examinó el número de mutaciones de ADNlc GB+ asociadas a la edad. El número de mutaciones de ADNlc GB+, pero no de las mutaciones de ADNlc GB-, se correlacionó significativamente con la edad (r de Pearson = 0,43,P< 1 x 10-8, Fig. 44 y 45). Coherentemente con el concepto de que estas mutaciones constituyen eventos de CH, los genes que contenían con mayor frecuencia mutaciones g B+ eran genes CH canónicos, incluyendoDNMT3A, TET2, TP53, SF3B1yPPM1D(Fig. 46).
Para examinar los cambios temporales en las mutaciones de ADNlc GB+, se contempló el subconjunto de la cohorte para el que se extrajo muestras de plasma en dos puntos temporales (8 pacientes con CPNM, mediana del intervalo entre extracciones de sangre = 12 días; 5 controles emparejados por riesgo, mediana del intervalo = 19 meses). Entre las mutaciones de ADNlc GB+ detectadas en el primer punto temporal de recogida de sangre, el 73 % (41/56) también se detectaron en el segundo punto temporal y presentaron VAF altamente correlacionadas (r de Pearson = 0,99,P< 0,0001 para los pacientes;rde Pearson = 0,74,P= 0,02 para los controles, Fig. 47). De manera similar, cuando se contemplaron todas las mutaciones de ADNlc GB+ en todos los pacientes y controles, los genes CH canónicos albergaban tasas más altas de mutaciones no sinónimas que de variantes sinónimas (Fig. 46), lo que es coherente con el hecho de que estas mutaciones estaban sometidas a selección positiva. Estas observaciones son coherentes con la estabilidad relativa de los clones CH cuando se estudian sus niveles alélicos en los GB a lo largo del tiempo.
Para identificar propiedades de las mutaciones de CH que pueden ser útiles para distinguirlas de mutaciones derivadas de tumores, se compararon y contrastaron los distintivos mutacionales de las mutaciones de ADNlc GB+ y GB-, así como con conjuntos de datos de mutaciones publicados anteriormente en la literatura sobre CH y cáncer de pulmón. Las mutaciones GB+ detectadas en el ADNlc en los casos y controles estaban dominadas por el distintivo mutacional asociado al envejecimiento (Distintivo 1, Fig. 48 y 49). Cabe destacar que, el Distintivo 4, que se asocia al tabaquismo y es el distintivo mutacional predominante de los genomas tumorales del CPNM, se observó en las mutaciones de ADNlc GB- pero no GB+ en pacientes con CPNM (P < 0,001), y no se observó en ninguno de los compartimentos entre los controles con o sin antecedentes de tabaquismo (P < 0,001). Esto es coherente con observaciones anteriores de que surgen patrones distintos de lesiones del ADN como resultado de la exposición a diferentes agentes carcinógenos, e indica que, además de secuenciar los GB emparejados, el espectro de sustitución de bases de las variantes de ADNlc puede ser útil para distinguir las mutaciones derivadas de carcinoma de las derivadas de CH.
TP53es uno de los genes mutados con más frecuencia en los cánceres humanos; sin embargo, también se observan con frecuencia mutaciones enTP53en la CH. La discriminación entre las mutaciones deTP53derivadas de carcinoma y las derivadas de CH es, por lo tanto, una consideración importante para los enfoques de cribado del cáncer basados en ADNlc. De manera notable, una fracción grande de las variantes deTP53halladas en el ADNlc también eran detectables en los GB, si se contemplaban los casos de cáncer de pulmón (40,6 %; 13 de 32) o todos los controles (100 %; 4 de 4, Prueba exacta de FisherP< 0,05, Fig. 46). La distribución de las mutaciones de ADNlc GB+ y GB-fue similar en toda la proteína TP53, afectando ambas clases de mutaciones principalmente a su dominio de unión a ADN (Fig. 50). Coherentemente con los resultados del análisis del distintivo global, las mutaciones de ADNlc deTP53GB- mostraron un indicio significativamente mayor del distintivo del tabaquismo que sus homólogos GB+ (prueba de suma de rangos de Wilcoxon,P< 0,01, Fig. 51).
Se examinó la distribución de tamaño del fragmento de moléculas de ADNlc que albergaban variantes presentes en GB emparejados o en biopsias tumorales emparejadas. Se observó que las moléculas de ADNlc que albergaban mutaciones GB+ (por ejemplo, "mutaciones CH") presentaban una distribución de tamaño casi idéntica a la de las moléculas de ADNlc no mutantes que abarcaban las mismas posiciones genómicas (Fig. 51). Por el contrario, las moléculas de ADNlc con mutaciones también presentes en muestras de ensayo de biopsia tumoral emparejadas (por ejemplo, "mutaciones con adjudicación tumoral") presentaron una distribución de tamaño desplazada, siendo las variantes con adjudicación tumoral significativamente más cortas (prueba de suma de rangos de Wilcoxon,P <1x10' 8, Fig. 51). En consecuencia, la selección informática para los tamaños de fragmento que resultaron estar enriquecidos en ADNtc en el análisis con información del tumor de los presentes inventores (<160 pb o 230-310 pb, Fig. 21) no aumentó las VAF de las variantes de CH GB+ en el ADNlc de pacientes con CPN<m>o controles (mediana de enriquecimiento de 0,94 y 0,91 en pacientes y controles, respectivamente, Fig. 51). Por el contrario, las VAF de las mutaciones GB- en pacientes con CPNM, pero no en los controles, se enriquecieron significativamente con la selección de tamaño (prueba de suma de rangos de WilcoxonP< 0,001, mediana de enriquecimiento de 1,99 y 0,51 en pacientes y controles, respectivamente). Esto indica que, además del tipo de sustitución de base, el tamaño del fragmento de ADNlc también puede ser útil para distinguir las mutaciones derivadas de carcinoma de las derivadas de CH.
Un método para estimar la probabilidad de cáncer de pulmón en plasma
Habiendo identificado las propiedades que distinguen los fragmentos de ADNIc derivados de tumor y de CH, se desarrolló el ensayo de Probabilidad de cáncer de pulmón en plasma (Lung-CLiP). Se usó un enfoque probabilístico para estimar la probabilidad de que una muestra de plasma contenga ADNlc derivado de tumor sin usar el conocimiento previo de las variantes tumorales. Este enfoque implica la secuenciación profunda de ADNlc plasmático y leucocitos emparejados e integra tanto SNV como el análisis del número de copias en todo el genoma. El ensayo Lung-CLiP se entrenó usando muestras de una cohorte de descubrimiento de 104 pacientes con cáncer de pulmón y 56 controles de riesgo alto sometidos a cribado radiológico anual de cáncer de pulmón en 4 centros oncológicos (Fig. 35, Tabla 4). Para desarrollar el ensayo, se empleó un enfoque de aprendizaje automático de varios niveles en el que primero se entrenó un modelo para estimar la probabilidad de que una SNV de ADNlc dada derivara de tumor. El modelo de SNV aprovecha las características biológicas y técnicas clave específicas de cada variante individual, incluyendo las frecuencias de fondo, el tamaño del fragmento de ADNlc, la contribución del distintivo de tabaquismo, la presencia en un gen frecuentemente mutado en CPNM y la probabilidad de CH (Fig. 52, véase la Fig. 6 para consultar las características del modelo). Adicionalmente, para identificar variantes del número de copias (CNV), el genoma se compartimentó en regiones de 5 megabases (Mb ) y se usaron las lecturas de secuenciación de CAPP-Seq, tanto dentro como fuera de la diana, para identificar alteraciones del número de copias en todo el genoma. Los resultados del modelo de SNV se integraron con las alteraciones del número de copias en todo el genoma (generadas mediante el análisis de las lecturas de secuenciación dentro y fuera de la diana) en un clasificador probabilístico final a nivel de paciente que estima la probabilidad de que una muestra de sangre dada contenga ADNlc derivado de cáncer de pulmón (por ejemplo, "puntuación de CLiP") (Tabla 4).
Las formas de las curvas características de receptor-operador revelaron que Lung-CLiP puede ajustarse fácilmente a las especificidades deseables dependiendo de la aplicación clínica diana (Fig. 53). Por ejemplo, como prueba de cribado independiente, sería deseable una alta especificidad para minimizar los falsos positivos. A una especificidad del 98 %, las sensibilidades de Lung-CLiP fueron del 41 % en pacientes en estadio I, 54 % en pacientes en estadio II y 67 % en pacientes en estadio III (Fig. 54). Como alternativa, una especificidad inferior podría ser aceptable si el ensayo se aplicara a aproximadamente el 95 % de los individuos en riesgo que actualmente no se someten a una LDCT debido a limitaciones de acceso u otros obstáculos. En este contexto, ajustar el ensayo a una especificidad más baja (por ejemplo, 80 %, que es similar a la de la LDCT en el ensayo NLST) sería razonable, puesto que la prueba refleja para una prueba positiva sería la LDCT. A una especificidad del 80 %, se observaron sensibilidades del 63 % en pacientes en estadio I, 69 % en pacientes en estadio II y 75 % en pacientes en estadio III (Fig. 54). Los genes en los que se identificaron mutaciones de forma recurrente en el ADNlc de los pacientes incluían impulsores de CPNM esperados tales comoTP53, KRASyEGFR(Fig. 55). Las características del clasificador con mayor impacto en la clasificación de pacientes incluyeron los niveles de VAF de SNV, el tamaño del fragmento de ADNlc, el número de SNV detectados, el número de CNV detectadas y si las alteraciones se habían observado anteriormente en el cáncer de pulmón (Fig. 55).
Las puntuaciones de Lung-CLiP se compararon con los niveles de ADNtc con información del tumor y las características clinicopatológicas. De manera destacada, las sensibilidades a una especificidad del 98 % no fueron significativamente diferentes de aquellas observadas usando análisis de ADNtc con información del tumor (Fig. 56), lo que indica que Lung-CLiP alcanza sensibilidades similares a la detección de ADNtc con información del tumor. Además, se observó que las puntuaciones de Lung-CLiP sin exposición a tumor estaban significativamente correlacionadas con los niveles de ADNtc con información del tumor (r de Spearman = 0,59,P< 0,0001, Fig. 56). Como se esperaba, los tumores de pacientes con CPNM clasificados como positivos por Lung-CLiP eran significativamente más grandes que aquellos clasificados como negativos (prueba de suma de rangos de Wilcoxon,P< 0,01, Fig. 57) y, de forma similar, los pacientes con histología no adenocarcinoma se detectaron con mayor frecuencia (Prueba exacta de Fisher,P< 0,01, Fig. 57). Tomados en conjunto, estos datos indican que las puntuaciones de Lung-CLiP capturan factores biológicamente significativos relacionados con la carga de ADNtc global.
Por último, el rendimiento del ensayo Lung-CLiP se validó en una cohorte independiente de 46 pacientes con CPNM (n = 32 estadio I; n = 9 estadio II; n = 5 estadio III) y 48 controles emparejados por riesgo con exploraciones de LDCT negativas que se inscribieron prospectivamente en una institución diferente (Fig. 35 y 58; Tabla 4). La inscripción prospectiva de la cohorte de validación en un sitio clínico independiente fue un aspecto clave del diseño del estudio, ya que representa una prueba rigurosa del ensayo y disminuye el riesgo de notificar resultados demasiado optimistas. El rendimiento emparejado por estadio del modelo en la cohorte de validación fue estadísticamente similar al observado en el entrenamiento mediante las métricas de AUC (Fig. 53 y 59) y sensibilidad (Fig. 59), con diferencias numéricas en el rendimiento del estadio I atribuibles a una mayor fracción de casos en estadio IA frente a IB en la cohorte de validación (Fig. 59). Además, los umbrales de especificidad establecidos en la cohorte de entrenamiento tuvieron un comportamiento similar cuando se aplicaron a los controles de la cohorte de validación, lo que indica que las puntuaciones de Lung-CLiP están bien calibradas (Fig. 60).
Por último, se realizaron varios análisis exploratorios en las cohortes combinadas de entrenamiento y validación. En primer lugar, se examinó la influencia de la profundidad de secuenciación o métricas relacionadas sobre la sensibilidad. Se descubrió que la entrada de ADNlc, la entrada de volumen plasmático y la profundidad de secuenciación única no se asociaron significativamente a la sensibilidad de Lung-CLiP (Fig. 61). Sin embargo, contemplando todos los pacientes con CPNM con datos de MTV disponibles (n = 103), se observó una fuerte correlación entre el MTV y la sensibilidad de Lung-CLiP, con sensibilidades aproximadas del 16 % (IC del 95 %: 4 %-24 %), 52 % (IC del 95 %: 32 %-72 %) y 80 % (IC del 95 %: 60 %-96 %) para tumores de 1 ml, tumores de 10 ml y tumores de > 100 ml, respectivamente (Fig. 62).
Diseño del estudio y pacientes
Todos las biomuestras de ensayo analizadas en este estudio se recogieron con el consentimiento informado de sujetos inscritos en protocolos aprobados por la Junta de Revisión Institucional en sus respectivos centros, incluyendo la Universidad de Stanford, Centro Oncológico MD Anderson, Clínica Mayo, Centro Médico de la Universidad de Vanderbilt y Hospital General de Massachusetts. Todos los pacientes se desidentificaron y tenían CPNM en estadio I-III AJCC v7 y recibieron tratamiento con intención curativa con cirugía o radioterapia.
Este estudio consistía en dos cohortes, una cohorte de descubrimiento y una cohorte de validación. Las características clínicas de los pacientes de ambas cohortes se muestran en la Fig. 35. La cohorte de descubrimiento consistía en dos grupos de pacientes: (1) pacientes con CPNM con información del tumor y (2) casos de CPNM de entrenamiento de Lung-CLiP. Estos dos grupos estaban formados por pacientes con cáncer de pulmón inscritos en la Universidad de Stanford (n = 80), Universidad de Vanderbilt (n = 21), Clínica Mayo (n = 14) y Centro Oncológico MD Anderson (n = 7) entre noviembre de 2009 y julio de 2018. Los casos de CPNM con información del tumor consistieron en 85 pacientes con tejido tumoral compatible disponible, la mayoría de los cuales (67/85) se analizaron con todos los aspectos del flujo de trabajo de CAPP-Seq mejorado descrito en la Fig. 7. El grupo de entrenamiento de Lung-CLiP se limitó únicamente a los pacientes analizados con el flujo de trabajo mejorado (n = 104) y estudiados para los análisis sin exposición a tumor, sirviendo como grupo de entrenamiento para el clasificador de Lung-CLiP. Entre los 104 casos de CPNM de entrenamiento de Lung-CLiP, 67 se solapan con los 85 pacientes del grupo con información del tumor. Después del entrenamiento inicial de un clasificador no invasivo, se inscribieron prospectivamente pacientes con CPNM de la cohorte de validación independiente (46 casos de cáncer de pulmón) en el Hospital General de Massachusetts (MGH) entre enero y diciembre de 2018.
La cohorte de descubrimiento consistió en dos grupos de control separados (Fig. 35). El primer grupo consistía en 42 donantes de sangre adultos no emparejados por riesgo ("controles de riesgo bajo"). El segundo grupo consistía en 56 adultos emparejados por edad, sexo y tabaquismo ("controles emparejados por riesgo") a los que se les realizó una tomografía computarizada de dosis baja (LDCT) negativa para cáncer de pulmón en la Universidad de Stanford y que sirvieron como grupo de entrenamiento para el clasificador de Lung-CLiP. La cohorte de validación contenía un tercer grupo de control, compuesto por 48 adultos emparejados por riesgo sometidos a cribado por LDCT en el Hospital General de Massachusetts que se inscribieron prospectivamente entre enero y diciembre de 2018. Este grupo de control sólo se contempló para la validación del modelo de Lung-CLiP.
Extracción y tratamiento de la sangre
La sangre entera recogida en tubos de K2EDTA se procesó inmediatamente o en las 4 horas siguientes a su almacenamiento a 4 °C. La sangre entera recogida en tubos de ADN libre de células BCT (STRECK) se procesó en un plazo de 72 horas. Los tubos K2EDTA se centrifugaron una vez a 1.800 x g durante 10 min y los tubos STRECK se centrifugaron dos veces a 1.600 x g durante 10 min a temperatura ambiente. Después de la centrifugación, el plasma se almacenó a -80 °C en alícuotas de 1,8 ml hasta el aislamiento del ADNlc. La sangre entera empobrecida en plasma se almacenó a - 80 °C para el aislamiento de ADN de los leucocitos.
El ADN libre de células se extrajo de 2 a 16 ml de plasma (mediana de 3,6 ml) usando el kit de ácido nucleico circulante QIAamp (Qiagen) de acuerdo con las instrucciones del fabricante. Después del aislamiento, el ADNlc se cuantificó usando el kit de alta sensibilidad de ADNbc Qubit (Thermo Fisher Scientific) y el analizador de fragmentos de NGS de alta sensibilidad (Agilent). Se extrajo ADN genómico (ADNg) de sangre entera emparejada y empobrecida en plasma (por ejemplo, "GB" o "leucocitos") usando el kit de sangre y tejido DNeasy de Qiagen, se cuantificó usando el kit de alta sensibilidad de ADNbc Qubit, y se fragmentado hasta un tamaño diana de 170 pb usando el aparato de ultrasonidos Covaris S2. Después del tratamiento por ultrasonidos, el ADNg fragmentado se purificó usando el kit de purificación de PCR QIAquick (Qiagen). Para el ADNlc, se introdujo una mediana de 38 ng (8-85 ng) en la preparación de bibliotecas. La entrada de ADN se escaló para controlar la contaminación por ADN de alto peso molecular, con una entrada diana de 40 ng de ADNlc en el intervalo de tamaño de 50-450 pb basado en los datos del Analizador de Fragmentos cuando estén disponibles. Para ADNg de leucocitos, se introdujeron < 100 ng de ADNg fragmentado en la preparación de bibliotecas.
Las consideraciones logísticas relacionadas con la recogida prospectiva de la cohorte de validación requirieron el uso de tubos de recogida de sangre STRECK, mientras que para la cohorte de entrenamiento se usaron tubos de recogida K2EDTA. El diseño del estudio evita que estas variables preanalíticas influyan en la clasificación de los casos frente a los controles, ya que todas las muestras de la cohorte de validación (por ejemplo, casos y controles) se recogieron en tubos STRECK. No obstante, para confirmar que el tipo de tubo de recogida no confunde el modelo Lung-CLiP se recogió sangre de tres donantes sanos en tubos K2EDTA y STRECK y se compararon métricas clave, incluyendo la clasificación de Lung-CLiP, la concordancia de mutaciones de ADNIc, el tamaño del fragmento, la concentración de ADNIc, la recuperación molecular y los perfiles de error y se comprobó que ninguno de ellos se veía afectado significativamente por el tipo de tubo de recogida utilizado (Fig.63 a 65).
Recogida y procesamiento de tejido tumoral
Se extrajo ADN tumoral de muestras de biopsia congeladas usando el kit de sangre y tejido DNeasy de Qiagen o de muestras de biopsia de FFPE usando el kit de FFPE de ADN/ARN AllPrep de Qiagen de acuerdo con las instrucciones del fabricante. Después de la extracción, el ADN se cuantificó y fragmentó de la misma manera que el ADNg de sangre entera empobrecida en plasma y se introdujeron < 100 ng de ADN cizallado en la preparación de bibliotecas.
Preparación y secuenciación de bibliotecas
Se desarrolló un nuevo esquema adaptador, adaptadores FLexibles con corrección de Errores dúpleX ("adaptadores FLEX"), que desacopla la porción del adaptador que contiene el código de barras molecular dúplex (por ejemplo, el identificador único o "UID") de la porción que contiene el código de barras de muestra (Fig. 2 y 3). Los adaptadores FLEX utilizan códigos de barras de muestra de 8 pb de índice doble (distancias de edición por pares > 5) y UID con corrección de errores de 6 pb (distancias de edición por pares > 3) con contenido de GC y diversidad de secuencias optimizados. Se realizan la reparación de extremos, la adición de colas A y la ligadura del adaptador siguiendo las instrucciones del fabricante del kit KAPA Hyper Prep con la ligadura realizada durante la noche a 4 °C. La ligadura del adaptador se realiza usando un adaptador en Y parcial que contiene un UID de 6 pb y el saliente T necesario para la ligadura (Fig. 3). Después de la ligadura, se realiza una limpieza de perlas usando perlas magnéticas SPRIselect (Beckman Coulter). A continuación, se realiza una "PCR de injerto" para añadir códigos de barras de muestra de 8 pb de índice doble y la secuencia adaptadora restante necesaria para crear una biblioteca de secuenciación Illumina funcional. Después de otra limpieza de perlas SPRI, se realiza la PCR universal.
Justificación de los adaptadores FLEX:Se deseaba una estrategia que permitiera flexibilidad y eficiencia en los flujos de trabajo de biología molecular y bioinformática para la secuenciación de alto rendimiento de ADN, y que protegiera simultáneamente contra dos fuentes principales de errores observados durante la secuenciación. Estas dos fuentes comprenden: (1) errores de secuenciación que dan como resultado una identificación errónea de moléculas de ADN únicas dentro de una muestra dada, y (2) posible contaminación cruzada entre muestras. La enumeración precisa de moléculas únicas observadas mediante secuenciación es importante cuando la entrada de ADN es limitada y/o se desea la identificación de eventos de baja fracción alélica, como en el caso del análisis de ADN libre de células. Una consideración importante a la hora de contar las moléculas únicas observadas en la secuenciación dirigida de alta profundidad es eliminar los duplicados de PCR para no contar una molécula única dada más de una vez. Los duplicados de PCR se identifican generalmente durante la secuenciación de ADNlc usando las posiciones genómicas inicial y final de la molécula y los códigos de barras moleculares (por ejemplo, identificador único o "UID") que se unen a cada lado de la molécula durante la ligadura del adaptador. Las moléculas con la misma posición inicial, posición final y UID se consideran duplicados de PCR y se agrupan en una "molécula única" representativa a través de un proceso conocido como "desduplicación por código de barras". Los errores en los UID introducidos durante la preparación de bibliotecas pueden conducir a un aumento artificial de la profundidad de secuenciación. Esto ocurre cuando uno o más errores en el UID de un duplicado de PCR de una molécula observada anteriormente da como resultado la clasificación errónea de la molécula como que pertenece a una familia de códigos de barras separada, provocando que la molécula no se elimine durante la desduplicación por código de barras. Se investigó si la inflación del genoma estaba dando como resultado una enumeración inexacta de las moléculas únicas de ADNlc secuenciadas. Para evaluar dicha inflación, se compararon las "distancias de edición" de UID de las moléculas de ADNlc con las mismas posiciones inicial/final con la distribución teórica que cabría esperar por azar y con la de moléculas con diferentes posiciones inicial/final. Las distancias de edición medidas representan el número de cambios de bases necesarios para cambiar un UID por otro, como puede ocurrir por errores de PCR y/o secuenciación. Se planteó la hipótesis de que si había inflación del genoma presente, se observaría un mayor número de UID separados por sólo 1 base (es decir, una distancia de edición de 1) en las moléculas con los mismos inicios/finales. De hecho, se descubrió que los UID que diferían en 1 pb estaban significativamente sobrerrepresentados cuando se comparaban moléculas de ADNlc con la misma posición inicial/final con cada una de las otras distribuciones de UID. Esto indica claramente que los errores de 1 pb pueden crear erróneamente nuevas familias de UID al usar la generación anterior de adaptadores de los presentes inventores, lo que motiva los esquemas con corrección de errores dentro de los nuevos adaptadores FLEX para suprimirlos.
A medida que se secuencie a mayores profundidades únicas, aumenta la posibilidad de que moléculas parentales distintas con las mismas posiciones inicial/final reciban el mismo UID exógeno. Una forma de mitigar dichas colisiones de códigos de barras es aumentar el número de UID utilizados. Adicionalmente, a medida que mejoran las tecnologías de secuenciación de alto rendimiento, la capacidad de secuenciar muchas muestras en paralelo (multiplexación de muestras) es cada vez más importante.
Este nuevo esquema tiene varias ventajas potenciales sobre los diseños históricos, incluyendo: (i) escalado más económico de la capacidad de multiplexación; (ii) una protección más eficiente contra la contaminación cruzada de las muestras usando códigos de barras de muestra de índice doble; (iii) aumento del rendimiento de lecturas de secuenciación desmultiplexadas usando códigos de barras de muestra con corrección de errores; (iv) eliminación más precisa de los duplicados de PCR para evitar colisiones de códigos de barras aumentando la diversidad de UID a 1.024 UID (en comparación con 256 en el esquema anterior); y (v) el uso de UID dúplex con corrección de errores protege contra la inflación de profundidad errónea que se produce cuando los errores en los UID dan como resultado la clasificación errónea de duplicados de PCR como moléculas únicas.
Después de la preparación de bibliotecas, se realiza la captura de híbridos (SeqCap EZ Choice, NimbleGen). En este estudio se utilizó un panel personalizado de 355 kb centrado en el CPNM y dirigido a 255 genes con mutaciones recurrentes en el cáncer de pulmón y 11 genes asociados canónicamente a la hematopoyesis clonal (Tabla 3). El ensayo de captura de híbridos se realizó de acuerdo con el protocolo del fabricante, con todas las operaciones a 47 °C realizadas en un termociclador. Después del enriquecimiento, las bibliotecas se secuenciaron en una HiSeq4000 de Illumina con lecturas de 2x150 pb por pares.
Análisis de datos de secuenciación y llamada de variantes
Los archivos Fastq se desmultiplexaron usando un proceso personalizado en el que los pares de lecturas sólo se contemplaban si los códigos de barras de muestra de 8 pb y los UID de 6 pb coincidían con las secuencias esperadas después de la corrección de errores. Después de la desmultiplexación, se eliminaron los UID y se recortó la lectura de adaptador del extremo 3' de las lecturas usando AfterQC para conservar los fragmentos cortos. Las lecturas se alinearon con el genoma humano de referencia (hg19, GRCh37) usando BWA ALN.
Supresión de errores y llamada de variantes:La supresión de errores mediada por código de barras molecular y el pulido de fondo se realizaron como se describió anteriormente (véase A. M. Newman,Nat. Biotechnol.(2016), citado anteriormente). Para aprovechar el perfil de error mejorado proporcionado por la captura de muestras con el eliminador de ROS hipotaurina, para el pulido de fondo se usó una base de datos de fondo construida a partir de 12 muestras de plasma de controles sanos retenidas y capturadas con hipotaurina. Después de la supresión de errores, la llamada de variantes de nucleótido único (SNV) en todo el selector se realizó como se ha descrito anteriormente usando un algoritmo de llamada de variantes personalizado y optimizado para la detección de variantes de baja frecuencia alélica a partir de datos de secuenciación profunda (véase A. M. Newman,Nat. Biotechnol.(2016), citado anteriormente). Este enfoque, denominado "llamada de variantes adaptativa", contempla la variación local y global de las tasas de error de fondo con el fin de determinar los umbrales de llamada de variantes específicos de cada posición dentro de cada muestra. Después, las llamadas de variantes adaptativas se filtraron de la siguiente manera: (I) se eliminaron las variantes de estirpe germinal identificadas en el ADNg de GB de cualquier individuo del estudio a una VAF > 25 %, (II) se eliminaron las variantes en posiciones de profundidad baja (< 50 % de la mediana de profundidad) y las que están en regiones de repetición, intrónicas, intergénicas o pseudogénicas, (III) se eliminaron las variantes que caen en regiones con poca unicidad o mapeabilidad, (IV) se eliminaron las variantes con una frecuencia alélica poblacional > 0,1 % en la base de datos gnomAD, (V) los artefactos de fondo recurrentes se eliminaron usando una lista negra específica para el espacio de secuenciación dirigida de los presentes inventores derivada de una base de datos de 430 muestras de ADNg de GB. Después de la llamada de variantes y el filtrado, se aplicaron filtros adicionales dependiendo del compartimento tisular y del análisis que se estuviera realizando (que se describen a continuación).
Genotipado tumoral
La llamada de variantes somáticas en tejido tumoral se realizó como se describe en la sección anterior, excepto por los siguientes requisitos: (1) un umbral de frecuencia alélica mínimo del 5 %, (2) las variantes pueden no estar presentes en los GB emparejados, y (3) se eliminaron las variantes en genes de hematopoyesis clonal canónicos distintos deTP53.
Detección de ADNtc con información del tumor
Para buscar en plasma la presencia de ADNtc usando mutaciones identificadas en tejido tumoral compatible, se utilizó un índice de detección de ADNtc basado en Monte Carlo (véase A. M. Newman,et al., Nat. Biotechnol.(2016), citado anteriormente). El umbral del índice de detección de ADNtc se estableció para conseguir una especificidad >95 % en 56 muestras de ADNlc de control retenidas de pacientes con exploraciones de LDCT negativas analizadas usando el mismo selector. En las muestras con ADNtc detectable, la VAF plasmática de las mutaciones se ajustó basándose en el estado del número de copias del tumor. Después, se calculó la VAF de ADNtc de cada muestra promediando las VAF de todas las variantes tumorales utilizadas para el seguimiento (incluyendo las variantes con 0 lecturas mutantes en la muestra).
El límite analítico de detección (LOD) específico del paciente se determinó como se ha descrito anteriormente (véase A. M. Newman,et al., Nat. Biotechnol.(2016), citado anteriormente). En resumen, el LOD se definió como la fracción tumoral más baja que se espera que produzca 3 o más moléculas de ADNlc que contienen mutación con una confianza del 95 % basándose en la distribución binomial, el número de mutaciones rastreadas y la profundidad molecular única.
Se realizó la secuenciación del exoma completo de ADN tumoral y de ADN leucocitario emparejado para 17 pacientes usando el reactivo de captura SeqCap EZ Exome versión 3.0 (NimbleGen) de acuerdo con el protocolo del fabricante.
Los datos de secuenciación se desmultiplexaron y se mapearon como se ha descrito anteriormente y las lecturas duplicadas se eliminaron usando 'samtools rmdup'. Las variantes de nucleótido único se llamaron usando VarScan2, Mutect y Strelka (Para más información sobre VarScan, Mutect y Strelka, véase D.C. Kobo,et al., Genome Res.22, 568-576 (2012); K. Cibulskis,et al., Nat. Biotechnol.31, 213-219
(2013); y C. T. Saunders,et al., Bioinformatics28, 1811-1817 (2012)). Después, se filtraron las variantes llamadas por > 2 llamantes que requerían: (i) VAF > 5 %,(ii) profundidad posicional > 30X tanto en tumor como en estirpe germinal, (iii) 0 lecturas de estirpe germinal, (iv) una frecuencia alélica poblacional < 0,1 % en la base de datos gnomAD, y eliminar las variantes que yacen en regiones de repetición, intrónicas, intergénicas o pseudogénicas (para más información sobre la base de datos gnomAD, véase K. J. Karczewski,et al.,bioRxiv 531210 (2019)). Después se diseñaron paneles de captura personalizados (SeqCap EZ Choice, NimbleGen), cada uno de ellos dirigido a la unión de mutaciones de 5-7 pacientes y con un tamaño que varía entre 212-487 kb. Las bibliotecas de secuenciación de tumores y leucocitos emparejados de cada paciente se volvieron a capturar usando estos paneles personalizados y las variantes tumorales se volvieron a llamar a partir de los datos de secuenciación dirigida usando la canalización CAPP-Seq convencional. Estas listas de variantes finales, dirigidas a una mediana de 68 mutaciones por paciente (intervalo 7-543), después se usaron para la detección de ADNtc.
Para buscar la presencia de ADNtc usando paneles de CAPP-Seq personalizados, el mismo enfoque de muestreo basado en Monte Carlo utilizado para la detección con información del tumor CAPP-Seq típica se aplicó a dos subconjuntos diferentes de moléculas: (i) moléculas de ADNlc para las que se observaron ambas cadenas del dúplex de ADNlc original y (ii) moléculas de ADNlc <160 pb o 230-310 pb de tamaño. Después, se combinaron estos dos valoresPusando el método de Fisher. Después, el umbral del índice de detección de ADNtc se fijó para alcanzar una especificidad > 95 % en 24 muestras de ADNlc de controles sanos analizadas usando el mismo panel de secuenciación.
Análisis de fracción de células cancerosas
Para determinar la clonalidad de las mutaciones identificadas en las muestras tumorales, se usó ABSOLUTE como se ha descrito anteriormente para estimar la fracción de células tumorales que albergan cada mutación somática (por ejemplo, fracción de células cancerosas, CCF, por sus siglas en inglés) (Para más información sobre ABSOLUTe , véase S. L. Carter,et al., Nat. Biotechnol.30, 413-421 (2012)). Se usaron como datos de entrada las llamadas de número de copias segmentadas de todo el genoma y las posiciones y las VAF de las mutaciones puntuales. Las mutaciones clonales se definieron como aquellas para las que el límite superior del intervalo de confianza de la CCF era > 0,95, mientras que las mutaciones con estimaciones de CCF por debajo de este umbral se definieron como subclonales. Si sólo se identificó 1 mutación en una muestra tumoral, esta mutación se consideró clonal, ya que no fue posible obtener una estimación de la CCF.
Análisis del tamaño de los fragmentos de ADNtc
Para comparar la distribución de tamaño de las moléculas de ADNlc derivadas de tumores y no mutantes, se analizó el plasma en busca de moléculas de ADNlc que se solaparan con las posiciones genómicas de las mutaciones identificadas en muestras tumorales emparejadas. Se extrajo el tamaño del fragmento de ADNlc (campo TLEN en SAM Spec v1.6) de cada molécula que contenía una mutación derivada de un tumor (por ejemplo, "moléculas mutantes" o "ADNtc") y de cada molécula no mutante que abarcaba el mismo locus genómico en el mismo individuo. Después se agruparon las longitudes de los fragmentos mutantes y no mutantes en todas las posiciones para generar las distribuciones de tamaños de fragmentos representadas. Se aplicó la misma metodología a las mutaciones de ADNlc identificadas después de la llamada de variantes sin exposición a tumor para generar las distribuciones de tamaños de fragmentos de mutación "CH" y "con adjudicación tumoral".
Para determinar qué ventanas de tamaño de fragmento estaban enriquecidas en ADNtc, se calculó la fracción de todas las moléculas mutantes y no mutantes que caen en una ventana deslizante de 5 pb usando la función rollapply de R (paquete zoo). Después se calculó el enriquecimiento relativo de moléculas mutantes frente a no mutantes (por ejemplo, "enriquecimiento de ADNtc") para cada tamaño de fragmento de ADNlc entre 50-500 pb.
Correlaciones clínicas de la detección de ADNtc
El volumen tumoral metabólico se determinó usando tomografía por emisión de positrones (PET) con [18F] FDG de cuerpo entero. Se determinaron el porcentaje de opacidad en vidrio deslustrado (GGO), la presencia de necrosis y la ubicación del tumor usando formación de imágenes pretratamiento con tomografía computarizada (TC) torácica realizadas por un radiólogo torácico. La GGO se definió por la presencia de turbidez, aumento de la opacidad del pulmón con conservación de los márgenes bronquiales y vasculares. El porcentaje de GGO se determinó examinando todo el volumen de la lesión en las reconstrucciones axial, sagital y coronal con el porcentaje de GOO en todo el tumor cuantificado y redondeado al cuartil más cercano. El subtipo histológico de adenocarcinoma fue evaluado por un patólogo en el subgrupo de pacientes para los que había disponible tejido tumoral fijado en formol, incluido en parafina para el análisis (48/63 pacientes con adenocarcinoma). Para el análisis univariable y multivariable, se realizó una regresión logística para asociar el estadio, el MTV y la histología no adenocarcinoma a la VAF de ADNtc media (como variable dependiente continua). El MTV y la VAF de ADNtc media se transformaron logarítmicamente para producir datos con distribución normal.
Se contemplaron los siguientes criterios de valoración de la supervivencia: (1) ausencia de recidivas (recidiva demostrada mediante radiografía o biopsia), (2) ausencia de metástasis (metástasis demostrada mediante radiografía o biopsia en un órgano distante o en el pulmón contralateral), (3) supervivencia sin recidivas (recidiva demostrada mediante radiografía o biopsia o muerte por cualquier causa), (4) supervivencia sin metástasis (metástasis demostrada mediante radiografía o biopsia en un órgano distante o en el pulmón contralateral o muerte por cualquier causa), (5) supervivencia global (muerte por cualquier causa). Los pacientes sin eventos se censaron en el último seguimiento radiográfico. Las probabilidades de supervivencia se estimaron usando el método de Kaplan-Meier y la supervivencia de los grupos se comparó usando la prueba de rangos logarítmicos. El análisis por regresión se realizó mediante el modelo de riesgos proporcionales de Cox, los valoresPseevaluaron usando la prueba de log-probabilidad y todos los valoresPfueron bilaterales. Para los análisis de regresión, se usaron las mediciones medias de VAF y volumen tumoral transformadas logarítmicamente; se realizó una transformación logarítmica para obtener datos con distribución normal. Todas las variables se normalizaron para permitir la comparación de las relaciones de riesgos y los intervalos de confianza del 95 % usando modelos de Cox.
Caracterización de la hematopoyesis clonal en ADNIc y GB
Para caracterizar la hematopoyesis clonal (CH) en los compartimentos de ADNlc y GB, las variantes se llamaron como se describe en la sección "Supresión de errores y llamada de variantes" descrita en el presente documento con los siguientes filtros adicionales: (1) se requería que las mutaciones no fueran sinónimas, excepto para el análisis de selección positiva y el análisis de distintivo mutacional, para los que también se contemplaron las mutaciones sinónimas, (2) las mutaciones se rescataron de la lista negra si se encontraban en los siguientes 12 genes asociados canónicamente a CH:ASXL1, PPM1D, DNMT3A, TET2, GNB1, CBL, JAK2, STAT3, GNAS, MYD88, SF3B1, TP53,y (3) las mutaciones en genes canónicos impulsores del cáncer de pulmón se rescataron de la lista negra si se habían observado en > 10 casos de cáncer de pulmón COSMIC (CosmicGenomeScreens v85).
Usando secuenciación de glóbulos blancos (GB) emparejados, las mutaciones identificadas en el ADNlc se marcaron como GB-, GB+ o GB-indeterminado de la siguiente manera:
(i) Una mutación se consideró GB+ si estaba por encima del fondo en los GB emparejados, según se evaluó usando el mismo enfoque de Monte Carlo utilizado para la detección de ADNtc con información del tumor y requiriendo un valorPde índice de detección < 0,05.
(ii) Una mutación se consideró GB- si había 0 lecturas de respaldo en el ADN de GB emparejado y había suficiente profundidad en el ADN de GB emparejado para identificar la mutación dada la<v>A<f>observada en plasma. Específicamente, una mutación sólo se marcó como GB- si la probabilidad de observar £ 1 lectura de respaldo en los GB era > 95 % dada la VAF de la variante en el ADNlc y la profundidad posicional en los GB.
(iii) Se consideró que una mutación era GB-indeterminada si había > 0 lecturas de respaldo
en los GB pero el valor dePde índice de detección era > 0,05 (por ejemplo, la mutación no estaba significativamente por encima del fondo en los GB) o si había 0 lecturas de respaldo pero la probabilidad de observar la mutación en los GB emparejados era < 95 % dada la VAF de la variante en el ADNlc y la profundidad posicional en los GB.
Sólo se contemplaron para todos los análisis las mutaciones identificadasde novoen el ADNlc cuya presencia en los GB emparejados pudiera evaluarse con seguridad (marcadas como GB- o GB+), con las siguientes excepciones:
(i) Para las Fig. 42 y 45, también se contemplaron las mutaciones identificadasde novoa partir de GB.
(ii) Para el análisis que compara las VAF de mutaciones encontradas en el ADNlc y los GB, se contemplaron las mutaciones llamadasde novoen cualquiera de los compartimentos (ADNlc o GB) siempre que la presencia o ausencia de la alteración pudiera evaluarse con seguridad en ambos compartimentos tisulares, como se ha detallado anteriormente. Por lo tanto, las mutaciones identificadas de novo en los GB se marcaron como ADNlc-, ADNlc+ o ADNlc-indeterminado de la misma manera que se determinó el respaldo de GB para las mutaciones de ADNlc (véase anteriormente).
El análisis por selección positiva se realizó en todas las mutaciones sinónimas y no sinónimas de ADNlc GB+ y GB-usando el paquete dNdScv R con una modificación para explicar la fracción de un gen dado cubierta por el panel de secuenciación (Para más información sobre el paquete dNdScv R, véase I. MartincorenaCell171, 1029-1041.e21 (2017)). Se consideró que los genes estaban bajo selección positiva para mutaciones no sinónimas si el valor Q reportado por dNdScv para todos los tipos de sustitución era < 0,05.
La contribución de los procesos mutacionales conocidos a las mutaciones que se observaron en el ADNlc se evaluó con el paquete R deconstructSigs usando el conjunto de distintivos COSMIC (v2) (para más información sobre el paquete R deconstructSigs, véase R. Rosenthal,et al., Genome Biol.17, 1-11 (2016)). Debido al número limitado de mutaciones por individuo, las mutaciones de todos los individuos se agruparon para evaluar los distintivos mutacionales presentes en los compartimentos GB+ y GB- para una comparación dada (por ejemplo, pacientes frente a controles, fumadores frente a no fumadores). Para evaluar la importancia estadística de las diferencias en la contribución del Distintivo 4 (fumar) a los distintos conjuntos de mutaciones, se realizaron 1.000 permutaciones por comparación de interés (pacientes GB+ frente a GB-, pacientes GB- frente a controles GB-, fumadores GB+ frente a GB-, y fumadores GB- frente a no fumadores GB-) en las que se mezclaron los marcadores de mutación y se volvieron a calcular las contribuciones de los distintivos mutacionales con deconstructSigs. Para cada permutación, la diferencia en las contribuciones del Distintivo 4 entre los dos grupos de mutación se calculó para generar una distribución nula, y se determinó un valorPempírico comparando la diferencia observada en el Distintivo 4 entre los verdaderos grupos de mutación con la distribución nula. Para corregir los conjuntos de mutaciones que tenían recuentos de marcadores desequilibrados debido a diferencias en el tamaño de la cohorte (por ejemplo, diferentes números de mutaciones en los grupos que se están comparando), el número de mutaciones se redujo al total del marcador menos representado en cada iteración antes de recalcular las contribuciones del distintivo mutacional.
Para asignar a cada mutación una puntuación que reflejara la probabilidad de que fuera el resultado de procesos mutacionales asociados al tabaquismo, se contemplaron el contexto trinucleotídico y la sustitución de bases para la mutación y, después, se extrajo el peso para ese contexto del vector Distintivo 4 de COSMIC proporcionado por deconstructSigs.
Modelo Lung-CLiP
El modelo Lung-CLiP es un marco de trabajo de clasificación conjunto que integra los resultados de dos modelos de SNV y CNV constituyentes usando cinco reglas de clasificación diferentes,5 vecinos más cercanos (5NN), 3NN, Bayes sin exposición, regresión logísticayárbol de decisión.Para el modelo de SNV se desarrolló un modelo estadístico para distinguir mutaciones de ADNlc observadas en los pacientes de las observadas en los controles. Dentro de este modelo se aprovechó un marco de trabajo deaprendizaje semisupervisadoen el que se entrena un modelo de regresión logística de red elástica para distinguir las variantes con adjudicación tumoral de las variantes sin adjudicación ("modelo con adjudicación tumoral") en el subconjunto de pacientes con tumores emparejados. Este modelo adaptado al tumor se usa para marcar variantes de pacientes sin muestras tumorales emparejadas. Después se usa el modelo de SNV para asignar puntuaciones a todas las variantes en pacientes y controles usando los marcadores asignados por el modelo con adjudicación tumoral semisupervisado. Después de asignadas las puntuaciones de las variantes, se realizó una"Caracterización de SNV del paciente"para resumir las puntuaciones de variante en cada muestra. Después, estas puntuaciones resumidas se usan en un modelo final de regresión logística de red elástica entrenado para distinguir a los pacientes de los controles. Todas estas operaciones se realizan en un marco de trabajo por exclusión de un caso a nivel de paciente anidado.
El modelo de CNV enumera las regiones genómicas alteradas usando dos listas de anotación: (1) un conjunto de ventanas de 5 MB distribuidas uniformemente por todo el genoma, y (2) regiones alteradas de forma recurrente identificadas mediante la ejecución de GISTIC2.0 en 1.017 casos de CPNM de TCGA (por ejemplo, "regiones de punto crítico") (Para más información sobre GISTIC2.0, véase C. H. Mermel,et al., Genome Biol.(2011), citado anteriormente).El número de regiones de 5 MB y las regiones "de punto crítico" de GISTIC se usan como características en el modelo de número de copias junto con una tercera característica que capta si hay enriquecimiento para regiones que se sabe que están alteradas de forma recurrente en el número de copias en el CPNM (por ejemplo, GISTIC) en contraposición a los compartimentos uniformes.
Fundamento:El método de Probabilidad de cáncer de pulmón en plasma (Lung-CLiP) se desarrolló como un enfoque probabilístico para estimar la probabilidad de que una muestra de plasma contenga ADNlc derivado de tumor sin usar el conocimiento previo de las variantes tumorales. Este enfoque implica la secuenciación profunda de ADNlc plasmático y leucocitos emparejados para el genotipado de variantes somáticas en cada compartimento, seguida de la integración de SNV y alteraciones del número de copias en todo el genoma. La clasificación de una muestra de sangre dada usando Lung-CLiP se consigue aplicando un marco de trabajo de aprendizaje automático de múltiples niveles en el que una capa de subclasificación estima inicialmente la probabilidad de que una SNV de ADNlc dada derive de tumor. Como se detalla a continuación, estemodelo de SNV(que se describe a continuación) integra características biológicas y técnicas clave específicas de cada variante individual, incluyendo las frecuencias de fondo, el tamaño del fragmento de ADNlc, la contribución del distintivo de tabaquismo, la presencia en un gen frecuentemente mutado en CPNM y la probabilidad de CH. Un segundomodelo de CNV(que de describe a continuación) enumera las alteraciones del número de copias somáticas tanto en el ADNlc como en los leucocitos con la consideración adecuada de la alteración del número de copias derivadas de CH y constitutivas. Después, un clasificador conjunto probabilístico a nivel de paciente final integra los resultados de los modelos de SNV y CNV para estimar la probabilidad de que una muestra de sangre dada contenga ADNlc derivado de cáncer de pulmón (por ejemplo, "puntuación de CLiP").
Se utilizó un diseño caso:control y un marco de trabajo de entrenamiento y de validación independiente que emplea muestras de ensayo de 254 sujetos, con casos que comprenden pacientes con CPNM localizado y controles que comprenden adultos emparejados por riesgo sometidos a cribado radiológico anual para cáncer de pulmón mediante LDCT. El clasificador de Lung-CLiP se entrenó primero usando muestras de una cohorte de descubrimiento de 160 sujetos que incluía pacientes con cáncer de pulmón y controles de riesgo alto en 4 de los 5 centros oncológicos participantes (Stanford, MDACC, Mayo y Vanderbilt, como se han descrito anteriormente); también se utilizó un conjunto adicional de 18 pacientes con CPNM con tejido tumoral disponible para el análisis en la cohorte de descubrimiento y sirvió para informar de la identificación de las características del ADNtc en los análisis con información del tumor. El entrenamiento del modelo se realizó en un marco de trabajo de validación cruzada por exclusión de un caso en la cohorte de descubrimiento y los umbrales de puntuación de Lung-CliP que alcanzaron una especificidad del 98 % y del 80 % en las muestras de entrenamiento se aplicaron a una cohorte de validación independiente. Como se ha descrito anteriormente, esta cohorte de validación independiente comprendía 94 sujetos incluyendo pacientes con CPNM (n = 46) y controles emparejados por riesgo (n = 48) con exploraciones por LDCT negativas que se inscribieron prospectivamente en una institución independiente (MGH/Harvard). Después se comparó el rendimiento del modelo en la cohorte de validación con las medidas observadas en el entrenamiento, incluyendo la sensibilidad, el AUC y la especificidad.
Modelo de SNV
Las variantes se genotipificaron y filtraron como se describe en la sección "Supresión de errores y llamada de variantes" descrita en el presente documento, con los siguientes filtros adicionales: (1) mutaciones eliminadas presentes en los GB emparejados con un valorPde índice de detección < 0,10, (2) mutaciones eliminadas en los genes CH canónicosDNMT3A, TET2, ASXL1, PPM1D, GNB1, CBL, JAK2, STAT3, GNAS, MYD88, SF3B1,(3) mutaciones rescatadas de la lista negra en los siguientes oncogenes de cáncer de pulmón si se han observado en uno o más casos de cáncer de pulmón en COSMIC (CosmicGenomeScreens v85):EGFR, KRAS,
PIK3CA, BRAF, MET, U2AF1, NFE2L2, TERT, ERBB2, HRAS, NRAS, TERT, RAF1.
En el modelo de SNV se usaron quince características, que se detallan en el presente documento por orden de importancia de característica:
(1) Fondo bayesiano de GB: Esta métrica mide la importancia de la diferencia entre la VAF de una variante en comparación con una distribución de fondo de 430 muestras de GB.
V P
Para modelar la distribución de fondo para cada variante^ c(definida por la posición genómica p y el cambio de basebe(x —> y; xt ye{A, C, G,7))), la distribución de fondo en la cohorte de muestras de GB se modeló primero
mediante una distribución Beta inflada a cero comof Pbc ~ <r 6' )>(en aras de la simplicidad, los superíndicespybese omiten a continuación). Todos los parámetros se estiman a partir de la "cohorte de fondo" ( ® ). En este modelo, se estimamcomo la fracción de muestras en el conjunto ® con esa posicióncambiada como be, conduciendo a tto = 1 - tíi.El conjuntoBndespués se limitó a las muestras con su posición p8 p,bc. 8 p,bc.alterada comobe,indicadas por Después, para cada muestra en el conjunto de fondo, / e,se generaron
I f p[bcfQ,lt.
donde ' ’ es el número de lecturas de soporte en la muestraique cubre la posiciónpcon el alelo no den t,
referencia como enbey p es la profundidad total en la muestraien la posiciónp.Un "vector de VAF de fondo informático" combinado se define como:
A continuación, los parámetros de distribución Beta global en esta posición se estimaron de la siguiente manera: se
calcularon la media y la desviación típica de y, después, se empleó el "método de los momentos" para inferirapbcy¡3p-bc.Esta distribución Beta captaría eficazmente los factores de ruido estocástico entre las muestras de fondo en la posición de interés. De manera más importante, cada muestra del conjunto de fondo tendría la misma oportunidad de contribuir (debido a las 20 extracciones aleatorias de la operación muestra-variante individual anterior).
Con esto se infiere de la "cohorte de fondo", para una variante observada connaitlecturas mutantes de respaldo ynprofundidad total(n = nref- nait)el valor de significación bayesiano se calculó comor(k a)r(n-k + j? )r (cr+ /? )
p = l — JTi X Z ¡ £ ? ( £ )r(n+a+p)r(a)r(p)TI<n>
(2) Fondo bayesiano de ADNIc: Esta métrica mide la significación de la diferencia entre la VAF de la variante en comparación con una distribución de fondo de 51 muestras de ADNlc de control retenidas ("controles de riesgo bajo" que se retienen en su totalidad de la cohorte de Lung-CLIP). Aquí se usó el mismo método descrito anteriormente pero usando las muestras de ADNIc de control retenidas como el conjunto ® .
(3) Frecuencia alélica de la variante (% de VAF): Frecuencia alélica de la variante de la variante de interés.
(4) Profundidad de estirpe germinal: La probabilidad de observar > 2 lecturas de respaldo en los GB emparejados dada la VAF de la variante en el ADNlc y la profundidad posicional de la variante en los GB.
(5) Tamaño medio de familia de códigos de barras: Tamaño de familia de código de barras promedio (por ejemplo, el número promedio de duplicados de PCR que respalda cada molécula única de ADNlc) de las moléculas de ADNlc desduplicadas por código de barras que respaldan la variante de interés.
(6) Puntuación de fragmento corto 1: Valor P calculado realizando la prueba exacta de Fisher para comparar los recuentos de lecturas mutantes y no mutantes que solapan la posición de la variante antes y después de la selección de tamaño informática para tamaños de fragmentos enriquecidos de ADNtc (< 160 pb o 230-310 pb). Los recuentos de referencia y no referencia se indicaron antes y después de la selección de tamaño informática respectivamente porIn r 'e1 f 'yn aU'■después se creó una tabla de contingencia con estos recuentos y se calculó el valor p de cualquier coasociación entre el estado de cambio de base (ref. frente a alt.) y el tamaño del fragmento de ADNlc. La característica final se define entonces como:
(7) Puntuación de fragmento corto 2: A cada molécula de ADNlc que respalda una variante se le asigna un valor de enriquecimiento basado en su tamaño de fragmento, una relación de probabilidades del tamaño de fragmento (FSLR, por sus siglas en inglés),A(s)para todos los tamaños de fragmentos, s e [30.400] se definió por primera vez como:
Pr(l= s|muíante)
<A(s) :=>Pr (í = s|£rposilvestre)
Usando datos empíricos, en primer lugar se estimaron estas cantidades y, a través de un enfoque deplug-in(extensión), se estimó la FSLR como:
r í = f / n mut
A(s) « nwt/nwt
Donde ríj= f indica el número de fragmentos con longitudl = sy una variante con adjudicación tumoral, y ríj= f indica el número de fragmentos con longitudl = scon el alelo de tipo silvestre (wt, por sus siglas en inglés) en las posiciones mutadas. En esta definición,nmutynwtindican el número total de fragmentos con el alelo mutante y de tipo silvestre (en las mismas posiciones que los fragmentos mutantes), respectivamente. A continuación, para una variante dada,Vicon fragmentos de respaldo (de tipo silvestre y mutante) { f f ...,fm}se encontraron los tamaños de fragmentos correspondientes {s1,s2, ..., sm} y después se calculó una puntuación como:
(8) Transición/transversión: Variable binaria que indica si la sustitución de bases de la variante es una transición o una transversión.
(9) Respaldo de dúplex: Número de moléculas dúplex de ADNlc que respaldan la variante de interés.
(10) Superación de corte de valores atípicos: Variable binaria que indica si la VAF de la variante de interés está por encima de un umbral de VAF definido dentro de cada muestra diseñado para identificar supuestas mutaciones de valores atípicos de VAF baja.
(11) Calidad del mapeo: La calidad promedio de mapeo de las lecturas que respaldan la variante de interés.
(12) Punto crítico de cáncer de pulmón: Característica binaria que indica mutaciones en genes impulsores del cáncer de pulmón con > 20 observaciones en mutaciones activadoras COSMIC (CosmicGenomeScreens v85) y canónicas en EGFR, KRAS, NRAS y BRAF.
(13) Error de UMI corregido: Número promedio de errores corregidos en los UID en todas las moléculas de ADNlc que respaldan una variante.
(14) Calidad Phred: Puntuación de calidad de Phred promedio en todas las bases que respaldan la variante.
(15) Posición de la variante en la lectura: La posición normalizada promedio de la variante en todas las lecturas de secuenciación que respaldan la variante.
Se entrenó un modelo en un marco de validación cruzada por exclusión de un caso para distinguir las mutaciones de ADNlc observadas en pacientes de aquellas observadas en controles en los que cada varianteSNVíjconsiste en característicasp(descritas en la sección anterior, "Características del modelo deSNV').Anidado dentro de este modelo, se utilizó un marco de trabajo deaprendizaje semisupervisadoen el que se entrenó un modelo de regresión logística de red elástica para distinguir las variantes con adjudicación tumoral de las variantes sin adjudicación ("modelo con adjudicación tumoral") en el subconjunto de pacientes en el factor de entrenamiento con tumores emparejados. Después, este modelo se utilizó para marcar variantes de pacientes sin muestras tumorales emparejadas, como se representa en la Tabla 2.
T l 2. M r v ri n i n n in m r m r l m r .
Una vez asignados los marcadores, se creó una matriz de características completa, X, combinando todas las variantes de pacientes y controles. El vector de respuesta, indicado por y, es una combinación de "marcadores fuertes" (por ejemplo, adjudicación tumoral), "marcadores intermedios" (por ejemplo, variantes de pacientes sin tumores, marcadas mediante el modelo de aprendizaje automático) y "marcadores débiles" (por ejemplo, variantes no marcadas en pacientes con tumores emparejados y variantes en controles). Con el fin de incorporar estos marcadores blandos, las muestras se pesaron de la siguiente manera: los "marcadores fuertes" tienen un marcador de 1 con un peso de 1, los "marcadores intermedias" tienen sus marcadores asignados a partir del modelo de autoentrenamiento (0 o 1) y su peso (entre 0 y 1) determinado por la confianza del modelo en el marcaje, y los "marcadores débiles" pueden tener un marcador de 0 con un peso de 1. La matriz de características de SNV y los marcadores y pesos correspondientes se usan entonces dentro de una regresión logística regularizada por Fi(por ejemplo,lassocon familia "binomial") con una validación cruzada para el parámetro de regularización. El parámetro de regularización correspondiente a la validación cruzada mínima después se usa para el modelo final. Después, el modelo entrenado se usó para puntuar todas las variantes del factor retenido (por ejemplo, las variantes de un sujeto retenido). De manera destacada, se usó una validación cruzada anidada para garantizar que no se observan variantes en la muestra retenida antes de la clasificación supervisada de pacientes usando las puntuaciones de variantes (que se describen a continuación). Dentro del marco anidado de exclusión de un caso, una vez asignadas las puntuaciones de las variantes a todas las variantes de los factores de entrenamiento y de retención, se realizó una"Caracterización de SNV del paciente"para resumir las puntuaciones de variante en cada muestra de la siguiente manera:
Para cada muestra j se generó un vector de puntuaciones, uno para cada SNV,sj= [s/01, ... ,sjnj]donden jes un número no negativo que indica el número total de variantes de la muestra que pasan por el esquema de clasificación. una transformación para convertir cada vector de muestra en un conjunto de 13 características se definió como:f: sj^xj e Rpdondepes el número de características que pueden utilizarse para la clasificación de pacientes. Puesto que la dimensión del vector de entrada varía de una muestra a otra (por ejemplo, el número de SNV observadas en cada muestra difiere), se utilizó un conjunto de estadísticas de resumen como la funciónf.Estas características se resumen a continuación:
donde |.| indica la cardinalidad del conjunto, . indica el promedio, s/,(1) indica la estadística de orden más grande y s/,(2) indica la segunda estadística de orden más grande. En los casos con cero variantes, se usó 0 como valor para cada estadística de resumen. En los casos con una variante, se usó 0 como valor para s/,(2). Además de estas estadísticas de resumen, se definieron tres características adicionales que enumeran variantes: (1) sustituciones de cambio de base predominantemente asociadas al distintivo mutacional del tabaquismo (Distintivo 4; C>A/G>T), (2) sustituciones de cambio de base asociadas al distintivo mutacional del envejecimiento (Distintivo 1; C>T/G>A), y (3) el recuento a nivel de paciente de las mutaciones depunto crítico de cáncer de pulmóncon estas características indicadas por
tj C>A , O T
t í
1 y\SNVpuntocrítico]respectivamente.
Después se usó una red elástica (cona= 0,5) para puntuar a cada individuo usando las 13 características de resumen de variantes. Se ejecutó la red elástica 30 veces con remuestreobootstrapde muestras (por ejemplo,baggingde muestras de entrenamiento) y se tomó la puntuación promedio como puntuación final. En cada ejecución de la red elástica, se realizó un CV-glmnet para obtener el mejor parámetro de regularización. Este modelo conduce a una
puntuación de clasificación de pacientes basada en SNV, indicada porS[NVpara la muestra i.
Modelo de CNV
Para el modelo de número de copias, se usaron dos listas de anotación: (1) un conjunto de ventanas de 5 MB distribuidas uniformemente por todo el genoma, y (2) regiones alteradas de forma recurrente identificadas mediante la ejecución de GISTIC2.0 en 1.017 casos de CPNm de TCGA (por ejemplo, "regiones de punto crítico"). Después, se llamaron alteraciones del número de copias en estas regiones como se describe en la sección "Detección de la variación del número de copias en todo el genoma a partir de secuenciación dirigida" y se aplicaron los siguientes filtros para eliminar el ruido de fondo y los eventos de número de copias constitutivos o derivados de CH (nótese que para los filtros basados en la puntuación Z se contempla la direccionalidad de la alteración):
I. Requerir que el valor absoluto de la puntuación Z del número de copias sea > 2,58
II. Eliminar las alteraciones observadas en > 20 % de las muestras de ADNlc de control retenidas (n = 42) con una puntuación Z absoluta > 2,58
III. Eliminar las alteraciones observadas en los GB emparejados con una puntuación Z > 2,58
IV. Requerir una diferencia absoluta > 0,5 entre las puntuaciones Z del ADNlc y de la estirpe germinal
V. Requerir valor p de fondo de estirpe germinal < 0,05
VI. Requerir valor p de fondo de control < 0,05
VII. Eliminar cualesquier alteraciones en el cromosoma 19
El número de regiones de 5 MB y las regiones de "punto crítico" de GISTIC que superan estos umbrales se usan como características en el modelo de número de copias. Además de estos recuentos, se definió una tercera característica que capta si hay enriquecimiento para regiones que se sabe que están alteradas de forma recurrente en el número de copias en el CPNM (por ejemplo, "puntos críticos") en contraposición a los compartimentos uniformes. Esta característica se define como el valor P con distinción por el enriquecimiento 10 veces de log-razón de probabilidad derivado de una prueba exacta de Fisher para comparar el número de compartimentos alterados de 5 MB (500 compartimentos en total) con el número de compartimentos alterados de GISTIC (85 compartimentos en total). Se usaron estas tres variables: (1) recuento filtrado de CNV de 5 MB (2) recuento filtrado de CNV de GISTIC y (3) valor P de Fisher, como características en un modelo lineal generalizado (por ejemplo, "modelo de CNV"). Este modelo^CNV
conduce a una puntuación indicada por * para cada muestra i en el modelo Lung-CLIP final.
Clasificador de Lung-CLiP integrado
Por último, los dos modelos anteriores (modelos de SNV y CNV) se combinaron para construir el modelo de clasificación por Probabilidad de cáncer de pulmón en plasma (Lung-CLiP) que genera una probabilidad de que una muestra de plasma dada contenga ADNtc de cáncer de pulmón. En este caso se usan cinco variables derivadas deS N V $ C N V
los modelos de SNV y CNV donde1y f indican las puntuaciones de clasificación de pacientes basadas en SNV y CNV para la muestrai, abs(.)indica el valor absoluto, |.| indica la cardinalidad del conjunto, y cada muestra se codifica mediante:
compuesto
Xi §SNV ^cnvmáx (a b s (S iNV),a b s(S‘[nv) ) , máx(SfNV<c^nv ^ j^Punto crítico de SNV>
Después se usó un clasificador conjunto para asignar a cada individuo una puntuación de Lung-CLiP final de la siguiente manera. Se desarrolló un clasificador conjunto que usa cinco reglas de clasificación diferentes:5 vecinos más cercanos (5NN), 3NN, Bayes sin exposición, regresión logísticayárbol de decisión.Además de las normas de clasificación, también se realizó unbaggingde muestras mediante remuestreobootstrapde las muestras. Después, cada regla de clasificación se penaliza de acuerdo con su variación en la etapa debagging.Todas las puntuaciones penalizadas se combinaron linealmente para estos clasificadores.
Detección de la variación del número de copias en todo el genoma a partir de secuenciación dirigida
Para identificar variantes del número de copias (CNV), se utilizaron las lecturas en la diana y fuera de ella de CAPP-Seq. En resumen, cada biblioteca en el flujo de trabajo de CAPP-Seq recibe normalmente aproximadamente de 30 a 60 millones de lecturas de extremo pareado. Estas lecturas se mapean en el genoma humano (construcción hg19, GRCh37), con aproximadamente del 60 % al 80 % de las lecturas en las coordenadas genómicas dirigidas ("lecturas en la diana"). El resto, aproximadamente del 20 % al 40 %, está formado principalmente por lecturas que corresponden al resto del genoma humano ("lecturas fuera de la diana"). Para combinar los datos de alta profundidad en el espacio de secuenciación dirigida con los datos de profundidad baja en el espacio fuera de la diana, cada uno de estos conjuntos de lecturas se trató por separado, seguido de integración estadística.
Para detectar CNV en el espacio de secuenciación dirigida, se generó un vector de profundidades a nivel de posición normalizadas de la siguiente manera. A partir de archivos BAM duplicados por código de barras, se realizó lo siguiente: (1) generar un vector de profundidad en cada posición en el selector usando "bedtools genomcov"; para un selector de aproximadamente 355 kb, el resultado es un vector de 355.000 por 1; (2) normalizar este vector a la mediana del valor; y (3) realizar la corrección de GC. La corrección de GC se realizó de la siguiente manera: en primer lugar, a cada posición del selector se le asignó un valor de contenido de GC basado en una ventana de 201 pb que rodeaba la posición en el genoma. Después se realizó un ajuste LOESS de la profundidad trazando la profundidad frente al contenido de GC; este ajuste LOESS después se usó para eliminar el sesgo de GC. Después de la corrección de GC, cada muestra se normalizó (4) a una mediana del vector de profundidad derivado de 12 muestras de ADNlc de control retenidas. Por último, para eliminar los efectos de lote observados en cada carril de secuenciación, (5) se realizó un ajuste LOESS de cada muestra en el carril de secuenciación frente a la profundidad de la mediana de todas las muestras restantes en el ciclo de secuenciación. Después se calculó el log2 de este valor; este valor, el log2 de la relación del número de copias (L2CNR), que refleja el estado de número de copias normalizado de cada muestra en cada posición del espacio en la diana.
El vector L2CNR en la diana se centra en cero, limitado por - y infinito, con varianzao2.Para obtener un nivel estadístico de confianza del estado de alteración del número de copias de cada posición, es necesario estimaro.Dada una nueva muestra, con M posiciones en la diana, que tiene un perfil de CN desconocido, se calcula un vector:
donde cada posición, i e {1, ...,M} tiene un L2CNR que puede describirse como extraído de una distribución normal centrada enp¡(el verdadero log2 del número de copias) con desviación típicao¡.Se ha supuesto que todas laso'sson iguales, es decir,o¡=oj=o, Vi,j e{1, ..., M}. Para estimar la desviación típica a nivel de muestra o, se supuso que en el subvector[L2CNRm,...,L2CNRm+k], pm= pm+1 = ■■■ =pnm+kpara valores pequeños de k. Es decir, el verdadero L2CNR para dos posiciones será el mismo a través de pequeñas regiones en el espacio genómico. Por lo tanto, la desviación típicaoen todo el subvector[L2CNRm,... ,L2CNRm+k]representa una estimación de la desviación típica de toda la muestra. Se utilizó un subvector de k = 5.000 posiciones continuas en el espacio selector para estimar la desviación típica; tomando la mediana de 10.000 submuestreos de este tipo como estimación final de la desviación típica de una muestra dada. Por último, se obtuvo una puntuación z a nivel de posición, zL2CNR, en cada muestra:
zL2CNRi proporciona, por lo tanto, una estimación del estado del número de copias de cada posición, centrado en 0, con desviación típica 1, es decir, distribución normal típica. Esta producción de puntuaciones z permite que las muestras sean comparables entre diferentes profundidades de secuenciación. Un procedimiento similar permite asignar una puntuación z a regiones de cualquier tamaño del espacio en la diana.
Para identificar CNV en el espacio fuera de la diana, a partir de archivos BAM desduplicados por samtools ("samtools rmdup"), se realizó lo siguiente: (1) dividir el genoma en ventanas de 100 kb; (2) contar el número de lecturas fuera de la diana que caen en cada ventana y normalizar para el número total de lecturas de secuenciación de la muestra. Después, los recuentos de lecturas normalizados por ventana (3) se corrigen para el contenido de GC mediante regresión LOESS y se normalizan con el recuento de lecturas esperado de una cohorte de 12 muestras de ADNlc de control retenidas. (4) Después, se excluyen las ventanas que contienen las coordenadas del nuestro panel de secuenciación dirigida de los presentes inventores o que presentan una varianza alta entre una cohorte de 12 muestras de ADNlc de control retenidas. Este vector de recuentos de lectura normalizados por ventana se expresa como una relación de número de copias log2 (L2CNR) con respecto a muestras de control diploides normales. Similar al tratamiento de CNV en la diana, cada compartimento de 100 kb contiene ahora un valor de L2CNR, centrado en 0, limitado por - y infinito, con varianza a2. En este caso, cada casilla se trató de forma similar a una posición en el espacio de secuenciación en las diana, y la varianza a nivel de muestra se descubrió tomando vectores submuestreados de 100 casillas contiguas en todo el genoma (es decir, k = 100) y tomando la desviación típica. Este submuestreo se realizó 10.000 veces, representando la mediana la estimación de los presentes inventores de la varianza de toda la muestra. Dividir el vector de compartimento de 100 kb de L2CNR por esta estimación deaproporcionó zL2CNR a nivel de compartimento, centrado en 0 con desviación típica de 1.
Para combinar las estimaciones del estado del número de copias a partir de datos dentro y fuera de la diana, el genoma se compartimentó primero en regiones de 5 MB. Después se calculó una puntuación z para el estado del número de copias a partir de las bases en la diana contenidas dentro de esa región de 5 MB y los compartimentos de 100 kb fuera de la diana contenidos dentro de esa región de 5 MB. Después, estas dos estimaciones de puntuación z se combinaron mediante el método de Stouffer, proporcionando una única puntuación z unificada para el estado del número de copias de una región dada de 5 MB.
Ajuste del estado del número de copias para la detección de ADNtc con información del tumor
Al realizar la detección de ADNtc con información del tumor, se ajustó la frecuencia alélica de la variante (VAF) plasmática de 1) mutaciones subclonales y 2) mutaciones que solapaban regiones del tumor con alteraciones significativas del número de copias. Para determinar la clonalidad de las mutaciones identificadas en las muestras tumorales, se usó ABSOLUTE para estimar la fracción de células tumorales que albergan cada mutación somática (es decir, fracción de células cancerosas, CCF). Las mutaciones para las que el límite superior del intervalo de confianza de la CCF era < 0,95 se consideraron subclonales y la VAF plasmática de estas mutaciones se multiplicó por 1/CCF (donde CCF = la fracción de células cancerosas de la mutación).
Además, la VAF plasmática de las mutaciones que solapaban regiones del tumor se ajustó con alteraciones significativas del número de copias. Este ajuste sólo se realizó si se observaba una mutación tumoral en el plasma y la mutación se solapaba con una región del tumor con número de copias alterado con una puntuación Z de valor absoluto > 2,58 (es decir, una tasa teórica de falsos positivos del 1 % para la detección de CNV) y una relación del número de copias log2 absoluta (L2CNR) > 0,25 (los detalles sobre estas métricas se proporcionan en la "Detección de la variación del número de copias en todo el genoma a partir de secuenciación dirigida"). La VAF de las mutaciones que caen en dichas regiones se ajustó de la siguiente manera:
I. La pureza tumoral de las muestras se calculó como 2 veces la VAF media de todas las mutaciones que caían en regiones de copia neutra. Si no existían mutaciones en las regiones de copia neutra, se usó ABSOLUTE para estimar la pureza tumoral como se describió anteriormente7 con llamadas de número de copias segmentadas en todo el genoma y las posiciones y VAF de mutaciones puntuales utilizadas como entrada.
II. Se supuso lo siguiente:
a. Las mutaciones en las regiones suprimidas no se encontraban en el alelo suprimido (de lo contrario no se observarían).
b. Se asumió que las mutaciones en regiones amplificadas estaban en el alelo amplificado si 2 veces la VAF de la mutación era mayor que la pureza tumoral.
c. Se asumió que las mutaciones en regiones amplificadas no estaban en el alelo amplificado si 2 veces la VAF de la mutación era menor que la pureza tumoral (si el alelo WT está amplificado).
III. Después se usó el estado del número de copias (CNS) del alelo con número de copias alterado en el tumor para calcular un factor de ajuste, que se utilizó para ajustar la VAF de la mutación observada en el plasma de la siguiente manera:
a. El CNS se define como:
i.
CNS = (2AL2CNR) * 2 - 1
b. Si una mutación cae en una región suprimida en el tumor:
i. factor de ajuste = VAF*CNS de mutante
c. Si una mutación cae en una región amplificada en el tumor en el alelo amplificado:
i. factor de ajuste = VAF/CNS de mutante
d. Si una mutación cae en una región amplificada en el tumor en el alelo no amplificado
i. factor de ajuste = VAF*CNS de mutante
Después de este ajuste basado en el estado del número de copias del tumor, la fracción alélica de ADNtc de cada muestra se calculó promediando las fracciones alélicas de todas las variantes tumorales utilizadas para el control.
Simulación informática del flujo de trabajo de biología molecular de CAPP-seq
Para optimizar la recuperación de equivalentes genómicos de CAPP-Seq, se desarrolló una simulación idealizada del flujo de trabajo de biología molecular, partiendo de moléculas de ADN libres de células plasmáticas y terminando con lecturas de secuenciación. Este modelo, basado en el muestreo binomial estocástico, permitió simular diferentes condiciones de biología molecular y estimar el número de moléculas únicas observadas por secuenciación en cada etapa. Para los fines de este modelo, se contempló un selector de CAPP-Seq genérico dirigido a una porción de 200 kb del genoma humano. Suponiendo una masa total de entrada de 32 ng de ADNlc extraído aleatoriamente del genoma humano (estimado en 3x109 pb de tamaño de un complemento haploide) y un tamaño promedio de molécula de ADNlc de 170 pb, se esperaba tener un total de:
109g 1 m ol pb m olécula de ADNlc6,02 * 1023m oléculas 2* 105enbases diana32n g de ADNlc
n g 650 g 170 pb m ol3 *109 bases en el g en o m a
En el modelo informático, cada una de estas moléculas de ADNlc se contempló independientemente. Además, se supuso que cada molécula de ADNlc tenía una cadena superior y otra inferior (es decir, cadena "Watson" y "Crick"), que se contemplan independientemente. Para explicar la observación de que determinadas moléculas no pueden recuperarse como dúplex (por ejemplo, Watson y Crick no pudieron recuperarse a pesar de la sobresecuenciación), en el modelo se incluyó una "tasa de mellas" monocatenarias del 30 %. El modelo contempla las siguientes operaciones, con las eficiencias mostradas:
Etapa Eficiencia
"Tasa de mellas" de ADNmc 0,3
Ligadura del adaptador 0,9
Amplificación de biblioteca (8 ciclos) 1,5
Limpieza 0,7
Fracción de ADN en captura 0,083 - 1
Eficiencia de captura 0,075 - 0,75
Amplificación de biblioteca (15 ciclos) 1,8
Limpieza 0,7
En este caso, la "eficiencia" se definió como la probabilidad de que una molécula supere satisfactoriamente la etapa de flujo de trabajo. Por ejemplo, la eficiencia de 0,8 para la ligadura de adaptadores implica que cada molécula individual tiene un 80 % de posibilidades de ligar adaptadores satisfactoriamente. Para operaciones de amplificación, una eficiencia de 1,5 implica que cada ronda de PCR da como resultado, en promedio, un aumento del 50 % en el ADN, por lo tanto, cada molécula tiene un 50 % de posibilidades de amplificarse en cada ciclo. En este caso, la eficacia de cada operación se estimó a partir del conocimiento previo del flujo de trabajo de CAPP-Seq y de las concentraciones esperadas de ADN. De manera notable, no había una estimación fiable de la eficiencia de la captura de híbridos, por lo tanto, se contempló un intervalo de eficiencias de captura. La "secuenciación" se modela reduciendo el muestreo del grupo de moléculas finales a un número fijo de moléculas.
En este modelo informático, cada cadena de ADN original (por ejemplo, cada cadena "Watson" y "Crick") de una molécula de ADN dúplex original se contempló independientemente. A través de cada operación del flujo de trabajo, se rastrea el número de duplicados de PCR de cada cadena Watson y Crick original de ADN, con amplificación y reducción del muestreo mediante la función "binornd" de MATLAB para muestreo binomial.
Se realizaron múltiples simulaciones del modelo, variando la cantidad de biblioteca de precaptura que entra en la captura del 8,3 % al 100 %. Para determinar la profundidad molecular única esperada y la profundidad dúplex de cada ejecución del modelo, se supuso una cobertura uniforme de las moléculas de 170 pb en todo el selector de 200 kb. Por lo tanto, la profundidad molecular única estimada se calculó como:
N. ° de (W atsons orig in a les O Cricks o rig in a les) * 170pb
200000 pb
Y la profundidad dúplex se estimó como:
N. ° de (W atsons o rig in a les y Cricks o rig in a les )*170 pb
200000 pb
PCR digital en gotitas
Se realizó una validación ortogonal de 15 mutaciones de ADNlc GB+ observadas en un subconjunto de pacientes y controles usando PCR digital en gotitas (ddPCR, por sus siglas en inglés). La ddPCR se realizó en un instrumento Bio-Rad QX200 usando reactivos, cebadores y sondas obtenidos en Bio-Rad. Se validaron cuatro mutaciones privadas, así como dos mutaciones de punto crítico recurrentes enDNMT3AyJAK2que se observaron en 11 muestras de ADNlc. Se observó que el 100 % (15/15) de las mutaciones sometidas a ensayo se validaron mediante ddPCR tanto en el ADNlc como en los compartimentos de ADNg de GB y que las VAF cuantificadas mediante CAPP-Seq y ddPCR estaban significativamente correlacionados (Fig. 66A).
Análisis estadístico de datos
Los análisis estadísticos se realizaron en R (versión 3.4.0 y 3.5.2) y MATLAB (R2018a) y GraphPadPrism7 (versión 8.3.0). El marco de trabajo de clasificación de Lung-CLiP emplea los paquetes de R glmnet, caret, ETC, pROC, survival, optparse y MASS. Las pruebas estadísticas utilizadas incluyen: prueba de suma de rangos de Wilcoxon (bilateral), prueba t pareada (bilateral), prueba exacta de Fisher, correlación de Pearson, correlación de Spearman y modelo de riesgos proporcionales de Cox. Al evaluar la concordancia mediante la correlación de Pearson o Spearman, la significación estadística se evaluó mediante una prueba F. Las probabilidades de supervivencia se estimaron usando el método de Kaplan-Meier y la supervivencia de los grupos de pacientes basándose en los niveles de ADNtc se comparó usando la prueba de rangos logarítmicos. El análisis multivariable de las correlaciones clínicas de los niveles de ADNtc se realizó mediante regresión logística. Los intervalos de confianza para las estimaciones de sensibilidad y AUC se generaron mediante 1.000 remuestreosbootstrapde las puntuaciones de clasificación de Lung-CLiP en las cohortes de entrenamiento y validación. Se realizó un análisis de potencia para determinar el tamaño adecuado de la cohorte de validación de Lung-CLiP. Suponiendo una especificidad del 98 % determinada en la cohorte de entrenamiento, se calculó que 48 controles tendrían una potencia del 80 % para detectar que la especificidad verdadera es >= 90 % (prueba binomial de 1 rama con alfa unilateral = 0,05). La significación estadística para la detección de ADNtc con información del tumor se determinó con un índice de detección de ADNtc basado en Monte Carlo. La significación estadística de la contribución del distintivo mutacional del tabaquismo a los conjuntos de mutaciones seleccionados se realizó permutando los marcadores de SNV.
T l . R m n l r APP- n r n PNM.
continuación
Esta tabla enumera los 266 genes parcial o totalmente cubiertos por el selector de CAPP-Seq de 355 kb utilizado en este estudio.
Tabla 4. Puntuaciones de Lung-CLiP para pacientes con CPNM y controles emparejados por riesgo en las cohortes de entrenamiento validación.
(continuación)
(continuación)
(continuación)
(continuación)
(continuación)
(continuación)
Edad Estadio Puntuación Cohorte<Tipo de>
sujeto (años)Sexo Histología (AJCC v7)<Fumador>de Lung-CliP validación CPNM 74 F Adenocarcinoma IA sí 0,9147 validación CPNM 72 M Carcinoma epidermoide IA sí 0,3510 validación CPNM 54 F Carcinoma epidermoide IIIB sí 0,9867 validación CPNM 52 M Adenocarcinoma IB sí 0,0641 validación CPNM 73 F Adenocarcinoma IA sí 0,6802 validación CPNM 65 M Adenocarcinoma IB sí 0,7301 validación CPNM 61 F Adenocarcinoma IA sí 0,5750 validación CPNM 76 F Carcinoma epidermoide IA sí 0,7319 validación CPNM 83 F Adenocarcinoma IA sí 0,8739 validación CPNM 64 F Adenocarcinoma IIB sí 0,2511 validación CPNM 77 M Carcinoma epidermoide IB sí 0,9652 validación CPNM 64 F Adenocarcinoma IB sí 0,6819 validación CPNM 62 F Adenocarcinoma IA sí 0,2256 validación CPNM 64 M Adenocarcinoma IIB sí 0,6970 validación CPNM 69 F Adenocarcinoma IA sí 0,2080 validación CPNM 77 F Carcinoma epidermoide IB sí 0,9827 validación CPNM 75 M Adenocarcinoma IA sí 0,2080 validación CPNM 72 F Adenocarcinoma IA sí 0,8678 validación CPNM 57 F Adenocarcinoma IIB sí 0,2362 validación control 75 M - - sí 0,6583 validación control 64 M - - sí 0,2602 validación control 75 M - - sí 0,5772 validación control 60 M - - sí 0,8097 validación control 67 F - - sí 0,8300 validación control 63 M - - sí 0,2358 validación control 65 F - - sí 0,5041 validación control 62 M - - sí 0,4063 validación control 59 F - - sí 0,8967 validación control 61 M - - sí 0,6287 validación control 67 F - - sí 0,3789 validación control 66 M - - sí 0,5077 validación control 61 F - - sí 0,4070 validación control 66 M - - sí 0,4900 validación control 68 F - - sí 0,7600 validación control 62 F - - sí 0,1964 validación control 74 F - - sí 0,6672 validación control 59 F - - sí 0,9133 (continuación)
Ejemplo 2: Puntuación de Inicio: Análisis de la posición genómica de las lecturas de secuenciación para detectar ADN tumoral circulante
El análisis del ADN libre de células (ADNlc) es una técnica importante en oncología, con aplicaciones para la detección del cáncer, el control de la terapia y el genotipado mutacional. En este caso, usando datos de secuenciación de ADNlc dirigida, se ha descubierto que existen diferencias estereotipadas en las posiciones genómicas inicial y final de los fragmentos de ADNlc cuando se comparan pacientes con cáncer de pulmón y controles sin cáncer. En consecuencia, las posiciones genómicas inicial y final de un ADNlc pueden utilizarse para ayudar a diagnosticar el cáncer de pulmón en un individuo. Por ejemplo, las posiciones genómicas inicial y final de un conjunto de moléculas de ADNlc de una muestra biológica de un individuo pueden usarse como un conjunto de características de entrada que han de analizarse usando un clasificador de aprendizaje automático entrenado para diagnosticar el cáncer de pulmón en el individuo.
Métodos
Se secuenció ADNIc de pacientes con cáncer de pulmón y controles sin cáncer en cohortes de entrenamiento y validación que se describen a continuación mediante CAPP-Seq con una profundidad molecular única alta, con profundidades de 23.570x/5.012x (nominal/única) para los casos y 19.534x/4.075x para los controles emparejados por riesgo. Las muestras se secuenciaron y los datos de secuenciación se procesaron de la siguiente manera: Antes de la secuenciación, el enriquecimiento por captura de híbridos se realizó usando un panel personalizado de 355 kb centrado en el CPNM y dirigido a 255 genes con mutaciones recurrentes en el cáncer de pulmón y 11 genes asociados canónicamente a la hematopoyesis clonal. Las lecturas de secuenciación se mapearon en el genoma humano (hg19, GRCh37), seguido de la eliminación de duplicados por PCR mediada por código de barras para obtener un recuento preciso del número de fragmentos únicos en cada posición genómica. Después de la desduplicación, el número de fragmentos que comienzan y terminan en cada posición en cada muestra se evaluó en los casos de entrenamiento y en los controles, normalizando por el número total de fragmentos * 1.000.000 (por ejemplo, recuentos por millón (RPM)). Dicho de otro modo, se determinó un conjunto de medidas cuantitativas de RPM inicial mediante el número de fragmentos que comienzan en cada posición en cada muestra en los casos de entrenamiento y los controles, normalizado por el número total de fragmentos * 1.000.000. De manera similar, se determinó un conjunto de medidas cuantitativas de RPM final mediante el número de fragmentos que terminan en cada posición en cada muestra en los casos de entrenamiento y los controles, normalizado por el número total de fragmentos * 1.000.000.
En primer lugar, se analizaron los datos de secuenciación de ADNlc de una cohorte de entrenamiento de 104 pacientes con cáncer de pulmón y 56 controles emparejados por riesgo utilizados para establecer el modelo de Probabilidad de cáncer de pulmón en plasma (Lung-CLiP) descrito en el Ejemplo 1. Para cada muestra, el número de fragmentos de ADNlc que comienzan y el número que terminan en cada coordenada genómica seleccionada para la secuenciación se evaluó con una resolución de pares de bases. Después se evaluaron las diferencias cuantitativas en la frecuencia de fragmentos con una posición inicial o final dada (cuantificadas como RPM, como se ha descrito anteriormente) comparando los casos de cáncer de pulmón y los controles emparejados por riesgo. Por último, después de identificar posiciones genómicas enriquecidas en posiciones inicial o final de fragmento en pacientes con cáncer de pulmón, se creó un clasificador para distinguir a los pacientes con cáncer de pulmón de los controles emparejador por riesgo de la cohorte de entrenamiento. El clasificador se aplicó a dos cohortes de validación independientes, la primera, compuesta por 46 pacientes con cáncer de pulmón y 48 controles emparejados por riesgo (la misma cohorte de validación contemplada en el estudio Lung-CLiP), así como una 2.a cohorte de validación independiente (una nueva cohorte no contemplada en el estudio Lung-CLiP) compuesta por 24 pacientes con cáncer de pulmón y 54 controles de riesgo bajo (controles no emparejados por edad e historial de tabaquismo).
Resultados
En todo el panel de secuenciación se observó una naturaleza sorprendentemente estereotipada de las posiciones iniciales de los fragmentos (Fig. 67). Posiciones genómicas específicas permitieron distinguir los casos (por ejemplo, pacientes con cáncer de pulmón) de los controles de riesgo comparable, con una resolución de un solo par de bases. Se realizaron tres pruebas estadísticas separadas sobre los RPM de la posición inicial en cada posición. En primer lugar, se realizó una prueba t sobre la distribución de los RPM iniciales entre casos y controles. En segundo lugar, se evaluó la correlación de los RPM iniciales con la frecuencia alélica de la variante de ADN tumoral circulante (ADNtc), según se evaluó mediante SNV con información del tumor en el subconjunto de pacientes con tejido tumoral disponible. Por último, se evaluó la correlación de los RPM iniciales con el volumen tumoral metabólico (MTV). Los tres valores p de estas pruebas estadísticas se combinaron mediante el método de Fisher. Las posiciones con un valor P estadísticamente significativo (es decir, < 0,05) se seleccionaron como informativas para separar los casos de los controles. En total, se identificaron 8.192 posiciones de este tipo en los resultados de la secuenciación.
El conjunto de medidas cuantitativas de recuentos por millón (RPM) iniciales en las 8.192 posiciones informativas se sumaron para crear una "Puntuación de Inicio" para una muestra dada, que pueden usarse para clasificar o distinguir a los pacientes con cáncer de pulmón de los controles sin cáncer. De manera destacada, la Puntuación de Inicio se correlacionó con mediciones biológicas de carga de enfermedad, incluyendo la fracción alélica tumoral de ADNtc y el volumen tumoral metabólico (Fig. 68). Por lo tanto, la Puntuación de Inicio puede analizarse para determinar la fracción alélica tumoral de ADNtc y/o el volumen tumoral metabólico de una neoplasia (por ejemplo, cáncer de pulmón).
También se evaluó la correlación entre la Puntuación de Inicio y Lung-CLiP. De manera interesante, mientras que la Puntuación de Inicio se correlacionó significativamente con las puntuaciones de Lung-CLiP en la cohorte de entrenamiento, la correlación disminuyó en el conjunto de validación, lo que indica que el posicionamiento del inicio del fragmento representa una característica biológicamente ortogonal para los SNV y SCNA con una utilidad de clasificación independiente (Fig. 69).
Se evaluó la utilidad de la Puntuación de inicio para distinguir pacientes con cáncer de pulmón de controles sin cáncer en tres cohortes separadas, incluyendo la cohorte de entrenamiento y dos cohortes de validación independientes. Las Puntuaciones de Inicio fueron más altas en los pacientes con cáncer de pulmón que en los controles de cada cohorte sometida a ensayo (Fig. 70). De manera destacada, el rendimiento de la Puntuación de Inicio para distinguir a los pacientes con cáncer de pulmón de los controles fue similar en las cohortes de entrenamiento y de validación (AUC = 0,82 en el entrenamiento, AUC = 0,86 en el conjunto de validación 1, 0,80 en el conjunto de validación 2) (Fig. 71 y 72).
Claims (12)
1. Un método para preparar una biblioteca de ADN para secuenciación, comprendiendo el método: ligar en una pluralidad de segmentos de ácido nucleico pares de adaptadores en Y parciales para flanquear cada uno de la pluralidad de segmentos de ácido nucleico por un par de adaptadores en Y parciales, produciendo de este modo una pluralidad de productos de ligadura,
en donde cada uno de la pluralidad de segmentos de ácido nucleico es ADN, y en donde la pluralidad de segmentos de ácido nucleico se obtiene o deriva de una muestra biológica,
en donde cada uno del par de adaptadores en Y parciales comprende un identificador único flanqueado por una secuencia de desplazamiento de 1 pb y una secuencia de escalonamiento de 0-3 pb, y secuencias para que un cebador se hibride en una reacción en cadena de la polimerasa de injerto,
en donde el par de identificadores únicos en cada uno de la pluralidad de segmentos de ácido nucleico proporciona colectivamente una identificación única de los segmentos de ácido nucleico frente a otros segmentos de ácido nucleico en la pluralidad de segmentos de ácido nucleico, y
injertar en cada uno de la pluralidad de productos de ligadura un par de códigos de barras de muestra de índice doble para flanquear el producto de ligadura por los códigos de barras de muestra de índice doble, en donde los códigos de barras de muestra de índice doble proporcionan colectivamente una identificación única de la muestra biológica.
2. El método de la reivindicación 1, en donde el segmento de ácido nucleico es ADN complementario (ADNc).
3. El método de las reivindicaciones 1 o 2, en donde la muestra biológica comprende una muestra de ADN libre de células.
4. El método de acuerdo con una cualquiera de las reivindicaciones 1 a 3, en donde los códigos de barras de muestra de índice doble proporcionan colectivamente la identificación única de la muestra biológica frente a otras muestras biológicas representadas en la biblioteca de ADN.
5. El método de acuerdo con una cualquiera de las reivindicaciones 1 a 4, en donde el identificador único tiene 3 pb, 4 pb, 5 pb, 6 pb, 7 pb u 8 pb.
6. El método de acuerdo con una cualquiera de las reivindicaciones 1 a 5, en donde el identificador único tiene 6 pb.
7. Uso de una colección de moléculas de ADN como biblioteca de ADN para secuenciación, en donde la colección de moléculas de ADN comprende una pluralidad de moléculas de ADN, en donde cada una de la pluralidad de moléculas de ADN comprende:
un segmento de ácido nucleico obtenido o derivado de una muestra biológica, en donde la molécula de ácido nucleico es ADN;
un par de identificadores únicos ligados al segmento de ácido nucleico para producir un producto de ligadura, en donde el par de identificadores únicos flanquea el segmento de ácido nucleico, en donde cada uno del par de identificadores únicos es un segmento de ADN, en donde el par de identificadores únicos proporciona colectivamente una identificación única del segmento de ácido nucleico frente a otros segmentos de ácido nucleico representados en un conjunto de lecturas de secuenciación;
en donde los identificadores únicos están flanqueados por una secuencia de desplazamiento de 1 pb y una secuencia de escalonamiento de 0-3 pb; y
un par de códigos de barras de muestra de índice doble unidos al producto de ligadura, en donde cada uno del par de códigos de barras de muestra de índice doble es un segmento de ADN, y en donde el par de códigos de barras de muestra de índice doble proporciona colectivamente una identificación única de la muestra biológica frente a otras muestras biológicas representadas en un conjunto de lecturas de secuenciación.
8. El uso de acuerdo con la reivindicación 7, en donde el segmento de ácido nucleico de cada una de la pluralidad de moléculas de ADN es ADN complementario (ADNc).
9. El uso de acuerdo con las reivindicaciones 7 u 8, en donde el segmento de ácido nucleico de cada una de la pluralidad de moléculas de ADN se obtiene o deriva de una muestra de ADN libre de células.
10. El uso de acuerdo con una cualquiera de las reivindicaciones 7 a 9, en donde el par de códigos de barras de muestra de índice doble de cada una de la pluralidad de moléculas de ADN flanquean el producto de ligadura.
11. El uso de acuerdo con una cualquiera de las reivindicaciones 7 a 10, en donde el par de identificadores únicos de cada una de la pluralidad de moléculas de ADN tiene 3 pb, 4 pb, 5 pb, 6 pb, 7 pb u 8 pb.
12. El uso de acuerdo con una cualquiera de las reivindicaciones 7 a 11, en donde el par de identificadores únicos de cada una de la pluralidad de moléculas de ADN tiene 6 pb.
Applications Claiming Priority (2)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| US202062980972P | 2020-02-24 | 2020-02-24 | |
| PCT/US2021/019478 WO2021173722A2 (en) | 2020-02-24 | 2021-02-24 | Methods of analyzing cell free nucleic acids and applications thereof |
Publications (1)
| Publication Number | Publication Date |
|---|---|
| ES3040741T3 true ES3040741T3 (en) | 2025-11-04 |
Family
ID=77490525
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| ES21759938T Active ES3040741T3 (en) | 2020-02-24 | 2021-02-24 | Methods of analyzing cell free nucleic acids and applications thereof |
Country Status (9)
| Country | Link |
|---|---|
| US (2) | US20230242980A1 (es) |
| EP (3) | EP4660324A3 (es) |
| KR (2) | KR20220157976A (es) |
| CN (2) | CN116113436A (es) |
| AU (2) | AU2021227229A1 (es) |
| CA (2) | CA3172670A1 (es) |
| DK (1) | DK4110957T3 (es) |
| ES (1) | ES3040741T3 (es) |
| WO (2) | WO2021173724A1 (es) |
Families Citing this family (8)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| US11728007B2 (en) * | 2017-11-30 | 2023-08-15 | Grail, Llc | Methods and systems for analyzing nucleic acid sequences using mappability analysis and de novo sequence assembly |
| GB2623904B (en) | 2019-11-06 | 2024-07-24 | Univ Leland Stanford Junior | Methods and systems for analyzing nucleic acid molecules |
| US11783912B2 (en) | 2021-05-05 | 2023-10-10 | The Board Of Trustees Of The Leland Stanford Junior University | Methods and systems for analyzing nucleic acid molecules |
| MX2024003132A (es) * | 2021-09-13 | 2024-04-10 | Regeneron Pharma | Metodos para tratar la hematopoyesis clonal de potencial indeterminado (chip) con inhibidores del antigeno linfocitario 75 (ly75), grupo de diferenciacion 164 (cd164) o poli (adp-ribosa) polimerasa 1 (parp1). |
| EP4433611A4 (en) * | 2021-11-17 | 2025-10-08 | Univ Leland Stanford Junior | SYSTEMS AND METHODS FOR GENE EXPRESSION AND TISSUE OF ORIGIN INFERENCE FROM CIRCULATING FREE DNA |
| JP2025536559A (ja) * | 2022-11-01 | 2025-11-07 | ゾエティス・サービシーズ・エルエルシー | 非がん性体細胞変異の検出 |
| WO2025096466A2 (en) * | 2023-10-30 | 2025-05-08 | Myriad Women's Health, Inc. | Methods for improving minimal residual disease assays |
| WO2025212823A1 (en) * | 2024-04-03 | 2025-10-09 | Memorial Sloan-Kettering Cancer Center | Methods for predicting risk of recurrence and metastases in lung cancer patients using circulating tumor dna and spatial biomarkers |
Family Cites Families (13)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CA186569A (en) | 1918-04-02 | 1918-09-17 | Henry Arthur Dygert | Surgical appliance |
| CA188298A (en) | 1918-04-08 | 1919-01-14 | William H. Bot | Grain separator |
| US6171856B1 (en) * | 1997-07-30 | 2001-01-09 | Board Of Regents, The University Of Texas System | Methods and compositions relating to no-mediated cytotoxicity |
| KR20030007463A (ko) * | 2000-03-16 | 2003-01-23 | 이콜로지컬 테크놀로지 리서치, 엘티디. | Dna 손상 지표를 이용한 천연 및 인공 화학물질의 간이생물학적 평가법, 및 그 장치 |
| AU2001255518A1 (en) * | 2000-06-07 | 2001-12-17 | Baylor College Of Medicine | Compositions and methods for array-based nucleic acid hybridization |
| DE10032165A1 (de) * | 2000-07-01 | 2002-01-10 | Beiersdorf Ag | Verwendung von physiologisch verträglichen Sulfinsäuren als Antioxidans oder Radikalfänger in kosmetischen oder dermatologischen Zubereitungen |
| EP3290530B1 (en) * | 2009-02-18 | 2020-09-02 | Streck Inc. | Preservation of cell-free nucleic acids |
| ES2925014T3 (es) * | 2014-09-12 | 2022-10-13 | Univ Leland Stanford Junior | Identificación y uso de ácidos nucleicos circulantes |
| WO2018081161A1 (en) * | 2016-10-24 | 2018-05-03 | Biomatrica, Inc. | Stabilization of nucleic acids on paper |
| US11479807B2 (en) * | 2017-03-23 | 2022-10-25 | University Of Washington | Methods for targeted nucleic acid sequence enrichment with applications to error corrected nucleic acid sequencing |
| US11584958B2 (en) * | 2017-03-31 | 2023-02-21 | Grail, Llc | Library preparation and use thereof for sequencing based error correction and/or variant identification |
| US11542540B2 (en) * | 2017-06-16 | 2023-01-03 | Life Technologies Corporation | Control nucleic acids, and compositions, kits, and uses thereof |
| US11447818B2 (en) | 2017-09-15 | 2022-09-20 | Illumina, Inc. | Universal short adapters with variable length non-random unique molecular identifiers |
-
2021
- 2021-02-24 AU AU2021227229A patent/AU2021227229A1/en active Pending
- 2021-02-24 EP EP25197637.9A patent/EP4660324A3/en active Pending
- 2021-02-24 AU AU2021225854A patent/AU2021225854A1/en active Pending
- 2021-02-24 WO PCT/US2021/019481 patent/WO2021173724A1/en not_active Ceased
- 2021-02-24 CA CA3172670A patent/CA3172670A1/en active Pending
- 2021-02-24 EP EP21759938.0A patent/EP4110957B1/en active Active
- 2021-02-24 ES ES21759938T patent/ES3040741T3/es active Active
- 2021-02-24 CA CA3172675A patent/CA3172675A1/en active Pending
- 2021-02-24 EP EP21761302.5A patent/EP4110397A4/en active Pending
- 2021-02-24 WO PCT/US2021/019478 patent/WO2021173722A2/en not_active Ceased
- 2021-02-24 KR KR1020227033217A patent/KR20220157976A/ko active Pending
- 2021-02-24 DK DK21759938.0T patent/DK4110957T3/da active
- 2021-02-24 CN CN202180030202.9A patent/CN116113436A/zh active Pending
- 2021-02-24 CN CN202180030144.XA patent/CN115443341A/zh active Pending
- 2021-02-24 KR KR1020227033309A patent/KR20220145891A/ko active Pending
-
2022
- 2022-08-24 US US17/822,028 patent/US20230242980A1/en active Pending
- 2022-08-24 US US17/822,016 patent/US20250263789A1/en active Pending
Also Published As
| Publication number | Publication date |
|---|---|
| CN115443341A (zh) | 2022-12-06 |
| AU2021227229A1 (en) | 2022-10-13 |
| CA3172670A1 (en) | 2021-09-02 |
| EP4110957B1 (en) | 2025-08-27 |
| US20250263789A1 (en) | 2025-08-21 |
| WO2021173722A2 (en) | 2021-09-02 |
| US20230242980A1 (en) | 2023-08-03 |
| WO2021173724A1 (en) | 2021-09-02 |
| DK4110957T3 (da) | 2025-10-27 |
| EP4660324A2 (en) | 2025-12-10 |
| EP4110957A4 (en) | 2024-03-06 |
| AU2021225854A1 (en) | 2022-10-13 |
| EP4110397A1 (en) | 2023-01-04 |
| EP4660324A3 (en) | 2026-02-18 |
| EP4110957A2 (en) | 2023-01-04 |
| EP4110397A4 (en) | 2024-05-01 |
| CA3172675A1 (en) | 2021-09-02 |
| KR20220157976A (ko) | 2022-11-29 |
| KR20220145891A (ko) | 2022-10-31 |
| CN116113436A (zh) | 2023-05-12 |
| WO2021173722A3 (en) | 2021-10-07 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| US20250263789A1 (en) | Methods of Analyzing Cell Free Nucleic Acids and Applications Thereof | |
| ES3043308T3 (en) | Systems and methods for using sequencing data for pathogen detection | |
| ES2911613T3 (es) | Análisis de patrones de metilación de haplotipos en tejidos en una mezcla de ADN | |
| ES3017068T3 (en) | Detection and treatment of disease exhibiting disease cell heterogeneity and systems and methods for communicating test results | |
| ES2908347T3 (es) | Detección de mutaciones para cribado de cáncer y análisis fetal | |
| ES2764423T3 (es) | Método para determinar el estado mutacional de PIK3CA en una muestra | |
| BR112020023587A2 (pt) | método para determinar um perfil de fragmentação de dna livre de células (cfdna), método para identificar um mamífero como tendo câncer, método de identificação do tecido de origem de um câncer e método para tratar um mamífero com câncer | |
| Gabusi et al. | Intratumoral heterogeneity in recurrent metastatic squamous cell carcinoma of the oral cavity: new perspectives afforded by multiregion DNA sequencing and mtDNA analysis | |
| EP4623099A1 (en) | Cell-free dna methylation test for breast cancer | |
| EP4433611A2 (en) | Systems and methods for gene expression and tissue of origin inference from cell-free dna | |
| US20220333205A1 (en) | Non-invasive method for the diagnosis or screening of colorectal cancer and/or pre-cancerous stage thereof | |
| CN119948176A (zh) | 检测样品中的癌症dna的方法 | |
| Van et al. | Multimodal analysis of cell-free DNA enhances differentiation of early-stage breast cancer from benign lesions and healthy individuals | |
| Kalady et al. | Gene signature is associated with early stage rectal cancer recurrence | |
| HK40086248B (en) | Methods of analyzing cell free nucleic acids and applications thereof | |
| HK40086248A (en) | Methods of analyzing cell free nucleic acids and applications thereof | |
| Arana | New bioinformatic approaches in liquid biopsy as the preferential sample for the study of minimal residual disease and progression in localized colon cancer patients | |
| Pei et al. | Guotian Pei1, Kunkun Sun2, Yingshun Yang1, Shuai Wang1, Mingwei Li3, Xiaoxue Ma3, Huina Wang3, Libin Chen3, Jiayue Qin3, Shanbo Cao3, Jun Liu1 and Yuqing Huang1 | |
| Gu et al. | Genomic Heterogeneity of Multiple synchronous lung cancers (MSLCs) in Chinese population | |
| Otlu | The genomic and epigenomic evolutionary history of papillary renal cell carcinomas | |
| WO2025056629A1 (en) | Method for detecting markers of minimal residual disease | |
| Springer | Development of cancer biomarker assays from dna in various bodily fluids | |
| AU2024274039A9 (en) | Systems and methods for sequencing of cell-free rna | |
| Wang | DIAGNOSTIC POTENTIAL OF TUMOR DNA IN HUMAN MALIGNANCIES | |
| Hernandez | The role of MMPs, TIMPs, and RECK polymorphisms in prostate cancer susceptibility and progression in African Americans |