Genómica · asia
Enseñar a la IA a reconocer mutaciones del cáncer con «tumores sintéticos»: ClairS cubre una carencia de la secuenciación de lecturas largas
Un equipo de la Universidad de Hong Kong combinó muestras normales para crear diversos escenarios tumorales, lo que permite entrenar un modelo de aprendizaje profundo cuando escasean los datos reales de cáncer; las pruebas con líneas celulares mostraron resultados destacados, pero aún no pueden trasladarse directamente al diagnóstico clínico.
Uno de los retos del análisis del genoma del cáncer consiste en identificar, entre una gran cantidad de ruido de secuenciación, las mutaciones somáticas que solo están presentes en el tumor y no aparecen en las células normales. La secuenciación de lecturas largas puede abarcar regiones repetitivas o difíciles de mapear del genoma, pero también introduce patrones de error distintos de los observados en los datos de lecturas cortas; ClairS, una herramienta de aprendizaje profundo desarrollada por un equipo de la Universidad de Hong Kong, busca cubrir esta carencia analítica.
ClairS analiza muestras pareadas de tumor y tejido normal para identificar variantes de un solo nucleótido (SNV), así como inserciones y deleciones más cortas (indel). No se limita a comprobar si una base concreta es anómala, sino que también utiliza la información de haplotipos proporcionada por las lecturas largas para determinar si una mutación candidata puede asignarse razonablemente al cromosoma paterno o materno, lo que permite descartar señales con mayor probabilidad de proceder de errores de secuenciación.
La verdadera dificultad radica en los datos de entrenamiento. Las muestras de cáncer disponibles para el aprendizaje del modelo y dotadas de etiquetas de alta fiabilidad son mucho menos numerosas que los datos de variantes de la línea germinal. Por ello, el equipo dirigido por el profesor Ruibang Luo mezcló lecturas reales de secuenciación de dos individuos normales, redefinió las variantes de la línea germinal exclusivas de uno de ellos como mutaciones tumorales simuladas y ajustó la proporción de lecturas para crear escenarios de entrenamiento con distintos niveles de pureza tumoral, profundidad de secuenciación, frecuencia alélica de las variantes y grado de contaminación por células normales.
El estudio publicado en 《Nature Methods》 mostró que, en seis conjuntos de datos de Oxford Nanopore con una cobertura de 50 veces para el tumor y de 25 veces para la muestra normal pareada, el modelo entrenado únicamente con datos sintéticos obtuvo puntuaciones F1 para SNV de entre el 87,98% y el 98,58%; F1 es un indicador que combina precisión y sensibilidad. Sin embargo, la calidad de los conjuntos de referencia utilizados para cada línea celular no era uniforme, y algunas respuestas de referencia también habían incorporado las evaluaciones de diversos algoritmos, por lo que estas cifras no pueden considerarse directamente como tasas de exactitud en muestras clínicas.
En la línea celular de cáncer de mama triple negativo HCC1395 y su línea normal pareada HCC1395BL, para las que se dispone de un estándar de referencia más estricto, las puntuaciones F1 del modelo de datos sintéticos para SNV e indel fueron del 89,83% y el 73,38%, respectivamente. Tras realizar primero un preentrenamiento con muestras sintéticas y añadir después datos de líneas celulares de cáncer reales, ambas cifras aumentaron hasta el 96,19% y el 79,67%, lo que indica que los datos sintéticos pueden ampliar el alcance del entrenamiento, aunque sigue siendo necesario calibrar el modelo con características de tumores reales; en particular, aún persisten diferencias en la identificación de inserciones y deleciones.
La herramienta se ha publicado como código abierto bajo la licencia BSD 3-Clause, y el flujo de trabajo de Oxford Nanopore para detectar variantes somáticas en muestras pareadas de tumor y tejido normal también ha adoptado una versión desglosada de ClairS. Actualmente, este flujo de trabajo solo funciona con determinados modelos de identificación de bases R9 y R10, y el análisis de indel cortos está limitado además a los modelos R10, lo que refleja que el rendimiento sigue viéndose afectado por la versión de la química de secuenciación y la configuración del análisis.
Aún existe una frontera clara antes de su uso clínico: la validación actual procede principalmente de líneas celulares de cáncer, no de muestras prospectivas de pacientes, y todavía no se ha demostrado que los resultados mejoren las decisiones de diagnóstico o tratamiento. Tanto el repositorio del estudio como la documentación de Oxford Nanopore indican que el producto no está destinado al diagnóstico clínico; el artículo también revela que Ruibang Luo recibió financiación para investigación de la empresa. El siguiente paso será realizar una validación independiente en más tipos de cáncer, niveles de pureza tumoral y flujos de trabajo clínicos reales, así como aclarar las responsabilidades relativas a las actualizaciones de versiones, el control de calidad y la regulación.