Un enfoque bioinformático y de aprendizaje profundo basado en bases de datos biológicas para evaluar el papel de los genes asociados a funciones fisiológicas celulares en la mortalidad del meduloblastoma

Cargando...
Miniatura

Fecha

Título de la revista

ISSN de la revista

Título del volumen

Editor

ITESO

Resumen

El meduloblastoma es el tumor cerebral pediátrico maligno más frecuente, y actualmente se estratifica en cuatro subgrupos moleculares (WNT, SHH, Grupo 3 y Grupo 4) que difieren sustancialmente en comportamiento clínico, respuesta terapéutica y pronóstico. La clasificación transcriptómica precisa de estos subgrupos sigue siendo metodológicamente exigente, ya que requiere la integración de datos de expresión génica de alta dimensionalidad con arquitecturas de clasificación capaces de aprovechar las firmas moleculares específicas de cada subgrupo, controlando al mismo tiempo la maldición de la dimensionalidad inherente a los espacios de características derivados de microarreglos. La presente tesis propone una metodología computacional reproducible para la clasificación por subgrupo molecular del meduloblastoma a partir de datos transcriptómicos de microarreglos, extendiendo el marco metodológico de Reveles et al. (2025) a un conjunto de datos sustancialmente mayor y construido de manera independiente. Un total de 794 muestras, ensambladas a partir de los cohortes GSE85217 y GSE124814, fueron armonizadas entre las plataformas de anotación GPL22286 y GPL16977 mediante una intersección de genes compartidos que retuvo aproximadamente el 89% de los identificadores génicos, y posteriormente procesadas mediante un análisis de expresión diferencial estricto (FDR < 0.005, | log2 FC| > 2.32), del cual se obtuvieron 1,139 genes discriminativos únicos como características de entrada. Cinco redes neuronales artificiales de tipo feedforward (una clasificadora de cinco clases y cuatro clasificadoras binarias uno-contra-resto) fueron implementadas en MATLAB con tres capas ocultas, normalización por lotes, regularización por dropout, decaimiento de pesos L2 y el optimizador Adam, y validadas bajo validación cruzada estratificada de diez pliegues. La configuración alcanzó una exactitud validada cruzadamente igual o superior al 97.99% en las cinco redes, con valores medios de AUC entre 0.988 y 1.000, igualando o superando el estado del arte actual en clasificación transcriptómica de meduloblastoma. Los errores residuales se concentraron sistemáticamente a lo largo de la frontera Grupo 3 / Grupo 4, en concordancia con el solapamiento transcriptómico documentado entre estos subgrupos y con la estructura observada en las proyecciones no supervisadas de UMAP del espacio de características, lo que aporta evidencia cross-method de que el error residual es biológicamente interpretable y no de naturaleza metodológica. Implementada bajo un compromiso deliberado con la reproducibilidad mediante herramientas bioinformáticas de código abierto, la metodología se plantea como una plantilla metodológica para la investigación accesible en oncología computacional, particularmente en entornos de investigación con recursos limitados, como el contexto latinoamericano del que emerge.

Descripción

Palabras clave

Cáncer, Bioinformática, Ciencia de Datos, Redes Neuronales Artificiales, Aprendizaje Profundo, Meduloblastoma

Citación

Rivera-Chávez, A. (2026). Un enfoque bioinformático y de aprendizaje profundo basado en bases de datos biológicas para evaluar el papel de los genes asociados a funciones fisiológicas celulares en la mortalidad del meduloblastoma.