DMAF - Trabajos de fin de Maestría en Ciencia de Datos

URI permanente para esta colecciónhttps://hdl.handle.net/11117/7421

Examinar

Envíos recientes

Mostrando 1 - 20 de 52
  • ÍtemAcceso Abierto
    Un enfoque bioinformático y de aprendizaje profundo basado en bases de datos biológicas para evaluar el papel de los genes asociados a funciones fisiológicas celulares en la mortalidad del meduloblastoma
    (ITESO, 2026-08) Rivera-Chávez, Andrés; Vallejo-Cardona, Alba A.; Carrasco-Navarro, Rocío
    El meduloblastoma es el tumor cerebral pediátrico maligno más frecuente, y actualmente se estratifica en cuatro subgrupos moleculares (WNT, SHH, Grupo 3 y Grupo 4) que difieren sustancialmente en comportamiento clínico, respuesta terapéutica y pronóstico. La clasificación transcriptómica precisa de estos subgrupos sigue siendo metodológicamente exigente, ya que requiere la integración de datos de expresión génica de alta dimensionalidad con arquitecturas de clasificación capaces de aprovechar las firmas moleculares específicas de cada subgrupo, controlando al mismo tiempo la maldición de la dimensionalidad inherente a los espacios de características derivados de microarreglos. La presente tesis propone una metodología computacional reproducible para la clasificación por subgrupo molecular del meduloblastoma a partir de datos transcriptómicos de microarreglos, extendiendo el marco metodológico de Reveles et al. (2025) a un conjunto de datos sustancialmente mayor y construido de manera independiente. Un total de 794 muestras, ensambladas a partir de los cohortes GSE85217 y GSE124814, fueron armonizadas entre las plataformas de anotación GPL22286 y GPL16977 mediante una intersección de genes compartidos que retuvo aproximadamente el 89% de los identificadores génicos, y posteriormente procesadas mediante un análisis de expresión diferencial estricto (FDR < 0.005, | log2 FC| > 2.32), del cual se obtuvieron 1,139 genes discriminativos únicos como características de entrada. Cinco redes neuronales artificiales de tipo feedforward (una clasificadora de cinco clases y cuatro clasificadoras binarias uno-contra-resto) fueron implementadas en MATLAB con tres capas ocultas, normalización por lotes, regularización por dropout, decaimiento de pesos L2 y el optimizador Adam, y validadas bajo validación cruzada estratificada de diez pliegues. La configuración alcanzó una exactitud validada cruzadamente igual o superior al 97.99% en las cinco redes, con valores medios de AUC entre 0.988 y 1.000, igualando o superando el estado del arte actual en clasificación transcriptómica de meduloblastoma. Los errores residuales se concentraron sistemáticamente a lo largo de la frontera Grupo 3 / Grupo 4, en concordancia con el solapamiento transcriptómico documentado entre estos subgrupos y con la estructura observada en las proyecciones no supervisadas de UMAP del espacio de características, lo que aporta evidencia cross-method de que el error residual es biológicamente interpretable y no de naturaleza metodológica. Implementada bajo un compromiso deliberado con la reproducibilidad mediante herramientas bioinformáticas de código abierto, la metodología se plantea como una plantilla metodológica para la investigación accesible en oncología computacional, particularmente en entornos de investigación con recursos limitados, como el contexto latinoamericano del que emerge.
  • ÍtemEmbargo
    Levenberg-Marquardt With the Conjugate Gradient Method for Efficient Neural Network Training and Noisy Data
    (ITESO, 2025-02) Isidoro-Muñoz, Abraham; Ruíz-Cruz, Riemann
    El presente estudio tiene como objetivo proporcionar nuevas perspectivas sobre la implementación de métodos matriciales iterativos dentro de los algoritmos de entrenamiento para redes neuronales artificiales. Si bien existen algoritmos altamente desarrollados con buena aplicabilidad a problemas relativamente simples, como los algoritmos basados en los criterios de la segunda derivada, el costo computacional y otras características inherentes a la función de costo impiden su adopción en problemas más complejos. Es aquí donde los métodos iterativos para resolver sistemas matriciales pueden proporcionar mayor flexibilidad y eficiencia, dadas ciertas características de las matrices involucradas en el algoritmo bajo estudio y los criterios de parada del método. El algoritmo de Levenberg-Marquardt ha sido seleccionado como el objeto de estudio debido a su capacidad y eficiencia para realizar cierta interpolación entre los criterios de la primera y la segunda derivada, lo que permite lograr resultados de entrenamiento superiores en comparación con otros. El gradiente conjugado fue elegido como el método iterativo para la solución de matrices debido a las características que comparte con la matriz de interés del algoritmo antes mencionado, además de otras capacidades que permiten explorar nuevas propuestas sobre las matrices involucradas. Además de las características mencionadas anteriormente, es un tema recurrente que los algoritmos con métricas de entrenamiento sobresalientes generen un sobreajuste de los datos. Levenberg-Marquardt no es ajeno a este problema, y uno de los puntos analizados aquí es que los métodos iterativos pueden ayudar a mitigar este sobreajuste a través de sus criterios de parada. Como tema final, es de interés analizar el impacto de la precisión numérica de punto flotante en el procesamiento de datos, y si esto afecta significativamente los resultados y las métricas de tiempo para los algoritmos y métodos antes mencionados. Los estudios analizados involucran pruebas directas en matrices, problemas de entrenamiento para clasificación y regresión, y pruebas en problemas de regresión con ruido controlado para evaluar el sobreajuste.
  • ÍtemAcceso Abierto
    Implementación de redes neuronales convolucionales para el reconocimiento de imágenes de objetos perdidos en aeropuertos
    (ITESO, 2026-05) Álvarez-Castellanos, Jesús; Silva-Gálvez, Arturo
    El desarrollo acelerado de la tecnología de procesamiento digital de imágenes a nivel global ha logrado obtener grandes avances dentro de la rama de las ciencias computacionales, particularmente en el campo de la visión por computadora y el reconocimiento de patrones. La implementación de una gran cantidad de técnicas de preprocesamiento, junto con arquitecturas de aprendizaje profundo cada vez más sofisticadas, contribuyen en conjunto a un mejor modelado y aprendizaje automático que permita generar estimaciones favorables para la resolución de problemas complejos en diversos dominios de aplicación. En este trabajo se presenta el desarrollo de un modelo de redes neuronales para el reconocimiento y clasificación de imágenes de objetos perdidos en aeropuertos, abordando una problemática recurrente en las instalaciones aeroportuarias donde diariamente se registran numerosos casos de pertenencias extraviadas. El modelo propuesto tiene como objetivo principal procesar las imágenes de objetos extraviados en las instalaciones aeroportuarias para clasificarlos automáticamente que pueda facilitar a los propietarios la recuperación de sus pertenencias de manera eficiente, reduciendo así los tiempos de búsqueda y mejorando la gestión de objetos perdidos. Se selecciona como base de datos el repositorio ImageNet, creada por la Universidad de Princeton, contiene más de dos millones de imágenes organizadas en categorías semánticas denominadas synsets, derivadas de la estructura jerárquica de WordNet, también un recurso lexico creado en Princeton. Esta ontología organiza conceptos visuales en árboles con hasta catorce niveles de profundidad. Las categorias utilizadas son recaudadas mediante el descarte de objetos no permitidos en salas de espera dentro de los aeropuertos de acuerdo a las normas internacionales de aviación civil. Una vez seleccionadas las clases, cada imagen fue sometida a un pipeline de cinco etapas para su preprocesamiento. La arquitectura principal del proyecto fue la CNN extendida, organizada en seis bloques convolucionales ascendentes de 32 a 512 filtros, incorporando en cada bloque BatchNormalization, Dropout y terminando en una capa GlobalAveragePooling2D antes de la clasificación densa. Se entrenan y se evaluan 15 experimentos en los cuales se realizan ajustes sistemáticos a los diferentes hiperparámetros que configuran a la arquitectura del modelo principal. Dichos experimentos se dividen en 3 bloques donde en cada uno de ellos se fueron ajustando distintos tipos de hiperparámetros referentes al optimizados, aumentación de los datos y regularización de las capas convolucionales. Se selecciona el modelo con el mejor rendimiento de acuerdo a la métrica de exactitud. El modelo generado y seleccionado con mejor rendimiento demostró ser capaz de procesar las imagenes con un pipeline completo de transformaciones para mejorar la representación de los objetos a clasificar. También entregó una clasificación base con gran potencial de mejora de su rendimiento. Se planeá incorporar un mejor repositorio de imagenes que puedan representar de manera más presisa el dominio de categorias propias a los aeropuertos a ser implementados para mejorar el rendimiento del modelo.
  • ÍtemAcceso Abierto
    Relación entre autonomía económica y violencia de género en el estado de Baja California: caracterización y modelado predictivo
    (ITESO, 2026-05) Arciniega-Chávez, Alexandra; Motta-Bonilla, Byron M.
    El presente trabajo analiza la relación entre la autonomía económica y la violencia de género en el estado de Baja California utilizando datos de la ENDIREH 2021. A través de un Análisis Exploratorio de Datos (EDA), se caracterizó el entorno sociodemográfico y la autonomía económica de las mujeres; los resultados sugieren que, al no presentarse patrones lineales marcados, la violencia de género debe abordarse como un fenómeno multicausal y multidimensional. Posteriormente, se realizó un modelado predictivo comparando seis algoritmos de aprendizaje automático, desde una Regresión Logística hasta modelos de mayor complejidad. Se determinó que el Random Forest obtuvo el mejor rendimiento, evaluado primordialmente a través del F1-Score por su capacidad para balancear la precisión y la sensibilidad en la detección de casos positivos. Tras un proceso de selección de importancia de variables para reducir la dimensionalidad y el ruido, se identificó que la edad y el ingreso mensual son los factores más determinantes. Estos hallazgos sugieren que las mujeres jóvenes que inician su vida laboral enfrentan un riesgo mayor debido a alteraciones en las dinámicas tradicionales de poder. El estudio destaca la eficacia de la ciencia de datos para facilitar la identificación de perfiles vulnerables y apoyar a las instituciones gubernamentales en la implementación de medidas de prevención y mitigación de riesgos.
  • ÍtemEmbargo
    Ocio serio en videojuegos: Análisis de patrones de comportamiento
    (ITESO, 2025-12) González-Flores, Simón C.; Motta-Bonilla, Byron M.
    El trabajo analiza patrones de comportamiento de jugadores en una plataforma de videojuegos para PC mediante el marco teórico del ocio serio de Stebbins. Se procesaron 2,969,323 registros de 1,937,126 jugadores únicos, construyendo métricas derivadas que operacionalizan dimensiones del ocio serio: perseverancia, trayectoria y participación comunitaria. La metodología integra técnicas de clasificación supervisada y clustering no supervisado. El modelo Random Forest alcanzó F1=0.700 para identificar jugadores con compromiso sostenido, utilizando siete variables libres de data leakage. El análisis de clustering identificó siete perfiles distintivos de jugadores (Silhouette=0.739): desde jugadores casuales (43.3\%) hasta una élite con compromiso extremo (0.3\%), pasando por perfiles transicionales (41.3\%) y serios (15.7\%). Los hallazgos revelan heterogeneidad significativa dentro del ocio serio, identificando rutas alternativas hacia el compromiso (especialización vs. generalización) y dimensiones no teorizadas previamente (ratio juego/participación comunitaria). La correspondencia entre métodos supervisados y no supervisados (68.7\% de concordancia) valida la robustez de los perfiles identificados. El estudio contribuye con: (1) métricas cuantitativas derivables de datos de comportamiento digital para operacionalizar el ocio serio, (2) evidencia empírica sobre subtipos de compromiso no anticipados por la teoría original, y (3) un pipeline metodológico reproducible para estudios a gran escala. Las limitaciones incluyen sesgos de plataforma y la imposibilidad de capturar dimensiones subjetivas del constructo.
  • ÍtemAcceso Abierto
    Caracterización del funcionamiento cerebral en hombres y mujeres en estado de vigilia a partir de un registro electroencefalográfico (EEG)
    (ITESO, 2025-12) Guevara-Hernández, Miguel A.; Motta-Bonilla, Byron M.
    Se ha demostrado que tanto hombres como mujeres presentan patrones de funcionamiento cerebral típicos de su género y que sus cerebros usan diferentes estrategias dependiendo de las situaciones y contextos. Muchas de estas diferencias funcionales del cerebro se han reportado en relación con la ejecución de tareas o procesos cognitivo-emocionales, sin embargo, no se ha determinado si esta diferenciación funcional se puede presentar en un estado fisiológico de reposo, en vigilia con ojos abiertos. El registro de la actividad eléctrica cerebral o electroencefalograma (EEG), es una técnica no invasiva que permite caracterizar el funcionamiento de diferentes áreas de la corteza cerebral tanto en estado de reposo como durante conductas y procesos cognitivos o emocionales específicos. Los parámetros a medir del EEG son la potencia absoluta (PA), la potencia relativa (PR) y el grado de correlación EEG (rEEG) entre áreas corticales, de ahí que la cantidad de datos EEG a analizar es excesivamente grande y, por ende, complicada y difícil de analizar. La aplicación de modelos de optimización para el manejo y análisis de datos EEG implica una gran ventaja para los procesos rápidos de diagnóstico clínico y obtención de resultados en la investigación básica, por lo que el objetivo principal de este trabajo recepcional fue aplicar diferentes modelos de optimización para determinar el funcionamiento cerebral de jóvenes participantes en base a la categorización de su actividad EEG registrada en estado de vigilia con ojos abiertos. Los objetivos específicos incluyeron el análisis de la PA, la PR y la correlación (rEEG) de las frecuencias rápidas en el rango de beta (de 13 a 30 Hz), aplicando para cada tipo de parámetro EEG tres modelos de optimización: 1) regresión cuadrática por mínimos cuadrados, 2) regresión logística y 3) clasificación por K-medias. Los análisis exploratorios mostraron que de los tres parámetros EEG, fue con la PR que se encontró una mejor distribución normal y con el primer método (regresión por mínimos cuadrados) los resultados más estables y acordes a las hipótesis neurofisiológicas. Se concluye que la aplicación del modelo de optimización, regresión por mínimos cuadrados, es el más adecuado para caracterizar, con datos de PR de las frecuencias rápidas, la funcionalidad EEG que presentan hombres y mujeres en condición de reposo ojos abiertos. De los 37 participantes masculinos registrados, 67.6 por ciento fueron clasificados con un tipo de funcionalidad cerebral dominante tipo A y un 32.4 por ciento con tipo B; asimismo de los 37 sujetos femeninos, 70.3 por ciento se clasificaron con funcionalidad cerebral dominante tipo B y un 29.7 por ciento presentaron una funcionalidad cerebral dominante tipo A, indicando que el sexo no determina la funcionalidad cerebral en un estado de reposo con ojos abiertos.
  • ÍtemAcceso Abierto
    Forecasting Bitcoin’s Tendency with ConvLSTM Architecture
    (ITESO, 2025-09-30) Contreras-González, César; Carrasco-Navarro, Rocío
    Se presenta un modelo predictivo para la predicción en tiempo real del precio de Bitcoin, utilizando una arquitectura híbrida que combina Redes Neuronales Convolucionales (CNN) y Redes de Memoria a Corto y Largo Plazo Bidireccionales (Bi-LSTM), complementada con un mecanismo de atención de producto escalar. El modelo fue implementado usando TensorFlow y Keras, incorporando una función de pérdida personalizada y optimización de hiperparámetros mediante Keras Tuner. Utilizando un conjunto de datos de 15 características que incluyen indicadores financieros como RSI, MACD y Momentum, así como variables temporales. La investigación demuestra que el parámetro lookback es crucial para capturar la volatilidad del mercado, encontrando que períodos de 30 minutos son efectivos para mercados de alta volatilidad, mientras que 60 minutos funcionan mejor en condiciones estables, proporcionando una herramienta robusta para decisiones comerciales basadas en datos en el mercado de criptomonedas.
  • ÍtemAcceso Abierto
    El impacto del incremento salarial en México: un análisis con regresión distributiva
    (ITESO, 2025-08) Leyva-Gómez, María A.; Ruíz-Hernández, María R.
    Esta investigación analiza el impacto del aumento al salario mínimo en la distribución del ingreso salarial en México, a partir de las políticas implementadas durante el último sexenio. Para ello, se empleó la metodología de regresión distributiva, generando funciones de distribución acumulada (CDF) del ingreso por hora para 2018 y 2024, y construyendo una distribución contrafactual que aísla el efecto del salario mínimo. Los resultados revelan un efecto positivo en toda la distribución, con mayores aumentos en los percentiles bajos y altos, y aumentos más moderados en los segmentos medios. Esto contradice la idea de que el efecto se limita a los sectores más vulnerables, y confirma un impacto heterogéneo pero generalizado. Adicionalmente, se imputaron los ingresos faltantes, que representan casi el 30\% de los datos, utilizando modelos de machine learning. El XGBoost Regressor ofreció el mejor desempeño. La imputación incrementó significativamente el ingreso promedio, lo que confirma que los datos faltantes no son aleatorios. En conjunto, este trabajo muestra cómo herramientas de Ciencia de Datos pueden fortalecer el análisis económico, proporcionando estimaciones más precisas y revelando efectos que de otro modo podrían permanecer ocultos.
  • ÍtemEmbargo
    Construcción predictiva automatizada de una serie de tiempo financiera corporativa con algoritmos dentro de un caso de estudio aplicado de Ciencia de Datos
    (ITESO, 2025-08) Cárdenas-Cardeña, Mariely B.; Motta-Bonilla, Byron M.
    En este documento se presenta el estudio y la aplicación de métodos de ciencia de datos sobre una base procesada, con el fin de mejorar la predicción financiera de un departamento operando para una empresa local de tecnología. Los ejecutivos y usuarios finales de dichas predicciones se apoyan de aquellos valores para la construcción de la estrategia corporativa, así como la toma de decisiones respectivas. Actualmente la operación en silos para la construcción de aquellos pronósticos evidencia la complejidad para reproducir dichos procesos. Aproximando a estas problemáticas algoritmos de aprendizaje de máquina y aprendizaje profundo puede resolver los retos que actualmente se enfrentan y dejar atrás procedimientos manuales. El presente documento contiene la investigación, aplicación y obtención de resultados en el desarrollo y construcción de un proceso más innovador y autónomo para la construcción de predicciones para periodos futuros. En términos numéricos y específicos, se espera una eficacia superior a 90% de precisión y un tiempo máximo 100 minutos para la ejecución. En este trabajo se encuentra el análisis exploratorio inicial del caso obtenido, así como la transformación de los datos para su utilización en modelos de ciencia de datos. Finalmente se presentan las experimentaciones empleadas, las conclusiones resultantes y propuestas para la continuación de mejoramiento a los avances reportados en este documento.
  • ÍtemAcceso Abierto
    Recuerdos y redes: Detectando el Alzheimer antes del olvido
    (ITESO, 2025-06) Galván-Blanco, Héctor A.; Alcalá-Temores, Jaime E.
    El diagnóstico temprano de enfermedades neurodegenerativas como el Alzheimer es fundamental para mejorar la calidad de vida de los pacientes y facilitar una intervención médica oportuna. Este trabajo explora el uso de modelos de aprendizaje supervisado para clasificar el estado cognitivo de individuos: Cognitivamente Normal (CN), Deterioro Cognitivo Leve (MCI) y Alzheimer (AD), a partir de variables clínicas y demográficas estructuradas. Se implementaron y compararon dos enfoques: un modelo de regresión logística multinomial y una red neuronal profunda, desarrollada tras múltiples pruebas con arquitecturas de diferente complejidad. El proceso incluyó limpieza, codificación, normalización y selección de variables. La red neuronal, optimizada con múltiples capas densas y regularización, logró un desempeño superior, particularmente en la detección de la etapa MCI (recall = 81 %), considerada crítica por su relevancia clínica. Estos resultados refuerzan el potencial de las redes neuronales como herramienta de apoyo al diagnóstico temprano en contextos clínicos.
  • ÍtemAcceso Abierto
    Regularization of Visual Transformers and Reinforcement Learning: an Approach to General Artificial Intelligence Evaluated through the ARC Benchmark
    (ITESO, 2025-05) Oviedo-Vázquez, Mario A.; Guerrero-Arroyo, Edgar A.
    El auge de los Transformers y los modelos de lenguaje autorregresivos ha impulsado su uso en diversos campos, pero también ha expuesto sus limitaciones, como la incapacidad de resolver problemas simples que se encuentren fuera de los datos de su entrenamiento, lo que refleja deficiencias en comprensión, razonamiento y planificación. Estas habilidades son esenciales para aplicaciones críticas, autos autónomos o aplicaciones médicas, donde se requiere adaptabilidad a situaciones imprevistas. Esta tesis propone un modelo que combina un Transformers con codificador visual modificado (ViT) y aprendizaje por refuerzo (RL) para abordar estas limitaciones. La evaluación se realiza con el Abstraction and Reasoning Corpus (ARC), un benchmark creado para medir habilidades cognitivas en IA, que hasta ahora no ha sido superado por otros modelos.
  • ÍtemEmbargo
    Advanced Deep Learning Techniques for USD/MXN Structured Notes Predictive Modeling
    (ITESO, 2025-06) Ramos-Martínez, Ricardo; Campos-Macías, Leobardo E.
    This thesis investigates whether modern neural networks can enhance the issuance and selection of capital-protected structured notes in the Mexican market, concentrating on instruments linked to the USD/MXN exchange rate. Standard feed-forward and shallow recurrent models were first applied to a broad spectrum of payoff profiles—range accruals, double no-touch, and directional notes—but delivered limited out-of-sample stability and negligible economic value. Reframing the problem as a binary 7-day USD/MXN direction forecast narrowed the note universe to Strike Up and Strike Down structures and allowed the training set to extend back to 2010. A dual-stream GRU architecture was developed in which technical indicators (momentum, oscillators) and fundamental drivers (rate differentials, macro surprises) flow through parallel recurrent branches before merging in a shared decision layer. Bayesian hyper-parameter optimisation selected a compact configuration (five layers, 372 hidden units, dropout 0.3). When evaluated on 2024 out-of-sample data, the model achieved Accuracy = 64.7%, F1 = 71.7%, and AUC = 0.60, comfortably outperforming ARIMAX, logistic regression, and decision-tree baselines. The cumulative true-positive excess return (TPefe) tracked the CETE-28 benchmark within approximately ten basis points after embedded structuring fees, demonstrating commercial viability for investors who require weekly liquidity, principal protection, and yields at least equal to the domestic risk-free rate. The study shows that separating technical and fundamental information into dedicated recurrent channels, coupled with gated-unit dynamics and commission-aware evaluation, provides a robust and scalable template for machine-learning-driven structured-note selection in Mexico’s evolving markets.
  • ÍtemAcceso Abierto
    Analysis and Implementation of Different Open-Source Federated Learning Frameworks to Assess their Technical Implications
    (ITESO, 2025-05) Juan-Fernández, Antonio J.; Gudiño-Mendoza, Gema B.
    Google introduced Federated Learning, an approach to decentralized machine learning model training, in 2016. It is designed to allow the use of private data to train machine learning models without the need to possess the data or even "see" it. The main premise of Federated Learning is a paradigm shift from the traditional centralized machine learning training workflow to a distributed setting. In this setting, users carry out the training locally without ever revealing their data and only share the results of their efforts anonymously as model parameter updates, either to a local server or a network of other users. Over the years, several Federated Learning frameworks have emerged, each offering different sets of settings and serving either a broad or a particular purpose. While several comparisons have been made to determine the framework with the most comprehensive set of features, no comparison is available to assess their utility and the implications of using them at an empirical level. This case study uses the popular frameworks NVFlare, Flower, and Federated Scope to evaluate and showcase their main strengths and potential drawbacks, emphasizing the use of an external dataset and model. The results showed that regardless of whether the frameworks displayed considerable strengths in certain areas, there is still room for improvement, and that, even if they simplify the implementation of Federated Learning, a factor of manual work still needs to be taken into account, regardless of the framework at hand. Ultimately, the frameworks have relevant features and areas of opportunity that anyone looking to adopt Federated Learning will need to consider; however, the technical analysis should give a broad perspective on the implications of using the chosen frameworks.
  • ÍtemAcceso Abierto
    Modelo híbrido para la detección de deepfakes mediante YOLOv3 y análisis espectral con la Transformada de Fourier
    (ITESO, 2025-05) Gómez-Reyes, Uriel; Villalón-Turrubiates, Iván E.
    El aumento exponencial en la generación y propagación de deepfakes, sumado al crecimiento de herramientas que promueven su desarrollo, ha originado la necesidad creciente de verificar los contenidos en línea. La posibilidad de que cualquier persona pueda acceder a esta tecnológica sin ninguna dificultad, junto con su asombrosa habilidad para crear rostros hiperrealistas, presenta serios desafíos para su identificación a través de métodos tradicionales. Este trabajo propone un modelo híbrido que combina el modelo de detección de objetos YOLOv3 sumado con el análisis en el dominio de la frecuencia mediante la Transformada Discreta de Fourier (DFT) y el uso de una Red Neuronal ResNet50 para su clasificación. El modelo utiliza el algoritmo YOLOv3 como una herramienta de visión computacional que permite localizar y extraer las regiones faciales de interés, disminuyendo el ruido del entorno, seguido de un análisis espectral con DFT que permite identificar patrones de alta frecuencia que son característicos de imágenes creadas con herramientas de deepfake. Por último, se entrena un modelo de clasificación con representaciones espectrales de los conjuntos de datos que incluyen imágenes reales y falsas. Esto permite al modelo aprender los patrones de ambos datasets y distinguir entre una imagen real y una falsa. Los resultados que se obtuvieron como resultado de este trabajo demuestran que el enfoque híbrido propuesto puede lograr una mejora significativa en la precisión de detección respecto a métodos básicos basados exclusivamente en el dominio espacial. Este estudio aporta evidencia sobre la efectividad del análisis de frecuencia como una herramienta más para combatir este tipo de contenido. Combinado con técnicas de visión por computadora, muestra una posible solución para los retos que presenta esta nueva década, dominada por la inteligencia artificial.
  • ÍtemAcceso Abierto
    Machine learning en mercados financieros: generando predicciones mediante la clasificación lorentziana y vecinos más cercanos aproximados
    (ITESO, 2024-12) Tinoco-Figueroa, Sergio; Rodríguez-Reyes, Luis R.
    Este trabajo aborda el complejo y multivariado problema de predecir la dirección del precio de un activo financiero con el objetivo de generar un indicador tanto de compra como de venta de dicho activo, ofreciendo soluciones específicas para eliminar las suposiciones humanas y reducir las señales falsas al realizar transacciones. El indicador propuesto demuestra su capacidad para categorizar datos históricos en un espacio de características multidimensional, subrayando la utilidad de la Clasificación por Distancia de Lorentz (LDC, por sus siglas en inglés) al predecir la dirección futura de los movimientos de precios mediante la implementación de un algoritmo de Vecinos Más Cercanos Aproximados (ANN, por sus siglas en inglés). Para este estudio, se analizaron datos históricos de precios correspondientes al par dólares por Bitcoin (BCH/USD), abarcando un período de 60 días y una periodicidad de 15 minutos, lo que resultó en la recopilación de más de 5,000 registros de datos. Estos datos permitieron obtener una base sólida para el análisis y entrenamiento del modelo de clasificación. Los resultados obtenidos durante el desarrollo del estudio destacaron la eficacia del LDC, un algoritmo de clasificación de Aprendizaje Automático optimizado a través de un riguroso proceso de pruebas. Tras una ejecución en tiempo real, el modelo logró ejecutar 70 operaciones con una tasa de éxito del 92.86%, alcanzando 65 operaciones ganadoras frente a solo 5 perdedoras. Además, se obtuvo una acumulación total de 3,056.02 PIPs, lo que refleja un rendimiento positivo sostenido en el periodo evaluado. El Ratio de Sharpe fue de 0.13, lo que, aunque indica un riesgo moderado, se compensa por la alta tasa de aciertos y la consistencia de las ganancias. En última instancia, se concluye proponiendo un modelo de aplicación automático basado en sistemas en la nube. Este modelo implementa los algoritmos desarrollados de manera autónoma, generando transacciones de manera eficiente y objetiva. Este enfoque proporciona una herramienta valiosa para mejorar la precisión y la confiabilidad en las decisiones financieras, contribuyendo así al avance y la eficacia de las estrategias de trading en entornos volátiles y complejos como el mercado de criptomonedas.
  • ÍtemAcceso Abierto
    Modelo para la estructuración y clasificación de datos no estructurados usando técnicas de Procesamiento de Lenguaje Natural: un caso de estudio en el ámbito de la industria alimentaria
    (ITESO, 2025-01) Muñoz-López, Patricia; Lozano-Díaz, César
    Este estudio aborda el análisis de datos no estructurados provenientes de etiquetas de productos alimenticios con el objetivo de clasificar alimentos bajo el contexto de diseño y desarrollo de nuevos productos. Dado que estos datos contienen información detallada sobre ingredientes y aditivos, su análisis resulta fundamental para identificar relaciones subyacentes y transformar el texto en valores cuantitativos susceptibles de evaluación sistemática. Para alcanzar este propósito, se emplean técnicas de Procesamiento de Lenguaje Natural (PLN), como los word embeddings y el reconocimiento de entidades nombradas (Named Entity Recognition o NER). En particular, se utilizan modelos como GPT, Word2Vec y GLiNER, con los cuales se desarrolla una metodología orientada a la extracción de patrones relevantes, facilitando así la limpieza, estructuración y análisis de los datos en el marco del desarrollo de productos alimenticios. Los resultados muestran que la metodología es efectiva para procesar datos no estructurados, mejorando la calidad mediante segmentación por idioma, adaptación de modelos preentrenados de NER y balance de clases. Estas optimizaciones permitieron obtener métricas destacadas (accuracy, precision, recall, f1-score) y confirmar la hipótesis inicial, evidenciando un impacto positivo en la clasificación de alimentos. Finalmente, el procesamiento y estructuración de datos dentro de un flujo de trabajo automatizado tiene un alto valor, ya que permite integrar y sistematizar los datos de manera escalable y reproducible. Este enfoque ofrece un modelo escalable para gestionar datos, especialmente aquellos provenientes de bases de datos tipo crowdsourcing, mejorando así la calidad y consistencia de las bases de datos alimentarias y facilitando la actualización continua de información. La centralización de datos de alta calidad podría contribuir considerablemente al desarrollo y la innovación de productos alimenticios.
  • ÍtemEmbargo
    Pronóstico de ventas en Jabil Healthcare, junio-agosto 2024
    (ITESO, 2024-12) Flores-Martínez, María F.; Motta-Bonilla, Byron M.
    En este trabajo propongo desarrollar un pronóstico con mayor exactitud que permitirá mejorar la planeación de productos terminados y a su vez que la cadena de suministros fluya con mayor eficiencia provocando que los componentes se reciban en planta en el momento oportuno evitando la acumulación de inventario, o en caso contrario, las demoras de componentes y retrasos en producción.
  • ÍtemAcceso Abierto
    Smart Sample Selection for Retrieval Augmented Generation
    (ITESO, 2024-12) Ramírez-Barba, Diego; Motta-Bonilla, Byron M.
    El proyecto tiene como objetivo la optimización de una técnica emergente en el campo del machine learning llamada RAG (Retrieval-Augmented Generation). Esta técnica se utiliza para mejorar el procesamiento de datos en LLMs (Large Language Models) mediante diversos algoritmos, los cuales permiten aumentar la precisión y reducir el sesgo inherente al entrenamiento de estos modelos.
  • ÍtemEmbargo
    Procesamiento del lenguaje natural para el modelado de tópicos en ideas de innovación
    (ITESO, 2024-11) Corona-Bermúdez, Michel C.; Alcalá-Temores, Jaime E.
    Este trabajo propone mejorar la evaluación y priorización de ideas de innovación mediante Procesamiento de Lenguaje Natural (NLP, por sus siglas en inglés) y modelado de tópicos. Se aborda la necesidad de automatizar el análisis de ideas para facilitar su implementación en las empresas. El objetivo principal es identificar el modelo más adecuado para extraer temas relevantes de ideas empresariales, evaluando modelos como LDA y BERTopic en términos de coherencia y perplejidad. La metodología incluye el preprocesamiento de los datos textuales, comenzando con la detección de idioma y traducción al inglés para estandarizar las ideas. Posteriormente, se aplica tokenización, eliminación de palabras comunes y stemming para reducir palabras a su forma base. Esto permite generar representaciones numéricas, que los modelos de tópicos pueden analizar. Los resultados muestran que el modelo BERTopic supera a LDA en coherencia, facilitando la segmentación e interpretación de ideas. Finalmente, el trabajo sugiere áreas de mejora, como la optimización de modelos y su despliegue en plataformas como Amazon SageMaker, lo que permitirá una integración eficiente en entornos empresariales. Este estudio contribuye a la automatización del análisis de ideas de innovación, ofreciendo una herramienta para que las empresas analicen grandes volúmenes de información de manera rápida y efectiva.
  • ÍtemAcceso Abierto
    Predicción a largo plazo del movimiento del precio de acciones bursátiles con base en sus estados financieros
    (ITESO, 2024-11) Topete-Salazar, Alan O.; Alcalá-Temores, Jaime E.
    En este trabajo, se replican algunos resultados obtenidos por Milosevic (2016) para predecir el movimiento de precios de acciones a largo plazo. El presente estudio contrasta en que se evalúan a las empresas con mayor capitalización de mercado en Estados Unidos, a comparación del estudio original que estudiaba compañías con capitalización media del mercado americano y europeo. A través de una revisión del trabajo previo, este estudio busca mejorar la precisión de las predicciones del movimiento de precios de acciones a largo plazo utilizando técnicas avanzadas de aprendizaje automático y comparar el rendimiento con métodos previamente propuestos. Se introducen nuevos modelos y técnicas, y se comparan con el enfoque anterior para evaluar su rendimiento. Se analiza la importancia de las características utilizadas en los modelos para entender mejor qué factores influyen más en las predicciones. Finalmente se proponen recomendaciones para futuros investigadores en el área basados en los hallazgos obtenidos.