Implementación de redes neuronales convolucionales para el reconocimiento de imágenes de objetos perdidos en aeropuertos
Fecha
Autores
Título de la revista
ISSN de la revista
Título del volumen
Editor
Resumen
El desarrollo acelerado de la tecnología de procesamiento digital de imágenes a nivel global ha logrado obtener grandes avances dentro de la rama de las ciencias computacionales, particularmente en el campo de la visión por computadora y el reconocimiento de patrones. La implementación de una gran cantidad de técnicas de preprocesamiento, junto con arquitecturas de aprendizaje profundo cada vez más sofisticadas, contribuyen en conjunto a un mejor modelado y aprendizaje automático que permita generar estimaciones favorables para la resolución de problemas complejos en diversos dominios de aplicación. En este trabajo se presenta el desarrollo de un modelo de redes neuronales para el reconocimiento y clasificación de imágenes de objetos perdidos en aeropuertos, abordando una problemática recurrente en las instalaciones aeroportuarias donde diariamente se registran numerosos casos de pertenencias extraviadas. El modelo propuesto tiene como objetivo principal procesar las imágenes de objetos extraviados en las instalaciones aeroportuarias para clasificarlos automáticamente que pueda facilitar a los propietarios la recuperación de sus pertenencias de manera eficiente, reduciendo así los tiempos de búsqueda y mejorando la gestión de objetos perdidos.
Se selecciona como base de datos el repositorio ImageNet, creada por la Universidad de Princeton, contiene más de dos millones de imágenes organizadas en categorías semánticas denominadas synsets, derivadas de la estructura jerárquica de WordNet, también un recurso lexico creado en Princeton. Esta ontología organiza conceptos visuales en árboles con hasta catorce niveles de profundidad. Las categorias utilizadas son recaudadas mediante el descarte de objetos no permitidos en salas de espera dentro de los aeropuertos de acuerdo a las normas internacionales de aviación civil. Una vez seleccionadas las clases, cada imagen fue sometida a un pipeline de cinco etapas para su preprocesamiento. La arquitectura principal del proyecto fue la CNN extendida, organizada en seis bloques convolucionales ascendentes de 32 a 512 filtros, incorporando en cada bloque BatchNormalization, Dropout y terminando en una capa GlobalAveragePooling2D antes de la clasificación densa.
Se entrenan y se evaluan 15 experimentos en los cuales se realizan ajustes sistemáticos a los diferentes hiperparámetros que configuran a la arquitectura del modelo principal. Dichos experimentos se dividen en 3 bloques donde en cada uno de ellos se fueron ajustando distintos tipos de hiperparámetros referentes al optimizados, aumentación de los datos y regularización de las capas convolucionales. Se selecciona el modelo con el mejor rendimiento de acuerdo a la métrica de exactitud.
El modelo generado y seleccionado con mejor rendimiento demostró ser capaz de procesar las imagenes con un pipeline completo de transformaciones para mejorar la representación de los objetos a clasificar. También entregó una clasificación base con gran potencial de mejora de su rendimiento. Se planeá incorporar un mejor repositorio de imagenes que puedan representar de manera más presisa el dominio de categorias propias a los aeropuertos a ser implementados para mejorar el rendimiento del modelo.