Ir al contenido principal

Entradas

Defensa de TFM: Estudio de Modelos de Segmentación para el Análisis de Jeroglíficos

En este Trabajo de Fin de Máster, el alumno Jesús del Remedio García Fructuoso aborda el problema de la falta de imágenes reales etiquetadas para el entrenamiento de redes neuronales dedicadas a la detección de instancias (en este caso, jeroglíficos). En concreto, se compararán los modelos clásicos HoG con modelos modernos como la red neuronal YOLO como red de detección de una sola pasada. Algunos de los problemas que son necesarios abordar para resolver el problema son la variedad de tamaños, soportes y formas. Para tratar la falta de imágenes reales etiquetadas se ha desarrollado una herramienta dedicada a la generación de muestra sintética escrito en el lenguaje Python. Gracias a la herramienta se ha obtenido un conjunto de datos en el que además de tener imágenes reales anotadas, también se tienen imágenes sintéticas cuya generación apenas tiene lı́mites.  

Defensa de TFM: Un sistema para la verificación de autoría de obras pictóricas basado en técnicas de aprendizaje profundo

El alumno Juan Montes Cano acaba de defender su TFM en el que compara varios modelos para la verificación de autoría de obras pictóricas basados en técnicas de aprendizaje profundo.  

Publicación en congreso: A Study on Automatic Analysis of Handwriting Alterations due to Parkinson’s Disease

Publicado como Conference Proceedings en Springer , un artículo presentado en el 23rd EPIA Conference on Artificial Intelligence celebrado en Viana do Castelo (Portugal). En este trabajo se ha utilizado redes convolucionales sobre la base de datos "Parkinson’s Disease Handwriting Database" (PaHaW), que está compuesta por el resultado de diferentes tareas manuscritas efectuadas tanto por pacientes de Parkinson como por sujetos de control. El objetivo de la investigación era el de crear un modelo para detectar y predecir, a nivel de trazo, sílaba y tarea, si un paciente presentaba la enfermedad de Parkinson.      

Publicación en revista: A Pix2Pix Architecture for Complete Offline Handwritten Text Normalization

Publicación en Sensors . Este artículo presenta el uso de un modelo entrenable Pix2Pix, un tipo específico de red adversaria generativa condicional, como método para normalizar imágenes de texto escrito a mano. En el ámbito del reconocimiento de texto escrito a mano off-line , a lo largo de los años se han desarrollado numerosos algoritmos de normalización y preprocesamiento antes de aplicar los modelos de reconocimiento automático a imágenes escaneadas de texto manuscrito.  Estos algoritmos han demostrado eficacia para mejorar el rendimiento general de las arquitecturas de reconocimiento.  Sin embargo, muchos de estos métodos dependen en gran medida de estrategias heurísticas que no se integran perfectamente con la propia arquitectura de reconocimiento. Además, este algoritmo se puede integrar perfectamente como etapa inicial de cualquier arquitectura de aprendizaje profundo diseñada para tareas de reconocimiento escrito a mano. Además, este enfoque facilita el entrenamient...

Contrato de un año en el grupo GAVAB de la URJC para desarrollo de modelos de reconocimiento de texto

Estamos desarrollando un proyecto de investigación financiado por el Ministerio de Economía titulado “ Análisis de Texto Manuscrito para Aplicaciones Digitales de la Sociedad “. Dentro de dicho proyecto se convoca una plaza de investigación durante un año para el desarrollo de modelos de reconocimiento de escritura manuscrita. Inicialmente, el contrato comenzaría en septiembre de 2023. Idealmente, se busca a una persona con grado universitario, con conocimientos de programación, valorándose especialmente los conocimientos en visión artificial y estar estudiando o haber terminado un máster. El periodo de recepción de solicitudes empieza el día 25-04-2023, termina el día 18-05-2023 y la solicitud se puede presentar en está dirección .

Concesión del proyecto HADAS: Análisis de Texto Manuscrito para Aplicaciones Digitales de la Sociedad

Financiado por el MICINN. Este proyecto aborda el problema de la transcripción del texto manuscrito continuo, obtenido desde páginas digitalizadas de documentos genéricos. Considera muchas de las posibles variabilidades implicadas (por ejemplo, la estructura de los documentos donde aparece el texto o las diferencias interpersonales e intrapersonales entre los estilos de escritura). Este problema está lejos de poder resolverse eficazmente de forma automática. Por ello, y debido a sus potenciales aplicaciones, la transcripción y comprensión del contenido de los documentos manuscritos digitalizados seguirá siendo una necesidad importante para nuestra sociedad. Así, este proyecto investiga varios problemas científicos e industriales desafiantes relacionados con el procesamiento automático de texto manuscrito contenido en imágenes digitales de documentos. En particular: (1) el reconocimiento de palabras manuscritas en castellano; (2) la transcripción de documentos históricos; (3) l...

Defensa de TFM: Uso de redes neuronales generativas para la generación de imágenes a partir de texto

TFM publicado en la biblioteca de la URJC. En este trabajo se realiza un estudio de los distintos tipos de GANs y un estado del arte del problema de generación de imágenes a partir de texto. En la parte práctica se han realizado múltiples experimentos, partiendo de problemas sencillos de generación de imágenes hasta llegar a plantear modelos que generen imágenes a partir de texto.  

Defensa de TFG: Neuropaint, evolución de la biblioteca Neurotronik para la representación de redes profundas de neuronas artificiales

TFG publicado en Github y en la biblioteca de la URJC La representación gráfica de las redes de neuronas artificiales profundas tiene un alto interés en el campo científico. Numerosos trabajos científicos que incluyen este tipo de redes son presentados a diario en congresos y revistas de todo el mundo. En este Trabajo de Fin de Grado se proponen una serie de mejoras a la interfaz de usuario de la aplicación NeuroPaint, desarrollada por Marcos Ruiz en el año 2021, que permitía la representación gráfica, en notación AlexNet, de una amplia variedad de redes neuronales profundas. La aplicación desarrollada es de código abierto y este enlace te permite utilizarla.

Defensa de TFG: Predicción Automática de Características Demográficas de Individuos basada en su Escritura Manuscrita

TFG publicado en la biblioteca de la URJC. Este Trabajo de Fin de Grado desarrolla modelos de IA para clasificar textos manuscritos en inglés y árabe según diferentes atributos relativos a los escritores de los escritores. Entre estos atributos se han considerado: el género, la mano de escritura, la lengua materna y el rango de edad. La clasificación de textos manuscritos es una tarea muy importante en sectores como Biometría Forense y Psicología, de cara a sacar conclusiones en base a las características de los escritores. Para realizar esta tarea se han utilizado dos modelos de redes neuronales: una red convolucional sencilla (CNN) y otra más compleja con capas de tipo Inception.   Texto reconocido como de un hombre menor de 20 años (base de datos LAMIS-MSHD)    

Defensa de TFG: Detección de Sellos y Logos en Imágenes de Documentos Históricos usando Redes Neuronales Profundas

TFG publicado en la biblioteca de la URJC. Este Trabajo de Fin de Grado ha abordado la problemática de detección de sellos y logos en imágenes de documentos históricos usando las redes neuronales profundas de detección YOLOv5. Este tipo de documentos son muy valiosos para la preservación del patrimonio cultural de los países, y su análisis automático presenta dificultades debido al proceso de digitalización y el borrado de tinta de los documentos, entre otros factores. 

Publicación en congreso: Handwritten Word Recognition on the Fundación-Osborne Dataset

Presentado en el congreso IWINAC 2022 y publicado como artículo en Lecture Notes in Computer Science .   Incluso hoy en día, el reconocimiento de texto manuscrito escaneado constituye un problema de investigación desafiante, especialmente cuando se trata de realizar tareas de reconocimiento en bases de datos históricas.  En este contexto, el objetivo principal del presente trabajo es exponer los resultados obtenidos tras entrenar una red convolucional profunda Seq2Seq con mecanismo de atención utilizando una combinación de imágenes de entrenamiento de palabras tanto de bases de datos contemporáneas como históricas, consiguiendose un error a nivel de palabra inferior al 40%. A la luz de los resultados obtenidos, se discute el efecto del uso de diferentes proporciones de texto moderno e histórico durante el proceso de entrenamiento sobre el rendimiento final del sistema.

Publicación en congreso: Deep Layout Extraction Applied to Historical Postcards

Presentado en el congreso IWINAC 2022 y publicado como artículo en Lecture Notes in Computer Science .  En este trabajo se presenta una arquitectura neuronal profunda para el análisis de la estructura de postales históricas manuscritas.   La arquitectura se basa en una red de neuronas profunda de segmentación semántica que contempla diferentes tipos de categorías como: sellos, matasellos, texto manuscrito, ilustraciones y fondo.  El trabajo consigue unos resultados de acierto superiores al 92% a nivel de píxel.

Publicación en revista: A Bibliometric Analysis of Off-line Handwritten Document Analysis Literature (1990-2020)

Artículo publicado en la revista Pattern Recognition . Autores: Victoria Ruiz-Parrado, Ruben Heradio, Ernesto Aranda-Escolastico, Ángel Sánchez, José F. Vélez. El análisis automático de la escritura manuscrita es un reto muy importante. Hay que superar muchas dificultades (por ejemplo, diferentes estilos de escritura, alfabetos, idiomas, etc.) para abordar diversos problemas (reconocimiento de textos, verificación de firmas, identificación de escritores, localización de palabras, etc.). Este trabajo revisa la creciente literatura sobre el análisis de documentos manuscritos offlie en los últimos treinta años. Utilizando técnicas bibliométricas se examina una muestra de 5389 artículos. Este trabajo identifica (i) los artículos más influyentes en el área, (ii) los autores más productivos y sus redes de colaboración, (iii) los países e instituciones que han liderado la investigación sobre el tema, (iv) las revistas y conferencias que han publicado más artículos, y (v) los temas de investi...

Defensa de TFG: Una aplicación web para la representación gráfica de redes de neuronas artificiales

TFG publicado en Github y en la biblioteca de la URJC En este Trabajo Fin de Grado se ha creado una aplicación web llamada Neuropaint enfocada en la creación de representaciones gráficas de redes profundas de neuronas. Este enlace a github da acceso al código, y este otro enlace da acceso a la aplicación.

Publicación en revista: SSD vs. YOLO for Detection of Outdoor Urban Advertising Panels under Multiple Variabilities

Publicado en Sensors    Este trabajo compara una red SSD con una red YOLO para el problema de detección del paneles de publicidad exterior en entornos urbanos reales.  La detección de paneles de publicidad en imágenes ofrece importantes aplicaciones tanto en el mundo real como en el virtual. Por ejemplo, aplicaciones como Google Street View podrían utilizarla para actualizar o personalizar la publicidad que aparece en las imagenes de las calles.  En nuestros experimentos, tanto las redes SSD como las redes YOLO han producido resultados interesantes ante diferentes tamaños de paneles, condiciones de iluminación, perspectivas de visión, oclusiones parciales, fondos complejos y múltiples paneles en cada escenas.  Debido a la dificultad de encontrar imágenes anotadas para el problema considerado, creamos nuestro propio conjunto de datos para llevar a cabo los experimentos.  La mayor fortaleza del modelo SSD fue la casi eliminación de los casos de Falsos Po...

Publicación en revista: Off-line handwritten signature verification using compositional synthetic generation of signatures and Siamese Neural Networks

Publicado en Neurocomputing En este trabajo, se propone el uso de Siamese Neural Networks para ayudar a resolver el problema de verificación de firmas manuscritas fuera de línea con falsificaciones aleatorias en un contexto independiente del escritor. El sistema puede ser utilizado para verificar nuevos firmantes con tan solo una firma modelo con la que comparar. Se han analizado el uso de tres tipos de datos sintéticos para aumentar la cantidad de muestras y la variabilidad necesaria para el entrenamiento de redes neurales profundas: muestras de datos aumentados del conjunto de datos GAVAB, una propuesta de generación de firma sintética compositiva a partir de primitivas de forma y el conjunto de datos sintéticos GPDSS. Los dos primeros enfoques son generados "bajo demanda" y pueden utilizarse durante la fase de formación para producir un número potencialmente infinito de firmas sintéticas. El sistema se ha probado con los conjuntos de datos GPSSynthetic, MCYT, SigCo...

Concesión del proyecto ASTRID: Análisis y Transcripción Semántica para Imágenes de Documentos Manuscritos

Ministerio de Ciencias, innovación y universidades Advances in the development of methods for automatically extracting and understanding the content of handwritten digitized documents will continue being an important need for our society. This project addresses three challenging computational problems related to automatic handwritten text processing of document images: (1) document layout extraction over unstructured documents, (2) continuous handwritten text recognition under unrestricted conditions and (3) offline verification of human signatures using advanced deep neural models, respectively. The proposed solutions to previous problems will be adapted to several applications presenting a socio-economic interest. In particular: the analysis and transcription of historical documents, and some demographic prediction problems based on use of handwriting (for example, recognizing the gender or handedness of a person). In this project, we will emphasize the application of developments ...

Publicación en revista: Multiview 3D human pose estimation using improved least-squares and LSTM networks

Publicado en Neurocomputing En este artículo se presenta un método para estimar la pose del cuerpo humano en 3D a partir de múltiples vistas 2D utilizando aprendizaje profundo. El sistema está formado una sucesión de subsistemas. Primeramente, se obtienen las poses 2D usando una red de neuronas profunda que detecta los puntos claves de un esqueleto simplificado del cuerpo en las vistas disponibles. Luego, se recosntruyen las coordenadas 3D de cada punto utilizando una propuesta original, basada en optimización de mínimos cuadrados, que analiza la calidad de las anteriores detecciones 2D para decidir si aceptarlas o no. Una vez que se dispone de las poses 3D, se estima la posición completa del cuerpo, teniendo en cuenta la historia pasada para refinarla mediante una red LSTM. En la parte experimental, el artículo ofrece unos resultados competitivos cuando se compara con trabajos representativos de la literatura. In this paper we present a deep learning based method to estimate the ...

Publicación en congreso: Una metodología para la realización y evaluación efectiva de exámenes de programación usando el ordenador

Publicado en el congreso JENUI 2018 . El uso de ordenadores durante los exámenes de programación es una demanda muy habitual entre los estudiantes universitarios. En este trabajo se presenta una metodología para evaluar a los estudiantes de un curso de programación, que incorpora como novedad principal el uso del ordenador, por parte de los estudiantes, durante el examen. El trabajo comienza justificando las ventajas del uso del ordenador durante el examen y explicando los retos que introduce. Luego, se describen los diferentes procedimientos que componen la metodología propuesta: prácticas en casa, test unitarios, exámenes prácticos y exámenes tipo test. También se describen en este trabajo dos herramientas que se han desarrollado ad-hoc para complementar dicha metodología. La primera herramienta tiene por objetivo impedir el uso fraudulento del ordenador durante el examen. La segunda herramienta sirve para semiautomatizar la corrección de los exámenes. Finalmente, en ...

Publicación en congreso: Situation Awareness Cognitive Agent for Vehicle Geolocation in Tunnels

Publicado en Communications in Computer and Information Science The integration of geolocation, big data and cognitive agents has become one of the most boosting business tools of the digital era. By definition, geolocation represents the use of different technologies in a variety of applications to help locate humans and objects. To really achieve smart services, companies also require accessing huge volumes of related information to draw meaningful conclusions. With big data, it is possible to establish connections between a wide range of associated information, and use it to improve available services or create new ones. Today, the influence of geolocation, cloud data science and involved cognitive agents impacts many application fields, which include: safety and security, marketing, beacon technology, geofencing, location-sensitive services, transportation and logistics, healthcare, urban governance, intelligent buildings and smart cities, intelligent transport systems, advanced ...