Adaptación del dominio entre el mundo virtual y el real aplicada a la detección de peatones

Simplificación del proceso de mejora de productos para seguridad vial y otras aplicaciones industriales.

Alta proximidad al mercado.

Información básica

David Vázquez Bermúdez

López Peña, Antonio Manuel Ponsa, Daniel

Antonio M. López - Daniel Ponsa

Lista Centros CERCA
Universidad vinculada al centro

https://portalrecerca.csuc.cat/107343295

Instituto CERCA

Cerdanyola del Vallès, Spain

1994

Centre de Visió per Computador (CVC)

Área

Área DEEPTECH

Abstracto

La detección de peatones es clave para numerosas aplicaciones, como la asistencia al conductor, la videovigilancia o el multimedia. Los mejores detectores se basan en clasificadores basados en modelos de apariencia entrenados con ejemplos anotados. Sin embargo, el proceso de anotación es una tarea ardua y subjetiva cuando lo realizan personas. Por lo tanto, conviene minimizar la intervención humana en dicha tarea mediante el uso de herramientas computacionales como los mundos virtuales, ya que con ellos se pueden obtener anotaciones variadas y precisas rápidamente. No obstante, el uso de este tipo de datos plantea la siguiente pregunta: ¿Es posible que un modelo de apariencia entrenado en un mundo virtual funcione satisfactoriamente en el mundo real? Para responder a esta pregunta, hemos realizado diversos experimentos que sugieren que los clasificadores entrenados en el mundo virtual pueden ofrecer buenos resultados al aplicarse en entornos reales. No obstante, también se ha descubierto que, en algunos casos, estos clasificadores pueden verse afectados por el problema conocido como cambio en la naturaleza de los datos, al igual que ocurre con los clasificadores entrenados en el mundo real. En consecuencia, hemos diseñado un sistema de adaptación de dominio, V-AYLA, en el que hemos probado diferentes técnicas para recopilar unos pocos ejemplos del mundo real y combinarlos con una gran cantidad de ejemplos del mundo virtual para entrenar un detector de peatones adaptado. V-AYLA ofrece la misma precisión de detección que un detector entrenado con anotaciones manuales y probado con imágenes reales del mismo dominio. Idealmente, nos gustaría que nuestro sistema se adaptara automáticamente sin necesidad de intervención humana. Por lo tanto, a modo de demostración, proponemos utilizar técnicas de adaptación no supervisada que permitan eliminar por completo la intervención humana del proceso de adaptación. Hasta donde sabemos, este es el primer trabajo que demuestra que es posible desarrollar un detector de objetos en el mundo virtual y adaptarlo al mundo real. Finalmente, proponemos una estrategia diferente para evitar el problema del cambio en la naturaleza de los datos que consiste en recopilar ejemplos en el mundo real y volver a entrenar solo con ellos pero haciéndolo de tal forma que no tengan que anotar peatones en el mundo real. El resultado de este clasificador es equivalente a otro entrenado con anotaciones obtenidas manualmente. Los resultados presentados en esta tesis no se limitan a adaptar un detector de peatones virtual al mundo real, sino que van más allá, mostrando una nueva metodología que permitiría a un sistema adaptarse a cualquier nueva situación y que sienta las bases para futuras investigaciones en este campo aún inexplorado.

Esta tesis aborda diferentes problemas importantes para la industria: la detección de peatones, la generación de datos sintéticos y la adaptación al dominio. La detección de personas/peatones tiene una gran importancia en la industria de la automoción tanto en los sistemas de asistencia a la conducción para prevenir accidentes como en la navegación autónoma Además tiene otras muchas aplicaciones en industrias tan diversas como la seguridad, el audiovisual, el entretenimiento, los smartphones, etc. Nosotros proponemos un método robusto de detección de personas que hemos aplicado con éxito en proyectos industriales con dos importantes empresas del sector de la automoción y uno con un fabricante de smartphones. Cualquier aplicación basada en visión artificial requiere datos de entrenamiento para aprender un modelo. Estos datos deben contener una gran cantidad de ejemplos que reflejen las diferentes variaciones que puede presentar un objeto y deben estar correctamente anotados. Obtener toda esta información no es una tarea fácil Suele ser muy tedioso y supone un gran esfuerzo económico a la hora de desarrollar una aplicación industrial. Nosotros proponemos el uso de imágenes virtuales de un videojuego para solucionar este problema. La mayoría de las aplicaciones basadas en visión artificial se enfrentan al problema de la generalización, ya que las condiciones de adquisición de los datos de entrenamiento suelen variar según las condiciones de los diferentes entornos de aplicación. Proponemos la aplicación de técnicas de adaptación de dominio para resolver este problema. Empresas como Xerox han mostrado interés en nuestro sistema.

Detección de peatones; Asistencia al conductor; Videovigilancia; Multimedia; Detectores; Clasificadores; Modelos; Apariencia entrenada; Ejemplos anotados; Proceso de anotación; Tarea intensiva; Subjetivo; Intervención humana; Herramientas computacionales; Mundos virtuales; Anotaciones variadas; Anotaciones precisas; Anotación rápida; Generación de datos; Modelo de apariencia; Mundo real; Experimentos; Buenos resultados; Entornos del mundo real; Clasificadores; Cambio en la naturaleza de los datos; Sistema de adaptación del dominio; V-AYLA; Técnicas; Ejemplos del mundo real; Ejemplos del mundo virtual; Detector de peatones; Precisión de detección; Anotaciones manuales; Imágenes reales; Adaptación automática; Técnicas no supervisadas

Bloques de contenido

Ceremonia de entrega de premios