Hacia la moda inteligente: reconocimiento visual de productos y atributos

El jurado ha evaluado que la tesis describe la aplicación de la Inteligencia Artificial (IA) para mejorar dos procesos relacionados con el procesamiento de imágenes en el sector de la moda: la identificación automática de prendas y el procesamiento automatizado del color (clasificación). Si bien se trata de un área con gran competencia, muestra resultados incrementales muy superiores a los sistemas actuales. Demuestra una tecnología interesante y aplicable, sin duda en línea con la tendencia del mercado global. La empresa Wide Eyes Technologies está aplicando esta tecnología.

Información básica

Vacit Oğuz Yazici

Dr. Joost van de Weijer Dr. Arnau Ramisa

Lista Centros CERCA

https://portalrecerca.csuc.cat/107643339

Instituto CERCA

Cerdanyola del Vallès, Spain

1994

Centre de Visió per Computador (CVC)

Área

Área DEEPTECH

Abstracto

La inteligencia artificial está innovando en la industria de la moda al proponer nuevas soluciones a los problemas que enfrentan los investigadores e ingenieros. En esta tesis, abordamos tres de estos problemas. En la primera parte, investigamos el problema de la clasificación de imágenes multietiqueta, estrechamente relacionado con el reconocimiento de atributos de moda. En la segunda parte, abordamos dos problemas específicos de la moda. Primero, abordamos la detección del producto principal, que consiste en asociar las partes correctas de la imagen con el producto de moda que se vende. Segundo, abordamos el problema del reconocimiento categórico del color en prendas multicolor. Si consideramos el problema de la clasificación de imágenes multietiqueta como un problema de predicción de conjuntos de conceptos sin un orden específico, podemos aprovechar las redes neuronales recurrentes (RNN) para capturar estas correlaciones de etiquetas. Sin embargo, las RNN están entrenadas para predecir secuencias ordenadas de símbolos, por lo que si el orden de la secuencia predicha difiere del orden de la secuencia en la anotación de referencia, la red neuronal sufrirá una penalización incluso si las predicciones son correctas. Por lo tanto, en la primera parte de la tesis, proponemos una función objetivo para ordenar dinámicamente la secuencia de etiquetas en la anotación de referencia para lograr la mínima discrepancia en la predicción. Esto resulta en una mejora significativa de los modelos RNN en la clasificación de imágenes de múltiples etiquetas. Sin embargo, las RNN sufren dependencias a largo plazo cuando la cardinalidad del conjunto aumenta. Los modelos de transformador se pueden utilizar para evitar el problema de la dependencia a largo plazo. En consecuencia, proponemos un nuevo modelo de transformador para la clasificación de imágenes de múltiples etiquetas que supera los resultados del estado del arte por un amplio margen. En la segunda parte de la tesis, nos centramos en dos problemas específicos de la moda. La detección de productos es la tarea de asociar partes de la imagen con el producto de moda que se vende, generalmente utilizando metadatos textuales asociados. En esta tesis, representamos las regiones rectangulares de interés de todas las imágenes como vértices en un grafo completamente conectado. Nuestro algoritmo resulta en una mejora significativa sobre el estado del arte. Además, abordamos el problema del reconocimiento categórico de color para prendas multicolores, una tarea compleja debido a factores externos como cambios de iluminación u oclusiones causadas por otros objetos. En el contexto de la clasificación de imágenes multietiqueta, los límites difusos entre clases en el espacio de color generan ambigüedad. Sin embargo, se espera que un modelo inteligente de reconocimiento categórico de color pueda predecir el número correcto de colores en prendas monocromáticas o multicolores. Por lo tanto, en esta tesis proponemos una nueva arquitectura con una salida adicional que predice explícitamente el número de colores en prendas de moda. Esto elimina el problema de la ambigüedad y mejora significativamente los resultados.

we summarized the works presented in the thesis and their industrial impacts in three sections. In the first two sections, we tackled the task of fashion attribute recognition and in the last section, we addressed the problem of main product detection. We stated that improving the accuracy of CV-based fashion systems is in the best interest of all parties in the industry. It saves e-commerce retailers from allocating resources on the manual process of labeling their catalogs. It also makes the online buying process smoother and faster for customers as more similar products to the garment of interest are recommended to them, which can definitely help to increase sales in retail clothing

Artificial Intelligence (AI); Fashion Industry; Multi-label Image Classification; Fashion Attributes; Main Product Detection; Categorical Color Recognition; Multi-colored Clothes; Recurrent Neural Networks (RNNs); Label Correlations; Ordered Sequences; Objective Function; Dynamic Ordering; Minimum Discrepancy; Transformer Models; Long-term Dependencies; State-of-the-Art Results; Product Detection; Textual Metadata; Rectangular Regions of Interest; Fully Connected Graph; Lighting Changes; Occlusions; Fuzzy Boundaries; Color Space Ambiguity; Number of Colors Prediction; New Architecture.