Hacia la robustez en la comprensión de imágenes basada en computadora

La tesis aborda la problemática actual de la robustez de los modelos de aprendizaje profundo en visión artificial, un tema de creciente relevancia en la industria y la sociedad. El jurado ha valorado la viabilidad, el potencial y la originalidad de la propuesta, así como la perspectiva innovadora con la que se ha abordado el tema y las soluciones innovadoras presentadas para resolver los problemas planteados. Por todo ello, se ha considerado que los hallazgos tienen el potencial de revolucionar la industria.

Información básica

Diego Velázquez Dorta

Dr. Jordi González Sabaté Dr. Josep M. Gonfaus Sitjes Dr. Pau Rodríguez López

dirección de Jordi González Sabaté, investigador sénior del Centre de Visió per Computador - CVC; Josep María Gonfaus Sitjes, investigador de Satellogic; Yo Pau Rodríguez López, investigador de Apple Research.

Lista Centros CERCA
Universidad vinculada al centro

Instituto CERCA

Cerdanyola del Vallès, Spain

1994

Centre de Visió per Computador (CVC)

Área

Área DEEPTECH

Abstracto

This thesis embarks on an exploratory journey towards robustness in deep learning, with a keen focus on the intertwined facets of generalization, explainability, and edge cases within the field of computer vision. In deep learning, robustness epitomizes the resilience and flexibility of a model, based on its ability to generalize across diverse data distributions, explain its predictions transparently, and navigate effectively through the complexities of edge cases. The challenges associated with robust generalization are multifaceted, including the performance of the model on unseen data and its defense against out-of-distribution data and adversarial attacks. To bridge this gap, we explore the potential of Embedding Propagation (EP) to improve out-of-distribution generalization, which in turn strengthens the model's robustness against adversarial attacks and improves performance in low-sample and self-supervised learning. Within the maze of deep learning models, the path to robustness often intersects with explainability. As the complexity of the model increases, so does the urgency of deciphering its decision-making processes. Recognizing this, the thesis introduces a robust framework for evaluating and comparing various counterfactual explanation methods, echoing the imperative of quality of explanation over quantity and highlighting the complexities of diversifying explanations. At the same time, the deep learning landscape is full of edge cases, anomalies in the form of small objects or rare instances in object detection tasks that challenge the norm. Faced with this, the thesis presents an extension of the DEtection TRansformer model to improve small object detection that incorporates the Feature Pyramid technique, although it faces challenges such as high computational costs. With the emergence of fundamental models in mind, the thesis unveils EarthView, the largest-scale remote sensing dataset to date, built for self-supervised learning of a robust fundamental model for remote sensing. Collectively, these studies contribute to the grand narrative of robustness in deep learning, interweaving the threads of generalization, explainability, and edge-case performance. Through these methodological advances and novel datasets, the thesis calls for continued exploration, innovation, and refinement to strengthen the bastion of robust computer vision.

La tesis doctoral que precede a este documento representa un esfuerzo sistemático para resolver problemas en el campo de los modelos de aprendizaje profundo, un tema de creciente relevancia en la industria y la sociedad actuales. Esta investigación se articula en cuatro trabajos principales. A continuación, presentamos una propuesta para la aplicación del conocimiento y las herramientas desarrolladas, con el objetivo de aprovechar las ventajas comerciales e industriales de estos descubrimientos y orientar el desarrollo de políticas públicas fundamentadas. El siguiente documento explica cómo los resultados pueden influir y beneficiar a sectores clave. Capítulo 1: Detección de logotipos sin antecedentes. Los resultados de la investigación en detección y clasificación automática de objetos, específicamente mediante la extensión del enfoque DETR con pirámides de características, ofrecen avances significativos que pueden transformar la lucha contra la falsificación de logotipos. Según la Organización para la Cooperación y el Desarrollo Económicos (OCDE), el comercio mundial de productos falsificados representó hasta el 3,3 % del comercio mundial en 2016, alcanzando los 509 000 millones de dólares. Con esta gran economía sumergida en juego, la capacidad de detectar automáticamente logotipos falsificados es más crucial que nunca para la gestión de marcas y la protección de la propiedad intelectual. A continuación, destacamos algunas de las aplicaciones industriales y comerciales más prometedoras de los resultados de nuestra tesis, junto con datos cuantitativos que ilustran su impacto potencial: Aplicación comercial e industrial 1. Verificación de autenticidad de marca: en un mundo donde el comercio de productos falsificados vale alrededor de $ 600 mil millones anuales según The Guardian [1], nuestra tecnología se presenta como una solución clave para empresas en sectores como bienes de lujo, electrónica de consumo y ropa deportiva. La capacidad de verificar la autenticidad del logotipo puede redirigir estos flujos de efectivo significativos a negocios legítimos, mejorando la rentabilidad y fortaleciendo la confianza del consumidor. 2. Protección contra ventas de falsificaciones: con un estimado de $ 1.7 a $ 4.5 billones en productos falsificados vendidos anualmente en todo el mundo, nuestra tecnología se puede integrar en mercados en línea para analizar imágenes de productos listados, asegurando que los logotipos coincidan con los auténticos. Esto es vital ya que el 52% de los consumidores informan que pierden la confianza en una marca después de comprar un producto falsificado en línea [2], lo que tiene un impacto negativo duradero en la lealtad del cliente y las ventas. 1 3. Aplicaciones de seguridad documental: Los bancos y las compañías de seguros pueden beneficiarse de esta tecnología para verificar la autenticidad de los documentos y prevenir el fraude. Esta medida es crucial, ya que la pérdida de datos puede tener consecuencias financieras significativas y dañar la reputación empresarial. Por lo tanto, la seguridad documental es esencial para mantener la confianza del cliente y la integridad de sus datos personales y financieros. 4. Control de calidad de la producción: La importancia del control de calidad en la cadena de producción es crucial, ya que los costos asociados a los errores pueden ser considerables. La evidencia anecdótica sugiere que, en la fabricación, el costo de la mala calidad a menudo asciende a casi 100 veces el precio inicial de la pieza defectuosa. Esto significa que reparar un retenedor defectuoso de $7 puede costar hasta $700, y para un satélite de un millón de dólares, es probable que el costo supere los $100 millones [3]. Además, estudios recientes sugieren que, aunque los fabricantes calculan su costo de calidad en alrededor del 10% de los ingresos, en realidad este costo se acerca al 20% [4]. En este contexto, el uso de esta tecnología adquiere una relevancia clave. Dentro de la cadena de producción, la tecnología podría usarse para garantizar que los logotipos se apliquen correctamente y para corregir pequeños defectos en los productos durante el proceso de fabricación. Capítulo 2: Propagación por incrustación para suavizado múltiple Con los recientes avances en aprendizaje automático e inteligencia artificial, la necesidad de modelos que se generalicen bien en situaciones fuera de distribución (OOD) es más crítica que nunca. Los resultados presentados en el estudio de propagación por incrustación (EP) para suavizado múltiple abren nuevas vías para la generalización de modelos en aplicaciones comerciales e industriales, así como en el desarrollo de políticas públicas. La aplicación de EP puede transformar la forma en que las empresas abordan los problemas de clasificación de imágenes, detección de objetos y segmentación de imágenes, especialmente en áreas donde los datos OOD son comunes, como medicina (imágenes médicas), seguridad (sistemas de vigilancia) y la industria automotriz (vehículos autónomos). Aplicación comercial e industrial 1. Robustez mejorada ante ataques adversarios: Los modelos que son robustos ante ataques adversarios son esenciales para aplicaciones críticas como la seguridad y defensa de TI. La implementación de EP puede mejorar la seguridad de los sistemas de reconocimiento facial y detección de objetos en entornos vulnerables a ataques, como la seguridad bancaria o los sistemas de control de acceso. 2. Eficiencia en el etiquetado de datos: La eficiencia en el etiquetado de datos es crucial para el avance de la inteligencia artificial, en particular en campos como la medicina, donde el etiquetado manual puede resultar prohibitivamente costoso o poco práctico. Mediante el aprendizaje semisupervisado y autosupervisado, impulsado por EP, se puede reducir la necesidad de etiquetas, minimizando así los costes y acelerando la implementación de modelos de IA. En el sector sanitario, esto tiene profundas implicaciones: un informe sugiere que la IA podría mejorar los resultados de los pacientes hasta en un 40 % y reducir los costes de tratamiento hasta en un 50 % [5]. Ya se ha demostrado que la IA supera a los radiólogos humanos en precisión, identificando lesiones tuberculosas en radiografías de tórax con un 96 % de precisión, y puede diagnosticar el cáncer de mama 30 veces más rápido con un 99 % de precisión [5]. Además, la optimización de la gestión de datos impulsada por IA ha llevado a una reducción en los exámenes repetidos de hasta un 19% [3], lo que reduce los costos y la exposición a la radiación de los pacientes 3 . Estas mejoras no solo prometen ahorros financieros sustanciales, sino también un avance significativo en la calidad de la atención al paciente. Capítulo 3: Un punto de referencia basado en principios para los explicadores contrafactuales visuales La explicabilidad en IA juega un papel crucial no solo en el ámbito académico, sino también en los mundos comercial, industrial y político, ya que ayuda a aumentar la confianza de los usuarios en los modelos de IA. Cuando los usuarios comprenden cómo un modelo llega a sus decisiones, la probabilidad de que confíen y adopten la IA en varias aplicaciones aumenta significativamente. Esta capacidad para explicar decisiones complejas tiene el potencial de transformar la forma en que la sociedad ve y utiliza la IA, convirtiéndola en una herramienta más accesible, confiable y valiosa. Por lo tanto, la investigación sobre explicabilidad no solo sirve como base para futuros esfuerzos para mejorar la inteligencia artificial, sino que también impulsa la innovación y el progreso en muchos sectores, lo que permite una integración más amplia y efectiva de la IA en el tejido de la vida diaria. Los avances en la explicabilidad de los modelos de aprendizaje profundo son cruciales para una amplia gama de aplicaciones comerciales e industriales, así como para el desarrollo de políticas públicas. Algunas de las posibles aplicaciones de los resultados obtenidos en esta investigación se describen a continuación: Aplicaciones comerciales e industriales 1. Medicina: En el campo de la medicina, la integración de la inteligencia artificial (IA) no solo mejora significativamente el diagnóstico y el tratamiento, sino que también promete reducir los costos de atención médica. La adopción generalizada de la IA podría traducirse en ahorros del 5% al 10% en los costos de atención médica, equivalentes a aproximadamente 200 a 360 mil millones de dólares anuales [3]. Además, la implementación de esta tecnología conduce a una reducción en el tiempo dedicado a los tratamientos, comenzando con un ahorro de 21,67 horas por día por hospital en el primer año y alcanzando un pico de 122,83 horas por día por hospital en el décimo año. Este aumento en la eficiencia sugiere una reducción considerable de costos en el tiempo [4]. Sin embargo, para que ocurra esta aceptación, es esencial que los sistemas de IA brinden explicaciones claras y comprensibles, lo que fomentará la confianza de los profesionales y los pacientes. Los modelos explicativos, que mejoran la comunicación de las decisiones clínicas, también deben cumplir con los estrictos requisitos regulatorios que exigen transparencia en las tecnologías médicas. Esta combinación de eficiencia económica y claridad de razonamiento es clave para la integración exitosa de la IA en la salud pública. 2. Finanzas: En el sector financiero, la transparencia y la confianza son esenciales para la toma de decisiones en préstamos e inversiones. Las explicaciones detalladas generadas por los modelos de IA no solo pueden mejorar las relaciones con los clientes, sino también garantizar el cumplimiento normativo, un aspecto fundamental en un sector altamente regulado. Esta clarificación en las decisiones asistidas por IA también puede facilitar la gestión interna de riesgos y la justificación de estrategias financieras. 3. Automoción: En la industria automotriz, especialmente con el avance de los vehículos autónomos, la explicabilidad de las decisiones tomadas por modelos de inteligencia artificial (IA) se está convirtiendo en un factor crítico para aumentar la confianza de los usuarios y acelerar la aprobación regulatoria. Una comprensión clara de cómo y por qué un vehículo autónomo toma decisiones específicas en tiempo real no solo es esencial para garantizar la seguridad, sino que también puede tener un impacto económico significativo: una reducción del 1% en los incidentes de seguridad vial en EE. UU. podría ahorrar más de 8 mil millones de dólares anuales [5]. Esto subraya el potencial de los vehículos autónomos seguros impulsados por IA para transformar no solo la movilidad, sino también la economía. Esta visión holística de la tecnología enfatiza la importancia de la aceptación y confianza pública en esta nueva era de movilidad que la IA está redefiniendo. Desarrollo de Políticas Públicas 1. Transparencia y Sesgo: A medida que los gobiernos comienzan a adoptar la IA para la toma de decisiones, es esencial que estos modelos sean transparentes. Esto puede ayudar a prevenir decisiones sesgadas y garantizar que se respeten los derechos de los ciudadanos. Capítulo 4: EarthView: Un Conjunto de Datos de Teledetección a Gran Escala El progreso significativo en el modelado de inteligencia artificial y la acumulación de grandes conjuntos de datos han desbloqueado nuevas posibilidades en el campo de la teledetección. En particular, EarthMAE emerge como un modelo fundamental en esta esfera, distinguiéndose por su extraordinaria capacidad para ejecutar tareas novedosas, mostrando un rendimiento notable incluso en escenarios de disparo cero, donde el modelo se aplica a tareas que no ha visto durante el entrenamiento. Esto indica su versatilidad y su poderoso potencial para la extracción de conocimiento en situaciones no anticipadas previamente. Al mismo tiempo, EarthView se presenta como un conjunto de datos a gran escala (20 billones de píxeles), sin precedentes en su amplitud y profundidad, lo que permite una amplia aplicación en cualquier tarea de monitoreo terrestre. La combinación de un modelo como EarthMAE, con sus excepcionales capacidades de generalización, y un conjunto de datos como EarthView, rico en variedad y volumen, crea una simbiosis perfecta para la innovación en múltiples campos. Esto abre la puerta a la exploración y aplicación de estos recursos en una amplia gama de tareas de monitoreo terrestre, incluyendo las que se detallan a continuación: Comercial e industrial: 1. Agricultura de precisión: Las empresas del sector agrícola pueden beneficiarse de un aumento del 4% en la producción de cultivos y un aumento del 7% en la eficiencia de la aplicación de fertilizantes gracias a las tecnologías de agricultura de precisión [6]. Estos avances permiten no solo optimizar el rendimiento de los cultivos y la detección temprana de plagas y enfermedades, sino también gestionar los recursos hídricos de forma más eficiente. El resultado es una mejora significativa en la sostenibilidad y la eficiencia de la producción alimentaria, además de una reducción de más del 10% en la huella de carbono [7], lo que puede repercutir en ahorros económicos directos e indirectos, incluyendo la posible obtención de créditos de carbono. 2. Gestión Forestal y Monitoreo Ambiental: La aplicación de la gestión forestal activa puede tener beneficios notables en la captura de carbono [8], superando a los bosques no gestionados, y proporciona la ventaja adicional de generar energía de bajas emisiones a partir de residuos forestales y de aserraderos. En regiones como California, donde se gastan más de 1.000 millones de dólares anuales en la lucha contra los incendios forestales [8], una implementación proactiva de prácticas de gestión forestal podría implicar ahorros de cientos de millones, reduciendo la carga de combustible y la gravedad de los incendios. 3. Planificación urbana e infraestructura: En el contexto urbano, los árboles y la infraestructura de transporte no motorizado desempeñan un papel fundamental. Por ejemplo, en Tshwane, Sudáfrica, se ha estimado que plantar 1.000 árboles adicionales ahorra 3,82 millones de dólares anuales en energía de refrigeración [9], y en Coimbatore, India, se espera que una inversión en infraestructura de transporte no motorizado genere beneficios netos de hasta 510 millones de dólares en 23 años [10]. Estos datos subrayan la importancia de una planificación eficiente de la infraestructura y la creación de espacios optimizados que puedan dar lugar a ciudades más sostenibles y ecológicas, con un retorno de $31 en beneficios por cada dólar invertido, fomentando así una expansión urbana consciente y respetuosa con el medio ambiente. Desarrollo de políticas públicas: 1. Mitigación del cambio climático: Los gobiernos podrían utilizar los conocimientos para formular políticas más informadas sobre el cambio climático, como la mejora de la gestión de las emisiones de carbono o la planificación de iniciativas de reforestación. 2. Gestión de los recursos naturales: Podría mejorar la gestión del agua, los bosques y la biodiversidad, proporcionando herramientas para la toma de decisiones basada en datos para la conservación y la gestión sostenible de los recursos naturales.

Robustez; Aprendizaje profundo; Generalización; Explicabilidad; Casos límite; Visión artificial; Resiliencia; Flexibilidad; Distribuciones de datos; Predicciones transparentes; Datos no vistos; Datos fuera de distribución; Ataques adversarios; Propagación por incrustación (EP); Aprendizaje de muestra baja; Aprendizaje autosupervisado; Métodos de explicación contrafactual; Calidad de la explicación; Detección de objetos; Detección de objetos pequeños; Instancias raras; Transformador de detección (DETR); Técnica de pirámide de características; Altos costos computacionales; Modelos fundamentales; EarthView; Conjunto de datos de teledetección; Aprendizaje autosupervisado; Visión artificial robusta.