
Cap a la robustesa en la comprensió d'imatges basada en ordinador
Informació básica
Diego Velázquez Dorta
2023
Jordi Gonzalez Sabaté Dr. Josep M. Gonfaus Sitjes Dr. Pau Rodríguez López
direcció de Jordi González Sabaté, investigador sènior del Centre de Visió per Computador - CVC; Josep Maria Gonfaus Sitjes, investigador de Satellogic; i Pau Rodríguez López, investigador d'Apple Research.
Premi
Masculí
CVC
Universitat Autònoma de Barcelona (UAB)
Sí
Institut CERCA

Cerdanyola del Vallès, Spain
1994
Centre de Visió per Computador (CVC)
Àrea
Automatització
Nova AI
Salut i Medicina
Producció
Tecnologies de la informació i la comunicació
Aprenentatge automàtic i intel·ligència artificial
Resum
This thesis embarks on an exploratory journey towards robustness in deep learning, with a keen focus on the intertwined facets of generalization, explainability, and edge cases within the field of computer vision. In deep learning, robustness epitomizes the resilience and flexibility of a model, based on its ability to generalize across diverse data distributions, explain its predictions transparently, and navigate effectively through the complexities of edge cases. The challenges associated with robust generalization are multifaceted, including the performance of the model on unseen data and its defense against out-of-distribution data and adversarial attacks. To bridge this gap, we explore the potential of Embedding Propagation (EP) to improve out-of-distribution generalization, which in turn strengthens the model's robustness against adversarial attacks and improves performance in low-sample and self-supervised learning. Within the maze of deep learning models, the path to robustness often intersects with explainability. As the complexity of the model increases, so does the urgency of deciphering its decision-making processes. Recognizing this, the thesis introduces a robust framework for evaluating and comparing various counterfactual explanation methods, echoing the imperative of quality of explanation over quantity and highlighting the complexities of diversifying explanations. At the same time, the deep learning landscape is full of edge cases, anomalies in the form of small objects or rare instances in object detection tasks that challenge the norm. Faced with this, the thesis presents an extension of the DEtection TRansformer model to improve small object detection that incorporates the Feature Pyramid technique, although it faces challenges such as high computational costs. With the emergence of fundamental models in mind, the thesis unveils EarthView, the largest-scale remote sensing dataset to date, built for self-supervised learning of a robust fundamental model for remote sensing. Collectively, these studies contribute to the grand narrative of robustness in deep learning, interweaving the threads of generalization, explainability, and edge-case performance. Through these methodological advances and novel datasets, the thesis calls for continued exploration, innovation, and refinement to strengthen the bastion of robust computer vision.
La tesi doctoral que precedeix aquest document representa un esforç sistemàtic per resoldre problemes en el camp dels models d'aprenentatge profund, un tema de creixent rellevància en la indústria i la societat actuals. Aquesta recerca s'articula a través de quatre treballs principals. Ara presentem una proposta per a l'aplicació del coneixement i les eines desenvolupades, destinades a explotar els avantatges comercials i industrials d'aquests descobriments i guiar el desenvolupament de polítiques públiques informades. El següent document explica com els resultats poden influir i beneficiar sectors clau. Capítol 1: Detecció de logotips sense antecedents Els resultats de la recerca en la detecció i classificació automàtica d'objectes, concretament mitjançant l'extensió de l'enfocament DETR amb piràmides de característiques, ofereixen avenços significatius que poden transformar la lluita contra la falsificació de logotips. Segons l'Organització per a la Cooperació i el Desenvolupament Econòmics (OCDE), el comerç mundial de productes falsificats va representar fins a un 3,3% del comerç mundial el 2016, amb un valor de 509.000 milions de dòlars. Amb aquesta gran economia submergida en joc, la capacitat de detectar automàticament logotips falsificats és més crítica que mai per a la gestió de marques i la protecció de la propietat intel·lectual. A continuació, destaquem algunes de les aplicacions industrials i comercials més prometedores dels resultats de la nostra tesi, juntament amb dades quantitatives que il·lustren el seu impacte potencial: Aplicació comercial i industrial 1. Verificació de l'autenticitat de la marca: En un món on el comerç de productes falsificats valora al voltant de 600.000 milions de dòlars anuals segons The Guardian [1], la nostra tecnologia es presenta com una solució clau per a empreses de sectors com els béns de luxe, l'electrònica de consum i la roba esportiva. La capacitat de verificar l'autenticitat del logotip pot redirigir aquests fluxos d'efectiu significatius cap a negocis legítims, millorant la rendibilitat i enfortint la confiança del consumidor. 2. Protecció contra les vendes de productes falsificats: Amb una xifra estimada d'entre 1,7 i 4,5 bilions de dòlars en productes falsificats venuts anualment a tot el món, la nostra tecnologia es pot integrar en mercats en línia per analitzar imatges dels productes que figuren a la llista, garantint que els logotips coincideixin amb els autèntics. Això és vital, ja que el 52% dels consumidors informen que han perdut la confiança en una marca després de comprar un producte falsificat en línia [2], cosa que té un impacte negatiu durador en la fidelització dels clients i les vendes. 1 3. Aplicacions de seguretat de documents: Els bancs i les companyies d'assegurances poden beneficiar-se d'aquesta tecnologia per verificar l'autenticitat dels documents i prevenir el frau. Aquesta mesura és de vital importància, ja que la pèrdua de dades pot tenir conseqüències financeres significatives i danys a la reputació empresarial. Per tant, la seguretat dels documents és essencial per mantenir la confiança dels clients i la integritat de les seves dades personals i financeres. 4. Control de qualitat de la producció: La importància del control de qualitat a la cadena de producció és crítica, ja que els costos associats als errors poden ser substancials. L'evidència anecdòtica suggereix que en la fabricació, el cost de la mala qualitat sovint ascendeix a gairebé 100 vegades el preu inicial de la peça defectuosa. Això significa que un retenedor defectuós de 7 dòlars pot costar fins a 700 dòlars de reparar, i per a un satèl·lit d'un milió de dòlars, és probable que el cost superi els 100 milions de dòlars [3]. A més, estudis recents suggereixen que, tot i que els fabricants calculen el seu cost de qualitat al voltant del 10 per cent dels ingressos, en realitat aquest cost és més proper al 20 per cent [4]. En aquest context, l'ús d'aquesta tecnologia adquireix una rellevància clau. Dins de la cadena de producció, la tecnologia es podria utilitzar per garantir que els logotips s'apliquen correctament i per corregir petits defectes en els productes durant el procés de fabricació. Capítol 2: Propagació per incrustació per al suavització de varietats Amb els avenços recents en l'aprenentatge automàtic i la intel·ligència artificial, la necessitat de models que es generalitzin bé en situacions fora de distribució (OOD) és més crítica que mai. Els resultats presentats a l'estudi de la propagació per incrustació (EP) per al suavització de varietats obren noves vies per a la generalització de models en aplicacions comercials i industrials, així com en el desenvolupament de polítiques públiques. L'aplicació de la EP pot transformar la manera com les empreses aborden els problemes de classificació d'imatges, detecció d'objectes i segmentació d'imatges, especialment en àrees on les dades OOD són comunes, com ara la medicina (imatges mèdiques), la seguretat (sistemes de vigilància) i la indústria de l'automoció (vehicles autònoms). Aplicació comercial i industrial 1. Millora de la robustesa als atacs adversaris: Els models robustos als atacs adversaris són essencials per a aplicacions crítiques com la seguretat i la defensa informàtiques. La implementació de la EP pot millorar la seguretat dels sistemes de reconeixement facial i detecció d'objectes en entorns sensibles als atacs, com ara la seguretat bancària o els sistemes de control d'accés. 2. Eficiència en l'etiquetatge de dades: L'eficiència en l'etiquetatge de dades és crucial per a l'avanç de la intel·ligència artificial, especialment en camps com la medicina, on l'etiquetatge manual pot ser prohibitivament car o poc pràctic. Mitjançant l'ús de l'aprenentatge semisupervisat i autosupervisat, impulsat per EP, es pot reduir la necessitat d'etiquetes, minimitzant així els costos i accelerant la implementació de models d'IA. En el sector sanitari, això té implicacions profundes: un informe suggereix que la IA podria millorar els resultats dels pacients fins a un 40% i reduir els costos de tractament fins a un 50% [5]. Ja s'ha demostrat que la IA supera els radiòlegs humans en precisió, identificant lesions tuberculoses a les radiografies de tòrax amb una precisió del 96% i pot diagnosticar el càncer de mama 30 vegades més ràpid amb una precisió del 99% [5]. A més, l'optimització de la gestió de dades impulsada per la IA ha portat a una reducció de les revisions de fins a un 19% [3], reduint els costos i l'exposició a la radiació per als pacients 3. Aquestes millores no només prometen un estalvi financer substancial, sinó també un avenç significatiu en la qualitat de l'atenció al pacient. Capítol 3: Un punt de referència basat en principis per a explicacions visuals contrafactuals L'explicabilitat en la IA juga un paper crucial no només en el món acadèmic, sinó també en els mons comercial, industrial i polític, ja que ajuda a augmentar la confiança dels usuaris en els models d'IA. Quan els usuaris entenen com un model arriba a les seves decisions, la probabilitat que confiïn i adoptin la IA en diverses aplicacions augmenta significativament. Aquesta capacitat d'explicar decisions complexes té el potencial de transformar la manera com la societat veu i utilitza la IA, convertint-la en una eina més accessible, fiable i valuosa. Per tant, la recerca sobre l'explicabilitat no només serveix com a base per a futurs esforços per millorar la intel·ligència artificial, sinó que també impulsa la innovació i el progrés en molts sectors, permetent una integració més àmplia i eficaç de la IA en el teixit de la vida quotidiana. Els avenços en l'explicabilitat dels models d'aprenentatge profund són crucials per a una àmplia gamma d'aplicacions comercials i industrials, així com per al desenvolupament de polítiques públiques. Algunes de les possibles aplicacions dels resultats obtinguts en aquesta recerca es descriuen a continuació: Aplicacions comercials i industrials 1. Medicina: En el camp de la medicina, la integració de la intel·ligència artificial (IA) no només millora significativament el diagnòstic i el tractament, sinó que també promet reduir els costos de l'atenció mèdica. L'adopció generalitzada de la IA podria traduir-se en un estalvi del 5% al 10% en costos sanitaris, equivalent a uns 200.000 a 360.000 milions de dòlars anuals [3]. A més, la implementació d'aquesta tecnologia condueix a una reducció del temps dedicat als tractaments, començant amb un estalvi de 21,67 hores al dia per hospital durant el primer any i arribant a un pic de 122,83 hores al dia per hospital durant el desè any. Aquest augment de l'eficiència suggereix una reducció de costos considerable al llarg del temps [4]. Tanmateix, perquè es produeixi aquesta acceptació, és essencial que els sistemes d'IA proporcionin explicacions clares i comprensibles, que fomentin la confiança dels professionals i els pacients. Els models explicatius, que milloren la comunicació de les decisions clíniques, també han de complir amb els estrictes requisits reglamentaris que exigeixen transparència en les tecnologies mèdiques. Aquesta combinació d'eficiència econòmica i claredat de raonament és clau per a la integració reeixida de la IA en la salut pública. 2. Finances: En el sector financer, la transparència i la confiança són essencials per a la presa de decisions en préstecs i inversions. Les explicacions detallades generades pels models d'IA no només poden millorar les relacions amb els clients, sinó també garantir el compliment normatiu, un aspecte fonamental en un sector altament regulat. Aquesta aclariment en les decisions assistides per IA també pot facilitar la gestió interna de riscos i la justificació d'estratègies financeres. 3. Automoció: En la indústria de l'automoció, especialment amb l'avanç dels vehicles autònoms, l'explicabilitat de les decisions preses pels models d'intel·ligència artificial (IA) s'està convertint en un factor crític per augmentar la confiança dels usuaris i accelerar l'aprovació reguladora. Una comprensió clara de com i per què un vehicle autònom pren decisions específiques en temps real no només és essencial per garantir la seguretat, sinó que també pot tenir un impacte econòmic significatiu: una reducció de l'1% en els incidents de seguretat viària als EUA podria estalviar més de 8.000 milions de dòlars anuals [5]. Això subratlla el potencial dels vehicles autònoms segurs i impulsats per IA per transformar no només la mobilitat, sinó també l'economia. Aquesta visió holística de la tecnologia emfatitza la importància de l'acceptació pública i la confiança en aquesta nova era de mobilitat que la IA està redefinint. Desenvolupament de polítiques públiques 1. Transparència i biaix: A mesura que els governs comencen a adoptar la IA per a la presa de decisions, és essencial que aquests models siguin transparents. Això pot ajudar a prevenir decisions esbiaixades i garantir que es respectin els drets dels ciutadans. Capítol 4: EarthView: un conjunt de dades de teledetecció a gran escala Els progressos significatius en el modelatge de la intel·ligència artificial i l'acumulació de grans conjunts de dades han obert noves possibilitats en el camp de la teledetecció. En particular, EarthMAE emergeix com un model fonamental en aquest àmbit, distingint-se per la seva destacada capacitat per executar tasques innovadores, mostrant un rendiment remarcable fins i tot en escenaris de zero shot, on el model s'aplica a tasques que no ha vist durant l'entrenament. Això indica la seva versatilitat i el seu potent potencial per a l'extracció de coneixement en situacions no previstes prèviament. Al mateix temps, EarthView es presenta com un conjunt de dades a gran escala (20 bilions de píxels), sense precedents en la seva amplitud i profunditat, que permet una àmplia aplicació en qualsevol tasca de monitorització terrestre. La combinació d'un model com EarthMAE, amb les seves excepcionals capacitats de generalització, i un conjunt de dades com EarthView, ric en varietat i volum, crea una simbiosi perfecta per a la innovació en múltiples camps. Això obre la porta a l'exploració i l'aplicació d'aquests recursos en una àmplia gamma de tasques de monitorització de la Terra, incloent-hi les que es detallen a continuació: Comercial i industrial: 1. Agricultura de precisió: Les empreses del sector agrícola poden beneficiar-se d'un augment del 4% en la producció de cultius i un augment del 7% en l'eficiència de la col·locació de fertilitzants gràcies a les tecnologies d'agricultura de precisió [6]. Aquests avenços permeten no només optimitzar el rendiment dels cultius i la detecció precoç de plagues i malalties, sinó també gestionar els recursos hídrics de manera més eficient. El resultat és una millora significativa en la sostenibilitat i l'eficiència de la producció d'aliments, amb l'addició d'una reducció de més del 10% en la petjada de carboni [7], que pot tenir un impacte en l'estalvi econòmic directe i indirecte, inclosa la possible obtenció de crèdits de carboni. 2. Gestió forestal i monitorització ambiental: L'aplicació de la gestió forestal activa pot tenir beneficis notables en la captura de carboni [8], superant els boscos no gestionats, i proporciona l'avantatge addicional de generar energia de baixes emissions a partir de residus forestals i de serradores. En regions com Califòrnia, on es gasten més de 1.000 milions de dòlars anualment en la lluita contra incendis forestals [8], una implementació proactiva de pràctiques de gestió forestal podria implicar un estalvi de centenars de milions, reduint la càrrega de combustible i la gravetat dels incendis. 3. Planificació urbana i infraestructura: En el context urbà, els arbres i la infraestructura de transport no motoritzat tenen un paper clau. Per exemple, a Tshwane, Sud-àfrica, s'ha estimat que plantar 1.000 arbres addicionals estalvia 3,82 milions de dòlars anuals en energia de refrigeració [9], i a Coimbatore, Índia, s'espera que una inversió en infraestructura de transport no motoritzat generi beneficis nets de fins a 510 milions de dòlars en 23 anys [10]. Aquestes dades subratllen la importància d'una planificació eficient de les infraestructures i la creació d'espais optimitzats que puguin donar lloc a ciutats més sostenibles i verdes, amb un retorn de 31 dòlars en beneficis per cada dòlar invertit, fomentant així una expansió urbana respectuosa i conscient del medi ambient. Desenvolupament de polítiques públiques: 1. Mitigació del canvi climàtic: Els governs podrien utilitzar els coneixements per formular polítiques més informades sobre el canvi climàtic, com ara millorar la gestió de les emissions de carboni o planificar iniciatives de reforestació. 2. Gestió dels recursos naturals: Podria millorar la gestió de l'aigua, els boscos i la biodiversitat, proporcionant eines per a la presa de decisions basades en dades per a la conservació i la gestió sostenible dels recursos naturals.
Robustesa; Aprenentatge profund; Generalització; Explicabilitat; Casos límit; Visió per computador; Resiliència; Flexibilitat; Distribucions de dades; Prediccions transparents; Dades no vistes; Dades fora de distribució; Atacs adversaris; Propagació per incrustació (EP); Aprenentatge de mostra baixa; Aprenentatge autosupervisat; Mètodes d'explicació contrafactual; Qualitat de l'explicació; Detecció d'objectes; Detecció d'objectes petits; Instàncies rares; Transformador de detecció (DETR); Tècnica de la piràmide de característiques; Costos computacionals elevats; Models fonamentals; EarthView; Conjunt de dades de teledetecció; Aprenentatge autosupervisat; Visió per computador robusta.