ArmorOCR: Grounded Adversarial Visual Perception via Observation-Transferred Self-Distillation
Cet article introduit AdvSpot, le premier benchmark de l'OCR adversaire ancré, et propose ArmorOCR, un cadre d'entraînement en deux étapes exploitant l'auto-distillation par transfert d'observation et l'optimisation de politique relative de groupe pour améliorer significativement la robustesse des grands modèles multimodaux contre le texte visuel adversaire tout en maintenant les performances générales de l'OCR.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Dans le monde de l'intelligence artificielle, il existe une classe croissante de systèmes connus sous le nom de grands modèles multimodaux. Ce sont des ordinateurs puissants capables de voir des images et de lire du texte à l'intérieur, tout comme un humain regardant la photographie d'un panneau de signalisation ou d'une note manuscrite. Pendant des années, ces systèmes sont devenus remarquablement doués pour lire du texte clair et standard. Cependant, un écart important est apparu entre la vision humaine et la vision par machine. Les humains possèdent une capacité intuitive à reconstituer le sens même lorsque le texte est caché, déformé ou mélangé à un arrière-plan complexe. Nous pouvons regarder un motif de points et comprendre instantanément le mot qu'ils forment, ou lire une phrase écrite en minuscules lettres sur un t-shirt encombré. L'intelligence artificielle actuelle, en revanche, échoue souvent à ces tâches spécifiques. Elle pourrait regarder la même image et n'y voir que du bruit, manquer entièrement le texte ou se concentrer sur la mauvaise partie de l'image. Cette vulnérabilité n'est pas qu'un simple bug mineur ; elle révèle une faiblesse fondamentale dans la manière dont ces machines perçoivent le monde visuel, les laissant incapables de gérer le texte désordonné et manipulé que l'on trouve dans le monde réel.
Les chercheurs ont longtemps tenté de corriger cela en apprenant aux ordinateurs à « réfléchir » plus intensément aux images, souvent en leur demandant de zoomer, de recadrer ou de retourner des images pour révéler des détails cachés. Bien que cela fonctionne, c'est lent et nécessite des étapes supplémentaires chaque fois que l'ordinateur regarde une image. Une nouvelle étude introduit une approche différente, qui enseigne au modèle à percevoir ces motifs cachés instantanément, sans avoir besoin de modifier l'image au préalable. L'équipe derrière ce travail, dirigée par Linhan Cao et ses collègues, a d'abord créé un nouveau terrain d'essai appelé AdvSpot. Il s'agit d'une collection de 390 images conçues spécifiquement pour piéger l'intelligence artificielle. Ces images contiennent du texte lisible pour les humains mais difficile pour les machines, organisé en treize types différents de tours de passe-passe visuels. Ces tours vont de textes pivotés ou inversés, à des mots cachés à l'intérieur de motifs complexes, jusqu'à des lettres qui semblent avoir été dessinées à la main ou générées par d'autres systèmes artificiels. Cet ensemble de données est unique car il ne demande pas seulement à l'ordinateur de deviner le mot ; il exige que l'ordinateur pointe exactement où se trouve le texte, le lise et réponde à une question à son sujet, garantissant que la machine voit réellement le bon endroit et ne se contente pas de deviner en fonction du contexte.
Pour résoudre le problème de ces images complexes, les chercheurs ont développé une nouvelle méthode d'entraînement appelée ArmorOCR. Ils ont réalisé que si un ordinateur peut avoir du mal à voir un mot sous sa forme originale, ce même mot pourrait être facile à lire si l'image était légèrement étirée, pivotée ou redimensionnée. Au lieu de demander à l'ordinateur d'effectuer ces transformations chaque fois qu'il regarde une image, les chercheurs ont appris au modèle à apprendre de celles-ci pendant l'entraînement. Ils ont mis en place un processus d'apprentissage en deux étapes. Dans la première étape, ils ont utilisé un modèle « enseignant » capable de voir l'image sous de nombreuses formes transformées. Ce modèle enseignant, qui avait l'avantage de voir le texte clairement après manipulation de l'image, guiderait un modèle « étudiant » qui ne voyait que l'image originale et difficile. L'enseignant ne se contentait pas de donner la réponse ; il montrait à l'étudiant comment percevoir le texte caché en partageant sa compréhension interne des vues transformées. Cela a permis à l'étudiant d'intérioriser la capacité de voir à travers les tours visuels sans jamais avoir besoin de voir les tours elles-mêmes lors du test réel.
La deuxième étape de l'entraînement s'est concentrée sur l'affinement de la manière dont le modèle utilise cette nouvelle capacité. Les chercheurs ont donné au modèle des récompenses spécifiques pour chaque partie du travail accomplie correctement. Si le modèle pointait avec succès la bonne zone de l'image, il recevait une récompense pour la localisation. S'il lisait le texte correctement, il recevait une récompense pour la reconnaissance. S'il pouvait trouver tout le texte caché dans une seule image et répondre à des questions à son sujet, il recevait des récompenses pour ces tâches également. En combinant ces récompenses, le modèle a appris à équilibrer toutes ces compétences à la fois. Le résultat fut un système capable de regarder une image unique, non modifiée, et d'identifier, lire et expliquer instantanément un texte qui était auparavant invisible pour les machines.
Lorsqu'il a été testé sur leur nouveau benchmark, les résultats ont été frappants. La plupart des modèles d'intelligence artificielle existants, y compris certains des plus grands et des plus avancés disponibles, ont obtenu des scores très faibles sur le test AdvSpot, échouant souvent à reconnaître le texte plus de la moitié du temps. Le nouveau système ArmorOCR, cependant, les a tous nettement surpassés. Il a amélioré la capacité de reconnaissance du texte adversarial par une marge importante, atteignant la précision la plus élevée dans tous les domaines. Crucialement, les chercheurs ont constaté que ce nouvel entraînement n'a pas rendu le modèle moins performant pour la lecture de texte normal et clair. Le système est resté aussi efficace pour les tâches de lecture standard qu'il l'était auparavant, prouvant qu'il avait appris une nouvelle compétence sans perdre ses anciennes. L'étude suggère qu'en apprenant aux modèles à apprendre à partir de vues transformées pendant l'entraînement, nous pouvons construire une intelligence artificielle bien plus robuste et fiable face au monde visuel complexe et manipulé que les humains naviguent chaque jour.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.