← Derniers articles
🤖 AI

LLM-Driven AutoML for Cross-Lingual Handwritten OCR: Closed-Loop Neural Architecture Search with GPT-5, GPT-4o, and Claude Sonnet 4

Cet article présente un cadre d'AutoML entièrement automatisé et en boucle fermée qui exploite GPT-5, GPT-4o et Claude Sonnet 4 en tant qu'agents autonomes pour concevoir, entraîner et affiner de manière itérative des architectures neuronales pour l'OCR manuscrit multilingue, atteignant une précision moyenne de plus de 93 % et une faible latence sur les ensembles de données arabes, persans et anglais sans intervention manuelle.

Auteurs originaux : Mobina Kashaniyan, Amirhossein Ghassemi, Nasser Mozayani

Publié 2026-07-20
📖 1 min de lecture☕ Lecture pause café

Auteurs originaux : Mobina Kashaniyan, Amirhossein Ghassemi, Nasser Mozayani

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Résumé Technique : AutoML piloté par LLM pour l'OCR manuscrit multilingue

Énoncé du problème
La reconnaissance de texte manuscrit (HTR) à travers divers scripts, tels que l'arabe, l'anglais et le persan, demeure un défi significatif en apprentissage automatique en raison des complexités visuelles uniques, des motifs de traits complexes et de la grande variabilité des styles d'écriture. Les approches traditionnelles reposent lourdement sur une conception de modèle guidée par des experts, un prétraitement manuel extensif et un réglage itératif des hyperparamètres. Ces méthodes sont souvent chronophages, difficiles à adapter à de nouveaux scripts et sujettes à des résultats incohérents. Bien que les progrès récents de la recherche d'architecture neuronale (NAS) et des grands modèles de langage (LLM) aient montré des promesses, leur application en tant qu'agents autonomes en boucle fermée pour la génération et le raffinement d'architectures d'apprentissage profond spécifiquement dédiées à l'OCR manuscrit multilingue est restée largement inexplorée.

Méthodologie
Les auteurs proposent un pipeline entièrement automatisé de bout en bout qui utilise des grands modèles de langage (spécifiquement GPT-5, GPT-4o et Claude Sonnet 4) comme « architectes IA » autonomes. Le système fonctionne via un processus itératif en boucle fermée comprenant quatre étapes clés :

  1. Collecte et augmentation des données : Le pipeline utilise les jeux de données EMNIST (anglais), SADRI (persan) et AHCD (arabe). Les données sont standardisées en formats tenseurs avec un échantillonnage stratifié. Une stratégie d'augmentation légère (rotations aléatoires, décalages, zooms) est appliquée pendant l'entraînement pour améliorer la généralisation sans surcharge de calcul significative.
  2. Proposition d'architecture pilotée par LLM : Au début de chaque essai, le système soumet aux LLM des métadonnées du jeu de données (nombre de classes, dimensions de l'image) et, lors des itérations suivantes, les mesures de performance des essais précédents. Les LLM répondent par une spécification JSON structurée détaillant l'architecture du réseau neuronal (ex: Conv2D, BatchNorm, Dropout, blocs Transformer) et les hyperparamètres d'entraînement (optimiseur, taux d'apprentissage, taille de lot).
  3. Construction et entraînement de modèles automatisés : Les spécifications JSON sont analysées et converties automatiquement en modèles Keras exécutables. Ces modèles vont de CNN standards à des architectures hybrides intégrant des composants de Vision Transformer. Les modèles sont compilés avec une perte d'entropie croisée catégorielle et entraînés sans intervention humaine.
  4. Évaluation et boucle de rétroaction : Une fois l'entraînement terminé, le système évalue le modèle sur les ensembles de test, de validation et d'entraînement, en enregistrant la précision, le nombre de paramètres et la latence d'inférence. Ces métriques sont réinjectées dans le LLM sous forme de résumé structuré. Le LLM utilise ce retour pour affiner ses propositions architecturales lors de l'itération suivante, créant ainsi une boucle d'auto-amélioration qui converge vers des conceptions optimales pour chaque script spécifique.

Contributions clés

  • Cadre unifié multi-scripts : Ce travail introduit un cadre unique capable de reconnaître les scripts arabe, anglais et persan, s'adaptant aux complexités structurelles et visuelles spécifiques de chacun sans reconfiguration manuelle.
  • LLM en tant qu'agent génératif : Contrairement aux travaux antérieurs qui utilisent les LLM simplement pour la reconnaissance ou comme outils statiques, cette approche emploie GPT-5, GPT-4o et Claude Sonnet 4 comme des agents autonomes responsables de l'intégralité du cycle de vie de la découverte de modèles, de la proposition au raffinement.
  • Raffinement itératif en boucle fermée : Le système implémente une boucle de rétroaction dynamique où les LLM apprennent des résultats essai par essai pour ajuster les types de couches, la profondeur, la largeur et les hyperparamètres, éliminant ainsi le besoin de réglage manuel.
  • Transparence et reproductibilité : Le pipeline documente rigoureusement chaque essai, sauvegardant les configurations d'architecture et les métriques de performance dans des formats structurés (JSON, CSV) pour assurer une reproductibilité totale.

Résultats expérimentaux
Le pipeline a été évalué sur trente essais indépendants pour chacun des trois scripts et des trois LLM. Les conclusions clés incluent :

  • Précision : Le système a systématiquement découvert des modèles dotés d'une haute précision de test. GPT-4o a obtenu la précision moyenne la plus élevée pour l'arabe (0,959), tandis que Claude Sonnet 4 a excellé pour le persan (0,946). GPT-5 a atteint une précision de test maximale de 0,981 sur l'arabe. Les précisions moyennes pour l'ensemble des modèles et des scripts ont généralement dépassé 93 %.
  • Efficacité et latence : GPT-5 a généré les architectures les plus compactes (0,88M à 1,35M de paramètres), tandis que Claude Sonnet 4 a produit des modèles plus volumineux (jusqu'à 9,28M de paramètres). Malgré des variations significatives dans le nombre de paramètres, la latence d'inférence est restée stable et adaptée au temps réel (environ 40–44 ms), suggérant que le coût d'exécution est davantage dicté par la profondeur architecturale que par la taille brute des paramètres.
  • Généralisation : Les courbes de validation suivent étroitement les courbes d'entraînement (différences typiquement de l'ordre de 1 à 2 %), indiquant une forte généralisation et une régularisation efficace sans surapprentissage.
  • Comparaison : Comparé aux travaux antérieurs (ex: Cerescu & Bumbu, 2024), qui traitaient les LLM comme des reconnaisseurs directs pour les scripts à faibles ressources, ce cadre utilise les LLM comme des agents génératifs pour la conception de modèles automatisée, atteignant une précision supérieure et une automatisation complète sur plusieurs langues.

Signification et revendications
L'article affirme que ce travail démontre la capacité des grands modèles de langage à transcender leur rôle traditionnel de traitement du langage pour fonctionner comme des concepteurs indépendants de systèmes d'apprentissage automatique. En automatisant la découverte d'architectures neuronales pour l'OCR manuscrit multilingue, le cadre offre une solution évolutive, agnostique au script et entièrement automatique. Les auteurs soutiennent que cette approche simplifie considérablement le développement de modèles d'OCR, élimine la dépendance aux heuristiques spécifiques au domaine et à l'intervention d'experts, et ouvre la voie à un déploiement rapide et adaptable de la technologie OCR à travers diverses langues et domaines. Les résultats valident que la recherche d'architecture pilotée par LLM peut efficacement équilibrer la performance prédictive, l'efficacité d'inférence et la complexité du modèle.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →