← Nieuwste papers
🤖 AI

LLM-Driven AutoML for Cross-Lingual Handwritten OCR: Closed-Loop Neural Architecture Search with GPT-5, GPT-4o, and Claude Sonnet 4

Dit artikel presenteert een volledig geautomatiseerd, closed-loop AutoML-framework dat GPT-5, GPT-4o en Claude Sonnet 4 inzet als autonome agenten om iteratief neurale architecturen te ontwerpen, te trainen en te verfijnen voor cross-linguale handgeschreven OCR, waarbij een gemiddelde nauwkeurigheid van meer dan 93% en een lage latentie wordt bereikt over Arabische, Perzische en Engelse datasets zonder handmatige tussenkomst.

Oorspronkelijke auteurs: Mobina Kashaniyan, Amirhossein Ghassemi, Nasser Mozayani

Gepubliceerd 2026-07-20
📖 1 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Mobina Kashaniyan, Amirhossein Ghassemi, Nasser Mozayani

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Technische Samenvatting: LLM-gestuurde AutoML voor Cross-Linguale Handgeschreven OCR

Probleemstelling
Handgeschreven tekstherkenning (HTR) over diverse schriften heen, zoals Arabisch, Engels en Perzisch, blijft een significante uitdaging in machine learning vanwege unieke visuele complexiteiten, ingewikkelde penseelstreekpatronen en een hoge variabiliteit in schrijflenzen. Traditionele benaderingen leunen zwaar op door experts geleid modelontwerp, uitgebreide handmatige preprocessing en iteratieve hyperparameteroptimalisatie. Deze methoden zijn vaak tijdrovend, moeilijk te schalen naar nieuwe schriften en gevoelig voor inconsistente resultaten. Hoewel recente vooruitgang in Neural Architecture Search (NAS) en Large Language Models (LLMs) veelbelovend is gebleken, is hun toepassing als onafhankelijke, gesloten-lus agenten voor het genereren en verfijnen van deep learning-architecturen specifiek voor cross-linguale handgeschreven OCR grotendeels onverkend gebleven.

Methodologie
De auteurs stellen een volledig geautomatiseerde, end-to-end pijplijn voor die gebruikmaakt van Large Language Models (specifiek GPT-5, GPT-4o en Claude Sonnet 4) als autonome "AI-architecten". Het systeem werkt via een gesloten-lus iteratief proces bestaande uit vier kernstadia:

  1. Dataverzameling en Augmentatie: De pijplijn maakt gebruik van de EMNIST (Engels), SADRI (Perzisch) en AHCD (Arabisch) datasets. Data wordt gestandaardiseerd naar tensorformaten met gestratificeerde bemonstering. Een lichtgewicht augmentatiestrategie (willekeurige rotaties, verschuivingen, zooms) wordt toegepast tijdens de training om generalisatie te verbeteren zonder significante computationele overhead.
  2. LLM-gestuurde Architectuurvoorstel: Aan het begin van elke trial prompt de pijplijn de LLM's met datasetmetadata (klasse-aantal, beeldafmetingen) en, in opeenvolgende iteraties, prestatiecijfers van eerdere trials. De LLM's reageren met een gestructureerde JSON-specificatie die de neurale netwerkarchitectuur detailsert (bijv. Conv2D, BatchNorm, Dropout, Transformer-blokken) en trainingshyperparameters (optimizer, leersnelheid, batchgrootte).
  3. Geautomatiseerde Modelconstructie en Training: De JSON-specificaties worden geparsed en automatisch omgezet in uitvoerbare Keras-modellen. Deze modellen variëren van standaard CNN's tot hybride architecturen die Vision Transformer-componenten bevatten. Modellen worden gecompileerd met categorical cross-entropy loss en getraind zonder menselijke tussenkomst.
  4. Evaluatie en Feedbacklus: Na voltooiing van de training evalueert het systeem het model op test-, validatie- en trainingssets, waarbij nauwkeurigheid, aantal parameters en inferentielatentie worden geregistreerd. Deze metrieken worden teruggekoppeld naar de LLM als een gestructureerde samenvatting. De LLM gebruikt deze feedback om de architecturale voorstellen in de volgende iteratie te verfijnen, waardoor een zelfverbeterende lus ontstaat die convergeert naar optimale ontwerpen voor elk specifief schrift.

Belangrijkste Bijdragen

  • Verenigd Cross-Script Framework: Het werk introduceert een enkel framework dat in staat is om Arabische, Engelse en Perzische schriften te herkennen, waarbij het zich aanpast aan de specifieke structurele en visuele complexiteiten van elk schrift zonder handmatige reconfiguratie.
  • LLM als Generatieve Agent: In tegen tegenstelling tot eerdere werken die LLM's louter gebruiken voor herkenning of als statische hulpmiddelen, zet deze aanpak GPT-5, GPT-4o en Claude Sonnet 4 in als standalone agenten die verantwoordelijk zijn voor de volledige levenscyclus van modelontdekking, van voorstel tot verfijning.
  • Gesloten-Lus Iteratieve Verfijning: Het systeem implementeert een dynamische feedbacklus waarbij LLM's leren van resultaten per trial om laagtypen, diepte, breedte en hyperparameters aan te passen, waardoor handmatige afstemming wordt geëlimineerd.
  • Transparantie en Reproduceerbaarheid: De pijplijn documenteert elke trial strikt door architectuurconfiguraties en prestatiecijfers op te slaan in gestructureerde formaten (JSON, CSV) om volledige reproduceerbaarheid te garanderen.

Experimentele Resultaten
De pijplijn werd geëvalueerd over dertig onafhankelijke trials voor elk van de drie schriften en drie LLM's. Belangrijkste bevindingen zijn:

  • Nauwkeurigheid: Het systeem ontdekte consistent modellen met een hoge testnauwkeurigheid. GPT-4o bereikte de hoogste gemiddelde nauwkeurigheid voor Arabisch (0.959), terwijl Claude Sonnet 4 leidde voor Perzisch (0.946). GPT-5 bereikte een best-case trial nauwkeurigheid van 0.981 op Arabisch. Gemiddelde nauwkeurigheden over alle modellen en schriften lagen over het algemeen boven de 93%.
  • Efficiëntie en Latentie: GPT-5 genereerde de meest compacte architecturen (0.88M tot 1.35M parameters), terwijl Claude Sonnet 4 grotere modellen produceerde (tot 9.28M parameters). Ondanks aanzienlijke variaties in parametersaantallen bleef de inferentielatentie stabiel en geschikt voor real-time gebruik (ongeveer 40–44 ms), wat suggereert dat de runtime-kosten meer worden gedreven door architecturale diepte dan door de ruwe omvang van het aantal parameters.
  • Generalisatie: Validatiecurves volgden de trainingscurves nauwgezet (verschillen doorgaans binnen 1–2%), wat wijst op sterke generalisatie en effectieve regularisatie zonder overfitting.
  • Vergelijking: Vergeleken met eerder werk (bijv. Cerescu & Bumbu, 2024), dat LLM's behandelde als directe herkenners voor low-resource schriften, gebruikt dit framework LLM's als generatieve agenten voor geautomatiseerd modelontwerp, waarmee een hogere nauwkeurigheid en volledige automatisering over meerdere talen wordt bereikt.

Betekenis en Claims
Het artikel claimt dat dit werk aantoont dat Large Language Models in staat zijn om hun traditionele rol in taalverwerking te overstijgen en te fungeren als onafhankelijke ontwerpers voor machine learning-systemen. Door de ontdekking van neurale architecturen voor cross-linguale handgeschreven OCR te automatiseren, biedt het framework een schaalbare, script-agnostische en volledig automatische oplossing. De auteurs stellen dat deze aanpak de ontwikkeling van OCR-modellen aanzienlijk vereenvoudigt, de afhankelijkheid van domeinspecifieke heuristieken en expertinterventie wegneemt, en de deur opent naar snelle, aanpasbare implementatie van OCR-technologie over diverse talen en domeinen. De resultaten valideren dat LLM-gestuurde architectuurzoektochten effectief een balans kunnen vinden tussen voorspellende prestaties, inferentie-efficiëntie en modelcomplexiteit.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →