← Últimos artigos
🤖 AI

LLM-Driven AutoML for Cross-Lingual Handwritten OCR: Closed-Loop Neural Architecture Search with GPT-5, GPT-4o, and Claude Sonnet 4

Este artigo apresenta um framework de AutoML totalmente automatizado e de malha fechada que utiliza GPT-5, GPT-4o e Claude Sonnet 4 como agentes autônomos para projetar, treinar e refinar iterativamente arquiteturas neurais para OCR manuscrito cross-lingual, alcançando mais de 93% de acurácia média e baixa latência em conjuntos de dados de árabe, persa e inglês sem intervenção manual.

Autores originais: Mobina Kashaniyan, Amirhossein Ghassemi, Nasser Mozayani

Publicado 2026-07-20
📖 1 min de leitura☕ Leitura rápida

Autores originais: Mobina Kashaniyan, Amirhossein Ghassemi, Nasser Mozayani

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Resumo Técnico: AutoML Impulsionado por LLM para OCR de Escrita Manual Translingue

Definição do Problema
O reconhecimento de texto manuscrito (HTR) em diversos alfabetos, como árabe, inglês e persa, continua sendo um desafio significativo no aprendizado de máquina devido às complexidades visuais únicas, padrões de traçado intrincados e alta variabilidade nos estilos de escrita. As abordagens tradicionais dependem fortemente do design de modelos guiado por especialistas, pré-processamento extensivo manual e ajuste iterativo de hiperparâmetros. Esses métodos são frequentemente demorados, difíceis de escalar para novos alfabetos e propensos a resultados inconsistentes. Embora avanços recentes em Busca de Arquitetura Neural (NAS) e Grandes Modelos de Linguagem (LLMs) tenham mostrado potencial, sua aplicação como agentes independentes de ciclo fechado para gerar e refinar arquiteturas de aprendizado profundo especificamente para OCR de escrita manual translingue permanece amplamente inexplorada.

Metodologia
Os autores propõem um pipeline totalmente automatizado de ponta a ponta que utiliza Grandes Modelos de Linguagem (especificamente GPT-5, GPT-4o e Claude Sonnet 4) como "arquitetos de IA" autônomos. O sistema opera através de um processo iterativo de ciclo fechado compreendendo quatro estágios principais:

  1. Coleta e Aumento de Dados: O pipeline utiliza os conjuntos de dados EMNIST (Inglês), SADRI (Persa) e AHCD (Árabe). Os dados são padronizados em formatos de tensor com amostragem estratificada. Uma estratégia de aumento leve (rotações aleatórias, deslocamentos, zooms) é aplicada durante o treinamento para aumentar a generalização sem sobrecarga computacional significativa.
  2. Proposta de Arquitetura Impulsionada por LLM: No início de cada tentativa, o sistema fornece aos LLMs metadados do conjunto de dados (contagem de classes, dimensões da imagem) e, em subsequentes iterações, métricas de desempenho de tentativas anteriores. Os LLMs respondem com uma especificação JSON estruturada detalhando a arquitetura da rede neural (ex: Conv2D, BatchNorm, Dropout, blocos de Transformer) e hiperparâmetros de treinamento (otimizador, taxa de aprendizado, tamanho do lote).
  3. Construção e Treinamento Automatizado do Modelo: As especificações JSON são analisadas e automaticamente convertidas em modelos Keras executáveis. Esses modelos variam de CNNs padrão a arquiteturas híbridas que incorporam componentes de Vision Transformer. Os modelos são compilados com perda de entropia cruzada categórica e treinados sem intervenção humana.
  4. Avaliação e Ciclo de Feedback: Após a conclusão do treinamento, o sistema avalia o modelo nos conjuntos de teste, validação e treinamento, registrando precisão, contagem de parâmetros e latência de inferência. Essas métricas são retroalimentadas ao LLM como um resumo estruturado. O LLM usa esse feedback para refinar suas propostas arquiteturais na próxima iteração, criando um loop de autoaperfeiçoamento que converge para designs ideais para cada script específico.

Principais Contribuições

  • Framework Unificado Transcriptográfico: O trabalho introduz um framework único capaz de reconhecer escritas árabes, inglesas e persas, adaptando-se às complexidades estruturais e visuais específicas de cada uma sem reconfiguração manual.
  • LLM como Agente Generativo: Diferente de trabalhos anteriores que utilizam LLMs meramente para reconhecimento ou como ferramentas estáticas, esta abordagem emprega o GPT-5, GPT-4o e Claude Sonnet 4 como agentes autônomos responsáveis por todo o ciclo de vida da descoberta de modelos, da proposta ao refinamento.
  • Refinamento Iterativo de Ciclo Fechado: O sistema implementa um loop de feedback dinâmico onde os LLMs aprendem com os resultados tentativa a tentativa para ajustar tipos de camadas, profundidade, largura e hiperparâmetros, eliminando a necessidade de ajuste manual.
  • Transparência e Reprodutibilidade: O pipeline documenta rigorosamente cada tentativa, salvando configurações de arquitetura e métricas de desempenho em formatos estruturados (JSON, CSV) para garantir total reprodutibilidade.

Resultados Experimentais
O pipeline foi avaliado ao longo de trinta tentativas independentes para cada um dos três scripts e três LLMs. As principais descobertas incluem:

  • Precisão: O sistema descobriu consistentemente modelos com alta precisão de teste. O GPT-4o alcançou a maior precisão média para o árabe (0,959), enquanto o Claude Sonnet 4 liderou para o persa (0,946). O GPT-5 alcançou uma precisão de melhor caso de 0,981 no árabe. As precisões médias em todos os modelos e scripts geralmente excederam 93%.
  • Eficiência e Latência: O GPT-5 gerou as arquiteturas mais compactas (0,88M a 1,35M de parâmetros), enquanto o Claude Sonnet 4 produziu modelos maiores (até 9,28M de parâmetros). Apesar das variações significativas na contagem de parâmetros, a latência de inferência permaneceu estável e adequada para tempo real (aproximadamente 40–44 ms), sugerindo que o custo de execução é impulsionado mais pela profundidade arquitetural do que pelo tamanho bruto de parâmetros.
  • Generalização: As curvas de validação acompanharam de perto as curvas de treinamento (diferenças tipicamente dentro de 1–2%), indicando forte generalização e regularização eficaz sem overfitting.
  • Comparação: Comparado ao trabalho anterior (ex: Cerescu & Bumbu, 2024), que tratava os LLMs como reconhecedores diretos para scripts de baixos recursos, este framework utiliza os LLMs como agentes generativos para design de modelo automatizado, alcançando maior precisão e automação total entre múltiplos idiomas.

Significância e Alegações
O artigo afirma que este trabalho demonstra a capacidade dos Grandes Modelos de Linguagem de transcender seu papel tradicional no processamento de linguagem e funcionar como designers independentes para sistemas de aprendizado de máquina. Ao automatizar a descoberta de arquiteturas neurais para OCR de escrita manual translingue, o framework oferece uma solução escalável, agnóstica a scripts e totalmente automática. Os autores afirmam que esta abordagem simplifica significativamente o desenvolvimento de modelos de OCR, remove a dependência de heurísticas específicas de domínio e intervenção de especialistas, e abre as portas para o implante rápido e adaptável de tecnologia de OCR em diversos idiomas e domínios. Os resultados validam que a busca de arquitetura impulsionada por LLM pode equilibrar efetivamente o desempenho preditivo, a eficiência de inferência e a complexidade do modelo.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →