← Últimos artículos
🤖 AI

LLM-Driven AutoML for Cross-Lingual Handwritten OCR: Closed-Loop Neural Architecture Search with GPT-5, GPT-4o, and Claude Sonnet 4

Este artículo presenta un marco de trabajo de AutoML de bucle cerrado y totalmente automatizado que aprovecha GPT-5, GPT-4o y Claude Sonnet 4 como agentes autónomos para diseñar, entrenar y refinar iterativamente arquitecturas neuronales para OCR manuscrito translingüe, logrando más del 93% de precisión media y baja latencia en conjuntos de datos de árabe, persa e inglés sin intervención manual.

Autores originales: Mobina Kashaniyan, Amirhossein Ghassemi, Nasser Mozayani

Publicado 2026-07-20
📖 1 min de lectura☕ Lectura para el café

Autores originales: Mobina Kashaniyan, Amirhossein Ghassemi, Nasser Mozayani

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Resumen Técnico: AutoML impulsado por LLM para OCR manuscrito multilingüe

Planteamiento del problema
El reconocimiento de texto manuscrito (HTR) en diversos sistemas de escritura, como el árabe, el inglés y el persa, sigue siendo un desafío significativo en el aprendizaje automático debido a las complejidades visuales únicas, los patrones de trazo intrincados y la alta variabilidad en los estilos de escritura. Los enfoques tradicionales dependen en gran medida del diseño de modelos guiado por expertos, un preprocesamiento manual extensivo y un ajuste iterativo de hiperparámetros. Estos métodos suelen ser lentos, difíciles de escalar a nuevos sistemas de escritura y propensos a resultados inconsistentes. Si bien los avances recientes en la Búsqueda de Arquitectura Neuronal (NAS) y los Modelos de Lenguaje de Gran Escala (LLMs) han mostrado resultados prometedores, su aplicación como agentes independientes de ciclo cerrado para generar y refinar arquitecturas de aprendizaje profundo específicamente para el OCR manuscrito multilingüe ha permanecido prácticamente inexplorada.

Metodología
Los autores proponen un flujo de trabajo totalmente automatizado de extremo a extremo que utiliza Modelos de Lenguaje de Gran Escala (específicamente GPT-5, GPT-4o y Claude Sonnet 4) como "arquitectos de IA" autónomos. El sistema opera a través de un proceso iterativo de ciclo cerrado que comprende cuatro etapas principales:

  1. Recolección y aumento de datos: El flujo de trabajo utiliza los conjuntos de datos EMNIST (inglés), SADRI (persa) y AHCD (árabe). Los datos se estandarizan en formatos de tensores con muestreo estratificado. Se aplica una estrategia de aumento ligera (rotaciones aleatorias, desplazamientos, zooms) durante el entrenamiento para mejorar la generalización sin una carga computacional significativa.
  2. Propuesta de arquitectura impulsada por LLM: Al inicio de cada prueba, el sistema proporciona a los LLMs metadatos del conjunto de datos (conteo de clases, dimensiones de la imagen) y, en iteraciones posteriores, métricas de rendimiento de pruebas previas. Los LLMs responden con una especificación JSON estructurada que detalla la arquitectura de la red neuronal (por ejemplo, Conv2D, BatchNorm, Dropout, bloques Transformer) y los hiperparámetros de entrenamiento (optimizador, tasa de aprendizaje, tamaño del lote).
  3. Construcción y entrenamiento de modelos automatizados: Las especificaciones JSON se analizan y se convierten automáticamente en modelos Keras ejecutables. Estos modelos varían desde CNNs estándar hasta arquitecturas híbridas que incorporan componentes de Vision Transformer. Los modelos se compilan con pérdida de entropía cruzada categórica y se entrenan sin intervención humana.
  4. Evaluación y bucle de retroalimentación: Al finalizar el entrenamiento, el sistema evalúa el modelo en conjuntos de prueba, validación y entrenamiento, registrando la precisión, el conteo de parámetros y la latencia de inferencia. Estas métricas se reintroducen en el LLM como un resumen estructurado. El LLM utiliza esta retroalimentación para refinar sus propuestas arquitectónicas en la siguiente iteración, creando un bucle de automejora que converge hacia diseños óptimos para cada script específico.

Contribuciones clave

  • Marco unificado para múltiples scripts: El trabajo introduce un marco único capaz de reconocer escrituras árabe, inglesa y persa, adaptándose a las complejidades estructurales y visuales específicas de cada una sin reconfiguración manual.
  • LLM como agente generativo: A diferencia de trabajos previos que utilizan los LLMs meramente para el reconocimiento o como herramientas estáticas, este enfoque emplea a GPT-5, GPT-4o y Claude Sonnet 4 como agentes independientes responsables de todo el ciclo de vida del descubrimiento de modelos, desde la propuesta hasta el refinamiento.
  • Refinamiento iterativo de ciclo cerrado: El sistema implementa un bucle de retroalimentación dinámica donde los LLMs aprenden de los resultados de prueba tras prueba para ajustar tipos de capas, profundidad, anchura y hiperparámetros, eliminando la necesidad de ajuste manual.
  • Transparencia y reproducibilidad: El flujo de trabajo documenta rigurosamente cada prueba, guardando las configuraciones de arquitectura y las métricas de rendimiento en formatos estructurados (JSON, CSV) para garantizar la plena reproducibilidad.

Resultos experimentales
El flujo de trabajo fue evaluado a lo largo de treinta pruebas independientes para cada uno de los tres scripts y tres LLMs. Los hallazgos clave incluyen:

  • Precisión: El sistema descubrió consistentemente modelos con alta precisión de prueba. GPT-4o logró la mayor precisión media para el árabe (0.959), mientras que Claude Sonnet 4 lideró para el persa (0.946). GPT-5 alcanzó una precisión de prueba en el mejor caso de 0.981 en árabe. Las precisiones promedio en todos los modelos y scripts generalmente superaron el 93%.
  • Eficiencia y latencia: GPT-5 generó las arquitecturas más compactas (0.88M a 1.35M de parámetros), mientras que Claude Sonnet 4 produjo modelos más grandes (hasta 9.28M de parámetros). A pesar de las variaciones significativas en el conteo de parámetros, la latencia de inferencia se mantuvo estable y apta para tiempo real (aproximadamente 40–44 ms), lo que sugiere que el costo de ejecución está impulsado más por la profundidad arquitectónica que por el tamaño bruto de los parámetros.
  • Generalización: Las curvas de validación siguieron de cerca a las curvas de entrenamiento (diferencias típicamente dentro de un 1–2%), lo que indica una fuerte generalización y una regularización efectiva sin sobreajuste.
  • Comparación: En comparación con trabajos previos (por ejemplo, Cerescu & Bumbu, 2024), que trataban a los LLMs como reconocedores directos para scripts de bajos recursos, este marco utiliza a los LLMs como agentes generativos para el diseño de modelos automatizado, logrando una mayor precisión y una automatización total en múltiples idiomas.

Significancia y afirmaciones
El artículo afirma que este trabajo demuestra la capacidad de los Modelos de Lenguaje de Gran Escala para trascender su rol tradicional en el procesamiento del lenguaje y funcionar como diseñadores independientes de sistemas de aprendizaje automático. Al automatizar el descubrimiento de arquitecturas neuronales para el OCR manuscrito multilingüe, el marco ofrece una solución escalable, agnóstica al script y totalmente automática. Los autores sostienen que este enfoque simplifica significamente el desarrollo de modelos de OCR, elimina la dependencia de heurísticas específicas del dominio y la intervención de expertos, y abre la puerta a un despliegue rápido y adaptable de la tecnología OCR en diversos idiomas y dominios. Los resultados validan que la búsqueda de arquitectura impulsada por LLM puede equilibrar eficazmente el rendimiento predictivo, la eficiencia de inferencia y la complejidad del modelo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →