← 최신 논문
🤖 AI

LLM-Driven AutoML for Cross-Lingual Handwritten OCR: Closed-Loop Neural Architecture Search with GPT-5, GPT-4o, and Claude Sonnet 4

본 논문은 GPT-5, GPT-4o, Claude Sonnet 4를 자율 에이전트로 활용하여 아랍어, 페르시아어 및 영어 데이터셋 전반에서 수동 개입 없이 93% 이상의 평균 정확도와 낮은 지연 시간을 달리는 교차 언어 필기체 OCR을 위한 신경망 구조를 반복적으로 설계, 학습 및 정제하는 완전 자동화된 폐쇄 루프 AutoML 프레임워크를 제시한다.

원저자: Mobina Kashaniyan, Amirhossein Ghassemi, Nasser Mozayani

게시일 2026-07-20
📖 1 분 읽기☕ 가벼운 읽기

원저자: Mobina Kashaniyan, Amirhossein Ghassemi, Nasser Mozayani

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

기술 요약: 교차 언어 필기체 OCR을 위한 LLM 기반 AutoML

문제 정의
아랍어, 영어, 페르시아어와 같이 다양한 스크립트를 포함하는 필기체 텍스트 인식(HTR)은 고유한 시각적 복잡성, 복잡한 획 패턴, 그리고 높은 쓰기 스타일의 가변성으로 인해 머신러닝 분야에서 중요한 과제로 남아 있습니다. 전통적인 방식은 전문가가 유도하는 모델 설계, 광범한 수동 전처리, 그리고 반복적인 하이퍼파라미터 튜닝에 크게 의존합니다. 이러한 방법들은 시간이 많이 소요되고, 새로운 스크립트로 확장하기 어려우며, 일관되지 않은 결과를 초래하기 쉽습니다. 최근 신경 구조 탐색(NAS)과 대규모 언어 모델(LLM)의 발전이 가능성을 보여주었으나, 교차 언어 필기체 OCR을 위해 딥러닝 아키텍처를 생성하고 정제하는 독립적인 폐쇄 루프 에이전트로서의 LLM 활용은 여전히 미개척 영역으로 남아 있습니다.

방법론
저자들은 대규모 언어 모델(구체적으로 GPT-5, GPT-4o, Claude Sonnet 4)을 자율적인 "AI 아키텍트"로 활용하는 완전 자동화된 엔드 투 엔드 파이프라인을 제안합니다. 이 시스템은 네 가지 핵심 단계를 거치는 폐쇄 루프 반복 프로세스를 통해 작동합니다:

  1. 데이터 수집 및 증강: 파이프라인은 EMNIST(영어), SADRI(페르시아어), AHCD(아랍어) 데이터셋을 활용합니다. 데이터는 층화 추출(stratified sampling)을 통해 텐서 형식으로 표준화됩니다. 훈련 중에는 계산 오버헤드를 크게 늘리지 않으면서 일반화 성능을 높이기 위해 경량화된 증강 전략(무작위 회전, 이동, 줌)이 적용됩니다.
  2. LLM 기반 아키텍처 제안: 각 실험의 시작 단계에서 시스템은 데이터셋 메타데이터(클래스 수, 이미지 차원)를 LLM에 프롬프트로 제공하며, 이후 반복 단계에서는 이전 실험의 성능 지표를 함께 제공합니다. LLM은 신경망 아키텍처(예: Conv2D, BatchNorm, Dropout, Transformer 블록)와 훈련 하이퍼파라미터(옵티마이저, 학습률, 배치 크기)에 대한 상세한 구조화된 JSON 명세를 응답합니다.
  3. 자동 모델 구축 및 훈련: 생성된 JSON 명세는 파싱되어 자동으로 실행 가능한 Keras 모델로 변환됩니다. 모델은 표준 CNN부터 Vision Transformer 구성 요소를 포함하는 하이브리드 아키텍처까지 다양하게 구성됩니다. 모델은 범주형 교차 엔트로피 손실(categorical cross-entropy loss)로 컴파일되며 인간의 개입 없이 훈련됩니다.
  4. 평가 및 피드백 루프: 훈련 완료 후, 시스템은 테스트, 검증 및 훈련 세트에서 모델을 평가하여 정확도, 파라미터 수, 추론 지연 시간(latency)을 기록합니다. 이 지표들은 구조화된 요약 형태로 LLM에 다시 전달됩니다. LLM은 이 피드백을 사용하여 다음 단계의 아키텍처 제안을 정제하며, 이는 각 특정 스크립트에 최적화된 설계를 향해 수렴하는 자기 개선 루프를 형성합니다.

주요 기여

  • 통합 교차 스크립트 프레임워크: 본 연구는 수동 재설정 없이도 아랍어, 영어, 페르시아어 스크립트의 특정 구조적 및 시각적 복잡성에 적응할 수 있는 단일 프레임워크를 도입합니다.
  • 생성 에이전트로서의 LLM: LLM을 단순히 인식용이나 정적인 도구로 사용하는 기존 연구와 달리, 본 접근 방식은 GPT-5, GPT-4o, Claude Sonnet 4를 모델 발견의 전체 생애 주기(제안부터 정제까지)를 책임지는 독립적인 에이전트로 활용합니다.
  • 폐쇄 루프 반복 정제: 시스템은 LLM이 레이어 유형, 깊이, 너비 및 하이퍼파라미터를 조정하기 위해 실험 결과로부터 학습하는 동적 피드백 루프를 구현하여 수동 튜닝의 필요성을 제거합니다.
  • 투명성 및 재현성: 파이프라인은 모든 실험을 엄격하게 기록하며, 아키텍처 구성과 성능 지표를 구조화된 형식(JSON, CSV)으로 저장하여 완전한 재현성을 보장합니다.

실험 결과
파이프라인은 세 가지 스크립트와 세 가지 LLM에 대해 각각 30회의 독립적인 실험을 통해 평가되었습니다. 주요 결과는 다음과 같습니다:

  • 정확도: 시스템은 지속적으로 높은 테스트 정확도를 가진 모델을 발견했습니다. GPT-4o는 아랍어에 대해 가장 높은 평균 정확도(0.959)를 달성했으며, Claude Sonnet 4는 페르시아어에서 선두를 차지했습니다(0.946). GPT-5는 아랍어에서 최고 사례 실험 정확도 0.981을 기록했습니다. 모든 모델과 스크립트에 대한 평균 정확도는 일반적으로 93%를 상회했습니다.
  • 효율성 및 지연 시간: GPT-5는 가장 컴팩트한 아키텍처(0.88M ~ 1.35M 파라미터)를 생성한 반면, Claude Sonnet 4는 더 큰 모델(최대 9.28M 파라미터)을 생성했습니다. 파라미터 수의 상당한 차이에도 불구하고, 추론 지연 시간은 실시간 처리에 적합한 수준(약 40~44ms)으로 안정적으로 유지되었으며, 이는 런타임 비용이 원시 파라미터 크기보다 아키텍처의 깊이에 의해 결정됨을 시사합니다.
  • 일반화: 검증 곡선이 훈련 곡선을 밀접하게 추적하였으며(차이가 통상 1~2% 이내), 이는 강력한 일반화 능력과 효과적인 규제(regularization)를 통해 과적합이 방지되었음을 나타냅니다.
  • 비교: LLM을 저자원 스크립트를 위한 직접적인 인식기로 취급했던 이전 연구(예: Cerescu & Bumbu, 2024)와 비교하여, 본 프레임워크는 LLM을 자동 모델 설계를 위한 생성 에이전트로 활용함으로써 더 높은 정확도와 다국어에 걸친 완전한 자동화를 달려 성과를 거두었습니다.

의의 및 주장
본 논문은 대규모 언어 모델이 전통적인 언어 처리 역할을 넘어 머신러닝 시스템의 독립적인 설계자로서 기능할 수 있음을 입증한다고 주장합니다. 교차 언어 필기체 OCR을 위한 신경 아키텍처 탐색을 자동화함으로써, 본 프레임워크는 확장 가능하고 스크립트에 구애받지 않는 완전 자동화된 솔루션을 제공합니다. 저자들은 이 접근 방식이 OCR 모델 개발을 크게 단순화하고, 도메인 특화 휴리스틱 및 전문가 개입에 대한 의존성을 제거하며, 다양한 언어와 도메인에 걸쳐 OCR 기술을 신속하고 적응력 있게 배포할 수 있는 길을 열어준다고 단언합니다. 결과적으로 LLM 기반의 아키텍처 탐색이 예측 성능, 추론 효율성 및 모델 복잡도 사이의 균형을 효과적으로 맞출 수 있음을 검증하였습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →