← 最新の論文
🤖 AI

LLM-Driven AutoML for Cross-Lingual Handwritten OCR: Closed-Loop Neural Architecture Search with GPT-5, GPT-4o, and Claude Sonnet 4

本論文は、GPT-5、GPT-4o、およびClaude Sonnet 4を自律的なエージェントとして活用し、アラビア語、ペルシャ語、および英語のデータセットにおいて、手動による介入なしに93%以上の平均精度と低レイテンシを実現する、クロスリンガルな手書き文字OCRのためのニューラルアーキテクチャを反復的に設計、訓練、および洗練させる、完全自動化されたクローズドループ型のAutoMLフレームワークを提示する。

原著者: Mobina Kashaniyan, Amirhossein Ghassemi, Nasser Mozayani

公開日 2026-07-20
📖 1 分で読めます☕ さくっと読める

原著者: Mobina Kashaniyan, Amirhossein Ghassemi, Nasser Mozayani

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

技術要約:言語横断的な手書きOCRのためのLLM駆動型AutoML

問題提起
アラビア語、英語、ペルシア語といった多様なスクリプト(文字体系)における手書き文字認識(HTR)は、独特の視覚的複雑さ、入り組んだストロークのパターン、および筆致の多様性の高さから、機械学習における重要な課題であり続けている。従来のアプローチは、専門家によるモデル設計、大規模な手動前処理、および反復的なハイパーパラメータ調整に大きく依存している。これらの手法は、時間がかかることが多く、新しいスクリプトへのスケールが困難であり、結果に一貫性を欠く傾向がある。近年のニューラルアーキテクチャ探索(NAS)や大規模言語モデル(LLM)の進歩は有望視されているものの、これらを、クロスリンガルな手書きOCRに特化したディープラーニング・アーキテクチャを生成・洗練させるための独立したクローズドループ・エージェントとして活用する研究は、これまでほとんど探索されてこなかった。

手法
著者らは、大規模言語モデル(具体的にはGPT-5、GPT-4o、Claude Sonnet 4)を自律的な「AIアーキテクト」として利用する、完全に自動化されたエンドツーエンドのパイプラインを提案する。本システムは、以下の4つのコアステージからなる、クローズドループ型の反復プロセスを通じて動作する。

  1. データ収集と拡張: パイプラインは、EMNIST(英語)、SADRI(ペルシア語)、およびAHCD(アラビア語)のデータセットを利用する。データはテンソル形式に標準化され、層化抽出が行われる。トレーニング中には、計算負荷を大幅に増やすことなく汎化性能を高めるため、軽量な拡張戦略(ランダムな回転、シフト、ズーム)が適用される。
  2. LLM駆動型アーキテクチャ提案: 各試行の開始時に、システムはデータセットのメタデータ(クラス数、画像次元)を用いてLLMにプロンプトを送り、次回の反復では前回の試行からのパフォーマンス指標を提示する。LLMは、ニューラルネットワークのアーキテクチャ(例:Conv2D、BatchNorm、Dropout、Transformerブロック)およびトレーニング用ハイパーパラメータ(オプティマイザ、学習率、バッチサイズ)の詳細を記述した構造化されたJSON仕様を回答する。
  3. 自動モデル構築とトレーニング: JSON仕様は解析され、実行可能なKerasモデルへと自動的に変換される。これらのモデルは、標準的なCNNから、Vision Transformerコンポーネントを組み込んだハイブリッドアーキテクチャまで多岐にわたる。モデルはカテゴリカルクロスエントロピー損失を用いてコンパイルされ、人間の介入なしにトレーニングされる。
  4. 評価とフィードバックループ: トレーニング完了後、システムはテスト、検証、およびトレーニングセット上でモデルを評価し、精度、パラメータ数、および推論レイテンシを記録する。これらの指標は、構造化されたサマリーとしてLLMにフィードバックされる。LLMはこのフィードバックを用いて、次回の試行に向けてアーキテクチャの提案を洗練させ、特定のスクリプトに対して最適な設計へと収束する自己改善ループを形成する。

主な貢献

  • 統一されたクロススクリプト・フレームワーク: 本研究は、アラビア語、英語、ペルシア語のスクリプトを認識可能であり、手動の再構成なしに各スクリプトの構造的・視覚的な複雑さに適応できる単一のフレームワークを導入する。
  • 生成エージェントとしてのLLM: LLMを単なる認識ツールや静的なツールとして使用する先行研究とは異なり、本アプローチでは、提案から洗練に至るまでのモデル発見のライフサイクル全体を責任を持って担うスタンドアロンのエージェントとして、GPT-5、GPT-4o、およびClaude Sonnet 4を採用している。
  • クローズドループ型の反復的な洗練: 本システムは、LLMが試行ごとの結果から学習し、層のタイプ、深さ、幅、およびハイパーパラメータを調整する動的なフィードバックループを実装しており、手動チューニングを排除している。
  • 透明性と再現性: パイプラインはすべての試行を厳格に文書化し、アーキテクチャ構成とパフォーマンス指標を構造化された形式(JSON、CSV)で保存することで、完全な再現性を確保している。

実験結果
パイプラインは、3つのスクリプトと3つのLLMそれぞれについて、30回の独立した試行にわたって評価された。主な知見は以下の通りである:

  • 精度: システムは一貫して高いテスト精度を持つモデルを発見した。GPT-4oはアラビア語において最高の平均精度(0.959)を達成し、Claude Sonnet 4はペルシア語において最高(0.946)を記録した。GPT-5はアラビア語において最高試行精度0.981を達成した。すべてのモデルとスクリプトを通じた平均精度は、概して93%を超えた。
  • 効率性とレイテンシ: GPT-5は最もコンパクトなアーキテクチャ(0.88Mから1.35Mのパラメータ)を生成したが、Claude Sonnet 4はより大きなモデル(最大9.28Mのパラメータ)を生成した。パラメータ数の大幅な変動にもかかわらず、推論レイテンシは安定しており、リアルタイムに適した状態(約40〜44ミリ秒)を維持していた。これは、実行時のコストが生のパラメータサイズよりもアーキテクチャの深さに起因することを示唆している。
  • 汎化性能: 検証曲線はトレーニング曲線を密接に追跡しており(差異は通常1〜2%以内)、過学習のない強力な汎化と効果的な正則化を示している。
  • 比較: LLMを低リソース言語の直接的な認識器として扱っていた先行研究(例:Cerescu & Bumbu, 2024)と比較して、本フレームワークはLLMを自動モデル設計のための生成エージェントとして活用しており、複数の言語にわたって高い精度と完全な自動化を実現している。

意義と主張
本論文は、本研究が、大規模言語モデルが従来の言語処理の役割を超え、機械学習システムの独立した設計者として機能できることを実証していると主張している。クロスリンガルな手書きOCRのためのニューラルアーキテクチャ探索を自動化することにより、本フレームワークは、スケーラブルでスクリプトに依存しない、完全自動化されたソリューションを提供する。著者らは、このアプローチがOCRモデルの開発を大幅に簡素化し、ドメイン固有のヒューリスティックや専門家の介入への依存を取り除き、多様な言語やドメインにおけるOCR技術の迅速かつ適応可能な展開への道を開くと断言している。実験結果は、LLM駆動型のアーキテクチャ探索が、予測性能、推論効率、およびモデルの複雑さのバランスを効果的に取れることを裏付けている。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →