LLM-Driven AutoML for Cross-Lingual Handwritten OCR: Closed-Loop Neural Architecture Search with GPT-5, GPT-4o, and Claude Sonnet 4
本文提出了一种全自动、闭环的 AutoML 框架,该框架利用 GPT-5、GPT-4o 和 Claude Sonnet 4 作为自主智能体,通过迭代设计、训练和优化用于跨语言手写 OCR 的神经架构,在无需人工干预的情况下,在阿拉伯语、波斯语和英语数据集上实现了超过 93% 的平均准确率和低延迟。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:基于 LLM 驱动的跨语言手写体 OCR 自动机器学习 (AutoML)
问题陈述
由于独特的视觉复杂性、复杂的笔画模式以及书写风格的高度变异性,跨多种脚本(如阿拉伯语、英语和波斯语)的手写文本识别 (HTR) 仍然是机器学习领域的一项重大挑战。传统方法严重依赖于专家引导的模型设计、大量的手动预处理以及迭代式的超参数调优。这些方法通常耗时较长,难以扩展到新脚本,并且容易产生不一致的结果。虽然神经架构搜索 (NAS) 和大语言模型 (LLM) 的最新进展已显示出潜力,但将其作为独立的、闭环的智能体,专门用于生成和优化针对跨语言手写体 OCR 的深度学习架构,这一应用领域在很大程度上仍未得到充分探索。
方法论
作者提出了一种完全自动化的端到端流水线,利用大语言模型(具体为 GPT-5、GPT-4o 和 Claude Sonnet 4)作为自主的“AI 架构师”。该系统通过一个包含四个核心阶段的闭环迭代过程运行:
- 数据收集与增强: 该流水线利用了 EMNIST(英语)、SADRI(波斯语)和 AHCD(阿拉伯语)数据集。数据被标准化为张量格式并进行分层采样。在训练期间应用轻量级增强策略(随机旋转、平移、缩放),以在不增加显著计算开销的情况下增强泛化能力。
- LLM 驱动的架构提案: 在每次试验开始时,系统会向 LLM 提供数据集元数据(类别计数、图像维度),并在随后的迭代中提供来自先前试验的性能指标。LLM 会返回一个结构化的 JSON 规范,详细说明神经网络架构(例如 Conv2D、BatchNorm、Dropout、Transformer 模块)和训练超参数(优化器、学习率、批大小)。
- 自动化模型构建与训练: JSON 规范被解析并自动转换为可执行的 Keras 模型。这些模型涵盖了从标准 CNN 到包含 Vision Transformer 组件的混合架构。模型使用分类交叉熵损失进行编译,并在无需人工干预的情况下进行训练。
- 评估与反馈循环: 训练完成后,系统会在测试集、验证集和训练集上评估模型,记录准确率、参数量和推理延迟。这些指标作为结构化摘要反馈给 LLM。LLM 利用这些反馈在下一次迭代中优化其架构提案,从而创建一个自我改进的循环,向针对特定脚本的最优设计收敛。
核心贡献
- 统一的跨脚本框架: 该工作引入了一个能够识别阿拉伯语、英语和波斯语脚本的单一框架,能够适应每种脚本特定的结构和视觉复杂性,而无需手动重新配置。
- LLM 作为生成式智能体: 不同于以往仅将 LLM 用于识别或作为静态工具的研究,本方法将 GPT-5、GPT-4o 和 Claude Sonnet 4 作为独立的智能体,负责从提案到优化的整个模型发现生命周期。
- 闭环迭代优化: 系统实现了一个动态反馈循环,LLM 通过学习逐次试验的结果来调整层类型、深度、宽度和超参数,消除了对手动调优的需求。
- 透明度与可复现性: 该流水线严格记录每一次试验,以结构化格式(JSON、CSV)保存架构配置和性能指标,以确保完全的可复现性。
实验结果
该流水线针对三种脚本和三种 LLM 进行了三十次独立试验的评估。主要发现包括:
- 准确率: 系统一致地发现了具有高测试准确率的模型。GPT-4o 在阿拉伯语方面实现了最高的平均准确率 (0.959),而 Claude Sonnet 4 在波斯语方面表现领先 (0.946)。GPT-5 在阿拉伯语上的最佳试验准确率达到了 0.981。所有模型和脚本的平均准确率普遍超过 93%。
- 效率与延迟: GPT-5 生成的架构最为紧凑(0.88M 至 1.35M 参数),而 Claude Sonnet 4 生成的模型较大(高达 9.28M 参数)。尽管参数量存在显著差异,但推理延迟保持稳定且适用于实时场景(约 40–44 ms),这表明运行时成本更多是由架构深度而非原始参数规模驱动的。
- 泛化能力: 验证曲线与训练曲线紧密追踪(差异通常在 1–2% 以内),表明具有强大的泛化能力和有效的正则化,且未出现过拟合。
- 对比: 与之前的研究(例如 Cerescu & Bumbu, 2024)相比,后者将 LLM 作为低资源脚本的直接识别器,而本框架将 LLM 用作自动化模型设计的生成式智能体,实现了更高的准确率和跨多种语言的全自动化。
意义与主张
论文声称,这项工作证明了大语言模型超越其传统的语言处理角色,能够作为机器学习系统的独立设计者。通过自动化发现跨语言手写体 OCR 的神经架构,该框架提供了一种可扩展、与脚本无关且完全自动化的解决方案。作者断言,这种方法显著简化了 OCR 模型的开发,消除了对特定领域启发式方法和专家干预的依赖,并为跨多种语言和领域的 OCR 技术快速、灵活的部署开启了大门。结果验证了 LLM 驱动的架构搜索可以有效地平衡预测性能、推理效率和模型复杂度。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。