想象一下,化学的世界就像一座巨大且繁忙的图书馆,每一本书、每一项专利和每一篇研究论文中都充满了复杂的分子图谱。对于人类化学家来说,这些图画就像一种他们能瞬间读懂的秘密语言,能够洞察原子如何连接并形成药物、塑料或燃料。但对于计算机而言,这些图像仅仅是一堆杂乱的像素;机器人无法像人类那样“看到”一个苯环。为了让这些图画对计算机变得有用——以便它们能够搜索数据库、预测新药或训练人工智能——我们必须将这些图像转化为机器可以理解的文本代码。这个过程被称为光学化学结构识别(OCSR)。这就像是将一张房屋草图转化为一套精确的蓝图,并用一种建筑机器人能够阅读的语言写出来。
这座图书馆中有两种主要的图纸类型。第一种是单一、特定的分子,就像一张特定汽车的照片。第二种是“马库什”(Markush)结构,它更像是一套整个汽车家族的蓝图。马库什图纸并不绘制某一种具体的车辆,而是展示一个共享的框架,并在其中标有“R1”或“R2”等空白处,意为“任何符合此处要求的部件”。专利律师正是通过这种方式来描述潜在药物的家族,而无需列出每一个变体。挑战在于,虽然计算机在阅读单车照片方面已经做得很好,但在理解复杂的、具有灵活性的家族蓝图时仍然感到吃力。
这篇论文介绍了两个名为 OCSRGlyph 和 MarkushGlyph 的新型人工智能工具,旨在解决这些翻译问题。可以将它们想象成新一代的超级智能翻译官。OCSRGlyph 是专注于单分子照片的专家。研究人员发现,人工智能在处理分子的“手性”(一种被称为立体化学的属性,即分子可以是左手型或右手型的版本,就像一双手套一样)时会不断犯一些微小的错误。为了修复这个问题,他们向人工智能输入了更多关于这些棘手形状的训练示例。结果是,这个翻译器在单分子代码上的准确率达到了 93.8%,创下了新的纪录。
另一方面,MarkushGlyph 是更具雄心的兄弟。它是一个“视觉-语言”模型,这意味着它将整个专利页面——包括图纸和周围的文本——视为一幅完整的图像,而不是试图将文本和图像分开读取。以往的方法尝试分阶段解决这个谜题,就像一个团队中,一个人负责读文本,另一个人负责画图,第三个人负责尝试将它们组合在一起,这种方式往往会在交接过程中丢失细节。MarkushGlyph 则跳过了中间环节,一次性读取所有内容。作者证明,这种单步方法在理解“家族蓝图”方面比旧的多阶段方法要出色得多。他们还引入了一种更严格的评分方式,能够捕捉到旧评分系统漏掉的错误,例如人工智能不小心交换了两个标签,或者添加了原本不存在的特征。
简而言之,这篇论文表明,通过将这些化学图纸视为直接的图像到文本的翻译问题,并使用现代人工智能技术,我们可以让计算机以空前的准确度阅读化学专利。该团队不仅构建了一个更好的翻译器,还构建了一个更好的测试体系,以确保翻译确实正确,确保当计算机阅读一个化学家族时,能够精确理解化学家的意图,甚至细微到最小的细节。
技术摘要:MarkushGlyph 与 OCSRGlyph
问题陈述
专利和科学文献中的化学结构主要以图像形式进行交流,这些图像虽然对化学家而言是可读的,但难以进行程序化处理(例如,用于数据库索引或机器学习训练)。将这些图像转换为机器可读的线性表示(通常为 SMILES 或 CXSMILES)的任务,对于单个分子被称为光学化学结构识别(OCSR),对于马库什(Markush)结构家族则被称为马库什结构翻译。虽然 OCSR 已趋于成熟,但马库什结构解析仍然具有挑战性,因为需要解决不同专利局之间存在的变量位点、约束条件以及多样化的绘图惯例。此外,现有的马库什结构评估指标往往无法惩罚错误的特征添加或标签置换,从而导致准确率得分虚高。
方法论
作者将 OCSR 和马库什翻译都框架化为图像到文本的翻译问题,通过训练单一模型,而不是依赖于分别处理文本、布局和图像的多阶段流水线。
OCSRGlyph(单分子识别):
- 架构: 一个标准的图像到序列模型,使用 Swin-B Transformer 编码器(384 像素分辨率,基于 ImageNet 初始化)和一个六层 Transformer 解码器。
- 训练策略: 该模型在经过精心策划的 PubChem-1M 和 USPTO-680K 混合数据集上进行训练。至关重要的是,作者通过在训练期间对手性分子(Stereo-200K 及相邻环子集)进行过采样,解决了手性化学特性的特定挑战。这提高了对手性化学准确性的提升,且不会降低对非手性分子的性能。
- 输出: 生成纯粹的规范化 SMILES 字符串。
MarkushGlyph(马库什结构识别):
- 架构: 一个基于 Qwen3.5-2B-Base 的视觉语言模型(VLM),利用了一种早期融合方法,即裁剪后的图像和文本提示词由单个网络共同处理。它采用低秩自适应(LoRA)进行高效微调。
- 输入/输出: 该模型接受整个结构图像(包括打印文本、R-基团标签和括号),无需单独的 OCR 前端。它输出一个结构化的
cxsmiles_opt 记录(一种优化的 CXSMILES 格式,其中标签与原子内联),并将其封装在 XML 标签中,包括核心结构和任何取代基定义。
- 组合训练: 为了在没有输入类型先验知识的情况下同时处理单分子和马库什结构,该模型在一个组合数据集上进行训练,其中普通分子被视为马库什记录的一种特殊情况(具有空的变量字段)。
核心贡献
- OCSRGlyph: 一个最先进的 OCSR 模型,通过专门通过数据策划解决手性问题,在 USPTO 基准测试中实现了 93.8% 的精确匹配准确率。
- MarkushGlyph: 一个单阶段视觉语言模型,在所有三个标准马库什基准测试(IP5-M, M2S, USPTO-M)上均优于先前的多阶段流水线(如 MarkushGrapher-2)。它消除了对独立文本提取和布局解析阶段的需求。
- 严格解析图等价性指标: 作者引入了一种新的评估指标,解决了现有指标的失效模式。与以往仅检查是否包含所需特征(允许存在额外或错误的特征)的方法不同,该指标要求预测结果与参考结果之间满足严格的图同构,并保留 R-基团分配、连接位置、重复单元和片段对应关系。
- 统一方法: 证明了 OCSR 可以被视为马库什翻译的一个特例,从而允许单个模型有效地解析这两类化学结构。
结果
- OCSR 性能: OCSRGlyph 在 USPTO 基准测试(5,719 幅图像)上实现了 93.8% 的规范化精确匹配准确率,超过了之前的最先进模型(MolSight)1.8 个百分点。在“保持手性”约定下,它也达到了 93.9% 的准确率。
- 马库什性能: MarkushGlyph 在两种评分标准下,在所有三个基准测试中均优于 MarkushGrapher-2 及其他基准模型。
- 在 IP5-M(878 个示例)上,MarkushGlyph 在标准评分下达到 60.6%,在严格等价性评分下达到 54.7%。
- 在 M2S(103 个示例)上,它达到 62.1%(标准)和 64.1%(严格)。
- 在 USPTO-Markush(74 个示例)上,它达到 63.5%(标准)和 56.8%(严格)。
- 消融实验: 作者表明,向马库什训练集中添加 OCSR 样本可以显著提高 OCSR 性能,而不会实质性地降低马库什识别能力。
意义与主张
论文声称,这些结果代表了迈向能够从图像翻译单分子和复杂马库什家族的统一模型的进步。作者强调,高水平的性能是通过相对简单的策略实现的:利用预训练骨干网络、单阶段训练和仔细的数据采样。
该工作强调了两个具体的局限性:
- MarkushGlyph 的 OCSR 性能虽然很强,但尚未达到专门的 OCSRGlyph 模型,这表明在单一架构中统一这两项任务的最先进性能仍存在差距。
- 马库什结构识别性能仍明显落后于 OCSR 性能,表明变量基团和约束条件的复杂性仍然是一个具有挑战性的前沿领域。
作者总结道,他们的工作证明了简单、可扩展的方法以及推理时缩放(例如,多数投票法)在缩小当前能力与专利及文献分析中稳健化学结构识别需求之间差距方面的有效性。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。