← 最新论文
💻 computer science

MarkushGlyph and OCSRGlyph: Improved Chemical Structure Recognition

本文介绍了 MarkushGlyph 和 OCSRGlyph,这是两种通过利用针对 Markush 结构的视觉语言方法以及针对单分子增强立体化学处理的图像到文本翻译模型,从而显著提升化学结构识别能力的模型,并提出了一种用于评估 Markush 翻译准确性的新指标。

原作者: Alex Andonian, Samuel G Rodriques, Andrew D White, Siddharth M Narayanan

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Alex Andonian, Samuel G Rodriques, Andrew D White, Siddharth M Narayanan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,化学的世界就像一座巨大且繁忙的图书馆,每一本书、每一项专利和每一篇研究论文中都充满了复杂的分子图谱。对于人类化学家来说,这些图画就像一种他们能瞬间读懂的秘密语言,能够洞察原子如何连接并形成药物、塑料或燃料。但对于计算机而言,这些图像仅仅是一堆杂乱的像素;机器人无法像人类那样“看到”一个苯环。为了让这些图画对计算机变得有用——以便它们能够搜索数据库、预测新药或训练人工智能——我们必须将这些图像转化为机器可以理解的文本代码。这个过程被称为光学化学结构识别(OCSR)。这就像是将一张房屋草图转化为一套精确的蓝图,并用一种建筑机器人能够阅读的语言写出来。

这座图书馆中有两种主要的图纸类型。第一种是单一、特定的分子,就像一张特定汽车的照片。第二种是“马库什”(Markush)结构,它更像是一套整个汽车家族的蓝图。马库什图纸并不绘制某一种具体的车辆,而是展示一个共享的框架,并在其中标有“R1”或“R2”等空白处,意为“任何符合此处要求的部件”。专利律师正是通过这种方式来描述潜在药物的家族,而无需列出每一个变体。挑战在于,虽然计算机在阅读单车照片方面已经做得很好,但在理解复杂的、具有灵活性的家族蓝图时仍然感到吃力。

这篇论文介绍了两个名为 OCSRGlyphMarkushGlyph 的新型人工智能工具,旨在解决这些翻译问题。可以将它们想象成新一代的超级智能翻译官。OCSRGlyph 是专注于单分子照片的专家。研究人员发现,人工智能在处理分子的“手性”(一种被称为立体化学的属性,即分子可以是左手型或右手型的版本,就像一双手套一样)时会不断犯一些微小的错误。为了修复这个问题,他们向人工智能输入了更多关于这些棘手形状的训练示例。结果是,这个翻译器在单分子代码上的准确率达到了 93.8%,创下了新的纪录。

另一方面,MarkushGlyph 是更具雄心的兄弟。它是一个“视觉-语言”模型,这意味着它将整个专利页面——包括图纸和周围的文本——视为一幅完整的图像,而不是试图将文本和图像分开读取。以往的方法尝试分阶段解决这个谜题,就像一个团队中,一个人负责读文本,另一个人负责画图,第三个人负责尝试将它们组合在一起,这种方式往往会在交接过程中丢失细节。MarkushGlyph 则跳过了中间环节,一次性读取所有内容。作者证明,这种单步方法在理解“家族蓝图”方面比旧的多阶段方法要出色得多。他们还引入了一种更严格的评分方式,能够捕捉到旧评分系统漏掉的错误,例如人工智能不小心交换了两个标签,或者添加了原本不存在的特征。

简而言之,这篇论文表明,通过将这些化学图纸视为直接的图像到文本的翻译问题,并使用现代人工智能技术,我们可以让计算机以空前的准确度阅读化学专利。该团队不仅构建了一个更好的翻译器,还构建了一个更好的测试体系,以确保翻译确实正确,确保当计算机阅读一个化学家族时,能够精确理解化学家的意图,甚至细微到最小的细节。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →