← 최신 논문
📄 chemistry

MolTabReco: Table-Coordinate-Grounded Chemical Table Recognition with SMILES Recovery for Molecular-Structure Cells

MolTabReco는 표 좌표 그라운딩, 시각-언어 모델, 그리고 광학 화학 구조 인식을 통합하여 화학 문헌 표로부터 분자 구조를 정확하게 정규 SMILES 문자열로 복원하는 다단계 프레임워크로, 구조적 묘사를 계산 가능한 데이터로 변환하는 데 실패하는 기존 방식들을 크게 능가한다.

원저자: Wei Hu, Wei Liu, Yuanjie Xiang, Jiawei Huang, Mei Ouyang, Jiajun Tao, Yao Song

게시일 2026-08-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: Wei Hu, Wei Liu, Yuanjie Xiang, Jiawei Huang, Mei Ouyang, Jiajun Tao, Yao Song

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 마치 혼란스러운 범죄 현장에서 단서를 찾으려는 탐정이라고 상상해 보십시오. 어떤 단서는 포스트잇에 적혀 있고, 어떤 것은 컴퓨터에 타이핑되어 있으며, 또 어떤 것은 복잡하게 손으로 그려진 지도 안에 숨겨져 있습니다. 화학의 세계에서 과학자들은 수십 년 동안 정보의 노다지를 품고 있었습니다. 수천 편의 연구 논문에는 표가 가득 차 있습니다. 이 표들은 실험, 숫자, 그리고 가장 중요한 것, 생명과 의약품의 아주 작은 구성 단위인 분자의 그림들을 나열하고 있습니다. 오랫동안 컴퓨터는 타이핑된 단어와 숫자는 쉽게 읽을 수 있었지만, 분자 그림을 마주하면 벽에 부딪혔습니다. 컴퓨터는 그것을 보고 "이미지를 발견했습니다"라고 말할 뿐, 그 분자가 무엇인지, 혹은 컴퓨터 프로그램에서 어떻게 사용해야 하는지는 알지 못했습니다. 이는 마치 사서가 읽을 수 없는 언어로 쓰인 책들이 가득한 도서관과 같았습니다.

이를 해결하기 위해 과학자들은 SMILES라는 특별한 코드를 사용합니다. SMILES를 모든 분자에 대한 비밀번호나 고유한 바코드라고 생각하십시오. SMIMLS 코드가 있다면, 컴퓨터는 즉시 분자의 형태를 이해하고, 어떻게 행동할지 예측하며, 유사한 것을 검색할 수 있습니다. 문제는 이 표 안에 있는 분자 그림들이 매우 지저란하다는 것이었습니다. 이 그림들은 종종 아주 작게 그려져 텍스트 옆에 끼어 있거나, 표의 선에 의해 가려져 있거나, 저해상도로 그려져 있습니다. 텍스트를 읽는 일반적인 컴퓨터 프로그램(OCR)은 이 그림들 때문에 혼란을 겪으며, 이미지를 이해하는 고급 AI조차도 그저 추측하거나 빈칸으로 남겨두곤 합니다. 큰 질문은 이것이었습니다. "우리는 이 지저분한 표 안에서 이 작은 그림들을 찾아낼 뿐만 아니라, 이를 완벽하고 사용 가능한 SMILES 코드로 번역하면서, 동시에 그 그림이 정확히 몇 번째 행과 열에 속하는지까지 알 수 있는 시스템을 구축할 수 있을까?"

여기에 후난 의과대학교 연구진이 만든 새로운 디지털 탐정, MolTabReco가 등장했습니다. MolTabReco를 지저분한 도서관을 정리하기 위해 협력하는 매우 조직적인 전문가 팀이라고 생각할 수 있습니다. 이 시스템은 페이지 전체를 한꺼번에 읽으려고 하는 대신, 영리한 다단계 과정을 통해 작업을 분해합니다. 먼저, 이 시스템은 날카로운 눈을 가진 정찰대처럼 행동하여, 페이지 내에서 표의 정확한 경계를 찾아내고 혼란을 줄 수 있는 제목이나 각주를 무시합니다. 다음으로, 강력한 AI(시각-언어 모델, VLM)를 사용하여 표의 그리드를 매핑하고, 마치 지도 위에 격자를 그리듯 행과 열이 어디에 있는지 파악합니다.

하지만 여기서 MolTabReco는 정말 똑똑해집니다. 이 시스템은 표의 모든 셀이 동일하지 않다는 것을 알고 있습니다. 어떤 셀에는 "온도: 50°C"와 같은 단순한 텍스트가 있는 반면, 다른 셀에는 까다로운 분자 그림이 들어 있습니다. 시스템에는 각 셀을 살펴보고 "이것이 그림인가, 아니면 그냥 글자인가?"라고 묻는 특별한 '교통 경찰'이 있습니다. 만약 단순한 글자라면, 시스템은 신뢰할 수 있는 텍text 판독기를 사용하여 이를 전사합니다. 하지만 교통 경찰이 분자 그림을 포착한다면, 그 특정 셀을 별도의 초특화된 경로로 보냅니다. 이 경로는 그림의 지저분함을 처리하도록 설계되었습니다. 즉, 이미지를 확대하고, 깨끗하게 다듬고, 방해가 되는 표 선을 제거한 다음, 분자 전문가 AI를 사용하여 그 구불구불한 선들을 비밀스러운 SMILES 비밀번호로 해독합니다.

이 새로운 방식의 결과는 상당히 유망하지만, 연구진은 아직 이를 완벽한 해결책이라고 부르는 데는 신중합니다. 실제 화학 표 데이터셋에 MolTabReco를 테스트했을 때, 이전 방식들(VLM 베이스라인)은 분자 그림에 대해 거의 쓸모가 없었으며, 성공률이 약 8%에 불과했고 대개 추측하거나 빈칸으로 남겨두었습니다. 반면, MolTabReco는 그림을 SMILES 코드로 정확하게 변환하는 데 약 44%의 성공률을 보였습니다. 만약 그리드가 완벽하게 정렬된 표들만 살펴보았다면, 그 성공률은 거의 55%까지 치솟았습니다. 100% 완벽하지는 않지만, 이는 엄청난 도약입니다. 이는 컴퓨터가 처음으로 지저분한 화학 데이터 페이지를 가져와서, 숨겨진 분자 그림들을 사용 가능한 코드 목록으로 바꾸고, 각 코드를 표의 정확한 위치와 연결할 수 있게 되었음을 의미합니다.

연구진은 또한 초지능형 AI 챗봇을 사용하여 시스템이 저지른 실수를 "수정"할 수 있는지 테스트했습니다. 그들은 챗봇에게 표 전체를 다시 쓰게 하는 것이 위험하다는 것을 발견했습니다. 챗봇은 올바른 숫자를 틀린 숫자로 바꾸거나, 그럴듯하게 들리지만 과학적으로는 거짓인 사실들을 만들어내곤 했습니다. 대신, 그들은 챗봇을 가장 혼란스러운 부분에 대해서만 조심스럽게 사용하는 '편집자'로 활용하기로 했으며, 변경 사항을 받아들이기 전에 엄격한 규칙에 따라 검증하도록 했습니다. 이러한 접근 방식은 최종 데이터가 신뢰할 수 있도록 보장합니다. 궁극적으로, MolTabReco는 단순히 표를 읽는 것이 아니라, 단어와 분자의 차이를 이해하며, 정적인 화학 논문의 이미지를 역동적이고 검색 가능한 분자 비밀의 데이터베이스로 탈바꿈시킵니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →