← 최신 논문
🧬 biology

Fine-tuning DeepSeek-OCR-2 for Molecular Structure Recognition

이 논문은 DeepSeek-OCR-2 를 기반으로 파라미터 효율적 미세조정과 점진적 전 파라미터 미세조정 전략을 도입하여 2 차원 분자 구조를 SMILES 문자열로 변환하는 'MolSeek-OCR' 모델을 개발하고, 이미지-그래프 기반 최첨단 모델에는 미치지 못하지만 이미지-시퀀스 모델 중에서는 경쟁력 있는 성능을 보였음을 보고합니다.

원저자: Haocheng Tang, Xingyu Dang, Junmei Wang

게시일 2026-04-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Haocheng Tang, Xingyu Dang, Junmei Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

🧪 1. 문제 상황: "AI 가 화학자의 낙서를 못 읽는다"

화학 논문이나 특허 문서에는 분자 구조가 복잡한 그림으로 그려져 있습니다. 컴퓨터는 이 그림을 보고 "아, 이건 벤젠 고리야"라고 알아내서 C6H6 같은 텍스트 (SMILES) 로 바꿔줘야 합니다.

하지만 기존에 있던 거대 AI 모델 (DeepSeek-OCR-2 같은) 은 책이나 문서의 일반 글자는 잘 읽지만, 화학 구조라는 특수한 '낙서'를 읽는 데는 매우 서툴렀습니다. 그냥 모든 파라미터를 다 수정해서 학습시키려니 AI 가 혼란을 겪고 오히려 성능이 떨어지는 '학습 실패' 현상이 발생했습니다.

🛠️ 2. 해결책: "조금씩, 단계별로 가르치는 두 단계 전략"

저자들은 "한 번에 다 가르치면 안 되니, 두 단계로 나누어 천천히 가르치자"는 아이디어를 냈습니다.

  • 1 단계: 'LoRA'라는 안경 끼우기 (효율적인 학습)

    • 비유: AI 에게는 이미 세상을 보는 눈 (시각 인식 능력) 이 있습니다. 하지만 화학이라는 특수한 언어를 읽는 '안경'이 없죠.
    • 방법: AI 의 전체 뇌를 바꾸는 게 아니라, **특정 부분 (안경)**만 살짝 수정해서 화학 그림을 텍스트로 변환하는 능력을 먼저 익히게 합니다. 이때는 합성된 깨끗한 그림과 실제 특허 문서의 거친 그림을 섞어서 다양한 스타일에 익숙해지게 합니다.
    • 결과: AI 가 이제 화학 그림을 대략적으로 읽을 수 있게 되었습니다.
  • 2 단계: '분할 학습'으로 다듬기 (정밀한 학습)

    • 비유: 이제 안경은 잘 끼워졌으니, **시각을 담당하는 눈 (저수준)**은 그대로 둔 채, **이해와 해석을 담당하는 뇌 (고수준)**만 집중적으로 훈련시킵니다.
    • 방법: 그림을 보는 눈은 이미 잘 작동하므로 건드리지 않고, 그림을 텍스트로 바꾸는 '해석 능력'만 더 정교하게 다듬습니다. 이때 학습 속도를 다르게 조절하여 (시각은 느리게, 언어는 빠르게) 더 정확한 결과를 내도록 합니다.
    • 결과: 이렇게 만든 모델 **'MolSeek-OCR'**은 기존 최고의 모델들과 맞먹는 성능을 냈습니다.

📊 3. 성능 비교: "누가 더 잘할까?"

  • MolSeek-OCR (이 연구의 모델): 그림을 보고 바로 텍스트로 변환하는 '이미지-텍스트' 방식의 모델들 중에서는 최고 수준의 성능을 냅니다.
  • MolScribe (현존하는 최강자): 하지만 아직까지 가장 잘하는 모델은 그림을 보고 '점과 선 (원자 결합)'을 직접 그리는 '이미지-그래프' 방식의 모델입니다.
    • 비유: MolSeek-OCR 은 그림을 보고 "이건 사과야"라고 말로 설명하는 데는 훌륭하지만, MolScribe 는 사과를 직접 그리는 화가처럼 더 정밀하게 구조를 파악합니다. 복잡한 화학 구조를 100% 완벽하게 텍스트로 옮기는 데는 아직 한계가 있습니다.

❌ 4. 실패한 시도: "강화 학습은 왜 안 먹혔을까?"

연구진은 "더 잘하게 하려면 보상 (Reward) 을 주고 훈련해보자"는 강화 학습 (GSPO, ReFT) 도 시도했습니다.

  • 비유: AI 가 틀린 답을 내면 "아니야, 화학적으로 맞지 않아"라고 채점해 주고, 맞으면 "잘했어"라고 칭찬하는 방식입니다.
  • 결과: 하지만 AI 는 화학적으로 맞는 분자 구조를 찾아내는 데는 성공했지만, **정확한 텍스트 순서 (SMILES)**를 맞추는 데는 실패했습니다.
    • 핵심: AI 는 "사과"라는 뜻은 맞췄지만, 철자를 Aple이나 Pplae처럼 틀리게 쓰는 경우가 많았습니다. 화학에서는 철자 (순서) 가 하나라도 틀리면 완전히 다른 물질이 되므로, 이 방식은 결국 쓸모가 없었습니다.

💡 5. 결론: "점진적인 학습이 핵심"

이 논문은 거대 AI 모델을 화학 분야에 적용할 때, 한 번에 모든 것을 바꾸려 하지 말고, 효율적인 부분 수정 (LoRA) 과 단계적인 정밀 학습 (Split Learning) 을 결합하는 것이 중요하다는 것을 증명했습니다.

비록 아직은 '그림을 그리는 화가 (MolScribe)'만큼 완벽하지는 않지만, **"그림을 보고 텍스트로 읽어내는 독서왕 (MolSeek-OCR)"**으로서 매우 경쟁력 있는 모델을 만들어냈습니다. 이는 미래에 방대한 화학 문헌을 자동으로 디지털화하는 데 큰 도움이 될 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →