← 최신 논문
🤖 machine learning

Mat-Pref: Verifiable-Reward Training Improves Compositional Reasoning in Inorganic Materials

이 논문은 무기 재료를 위한 검증 가능한 보상 벤치마크인 Mat-Pref를 소개하며, 지도 미세 조정(supervised fine-tuning)과 그룹 상대 정책 최적화(Group Relative Policy Optimization, GRPO)를 결면한 2단계 학습 파이프라인이 구성 성분 추론 능력과 미학습 구조 군 및 물성에 대한 일반화 능력을 향상시킴으로써 더 큰 제로샷 모델들을 유의미하게 능가한다는 것을 입증한다.

원저자: Sarrah R. Mikhail Leung, Taehan Kim, Jeongbin Park

게시일 2026-06-23
📖 4 분 읽기☕ 가벼운 읽기

원저자: Sarrah R. Mikhail Leung, Taehan Kim, Jeongbin Park

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 아주 유능하지만 경험이 부족한 요리사에게 완벽한 요리를 만드는 법을 가르치려 한다고 상상해 보세요. 당신에게는 방대한 레시피 도서관(훈련 데이터)이 있지만, 요리사는 계속해서 엉뚱한 재료를 넣거나 조리법을 놓치곤 합니다.

이 논문인 MAT-PREF는 특정 유형의 "요리사"(인공지능)에게 무기 재료와 관련된 복잡한 퍼즐을 푸는 법을 가르치는 것에 관한 것입니다. 이 재료들은 새로운 배터리, 태양광 패널, 또는 컴퓨터 칩을 만들기 위한 빌딩 블록과 같은 것들입니다.

이들이 무엇을 했는지 쉽게 설명한 이야기는 다음과 같습니다.

1. 문제점: 요리사가 "추론"하지 못하고 그저 "추측"만 한다

연구진들은 거대 AI 모델들이 더 강하거나 효율적인 구조를 만들기 위해 하나의 성분(원자)을 다른 성분으로 교체하는 최적의 방법을 찾아낼 수 있는지 확인하고 싶었습니다.

그들은 세계에서 가장 똑똑한 네 가지 AI 요리사(700억 개에서 6,710억 개의 "뇌세포"를 가진 모델들)를 테스트했습니다. 이 모델들은 매우 거대함에도 불구하고, 정답률은 약 **33%에서 54%**에 불과했습니다.

  • 비유: 이는 천재에게 객관식 수학 시험을 주는 것과 같지만, 그들이 수학을 실제로 하는 것이 아니라 단어의 형태를 보고 단순히 추측하기 때문에 계속 오답을 고르는 것과 같습니다. 그들은 아직 화학의 논리를 배우지 못한 것입니다.

2. 해결책: 새로운 "훈련 체육관" (MAT-PREF)

이를 해결하기 위해 연구팀은 MAT-PREF라는 새로운 훈련장을 구축했습니다.

  • 출처: 그들은 모든 정답이 매우 정확한 컴퓨터 시뮬레이션(DFT라고 불림)에 의해 검증된, 신뢰할 수 있는 방대한 화학 사실 데이터베이스(Materials Project)를 사용했습니다. 이는 마치 모든 질문에 대해 정확한 정답을 알고 있는 선생님을 두는 것과 같습니다.
  • 테스트: 그들은 10,000개 이상의 질문을 만들었습니다. 어떤 것은 쉬웠고(훈련 시 보았던 것과 유사한 경우), 어떤 것은 어려웠으며(완전히 새로운 결정 구조), 어떤 것은 까다로웠습니다(동일한 구조를 사용하지만 "얼마나 많은 빛을 차단하는가"와 같이 기존의 속성과 다른 속성을 묻는 경우).

3. 훈련 방법: 성공을 위한 2단계 과정

연구진은 단순히 AI에게 더 많은 데이터를 먹인 것이 아닙니다. 그들은 2단계 훈련 과정을 사용했습니다.

  • 1단계: 지도 미세 조정(SFT) – "규칙 배우기"
    먼저, AI에게 화학자처럼 생각하는 법을 가르쳤습니다. 그들은 질문과 그에 따른 올로된 추론 단계(예: "원자의 크기를 확인하라", "전하를 확인하라")를 예시로 제공했습니다.

    • 결과: AI는 형식을 따르고 논리를 이해하는 데 훨씬 능숙해졌으며, 무작위 추측에 가까운 상태에서 약 **45%**의 정확도로 올라섰습니다. 하지만 여전히 일관성은 부족했습니다.
  • 2단계: GRPO (Group Relative Policy Optimization) – "실수를 통해 배우기"
    이것이 비법입니다. AI가 하나의 질문에 대해 8번의 답을 시도한다고 상상해 보세요.

    • 만약 정답을 맞히면, "간식"(보상)을 받습니다.
    • 만약 틀리면, "안 돼"라는 피드백을 받습니다.
    • 그러면 AI는 자신의 8번의 시도를 서로 비교합니다. AI는 학습합니다: "아, 내가 3번째 시도에서 고른 답은 맞았는데, 7번째 시도에서 고른 답은 틀렸구나. 나는 7번째 방식을 선택하지 말아야겠다."
    • 결과: 이 과정은 AI가 단순히 추측하는 것을 멈추고, 올바른 논리에 전념하도록 강제합니다.

4. 결과: 작은 요리사가 거인을 이기다

이 2단계 훈련을 거친 후, 연구진은 상대적으로 작은 AI 모델(Qwen3-8B)을 다시 테스트했습니다.

  • 충격적인 사실: 이 작고 훈련된 모델은 **65%에서 71%**의 정확도를 기록했습니다.
  • 비교: 이 모델은 (30배 더 많은 뇌력을 가진) 훈련되지 않은 거대 모델들을 압도적인 차이(20% 포인트 이상)로 이겼습니다.
  • 비용: 이 모든 훈련을 마치는 데 드는 비용은 50달러 미만이었습니다.

5. 왜 중요한가: 일관성이 핵심이다

연구진은 AI가 어떻게 개선되었는지에 대해 흥รรม스러운 사실을 발견했습니다.

  • 이전: AI는 정답을 가끔 알고 있었지만, 마치 정답을 알면서도 손을 들기를 주저하는 불안한 학생과 같았습니다. 질문의 표현이 약간만 달라져도(방해 요소가 포함되어도) AI는 정답과 오답 사이를 왔다 갔다 했습니다.
  • 이후: 훈련은 AI를 확신에 찬 상태로 만들었습니다. AI는 단순히 정답을 찾는 것에 그치지 않고, 그 정답을 고수하는 법을 배웠습니다.
    • 비유: 학생이 시험을 치는 상황을 생각해 보세요. 이전에는 논리가 동일함에도 불구하고, 어떤 버전의 질문에는 "A"라고 표시하고 다른 버전에는 "B"라고 표시했을 수 있습니다. 훈련 후에는 개념을 진정으로 이해했기 때문에 매번 "A"라고 표시하게 됩니다.

요약

이 논문은 크기가 전부가 아님을 보여줍니다. 복잡한 과학 문제를 해결하기 위해 반드시 가장 크고 비싼 AI가 필요한 것은 아닙니다. 대신, 검증된 사실을 사용하여 AI에게 논리적이고 자신감 있게 추론하는 법을 가르치는 스마트한 훈련 방법이 필요합니다. 이 새로운 "체육관"(MAT-PREF)과 2단계 훈련법을 사용함으로써, 작은 AI는 더 나은 재료를 만드는 법을 알아내는 데 있어 거대 모델들을 능가하는 법을 배웠습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →