← 최신 논문
💬 NLP

Improving Data and Reward Design for Scientific Reasoning in Large Language Models

이 논문은 과학적 추론 능력을 향상시키기 위해 100만 개의 STEM 데이터를 포함한 'Dr. SCI' 데이터셋을 구축하고, 탐색적 SFT, 동적 난이도 커리큘럼, 루브릭 기반 강화학습(RL)을 결합한 새로운 포스트 트레이닝 파이프라인을 제안하여 GPQA 등 주요 벤치마크에서 기존 모델들을 뛰어넘는 성능을 달성했습니다.

원저자: Zijie Chen, Zhenghao Lin, Xiao Liu, Zhenzhong Lan, Yeyun Gong, Peng Cheng

게시일 2026-02-11
📖 2 분 읽기☕ 가벼운 읽기

원저자: Zijie Chen, Zhenghao Lin, Xiao Liu, Zhenzhong Lan, Yeyun Gong, Peng Cheng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎓 제목: AI 과학자 양성 프로젝트, "Dr. SCI"

지금까지의 AI들은 수학 문제나 코딩처럼 '정답이 딱 떨어지는' 문제는 잘 풀었습니다. 하지만 "이 생명체의 진화 과정이 왜 이래?" 같은 주관식 과학 질문에는 엉터리 대답을 하거나, 아는 척만 하는 경우가 많았죠.

이 논문의 연구진은 AI가 진짜 과학자처럼 사고할 수 있도록 세 가지 특별한 교육 시스템을 만들었습니다.

1. 📚 교과서 만들기 (Dr. SCI 데이터셋)

먼저, AI에게 가르칠 아주 좋은 교과서가 필요했습니다. 기존의 데이터들은 너무 쉽거나, 정답이 불분명하거나, 형식이 엉망이었죠.

  • 비유: 기존 교과서가 "사과는 빨갛다" 같은 초등 수준이거나, 정답이 없는 낙서장 같았다면, 연구진은 100만 개의 엄선된 STEM(과학·기술·공학·수학) 문제를 모아 아주 체계적인 '명문대 전공 서적'을 만든 것입니다.
  • 특히, 정답이 딱 정해진 문제와 길게 설명해야 하는 문제를 나누고, 문제마다 **'난이도'**를 매겨서 단계별 학습이 가능하게 했습니다.

2. 🧠 단계별 맞춤형 학습 (3단계 훈련법)

연구진은 AI를 세 단계로 훈련시켰습니다.

① 1단계: "다양한 사고방식 배우기" (Exploration-Expanding SFT)

  • 비유: 수학 문제를 풀 때 한 가지 공식만 쓰는 게 아니라, 기하학적으로도 풀고 대수적으로도 풀어보는 법을 배우는 단계입니다. AI가 나중에 스스로 생각할 때 쓸 수 있는 **'생각의 도구 상자'**를 아주 풍성하게 만들어주는 과정이죠.

② 2단계: "수준별 맞춤 수업" (Dynamic Difficulty Curriculum)

  • 비유: 초등학생에게 미적분을 가르치면 포기하겠죠? 반대로 대학생에게 구구단을 가르치면 지루할 겁니다. AI가 문제를 풀다 실력이 늘면, 실시간으로 조금씩 더 어려운 문제를 내밀어 AI가 항상 '적당히 도전적인' 상태를 유지하게 만듭니다.

③ 3단계: "꼼꼼한 채점 기준표" (SciRubric-Guided RL)

  • 비유: 이게 이 논문의 핵심입니다! 보통 AI는 "정답이 맞았나?"만 보고 점수를 줍니다. 하지만 과학은 과정이 중요하죠.
  • 연구진은 **'채점 기준표(Rubric)'**를 만들었습니다. 예를 들어, "생물학 답안을 채점할 때 ①핵심 용어를 썼는가? ②원인을 논리적으로 설명했는가? ③잘못된 상식을 말하진 않았는가?"를 아주 세밀하게 체크합니다.
  • 단순히 "정답이다/아니다"가 아니라, **"너는 논리는 좋은데 핵심 용어를 빼먹었어"**라고 아주 구체적으로 피드백을 주며 AI를 가르칩니다.

🚀 결과는 어땠을까요?

결과는 놀라웠습니다!
연구진이 만든 이 시스템으로 훈련시킨 AI(Qwen3-4B)는 덩치가 훨씬 큰 다른 유명한 AI들(GPT-4o, o1-mini 등)보다 과학적 추론 능력이 더 뛰어난 모습을 보였습니다. 특히, 정답이 딱 정해지지 않은 '주관식 과학 문제'에서 압도적인 실력을 보여주었죠.

💡 요약하자면...

이 논문은 **"AI에게 단순히 정답만 외우게 하지 말고, 좋은 교과서로, 난이도에 맞춰, 아주 꼼꼼한 채점 기준을 가지고 가르쳐야 진짜 과학자가 된다"**는 것을 증명한 연구입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →