← 최신 논문
🤖 AI

COMPOSITE-Stem

이 논문은 박사급 연구자들이 물리학, 생물학, 화학, 수학 분야의 70 가지 과제로 구성된 COMPOSITE-STEM 벤치마크를 제안하여, 기존 평가의 한계를 극복하고 AI 에이전트의 과학적 발견 가속화 능력을 정밀하게 측정할 수 있는 새로운 기준을 마련했습니다.

원저자: Kyle Waters, Lucas Nuzzi, Tadhg Looram, Alessandro Tomasiello, Ariel Ghislain Kemogne Kamdoum, Bikun Li, Damien Sileo, Egor Kretov, Francesco Fournier-Facio, Georgios Soloupis, Haile Kassahun, Hew Wol
게시일 2026-04-14
📖 3 분 읽기☕ 가벼운 읽기

원저자: Kyle Waters, Lucas Nuzzi, Tadhg Looram, Alessandro Tomasiello, Ariel Ghislain Kemogne Kamdoum, Bikun Li, Damien Sileo, Egor Kretov, Francesco Fournier-Facio, Georgios Soloupis, Haile Kassahun, Hew Wolff, Jiaqi Cai, Lianghui Li, Marc Roth, Mohinder Naiya, Naixu Guo, Qicheng Tang, Richard Wheeler, Samuele Sala, Serguei Popov, Steven Dillman, Yuqi Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"AI 가 이제 과학자처럼 일할 수 있을까?"**라는 질문에 답하기 위해 만들어진 새로운 시험지, COMPOSITE-STEM에 대한 이야기입니다.

기존의 AI 시험들은 "객관식 문제를 얼마나 잘 맞췄나?"를 보는 수준이었다면, 이 새로운 시험지는 **"실제 실험실에서 복잡한 문제를 직접 해결해 낼 수 있는가?"**를 평가합니다.

이 내용을 누구나 쉽게 이해할 수 있도록 비유를 섞어 설명해 드릴게요.


1. 왜 이 시험이 필요할까요? (기존 시험의 한계)

과거의 AI 시험 (예: GPQA) 은 마치 고등학교 수학 문제집과 같았습니다. "이 공식에 숫자를 넣으면 답이 5 가 나오나요?"라고 묻는 식이었죠. 그런데 AI 가 너무 똑똑해져서, 이 문제집을 다 외워버렸거나 (데이터 오염), 단순히 정답만 맞추는 데는 능숙해졌습니다.

하지만 현실의 과학 연구는 다릅니다. 실험실로 들어가서 장비를 고르고, 데이터를 분석하고, 예상치 못한 오류를 수정하며 결과물을 만들어내는 과정이 중요하죠.

COMPOSITE-STEM은 바로 이 **'실전 능력'**을 보기 위해 만들어졌습니다. 70 개의 난이도 높은 과학 문제 (물리, 화학, 생물, 수학) 를 준비했는데, 이건 단순히 답을 고르는 게 아니라 컴퓨터 터미널 (명령어 창) 에서 직접 코드를 짜고, 도구를 설치하고, 실험을 시뮬레이션해야만 풀 수 있는 문제들입니다.

2. 시험은 어떻게 진행될까요? (실전 시뮬레이션)

이 시험은 마치 AI 에게 '가상의 실험실'을 빌려주는 것과 같습니다.

  • 환경: AI 는 가상의 실험실 (샌드박스) 에 투입됩니다. 여기에는 필요한 과학 도구 (파이썬 라이브러리 등) 가 기본적으로 설치되어 있지 않습니다.
  • 과제: "이 분자의 구조를 분석해 주세요"라고 하면, AI 는 직접 rdkit 같은 도구를 설치하고, 데이터를 불러와서 분석해야 합니다.
  • 참고 자료: 어떤 문제는 X-ray 사진이나 미세구조 이미지 같은 참고 자료도 주어집니다. AI 는 이 이미지를 보고 해석해야 합니다.

3. 채점은 누가, 어떻게 할까요? (AI 심판단)

이 시험의 가장 혁신적인 점은 채점 방식입니다.

  • 기존 방식: 정답이 "350"인데 AI 가 "350"을 쓰면 O, "351"이면 X. (너무 딱딱함)
  • COMPOSITE-STEM 방식: **전문가들이 만든 '채점 기준표 (루브릭)'**를 사용합니다.
    • 예: "분자 구조를 올바르게 해석했는가?", "올바른 도구를 사용했는가?", "논리 흐름이 자연스러운가?"
    • 이 기준을 **5 명의 다른 AI 심판단 (LLM Jury)**이 함께 봅니다. 만약 5 명 중 3 명 이상이 "부분적으로 맞다"고 하면 점수를 줍니다.
    • 마치 논문 심사처럼, 정답이 완벽하지 않아도 중요한 과정과 논리를 인정해 주는 유연한 채점입니다.

4. 결과는 어땠나요? (AI 의 실력)

최고 수준의 최신 AI 4 개 모델을 이 시험에 풀어보게 했더니 결과는 생각보다 처참했습니다.

  • 성적표: 가장 잘한 모델 (Claude Opus) 이도 전체 70 문제 중 21% 만 통과했습니다. (약 15 문제)
  • 실패 원인:
    • 도구 사용 실패: 필요한 과학 도구를 설치하지 못하거나, 설치 방법을 몰라 포기하는 경우가 많았습니다.
    • 지나친 자신감: 도구가 없으면 직접 코드를 짜서 우회하려다 오히려 더 큰 오류를 범했습니다. (예: 화학 분자 분석을 위해 직접 코드를 짜려다 틀린 답을 낸 경우)
    • 시간 부족: 10 번의 시도 (턴) 안에 문제를 해결하지 못해 시간 초과로 실패했습니다.

비유하자면:
최고의 천재 학생 (AI) 이 실험실에 들어갔는데, 장비 사용법을 몰라서 (도구 설치 실패) 실험을 시작도 못 하거나, 임시로 만든 엉터리 도구로 실험을 하다가 실패한 셈입니다.

5. 이 연구의 의미는 무엇일까요?

이 논문은 **"AI 가 아직 과학자의 조수 (어시스턴트) 로서 완전히 신뢰할 수준은 아니다"**라고 경고하면서도, **"이제부터는 이런 실전 능력을 키우는 방향으로 발전해야 한다"**는 방향을 제시합니다.

  • 열린 장: 이 70 개의 문제는 모두 공개되었습니다. 다른 연구자들이 AI 를 더 훈련시키고, 이 시험지를 통해 AI 의 실력을 검증할 수 있도록요.
  • 미래: 앞으로 AI 가 과학 연구의 속도를 획기적으로 높일 수 있으려면, 단순히 지식을 암기하는 것을 넘어 실제 실험실에서 문제를 해결하는 '손발'을 길러야 한다는 메시지입니다.

요약

COMPOSITE-STEM은 AI 에게 "지식 테스트"가 아니라 **"실전 생존 테스트"**를 시킨 것입니다. 결과는 아직 초보 수준이지만, 이 시험지를 통해 AI 가 과학 분야에서 진짜 일꾼이 되기 위해 무엇을 더 배워야 하는지 명확하게 보여준 중요한 이정표입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →