← 최신 논문
🤖 AI

SciCodePile: A 128GB Corpus and Executable Benchmark for Challenging Scientific Code Generation

이 논문은 현재의 거대 언어 모델들이 과학적 코드 생성에 있어 상당한 어려움을 겪고 있음을 입증하는 동시에, 이 데이터셋을 통한 학습이 모델의 성능을 실질적으로 향상시킨다는 것을 보여주기 위해 128GB 규모의 방대한 과학적 코드 코퍼스인 SciCodePile과 200개의 태스크로 구성된 실행 가능한 벤치마크를 소개한다.

원저자: Weifeng Sun, Ye Fan, Yuchen Chen, Gou Tan, Jieke Shi, Yuan Yidi, Swee Liang Wong, Jonathan Pan, David Lo

게시일 2026-07-22
📖 3 분 읽기☕ 가벼운 읽기

원저자: Weifeng Sun, Ye Fan, Yuchen Chen, Gou Tan, Jieke Shi, Yuan Yidi, Swee Liang Wong, Jonathan Pan, David Lo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 똑똑한 로봇에게 코딩하는 법을 가르치고 있다고 상상해 보세요. 당신은 이미 로봇에게 기초적인 것들을 가르쳤습니다. 간단한 웹사이트를 만드는 법, 계산기를 만드는 법, 혹은 재생 목록을 정리하는 법 같은 것들 말이죠. 로봇은 수백만 권의 책과 웹사이트를 읽었기 때문에 이런 "일반적인" 작업들은 꽤 잘 해냅니다. 하지만 이제 당신은 이 로봇이 정말 어려운 일, 즉 과학자들을 위한 코드를 작성할 수 있는지 확인하고 싶습니다. 우리는 바이러스가 어떻게 퍼지는지 시뮬레이션하거나, 단백질의 접힘을 계산하거나, 새로운 약물의 원자 거동을 모델링하는 코드를 말하는 것입니다. 이것은 "과학적 코드"입니다. 일반적인 코드와 다른 점은 단순히 컴퓨터가 무언가를 수행하게 만드는 것이 아니라, 컴퓨터의 수학과 논리가 실제의 복잡하고 무질서한 자연의 법칙과 일치하도록 만드는 것입니다. 만약 로봇이 문법(syntax)은 맞췄지만 과학적 내용이 틀렸다면, 그 결과는 단순한 버그가 아니라 실험의 실패나 위험한 계산 오류가 됩니다. 큰 질문은 이것입니다. 표준적인 코드는 잘 쓰지만, 과학적 코드는 잘 쓰는 현재의 AI 로봇들이 과학자들의 중대한 업무를 실제로 감당할 수 있을까요?

여기 SCICODEPILE이 등장합니다. 이는 거대하고 전문화된 훈련장이자, 이 AI 로봇들을 위한 엄격한 최종 시험 역할을 하는 새로운 프로젝트입니다. 이 논문의 연구자들은 AI가 과학적 코딩을 다룰 수 있는지 정말로 테스트하려면 두 가지가 필요하다고 결정했습니다. 바로 AI가 공부할 수 있는 방대한 양의 실제 과학 코드가 담긴 라이브러리와, 코드가 단순히 서류상으로 보기 좋은 것을 넘어 실제로 '실행'되고 작동해야 하는 엄격한 테스트입니다.

먼저, 그들은 라이브러리를 구축했습니다. 그들은 단순히 무작위 코드를 긁어모은 것이 아닙니다. 그들은 화학, 생물학, 물리학 및 기타 과학과 관련된 프로젝트를 구체적으로 찾아내어 인터넷상의 37,737개 공개 코드 저장소를 뒤졌습니다. 그들은 불필요한 데이터들을 걸러내어 128GB에 달하는 방대한 과학 코드 컬렉션을 완성했습니다. 이것은 마치 수천 개의 실제 과학 실험실에서 나온 모든 지침서, 모든 설계도, 그리고 모든 코드를 담고 있는 도서관과 같습니다. 그들은 이 라이브러리를 네 가지 방식으로 구성했습니다: 원시 코드 파일, 프로젝트의 기능을 요약한 내용, 특정 함수의 지침, 그리고 문제와 해결책 쌍입니다. 이는 마치 자동차 부품이 가득한 지저집을 엔진, 매뉴얼, 그리고 부품들이 어떻게 결합되는지를 보여주는 도면이 완벽하게 라벨링된 박물관처럼 정리해 놓은 것과 같습니다.

다음으로, 그들은 시험을 만들었습니다. 그들은 200개의 과제로 구성된 벤치마크를 구축했습니다. 여기서 핵심은, 그들이 단순히 AI에게 코드를 쓰게 한 뒤 그것이 인간의 답과 비슷해 보이는지를 체크한 것이 아니라는 점입니다. 그들은 AI의 코드를 "샌드박스(sandbox)"—안전하고 격리된 디지털 놀이터—에 넣고 실제로 실행했습니다. 만약 코드가 충돌하거나, 틀린 숫자를 내놓거나, 테스트를 통과하지 못하면 낙제였습니다. 이는 코드가 실제로 '작동'하는지에 기반한 합격/불합격 테스트였습니다.

그렇다면 로봇들은 어떻게 했을까요? 결과는 약간의 현실 자각 타임이었습니다. 보통 코딩 테스트를 휩쓰는 가장 똑똑한 AI 모델들조차 과학적인 내용 앞에서는 몹시 고전했습니다. "빈칸 채우기" 스타일의 과제에서, 최고의 모델들은 만점의 약 38% 정도밖에 도달하지 못했습니다. 하지만 "작동하게 만들기" 시험에서는 결과가 훨씬 더 처참했습니다. 가장 뛰어난 모델조차 성공률이 **12.30%**에 불과했습니다. 이는 AI가 100개의 과학 코딩 문제를 풀 때 88개를 틀렸다는 뜻입니다. 이는 AI가 '맞아 보이는' 코드를 쓰는 데는 능숙할지 몰라도, 과학적으로 신뢰할 수 있는 코드를 쓰는 데는 아직 갈 길이 멀다는 것을 시사합니다.

연구진은 또한 이 새로운 라이브러리가 로봇을 가르치는 데 실제로 유용하다는 것을 보여주었습니다. 그들이 더 작은 규모의 AI 모델을 가져와서 자신들의 128GB 라이브러리를 공부하게 하자, 모델의 성능이 눈에 띄게 향상되었습니다. 이는 학생에게 단지 몇 장의 플래시 카드를 주는 대신 한 더미의 교과서를 주는 것과 같습니다. 갑자기 그들은 내용을 훨씬 더 잘 이해하게 된 것입니다.

요약하자면, SCICODEPILE은 "이봐, AI, 너 코딩은 잘하지만 아직 과학자가 될 준비는 안 됐어"라고 말하는 거대한 새로운 도구입니다. 이는 그들을 더 잘 가르칠 수 있는 자원을 제공하고, 그들이 실제로 배웠는지 확인할 수 있는 엄격한 테스트를 제공합니다. 이는 우리가 엄청난 진전을 이루고 있기는 하지만, 코드를 쓸 줄 아는 로봇과 진짜 과학을 할 줄 아는 로봇 사이에는 여전히 거대한 간극이 존재한다는 경종을 울립니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →