← 최신 논문
💬 NLP

NatureBench: Can Coding Agents Match the Published SOTA of Nature-Family Papers?

이 논문은 Nature 계열 출판물에서 유도된 벤치마크인 NatureBench를 소개하며, 현재의 AI 코딩 에이전트들이 실제 과학적 발견 과제에서 기존의 SOTA를 능가하는 데 어려움을 겪고 있으며, 주로 진정한 발명보다는 방법론적 번역을 통해 성공하고 잘못된 방법 선택과 제한된 컴퓨팅 예산으로 인해 실패한다는 점을 밝히고 있습니다.

원저자: Yuru Wang, Lejun Cheng, Yuxin Zuo, Sihang Zeng, Bingxiang He, Che Jiang, Junlin Yang, Yuchong Wang, Kaikai Zhao, Weifeng Huang, Kai Tian, Zhenzhao Yuan, Jincheng Zhong, Weizhi Wang, Ning Ding, Bowen Z
게시일 2026-06-24
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yuru Wang, Lejun Cheng, Yuxin Zuo, Sihang Zeng, Bingxiang He, Che Jiang, Junlin Yang, Yuchong Wang, Kaikai Zhao, Weifeng Huang, Kai Tian, Zhenzhao Yuan, Jincheng Zhong, Weizhi Wang, Ning Ding, Bowen Zhou, Kaiyan Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 규모의, 판돈이 큰 요리 경연 대회를 상상해 보십시오. 심사위원들(연구자들)은 세계에서 가장 명성 있는 과학 잡지(Nature 패밀리 저널들)에서 가져온 90개의 믿기 힘들 정도로 복잡한 레시피가 담긴 요리책을 가지고 있습니다. 이 레시피들은 단순히 "토스트 만드는 법" 같은 것이 아닙니다. "단백질 구조 해체하기"나 "새로운 약물 분자가 어떻게 행동할지 예측하기"와 같이 정교한 요리들입니다.

이 경연의 참가자들은 AI 코딩 에이전트입니다. 즉, 코드를 작성하고 문제를 해결하도록 설계된 똑똑한 컴퓨터 프로그램들입니다.

여기 반전이 있습니다. 참가자들은 원래의 레시피를 볼 수 없습니다. 그들에게는 오직 가공되지 않은 재료(데이터)와 최종 요리가 어떤 맛이 나야 하는지에 대한 설명(목표)만이 주어집니다. 그들의 임무는 원래의 수상작만큼 훌륭하거나, 혹은 그보다 더 나은 요리를 만들어내기 위한 자신만의 방법을 발명하는 것입니다.

이 이야기는 NatureBench에 관한 이야기입니다. AI가 단순히 레시피를 복제하는 수준을 넘어, 실제로 새로운 레시피를 발명할 수 있는지 테스트하기 위해 설계된 새로운 시험대입니다.

문제점: "복사-붙여넣기"의 함정

이 테스트 이전의 많은 AI 벤치마크는 학생에게 수학 문제를 주고 정답지를 준 뒤, 풀이 과정을 보여달라고 하는 것과 같았습니다. 만약 학생이 정답지를 그대로 베꼈다면, 그 학생은 통과한 것으로 간주되었습니다. 하지만 진짜 과학은 복사가 아니라 발견에 관한 것입니다.

NatureBench의 제작자들은 기존의 테스트들이 엉망이라는 점을 깨달았습니다. 때때로 "주방"(컴퓨터 환경)이 고장 나 있거나 재료가 누락되어, AI가 멍청해서 실패한 것인지 아니면 테스트 자체가 불공정했던 것인지 구분할 수 없었습니다.

이를 해결하기 위해 그들은 NatureGym을 구축했습니다. NatureGym은 매우 체계적이고 자동화된 주방 팀이라고 생각하면 됩니다.

  1. 필터링: 그들은 수천 편의 논문을 스캔하여 공정하고, 모든 재료가 준비되어 있으며, 기계가 채점할 수 있는 90개의 논문만을 선별했습니다.
  2. 방화벽: 그들은 AI 주변에 "유리 벽"을 세웠습니다. AI는 재료와 목표는 볼 수 있지만, 원래 셰프의 메모나 우승 요리에 들어간 비밀 소스는 볼 수 없습니다.
  3. 컨테이너: 모든 작업은 각각의 밀봉된 완벽한 작은 주방(컨테이너) 안에 배치되어, AI가 외부 도구나 인터넷을 사용하여 부정행위를 할 수 없도록 했습니다.

경연: AI는 어떻게 했는가?

그들은 90개의 요리를 해결하기 위해 10명의 가장 똑똑한 AI "셰프들"(Claude Opus 4.7, GPT-5.5, Gemini 3.5 등)을 초대했습니다. 그들에게는 엄격한 규칙이 있었습니다: 구글링 금지. 그들은 맨바닥에서 스스로 알아내야 했습니다.

결과는 냉혹했습니다:

  • "그럭저럭 괜찮은 클럽": 가장 뛰어난 AI조차도 원래의 수상 레시피와 동일한 수준의 요리를 만드는 데 약 **48%**의 성공률을 보였습니다.
  • "원작보다 나은 클럽": AI가 원래의 요리보다 더 나은 요리를 만들어낸 경우는 단 **18%**에 불과했습니다.
  • 현실 자각 타임: 나머지 82%의 경우, AI는 원래의 요리보다 못한 요리를 만들었거나 아예 완성하지 못했습니다.

어떻게 성공했는가 (그리고 왜 실패했는가)?

연구진은 AI 셰프들이 어떻게 작동하는지 파악하기 위해 결과를 면밀히 분석했습니다.

성공 전략: "번역의 기술"
AI가 성공했을 때, 그것은 대개 찬란한 새로운 과학적 발견을 해낸 것이 아니었습니다. 대신, 그들은 **방법론적 번역(Methodological Translation)**이라는 기술을 사용했습니다.

  • 비유: 원래의 레시피가 복잡한 프랑스식 수플레(어려운 과학 문제)였다고 가정해 봅시다. AI는 수플레를 만들려고 노력하지 않았습니다. 대신 재료를 보고 이렇게 말했습니다. "어, 이거 내가 할 줄 아는 피자와 비슷하게 생겼는데!" AI는 어려운 과학 문제를 자신이 이미 수만 번 해본 익숙하고 단순한 수학 문제로 바꾸어 버린 것입니다.
  • 성공 사례의 **45%**는 AI가 과학 문제를 단순히 "정답 맞히기" 게임으로 변환했기 때문에 발생했습니다. AI는 새로운 과학을 발명한 것이 아니라, 기존의 기술을 새로운 데이터에 적용했을 뿐입니다.

실패 전략: "잘못된 도구와 시간 부족"
AI가 실패했을 때, 그것은 대개 지시 사항을 이해하지 못해서가 아니었습니다.

  • 잘못된 도구 (45%): AI가 잘못된 "주방 가젯"을 골랐습니다. 거품기가 필요한데 블렌더를 사용하려고 시도한 것입니다. 문제 유형에 근본적으로 맞지 않는 방법을 선택했습니다.
  • 시간/비용 부족 (24%): AI가 요리를 시작했지만, 요리를 완성하는 데 필요한 4시간의 시간 제한이나 컴퓨터 연산 능력(예산)을 다 써버렸습니다.
  • 오해 (드묾): AI가 요리가 무엇이어야 하는지 단순히 이해하지 못한 경우는 매우 드물었습니다.

난이도 수준

모든 레시피가 똑같이 어려운 것은 아니었습니다.

  • 쉬운 요리: "관계적 추론(점 연결하기)"과 "단백질 생물학" 관련 과제들이 AI에게 가장 쉬웠습니다.
  • 어려운 요리: "물리 모델링(물리 시뮬레이션)"과 "분자 설계"가 가장 어려웠습니다.
  • "프랑켄슈타인" 요리: 가장 어려운 과제는 두 가지 다른 분야를 혼합한 것들(예: 생물학과 물리학의 결합)이었습니다. AI는 서로 다른 "요리법"의 지식을 결합하는 데 어려움을 겪었습니다.

핵심 요점

NatureBench는 AI 코딩 에이전트들이 지시를 따르고 버그를 수정하는 데는 매우 능숙해지고 있지만, 아직 진정한 과학적 발명가는 아니다라는 점을 알려줍니다.

그들은 복잡한 과학 문제를 가져와서 "이것에 대한 지름길을 알고 있어!"라고 말하는 데는 탁เยี่ยม합니다. 하지만 문제를 보고 "인간이 아직 생각하지 못한 완전히 새로운 아이디어가 있어!"라고 말하는 데는 아직 미흡합니다.

이 논문은 AI가 진정으로 과학에 기여하기 위해서는, 단순히 승자의 방식을 복사하도록 요구하는 것을 멈추고, AI에게 올바른 도구를 선택하고 코더가 아닌 과학자처럼 생각하는 법을 가르쳐야 한다고 결론짓습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →