FindStatBench: Evaluating Large Language Models on Combinatorial Code Synthesis
이 논문은 조합적 코드 합성(combinatorial code synthesis)에 대한 대규모 언어 모델의 성능을 평가하기 위한 엄격한 실행 기반 벤치마크인 FindStatBench을 소개하며, 상위 모델들의 성능은 수렴하지만 긴 프롬프트, 특정 작업에서 예시가 미치는 반직관적인 부정적 영향, 그리고 통계 합성 대비 맵 합성의 내재적 난이도로 인해 정확도가 현저히 저해된다는 점을 밝혀낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 수학자가 되는 법을 가르치려 한다고 상상해 보세요. 단순히 숫자에 대해 대화하는 것을 넘어, 당신은 로봇이 퍼즐을 해결하는 실제 코드를 작성하기를 원합니다. 이것이 바로 **조합론적 코드 합성(combinatorial code synthesis)**의 세계입니다. "조합론(combinatorics)"은 사물을 배열하거나, 섞거나, 세는 방법(예를 들어 블록을 쌓는 방법, 카드 덱을 섞는 방법, 혹은 인접한 두 색이 서로 닿지 않게 지도를 색칠하는 방법 등)을 연구하는 학문입니다. "코드 합성(code synthesis)"은 단순히 AI가 수학을 수행하기 위한 컴퓨터 프로그램을 작성하는 행위를 의미합니다.
오랫동안 우리는 AI를 일반적인 코딩 작업, 예를 들어 "이름 목록을 정렬하는 함수를 작성하라"거나 "웹사이트의 버그를 수정하라"와 같은 과제로 테스트해 왔습니다. 하지만 이러한 테스트는 요리사에게 양파를 써는 법을 묻는 것과 비슷합니다. 그것은 요리사가 칼을 잡는 법을 아는지 보여줄 수는 있지만, 완전히 새로운 레시피를 처음부터 발명할 수 있는지는 보여주지 못합니다. 이 논문은 더 어려운 질문을 던집니다. 만약 당신이 AI에게 엄격하고 추상적인 수학적 규칙과 몇 가지 예시를 준다면, AI가 본 적 없는 입력값에 대해서도 그 규칙을 완벽하게 따르는 프로그램을 작성할 수 있을까요? 이는 레시피를 따르는 로봇과, 요리의 화학적 원리를 이해하여 존재하지 않았던 요리를 발명할 수 있는 로봇의 차이와 같습니다.
위대한 수학 코드 챌린지: FindStatBench
FindStatBench라는 새로운, 매우 강력한 AI 체육관이 등장했습니다. Scale AI의 연구원들이 만든 이 벤치마크는 LLM(대규모 언어 모델)이 순수한 수학적 설명을 작동하는 파이썬 코드로 변환하는 능력을 스트레스 테스트하도록 설계되었습니다. 연구원들은 AI에게 단순한 스크립트를 쓰라고 요청하는 대신, 2,329개의 독특한 수학 퍼즐을 제시했습니다. 이 퍼즐들은 순열(리스트 섞기), 그래프(점과 선으로 이루어진 네트워크), 분할(숫자를 합계로 나누기)과 같은 것들을 위한 "수학적 레시피" 라이브러리인 FindStat 데이터베이스에서 가져온 것입니다.
게임의 규칙은 엄격하고 "폐쇄형(closed-book)"이었습니다. AI는 수학 문제에 대한 설명과 최대 5개의 입출력 예시를 받았습니다. AI는 오직 본 예시들뿐만 아니라 모든 객체를 처리할 수 있는 단 하나의 파이썬 함수 solve(obj)를 작성해야 했습니다. AI는 계산기를 사용할 수 없었고, 인터넷을 검색할 수도 없었으며, 도움을 요청할 수도 없었습니다. 반드시 단 한 번의 시도로 성공해야 했습니다. AI가 단순히 답을 암기하는 것이 아님을 확인하기 위해, 연구원들은 552만 개의 숨겨진 테스트 케이스, 즉 AI가 한 번도 본 적 없는 수백만 개의 수학 문제를 통해 코드를 검증했습니다. 만약 코드가 이 숨겨진 테스트 중 단 하나라도 실패하면 틀린 것으로 간격되었습니다.
결과: 놀라운 동점과 몇몇 기묘한 오류들
결과가 나왔을 때, 그 내용은 매우 흥리학적이고 다소 직관에 반하는 것이었습니다.
1. "대형" 모델과 "소형" 모델이 막상막하이다
가장 비싸고 강력한 "폐쇄형 소스(closed-source)" 모델(기업에 비용을 지불하고 사용하는 모델)이 오픈 소스 모델(누구나 다운로드하여 실행할 수 있는 모델)을 압도할 것이라고 예상할 수 있습니다. 하지만 이 수학 중심의 경기장에서는 그렇지 않았습니다. 최고의 오픈 소스 모델인 gpt-oss-120b는 최고의 폐쇄형 모델인 Claude Sonest 4.6과 거의 동일한 점수를 기록했습니다. 두 모델의 차이는 1% 미만이었습니다. 이는 마치 마라톤을 하는 두 명의 주자와 같습니다. 한 명은 거대 기업의 후원을 받는 화려한 팀을 가졌고, 다른 한 명은 직접 만든 신발을 신은 지역 영웅이지만, 두 주자 모두 정확히 동시에 결승선을 통과했습니다.
더 놀라운 점은, 테스트한 11개 모델의 가장 좋은 답변들을 결합했을 때 전체 점수가 약 10% 정도만 향상되었다는 것입니다. 이는 모든 모델이 유사한 능력의 "천장(ceiling)"에 부딪히고 있음을 시사합니다. 그들은 모두 퍼즐의 똑같은 어려운 부분에서 고전하고 있습니다.
2. 예시가 많아지면 오히려 악영향을 줄 수 있다
여기서 기묘한 현상이 발생합니다. 대부분의 AI 테스트에서는 모델에게 더 많은 예시를 주는 것이 학습에 도움이 됩니다. 하지만 FindStatBench에서는 "전단사(bijections)"라고 불리는 특정 유형의 수학 퍼즐의 경우, 모델에게 5개의 예시를 주는 것이 예시를 0개 주는 것보다 성능을 떨어뜨렸습니다.
당신이 학생에게 종이학 접는 법을 가르친다고 상상해 보세요. 만약 당신이 "종이를 이렇게 접으세요"라고 말한다면, 학생은 전형적이고 완벽한 접기 방법을 기억할 것입니다. 하지만 만약 당신이 누군가 약간 서투르게 접은 예시 5개를 보여준다면, 학생은 혼란을 느껴 완벽한 규칙을 잊어버리고 그 서투른 접기를 따라 하려고 할 수도 있습니다. 이 논문은 일부 고전적인 수학 규칙의 경우, 예시들이 AI의 내부 지식을 "밀어내어(crowded out)", 결국 자신이 본 예시조차 통과하지 못하는 깨진 코드를 작성하게 만든다는 것을 발견했습니다. 이는 "정보는 너무 많지만, 이해는 부족한" 사례입니다.
3. "생각하기"의 함정
또 다른 주요 발견은, 특히 말하기 전에 "생각하도록" 설계된 모델들이 종종 공간이 부족해진다는 것이었습니다. 이러한 모델들은 생성할 수 있는 텍스트 양에 제한이 있습니다. 때때로 이들은 자신의 내부 추론(사고 과정)을 작성하는 데 모든 "예산"을 써버려, 실제 코드를 작성할 차례가 되면 시간이 다 되어버립니다. 이는 마치 학생이 시험 시간 내내 시험이 얼마나 힘든지에 대한 일기를 쓰다가, 정작 문제를 풀 시간은 다 써버리는 것과 같습니다. 연구원들은 단순히 이 모델들에게 생각(그리고 코드)을 쓸 수 있는 공간을 더 많이 주는 것만으로도 이러한 실패의 상당 부분을 해결할 수 있다는 것을 발견했습니다.
4. 어려운 것은 여전히 어렵다
AI는 어떤 작업(무언가를 세거나 단순한 도형을 다루는 일 등)에는 꽤 능숙해졌지만, 다른 작업에서는 완전히 실패했습니다. "집합 분할(set partitions, 항목들을 가능한 모든 방식으로 그룹화하는 것)"과 "이진 트리(binary trees, 계층 구조)"와 관련된 작업의 경우, 모델이 오픈 소스인지 폐쇄형인지와 상관없이 모든 모델의 정확도가 거의 0에 가까웠습니다. 모델의 크기가 얼마나 크든, 비용이 얼마나 들든, 이러한 유형의 구조적 퍼즐은 현재 그들의 손이 닿지 않는 영역인 것으로 보입니다.
이것이 의미하는 바
이 논문은 AI가 "그럴듯한" 수학 코드를 쓰는 데는 매우 능숙해지고 있지만, 정확하고 기호적인 규칙에 있어서는 여전히 취약하다는 결론을 내립니다. 모델들은 정답을 자주 추측할 수는 있지만, 복잡한 구조에 대한 완벽한 논리를 일관되게 도출하는 데는 어려움을 겪습니다.
가장 큰 교훈은 무엇일까요? 비용이 항상 능력을 보장하는 것은 아니라는 점입니다. 이 특정 테스트에서 저렴한 오픈 소스 모델은 가장 비싼 독점 모델만큼이나 잘 수행되었습니다. 그리고 때로는 AI에게 더 많은 예시나 더 많은 "생각할 시간"을 주는 것이 도움이 되지 않을 수 있으며, 오히려 혼란을 줄 수도 있습니다. 연구원들은 AI가 진정으로 수학을 마스터하려면, 단순히 움직임을 암기하는 것이 아니라 게임의 규칙을 이해하는 능력을 키워야 한다고 제안합니다. 현재로서는 AI는 지시를 잘 따를 수는 있지만, 새로운 종류의 기하학을 발명하라고 하면 길을 잃고 마는 유능한 견습생과 같습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.