ALPS: Measuring Valid Creativity in Large Language Models with Mathematical Construction
이 논문은 대규모 언어 모델에게 무작위로 생성된 방정식 법칙에 대한 독창적이고 검증 가능한 수학적 증명이나 구성을 생성하도록 과제를 부여함으로써 모델의 유효한 창의성을 엄격하게 측정하는 새로운 벤치마크인 ALPS를 소개하며, 현재의 모델들이 구성 측면에서 상당한 어려움을 겪고 있고 대부분의 사례가 고급 자동 증명기들에 의해서도 해결되지 않은 채 남아 있다는 점을 밝히고 있다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대 과학의 지형에서 인공지능은 데이터 처리자의 역할을 넘어 발견자의 역할로 발을 내딛기 시작했습니다. 우리는 새로운 화학 화합물을 제안하고, 새로운 재료를 암시하며, 심지어 인간이 아직 고려하지 못한 수학적 추측을 공식화할 수 있는 기계들을 목격하고 있습니다. 이러한 변화는 심오한 질문을 던집니다. 만약 기계가 돌파구처럼 보이는 답을 내놓는다면, 우리는 그것이 진정으로 창의적인 것인지, 아니면 단순히 훈련 과정에서 암기한 것을 교묘하게 반복하는 것인지 어떻게 알 수 있을까요? 과학에서의 진정한 창의성은 두 가지를 요구합니다. 즉, 해결책이 이전에 본 적 없는 독창적이어야 하며, 동시에 실제로 작동하여 당면한 문제를 해결하는 유효성을 갖추어야 합니다. 문제는 이러한 자질을 검증하는 데 있습니다. 많은 분야에서 새로운 아이디어의 타당성을 판단하려면 인간 전문가가 그 결과를 보고 그것이 좋은지 결정해야 하는데, 이는 느리고 주관적인 과정입니다. 답을 확실하게 확인할 수 있는 수학의 경우, 도전 과제는 다릅니다. 문제는 종종 너무 복잡하여 컴퓨터가 단순히 모든 가능성을 검색하여 답을 찾을 수 없으며, 문제 자체가 기계가 이미 학습했을 법한 고정된 집합인 경우가 많습니다.
이러한 딜레마를 해결하기 위해 버지니아 대학교의 연구진은 인공지능을 테스트하는 새로운 방법인 ALPS라는 벤치마크를 개발했습니다. 이 시스템은 기계가 기억력이나 표준적인 절차에 의존하여 풀 수 없는 특정 유형의 수학적 퍼즐을 제시함으로써 '유효한 창의성'을 측정하도록 설계되었습니다. 퍼즐은 일련의 항목들이 어떻게 결합될 수 있는지에 대한 규칙을 기반으로 합니다. 여러 객체의 집합과 그 중 어떤 두 개를 혼합하는 규칙이 있다고 상상해 보십시오. 연구진은 이 객체들이 어떻게 행동해야 하는지를 설명하는 특정한 규칙, 즉 법칙을 생성합니다. 기계의 과제는 두 가지 중 하나를 결정하는 것입니다. 규칙이 너무 제한적이어서 모든 객체를 동일하게 만드는 것인지, 아니면 규칙이 조건을 만족하는 복잡하고 무한한 구조의 객체들을 허용하는 것인지 결정해야 합니다. 만약 기계가 구조가 존재한다고 주장한다면, 그것에 대한 묘사를 구축해야 합니다. 만약 객체들이 동일해야 한다고 주장한다면, 다른 가능성이 존재하지 않음을 증证明해야 합니다. 이 설정의 탁월함은 인간이 결과를 직접 확인할 필요 없이 컴퓨터가 완벽한 정확도로 답을 검증할 수 있다는 점에 있습니다. 또한, 이 시스템은 끝없는 퍼즐을 생성할 수 있어 기계가 이전에 접해보지 못한 문제에 항상 직면하도록 보장합니다.
연구진은 논리적 문제를 해결하기 위해 설계된 특수 컴퓨터 프로그램인 다양한 자동 추론 도구들을 사용하여 이 시스템을 테스트했습니다. 그들은 4,000개 이상의 생성된 법칙들을 대상으로 이 도구들을 실행했습니다. 결과는 극명했습니다. 컴퓨팅 파워를 대폭 늘렸음에도 불구하고, 자동화된 도구들은 아주 적은 부분의 문제만을 해결할 수 있었습니다. 구체적으로, 가장 우수한 증명기들의 8가지 서로 다른 구성 포트폴리오는 단 약 2%의 법칙만을 해결했습니다. 연구진이 컴퓨팅 예산을 20배로 늘렸을 때, 단 몇 개의 추가적인 해결책만을 발견했을 뿐이었으며, 그중 어떤 것도 그들이 찾던 복잡한 구조가 아니라 단지 객체들이 동일해야 한다는 증명뿐이었습니다. 이는 이 문제들을 해결하는 데 있어 장벽이 컴퓨팅 파력의 부족이 아니라, 각 고유한 법칙에 맞는 특정한 맞춤형 구조를 발명해내는 방법의 부재임을 시사합니다. 기계는 스스로부터 적절한 종류의 무한한 구조를 구축하는 방법을 알지 못하는 것입니다.
연구진은 이후 오늘날 사용되는 많은 대화형 도구의 기반이 되는 인공지능인 대규모 언어 모델들을 활용했습니다. 그들은 가장 강력한 추론 모델들에게 동일한 퍼즐과 동일한 증명의 기회를 부여했습니다. 기계가 모든 객체가 동일함을 증명해야 하는 과제 측면에서, 가장 우수한 모델은 더 단순한 문제들에 대해 약 14%의 성공률을 보였습니다. 하지만 기계가 새로운 무한 구조를 구축해야 하는 과제 측면에서 결과는 더욱 명확했습니다. 어떤 모델도 성공하지 못했습니다. 모델들이 구조를 구축하려고 시도했을 때, 그들은 일관되게 두 가지 방식 중 하나로 실패했습니다. 구조가 너무 경직되어 모든 객체를 하나의 점으로 붕괴시켜 복잡한 솔루션을 보여주는 데 실패하거나, 혹은 구조가 너무 느슨하여 그들이 따르려 했던 법칙의 규칙을 준수하지 못하는 것이었습니다. 모든 사례에서 기계는 규칙을 준수하는 것과 새로운 것을 창조하는 것 사이의 균형을 잡지 못했습니다.
연구는 인공지능 시스템이 지시를 따르고 자신의 작업을 검토하는 능력은 향상되고 있지만, 여전히 과학적 발견의 핵심 행위인 '일련의 제약 조건에 부합하는 새로운 구조를 발명하는 것'에는 어려움을 겪고 있다고 결결론짓습니다. 연구진은 퍼즐을 생성하는 생성기와 답을 확인하는 자동 판정기를 포함한 전체 시스템을 공개했습니다. 이를 통해 다른 과학자들이 신선한 문제에 도달하여 고갈되지 않고도 이 모델들을 지속적으로 테스트하고 개선할 수 있도록 했습니다. 이 연구 결과는 과학 분야에서 AI의 앞날이 단순히 더 많은 데이터나 시간을 주는 것이 아니라, 창조와 검증의 루프 속에서 스스로 아이디어를 제안하고 정교화하는 법을 가르치는 것에 달려 있을 수 있음을 시사합니다. 기계가 이러한 맞춤형 솔루션을 안정적으로 구축할 수 있게 될 때까지, 과학적 발견에서 그들의 역할은 정보를 처리하는 단계에서 진정으로 유효하고 독창적인 지식을 생성하는 단계로 넘어가지 못한 채 제한될 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.