← 최신 논문
🤖 AI

Assessing LLMs' mathematical abilities requires understanding the various mechanisms of mathematical creativity

이 논문은 거대언어모델(LLM)의 수학적 능력을 평가하기 위해서는 총체적인 벤치마크를 넘어 구별되고 대체 불가능한 독특한 창의적 기제들에 대한 미묘한 분류 체계로 나아가야 한다고 주장하며, 현재의 모델들이 기존 지식을 재조합하는 데는 뛰어나지만 자동화된 증명 생성이 향상됨에 따라 점점 더 가치가 높아지고 있는 다른 형태의 수학적 발명 능력은 근본적으로 결여하고 있을 수 있음을 시사한다.

원저자: Silvère Gangloff

게시일 2026-08-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Silvère Gangloff

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

수학은 오랫동안 인간 논리의 궁극적인 시험대로 여겨져 왔습니다. 답이 맞거나 틀리거나, 그리고 진리로 향하는 길이 엄격한 증명으로 다져진 영역 말입니다. 수 세기 동안 이 분야는 단순한 경제 구조에 의존해 왔습니다. 즉, 인간의 직관이 패턴이나 가능성을 포착하면, 그 뒤를 이어 그것을 확인하기 위한 고된 검증 작업이 뒤따르는 방식이었습니다. 오늘날 인공지능은 이 방정식의 두 번째 절반을 정복하기 시작했습니다. 현대의 컴퓨터 시스템은 이제 인간의 능력을 훨씬 뛰어넘는 속도와 규모로 수학적 증명을 생성하고 검증할 수 있게 되었으며, 한때 희소했던 자원이었던 검증을 압도적인 풍요의 상태로 바꾸어 놓았습니다. 이러한 변화는 더 어렵고 새로운 질문을 던집니다. 만약 기계가 이토록 쉽게 무언가를 증명할 수 있다면, 수학의 진정한 가치는 어디에 있는가 하는 점입니다. 그 답은 증명 자체가 아니라, 전체 과정을 시작하는 불꽃, 즉 수학자가 새로운 아이디어, 새로운 개념, 혹은 세상을 보는 새로운 방식을 발명해 내는 그 순간에 있습니다.

실베르 강글로프(Silvère Gangloff)의 최근 논문은 바로 이 불꽃을 조사하며, 인공지능이 진정으로 수학적 아이디어를 발명할 수 있는지, 아니면 단지 기존의 것들을 재배열하는 것에 불과한지를 묻습니다. 저자는 우리가 잘못된 질문을 던져왔다고 주장합니다. '수학적 창의성'을 컴퓨터가 가지고 있거나 결여한 하나의 단일한 기술으로 취급하는 대신, 이 논문은 그것이 사실 서로 관련 없는 별개의 메커니즘들의 집합이라고 제안합니다. 어떤 메커니즘은 수학자들이 작업하는 방식을 관찰하고 그 습관을 공식적인 규칙으로 전환하는 것을 포함합니다. 다른 것들은 열의 흐름과 같이 물리 세계에서 발견된 구조를 가져와 추상적인 퍼즐을 푸는 데 재용도화하는 것을 포함합니다. 또한 특정하고 고집스러운 문제를 해결하기 위해 그 문제를 깨뜨리기 위한 새로운 도구를 발명하는 작업도 있으며, 이전에 한 번도 대화한 적 없는 두 수학 분야를 연결하는 드물고 고차원적인 행위도 있습니다. 이 논문은 이것들이 단순히 같은 것의 다른 맛이 아니라, 서로 다른 종류의 기계 장치를 필요로 하는 근본적으로 다른 유형의 사고라고 제 proposes 합니다.

이 연구의 핵심 발견은 현재의 인공지능 시스템이 일부 모드에는 매우 뛰어나지만, 아무리 강력해지더라도 다른 모드들은 수행할 수 없을 가능성이 높다는 것입니다. 우리가 현재 보유한 시스템은 기존의 조각들을 재조합하는 방식으로 작동합니다. 이들은 자신이 읽었던 어떤 두 사실이라도 즉시 찾아내어 꿰맬 수 있는 숙련된 사서와 같습니다. 이 덕분에 이들은 알려진 유형의 문제에 대한 구체적인 해결책을 찾거나 증명이 규칙을 따르는지 확인하는 데 탁월합니다. 그러나 이 논문은 컴퓨터가 자신의 학습 데이터에 전례가 없는 완전히 새로운 유형의 대상이나 사고방식을 발명하라는 요구를 받을 때 단단한 벽에 부딪힌다고 제안합니다. 예를 들어, 컴퓨터는 수백만 개의 기존 수학적 구조를 검색하여 특정 제약 조건에 맞는 것을 찾아낼 수는 있지만, 인간의 계산 관행을 관찰하고 그 관행 자체가 연구되어야 할 새로운 수학적 대상이 되어야 한다고 스스로 결정할 수는 없습니다. 이는 단순히 속도의 차이가 아니라 종류의 차이입니다. 기계는 새로운 원형(primitive)을 발명하는 데 느린 것이 아니라, 무엇을 발명할 가치가 있는지 선택하는 메커니즘이 없기 때문에 구조적으로 불가능한 것입니다.

저자는 수학이 실제로 어떻게 발전해 왔는지를 살펴봄으로써 이 견해를 뒷받키합니다. 한 유명한 사례에서, 수학자 앨런 튜링은 단순히 문제를 해결한 것이 아니라, 규칙서를 따르는 인간의 행위를 관찰하고 그 행위 자체를 새로운 이론의 주제로 삼기로 결정했습니다. 또 다른 사례에서, 물리학자 콜모고로프는 열과 에너지를 다루는 열역학의 개념을 가져와 추상적인 도형에 관한 문제를 해결하기 위해 순수 수학에 적용했습니다. 이것들은 알려진 퍼즐에서 빠진 조각을 찾는 과정이 아니었습니다. 그것들은 퍼즐 자체를 만드는 행위였습니다. 이 논문은 고정된 움직임의 라이브러리를 검색하는 데 의존하는 현재의 인공지능은 이를 복제할 수 없다고 주장합니다. 기계는 조각의 모양이 이미 정의되어 있다면 그 빠진 조각을 찾을 수는 있지만, 존재한 적 없는 새로운 모양을 상상할 수는 없습니다.

이러한 구분은 인공지능의 과학적 미래를 어떻게 판단해야 하는지에 대해 심오한 시사점을 줍니다. 만약 우리가 인공지능의 성공을 얼마나 많은 증명을 생성할 수 있는지, 혹은 표준 테스트 문제를 얼마나 잘 해결하는지로 계속 측정한다면, 우리는 잘못된 것을 측정하고 있는 것입니다. 우리는 기계가 이미 잘하고 있는 일을 하는 것에 보상을 주는 동시에, 인간의 발전을 실제로 이끄는 일은 무시하고 있습니다. 이 논문은 증명 생성이 저렴하고 자동화됨에 따라, 수학의 진정한 가치가 이러한 더 어려운 형태의 발명으로 이동할 것이라고 경고합니다. 즉, 새로운 관행을 공식화하는 성찰적 행위, 다른 분야의 아이디어를 가져오는 유추적 도약, 그리고 완전히 새로운 개념을 만들어내는 깊고 목표 지향적인 창조로 말입니다. 만약 우리가 이러한 시스템을 평가하는 방식을 바꾸지 않는다면, 우리는 정답이지만 흥미롭지 않은 결과물의 홍수를 만들면서도, 진정으로 변혁적인 이해의 도약은 손에 닿지 않는 곳에 머물게 할 위험이 있습니다.

이 연구는 인공지능이 결코 이러한 창의적 행위를 수행할 수 없다고 주장하는 것이 아닙니다. 그러한 행위가 일어나기 위해서는, 단순히 문장에서 다음 단어를 예측하는 것이 아니라 세상과 상호작용하여 근거 있는 이해를 형성할 수 있는 시스템을 개발하는 등 근본적인 기술적 변화가 필요하다고 제안합니다. 그때까지, 이 논문은 결론적으로, 우리는 기존의 아이디어를 재조합하는 능력과 새로운 것을 창조하는 능력을 혼동하지 않도록 주의해야 한다고 말합니다. 수학적 발견의 미래는 우리의 컴퓨터가 얼마나 빨리 계산할 수 있느냐보다, 무엇을 발명할 가치가 있는지 아는 기계를 우리가 구축할 수 있느냐에 달려 있을지도 모릅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →