Harnessing the Collective Intelligence of AI Agents in the Wild for New Discoveries
이 논문은 자율적인 AI 에이전트들이 공개적인 상호작용과 아이디어 공유를 통해 개방된 수학적 문제들을 협력적으로 해결하는 탈중앙화 플랫폼인 EinsteinArena를 소개하며, 11차원 키싱 수(kissing number) 문제에 대한 개선된 경계값을 포함하여 12개의 새로운 최첨단 성과를 성공적으로 생성해 냈다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대한 24시간 디지털 과학 박람회를 상상해 보세요. 참가자는 인간이 아니라 AI 에이전트들입니다. 이것이 바로 EinsteinArena입니다. Together AI와 스탠퍼드 대학교의 연구진이 만든 이 새로운 플랫폼은, AI가 인간 과학자들처럼 어려운 수학 문제를 해결하기 위해 어떻게 서로 협력할 수 있는지 알아보기 위해 만들어졌습니다.
다음은 이 시스템이 어떻게 작동하는지에 대한 쉬운 설명입니다:
과거의 방식: "외로운 늑대" vs "팀"
과격에 AI가 과학적 문제를 해결하려고 할 때, 대개 외로운 늑대처럼 행동했습니다. 하나의 AI에게 문제가 주어지면, 그 AI는 고립된 상태에서 문제를 풀려고 시도한 뒤 멈췄습니다. 만약 실패한다면, 그 실패는 그대로 사라졌습니다. 만약 부분적인 답을 찾아내더라도 다른 누구도 그것을 보거나 이를 바탕으로 발전시킬 수 없었습니다. 그것은 마치 연구자가 자신의 노트를 절대 공유하지 않고, 다른 이들이 무엇을 시도하고 있는지 전혀 보지 못한 채, 매번 처음부터 다시 시작하는 폐쇄된 방 안에서 작업하는 것과 같았습니다.
EinsteinArena는 규칙을 바꿉니다. 이 과정을 협력적인 커뮤니티로 전환합니다. 마치 다음과 같은 거대한 오픈 소스 워크숍을 생각해보세요:
- 문제: 풀리지 않은 수학 퍼즐 목록(예: 구체를 쌓는 최적의 방법 찾기 또는 특정 숫자 계산하기).
- 점수판: 모든 퍼즐에 대한 현재 최고 정답을 보여주는 실시간 리더보드.
- 채팅방: 에이전트들이 아이디어를 게시하거나, "이걸 시도해 봤는데 실패했어요"라고 말하거나, "왜 이 숫자가 이상한지 아는 분 있나요?"라고 질문할 수 있는 공개 포럼.
- 규칙집: 모든 에이전트는 정답 여부를 확인하는 동일한 "검증기"(심판 스크립트)에 접근할 수 있습니다.
거대한 돌파구: "키싱 넘버(Kissing Number)"
이 논문은 **11차원에서의 "키싱 넘버(Kissing Number)"**라는 문제와 관련된 특정 성공 사례를 강조합니다.
- 비유: 중앙에 있는 오렌지를 중심으로 최대한 많은 오렌지를 겹치지 않게 배치하는 상황을 상상해 보세요. 11차원 공간에서 이것은 매우 어려운 일입니다.
- 역사: 약 40년 동안 인간이나 AI가 할 수 있었던 최선은 582개의 오렌지를 배치하는 것이었습니다. 그러다 2022년, 한 인간이 이를 592로 개선했습니다. 2025년에는 AlphaEvolve라는 AI가 이를 593까지 끌어올렸습니다.
- EinsteinArena의 결과: 2026년 5월, EinsteinArena의 에이전트들은 이 숫자를 604까지 높였습니다.
그들은 어떻게 해냈을까요?
이것은 한 명의 초천재 AI가 "유레카"의 순간을 맞이한 것이 아니었습니다. 그것은 릴레이 경주였습니다:
- 에이전트 A는 지저-분하지만 거의 정답에 가까운 솔루션을 찾아냈지만, 완벽하게 만들지는 못했습니다.
- 에이전트 B는 공개 포럼에서 에이전트 A의 작업물을 보았습니다. 처음부터 다시 시작하는 대신, 에이전트 B는 이렇게 말했습니다. "당신이 이 모양을 시도한 것을 보았습니다. 수학적 구조를 더 매끄럽게 만들기 위해 이 부분을 수정하면 어떨까요?"
- 에이전트 C는 에이전트 B의 숫자 패턴을 발견하고, 그것들이 정수처럼 보인다는 점을 알아차렸습니다. 그들은 지저분한 소수들을 깔끔한 정수로 "스냅(snap)"하여 완벽하고 증명 가능한 솔루션을 만들어냈습니다.
- 에이전트 D는 그 완벽한 솔루션을 가져와서 더 많은 오렌지를 담을 수 있도록 확장했습니다.
논문은 이를 **"집단 지성"**이라고 부릅니다. 에이전트들은 인간 연구자들이 프리프린트(preprint)나 컨퍼런스 노트를 공유하듯 자신들의 "실패한 시도"와 "부분적인 아이디어"를 공유했습니다. 이를 통해 집단은 단일한 등반가가 혼자 하는 것보다 훨씬 빠르게 산 정상에 도달할 수 있었습니다.
"와일드(Wild)" 실험
연구진은 이를 "야생의 AI(AI in the wild)"라고 부릅니다. 왜냐하면 그들은 에이전트들에게 특정한 방식으로 대화하도록 강요하지 않았기 때문입니다. "당신은 리더다, 당신은 추종자다"라고 정해주지 않았습니다. 대신, 그저 플랫폼을 제공하고 그들이 스스로 방법을 찾아내도록 두었습니다.
- 어떤 에이전트는 정답만 제출했습니다.
- 어떤 에이전트는 채팅에서 질문만 던졌습니다.
- 어떤 에이전트는 다른 이들이 왜 실패했는지 분석했습니다.
결과는 어떠했을까요? 플랫폼은 다양한 수학 문제에서 12개의 새로운 "SOTA(State-of-the-Art, 최고 수준)" 결과를 발견했습니다. 가장 유명한 것은 11차원 키싱 넘버로, 593에서 604로 뛰어올랐습니다.
이 연구가 중요한 이유 (논문에 따르면)
논문은 AI가 진정으로 과학을 발전시키기 위해서는 더 나은 '두뇌'뿐만 아니라 인프라가 필요하다고 주장합니다.
- 투명성: "심판"(검증기)이 공개되어 있기 때문에, 에이전트들은 자신의 아이디어를 제출하기 전에 마치 과학자가 실험실에서 시뮬레이션을 돌리는 것처럼 로컬에서 테스트할 수 있습니다.
- 공유 메모리: 플랫폼은 공유 메모리 뱅크 역할을 합니다. 오늘의 에이전트는 3일 전에 발생한 실패로부터 배울 수 있으며, 똑같은 실수를 반복하며 시간을 낭비하지 않을 수 있습니다.
- "블랙박스"의 부재: 이전의 시스템들이 비밀리에 작업했던 것과 달리, 여기서는 모든 단계, 모든 토론, 그리고 모든 부분적인 결과가 눈에 보입니다.
결론
EinsteinArena는 AI 에이전트들에게 서로 공유하고, 경쟁하며, 서로의 작업을 구축할 수 있는 장소를 제공한다면, 혼자 일할 때보다 더 빠르고 더 잘 문제를 해결할 수 있다는 것을 증명합니다. 이것은 단 한 명의 천재 AI에 관한 이야기가 아닙니다. 그것은 매 단계, 모든 실수, 그리고 그 과정에서의 작은 승리로부터 배우는 AI 커뮤니티에 관한 이야기입니다.
참고: 이 논문은 수학적 최적화 문제(모양 쌓기 및 부등식 등)에 엄격히 집중합니다. 이 결과가 의료 진단, 기후 모델링 또는 기타 현실 세계의 응용 분야에 적용된다는 주장은 아직 하지 않습니다. 이는 AI 협업이 통제된 수학적 환경에서 어떻게 작동하는지에 대한 개념 증명(proof-of-concept)입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.