← 최신 논문
🤖 AI

Discovering Multiagent Learning Algorithms with Large Language Models

본 논문은 대규모 언어 모델이 불완전 정보 게임에 대한 경쟁적 다중 에이전트 강화 학습 알고리즘의 발견을 자동화할 수 있음을 입증하고, 이러한 복잡하고 환경에 특화된 발견 결과를 최소한의 알고리즘적 핵심으로 정제하면 일반화 성능이 향상되고 구조적 복잡성이 감소함을 보여줍니다.

원저자: Zun Li, John Schultz, Daniel Hennes, Marc Lanctot

게시일 2026-05-11
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zun Li, John Schultz, Daniel Hennes, Marc Lanctot

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇들에게 포커, 바둑, 혹은 '거짓말 주사위' 게임을 가르치려 한다고 상상해 보세요. 수십 년 동안 인간은 코치 역할을 하며 로봇의 두뇌를 수동으로 조정해 왔습니다. 다양한 수학 공식을 시도하며 그들이 더 나아지기를 바랐죠. 이는 실패와 성공을 반복하는 느리고 지루한 과정이었습니다.

이 논문은 새로운 코칭 방식을 소개합니다. 인간이 코드를 조정하는 대신, 연구자들은 코드를 이해하는 초지능 AI인 **대규모 언어 모델 (LLM)**이 진화 생물학자처럼 행동하도록 했습니다. 이 시스템을 AlphaEvolve라고 부릅니다.

다음은 그들이 발견한 내용을 단순한 개념으로 풀어낸 이야기입니다.

1. 진화 실험실

연구자들은 두 가지 다른 게임 플레이 알고리즘이 있는 디지털 '실험실'을 구축했습니다.

  • CFR (반사실 후회 최소화): 마치 자신이 저지른 모든 실수를 돌아보며 "내가 다른 행동을 했다면 이겼을까?"라고 묻는 학생과 같습니다.
  • PSRO (정책 공간 응답 오라클): 다양한 선수 팀을 구성해 서로 대결시키고, 현재 최강자를 이기기 위해 roster 에 새로운 더 똑똑한 선수들을 끊임없이 추가하는 코치와 같습니다.

LLM 에게는 이러한 알고리즘의 소스 코드가 주어졌고, 다음과 같은 지시를 받았습니다. "이것들을 더 나아지게 만들어라. 로봇들이 저지르는 실수 (취약성) 를 줄여라."

LLM 은 단순히 몇 가지 숫자를 조정하는 데 그치지 않았습니다. 알고리즘의 DNA 를 변이시키듯 코드 자체의 논리를 다시 썼습니다. '적자생존'의 여러 세대를 거친 후, LLM 은 두 가지 새로운 매우 복잡한 알고리즘을 만들어냈습니다.

  • VAD-CFR: 게임이 얼마나 혼란스러운지에 따라 극적으로 적응하는 '후회' 학생의 변형 버전입니다.
  • SHOR-PSRO: 매우 구체적이고 복잡한 방식으로 다양한 전략을 혼합하는 '팀 코치'의 변형 버전입니다.

2. '과도하게 설계된' 함정

이 새로운 AI 가 발견한 알고리즘들을 테스트했을 때, 그 성능은 놀라웠습니다. 훈련된 특정 게임에서 인간이 설계한 챔피언들을 모두 물리쳤습니다.

그러나 연구자들은 수상한 점을 발견했습니다. LLM 은 매우 까다로운 한 명의食客를 위해 특정 요리를 만드는 마스터 셰프처럼 알고리즘을 구축했습니다. 코드는 훈련 게임에서는 완벽하게 작동했지만, 게임의 일반적 규칙을 배우기보다는 훈련 데이터를 암기하는 '과적합'일 가능성이 높은 복잡하고 얽힌 메커니즘으로 가득 차 있었습니다.

이는 마치 LLM 이 특정 경주로만 맞춰진 터보차저, 니트로 시스템, 특수 서스펜션을 갖춘 자동차를 만든 것과 같습니다. 그 경주에서는 승리하겠지만, 울퉁불퉁한 흙길로 가져가면 무너질지도 모릅니다.

3. '절제' 수술 (수사 작업)

무엇이 실제로 이 알고리즘들을 똑똑하게 만들었는지 파악하기 위해 연구자들은 '수술'을 실시했습니다. 어떤 일이 일어나는지 확인하기 위해 코드의 일부를 체계적으로 제거했습니다. 이를 **절제 (ablation)**라고 합니다.

그들은 정교하고 복잡한 부분들 (변동성 추적이나 특정 방식으로 전략을 혼합하는 것 등) 이 대부분 쓸모없는 장신구임을 발견했습니다. 이러한 부분들은 훈련 경주에서 알고리즘이 이기도록 도왔지만, 새로운 게임으로 일반화하는 데는 도움이 되지 않았습니다.

그들이 '화려한 옷'을 벗겨내자, 실제로 엔진을 작동하게 만든 본질적인 뼈대가 드러났습니다.

4. 정제된 승자

가장 필수적이고 근본적인 원리만 남기고 과도하게 복잡해진 코드를 버림으로써, 그들은 두 가지 더 간단하고 새로운 알고리즘을 만들었습니다.

  • WOP-CFR (웜스타트된 낙관적 예측 CFR):

    • 비유: 나쁜 습관을 기록하지 않기 위해 수업 첫 500 일 동안은 노트를 쓰기를 거부하는 학생을 상상해 보세요 (웜스타트). 그 후 노트를 쓰기 시작하지만, '낙관적'입니다. 다음 행위가 실제보다 약간 더 나을 것이라고 가정함으로써 더 빠르게 학습합니다.
    • 결과: 이 단순한 버전은 복잡한 원본보다 실제로 새로운 게임으로 일반화하는 데 더 뛰어났습니다. 새로운 상황에 혼동될 가능성이 적었습니다.
  • PM-PSRO (투사 매칭 PSRO):

    • 비유: 관중의 '소음'을 무시하는 코치를 상상해 보세요. 모든 점수를 하나하나 보는 대신, 전체 팀의 평균에 비해 선수가 어떻게 수행하는지 봅니다. 평균 이하인 선수는 즉시 잊혀집니다. 평균 이상인 선수는 스포트라이트를 받습니다.
    • 결과: 이 간소화된 버전도 복잡한 원본보다 우수했습니다. 이는 LLM 의 복잡한 혼합 논리가 불필요했음을 증명했습니다.

5. 핵심 교훈

이 논문은 LLM 은 아이디어를 제안하는 데 뛰어나지만, 이를 정제하는 데는 인간이 필요하다고 결론 내립니다.

LLM 은 500 개의 움직이는 부품으로 기계를 만드는 창의적인 발명가처럼 행동했습니다. 연구자들은 "이 부품 중 3 개만 있으면 작동하고, 나머지 497 개를 제거하면 더 빠르고 신뢰할 수 있다"는 엔지니어처럼 깨달았습니다.

주장의 요약:
연구자들은 AI 를 활용하여 인간 전문가를 능가하는 새로운 게임 플레이 알고리즘을 발견하는 데 성공했습니다. 그러나 AI 의 raw 발견 결과는 너무 복잡하고 전문화되어 있었습니다. 불필요한 복잡성을 수술적으로 제거함으로써, 그들은 새로운 보지 못한 게임을 처리하는 데 더 뛰어난 더 간단하고 깔끔한 알고리즘을 만들었습니다. 이는 인간이 결과를 단순화하고 해석할 수 있다면 AI 가 과학적 발견을 위한 강력한 도구가 될 수 있음을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →