← 최신 논문
🤖 machine learning

An Information-Theoretic Definition for Open-Ended Learning

이 논문은 보상 획득에 필요한 정보를 정량화하기 위해 "비트 등가(bit-equivalent)" 개념에 기반한 개방형 학습의 정보 이론적 정의를 도입하며, 이 지표에서의 선형적 성장이 고전적 밴딧(bandit)과 개방형 환경을 구분한다는 것을 입증하고, 이러한 학습을 달성하는 알고리즘을 제시한다.

원저자: Wanqiao Xu, Yifan Zhu, Benjamin Van Roy

게시일 2026-06-09
📖 5 분 읽기🧠 심층 분석

원저자: Wanqiao Xu, Yifan Zhu, Benjamin Van Roy

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 비디오 게임을 플레이하고 있다고 상상해 보세요. 일반적인 게임에는 최종 보스, 최고 점수, 그리고 명확한 승리 경로가 있습니다. 보스를 물리치고 나면 게임은 "해결(solved)"됩니다. 더 이상 배울 것이 없기 때문에 더 잘해질 방법도 없습니다.

이제 다른 종류의 게임을 상상해 보세요. 이 게임은 플레이하면 할수록 새로운 레벨, 새로운 메커니즘, 그리고 이전에는 상상조차 할 수 없었던 새로운 도전 과제들을 드러냅니다. 게임은 끝나지 않으며, 당신은 결코 성장을 멈추지 않습니다. 이것이 저자들이 말하는 **개방형 학습(Open-Ended Learning)**입니다.

Xu, Zhu, 그리고 Van Roy의 논문은 매우 까다로운 질문에 답하고자 합니다: 우리는 AI가 정말로 끝나지 않는 게임을 하고 있는 것인지, 아니면 그저 아주 길고 지루한 게임을 하고 있는 것인지 어떻게 알 수 있을까요?

다음은 이들의 아이디어를 쉬운 비유를 사용하여 정리한 내용입니다.

1. 문제점: "새로움(Novelty)"만으로는 부족하다

이전에는 환경이 AI에게 새롭고, 기이하며, 흥미로운 것들을 계속 제공한다면 그 환경이 "개방형"이라고 생각했습니다. 저자들은 이렇게 말합니다. "잠깐만요, 그건 아닙니다."

로봇이 계속해서 무작위로 이상한 그림들을 그려낸다고 상상해 보세요. 그 그림들은 모두 "새롭고(novel)" 당신은 그것들을 인식하는 법을 "학습"할 수 있습니다. 하지만 로봇이 실제로 그림을 더 잘 그리게 되었을까요? 아닙니다. 그저 소음을 만들어내고 있을 뿐입니다.

저자들은 진정한 개방형이란 단순히 새로운 것을 만드는 것이 아니라, 더 잘하기 위해 끊임없이 새로운 정보를 배워야 하는 것이라고 주장합니다. 만약 새로운 것을 배우지 않고도 높은 점수를 얻을 수 있다면, 그 게임은 개방형이 아닙니다.

2. 새로운 도구: "비트 등가치(Bit-Equivalent)"

이를 측정하기 위해 저자들은 비트 등가치라는 새로운 개념을 발명했습니다.

"비트"를 정보의 화폐라고 생각해 보세요.

  • 개념: 보상의 "비트 등가치"란 특정 보상을 얻기 위해 세상을 이해하는 데 필요한 최소한의 정보량입니다.
  • 비유: 당신이 숨겨진 보물을 찾으려고 한다고 상상해 보세요.
    • 만약 보물이 인도 위에 놓인 1달러 지폐라면, 그것을 찾기 위해 필요한 정보는 0 비트입니다. 그냥 아래를 내려다보면 됩니다.
    • 만약 보물이 복잡한 지도가 있는 거대한 동굴 속에 숨겨진 다이아몬드라면, 그것을 찾기 위해 많은 비트의 정보(지도, 구조, 단서 등)가 필요합니다.

저자들은 AI가 더 많은 보상을 얻기 위해 지속적으로 더 많은 정보(비트)를 계속해서 수집해야만 하는 환경을 **개방형(Open-Ended)**이라고 정의합니다. 만약 AI가 새로운 정보를 배우지 않고도 계속해서 보상을 얻을 수 있다면, 그 환경은 "닫힌(closed)" 환경입니다.

3. 테스트: 기존 게임들이 실패하는 이유

저자들은 이 정의를 "클래식" AI 게임(밴딧 환경이라 불리는)에 테스트했습니다. 그 결과, 거의 모든 게임이 개방형 테스트에서 실패한다는 것을 발견했습니다.

  • 유한한 게임 (Finite-Armed Bandit): 10개의 레버가 있는 슬롯머신을 상상해 보세요. 어떤 레버가 가장 많이 보상을 주는지 파악하고 나면, 당신은 그 레버만 계속 당기게 됩니다. 그러면 학습은 멈춥니다. "비트 등가치"의 증가도 멈춥니다.
  • 무한한 게임 (Infinite-Armed Bandit): 레버가 무한히 많은 슬롯머신이 있지만, 각 레버가 서로 완전히 무작위이고 관련이 없다고 상상해 보세요. 당신은 매번 새로운 레버를 당겨서 새로운 보상을 얻을 수 있지만, 어떤 "패턴"을 배우지는 못합니다. 당신은 기계에 대한 더 깊은 이해를 쌓고 있지 않습니다. 당신이 얻은 정보는 장기적으로 더 나은 보상을 얻는 데 도움이 되지 않습니다.

두 경우 모두, AI는 더 배우지 않고서는 더 잘해질 수 없는 벽에 부딪히지만, 환경은 그러한 지속적인 학습을 허용하지 않습니다.

4. 해결책: "탐욕스러운(Insatiable)" 게임

그 후 저자들은 새로운 맞춤형 게임인 **탐욕스러운 선형 밴딧(Insatiable Linear Bandit)**을 만들었습니다.

  • 설정: 거대하고 무한한 전등 스위치 행을 상상해 보세요. 각 스위치는 당신의 점수에 아주 작은 영향을 미칩니다. 어떤 스위치는 고장 나서 점수를 깎고, 어떤 스위치는 점수를 높여줍니다.
  • 함정: 당신은 어떤 스위치가 좋은지 모릅니다. 당신은 직접 스위치를 조작해 보아야만 알 수 있습니다.
  • 작동 원리: 행이 무한하기 때문에, 항상 아직 탐색되지 않은 새로운 구역의 스위치들이 존재하며, 그곳에 좋은 스위치들이 있을 수 있습니다. 더 높은 점수를 얻으려면, 당신은 반드시 더 많은 스위치를 조작하고 어떤 것이 효과적인지에 대한 패턴을 계속 학습해야만 합니다. 당신은 결코 이 게임을 "해결"할 수 없습니다. 왜냐하면 게임이 무한히 깊기 때문입니다.

5. 전략: "절단된 톰슨 샘플링(Truncated Thompson Sampling)"

저자들은 또한 AI에게 이 새로운 게임을 플레이하는 법을 가르치려 했습니다. 그들은 표준적인 AI 전략들이 실패한다는 것을 발견했습니다.

  • 너무 탐욕스러운 경우 (Too greedy): 만약 AI가 무한한 행 전체를 한꺼번에 배우려고 시도한다면, 압도되어 버리고 점수에 타격을 주는 실수를 저지르게 됩니다.
  • 너무 작은 경우 (Too small): 만약 AI가 처음 10개의 스위치만 보고 나머지 스위치들은 무시한다면, 얼마 지나지 않아 성장이 멈추게 됩니다.

승리하는 전략: 저자들은 **절단된 톰슨 샘플링(Truncated Thompson Sampling, TTS)**이라는 방법을 만들었습니다.

  • 비유: 당신이 방대하고 무한한 백과사전을 읽고 있다고 상상해 보세요.
    • 하루 만에 책 전체를 다 읽으려 하지 마세요 (그러면 실패할 것입니다).
    • 첫 페이지를 영원히 읽기만 하지 마세요 (그러면 새로운 것을 배울 수 없습니다).
    • TTS 방식: 첫 번째 장을 읽으세요. 숙달하세요. 그다음 두 번째 장으로 넘어가세요. 그다음 세 번째 장으로 가세요. 당신은 학습 곡선보다 앞서 나가기 위해 딱 적당한 만큼 "읽기 창(reading window)"을 계속 확장해 나갑니다.

학습하려는 범위를 천천히 확장함으로써, AI는 계속해서 새로운 "좋은 스위치"를 찾아낼 수 있고, 점수(그리고 그가 보유한 정보)는 선형적으로 계속 성장할 수 있습니다.

요약

이 논문의 주장은 다음과 같습니다:

  1. **진정한 개방형(True Open-Endedness)**이란, 더 잘하기 위해서 반드시 일정한 속도로 새로운 정보를 계속 배워야만 하는 환경을 의미한다.
  2. 현재 대부분의 AI 게임은 언젠가 보상을 얻기 위해 더 이상 배울 필요가 없어지기 때문에 개방형이 아니다.
  3. 그들은 새로운 게임(Insatiable Linear Bandit)을 구축했으며, 여기서는 더 잘하기 위해 반드시 계속 배워야 한다.
  4. 그들은 새로운 AI 전략(Truncated Thompson Sampling)을 구축했으며, 이는 지식의 범위를 서서히 확장함으로써 이 게임을 성공적으로 수행하여, 적절한 조건 하에서 개방형 학습이 가능하다는 것을 증명했다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →