← 최신 논문
🤖 AI

OPINE-World: Programmatic World Modeling with Ontology-error-Prioritized Interactive Exploration

OPINE-World는 가설 생성과 온톨로지 오류 우선순위 탐색을 결합함으로써 픽셀 기반 상호작용으로부터 데이터 효율적이고 재사용 가능한 객체 중심의 프로그래밍 방식 세계 모델을 온라인으로 학습하며, 별도의 게임별 훈련 없이도 도전적인 ARC-AGI-3 벤치마크에서 강력한 성능을 달성하는 LLM 기반 에이전트이다.

원저자: David Courtis, Wenhao Li, Scott Sanner

게시일 2026-07-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: David Courtis, Wenhao Li, Scott Sanner

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 완전히 새로운 비디오 게임 속에 떨어졌다고 상상해 보세요. 당신은 규칙도 모르고, 캐릭터의 이름도 모르며, 심지어 "목표"가 무엇인지조차 모릅니다. 그저 버튼을 눌러보며 어떤 일이 일어나는지 지켜봐야 할 뿐입니다. 대부분의 컴퓨터 프로그램은 보이는 모든 픽셀을 암기하려고 애쓰다가 막혀버리거나, "위" 키를 누르면 캐릭터가 점프한다는 사실을 알아내기 위해 게임을 수천 번 반복해서 플레이해야 할 것입니다.

이 논문은 OPINE-World라는 새로운 종류의 AI 에이전트를 소개합니다. 이 에이전트는 인간과 매우 유사한 방식으로 게임을 학습합니다. 즉, 세상에 대한 정신적 모델(mental model)을 구축하고, 이를 테스트하며, 틀렸을 때 수정하는 방식입니다.

작동 원리는 다음과 같습니다.

1. 두 개의 뇌 시스템

하나의 거대한 뇌가 모든 것을 다 하려고 하는 대신, OPINE-World는 두 명의 협력하는 에이전트(함께 일하는 두 명의 전문가라고 생각하세요)를 사용합니다.

  • 탐험가 (행동 에이전트 - The Explorer): 이 에이전트는 "손" 역할을 합니다. 실시간으로 게임을 플레이합니다. 행동을 시도하고, 어떤 일이 일어나는지 관찰하며, 모든 움직임과 결과에 대한 일기를 작성합니다. 아직 규칙 책을 쓰려고 노력하지 않습니다. 그저 증거를 수집할 뿐입니다.
  • 설계자 (세계 모델 에이전트 - The Architect): 이 에이전트는 "두뇌" 역할을 합니다. 탐험가가 쓴 일기를 읽고, 왜 그런 일이 일어났는지 설명할 수 있는 규칙(컴퓨터 프로그램)을 만들려고 노력합니다. 예를 들어, "바닥에 있을 때 '위'를 누르면 점프한다. 공중에 있으면 떨어진다. 이 규칙을 기록하자"라고 묻는 식입니다.

2. "가설 및 검증" 루프

이 시스템은 단순히 한 번 추측하고 잘 되기를 바라는 것이 아닙니다. **가설 및 검증(Hypothesis and Test)**의 연속적인 루프를 실행합니다.

  1. 설계자가 초안 규칙 책(프로그램)을 작성합니다.
  2. 탐험가가 계속 게임을 플레이합니다.
  3. **검증기(Verifier)**가 설계자의 규칙 책을 탐험가의 일기와 대조하여 확인합니다. "당신의 규칙 책이 일기에 적힌 내용과 정확히 일치하는가?"라고 묻습니다.
    • 만약 규칙 책이 미래를 완벽하게 예측한다면, 그 규칙은 수용됩니다.
    • 만약 규칙 책은 "캐릭터가 점프할 것"이라고 예측했는데 실제로는 캐릭터가 떨어졌다면, 이는 **반례(Counterexample)**가 됩니다. 설계자는 "빨간 깃발"을 받게 되며, 이 특정 실수를 고치기 위해 규칙 책을 다시 쓰고 다시 시도합니다.

3. "온톨로지(Ontology)" 학습 (객체 어휘)

이 부분이 OPINE-World가 특별한 지점입니다. 많은 게임에서는 컴퓨터에게 "이것은 플레이어이고, 이것은 벽이다"라고 알려줍니다. 하지만 OPINE-World는 이런 것을 미리 듣지 못합니다. 처음부터 스스로 알아내야 합니다.

  • 문제: 다리 사진을 보고 있다고 상상해 보세요. 이것은 하나의 커다란 물체일까요, 아니면 여러 개의 작은 판자로 구성된 것일까요? 만약 AI가 이를 잘못 그룹화한다면, 그 규칙은 엉망이 될 것입니다.
  • 해결책: 시스템은 **온톨로지 오류(Ontology Error)**라는 영리한 측정 도구를 사용합니다. 이것을 "혼란 지수(Confusion Meter)"라고 생각하세요.
    • AI가 어떤 물체의 유형(예: "이것이 열쇠인가 문인가?")에 대해 혼란을 느끼면 지수가 올라갑니다.
    • AI가 물체의 동작 방식(예: "어떨 때는 이 버튼이 문을 열지만, 어떨 때는 그렇지 않다")에 대해 혼란을 느끼면 지수가 올라갑니다.
    • 시스템은 이 지수를 사용하여 탐험가가 가장 혼란스러운 부분(데이터가 더 필요한 부분)을 향해 가도록 유도하며, 이를 통해 설계자가 올바른 "객체 어휘"를 파악하도록 돕습니다.

4. "정확한 재현" 규칙

대부분의 AI 시스템은 "대체로 맞으면" 괜찮다고 생각합니다. 하지만 OPINE-World는 완벽주의자입니다. 이 시스템은 **반례 유도 합성(Counterexample-Guided Inductive Synthesis, CEGIS)**이라는 방법을 사용합니다.

  • 설계자의 프로그램은 과거의 모든 움직임을 마지막 픽셀 하나까지 완벽하게 재현할 수 있을 때만 사용될 수 있습니다.
  • 프로그램이 단 한 번이라도 실패하면 거부됩니다. 이는 AI가 규칙을 안다고 생각했을 때, 단순히 패턴을 기반으로 추측하는 것이 아니라 정말로 규칙을 완벽히 이해했음을 보장하기 위함입니다.

5. 결과: 벤치마크 정복

연구진은 AI가 사전 훈련 없이 얼마나 빨리 새로운 기술을 배울 수 있는지 테스트하기 위해 설계된 매우 어려운 벤치마크인 ARC-AGI-3에서 이를 테스트했습니다.

  • 도전 과제: AI는 25개의 서로 다른 게임을 플레이해야 했습니다. 목표도, 객체의 이름도, 규칙도 몰랐습니다.
  • 결과: OPONE-World는 25개 게임 중 20개를 성공적으로 해결했습니다.
  • 효율성: 단순히 해결한 것이 아니라 효율적으로 해결했습니다. 많은 게임에서 인간보다 적은 행동 횟수로 문제를 풀었습니다.
  • 비교: 픽셀을 암기하려는 딥 뉴럴 네트워크나 다른 프로그램 합성 방식들은 동일한 엄격한 조건 하에서 단 하나의 게임도 해결하지 못했습니다.

요약 비유

당신이 말이 통하지 않는 외국에 떨어진 상황을 상상해 보세요.

  • 기존 AI: 나중에 패턴을 인식할 수 있기를 바라며 눈에 보이는 모든 얼굴과 표지판을 외우려고 노력합니다. 그러다 결국 압도당하고 혼란에 빠집니다.
  • OPINE-World:
    1. 탐험가가 돌아다니며 사물을 가리키고, "이것을 누르면 문이 열린다"라고 기록합니다.
    2. 설계자는 그 기록을 바탕으로 사전과 문법책을 씁니다.
    3. 혼란 지수가 알려줍니다. "우리는 아직 저 빨간 물체가 무엇인지 모릅니다. 가서 다시 확인해 봅시다."
    4. 그들은 미래를 완벽하게 예측할 수 있을 때까지 사전을 계속 다듬습니다.
    5. 완벽한 사전을 갖추게 되면, 그들은 추측 없이 목적지로 가는 경로를 계획할 수 있습니다.

논문은 "하는 것(doing)"과 "생각하는 것(thinking)"을 분리하고, 내부 규칙 책의 정확성을 완벽하게 유지함으로써, 이 시스템이 이전 방식들보다 훨씬 빠르고 효율적으로 복잡하고 미지의 환경을 학습할 수 있다고 주장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →