← 최신 논문
💻 computer science

Learning Lifted Action Models from Traces with Minimal Information About Actions and States

본 논문은 행동과 상태에 대한 부분적 정보를 가진 추적 데이터로부터 STRIPS+ 행동 도메인을 학습하기 위한 알고리즘과 완전성 결과를 제시하며, 상태 관측성이 전혀 없는 경우부터 특정 상태 술어에 대한 완전 또는 국소 관측성이 있는 경우까지의 시나리오를 고려함으로써 이전의 한계를 극복합니다.

원저자: Jonas Gösgens, Niklas Jansen, Hector Geffner

게시일 2026-05-19
📖 5 분 읽기🧠 심층 분석

원저자: Jonas Gösgens, Niklas Jansen, Hector Geffner

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

복잡한 보드 게임, 예를 들어 체스나 슬라이딩 타일 퍼즐의 규칙을 파악하려고 한다고 상상해 보세요. 하지만 아주 기이한 문제가 있습니다: 보드 자체는 볼 수 없습니다.

플레이어들이 하는 행동만 볼 수 있을 뿐입니다. 어떤 말이 "A"에서 "B"로 이동하거나, 플레이어가 토큰을 집어 올리는 것을 보게 됩니다. 하지만 어떤 말이 이동했는지, 어디서 시작했는지, 혹은 이동 전후에 보드가 어떻게 생겼는지 알 수 없습니다. 일련의 행동들을 관찰하기만 해서 게임의 규칙서를 역공학으로 재구성해 보려는 것입니다.

이것이 논문 "Learning Lifted Action Models from Traces with Minimal Information(최소한의 정보로 트레이스로부터 리프팅된 행동 모델 학습)" 에서 다루는 핵심 과제입니다.

다음은 저자들이 수행한 작업을 간단한 비유를 통해 정리한 것입니다.

문제: "정보 과다"의 함정

과거 컴퓨터 과학자들은 AI 에게 이러한 규칙을 학습시키려 했습니다. 두 가지 주요 접근법이 있었지만, 둘 다 결함이 있었습니다:

  1. "전체 보드" 접근법: AI 에게 보드의 전체 상태 (모든 말의 위치) 와 행동을 제공했습니다.
    • 결함: 현실 세계에서는 전체 보드를 거의 볼 수 없습니다. 또한 규칙이 너무 많은 세부 사항을 요구하는 경우가 많습니다. 예를 들어, 퍼즐에서 타일을 이동시키려면 기존 규칙은 타일의 현재 위치, 새로운 위치, 그리고 빈 공간을 모두 지정해야 했습니다. 하지만 이동할지를 결정하려면 실제로는 "왼쪽으로 이동"이라는 사실만 알면 됩니다. 추가적인 세부 사항은 의사결정자에게는 단지 노이즈일 뿐입니다.
  2. "행동만" 접근법: AI 에게 행동 목록(예: "왼쪽으로 이동", "집어 올리기") 만 제공했습니다.
    • 결함: 보드를 보지 못하면 AI 는 무엇을 이동시켰는지 파악할 수 없었습니다. "왼쪽으로 이동"이 로봇을 움직이는 것인지, 차를 움직이는 것인지, 아니면 상자를 움직이는 것인지 알 수 없었습니다.

해결책: 새로운 언어 (STRIPS+)

저자들은 STRIPS+ 라는 중간 지점을 도입했습니다. 이는 규칙을 작성하는 더 지적인 방법이라고 생각하세요.

구식 방식 (STRIPS) 에서는 규칙이 엄격한 양식처럼 보일 수 있습니다:

Move(Robot, CurrentCell, NextCell)

새로운 방식 (STRIPS+) 에서는 규칙이 더 수수께끼와 같습니다:

Move()

이 규칙은 다음과 같이 말합니다: "만약 셀 안에 로봇이 있고, 오른쪽에 셀이 있다면 이동할 수 있다." 컴퓨터는 어떤 로봇과 어떤 셀이 그 설명에 맞는지 파악해야 합니다. 이는 용의자가 "존 스미스"라는 이름으로 지목되는 것이 아니라, "빨간 모자를 쓴 사람"으로만 묘사된 범죄 사건을 수사하는 탐정 같은 것입니다.

새로운 알고리즘: SIFT+ 와 SYNTH+

이 논문은 정보가 부족할 때 이 수수께끼를 풀 두 가지 새로운 "탐정"(알고리즘) 을 제시합니다.

1. SIFT+(행동 전용 탐정)

  • 하는 일: 보드를 전혀 보지 못한 채 행동 목록만 보고 규칙을 학습합니다.
  • 작동 원리: "Mutex Features(상호 배타적 특징)" 라는 트릭을 사용합니다.
    • 비유: 플레이어가 컵을 집어 올리는 것을 보았다고 가정해 보세요. 컵 자체는 보이지 않지만, 플레이어가 동시에 하나의 컵만 들 수 있다는 것을 알고 있습니다. 플레이어가 컵을 집어 올렸다면, 그들이 들고 있던 컵을 내려놓았을 것입니다.
    • SIFT+ 는 이러한 "상호 배타적" 패턴을 찾습니다. "아, 이 행동이 일어날 때마다 들고 있는 객체에 관해 무언가가 참이어야 하구나"라고 깨닫습니다. 그리고 is_holding(들고 있다) 과 같은 새로운 "술어(개념)"를 만들어 빈 공간을 채웁니다.
  • 결과: 행동 이름에서 거의 모든 세부 사항이 제거되어 있더라도 전체 규칙서를 학습할 수 있습니다.

2. SYNTH+(부분적 시야 탐정)

  • 하는 일: 보드의 일부 부분만 볼 수 있을 때 규칙을 학습합니다.
  • 작동 원리: 새로운 STRIPS+ 언어의 "수수께끼 풀기" 능력과 SIFT+ 의 "발명" 능력을 결합합니다.
    • 비유: 배송 기사를 지켜보고 있다고 상상해 보세요. 기사의 위치 (완전히 관찰 가능한 부분) 는 보일 수 있지만, 트럭 안의 택배는 볼 수 없습니다. 하지만 기사는 한 번에 하나의 택배만 운반할 수 있다는 것을 알고 있습니다.
    • SYNTH+ 는 보이는 위치를 이용해 보이지 않는 택배를 파악합니다. "기사가 문 앞에 있고, 방금 '내려놓았다'고 했다면, 그들이 손에 들고 있던 것은 무엇이었을까?"라고 묻습니다.
  • 반전: 이 논문은 "국소 관찰 가능성 (Local Observability)" 을 도입합니다. 이는 전체 보드를 볼 필요가 없다는 뜻입니다. 현재 행동과 관련된 부분만 보이면 됩니다.
    • 예시: 로봇이 "왼쪽"으로 이동한다면, 로봇 왼쪽의 셀만 보이면 됩니다. 지도 반대편의 셀을 볼 필요는 없습니다. 이렇게 하면 학습이 훨씬 현실적이 됩니다.

"의존성 그래프"(로드맵)

이 탐정들이 함정에 걸려 순환 루프에 빠지지 않도록 하기 위해, 저자들은 의존성 그래프라는 지도를 만들었습니다.

  • 이는 흐름도라고 생각하세요. "규칙 A"를 학습하려면 "사실 B"를 알아야 할 수 있습니다. "사실 B"를 학습하려면 "규칙 C"가 필요할 수 있습니다.
  • 이 논문은 이 흐름도에 순환 루프 (A 가 B 를 필요로 하고, B 가 C 를 필요로 하고, C 가 A 를 필요로 하는 경우) 가 없다면, 알고리즘이 볼 수 있는 것에서 시작해 볼 수 없는 것까지 거꾸로 작업하며 규칙을 단계별로 학습할 수 있음을 증명합니다.

결과: 효과가 있었을까요?

저자들은 Blocksworld(블록 쌓기), Delivery(택배 이동), Sokoban(상자 밀기) 같은 고전 퍼즐에서 이 탐정들을 테스트했습니다.

  • 테스트: 알고리즘에 50% 에서 90% 의 정보가 숨겨진 트레이스를 입력했습니다.
  • 결과:
    • SIFT+ 는 행동 목록만으로 규칙을 성공적으로 학습하여, 패턴을 관찰함으로써 "어떤 블록이 위에 있는지"와 같은 누락된 세부 사항을 복원했습니다.
    • SYNTH+ 는 "보드"가 대부분 숨겨져 있더라도, 중요한 요소들 (예: 에이전트의 위치) 이 보일 경우 규칙을 학습했습니다.
    • 거의 모든 테스트에서 알고리즘은 100% 정확도를 달성하여 숨겨진 규칙서를 정확하게 재구성했습니다.

요약

이 논문은 매우 적은 정보만 주어졌을 때 컴퓨터가 "게임의 규칙"을 학습하도록 가르치는 것에 관한 것입니다.

  • 구식 방식: "여기 보드가 있고, 여기 행동이 있다. 규칙을 학습해라." (너무 많은 정보 필요)
  • 신식 방식: "여기 행동 목록이 있다. 플레이어의 위치는 보일 수 있지만 객체는 볼 수 없다. 규칙을 찾아내라."
  • 혁신: 더 지적인 언어 (STRIPS+) 와 반드시 참이어야 할 사실에 기반하여 누락된 사실을 "발명"하는 교묘한 방법 (Mutex Features) 을 사용하여, AI 는 세계를 완전히 볼 필요 없이 도메인의 완전한 논리를 채워 넣고 학습할 수 있습니다.

이 논문은 완벽한 데이터가 풍부한 매뉴얼이 필요하지 않고, 인간이 다른 사람을 지켜보며 학습하는 방식과 유사하게 자연스럽고 불완전한 관찰로부터 학습할 수 있는 AI 를 만드는 데 중요한 한 걸음이라고 주장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →