ASH: Agents that Self-Hone via Embodied Learning
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
마치 포켓몬스터나 젤다의 전설처럼 매우 길고 복잡한 비디오 게임을 배우려는데, 설명서도, 선생님도, 어떤 버튼을 눌러야 하는지 알려주는 사람도 없다고 상상해 보세요. 이런 일을 하려는 대부분의 컴퓨터 프로그램은 몇 시간 만에 막히곤 합니다. 왜냐하면 인간이 꼼꼼하게 라벨을 붙인 방대한 데이터나 미리 작성된 규칙에 의존하기 때문입니다.
이 논문은 ASH(Embodied Learning 을 통한 자기 연마 에이전트)라는 새로운 시스템을 소개합니다. ASH 를 스크립트를 따르는 로봇이 아니라, 구글 사용법을 아는 호기심 많은 인간 플레이어로 생각하세요.
ASH 가 작동하는 방식을 간단한 단계로 나누어 설명하면 다음과 같습니다:
1. "막힘" 순간
ASH 가 게임을 시작합니다. 이는 단기 기억 (지난 30 초 동안 일어난 일) 과 장기 기억 (이전에 본 중요한 순간들) 을 가지고 있습니다. 벽에 부딪힐 때까지 게임을 진행하다가, 몬스터를 싸우는 방법을 모르거나 미로에서 어느 길을 가야 할지 모를 때 멈춥니다. 논문의 용어로 말하면 "막히게" 됩니다.
2. "구글 검색"
ASH 가 막히면 포기하지 않습니다. 대신 방금 화면에서 본 것을 바탕으로 인터넷 (구체적으로는 방대한 양의 유튜브 비디오 모음) 으로 나가 다른 사람들이 게임을 하는 모습을 찾습니다. 현재 막힌 순간과 정확히 일치하는 비디오를 검색합니다.
3. "스마트 필터"
인터넷은 잡음으로 가득 차 있습니다. ASH 는 무작위 비디오를 그냥 보는 것이 아니라, 핵심 순간을 찾아내는 특수 도구를 사용합니다. 누군가가 게임을 하는 20 시간 분량의 비디오를 본다고 가정해 보세요. 보스전을 어떻게 치르는지 배우려면 전체를 볼 필요는 없습니다. 그들이 전략을 터득하는 특정 30 초만 보면 됩니다. ASH 는 자동으로 이러한 "하이라이트 릴"을 찾아 장기 기억에 저장합니다.
4. "역공학"
이제 까다로운 부분입니다: ASH 가 찾은 인터넷 비디오는 보통 화면만 보여줄 뿐, 버튼 누름 동작은 보여주지 않습니다. ASH 는 "번역기"(역동역학 모델, Inverse Dynamics Model) 를 가지고 있어 비디오를 보고 "좋아, 이 화면에서 저 화면으로 가려면 플레이어가 'A'를 누른 다음 '위'를 눌러야 했겠군"이라고 추측합니다. 소리가 없는 비디오를 일련의 명령어로 변환하는 것입니다.
5. "자기 개선" 루프
이제 ASH 는 그 새로운 명령어를 받아 연습합니다. 다음에 막혔을 때 무엇을 해야 할지 알 수 있도록 자신의 뇌 (정책) 를 업데이트합니다. 그 후 다시 게임을 합니다. 나중에 다른 문제에서 다시 막히면 전체 과정을 반복합니다: 막히기, 인터넷 검색, 트릭 학습, 그리고 계속 진행하기.
결과: 왜 중요한가
연구진은 ASH 를 두 가지 매우 다른 게임에서 테스트했습니다:
- 포켓몬스터 에메랄드: 모험을 떠나 몬스터를 잡고 전투를 벌이는 전략 게임.
- 젤다의 전설: 미니쉬 캡: 실시간으로 뛰고, 점프하고, 퍼즐을 풀고, 적과 싸우는 액션 게임.
그들은 ASH 를 다른 AI 방법들과 비교했습니다:
- "교과서" 학습자: 이러한 시스템은 미리 라벨이 붙은 방대한 동작 데이터셋에서 학습하려 했습니다. 이전에 보지 못한 새로운 상황에 대처하지 못해 일찍 막혔습니다.
- "천재" 모델: 훈련 없이 답을 추측하려는 거대한 AI 모델들입니다. 이들은 종종 "환각"(사실을 왜곡하거나 만들어냄) 을 일으켜 벽에 부딪히거나 존재하지 않는 캐릭터와 대화하곤 합니다.
- ASH: ASH 는 계속 발전했습니다. 다른 시스템들이 약 6 시간 후에 진전이 멈춘 반면, ASH 는 8 시간 동안 계속 진행하며 전투, 몬스터 포획, 퍼즐 해결 등 새로운 기술을 배웠습니다. 두 게임에서 거의 모든 주요 목표를 달성했습니다.
큰 그림
이 논문은 ASH 가 긴 복잡한 작업을 AI 에게 가르치기 위해 인간이 보상 시스템을 작성하거나 모든 비디오에 라벨을 붙일 필요가 없음을 증명한다고 주장합니다. 대신, AI 에게 막히면 인터넷에서 도움을 찾고, 그로부터 배우는 능력을 부여한다면, 긴 개방형 모험을 스스로 마스터할 수 있습니다.
이는 어린이에게 자전거 타기를 가르칠 때 설명서를 작성하는 대신, 넘어지게 하고 다른 사람이 타는 비디오를 보게 한 뒤 다시 시도하게 하는 것과 같습니다. ASH 는 복잡한 비디오 게임에서 이 루프를 자동으로 성공적으로 수행한 최초의 시스템입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.