Coachable agents for interactive gameplay
이 논문은 비디오 게임과 로보틱스 같은 다양한 도메인에 걸쳐 에이전트가 작업 성능을 유지하면서도 특정 행동 선호도에 적응할 수 있도록, 범용 가치 함수 근사기와 특화된 훈련 기법을 결합하여 실시간으로 사용자가 제어 가능한 "스타일" 수정을 가능하게 하는 프레임워크를 제시한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 아주 똑똑하고 천재적인 비디오 게임 캐릭터나, 승리하도록 훈련된 로봇이 있다고 상상해 보세요. 보통 이러한 AI 시스템은 단 하나의 특정 방식, 즉 가장 빠르고 효율적이며 "완벽한" 방식으로 승리하는 법을 마스터한 엘리트 운동선수와 같습니다. 만약 당신이 그들에게 방을 청소하라고 하면, 그들은 가능한 가장 효율적인 경로로 청소를 할 것입니다. 만약 그들이 레이싱 카를 운전한다면, 매번 완벽한 레이싱 라인을 탈 것입니다.
하지만 만약 당신이 "완벽함"을 원하지 않는다면 어떨까요? 만약 그들이 무모한 데어데블처럼 운전하거나, 아기가 자고 있으니 조용히 방을 청소하거나, 혹은 특정 종류의 마법만을 사용하여 비디오 게임의 보스와 싸우기를 원한다면 어떨까요?
이 논문은 AI 에이전트가 처음부터 다시 학습할 필요 없이, 실시간으로 자신의 스타일을 바꿀 수 있도록 "코칭"받는 새로운 방법을 소개합니다.
이들이 어떻게 이 일을 해냈는지, 쉬운 비유를 들어 설명해 드리겠습니다.
1. 문제점: "한 가지 모델만 아는" 운동선수
표준적인 AI 에이전트를 단 하나의 완벽한 랩(lap)을 암기한 포뮬러 1 드라이버라고 생각해 보세요. 그들은 믿을 수 없을 정도로 빠르지만, 만약 당신이 그들에게 "관광객처럼 운전해 봐"라거나 "공격적으로 운전해 봐"라고 요청한다면, 그들은 방법을 모릅니다. 그들은 오직 승리하기 위한 단 하나의 최적의 방법만을 알고 있습니다. 현실 세계에서 사용자들은 단순히 과업이 "완수되는 것"뿐만 아니라, 그 과업이 "어떻게" 수행되는지에도 관심을 가집니다.
2. 해결책: "스타일 코치"
연구진은 AI가 단 하나의 행동이 아닌, 하나의 **행동 가족(family of behaviors)**을 학습하는 시스템을 구축했습니다. 그들은 이를 "스타일 조건부(Style-Conditioned)" 학습이라고 부릅니다.
인간 코치가 운동선수에게 말하는 상황을 상상해 보세요. 코치는 단순히 "더 빨리 달려"라고 말하는 대신, "빨리 달리되, 팔은 낮게 유지해"라거나 "빨리 달리되, 코너를 넓게 돌아"라고 말합니다. 선수는 주요 과업(달리기)을 수행하면서도, 코치의 지시에 따라 부차적인 움직임(스타일)을 조정하는 법을 배웁니다.
이 논문에서 "코치"는 AI가 플레이를 시작하는 순간 주어지는 일련의 지침입니다. AI에게는 사용자가 행동을 즉각적으로 바꿀 수 있는 "제어 노브(control knob)"(이를 '스타일 벡터'라고 부름)가 있습니다.
3. AI를 가르치는 방법 (훈련 체육관)
AI에게 이러한 스타일을 가르치기 위해, 연구진은 단순히 일반적인 방식으로 플레이하게 두지 않았습니다. 그들은 특별한 훈련 시나리오를 만들었습니다.
- 보상 시스템: 연구진은 AI에게 두 가지 종류의 점수를 주었습니다.
- 과업 점수(Task Points): 경주에서 이기거나, 적을 물리치거나, 앞으로 나아가는 등의 성과에 대한 점수입니다.
- 스타일 점수(Style Points): "특정한 방식"으로 수행했을 때 받는 점수입니다. 예를 들어, "불 화살을 사용하면 추가 점수를 준다"라거나 "연료를 아끼기 위해 천천히 운전하면 추가 점수를 준다"와 같은 방식입니다.
- "범용적인" 두뇌: 그들은 "승리하는 것"이 목표이지만 "어떻게 승리하는가"는 변할 수 있다는 것을 이해할 수 있는 특수한 형태의 AI 두뇌(UVFA라고 불림)를 사용했습니다. 이는 마치 맛있는 스테이크를 만드는 법(과업)을 알면서도, 고객의 요청에 따라 소금, 후추, 또는 트러플 오일로 즉시 양념을 바꿀 수 있는 셰프와 같습니다.
4. 세 가지 테스트 드라이브
팀은 이 "코칭 가능한 에이전트(Coachable Agent)" 프레임워크가 어디서나 작동한다는 것을 증명하기 위해 세 가지 매우 다른 세계에서 테스트를 진행했습니다.
레이싱 카 (그란 투리스모 7):
연구진은 AI가 레이싱 카를 운전하도록 훈련했습니다. 보통의 AI는 가장 빠른 시간을 기록하기 위해 운전합니다. 하지만 이 새로운 시스템을 통해, 그들은 AI에게 "연료를 아끼며 운전하라" 또는 "타이어를 아끼며 운전하라"고 지시할 수 있었습니다.- 결과: AI는 연료 범위를 60%까지 늘리기 위해 더 느리고 조심스럽게 운전하는 법을 배웠으며, 스타일을 위해 코너를 드리프트하며 돌 수도 있었습니다. 또한 다이얼을 돌리는 것만으로도 "공격적으로 운전하라" 또는 "보수적으로 운전하라"고 명령할 수 있었습니다.
비디오 게임 영웅 (호라이즌 포비든 웨스트):
이것이 핵심 테스트였습니다. AI는 거대한 로봇 동물들과 싸우는 영웅 역할을 수행했습니다. 이 게임에는 다양한 무기, 함정, 그리고 원소 능력(불, 얼음, 전기)이 있습니다.- 결과: 연구진은 AI에게 "함정만을 사용하여 싸워라", "불 무기만을 사용하라", 또는 "가장 강력한 무기를 사용하지 마라"고 지시할 수 있었습니다.
- AI는 단순히 명령에 맹목적으로 따르는 것이 아니라 영리하게 행동했습니다. 만약 "얼음"을 사용하라는 지시를 받으면, 적을 얼리기 위해 약한 얼음 무기를 선택한 다음, 적이 얼어붙은 상태에서 마무리하기 위해 강력한 무기로 전환했습니다. AI는 특정 무기를 사용하면서 동시에 특정 원소 효과를 사용하는 것처럼 스타일을 결 조합하는 법을 배웠습니다.
로봇 보행자 (휴머노이드):
연구진은 디지털 로봇이 바닥을 가로질러 걷도록 훈련했습니다.- 결과: 연구진은 로봇에게 "짧은 보폭으로 걷기" 또는 "긴 보폭으로 걷기"를 지시할 수 있었고, 심지(팔의 자세)를 바꾸는 것(예: 쟁반을 들거나 팔을 흔드는 동작)도 가능했습니다. 로봇은 균형을 유지하면서도 이러한 보행 스타일을 즉각적으로 전환할 수 있었습니다.
5. "런타임(실시간)" 제어의 마법
이 논문의 가장 중요한 부분은 사용자가 AI가 새로운 스타일을 배울 때까지 기다릴 필요가 없다는 점입니다. AI는 훈련 과정에서 모든 스타일을 한꺼번에 학습합니다.
사용자가 실제로 플레이하거나 로봇을 사용할 때, 스타일을 실시간으로 선택할 수 있습니다.
- 비유: 음악 플레이어를 상상해 보세요. 보통 다른 장르를 듣기 위해서는 새로운 노래를 다운로드해야 합니다. 하지만 이 시스템에서 AI는 모든 장르를 머릿속에 담고 있는 DJ와 같습니다. 버튼 하나만 누르면, 음악을 멈추지 않고도 "재즈"(차분하고 안전한 운전)에서 "록"(빠르고 공격적인 운전)으로 즉시 전환할 수 있습니다.
요약
이 논문은 우리가 AI 에이전트에게 유연성을 가르칠 수 있음을 보여줍니다. 단순히 정해진 방식대로만 움직이는 경직된 로봇 대신, 이 "코칭 가능한 에이전트"들은 자신의 성격과 전략을 즉석에서 바꿀 수 있습니다. 연료를 아끼는 레이싱 카든, 특정 무기를 사용하는 비디오 게임 영웅이든, 특정 걸음걸이로 걷는 로봇이든, 사용자는 과업이 "완수되는 것"뿐만 아니라 "어떻게" 수행될지를 직접 결정할 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.