← 최신 논문
🤖 AI

Partner Capability Estimation for Task-Agnostic Adaptation in Ad-Hoc Teamwork

이 논문은 자율 에이전트가 사전 훈련이나 작업에 대한 사전 지식 없이도 애드혹(ad-hoc) 팀워크 시나리오에서 숨겨진 작업 불변적 파트너 역량을 신속하게 추정하고 공동 계획을 조정할 수 있게 하는 근사 베이지안 프레임워크인 CE-CM 및 그 다양성 인지 확장형인 CE-CM-Div를 소개한다.

원저자: Peter Tisnikar, Maja Swieczkowska, Benteng Ma, Gerard Canal, Matteo Leonetti

게시일 2026-07-30
📖 4 분 읽기☕ 가벼운 읽기

원저자: Peter Tisnikar, Maja Swieczkowska, Benteng Ma, Gerard Canal, Matteo Leonetti

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 낯선 사람과 함께 완전히 새로운 비디오 게임 속으로 걸어 들어가는 모습을 상상해 보세요. 그 사람이 레벨을 건너뛰는 스피드러너인지, 구석구석을 확인하는 신중한 탐험가인지, 아니면 단순히 점프를 정말 싫어하는 사람인지 당신은 알 수 없습니다. 인공지능의 세계에서 이것을 **애드혹 팀워크(Ad-Hoc Teamwork)**라고 부릅니다. 이는 로봇(또는 AI 에이전트)이 사전 연습이나 공유된 규칙 책 없이도, 한 번도 만난 적 없는 파트너와 협력하도록 만드는 도전 과제입니다. 보통 AI 연구자들은 로봇이 수천 명의 서로 다른 컴퓨터 상대와 연습함으로써 '누구에게나 잘 대응할 수 있도록' 매우 강력한 내성을 갖도록 훈련시키려 합니다. 하지만 이 논문은 다른 질문을 던집니다. 로봇이 단순히 어떻게 반응할지를 암기하는 대신, 파트너가 무엇을 할 수 있는지 실제로 '파악'할 수 있다면 어떨까요? 이것을 댄스 파트너에 비유해 봅시다. 로봇은 단순히 다음 동작을 추측하는 대신, 파트너의 '무브셋(moveset)'—예를 들어, 높이 점프할 수 있는지, 무거운 것을 들 수 있는지—을 배우려고 노력합니다. 일단 파트너의 능력 한계를 알게 되면, 로봇은 두 사람 모두에게 완벽하게 작동하는 댄스 루틴을 계획할 수 있습니다. 설령 완전히 새로운 곡에 맞춰 춤을 추더라도 말이죠.

"Partner Capability Estimation for Task-Agnostic Adaptation in Ad-Hoc Teamwork"라는 제목의 이 논문은 CE-CM(Contextual Models를 통한 능력 추정)이라는 영리한 새로운 방법을 소개합니다. 핵심 아이디어는 로봇이 파트너가 무엇을 '하고 싶어 하는지'를 추측하는 것이 아니라, 파트너가 무엇을 '할 수 있는지'를 파악해야 한다는 것입니다. 저자들은 파트너의 능력을 어떤 게임을 하든 변하지 않는 숨겨진 '초능력(또-는 그 결핍)' 목록으로 취급합니다.

로봇은 다음과 같이 학습합니다. 먼저 로봇은 파트너가 몇 라운드 동안 게임을 플레이하는 것을 관찰합니다. 그런 다음, 로봇은 머릿속으로 시뮬레이션을 돌립니다. "좋아, 만약 내 파트너가 '이러한' 특정 초능력 세트를 가지고 있다면, 지난 라운드에서 어떻게 플레이했을까?"라고 말이죠. 로봇은 자신의 시뮬레이션 결과와 실제로 일어난 일을 비교합니다. 만약 시뮬레이션이 실제 상황과 일치하면, 로봇은 그 초능력 세트를 하나의 가능성으로 유지합니다. 만약 일치하지 않는다면, 그 아이디어를 버립니다. 이 과정을 반복함으로써 로봇은 아주 좋은 추측에 도달할 때까지 목록을 좁혀 나갑니다. 일단 파트너의 한계를 알게 되면, 로봇은 다음 게임을 계획할 때 파트너가 들어갈 수 없는 방을 청소하라고 요청하는 것과 같이 불가능한 일을 요구하지 않도록 주의하며 완벽하게 계획을 세웁니다.

연구진은 이 아이디어를 두 가지 매우 다른 디지털 세계에서 테스트했습니다. 첫 번째는 TidyUP이라는 정리 게임으로, 규칙이 엄격하고 명확했습니다(마치 논리 퍼즐처럼 말이죠). 이 세계에서 로봇은 매우 뛰어난 성능을 보였습니다. 로봇은 파트너가 무엇을 할 수 있고 무엇을 할 수 없는지 빠르게 파악했습니다. 단 몇 번의 게임 만에 로봇은 파트너가 들어갈 수 없는 방을 청소하라고 요청하는 것과 같은 실수를 멈추었습니다. 결과에 따르면 로봇의 협업 능력은 비약적으로 향상되었습니다. 일부 파트너의 경우, '수정 사항'(로봇이 잘못된 계획을 바로잡아야 했던 횟수)이 약 75%에서 5% 미만으로 급감했습니다.

그러나 두 번째 세계인 Overcooked(혼란스러운 요리 시뮬레이션)는 훨씬 더 까다로웠습니다. 주방에서는 샐러드를 만드는 방법이 매우 다양합니다. 토마토를 먼저 썰 수도 있고, 양파를 먼저 썰 수도 있습니다. 둘 다 가능한 방법이죠. 로-봇의 원래 방식인 CE-CM은 만약 파트너가 무언가를 할 수 있다면, 그들이 가장 완벽하고 논리적인 방식으로 행동할 것이라고 가정했습니다. 하지만 실제 사람(그리고 심지어 일부 컴퓨터 파트너)은 무질서합니다. 그들은 단지 그것이 좋아서 이상한 경로를 선택할 수도 있고, 실수를 할 수도 있습니다. 이 혼란스러운 환경에서 로봇은 난관에 봉착했습니다. 로봇은 파트너가 무엇을 '할 수 있는지'는 알았지만, 너무 많은 유효한 옵션이 존재하기 때문에 파트너가 실제로 '무엇을 할지'는 예측할 수 없었습니다.

이를 해결하기 위해 저자들은 업그레이드된 버전인 CE-CM-Div를 만들었습니다. "내 파트너가 행동할 단 하나의 완벽한 방식은 무엇인가?"라고 묻는 대신, 이 새로운 방식은 "내 파트너가 행동할 수 있는 모든 다양한 방식은 무엇인가?"라고 묻습니다. 이 방식은 각 초능력 세트에 대해 수많은 가능한 시나리오를 생성합니다. 파트너가 어떤 행동을 하면, 로봇은 그것이 생성된 시나리오 중 '어느 하나라도' 일치하는지 확인합니다. 이 방식은 실제 인간을 대상으로 테스트했을 때 게임 체인저가 되었습니다. 연구진은 15명의 사람으로부터 225개의 요리 세션을 수집했습니다. 기존 방식은 인간의 예측 불가능성 때문에 인간의 능력을 정확히 추측하는 데 어려움을 겪으며 자주 실패했습니다. 하지만 '다양한 가능성' 접근법을 사용한 CE-CM-Div는 인간의 능력을 훨씬 더 빠르고 정확하게 학습해 냈습니다.

이 논문은 파트너의 한계를 아는 것이 큰 진전이긴 하지만, 모든 상황에 적용되는 마법의 탄환은 아니라는 점을 시사합니다. 만약 파트너가 문제를 해결하는 여러 가지 방법을 가지고 있다면, 그들의 한계를 아는 것만으로는 그들이 어떤 경로를 선택할지 알기에 충분하지 않습니다. 하지만 이러한 다양성과 불확실성을 고려함으로써, 로봇은 훨씬 더 나은 팀 동료가 될 수 있습니다. 저자들은 이 접근 방식—단순히 특정 게임에서 어떻게 행동하는지를 암기하는 것이 아니라, 파트너가 무엇을 '할 수 있는지'에 대한 재사용 가능한 모델을 학습하는 것—이 어떤 작업에서도, 누구와도 협력할 수 있는 AI를 구축하는 유망한 방법이라고 결론지었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →