← 최신 논문
🤖 AI

Adaptive Human-AI Coordination via Hierarchical Action Disentanglement

원저자: Adnan Ahmad, Bahareh Nakisa, Mohammad Naim Rastgoo

게시일 2026-05-26
📖 3 분 읽기☕ 가벼운 읽기

원저자: Adnan Ahmad, Bahareh Nakisa, Mohammad Naim Rastgoo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신과 파트너가 작고 혼란스러운 부엌에서 복잡한 요리를 하려고 한다고 상상해 보세요. 때로는 파트너가 모든 것을 빠르게 집어 드는 속도 마스터일 수도 있고, 다른 때는 신중하고 체계적일 수도 있습니다. 때로는 조리대 주변을 시계 방향으로 움직이는 것을 좋아하고, 때로는 시계 반대 방향으로 움직이기도 합니다. 만약 모든 사람에게 정확히 같은 요리 스타일을 적용하려 한다면, 서로 부딪히거나 재료를 떨어뜨리거나 엉망진창이 될 가능성이 높습니다.

이 논문은 AI(로봇 요리사) 가 어떤 인간 파트너와도 함께 요리하는 법을 학습할 수 있는 새로운 방식을 제시합니다. 저자들은 이 방법을 IAD(Intrinsic Action Disentanglement, 고유 행동 분리) 라고 부릅니다.

간단한 비유를 들어 작동 원리를 설명해 보겠습니다:

문제: "일률적 적용"의 실패

이전 AI 방법들은 오직 하나의 춤만 배운 로봇과 같았습니다. 느린 파트너와 춤추라고 하면 느리게 추려고 했고, 빠른 파트너와 춤추라고 하면 빠르게 추려고 했습니다. 하지만 머릿속에 "춤 동작"이 하나뿐이었기 때문에, 종종 혼란을 겪거나 속도가 느려지거나 아예 아무것도 하지 못하는 상태로 무너져 내렸습니다. 서로 다른 사람들과 맞춰 빠르게 기어를 전환할 수 없었던 것입니다.

해결책: 기술의 "스위스 아미 나이프"

저자들은 AI 가 하나의 거대하고 엉성한 행동을 학습하는 대신, 구별된 기술들의 메뉴를 학습해야 한다고 제안합니다. 마치 스위스 아미 나이프와 같습니다. 나사 드라이버, 칼, 코르크 스크루, 가위가 있습니다. 나사 스크루를 조일 때 코르크 스크루를 사용하지 않죠. 작업에 맞는 올바른 도구를 선택합니다.

IAD 시스템은 함께 작동하는 두 가지 주요 부분으로 구성됩니다:

  1. 매니저 (두뇌): 이는 AI 의 고수준 부분입니다. 매니저는 몇 초 동안 인간 파트너를 관찰하여 그들의 "분위기"를 파악합니다. 인간이 서두르고 있나요? 신중한가요? 원을 그리며 움직이고 있나요? 이러한 관찰을 바탕으로 매니저는 메뉴에서 특정 "기술"을 선택합니다 (예: "빠른 길 기술" 또는 "신중한 걸음 기술").
  2. 워커 (손): 이는 저수준 부분입니다. 매니저가 기술을 선택하면, 워커는 오직 그 기술만을 위해 설계된 일련의 동작을 실행합니다.

비밀 소스: "분리 (Disentanglement)"

이 논문의 진정한 마법은 AI 가 이러한 기술들을 어떻게 분리하여 유지하도록 가르치는지에 있습니다. 이를 고유 행동 분리 (Intrinsic Action Disentanglement) 라고 합니다.

강아지에게 트릭을 가르친다고 상상해 보세요. 신중하게 훈련하지 않으면, 강아지는 "앉아"와 "기다려"가 같은 것이라고 생각하거나 둘을 혼동할 수 있습니다.

  • 이전 방법들은 종종 AI 가 본질적으로 모두 같지만 약간씩 다른 기술들을 학습하도록 허용했습니다. 모든 도구가 망치처럼 보이는 공구함을 가진 것과 같았습니다.
  • IAD는 특별한 "보상 시스템"(가상 간식) 을 사용하여 다음과 같이 말합니다: "만약 기술 A 를 사용한다면, 기술 B 를 사용할 때와 완전히 다른 무언가를 해야 한다."

이것은 AI 가 명확하고 구별된 패턴을 만들도록 강제합니다.

  • 기술 1은 다음과 같은 의미를 가질 수 있습니다: "나는 항상 왼쪽에서 토마토를 너에게 건네줄 것이다."
  • 기술 2는 다음과 같은 의미를 가질 수 있습니다: "나는 너가 접시를 잡을 때까지 기다린 후에 움직일 것이다."

이러한 기술들이 매우 구별되므로 (분리되므로), 매니저는 인간을 보고 "아, 그들은 왼쪽에서 빠르게 움직이는구나"라고 말하며 즉시 기술 1을 선택할 수 있습니다. AI 는 추측할 필요가 없습니다. 그 특정 인간 스타일에 맞는 사전 프로그래밍된 행동으로 전환할 뿐입니다.

테스트 방법

연구자들은 두 에이전트가 함께 수프를 만들어야 하는 디지털 게임인 Overcooked에서 이를 테스트했습니다.

  • 테스트: 그들은 그들의 AI 를 다양한 "파트너"와 짝지었습니다. 일부 파트너는 서로 다른 기술 수준을 가진 다른 AI 들이었고, 일부는 실제 인간 데이터로 훈련된 컴퓨터 모델이었고, 일부는 게임을 플레이한 실제 인간들이었습니다.
  • 결과: IAD AI 는 다른 방법들보다 일관되게 우수한 성과를 거두었습니다. 빠른 인간과 짝을 이루면 속도를 높였고, 느리고 신중한 인간과 짝을 이루면 속도를 늦추고 기다렸습니다. 혼란을 겪거나 아무것도 하지 못하는 상태로 "무너지지" 않았습니다.
  • 증거: 그들은 심지어 데이터를 시각적으로 살펴보았으며, AI 의 행동들이 깔끔하고 분리된 군집을 형성하는 것을 확인했습니다. 흐릿한 엉망진창이 아니라, 올바르게 사용되는 명확한 서로 다른 도구들의 집합이었습니다.

결론

이 논문은 AI 가 인간과 잘 협력하기 위해서는 단순히 작업에 "잘" 해내는 것만으로는 부족하다고 보여줍니다. AI 는 구별된 행동들의 라이브러리를 학습하고, 누구와 협력하는지에 따라 올바른 것을 선택할 수 있는 지능적인 방식을 필요로 합니다. 이러한 행동들이 서로 명확하게 다르게 되도록 강제함으로써, AI 는 파트너가 로봇이든, 컴퓨터 시뮬레이션이든, 실제 사람이든 훨씬 더 적응력 있고 신뢰할 수 있는 파트너가 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →