← 최신 논문
🤖 AI

Partner-Aware Hierarchical Skill Discovery for Robust Human-AI Collaboration

본 논문은 파트너의 행동에 조건부인 기술을 학습하기 위해 대비적 내재적 보상을 활용하는 계층적 강화학습 프레임워크인 파트너 인식 기술 발견 (PASD) 을 소개하여, 단축 학습을 극복하고 다양하고 새로운 파트너에 걸친 견고하고 적응적인 인간-AI 협력을 가능하게 합니다.

원저자: Adnan Ahmad, Bahareh Nakisa, Mohammad Naim Rastgoo

게시일 2026-05-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Adnan Ahmad, Bahareh Nakisa, Mohammad Naim Rastgoo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

새로운 파트너와 복잡한 요리를 해보려고 상상해 보세요. 당신은 그들과 함께 일해 본 적이 없습니다. 그들은 빠를 수도, 느릴 수도, 지저분할 수도, 혹은 체계적일 수도 있습니다. 만약 당신이 그들의 행동을 무시한 채 오직 자신의 요리 스타일에만 집중한다면, 서로 부딪히거나 재료를 떨어뜨리거나, 하나의 수프 대신 두 가지 다른 수프를 만들어내는 결과를 초래할 가능성이 큽니다.

이 논문은 어떤 인간이든, 그 행동 방식이 어떠하든 매끄럽게 협업할 수 있도록 AI "요리 파트너"(또는 어떤 협업 로봇이든) 를 훈련시키는 새로운 방식을 소개합니다. 이 방법은 PASD(Partner-Aware Skill Discovery, 파트너 인식 기술 발견)라고 불립니다.

일상적인 비유를 사용하여 작동 원리를 간단히 설명하면 다음과 같습니다:

1. 문제: "자기중심적" 셰프

대부분의 현재 AI 훈련 방식은 오직 자신의 칼질 실력만 신경 쓰는 셰프와 같습니다. 그들은 "보상"을 받기 위해 가능한 한 빠르게 야채를 썰도록 학습합니다.

  • 결함: 파트너가 느리다면, 빠른 셰프는 파트너가 따라올 수 없다는 점을 무시한 채 더 빠르게, 더 빠르게 썰기만 합니다. AI 는 환경에서 이상한 패턴을 찾아내어 스스로는 좋아 보이지만 실제로는 팀에 도움이 되지 않는 "단순화"를 학습합니다. 마치 파트너는 가만히 서 있는데도 멋져 보인다고 생각하며 제자리에서 미친 듯이 빙글빙글 도는 무용수와 같습니다.
  • 결과: 스타일이 다른 실제 인간과 이 AI 를 짝지어 주면, AI 는 혼란을 겪고 협조하지 못하게 됩니다.

2. 해결책: "거울" 셰프 (PASD)

저자들은 AI 가 파트너의 "거울"이 되도록 가르치는 PASD 를 개발했습니다. 단순히 "어떻게 썰지"를 배우는 대신, AI 는 "파트너가 X 를 할 때 어떻게 썰지"를 학습합니다.

댄스를 배우는 것과 같다고 생각해 보세요.

  • 옛 방식: AI 는 100 가지의 다른 춤 동작 (기술) 목록을 학습하고, 스스로 모든 동작을 완벽하게 수행하려고 노력합니다.
  • PASD 방식: AI 는 파트너를 관찰하는 법을 배웁니다. 파트너가 느리고 우아한 동작을 하면, AI 는 "느린 춤" 기술을 선택한다는 것을 알게 됩니다. 파트너가 빠르고 에너지 넘치는 점프를 하면, AI 는 "빠른 춤" 기술을 선택합니다.

3. 학습 방법: "그룹 사진" 트릭

AI 는 어떤 기술이 어떤 파트너와 일치하는지 어떻게 알까요? 논문은 **대조 학습 (Contrastive Learning)**이라는 교묘한 트릭을 사용합니다.

다양한 활동을 하는 친구 그룹의 사진을 찍는다고 상상해 보세요:

  • 설정: 당신은 같은 "느린 춤" 기술에 대한 사진을 10 장 찍되, 매번 AI 를 서로 다른 파트너와 짝지어 줍니다 (키가 큰 사람, 키가 작은 사람, 빠른 사람, 느린 사람).
  • 목표: AI 에게 "이 파트너들은 서로 다르게 보이지만, '느린 춤'의 결과는 사진에서 동일하게 보여야 한다"고 알려줍니다.
  • 대조: 그런 다음 AI 에게 "빠른 점프" 기술의 사진을 보여줍니다. AI 는 "이 사진들은 '느린 춤' 사진과 완전히 다르게 보인다"고 학습합니다.

이렇게 함으로써 AI 는 파트너의 키와 같은 무작위 노이즈를 무시하고, 그들이 어떻게 함께 움직이는지 그 패턴에 집중하는 법을 배웁니다. AI 는 "아, 이 특정 파트너 스타일은 항상 이 특정 팀 결과로 이어지는구나"라고 말하게 됩니다.

4. "내재적 보상": 비밀 점수

비디오 게임에서 적을 처치하거나 동전을 수집하면 점수 (외재적 보상) 를 받습니다. 하지만 여기서는 AI 가 패턴을 인식하는 것만으로 비밀스러운 내부 점수 (내재적 보상) 를 받습니다.

  • AI 가 파트너를 보고 "아, 이 파트너는 시계 방향으로 움직이는 것을 좋아하니까 '시계 방향 기술'을 사용해야겠다"고 올바르게 예측하면 보너스 점수를 받습니다.
  • 반대로 틀리게 추측하여 "반시계 방향 기술"을 사용하면 패널티를 받습니다.
  • 이 보너스 점수는 AI 가 무작위로 추측하는 것을 멈추고 파트너의 행동에 집중하도록 장려합니다.

5. 결과: 함께 성공적으로 요리하기

연구자들은 두 에이전트가 작은 부엌에서 함께 수프를 만들어야 하는 Overcooked-AI라는 게임에서 이를 테스트했습니다.

  • 테스트: 그들은 AI 를 다양한 "파트너"(다른 AI 들, 실제 인간 데이터로 훈련된 컴퓨터 모델들, 그리고 실제 인간들) 와 짝지어 보았습니다.
  • 결과:
    • FCP 나 DIAYN 과 같은 기존 방법들은 적응이 잘 되지 않아 혼란을 겪거나 벽에 부딪히곤 했습니다.
    • PASD 가 승리했습니다. 일관적으로 더 높은 점수를 기록했습니다.
    • 실제 인간이 PASD AI 와 함께 플레이했을 때, 다른 AI 들과 플레이했을 때보다 더 많은 수프를 만들고 사고가 더 적었습니다.

결론

이 논문은 AI 가 내일 당신의 저녁 식사를 해줄 수 있다고 주장하지 않습니다. 단순히 AI 에게 (무엇을 하느냐가 아니라) 누구와 함께 일하느냐에 기반하여 기술을 학습하도록 가르친다면, 그것이 훨씬 더 훌륭한 팀원이 된다는 것을 증명할 뿐입니다. AI 는 "외로운 늑대"가 되는 것을 멈추고 누구의 스타일이든 적응할 수 있는 진정한 파트너가 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →