← 최신 논문
🤖 machine learning

CooT: Learning to Coordinate In-Context with Coordination Transformers

CooT 는 기존 인구 기반, 파인튜닝, 메타-RL 접근법보다 Overcooked 및 Google Research Football 과 같은 벤치마크에서 더 우수한 성능을 보이며, 매개변수 업데이트 없이 컨텍스트 내 학습을 활용하여 다중 에이전트 시스템이 낯선 파트너에 대해 빠르고 견고하게 적응할 수 있게 하는 새로운 프레임워크입니다.

원저자: Huai-Chih Wang, Hsiang-Chun Chuang, Hsi-Chun Cheng, Dai-Jie Wu, Shao-Hua Sun

게시일 2026-05-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Huai-Chih Wang, Hsiang-Chun Chuang, Hsi-Chun Cheng, Dai-Jie Wu, Shao-Hua Sun

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

CooT(조정 트랜스포머) 논문에 대한 설명을 일상적인 비유를 사용하여 쉬운 언어로 번역한 것입니다.

큰 문제: "새로운 파트너" 딜레마

당신이 전문 댄서라고 상상해 보세요. 당신은 정기적인 파트너와 함께 수년 동안 연습해 왔습니다. 그들이 어떻게 움직이고, 언제 회전하며, 어떻게 반응하는지 정확히 알고 있습니다. 당신은 완벽한 조화를 이룹니다.

이제, 갑자기 낯선 사람과 댄스 오프를 위해 짝을 지었다고 상상해 보세요. 당신은 그들의 스타일을 모릅니다. 그들은 느릴 수도, 빠를 수도, 혹은 서툴 수도 있습니다.

  • 구식 AI 방법은 오직 한 명의 특정 파트너와만 연습한 댄서와 같습니다. 낯선 사람을 만나면, 그 사람을 자신들의 방식으로 춤추게 하려고 강요하거나, 춤추는 법을 모르기 때문에 그냥 얼어붙습니다.
  • 다른 방법들은 새로운 파트너의 스타일을 파악하기 위해 수천 번이나 몇 시간 동안 그 사람과 춤을 추며 배우려고 시도합니다. 이는 너무 느리고 비쌉니다. 특히 함께 춤출 시간이 몇 분뿐이라면 더욱 그렇습니다.

이 논문의 목표는 AI가 처음부터 춤추는 법을 다시 배울 필요 없이, 몇 걸음 만에 새로운 파트너를 즉시 "읽어" 그들과 동기화된 춤을 추는 법을 가르치는 것입니다.

해결책: CooT( "맥락" 댄서)

저자들은 CooT(Coordination Transformer)라는 새로운 AI 프레임워크를 개발했습니다.

CooT를 동작을 암기하는 댄서가 아니라, 매우 예리한 즉흥 연주자로 생각하세요.

  1. 학습 방법 (훈련 단계):
    큰 댄스 오프 전에 CooT는 다양한 춤 파트너들의 수천 개의 비디오를 시청합니다. 단순히 동작만 보는 것이 아니라, 관계를 관찰합니다.

    • 왼쪽으로 회전하는 것을 좋아하는 파트너 A를 보고, 파트너 B(최적의 대응) 가 그들과 맞추기 위해 오른쪽으로 회전하도록 어떻게 조정하는지 지켜봅니다.
    • 천천히 움직이는 파트너 C를 보고, 파트너 D 가 어떻게 인내심 있게 기다리는지 지켜봅니다.
    • 비유: CooT 는 전 세계의 모든 춤 커플을 지켜본 학생과 같습니다. 그들은 아직 당신과 춤을 추지는 않았지만, 당신의 춤 스타일에 사람들이 어떻게 반응하는지 지켜본 것입니다.
  2. 작동 방식 ("인-컨텍스트" 마법):
    CooT 가 새로운 인간이나 AI 파트너를 만나면, 뇌를 바꾸지 않습니다 (즉, "재훈련"을 하지 않습니다). 대신 **인-컨텍스트 학습 (In-Context Learning)**을 사용합니다.

    • 비유: CooT 에게 "스크래치 패드"(컨텍스트 창) 가 있다고 상상해 보세요. 당신과 춤을 추는 동안, 그것은 지난 몇 초 동안 당신이 한 일을 이 스크래치 패드에 적어둡니다.
    • 다음 동작을 결정해야 할 때, 스크래치 패드를 봅니다: "아, 내 파트너가 방금 왼쪽으로 움직였구나. 내가 본 비디오들에서 파트너가 왼쪽으로 움직였을 때, 최선의 동작은 오른쪽으로 발을 내딛는 것이었어."
    • 그것은 최근의 관찰들을 사용하여 당신의 스타일을 즉시 추측하고 적응합니다.

왜 이것이 구식 방법들보다 더 나은가요?

  • "셀프 플레이"(스스로와 연습하는 것) vs:
    구식 AI 들은 거울에 비친 자신과 춤을 추며 연습합니다. 그들은 자신과 춤추는 데는 매우 능숙해지지만, 낯선 사람과는 엉망이 됩니다. CooT 는 모두와 춤추는 법을 배웁니다.
  • "파인 튜닝"(실시간 학습) vs:
    일부 AI 는 당신과 몇 시간 동안 춤을 추며 실수를 하고 수정함으로써 배우려고 시도합니다. 이는 느립니다. CooT 는 하나 또는 두 곡만 지켜봐도 당신의 스타일을 알아내는 천재와 같습니다. 뇌를 "재훈련"할 필요 없이 즉시 적응합니다.
  • "인구 기반" 방법 (모든 것에 잘하려고 시도하는 것) vs:
    다른 AI 들은 거대한 무작위 파트너 그룹과 훈련하여 "모든 일에 능한" 사람이 되려고 시도합니다. 하지만 정말 이상한 사람을 만나면 여전히 실패할 수 있습니다. CooT 는 당신의 구체적인 최근 행동을 보고 당신에게 특별히 적응합니다.

결과: 효과가 있었나요?

연구진들은 CooT 를 두 가지 매우 다른 "댄스 플로어"에서 테스트했습니다:

  1. Overcooked: 두 명의 요리사가 작은 부엌에서 함께 수프를 만들어야 하는 혼란스러운 비디오 게임입니다. (고스트레스 주방 근무와 같습니다).
  2. Google Research Football: 선수들이 패스와 움직임을 함께 해야 하는 축구 게임입니다. (팀 스포츠와 같습니다).

연구 결과:

  • 속도: CooT 는 거의 즉시 잘 조율하기 시작했으며, 게임이 진행됨에 따라 더 나아졌습니다.
  • 인간 테스트: 실제 인간들이 CooT 와 함께 플레이했을 때, 그들은 CooT 를 최고의 파트너로 평가했습니다. 그들은 CooT 가 자신을 이해하고, 자신의 스타일에 적응하며, 방해하지 않는다고 느꼈습니다.
  • 회복 탄력성: 파트너가 갑자기 전략을 변경한 경우 (예: 패스를 멈추고 혼자 달리기 시작), CooT 는 몇 초 내에 그 변화를 감지하고 즉시 계획을 조정했습니다.

결론

CooT 는 AI 가 인간이나 다른 AI 와 협력하는 새로운 방식입니다. 모든 사람이 동일한 경직된 규칙을 배우도록 강요하는 대신, CooT 는 카멜레온처럼 행동합니다. 그것은 함께 일하는 사람을 관찰하고, 그들의 최근 행동을 기억하며, 그들과 완벽하게 맞추기 위해 자신의 행동을 즉시 변경합니다.

이는 "내가 사전에 프로그래밍된 춤을 추겠다"고 말하는 로봇과 "당신이 왼쪽으로 움직이는 걸 보니, 내가 당신을 돕기 위해 오른쪽으로 움직이겠다"고 말하는 로봇의 차이입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →