← 최신 논문
🤖 AI

Benchmarking the Limits of In-Context Reinforcement Learning for Ad-Hoc Teamwork

본 논문은 Ad-Hoc 팀워크에서의 In-Context 강화학습을 평가하기 위한 ICRL4AHT 벤치마크를 제시하며, 기존 히스토리 조건부 알고리즘이 알려지지 않은 파트너와 함께 작동할 때 견고한 테스트 시간 적응을 달성하지 못하며 다중 에이전트 환경에서 종종 무작위 기준선보다 낮은 성능을 보임을 규명합니다.

원저자: Yuheng Jing, Kai Li, Ziwen Zhang, Jiajun Zhang, Zeyao Ma, Jiaxi Yang, Lei Zhang, Zhe Wu, Jinmin He, Junliang Xing, Jian Cheng

게시일 2026-05-26
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yuheng Jing, Kai Li, Ziwen Zhang, Jiajun Zhang, Zeyao Ma, Jiaxi Yang, Lei Zhang, Zhe Wu, Jinmin He, Junliang Xing, Jian Cheng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

미처 만나 본 적 없는 낯선 사람과 함께 복잡한 요리를 하려고 상상해 보세요. 그 사람과 대화할 수도 없고, 그들이 셰프인지 서툰 초보자인지, 아니면 그냥 생식재료를 먹고 싶어 하는 사람인지 알 수 없습니다. 이것이 **Ad-Hoc 팀워크 (AHT)**의 도전 과제입니다: 사전 계획 없이 한 번도 본 적 없는 파트너와 효과적으로 협력하는 것입니다.

최근 **In-Context 강화학습 (ICRL)**이라는 새로운 유형의 인공지능이 주목받고 있습니다. 이러한 AI 를"초학습자"라고 생각하세요. 특정 게임을 수년 동안 연습하는 대신, 과거 경험의 방대한 도서관으로 훈련받습니다. 새로운 상황에 직면했을 때, 그들은 최근의 역사 (즉, '맥락') 를 살펴보고 즉시 무엇을 해야 할지 파악합니다. 마치 인간이"아, 이건 밥과 함께 놀았던 때와 비슷하네. 그때 효과가 있었던 걸 다시 해보자"라고 말하는 것과 같습니다.

이 논문의 연구자들은 다음과 같은 큰 질문을 던졌습니다:이"초학습자"들이 정말로 혼란스러운 부엌에서 낯선 사람과 잘 협력할 수 있을까?

실험:"Overcooked"테스트 부엌

이를 확인하기 위해 팀은 ICRL4AHT라는 거대한 테스트 장소를 구축했습니다. 두 명의 셰프가 수프와 샐러드를 만들기 위해 협력해야 하는 인기 있는 비디오 게임인 Overcooked를 사용했습니다.

  • 설정: 그들은 거대한"팀원"도서관을 만들었습니다. 일부는 다른 AI 에 의해 훈련된"RL"그룹이고, 일부는 단순하고 경직된 규칙을 따르는"Heuristic"그룹이었습니다.
  • 테스트: 그들은 AI 팀원들에게"초학습자"AI 를 훈련시켰습니다. 그런 다음, 그들이 한 번도 본 적 없는 규칙을 따르는 팀원들과 함께 부엌에 던져 넣었습니다.
  • 목표: 초학습자가 낯선 사람의 움직임을 보고 그들의 스타일을 파악하여 즉시 적응해 완벽한 요리를 할 수 있을까요?

충격적인 결과:"초학습자"가 길을 잃었습니다

결과는 놀라웠으며, 솔직히 말해 AI 커뮤니티에게는 조금 실망스러웠습니다.

  1. 적응 실패: "초학습자"였음에도 불구하고, 이 AI 들은 낯선 사람과 더 많은 라운드를 플레이할수록 나아지지 않았습니다. 오히려 무작위로 버튼을 누르는 무작위 플레이어보다 더 나쁜 성능을 보이는 경우가 많았습니다.
  2. "평탄한"선: 성공적인 학습에서는 시간이 지남에 따라 AI 가 파트너의 스타일을 배우면서 성능이 향상되는 그래프를 기대합니다. 하지만 여기서는 그래프가 완전히 평탄했습니다. AI 는 상호작용의 역사로부터 전혀"학습"하는 것처럼 보이지 않았습니다.
  3. 부엌의 혼란: 어려운 낯선 사람과 짝을 이루었을 때, AI 는 단순히 도움을 주지 못했을 뿐만 아니라, 적극적으로 방해하여 음수 점수를 초래했습니다 (수프를 태우거나 문을 막는 등).

왜 실패했을까요?

연구자들은 AI 에 더 많은 정보를 제공함으로써 문제를 해결하려고 시도했습니다. 예를 들어:

  • 더 긴 기억: 시험 전에 더 긴 책을 읽는 것처럼, AI 에게 발생한 사건의 더 긴 역사를 제공했습니다.
  • 파트너 보기: AI 가 파트너가 한 움직임을 정확히 보게 했습니다 (단순히 추측하는 대신).
  • 더 큰 두뇌: AI 모델을 더 크고 복잡하게 만들었습니다.

이러한 해결책 중 어느 것도 작동하지 않았습니다. AI 는 여전히 조정 방법을 파악하지 못했습니다. 이 모델들은 작업(퍼즐 풀기 등) 을 학습하는 데는 뛰어나지만, 실시간으로 사람(또는 다른 에이전트) 을 학습하는 데는 형편없어 보입니다. 그들은 훈련 중에 본 특정 패턴을 암기하는 것 같지만, 낯선 사람의 행동 뒤에 숨은"이유"를 이해하지는 못하는 것으로 보입니다.

교훈

이 논문은 AI 가 쓸모없다고 말하는 것이 아닙니다. 대신, 이는 정비공이 우리에게"우리는 이 새로운 엔진이 어떤 날씨에서도 운전하기에 완벽하다고 생각했지만, 막상 폭설 속에서 테스트해 보니 시동이 걸리지 않았어요"라고 말하는 것과 같습니다.

이 연구는 현재"초학습자"AI 들이 주요한 맹점을 가지고 있음을 증명하기 위한 새롭고 엄격한 테스트 (벤치마크) 를 확립했습니다:**그들은 단순히 낯선 사람을 지켜보는 것만으로는 새롭고 예측 불가능한 파트너에 쉽게 적응할 수 없습니다.**저자들은 이 발견이 커뮤니티가 과거 게임을 단순히 암기하는 것이 아니라, 낯선 사람을 진정으로 이해하고 협력할 수 있는 더 나은 AI 를 구축하도록 자극하기를 바랍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →