← 최신 논문
🤖 machine learning

LatentGym: A Testbed For Cross-Task Experiential Learning With Controllable Latent Structure

이 논문은 탐색과 활용을 분리함으로써 에이전트 시스템의 태스크 간 경험 학습 평가를 가능하게 하고, LLM이 순차적 태스크를 통해 어떻게 그리고 왜 적응하는지에 대한 연구를 용이하게 하는, 정답 잠재 구조(ground-truth latent structures)를 특징으로 하는 제어 가능한 테스트베드인 LatentGym을 소개한다.

원저자: Daksh Mittal, Tommaso Castellani, Thomson Yen, Naimeng Ye, Fangyu Wu, Minghui Chen, Tiffany Cai, Emmanouil Koukoumidis, William Zeng, Hongseok Namkoong

게시일 2026-06-16
📖 4 분 읽기☕ 가벼운 읽기

원저자: Daksh Mittal, Tommaso Castellani, Thomson Yen, Naimeng Ye, Fangyu Wu, Minghui Chen, Tiffany Cai, Emmanouil Koukoumidis, William Zeng, Hongseok Namkoong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 똑똑하지만 약간은 융통성이 없는 로봇에게 일련의 게임을 가르치고 있다고 상상해 보세요. 현실 세계에서 우리 인간은 "점들을 연결하는 것(connecting the dots)"에 매우 능숙합니다. 만약 정답이 항상 세 개의 숫자 중 하나인 게임을 한다면, 열 번 정도 플레이하고 나서 금방 이렇게 깨닫게 됩니다. "어라, 정답은 항상 이 세 숫자 중 하나네!" 그러면 당신은 무작위로 추측하는 것을 멈추고 그 세 숫자를 공략하기 시작합니다. 당신은 경험으로부터 배웁니다.

이 논문은 오늘날 가장 발전된 AI 에이전트들(챗봇을 구동하는 것과 같은)이 놀랍게도 이런 부분에 취약하다고 주장합니다. 그들은 마치 모든 게임을 매번 완전히 새로운 게임인 것처럼 취급하며, 이전 아홉 번의 게임에서 배웠던 모든 것을 잊어버리는 경향이 있습니다.

이를 증명하고 해결 방법을 찾기 위해, 저자들은 LatentGym을 구축했습니다.

놀이터: LatentGym

LatentGym을 단일 게임이 아니라, 게임 시퀀스를 생성하는 공장이라고 생각하세요.

  • "Latent" (숨겨진 규칙): 일반적인 게임에서는 규칙이 고정되어 있습니다. 하지만 LatentGym에서는 하나의 비밀스러운 "숨겨진 규칙"이 시퀀스 내의 모든 게임에 적용됩니다. 예를 들어, 숫자 맞히기 게임에서 숨겨진 규칙은 "숫자는 항상 137 또는 793이다"가 될 수 있습니다. AI는 시작할 때 이 규칙을 알지 못하며, 게임을 플레이하며 이를 알아내야 합니다.
  • 조절 노브 (Control Knobs): 연구자들은 사운드보드처럼 난이도를 미세하게 조정할 수 있습니다:
    • 프롬프트 (The Prompt): 비밀 규칙에 대해 AI에게 얼마나 알려줄 것인가? (아무것도 알려주지 않기? 모호한 힌트 주기? 진실 전부 알려주기?)
    • 피드백 (The Feedback): 게임이 끝난 후, 단순히 "승리/패배"만 알려줄 것인가, 아니면 AI가 학습할 수 있도록 실제 정답을 공개할 것인가?
    • 호라이즌 (The Horizon): 시퀀스에 포함된 게임의 개수는 몇 개인가? (5개? 10개? 20개?)

이 설정이 중요한 이유는, 대부분의 AI 테스트에서는 AI가 실패했을 때 그 이유를 알 수 없기 때문입니다. 패턴을 보지 못한 것일까요? 패턴은 보았지만 그것을 사용하는 법을 몰랐던 것일까요? LatentGym에서 연구자들은 비밀 규칙을 완벽하게 알고 있으므로, AI의 두뇌가 정확히 어느 지점에서 단락(short-circuit)되었는지 짚어낼 수 있습니다.

문제점: AI는 어떻게 실패하는가

연구자들이 GPT-4o나 Claude와 같은 최상위 AI 모델들을 이러한 단순한 시퀀스에 테스트했을 때, AI가 학습에 실패하는 세 가지 구체적인 방식을 발견했습니다.

  1. 적응 무시 (Adaptation Neglect - "리셋 버튼" 증후군): AI는 이전에 플레이한 적이 있다는 사실을 무시합니다. 설령 정답이 항상 "빨강"이라 할지라도, AI는 두 번째 게임을 마치 생애 첫 게임인 것처럼 취급하여, 기존의 것을 먼저 확인하는 대신 무작위 추측부터 시작합니다. 이는 마치 어제 수학 시험을 봤는데도 오늘 다시 공식부터 유도하려고 하는 학생과 같습니다.
  2. 적응 붕괴 (Adaptation Breakdown - "눈을 가늘게 뜨는" 증후군): AI는 패턴을 감지합니다 ("잠깐, 숫자가 점점 작아지고 있어!"). 하지만 그 정보를 어떻게 사용해야 할지는 모릅니다. 힌트는 보이지만 예전 방식 그대로 플레이하는 것입니다. 이는 마치 "바닥 미끄러움" 표지판을 보고도 속도를 줄이는 대신 평소처럼 걷는 것과 같습니다.
  3. 적응 오차 교정 (Adaptation Miscalibration - "과하게 생각하는" 증후군): 연구자들이 명시적으로 규칙을 알려주었을 때 ("정답은 항상 137 또는 793입니다"), AI는 때때로 혼란에 빠져 아무것도 알려주지 않았을 때보다 오히려 성적이 더 나빠졌습니다. 규칙을 따르려고 너무 애쓰다 보니 실제 게임 메커니즘을 무시해 버린 것입니다. 이는 "분홍 코끼리를 생각하지 마세요"라는 말을 들었을 때, 게임을 하는 대신 온종일 분홍 코끼리만 생각하는 것과 같습니다.

해결책: 교차 작업 강화 학습 (Cross-Task RL)

연구자들은 **교차 작업 강화 학습 (Cross-Task Reinforcement Learning, RL)**이라는 방법을 사용하여 AI가 더 잘 학습하도록 가르쳐 보았습니다.

  • 기존 방식 (Single-Task RL): AI에게 게임 1을 가르치고, 그다음 게임 2, 그다음 게임 3을 가르칩니다. AI는 게임 1과 게임 2에서 이기는 법을 배우지만, 이들을 서로 연결하는 법은 배우지 못합니다.
  • 새로운 방식 (Cross-Task RL): AI에게 전체 시퀀스를 한꺼번에 훈련시킵 direction. 당신은 AI에게 "당신의 목표는 단순히 게임 1에서 이기는 것이 아니라, 게임 1부터 9까지의 경험을 통해 학습함으로써 게임 10에서 이기는 것이다"라고 말합니다.

결과:
이 새로운 훈련 방식을 사용했을 때, AI는 실제로 적응하는 법을 배웠습니다.

  • AI는 초기에 패턴을 찾기 시작했습니다.
  • AI는 그 패턴을 사용하여 나중의 게임들을 더 빠르게 이기기 시작했습니다.
  • 결정적으로, 이 학습은 **일반화(generalize)**되었습니다. 연구자들이 한 번도 본 적 없는 새로운 숨겨진 규칙이 적용된 새로운 게임 세트로 AI를 테스트했을 때도, 기존 방식으로 훈련된 AI보다 훨씬 더 잘 적응했습니다. 즉, 학습하는 방법 자체에 대한 "메타 기술"을 배운 것입니다.

놀라운 반전: 정보가 적을수록 좋다

피드백에 관한 가장 흥CS로운 발견 중 하나는 다음과 같습니다.

  • 풍부한 피드백 (Rich Feedback): 매 게임이 끝날 때마다 AI에게 정확한 정답을 알려주는 것.
  • 희소한 피드백 (Sparse Feedback): 단순히 AI에게 "승리" 또는 "패배"만을 알려주는 것.

역설적이게도, 희소한 피드백(정보가 적은 쪽)으로 훈련된 AI가 풍부한 피드백으로 훈련된 AI보다 새로운 상황에서 더 잘 일반화되었습니다. AI에게 정답을 너무 쉽게 주면, AI가 게을러지거나 특정 힌트에 과도하게 의존하게 되는 것으로 보입니다. 반면, 단지 "승리/패배" 신호만 가지고 스스로 알아내야 할 때, AI는 힌트가 바뀌더라도 작동하는 더 견고한 전략을 구축하게 됩니다.

핵심 요약

이 논문은 AI 에이전트가 일련의 연관된 작업으로부터 학습할 수 있는지 테스트하기 위한 새로운 "체육관(LatentGym)"을 소개합니다. 연구자들은 현재의 최첨단 AI들이 이 부분에 취약하며, 종종 작업 간의 점들을 연결하는 데 실패한다는 것을 발견했습니다. 그러나 작업을 개별적으로 훈련하는 대신 전체 시퀀스로 훈련함으로써, AI는 적응하는 일반적인 능력을 배울 수 있습니다. 이 프레임워크는 연구자들이 AI가 왜 실패하는지, 그리고 어떻게 고칠 수 있는지를 정확히 파악할 수 있게 하여, 우리가 진정으로 경험으로부터 배우는 에이전트에 더 가까워지도록 돕습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →