← 최신 논문
💬 NLP

Endless Terminals: Scaling RL Environments for Terminal Agents

이 논문은 인간 주석이 없는 절차적 생성 파이프라인을 통해 3,255 개의 터미널 태스크를 대량으로 생성하고, 이를 통해 복잡한 에이전트 구조 없이도 단순한 강화학습으로 모델의 성능을 획기적으로 향상시켰음을 보여줍니다.

원저자: Kanishk Gandhi, Shivam Garg, Noah D. Goodman, Dimitris Papailiopoulos

게시일 2026-02-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Kanishk Gandhi, Shivam Garg, Noah D. Goodman, Dimitris Papailiopoulos

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎯 핵심 비유: "AI 에게 요리하는 법을 가르치는 것"

기존의 AI 학습 방식은 유명한 요리사 (전문가) 가 쓴 레시피책 (데이터) 을 외우게 하는 것과 비슷했습니다. 하지만 레시피책은数量有限 (제한적) 이고, AI 가 직접 재료를 손질하고 불을 조절하는 실전 경험을 쌓기엔 부족했습니다.

이 논문은 **"AI 가 스스로 요리 연습을 할 수 있는 무한한 가상 주방"**을 만들었습니다.

1. 문제: "학습할 공간이 너무 부족해요!"

  • 기존 상황: AI 를 컴퓨터 명령어 (터미널) 를 다룰 수 있게 하려면, 수많은 연습 문제가 필요합니다. 하지만 사람이 직접 문제를 만들고 정답을 확인하는 건 너무 비싸고 느립니다. 마치 요리사 한 명이 매일 새로운 요리를 만들어내야 하는 것과 같죠.
  • 결과: AI 가 배울 수 있는 문제가 너무 적어서, AI 는 실제 상황에서 엉뚱한 짓을 하거나 실수를 반복했습니다.

2. 해결책: "Endless Terminals (끝없는 터미널)"

저자들은 AI 가 스스로 문제를 만들고, 검증하고, 학습하는 자동화 공장을 지었습니다. 이 공장은 4 단계로 작동합니다.

🏭 4 단계 자동화 공장

  1. 요청서 만들기 (Task Generation): AI 에게 "오늘은 로그 파일을 정리해줘"나 "데이터베이스 백업해줘" 같은 다양한 미션을 무작위로 만들어냅니다.
  2. 가상 주방 세팅 (Container Setup): 그 미션을 수행할 수 있는 가상 컴퓨터 환경을 자동으로 만들고, "이 환경이 제대로 준비됐나?"를 스스로 검사합니다.
  3. 정답 확인 시험지 만들기 (Completion Tests): 미션이 성공했는지 확인하는 '시험지'를 자동으로 작성합니다. (예: "파일이 생겼나요?", "내용이 맞나요?")
  4. 해결 가능성 검증 (Filtering): 가장 똑똑한 AI(o3) 가 이 문제를 16 번 시도해봤을 때, 적어도 한 번은 성공하는 문제만 남깁니다. (너무 어렵거나 애매한 문제는 버립니다.)

이 과정을 통해 3,255 개의 검증된 연습 문제가 자동으로 만들어졌습니다.

3. 학습 방법: "단순하지만 강력한 훈련"

  • 복잡한 장치는 필요 없음: 다른 연구들은 AI 에게 '검색 도구', '여러 AI 팀원', '특별한 보조 도구' 같은 복잡한 장비를 주었습니다.
  • 이 논문의 방식: AI 에게는 단순한 명령어 입력창만 줍니다. AI 는 명령을 입력하고, 결과를 보고, 다시 명령을 입력하는 가장 기본적인 반복 훈련을 합니다.
  • 보상 시스템: 미션을 성공하면 "좋아!" (보상 1), 실패하면 "아니야" (보상 0) 만 줍니다. 중간에 "잘하고 있어" 같은 칭찬은 없습니다. (이걸 PPO라고 합니다.)

4. 결과: "단순한 훈련이 기적을 만들다"

이 방식은 놀라운 효과를 냈습니다.

  • 실력 향상: 훈련 전에는 4% 만 성공하던 AI 가 훈련 후에는 **59%**까지 성공률이 올랐습니다. (Qwen2.5-7B 모델 기준)
  • 실전 적용: 이 AI 는 훈련할 때 보지 못했던, 사람이 만든 어려운 시험 (TerminalBench 2.0) 에서도 다른 복잡한 AI 들보다 더 좋은 점수를 받았습니다.
  • 핵심 교훈: AI 를 더 똑똑하게 만드는 비결은 복잡한 장비를 주는 게 아니라, 학습할 수 있는 환경 (문제) 을 무한히 늘려주는 것이었습니다.

5. 한계와 미래: "아직 완벽하지는 않아요"

  • 루프 함정: AI 가 실수를 하면 같은 명령을 계속 반복하는 '함정'에 빠지는 경우가 많았습니다. (39% 의 실패 원인)
  • 전문 분야 부족: 수학이나 머신러닝 같은 매우 전문적인 분야에서는 아직 실력이 부족합니다.
  • 미래 전망: 앞으로는 AI 가 스스로 더 어려운 문제를 만들어내거나, 사람이 개입하여 더 자연스러운 요청을 할 수 있도록 발전시킬 수 있습니다.

📝 한 줄 요약

"AI 를 가르칠 때, 비싼 레시피책 (데이터) 을 주는 것보다, AI 가 스스로 무한히 연습할 수 있는 '가상 공장 (Endless Terminals)'을 만들어주는 것이 더 효과적이다."

이 연구는 AI 개발자들이 복잡한 알고리즘만 쫓는 것이 아니라, 학습할 수 있는 풍부한 환경을 만드는 데 집중해야 함을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →