← 최신 논문
💬 NLP

Tmax: A simple recipe for terminal agents

이 논문은 새로운 데이터 생성 분류 체계를 활용하여 대규모 데이터셋을 구축함으로써, 90억 파라미터 모델이 오직 결과 기반 강화 학습만을 사용하여 Terminal-Bench 2.0에서 최첨단 성능을 달기 할 수 있도록 하는 터미널 에이전트 학습을 위한 단순하면서도 강력한 오픈 소스 레시피인 Tmax를 소개한다.

원저자: Hamish Ivison, Junjie Oscar Yin, Rulin Shao, Teng Xiao, Nathan Lambert, Hannaneh Hajishirzi

게시일 2026-06-23
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hamish Ivison, Junjie Oscar Yin, Rulin Shao, Teng Xiao, Nathan Lambert, Hannaneh Hajishirzi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

개요: 로봇에게 컴퓨터 사용법 가르치기

매우 똑똑한 로봇(거대 언어 모델)이 있다고 상상해 보세요. 이 로봇은 코드를 작성하고 질문에 답할 수 있습니다. 하지만 지금 이 로봇은 마치 키보드를 만지거나 컴퓨터 터미널을 사용해 본 적이 없는 아주 명석한 학생과 같습니다. 컴퓨터에 '대해서'는 잘 알지만, 실제로 문제를 해결하기 위해 컴퓨터를 어떻게 '사용'해야 하는지는 모르는 상태입니다.

TMAX 프로젝트는 이 로봇들이 복잡하고 실제적인 문제를 해결하기 위해 컴퓨터 터미널(명령어를 입력하는 검은 화면)을 사용하는 법을 가르치기 위해 설계된 단순하고 효과적인 "훈련 캠프"입니다.

문제점: "체육관"이 너무 쉬웠다

이 논문이 나오기 전, 연구자들은 기존의 데이터셋을 사용하여 이 로봇들을 훈련시키려 노력했습니다. 저자들은 이 오래된 데이터셋들을 가벼운 덤벨만 있는 체육관에 비유했습니다.

  • 문제점: 작업들이 너무 단순했습니다(예: "파일 목록 보기"나 "파일 이동하기"). 현대의 로봇들은 이런 것들을 즉시 해결할 수 있기 때문에, 새로운 것을 배우지 못했습니다.
  • 격차: 실제 업무는 더 어렵습니다. 서버를 설정하고, 복잡한 코드를 디버깅하며, 긴 명령어를 연속적으로 실행해야 합니다. 이전의 훈련 데이터는 이러한 "고강도 웨이트 트레이닝"을 담아내지 못했습니다.

해결책: 맞춤형 "장애물 코스" 구축 (TMAX-15K)

이를 해결하기 위해 저자들은 TMAX-15K라는 거대한 새로운 데이터셋을 구축했습니다. 이것을 로봇을 위한 맞춤형 하이테크 장애물 코스를 설계하는 것이라고 생각하면 됩니다.

모든 작업을 일일이 손으로 쓰는 대신(그러면 시간이 너무 오래 걸릴 것입니다), 그들은 레시 Recipe 생성기를 만들었습니다:

  1. 조합과 매칭: 그들은 다양한 "재료"를 무작위로 조합하는 시스템을 만들었습니다:
    • 도메인(분야): 보안인가? 데이터 과학인가? 파일 관리인가?
    • 페르노아(역할): 로봇이 해커처럼 행동하는가, 시스템 관리자처럼 행동하는가, 아니면 데이터 분석가처럼 행동하는가?
    • 난이도: 3단계 작업인가, 아니면 30단계의 마라톤인가?
    • 도구: 로봇이 오디오 파일, 이미지, 또는 복잡한 코드를 다뤄야 하는가?
  2. "선생님": 그들은 매우 똑똑한 AI(Gemini-1.5-Pro)를 사용하여 이 작업들에 대한 실제 지침과 "정답지"를 생성했습니다.
  3. 결과: 그들은 14,600개의 고유한 작업을 만들어냈습니다. 결정적으로, 난이도가 너무 쉽지도, 불가능하지도 않게 딱 적절하도록 조절했습니다. 이는 플레이어가 항상 도전 과제를 마주하면서도 막히지는 않도록 난이도를 조절하는 비디오 게임과 같습니다.

훈련 방법: 직접 해보며 배우기 (강화 학습)

일단 장애물 코스가 준비되었으니, 로봇을 훈련시킬 방법이 필요했습니다. 그들은 **강화 학습(Reinforcement Learning, RL)**이라는 방법을 사용했습니다.

  • 비유: 강아지가 공을 물어오는 법을 배운다고 상상해 보세요. 당신은 공을 던지는 물리 법칙을 설명하지 않습니다. 그저 공을 던지고, 강아지가 공을 가져오면 간식(보상)을 줍니다. 실패하면 간식을 주지 않습니다.
  • TMAX 레시피:
    • 로봇은 터미널에서 작업을 해결하려고 시도합니다.
    • 성공하면 "보상"을 받습니다.
    • 실패하면 아무것도 얻지 못합니다.
    • 로봇은 보상을 얻기 위해 최선의 명령어 입력 방식을 찾아내며 반복해서 다시 시도합니다.

핵심 혁신: 저자들은 표준적인 훈련 방식이 불안정하다는 것(로봇이 배운 것을 '잊어버리거나' 오류가 발생하는 현상)을 발견했습니다. 그들은 계산을 정밀하게 유지하고(DPPO 방법 사용) 수학적 설정을 조정하여, 울퉁불퉁한 길을 달릴 때 충격을 흡수하는 쇼크 업소버(shock absorber)를 추가하듯 훈련을 안정적으로 유지했습니다.

결과: 작은 모델, 큰 승리

이 논문에서 가장 놀라운 부분은 훈련된 로봇의 크기입니다.

  • 언더독(약자): 그들은 단 90억 개의 파라미터(AI 세계에서는 "작다"고 간주됨)를 가진 모델을 훈련시켰습니다.
  • 승리: 이 작은 모델인 TMAX-9B는 자신보다 3~4배 더 큰 모델들을 포함하여 거의 모든 다른 "오픈(공개형)" 모델들을 이겼습니다.
  • 비교: 이 모델은 대형 기술 기업들이 사용하는 최고 수준의 비공개 모델(Claude Haiku 등)과 거의 대등한 성능을 보여주었습니다.

왜 이것이 중요한가요?
보통 어려운 일을 더 잘하게 하려면 더 크고 비싼 뇌가 필요합니다. 하지만 TMAX는 올바른 훈련 데이터좋은 레시피가 있다면, 더 작고 저렴한 뇌가 훨씬 더 큰 모델을 압도할 수 있다는 것을 보여주었습니다.

훈련 효과가 지속되는가? (일반화)

저자들은 "로봇이 단순히 우리가 준 특정 테스트의 답을 암기한 것인가, 아니면 실제로 기술을 배운 것인가?"라고 물었습니다.

  • 테스트: 훈련된 로봇을 다른 환경(다른 "체육관 설정")에 배치하고, 다른 유형의 문제들(소프트웨어 버그 수정이나 수학 퍼즐 등)을 주었습니다.
  • 결과: 로봇은 모든 것에서 더 나아졌습니다. 단순히 특정 테스트를 통과하기 위해 배운 것이 아니라, 생각하는 법과 도구를 사용하는 법을 더 효과적으로 배웠습니다. 이는 학생에게 공부하는 법을 가르치는 것과 같습니다. 공부하는 방법을 한 번 익히면, 연습했던 시험뿐만 아니라 어떤 시험도 통과할 수 있게 되는 것과 같습니다.

요약

TMAX 논문은 AI 에이전트에게 컴퓨터 사용법을 가르치는 "방법론 가이드"입니다.

  1. 방대하고 다양하며 어려운 데이터셋(TMAX-15K)을 스마트한 생성기를 통해 구축했습니다.
  2. 작은 모델이 이 데이터셋을 탐색할 수 있도록 안정적인 훈련 방법을 사용했습니다.
  3. 결과: 이 작은 오픈 소스 모델은 컴퓨터 터미널 사용 분야에서 동급 최고의 성능을 보여주었으며, 이는 단순히 모델을 크게 만드는 것보다 더 나은 훈련 데이터가 더 중요하다는 것을 증명했습니다.

저자들은 이 방식이 미래의 연구자들이 더 똑똑한 터미널 에이전트를 구축하기 위한 표준 "레시피"가 되기를 바라며, 모든 코드, 데이터, 모델을 무료로 공개했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →