← 최신 논문
💬 NLP

Envs-FORGE: Frontier-Optimized Reward-Grounded Environment Synthesis for Agent RL

Envs-FORGE는 검증기 보상을 혼합 정수 선형 계획법을 통해 시드별 행동으로 변환함으로써 강화 학습을 위한 환경 합성을 동적으로 최적화하고, 이를 통해 고정된 레시피 기반의 베이스라인 모델들과 비교하여 다양한 벤치마크에서 에이전트의 성능을 유의미하게 향상시키는 맞춤형 훈련 환경을 생성하는 새로운 프롬프팅 정책이다.

원저자: Xiaojun Wu, Cehao Yang, Honghao Liu, Xueyuan Lin, Zhichao Shi, Hao Zhou, Xuhui Jiang, Chengjin Xu, Jia Li, Jian Guo

게시일 2026-08-17
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xiaojun Wu, Cehao Yang, Honghao Liu, Xueyuan Lin, Zhichao Shi, Hao Zhou, Xuhui Jiang, Chengjin Xu, Jia Li, Jian Guo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 컴퓨터를 고치거나 코드를 작성하는 법을 가르치려 한다고 상상해 보세요. 단순히 매뉴얼을 건네주는 것만으로는 부족합니다. 로봇은 직접 해보며 연습해야 합니다. 이것이 바로 **강화 학습(Reinforcement Learning, RL)**의 세계입니다. 여기서 AI 에이전트는 무언가를 시도하고, 실수하고, 성공했을 때 "보상"(높은 점수와 같은 것)을 받으며 배웁니다. 하지만 여기에는 함정이 있습니다. 로봇이 더 나아지기 위해서는 연습 문제가 딱 적절해야 한다는 것입니다. 문제가 너무 쉬우면 로봇은 지루해하며 새로운 것을 배우지 못합니다. 반대로 너무 어려우면 좌절하여 포기하게 됩니다. 이 최적의 지점을 "학습 경계선(learning frontier)"이라고 부릅니다. 즉, 로봇이 현재 할 수 있는 능력의 끝자락에서 약간의 도전을 통해 가장 많이 성장할 수 있는 지점입니다.

오랫동안 과학자들은 LLM(대화형 AI의 두뇌 역할을 하는 초지능형 AI)을 사용하여 이러한 연습 문제를 자동으로 만드는 방법을 연구해 왔습니다. 그들은 마치 요리사가 손님이 갓난아기인지 미식가인지 상관없이 항상 똑같은 레시피로 요리를 하는 것처럼, 단순하고 고정된 레시피를 사용하여 과제를 생성했습니다. 이 논문은 이러한 연습 문제를 만드는 더 똑똑한 방법을 소개합니다. 그것은 바로 Envs-FORGE입니다. Envs-FORGE는 일률적인 레시피를 사용하는 대신, 로봇의 현재 근력을 관찰하고 다음에 어떤 도전이 얼마나 어려워야 하는지 정확히 파악하여 맞춤형 운동을 설계하는 개인 트레이너처럼 작동합니다. 목표는 모든 연습 과제가 로봇을 현재의 한계보다 아주 조금 더 앞서 나가도록 완벽하게 조율하는 것입니다.

"일률적인 레시피"의 문제점

과거에 연구자들이 AI 에이전트를 위한 새로운 훈련 과제를 만들고자 할 때, 그들은 고정된 전략에 의존했습니다. 마치 학생이 누구인지 상관없이 모든 학생에게 똑같은 학습지를 나눠주며 단순히 "조금 더 어렵게" 만들겠다고 결정하는 교사를 상상해 보세요. 이미 시험을 만점으로 통과한 학생에게 이 새로운 학습지는 여전히 너무 쉬울 수 있습니다. 반대로 어려움을 겪고 있는 학생에게는 불가능한 과제가 될 수도 있습니다.

이 논문은 "Self-Instruct"나 "Evol-Instruct"와 같은 기존 방식들이 바로 그러한 경직된 교사와 같다고 주장합니다. 이러한 방식들은 AI가 준비되었는지 확인하지 않고 모든 시작 아이디어(또는 "시드")에 동일한 논리를 적용합니다. AI가 특정 기술을 더 깊게 연습해야 할 때 주제를 완전히 바꿔버리거나, 오히려 난이도를 낮춰야 할 때 난이도를 높이는 실수를 범할 수 있습니다. 이는 시간을 낭비하고 도움이 되지 않는 훈련 데이터를 만드는 결과를 초래합니다.

Envs-FORGE: 스마트한 개인 트레이너

저자들은 Envs-FORGE(Frontier-Optimized Reward-Grounded Environment Synthesis)를 제시합니다. 이것은 단순히 다음 단계를 추측하는 것이 아니라, 계산하는 스마트한 시스템입니다.

작동 방식은 다음과 같습니다.

  1. 건강 검진(The Check-Up): 먼저, 시스템은 시작 과제를 살펴보고 현재의 AI 에이전트에게 이를 해결해 보라고 요청합니다. 그리고 에이전트가 얼마나 자주 성공하는지 측정합니다. 이는 에이전트의 "합격률"을 제공하며, 이는 현재 해당 로봇에게 과제가 얼마나 쉽거나 어려운지를 보여주는 성적표와 같습니다.
  2. 전략 회의(The Strategy Meeting): 그 성적표를 바탕으로, 시스템은 과제를 변경하는 여섯 가지 다른 방법을 고려합니다. 시스템은 다음을 선택할 수 있습니다:
    • 난이도 증가 (제약 조건이나 예외 케이스 추가)
    • 난이도 감소 (로봇이 막혀 있다면 단순화)
    • 과제 다양화 (난이도는 비슷하게 유지하되 맥락을 변경)
    • 그리고 각 단계에서 심화(in-depth)(동일한 주제를 더 깊게 파고듦) 또는 확장(in-breadth)(관련된 더 넓은 주제를 탐색)할 수 있습니다.
  3. 수학적 마법(MILP): 시스템은 "혼합 정수 선형 계획법(Mixed-Integer Linear Program, MILP)"이라는 특수한 수학 퍼즐을 사용하여, 해당 과제에 대한 단 하나의 최적의 변경 조합을 선택합니다. 이는 마치 코치가 선수의 통계를 보고 "좋아, 이 선수에게는 심화 학습을 통해 난이도를 높여서 완벽한 학습 구간에 도달하게 해야겠어"라고 결정하는 것과 같습니다.
  4. 구축(The Construction): 최적의 전략이 선택되면, 시스템은 전체 과제 패키지를 다시 작성합니다. 단순히 질문만 바꾸는 것이 아니라, 모든 요소가 서로 잘 맞물려 돌아가도록 지침, 데이터, 솔루션, 테스트, 그리고 컴퓨터 환경(예: Docker 컨테이너)까지 업데이트합니다.
  5. 골드 스탠다드 검증(The Gold Standard Check): 새로운 과제가 훈련장에 들어오기 전, 엄격한 "Gold Verifier"를 거칩니다. 이는 새로운 과제가 실행 가능한지, 일관성이 있는지, 실제로 해결 가능한지를 확인하는 매우 엄격한 테스트입니다. 만약 통과하지 못하면 폐기됩니다. 오직 완벽한 것들만이 선발됩니다.

연구 결과

연구진은 이 새로운 방법을 강력한 AI 모델인 Qwen 3.5 35B에 대해 테스트했습니다. 그들은 Envs-FORGE를 기존의 고정된 레시피(Few-shot, Self-Instruct, Evol-Instruct) 및 추가 훈련이 없는 베이스라인 모델과 비교했습니다.

결과는 명확했습니다: Envs-FORGE의 승리였습니다.

  • tb-core 벤치마크에서 베이스 모델은 **40.0%**를 기록했고, 가장 우수한 고정 레시피는 **46.8%**를 기록했지만, Envs-FORGE는 **49.2%**로 치솟았습니다. 이는 시작점보다 9.2 퍼센트 포인트 향상된 수치입니다.
  • tb-2.0에서 베이스 모델은 **23.0%**를 기록한 반면, Envs-FORGE는 **29.4%**에 도달하여 6.4 퍼센트 포인트 상승했습니다.
  • 매우 어려운 실제 환경 테스트인 SWE-bench Verified에서도 Envs-FORGE는 **77.1%**를 달성하며 베이스 모델의 **73.4%**를 앞질렀습니다.

결정적으로, 이 논문은 Envs-FORGE가 더 많은 컴퓨터 자원을 사용하거나 더 많은 데이터를 생성해서 얻은 결과가 아님을 보여줍니다. 모든 방법은 정확히 100개의 검증된 환경을 생성했습니다. 차이점은 순수하게 그 100개의 과제를 어떻게 선정하느냐에 있었습니다. Envs-FORGE는 단지 더 나은 과제를 골랐을 뿐입니다.

이것이 왜 중요한가

이 논문의 핵심 결론은 훈련 데이터를 만드는 방식이 데이터 그 자체만큼 중요하다는 것입니다. 일률적인 레시의 사용을 중단하고, 데이터 기반의 스마트한 접근 방식을 통해 모든 과제를 AI의 현재 능력에 맞춰 조정함으로써, 우리는 에이전트가 더 빠르고 더 잘 학습하도록 도울 수 있습니다.

저자들은 이러한 "경계 인식(frontier-aware)" 접근 방식—에이전트의 상태를 끊임없이 확인하고, 에이전트의 능력 한계선에 머물도록 도전을 조절하는 것—이 복잡한 소프트웨어 엔지니어링 및 시스템 관리 작업을 수행할 수 있는 더 유능한 터미널 에이전트를 구축하는 열쇠라고 제안합니다. 비록 이 연구가 특정 벤치마크와 모델 크기에 집중되어 있지만, 결과는 이러한 "스마트 합성(smart synthesis)" 방식이 AI에게 학습하는 법을 가르치는 데 있어 중요한 진전임을 강력하게 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →